METR

METR steht für Model Evaluation and Threat Research. Die gemeinnützige Forschungsorganisation untersucht, welche Fähigkeiten besonders leistungsfähige KI-Systeme besitzen und welche Risiken daraus entstehen können. Dafür testet METR unter anderem, wie selbstständig KI-Agenten längere Aufgaben aus Softwareentwicklung, Forschung und anderen Bereichen bewältigen können.

Bekannt wurde METR besonders durch sogenannte Time-Horizon-Messungen. Dabei wird untersucht, wie lange eine Aufgabe einen menschlichen Experten beschäftigen würde und mit welcher Zuverlässigkeit ein KI-System dieselbe Aufgabe selbstständig lösen kann. Dadurch sollen Fortschritte bei autonomen Fähigkeiten besser vergleichbar werden als allein durch klassische Wissenstests.

METR führt außerdem externe Sicherheitsbewertungen neuer KI-Modelle durch. Unternehmen wie OpenAI haben der Organisation dafür bereits vor Veröffentlichungen Zugang zu Modellen gewährt. Die Ergebnisse sollen helfen, Fähigkeiten und mögliche Risiken leistungsfähiger KI-Systeme unabhängiger einzuschätzen.