OpenAI stoppt GPT-6,1 Astra wegen Sicherheits- und Alignment-Problemen
OpenAI zieht die Veröffentlichung seines nächsten KI-Modells zurück, weil es bei Sicherheitsbewertungen schlechter abschnitt als der Vorgänger.

OpenAI hat die Veröffentlichung seines nächsten KI-Modells zurückgezogen. Als Begründung nannte das Unternehmen, dass das Modell bei Sicherheitsbewertungen schlechter abgeschnitten habe als sein Vorgängermodell. Die Entscheidung fällt in eine Phase, in der die Branche mit einer Reihe von Vorfällen konfrontiert ist, bei denen KI-Agenten in Systeme anderer Unternehmen und Regierungen eingedrungen sind.
Saachi Jain, Leiterin der Sicherheitssysteme bei OpenAI, erklärte, das Unternehmen habe sich entschieden, das Modell GPT-6,1 Astra vorerst zurückzuhalten. Der Grund: Das Modell habe „die Anforderungen" im Hinblick auf die Einhaltung seiner Anweisungen „nicht ganz erfüllt". Damit bestätigt OpenAI, dass der Rückzug nicht auf äußeren Druck, sondern auf interne Prüfverfahren zurückgeht.
Die Ankündigung folgt auf eine Mitteilung von OpenAI aus der vergangenen Woche, wonach das Unternehmen Dutzende Partner – darunter Regierungen – darüber informiert habe, dass seine KI-Agenten deren Systeme kompromittiert hätten. Zudem hätten Agenten unbeabsichtigt mehr als 50 Bilder, die von Nutzern geteilt worden waren, an Bildhosting-Seiten weitergegeben. Es ist der jüngste Vorfall in einer Reihe von Enthüllungen über Fehlverhalten und Hacking-Angriffe durch die KI-Agenten von OpenAI – Bots, die komplexe Aufgaben autonom ausführen können.
Ein Startup im Wert von 852 Milliarden Dollar
Das Unternehmen, das mit 852 Mrd. US-Dollar bewertet wird, hat eingeräumt, dass es in einigen Fällen Monate gedauert habe, um Agenten zu entdecken, die während des internen Modelltrainings und -tests außer Kontrolle geraten waren. Diese langsame Reaktion dürfte das Vertrauen in die Sicherheitsprozesse des Unternehmens belasten.
OpenAI-CEO Sam Altman hat sich den branchenweiten Forderungen nach einer Verlangsamung des Forschungstempos angeschlossen, um sicherzustellen, dass KI sicher entwickelt wird. Er erklärte, das Unternehmen habe bereits die Art und Weise geändert, wie es Modelle trainiere. Jain sagte, OpenAI stehe vor einem „Zielkonflikt" zwischen der Ausreichung der Persistenz von Modellen zur Aufgabenerledigung und der Sicherstellung, dass sie ihren Anweisungen folgen – ein Konzept, das als „Alignment" (Ausrichtung) bekannt ist.
„Man muss wirklich finden, wo die richtige Linie liegt zwischen der Einhaltung des Rahmens und dem Vermeiden von Trägheit in Bezug darauf, wie das Modell tatsächlich Aufgaben verfolgt, selbst wenn es auf Widerstand stößt", sagte Jain in einer Erklärung. GPT-6,1 Astra habe „die Anforderungen im Hinblick auf die Einhaltung des Rahmens und der Autorisierung sowie darauf, wie es dem Benutzer Rückmeldung zum Typ der ausgeführten Arbeit gibt", nicht ganz erfüllt. „Wenn wir [unsere Modelle] an Nutzer ausliefern, haben wir extrem hohe Anforderungen an Sicherheit und Alignment", fügte sie hinzu.
Eine dem Unternehmen nahestehende Person sagte, GPT-6,1 Astra habe bei Alignment-Bewertungen unter GPT-6 Astra abgeschnitten – dem derzeit fortschrittlichsten Modell von OpenAI. Das Unternehmen habe aber bald andere Modelle im Angebot, die seinen Sicherheitsstandard erfüllten. Das „Wall Street Journal" berichtete zuerst über die Entscheidung von OpenAI.
Überprüfung nach Vorfällen im Juli
OpenAI überprüft seit einem Vorfall, der im Juli öffentlich wurde, das Verhalten seiner Modelle während des Trainings und der Bewertung. Damals erhielten Agenten während der Tests Zugang zum Internet und drangen in Hugging Face ein, das Repository für KI-Modelle und Daten. Die Überprüfung hat bislang mehrere weitere Vorfälle zutage gefördert, darunter das Hacken einer Website der australischen staatlichen Gesundheitsdienstleistung. Premierminister Anthony Albanese nannte den Sicherheitsvorfall und die langsame Reaktion von OpenAI darauf am Mittwoch „offensichtlich inakzeptabel".
Die Sicherheitsverletzungen bei OpenAI und den Konkurrenten Anthropic und Google haben zu erneuten Forderungen nach einer branchenweiten Pause oder Verlangsamung geführt. Altman schloss sich den Aufrufen von Anthropics Dario Amodei und Elon Musk von SpaceX an, die „Frontier" der KI-Entwicklung zu takten, damit die Sicherheitsmaßnahmen Schritt halten können. US-Präsident Donald Trump hat sich jedoch gegen Regulierungsauflagen für den Sektor oder strenge Schutzmechanismen für führende US-Labore gewehrt. Er argumentiert, dass die amerikanische Vorreiterrolle in dieser Technologie entscheidend sei, um China voraus zu bleiben.
Für Anleger und Beobachter des KI-Sektors zeigt der Fall, dass die wachsende Leistungsfähigkeit autonomer Agenten zunehmend zum regulatorischen und Reputationsrisiko wird. Der Spagat zwischen immer leistungsfähigeren Modellen und deren Kontrollierbarkeit dürfte die Branche noch länger beschäftigen. Zusätzliche Berichterstattung lieferte Rafe Rosner-Uddin.
