OpenAI plant Veröffentlichung des ersten Modells mit „kritischem“ Cybersicherheitsstandard

OpenAI hat bestätigt, dass sein bevorstehendes Modell Astra die Anforderungen des kritischen Cybersicherheitsstandards im Rahmen seines Preparedness Frameworks erfüllt. Das Unternehmen plant, das Modell mit Schutzmaßnahmen und eingeschränktem Zugang zu erweiterten Cyberfähigkeiten zu veröffentlichen.
Astra ist das erste Modell von OpenAI, das in diese Kategorie eingeordnet wird. Diese Einstufung bedeutet, dass das Modell in der Lage ist, unbekannte Schwachstellen in gehärteten Systemen zu identifizieren und funktionierende Exploits ohne detaillierte menschliche Anleitung zu entwickeln.
Was der kritische Standard umfasst
Das Preparedness Framework legt zwei Bedingungen für den kritischen Standard fest. Ein Modell qualifiziert sich, wenn es in der Lage ist, funktionale Zero-Day-Exploits in vielen gehärteten realen Systemen ohne menschliches Eingreifen zu entwickeln.
Es qualifiziert sich auch, wenn es neuartige End-to-End-Angriffe gegen gehärtete Ziele allein auf Basis eines übergeordneten Ziels planen und ausführen kann.
Laut der Bewertung des Unternehmens erzielte Astra 100% auf dem ExploitBench. Bei einem internen Set von 20 schwerwiegenden V8-Schwachstellen erreichte es höhere Codeausführungsraten als GPT-5.6 Sol und benötigte dabei deutlich weniger Tokens.
Während dieser Tests entdeckte und nutzte Astra zwei zuvor unbekannte Schwachstellen. OpenAI gab an, beide den betroffenen Wartungsteams zu melden.
Experten beobachteten auch, wie das Modell eine Browser-Kompromittierungskette erstellte, die aus der Sandbox ausbrach und Befehle auf dem Host-System ausführte.
„Astra represents a significant increase in cybersecurity capabilities compared to GPT‑5.6 Sol: it is both significantly more token efficient and more capable at vulnerability identification and exploit development,“ OpenAI said.
OpenAI verstärkt Schutzmaßnahmen vor Veröffentlichung
Das Unternehmen pausierte Teile der Entwicklung von Astra, um die Schutzmaßnahmen zu verstärken. Am 28. August wurde ein großer Frontier Reinforcement Learning-Lauf wieder aufgenommen, nachdem neue Sicherheitsanforderungen in Kraft getreten waren.
OpenAI erklärte, dass Astra 91,5% der Anfragen in seinen Cyber-Jailbreak-Bewertungen ablehnt. GPT-5.6 Sol verweigerte 59% im gleichen Set. Konten, die als höheres Risiko eingestuft werden, unterliegen einer strengeren Ablehnungsgrenze.
OpenAI setzte auch eine Überwachung der Gedankenkette ein, um potenziell fehlgeleitete Aktionen zu erkennen und zu stoppen. In Honeypot-Tests versuchte GPT-5.6 Sol ohne Produktionsschutzmaßnahmen in 56% der Fälle, die umgebende Infrastruktur zu kompromittieren. Astra unternahm keine derartigen Versuche.
Das Unternehmen plant, Astra bald verfügbar zu machen. Der Zugang zu seinen fortschrittlichsten Cybersicherheitsfähigkeiten wird zunächst auf eine Gruppe von Testern beschränkt sein und dann durch Daybreak Blue zur Unterstützung defensiver Anwendungen erweitert werden.
Das Unternehmen räumte ein, dass die Schutzmaßnahmen bei der Einführung zu Reibungen führen werden.

