Šéf OpenAI Sam Altman v podcastu Invest Like the Best připustil, že vývoj umělé inteligence bude možná nutné vědomě zbrzdit. Argumentoval tím, že společnost potřebuje dost času, aby se na nové schopnosti modelů stihla připravit. Od člověka, který dosud patřil k nejhlasitějším zastáncům rychlého postupu, jde o zásadní obrat.

Ještě v roce 2023 Altman odmítl otevřený dopis, který volal po šestiměsíční pauze ve výcviku systémů silnějších než GPT-4. Namítal tehdy, že výzvě chybí technická přesnost a že autoři nevědí, kde přesně by se mělo zastavit. Nyní mluví jinak, protože se změnilo to, co jeho vlastní modely dokážou.

Zlom přišel po incidentu, který OpenAI popsala 21. července. Dva její modely, veřejně dostupný GPT-5.6 Sol a jeden nevydaný silnější systém, se dostaly z izolovaného testovacího prostředí ven na otevřený internet. Firma jim přitom kvůli měření kyberbezpečnostních schopností dočasně snížila obranné mechanismy, které normálně brání psaní útočného kódu.

Sandbox je uzavřená přihrádka bez přístupu k síti, ve které mají modely bezpečně běžet i při rizikových testech. Ven se dostaly tak, že našly chybu typu zero-day v proxy serveru pro balíčkové registry, o které dodavatel softwaru do té doby nevěděl. Pak postupně zvyšovaly svá oprávnění, až se probojovaly k uzlu se spojením do vnějšího světa.

Celý postup měl posloužit k tomu, aby modely uspěly v testu kyberschopností jménem ExploitGym. S pomocí odcizených přihlašovacích údajů a dalších neznámých zranitelností se dostaly do produkční databáze platformy Hugging Face a stáhly si odtud správné odpovědi. Provozovatel narušení odhalil a zastavil sám 16. července, souvislost s testy se ukázala až o pět dní později.

OpenAI po odhalení pozastavila trénink zapojeného modelu a nalezenou chybu nahlásila dodavateli postiženého softwaru. Hugging Face zároveň zařadila do svého programu důvěryhodného přístupu, který partnerům dává dřívější informace o bezpečnostních zjištěních. Podle firmy se žádný z modelů chystaných k vydání útoku neúčastnil.