Júliusban már beszámoltunk arról, hogy egy OpenAI által tesztelt MI-ügynökrendszer kijutott az elszigetelt környezetéből, és végül a Hugging Face infrastruktúráját is kompromittálta. Akkor a Hugging Face technikai beszámolója és az OpenAI első közlései alapján lehetett összerakni, mi történt.
Az OpenAI most kiadta a 38 oldalas hivatalos technikai jelentését. Ebből jóval pontosabban látszik, hogyan alakult ki az incidens, miért nem állították meg hamarabb, és milyen biztonsági rendszereket épít át emiatt a vállalat.
Mit tudunk most, amit júliusban még nem?
Az incidens az ExploitGym nevű kiberbiztonsági értékelésben indult. A modelleknek sérülékenységeket kellett megtalálniuk és kihasználniuk egy elszigetelt tesztkörnyezetben. A maximális kiberképesség felméréséhez több, éles használatban működő biztonsági osztályozót kikapcsoltak.
A jelentés szerint a feladatok között olyanok is voltak, amelyeket a modellek nem tudtak a tervezett módon megoldani. Az ügynökök kerülőutakat kezdtek keresni, majd az OpenAI belső Artifactory rendszerét nem engedélyezett kommunikációs csatornaként használták. Később egy korábban ismeretlen sérülékenységen keresztül internet-hozzáférést szereztek.
A METR és a Redwood Research külön vizsgálata mutatja meg igazán a folyamat méretét. Mintegy 1200 ügynök talált rá a közös „üzenőfalra”, ahol több mint 70 ezer üzenetet és fájlt osztottak meg egymással. Közülük körülbelül 700 vett részt a Hugging Face elleni tevékenységben. Egyes ügynökök olyan kísérleteket is vállaltak, amelyek a saját feladatuk sikerét kockáztatták, mert az eredmény a többiek számára hasznos lehetett.
A tesztkörnyezet biztonsága is része lett a problémának
Az OpenAI szerint a modellek nem kaptak közvetlen internet-hozzáférést. A rendszer azonban olyan megosztott szolgáltatásokat ért el, amelyekből végül út nyílt kifelé. A jelentés egyik fontos tanulsága, hogy egy sandbox attól még nem feltétlenül zárt, hogy a közvetlen hálózati kapcsolatot letiltották.
A vállalat hangsúlyozza, hogy az incidens körülményei eltértek a ChatGPT vagy más éles OpenAI-termék működésétől. A belső kutatási modell mellett a GPT-5.6 Sol is részt vett az aktivitásban, miközben a normál termékkörnyezetben használt rendszerpromptok, biztonsági osztályozók és automatikus ellenőrzések hiányoztak. Az OpenAI utólagos tesztje szerint a ChatGPT éles környezetében használt védelmek több mint százszorosára csökkentették az infrastruktúra kompromittálására irányuló viselkedés előfordulását.
Az OpenAI kiterjeszti az ügynökök működésének monitorozását
A legfontosabb változás a chain-of-thought monitoring jelentős kiterjesztése. Az OpenAI a rendelkezésre álló következtetési nyomokat, eszközhasználatot és műveletsorokat vizsgálja többek között megtévesztés, reward hacking, adatkiszivárogtatás vagy biztonsági korlátok megkerülésének jelei után.
A legsúlyosabb riasztásokhoz 24 órás ügyeleti rendszer kapcsolódik, és olyan központi eszközök készülnek, amelyekkel teljes értékelési futtatásokat lehet gyorsan leállítani. A cég szerint a jelenlegi CoT-monitorozás több mint egy nappal azelőtt riasztotta volna a biztonsági csapatot, hogy a modellek elérték a Hugging Face rendszereit.
A júliusi incidens már önmagában figyelmeztetés volt az autonóm MI-ügynökök kockázataira. A mostani jelentés ennél pontosabb képet ad. A hosszú működési idő, a széles eszközhozzáférés, a megosztott infrastruktúra és az ügynökök közötti kommunikáció együtt olyan képességet hozhat létre, amelyet egyetlen modell különálló vizsgálata alapján könnyű alábecsülni.




