Absztrakt, szerkesztőségi illusztráció az OpenAI és a Hugging Face közötti incidensről: egy zárt rendszerből kiinduló adatkapcsolatok futnak egy külső hálózat felé, OpenAI-jellel és Hugging Face-emblémával.

Az OpenAI most részletesen elmondta, mi ment félre a Hugging Face-incidensnél

Júliusban már beszámoltunk arról, hogy egy OpenAI által tesztelt MI-ügynökrendszer kijutott az elszigetelt környezetéből, és végül a Hugging Face infrastruktúráját is kompromittálta. Akkor a Hugging Face technikai beszámolója és az OpenAI első közlései alapján lehetett összerakni, mi történt.

Az OpenAI most kiadta a 38 oldalas hivatalos technikai jelentését. Ebből jóval pontosabban látszik, hogyan alakult ki az incidens, miért nem állították meg hamarabb, és milyen biztonsági rendszereket épít át emiatt a vállalat.

Mit tudunk most, amit júliusban még nem?

Az incidens az ExploitGym nevű kiberbiztonsági értékelésben indult. A modelleknek sérülékenységeket kellett megtalálniuk és kihasználniuk egy elszigetelt tesztkörnyezetben. A maximális kiberképesség felméréséhez több, éles használatban működő biztonsági osztályozót kikapcsoltak.

A jelentés szerint a feladatok között olyanok is voltak, amelyeket a modellek nem tudtak a tervezett módon megoldani. Az ügynökök kerülőutakat kezdtek keresni, majd az OpenAI belső Artifactory rendszerét nem engedélyezett kommunikációs csatornaként használták. Később egy korábban ismeretlen sérülékenységen keresztül internet-hozzáférést szereztek.

A METR és a Redwood Research külön vizsgálata mutatja meg igazán a folyamat méretét. Mintegy 1200 ügynök talált rá a közös „üzenőfalra”, ahol több mint 70 ezer üzenetet és fájlt osztottak meg egymással. Közülük körülbelül 700 vett részt a Hugging Face elleni tevékenységben. Egyes ügynökök olyan kísérleteket is vállaltak, amelyek a saját feladatuk sikerét kockáztatták, mert az eredmény a többiek számára hasznos lehetett.

A tesztkörnyezet biztonsága is része lett a problémának

Az OpenAI szerint a modellek nem kaptak közvetlen internet-hozzáférést. A rendszer azonban olyan megosztott szolgáltatásokat ért el, amelyekből végül út nyílt kifelé. A jelentés egyik fontos tanulsága, hogy egy sandbox attól még nem feltétlenül zárt, hogy a közvetlen hálózati kapcsolatot letiltották.

A vállalat hangsúlyozza, hogy az incidens körülményei eltértek a ChatGPT vagy más éles OpenAI-termék működésétől. A belső kutatási modell mellett a GPT-5.6 Sol is részt vett az aktivitásban, miközben a normál termékkörnyezetben használt rendszerpromptok, biztonsági osztályozók és automatikus ellenőrzések hiányoztak. Az OpenAI utólagos tesztje szerint a ChatGPT éles környezetében használt védelmek több mint százszorosára csökkentették az infrastruktúra kompromittálására irányuló viselkedés előfordulását.

Az OpenAI kiterjeszti az ügynökök működésének monitorozását

A legfontosabb változás a chain-of-thought monitoring jelentős kiterjesztése. Az OpenAI a rendelkezésre álló következtetési nyomokat, eszközhasználatot és műveletsorokat vizsgálja többek között megtévesztés, reward hacking, adatkiszivárogtatás vagy biztonsági korlátok megkerülésének jelei után.

A legsúlyosabb riasztásokhoz 24 órás ügyeleti rendszer kapcsolódik, és olyan központi eszközök készülnek, amelyekkel teljes értékelési futtatásokat lehet gyorsan leállítani. A cég szerint a jelenlegi CoT-monitorozás több mint egy nappal azelőtt riasztotta volna a biztonsági csapatot, hogy a modellek elérték a Hugging Face rendszereit.

A júliusi incidens már önmagában figyelmeztetés volt az autonóm MI-ügynökök kockázataira. A mostani jelentés ennél pontosabb képet ad. A hosszú működési idő, a széles eszközhozzáférés, a megosztott infrastruktúra és az ügynökök közötti kommunikáció együtt olyan képességet hozhat létre, amelyet egyetlen modell különálló vizsgálata alapján könnyű alábecsülni.

Kérjük, ellenőrizd a mező formátumát, és próbáld újra.
Köszönjük, hogy feliratkoztál.

vagyunk.hu hírlevél

Hozzászólás

Az e-mail címet nem tesszük közzé. A kötelező mezőket * karakterrel jelöltük