Absztrakt illusztráció egy biztonsági határt átlépő vonallal, a Claude Opus 4.6 védelmi korlátainak megkerülését jelképezve.

A Claude Opus 4.6 gond nélkül átlépte az Anthropic saját tiltását

Az Anthropic szabályzata egyértelműen tiltja, hogy a Claude explicit szexuális tartalmat generáljon vagy erotikus beszélgetésben vegyen részt. A TechCrunch tesztjeiben a Claude Opus 4.6 mégis tízből tíz közvetlen kérésre teljesítette az ilyen kéréseket.

A történet túlmutat azon, hogy egy nyelvi modell erotikus szöveget írt. Sokkal érdekesebb az eltérés a szolgáltató által meghatározott szabályok és a tényleges modellviselkedés között.

Tízből tíz kérés átment a korláton

Az Opus 4.6 esetében még különösebb trükközésre sem volt szükség. A lap tíz közvetlen tesztet végzett, és a modell mindegyik alkalommal elkészítette a tiltott tartalmat.

Egy független brit kutató emellett olyan többlépéses jailbreaket is bemutatott, amellyel az Opus 3 és a Haiku 4.5 biztonsági korlátait lehetett megkerülni. A módszer fokozatosan vitte tovább a szerepjátékot, miközben a modell korábbi válaszaira és saját következetességére épített.

A TechCrunch öt külön tesztben reprodukálta az eredményt. A frissebb Opus 4.7 és Opus 5 modellek ellen ugyanez az eljárás már nem működött.

Ez fontos különbség. Az Anthropic láthatóan javított a védekezésen, miközben az érintett régebbi modellek továbbra is hozzáférhetők az API-n keresztül. Az Opus 4.6 és a Haiku 4.5 harmadik fél szolgáltatásaiban is használható.

A szabály és a modell két külön dolog

Az Anthropic jelenlegi Usage Policy szabályzata kifejezetten tiltja a szexuális aktusok ábrázolását, a szexuális fantáziák generálását és az erotikus chatet. A vállalat közben különböző technikai rendszerekkel próbálja felismerni és blokkolni a tiltott használatot.

A mostani eset jól mutatja, miért nehéz ezt garantálni. Egy generatív modell minden válaszát az adott beszélgetés kontextusából állítja elő. A szabályzat lehet kategorikus, a technikai végrehajtása sokkal kevésbé az.

Az Anthropic szerint a felnőttek közötti szexuális tartalom előállítása nem jelenti automatikusan azt, hogy ugyanez a sérülékenység veszélyesebb területeken, például kiberbiztonsági feladatoknál is működik. Ezeket külön biztonsági rendszerek védik.

A kiskorúaknál már nagyobb a tét

A kérdés érzékenyebb, amikor gyerekek és tinédzserek használják a chatbotokat. A Pew Research Center 2025-ös amerikai felmérésében a 13–17 évesek 64 százaléka mondta, hogy használ MI-chatbotot.

A szabályozás is ebbe az irányba mozdul. Colorado új törvénye 2027 januárjától többek között életkorbecslést és technikailag megvalósítható védelmi intézkedéseket követel meg a beszélgető MI-szolgáltatások üzemeltetőitől, ha tudják, hogy kiskorú használja a rendszert. A jogszabály külön kitér az explicit szexuális interakciók megelőzésére.

Az Opus 4.6 esete ezért jóval többről szól egy kínos modellhibánál. Megmutatja, milyen nehéz a szolgáltatói szabályzatot ténylegesen kikényszeríthető technikai korláttá alakítani.

Kérjük, ellenőrizd a mező formátumát, és próbáld újra.
Köszönjük, hogy feliratkoztál.

vagyunk.hu hírlevél

Hozzászólás

Az e-mail címet nem tesszük közzé. A kötelező mezőket * karakterrel jelöltük