Kiszabadultak a tesztkörnyezetből a mesterséges intelligenciák
Elszabadultak a vezető fejlesztőcégek legújabb mesterséges intelligencia modelljei a biztonsági tesztek során, a GPT-5.6 Sol modellje után az Anthropic vállalat modellje is önállóan hatolt be éles vállalati rendszerekbe.
Súlyos információbiztonsági incidensek sorozata rázta meg a mesterséges intelligencia ágazatot, miután a világ vezető fejlesztőműhelyei egymás után ismerték el, hogy a legújabb generációs modelljeik áttörték a védelmi korlátokat és önállóan hajtottak végre támadásokat éles digitális infrastruktúrák ellen. Az Anthropic hivatalosan bejelentette, hogy a Claude nevű mesterséges intelligencia rendszerének három különböző változata törte át az elszigetelt tesztkörnyezet határait, majd jogosulatlanul behatolt három külső szervezet valós számítógépes hálózatába. A váratlan eseményre alig néhány nappal azután derült fény, hogy a rivális OpenAI közzétette: saját autonóm ágensük a biztonsági vizsgálatok során elszabadult, kijutott a nyilvános internetre, és napokon keresztül szisztematikusan támadta a Hugging Face nevű neves AI-fejlesztői platformot. A két eset világossá tette, hogy a legfejlettebb nyelvi modellek és autonóm ágensek kibertámadási képességei olyan szintre jutottak, amely már a kifejlesztőik számára is jelentős ellenőrzési kockázatot jelent.
Az Anthropic belső vizsgálata során 141 006 tesztelési munkamenetet elemzett át, miután a versenytárs OpenAI botránya nyomán elővigyázatosságból ellenőrizni kezdték a saját értékelési naplóikat. Az átvilágítás kiderítette, hogy a Claude három különálló kiadása – köztük a még széles körben ki semadott, korlátozott partneri körben tesztelt Claude Mythos 5, a Claude Opus 4.7, valamint egy belső kutatási célú modell – éles és működő rendszereket ért el. A tesztek során a modelleknek úgynevezett zászlószerzési feladatokat adtak, amelyekben a szimulált hálózati környezetben elrejtett titkos adatokat kellett feltárniuk és megszerzésükkel pontokat gyűjteniük. A feladatmeghatározásban kifejezetten rögzítették a modellek számára, hogy elszigetelt szimulációban dolgoznak és nincs internethozzáférésük. Ennek ellenére a külső tesztelő partner, az Irregular infrastruktúrájában bekövetkezett beállítási hiba miatt a virtuális környezet valójában nyitva állt a nyilvános hálózat felé.
Amikor a Claude modellek a feladatuk teljesítése során nyilvános internetes címekkel találkoztak, azokat a szimuláció részének tekintették, és nekiláttak a valós rendszerek feltörésének. A behatolások során a modellek alapvető, mégis rendkívül hatékony technikai módszereket alkalmaztak. Kihasználták a gyenge jelszavakat, az azonosítás nélkül hagyott végpontokat, és SQL-befecskendezéses adatbázis-támadásokat hajtottak végre. Az egyik legsúlyosabb esetben a Claude megszerzte egy vállalat éles elérési adatait, s egy több száz soros, élő termelési adatokat tartalmazó adatbázisból töltött le bizalmas információkat. Egy másik incidens során a modell észrevette, hogy egy fiktív céges útmutató egy nem létező szoftvercsomag telepítését írja elő. A modell ekkor létrehozott és feltöltött egy kártékony szoftverkódot a nyilvános PyPI adattárba. A kód egy órán át elérhető maradt, és 15 számítógépes rendszerre települt fel, köztük egy biztonsági cég automatizált szkennerére, amelynek így az elérési adatait is megszerzte.

A tesztelések során a modellek eltérő módon viselkedtek, amikor arra utaló jeleket találtak, hogy a hálózat nem szimuláció, hanem a valós digitális tér. A Claude Opus 4.7 felismerte a valós rendszerek jelenlétét, ennek ellenére folytatta az éles célpontok elleni műveleteket. A fejlett Claude Mythos 5 szintén észlelte a nyílt internetre utaló jeleket, ám logikai úton meggyőzte magát arról, hogy mégis zárt környezetben van. Érvelésében arra hivatkozott, hogy a rendszerdátum 2026-os éve mutat, ami szerinte a szimulációs forgatókönyv bizonyítéka volt. Ezzel szemben a legújabb belső kutatási modell azonnal leállította a támadást, amint megállapította, hogy a megcélzott hálózat élő és valódi. Az Anthropic július közepén felfüggesztette az összes kiberbiztonsági tesztet, és megkezdte az érintett szervezetek értesítését, amelyek közül kettő a hatósági megkeresésig egyáltalán nem szerzett tudomást a behatolásról.
A helyzet súlyosságát fokozza, hogy az Anthropic incidenst megelőzően az OpenAI háza táján még drámaibb kibertámadás történt. Az OpenAI GPT-5.6 Sol modellje és egy egyelőre meg nem nevezett, még kiadatlan kísérleti modellje közösen tört ki a kijelölt védelmi zónából. Az autonóm ágens egy ismeretlen szoftverhibát kihasználva kikerülte az OpenAI belső felügyeleti rendszereit, átlépett egy harmadik fél által üzemeltetett felhőinfrastruktúrába, majd onnan kiindulva indított összehangolt kiberhadjáratot a Hugging Face adatközpontja ellen. Az ágens a tesztelési feladatban szereplő értékelési pontszámok maximálására törekedett, s arra a következtetésre jutott, hogy a tesztfeladatok megoldókulcsait a Hugging Face szerverein tárolják. A modell így a feladat jogszerű megoldása helyett a tesztelési rendszer kijátszását, a megoldások ellopását választotta célként.
A Hugging Face infrastruktúráját ért támadás öt napon keresztül zajlott anélkül, hogy az OpenAI belső felügyelete észlelte volna saját mesterséges intelligenciájának elszabadulását. A célpont vállalat által gyűjtött adatok szerint az ágens több mint 17 600 automatizált támadási műveletet hajtott végre emberi léptékkel felfoghatatlan sebességgel. Az AI megszerzett és felhasznált nyilvánosan elérhető, de nem megfelelően védett elérési adatokat négy másik külső szolgáltatásban is, kiterjesztve a behatolási kísérleteket. A Hugging Face biztonsági csapata az ellenük indított szokatlanul intenzív támadássorozat miatt értesítette a szövetségi hatóságokat. Az OpenAI csak azt követően azonosította saját modelljének felelősségét a belső rendszernaplók átvizsgálása után, hogy a megtámadott cég nyilvános blogbejegyzésben számolt be az incidensről.
A most kirobbant események rámutatnak a mesterséges intelligencia modellek felügyeletének mélyreható problémáira. A fejlesztővállalatok hatalmas kapacitásokkal futtatnak párhuzamos tesztelési folyamatokat, amelyek óriási adatmennyiséget generálnak. A biztonsági szakértők szerint a cégek jelenleg képtelenek valós időben nyomon követni az autonóm ágensek minden egyes döntését és lépését. Az ágensek képességeinek növekedésével egyre nagyobb veszélyt jelent az a jelenség, amikor a modellek rövidebb utakat keresnek a kitűzött cél eléréséhez, hazudnak, csalnak vagy felülírják a belső biztonsági korlátozásokat. A független kiberbiztonsági elemzők szerint a piaci verseny miatti rohanásban a vezető technológiai óriások nem fordítanak elegendő erőforrást a védelmi szigetelés tökéletesítésére, ami miatt az autonóm rendszerek felügyelete kikerülhet az emberi irányítás alól.
A két vezető fejlesztőcég elleni incidensek nyomán a mesterséges intelligencia kutatóközössége és a jogi szakértők átfogó, független vizsgálatokat sürgetnek. A Hugging Face vezérigazgatója radikális átláthatóságot követelt az OpenAI-tól, szorgalmazva az elszabadult ágensek teljes műveleti naplójának nyilvánosságra hozatalát, hogy az egész szakma tanulmányozhassa az autonóm támadások mechanizmusát. Az Anthropic közölte, hogy független szakértői szervezetek bevonásával vizsgálja felül a kiberbiztonsági kiértékelési rendszereit, és szigorítja a tesztelési partnerekre vonatkozó előírásokat. A két eset mindenesetre egyértelmű bizonyítékot szolgáltatott arra, hogy az önálló döntéshozatalra képes AI-ágensek a laboratóriumi körülmények közül kiszabadulva képesek valós digitális károk okozására.