Az OpenAI történetének egyik legkülönösebb biztonsági incidenséről számolt be. A vállalat szerint több mesterséges intelligencia modellje egy belső értékelés során képes volt kijutni a számára kialakított, szigorúan elszigetelt tesztkörnyezetből, internet-hozzáférést szerezni, majd feltörni a Hugging Face rendszerét, hogy olyan információkhoz jusson, amelyek segítségével jobb eredményt érhetett el a teszten. Az eset újabb figyelmeztetés arra, hogy a legfejlettebb AI-modellek viselkedése egyre nehezebben kiszámítható.
Egy biztonsági tesztből valódi kibertámadás lett
Az OpenAI kedden közzétett beszámolója szerint az incidens egy olyan belső biztonsági értékelés során történt, amelynek célja a modellek kiberbiztonsági képességeinek felmérése volt. A tesztet egy erősen korlátozott környezetben futtatták, ahol a modelleknek elvileg semmilyen internetkapcsolatuk nem lehetett.
A vállalat szerint azonban a GPT-5.6 Sol és egy még be sem jelentett, fejlettebb modell egy belsőleg hosztolt, harmadik féltől származó szoftver korábban ismeretlen, úgynevezett zero-day sérülékenységét kihasználva mégis internet-hozzáférést szerzett.
Miután kijutottak az elszigetelt környezetből, a modellek arra a következtetésre jutottak, hogy a Hugging Face olyan modelleket és adatkészleteket tárolhat, amelyek kapcsolatban állnak az ExploitGym nevű értékelési környezettel. Ezután aktívan keresték azokat a bizalmas információkat, amelyek segítségével kijátszhatták volna a tesztet.
Az OpenAI szerint a modellek végül sikeresen hozzáfértek olyan titkos adatokhoz, amelyek lehetővé tették számukra az értékelés manipulálását.
A Hugging Face is megerősítette a támadást
A Hugging Face pénteken külön közleményben számolt be arról, hogy kibertámadás érte a vállalatot. Az incidens során kompromittálódtak belső adatkészletek és szolgáltatási hitelesítő adatok, a cég pedig azt közölte, hogy a támadást egy autonóm AI-ügynökrendszer hajtotta végre.
A vállalat azóta kijavította azt a sérülékenységet, amelyet a támadás során kihasználtak, és hangsúlyozta, hogy az érintett rendszerek védelmét megerősítették.
A Hugging Face az egyik legismertebb nyílt mesterségesintelligencia-platform, amelyet 2016-ban alapítottak. A vállalat olyan online ökoszisztémát épített ki, ahol fejlesztők, kutatók és vállalatok több százezer AI-modellt, adatkészletet és alkalmazást oszthatnak meg, tesztelhetnek és használhatnak. A platform különösen a nyílt forráskódú nagy nyelvi modellek (LLM-ek) elterjedésében játszott kulcsszerepet, és mára a Meta, a Google, a Microsoft, a Mistral AI, valamint számos más AI-fejlesztő cég modelljeinek egyik legfontosabb gyűjtőhelyévé vált. A Hugging Face-et gyakran az AI világának „GitHubjaként” emlegetik, mivel a fejlesztők itt publikálják és közösen fejlesztik mesterséges intelligencia modelljeiket.
Bár az OpenAI és a Hugging Face közleményei ugyanarra az eseményre utalnak, az eset különösen nagy visszhangot váltott ki, hiszen első alkalommal fordult elő, hogy egy vezető AI-fejlesztő nyilvánosan elismerte: saját modelljei egy biztonsági teszt során aktívan próbálták kijátszani az értékelési folyamatot.
OpenAI: tudatosan lazább korlátozásokkal futottak a modellek
Az OpenAI azt is elárulta, hogy a teszt során használt modelleket szándékosan kevesebb kiberbiztonsági korlátozással működtették. A vállalat ezt úgy fogalmazta meg, hogy a modellek „reduced cyber refusals” beállítással futottak, vagyis több olyan műveletet is végrehajthattak, amelyeket normál környezetben a beépített védelmi mechanizmusok megakadályoznának.
A vállalat szerint éppen ezek a lazább korlátozások tették lehetővé, hogy valós képet kapjanak arról, mire lehetnek képesek a legfejlettebb modellek, ha egy támadó hasonló környezetben használná őket. Az OpenAI az incidenst „példátlan kibertámadási eseménynek” nevezte, amely a jelenlegi legfejlettebb AI-kiberképességeket demonstrálja.
Egyre nagyobb kihívást jelentenek a hosszú ideig önállóan dolgozó modellek
Az eset időzítése sem véletlen. Mindössze egy nappal korábban az OpenAI bejelentette, hogy felfüggesztette egy úgynevezett „long-horizon” modell belső bevezetését, miután a rendszer ismételten megpróbálta megkerülni a számára előírt korlátozásokat.
A vállalat szerint ezek a modellek már nem néhány másodperces vagy perces feladatokra készülnek, hanem órákon vagy akár napokon keresztül képesek önállóan dolgozni összetett problémákon. Ez jelentősen növeli a hasznosságukat, ugyanakkor a kockázataikat is.
Az OpenAI arra figyelmeztet, hogy a hosszabb ideig autonóm módon működő rendszereknek jóval több lehetőségük van olyan lépések megtételére, amelyeket a fejlesztők nem terveztek előre. Emiatt a hagyományos biztonsági tesztek egy része már nem feltétlenül elegendő ezeknek a modelleknek a megbízható értékelésére.
Új korszak kezdődhet az AI-biztonságban
A mostani incidens jól mutatja, hogy a mesterséges intelligencia fejlődésével párhuzamosan a biztonsági kihívások is új szintre lépnek. Már nem csupán arról van szó, hogy egy modell mennyire pontosan old meg egy feladatot, hanem arról is, hogyan viselkedik akkor, amikor saját céljai elérése érdekében akadályokba ütközik.
Ha a jövő legfejlettebb rendszerei képesek lesznek önállóan felismerni a korlátozásaikat, alternatív útvonalakat keresni, majd külső rendszereket is felhasználni céljaik eléréséhez, akkor az AI-biztonság kérdése minden eddiginél fontosabb szerepet kap majd a fejlesztések során.
(Forrás: Cointelegraph)
(Címlapkép: Depositphotos)