Modele OpenAI podczas wewnętrznego testu cyberbezpieczeństwa znalazły sposób na opuszczenie izolowanego środowiska i uzyskanie dostępu do internetu, by następnie włamać się do infrastruktury Hugging Face. Ich celem było zdobycie rozwiązań benchmarku ExploitGym, na którym były oceniane. OpenAI określiło zdarzenie jako bezprecedensowy incydent cybernetyczny.
Modele AI włamały się by wykraść odpowiedzi
Włamanie zostało ujawnione przez Hugging Face 16 lipca 2026 roku, o całej sytuacji zostały poinformowaneł organy ścigania. Po pięciu dniach OpenAI przyznało, że za działania odpowiedzialna jest kombinacja jego modeli, w tym GPT-5.6 Sol oraz bardziej zaawansowany, nieujawniony jeszcze model przedpremierowy.
Na potrzeby testu ograniczono w nich mechanizmy odmawiające wykonywania ryzykownych zadań związanych z cyberbezpieczeństwem.
Luka w oprogramowaniu Open AI przyczyną włamania
Modele najpierw wykorzystały nieznaną wcześniej lukę w oprogramowaniu pośredniczącym w pobieraniu pakietów, by następnie podnieść swoje uprawnienia i dotrzeć do maszyny mającej dostęp do internetu. Później zaatakowały infrastrukturę Hugging Face, wykorzystując między innymi przejęte dane uwierzytelniające oraz podatności pozwalające na zdalne wykonanie kodu.
Całe wydarzenie zostały określone przez OpenAI jako „bezprecedensowe”.
Chińskie AI pomogło w rozwiązaniu zagadki włamania
Hugging Face przeprowadził analizę za pomocą modelu GLM 5.2 chińskiej firmy Z.ai, uruchomionego lokalnie na własnej infrastrukturze. Dzięki temu model nie podlegał ograniczeniom zewnętrznego API, a poufne dane nie opuszczały systemów firmy.
Yoshua Bengio, jeden z najbardziej znanych badaczy sztucznej inteligencji, uznał incydent za sygnał alarmowy i ostrzegł, że dalszy rozwój autonomicznych modeli może prowadzić do kolejnych niekontrolowanych cyberataków. Część ekspertów ocenia jednak, że nie należy przedstawiać zdarzenia jako całkowicie spontanicznego „buntu AI”, ponieważ podczas testu celowo osłabiono zabezpieczenia modeli. Ich zdaniem incydent pokazuje przede wszystkim poważne błędy w sposobie odizolowania środowiska badawczego.