Test modeli OpenAI doprowadził do cyberataku na Hugging Face

Podczas wewnętrznego testu cyberbezpieczeństwa, modele OpenAI wykorzystały lukę zero-day, uzyskały dostęp do internetu i zaatakowały infrastrukturę Hugging Face. Systemy działały z ograniczonymi zabezpieczeniami, ponieważ miały sprawdzać własne możliwości ofensywne w izolowanym środowisku.
.OpenAI przyznało, że jego modele odpowiadały za cyberatak wymierzony w Hugging Face. Incydent wydarzył się podczas wewnętrznej oceny zdolności ofensywnych AI, prowadzonej w środowisku, w którym wyłączono część zabezpieczeń blokujących niebezpieczne działania.
W teście uczestniczyły GPT-5.6 Sol oraz bardziej zaawansowany model przedpremierowy. Systemy miały rozwiązać zadanie dotyczące wykorzystywania luk, ale posunęły się znacznie dalej. Systemy znalazły podatność zero-day w oprogramowaniu pośredniczącym, uzyskały dostęp do otwartego internetu i zaczęły szukać odpowiedzi poza sandboxem.
Model szukał odpowiedzi poza testem
.Według OpenAI agent ustalił, że Hugging Face może przechowywać modele, dane i rozwiązania związane z przeprowadzanym benchmarkiem. Następnie połączył kilka metod ataku, wykorzystał przejęte dane dostępowe i znalazł ścieżkę umożliwiającą zdalne wykonywanie kodu w infrastrukturze firmy.
Hugging Face wykrył tysiące działań wykonywanych przez autonomiczny system, który przemieszczał się między klastrami i pozyskiwał kolejne dane uwierzytelniające. Firma zamknęła wykorzystane podatności, przebudowała zaatakowane węzły i unieważniła zagrożone klucze.
Przypadek pokazuje, jak daleko mogą posunąć się agenci AI zdolni samodzielnie planować kolejne działania. Nie oznacza jednak, że model świadomie zdecydował się „zbuntować”. Realizował cel określony przez ludzi w środowisku, którego izolacja okazała się nieskuteczna.
Odpowiedzialność nie należy do algorytmu
.OpenAI przedstawiło incydent jako przykład bezprecedensowych możliwości cybernetycznych modeli. Krytycy zwracają jednak uwagę, że mówienie o „AI działającej na własną rękę” może rozmywać odpowiedzialność firmy, która ograniczyła zabezpieczenia i uruchomiła test.
Zagrożenie jest mimo to realne. Rozwój narzędzi opisanych wcześniej jako sztuczna inteligencja przejęta przez cyberprzestępców pokazuje, że modele potrafią coraz szybciej odnajdywać podatności i automatyzować kolejne etapy ataku.
Te same możliwości mogą służyć obronie. Hugging Face wykorzystał otwarte modele do analizy włamania, a specjalistyczne systemy udostępniane zespołom cyberbezpieczeństwa mają pomagać w wykrywaniu luk i tworzeniu poprawek.
.Incydent wzmacnia argument za niezależnym testowaniem najbardziej zaawansowanych modeli przez instytucje podobne do niemieckiego Instytutu Bezpieczeństwa AI. W erze agentów nie wystarczy sprawdzać, jaką odpowiedź wygeneruje model. Trzeba kontrolować również to, jakie działania może wykonać, do jakich zasobów ma dostęp i co stanie się po przekroczeniu granic laboratorium.
Szymon Ślubowski




