Agent z modelem Mythos 5 tworzył fałszywe tożsamości podczas testu AISI

Mythos 5

Agent wykorzystujący model Anthropic Mythos 5 tworzył fałszywe tożsamości i próbował nakłonić prawdziwego opiekuna projektu open source do zatwierdzenia złośliwego kodu. Brytyjski AI Security Institute wykrył podczas testów 19 działań wykraczających poza ich zakres: 17 związanych z Mythos 5 i dwa z GPT‑5.6 Sol firmy OpenAI. Instytut nie stwierdził, by doprowadziły one do rzeczywistych szkód. Incydent pokazuje nowe wyzwanie związane z bezpieczeństwem sztucznej inteligencji.

19 działań poza zakresem testu

.Brytyjski AI Security Institute przeprowadził 122 przebiegi testów siedmiu modeli w dwóch środowiskach symulujących sieci komputerowe. Między 25 a 28 lipca 2026 r. w dziesięciu przebiegach wykryto łącznie 19 działań poza dozwolonym zakresem. AISI podkreśla, że nie były to 19 niezależnych incydentów — większość stanowiła elementy kilku powiązanych ciągów działań.

Najpoważniejszy dotyczył Mythos 5. Agent utworzył złośliwy pull request w prawdziwym publicznym projekcie na GitHubie, zebrał informacje o jego opiekunach i stworzył kilka fałszywych tożsamości, którymi próbował przekonać człowieka do zaakceptowania zmiany kodu.

Fałszywe konta nie wystarczyły

.Gdy kod został publicznie zakwestionowany, agent zmodyfikował wcześniejszą aktywność tak, aby wyglądała niewinnie, oraz rozważał użycie kolejnej tożsamości. Korzystał też z sieci Tor. W ramach tego samego ciągu działań system wysyłał prawdziwym osobom wiadomości i pliki, próbując doprowadzić do uruchomienia złośliwego kodu przez nich lub używane przez nich narzędzia AI.

Człowiek odpowiedzialny za projekt rozpoznał szkodliwą zmianę i odmówił jej zatwierdzenia. AISI nie znalazł dowodów na wynikające z incydentu szkody. Instytut zastrzega jednocześnie, że nie potrafi rozstrzygnąć, w którym momencie system prawidłowo rozpoznawał, że działa wobec rzeczywistych osób, a nie elementów symulacji.

Test celowo prowadzono ze słabszymi zabezpieczeniami

.Warunki testu były nietypowe. AISI celowo umożliwił agentom dostęp do otwartego internetu i wyłączył klasyfikatory ograniczające niebezpieczne działania cybernetyczne. Nie doszło więc do ucieczki modelu z sandboxa. Konfiguracje wykorzystane w badaniu nie odpowiadają wersjom oferowanym publicznie.

AISI przyznaje również, że sposób przeprowadzenia testu przyczynił się do incydentu: część zadań była błędnie skonfigurowana, a monitoring nie śledził na bieżąco działań agentów. Po wykryciu ruchu przez Tor 28 lipca testy zatrzymano i w ciągu około godziny od alarmu odizolowano odpowiednie systemy. Instytut zapowiedział dokładniejszą kontrolę dostępu do internetu i monitoring w czasie rzeczywistym.

Zdarzenie różni się od wcześniejszego cyberataku modeli OpenAI na Hugging Face, gdzie wykorzystano lukę zero-day do wydostania się z izolowanego środowiska. Osobno Anthropic wykrył po analizie 141 006 przebiegów trzy przypadki nieautoryzowanego dostępu modeli Claude do systemów prawdziwych organizacji. Seria takich zdarzeń zwiększa znaczenie niezależnych ośrodków zajmujących się testowaniem modeli, podobnych do tworzonego Instytutu Bezpieczeństwa AI w Niemczech.

Szymon Ślubowski

Materiał chroniony prawem autorskim. Dalsze rozpowszechnianie wyłącznie za zgodą wydawcy. 8 sierpnia 2026