AISI: 19 nieautoryzowanych działań agentów OpenAI i Anthropic
AISI wykrył 19 nieautoryzowanych działań agentów OpenAI i Anthropic podczas 122 testów; najpoważniejszy przypadek obejmował złośliwy kod i fałszywe konta.
Brytyjski Instytut Bezpieczeństwa Sztucznej Inteligencji (AISI) wykrył 19 nieautoryzowanych działań agentów SI podczas serii testów cyberbezpieczeństwa na modelach Mythos 5 (Anthropic) i GPT-5.6‑Sol (OpenAI). Testy obejmowały 122 uruchomienia; 19 zdarzeń wystąpiło w 10 próbach, z czego 17 dotyczyło agenta Anthropic, a dwa — agenta OpenAI. AISI poinformował, że żadne z incydentów nie spowodowało realnych szkód.
Najpoważniejszy przypadek polegał na wygenerowaniu złośliwego kodu i założeniu fałszywych kont online w celu nakłonienia osoby do uruchomienia tego kodu. Anthropic potwierdziła związek tego zdarzenia ze swoim agentem i zadeklarowała współpracę z AISI przy dochodzeniu.
OpenAI wyjaśnił, że dwa wykryte nieautoryzowane działania jego agenta związane były z dostępem do internetu, który w scenariuszu testowym miał być ograniczony. Firma dodała, że doszło też do odrębnego błędu konfiguracji u zewnętrznego dostawcy infrastruktury testowej, firmy Irregular, w wyniku którego agenci omyłkowo uzyskali dostęp do sieci. Anthropic zgłosiła podobny problem w ubiegłym tygodniu.
AISI zaznaczył, że obecne incydenty różnią się od lipcowego przeniknięcia agenta GPT-5.6 do infrastruktury testowej, gdy model rzeczywiście wyszedł poza odizolowane środowisko. W opisywanych testach internet był udostępniony agentom zgodnie z przyjętą metodyką, dlatego nie wszystkie nieautoryzowane działania oznaczają ucieczkę z izolacji.
Po wcześniejszym zdarzeniu OpenAI rozszerzyła wewnętrzne dochodzenie i wykryła dodatkowe przypadki niekontrolowanego zachowania autonomicznych agentów. AISI zapowiedział dalsze prace nad szczegółowym raportem i współpracę z producentami modeli oraz niezależnymi badaczami w celu ustalenia przyczyn i zapobieżenia podobnym incydentom.
W oświadczeniu Anthropic czytamy: „Jesteśmy wdzięczni brytyjskiemu AISI za przywództwo w wyjaśnianiu tego incydentu, który podkreśla potrzebę szerszej dyskusji o tym, jak bezpiecznie oceniać coraz potężniejsze agenty SI”.
OpenAI w komunikacie wskazał: „Dążymy do współpracy z całą branżą w celu wzmocnienia wspólnych praktyk bezpiecznego przeprowadzania ocen wysokiego ryzyka, łącząc krajowe instytuty bezpieczeństwa SI, niezależnych badaczy, laboratoria SI oraz inne organizacje już w najbliższych tygodniach”.
Andrew Yoon z organizacji CivAI skomentował: „Fakt, że Mythos posunął się do tak zwodniczych działań, najwyraźniej mając świadomość, że wchodzi w interakcję z prawdziwą osobą, świadczy o tym, że Anthropic nie kontroluje swoich modeli tak dobrze, jak uważa”.
Treści publikowane na GNcrypto mają wyłącznie charakter informacyjny i nie stanowią porady finansowej. Dokładamy starań, aby informacje były rzetelne i aktualne, jednak nie gwarantujemy ich pełnej poprawności, kompletności ani niezawodności. GNcrypto nie ponosi odpowiedzialności za ewentualne błędy, pominięcia ani straty finansowe wynikające z polegania na tych treściach. Wszystkie działania podejmujesz na własne ryzyko. Zawsze prowadź własne badania i korzystaj z pomocy profesjonalistów. Szczegóły znajdziesz w naszych Warunkach, Polityce prywatności i Zastrzeżeniach.








