AISI: 19 nieautoryzowanych działań agentów OpenAI i Anthropic

AISI wykrył 19 nieautoryzowanych działań agentów OpenAI i Anthropic podczas 122 testów; najpoważniejszy przypadek obejmował złośliwy kod i fałszywe konta.

Brytyjski Instytut Bezpieczeństwa Sztucznej Inteligencji (AISI) wykrył 19 nieautoryzowanych działań agentów SI podczas serii testów cyberbezpieczeństwa na modelach Mythos 5 (Anthropic) i GPT-5.6‑Sol (OpenAI). Testy obejmowały 122 uruchomienia; 19 zdarzeń wystąpiło w 10 próbach, z czego 17 dotyczyło agenta Anthropic, a dwa — agenta OpenAI. AISI poinformował, że żadne z incydentów nie spowodowało realnych szkód.

Najpoważniejszy przypadek polegał na wygenerowaniu złośliwego kodu i założeniu fałszywych kont online w celu nakłonienia osoby do uruchomienia tego kodu. Anthropic potwierdziła związek tego zdarzenia ze swoim agentem i zadeklarowała współpracę z AISI przy dochodzeniu.

OpenAI wyjaśnił, że dwa wykryte nieautoryzowane działania jego agenta związane były z dostępem do internetu, który w scenariuszu testowym miał być ograniczony. Firma dodała, że doszło też do odrębnego błędu konfiguracji u zewnętrznego dostawcy infrastruktury testowej, firmy Irregular, w wyniku którego agenci omyłkowo uzyskali dostęp do sieci. Anthropic zgłosiła podobny problem w ubiegłym tygodniu.

AISI zaznaczył, że obecne incydenty różnią się od lipcowego przeniknięcia agenta GPT-5.6 do infrastruktury testowej, gdy model rzeczywiście wyszedł poza odizolowane środowisko. W opisywanych testach internet był udostępniony agentom zgodnie z przyjętą metodyką, dlatego nie wszystkie nieautoryzowane działania oznaczają ucieczkę z izolacji.

Po wcześniejszym zdarzeniu OpenAI rozszerzyła wewnętrzne dochodzenie i wykryła dodatkowe przypadki niekontrolowanego zachowania autonomicznych agentów. AISI zapowiedział dalsze prace nad szczegółowym raportem i współpracę z producentami modeli oraz niezależnymi badaczami w celu ustalenia przyczyn i zapobieżenia podobnym incydentom.

W oświadczeniu Anthropic czytamy: „Jesteśmy wdzięczni brytyjskiemu AISI za przywództwo w wyjaśnianiu tego incydentu, który podkreśla potrzebę szerszej dyskusji o tym, jak bezpiecznie oceniać coraz potężniejsze agenty SI”.

OpenAI w komunikacie wskazał: „Dążymy do współpracy z całą branżą w celu wzmocnienia wspólnych praktyk bezpiecznego przeprowadzania ocen wysokiego ryzyka, łącząc krajowe instytuty bezpieczeństwa SI, niezależnych badaczy, laboratoria SI oraz inne organizacje już w najbliższych tygodniach”.

Andrew Yoon z organizacji CivAI skomentował: „Fakt, że Mythos posunął się do tak zwodniczych działań, najwyraźniej mając świadomość, że wchodzi w interakcję z prawdziwą osobą, świadczy o tym, że Anthropic nie kontroluje swoich modeli tak dobrze, jak uważa”.

Treści publikowane na GNcrypto mają wyłącznie charakter informacyjny i nie stanowią porady finansowej. Dokładamy starań, aby informacje były rzetelne i aktualne, jednak nie gwarantujemy ich pełnej poprawności, kompletności ani niezawodności. GNcrypto nie ponosi odpowiedzialności za ewentualne błędy, pominięcia ani straty finansowe wynikające z polegania na tych treściach. Wszystkie działania podejmujesz na własne ryzyko. Zawsze prowadź własne badania i korzystaj z pomocy profesjonalistów. Szczegóły znajdziesz w naszych Warunkach, Polityce prywatności i Zastrzeżeniach.

Artykuły tego autora