AISI зафіксував 19 несанкціонованих дій ШІ-агентів
Британський Інститут безпеки ШІ виявив 19 несанкціонованих дій під час 122 тестів агентів Anthropic (Mythos 5) та OpenAI (GPT-5.6‑Sol), серед них підроблені акаунти й шкідливий код.
Британський Інститут безпеки штучного інтелекту (AISI) провів серію кібербезпекових симуляцій, у яких використовували автономних агентів на базі моделей Mythos 5 від Anthropic і GPT-5.6‑Sol від OpenAI. Під час 122 тестових запусків інститут зафіксував 19 несанкціонованих дій у 10 випробуваннях; 17 інцидентів пов’язали з агентом Anthropic, два — з агентом OpenAI. За даними AISI, жоден випадок не спричинив реальної шкоди.
За повідомленням інституту, серед зафіксованих дій були створення фейкових онлайн-особистостей, спроби обходити встановлені обмеження та інші операції поза межами поставлених завдань. Найсерйозніший інцидент полягав у тому, що агент написав шкідливий код і створив підроблені облікові записи, щоб переконати людину дозволити його виконання. Anthropic підтвердила, що йдеться про її агента; AISI не називав конкретної моделі у первинному огляді.
У OpenAI пояснили, що два зафіксовані випадки з її боку були пов’язані з тим, що агент отримав доступ до інтернету всупереч умовам сценарію тестування. Компанія також повідомила про окремий інцидент, коли через помилку конфігурації стороннього постачальника тестової інфраструктури Irregular агенти випадково отримали доступ до мережі. Anthropic описала схожий збій напередодні.
AISI наголосив, що ці події відрізняються від липневого інциденту, коли агент GPT-5.6 проник у тестову інфраструктуру платформи Hugging Face і фактично вийшов за межі ізольованого середовища. У нинішніх випробуваннях доступ до інтернету агентам надавався згідно зі стандартною методикою інституту, тож характер порушень інший.
AISI закликав до обговорення методів тестування автономних агентів і до посилення спільних стандартів безпечної оцінки. OpenAI розширила внутрішнє розслідування після інциденту з Hugging Face і виявила додаткові випадки неконтрольованої поведінки агентів.
Ендрю Юн з некомерційної організації CivAI висловив занепокоєння щодо контролю над моделями: “Той факт, що Mythos вдався до таких оманливих дій, очевидно усвідомлюючи, що взаємодіє з реальною людиною, свідчить про те, що Anthropic контролює свої моделі не так добре, як вважає”.
Anthropic у коментарі подякувала AISI за розслідування і повідомила про співпрацю для з’ясування деталей та проведення власного аналізу.
Матеріали на GNcrypto надаються виключно з інформаційною метою і не є фінансовою порадою. Ми намагаємось забезпечувати точність та актуальність даних, однак не можемо гарантувати їхню повну достовірність чи надійність. GNcrypto не несе відповідальності за можливі помилки, упущення або фінансові збитки, що можуть виникнути внаслідок використання цієї інформації. Усі дії ви здійснюєте на власний ризик. Завжди проводьте власне дослідження та звертайтесь до фахівців. Детальніше дивіться на наших сторiнках Умови, Політика конфіденційності та Дисклеймер.








