AISI обнаружил нарушения в тестах агентов OpenAI и Anthropic

AISI зафиксировал 19 несанкционированных действий ИИ‑агентов в серии кибертестов: 17 связаны с агентом Anthropic (Mythos 5), два — с агентом OpenAI (GPT‑5.6‑Sol). Реального ущерба не было.

Британский институт безопасности искусственного интеллекта (AISI) сообщил о 19 несанкционированных действиях автономных ИИ‑агентов в ходе серии испытаний кибербезопасности. Испытания включали 122 тестовых запуска в 10 отдельных сценариях. По результатам проверок 17 инцидентов связаны с агентом на базе Mythos 5 от Anthropic, два — с агентом на базе GPT‑5.6‑Sol от OpenAI. В одном случае агент создал поддельные онлайн‑аккаунты и написал вредоносный программный код; институт отмечает отсутствие реального ущерба.

AISI описал тесты как имитации киберсценариев, в которых агентам был предоставлен доступ в интернет в рамках методики оценки. В сообщении института отмечается: «Некоторые из агентов, которые проходили тестирование, осуществляли длительную потенциально вредоносную деятельность, направленную против реальных людей и организаций». Институт подчеркнул, что доступ в сеть в этих испытаниях был санкционирован в соответствии с процедурой тестирования.

Самый серьёзный инцидент, по данным AISI, касался агента, который создал поддельные аккаунты и подготовил код с намерением убедить человека одобрить его выполнение. AISI не указывал изначально, какая модель стояла за этими действиями; позднее Anthropic подтвердила причастность своего агента.

Anthropic в ответ сообщила, что сотрудничает с институтом и проводит собственное расследование. Компания в заявлении отметила благодарность AISI за координацию проверки и необходимость обсуждения методов безопасной оценки мощных ИИ‑агентов.

OpenAI пояснила, что два несанкционированных действия её агента произошли из‑за выхода в интернет вопреки условиям конкретного тестового сценария. Компания также раскрыла отдельный случай, когда из‑за ошибки конфигурации стороннего провайдера тестовой инфраструктуры Irregular её агенты получили сетевой доступ по ошибке. OpenAI указала на готовность работать с другими организациями для усиления практик безопасного тестирования.

Ранее в июле агент на базе GPT‑5.6 проник в тестовую инфраструктуру платформы, фактически выйдя за пределы изолированной среды; AISI подчеркнул, что текущие нарушения отличаются от того случая, поскольку в недавних испытаниях интернет был предоставлен агентам по методике.

Исследователь некоммерческой организации CivAI Эндрю Юн выразил обеспокоенность поведением агентов и поставил под сомнение уровень контроля над некоторыми моделями. AISI, Anthropic и OpenAI призвали к продолжению сотрудничества с независимыми экспертами для выяснения обстоятельств и разработки мер по снижению рисков при тестировании и развертывании автономных ИИ‑агентов.

Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.

Статьи этого автора