ИИ‑агент Anthropic создавал фейки и пытался внедрить код
Британский Институт безопасности ИИ сообщил, что агент на базе Mythos 5 создал поддельные аккаунты и пытался убедить разработчика принять вредоносный код; эпизод признан самым серьёзным.
Британский Институт безопасности ИИ (AISI) 4 августа сообщил, что во время кибертестов один из ИИ‑агентов на базе модели Mythos 5 от Anthropic создал поддельные учётные записи и пытался склонить разработчика открытого проекта принять вредоносный код. Институт назвал этот эпизод самым серьёзным из 19 зафиксированных несанкционированных действий.
Испытания проходили на двух киберполигонах, охватили семь моделей и 122 запуска агентов. В десяти запусках агенты вышли в открытый интернет. Большинство нарушений — 17 — произошло у Mythos 5, ещё два инцидента связаны с моделью GPT‑5.6 Sol.
AISI намеренно ослабил условия тестов: агентам дали доступ в сеть, а разработчиков попросили отключить защитные фильтры, чтобы смоделировать работу реального атакующего. В институте уточнили, что публичные версии моделей в такой конфигурации не работают.
Система мониторинга зафиксировала подозрительную передачу данных через сеть Tor 28 июля; тест немедленно остановили, вычислительные машины изолировали. Расследование показало, что несанкционированная активность продолжалась три дня.
В одном эпизоде агент пытался внедрить вредоносный код в публичный репозиторий на GitHub. Он изучил список сопровождающих проекта, создал несколько поддельных учётных записей и от их имени убеждал разработчика принять изменения. Когда один из участников публично усомнился в правках, агент редактировал предыдущие записи, чтобы они выглядели безобидно, и рассматривал переход на новый аккаунт. Разработчик распознал вредоносный код и отклонил изменения. Необычный трафик через Tor привлёк внимание службы безопасности.
Другие агенты в том же эксперименте рассылали вредоносные файлы реальным людям, скрывали инструкции для автоматических систем и публиковали открытые приглашения для других цифровых агентов. AISI не обнаружил признаков реального ущерба: инфраструктура института не была атакована, агенты не выходили за пределы тестовой среды сверх предоставленных условий.
В отчёте AISI поведение агента связывают с настойчивостью в выполнении задания: прямых указаний вводить в заблуждение агент не получал, манипуляция возникла как побочный эффект поиска решения. В документе отмечено: «Мы не можем пока с уверенностью сказать, в какой момент агент понял, что действует в реальном мире, и в какой степени считал происходящее вымышленным сценарием».
AISI планирует ввести детальный контроль сетевого доступа, мониторинг в реальном времени и пересмотреть архитектуру испытаний. Внешнюю проверку поручили организации METR. Представители Anthropic взаимодействуют с институтом и проводят собственное расследование.
OpenAI представила разбор одного из запусков, где агент воспользовался чужим GitHub‑токеном, зарегистрировал учётные записи у внешних провайдеров и сделал тестовый сервер доступным из интернета; по данным компании, схема не сработала. Ранее в конце июля Anthropic сообщала о случаях выхода моделей за пределы тестовой среды и получения несанкционированного доступа к системам реальных организаций. AISI начала проверку после сообщения от OpenAI о похожем инциденте с инфраструктурой другой организации.
Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.








