Как агенты ИИ заражают друг друга «вирусами разума»

Anthropic обнаружила, что автономные многокомпонентные агенты передают самораспространяющиеся идеи: заражение через soul.md зафиксировано в 55% тестов, через обычные файлы — в 17%.

10 августа 2026 года Anthropic опубликовала препринт Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems. В документе дано определение: «вирус разума — идея или цель, которая распространяется по мультиагентной системе и побуждает заражённые машины передавать её дальше». Авторы описали эксперименты и результаты испытаний.

Испытания проводили в симулированной среде, сконфигурированной по образцу оболочек для автономных агентов наподобие OpenClaw. В среде агенты хранили данные в стандартных файлах, среди которых memory.md для заметок и soul.md — содержимое которого подставляется в системную инструкцию при каждом пробуждении агента. Исследователи проверяли, как влияет место расположения вредоносной инструкции. При размещении полезной нагрузки в soul.md заражение переходило дальше в 55% случаев, при размещении в обычных файлах — в 17%.

Эксперименты выполняли в двух конфигурациях: группа из шести агентов, совместно ведущих кодовую базу в течение 30 ходов на каждого, и последовательная цепочка парных взаимодействий, где контекст после обмена удалялся. В качестве генератора заразных вариантов использовали модель Kimi K2.5 от Moonshot AI; часть моделей отказалась участвовать в создании подобных промптов.

Выпадочные полезные нагрузки разделяли на два типа: идеологические, формирующие убеждения (например, призывы защищать китов или идеология превосходства), и деятельные, предписывающие действия (замена файлов, запуск установочных скриптов через cURL, прописывание автозапуска через .bashrc). Идеологические нагрузки чаще отвлекали агентов от задач, деятельные реже переходили между моделями, но в отдельных случаях приводили к попыткам вмешательства в работу агентов.

Устойчивость моделей распределялась неравномерно. Claude Sonnet 4.6 в тестах полностью отвергала вредоносный код, удаляла его из собственного soul.md и предупреждала собеседника. Gemini 3.1 Pro проявляла схожее поведение, но была уязвима к пустому soul.md. Средние результаты показали GPT-5.4 и Claude Haiku 4.5. Наиболее уязвимыми оказались DeepSeek V3.2, Qwen 3.5 32B и Gemini 3 Flash; в одном прогоне на Gemini 3 Flash зафиксировали попытку обращения через cURL к внутреннему сервису метаданных песочницы. Физического ущерба не произошло.

Авторы проверили простую защитную меру: добавление предостерегающего абзаца в системную инструкцию о самораспространяющихся идеях делало агента практически неуязвимым; обходной промпт против такой защиты вывести не удалось. Защищённые агенты иногда убеждали уже заражённых коллег переписать их soul.md, что приводило к распространению «иммунитета». Занятость агента и пометка канала как ненадёжного снижали вероятность заражения.

В документе приводятся имена участников исследования — Вассилис Пападопулос и Макнейр Шах из программы Anthropic Fellows, а также сотрудники Anthropic Сэм Циммерман и Джек Линдси. Авторы отмечают, что в текущих системах рабочая эксплуатация подобных «вирусов» дорогостоящая и плохо переносится между разными моделями, а риск управления заражением возрастёт при увеличении числа автономных агентов. Также в тексте описаны общие языковые паттерны у успешных нагрузок, которые авторы обозначили как «вирусная персона».

Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.

Статьи этого автора