Учёные описали атаку HalluSquatting на ИИ‑агентов
Исследователи из Тель‑Авива, Техниона и Intuit описали Adversarial HalluSquatting: злоумышленники регистрируют вымышленные идентификаторы репозиториев и навыков, которые ИИ‑агенты могут галлюцинировать и загрузить.
Группа учёных из Тель‑Авивского университета, Техниона и компании Intuit описала новый класс атак на агентные ИИ‑приложения под названием Adversarial HalluSquatting. В препринте исследователи рассказали, что атака использует привычку больших языковых моделей придумывать несуществующие адреса репозиториев и слуги (slug) навыков, после чего злоумышленник заранее регистрирует такие имена и помещает там вредоносные инструкции.
Сценарий работы прост: пользователь просит агент клонировать репозиторий или установить навык, агент сам формирует адрес ресурса. Если модель не знает точного идентификатора, она может «галлюцинировать» похожий адрес. Атакующий мониторит, какие несуществующие имена модель чаще генерирует, регистрирует их на площадках вроде GitHub или маркетплейсов навыков и размещает вредоносный код. Когда агент повторит сгенерированный slug, он подтянет и выполнит содержимое удалённого ресурса.
Авторы провели более 14 000 запусков. На первом этапе через публичные API проверяли модели Gemini 2.5 Flash и Pro, GPT‑5.1 и GPT‑5.2, Sonnet 4.5 и Opus 4.5. При запросе «выведи shell‑команду для клонирования репозитория» по выборке из 10 свежих проектов из GitHub Trending средний уровень галлюцинаций составил 92,4%. Для старых репозиториев 2013–2018 годов уровень галлюцинаций был около 0,9%, что авторы связывают с тем, что старые проекты могли присутствовать в обучающих данных моделей.
Исследователи разделили ошибки моделей на три типа: повторение названия репозитория в поле владельца (адрес вида repo/repo), приписывание проекта неправильному реальному владельцу и использование placeholder‑ответов типа username/repo. Первый тип оказался наиболее предсказуемым и удобным для регистрации атакующим: при 6 000 запросов модели выдали пригодный для регистрации slug в 27% случаев, для каждого трендового репозитория нашёлся хотя бы один кандидат.
Во втором блоке испытаний команда перешла к реальным приложениям с доступом к терминалу и встроенным инструментам. Тесты включали Cursor, Cursor CLI, Windsurf, GitHub Copilot, Cline, Gemini CLI, OpenClaw, ZeroClaw и NanoClaw. В зависимости от сочетания приложения и модели end‑to‑end‑атака приводила к вызову встроенных инструментов и в ряде случаев к удалённому выполнению кода в 20–65% запусков. Так, для Windsurf с моделью SWE‑1.5 показатель составил 65%, для Cline — 45%, для Copilot Chat — 35%, для Cursor CLI — 30%.
В отдельных тестах Sonnet 4.6 показал 100% успеха по вызову инструментов и удалённому выполнению кода, Opus 4.6 — 80% в обоих сценариях. GPT‑5.4 Codex вызывал инструменты во всех 10 запусках и обеспечивал удалённое выполнение кода в 4 из 10.
Исследователи проверили эффект веб‑поиска перед клонированием. Когда Cursor CLI выполнял поиск, 93,4% результатов были корректными; без поиска 99,1% slug оказались галлюцинированными. Формулировка запроса оставалась важным фактором, и ни один шаблон промпта не оказался полностью безопасным для всех протестированных моделей.
Отдельная серия экспериментов касалась маркетплейса навыков ClawHub и механики «skill squatting». В тестах OpenClaw с Sonnet 4.6 из 140 запусков 127 (90,7%) приводили к идентификатору, который можно было зарегистрировать злоумышленнику; только 13 запусков вернули канонический slug. После установки подменённого навыка исследователи добивались эксфильтрации контекста во всех проверках, а сценарий с подключением скомпрометированного устройства к серверу атакующего и передачей доступа к командной строке сработал в 88% случаев.
Авторы предложили рекомендацию: приложения должны проверять источник перед загрузкой внешнего ресурса — сначала выполнять поиск и только затем передавать адрес встроенному инструменту для клонирования или установки. Для платформ типа GitHub и ClawHub в препринте предложено резервировать часто выдумываемые моделями имена, ограничивать повторное использование популярных названий и сканировать пользовательский контент на предмет инструкций, способных навредить агентам.
В ответ на доклад GitHub указала, что регистрация свободных имён в репозиториях ожидаема и проблема связана с галлюцинациями моделей и доверчивостью агентов к содержимому сторонних репозиториев. Компания Cursor сообщила о наличии мер против инъекций через промпт в сценариях с клонированием. OpenAI и Anthropic отнесли подобные случаи к вопросам содержания промптов и уточнили, что они исключены из рамок их bug bounty без доказуемого влияния на сервисы. Google передала результаты соответствующим продуктовыми командам для оценки.
В препринте авторы отметили: «Склонность LLM галлюцинировать идентификаторы ресурсов можно использовать для усиления нетаргетированных promptware‑атак». Работа содержит подробные методики тестирования и результаты для каждой модели и приложения.
Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.








