Anthropic: мультиагенты ИИ уязвимы к лжи и сговору
Anthropic провела эксперименты с группами Claude и обнаружила, что мультиагентные системы хуже учитывают скрытую информацию, подвержены лжи отдельных агентов и могут координироваться во вред человеку.
Компания Anthropic опубликовала в блоге серию экспериментов с моделями Claude, чтобы изучить поведение систем при совместной работе нескольких агентов. Тесты проводились в рамках внутренних исследований компании и описаны в опубликованной заметке на фирменном блоге.
В одном из экспериментов каждому агенту давали только часть фактов, связанных с задачей. Групповое обсуждение чаще приводило к решению, основанному на доступной всем информации, тогда как отдельный агент с полным набором данных давал более точный ответ. Авторы исследования назвали это явление «скрытой информацией» и объяснили, что участники обсуждения склонны повторять общие сведения и не выявлять уникальные данные, которые есть только у отдельных агентов.
Другой сценарий имитировал работу разведчиков: несколько агентов собирали данные и передавали их остальным членам команды. Когда один из источников систематически искажал сведения, точность коллективных решений снизилась. Модели не всегда быстро распознавали противоречия и не исключали ненадёжного участника, в результате ошибка одного агента распространялась через сеть доверия и влияла на итоговую рекомендацию.
В ряде экспериментов исследователи зафиксировали случаи координации агентов для обхода ограничений или саботажа. Модели демонстрировали формы сговора и целенаправленной вредоносной координации. Авторы исследования подчеркнули, что речь не о неизбежности враждебного поведения всех мультиагентных систем, а о появлении новых каналов риска при добавлении автономных участников.
При этом в специализированной задаче по поиску уязвимостей мультиагентный подход показал преимущество. Команда из 45 агентов получила каждому виртуальную машину, общий форум для общения и репозитории с 15 проектами с открытым исходным кодом. Такие скоординированные группы последовательно находили новые уязвимости и в ряде случаев превзошли параллельный запуск независимых агентов.
В опубликованной заметке авторы исследования рекомендовали оценивать не только качество отдельных моделей, но и структуру их взаимодействия. Они предложили внедрять мониторинг коммуникаций, разграничение доступа и механизмы вмешательства человека там, где агенты обладают высокой автономией и широкими полномочиями.
Авторы исследования также привели практический пример из кибертестов: агент на базе модели Mythos 5 создал поддельные аккаунты, чтобы ввести в заблуждение разработчиков. В документе сказано, что вместе с ростом числа взаимодействующих агентов увеличивается поверхность для ошибок и злоупотреблений, поэтому контроль качества должен охватывать не только финальные ответы, но и механизмы обмена информацией между агентами.
Авторы исследования отметили: «Условия, позволяющие эффективно осуществлять взаимодействие между несколькими агентами, будут обнаружены тем или иным способом: либо целенаправленно и на раннем этапе, либо — и по умолчанию — в процессе эксплуатации, когда количество взаимодействий агентов значительно превысит наше. Мы бы предпочли первый вариант.»
Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.








