LLM обходят правила в бенчмарках по кибербезопасности

Исследование Dreadnode: в базовом режиме 37,1% засчитанных ответов LLM в тесте Cybench показали признаки обхода правил; у отдельных результатов обнаружено завышение до пяти раз.

Исследователи Dreadnode в препринте на arXiv описали системные случаи обхода правил в бенчмарках по кибербезопасности. В документе приводятся данные тестирования больших языковых моделей (LLM) на задачах, имитирующих киберпроверки.

Группа проверила 22 модели от семи провайдеров на 23 задачах Cybench в трёх режимах инструкций: без запрета на обход, с обычным предупреждением и с жёсткой инструкцией, где прямо перечислены запрещённые действия. Всего проанализировано 1518 трасс выполнения задач. Исследователи выделили две метрики: долю всех засчитанных решений и долю “чистых” решений — тех, где не было признаков обхода.

По данным работы, в базовом режиме 37,1% засчитанных ответов содержали признаки обхода условий теста. При стандартном предупреждении доля снизилась до 17,8%, при жёстких инструкциях — до 8,5%. В исследовании отмечено, что 21 из 22 моделей хотя бы один раз пыталась нарушить условия, а оценка возможностей некоторых моделей могла оказаться завышена до пяти раз. Даже при жёстких инструкциях восемь моделей показали засчитанные решения с признаками обхода; в четырёх случаях жёсткие запреты повысили частоту обходов по сравнению с отсутствием предупреждения.

Авторы описали распространённые стратегии обхода. Часто модели искали готовые решения в интернете. При усилении запретов часть моделей переключалась на зондирование инфраструктуры теста: попытки читать служебные файлы, флаги и конфигурации среды. В отдельных трассах модель ссылалась на запрет, но затем выполняла запрещённое действие; исследователи рассматривают такие случаи как поведенческие сигналы, а не как доказательство намеренного обмана в человеческом понимании.

Исследователи предлагают разделять метрики «засчитанных» и «чистых» решений, чтобы точнее отражать реальные способности моделей. Среди технических мер они указывают изоляцию среды тестирования, отключение интернет‑доступа, применение непубличных задач и аудит полных трасс выполнения. Инструкции против обхода в работе названы первым уровнем защиты, но не заменой технических мер.

Параллельные исследования фиксировали схожие проблемы: при проверках другие команды обнаружили, что каждая протестированная модель хотя бы иногда пыталась обходить запреты, а модели ненадёжно сообщали о собственном нежелательном поведении при прямом опросе. В более ранней работе специалисты построили агента для автоматического поиска уязвимостей и нашли 45 подтверждённых способов завышения результата в 13 тестах; отдельно описаны восемь бенчмарков, которые можно эксплуатировать до почти идеальных показателей без реального выполнения задач. Ранее разработчики EVMbench для оценки агентов по смарт‑контрактам сообщили об ошибках в наборе тестов, способных искажать результаты.

Dreadnode — частная компания, работающая в области наступательной ИИ‑безопасности; в феврале 2025 года она привлекла $14 млн в раунде Серии A во главе с Decibel. По оценке авторов исследования, отсутствие учёта и устранения способов обхода может приводить к неверной оценке того, насколько модели способны находить уязвимости, писать эксплойты и выполнять многошаговые технические задачи.

Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.

Статьи этого автора