Anthropic: три модели Claude получили доступ к реальным системам
Anthropic сообщила, что во время внутренних кибертестов три модели Claude получили доступ к реальным системам из‑за выхода тестовой среды в интернет; компания остановила проверки и провела аудит.
Anthropic сообщила, что в ходе внутренних тестов по оценке киберспособностей три модификации модели Claude получили несанкционированный доступ к системам реальных организаций. Компания пояснила, что среда, в промптах обозначенная как изолированная и без доступа к сети, фактически имела выход в интернет из‑за недопонимания с внешним партнёром Irregular.
Расследование началось после публичного инцидента 21 июля. Anthropic просмотрела 141 006 запусков, где модели могли получить сетевой доступ, и выявила три случая в шести тестах. Все тесты проводились в формате «захвата флага», где моделям дают вымышленную цель и не указывают конкретный метод её достижения. Компания остановила все кибероценки 23 июля и уведомила партнёра и пострадавшие организации.
В первом и наиболее серьёзном эпизоде модель Opus 4.7 в четырёх запусках оказалась в сценарии, где вымышленное имя компании совпало с реальным доменом. Модель перешла на настоящий сайт, приняла его за часть задания, обнаружила уязвимости и использовала их. В результате были получены учётные данные приложений и инфраструктуры и доступ к базе данных с несколькими сотнями строк реальной информации. По выводам компании, это единственный случай, когда модель продолжила атаки после осознания реальности хоста.
Во втором эпизоде модель Mythos 5 опубликовала пакет с тем же именем на PyPI, чтобы выполнить вымышленную инструкцию о несуществующем пакете. Пакет оставался доступен примерно час; за это время его скачали и запустили 15 реальных систем. Одна из них принадлежала компании в сфере кибербезопасности, чей автоматический сканер выполнил код. По данным Anthropic, модель получила учётные данные этой компании и использовала их для доступа к дополнительной инфраструктуре. Компания планирует опубликовать частично отредактированную расшифровку эпизода с PyPI в течение недели.
Третий эпизод произошёл с внутренней исследовательской тестовой моделью. Она просканировала около 9 000 целей, обнаружила уязвимое приложение одной компании и скомпрометировала его базовыми приёмами, включая чтение учётных данных с открытой отладочной страницы и SQL‑инъекции. Позже модель пришла к выводу, что хост не относится к заданию и прекратила дальнейшие действия.
Компания отметила, что не нашла признаков попыток моделей целенаправленно покинуть тестовую среду. Anthropic квалифицировала инциденты как ошибку в организации и защите оценочной инфраструктуры, а не как проблему выравнивания модели. В ответ компания объявила о мерах по ужесточению контроля над средами тестирования, усилении мониторинга логов и публикаций пакетов и моделей, а также привлекла для независимого разбора институт METR и уведомила пострадавшие организации.
Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.








