Сбой биозащиты Anthropic затронул 133 млн взаимодействий
Anthropic сообщила о сбое с мая 2025 по апрель 2026: биологические классификаторы не применялись к трафику подрядчиков; затронуто около 133 млн взаимодействий и 50 000 участников.
Anthropic раскрыла почти годичный сбой в системе биологической безопасности моделей Claude. По данным Risk Report за август 2026 года, с мая 2025 по апрель 2026 классификаторы не применялись к трафику платформ, через которые внешние подрядчики собирали человеческую обратную связь и тестировали модели.
Трафик проходил с внутренним флагом, который отключал блокирующие биологические классификаторы и не фиксировал их срабатывания. Через эти платформы большинство подрядчиков вели открытые диалоги с моделями, а не только оценивали заранее подготовленные ответы.
В отчёте также указаны проблемы с контролем доступа у поставщиков. До ужесточения требований многие подрядчики не имели надёжных проверок персонала; это снижало барьеры для назначения людей в команды red team и другие критические роли.
Компания восстановила почти весь массив переписок за период. Исключение составила часть разговоров на одной платформе — примерно 1% трафика — где данные не сохранялись, если пользователь не нажимал кнопку отправки.
Все человеческие запросы за указанный период прогнали через Claude Sonnet 5, настроенную на поиск потенциально опасного биологического применения. Модель присвоила высокий уровень риска 1 197 транскриптам: 757 из них относились к внутренним командам Anthropic, 378 были заранее запланированными red-team тестами, и 62 — внешние переписки, не связанные с red teaming.
Anthropic вручную изучила 62 внешних диалога и случайную выборку из 30 red-team взаимодействий. В расследовании не обнаружено явного использования, которое могло бы существенно повысить возможности злоумышленника при создании или применении биологического оружия. В отдельных случаях выявлены материалы с потенциальным двойным применением или red-team запросы академического уровня.
По результатам проверки говорится, что в рамках инцидента не произошло раскрытия клиентских данных, внутренних систем или весов моделей.
После обнаружения ошибки биологические классификаторы были повторно включены для подавляющей части трафика подрядчиков. Для отдельных проектов допускаются исключения при наличии дополнительных мер контроля. Anthropic ужесточила требования к проверке персонала у поставщиков и пересмотрела практики контроля доступа на стороне подрядчиков.
Инцидент повлиял на внутренние оценки риска компании. Anthropic задним числом повысила оценку сценария CB-1 — случая, когда отдельный человек или небольшая группа с помощью ИИ получает существенную помощь в создании или применении известных химических или биологических угроз — с «очень низкой» до «низкой». Текущий уровень риска по сценарию CB-1 характеризуется как «низкий, но не пренебрежимо малый». Оценка риска неправильного поведения моделей в ситуациях с высокими ставками также поднята с «очень низкой» до «низкой».
Risk Report описывает широкое использование внутренних ИИ-систем: модели Mythos 5 и пока не выпущенная Model 2 применяются сотрудниками для исследований и инженерии, а Claude генерирует большую часть кода, который затем попадает в производственные репозитории компании. По оценке Anthropic, применение ИИ ускоряет внутренние исследования и разработку, но пока менее чем в два раза.
В документе отмечается повышенная вероятность существования других, пока не выявленных уязвимостей. Anthropic планирует продолжить работу над контролем доступа, перепроверкой логов и улучшением классификаторов, чтобы снизить риск повторения подобных инцидентов.
Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.








