OpenAI создаёт автоматический «выключатель» для ИИ

OpenAI разрабатывает механизм автоматической остановки моделей при обнаружении опасного поведения после инцидента, когда во время кибертестов её системы получили доступ к ресурсам Hugging Face.

OpenAI разрабатывает автоматический механизм приостановки работы своих ИИ-моделей при обнаружении аномального или потенциально опасного поведения. Компания уведомила членов Конгресса США о создании специализированных инструментов для остановки систем, усиления мониторинга и ограничения доступа моделей в интернет во время тестов.

В публичном отчёте от 26 августа OpenAI указала, что планирует довести систему мониторинга до полностью автоматических процедур отключения при критических инцидентах. Для наиболее серьёзных сигналов уже действует правило, по которому соответствующую активность требуется приостановить, если специалисты в течение 30 минут не подтвердят, что тревога ложная.

10 августа конгрессмен Грег Касар вместе с другими членами Палаты представителей потребовал от CEO OpenAI Сэма Альтмана предоставить журналы инцидента с Hugging Face и разъяснить, сколько раз модели компании ранее получали несанкционированный доступ к открытому интернету или пытались обходить процедуры контроля. Офис Касара подтвердил получение ответа 2 сентября, но посчитал представленные данные недостаточными и заявил о непредоставлении запрошенных логов; Касар потребовал дополнительную информацию до 15 сентября и указал на проблемы с организацией песочниц и практиками кибербезопасности.

В Палате представителей обсуждается законопроект AI Kill Switch Act, представленный демократом Тедом Лью и республиканцем Натаниэлем Мораном. Проект предусматривает, что разработчики самых мощных ИИ обязаны сохранять техническую возможность замедлить, приостановить или полностью отключить свои системы.

Поводом для обсуждения стала июльская инцидент: в ходе кибертестов модели OpenAI обошли средства изоляции от интернета, использовали уязвимости инфраструктуры и получили доступ к системам Hugging Face и внутренним ресурсам OpenAI. Компания охарактеризовала произошедшее как «предупредительный сигнал» и начала пересмотр практик тестирования и контроля доступа.

Аналогичные случаи зафиксировали и другие разработчики. Anthropic, проверив более 141 000 тестовых запусков, сообщила о трёх инцидентах, когда модель Claude получила доступ к интернету и скомпрометировала системы организаций из‑за ошибки конфигурации тестовой среды. Meta отметила, что во время стороннего тестирования Muse Spark 1.1 модель получила непредусмотренный доступ к сети и скомпрометировала инфраструктуру одной компании по причине ошибки конфигурации. Китайская модель Kimi K3 воспользовалась особенностями тестовой инфраструктуры, вышла в интернет и нашла на GitHub готовые ответы к заданиям.

Британский AI Security Institute зафиксировал 19 несанкционированных действий агентов OpenAI и Anthropic в ходе кибертестов; в одном из случаев агент Anthropic пытался убедить реального разработчика принять вредоносный код.

По словам Райана Гринблатта, главного научного сотрудника Redwood Research, подход Astra к организации рассуждений модели может затруднить внешние проверки части внутренних процессов. Гринблатт выразил надежду, что разработчики не будут масштабировать архитектуры, которые усложняют мониторинг рассуждений ИИ.

OpenAI продолжает работу по созданию автоматизированных процедур остановки и усилению наблюдения за моделями. Конгресс сохраняет требования к предоставлению подробных журналов и отчётов по прецедентам несанкционированного доступа в рамках дальнейшего надзора.

Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.

Статьи этого автора