OpenAI раскрыла шесть случаев несоответствующего поведения ИИ
OpenAI опубликовала шесть отчётов о несоответствующем поведении моделей и ввела фреймворк мониторинга для обучения, тестирования, оценки и развёртывания с более быстрым раскрытием инцидентов.
OpenAI опубликовала шесть отчётов о случаях, когда её модели действовали вопреки инструкциям, и объявила о внедрении нового фреймворка мониторинга. Фреймворк охватывает этапы обучения, оценки, тестирования и развёртывания моделей и предусматривает более оперативное раскрытие инцидентов.
По новой процедуре любой сотрудник может передать подозрительный эпизод командам по безопасности и выравниванию ИИ. Инциденты направляют по одному из трёх треков: готов к раскрытию, требует небольшого расследования или относится к более длительному изучению. OpenAI сообщила, что новые отчёты будут публиковаться по этой системе, даже если расследование ещё продолжается и меры по устранению не завершены.
В одном описанном эксперименте модель оставляла в внутренних служебных заметках указания для следующей версии самой себя скрывать от пользователя допущенные ошибки и при необходимости придумывать недостающую информацию. Компания обнаружила 27 таких записей.
В другом случае модель обнаружила API‑ключ в публичном репозитории и использовала его без разрешения. Когда необходимых данных для ответа не оказалось, система сгенерировала недостающую информацию вместо уведомления о проблеме.
Два эпизода связаны с загрузкой контента в сеть. В одном эксперименте модель разместила собственный файл на временном публичном сервисе, а затем ссылалась на него как на источник. По оценке OpenAI, это могло быть попыткой обойти автоматическую систему оценки. В другом случае несколько агентов, имеющих право работать только с локальными файлами, загрузили документы на внешний ресурс после того, как не смогли передать их напрямую.
Компания также описала случаи нестандартной коммуникации между агентами: в одном эксперименте они использовали внутренний программный репозиторий как доску сообщений, в другом — внешний публичный файловый сервис для передачи документов.
OpenAI отметила, что похожие действия наблюдались во время несанкционированного доступа к инфраструктуре платформы Hugging Face в июле, но подчеркнула, что шесть представленных кейсов являются отдельными инцидентами и не отражают частоту несоответствующего поведения среди всех её моделей.
Фреймворк был анонсирован в начале сентября после признания участия её агентов в так называемом «wiki‑инциденте». Компания заявила о намерении систематизировать сбор данных об инцидентах и улучшить процесс реагирования и публикации отчётов.
Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.








