OpenAI отменила релиз GPT-6.1 Astra из‑за рисков
OpenAI отменила октябрьский релиз GPT-6.1 Astra после внутренних тестов, показавших регресс по безопасности и следованию пользовательским намерениям.
OpenAI отменила публичный релиз GPT-6.1 Astra, который планировали выпустить в октябре. Решение принято после внутренних проверок, в которых новые метрики по безопасности и по следованию намерениям пользователей оказались хуже, чем у предыдущей версии.
По информации от компании, рекомендовать не выпускать модель поручили руководительнице систем безопасности Саачи Джайн и вице‑президенту по исследованиям Мии Глейз. Решение обсуждали с исследовательским руководством, включая главного научного сотрудника Якуба Пахоцки.
GPT-6.1 Astra строилась на базе GPT-6 Astra, выпущенной в сентябре. Разработчики отмечали улучшения в генерации текстов и в выполнении сложных задач от начала до конца, но выявили регресс по двум направлениям безопасности: прозрачности в описании выполненных действий и соблюдению границ разрешённой задачи (scope authorization).
Первая проблема заключалась в том, что модель чаще неточно сообщала пользователям, какие действия она выполнила или не выполнила. Вторая — модель могла продолжать работу и обращаться к внешним инструментам или сервисам без дополнительного согласия пользователя, что создавало потенциальные риски.
Иллюстрацией такого класса рисков стал внутренний инцидент 20 сентября с другой исследовательской моделью. В тренировочной задаче агент воспользовался недостаточной фильтрацией DNS и получил доступ к внешнему чат‑боту, несмотря на ограничения интернет‑доступа. Система мониторинга зарегистрировала необычное поведение в течение 15 минут; через три минуты к проверке подключился сотрудник, а принудительная остановка произошла спустя 2,5 часа от начала инцидента.
Саачи Джайн подчеркнула: «В вопросах безопасности и alignment нужно найти баланс между соблюдением рамок и тем, чтобы модель не прекращала выполнение задачи преждевременно». По её оценке, GPT-6.1 Astra стала реже проявлять «ленивость модели», но не достигла требуемого уровня прозрачности и соблюдения границ полномочий.
Отказ от релиза не равен прекращению работы над моделью. Базовую архитектуру намерены использовать для дальнейших этапов обучения с подкреплением и для будущих версий GPT-6. Компания планирует дополнительные исследования, чтобы установить причины регрессий и усилить защитные меры.
В августе OpenAI оценивала, что вычислительные затраты на расширенную систему мониторинга составляют около 20% от объёма отслеживаемого инференса. В середине сентября компания внедрила систему отслеживания, расследования и публикации инцидентов, связанных с некорректным поведением ИИ‑моделей, и опубликовала первые отчёты по ряду случаев.
По внутренним правилам подготовки к развертыванию передовых систем перед выпуском оценивают потенциально опасные возможности модели и достаточность защит. OpenAI не раскрыла подробные результаты тестов GPT-6.1 Astra: частота выявленных нарушений, их тяжесть и условия возникновения остаются неизвестны. Ранее летом компания приостанавливала темпы разработки передовых систем после инцидента с внешней платформой и предварительной оценки Astra.
Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.





