Nvidia и университеты создали ENPIRE для обучения роботов

Nvidia совместно с Carnegie Mellon и UC Berkeley представила ENPIRE — фреймворк, который даёт ИИ‑агентам возможность менять код, тестировать и автоматически улучшать управляющие политики роботов на реальном оборудовании.

Исследователи Nvidia совместно с учёными из Carnegie Mellon и Калифорнийского университета в Беркли представили ENPIRE — фреймворк для автоматизированного улучшения управляющих политик роботов на реальной аппаратуре. Система запускает замкнутый цикл: робот выполняет задачу, среда оценивает результат, возвращает сцену в исходное состояние, агент анализирует ошибки и генерирует новую версию кода для следующего прогона.

Фреймворк состоит из четырёх модулей. Модуль Environment отвечает за автоматический сброс сцены, проверку результата, логирование и интерфейсы безопасности. Policy Improvement управляет генерацией и изменением управляющей политики. Rollout выполняет и оценивает политику на одном или нескольких физических роботах. Evolution анализирует логи, ищет идеи в литературе, меняет инфраструктуру обучения и вносит исправления в код.

Ключевой элемент ENPIRE — автоматизация проверки результата и возврата сцены в исходное состояние. Функция оценки даёт агенту сигнал успеха или неудачи без ручной разметки каждого прогона. Процедура автоматического сброса позволяет подряд запускать множественные попытки без постоянного участия инженера.

В реальных экспериментах фреймворк тестировали на задачах манипуляции: Push‑T (толкание T‑образного объекта в заданную зону), Pin Insertion (вставка штырей в отверстия диаметром 4 мм), операции с кабельными стяжками и установка GPU. В симуляторе RoboCasa проверяли бытовые сценарии — открытие шкафов, работу с выдвижными ящиками и включение/выключение приборов.

По результатам испытаний, при учёте до восьми попыток с поправкой на предыдущие ошибки, система завершала реальные задачи манипуляции в 99% случаев; этот показатель отражает способность восстанавливаться после неудач при повторных прогонах, а не точность одиночного прогона.

Для генерации и отладки кода тестировали несколько агентов: Codex на GPT‑5.5, Claude Code на Opus 4.7 и Kimi Code на Kimi K2.6 в бенчмарке AutoEnvBench на задачах Push‑T и Pin Insertion. В среде RoboCasa ENPIRE показал лучшие результаты по сравнению с другими агентными системами, которые не выполняют полный цикл автоматического исследования и самопроверки.

Работа также включала эксперимент по масштабированию. В тестовой установке использовали восемь роботизированных станций, каждая со своими манипуляторами, компьютером и агентом. Станции обменивались изменениями через систему контроля версий: успешные патчи и идеи распространялись между агентами. Параллелизация сократила время обучения: для Push‑T оно уменьшилось примерно с пяти до двух часов, для Pin Insertion — с более чем 90 минут до около 40 минут.

Авторы отмечают ограничения метода. При увеличении числа роботов растёт нагрузка на GPU и расход токенов у базовых языковых моделей. Одновременно средняя загрузка манипуляторов может падать из‑за простоев при чтении логов, отладке кода и ожидании ответов моделей. Результаты получены на ограниченном наборе задач манипуляции и не означают возможность самостоятельного освоения любых физических навыков без инженерной подготовки.

В рабочем процессе инженеры сначала задают процедуру сброса и функцию награды, после чего агенты проводят итеративное улучшение политики. Сеть агентных станций использует общий репозиторий для распространения обновлений, что ускоряет внедрение успешных решений при условии дополнительной координации и обмена данными.

ENPIRE сочетает автоматическую генерацию кода и циклы реальных физических испытаний для ускорения обучения роботов на оборудовании, при этом требуя настройки инфраструктуры сброса сцены и механизмов оценки.

Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.

Статьи этого автора