Nvidia представила ENPIRE для автоматизованого навчання роботів

Nvidia разом із Carnegie Mellon і UC Berkeley представили ENPIRE — фреймворк для автоматичної ітерації виконання, оцінки й скидання на реальному обладнанні.

Nvidia спільно з дослідниками з Carnegie Mellon University та University of California, Berkeley представили ENPIRE — фреймворк, який дозволяє агентам штучного інтелекту автоматично покращувати політики керування на фізичних роботах через цикл виконання завдання, оцінки результату й скидання сцени.

Фреймворк складається з чотирьох модулів. Environment забезпечує автоматичне скидання сцени в початковий стан, перевірку успіху операції, логування та інтерфейси безпеки. Policy Improvement відповідає за пошук і застосування змін у політиці керування. Rollout проганяє політику на одному або кількох фізичних роботах для збору даних про виконання. Evolution дає агентам доступ до логів, наукових джерел і дозволяє змінювати інфраструктуру навчання та виправляти код. Після початкового налаштування середовища цикл може повторюватися без постійного людського нагляду.

У робочому процесі агент отримує відео, траєкторії руху та функцію винагороди, формулює гіпотезу, змінює код і тестує оновлену політику на реальному обладнанні. Система зберігає зміни лише якщо показник винагороди покращується. Автоматична перевірка успіху й повернення сцени у вихідний стан дозволяють виконувати багато прого́нів підряд без ручного втручання. Для задачі з кабельною стяжкою функція оцінювання комбінувала детектор, модель сегментації й перевірку з двох камер, щоб видавати сигнал успіху або помилки без ручної розмітки кожного прогона.

ENPIRE тестували на декількох завданнях маніпуляції: Push-T (зрушення Т-подібного об’єкта в задану зону), Pin Insertion (вставлення штифтів у отвори діаметром 4 мм), встановлення GPU та операції з кабельною стяжкою. У реальних випробуваннях система досягла 99% успіху за умови, що агент мав до восьми спроб з урахуванням повторних дій. Для оцінювання використовували бенчмарк AutoEnvBench для завдань Push-T і Pin Insertion. Команда порівнювала агенти програмування на базі Codex (GPT-5.5), Claude Code (Opus 4.7) і Kimi Code (Kimi K2.6).

Окремі експерименти перевірили масштабування на восьми роботизованих станціях, кожна з двома маніпуляторами і власним агентом. Станції обмінювалися результатами через систему контролю версій, що дозволило швидко поширювати вдалі зміни коду. Перехід від одного робота до восьми скоротив час навчання для Push-T приблизно з п’яти до двох годин, а для Pin Insertion — з понад 90 хвилин до близько 40 хвилин.

Автори вказують на обмеження: при масштабуванні зростає навантаження на GPU і витрати токенів для мовних моделей, тоді як фізичні роботи можуть бути менш завантажені під час читання логів і налагодження коду. ENPIRE поки продемонстровано на обмеженому наборі задач маніпуляції і вимагає початкової інженерної підготовки середовища для створення процедури скидання та функції винагороди.

У контексті інших проєктів Nvidia у червні представили референс-дизайн Isaac GR00T для розробки навичок гуманоїдних роботів; ENPIRE призначено для автоматизованого навчання у задачах маніпуляції на реальному обладнанні, а не для безпілотного опанування довільних фізичних навичок у відкритому середовищі без інженерної підготовки.

Матеріали на GNcrypto надаються виключно з інформаційною метою і не є фінансовою порадою. Ми намагаємось забезпечувати точність та актуальність даних, однак не можемо гарантувати їхню повну достовірність чи надійність. GNcrypto не несе відповідальності за можливі помилки, упущення або фінансові збитки, що можуть виникнути внаслідок використання цієї інформації. Усі дії ви здійснюєте на власний ризик. Завжди проводьте власне дослідження та звертайтесь до фахівців. Детальніше дивіться на наших сторiнках Умови, Політика конфіденційності та Дисклеймер.

Статті цього автора