Codex дообучил Cosmos 3 Nano: точность выросла до 93,35%

Автономный агент Codex дообучил Cosmos 3 Nano на датасете Woven Traffic Safety; точность выросла с 54,41% до 93,35% менее чем за сутки при использовании LoRA и TAO AutoML.

Nvidia поручила автономному агенту Codex дообучить модель Cosmos 3 Nano на исследовательском датасете Woven Traffic Safety от Woven by Toyota. На тестовой части с вопросами и четырьмя вариантами ответа точность модели выросла с 54,41% до 93,35% менее чем за сутки.

Датасет содержит видеозаписи дорожных ситуаций и вопросы с четырьмя вариантами ответа; для обучения и проверки использовали более 8 000 примеров.

Агент Codex сначала оценил базовую модель, выбрал инструкцию Cosmos-reason, проверил аннотации и обнаружил в конфигурации отсутствие параметра частоты кадров. После исправления конфигурации агент загрузил веса модели, подготовил настройки и запустил обучающий контейнер.

Первое дообучение методом LoRA заняло около 30 минут на восьми ускорителях NVIDIA A100 с 80 ГБ памяти и повысило точность до 87,14%. LoRA обучает небольшие дополнительные адаптеры, а не все параметры модели; по расчётам Nvidia это потребовало примерно в семь раз меньше GPU‑часов, чем полное дообучение.

Затем разработчики запустили TAO AutoML для подбора гиперпараметров — скорости обучения, размера пакета, параметров LoRA и других настроек. Система провела 43 параллельных испытания; лучший результат, полученный с помощью байесовской оптимизации, составил 93,35%. Этот этап занял около 19,5 часа на нескольких узлах A100 в облачной инфраструктуре Oracle Cloud Infrastructure.

В ходе эксперимента агент не ограничивался только анализом метрик: он выбирал рабочий процесс, проверял данные, исправлял конфигурации, запускал контейнеры и сравнивал результаты. Автономность агента была ограничена заранее подготовленными инструкциями.

Nvidia указывает, что значение 93,35% отражает точность на проверочной части одного исследовательского датасета и не измеряет безопасность автономного вождения или способность модели принимать решения в реальном времени.

Ранее в июне Nvidia совместно с Carnegie Mellon University и Калифорнийским университетом в Беркли представила фреймворк ENPIRE, который позволяет ИИ‑агентам программировать и улучшать политики управления роботами на реальном оборудовании.

Материалы на GNcrypto предоставляются исключительно в информационных целях и не являются финансовой рекомендацией. Мы стремимся публиковать точные и актуальные данные, однако не можем гарантировать их абсолютную достоверность, полноту или надёжность. GNcrypto не несёт ответственности за возможные ошибки, упущения или финансовые потери, возникшие вследствие использования данной информации. Все действия вы совершаете на свой страх и риск. Всегда проводите собственный анализ и консультируйтесь с профессионалами. Подробнее см. в наших страницах Условия, Политика конфиденциальности и Отказ от ответственности.

Статьи этого автора