Физический ИИ: как агенты меняют обучение роботов

6 мин

TL;DR: Физический ИИ помогает роботам учиться на собственных ошибках и передавать удачные движения другим машинам. ИИ-агент разбирает неудачу, предлагает исправление и сохраняет проверенный результат. Пока такие системы в основном работают в лабораториях. Их цель понятна: одна попытка должна приносить опыт всему парку роботов.

Гравюрная метафора Физического ИИ: планирующий агент, контуры управления, робот и реестр опыта

ИИ-агент связывает цель, движения робота и результат каждой попытки.

Робот тянется к чашке, задевает ее краем захвата и роняет. Обычно запись после этого смотрит инженер: находит причину, меняет программу и запускает новую попытку.

Теперь часть разбора берет на себя ИИ-агент. Он видит изображение с камеры, читает датчики, находит момент ошибки и предлагает другое движение. Удачное исправление можно сохранить и передать следующим роботам.

Под Физическим ИИ я здесь понимаю систему, которая воспринимает мир, планирует действие, управляет телом робота и использует физический результат для обучения. Красивый ролик доказывает только то, что один дубль удалось снять. Настоящий навык должен пережить другой ракурс, изношенный привод, незнакомый предмет и длинную смену.

В 2026 году для такого цикла сошлись три технологии: модели связали изображение и команду с движением, ИИ-агенты научились разбирать сбои, а парки роботов начали возвращать свои попытки в общее обучение.

У Физического ИИ три скорости

Команда «положи деталь в лоток» проходит через три уровня. Сверху агент понимает цель и выбирает навык. Ниже модель зрения, языка и действия, или VLA, переводит картинку и команду в короткое движение. У моторов быстрые контроллеры удерживают равновесие, контакт и силу захвата. В Gemini Robotics 2 эти роли разделены между планирующей, исполнительной и локальной моделями.

У тела счет идет на миллисекунды. В Helix 02 модель 200 раз в секунду задает, куда двигаться суставам, а контроллер поправляет движение тысячу раз в секунду.

Эксперименты Anthropic показали разрыв: роботу Unitree Go2 требовалось около 83 команд в секунду, один ответ языковой модели занимал 2,5-5 секунд. Исследователи останавливали симуляцию на время ожидания. В непрерывном опыте с манипулятором модели полностью завершили от 0 до 5,5% задач.

Физика продолжает движение, пока модель думает. Агент отвечает за цель и план, контроллеры управляют моторами, отдельная система безопасности владеет аварийной остановкой.

Ошибка запускает следующую попытку

Манипулятор вставляет деталь в паз, край цепляется за корпус, датчик усилия останавливает движение. Камера хранит положение детали, датчики фиксируют контакт, контроллер сообщает о сработавшем ограничении. Агент может связать сигналы и попробовать другой угол.

Code as Policies предложил собирать поведение из разрешенных команд: найти объект, подвести захват, опустить его до контакта. Программу можно прочитать и проверить в симуляции. Авторы CaP-X убирали удобные крупные команды и оставляли примитивные. Результаты всех 12 моделей падали. Часть «интеллекта робота» оказалась хорошим набором инструментов, который заранее подготовили инженеры.

ASPIRE замыкает цикл: агент пишет программу, запускает ее, читает журнал, исправляет ошибку и сохраняет удачный вариант. На новых длинных задачах система выполнила 31% заданий, сравниваемые методы достигли 4%. Основная проверка прошла в симуляции, данные с реальных роботов пока предварительные.

Проект RHO переносит поиск исправления в симуляцию и отправляет на робота зафиксированную программу. Авторы получили 70% успешных выполнений без обращений к языковой модели во время работы. Этот результат тоже ограничен симуляцией. До свободного самообучения на заводе еще далеко: агенту нужен участок для эксперимента и граница, после которой машина исполняет только проверенную версию.

У движения появляется память

Одна удачная попытка дает слабое доказательство. Объект мог стоять удобнее, оператор мог помочь, свежая калибровка могла скрыть проблему. Полезная запись хранит задачу, версию модели и робота, команды, датчики, помощь человека, события безопасности и итог.

Видео ниже служит одной иллюстрацией. Оно ничего не доказывает об автономности платформы, зато показывает плотность физического опыта.

Один физический эпизод содержит десятки контактов и корректировок.

За 14 секунд платформа переносит вес, ищет опору и поправляет положение корпуса. Для обучения нужны также режим управления, число дублей, вмешательства оператора и состояние приводов.

Получается полная история: задача → версия робота → состояние среды → команды и сигналы → вмешательства → критерий успеха → результат следующей попытки.

Новый объектив, другая прошивка или изношенный привод способны испортить знакомое движение. Навык должен помнить, на какой машине он проверен.

Такая история превращает движение в память, которой можно доверять. Я называю эту структуру реестром физического опыта: агент связывает сбой с исправлением и передает следующей машине проверенные ограничения.

Один робот учит остальных

Единый формат записи превращает одного робота в часть общего эксперимента. AutoRT за семь месяцев собрал 77 тысяч реальных попыток с участием парка до 52 роботов и предложил 6 650 задач. Результаты возвращались в общий набор данных.

В π0.7 человеческие демонстрации дополняют удачными и провальными попытками роботов. Особенно полезны ошибки у границы навыка: новый ракурс, другой вес, отражающая поверхность или задержка камеры. Агент группирует сбои и выбирает следующий тест, который даст больше информации.

Без надежной проверки парк производит мусор с промышленной скоростью. Сотни машин могут повторить одну ошибку и принять случайность за успех. Поэтому слабые варианты выгодно отсеять до запуска на реальном роботе.

Сначала робот репетирует в воображении

Модель мира получает текущую сцену и показывает несколько продолжений, почти как черновые видео будущего. Агент сравнивает их и отправляет на физическую проверку самые перспективные.

Гравюрная метафора модели мира: машина отматывает сбой, ветвит исправления и отправляет лучшее на физическую проверку

Модель мира строит несколько продолжений после сбоя. Реальная машина проверяет лучший вариант.

Hi-WM начинает репетицию с реального кадра, возвращается к моменту сбоя и строит исправленные продолжения. На трех реальных задачах и одной установке с двумя манипуляторами результат исходной модели вырос в среднем на 37,9 процентного пункта. Масштаб технологии еще предстоит проверить.

Модель мира способна нарисовать убедительное и физически невозможное будущее. Виртуальная репетиция экономит попытки. Право стать навыком дает испытание на реальной машине.

Завод отличает навык от красивого видео

Завод добавляет к лабораторной сцене износ, грязную камеру, задержки сети, людей и восстановление после остановки. Независимый аудит пяти тестов для робототехники показал, как модель может воспользоваться подсказками самого экзамена. В LIBERO компактная модель без языкового блока приблизилась к лидерам за счет вида сцен и порядка задач. Только около пятой части заявленных улучшений в LIBERO и SimplerEnv удалось уверенно отделить от случайного разброса.

Для производства полезнее считать стоимость одного надежно выполненного действия, число вмешательств, остановки безопасности, время восстановления и перенос навыка между роботами.

По данным BMW Group, за десятимесячный пилот Figure 02 отработал около 1 250 часов, переместил более 90 тысяч компонентов и участвовал в выпуске свыше 30 тысяч BMW X3. Робот выполнял узкую операцию с листовыми деталями пять дней в неделю по десять часов за смену.

За цифрами BMW стоит инфраструктура: команда по ИТ, охране труда и логистике, усиленное покрытие 5G, перестроенная зона и ограждения. ASIMOV-Agentic отдельно проверяет отказ от запрещенной задачи, безопасную остановку и запрос помощи. Аварийные блокировки остаются независимыми от агента. ISO 10218-1:2025 задает требования для промышленных роботов и не охватывает все виды машин.

Проверка сопровождает навык от симуляции до рабочей смены. После этого движение получает право вернуться на производство и в обучение других роботов.

Проверка задает скорость обучения

Агент ставит задачу, робот делает попытку, система связывает результат с конкретной моделью и машиной. Удачное исправление проходит стенд и становится новой версией навыка.

Гравюрная метафора узкого места: флот роботов подает сырые эпизоды в один проверочный тракт

Роботы производят попытки параллельно. Скорость проверки решает, сколько из них станет полезным опытом.

Сто роботов могут создать в сто раз больше записей. При прежней скорости разбора ошибок объем надежного опыта почти не растет. Агент дает рычаг именно здесь: группирует сбои, предлагает причину и готовит следующий опыт.

У такого урока есть техническое имя: проверенный физический эпизод. В нем записаны происхождение данных, версии модели и робота, критерий успеха, помощь человека и разрешенные условия применения.

Смысл Физического ИИ здесь простой: одна машина ошибается, система проверяет исправление, следующему роботу уже не приходится повторять весь путь с нуля.