Когда ИИ получает тело: как агенты меняют обучение роботов
Планирующий агент, быстрые контуры управления и реестр физического опыта работают как одна машина.
Манипулятор получает команду вставить деталь в паз. Камера находит ее, модель строит движение, захват подходит к сборочному узлу. Последние восемь миллиметров ломают план: край цепляется за корпус, усилие растет, контроллер останавливает руку.
У такой ошибки есть координаты, масса, след в телеметрии и цена. Иногда срывается один прогон. Иногда захват повреждает оснастку.
В 2026 году ИИ-агент уже способен разобрать эпизод, изменить программу поведения и запустить следующую попытку.
Для этого сошлись три технологии. VLA-модели связывают изображение, команду и движение. Рассуждающие агенты планируют длинные задачи. Флоты роботов возвращают собственные попытки в обучение.
Так складывается агентная робототехника, или agentic robotics. Агент получает камеры, модели, библиотеку навыков и право инициировать эксперимент. Его главная работа начинается после первой ошибки: превратить физическое событие в проверяемый опыт.
Команда спускается от слов к моторам
Фраза «положи деталь в лоток» занимает секунду. Во время исполнения робот живет сразу в трех временных масштабах.
Наверху агент понимает цель, разбивает ее на шаги и выбирает навык. Здесь допустимы секунды размышления. Ниже VLA, модель «зрение, язык, действие», получает свежий кадр и выдает короткую последовательность движений. В Gemini Robotics 2 такое разделение оформлено явно: ER 2 ведет многошаговую задачу, VLA исполняет физические навыки, On-Device 2 запускается локально для действий, чувствительных к задержке.
У самого тела счет идет на миллисекунды. В Helix 02 зрительно-моторная политика выдает цели суставам 200 раз в секунду, а контроллер всего тела обновляет команды с частотой 1 кГц.
Разрыв хорошо виден в экспериментах Anthropic. Unitree Go2 требует примерно 83 обновления в секунду, а один вызов модели без рассуждений занимал около 2,5-5 секунд. Симулятор ставили на паузу между ответами, поэтому результат показывает верхний предел без текущей задержки API.
В отдельном опыте с закрепленным манипулятором паузу уже не использовали: руке не требовалось постоянно удерживать равновесие. При прямом управлении модели полностью завершали от 0 до 5,5% задач LIBERO.
Агент управляет целью и порядком шагов. Контроллеры держат баланс, контакт и усилие. Независимый контур безопасности следит за рабочей зоной и аварийной остановкой. Чем ближе команда к мотору, тем уже полномочия и короче цикл обратной связи.
Физика работает без очереди к языковой модели.
Ошибка возвращается наверх
Сигнал о сбое поднимается от датчиков и контроллеров к уровню, который способен изменить следующее действие. Способность менять поведение можно разместить в трех местах.
В управляющей модели. VLA обучается моторному навыку целиком и сразу выдает движения по изображению и команде. Исправление входит в веса модели; его сложнее изолировать и проверить отдельно.
В программе. В Code as Policies языковая модель собирает поведение из разрешенных функций. Такую правку легко прочитать, проверить и переиспользовать. Возможности ограничены набором доступных функций.
В интерфейсе. VIA дает универсальной модели виртуальный захват и небольшой набор инструментов. Модель видит результат каждого шага и через тот же интерфейс исправляет действие.
Интерфейс заметно влияет на результат. В CaP-X качество 12 моделей снижалось по мере удаления удобных высокоуровневых функций. VIA получила 96,7% на трех обычных задачах и 40% на точной вставке. Все опыты проходили в симуляции, одна попытка могла занимать до часа.
ASPIRE собирает полный цикл отладки: агент пишет программу, запускает ее, читает трассу, диагностирует сбой и проверяет исправление. Успешная версия попадает в библиотеку навыков. На новых длинных задачах авторы сообщают 31% успеха против 4% у предыдущих методов; реальные эксперименты пока остаются ранними.
Проверяющий модуль фиксирует незавершенную вставку. Датчик усилия показывает ранний контакт, камера подтверждает правильное положение детали. Трасса локализует ошибку в угле подхода.
Агент добавляет боковое выравнивание, снижает скорость последних сантиметров и проверяет усилие перед финальным движением. После успешной попытки в библиотеке появляется навык с условным именем insert_with_edge_alignment, допустимой погрешностью позы, пределом усилия и критерием завершения. За одной строкой теперь стоит проверенная физическая история.
Исправления во время работы дороги: в одном из экспериментов агент делал до 66 вызовов модели за попытку. RHO ищет программу в симуляции и выпускает на робота замороженный код. Авторы получили 70% без обращений к модели во время исполнения; результаты пока ограничены симуляцией.
Самообучение легко превращается в маркетинговый туман. Рабочая архитектура отдельно обрабатывает текущий сбой, пополняет библиотеку навыков и обучает новую версию модели. Каждому циклу нужна полная запись физического эпизода.
Попытка получает паспорт
Робот способен выполнить задачу случайно. Захват соскользнул в удачную позицию, оператор поправил объект, стол стоял на несколько сантиметров ближе. Флаг success=true потеряет все эти обстоятельства.
За 14 секунд колесно-ногая платформа распределяет вес, выбирает точки опоры и корректирует корпус. Режим управления, число дублей, вмешательства оператора и состояние приводов остаются за кадром.
Для обучения эпизоду нужен паспорт: задача → конфигурация робота → калибровка → версия модели → сигналы и команды → вмешательства → события безопасности → проверенный результат.
Конфигурация означает конкретное тело: геометрию, камеры, захват, приводы и степени свободы. Замена объектива, обновление прошивки или износ редуктора способны изменить поведение навыка. Версия машины так же важна, как версия модели.
Проверяющий модуль для вставки детали оценивает конечную позу и профиль усилия. Для сортировки он распознает содержимое лотка, для мобильного робота учитывает маршрут, контакт и расход энергии. Точный критерий отсекает случайные успехи.
Полезная запись хранит причинную цепочку. Инженер или агент открывает трассу, находит момент сбоя и связывает исправление с наблюдаемым эффектом. Такой журнал я называю реестром физического опыта. Флот превращает его в непрерывный поток данных.
52 робота превращают движение в данные
AutoRT за семь месяцев собрал 77 тысяч реальных эпизодов с участием флота до 52 роботов. Система предложила 6 650 уникальных задач.
Это фабрика данных: одна модель описывает сцену, другая предлагает задачу, правила безопасности фильтруют команду, робот действует, результат возвращается в общий набор. В π0.7 обучение уже использует демонстрации людей, неудачные автономные попытки и данные за пределами робототехники.
Серия одинаковых падений чашки дает слабое покрытие. Агент должен искать границы навыка: новый ракурс, другой вес, отражающую поверхность, задержку камеры, частично закрытый объект.
Сбор масштабируется быстрее проверки. Слабый критерий пропускает случайности, повторяющиеся провалы и опасные обходные стратегии.
Флот с плохой проверкой масштабирует мусор.
Модель мира отматывает сбой
Физический опыт дорог: робот движется в реальном времени, занимает стенд и изнашивает оборудование. Модель мира заранее разыгрывает продолжение сцены по текущему состоянию и выбранному действию.
Модель мира отматывает сбой и ветвит исправления. Окончательный статус эпизоду присваивает физическая проверка.
Hi-WM начинает виртуальную попытку с реального наблюдения. Рядом с моментом сбоя человек вмешивается, система отматывает сцену и строит несколько продолжений. На трех задачах и одной установке с двумя манипуляторами авторы получили средний прирост 37,9 процентного пункта к исходной управляющей модели.
Погрешность растет вместе с длиной попытки. Контактная физика упрощается, редкий материал ведет себя правдоподобно на видео и странно на столе. Модель мира умеет уверенно придумать вымышленную физику.
Поэтому модель мира работает как генератор кандидатов. Перспективные траектории проходят симуляцию с физическими ограничениями, затем ограниченный запуск на стенде. Физическая проверка присваивает окончательный статус и измеряет разрыв между симуляцией и реальностью.
Тест может выдать подсказку за навык
Красивые показатели робототехнических моделей часто зависят от устройства теста. Аудит пяти популярных бенчмарков манипуляции обнаружил скрытые короткие пути, статистически слабые улучшения и переобучение на процедуру оценки.
В LIBERO компактная модель на 90 млн параметров без языкового блока приблизилась к заявленным лидерам за счет визуальных закономерностей и порядка задач. В CALVIN случайное смещение блоков внутри знакомого диапазона заметно снижало качество. Исследователь легко принимает регулярность сцены за общий навык.
Опубликованные Google показатели Gemini Robotics 2 показывают широкий разброс даже у одной версии модели. Franka Duo с двухпальцевым захватом получила 74,2%, 78,9% и 89,6% в трех категориях задач.
Конфигурация Apptronik Apollo 2 с кистями SharpaWave показала от 32% при работе с совком до 92% на выкручивании лампочки; остальные задачи дали 36%, 40% и 44%. Другая конфигурация Apollo 2 с кистями Inspire получила 45,7%, 68,4% и 76,3% в трех задачах с движением всего тела.
Сравнивать эти столбцы напрямую трудно. Для захвата и движений всего тела Google показывает средние значения по нескольким задачам внутри категории, для SharpaWave приводит отдельные задачи. На графиках есть полосы погрешности, но страница не объясняет их расчет, число прогонов и полный состав агрегированных категорий. Одно среднее число здесь легко прячет реальную форму навыка.
Для Физического ИИ я бы поставил наверх стоимость одного проверенного успешного эпизода. Рядом нужны доверительный интервал, частота вмешательств, защитные остановки, время восстановления, перенос между роботами и деградация после изменения среды. Эти метрики связывают качество модели с ценой эксплуатации. Подробнее подход к измерению разобран в статье про оценку LLM-агентов.
Завод проверяет навык длинной сменой
Красивый ролик длится секунды. Надежность измеряется сменами, остановками и восстановлением после сбоя.
BMW сообщала, что Figure 02 отработал около 1 250 часов, переместил более 90 тысяч деталей и участвовал в выпуске свыше 30 тысяч BMW X3. Робот работал десятичасовыми сменами пять дней в неделю.
Эти часы потребовали инфраструктуры. BMW подключила ИТ, охрану труда, управление процессом и логистику, усилила 5G, адаптировала рабочую зону и разработала концепцию безопасности с физическими разделителями.
Когда робот останавливается в середине смены, инженер должен быстро отделить смещенный предмет от ошибки сенсора, модели или механики. Журнал связывает остановку с версией модели и состоянием машины. Новую версию сначала получает малая часть флота, а предыдущая остается доступной для отката.
ASIMOV-Agentic отдельно проверяет отказ от запрещенных задач, защитную остановку, запрос помощи и реакцию на невыполнимую команду. Машинную безопасность обеспечивают жесткие ограничения, блокировки и оценка рисков по стандартам вроде ISO 10218-1:2025. Генеративная модель остается внутри этих границ.
Скорость проверки задает скорость обучения
После каждой смены зрелая система сохраняет библиотеку навыков, набор эпизодов, правила проверки и границы безопасности. Вместе они образуют память флота. Исправление одного физического сбоя после проверки может попасть на десятки машин.
Скорость проверки ограничивает весь цикл. Сто роботов способны увеличить поток сырых эпизодов в сто раз. При прежней скорости разбора провалов и стендовых тестов объем надежного опыта почти не изменится.
Флот производит сырые эпизоды параллельно. Узкий проверочный тракт определяет скорость превращения движения в знание.
Здесь агент дает самый большой рычаг. Он группирует сбои, воспроизводит трассы, предлагает диагноз, строит следующий эксперимент и отправляет человеку спорные случаи.
Главный сдвиг 2026 года находится здесь. Робототехника учится хранить физический опыт как инженерный артефакт: с происхождением, версией, критерием успеха и путем до конкретной машины.
В начале этой статьи деталь застряла на последних восьми миллиметрах. После разбора сбой превращается в навык, навык проходит стенд и входит в новый выпуск. Каждая совместимая машина получает предел усилия, угол подхода и проверку завершения до своей первой попытки.
Так ИИ получает тело вместе с ответственностью за последствия движения. Каждая следующая машина начинает уже с чужого опыта.