Введение
В мире искусственного интеллекта наступил новый этап: от языковых моделей и генерации изображений индустрия переходит к Physical AI — системам, способным взаимодействовать с физическим миром. Гуманоидные роботы, обученные через Vision-Language-Action (VLA) модели, больше не фантастика, а реальные прототипы, которые уже тестируются на заводах и в логистических центрах. Вторая часть большого разбора, опубликованная на Habr, детально анализирует, как развиваются VLA-модели, какие гуманоиды вышли на передовую, кто лидирует в гонке между Китаем и США, и есть ли у России шанс вписаться в этот тренд. Источник
VLA-модели: новый фундамент для физического ИИ
Авторы статьи подчёркивают, что ключевым технологическим прорывом 2025–2026 годов стали VLA-модели (Vision-Language-Action). В отличие от классических систем компьютерного зрения или NLP, VLA-модели способны не только распознавать объекты и понимать команды на естественном языке, но и генерировать последовательности действий (actions). Это достигается за счёт интеграции мультимодальных данных: видео, текста и сенсорной обратной связи.
Одним из ярких примеров, упомянутых в материале, является модель RT-2, разработанная Google DeepMind, и её последующие версии (RT-3), которые уже используются для управления роботами-манипуляторами в складских операциях. Другой значимый игрок — команда Stanford University с проектом Mobile ALOHA, где VLA-модель обучается на демонстрациях человека и способна самостоятельно выполнять бытовые задачи: мыть посуду, складывать бельё, открывать двери.
Важно отметить, что развитие VLA-моделей напрямую зависит от объёма и качества обучающих данных. В статье указывается, что для обучения эффективного гуманоида требуется не менее 10 000 часов демонстраций, и ведущие лаборатории публикуют открытые датасеты (например, Open X-Embodiment), чтобы ускорить прогресс.
Гуманоиды: кто уже на рынке, а кто только в прототипах?
Гонка гуманоидных роботов перешла из научной фантастики в промышленные испытания. Авторы разбора выделяют несколько ключевых проектов.
Китайские гиганты
- UBTECH Walker S — гуманоид, который прошёл тесты на сборочных линиях BYD. Робот способен переносить детали весом до 15 кг и синхронизироваться с системами MES.
- Fourier Intelligence GR-2 — робот с 54 степенями свободы, используемый в реабилитационных центрах. Интересно, что его VLA-модель обучается на данных с экзоскелетов компании.
- Xiaomi CyberOne — обновлённая версия, которая теперь может распознавать эмоции и отвечать жестами. В статье отмечается, что CyberOne уже интегрирован в шоурумы Xiaomi для взаимодействия с посетителями.
Американские стартапы и корпорации
- Tesla Optimus (Gen 3) — по данным источника, третье поколение гуманоида Теслы научилось выполнять 15 различных операций на заводе Tesla Gigafactory, включая затяжку болтов и сортировку компонентов. Однако массовое производство отложено до 2027 года.
- Figure 01 — стартап Figure AI, получивший инвестиции от OpenAI, Microsoft и Nvidia, представил робота, который работает в паре с VLA-моделью на базе GPT-4o. В статье говорится, что Figure 01 уже тестируют в логистических центрах Amazon.
- Agility Robotics Digit — хотя Digit — не полноценный гуманоид (ноги как у птицы), его успех подтолкнул инженеров к созданию человекоподобной версии с руками. Прототип анонсирован на 2027 год.
Япония и Европа
- Toyota продолжает развивать гуманоида T-HR3, но сместила фокус на домашнюю помощь для пожилых людей.
- Boston Dynamics (Hyundai) представила электрическую версию Atlas EV, которая может делать сальто, но пока не коммерциализирована.
Гонка Китая и США: стратегии и финансирование
Авторы статьи проводят сравнение подходов двух сверхдержав к развитию Physical AI.
Китай: государственная поддержка и скорость внедрения
- Правительство Китая включило Physical AI в список приоритетных направлений 14-й пятилетки (2026–2030). Выделены субсидии на закупку гуманоидов для производственных линий.
- Корпорации, такие как Huawei и DJI, вкладывают миллиарды юаней в исследования VLA-моделей. Особенность Китая — использование реальных данных с заводов, что даёт преимущество в обучении моделей.
- В статье упоминается, что к июлю 2026 года в Китае развёрнуто уже более 500 гуманоидов на промышленных объектах (против примерно 150 в США).
США: ставка на ИИ и стартапы
- Американская стратегия опирается на сильные фундаментальные исследования (MIT, Stanford, CMU) и венчурное финансирование. В 2025–2026 годах в Physical AI инвестировано более $8 млрд (данные Crunchbase, которые цитирует источник).
- Основные драйверы — компании OpenAI, Google, Nvidia, которые разрабатывают универсальные VLA-модели, не привязанные к конкретному роботу.
- Однако, как отмечают авторы, США сталкиваются с проблемой дефицита инженерных кадров для интеграции ПО с «железом» — робототехников, которые понимают и механику, и ИИ.
Кто лидирует? Мнения экспертов
В статье приводится цитата директора одной из китайских лабораторий: «Китай выигрывает в hardware и масштабировании, но уступает в архитектурах глубокого обучения. США — наоборот». Пока рано говорить о явном лидере, но гонка ускоряется с каждым кварталом.
Что есть у России?
В материалу уделяется внимание и российским разработкам. Авторы перечисляют следующие проекты:
- «Андроидная техника» (входит в ГК «Роскосмос») — гуманоид FEDOR-3, который прошёл модернизацию: теперь он управляется через нейросетевой интерфейс и может работать в условиях радиации. Проект остаётся экспериментальным.
- Сбер — лаборатория AI показала прототип робота СберГуманоид, который использует собственную мультимодальную модель на основе NLP-архитектуры. Однако, как сообщается, до промышленного применения далеко — робот пока способен лишь ходить и выполнять 5-6 простых команд.
- МФТИ и Сколтех — совместная разработка гуманоида «Арктур» с открытым исходным кодом ПО. Проект ориентирован на образование и исследования.
- Промышленные манипуляторы — в России активно применяются VLA-модели для управления коллаборативными роботами на заводах (например, KUKA, FANUC). Но полноценных гуманоидов в серийном производстве пока нет.
Авторы статьи отмечают, что российские разработки отстают от лидеров на 3–5 лет, но потенциал есть в области специализированных решений (например, для МЧС или атомной промышленности).
Проблемы и вызовы для Physical AI
Несмотря на оптимизм, авторы выделяют ряд ключевых проблем:
1. Энергопотребление — современные гуманоиды работают от батарей всего 2–4 часа. Разработка более ёмких источников питания остаётся узким местом.
2. Безопасность — VLA-модели могут совершать опасные действия при неполных данных. Инциденты уже были: в тестовой среде робот схватил человека за руку, не рассчитав силу.
3. Этика и регулирование — ни в одной стране пока нет нормативной базы для массового использования гуманоидов в общественных местах.
Заключение
Подводя итог, можно сказать, что Physical AI переходит из исследовательской фазы в практическую. VLA-модели становятся стандартом для обучения роботов, а гуманоиды — коммерческим продуктом. Гонка между Китаем и США будет определять технологический ландшафт ближайших лет. Россия, по мнению авторов статьи, пока остаётся сторонним наблюдателем, но может найти ниши в специализированных приложениях. Вторая часть разбора даёт чёткое понимание текущей картины и трендов, которые стоит отслеживать каждому, кто интересуется ИИ и робототехникой.
Комментарии