VLA-модели (vision-language-action)

Кратко

VLA-модель (vision-language-action) — единая нейросеть, которая по изображению с камер робота и языковой инструкции («убери чашку со стола») напрямую выдаёт действия: команды приводам манипулятора или шасси. Название образовано от трёх модальностей: зрение (vision), язык (language), действие (action).

Для чего используется

Классический робот собирается из отдельных модулей: восприятие находит объекты, планировщик строит траекторию, контроллер её исполняет. Каждый модуль настраивают отдельно, и связка плохо переносится на новые задачи. VLA-модель заменяет цепочку одной обученной сетью — и наследует от больших языковых и визуальных моделей главное свойство: обобщение. Робот с VLA выполняет команды про объекты, которых не было в его обучающих данных, потому что «знает» их из интернет-масштабного предобучения.

Основное применение сегодня — манипуляция: взять, положить, сложить, упаковать. VLA-модели — центральная технология современного воплощённого ИИ.

Как работает

Фундамент — vision-language-модели: визуальный энкодер соединяется с языковой моделью (как в LLaVA — CLIP-энкодер плюс LLM через проекционный слой). VLA добавляет третью модальность — действие.

Термин ввела работа RT-2 (Google DeepMind, 2023). Идея: закодировать действия робота текстовыми токенами и включить их в обучение наравне с обычным текстом. Модель дообучается совместно на двух наборах данных — траекториях робота и интернет-задачах «зрение-язык» — и учится отвечать на вопрос «что сделать дальше?» так же, как языковая модель продолжает предложение. В испытаниях (6 тысяч прогонов) RT-2 показала значительно лучшее обобщение на новые объекты и понимание новых команд, включая зачатки многошагового рассуждения: например, по просьбе дать «полезный перекус» модель сама выбирает подходящий предмет.

π0 (Physical Intelligence, 2024) сменила дискретные токены действий на генерацию непрерывных траекторий методом flow matching (родственник диффузионных генеративных моделей): базовая VLM на 3 млрд параметров дополнена «экспертом по действиям», который выдаёт моторные команды с частотой до 50 Гц — плавность, нужная для ловкой манипуляции вроде складывания белья.

Обучаются VLA на больших коллекциях демонстраций с разных роботов (датасеты Open X-Embodiment): одна модель управляет разными «телами» — это называют cross-embodiment.

Основные компоненты

  • Визуальный энкодер — превращает кадры с камер в векторные признаки (в OpenVLA — связка DINOv2 + SigLIP).
  • Языковая модель — ядро рассуждения (в OpenVLA — Llama 2 на 7 млрд параметров).
  • Декодер действий — текстовые токены действий (RT-2, OpenVLA) или генератор непрерывных траекторий (π0).
  • Данные — сотни тысяч записанных демонстраций: камера, команда, движения манипулятора.

Примеры

  • RT-2 (Google DeepMind, 2023) — первая VLA; построена на vision-language-моделях Google (PaLI-X, PaLM-E), дообученных на траекториях робота RT-1.
  • OpenVLA (2024) — открытая модель на 7 млрд параметров, обучена на 970 тыс. демонстраций; превзошла закрытую RT-2-X (55 млрд параметров) на 16,5 % абсолютного успеха при в 7 раз меньшем размере. Веса и код открыты; дообучается на потребительской видеокарте через LoRA, а квантование при работе не снижает успешность — то есть VLA запускаются и на бортовом железе (см. Нейросети на борту (Edge AI)).
  • π0 (Physical Intelligence, 2024) — flow matching и собственный датасет с 8 робоплатформ; демонстрации — складывание белья, уборка стола, сборка коробок (данные компании).
  • После RT-2 направление выросло в отдельную гонку: открытые модели и промышленные линии NVIDIA GR00T, Google Gemini Robotics, π-серия.

Простыми словами

VLA-модель — это способ дать роботу не программу, а понимание. Обычного промышленного робота программируют как станок: точка А, точка Б, захват. Робот с VLA-моделью получает команду словами и сам решает, куда двигать руку, глядя в камеру.

Ближайшая аналогия — стажёр, который до первого рабочего дня прочитал половину интернета. Он ни разу не был на этой кухне, но знает, как выглядит губка, что посуду моют, а хлеб не кладут в раковину. Дообучить такого стажёра конкретным движениям куда быстрее, чем учить с нуля того, кто ничего этого не знает: общие знания о мире у него уже есть — из тех же текстов и картинок, на которых учат чат-боты.

Практический пример: скажите роботу с VLA «убери со стола то, что может разбиться». В его обучающих данных не было именно вашей чашки — но модель знает из предобучения, что керамика бьётся, и способна найти чашку в кадре и перенести её. Модуль распознавания и модуль планирования для этого писать не пришлось: всё делает одна нейросеть.

Связанные темы

Источники

Обновлено: 2026-07-12