VLA-модели (vision-language-action)
Кратко
VLA-модель (vision-language-action) — единая нейросеть, которая по изображению с камер робота и языковой инструкции («убери чашку со стола») напрямую выдаёт действия: команды приводам манипулятора или шасси. Название образовано от трёх модальностей: зрение (vision), язык (language), действие (action).
Для чего используется
Классический робот собирается из отдельных модулей: восприятие находит объекты, планировщик строит траекторию, контроллер её исполняет. Каждый модуль настраивают отдельно, и связка плохо переносится на новые задачи. VLA-модель заменяет цепочку одной обученной сетью — и наследует от больших языковых и визуальных моделей главное свойство: обобщение. Робот с VLA выполняет команды про объекты, которых не было в его обучающих данных, потому что «знает» их из интернет-масштабного предобучения.
Основное применение сегодня — манипуляция: взять, положить, сложить, упаковать. VLA-модели — центральная технология современного воплощённого ИИ.
Как работает
Фундамент — vision-language-модели: визуальный энкодер соединяется с языковой моделью (как в LLaVA — CLIP-энкодер плюс LLM через проекционный слой). VLA добавляет третью модальность — действие.
Термин ввела работа RT-2 (Google DeepMind, 2023). Идея: закодировать действия робота текстовыми токенами и включить их в обучение наравне с обычным текстом. Модель дообучается совместно на двух наборах данных — траекториях робота и интернет-задачах «зрение-язык» — и учится отвечать на вопрос «что сделать дальше?» так же, как языковая модель продолжает предложение. В испытаниях (6 тысяч прогонов) RT-2 показала значительно лучшее обобщение на новые объекты и понимание новых команд, включая зачатки многошагового рассуждения: например, по просьбе дать «полезный перекус» модель сама выбирает подходящий предмет.
π0 (Physical Intelligence, 2024) сменила дискретные токены действий на генерацию непрерывных траекторий методом flow matching (родственник диффузионных генеративных моделей): базовая VLM на 3 млрд параметров дополнена «экспертом по действиям», который выдаёт моторные команды с частотой до 50 Гц — плавность, нужная для ловкой манипуляции вроде складывания белья.
Обучаются VLA на больших коллекциях демонстраций с разных роботов (датасеты Open X-Embodiment): одна модель управляет разными «телами» — это называют cross-embodiment.
Основные компоненты
- Визуальный энкодер — превращает кадры с камер в векторные признаки (в OpenVLA — связка DINOv2 + SigLIP).
- Языковая модель — ядро рассуждения (в OpenVLA — Llama 2 на 7 млрд параметров).
- Декодер действий — текстовые токены действий (RT-2, OpenVLA) или генератор непрерывных траекторий (π0).
- Данные — сотни тысяч записанных демонстраций: камера, команда, движения манипулятора.
Примеры
- RT-2 (Google DeepMind, 2023) — первая VLA; построена на vision-language-моделях Google (PaLI-X, PaLM-E), дообученных на траекториях робота RT-1.
- OpenVLA (2024) — открытая модель на 7 млрд параметров, обучена на 970 тыс. демонстраций; превзошла закрытую RT-2-X (55 млрд параметров) на 16,5 % абсолютного успеха при в 7 раз меньшем размере. Веса и код открыты; дообучается на потребительской видеокарте через LoRA, а квантование при работе не снижает успешность — то есть VLA запускаются и на бортовом железе (см. Нейросети на борту (Edge AI)).
- π0 (Physical Intelligence, 2024) — flow matching и собственный датасет с 8 робоплатформ; демонстрации — складывание белья, уборка стола, сборка коробок (данные компании).
- После RT-2 направление выросло в отдельную гонку: открытые модели и промышленные линии NVIDIA GR00T, Google Gemini Robotics, π-серия.
Простыми словами
VLA-модель — это способ дать роботу не программу, а понимание. Обычного промышленного робота программируют как станок: точка А, точка Б, захват. Робот с VLA-моделью получает команду словами и сам решает, куда двигать руку, глядя в камеру.
Ближайшая аналогия — стажёр, который до первого рабочего дня прочитал половину интернета. Он ни разу не был на этой кухне, но знает, как выглядит губка, что посуду моют, а хлеб не кладут в раковину. Дообучить такого стажёра конкретным движениям куда быстрее, чем учить с нуля того, кто ничего этого не знает: общие знания о мире у него уже есть — из тех же текстов и картинок, на которых учат чат-боты.
Практический пример: скажите роботу с VLA «убери со стола то, что может разбиться». В его обучающих данных не было именно вашей чашки — но модель знает из предобучения, что керамика бьётся, и способна найти чашку в кадре и перенести её. Модуль распознавания и модуль планирования для этого писать не пришлось: всё делает одна нейросеть.
Связанные темы
- Воплощённый искусственный интеллект (embodied AI)
- Мультимодальные модели (VLM)
- Большие языковые модели (LLM)
- Обучение роботов в симуляции (sim-to-real)
- Оптимизация нейросетей: квантование и дистилляция
- Нейросети на борту (Edge AI)
- Генеративные модели
Источники
- RT-2: Vision-Language-Action Models (DeepMind, 2023) — термин VLA, действия как токены, результаты обобщения.
- OpenVLA (2024) — архитектура, 970 тыс. демонстраций, сравнение с RT-2-X, открытость.
- Physical Intelligence — π0 — flow matching, 50 Гц, датасет с 8 платформ (материал компании).
- VLA Models: Concepts, Progress, Challenges (2025) — определение класса и карта направления.
- Comprehensive Survey on Embodied AI (2024) — место VLA в воплощённом ИИ.
- LLaVA (2023) — устройство vision-language-моделей, на которых строятся VLA.