Мультимодальные модели (VLM)
Кратко
Зрительно-языковая модель (vision language model, VLM) — мультимодальная нейросеть, которая принимает на вход изображение и текст, а порождает текст: отвечает на вопросы по картинке, описывает её, читает документы. VLM соединяют два мира — компьютерное зрение и большие языковые модели — и делают это буквально: типовая архитектура склеивает энкодер изображения с готовой языковой моделью.
Для чего используется
- ответы на вопросы по изображению (visual question answering, VQA);
- автоматическое описание изображений (captioning);
- понимание документов: чтение таблиц, схем, скриншотов;
- диалог о картинке — «что не так на этом фото?»;
- локализация по запросу (grounding): модель выдаёт рамки или маски названного объекта;
- в робототехнике — фундамент VLA-моделей «зрение-язык-действие» (vision-language-action).
Как работает
Шаг 1: трансформер учится видеть. Vision Transformer (ViT, Google Research, 2020) перенёс трансформер в зрение: изображение режется на фрагменты 16×16 пикселей, каждый фрагмент — «токен» последовательности. При предобучении на больших данных чистый трансформер без свёрток достигает результатов уровня лучших свёрточных сетей при меньших затратах на обучение.
Шаг 2: зрение связывается с языком. CLIP (OpenAI, 2021) обучен контрастно на 400 млн пар «изображение-описание» из интернета: модель учится сближать представления картинки и её текста. Результат — zero-shot классификация: CLIP сравнялся по точности с ResNet-50 на ImageNet, не увидев ни одного из 1,28 млн размеченных обучающих примеров; проверен более чем на 30 датасетах — от OCR до распознавания действий на видео.
Шаг 3: картинка подключается к LLM. Типовая VLM состоит из трёх блоков: энкодер изображения → проектор (небольшая сеть, переводящая визуальные признаки в «язык» эмбеддингов LLM) → языковая модель, которая генерирует ответ. Обучают экономно: энкодер и LLM заморожены, сначала учится только проектор, затем LLM размораживают для дообучения. Аналогия: к готовому «мозгу» (LLM) подключают готовый «глаз» (энкодер CLIP), и учат в основном «зрительный нерв» между ними.
Открытый пример этой схемы — LLaVA (NeurIPS 2023): энкодер CLIP + проектор + языковая модель Vicuna. Данные для обучения инструкциям сгенерированы текстовым GPT-4 (visual instruction tuning): 85,1% относительного балла GPT-4 на мультимодальных инструкциях, state-of-the-art 92,53% на Science QA; данные, модель и код открыты.
Основные компоненты
- энкодер изображения — ViT или CLIP-энкодер: картинка → векторные признаки;
- проектор — выравнивает визуальные представления с текстовыми;
- языковая модель — генерирует ответ; наследует способности LLM;
- данные «изображение-текст» — пары для контрастного обучения и инструктивные датасеты.
Примеры
- ViT (2020) — трансформер для классификации изображений, «глаз» многих VLM.
- CLIP (2021) — контрастная связка изображения и текста, zero-shot классификация; код и веса открыты.
- LLaVA (2023) — открытая VLM «CLIP + проектор + Vicuna», собранная по типовой схеме.
Связанные темы
- Большие языковые модели (LLM)
- Трансформеры
- Компьютерное зрение
- Свёрточные нейросети (CNN)
- Сегментация изображений
Источники
- Vision Transformer (Dosovitskiy et al., 2020) — изображение как последовательность фрагментов.
- CLIP (Radford et al., 2021) — контрастное обучение на 400 млн пар, zero-shot.
- LLaVA (Liu et al., NeurIPS 2023) — открытая VLM, visual instruction tuning.
- Hugging Face — Vision Language Models Explained — определение, типовая архитектура, задачи.
- Hugging Face LLM Course — схема «предобучение + перенос».