Датасеты и разметка данных

Кратко

Датасет (набор данных) — коллекция примеров, на которых обучается и проверяется модель машинного обучения; разметка — присвоение этим примерам эталонных ответов: меток классов, рамок, попиксельных масок. Качество и объём размеченных данных определяют потолок качества модели: прорыв глубокого обучения случился не только из-за алгоритмов, но и потому, что появился ImageNet — миллионы размеченных изображений.

Для чего используется

  • обучение моделей: примеры с ответами — «учебник» для нейросети;
  • честная оценка качества: проверка на данных, которых модель не видела;
  • сравнение методов: общие эталонные датасеты (ImageNet, COCO) позволяют сопоставлять результаты разных команд;
  • дообучение под конкретную задачу: свой небольшой датасет под свою камеру, свои объекты.

Как работает

Разбиение данных. Датасет делят на выборки. Обучать и проверять модель на одних и тех же данных — методологическая ошибка: модель, запомнившая ответы, покажет идеальный результат, но провалится на новых данных (переобучение). Поэтому часть данных откладывают как тестовую выборку. Для подбора гиперпараметров выделяют ещё и валидационную: если настраивать модель по тестовой, знание о ней «утекает» в модель, и оценка перестаёт отражать реальную обобщающую способность. Когда данных мало, применяют k-fold кросс-валидацию: обучающая выборка делится на k частей, модель k раз обучается на k−1 частях и проверяется на оставшейся, результаты усредняются.

Виды разметки. Задача диктует формат эталона: классификации достаточно метки на изображение, детекции нужны ограничивающие рамки, сегментации — попиксельные маски, оценке позы — ключевые точки.

Как размечают. Классический путь — вручную, силами многих людей. ImageNet размечен краудсорсингом через Amazon Mechanical Turk: около 49 тыс. работников из 167 стран отфильтровали свыше 160 млн изображений-кандидатов (2008–2010); для контроля качества каждое изображение размечалось трижды. Современный путь — полуавтоматический: инструменты разметки вроде CVAT предразмечают данные моделями (в том числе Segment Anything и YOLO), человек правит. Крайний случай — «движок данных» SAM: модель сама размечала изображения, люди корректировали, так собран SA-1B — 1 млрд масок на 11 млн изображений.

Основные компоненты

  • обучающая / валидационная / тестовая выборки — обучение, подбор гиперпараметров, финальная оценка;
  • эталонная разметка (ground truth) — метки, рамки, маски, ключевые точки;
  • инструменты разметки — CVAT (открытый, MIT): изображения, видео и 3D, контроль качества, командная работа;
  • краудсорсинг и предразметка моделями — способы масштабировать ручной труд.

Примеры

  • ImageNet — более 14 млн размеченных изображений, 20 000+ категорий (проект Фей-Фей Ли, с 2006). Подмножество ImageNet-1K для соревнования ILSVRC: 1000 классов, 1 281 167 обучающих, 50 000 валидационных, 100 000 тестовых изображений. Победа AlexNet на ILSVRC 2012 — top-5 ошибка 15,3%, более чем на 10 процентных пунктов лучше ближайшего конкурента — открыла эру глубокого обучения.
  • MS COCO (2014) — 328 тыс. изображений повседневных сцен, 2,5 млн экземпляров с попиксельными масками; стандарт для детекции и сегментации.
  • SA-1B (2023) — 1 млрд масок, собранных полуавтоматически моделью SAM.

Связанные темы

Источники

Обновлено: 2026-07-10