Датасеты и разметка данных
Кратко
Датасет (набор данных) — коллекция примеров, на которых обучается и проверяется модель машинного обучения; разметка — присвоение этим примерам эталонных ответов: меток классов, рамок, попиксельных масок. Качество и объём размеченных данных определяют потолок качества модели: прорыв глубокого обучения случился не только из-за алгоритмов, но и потому, что появился ImageNet — миллионы размеченных изображений.
Для чего используется
- обучение моделей: примеры с ответами — «учебник» для нейросети;
- честная оценка качества: проверка на данных, которых модель не видела;
- сравнение методов: общие эталонные датасеты (ImageNet, COCO) позволяют сопоставлять результаты разных команд;
- дообучение под конкретную задачу: свой небольшой датасет под свою камеру, свои объекты.
Как работает
Разбиение данных. Датасет делят на выборки. Обучать и проверять модель на одних и тех же данных — методологическая ошибка: модель, запомнившая ответы, покажет идеальный результат, но провалится на новых данных (переобучение). Поэтому часть данных откладывают как тестовую выборку. Для подбора гиперпараметров выделяют ещё и валидационную: если настраивать модель по тестовой, знание о ней «утекает» в модель, и оценка перестаёт отражать реальную обобщающую способность. Когда данных мало, применяют k-fold кросс-валидацию: обучающая выборка делится на k частей, модель k раз обучается на k−1 частях и проверяется на оставшейся, результаты усредняются.
Виды разметки. Задача диктует формат эталона: классификации достаточно метки на изображение, детекции нужны ограничивающие рамки, сегментации — попиксельные маски, оценке позы — ключевые точки.
Как размечают. Классический путь — вручную, силами многих людей. ImageNet размечен краудсорсингом через Amazon Mechanical Turk: около 49 тыс. работников из 167 стран отфильтровали свыше 160 млн изображений-кандидатов (2008–2010); для контроля качества каждое изображение размечалось трижды. Современный путь — полуавтоматический: инструменты разметки вроде CVAT предразмечают данные моделями (в том числе Segment Anything и YOLO), человек правит. Крайний случай — «движок данных» SAM: модель сама размечала изображения, люди корректировали, так собран SA-1B — 1 млрд масок на 11 млн изображений.
Основные компоненты
- обучающая / валидационная / тестовая выборки — обучение, подбор гиперпараметров, финальная оценка;
- эталонная разметка (ground truth) — метки, рамки, маски, ключевые точки;
- инструменты разметки — CVAT (открытый, MIT): изображения, видео и 3D, контроль качества, командная работа;
- краудсорсинг и предразметка моделями — способы масштабировать ручной труд.
Примеры
- ImageNet — более 14 млн размеченных изображений, 20 000+ категорий (проект Фей-Фей Ли, с 2006). Подмножество ImageNet-1K для соревнования ILSVRC: 1000 классов, 1 281 167 обучающих, 50 000 валидационных, 100 000 тестовых изображений. Победа AlexNet на ILSVRC 2012 — top-5 ошибка 15,3%, более чем на 10 процентных пунктов лучше ближайшего конкурента — открыла эру глубокого обучения.
- MS COCO (2014) — 328 тыс. изображений повседневных сцен, 2,5 млн экземпляров с попиксельными масками; стандарт для детекции и сегментации.
- SA-1B (2023) — 1 млрд масок, собранных полуавтоматически моделью SAM.
Связанные темы
Источники
- scikit-learn — Cross-validation — разбиение данных, валидационная выборка, k-fold.
- Wikipedia — ImageNet — масштаб, краудсорсинг, ILSVRC, AlexNet.
- Microsoft COCO (Lin et al., ECCV 2014) — состав и аннотации COCO.
- CVAT — документация — типы разметки, автоматизация, лицензия.
- Segment Anything (Kirillov et al., 2023) — датасет SA-1B и полуавтоматический сбор.
- AlexNet (Krizhevsky et al., NIPS 2012) — роль большого датасета в прорыве.