Искусственный интеллект
-
VLA-модели (vision-language-action)
сложный
VLA-модель (vision-language-action) — единая нейросеть, которая по изображению с камер робота и языковой инструкции («убери чашку со стола») напрямую выдаёт действия: команды приводам манипулятора или шасси. Название образовано от трёх модальностей: зрение (vision), язык (language), действие (action).
-
Автономность БПЛА — от стабилизации к полной автономии
средний
Автономность — способность беспилотной системы самостоятельно воспринимать обстановку, планировать, принимать решения и действовать для достижения целей, поставленных оператором (определение из фреймворка NIST ALFUS). У БПЛА автономность — не переключатель «вкл/выкл», а лестница: от ручной стабилизации до полёта без GPS и оператора.
-
Аппаратные ускорители ИИ (GPU, NPU, TPU)
средний
Ускоритель ИИ (нейропроцессор, NPU) — специализированный процессор для нейросетевых вычислений: он выполняет матричные операции с пониженной точностью в тысячах параллельных блоков и за счёт этого выигрывает у универсального CPU в скорости или энергопотреблении. К этому классу относятся GPU с тензорными ядрами, облачные TPU Google и компактные NPU в смартфонах и бортовых компьютерах.
-
Большие языковые модели (LLM)
средний
Большая языковая модель (large language model, LLM) — трансформерная нейросеть с миллиардами параметров, предобученная на огромных корпусах текста предсказывать следующее слово. Из этой простой задачи вырастает неожиданно общая способность: начиная с GPT-3 такие модели решают новые задачи прямо по текстовой инструкции с парой примеров, без дообучения. На LLM построены современные чат-ассистенты.
-
Визуальное сопровождение цели (трекинг)
средний
Визуальное сопровождение (video tracking, трекинг) — определение положения движущегося объекта от кадра к кадру по видео с камеры. В отличие от детекции, которая заново находит объекты на каждом кадре, трекер удерживает идентичность цели во времени: «этот пешеход на новом кадре — тот же, что и на предыдущем». Без трекинга невозможны подсчёт объектов, анализ траекторий и автоматическое удержание цели камерой.
-
Воплощённый искусственный интеллект (embodied AI)
средний
Воплощённый ИИ (embodied AI) — направление, в котором интеллектуальная система получает физическое тело: сенсоры, приводы, корпус. Такая система воспринимает реальную среду, принимает решения, действует и учится на последствиях собственных действий — в отличие от «бестелесного» ИИ, который работает только с текстами и данными.
-
Генеративные модели
средний
Генеративные модели (generative models) — модели машинного обучения, которые выучивают распределение данных и порождают новые образцы: изображения, текст, аудио. Если классификатор отвечает на вопрос «что это?», то генеративная модель — на вопрос «как выглядит типичный образец?» и умеет создавать такие образцы сама. Два главных семейства последнего десятилетия — генеративно-состязательные сети (GAN) и диффузионные модели.
-
Глубокое обучение
база
Глубокое обучение (deep learning) — подход машинного обучения на многослойных нейронных сетях: вычислительные модели из многих слоёв обработки выучивают представления данных с несколькими уровнями абстракции. Так область определяют её основоположники — Ян Лекун, Йошуа Бенджио и Джеффри Хинтон. Ключевое отличие от классических методов: признаки не проектируются инженерами, а выучиваются из сырых данных.
-
Датасеты и разметка данных
база
Датасет (набор данных) — коллекция примеров, на которых обучается и проверяется модель машинного обучения; разметка — присвоение этим примерам эталонных ответов: меток классов, рамок, попиксельных масок. Качество и объём размеченных данных определяют потолок качества модели: прорыв глубокого обучения случился не только из-за алгоритмов, но и потому, что появился ImageNet — миллионы размеченных изображений.
-
Детекция объектов
средний
Детекция объектов (object detection) — задача компьютерного зрения: найти на изображении или видео все экземпляры объектов заданных классов и локализовать каждый ограничивающей рамкой (bounding box). В отличие от классификации, которая отвечает «что на картинке», детектор отвечает «что и где»: выдаёт список рамок с классами и оценками уверенности. Современные детекторы построены на свёрточных нейросетях и трансформерах.
-
ИИ в сельском хозяйстве — агродроны и автопилоты техники
база
ИИ в сельском хозяйстве — это в первую очередь компьютерное зрение над полем и в кабине: нейросети распознают болезни растений и сорняки на снимках, предсказывают урожайность, ведут комбайн вдоль кромки нескошенного поля. Носители этого зрения — агродроны и автопилоты сельхозтехники.
-
Искусственный интеллект
база
Искусственный интеллект (artificial intelligence, ИИ) — комплекс технологических решений, позволяющий имитировать когнитивные функции человека, включая самообучение и решение задач без заранее заданного алгоритма. Так ИИ определяют российский ГОСТ Р 59277-2020 и Национальная стратегия развития ИИ. Термин появился в 1955 году, а самостоятельной научной областью ИИ стал после Дартмутской конференции 1956 года.
-
Машинное зрение в промышленности
средний
Машинное зрение (machine vision) — автоматическая инспекция и анализ по изображениям на производстве: камера над конвейером проверяет детали, считывает коды, измеряет размеры и подсказывает роботу, где лежит заготовка. Это инженерная дисциплина: не «научить компьютер видеть в принципе», а собрать из камер, света и алгоритмов систему, которая годами без сбоев отвечает «годен / брак».
-
Машинное обучение
база
Машинное обучение (machine learning) — наука об алгоритмах, которые автоматически улучшаются благодаря опыту, то есть данным. Вместо того чтобы программировать правила вручную, инженер собирает примеры, а модель сама настраивает свои параметры так, чтобы правильно обрабатывать новые, ранее не виденные данные. Это главный рабочий инструмент современного искусственного интеллекта.
-
Мультимодальные модели (VLM)
средний
Зрительно-языковая модель (vision language model, VLM) — мультимодальная нейросеть, которая принимает на вход изображение и текст, а порождает текст: отвечает на вопросы по картинке, описывает её, читает документы. VLM соединяют два мира — компьютерное зрение и большие языковые модели — и делают это буквально: типовая архитектура склеивает энкодер изображения с готовой языковой моделью.
-
Нейронные сети
база
Нейронная сеть (neural network) — модель машинного обучения, построенная из слоёв искусственных нейронов. Каждый нейрон выполняет три операции: вычисляет взвешенную сумму входов, прибавляет смещение (bias) и применяет нелинейную функцию активации. Сила нейросетей в том, что признаки для решения задачи они извлекают из данных сами — их не нужно конструировать вручную.
-
Нейросети на борту (Edge AI)
средний
Периферийный ИИ (edge AI) — выполнение нейросетей прямо на устройстве у источника данных: на бортовом компьютере дрона, в камере, на одноплатнике — вместо отправки данных в облако. Модель обучают на мощных серверах, а работает она затем на месте, рядом с сенсорами.
-
Обучение роботов в симуляции (sim-to-real)
средний
Перенос из симуляции в реальность (sim-to-real) — подход, при котором управляющую политику робота обучают в виртуальной среде, а затем переносят на реальную машину. Симуляция даёт практически неограниченные обучающие данные и позволяет роботу ошибаться тысячи раз, не ломая железо.
-
Обучение с подкреплением
средний
Обучение с подкреплением (reinforcement learning, RL) — вид машинного обучения, при котором агент учится, взаимодействуя со средой: выбирает действия, получает награды и постепенно находит стратегию, максимизирующую суммарный выигрыш. В отличие от обучения с учителем, правильных ответов агенту никто не показывает — только оценку последствий его действий.
-
Оптимизация нейросетей: квантование и дистилляция
средний
Квантование и дистилляция — два основных способа сжать обученную нейросеть, чтобы она работала быстрее и помещалась на слабом железе. Квантование понижает точность чисел (обычно int8 вместо 32-битных float), дистилляция переносит «знание» большой модели в маленькую. Без этих приёмов современные модели не влезали бы ни в смартфон, ни в бортовой компьютер робота.
-
Свёрточные нейросети (CNN)
средний
Свёрточная нейронная сеть (convolutional neural network, CNN) — нейросеть для данных с пространственной структурой, прежде всего изображений. Вместо того чтобы соединять каждый пиксель с каждым нейроном, CNN скользит по изображению небольшими обучаемыми фильтрами — это резко сокращает число параметров и делает сеть устойчивой к сдвигам объектов в кадре. На свёрточных сетях построено современное компьютерное зрение.
-
Сегментация изображений
средний
Сегментация изображений (image segmentation) — разбиение изображения на области с попиксельной точностью: каждому пикселю присваивается метка. Если детекция обводит объект прямоугольной рамкой, то сегментация вырезает его точный силуэт. Это самый детальный уровень понимания сцены в компьютерном зрении.
-
Трансформеры
средний
Трансформер (transformer) — архитектура нейросети, основанная целиком на механизме внимания: в ней нет ни рекуррентности, ни свёрток. Предложена в 2017 году в статье Google «Attention Is All You Need» для машинного перевода и с тех пор стала фундаментом больших языковых моделей — GPT, BERT и их наследников.
-
Уровни автономности автомобилей (SAE J3016)
база
SAE J3016 — стандарт, который делит автоматизацию вождения на шесть уровней: от 0 (всё делает водитель) до 5 (автомобиль справляется сам в любых условиях). Когда производитель говорит «автопилот третьего уровня», он ссылается именно на эту шкалу.
-
Этика и регулирование ИИ
база
Этика и регулирование ИИ — правила, по которым общество определяет, что системам искусственного интеллекта можно, что нельзя и кто отвечает за последствия. Спектр — от добровольных этических кодексов (как российский Кодекс этики в сфере ИИ) до юридически обязательных законов (как регламент ЕС об ИИ).