Какой вопрос вы задаёте изображению
Компьютерное зрение с ИИ · Урок 1 / 22
Задача появляется, когда описаны вход, выход и действие
Первая ошибка CV-проекта делается до первой строки кода: задачу берут в той формулировке, в которой её произнёс заказчик. «Контролировать качество на конвейере» — это не задача над изображениями. Задача появляется, когда записаны три вещи: что подаётся на вход (кадр 1920×1080 с неподвижной камеры, деталь занимает примерно четверть площади), что возвращается на выходе (метка «брак/норма», или список рамок с координатами, или маска), и какое действие следует за выходом (остановить линию, пометить деталь на переборку, показать оператору). Если третий пункт пуст, модель не нужна — нужен ещё один разговор с заказчиком.
Пять формулировок, из которых обычно выбирают
- Классификация. Одна метка на кадр. Самая дешёвая разметка: один клик на изображение. Работает, когда объект в кадре один и занимает заметную долю площади.
- Детекция. Список прямоугольников с классом и уверенностью. Отвечает на «сколько и где». Разметка дороже классификации примерно на порядок.
- Сегментация. Класс для каждого пикселя. Нужна, когда измеряют площадь, длину или форму, либо когда объект принципиально не прямоугольный: трещина, потёк, дорога, пятно.
- Чтение текста. Локализация текстовых областей плюс распознавание символов. Отдельный класс инструментов, с нуля почти никогда не обучается.
- Сравнение. Модель отдаёт вектор, вы сравниваете векторы между собой: «тот же товар или другой», «этот объект уже проходил». Не требует заранее фиксированного списка классов — главное преимущество там, где классы добавляются каждую неделю.
Проверка формулировки тремя вопросами
1. Что вернёт система, если объектов на кадре два? 2. Что она вернёт, если объект наполовину за краем кадра? 3. Чем «не нашла» отличается от «нашла, но перепутала класс» — и одинаково ли дорого это стоит?
Классификация проваливает первый вопрос: она отдаст одну метку и промолчит про второй объект. Детекция отвечает на все три, но требует явного правила про обрезанные объекты — размечать или пропускать. Третий вопрос обычно вскрывает главное: в контроле качества пропуск дефекта стоит в десятки раз дороже ложной тревоги, в подсчёте посетителей — наоборот, и это меняет не только выбор задачи, но и рабочий порог уверенности.
Минимально достаточная формулировка
Сегментация вместо детекции — типичное удорожание на ровном месте. Разметка одной маски занимает 2–5 минут против 5–15 секунд на рамку; набор в 2000 изображений превращается из недели работы в два месяца. Правило: если бизнес-ответ выражается числом объектов или их положением с точностью до сантиметров — хватает рамок. Точная граница нужна тогда, когда её кто-то измеряет: площадь поражения, длина трещины, доля покрытия.
Иногда изображение — не лучший вход
Прежде чем ставить камеру, проверьте, нет ли сигнала дешевле. Наличие детали ловится оптическим датчиком за копейки и без переобучения. Толщина — лазерным микрометром точнее любой сегментации. Камера оправдана, когда признак визуальный и разнообразный: царапина где угодно на поверхности, произвольная поза человека, произвольный ракурс товара. Взяв CV там, где хватает датчика, вы платите разметкой и деградацией качества при каждой смене освещения.
Шпаргалка
- Задача поставлена, когда описаны вход, выход и следующее за выходом действие.
- Классификация — метка, детекция — рамки, сегментация — пиксели, сравнение — вектор.
- Цена формулировки измеряется минутами разметки на изображение.
- Разная цена пропуска и ложной тревоги задаёт и постановку, и порог.