Разные вопросы к изображению — разные задачи
CV — это не одна задача, а спектр. Важно понимать разницу между основными типами, потому что от этого зависит выбор инструмента и сложность. Все они отвечают на разные вопросы к изображению, с растущей точностью и сложностью. Разберём главные.
Три основных типа
- Классификация — «что это?»: одна метка на всё изображение. «На фото кошка». Простейшая задача.
- Детекция — «что и где?»: рамки вокруг объектов с метками. «Вот три машины и два человека, каждый в своей рамке». Сложнее.
- Сегментация — «какие именно пиксели?»: точная маска формы объекта, а не рамка. «Вот точный контур этого объекта попиксельно». Ещё точнее.
Растущая точность = растущая сложность
Заметьте закономерность: от классификации к сегментации растёт и точность ответа (метка → рамки → маска пикселей), и сложность (обычно больше данных и вычислений). Это важно для выбора: более точная задача требовательнее. Не всегда нужна максимальная точность — часто хватает более простой задачи, которая дешевле и требует меньше данных.
Берите минимально достаточную задачу
Практический принцип выбора: определите, какой вопрос вы задаёте изображению, и возьмите минимально достаточный тип задачи. Нужно просто категоризировать фото — классификация (проще, дешевле). Нужно найти и посчитать объекты — детекция. Нужна точная форма/граница — сегментация (но сложнее). Частая ошибка — брать задачу сложнее, чем нужно (сегментацию там, где хватило бы классификации): больше данных, вычислений, сложности без пользы. Есть и другие задачи (OCR, лица, поза, отслеживание), но эти три — фундамент понимания CV.
Правило: классификация — «что» (метка), детекция — «что и где» (рамки), сегментация — «какие пиксели» (маска). Растущая точность = растущая сложность. Берите минимально достаточную задачу под ваш вопрос.
🧠 Чем детекция объектов отличается от классификации?