Три главных понятия ML
Чтобы говорить об ML, нужно понимать три базовых понятия: данные, признаки и модель. Они образуют основу любой ML-системы. Разберём их на понятном примере — предсказании цены квартиры.
Данные
Данные — это примеры, на которых учится модель. Для предсказания цены квартиры данные — это таблица проданных квартир: у каждой известны характеристики и реальная цена продажи. Чем больше и качественнее данные, тем лучше учится модель.
Признаки (features)
Признаки — это характеристики каждого примера, по которым модель делает вывод. Для квартиры признаки: площадь, число комнат, этаж, район, состояние. Модель учится связывать признаки с ответом (ценой). Выбор хороших признаков критичен: «площадь» полезна для цены, «цвет обоев» — вряд ли.
Модель
Модель — это то, что учится на данных находить связь между признаками и ответом. После обучения модель может предсказывать: дайте ей признаки новой квартиры (которой не было в данных) — она предскажет цену на основе выученных закономерностей.
Обучение и предсказание — два этапа
Работа с ML-моделью делится на два этапа: обучение (модель учится на данных с известными ответами) и предсказание (обученная модель применяется к новым данным). Сначала учим на прошлом, потом применяем к новому. Понимание этого разделения — ключ ко всему дальнейшему.
Правило: данные — примеры для обучения, признаки — что описывает пример, модель — то, что учится связывать признаки с ответом. Хорошие данные и признаки решают всё.
🧠 Что такое признаки (features) в ML?