Что дообучение меняет в модели на самом деле

Fine-tuning и кастомизация моделей · Урок 1 / 20

Сдвиг распределения, а не загрузка знаний

Дообучение выглядит как «показать модели наши материалы», но механически это другое. Модель предсказывает следующий токен и выдаёт распределение вероятностей по словарю. Обучение на ваших парах «вход — ответ» сдвигает это распределение так, чтобы токены ваших ответов становились вероятнее в ваших контекстах. Никакой отдельной ячейки, куда кладут факт, в модели нет: изменение размазано по весам и проявляется как склонность отвечать определённым образом.

Отсюда следует всё остальное. Форма — длина ответа, структура, порядок разделов, терминология, тон, отказ от вступлений — переносится хорошо, потому что это статистическая привычка, повторённая в сотнях примеров. Факт переносится плохо, потому что он встречается один раз и должен воспроизводиться точно. Модель после дообучения не отличает выученное от достроенного и не может сослаться на источник — у неё нет источника.

Что переносится, а что нет

  • Формат вывода. Стабильная структура ответа, набор полей, порядок блоков. Переносится надёжнее всего.
  • Стиль и регистр речи. Сухой протокольный тон вместо развёрнутого, обращение на «вы», отсутствие извинений.
  • Тип задачи. Разметка обращения по вашей таксономии, извлечение сущностей по вашим правилам, переписывание текста по вашему стандарту.
  • Границы поведения. Когда отвечать, когда переспрашивать, когда отказываться и какой формулировкой.
  • Факты и цифры. Переносятся ненадёжно: тарифы, даты, имена, номера пунктов регламента модель воспроизводит приблизительно и уверенно.

Проверка на пригодность за одну минуту

Возьмите желаемый ответ и спросите: если бы человек знал только вопрос и ваш свод правил, но не имел доступа к базе, смог бы он написать этот ответ? Если да — задача про форму, дообучение подходит. Если для ответа нужно посмотреть значение в таблице или прочитать документ — это задача про знания, и её решает подача данных в контекст.

вопрос: «Верните деньги за заказ 4471»
──────────────────────────────────────
что берётся из контекста: статус заказа, сумма, срок возврата
что даёт дообучение:      порядок блоков ответа, тон, отсутствие лишних
                          извинений, обязательное указание срока
──────────────────────────────────────
дообучение без контекста → правдоподобная сумма, выдуманный срок

Почему это не спор о терминах

Различие «форма против фактов» определяет бюджет проекта. Форма стабильна: собрали пятьсот примеров, обучили, работает месяцами. Факты меняются: каждое изменение тарифа требует нового цикла сбора данных, обучения, оценки и выкатки. Команды, начавшие дообучать ради знаний, обычно обнаруживают это на третьем цикле переобучения, потратив квартал.

Инсайт. Дообучение сжимает промпт. То, что вы объясняли моделью на две тысячи токенов инструкций в каждом запросе, после обучения занимает ноль токенов — правило переехало в веса. При большом объёме вызовов это и есть основной денежный эффект, а не рост качества.
Частая ошибка. Ждать, что модель «запомнит документацию». После обучения на тексте документации модель начнёт говорить в её стиле и уверенно называть несуществующие разделы. Стиль вы получите, точность — нет.
Про-совет. Прежде чем собирать данные, выпишите десять реальных ответов, которых вы хотите, и подчеркните в них всё, что нельзя вывести из вопроса. Если подчёркнутого много, проект в этой постановке провалится, и лучше узнать это до разметки.

Шпаргалка

  • Дообучение сдвигает распределение вероятностей, а не добавляет память.
  • Форма, тон, структура и тип задачи переносятся; факты — нет.
  • Проверка: можно ли написать ответ, зная только правила и вопрос.
  • Основная экономия от дообучения — короткий промпт, а не скачок качества.
1. Почему факты переносятся в веса хуже, чем формат ответа?
2. В чём состоит минутная проверка пригодности задачи для дообучения?
3. Какой денежный эффект от дообучения проявляется на большом объёме вызовов?

🔒 Ответьте на вопрос верно, чтобы перейти к следующему уроку.

Что дообучение меняет в модели на самом деле — Fine-tuning и кастомизация моделей — Skilvy