[UTC+3]

Что такое экономное дообучение и когда оно окупается

Зачем это знать

  • Понимать, за что берут деньги, когда предлагают «обучить модель под вашу компанию»
  • Оценить бюджет настройки заранее: часы одной видеокарты вместо суток кластера
  • Спрашивать подрядчика, что останется у компании после проекта — файл, выборка и протокол замера

Что такое экономное дообучение простыми словами

Серийный костюм шьют на усреднённую фигуру. В ателье его редко перекраивают целиком: подгоняют рукав, талию, длину. Ткань и крой остаются заводскими, работы — на пару часов.

С готовой моделью похоже. Внутри неё миллиарды числовых настроек — весов. Полное дообучение пересчитывает их все. Экономное замораживает основной массив и трогает порядка процента.

Результат ложится в отдельный файл — адаптер. Базовая модель остаётся нетронутой, адаптер подключают к ней при запуске. Считать нужно малую часть, хранить — тоже.

Полное дообучение
Экономное
Доля обучаемых весов
все
доли процента
Железо на прогон
несколько карт
одна карта
Что получается на выходе
копия модели, десятки ГБ
файл адаптера, десятки МБ
Смена задачи
отдельная копия модели
переключение адаптера
Откат неудачной версии
перезалить модель
отключить файл
Два способа настроить модель под свою задачу · Источник: открытые описания метода LoRA и адаптеров

Как это работает

  1. Базовую модель замораживают. Её веса при обучении не меняются, поэтому исходное качество никуда не девается и вернуться к нему можно в любой момент.
  2. Рядом пристраивают довесок. Самый распространённый способ — LoRA: к нужным слоям добавляют две небольшие таблицы чисел, и обучение идёт только по ним.
  3. Прогоняют размеченную выборку. Каждый пример — пара «вход и правильный ответ» в том виде, в каком ответ нужен в работе.
  4. Получают файл адаптера. Десятки мегабайт против десятков гигабайт у полной копии. Хранится в репозитории компании, версионируется как обычный файл.
  5. Подключают к базовой модели. Один развёрнутый экземпляр обслуживает несколько адаптеров под разные задачи: разбор актов, ответы поддержки, извлечение полей из накладных.

Запускать это можно только там, где к весам модели есть доступ. Значит, нужна модель с открытыми весами либо сервис поставщика с собственной функцией дообучения.

Шаг 1
Замер до
Отложенная выборка в 200–300 документов. Считают долю ответов, которые ушли в работу без правок
Шаг 2
Разметка
Сотни примеров «вход и эталонный ответ», размеченных по одному письменному правилу
Шаг 3
Прогон
Обучение адаптера на одной арендованной карте, несколько часов. Повторяется при смене выборки
Шаг 4
Замер после
Та же выборка, та же метрика, тот же человек-проверяющий. Разница и есть результат
Порядок работ по адаптеру

Пример из практики

Цифры ниже — расчётный ориентир для компании такого профиля, а не отчёт о внедрении. У каждой указано, что мерили и на каком объёме, чтобы расчёт можно было повторить на своих данных.

Профиль: сервисная компания, около 4 000 однотипных актов в месяц, из акта нужно вытащить двенадцать полей в жёстком формате. Первый подход обычно делают промптом: пишут инструкцию на пять-шесть страниц с примерами. Замер на отложенной выборке из 300 актов показывает долю полей, ушедших в учёт без ручной правки.

Дальше готовят выборку под адаптер. Тысяча-полторы проверенных актов — это порядка недели работы двух сотрудников, которые уже делают эту разметку руками каждый день. Прогон адаптера на одной арендованной карте занимает часы; часовой тариф берут из прайса своего облачного провайдера и умножают на число прогонов — их обычно три-четыре, пока подбирают настройки.

Повторный замер идёт по той же выборке и той же метрике. Прирост доли полей без правок на 8–15 пунктов — реалистичный порядок для узкой задачи с чистой разметкой. Проверяется он только собственным замером: на грязной разметке прироста не будет вовсе, и это выясняется за один прогон, а не за квартал.

Экономия появляется и на счёте за запросы. Пятистраничная инструкция уезжает в модель при каждом обращении; после адаптера часть правил живёт в весах, и её из промпта убирают. Порядок суммы для своего объёма прикидывают калькулятором бюджета.

Что это даёт бизнесу

  • Настройка становится расходом в часах, а не в месяцах. Прогон на одной карте планируется как обычная задача: известно железо, известна длительность, известно число попыток.
  • Одна модель обслуживает несколько отделов. Базовый экземпляр развёрнут один раз, адаптеры под разные процессы подключаются к нему по очереди. Железо не умножается на число задач.
  • Откат стоит одну минуту. Адаптер отключают, базовая модель отвечает как прежде. Риск «сломали то, что работало» снимается на уровне устройства.
  • Актив остаётся внутри компании. Размеченная выборка переживает и подрядчика, и саму модель: на новой базовой модели обучение повторяют по тем же данным.

Когда без этого можно обойтись

Если нужны свежие факты — прайс, остатки, действующая редакция регламента — задача решается поиском по документам. Веса переучивать под данные, которые меняются каждую неделю, дорого и бессмысленно. Разбор двух подходов есть в отдельном материале: дообучение или поиск по документам.

Не нужен адаптер и там, где объём мал. Несколько десятков документов в месяц дешевле проверять глазами: неделя разметки не окупится никогда.

Третий случай — закрытая модель по API без функции настройки. Тогда сначала выбирают модель с доступом к весам, и только потом планируют обучение.

Что важно проверить

Первое: качество разметки решает исход. Стандартный приём — отдать 5–10% выборки двум разметчикам сразу и посчитать, на какой доле примеров они сошлись. Свой порог задают по этому же замеру: получившаяся доля становится точкой отсчёта, а расхождения разбирают поштучно. Разошлись сильно — правило переписывают и размечают заново. Полдня на пятидесяти документах до старта — главный предохранитель проекта.

Второе: замер до и после делается на одной выборке, одной метрикой, с одинаковым проверяющим. Выборка откладывается заранее и в обучение не попадает. Иначе прирост окажется красивым на бумаге и пропадёт на живом потоке.

Третье: адаптер привязан к конкретной версии базовой модели. Поставщик обновил модель — адаптер прогоняют заново на той же выборке. Заложите эту работу в план на год, вместе с ответом на вопрос, кому принадлежат выборка и файл после сдачи проекта.

Frequently asked questions

Экономное дообучение простыми словами — это что?

Способ настроить готовую модель под свою задачу, обучив малую часть её внутренних настроек. Основной массив весов замораживают, рядом обучают небольшой довесок — адаптер. Он весит десятки мегабайт и подключается к базовой модели при запуске. Отсюда и цена: считать и хранить нужно малую часть.

Чем экономное дообучение отличается от полного

Полное пересчитывает все веса модели: нужен кластер видеокарт, а на выходе получается новая копия модели на десятки гигабайт. Экономное трогает порядка процента весов, обходится одной картой и даёт файл на десятки мегабайт. Под разные задачи держат несколько адаптеров и один общий экземпляр базовой модели.

Сколько примеров нужно для обучения адаптера

Для узкой задачи с одним форматом ответа хватает нескольких сотен проверенных примеров, для задачи с ветвлениями — нескольких тысяч. Решает не количество, а однородность: сто примеров, размеченных по одному правилу, дают больше, чем тысяча со спорной разметкой. Объём проверяют замером на отложенной выборке.

Что выбрать — адаптер или поиск по документам

Адаптер ставят там, где нужно закрепить формат, разметку полей, отраслевые формулировки и стиль ответа. Поиск по документам ставят там, где нужны свежие факты: прайс, остатки, редакция регламента. Эти два приёма складываются: адаптер отвечает за форму ответа, поиск подставляет содержание на сегодняшний день.

Что остаётся у компании после работы подрядчика

Три вещи: размеченная выборка, файл адаптера и протокол замера до и после. Выборка ценнее адаптера — по ней обучение повторяют на любой новой базовой модели. В договоре фиксируют, что все три передаются заказчику, и на какой версии базовой модели адаптер проверен.