[МСК]

Точка отсечки знаний — что это простыми словами

Зачем это знать

  • Понять, почему модель уверенно называет прошлогоднюю цену и старую редакцию регламента
  • Знать, какие процессы нельзя отдавать модели без подачи свежих документов
  • Спрашивать подрядчика, откуда система берёт актуальные данные, а не только какая модель внутри

Что такое точка отсечки знаний простыми словами

Справочник напечатали в марте. Всё, что случилось после марта, в него не попало — не потому, что редакция ленилась, а потому что типография не печатает будущее. Справочник этого не знает и на любой вопрос отвечает мартовскими данными.

Модель устроена так же. Обучение идёт на текстах, собранных до определённой даты. Эта дата и есть точка отсечки: граница между тем, что модель читала, и тем, чего не было в её мире.

Разница со справочником одна, и она важная. Справочник видно: на обложке стоит год издания. Модель год издания не показывает и на вопрос о вчерашнем событии отвечает так же гладко, как о позапрошлогоднем.

Шаг 1
Сбор данных заканчивается
Это и есть точка отсечки. Всё, что появилось в мире позже, в обучение уже не попадёт.
Шаг 2
Обучение и проверка
Занимают месяцы. Разрыв между отсечкой и релизом копится здесь.
Шаг 3
Выход модели
На старте модель уже отстаёт от календаря. Дата отсечки указана в описании поставщика.
Шаг 4
Эксплуатация
Отставание растёт каждый день. Модель работает год — разрыв вырос на год.
Откуда берётся разрыв между моделью и календарём

Как это работает

  1. Данные собирают до конкретного дня. В обучение уходят тексты, доступные на момент сбора. Позже сбор закрывают, и содержимое фундаментальной модели фиксируется.
  2. Модель обучают и проверяют. Это занимает месяцы. Разрыв между отсечкой и выходом модели закладывается здесь.
  3. Модель выпускают. С первого дня она отвечает по состоянию мира на дату отсечки, а не на дату вопроса.
  4. Разрыв растёт. Каждый месяц эксплуатации добавляет месяц к отставанию. Модель, проработавшая полтора года, отвечает по данным двухлетней давности.
  5. Свежее подают в запросе. Всё, что произошло после отсечки, модель узнаёт только из текста запроса: приложенного документа, найденной выдержки, поля из базы.

Отдельно про уверенность. Ответ по устаревшим данным звучит ровно так же, как ответ по актуальным: тем же тоном, с той же детализацией. Пометки «это ответ по памяти двухлетней давности» в нём нет. Поэтому граница проверяется не тоном, а тем, откуда пришли данные в конкретном ответе.

Пример из практики

Оптовая компания собиралась отдать модели ответы на вопросы менеджеров: условия отгрузки, актуальные скидки, сроки поставки по категориям. Прототип собрали на одной модели без подключения к базе — просто вопрос и ответ.

На проверочной выборке из полусотни вопросов картина разделилась. Общие вопросы — как считается отсрочка, что такое рамочный договор — модель разбирала верно. Вопросы про конкретные условия компании она тоже разбирала — уверенно и мимо, потому что этих условий в обучении не было и быть не могло.

Дальше прототип переделали: к каждому вопросу поиском подтягивали действующий прайс и текущую редакцию регламента, а модели оставляли работу по переданному тексту. Ту же выборку из пятидесяти вопросов прогнали заново, ответы сверял коммерческий директор. Методика замера простая и повторяемая: одна и та же выборка, один и тот же проверяющий, замер до и после.

Модель отвечает по памяти
Документы подаются в запрос
Источник ответа
данные до точки отсечки
действующий документ компании
Внутренние правила компании
в обучении их нет
подтягиваются поиском по базе
Проверяемость
источник ответа не виден
видно, какой документ использован
Реакция на пробел
ответ по памяти
правило отвечать «нет данных»
Что меняется, когда свежие данные подают в запрос

Что это даёт бизнесу

  • Задачи делятся на две стопки заранее. Устойчивые знания — язык, форматы, общие правила разбора — модель держит в себе. Всё, что меняется чаще раза в год, подаётся документом. Деление делается на бумаге за час и экономит недели пилота.
  • Проверка подрядчика становится конкретной. Вместо «какая у вас модель» задаётся вопрос «откуда система берёт данные, которых нет в обучении». Ответ либо есть, либо система будет уверенно отвечать устаревшим.
  • Смена модели перестаёт быть лотереей. Когда свежие данные приходят из базы, а не из памяти модели, замена движка не переписывает знания системы. Сравнить варианты помогает подбор решения.
  • Снимается класс ошибок с ценой. Ответ по прошлогоднему тарифу или отменённой редакции регламента стоит денег и репутации. Цену таких ошибок для своего процесса считают калькулятором.

Когда без этого можно обойтись

Есть задачи, где дата отсечки роли не играет. Перевод, вычитка, переформулировка письма, разбор приложенного документа на поля, суммаризация встречи — здесь модель работает с текстом, который ей дали, и собственные знания о мире почти не подключаются.

То же с задачами на устойчивых правилах: классификация обращений по типам, извлечение реквизитов, сортировка входящих по темам. Правила меняются редко, и годовой разрыв на них не сказывается.

Разница простая: если ответ целиком выводится из переданного текста, отсечка неважна. Если модель добирает что-то из памяти — важна всегда.

Что важно проверить

Первое: дата отсечки берётся из описания поставщика, а не из ответа самой модели. Модель называет свою дату по памяти и ошибается на месяцы — это тот же ответ по обучающим данным, что и любой другой.

Второе: устаревание неравномерно по областям. Правила деловой переписки за год не изменились, а тарифы, курсы, редакции нормативных актов и линейки моделей на рынке — изменились полностью. Проверять надо на вопросах из своей области, а не на общих.

Третье: подача документов в запрос лечит отсечку только там, где документ нашёлся. Если поиск вернул пустоту, модель по умолчанию ответит по памяти. Поэтому у системы должно быть явное правило отвечать «нет данных» — и его стоит проверить отдельным замером на вопросах, ответа на которые в базе заведомо нет.

Частые вопросы

Точка отсечки знаний простыми словами — это что?

Это дата последних данных, попавших в обучение модели. Всё, что произошло в мире позже, для модели не существует: она об этом не читала. На вопрос о более поздних событиях модель отвечает по состоянию на свою дату — и обычно не предупреждает, что дата прошла. Свежие сведения приходится подавать самим, прямо в запросе.

Чем отсечка отличается от даты выхода модели

Дата выхода — когда модель стала доступна. Точка отсечки — когда закончился сбор обучающих данных. Между ними обычно несколько месяцев: данные надо собрать, обучить на них модель, проверить и выпустить. Поэтому даже самая новая модель на старте уже отстаёт от календаря, и разрыв растёт каждый день её эксплуатации.

Почему модель не говорит, что чего-то не знает

Модель отвечает по своим данным и не сверяется с календарём. Если в обучении был закон в старой редакции, она уверенно пересказывает старую редакцию — формулировки при этом выглядят так же убедительно, как в верном ответе. Это частный случай [галлюцинации](/ru/blog/gallyutsinatsiya). Проверяется не спором с моделью, а подачей актуального документа в запрос.

Как узнать точку отсечки конкретной модели

Дата публикуется поставщиком в описании модели. Спрашивать саму модель ненадёжно: она называет дату по памяти и часто ошибается на месяцы. Практическая проверка — задать десяток вопросов о событиях известной давности в своей области и посмотреть, где ответы начинают устаревать. Замер повторяется при каждой смене модели.

Что делать с процессами, где важна свежесть

Актуальные документы подтягиваются к запросу поиском по своей базе — подход называется [RAG](/ru/blog/rag). Модель тогда отвечает по переданному тексту, а не по памяти. Второй слой — правило отвечать «нет данных», если нужного документа в выдаче не нашлось. Третий — дата обновления рядом с каждым документом в базе.