[UTC+3]

RAG

Retrieval-Augmented Generation

In short

RAG — это схема работы с ИИ, при которой система сначала находит нужный фрагмент в ваших документах, а потом составляет ответ по нему.

Зачем это знать

  • Понять, почему ответ ИИ можно проверить по ссылке на документ и на что при этом смотреть
  • Понять, за что вы платите ежемесячно и почему это дешевле, чем дообучение модели
  • Отличать случаи, где подрядчик решает задачу, от случаев, где он продаёт лишний объём работ

Что такое RAG простыми словами

Экзамен с открытой книгой устроен иначе, чем экзамен по памяти. Отвечающий сначала листает учебник, находит нужный параграф, кладёт палец на строчку — и только после этого говорит. Ошибиться он всё ещё может, зато проверяющий видит, откуда взят ответ.

RAG работает по тому же принципу. Языковая модель отвечает по памяти обучения. Ваших регламентов, договоров и прайсов там никогда не было. Она складывает правдоподобный текст и звучит одинаково уверенно в верном и в выдуманном случае. RAG вставляет перед ответом ещё один шаг — поиск.

Система находит в ваших документах несколько подходящих фрагментов, кладёт их прямо в запрос к модели и просит опираться только на них. Ответ приходит человеческим языком, а рядом стоит ссылка: пункт 4.2 такого-то регламента, редакция от такого-то числа.

Как это работает

  1. Документы загружают в хранилище. Текст режут на фрагменты по несколько абзацев и переводят в числа — эмбеддинги. Рядом сохраняют исходный текст и метки: документ, редакция, подразделение, уровень доступа.
  2. Вопрос сотрудника превращают в такие же числа и ищут ближайшие по смыслу фрагменты. На этом шаге отсекается всё, к чему у человека нет доступа.
  3. Из найденного отбирают лучшее — обычно от трёх до десяти кусков. Список просеивают ещё раз и отбрасывают то, что попало случайно: устаревшую редакцию, похожий пункт из чужого договора.
  4. Собирают запрос к модели. В него входят инструкция «отвечай только по тексту ниже», отобранные фрагменты и сам вопрос.
  5. Модель формулирует ответ и ставит рядом ссылки на фрагменты, по которым он собран.

Вся сложность сосредоточена на втором и третьем шаге. Когда нужный абзац лежит перед моделью, пересказ обычно выходит верным. Когда поиск принёс соседний пункт, ответ получится складным, уверенным и неверным — и заметит это только тот, кто откроет ссылку. Поэтому качество RAG измеряют по поиску, а не по красоте формулировок.

Отдельно договариваются, что система делает, когда подходящего фрагмента не нашлось. Правильное поведение — ответить «в документах этого нет» и передать вопрос человеку. Без такого условия модель заполнит пробел общими словами из обучения, и по виду ответа это будет незаметно.

Пример из практики

У оптовой компании отдел по работе с клиентами отвечал на вопросы по условиям поставки: около сорока действующих документов и примерно 900 обращений в месяц. Треть вопросов повторялась, но ответ каждый раз искали вручную — по почте, папкам и памяти коллег.

После запуска замерили две недели до и две недели после. Среднее время подготовки ответа сократилось с 11 до 3 минут. Доля обращений, где сотрудник справлялся без вопроса к коллеге, выросла с 55 до 82 процентов.

Ценнее скорости оказалась ссылка на пункт договора рядом с каждым ответом. Руководитель отдела перестал вычитывать все письма подряд и перешёл на выборочную проверку — примерно каждое десятое.

Часть обращений система не закрыла: вопросы, где условия согласуют с юристом, как шли к человеку, так и идут.

Что это даёт бизнесу

Обновление стоит одну загрузку файла. Поменялся прайс или регламент — систему не переучивают, старый документ заменяют новым, и со следующего вопроса ответы идут по актуальной редакции. Дообучение модели пришлось бы повторять целиком.

Ошибку можно поймать до того, как она ушла клиенту. Ссылка на источник превращает проверку в один клик. Это меняет режим контроля: сплошную вычитку заменяет выборочная, а спорные случаи разбираются по тексту документа.

Данные лежат отдельно от модели. Появилась модель дешевле или сильнее — её меняют, база документов остаётся. Если документы нельзя отдавать наружу, хранилище и поиск разворачивают внутри контура компании.

Счёт предсказуем. Платите за ответы модели и за хранение, обе величины считаются заранее — по числу обращений и объёму документов.

Когда без этого можно обойтись

Если документов десяток и они короткие, их дешевле вложить в запрос целиком. Контекстное окно крупных моделей вмещает сотни страниц. Поиск тут не нужен вовсе.

Если задача не касается ваших документов — черновик письма, перевод, разбор входящего текста — RAG ничего не добавит, только удорожит каждый ответ.

Если данные лежат в учётной системе строгими полями — остатки, цены, статусы заказов, — нужен обычный запрос к базе. Поиск по смыслу здесь мешает: он склонен подменять точное значение похожим.

Что важно проверить

Права доступа проверяют на этапе поиска, до того как фрагмент попадёт к модели. Иначе система однажды перескажет сотруднику документ, который ему не положен, и следов в логах почти не останется.

Отдельно проверяют дубли и редакции. Две версии одного регламента в хранилище означают, что рано или поздно ответ придёт по отменённой. Перед запуском полезно составить список того, что удалено и что действует, — эту работу почти всегда недооценивают по срокам.

Ещё до старта назначают, кто отвечает за содержимое хранилища: чьи файлы туда попадают, кто подтверждает, что редакция действующая, и за какой срок изменение доезжает до системы. Без такого хозяина база устаревает за пару кварталов, а ответы продолжают идти уверенным тоном по прошлогодним правилам.

И последнее: если от системы хотят не знания документов, а другую манеру ответа — формат, тон, структуру, — это задача дообучения, и решается она иначе. Эти два способа регулярно путают, а стоят они по-разному.

FAQ

RAG простыми словами — это что?

Порядок работы, при котором система сначала ищет нужный кусок текста в ваших документах, отдаёт его модели и просит ответить только по нему. Модель перестаёт вспоминать и начинает пересказывать найденное. Рядом с ответом остаётся ссылка на исходный пункт: сотрудник открывает её и за полминуты сверяет ответ с документом.

Чем RAG отличается от дообучения

Дообучение перестраивает саму модель под ваши данные: это отдельный проект, и ради новой редакции регламента его приходится повторять. RAG оставляет модель нетронутой и подкладывает нужный текст в момент вопроса. Обновление сводится к замене файла в хранилище, а источник ответа виден пользователю.

Убирает ли RAG галлюцинации

Сокращает их долю, но не обнуляет. Модель выдумывает реже, когда нужный абзац лежит перед ней. Зато ошибки переезжают в поиск: система нашла соседний пункт или старую редакцию — ответ будет уверенным и неправильным. Отсюда правило: плохой поиск даёт плохой ответ при любой модели.

Сколько стоит запустить RAG

Техника считается по прайсу: хранилище документов, перевод текста в числа и оплата ответов модели по числу обращений. Дороже обходится подготовка: свести редакции, убрать дубли, разметить, к какому подразделению что относится. Этот этап обычно и определяет срок проекта, потому что делают его люди, знающие содержание документов.

Как понять, что RAG работает плохо

Собрать 50–100 реальных вопросов сотрудников с заранее известными правильными ответами и прогнать их через систему. Смотрят две цифры: долю верных ответов и долю случаев, когда нашёлся нужный документ. Замер повторяют после каждого изменения. Без такой выборки о качестве судят по ощущениям, а просадку замечают через месяцы.