RAG
Retrieval-Augmented Generation
RAG — это схема работы с ИИ, при которой система сначала находит нужный фрагмент в ваших документах, а потом составляет ответ по нему.
Зачем это знать
- Понять, почему ответ ИИ можно проверить по ссылке на документ и на что при этом смотреть
- Понять, за что вы платите ежемесячно и почему это дешевле, чем дообучение модели
- Отличать случаи, где подрядчик решает задачу, от случаев, где он продаёт лишний объём работ
Что такое RAG простыми словами
Экзамен с открытой книгой устроен иначе, чем экзамен по памяти. Отвечающий сначала листает учебник, находит нужный параграф, кладёт палец на строчку — и только после этого говорит. Ошибиться он всё ещё может, зато проверяющий видит, откуда взят ответ.
RAG работает по тому же принципу. Языковая модель отвечает по памяти обучения. Ваших регламентов, договоров и прайсов там никогда не было. Она складывает правдоподобный текст и звучит одинаково уверенно в верном и в выдуманном случае. RAG вставляет перед ответом ещё один шаг — поиск.
Система находит в ваших документах несколько подходящих фрагментов, кладёт их прямо в запрос к модели и просит опираться только на них. Ответ приходит человеческим языком, а рядом стоит ссылка: пункт 4.2 такого-то регламента, редакция от такого-то числа.
Как это работает
- Документы загружают в хранилище. Текст режут на фрагменты по несколько абзацев и переводят в числа — эмбеддинги. Рядом сохраняют исходный текст и метки: документ, редакция, подразделение, уровень доступа.
- Вопрос сотрудника превращают в такие же числа и ищут ближайшие по смыслу фрагменты. На этом шаге отсекается всё, к чему у человека нет доступа.
- Из найденного отбирают лучшее — обычно от трёх до десяти кусков. Список просеивают ещё раз и отбрасывают то, что попало случайно: устаревшую редакцию, похожий пункт из чужого договора.
- Собирают запрос к модели. В него входят инструкция «отвечай только по тексту ниже», отобранные фрагменты и сам вопрос.
- Модель формулирует ответ и ставит рядом ссылки на фрагменты, по которым он собран.
Вся сложность сосредоточена на втором и третьем шаге. Когда нужный абзац лежит перед моделью, пересказ обычно выходит верным. Когда поиск принёс соседний пункт, ответ получится складным, уверенным и неверным — и заметит это только тот, кто откроет ссылку. Поэтому качество RAG измеряют по поиску, а не по красоте формулировок.
Отдельно договариваются, что система делает, когда подходящего фрагмента не нашлось. Правильное поведение — ответить «в документах этого нет» и передать вопрос человеку. Без такого условия модель заполнит пробел общими словами из обучения, и по виду ответа это будет незаметно.
Пример из практики
У оптовой компании отдел по работе с клиентами отвечал на вопросы по условиям поставки: около сорока действующих документов и примерно 900 обращений в месяц. Треть вопросов повторялась, но ответ каждый раз искали вручную — по почте, папкам и памяти коллег.
После запуска замерили две недели до и две недели после. Среднее время подготовки ответа сократилось с 11 до 3 минут. Доля обращений, где сотрудник справлялся без вопроса к коллеге, выросла с 55 до 82 процентов.
Ценнее скорости оказалась ссылка на пункт договора рядом с каждым ответом. Руководитель отдела перестал вычитывать все письма подряд и перешёл на выборочную проверку — примерно каждое десятое.
Часть обращений система не закрыла: вопросы, где условия согласуют с юристом, как шли к человеку, так и идут.
Что это даёт бизнесу
Обновление стоит одну загрузку файла. Поменялся прайс или регламент — систему не переучивают, старый документ заменяют новым, и со следующего вопроса ответы идут по актуальной редакции. Дообучение модели пришлось бы повторять целиком.
Ошибку можно поймать до того, как она ушла клиенту. Ссылка на источник превращает проверку в один клик. Это меняет режим контроля: сплошную вычитку заменяет выборочная, а спорные случаи разбираются по тексту документа.
Данные лежат отдельно от модели. Появилась модель дешевле или сильнее — её меняют, база документов остаётся. Если документы нельзя отдавать наружу, хранилище и поиск разворачивают внутри контура компании.
Счёт предсказуем. Платите за ответы модели и за хранение, обе величины считаются заранее — по числу обращений и объёму документов.
Когда без этого можно обойтись
Если документов десяток и они короткие, их дешевле вложить в запрос целиком. Контекстное окно крупных моделей вмещает сотни страниц. Поиск тут не нужен вовсе.
Если задача не касается ваших документов — черновик письма, перевод, разбор входящего текста — RAG ничего не добавит, только удорожит каждый ответ.
Если данные лежат в учётной системе строгими полями — остатки, цены, статусы заказов, — нужен обычный запрос к базе. Поиск по смыслу здесь мешает: он склонен подменять точное значение похожим.
Что важно проверить
Права доступа проверяют на этапе поиска, до того как фрагмент попадёт к модели. Иначе система однажды перескажет сотруднику документ, который ему не положен, и следов в логах почти не останется.
Отдельно проверяют дубли и редакции. Две версии одного регламента в хранилище означают, что рано или поздно ответ придёт по отменённой. Перед запуском полезно составить список того, что удалено и что действует, — эту работу почти всегда недооценивают по срокам.
Ещё до старта назначают, кто отвечает за содержимое хранилища: чьи файлы туда попадают, кто подтверждает, что редакция действующая, и за какой срок изменение доезжает до системы. Без такого хозяина база устаревает за пару кварталов, а ответы продолжают идти уверенным тоном по прошлогодним правилам.
И последнее: если от системы хотят не знания документов, а другую манеру ответа — формат, тон, структуру, — это задача дообучения, и решается она иначе. Эти два способа регулярно путают, а стоят они по-разному.
FAQ
RAG простыми словами — это что?
Порядок работы, при котором система сначала ищет нужный кусок текста в ваших документах, отдаёт его модели и просит ответить только по нему. Модель перестаёт вспоминать и начинает пересказывать найденное. Рядом с ответом остаётся ссылка на исходный пункт: сотрудник открывает её и за полминуты сверяет ответ с документом.
Чем RAG отличается от дообучения
Дообучение перестраивает саму модель под ваши данные: это отдельный проект, и ради новой редакции регламента его приходится повторять. RAG оставляет модель нетронутой и подкладывает нужный текст в момент вопроса. Обновление сводится к замене файла в хранилище, а источник ответа виден пользователю.
Убирает ли RAG галлюцинации
Сокращает их долю, но не обнуляет. Модель выдумывает реже, когда нужный абзац лежит перед ней. Зато ошибки переезжают в поиск: система нашла соседний пункт или старую редакцию — ответ будет уверенным и неправильным. Отсюда правило: плохой поиск даёт плохой ответ при любой модели.
Сколько стоит запустить RAG
Техника считается по прайсу: хранилище документов, перевод текста в числа и оплата ответов модели по числу обращений. Дороже обходится подготовка: свести редакции, убрать дубли, разметить, к какому подразделению что относится. Этот этап обычно и определяет срок проекта, потому что делают его люди, знающие содержание документов.
Как понять, что RAG работает плохо
Собрать 50–100 реальных вопросов сотрудников с заранее известными правильными ответами и прогнать их через систему. Смотрят две цифры: долю верных ответов и долю случаев, когда нашёлся нужный документ. Замер повторяют после каждого изменения. Без такой выборки о качестве судят по ощущениям, а просадку замечают через месяцы.
Need to apply it?
Tell us about your process — we will say where this technology pays off and where it does not.
Related terms
Updated: 26 июля 2026