[UTC+3]

Эмбеддинг

Embedding

In short

Эмбеддинг — это способ записать текст числами так, чтобы близкие по смыслу фразы получили близкие числа.

Зачем это знать

  • Понять, почему поиск по документам компании работает «по смыслу», а не по совпадению слов
  • Понять, за что именно вы платите в счёте за ИИ и что можно удешевить
  • Различать, когда подрядчик предлагает нужное, а когда лишнее

Что такое эмбеддинг простыми словами

Представьте картотеку, где у каждого документа вместо названия — координаты на карте. Документы про отпуска легли в одном углу, про закупки — в другом, про технику безопасности — в третьем. Компьютер не читает текст: он смотрит, какие точки лежат рядом.

Эмбеддинг — это и есть такие координаты. Модель читает кусок текста и выдаёт список чисел, обычно от нескольких сотен до нескольких тысяч. Каждое число описывает какую-то грань смысла: о чём речь, в каком тоне, к какой области относится. Сами по себе эти числа человеку ничего не говорят — важно только расстояние между ними.

Дальше всё сводится к арифметике. Сотрудник спрашивает «как уйти без содержания», его вопрос тоже превращается в координаты, и система находит ближайшие точки. В ответ приходит пункт регламента про отпуск за свой счёт, хотя ни одно слово в запросе с ним не совпало.

Как это работает

  1. Документы режут на куски. Целый регламент на сто страниц в одну точку не превратишь — смысл размажется. Текст делят на фрагменты по несколько абзацев.
  2. Каждый кусок прогоняют через модель. На выходе — набор чисел для этого фрагмента.
  3. Числа складывают в отдельное хранилище — векторную базу. Рядом хранят исходный текст и метки: из какого документа, какая редакция, к какому подразделению относится.
  4. Вопрос пользователя превращают в такие же числа тем же способом.
  5. Ищут ближайшие фрагменты и отдают их модели, чтобы она составила ответ человеческим языком.

Ключевое требование: вопрос и документы должны переводиться в числа одной и той же моделью. Разные модели строят разные «карты», и координаты с одной карты бессмысленны на другой.

Пример из практики

В компании с распределёнными складами кладовщики искали ответы в трёхсотстраничном регламенте по приёмке. Поиск по словам не помогал: в документе написано «расхождение по количеству при приёмке», а спрашивают «что делать, если привезли меньше».

После перевода регламента в эмбеддинги средний поиск ответа сократился с шести минут до двадцати секунд. Побочный эффект оказался важнее скорости: перестали звонить старшему кладовщику по каждому спорному случаю, и у него освободилось около четырёх часов в неделю.

Что это даёт бизнесу

  • Поиск начинает работать так, как спрашивают люди, а не так, как написано в документе. Это снимает главную причину, по которой базы знаний не используют.
  • Ответы опираются на ваши документы, а не на общие знания модели. Это основа схемы, которую называют RAG.
  • Дёшево в эксплуатации. Перевод в числа делается один раз при загрузке документа, а не при каждом вопросе. Дорогая часть — ответы модели, а не поиск.

Когда без этого можно обойтись

Если документов мало и они хорошо структурированы — обычный поиск по словам справится дешевле и предсказуемее. Порядок величин такой: до нескольких десятков документов с понятными названиями городить векторный поиск незачем.

Не поможет эмбеддинг и там, где нужны точные совпадения: артикулы, номера договоров, коды ошибок. Поиск по смыслу как раз склонен подменять близким — вместо артикула 4517 найдёт 4519. В таких случаях делают гибрид: точный поиск по номерам плюс смысловой по описаниям.

И отдельно: противоречия и устаревшие редакции эмбеддинг не исправляет — поиск отвечает по тому, что лежит в хранилище. Поэтому список действующих документов составляют до загрузки, а не после первых жалоб: это несколько дней работы, которые окупаются сразу.

Что важно проверить

Качество зависит от модели. Та, что обучалась в основном на английском, хуже различает оттенки русского текста — особенно в юридических и технических формулировках. Проверять это нужно на своих документах и своих типичных вопросах, а не по рейтингам: у каждой компании свой язык, и лидер общего теста может проиграть на вашей специфике.

FAQ

Эмбеддинг простыми словами — это что?

Это перевод текста в набор чисел, который сохраняет смысл. Компьютер не понимает слов, зато умеет сравнивать числа. После такого перевода фразы «отпуск за свой счёт» и «уйти без содержания» оказываются рядом, хотя не совпадают ни одним словом.

Чем эмбеддинг отличается от вектора

Вектор — это просто список чисел, математический объект. Эмбеддинг — вектор, который получен из текста или картинки и несёт их смысл. Проще говоря, вектор это форма записи, а эмбеддинг — то, что в ней записано.

Сколько стоит перевести документы в эмбеддинги

Считают по объёму текста. Эта операция в разы дешевле, чем ответы модели: обычно разовый пересчёт всей базы документов средней компании стоит меньше, чем месяц её работы в продакшене. Точную цифру дают тарифы поставщика за миллион токенов.

Нужно ли отдавать документы наружу

Не обязательно. Модели для эмбеддингов бывают открытые и разворачиваются внутри контура компании. Тогда документы не покидают периметр, а платите вы не за токены, а за сервер.

Как часто нужно пересчитывать

При каждом изменении документа. Если регламент правят, а числа остались от старой версии, поиск будет уверенно отвечать по устаревшему тексту — и никто этого не заметит, пока не проверят вручную.