[МСК]

Что такое глубокое обучение и где оно даёт выгоду

14 сентября 2026 · 4 минОсновыПростыми словами

Зачем это знать

  • Понимать, за что именно выставят счёт: за разметку данных, за часы обучения или за каждый прогон модели
  • Отличать задачу, где хватит написанных правил, от задачи, где нужны примеры
  • Спрашивать подрядчика метрику качества и выборку, на которой её мерили

Что такое глубокое обучение простыми словами

Приёмка на складе устроена в несколько столов. На первом смотрят на коробку целиком: цела ли, того ли размера. На втором читают наклейку. На третьем сверяют с накладной. На каждый стол приходит вывод предыдущего.

Нейросеть с глубоким обучением устроена похоже. Слоёв в ней десятки, иногда сотни. Ранние ловят простое: края, штрихи, частые сочетания букв. Поздние собирают из этого подпись, печать, смысл фразы.

Разница со складом одна. Инструкцию для каждого стола никто не пишет словами. Её подбирают по примерам с известными ответами — тысячам, а при обучении с нуля миллионам.

Отсюда и слово «глубокое». Оно про количество слоёв, а не про глубину мысли.

Как это работает

  1. Собирают примеры с ответами. Тысяча сканов накладных, у каждой руками проставлены нужные поля. Это размеченные данные, и обычно они дороже всего остального в проекте.
  2. Пропускают пример через слои. Модель выдаёт свой вариант ответа. На старте он случайный.
  3. Считают ошибку и правят коэффициенты. Отклонение от верного ответа возвращают назад по слоям, каждый слой сдвигает свои числа в сторону меньшей ошибки. Это и есть обучение.
  4. Повторяют много раз. Здесь уходят часы видеокарт и деньги за их аренду.
  5. Проверяют на отложенной выборке. Часть примеров прячут от обучения заранее. Качество считают только на них: на своих данных модель покажет результат лучше настоящего.

Обучать с нуля сегодня приходится редко. Берут готовую предобученную модель и дообучают её под свою задачу. Порядок объёма падает с миллионов примеров до сотен, вместе с ним падает и счёт.

Шаг 1
Разметка
Примеры с проставленными верными ответами. Самая дорогая часть проекта
Шаг 2
Прогон
Пример проходит через слои, модель выдаёт свой вариант
Шаг 3
Правка весов
Ошибку возвращают назад по слоям, коэффициенты сдвигаются
Шаг 4
Проверка
Качество считают на отложенной выборке, которую модель не видела
Что происходит при обучении

Пример из практики

Приёмка накладных в торговой компании. Часть документов приходит сканами: печать легла на графу с количеством, скан под углом, часть строк вписана от руки. Правила по координатам полей здесь ломаются на первой же новой форме поставщика.

Задача решается моделью, обученной на размеченных сканах. Разметку делают руками: берут документы за прошедший квартал и проставляют поля. Дальше считают долю документов, прошедших без правок оператора.

Методика замера одна для всех таких проектов. Выборку в несколько сотен сканов откладывают до обучения и не трогают. Качество на ней сверяют с тем же показателем у людей за тот же период. Порог задаёт бизнес: например, доля документов на ручную проверку не выше названной цифры. Ниже порога систему не включают на весь поток.

Что это даёт бизнесу

  • Закрываются задачи, для которых нет правил. Распознавание кривого скана, разбор свободного текста заявки, сортировка обращений по смыслу — везде, где признак словами не описать, глубокое обучение работает там, где написанные условия бессильны.
  • Качество растёт вместе с данными. Накопленный архив документов и переписки превращается в актив: каждая новая тысяча размеченных примеров поднимает точность, и рост этот измерим.
  • Порог входа стал ниже. Предобученные модели снимают самую дорогую часть — обучение с нуля. Остаётся дообучение на своих примерах и аренда вычислений на часы, а не на месяцы.
  • Расходы становятся расчётными. Разметка считается в человеко-часах, обучение — в часах видеокарт, эксплуатация — в прогонах модели. Все три статьи оцениваются до старта.
Правила, написанные руками
Глубокое обучение
Откуда берётся логика
аналитик описывает условия словами
модель подбирает их по размеченным примерам
Главный расход
часы аналитика и программиста
разметка данных и аренда видеокарт
Новая форма документа
правила дописывают руками
добавляют примеры и дообучают
Объяснимость решения
видно, какое условие сработало
виден ответ и уверенность, разбор причины сложнее
Где выигрывает
структурные данные, строгие регламенты
сканы, речь, свободный текст, картинки
Что меняется при переходе от правил к обучению на примерах

Когда без этого можно обойтись

Данные уже структурированы — глубокое обучение не нужно. Выгрузка из учётной системы, где поля разложены по колонкам, обрабатывается обычным кодом быстрее, дешевле и с понятным результатом.

Правил мало и они стабильны — их проще записать условиями. Такой процесс работает годами без переобучения и не требует ни разметки, ни видеокарт.

Задач в месяц десятки — экономия не покроет разметку. Готовность конкретного процесса к автоматизации удобно прикинуть чек-листом до начала разговоров с подрядчиками.

Что важно проверить

Первое: на какой выборке мерили качество. Цифра, полученная на данных, которые модель видела при обучении, всегда завышена. Просите отложенную выборку, её объём и период, из которого она взята.

Второе: сколько стоит разметка. Она редко попадает в первое коммерческое предложение, а по факту съедает заметную часть бюджета. Считается просто: число примеров умножить на минуты на документ и на ставку разметчика.

Третье: что происходит при появлении новой формы или нового типа обращения. У обученной модели должен быть описанный порядок дообучения, иначе через полгода качество поплывёт, и починить это будет нечем.

Частые вопросы

Глубокое обучение простыми словами — это что?

Это обучение нейросети из многих слоёв на готовых примерах с ответами. Ранние слои ловят простое: края, штрихи, частые сочетания букв. Поздние собирают из этого подпись, печать или смысл фразы. Правила для слоёв подбираются автоматически по данным, человек задаёт только задачу и примеры.

Чем глубокое обучение отличается от машинного обучения

Глубокое обучение — часть машинного обучения, где слоёв много и признаки модель находит сама. В классическом машинном обучении признаки готовит человек: длина документа, сумма, число строк. Там, где признаки легко перечислить, классические методы дешевле и понятнее. Там, где признак словами не описать, выигрывают глубокие модели.

Сколько примеров нужно, чтобы обучить модель

Обучение с нуля требует миллионов примеров и месяцев расчётов на дорогих видеокартах. Под задачу компании чаще берут готовую предобученную модель и дообучают её. Порядок объёма — сотни и тысячи размеченных примеров по каждому классу. Точную цифру даёт замер: обучают на растущей выборке и смотрят, на каком объёме качество перестаёт расти.

За что платят в проекте с глубоким обучением

Три статьи расходов. Разметка данных — оплачивается человеко-часами разметчиков. Обучение — аренда видеокарт за часы расчётов. Эксплуатация — счёт за каждый прогон модели на живом потоке. Разметка обычно самая крупная и самая недооценённая часть, и её объём стоит посчитать до старта.

Обязательно ли обучать свою модель

Нет. Большая часть задач с текстом закрывается готовой моделью через обращение к поставщику по сети, без обучения вовсе. Своё обучение оправдано там, где данные нельзя выносить наружу, где задача узкая и повторяется тысячи раз в месяц или где готовые модели уже проверены и качества не дают.