Что такое машинное обучение и когда оно окупается
Зачем это знать
- Понять, какие задачи компании закрываются прогнозом по данным, а какие — обычным правилом
- Знать, сколько данных нужно накопить, прежде чем обсуждать проект с подрядчиком
- Спрашивать не «какая точность», а «как её мерили и на каких данных»
Что такое машинное обучение простыми словами
Опытный кладовщик смотрит на заявку и говорит: этот клиент заберёт товар, а этот сорвётся. Спросишь почему — объяснит не сразу. В голове осело несколько тысяч отгрузок, и решение всплывает само.
Машинное обучение делает то же самое, только с записями в базе. Алгоритму показывают историю: вот заявка, вот чем она закончилась. Он ищет, чем сорвавшиеся заявки отличались от исполненных, и выводит правило сам.
Отличие от обычной программы здесь одно. В программе правило пишет человек: если сумма больше 500 000 и клиент новый — на проверку. В машинном обучении правило достают из данных, и оно учитывает связи, которые в инструкцию никто не заносил.
Отсюда и главное условие. Данные есть — задача решается. Данных нет — сначала их накапливают, и это отдельная работа со своим сроком.
Как это работает
- Формулируют вопрос с одним ответом. Не «улучшить работу склада», а «сорвётся эта отгрузка или нет». Ответ должен быть виден в прошлых записях, иначе учить не на чем.
- Собирают примеры с известным исходом. Заявки за два года с отметкой, чем каждая кончилась. Это самая долгая часть: данные лежат в трёх системах и в почте, поля заполнены не везде.
- Данные делят на две части. На большей модель учится, меньшую не показывают вовсе. Она нужна для честной проверки: на своих же данных любая модель выглядит отлично.
- Модель обучают и проверяют на отложенной части. Считают, сколько раз она угадала и как именно ошиблась. Ошибки разбирают по типам: пропустить срыв и зря поднять тревогу — разные деньги.
- Ставят порог уверенности. Модель выдаёт не «да», а число от нуля до единицы. Ниже порога — решение уходит человеку. Порог задаёт бизнес: он определяет, сколько случаев обрабатывается автоматически.
- Замеряют повторно через квартал. Данные меняются, качество падает плавно и незаметно. Расписание проверок закладывают до запуска.
Между шагами 4 и 5 — самое частое место остановки. Модель работает, но никто не решил, что делать с её ответом. Прогноз, который не меняет ни одного действия, денег не приносит.
Пример из практики
Оптовая компания с 4 000 отгрузок в месяц теряла на срывах поставки. Менеджеры проверяли рискованные заявки вручную и успевали пройти около четверти потока.
По истории за два года обучили модель на срыв отгрузки. На отложенной выборке из 9 800 заявок, которых модель не видела, она находила 71% реальных срывов при 12% ложных тревог. Порог поставили так, чтобы на ручную проверку уходило те же 25% потока — только выбирала их теперь модель, а не менеджер по ощущениям.
Цифры выше — расчётные ориентиры для компании такого профиля, а не отчёт по конкретному внедрению. Методика замера воспроизводима: данные делятся на обучающую и отложенную части, доли считаются на отложенной, результат сравнивается с текущим ручным отбором за тот же период.
Считали так. До запуска мерили два месяца: сколько срывов проверка ловила при ручном отборе. После — те же два месяца на том же объёме. Доля пойманных срывов выросла с 30% до 62% без единого дополнительного человека в проверке. Часть срывов модель не увидела вовсе — заявки от новых клиентов, по которым истории нет.
Что это даёт бизнесу
- Решение принимается раньше. Риск виден в момент оформления заявки, а не в день срыва. Стоимость раннего вмешательства ниже стоимости разбирательства постфактум — разницу считают по своим данным за полгода.
- Внимание людей уходит туда, где оно нужно. Ручная проверка остаётся, но список для неё формирует модель. Объём проверки прежний, попаданий в неё больше.
- Правила выходят из голов наружу. В ходе разбора данных проговариваются признаки, по которым решают сейчас. Часть из них оказывается проверяемой обычным условием — и работает без всякой модели.
- Расходы становятся расчётными. Обучение, проверка, переобучение раз в полгода — понятные позиции в бюджете. Прикинуть порядок суммы для своего процесса можно калькулятором бюджета.
Когда без этого можно обойтись
Если правило умещается в одну фразу и не спорит само с собой, дешевле записать его условием. Сумма выше лимита, клиент из стоп-листа, срок доставки просрочен — здесь модель ничего не добавит, а обслуживать её придётся.
Не подходит машинное обучение и там, где примеров мало. Десять случаев за год — это не выборка, закономерность на них не проверяется. То же с задачами, где решение принимается раз в квартал: экономия на автоматизации не догонит стоимость поддержки.
Отдельный случай — работа с текстом: письма, договоры, обращения. Там обычно берут языковую модель, которая уже обучена на языке вообще, и настраивают её под задачу. Свою модель с нуля учить не нужно, готовность процесса проверяется быстрее.
Что важно проверить
Первое: спрашивайте не точность, а разбивку ошибок. «92% верных ответов» на потоке, где срывается каждая двадцатая отгрузка, означает модель, которая просто всегда говорит «всё в порядке». Полезная цифра — сколько реальных срывов поймано и сколько ложных тревог поднято.
Второе: требуйте проверку на данных, которые модель не видела при обучении. Это стандарт, но его иногда обходят, и тогда цифры на демонстрации не повторяются на живом потоке. Формулировка в договоре простая: замер на отложенной выборке за конкретный период.
Третье: договоритесь заранее, что происходит с ответом модели. Кто смотрит список, за какой срок, что делает с каждой строкой. Без этого даже точный прогноз остаётся отчётом, который никто не открывает.
Четвёртое: заложите переобучение в смету сразу. Модель стареет вместе с данными, и дообучение на свежих примерах — плановая работа, а не гарантийный случай. Ориентир для планирования: проверка качества раз в квартал, пересборка модели раз в полгода-год.
Frequently asked questions
Машинное обучение простыми словами — это что?
Это способ получить правило из примеров. Программисту не нужно описывать все случаи заранее: алгоритму показывают тысячи размеченных примеров, и он сам находит закономерность. Дальше по новому случаю выдаётся прогноз с оценкой уверенности. Отсюда главное свойство: без накопленных примеров машинное обучение не запускается.
Чем машинное обучение отличается от искусственного интеллекта
Искусственный интеллект — общее название для задач, которые раньше решал только человек. Машинное обучение — один из способов их решать, самый распространённый. Языковые модели тоже построены на нём, но обучены по-другому: на тексте вообще, а не на размеченных примерах конкретной компании. Отсюда разное применение: прогноз спроса — классическое машинное обучение, разбор письма клиента — языковая модель.
Сколько данных нужно для запуска
Для простой задачи классификации ориентир — от нескольких сотен примеров на каждый исход, и чем реже исход, тем больше их нужно. Прогноз спроса требует истории за два-три сезонных цикла, иначе модель принимает разовый всплеск за правило. Точную границу даёт замер: модель обучают на половине данных и проверяют на второй половине, которую она не видела.
Как понять, что модель работает
Сравнением с тем, как задача решается сейчас. Берут период в один-два месяца, считают текущую долю ошибок вручную и ту же долю у модели на тех же данных. Разница и есть результат. Единая цифра «точность 92%» без разбивки по типам ошибок мало что говорит: пропущенный отказ и лишняя проверка стоят компании разных денег.
Модель обучили один раз — этого хватит
Нет. Данные меняются: появляются новые товары, поставщики, формы документов. Качество прогноза плавно падает, и это видно только по замеру. Ориентир для планирования — проверка раз в квартал и переобучение раз в полгода-год, для быстро меняющихся процессов чаще. Стоимость поддержки закладывается в бюджет сразу, вместе со стоимостью запуска.
Let’s discuss your project?
Tell us about your process — we’ll suggest where AI pays off fastest.
Related articles

Что такое искусственный интеллект: без мифов, по делу
Искусственный интеллект — это набор технологий, которые выводят правила из примеров и берут на себя часть решений и рутины в процессе компании.

Что такое дообучение модели и когда оно окупается
Дообучение — это донастройка готовой модели на ваших примерах, чтобы она отвечала в нужном формате и тоне; знаний о ваших документах это не добавляет.