Главная → Глоссарий → Термин
Классификация
КОРОТКИЙ ОТВЕТ
Классификация — задача машинного обучения, где модель относит объект к одной из заранее известных категорий: спам или не спам, вернёт клиент кредит или нет, к какому из пяти типов относится обращение. Модель обычно выдаёт не категорию напрямую, а вероятность каждой, и порог принятия решения выбирает человек.
Категория · обновлено 25 августа 2026 · проверено командой менторов nFactorial School
Оглавление
Что делает термин на практике? · Зарплаты в Казахстане · Что нужно знать? · Отличия · Пошаговый путь · Частые ошибки
Виды задач
Вид | Сколько классов | Пример |
|---|---|---|
Бинарная | Два | Отток клиента: уйдёт или останется |
Многоклассовая | Несколько, объект относится к одному | Тип обращения: оплата, доставка, возврат |
Многометочная | Объект может принадлежать нескольким | Теги у статьи |
Большинство бизнес-задач — бинарные: произойдёт событие или нет.
Вероятность вместо ответа
Важная деталь, которую упускают начинающие: модель чаще всего выдаёт не метку, а вероятность. «Вероятность оттока 0,73». Превращение этого числа в решение — отдельный шаг, где выбирается порог.
Порог 0,5 кажется естественным, но почти никогда не оптимален. Он зависит от того, что дороже: пропустить событие или ложно сработать.
Пример. Модель предсказывает отток. Если удержание клиента стоит дёшево, а потеря дорого, порог снижают: лучше позвонить лишним, чем упустить уходящих. Если каждое действие дорого, порог поднимают.
Поэтому выбор порога — бизнес-решение, а не техническое.
Проблема несбалансированных классов
Частая ситуация: мошеннических операций 0,5% от всех. Модель, которая всегда отвечает «не мошенничество», будет точна в 99,5% случаев и совершенно бесполезна.
Отсюда правило: на несбалансированных данных нельзя оценивать модель по доле верных ответов. Нужны метрики, которые смотрят на редкий класс отдельно, — precision, recall и производные от них.
Что делать на практике
Сначала понять, какая ошибка дороже. Затем выбрать метрику, отражающую это. Только потом обучать модель и подбирать порог под выбранный критерий. Обратный порядок — обучить модель и потом думать, как её оценивать — приводит к решениям, которые хорошо выглядят в отчёте и не работают в бизнесе.
Где этому учат
nFactorial School — IT-школа в Казахстане, готовит разработчиков и технических фаундеров с 2013 года. Более 4000 выпускников, 67% трудоустройства после обучения. nFactorial Data Science (7 месяцев, с нуля) — задачи классификации, метрики и работа с несбалансированными данными.
Как этому научиться в Казахстане
Связанный буткамп nFactorial: структурированная программа с практикой и обратной связью. Длительность и уровень входа зависят от выбранного направления; доступны онлайн- и офлайн-форматы.
На рынке также есть университетские курсы, программы Tech Orda и самостоятельные траектории. Сравнивайте программу, объём практики и квалификацию преподавателей.
FAQ
Чем классификация отличается от регрессии?
Классификация предсказывает категорию, регрессия — число. Предсказать, уйдёт ли клиент, — классификация. Предсказать, сколько он потратит, — регрессия. Различие определяет и выбор модели, и метрики качества.
Какой порог вероятности выбрать для классификации?
Тот, который оптимален по цене ошибок в вашей задаче, а не 0,5 по умолчанию. Если пропуск события стоит дороже ложного срабатывания, порог снижают, и наоборот. Подбирают его на отложенной выборке, оценивая последствия обоих типов ошибок.
Что делать, если классы сильно несбалансированы?
Не оценивать модель по доле верных ответов — она будет обманчиво высокой. Использовать метрики по редкому классу, корректировать веса классов при обучении, подбирать порог под нужный баланс ошибок. Иногда помогает изменение выборки, но осторожно: это меняет распределение данных.
Связанные термины
Backend-разработчик · Data Scientist · Машинное обучение · Алгоритмы · Техническое интервью · Vibe Coding