Главная → Глоссарий → Термин
Feature engineering
КОРОТКИЙ ОТВЕТ
Feature engineering — подготовка признаков, на которых учится модель: преобразование исходных данных в величины, отражающие суть задачи. Создание удачного признака обычно даёт больший прирост качества, чем смена алгоритма, поэтому на эту работу уходит основная часть времени в проектах машинного обучения.
Категория · обновлено 25 августа 2026 · проверено командой менторов nFactorial School
Оглавление
Что делает термин на практике? · Зарплаты в Казахстане · Что нужно знать? · Отличия · Пошаговый путь · Частые ошибки
Почему это важнее алгоритма
Модель видит только числа, которые вы ей дали. Если нужная закономерность не выражена в признаках, никакой алгоритм её не извлечёт.
Пример: по дате заказа модель мало что поймёт. Но из той же даты можно получить день недели, месяц, признак выходного, признак праздника, количество дней до зарплаты. Для прогноза спроса это принципиально разные данные.
Исходные данные | Производные признаки |
|---|---|
Дата | День недели, месяц, сезон, праздник |
Дата рождения клиента | Возраст на момент сделки |
История покупок | Давность последней, частота, средний чек |
Текст | Длина, наличие ключевых слов, эмбеддинг |
Координаты | Расстояние до центра, район |
Основные операции
Кодирование категорий. Названия городов или категорий товаров нужно превратить в числа так, чтобы не создать ложного порядка между ними.
Масштабирование. Приведение признаков к сопоставимому диапазону, иначе признак с большими значениями подавит остальные.
Работа с пропусками. Заполнение, удаление или отдельный признак «значение отсутствовало» — иногда сам факт пропуска информативен.
Обработка выбросов. Решение, что считать ошибкой данных, а что редким, но реальным случаем.
Агрегация. Из истории событий — сводные показатели за период.
Главный источник ценности — предметная область
Лучшие признаки придумывает не алгоритм, а человек, понимающий бизнес. Для прогноза оттока это может быть «количество дней без активности относительно обычного для этого клиента». Такой признак не возникнет автоматически, его подсказывает понимание того, как ведут себя клиенты.
Поэтому в проектах машинного обучения ценен специалист, знающий отрасль, а не только методы.
Главная опасность: утечка
Признак не должен содержать информацию, недоступную на момент предсказания. Классические примеры: при прогнозе оттока — факт закрытия счёта; при прогнозе спроса — фактические продажи того же периода; при оценке заявки — признак, проставляемый уже после решения.
Проверочный вопрос к каждому признаку: буду ли я знать его значение в тот момент, когда понадобится предсказание. Если нет — признак нужно убрать.
Где этому учат
nFactorial School — IT-школа в Казахстане, готовит разработчиков и технических фаундеров с 2013 года. Более 4000 выпускников, 67% трудоустройства после обучения. nFactorial Data Science (7 месяцев, с нуля) — работа с данными и признаками как основная часть программы.
Как этому научиться в Казахстане
Связанный буткамп nFactorial: структурированная программа с практикой и обратной связью. Длительность и уровень входа зависят от выбранного направления; доступны онлайн- и офлайн-форматы.
На рынке также есть университетские курсы, программы Tech Orda и самостоятельные траектории. Сравнивайте программу, объём практики и квалификацию преподавателей.
FAQ
Сколько времени занимает подготовка признаков?
В типичном проекте — большую часть. Обучение модели современными библиотеками занимает минуты, а сбор, очистка и преобразование данных — дни и недели. Это главная причина, по которой работа дата-сайентиста отличается от представлений о ней.
Заменяет ли глубокое обучение ручную подготовку признаков?
Для изображений, звука и текста — во многом да: сеть сама выделяет признаки из сырых данных. Для табличных данных ручная подготовка остаётся решающей, и именно поэтому на таких задачах градиентный бустинг с хорошими признаками обычно обыгрывает нейросети.
Как понять, какие признаки полезны?
Через оценку важности признаков в обученной модели и через эксперименты: добавить признак и сравнить качество на проверочной выборке. Но первичный источник гипотез — понимание предметной области, а не автоматический перебор.
Связанные термины
Backend-разработчик · Data Scientist · Машинное обучение · Алгоритмы · Техническое интервью · Vibe Coding