Главная → Глоссарий → Термин
Train/test split
КОРОТКИЙ ОТВЕТ
Train/test split — разделение данных на обучающую и тестовую выборки. Модель учится только на первой, а качество измеряется на второй, которую она не видела. Без такого разделения оценка модели бессмысленна: она покажет, насколько хорошо модель запомнила примеры, а не насколько она работает на новых данных.
Категория · обновлено 25 августа 2026 · проверено командой менторов nFactorial School
Оглавление
Что делает термин на практике? · Зарплаты в Казахстане · Что нужно знать? · Отличия · Пошаговый путь · Частые ошибки
Три выборки, а не две
Выборка | Для чего | Доля |
|---|---|---|
Обучающая | Модель настраивает параметры | Большая часть |
Валидационная | Подбор гиперпараметров, сравнение вариантов | Небольшая |
Тестовая | Финальная честная оценка, используется один раз | Небольшая |
Валидационную часто пропускают, и зря. Если подбирать настройки модели, проверяя на тестовой выборке, вы постепенно подгоните модель под неё, и оценка перестанет быть честной. Тестовая выборка должна оставаться нетронутой до самого конца.
Как делить
Для обычных табличных данных — случайно, с фиксацией начального состояния генератора, чтобы результат воспроизводился.
Для несбалансированных классов — со стратификацией: доля редкого класса должна быть одинаковой во всех частях. Иначе в тесте может оказаться слишком мало примеров редкого класса, и оценка станет случайной.
Данные со временем — особый случай
Если задача связана с прогнозом будущего — спрос, отток, цены, — случайное разделение даёт обманчиво хорошие результаты. Модель обучается на данных, часть которых относится к более позднему периоду, чем тестовые. В реальности такой информации у неё не будет.
Правильный подход — разделение по времени: обучение на раннем периоде, проверка на позднем. Так воспроизводится реальная ситуация применения.
Частая ошибка: подготовка данных до разделения
Заполнение пропусков средними, масштабирование признаков и отбор признаков нужно выполнять после разделения, рассчитывая параметры только по обучающей части. Если посчитать среднее по всем данным сразу, информация из тестовой выборки просочится в обучение, и оценка окажется завышенной.
Это одна из самых распространённых незаметных ошибок у начинающих.
Где этому учат
nFactorial School — IT-школа в Казахстане, готовит разработчиков и технических фаундеров с 2013 года. Более 4000 выпускников, 67% трудоустройства после обучения. nFactorial Data Science (7 месяцев, с нуля) — корректная постановка эксперимента и оценка моделей.
Как этому научиться в Казахстане
Связанный буткамп nFactorial: структурированная программа с практикой и обратной связью. Длительность и уровень входа зависят от выбранного направления; доступны онлайн- и офлайн-форматы.
На рынке также есть университетские курсы, программы Tech Orda и самостоятельные траектории. Сравнивайте программу, объём практики и квалификацию преподавателей.
FAQ
В какой пропорции делить данные?
Распространённые варианты — около 70–80% на обучение и остальное на проверку. При большом объёме данных тестовой части может хватать и меньшей доли, а при малом лучше использовать кросс-валидацию вместо однократного разделения.
Можно ли использовать тестовую выборку несколько раз?
Формально да, но каждый раз, когда вы меняете модель по результатам теста, вы немного подгоняете её под него. После нескольких десятков таких итераций оценка перестаёт отражать реальное качество. Для подбора настроек нужна отдельная валидационная выборка.
Как делить данные временных рядов?
По времени, а не случайно: модель обучается на более раннем периоде и проверяется на более позднем. Случайное разделение позволяет модели «подсмотреть» будущее и даёт завышенную оценку, которая не воспроизводится в реальной работе.
Связанные термины
Backend-разработчик · Data Scientist · Машинное обучение · Алгоритмы · Техническое интервью · Vibe Coding