Главная → Глоссарий → Термин
F1-score
КОРОТКИЙ ОТВЕТ
F1-score — метрика, объединяющая precision и recall в одно число через их гармоническое среднее. Она высока только когда обе составляющие достаточно велики: если одна близка к нулю, F1 тоже близок к нулю. Используется, когда нужно сравнить модели одним показателем при несбалансированных классах.
Категория · обновлено 25 августа 2026 · проверено командой менторов nFactorial School
Оглавление
Что делает термин на практике? · Зарплаты в Казахстане · Что нужно знать? · Отличия · Пошаговый путь · Частые ошибки
Почему гармоническое среднее
Обычное среднее сгладило бы перекос. Модель с precision 1,0 и recall 0,02 имела бы среднее 0,51 — выглядит прилично, хотя модель находит два случая из ста.
Гармоническое среднее так не работает: оно тянется к меньшему из значений. В том же примере F1 составит около 0,04, что честно отражает бесполезность модели.
Precision | Recall | Обычное среднее | F1 |
|---|---|---|---|
1,00 | 0,02 | 0,51 | 0,04 |
0,80 | 0,70 | 0,75 | 0,75 |
0,50 | 0,50 | 0,50 | 0,50 |
Из таблицы видно: F1 близок к обычному среднему, когда составляющие сбалансированы, и резко падает при перекосе.
Когда применять
Когда нужно одно число для сравнения моделей или для автоматического подбора настроек, а классы несбалансированы. Это основной сценарий: при подборе гиперпараметров нужна одна целевая величина, и F1 подходит лучше доли верных ответов.
Когда не применять
Когда цена ошибок разная. F1 считает precision и recall равнозначными, а в реальных задачах это почти никогда не так. В медицинской диагностике пропуск заболевания и ложная тревога несопоставимы по последствиям.
В таких случаях используют взвешенные варианты метрики, которые позволяют задать, во сколько раз одна составляющая важнее другой, либо оптимизируют напрямую бизнес-показатель: стоимость ошибок в деньгах.
Многоклассовый случай
При нескольких классах F1 считают для каждого отдельно, а затем усредняют. Способ усреднения меняет смысл: усреднение по классам без учёта их размера даёт равный вес редким и частым классам, усреднение с учётом размера — наоборот.
Для несбалансированных задач первый вариант информативнее: иначе качество на крупном классе замаскирует провал на редком.
Главное предостережение
F1 — удобный инструмент сравнения, а не цель. Модель с F1 0,82 не обязательно полезнее модели с 0,79: всё зависит от того, как распределены ошибки и сколько они стоят. Перед финальным решением стоит посмотреть матрицу ошибок и перевести её в деньги или в часы работы.
Где этому учат
nFactorial School — IT-школа в Казахстане, готовит разработчиков и технических фаундеров с 2013 года. Более 4000 выпускников, 67% трудоустройства после обучения. nFactorial Data Science (7 месяцев, с нуля) — метрики качества и их выбор под задачу.
Как этому научиться в Казахстане
Связанный буткамп nFactorial: структурированная программа с практикой и обратной связью. Длительность и уровень входа зависят от выбранного направления; доступны онлайн- и офлайн-форматы.
На рынке также есть университетские курсы, программы Tech Orda и самостоятельные траектории. Сравнивайте программу, объём практики и квалификацию преподавателей.
FAQ
Какой F1-score считается хорошим?
Абсолютного порога нет: значение зависит от сложности задачи и баланса классов. Сравнивать нужно с простой базовой моделью и с текущим процессом. F1 0,6 может быть отличным результатом в сложной задаче и слабым в простой.
Когда F1 лучше доли верных ответов?
При несбалансированных классах. Доля верных ответов на редком событии обманчиво высока и не отражает полезность модели. F1 учитывает качество именно по целевому классу.
Чем F1 отличается от ROC-AUC?
F1 оценивает качество при конкретном пороге, ROC-AUC — способность модели разделять классы при всех возможных порогах. F1 полезен, когда порог уже выбран, ROC-AUC — при сравнении моделей до его выбора.
Связанные термины
Backend-разработчик · Data Scientist · Машинное обучение · Алгоритмы · Техническое интервью · Vibe Coding