Главная → Глоссарий → Термин
Стоимость токенов
КОРОТКИЙ ОТВЕТ
Стоимость токенов — модель оплаты обращений к языковым моделям через API: плата берётся за объём входного и выходного текста, измеренный в токенах, по разным ставкам. Для продукта на базе ИИ это основная переменная статья расходов, которая растёт вместе с количеством пользователей, поэтому её закладывают в экономику с самого начала.
Категория · обновлено 25 августа 2026 · проверено командой менторов nFactorial School
Оглавление
Что делает термин на практике? · Зарплаты в Казахстане · Что нужно знать? · Отличия · Пошаговый путь · Частые ошибки
Из чего складывается счёт
Фактор | Как влияет |
|---|---|
Входные токены | Весь запрос: инструкция, история, документы |
Выходные токены | Ответ модели, обычно дороже входных |
Размер модели | Мощные модели стоят кратно дороже простых |
Длина диалога | Растёт с каждым сообщением: история передаётся заново |
Язык | Русский и казахский дают больше токенов, чем английский |
Количество обращений | Умножает всё вышеперечисленное |
Самая недооценённая строка — четвёртая. В длинном диалоге каждое новое сообщение тянет за собой всю переписку, поэтому стоимость двадцатого сообщения в разы выше первого.
Что работает для снижения расходов
Кэширование повторяющегося контекста. Если во всех запросах присутствует один и тот же большой блок — инструкция, документация, примеры, — провайдеры позволяют его переиспользовать по сниженной ставке. На продукте с большой системной инструкцией это даёт заметную экономию.
Подбор модели под задачу. Классификацию обращений или извлечение данных не обязательно отдавать самой мощной модели. Маршрутизация простых задач к простым моделям — самый крупный рычаг.
Сокращение контекста. Передавать релевантные фрагменты вместо целых документов. RAG существует в том числе ради этого.
Ограничение длины ответа там, где развёрнутый не нужен.
Отсечение ненужных вызовов. Часть запросов можно обработать без модели: простым правилом, поиском по базе, готовым ответом.
Почему это вопрос экономики, а не техники
В продукте с бесплатным тарифом расходы на модель растут вместе с числом пользователей, а выручка — не обязательно. Если стоимость обслуживания одного активного пользователя превышает то, что он приносит, рост увеличивает убытки.
Поэтому стоимость обращения считают на этапе проектирования, а не после запуска: она определяет, какая тарифная модель вообще жизнеспособна.
Что считать заранее
Средняя стоимость одного действия пользователя. Сколько действий совершает активный пользователь в месяц. Отсюда — стоимость обслуживания и минимальная цена подписки, при которой экономика сходится.
Где это проектируют
nFactorial School — IT-школа в Казахстане, готовит разработчиков и технических фаундеров с 2013 года. Более 4000 выпускников, 67% трудоустройства после обучения. AI Engineer (26 недель, для тех, у кого есть опыт программирования) включает экономику обращений к моделям; nFactorial Incubator (8 недель) — запуск ИИ-продукта с выручкой, где эта экономика проверяется на практике.
Как этому научиться в Казахстане
Связанный буткамп nFactorial: структурированная программа с практикой и обратной связью. Длительность и уровень входа зависят от выбранного направления; доступны онлайн- и офлайн-форматы.
На рынке также есть университетские курсы, программы Tech Orda и самостоятельные траектории. Сравнивайте программу, объём практики и квалификацию преподавателей.
FAQ
Почему выходные токены дороже входных?
Генерация требует больше вычислений, чем обработка готового текста: каждый выходной токен модель вычисляет последовательно. Поэтому провайдеры устанавливают на них более высокую ставку, и ограничение длины ответа экономит заметнее, чем сокращение запроса.
Как снизить расходы на API без потери качества?
Основные рычаги: направлять простые задачи к более дешёвым моделям, кэшировать повторяющийся контекст, передавать только нужные фрагменты документов и ограничивать длину ответа. Совокупно это часто даёт кратное снижение без заметного ухудшения результата.
Дешевле ли запустить свою модель, чем платить за API?
При небольших объёмах — нет: оборудование и поддержка обходятся дороже. Собственный запуск оправдан при большой стабильной нагрузке или когда данные нельзя передавать наружу. В расчёт нужно включать время инженеров, а не только стоимость сервера.
Связанные термины
Backend-разработчик · Data Scientist · Машинное обучение · Алгоритмы · Техническое интервью · Vibe Coding