Как устроен расчёт
Мы считаем себестоимость своих ИИ-инструментов по одной схеме: вводные → формула → результат → решение по прайсу. Каждая цифра в расчёте несёт статус: замер (сделан нами, воспроизводим), первоисточник (прайс или документация вендора, прочитанные напрямую), оценка (наша модель с названным допущением) и данных нет. Смешивать их в одной таблице без пометок — самый простой способ получить убедительный и неверный итог.
Сам расчёт после сведения проходит состязательную проверку. На последнем пересчёте она нашла три ошибки, включая содержательную: доля пакетных запросов считалась по количеству вызовов, а не по их стоимости.
Что входит в цену на самом деле
- Цена модели за вход и выход. Считается отдельно: выход дороже входа в 4–5 раз у всех классов моделей. Задача, где модель много читает и мало пишет, и задача, где наоборот, стоят по-разному при одинаковом «объёме работы».
- Пакетный режим — минус 50% на вход и выход. Он придуман ровно для того, чем занята основная масса наших прогонов: массовая обработка, где ответ не нужен в ту же секунду. Мы этот рычаг долго не применяли — просто не смотрели в его сторону.
- Кэш промпта — попадание стоит 0,1× цены входа. В любом массовом прогоне у промпта есть постоянная часть: инструкция, справочные факты, примеры-эталоны. Она повторяется в каждом вызове пачки и не обязана оплачиваться каждый раз по полной.
- Поправка на язык. Для английского вендор даёт около 4 символов на токен, кириллица токенизируется вдвое хуже — мы считаем по 2 символа на токен. Это осознанно консервативная оценка: она завышает стоимость, а не занижает.
- Поправка на смену токенизатора. Модели нового поколения дают примерно на 30% больше токенов на том же тексте. При переходе на такую модель себестоимость умножается на 1,3, даже если цена за миллион токенов в прайсе не изменилась.
- Всё, что не токены. В нашей строке прайса на инструменты токены занимают от 1 до 20% суммы. Остальное — серверы, сторонние платные API, резерв на всплески. Расчёт, где посчитаны только токены, показывает не себестоимость, а её малую часть.
Две ловушки, на которых легко ошибиться
Ловушка 1: вводная цена принимается за постоянную. Модель может стоить дешевле «до такого-то числа». Наша средняя модель идёт по вводной цене до 31 августа 2026, с 1 сентября — на 50% дороже. Бюджет и лимиты мы считаем по будущей цене; иначе в сентябре себестоимость вырастет в полтора раза без единого изменения в продукте.
Ловушка 2: цифра из обзора вместо прайса. В дайджесте, с которого начинался наш пересчёт, было сказано, что новый флагман вдвое дешевле прежнего. По прайсу вендора — втрое. В другом разборе автор ролика назвал стоимость своего же перехода на полтора раза меньше реальной. Обе ошибки в пользу оптимизма, и обе всплыли только при чтении первоисточника.
Своё железо: где проходит граница
Вопрос «а не поставить ли локальную модель, чтобы не платить за токены» задаётся почти на каждой встрече. Он решается арифметикой, а не убеждениями. В нашем расчёте по одному из проектов собственное железо начинало окупаться примерно с 68 млн токенов в месяц. Реальный профиль проекта был около 1,2 млн — в полсотни раз меньше порога.
Как посчитать свой случай за полчаса
- Возьмите одну типовую операцию, а не «весь процесс»: один разбор переписки, одно письмо, одна карточка. Измерьте её вход и выход в символах — по реальному примеру, не по памяти.
- Переведите в токены делением на 2 для русского текста. Умножьте на цену входа и выхода отдельно.
- Умножьте на частоту за месяц. Это ваша нижняя граница — то, что видно.
- Добавьте невидимое: повторные прогоны после правок, отбракованные ответы, служебные вызовы. У нас это заметная доля, и она не попадает в наивную оценку.
- Примените рычаги: что из этого может идти пакетом (−50%) и какая часть промпта постоянна (кэш 0,1×). Часто именно этот шаг решает, окупается операция или нет.
- Сравните с ручным временем в тех же единицах — часах сотрудника, а не в ощущениях.