Сколько стоит ИИ в продукте
За что платят, когда продукт использует языковую модель: токены, из чего состоит один запрос, пять сценариев месячного счёта, как посчитать свой и восемь способов его сократить.
Коротко
Стоимость ИИ в продукте складывается из двух частей: разовой работы по созданию и текущего расхода на модель, который оплачивается за токены — кусочки текста, которые модель читает и пишет. У типичного ассистента, отвечающего по базе знаний, один ответ стоит от долей цента до пары центов, а тысяча ответов в день — от десятков до нескольких сотен долларов в месяц. Счёт зависит не столько от прайса модели, сколько от того, как построены запросы: длинная инструкция с каждым вопросом, лишняя история переписки и флагман там, где хватило бы быстрой модели, умножают расход в разы. Кэш, быстрая модель для простых задач и короткие ответы возвращают его обратно.
За что платят: основы
Семь фактов, которые объясняют любой счёт за языковую модель.
- Единица оплаты
- Токен — около четырёх символов английского текста; цены указывают за миллион токенов
- Русский текст
- Занимает заметно больше токенов, чем тот же текст на английском
- Вход и выход
- То, что модель пишет, стоит примерно в пять раз дороже того, что она читает
- Кэш
- Повторяющееся начало запроса читается в разы дешевле
- Пакеты
- Несрочные задачи, отправленные пакетом, стоят примерно вдвое дешевле
- Уровни моделей
- Быстрая модель в разы дешевле сбалансированной, флагман — дороже
- Кто платит
- Владелец ключа API — лучше всего, когда ключи оформлены на клиента
Из чего состоит один запрос
Типичный ответ ассистента по базе знаний. Сам вопрос — самая маленькая часть счёта.
| Часть | Токены | Повторяется | Как сократить |
|---|---|---|---|
| Инструкция модели | 2 000 | в каждом запросе | кэш, короче формулировки |
| Найденные куски базы знаний | 800 | каждый раз разные | меньше и короче куски |
| Вопрос и история | 200 | растёт по ходу диалога | пересказ вместо всей переписки |
| Ответ модели | 300 | каждый раз разный | ограничение длины, формат |
Пять сценариев для одного ассистента
Один и тот же ассистент, 1 000 ответов в день, запрос из таблицы выше. Условные цены за миллион токенов: быстрая модель $1 на входе и $5 на выходе, сбалансированная $3 и $15, флагман $5 и $25; чтение из кэша — 10% цены входа.
| Сценарий | Один ответ | Месяц | К первому |
|---|---|---|---|
| Флагман, без кэша | $0.0225 | $675 | 100% |
| Сбалансированная, без кэша | $0.0135 | $405 | 60% |
| Сбалансированная, инструкция в кэше | $0.0081 | $243 | 36% |
| Быстрая, без кэша | $0.0045 | $135 | 20% |
| Быстрая, инструкция в кэше | $0.0027 | $81 | 12% |
Как посчитать счёт для своего продукта
-
1. Собрать настоящие запросы
30–50 типичных вопросов или документов — не придуманных, а из почты, чатов и CRM.
-
2. Прогнать через прототип
Провайдер возвращает число входных и выходных токенов в каждом ответе.
-
3. Найти среднее
Среднее число токенов на входе и выходе на запрос и отдельно — доля, которая повторяется и может уйти в кэш.
-
4. Умножить на объём
Запросов в день × 30, с запасом на пики и рост.
-
5. Сравнить уровни
Тот же набор на быстрой и сбалансированной модели: если качество одинаковое, разница — чистая экономия.
-
6. Поставить лимит
Месячный лимит расходов в кабинете провайдера защищает от зацикливаний и злоупотреблений.
8 способов сократить счёт
-
01
Кэшировать инструкцию
Повторяющееся начало запроса уходит в кэш — самая большая экономия без потери качества.
-
02
Быстрая модель для простой работы
Сортировке, извлечению и коротким ответам редко нужно больше.
-
03
Маршрутизация по сложности
Простые вопросы уходят быстрой модели, сложные — сильной.
-
04
Ограничить ответ
Ответ — самая дорогая часть: ограничение длины и понятный формат.
-
05
Меньше кусков контекста
Три хороших куска дешевле и точнее десяти средних.
-
06
Пересказ вместо истории
Длинный диалог заменяется кратким пересказом, а не отправляется целиком каждый раз.
-
07
Пакеты для несрочной работы
Описания товаров или ночные отчёты — за полцены.
-
08
Готовые ответы на частые вопросы
Вопрос, на который уже отвечали, не отправляется модели повторно.
Что ещё стоит денег, кроме токенов
Модель — самая заметная строка счёта, но не единственная.
| Статья | Как оплачивается | Доля в бюджете |
|---|---|---|
| Создание продукта | разово, по часам работы | самая большая на старте |
| Векторы для поиска | за токены, один раз на документ | маленькая |
| Хранение векторов | внутри существующей базы | обычно ничего сверху |
| Сервер | помесячно | небольшая для облачных моделей |
| Разбор журнала | часы в месяц | решает качество |
| Обновление базы знаний | по мере изменения документов | небольшая, если автоматизировано |
Частые ошибки в бюджете ИИ
-
Считать только вопрос
Инструкция и контекст в десять раз длиннее самого вопроса.
-
Забыть про цену выхода
Длинный ответ стоит дороже всего запроса, который его породил.
-
Нет лимита расходов
Одно зацикливание агента или атака ботов съедают месячный бюджет за ночь.
-
Вся переписка с каждым сообщением
Цена каждого нового сообщения растёт вместе с длиной диалога.
-
Ключи на подрядчике
Клиент не видит реальный расход и зависит от чужого аккаунта.
-
Экономить не на том
Дешёвая модель, которая отвечает неверно, обходится потерянными клиентами дороже, чем экономит.
Вопросы о стоимости ИИ
Сколько стоит ИИ-ассистент в месяц?
Модель на тысячу ответов в день — от десятков до нескольких сотен долларов в зависимости от уровня, кэша и длины запросов.
Что такое токен?
Кусочек текста, с которым работает модель, — в среднем около четырёх символов английского текста.
Почему ответ дороже вопроса?
Писать модели намного труднее, чем читать, поэтому выходные токены стоят в разы дороже.
Сколько экономит кэш?
В примере выше — 40% счёта; чем длиннее повторяющаяся инструкция, тем больше экономия.
Дешевле ли локальная модель?
На больших объёмах простой работы — да; на малых сервер обходится дороже API.
Как не получить неожиданный счёт?
Месячный лимит у провайдера, ограничения на пользователя и уведомление на половине бюджета.
На кого оформлять ключи API?
На клиента: расход виден, а продукт не зависит от аккаунта подрядчика.
Форма
Бюджет ИИ
до старта
Считаю расход на ваших настоящих запросах до начала разработки и строю продукт так, чтобы счёт оставался предсказуемым. Ключи оформлены на вас, а модель вы оплачиваете провайдеру напрямую. Расскажите о задаче — отвечу в течение рабочего дня.