Сколько стоит ИИ в продукте

За что платят, когда продукт использует языковую модель: токены, из чего состоит один запрос, пять сценариев месячного счёта, как посчитать свой и восемь способов его сократить.

Искусственный интеллект Обновлено

Коротко

Стоимость ИИ в продукте складывается из двух частей: разовой работы по созданию и текущего расхода на модель, который оплачивается за токены — кусочки текста, которые модель читает и пишет. У типичного ассистента, отвечающего по базе знаний, один ответ стоит от долей цента до пары центов, а тысяча ответов в день — от десятков до нескольких сотен долларов в месяц. Счёт зависит не столько от прайса модели, сколько от того, как построены запросы: длинная инструкция с каждым вопросом, лишняя история переписки и флагман там, где хватило бы быстрой модели, умножают расход в разы. Кэш, быстрая модель для простых задач и короткие ответы возвращают его обратно.

За что платят: основы

Семь фактов, которые объясняют любой счёт за языковую модель.

Единица оплаты
Токен — около четырёх символов английского текста; цены указывают за миллион токенов
Русский текст
Занимает заметно больше токенов, чем тот же текст на английском
Вход и выход
То, что модель пишет, стоит примерно в пять раз дороже того, что она читает
Кэш
Повторяющееся начало запроса читается в разы дешевле
Пакеты
Несрочные задачи, отправленные пакетом, стоят примерно вдвое дешевле
Уровни моделей
Быстрая модель в разы дешевле сбалансированной, флагман — дороже
Кто платит
Владелец ключа API — лучше всего, когда ключи оформлены на клиента

Из чего состоит один запрос

Типичный ответ ассистента по базе знаний. Сам вопрос — самая маленькая часть счёта.

ЧастьТокеныПовторяетсяКак сократить
Инструкция модели 2 000 в каждом запросе кэш, короче формулировки
Найденные куски базы знаний 800 каждый раз разные меньше и короче куски
Вопрос и история 200 растёт по ходу диалога пересказ вместо всей переписки
Ответ модели 300 каждый раз разный ограничение длины, формат

Пять сценариев для одного ассистента

Один и тот же ассистент, 1 000 ответов в день, запрос из таблицы выше. Условные цены за миллион токенов: быстрая модель $1 на входе и $5 на выходе, сбалансированная $3 и $15, флагман $5 и $25; чтение из кэша — 10% цены входа.

СценарийОдин ответМесяцК первому
Флагман, без кэша $0.0225 $675 100%
Сбалансированная, без кэша $0.0135 $405 60%
Сбалансированная, инструкция в кэше $0.0081 $243 36%
Быстрая, без кэша $0.0045 $135 20%
Быстрая, инструкция в кэше $0.0027 $81 12%

Как посчитать счёт для своего продукта

  1. 1. Собрать настоящие запросы

    30–50 типичных вопросов или документов — не придуманных, а из почты, чатов и CRM.

  2. 2. Прогнать через прототип

    Провайдер возвращает число входных и выходных токенов в каждом ответе.

  3. 3. Найти среднее

    Среднее число токенов на входе и выходе на запрос и отдельно — доля, которая повторяется и может уйти в кэш.

  4. 4. Умножить на объём

    Запросов в день × 30, с запасом на пики и рост.

  5. 5. Сравнить уровни

    Тот же набор на быстрой и сбалансированной модели: если качество одинаковое, разница — чистая экономия.

  6. 6. Поставить лимит

    Месячный лимит расходов в кабинете провайдера защищает от зацикливаний и злоупотреблений.

8 способов сократить счёт

  1. 01

    Кэшировать инструкцию

    Повторяющееся начало запроса уходит в кэш — самая большая экономия без потери качества.

  2. 02

    Быстрая модель для простой работы

    Сортировке, извлечению и коротким ответам редко нужно больше.

  3. 03

    Маршрутизация по сложности

    Простые вопросы уходят быстрой модели, сложные — сильной.

  4. 04

    Ограничить ответ

    Ответ — самая дорогая часть: ограничение длины и понятный формат.

  5. 05

    Меньше кусков контекста

    Три хороших куска дешевле и точнее десяти средних.

  6. 06

    Пересказ вместо истории

    Длинный диалог заменяется кратким пересказом, а не отправляется целиком каждый раз.

  7. 07

    Пакеты для несрочной работы

    Описания товаров или ночные отчёты — за полцены.

  8. 08

    Готовые ответы на частые вопросы

    Вопрос, на который уже отвечали, не отправляется модели повторно.

Что ещё стоит денег, кроме токенов

Модель — самая заметная строка счёта, но не единственная.

СтатьяКак оплачиваетсяДоля в бюджете
Создание продукта разово, по часам работы самая большая на старте
Векторы для поиска за токены, один раз на документ маленькая
Хранение векторов внутри существующей базы обычно ничего сверху
Сервер помесячно небольшая для облачных моделей
Разбор журнала часы в месяц решает качество
Обновление базы знаний по мере изменения документов небольшая, если автоматизировано

Частые ошибки в бюджете ИИ

  1. Считать только вопрос

    Инструкция и контекст в десять раз длиннее самого вопроса.

  2. Забыть про цену выхода

    Длинный ответ стоит дороже всего запроса, который его породил.

  3. Нет лимита расходов

    Одно зацикливание агента или атака ботов съедают месячный бюджет за ночь.

  4. Вся переписка с каждым сообщением

    Цена каждого нового сообщения растёт вместе с длиной диалога.

  5. Ключи на подрядчике

    Клиент не видит реальный расход и зависит от чужого аккаунта.

  6. Экономить не на том

    Дешёвая модель, которая отвечает неверно, обходится потерянными клиентами дороже, чем экономит.

Вопросы о стоимости ИИ

Сколько стоит ИИ-ассистент в месяц?

Модель на тысячу ответов в день — от десятков до нескольких сотен долларов в зависимости от уровня, кэша и длины запросов.

Что такое токен?

Кусочек текста, с которым работает модель, — в среднем около четырёх символов английского текста.

Почему ответ дороже вопроса?

Писать модели намного труднее, чем читать, поэтому выходные токены стоят в разы дороже.

Сколько экономит кэш?

В примере выше — 40% счёта; чем длиннее повторяющаяся инструкция, тем больше экономия.

Дешевле ли локальная модель?

На больших объёмах простой работы — да; на малых сервер обходится дороже API.

Как не получить неожиданный счёт?

Месячный лимит у провайдера, ограничения на пользователя и уведомление на половине бюджета.

На кого оформлять ключи API?

На клиента: расход виден, а продукт не зависит от аккаунта подрядчика.

Форма

Бюджет ИИ
до старта

Считаю расход на ваших настоящих запросах до начала разработки и строю продукт так, чтобы счёт оставался предсказуемым. Ключи оформлены на вас, а модель вы оплачиваете провайдеру напрямую. Расскажите о задаче — отвечу в течение рабочего дня.

Или пишите на [email protected]