Вопрос «сколько это будет стоить в месяц» звучит первым и почти всегда остаётся без честного ответа. В прайсах указана цена за миллион токенов, а сколько токенов уйдёт именно у вас, заранее не знает никто, включая продавца.
Мы платим за модели каждый день и считаем стоимость ответа, потому что от неё зависит наша собственная маржа. Ниже расчёт на конкретном примере, а не диапазон «от и до».
Сразу главное: для небольшой компании счёт за модели выходит меньше, чем принято думать. Считать всё равно нужно, но по другой причине, чем кажется вначале.
Пример, на котором считаем
Кофейня в Белграде, две точки, восемь человек персонала. Помощник отвечает на вопросы сотрудников: сколько граммов в двойном, что делать с просроченным молоком, как оформить возврат, где лежат перчатки.
Это самый частый первый сценарий, и он удобен для расчёта: вопросы короткие, ответы берутся из загруженных документов, объём предсказуем.
| Что считаем | Значение |
|---|---|
| Вопросов в месяц | 300 |
| Длина вопроса | 20-40 слов |
| Длина ответа | 80-150 слов |
| Документов в базе | 40 страниц техкарт и регламентов |
| Что уходит в модель | вопрос + 2-3 найденных фрагмента базы |
Важная деталь, о которой обычно забывают: в модель уходит не только вопрос. Вместе с ним отправляются фрагменты из ваших документов, иначе отвечать будет не по чему. На них приходится основная часть объёма, и именно они определяют счёт.
В нашем примере вопрос занимает около 40 токенов, а найденные фрагменты — примерно 900. То есть платите вы в основном не за вопрос сотрудника, а за кусок собственной базы знаний, который едет вместе с ним.
Три способа потратить деньги на одни и те же 300 вопросов
Способ первый: везде самая мощная модель
Так делают почти все на старте: берётся модель, о которой слышали, и ставится на все задачи разом.
Один ответ обходится примерно в 0,55 цента, а 300 вопросов — в 1,66 доллара в месяц. Ответы отличные. Вопрос только в том, нужны ли они, когда сотрудник спрашивает, сколько граммов кофе в двойном эспрессо.
Способ второй: везде самая дешёвая
Обратная крайность. Ответ стоит 0,025 цента, а месяц — семь центов. На простых вопросах результат неотличим от дорогой модели.
Разница вылезает на сложном. Когда бариста спрашивает про возврат просроченного товара, а в регламенте это описано в двух местах и с оговорками, дешёвая модель уверенно отвечает половиной правды. Разбираться будет управляющий, и его час стоит дороже, чем вся годовая экономия на модели.
Способ третий: модель под задачу
Простой вопрос уходит дешёвой модели, сложный — мощной. Разделение делает не человек, а сам сервис: по типу вопроса, длине найденного контекста и тому, нужно ли сопоставлять несколько источников.
В нашем примере сложными оказываются около сорока вопросов из трёхсот. Получается 29 центов в месяц при качестве ответов, неотличимом от первого способа.
| Способ | 300 вопросов | 3 000 вопросов | 30 000 вопросов | Качество на сложном |
|---|---|---|---|---|
| Всегда мощная | 1,66 $ | 16,56 $ | 165,60 $ | отличное |
| Всегда дешёвая | 0,07 $ | 0,75 $ | 7,47 $ | подводит |
| Под задачу | 0,29 $ | 2,86 $ | 28,55 $ | отличное |
Главное в этой таблице не первый столбец, а последний слева направо. На трёхстах вопросах разница между способами — полтора доллара, её не заметит никто. На тридцати тысячах это уже 137 долларов в месяц разницы при одинаковом качестве.
Экономия держится на 83 процентах независимо от объёма. Просто на маленьких объёмах она незаметна, а на больших оплачивает сотрудника на полставки.
Где на самом деле возникает переплата
Раз счёт за модели невелик, стоит понять, из-за чего он вырастает в разы. Причин две, и обе не про цену модели.
Первая: на простой вопрос отвечает дорогая модель. Из трёхсот вопросов сложными оказываются сорок. Если все триста обслуживает мощная модель, вы платите за неё в семи случаях из восьми впустую.
Вторая, менее очевидная: размер базы документов. Чем больше найдено под вопрос, тем длиннее запрос. Аккуратная база из сорока страниц даёт 900 токенов контекста и 1,66 доллара за 300 вопросов. Свалка, куда загрузили всё подряд «на всякий случай», даёт 2700 токенов и 3,28 доллара за те же самые 300 вопросов.
Вдвое дороже при том же числе вопросов и, что хуже, при худшем качестве ответов: среди четырёхсот страниц мусора нужный абзац находится реже, чем среди сорока страниц по делу.
Что это значит на практике
Четыре вывода, ради которых стоило считать.
Порог входа ниже, чем кажется. Небольшой компании модели обходятся в единицы долларов в месяц. Если вы откладывали запуск из-за расходов, вы откладывали его зря.
Дешёвая модель не экономит, а откладывает расход. Сэкономленные семьдесят центов возвращаются часом работы управляющего, который разбирает последствия неточного ответа.
Дорогая модель не гарантирует качество, она гарантирует счёт. На простых вопросах разницы в ответе нет, а платите вы за неё всегда.
Порядок в документах экономит больше, чем выбор модели. Вычистить базу — разовая работа на день, а платить за лишний контекст вы будете в каждом запросе.
Как это устроено у нас
Модель под задачу выбирает сервис, а не вы: настраивать ничего не нужно, разделение работает по умолчанию.
В тарифы включён понятный объём ответов, а не абстрактные токены. Видно, сколько осталось, и не бывает счёта, который не с чем сравнить.
Начать можно бесплатно и без карты: ста ответов хватает, чтобы прогнать сценарий на своих документах и увидеть настоящий расход, а не оценку из статьи. В том числе из этой.