Цена начинается не с модели, а с границы задачи
На вопрос «сколько стоит AI-агент» часто отвечают ценой токенов, хотя руководитель покупает завершённое действие: разобранное обращение, карточку CRM, отчёт, согласованный ответ или проверенный пакет документов.
Цена прогона одной модели различается в десятки раз из-за маршрута: контекста, поиска или CRM, ошибок API, повторов, передачи сомнительных результатов человеку и журнала инцидентов. Если считать только генерацию текста, проект кажется дешёвым до первого месяца эксплуатации.
Единица расчёта — бизнес-операция с началом и концом. Не «обработка лида», а «лид из формы классифицирован, обогащён, создан в CRM и принят менеджером за 15 минут». Не «ответ на тикет», а «обращение закрыто без повторного открытия семь дней». Это отделяет стоимость задачи от стоимости полезного результата.
Задача — один запуск по тикету, лиду, заказу, договору или записи базы знаний. Проверенный результат — результат, ценность которого подтверждена заранее заданным правилом качества: автоматическим, выборочным человеческим или смешанным.
Формула, которую можно перенести в таблицу
Полная стоимость задачи — переменные расходы запуска и распределённые расходы системы:
Cзадачи = Cпервый_прогон + Cповторы + Ctools + Cоркестрация + Cпроверка + (Cинтеграции + Cподдержка) / N
N — ожидаемое число задач за срок жизни интеграции или выбранный период. Считайте в одной валюте; ниже — доллары США, но формула применима к рублям и другой внутренней валюте.
| Статья | Что считать | Частая ловушка |
|---|---|---|
| Первый прогон | входные и выходные токены штатных вызовов модели | считать финальный вызов, забыв классификатор, суммаризатор и маршрутизатор |
| Повторы | токены и calls после тайм-аута, отказа tool или низкой уверенности | прятать повтор в «средней цене модели», не измеряя долю |
| Tools | поиск, браузер, OCR, распознавание, CRM, почтовые и платёжные API | считать API бесплатным из-за корпоративного контракта |
| Оркестрация | очереди, контекст, журналирование, векторный поиск, мониторинг | относить инфраструктуру только на платформенную команду |
| Проверка | минуты специалиста, час с налогами и накладными | считать клик «принять», игнорируя спорные случаи |
| Интеграции и поддержка | разработка, тесты, обновления схемы, дежурства, инциденты | делить разработку на завышенный прогнозный объём |
Токены складывайте по вызовам:
Cмодели = Σ ((Tin / 1 000 000 × Pin) + (Tout / 1 000 000 × Pout))
Tin, Tout — фактические входные и выходные токены; Pin, Pout — тарифы. Повторы либо выделяйте отдельной строкой, либо включайте в сумму вызовов: дважды учитывать их нельзя.
Срез публичных тарифов проверен 29 августа 2026 года. Для стандартного API без пакетных скидок и кэшированного ввода GPT-5 mini стоит 0,25 доллара за миллион входных и 2 доллара за миллион выходных токенов; GPT-5 — 1,25 и 10 долларов. Условия — на странице тарифов OpenAI. Claude Sonnet 4 указан по 3 и 15 долларов за миллион входных и выходных токенов на странице цен Anthropic. Поставщик может менять модель, лимиты и кэширование, поэтому фиксируйте дату, регион, режим API и ссылку на коммерческое предложение.
Шаблон входных ячеек воспроизводим: подставляйте журналы за неделю, а не оценку из демо.
| Ячейка | Формула | Пример для задачи с черновиком ответа |
|---|---|---|
| Вход модели | 12 000 / 1 000 000 × 3 |
0,036 доллара |
| Выход модели | 2 500 / 1 000 000 × 15 |
0,0375 доллара |
| Два вспомогательных вызова GPT-5 mini | 6 000 / 1 000 000 × 0,25 + 800 / 1 000 000 × 2 |
0,0031 доллара |
| Ожидаемая цена повтора | 15% × 0,0735 |
0,011 доллара |
| Проверка сотрудником | 8 / 60 × 24 доллара в час |
3,20 доллара |
| Распределённая интеграция | 12 000 / 40 000 задач |
0,30 доллара |
Здесь восьмиминутная проверка дороже LLM: смена Sonnet на дешёвую модель экономит центы, сокращение проверки до трёх минут — доллары. Это не аргумент против проверки, а сигнал сузить формат результата, определить эскалации и добавить автоматические тесты вместо длинного свободного текста.
Три ценовых коридора для разных задач
Диапазоны — не рыночные нормативы, а плановые коридоры для первичной модели, когда контекст, труд проверяющего и число вызовов известны приблизительно. До закупки замените их данными пилота.
| Сценарий | Граница задачи | Состав затрат на задачу | Цена задачи | Доля принятых результатов | Цена проверенного результата |
|---|---|---|---|---|---|
| Простой | классифицировать тикет, извлечь поля, выбрать маршрут | модель 0,004–0,02; tools 0,005–0,05; проверка 0,25–1,00; прочее 0,06–0,33 | 0,32–1,40 | 90–95% | 0,34–1,56 |
| Средний | собрать данные из CRM и базы знаний, подготовить черновик | модель 0,08–0,40; tools 0,05–0,40; проверка 1,50–5,00; прочее 0,35–2,00 | 1,98–7,80 | 70–85% | 2,33–11,14 |
| Высокий риск | проверить договор или закупку, собрать доказательства, передать на утверждение | модель 0,50–3,00; tools 0,30–3,00; проверка 8,00–30,00; прочее 2,00–10,00 | 10,80–46,00 | 45–70% | 15,43–102,22 |
В простом сценарии автоматическая проверка подтверждает поля, формат и маршрут, а человек смотрит исключения. Низкая цена возможна при стабильном потоке и обратимой ошибке.
Средний сценарий часто недооценивают: «написать ответ» включает актуальный контекст, доступы, дедупликацию контактов, правила бренда и проверку фактов. Принятие черновика без редактуры измеряйте отдельно от отправки: менеджер мог полностью переписать письмо.
Высокорисковую задачу не обязательно автоматизировать автономно. Для договора или финансового решения результатом может быть досье с цитатами, противоречиями и маршрутом согласования. Сравнивайте его с подготовкой такого досье специалистом, а не с «заменой юриста».
Повторы и ручная проверка съедают бюджет незаметно
Технический повтор следует за сетевой ошибкой, лимитом API или недоступностью CRM; логический — за несоблюдением схемы, пустым поиском или решением перепроверить ответ. Их нельзя смешивать: первый уменьшают резервированием и очередями, второй — промптом, контекстом, output-схемой или маршрутом.
Rповторов = число дополнительных запусков / число начатых задач
Если за 10 000 задач сделано 1 800 дополнительных вызовов, коэффициент — 18%. В отчёте показывайте сумму и причины повторов. Иначе команда спорит о модели, хотя счёт растёт из-за периодически пустого поля CRM.
Декомпозируйте проверку: контроль формата, фактов, тона и юридическое одобрение имеют разную цену и владельца. Смешанный процесс строится по порогам: автоматическое завершение после детерминированных правил, выборочный аудит при средней уверенности, блокировка при красных флагах. Самооценка модели эту политику не заменяет.
Учитывайте цену ложного положительного решения. Ошибочно закрытый критичный тикет может вызвать повторное обращение, возврат платежа или потерю доверия. Её сложно приписать запуску, но нужно вести защитные метрики: повторно открытые обращения, отменённые операции, нарушения SLA и ручные откаты. Дешёвый агент с плохими метриками лишь переносит расход в другой отдел.
От прогона к принятому бизнес-результату
Cost per task показывает цену попытки одной задачи и выявляет рост токенов, дорогой tool или инфраструктурную просадку. Для масштабирования нужен второй показатель:
Cпроверенного_результата = все расходы за период / число результатов, прошедших правило качества
При 6 000 долларах расходов и 4 000 запусках цена задачи — 1,50 доллара. Если 3 000 завершились в SLA, приняты без существенной переделки и не вернулись на доработку, цена проверенного результата — 2 доллара. Её сопоставляют со временем сотрудника, очередью, подрядчиком или потерянной конверсией.
Правило качества запишите до пилота. Поддержка: «категория верна, ответ не нарушает политику, клиент не открыл тикет повторно семь дней». Продажи: «лид соответствует ICP, карточка заполнена, менеджер принял её в работу». Операционный отдел: «заказ проведён без ручного исправления в течение 24 часов». Период наблюдения различается, поэтому не сводите команды к одному проценту успешности.
Полная ручная альтернатива:
Cручного_результата = минуты на работу / 60 × загруженная ставка + стоимость переделок
12 минут при ставке 24 доллара в час стоят 4,80 доллара прямого труда. Агент по 2 доллара за проверенный результат выгоден, только если не ухудшает SLA, качество и безопасность. Четыре минуты редакторской работы должны быть в числителе, а не в примечании к презентации.
Экономика единицы в AI-стартапах: CAC, LTV и стоимость вычислений связывает показатель с экономикой продукта; здесь фокус — цена конкретной операции и условия её принятия бизнесом.
Кто владеет цифрами после запуска
Модель ломается, если её делает закупка, а продуктовая команда узнаёт цену после релиза. Продакт задаёт границу и критерий принятия; технический лидер — журнал вызовов, версии промптов, лимиты и надёжность интеграций; владелец процесса — переделки и неавтоматизируемые решения; финансы — ставку труда, постоянные расходы и период расчёта.
Минимальный еженедельный отчёт содержит:
- число начатых и завершённых задач;
- медиану и 90-й перцентиль стоимости запуска;
- входные и выходные токены по версии агента;
- расходы на каждый tool и долю ошибок API;
- коэффициент повторов по причинам;
- долю автоматического принятия, эскалаций и откатов;
- цену проверенного результата и защитные метрики качества.
Средняя цена скрывает хвост: девять коротких тикетов могут стоить по 20 центов, а один договор с вложениями, OCR и несколькими поисками — 30 долларов. Сегментируйте по типу задачи, каналу, языку, размеру вложения и версии маршрута.
Перед релизом используйте эталонные задачи. Они не докажут будущую экономику, но поймают регрессии: инструкция удлинила ответы, обязательное поле перестало находиться или поиск стал вызываться дважды. Измеряйте на эталоне токены, время, долю корректных структурированных результатов и эскалации, затем сверяйте с потоком.
Выбор модели меняет не только цену токена
Дешёвая модель подходит для извлечения полей, классификации и коротких маршрутов, если тесты подтверждают качество. Дорогую оставляйте для неоднозначных документов, многошагового рассуждения и аргументированного черновика. Слабый ответ создаёт повторы и минуты проверки, перекрывая экономию токенов.
Практичная архитектура — маршрутизация: маленькая модель определяет тип и риск, простые случаи проходят строгую JSON-схему и валидацию, спорные получают больше контекста, сильную модель или человека. Измеряйте и роутер: ошибка первого шага отправит дорогой кейс в дешёвую ветку и испортит метрику принятия.
Не покупайте автономность, если ценность — ускорение подготовки. Когда регламент требует решения сотрудника, агент может собрать факты, заполнить форму и подсветить исключения. Это снижает цену проверенного результата без имитации ответственности и лишнего риска клиенту.
Рынок уходит от цены запроса к цене действия
Первые пилоты измеряли чаты и API-вызовы; в производстве важны трассировка шагов, версии инструмента, бюджет задачи, правила остановки и качество после действия. Без этого нельзя отличить автоматизацию от дешёвой генерации текста.
Нормой становятся структурированные ответы, лимиты на tool calls, кэширование неизменяемого контекста и маршрутизация по риску. Полезнее не только снижать токены, но и убирать ненужный поиск, сокращать проверку или не запускать агента там, где он заранее проигрывает человеку. Автономность без измеримого правила приёмки повышает непредсказуемость бюджета.
Зафиксируйте экономику до следующего пилота
Выберите одну операцию с известными ручным процессом, объёмом и ценой ошибки. Запишите начало задачи, допустимый результат, срок проверки и защитные метрики. Соберите две недели логов и посчитайте не только среднюю цену вызова, но и медиану, хвост расходов, повторы и цену принятого результата.
Масштабируйте агента, если он удерживает качество и SLA при цене проверенного результата ниже альтернативы. Если нет, не спасайте проект лишь дешёвой моделью: найдите дорогой шаг — лишний контекст, сбойный tool, ручную переделку или неверную границу задачи.