AI и ML
Сколько стоит содержать ИИ-агента после запуска: токены, поддержка, переобучение
Смета на разработку ИИ-агента почти всегда заканчивается на запуске. Реальный вопрос бюджета начинается с первого месяца эксплуатации.
Коротко
Стоимость разработки ИИ-агента — разовая статья, а его содержание — постоянная, и именно вторая определяет, окупится ли проект в итоге. Регулярные расходы состоят из четырёх статей: стоимость токенов API, растущая с объёмом запросов; поддержка и исправление сбоев; периодическое переобучение или обновление промптов под изменения в бизнес-процессах; и мониторинг качества ответов, без которого деградация замечается только по жалобам клиентов.
Смета на разработку — это не бюджет проекта
Коммерческое предложение на разработку ИИ-агента почти всегда фиксирует разовую стоимость: анализ задачи, настройку промптов или дообучение, интеграцию с существующими системами, тестирование. Это реальные и обоснованные расходы, но они описывают только момент запуска. Вопрос, который редко задают на этом этапе — сколько будет стоить продолжать эксплуатировать агента через полгода, когда объём запросов вырастет, а первоначальная команда разработки, возможно, уже перешла на другой проект.
Четыре статьи регулярных расходов
| Статья | Как масштабируется |
|---|---|
| Токены API | Прямо пропорционально объёму запросов и длине контекста |
| Поддержка и исправление сбоев | Растёт с сложностью интеграций и числом edge case |
| Переобучение и обновление промптов | Привязано к частоте изменений в бизнес-процессах |
| Мониторинг качества ответов | Фиксированная база + рост с объёмом для ручной выборочной проверки |
Почему стоимость токенов — не линейная, а ступенчатая проблема
На демо-объёме — десятки запросов в день — стоимость токенов через внешний API незаметна, буквально копейки. При выходе на продакшен-объём — тысячи запросов в день — та же архитектура может стать полноценной ежемесячной статьёй бюджета, о которой узнают только когда приходит первый счёт за месяц полной эксплуатации. Это не постепенный рост, а фактически скачок между двумя разными порядками величины, к которому редко готовятся заранее.
Практический способ не попасть в эту ловушку — считать стоимость токенов на реалистичном продакшен-объёме ещё на этапе выбора архитектуры, а не после запуска, и закладывать в проект лимиты или кеширование повторяющихся запросов там, где это возможно.
Мониторинг качества: расход, который окупается тем, что предотвращает
Качество ответов ИИ-агента деградирует со временем незаметно: меняются формулировки в базе знаний, обновляется продукт, появляются новые типы вопросов, для которых промпт не был написан. Без регулярной выборочной проверки ответов эта деградация обнаруживается только тогда, когда клиент жалуется — то есть уже после того, как несколько человек получили плохой опыт. Регулярный, пусть небольшой бюджет на мониторинг — это по сути страховка от накопленного репутационного риска, который стоит дороже самого мониторинга.
Частые вопросы
Почему смета на разработку ИИ-агента не отражает полную стоимость?
Потому что она фиксирует разовую работу — анализ, настройку, интеграцию, тестирование, — а не регулярную эксплуатацию. Реальная стоимость содержания складывается из токенов API, поддержки, переобучения и мониторинга качества, которые продолжаются на всём протяжении использования агента, а не заканчиваются в момент запуска.
Почему стоимость токенов на демо-объёме не отражает продакшен-стоимость?
Потому что разница между демо-объёмом (десятки запросов в день) и продакшен-объёмом (тысячи запросов в день) — это скачок на порядки, а не постепенный рост. Стоимость токенов, незаметная на демо, может стать полноценной ежемесячной статьёй бюджета при реальной нагрузке, и это стоит просчитывать заранее, а не постфактум по первому счёту.
Зачем нужен мониторинг качества, если агент и так работает?
Потому что качество ответов деградирует незаметно со временем — меняется база знаний, продукт, появляются новые типы вопросов. Без регулярной проверки деградация обнаруживается только через жалобы клиентов, то есть после того, как несколько человек уже получили плохой опыт. Мониторинг — это страховка от накопленного репутационного риска.
Как избежать неожиданного роста счёта за токены?
Считать стоимость токенов на реалистичном продакшен-объёме ещё на этапе выбора архитектуры, а не после запуска. Дополнительно помогают лимиты на объём запросов и кеширование повторяющихся или похожих запросов там, где это применимо к конкретной задаче.
Нужна помощь с этой задачей?
Мы делаем это на практике, а не только пишем об этом. Опишите задачу — разберём и пришлём смету по этапам.
Услуги по теме
- Разработка AI и ML-решенийМы делаем AI, который решает конкретную задачу и окупается, а не демо ради демо. Классификаторы, рекомендации, обработка текста и документов, ассистенты на LLM, интеграция моделей в существующий продукт.
- AI-стратегия для бизнесаБольшинство компаний уже запустили хотя бы один пилот с ИИ. Меньшинство довело хоть один пилот до устойчивой эксплуатации. Разница обычно не в модели, а в том, выбрали ли процесс с измеримым эффектом и посчитали ли реальную стоимость эксплуатации до старта. Мы помогаем выбрать правильную точку входа и не потратить бюджет на демо, которое так и останется демо.
Читать дальше
- ИИ-ассистент на своей базе знаний: как работает RAG и сколько стоит внедрениеРазбираем, чем RAG-ассистент отличается от бота с кнопками и от LLM без данных, откуда берутся галлюцинации и что их реально снижает, сколько стоит SaaS против кастомной разработки и на каком месяце проект выходит в ноль.
- Почему ИИ-пилоты не доходят до продакшена: разбор на цифрахРазрыв между «попробовали ИИ» и «ИИ реально работает в компании» — не про технологию. Три конкретные, воспроизводимые причины и как их закрыть до старта пилота.
- Как отличить разработку ИИ-агента от обёртки над чужим APIВнешне готовый бот на чужом API и полноценная кастомная разработка выглядят одинаково на демонстрации. Разница видна только в вопросах, которые мало кто задаёт.