Veltos.Tech

AI и ML

Сколько стоит содержать ИИ-агента после запуска: токены, поддержка, переобучение

Смета на разработку ИИ-агента почти всегда заканчивается на запуске. Реальный вопрос бюджета начинается с первого месяца эксплуатации.

Коротко

Стоимость разработки ИИ-агента — разовая статья, а его содержание — постоянная, и именно вторая определяет, окупится ли проект в итоге. Регулярные расходы состоят из четырёх статей: стоимость токенов API, растущая с объёмом запросов; поддержка и исправление сбоев; периодическое переобучение или обновление промптов под изменения в бизнес-процессах; и мониторинг качества ответов, без которого деградация замечается только по жалобам клиентов.

Смета на разработку — это не бюджет проекта

Коммерческое предложение на разработку ИИ-агента почти всегда фиксирует разовую стоимость: анализ задачи, настройку промптов или дообучение, интеграцию с существующими системами, тестирование. Это реальные и обоснованные расходы, но они описывают только момент запуска. Вопрос, который редко задают на этом этапе — сколько будет стоить продолжать эксплуатировать агента через полгода, когда объём запросов вырастет, а первоначальная команда разработки, возможно, уже перешла на другой проект.

Четыре статьи регулярных расходов

СтатьяКак масштабируется
Токены APIПрямо пропорционально объёму запросов и длине контекста
Поддержка и исправление сбоевРастёт с сложностью интеграций и числом edge case
Переобучение и обновление промптовПривязано к частоте изменений в бизнес-процессах
Мониторинг качества ответовФиксированная база + рост с объёмом для ручной выборочной проверки
Что входит в содержание ИИ-агента

Почему стоимость токенов — не линейная, а ступенчатая проблема

На демо-объёме — десятки запросов в день — стоимость токенов через внешний API незаметна, буквально копейки. При выходе на продакшен-объём — тысячи запросов в день — та же архитектура может стать полноценной ежемесячной статьёй бюджета, о которой узнают только когда приходит первый счёт за месяц полной эксплуатации. Это не постепенный рост, а фактически скачок между двумя разными порядками величины, к которому редко готовятся заранее.

Практический способ не попасть в эту ловушку — считать стоимость токенов на реалистичном продакшен-объёме ещё на этапе выбора архитектуры, а не после запуска, и закладывать в проект лимиты или кеширование повторяющихся запросов там, где это возможно.

Мониторинг качества: расход, который окупается тем, что предотвращает

Качество ответов ИИ-агента деградирует со временем незаметно: меняются формулировки в базе знаний, обновляется продукт, появляются новые типы вопросов, для которых промпт не был написан. Без регулярной выборочной проверки ответов эта деградация обнаруживается только тогда, когда клиент жалуется — то есть уже после того, как несколько человек получили плохой опыт. Регулярный, пусть небольшой бюджет на мониторинг — это по сути страховка от накопленного репутационного риска, который стоит дороже самого мониторинга.

Частые вопросы

Почему смета на разработку ИИ-агента не отражает полную стоимость?

Потому что она фиксирует разовую работу — анализ, настройку, интеграцию, тестирование, — а не регулярную эксплуатацию. Реальная стоимость содержания складывается из токенов API, поддержки, переобучения и мониторинга качества, которые продолжаются на всём протяжении использования агента, а не заканчиваются в момент запуска.

Почему стоимость токенов на демо-объёме не отражает продакшен-стоимость?

Потому что разница между демо-объёмом (десятки запросов в день) и продакшен-объёмом (тысячи запросов в день) — это скачок на порядки, а не постепенный рост. Стоимость токенов, незаметная на демо, может стать полноценной ежемесячной статьёй бюджета при реальной нагрузке, и это стоит просчитывать заранее, а не постфактум по первому счёту.

Зачем нужен мониторинг качества, если агент и так работает?

Потому что качество ответов деградирует незаметно со временем — меняется база знаний, продукт, появляются новые типы вопросов. Без регулярной проверки деградация обнаруживается только через жалобы клиентов, то есть после того, как несколько человек уже получили плохой опыт. Мониторинг — это страховка от накопленного репутационного риска.

Как избежать неожиданного роста счёта за токены?

Считать стоимость токенов на реалистичном продакшен-объёме ещё на этапе выбора архитектуры, а не после запуска. Дополнительно помогают лимиты на объём запросов и кеширование повторяющихся или похожих запросов там, где это применимо к конкретной задаче.

Нужна помощь с этой задачей?

Мы делаем это на практике, а не только пишем об этом. Опишите задачу — разберём и пришлём смету по этапам.

Услуги по теме

Читать дальше