Сколько стоит ИИ-агент и внедрение ИИ: бюджет на пилот и продакшн
«Сколько стоит ИИ-агент» — вопрос с двумя ответами. Первый — разовый бюджет на разработку: диагностику, логику, интеграции, базу знаний. Второй — ежемесячная стоимость владения: токены языковой модели, инфраструктура, поддержка. Большинство смет честно показывает только первую часть, а вторая всплывает после запуска. Ниже разбираем обе: из чего складывается цена, чем бюджет пилота отличается от продакшна, сколько реально стоят токены российских и зарубежных моделей, когда выгоден свой сервер с GPU и как посчитать окупаемость на цифрах, а не на ощущениях.
Сколько стоит внедрение ИИ в бизнес: порядок цифр
Внедрение ИИ разумно покупать по этапам: каждый следующий шаг оплачивается только после того, как предыдущий показал результат. Ориентиры по рынку заказной разработки в 2026 году — от десятков тысяч рублей за простого ассистента до миллионов за корпоративную систему из нескольких агентов. Ниже — вилки, по которым работает наша студия; итоговая сумма зависит от числа процессов, интеграций и состояния данных.
| Этап или тип решения | Что получаете | Бюджет |
|---|---|---|
| Диагностика и стратегия | Разбор процессов, отбор 1–2 задач с измеримым эффектом, выбор модели, архитектура, прогноз ROI | от 80 000 ₽ |
| ИИ-ассистент с базой знаний | Ответы по вашим документам в одном канале, передача диалога менеджеру | 120 000–250 000 ₽ |
| Пилот по одной задаче | Рабочее решение на ограниченной выборке с замером точности и экономии | от 200 000 ₽ |
| ИИ-агент под один процесс | Многошаговая логика, RAG по базе знаний | от 250 000 ₽ |
| Продакшн с интеграциями | Действия в CRM и 1С, мониторинг, фолбэк на человека | от 500 000 ₽ |
| Комплексное внедрение, агентный пайплайн | Несколько процессов или связка систем | от 1 000 000 ₽ |
Ко всем строкам добавляется ежемесячный расход: токены LLM и поддержка. Подробно по этапам и составу работ — на странице внедрения искусственного интеллекта в бизнес.
Из чего складывается стоимость ИИ-агента
ИИ-агент — это не «лицензия на нейросеть», а связка из модели, логики, данных и интеграций. Сама модель в разработке почти ничего не стоит: платите вы за работу вокруг неё. Подробнее об устройстве агентов — в статье что такое ИИ-агент и чем он отличается от чат-бота.
Диагностика
Аналитик разбирает процесс: сколько обращений, какие типы, сколько времени тратит сотрудник, где лежат данные, какой результат считать успехом. Результат — 1–2 задачи под пилот и расчёт эффекта. Это самый дешёвый этап, и именно он отсекает проекты, которые не окупятся ни при каком бюджете.
Разработка логики и промптов
Сценарии, инструкции модели, описание инструментов (function calling), ограничения: что агенту можно делать самому, а что — только с подтверждением человека. Цена растёт с числом веток и шагов: ответ на вопрос и «принять заявку → проверить остаток → выставить счёт → записать в CRM» — задачи разного порядка.
Интеграции
Обычно самая весомая статья. Бот на сайте, который просто отвечает, и агент, встроенный в контур amoCRM или Битрикс24, 1С и телефонии, различаются по трудоёмкости в разы. Каждая система — это авторизация, лимиты API, обработка ошибок и тесты на реальных данных.
Данные и подготовка базы знаний
Регламенты, прайсы, каталог, ответы на типовые вопросы нужно собрать, почистить от противоречий и устаревшего, разбить на фрагменты и проиндексировать. Без этого даже сильная модель будет отвечать неточно. Как работают ответы по документам — в материале что такое RAG-система. Часть работы ложится на ваших экспертов: только они знают, какой из трёх регламентов актуален.
Токены и инфраструктура
Оплата языковой модели за объём, векторная база, сервер для кода агента, логи. Это переменная часть бюджета, она растёт вместе с нагрузкой.
Поддержка и дообучение
Реальные диалоги всегда показывают пробелы: новые формулировки, товары, изменения в регламентах. Первые 2–3 месяца после запуска промпты и базу знаний правят особенно активно. Дальше — мониторинг качества, обновление базы, переход на новые версии моделей.
Бюджет на пилот и на продакшн: в чём разница
Пилот отвечает на вопрос «работает ли это на наших данных». Продакшн — «работает ли это каждый день без присмотра». Отсюда разница в бюджете.
| Параметр | Пилот | Продакшн |
|---|---|---|
| Охват | Один процесс, часть потока | Весь поток, иногда несколько процессов |
| Интеграции | Минимум, часто только чтение данных | Запись в CRM и 1С, действия в системах |
| Надёжность | Ручной контроль ответов | Мониторинг, алерты, фолбэк на человека |
| Безопасность | Тестовые данные или обезличенные | Права доступа, журналы, защита от промпт-инъекций |
| Результат | Замер точности, доли задач без оператора, экономии времени | Стабильная работа и отчётность по метрикам |
| Бюджет в нашей студии | от 200 000 ₽ | от 500 000 ₽ |
Пилот не выбрасывается: база знаний, промпты и часть кода переходят в продакшн. Поэтому общий бюджет проекта не равен сумме двух строк — скорее, продакшн достраивает пилот до рабочего состояния.
Стоимость токенов: российские модели и зарубежные API
Модели тарифицируются за токены — фрагменты текста, из которых модель собирает запрос и ответ. В русском тексте один токен — в среднем часть слова. Платите вы и за то, что отправляете модели (инструкции, фрагменты базы знаний, история диалога), и за то, что она генерирует. Ориентиры по опубликованным тарифам на сентябрь 2026 года, с НДС:
| Модель | Цена за 1000 токенов | Комментарий |
|---|---|---|
| GigaChat Lite | 0,065 ₽ | Оплата по факту для юрлиц; асинхронный режим вдвое дешевле |
| GigaChat Pro | 0,5 ₽ | Есть пакеты токенов со сроком действия |
| GigaChat Max | 0,65 ₽ | Старшая модель линейки |
| YandexGPT Lite | 0,2 ₽ | Вход и выход по одной цене |
| YandexGPT Pro 5.1 | 0,8 ₽ | Асинхронный режим — 0,41 ₽ |
Цены GigaChat — по прайсу developers.sber.ru для действующих клиентов: с 1 сентября 2026 года новые юрлица подключаются через платформу cloud.ru, где действует свой прайс. У Сбера минимальный платёж при оплате по факту — 600 ₽ в месяц, а эмбеддинги для векторного поиска стоят копейки: у Яндекса векторизация миллиона токенов документации обходится примерно в 10 ₽. Тарифы пересматриваются несколько раз в год, поэтому перед расчётом бюджета сверяйтесь с актуальными прайсами провайдеров.
Зарубежные API (OpenAI, Anthropic, Google) тарифицируются в долларах за миллион токенов. Младшие модели по цене сопоставимы с российскими, флагманы заметно дороже. Для российской компании добавляются две проблемы: оплата — только через посредников с наценкой, а передача персональных данных клиентов за рубеж требует соблюдения 152-ФЗ: по ст. 12 с 1 марта 2023 года оператор обязан уведомить Роскомнадзор о трансграничной передаче до её начала, а первичный сбор и хранение данных граждан РФ должны идти в базах на территории России. Поэтому зарубежные модели чаще используют для задач без персональных данных, а клиентские диалоги отдают российским моделям или своему контуру.
Сколько стоит содержать ИИ-агента в месяц: расчёт
Считать удобнее не от прайса, а от стоимости одного обращения. Типовой вопрос в поддержку: около 2000 входящих токенов (инструкция, фрагменты базы знаний, вопрос) и 500 исходящих — 2500 токенов.
| Модель | 1 обращение | 1000 обращений в день, месяц |
|---|---|---|
| GigaChat Lite | ≈0,16 ₽ | ≈4 900 ₽ |
| YandexGPT Lite | 0,5 ₽ | 15 000 ₽ |
| GigaChat Pro | 1,25 ₽ | 37 500 ₽ |
| YandexGPT Pro 5.1 | 2 ₽ | 60 000 ₽ |
С агентом всё дороже. Агент работает в несколько шагов — поднять данные, проверить, вызвать инструмент, ответить — и на каждом шаге заново отправляет модели накопленный контекст. Задача из 6 шагов с контекстом около 5000 токенов на шаге — это уже порядка 30 000 токенов, или около 24 ₽ на YandexGPT Pro 5.1. Разница с простым ответом — на порядок, и её надо закладывать в прогноз заранее.
Свой сервер с GPU или API: когда окупается
Открытые модели (Qwen, Llama, gpt-oss и другие модели с открытыми весами) можно запустить на своём или арендованном сервере с GPU. Тогда вы платите не за токены, а за железо — круглосуточно, независимо от нагрузки.
Порядок цифр даёт выделенный инстанс открытой модели в Yandex AI Studio: конфигурация S для T-Pro 2.0 стоит 756,40 ₽ в час, это около 545 000 ₽ в месяц при работе 24/7. На эти деньги через API YandexGPT Pro 5.1 можно купить примерно 680 млн токенов — около 9000 обращений в сутки по 2500 токенов. Аренда или покупка своего GPU-сервера может быть дешевле, но к ней добавляются администрирование, обновление моделей и резервирование.
- API выгоднее, если нагрузка — сотни или несколько тысяч обращений в день, неравномерна по времени и вам важно быстро переходить на новые версии моделей.
- Свой сервер оправдан, если данные нельзя выпускать из закрытого контура (медицина, финансы, госзаказчики), нагрузка стабильно высокая или нужна дообученная модель под узкую задачу.
- Гибрид — частый практичный вариант: чувствительные данные обрабатывает локальная модель, остальное — API.
Расчёт окупаемости на примере обработки заявок
Возьмём отдел, который обрабатывает входящие обращения: вопросы о ценах, сроках, наличии, статусе заказа. Все исходные данные — допущения для примера, в вашем расчёте их нужно заменить своими.
- Нагрузка: 3000 обращений в месяц, в среднем 6 минут сотрудника на каждое — 300 часов.
- Стоимость часа: полная стоимость часа сотрудника (зарплата, взносы, рабочее место) — 600 ₽. Итого 180 000 ₽ в месяц на процесс.
- Эффект: агент закрывает без оператора 60% обращений — 180 часов, или 108 000 ₽ в месяц.
- Операционные расходы: токены — 3000 × 2 ₽ = 6000 ₽ на YandexGPT Pro 5.1, с запасом на многошаговые сценарии — до 20 000 ₽; поддержка — условно 25 000 ₽. Итого до 45 000 ₽.
- Чистый эффект: 108 000 − 45 000 = 63 000 ₽ в месяц.
- Окупаемость: ассистент за 250 000 ₽ — около 4 месяцев; решение с интеграциями за 500 000 ₽ — около 8 месяцев.
Экономия времени превращается в деньги только тогда, когда освободившиеся часы что-то приносят: сотрудник переключается на продажи, не нужно нанимать ещё одного оператора при росте потока, закрываются ночные и выходные обращения, которые раньше терялись. Если высвобожденные часы никуда не идут, окупаемость на бумаге не станет реальной.
Скрытые расходы, которые забывают в смете
- Время ваших сотрудников. Эксперты собирают и проверяют базу знаний, размечают спорные ответы, принимают пилот. Это десятки часов, которые не видны в смете подрядчика.
- Рост нагрузки. Счёт за токены растёт вместе с числом диалогов и длиной контекста. Нужен прогноз на двукратный рост.
- Хранение индекса и логов. Векторная база и история диалогов тарифицируются отдельно: у Яндекса хранение поискового индекса — 10,6 ₽ за гигабайт в сутки.
- Смена версии модели. Провайдеры выпускают новые версии и выводят старые; промпты приходится перекалибровать и заново тестировать.
- Требования 152-ФЗ. Обезличивание, согласия, выбор провайдера с хранением данных в России — иногда это отдельная доработка.
- Лицензии и лимиты смежных систем. Тариф CRM с доступом к API, дополнительные пользователи, лимиты запросов у 1С или телефонии.
- Контроль качества. Набор тестовых вопросов, регулярная проверка ответов, разбор ошибок — без этого качество деградирует незаметно.
Как снизить бюджет на внедрение ИИ
- Начните с одного процесса. Пилот на задаче с большим объёмом повторяющихся действий покажет эффект быстрее и дешевле, чем «ИИ во всей компании».
- Сначала читать, потом писать. Агент, который готовит черновик ответа или карточку лида для менеджера, проще и безопаснее агента, который сам меняет данные в 1С. Права на запись добавляйте после пилота.
- Наведите порядок в базе знаний до разработки. Актуальные регламенты и прайсы сокращают сроки сильнее, чем торг по ставке.
- Подберите модель под задачу. Классификация обращений и извлечение полей не требуют флагмана.
- Используйте готовые компоненты для типового: векторный поиск, распознавание речи, коннекторы к CRM. Заказная разработка нужна для логики, которая отличает ваш процесс.
- Сохраняйте права на код и промпты. Это страхует от повторной разработки при смене подрядчика или платформы.
Если первая задача — входящие заявки и продажи, ограниченный по объёму проект вроде ИИ-бота для квалификации лидов часто даёт измеримый результат уже через несколько недель после запуска. Для процессов с действиями в нескольких системах логичнее сразу проектировать AI-агента с интеграциями, но запускать его тоже поэтапно.
Ошибки при планировании бюджета на ИИ
- Считать только разработку. Ежемесячные расходы на токены и поддержку за год могут сравняться с разовым бюджетом.
- Оценивать по демо. Три удачных примера на презентации ничего не говорят о работе на тысяче реальных обращений.
- Не зафиксировать метрики до старта. Без исходных цифр — время обработки, доля потерянных заявок, нагрузка на сотрудников — потом нечем доказать эффект.
- Автоматизировать всё сразу. Бюджет размазывается, ни один процесс не доходит до продакшна.
- Выбрать платформу с оплатой за диалоги без расчёта роста. На старте дёшево, при росте нагрузки тариф растёт быстрее эффекта, а уйти некуда.
- Не предусмотреть передачу человеку. Агент без фолбэка на сотрудника рано или поздно ответит клиенту неверно в дорогой ситуации.
Чек-лист: что подготовить перед запросом сметы
- Выбран один процесс для старта и описано, как он работает сейчас
- Посчитан объём: обращений или документов в месяц, минут сотрудника на единицу
- Известна полная стоимость часа сотрудников, занятых в процессе
- Зафиксированы исходные метрики, по которым будете оценивать эффект
- Собраны документы для базы знаний и назначен ответственный за их актуальность
- Составлен список систем для интеграции и проверен доступ к их API
- Понятно, есть ли в процессе персональные данные и где их можно обрабатывать
- Запрошен у подрядчика прогноз ежемесячных расходов на токены и поддержку
- В договоре зафиксированы этапы, пилот с метриками и передача кода и промптов
Вывод
Стоимость внедрения ИИ — это разовый бюджет на разработку плюс переменные расходы на владение. Разовая часть определяется интеграциями и состоянием данных, переменная — выбором модели, длиной контекста и объёмом нагрузки. Токены российских моделей для типового обращения стоят от копеек до пары рублей, свой GPU-сервер оправдан при закрытом контуре или стабильно высокой нагрузке. Самый надёжный способ не переплатить — диагностика, пилот на одном процессе с замером метрик и только потом масштабирование. С чего начать, если ИИ в компании пока не используется, — в материале нейросети для бизнеса: с чего начать.
