Обсудить проект
← Все статьи

Выбор AI-модели для ИИ-агента: как не разориться при росте нагрузки

Когда мы делаем ИИ-агент для клиентов, вопрос выбора модели встает первым. OpenAI или Anthropic? Yandex или Сбер? А если 1000 диалогов в день? А если данных в базе знаний становится слишком много?

Годы работы с ИИ-агентами разного размера показали: выбор модели зависит не столько от того, «какая лучше», сколько от нагрузки и объема данных. То, что работает у бота с 50 диалогов в месяц, разорит вас на 5000. И наоборот — модель, выбранная под большую нагрузку, часто не оправдывает себя, если поток небольшой.

В статье:

  • Сравнение 6 популярных моделей: цена, скорость, качество русского
  • Альтернативные, менее известные модели, которые в некоторых задачах выигрывают
  • Правила выбора при разной нагрузке
  • Когда стоит подключать RAG (поиск по базе знаний)
  • Как сохранить качество и снизить стоимость при росте

Что оцениваем при выборе

Четыре параметра, определяющих выбор модели для ИИ-агента:

  1. Цена за 1000 диалогов, а не за 1M токенов. Между провайдерами разница до 50 раз.
  2. Латентность (TTFT) — время до первого символа ответа. Больше 2 секунд клиент в чате уже не готов ждать.
  3. Качество русского языка. На простых вопросах модели одинаковы. Различия видны на сложных.
  4. Контекстное окно. Сколько бот может «помнить» в диалоге и в подложенных материалах.

Сравнение 6 моделей

Мы выбрали шесть моделей, которые чаще всего рассматривают для ИИ-агентов в 2026:

Модель Провайдер 1000 диалогов TTFT Русский
GPT-4o OpenAI ~1250 ₽ ($15.50) ~1 с 5/5
GPT-5.4-mini OpenAI ~470 ₽ ($5.85) ~0.4 с 4/5
GPT-5.4-nano OpenAI ~130 ₽ ($1.60) ~0.3 с 3–4/5
Claude Sonnet 4.6 Anthropic ~1680 ₽ ($21) ~2 с 5/5
YandexGPT 5 Pro Yandex ~1520 ₽ ~1 с 5/5
GigaChat 2 Pro Сбер ~1900 ₽ ~1 с 4–5/5

Базовый расчет: 3000 input токенов на диалог (системный промт + история) + 800 output токенов на ответы бота. Реальный расчет может отличаться в 2 раза в обе стороны в зависимости от длины ответов и количества сообщений в диалоге.

GPT-4o — рабочая лошадка OpenAI. Отличный русский, стабильное качество, латентность около 1 секунды. Подходит под большинство задач: FAQ, консультации, продажи. Хороший баланс цена/качество для типового B2C-бота.

GPT-5.4-mini — новая бюджетная модель OpenAI, заменившая GPT-4o-mini. Быстрее, чем старший брат, качество русского на 4 из 5 — норм для FAQ и коротких ответов. Если 90% диалогов — типовые вопросы, mini закрывает большинство сценариев в 3-4 раза дешевле.

GPT-5.4-nano — ультра-бюджетная модель для классификации, роутинга, разбора коротких запросов. За 130 рублей делает 1000 диалогов. Русский слабее (3–4/5), поэтому как основная модель не подходит, но как классификатор в связке — очень эффективна.

Claude Sonnet 4.6 — универсальная модель Anthropic для сложных задач. Отличный русский, контекст до 1M токенов — можно передавать в промт много справочной информации. Стоит дороже GPT-4o, но с prompt caching разница нивелируется. Хороша там, где нужен рассуждающий ответ на сложный вопрос с большим контекстом.

YandexGPT 5 Pro — российская модель, серверы в РФ, оплата в рублях, договор + счет. Родной русский, лидер по локальным бенчмаркам (SLAVA). Хорошо знает ФЗ-контекст, ГОСТы, российские реалии. Работает хорошо для отелей, клиник, тур-бизнеса — там, где важно понимать местную специфику.

GigaChat 2 Pro — второй российский вариант, от Сбера. Серверы в РФ, оплата в рублях. Хорошо знает бизнес-контекст, документооборот, финансовую тематику. Цена конкурентная — Сбер снизил тарифы в 3 раза в 2026, теперь GigaChat дешевле большинства зарубежных моделей.

Сколько платить при разной нагрузке

Ключевая мысль: чем меньше диалогов, тем меньше важна экономия, тем важнее качество.

До 100 диалогов в месяц

Любая модель обойдется в копейки:

  • GPT-4o: ~125 ₽/мес
  • Claude Sonnet 4.6: ~170 ₽/мес
  • YandexGPT 5 Pro: ~150 ₽/мес
  • GPT-5.4-mini: ~50 ₽/мес

Выбирайте по качеству, не по цене. Возьмите ту, что лучше отвечает на реальных вопросах ваших клиентов. Разница в бюджете здесь несущественна.

500–1000 диалогов в месяц

Появляется ощутимая вилка:

  • GPT-4o: 625–1250 ₽/мес
  • Claude Sonnet 4.6: 840–1680 ₽/мес
  • YandexGPT 5 Pro: 760–1520 ₽/мес
  • GPT-5.4-mini: 235–470 ₽/мес
  • GPT-5.4-nano: 65–130 ₽/мес

Выбор зависит от типа диалогов. Простые FAQ — mini или nano вытянет. Сложные консультации — GPT-4o, Sonnet или YandexGPT Pro.

1000+ диалогов в месяц (типичный сервисный B2C)

Здесь начинается настоящая экономика. При 400 диалогах в день (около 12 000 в месяц):

  • GPT-4o: ~15 000 ₽/мес (~500 ₽/день — цифра, которую мы видим у своих клиентов на GPT-4o в реальной эксплуатации)
  • Claude Sonnet 4.6: ~20 000 ₽/мес
  • YandexGPT 5 Pro: ~18 000 ₽/мес
  • GPT-5.4-mini: ~5 600 ₽/мес
  • GPT-5.4-nano: ~1 500 ₽/мес

Разница между топ- и бюджетной моделью — в 10 раз. При росте до 30 000+ диалогов игнорировать ее невозможно.

Ключевой инсайт: при потоке от 1000 диалогов в месяц одной моделью обходиться становится дорого. Выгодно комбинировать несколько. И параллельно с этим — подключать RAG, но об этом ниже.

Когда стоит подключать RAG

RAG (Retrieval-Augmented Generation) — это подход, при котором бот сначала ищет ответ в подключенной базе знаний (векторной или гибридной), а модель формирует итоговый ответ на основе найденных фрагментов. Не нужно засовывать все в системный промт.

Когда RAG избыточен:

  • У вас 5–10 страниц описаний услуг, регламентов, прайсов. Все это влезает в системный промт (~15 000 токенов) без потерь.
  • Диалогов не больше нескольких десятков в месяц.
  • Данные почти не меняются — раз в квартал добавляете абзац.

В таких условиях RAG — это лишний слой сложности. Проще держать все в промте, обновлять руками.

Когда RAG становится нужен:

  • Рост объема данных. База знаний перевалила за 30–50 страниц. Пихать все в промт становится дорого — на каждый диалог 30–50 тысяч input-токенов. Это утроит-упятерит счет от провайдера. RAG отфильтровывает только релевантные ~500–1500 токенов и подкладывает их в контекст.
  • Рост количества запросов. Диалогов больше 500–1000 в месяц. Даже если данных немного — на большом объеме диалогов экономия на input-токенах окупает разработку и поддержку RAG.
  • Данные часто обновляются. Прайсы, расписания, акции меняются еженедельно. Векторная база обновляется одним апдейтом файла — быстрее, чем править и тестировать промт после каждого изменения.
  • Нужны цитаты. Клиент спрашивает «откуда это правило?» — бот показывает, из какого пункта регламента взят ответ. Без RAG цитирование ненадежно, модель может выдумывать источники.

Практический порог: RAG становится оправданным примерно с 50 страниц данных или 500 диалогов в месяц. Ниже — можно уместить все в промт. Выше — RAG почти всегда окупает разработку за 1–2 месяца эксплуатации.

Как сохранить качество и снизить стоимость

Пять техник, которые мы применяем в реальных ботах для оптимизации бюджета без потери качества.

1. Роутинг по типу вопроса

Классифицируем входящие вопросы и направляем в разные модели:

  • Простые FAQ («какое время работы?», «как добраться?») → дешевая модель (nano или mini).
  • Сложные консультации («какой тариф подойдет для семьи из 5 человек с 2 детьми и годовым абонементом?») → топ (GPT-4o или Sonnet).

Классификатор (легкая модель или свой на эмбеддингах) определяет тип за <0.3 секунды. Стоимость классификации — около $0.001 за запрос.

Пример: 70% диалогов простые, 30% сложные. Средняя цена диалога падает в 2–3 раза относительно случая «все через GPT-4o».

2. Роутинг по размеру вопроса

Более простой подход: смотрим на длину входящего сообщения и структуру:

  • Короткие (<50 символов, часто одно-два слова) → мини-модель.
  • Длинные (>200 символов) или с уточнениями → топ.

Работает если пользователи часто пишут короткие уточнения — «да», «нет», «сколько?». Роутинг тривиальный, без ML-классификатора — простая регулярка или счетчик символов. Плюс: меньше рисков ошибки в роутинге, поскольку правило детерминированное.

3. Каскад с эскалацией

Сначала мини-модель отвечает. Если она не уверена — просим топ-модель.

Реализация: мини-модель отвечает и возвращает поле confidence или флаг «уверен: да/нет» рядом с ответом. Если не уверена — эскалируем на топ-модель с исходным вопросом и накопленным контекстом.

Экономия: 80–90% диалогов закрываются мини-моделью. Только 10–20% доходят до топ. При этом качество ответов на сложных вопросах остается высоким.

4. RAG-first, LLM-second

Основную работу делает поиск в базе знаний:

  • RAG находит точный ответ в базе → легкая модель форматирует его в диалог.
  • RAG не нашел — топ-модель отвечает, рассуждая на основе контекста.

95% простых вопросов закрываются точным ответом из базы. Только 5% требуют «рассуждения» — там нужна топ-модель. LLM в этом сценарии — форматтер, а не источник знаний. Это самая устойчивая архитектура против галлюцинаций.

5. Prompt caching

Работает у OpenAI и Anthropic: системный промт кэшируется на стороне провайдера. При каждом следующем запросе кэшированные токены стоят в 10 раз дешевле.

Практически: если системный промт стабилен (типичная ситуация — все инструкции, тон, описание услуг), 90% input-токенов идут по «кэш-цене». Реальная стоимость диалога снижается в 2–4 раза без изменения качества.

Включается одной строкой в API-запросе (у Anthropic — cache_control, у OpenAI — автоматически). Обязательно к использованию от 500 диалогов/мес.

Наш подход

Модель для каждого клиента подбираем индивидуально. Это зависит от объема диалогов, специфики вопросов, требований по скорости ответа, чувствительности данных и бюджета. Для одного клиента оптимальна одна универсальная модель со стабильным качеством, для другого — комбо с роутингом и эскалацией на топ, для третьего — полностью on-premise open-source вариант.

На практике мы применяем все техники из этой статьи: роутинг, каскад, RAG-first, prompt caching, а также экспериментируем с менее популярными моделями там, где они дают выигрыш по цене или качеству. Единый рецепт не подходит — каждый бот получает индивидуально настроенное решение.

Что мы поняли на практике:

  • Prompt caching обязателен. Системный промт длинный (RAG-контекст + инструкции), кэширование снижает его стоимость в 10 раз. Включать при любых объемах от 500 диалогов/мес.
  • Экономия на output важнее, чем на input. Output-токены дороже input-токенов в 4–5 раз. Настройка максимальной длины ответа и лаконичные формулировки — прямая экономия.
  • RAG подключаем от 50 страниц данных или 500 диалогов/мес. До этого — держим все в промте, проще.
  • Регулярно тестируем менее популярные модели — рынок меняется быстро, и то, что вчера было экзотикой, сегодня может стать оптимальным выбором.

Альтернативные, менее популярные модели

Топ-6 моделей — это то, что чаще всего рассматривают в первую очередь. Но рынок AI-моделей шире, и в некоторых задачах менее популярные варианты выигрывают у мейнстрима — по цене, качеству, скорости или специфике.

DeepSeek (V3, R1) — китайская модель, которая за последний год сильно выросла в качестве. На технических задачах и задачах на рассуждение показывает результаты уровня топовых Claude/GPT, при этом стоит в разы дешевле. Русский язык — на приличном уровне, ниже YandexGPT, но выше многих западных моделей за ту же цену. Хороший выбор, если задача — сложные консультации с рассуждением, а бюджет ограничен.

Mistral Large / Codestral — французская, лидер европейского open-source рынка. Хорошо работает на европейских языках, компетентна в коде и технических вопросах. Русский — средний. Подходит, если бот работает в мультиязычном сценарии с приоритетом европейских языков.

Qwen (Alibaba) — китайская, но многоязычная. Русский на приемлемом уровне, при этом одна из самых дешевых в open-source сегменте (если разворачивать self-host). Интересна, когда важна конфиденциальность и есть возможность on-premise.

Cohere Command — специализируется на RAG-сценариях, хорошо работает с длинным контекстом и цитированием источников. Не самый популярный выбор, но в задачах, где бот должен приводить точные цитаты из документов, часто обходит универсальные модели.

Grok (xAI) — набирает популярность. Русский язык — базовый, но неплох. Хорошо работает на актуальных данных (интегрирована с потоком свежей информации). В нишевых задачах, где важна свежесть контекста, может быть полезна.

Смысл рассматривать эти модели — не заменять мейнстрим на альтернативы поголовно, а знать, что при специфической задаче стоит протестировать. Иногда экономия в 3-5 раз при том же качестве оправдывает эксперимент.

Вывод

Три правила выбора AI-модели для ИИ-агента:

1. При малом трафике (до 500 диалогов/мес) выбирайте по качеству, не по цене.

Разница между дорогой и дешевой моделью — сотни рублей в месяц. Возьмите ту, что лучше отвечает на реальных вопросах ваших клиентов. Тестируйте на своих сценариях, не на публичных бенчмарках.

2. При среднем и большом трафике (500+ диалогов/мес) используйте комбинацию моделей.

Экономия в 2–4 раза на реальных счетах при том же качестве ответов. Три техники — роутинг + каскад + prompt caching — покрывают 90% сценариев.

3. Подключайте RAG, когда база знаний растет или запросов становится много.

Порог — примерно 50 страниц данных или 500 диалогов/мес. До этого RAG избыточен. После — экономия на input-токенах окупает разработку за 1–2 месяца.

И четвертое, неявное: не ограничивайте выбор мейнстримом. Модели типа DeepSeek, Qwen, Mistral, Cohere иногда дают лучшее соотношение цена/качество для конкретной задачи. Стоит держать их в поле зрения и тестировать.

Главное: модель — это инструмент. Успех бота определяется архитектурой диалога, качеством базы знаний и промт-инжинирингом. Дешевая модель с хорошим промтом и правильным RAG бьет дорогую модель «из коробки». Не платите за то, что не нужно, — и не экономьте там, где это стоит клиенту доверия.

Мы в BoostBot несколько лет разрабатываем ИИ-агентов и голосовых агентов под задачу — для бизнеса с большим клиентопотоком. Отели, аквапарки, клиники, фитнес-клубы, развлекательные центры, а также голосовые агенты для приема звонков и обзвона. За качеством работы бота у клиента следит наша команда: разбираем диалоги, обновляем базу знаний, обучаем на новых вопросах.

Больше материалов, кейсов и разборов — в нашем Telegram-канале: t.me/boostbotru

Скачать бесплатный чек-лист «10 способов узнать, теряет ли ИИ-агент клиентов» — на boostbot.ru

Нужен разбор похожей задачи?

Обсудить проект