Выбор AI-модели для ИИ-агента: как не разориться при росте нагрузки
Когда мы делаем ИИ-агент для клиентов, вопрос выбора модели встает первым. OpenAI или Anthropic? Yandex или Сбер? А если 1000 диалогов в день? А если данных в базе знаний становится слишком много?
Годы работы с ИИ-агентами разного размера показали: выбор модели зависит не столько от того, «какая лучше», сколько от нагрузки и объема данных. То, что работает у бота с 50 диалогов в месяц, разорит вас на 5000. И наоборот — модель, выбранная под большую нагрузку, часто не оправдывает себя, если поток небольшой.
В статье:
- Сравнение 6 популярных моделей: цена, скорость, качество русского
- Альтернативные, менее известные модели, которые в некоторых задачах выигрывают
- Правила выбора при разной нагрузке
- Когда стоит подключать RAG (поиск по базе знаний)
- Как сохранить качество и снизить стоимость при росте
Что оцениваем при выборе
Четыре параметра, определяющих выбор модели для ИИ-агента:
- Цена за 1000 диалогов, а не за 1M токенов. Между провайдерами разница до 50 раз.
- Латентность (TTFT) — время до первого символа ответа. Больше 2 секунд клиент в чате уже не готов ждать.
- Качество русского языка. На простых вопросах модели одинаковы. Различия видны на сложных.
- Контекстное окно. Сколько бот может «помнить» в диалоге и в подложенных материалах.
Сравнение 6 моделей
Мы выбрали шесть моделей, которые чаще всего рассматривают для ИИ-агентов в 2026:
| Модель | Провайдер | 1000 диалогов | TTFT | Русский |
|---|---|---|---|---|
| GPT-4o | OpenAI | ~1250 ₽ ($15.50) | ~1 с | 5/5 |
| GPT-5.4-mini | OpenAI | ~470 ₽ ($5.85) | ~0.4 с | 4/5 |
| GPT-5.4-nano | OpenAI | ~130 ₽ ($1.60) | ~0.3 с | 3–4/5 |
| Claude Sonnet 4.6 | Anthropic | ~1680 ₽ ($21) | ~2 с | 5/5 |
| YandexGPT 5 Pro | Yandex | ~1520 ₽ | ~1 с | 5/5 |
| GigaChat 2 Pro | Сбер | ~1900 ₽ | ~1 с | 4–5/5 |
Базовый расчет: 3000 input токенов на диалог (системный промт + история) + 800 output токенов на ответы бота. Реальный расчет может отличаться в 2 раза в обе стороны в зависимости от длины ответов и количества сообщений в диалоге.
GPT-4o — рабочая лошадка OpenAI. Отличный русский, стабильное качество, латентность около 1 секунды. Подходит под большинство задач: FAQ, консультации, продажи. Хороший баланс цена/качество для типового B2C-бота.
GPT-5.4-mini — новая бюджетная модель OpenAI, заменившая GPT-4o-mini. Быстрее, чем старший брат, качество русского на 4 из 5 — норм для FAQ и коротких ответов. Если 90% диалогов — типовые вопросы, mini закрывает большинство сценариев в 3-4 раза дешевле.
GPT-5.4-nano — ультра-бюджетная модель для классификации, роутинга, разбора коротких запросов. За 130 рублей делает 1000 диалогов. Русский слабее (3–4/5), поэтому как основная модель не подходит, но как классификатор в связке — очень эффективна.
Claude Sonnet 4.6 — универсальная модель Anthropic для сложных задач. Отличный русский, контекст до 1M токенов — можно передавать в промт много справочной информации. Стоит дороже GPT-4o, но с prompt caching разница нивелируется. Хороша там, где нужен рассуждающий ответ на сложный вопрос с большим контекстом.
YandexGPT 5 Pro — российская модель, серверы в РФ, оплата в рублях, договор + счет. Родной русский, лидер по локальным бенчмаркам (SLAVA). Хорошо знает ФЗ-контекст, ГОСТы, российские реалии. Работает хорошо для отелей, клиник, тур-бизнеса — там, где важно понимать местную специфику.
GigaChat 2 Pro — второй российский вариант, от Сбера. Серверы в РФ, оплата в рублях. Хорошо знает бизнес-контекст, документооборот, финансовую тематику. Цена конкурентная — Сбер снизил тарифы в 3 раза в 2026, теперь GigaChat дешевле большинства зарубежных моделей.
Сколько платить при разной нагрузке
Ключевая мысль: чем меньше диалогов, тем меньше важна экономия, тем важнее качество.
До 100 диалогов в месяц
Любая модель обойдется в копейки:
- GPT-4o: ~125 ₽/мес
- Claude Sonnet 4.6: ~170 ₽/мес
- YandexGPT 5 Pro: ~150 ₽/мес
- GPT-5.4-mini: ~50 ₽/мес
Выбирайте по качеству, не по цене. Возьмите ту, что лучше отвечает на реальных вопросах ваших клиентов. Разница в бюджете здесь несущественна.
500–1000 диалогов в месяц
Появляется ощутимая вилка:
- GPT-4o: 625–1250 ₽/мес
- Claude Sonnet 4.6: 840–1680 ₽/мес
- YandexGPT 5 Pro: 760–1520 ₽/мес
- GPT-5.4-mini: 235–470 ₽/мес
- GPT-5.4-nano: 65–130 ₽/мес
Выбор зависит от типа диалогов. Простые FAQ — mini или nano вытянет. Сложные консультации — GPT-4o, Sonnet или YandexGPT Pro.
1000+ диалогов в месяц (типичный сервисный B2C)
Здесь начинается настоящая экономика. При 400 диалогах в день (около 12 000 в месяц):
- GPT-4o: ~15 000 ₽/мес (~500 ₽/день — цифра, которую мы видим у своих клиентов на GPT-4o в реальной эксплуатации)
- Claude Sonnet 4.6: ~20 000 ₽/мес
- YandexGPT 5 Pro: ~18 000 ₽/мес
- GPT-5.4-mini: ~5 600 ₽/мес
- GPT-5.4-nano: ~1 500 ₽/мес
Разница между топ- и бюджетной моделью — в 10 раз. При росте до 30 000+ диалогов игнорировать ее невозможно.
Ключевой инсайт: при потоке от 1000 диалогов в месяц одной моделью обходиться становится дорого. Выгодно комбинировать несколько. И параллельно с этим — подключать RAG, но об этом ниже.
Когда стоит подключать RAG
RAG (Retrieval-Augmented Generation) — это подход, при котором бот сначала ищет ответ в подключенной базе знаний (векторной или гибридной), а модель формирует итоговый ответ на основе найденных фрагментов. Не нужно засовывать все в системный промт.
Когда RAG избыточен:
- У вас 5–10 страниц описаний услуг, регламентов, прайсов. Все это влезает в системный промт (~15 000 токенов) без потерь.
- Диалогов не больше нескольких десятков в месяц.
- Данные почти не меняются — раз в квартал добавляете абзац.
В таких условиях RAG — это лишний слой сложности. Проще держать все в промте, обновлять руками.
Когда RAG становится нужен:
- Рост объема данных. База знаний перевалила за 30–50 страниц. Пихать все в промт становится дорого — на каждый диалог 30–50 тысяч input-токенов. Это утроит-упятерит счет от провайдера. RAG отфильтровывает только релевантные ~500–1500 токенов и подкладывает их в контекст.
- Рост количества запросов. Диалогов больше 500–1000 в месяц. Даже если данных немного — на большом объеме диалогов экономия на input-токенах окупает разработку и поддержку RAG.
- Данные часто обновляются. Прайсы, расписания, акции меняются еженедельно. Векторная база обновляется одним апдейтом файла — быстрее, чем править и тестировать промт после каждого изменения.
- Нужны цитаты. Клиент спрашивает «откуда это правило?» — бот показывает, из какого пункта регламента взят ответ. Без RAG цитирование ненадежно, модель может выдумывать источники.
Практический порог: RAG становится оправданным примерно с 50 страниц данных или 500 диалогов в месяц. Ниже — можно уместить все в промт. Выше — RAG почти всегда окупает разработку за 1–2 месяца эксплуатации.
Как сохранить качество и снизить стоимость
Пять техник, которые мы применяем в реальных ботах для оптимизации бюджета без потери качества.
1. Роутинг по типу вопроса
Классифицируем входящие вопросы и направляем в разные модели:
- Простые FAQ («какое время работы?», «как добраться?») → дешевая модель (nano или mini).
- Сложные консультации («какой тариф подойдет для семьи из 5 человек с 2 детьми и годовым абонементом?») → топ (GPT-4o или Sonnet).
Классификатор (легкая модель или свой на эмбеддингах) определяет тип за <0.3 секунды. Стоимость классификации — около $0.001 за запрос.
Пример: 70% диалогов простые, 30% сложные. Средняя цена диалога падает в 2–3 раза относительно случая «все через GPT-4o».
2. Роутинг по размеру вопроса
Более простой подход: смотрим на длину входящего сообщения и структуру:
- Короткие (<50 символов, часто одно-два слова) → мини-модель.
- Длинные (>200 символов) или с уточнениями → топ.
Работает если пользователи часто пишут короткие уточнения — «да», «нет», «сколько?». Роутинг тривиальный, без ML-классификатора — простая регулярка или счетчик символов. Плюс: меньше рисков ошибки в роутинге, поскольку правило детерминированное.
3. Каскад с эскалацией
Сначала мини-модель отвечает. Если она не уверена — просим топ-модель.
Реализация: мини-модель отвечает и возвращает поле confidence или флаг «уверен: да/нет» рядом с ответом. Если не уверена — эскалируем на топ-модель с исходным вопросом и накопленным контекстом.
Экономия: 80–90% диалогов закрываются мини-моделью. Только 10–20% доходят до топ. При этом качество ответов на сложных вопросах остается высоким.
4. RAG-first, LLM-second
Основную работу делает поиск в базе знаний:
- RAG находит точный ответ в базе → легкая модель форматирует его в диалог.
- RAG не нашел — топ-модель отвечает, рассуждая на основе контекста.
95% простых вопросов закрываются точным ответом из базы. Только 5% требуют «рассуждения» — там нужна топ-модель. LLM в этом сценарии — форматтер, а не источник знаний. Это самая устойчивая архитектура против галлюцинаций.
5. Prompt caching
Работает у OpenAI и Anthropic: системный промт кэшируется на стороне провайдера. При каждом следующем запросе кэшированные токены стоят в 10 раз дешевле.
Практически: если системный промт стабилен (типичная ситуация — все инструкции, тон, описание услуг), 90% input-токенов идут по «кэш-цене». Реальная стоимость диалога снижается в 2–4 раза без изменения качества.
Включается одной строкой в API-запросе (у Anthropic — cache_control, у OpenAI — автоматически). Обязательно к использованию от 500 диалогов/мес.
Наш подход
Модель для каждого клиента подбираем индивидуально. Это зависит от объема диалогов, специфики вопросов, требований по скорости ответа, чувствительности данных и бюджета. Для одного клиента оптимальна одна универсальная модель со стабильным качеством, для другого — комбо с роутингом и эскалацией на топ, для третьего — полностью on-premise open-source вариант.
На практике мы применяем все техники из этой статьи: роутинг, каскад, RAG-first, prompt caching, а также экспериментируем с менее популярными моделями там, где они дают выигрыш по цене или качеству. Единый рецепт не подходит — каждый бот получает индивидуально настроенное решение.
Что мы поняли на практике:
- Prompt caching обязателен. Системный промт длинный (RAG-контекст + инструкции), кэширование снижает его стоимость в 10 раз. Включать при любых объемах от 500 диалогов/мес.
- Экономия на output важнее, чем на input. Output-токены дороже input-токенов в 4–5 раз. Настройка максимальной длины ответа и лаконичные формулировки — прямая экономия.
- RAG подключаем от 50 страниц данных или 500 диалогов/мес. До этого — держим все в промте, проще.
- Регулярно тестируем менее популярные модели — рынок меняется быстро, и то, что вчера было экзотикой, сегодня может стать оптимальным выбором.
Альтернативные, менее популярные модели
Топ-6 моделей — это то, что чаще всего рассматривают в первую очередь. Но рынок AI-моделей шире, и в некоторых задачах менее популярные варианты выигрывают у мейнстрима — по цене, качеству, скорости или специфике.
DeepSeek (V3, R1) — китайская модель, которая за последний год сильно выросла в качестве. На технических задачах и задачах на рассуждение показывает результаты уровня топовых Claude/GPT, при этом стоит в разы дешевле. Русский язык — на приличном уровне, ниже YandexGPT, но выше многих западных моделей за ту же цену. Хороший выбор, если задача — сложные консультации с рассуждением, а бюджет ограничен.
Mistral Large / Codestral — французская, лидер европейского open-source рынка. Хорошо работает на европейских языках, компетентна в коде и технических вопросах. Русский — средний. Подходит, если бот работает в мультиязычном сценарии с приоритетом европейских языков.
Qwen (Alibaba) — китайская, но многоязычная. Русский на приемлемом уровне, при этом одна из самых дешевых в open-source сегменте (если разворачивать self-host). Интересна, когда важна конфиденциальность и есть возможность on-premise.
Cohere Command — специализируется на RAG-сценариях, хорошо работает с длинным контекстом и цитированием источников. Не самый популярный выбор, но в задачах, где бот должен приводить точные цитаты из документов, часто обходит универсальные модели.
Grok (xAI) — набирает популярность. Русский язык — базовый, но неплох. Хорошо работает на актуальных данных (интегрирована с потоком свежей информации). В нишевых задачах, где важна свежесть контекста, может быть полезна.
Смысл рассматривать эти модели — не заменять мейнстрим на альтернативы поголовно, а знать, что при специфической задаче стоит протестировать. Иногда экономия в 3-5 раз при том же качестве оправдывает эксперимент.
Вывод
Три правила выбора AI-модели для ИИ-агента:
1. При малом трафике (до 500 диалогов/мес) выбирайте по качеству, не по цене.
Разница между дорогой и дешевой моделью — сотни рублей в месяц. Возьмите ту, что лучше отвечает на реальных вопросах ваших клиентов. Тестируйте на своих сценариях, не на публичных бенчмарках.
2. При среднем и большом трафике (500+ диалогов/мес) используйте комбинацию моделей.
Экономия в 2–4 раза на реальных счетах при том же качестве ответов. Три техники — роутинг + каскад + prompt caching — покрывают 90% сценариев.
3. Подключайте RAG, когда база знаний растет или запросов становится много.
Порог — примерно 50 страниц данных или 500 диалогов/мес. До этого RAG избыточен. После — экономия на input-токенах окупает разработку за 1–2 месяца.
И четвертое, неявное: не ограничивайте выбор мейнстримом. Модели типа DeepSeek, Qwen, Mistral, Cohere иногда дают лучшее соотношение цена/качество для конкретной задачи. Стоит держать их в поле зрения и тестировать.
Главное: модель — это инструмент. Успех бота определяется архитектурой диалога, качеством базы знаний и промт-инжинирингом. Дешевая модель с хорошим промтом и правильным RAG бьет дорогую модель «из коробки». Не платите за то, что не нужно, — и не экономьте там, где это стоит клиенту доверия.
Мы в BoostBot несколько лет разрабатываем ИИ-агентов и голосовых агентов под задачу — для бизнеса с большим клиентопотоком. Отели, аквапарки, клиники, фитнес-клубы, развлекательные центры, а также голосовые агенты для приема звонков и обзвона. За качеством работы бота у клиента следит наша команда: разбираем диалоги, обновляем базу знаний, обучаем на новых вопросах.
Больше материалов, кейсов и разборов — в нашем Telegram-канале: t.me/boostbotru
Скачать бесплатный чек-лист «10 способов узнать, теряет ли ИИ-агент клиентов» — на boostbot.ru