Внутри платформы

ИИ-агенты на нескольких моделях: одна система, для каждой задачи своя модель

Рейтинг ИИ-моделей перетасовывается каждые несколько месяцев. Бизнес-система, приваренная к одному провайдеру, стареет вместе с ним — и платит цены рассуждающей модели за рутинную работу. Системы Olano мультимодельны по замыслу: каждая задача уходит к наиболее подходящей модели, внутри жёстких лимитов расходов, и ничто в вашей системе не привязано к одному поставщику.

Ловушка одной модели

Выбор ИИ-платформы часто негласно означает выбор ИИ-модели — той самой, на которой строил поставщик. У этого решения два издержки, которые со временем накапливаются.

Первая — дрейф. Передний край движется быстро и неравномерно: в этом квартале один провайдер лидирует в глубоких рассуждениях, другой — в скорости и стоимости, третий — в языке или модальности, которые как раз важны вашим клиентам. Система, способная работать только с одним провайдером, ставит вашу операционку на то, что этот вендор будет побеждать во всех категориях и всегда. Пока такого не было ни у кого.

Вторая — экономика. Работа тоже неоднородна. Разобрать входящие, проставить метку на обращении, вытащить дату брони — это большой объём при низкой сложности, с чем прекрасно справляется быстрая и дешёвая модель. Постоянное исследовательское задание или тонкая жалоба заслуживают самого сильного доступного рассуждения. Гонять всё через флагманскую модель — платить ставку топ-адвоката за подшивку бумаг; гонять всё через бюджетную — ложная экономия, которая вылезает в переписке с клиентами.

Как система Olano распределяет работу

Каждое развёртывание Olano мультимодельное. Агенты могут работать на Claude, OpenAI, DeepSeek, Gemini или локальных моделях — среди 18+ провайдеров LLM, включая Anthropic, OpenAI, Google, Mistral, Groq, DeepSeek, xAI, Cohere, Together, Fireworks, OpenRouter, Perplexity, NVIDIA, Azure OpenAI, AWS Bedrock и локальные модели через Ollama. Платформа направляет каждую задачу к наиболее подходящей модели, модели можно комбинировать по агентам и менять прямо посреди разговора.

В типичном развёртывании это выглядит как специализация — так же, как вы укомплектовали бы команду: агент на ресепшене — на быстрой и толковой модели, рассчитанной на поток разговоров; исследовательский агент тянется к глубокому рассуждению, когда задача этого требует; массовое извлечение данных крутится на самой дешёвой модели, проходящей проверку качества. Одна система, одна память, один аудиторский след — и несколько моделей, каждая на своём.

Расходы ограничены архитектурой, а не силой воли

Мультимодельная маршрутизация — тоже инструмент контроля затрат, но работает она внутри более жёсткой границы: использование ИИ идёт в пределах заранее согласованных жёстких лимитов расходов. Именно лимиты, а не уведомления: сколько бы ни было нагрузки, система не может потратить больше одобренного. А если у вас уже есть аккаунты у провайдеров, поддерживается BYOK (свои ключи) без доплаты: ваша система работает на ваших ключах с той же маршрутизацией, теми же согласованиями и той же историей аудита.

Вы также сохраняете контроль над тем, где обрабатываются данные. Развёртывания работают на управляемой облачной инфраструктуре в изолированных средах, а в индивидуальных проектах обработку можно закрепить за конкретным регионом AWS или GCP — либо за облачной средой, которой управляете вы, — если этого требует резидентность данных.

Почему смена модели ничего не ломает

Вот архитектурный момент, который делает всё это осуществимым. В системе Olano всё, что делает развёртывание вашим , живёт на уровне платформы, а не внутри какой-либо модели: память, база знаний и навыки, каналы, через которые к вам приходят клиенты, уровни доверия и шлюзы согласования, история аудита и улучшения, которые накопил Cortex . Модель — это компонент, который вызывает платформа: мощный, но заменяемый.

Поэтому когда выходит модель получше — а такая выходит всегда — ваша система не застревает на прошлогоднем выборе. Модель под агентом меняется; агент по-прежнему знает ваших постоянных клиентов, следует вашим процедурам, соблюдает ваши правила согласования и отвечает в ваших каналах. Прогресс моделей превращается в то, чем ваше развёртывание пользуется автоматически, а не в миграционный проект, который надо финансировать.

Поступает задача — обращение, бриф или задание по расписаниюПлатформа направляет её к наиболее подходящей моделиАгент работает со своей памятью, знаниями и навыкамиПотребление остаётся в пределах заранее согласованных жёстких лимитовВсё исходящее или значимое встаёт в очередь на согласованиеМодель можно сменить в любой момент — всё остальное остаётся

Когда одной модели действительно достаточно

Сначала честно: если ИИ в вашей компании — это один человек, пишущий текст в окне чата, то подписка на одну модель и есть правильный инструмент, а мультимодельная маршрутизация будет избыточной инженерией. Расклад меняется, когда ИИ становится операционной инфраструктурой: агенты отвечают клиентам в живых каналах, выполняют работу по расписанию и трогают настоящие системы. В этот момент выбор модели перестаёт быть предпочтением и становится операционной зависимостью — и вы захотите, чтобы это было решением о маршрутизации, а не миграцией платформы. Наше руководство «Olano против ChatGPT» проводит эту границу подробнее, а чек-лист выбора платформы ставит гибкость по моделям в один ряд с прочими вопросами, которые стоит задать.

Читайте также

Остальные материалы серии «Внутри платформы» и руководства по выбору, с которыми связан этот текст.

Частые вопросы

Какие ИИ-модели может использовать система Olano?

Системы Olano мультимодельны. Агенты могут работать на Claude, OpenAI, DeepSeek, Gemini или локальных моделях среди 18+ провайдеров LLM — включая Anthropic, OpenAI, Google, Mistral, Groq, DeepSeek, xAI, Cohere, Together, Fireworks, OpenRouter, Perplexity, NVIDIA, Azure OpenAI, AWS Bedrock и локальные модели через Ollama. Модели можно комбинировать по агентам и менять посреди разговора.

Могу ли я использовать свои ключи от провайдеров ИИ?

Да. BYOK (свои ключи) поддерживается без доплаты — при желании ваша система работает на ваших аккаунтах у провайдеров, с той же маршрутизацией, теми же согласованиями и той же историей аудита. В любом случае использование ИИ идёт в пределах заранее согласованных жёстких лимитов расходов.

Что будет с моей системой, когда выйдет модель получше?

Вы получаете выгоду, а не застреваете. Память, навыки, база знаний, каналы и правила согласования ваших агентов живут в платформе Olano, а не внутри какой-то одной модели, — поэтому модель под агентом можно заменить, ничего не пересобирая, и комбинировать по агентам или задачам по мере изменения расклада.

Как работает контроль расходов при нескольких моделях?

Использование ИИ идёт в пределах заранее согласованных жёстких лимитов расходов — именно лимитов, а не уведомлений. Маршрутизация тоже помогает экономике: рутина крутится на быстрых и дешёвых моделях, а глубокое рассуждение оставляют задачам, которым оно действительно нужно, — так мощность тратится там, где это важно.

Стройте на всём переднем крае, а не на одном поставщике

Запишитесь на консультацию: мы разберём ваш самый ценный процесс, дадим фиксированное предложение и начнём строить только после вашего согласия — с маршрутизацией к нужным моделям с первого дня.

Обсудить проект