Внутри платформы
ИИ-агенты на нескольких моделях: одна система, для каждой задачи своя модель
Рейтинг ИИ-моделей перетасовывается каждые несколько месяцев. Бизнес-система, приваренная к одному провайдеру, стареет вместе с ним — и платит цены рассуждающей модели за рутинную работу. Системы Olano мультимодельны по замыслу: каждая задача уходит к наиболее подходящей модели, внутри жёстких лимитов расходов, и ничто в вашей системе не привязано к одному поставщику.
Ловушка одной модели
Выбор ИИ-платформы часто негласно означает выбор ИИ-модели — той самой, на которой строил поставщик. У этого решения два издержки, которые со временем накапливаются.
Первая — дрейф. Передний край движется быстро и неравномерно: в этом квартале один провайдер лидирует в глубоких рассуждениях, другой — в скорости и стоимости, третий — в языке или модальности, которые как раз важны вашим клиентам. Система, способная работать только с одним провайдером, ставит вашу операционку на то, что этот вендор будет побеждать во всех категориях и всегда. Пока такого не было ни у кого.
Вторая — экономика. Работа тоже неоднородна. Разобрать входящие, проставить метку на обращении, вытащить дату брони — это большой объём при низкой сложности, с чем прекрасно справляется быстрая и дешёвая модель. Постоянное исследовательское задание или тонкая жалоба заслуживают самого сильного доступного рассуждения. Гонять всё через флагманскую модель — платить ставку топ-адвоката за подшивку бумаг; гонять всё через бюджетную — ложная экономия, которая вылезает в переписке с клиентами.
Как система Olano распределяет работу
Каждое развёртывание Olano мультимодельное. Агенты могут работать на Claude, OpenAI, DeepSeek, Gemini или локальных моделях — среди 18+ провайдеров LLM, включая Anthropic, OpenAI, Google, Mistral, Groq, DeepSeek, xAI, Cohere, Together, Fireworks, OpenRouter, Perplexity, NVIDIA, Azure OpenAI, AWS Bedrock и локальные модели через Ollama. Платформа направляет каждую задачу к наиболее подходящей модели, модели можно комбинировать по агентам и менять прямо посреди разговора.
В типичном развёртывании это выглядит как специализация — так же, как вы укомплектовали бы команду: агент на ресепшене — на быстрой и толковой модели, рассчитанной на поток разговоров; исследовательский агент тянется к глубокому рассуждению, когда задача этого требует; массовое извлечение данных крутится на самой дешёвой модели, проходящей проверку качества. Одна система, одна память, один аудиторский след — и несколько моделей, каждая на своём.
Расходы ограничены архитектурой, а не силой воли
Мультимодельная маршрутизация — тоже инструмент контроля затрат, но работает она внутри более жёсткой границы: использование ИИ идёт в пределах заранее согласованных жёстких лимитов расходов. Именно лимиты, а не уведомления: сколько бы ни было нагрузки, система не может потратить больше одобренного. А если у вас уже есть аккаунты у провайдеров, поддерживается BYOK (свои ключи) без доплаты: ваша система работает на ваших ключах с той же маршрутизацией, теми же согласованиями и той же историей аудита.
Вы также сохраняете контроль над тем, где обрабатываются данные. Развёртывания работают на управляемой облачной инфраструктуре в изолированных средах, а в индивидуальных проектах обработку можно закрепить за конкретным регионом AWS или GCP — либо за облачной средой, которой управляете вы, — если этого требует резидентность данных.
Почему смена модели ничего не ломает
Вот архитектурный момент, который делает всё это осуществимым. В системе Olano всё, что делает развёртывание вашим , живёт на уровне платформы, а не внутри какой-либо модели: память, база знаний и навыки, каналы, через которые к вам приходят клиенты, уровни доверия и шлюзы согласования, история аудита и улучшения, которые накопил Cortex . Модель — это компонент, который вызывает платформа: мощный, но заменяемый.
Поэтому когда выходит модель получше — а такая выходит всегда — ваша система не застревает на прошлогоднем выборе. Модель под агентом меняется; агент по-прежнему знает ваших постоянных клиентов, следует вашим процедурам, соблюдает ваши правила согласования и отвечает в ваших каналах. Прогресс моделей превращается в то, чем ваше развёртывание пользуется автоматически, а не в миграционный проект, который надо финансировать.
Когда одной модели действительно достаточно
Сначала честно: если ИИ в вашей компании — это один человек, пишущий текст в окне чата, то подписка на одну модель и есть правильный инструмент, а мультимодельная маршрутизация будет избыточной инженерией. Расклад меняется, когда ИИ становится операционной инфраструктурой: агенты отвечают клиентам в живых каналах, выполняют работу по расписанию и трогают настоящие системы. В этот момент выбор модели перестаёт быть предпочтением и становится операционной зависимостью — и вы захотите, чтобы это было решением о маршрутизации, а не миграцией платформы. Наше руководство «Olano против ChatGPT» проводит эту границу подробнее, а чек-лист выбора платформы ставит гибкость по моделям в один ряд с прочими вопросами, которые стоит задать.
Читайте также
Остальные материалы серии «Внутри платформы» и руководства по выбору, с которыми связан этот текст.
Внутри Olano Cortex
Механизм самоулучшения: пять циклов, ритм, который задаёте вы, и согласование человеком на каждое изменение.
Как ИИ-агенты запоминают
Память, знания и навыки живут в платформе — поэтому модели под ней можно менять свободно.
Как выбрать платформу ИИ-агентов
Каналы, согласования, аудиторский след, лимиты расходов, BYOK, изоляция — полный чек-лист для оценки.
Olano против ChatGPT в операционной работе
Где универсального ИИ-рабочего пространства действительно хватает — и где постоянно работающие агенты окупаются.
Частые вопросы
Какие ИИ-модели может использовать система Olano?
Системы Olano мультимодельны. Агенты могут работать на Claude, OpenAI, DeepSeek, Gemini или локальных моделях среди 18+ провайдеров LLM — включая Anthropic, OpenAI, Google, Mistral, Groq, DeepSeek, xAI, Cohere, Together, Fireworks, OpenRouter, Perplexity, NVIDIA, Azure OpenAI, AWS Bedrock и локальные модели через Ollama. Модели можно комбинировать по агентам и менять посреди разговора.
Могу ли я использовать свои ключи от провайдеров ИИ?
Да. BYOK (свои ключи) поддерживается без доплаты — при желании ваша система работает на ваших аккаунтах у провайдеров, с той же маршрутизацией, теми же согласованиями и той же историей аудита. В любом случае использование ИИ идёт в пределах заранее согласованных жёстких лимитов расходов.
Что будет с моей системой, когда выйдет модель получше?
Вы получаете выгоду, а не застреваете. Память, навыки, база знаний, каналы и правила согласования ваших агентов живут в платформе Olano, а не внутри какой-то одной модели, — поэтому модель под агентом можно заменить, ничего не пересобирая, и комбинировать по агентам или задачам по мере изменения расклада.
Как работает контроль расходов при нескольких моделях?
Использование ИИ идёт в пределах заранее согласованных жёстких лимитов расходов — именно лимитов, а не уведомлений. Маршрутизация тоже помогает экономике: рутина крутится на быстрых и дешёвых моделях, а глубокое рассуждение оставляют задачам, которым оно действительно нужно, — так мощность тратится там, где это важно.
Стройте на всём переднем крае, а не на одном поставщике
Запишитесь на консультацию: мы разберём ваш самый ценный процесс, дадим фиксированное предложение и начнём строить только после вашего согласия — с маршрутизацией к нужным моделям с первого дня.