Por dentro de la plataforma
Agentes de IA multimodelo: un sistema, el modelo adecuado para cada tarea
La clasificación de modelos de IA se reordena cada pocos meses. Un sistema de negocio soldado a un único proveedor envejece con ese proveedor, y paga precios de modelo de razonamiento por trabajo rutinario. Los sistemas de Olano son multimodelo por diseño: cada tarea va al modelo que mejor le encaja, dentro de límites de gasto estrictos, y nada de tu sistema queda atado a un solo fabricante.
La trampa del modelo único
Elegir una plataforma de IA suele significar, en silencio, elegir un modelo de IA: aquel sobre el que construyó el proveedor. Esa decisión tiene dos costes que se acumulan con el tiempo.
El primero es la deriva. La frontera avanza rápido y no lo hace de forma uniforme: un proveedor lidera este trimestre en razonamiento profundo, otro en velocidad y coste, otro en un idioma o modalidad que justo le importa a tus clientes. Un sistema que solo puede usar un proveedor está apostando tus operaciones a que ese fabricante gane todas las categorías, para siempre. Nadie lo ha hecho.
El segundo es la economía. El trabajo tampoco es uniforme. Clasificar un buzón, etiquetar una consulta o extraer una fecha de reserva es trabajo de mucho volumen y poca dificultad, que un modelo rápido y económico resuelve bien. Un encargo de investigación permanente o una queja delicada merecen el razonamiento más fuerte disponible. Pasarlo todo por un modelo insignia es pagar tarifas de abogado por archivar papeles; pasarlo todo por un modelo barato es un ahorro falso que se nota en las conversaciones con tus clientes.
Cómo reparte el trabajo un sistema de Olano
Todo despliegue de Olano es multimodelo. Los agentes pueden correr sobre Claude, OpenAI, DeepSeek, Gemini o modelos locales, entre más de 18 proveedores de LLM, incluidos Anthropic, OpenAI, Google, Mistral, Groq, DeepSeek, xAI, Cohere, Together, Fireworks, OpenRouter, Perplexity, NVIDIA, Azure OpenAI, AWS Bedrock y modelos locales vía Ollama. La plataforma envía cada tarea al modelo que mejor le encaja, y los modelos pueden mezclarse por agente y cambiarse a mitad de una conversación.
En un despliegue típico eso se parece a la especialización, igual que montarías un equipo: el agente de recepción sobre un modelo rápido y capaz, pensado para volumen de conversación; el agente de investigación tirando de razonamiento profundo cuando el encargo lo pide; un trabajo de extracción masiva corriendo sobre el modelo más económico que pase los controles de calidad. Un sistema, una memoria, un registro de auditoría, y varios modelos haciendo cada uno lo que mejor hace.
El gasto lo limita la arquitectura, no la contención
El enrutado multimodelo también es un instrumento de control de costes, pero opera dentro de un límite más duro: el uso de IA corre dentro de controles de gasto estrictos acordados de antemano. Topes, no alertas: el sistema no puede gastar más de lo que aprobaste, haga lo que haga la carga de trabajo. Y si ya tienes cuentas con proveedores, se admite traer tu propia clave (BYOK) sin coste añadido: tu sistema funciona contra tus claves con el mismo enrutado, las mismas aprobaciones y el mismo historial de auditoría.
También mantienes el control sobre dónde se procesan los datos. Los despliegues corren sobre infraestructura cloud gestionada en entornos aislados, y los proyectos a medida pueden fijar el procesamiento a una región concreta de AWS o GCP, o a un entorno cloud que controles tú, cuando la residencia de datos lo exija.
Por qué cambiar de modelo no rompe nada
Este es el punto arquitectónico que hace todo esto viable. En un sistema de Olano, todo lo que hace que el despliegue sea tuyo vive en la capa de plataforma, no dentro de ningún modelo: la memoria, la base de conocimiento y las habilidades, los canales por los que te llegan los clientes, los niveles de confianza y las puertas de aprobación, el historial de auditoría, y las mejoras que Cortex ha ido acumulando. El modelo es un componente al que llama la plataforma: potente, pero reemplazable.
Así que cuando sale un modelo mejor - y siempre sale alguno - tu sistema no se queda varado en la elección del año pasado. Se cambia el modelo que hay debajo del agente; el agente sigue conociendo a tus clientes habituales, siguiendo tus procedimientos, respetando tus reglas de aprobación y respondiendo en tus canales. El progreso de los modelos se convierte en algo de lo que tu despliegue se beneficia automáticamente, en vez de un proyecto de migración que tienes que financiar.
Cuándo un solo modelo es realmente suficiente
Primero, la honestidad: si la IA en tu negocio significa una persona redactando texto en una ventana de chat, una suscripción a un solo modelo es la herramienta adecuada y el enrutado multimodelo sería sobreingeniería. El cálculo cambia cuando la IA se convierte en infraestructura operativa: agentes respondiendo a clientes en canales reales, ejecutando trabajo programado y tocando sistemas de verdad. En ese punto, la elección de modelo deja de ser una preferencia y pasa a ser una dependencia operativa, y quieres que sea una decisión de enrutado y no una migración de plataforma. Nuestra guía de Olano frente a ChatGPT traza esa línea con más detalle, y la lista para elegir plataforma pone la flexibilidad de modelo junto a las demás preguntas que merece la pena hacer.
Lecturas relacionadas
El resto de la serie "Por dentro de la plataforma" y las guías de compra con las que enlaza.
Por dentro de Olano Cortex
El motor de automejora: cinco ciclos, una cadencia que tú controlas y aprobación humana en cada cambio.
Cómo recuerdan los agentes de IA
La memoria, el conocimiento y las habilidades viven en la plataforma: por eso los modelos de debajo se pueden cambiar sin más.
Cómo elegir una plataforma de agentes de IA
Canales, aprobaciones, registros de auditoría, topes de gasto, BYOK, aislamiento: la lista de evaluación completa.
Olano frente a ChatGPT para operaciones
Dónde basta de verdad un espacio de trabajo de IA general, y dónde los agentes permanentes se ganan el sueldo.
Preguntas frecuentes
¿Qué modelos de IA puede usar un sistema de Olano?
Los sistemas de Olano son multimodelo. Los agentes pueden correr sobre Claude, OpenAI, DeepSeek, Gemini o modelos locales, entre más de 18 proveedores de LLM: Anthropic, OpenAI, Google, Mistral, Groq, DeepSeek, xAI, Cohere, Together, Fireworks, OpenRouter, Perplexity, NVIDIA, Azure OpenAI, AWS Bedrock y modelos locales vía Ollama. Los modelos pueden mezclarse por agente y cambiarse a mitad de conversación.
¿Puedo traer mis propias claves de proveedor de IA?
Sí. Traer tu propia clave (BYOK) está soportado sin coste añadido: si lo prefieres, tu sistema funciona contra tus propias cuentas de proveedor, con el mismo enrutado, las mismas aprobaciones y el mismo historial de auditoría. En cualquier caso, el uso de IA corre dentro de controles de gasto estrictos acordados de antemano.
¿Qué le pasa a mi sistema cuando sale un modelo mejor?
Te beneficias en vez de quedarte varado. La memoria, las habilidades, la base de conocimiento, los canales y las reglas de aprobación de tus agentes viven en la plataforma de Olano, no dentro de ningún modelo, así que el modelo bajo un agente se puede cambiar sin reconstruir nada, y mezclar por agente o por tarea según cambie el panorama.
¿Cómo funcionan los controles de gasto con varios modelos?
El uso de IA corre dentro de controles de gasto estrictos acordados de antemano: topes, no alertas. El enrutado también ayuda a la economía: el trabajo rutinario corre sobre modelos rápidos y baratos, mientras el razonamiento profundo se reserva para las tareas que de verdad lo necesitan, así que la capacidad se gasta donde importa.
Construye sobre toda la frontera, no sobre un solo proveedor
Reserva una consulta y trazaremos tu flujo de mayor valor, te daremos una propuesta cerrada y solo lo construiremos cuando lo apruebes, enrutado a los modelos adecuados desde el primer día.