平台内部
多模型 AI 智能体:一套系统,每个任务都用对的模型
AI 模型的排行榜每隔几个月就重排一次。一套焊死在单一供应商上的业务系统,会跟着那家一起变老——而且干日常活儿也照付推理模型的价钱。Olano 的系统从设计上就是多模型的:每个任务都交给最合适的模型,在硬性支出管控之内运行,而你系统里的任何一部分都不被某一家厂商绑住。
单一模型的陷阱
选一个 AI 平台,往往悄悄地就等于选定了一个 AI 模型——供应商是拿哪个搭的就是哪个。这个决定有两项成本,会随时间越滚越大。
第一项是 掉队。前沿推进得很快,而且并不齐头并进:这个季度某家在深度推理上领先,另一家在速度和成本上领先,还有一家在恰好对你客户重要的语言或模态上领先。一套只能用一家供应商的系统,等于把你的运营押在那家永远在每个类别都夺冠上。至今没有一家做到过。
第二项是 经济账。活儿本身也不齐整。分拣收件箱、给咨询打标签、抽取预订日期,都是量大难度低的活儿,用快而便宜的模型就挺好。而一份常设的调研任务、一封措辞微妙的投诉,值得用能拿到的最强推理。什么都塞给旗舰模型,等于请大律师来归档;什么都塞给廉价模型,则是一种会在客户对话里露馅的假省钱。
Olano 的系统怎么派活儿
Olano 的每一次部署都是多模型的。智能体可以跑在 Claude、OpenAI、DeepSeek、Gemini 或本地模型上——覆盖 18+ 家 LLM 供应商,包括 Anthropic、OpenAI、Google、Mistral、Groq、DeepSeek、xAI、Cohere、Together、Fireworks、OpenRouter、Perplexity、NVIDIA、Azure OpenAI、AWS Bedrock,以及通过 Ollama 接入的本地模型。平台会把每个任务送到最合适的模型上,模型可以按智能体混搭,也能在对话中途切换。
在典型的部署里,这看起来就像分工,和你配人手是一个道理:前台智能体跑在一个快而够用、能扛对话量的模型上;调研智能体在任务需要时去够最强的推理;批量抽取的活儿则跑在能通过质量检查的最便宜模型上。一套系统、一份记忆、一条审计记录——底下是好几个模型,各干各最擅长的事。
支出的天花板由架构决定,不靠自觉
多模型分派也是一种成本管控手段,但它是在一条更硬的边界之内运作的:AI 用量始终在事先约定的硬性支出管控之内。是上限,不是提醒——不管负载怎么变,系统都花不过你批准的数。如果你已经有供应商账号,自带密钥(BYOK)不额外收费:你的系统用你自己的密钥运行,分派、审批和审计历史一切照旧。
数据在哪儿处理,主动权也仍在你手里。部署跑在隔离环境中的托管云基础设施上;如果数据驻留有要求,定制项目可以把处理固定在特定的 AWS 或 GCP 区域——或者你自己掌控的云环境里。
为什么换模型不会弄坏任何东西
下面这个架构上的关键点,才让上面这一切真正可行。在 Olano 的系统里,让这套部署成为 「你的」的那些东西 ,都住在平台这一层,而不在任何模型里面: 记忆、知识库和技能、你客户找到你的那些渠道、信任等级和审批关卡、审计历史,以及 Cortex 所积累的那些改进。模型不过是平台调用的一个部件——强大,但可以替换。
所以当更好的模型出来时——总会有的——你的系统不会被困在去年的选择上。换掉智能体底下那个模型就行;这个智能体照样认得你的熟客、照你的流程办事、遵守你的审批规则、在你的渠道上作答。模型的进步于是变成你的部署自动就能吃到的红利,而不是一个还得掏钱去做的迁移项目。
什么时候一个模型真的就够了
先说实话:如果 AI 在你公司里就是一个人对着聊天窗口写文案,那么订一个模型才是对的工具,多模型分派属于过度设计。当 AI 变成运营基础设施时,账就不一样了——智能体在真实渠道上回应客户、跑定时作业、动真实系统。到那一步,选模型就不再是偏好,而是运营上的依赖;那你会希望它只是一个分派决定,而不是一次平台迁移。我们的 「Olano vs ChatGPT」指南 把这条线画得更细,而 平台选型清单 则把模型灵活度和其他值得追问的问题摆在一起。
延伸阅读
「平台内部」系列的其余篇目,以及与之相关的选型指南。
常见问题
Olano 的系统能用哪些 AI 模型?
Olano 的系统是多模型的。智能体可以跑在 Claude、OpenAI、DeepSeek、Gemini 或本地模型上,覆盖 18+ 家 LLM 供应商——包括 Anthropic、OpenAI、Google、Mistral、Groq、DeepSeek、xAI、Cohere、Together、Fireworks、OpenRouter、Perplexity、NVIDIA、Azure OpenAI、AWS Bedrock,以及通过 Ollama 接入的本地模型。模型可以按智能体混搭,也能在对话中途切换。
我能用自己的 AI 供应商密钥吗?
可以。自带密钥(BYOK)不额外收费——如果你愿意,系统就跑在你自己的供应商账号上,分派、审批和审计历史都一样。无论哪种方式,AI 用量都在事先约定的硬性支出管控之内。
出了更好的模型,我的系统会怎样?
你是吃到红利,而不是被困住。你智能体的记忆、技能、知识库、渠道和审批规则都住在 Olano 平台里,不在任何一个模型内部——所以智能体底下的模型可以直接换掉、什么都不用重建,还能随着格局变化按智能体或按任务混搭。
用多个模型时,支出管控怎么运作?
AI 用量在事先约定的硬性支出管控之内运行——是上限,不是提醒。分派本身也帮着省钱:日常活儿跑在快而便宜的模型上,深度推理留给真正需要它的任务,能力就花在刀刃上。
建在整个前沿之上,而不是一家供应商之上
约一次咨询,我们会梳理你最值钱的那条流程、给出固定报价,等你点头才动手——从第一天起就把活儿派给对的模型。