Bên trong nền tảng
Agent AI đa mô hình: một hệ thống, đúng mô hình cho từng tác vụ
Bảng xếp hạng mô hình AI đảo lại sau vài tháng một lần. Một hệ thống nghiệp vụ bị hàn chết vào một nhà cung cấp sẽ già đi cùng nhà cung cấp đó - và trả giá của mô hình suy luận cho cả những việc thường ngày. Hệ thống Olano đa mô hình ngay từ thiết kế: mỗi tác vụ được đưa tới mô hình phù hợp nhất, nằm trong các giới hạn chi tiêu cứng, và không phần nào trong hệ thống của bạn bị buộc vào một nhà cung cấp duy nhất.
Cái bẫy một mô hình
Chọn một nền tảng AI thường lặng lẽ đồng nghĩa với chọn một mô hình AI - đúng cái mà nhà cung cấp đã dựng lên trên đó. Quyết định ấy kéo theo hai loại chi phí cứ dồn lên theo thời gian.
Thứ nhất là sự trôi tụt. Biên giới công nghệ dịch chuyển nhanh, và không đều: quý này một nhà cung cấp dẫn đầu về suy luận sâu, nhà khác về tốc độ và chi phí, nhà khác nữa về một ngôn ngữ hay dạng dữ liệu tình cờ lại quan trọng với khách của bạn. Một hệ thống chỉ có thể dùng đúng một nhà cung cấp là đang đem hoạt động của bạn ra cược rằng nhà đó sẽ thắng mọi hạng mục, mãi mãi. Chưa ai làm được vậy.
Thứ hai là bài toán chi phí. Công việc cũng chẳng đồng nhất. Phân loại hộp thư, gắn nhãn một yêu cầu, hay rút ra ngày đặt lịch là loại việc khối lượng lớn nhưng độ khó thấp, một mô hình nhanh và rẻ xử lý rất ổn. Còn một đầu việc nghiên cứu thường trực hay một khiếu nại tế nhị thì xứng đáng với khả năng suy luận mạnh nhất hiện có. Đẩy mọi thứ qua mô hình đầu bảng là trả giá luật sư hạng nhất để đi kẹp hồ sơ; đẩy mọi thứ qua mô hình giá rẻ là kiểu tiết kiệm giả tạo, và nó hiện ra ngay trong đoạn chat với khách của bạn.
Hệ thống Olano điều phối công việc ra sao
Mọi triển khai của Olano đều đa mô hình. Agent có thể chạy trên Claude, OpenAI, DeepSeek, Gemini hoặc mô hình cục bộ - trải khắp hơn 18 nhà cung cấp LLM, gồm Anthropic, OpenAI, Google, Mistral, Groq, DeepSeek, xAI, Cohere, Together, Fireworks, OpenRouter, Perplexity, NVIDIA, Azure OpenAI, AWS Bedrock, và mô hình cục bộ qua Ollama. Nền tảng điều mỗi tác vụ tới mô hình phù hợp nhất, và mô hình có thể trộn theo từng agent, thậm chí đổi giữa chừng cuộc trò chuyện.
Trong một lần triển khai điển hình, điều đó trông giống việc phân vai, hệt như cách bạn bố trí một đội: agent lễ tân chạy trên một mô hình nhanh và đủ giỏi, hợp với lượng hội thoại lớn; agent nghiên cứu với tới khả năng suy luận sâu khi đầu việc đòi hỏi; một tác vụ trích xuất hàng loạt chạy trên mô hình rẻ nhất mà vẫn qua được kiểm tra chất lượng. Một hệ thống, một kho trí nhớ, một nhật ký kiểm toán - và nhiều mô hình, mỗi cái làm đúng thứ nó giỏi nhất.
Chi tiêu bị chặn bởi kiến trúc, không phải bởi sự kiềm chế
Điều phối đa mô hình cũng là một công cụ kiểm soát chi phí, nhưng nó hoạt động bên trong một ranh giới cứng hơn: việc dùng AI nằm trong các giới hạn chi tiêu cứng đã thống nhất trước. Là trần, không phải cảnh báo - dù tải công việc có ra sao, hệ thống cũng không thể tiêu quá mức bạn đã duyệt. Và nếu bạn đã có tài khoản ở các nhà cung cấp, chúng tôi hỗ trợ dùng khóa của chính bạn (BYOK) mà không tính thêm phí: hệ thống chạy trên khóa của bạn với cùng cách điều phối, cùng quy trình duyệt và cùng lịch sử kiểm toán.
Bạn cũng giữ quyền quyết định dữ liệu được xử lý ở đâu. Các triển khai chạy trên hạ tầng đám mây được vận hành sẵn trong môi trường tách biệt, và với những dự án riêng, việc xử lý có thể được ghim vào một vùng AWS hoặc GCP cụ thể - hoặc vào một môi trường đám mây do bạn kiểm soát - khi yêu cầu về nơi lưu trữ dữ liệu đòi hỏi như vậy.
Vì sao đổi mô hình chẳng làm hỏng gì
Đây là điểm mấu chốt về kiến trúc khiến tất cả những điều trên khả thi. Trong một hệ thống Olano, mọi thứ khiến bản triển khai đó là của bạn đều nằm ở tầng nền tảng, không nằm trong bất kỳ mô hình nào: trí nhớ, kho tri thức và kỹ năng, các kênh mà khách hàng liên hệ với bạn, các mức tin cậy và cổng phê duyệt, lịch sử kiểm toán, và những cải tiến mà Cortex đã tích lũy được. Mô hình chỉ là một thành phần mà nền tảng gọi tới - mạnh mẽ, nhưng thay thế được.
Nên khi một mô hình tốt hơn ra mắt - và luôn có - hệ thống của bạn không mắc kẹt ở lựa chọn của năm ngoái. Mô hình bên dưới một agent được thay; agent đó vẫn biết khách quen của bạn, vẫn theo quy trình của bạn, vẫn tôn trọng quy tắc phê duyệt của bạn, và vẫn trả lời trên các kênh của bạn. Tiến bộ về mô hình trở thành thứ mà hệ thống của bạn tự động hưởng lợi, thay vì một dự án di chuyển mà bạn phải bỏ tiền ra làm.
Khi nào một mô hình là thật sự đủ
Nói thẳng trước đã: nếu AI trong doanh nghiệp bạn chỉ là một người soạn chữ trong cửa sổ chat, thì gói thuê bao một mô hình mới là công cụ đúng, còn điều phối đa mô hình là làm quá. Phép tính đổi khác khi AI trở thành hạ tầng vận hành - agent trả lời khách trên kênh thật, chạy công việc theo lịch, và động vào hệ thống thật. Tới lúc đó, chọn mô hình không còn là sở thích mà thành một ràng buộc vận hành, và bạn sẽ muốn nó là một quyết định điều phối chứ không phải một cuộc di chuyển nền tảng. Bài hướng dẫn Olano so với ChatGPT vạch rõ ranh giới đó chi tiết hơn, còn danh sách kiểm tra khi chọn nền tảng đặt tính linh hoạt về mô hình bên cạnh những câu hỏi khác đáng đặt ra.
Đọc thêm
Phần còn lại của loạt bài "Bên trong nền tảng", và các hướng dẫn chọn mua mà bài này nối tới.
Bên trong Olano Cortex
Cỗ máy tự cải thiện: năm chu kỳ, nhịp độ do bạn đặt, và phê duyệt của người cho mọi thay đổi.
Agent AI ghi nhớ như thế nào
Trí nhớ, tri thức và kỹ năng nằm ở nền tảng - đó là lý do các mô hình bên dưới có thể thay tự do.
Cách chọn nền tảng agent AI
Kênh, phê duyệt, nhật ký kiểm toán, trần chi tiêu, BYOK, cô lập - danh sách đánh giá đầy đủ.
Olano so với ChatGPT cho vận hành
Khi nào một không gian làm việc AI phổ thông là thật sự đủ - và khi nào những agent túc trực mới đáng đồng tiền.
Câu hỏi thường gặp
Hệ thống Olano dùng được những mô hình AI nào?
Hệ thống Olano là đa mô hình. Agent có thể chạy trên Claude, OpenAI, DeepSeek, Gemini hoặc mô hình cục bộ, trải khắp hơn 18 nhà cung cấp LLM - gồm Anthropic, OpenAI, Google, Mistral, Groq, DeepSeek, xAI, Cohere, Together, Fireworks, OpenRouter, Perplexity, NVIDIA, Azure OpenAI, AWS Bedrock, và mô hình cục bộ qua Ollama. Mô hình có thể trộn theo từng agent và đổi giữa chừng cuộc trò chuyện.
Tôi có thể dùng khóa nhà cung cấp AI của riêng mình không?
Có. Dùng khóa của chính bạn (BYOK) được hỗ trợ mà không tính thêm phí - nếu bạn muốn, hệ thống sẽ chạy trên tài khoản nhà cung cấp của riêng bạn, với cùng cách điều phối, cùng quy trình duyệt và cùng lịch sử kiểm toán. Dù chọn cách nào, việc dùng AI vẫn nằm trong các giới hạn chi tiêu cứng đã thống nhất trước.
Hệ thống của tôi sẽ ra sao khi có mô hình tốt hơn ra mắt?
Bạn được hưởng lợi thay vì mắc kẹt. Trí nhớ, kỹ năng, kho tri thức, kênh và quy tắc phê duyệt của agent nằm ở nền tảng Olano, không nằm trong bất kỳ mô hình nào - nên mô hình bên dưới một agent có thể thay mà không phải dựng lại thứ gì, và có thể trộn theo từng agent hay từng tác vụ khi bối cảnh đổi.
Kiểm soát chi tiêu hoạt động ra sao khi dùng nhiều mô hình?
Việc dùng AI nằm trong các giới hạn chi tiêu cứng đã thống nhất trước - là trần, không phải cảnh báo. Điều phối cũng giúp về chi phí: việc thường ngày chạy trên mô hình nhanh và rẻ, còn suy luận sâu để dành cho những tác vụ thật sự cần, nhờ vậy năng lực được tiêu đúng chỗ.
Xây trên toàn bộ biên giới công nghệ, không phải trên một nhà cung cấp
Đặt một buổi tư vấn và chúng tôi sẽ phác ra quy trình đáng giá nhất của bạn, đưa một đề xuất cố định, và chỉ bắt tay làm khi bạn đồng ý - được điều tới đúng mô hình ngay từ ngày đầu.