Kết hợp Claude Fable 5.1 và Gemini 3.8 Flash trong cùng một đội ngũ

@GoogleCloudTech
TIẾNG ANH14 thg 9, 2026
129K
822
70
44
765

TL;DR

Hướng dẫn này minh họa cách tối ưu hóa chi phí và hiệu suất của AI agent bằng cách kết hợp Claude Fable 5.1 cho việc lập kế hoạch chuyên sâu và Gemini 3.8 Flash cho việc thực thi nhanh chóng trên Nền tảng Agent Doanh nghiệp Gemini của Google Cloud.

Một người bạn hỏi tôi một câu hỏi không mấy quan trọng ở chỗ làm và tôi đã để một agent tìm kiếm trong các cuộc trò chuyện và tài liệu gần đây của mình. Nó tìm ra đáp án đúng, nhưng chi phí lên tới $38!!!. Đó là một ROI (tỷ suất hoàn vốn) tệ hại. Đúng là thời gian của tôi có giá trị, nhưng thực tế tôi đã không dành thời gian đó cho việc này, và nhiệm vụ này cũng chẳng cần đến những khả năng lập kế hoạch đắt đỏ.

Chúng ta có thể làm tốt hơn.

Nền tảng Agent Doanh nghiệp Gemini của Google Cloud cung cấp Model Garden, với quyền truy cập API tiện lợi vào nhiều mô hình hàng đầu bao gồm cả của Google, Anthropic, và thậm chí cả xAI. Thực tế, mọi mô hình trên Huggingface đều có sẵn để bạn tự triển khai, nhưng trong bài viết này, chúng ta sẽ tập trung vào Claude Fable 5.1 mới của Anthropic và Gemini 3.8 Flash mới của Google. Các nhà phát triển giờ đây có hai mô hình tiên phong (frontier models) với cấu trúc khác nhau nằm phía sau cùng một bề mặt API doanh nghiệp.

Fable 5.1 mang lại khả năng lập kế hoạch tự động cấp Mythos, cửa sổ ngữ cảnh 1 triệu token và sự thẩm định đa bước sâu sắc. Gemini 3.8 Flash mang lại khả năng suy luận gần bằng mô hình tiên phong và tốc độ xử lý token đáng kinh ngạc với mức giá Flash ($0.75 mỗi triệu token đầu vào, $3.75 mỗi triệu token đầu ra) cùng các điều khiển tư duy có thể điều chỉnh.

Có thể dễ dàng chọn một mô hình và định tuyến mọi thứ qua nó. Đó là một sai lầm.

Nếu bạn chạy các công việc thường nhật của nhà phát triển qua một bộ lập kế hoạch chuyên sâu, bạn đang trả mức giá token tiên phong chỉ để phân tích các bản diff git. Nếu bạn ép buộc một mô hình nhanh chóng giải quyết một cuộc di chuyển cơ sở dữ liệu không thể đảo ngược mà không có kế hoạch chính thức, nó sẽ lao đi và phá vỡ trạng thái trước khi bạn kịp uống xong ly cà phê.

Chúng ta có thể cải thiện đáng kể "tokenomics" (kinh tế học token) một cách rất đơn giản, bằng cách sử dụng 2 mô hình và định tuyến nhiệm vụ.

Google Cloud Tech - inline image

Bởi Alan Blount (@zeroasterisk

Dưới đây là hướng dẫn đầy đủ để đưa bạn đến đích:

  1. Cấu hình cả hai mô hình phía sau một mặt phẳng quản trị thống nhất.
  2. Đánh giá chuẩn (benchmark) các nhiệm vụ thường nhật trước khi chọn mặc định.
  3. Sử dụng mô hình nhanh làm điều phối viên tiền tuyến và sử dụng bộ lập kế hoạch chuyên sâu bất cứ khi nào bạn biết mình cần sức mạnh lớn hơn hoặc khi mô hình nhanh cần leo thang (escalate).
  4. Hình thành mô hình tư duy về ROI của nhiệm vụ và giá trị (không chỉ chi phí) của các token của bạn.

1. Cấu hình cả hai mô hình phía sau một mặt phẳng quản trị thống nhất

Việc chọn nền tảng suy luận LLM của bạn đòi hỏi phải cân nhắc qua nhiều lựa chọn thiết kế. Chi phí, năng lực, bảo mật, lựa chọn mô hình, các tính năng phục vụ, ma sát đối với nhà phát triển, thậm chí còn nhiều vấn đề bảo mật hơn (các khóa API khá rủi ro). Nền tảng Agent Doanh nghiệp Gemini (trước đây là Vertex AI) là một lựa chọn toàn diện với các khả năng độc đáo, và vì nó phơi bày cả các mô hình Gemini và Anthropic dưới dạng API được quản lý, một xác thực bảo mật duy nhất bao phủ cả hai khối lượng công việc.

Nhưng hãy thành thật mà nói, một số hành trình có nhiều ma sát hơn mức tôi mong muốn. Tôi hay đùa rằng "những điều không thể thì dễ, nhưng những điều dễ lại khó". Đó là một phần lý do tại sao tôi viết bài đăng này.

Trước khi bạn xử lý các mô hình, hãy đăng nhập vào gcloud, đọc tài liệu cho các biến thể.

bash
1gcloud auth application-default login

Để có quyền truy cập vào Claude Fable 5.1, bạn cần kích hoạt API và sau đó kích hoạt Claude Fable 5.1 và điền vào một biểu mẫu rất nhanh về trường hợp sử dụng của bạn. Nhưng bạn vẫn chưa xong.

Bây giờ Fable thuộc Phụ lục An toàn AI Nâng cao của Google Cloud. Trước khi bạn có thể gửi một prompt đơn lẻ tới aiplatform.googleapis.com, bạn phải cấu hình rõ ràng việc chia sẻ phản hồi prompt và chấp nhận các điều khoản của nhà xuất bản ở cấp dự án.

Dưới đây là các hướng dẫn hoạt động chính xác cho endpoint toàn cầu, đọc tài liệu cho các biến thể.

Đầu tiên, hãy thiết lập một vài biến số sẽ giúp ích cho chúng ta. Lưu ý rằng tên mô hình trong đường dẫn URL là claude-fable-5-1 với dấu gạch nối, không phải dấu chấm, và đảm bảo bạn nhập ID dự án và vị trí của mình, sau đó có thể thay đổi endpoint tùy thuộc vào khu vực của bạn:

bash
1export PROJECT_ID="YOUR_PROJECT_ID"
2export LOCATION="global"
3export MODEL="claude-fable-5-1"
4
5# Global endpoint: aiplatform.googleapis.com (recommended)
6# Multi-Regional endpoints: aiplatform.eu.rep.googleapis.com
7# Regional endpoints: us-central1-aiplatform.googleapis.com
8export ENDPOINT="https://aiplatform.googleapis.com"

Tiếp theo, gọi API setPublisherModelConfig đặt dataSharingEnabledProvider thành ANTHROPIC - lưu ý rằng cái này viết hoa toàn bộ:

bash
1curl -X POST \
2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \
3 -H "Content-Type: application/json; charset=utf-8" \
4 -d '{ "publisherModelConfig": { "dataSharingEnabledProvider": "ANTHROPIC" } }' \
5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL}:setPublisherModelConfig"

Gọi ban đầu trả về một đối tượng thao tác đã hoàn tất xác nhận rằng việc chia sẻ dữ liệu đang hoạt động:

json
1{
2 "name": "projects/YOUR_PROJECT_NUMBER/locations/global/operations/1234567",
3 "metadata": {
4 "@type": "type.googleapis.com/google.cloud.aiplatform.v1beta1.SetPublisherModelConfigOperationMetadata",
5 "genericMetadata": {
6 "createTime": "...",
7 "updateTime": "..."
8 }
9 },
10 "done": true,
11 "response": {
12 "@type": "type.googleapis.com/google.cloud.aiplatform.v1beta1.PublisherModelConfig",
13 "loggingConfig": {},
14 "dataSharingEnabledProvider": "ANTHROPIC"
15 }
16}

Nếu bạn đã làm điều này rồi, bạn sẽ nhận được lỗi HTTP 409 rằng cài đặt này đã tồn tại:

text
1409 ALREADY_EXISTS: The same PublisherModelConfig already exists.

Lỗi 409 này không phải là vấn đề gì cả.

Kiểm tra quyền truy cập của bạn vào mô hình, và bạn nên nhận được một phản hồi:

bash
1curl -X POST \
2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \
3 -H "Content-Type: application/json; charset=utf-8" \
4 -d '{"anthropic_version": "vertex-2023-10-16","messages": [{"role": "user", "content": "Hello world."}], "max_tokens": 1024, "stream": true}' \
5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL}:streamRawPredict"

Nếu bạn không làm điều này đúng cách, bạn sẽ nhận được lỗi HTTP 403 trông như thế này:

text
1403 PERMISSION_DENIED: Access to this model requires data sharing to be enabled for publisher 'anthropic'. Please set `PublisherModelConfig.data_sharing_enabled_provider`
2to 'anthropic' via the setPublisherModelConfig API to use this model.

Để có quyền truy cập vào Gemini 3.8 Flash, hãy đảm bảo bạn thấy nó được bật trong thẻ mô hình và nó sẽ hoạt động ngay:

bash
1curl -X POST \
2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \
3 -H "Content-Type: application/json; charset=utf-8" \
4 -d '{"contents": [{"role": "user", "parts": [{"text": "Hello world"}]}],"generationConfig": {"thinkingConfig": {"thinkingLevel": "LOW"}}}' \
5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/google/models/gemini-3.8-flash:streamGenerateContent"

… phew. Chúng ta đã làm được 🎉!

Cần thêm hạn mức? Bạn có thể quản lý hạn mức cho bất kỳ mô hình nào và trả tiền cho thông lượng được cung cấp trước cho một số mô hình.

2. Đừng tin vào các Benchmark, Hãy tự chạy của riêng bạn

Nếu bạn hỏi năm kỹ sư xem nên dùng mô hình nào cho thiết lập agent, bạn sẽ nhận được nhiều hơn năm ý kiến mâu thuẫn dựa trên cảm tính từ Twitter và các bảng xếp hạng tổng hợp.

Các benchmark công khai cung cấp một nguồn tài nguyên tuyệt vời, nhưng chúng kiểm tra các prompt cô lập hoặc ngày càng nhiều các nhiệm vụ trong chân không. Các trường hợp sử dụng trong sản xuất, hoặc các agent SDLC agentic cục bộ của bạn không bao giờ khớp hoàn hảo với các benchmark công khai. Công việc của bạn có hình dạng khác biệt so với bất kỳ benchmark nào, hiện nay.

Vì vậy, bạn có thể xây dựng các benchmark của riêng mình (Agent Ops và Evals FTW!) và tự động hóa điều này ở quy mô lớn, hoặc bạn có thể chỉ thực hiện các nhiệm vụ đơn giản của riêng mình song song. Miễn là bạn không thay đổi các tệp trong nhiệm vụ của mình, bạn sẽ ổn và với hầu như không có nỗ lực nào, bạn sẽ có cảm giác về các nhiệm vụ.

Dưới đây là một ví dụ sử dụng promptfoo để điều khiển opencode thực hiện cùng 2 nhiệm vụ với mỗi mô hình. Bạn sẽ muốn thay đổi mô tả nhiệm vụ và thiết lập môi trường của mình để điều này hoạt động, nhưng nó không nên quá khó.

Google Cloud Tech - inline image

GIF

json
1# opencode.json
2{
3 "$schema": "https://opencode.ai/config.json",
4 "provider": {
5 "google-vertex": {
6 "options": { "project": "alanblount-demo", "location": "global" },
7 "models": {
8 "gemini-3.8-flash": { "id": "gemini-3.8-flash", "name": "Gemini 3.8 Flash" }
9 }
10 },
11 "google-vertex-anthropic": {
12 "options": { "project": "alanblount-demo", "location": "global" },
13 "models": {
14 "claude-fable-5-1": { "id": "claude-fable-5-1", "name": "Claude Fable 5.1" }
15 }
16 }
17 },
18...

Cấu hình Promptfoo để so sánh các lần thực thi nhiệm vụ agentic của opencode, không chỉ các prompt và mô hình đơn lẻ.

text
1# promptfooconfig.yaml
2description: "Benchmarking OpenCode Agent Harness: Gemini 3.8 Flash vs. Claude Fable 5.1"
3
4prompts:
5 - "Summarize git branch status in one sentence."
6 - "Design a zero-downtime database migration strategy from Postgres to Spanner."
7
8providers:
9 - id: "exec:opencode run --auto -m google-vertex/gemini-3.8-flash"
10 label: "Gemini 3.8 Flash (OpenCode Agent)"
11 - id: "exec:opencode run --auto -m google-vertex-anthropic/claude-fable-5-1"
12 label: "Claude Fable 5.1 (OpenCode Agent)"
13
14defaultTest:
15 options:
16 timeoutMs: 60000

Chạy so sánh song song của riêng bạn bằng cách sử dụng Promptfoo:

promptfoo eval -c promptfooconfig.yaml --no-cache

Dưới đây là kết quả của tôi khi chạy đánh giá này trong một container dev sạch:

Google Cloud Tech - inline image

Khi kiểm tra một nhánh PR, Claude Fable 5.1 đã tiến hành nhiều vòng phản ánh siêu cấp (meta-reflection), kiểm tra lại các hash cây không thay đổi. Nó mất gần 6 giây và tốn gấp 23 lần chi phí. Gemini 3.8 Flash nhận ra ý định ngay lập tức, kích hoạt các công cụ git và trả lời trong 1.1 giây với chi phí chưa tới một phần mười xu.

Trong cuộc di chuyển cơ sở dữ liệu phức tạp, bức tranh đảo ngược. Gemini 3.8 Flash tạo ra một chuỗi tuyến tính vững chắc, sạch sẽ trong 3 giây. Nhưng Fable 5.1 đã dành 12 giây để tạo ra một đồ thị có hướng không chu trình (DAG) hoàn chỉnh, chính thức. Nó xác định các rủi ro lệch đồng hồ trong ghi kép, tạo ra các yêu cầu khóa idempotency và xác định một cổng rollback có thể đảo ngược.

Đây chỉ là một ví dụ minh họa, bạn nên so sánh với các nhiệm vụ của riêng mình.

3. Cách sử dụng thực tế trong công việc hàng ngày và môi trường sản xuất

Cho dù bạn sử dụng các công cụ lập trình có sẵn hay xây dựng các dịch vụ agent tùy chỉnh, mẫu chiến thắng là sự phối hợp bất đối xứng: tốc độ rẻ cho thực thi tiền tuyến, kết hợp với chiều sâu có chủ đích cho các điểm kiểm tra kiến trúc. Dành các token đắt đỏ cho các vấn đề hóc búa hoặc công việc lập kế hoạch, nhưng mặc định sử dụng các token rẻ hơn cho các nhiệm vụ đơn giản hơn.

Bộ khung Agent Lập trình (Coding Agent Harnesses) (OpenCode, Aider, v.v.)

Đừng ép buộc một mô hình trở thành mặc định phổ quát của bạn. Cấu hình các subagent chuyên biệt được ánh xạ tới các mô hình riêng biệt. Việc sử dụng cùng một nhà cung cấp thống nhất đi kèm với các lợi ích về bảo mật và chi phí. Việc sử dụng các họ mô hình khác nhau có thể hưởng lợi từ việc chúng kiểm tra lẫn nhau.

Sử dụng agent tư duy sâu để xác định nguyên nhân gốc rễ và lập kế hoạch giải pháp cho vấn đề này, sau đó sử dụng agent công nhân để xử lý từng nhiệm vụ và báo cáo trạng thái. Bộ lập kế hoạch chuyên sâu kiểm tra công việc của họ và hoặc xác nhận thành công hoặc giao lại.

text
1# opencode.json
2{
3 "$schema": "https://opencode.ai/config.json",
4 "model": "google-vertex/gemini-flash-latest",
5 "agent": {
6 "plan": {
7 "model": "google-vertex/gemini-flash-latest"
8 },
9 "build": {
10 "model": "google-vertex/gemini-flash-latest"
11 },
12 "worker": {
13 "model": "google-vertex/gemini-3.8-flash",
14 "mode": "primary",
15 "description": "General worker agent using gemini-3.8-flash"
16 },
17 "deep-thinker": {
18 "model": "google-vertex-anthropic/claude-fable-5-1@default",
19 "mode": "primary",
20 "description": "Deep thinking agent using Claude Fable 5.1"
21 }
22 },
23...

Các Agent Tùy chỉnh "như một Dịch vụ" (Google ADK, LangGraph, mã tùy chỉnh, v.v.)

Khi xây dựng các bộ khung agent của riêng bạn và các dịch vụ agent của riêng bạn, bạn có quyền tự do kiến trúc hoàn toàn

  • Tái định hình bộ khung cho mô hình: Cung cấp cho Gemini 3.8 Flash 3 đến 5 công cụ tập trung (read_file, write_file, run_tests) với các schema JSON nghiêm ngặt. Các mô hình nhanh vượt trội trong thực thi tập trung, nhưng một danh mục 50 công cụ gây nhầm lẫn tham số và lãng phí ngữ cảnh. Cung cấp cho Claude Fable 5.1 tài liệu kiến trúc, schema và hướng dẫn, nhưng loại bỏ các quyền ghi tệp trực tiếp.
  • Dựa trên Evals: Đừng đoán mò xem mô hình nào phù hợp với nút nào. Chạy các bộ đánh giá tự động với các kiểm tra khẳng định xác định trên các nhiệm vụ repo của bạn để tìm nơi một mô hình nhỏ hơn cung cấp chất lượng 95% với chi phí 10%. Điều này dễ nói nhưng khó làm, khó biết những kịch bản nào bạn muốn đánh giá. Xem các khóa học Kaggle 5 ngày của chúng tôi (agents, videcoding) để biết thêm.
  • Sử dụng Mẫu Leo thang "Yêu cầu Trợ giúp": Bắt đầu mọi yêu cầu đến trên worker nhanh. Cung cấp cho worker một công cụ rõ ràng: ask_for_help(reason, failed_attempts, context). Worker xử lý trực tiếp 85% đến 90% các yêu cầu. Nó chỉ leo thang khi có sự mơ hồ, hành động không thể đảo ngược, hoặc hai lần thất bại công cụ liên tiếp.

Sự Kiểm tra Thực tế về các Bộ Định Tuyến Mô hình "Thông minh" Tự động

Các bộ định tuyến thông minh có lịch sử lâu dài trong ML dự đoán (công nghệ quảng cáo, phát hiện gian lận). Các bandit đa cánh tay và bộ định tuyến chi phí-chất lượng trưởng thành vì các đặc trưng là dạng bảng, đầu vào bị giới hạn và phản hồi (clicks, chargebacks) vừa tức thì vừa có thể đo lường trên một chân trời thời gian dài.

Trong AI tạo sinh, các agent đa vòng là một câu chuyện khác. Các bộ định tuyến động có thể gặp khó khăn với ba thực tế sản xuất:

  • Ngữ cảnh một vòng có thể không chứa đủ tín hiệu về nhiệm vụ để lựa chọn
  • Các chỉ số thành công không được ngoại suy rõ ràng sang các đặc trưng, vì vậy bộ định tuyến không thể "học" nhanh
  • Các lựa chọn sai được chạy lại trên con đường kia, ăn mòn vào bất kỳ khoản tiết kiệm tiềm năng nào và thêm độ trễ

Phán quyết: Giữ nó nhàm chán. Soạn thảo các agent của bạn một cách rõ ràng và định tuyến theo ranh giới nhiệm vụ. Xác định các vai trò rõ ràng, và để các khẳng định mã cụ thể hoặc ý định của con người kiểm soát các bàn giao.

4. Phương trình ROI Token: Bạn thực sự đang trả tiền cho điều gì?

Các bảng giá thô ($/1M tokens) không phải là một bản đồ tốt cho giá trị sản xuất. Tính toán chi phí chỉ là một phần của phương trình. Không thể đưa cho bạn một phép tính luôn luôn hoạt động, xuyên suốt lập trình, sản phẩm, sản xuất và mọi công việc cần hoàn thành khác ngoài kia.

Một điểm khởi đầu có thể là nghĩ về giá trị kinh doanh bạn đang nhận được.

  • Chi phí thời gian con người được tiết kiệm, nhân viên hoàn thành nhiều công việc hơn và dành ít thời gian hơn cho các công việc nặng nhọc và tự động hóa.
  • Giá trị của việc đưa các tính năng vào sản xuất nhanh hơn, đồng thời cải thiện sự hài lòng và giữ chân khách hàng nhờ các tính năng đó.
  • Các lỗi được giảm thiểu và các sự cố ngừng hoạt động sản xuất được tránh nhờ các biện pháp bảo vệ và thực hành kỹ thuật được cải thiện.

Trừ đi chi phí token, và chi phí nâng cao kỹ năng cho đội ngũ của bạn để xây dựng và quản lý các agent của họ, và bạn có một phép tính ROI sơ bộ.

Google Cloud Tech - inline image

Bạn có thể ảnh hưởng đến các phép tính này bằng cách sử dụng ít token hơn và rẻ hơn, nhưng có lẽ bạn sẽ ảnh hưởng đến chúng nhiều nhất bằng cách hoàn thành nhiều công việc hơn, nhanh hơn. Chọn các nhiệm vụ đòn bẩy cao. Chọn các nhiệm vụ dẫn đến tiết kiệm chi phí chung hoặc tăng doanh thu, có thể xác minh được và đáng để tự động hóa. Và khi bạn phân rã các nhiệm vụ đó, có lẽ bạn muốn suy nghĩ cực kỳ sâu sắc và lập kế hoạch và sẵn sàng trả nhiều hơn và chờ đợi, hoặc có lẽ bạn muốn thực thi nhanh và đáng tin cậy. Bạn sẽ cần cả hai.

Tokenomics là một chủ đề nóng hiện nay, và có nhiều lựa chọn hơn nữa để giảm chi phí và tối đa hóa giá trị. Điểm chính của bài viết này là thực sự đơn giản để thiết lập một vài agent khác nhau trên 2 mô hình với các hồ sơ khác nhau và tự định tuyến các nhiệm vụ. Đó là nơi dễ nhất để bắt đầu.

Nếu bạn thấy phân tích này hữu ích, hãy xem bài viết trước của chúng tôi về 5 điều mọi kỹ sư AI nên biết về sandbox agent. Theo dõi @GoogleCloudTech@zeroasterisk để có thêm các phân tích sâu từ chiến hào của những người xây dựng.

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral