Mô hình tốt nhất cho một công việc hầu như không bao giờ là mô hình đứng đầu bảng xếp hạng.
Trong thế giới AI, Giáng sinh đến khoảng mỗi tuần một lần. Một mô hình mới ra mắt, mọi người đều nhìn vào cùng những biểu đồ điểm chuẩn có độ chính xác giả tạo, và tất cả chúng ta đều đồng ý rằng đó là thứ tuyệt vời nhất từ trước đến nay, cho đến tuần sau, khi chúng ta lại làm điều tương tự.
Nhưng không một biểu đồ nào trong số đó trả lời được câu hỏi duy nhất quan trọng. Liệu mô hình có thực sự có thể chạy bản tóm tắt hàng ngày của bạn hoặc gửi báo giá cho khách hàng không? Tại Hyperagent, chúng tôi cung cấp cho bạn quyền truy cập vào tất cả các mô hình này trên nền tảng của một agent đẳng cấp nhất. Vì vậy, chúng tôi đã tự mình chạy thử chúng. Mười bốn mô hình, bốn mươi hai lần chạy, trên công việc tri thức thực tế mà khách hàng của chúng tôi giao cho các agent hàng ngày. Ba điều nổi bật.
- Hóa đơn chênh lệch 50 lần cho cùng một công việc. Cùng một bộ thử nghiệm tốn 1,48 đô la trên Qwen 3.7 Plus và 75,16 đô la trên Fable 5.
- Người chiến thắng điểm chuẩn không phải là người chiến thắng trong công việc. GPT 5.6 Sol đứng đầu các bài kiểm tra cơ bản của chúng tôi nhưng không lọt vào top ba khi nó thực hiện các công việc thực tế bên trong Hyperagent. Grok 4.5 ở vị trí trung bình trong bài kiểm tra cơ bản và vươn lên dẫn đầu về công việc hoàn thành, tốc độ và chi phí.
- Và không có mô hình nào thắng tất cả. Lựa chọn đúng đắn thay đổi tùy theo công việc.
Bài học rút ra không phải là một mô hình yêu thích mới. Đó là một cách để quyết định, từng công việc một, mô hình nào xứng đáng với chi phí của nó.
Bản đồ mô hình AI cho công việc tri thức
Mọi công việc bạn giao cho một agent đều xoay quanh hai câu hỏi: nó cần bao nhiêu khả năng phán đoán và nó chạy thường xuyên như thế nào? Vẽ hai trục đó ra, công việc tri thức rơi vào bốn khu vực, mỗi khu vực muốn một loại mô hình khác nhau.

Công việc khối lượng lớn (góc trên bên trái). Phân loại, giám sát, định tuyến, đồng bộ dữ liệu. Quy trình rõ ràng, chạy liên tục và sai sót dễ sửa chữa. Công việc này cần thứ gì đó nhanh và rẻ.
Công việc thủ công hàng ngày (góc trên bên phải). Soạn thảo, báo cáo, nghiên cứu, giao tiếp với khách hàng. Công việc tri thức lặp đi lặp lại chiếm phần lớn thời gian trong tuần - nó cần khả năng tổng hợp thực sự và giọng văn tốt, được thực hiện đáng tin cậy và thường xuyên.
Tình huống rủi ro cao (góc dưới bên phải). Rà soát hợp đồng, quyết định giá cả, nghiên cứu chuyên sâu. Hiếm khi xảy ra, nhưng một câu trả lời sai có thể khiến bạn mất khách hàng, một hợp đồng hoặc lợi nhuận của cả quý. Đây là nơi mà tác hại vượt xa hóa đơn mô hình, và là nơi những mô hình đắt nhất xứng đáng với mức giá của chúng.
Không cần tối ưu (góc dưới bên trái). Những yêu cầu đơn giản, thỉnh thoảng mà bất kỳ mô hình có năng lực nào cũng đáp ứng được và khoảng cách giá quá nhỏ để đáng phải quyết định. Đó là ô duy nhất trên bản đồ mà chúng tôi bảo mọi người đừng bận tâm.
Ba nhóm mô hình
Ba nhóm làm việc xuất hiện từ bản đồ. Chúng mô tả kinh tế học và hồ sơ phán đoán của công việc hơn là xếp hạng mô hình tốt hay xấu.
Sprinter được xây dựng cho công việc khối lượng lớn - nhanh, rẻ và nhất quán khi quy trình rõ ràng và sai sót dễ sửa. Haiku 4.5, Gemini 3.5 Flash và DeepSeek V4 Pro.
Middleweight vận hành công việc thủ công hàng ngày. Chúng tổng hợp các nguồn, nắm giữ kế hoạch nhiều bước và viết tốt mà không tính phí cao nhất cho mọi báo cáo. Sonnet 5, GPT 5.6 Terra, Grok 4.5 và GLM 5.2 - nơi hầu hết công việc tri thức thuộc về.
Heavyweight đảm nhận các nhiệm vụ rủi ro cao, mang lại khả năng phán đoán mạnh mẽ hơn và nhiều thời gian suy luận hơn cho công việc mà một câu trả lời sai tốn kém hơn nhiều so với hóa đơn mô hình. Opus 4.8, GPT 5.6 Sol và Fable 5.
Bản năng của hầu hết mọi người là bắt đầu từ cao và giảm dần - chạy mọi thứ trên Fable 5 hoặc Opus 4.8, lấy đầu ra bạn muốn, sau đó thử các mô hình rẻ hơn cho đến khi chất lượng giảm sút. Cách này hiệu quả, nhưng chúng tôi thấy hầu hết các công việc không cần đến nó. Một khi bạn có thể đặt tên cho công việc và đặt nó trên bản đồ, bạn thường có thể bắt đầu ở đúng nhóm ngay từ đầu. Đối với công việc thủ công hàng ngày, chiếm phần lớn những gì bạn làm, điều đó có nghĩa là bắt đầu với một middleweight vững chắc như Sonnet 5. Bạn chỉ cần sử dụng cách tìm kiếm từ trên xuống khi một công việc thực sự nằm ở phân khúc rủi ro cao.
Phạm vi rộng hơn Claude, GPT và Gemini
Hầu hết các nhóm đều mặc định sử dụng một vài tên mô hình mà họ đã biết. Đó là một điểm khởi đầu hợp lý, nhưng nó bỏ sót nhiều mô hình khác - và một số mô hình thực hiện công việc hữu ích nhất trong Hyperagent không phải là những cái tên phổ biến. Đây là những ấn tượng vận hành của chúng tôi từ bộ thử nghiệm và từ việc sử dụng hàng ngày, cộng với công việc mà chúng tôi đã theo dõi khách hàng thực hiện.
Grok 4.5 là nghiên cứu thời gian thực, nhanh chóng. Nó di chuyển nhanh qua các nghiên cứu sử dụng nhiều công cụ và hoạt động đặc biệt tốt khi kết hợp với Exa Search gốc của Hyperagent. Nó cũng có một đường dẫn gốc vào X, vì vậy một câu hỏi về tâm lý trực tuyến có thể trả về các bài đăng thực tế đằng sau câu trả lời. Nó dẫn đầu điểm số công việc hoàn thành của chúng tôi với mức giá 9,71 đô la cho toàn bộ lần chạy.
Muse Spark 1.1 viết sạch sẽ và tự kiểm tra. Nó đứng thứ hai trong bộ thử nghiệm, và đánh giá ban đầu của chúng tôi là văn xuôi ngắn gọn, có cấu trúc tốt với thói quen hữu ích là tự kiểm tra công việc trước khi trả lại. Nó vẫn còn mới, vì vậy chúng tôi sẽ bắt đầu sử dụng nó cho các công việc hàng ngày có giám sát trước khi chuyển sang các công việc dài hạn không giám sát.
Kimi K2.6 là nghiên cứu chuyên sâu với mức giá của mô hình mở. Nó chạy các tìm kiếm song song và tổng hợp bằng chứng thành một câu trả lời duy nhất mà không tính phí cao nhất, điều này khiến nó trở thành một chuyên gia nghiên cứu mạnh mẽ. Một hạn chế thực sự duy nhất của nó là kích thước tài liệu, với cửa sổ ngữ cảnh tối đa 256.000 token.
GLM 5.2 là lựa chọn về giá trị. Nó gần đến mức đáng ngạc nhiên so với các middleweight đóng trên nghiên cứu thông thường, soạn thảo và công việc tài liệu dài với mức giá khoảng một phần ba, và văn xuôi của nó nằm trong số mạnh nhất bên ngoài Sonnet và Opus. Nó đã trở thành một công cụ hàng ngày đối với nhiều thành viên trong nhóm Hyperagent.
Qwen 3.7 Plus là người làm việc trên màn hình. Nó đặc biệt giỏi trong việc tìm các nút, trường và menu trên các trang được hiển thị, và nó rẻ cho việc trích xuất có cấu trúc - nó tạo ra lần chạy hoàn chỉnh có chi phí thấp nhất trong bộ thử nghiệm của chúng tôi. Hãy sử dụng nó khi công việc liên quan đến giao diện hoặc di chuyển dữ liệu, không phải khi giọng văn quan trọng.
DeepSeek V4 Pro là phân tích có cấu trúc với chi phí rất thấp. Nó mạnh nhất về đối chiếu, dọn dẹp dữ liệu, công việc số theo lịch trình và các tác vụ có cấu trúc tương tự. Khả năng viết của nó mang tính nguyên văn và ngắn gọn, phù hợp cho các giải thích nội bộ và không phù hợp cho văn bản hướng đến khách hàng. Một chuyên gia, và rất kinh tế.
Bố trí nhân sự cho các agent luôn hoạt động của bạn với mức giá phù hợp
Steve Juba điều hành một công ty du lịch sáu người. Anh ấy đã xây dựng một agent tóm tắt kết nối với tám nguồn dữ liệu trực tiếp chạy vài lần một ngày, và nó đã cắt giảm thời gian thu thập thông tin buổi sáng của anh ấy từ hơn ba giờ trên tám tab xuống còn mười lăm phút.
Một agent như thế này đọc nhiều hơn viết và thực hiện cùng một công việc hàng trăm lần một năm, vì vậy một chênh lệch giá nhỏ mỗi lần chạy không còn là sai số làm tròn mà trở thành một khoản mục ngân sách thực sự. Hãy xem xét một bản tóm tắt đọc 100.000 token và viết 2.000 token mỗi ngày. Theo giá niêm yết tháng 7 năm 2026, khối lượng công việc đó sẽ tốn khoảng:
- 16 đô la một năm trên Qwen 3.7 Plus (sprinter)
- 38 đô la một năm trên Kimi K2.6 (middleweight)
- 40 đô la một năm trên Haiku 4.5 (sprinter)
- 80 đô la một năm trên Sonnet 5 (middleweight)

Các tùy chọn trọng lượng mở thay đổi cách tính toán cho công việc nặng về đọc như thế này. Kimi K2.6 thực hiện nghiên cứu và tổng hợp chất lượng middleweight với giá 38 đô la cho công việc này - chưa bằng một nửa Sonnet 5, và gần bằng giá chạy sprinter Haiku. Bạn không đánh đổi khả năng phán đoán lấy chi phí; bạn đang nhận được công việc của middleweight với giá của sprinter. Nếu công việc chỉ là trích xuất thuần túy mà không cần phán đoán, Qwen sẽ chạy nó với giá 16 đô la - nhưng khi cần tổng hợp thực sự, Kimi cung cấp điều đó với mức giá gần tương đương.
Đổi mô hình, giữ nguyên agent
Không điều nào trong số này có ý nghĩa nếu việc chuyển đổi mô hình đồng nghĩa với việc xây dựng lại agent. Bên trong Hyperagent, điều đó không xảy ra, bởi vì mô hình chỉ là một cài đặt và vai trò nằm ở trên nó. Thay đổi mô hình và agent vẫn giữ mọi thứ làm nên sự hữu ích của nó:
- Hướng dẫn và phạm vi của nó
- Kỹ năng, tập lệnh và quy trình làm việc của nó
- Bộ nhớ về các chỉnh sửa của nó
- Các tệp tham khảo và bối cảnh công ty của nó
- Kết nối của nó với các hệ thống nơi công việc diễn ra
- Các tiêu chí đánh giá chất lượng của nó

Điều đó biến việc chọn mô hình thành một bài kiểm tra chứ không phải là một cuộc di chuyển. Cùng một agent có thể chạy cùng một công việc trên hai mô hình mà không cần xây dựng lại, vì vậy bạn có thể tìm ra mô hình rẻ nhất đáp ứng tiêu chuẩn của mình thay vì phải phỏng đoán.
Nó cũng cho phép phần đắt tiền của một quy trình làm việc khó tự trả tiền một lần. Khi một công việc thực sự cần nó, hãy sử dụng một mô hình nặng hơn để thiết kế và gỡ lỗi quy trình làm việc - sau đó hệ thống hóa quy trình thành một kỹ năng để một middleweight hoặc sprinter có thể chạy nó hàng ngày với một phần nhỏ chi phí.
Tuy nhiên, có một chi phí ẩn cần theo dõi. Một mô hình rẻ hơn với hóa đơn thấp không hề rẻ nếu mọi đầu ra đều cần chỉnh sửa - thời gian xem xét của con người và chi phí của một sai sót là một phần của giá thực tế. Hãy gọi nó là thuế xem xét. Nó đặt ra giới hạn dưới cho mức độ rẻ mà bạn có thể đi. Điều khác biệt trong Hyperagent là việc xem xét không chỉ được thanh toán, nó còn được cộng dồn: khi agent học hỏi từ các chỉnh sửa của bạn thông qua bộ nhớ, nỗ lực xem xét đó được bộ khung thu thập và tạo ra một agent tốt hơn cho lần chạy tiếp theo.
Khách hàng đã bố trí nhân sự cho các agent theo cách này. Ankit Das đã xây dựng một hoạt động tiếp thị với Growth Orchestrator trên Sonnet 5 đưa ra các quyết định phán đoán và tám chuyên gia kênh trên GLM 5.2 sản xuất công việc kênh định kỳ, với các agent QA riêng biệt kiểm tra tuân thủ thương hiệu và chất lượng viết - tất cả đều được khởi động từ một luồng duy nhất. Eli Weiss mô tả sự phân chia của mình một cách đơn giản hơn: khoảng 85% Sonnet và 15% Opus trên các kỹ năng và thói quen của anh ấy. Hầu hết công việc chạy trên trình điều khiển hàng ngày; Opus nhận được một tập hợp nhỏ hơn các công việc mà khả năng phán đoán bổ sung xứng đáng với chi phí của nó.
Đó là giá trị thực tế của việc lựa chọn mô hình trong Hyperagent. Chi tiêu có chủ đích cho các công việc khác nhau và dành những đô la thêm cho những công việc mà khả năng phán đoán bổ sung thay đổi kết quả.
Chọn mô hình sau khi bạn chọn công việc
Sử dụng trình tự này trên một agent bạn đã chạy:
- Đặt tên cho công việc. "Chuẩn bị báo cáo khách hàng thứ Hai" hữu ích hơn "giúp với báo cáo."
- Đặt nó trên bản đồ. Quyết định xem nó cần bao nhiêu khả năng phán đoán và nó sẽ chạy thường xuyên như thế nào.
- Bắt đầu từ nơi bản đồ đặt nó. Đối với hầu hết công việc, đó là một middleweight có năng lực - hãy sử dụng nó cho đến khi bạn hiểu các trường hợp ngoại lệ của công việc và hệ thống hóa quy trình thành các kỹ năng.
- Kiểm tra một nhóm nhẹ hơn cho năm lần chạy thực tế. Giữ nguyên các hướng dẫn, kỹ năng, bộ nhớ, nguồn và tiêu chí.
- So sánh tổng chi phí. Theo dõi chất lượng hoàn thành, tính nhất quán, thời gian, sai sót thực tế, hóa đơn mô hình và thời gian xem xét của con người.
- Leo thang có mục đích. Đưa vào một heavyweight khi gánh nặng xem xét hoặc chi phí của một câu trả lời sai vượt quá phí bảo hiểm của mô hình.
- Sử dụng một mô hình khác để xem xét công việc quan trọng. Mô hình đã mắc sai lầm thường là mô hình ít có khả năng nhìn thấy nó nhất.
Hãy giữ lại mô hình ít tốn kém nhất đáp ứng một cách đáng tin cậy tiêu chuẩn của bạn. Sau đó chi phần chênh lệch cho những nhiệm vụ xứng đáng.





