Mô hình mở lớn nhất thế giới vừa được ra mắt. Nó viết code ở cấp độ Fable 5, chi phí thấp hơn 5 lần và sử dụng một phần nhỏ token để làm việc đó. Dưới đây là bảy điểm nổi bật.
Vào ngày 16 tháng 7, một mô hình Trung Quốc mã nguồn mở đã âm thầm trở thành mô hình viết code mạnh mẽ nhất mà bạn có thể chạy mà không phải trả mức giá frontier.
Moonshot AI đã ra mắt Kimi K3 với 2,8 nghìn tỷ tham số, mô hình trọng số mở lớn nhất thế giới. Bloomberg, Forbes và Fortune đều đưa tin trong vòng 48 giờ, và lý do rất đơn giản: trên các điểm chuẩn lập trình, nó ngang ngửa với Claude Fable 5 và GPT-5.5, và nó làm điều đó với chi phí chỉ bằng khoảng một phần năm.

Để hiểu tại sao điều này lại quan trọng, hãy nhớ lại những gì hai năm qua đã dạy cho mọi người tin tưởng. Năng lực frontier đồng nghĩa với mức giá frontier. Nếu bạn muốn code tốt nhất, bạn phải trả mức giá tốt nhất, tính theo từng token, trên một endpoint mà bạn không kiểm soát. Đó đơn giản là thỏa thuận. Mọi đội ngũ nghiêm túc đều lập ngân sách dựa trên điều đó.
K3 phá vỡ giả định đó chỉ trong một lần ra mắt. Sự kết hợp mà nó mang lại, đầu ra ở cấp độ frontier với mức giá hàng hóa, cùng với trọng số được công bố cho bất kỳ ai tải về, là thứ mà báo chí kinh doanh đã phản ứng. Dưới đây là bảy tính năng khiến phần còn lại của lĩnh vực này cảm thấy lạc hậu. Tính năng đầu tiên là lý do hóa đơn API của bạn sắp giảm.

Dưới đây là bảy tính năng khiến phần còn lại của lĩnh vực này cảm thấy lạc hậu. Tính năng đầu tiên là lý do hóa đơn API của bạn sắp giảm.
1. Điểm nhấn chính
Viết code backend đẳng cấp Fable với chi phí thấp hơn 5 lần
Đây là tính năng định hình lại mọi thứ khác. Trong các thử nghiệm độc lập, Kimi K3 đạt ngang bằng với Claude Fable 5 trong các tác vụ viết code backend thực tế: thiết kế API, lược đồ cơ sở dữ liệu, logic dịch vụ, tái cấu trúc trên một cơ sở mã lớn. Không phải những đoạn mã nhỏ lẻ. Đó là loại công việc từng được dùng để biện minh cho một gói đăng ký frontier.
Backend là nơi sự khác biệt thể hiện rõ nhất, bởi vì code backend trừng phạt những lối tắt. Một thành phần front-end trông có vẻ đúng thường là đúng. Một trình xử lý thanh toán trông có vẻ đúng vẫn có thể làm hỏng trạng thái khi chịu tải, rò rỉ điều kiện cạnh tranh, hoặc âm thầm bỏ qua một trường hợp ngoại lệ. Đánh giá một mô hình dựa trên công việc backend có nghĩa là đánh giá nó dựa trên tính chính xác dưới áp lực, và đây chính xác là nơi các mô hình yếu hơn rơi ra khỏi nhóm frontier. K3 vẫn ở trong nhóm đó.
Sự khác biệt nằm ở hóa đơn. K3 tạo ra cùng một cấp độ code với chi phí chỉ bằng khoảng một phần năm, và bởi vì nó hiệu quả hơn về token, khoảng cách thực tế trên một dự án hoàn chỉnh thường lớn hơn nhiều so với mức giá niêm yết.

Hãy nhìn vào vị trí của các cột. K3 nằm trong nhóm frontier, không phải đang đuổi theo nó. Và bây giờ, hãy giữ chất lượng đó không đổi và xem xét chi phí để đạt được nó:

Bạn không đánh đổi chất lượng lấy giá cả. Bạn đang giữ đầu ra backend cấp Fable và xóa đi 80% hóa đơn.
Nhân con số đó lên trong một tháng làm việc thực tế của kỹ sư và con số đó không còn là trừu tượng nữa. Một đội ngũ chạy hàng nghìn tác vụ viết code tự động mỗi tuần không chỉ chọn một lần giữa 1,00 đô la và 0,20 đô la. Họ chọn nó hàng chục nghìn lần, và khoảng cách đó cộng dồn thành một khoản mục mà ban lãnh đạo thực sự chú ý.

2. Hệ số nhân
Nó nói nhiều hơn với ít token hơn
Giá mỗi token chỉ là một nửa của vấn đề kinh tế. Nửa còn lại là một mô hình tiêu tốn bao nhiêu token để đưa ra cùng một câu trả lời. K3 đặc biệt tiết kiệm ở điểm này. Nó suy luận để đưa ra một giải pháp khả thi với ít sự trao đổi qua lại hơn, ít giả định được lặp lại hơn và ít nội dung đệm xung quanh code thực tế hơn.
Có một lý do tinh tế khiến điều này quan trọng hơn đối với agent so với chat. Trong một cuộc trò chuyện đơn lẻ, một mô hình "nói nhiều" chỉ cảm thấy chậm. Trong một vòng lặp agent, mọi token lãng phí lại được tiêu tốn một lần nữa cho bước tiếp theo, và bước tiếp theo nữa, bởi vì ngữ cảnh được chuyển tiếp. Một mô hình tiết kiệm hơn 60% mỗi bước không chỉ rẻ hơn 60% trong một lần chạy. Nó tiết kiệm một cách cộng dồn, bởi vì nó cũng để lại một dấu vết nhỏ hơn cho mọi bước tiếp theo phải đọc lại.
Trên một prompt đơn lẻ, điều đó trông giống như một sai số làm tròn. Trên một lần chạy agent thực tế với hàng nghìn bước, nó cộng dồn thành sự khác biệt giữa một dự án tốn đô la và một dự án chỉ tốn xu. Đây là lý do tại sao khoảng cách chi phí thực tế so với Fable 5 trên một bản build hoàn chỉnh thường lớn hơn con số 5x được nhấn mạnh.

3. Quy mô
2,8 nghìn tỷ tham số, và bạn có thể tải chúng về
K3 là mô hình trọng số mở lớn nhất từng được phát hành. Moonshot gọi nó là mô hình lớp 3T mở đầu tiên, giành vương miện từ DeepSeek. Để dễ hình dung, cả OpenAI và Anthropic đều không tiết lộ số lượng tham số của họ. Đây là một phòng thí nghiệm công bố một mô hình 2,8T và trao cho bạn các trọng số.
Bản thân quy mô không phải là vấn đề. Điều quan trọng là dung lượng lớn như vậy giờ đây là thứ bạn có thể chạy, kiểm tra, tinh chỉnh và tự lưu trữ, thay vì thuê thông qua một endpoint tính phí mà bạn không kiểm soát. Đối với một đội ngũ backend, sự khác biệt đó không phải là lý thuyết suông. Nó có nghĩa là bạn có thể đặt mô hình sau tường lửa của riêng mình, tinh chỉnh nó trên cơ sở mã và quy ước của riêng bạn, và không bao giờ gửi một dòng code độc quyền nào đến API của bên thứ ba. Bản phát hành trọng số mở sẽ có mặt vào ngày 27 tháng 7.

4. Bộ nhớ
1 triệu token ngữ cảnh trong một lần
K3 chứa một triệu token ngữ cảnh trong một cửa sổ duy nhất. Về mặt thực tế, đó là toàn bộ cơ sở mã backend, các bài kiểm tra, tài liệu và lịch sử di chuyển của nó, tất cả được tải cùng một lúc, vẫn còn dư chỗ.
Đây là điều làm cho câu chuyện về code trở nên thực tế thay vì chỉ là một thành tích điểm chuẩn. Một mô hình viết code như Fable thì hữu ích. Một mô hình viết code như Fable và có thể nhìn thấy toàn bộ repo của bạn cùng một lúc là một loại công cụ khác. Nó tái cấu trúc với kiến thức đầy đủ về mọi caller, mọi kiểu dữ liệu, mọi phụ thuộc hạ nguồn, thay vì phỏng đoán từ ba tệp bạn đã cố gắng dán vào.
Bất kỳ ai đã từng chứng kiến một mô hình mạnh mẽ tự tin phá vỡ một cơ sở mã đều biết kiểu thất bại: nó viết code đúng cho tệp nó có thể thấy, và code sai cho mười hai tệp nó không thể thấy. Một cửa sổ một triệu token không làm cho mô hình thông minh hơn. Nó tháo bỏ chiếc bịt mắt. Khả năng suy luận cấp Fable tương tự giờ đây hoạt động trên toàn bộ bức tranh, đó là nơi hầu hết các lỗi backend thực sự ẩn náu.

5. Tính song song
K3 Swarm Max chạy công việc song song
K3 được phát hành với hai biến thể. K3 Max xử lý các tác vụ chat và agent. K3 Swarm Max được xây dựng cho xử lý song song quy mô lớn: nhiều agent làm việc cùng một lúc thay vì một mô hình xử lý lần lượt qua một hàng đợi.
Đối với công việc backend, đây là sự khai phá. Thay vì một agent triển khai bốn mươi endpoint theo trình tự, swarm phân bổ chúng cho các worker song song, mỗi worker có một phần cơ sở mã riêng, và chúng hoàn thành cùng nhau. Chất lượng cấp Fable giờ đây cũng nhanh chóng, bởi vì thông lượng tỷ lệ thuận với số lượng agent thay vì độ dài của một cuộc trò chuyện đơn lẻ.
Tính kinh tế chồng lên tốc độ. Bởi vì mỗi agent trong swarm là một agent K3, toàn bộ lần chạy song song kế thừa cùng một lợi thế chi phí 5x. Bạn không phải trả mức giá frontier cho đặc quyền song song, như cách bạn sẽ làm nếu bạn triển khai bốn mươi agent Fable cùng một lúc. Bạn có được thông lượng của một swarm và hóa đơn của một mô hình hàng hóa cùng một lúc.

6. Tầm với
Được xây dựng cho công việc agent tầm xa
K3 được huấn luyện đặc biệt cho các khối lượng công việc viết code tầm xa và agent, không phải được tinh chỉnh lại cho chúng. Nó duy trì một kế hoạch qua hàng nghìn bước, sử dụng các công cụ mà không bị mất mạch, và phục hồi khi một bước thất bại thay vì làm hỏng toàn bộ quá trình chạy.
Kết hợp điều đó với cửa sổ một triệu token và bạn có một agent có thể sở hữu toàn bộ một tính năng backend từ đầu đến cuối: đọc cơ sở mã, lập kế hoạch thay đổi, triển khai qua các dịch vụ, chạy kiểm tra, đọc các lỗi và sửa chúng. Loại vòng lặp mà trước đây chỉ hoạt động trên các mô hình frontier giờ đây hoạt động trên một mô hình có chi phí chỉ bằng một phần năm.
Phần phục hồi sau lỗi là thứ phân biệt một bản demo với một công cụ. Hầu hết các agent trông rất ấn tượng cho đến khi một bài kiểm tra thất bại ở bước thứ 900, tại thời điểm đó, một agent mong manh sẽ vứt bỏ kế hoạch và bắt đầu ứng biến. K3 được tinh chỉnh để coi một bước thất bại là thông tin chứ không phải là ngõ cụt. Nó đọc lỗi, điều chỉnh và tiếp tục, đó là cách duy nhất để một lần chạy tầm xa thực sự hoàn thành.

7. Sự thay đổi
Trọng số mở, và nó thiết lập lại giá của frontier
Tính năng thứ bảy không phải là một thông số kỹ thuật. Đó là tổng hòa của sáu tính năng còn lại. Khi một mô hình mạnh mẽ như vậy có trọng số mở, việc định giá của mọi mô hình đóng trở thành một câu hỏi thay vì một điều hiển nhiên.
Nếu K3 cung cấp code backend cấp Fable với chi phí bằng một phần năm, với cửa sổ một triệu token và một swarm song song, gánh nặng sẽ chuyển sang các phòng thí nghiệm đóng để biện minh cho mức phí bảo hiểm của họ. Đó là cùng một mô hình mà ngành công nghiệp đã thấy với DeepSeek, và đó là lý do tại sao sự ra mắt này đã lên trang nhất của ba tờ báo kinh doanh trong hai ngày.
Moonshot không tình cờ làm được điều này. Công ty đã huy động được 500 triệu đô la vào tháng 1 với mức định giá 4,3 tỷ đô la, dành riêng cho K3 và sức mạnh tính toán để huấn luyện nó. Đây là một nỗ lực có chủ đích, được tài trợ để đưa một mô hình cấp frontier ra công khai, và việc định giá cũng không phải là tình cờ. Đó là chiến lược. Phá giá các phòng thí nghiệm đóng về chi phí trong khi đánh bại họ trên một khía cạnh duy nhất trả tiền cho các nhà phát triển: code hoạt động.

Bảy điểm, trong một cái nhìn tổng quan:
- Viết code backend cấp Fable với chi phí thấp hơn khoảng 5 lần.
- Tiết kiệm token, do đó khoảng cách thực tế thậm chí còn lớn hơn.
- 2,8 nghìn tỷ tham số, mô hình trọng số mở lớn nhất thế giới.
- Ngữ cảnh 1 triệu token, toàn bộ một repo backend trong một lần.
- K3 Swarm Max cho các bản build song song, thông lượng cao.
- Khối lượng công việc agent tầm xa, được sở hữu từ đầu đến cuối.
- Trọng số mở, thiết lập lại những gì frontier được phép có giá.
Code cấp Fable. Một phần năm giá. Trọng số mở.
Frontier từng là một nơi bạn phải trả tiền để ghé thăm. Kimi K3 vừa biến cấp độ viết code tốt nhất thành thứ bạn có thể chạy, sở hữu và chi trả. Mọi mô hình khác giờ đây phải giải thích tại sao nó đắt gấp năm lần cho cùng một kết quả.





