Con số tiêu đề không phải là câu chuyện
Vào ngày 27 tháng 7, Moonshot AI phát hành toàn bộ trọng số của Kimi K3 theo giấy phép Modified MIT. Bảng thông số kỹ thuật trông như một màn khoe khoang: 2,8 nghìn tỷ tham số, cửa sổ ngữ cảnh một triệu token, và danh hiệu mô hình trọng số mở lớn nhất từng được phát hành, lớn hơn khoảng 75% so với DeepSeek V4 Pro.
Nhưng kích thước chỉ là mồi nhử. Câu chuyện thực sự là sự thay đổi trong việc ai kiểm soát quyền truy cập vào trí thông minh tiên tiến. Trong ba năm, các mô hình tốt nhất sống sau một API. Bạn trả tiền thuê, chủ nhà đặt điều khoản, và nếu nhà cung cấp định giá lại endpoint hoặc âm thầm thay đổi hành vi của mô hình, sản phẩm của bạn sẽ hứng chịu thiệt hại.
Trọng số mở phá vỡ thỏa thuận đó. Một khi các tệp được công khai, không phòng thí nghiệm nào có thể lấy lại khả năng đó. Một sự thật duy nhất đó thay đổi kinh tế học cho tất cả mọi người, bao gồm cả những người sẽ không bao giờ tải xuống một shard nào.
Bảng thông số kỹ thuật trong nháy mắt
Thông số
Giá trị
Tham số
2,8 nghìn tỷ
Chuyên gia
896 tổng cộng, 16 hoạt động trên mỗi token
Cửa sổ ngữ cảnh
1.048.576 token
Giấy phép
Modified MIT
Phát hành trọng số
27 tháng 7
Kích thước so với DeepSeek V4 Pro
~75% lớn hơn
Hiệu suất mở rộng so với K2
~2,5 lần
Định giá
Tỷ lệ
Đầu vào (cache hit)
$0,30 / 1M token
Đầu vào (cache miss)
$3,00 / 1M token
Đầu ra
$15,00 / 1M token
Làm thế nào một mô hình 2,8T tránh được hóa đơn 2,8T
Một mô hình dense có kích thước này sẽ không thể sử dụng được. Chạy mọi tham số trên mọi token là bức tường mà tất cả các mô hình quy mô nghìn tỷ đều gặp phải: quá chậm, quá đắt, không có cách nào vượt qua vật lý.
K3 né tránh nó bằng một thiết kế Mixture-of-Experts mạnh mẽ. Bên trong mô hình có 896 mạng con chuyên gia. Trên bất kỳ token nào, chỉ có 16 trong số chúng hoạt động. Bạn có được kiến thức lưu trữ của 2,8 nghìn tỷ tham số trong khi trả chi phí suy luận của một mô hình chỉ bằng một phần nhỏ kích thước đó.
Đây là sự thưa thớt, và K3 dựa vào nó mạnh hơn bất kỳ mô hình mở nào trước đây. K2 đã chứng minh cách tiếp cận này hiệu quả. K3 biến nó thành cược cốt lõi.

Hai bài nghiên cứu đã làm phần việc nặng nhọc
Hai thay đổi kiến trúc giúp phần còn lại khả thi, và cả hai đều được công bố dưới dạng nghiên cứu mở trước khi mô hình được phát hành, điều này đã mang lại uy tín cho Moonshot với các nhà nghiên cứu trước khi bất kỳ điểm chuẩn nào xuất hiện.
Đầu tiên là Kimi Delta Attention, một cơ chế chú ý tuyến tính lai. Chi phí chú ý tiêu chuẩn tăng bậc hai khi ngữ cảnh dài hơn, đó là lý do tại sao cửa sổ triệu token thường chỉ nằm trong các tài liệu tiếp thị. KDA mở rộng quy mô khác đi, và sự khác biệt đó là lý do duy nhất khiến cửa sổ 1M tồn tại với mức giá mà bất kỳ ai cũng có thể thực sự trả.
Thứ hai là Attention Residuals, một sự thay thế cho các kết nối dư tiêu chuẩn. Moonshot ghi nhận nó cho những lợi ích mở rộng quy mô nhất quán, cho phép họ xây dựng các mô hình sâu hơn mà không bị suy giảm thông thường. Theo số liệu của họ, sự kết hợp mang lại hiệu suất mở rộng quy mô cao hơn khoảng 2,5 lần so với K2.
Một triệu token giết chết điều gì

Hầu hết cơ sở hạ tầng truy xuất trong AI sản xuất tồn tại như một giải pháp thay thế. Chunking, embeddings, cơ sở dữ liệu vector, pipeline RAG: tất cả đều bù đắp cho các mô hình không thể giữ đủ trong bộ nhớ làm việc cùng một lúc.
Một triệu token thay đổi mặc định. Toàn bộ mã nguồn đi vào một prompt duy nhất. Một năm tài liệu nội bộ. Năm mươi bản ghi video. Mọi thứ nằm trong sự chú ý đồng thời, và mô hình suy luận trên toàn bộ tập hợp thay vì ghép các mảnh truy xuất lại và hy vọng các đường nối giữ vững.
Tầm nhìn gốc (native vision) mở rộng bề mặt đầu vào hơn nữa. Ảnh chụp màn hình, ảnh bảng trắng, sơ đồ kiến trúc và biểu đồ đều có thể đọc được trong cùng một ngữ cảnh với mã và văn bản xung quanh chúng. Không phải ngẫu nhiên mà chiến thắng điểm chuẩn mạnh nhất của K3 đến từ mã hóa front-end: mô hình nhìn thấy thiết kế và viết ra phần triển khai trong một cửa sổ ngữ cảnh.
Bảng giá quan trọng hơn điểm chuẩn
Các mức giá được niêm yết: $0,30 cho mỗi triệu token đầu vào khi cache hit, $3,00 khi cache miss, $15,00 cho mỗi triệu token đầu ra, với ngữ cảnh 1.048.576 token.
Con số cache là con số đáng chú ý. Moonshot báo cáo tỷ lệ cache hit trên 90% trong các phiên mã hóa dài. Hãy nghĩ về những gì một agent thực sự làm: nó đọc lại cùng một kho lưu trữ nhiều lần trong nhiều giờ. Nếu không có caching, nó trả giá đầu vào đầy đủ trên mỗi lần đọc. Với caching, chi phí của một phiên dài giảm xuống khoảng 4 lần.
Các agent tầm xa sống hay chết phụ thuộc chính xác vào phép tính này. K3 được xây dựng cho các phiên kéo dài hàng giờ với sự giám sát tối thiểu, điều hướng kho lưu trữ, điều phối các công cụ terminal, kiểm tra công việc của chính nó. Cấu trúc giá chính là sản phẩm.
Điểm trừ mà không ai nên bỏ qua
K3 không có chế độ tiết kiệm. Suy luận luôn bật và cố định ở mức tối đa. Những người thử nghiệm độc lập đã thấy nó đốt cháy hơn 13.000 token suy nghĩ cho một yêu cầu SVG tầm thường, khoảng $0,25 cho một truy vấn bỏ đi.
Bài học là định tuyến. Các cuộc gọi nhanh, rẻ, khối lượng lớn thuộc về các mô hình nhỏ hơn. K3 chỉ xứng đáng với chi phí của nó khi kích thước ngữ cảnh và độ phức tạp của nhiệm vụ biện minh cho suy luận luôn bật. Sử dụng nó như một endpoint chat đa năng là đốt tiền.
Kết nối chỉ mất năm phút
API tương thích với OpenAI. Thay đổi base_url và key, giữ nguyên mã hiện tại của bạn:
1from openai import OpenAI2import os34client = OpenAI(5 api_key=os.environ["MOONSHOT_API_KEY"],6 base_url="https://api.moonshot.ai/v1",7)89completion = client.chat.completions.create(10 model="kimi-k3",11 messages=[{"role": "user", "content": "Giới thiệu Kimi K3 trong một câu."}],12)13print(completion.choices[0].message.content)
Suy luận được cấu hình thông qua một trường cấp cao nhất, hiện chỉ chấp nhận "max":
1completion = client.chat.completions.create(2 model="kimi-k3",3 reasoning_effort="max",4 messages=[{"role": "user", "content": "Chứng minh rằng căn bậc hai của 2 là số vô tỷ."}],5)6print(completion.choices[0].message.content)
Streaming hoạt động theo cách tiêu chuẩn, với suy luận đến trong một trường delta riêng biệt để bạn có thể hiển thị suy nghĩ và câu trả lời một cách độc lập:
1stream = client.chat.completions.create(2 model="kimi-k3",3 messages=[{"role": "user", "content": "Giải thích tại sao bầu trời có màu xanh."}],4 stream=True,5)67for chunk in stream:8 delta = chunk.choices[0].delta9 reasoning = getattr(delta, "reasoning_content", None)10 if reasoning:11 print(reasoning, end="", flush=True)12 if delta.content:13 print(delta.content, end="", flush=True)
Đầu vào hình ảnh nhận hình ảnh mã hóa base64 cùng với văn bản trong cùng một tin nhắn. Đây là toàn bộ quy trình screenshot-to-code:
1import base642from pathlib import Path34image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()56completion = client.chat.completions.create(7 model="kimi-k3",8 messages=[9 {10 "role": "user",11 "content": [12 {13 "type": "image_url",14 "image_url": {"url": f"data:image/png;base64,{image_data}"},15 },16 {"type": "text", "text": "Xây dựng lại trang đích này bằng HTML và Tailwind."},17 ],18 }19 ],20)21print(completion.choices[0].message.content)
Tại sao điều này tiếp cận được những người không bao giờ chạm vào trọng số
Đây là phần trung thực: hầu như không ai sẽ tự host 2,8 nghìn tỷ tham số. Ngay cả với sự thưa thớt, hóa đơn phần cứng vẫn vượt xa tầm với của người đam mê, và cũng vượt quá khả năng của hầu hết các công ty.
Đó chưa bao giờ là vấn đề. Trọng số công khai đặt ra một giới hạn trên về những gì các phòng thí nghiệm đóng có thể tính phí cho khả năng tương đương. Các bên host thứ ba sẽ cạnh tranh với nhau để phục vụ K3 với biên lợi nhuận hàng hóa, cùng một động lực đã diễn ra với mọi bản phát hành mở lớn trước đó. Giá cả trên toàn bộ thị trường trôi về phía đường cơ sở mở.
Lợi ích đến với bạn thông qua hóa đơn của bất kỳ nhà cung cấp nào bạn đang sử dụng, cho dù bạn có bao giờ tải xuống một tệp hay không.
Một kế hoạch thực tế
Cung cấp cho nó những thứ hoàn chỉnh. Toàn bộ kho lưu trữ để xem xét, toàn bộ thư mục hợp đồng, toàn bộ thư viện nội dung. Ngừng chunking những gì không còn yêu cầu chunking.
Chạy nó lâu dài. Xếp hàng các phiên kỹ thuật kéo dài nhiều giờ và kiểm tra kết quả sau đó. Cache ăn chi phí của mỗi lần đọc lại.
Hướng máy ảnh vào các vấn đề. Chụp ảnh màn hình một trang đích và yêu cầu xây dựng lại. Chụp ảnh bảng trắng và yêu cầu triển khai.
Giữ lưu lượng tầm thường tránh xa nó. Một mô hình luôn suy luận ở mức tối đa là công cụ sai cho các cuộc gọi nhanh, khối lượng lớn. Định tuyến chúng ở nơi khác và dành K3 cho công việc xứng đáng.
Đếm ngược mười ngày
Trong ba năm, tiên phong là thứ bạn thuê, với các điều khoản bạn không đặt, với mức giá có thể thay đổi mà không báo trước.
Vào ngày 27 tháng 7, nó trở thành một tệp. Và một tệp, không giống như một đăng ký, là thứ bạn sở hữu.





