這是一份完整的 Kimi K3 入門指南,涵蓋它的本質、功能,以及為何它正悄悄成為目前最被忽略的重要程式碼模型。
請把這頁加入書籤,以免錯過這篇文章。
2.8 兆個參數。100 萬 Token 的上下文。
以下是所有細節。
在討論基準測試之前,先來談談剛剛發生的事
過去三年,故事總是一樣的:美國實驗室打造前沿,中國實驗室六個月後做出便宜的複製品。
7 月 16 日,Moonshot AI 發表了 Kimi K3。
https://x.com/Kimi_Moonshot/status/2077830229968683203
總計 2.8 兆個參數——比 DeepSeek 的 V4 Pro 大約大 75%,接近智譜 GLM 5 系列的 4 倍。這是史上最大的開源模型。
它超越了 Claude Opus 4.8。超越了 GPT-5.6 Sol。在 Moonshot 的基準測試中,它與目前公開可用的最強模型 Fable 5 並駕齊驅。
複製的故事已經結束了。
數據

最後那一行是大家容易誤讀的地方。我們來好好處理它。
定價的現實——請仔細閱讀
Kimi K3 不是一個折扣模型。每百萬 Token 收費 3/15 美元,定價大致與 Claude Sonnet 相當——而不是 Moonshot 早期版本提供的深度折扣。
那麼,「比 Fable 5 便宜 5 倍」是從哪裡來的?
是每項任務的成本,而不是每個 Token 的價格。
K3 完成相同工作所需的輸出 Token 數量顯著減少。以一個代表性的程式任務為例:Fable 5 成本約為 1.30 美元。K3 成本約為 0.25 美元。
相同的輸出等級。更少的 Token。更低的總帳單。
誠實的說法是:Sonnet 的價格,Fable 等級的體驗。 你買的不是市場上最便宜的 Token。你買的是以中等價格獲得的前沿能力,而且步驟更少。
如果你比較的是原始 Token 價格,K3 看起來平淡無奇。但如果你比較的是完成一項工作需要多少成本,那就是另一回事了。
Kimi K3 在哪些方面達到最高水準
根據 Moonshot 公布的基準測試,K3 在以下項目創下最高水準(SOTA):
- HLE with tools——人類最終考試(工具增強版)
- SWE-Bench Pro——真實世界軟體工程
- SWE-Bench Multilingual——跨語言工程
- BrowseComp——網頁瀏覽與研究
- Toolathlon——大規模工具使用
- CharXiv with Python——圖表與圖形推理
- MathVision with Python——視覺數學

對比競爭對手:超越 Opus 4.8 和 GPT-5.6 Sol,與 Fable 5 平起平坐。
在 AI 評估器 Arena 的盲測中,開發者偏好 Kimi 勝過所有領先的美國模型。
兩個真正重要的架構創新
這是大多數報導忽略的部分,也是這次發表中最有趣的地方。

- Kimi Delta Attention (KDA)
一種混合線性注意力機制。結果是:在百萬 Token 的上下文中,解碼速度快了 6.3 倍。
100 萬 Token 的上下文視窗只有在你可以真正在其中工作而不需要永遠等待時才有用。KDA 正是讓這個上下文視窗從理論變為實用的關鍵。
- Attention Residuals (AttnRes)
一種殘差連接的替代方案。訓練效率提高約 25%,成本僅增加不到 2%。
這兩項技術都在模型發表前由 Moonshot 團隊在 GitHub 上作為開放研究發布。這不是行銷——這是可供同行檢驗的工作。
兩者結合,解釋了 Token 效率:K3 在同等任務上使用的輸出 Token 比 K2.6 少了 21%。
最令人震驚的部分:K3 自動優化了自己的架構
Moonshot 給了 K3 注意力殘差(Attention Residuals)的實作——它自己的架構組件——以及一個目標:在不改變數值行為的前提下,讓它在 H200 硬體上更快。
然後他們就放手了。
20 小時的實驗。零人工干預。速度提升了 1.6 倍。
在另一次運行中,K3 將 FLA Triton AttnRes 的前向/反向時間從 283.6ms 降低到 114.4ms——速度提升了 2.48 倍——同樣沒有改變數值。

而且它的迭代速度比 Fable 5 做同樣任務時更快。
再讀一遍。這個模型改進了讓模型運作的機制。自主地。在一夜之間。
這就是「遞迴式自我改進」在實際中的樣子——不是科幻場景,而是 20 小時的工作,有可衡量的結果。這正是 Anthropic 幾週前警告過的能力,現在出現在一個任何人都可以在 7 月 27 日下載的開放權重模型中。
長週期程式碼編寫是核心重點
Moonshot 自己的說法是:「K3 是 Moonshot AI 迄今為止最強大的開源程式碼模型。在極少人工監督下運行,能夠進行長時間的工程會話、瀏覽大型儲存庫,並協調終端工具。」
真正工程工作所需的三件事:
- 持續的會話——20 小時的自主實驗不是展示,而是設計目標。
- 大型儲存庫——100 萬 Token 的上下文加上 6.3 倍的解碼速度,意味著你可以將真實的程式碼庫放入上下文,並在其中實際工作。
- 工具協調——在 Toolathlon 和 BrowseComp 上達到最高水準,代表它能處理終端、瀏覽器和 API 呼叫而不會崩潰。
前端程式碼達到 Fable 5 等級。從單一提示生成 AAA 品質的遊戲場景。WebGPU、Three.js、著色器、物理——這些過去需要一個工作室才能完成的事。
使用 Kimi K3 進行氛圍程式設計
這就是模型從基準數字轉變為明顯有用的地方。
K3 的前端程式碼達到 Fable 5 等級。實際上,這意味著描述與可運作的 3D 產品之間的壁壘現在只是一個提示。
人們從單一提示實際發布了什麼:
遊戲——帶 VFX 的 WebGPU 戰鬥競技場。基於瀏覽器的 3D 城市穿越,帶有抓鉤機制。
- 殭屍 FPS。
- 多人賽車。
- 一個可運作的 3D GBA 模擬器。
- 完整的 MMORPG 框架。
不是「遊戲般的展示」——是可遊玩的場景,有命中反應、衝擊回饋和合理的物理行為。

具有真實材質的 3D 物件——一款具有正確光澤度和光線行為的勞力士。一把 CSGO 武器,由 33 個獨立建模的部件組成,可以組裝和拆卸。一部 Sony 相機拆解。一個帶有重力透鏡效應的黑洞。具有真實波浪動態的海洋模擬。

物理場景——布料模擬。結構坍塌。車輛碰撞,動量傳遞看起來真實而不是像腳本編寫的。
這與以往「AI 建立網站」展示的不同之處在於:K3 處理了通常會出錯的細節。光照。陰影。材質光澤度。那些區分「明顯是 AI 生成的」與「有人真正打造了這個」的 20 個小細節。
一個提示。四百萬個 Token。一個過去需要一個團隊才能完成的場景。
4 個經過實戰考驗的提示(可直接複製貼上)
這些提示的結構旨在充分利用 K3 真正的強項:長週期工作、工具使用,以及在不偏離主題的情況下維持大型上下文。
提示 1 — 物理壓力測試
這個提示可以區分出真正的能力與展示用的虛假效果。如果一個模型能高品質地完成這三個場景,那就是真的厲害。
1Build three self-contained HTML5 canvas scenes with real physics.2No external libraries. Everything in one file per scene.34Scene 1: A train derailing off a broken bridge into water.5Include: carriage momentum, bridge structural failure,6water displacement on impact.78Scene 2: Two cars jumping off ramps and colliding mid-air9over a canyon. Include: correct trajectory arcs,10collision momentum transfer, debris.1112Scene 3: A monster truck crushing a row of parked cars.13Include: suspension compression, sheet metal deformation,14weight distribution.1516Requirements for all three:17- Physics must be computed, not animated18- 60fps target19- Include a reset button20- Comment the physics math so I can verify it2122Build all three. Don't ask clarifying questions.
提示 2 — 長週期儲存庫任務
這是 K3 真正的設計目標。指向一個真實的程式碼庫,然後給它一個結果,而不是一個任務。
1Read this entire codebase before writing anything.23[paste your repo, or point it at the directory]45Objective: [state a measurable outcome — e.g. "reduce6p95 API response time by 30%" or "eliminate all N+17queries in the data layer"]89Rules:10- Profile first. Show me where the time actually goes11 before you change anything.12- Do not change public interfaces or numerical behavior.13- Run the existing test suite after each change.14- If a change makes things worse, revert it and tell me why.15- Work until the objective is hit or you can prove it's16 not achievable without breaking the rules.1718Report at the end: what you changed, what it bought,19what you tried that didn't work.
「你嘗試過但沒有效果的東西」這一行很重要。它把輸出從一個差異比較變成了工程日誌。
提示 3 — 3D 產品建置
適合任何從事前端、登陸頁面或產品視覺化的人。
1Build an interactive 3D [object] in the browser.2Single HTML file. Three.js.34The object: [describe it precisely — materials,5number of parts, what moves]67Must include:8- Correct material properties (glossiness, roughness,9 metalness where relevant)10- Three-point lighting with real shadows11- Orbit controls12- [Any interaction — assembly/disassembly, animation,13 hover states]1415Quality bar: this should look like a product render,16not a WebGL demo. If a detail would be visible in real17life, model it.1819Build the whole thing. Show me the file.
「品質標準」這一行比提示中其他任何東西都更重要。K3 會回應標準,而不僅僅是指令。
提示 4 — 具有動態部件的即時功能
全端 CRUD 是一種應用程式形態。即時功能則是另一種完全不同的形態——狀態必須在不同客戶端之間保持同步,而不僅僅是持久化到資料庫。很多模型在這方面會悄悄失效。
1Add a real-time feature to an existing app: a live collaborative2cursor + comment system, like Figma's.34REQUIREMENTS:5- WebSocket connection (use Socket.io or native ws)6- Show other connected users' cursor positions in real time7- Click anywhere to drop a comment pin8- Comments update live for all connected clients9- Handle disconnect/reconnect gracefully — no ghost cursors10- Debounce cursor updates so it doesn't flood the socket1112BUILD:131. Set up the WebSocket server142. Build the client-side connection with auto-reconnect153. Implement cursor broadcasting with debouncing164. Implement the comment pin system175. Add a simple presence indicator (who's online)186. Test with at least 2 simulated clients to confirm sync works1920Show me how you tested multi-client sync before calling this done.
預期結果: 15 到 30 分鐘內建立一個可運作的即時層,並有明確的證據證明它已經過多個客戶端的測試。

最後一行很重要。即時功能的錯誤不會在只有一個瀏覽器分頁時出現——它們會在兩個分頁同時開啟時出現。一個跳過多客戶端測試的模型,會交給你看起來完成但實際上未完成的程式碼。
當 K3 出錯時:故障排除指南
這是一個新模型,有明顯的粗糙邊緣。以下是會出問題的地方以及解決方法。
- 問題:在簡單任務上浪費 Token
這是最大的問題,而且是結構性的。
K3 目前只有一種推理努力等級:「最大」。沒有「快速回答」模式。獨立測試人員測得,生成一個簡單的 SVG 就需要 13,241 個推理 Token——大約 0.25 美元,而這項工作本來應該只需花費零點幾美分。
解決方法:
不要把簡單的工作交給 K3。它是一個只有一個檔位的前沿模型,而那個檔位就是「對所有事情進行深入思考」。對於樣板程式碼、格式化和任何機械性工作,請使用 K2.7 或更小的模型。把 K3 留給值得其推理能力的工作。
這將是人們在第一個月內犯下的最大錯誤:讓 K3 成為所有工作的預設模型,然後驚訝於帳單。
- 問題:上下文視窗還是會滿
100 萬 Token 聽起來無限,直到你把一個真實的儲存庫放進去,發現還是不夠。
解決方法:
不要傾倒所有東西。指向重要的目錄即可。K3 在長週期工作上的優勢來自於持續的專注,而不是將所有檔案都放在上下文中。精選 200K 的正確程式碼,遠勝過塞滿整個單一儲存庫的 900K。
- 問題:在非常長時間的自主運行中偏離主題
20 小時的自主實驗是真實的,但它能成功是因為目標是 可衡量的——「讓它在 H200 上更快,而不改變數值」。給它一個模糊的目標和太長的自由,它就會偏離方向。
解決方法:
每個長週期提示都需要一個可驗證的成功條件。不是「改進程式碼」。而是一個數字、一個通過的測試、一個有變化的基準。如果你無法說明如何檢查它是否成功,它就會偏離主題。
- 問題:你無法重現某人的基準測試結果
Moonshot 以外沒有人審核過這個模型。權重要到 7 月 27 日才會發布。目前流傳的每個數字——包括本文中的——都是廠商提供的。
解決方法:
等到 7 月 27 日,或者在自己的任務上測試,相信你自己的結果。你實際的五個任務,比任何人的基準表都更有價值。
- 問題:從 OpenAI 或 Anthropic 切換後的整合錯誤
K3 與 OpenAI SDK 相容,這解決了 90% 的遷移問題。剩下的 10% 通常是推理行為——K3 預設會思考,並返回你可能沒有預料到會在回應處理中出現的推理 Token。
解決方法:
在假設模型有問題之前,先檢查你的 Token 會計和回應解析。大多數「K3 很貴」的抱怨,實際上是「我忘了推理 Token 也是輸出 Token」。
不容忽視的背景
Moonshot 總部位於北京,由前 Google 研究員楊植麟創立,並獲得阿里巴巴支持。
https://x.com/kirillk_web3/status/2057528102368977328
他們在美國對先進晶片出口管制不斷升級的三年內,打造了一個 2.8 兆參數的前沿模型。
美國銀行分析師直言:「儘管中國在硬體/算力容量方面持續受限,但 K3 證明了預訓練擴展,加上架構創新,仍然可以為中國旗艦模型帶來階梯式進步。」
而這個時間點並非偶然:K3 在 2026 年上海世界人工智能大會 前幾天問世。
7 月 27 日的問題
權重將於 7 月 27 日發布。這個日期比發布日期更重要。
在此之前,K3 是一個你可以透過 API 使用的前沿模型——令人印象深刻。
到了 7 月 27 日,它就變成了另一種東西:一個任何人都可以下載、檢查、修改並在自己的硬體上運行的前沿級模型。沒有 API。沒有使用限制。沒有服務條款。沒有 30 天的提示保留。
這才是真正的故事。不是「中國追上來了。」
中國追上來了,而且還免費送給了大家。

值得注意的是:中國監管機構正在討論自己的人工智慧出口管制。K3 是中國最後一個前沿級開源權重發布,還是眾多發布中的第一個,目前還不清楚。
如何試用
聊天: kimi.com —— K3 現已上線
API: 與 OpenAI SDK 相容,所以如果你已經在 OpenAI 或 Anthropic 工具鏈上開發,整合只是一個配置變更,而不是重寫
權重: 7 月 27 日
SDK 相容性比聽起來更重要。更換模型通常意味著重寫你的整合層。在這裡,它意味著改變一個基礎 URL 和一個模型字串。
如何安裝 Kimi Code(終端代理)
如果你想讓 K3 在你的實際程式碼庫中運行,而不是只在聊天視窗中,以下是設定方法。

需求:
- 一台電腦(Mac、Windows 或 Linux)
- 終端機存取權限
- Kimi 帳號——kimi.com
步驟 1 — 安裝 Kimi Code
Mac/Linux:
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
Windows(PowerShell):
1irm https://code.kimi.com/kimi-code/install.ps1 | iex
在 Windows 上,請先安裝 Git for Windows——Kimi Code CLI 會使用其附帶的 Git Bash 作為 shell 環境。
驗證安裝:
1kimi --version
由於 macOS Gatekeeper 的關係,首次啟動可能需要明顯更長時間。請在「系統設定」→「隱私權與安全性」→「開發者工具」中加入你的終端機應用程式,以加快後續啟動速度。
如果你已經安裝了 uv,可以直接安裝:
1uv tool install --python 3.13 kimi-cli
Kimi Code CLI 支援 Python 3.12–3.14,建議使用 3.13 以獲得最佳相容性。
步驟 2 — 導航到你的專案並啟動
1cd your-project2kimi
首次啟動時,在會話中執行 /login 來設定你的 API 來源——它會開啟一個瀏覽器視窗進行 OAuth 認證。
步驟 3 — 給它一個任務
Kimi Code 現在在你的專案中運行,並有直接讀寫所有檔案的權限。用日常語言描述一個任務——它會規劃步驟、編輯程式碼、執行測試,並報告它做了什麼。
這實際上意味著什麼
如果你正在運行生產工作負載:
在切換前先測試。 廠商基準測試和真實世界效能經常會有落差。選擇五個真實任務,並排運行 K3 和你目前的模型,衡量每完成一個工作的成本——而不是每個 Token 的成本。

每項任務的數學計算才是關鍵論點。 以 3/15 美元的價格來看,K3 在紙面上並不便宜。但考慮到少用 21% 的 Token 和 Fable 等級的輸出,它在關鍵的地方很便宜。
7 月 27 日將改變遊戲規則。 開放權重意味著可以自架、微調,並且完全不依賴任何人的 API 持續可用或任何人的條款持續有利。對於任何敏感事物來說,這都不是小事。
結論
過去,前沿是由美國實驗室打造的,其他人則在六個月後才能一窺究竟。
2.8 兆個參數。100 萬上下文。Fable 5 等級的程式碼能力,Sonnet 的定價。在出口管制下由全場估值最低的實驗室打造,並於 7 月 27 日免費贈送。
有趣的問題不是 K3 是否在某個基準測試上擊敗了 Fable 5。而是一個開放權重模型與封閉前沿模型平起平坐時,封閉模型的經濟學將會發生什麼變化。
連結
- Kimi K3: https://www.kimi.com
- 我的 Telegram: https://t.me/kirillk_web3
- 我的 Twitter/X: https://x.com/kirillk_web3
- 合作託管: https://ishosting.com/affiliate/NzE0MiM2
追蹤以獲取更多「氛圍程式設計」資訊。感謝閱讀!





