7 個讓其他模型相形見絀的 Kimi K3 特色

@0xRicker
英語1 天前 · 2026年7月22日
327K
91
9
23
141

TL;DR

Kimi K3 是 Moonshot AI 推出的超大型 2.8 兆參數開放權重模型,在擁有 100 萬 token 上下文視窗的同時,能以五分之一的成本達到頂尖的程式編寫效能。

全球最大的開源模型正式出貨了。它在程式碼能力上達到 Fable 5 等級,成本卻低 5 倍,且只需消耗極少的 token。以下是七個最突出的亮點。

7 月 16 日,一個開源的中國模型悄然成為你能在不支付頂級價格下運行的最強程式碼模型。

Moonshot AI 推出了 Kimi K3,擁有 2.8 兆參數,是全球最大的開源權重模型。Bloomberg、Forbes 和 Fortune 在 48 小時內紛紛報導,原因很簡單:在程式碼基準測試中,它與 Claude Fable 5 和 GPT-5.5 不相上下,而成本大約只有它們的五分之一。

Ricker - inline image

要理解為什麼這很重要,回想一下過去兩年大家被灌輸的觀念:頂尖能力意味著頂尖價格。如果你想要最好的程式碼,你就得支付頂級費率,按 token 計費,而且使用的是你無法控制的端點。這就是遊戲規則。每個認真組建的團隊都要據此規劃預算。

K3 在一次發布中打破了這個假設。它所帶來的組合——頂尖水準的輸出、平民化的價格,而且權重開放供任何人下載——正是商業媒體爭相報導的原因。以下是七個讓其他模型感覺落後一代的功能。第一個就是你 API 帳單即將下降的原因。

Ricker - inline image

以下是七個讓其他模型感覺落後一代的功能。第一個就是你 API 帳單即將下降的原因。

1. 重點

Fable 等級的後端程式碼,成本低 5 倍

這是重新定義一切的功能。在獨立測試中,Kimi K3 在真實後端程式碼任務上與 Claude Fable 5 並駕齊驅:API 設計、資料庫 schema、服務邏輯、大型程式碼庫的重構。不是玩具範例,而是過去需要頂級訂閱才能完成的那種工作。

後端是差異最明顯的地方,因為後端程式碼不容許捷徑。一個看起來對的前端元件通常就是對的。但一個看起來對的支付處理器,在高負載下仍可能破壞狀態、洩漏競爭條件、或默默遺漏邊界情況。在後端工作上評分模型,意味著在高壓下評分正確性,而這正是較弱模型脫離頂尖水準的地方。K3 穩穩待在這個水準。

差異在於帳單。K3 以大約 五分之一 的價格產出同等級的程式碼,而且因為它 token 效率更高,在完整專案上的實際差距往往比標價本身更大。

Ricker - inline image

看看這些柱狀圖的位置。K3 在頂尖水準帶內,而不是在追趕。現在保持這個品質不變,看看達到這個水準需要多少成本:

Ricker - inline image

你並不是在品質和價格之間做取捨。你是在保留 Fable 等級的後端輸出,同時省掉 80% 的帳單。

把這個數字乘以一個真實的工程月份,就不再是抽象的數字了。一個每週執行數千次 agentic 程式碼任務的團隊,不是只在 $1.00 和 $0.20 之間選擇一次,而是數萬次,這個差距會累積成管理層真正會注意的項目。

Ricker - inline image

2. 倍增效應

用更少的 token 說更多話

每 token 的價格只是經濟學的一半。另一半是模型為了得到相同答案需要花費多少 token。K3 在這裡異常節省。它用更少的來回溝通、更少的重複假設、以及更少的填充內容就能推理出可行的解決方案。

有一個微妙的原因讓這對 Agent 比對聊天更重要。在單一對話中,一個話多的模型只會讓人覺得慢。但在 agentic 循環中,每個浪費的 token 都會在下一個步驟中再次被花費,然後再下一個,因為上下文會往前傳遞。一個每一步都節省 60% 的模型,在整個運行中不僅僅是便宜 60%。它是複合式地節省,因為它留下的痕跡更少,後續每個步驟需要重新讀取的內容也更少。

在單一提示中,這看起來像是四捨五入的誤差。但在一個真實的數千步驟 agentic 運行中,它會累積成一個專案花費美元與花費美分之間的差異。這就是為什麼在完整建置中,與 Fable 5 的實際成本差距往往比 5 倍這個標題更大。

Ricker - inline image

3. 規模

2.8 兆參數,而且你可以下載它們

K3 是有史以來發布的最大開源權重模型。Moonshot 稱其為第一個開源的 3T 等級模型,從 DeepSeek 手中奪下這個頭銜。作為對比,OpenAI 和 Anthropic 根本沒有公開它們的參數數量。而這裡有一個實驗室發布了 2.8T 的模型,並把權重交到你手上。

規模本身不是重點。重要的是,如此巨大的容量現在是你可以運行、檢查、微調和自行託管的東西,而不是通過你無法控制的計量端點來租用。對於後端團隊來說,這個區別不是理論上的。這意味著你可以把模型放在自己的防火牆後面,根據自己的程式碼庫和慣例進行微調,而且永遠不需要將一行專有程式碼發送到第三方 API。開源權重將在 7 月 27 日發布。

Ricker - inline image

4. 記憶力

一次處理 100 萬 token 的上下文

K3 在單一視窗中容納 100 萬 token 的上下文。實際來說,這相當於整個後端程式碼庫、它的測試、文件、以及遷移歷史,全部一次載入,還有剩餘空間。

這使得程式碼能力的故事變得真實,而不只是基準測試的產物。一個像 Fable 一樣寫程式碼的模型很有用。但一個像 Fable 一樣寫程式碼,而且 能同時看到整個倉庫的模型,是另一種不同層次的工具。它重構時能完全了解每個呼叫者、每個型別、每個下游依賴,而不是根據你勉強貼上的三個檔案來猜測。

任何看過一個能力強大的模型自信地破壞程式碼庫的人都知道這種失敗模式:它為它能看到的那個檔案寫了正確的程式碼,卻為它看不到的十二個檔案寫了錯誤的程式碼。100 萬 token 的視窗並不會讓模型變得更聰明。它只是拿掉了眼罩。同樣是 Fable 等級的推理能力,現在可以在完整的圖景上運作,而這正是大多數真實後端錯誤藏身的地方。

Ricker - inline image

5. 平行處理

K3 Swarm Max 平行執行工作

K3 推出了兩個版本。K3 Max 處理聊天和 Agent 任務。K3 Swarm Max 則是為大規模平行處理而設計:許多 Agent 同時工作,而不是一個模型在佇列中逐一處理。

對於後端工作來說,這是關鍵的突破。與其讓一個 Agent 依序實作四十個端點,Swarm 將它們分配給多個平行工作者,每個工作者負責程式碼庫的一部分,然後一起完成。Fable 等級的品質現在也變快了,因為吞吐量隨著 Agent 的數量擴展,而不是單一對話的長度。

經濟效益疊加在速度之上。由於 swarm 中的每個 Agent 都是 K3 Agent,整個平行運行繼承了相同的 5 倍成本優勢。你不需要像同時派出四十個 Fable Agent 那樣,為平行處理的特權支付頂級費率。你同時獲得 swarm 的吞吐量和一般模型的帳單。

Ricker - inline image

6. 觸及範圍

為長期 Agent 任務而建

K3 是專門為長期程式碼和 Agent 工作負載訓練的,而不是事後改造的。它能在數千個步驟中保持計畫,使用工具而不偏離主題,並且在步驟失敗時恢復,而不是讓整個運行脫軌。

將它與 100 萬 token 的視窗結合,你就得到一個能端到端擁有整個後端功能的 Agent:讀取程式碼庫、規劃變更、跨服務實作、執行測試、讀取失敗訊息、並修正它們。那種過去只能在頂尖模型上運行的循環,現在可以在成本只有五分之一的模型上運行。

失敗恢復的部分是區分展示品和真正工具的分水嶺。大多數 Agent 看起來令人印象深刻,直到某個測試在第 900 步失敗,此時脆弱的 Agent 會拋棄計畫並開始即興發揮。K3 被調整為將失敗的步驟視為資訊,而不是死胡同。它讀取錯誤、調整、然後繼續,這是長期運行能夠真正完成的唯一方式。

Ricker - inline image

7. 轉變

開源權重,重新定義頂尖價格

第七個功能不是規格。它是前六個功能的總和。當一個能力如此強大的模型是開源權重時,每個封閉模型的定價都變成了一個問題,而不是理所當然。

如果 K3 以五分之一的成本提供 Fable 等級 的後端程式碼,加上 100 萬 token 的視窗和平行 swarm,那麼責任就轉移到封閉實驗室身上,要求它們證明自己的溢價是合理的。這正是我們在 DeepSeek 身上看到的模式,也是為什麼這次發布能在兩天內登上三家商業媒體的頭版。

Moonshot 並非偶然達成這個成就。該公司在 1 月完成了 5 億美元的融資,估值 43 億美元,明確指定用於 K3 及其訓練所需的運算資源。這是一次有資金、有計劃的推動,要將頂尖級別的模型開放出來,而定價也絕非偶然。這是策略:在成本上壓低封閉實驗室,同時在開發者最關心的關鍵指標——能用的程式碼——上與它們匹敵。

Ricker - inline image

七點一覽:

  • Fable 等級的後端程式碼,成本約低 5 倍。
  • token 效率高,實際差距更大。
  • 2.8T 參數,全球最大的開源權重模型。
  • 100 萬 token 上下文,一次載入整個後端倉庫。
  • K3 Swarm Max,支援平行、高吞吐量的建置。
  • 長期 Agent 工作負載,端到端擁有。
  • 開源權重,重新定義頂尖模型的合理價格。

Fable 等級的程式碼。五分之一的價格。開源權重。

過去,頂尖水準是你需要付費才能進入的地方。Kimi K3 讓最好的程式碼等級變成了你可以運行、擁有、並且負擔得起的東西。現在,每個其他模型都得解釋為什麼它要為同樣的結果收費五倍。

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章