Kimi K3 的 7 大功能,让其他模型瞬间过时

@0xRicker
英语1天前 · 2026年7月22日
327K
91
9
23
141

TL;DR

Kimi K3 是 Moonshot AI 推出的超大规模 2.8T 参数开放权重模型,它以 1/5 的成本达到了前沿级的编程表现,并支持 1M token 的上下文窗口。

全球最大的开源模型刚刚发布。它在编程能力上达到 Fable 5 级别,成本却低 5 倍,且消耗的 Token 量也少得多。以下七个亮点值得关注。

7 月 16 日,一款中国开源模型悄然成为你能在不支付前沿价格的情况下运行的最强编程模型。

Moonshot AI 发布了 Kimi K3,拥有 2.8 万亿参数,是全球最大的开源权重模型。Bloomberg、Forbes 和 Fortune 均在 48 小时内报道了此事,原因很简单:在编程基准测试中,它能够与 Claude Fable 5 和 GPT-5.5 一较高下,而成本仅为它们的五分之一左右。

Ricker - inline image

要理解这意味着什么,请回想过去两年灌输给所有人的认知:前沿能力等于前沿价格。如果你想要最好的代码,你就得按最优费率支付,按 Token 计费,且使用你无法控制的端点。这曾是既定规则。每个严肃的团队都在预算中为此留出空间。

K3 用一个版本打破了这一假设。它带来的组合——前沿级别的输出,商品化的价格,且权重公开供任何人下载——正是商业媒体争相报道的原因。以下七个特性让其他模型感觉落后了一代。第一个特性就是你 API 账单即将下降的原因。

Ricker - inline image

以下七个特性让其他模型感觉落后了一代。第一个特性就是你 API 账单即将下降的原因。

1. 核心亮点

Fable 级别的后端编程,成本降低 5 倍

这是重新定义一切的特性。在独立测试中,Kimi K3 在真实后端编程任务上表现与 Claude Fable 5 相当:API 设计、数据库架构、服务逻辑、跨大型代码库的重构。不是玩具代码片段,而是过去需要前沿订阅才能完成的工作。

后端是差异最明显的领域,因为后端代码容不得取巧。一个看起来正确的前端组件通常就是正确的。但一个看起来正确的支付处理器,在负载下仍可能破坏状态、泄露竞争条件或静默丢弃边缘情况。用后端工作来评估模型,意味着在压力下评估正确性,而这正是较弱模型被排除在前沿范围之外的地方。K3 则始终处于前沿。

差异在于账单。K3 以大约 五分之一的价格 生成同样级别的代码,而且由于它的 Token 效率更高,在完整项目上,实际差距往往比标价所显示的更大。

Ricker - inline image

看看这些柱状图的位置。K3 处于前沿范围内,而不是在追赶。现在,保持质量不变,看看达到这一水平需要多少成本:

Ricker - inline image

你并非在质量和价格之间做取舍。你是在保持 Fable 级别的后端输出,同时砍掉 80% 的账单。

将这一点乘以一个真实的工程月,数字就不再抽象。一个每周运行数千次 Agent 编程任务的团队,不是在 1.00 美元和 0.20 美元之间选择一次。他们要选择数万次,这个差距累积成领导层真正会关注的成本项。

Ricker - inline image

2. 乘数效应

用更少的 Token 表达更多内容

每个 Token 的价格只是经济学的一半。另一半在于模型需要多少 Token 才能得出相同答案。K3 在这方面异常紧凑。它用更少的来回沟通、更少的重复假设以及更少的代码填充来推理出可行的解决方案。

这对 Agent 的重要性比对聊天更大,原因微妙。在单次对话中,一个啰嗦的模型只是感觉慢。但在 Agent 循环中,每个浪费的 Token 都会在下一步被再次消耗,再下一步,因为上下文会延续。一个每一步效率高 60% 的模型,在整个运行中并非只便宜 60%。它是复合效率更高,因为留给后续每一步重新读取的痕迹也更少。

在单个提示上,这看起来像是一个舍入误差。但在一个包含数千步的真实 Agent 运行中,它会累积成一个项目成本从美元变为美分的差别。这就是为什么在完整构建中,与 Fable 5 的实际成本差距往往大于 5 倍这一标题的原因。

Ricker - inline image

3. 规模

2.8 万亿参数,且你可以下载

K3 是有史以来发布的最大开源权重模型。Moonshot 称之为首个开源 3T 级模型,从 DeepSeek 手中夺走了这一桂冠。作为对比,OpenAI 和 Anthropic 均未公开其参数数量。而现在,一个实验室发布了一个 2.8T 的模型,并将权重交到你手中。

规模本身并非重点。真正重要的是,这种级别的容量现在可以让你运行、检查、微调并自行托管,而不是通过你无法控制的计量端点来租用。对于后端团队来说,这种区别并非学术性。它意味着你可以将模型置于自己的防火墙之后,根据你自己的代码库和规范进行微调,并且永远不需要将一行专有代码发送到第三方 API。开源权重版本将于 7 月 27 日发布。

Ricker - inline image

4. 记忆

一次性处理 100 万 Token 的上下文

K3 在单个窗口中可容纳 100 万 Token 的上下文。实际上,这意味着整个后端代码库、其测试、文档和迁移历史,一次性全部加载,还有余量。

这正是让编程故事变得真实而非基准测试产物之处。一个像 Fable 一样编程的模型很有用。而一个像 Fable 一样编程,并且能同时看到你整个仓库的模型,则是一种不同的工具。它在重构时能完全了解每个调用者、每个类型、每个下游依赖,而不是根据你费力粘贴的三个文件来猜测。

任何见过强大模型自信地破坏代码库的人都知道这种失败模式:它写出了对于它能看到的那一个文件是正确的代码,但对于它看不到的另外十二个文件却是错误的代码。100 万 Token 的窗口并不能让模型更聪明。它只是摘掉了眼罩。同样的 Fable 级推理现在作用于全局,而大多数真实后端 bug 恰恰隐藏在那里。

Ricker - inline image

5. 并行能力

K3 Swarm Max 并行运行工作

K3 发布了两个版本。K3 Max 处理聊天和 Agent 任务。K3 Swarm Max 专为大规模并行处理而构建:多个 Agent 同时工作,而不是单个模型逐个处理队列。

对于后端工作来说,这是真正的解锁。不再是一个 Agent 按顺序实现四十个端点,而是 swarm 将它们分配给并行工作线程,每个线程拥有自己的代码库切片,然后它们同时完成。Fable 级别的质量现在也很快,因为吞吐量随 Agent 数量扩展,而非单个对话的长度。

经济性叠加在速度之上。由于 swarm 中的每个 Agent 都是 K3 Agent,整个并行运行继承了相同的 5 倍成本优势。你无需为并行的特权支付前沿价格——如果你同时启动四十个 Fable Agent,就需要那样做。你同时获得 swarm 的吞吐量和商品模型的价格。

Ricker - inline image

6. 覆盖范围

专为长期 Agent 任务而设计

K3 是专门为长期编程和 Agent 工作负载训练的,而非事后改造。它能在数千步中保持计划,使用工具而不丢失主线,并在某一步失败时恢复,而不是让整个运行脱轨。

将其与 100 万 Token 的窗口结合,你得到一个能够端到端掌控整个后端功能的 Agent:读取代码库、规划更改、跨服务实现、运行测试、读取失败信息并修复。那种过去只在前沿模型上有效的工作循环,现在可以在成本仅为五分之一的新模型上运行。

失败恢复部分是将演示与真正工具区分开来的关键。大多数 Agent 看起来令人印象深刻,直到第 900 步测试失败,此时脆弱的 Agent 会丢弃计划并开始即兴发挥。K3 被训练为将失败步骤视为信息而非死胡同。它读取错误,调整,然后继续,这是长期运行最终能够完成的唯一方式。

Ricker - inline image

7. 变革

开源权重,重置前沿价格

第七个特性并非一个规格参数。它是前六个特性的总和。当一个如此强大的模型以开源权重发布时,每个闭源模型的价格都变成了一个需要解释的问题,而非理所当然的事实。

如果 K3 以五分之一的价格提供 Fable 级别 的后端代码,并拥有 100 万 Token 窗口和并行 swarm,那么压力就转移到了闭源实验室身上,他们需要证明其溢价的合理性。这与行业在 DeepSeek 身上看到的模式相同,也是为什么这次发布在两天内登上了三家商业媒体的头版。

Moonshot 并非偶然做到这一点。该公司在 1 月份以 43 亿美元估值完成了 5 亿美元融资,明确指定用于 K3 及其训练所需的算力。这是一次有资金支持的、蓄意的推动,旨在将前沿级模型开源,而定价也绝非偶然。这是策略:在成本上低于闭源实验室,同时在开发者最关心的那个维度——可以正常运行的代码——上与之匹敌。

Ricker - inline image

七个特性一目了然:

  • Fable 级别的后端编程,成本降低约 5 倍。
  • Token 效率高,实际差距更大。
  • 2.8T 参数,全球最大的开源权重模型。
  • 100 万 Token 上下文,一次性容纳整个后端仓库。
  • K3 Swarm Max,用于并行、高吞吐量的构建。
  • 长期 Agent 任务,端到端掌控。
  • 开源权重,重新定义前沿模型的定价合理性。

Fable 级别的代码。五分之一的价格。开源权重。

过去,前沿是一个需要付费才能访问的地方。Kimi K3 刚刚让最好的编程级别变得可以运行、拥有和负担得起。现在,其他每个模型都必须解释为什么它们要为实现相同结果收费五倍以上。

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章