这是对 Kimi K3 是什么、它能做什么,以及为什么它正在悄然成为最重要的编程模型(但还没有人在谈论它)的一个完整 A–Z 解析。
收藏此页面,以免丢失这篇文章。
2.8 万亿参数。100 万 token 上下文。
以下是它的全部内容。
在谈基准测试之前,先来看看刚刚发生了什么
过去三年,故事一直是这样:美国实验室打造前沿模型,中国实验室六个月后推出廉价复制品。
7 月 16 日,Moonshot AI 发布了 Kimi K3。
https://x.com/Kimi_Moonshot/status/2077830229968683203
总参数达到 2.8 万亿——比 DeepSeek 的 V4 Pro 大约大 75%,几乎是智谱 GLM 5 系列的 4 倍。这是有史以来发布的最大型开源模型。
它超越了 Claude Opus 4.8。超越了 GPT-5.6 Sol。根据 Moonshot 的基准测试,它与 Fable 5 水平相当——后者是目前公众可用的最强模型。
复制品的故事结束了。
数据

最后一行是人们误读的地方。我们来正确理解它。
定价真相——请仔细阅读
Kimi K3 不是一个廉价模型。每百万 token 收费 $3/$15,定价大约与 Claude Sonnet 相当——并非 Moonshot 早期版本提供的深度折扣。
那么,“比 Fable 5 便宜 5 倍”从何而来?
按任务成本,而非按 token 价格。
完成相同工作,K3 使用的输出 token 数量大幅减少。以一个代表性编程任务为例:Fable 5 成本约 $1.30。K3 成本约 $0.25。
相同的输出水平。更少的 token。更低的总账单。
诚实的表述是:Sonnet 的价格,Fable 级别的体验。 你买的不是市场上最便宜的 token。你买到的是中端价格的前沿能力,而且能用更少的步骤达到目标。
如果比较原始 token 价格,K3 看起来平平无奇。如果比较完成一个工作的成本,那就完全是另一回事了。
Kimi K3 在哪些方面达到顶尖水平
根据 Moonshot 公布的基准测试,K3 在以下方面达到顶尖水平(SOTA):
- 带工具的 HLE —— 人类最后的考试(工具增强版)
- SWE-Bench Pro —— 真实世界软件工程
- SWE-Bench Multilingual —— 跨语言工程
- BrowseComp —— 网页浏览与研究
- Toolathlon —— 大规模工具使用
- 带 Python 的 CharXiv —— 图表与图形推理
- 带 Python 的 MathVision —— 视觉数学

与竞争对手相比:超越 Opus 4.8 和 GPT-5.6 Sol,与 Fable 5 持平。
在 AI 评估平台 Arena 的盲测中,开发者更偏爱 Kimi,胜过所有领先的美国模型。
两个真正重要的架构创新
这是大多数报道忽略的部分,也是这次发布中最有趣的内容。

- Kimi Delta Attention(KDA)
一种混合线性注意力机制。结果:在百万 token 上下文中,解码速度最高提升 6.3 倍。
100 万上下文窗口只有在你实际上能快速使用它时才是有用的。KDA 让上下文窗口从理论变为实用。
- Attention Residuals(AttnRes)
残差连接的即插即用替代方案。训练效率提升约 25%,额外成本低于 2%。
两种技术都在模型发布前由 Moonshot 团队在 GitHub 上作为开放研究公开。这不是营销——这是可同行审查的工作。
两者结合,解释了 token 效率:K3 在同等任务上比 K2.6 使用少 21% 的输出 token。
让你坐直的部分:K3 自己优化了自己的架构
Moonshot 给了 K3 Attention Residuals(其自身架构组件)的实现,以及一个目标:在不改变数值行为的前提下,让它在 H200 硬件上运行更快。
然后他们就不再干预了。
20 小时的实验。零人工干预。1.6 倍加速。
在另一次运行中,K3 将 FLA Triton AttnRes 的前向/反向传播时间从 283.6ms 减少到 114.4ms——2.48 倍加速——同样没有改变数值。

而且它的迭代速度比做同样任务的 Fable 5 更快。
再读一遍。模型改进了使模型工作的机制。自主地。在一夜之间。
这就是“递归自我改进”在实践中的样子——不是一个科幻场景,而是一个 20 小时的工作,有可测量的结果。这正是几周前 Anthropic 警告需要谨慎的那种能力,而今运行在一个开放权重的模型中,任何人都可以在 7 月 27 日下载。
长周期编程是全部关键
Moonshot 自己的表述:“K3 是 Moonshot AI 迄今为止最强大的开源编程模型。在最小人工监督下运行,它可以维持长时间的工程会话,导航大型代码仓库,并协调终端工具。”
对于真正的工程工作,三个关键点:
- 持续会话 —— 20 小时的自主实验不是演示。那是设计目标。
- 大型代码仓库 —— 带 6.3 倍更快解码的 100 万上下文窗口,意味着你可以将真实代码库放入上下文中,并在其中实际工作。
- 工具协调 —— 在 Toolathlon 和 BrowseComp 上达到 SOTA,意味着它能处理终端、浏览器和 API 调用,而不会崩溃。
前端编程达到 Fable 5 水平。单个提示就能生成 AAA 品质的游戏场景。WebGPU、Three.js、着色器、物理——这些过去需要一个工作室才能完成的工作。
用 Kimi K3 进行氛围编程
这是模型不再只是基准数字,而是开始变得明显有用的地方。
K3 的前端编程达到 Fable 5 水平。实际上,这意味着一个描述和一个可工作的 3D 产品之间的墙现在只需一个提示。
人们实际上已经用单个提示交付了哪些内容:
游戏 —— 带 VFX 的 WebGPU 战斗竞技场。带钩爪机制的浏览器 3D 城市穿越。
- 僵尸 FPS。
- 多人赛车。
- 一个可工作的 3D GBA 模拟器。
- 完整的 MMORPG 框架。
不是“类游戏演示”——而是可玩的场景,带有命中反应、冲击反馈和符合物理规律的表现。

带真实材质处理的 3D 物体 —— 一个具有正确光泽度和光线行为的劳力士手表。一把 CSGO 武器,在 33 个独立建模的部件上组装和拆卸。索尼相机拆解。带引力透镜的黑洞。具有真实波浪动力学的海洋模拟。

物理场景 —— 布料模拟。结构倒塌。带有看起来正确而非脚本化的动量传递的车辆碰撞。
这些与之前“AI 构建网站”演示的不同之处在于:K3 处理了通常会被搞砸的细节。光照。阴影。材质光泽度。那些将“明显是 AI 生成的”与“这是有人做出来的”区分开的 20 个小细节。
一个提示。400 万 token。一个曾经需要一个团队才能完成的场景。
4 个经过实战检验的提示(可直接复制粘贴)
这些提示的结构旨在利用 K3 的擅长之处:长周期工作、工具使用,以及在不偏离主题的情况下维持大上下文。
提示 1 —— 物理压力测试
这个提示能够区分真实能力和演示抛光。如果模型能高质量完成所有三个场景,那就是真家伙。
1构建三个带有真实物理的自包含 HTML5 画布场景。2不使用外部库。每个场景一个文件。34场景 1:火车从断裂的桥上脱轨坠入水中。5包括:车厢动量、桥梁结构失效、6撞击时的水位移。78场景 2:两辆车从斜坡上跳起并在峡谷上空9空中相撞。包括:正确的弹道弧线、10碰撞动量传递、碎片。1112场景 3:一辆怪物卡车碾压一排停放的汽车。13包括:悬挂压缩、金属板变形、14重量分布。1516所有三个场景的要求:17- 物理必须是计算出来的,而非动画化的18- 目标 60fps19- 包含一个重置按钮20- 注释物理数学,以便我能验证2122构建所有三个。不要问澄清性问题。
提示 2 —— 长周期仓库任务
这是 K3 真正为做的工作。指向一个真实代码库,给出一个结果,而不是一个任务。
1在写任何代码之前,先阅读整个代码库。23[粘贴你的仓库,或者指向目录]45目标:[陈述一个可测量的结果——例如“将6p95 API 响应时间降低 30%”或“消除数据层中所有7N+1 查询”]89规则:10- 先做性能分析。在你做任何更改之前,告诉我时间11 实际花在哪里。12- 不要更改公共接口或数值行为。13- 每次更改后运行现有的测试套件。14- 如果某个更改让事情变得更糟,撤销它并告诉我原因。15- 持续工作直到达到目标,或者你能证明在不违反规则16 的情况下无法实现。1718最后报告:你更改了什么,带来了什么收益,19你尝试了什么但没用的。
“你尝试了什么但没用的”这一行很重要。它将输出从一个 diff 变成了一份工程日志。
提示 3 —— 3D 产品构建
适用于任何做前端、登陆页或产品可视化的人。
1在浏览器中构建一个交互式 3D [物体]。2单个 HTML 文件。Three.js。34物体:[精确描述它——材质、5部件数量、哪些部分可动]67必须包含:8- 正确的材质属性(光泽度、粗糙度、9 金属感,如有相关)10- 带真实阴影的三点光照11- 轨道控制12- [任何交互——组装/拆卸、动画、13 悬停状态]1415质量要求:这应该看起来像产品渲染,16而不是 WebGL 演示。如果某个细节在真实生活中17可见,就要建模。1819构建整个东西。给我看文件。
“质量要求”这一行比提示中任何其他内容都更有效。K3 对标准做出响应,而不仅仅是指令。
提示 4 —— 带动态部件的实时功能
全栈 CRUD 是应用的一种形态。实时则是完全不同的形态——状态必须在客户端之间保持同步,而不仅仅是持久化到数据库。这是很多模型悄悄崩溃的地方。
1为现有应用添加一个实时功能:一个实时协作2光标 + 评论系统,类似 Figma 的那种。34要求:5- WebSocket 连接(使用 Socket.io 或原生 ws)6- 实时显示其他已连接用户的鼠标位置7- 点击任意位置放置评论针8- 评论对所有连接的客户端实时更新9- 优雅处理断开/重连——没有幽灵光标10- 对光标更新进行防抖,以免淹没 socket1112构建:131. 设置 WebSocket 服务器142. 构建带自动重连的客户端连接153. 实现带防抖的光标广播164. 实现评论针系统175. 添加简单的在线状态指示器(谁在线)186. 用至少 2 个模拟客户端测试,确认同步有效1920在说完成之前,展示你是如何测试多客户端同步的。
预期结果: 一个可工作的实时层,15–30 分钟内完成,并有可见的证据表明它已经过不止一个客户端的测试。

最后一行是关键。实时 bug 不会在一个浏览器标签页打开时出现——它们会在两个标签页打开时出现。跳过多客户端测试的模型会交给你看起来完成但实际上并非如此的代码。
K3 出问题时:故障排除指南
这是一个有真实粗糙边缘的新模型。以下是什么会出问题以及如何处理。
- 问题:它在琐碎任务上消耗大量 token
这是个大问题,而且是结构性的。
K3 目前只有一种推理努力级别——‘max’。没有“直接快速回答”模式。独立测试人员发现,生成一个简单的 SVG 用了 13,241 个推理 token——大约 $0.25,而这本来应该只花几分之一美分。
修复方法:
不要把简单工作路由给 K3。它是一个前沿模型,只有一个档位,那就是“凡事都要深入思考”。对于样板代码、格式化和任何机械性工作,使用 K2.7 或更小的模型。把 K3 留给你那些值得推理的工作。
这是人们在第一个月会犯的最大错误:让 K3 成为所有任务的默认模型,然后对账单感到惊讶。
- 问题:上下文窗口还是会填满
100 万 token 听起来无限大,直到你把你真实的仓库放进去,发现它不够用。
修复方法:
不要倾泻所有内容。指向那些重要的目录。K3 在长周期工作上的优势来自持续的关注,而不是上下文中拥有每一个文件。紧凑的 200K 正确代码胜过臃肿的 900K 整个单体仓库。
- 问题:在非常长的自主运行中它会偏离方向
20 小时的自主实验是真实的,但它之所以有效是因为目标是可测量的——“在不改变数值的情况下让它在 H200 上更快。”给它一个模糊的目标和一条长绳子,它就会 wander。
修复方法:
每个长周期提示都需要一个可验证的成功条件。不是“改进代码”。一个数字,一个通过的测试,一个移动的基准。如果你不能陈述如何检查它是否成功,它就会偏离。
- 问题:你无法复现别人的基准结果
Moonshot 之外没有人审计过这个模型。权重要到 7 月 27 日才公布。目前每个流传的数字——包括本文中的——都是供应商报告的。
修复方法:
等到 7 月 27 日,或者在自己的任务上测试并相信那个结果。你的五个真实任务比任何人的基准表都更有价值。
- 问题:从 OpenAI 或 Anthropic 切换后的集成错误
K3 兼容 OpenAI SDK,这解决了 90% 的迁移问题。剩下的 10% 通常是推理行为——K3 默认会思考,并返回你可能没预料到的推理 token,在你的响应处理中。
修复方法:
在看到模型有问题之前,先检查你的 token 计数和响应解析。大多数“K3 很贵”的抱怨实际上是“我忘了推理 token 也计入输出 token”。
不容忽视的背景
Moonshot 总部位于北京,由前 Google 研究员杨植麟创立,并获得阿里巴巴支持。
https://x.com/kirillk_web3/status/2057528102368977328
他们在美国对先进芯片出口管制不断升级的三年间,构建了一个 2.8 万亿参数的前沿模型。
美国银行的分析师直言:“尽管中国持续存在硬件/算力容量限制,但 K3 表明,预训练扩展结合架构创新,仍然能够为中国旗舰模型带来阶跃式进步。”
而且时机并非偶然:K3 在 2026 年上海世界人工智能大会 前几天发布。
7 月 27 日的问题
权重于 7 月 27 日公布。这个日期比发布日更重要。
在此之前,K3 是一个可以通过 API 使用的前沿模型——令人印象深刻。
在 7 月 27 日,它将变成另一种东西:一个任何人都可以下载、检查、修改并在自己硬件上运行的前沿级模型。没有 API。没有使用限制。没有服务条款。没有 30 天 prompt 留存。
这才是真正的故事。不是“中国赶上了”。
中国赶上了,然后免费赠送了它。

值得注意的是:中国监管机构一直在讨论他们自己的 AI 出口管制。K3 究竟是中国最后的前沿开放权重发布,还是许多发布中的第一个,目前真的还不清楚。
如何尝试
聊天: kimi.com —— K3 现已上线
API: 兼容 OpenAI SDK,所以如果你已经在使用 OpenAI 或 Anthropic 工具链进行开发,集成只需更改配置,无需重写代码
权重: 7 月 27 日
SDK 兼容性比听起来更重要。更换模型通常意味着重写集成层。在这里,只需更改一个基础 URL 和一个模型字符串。
如何安装 Kimi Code(终端 Agent)
如果你想让 K3 在真实的代码库中运行,而不是在聊天窗口中,这是设置步骤。

要求:
- 一台电脑(Mac、Windows 或 Linux)
- 终端访问权限
- Kimi 账户 —— kimi.com
步骤 1 —— 安装 Kimi Code
Mac/Linux:
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
Windows(PowerShell):
1irm https://code.kimi.com/kimi-code/install.ps1 | iex
在 Windows 上,先安装 Git for Windows —— Kimi Code CLI 使用其捆绑的 Git Bash 作为 shell 环境。
验证安装:
1kimi --version
由于 macOS Gatekeeper,首次运行可能明显更慢。在“系统设置”→“隐私与安全性”→“开发者工具”中添加你的终端应用,以加快后续启动速度。
如果你已经安装了 uv,可以直接安装:
1uv tool install --python 3.13 kimi-cli
Kimi Code CLI 支持 Python 3.12–3.14,推荐使用 3.13 以获得最佳兼容性。
步骤 2 —— 进入你的项目并启动
1cd your-project2kimi
首次启动时,在会话中运行 /login 来配置你的 API 源 —— 它会打开一个浏览器窗口进行 OAuth 认证。
步骤 3 —— 交给它一个任务
现在 Kimi Code 正在你的项目中运行,对所有文件具有直接的读写访问权限。用自然语言描述一个任务——它会规划步骤、编辑代码、运行测试,并报告它做了什么。
这实际上意味着什么
如果你正在运行生产工作负载:
在切换之前先测试它。 供应商基准测试和真实世界性能之间经常存在差异。选择五个真实任务,并排运行 K3 和你当前的模型,衡量每个完成工作的成本——而不是每个 token 的成本。

按任务计算的数学是全部论据。 以 $3/$15 的价格,K3 在纸面上并不便宜。但用 21% 更少的 token 和 Fable 级别的输出,它在关键地方是便宜的。
7 月 27 日改变了游戏规则。 开放权重意味着自托管、微调,以及对任何人的 API 保持在线或任何人的条款保持有利的零依赖。对于任何敏感内容,这可不是小事。
结论
前沿曾经是美国实验室建造、其他人六个月后参观的地方。
2.8 万亿参数。100 万上下文。Sonnet 定价下的 Fable 5 级别编程能力。在出口管制下建造,由房间中估值最低的实验室完成,并在 7 月 27 日免费赠送。
有趣的问题不是 K3 是否在某些基准上击败 Fable 5。而是当一个开放权重的模型与它们匹配时,封闭前沿模型的经济学会发生什么变化。
链接
- Kimi K3:https://www.kimi.com
- 我的 Telegram:https://t.me/kirillk_web3
- 我的 Twitter/X:https://x.com/kirillk_web3
- 合作托管:https://ishosting.com/affiliate/NzE0MiM2
关注获取更多氛围编程信息。感谢阅读!





