哪些模型真正物有所值?我们测试了 14 款模型在真实知识工作中的表现。

@andrewbusse
英语1天前 · 2026年7月23日
166K
11
3
1
8

TL;DR

这项针对 14 款 AI 模型的分析显示,基准测试的领先者往往在实际知识工作中表现不佳。本文提供了一个基于判断力和频率选择模型的框架,将模型分为短跑选手、中量级选手和重量级选手。

最适合某项工作的模型,几乎从来都不是排行榜上表现最好的模型。

在 AI 世界里,好消息大约每周都会来一次。新模型发布,所有人都盯着同一张充满虚假精度的基准测试图表,一致认为这是有史以来最棒的东西——直到下周,我们再来一遍。

但这些图表没有一个能回答那个唯一重要的问题:这个模型真的能处理你的日常简报,或者给客户发送报价吗?在 Hyperagent,我们让你在顶级的 Agent 之上,使用所有这些模型。所以我们自己测试了它们。14 个模型,42 次运行,针对的是客户每天交给 Agent 的真实知识工作。有三点非常突出。

  • 相同工作的费用相差 50 倍。 同样的测试任务,在 Qwen 3.7 Plus 上花费 1.48 美元,在 Fable 5 上则高达 75.16 美元。
  • 基准测试的赢家,并不是实际工作的赢家。 GPT 5.6 Sol 在我们的基线测试中名列前茅,但一旦在 Hyperagent 内部执行真实任务,它甚至没能进入前三名。Grok 4.5 在基线测试中表现中等,但在完成工作的质量、速度和成本方面却拔得头筹。
  • 没有哪个模型能包揽一切。 正确的选择需要根据具体工作来定。

结论不是要找一个新宠模型。而是要找到一种方法,针对每一项工作,来判断哪个模型值得它的成本。

AI 模型知识工作地图

你交给 Agent 的每一项工作,都归结为两个问题:它需要多少判断力,以及它运行的频率有多高?将这两个维度画出来,知识工作就落入了四个区域,每个区域都需要不同类型的模型。

Andrew Busse - inline image

批量工作(左上角)。分类、监控、路由、数据同步。流程清晰,持续运行,出错后修复成本低。这类工作需要快速且廉价的模型。

日常手艺活(右上角)。起草、报告、研究、客户沟通。这些是占据大部分工作时间的重复性知识工作——它需要真正的综合能力和良好的写作风格,并且要可靠、频繁地完成。

高 stakes(右下角)。合同审查、定价决策、深度研究。不常发生,但一个错误答案可能会失去客户、合同,或一个季度的利润。在这里,错误的代价远高于模型费用,最昂贵的模型也在这里赚取它们的价值。

无需优化(左下角)。偶尔的、简单的请求,任何有能力的模型都能轻松完成,价格差异小到不值得花心思决定。这是地图上我们告诉用户无需费心的一块区域。

三种模型类别

从地图中可以看出三种工作类别。它们描述的是工作的经济性和判断力需求,而不是给模型贴上好坏的标签。

短跑选手 专为批量工作而生——当流程清晰且错误容易修复时,它们快速、廉价且稳定。例如 Haiku 4.5、Gemini 3.5 Flash 和 DeepSeek V4 Pro。

中量级选手 处理日常手艺活。它们能综合信息源、保持多步骤计划、写出好文章,而不会为每份报告收取顶级费用。Sonnet 5、GPT 5.6 Terra、Grok 4.5 和 GLM 5.2——大多数知识工作都属于这一类。

重量级选手 负责高 stakes 的工作,带来更强的判断力和更多的推理时间,来处理那些错误成本远高于模型费用的事务。例如 Opus 4.8、GPT 5.6 Sol 和 Fable 5。

大多数人本能的反应是从高往低选——先用 Fable 5 或 Opus 4.8 运行所有任务,得到想要的输出,然后尝试更便宜的模型,直到质量下降。这种方法可行,但我们发现大多数工作并不需要这样。一旦你能明确任务类型并将其放在地图上,你通常从一开始就能选对类别。对于日常手艺活(这也是你大部分的工作),这意味着从一个可靠的中量级模型开始,比如 Sonnet 5。只有当一项任务确实属于高风险端时,你才需要采取自上而下的搜索策略。

模型选择远不止 Claude、GPT 和 Gemini

大多数团队默认使用他们已知的少数几个模型名称。这是一个合理的起点,但这会忽略大量的其他模型——而且,在 Hyperagent 中,一些完成最有用工作的模型并不是那些家喻户晓的名字。以下是我们从测试和日常使用中得出的操作印象,以及我们观察到的客户运行情况。

Grok 4.5 快速,擅长实时研究。它在处理大量工具的研究任务时速度很快,并且在与 Hyperagent 的原生 Exa 搜索配合使用时表现尤其出色。它还拥有 X 的本地连接,因此关于实时情感的问题可以带回背后实际的相关帖子。在我们测试中,它凭借 9.71 美元的总运行成本,在完成工作得分上领先。

Muse Spark 1.1 写作清晰,并能自我检查。它在测试中排名第二,我们初步评价是:文笔简洁、结构清晰,并且有一个有用的习惯——在交回结果前会先审计自己的工作。它仍然很新,所以对于长时间无人监督的任务,我们建议先让它处理有监督的日常工作。

Kimi K2.6 提供深度研究,但价格是开放模型的水平。它并行运行搜索,并将证据汇总到一个答案中,而不收取旗舰级模型的费用,这使其成为一个强大的研究专家。它唯一的真正限制是文档大小,上下文窗口上限为 256,000 个 Token。

GLM 5.2 是性价比之选。在常规研究、起草和长文档处理方面,它的表现惊人地接近封闭的中量级模型,但价格仅为其三分之一左右,并且其文笔是除 Sonnet 和 Opus 之外最强的。它已成为 Hyperagent 团队许多人的日常首选。

Qwen 3.7 Plus 是屏幕操作能手。它特别擅长在渲染页面上找到按钮、字段和菜单,并且对于结构化提取来说价格低廉——它在我们的测试中产生了最低成本的完整运行。当任务是操作界面或移动数据时,可以选用它,而不是当需要注重语言风格时。

DeepSeek V4 Pro 以极低的成本进行结构化分析。它最擅长对账、数据清理、定期的数字处理等类似的结构化任务。它的写作风格直白且简洁,这适合内部解释,但不适合面向客户的文稿。它是一个专家,而且是一个非常经济实惠的专家。

以合适的价格为你始终在线的 Agent 配备人员

Steve Juba 经营着一家六人的旅游公司。他构建了一个连接八个实时数据源的简报 Agent,每天运行数次,将他每天早晨从八个标签页中收集信息的时间从三个多小时缩短到了十五分钟。

这样的 Agent 读取量远大于写入量,并且一年内要执行相同的任务数百次,因此每次运行微小的价格差异就不再是四舍五入的误差,而是变成了实实在在的预算项目。考虑一个每天读取 100,000 个 Token、写入 2,000 个 Token 的简报。按照 2026 年 7 月的标价,这种形状的工作大致运行成本是:

  • 使用 Qwen 3.7 Plus(短跑选手)每年约 16 美元
  • 使用 Kimi K2.6(中量级选手)每年约 38 美元
  • 使用 Haiku 4.5(短跑选手)每年约 40 美元
  • 使用 Sonnet 5(中量级选手)每年约 80 美元
Andrew Busse - inline image

对于这种读取密集型的工作,开放权重的模型改变了成本计算。Kimi K2.6 能提供中量级质量的研究和综合,在这项任务上只需 38 美元——不到 Sonnet 5 的一半,与运行短跑选手 Haiku 的价格相当。你并没有为了成本而牺牲判断力;你是在用短跑选手的价格获得中量级的工作成果。如果任务纯粹是提取数据,无需判断力,Qwen 可以 16 美元完成——但一旦需要真正的综合能力,Kimi 就能以接近的价格提供给你。

更换模型,保留 Agent

如果更换模型意味着重建 Agent,那么以上这些都毫无意义。在 Hyperagent 内部,情况并非如此,因为模型只是一个设置,而角色位于其之上。更换模型后,Agent 会保留使其有用的一切:

  • 它的指令和范围
  • 它的技能、脚本和工作流程
  • 它对错误修正的记忆
  • 它的参考文件和企业上下文
  • 它与工作所在系统的连接
  • 它用于评估质量的评价标准
Andrew Busse - inline image

这使得模型选择变成了一次测试,而不是一次迁移。同一个 Agent 可以在两个不同的模型上运行相同的任务而无需重建,这样你就可以找到最便宜且能满足你标准的模型,而不是靠猜测。

这也让困难工作流中昂贵的部分能够一次性收回成本。当一项任务确实需要时,使用更重的模型来设计和调试工作流——然后将流程固化为一个技能,这样中量级或短跑选手模型就能以极低的成本每天运行它。

不过,有一个隐藏的成本需要注意。一个费用较低的廉价模型,如果每次输出都需要修正,那它就不便宜——人工审核时间和错误成本都是实际价格的一部分。我们称之为审核税。它为你选择多轻量级的模型设定了下限。在 Hyperagent 中,不同之处在于,审核不仅仅是被支付了,它还会产生复利:当 Agent 通过记忆从你的修正中学习时,这个审核努力会被测试平台捕获,并在下一次运行时产生更好的 Agent。

客户已经在用这种方式配备 Agent 了。Ankit Das 建立了一个营销运营体系,由一个使用 Sonnet 5 做出判断决策的增长运营官和八个使用 GLM 5.2 执行重复性渠道工作的渠道专家组成,还有独立的 QA Agent 检查品牌合规性和写作质量——所有这一切都从一个线程启动。Eli Weiss 更简单地描述了他的分配方式:在他的技能和日常流程中,大约 85% 使用 Sonnet,15% 使用 Opus。大部分工作由日常驱动模型运行;Opus 则处理那一小部分需要额外判断力、且能体现其价值的任务。

这就是在 Hyperagent 内部选择模型的实际价值。根据工作类型有策略地分配支出,将额外的费用留给那些需要额外判断力才能改变结果的任务。

先确定工作,再选择模型

对于你已经在运行的 Agent,请遵循以下步骤:

  1. 明确任务。 “准备周一的客户报告”比“协助报告”更有用。
  2. 在地图上定位。 判断它需要多少判断力,以及运行的频率。
  3. 从地图指示的位置开始。 对于大多数工作来说,这意味着从一个有能力的 中量级模型开始——使用它,直到你了解任务的边缘情况,并将流程固化为技能。
  4. 降低一个级别,进行五次真实运行测试。 保持指令、技能、记忆、数据源和评价标准不变。
  5. 比较总成本。 跟踪完成的品质、一致性、时间、事实错误、模型费用和人工审核时间。
  6. 有目的地升级。 当审核负担或错误答案的成本超过模型溢价时,引入一个 重量级模型。
  7. 使用不同的模型来审核重要工作。 犯错的模型通常最不可能发现自己的错误。

保留那个能稳定达到你标准的最便宜模型。然后将节省下来的费用,花在那些真正值得的判断上。

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章