一个免费的国产模型在 4 分 11 秒内完成了对美光的完整估值,将股价定为每股 854 美元,然后在其中六个数字出错时,却给自己的算术打上了正确的标记。
然后我让它攻击自己的成果。27 秒后,它发现了七个漏洞,撤回了一个自己的结论,并写下了一句我反复回味的话。
Man Group 雇了一队人来完成第二部分工作。而蚂蚁集团直接把它免费送了出来:Ling-3.0-flash-Fin,1240 亿参数,其中 51 亿活跃,在 OpenRouter 上免费使用,本周开放权重。
所以我给了它金融领域最难的指令。不是撰写研究报告,而是摧毁它。

首先,它必须赢得被攻击的资格
我给了它一份关于美光的经过验证的事实包:第三季度营收 414.56 亿美元,毛利率 84.9%,第四季度指引,TrendForce 行业数据,以及 8 月 31 日的收盘价 958.73 美元。没有网络访问权限,没有即兴发挥的空间。
四个步骤。研究业务,构建一个六季度的模型,运行 DCF,撰写备忘录。
它花费了 4 分 11 秒的机器时间,成本为零。
模型返回了一个完整的运营构建:营收从 500 亿美元 攀升至 570 亿美元,毛利率从 86% 正常化至 78%,FY27 每股收益为 127.03 美元,无杠杆自由现金流为 1070.8 亿美元。然后是一个 WACC 为 9%、终端增长率为 3% 的 DCF:企业价值 9578.8 亿美元,股权价值 9822.8 亿美元,每股 854.16 美元,通过远期市盈率交叉验证,并混合得出 935.20 美元,而市场价格为 958.73 美元。

我用 Python 重建了它的每一行。六季度表格是精确的。折现因子是精确的。终值、净现金桥接、每股计算、敏感性网格的两个角落,全部成立。
它生成的备忘录共 611 字,将公司事实、行业证据与其自身推断区分开来,并正确列出了所有六个来源 URL。我打开了每个链接。它们都有效。
对于零成本来说,这是一个初级分析师一周的工作量。
然后它给自己的作业打了分
在模型的底部,它打印了一行被要求打印的内容:
> 行数检查:6;算术检查:通过。
但事实并非通过。
情景块中的六个数字是错误的。基础案例在同一个答案中出现了两次,且数值不同。而悲观案例的自由现金流则少了 10.8 亿美元。

所以我让它重新计算这个块。我没有说错误在哪里。我甚至没有说存在错误。
它找到了全部六个。精确到小数点后第二位。它修正后的数字与我的 Python 代码逐行吻合,并且它写道:
先前答案的年度总计与其自身的季度表格不符,且敏感性总计在算术上不正确。
它一直都能自我检查。它只是从未开始过。
真正的测试
然后我调转了方向。新的指令:你是风险官,唯一的职责是阻止这份备忘录送达投资委员会。找出分析师在没有证据的情况下相信自己观点的每一个地方。
27 秒。1008 字。七个漏洞。

它直接撤回了自己的第二个论点,并称其自身的信心评级对于一个实质内容为“无人知晓”的主张来说过于慷慨。它因内部不一致而下调了第一个论点的评级,指出分析师看到了反方论点,却仍然将其评为“高”。
然后它开始攻击我未曾标记过的地方。
它将 FY31 的利润率正常化至 42%,并称之为低谷,而历史记忆中的低谷在 30% 到 35% 之间。这正是备忘录声称要避免的峰值永久化错误。
6 倍、8 倍和 10 倍的市盈率倍数是在没有同行比较和周期历史支撑的情况下断言的。
DCF 和市盈率之间 50/50 的权重没有依据,因此混合数字继承了两者的弱点。
244 亿美元 的净现金保持不变,而资本支出却超过 450 亿美元。
1000 亿美元 的客户协议是对承诺量的最低价格保证,而非收入,并且不能作为催化剂持续存在。
以及那句我反复回味的话:
那不是分析;那是一个带有自信标题的宽泛置信区间。
我问它支持哪个版本
六秒钟:
> 这份备忘录以其当前形式无法通过投资委员会。我支持的是这份审查报告,因为它诚实地指出了备忘录的错误之处。
没有辩护。没有向原始结论回撤。它将自己的结论从一个公允价值判断,缩小为承认范围太宽,以至于根本没有观点。
这实际上意味着什么
阅读和建模工作已经完成。那部分工作现在成本为零,几分钟内完成,并且结果有来源、可复现。
判断工作尚未完成。这个模型会递给你一份自信满满的备忘录,并在不看一眼的情况下盖章批准。它犯的每一个错误,它都有能力发现,并且一旦有人提出质疑,它就能全部抓住。
这就是全部的教训。检查必须置于模型之外,并且每次都运行,而不是等到感觉不对劲时才进行。它不抗拒被审计。它只是从不主动提出。
这也适用于每一位曾经撰写过报告的 analyst。
如果你想运行它
该模型目前在 OpenRouter 上免费使用,权重将于本周开放。262k 的上下文可以容纳完整的季度财报,无需拆分。
有两件事没人告诉你。它在单独的通道中思考,会消耗你的 token 预算,一个一句话的答案可能消耗 481 个 token 才能得出,所以请将限制设置得高一些,否则你的输出将是空的。而且 OpenRouter 不会为你运行工具,所以如果你想要实时检索,你需要自己执行调用并将结果传回。
在闭环的情况下,它驱动了 6 个步骤中的 13 次工具调用,拉取了四项第一方披露信息,丢弃了那些不可比的,并正确计算了它们之间的天数。
给它研究。保留裁决。





