一個免費的中文模型在 4 分 11 秒內建立了完整的美光估值,將股價定在每股 854 美元,然後在六個數字都錯誤的情況下,卻自行蓋章認證其算術是正確的。
接著我要求它攻擊自己的成果。27 秒後,它找到了七個漏洞,撤回了一個自己的結論,並寫下了一句我反覆回味的話。
Man Group 僱用了一組人來做第二部分的工作。螞蟻集團(Ant Group)則直接免費提供:Ling-3.0-flash-Fin,擁有 1240 億個參數,其中 51 億個活躍參數,在 OpenRouter 上免費使用,本週開放權重。
所以我給了它金融界最難的指令。不是撰寫研究報告,而是摧毀它。

首先,它必須先贏得被挑戰的資格
我交給它一份關於美光的驗證事實資料包:第三季營收 414.56 億美元,毛利率 84.9%,第四季財測,TrendForce 產業數據,以及 8 月 31 日的收盤價 958.73 美元。沒有網路存取權限,沒有臨場發揮的空間。
四個步驟。研究業務、建立六季模型、執行 DCF、撰寫備忘錄。
它花了 4 分 11 秒的機器時間,而且完全免費。
模型回傳了一份完整的營運建構:營收從 500 億美元 攀升至 570 億美元,毛利率從 86% 正常化下降至 78%,FY27 每股盈餘為 127.03 美元,無槓桿自由現金流為 1070.8 億美元。接著是基於 9% WACC 和 3% 終值增長率的 DCF 模型:企業價值 9578.8 億美元,權益價值 9822.8 億美元,每股 854.16 美元,並與預期本益比交叉比對,最終混合價格為 935.20 美元,對比市場價格 958.73 美元。

我用 Python 重建了它的每一行數據。六季表格完全精確。折現因子完全精確。終值、淨現金橋接、每股計算、敏感度網格的兩個角落,全部正確無誤。
它產出的備忘錄共 611 字,將公司事實、產業證據與其自身推論區分開來,並正確引用了所有六個來源網址。我打開了每個連結,都能正常運作。
花費 0 美元,這是一個初級分析師一週的工作量。
然後它為自己的作業打分
在模型底部,它印出了一行被要求印出的文字:
> 行數檢查:6;算術檢查:通過。
但這並非通過。
情境區塊中有六個數字是錯誤的。基本情境在同一個答案中出現了兩次,且數值不同。而悲觀情境的自由現金流則少了 10.8 億美元。

所以我要求它重新計算這個區塊。我沒有說錯誤在哪裡,也沒有說存在錯誤。
它找到了全部六個錯誤。每個都精確到小數點後第二位。它修正後的數字與我的 Python 計算結果完全一致,並且它寫道:
先前答案的年度總計與其自身的季度表格不符,且敏感度總計在算術上是錯誤的。
它一直都能夠自我檢查。只是從未開始。
真正的考驗
接著我反轉指令。新的指示:你是風險官,唯一的職責是阻止這份備忘錄送達投資委員會。找出所有分析師在沒有證據的情況下就相信自己的地方。
27 秒。1008 字。七個漏洞。

它直接撤回了自己的第二個論點主張,並表示對於一個實質內容是「無人知曉」的主張來說,它原本的信心評級過於寬容。它因內部不一致而下調了第一個主張的評級,指出分析師看到了反對論點,卻仍將其評為「高」信心。
接著,它針對我沒有標記出來的問題進行了攻擊。
它將利潤率正常化至 FY31 的 42%,並稱之為低谷,但歷史記憶中的低谷是在 30% 到 35% 之間。這正是備忘錄聲稱要避免的「高峰永續」錯誤。
6 倍、8 倍和 10 倍的估值倍數是在沒有同業比較組和週期歷史的情況下被斷言出來的。
DCF 與 P/E 之間 50/50 的權重沒有正當理由,因此混合數字繼承了兩者的弱點。
244 億美元 的淨現金保持不變,而資本支出卻超過 450 億美元。
1000 億美元 的客戶協議是對承諾銷量的最低價格保證,而非營收,因此無法作為催化劑持續存在。
以及那句我反覆回味的話:
那不是分析;那只是一個信心區間很寬、配上一個聽起來很有信心的標題。
我問它支持哪個版本
六秒鐘:
> 這份備忘錄以其目前的形式無法通過投資委員會。我支持的是那份審查報告,因為它誠實地說明了備忘錄錯在哪裡。
沒有辯護。沒有試圖迴歸原版。它將自己的結論從一個公允價值判斷,縮減為承認估值區間過大,以至於根本沒有任何觀點。
這實際上意味著什麼
閱讀和建模的工作已經完成。這部分工作現在零成本、幾分鐘內完成,並且有來源、可複現。
判斷的工作尚未完成。這個模型會交給你一份充滿信心的備忘錄,並在未經審視的情況下蓋章批准。它每個算錯的數字,它都有能力發現,而且只要有人提出要求,它就能全部找出來。
這就是全部的教訓。檢查機制必須獨立於模型之外,並且每次都執行,而不是等到感覺不對勁才做。它並不抗拒被審計,只是永遠不會主動提出。
這也適用於每一位撰寫過報告的分析師。
如果你想試試看
這個模型目前在 OpenRouter 上免費提供,權重將於本週開放。262k 的上下文長度可以直接處理完整的季度財報,無需分割。
有兩件事沒有人告訴你。它會在一個單獨的通道中思考,這會消耗你的 token 預算,而且一個一句話的答案可能耗費 481 個 token 才能產出,所以請將上限設高,否則你的輸出會是空的。此外,OpenRouter 不會為你執行工具,所以如果你想要即時檢索,你需要自己執行呼叫並將結果傳回。
在完成這個循環後,它驅動了 6 個步驟中的 13 次工具呼叫,提取了四份第一方揭露文件,捨棄了那些不具可比性的文件,並正確計算了它們之間的天數。
把研究交給它。把判斷權留給自己。





