中国製の無料モデルが 4 分 11 秒で Micron の完全なバリュエーションを構築、株価を 1 株 854 ドルと算出し、6 つの数値が誤っているにもかかわらず、自身の計算を正しいと認定した。
その後、私はそのモデルに自身の作業を攻撃するよう指示した。27 秒後、7 つの穴を見つけ、自身の結論の 1 つを撤回し、私が何度も思い返す一文を書き出した。
Man Group はその後半部分を実行するチームに報酬を支払っている。Ant Group はそれを無料で提供した:Ling-3.0-flash-Fin、1,240 億パラメータ、51 億のアクティブパラメータ、OpenRouter で無料、今週中にオープンウェイト公開。
そこで私は金融で最も難しい指示を与えた。リサーチを書くことではない。それを破壊することだ。

まず、攻撃される資格を得る必要があった
私は Micron に関する検証済みのファクトパックを渡した:第 3 四半期の売上高 41.456bn ドル、粗利益率 84.9%、第 4 四半期ガイダンス、TrendForce の業界データ、8 月 31 日の終値 958.73 ドル。ウェブアクセスなし、即興の余地なし。
4 つのステップ。事業を調査し、6 四半期のモデルを構築し、DCF を実行し、メモを作成する。
マシンタイムで 4 分 11 秒かかり、コストはゼロだった。
モデルは完全な事業構築を返してきた:売上高は 500 億ドル から 570 億ドル へ増加、粗利益率は 86% から 78% へ正常化、FY27 の EPS は 127.03 ドル、アンレバードフリーキャッシュフローは 1,070.8 億ドル。その後、WACC 9%、ターミナル成長率 3% での DCF:企業価値 9,578.8 億ドル、株主価値 9,822.8 億ドル、1 株あたり 854.16 ドル、フォワード PER とクロスチェックし、市場価格 958.73 ドルに対して 935.20 ドルにブレンドされた。

私はそのすべての行を Python で再構築した。6 四半期のテーブルは正確だ。割引係数は正確だ。ターミナルバリュー、ネットキャッシュブリッジ、1 株あたりの計算、感応度グリッドの両端。すべてが成立する。
作成されたメモは 611 ワードで、企業の事実と業界のエビデンスと自身の推論を分離し、6 つのソース URL をすべて正しく再現している。すべてのリンクを開いた。機能する。
0 ドルで、これはジュニアアナリストの 1 週間分の仕事だ。
そして、自身の宿題を採点した
モデルの下部に、指示された行が印刷されていた:
> 行数チェック:6;算術チェック:合格。
合格ではなかった。
シナリオブロックの 6 つの数値が間違っていた。ベースケースが同じ回答内に 2 つの異なる値で 2 回出現していた。そしてベアケースのフリーキャッシュフローは 10.8 億ドルずれていた。

そこで、そのブロックを再計算するよう依頼した。エラーの場所は言わなかった。エラーがあるとも言わなかった。
6 つすべてを見つけた。それぞれを小数点第 2 位まで特定した。修正された数値は私の Python と行ごとに一致し、次のように書いた:
以前の回答の年間合計は、自身の四半期テーブルと一致しておらず、感応度の合計は算術的に誤っていました。
ずっと自分自身をチェックできたのに、ただ開始しなかっただけだ。
実際のテスト
次に、それを逆転させた。新しい指示:あなたはリスクオフィサーであり、唯一の仕事はこのメモが投資委員会に届くのを防ぐことだ。アナリストが証拠なしに自分を信じた箇所をすべて見つけよ。
27 秒。1,008 ワード。7 つの穴。

自身の 2 番目のテーゼの主張を即座に撤回し、誰も知らないという主張に対して自身の信頼度評価は寛大すぎたと述べた。1 番目の主張は内部矛盾を理由に格下げし、アナリストが反対意見を見ながらもそれを High と評価したことを指摘した。
その後、私が指摘していなかった点を攻撃した。
FY31 までに利益率を 42% に正常化し、それをボトムと呼んだが、歴史的なボトムは 30 から 35 パーセントである。これはまさに、メモが回避しようと主張したピーク永続化エラーだ。
6 倍、8 倍、10 倍の倍率は、ピアセットやサイクル履歴なしに主張されていた。
DCF と PER の 50/50 ウェイト付けには正当性がなく、ブレンドされた数値は両方の弱点を継承していた。
244 億ドル のネットキャッシュは一定に保たれていたが、CapEx は 450 億ドル を超えていた。
1,000 億ドル の顧客契約は、確約数量に対する最低価格であり、売上高ではなく、触媒として存続しない。
そして、私が何度も思い返す一文:
それは分析ではない。自信ありげな見出しがついた、幅広い信頼区間にすぎない。
どのバージョンを支持するか尋ねた
6 秒:
> このメモは現在の形では投資委員会を通過しない。私が支持するのはレビューだ。なぜなら、メモの何が間違っていたかについて正直だったからだ。
弁護も、元の主張への後退もない。自身の結論を、フェアバリューのコールから、レンジが広すぎて見解を持てないという認容へと縮小した。
これが実際に意味すること
読み取りとモデリングは完了した。仕事のその半分は今やコストゼロで、数分で実行され、ソース付きで再現可能な形で返ってくる。
判断は完了していない。このモデルは、自信満々のメモを手渡し、見もせずに承認のスタンプを押す。間違えたすべての数値は、捕捉可能であり、誰かが尋ねた瞬間にすべてを捕捉した。
それがすべての教訓だ。チェックはモデルの外部に置かれ、毎回実行されなければならない。何かがおかしいと感じたときだけではない。監査に抵抗しない。ただ自発的には行わない。
それは、これまでにノートを書いたすべてのアナリストにも当てはまる。
実行したい場合
モデルは今すぐ OpenRouter で無料であり、今週中にウェイトがオープンになる。262k のコンテキストは、四半期報告書を分割せずに丸ごと処理できる。
誰も教えてくれないことが 2 つある。別のチャネルで思考し、トークンバジェットを消費する。1 文の回答でも、そこに到達するまでに 481 トークンを消費する可能性があるため、制限を高く設定しないと、出力は空で到着する。また、OpenRouter はツールを実行しないため、ライブ検索が必要な場合は、自分で呼び出しを実行し、結果を渡す必要がある。
そのループを閉じることで、6 つのステップにわたって 13 回のツールコールを駆動し、4 つの第一開示情報を取得し、比較可能でないものを破棄し、それらの間の日数を正確に計算した。
リサーチを与えよ。判断は自分で下せ。





