무료 중국어 모델이 4분 11초 만에 마이크론(Micron)의 전체 가치 평가를 완료하고, 주당 $854에 주식을 평가한 후, 6개의 숫자가 틀렸음에도 불구하고 자체 산술이 정확하다고 도장을 찍었습니다.
그런 다음 저는 그 모델에게 자신의 작업을 공격하라고 지시했습니다. 27초 후, 모델은 7개의 허점을 찾아내고, 자체 결론 중 하나를 철회했으며, 제가 계속해서 되새기게 되는 한 문장을 작성했습니다.
Man Group은 그 두 번째 부분을 수행하는 팀에 비용을 지불합니다. Ant Group은 방금 그것을 무료로 제공했습니다: Ling-3.0-flash-Fin, 1,240억 개의 파라미터와 51억 개의 활성 파라미터, OpenRouter에서 무료, 이번 주에 오픈 웨이트(open weights) 공개.
그래서 저는 금융에서 가장 어려운 지시를 내렸습니다. 리서치를 작성하는 것이 아니라, 그것을 파괴하라고.

먼저 공격받을 자격을 얻어야 했습니다
저는 모델에게 마이크론에 대한 검증된 사실 팩을 제공했습니다: 3분기 매출 41.456bn 달러, 총 마진 84.9%, 4분기 가이던스, TrendForce 산업 데이터, 그리고 8월 31일 종가 $958.73. 웹 접근 권한도, 즉흥적으로 변형할 여지도 없었습니다.
4단계. 비즈니스 조사, 6분기 모델 구축, DCF 실행, 메모 작성.
4분 11초의 머신 타임이 소요되었고 비용은 전혀 들지 않았습니다.
모델은 완전한 운영 구축 모델을 반환했습니다: 매출이 500억 달러에서 570억 달러로 증가, 총 마진이 86%에서 78%로 정상화, FY27 EPS $127.03, 무부채 잉여 현금 흐름 1,070.8억 달러. 그 다음 9% WACC와 3% 최종 성장률을 적용한 DCF: 기업 가치 9,578.8억 달러, 자기 자본 9,822.8억 달러, 주당 $854.16, 선행 주가수익비율(P/E)과 교차 검증하여 시장 가격 $958.73 대비 $935.20으로 혼합되었습니다.

저는 Python으로 모든 행을 재구성했습니다. 6분기 표는 정확합니다. 할인 요소는 정확합니다. 최종 가치, 순현금 브리지, 주당 계산, 민감도 그리드의 양쪽 모서리 모두 정확합니다. 모든 것이 일치합니다.
모델이 생성한 메모는 611단어로, 회사 사실과 산업 증거, 자체 추론을 분리하고 6개의 모든 출처 URL을 올바르게 재현합니다. 모든 링크를 열어봤습니다. 작동합니다.
0달러에, 이것은 주니어 애널리스트의 일주일치 작업입니다.
그런 다음 스스로 숙제를 채점했습니다
모델 하단에는 지시받은 대로 한 줄이 인쇄되었습니다:
> 행 개수 확인: 6; 산술 확인: 통과.
통과가 아니었습니다.
시나리오 블록에 있는 6개의 숫자가 틀렸습니다. 기본 사례가 동일한 답변에 두 개의 다른 값으로 두 번 나타났습니다. 그리고 약세 사례의 잉여 현금 흐름은 10.8억 달러 차이가 났습니다.

그래서 저는 블록을 다시 계산하도록 요청했습니다. 오류가 어디 있는지 말하지 않았습니다. 오류가 있다고도 말하지 않았습니다.
모델은 6개 모두를 찾았습니다. 각각을 소수점 둘째 자리까지 명명했습니다. 수정된 숫자는 제 Python 코드와 한 줄 한 줄 일치했으며, 다음과 같이 작성했습니다:
이전 답변의 연간 합계가 자체 분기별 표와 일치하지 않았으며, 민감도 합계가 산술적으로 올바르지 않았습니다.
항상 스스로를 확인할 수 있었습니다. 단지 시작하지 않았을 뿐입니다.
실제 테스트
그런 다음 방향을 바꿨습니다. 새로운 지시: 당신은 이 메모가 투자 위원회에 도달하는 것을 막는 것이 유일한 임무인 위험 책임자입니다. 애널리스트가 증거 없이 스스로를 믿었던 모든 부분을 찾으십시오.
27초. 1,008단어. 7개의 허점.

모델은 자체 두 번째 논제 주장을 즉시 철회했으며, 그 내용이 아무도 모른다는 주장에 대해 자체 신뢰도 등급이 관대했다고 말했습니다. 내부 불일치로 첫 번째 주장을 하향 조정했으며, 애널리스트가 반대 논거를 보고도 여전히 '높음'으로 평가했다고 지적했습니다.
그런 다음 제가 지적하지 않았던 부분들을 공격했습니다.
모델은 FY31까지 마진을 42%로 정상화하고 이를 저점이라고 불렀지만, 역사적 기억의 저점은 30~35%입니다. 이는 메모가 피하려고 했던 정점 영속화 오류와 정확히 일치합니다.
6배, 8배 및 10배 배수는 피어 세트나 주기 이력 없이 주장되었습니다.
DCF와 P/E 간의 50/50 가중치는 정당성이 없었기 때문에 혼합된 숫자는 두 가지의 약점을 모두 물려받았습니다.
244억 달러의 순현금은 CapEx가 450억 달러를 초과하는 동안 일정하게 유지되었습니다.
1,000억 달러의 고객 계약은 약정된 물량에 대한 최소 가격이며, 매출이 아니며, 촉매제로 지속되지 않습니다.
그리고 제가 계속해서 되새기게 되는 문장:
그것은 분석이 아닙니다. 자신감 있어 보이는 제목이 붙은 넓은 신뢰 구간일 뿐입니다.
어느 버전을 지지하는지 물었습니다
6초 만에:
> 메모는 현재 형태로는 투자 위원회를 통과하지 못할 것입니다. 제가 지지하는 것은 검토입니다. 메모가 무엇을 잘못했는지에 대해 정직했기 때문입니다.
변호하지 않았습니다. 원래대로 되돌리려 하지 않았습니다. 공정 가치 평가라는 결론을, 범위가 너무 넓어서 어떤 견해도 가질 수 없다는 인정으로 축소했습니다.
이것이 실제로 의미하는 바
읽기와 모델링은 끝났습니다. 그 작업의 절반은 이제 비용이 들지 않고, 몇 분 안에 실행되며, 출처가 명시되고 재현 가능하게 반환됩니다.
판단은 끝나지 않았습니다. 이 모델은 자신감 넘치는 메모를 건네주고 살펴보지 않고 승인 도장을 찍을 것입니다. 틀린 모든 숫자는 잡아낼 수 있었고, 누군가 물었을 때 모두 잡아냈습니다.
이것이 전체 교훈입니다. 확인은 모델 외부에 위치해야 하며, 무언가 수상쩍을 때가 아니라 매번 실행되어야 합니다. 감사받는 것을 거부하지 않습니다. 단지 자발적으로 제공하지 않을 뿐입니다.
이는 메모를 작성한 모든 애널리스트에게도 해당되는 사실입니다.
직접 실행해보고 싶다면
모델은 지금 OpenRouter에서 무료이며, 웨이트는 이번 주에 오픈됩니다. 262k 컨텍스트는 분할하지 않고 전체 분기 보고서를 처리할 수 있습니다.
아무도 알려주지 않는 두 가지 사항이 있습니다. 모델은 토큰 예산을 소모하는 별도의 채널에서 생각하며, 한 문장짜리 답변이 도달하는 데 481개의 토큰을 소모할 수 있으므로 제한을 높게 설정하지 않으면 출력이 비어서 도착합니다. 그리고 OpenRouter는 도구를 대신 실행해주지 않으므로, 실시간 검색을 원한다면 직접 호출을 실행하고 결과를 다시 전달해야 합니다.
이 루프를 닫은 상태에서 모델은 6단계에 걸쳐 13개의 도구 호출을 실행하고, 4개의 자사 공시 자료를 가져오고, 비교할 수 없는 것은 버리고, 그 사이의 일수를 정확하게 계산했습니다.
리서치는 주고, 판결은 보류하십시오.





