레버리지 비율 7.3배는 모든 Jane Street 뉴스 기사를 합친 것보다 더 많은 것을 말해준다. 이를 드러낸 방법론과 작업을 재현할 수 있는 오픈 리포지토리.
2024년, Bill Hwang은 200억 달러를 잃었고, 업계는 뉴스를 통해 이를 알게 되었다. 13F가 아니었다. 13D가 아니었다. Form SHO도 아니었다. Archegos는 13F를 제출한 적이 없다. ViacomCBS, Discovery, Tencent Music의 포지션은 총수익스왑(TRS)을 통해 구성되었는데, 규제 프레임워크는 이를 '보유 지분'으로 간주하지 않는다. 이것이 법 안에 숨길 수 있는 한계다.
Jane Street을 해독하기 전에 - SEBI가 Jane Street이 훨씬 비공개로 유지하고 싶어했던 105페이지 분량의 자료를 공개한 상황에서 - 우리는 공개 데이터에서 무엇이 보이고 보이지 않는지에 대해 합의해야 한다. 그렇지 않으면 어떤 LLM 파이프라인도 아름답게 쓰여진 환상을 만들어낼 것이다.
이 글은 Jane Street 대 SEBI 사건과 이를 선임 애널리스트 일주일 분량 대신 하루 저녁에 해독한 방법론에 관한 것이다. 여섯 가지 기법, 모니터링 레이어, 패턴 전파를 갖춘 오픈 리포지토리로 구현된 방법론. 링크는 마지막에 있다.
파트 1. 13F와 공개 문서가 보여주지 않는 것
만약 당신의 애널리스트가 여전히 13F를 포트폴리오 스냅샷이라고 생각한다면, 그 애널리스트를 해고하라. 13F는 필터링되고 지연된 포트폴리오의 투영일 뿐이다:
- Section 13(f) 증권의 롱 포지션만 포함. 숏 포지션 없음. 스왑 없음. 고정 수입 없음. 옵션은 명목 가치만 보고 - 행사가나 방향성 없음
- 45일 지연. 3분기 보유 지분을 볼 때쯤이면, 펀드는 이미 4분기에 있을 수 있음
- 기밀 처리 요청. Berkshire는 건설 중인 포지션을 3-12개월 동안 정기적으로 숨김; Agarwal 등의 \Journal of Finance\ 연구는 기밀로 처리된 보유 지분이 공개된 것보다 체계적으로 더 높은 알파를 창출한다는 것을 실증적으로 보여줌
- 윈도우 드레싱. 분기 말을 앞두고 '존경받을 만한' 포지션으로 갈아타기 - 학계에 잘 문서화되어 있지만, 13F 구조상 보이지 않음
- Form SHO(숏 포지션 허점의 일부를 막을 수 있었던)는 2028년 2월로 연기됨
모든 방법론은 구조적으로 추출이 불가능한 것이 무엇인지 명시적으로 나열하는 것으로 시작한다. 그렇지 않으면, 당신은 펀드 자체가 아니라 펀드의 공개된 가면에 대한 모델을 구축하는 것이다.
좋은 소식: 그 가면은 일관성을 유지해야 한다는 것이다. 전략을 숨기기 위해 펀드는 매 분기마다 비용이 많이 드는 조치가 필요하다 - 기밀 처리 요청, 스왑 구조 조정, 국가 간 자산 배분. 이러한 조치들은 2차적 흔적을 남긴다: 연도별 Form ADV의 언어 변화, LinkedIn의 채용 패턴, USPTO의 특허 출원, 직원의 학술 논문, 다른 국가의 규제 문서.
LLM이 새로운 출처를 찾아내지는 않는다. 출처는 동일하다. 변하는 것은 상호 참조의 비용이다. USPTO 특허를 같은 저자의 학술 논문에 연결하고, 그 저자가 1년 전에 그 펀드의 전 직원도 참석했던 컨퍼런스에서 발표했다면 - 이전에는 선임 애널리스트의 하루치 작업이었다. Claude와 프롬프트 캐싱을 사용하면: API 크레딧 2달러와 15분이면 된다.
Opus 4.7에서 캐시 읽기는 토큰 100만 개당 5달러 대신 0.50달러다. 105페이지 분량의 PDF를 캐시에 한 번 로드한 다음, 수백 개의 프롬프트를 각각 몇 센트로 실행한다. 작업 흐름이 "비싼 분석 한 번"에서 "저렴한 질문 천 개"로 전환된다.
파트 2. Jane Street 대 SEBI
타임라인:
- 2024년 4월: Citadel이 뉴욕에서 전 직원 두 명의 영업 비밀 침해로 Jane Street을 고소. 고소장에는 인도 옵션 전략이 언급됨 - 이는 SEBI에 단서를 제공
- 2025년 2월: NSE가 Jane Street에 명시적 권고를 발행
- 2025년 7월 3일: SEBI가 105페이지 분량의 일방적 잠정 명령을 발표하고, ₹4,843크로르(5억 6,500만 달러)를 동결
- 2025년 7월 21일: 에스크로 예치 후 동결 해제
- 2025년 9월: 증권항소법원(SAT)이 개인 청문회를 중단하고 SEBI에 추가 문서 공개를 요구
- 2026년 1월: 조사가 Sensex 및 기타 전략으로 확대. 아직 최종 명령 없음
SEBI가 Jane Street이 2023년 1월부터 2025년 3월까지 인도 옵션에서 얻은 것으로 간주하는 이익: ₹43,289크로르(~50억 달러). 동결된 5억 6,500만 달러는 특정 거래일의 "불법 이득"만 해당한다.
Jane Street의 변호: "기본적인 지수 차익거래, 소매 수요 충족." 파생상품에서 시장 조성과 조작 사이의 경계는 실제로 매우 얇다. 그러나 NSE의 명시적 권고 이후에도 지속된, 거의 동일한 패턴의 18개의 만기일 - 변호하기 더 어려워진다.
다음은: 공개 문서만으로 동일한 결론에 도달하는 방법.
파트 3. 여섯 가지 기법
대부분의 LLM-for-finance 튜토리얼은 "PDF를 로드하고 요약을 요청하라"고 말한다. 낭비되는 컨텍스트다.
3.1. 적대적 가설 검증
기본적인 실수 - LLM에게 "전략을 설명해달라"고 요청하는 것이다. 당신의 유도 질문을 레일 삼아 Claude가 다듬어진 이야기를 만들어낸다.
올바른 패턴은 역전된다. 당신이 가설을 공식화하고, Claude는 적대적 검토자의 역할을 맡는다:
LLM은 교정자로서는 좋지만, 증명 생성자로서는 나쁘다. "나 대신 생각해줘" 모드가 아니라 "내 생각의 허점을 찾아줘" 모드로 사용하라.
3.2. 경쟁 가설의 앙상블
올바른 가설이 당신이 공식화한 것이 아니라면? 여러 Claude 인스턴스를 병렬로 실행하고 각각 다른 해석 프레임을 적용하라: "이것은 조작이다," "이것은 합법적인 시장 조성이다," "이것은 다른 것이다." 메타 프롬프트가 세 가지 출력을 비교하고 차이점을 식별한다. 세 가지 프레임이 모두 동일한 사실에 수렴하지만 다른 결론에 도달하는 곳 - 바로 데이터가 불충분한 지점이다. 자신의 미지수를 진단하는 것, 이는 연구에서 어떤 단일 답변보다 가치 있다.
3.3. 시간 차분
동일한 회사의 다른 연도 동일한 문서 유형(가장 생산적인 대상은 Form ADV)을 비교한다. Claude에게 언어 변화, 특히 표준 문구의 변화를 찾도록 요청하라. 대부분의 펀드는 ADV를 해마다 그대로 복사한다; 위험 관리 언어에 변화가 있을 때, 이는 규정 준수 부서가 기존 문구가 더 이상 자신들을 보호하지 않는다고 판단했다는 신호다.
가장 흥미로운 발견: 오래된 언어가 사라지는 경우. 제거된 진술은 거의 항상 그것이 더 이상 사실이 아님을 의미한다.
3.4. 교차 문서 삼각 측량
하나의 문서는 내러티브다. 세 개의 문서는 삼각 측량이다. 출처 A(SEBI 명령)의 주장, B(만기일 미시구조에 관한 학술 문헌)의 확인, C(Jane Street 내부 커뮤니케이션)의 모순. Claude는 신뢰도 점수와 함께 한 세션에서 수백 개의 주장에 대한 교차점을 실행한다. 세 가지 검증을 모두 통과한 주장 - 운영상의 진실. A를 통과했지만 B와 C에 의해 모순되는 주장 - 규제 기관이 지나치게 확장한 부분.
3.5. 프롬프트 캐싱
105페이지 분량의 SEBI 명령은 ~120k 토큰이다. 1시간 캐시로 처음 로드: ~$1.20. 각 후속 쿼리: ~$0.06. 50개 쿼리 후 - $4와 50개의 다양한 분석 단면.
변하는 것은 비용이 아니라 작업의 구조다: "문서당 세 가지 질문"에서 "삼백 가지 질문"으로.
3.6. 적대적 문서 심문
당사자 A(SEBI 명령)의 문서. 이를 Claude에 제공하고 A의 적대자 - Jane Street의 변호 팀 - 역할을 수행하도록 요청하고, 특정 사실 주장을 약화시킬 수 있는 표적 질문을 구성하도록 한다. 결과 목록은 변호가 어떻게 구성될지에 대한 예측이다. 최종 명령은 1년 후, 항소는 2년 더 걸릴 수 있지만 - 잠재적 취약점에 대한 지도는 오늘 당신의 손에 있다.
파트 4. 환각 현상을 극복하는 방법
이것 없이는 여섯 가지 기법은 아름답게 쓰여진 헛소리가 된다. Pydantic을 통해 코드로 적용되는 세 가지 규칙:
증거 출처 사슬(Provenance chain) 적용. 모든 주장은 완전한 증거 흔적을 수반한다: \source_url\, \source_document_hash\, \source_page\, \extraction_timestamp\, \extraction_model\, \verification_status\. 완전한 흔적이 없으면 - Pydantic이 거부한다.
축어적 인용 검증(Verbatim quote verification). LLM의 모든 인용은 소스 문서에 대해 프로그래밍 방식으로 문자열 매칭된다. 찾을 수 없음 - \verification_status="failed"\, 주문 폐기.
앙상블 투표(Ensemble voting). 모든 강화(Enrichment)는 다른 시드로 N번 실행된다(기본값 3). 2/3 이상 일치하는 주장은 높은 신뢰도를 얻는다. 불일치는 최종 출력에 표시된다.
코드의 신뢰도 공식:
모든 가중치에는 필수 \weight_justification\ 필드가 있다. 기본 체계: 구조적 마커 0.4, 수치 임계값 0.3, 정규식 패턴 0.2, LLM 의미 추출 0.1(가장 낮음, 가장 주관적이기 때문에).
예측에 관해서는 - 필수 \adversarial_analysis\ 및 \falsification_criteria\. Pydantic은 빈 값을 거부한다.
LLM 프롬프트 엔지니어링은 작업의 10%다. 90%는 LLM을 둘러싼 코드로, LLM이 지어낸 것을 잡아내고 폐기한다.
파트 5. 규제 기관을 신뢰할 수 있는가
자연스러운 반론: 방법론이 규제 문서에 기반을 두고 있고, 규제 기관이 명백히 편향되어 있다면 - 신뢰를 무엇이 지탱하는가?
비판의 타당성. SEC와 업계 간의 회전문 현상은 문서화되어 있다(Mary Jo White, Jay Clayton). 선택적 집행은 현실이다 - Madoff는 Markopolos의 내부고발 보고서(2000년, 2005년, 2007년)에도 불구하고 16년 동안 적발되지 않았다. 2008년 이후, 주요 은행의 최고 경영진 중 단 한 명도 형사 기소되지 않은 반면, 1980년대 저축대부조합 위기 이후에는 1,000명 이상이 유죄 판결을 받았다. SEC 집행 부서는 1,300명인 반면, 업계는 수백만 명이다.
이것이 방법론에 관련이 없는 이유.
편향은 한 방향으로 작용한다. 규제 기관은 사건 제기를 거부할 수 있다. 그러나 105페이지 분량의 명령을 발행하는 것은 다른 종류의 결정이다. 이 시점에서 규제 기관의 위험은 과소 평가가 아니라 과대 평가다: 상대방은 법정에서 약한 논증을 산산조각낼 자원을 가지고 있다.
SEBI ≠ SEC. 미국 기업에 대한 SEBI - 정치적 역학은 역전된다: 주권을 입증하고, 국내 소매를 보호하라. 국가 간 집행은 국내 집행보다 체계적으로 더 엄격하다.
숫자 대 내러티브. SEBI 명령에는 내러티브("조작," "사악한 계획")와 특정 숫자가 포함된 사실 섹션(표 7, 8, 16, 17)이 있다. 내러티브는 왜곡될 수 있다. 숫자는 Jane Street 자체가 인도 규제 시스템에 제출한 거래소 기록과 브로커 보고서에서 비롯된다. 숫자 위조는 규제 기관 직원에게 형사 책임이다.
적대적 검증. Jane Street은 적극적으로 싸우고 있다. 최고 수준의 변호사들. 항소를 제기했다. 그들은 사실("우리는 그렇게 많은 기초 자산을 사지 않았다")이 아니라 해석("이것은 조작이 아니라 차익거래다")에 대해 이의를 제기한다. 만약 숫자가 조작되었다면, 그것이 SAT에서 그들의 첫 번째 논증이었을 것이다. 적대적 시스템은 제 역할을 하고 있다.
방법론이 이와 함께 하는 일. 주장 유형별 분리: 사실적 주장 → 신뢰(검증 가능, 적대적으로 검증됨); 인과/의도 주장 → 다른 출처에 대해 삼각 측량; 법적 특성화 → 우리의 영역이 아님, 최종 명령을 기다림. 적대적 문서 심문(파트 3.6)은 특히 문서 자체에서 변호 측 관점을 구매한다.
규제 기관은 중립적이지 않다. 그러나 발행된 집행 명령은 대부분의 대안 출처보다 사실적 주장을 더 강건하게 만드는 적대적 필터를 통과한다. 내러티브가 아닌 숫자를 신뢰하라.
파트 6. 퀀트 역학: 2024년 1월 17일의 오더북
"Jane Street이 일일 거래 가치의 20%+를 보유했다"는 것은 결정적인 증거처럼 들리지만 - 그 자체로는 아무것도 증명하지 못한다.
BANKNIFTY는 인도 12대 은행의 지수다. 지수 옵션은 구성 종목 거래의 마지막 30분 가중 평균에 대해 현금 결제된다. 그 순간에 큰 감마 포지션을 보유한 시장 조성자는 현금과 선물을 통해 헤지해야 한다.
시장 조성자의 헤지는 기술적으로 시장을 움직인다. 옵션 포지션이 30분 안에 2억 달러의 기초 자산을 매도해야 한다면, 자신의 흐름이 하방 압력을 만든다. 그것은 물리학이지 의도가 아니다.
명령의 숫자들
SEBI는 2024년 1월 17일을 가장 설명적인 날로 문서화한다. 25-40페이지의 숫자(표 7, 8, 16, 17):
파트 7. 이 기법들이 오늘 당신에게 주는 것
우리는 2023-2024년 사건에 관한 2025년 명령을 해독했다 - 이것이 당신에게 지금 무엇을 주는가? 만약 출력이 구식 전략의 재구성뿐이라면, 이것은 언론인을 위한 방법론이지 트레이더를 위한 것이 아니다.
각 기법은 오늘의 데이터를 실행하는 패턴 탐지기다. Jane Street은 교육 사례다. 실시간 데이터에 대한 다섯 가지 응용:
- 레버리지 7.3배를 탐지 신호로 사용. 공개 데이터(13F + 옵션 청산소 데이터 + 거래소 거래량 보고서 결합)를 통해 관찰 가능한 시장 조성자 중 옵션 명목 가치 대 기초 자산 포지션 비율이 5배 이상运行的 것은 Jane Street의 2025년 이전 설정이다. 20-30대 대형 HFT 기업에 대한 능동적 모니터링은 다음에 대한 조기 경보를 제공한다: (a) 규제 기관이 움직이기 시작할 경우 익스포저가 있는 ETF의 숏 변동성, (b) 집행 후 한 기업이 철수할 경우 용량 기회.
- LTP 영향 분석을 실사(due diligence)로 사용. SEBI의 방법은 이제 규제 도구 키트의 일부다. 2025년 7월 이후의 모든 자산 할당자는 DDQ에서 LTP 영향 메트릭스를 요구해야 한다. 당신의 펀드가 시장 조성을 운영한다면 - 지금 내부적으로 이 모니터링을 구축하라.
- 비대칭 P&L 패턴을 실시간 스크리닝으로 사용. 포트폴리오 귀속의 모든 멀티-레그 전략에 대해, 레그 간 체계적 손실 선도(loss-leader) 패턴을 확인하라. 존재한다면 - 의도와 관계없이 규정 준수 위험이다.
- 인도 옵션을 실행 가능한 구조적 인사이트로 사용. 글로벌 주식 옵션 거래량의 61%가 인도에서 거래된다(2025년 4월 데이터). Jane Street이 철수했다 - 유동성 공백은 Tower, Citadel Securities, Optiver, IMC에 분산되고 있다. 6-18개월 동안 열린 기회의 창, 그 후 SEBI가 참여 상한선을 도입할 가능성이 높다. 실행 가능한 트레이드: 인도에서 용량 구축, 다각화 없이 인도 수익이 과도한 기업의 숏 포지션.
- JSI/JSI2/싱가포르/홍콩을 규제 차익거래 템플릿으로 사용. 이 구조는 적어도 12개 이상의 외국 HFT 기업에 의해 사용되었다. SEBI는 선례를 만들고 있다. 익스포저가 있는(직접 또는 ETF를 통해) 외국 HFT에 대해, DTAA 라우팅을 위한 공개 서류를 확인하라. 존재한다면 - 규제 위험 프리미엄을 상향 조정하라.
각각은 미래 지향적 스크리닝 기준으로 변환된 역사적 패턴다. (a) 레버리지 옵션 구조, (b) 공격적인 LTP 영향 행동, (c) 비대칭 PnL 지문, (d) 구조적으로 왜곡된 시장의 기회, (e) 규제 차익거래 아키텍처를 식별하는 방법론 - 오늘의 8-K, 13D, ADV에 적용 가능한 실시간 도구.
파트 8. 리포지토리에 있는 것
각 기법이 원샷 모드에서 작동한다면, 규제 기관 RSS 피드, USPTO 특허 양도, 법원 서류 API를 통한 지속적 모니터링으로 전환하는 것을 막을 수 있는 것은 없다. 더 나아가 - 분석된 사례에서 반복되는 구조적 패턴을 추출하고 다른 펀드와 매칭한다. 아키텍처적으로, 동일한 코드베이스다. 세 개의 커밋:
커밋 1: 플랫폼. \src/reverse_quant/techniques/\의 여섯 가지 기법. CachedCorpus. 재시도 및 비용 추적 기능이 있는 Anthropic 클라이언트 래퍼. 13F 및 ADV용 EDGAR 페처. 노트북 01: SEBI 문서에 대한 종단 간 분석 - 이 글의 분석, $4-8에 실행 가능.
커밋 2: 모니터링 레이어. \monitors/\ - EDGAR RSS 폴러(작동 중), USPTO/PACER/규제 기관 보도 자료 스텁. \pipelines/\ - 분류/강화/중복 제거/오케스트레이터. \alerts/\ - stdout/파일 작동 중, Slack/이메일 스텁. 전체 출처 스키마가 포함된 SQLite 저장소. 노트북 04는 검증이 환각 주장을 어떻게 잡아내는지 보여준다.
커밋 3: 패턴 전파. \patterns/\ - 추출/라이브러리/매칭/예측. Jane Street 사례의 세 가지 시드 패턴, 수동 큐레이션, \reviewed_by_human=True\ 표시. 코드의 투명한 신뢰도 공식. 모든 예측에 대한 필수 적대적 분석 및 반증 기준. 노트북 05-06.
스택: Python 3.11+, 타입 힌트, ruff/mypy 클린, 모의 LLM 클라이언트를 사용한 테스트, SQLAlchemy, Pydantic v2. MIT 라이선스.
\data/README.md\의 링크를 통해 SEBI 명령을 다운로드하라; 실행 비용은 대략 $4-8이다.
최고의 LLM으로도 얻을 수 없는 것
- SEBI 주장의 직접 검증을 위한 틱 데이터는 공개적으로 이용할 수 없음
- Jane Street의 내부 규정 준수 로그는 없음 - 당신은 회사가 실시간으로 무엇을 보았는지 알 수 없음
- 의도 - LLM은 조작과 시장 조성을 구분할 수 없으며, 발견 절차가 필요함
- 숫자 검증 - Claude는 10번 중 적어도 한 번은 crore를 백만 달러와 혼동했다. 모든 숫자는 수동으로 검증되어야 함
- 다음에 일어날 일 - 최종 명령은 무죄, 유죄 선고 또는 부분 확인이 될 수 있음
마무리
규제 기관의 문서는 펀드가 공개 영역에 남기는 가장 정보 밀도가 높은 산출물이다. 전략을 드러내기 때문이 아니라(13F보다 덜 드러낸다), 펀드나 그 마케팅 부서가 작성하지 않은 유일한 문서이기 때문이다. SEC, SEBI, FCA - 이 기관들은 소환권을 가지고 있으며, 대중이 아닌 법원을 위해 글을 쓴다.
2020년에, 평균 헤지 펀드의 구조를 해독하는 데는 50,000-100,000달러와 선임 애널리스트의 2-3개월 시간이 들었다. 2026년에는 - 50-100달러와 하루 저녁. 펀드들이 자신의 공개적 발자취가 이런 식으로 분석되고 있음을 인지하고 더 주의 깊게 통제하기 시작할 것이며, 이는 게임의 다음 라운드를 만들어낼 새로운 균형이다.
펀드나 할당자에서 일하며 내부 사용에 관심이 있다면 - 비공개 컨설팅이 가능하다.





