YouMind
登入

反向量化工程:重構對沖基金策略

@zostaff
英語2026年5月25日
523K
422
61
22
982

TL;DR

本文探討了一種利用 LLM 分析監管文件以反向工程對沖基金策略的方法,重點聚焦於 Jane Street 與 SEBI 的案例。文中提供了六種具體技術,並附上一個用於自動化財務分析的開源儲存庫。

7.3 倍的槓桿比率,比 Jane Street 的所有新聞報導加起來都更有說服力。本文將揭露發現此數據的方法論,以及一個可重現此研究的開源儲存庫。

2024 年,Bill Hwang 虧損了 200 億美元,業界是從新聞中得知此事的。不是從 13F 表格,不是從 13D 表格,也不是從 SHO 表格。Archegos 從未提交過 13F 表格——其在 ViacomCBS、Discovery、Tencent Music 的持倉是透過總回報互換進行架構的,而監管框架並不將其視為「持股」。這就是法律所能隱瞞的極限。

在我們解析 Jane Street 之前——印度證券交易委員會 (SEBI) 發布了 105 頁的資料,這些資料是 Jane Street 非常希望保密的——我們必須先釐清,哪些資訊可以從公開數據中獲得,哪些不能。否則,任何 LLM 管線都只會為你構建一個華麗的幻覺。

本文將探討 Jane Street 對抗 SEBI 的案件,以及能夠在一個晚上(而非資深分析師一週的工作時間)內解析此案的完整方法論。此方法論已實現為一個開源儲存庫,包含六種技術、一個監控層和模式傳播機制。連結將在文末提供。

第一部分:13F 表格與公開文件未能揭示的真相

如果你的分析師仍然認為 13F 表格是投資組合的快照,那麼請解僱他。13F 表格只是一個經過過濾、延遲的投資組合投影:

  • 僅包含 Section 13(f) 證券的多頭持倉。沒有空頭、沒有互換、沒有固定收益。選擇權僅以名義價值報告——沒有履約價、沒有方向。
  • 45 天延遲。當你看到第三季的持倉時,該基金可能已經進入了第四季。
  • 保密處理請求。Berkshire 經常將建立中的持倉隱藏 3 到 12 個月;Agarwal 等人在《Journal of Finance》上發表的實證研究顯示,保密持倉能系統性地產生比公開持倉更高的超額報酬 (Alpha)。
  • 窗飾 (Window Dressing)。在季末將資金轉入「體面」的持倉——學術界已有充分記載,但在 13F 表格的結構中是不可見的。
  • SHO 表格(本可補足部分放空漏洞)的實施已推遲至 2028 年 2 月。

任何方法論的起點,都必須明確列出哪些資訊在結構上是無法提取的。否則,你只是在建立該基金公開面具的模型,而非基金本身。

好消息是:這個面具必須前後一致。為了隱藏策略,基金每季都需要付出高昂的代價——保密處理請求、互換重組、跨司法管轄區的配置。這些行為會留下二階痕跡:Form ADV 中年與年之間的語言變化、LinkedIn 上的招聘模式、USPTO 的專利申請、員工的學術發表、來自其他司法管轄區的監管文件。

LLM 並沒有發現新的資訊來源。來源始終相同。改變的是交叉引用的成本。將一份 USPTO 專利與同一作者的一篇學術論文聯繫起來,而該作者一年前曾參加過一場會議,該會議也有該基金的前員工出席——這在過去是資深分析師一整天的工時。現在,使用 Claude 加上提示快取 (Prompt Caching):只需要 2 美元的 API 費用和 15 分鐘。

在 Opus 4.7 上,快取讀取成本為每百萬個 token 0.50 美元,而非 5 美元。將 105 頁的 PDF 載入快取一次,然後以每次幾美分的成本執行數百個提示。工作流程從「一次昂貴的分析」轉變為「一千個廉價的問題」。

第二部分:Jane Street 對抗 SEBI

時間軸:

  • 2024 年 4 月:Citadel 在紐約起訴 Jane Street,指控其兩名前員工盜用商業機密。訴狀中提及印度選擇權策略——這引起了 SEBI 的警覺。
  • 2025 年 2 月:印度國家證券交易所 (NSE) 向 Jane Street 發出明確的建議書。
  • 2025 年 7 月 3 日:SEBI 發布 105 頁的單方臨時命令,凍結 ₹4,843 千萬盧比(5.65 億美元)。
  • 2025 年 7 月 21 日:在存入保證金後,禁令解除。
  • 2025 年 9 月:證券上訴法庭 (SAT) 暫停個人聽證會,要求 SEBI 披露更多文件。
  • 2026 年 1 月:調查擴大到 Sensex 及其他策略。尚未公布最終命令。

SEBI 認定 Jane Street 在 2023 年 1 月至 2025 年 3 月期間,從印度選擇權中獲得的利潤為:₹43,289 千萬盧比(約 50 億美元)。被凍結的 5.65 億美元僅是特定交易日的「非法所得」。

Jane Street 的辯護理由:「基本的指數套利,零售需求撮合。」在做市商與操縱之間的界線,在衍生性商品領域確實很模糊。但在 NSE 發出明確建議書後,仍有 18 個到期日呈現幾乎相同的模式——這使得辯護更加困難。

接下來:如何僅憑公開文件自行得出相同結論。

第三部分:六種技術

大多數的「LLM 應用於金融」教學只會說:「載入 PDF,要求摘要。」這是浪費上下文。

3.1. 敵意假設檢定

最基本的錯誤——要求 LLM「解釋該策略」。你會得到一個精美的敘述,其中 Claude 只是順著你的引導性問題走。

正確的模式是反向操作。你提出假設;Claude 扮演敵意審查者的角色:

LLM 擅長擔任校稿者,但不擅長擔任證明產生器。使用它們時,應處於「找出我思考中的漏洞」模式,而非「為我思考」模式。

3.2. 競爭假設集成

如果正確的假設並非你所提出的那個呢?同時運行多個 Claude 實例,並賦予它們不同的解釋框架:「這是操縱」、「這是合法的做市」、「這是其他東西」。然後用一個元提示 (Meta-prompt) 來比較這三個輸出,並找出分歧點。當三個框架都聚焦於相同的事實,但得出不同的結論時——這就表示數據不足。診斷出你自己的未知領域,在研究中這比任何單一答案更有價值。

3.3. 時間差異分析

比較同一家公司在不同年份提交的相同文件類型(Form ADV 是最有成效的目標)。要求 Claude 找出語言的變化,尤其是在樣板文字中。大多數基金每年都逐字複製 ADV;當風險管理語言發生變化時,這表示法務部門認為舊的措辭不再能保護他們。

最有趣的發現是:舊的語言消失了。一個被刪除的陳述,幾乎總是意味著它已不再屬實。

3.4. 跨文件三角驗證

一份文件是一個敘事。三份文件則是三角驗證。來自來源 A(SEBI 命令)的主張,在來源 B(關於到期日微型結構的學術文獻)中得到確認,但在來源 C(Jane Street 內部通訊)中出現矛盾。Claude 在一次會話中,針對數百個主張運行交叉比對,並給出信心分數。通過所有三項檢查的主張——即為運作中的基本事實。通過 A 檢查但被 B 和 C 反駁的主張——則顯示監管機關可能越界了。

3.5. 提示快取

一份 105 頁的 SEBI 命令約有 12 萬個 token。第一次載入並設定 1 小時快取:約 1.20 美元。之後每次查詢:約 0.06 美元。在 50 次查詢後——花費 4 美元,卻能得到 50 個不同的分析角度。

改變的不僅僅是成本,更是工作的結構:從「每份文件問三個問題」變成「問三百個問題」。

3.6. 對抗性文件審訊

取得 A 方(SEBI 命令)的文件。將其輸入 Claude,並要求它扮演 A 方的對手——Jane Street 的辯護團隊——然後建構有針對性的問題,用來削弱特定的具體事實主張。由此產生的列表,就是對辯護方未來策略結構的預測。最終命令可能還要一年才會出爐,上訴則需要再等兩年——但潛在弱點的地圖,你今天就能掌握在手中。

第四部分:如何擊敗幻覺

如果沒有這部分,前面六種技術就會變成華麗的廢話。以下是三條規則,透過 Pydantic 在程式碼中強制執行:

強制溯源鏈。 每個主張都帶有完整的證據軌跡:source_url、source_document_hash、source_page、extraction_timestamp、extraction_model、verification_status。如果證據軌跡不完整——Pydantic 會拒絕接受。

逐字引用驗證。 來自 LLM 的每個引用都會以程式方式與來源文件進行字串比對。如果找不到——verification_status="failed",該主張被丟棄。

集成投票。 每次增強分析 (enrichment) 都會使用不同的隨機種子執行 N 次(預設為 3 次)。獲得 2/3 以上一致性的主張,具有高信心水準。不一致的部分則會在最終輸出中顯示。

程式碼中的信心水準公式:

每個權重都有一個必填的 weight_justification 欄位。預設方案:結構性標記為 0.4,數值門檻為 0.3,正則表達式模式為 0.2,LLM 語意萃取為 0.1(最低,因為最主觀)。

對於預測——強制要求提供 adversarial_analysis 和 falsification_criteria。Pydantic 會拒絕空值。

LLM 提示工程僅佔全部工作的百分之十。其餘百分之九十,是圍繞著 LLM 的程式碼,用來捕捉並丟棄 LLM 編造出來的內容。

第五部分:你能信任監管機關嗎?

很自然的反對意見:如果這個方法論是建立在監管文件之上,而監管機關顯然又有偏見——那麼信任從何而來?

批評的有效性。 SEC 與業界之間的旋轉門現象有據可查(Mary Jo White、Jay Clayton)。選擇性執法是真實存在的——Madoff 在 Markopolos 於 2000、2005、2007 年提出吹哨者報告後,仍逍遙法外長達 16 年。2008 年之後,大型銀行的頂級高層無一人受到刑事起訴,相較之下,1980 年代儲貸危機後有超過 1000 人被定罪。SEC 的執法部門只有 1300 人,面對的卻是數百萬從業人員的產業。

為何這與本方法論無關?

偏見是單向的。監管機關可能選擇不提起訴訟。但發布一份 105 頁的命令,是另一種層級的決策。此時,監管機關的風險在於「過度陳述」,而非「陳述不足」:因為對手擁有資源,可以在法庭上拆解薄弱的主張。

SEBI 與 SEC 不同。當 SEBI 對抗一家美國公司時——政治情勢是相反的:展現主權,捍衛國內散戶。跨司法管轄區的執法,在系統上比國內執法更為嚴厲。

數字 vs. 敘事。 SEBI 的命令包含敘事部分(「操縱」、「邪惡計畫」)和一個事實部分,其中包含具體數字(表 7、表 8、表 16、表 17)。敘事可以被扭曲。但數字來自交易所記錄和經紀商報告,而這些是 Jane Street 自己提交到印度監管系統的。偽造數字將使監管機關員工承擔刑事責任。

對抗性驗證。 Jane Street 正在積極抗辯。他們擁有頂尖律師。已提出上訴。他們爭辯的是「解釋」(「這不是操縱,這是套利」),而不是「事實」(「我們沒有買那麼多的現股」)。如果數字是捏造的,這會是他們在 SAT 提出的第一個論點。敵對系統正在發揮作用。

方法論如何處理這點。 按主張類型進行分離:

  • 事實性主張 → 信任(可驗證,經對抗性驗證)
  • 因果/意圖主張 → 與其他來源進行三角驗證
  • 法律定性 → 非我們領域,等待最終命令

對抗性文件審訊(第三部分第 6 點)特別從文件中萃取了辯護方的觀點。

監管機關並非中立。但針對已發布的執法命令,它們經歷了對抗性過濾,使其事實主張比大多數其他來源更為穩健。相信數字,而非敘事。

第六部分:量化機制:2024 年 1 月 17 日的訂單簿

「Jane Street 持倉量占每日交易價值的 20% 以上」聽起來像鐵證——但僅此而已,它什麼也無法證明。

BANKNIFTY 是一個由印度 12 家最大銀行組成的指數。指數選擇權是現金結算的,結算價為其成分股在最後 30 分鐘交易中加權平均價格。一個持有大量 Gamma 部位的做市商,在該時刻必須透過現貨和期貨進行避險。

做市商的避險行為在技術上會影響市場。如果你的選擇權部位需要在 30 分鐘內賣出 2 億美元的現貨,你自身的交易流動就會產生下行壓力。這是物理學,不是意圖。

命令中的數字

SEBI 將 2024 年 1 月 17 日記錄為最具代表性的一天。數字來自第 25-40 頁(表 7、表 8、表 16、表 17):

第七部分:這些技術今天能帶給你什麼

我們解析了一份關於 2023-2024 年事件的 2025 年命令——這對你現在有什麼用?如果唯一的產出是重建一個過時的策略,那麼這套方法論只適合作為記者的工具,而非交易員的武器。

每一種技術都是一個模式偵測器,它可以應用於今天的資料。Jane Street 只是一個教學案例。以下是五個應用於即時數據的範例:

  1. 7.3 倍槓桿作為偵測訊號。 任何可透過公開數據(結合 13F + 選擇權結算公司資料 + 交易所成交量報告)觀察到的做市商,如果其選擇權名義價值 / 現貨持倉比率超過 5 倍,就是一個「Jane Street 2025 年前」的配置。對前 20-30 大高頻交易公司進行主動監控,可以為以下情況提供早期預警:(a) 當監管機關開始行動時,ETF 上的空頭波動率風險,(b) 當一家公司在執法後退出市場時所產生的容量機會。
  1. LTP 衝擊分析作為盡職調查工具。 SEBI 的方法現在已成為監管工具箱的一部分。2025 年 7 月之後的任何資產配置者,都應要求在盡職調查問卷 (DDQ) 中提供 LTP 衝擊指標。如果你的基金從事做市業務——請立即在內部建立此監控系統。
  1. 非對稱 P&L 模式用於即時篩選。 對於你投資組合歸因中的每一個多腳策略,檢查其各腳之間是否存在系統性的虧損領頭羊 (Loss-Leader) 模式。如果存在——無論意圖為何,都存在合規風險。
  1. 印度選擇權作為一個可操作的結構性洞察。 全球 61% 的權益類選擇權成交量發生在印度(2025 年 4 月數據)。Jane Street 撤出後——流動性真空正在被 Tower、Citadel Securities、Optiver、IMC 等公司瓜分。這提供了一個 6 到 18 個月的開放窗口,之後 SEBI 很可能會引入參與上限。可行的交易:在印度建立容量,做空那些印度營收占比過高且缺乏多元化的公司。
  1. JSI/JSI2/新加坡/香港作為監管套利模板。 至少十幾家外國高頻交易公司使用過這種結構。SEBI 正在建立先例。對於你持有曝險(直接或透過 ETF)的任何外國高頻交易公司,請檢查其公開文件中是否存在 DTAA(避免雙重課稅協定)路徑。如果存在——請調高其監管風險溢價。

每一項都是一個歷史模式,被轉化為前瞻性的篩選標準。這套方法論可用於識別:(a) 高槓桿選擇權結構、(b) 激進的 LTP 影響行為、(c) 非對稱 PnL 指紋、(d) 結構性扭曲市場中的機會、(e) 監管套利架構——這些都是即時可用的工具,可應用於今天的 8-K、13D、ADV 表格。

第八部分:儲存庫內容

如果每一種技術都能以一次性模式運作,那麼沒有什麼可以阻止將其轉換為持續監控系統,透過監管機關的 RSS 訂閱、USPTO 專利轉讓、法院文件 API 來實現。更進一步——從已分析的案例中提取重複出現的結構性模式,並將其與其他基金進行比對。在架構上,這與同一套程式碼庫。包含三個提交 (Commit):

Commit 1:平台。 六種技術位於 src/reverse_quant/techniques/。CachedCorpus。包含重試和成本追蹤功能的 Anthropic 客戶端包裝器。用於擷取 13F 和 ADV 的 EDGAR 提取器。Notebook 01:針對 SEBI 文件的端到端分析——即本文的分析內容,運行成本約為 4 到 8 美元。

Commit 2:監控層。 monitors/——EDGAR RSS 輪詢器(可使用中),USPTO/PACER/監管機關新聞稿的存根。pipelines/——分類/增強/去重/協調器。alerts/——標準輸出/檔案警示可使用中,Slack/電子郵件存根。使用 SQLite 儲存,包含完整的溯源架構。Notebook 04 展示驗證如何捕捉到幻覺主張。

Commit 3:模式傳播。 patterns/——提取/庫/比對/預測。三個來自 Jane Street 案件的種子模式,經過人工整理,標記為 reviewed_by_human=True。程式碼中包含透明的信心水準公式。對每個預測都強制要求進行對抗性分析和提供證偽標準。Notebooks 05-06。

技術棧: Python 3.11+、型別提示、ruff/mypy 無錯誤、包含使用模擬 LLM 用戶端的測試、SQLAlchemy、Pydantic v2。MIT 授權。

請透過 data/README.md 中的連結下載 SEBI 命令;運行成本約為 4 到 8 美元。

即使使用最好的 LLM 也無法獲得的事物

  • 用於直接驗證 SEBI 主張的逐筆交易 (Tick) 數據並不公開
  • 缺少 Jane Street 的內部合規日誌——你無從得知該公司即時看到了什麼
  • 意圖——LLM 無法區分操縱與做市,這需要發現程序 (Discovery) 來確定
  • 數字驗證——Claude 在每十次運行中,至少會有一次混淆「crore(千萬)」與「百萬美元」。每個數字都需手動驗證
  • 接下來會發生什麼——最終命令可能完全免責、定罪或部分確認

結論

一份監管文件,是一家基金遺留在公眾視野中資訊密度最高的文件。這不是因為它揭露了策略(它揭露的比 13F 表格還少),而是因為它是唯一一份既非由基金自己撰寫、也非由其市場部門撰寫的文件。SEC、SEBI、FCA——這些機構擁有傳票權力,並且他們是為法院寫作,而非為公眾。

在 2020 年,解析一家普通避險基金的結構需要花費 5 萬到 10 萬美元,以及資深分析師 2 到 3 個月的時間。到了 2026 年——只需要 50 到 100 美元和一個晚上。這是一個新的平衡,而那些意識到其公開足跡正被如此分析的基金,將開始更謹慎地控制它——從而開啟遊戲的下一輪。

如果你在基金或資產配置機構工作,且對內部使用感興趣——我們提供封閉式顧問服務。

我的資源

在此交易: https://polymarket.com/?r=zostaff

Telegram 頻道: https://t.me/zostaffsmartarc

GitHub: https://github.com/zostaff

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章