7.3 倍的杠杆比率比所有关于 Jane Street 的新闻文章加起来都更有说服力。揭晓这个数据的方法论,以及一个可复现该研究的开源仓库。
2024 年,Bill Hwang 亏掉了 200 亿美元,而行业是从新闻中才知道这件事的。不是从 13F 文件里,也不是 13D 或 Form SHO。Archegos 从未提交过 13F 文件——它在 ViacomCBS、Discovery、腾讯音乐的头寸都是通过总收益互换构建的,而监管框架并不将其视为"持股"。这就是法律的灰色地带所能掩盖的极限。
在解码 Jane Street 之前——SEBI 发布了 105 页 Jane Street 非常希望保密的材料——我们需要就公共数据中什么是可见的、什么是不可见的达成一致。否则,任何 LLM 流程都会为你构建一个文笔优美的幻觉。
这篇文章是关于 Jane Street 与 SEBI 的案例,以及用一个晚上的时间而非资深分析师一周的时间来解码该案例的方法论。该方法论已实现为一个开源仓库,包含六项技术、一个监控层和模式传播。链接在文末。
第一部分:13F 文件和公开文件不显示的内容
如果你的分析师仍然认为 13F 文件是投资组合的快照,那就直接开掉分析师。13F 文件是一个经过过滤和延迟的投资组合投影:
- 仅限多头头寸,且只包含 Section 13(f) 证券。没有空头头寸。没有掉期合约。没有固定收益产品。期权仅按名义价值报告——没有行权价,没有方向
- 存在 45 天延迟。当你看到第三季度的持仓时,基金可能已经进入第四季度
- 机密处理请求。伯克希尔公司通常会隐藏 3-12 个月的建仓过程;Agarwal 等人在《金融学刊》上的实证研究表明,机密持仓产生的阿尔法收益系统地高于披露的头寸
- 窗口粉饰。在季度末转向"体面"的持仓——这在学术上有充分证明,但在 13F 文件中固有地不可见
- Form SHO(这可以填补部分空头漏洞)被推迟到 2028 年 2 月
任何方法论都必须从明确列出哪些信息在结构上无法提取开始。否则,你建立的只是基金公共面具的模型,而不是基金本身。
好消息是:这个面具必须保持一致。为了隐藏策略,基金每个季度都需要采取成本高昂的行动——机密处理请求、掉期重组、跨司法管辖区的分配。这些行为会留下二阶痕迹:Form ADV 文件中年与年之间的语言变化、LinkedIn 上的招聘模式、USPTO 的专利申请、员工的学术出版物、其他司法管辖区的监管文件。
LLM 并没有发现新的信息来源。信息来源是一样的。变化的是交叉引用的成本。将一个 USPTO 专利与同一作者的一篇学术论文联系起来,而该作者一年前曾在一次会议上发言,该会议还有一位该基金的前雇员参加——这过去是资深分析师一整天的工作量。现在用 Claude 加提示缓存:只需 2 美元的 API 费用和 15 分钟。
在 Opus 4.7 上,缓存读取成本为每百万 token 0.50 美元,而非 5 美元。将 105 页的 PDF 一次性加载到缓存中,然后以每次几美分的成本运行数百个提示。工作流程从"一次昂贵的分析"转变为"一千个廉价的问题"。
第二部分:Jane Street 与 SEBI
时间线:
- 2024 年 4 月:Citadel 在纽约起诉 Jane Street,指控其两名前雇员盗用商业秘密。起诉书中提到了印度期权策略——这引起了 SEBI 的注意
- 2025 年 2 月:NSE 向 Jane Street 发出明确警告
- 2025 年 7 月 3 日:SEBI 发布其 105 页的单方临时命令,冻结 4,843 亿卢比(5.65 亿美元)
- 2025 年 7 月 21 日:在存入托管资金后解冻
- 2025 年 9 月:证券上诉法庭暂停个人听证会,要求 SEBI 披露更多文件
- 2026 年 1 月:调查扩大至 Sensex 及其他策略。尚未发布最终命令
SEBI 认为 Jane Street 在 2023 年 1 月至 2025 年 3 月期间从印度期权中获得的利润为:43,289 亿卢比(约 50 亿美元)。被冻结的 5.65 亿美元仅是特定交易日的"非法收益"。
Jane Street 的辩护是:"基本的指数套利,零售需求促进作用。" 在衍生品领域,做市与操纵之间的界限确实非常模糊。但是,在 NSE 发出明确警告之后,仍然存在 18 个模式几乎完全相同的到期日——这使得辩护更加困难。
接下来:如何自己从公开文件中得出相同的结论。
第三部分:六项技术
大多数面向金融的 LLM 教程都说"加载 PDF,要求总结"。这是对上下文的浪费。
3.1. 对抗性假设检验
基本的错误——要求 LLM "解释这个策略"。你会得到一个经过修饰的叙述,其中 Claude 使用了你的引导性问题作为轨道。
正确的模式是反向的。你提出假设;Claude 扮演对抗性审查者的角色:
LLM 擅长做校对者,不擅长做证明生成者。让它们处于"找我想法中的漏洞"模式,而不是"替我想"模式。
3.2. 竞争性假设集成
如果你的正确假设不是你想的那个呢?并行运行多个 Claude 实例,每个实例使用不同的解释框架:"这是操纵","这是合法的做市","这是别的东西"。一个元提示会比较三个输出,并找出分歧点。当所有三个框架在相同事实下得出不同结论时——就说明数据不足。诊断你自己的未知领域,这在研究中的价值超过任何单一答案。
3.3. 时间差分
同一家公司在不同年份的同一类文件(Form ADV 是最具生产力的目标)。让 Claude 找出语言变化,尤其是在样板文件中。大多数基金每年都会逐字复制 ADV;当风险管理语言发生变化时,这表示合规部门认为旧的措辞不再能保护他们。
最有趣的发现是:旧语言消失的地方。删除的陈述几乎总是意味着它不再成立。
3.4. 跨文档三角验证
一份文档是一个叙述。三份文档是三角验证。来自来源 A(SEBI 命令)的主张,在 B(关于到期日微观结构的学术文献)中得到确认,在 C(Jane Street 内部沟通)中被反驳。Claude 在一次会话中根据置信度分数,对数百个主张运行交集运算。通过所有三项检查的主张——可操作的基本事实。通过 A 但被 B 和 C 反驳的主张——说明监管机构可能过度干预了。
3.5. 提示缓存
一份 105 页的 SEBI 命令大约有 12 万个 token。首次加载并设置 1 小时缓存:约 1.20 美元。随后的每次查询:约 0.06 美元。执行 50 次查询后——总计 4 美元,获得 50 个不同的分析剖面。
改变的不是成本,而是工作的结构:从"每个文档问三个问题"变成了"问三百个"。
3.6. 对抗性文档审问
来自 A 方(SEBI 命令)的文档。将其提供给 Claude,并让它扮演 A 方的对手——Jane Street 的辩护团队——构建针对性问题,以削弱特定的事实主张。由此产生的列表是对辩护将如何构建的预测。最终命令可能还要一年,上诉再花两年——但潜在的漏洞地图现在就在你手中。
第四部分:如何击败幻觉
没有这个,上述六项技术就会变成文笔优美的胡言乱语。三条规则,通过 Pydantic 在代码中强制执行:
强制执行溯源链。每个主张都带有完整的证据轨迹:source_url、source_document_hash、source_page、extraction_timestamp、extraction_model、verification_status。如果轨迹不完整——Pydantic 拒绝。
逐字引用验证。来自 LLM 的每个引文都会程序化地与源文档进行字符串匹配。找不到匹配——verification_status="failed",丢弃该主张。
集成投票。每次富集都会使用不同的随机种子运行 N 次(默认 3 次)。获得 2/3 及以上一致性的主张获得高置信度。不一致之处在最终输出中可见。
代码中的置信度公式:
每个权重都有一个必需的 weight_justification 字段。默认方案:结构性标记为 0.4,数值阈值为 0.3,正则表达式模式为 0.2,LLM 语义提取为 0.1(最低,因为最主观)。
对于预测——强制要求 adversarial_analysis 和 falsification_criteria。Pydantic 拒绝空值。
LLM 提示工程只占工作的百分之十。百分之九十是围绕 LLM 的代码,用于捕获和丢弃 LLM 编造的内容。
第五部分:你能信任监管机构吗?
自然的质疑:如果方法论建立在监管文件之上,而监管机构明显存在偏见——信任的基础是什么?
批评的有效性。SEC 与行业之间的旋转门现象有据可查(Mary Jo White、Jay Clayton)。选择性执法是真实存在的——尽管 Markopolos 在 2000 年、2005 年、2007 年都提交了举报报告,但 Madoff 还是 16 年未被抓获。2008 年后,没有一家大型银行的高管受到刑事起诉,而 1980 年代储贷危机后有 1,000 多起定罪。SEC 的执法部门只有 1,300 人,而他们要面对的行业有数百万人。
为什么这与方法论无关。
偏见只朝一个方向起作用。监管机构可能决定不立案。但发布一份 105 页的命令是另一类决定。此时,监管机构面临的风险是夸大其词,而非轻描淡写:对手有资源在法庭上拆解薄弱论点。
SEBI ≠ SEC。SEBI 针对一家美国公司——政治动机是相反的:展示主权,保护国内散户。跨境执法在系统上比国内执法更为严厉。
数字 vs 叙述。SEBI 的命令既有叙述("操纵"、"邪恶阴谋"),也有包含具体数字的事实部分(表 7、8、16、17)。叙述可以被曲解。数字来自交易所记录和经纪商报告,这些是 Jane Street 自己提交到印度监管系统中的。伪造数字对监管机构员工来说是刑事责任。
对抗性验证。Jane Street 正在积极抗争。顶级律师。已提出上诉。他们质疑的是解释("这不是操纵,是套利"),而不是事实("我们没有买入那么多标的物")。如果数字是伪造的,那将是他们在 SAT 的第一论据。对抗性系统正在发挥其作用。
方法论如何利用这一点。按主张类型分离:事实性主张 → 信任(可验证,经过对抗性验证);因果/意图主张 → 与其他来源进行三角验证;法律定性 → 非我们领域,等待最终命令。对抗性文档审问(第三部分第 3.6 节)专门从文档本身获取辩护视角。
监管机构并非中立。但已发布的执法命令经过了对抗性过滤,使其事实性主张比大多数替代来源更可靠。相信数字,而不是叙述。
第六部分:量化机制:2024 年 1 月 17 日的订单簿
"Jane Street 持有每日交易价值的 20% 以上"听起来像是一个铁证——但仅凭这一点什么都证明不了。
BANKNIFTY 是印度 12 家最大银行的指数。指数期权以现金结算,基于成分股最后 30 分钟交易的加权平均值。在那一刻持有大量伽马头寸的做市商需要通过现金和期货来对冲。
做市商的对冲在技术上会影响市场。如果你的期权头寸要求在 30 分钟内卖出 2 亿美元标的物,那么你自己的流量就会产生下行压力。这是物理现象,而非意图。
命令中的数字
SEBI 将 2024 年 1 月 17 日列为最具代表性的日子。第 25-40 页(表 7、8、16、17)的数字:
第七部分:这些技术如今能给你带来什么
我们解码了一份关于 2023-2024 年事件的 2025 年命令——这现在能给你带来什么?如果唯一的输出是对一个过时策略的重建,那么这对记者来说是方法论,对交易员来说不是。
每项技术都是一个模式检测器,运行在当前的数据上。Jane Street 是一个教学案例。五个应用于实时数据的应用场景:
- 杠杆率 7.3 倍作为检测信号。任何通过公开数据(结合 13F + 期权清算公司数据 + 场所成交量报告)可观察到的、运行期权名义价值/标的物头寸比率超过 5 倍的做市商,都是 Jane Street 在 2025 年前的配置。对 20-30 家最大的高频交易公司进行主动监控,可以为以下情况提供早期预警:(a) 做空波动性的 ETF,若监管机构开始行动则面临风险;(b) 若某家公司在执法后退出,则存在容量机会。
- LTP 影响分析作为尽职调查。SEBI 的方法现在已成为监管工具箱的一部分。任何在 2025 年 7 月之后的配置者,都应该在 DDQ 中要求提供 LTP 影响指标。如果你的基金运行做市业务——请立即内部构建此监控。
- 非对称 P&L 模式用于实时筛选。对于你投资组合归因中的每个多腿策略,检查各腿之间是否存在系统性的亏本引流模式。如果存在——无论意图如何,都存在合规风险。
- 印度期权作为一个可操作的结构性洞见。全球股权期权交易量的 61% 在印度进行(2025 年 4 月数据)。Jane Street 退出——流动性真空正被 Tower、Citadel Securities、Optiver、IMC 等公司瓜分。一个 6-18 个月的开放窗口期,之后 SEBI 很可能会引入参与上限。实时交易:在印度建立容量,做空印度收入占比过高且缺乏多元化的公司。
- JSI/JSI2/新加坡/香港作为监管套利模板。至少有十几家外国高频交易公司使用了这种结构。SEBI 正在建立先例。对于你对其有风险敞口(直接或通过 ETF)的任何外国高频交易公司,检查公开文件中是否存在 DTAA 路由。如果存在——向上调整监管风险溢价。
每一个都是将历史模式转化为前瞻性的筛选标准。用于识别 (a) 杠杆期权结构、(b) 激进 LTP 影响行为、(c) 非对称 PnL 特征、(d) 结构性扭曲市场中的机会、(e) 监管套利架构的方法论——实时工具,适用于今天的 8-K、13D、ADV 文件。
第八部分:仓库中的内容
如果每项技术都在一次性模式下有效,那么没有什么能阻止它转化为通过监管机构 RSS 订阅源、USPTO 专利转让、法院文件 API 进行的持续监控。进一步——从已分析的案例中提取重复出现的结构性模式,并将其与其他基金进行匹配。在架构上,相同的代码库。三个提交:
提交 1:平台。src/reverse_quant/techniques/ 中的六项技术。CachedCorpus。包含重试和成本跟踪的 Anthropic 客户端包装器。用于 13F 和 ADV 的 EDGAR 获取器。Notebook 01:在 SEBI 文档上的端到端演示——本文的分析,运行成本 4-8 美元。
提交 2:监控层。monitors/ - EDGAR RSS 轮询器(可用)、USPTO/PACER/监管机构新闻的桩代码。pipelines/ - 分类/富集/去重/编排器。alerts/ - 标准输出/文件(可用)、Slack/电子邮件桩代码。包含完整溯源架构的 SQLite 存储。Notebook 04 演示了验证如何捕获幻觉主张。
提交 3:模式传播。patterns/ - 提取/库/匹配/预测。来自 Jane Street 案例的三个种子模式,经过人工策划,标记为 reviewed_by_human=True。代码中的透明置信度公式。每次预测强制要求对抗性分析和证伪标准。Notebooks 05-06。
技术栈:Python 3.11+,类型提示,通过 ruff/mypy 检查,包含模拟 LLM 客户端的测试,SQLAlchemy,Pydantic v2。MIT 许可。
通过 data/README.md 中的链接下载 SEBI 命令;运行成本约为 4-8 美元。
即使使用最好的 LLM 也无法获得的内容
- 用于直接验证 SEBI 主张的逐笔数据并非公开可用
- Jane Street 的内部合规日志缺失——你不知道该公司的实时所见
- 意图——LLM 无法区分操纵和做市,这需要证据开示
- 数字验证——Claude 每运行十次就至少有一次混淆了"千万"(crore)和"百万美元"。每个数字都需要手动验证
- 接下来会发生什么——最终命令可能无罪释放、谴责或部分确认
结语
监管机构的文件是基金留在公共领域信息密度最高的产物。不是因为它揭示了策略(它揭示的内容比 13F 还少),而是因为它是唯一一份既不是基金自己写的、也不是其营销团队写的文件。SEC、SEBI、FCA——这些人拥有传唤权,他们是为法院而非公众写作。
在 2020 年,解码一个普通对冲基金的结构需要花费 5-10 万美元和资深分析师 2-3 个月的时间。在 2026 年——只需 50-100 美元和一个晚上。一个新的平衡点出现了,那些意识到自己的公开足迹正被如此分析的基金会开始更谨慎地控制它——从而引发游戏的下一个回合。
如果你在某家基金或配置机构工作,并对内部使用感兴趣——可提供封闭式咨询服务。
我的资源
交易平台:https://polymarket.com/?r=zostaff
Telegram 频道:https://t.me/zostaffsmartarc
GitHub:https://github.com/zostaff





