YouMind
Iniciar sessão

Engenharia Reversa Quantitativa: Reconstruindo Estratégias de Hedge Funds

@zostaff
INGLÊS25/05/2026
523K
422
61
22
982

TL;DR

Este artigo explora uma metodologia para realizar engenharia reversa em estratégias de hedge funds utilizando LLMs para analisar registros regulatórios, com foco no caso Jane Street vs. SEBI. Ele fornece seis técnicas específicas e um repositório de código aberto para análise financeira automatizada.

Uma alavancagem de 7,3x diz mais do que todas as matérias sobre a Jane Street juntas. A metodologia que a revelou, e um repositório aberto para reproduzir o trabalho.

Em 2024, Bill Hwang perdeu US$ 20 bilhões, e o setor ficou sabendo pela imprensa. Não por uma 13F. Não por uma 13D. Não pelo Form SHO. A Archegos nunca protocolou uma 13F — suas posições em ViacomCBS, Discovery, Tencent Music foram estruturadas por meio de total return swaps, que o arcabouço regulatório não trata como "participações". Esse é o teto do que pode ser escondido dentro da lei.

Antes de decodificar a Jane Street — onde a SEBI divulgou 105 páginas de material que a Jane Street preferiria manter em sigilo — precisamos concordar sobre o que é visível e invisível nos dados públicos. Caso contrário, qualquer pipeline de LLM vai te construir uma alucinação lindamente escrita.

Este artigo trata do caso Jane Street vs SEBI e da metodologia que o decodificou em uma noite, em vez de uma semana de analista sênior. Metodologia implementada como um repositório aberto com seis técnicas, uma camada de monitoramento e propagação de padrões. Link no final.

Parte 1. O que as 13Fs e os documentos públicos não mostram

Se seu analista ainda acha que uma 13F é um instantâneo do portfólio, demita o analista. Uma 13F é uma projeção filtrada e defasada de um portfólio:

  • Apenas posições compradas, em títulos da Seção 13(f). Sem vendas a descoberto. Sem swaps. Sem renda fixa. Opções reportadas apenas pelo valor nocional — sem strikes, sem direção
  • Defasagem de 45 dias. Quando você vê as participações do 3º trimestre, o fundo já pode estar no 4º
  • Pedidos de tratamento confidencial. A Berkshire rotineiramente esconde posições em construção por 3 a 12 meses; Agarwal et al. no \Journal of Finance\ mostraram empiricamente que participações confidenciais geram alfa sistematicamente maior do que as divulgadas
  • Maquiagem de carteira. Rotacionar para posições "respeitáveis" perto do fim do trimestre — bem documentado academicamente, invisível por construção nas 13Fs
  • Form SHO (que fecharia parte da brecha das vendas a descoberto) adiado para fevereiro de 2028

Qualquer metodologia começa com uma lista explícita do que é estruturalmente impossível de extrair. Caso contrário, você está construindo um modelo da máscara pública do fundo, não do fundo.

A boa notícia: a máscara precisa ser consistente. Para esconder uma estratégia, um fundo precisa de ações custosas a cada trimestre — pedidos de tratamento confidencial, reestruturação de swaps, alocações entre jurisdições. Isso deixa rastros de segunda ordem: mudanças de linguagem no Form ADV entre anos, padrões de contratação no LinkedIn, pedidos de patente no USPTO, publicações acadêmicas de funcionários, documentos regulatórios de outras jurisdições.

LLMs não encontram novas fontes. As fontes são as mesmas. O que muda é o custo da referência cruzada. Conectar uma patente do USPTO a um artigo acadêmico do mesmo autor, que um ano antes falou em uma conferência também frequentada por um ex-funcionário do fundo — isso costumava ser um dia inteiro de trabalho de um analista sênior. Com Claude mais cache de prompt: US$ 2 em créditos de API e 15 minutos.

No Opus 4.7, leituras de cache custam US$ 0,50 por milhão de tokens em vez de US$ 5. Carregue o PDF de 105 páginas no cache uma vez e depois execute centenas de prompts a centavos cada. O fluxo de trabalho muda de "uma análise cara" para "mil perguntas baratas."

Parte 2. Jane Street vs SEBI

Linha do tempo:

  • Abril de 2024: A Citadel processa a Jane Street em NY por apropriação indevida de segredo comercial por dois ex-funcionários. A queixa menciona estratégias de opções na Índia — o que alertou a SEBI
  • Fevereiro de 2025: A NSE emite um aviso explícito para a Jane Street
  • 3 de julho de 2025: A SEBI publica sua ordem interim ex-parte de 105 páginas, congela ₹4.843 crore (US$ 565 milhões)
  • 21 de julho de 2025: suspensão da proibição após depósito em garantia
  • Setembro de 2025: O Tribunal de Apelação de Valores Mobiliários suspende audiências pessoais, exige que a SEBI divulgue mais documentos
  • Janeiro de 2026: investigação se expande para Sensex e outras estratégias. Nenhuma ordem final ainda

Lucro que a SEBI atribui à Jane Street entre janeiro de 2023 e março de 2025 em opções indianas: ₹43.289 crore (~US$ 5 bilhões). Os US$ 565 milhões congelados são apenas "ganhos ilícitos" de dias de negociação específicos.

Defesa da Jane Street: "arbitragem básica de índice, facilitação da demanda de varejo." A linha entre formação de mercado e manipulação em derivativos é realmente tênue. Mas 18 dias de vencimento com um padrão quase idêntico, persistindo após o aviso explícito da NSE — uma defesa mais difícil.

O que vem a seguir: como chegar às mesmas conclusões por conta própria a partir de documentos públicos.

Parte 3. Seis técnicas

A maioria dos tutoriais de LLM para finanças diz "carregue o PDF, peça um resumo." Contexto desperdiçado.

3.1. Teste de hipótese adversarial

O erro básico — pedir ao LLM para "explicar a estratégia." Você obtém uma narrativa polida na qual o Claude usou suas perguntas direcionadoras como trilhos.

O padrão correto é invertido. Você formula a hipótese; Claude assume o papel de revisor adversarial:

LLMs são bons como revisores, ruins como geradores de prova. Use-os no modo "encontre falhas no meu pensamento", não no modo "pense por mim."

3.2. Conjunto de hipóteses concorrentes

E se a hipótese certa não for a que você formulou? Execute várias instâncias do Claude em paralelo com diferentes quadros interpretativos: "isso é manipulação," "isso é formação de mercado legítima," "isso é outra coisa." Um meta-prompt compara os três resultados e identifica pontos de divergência. Onde todos os três quadros convergem para os mesmos fatos, mas chegam a conclusões diferentes — é aí que os dados são insuficientes. Diagnosticar suas próprias incógnitas, o que em pesquisa vale mais do que qualquer resposta única.

3.3. Diferenciação temporal

Mesmo tipo de documento (Form ADV é o alvo mais produtivo) da mesma empresa em anos diferentes. Peça ao Claude para encontrar mudanças de linguagem, especialmente em texto padrão ("boilerplate"). A maioria dos fundos copia o ADV textualmente ano após ano; quando algo muda na linguagem de gerenciamento de risco, é sinal de que o compliance decidiu que a redação antiga não os protegia mais.

As descobertas mais interessantes: onde a linguagem antiga desaparece. Uma declaração removida quase sempre significa que não é mais verdadeira.

3.4. Triangulação entre documentos

Um documento é uma narrativa. Três documentos são triangulação. Alegação da fonte A (ordem da SEBI), confirmação em B (literatura acadêmica sobre microestrutura em dias de vencimento), contradição em C (comunicações internas da Jane Street). Claude executa a interseção contra cem alegações em uma sessão com pontuações de confiança. Alegações que passam nas três verificações — verdade operacional. Alegações que passam em A e são contraditas por B e C — onde o regulador exagerou.

3.5. Cache de prompt

Uma ordem da SEBI de 105 páginas tem ~120 mil tokens. Primeiro carregamento com cache de 1 hora: ~US$ 1,20. Cada consulta subsequente: ~US$ 0,06. Após 50 consultas — US$ 4 e 50 diferentes seções transversais analíticas.

O que muda não é o custo, é a estrutura do trabalho: de "três perguntas por documento" para "trezentas."

3.6. Interrogatório adversarial de documentos

Documento da parte A (ordem da SEBI). Alimente-o ao Claude e peça que ele interprete o adversário de A — a equipe de defesa da Jane Street — e construa perguntas direcionadas que minariam alegações factuais específicas. A lista resultante é uma previsão de como a defesa será estruturada. A ordem final pode estar a um ano de distância, apelações mais dois — mas o mapa das vulnerabilidades potenciais está em suas mãos hoje.

Parte 4. Como derrotar alucinações

Sem isso, as seis técnicas se tornam besteira lindamente escrita. Três regras, aplicadas em código via Pydantic:

Cadeia de proveniência aplicada. Cada alegação carrega um rastro de evidência completo: \source_url\, \source_document_hash\, \source_page\, \extraction_timestamp\, \extraction_model\, \verification_status\. Sem um rastro completo — o Pydantic rejeita.

Verificação de citação textual. Cada citação do LLM é comparada programaticamente por string com o documento fonte. Não encontrada — \verification_status="failed"\, alegação descartada.

Votação em conjunto. Cada enriquecimento é executado N vezes com sementes diferentes (padrão 3). Alegações com concordância de 2/3+ recebem alta confiança. A discordância é visível no resultado final.

A fórmula de confiança no código:

Cada peso tem um campo obrigatório \weight_justification\. Esquema padrão: 0,4 para marcadores estruturais, 0,3 para limites numéricos, 0,2 para padrões regex, 0,1 para extração semântica por LLM (o menor, porque é mais subjetivo).

Em previsões — \adversarial_analysis\ e \falsification_criteria\ obrigatórios. O Pydantic rejeita valores vazios.

Engenharia de prompt de LLM é dez por cento do trabalho. Noventa por cento é o código em torno do LLM que captura e descarta o que o LLM inventou.

Parte 5. Você pode confiar nos reguladores

Objeção natural: se a metodologia é construída sobre documentos regulatórios, e os reguladores são comprovadamente tendenciosos — o que sustenta a confiança?

Validade da crítica. A porta giratória entre a SEC e o setor é documentada (Mary Jo White, Jay Clayton). A aplicação seletiva é real — Madoff não foi pego por 16 anos apesar dos relatórios de denúncia de Markopolos em 2000, 2005, 2007. Após 2008, zero altos executivos de grandes bancos receberam processos criminais, contra mais de 1.000 condenações após a crise da poupança e empréstimo dos anos 1980. A divisão de aplicação da SEC tem 1.300 pessoas contra um setor de milhões.

Por que isso não é relevante para a metodologia.

O viés funciona em uma direção. Um regulador pode se recusar a abrir um caso. Mas publicar uma ordem de 105 páginas é uma categoria diferente de decisão. Nesse ponto, o risco do regulador é exagerar, não minimizar: o oponente tem os recursos para desmontar argumentos fracos no tribunal.

SEBI ≠ SEC. A SEBI contra uma empresa dos EUA — a política é invertida: demonstrar soberania, defender o varejo doméstico. A aplicação entre jurisdições é sistematicamente mais severa do que a doméstica.

Números vs narrativa. A ordem da SEBI tem narrativa ("manipulação," "esquema sinistro") e uma seção factual com números específicos (Tabelas 7, 8, 16, 17). A narrativa pode ser distorcida. Os números vêm de registros de bolsa e relatórios de corretoras que a própria Jane Street submeteu aos sistemas regulatórios indianos. Falsificar números é responsabilidade criminal para funcionários do regulador.

Validação adversarial. A Jane Street está lutando ativamente. Advogados de primeira linha. Protocolou um recurso. Eles contestam a interpretação ("isso não é manipulação, é arbitragem"), não os fatos ("não compramos tanto do subjacente"). Se os números fossem fabricados, esse seria seu primeiro argumento no SAT. O sistema adversarial está fazendo seu trabalho.

O que a metodologia faz com isso. Separação por tipo de alegação: alegações factuais → confiar (verificáveis, validadas adversarialmente); alegações causais/de intenção → triangular contra outras fontes; caracterizações legais → não é nosso domínio, esperar pela ordem final. O interrogatório adversarial de documentos (Parte 3.6) especificamente extrai a perspectiva da defesa do próprio documento.

Reguladores não são neutros. Mas as ordens de aplicação publicadas passam por um filtro adversarial que torna suas alegações factuais mais robustas do que a maioria das fontes alternativas. Confie nos números, não na narrativa.

Parte 6. Mecânica quant: o livro de ofertas em 17 de janeiro de 2024

"A Jane Street detinha 20%+ do valor diário negociado" parece uma prova cabal — por si só, não prova nada.

BANKNIFTY é um índice dos 12 maiores bancos indianos. Opções de índice são liquidadas em dinheiro contra a média ponderada dos últimos 30 minutos de negociação dos componentes. Um formador de mercado com uma grande posição gama naquele momento é obrigado a fazer hedge através de dinheiro e futuros.

O hedge de um formador de mercado tecnicamente movimenta o mercado. Se sua posição em opções exige vender US$ 200 milhões do subjacente em 30 minutos, seu próprio fluxo cria pressão de baixa. Isso é física, não intenção.

Números da ordem

A SEBI documenta 17 de janeiro de 2024 como o dia mais ilustrativo. Números das páginas 25-40 (Tabelas 7, 8, 16, 17):

Parte 7. O que essas técnicas te proporcionam hoje

Decodificamos uma ordem de 2025 sobre eventos de 2023-2024 — o que isso te proporciona agora? Se o único resultado fosse uma reconstrução de uma estratégia obsoleta, isso seria metodologia para jornalistas, não para traders.

Cada técnica é um detector de padrões que é executado em dados atuais. A Jane Street é um caso de ensino. Cinco aplicações em dados ao vivo:

  1. Alavancagem 7,3x como assinatura de detector. Qualquer formador de mercado observável através de dados públicos (13F combinada + dados da Options Clearing Corp + relatórios de volume da bolsa) executando índices de nocional de opções / posição subjacente acima de 5x é uma configuração pré-2025 da Jane Street. Monitoramento ativo entre as 20-30 maiores empresas de HFT fornece alerta precoce para: (a) volatilidade vendida em ETFs com exposição se um regulador começar a agir, (b) oportunidades de capacidade se uma empresa sair após a repressão.
  1. Análise de impacto no LTP como due diligence. O método da SEBI agora faz parte do kit de ferramentas regulatório. Qualquer alocador após julho de 2025 deve estar pedindo métricas de impacto no LTP no DDQ. Se seu fundo opera formação de mercado — construa esse monitoramento internamente agora.
  1. Padrão de P&L assimétrico para triagem em tempo real. Para cada estratégia de múltiplas pernas em sua atribuição de portfólio, verifique se há padrões sistemáticos de perda-líder entre as pernas. Se existirem — risco de conformidade independentemente da intenção.
  1. Opções indianas como um insight estrutural acionável. 61% do volume global de opções de ações é negociado na Índia (dados de abril de 2025). A Jane Street se retirou — o vácuo de liquidez está sendo distribuído entre Tower, Citadel Securities, Optiver, IMC. Uma janela aberta por 6 a 18 meses, após a qual a SEBI provavelmente introduzirá limites de participação. Negociações ao vivo: construção de capacidade na Índia, posições vendidas em empresas com receita indiana desproporcional sem diversificação.
  1. JSI/JSI2/Cingapura/Hong Kong como modelo de arbitragem regulatória. Essa estrutura foi usada por pelo menos uma dúzia de empresas estrangeiras de HFT. A SEBI está estabelecendo precedente. Para qualquer HFT estrangeira à qual você tenha exposição (direta ou via ETF), verifique os registros públicos quanto ao roteamento DTAA. Se presente — ajuste o prêmio de risco regulatório para cima.

Cada um é um padrão histórico convertido em um critério de triagem prospectivo. A metodologia para identificar (a) estruturas de opções alavancadas, (b) comportamento agressivo de impacto no LTP, (c) impressões digitais de PnL assimétricas, (d) oportunidades em mercados estruturalmente distorcidos, (e) arquiteturas de arbitragem regulatória — ferramentas ao vivo, aplicáveis a 8-Ks, 13Ds, ADVs de hoje.

Parte 8. O que está no repositório

Se cada técnica funciona em modo único, nada impede de convertê-la para monitoramento contínuo via feeds RSS de reguladores, atribuições de patentes do USPTO, APIs de registros judiciais. E mais adiante — extrair padrões estruturais recorrentes de casos analisados e combiná-los com outros fundos. Arquiteturalmente, a mesma base de código. Três commits:

Commit 1: Plataforma. Seis técnicas em \src/reverse_quant/techniques/\. CachedCorpus. Wrapper do cliente Anthropic com retry e rastreamento de custos. Coletor EDGAR para 13F e ADV. Notebook 01: ponta a ponta no documento da SEBI — a análise deste artigo, executável por US$ 4-8.

Commit 2: Camada de monitoramento. \monitors/\ — coletor RSS EDGAR (funcionando), stubs para USPTO/PACER/imprensa regulatória. \pipelines/\ — triagem/enriquecimento/deduplicação/orquestrador. \alerts/\ — stdout/file funcionando, stubs para Slack/email. Armazenamento SQLite com esquema de proveniência completo. O Notebook 04 mostra como a verificação captura alegações alucinadas.

Commit 3: Propagação de padrões. \patterns/\ — extração/biblioteca/comparação/previsão. Três padrões de semente do caso Jane Street, curados manualmente, marcados \reviewed_by_human=True\. Fórmula de confiança transparente no código. Análise adversarial e critérios de falsificação obrigatórios em toda previsão. Notebooks 05-06.

Stack: Python 3.11+, type hints, ruff/mypy limpo, testes com clientes LLM simulados, SQLAlchemy, Pydantic v2. Licença MIT.

Baixe a ordem da SEBI através do link em \data/README.md\; a execução custa ~US$ 4-8.

O que você não consegue nem com o melhor LLM

  • Dados de tick para verificação direta das alegações da SEBI não estão disponíveis publicamente
  • Registros internos de compliance da Jane Street estão ausentes — você não sabe o que a empresa viu em tempo real
  • Intenção — um LLM não consegue distinguir manipulação de formação de mercado, requer descoberta
  • Verificação numérica — Claude confundiu crore com milhões de dólares pelo menos uma vez a cada dez execuções. Cada número é verificado manualmente
  • O que acontece a seguir — a ordem final pode inocentar, condenar ou confirmar parcialmente

Final

O documento de um regulador é o artefato mais denso em informação que um fundo deixa em público. Não porque revela a estratégia (revela menos que uma 13F), mas porque é o único documento não escrito pelo fundo e não por seu marketing. SEC, SEBI, FCA — essas pessoas têm poder de intimação e escrevem para tribunais, não para o público.

Em 2020, decodificar a estrutura de um hedge fund médio custava US$ 50-100 mil e 2-3 meses de tempo de analista sênior. Em 2026 — US$ 50-100 e uma noite. Um novo equilíbrio, no qual os fundos cientes de que sua pegada pública está sendo analisada dessa forma começarão a controlá-la com mais cuidado — criando a próxima rodada do jogo.

Se você trabalha em um fundo ou alocador interessado em uso interno — consultoria fechada está disponível.

Meus recursos Trading aqui: https://polymarket.com/?r=zostaff Canal do Telegram: https://t.me/zostaffsmartarc GitHub: https://github.com/zostaff

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais