YouMind
Entrar

Engenharia Reversa Quantitativa: Reconstruindo Estratégias de Hedge Funds

@zostaff
INGLÊS25 de mai. de 2026
523K
422
61
22
982

TL;DR

Este artigo explora uma metodologia para realizar engenharia reversa de estratégias de hedge funds usando LLMs para analisar registros regulatórios, com foco no caso Jane Street vs. SEBI. Ele fornece seis técnicas específicas e um repositório de código aberto para análise financeira automatizada.

Um índice de alavancagem de 7,3x diz mais do que todos os artigos de notícias sobre a Jane Street combinados. A metodologia que o revelou e um repositório aberto para reproduzir o trabalho.

Em 2024, Bill Hwang perdeu US$ 20 bilhões, e o setor ficou sabendo pelas notícias. Não por um 13F. Não por um 13D. Não pelo Form SHO. A Archegos nunca protocolou um 13F – suas posições em ViacomCBS, Discovery, Tencent Music foram estruturadas por meio de total return swaps, que o arcabouço regulatório não trata como "participações". Esse é o teto do que pode ser escondido dentro da lei.

Antes de decodificar a Jane Street – onde a SEBI divulgou 105 páginas de material que a Jane Street preferiria manter em sigilo – precisamos concordar sobre o que é visível e invisível nos dados públicos. Caso contrário, qualquer pipeline de LLM construirá para você uma alucinação lindamente escrita.

Este artigo trata do caso Jane Street vs SEBI e da metodologia que o decodificou em uma noite, em vez de uma semana de analista sênior. Metodologia implementada como um repositório aberto com seis técnicas, uma camada de monitoramento e propagação de padrões. Link no final.

Parte 1. O que os 13Fs e documentos públicos não mostram

Se seu analista ainda acha que um 13F é um instantâneo do portfólio, demita o analista. Um 13F é uma projeção filtrada e defasada de um portfólio:

  • Apenas posições compradas, em títulos da Seção 13(f). Sem vendas a descoberto. Sem swaps. Sem renda fixa. Opções reportadas apenas pelo valor nocional – sem strikes, sem direção
  • Defasagem de 45 dias. Quando você vê as participações do 3º trimestre, o fundo já pode estar no 4º
  • Pedidos de tratamento confidencial. A Berkshire rotineiramente esconde posições em construção por 3 a 12 meses; Agarwal et al. no \Journal of Finance\ mostraram empiricamente que participações confidenciais geram alfa sistematicamente maior do que as divulgadas
  • Maquiagem de carteira. Rotação para posições "respeitáveis" próximo ao final do trimestre – bem documentado academicamente, invisível por construção no 13F
  • Form SHO (que fecharia parte da brecha de vendas a descoberto) adiado para fevereiro de 2028

Qualquer metodologia começa com uma lista explícita do que é estruturalmente impossível de extrair. Caso contrário, você está construindo um modelo da máscara pública do fundo, não do fundo.

A boa notícia: a máscara precisa ser consistente. Para esconder uma estratégia, um fundo precisa de ações custosas a cada trimestre – pedidos de tratamento confidencial, reestruturação de swaps, alocações entre jurisdições. Elas deixam vestígios de segunda ordem: mudanças de linguagem no Form ADV entre anos, padrões de contratação no LinkedIn, depósitos de patentes no USPTO, publicações acadêmicas de funcionários, documentos regulatórios de outras jurisdições.

LLMs não encontram novas fontes. As fontes são as mesmas. O que muda é o custo da referência cruzada. Conectar uma patente do USPTO a um artigo acadêmico do mesmo autor, que um ano atrás falou em uma conferência também frequentada por um ex-funcionário do fundo – isso costumava ser um dia inteiro de trabalho de um analista sênior. Com Claude mais cache de prompt: US$ 2 em créditos de API e 15 minutos.

No Opus 4.7, leituras de cache custam US$ 0,50 por milhão de tokens em vez de US$ 5. Carregue o PDF de 105 páginas no cache uma vez e execute centenas de prompts a centavos cada. O fluxo de trabalho muda de "uma análise cara" para "mil perguntas baratas."

Parte 2. Jane Street vs SEBI

Linha do tempo:

  • Abril de 2024: Citadel processa a Jane Street em NY por apropriação indevida de segredos comerciais por dois ex-funcionários. A queixa menciona estratégias de opções na Índia – o que alertou a SEBI
  • Fevereiro de 2025: NSE emite um aviso explícito à Jane Street
  • 3 de julho de 2025: SEBI publica sua ordem interlocutória ex-parte de 105 páginas, congela ₹4.843 crore (US$ 565 milhões)
  • 21 de julho de 2025: proibição suspensa após depósito em garantia
  • Setembro de 2025: Tribunal de Apelações de Valores Mobiliários suspende audiências pessoais, exige que a SEBI divulgue mais documentos
  • Janeiro de 2026: investigação se expande para Sensex e outras estratégias. Nenhuma ordem final ainda

Lucro que a SEBI atribui à Jane Street entre janeiro de 2023 e março de 2025 em opções indianas: ₹43.289 crore (~US$ 5 bilhões). Os US$ 565 milhões congelados são apenas "ganhos ilícitos" de dias de negociação específicos.

Defesa da Jane Street: "arbitragem básica de índice, facilitação da demanda de varejo." A linha entre formação de mercado e manipulação em derivativos é realmente tênue. Mas 18 dias de vencimento com um padrão quase idêntico, persistindo após o aviso explícito da NSE – uma defesa mais difícil.

O que vem a seguir: como chegar às mesmas conclusões por conta própria a partir de documentos públicos.

Parte 3. Seis técnicas

A maioria dos tutoriais de LLM para finanças diz "carregue o PDF, peça um resumo." Contexto desperdiçado.

3.1. Teste de hipótese adversarial

O erro básico – pedir ao LLM para "explicar a estratégia." Você obtém uma narrativa polida na qual o Claude usou suas perguntas direcionadoras como trilhos.

O padrão correto é invertido. Você formula a hipótese; o Claude assume o papel de revisor adversarial:

LLMs são bons como revisores, ruins como geradores de prova. Use-os no modo "encontre falhas no meu pensamento", não no modo "pense por mim."

3.2. Conjunto de hipóteses concorrentes

E se a hipótese correta não for a que você formulou? Execute várias instâncias do Claude em paralelo com diferentes estruturas interpretativas: "isso é manipulação," "isso é formação de mercado legítima," "isso é outra coisa." Um meta-prompt compara as três saídas e identifica pontos de divergência. Onde todas as três estruturas convergem para os mesmos fatos, mas chegam a conclusões diferentes – é aí que os dados são insuficientes. Diagnosticar suas próprias incógnitas, o que em pesquisa vale mais do que qualquer resposta única.

3.3. Diferenciação temporal

Mesmo tipo de documento (Form ADV é o alvo mais produtivo) da mesma empresa em anos diferentes. Peça ao Claude para encontrar mudanças de linguagem, especialmente em texto padrão. A maioria dos fundos copia o ADV literalmente ano após ano; quando algo muda na linguagem de gerenciamento de risco, é sinal de que o compliance decidiu que a redação antiga não os protege mais.

As descobertas mais interessantes: onde a linguagem antiga desaparece. Uma declaração removida quase sempre significa que não é mais verdadeira.

3.4. Triangulação entre documentos

Um documento é uma narrativa. Três documentos são triangulação. Alegação da fonte A (ordem da SEBI), confirmação em B (literatura acadêmica sobre microestrutura em dias de vencimento), contradição em C (comunicações internas da Jane Street). Claude executa a interseção contra cem alegações em uma sessão com pontuações de confiança. Alegações que passam em todas as três verificações – verdade operacional. Alegações que passam em A e são contraditas por B e C – onde o regulador exagerou.

3.5. Cache de prompt

Uma ordem da SEBI de 105 páginas tem ~120 mil tokens. Primeiro carregamento com cache de 1 hora: ~US$ 1,20. Cada consulta subsequente: ~US$ 0,06. Após 50 consultas – US$ 4 e 50 diferentes seções transversais analíticas.

O que muda não é o custo, é a estrutura do trabalho: de "três perguntas por documento" para "trezentas."

3.6. Interrogatório adversarial de documentos

Documento da parte A (ordem da SEBI). Alimente-o ao Claude e peça que ele interprete o adversário de A – a equipe de defesa da Jane Street – e construa perguntas direcionadas que minariam alegações factuais específicas. A lista resultante é uma previsão de como a defesa será estruturada. A ordem final pode estar a um ano de distância, recursos mais dois – mas o mapa de vulnerabilidades potenciais está em suas mãos hoje.

Parte 4. Como derrotar alucinações

Sem isso, as seis técnicas se tornam besteira lindamente escrita. Três regras, aplicadas em código via Pydantic:

Cadeia de proveniência aplicada. Cada alegação carrega uma trilha de evidências completa: \source_url\, \source_document_hash\, \source_page\, \extraction_timestamp\, \extraction_model\, \verification_status\. Sem uma trilha completa – Pydantic rejeita.

Verificação de citação literal. Cada citação do LLM é comparada programaticamente por string com o documento de origem. Não encontrada – \verification_status="failed"\, alegação descartada.

Votação em conjunto. Cada enriquecimento é executado N vezes com sementes diferentes (padrão 3). Alegações com concordância de 2/3+ recebem alta confiança. Discordância é visível na saída final.

A fórmula de confiança no código:

Cada peso tem um campo obrigatório \weight_justification\. Esquema padrão: 0,4 para marcadores estruturais, 0,3 para limites numéricos, 0,2 para padrões regex, 0,1 para extração semântica do LLM (o mais baixo, por ser mais subjetivo).

Em previsões – \adversarial_analysis\ e \falsification_criteria\ obrigatórios. Pydantic rejeita valores vazios.

Engenharia de prompt de LLM é dez por cento do trabalho. Noventa por cento é o código em torno do LLM que captura e descarta o que o LLM inventou.

Parte 5. Você pode confiar nos reguladores

Objeção natural: se a metodologia é construída sobre documentos regulatórios, e os reguladores são demonstravelmente tendenciosos – o que sustenta a confiança?

Validade da crítica. A porta giratória entre SEC e setor é documentada (Mary Jo White, Jay Clayton). A aplicação seletiva é real – Madoff não foi pego por 16 anos, apesar dos relatórios de denunciante de Markopolos em 2000, 2005, 2007. Após 2008, zero altos executivos de grandes bancos receberam processos criminais, contra mais de 1.000 condenações após a crise da poupança e empréstimo dos anos 1980. A divisão de fiscalização da SEC tem 1.300 pessoas contra um setor de milhões.

Por que isso não é relevante para a metodologia.

O viés funciona em uma direção. Um regulador pode se recusar a abrir um caso. Mas publicar uma ordem de 105 páginas é uma categoria diferente de decisão. Nesse ponto, o risco do regulador é exagerar, não minimizar: o oponente tem os recursos para desmontar argumentos fracos no tribunal.

SEBI ≠ SEC. SEBI contra uma empresa dos EUA – a política é invertida: demonstrar soberania, defender o varejo doméstico. A aplicação entre jurisdições é sistematicamente mais severa do que a doméstica.

Números vs narrativa. A ordem da SEBI tem narrativa ("manipulação," "esquema sinistro") e uma seção factual com números específicos (Tabelas 7, 8, 16, 17). A narrativa pode ser distorcida. Os números vêm de registros de bolsa e relatórios de corretoras que a própria Jane Street submeteu aos sistemas regulatórios indianos. Falsificar números é responsabilidade criminal para funcionários do regulador.

Validação adversarial. A Jane Street está lutando ativamente. Advogados de primeira linha. Protocolou um recurso. Eles contestam a interpretação ("isso não é manipulação, é arbitragem"), não os fatos ("não compramos tanto do ativo subjacente"). Se os números fossem fabricados, esse seria seu primeiro argumento no SAT. O sistema adversarial está fazendo seu trabalho.

O que a metodologia faz com isso. Separação por tipo de alegação: alegações factuais → confiança (verificáveis, validadas adversarialmente); alegações causais/de intenção → triangulação contra outras fontes; caracterizações legais → não é nosso domínio, aguarde a ordem final. O interrogatório adversarial de documentos (Parte 3.6) especificamente compra a perspectiva da defesa a partir do próprio documento.

Reguladores não são neutros. Mas ordens de fiscalização publicadas passam por um filtro adversarial que torna suas alegações factuais mais robustas do que a maioria das fontes alternativas. Confie nos números, não na narrativa.

Parte 6. Mecânica quant: o livro de ofertas em 17 de janeiro de 2024

"Jane Street detinha 20%+ do valor diário negociado" parece uma prova incontestável – por si só, não prova nada.

BANKNIFTY é um índice dos 12 maiores bancos indianos. Opções de índice são liquidadas em dinheiro contra a média ponderada dos últimos 30 minutos de negociação dos constituintes. Um formador de mercado com uma grande posição gama nesse momento é obrigado a fazer hedge por meio de dinheiro e futuros.

O hedge de um formador de mercado tecnicamente move o mercado. Se sua posição em opções exige vender US$ 200 milhões do ativo subjacente em 30 minutos, seu próprio fluxo cria pressão descendente. Isso é física, não intenção.

Números da ordem

A SEBI documenta 17 de janeiro de 2024 como o dia mais ilustrativo. Números das páginas 25-40 (Tabelas 7, 8, 16, 17):

Parte 7. O que essas técnicas oferecem hoje

Decodificamos uma ordem de 2025 sobre eventos de 2023-2024 – o que isso oferece agora? Se a única saída fosse uma reconstrução de uma estratégia obsoleta, isso seria metodologia para jornalistas, não para traders.

Cada técnica é um detector de padrões que é executado em dados atuais. Jane Street é um caso de ensino. Cinco aplicações em dados ao vivo:

  1. Alavancagem 7,3x como assinatura de detector. Qualquer formador de mercado observável por meio de dados públicos (13F combinado + dados da Options Clearing Corp + relatórios de volume de bolsa) executando índices de nocional de opções / posição subjacente acima de 5x é uma configuração pré-2025 da Jane Street. Monitoramento ativo entre as 20-30 maiores empresas de HFT fornece alerta precoce para: (a) volatilidade curta em ETFs com exposição se um regulador começar a se mover, (b) oportunidades de capacidade se uma empresa sair após a fiscalização.
  1. Análise de impacto no LTP como due diligence. O método da SEBI agora faz parte do kit de ferramentas regulatórias. Qualquer alocador após julho de 2025 deve estar solicitando métricas de impacto no LTP no DDQ. Se seu fundo opera formação de mercado – construa esse monitoramento internamente agora.
  1. Padrão de P&L assimétrico para triagem em tempo real. Para cada estratégia de múltiplas etapas em sua atribuição de portfólio, verifique padrões sistemáticos de perda-líder entre as etapas. Se existirem – risco de compliance independentemente da intenção.
  1. Opções indianas como um insight estrutural acionável. 61% das opções de ações globais por volume são negociadas na Índia (dados de abril de 2025). A Jane Street se retirou – o vácuo de liquidez está sendo distribuído entre Tower, Citadel Securities, Optiver, IMC. Uma janela aberta por 6 a 18 meses, após a qual a SEBI provavelmente introduzirá limites de participação. Negociações ao vivo: construção de capacidade na Índia, posições curtas em empresas com receita desproporcional da Índia sem diversificação.
  1. JSI/JSI2/Cingapura/Hong Kong como um modelo de arbitragem regulatória. Essa estrutura foi usada por pelo menos uma dúzia de empresas estrangeiras de HFT. A SEBI está estabelecendo precedente. Para qualquer HFT estrangeiro ao qual você tenha exposição (direta ou via ETF), verifique arquivos públicos para roteamento DTAA. Se presente – ajuste para prêmio de risco regulatório para cima.

Cada um é um padrão histórico convertido em um critério de triagem prospectivo. A metodologia para identificar (a) estruturas de opções alavancadas, (b) comportamento agressivo de impacto no LTP, (c) impressões digitais de PnL assimétrico, (d) oportunidades em mercados estruturalmente distorcidos, (e) arquiteturas de arbitragem regulatória – ferramentas ao vivo, aplicáveis aos 8-Ks, 13Ds, ADVs de hoje.

Parte 8. O que está no repositório

Se cada técnica funciona em modo único, nada impede de convertê-la em monitoramento contínuo por meio de feeds RSS de reguladores, atribuições de patentes do USPTO, APIs de arquivos judiciais. E mais – extrair padrões estruturais recorrentes de casos analisados e combiná-los com outros fundos. Arquiteturalmente, a mesma base de código. Três commits:

Commit 1: Plataforma. Seis técnicas em \src/reverse_quant/techniques/\. CachedCorpus. Wrapper do cliente Anthropic com retry e rastreamento de custos. Coletor EDGAR para 13F e ADV. Notebook 01: ponta a ponta no documento da SEBI – a análise deste artigo, executável por US$ 4-8.

Commit 2: Camada de monitoramento. \monitors/\ – Poller RSS EDGAR (funcionando), stubs de imprensa USPTO/PACER/regulador. \pipelines/\ – triagem/enriquecimento/deduplicação/orquestrador. \alerts/\ – stdout/arquivo funcionando, stubs Slack/e-mail. Armazenamento SQLite com esquema de proveniência completo. Notebook 04 mostra como a verificação captura alegações alucinadas.

Commit 3: Propagação de padrões. \patterns/\ – extração/biblioteca/comparação/previsão. Três padrões iniciais do caso Jane Street, curados manualmente, marcados \reviewed_by_human=True\. Fórmula de confiança transparente no código. Análise adversarial e critérios de falsificação obrigatórios em cada previsão. Notebooks 05-06.

Stack: Python 3.11+, type hints, ruff/mypy limpo, testes com clientes LLM simulados, SQLAlchemy, Pydantic v2. Licença MIT.

Baixe a ordem da SEBI através do link em \data/README.md\; a execução custa ~US$ 4-8.

O que você não consegue nem com o melhor LLM

  • Dados de tick para verificação direta das alegações da SEBI não estão disponíveis publicamente
  • Registros de compliance internos da Jane Street estão ausentes – você não sabe o que a empresa viu em tempo real
  • Intenção – um LLM não consegue distinguir manipulação de formação de mercado, requer descoberta
  • Verificação numérica – Claude confundiu crore com milhões de dólares pelo menos uma vez a cada dez execuções. Cada número é verificado manualmente
  • O que acontece depois – a ordem final pode inocentar, condenar ou confirmar parcialmente

Final

O documento de um regulador é o artefato mais denso em informações que um fundo deixa em público. Não porque revela a estratégia (revela menos do que um 13F), mas porque é o único documento não escrito pelo fundo e nem por seu marketing. SEC, SEBI, FCA – essas pessoas têm poder de intimação e escrevem para tribunais, não para o público.

Em 2020, decodificar a estrutura de um fundo de hedge médio custava US$ 50-100 mil e 2-3 meses de tempo de analista sênior. Em 2026 – US$ 50-100 e uma noite. Um novo equilíbrio, no qual fundos cientes de que sua pegada pública está sendo analisada dessa forma começarão a controlá-la mais cuidadosamente – criando a próxima rodada do jogo.

Se você trabalha em um fundo ou alocador interessado em uso interno – consultoria fechada está disponível.

Meus recursos Negociação aqui: https://polymarket.com/?r=zostaff Canal do Telegram: https://t.me/zostaffsmartarc GitHub: https://github.com/zostaff

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais