YouMind
Se connecter

Ingénierie inverse quantitative : Reconstruire les stratégies des hedge funds

@zostaff
ANGLAIS25 mai 2026
523K
422
61
22
982

TL;DR

Cet article explore une méthodologie d'ingénierie inverse des stratégies de hedge funds utilisant les LLM pour analyser les documents réglementaires, en se concentrant sur l'affaire Jane Street contre SEBI. Il propose six techniques spécifiques et un dépôt open-source pour l'analyse financière automatisée.

Un ratio de levier de 7,3x en dit plus que tous les articles de presse sur Jane Street réunis. La méthodologie qui l'a mis au jour, et un dépôt ouvert pour reproduire le travail.

En 2024, Bill Hwang a perdu 20 milliards de dollars, et le secteur l'a appris par les médias. Pas par un 13F. Pas par un 13D. Pas par le formulaire SHO. Archegos n'a jamais déposé de 13F – ses positions dans ViacomCBS, Discovery, Tencent Music étaient structurées via des total return swaps, que le cadre réglementaire ne considère pas comme des « participations ». C'est le plafond de ce qui peut être caché dans les limites de la loi.

Avant de décoder Jane Street – où la SEBI a publié 105 pages de documents que Jane Street aurait préféré garder confidentiels – il faut s'accorder sur ce qui est visible et invisible dans les données publiques. Sinon, tout pipeline LLM vous construira une hallucination magnifiquement rédigée.

Cet article porte sur l'affaire Jane Street contre SEBI et la méthodologie qui l'a décodée en une soirée au lieu d'une semaine d'analyste senior. Méthodologie implémentée sous forme de dépôt ouvert avec six techniques, une couche de surveillance et une propagation de motifs. Lien à la fin.

Partie 1. Ce que les 13F et les documents publics ne montrent pas

Si votre analyste pense encore qu'un 13F est un instantané de portefeuille, virez l'analyste. Un 13F est une projection filtrée et décalée d'un portefeuille :

  • Positions longues uniquement, dans les titres relevant de l'article 13(f). Pas de shorts. Pas de swaps. Pas de titres à revenu fixe. Les options sont déclarées uniquement au notionnel – pas de strikes, pas de direction.
  • Décalage de 45 jours. Au moment où vous voyez les participations du T3, le fonds est peut-être déjà au T4.
  • Demandes de traitement confidentiel. Berkshire cache systématiquement ses positions en construction pendant 3 à 12 mois ; Agarwal et al. dans le Journal of Finance ont montré empiriquement que les participations confidentielles génèrent un alpha systématiquement plus élevé que celles divulguées.
  • Window dressing. Rotation vers des positions « respectables » en fin de trimestre – bien documenté académiquement, invisible par construction dans un 13F.
  • Le formulaire SHO (qui comblerait en partie la lacune sur les shorts) repoussé à février 2028.

Toute méthodologie commence par une liste explicite de ce qu'il est structurellement impossible d'extraire. Sinon, vous construisez un modèle du masque public du fonds, pas du fonds.

La bonne nouvelle : le masque doit être cohérent. Pour cacher une stratégie, un fonds doit prendre des mesures coûteuses chaque trimestre – demandes de traitement confidentiel, restructuration de swaps, allocations transfrontalières. Ces mesures laissent des traces de second ordre : changements de langage dans le formulaire ADV entre les années, recrutements sur LinkedIn, dépôts de brevet à l'USPTO, publications académiques des employés, documents réglementaires d'autres juridictions.

Les LLM ne trouvent pas de nouvelles sources. Les sources sont les mêmes. Ce qui change, c'est le coût de la mise en relation. Relier un brevet de l'USPTO à un article académique du même auteur, qui, un an plus tôt, a parlé à une conférence à laquelle assistait également un ancien employé du fonds – cela prenait autrefois une journée entière de travail à un analyste senior. Avec Claude et le cache de prompts : 2 $ de crédits API et 15 minutes.

Sur Opus 4.7, les lectures dans le cache coûtent 0,50 $ par million de tokens au lieu de 5 $. Chargez le PDF de 105 pages dans le cache une fois, puis exécutez des centaines de prompts pour quelques centimes chacun. Le flux de travail passe d'« une analyse coûteuse » à « mille questions à bas prix ».

Partie 2. Jane Street contre SEBI

Chronologie :

  • Avril 2024 : Citadel poursuit Jane Street à New York pour appropriation de secrets commerciaux par deux anciens employés. La plainte mentionne des stratégies sur options indiennes – ce qui a mis la puce à l'oreille de la SEBI.
  • Février 2025 : la NSE publie un avis explicite à l'intention de Jane Street.
  • 3 juillet 2025 : la SEBI publie son ordonnance provisoire ex parte de 105 pages, gèle 4 843 ₹ crore (565 millions de dollars).
  • 21 juillet 2025 : levée du gel après dépôt sous séquestre.
  • Septembre 2025 : le Tribunal d'appel des valeurs mobilières suspend les audiences personnelles, exige que la SEBI divulgue davantage de documents.
  • Janvier 2026 : l'enquête s'étend au Sensex et à d'autres stratégies. Aucune décision finale pour l'instant.

Bénéfices que la SEBI attribue à Jane Street sur la période janvier 2023 – mars 2025 sur les options indiennes : 43 289 ₹ crore (~5 milliards de dollars). Les 565 millions de dollars gelés ne représentent que les « gains illicites » provenant de jours de bourse spécifiques.

Défense de Jane Street : « arbitrage d'indice de base, facilitation de la demande de détail ». La frontière entre la tenue de marché et la manipulation dans les dérivés est réellement mince. Mais 18 jours d'échéance suivant un motif quasi identique, persistant après l'avis explicite de la NSE – une défense plus difficile.

Ce qui suit : comment parvenir vous-même aux mêmes conclusions à partir de documents publics.

Partie 3. Six techniques

La plupart des tutoriels « LLM pour la finance » disent : « chargez le PDF, demandez un résumé ». Contexte gaspillé.

3.1. Test d'hypothèse hostile

L'erreur de base – demander au LLM d'« expliquer la stratégie ». Vous obtenez un récit poli dans lequel Claude a utilisé vos questions orientées comme des rails.

Le modèle correct est inversé. Vous formulez l'hypothèse ; Claude reçoit le rôle d'examinateur hostile :

Les LLM sont bons comme relecteurs, mauvais comme générateurs de preuves. Utilisez-les en mode « trouve des failles dans mon raisonnement », pas en mode « pense pour moi ».

3.2. Ensemble d'hypothèses concurrentes

Et si la bonne hypothèse n'était pas celle que vous avez formulée ? Exécutez plusieurs instances de Claude en parallèle avec différents cadres interprétatifs : « c'est de la manipulation », « c'est de la tenue de marché légitime », « c'est autre chose ». Un méta-prompt compare les trois sorties et identifie les points de divergence. Là où les trois cadres convergent sur les mêmes faits mais parviennent à des conclusions différentes – c'est là que les données sont insuffisantes. Diagnostiquer vos propres inconnues, ce qui, en recherche, vaut plus que n'importe quelle réponse unique.

3.3. Différenciation temporelle

Même type de document (le formulaire ADV est la cible la plus productive) provenant de la même entreprise à différentes années. Demandez à Claude de trouver les changements de langage, en particulier dans le texte standard. La plupart des fonds copient leur ADV mot pour mot d'une année sur l'autre ; quand quelque chose change dans le langage de gestion des risques, c'est le signe que la conformité a décidé que l'ancienne formulation ne les protégeait plus.

Les constatations les plus intéressantes : là où l'ancien langage disparaît. Une déclaration supprimée signifie presque toujours qu'elle n'est plus vraie.

3.4. Triangulation inter-documents

Un document est un récit. Trois documents sont une triangulation. Affirmation de la source A (ordonnance de la SEBI), confirmation dans B (littérature académique sur la microstructure des jours d'échéance), contradiction dans C (communications internes de Jane Street). Claude exécute l'intersection entre une centaine d'affirmations en une seule session avec des scores de confiance. Les affirmations passant les trois vérifications – vérité opérationnelle de terrain. Les affirmations passant A et contredites par B et C – là où le régulateur a dépassé ses prérogatives.

3.5. Mise en cache des prompts

Une ordonnance de la SEBI de 105 pages représente environ 120 000 tokens. Premier chargement avec un cache d'une heure : ~1,20 $. Chaque requête suivante : ~0,06 $. Après 50 requêtes – 4 $ et 50 coupes analytiques différentes.

Ce qui change n'est pas le coût, mais la structure du travail : passer de « trois questions par document » à « trois cents ».

3.6. Interrogation contradictoire du document

Document de la partie A (ordonnance de la SEBI). Donnez-le à Claude et demandez-lui de jouer le rôle de l'adversaire de A – l'équipe de défense de Jane Street – et de construire des questions ciblées qui remettraient en cause des affirmations factuelles spécifiques. La liste qui en résulte est une prévision de la manière dont la défense sera structurée. La décision finale peut être dans un an, les appels dans deux ans – mais la carte des vulnérabilités potentielles est entre vos mains dès aujourd'hui.

Partie 4. Comment vaincre les hallucinations

Sans cela, les six techniques deviennent de magnifiques conneries. Trois règles, appliquées dans le code via Pydantic :

Chaîne de provenance imposée. Chaque affirmation est accompagnée d'une piste complète de preuves : source_url, source_document_hash, source_page, extraction_timestamp, extraction_model, verification_status. Sans piste complète – Pydantic rejette.

Vérification de citation textuelle. Chaque citation du LLM est comparée par programme à la chaîne de caractères du document source. Non trouvée – verification_status="failed", affirmation rejetée.

Vote d'ensemble. Chaque enrichissement est exécuté N fois avec des graines différentes (par défaut 3). Les affirmations avec un accord de 2/3 ou plus obtiennent une confiance élevée. Le désaccord est visible dans la sortie finale.

La formule de confiance dans le code :

Chaque poids a un champ obligatoire weight_justification. Schéma par défaut : 0,4 pour les marqueurs structurels, 0,3 pour les seuils numériques, 0,2 pour les motifs regex, 0,1 pour l'extraction sémantique par LLM (le plus bas, car le plus subjectif).

Sur les prédictions – adversarial_analysis et falsification_criteria obligatoires. Pydantic rejette les valeurs vides.

L'ingénierie des prompts LLM représente dix pour cent du travail. Quatre-vingt-dix pour cent, c'est le code autour du LLM qui attrape et rejette ce que le LLM a inventé.

Partie 5. Peut-on faire confiance aux régulateurs

Objection naturelle : si la méthodologie est construite sur des documents réglementaires, et que les régulateurs sont manifestement partiaux – qu'est-ce qui garantit la confiance ?

Validité de la critique. La porte tournante entre la SEC et l'industrie est documentée (Mary Jo White, Jay Clayton). L'application sélective de la loi est réelle – Madoff n'a pas été attrapé pendant 16 ans malgré les rapports de lanceur d'alerte de Markopolos en 2000, 2005, 2007. Après 2008, aucun haut dirigeant des grandes banques n'a fait l'objet de poursuites pénales, contre plus de 1 000 condamnations après la crise des caisses d'épargne des années 1980. La division d'application de la SEC compte 1 300 personnes face à une industrie de millions.

Pourquoi cela n'est pas pertinent pour la méthodologie.

Le biais opère dans un sens. Un régulateur peut refuser de déposer une affaire. Mais publier une ordonnance de 105 pages est une catégorie de décision différente. À ce stade, le risque du régulateur est d'en faire trop, pas trop peu : l'adversaire a les ressources nécessaires pour démonter des arguments faibles devant les tribunaux.

SEBI ≠ SEC. La SEBI contre une entreprise américaine – la politique est inversée : démontrer la souveraineté, défendre le détail domestique. L'application transfrontalière est systématiquement plus sévère que l'application nationale.

Les chiffres contre le récit. L'ordonnance de la SEBI comporte un récit (« manipulation », « sinistre stratagème ») et une section factuelle avec des chiffres spécifiques (tableaux 7, 8, 16, 17). Le récit peut être orienté. Les chiffres proviennent des registres de bourse et des rapports de courtier que Jane Street elle-même a soumis aux systèmes réglementaires indiens. Falsifier des chiffres est une responsabilité pénale pour les employés du régulateur.

Validation contradictoire. Jane Street se défend activement. Avocats de premier plan. Appel déposé. Ils contestent l'interprétation (« ce n'est pas de la manipulation, c'est de l'arbitrage »), pas les faits (« nous n'avons pas acheté autant de sous-jacent »). Si les chiffres étaient fabriqués, ce serait leur premier argument devant le SAT. Le système contradictoire fait son travail.

Ce que la méthodologie en fait. Séparation par type d'affirmation : affirmations factuelles → confiance (vérifiables, validées contradictoirement) ; affirmations causales/intentionnelles → trianguler avec d'autres sources ; qualifications juridiques → pas notre domaine, attendre la décision finale. L'interrogation contradictoire du document (Partie 3.6) achète spécifiquement la perspective de la défense à partir du document lui-même.

Les régulateurs ne sont pas neutres. Mais les ordonnances d'exécution publiées passent par un filtre contradictoire qui rend leurs affirmations factuelles plus robustes que la plupart des sources alternatives. Faites confiance aux chiffres, pas au récit.

Partie 6. Mécanique quant : le carnet d'ordres du 17 janvier 2024

« Jane Street détenait plus de 20 % de la valeur quotidienne échangée » ressemble à une preuve accablante – en elle-même, elle ne prouve rien.

BANKNIFTY est un indice des 12 plus grandes banques indiennes. Les options sur indices sont réglées en espèces sur la base de la moyenne pondérée des 30 dernières minutes de négociation des constituants. Un teneur de marché détenant une position gamma importante à ce moment est tenu de couvrir par le biais de liquidités et de contrats à terme.

La couverture d'un teneur de marché fait techniquement bouger le marché. Si votre position sur options nécessite de vendre 200 millions de dollars de sous-jacent en 30 minutes, votre propre flux crée une pression à la baisse. C'est de la physique, pas une intention.

Chiffres de l'ordonnance

La SEBI documente le 17 janvier 2024 comme le jour le plus illustratif. Chiffres des pages 25-40 (tableaux 7, 8, 16, 17) :

Partie 7. Ce que ces techniques vous donnent aujourd'hui

Nous avons décodé une ordonnance de 2025 concernant des événements de 2023-2024 – qu'est-ce que cela vous apporte maintenant ? Si la seule production était une reconstruction d'une stratégie obsolète, ce serait une méthodologie pour journalistes, pas pour traders.

Chaque technique est un détecteur de motifs qui s'exécute sur les données d'aujourd'hui. Jane Street est un cas d'école. Cinq applications à des données en direct :

  1. Levier 7,3x comme signature de détection. Tout teneur de marché observable via les données publiques (13F combiné + données d'Options Clearing Corp + rapports de volume des bourses) dont le ratio notionnel d'options / position sous-jacente dépasse 5x est une configuration pré-2025 de type Jane Street. Une surveillance active des 20 à 30 plus grandes sociétés de trading à haute fréquence fournit un avertissement précoce pour : (a) une volatilité courte sur les ETF avec exposition si un régulateur commence à agir, (b) des opportunités de capacité si une entreprise se retire après une mesure d'exécution.
  1. Analyse de l'impact LTP comme due diligence. La méthode de la SEBI fait désormais partie de la boîte à outils réglementaire. Tout allocataire après juillet 2025 devrait demander des métriques d'impact LTP dans le DDQ. Si votre fonds fait de la tenue de marché – mettez en place cette surveillance en interne dès maintenant.
  1. Motif de P&L asymétrique pour le filtrage en temps réel. Pour chaque stratégie multi-jambes dans votre attribution de portefeuille, vérifiez les motifs systématiques de loss-leader entre les jambes. S'ils existent – risque de conformité indépendamment de l'intention.
  1. Options indiennes comme un aperçu structurel actionnable. 61 % des options sur actions mondiales en volume se négocient en Inde (données d'avril 2025). Jane Street s'est retirée – le vide de liquidité est distribué entre Tower, Citadel Securities, Optiver, IMC. Une fenêtre ouverte de 6 à 18 mois, après laquelle la SEBI est susceptible d'introduire des plafonds de participation. Transactions en direct : montée en capacité en Inde, positions courtes sur les entreprises ayant un chiffre d'affaires excessif en Inde sans diversification.
  1. JSI/JSI2/Singapour/Hong Kong comme modèle d'arbitrage réglementaire. Cette structure a été utilisée par au moins une douzaine de sociétés étrangères de trading à haute fréquence. La SEBI établit un précédent. Pour toute société étrangère de trading à haute fréquence à laquelle vous êtes exposé (directement ou via un ETF), vérifiez les documents publics pour le routage DTAA. Si présent – ajustez la prime de risque réglementaire à la hausse.

Chacun est un motif historique converti en critère de filtrage prospectif. La méthodologie pour identifier (a) les structures d'options à effet de levier, (b) le comportement agressif d'impact LTP, (c) les empreintes de PnL asymétriques, (d) les opportunités dans des marchés structurellement déformés, (e) les architectures d'arbitrage réglementaire – des outils en direct, applicables aux 8-K, 13D, ADV d'aujourd'hui.

Partie 8. Ce qu'il y a dans le dépôt

Si chaque technique fonctionne en mode ponctuel, rien n'empêche de la convertir en surveillance continue via les flux RSS des régulateurs, les attributions de brevets de l'USPTO, les API de dépôts judiciaires. Et plus encore – extraire les motifs structurels récurrents des affaires analysées et les faire correspondre à d'autres fonds. Architectuellement, la même base de code. Trois commits :

Commit 1 : Plateforme. Six techniques dans src/reverse_quant/techniques/. CachedCorpus. Wrapper client Anthropic avec réessai et suivi des coûts. Récupérateur EDGAR pour 13F et ADV. Notebook 01 : de bout en bout sur le document SEBI – l'analyse de cet article, exécutable pour 4 à 8 $.

Commit 2 : Couche de surveillance. monitors/ – poller RSS EDGAR (fonctionnel), stubs USPTO/PACER/communiqués de presse des régulateurs. pipelines/ – tri/enrichissement/déduplication/orchestrateur. alerts/ – stdout/fichier fonctionnel, stubs Slack/e-mail. Stockage SQLite avec schéma de provenance complet. Le notebook 04 montre comment la vérification détecte les affirmations hallucinées.

Commit 3 : Propagation de motifs. patterns/ – extraction/bibliothèque/correspondance/prédiction. Trois motifs de départ issus de l'affaire Jane Street, organisés manuellement, marqués reviewed_by_human=True. Formule de confiance transparente dans le code. Analyse contradictoire obligatoire et critères de falsification sur chaque prédiction. Notebooks 05-06.

Stack : Python 3.11+, indications de type, propre sous ruff/mypy, tests avec clients LLM simulés, SQLAlchemy, Pydantic v2. Licence MIT.

Téléchargez l'ordonnance de la SEBI via le lien dans data/README.md ; l'exécution coûte environ 4 à 8 $.

Ce que vous ne pouvez pas obtenir, même avec le meilleur LLM

  • Les données tick pour la vérification directe des affirmations de la SEBI ne sont pas publiquement disponibles.
  • Les registres de conformité internes de Jane Street sont absents – vous ne savez pas ce que l'entreprise a vu en temps réel.
  • L'intention – un LLM ne peut pas distinguer la manipulation de la tenue de marché, cela nécessite une découverte.
  • Vérification numérique – Claude a confondu les crores avec des millions de dollars au moins une fois sur dix exécutions. Chaque nombre est vérifié manuellement.
  • Ce qui se passera ensuite – la décision finale pourrait innocenter, condamner ou confirmer partiellement.

Conclusion

Le document d'un régulateur est l'artefact le plus dense en information qu'un fonds laisse dans le domaine public. Non pas parce qu'il révèle la stratégie (il en révèle moins qu'un 13F), mais parce que c'est le seul document qui n'est pas rédigé par le fonds ni par son service marketing. SEC, SEBI, FCA – ces gens ont le pouvoir de citation à comparaître, et ils écrivent pour les tribunaux, pas pour le public.

En 2020, décoder la structure d'un fonds spéculatif moyen coûtait 50 000 à 100 000 $ et 2 à 3 mois de travail d'analyste senior. En 2026 – 50 à 100 $ et une soirée. Un nouvel équilibre, dans lequel les fonds conscients que leur empreinte publique est analysée de cette manière commenceront à la contrôler plus soigneusement – créant le prochain cycle du jeu.

Si vous travaillez dans un fonds ou une société d'allocation intéressé par une utilisation interne – un conseil fermé est disponible.

Mes ressources

Tradez ici : https://polymarket.com/?r=zostaff

Chaîne Telegram : https://t.me/zostaffsmartarc

GitHub : https://github.com/zostaff

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux