YouMind
Iniciar sesión

Ingeniería inversa cuantitativa: Reconstruyendo estrategias de fondos de cobertura

@zostaff
INGLÉS25 may 2026
523K
422
61
22
982

TL;DR

Este artículo explora una metodología para realizar ingeniería inversa de estrategias de fondos de cobertura utilizando LLMs para analizar presentaciones regulatorias, centrándose en el caso de Jane Street contra SEBI. Proporciona seis técnicas específicas y un repositorio de código abierto para el análisis financiero automatizado.

Un ratio de apalancamiento de 7.3x dice más que todos los artículos de Jane Street combinados. La metodología que lo descubrió y un repositorio abierto para reproducir el trabajo.

En 2024, Bill Hwang perdió $20 mil millones, y la industria se enteró por las noticias. No por un 13F. No por un 13D. No por el Formulario SHO. Archegos nunca presentó un 13F: sus posiciones en ViacomCBS, Discovery, Tencent Music estaban estructuradas mediante swaps de retorno total, que el marco regulatorio no trata como "tenencias". Ese es el límite de lo que se puede ocultar dentro de la ley.

Antes de descifrar a Jane Street —donde SEBI publicó 105 páginas de material que Jane Street preferiría mantener privado— debemos acordar qué es visible e invisible en los datos públicos. De lo contrario, cualquier pipeline de LLM te construirá una alucinación bellamente redactada.

Este artículo trata sobre el caso Jane Street vs SEBI y la metodología que lo descifró en una tarde en lugar de una semana de analista senior. Metodología implementada como un repositorio abierto con seis técnicas, una capa de monitoreo y propagación de patrones. Enlace al final.

Parte 1. Lo que los 13F y los documentos públicos no muestran

Si tu analista aún cree que un 13F es una instantánea de cartera, despide al analista. Un 13F es una proyección filtrada y retrasada de una cartera:

  • Solo posiciones largas en valores de la Sección 13(f). Sin cortos. Sin swaps. Sin renta fija. Opciones reportadas solo como nocional —sin strikes, sin dirección
  • Retraso de 45 días. Cuando ves las tenencias del tercer trimestre, el fondo ya puede estar en el cuarto
  • Solicitudes de tratamiento confidencial. Berkshire oculta rutinariamente posiciones en construcción durante 3-12 meses; Agarwal et al. en el \Journal of Finance\ demostraron empíricamente que las tenencias confidenciales generan un alfa sistemáticamente mayor que las divulgadas
  • Maquillaje de ventana. Rotar hacia posiciones "respetables" al final del trimestre —bien documentado académicamente, invisible por construcción en el 13F
  • Formulario SHO (que cerraría parte del vacío legal de cortos) pospuesto hasta febrero de 2028

Cualquier metodología comienza con una lista explícita de lo que es estructuralmente imposible de extraer. De lo contrario, estás construyendo un modelo de la máscara pública del fondo, no del fondo.

Lo bueno: la máscara debe ser coherente. Para ocultar una estrategia, un fondo necesita acciones costosas cada trimestre: solicitudes de tratamiento confidencial, reestructuración de swaps, asignaciones entre jurisdicciones. Estas dejan rastros de segundo orden: cambios de lenguaje en el Formulario ADV entre años, patrones de contratación en LinkedIn, solicitudes de patentes en USPTO, publicaciones académicas de empleados, documentos regulatorios de otras jurisdicciones.

Los LLM no encuentran nuevas fuentes. Las fuentes son las mismas. Lo que cambia es el costo de la referencia cruzada. Conectar una patente de USPTO con un artículo académico del mismo autor, que hace un año habló en una conferencia a la que también asistió un ex empleado del fondo —eso solía ser un día completo de trabajo de un analista senior. Con Claude más almacenamiento en caché de prompts: $2 en créditos de API y 15 minutos.

En Opus 4.7, las lecturas de caché cuestan $0.50 por millón de tokens en lugar de $5. Carga el PDF de 105 páginas en caché una vez, luego ejecuta cientos de prompts a centavos cada uno. El flujo de trabajo pasa de "un análisis costoso" a "mil preguntas baratas".

Parte 2. Jane Street vs SEBI

Cronología:

  • Abril 2024: Citadel demanda a Jane Street en Nueva York por apropiación indebida de secretos comerciales por parte de dos ex empleados. La queja hace referencia a estrategias de opciones en India —lo que alertó a SEBI
  • Febrero 2025: NSE emite una advertencia explícita a Jane Street
  • 3 de julio de 2025: SEBI publica su orden provisional de 105 páginas sin contradictorio, congela ₹4,843 crore ($565M)
  • 21 de julio de 2025: se levanta la prohibición tras depósito en garantía
  • Septiembre 2025: el Tribunal de Apelaciones de Valores suspende las audiencias personales, exige que SEBI revele más documentos
  • Enero 2026: la investigación se expande a Sensex y otras estrategias. Aún sin orden final

Ganancia que SEBI atribuye a Jane Street entre enero de 2023 y marzo de 2025 en opciones indias: ₹43,289 crore (~$5B). Los $565M congelados son solo "ganancias ilícitas" de días de negociación específicos.

Defensa de Jane Street: "arbitraje básico de índices, facilitación de demanda minorista". La línea entre creación de mercado y manipulación en derivados es realmente delgada. Pero 18 días de vencimiento con un patrón casi idéntico, persistiendo después de la advertencia explícita de NSE —una defensa más difícil.

Lo que sigue: cómo llegar a las mismas conclusiones por ti mismo a partir de documentos públicos.

Parte 3. Seis técnicas

La mayoría de los tutoriales de LLM para finanzas dicen "carga el PDF, pide un resumen". Contexto desperdiciado.

3.1. Prueba de hipótesis adversarial

El error básico: pedirle al LLM que "explique la estrategia". Obtienes una narrativa pulida en la que Claude usó tus preguntas capciosas como rieles.

El patrón correcto es invertido. Tú formulas la hipótesis; Claude obtiene el rol de revisor adversarial:

Los LLM son buenos como correctores, malos como generadores de pruebas. Úsalos en modo "encuentra agujeros en mi pensamiento", no en modo "piensa por mí".

3.2. Conjunto de hipótesis competidoras

¿Y si la hipótesis correcta no es la que formulaste? Ejecuta múltiples instancias de Claude en paralelo con diferentes marcos interpretativos: "esto es manipulación", "esto es creación de mercado legítima", "esto es otra cosa". Un meta-prompt compara las tres salidas e identifica puntos de divergencia. Donde los tres marcos convergen en los mismos hechos pero llegan a conclusiones diferentes —ahí los datos son insuficientes. Diagnosticar tus propias incógnitas, que en investigación vale más que cualquier respuesta única.

3.3. Diferenciación temporal

Mismo tipo de documento (el Formulario ADV es el objetivo más productivo) de la misma empresa en diferentes años. Pídele a Claude que encuentre cambios de lenguaje, especialmente en texto estándar. La mayoría de los fondos copian el ADV textualmente año tras año; cuando algo cambia en el lenguaje de gestión de riesgos, es señal de que el cumplimiento normativo decidió que la redacción anterior ya no los protegía.

Los hallazgos más interesantes: donde desaparece el lenguaje antiguo. Una declaración eliminada casi siempre significa que ya no es cierta.

3.4. Triangulación entre documentos

Un documento es una narrativa. Tres documentos son triangulación. Afirmación de la fuente A (orden de SEBI), confirmación en B (literatura académica sobre microestructura en días de vencimiento), contradicción en C (comunicaciones internas de Jane Street). Claude ejecuta la intersección contra cien afirmaciones en una sesión con puntuaciones de confianza. Afirmaciones que pasan las tres comprobaciones —verdad operativa del terreno. Afirmaciones que pasan A y son contradichas por B y C —donde el regulador se excedió.

3.5. Almacenamiento en caché de prompts

Una orden de SEBI de 105 páginas tiene ~120k tokens. Primera carga con caché de 1 hora: ~$1.20. Cada consulta subsiguiente: ~$0.06. Después de 50 consultas —$4 y 50 secciones transversales analíticas diferentes.

Lo que cambia no es el costo, es la estructura del trabajo: de "tres preguntas por documento" a "trescientas".

3.6. Interrogatorio adversarial de documentos

Documento de la parte A (orden de SEBI). Aliméntalo a Claude y pídele que interprete al adversario de A —el equipo de defensa de Jane Street— y construya preguntas dirigidas que socavarían afirmaciones fácticas específicas. La lista resultante es un pronóstico de cómo se estructurará la defensa. La orden final puede estar a un año, las apelaciones dos más —pero el mapa de vulnerabilidades potenciales está en tus manos hoy.

Parte 4. Cómo vencer las alucinaciones

Sin esto, las seis técnicas se convierten en basura bellamente redactada. Tres reglas, aplicadas en código mediante Pydantic:

Cadena de procedencia aplicada. Cada afirmación lleva un rastro de evidencia completo: \source_url\, \source_document_hash\, \source_page\, \extraction_timestamp\, \extraction_model\, \verification_status\. Sin un rastro completo —Pydantic lo rechaza.

Verificación de cita textual. Cada cita del LLM se compara mediante coincidencia de cadenas programática con el documento fuente. No encontrada —\verification_status="failed"\, afirmación descartada.

Votación de conjunto. Cada enriquecimiento se ejecuta N veces con diferentes semillas (por defecto 3). Las afirmaciones con acuerdo de 2/3+ obtienen alta confianza. El desacuerdo es visible en la salida final.

La fórmula de confianza en código:

Cada peso tiene un campo obligatorio \weight_justification\. Esquema predeterminado: 0.4 para marcadores estructurales, 0.3 para umbrales numéricos, 0.2 para patrones de expresiones regulares, 0.1 para extracción semántica del LLM (la más baja, porque es la más subjetiva).

En predicciones —\adversarial_analysis\ y \falsification_criteria\ obligatorios. Pydantic rechaza valores vacíos.

La ingeniería de prompts de LLM es el diez por ciento del trabajo. El noventa por ciento es el código alrededor del LLM que atrapa y descarta lo que el LLM inventó.

Parte 5. ¿Puedes confiar en los reguladores?

Objeción natural: si la metodología se basa en documentos regulatorios, y los reguladores son demostrablemente parciales —¿qué sostiene la confianza?

Validez de la crítica. La puerta giratoria entre la SEC y la industria está documentada (Mary Jo White, Jay Clayton). La aplicación selectiva es real —Madoff no fue atrapado durante 16 años a pesar de los informes de denunciante de Markopolos en 2000, 2005, 2007. Después de 2008, cero altos ejecutivos de grandes bancos recibieron procesamientos penales frente a más de 1,000 condenas después de la crisis de ahorros y préstamos de los años 80. La división de cumplimiento de la SEC tiene 1,300 personas frente a una industria de millones.

Por qué esto no es relevante para la metodología.

El sesgo funciona en una dirección. Un regulador puede negarse a presentar un caso. Pero publicar una orden de 105 páginas es una categoría diferente de decisión. En ese punto, el riesgo del regulador es exagerar, no minimizar: el oponente tiene los recursos para desmantelar argumentos débiles en los tribunales.

SEBI ≠ SEC. SEBI contra una empresa estadounidense —la política está invertida: demostrar soberanía, defender al minorista doméstico. La aplicación transfronteriza es sistemáticamente más severa que la nacional.

Números vs narrativa. La orden de SEBI tiene narrativa ("manipulación", "esquema siniestro") y una sección fáctica con números específicos (Tablas 7, 8, 16, 17). La narrativa puede ser manipulada. Los números provienen de registros de intercambio e informes de corredores que la propia Jane Street presentó en los sistemas regulatorios indios. Falsificar números es responsabilidad penal para los empleados del regulador.

Validación adversarial. Jane Street está luchando activamente. Abogados de primer nivel. Presentaron una apelación. Cuestionan la interpretación ("esto no es manipulación, es arbitraje"), no los hechos ("no compramos tanto subyacente"). Si los números fueran fabricados, ese sería su primer argumento en SAT. El sistema adversarial está haciendo su trabajo.

Lo que la metodología hace con esto. Separación por tipo de afirmación: afirmaciones fácticas → confiar (verificables, validadas adversarialmente); afirmaciones causales/de intención → triangular contra otras fuentes; caracterizaciones legales → no es nuestro dominio, esperar la orden final. El interrogatorio adversarial de documentos (Parte 3.6) compra específicamente la perspectiva de la defensa desde el propio documento.

Los reguladores no son neutrales. Pero las órdenes de cumplimiento publicadas pasan por un filtro adversarial que hace que sus afirmaciones fácticas sean más robustas que la mayoría de las fuentes alternativas. Confía en los números, no en la narrativa.

Parte 6. Mecánica cuantitativa: el libro de órdenes el 17 de enero de 2024

"Jane Street poseía el 20%+ del valor diario negociado" suena a prueba irrefutable —por sí solo, no prueba nada.

BANKNIFTY es un índice de los 12 bancos indios más grandes. Las opciones sobre índices se liquidan en efectivo contra el promedio ponderado de los últimos 30 minutos de negociación de los constituyentes. Un creador de mercado que mantiene una posición gamma grande en ese momento está obligado a cubrirse mediante efectivo y futuros.

La cobertura de un creador de mercado técnicamente mueve el mercado. Si tu posición de opciones requiere vender $200M de subyacente en 30 minutos, tu propio flujo crea presión a la baja. Eso es física, no intención.

Números de la orden

SEBI documenta el 17 de enero de 2024 como el día más ilustrativo. Números de las páginas 25-40 (Tablas 7, 8, 16, 17):

Parte 7. Lo que estas técnicas te dan hoy

Desciframos una orden de 2025 sobre eventos de 2023-2024 —¿qué te da eso ahora? Si el único resultado fuera una reconstrucción de una estrategia obsoleta, esto sería metodología para periodistas, no para traders.

Cada técnica es un detector de patrones que se ejecuta con datos de hoy. Jane Street es un caso de enseñanza. Cinco aplicaciones a datos en vivo:

  1. Apalancamiento 7.3x como firma detectora. Cualquier creador de mercado observable a través de datos públicos (13F combinado + datos de la Cámara de Compensación de Opciones + informes de volumen de la plataforma) que ejecute ratios de nocional de opciones / posición subyacente por encima de 5x es una configuración pre-2025 de Jane Street. Monitoreo activo entre las 20-30 firmas HFT más grandes proporciona alerta temprana para: (a) volatilidad corta en ETFs con exposición si un regulador comienza a moverse, (b) oportunidades de capacidad si una firma sale después del cumplimiento.
  1. Análisis de impacto LTP como diligencia debida. El método de SEBI ahora es parte del kit de herramientas regulatorias. Cualquier asignador después de julio de 2025 debería estar solicitando métricas de impacto LTP en el DDQ. Si tu fondo ejecuta creación de mercado —construye este monitoreo internamente ahora.
  1. Patrón de P&L asimétrico para detección en tiempo real. Para cada estrategia multi-pierna en tu atribución de cartera, verifica patrones sistemáticos de pérdida líder entre piernas. Si existen —riesgo de cumplimiento independientemente de la intención.
  1. Opciones indias como una visión estructural procesable. El 61% de las opciones sobre acciones globales por volumen se negocian en India (datos de abril de 2025). Jane Street se retiró —el vacío de liquidez se está distribuyendo entre Tower, Citadel Securities, Optiver, IMC. Una ventana abierta por 6-18 meses, después de la cual SEBI probablemente introducirá límites de participación. Operaciones en vivo: construcción de capacidad en India, posiciones cortas en empresas con ingresos desproporcionados de India sin diversificación.
  1. JSI/JSI2/Singapur/Hong Kong como plantilla de arbitraje regulatorio. Esta estructura fue utilizada por al menos una docena de firmas HFT extranjeras. SEBI está estableciendo precedente. Para cualquier HFT extranjero al que tengas exposición (directa o mediante ETF), verifica las presentaciones públicas para enrutamiento DTAA. Si está presente —ajusta la prima de riesgo regulatorio al alza.

Cada uno es un patrón histórico convertido en un criterio de detección prospectivo. La metodología para identificar (a) estructuras de opciones apalancadas, (b) comportamiento agresivo de impacto LTP, (c) huellas dactilares de PnL asimétrico, (d) oportunidades en mercados estructuralmente distorsionados, (e) arquitecturas de arbitraje regulatorio —herramientas en vivo, aplicables a los 8-K, 13D, ADV de hoy.

Parte 8. Lo que hay en el repositorio

Si cada técnica funciona en modo de un solo disparo, nada impide convertirla en monitoreo continuo mediante feeds RSS de reguladores, asignaciones de patentes USPTO, APIs de presentaciones judiciales. Y más allá —extraer patrones estructurales recurrentes de casos analizados y emparejarlos con otros fondos. Arquitectónicamente, la misma base de código. Tres commits:

Commit 1: Plataforma. Seis técnicas en \src/reverse_quant/techniques/\. CachedCorpus. Envoltorio del cliente Anthropic con reintento y seguimiento de costos. Descargador EDGAR para 13F y ADV. Notebook 01: de extremo a extremo en el documento de SEBI —el análisis de este artículo, ejecutable por $4-8.

Commit 2: Capa de monitoreo. \monitors/\ —sondeador RSS de EDGAR (funcionando), stubs de USPTO/PACER/prensa reguladora. \pipelines/\ —triage/enriquecimiento/dedup/orquestador. \alerts/\ —salida estándar/archivo funcionando, stubs de Slack/correo electrónico. Almacenamiento SQLite con esquema de procedencia completo. Notebook 04 muestra cómo la verificación atrapa afirmaciones alucinadas.

Commit 3: Propagación de patrones. \patterns/\ —extracción/biblioteca/emparejamiento/predicción. Tres patrones semilla del caso Jane Street, curados a mano, marcados \reviewed_by_human=True\. Fórmula de confianza transparente en código. Análisis adversarial obligatorio y criterios de falsificación en cada predicción. Notebooks 05-06.

Stack: Python 3.11+, type hints, limpio ruff/mypy, pruebas con clientes LLM simulados, SQLAlchemy, Pydantic v2. Licencia MIT.

Descarga la orden de SEBI mediante el enlace en \data/README.md\; la ejecución cuesta ~$4-8.

Lo que no puedes obtener ni siquiera con el mejor LLM

  • Datos de tick para verificación directa de las afirmaciones de SEBI no están disponibles públicamente
  • Los registros de cumplimiento internos de Jane Street están ausentes —no sabes lo que la firma vio en tiempo real
  • Intención —un LLM no puede distinguir manipulación de creación de mercado, requiere descubrimiento
  • Verificación numérica —Claude confundió crore con millones de dólares al menos una vez cada diez ejecuciones. Cada número se verifica a mano
  • Lo que sucede después —la orden final podría exonerar, condenar o confirmar parcialmente

Final

El documento de un regulador es el artefacto más denso en información que un fondo deja en público. No porque revele la estrategia (revela menos que un 13F), sino porque es el único documento no escrito por el fondo ni por su marketing. SEC, SEBI, FCA —estas personas tienen poder de citación, y escriben para tribunales, no para el público.

En 2020, descifrar la estructura de un fondo de cobertura promedio costaba $50-100k y 2-3 meses de tiempo de analista senior. En 2026 —$50-100 y una tarde. Un nuevo equilibrio, en el que los fondos conscientes de que su huella pública está siendo analizada de esta manera comenzarán a controlarla más cuidadosamente —creando la siguiente ronda del juego.

Si trabajas en un fondo o asignador interesado en uso interno —consultoría cerrada disponible.

Mis recursos Trading aquí: https://polymarket.com/?r=zostaff Canal de Telegram: https://t.me/zostaffsmartarc GitHub: https://github.com/zostaff

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales