Un ratio de apalancamiento de 7.3x dice más que todos los artículos de Jane Street combinados. La metodología que lo descubrió y un repositorio abierto para reproducir el trabajo.
En 2024, Bill Hwang perdió $20 mil millones, y la industria se enteró por las noticias. No por un 13F. No por un 13D. No por el Formulario SHO. Archegos nunca presentó un 13F: sus posiciones en ViacomCBS, Discovery y Tencent Music se estructuraron mediante swaps de retorno total, que el marco regulatorio no trata como "tenencias". Ese es el techo de lo que se puede ocultar dentro de la ley.
Antes de descifrar a Jane Street —donde SEBI publicó 105 páginas de material que Jane Street preferiría mantener privado— debemos acordar qué es visible e invisible en los datos públicos. De lo contrario, cualquier pipeline de LLM te construirá una alucinación bellamente redactada.
Este artículo trata sobre el caso Jane Street vs SEBI y la metodología que lo descifró en una tarde en lugar de una semana de analista senior. Metodología implementada como un repositorio abierto con seis técnicas, una capa de monitoreo y propagación de patrones. Enlace al final.
Parte 1. Lo que los 13F y los documentos públicos no muestran
Si tu analista aún cree que un 13F es una instantánea de cartera, despide al analista. Un 13F es una proyección filtrada y retrasada de una cartera:
- Solo posiciones largas, en valores de la Sección 13(f). Sin cortos. Sin swaps. Sin renta fija. Opciones reportadas solo como nocional —sin strikes, sin dirección
- Retraso de 45 días. Para cuando ves las tenencias del tercer trimestre, el fondo ya puede estar en el cuarto
- Solicitudes de tratamiento confidencial. Berkshire oculta sistemáticamente posiciones en construcción durante 3-12 meses; Agarwal et al. en el \Journal of Finance\ demostraron empíricamente que las tenencias confidenciales generan alfa sistemáticamente mayor que las divulgadas
- Maquillaje de ventana. Rotar hacia posiciones "respetables" al final del trimestre —bien documentado académicamente, invisible por construcción en el 13F
- Formulario SHO (que cerraría parte del vacío legal de cortos) pospuesto hasta febrero de 2028
Cualquier metodología comienza con una lista explícita de lo que es estructuralmente imposible de extraer. De lo contrario, estás construyendo un modelo de la máscara pública del fondo, no del fondo.
La buena noticia: la máscara debe ser consistente. Para ocultar una estrategia, un fondo necesita acciones costosas cada trimestre —solicitudes de tratamiento confidencial, reestructuración de swaps, asignaciones transfronterizas. Estas dejan rastros de segundo orden: cambios de lenguaje en el Formulario ADV entre años, patrones de contratación en LinkedIn, solicitudes de patentes en USPTO, publicaciones académicas de empleados, documentos regulatorios de otras jurisdicciones.
Los LLM no encuentran nuevas fuentes. Las fuentes son las mismas. Lo que cambia es el costo de la referencia cruzada. Conectar una patente de USPTO con un artículo académico del mismo autor, quien hace un año habló en una conferencia a la que también asistió un ex empleado del fondo —eso solía ser un día completo de trabajo de un analista senior. Con Claude más almacenamiento en caché de prompts: $2 en créditos de API y 15 minutos.
En Opus 4.7, las lecturas de caché cuestan $0.50 por millón de tokens en lugar de $5. Carga el PDF de 105 páginas en caché una vez, luego ejecuta cientos de prompts a centavos cada uno. El flujo de trabajo pasa de "un análisis costoso" a "mil preguntas baratas".
Parte 2. Jane Street vs SEBI
Cronología:
- Abril 2024: Citadel demanda a Jane Street en Nueva York por apropiación indebida de secretos comerciales por parte de dos ex empleados. La denuncia menciona estrategias de opciones en India —lo que alertó a SEBI
- Febrero 2025: NSE emite una advertencia explícita a Jane Street
- Julio 3, 2025: SEBI publica su orden interlocutoria ex-parte de 105 páginas, congela ₹4,843 crore ($565M)
- Julio 21, 2025: se levanta la prohibición tras un depósito en garantía
- Septiembre 2025: el Tribunal de Apelaciones de Valores suspende las audiencias personales, exige que SEBI divulgue más documentos
- Enero 2026: la investigación se expande a Sensex y otras estrategias. Aún no hay orden final
Ganancia que SEBI atribuye a Jane Street entre enero de 2023 y marzo de 2025 en opciones indias: ₹43,289 crore (~$5B). Los $565M congelados son solo "ganancias ilícitas" de días de negociación específicos.
Defensa de Jane Street: "arbitraje básico de índices, facilitación de demanda minorista". La línea entre creación de mercado y manipulación en derivados es genuinamente delgada. Pero 18 días de vencimiento con un patrón casi idéntico, persistente después de la advertencia explícita de NSE —una defensa más difícil.
Lo que sigue: cómo llegar a las mismas conclusiones por tu cuenta a partir de documentos públicos.
Parte 3. Seis técnicas
La mayoría de los tutoriales de LLM para finanzas dicen "carga el PDF, pide un resumen". Contexto desperdiciado.
3.1. Prueba de hipótesis adversarial
El error básico —pedirle al LLM que "explique la estrategia". Obtienes una narrativa pulida en la que Claude usó tus preguntas capciosas como rieles.
El patrón correcto es invertido. Tú formulas la hipótesis; Claude obtiene el rol de revisor adversarial:
Los LLM son buenos como correctores, malos como generadores de pruebas. Úsalos en modo "encuentra agujeros en mi pensamiento", no en modo "piensa por mí".
3.2. Conjunto de hipótesis competidoras
¿Qué pasa si la hipótesis correcta no es la que formulaste? Ejecuta múltiples instancias de Claude en paralelo con diferentes marcos interpretativos: "esto es manipulación", "esto es creación de mercado legítima", "esto es otra cosa". Un meta-prompt compara los tres resultados e identifica puntos de divergencia. Donde los tres marcos convergen en los mismos hechos pero llegan a conclusiones diferentes —ahí es donde los datos son insuficientes. Diagnosticar tus propias incógnitas, que en investigación vale más que cualquier respuesta única.
3.3. Diferenciación temporal
Mismo tipo de documento (Formulario ADV es el objetivo más productivo) de la misma firma en diferentes años. Pídele a Claude que encuentre cambios de lenguaje, especialmente en texto estándar. La mayoría de los fondos copian ADV textualmente año tras año; cuando algo cambia en el lenguaje de gestión de riesgos, es señal de que compliance decidió que la redacción anterior ya no los protege.
Los hallazgos más interesantes: donde desaparece el lenguaje antiguo. Una declaración eliminada casi siempre significa que ya no es cierta.
3.4. Triangulación entre documentos
Un documento es una narrativa. Tres documentos son triangulación. Afirmación de la fuente A (orden de SEBI), confirmación en B (literatura académica sobre microestructura en días de vencimiento), contradicción en C (comunicaciones internas de Jane Street). Claude ejecuta la intersección contra cien afirmaciones en una sola sesión con puntuaciones de confianza. Afirmaciones que pasan las tres verificaciones —verdad operativa del terreno. Afirmaciones que pasan A y son contradichas por B y C —donde el regulador se excedió.
3.5. Almacenamiento en caché de prompts
Una orden de SEBI de 105 páginas tiene ~120k tokens. Primera carga con caché de 1 hora: ~$1.20. Cada consulta subsiguiente: ~$0.06. Después de 50 consultas —$4 y 50 secciones transversales analíticas diferentes.
Lo que cambia no es el costo, es la estructura del trabajo: de "tres preguntas por documento" a "trescientas".
3.6. Interrogatorio adversarial de documentos
Documento de la parte A (orden de SEBI). Aliméntalo a Claude y pídele que interprete al adversario de A —el equipo de defensa de Jane Street— y construya preguntas dirigidas que socavarían afirmaciones fácticas específicas. La lista resultante es un pronóstico de cómo se estructurará la defensa. La orden final puede estar a un año de distancia, las apelaciones dos más —pero el mapa de vulnerabilidades potenciales está en tus manos hoy.
Parte 4. Cómo vencer las alucinaciones
Sin esto, las seis técnicas se convierten en basura bellamente redactada. Tres reglas, aplicadas en código mediante Pydantic:
Cadena de procedencia aplicada. Cada afirmación lleva un rastro de evidencia completo: \source_url\, \source_document_hash\, \source_page\, \extraction_timestamp\, \extraction_model\, \verification_status\. Sin un rastro completo —Pydantic lo rechaza.
Verificación de cita textual. Cada cita del LLM se compara mediante cadenas de texto programáticamente con el documento fuente. No encontrada —\verification_status="failed"\, afirmación descartada.
Votación en conjunto. Cada enriquecimiento se ejecuta N veces con diferentes semillas (por defecto 3). Las afirmaciones con acuerdo de 2/3+ obtienen alta confianza. El desacuerdo es visible en el resultado final.
La fórmula de confianza en código:
Cada peso tiene un campo obligatorio \weight_justification\. Esquema predeterminado: 0.4 para marcadores estructurales, 0.3 para umbrales numéricos, 0.2 para patrones regex, 0.1 para extracción semántica del LLM (la más baja, por ser la más subjetiva).
En predicciones —\adversarial_analysis\ y \falsification_criteria\ obligatorios. Pydantic rechaza valores vacíos.
La ingeniería de prompts de LLM es el diez por ciento del trabajo. El noventa por ciento es el código alrededor del LLM que captura y descarta lo que el LLM inventó.
Parte 5. ¿Se puede confiar en los reguladores?
Objeción natural: si la metodología se basa en documentos regulatorios, y los reguladores están demostrablemente sesgados —¿qué sostiene la confianza?
Validez de la crítica. La puerta giratoria entre la SEC y la industria está documentada (Mary Jo White, Jay Clayton). La aplicación selectiva es real —Madoff no fue atrapado durante 16 años a pesar de los informes de denunciante de Markopolos en 2000, 2005, 2007. Después de 2008, cero altos ejecutivos de grandes bancos recibieron procesamientos penales frente a más de 1,000 condenas después de la crisis de S&L de los años 80. La división de cumplimiento de la SEC tiene 1,300 personas frente a una industria de millones.
Por qué esto no es relevante para la metodología.
El sesgo funciona en una dirección. Un regulador puede negarse a presentar un caso. Pero publicar una orden de 105 páginas es una categoría diferente de decisión. En ese punto, el riesgo del regulador es exagerar, no subestimar: el oponente tiene los recursos para desmantelar argumentos débiles en los tribunales.
SEBI ≠ SEC. SEBI contra una firma estadounidense —la política está invertida: demostrar soberanía, defender al minorista doméstico. La aplicación transfronteriza es sistemáticamente más dura que la doméstica.
Números vs narrativa. La orden de SEBI tiene narrativa ("manipulación", "esquema siniestro") y una sección fáctica con números específicos (Tablas 7, 8, 16, 17). La narrativa puede ser manipulada. Los números provienen de registros de intercambio e informes de corredores que la propia Jane Street presentó en los sistemas regulatorios indios. Falsificar números es responsabilidad penal para los empleados del regulador.
Validación adversarial. Jane Street está luchando activamente. Abogados de primer nivel. Presentaron una apelación. Cuestionan la interpretación ("esto no es manipulación, es arbitraje"), no los hechos ("no compramos tanto subyacente"). Si los números fueran fabricados, ese sería su primer argumento en SAT. El sistema adversarial está haciendo su trabajo.
Lo que la metodología hace con esto. Separación por tipo de afirmación: afirmaciones fácticas → confianza (verificables, validadas adversarialmente); afirmaciones causales/de intención → triangular contra otras fuentes; caracterizaciones legales → no es nuestro dominio, esperar la orden final. El interrogatorio adversarial de documentos (Parte 3.6) específicamente compra la perspectiva de la defensa desde el propio documento.
Los reguladores no son neutrales. Pero las órdenes de cumplimiento publicadas pasan por un filtro adversarial que hace que sus afirmaciones fácticas sean más robustas que la mayoría de las fuentes alternativas. Confía en los números, no en la narrativa.
Parte 6. Mecánica cuantitativa: el libro de órdenes el 17 de enero de 2024
"Jane Street tenía el 20%+ del valor diario negociado" suena como una prueba irrefutable —por sí solo, no prueba nada.
BANKNIFTY es un índice de los 12 bancos indios más grandes. Las opciones sobre índices se liquidan en efectivo contra el promedio ponderado de los últimos 30 minutos de negociación de los constituyentes. Un creador de mercado que mantiene una posición gamma grande en ese momento está obligado a cubrirse mediante efectivo y futuros.
La cobertura de un creador de mercado técnicamente mueve el mercado. Si tu posición de opciones requiere vender $200M de subyacente en 30 minutos, tu propio flujo crea presión a la baja. Eso es física, no intención.
Números de la orden
SEBI documenta el 17 de enero de 2024 como el día más ilustrativo. Números de las páginas 25-40 (Tablas 7, 8, 16, 17):
Parte 7. Qué te dan estas técnicas hoy
Desciframos una orden de 2025 sobre eventos de 2023-2024 —¿qué te da eso ahora? Si el único resultado fuera una reconstrucción de una estrategia obsoleta, esto sería metodología para periodistas, no para traders.
Cada técnica es un detector de patrones que se ejecuta con datos de hoy. Jane Street es un caso de enseñanza. Cinco aplicaciones a datos en vivo:
- Apalancamiento 7.3x como firma detectora. Cualquier creador de mercado observable a través de datos públicos (13F combinado + datos de Options Clearing Corp + informes de volumen de la plaza) que ejecute ratios de opciones nocional / posición subyacente por encima de 5x es una configuración de Jane Street pre-2025. El monitoreo activo de las 20-30 firmas HFT más grandes proporciona alerta temprana para: (a) volatilidad corta en ETFs con exposición si un regulador comienza a moverse, (b) oportunidades de capacidad si una firma sale después de una acción de cumplimiento.
- Análisis de impacto LTP como diligencia debida. El método de SEBI ahora es parte del kit de herramientas regulatorias. Cualquier asignador después de julio de 2025 debería estar solicitando métricas de impacto LTP en el DDQ. Si tu fondo ejecuta creación de mercado —construye este monitoreo internamente ahora.
- Patrón de P&L asimétrico para detección en tiempo real. Para cada estrategia multi-pierna en tu atribución de cartera, verifica patrones sistemáticos de pérdida líder entre piernas. Si existen —riesgo de cumplimiento independientemente de la intención.
- Opciones indias como una percepción estructural procesable. El 61% de las opciones sobre acciones globales por volumen se negocian en India (datos de abril de 2025). Jane Street se retiró —el vacío de liquidez se está distribuyendo entre Tower, Citadel Securities, Optiver, IMC. Una ventana abierta por 6-18 meses, después de la cual es probable que SEBI introduzca límites de participación. Operaciones en vivo: construcción de capacidad en India, posiciones cortas en firmas con ingresos desproporcionados en India sin diversificación.
- JSI/JSI2/Singapur/Hong Kong como plantilla de arbitraje regulatorio. Esta estructura fue utilizada por al menos una docena de firmas HFT extranjeras. SEBI está estableciendo precedente. Para cualquier HFT extranjera a la que tengas exposición (directa o mediante ETF), verifica los registros públicos para enrutamiento DTAA. Si está presente —ajusta al alza la prima de riesgo regulatorio.
Cada uno es un patrón histórico convertido en un criterio de detección prospectivo. La metodología para identificar (a) estructuras de opciones apalancadas, (b) comportamiento agresivo de impacto LTP, (c) huellas dactilares de PnL asimétrico, (d) oportunidades en mercados estructuralmente distorsionados, (e) arquitecturas de arbitraje regulatorio —herramientas en vivo, aplicables a los 8-K, 13D, ADV de hoy.
Parte 8. Qué hay en el repositorio
Si cada técnica funciona en modo de un solo disparo, nada impide convertirla en monitoreo continuo a través de feeds RSS de reguladores, asignaciones de patentes USPTO, APIs de presentaciones judiciales. Y más allá —extraer patrones estructurales recurrentes de casos analizados y emparejarlos con otros fondos. Arquitectónicamente, la misma base de código. Tres commits:
Commit 1: Plataforma. Seis técnicas en \src/reverse_quant/techniques/\. CachedCorpus. Envoltorio del cliente de Anthropic con reintento y seguimiento de costos. Descargador de EDGAR para 13F y ADV. Notebook 01: extremo a extremo en el documento de SEBI —el análisis de este artículo, ejecutable por $4-8.
Commit 2: Capa de monitoreo. \monitors/\ —sondeador RSS de EDGAR (funcionando), stubs de USPTO/PACER/prensa reguladora. \pipelines/\ —triage/enriquecimiento/dedup/orquestador. \alerts/\ —stdout/archivo funcionando, stubs de Slack/correo electrónico. Almacenamiento SQLite con esquema de procedencia completo. Notebook 04 muestra cómo la verificación atrapa afirmaciones alucinadas.
Commit 3: Propagación de patrones. \patterns/\ —extracción/biblioteca/emparejamiento/predicción. Tres patrones semilla del caso Jane Street, curados a mano, marcados \reviewed_by_human=True\. Fórmula de confianza transparente en código. Análisis adversarial obligatorio y criterios de falsificación en cada predicción. Notebooks 05-06.
Stack: Python 3.11+, type hints, limpio con ruff/mypy, pruebas con clientes LLM simulados, SQLAlchemy, Pydantic v2. Licencia MIT.
Descarga la orden de SEBI a través del enlace en \data/README.md\; la ejecución cuesta ~$4-8.
Lo que no puedes obtener ni siquiera con el mejor LLM
- Datos de tick para verificación directa de las afirmaciones de SEBI no están disponibles públicamente
- Los registros de cumplimiento internos de Jane Street están ausentes —no sabes lo que la firma vio en tiempo real
- Intención —un LLM no puede distinguir entre manipulación y creación de mercado, requiere descubrimiento
- Verificación numérica —Claude confundió crore con millones de dólares al menos una vez por cada diez ejecuciones. Cada número se verifica a mano
- Lo que sucede después —la orden final podría exonerar, condenar o confirmar parcialmente
Final
El documento de un regulador es el artefacto con mayor densidad de información que un fondo deja en público. No porque revele la estrategia (revela menos que un 13F), sino porque es el único documento no escrito por el fondo ni por su equipo de marketing. SEC, SEBI, FCA —estas personas tienen poder de citación y escriben para los tribunales, no para el público.
En 2020, descifrar la estructura de un fondo de cobertura promedio costaba $50-100k y 2-3 meses de tiempo de analista senior. En 2026 —$50-100 y una tarde. Un nuevo equilibrio, en el que los fondos conscientes de que su huella pública se está analizando de esta manera comenzarán a controlarla más cuidadosamente —creando la siguiente ronda del juego.
Si trabajas en un fondo o asignador interesado en uso interno —consultoría cerrada disponible.





