Nos mantuvimos en silencio y construimos la búsqueda MÁS RÁPIDA del mundo

@KZouAPT
INGLÉShace 6 horas · 21 jul 2026
399K
351
82
146
138

TL;DR

Octen presenta una API de búsqueda nativa de IA diseñada para agentes de alta concurrencia, con una latencia de 62ms y precios disruptivos de $1 por cada 1,000 llamadas. Creada por veteranos en búsqueda, su objetivo es reemplazar las arquitecturas de búsqueda centradas en humanos.

La búsqueda fue diseñada para humanos. Escribes una consulta, revisas los resultados, ajustas y vuelves a intentarlo.

Treinta años de infraestructura están diseñados alrededor de ese ciclo.

Los agentes de IA NO funcionan así. Un agente quiere hacer una pregunta desde muchos ángulos a la vez y obtener todo junto.

Pero las APIs de búsqueda que alimentan a los agentes hoy son el mismo ciclo humano envuelto en un endpoint.

Una consulta de entrada, una respuesta de salida, cientos de milisegundos cada una.

Pasamos el último año reconstruyendo la búsqueda para lo que realmente está buscando. No publicamos mucho al respecto.

Honestamente, no estábamos listos. A principios de este año sentía que estábamos quizás al 70% de nuestras propias expectativas, y no quería hacer ruido sobre un 70%.

Ahora estamos listos.

Los números

La API de búsqueda web de Octen devuelve resultados en 62ms (P50) con un P90 de 68ms, medido en SealQA Hard.

Eso es varias veces más rápido que Exa, Parallel y servicios similares.

La alternativa más rápida mide alrededor de 244ms. La más lenta, por encima de 2.6 segundos.

Kuan Zou - inline image

Un detalle en este gráfico importa más que el titular: la brecha entre nuestro P50 y P90 es de 6ms. Para algunos servicios es de más de un segundo.

Si tu agente no puede predecir cuánto tarda una búsqueda, no puede planificar en torno a ella.

El precio es de $1 por cada 1,000 llamadas. La mayoría de los servicios en esta categoría cobran de $4 a $9.

En cuanto a calidad: Octen Embedding es #1 en RTEB, y nuestro modelo de embedding VL es #1 en MMEB-v2.

Publicamos modelos de embedding de texto como código abierto y se han descargado más de 500,000 veces en cinco meses.

En DeepResearch Bench puntuamos por encima de OpenAI Deep Research, Gemini y Grok por 10 a 17 puntos.

En FreshQA Strict y SimpleQA lideramos sobre todos los proveedores con los que nos comparamos.

Kuan Zou - inline image

Nota: Todos los benchmarks son públicos y reproducibles. Enlaces al final.

Por qué empecé esto

Mi nombre es Kuan Zou. Antes de Octen, fui líder de producto de búsqueda con IA en Alibaba Cloud durante cinco años, gestionando sistemas que atendían a cientos de millones de usuarios.

Antes de eso, construí la plataforma de búsqueda empresarial de Baidu desde cero.

Cada año en Alibaba, mi trabajo era sobrevivir al Black Friday. Miles de millones de consultas en un día, y sin tolerancia al fracaso.

Así que cuando vi las APIs de búsqueda que se les daban a los agentes de IA, me sorprendí genuinamente. La mayoría empiezan a fallar cuando las consultas por segundo llegan a las decenas.

Un agente que realiza trabajo real lanzará 20, 50, 100 búsquedas juntas. La infraestructura de la que más dependen los agentes es la parte que falla primero.

Recaudamos una inversión semilla de $10M liderada por Square Peg, reunimos un equipo de Alibaba, Baidu, Meta, Google, TikTok, DeepSeek y Xiaohongshu, y nos pusimos a trabajar.

De lineal a concurrente

Dale a Octen una pregunta y la descompone en docenas de subconsultas, las dispara todas simultáneamente y ensambla todo lo que regresa en una sola respuesta.

No una consulta a la vez. Todas a la vez.

Kuan Zou - inline image
Kuan Zou - inline image
Kuan Zou - inline image

Esto es lo que hace con la investigación profunda: un informe completo con fuentes en menos de 3 minutos. Los sistemas que tardan más de una hora en la misma tarea puntúan por debajo de nosotros en DeepResearch Bench.

Kuan Zou - inline image

A 62ms, la búsqueda deja de comportarse como una herramienta externa y comienza a comportarse como memoria.

Tu agente razona sobre la web en vivo a una velocidad cercana a la que razona sobre su propio contexto.

Eso abre aplicaciones que antes no eran prácticas. Agentes de trading en tiempo real. Datos de deportes y mercados en vivo. Agentes de voz que responden sin la pausa incómoda.

Kuan Zou - inline image

Construido para la confiabilidad

Una sola cuenta de Octen soporta más de 1,000,000 de consultas por segundo. El contenido nuevo se indexa en menos de 5 minutos de su publicación.

También ofrecemos QPS garantizado con un SLA.

Hasta donde sé, somos los únicos en esta categoría que pueden prometer esto, porque solo es posible cuando posees el índice de principio a fin. Y lo hacemos.

Kuan Zou - inline image

Más allá del texto, ejecutamos búsqueda de imágenes y búsqueda de videos, y fundamentamos la generación de imágenes y videos con referencias reales de la web en vivo.

Esta capa está ahora en acceso anticipado.

Kuan Zou - inline image

Cómo es también 5 veces más barato

No hay truco.

La mayoría de los productos de "búsqueda para IA" están construidos sobre pilas de búsqueda de código abierto que fueron diseñadas para humanos. Tomaron el motor detrás de un cuadro de consulta y lo movieron detrás de una API.

La tecnología no cambió. Solo cambió la interfaz. Llamar a eso "búsqueda para IA" no tiene sentido.

Reconstruimos todo. El motor de búsqueda, la clasificación, la capa de servicio, todo escrito desde cero para consumo de máquinas. Nada en nuestra pila fue diseñado para que una persona desplazara resultados.

Por eso el precio es posible. Un motor completamente nativo para IA no hereda treinta años de sobrecarga de búsqueda humana. El negocio es saludable a $1 por cada 1,000 llamadas. Esto no es un subsidio a punto de expirar.

El precio es la prueba más honesta de la arquitectura. Cualquiera puede afirmar que su búsqueda está construida para IA. La estructura de costos muestra si es verdad.

Algunas empresas en esta categoría ya ejecutan nuestra API contra la suya todos los días.

Lo tomo como un cumplido.

Por qué lo comparto todo

Saber lo que hacemos y poder construirlo son problemas diferentes.

Nuestro foso es un equipo que ha pasado una década manejando uno de los tráficos de búsqueda más difíciles del mundo.

Los primeros en moverse educaron al mercado, y estoy agradecido por eso.

Pero los desarrolladores siempre revisan los números y se dirigen a lo que mejor funciona y cuesta menos.

Creo que ese es el mercado más honesto del mundo.

Los incumbentes pasaron los últimos dos años en marketing. Nosotros los pasamos en ingeniería.

Ahora la ingeniería es pública.

La era física

La próxima generación de IA no vive en una pantalla.

Gafas, robótica, modelos del mundo. En ese mundo, la búsqueda se convierte en los ojos: percepción en tiempo real de la web en vivo.

Un robot no puede esperar 3 segundos por una respuesta.

Cuando la búsqueda regresa en decenas de milisegundos, la interacción en tiempo real para la IA física finalmente supera el cuello de botella que la ha frenado.

En esa era, no creo que nada por encima de 100ms de latencia sobreviva. Hoy somos los únicos por debajo de esa barra.

La pila de agentes se está consolidando en tres piezas: modelos fundamentales, GPUs y búsqueda en vivo.

Las dos primeras son problemas resueltos con ganadores claros. La tercera aún se está decidiendo. Esa es la carrera que pretendemos ganar.

Pruébalo tú mismo

Los benchmarks son públicos y la API está abierta.

$1 por cada 1,000 llamadas, con $5 en crédito gratuito. Disponible como API, como Skills, a través de MCP y desde la CLI. Funciona en Claude Code, Cursor, VS Code y cualquier cliente MCP.

Pruébanos contra lo que estés usando hoy.

Las mismas consultas, lado a lado. Publica lo que encuentres.

Las empresas en esta categoría ya nos evalúan a diario, y tú también deberías hacerlo.

Documentación: docs.octen.ai

Nota: Las cifras de latencia y precisión se midieron en SealQA Hard, FreshQA Strict y SimpleQA. La fecha de prueba y la región están marcadas en cada gráfico. Reproduce el benchmark: https://github.com/Octen-Team/search-eval

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales