La búsqueda fue creada para humanos. Escribes una consulta, escaneas los resultados, refinas y vuelves a intentarlo.
Treinta años de infraestructura están diseñados en torno a ese ciclo.
Los agentes de IA NO funcionan así. Un agente quiere hacer una pregunta desde muchos ángulos a la vez y obtener todo de vuelta junto.
Pero las APIs de búsqueda que alimentan a los agentes hoy son el mismo ciclo humano envuelto en un endpoint.
Una consulta de entrada, una respuesta de salida, cientos de milisegundos cada una.
Pasamos el último año reconstruyendo la búsqueda para la cosa que realmente está buscando. No publicamos mucho al respecto.
Honestamente, no estábamos listos. A principios de este año sentía que estábamos al 70% de nuestras propias expectativas, y no quería hacer ruido sobre un 70%.
Ahora estamos listos.
Los números
La API de búsqueda web de Octen devuelve resultados en 62ms (P50) con un P90 de 68ms, medido en SealQA Hard.
Eso es varias veces más rápido que Exa, Parallel y servicios similares.
La alternativa más rápida mide alrededor de 244ms. La más lenta, por encima de 2.6 segundos.

Un detalle en este gráfico importa más que el titular: la brecha entre nuestro P50 y P90 es de 6ms. Para algunos servicios es de más de un segundo.
Si tu agente no puede predecir cuánto tarda una búsqueda, no puede planificar en torno a ella.
El precio es de $1 por cada 1,000 llamadas. La mayoría de los servicios en esta categoría cobran entre $4 y $9.
En calidad: Octen Embedding es #1 en RTEB, y nuestro modelo de embedding VL es #1 en MMEB-v2.
Publicamos modelos de embedding de texto como código abierto y se han descargado más de 500,000 veces en cinco meses.
En DeepResearch Bench puntuamos por encima de OpenAI Deep Research, Gemini y Grok por 10 a 17 puntos.
En FreshQA Strict y SimpleQA lideramos frente a todos los proveedores con los que probamos.

Nota: Todos los benchmarks son públicos y reproducibles. Enlaces al final.
Por qué empecé esto
Me llamo Kuan Zou. Antes de Octen, fui líder de producto de búsqueda con IA en Alibaba Cloud durante cinco años, gestionando sistemas que servían a cientos de millones de usuarios.
Antes de eso, construí la plataforma de búsqueda empresarial de Baidu desde cero.
Cada año en Alibaba, mi trabajo era sobrevivir al Black Friday. Miles de millones de consultas en un día, y sin tolerancia al fracaso.
Así que cuando miré las APIs de búsqueda que se les daban a los agentes de IA, me sorprendió genuinamente. La mayoría empiezan a fallar cuando las consultas por segundo alcanzan las decenas.
Un agente haciendo trabajo real activará 20, 50, 100 búsquedas juntas. La infraestructura de la que más dependen los agentes es la parte que falla primero.
Recaudamos una ronda semilla de $10M liderada por Square Peg , reunimos un equipo de Alibaba, Baidu, Meta, Google, TikTok, DeepSeek y Xiaohongshu, y nos pusimos a trabajar.
De lineal a concurrente
Dale a Octen una pregunta y la descompone en docenas de subconsultas, las dispara todas simultáneamente y ensambla todo lo que regresa en una sola respuesta.
No una consulta a la vez. Todas a la vez.



Esto es lo que hace con la investigación profunda: un informe completo con fuentes en menos de 3 minutos. Los sistemas que tardan más de una hora en la misma tarea puntúan por debajo de nosotros en DeepResearch Bench.

A 62ms, la búsqueda deja de comportarse como una herramienta externa y empieza a comportarse como memoria.
Tu agente razona sobre la web en vivo a una velocidad cercana a la que razona sobre su propio contexto.
Eso abre aplicaciones que antes no eran prácticas. Agentes de trading en tiempo real. Datos de deportes y mercado en vivo. Agentes de voz que responden sin la pausa incómoda.

Construido para la fiabilidad
Una sola cuenta de Octen soporta más de 1,000,000 de consultas por segundo. El contenido nuevo se indexa en menos de 5 minutos desde su publicación.
También ofrecemos QPS garantizado con un SLA.
Hasta donde sé, somos los únicos en esta categoría que pueden prometer esto, porque solo es posible cuando posees el índice de principio a fin. Nosotros lo hacemos.

Más allá del texto, ejecutamos búsqueda de imágenes y búsqueda de video, y fundamentamos la generación de imágenes y video con referencias reales de la web en vivo.
Esta capa está ahora en acceso anticipado.

Cómo es también 5 veces más barato
No hay truco.
La mayoría de los productos de "búsqueda para IA" están construidos sobre stacks de búsqueda de código abierto que fueron diseñados para humanos. Tomaron el motor detrás de un cuadro de consulta y lo movieron detrás de una API.
La tecnología no cambió. Solo cambió la interfaz. Llamar a eso "búsqueda para IA" no tiene sentido.
Lo reconstruimos todo. El motor de búsqueda, la clasificación, la capa de servicio, todo escrito desde cero para consumo de máquinas. Nada en nuestro stack fue diseñado para una persona desplazando resultados.
Por eso el precio es posible. Un motor completamente nativo para IA no hereda treinta años de sobrecarga de búsqueda humana. El negocio es saludable a $1 por cada 1,000 llamadas. Esto no es un subsidio a punto de caducar.
El precio es la prueba más honesta de la arquitectura. Cualquiera puede afirmar que su búsqueda está construida para IA. La estructura de costos muestra si es verdad.
Algunas empresas en esta categoría ya ejecutan nuestra API contra la suya todos los días.
Lo tomo como un cumplido.
Por qué comparto todo
Saber lo que hacemos y poder construirlo son problemas diferentes.
Nuestro foso es un equipo que ha pasado una década manejando uno de los tráficos de búsqueda más difíciles del mundo.
Los primeros en moverse educaron al mercado, y estoy agradecido por eso.
Pero los desarrolladores siempre revisan los números, y se dirigen a lo que mejor rinde y menos cuesta.
Creo que ese es el mercado más honesto del mundo.
Los incumbentes pasaron los últimos dos años en marketing. Nosotros los pasamos en ingeniería.
Ahora la ingeniería es pública.
La era física
La próxima generación de IA no vive en una pantalla.
Gafas, robótica, modelos del mundo. En ese mundo, la búsqueda se convierte en los ojos: percepción en tiempo real de la web en vivo.
Un robot no puede esperar 3 segundos por una respuesta.
Cuando la búsqueda regresa en decenas de milisegundos, la interacción en tiempo real para la IA física finalmente supera el cuello de botella que la ha retenido.
En esa era, no creo que nada por encima de 100ms de latencia sobreviva. Hoy somos los únicos por debajo de esa barrera.
El stack de agentes se está asentando en tres piezas: modelos fundacionales, GPUs y búsqueda en vivo.
Las dos primeras son problemas resueltos con ganadores claros. La tercera aún se está decidiendo. Esa es la carrera que pretendemos ganar.
Pruébalo tú mismo
Los benchmarks son públicos y la API está abierta.
$1 por cada 1,000 llamadas, con $5 en crédito gratis. Disponible como API, como Skills, a través de MCP y desde la CLI. Funciona en Claude Code, Cursor, VS Code y cualquier cliente MCP.
Pruébanos contra lo que estés usando hoy.
Mismas consultas, lado a lado. Publica lo que encuentres.
Las empresas en esta categoría ya nos evalúan a diario, y tú también deberías.
Docs: docs.octen.ai
Nota: Las cifras de latencia y precisión se midieron en SealQA Hard, FreshQA Strict y SimpleQA. La fecha y región de la prueba están selladas en cada gráfico. Reproduce el benchmark: https://github.com/Octen-Team/search-eval





