La búsqueda fue diseñada para humanos. Escribes una consulta, revisas los resultados, ajustas y vuelves a intentarlo.
Treinta años de infraestructura están diseñados alrededor de ese ciclo.
Los agentes de IA NO funcionan así. Un agente quiere hacer una pregunta desde muchos ángulos a la vez y obtener todo junto.
Pero las APIs de búsqueda que alimentan a los agentes hoy son el mismo ciclo humano envuelto en un endpoint.
Una consulta de entrada, una respuesta de salida, cientos de milisegundos cada una.
Pasamos el último año reconstruyendo la búsqueda para lo que realmente está buscando. No publicamos mucho al respecto.
Honestamente, no estábamos listos. A principios de este año sentía que estábamos quizás al 70% de nuestras propias expectativas, y no quería hacer ruido sobre un 70%.
Ahora estamos listos.
Los números
La API de búsqueda web de Octen devuelve resultados en 62ms (P50) con un P90 de 68ms, medido en SealQA Hard.
Eso es varias veces más rápido que Exa, Parallel y servicios similares.
La alternativa más rápida mide alrededor de 244ms. La más lenta, por encima de 2.6 segundos.

Un detalle en este gráfico importa más que el titular: la brecha entre nuestro P50 y P90 es de 6ms. Para algunos servicios es de más de un segundo.
Si tu agente no puede predecir cuánto tarda una búsqueda, no puede planificar en torno a ella.
El precio es de $1 por cada 1,000 llamadas. La mayoría de los servicios en esta categoría cobran de $4 a $9.
En cuanto a calidad: Octen Embedding es #1 en RTEB, y nuestro modelo de embedding VL es #1 en MMEB-v2.
Publicamos modelos de embedding de texto como código abierto y se han descargado más de 500,000 veces en cinco meses.
En DeepResearch Bench puntuamos por encima de OpenAI Deep Research, Gemini y Grok por 10 a 17 puntos.
En FreshQA Strict y SimpleQA lideramos sobre todos los proveedores con los que nos comparamos.

Nota: Todos los benchmarks son públicos y reproducibles. Enlaces al final.
Por qué empecé esto
Mi nombre es Kuan Zou. Antes de Octen, fui líder de producto de búsqueda con IA en Alibaba Cloud durante cinco años, gestionando sistemas que atendían a cientos de millones de usuarios.
Antes de eso, construí la plataforma de búsqueda empresarial de Baidu desde cero.
Cada año en Alibaba, mi trabajo era sobrevivir al Black Friday. Miles de millones de consultas en un día, y sin tolerancia al fracaso.
Así que cuando vi las APIs de búsqueda que se les daban a los agentes de IA, me sorprendí genuinamente. La mayoría empiezan a fallar cuando las consultas por segundo llegan a las decenas.
Un agente que realiza trabajo real lanzará 20, 50, 100 búsquedas juntas. La infraestructura de la que más dependen los agentes es la parte que falla primero.
Recaudamos una inversión semilla de $10M liderada por Square Peg, reunimos un equipo de Alibaba, Baidu, Meta, Google, TikTok, DeepSeek y Xiaohongshu, y nos pusimos a trabajar.
De lineal a concurrente
Dale a Octen una pregunta y la descompone en docenas de subconsultas, las dispara todas simultáneamente y ensambla todo lo que regresa en una sola respuesta.
No una consulta a la vez. Todas a la vez.



Esto es lo que hace con la investigación profunda: un informe completo con fuentes en menos de 3 minutos. Los sistemas que tardan más de una hora en la misma tarea puntúan por debajo de nosotros en DeepResearch Bench.

A 62ms, la búsqueda deja de comportarse como una herramienta externa y comienza a comportarse como memoria.
Tu agente razona sobre la web en vivo a una velocidad cercana a la que razona sobre su propio contexto.
Eso abre aplicaciones que antes no eran prácticas. Agentes de trading en tiempo real. Datos de deportes y mercados en vivo. Agentes de voz que responden sin la pausa incómoda.

Construido para la confiabilidad
Una sola cuenta de Octen soporta más de 1,000,000 de consultas por segundo. El contenido nuevo se indexa en menos de 5 minutos de su publicación.
También ofrecemos QPS garantizado con un SLA.
Hasta donde sé, somos los únicos en esta categoría que pueden prometer esto, porque solo es posible cuando posees el índice de principio a fin. Y lo hacemos.

Más allá del texto, ejecutamos búsqueda de imágenes y búsqueda de videos, y fundamentamos la generación de imágenes y videos con referencias reales de la web en vivo.
Esta capa está ahora en acceso anticipado.

Cómo es también 5 veces más barato
No hay truco.
La mayoría de los productos de "búsqueda para IA" están construidos sobre pilas de búsqueda de código abierto que fueron diseñadas para humanos. Tomaron el motor detrás de un cuadro de consulta y lo movieron detrás de una API.
La tecnología no cambió. Solo cambió la interfaz. Llamar a eso "búsqueda para IA" no tiene sentido.
Reconstruimos todo. El motor de búsqueda, la clasificación, la capa de servicio, todo escrito desde cero para consumo de máquinas. Nada en nuestra pila fue diseñado para que una persona desplazara resultados.
Por eso el precio es posible. Un motor completamente nativo para IA no hereda treinta años de sobrecarga de búsqueda humana. El negocio es saludable a $1 por cada 1,000 llamadas. Esto no es un subsidio a punto de expirar.
El precio es la prueba más honesta de la arquitectura. Cualquiera puede afirmar que su búsqueda está construida para IA. La estructura de costos muestra si es verdad.
Algunas empresas en esta categoría ya ejecutan nuestra API contra la suya todos los días.
Lo tomo como un cumplido.
Por qué lo comparto todo
Saber lo que hacemos y poder construirlo son problemas diferentes.
Nuestro foso es un equipo que ha pasado una década manejando uno de los tráficos de búsqueda más difíciles del mundo.
Los primeros en moverse educaron al mercado, y estoy agradecido por eso.
Pero los desarrolladores siempre revisan los números y se dirigen a lo que mejor funciona y cuesta menos.
Creo que ese es el mercado más honesto del mundo.
Los incumbentes pasaron los últimos dos años en marketing. Nosotros los pasamos en ingeniería.
Ahora la ingeniería es pública.
La era física
La próxima generación de IA no vive en una pantalla.
Gafas, robótica, modelos del mundo. En ese mundo, la búsqueda se convierte en los ojos: percepción en tiempo real de la web en vivo.
Un robot no puede esperar 3 segundos por una respuesta.
Cuando la búsqueda regresa en decenas de milisegundos, la interacción en tiempo real para la IA física finalmente supera el cuello de botella que la ha frenado.
En esa era, no creo que nada por encima de 100ms de latencia sobreviva. Hoy somos los únicos por debajo de esa barra.
La pila de agentes se está consolidando en tres piezas: modelos fundamentales, GPUs y búsqueda en vivo.
Las dos primeras son problemas resueltos con ganadores claros. La tercera aún se está decidiendo. Esa es la carrera que pretendemos ganar.
Pruébalo tú mismo
Los benchmarks son públicos y la API está abierta.
$1 por cada 1,000 llamadas, con $5 en crédito gratuito. Disponible como API, como Skills, a través de MCP y desde la CLI. Funciona en Claude Code, Cursor, VS Code y cualquier cliente MCP.
Pruébanos contra lo que estés usando hoy.
Las mismas consultas, lado a lado. Publica lo que encuentres.
Las empresas en esta categoría ya nos evalúan a diario, y tú también deberías hacerlo.
Documentación: docs.octen.ai
Nota: Las cifras de latencia y precisión se midieron en SealQA Hard, FreshQA Strict y SimpleQA. La fecha de prueba y la región están marcadas en cada gráfico. Reproduce el benchmark: https://github.com/Octen-Team/search-eval





