A busca foi construída para humanos. Você digita uma consulta, analisa os resultados, refina e tenta novamente.
Trinta anos de infraestrutura foram projetados em torno desse ciclo.
Agentes de IA NÃO funcionam assim. Um agente quer fazer uma pergunta de vários ângulos ao mesmo tempo e obter tudo de volta integrado.
Mas as APIs de busca que alimentam os agentes hoje são o mesmo ciclo humano encapsulado em um endpoint.
Uma consulta enviada, uma resposta recebida, centenas de milissegundos cada.
Passamos o último ano reconstruindo a busca para quem realmente está fazendo a busca. Não publicamos muito sobre isso.
Sinceramente, não estávamos prontos. No início deste ano, sentia que estávamos talvez em 70% das nossas próprias expectativas, e não queria fazer barulho sobre 70%.
Estamos prontos agora.
Os números
A API de busca web da Octen retorna resultados em 62ms (P50) com um P90 de 68ms, medido no SealQA Hard.
Isso é várias vezes mais rápido que Exa, Parallel e serviços similares.
A alternativa mais rápida mede cerca de 244ms. A mais lenta, acima de 2,6 segundos.

Um detalhe neste gráfico importa mais do que o título: a diferença entre nosso P50 e P90 é de 6ms. Para alguns serviços, é de mais de um segundo.
Se seu agente não consegue prender quanto tempo uma busca leva, ele não consegue se planejar em torno disso.
O preço é de $1 por 1.000 chamadas. A maioria dos serviços nesta categoria cobra de $4 a $9.
Em qualidade: o Octen Embedding é #1 no RTEB, e nosso modelo de embedding VL é #1 no MMEB-v2.
Disponibilizamos modelos de embedding de texto como código aberto e eles foram baixados mais de 500.000 vezes em cinco meses.
No DeepResearch Bench, pontuamos acima do OpenAI Deep Research, Gemini e Grok por 10 a 17 pontos.
No FreshQA Strict e SimpleQA, lideramos todos os fornecedores contra os quais testamos.

Nota: Todos os benchmarks são públicos e reproduzíveis. Links no final.
Por que comecei isso
Meu nome é Kuan Zou. Antes da Octen, fui líder de produto de busca com IA na Alibaba Cloud por cinco anos, gerenciando sistemas que atendiam centenas de milhões de usuários.
Antes disso, construí a plataforma de busca empresarial do Baidu do zero.
Todos os anos na Alibaba, meu trabalho era sobreviver à Black Friday. Bilhões de consultas em um dia, e tolerância zero para falhas.
Então, quando olhei para as APIs de busca sendo fornecidas aos agentes de IA, fiquei genuinamente surpreso. A maioria delas começa a falhar quando as consultas por segundo chegam às dezenas.
Um agente realizando trabalho real vai disparar 20, 50, 100 buscas juntas. A infraestrutura da qual os agentes mais dependem é a parte que falha primeiro.
Levantamos um seed de $10M liderado pela Square Peg, reunimos uma equipe da Alibaba, Baidu, Meta, Google, TikTok, DeepSeek e Xiaohongshu, e começamos a trabalhar.
Do linear ao concorrente
Dê à Octen uma pergunta e ela a decompõe em dezenas de subconsultas, dispara todas simultaneamente e monta tudo o que retorna em uma única resposta.
Não uma consulta de cada vez. Todas de uma vez.



Isto é o que ela faz com pesquisa aprofundada: um relatório completo com fontes em menos de 3 minutos. Sistemas que levam mais de uma hora na mesma tarefa pontuam abaixo de nós no DeepResearch Bench.

A 62ms, a busca deixa de se comportar como uma ferramenta externa e começa a se comportar como memória.
Seu agente raciocina sobre a web ao vivo a uma velocidade próxima daquela com que raciocina sobre seu próprio contexto.
Isso abre aplicações que não eram práticas antes. Agentes de negociação em tempo real. Dados esportivos e de mercado ao vivo. Agentes de voz que respondem sem a pausa estranha.

Construído para confiabilidade
Uma única conta Octen suporta mais de 1.000.000 de consultas por segundo. Novo conteúdo é indexado em menos de 5 minutos após a publicação.
Também oferecemos QPS garantido com um SLA.
Tanto quanto sei, somos os únicos nesta categoria que podem prometer isso, porque só é possível quando você possui o índice de ponta a ponta. Nós possuímos.

Além de texto, executamos busca de imagens e busca de vídeos, e fundamentamos a geração de imagens e vídeos com referências reais da web ao vivo.
Esta camada está em acesso antecipado agora.

Como também é 5x mais barato
Não há truque.
A maioria dos produtos de "busca para IA" é construída sobre pilhas de busca de código aberto que foram projetadas para humanos. Eles pegaram o motor por trás de uma caixa de consulta e o moveram para trás de uma API.
A tecnologia não mudou. Apenas a interface mudou. Chamar isso de "busca para IA" não faz sentido.
Reconstruímos tudo. O mecanismo de busca, a classificação, a camada de serviço, tudo escrito do zero para consumo por máquina. Nada em nossa pilha foi projetado para uma pessoa rolando resultados.
É por isso que o preço é possível. Um mecanismo totalmente nativo para IA não herda trinta anos de custos indiretos de busca humana. O negócio é saudável a $1 por 1.000 chamadas. Isso não é um subsídio esperando para expirar.
O preço é a prova mais honesta da arquitetura. Qualquer um pode afirmar que sua busca é construída para IA. A estrutura de custos mostra se é verdade.
Algumas empresas nesta categoria já executam nossa API contra a delas todos os dias.
Levo isso como um elogio.
Por que estou compartilhando tudo
Saber o que fazemos e ser capaz de construir são problemas diferentes.
Nosso fosso é uma equipe que passou uma década lidando com alguns dos tráfegos de busca mais difíceis do mundo.
Os primeiros movimentos educaram o mercado, e sou grato por isso.
Mas os desenvolvedores sempre verificam os números, e roteiam para o que tem melhor desempenho e menor custo.
Acho que esse é o mercado mais honesto do mundo.
Os incumbentes passaram os últimos dois anos em marketing. Nós os passamos em engenharia.
Agora a engenharia é pública.
A era física
A próxima geração de IA não vive em uma tela.
Óculos, robótica, modelos de mundo. Nesse mundo, a busca se torna os olhos: percepção em tempo real da web ao vivo.
Um robô não pode esperar 3 segundos por uma resposta.
Quando a busca retorna em dezenas de milissegundos, a interação em tempo real para a IA física finalmente rompe o gargalo que a tem impedido.
Nessa era, não acredito que nada acima de 100ms de latência sobreviva. Hoje somos os únicos abaixo dessa barreira.
A pilha de agentes está se estabelecendo em três partes: modelos de fundação, GPUs e busca ao vivo.
As duas primeiras são problemas resolvidos com vencedores claros. A terceira ainda está sendo decidida. Essa é a corrida que pretendemos vencer.
Teste você mesmo
Os benchmarks são públicos e a API está aberta.
$1 por 1.000 chamadas, com $5 em crédito gratuito. Disponível como API, como Skills, via MCP e pelo CLI. Funciona no Claude Code, Cursor, VS Code e qualquer cliente MCP.
Execute-nos contra o que você estiver usando hoje.
Mesmas consultas, lado a lado. Publique o que encontrar.
Empresas nesta categoria já nos comparam diariamente, e você também deveria.
Documentação: docs.octen.ai
Nota: Latência e precisão medidas no SealQA Hard, FreshQA Strict e SimpleQA. Data e região do teste estão carimbadas em cada gráfico. Reproduza o benchmark: https://github.com/Octen-Team/search-eval





