Mantivemos o silêncio e construímos a busca MAIS RÁPIDA do planeta

@KZouAPT
INGLÊShá 6 horas · 21/07/2026
399K
351
82
146
138

TL;DR

A Octen apresenta uma API de busca nativa em IA projetada para agentes de alta concorrência, oferecendo 62ms de latência e um preço disruptivo de US$ 1 por 1.000 chamadas. Criada por veteranos em busca, ela visa substituir as pilhas de busca centradas em humanos.

A busca foi construída para humanos. Você digita uma consulta, analisa os resultados, refina e tenta novamente.

Trinta anos de infraestrutura foram projetados em torno desse ciclo.

Agentes de IA NÃO funcionam assim. Um agente quer fazer uma pergunta de vários ângulos ao mesmo tempo e obter tudo de volta integrado.

Mas as APIs de busca que alimentam os agentes hoje são o mesmo ciclo humano encapsulado em um endpoint.

Uma consulta enviada, uma resposta recebida, centenas de milissegundos cada.

Passamos o último ano reconstruindo a busca para quem realmente está fazendo a busca. Não publicamos muito sobre isso.

Sinceramente, não estávamos prontos. No início deste ano, sentia que estávamos talvez em 70% das nossas próprias expectativas, e não queria fazer barulho sobre 70%.

Estamos prontos agora.

Os números

A API de busca web da Octen retorna resultados em 62ms (P50) com um P90 de 68ms, medido no SealQA Hard.

Isso é várias vezes mais rápido que Exa, Parallel e serviços similares.

A alternativa mais rápida mede cerca de 244ms. A mais lenta, acima de 2,6 segundos.

Kuan Zou - inline image

Um detalhe neste gráfico importa mais do que o título: a diferença entre nosso P50 e P90 é de 6ms. Para alguns serviços, é de mais de um segundo.

Se seu agente não consegue prender quanto tempo uma busca leva, ele não consegue se planejar em torno disso.

O preço é de $1 por 1.000 chamadas. A maioria dos serviços nesta categoria cobra de $4 a $9.

Em qualidade: o Octen Embedding é #1 no RTEB, e nosso modelo de embedding VL é #1 no MMEB-v2.

Disponibilizamos modelos de embedding de texto como código aberto e eles foram baixados mais de 500.000 vezes em cinco meses.

No DeepResearch Bench, pontuamos acima do OpenAI Deep Research, Gemini e Grok por 10 a 17 pontos.

No FreshQA Strict e SimpleQA, lideramos todos os fornecedores contra os quais testamos.

Kuan Zou - inline image

Nota: Todos os benchmarks são públicos e reproduzíveis. Links no final.

Por que comecei isso

Meu nome é Kuan Zou. Antes da Octen, fui líder de produto de busca com IA na Alibaba Cloud por cinco anos, gerenciando sistemas que atendiam centenas de milhões de usuários.

Antes disso, construí a plataforma de busca empresarial do Baidu do zero.

Todos os anos na Alibaba, meu trabalho era sobreviver à Black Friday. Bilhões de consultas em um dia, e tolerância zero para falhas.

Então, quando olhei para as APIs de busca sendo fornecidas aos agentes de IA, fiquei genuinamente surpreso. A maioria delas começa a falhar quando as consultas por segundo chegam às dezenas.

Um agente realizando trabalho real vai disparar 20, 50, 100 buscas juntas. A infraestrutura da qual os agentes mais dependem é a parte que falha primeiro.

Levantamos um seed de $10M liderado pela Square Peg, reunimos uma equipe da Alibaba, Baidu, Meta, Google, TikTok, DeepSeek e Xiaohongshu, e começamos a trabalhar.

Do linear ao concorrente

Dê à Octen uma pergunta e ela a decompõe em dezenas de subconsultas, dispara todas simultaneamente e monta tudo o que retorna em uma única resposta.

Não uma consulta de cada vez. Todas de uma vez.

Kuan Zou - inline image
Kuan Zou - inline image
Kuan Zou - inline image

Isto é o que ela faz com pesquisa aprofundada: um relatório completo com fontes em menos de 3 minutos. Sistemas que levam mais de uma hora na mesma tarefa pontuam abaixo de nós no DeepResearch Bench.

Kuan Zou - inline image

A 62ms, a busca deixa de se comportar como uma ferramenta externa e começa a se comportar como memória.

Seu agente raciocina sobre a web ao vivo a uma velocidade próxima daquela com que raciocina sobre seu próprio contexto.

Isso abre aplicações que não eram práticas antes. Agentes de negociação em tempo real. Dados esportivos e de mercado ao vivo. Agentes de voz que respondem sem a pausa estranha.

Kuan Zou - inline image

Construído para confiabilidade

Uma única conta Octen suporta mais de 1.000.000 de consultas por segundo. Novo conteúdo é indexado em menos de 5 minutos após a publicação.

Também oferecemos QPS garantido com um SLA.

Tanto quanto sei, somos os únicos nesta categoria que podem prometer isso, porque só é possível quando você possui o índice de ponta a ponta. Nós possuímos.

Kuan Zou - inline image

Além de texto, executamos busca de imagens e busca de vídeos, e fundamentamos a geração de imagens e vídeos com referências reais da web ao vivo.

Esta camada está em acesso antecipado agora.

Kuan Zou - inline image

Como também é 5x mais barato

Não há truque.

A maioria dos produtos de "busca para IA" é construída sobre pilhas de busca de código aberto que foram projetadas para humanos. Eles pegaram o motor por trás de uma caixa de consulta e o moveram para trás de uma API.

A tecnologia não mudou. Apenas a interface mudou. Chamar isso de "busca para IA" não faz sentido.

Reconstruímos tudo. O mecanismo de busca, a classificação, a camada de serviço, tudo escrito do zero para consumo por máquina. Nada em nossa pilha foi projetado para uma pessoa rolando resultados.

É por isso que o preço é possível. Um mecanismo totalmente nativo para IA não herda trinta anos de custos indiretos de busca humana. O negócio é saudável a $1 por 1.000 chamadas. Isso não é um subsídio esperando para expirar.

O preço é a prova mais honesta da arquitetura. Qualquer um pode afirmar que sua busca é construída para IA. A estrutura de custos mostra se é verdade.

Algumas empresas nesta categoria já executam nossa API contra a delas todos os dias.

Levo isso como um elogio.

Por que estou compartilhando tudo

Saber o que fazemos e ser capaz de construir são problemas diferentes.

Nosso fosso é uma equipe que passou uma década lidando com alguns dos tráfegos de busca mais difíceis do mundo.

Os primeiros movimentos educaram o mercado, e sou grato por isso.

Mas os desenvolvedores sempre verificam os números, e roteiam para o que tem melhor desempenho e menor custo.

Acho que esse é o mercado mais honesto do mundo.

Os incumbentes passaram os últimos dois anos em marketing. Nós os passamos em engenharia.

Agora a engenharia é pública.

A era física

A próxima geração de IA não vive em uma tela.

Óculos, robótica, modelos de mundo. Nesse mundo, a busca se torna os olhos: percepção em tempo real da web ao vivo.

Um robô não pode esperar 3 segundos por uma resposta.

Quando a busca retorna em dezenas de milissegundos, a interação em tempo real para a IA física finalmente rompe o gargalo que a tem impedido.

Nessa era, não acredito que nada acima de 100ms de latência sobreviva. Hoje somos os únicos abaixo dessa barreira.

A pilha de agentes está se estabelecendo em três partes: modelos de fundação, GPUs e busca ao vivo.

As duas primeiras são problemas resolvidos com vencedores claros. A terceira ainda está sendo decidida. Essa é a corrida que pretendemos vencer.

Teste você mesmo

Os benchmarks são públicos e a API está aberta.

$1 por 1.000 chamadas, com $5 em crédito gratuito. Disponível como API, como Skills, via MCP e pelo CLI. Funciona no Claude Code, Cursor, VS Code e qualquer cliente MCP.

Execute-nos contra o que você estiver usando hoje.

Mesmas consultas, lado a lado. Publique o que encontrar.

Empresas nesta categoria já nos comparam diariamente, e você também deveria.

Documentação: docs.octen.ai

Nota: Latência e precisão medidas no SealQA Hard, FreshQA Strict e SimpleQA. Data e região do teste estão carimbadas em cada gráfico. Reproduza o benchmark: https://github.com/Octen-Team/search-eval

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais