Ficamos em silêncio e construímos a busca MAIS RÁPIDA do planeta

@KZouAPT
INGLÊShá 7 horas · 21 de jul. de 2026
399K
351
82
146
138

TL;DR

A Octen apresenta uma API de busca nativa em IA projetada para agentes de alta concorrência, com latência de 62ms e preços disruptivos de US$ 1 por 1.000 chamadas. Criada por veteranos em busca, ela visa substituir as pilhas de busca centradas em humanos.

A busca foi criada para humanos. Você digita uma consulta, examina os resultados, refina e tenta novamente.

Trinta anos de infraestrutura foram projetados em torno desse ciclo.

Agentes de IA NÃO funcionam dessa forma. Um agente quer fazer uma pergunta de vários ângulos ao mesmo tempo e obter tudo de volta de uma vez.

Mas as APIs de busca que alimentam os agentes hoje são o mesmo ciclo humano encapsulado em um endpoint.

Uma consulta enviada, uma resposta recebida, centenas de milissegundos cada.

Passamos o último ano reconstruindo a busca para a coisa que realmente está fazendo a pesquisa. Não publicamos muito sobre isso.

Sinceramente, não estávamos prontos. No início deste ano, senti que estávamos talvez em 70% das nossas próprias expectativas, e não queria fazer barulho sobre 70%.

Estamos prontos agora.

Os números

A API de busca web do Octen retorna resultados em 62ms (P50) com um P90 de 68ms, medido no SealQA Hard.

Isso é várias vezes mais rápido que Exa, Parallel e serviços similares.

A alternativa mais rápida mede cerca de 244ms. A mais lenta, acima de 2,6 segundos.

Kuan Zou - inline image

Um detalhe neste gráfico importa mais do que o título: a diferença entre nosso P50 e P90 é de 6ms. Para alguns serviços, é superior a um segundo.

Se seu agente não consegue prender quanto tempo uma busca leva, ele não consegue planejar em torno disso.

O preço é de $1 por 1.000 chamadas. A maioria dos serviços nesta categoria cobra de $4 a $9.

Em qualidade: o Octen Embedding é #1 no RTEB, e nosso modelo de embedding VL é #1 no MMEB-v2.

Disponibilizamos modelos de embedding de texto como código aberto e eles foram baixados mais de 500.000 vezes em cinco meses.

No DeepResearch Bench, pontuamos acima do OpenAI Deep Research, Gemini e Grok por 10 a 17 pontos.

No FreshQA Strict e SimpleQA, lideramos todos os fornecedores contra os quais testamos.

Kuan Zou - inline image

Nota: Todos os benchmarks são publicados e reproduzíveis. Links no final.

Por que comecei isso

Meu nome é Kuan Zou. Antes do Octen, fui líder de produto de busca com IA na Alibaba Cloud por cinco anos, gerenciando sistemas que atendiam centenas de milhões de usuários.

Antes disso, construí a plataforma de busca empresarial do Baidu do zero.

Todos os anos na Alibaba, meu trabalho era sobreviver à Black Friday. Bilhões de consultas em um dia, e tolerância zero para falhas.

Então, quando olhei para as APIs de busca que estavam sendo fornecidas aos agentes de IA, fiquei genuinamente surpreso. A maioria delas começa a falhar quando as consultas por segundo chegam às dezenas.

Um agente fazendo trabalho real vai disparar 20, 50, 100 buscas juntas. A infraestrutura da qual os agentes mais dependem é a parte que falha primeiro.

Levantamos um seed de $10M liderado pela Square Peg, reunimos uma equipe da Alibaba, Baidu, Meta, Google, TikTok, DeepSeek e Xiaohongshu, e começamos a trabalhar.

Do linear ao concorrente

Dê uma pergunta ao Octen e ele a decompõe em dezenas de subconsultas, dispara todas simultaneamente e monta tudo o que volta em uma única resposta.

Não uma consulta de cada vez. Todas de uma vez.

Kuan Zou - inline image
Kuan Zou - inline image
Kuan Zou - inline image

Isso é o que ele faz para pesquisa aprofundada: um relatório completo com fontes em menos de 3 minutos. Sistemas que levam mais de uma hora na mesma tarefa pontuam abaixo de nós no DeepResearch Bench.

Kuan Zou - inline image

A 62ms, a busca deixa de se comportar como uma ferramenta externa e começa a se comportar como memória.

Seu agente raciocina sobre a web ao vivo a uma velocidade próxima daquela com que raciocina sobre seu próprio contexto.

Isso abre aplicações que antes não eram práticas. Agentes de negociação em tempo real. Dados de esportes e mercado ao vivo. Agentes de voz que respondem sem a pausa estranha.

Kuan Zou - inline image

Construído para confiabilidade

Uma única conta Octen suporta mais de 1.000.000 de consultas por segundo. Novo conteúdo é indexado em até 5 minutos após a publicação.

Também oferecemos QPS garantido com um SLA.

Até onde sei, somos os únicos nesta categoria que podem prometer isso, porque só é possível quando você possui o índice de ponta a ponta. Nós possuímos.

Kuan Zou - inline image

Além de texto, executamos busca de imagens e busca de vídeos, e fundamentamos a geração de imagens e vídeos com referências reais da web ao vivo.

Esta camada está em acesso antecipado agora.

Kuan Zou - inline image

Como também é 5x mais barato

Não há truque.

A maioria dos produtos de "busca para IA" é construída sobre pilhas de busca de código aberto que foram projetadas para humanos. Eles pegaram o motor por trás de uma caixa de consulta e o moveram para trás de uma API.

A tecnologia não mudou. Apenas a interface mudou. Chamar isso de "busca para IA" não faz sentido.

Nós reconstruímos tudo. O mecanismo de busca, a classificação, a camada de serviço, tudo escrito do zero para consumo por máquina. Nada em nossa pilha foi projetado para uma pessoa rolando resultados.

É por isso que o preço é possível. Um motor totalmente nativo para IA não herda trinta anos de sobrecarga de busca humana. O negócio é saudável a $1 por 1.000 chamadas. Isso não é um subsídio esperando para expirar.

O preço é a prova mais honesta da arquitetura. Qualquer um pode afirmar que sua busca é construída para IA. A estrutura de custos mostra se é verdade.

Algumas empresas nesta categoria já executam nossa API contra a delas todos os dias.

Eu considero isso um elogio.

Por que estou compartilhando tudo

Saber o que fazemos e ser capaz de construir são problemas diferentes.

Nosso fosso é uma equipe que passou uma década lidando com alguns dos tráfegos de busca mais difíceis do mundo.

Os pioneiros educaram o mercado, e sou grato por isso.

Mas os desenvolvedores sempre verificam os números e roteiam para o que tiver melhor desempenho e menor custo.

Acho que esse é o mercado mais honesto do mundo.

Os players estabelecidos passaram os últimos dois anos em marketing. Nós os passamos em engenharia.

Agora a engenharia é pública.

A era física

A próxima geração de IA não vive em uma tela.

Óculos, robótica, modelos de mundo. Nesse mundo, a busca se torna os olhos: percepção em tempo real da web ao vivo.

Um robô não pode esperar 3 segundos por uma resposta.

Quando a busca retorna em dezenas de milissegundos, a interação em tempo real para a IA física finalmente rompe o gargalo que a tem impedido.

Nessa era, não acredito que nada acima de 100ms de latência sobreviva. Hoje somos os únicos abaixo dessa barreira.

A pilha de agentes está se consolidando em três partes: modelos de fundação, GPUs e busca ao vivo.

Os dois primeiros são problemas resolvidos com vencedores claros. O terceiro ainda está sendo decidido. Essa é a corrida que pretendemos vencer.

Experimente você mesmo

Os benchmarks são públicos e a API está aberta.

$1 por 1.000 chamadas, com $5 em crédito gratuito. Disponível como API, como Skills, via MCP e pela CLI. Funciona no Claude Code, Cursor, VS Code e em qualquer cliente MCP.

Teste-nos contra o que você estiver usando hoje.

Mesmas consultas, lado a lado. Poste o que encontrar.

Empresas nesta categoria já nos comparam diariamente, e você também deveria.

Documentação: docs.octen.ai

Nota: Números de latência e precisão medidos no SealQA Hard, FreshQA Strict e SimpleQA. Data e região do teste estão carimbadas em cada gráfico. Reproduza o benchmark: https://github.com/Octen-Team/search-eval

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais