Siamo rimasti in silenzio e abbiamo costruito il motore di ricerca PIÙ VELOCE al mondo

@KZouAPT
INGLESE7 ore fa · 21 lug 2026
399K
351
82
146
138

TL;DR

Octen introduce un'API di ricerca nativa per l'IA progettata per agenti ad alta concorrenza, caratterizzata da una latenza di 62ms e un prezzo dirompente di 1$ per 1.000 chiamate. Realizzata da veterani del settore, mira a sostituire gli stack di ricerca incentrati sull'uomo.

Search è stato costruito per gli esseri umani. Scrivi una query, scorri i risultati, affini e riprovi.

Trent'anni di infrastruttura sono progettati attorno a questo ciclo.

Gli agenti AI NON funzionano così. Un agente vuole fare una domanda da molteplici angolazioni contemporaneamente e ottenere tutto insieme.

Ma le API di ricerca che oggi alimentano gli agenti sono lo stesso ciclo umano racchiuso in un endpoint.

Una query in ingresso, una risposta in uscita, centinaia di millisecondi ciascuna.

Abbiamo passato l'ultimo anno a ricostruire la ricerca per chi effettivamente la esegue. Non ne abbiamo parlato molto.

Onestamente, non eravamo pronti. All'inizio di quest'anno sentivo di essere forse al 70% delle nostre aspettative, e non volevo fare rumore per un 70%.

Ora siamo pronti.

I numeri

L'API di ricerca web di Octen restituisce risultati in 62ms (P50) con un P90 di 68ms, misurati su SealQA Hard.

È diverse volte più veloce di Exa, Parallel e servizi simili.

L'alternativa più veloce misura circa 244ms. La più lenta, oltre 2,6 secondi.

Kuan Zou - inline image

Un dettaglio in questo grafico conta più del titolo: il divario tra il nostro P50 e P90 è di 6ms. Per alcuni servizi è superiore a un secondo.

Se il tuo agente non può prevedere quanto tempo impiega una ricerca, non può pianificare di conseguenza.

Il prezzo è di $1 per 1.000 chiamate. La maggior parte dei servizi in questa categoria addebita da $4 a $9.

Sulla qualità: Octen Embedding è al primo posto su RTEB, e il nostro modello di embedding VL è al primo posto su MMEB-v2.

Abbiamo rilasciato modelli di embedding testuali in open source e sono stati scaricati più di 500.000 volte in cinque mesi.

Su DeepResearch Bench otteniamo punteggi superiori a OpenAI Deep Research, Gemini e Grok da 10 a 17 punti.

Su FreshQA Strict e SimpleQA siamo davanti a ogni vendor che testiamo.

Kuan Zou - inline image

Nota: Tutti i benchmark sono pubblicati e riproducibili. I link alla fine.

Perché ho iniziato

Mi chiamo Kuan Zou. Prima di Octen, sono stato responsabile del prodotto per la ricerca AI presso Alibaba Cloud per cinque anni, gestendo sistemi che servivano centinaia di milioni di utenti.

Prima ancora, ho costruito da zero la piattaforma di ricerca enterprise di Baidu.

Ogni anno ad Alibaba, il mio compito era sopravvivere al Black Friday. Miliardi di query in un giorno, senza tolleranza per i fallimenti.

Così, quando ho guardato le API di ricerca fornite agli agenti AI, sono rimasto sinceramente sorpreso. La maggior parte inizia a rompersi quando le query al secondo raggiungono le decine.

Un agente che svolge un lavoro reale attiverà 20, 50, 100 ricerche insieme. L'infrastruttura da cui gli agenti dipendono di più è quella che cede per prima.

Abbiamo raccolto un seed da $10M guidato da Square Peg, riunito un team da Alibaba, Baidu, Meta, Google, TikTok, DeepSeek e Xiaohongshu, e ci siamo messi al lavoro.

Dal lineare al concorrente

Dai a Octen una domanda e la scompone in dozzine di sotto-query, le lancia tutte simultaneamente e assembla tutto ciò che torna in un'unica risposta.

Non una query alla volta. Tutte insieme.

Kuan Zou - inline image
Kuan Zou - inline image
Kuan Zou - inline image

Questo è ciò che fa per la ricerca approfondita: un report completo con fonti in meno di 3 minuti. I sistemi che impiegano più di un'ora sullo stesso compito ottengono punteggi inferiori al nostro su DeepResearch Bench.

Kuan Zou - inline image

A 62ms, la ricerca smette di comportarsi come uno strumento esterno e inizia a comportarsi come memoria.

Il tuo agente ragiona sul web in tempo reale quasi alla stessa velocità con cui ragiona sul proprio contesto.

Questo apre applicazioni che prima non erano pratiche. Agenti di trading in tempo reale. Dati sportivi e di mercato live. Agenti vocali che rispondono senza la pausa imbarazzante.

Kuan Zou - inline image

Costruito per l'affidabilità

Un singolo account Octen supporta oltre 1.000.000 di query al secondo. I nuovi contenuti vengono indicizzati entro 5 minuti dalla pubblicazione.

Offriamo anche QPS garantito con un SLA.

Per quanto ne so, siamo gli unici in questa categoria a poterlo promettere, perché è possibile solo quando possiedi l'indice da cima a fondo. Noi lo facciamo.

Kuan Zou - inline image

Oltre al testo, gestiamo la ricerca di immagini e video, e ancoriamo la generazione di immagini e video a riferimenti reali dal web in tempo reale.

Questo livello è ora in accesso anticipato.

Kuan Zou - inline image

Come fa anche a costare 5 volte meno

Non c'è trucco.

La maggior parte dei "prodotti di ricerca per AI" si basa su stack di ricerca open source progettati per gli umani. Hanno preso il motore dietro una casella di query e lo hanno spostato dietro un'API.

La tecnologia non è cambiata. Solo l'interfaccia. Chiamarlo "ricerca per AI" non ha senso.

Abbiamo ricostruito tutto. Il motore di ricerca, il ranking, il layer di servizio, tutto scritto da zero per il consumo da parte delle macchine. Niente nel nostro stack è stato progettato per una persona che scorre i risultati.

Ecco perché il prezzo è possibile. Un motore completamente AI-native non eredita trent'anni di overhead della ricerca umana. L'attività è sana a $1 per 1.000 chiamate. Non è un sussidio in attesa di scadere.

Il prezzo è la prova più onesta dell'architettura. Chiunque può affermare che la propria ricerca è costruita per l'AI. La struttura dei costi mostra se è vero.

Alcune aziende in questa categoria usano già la nostra API contro la loro ogni giorno.

Lo prendo come un complimento.

Perché condivido tutto

Sapere cosa facciamo e riuscire a costruirlo sono problemi diversi.

Il nostro fossato è un team che ha passato un decennio a gestire alcuni dei carichi di ricerca più difficili al mondo.

I primi pionieri hanno educato il mercato, e ne sono grato.

Ma gli sviluppatori controllano sempre i numeri e si indirizzano verso ciò che offre le migliori prestazioni al costo più basso.

Penso che sia il mercato più onesto del mondo.

Gli incumbent hanno passato gli ultimi due anni a fare marketing. Noi li abbiamo passati in ingegneria.

Ora l'ingegneria è pubblica.

L'era fisica

La prossima generazione di AI non vive su uno schermo.

Occhiali, robotica, modelli del mondo. In quel mondo, la ricerca diventa gli occhi: percezione in tempo reale del web in tempo reale.

Un robot non può aspettare 3 secondi per una risposta.

Quando la ricerca risponde in decine di millisecondi, l'interazione in tempo reale per l'AI fisica supera finalmente il collo di bottiglia che l'ha trattenuta.

In quell'era, non credo che nulla al di sopra di 100ms di latenza sopravviva. Oggi siamo gli unici al di sotto di quella soglia.

Lo stack degli agenti si sta stabilizzando in tre pezzi: modelli foundation, GPU e ricerca in tempo reale.

I primi due sono problemi risolti con vincitori chiari. Il terzo è ancora da decidere. Questa è la gara che intendiamo vincere.

Prova tu stesso

I benchmark sono pubblici e l'API è aperta.

$1 per 1.000 chiamate, con $5 di credito gratuito. Disponibile come API, come Skills, tramite MCP e da CLI. Funziona in Claude Code, Cursor, VS Code e qualsiasi client MCP.

Mettiti alla prova con qualunque cosa tu stia usando oggi.

Stesse query, fianco a fianco. Pubblica ciò che trovi.

Le aziende in questa categoria già ci confrontano quotidianamente, e dovresti farlo anche tu.

Docs: docs.octen.ai

Nota: Le cifre di latenza e accuratezza sono state misurate su SealQA Hard, FreshQA Strict e SimpleQA. La data e la regione del test sono stampate su ogni grafico. Riproduci il benchmark: https://github.com/Octen-Team/search-eval

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali