Search è stato costruito per gli esseri umani. Scrivi una query, scorri i risultati, affini e riprovi.
Trent'anni di infrastruttura sono progettati attorno a questo ciclo.
Gli agenti AI NON funzionano così. Un agente vuole fare una domanda da molteplici angolazioni contemporaneamente e ottenere tutto insieme.
Ma le API di ricerca che oggi alimentano gli agenti sono lo stesso ciclo umano racchiuso in un endpoint.
Una query in ingresso, una risposta in uscita, centinaia di millisecondi ciascuna.
Abbiamo passato l'ultimo anno a ricostruire la ricerca per chi effettivamente la esegue. Non ne abbiamo parlato molto.
Onestamente, non eravamo pronti. All'inizio di quest'anno sentivo di essere forse al 70% delle nostre aspettative, e non volevo fare rumore per un 70%.
Ora siamo pronti.
I numeri
L'API di ricerca web di Octen restituisce risultati in 62ms (P50) con un P90 di 68ms, misurati su SealQA Hard.
È diverse volte più veloce di Exa, Parallel e servizi simili.
L'alternativa più veloce misura circa 244ms. La più lenta, oltre 2,6 secondi.

Un dettaglio in questo grafico conta più del titolo: il divario tra il nostro P50 e P90 è di 6ms. Per alcuni servizi è superiore a un secondo.
Se il tuo agente non può prevedere quanto tempo impiega una ricerca, non può pianificare di conseguenza.
Il prezzo è di $1 per 1.000 chiamate. La maggior parte dei servizi in questa categoria addebita da $4 a $9.
Sulla qualità: Octen Embedding è al primo posto su RTEB, e il nostro modello di embedding VL è al primo posto su MMEB-v2.
Abbiamo rilasciato modelli di embedding testuali in open source e sono stati scaricati più di 500.000 volte in cinque mesi.
Su DeepResearch Bench otteniamo punteggi superiori a OpenAI Deep Research, Gemini e Grok da 10 a 17 punti.
Su FreshQA Strict e SimpleQA siamo davanti a ogni vendor che testiamo.

Nota: Tutti i benchmark sono pubblicati e riproducibili. I link alla fine.
Perché ho iniziato
Mi chiamo Kuan Zou. Prima di Octen, sono stato responsabile del prodotto per la ricerca AI presso Alibaba Cloud per cinque anni, gestendo sistemi che servivano centinaia di milioni di utenti.
Prima ancora, ho costruito da zero la piattaforma di ricerca enterprise di Baidu.
Ogni anno ad Alibaba, il mio compito era sopravvivere al Black Friday. Miliardi di query in un giorno, senza tolleranza per i fallimenti.
Così, quando ho guardato le API di ricerca fornite agli agenti AI, sono rimasto sinceramente sorpreso. La maggior parte inizia a rompersi quando le query al secondo raggiungono le decine.
Un agente che svolge un lavoro reale attiverà 20, 50, 100 ricerche insieme. L'infrastruttura da cui gli agenti dipendono di più è quella che cede per prima.
Abbiamo raccolto un seed da $10M guidato da Square Peg, riunito un team da Alibaba, Baidu, Meta, Google, TikTok, DeepSeek e Xiaohongshu, e ci siamo messi al lavoro.
Dal lineare al concorrente
Dai a Octen una domanda e la scompone in dozzine di sotto-query, le lancia tutte simultaneamente e assembla tutto ciò che torna in un'unica risposta.
Non una query alla volta. Tutte insieme.



Questo è ciò che fa per la ricerca approfondita: un report completo con fonti in meno di 3 minuti. I sistemi che impiegano più di un'ora sullo stesso compito ottengono punteggi inferiori al nostro su DeepResearch Bench.

A 62ms, la ricerca smette di comportarsi come uno strumento esterno e inizia a comportarsi come memoria.
Il tuo agente ragiona sul web in tempo reale quasi alla stessa velocità con cui ragiona sul proprio contesto.
Questo apre applicazioni che prima non erano pratiche. Agenti di trading in tempo reale. Dati sportivi e di mercato live. Agenti vocali che rispondono senza la pausa imbarazzante.

Costruito per l'affidabilità
Un singolo account Octen supporta oltre 1.000.000 di query al secondo. I nuovi contenuti vengono indicizzati entro 5 minuti dalla pubblicazione.
Offriamo anche QPS garantito con un SLA.
Per quanto ne so, siamo gli unici in questa categoria a poterlo promettere, perché è possibile solo quando possiedi l'indice da cima a fondo. Noi lo facciamo.

Oltre al testo, gestiamo la ricerca di immagini e video, e ancoriamo la generazione di immagini e video a riferimenti reali dal web in tempo reale.
Questo livello è ora in accesso anticipato.

Come fa anche a costare 5 volte meno
Non c'è trucco.
La maggior parte dei "prodotti di ricerca per AI" si basa su stack di ricerca open source progettati per gli umani. Hanno preso il motore dietro una casella di query e lo hanno spostato dietro un'API.
La tecnologia non è cambiata. Solo l'interfaccia. Chiamarlo "ricerca per AI" non ha senso.
Abbiamo ricostruito tutto. Il motore di ricerca, il ranking, il layer di servizio, tutto scritto da zero per il consumo da parte delle macchine. Niente nel nostro stack è stato progettato per una persona che scorre i risultati.
Ecco perché il prezzo è possibile. Un motore completamente AI-native non eredita trent'anni di overhead della ricerca umana. L'attività è sana a $1 per 1.000 chiamate. Non è un sussidio in attesa di scadere.
Il prezzo è la prova più onesta dell'architettura. Chiunque può affermare che la propria ricerca è costruita per l'AI. La struttura dei costi mostra se è vero.
Alcune aziende in questa categoria usano già la nostra API contro la loro ogni giorno.
Lo prendo come un complimento.
Perché condivido tutto
Sapere cosa facciamo e riuscire a costruirlo sono problemi diversi.
Il nostro fossato è un team che ha passato un decennio a gestire alcuni dei carichi di ricerca più difficili al mondo.
I primi pionieri hanno educato il mercato, e ne sono grato.
Ma gli sviluppatori controllano sempre i numeri e si indirizzano verso ciò che offre le migliori prestazioni al costo più basso.
Penso che sia il mercato più onesto del mondo.
Gli incumbent hanno passato gli ultimi due anni a fare marketing. Noi li abbiamo passati in ingegneria.
Ora l'ingegneria è pubblica.
L'era fisica
La prossima generazione di AI non vive su uno schermo.
Occhiali, robotica, modelli del mondo. In quel mondo, la ricerca diventa gli occhi: percezione in tempo reale del web in tempo reale.
Un robot non può aspettare 3 secondi per una risposta.
Quando la ricerca risponde in decine di millisecondi, l'interazione in tempo reale per l'AI fisica supera finalmente il collo di bottiglia che l'ha trattenuta.
In quell'era, non credo che nulla al di sopra di 100ms di latenza sopravviva. Oggi siamo gli unici al di sotto di quella soglia.
Lo stack degli agenti si sta stabilizzando in tre pezzi: modelli foundation, GPU e ricerca in tempo reale.
I primi due sono problemi risolti con vincitori chiari. Il terzo è ancora da decidere. Questa è la gara che intendiamo vincere.
Prova tu stesso
I benchmark sono pubblici e l'API è aperta.
$1 per 1.000 chiamate, con $5 di credito gratuito. Disponibile come API, come Skills, tramite MCP e da CLI. Funziona in Claude Code, Cursor, VS Code e qualsiasi client MCP.
Mettiti alla prova con qualunque cosa tu stia usando oggi.
Stesse query, fianco a fianco. Pubblica ciò che trovi.
Le aziende in questa categoria già ci confrontano quotidianamente, e dovresti farlo anche tu.
Docs: docs.octen.ai
Nota: Le cifre di latenza e accuratezza sono state misurate su SealQA Hard, FreshQA Strict e SimpleQA. La data e la regione del test sono stampate su ogni grafico. Riproduci il benchmark: https://github.com/Octen-Team/search-eval





![[Scuse e ringraziamenti] Ridefinire il valore dell'ufficio nell'era dell'IA](/cdn-cgi/image/width=1920,quality=90,format=auto,metadata=none/https%3A%2F%2Fcms-assets.youmind.com%2Fmedia%2F1784654487214_c56a6p_HNr6-znbwAAQJbv.jpg)