Die Suche wurde für Menschen entwickelt. Du gibst eine Anfrage ein, durchsuchst die Ergebnisse, verfeinerst sie und versuchst es erneut.
Dreißig Jahre Infrastruktur sind auf diesen Kreislauf ausgelegt.
KI-Agenten funktionieren NICHT so. Ein Agent möchte eine Frage aus vielen Blickwinkeln gleichzeitig stellen und alles auf einmal zurückbekommen.
Aber die Such-APIs, die heute Agenten versorgen, sind derselbe menschliche Kreislauf, nur in einen Endpunkt verpackt.
Eine Anfrage rein, eine Antwort raus, Hunderte Millisekunden pro Stück.
Wir haben das letzte Jahr damit verbracht, die Suche für das neu zu bauen, was tatsächlich sucht. Wir haben nicht viel darüber geschrieben.
Ehrlich gesagt, wir waren nicht bereit. Anfang dieses Jahres hatte ich das Gefühl, dass wir bei vielleicht 70 % unserer eigenen Erwartungen waren, und ich wollte keinen Lärm um 70 % machen.
Jetzt sind wir bereit.
Die Zahlen
Octens Websuch-API liefert Ergebnisse in 62 ms (P50) mit einem P90 von 68 ms, gemessen auf SealQA Hard.
Das ist um ein Vielfaches schneller als Exa, Parallel und ähnliche Dienste.
Die schnellste Alternative misst etwa 244 ms. Die langsamste über 2,6 Sekunden.

Ein Detail in dieser Grafik ist wichtiger als die Überschrift: Die Lücke zwischen unserem P50 und P90 beträgt 6 ms. Bei manchen Diensten beträgt sie über eine Sekunde.
Wenn dein Agent nicht vorhersagen kann, wie lange eine Suche dauert, kann er nicht darum herum planen.
Der Preis beträgt 1 $ pro 1.000 Aufrufe. Die meisten Dienste in dieser Kategorie verlangen 4 bis 9 $.
Zur Qualität: Octen Embedding ist #1 auf RTEB, und unser VL-Einbettungsmodell ist #1 auf MMEB-v2.
Wir haben Text-Einbettungsmodelle als Open Source veröffentlicht, die in fünf Monaten mehr als 500.000 Mal heruntergeladen wurden.
Auf dem DeepResearch Bench liegen wir 10 bis 17 Punkte über OpenAI Deep Research, Gemini und Grok.
Auf FreshQA Strict und SimpleQA führen wir gegen jeden Anbieter, den wir testen.

Hinweis: Alle Benchmarks sind veröffentlicht und reproduzierbar. Links am Ende.
Warum ich damit angefangen habe
Mein Name ist Kuan Zou. Vor Octen war ich fünf Jahre lang Produktleiter für KI-Suche bei Alibaba Cloud und leitete Systeme, die Hunderte Millionen Nutzer bedienten.
Davor habe ich die Unternehmenssuchplattform von Baidu von Grund auf aufgebaut.
Jedes Jahr bei Alibaba bestand meine Aufgabe darin, den Black Friday zu überstehen. Milliarden von Anfragen an einem Tag, und keine Toleranz für Fehler.
Als ich mir also die Such-APIs ansah, die KI-Agenten zur Verfügung gestellt werden, war ich ehrlich überrascht. Die meisten von ihnen fangen an zu brechen, wenn die Anzahl der Abfragen pro Sekunde in den zweistelligen Bereich kommt.
Ein Agent, der echte Arbeit leistet, wird 20, 50, 100 Suchvorgänge gleichzeitig auslösen. Die Infrastruktur, auf die Agenten am meisten angewiesen sind, ist der Teil, der zuerst versagt.
Wir haben eine 10-Millionen-Dollar-Saatrunde unter der Führung von Square Peg aufgenommen, ein Team aus Mitarbeitern von Alibaba, Baidu, Meta, Google, TikTok, DeepSeek und Xiaohongshu zusammengestellt und uns an die Arbeit gemacht.
Von linear zu gleichzeitig
Gib Octen eine Frage, und es zerlegt sie in Dutzende von Unterabfragen, feuert sie alle gleichzeitig ab und setzt alles, was zurückkommt, zu einer Antwort zusammen.
Nicht eine Abfrage nach der anderen. Alle auf einmal.



Das ist es, was es für tiefgehende Recherche tut: Ein vollständiger, quellengestützter Bericht in unter 3 Minuten. Systeme, die für dieselbe Aufgabe über eine Stunde brauchen, schneiden auf dem DeepResearch Bench schlechter ab als wir.

Bei 62 ms verhält sich die Suche nicht mehr wie ein externes Werkzeug, sondern wie ein Gedächtnis.
Dein Agent denkt über das Live-Web mit einer Geschwindigkeit nach, die fast so hoch ist wie die, mit der er über seinen eigenen Kontext nachdenkt.
Das eröffnet Anwendungen, die vorher nicht praktikabel waren. Echtzeit-Handelsagenten. Live-Sport- und Marktdaten. Sprachagenten, die ohne die peinliche Pause antworten.

Auf Zuverlässigkeit ausgelegt
Ein einzelnes Octen-Konto unterstützt mehr als 1.000.000 Abfragen pro Sekunde. Neue Inhalte werden innerhalb von 5 Minuten nach der Veröffentlichung indexiert.
Wir bieten auch eine garantierte QPS mit einer SLA an.
Soweit ich weiß, sind wir die Einzigen in dieser Kategorie, die dies versprechen können, weil es nur möglich ist, wenn man den Index von Anfang bis Ende selbst besitzt. Das tun wir.

Über Text hinaus betreiben wir Bildsuche und Videosuche und verankern die Bild- und Videogenerierung mit echten Referenzen aus dem Live-Web.
Diese Ebene befindet sich jetzt im Early Access.

Wie es auch noch 5x günstiger ist
Da ist kein Trick.
Die meisten "Suche für KI"-Produkte basieren auf Open-Source-Suchstapeln, die für Menschen entwickelt wurden. Sie haben die Engine hinter einem Abfragefeld genommen und sie hinter eine API verschoben.
Die Technologie hat sich nicht geändert. Nur die Schnittstelle. Das als "Suche für KI" zu bezeichnen, ergibt keinen Sinn.
Wir haben alles neu aufgebaut. Die Suchmaschine, das Ranking, die Serving-Ebene – alles von Grund auf für die Maschinenverarbeitung geschrieben. Nichts in unserem Stack wurde für einen Menschen entwickelt, der durch Ergebnisse scrollt.
Deshalb ist der Preis möglich. Eine vollständig KI-native Engine erbt nicht dreißig Jahre menschlichen Such-Overhead. Das Geschäft ist bei 1 $ pro 1.000 Aufrufen gesund. Dies ist keine Subvention, die demnächst ausläuft.
Der Preis ist der ehrlichste Beweis für die Architektur. Jeder kann behaupten, dass seine Suche für KI gebaut ist. Die Kostenstruktur zeigt, ob es wahr ist.
Einige Unternehmen in dieser Kategorie lassen unsere API bereits täglich gegen ihre eigene laufen.
Ich nehme das als Kompliment.
Warum ich alles teile
Zu wissen, was wir tun, und es bauen zu können, sind unterschiedliche Probleme.
Unser Burggraben ist ein Team, das ein Jahrzehnt damit verbracht hat, einige der schwierigsten Suchanfragen der Welt zu bewältigen.
Die ersten Anbieter haben den Markt aufgeklärt, und ich bin ihnen dankbar dafür.
Aber Entwickler überprüfen immer die Zahlen, und sie routen zu dem, was die beste Leistung und die geringsten Kosten bietet.
Ich denke, das ist der ehrlichste Markt der Welt.
Die etablierten Anbieter haben die letzten zwei Jahre mit Marketing verbracht. Wir haben sie mit Technik verbracht.
Jetzt ist die Technik öffentlich.
Die physische Ära
Die nächste Generation der KI lebt nicht auf einem Bildschirm.
Brillen, Robotik, Weltmodelle. In dieser Welt wird die Suche zu den Augen: Echtzeit-Wahrnehmung des Live-Webs.
Ein Roboter kann nicht 3 Sekunden auf eine Antwort warten.
Wenn die Suche in Dutzenden von Millisekunden zurückkommt, durchbricht die Echtzeit-Interaktion für physische KI endlich den Engpass, der sie zurückgehalten hat.
In dieser Ära glaube ich nicht, dass irgendetwas über 100 ms Latenz überleben wird. Heute sind wir die Einzigen unter dieser Grenze.
Der Agenten-Stack gliedert sich in drei Teile: Foundation-Modelle, GPUs und Live-Suche.
Die ersten beiden sind gelöste Probleme mit klaren Gewinnern. Der dritte wird noch entschieden. Das ist das Rennen, das wir gewinnen wollen.
Probier es selbst aus
Die Benchmarks sind öffentlich und die API ist offen.
1 $ pro 1.000 Aufrufe, mit 5 $ Gratisguthaben. Verfügbar als API, als Skills, über MCP und über die CLI. Es funktioniert in Claude Code, Cursor, VS Code und jedem MCP-Client.
Lass es gegen das laufen, was du heute verwendest.
Gleiche Abfragen, nebeneinander. Teile mit, was du findest.
Unternehmen in dieser Kategorie benchmarken uns bereits täglich, und du solltest das auch tun.
Dokumentation: docs.octen.ai
Hinweis: Latenz- und Genauigkeitswerte gemessen auf SealQA Hard, FreshQA Strict und SimpleQA. Testdatum und -region sind auf jedem Diagramm vermerkt. Reproduziere den Benchmark: https://github.com/Octen-Team/search-eval

![[Entschuldigung und Dank] Die Neudefinition des Bürowerts im Zeitalter der KI](/cdn-cgi/image/width=1920,quality=90,format=auto,metadata=none/https%3A%2F%2Fcms-assets.youmind.com%2Fmedia%2F1784654487214_c56a6p_HNr6-znbwAAQJbv.jpg)



