Ми мовчали і створили НАЙШВИДШИЙ пошук на планеті

@KZouAPT
АНГЛІЙСЬКА6 годин тому · 21 лип. 2026 р.
399K
351
82
146
138

Коротко

Octen представляє AI-native API для пошуку, розроблений для агентів із високою паралельністю, що забезпечує затримку 62 мс та революційну ціну $1 за 1000 запитів. Створений ветеранами пошукових технологій, він має на меті замінити пошукові стеки, орієнтовані на людей.

Пошук створювався для людей. Ви вводите один запит, переглядаєте результати, уточнюєте та пробуєте знову.

Тридцять років інфраструктури побудовано навколо цього циклу.

AI-агенти працюють НЕ так. Агент хоче поставити запитання з багатьох кутів одночасно та отримати все зібране докупи.

Але пошукові API, які живлять агентів сьогодні — це той самий людський цикл, загорнутий в ендпоінт.

Один запит на вході, одна відповідь на виході, сотні мілісекунд на кожну.

Ми провели останній рік, перебудовуючи пошук для того, хто насправді виконує пошук. Ми не писали про це багато.

Чесно кажучи, ми не були готові. На початку цього року я відчував, що ми досягли десь 70% власних очікувань, і я не хотів створювати галас навколо 70%.

Тепер ми готові.

Цифри

Веб-пошуковий API Octen повертає результати за 62 мс (P50) з P90 у 68 мс, виміряно на SealQA Hard.

Це в кілька разів швидше, ніж Exa, Parallel та подібні сервіси.

Найшвидша альтернатива становить близько 244 мс. Найповільніша — понад 2,6 секунди.

Kuan Zou - inline image

Одна деталь на цьому графіку важливіша за заголовок: розрив між нашим P50 та P90 становить 6 мс. Для деяких сервісів він перевищує одну секунду.

Якщо ваш агент не може передбачити, скільки триватиме пошук, він не може планувати навколо цього.

Ціна становить $1 за 1 000 викликів. Більшість сервісів у цій категорії беруть від $4 до $9.

Щодо якості: Octen Embedding займає #1 місце в RTEB, а наша модель VL-ембеддингів — #1 в MMEB-v2.

Ми відкрили вихідний код текстових моделей еmбеддингів, і їх завантажили понад 500 000 разів за п'ять місяців.

На DeepResearch Bench ми набираємо вище, ніж OpenAI Deep Research, Gemini та Grok, на 10–17 пунктів.

На FreshQA Strict та SimpleQA ми випереджаємо всіх вендорів, з якими тестуємося.

Kuan Zou - inline image

Примітка: Усі бенчмарки опубліковані та відтворювані. Посилання в кінці.

Чому я це почав

Мене звати Куан Цзоу. До Octen я протягом п'яти років керував продуктом AI-пошуку в Alibaba Cloud, відповідаючи за системи, які обслуговували сотні мільйонів користувачів.

До цього я з нуля створив корпоративну пошукову платформу Baidu.

Щороку в Alibaba моїм завданням було пережити Чорну п'ятницю. Мільярди запитів на день і жодної толерантності до збоїв.

Тому, коли я подивився на пошукові API, які дають AI-агентам, я був щиро здивований. Більшість із них починають ламатися, коли кількість запитів на секунду сягає десятків.

Агент, який виконує реальну роботу, запускатиме 20, 50, 100 пошуків одночасно. Інфраструктура, від якої агенти залежать найбільше, — це те, що відмовляє першим.

Ми залучили $10M seed-раунд під проводом Square Peg, зібрали команду з Alibaba, Baidu, Meta, Google, TikTok, DeepSeek та Xiaohongshu, і взялися до роботи.

Від лінійного до одночасного

Дайте Octen запитання, і він розкладає його на десятки підзапитів, запускає їх усі одночасно та збирає все, що повертається, в одну відповідь.

Не один запит за раз. Усі одночасно.

Kuan Zou - inline image
Kuan Zou - inline image
Kuan Zou - inline image

Ось як це виглядає для глибокого дослідження: повний звіт із джерелами менш ніж за 3 хвилини. Системи, які витрачають понад годину на те саме завдання, набирають нижче за нас на DeepResearch Bench.

Kuan Zou - inline image

При 62 мс пошук перестає поводитися як зовнішній інструмент і починає поводитися як пам'ять.

Ваш агент міркує над живим вебом майже з тією ж швидкістю, з якою він міркує над власним контекстом.

Це відкриває застосунки, які раніше не були практичними. Торгові агенти в реальному часі. Живі спортивні та ринкові дані. Голосові агенти, які відповідають без незручної паузи.

Kuan Zou - inline image

Створено для надійності

Один акаунт Octen підтримує понад 1 000 000 запитів на секунду. Новий контент індексується протягом 5 хвилин після публікації.

Ми також пропонуємо гарантований QPS із SLA.

Наскільки мені відомо, ми єдині в цій категорії, хто може це обіцяти, тому що це можливо лише тоді, коли ви володієте індексом від початку до кінця. Ми володіємо.

Kuan Zou - inline image

Окрім тексту, ми запускаємо пошук зображень та відео, а також обґрунтовуємо генерацію зображень і відео реальними посиланнями з живого вебу.

Цей шар зараз у ранньому доступі.

Kuan Zou - inline image

Чому це також у 5 разів дешевше

Тут немає жодного трюку.

Більшість продуктів "пошуку для AI" побудовано на стек-рішеннях із відкритим кодом, які проєктувалися для людей. Вони взяли двигун, що стоїть за полем запиту, і перемістили його за API.

Технологія не змінилася. Змінився лише інтерфейс. Називати це "пошуком для AI" не має сенсу.

Ми перебудували все. Пошуковий двигун, ранжування, сервісний шар — усе написано з нуля для машинного споживання. Нічого в нашому стеку не проєктувалося для людини, яка гортає результати.

Ось чому така ціна можлива. Повністю AI-нативний двигун не успадковує тридцять років людських пошукових накладних витрат. Бізнес здоровий при $1 за 1 000 викликів. Це не субсидія, яка закінчиться.

Ціна — найчесніший доказ архітектури. Кожен може стверджувати, що його пошук створено для AI. Структура витрат показує, чи це правда.

Деякі компанії в цій категорії вже щодня запускають наш API проти свого власного.

Я сприймаю це як комплімент.

Чому я ділюся всім

Знати, що ми робимо, і мати змогу це побудувати — це різні проблеми.

Наш рів — це команда, яка провела десятиліття, обробляючи одні з найскладніших пошукових навантажень у світі.

Перші гравці виховали ринок, і я вдячний за це.

Але розробники завжди перевіряють цифри й маршрутизуються до того, що працює найкраще та коштує найменше.

Я вважаю, що це найчесніший ринок у світі.

Діючі гравці витратили останні два роки на маркетинг. Ми витратили їх на інженерію.

Тепер інженерія стала публічною.

Фізична ера

Наступне покоління AI не живе на екрані.

Окуляри, робототехніка, світові моделі. У цьому світі пошук стає очима: сприйняття живого вебу в реальному часі.

Робот не може чекати 3 секунди на відповідь.

Коли пошук повертає результат за десятки мілісекунд, взаємодія в реальному часі для фізичного AI нарешті пробиває вузьке місце, яке її стримувало.

У цю еру я не вірю, що щось із затримкою понад 100 мс виживе. Сьогодні ми єдині під цією планкою.

Стак агентів усталюється в три частини: фундаментальні моделі, GPU та живий пошук.

Перші дві — це вирішені проблеми з чіткими лідерами. Третя все ще вирішується. Це перегони, які ми маємо намір виграти.

Спробуйте самі

Бенчмарки є публічними, а API відкритий.

$1 за 1 000 викликів із $5 безкоштовного кредиту. Доступний як API, як Skills, через MCP та з CLI. Працює в Claude Code, Cursor, VS Code та будь-якому MCP-клієнті.

Запустіть нас проти того, що ви використовуєте сьогодні.

Ті самі запити, пліч-о-пліч. Опублікуйте, що знайдете.

Компанії в цій категорії вже щодня тестують нас, і ви також повинні.

Документація: docs.octen.ai

Примітка: Показники затримки та точності виміряно на SealQA Hard, FreshQA Strict та SimpleQA. Дата тестування та регіон зазначені на кожному графіку. Відтворіть бенчмарк: https://github.com/Octen-Team/search-eval

Переробити в YouMind

Перетворіть одну віральну статтю на повноцінний робочий процес

Збирайте джерела, розшифровуйте патерни, створюйте матеріали, пишіть чернетки та поширюйте контент в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей