我们潜心研发,打造出全球最快的搜索服务

@KZouAPT
英语7小时前 · 2026年7月21日
399K
351
82
146
138

TL;DR

Octen 推出了一款专为高并发 AI Agents 设计的 AI 原生搜索 API,拥有 62ms 的超低延迟,定价仅为每 1,000 次调用 1 美元。该产品由搜索领域的资深专家打造,旨在取代以人为中心的传统搜索架构。

搜索本是为人类设计的。你输入一个查询,浏览结果,优化,再试一次。

三十年的基础设施都是围绕这个循环构建的。

AI Agent 的工作方式完全不同。Agent 想同时从多个角度提问,然后一次性获取所有结果。

但如今为 Agent 提供支持的搜索 API,本质上仍然是那个人类循环,只是被包装成了一个接口。

一个查询进入,一个响应返回,每次耗时数百毫秒。

我们花了一年时间,为真正执行搜索的主体重新构建了搜索。我们没怎么宣传过这件事。

说实话,当时我们还没准备好。今年早些时候,我觉得我们只达到了自己期望的 70% 左右,我不想为一个 70% 的产品造势。

现在,我们准备好了。

数据

Octen 的网页搜索 API 在 SealQA Hard 上的响应时间为 62 毫秒(P50),P90 为 68 毫秒。

这比 Exa、Parallel 以及类似服务要快上好几倍。

最快的替代方案大约需要 244 毫秒。最慢的则超过 2.6 秒。

Kuan Zou - inline image

这张图表中,有一个细节比标题更重要:我们的 P50 和 P90 之间只差 6 毫秒。而对于某些服务,这个差距超过一秒。

如果你的 Agent 无法预测一次搜索需要多长时间,它就无法围绕搜索进行规划。

定价为每 1,000 次调用 1 美元。该类别中的大多数服务收费为 4 到 9 美元。

在质量方面:Octen Embedding 在 RTEB 上排名第一,我们的 VL 嵌入模型在 MMEB-v2 上排名第一。

我们开源了文本嵌入模型,在五个月内下载量已超过 50 万次。

在 DeepResearch Bench 上,我们的得分比 OpenAI Deep Research、Gemini 和 Grok 高出 10 到 17 分。

在 FreshQA Strict 和 SimpleQA 上,我们领先于我们测试过的所有供应商。

Kuan Zou - inline image

注:所有基准测试均已发布且可复现。链接见文末。

我为什么开始做这件事

我叫 Kuan Zou。在创立 Octen 之前,我在阿里云担任了五年的 AI 搜索产品负责人,管理着服务数亿用户的系统。

在此之前,我从零开始搭建了百度的企业搜索平台。

在阿里巴巴的每一年,我的工作都是扛过双十一。一天之内数十亿的查询,不容有任何闪失。

所以,当我看到那些提供给 AI Agent 的搜索 API 时,我真的很惊讶。大多数 API 在每秒查询数达到几十的时候就开始崩溃了。

一个真正在工作的 Agent 会同时触发 20、50、甚至 100 次搜索。Agent 最依赖的基础设施,恰恰是最先出问题的部分。

我们筹集了 由 Square Peg 领投的 1000 万美元种子轮,组建了一支来自阿里巴巴、百度、Meta、Google、TikTok、DeepSeek 和小红书的团队,然后开始干活。

从线性到并发

给 Octen 一个问题,它会将其分解成数十个子查询,同时发出所有这些查询,然后将返回的所有结果整合成一个答案。

不是一次只查一个。而是同时查所有。

Kuan Zou - inline image
Kuan Zou - inline image
Kuan Zou - inline image

这就是它对深度研究所做的:在不到 3 分钟内生成一份完整的、有来源支持的报告。有些系统在同样的任务上需要花一个多小时,在 DeepResearch Bench 上的得分却低于我们。

Kuan Zou - inline image

在 62 毫秒的速度下,搜索不再像一个外部工具,而更像是一种记忆。

你的 Agent 可以以接近其自身上下文推理的速度,对实时网络进行推理。

这开启了以前不切实际的应用。实时交易 Agent。实时体育和市场数据。无需尴尬停顿就能回答的语音 Agent。

Kuan Zou - inline image

为可靠性而生

单个 Octen 账户支持每秒超过 1,000,000 次查询。新内容在发布后 5 分钟内即可被索引。

我们还提供有 SLA 保障的 QPS。

据我所知,我们是这个类别中唯一能承诺这一点的,因为只有当你端到端地拥有索引时,这才有可能实现。我们做到了。

Kuan Zou - inline image

除了文本,我们还运行图片搜索和视频搜索,并使用来自实时网络的真实参考为图片和视频生成提供依据。

这一层目前处于早期访问阶段。

Kuan Zou - inline image

为什么它同时也便宜 5 倍

这没什么诀窍。

大多数“面向 AI 的搜索”产品都是建立在为人类设计的开源搜索堆栈之上的。他们把查询框背后的引擎搬到了 API 后面。

技术没有变。只是界面变了。把这叫做“面向 AI 的搜索”毫无意义。

我们重建了一切。搜索引擎、排序、服务层,全部为机器消费而重新编写。我们的堆栈中没有任何东西是为人类滚动浏览结果而设计的。

这就是为什么能实现这个价格。一个完全为 AI 原生设计的引擎,不会继承三十年来人类搜索带来的开销。在每 1,000 次调用 1 美元的价格下,我们的业务是健康的。这不是一个等着过期的补贴。

价格是架构最诚实的证明。任何人都可以声称他们的搜索是为 AI 构建的。成本结构会揭示真相。

这个类别中的一些公司,每天都在用我们的 API 与它们自己的 API 进行对比测试。

我认为这是一种恭维。

我为什么分享一切

知道我们能做什么,和能够把它构建出来,是两个不同的问题。

我们的护城河是一支团队,这支团队花了十年时间处理世界上一些最棘手的搜索流量。

先行者们教育了市场,我对此心存感激。

但开发者们总是会看数据,他们会把流量路由到性能最好、成本最低的地方。

我认为这是世界上最诚实的市场。

现有的老牌公司过去两年花在了营销上。我们则花在了工程上。

现在,工程成果已经公开。

物理时代

下一代的 AI 不会只活在屏幕上。

眼镜、机器人、世界模型。在那个世界里,搜索变成了眼睛:对实时网络的实时感知。

机器人不能等 3 秒才得到一个答案。

当搜索在几十毫秒内返回结果时,物理 AI 的实时交互终于突破了长久以来的瓶颈。

在那个时代,我相信任何延迟超过 100 毫秒的搜索都无法存活。今天,我们是唯一低于这个门槛的。

Agent 的堆栈正逐渐定型为三个部分:基础模型、GPU 和实时搜索。

前两个是已经解决的问题,有明确的赢家。第三个仍在决定之中。这就是我们志在必得的竞赛。

亲自试试

基准测试是公开的,API 也是开放的。

每 1,000 次调用 1 美元,并附赠 5 美元免费额度。可作为 API、Skills、通过 MCP 以及从 CLI 使用。它能在 Claude Code、Cursor、VS Code 以及任何 MCP 客户端中使用。

拿我们和你现在用的任何工具比一比。

同样的查询,并排对比。把你的发现分享出来。

这个类别里的公司每天都在拿我们做基准测试,你也应该这么做。

文档:docs.octen.ai

注:延迟和准确率数据基于 SealQA Hard、FreshQA Strict 和 SimpleQA 的测量。测试日期和区域已标注在每个图表上。复现基准测试:https://github.com/Octen-Team/search-eval

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章