我们如何以每百万 Token 0.04 雷亚尔的成本处理 130 亿 Token

@gmprestes
葡语4周前 · 2026年7月09日
274K
11
0
1
3

TL;DR

Guilherme Silva 详细介绍了 Velua Code 的架构,这是一款利用上下文压缩、模型路由和知识图谱的 AI Agent,能够以极低的成本处理数十亿 Token。

在过去一个月里,我构建的 coding agents 处理了 130 亿个 token(输入和输出之和),缓存命中率达 97.24%,每百万 token 的有效成本约为 R$ 0.04。

当我提到这些数字时,第一反应通常是怀疑——这很正常。成本是公司放弃自主 Agent 的第一大原因:试点成功,账单来了,项目就死了。所以这篇文章要讲的是这些数字是如何实现的。没有单一技巧,而是一种架构——每个进入和退出的 token 都经过压缩、路由和测量。

这就是 Velua Code,我们在一家新创公司 Velua AI(https://velua.aihttps://velua.ai/))中构建的 Agent。在介绍架构之前,先说说核心理念。

核心理念:三个问题,一次性解决

Coding agents 会在三个地方崩溃,只解决其中一个是不够的。

成本。 自主 Agent 消耗 token 的规模足以吓住任何 CFO。如果每次迭代都很贵,没人会让 Agent 迭代——而不迭代的 Agent 实际上解决不了任何问题。

上下文。 上下文窗口既有限又昂贵。典型的实现方式是把整个文件和 grep 结果塞进 prompt,每次调用都要为成千上万无关的 token 买单。

记忆。 每次会话都从零开始。Agent 在周二重新发现它周一已经学到的东西——并为此付出代价(token 和错误)。

这三个问题相互关联:膨胀的上下文推高成本,缺乏记忆又导致上下文膨胀。正因如此,Velua Code 同时向这三个问题发起攻击。

成本:源头压缩 + 主动路由

第一个架构决策:在源头压缩上下文,而不是在末端压缩。每个工具输出——文件读取、搜索结果、构建日志——在进入会话历史之前都要经过一个压缩管道。核心是一个专有的压缩模型,运行在本地 ONNX 上,即在开发者的机器或 Agent 的容器内。压缩无需网络调用:节省不消耗 token。

围绕它,更简单的层负责繁重的工作:读取去重(Agent 是不是又读了同一个文件?旧版本从上下文中移除)、结构化 JSON 压缩、保留签名同时省略代码主体,以及一个自适应阈值——当上下文增长时,压缩变得更紧。一切都用目标模型的实际分词器进行测量——节省按真实 token 计算,而非估算。

还有一个决策是关于 不做什么:我们从不在运行时修改系统提示。稳定的提示是维持 97.24% 缓存命中率的关键——而缓存命中是最便宜的成本杠杆,因为一个缓存的 token 只占用完整 token 的一小部分成本。

第二个决策:Agent 不自己选择模型。一个本地分类器按类别和复杂度预先分类每个任务,然后 Velua Gateway——它能实时看到 50 多个模型的价格和性能——将任务路由到 在必要范围内 最合适的模型,同时应用护栏并用 RAG 丰富上下文。重命名变量不需要前沿模型;但设计模式迁移则需要。通过主动路由,大多数调用由较小的模型处理,昂贵的模型只在复杂度需要时才介入。

Gateway 还会测量每个请求的真实成本。这使得我视为生产环境中 Agent 不可或缺的东西成为可能:将预算作为停止条件。自主循环以货币形式设定成本上限,而不是凭希望运行。

正是这三者的组合——源头压缩、高缓存、较小模型之间的路由——产生了 R$ 0.04 每百万 token 的结果。单独任何一环都无法接近。

上下文:用图代替 grep

Agent "理解"代码库的标准方式是 grep 和文件读取——既昂贵又盲目。Velua Code 维护一个 代码知识图谱:函数、类、路由以及它们之间的关系(谁调用谁,谁实现什么)。

这在循环的两端都带来了改变。在输入端,Agent 通过 查询图谱(项目的架构视图和与任务相关的节点)来组装一个轻量的上下文包,而不是把文件倾倒进 prompt。在输出端,它改变了 验证:当 Agent 修改一个函数时,图谱会列出所有受影响的调用点,然后一个审查 Agent——拥有干净的上下文,不受编写代码者偏见的影响——检查每一个调用点,同时运行测试、lint 和构建。"你修改了 processOrder 的签名;有七个地方调用了它"——这种验证是 grep 无法提供的。

记忆:不断学习的循环

这是闭合系统的最后一块。在每个验证过的迭代结束时,Agent 会记录 工程决策:做了什么决策、为什么、考虑了哪些替代方案、哪些失败了。并且每个决策都 链接到它解释的代码节点,直接在图谱中。

在下一次迭代中,上下文集收集阶段会检索这些决策——包括已经失败的方案,以避免重复尝试。这个循环不再是重复任务的执行器,而成为一个 积累关于代码库的知识 的系统。这也是最有效的成本摊销方式:廉价的记忆取代了昂贵的重新发现。

于是,完整的循环是:收集上下文(图谱 + 记忆 + RAG)、用适合问题规模的模型进行规划、通过子 Agent 执行、用干净上下文的审查者和图谱感知进行验证、通过记录决策来学习——然后重复,同时设有成本上限。这是经典的 Agent 循环,每个通用阶段都被替换为自身的能力。

为什么第一个客户是我们自己

产品策略有意反直觉:在卖给任何客户之前,Velua Code 先在 SIGE Cloud 内部运行。真正的 dogfooding——一个生产环境中的 ERP,真实团队每天在真实代码上操作 Agent。

正是这种内部使用产生了 130 亿个 token,这也正是塑造产品的过程。生产环境中的自主 Agent 暴露出了基准测试无法暴露的问题:权限、累积成本、停滞的任务、腐烂的上下文。我更希望它在我们自己的痛苦中成熟。

下一步:面向企业的统一记忆

目前,决策记忆按项目存储。下一步最让我兴奋:将其提升到 企业级统一工程记忆层

想象一下,团队 A 的 Agent 记录的决策——"我们因为 Y 迁移到了 X;我们避开了 Z 因为它破坏了 W"——可以被团队 B 的 Agent 检索,也可以被操作这些 Agent 的人类开发者检索,并且具有访问控制、来源证明和审计。问题"这段代码为什么是这样?"可以用原始决策来回答,并链接到代码,供组织中的任何人或任何 Agent 使用。更快的 onboarding、团队之间的一致性,以及公司的工程知识不再仅仅存在于人的头脑中。

通过 Gateway 提供服务,这种记忆将变成基础设施:公司中的任何 Agent、任何工具,都能继承积累的学习成果。

自主 Agent 将成为商品。但它们积累的关于

系统的知识则不会。

这就是我们的赌注。

如果你正在用生产环境中的 Agent 构建产品——或者正在为上下文成本头疼——我的私信随时开放。

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章