在过去一个月里,我构建的 coding agents 处理了 130 亿个 token(输入和输出之和),缓存命中率达 97.24%,每百万 token 的有效成本约为 R$ 0.04。
当我提到这些数字时,第一反应通常是怀疑——这很正常。成本是公司放弃自主 Agent 的第一大原因:试点成功,账单来了,项目就死了。所以这篇文章要讲的是这些数字是如何实现的。没有单一技巧,而是一种架构——每个进入和退出的 token 都经过压缩、路由和测量。
这就是 Velua Code,我们在一家新创公司 Velua AI(https://velua.aihttps://velua.ai/))中构建的 Agent。在介绍架构之前,先说说核心理念。
核心理念:三个问题,一次性解决
Coding agents 会在三个地方崩溃,只解决其中一个是不够的。
成本。 自主 Agent 消耗 token 的规模足以吓住任何 CFO。如果每次迭代都很贵,没人会让 Agent 迭代——而不迭代的 Agent 实际上解决不了任何问题。
上下文。 上下文窗口既有限又昂贵。典型的实现方式是把整个文件和 grep 结果塞进 prompt,每次调用都要为成千上万无关的 token 买单。
记忆。 每次会话都从零开始。Agent 在周二重新发现它周一已经学到的东西——并为此付出代价(token 和错误)。
这三个问题相互关联:膨胀的上下文推高成本,缺乏记忆又导致上下文膨胀。正因如此,Velua Code 同时向这三个问题发起攻击。
成本:源头压缩 + 主动路由
第一个架构决策:在源头压缩上下文,而不是在末端压缩。每个工具输出——文件读取、搜索结果、构建日志——在进入会话历史之前都要经过一个压缩管道。核心是一个专有的压缩模型,运行在本地 ONNX 上,即在开发者的机器或 Agent 的容器内。压缩无需网络调用:节省不消耗 token。
围绕它,更简单的层负责繁重的工作:读取去重(Agent 是不是又读了同一个文件?旧版本从上下文中移除)、结构化 JSON 压缩、保留签名同时省略代码主体,以及一个自适应阈值——当上下文增长时,压缩变得更紧。一切都用目标模型的实际分词器进行测量——节省按真实 token 计算,而非估算。
还有一个决策是关于 不做什么:我们从不在运行时修改系统提示。稳定的提示是维持 97.24% 缓存命中率的关键——而缓存命中是最便宜的成本杠杆,因为一个缓存的 token 只占用完整 token 的一小部分成本。
第二个决策:Agent 不自己选择模型。一个本地分类器按类别和复杂度预先分类每个任务,然后 Velua Gateway——它能实时看到 50 多个模型的价格和性能——将任务路由到 在必要范围内 最合适的模型,同时应用护栏并用 RAG 丰富上下文。重命名变量不需要前沿模型;但设计模式迁移则需要。通过主动路由,大多数调用由较小的模型处理,昂贵的模型只在复杂度需要时才介入。
Gateway 还会测量每个请求的真实成本。这使得我视为生产环境中 Agent 不可或缺的东西成为可能:将预算作为停止条件。自主循环以货币形式设定成本上限,而不是凭希望运行。
正是这三者的组合——源头压缩、高缓存、较小模型之间的路由——产生了 R$ 0.04 每百万 token 的结果。单独任何一环都无法接近。
上下文:用图代替 grep
Agent "理解"代码库的标准方式是 grep 和文件读取——既昂贵又盲目。Velua Code 维护一个 代码知识图谱:函数、类、路由以及它们之间的关系(谁调用谁,谁实现什么)。
这在循环的两端都带来了改变。在输入端,Agent 通过 查询图谱(项目的架构视图和与任务相关的节点)来组装一个轻量的上下文包,而不是把文件倾倒进 prompt。在输出端,它改变了 验证:当 Agent 修改一个函数时,图谱会列出所有受影响的调用点,然后一个审查 Agent——拥有干净的上下文,不受编写代码者偏见的影响——检查每一个调用点,同时运行测试、lint 和构建。"你修改了 processOrder 的签名;有七个地方调用了它"——这种验证是 grep 无法提供的。
记忆:不断学习的循环
这是闭合系统的最后一块。在每个验证过的迭代结束时,Agent 会记录 工程决策:做了什么决策、为什么、考虑了哪些替代方案、哪些失败了。并且每个决策都 链接到它解释的代码节点,直接在图谱中。
在下一次迭代中,上下文集收集阶段会检索这些决策——包括已经失败的方案,以避免重复尝试。这个循环不再是重复任务的执行器,而成为一个 积累关于代码库的知识 的系统。这也是最有效的成本摊销方式:廉价的记忆取代了昂贵的重新发现。
于是,完整的循环是:收集上下文(图谱 + 记忆 + RAG)、用适合问题规模的模型进行规划、通过子 Agent 执行、用干净上下文的审查者和图谱感知进行验证、通过记录决策来学习——然后重复,同时设有成本上限。这是经典的 Agent 循环,每个通用阶段都被替换为自身的能力。
为什么第一个客户是我们自己
产品策略有意反直觉:在卖给任何客户之前,Velua Code 先在 SIGE Cloud 内部运行。真正的 dogfooding——一个生产环境中的 ERP,真实团队每天在真实代码上操作 Agent。
正是这种内部使用产生了 130 亿个 token,这也正是塑造产品的过程。生产环境中的自主 Agent 暴露出了基准测试无法暴露的问题:权限、累积成本、停滞的任务、腐烂的上下文。我更希望它在我们自己的痛苦中成熟。
下一步:面向企业的统一记忆
目前,决策记忆按项目存储。下一步最让我兴奋:将其提升到 企业级统一工程记忆层。
想象一下,团队 A 的 Agent 记录的决策——"我们因为 Y 迁移到了 X;我们避开了 Z 因为它破坏了 W"——可以被团队 B 的 Agent 检索,也可以被操作这些 Agent 的人类开发者检索,并且具有访问控制、来源证明和审计。问题"这段代码为什么是这样?"可以用原始决策来回答,并链接到代码,供组织中的任何人或任何 Agent 使用。更快的 onboarding、团队之间的一致性,以及公司的工程知识不再仅仅存在于人的头脑中。
通过 Gateway 提供服务,这种记忆将变成基础设施:公司中的任何 Agent、任何工具,都能继承积累的学习成果。
自主 Agent 将成为商品。但它们积累的关于
你
系统的知识则不会。
这就是我们的赌注。
如果你正在用生产环境中的 Agent 构建产品——或者正在为上下文成本头疼——我的私信随时开放。





