我们非常高兴能与 OpenAI 达成合作,成为 OpenAI B2B Marketplace 中首批开放模型推理服务商之一,并在 Codex 内实现了原生集成。现在,OpenAI 的企业客户可以通过现有的 OpenAI 承诺消费额度,在 Codex 中或通过 Responses API 使用由 Baseten 提供的开放模型。对企业而言,这意味着你现有的 OpenAI 承诺消费额度能换来更高的智能性价比。
我们曾撰文探讨过多模型的未来,而这次合作公告恰恰说明,这个未来正以多快的速度变成现实。Agentic coding(智能体编程)是目前落地最广的 AI 应用场景,而 OpenAI 的 Codex 和 GPT 模型则是规模化代码生成工作流中最受欢迎的两个选择。随着由 Baseten 驱动的开放模型正式面向 OpenAI 客户开放,企业可以在开放模型与闭源模型之间灵活优化 Agent 工作流,把每项任务路由给最合适的模型。
Agentic coding 是全球首个大规模落地的多模型工作流
如今,走在 AI 前沿的公司正在转向混合使用多种模型,在智能水平、成本、延迟和容量之间寻找 帕累托最优边界。
顶尖的工程团队正通过静态或自适应路由器,主动将任务分发给能在成本、质量和性能之间取得最佳平衡的模型。而且,新开放模型与闭源模型的迭代周期已经缩短到以周计算,没有任何一个模型能长期包揽所有任务的最佳工具之位。
要想保持领先,企业必须能够即时用上最新模型,并享受快速、可靠的推理服务,同时无缝集成到现有的调度框架、网关和其他工具链中。Baseten 正是为此而生——我们提供高性能的基础设施原语和开发者工具,能够原生融入每家企业独特的技术体系。
全新能力,让代码生成的多模型智能实现规模化
在生产环境中,只有当模型表现始终符合预期时,最高的智能性价比才能真正跑通规模。要让多模型系统在技术上跑得起来,你需要性能、可靠性和灵活性;而要在企业内部真正铺开,你还得加上流畅的开发者体验、全局治理能力以及一线工程支持。
- 全栈性能优化: 代码生成类负载在推理层的挑战尤为突出。多轮对话、针对大型代码库的长 prompt、超大上下文窗口,都会压测技术栈的每一层。因此,我们的性能优化覆盖了从上层工具到底层引擎的所有环节。
- 多云容量与可靠性。 在整个工程组织中,代码生成往往呈爆发式并发,容量是最先卡脖子的瓶颈。Baseten 运行在 20 多个云平台的 90 多个集群上,部署采用双活架构,因此即便某个云厂商或某个区域出现故障,流量也会自动切换,而不是直接停摆。我们与 200 多家算力供应商保持着合作关系,一旦有新算力上线,我们总能第一时间拿到资源,让供给始终跑在需求前面。
- Day zero 模型接入: 当一个新的开放模型登顶代码评测榜单时,等上一个季度再去评估是完全不可接受的。重量级开放模型发布当天,我们就会在 Model APIs 上同步上线。想要试用最新发布的前沿模型,只需改一行代码那么简单。
- 开发者(及 Agent)体验: 对于编程工作流来说,光有推理还不够。Agent 需要地方来运行自己写的代码,这也是为什么 现已加入 Baseten 的 Blaxel 沙盒 会为每个 Agent 提供专属沙盒环境。
- 企业级治理:代码天生就是敏感数据。Baseten 的推理服务运行在美国本土基础设施上,对所有 prompt 实行零数据留存(ZDR)。如果你有更高的合规要求,还可以将部署锁定在特定区域,实施细粒度的身份认证(AuthN)与授权(AuthZ),并按任意模型、用户或密钥维度查看用量。
- 应用研究与驻场工程支持: 前线工程师会根据你的延迟目标调优部署,应用研究员则会与你一起完成训练后优化。LangChain 正是通过 Baseten Loops 为 LangSmith Engine 训练定制模型的。
与 OpenAI 的合作,是我们打造最佳多模型 Agent 编程体验的又一步。无论是 Day zero 接入开放前沿模型、快速可靠的推理,还是在我们云端或你的云端保障算力容量,我们都会持续构建你真正需要的能力,帮你加速 AI 落地,让每一分钱都换回更多智能价值。
如果你想通过 OpenAI 承诺消费额度在 Codex 中原生使用开放模型,欢迎 加入候选名单。其他需求,请直接 与我们的工程师聊聊。





