हमें OpenAI B2B Marketplace में पहले open-model inference प्रोवाइडर्स में से एक के रूप में OpenAI के साथ साझेदारी करने पर गर्व है, जिसमें Codex के अंदर एक नेटिव इंटीग्रेशन भी शामिल है। अब OpenAI के एंटरप्राइज़ ग्राहक Codex के भीतर या Responses API के ज़रिए Baseten द्वारा सर्व किए जाने वाले open models के लिए अपने मौजूदा OpenAI commitments का इस्तेमाल कर सकते हैं। एंटरप्राइज़ेज़ के लिए इसका मतलब है कि आपके मौजूदा OpenAI commitment के ज़रिए हर डॉलर में और भी ज़्यादा intelligence (बुद्धिमत्ता) हासिल करना।
हमने multi-model भविष्य के बारे में लिखा है, और यह घोषणा दिखाती है कि वह भविष्य कितनी तेज़ी से वर्तमान बन रहा है। आज Agentic coding सबसे ज़्यादा अपनाया जाने वाला AI use case है, और code generation workflows को स्केल करने के लिए OpenAI के Codex और GPT models दो सबसे लोकप्रिय विकल्पों में से हैं। अब जब Baseten द्वारा संचालित open models OpenAI के ग्राहकों के लिए उपलब्ध हो गए हैं, तो संगठन open और closed दोनों मॉडल्स में agentic workflows को ऑप्टिमाइज़ कर सकते हैं और हर टास्क को उसके लिए सबसे उपयुक्त मॉडल पर रूट कर सकते हैं।
Agentic coding वैश्विक स्तर पर पहला multi-model workflow है
आज, AI में अग्रणी कंपनियाँ intelligence, लागत, latency और capacity के Pareto frontiers पर मॉडल्स के मिश्रण का इस्तेमाल करने की ओर बढ़ रही हैं।
शीर्ष engineering teams स्टैटिक या adaptive routers के ज़रिए सक्रिय रूप से टास्क्स को उस मॉडल तक पहुँचा रही हैं जो उस काम के लिए लागत, गुणवत्ता और performance का सबसे बेहतरीन संतुलन देता है। और चूँकि नए open और closed मॉडल्स के बीच का चक्र अब कुछ हफ़्तों तक सिमट गया है, इसलिए कोई भी मॉडल लंबे समय तक हर काम के लिए सबसे अच्छा टूल नहीं बना रहता।
आगे बने रहने के लिए, कंपनियों को तुरंत नवीनतम मॉडल्स तक पहुँच चाहिए — ऐसी fast और reliable inference के साथ जो उनके harnesses, gateways और अन्य tooling में आसानी से integrate हो जाए। Baseten को ठीक इसी उद्देश्य के लिए डिज़ाइन किया गया है, जो high-performance infrastructure primitives और developer tools प्रदान करता है जो हर संगठन के अनूठे setup में नेटिव रूप से integrate हो जाते हैं।
Code generation के लिए multi-model intelligence को स्केल करने की नई क्षमताएँ
प्रोडक्शन में हर डॉलर के बदले सबसे बेहतरीन intelligence तभी बड़े पैमाने पर काम करती है जब मॉडल्स लगातार अपेक्षाओं के अनुसार perform करें। किसी multi-model system को तकनीकी रूप से काम करने लायक बनाने के लिए आपको performance, reliability और flexibility की ज़रूरत होती है। इसे किसी एंटरप्राइज़ के भीतर स्केल करने के लिए, आपको streamlined developer experience, global governance capabilities और front-line engineering support भी जोड़ना होगा।
- Full-stack performance optimization: Inference layer पर code generation workloads खास तौर पर चुनौतीपूर्ण होते हैं। multiple turns, बड़े repos पर लंबे prompts, और विशाल context windows स्टैक के हर हिस्से पर दबाव डालते हैं, इसलिए हमारा performance से जुड़ा काम tooling से लेकर engine level तक सब कुछ कवर करता है।
- Multi-cloud capacity और reliability. Code generation पूरी engineering organizations में bursts के रूप में चलता है, और capacity ही वह बाधा है जो सबसे पहले सामने आती है। Baseten 20+ clouds पर 90 से ज़्यादा clusters में चलता है, और deployments active-active मोड में चलते हैं, इसलिए किसी provider या region के खराब होने पर काम रुकता नहीं बल्कि traffic दूसरी जगह route हो जाता है। 200+ compute providers के साथ हमारे संबंधों की वजह से, जब भी नई capacity उपलब्ध होती है तो हमें सबसे पहले कॉल किया जाता है, ताकि supply माँग से पहले ही बढ़ जाए।
- Day zero model access: जब कोई नया open model coding benchmarks में शीर्ष पर आता है, तो उसे evaluate करने के लिए एक तिमाही तक इंतज़ार करना स्वीकार्य नहीं है। हम जिस दिन major open models रिलीज़ होते हैं, उसी दिन उन्हें Model APIs पर लॉन्च कर देते हैं। रिलीज़ के दिन ही नवीनतम frontier model को evaluate करना उतना ही आसान है जितना कोड की एक लाइन अपडेट करना।
- Developer (और agent) experience: Coding workflows के लिए सिर्फ inference काफी नहीं है। Agents को अपना लिखा हुआ कोड चलाने के लिए किसी जगह की ज़रूरत होती है, यही कारण है कि Blaxel sandboxes, जो अब Baseten का हिस्सा हैं, हर agent को उसका अपना sandbox देते हैं।
- Enterprise governance: कोड स्वभाव से ही sensitive होता है, और Baseten की inference US-based infrastructure पर चलती है जिसमें सभी prompts के लिए zero data retention (ZDR) होता है। और भी सख्त compliance requirements के लिए, आप deployments को specific regions तक सीमित (pin) कर सकते हैं, fine-grained AuthN और AuthZ लागू कर सकते हैं, और किसी भी model, user या key के usage को देख सकते हैं।
- Applied research और embedded engineering support: Forward-deployed engineers आपके latency targets के हिसाब से deployments को tune करते हैं, और applied researchers आपके साथ मिलकर post-training चलाते हैं। इसी तरह LangChain, Baseten Loops के साथ LangSmith Engine के लिए custom models train करता है।
OpenAI के साथ हमारी साझेदारी सबसे बेहतरीन multi-model agentic coding experience देने की दिशा में एक और कदम है। Day zero पर open frontier models तक पहुँच, fast और reliable inference, और हमारे या आपके cloud में guaranteed capacity के साथ, हम वह सब बनाते रहेंगे जिसकी आपको AI adoption को तेज़ करने और हर डॉलर में intelligence की value बढ़ाने के लिए ज़रूरत है।
अपने OpenAI commitment के ज़रिए Codex में open models को नेटिव रूप से access करने के लिए, लिस्ट में शामिल हों। बाकी किसी भी चीज़ के लिए, किसी engineer से बात करें।





