Siamo entusiasti di collaborare con OpenAI come uno dei primi provider di inferenza per modelli open source nell'OpenAI B2B Marketplace, inclusa un'integrazione nativa all'interno di Codex. I clienti enterprise di OpenAI possono ora utilizzare i propri impegni contrattuali esistenti con OpenAI per accedere ai modelli open source serviti da Baseten all'interno di Codex o tramite la Responses API. Per le aziende, questo significa ottenere ancora più intelligenza per ogni dollaro speso attraverso il proprio impegno contrattuale esistente con OpenAI.
Abbiamo già parlato del futuro multi-modello e questo annuncio dimostra quanto rapidamente quel futuro stia diventando il presente. L'agentic coding è attualmente il caso d'uso dell'IA più diffuso e i modelli Codex e GPT di OpenAI sono due delle scelte più popolari per scalare i workflow di generazione del codice. Con i modelli open source supportati da Baseten ora disponibili per i clienti OpenAI, le organizzazioni possono ottimizzare i workflow agentic su modelli aperti e chiusi, indirizzando ogni task al modello più adatto.
L'agentic coding è il primo workflow multi-modello su scala globale
Oggi, le aziende all'avanguardia nell'IA stanno passando all'utilizzo di un mix di modelli posizionati sulle frontiere di Pareto in termini di intelligenza, costo, latenza e capacità.
I migliori team di engineering instradano attivamente i task, tramite router statici o adattivi, verso il modello che offre il miglior compromesso tra costo, qualità e prestazioni per quella specifica attività. E con il ciclo di rilascio di nuovi modelli aperti e chiusi sceso a poche settimane, nessun modello rimane lo strumento migliore per ogni lavoro a lungo.
Per restare competitive, le aziende hanno bisogno di accesso immediato ai modelli più recenti, con un'inferenza rapida e affidabile che si integri perfettamente nei loro harness, gateway e altri strumenti. Baseten è stato progettato esattamente per questo: fornisce primitive infrastrutturali ad alte prestazioni e strumenti per sviluppatori che si integrano in modo nativo nell'ecosistema unico di ogni organizzazione.
Nuove funzionalità per scalare l'intelligenza multi-modello nella generazione di codice
Il miglior rapporto intelligenza/dollaro in produzione funziona su larga scala solo quando i modelli offrono costantemente le prestazioni attese. Servono prestazioni, affidabilità e flessibilità per far funzionare tecnicamente un sistema multi-modello. Ma per scalare all'interno di un'azienda, devi aggiungere un'esperienza di sviluppo fluida, funzionalità di governance globale e supporto tecnico di prima linea.
- Ottimizzazione delle prestazioni full-stack: i carichi di lavoro per la generazione di codice sono particolarmente impegnativi a livello di inferenza. Turni multipli, prompt lunghi su repository di grandi dimensioni e finestre di contesto enormi mettono sotto stress ogni parte dello stack, per questo il nostro lavoro sulle prestazioni copre tutto, dagli strumenti fino al motore.
- Capacità e affidabilità multi-cloud. La generazione di codice procede a picchi in intere organizzazioni di engineering, e la capacità è il vincolo che si fa sentire per primo. Baseten opera su oltre 90 cluster distribuiti su più di 20 cloud, con deployment in modalità active-active: se perdi un provider o una regione, il traffico viene reindirizzato invece di bloccare il lavoro. Le relazioni con oltre 200 provider di computing ci rendono il primo interlocutore quando diventa disponibile nuova capacità, così l'offerta cresce prima della domanda.
- Accesso ai modelli dal giorno zero: quando un nuovo modello aperto domina le classifiche di benchmark sul codice, non è accettabile aspettare un trimestre per valutarlo. Lanciamo i principali modelli open source sulle Model APIs il giorno stesso del loro rilascio. Valutare il nuovissimo modello frontier il giorno in cui esce è semplice come aggiornare una singola riga di codice.
- Esperienza per sviluppatori (e agenti): l'inferenza da sola non basta per i workflow di programmazione. Gli agenti hanno bisogno di un posto dove eseguire il codice che scrivono; ecco perché le sandbox Blaxel, ora parte di Baseten, assegnano a ogni agente la propria sandbox dedicata.
- Governance enterprise: il codice è sensibile per definizione, e l'inferenza di Baseten gira su infrastrutture situate negli Stati Uniti con zero data retention (ZDR) per tutti i prompt. Per requisiti di conformità ancora più stringenti, puoi ancorare i deployment a regioni specifiche, implementare AuthN e AuthZ granulari e monitorare l'utilizzo per qualsiasi modello, utente o chiave.
- Ricerca applicata e supporto engineering integrato: i nostri forward-deployed engineer calibrano i deployment sui tuoi obiettivi di latenza, mentre i ricercatori applicati eseguono il post-training insieme a te. È così che LangChain addestra modelli personalizzati per LangSmith Engine con Baseten Loops.
La nostra partnership con OpenAI è un ulteriore passo verso la migliore esperienza di agentic coding multi-modello. Con l'accesso ai modelli frontier open source dal giorno zero, un'inferenza rapida e affidabile e capacità garantita nel nostro cloud o nel tuo, continueremo a costruire ciò che ti serve per accelerare l'adozione dell'IA e aumentare il valore dell'intelligenza per ogni dollaro investito.
Per accedere ai modelli open source in modo nativo in Codex tramite il tuo impegno contrattuale con OpenAI, iscriviti alla lista. Per tutto il resto, parla con un nostro engineer.





