Nous avons levé 355 millions de dollars après avoir quintuplé depuis septembre, dépassant les 300 millions de dollars de revenus annualisés. Notre valorisation post-money est de 4,65 milliards de dollars dans le cadre d'un tour mené par @generalcatalyst et @Redpoint, avec @MenloVentures et @Accel comme nouveaux investisseurs. Tous nos principaux investisseurs existants ont également participé, renforçant leur conviction en Modal.
Une nouvelle couche d'infrastructure pour l'ère de l'IA
Nous avons créé Modal parce que le cloud conçu pour les applications web traditionnelles n'était pas adapté aux charges de travail de l'IA. Cela nous était clair avant la révolution GenAI et cela devient encore plus vrai à mesure que les modèles et les techniques progressent.
Modal est un cloud conçu pour l'IA. Pas un cloud GPU à usage unique, mais une plateforme avec les bonnes primitives pour que les développeurs construisent une très large gamme d'applications. Aujourd'hui, cela se traduit par de l'inférence élastique à faible latence, des environnements d'exécution d'agents dynamiques, de l'apprentissage par renforcement, des traitements par lots à grande échelle, et bien plus encore.
Des API de pointe à la propriété des modèles
Des entreprises nées du numérique comme DoorDash aux entreprises natives de l'IA comme Reducto, les équipes qui prennent de l'avance s'approprient leurs modèles. Ils affinent avec leurs propres données, exécutent du RL et ajustent l'inférence selon leurs besoins de latence, de débit et de coût. Les modèles à poids ouverts de DeepSeek, Qwen et d'autres ont atteint une qualité de production, et les moteurs d'inférence comme vLLM et SGLang ont mûri à leurs côtés. Pour la première fois, la pile complète pour posséder et servir vos modèles est disponible, sans sacrifier les capacités.
Modal alimente à la fois notre infrastructure d'apprentissage par renforcement et notre inférence en production. Des millions de sandboxes d'un côté, du service en temps réel de l'autre. Le tout sur la même plateforme. — @ScottWu46, PDG de @cognition
Decagon a réussi à atteindre une latence p90 de 342 ms, bien en dessous du seuil de la seconde requis pour des conversations clients naturelles, offrant rapidité, efficacité et fiabilité à l'échelle de l'entreprise — @DecagonAI
Les agents ont besoin de meilleurs environnements d'exécution
En 2023, nous avons commencé à voir des utilisateurs exécuter du code généré par l'IA sur Modal. Il était clair que cela deviendrait un besoin universel, nous avons donc construit les Sandboxes, des environnements isolés pour du code non fiable, en tant que primitive de première classe. Il a fallu deux ans pour que l'explosion se produise.
Au cours des six derniers mois, il est devenu clair : les agents seront partout, et ils sont bien plus puissants lorsqu'ils disposent d'un environnement d'exécution pour opérer. DoorDash construit des agents IA pour les commerçants, des agents de codage comme Ramp's Inspect rédigent 70 % des PR fusionnées, les charges de travail de RL exécutent des milliers d'environnements en parallèle, et les agents de recherche automatiques parcourent le web à grande échelle. Plus de 1 milliard de sandboxes ont été lancées sur Modal.
Les Sandboxes sont l'un des blocs de construction les plus importants pour l'apprentissage par renforcement. Modal était clairement très flexible, structuré de manière à nous permettre de construire ces environnements complexes, axé sur la performance et la fiabilité. — @ypatil125 , PDG @appliedcompute
Il aurait été vraiment difficile de construire Inspect sans Modal. Une grande partie de la complexité est cachée derrière la simple capacité de lancer des sandboxes très rapidement avec beaucoup de services et de données, et d'en avoir effectivement une infinité à tout moment. — @rahulgs, Responsable de l'IA appliquée @tryramp
La forme de l'IA ne cesse de s'élargir
Modal est une plateforme de calcul général conçue pour les besoins sous-jacents des charges de travail IA : calcul élastique, isolation sécurisée et contrôle programmatique. Les développeurs les composent en applications très différentes. Physical Intelligence exécute de l'inférence en temps réel pour des robots en direct. Chai Discovery fait évoluer les pipelines de découverte de médicaments, des embeddings de protéines à la conception d'anticorps. Suno génère des millions de chansons par jour, passant de milliers de GPU à presque zéro. Mêmes primitives, formes complètement différentes.
Nous utilisons Modal pour exécuter de l'inférence en périphérie avec une surcharge <10 ms et des traitements par lots à grande échelle. Notre équipe adore la plateforme pour la puissance et la flexibilité qu'elle nous offre. — Brian Ichter, Co-fondateur @physical_int
Ce n'est pas seulement un gain de temps, c'est la charge mentale qui disparaît. Avec Modal, nous ajoutons quelques décorateurs à une fonction que nous devons faire évoluer, nous les oublions, et ils fonctionnent tout simplement — Kevin Wu, Chercheur en ML chez @chaidiscovery
Ce que nous construisons ensuite
Nous avons passé les cinq dernières années à aller très loin dans la technologie, notamment en construisant notre propre couche de stockage et de calcul à partir de zéro. Cela nous a permis d'atteindre des résultats qui semblaient impossibles, par exemple améliorer les démarrages à froid de 100x grâce au snapshotting GPU, l'inférence élastique à faible latence à l'échelle mondiale, et passer de 0 à 1 000 GPU en quelques minutes (voire secondes !) sans réservation en mutualisant la capacité dans des centaines de centres de données dans le monde entier.
Parce que nous possédons toute la pile, nous pouvons continuer à tirer parti de ces avantages pour offrir une expérience de plus en plus performante aux développeurs.
Cette fondation est ce qui rend la prochaine phase possible. Voici où nous allons :
Inférence à faible latence à grande échelle.
La barre de l'inférence en production ne cesse de monter, et nous redoublons d'efforts sur ce qui permet aux équipes d'itérer rapidement : de meilleures primitives de service, une observabilité plus fine, et un investissement continu dans la pile d'inférence ouverte. Nous avons constitué une équipe d'ingénieurs en inférence qui contribuent à Flash Attention, vLLM, SGLang, et plus encore, car les gains de performance doivent revenir à la communauté qui construit sur les mêmes moteurs.
Fusionner la boucle d'entraînement et d'inférence.
L'apprentissage par renforcement est un problème d'infrastructure difficile. L'entraînement multi-nœuds, l'inférence élastique et les sandboxes bénéficient déjà d'un support de première classe sur Modal, ce qui rend la boucle RL complète parfaitement adaptée. Nos utilisateurs constatent déjà des résultats Pareto-efficaces en termes de qualité, coût, latence et débit. Nous voulons rendre le cycle de vie complet de l'entraînement des modèles, du premier ajustement fin au service en production, accessible à bien plus d'équipes.
La couche de calcul pour les agents.
Les Sandboxes génèrent déjà plus d'un tiers de nos revenus, et les clients nous poussent à en faire plus. Nous élargissons la surface des Sandboxes avec de nouvelles capacités et l'échelle pour en exécuter des millions en parallèle. Simultanément, nous reconnaissons que le développement agentique est là. Modal est du code, ce qui en fait déjà un excellent endroit pour les agents. Nous allons continuer à nous améliorer ici, en commençant par déployer un RBAC granulaire afin que les clients puissent donner des capacités aux agents sans risque.
La couche d'infrastructure IA ne fait que commencer. Nous aussi.
Si vous souhaitez rejoindre notre équipe de 120+ personnes à New York, San Francisco et Stockholm, consultez nos offres d'emploi ici.





