Wir haben 355 Millionen US-Dollar eingesammelt, nachdem wir uns seit September verfĂŒnffacht haben und einen annualisierten Umsatz von ĂŒber 300 Millionen US-Dollar erzielen. Unsere Bewertung betrĂ€gt 4,65 Milliarden US-Dollar post-money in einer Runde unter der Leitung von @generalcatalyst und @Redpoint, mit @MenloVentures und @Accel als neuen Investoren. Alle unsere bisherigen Hauptinvestoren haben ebenfalls teilgenommen und ihr Vertrauen in Modal bekrĂ€ftigt.
Eine neue Infrastrukturebene fĂŒr das KI-Zeitalter
Wir haben Modal gegrĂŒndet, weil die Cloud, die fĂŒr traditionelle Webanwendungen gebaut wurde, niemals zu KI-Workloads passen wĂŒrde. Das war uns schon vor der GenAI-Revolution klar und wird mit der Weiterentwicklung von Modellen und Techniken noch wahrer.
Modal ist eine Cloud, die fĂŒr KI gebaut wurde. Keine reine GPU-Cloud, sondern eine Plattform mit den richtigen Primitiven, damit Entwickler eine sehr breite Palette von Anwendungen erstellen können. Heute sieht das aus wie latenzarme elastische Inferenz, dynamische Agenten-Laufzeitumgebungen, Reinforcement Learning, Batch-Jobs in massivem MaĂstab und vieles mehr.
Von Frontier-APIs zur Modell-Eigenverantwortung
Von digitalen Natives wie DoorDash bis hin zu KI-nativen Unternehmen wie Reducto â die Teams, die sich absetzen, ĂŒbernehmen die Verantwortung fĂŒr ihre Modelle. Sie feintunen mit ihren eigenen Daten, betreiben Reinforcement Learning und optimieren die Inferenz fĂŒr ihre eigenen Latenz-, Durchsatz- und Kostenanforderungen. Open-Weight-Modelle von DeepSeek, Qwen und anderen haben ProduktionsqualitĂ€t erreicht, und Inferenz-Engines wie vLLM und SGLang sind parallel dazu gereift. Zum ersten Mal ist der gesamte Stack vorhanden, um Ihre Modelle zu besitzen und zu betreiben, ohne Kompromisse bei der LeistungsfĂ€higkeit einzugehen.
Modal betreibt sowohl unsere Reinforcement-Learning-Infrastruktur als auch die Produktionsinferenz. Millionen von Sandboxen auf der einen Seite, Echtzeit-Serving auf der anderen. Alles auf derselben Plattform. â @ScottWu46, CEO @cognition
Decagon konnte eine p90-Latenz von 342 ms erreichen, weit unter der geforderten Subsekunden-Grenze fĂŒr natĂŒrliche KundengesprĂ€che, und liefert Geschwindigkeit, Effizienz und ZuverlĂ€ssigkeit auf Unternehmensebene â @DecagonAI
Agenten brauchen bessere AusfĂŒhrungsumgebungen
Im Jahr 2023 sahen wir zum ersten Mal, dass Benutzer KI-generierten Code auf Modal ausfĂŒhrten. Es war klar, dass dies ein universelles BedĂŒrfnis werden wĂŒrde, also bauten wir Sandboxen, isolierte Umgebungen fĂŒr nicht vertrauenswĂŒrdigen Code, als erstklassiges Primitive. Es dauerte zwei Jahre, bis die Explosion stattfand.
In den letzten sechs Monaten wurde klar: Agenten werden ĂŒberall sein, und sie sind weitaus leistungsfĂ€higer, wenn sie eine Laufzeitumgebung zum Arbeiten haben. DoorDash baut KI-Agenten fĂŒr HĂ€ndler, Coding-Agenten wie Ramp's Inspect verfassen 70 % der zusammengefĂŒhrten PRs, RL-Workloads laufen tausende Umgebungen parallel, und Autoresearch-Agenten durchsuchen das Internet in groĂem MaĂstab. Ăber 1 Milliarde Sandboxen wurden auf Modal gestartet.
Sandboxen sind einer der wichtigsten Bausteine fĂŒr Reinforcement Learning. Modal war offensichtlich sehr flexibel, so strukturiert, dass wir diese komplexen Umgebungen aufbauen konnten, mit Fokus auf Leistung und ZuverlĂ€ssigkeit. â @ypatil125 , CEO @appliedcompute
Es wĂ€re wirklich schwierig gewesen, Inspect ohne Modal zu bauen. Ein GroĂteil der KomplexitĂ€t versteckt sich hinter der Möglichkeit, Sandboxen sehr schnell mit vielen Diensten und Daten hochzufahren und praktisch unbegrenzt viele davon zu jeder Zeit zu haben. â @rahulgs, Head of Applied AI @tryramp
Die Form von KI erweitert sich stÀndig
Modal ist eine universelle Compute-Plattform, die fĂŒr die zugrunde liegenden Anforderungen von KI-Workloads gebaut wurde: elastisches Computing, sichere Isolation und programmgesteuerte Kontrolle. Entwickler setzen sie zu sehr unterschiedlichen Anwendungen zusammen. Physical Intelligence fĂŒhrt Echtzeit-Inferenz fĂŒr Live-Roboter durch. Chai Discovery skaliert Wirkstoffforschungs-Pipelines von Protein-Embeddings bis hin zum Antikörperdesign. Suno generiert Millionen von Songs pro Tag, skaliert auf Tausende von GPUs und zurĂŒck auf nahe Null. Gleiche Primitive, völlig unterschiedliche Formen.
Wir nutzen Modal, um Edge-Inferenz mit <10ms Overhead und Batch-Jobs in groĂem MaĂstab durchzufĂŒhren. Unser Team liebt die Plattform fĂŒr die LeistungsfĂ€higkeit und FlexibilitĂ€t, die sie uns bietet. â Brian Ichter, Co-founder @physical_int
Es ist nicht nur eine Zeitersparnis, sondern der mentale Aufwand, der verschwindet. Mit Modal fĂŒgen wir ein paar Dekorateure zu einer Funktion hinzu, die wir skalieren mĂŒssen, vergessen sie, und sie funktionieren einfach. â Kevin Wu, ML Researcher at @chaidiscovery
Was wir als NĂ€chstes bauen
Wir haben die letzten fĂŒnf Jahre damit verbracht, sehr tief in die Technologie einzusteigen, einschlieĂlich dem Aufbau unserer eigenen Speicher- und Compute-Schicht von Grund auf. Dies hat es uns ermöglicht, Ergebnisse zu erzielen, die unmöglich schienen, z. B. die Verbesserung von Kaltstarts um das 100-fache mit GPU-Snapshotting, elastische latenzarme Inferenz weltweit und die Skalierung von 0 auf 1.000 GPUs in Minuten (oder sogar Sekunden!) ohne Reservierungen durch die BĂŒndelung von KapazitĂ€t in Hunderten von Rechenzentren auf der ganzen Welt.
Da wir den gesamten Stack besitzen, können wir auf diesen Vorteilen aufbauen, um Entwicklern eine immer bessere Erfahrung zu bieten.
Dieses Fundament ermöglicht die nÀchste Phase. Hier geht es hin:
Latenzarme Inferenz in groĂem MaĂstab.
Die Messlatte fĂŒr Produktionsinferenz verschiebt sich stĂ€ndig, und wir setzen verstĂ€rkt auf das, was Teams eine schnelle Iteration ermöglicht: bessere Serving-Primitive, schĂ€rfere Observability und fortgesetzte Investitionen in den offenen Inferenz-Stack. Wir haben ein Team von Inferenz-Ingenieuren zusammengestellt, die zu Flash Attention, vLLM, SGLang und mehr beitragen, denn Leistungssteigerungen sollten an die Gemeinschaft zurĂŒckflieĂen, die auf denselben Engines aufbaut.
Die Trainings- und Inferenzschleife zusammenfĂŒhren.
Reinforcement Learning ist ein schwieriges Infrastrukturproblem. Multi-Node-Training, elastische Inferenz und Sandboxen haben bereits erstklassige UnterstĂŒtzung auf Modal, was den gesamten RL-Zyklus zu einer natĂŒrlichen Passform macht. Unsere Benutzer sehen bereits Pareto-effiziente Ergebnisse in QualitĂ€t, Kosten, Latenz und Durchsatz. Wir möchten den gesamten Modelltrainings-Lebenszyklus, vom ersten Feintuning bis zum Produktions-Serving, fĂŒr weit mehr Teams zugĂ€nglich machen.
Die Compute-Schicht fĂŒr Agenten.
Sandboxen treiben bereits mehr als ein Drittel unseres Umsatzes, und Kunden drĂ€ngen uns nach mehr. Wir erweitern die Sandbox-OberflĂ€che mit neuen FĂ€higkeiten und dem MaĂstab, um Millionen parallel auszufĂŒhren. Gleichzeitig erkennen wir, dass agentische Entwicklung angekommen ist. Modal ist Code, was es bereits zu einem groĂartigen Ort fĂŒr Agenten zum Arbeiten macht. Wir werden hier weiter verbessern, beginnend mit der Auslieferung von granularer RBAC, damit Kunden Agenten FĂ€higkeiten ohne Risiko geben können.
Die KI-Infrastrukturebene fÀngt gerade erst an. Wir auch.
Wenn Sie unser 120-köpfiges Team in NY, SF und Stockholm verstÀrken möchten, werfen Sie einen Blick auf unsere offenen Stellen hier.





