Hemos recaudado $355 millones después de multiplicarnos por cinco desde septiembre, superando los $300 millones en ingresos anualizados. Nuestra valoración post-money es de $4.65 mil millones en una ronda liderada por @generalcatalyst y @Redpoint, con @MenloVentures y @Accel uniéndose como nuevos inversores. Todos nuestros principales inversores existentes también participaron, reafirmando su confianza en Modal.
Una nueva capa de infraestructura para la era de la IA
Fundamos Modal porque la nube construida para aplicaciones web tradicionales nunca iba a encajar con las cargas de trabajo de IA. Esto lo teníamos claro antes de la revolución de la IA generativa, y se vuelve aún más cierto a medida que los modelos y las técnicas avanzan.
Modal es una nube construida para IA. No es una nube de GPU de un solo propósito, sino una plataforma con los primitivos adecuados para que los desarrolladores construyan una amplia gama de aplicaciones. Hoy en día, esto se traduce en inferencia elástica de baja latencia, entornos de ejecución dinámicos para agentes, aprendizaje por refuerzo, trabajos por lotes a gran escala, y mucho más.
APIs de frontera para la propiedad de modelos
Desde empresas nativas digitales como DoorDash hasta compañías nativas de IA como Reducto, los equipos que están avanzando están tomando el control de sus modelos. Están haciendo fine-tuning con sus propios datos, ejecutando RL y ajustando la inferencia según sus necesidades de latencia, rendimiento y costo. Los modelos de pesos abiertos de DeepSeek, Qwen y otros han alcanzado la calidad de producción, y los motores de inferencia como vLLM y SGLang han madurado junto a ellos. Por primera vez, está disponible la pila completa para poseer y servir tus modelos, sin sacrificar capacidad.
Modal impulsa tanto nuestra infraestructura de aprendizaje por refuerzo como la inferencia en producción. Millones de sandboxes por un lado, servidores en tiempo real por el otro. Todo en la misma plataforma. — @ScottWu46, CEO de @cognition
Decagon logró una latencia p90 de 342 ms, muy por debajo del rango de menos de un segundo requerido para conversaciones naturales con clientes, ofreciendo velocidad, eficiencia y confiabilidad a escala empresarial — @DecagonAI
Los agentes necesitan mejores entornos de ejecución
En 2023, comenzamos a ver usuarios ejecutando código generado por IA en Modal. Estaba claro que esto se convertiría en una necesidad universal, así que construimos Sandboxes, entornos aislados para código no confiable, como un primitivo de primera clase. Tomó dos años para que ocurriera la explosión.
En los últimos seis meses, ha quedado claro: los agentes van a estar en todas partes, y son mucho más poderosos cuando tienen un entorno de ejecución para operar. DoorDash está construyendo agentes de IA para comerciantes, agentes de codificación como Inspect de Ramp realizan el 70% de los PR fusionados, las cargas de trabajo de RL ejecutan miles de entornos en paralelo, y los agentes de auto-investigación rastrean la web a escala. Más de mil millones de sandboxes se han lanzado en Modal.
Los Sandboxes son uno de los bloques de construcción más importantes para el Aprendizaje por Refuerzo. Modal era claramente muy flexible, estructurado de una manera donde podíamos construir estos entornos complejos, centrados en el rendimiento y la confiabilidad. — @ypatil125, CEO de @appliedcompute
Hubiera sido muy difícil construir Inspect sin Modal. Gran parte de la complejidad se oculta detrás de poder crear sandboxes muy rápidamente con muchos servicios y datos, y efectivamente tener infinitos en cualquier momento. — @rahulgs, Head of Applied AI de @tryramp
La forma de la IA sigue expandiéndose
Modal es una plataforma de cómputo general construida para las necesidades subyacentes de las cargas de trabajo de IA: cómputo elástico, aislamiento seguro y control programático. Los desarrolladores las componen en aplicaciones muy diferentes. Physical Intelligence ejecuta inferencia en tiempo real para robots en vivo. Chai Discovery escala pipelines de descubrimiento de fármacos desde embeddings de proteínas hasta diseño de anticuerpos. Suno genera millones de canciones al día, escalando a miles de GPUs y volviendo a casi cero. Mismos primitivos, formas completamente diferentes.
Usamos Modal para ejecutar inferencia en el borde con una sobrecarga de <10 ms y trabajos por lotes a gran escala. Nuestro equipo ama la plataforma por el poder y la flexibilidad que nos brinda. — Brian Ichter, Co-fundador de @physical_int
No es solo un ahorro de tiempo, es la carga mental que desaparece. Con Modal, añadimos unos decoradores a una función que necesitamos escalar, nos olvidamos de ellos, y simplemente funcionan. — Kevin Wu, ML Researcher de @chaidiscovery
Lo que estamos construyendo a continuación
Hemos pasado los últimos cinco años profundizando en tecnología, incluyendo la construcción de nuestra propia capa de almacenamiento y cómputo desde cero. Esto nos ha permitido lograr resultados que parecían imposibles, por ejemplo, mejorar los arranques en frío en 100x con snapshotting de GPU, inferencia elástica de baja latencia a nivel global, y escalar de 0 a 1,000 GPUs en minutos (¡o incluso segundos!) sin reservas, agrupando capacidad en cientos de centros de datos alrededor del mundo.
Debido a que poseemos la pila completa, podemos seguir construyendo sobre esas ventajas para ofrecer una experiencia cada vez mejor para los desarrolladores.
Inferencia de baja latencia a escala
El listón para la inferencia en producción sigue subiendo, y estamos redoblando la apuesta en lo que permite a los equipos iterar rápido: mejores primitivos de servicio, observabilidad más precisa, e inversión continua en la pila de inferencia abierta. Hemos reunido un equipo de ingenieros de inferencia que contribuyen a Flash Attention, vLLM, SGLang y más, porque las ganancias de rendimiento deben fluir de vuelta a la comunidad que construye sobre los mismos motores.
Fusionando el bucle de entrenamiento e inferencia
El Aprendizaje por Refuerzo es un problema de infraestructura difícil. El entrenamiento multi-nodo, la inferencia elástica y los sandboxes ya tienen soporte de primera clase en Modal, lo que hace que el bucle completo de RL sea un ajuste natural. Nuestros usuarios ya están viendo resultados Pareto-eficientes en calidad, costo, latencia y rendimiento. Queremos hacer que el ciclo de vida completo del entrenamiento de modelos, desde el primer fine-tuning hasta el servicio en producción, sea accesible para muchos más equipos.
La capa de cómputo para agentes
Los Sandboxes ya generan más de un tercio de nuestros ingresos, y los clientes nos siguen pidiendo más. Estamos expandiendo la superficie de Sandboxes con nuevas capacidades y la escala para ejecutar millones en paralelo. Simultáneamente, reconocemos que el desarrollo de agentes está aquí. Modal es código, lo que lo convierte ya en un gran lugar para que trabajen los agentes. Vamos a seguir mejorando aquí, comenzando por lanzar RBAC granular para que los clientes puedan dar capacidad a los agentes sin riesgo.
La capa de infraestructura de IA apenas está comenzando. Nosotros también.
Si te gustaría unirte a nuestro equipo de más de 120 personas en NY, SF y Estocolmo, echa un vistazo a nuestras vacantes aquí.





