Levantamos US$ 355 milhões depois de crescer cinco vezes desde Setembro, ultrapassando US$ 300 milhões em receita anualizada. Nossa avaliação é de US$ 4,65 bilhões pós-money em uma rodada liderada por @generalcatalyst e @Redpoint, com @MenloVentures e @Accel entrando como novos investidores. Todos os nossos principais investidores existentes também participaram, reforçando sua convicção na Modal.
Uma nova camada de infraestrutura para a era da IA
Começamos a Modal porque a nuvem construída para aplicações web tradicionais nunca se adequaria às cargas de trabalho de IA. Isso estava claro para nós antes da revolução da GenAI e se torna ainda mais verdadeiro à medida que os modelos e técnicas avançam.
A Modal é uma nuvem construída para IA. Não é uma nuvem de GPU de propósito único, mas uma plataforma com os primitivos certos para que desenvolvedores construam uma vasta gama de aplicações. Hoje, isso se traduz em inferência elástica de baixa latência, runtimes dinâmicos para agentes, aprendizado por reforço, jobs em lote em escala massiva e muito mais.
De APIs de fronteira à propriedade de modelos
Desde nativos digitais como DoorDash até empresas nativas de IA como a Reducto, as equipes que estão se destacando estão assumindo a propriedade de seus modelos. Eles estão fazendo fine-tuning com seus próprios dados, executando RL e ajustando a inferência para suas próprias necessidades de latência, throughput e custo. Modelos de pesos abertos da DeepSeek, Qwen e outros atingiram qualidade de produção, e mecanismos de inferência como vLLM e SGLang amadureceram junto com eles. Pela primeira vez, a pilha completa para possuir e servir seus modelos está disponível, sem sacrificar a capacidade.
A Modal alimenta tanto nossa infraestrutura de aprendizado por reforço quanto a inferência em produção. Milhões de sandboxes de um lado, servindo em tempo real do outro. Tudo na mesma plataforma. — @ScottWu46, CEO @cognition
A Decagon conseguiu atingir uma latência p90 de 342ms, bem abaixo do intervalo de submissegundo necessário para conversas naturais com clientes, entregando velocidade, eficiência e confiabilidade em escala empresarial — @DecagonAI
Agentes precisam de melhores ambientes de execução
Em 2023, começamos a ver usuários executarem código gerado por IA na Modal. Ficou claro que isso se tornaria uma necessidade universal, então construímos Sandboxes, ambientes isolados para código não confiável, como um primitivo de primeira classe. Levou dois anos para a explosão acontecer.
Nos últimos seis meses, ficou claro: os agentes estarão em todos os lugares, e eles são muito mais poderosos quando têm um runtime para operar. A DoorDash está construindo agentes de IA para comerciantes, agentes de codificação como o Inspect da Ramp são autores de 70% dos PRs mesclados, cargas de trabalho de RL executam milhares de ambientes em paralelo, e agentes de auto-pesquisa rastreiam a web em escala. Mais de 1 bilhão de sandboxes foram lançados na Modal.
Sandboxes são um dos blocos de construção mais importantes para o Aprendizado por Reforço. A Modal era claramente muito flexível, estruturada de uma forma que podíamos construir esses ambientes complexos, focada em desempenho e confiabilidade. — @ypatil125 , CEO @appliedcompute
Teria sido muito difícil construir o Inspect sem a Modal. Grande parte da complexidade fica oculta por trás da capacidade de criar sandboxes muito rapidamente com muitos serviços e dados, e efetivamente ter infinitas delas a qualquer momento. — @rahulgs, Head of Applied AI @tryramp
O formato da IA continua se expandindo
A Modal é uma plataforma de computação geral construída para as necessidades subjacentes das cargas de trabalho de IA: computação elástica, isolamento seguro e controle programático. Os desenvolvedores as compõem em aplicações muito diferentes. A Physical Intelligence executa inferência em tempo real para robôs ao vivo. A Chai Discovery escala pipelines de descoberta de medicamentos, desde embeddings de proteínas até design de anticorpos. A Suno gera milhões de músicas por dia, escalando para milhares de GPUs e voltando a quase zero. Mesmos primitivos, formatos completamente diferentes.
Usamos a Modal para executar inferência na borda com overhead <10ms e jobs em lote em larga escala. Nossa equipe adora a plataforma pelo poder e flexibilidade que ela nos oferece. — Brian Ichter, Co-founder @physical_int
Não é apenas uma economia de tempo, é a sobrecarga mental que desaparece. Com a Modal, adicionamos alguns decoradores a uma função que precisamos escalar, esquecemos deles e eles simplesmente funcionam — Kevin Wu, ML Researcher at @chaidiscovery
O que estamos construindo em seguida
Passamos os últimos cinco anos nos aprofundando muito em tecnologia, incluindo a construção de nossa própria camada de armazenamento e computação do zero. Isso nos permitiu alcançar resultados que pareciam impossíveis, por exemplo, melhorar cold starts em 100x com snapshotting de GPU, inferência elástica de baixa latência globalmente, e escalar de 0 a 1.000 GPUs em minutos (ou até segundos!) sem reservas, ao agrupar capacidade em centenas de data centers ao redor do mundo.
Porque possuímos toda a pilha, podemos continuar construindo sobre essas vantagens para oferecer uma experiência cada vez melhor para os desenvolvedores.
Essa base é o que torna possível a próxima fase. Aqui está para onde estamos indo:
Inferência de baixa latência em escala.
O nível da inferência em produção continua subindo, e estamos dobrando a aposta no que permite que as equipes iterem rapidamente: melhores primitivos de servimento, observabilidade mais precisa e investimento contínuo na pilha de inferência aberta. Montamos uma equipe de engenheiros de inferência contribuindo para Flash Attention, vLLM, SGLang e mais, porque os ganhos de desempenho devem fluir de volta para a comunidade que constrói nos mesmos mecanismos.
Colapsando o loop de treinamento e inferência.
Aprendizado por Reforço é um problema de infraestrutura difícil. Treinamento multi-nó, inferência elástica e sandboxes já têm suporte de primeira classe na Modal, o que torna o loop completo de RL um ajuste natural. Nossos usuários já estão vendo resultados Pareto-eficientes em qualidade, custo, latência e throughput. Queremos tornar o ciclo de vida completo de treinamento de modelos, desde o primeiro fine-tune até o servimento em produção, acessível a muito mais equipes.
A camada de computação para agentes.
Sandboxes já geram mais de um terço de nossa receita, e os clientes continuam nos pressionando por mais. Estamos expandindo a superfície do Sandbox com novas capacidades e a escala para executar milhões em paralelo. Simultaneamente, reconhecemos que o desenvolvimento de agentes chegou. A Modal é código, o que já a torna um ótimo lugar para agentes trabalharem. Vamos continuar melhorando aqui, começando por entregar RBAC granular para que os clientes possam dar capacidade aos agentes sem riscos.
A camada de infraestrutura de IA está apenas começando. Nós também.
Se você gostaria de se juntar à nossa equipe de mais de 120 pessoas em NY, SF e Estocolmo, confira nossas vagas em aberto aqui.





