Recebemos US$ 355 milhões após crescer cinco vezes desde setembro, ultrapassando US$ 300 milhões em receita anualizada. Nossa valuation é de US$ 4,65 bilhões pós-money em uma rodada liderada por @generalcatalyst e @Redpoint, com @MenloVentures e @Accel como novos investidores. Todos os nossos principais investidores atuais também participaram, dobrando sua aposta na Modal.
Uma nova camada de infraestrutura para a era da IA
Criamos a Modal porque a nuvem construída para aplicações web tradicionais nunca serviria para cargas de trabalho de IA. Isso estava claro para nós antes da revolução da IA Generativa e se torna ainda mais verdadeiro à medida que modelos e técnicas avançam.
A Modal é uma nuvem construída para IA. Não uma nuvem de GPU para um único propósito, mas uma plataforma com os primitivos certos para que desenvolvedores criem uma ampla gama de aplicações. Hoje, isso inclui inferência elástica de baixa latência, runtimes dinâmicos para agentes, aprendizado por reforço, jobs em lote em escala massiva, e muito mais.
De APIs de fronteira à propriedade de modelos
De nativos digitais como DoorDash a empresas nativas de IA como Reducto, as equipes que estão se destacando estão assumindo o controle de seus modelos. Eles estão fazendo fine-tuning com seus próprios dados, executando RL, e ajustando inferência para suas próprias necessidades de latência, throughput e custo. Modelos de pesos abertos da DeepSeek, Qwen e outros atingiram qualidade de produção, e engines de inferência como vLLM e SGLang amadureceram junto com eles. Pela primeira vez, a pilha completa para possuir e servir seus modelos está disponível, sem sacrificar capacidade.
A Modal alimenta tanto nossa infraestrutura de aprendizado por reforço quanto a inferência em produção. Milhões de sandboxes de um lado, servindo em tempo real do outro. Tudo na mesma plataforma. — @ScottWu46, CEO @cognition
A Decagon conseguiu atingir uma latência p90 de 342ms, bem abaixo do intervalo de submissegundos necessário para conversas naturais com clientes, entregando velocidade, eficiência e confiabilidade em escala empresarial — @DecagonAI
Agentes precisam de melhores ambientes de execução
Em 2023, começamos a ver usuários executando código gerado por IA na Modal. Ficou claro que isso se tornaria uma necessidade universal, então construímos Sandboxes, ambientes isolados para código não confiável, como um primitivo de primeira classe. Levou dois anos para a explosão acontecer.
Nos últimos seis meses, ficou claro: os agentes estarão em todos os lugares, e eles são muito mais poderosos quando têm um runtime para operar. DoorDash está construindo agentes de IA para comerciantes, agentes de codificação como Inspect da Ramp são responsáveis por 70% dos PRs mesclados, cargas de trabalho de RL executam milhares de ambientes em paralelo, e agentes de pesquisa automatizados rastreiam a web em escala. Mais de 1 bilhão de sandboxes foram iniciados na Modal.
As Sandboxes são um dos blocos de construção mais importantes para o aprendizado por reforço. A Modal era claramente muito flexível, estruturada de uma forma que nos permitia construir esses ambientes complexos, focada em desempenho e confiabilidade. — @ypatil125 , CEO @appliedcompute
Teria sido muito difícil construir o Inspect sem a Modal. Grande parte da complexidade fica oculta atrás da capacidade de criar sandboxes muito rapidamente com muitos serviços e dados, e efetivamente ter infinitas delas a qualquer momento. — @rahulgs, Head of Applied AI @tryramp
O formato da IA continua se expandindo
A Modal é uma plataforma de computação geral construída para as necessidades subjacentes das cargas de trabalho de IA: computação elástica, isolamento seguro e controle programático. Os desenvolvedores as compõem em aplicações muito diferentes. Physical Intelligence executa inferência em tempo real para robôs ao vivo. Chai Discovery escala pipelines de descoberta de medicamentos, desde embeddings de proteínas até design de anticorpos. Suno gera milhões de músicas por dia, escalando para milhares de GPUs e voltando para perto de zero. Mesmos primitivos, formatos completamente diferentes.
Usamos a Modal para executar inferência na borda com menos de 10ms de overhead e jobs em lote em grande escala. Nossa equipe adora a plataforma pelo poder e flexibilidade que ela nos oferece. — Brian Ichter, Co-founder @physical_int
Não é apenas uma economia de tempo, é a sobrecarga mental que desaparece. Com a Modal, adicionamos alguns decoradores a uma função que precisa ser escalada, esquecemos deles, e eles simplesmente funcionam — Kevin Wu, ML Researcher at @chaidiscovery
O que estamos construindo em seguida
Passamos os últimos cinco anos nos aprofundando muito em tecnologia, incluindo a construção de nossa própria camada de armazenamento e computação do zero. Isso nos permitiu alcançar resultados que pareciam impossíveis, por exemplo, melhorar cold starts em 100x com snapshotting de GPU, inferência elástica de baixa latência globalmente, e escalar de 0 a 1.000 GPUs em minutos (ou até segundos!) sem reservas, agrupando capacidade em centenas de data centers em todo o mundo.
Porque possuímos toda a pilha, podemos continuar construindo sobre essas vantagens para oferecer uma experiência cada vez melhor para os desenvolvedores.
Essa base é o que torna a próxima fase possível. Aqui está o que estamos planejando:
Inferência de baixa latência em escala.
O padrão para inferência em produção continua evoluindo, e estamos dobrando a aposta no que permite que as equipes iterem rapidamente: melhores primitivos de serviço, observabilidade mais refinada e investimento contínuo na pilha de inferência aberta. Montamos uma equipe de engenheiros de inferência que contribuem para Flash Attention, vLLM, SGLang e mais, porque os ganhos de desempenho devem fluir de volta para a comunidade que constrói nas mesmas engines.
Unindo o loop de treinamento e inferência.
O aprendizado por reforço é um problema de infraestrutura difícil. Treinamento multi-nó, inferência elástica e sandboxes já têm suporte de primeira classe na Modal, o que torna o loop completo de RL um ajuste natural. Nossos usuários já estão vendo resultados Pareto-eficientes em qualidade, custo, latência e throughput. Queremos tornar o ciclo de vida completo de treinamento de modelos, desde o primeiro fine-tuning até o serviço em produção, acessível para muito mais equipes.
A camada de computação para agentes.
As Sandboxes já geram mais de um terço de nossa receita, e os clientes continuam nos pressionando por mais. Estamos expandindo a superfície das Sandboxes com novas capacidades e a escala para executar milhões em paralelo. Simultaneamente, reconhecemos que o desenvolvimento de agentes já é realidade. A Modal é código, o que a torna um ótimo lugar para agentes trabalharem. Vamos continuar melhorando aqui, começando por lançar RBAC granular para que os clientes possam dar capacidade aos agentes sem riscos.
A camada de infraestrutura de IA está apenas começando. Nós também.
Se você quiser se juntar à nossa equipe de mais de 120 pessoas em NY, SF e Estocolmo, confira nossas vagas em aberto aqui.





