Para os construtores e investidores com pouco tempo que querem aprender com as melhores conversas sobre tecnologia e negócios sem abrir mão das horas necessárias para acompanhá-las.
Os oito melhores episódios publicados esta semana, recapitulados em um só lugar, com cada peça completa a um clique de distância. Inscreva-se no Fireside Alpha para receber análises e resumos diários de novos episódios.
O maior destaque da semana:
- Jensen Huang diz que a indústria de chips ainda precisa crescer de cinco a dez vezes antes que a construção da IA termine, e data a bolha para "algum dia, só não hoje". ▶ Assista · 00:32:01
- Charlie Kawwas (Presidente, Broadcom) tem um cliente escalando de 1,5 GW de silício para IA este ano para 6,5 GW contratados no próximo ano para mais de 10 no ano seguinte. ▶ Assista · 00:16:40
- Sassine Ghazi (CEO, Synopsys) classifica o design de chips de IA no nível L4 hoje, o front-end já rodando em seis a oito agentes, depois de dois anos errando ao dizer que estava a cinco ou seis anos de distância. ▶ Assista · 00:12:56
- Andy Hock (Diretor de Estratégia, Cerebras) diz que a OpenAI concordou em comprar 750 megawatts de computação da Cerebras, e a opção Codex mais rápida em seu produto de codificação roda na Cerebras por baixo. ▶ Assista · 00:49:58
- Pat Gelsinger e o painel da HBM incluindo a SK hynix observam que a memória imprime margens próximas a 90% para um negócio que costumava ter "um ano bom em cada quatro", e ainda assim a chamam de memória ruim. ▶ Assista · 0:03:11
- A equipe do SemiAnalysis argumenta que a Anthropic já é lucrativa, com mais de 80% da receita recorrente anual (ARR) no lado da API de alta margem e lucro operacional no Q3 possivelmente ultrapassando US$ 1 bilhão.
- Scott Wu mostra que mais de 90% do código da Cognition agora é commitado pelo Devin, e o agente já inicia a maioria de suas próprias sessões. ▶ Assista · 5:31
- Mansour Karam da Aria Networks diz que o mesmo milhão de tokens pode custar US$ 0,20 ou US$ 20, uma diferença de 100x, e a camada que decide é a rede. ▶ Assista · 0:03:38
Jensen Huang · Axios

Artigo Completo: Jensen Huang sobre os Profetas do Apocalipse da IA: A Bolha Vem Algum Dia, Só Não nos Próximos Cinco Anos
Jensen Huang, cofundador e CEO da NVIDIA, no Axios “Behind the Curtain” com Mike Allen, de uma nova fábrica de chips em Fort Worth, sobre por que a bolha da IA é real, mas está a anos de distância, e o que precisa ser construído primeiro.
A indústria de chips precisa crescer de cinco a dez vezes nos próximos dez anos. A estimativa de Huang se baseia em escassez em memória, armazenamento, interconexões ópticas, empacotamento e capacidade da TSMC ao mesmo tempo.
“Acredito que provavelmente precisamos que nossa indústria de semicondutores seja algo entre cinco a dez vezes maior do que é.”
▶
A bolha vem "algum dia", não nos próximos cinco anos. Allen o pressionou sobre a pergunta mais antiga dos semicondutores: se um boom tão grande está destinado a uma crise.
“A bolha virá algum dia. Só não é hoje. Sabe, isso está bem no início da construção.”
▶
As vendas da NVIDIA na China são "aproximadamente zero hoje". Huang disse aos investidores para não esperarem nada enquanto o mercado chinês permanecer fechado.
“Nossas vendas na China são aproximadamente zero hoje. E eu disse a todos os nossos investidores para não esperarem nenhuma venda na China.”
▶
Os empregos na manufatura aumentaram cerca de 50% nos últimos anos. Huang atribui o aumento à construção física dos data centers de IA que geram tokens.
“O número de empregos na manufatura aumentou cerca de 50% nos últimos anos porque esses computadores precisam ir para esses data centers de IA, que geram os tokens, a inteligência.”
▶
Alguém que usa IA toma seu emprego, não a IA em si. A linha de pensamento anti-apocalipse de Huang divide a automatização de uma tarefa da eliminação de um emprego inteiro.
“A IA não vai destruir todos os nossos empregos. Alguém que usa IA vai tomar nossos empregos.”
▶
Cem bilhões a um trilhão de agentes rodando o tempo todo. Contra cerca de 100 milhões de pessoas usando um computador em qualquer dado momento hoje.
“Vamos ter cem bilhões, um trilhão de agentes rodando o tempo todo. Agentes inteligentes, agentes menos inteligentes, agentes especializados, superagentes, todos os tipos diferentes de agentes rodando o tempo todo.”
▶
Charlie Kawwas · RAISE Summit

Artigo Completo: Broadcom (Charlie Kawwas): Como o Silício Personalizado Foi de Zero a US$ 100 Bilhões
Charlie Kawwas, presidente do grupo de soluções de semicondutores da Broadcom, no palco do RAISE Summit, explicando a Tony Kim, da BlackRock, como o silício personalizado foi de zero a US$ 100 bilhões e por que os maiores laboratórios de IA estão deixando o rack de uso geral da Nvidia.
O rack de uso geral da Nvidia carrega dois impostos: um imposto de eficiência e um imposto de margem. Kawwas está delineando a estrutura de custos que um laboratório de fronteira herda quando compra a plataforma de computação pré-construída da Nvidia.
“Essa computação de uso geral vem com um imposto. O imposto é primeiro a eficiência dessa plataforma de computação, ou seja, ela é construída para todos. Se você tem uma carga de trabalho específica no seu modelo de IA de fronteira, adivinhe, você está pagando esse imposto extra. E então o outro imposto são as altas margens que vêm com ela.”
▶
Cada geração de chip triplica a memória e roda quase 3x a computação da anterior. Kawwas disse isso enquanto entregava ao apresentador chips reais de anos consecutivos, dois cubos de memória contra seis.
“Do ano passado para este ano, você está recebendo três vezes mais memória. Aqui você tem dois cubos de memória. Aqui você tem seis cubos de memória. E a computação que está no meio é quase 3x mais forte.”
▶
Quatro dos cinco grandes laboratórios de IA estão construindo plataformas personalizadas com a Broadcom. Os cinco são OpenAI, Anthropic, Google, Meta e xAI, representando cerca de 90% dos gastos mundiais com IA, segundo a contagem de Kawwas.
“Os cinco grandes nos EUA, que hoje estão gastando talvez 90% dos gastos no mundo, são OpenAI, Anthropic, Google com Gemini, Meta e xAI... Entre esses cinco está literalmente 80, 90% ou mais do mercado. E quatro dos cinco perceberam que a tecnologia da Nvidia é muito boa, mas eles não podem comprar esta plataforma de computação de uso geral que é personalizada no nível do rack.”
▶
O co-design opera em dois níveis: o XPU e o rack inteiro. Kawwas está respondendo por que um laboratório não pode comprar este silício personalizado em uma prateleira, e onde a Broadcom pressiona por um rack aberto.
“Há duas partes nessa alta-costura. Uma é exatamente o co-design profundo para o XPU que você descreveu. A segunda é no nível do rack. Então, não só temos que fazer isso no nível do XPU para seus LLMs e seus casos de uso específicos, mas também nos envolvemos fortemente em como garantir que todo o rack seja aberto.”
▶
Um cliente passa de 1,5 GW este ano para 6,5 GW contratados no próximo ano para mais de 10 no ano seguinte. Perguntado sobre para onde vai a infraestrutura de IA, Kawwas respondeu em termos de energia para um único grande cliente, não em contagens de chips.
“Para um dos cinco grandes, este ano estamos colocando cerca de um gigawatt e meio com um dos chips que mostrei a vocês. No próximo ano, provavelmente colocaremos mais de cinco. Já contratamos cinco... No ano seguinte, tenho certeza de que serão mais de 10.”
▶
Sassine Ghazi · RAISE Summit

Artigo Completo: Synopsys (Sassine Ghazi): O Design de Chips Alcançou o "Nível L4", e a Capacidade de Wafers é o Teto
Sassine Ghazi, CEO da Synopsys, no palco do RAISE Summit, sobre a rapidez com que a IA está projetando os próprios chips e onde a construção fica sem wafers.
Todo chip na terra passa pela Synopsys antes de existir, segundo seu CEO. A Synopsys vende as ferramentas de automação de design eletrônico que os engenheiros de chips usam para projetar silício, agora estendidas para a física pela aquisição da Ansys.
“Não há chip hoje que seja projetado sem a Synopsys, então somos essenciais e onipresentes em termos de nosso uso no nível do silício.”
▶
A mudança do treinamento para a inferência força a customização em toda a pilha. O relato de Ghazi sobre por que um chip de IA de uso geral está se fragmentando em GPUs, ASICs estilo Broadcom e ferramentas proprietárias de hiperescaladores.
“Para alcançar essa eficiência de inferência, você precisa olhar para toda a pilha... E é aí que você precisa tanto da customização do silício, olhando para cima ao longo da pilha, para alcançar a eficiência, desempenho e custo certos.”
▶
As margens dos data centers são custo, e os hiperescaladores estão fazendo co-design para reduzi-las. A aquisição da Ansys, que completa um ano na próxima semana, é o que permite à Synopsys modelar a física térmica, de fluidos e estrutural juntamente com a eletrônica.
“Ao projetar um data center, normalmente você está projetando com muitas margens, e margens equivalem a custo... Estamos vendo muitos dos hiperescaladores e clientes avançados tentando reduzir essa margem através do co-design em múltiplos domínios de engenharia.”
▶
Ghazi disse que o design autônomo de chips estava a cinco ou seis anos de distância, e ele vem errando há dois anos. A Synopsys classifica a autonomia de design de L1 a L5, como carros autônomos, e coloca a indústria no L4 hoje, com o front-end já em seis a oito agentes.
“Se você me fizesse essa pergunta dois anos atrás, eu diria que isso está a cerca de cinco, seis anos de distância, e eu tenho errado nos últimos dois anos porque está chegando muito rápido.”
▶
A capacidade de wafers é o teto tanto em lógica quanto em memória, e a Tesla vê uma escassez de silício até 2030. A restrição limitante da expansão é a produção física da fábrica, não a demanda, que Ghazi espera que continue pressionando contra ela.
“As restrições atuais são limitadas pela capacidade de wafers, e isso é capacidade de wafers de lógica, bem como memória... Quando você ouve empresas como a Tesla dizerem que até 2030 não terão, dada sua ambição de EV para robótica, não haverá capacidade suficiente para suportar a demanda de silício que eles envisionam.”
▶
Andy Hock · Cerebras

Artigo Completo: Como a Cerebras Planeja Matar a Nvidia (Andy Hock, Diretor de Estratégia)
Andy Hock, diretor de estratégia da Cerebras, sobre por que a indústria continua comprando um chip construído para gráficos, e como um processador do tamanho de um wafer deixado inteiro acabou alimentando o acordo de computação de 750 megawatts com a OpenAI.
A Cerebras constrói um chip e deixa o wafer inteiro em vez de fatiá-lo em centenas. A indústria imprime um wafer, corta-o em pequenos chips e os religa através de placas e data centers.
“E se colocássemos o máximo de computação possível em um chip, em um chip grande, e então permitíssemos que os elementos de computação conversassem entre si sobre o silício, para que não tivéssemos que conectar um monte de chips pequenos. [...] E se simplesmente não fizéssemos essa última parte? E se construíssemos um chip grande e o deixássemos inteiro?”
▶
O mecanismo em escala de wafer possui quase um milhão de núcleos, 900.000 em máquinas de produção. Cada núcleo carrega seu próprio banco de memória rápida no chip, todos conectados através de silício em vez de cobre e fibra.
“Este é o mecanismo em escala de wafer. [...] Ele tem quase um milhão de núcleos em um único dispositivo, e 900.000 em nossas máquinas de produção. Eles estão em uma grade 2D em toda a superfície do wafer, e todos esses núcleos estão diretamente conectados uns aos outros. [...] Este design nos dá o que você pode pensar como o equivalente a um cluster de computação de IA em um único dispositivo, e literalmente três ordens de grandeza a mais de largura de banda de comunicação e largura de banda de memória do que é possível com designs de chip tradicionais.”
▶
Treinamento é um centro de custo, inferência é onde você toca a caixa registradora. Hock divide a economia da IA em construir o modelo e executá-lo para os usuários finais.
“Treinamento é um centro de custo. É onde você constrói seu modelo, é onde você o ensina a fazer o que você quer que ele faça. Inferência é um centro de valor. Uma vez que o modelo faz o que você precisa que ele faça, ou o que é valioso para você ou seus usuários finais, a inferência é onde você toca a caixa registradora.”
▶
A Cerebras serve o Gemma 4 a 1.500 tokens por segundo, 10x mais rápido que qualquer implementação em GPU. A empresa colocou o modelo do Google em pré-visualização no dia da entrevista e citou sua velocidade em relação ao mercado.
“Estamos servindo o Gemma 4 a 1.500 tokens por segundo. É 10 vezes mais rápido do que qualquer implementação em GPU e 15 vezes mais rápido do que algo como o modelo Haiku do Claude. [...] Agentes de codificação rápidos, onde velocidade é igual à produtividade do engenheiro de software.”
▶
A OpenAI concordou em comprar 750 megawatts de computação da Cerebras, e o Codex Spark roda nela. A opção de codificação mais rápida e de maior preço no produto da OpenAI roda na Cerebras por baixo.
“Os termos públicos do acordo são que eles vão comprar 750 megawatts de computação da Cerebras para alimentar suas aplicações. O modelo de codificação que usa a Cerebras agora é o Codex Spark, e estamos trabalhando com a equipe da OpenAI para trazer modelos adicionais no futuro, desde seus modelos de fronteira GPT até modelos de codificação de próxima geração.”
▶
A Cerebras mantém toda a sua memória no chip, então a escassez de HBM não a afeta. A memória de alta largura de banda de onde as GPUs puxam os pesos é limitada pela fabricação e não pode escalar sob comando.
“Essa memória está sujeita a limites de fabricação, limites de manufatura. [...] Você não pode simplesmente virar uma chave e produzir 10 vezes mais. E então essa memória é um gargalo agora para esses tipos de chips. Para nós, não é. Temos toda a nossa memória no chip. Está bem aqui. Não faz parte dessa cadeia de suprimentos.”
▶
Painel HBM · RAISE Summit

Artigo Completo: HBM Imprime Margens de 90% e Todos no Palco Ainda a Chamam de Memória Ruim: Dentro do Gargalo de Memória da IA
No RAISE Summit em Paris, Pat Gelsinger, Hoshik Kim (Fellow da SK hynix), e os investidores Andrew Homan e Vijay Shilpiekandula analisaram por que a HBM imprime margens de aproximadamente 90% enquanto todos no palco ainda a chamam de memória ruim.
A HBM obtém margens próximas a 90% para um negócio que costumava ter um ano bom em cada quatro. Gelsinger liderou a Intel através de múltiplos ciclos de memória e agora investe no espaço na Playground Global.
“A memória nunca teve uma situação tão boa. Costumávamos brincar na indústria de semicondutores que, se você fosse uma empresa de memória, tinha um ano bom em cada quatro. Os outros três eram um lixo.” Pat Gelsinger, Playground Global
▶
O ex-CEO da Intel chama a HBM de "uma memória ruim" com o Fellow da SK hynix a um assento de distância. A objeção de Gelsinger é física, não comercial: empilhar DRAM constrói um sanduíche térmico e prende a largura de banda ao litoral onde a memória encontra a GPU.
“HBM é uma memória ruim. Eu sei que meus amigos da memória estão prestes a subir ao palco, e chamar o bebê deles de feio talvez não seja a melhor maneira de fazer amigos e influenciar pessoas.” Pat Gelsinger, Playground Global
▶
O próprio Fellow da SK hynix diz que a HBM não resolverá o problema da parede de memória. Kim lidera a pesquisa de arquitetura de sistemas na SK hynix, a líder de mercado em HBM.
“É uma boa memória, mas não é a resposta final. A HBM não resolverá o problema da parede de memória. O problema da parede de memória é um problema inerente da IA, que você não pode evitar.” Hoshik Kim, SK hynix
▶
A HBM reduz a taxa de produção de uma fábrica de 12 wafers por hora para quatro. Homan recorreu à cozinha para explicar por que a taxa de produção de manufatura impede que a escassez se resolva rapidamente.
“A SK hynix é um fabricante de waffles. Então você tem uma máquina de waffles que normalmente pode cozinhar um waffle em cinco minutos. Então, nesse cenário, você pode fazer 12 waffles por hora. Com a HBM, agora leva 15 minutos para fazer esse waffle. Então agora você só pode fazer quatro waffles por hora.” Andrew Homan, Maverick Silicon
▶
A Apple aumentou os preços em toda a sua linha, e é a compradora de memória mais sofisticada do planeta. A HBM está com um déficit de oferta de aproximadamente 7% em 2026, e Homan apontou para Cupertino para a leitura mais clara de quanto tempo a alta pressão durará.
“A Apple aumentou os preços em toda a sua linha de produtos. Eles são as máquinas de aquisição de memória mais sofisticadas do planeta, e claramente esperam que isso dure um tempo, caso contrário não teriam feito isso.” Andrew Homan, Maverick Silicon
▶
Mais vários anos de escassez de memória pela frente, segundo a leitura do ex-CEO da Intel. Gelsinger definiu sua linha do tempo contra a capacidade que já estava bloqueada por decisões de capital tomadas três anos atrás.
“Os anos de abundância estão a muitos anos de distância. Os anos de escassez de memória, temos mais vários anos pela frente.” Pat Gelsinger, Playground Global
▶
Tokenomics SemiAnalysis · Ep020

Artigo Completo: Tokenomics SemiAnalysis: A Anthropic Já é Lucrativa (US$ 1 Bi+ no Q3), e a OpenAI Acabou de Voltar ao Equilíbrio
A equipe de Tokenomics do SemiAnalysis (Crystal Huang, Max Kan, Joey Brookhart, apresentador Jordan Nanos) passa a hora nas margens dos laboratórios de modelos: por que a Anthropic já é lucrativa, como as assinaturas subsidiam a API, e a receita por megawatt dobrando a cada três trimestres.
A API da Anthropic representa mais de 80% da ARR, e o lucro operacional do Q3 pode ultrapassar US$ 1 bilhão. Joey Brookhart coloca o lucro no P&L em uma base não-GAAP, excluindo remuneração em ações.
“O lucro operacional foi lucrativo no Q2, pode ser lucrativo na ordem de 1 bilhão ou mais no Q3.” Joey Brookhart
Margem bruta da API acima de 85% para a Anthropic, e os planos de assinatura 20x podem ser negativos. Max Kan sobre onde a margem de assinatura versus API realmente se encontra.
“Esqueça ser uma margem pior do que a API, que achamos que é provavelmente 85% ou mais para a Anthropic. Pode ser simplesmente margem negativa em geral para esses planos 20x. E então, é claro, esses negócios querem mover o máximo de volume possível para a API.” Max Kan
A empresa no percentil 99 gasta US$ 100.000 por funcionário por ano em IA. Joey Brookhart lê os dados de cartão da Ramp como a verificação de ROI para gastos pesados em codificação.
“Os dados da Ramp são que as empresas no percentil 99 gastam cem mil por ano em IA por funcionário. E se você chegou a esse ponto de gastar tanto, obviamente está obtendo um ROI muito bom.” Joey Brookhart
Os planos empresariais bloqueiam assinaturas e forçam a cobrança por token, onde está a margem. Max Kan sobre por que os laboratórios medem seus usuários mais pesados na API.
“Qualquer um que possa usar uma assinatura definitivamente deveria usar uma assinatura só porque é tão subsidiada. A OpenAI e a Anthropic estão muito cientes disso. Quando eles têm seus planos empresariais, eles não deixam você usar uma assinatura. Eles te forçam a pagar por token porque sabem que é onde está a margem.” Max Kan
A leitura da equipe: Elon aluga a maior parte do Colossus para a Anthropic a 3x a 4x a taxa de mercado, com uma cláusula de reaquisição de 90 dias. Max Kan narra a lógica de alugar a fronteira do ponto de vista do proprietário da computação.
“Vou deixar vocês com computação suficiente para provar que são capazes de alcançar a fronteira. Enquanto isso, vou monetizar toda a computação adicional alugando-a nesses acordos de aluguel de margem extremamente alta, 3x, talvez 4x a taxa de mercado. Vou garantir que haja essa cláusula de reaquisição de 90 dias incluída em cada um deles.” Max Kan
Os orçamentos de dados dos laboratórios de fronteira ultrapassam US$ 10 bilhões este ano, aproximadamente 10x o ano passado. Max Kan sobre o que realmente limita a capacidade do modelo, onde o gargalo são os ambientes de RL, não a computação bruta.
“O aprendizado por reforço é provavelmente a lei de escalonamento mais importante para melhorar as capacidades do modelo hoje. Há muitas pessoas que acreditam que a única coisa que impede os modelos de serem capazes de fazer literalmente qualquer coisa que um humano possa fazer em um computador é ter ambientes de RL suficientes.” Max Kan
Scott Wu · RAISE Summit

Artigo Completo (link abaixo): Cognition (Scott Wu): A Era de Ouro da Engenharia de Softwareg
Scott Wu, CEO da Cognition e criador do engenheiro de software de IA Devin, no palco do RAISE Summit, argumentando que o salto de produtividade dentro da própria empresa é um motivo para aumentar a equipe de engenharia, e não reduzi-la.
Mais de 90% do código da Cognition agora é commitado pelo Devin. Wu exibiu seu gráfico interno e observou que o agente começou a iniciar suas próprias sessões com base em regressões de desempenho e erros do DataDog, sem nenhum humano no ciclo.
“Vocês veem a porcentagem de código commitada pelo Devin subindo para mais de 90%. Basicamente, usamos o Devin para praticamente tudo agora. O mais louco é que o Devin também faz a maioria das inicializações de novos Devins.”
▶
A Cognition entregou 10 vezes mais software em seis meses com cerca de 40% mais engenheiros. Wu conduziu de novembro ao final de abril um experimento em sua própria empresa, aumentando a equipe de aproximadamente 45 para 60 pessoas, e atribui o resultado a modelos e agentes, e não ao aumento de headcount.
“O que exatamente mudou ao longo de seis meses que nos permitiu entregar 10 vezes mais e fazer 10 vezes mais?”
▶
O GPT-3.5 conseguia rodar 30 segundos de trabalho sem assistência; os modelos mais recentes rodam tarefas de 16 horas. Wu apontou para o estudo da METR, que mede quanto tempo uma IA consegue completar uma tarefa antes de precisar retornar a um humano.
“Olhem para o GPT-3.5, bem no meio daquele gráfico: 30 segundos de trabalho, o que não é ruim, diga-se de passagem. E aquele foi o momento do ChatGPT.”
▶
Em dezembro de 2025, o Devin era o equivalente a 130 engenheiros extras de capacidade por mil. Wu enquadrou a capacidade adicional do agente como headcount que você poderia dar a uma equipe existente, antes de notar que desde então subiu para algo entre 89% e 90% do trabalho.
“Pensem em uma equipe de mil engenheiros de software e imaginem que vocês pudessem dizer a eles: ok, vocês estão recebendo o equivalente a 130 engenheiros de software extras de capacidade para construir coisas. Dá para fazer muita coisa com isso.”
▶
Cada engenheiro é 10 vezes mais produtivo, e há 10 vezes mais coisas para construir. A resposta de Wu ao medo de demissões, apoiada por exemplos deliberadamente mundanos de software não construído, como um Detran que funciona e prontuários médicos acessíveis.
“Cada engenheiro de software humano é dez vezes mais produtivo, mas adivinhem? Temos dez vezes mais coisas para construir.”
▶
Wu encerrou a palestra com uma pergunta: o que você faria com um exército infinito de engenheiros de software. Seus clientes incluem Goldman Sachs, Mercedes-Benz e Lowe's, cada um com dezenas de milhares de engenheiros enfrentando um backlog que nunca acaba.
“O que vocês fariam com um exército infinito de engenheiros de software? Eu pediria a todos vocês que parassem um segundo e pensassem nisso.”
▶
Mansour Karam · RAISE Summit

Mansour Karam, fundador e CEO da Aria Networks, no palco do RAISE Summit com Dylan Patel, da SemiAnalysis, explicando por que a era do "cluster de uso geral para tudo" está acabando e por que a rede decide a economia da inferência.
Treinamento é um centro de custo; servir (serving) se parece mais com alugar um prédio de apartamentos. Karam divide um cluster de IA em dois negócios que compartilham o hardware, mas quase nenhuma das economias.
“Treinamento é essencialmente construir um modelo. É como construir um produto. Mas então servir o modelo, a economia se parece muito mais com o aluguel de um prédio de apartamentos em termos de financiamento.”
▶
Especializar um cluster para uma única carga de trabalho vale um fator de 10 ou 100. Karam vê espaço para novas empresas se formarem em torno de casos de uso únicos, cada uma otimizada para uma métrica.
“Vejo muita oportunidade em torno de novas empresas sendo formadas para otimizar um determinado caso de uso, e a diferença pode ser um fator de 10 ou 100, dependendo da métrica que você está tentando otimizar.”
▶
Um milhão de tokens pode custar US$ 0,20 ou US$ 20, uma variação de 100x determinada por como você constrói. Karam relaciona essa oscilação a se a infraestrutura foi construída para inferência barata de alto throughput ou para outra coisa.
“Você pode ir de uns 20 centavos a uns 20 dólares por milhão de tokens. Quer dizer, isso é uma diferença de 100x. Se você realmente quer otimizar para inferência simples de alto throughput, pode servir de forma muito barata, mas tem que construir sua infraestrutura com isso em mente.”
▶
A frase de Dylan Patel: "velocidade é o fosso." Patel fornece a razão pelo lado da demanda de que o canto rápido é de repente onde o dinheiro vai: agentes operam em loops sequenciais de tentativa e verificação.
“Agentes são muito sequenciais, orientados a tarefas. Tentar algo, verificar, checar se está certo, e você faz isso em um loop. Acaba sendo muito lento. E velocidade é o fosso. Quanto mais rápido você vai, velocidade é o fosso.” Dylan Patel, SemiAnalysis
▶
Um único transceptor com um grão de poeira paralisa todos os usuários no cluster. Uma única consulta de inferência atravessa várias redes em sequência, e o elo mais lento define o ritmo para todos.
“Se você tem perda de pacotes, ou um transceptor com um grão de poeira... então todos os outros têm que esperar, e é tudo sequencial.”
▶
Um segundo dentro de um cluster de inferência "é como um século em escala humana." A proposta de Karam para a Aria é telemetria com resolução de microssegundos para capturar as paradas que o monitoramento padrão de um segundo não percebe.
“Um segundo, no contexto de um cluster de IA rodando inferência, é como um século em escala humana. Muita coisa acontece em um segundo. Então o que você realmente precisa é coletar essa telemetria em resolução de microssegundos, para capturar aqueles eventos que podem estar causando uma parada.”
▶





