Para os construtores e investidores com pouco tempo que querem aprender com as melhores conversas sobre tecnologia e negócios sem abrir mão das horas necessárias para acompanhar todas elas.
Os oito melhores episódios publicados esta semana, recapitulados em um só lugar, com cada texto completo a um clique de distância. Não se esqueça de assinar o Fireside Alpha para receber análises diárias e resumos de novos episódios.
O maior destaque da semana:
- Jensen Huang diz que a indústria de chips ainda precisa crescer de cinco a dez vezes antes que a construção da IA termine, e data a bolha para "um dia, só não hoje". ▶ Assista · 00:32:01
- Charlie Kawwas (Presidente, Broadcom) tem um cliente escalando de 1,5 GW de silício para IA este ano para 6,5 GW contratados no próximo ano e mais de 10 no ano seguinte. ▶ Assista · 00:16:40
- Sassine Ghazi (CEO, Synopsys) classifica o design de chips de IA no nível 4 hoje, com o front-end já rodando em seis a oito agentes, depois de dois anos errando ao dizer que estava a cinco ou seis anos de distância. ▶ Assista · 00:12:56
- Andy Hock (Diretor de Estratégia, Cerebras) diz que a OpenAI concordou em comprar 750 megawatts de poder computacional da Cerebras, e a opção mais rápida Codex em seu produto de codificação roda na Cerebras por baixo. ▶ Assista · 00:49:58
- Pat Gelsinger e o painel HBM incluindo SK hynix observam que as memórias imprimem margens próximas a 90% para um negócio que costumava ter "um ano bom em quatro", e ainda assim a chamam de memória ruim. ▶ Assista · 0:03:11
- A equipe do SemiAnalysis argumenta que a Anthropic já é lucrativa, com mais de 80% da receita recorrente anual vindo do lado da API de alta margem e lucro operacional no terceiro trimestre possivelmente superior a US$ 1 bilhão.
- Scott Wu mostra que mais de 90% do código da Cognition agora é commitado pelo Devin, e o agente já inicia a maioria de suas próprias sessões. ▶ Assista · 5:31
- Mansour Karam da Aria Networks diz que o mesmo milhão de tokens pode custar US$ 0,20 ou US$ 20, uma diferença de 100 vezes, e a camada que decide é a rede. ▶ Assista · 0:03:38
Jensen Huang · Axios

Artigo Completo: Jensen Huang sobre os Apocalípticos da IA: A Bolha Vem um Dia, Só Não nos Próximos Cinco Anos
Jensen Huang, cofundador e CEO da NVIDIA, no Axios "Behind the Curtain" com Mike Allen, direto de uma nova fábrica de chips em Fort Worth, sobre por que a bolha da IA é real, mas está a anos de distância, e o que precisa ser construído primeiro.
A indústria de chips precisa crescer de cinco a dez vezes nos próximos dez anos. A estimativa de Huang se baseia em escassez simultânea em memória, armazenamento, interconexões ópticas, empacotamento e capacidade da TSMC.
"Acredito que provavelmente precisamos que nossa indústria de semicondutores seja algo entre cinco a dez vezes maior do que é."
▶
A bolha vem "um dia", não nos próximos cinco anos. Allen o pressionou sobre a questão mais antiga dos semicondutores: se um boom tão grande está fadado a uma crise.
"A bolha virá um dia. Só não é hoje. Sabe, isso está bem no início da construção."
▶
As vendas da NVIDIA na China são "aproximadamente zero hoje". Huang disse aos investidores para não esperarem nada enquanto o mercado chinês permanecer fechado.
"Nossas vendas na China são aproximadamente zero hoje. E eu disse a todos os nossos investidores para não esperarem nenhuma venda na China."
▶
Os empregos na manufatura aumentaram cerca de 50% nos últimos anos. Huang atribui o aumento à construção física dos data centers de IA que geram tokens.
"O número de empregos na manufatura aumentou cerca de 50% nos últimos anos porque esses computadores precisam ir para esses data centers de IA, que geram os tokens, a inteligência."
▶
Alguém que usa IA toma seu emprego, não a IA em si. A linha anti-apocalíptica de Huang separa a automatização de uma tarefa da eliminação de um emprego inteiro.
"A IA não vai destruir todos os nossos empregos. Alguém que usa IA vai tomar nossos empregos."
▶
Cem bilhões a um trilhão de agentes rodando o tempo todo. Contra cerca de 100 milhões de pessoas usando um computador em qualquer dado momento hoje.
"Nós vamos ter cem bilhões, um trilhão de agentes rodando o tempo todo. Agentes inteligentes, agentes menos inteligentes, agentes especializados, superagentes, todos os tipos diferentes de agentes rodando o tempo todo."
▶
Charlie Kawwas · RAISE Summit

Artigo Completo: Broadcom (Charlie Kawwas): Como o Silício Personalizado Foi de Zero a US$ 100 Bilhões
Charlie Kawwas, presidente do grupo de soluções de semicondutores da Broadcom, no palco do RAISE Summit, explicando a Tony Kim, da BlackRock, como o silício personalizado foi de zero a US$ 100 bilhões e por que os maiores laboratórios de IA estão deixando o rack de uso geral da Nvidia.
O rack de uso geral da Nvidia carrega dois impostos: um imposto de eficiência e um imposto de margem. Kawwas está detalhando a estrutura de custos que um laboratório de fronteira herda quando compra a plataforma de computação pré-construída da Nvidia.
"Essa computação geral vem com um imposto. O imposto é primeiro a eficiência dessa plataforma de computação, ou seja, ela é construída para todos. Se você tem uma carga de trabalho específica em seu modelo de IA de fronteira, adivinhe, você está pagando esse imposto extra. E o outro imposto são as altas margens que vêm com ela."
▶
Cada geração de chip triplica a memória e roda quase 3x o poder computacional da anterior. Kawwas disse isso enquanto entregava ao apresentador chips reais de anos consecutivos, dois cubos de memória contra seis.
"Do ano passado para este ano, você está obtendo três vezes mais memória. Aqui você tem dois cubos de memória. Aqui você tem seis cubos de memória. E o poder computacional no meio é quase 3 vezes mais forte."
▶
Quatro dos cinco grandes laboratórios de IA estão construindo plataformas personalizadas com a Broadcom. Os cinco são OpenAI, Anthropic, Google, Meta e xAI, representando cerca de 90% dos gastos mundiais com IA, segundo a contagem de Kawwas.
"Os cinco grandes nos EUA, que hoje estão gastando talvez 90% dos gastos no mundo, são OpenAI, Anthropic, Google com Gemini, Meta e xAI... Entre esses cinco está literalmente 80, 90% ou mais do mercado. E quatro dos cinco perceberam que a tecnologia da Nvidia é muito boa, mas eles não podem continuar comprando essa plataforma de computação geral que é personalizada no nível do rack."
▶
O co-design opera em dois níveis: a XPU e o rack inteiro. Kawwas está respondendo por que um laboratório não pode comprar este silício personalizado em uma prateleira, e onde a Broadcom pressiona por um rack aberto.
"Há duas partes nessa alta-costura. Uma é exatamente o co-design profundo para a XPU que você descreveu. A segunda é no nível do rack. Então, não só temos que fazer isso no nível da XPU para seus LLMs e seus casos de uso específicos, mas também nos envolvemos pesadamente em como garantir que o rack inteiro seja aberto."
▶
Um cliente vai de 1,5 GW este ano para 6,5 GW contratados no próximo ano e mais de 10 no ano seguinte. Perguntado sobre para onde a infraestrutura de IA vai a seguir, Kawwas respondeu em termos de energia para um único grande cliente, não em contagem de chips.
"Para um dos cinco grandes, este ano estamos colocando cerca de um gigawatt e meio com um dos chips que mostrei. No próximo ano, provavelmente colocaremos mais de cinco. Já contratamos cinco... No ano seguinte, tenho certeza que será mais de 10."
▶
Sassine Ghazi · RAISE Summit

Artigo Completo: Synopsys (Sassine Ghazi): O Design de Chips Atingiu o "Nível 4", e a Capacidade de Wafers é o Teto
Sassine Ghazi, CEO da Synopsys, no palco do RAISE Summit, sobre a rapidez com que a IA está projetando os próprios chips e onde a expansão encontra o limite de wafers.
Todo chip na Terra passa pela Synopsys antes de existir, segundo seu CEO. A Synopsys vende as ferramentas de automação de design eletrônico que os engenheiros de chips usam para projetar o silício, agora estendidas para a física pela aquisição da Ansys.
"Não há chip hoje que seja projetado sem a Synopsys, então somos essenciais e onipresentes em termos de nosso uso no nível do silício."
▶
A mudança do treinamento para a inferência força a personalização em toda a pilha. O relato de Ghazi sobre por que um chip de IA de uso geral está se fragmentando em GPUs, ASICs estilo Broadcom e ferramentas próprias de hiperescaladores.
"Para alcançar essa eficiência de inferência, você precisa olhar para toda a pilha... E é aí que você precisa tanto da personalização do silício, olhando para cima ao longo da pilha, para alcançar a eficiência, desempenho e custo certos."
▶
As margens dos data centers são custo, e os hiperescaladores estão fazendo co-design para reduzi-las. A aquisição da Ansys, que completa um ano na próxima semana, é o que permite à Synopsys modelar física térmica, de fluidos e estrutural junto com a eletrônica.
"Ao projetar um data center, normalmente você está projetando com muitas margens, e margens equivalem a custo... Estamos vendo muitos hiperescaladores e clientes avançados tentando reduzir essa margem por meio do co-design em múltiplos domínios de engenharia."
▶
Ghazi chamou o design autônomo de chips de cinco a seis anos de distância, e está errado há dois anos consecutivos. A Synopsys classifica a autonomia de design de L1 a L5 como a direção autônoma e coloca a indústria no L4 hoje, com o front-end já em seis a oito agentes.
"Se você me fizesse essa pergunta há dois anos, eu diria que isso está a cerca de cinco, seis anos de distância, e eu estive errado nos últimos dois anos porque está chegando muito rápido."
▶
A capacidade de wafers é o teto tanto em lógica quanto em memória, e a Tesla vê uma escassez de silício até 2030. A restrição limitante na expansão é a produção física das fábricas, não a demanda, que Ghazi espera que continue pressionando contra ela.
"As restrições atuais são limitadas pela capacidade de wafers, e isso é capacidade de wafer lógico, bem como memória... Quando você ouve empresas como a Tesla dizerem que até 2030 não terão, dada sua ambição do veículo elétrico à robótica, não haverá capacidade suficiente para suportar a demanda de silício que eles envisioned."
▶
Andy Hock · Cerebras

Artigo Completo: Como a Cerebras Planeja Matar a Nvidia (Andy Hock, Diretor de Estratégia)
Andy Hock, diretor de estratégia da Cerebras, sobre por que a indústria continua comprando um chip feito para gráficos, e como um processador do tamanho de um wafer deixado inteiro acabou alimentando o acordo de 750 megawatts de poder computacional da OpenAI.
A Cerebras constrói um único chip e deixa o wafer inteiro, em vez de fatiá-lo em centenas. A indústria imprime um wafer, corta-o em pequenos chips e os reconecta através de placas e data centers.
"E se colocássemos o máximo de poder computacional possível juntos em um chip, em um chip grande, e então permitíssemos que os elementos de computação conversassem entre si sobre silício, para que não tivéssemos que conectar um monte de chips pequenos. [...] E se simplesmente não fizéssemos essa última parte? E se construíssemos um chip grande e o deixássemos inteiro?"
▶
O wafer scale engine contém quase um milhão de núcleos, 900.000 nas máquinas de produção. Cada núcleo carrega seu próprio banco de memória rápida no chip, todos conectados através de silício, em vez de cobre e fibra.
"Este é o wafer scale engine. [...] Ele tem quase um milhão de núcleos todos em um único dispositivo, e 900.000 em nossas máquinas de produção. Eles estão em uma grade 2D em toda a superfície do wafer, e todos esses núcleos estão diretamente conectados uns aos outros. [...] Este design nos dá o que você pode pensar como um cluster de poder computacional de IA em um único dispositivo, e literalmente três ordens de grandeza mais largura de banda de comunicação e largura de banda de memória do que é possível com designs de chip tradicionais."
▶
Treinamento é um centro de custo, inferência é onde você faz o dinheiro soar. Hock divide a economia da IA entre construir o modelo e executá-lo para os usuários finais.
"Treinamento é um centro de custo. É aí que você constrói seu modelo, é aí que você o ensina a fazer o que você quer que ele faça. Inferência é um centro de valor. Quando o modelo faz a coisa que você precisa que ele faça, ou a coisa que é valiosa para você ou seus usuários finais, a inferência é onde você faz o dinheiro soar."
▶
A Cerebras serve o Gemma 4 a 1.500 tokens por segundo, 10x qualquer implementação em GPU. A empresa colocou o modelo do Google em pré-visualização no dia da entrevista e citou sua velocidade em relação ao mercado.
"Estamos servindo o Gemma 4 a 1.500 tokens por segundo. É 10 vezes mais rápido do que qualquer implementação em GPU e 15 vezes mais rápido do que algo como o modelo Haiku do Claude. [...] Agentes de codificação rápidos, onde velocidade é igual à produtividade do engenheiro de software."
▶
A OpenAI concordou em comprar 750 megawatts de poder computacional da Cerebras, e o Codex Spark roda nela. A opção de codificação mais rápida e de maior preço no produto da OpenAI é a Cerebras por baixo.
"Os termos públicos do acordo são que eles vão comprar 750 megawatts de poder computacional da Cerebras para alimentar suas aplicações. O modelo de codificação que usa a Cerebras agora é o Codex Spark, e estamos trabalhando com a equipe da OpenAI para trazer modelos adicionais no futuro, desde seus modelos de fronteira GPT até modelos de codificação de próxima geração."
▶
A Cerebras mantém toda a sua memória no chip, então a escassez de HBM não a afeta. A memória de alta largura de banda da qual as GPUs puxam pesos é limitada pela fabricação e não pode escalar sob comando.
"Essa memória está sujeita a limites de fabricação, limites de manufatura. [...] Você não pode simplesmente girar um botão e produzir 10 vezes mais. E então essa memória é um gargalo agora para esses tipos de chips. Para nós, não é. Temos toda a nossa memória no chip. Está bem aqui. Não faz parte dessa cadeia de suprimentos."
▶
Painel HBM · RAISE Summit

Artigo Completo: HBM Imprime Margens de 90% e Todos no Palco Ainda a Chamam de Memória Ruim: Dentro do Gargalo de Memória da IA
No RAISE Summit em Paris, Pat Gelsinger, o Fellow da SK hynix Hoshik Kim, e os investidores Andrew Homan e Vijay Shilpiekandula analisaram por que a HBM imprime margens de aproximadamente 90% enquanto todos no palco ainda a chamam de memória ruim.
A HBM obtém margens próximas a 90% para um negócio que costumava ter um ano bom em quatro. Gelsinger dirigiu a Intel através de vários ciclos de memória e agora investe no espaço na Playground Global.
"A memória nunca esteve tão boa. Costumávamos brincar na indústria de semicondutores que, se você fosse uma empresa de memória, tinha um ano bom em quatro. Os outros três eram uma droga." Pat Gelsinger, Playground Global
▶
O ex-CEO da Intel chama a HBM de "uma memória ruim" com o Fellow da SK hynix a um assento de distância. A objeção de Gelsinger é física, não comercial: empilhar DRAM cria um sanduíche térmico e prende a largura de banda na linha de costa onde a memória encontra a GPU.
"HBM é uma memória ruim. Eu sei que meus amigos da memória estão prestes a subir ao palco, e chamar o bebê deles de feio talvez não seja a melhor maneira de fazer amigos e influenciar pessoas." Pat Gelsinger, Playground Global
▶
O próprio Fellow da SK hynix diz que a HBM não resolverá o problema da parede de memória. Kim dirige a pesquisa de arquitetura de sistemas na SK hynix, líder de mercado em HBM.
"É uma boa memória, mas não é a resposta final. A HBM não resolverá o problema da parede de memória. O problema da parede de memória é um problema inerente da IA, que você não pode evitar." Hoshik Kim, SK hynix
▶
A HBM reduz o rendimento de uma fábrica de 12 waffles por hora para quatro. Homan recorreu à cozinha para explicar por que o rendimento da manufatura impede que a escassez se resolva rapidamente.
"A SK hynix é uma fabricante de waffles. Então você tem uma máquina de waffle que normalmente pode cozinhar um waffle em cinco minutos. Nesse cenário, você pode fazer 12 waffles por hora. Com a HBM, agora leva 15 minutos para fazer aquele waffle. Então agora você só pode fazer quatro waffles por hora." Andrew Homan, Maverick Silicon
▶
A Apple aumentou os preços em toda a sua linha, e é a compradora de memória mais sofisticada do planeta. A HBM está com um déficit de oferta de aproximadamente 7% em 2026, e Homan apontou para Cupertino como a leitura mais clara de quanto tempo a escassez vai durar.
"A Apple aumentou os preços em toda a sua linha de produtos. Eles são as máquinas de aquisição de memória mais sofisticadas do planeta, e claramente esperam que isso dure um tempo, caso contrário não teriam feito isso." Andrew Homan, Maverick Silicon
▶
Mais vários anos de escassez de memória pela frente, segundo a leitura do ex-CEO da Intel. Gelsinger definiu seu cronograma em relação à capacidade que já estava bloqueada por decisões de capital tomadas há três anos.
"Os anos de abundância estão muitos anos distantes. Os anos de escassez de memória, temos mais vários anos pela frente." Pat Gelsinger, Playground Global
▶
SemiAnalysis Tokenomics · Ep020

Artigo Completo: SemiAnalysis Tokenomics: A Anthropic Já é Lucrativa (US$ 1 Bi+ no 3º Trimestre), e a OpenAI Acabou de Voltar ao Zero
A equipe de Tokenomics do SemiAnalysis (Crystal Huang, Max Kan, Joey Brookhart, apresentador Jordan Nanos) passa a hora nas margens dos laboratórios de modelos: por que a Anthropic já é lucrativa, como as assinaturas subsidiam a API, e a receita por megawatt dobrando a cada três trimestres.
A API da Anthropic é 80% ou mais da receita recorrente anual, e o lucro operacional do 3º trimestre pode ultrapassar US$ 1 bilhão. Joey Brookhart coloca o lucro no P&L em uma base não-GAAP, excluindo compensação baseada em ações.
"O lucro operacional foi lucrativo no 2º trimestre, pode ser lucrativo na ordem de 1 bilhão ou mais no 3º trimestre." Joey Brookhart
Margem bruta da API da Anthropic de 85% ou mais, e os planos de assinatura 20x podem ser negativos. Max Kan sobre onde a margem de assinatura versus API realmente se encontra.
"Esqueça ser pior margem do que a API, que achamos que é provavelmente 85% ou mais para a Anthropic pelo menos. Pode ser margem negativa em geral para esses planos 20x. E então, é claro, esses negócios querem mover o máximo de volume possível para a API." Max Kan
A empresa no percentil 99 gasta US$ 100.000 por funcionário por ano em IA. Joey Brookhart lê os dados de cartão da Ramp como a verificação de ROI em gastos pesados com codificação.
"Os dados da Ramp mostram que o percentil 99 das empresas gasta cem mil por ano em IA por funcionário. E se você chegou a esse ponto de gastar tanto, obviamente está obtendo um ROI muito bom." Joey Brookhart
Os planos empresariais bloqueiam assinaturas e forçam a cobrança por token, onde está a margem. Max Kan sobre por que os laboratórios medem seus usuários mais pesados na API.
"Qualquer um que possa usar uma assinatura definitivamente deveria usar uma assinatura só porque é tão subsidiada. OpenAI e Anthropic estão muito cientes disso. Quando eles têm seus planos empresariais, eles não deixam você usar uma assinatura. Eles forçam você a pagar por token porque sabem que é aí que está a margem." Max Kan
A leitura da equipe: Elon aluga a maior parte do Colossus para a Anthropic a 3x a 4x a taxa de mercado, com uma cláusula de resgate de 90 dias. Max Kan narra a lógica do aluguel de fronteira da perspectiva do proprietário do poder computacional.
"Vou deixar para vocês poder computacional suficiente para provar que são capazes de alcançar a fronteira. Enquanto isso, vou monetizar todo o poder computacional adicional alugando-o nesses acordos de aluguel de margem extremamente alta de 3x, talvez 4x a taxa de mercado. Vou garantir que haja esta cláusula de resgate de 90 dias incluída em cada um deles." Max Kan
Os orçamentos de dados dos laboratórios de fronteira ultrapassam US$ 10 bilhões este ano, cerca de 10x o ano passado. Max Kan sobre o que realmente limita a capacidade do modelo, onde o gargalo são os ambientes de RL, em vez de poder computacional bruto.
"O aprendizado por reforço é provavelmente a lei de escalonamento mais importante para melhorar as capacidades do modelo hoje. Há muitas pessoas que acreditam que a única coisa que impede os modelos de serem capazes de fazer literalmente qualquer coisa que um humano pode fazer em um computador é ter ambientes de RL suficientes." Max Kan
Scott Wu · RAISE Summit

Artigo Completo (link abaixo): Cognition (Scott Wu): A Era de Ouro da Engenharia de Software
Scott Wu, CEO da Cognition e criador do engenheiro de software IA Devin, no palco do RAISE Summit, argumentando que o salto de produtividade dentro de sua própria empresa é um motivo para aumentar a equipe de engenharia, não reduzi-la.
Mais de 90% do código da Cognition agora é commitado pelo Devin. Wu exibiu seu gráfico interno e observou que o agente começou a acionar suas próprias sessões com base em regressões de desempenho e erros do DataDog, sem intervenção humana.
"Você vê a porcentagem de código commitada pelo Devin subindo para mais de 90%. Basicamente, usamos o Devin para praticamente tudo agora. O mais louco é que o Devin também faz a maioria das inicializações de Devins."
▶
A Cognition entregou 10 vezes mais software em seis meses com cerca de 40% mais engenheiros. Wu realizou um experimento de novembro ao final de abril em sua própria empresa, aumentando a equipe de aproximadamente 45 para 60, e atribui o resultado a modelos e agentes, não ao número de funcionários.
"O que exatamente mudou ao longo de seis meses que nos permitiu entregar 10 vezes mais e fazer 10 vezes mais?"
▶
O GPT-3.5 conseguia executar 30 segundos de trabalho não assistido; os modelos mais recentes executam tarefas de 16 horas. Wu apontou para o estudo da METR, que mede por quanto tempo uma IA consegue completar uma tarefa antes de precisar voltar a um humano.
"Observe o GPT-3.5, bem no meio do gráfico: 30 segundos de trabalho, o que não é ruim, aliás. E esse foi o momento do ChatGPT."
▶
Em dezembro de 2025, o Devin era uma largura de banda extra de 130 engenheiros por mil. Wu enquadrou a capacidade adicional do agente como o número de funcionários que você poderia dar a uma equipe existente, antes de observar que desde então subiu para cerca de 89 a 90% do trabalho.
"Pense em uma equipe de mil engenheiros de software e imagine que você pudesse dizer a eles: ok, vocês estão recebendo uma largura de banda extra de 130 engenheiros de software para construir coisas. Dá para fazer muito com isso."
▶
Cada engenheiro é 10 vezes mais produtivo, e há 10 vezes mais coisas para construir. A resposta de Wu ao medo das demissões, apoiada por exemplos deliberadamente banais de software não construído, como um DMV que funciona e registros médicos acessíveis.
"Cada engenheiro de software humano é dez vezes mais produtivo, mas adivinhe? Temos dez vezes mais coisas para construir."
▶
Wu emoldurou a palestra com uma pergunta: o que você faria com um exército infinito de engenheiros de software. Seus clientes incluem Goldman Sachs, Mercedes-Benz e Lowe's, cada um com dezenas de milhares de engenheiros trabalhando em um backlog que nunca se esgota.
"O que você faria com um exército infinito de engenheiros de software? Eu pediria a todos vocês que parassem um segundo e pensassem nisso."
▶
Mansour Karam · RAISE Summit

Mansour Karam, fundador e CEO da Aria Networks, no palco do RAISE Summit com Dylan Patel, da SemiAnalysis, explicando por que a era do "cluster de uso geral para tudo" está terminando e por que a rede decide a economia da inferência.
Treinamento é um centro de custo; servir (o modelo) se parece mais com alugar um complexo de apartamentos. Karam divide um cluster de IA em dois negócios que compartilham o hardware, mas quase nenhuma das economias.
"Treinamento é essencialmente construir um modelo. Isso é como construir um produto. Mas servir o modelo, a economia se parece muito mais com alugar um complexo de apartamentos em termos de financiamento."
▶
Especializar um cluster para uma única carga de trabalho vale um fator de 10 ou 100. Karam vê espaço para novas empresas se formarem em torno de casos de uso únicos, cada uma otimizada para uma métrica.
"Vejo muita oportunidade em torno de novas empresas sendo formadas para otimizar um determinado caso de uso, e a diferença pode ser um fator de 10 ou 100, dependendo da métrica que você está tentando otimizar."
▶
Um milhão de tokens pode custar de US$ 0,20 a US$ 20, uma variação de 100x determinada pela forma como você constrói. Karam associa a oscilação ao fato de a infraestrutura ter sido construída para inferência barata e de alto throughput ou para outra finalidade.
"Você pode ir de, digamos, 20 centavos até 20 dólares por milhão de tokens. Quer dizer, isso é uma diferença de 100x. Se você realmente quer otimizar para inferência simples e de alto throughput, pode servir de forma muito barata, mas precisa construir sua infraestrutura pensando nisso."
▶
A frase de Dylan Patel: "velocidade é o fosso." Patel fornece a razão do lado da demanda pela qual o canto rápido é onde o dinheiro está de repente: os agentes executam loops sequenciais de tentativa e verificação.
"Agentes são muito sequenciais, orientados a tarefas. Tentar algo, verificar, checar se está certo, e você faz isso em um loop. Acaba sendo muito lento. E velocidade é o fosso. Quanto mais rápido você vai, velocidade é o fosso." Dylan Patel, SemiAnalysis
▶
Um único transceptor com um grão de poeira interrompe todos os usuários no cluster. Uma única consulta de inferência cruza várias redes em sequência, e o link mais lento define o ritmo para todos.
"Se você tem perda de pacotes, ou um transceptor com um grão de poeira... então todos os outros têm que esperar, e é tudo sequencial."
▶
Um segundo dentro de um cluster de inferência "é como um século em escala humana." O argumento de Karam para a Aria é a telemetria com resolução de microssegundos para capturar as paradas que o monitoramento padrão de um segundo não percebe.
"Um segundo, no contexto de um cluster de IA executando inferência, é como um século em escala humana. Muita coisa acontece em um segundo. Então, o que você realmente precisa é coletar essa telemetria em resolução de microssegundos, para capturar os eventos que podem estar causando uma parada."
▶





