Para los constructores e inversores con poco tiempo que quieren aprender de las mejores conversaciones sobre tecnología y negocios sin dedicar las horas que lleva seguirlas todas.
Los ocho mejores episodios publicados esta semana, resumidos en un solo lugar, con cada artículo completo a un clic de distancia. Asegúrate de suscribirte a Fireside Alpha para recibir análisis y desgloses diarios de los nuevos episodios.
Lo más destacado de esta semana:
- Jensen Huang afirma que la industria de chips aún debe crecer entre cinco y diez veces antes de que termine la construcción de la IA, y sitúa la burbuja en "algún día, simplemente no hoy". ▶ Ver · 00:32:01
- Charlie Kawwas (Presidente, Broadcom) tiene un cliente que escala de 1.5 GW de silicio para IA este año a 6.5 GW contratados el próximo año, y a más de 10 el año siguiente. ▶ Ver · 00:16:40
- Sassine Ghazi (CEO, Synopsys) califica el diseño de chips con IA hoy como nivel L4, con el front-end ya ejecutándose en seis u ocho agentes, después de haber estado equivocado durante dos años al decir que faltaban cinco o seis años. ▶ Ver · 00:12:56
- Andy Hock (Director de Estrategia, Cerebras) revela que OpenAI acordó comprar 750 megavatios de capacidad de cómputo de Cerebras, y que la opción Codex más rápida en su producto de codificación funciona sobre Cerebras internamente. ▶ Ver · 00:49:58
- Pat Gelsinger y el panel de HBM, incluyendo a SK hynix, señalan que la memoria imprime márgenes cercanos al 90% para un negocio que solía tener "un buen año de cada cuatro", y aún así lo llaman una mala memoria. ▶ Ver · 0:03:11
- El equipo de SemiAnalysis sostiene que Anthropic ya es rentable, con más del 80% de sus ingresos anuales recurrentes (ARR) en el lado de la API de alto margen y un beneficio operativo en el tercer trimestre que posiblemente supere los mil millones de dólares.
- Scott Wu muestra que más del 90% del código de Cognition ahora es enviado por Devin, y que el agente ya inicia la mayoría de sus propias sesiones. ▶ Ver · 5:31
- Mansour Karam de Aria Networks dice que el mismo millón de tokens puede costar entre 0.20 y 20 dólares, una diferencia de 100 veces, y la capa que lo decide es la red. ▶ Ver · 0:03:38
Jensen Huang · Axios

Artículo completo: Jensen Huang sobre los agoreros de la IA: La burbuja llegará algún día, pero no en los próximos cinco años
Jensen Huang, cofundador y CEO de NVIDIA, en Axios "Behind the Curtain" con Mike Allen desde una nueva planta de chips en Fort Worth, explica por qué la burbuja de la IA es real pero está a años de distancia y qué debe construirse primero.
La industria de chips debe crecer entre cinco y diez veces en los próximos diez años. La estimación de Huang se basa en la escasez simultánea de memoria, almacenamiento, interconexiones ópticas, empaquetado y capacidad de TSMC.
"Creo que probablemente necesitamos que nuestra industria de semiconductores sea entre cinco y diez veces más grande de lo que es."
▶
La burbuja llega "algún día", no en los próximos cinco años. Allen lo presionó sobre la pregunta más antigua en semiconductores: si un auge tan grande está destinado a terminar en crisis.
"La burbuja llegará algún día. Simplemente no es hoy. Ya sabes, esto está en el comienzo mismo de la construcción."
▶
Las ventas de NVIDIA en China son "aproximadamente cero hoy". Huang dijo a los inversores que no esperen nada mientras el mercado chino permanezca cerrado.
"Nuestras ventas en China son aproximadamente cero hoy. Y les he dicho a todos nuestros inversores que no esperen ninguna venta en China."
▶
Los empleos manufactureros han aumentado aproximadamente un 50% en los últimos años. Huang relaciona este aumento con la construcción física de los centros de datos de IA que generan tokens.
"El número de empleos manufactureros ha aumentado aproximadamente un 50% en los últimos años porque estas computadoras tienen que ir a estos centros de datos de IA, que generan los tokens, la inteligencia."
▶
Alguien que usa IA te quita el trabajo, no la IA en sí misma. La línea anti-agorera de Huang divide la automatización de una tarea de la eliminación de un empleo completo.
"La IA no va a destruir todos nuestros trabajos. Alguien que usa IA va a quitarnos nuestros trabajos."
▶
Cien mil millones a un billón de agentes ejecutándose todo el tiempo. En comparación con aproximadamente 100 millones de personas usando una computadora en un momento dado hoy en día.
"Vamos a tener cien mil millones, un billón de agentes que se ejecutan todo el tiempo. Agentes inteligentes, agentes menos inteligentes, agentes especializados, superagentes, todo tipo de agentes diferentes ejecutándose todo el tiempo."
▶
Charlie Kawwas · RAISE Summit

Artículo completo: Broadcom (Charlie Kawwas): Cómo el silicio personalizado pasó de cero a 100 mil millones de dólares
Charlie Kawwas, presidente del grupo de soluciones de semiconductores de Broadcom, en el escenario del RAISE Summit, explicando a Tony Kim de BlackRock cómo el silicio personalizado pasó de cero a [100 mil millones de dólares](https://x.com/search?q=%24100bn&src=cashtag_click) y por qué los mayores laboratorios de IA están abandonando el rack de uso general de Nvidia.
El rack de uso general de Nvidia conlleva dos impuestos: un impuesto de eficiencia y un impuesto de margen. Kawwas describe la estructura de costos que un laboratorio de frontera hereda cuando compra la plataforma de cómputo preconstruida de Nvidia.
"Este cómputo general viene con un impuesto. El impuesto es, primero, la eficiencia de esa plataforma de cómputo, es decir, está construida para todos. Si tienes una carga de trabajo específica en tu modelo de IA de frontera, adivina qué, estás pagando ese impuesto extra. Y luego el otro impuesto son los altos márgenes que conlleva."
▶
Cada generación de chips triplica la memoria y ejecuta casi 3 veces el cómputo de la anterior. Kawwas dijo esto mientras entregaba al presentador chips reales de años consecutivos, dos cubos de memoria contra seis.
"Del año pasado a este año, ahora estás obteniendo tres veces más memoria. Aquí tienes dos cubos de memoria. Aquí tienes seis cubos de memoria. Y el cómputo que está en el medio es casi 3 veces más potente."
▶
Cuatro de los cinco grandes laboratorios de IA están construyendo plataformas personalizadas con Broadcom. Los cinco son OpenAI, Anthropic, Google, Meta y xAI, que representan aproximadamente el 90% del gasto mundial en IA, según el recuento de Kawwas.
"Los cinco grandes en EE. UU., que hoy en día están gastando quizás el 90% del gasto en el mundo, son OpenAI, Anthropic, Google con Gemini, Meta y xAI... Entre estos cinco está literalmente el 80, 90 por ciento o más del mercado. Y cuatro de los cinco se han dado cuenta de que la tecnología de Nvidia es muy buena, pero no pueden seguir comprando esta plataforma de cómputo general que es personalizada a nivel de rack."
▶
El codiseño se ejecuta a dos niveles: la XPU y el rack completo. Kawwas responde por qué un laboratorio no puede comprar este silicio personalizado en un estante, y dónde Broadcom presiona por un rack abierto.
"Hay dos partes en esa alta costura. Una es exactamente el codiseño profundo para la XPU que describiste. La segunda es a nivel de rack. Así que no solo tenemos que hacerlo a nivel de XPU para sus LLMs y sus casos de uso específicos, sino que también participamos activamente en cómo asegurarnos de que todo el rack sea abierto."
▶
Un cliente pasa de 1.5 GW este año a 6.5 GW contratados el próximo año, y a más de 10 el año siguiente. Preguntado sobre hacia dónde se dirige la infraestructura de IA, Kawwas respondió en términos de energía para un solo gran cliente, no en recuento de chips.
"Para uno de los cinco grandes, este año estamos instalando aproximadamente un gigavatio y medio con uno de los chips que les mostré. El próximo año, probablemente instalaremos más de cinco. Ya tenemos cinco contratados... El año siguiente, estoy bastante seguro de que serán más de 10."
▶
Sassine Ghazi · RAISE Summit

Artículo completo: Synopsys (Sassine Ghazi): El diseño de chips ha alcanzado el "nivel L4", y la capacidad de obleas es el límite
Sassine Ghazi, CEO de Synopsys, en el escenario del RAISE Summit, habla sobre la rapidez con la que la IA está diseñando ahora los propios chips y dónde se queda sin obleas la expansión.
Cada chip en la tierra pasa por Synopsys antes de existir, según su CEO. Synopsys vende las herramientas de automatización de diseño electrónico que los ingenieros de chips usan para diseñar silicio, ahora extendidas a la física mediante la adquisición de Ansys.
"No hay ningún chip hoy en día que se diseñe sin Synopsys, por lo que somos esenciales y omnipresentes en cuanto a nuestro uso a nivel de silicio."
▶
El paso del entrenamiento a la inferencia fuerza la personalización en toda la pila. El relato de Ghazi sobre por qué un chip de IA de uso general se está fragmentando en GPUs, ASICs al estilo Broadcom y herramientas personalizadas de los hiperescaladores.
"Para lograr esa eficiencia de inferencia, necesitas mirar toda la pila... Y ahí es donde necesitas tanto la personalización del silicio, mirando hacia arriba a lo largo de toda la pila, para lograr la eficiencia, el rendimiento y el costo adecuados."
▶
Los márgenes de los centros de datos son costos, y los hiperescaladores están codiseñando para reducirlos. La adquisición de Ansys, que cumple un año la próxima semana, es lo que permite a Synopsys modelar la física térmica, de fluidos y estructural junto con la electrónica.
"Cuando diseñas un centro de datos, normalmente lo haces con muchos márgenes, y los márgenes equivalen a costo... Estamos viendo que muchos de los hiperescaladores y clientes avanzados están tratando de reducir este margen mediante el codiseño a través de múltiples dominios de ingeniería."
▶
Ghazi calificó el diseño autónomo de chips como algo que estaba a cinco o seis años de distancia, y ha estado equivocado durante dos años consecutivos. Synopsys clasifica la autonomía del diseño del L1 al L5, como los coches autónomos, y sitúa a la industria en L4 hoy, con el front-end ya en seis u ocho agentes.
"Si me hubieras hecho esa pregunta hace dos años, habría dicho que esto está a unos cinco o seis años de distancia, y he estado equivocado durante los últimos dos años porque está llegando muy rápido."
▶
La capacidad de obleas es el límite tanto en lógica como en memoria, y Tesla prevé un déficit de silicio para 2030. La restricción vinculante para la expansión es la producción física de las fábricas, no la demanda, que Ghazi espera que siga presionando contra ese límite.
"Las restricciones actuales están limitadas por la capacidad de obleas, y eso es capacidad de obleas lógicas, así como de memoria... Cuando escuchas a empresas como Tesla decir que para 2030 no tendrán, dada su ambición de pasar de vehículos eléctricos a robótica, no habrá suficiente capacidad para soportar la demanda de silicio que imaginan."
▶
Andy Hock · Cerebras

Artículo completo: Cómo Cerebras planea matar a Nvidia (Andy Hock, Director de Estrategia)
Andy Hock, director de estrategia de Cerebras, explica por qué la industria sigue comprando un chip diseñado para gráficos, y cómo un procesador del tamaño de una oblea, dejado entero, terminó alimentando el acuerdo de cómputo de 750 megavatios de OpenAI.
Cerebras construye un solo chip y deja la oblea entera en lugar de cortarla en cientos. La industria imprime una oblea, la corta en chips pequeños y los vuelve a cablear a través de placas y centros de datos.
"¿Qué tal si simplemente juntamos tanto cómputo como pudiéramos en un chip, en un chip grande, y luego permitimos que los elementos de cómputo se comuniquen entre sí a través de silicio, para no tener que cablear un montón de chips pequeños juntos? [...] ¿Qué tal si simplemente no hiciéramos esa última parte? ¿Qué tal si construyéramos un gran chip y luego lo dejáramos entero?"
▶
El motor a escala de oblea contiene casi un millón de núcleos, 900,000 en las máquinas de producción. Cada núcleo lleva su propio banco de memoria rápida en el chip, todos conectados a través de silicio en lugar de cobre y fibra.
"Este es el motor a escala de oblea. [...] Tiene casi un millón de núcleos en un solo dispositivo, y 900,000 en nuestras máquinas de producción. Están en una cuadrícula 2D en toda la superficie de la oblea, y todos esos núcleos están directamente conectados entre sí. [...] Este diseño nos da lo que podrías pensar como el equivalente a un clúster de cómputo de IA en un solo dispositivo, y literalmente tres órdenes de magnitud más de ancho de banda de comunicación y ancho de banda de memoria de lo que es posible con los diseños de chips tradicionales."
▶
El entrenamiento es un centro de costo, la inferencia es donde haces sonar la caja registradora. Hock divide la economía de la IA entre construir el modelo y ejecutarlo para los usuarios finales.
"El entrenamiento es un centro de costo. Ahí es donde construyes tu modelo, donde le enseñas a hacer lo que quieres que haga. La inferencia es un centro de valor. Una vez que el modelo hace lo que necesitas que haga, o lo que es valioso para ti o tus usuarios finales, la inferencia es donde haces sonar la caja registradora."
▶
Cerebras sirve Gemma 4 a 1,500 tokens por segundo, 10 veces más rápido que cualquier implementación en GPU. La compañía puso el modelo de Google en vista previa el día de la entrevista y citó su velocidad en comparación con la competencia.
"Estamos sirviendo Gemma 4 a 1,500 tokens por segundo. Es 10 veces más rápido que cualquier implementación en GPU y 15 veces más rápido que algo como el modelo Haiku de Claude. [...] Agentes de codificación rápidos, donde la velocidad equivale a la productividad del ingeniero de software."
▶
OpenAI acordó comprar 750 megavatios de capacidad de cómputo de Cerebras, y Codex Spark se ejecuta en ella. La opción de codificación más rápida y de mayor precio en el producto de OpenAI funciona sobre Cerebras internamente.
"Los términos públicos del acuerdo son que van a comprar 750 megavatios de capacidad de cómputo de Cerebras para alimentar sus aplicaciones. El modelo de codificación que usa Cerebras ahora es Codex Spark, y estamos trabajando con el equipo de OpenAI para implementar modelos adicionales en el futuro, desde sus modelos frontera GPT hasta modelos de codificación de próxima generación."
▶
Cerebras mantiene toda su memoria en el chip, por lo que la escasez de HBM no le afecta. La memoria de alto ancho de banda de la que las GPUs extraen los pesos tiene limitaciones de fabricación y no puede escalar bajo demanda.
"Esa memoria está sujeta a límites de fabricación, límites de producción. [...] No puedes simplemente girar una perilla y producir 10 veces más. Y así, esa memoria es un cuello de botella ahora mismo para ese tipo de chips. Para nosotros, no lo es. Tenemos toda nuestra memoria en el chip. Está justo aquí. No es parte de esa cadena de suministro."
▶
Panel de HBM · RAISE Summit

Artículo completo: HBM imprime márgenes del 90% y todos en el escenario aún lo llaman una mala memoria: Dentro del cuello de botella de memoria de la IA
En el RAISE Summit en París, Pat Gelsinger, Hoshik Kim (Fellow de SK hynix), y los inversores Andrew Homan y Vijay Shilpiekandula analizaron por qué HBM imprime márgenes de aproximadamente el 90% mientras que todos en el escenario todavía lo llaman una mala memoria.
HBM obtiene márgenes cercanos al 90% para un negocio que solía tener un buen año de cada cuatro. Gelsinger dirigió Intel a través de múltiples ciclos de memoria y ahora invierte en el sector en Playground Global.
"La memoria nunca lo había tenido tan bien. Solíamos bromear en la industria de semiconductores que si eras una empresa de memoria, tenías un buen año de cada cuatro. Los otros tres eran pésimos." Pat Gelsinger, Playground Global
▶
El ex-CEO de Intel llama a HBM "una mala memoria" con el Fellow de SK hynix a un asiento de distancia. La objeción de Gelsinger es física, no comercial: apilar DRAM crea un sándwich térmico y limita el ancho de banda a la línea de costa donde la memoria se encuentra con la GPU.
"HBM es una mala memoria. Sé que mis amigos de la memoria están a punto de subir al escenario, y llamar feo a su bebé quizás no sea la mejor manera de hacer amigos e influir en las personas." Pat Gelsinger, Playground Global
▶
El propio Fellow de SK hynix dice que HBM no resolverá el muro de la memoria. Kim dirige la investigación de arquitectura de sistemas en SK hynix, el líder del mercado de HBM.
"Es una buena memoria, pero no es la respuesta final. HBM no resolverá el problema del muro de la memoria. El problema del muro de la memoria es un problema inherente de la IA, que no se puede evitar." Hoshik Kim, SK hynix
▶
HBM reduce el rendimiento de una fábrica de 12 obleas por hora a cuatro. Homan recurrió a la cocina para explicar por qué el rendimiento de fabricación impide que la escasez se resuelva rápidamente.
"SK hynix es un fabricante de gofres. Tienes una máquina de gofres que normalmente puede cocinar un gofre en cinco minutos. En ese escenario, puedes hacer 12 gofres por hora. Con HBM, ahora se necesitan 15 minutos para hacer ese gofre. Así que ahora solo puedes hacer cuatro gofres por hora." Andrew Homan, Maverick Silicon
▶
Apple subió los precios en toda su línea de productos, y es el comprador de memoria más sofisticado del planeta. HBM se encuentra en un déficit de oferta de aproximadamente el 7% en 2026, y Homan señaló a Cupertino como la lectura más clara de cuánto durará la tensión.
"Apple subió los precios en toda su línea de productos. Son las máquinas de adquisición de memoria más sofisticadas del planeta, y claramente esperan que esto dure un tiempo, de lo contrario no habrían hecho eso." Andrew Homan, Maverick Silicon
▶
Todavía quedan varios años más de escasez de memoria por delante, según la lectura del ex-CEO de Intel. Gelsinger estableció su cronograma en función de la capacidad que ya estaba bloqueada por decisiones de capital tomadas hace tres años.
"Los años de abundancia están a muchos años de distancia. Los años de escasez de memoria, tenemos varios años más por delante." Pat Gelsinger, Playground Global
▶
SemiAnalysis Tokenomics · Ep020

Artículo completo: SemiAnalysis Tokenomics: Anthropic ya es rentable (más de mil millones de dólares en el tercer trimestre), y OpenAI acaba de volver a punto de equilibrio
El equipo de SemiAnalysis Tokenomics (Crystal Huang, Max Kan, Joey Brookhart, presentador Jordan Nanos) dedica la hora a los márgenes de los laboratorios de modelos: por qué Anthropic ya es rentable, cómo las suscripciones subsidian la API, y los ingresos por megavatio se duplican cada tres trimestres.
La API de Anthropic representa más del 80% de los ingresos anuales recurrentes (ARR), y el beneficio operativo del tercer trimestre podría superar los mil millones de dólares. Joey Brookhart sitúa el beneficio en la cuenta de resultados sobre una base no-GAAP, excluyendo la compensación en acciones.
"El beneficio operativo fue rentable en el segundo trimestre, podría ser rentable en el orden de mil millones de dólares o más en el tercer trimestre." Joey Brookhart
Margen bruto de la API de Anthropic superior al 85%, y los planes de suscripción 20x podrían tener márgenes negativos. Max Kan explica dónde aterriza realmente el margen entre suscripción y API.
"Olvídate de que sea un margen peor que el de la API, que creemos que es probablemente superior al 85% para Anthropic al menos. Podría ser simplemente un margen negativo en general para estos planes 20x. Y así, por supuesto, estas empresas quieren mover tanto volumen como sea posible a la API." Max Kan
La empresa en el percentil 99 gasta 100,000 dólares por empleado al año en IA. Joey Brookhart lee los datos de tarjetas de Ramp como la verificación del retorno de la inversión en gasto intensivo en codificación.
"Los datos de Ramp son que el percentil 99 de las empresas gasta cien mil dólares al año en IA por empleado. Y si has llegado a ese punto en el que estás gastando tanto, obviamente estás obteniendo un retorno de la inversión bastante bueno." Joey Brookhart
Los planes empresariales bloquean las suscripciones y fuerzan la facturación por token, donde está el margen. Max Kan explica por qué los laboratorios miden a sus usuarios más intensivos y los dirigen a la API.
"Cualquiera que pueda usar una suscripción definitivamente debería usar una suscripción solo porque está muy subsidiada. OpenAI y Anthropic son muy conscientes de esto. Cuando tienen sus planes empresariales, no te dejan usar una suscripción. Te obligan a pagar por token porque saben que ahí es donde está el margen." Max Kan
La lectura del equipo: Elon alquila la mayor parte de Colossus a Anthropic a 3 o 4 veces la tasa de mercado, con una cláusula de recuperación de 90 días. Max Kan narra la lógica de alquilar la frontera desde la perspectiva del propietario del cómputo.
"Voy a dejaros suficiente cómputo para demostrar que sois capaces de llegar a la frontera. Mientras tanto, voy a monetizar todo el cómputo adicional alquilándolo en estos acuerdos de alquiler de margen extremadamente alto, a 3 o 4 veces la tasa de mercado. Voy a asegurarme de que haya una cláusula de recuperación de 90 días incluida en cada uno de ellos." Max Kan
Los presupuestos de datos de los laboratorios frontera superan los 10 mil millones de dólares este año, aproximadamente 10 veces más que el año pasado. Max Kan habla sobre qué es lo que realmente limita la capacidad del modelo, donde el cuello de botella son los entornos de aprendizaje por refuerzo en lugar del cómputo bruto.
"El aprendizaje por refuerzo es probablemente la ley de escalado más importante para mejorar las capacidades del modelo hoy en día. Hay muchas personas que creen que lo único que impide que los modelos puedan hacer literalmente cualquier cosa que un humano pueda hacer en una computadora es tener suficientes entornos de aprendizaje por refuerzo." Max Kan
Scott Wu · RAISE Summit

Artículo completo (enlace abajo): Cognition (Scott Wu): La edad de oro de la ingeniería de softwareg
Scott Wu, CEO de Cognition y creador del ingeniero de software Devin AI, en el escenario de RAISE Summit, argumentando que el salto de productividad dentro de su propia empresa es una razón para agrandar el equipo de ingeniería, no para reducirlo.
Más del 90 % del código de Cognition ahora lo escribe Devin. Wu mostró su gráfico interno y señaló que el agente ha comenzado a activar sus propias sesiones ante regresiones de rendimiento y errores de DataDog, sin intervención humana.
«Ves que el porcentaje de código escrito por Devin sube a más del 90 %. Básicamente usamos Devin para casi todo ahora mismo. Lo que es aún más loco es que Devin también hace la mayoría de las tareas de iniciar Devins.»
▶
Cognition envió 10 veces más software en seis meses con aproximadamente un 40 % más de ingenieros. Wu realizó un experimento de noviembre a finales de abril en su propia empresa, aumentando el equipo de unos 45 a 60 integrantes, y atribuye el resultado a los modelos y agentes, no a la cantidad de personal.
«¿Qué cambió exactamente en esos seis meses que nos permitió enviar 10 veces más y hacer 10 veces más?»
▶
GPT-3.5 podía ejecutar 30 segundos de trabajo sin asistencia; los modelos más recientes ejecutan trabajos de 16 horas. Wu señaló el estudio METR, que mide cuánto tiempo puede completar una tarea una IA antes de tener que volver a un humano.
«Mira a GPT-3.5, justo en medio de ese gráfico: 30 segundos de trabajo, que no está mal, por cierto. Y ese fue el momento de ChatGPT.»
▶
En diciembre de 2025, Devin equivalía a 130 ingenieros extra de ancho de banda por cada mil. Wu enmarcó la capacidad adicional del agente como personal que podrías asignar a un equipo existente, antes de señalar que desde entonces ha subido hasta cubrir entre el 89 y el 90 % del trabajo.
«Piensa en un equipo de mil ingenieros de software e imagina que pudieras decirles: okey, van a recibir el equivalente a 130 ingenieros de software extra de ancho de banda para construir cosas. Puedes hacer mucho con eso.»
▶
Cada ingeniero es 10 veces más productivo, y hay 10 veces más cosas por construir. La respuesta de Wu al miedo a los despidos, respaldada con ejemplos deliberadamente mundanos de software no construido, como un departamento de vehículos motorizados (DMV) que funcione y registros médicos accesibles.
«Cada ingeniero de software humano es diez veces más productivo, pero ¿adivina qué? Tenemos diez veces más cosas que construir.»
▶
Wu cerró la charla con una pregunta: qué harías con un ejército infinito de ingenieros de software. Sus clientes incluyen Goldman Sachs, Mercedes-Benz y Lowe's, cada uno con decenas de miles de ingenieros trabajando contra un backlog que nunca se despeja.
«¿Qué harías con un ejército infinito de ingenieros de software? Les pediría a todos ustedes que se tomen un segundo y solo piensen en eso.»
▶
Mansour Karam · RAISE Summit

Mansour Karam, fundador y CEO de Aria Networks, en el escenario de RAISE Summit junto a Dylan Patel de SemiAnalysis, explicando por qué la era del «clúster de propósito general para todo» está terminando y por qué la red decide la economía de la inferencia.
El entrenamiento es un centro de costos; servir se parece más a alquilar un complejo de apartamentos. Karam divide un clúster de IA en dos negocios que comparten el hardware pero casi ninguna de las economías.
«Entrenar es esencialmente construir un modelo. Es como desarrollar un producto. Pero luego servir el modelo, la economía se parece mucho más a cuando alquilas un complejo de apartamentos en términos de financiamiento.»
▶
Especializar un clúster para una sola carga de trabajo vale un factor de 10 o 100. Karam ve espacio para que surjan nuevas empresas enfocadas en un solo caso de uso, cada una ajustada a una métrica.
«Veo una gran oportunidad en que se formen nuevas empresas para optimizar un caso de uso determinado, y la diferencia puede ser un factor de 10 o 100, dependiendo de la métrica que intentes optimizar.»
▶
Un millón de tokens puede costar $0,20 o $20, una diferencia de 100x determinada por cómo construyas. Karam vincula esa oscilación a si la infraestructura se construyó para inferencia barata de alto rendimiento o para otra cosa.
«Puedes ir desde, digamos, 20 centavos hasta 20 dólares o algo así por un millón de tokens. O sea, es una diferencia de 100x. Si realmente quieres optimizar para inferencia simple de alto rendimiento, puedes servirla muy barata, pero tienes que construir tu infraestructura pensando en eso.»
▶
La frase de Dylan Patel: «la velocidad es el foso». Patel aporta la razón del lado de la demanda por la que el carril rápido es de repente donde va el dinero: los agentes funcionan en bucles secuenciales de prueba y verificación.
«Los agentes son muy secuenciales, orientados a tareas. Intentar algo, verificarlo, comprobar si es correcto, y lo haces en un bucle. Termina siendo muy lento. Y la velocidad es el foso. Cuanto más rápido vayas, la velocidad es el foso.» Dylan Patel, SemiAnalysis
▶
Un solo transceptor con una mota de polvo detiene a todos los usuarios del clúster. Una sola consulta de inferencia atraviesa varias redes en secuencia, y el enlace más lento marca el ritmo para todos.
«Si tienes pérdida de paquetes, o un transceptor con una mota de polvo… entonces todos los demás tienen que esperar, y todo es secuencial.»
▶
Un segundo dentro de un clúster de inferencia «es como un siglo a escala humana». La propuesta de Karam para Aria es telemetría con resolución de microsegundos para detectar las detenciones que el monitoreo estándar de un segundo no capta.
«Un segundo, en el contexto de un clúster de IA ejecutando inferencia, es como un siglo a escala humana. En un segundo ocurren muchas cosas. Así que lo que realmente necesitas es recopilar esa telemetría con resolución de microsegundos para poder capturar esos eventos que podrían estar causando una detención.»
▶





