Una teoría de escalado temporal para sistemas electrónicos multicapa

@Huawei
INGLÉShace 2 meses · 27 may 2026
2.4M
249
85
9
30

TL;DR

Tingbo He, de Huawei, propone el escalado τ, un nuevo principio de semiconductores centrado en la reducción del tiempo en toda la pila informática para superar los límites de la reducción geométrica.

Tingbo He

Huawei

Resumen

Durante seis décadas, el escalado geométrico de Moore impulsó el progreso en semiconductores. Ese pacto industrial ya no se sostiene: los rendimientos de la mera reducción dimensional se han aplanado, los presupuestos de diseño de vanguardia superan los mil millones de dólares por chip y el costo por transistor en los nodos más avanzados ya no disminuye. Esta perspectiva propone un principio de escalado sucesor — el escalado τ — que adopta el propio tiempo, en lugar del área del transistor, como la métrica principal del progreso, aplicando una única constante de tiempo característica τ como el objetivo de optimización unificador a lo largo de doce órdenes de magnitud, desde un transistor de conmutación hasta una carga de trabajo en un centro de datos. Se presentan dos demostraciones a escala de producción. En un SoC móvil, LogicFolding — una metodología que particiona circuitos digitales, analógicos y de memoria a través de niveles activos apilados verticalmente — ofrece un aumento escalonado del 55% en la densidad de transistores y una ganancia del 41% en eficiencia energética en un nodo de dispositivo fijo. En sistemas de IA, una pila codiseñada que comprende el tejido Unified Bus con semántica de memoria, la E/S óptica Hi-ONE cerca del encapsulado y el 3D Folding de borde a superficie proyecta un crecimiento de más de 100× en la integración de hardware para 2035. La afirmación más profunda es metodológica: el escalado τ es el primer principio de escalado desde Dennard en establecer un objetivo de optimización compartido en toda la pila informática.

Introducción

Desde mediados de la década de 1960, la industria de semiconductores ha medido el progreso en nanómetros. Cada dieciocho meses, los transistores se reducían, las frecuencias aumentaban y el costo por puerta lógica disminuía. La Ley de Moore funcionó tanto como una observación empírica como para ayudar a establecer un pacto industrial sobre el cual se construyó toda la pila informática. Ese pacto industrial ya no se sostiene. Más allá del nodo de 7 nm, el escalado geométrico ya no ofrece sus dividendos históricos. Las herramientas de litografía se acercan a los límites físicos del patrón, la depreciación EUV domina el costo de la oblea y la curva de precio por transistor se ha aplanado — y en algunos casos, invertido. Para las organizaciones cuyo acceso a la litografía más avanzada está restringido, la limitación se volvió vinculante antes y es más grave.

Por lo tanto, la pregunta central para la industria ha cambiado. Ya no es "¿cuánto más puede reducirse el transistor?" Es "¿qué debería escalarse y con qué objetivo?"

Durante los últimos seis años, el equipo del autor en Huawei Semiconductor ha investigado esta cuestión en silicio a través de SoC móviles, aceleradores de IA, tejidos de sistema y encapsulados. La conclusión es que la respuesta no reside en otro nodo, ni en otra arquitectura de transistor, sino en un cambio del propio objetivo de optimización principal. Esta perspectiva sostiene que la próxima década de evolución de los sistemas electrónicos no debería guiarse por el escalado geométrico, sino por el escalado del tiempo — la reducción sistemática de una única constante de tiempo característica τ en cada capa de la pila, desde un transistor que conmuta en un picosegundo hasta una carga de trabajo de un centro de datos que responde en un segundo.

El caso del escalado τ se desarrolla a continuación tanto como una metodología científica como una hoja de ruta industrial, basándose en las lecciones de 381 chips llevados a producción en volumen entre mayo de 2020 y mayo de 2026.

1. El Fin de la Era Geométrica

Durante la mayor parte de su historia, la industria de semiconductores ha tenido un trabajo: hacer el transistor más pequeño. La observación de Gordon Moore en 1965 — de que la densidad de transistores se duplica aproximadamente cada dos años — fue complementada una década después por la teoría de escalado de Robert Dennard, que establecía que la reducción proporcional del voltaje y las dimensiones podía mantener un campo eléctrico constante. Juntos, el escalado geométrico y el escalado de Dennard ofrecieron mejoras exponenciales en rendimiento por vatio y rendimiento por dólar durante casi cinco décadas.

Este arreglo se deshizo en dos etapas. Alrededor de 2005, el escalado de Dennard se rompió primero: el voltaje dejó de escalar proporcionalmente con el tamaño de la característica, y comenzó la era del silicio oscuro. El escalado geométrico persistió más tiempo, sostenido por FinFET y posteriormente por arquitecturas de dispositivos gate-all-around (GAA). Sin embargo, más allá de los 7 nm, los rendimientos del escalado dimensional puro se han aplanado. Las razones están ahora bien documentadas: la saturación de velocidad reduce la dependencia del retardo intrínseco de la longitud del canal de cuadrática a lineal; la resistencia parásita y la capacitancia de las interconexiones locales dominan cada vez más el presupuesto de retardo de la celda estándar; los costos de las máscaras, la depreciación EUV y la complejidad de las reglas de diseño han llevado los presupuestos de diseño de chips de vanguardia a superar los mil millones de dólares por chip en el nodo de 2 nm.

Las consecuencias económicas son igualmente ineludibles. El costo por transistor se ha aplanado en los nodos avanzados y, en la vanguardia, ahora está aumentando. El pacto industrial que sostuvo los últimos cincuenta años — más transistores a menor costo cada generación — ya no se cumple.

Para Huawei Semiconductor, esta transición llegó con una restricción adicional: acceso limitado a las herramientas de litografía más avanzadas. Asumir que otro nodo resolvería el problema ya no era sostenible. Hace seis años, la hoja de ruta geométrica se estancó, lo que obligó a plantear una pregunta más fundamental — una que, en retrospectiva, toda la industria tendrá que afrontar eventualmente.

2. Tiempo, No Espacio: La Verdadera Moneda de la Era de Moore

Reducido a su efecto esencial para el usuario final, la Ley de Moore nunca trató fundamentalmente sobre la geometría. Los transistores más pequeños mejoraban el rendimiento del sistema porque conmutaban más rápido. Las interconexiones más densas mejoraban el rendimiento porque las señales recorrían distancias más cortas. La mayor integración mejoraba el rendimiento porque los datos cruzaban menos límites. Lo que cada generación ofrecía, en esencia, era una reducción en el tiempo — de picosegundos a nanosegundos en el dispositivo, de nanosegundos a microsegundos en el chip, de microsegundos a segundos en el sistema. El escalado espacial servía meramente como el instrumento para comprimir el tiempo.

Una vez que esto se reconoce, se presenta un reencuadre obvio. El propio tiempo debería adoptarse como la métrica principal. Se puede definir una constante de tiempo característica τ en cada capa de la pila — transistor, circuito, chip y sistema — y tratar su reducción como el objetivo de optimización unificador. El escalado geométrico se convierte entonces en una técnica entre muchas para reducir τ, en lugar de la única.

Este principio se denomina escalado τ, y se propone aquí como el sucesor del escalado geométrico de Moore como principio rector de la evolución de los semiconductores. Formalmente, τ se trata como una construcción en capas que se descompone como

Huawei - inline image
  • Transistor: retardo de conmutación intrínseco, abordado mediante mejora de la movilidad, ingeniería de tensión, puerta de alto κ/metal y arquitecturas GAA, y, cada vez más, mediante la reducción de la R y C parásitas de las interconexiones locales, que ahora superan el tiempo de tránsito intrínseco en varios factores.
  • Circuito: retardo de propagación RC a lo largo de las rutas de señal, abordado mediante conductores de menor resistividad, dieléctricos de bajo κ y — más importante — mediante la reducción de la longitud del cable a través de la integración vertical.
  • Chip: latencia de cómputo y acceso a memoria, abordada mediante elecciones arquitectónicas, profundidad de tubería, jerarquía de memoria y tejidos en el chip.
  • Sistema: tiempo de mensajería y sincronización de extremo a extremo, abordado mediante topología de interconexión, pila de protocolos y diseño del tejido.
Huawei - inline image

donde el factor de escalado α es específico de la aplicación, no universal. La experiencia de producción hasta la fecha indica α ≈ 1.3× por año para dispositivos móviles con restricciones de energía, ≈ 1.5× por año para sistemas autónomos de seguridad crítica y hasta 10× por año para cargas de trabajo de IA, donde el rendimiento se traduce directamente en valor económico.

Lo que hace que τ sea una métrica principal útil, en lugar de un cambio de nombre de las existentes, es que es la misma métrica en toda la pila. La frecuencia, la latencia, el ancho de banda y el rendimiento están todos gobernados por τ en sus respectivas capas. Un tecnólogo de procesos, un diseñador de circuitos y un arquitecto de sistemas pueden debatir la misma cantidad en unidades idénticas. τ es el lenguaje que permite la cooptimización de la pila de extremo a extremo — y la era de la optimización independiente en cada capa, con el tiempo emergiendo como un residual, ha concluido.

3. LogicFolding: Un Punto de Prueba en SoC Móvil

La primera prueba a escala de producción del escalado τ se realizó en el ámbito móvil. Un SoC de smartphone es el caso inusual en el que un chip constituye todo el sistema. El paralelismo multisocket no está disponible; ningún tejido de mil nodos puede enmascarar un enlace lento. Todo el rendimiento entregado al usuario se origina en un solo dado, bajo un presupuesto de energía de unos pocos vatios, frente a límites térmicos establecidos por las restricciones del factor de forma del dispositivo de mano.

Después de 2020, cuando el acceso a los nodos de vanguardia se restringió, la pregunta operativa se convirtió en: con el nodo fijo, ¿cómo se pueden seguir ofreciendo mejoras generación tras generación en un solo dado?

La respuesta que surgió se llama LogicFolding.

Definición. LogicFolding es una metodología de diseño que particiona circuitos digitales, analógicos y de memoria a través de niveles activos apilados verticalmente para optimizar conjuntamente el rendimiento, la potencia y el área siguiendo el principio de escalado del tiempo.

Los circuitos digitales se dividen en lógica combinacional — la red booleana entre registros — y lógica secuencial — los flip-flops que mantienen el estado. El techo de rendimiento de un sistema digital está establecido por el retardo de la trayectoria crítica entre etapas de flip-flop adyacentes, que a su vez está dominado por la RC de la interconexión y el recuento de puertas a lo largo de esa trayectoria. La optimización convencional coloca las puertas en un plano y enruta los cables a través de una pila de metal por encima; cuanto más largo es el cable, mayor es la RC parásita y más lenta es la trayectoria crítica.

LogicFolding abandona la suposición planar. Las puertas de la trayectoria crítica se distribuyen a través de dos (y eventualmente más) niveles activos apilados verticalmente, conectados mediante unión híbrida de paso ultrafino. Desde la perspectiva del diseñador de circuitos, los dos niveles se comportan como un tejido continuo único, con las celdas distribuidas a través del límite de la oblea como si fuera una capa de metal adicional. Los cables de señal se vuelven sustancialmente más cortos, la RC parásita disminuye drásticamente, el sesgo de reloj se reduce y el chip funciona a una frecuencia de reloj más alta en el mismo nodo de dispositivo.

Para ayudar a LogicFolding a ofrecer estas ganancias, es ventajoso mantener la relación de engranaje entre el paso de unión híbrida y el paso de metal superior relativamente baja — aproximadamente por debajo de 3 en la práctica, y generalmente mejor cuanto más baja es la relación. Con el paso de metal superior actual alrededor de 720 nm, esto se traduce en un paso de unión híbrida por debajo de 2 μm — e idealmente en una relación de engranaje de aproximadamente 1, en la que la sobrecarga de enrutamiento en jaula de pájaro en la interfaz de unión desaparece efectivamente. Lograr este paso, junto con la precisión de superposición requerida (<0.5 μm), el escalado de TSV (CD y KOZ por debajo de 1.5 μm, paso por debajo de 6 μm) y el rendimiento (~100% con redundancia inteligente), requirió un esfuerzo de desarrollo de procesos de varios años en todo el ecosistema de proveedores y socios.

Huawei - inline image
  • La eficiencia energética del núcleo de rendimiento del SoC mejoró en un 41% y la frecuencia máxima de reloj aumentó casi un 13%.
  • Una ruta de datos global de red en chip de alta velocidad construida a través de los niveles superior e inferior redujo la huella de la ruta de datos en un 55%, con una estabilidad de entrega de energía mejorada.
  • Un esquema de ajuste del sesgo de reloj postsilicio contribuyó con más del 5% al rendimiento del SoC de forma independiente.
  • En SRAM — donde la velocidad de acceso, la energía por bit y el área dependen en gran medida de la longitud de la línea de bit y de la línea de palabra — LogicFolding acortó las trayectorias críticas, redujo la energía por bit y aumentó la frecuencia de funcionamiento en más del 40%.
  • En un núcleo de procesamiento representativo, la arquitectura de plegado de doble capa redujo el recuento de búferes de reloj en más del 50%, el sesgo de reloj en un 25% y la longitud del cable en aproximadamente un 30%.

Estas ganancias se lograron en un nodo de dispositivo fijo, obtenidas no a través de un nuevo paso de litografía sino mediante una reorganización topológica de la distribución espacial de la lógica en tres dimensiones.

La implementación de LogicFolding que se envía en Kirin 2026 es deliberadamente conservadora. El paso de unión híbrida alcanzó 1.5 μm; el aterrizaje de TSV avanzó solo un paso por debajo del metal superior; el plegado se aplicó selectivamente a lo largo de trayectorias críticas clave en lugar de en todo el diseño. Aun así, la frecuencia del núcleo de rendimiento de la CPU vuelve a 3.1 GHz este año.

Durante la próxima década, se espera que LogicFolding evolucione del plegado de trayectorias críticas local al plegado de múltiples capas a gran escala — tres, cuatro y más niveles activos por encapsulado — habilitado por la unión híbrida a menor temperatura (relajando el presupuesto térmico entre niveles) y por el aterrizaje de TSV que migra del metal superior a M6, lo que libera más del 30% de los recursos de enrutamiento de alto nivel. De 2026 a 2035, se proyecta que la densidad de transistores aumente hacia 400 MTr/mm² y más allá. Simultáneamente, LogicFolding permite que Kirin aumente sustancialmente la frecuencia del núcleo de la CPU y allana el camino hacia 4 GHz y más allá (Tabla 1). La hoja de ruta es factible y, en términos de costo, económicamente viable.

Tabla 1. Tendencia de la frecuencia de funcionamiento del núcleo de rendimiento de la CPU Kirin.

Huawei - inline image

Barra lateral A — LogicFolding de un Vistazo

  • Paso de unión híbrida: por debajo de 2 μm (1.5 μm en Kirin 2026; relación de engranaje objetivo ≈ 1)
  • Precisión de superposición: por debajo de 0.5 μm
  • CD/KOZ de TSV: por debajo de 1.5 μm; paso por debajo de 6 μm; tasa de fallos <100 ppm; tasa de reparación 99.9%
  • Rendimiento: ~100% con redundancia inteligente
  • Densidad de transistores: 155 → 238 MTr/mm² en un solo paso
  • Ganancia de eficiencia energética/frecuencia (núcleo P del SoC): +41% / +13%
  • Frecuencia de funcionamiento de SRAM: +40%+
  • Recuento de búferes de reloj / sesgo de reloj / longitud de cable en un núcleo representativo: −50% / −25% / −30%

4. De Picosegundos a Microsegundos: Escalado τ en el Centro de Datos de IA

Una pregunta natural es si un principio desarrollado en el régimen de milivatios de los smartphones sobrevive a la traducción al régimen de gigavatios del entrenamiento e inferencia de IA. Las cargas de trabajo de IA ocupan el extremo opuesto del espectro τ: no un solo chip sino cientos o miles de chips comportándose como una sola máquina, con el cómputo agregado aumentando en aproximadamente seis órdenes de magnitud durante la última década.

La respuesta es afirmativa — siempre que τ se trate como un objetivo a nivel de sistema y se aplique en toda la cadena, en lugar de dentro de un solo acelerador.

Dos hechos dan forma al lado de la IA del argumento τ. Primero, los sistemas de IA continúan creciendo — de un chip, a docenas, a cientos, y cada vez más a decenas de miles. Segundo, el presupuesto de energía y el presupuesto de materiales de los sistemas de IA modernos están dominados por los datos, no por el cómputo. Más del 80% de la energía en un gran clúster de IA se consume en el movimiento de datos; más del 70% del costo del sistema se asigna al almacenamiento de datos. La implicación es directa: reducir el tiempo que los datos pasan en tránsito — entre chips, entre bastidores y dentro del encapsulado — es al menos tan importante como reducir el tiempo que el cómputo pasa computando.

El escalado τ se instancia a escala de IA a través de tres capas coordinadas: un tejido de sistema (Unified Bus), un motor óptico cerca del encapsulado (Hi-ONE) y una reorganización topológica del propio encapsulado (3D Folding).

4.1 Unified Bus — Un Tejido de Sistema Primero-τ

Las arquitecturas tradicionales de múltiples nodos y múltiples aceleradores mueven datos a través de múltiples protocolos apilados: PCIe al host, NVLink o tejidos propietarios dentro del chasis, Ethernet o InfiniBand entre chasis y acceso a memoria remota de la pila de software en la parte superior. Cada capa implica una conversión de protocolo, serialización adicional, un búfer DMA extra y un protocolo de enlace adicional. Cada conversión añade latencia, reduce la fiabilidad e incurre en un costo adicional.

Unified Bus (UB) reemplaza esta pila con un solo protocolo que opera dentro y a través del chasis — un tejido totalmente peer-to-peer que expone semántica de memoria de forma nativa en todo el sistema. El movimiento de datos se reduce a transmisión peer-to-peer sin conversión en la capa de semántica de memoria, con coherencia gestionada por hardware en lugar de paso de mensajes de la pila de software.

El beneficio medido es de aproximadamente dos órdenes de magnitud: la latencia de acceso remoto de extremo a extremo cae de las decenas de microsegundos típicas de las pilas TCP/IP a aproximadamente 100 ns — una reducción de ~500× en τ del sistema a lo largo del eje de comunicación dominante. A escala de bastidor, esto acerca el sistema asintóticamente a una sola máquina coherente con el tejido — designada internamente como un System-as-One-Chip.

4.2 Hi-ONE — E/S Óptica en el Encapsulado

Una vez que se reduce la latencia de comunicación, el siguiente cuello de botella se desplaza. Aumentar la densidad de chips dentro de un solo bastidor lleva la densidad de potencia y la fiabilidad más allá de sus límites — y lleva los SerDes eléctricos más allá de los suyos. A 400 Gb/s por chip de IA, el cableado de cobre sigue siendo bien conocido y fiable. A múltiples Tb/s por chip, el cobre se vuelve físicamente impráctico: el alcance de SerDes se contrae, el cableado se vuelve prohibitivamente voluminoso, la instalación en panel se vuelve inviable y los márgenes térmicos y de entrega de energía se agotan.

El enfoque desarrollado en Huawei Semiconductor es el High-density Optical-interconnect-Node Engine, Hi-ONE — un motor óptico cerca del encapsulado que ofrece 8 Tb/s por módulo, igualando el ancho de banda de UB de un chip de IA en un solo enlace óptico. Reduce el alcance requerido de SerDes de ~100 cm a ~5 cm, elimina el cableado voluminoso y extiende el alcance de menos de un metro a 100 metros — haciendo que la interconexión de alta densidad para centros de datos distribuidos a escala de gigavatios sea físicamente realizable.

La filosofía de diseño subyacente a Hi-ONE es en sí misma un argumento de escalado τ. En lugar de un DSP pesado para una alta fidelidad de señal, Hi-ONE adopta un enfoque lineal — un driver mejorado con ecualización analógica y un amplificador de transimpedancia — y permite que el protocolo UB tolere una tasa de error de bit deliberadamente relajada. Este compromiso entre capas (capa de protocolo y capa física) reduce la potencia, el costo y la complejidad de integración, y ejemplifica el compromiso entre capas que recompensa una metodología primero-τ.

4.3 El Dilema N² vs N, y por qué el 3D Folding es Inevitable

La razón más profunda por la que los aceleradores de IA no se detendrán en el abanico de 2.5D es geométrica, y merece una declaración explícita porque determina la hoja de ruta posterior a 2030.

En un chip de IA 2.5D convencional, el dado de lógica ocupa el centro del encapsulado, las pilas de HBM y los SerDes bordean sus bordes, y los reguladores de voltaje rodean el encapsulado. Cada señal de memoria, cada señal de interconexión y cada amperio de corriente de suministro debe atravesar el borde del dado para alcanzar los recursos de cómputo en su interior. Si el dado tiene una longitud de lado N, entonces:

  • la capacidad de cómputo escala como N² (área),
  • pero el ancho de banda de memoria, la interconexión y la entrega de energía — todo transportado por el abanico de 2.5D a lo largo del borde — escalan solo como N (perímetro).

La divergencia creciente entre estas curvas cuadrática y lineal constituye el dilema del abanico, y explica el estancamiento del escalado 2.5D independientemente de lo agresivo que sea el nodo lógico subyacente. Ninguna mejora a nivel de transistor cierra un déficit topológico.

3D Folding resuelve este dilema reubicando los recursos ligados al borde en superficies. La entrega de energía (a través de la energía posterior y reguladores de voltaje integrados), la memoria de alta velocidad (a través de la unión híbrida con la lógica) y la E/S óptica (a través de Hi-ONE cerca del encapsulado) migran todas del perímetro a la superficie vertical — y, una vez ubicadas en una superficie, escalan como N², igualando el ritmo cuadrático del cómputo. El encapsulado ya no es un dado de lógica rodeado por un cinturón perimetral de memoria y SerDes; se convierte en una pila integrada verticalmente en la que la memoria, el tejido, la energía y la lógica escalan todos juntos.

La hoja de ruta sitúa esta evolución en un cronograma explícito. Hasta aproximadamente 2030, los aceleradores de IA (la línea Ascend SuperPoD — Ascend 910C en 2025, Ascend 950 en 2026 y el 990 posterior) se basan en una combinación de técnicas maduras: chiplets, abanico 2.5D y apilamiento 3D mediante microbump y unión híbrida de paso estándar. Alrededor de 2030, Ascend 990 introducirá LogicFolding en la clase de aceleradores de IA, y a partir de ese punto, 3D Folding se convierte en el portador principal de α hasta 2035. A lo largo de este camino, se proyecta que la integración de hardware aumente en más de 100× para 2035, con la reducción de τ distribuida en cada capa de la pila en lugar de concentrada a nivel de dispositivo.

Barra lateral B — τ a Escala de Sistema de IA

  • Latencia de acceso remoto de UB: ~10s de μs → ~100 ns (≈ 500× de reducción de τ)
  • Ancho de banda por módulo de HiONE: 8 Tb/s (iguala el ancho de banda de UB por chip)
  • Alcance de SerDes de HiONE: ~100 cm → ~5 cm; alcance entre paneles: <1 m → 100 m
  • Dilema del abanico: cómputo ∝ N², BW/E/S/potencia ligados al perímetro ∝ N
  • 3D Folding: reubica BW, E/S óptica y entrega de energía de los bordes a las superficies, restaurando la paridad N²
  • Crecimiento proyectado de integración de hardware 2026 → 2035: >100×

5. Lógica y Memoria: Del Desacoplamiento a la Refusión

Una implicación del escalado τ merece una discusión aparte, porque sus consecuencias son tanto industriales como técnicas.

En la era del 8086, la industria desacopló deliberadamente los procesadores y la memoria a través de buses de memoria estandarizados. Ese desacoplamiento permitió que dos industrias escalaran de forma independiente: el rendimiento del procesador avanzó rápidamente a lo largo de la curva de Moore, mientras que los proveedores de memoria desarrollaron un vasto mercado separado a su lado.

La era de la IA está invirtiendo este desacoplamiento. La continua expansión de la densidad de cómputo está llevando el ancho de banda de la memoria, la latencia, la potencia y el encapsulado a sus límites. HBM, la unión híbrida y la SRAM apilada en 3D son síntomas de un único hecho subyacente: para las cargas de trabajo modernas de IA, el movimiento de datos es tan crítico como el propio cómputo, y la lógica y la memoria están siendo impulsadas nuevamente hacia una integración física estrecha. A medida que se fusionan, el equilibrio de influencia en la cadena de suministro se está desplazando hacia los proveedores de memoria y encapsulado.

La dirección tecnológica es inequívoca, pero la resolución económica aún no está resuelta. El éxito duradero en la era del hardware de IA corresponderá a aquellos que puedan fusionar la lógica y la memoria tecnológicamente y establecer una asociación económica que permita a ambas industrias compartir los beneficios de esa fusión a largo plazo. Esto no es meramente un problema de investigación; es un problema estructural que la industria debe abordar durante la próxima década. Al hacer visible el costo entre capas de cada separación, el escalado τ asegura que el problema no pueda posponerse.

6. Desafíos Abiertos

Sería engañoso presentar el escalado τ como un sistema completo. Varios problemas sustantivos permanecen abiertos, y se identifican aquí tanto para resaltar el trabajo en curso como para invitar a la colaboración.

Herramientas y metodologías. Las herramientas EDA actuales se desarrollaron para una era en la que el área, el tiempo y la potencia se optimizaban a lo largo de tres ejes separados, con el τ del sistema emergiendo como un residual. El LogicFolding a gran escala requiere que el conjunto de herramientas trate múltiples dados apilados como una única entidad de diseño continua — particionando la lógica a granularidad de celda en lugar de granularidad de bloque, colocando a través del volumen completo bajo una función de costo unificada y realizando el cierre de tiempo a través de rutas entre dados donde las parásitas de la interconexión vertical, las exclusiones KOZ y la variación del proceso entre obleas interactúan de maneras que las herramientas tradicionales entrenadas en 2D no abordan adecuadamente. Se han desarrollado herramientas internas preliminares que producen resultados útiles, y los detalles de la metodología se publicarán en los próximos meses. Un conjunto de herramientas nativo de τ — abierto, multifísico y nativo de 3D — es la inversión habilitadora más importante para la próxima década.

Variación del proceso entre obleas. LogicFolding une obleas de lotes potencialmente distintos — y en algunos casos, nodos distintos. La variación entre obleas en Vth, corriente de accionamiento y RC de interconexión es materialmente mayor que la variación dentro de la oblea, y afecta más gravemente a la distribución del reloj y a los márgenes de tiempo de retención. La redundancia inteligente, la compensación adaptativa y los flujos de cierre conscientes de τ son componentes necesarios de la respuesta.

Sobrecarga de interconexión vertical. Cada unión híbrida y cada TSV incurre en una penalización finita de resistencia y capacitancia, y el KOZ de TSV desplaza celdas estándar. Por lo tanto, LogicFolding debe justificarse capa por capa a través de la simple desigualdad

Huawei - inline image

Este umbral se ha superado para las rutas críticas móviles y para la memoria; el umbral depende de la carga de trabajo, y el límite se moverá a medida que se reduzca el paso de unión.

Energía. τ es una ley de tiempo, no una ley de julios. Un supernodo que opera 10× más rápido pero con un consumo de energía 10× mayor no viola ningún principio de escalado, pero excede la capacidad de la red eléctrica. Por lo tanto, el escalado τ requiere un acompañante energético: tejidos con semántica de memoria que eliminen la sobrecarga de la pila, óptica cercana/cointegrada que reduzca los picojulios por bit en órdenes de magnitud, suministro de energía por la parte trasera, computación integrada/cerca de la memoria, y la práctica disciplinada de intercambiar margen τ por potencia (DVFS a escala de centro de datos —el mismo mecanismo que posibilitó la longevidad de la batería en los teléfonos inteligentes). Es importante destacar que el propio margen τ proporciona margen energético cuando se asigna en esa dirección.

Evaluaciones comparativas. Los benchmarks de rendimiento actuales de la industria —Linpack, MLPerf, SPEC— fueron diseñados para una era en la que un único escalar por carga de trabajo era suficiente. Una industria de escalado τ necesita benchmarks de perfil τ: vectores que revelen la τ dominante en cada capa de un sistema junto con el margen restante en esa capa. La capa de τ dominante es, por definición, la próxima inversión.

7. Seis años después, diez años por delante

Entre mayo de 2020 y mayo de 2026, Huawei Semiconductor diseñó y llevó a producción en volumen 381 chips para los mercados móvil, IA, automotriz, industrial e infraestructura. En toda esa cartera, la tesis del escalado τ se ha mantenido:

  • En las capas de dispositivo y circuito, la densidad de transistores ha aumentado de 155 a más de 400 MTr/mm² para 2031.
  • En la capa de chip, LogicFolding ha demostrado, en un SoC móvil de vanguardia, que la frecuencia de la ruta crítica, la eficiencia energética y la densidad pueden seguir avanzando en un nodo de dispositivo fijo.
  • En la capa de sistema, Unified Bus e Hi-ONE han demostrado que cientos de microsegundos de τ de comunicación pueden comprimirse a cientos de nanosegundos, y que un clúster de IA de varios racks puede comportarse como una sola máquina coherente.
  • De cara al futuro, se espera que la frecuencia del núcleo de rendimiento de la CPU alcance los 4 GHz y más allá para 2029, se proyecta que la eficiencia del SoC Kirin se duplique con creces en tres a cinco años en uso típico, y se espera que la integración de hardware de IA crezca más de 100× para 2035.

La afirmación más profunda, más allá de cualquier producto individual, es metodológica. El escalado τ es el primer principio de escalado desde Dennard que le da a toda la pila un objetivo de optimización compartido. Señala a los tecnólogos de proceso, diseñadores de circuitos, arquitectos, ingenieros de sistemas y equipos de software que estas comunidades ahora están optimizando la misma cantidad en unidades idénticas, y que las mejoras en cualquier capa individual deben propagarse a la τ del sistema para contar. También indica a los estrategas de la industria y asignadores de capital que el próximo dólar debe seguir a τ, no a los nodos —que el rendimiento competitivo ya no requiere residencia perpetua en el borde de ataque de la litografía, y que el empaquetado, el ancho de banda de memoria y el diseño de tejido ahora tienen el peso estratégico que antes ostentaba solo el nodo lógico de vanguardia.

Para una generación de ingenieros educados para tratar la "Ley de Moore" como sinónimo de "progreso", esta es una transición difícil. La era geométrica ha concluido, de hecho; negar ese hecho no es una estrategia viable. La era de la aceleración mediante miniaturización está dando paso a una era de aceleración mediante la optimización τ a través del sistema electrónico multicapa —y las empresas, grupos de investigación y ecosistemas que adopten τ como objetivo principal en los próximos seis a diez años determinarán la forma de la computación en la década siguiente.

El trabajo de los próximos diez años está definido. Quedan muchas preguntas abiertas, y ninguna organización puede abordarlas por sí sola —la cadena de herramientas, los estándares, los puntos de referencia, la física de dispositivos y los modelos económicos requieren contribuciones de más allá de una sola empresa. Por lo tanto, esta perspectiva se presenta tanto como un informe desde el campo como una invitación.

El camino por delante es exigente, pero la dirección es inequívoca.

Autora

Tingbo He dirige el negocio de semiconductores de Huawei. El equipo que dirige ha diseñado y llevado a producción en volumen 381 chips entre 2020 y 2026 en los mercados móvil, IA, automotriz e infraestructura, y es la fuente de la metodología de escalado τ y de las tecnologías LogicFolding, UnifiedBus e Hi-ONE descritas en este artículo.

Agradecimientos

Esta perspectiva se basa en seis años de trabajo de miles de ingenieros en Huawei Semiconductor y su ecosistema de socios de fundición, equipos, EDA y sistemas. La autora agradece a los clientes cuya paciencia hizo posible este trabajo.

Lecturas adicionales

  1. G. E. Moore, "Cramming more components onto integrated circuits," Electronics, vol. 38, no. 8, pp. 114–117, abr. 1965 (reimpreso en Proc. IEEE, vol. 86, no. 1, ene. 1998).
  1. R. H. Dennard et al., "Design of ion-implanted MOSFETs with very small physical dimensions," IEEE J. Solid-State Circuits, vol. 9, no. 5, pp. 256–268, 1974.
  1. J. L. Hennessy y D. A. Patterson, "A new golden age for computer architecture," Commun. ACM, vol. 62, no. 2, pp. 48–60, feb. 2019.
  1. M. Horowitz, "Computing's energy problem (and what we can do about it)," ISSCC Dig. Tech. Papers, pp. 10–14, feb. 2014.
  1. International Roadmap for Devices and Systems (IRDS) — capítulos de Interconnect y More-than-Moore, actualización 2023/2024.
  1. P. Batude et al., "3D sequential integration: a key enabling technology for heterogeneous co-integration of new functions with CMOS," IEEE J. Electron Devices Soc., vol. 3, no. 3, pp. 205–216, 2015.
Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales