[!NOTE] Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.

Conexiones hiperdimensionales restringidas por variedad geométrica (mHC): Explicación de la escala residual de DeepSeek

El aprendizaje profundo moderno se basa en la conexión residual. Las hiperconexiones (HC) exploran otra dimensión arquitectónica: amplían el estado residual en varios flujos interactivos. DeepSeek’s Conexiones hiperbólicas restringidas por variedad (mHC) El artículo analiza cómo mantener estable esa ruta de enrutamiento a escalas de entrenamiento más grandes.

Este artículo comienza con las conexiones residuales estándar y, a continuación, presenta las Hyper-Connections y la inestabilidad que generan. Dicha secuencia facilita la comprensión de la restricción final mHC y su implementación.

Resumen: HC sustituye un estado residual por múltiples flujos, además de mapas aprendibles para la lectura, escritura y mezcla. Dichos mapas, al no estar sujeto a restricciones, pueden amplificar o atenuar las señales cuando se combinan entre capas. mHC proyecta aproximadamente el mapa de mezcla residual sobre el poliedro de Birkhoff mediante 20 iteraciones de Sinkhorn-Knopp. El artículo presenta experimentos de preentrenamiento con modelos de 3B, 9B y 27 mil millones de parámetros que resultan estables, y muestra que la implementación de kernels personalizados y un esquema de programación adecuado reduce el tiempo de entrenamiento adicional necesario para cuatro flujos en un 6,7 %.


Por qué funcionan las conexiones residuales

Antes de analizar qué soluciona el mHC, es necesario entender sobre qué se basa.

El problema de profundidad

Añadir capas puede incrementar la capacidad del sistema, pero también dificulta la optimización y la propagación de la señal. En función de la inicialización, la normalización y la arquitectura, las activaciones en el sentido forward o los gradientes en el sentido backward pueden reducirse, aumentar o presentar condiciones de convergencia precarias a medida que se avanza en profundidad.

La solución residual

El El artículo original de ResNet Se introdujo una solución elegante. En lugar de aprender una asignación directa, se aprende el residual, que corresponde a la diferencia con respecto a la función identidad:

Conexión de residuos estándar

La propiedad útil es el atajo de identidad. Cuando la función residual F(x)F(x) devuelve cero, la capa funciona como un paso directo. De esto se derivan dos consecuencias:

  1. Un término de gradiente directo: la retropropagación incluye un camino a través de la componente de identidad.
  2. Una mapeo de fallback sencillo: la rama residual puede mantenerse cerca de cero cuando una capa no necesita modificar significativamente su estado.

Esto no elimina todos los problemas de optimización, pero permitió que las redes de mayor profundidad fueran viables en la práctica.


Cómo la normalización por capas modifica la ruta residual

Los Transformers introdujeron una variable adicional: el lugar donde se debe colocar la normalización por capas (Layer Normalization, LN). A primera vista, la decisión parece trivial, pero en realidad no lo es.

Compromisos entre enfoque post-LN y pre-LN

VarianteColocación de LNVentajaLimitación clave
Post-LNDespués del bloque residualContribución significativa de profundidadPuede resultar más difícil de optimizar a mayor profundidad.
Pre-LNAntes del bloque residualRuta residual más directaLas representaciones de capas adyacentes pueden volverse cada vez más similares.

El ResiDual La arquitectura combina rutas residuales de tipo Pre-LN y Post-LN. Por su parte, el HC sigue un enfoque distinto al ampliar el estado residual en múltiples flujos.


Las hiper-conexiones añaden flujos residuales paralelos

Conexiones hiperdimensionales (CH) Toma un camino diferente: amplía la ancho del flujo residual en lugar de aumentar su profundidad.

Arquitectura de Hiper-Conexiones

Qué significa un flujo

En un Transformer estándar, cada token cuenta con un estado de dd dimensiones que atraviesa los bloques. HC replica el estado inicial nn veces, generando una matriz oculta de tamaño n×dn \times d.

En Hyper-Connections, un stream es una de las nn instanciaciones paralelas de este estado.

¿Cómo los obtenemos? Al inicio de la red, la entrada inicial embedding se replica nn veces (donde nn es la “tasa de expansión”, normalmente 4). El estado oculto estándar de dd dimensiones se convierte en una “matriz hiperoculta” de tamaño n×dn \times d.

Las copias comienzan de forma idéntica y luego divergen a medida que los mapas aprendidos leen, escriben y mezclan las secuencias de datos. El artículo las interpreta como múltiples patrones de conexión a lo largo de la profundidad; no exige que cada secuencia adquiera un rol fijo y legible para el ser humano.

Mecanismos fundamentales

En lugar de una única vía residual, HC mantiene nn flujos paralelos que circulan por toda la red. En cada bloque de transformador, se ejecutan tres operaciones, cada una controlada por pequeños pesos aprendibles:

  1. Lectura (Hpre\mathcal{H}^{pre}): se agregan las nn secuencias en una entrada de dd dimensiones que es procesada por el bloque de atención o de feed-forward.
  2. Escritura (Hpost\mathcal{H}^{post}): la salida de dicho bloque se mapea nuevamente para generar actualizaciones correspondientes a las nn secuencias.
  3. Mezcla (Hres\mathcal{H}^{res}): se aplica un mapeo residual de tipo n×nn \times n antes de sumar las actualizaciones provenientes del bloque.

Estos mapas pueden ser parámetros estáticos además de términos dependientes de la entrada. El mapa residual es la parte crítica para la estabilidad, ya que se multiplica repetidamente a lo largo de la profundidad.

Qué informa el artículo de HC

Rendimiento HC

El problema de escalabilidad

El artículo sobre mHC describe una inestabilidad que aparece al escalar el HC sin restricciones hacia su configuración de 27 mil millones de parámetros. La sección siguiente explica el mecanismo que dicho estudio identifica.


Por qué el HC sin restricciones puede volverse inestable

La flexibilidad que impulsa a HC es también lo que lo debilita. Destruye el mapeo de identidades que permite, en primer lugar, que los residuos sean entrenables.

Problema de inestabilidad HC

El problema del mapa compuesto

En los residuos estándar:

xl+1=xl+F(xl)x_{l+1} = x_l + F(x_l)

Cuando F(x)0F(x) \rightarrow 0, se cumple la identidad: xl+1=xlx_{l+1} = x_l. La señal atraviesa el sistema sin sufrir modificaciones.

En Hyper-Connections, la ruta residual incluye una multiplicación matricial:

xl+1=Hlresxl+x_{l+1} = \mathbf{H}^{res}_l \cdot x_l + \dots

A lo largo de las capas L, la señal se convierte en:

xL=HLres×HL1res××H1res×x0x_L = \mathbf{H}^{res}_L \times \mathbf{H}^{res}_{L-1} \times \dots \times \mathbf{H}^{res}_1 \times x_0

El comportamiento depende de la matriz compuesta, y no de si los elementos individuales se encuentran por encima o por debajo de 1. Si los mapas sucesivos presentan ganancias del operador superiores a uno en una dirección alineada, las señales pueden crecer; las ganancias inferiores a uno pueden atenuarlas. Los valores negativos también pueden provocar cancelación.

El artículo sobre mHC mide este valor mediante la Amax Gain Magnitude: es decir, la suma absoluta máxima de las filas durante la propagación hacia adelante y la suma de las columnas durante la propagación hacia atrás en un mapa residual compuesto. En su experimento con 27B de HC, el pico alcanza aproximadamente 3,000, coincidiendo con un comportamiento de entrenamiento inestable.

La causa raíz: pérdida de identidad

Por lo tanto, el objetivo de diseño es más restrictivo que obligar a que cada mapeo sea la función identidad: permitir la mezcla entre flujos distintos al tiempo que se limita la amplificación en las composiciones.


La restricción del mHC

El mHC mantiene el enrutamiento entre flujos, pero restringe cada matriz de mezcla residual al poliedro de Birkhoff, que es el conjunto de matrices doblemente estocásticas. Sus elementos son no negativos, y la suma de cada fila y columna es igual a uno. Esta restricción garantiza que cada flujo de salida sea una combinación convexa de los flujos de entrada, además de limitar la norma espectral de la función de mapeo residual a un valor igual a uno.

La solución mHC

Qué garantiza la doble estocasticidad

El mHC impone que la matriz de mezcla H^res sea doblemente estocástica: todas sus entradas son no negativas, y la suma de cada fila y columna es exactamente 1. Esto garantiza al mismo tiempo tres propiedades:

RestricciónConsecuencia
No negatividadTodos los valores son al menos cero.Cada salida corresponde a una combinación convexa, sin cancelación de signos.
Suma de filas = 1La suma de cada fila es igual a uno.Una señal constante en todos los flujos se mantiene invariable.
Suma de columnas = 1La suma de cada columna es igual a uno.El valor medio global a lo largo de las secuencias se conserva.

Esto no corresponde a una conservación de energía euclidiana en sentido literal. Un mapa doblemente estocástico puede suavizar las diferencias entre flujos. Lo que ofrece es una conservación de la media, además de una ruta no expansiva, dentro de los límites normativos establecidos.

Esta restricción también conlleva consecuencias matemáticas útiles:

  1. Norma espectral ≤ 1: el mapa de enrutamiento residual no puede amplificar la norma euclidiana.
  2. Cierre bajo multiplicación: el producto de matrices doblemente estocásticas sigue siendo doblemente estocástico, por lo que la restricción se mantiene al componer operaciones a diferentes profundidades.
  3. Mezcla convexa: según el teorema de Birkhoff-von Neumann, el mapa pertenece al cono convexo de las matrices de permutación.

Proyección de Sinkhorn-Knopp

Los logit residuales aprendibles no están sujeto a ninguna restricción. mHC primero los expone para obtener una matriz positiva y, a continuación, aplica normalización alternativa en filas y columnas. Con suficientes iteraciones, este proceso de Sinkhorn-Knopp converge hacia una matriz doblemente estocástica; el artículo emplea 20 iteraciones como una proyección aproximada y diferenciable.

Algoritmo Sinkhorn detallado

Para los logits brutos AA, el procedimiento es:

S = exp(A)
repeat 20 times:
    S = S / row_sum(S)
    S = S / column_sum(S)
return S

Las operaciones son diferenciables, pero no son gratuitas. mHC depende de un núcleo forward fusionado y de un núcleo backward personalizado que vuelve a calcular los estados de normalización intermedios directamente en el chip.

Detalles de parametrización


Arquitectura completa del mHC

En resumen:

Arquitectura completa de mHC

El flujo a través de cada bloque:

  1. Entrada: nn flujos residuales paralelos ingresan en la capa.
  2. Lectura (Hpre\mathcal{H}^{pre}): los nn flujos se combinan para formar la entrada que consume la función de la capa. Una función sigmoide garantiza que los coeficientes sean no negativos.
  3. Cálculo: El bloque estándar de Transformer (Atención o MLP) procesa el vector agregado único.
  4. Escritura (Hpost\mathcal{H}^{post}): La salida del bloque se mapea en actualizaciones para los nn flujos, nuevamente con coeficientes no negativos.
  5. Mezcla (Hres\mathcal{H}^{res}): El mapeo residual aproximadamente dual estocástico mezcla los flujos entrantes antes de aplicar la actualización.
  6. Salida: La matriz de flujos actualizada pasa a la capa siguiente.

Solo el mapa de mezcla residual utiliza la proyección de Sinkhorn. Los mapas de lectura y escritura emplean parametrizaciones no negativas. Dicha distinción es importante, ya que la garantía de composición del artículo se aplica a Hres\mathcal{H}^{res}.


Infraestructura requerida para el sobrecoste reportado

Cuatro flujos incrementan el acceso a la memoria de estado residual, el almacenamiento de activaciones y la comunicación mediante pipeline. El resultado de 6,7 % en cuanto a tiempos de ejecución presentado en el artículo se debe a la implementación diseñada conjuntamente que se describe a continuación.

Fusión de kernels

La implementación combina operaciones que comparten acceso a memoria, emplea precisión mixta cuando es adecuado, e implementa la mayoría de los núcleos personalizados con TileLang. El bucle Sinkhorn y su paso hacia atrás personalizado se ejecutan dentro de kernels dedicados con el fin de reducir el tráfico de memoria y la sobrecarga asociada al inicio de las operaciones.

Recómputo selectivo

Almacenar cada estado intermedio de Sinkhorn para la retropropagación haría que la memoria se agotara. En su lugar, mHC:

Una extensión DualPipe El horario establece superposiciones en las fases de comunicación, recálculo y trabajo por capas en los límites de pipeline. La superposición lograda es específica de este sistema de entrenamiento.

Resultado del sistema reportado

En el entorno a gran escala utilizado para el artículo, una tasa de expansión de n=4n=4 incrementa el tiempo de entrenamiento en un 6,7 % con respecto a su versión base. Se trata de un resultado propio del sistema, y no del sobrecoste que conlleva una implementación simple de framework.


Qué establecen los experimentos

En la comparación de 27 mil millones de parámetros, el HC sin restricciones alcanza un valor máximo compuesto de ganancia Amax cercano a 3.000. Mediante una proyección aproximada de Sinkhorn de 20 pasos, la ganancia hacia atrás compuesta del mHC se desvía de uno, pero permanece limitada a aproximadamente 1,6 según el análisis presentado.

Los autores también entrenan variantes inspiradas en DeepSeek-V3 con capacidades de 3B, 9B y 27B de parámetros MoE. Con 27B de parámetros, el método mHC supera al modelo base basado en residuos estándar en las ocho tareas downstream benchmarks analizadas, y lo supera además en seis de esas ocho pruebas; por su parte, el método HC obtiene resultados ligeramente mejores en las tareas GSM8K y MATH. Se trata de experimentos de preentrenamiento realizados internamente por el equipo que propuso estos modelos, por lo que aún queda pendiente una replicación independiente y comparaciones con otras arquitecturas.


Compromisos y cuestiones abiertas

mHC no constituye una solución universal aplicable a todos los modelos. Quedan cuatro cuestiones por resolver:

  1. Sobrecarga del sistema: El 6,7 % corresponde al resultado obtenido con la implementación optimizada; otro runtime, como la topología del dispositivo o la forma del modelo, puede generar un costo distinto.
  2. Complejidad de implementación: Aunque existe una implementación de referencia que permite expresar el método, lograr el rendimiento reportado exige el uso de núcleos personalizados, recálculos y modificaciones en el plan de ejecución.
  3. Sesgo por mezcla: La doble estocasticidad mantiene el promedio interstream y evita la expansión a través de Hres\mathcal{H}^{res}, pero puede suavizar las diferencias entre los flujos de datos. No obstante, la actualización por bloques sigue alterando la representación global.
  4. Alcance de las pruebas: La evidencia más sólida proviene del preentrenamiento de modelos de lenguaje en arquitecturas inspiradas en DeepSeek-V3 y basadas en MoE. Por el momento, este trabajo no ha demostrado aún la generalizabilidad a otras familias de modelos.

Conclusiones principales

  1. Las conexiones residuales funcionan gracias al mapeo de identidad: la capacidad de transmitir señales sin que estas sufran cambios.
  2. Las Hyper-Connections escalan la anchura en lugar de la profundidad, lo que permite una convergencia más rápida mediante enrutamiento multihilo.
  3. Las HC sin restricciones pueden perder la propiedad de conservación residual cuando los mapas residuales se componen a lo largo de la profundidad.
  4. El mHC restringe la mezcla residual al poliedro de Birkhoff, conservando el promedio entre hilos y delimitando la amplificación.
  5. El método Sinkhorn-Knopp hace que la restricción sea diferenciable, lo que posibilita el entrenamiento de extremo a extremo.
  6. El sobrecoste del 6,7 % reportado es un logro del sistema, y no una característica exclusiva de la arquitectura.

mHC representa una vía prometedora para estudiar una topología residual más amplia, al mismo tiempo que mantiene el mapa residual repetido en buenas condiciones. Que sea viable para otro modelo depende de las mejoras de calidad independientes y del costo asociado a reproducir su stack de sistemas.


Referencias