[!NOTE] Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Conexiones hiperdimensionales restringidas por variedad geométrica (mHC): Explicación de la escala residual de DeepSeek
El aprendizaje profundo moderno se basa en la conexión residual. Las hiperconexiones (HC) exploran otra dimensión arquitectónica: amplían el estado residual en varios flujos interactivos. DeepSeek’s Conexiones hiperbólicas restringidas por variedad (mHC) El artículo analiza cómo mantener estable esa ruta de enrutamiento a escalas de entrenamiento más grandes.
Este artículo comienza con las conexiones residuales estándar y, a continuación, presenta las Hyper-Connections y la inestabilidad que generan. Dicha secuencia facilita la comprensión de la restricción final mHC y su implementación.
Resumen: HC sustituye un estado residual por múltiples flujos, además de mapas aprendibles para la lectura, escritura y mezcla. Dichos mapas, al no estar sujeto a restricciones, pueden amplificar o atenuar las señales cuando se combinan entre capas. mHC proyecta aproximadamente el mapa de mezcla residual sobre el poliedro de Birkhoff mediante 20 iteraciones de Sinkhorn-Knopp. El artículo presenta experimentos de preentrenamiento con modelos de 3B, 9B y 27 mil millones de parámetros que resultan estables, y muestra que la implementación de kernels personalizados y un esquema de programación adecuado reduce el tiempo de entrenamiento adicional necesario para cuatro flujos en un 6,7 %.
Por qué funcionan las conexiones residuales
Antes de analizar qué soluciona el mHC, es necesario entender sobre qué se basa.
El problema de profundidad
Añadir capas puede incrementar la capacidad del sistema, pero también dificulta la optimización y la propagación de la señal. En función de la inicialización, la normalización y la arquitectura, las activaciones en el sentido forward o los gradientes en el sentido backward pueden reducirse, aumentar o presentar condiciones de convergencia precarias a medida que se avanza en profundidad.
La solución residual
El El artículo original de ResNet Se introdujo una solución elegante. En lugar de aprender una asignación directa, se aprende el residual, que corresponde a la diferencia con respecto a la función identidad:
La propiedad útil es el atajo de identidad. Cuando la función residual devuelve cero, la capa funciona como un paso directo. De esto se derivan dos consecuencias:
- Un término de gradiente directo: la retropropagación incluye un camino a través de la componente de identidad.
- Una mapeo de fallback sencillo: la rama residual puede mantenerse cerca de cero cuando una capa no necesita modificar significativamente su estado.
Esto no elimina todos los problemas de optimización, pero permitió que las redes de mayor profundidad fueran viables en la práctica.
Cómo la normalización por capas modifica la ruta residual
Los Transformers introdujeron una variable adicional: el lugar donde se debe colocar la normalización por capas (Layer Normalization, LN). A primera vista, la decisión parece trivial, pero en realidad no lo es.
| Variante | Colocación de LN | Ventaja | Limitación clave |
|---|---|---|---|
| Post-LN | Después del bloque residual | Contribución significativa de profundidad | Puede resultar más difícil de optimizar a mayor profundidad. |
| Pre-LN | Antes del bloque residual | Ruta residual más directa | Las representaciones de capas adyacentes pueden volverse cada vez más similares. |
El ResiDual La arquitectura combina rutas residuales de tipo Pre-LN y Post-LN. Por su parte, el HC sigue un enfoque distinto al ampliar el estado residual en múltiples flujos.
Las hiper-conexiones añaden flujos residuales paralelos
Conexiones hiperdimensionales (CH) Toma un camino diferente: amplía la ancho del flujo residual en lugar de aumentar su profundidad.
Qué significa un flujo
En un Transformer estándar, cada token cuenta con un estado de dimensiones que atraviesa los bloques. HC replica el estado inicial veces, generando una matriz oculta de tamaño .
En Hyper-Connections, un stream es una de las instanciaciones paralelas de este estado.
¿Cómo los obtenemos? Al inicio de la red, la entrada inicial embedding se replica veces (donde es la “tasa de expansión”, normalmente 4). El estado oculto estándar de dimensiones se convierte en una “matriz hiperoculta” de tamaño .
Las copias comienzan de forma idéntica y luego divergen a medida que los mapas aprendidos leen, escriben y mezclan las secuencias de datos. El artículo las interpreta como múltiples patrones de conexión a lo largo de la profundidad; no exige que cada secuencia adquiera un rol fijo y legible para el ser humano.
Mecanismos fundamentales
En lugar de una única vía residual, HC mantiene flujos paralelos que circulan por toda la red. En cada bloque de transformador, se ejecutan tres operaciones, cada una controlada por pequeños pesos aprendibles:
- Lectura (): se agregan las secuencias en una entrada de dimensiones que es procesada por el bloque de atención o de feed-forward.
- Escritura (): la salida de dicho bloque se mapea nuevamente para generar actualizaciones correspondientes a las secuencias.
- Mezcla (): se aplica un mapeo residual de tipo antes de sumar las actualizaciones provenientes del bloque.
Estos mapas pueden ser parámetros estáticos además de términos dependientes de la entrada. El mapa residual es la parte crítica para la estabilidad, ya que se multiplica repetidamente a lo largo de la profundidad.
Qué informa el artículo de HC
El problema de escalabilidad
El artículo sobre mHC describe una inestabilidad que aparece al escalar el HC sin restricciones hacia su configuración de 27 mil millones de parámetros. La sección siguiente explica el mecanismo que dicho estudio identifica.
Por qué el HC sin restricciones puede volverse inestable
La flexibilidad que impulsa a HC es también lo que lo debilita. Destruye el mapeo de identidades que permite, en primer lugar, que los residuos sean entrenables.
El problema del mapa compuesto
En los residuos estándar:
Cuando , se cumple la identidad: . La señal atraviesa el sistema sin sufrir modificaciones.
En Hyper-Connections, la ruta residual incluye una multiplicación matricial:
A lo largo de las capas L, la señal se convierte en:
El comportamiento depende de la matriz compuesta, y no de si los elementos individuales se encuentran por encima o por debajo de 1. Si los mapas sucesivos presentan ganancias del operador superiores a uno en una dirección alineada, las señales pueden crecer; las ganancias inferiores a uno pueden atenuarlas. Los valores negativos también pueden provocar cancelación.
El artículo sobre mHC mide este valor mediante la Amax Gain Magnitude: es decir, la suma absoluta máxima de las filas durante la propagación hacia adelante y la suma de las columnas durante la propagación hacia atrás en un mapa residual compuesto. En su experimento con 27B de HC, el pico alcanza aproximadamente 3,000, coincidiendo con un comportamiento de entrenamiento inestable.
Por lo tanto, el objetivo de diseño es más restrictivo que obligar a que cada mapeo sea la función identidad: permitir la mezcla entre flujos distintos al tiempo que se limita la amplificación en las composiciones.
La restricción del mHC
El mHC mantiene el enrutamiento entre flujos, pero restringe cada matriz de mezcla residual al poliedro de Birkhoff, que es el conjunto de matrices doblemente estocásticas. Sus elementos son no negativos, y la suma de cada fila y columna es igual a uno. Esta restricción garantiza que cada flujo de salida sea una combinación convexa de los flujos de entrada, además de limitar la norma espectral de la función de mapeo residual a un valor igual a uno.
Qué garantiza la doble estocasticidad
El mHC impone que la matriz de mezcla H^res sea doblemente estocástica: todas sus entradas son no negativas, y la suma de cada fila y columna es exactamente 1. Esto garantiza al mismo tiempo tres propiedades:
| Restricción | Consecuencia | |
|---|---|---|
| No negatividad | Todos los valores son al menos cero. | Cada salida corresponde a una combinación convexa, sin cancelación de signos. |
| Suma de filas = 1 | La suma de cada fila es igual a uno. | Una señal constante en todos los flujos se mantiene invariable. |
| Suma de columnas = 1 | La suma de cada columna es igual a uno. | El valor medio global a lo largo de las secuencias se conserva. |
Esto no corresponde a una conservación de energía euclidiana en sentido literal. Un mapa doblemente estocástico puede suavizar las diferencias entre flujos. Lo que ofrece es una conservación de la media, además de una ruta no expansiva, dentro de los límites normativos establecidos.
Esta restricción también conlleva consecuencias matemáticas útiles:
- Norma espectral ≤ 1: el mapa de enrutamiento residual no puede amplificar la norma euclidiana.
- Cierre bajo multiplicación: el producto de matrices doblemente estocásticas sigue siendo doblemente estocástico, por lo que la restricción se mantiene al componer operaciones a diferentes profundidades.
- Mezcla convexa: según el teorema de Birkhoff-von Neumann, el mapa pertenece al cono convexo de las matrices de permutación.
Proyección de Sinkhorn-Knopp
Los logit residuales aprendibles no están sujeto a ninguna restricción. mHC primero los expone para obtener una matriz positiva y, a continuación, aplica normalización alternativa en filas y columnas. Con suficientes iteraciones, este proceso de Sinkhorn-Knopp converge hacia una matriz doblemente estocástica; el artículo emplea 20 iteraciones como una proyección aproximada y diferenciable.
Para los logits brutos , el procedimiento es:
S = exp(A)
repeat 20 times:
S = S / row_sum(S)
S = S / column_sum(S)
return S
Las operaciones son diferenciables, pero no son gratuitas. mHC depende de un núcleo forward fusionado y de un núcleo backward personalizado que vuelve a calcular los estados de normalización intermedios directamente en el chip.
Detalles de parametrización
- Mapa residual: la exponenciación sumada a la normalización de Sinkhorn genera el espacio , que es aproximadamente doblemente estocástico.
- Mapas de lectura y escritura: la parametrización sigmoide mantiene a y no negativos, lo que disminuye la cancelación causada por coeficientes de signo mixto.
Arquitectura completa del mHC
En resumen:
El flujo a través de cada bloque:
- Entrada: flujos residuales paralelos ingresan en la capa.
- Lectura (): los flujos se combinan para formar la entrada que consume la función de la capa. Una función sigmoide garantiza que los coeficientes sean no negativos.
- Cálculo: El bloque estándar de Transformer (Atención o MLP) procesa el vector agregado único.
- Escritura (): La salida del bloque se mapea en actualizaciones para los flujos, nuevamente con coeficientes no negativos.
- Mezcla (): El mapeo residual aproximadamente dual estocástico mezcla los flujos entrantes antes de aplicar la actualización.
- Salida: La matriz de flujos actualizada pasa a la capa siguiente.
Solo el mapa de mezcla residual utiliza la proyección de Sinkhorn. Los mapas de lectura y escritura emplean parametrizaciones no negativas. Dicha distinción es importante, ya que la garantía de composición del artículo se aplica a .
Infraestructura requerida para el sobrecoste reportado
Cuatro flujos incrementan el acceso a la memoria de estado residual, el almacenamiento de activaciones y la comunicación mediante pipeline. El resultado de 6,7 % en cuanto a tiempos de ejecución presentado en el artículo se debe a la implementación diseñada conjuntamente que se describe a continuación.
Fusión de kernels
La implementación combina operaciones que comparten acceso a memoria, emplea precisión mixta cuando es adecuado, e implementa la mayoría de los núcleos personalizados con TileLang. El bucle Sinkhorn y su paso hacia atrás personalizado se ejecutan dentro de kernels dedicados con el fin de reducir el tráfico de memoria y la sobrecarga asociada al inicio de las operaciones.
Recómputo selectivo
Almacenar cada estado intermedio de Sinkhorn para la retropropagación haría que la memoria se agotara. En su lugar, mHC:
- Libera las activaciones intermedias tras el paso hacia adelante.
- Vuelve a calcularlas en tiempo real durante el paso hacia atrás.
Una extensión DualPipe El horario establece superposiciones en las fases de comunicación, recálculo y trabajo por capas en los límites de pipeline. La superposición lograda es específica de este sistema de entrenamiento.
Resultado del sistema reportado
En el entorno a gran escala utilizado para el artículo, una tasa de expansión de incrementa el tiempo de entrenamiento en un 6,7 % con respecto a su versión base. Se trata de un resultado propio del sistema, y no del sobrecoste que conlleva una implementación simple de framework.
Qué establecen los experimentos
En la comparación de 27 mil millones de parámetros, el HC sin restricciones alcanza un valor máximo compuesto de ganancia Amax cercano a 3.000. Mediante una proyección aproximada de Sinkhorn de 20 pasos, la ganancia hacia atrás compuesta del mHC se desvía de uno, pero permanece limitada a aproximadamente 1,6 según el análisis presentado.
Los autores también entrenan variantes inspiradas en DeepSeek-V3 con capacidades de 3B, 9B y 27B de parámetros MoE. Con 27B de parámetros, el método mHC supera al modelo base basado en residuos estándar en las ocho tareas downstream benchmarks analizadas, y lo supera además en seis de esas ocho pruebas; por su parte, el método HC obtiene resultados ligeramente mejores en las tareas GSM8K y MATH. Se trata de experimentos de preentrenamiento realizados internamente por el equipo que propuso estos modelos, por lo que aún queda pendiente una replicación independiente y comparaciones con otras arquitecturas.
Compromisos y cuestiones abiertas
mHC no constituye una solución universal aplicable a todos los modelos. Quedan cuatro cuestiones por resolver:
- Sobrecarga del sistema: El 6,7 % corresponde al resultado obtenido con la implementación optimizada; otro runtime, como la topología del dispositivo o la forma del modelo, puede generar un costo distinto.
- Complejidad de implementación: Aunque existe una implementación de referencia que permite expresar el método, lograr el rendimiento reportado exige el uso de núcleos personalizados, recálculos y modificaciones en el plan de ejecución.
- Sesgo por mezcla: La doble estocasticidad mantiene el promedio interstream y evita la expansión a través de , pero puede suavizar las diferencias entre los flujos de datos. No obstante, la actualización por bloques sigue alterando la representación global.
- Alcance de las pruebas: La evidencia más sólida proviene del preentrenamiento de modelos de lenguaje en arquitecturas inspiradas en DeepSeek-V3 y basadas en MoE. Por el momento, este trabajo no ha demostrado aún la generalizabilidad a otras familias de modelos.
Conclusiones principales
- Las conexiones residuales funcionan gracias al mapeo de identidad: la capacidad de transmitir señales sin que estas sufran cambios.
- Las Hyper-Connections escalan la anchura en lugar de la profundidad, lo que permite una convergencia más rápida mediante enrutamiento multihilo.
- Las HC sin restricciones pueden perder la propiedad de conservación residual cuando los mapas residuales se componen a lo largo de la profundidad.
- El mHC restringe la mezcla residual al poliedro de Birkhoff, conservando el promedio entre hilos y delimitando la amplificación.
- El método Sinkhorn-Knopp hace que la restricción sea diferenciable, lo que posibilita el entrenamiento de extremo a extremo.
- El sobrecoste del 6,7 % reportado es un logro del sistema, y no una característica exclusiva de la arquitectura.
mHC representa una vía prometedora para estudiar una topología residual más amplia, al mismo tiempo que mantiene el mapa residual repetido en buenas condiciones. Que sea viable para otro modelo depende de las mejoras de calidad independientes y del costo asociado a reproducir su stack de sistemas.
Referencias
- mHC: Hiperconexiones Restringidas por el Manifasto - Xie et al. (DeepSeek) Aprendizaje residual profundo para el reconocimiento de imágenes - He y colaboradores (ResNet)
- Hyper-Conexiones - Artículo original de HC TileLang - CUDA optimización del kernel framework
- DualPipe - Pipeline planificador de paralelismo para DeepSeek-V3
- ResiDual - Arquitectura de ruta residual dual