[!NOTE] Traduction automatique Cet article a été traduit automatiquement depuis la version originale en anglais.
Hyper-conexions contraintes par un manifond (mHC) : Explication de l’échelle des résidus de DeepSeek
Le deep learning moderne repose sur la connexion résiduelle. Les hyper-connections (HC) explorent une autre dimension architecturale : elles élargissent l’état résiduel en plusieurs flux interactifs. DeepSeek’s Hyper‑connexions contraintes par un manifond (mHC) Cet article examine les méthodes permettant de maintenir cette stabilité de routage à des échelles d’entraînement plus importantes.
Ce postule commence par les connexions résiduelles classiques, avant d’introduire les Hyper-Connections ainsi que l’instabilité qu’elles génèrent. Cette séquence permet de comprendre plus facilement la contrainte mHC finale et sa mise en œuvre.
En résumé : HC remplace un état résiduel par plusieurs flux, ainsi que des cartes de lecture, d’écriture et de mélange apprenables. Ces cartes non contraintes peuvent amplifier ou atténuer les signaux lorsqu’elles sont combinées entre différentes couches. mHC projette approximativement la carte de mélange résiduelle sur le polytope de Birkhoff à l’aide de 20 itérations de Sinkhorn-Knopp. L’étude présente des expériences de préentraînement stables sur des modèles de 3 B, 9 B et 27 B, indiquant une augmentation de 6,7 % du temps d’entraînement nécessaire pour quatre flux, grâce à des noyaux personnalisés et à une planification optimisée.
Pourquoi les connexions résiduelles fonctionnent
Avant d’aborder ce que corrige le mHC, il nous faut comprendre sur quoi il s’appuie.
Le problème de profondeur
L’ajout de couches permet d’augmenter la capacité du réseau, mais il complique également l’optimisation ainsi que la propagation des signaux. En fonction de la méthode d’initialisation, de la normalisation et de l’architecture, les activations en sens avant ou les gradients en sens arrière peuvent se réduire, augmenter ou présenter de mauvaises conditions à mesure que l’on s’enfonce dans la profondeur du réseau.
La solution résiduelle
Le article de ResNet une correction élégante a été mise en œuvre. Au lieu d’apprendre une correspondance directe, il s’agit d’apprendre le résidu, c’est‑à‑dire la différence par rapport à l’identité :
La propriété pertinente est le raccourci d’identité. Lorsque la fonction résiduelle produit zéro, la couche devient un passe-through. Deux conséquences en découlent :
- Un terme de gradient direct : la rétropropagation intègre un chemin passant par la composante d’identité.
- Une mise en correspondance de secours simple : la branche résiduelle peut rester proche de zéro lorsque une couche n’a pas besoin de modifier significativement son état.
Cela ne résout pas tous les problèmes d’optimisation, mais il a rendu possibles l’utilisation de réseaux nettement plus profonds.
Comment la normalisation par couche modifie le chemin résiduel
Les Transformers ont introduit une nouvelle variable : il s’agit de déterminer où placer la normalisation par couche (LN). Cette décision semble anodine, mais ce n’est pas le cas.
| Variant | Placement LN | Avantage | Limite majeure |
|---|---|---|---|
| Post-LN | Après le bloc résiduel | Contribution significative en profondeur | Il peut être plus difficile d’optimiser en profondeur. |
| Pré-LN | Avant le bloc résiduel | Chemin résiduel plus direct | Les représentations des couches adjacentes peuvent devenir de plus en plus similaires. |
Le ResiDual L’architecture intègre des chemins résiduels pré-LN et post-LN. L’HC emprunte une approche différente en élargissant l’état résiduel en plusieurs flux.
Les hyper‑connexions ajoutent des flux résiduels parallèles
Hyper-Connexions (HC) emprunte une voie différente : il s’agit d’augmenter la largeur du flux résiduel plutôt que d’ajouter de la profondeur.
Ce qu’est un flux
Dans un Transformer classique, chaque token possède un état de dimension qui traverse les blocs. L’architecture HC reproduit cet état initial fois, ce qui génère une matrice cachée de taille .
Dans Hyper-Connections, un flux correspond à l’une des instances parallèles de cet état.
Comment les obtenons-nous ? Au début du réseau, l’entrée initiale embedding est reproduite fois (où représente le « taux d’expansion », généralement égal à 4). L’état caché standard à dimensions devient ainsi une « matrice hyper-cachée » de taille .
Les copies commencent de manière identique, puis divergent à mesure que les cartes apprises lisent dans ces flux, y écrivent et les mélangent. Cet article les interprète comme plusieurs motifs de connexion à travers la profondeur ; il n’exige pas que chaque flux acquière un rôle lisible par l’humain fixe.
Mécanismes fondamentaux
Au lieu d’un seul chemin résiduel, HC maintient flux parallèles circulant à travers l’ensemble du réseau. Dans chaque bloc transformateur, trois opérations sont exécutées, chacune étant contrôlée par de petits poids apprenables :
- Lecture () : agréger les flux en une entrée de dimension que consomment le bloc d’attention ou le bloc feed-forward.
- Écriture () : transformer la sortie de ce bloc en mises à jour pour les flux.
- Mélange () : appliquer une carte résiduelle de taille avant d’ajouter la mise à jour issue du bloc.
Ces cartes peuvent être des paramètres statiques ainsi que des termes dépendants des entrées. La carte résiduelle constitue l’élément critique pour la stabilité, car elle est multipliée à plusieurs reprises au fil de la profondeur.
Ce que rapporte la publication sur les HC
Le papier de HC indique une convergence 1,8 fois plus rapide pour sa configuration OLMoE-1B-7B DHC×4 par rapport à sa version de référence, ainsi que des gains supplémentaires lors du traitement de 500 milliards de tokens. Il s’agit d’une seule configuration évaluée, et non d’un multiplicateur de vitesse général applicable aux quatre flux.
Le problème de l’échelle
Le papier sur le mHC met en évidence une instabilité lors de l’extension du modèle HC non contraint vers sa configuration de 27 milliards de paramètres. La section suivante décrit le mécanisme qu’il identifie.
Pourquoi un HC non contraint peut devenir instable
La flexibilité qui permet au HC de fonctionner est également ce qui le rend instable. Elle détruit la correspondance d’identité qui permet, en premier lieu, d’entraîner les résidus.
Le problème de la carte composite
Dans les résidus standards :
Lorsque , on obtient l’identité : . Le signal passe à travers sans modification.
Dans Hyper-Connections, le chemin résiduel comprend une multiplication matricielle :
Au-delà de L couches, le signal devient :
Le comportement dépend de la matrice composite, et non du fait que les éléments individuels se situent au-dessus ou en dessous de 1. Lorsque des cartes successives présentent des gains opérateurs supérieurs à un dans une direction alignée, les signaux peuvent se renforcer ; des gains inférieurs à un peuvent les atténuer. Les éléments négatifs peuvent également provoquer une annulation.
L’article sur le mHC mesure cette valeur à l’aide de la Amax Gain Magnitude : c’est la somme absolue maximale des éléments d’une ligne lors de la propagation avant, et la somme des éléments d’une colonne lors de la propagation arrière, dans une carte résiduelle composite. Dans son expérience avec 27 milliards de couches HC, ce pic atteint environ 3 000, ce qui coïncide avec un comportement d’entraînement instable.
L’objectif de conception est donc plus restreint que d’exiger que chaque carte soit l’identité : il s’agit de permettre le mélange entre les flux tout en limitant l’amplification au sein des compositions.
La contrainte mHC
mHC maintient le routage entre flux tout en contrainquant chaque matrice de mélange résiduelle au polytope de Birkhoff, c’est‑à‑dire l’ensemble des matrices doublement stochastiques. Ses éléments sont non négatifs, et la somme de chaque ligne ainsi que de chaque colonne vaut un. Cette contrainte fait de chaque flux de sortie une combinaison convexe des flux d’entrée et limite la norme spectrale de la carte résiduelle à une unité.
Ce que garantit la double stochastique
Le mHC contraint la matrice de mélange H^res à être doublément stochastique : toutes ses entrées sont non négatives, et la somme de chaque ligne ainsi que de chaque colonne est égale à 1. Cela impose simultanément trois propriétés :
| Contrainte | Conséquence | |
|---|---|---|
| Non-négativité | Toutes les entrées sont égales à au moins zéro. | Chaque sortie représente une combinaison convexe, sans annulation de signe. |
| Somme des valeurs de la ligne = 1 | Chaque ligne a une somme égale à un. | Un signal constant à travers les flux reste inchangé. |
| Somme des colonnes = 1 | Chaque colonne vaut un. | La moyenne globale sur l’ensemble des flux est conservée. |
Il ne s’agit pas d’une conservation de l’énergie euclidienne au sens littéral. Une carte doublement stochastique peut lisser les différences entre les flux. Ce qu’elle offre, c’est une conservation de la moyenne associée à un routage non expansif, dans le cadre de la contrainte de norme indiquée.
Cette contrainte présente également des conséquences mathématiques intéressantes :
- Norme spectrale ≤ 1 : la carte de routage résiduelle ne peut pas amplifier la norme euclidienne.
- Clôture sous multiplication : le produit de matrices doublement stochastiques reste doublement stochastique, ce qui garantit que la contrainte persiste lors de la composition à travers les différentes couches.
- Mélange convexe : d’après le théorème de Birkhoff-von Neumann, cette carte appartient au hull convexe des matrices de permutation.
Projection de Sinkhorn-Knopp
Les logits résiduels apprenables ne sont soumis à aucune contrainte. mHC les exponentie d’abord afin d’obtenir une matrice positive, puis effectue successivement une normalisation des lignes et des colonnes. Avec un nombre suffisant d’itérations, ce processus de Sinkhorn-Knopp converge vers une matrice doublement stochastique ; l’article retient 20 itérations comme projection approximative et différentiable.
Pour les logits bruts , la procédure est :
S = exp(A)
repeat 20 times:
S = S / row_sum(S)
S = S / column_sum(S)
return S
Ces opérations sont dérivables, mais elles ne sont pas gratuites. mHC s’appuie sur un noyau avant fusionné ainsi que sur un noyau arrière personnalisé qui récalcule les états de normalisation intermédiaires directement sur la puce.
Détails de paramétrisation
- Carte résiduelle : l’exponentiation associée à une normalisation Sinkhorn permet d’obtenir la structure , qui est approximativement doublement stochastique.
- Cartes de lecture et d’écriture : la paramétrisation sigmoïde garantit que et restent non négatifs, ce qui limite les effets d’annulation dus à des coefficients de signes opposés.
Architecture complète du mHC
En résumé :
Le flux à travers chaque bloc :
- Entrée : flux résiduels parallèles alimentent la couche.
- Lecture () : les flux sont combinés pour former l’entrée consommée par la fonction de la couche. Une fonction sigmoïde garantit que les coefficients soient non négatifs.
- Calcul : le bloc standard du Transformer (Attention ou MLP) traite ce vecteur agrégé unique.
- Écriture () : la sortie du bloc est transformée en mises à jour pour les flux, toujours avec des coefficients non négatifs.
- Mélange () : la carte résiduelle approximativement doublement stochastique mélange les flux entrants avant l’ajout de la mise à jour.
- Sortie : la matrice de flux mise à jour est transmise à la couche suivante.
Seule la carte de mélange résiduelle utilise la projection de Sinkhorn. Les cartes de lecture et d’écriture emploient des paramétrisations non négatives. Cette distinction est importante, car la garantie de composition énoncée dans l’article s’applique à .
Infrastructure requise pour l’overhead signalé
Quatre flux augmentent les accès à la mémoire d’état résiduel, le stockage des activations, ainsi que la communication pipeline. Le résultat en termes de délai de 6,7 % présenté dans l’article dépend de l’implémentation conçue en parallèle décrite ci-dessous.
Fusion de noyau
L’implémentation fusionne les opérations qui partagent un accès mémoire, utilise une précision mixte lorsque c’est approprié, et implémente la plupart des noyaux personnalisés avec TileLang. La boucle Sinkhorn ainsi que sa passe arrière personnalisée s’exécutent à l’intérieur de noyaux dédiés, afin de réduire la fréquence d’accès à la mémoire et les coûts liés au démarrage des opérations.
Recomputation sélective
Stocker chaque état intermédiaire de Sinkhorn pour la rétropropagation entraînerait une explosion de la mémoire. À la place, mHC :
- Libère les activations intermédiaires après le passage en avant.
- Les recalcule dynamiquement pendant le passage en arrière.
Une extension DualPipe Le planning superpose des parties de la communication, du recomputage et des tâches de couche aux frontières pipeline. L’overlap obtenu est spécifique à ce système d’entraînement.
Résultat système rapporté
Dans le cadre de l’implémentation à grande échelle présentée dans cet article, un taux d’expansion entraîne une augmentation de 6,7 % du temps de formation par rapport à la version de référence. Il s’agit d’un effet systémique, et non de la surcharge liée à une simple mise en œuvre framework.
Ce que démontrent les expériences
Dans la comparaison des modèles de 27 milliards de paramètres, le HC non contraint atteint un pic de gain composite Amax proche de 3 000. Grâce à une projection approximative de Sinkhorn en 20 étapes, le gain rétroactif composite du mHC s’écarte de la valeur 1, mais reste limité à environ 1,6 selon l’analyse présentée.
Les auteurs entraînent également des variantes inspirées de DeepSeek-V3 avec 3 B, 9 B et 27 B de paramètres, à savoir MoE. Avec 27 B de paramètres, la méthode mHC surpasse la base résiduelle standard sur les huit tâches benchmarks présentées, et devance également HC sur six d’entre elles ; en revanche, HC obtient de légèrement meilleurs résultats sur GSM8K et MATH. Il s’agit d’expériences d’entraînement préalable menées en interne par l’équipe qui a proposé cette approche, ce qui signifie que des reproductions indépendantes ainsi que des comparaisons avec d’autres architectures restent possibles.
Compromis et questions en suspens
mHC ne constitue pas une solution universelle applicable à tous les modèles. Quatre questions restent en suspens :
- Surcoût système : 6,7 % correspond au résultat obtenu avec l’optimisation ; d’autres facteurs tels que runtime, la topologie du dispositif ou la forme du modèle peuvent entraîner des coûts différents.
- Complexité de mise en œuvre : une implémentation de référence permet de représenter la méthode, mais pour atteindre le débit annoncé, il est nécessaire d’utiliser des noyaux personnalisés, de réaliser de nouvelles calculs et de modifier le plan de traitement.
- Biais de mélange : la double stochastique conserve la moyenne inter-flux et empêche l’expansion à travers , mais elle peut atténuer les différences entre les flux. La mise à jour par bloc modifie néanmoins la représentation globale.
- Portée des preuves : la preuve la plus solide provient du préentraînement de modèles de langage sur des architectures inspirées de DeepSeek-V3, c’est-à-dire des MoE. Une généralisation à d’autres familles de modèles n’a pas encore été démontrée dans cette étude.
Principaux enseignements
- Les connexions résiduelles fonctionnent grâce à la mise en correspondance d’identité : capacité de faire passer les signaux sans les modifier.
- Les hyper‑connexions augmentent la largeur plutôt que la profondeur, permettant une convergence plus rapide grâce au routage multi‑flux.
- Les HC non contraintes peuvent perdre la propriété de conservation des résidus lorsque les cartes résiduelles sont composées sur plusieurs niveaux de profondeur.
- Le mHC restreint le mélange des résidus au polytope de Birkhoff, préservant la moyenne inter‑flux et limitant l’amplification.
- La méthode Sinkhorn‑Knopp rend cette contrainte différentiable, ce qui permet un entraînement bout en bout.
- L’augmentation de charge de 6,7 % rapportée est le résultat d’une optimisation globale du système, et non uniquement d’une caractéristique de l’architecture.
mHC représente une approche prometteuse pour étudier une topologie résiduelle plus large tout en maintenant le plan résiduel répété dans de bonnes conditions. Le fait qu’elle soit utile pour un autre modèle dépend de gains de qualité indépendants ainsi que du coût lié à la reconstitution de sa pile de systèmes.
Références
- mHC : Hyper‑connexions contraintes par le manifond - Xie et al. (DeepSeek) Apprentissage résiduel profond pour la reconnaissance d’images - He et al. (ResNet)
- Hyper‑Connexions - Article original publié dans HC TileLang - CUDA optimisation du noyau framework
- DualPipe - Pipeline planificateur de parallélisme pour DeepSeek-V3
- ResiDual - Architecture à deux chemins de résidus