[!NOTE] Automatische Übersetzung Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Mannigfaltigkeitsbeschränkte Hyper-Verbindungen (mHC): Erklärung zur Residuenskalierung bei DeepSeek
Der moderne tiefere Lernen beruht auf der Residualverbindung. Hyper-Verbindungen (HC) erschließen eine weitere architektonische Dimension: Sie erweitern den Residualzustand in mehrere miteinander interagierende Ströme. DeepSeek’s Manifolds-begrenzte Hyper-Verbindungen (mHC) Die Veröffentlichung untersucht Methoden, wie Routing bei größeren Trainingsmengen stabil gehalten werden kann.
Dieser Artikel beginnt mit herkömmlichen Residualverbindungen und führt anschließend Hyper-Verbindungen sowie die dadurch entstehende Instabilität ein. Diese Abfolge erleichtert das Verständnis der endgültigen mHC-Beschränkung und ihrer Umsetzung.
TL;DR: HC ersetzt einen residualen Zustand durch mehrere Ströme sowie lernbare Lesen-, Schreiben- und Mischkarten. Diese unbeschränkten Karten können Signale bei ihrer Kombination über verschiedene Schichten verstärken oder abschwächen. mHC projiziert die residuale Mischkarte in etwa auf das Birkhoff-Polytope mittels 20 Sinkhorn-Knopp-Iterationen. In der Veröffentlichung werden stabile Experimente mit Modellen der Größenordnung 3B, 9B und 27B Pretraining vorgestellt; außerdem wird ein zusätzlicher Trainingszeitbedarf von 6,7 % für vier Ströme nach angepasster Kernel-Methodik sowie Optimierung der Scheduling-Strategie berichtet.
Warum Residualverbindungen funktionieren
Bevor wir uns mit den Korrekturen durch den mHC beschäftigen, müssen wir zunächst verstehen, worauf er aufbaut.
Das Tiefe-Problem
Durch das Hinzufügen von Schichten kann die Kapazität erhöht werden, doch es erschwert zugleich die Optimierung sowie die Signalverbreitung. Abhängig von der Initialisierung, Normalisierung und Architektur können die vorwärtsen Activations oder rückwärtsen Gradienten im Laufe der Tiefe schrumpfen, ansteigen oder eine schlechte Konditionierung aufweisen.
Die Restlösung
Der Das ResNet-Paper Es wurde eine elegante Lösung eingeführt. Anstelle eines direkten Zuordnungsmodells wird das Residuum erlernt – also der Unterschied zur Identitätsfunktion:
Die nützliche Eigenschaft ist der Identity Shortcut. Wenn die Restfunktion den Wert Null ausgibt, fungiert die Schicht als Durchlassschicht. Daraus ergeben sich zwei Folgen:
- Ein direkter Gradiententerm: Die Backpropagation beinhaltet einen Pfad über die Identitätskomponente.
- Eine einfache Fallback-Konvertierung: Der Residuenzweig kann nahe bei Null bleiben, wenn eine Schicht den Zustand nur geringfügig ändern muss.
Dies beseitigt zwar nicht alle Optimierungsprobleme, ermöglicht aber den Einsatz deutlich komplexerer Netzwerke.
Wie die Schichtnormalisierung den Residualpfad verändert
Transformer-Modelle führten eine neue Variable ein: den Ort für die Layer Normalisierung (LN). Die Entscheidung scheint unbedeutend zu sein – ist sie aber nicht.
| Variante | LN-Platzierung | Vorteil | Hauptbeschränkung |
|---|---|---|---|
| Post-LN | Nach dem Residualblock | Erheblicher Beitrag zur Tiefe | Es kann schwieriger sein, die Optimierung in tieferen Schichten durchzuführen. |
| Vor-LN | Vor dem Residualblock | Direkterer Residuenpfad | Die Repräsentationen benachbarter Schichten können zunehmend ähnlicher werden. |
Der ResiDual Die Architektur kombiniert die residualen Pfade vor und nach der Linearisierung. Der HC verfolgt einen anderen Ansatz, indem er den residualen Zustand in mehrere Ströme aufteilt.
Hyper-Verbindungen erzeugen parallele Residuensströme
Hyper-Verbindungen (HV) wählt einen anderen Ansatz: Erweitert die Breite des Residualstroms anstelle der Hinzufügung von Tiefe.
Was ein Stream bedeutet
In einem herkömmlichen Transformer verfügt jeder Token über einen -dimensionalen Zustand, der durch die Blöcke weitergeleitet wird. HC vervielfacht den ursprünglichen Zustand Mal, wodurch eine -große versteckte Matrix entsteht.
In Hyper-Connections ist ein Stream eine der parallelen Instanzen dieses Zustands.
Wie erhalten wir sie? Am Anfang des Netzwerks wird die ursprüngliche Eingabe Embedding -mal repliziert (wobei die „Erweiterungsrate“ darstellt, in der Regel 4). Der herkömmliche -dimensionale versteckte Zustand wird dadurch zu einer - großen „Hyper-Versteckten-Matrix“.
Die Kopien beginnen identisch, weichen jedoch ab, da die gelernten Karten von den Strömen lesen, in sie schreiben und diese miteinander vermischen. Die Veröffentlichung interpretiert sie als mehrere Verbindungsmustern über verschiedene Ebenen hinweg; es ist nicht erforderlich, dass jeder Stream eine feste, für Menschen lesbare Rolle erhält.
Kernmechanismen
Anstelle eines einzigen Residuustracks hält HC parallele Ströme am Laufen, die durch das gesamte Netzwerk fließen. In jedem Transformer-Block werden drei Operationen ausgeführt, wobei jede von kleinen, lernbaren Weights gesteuert wird:
- Lesen (): Aggregieren der Ströme zu einem -dimensionalen Eingang, der vom Attention oder vom Feed-Forward-Block verarbeitet wird.
- Schreiben (): Umwandlung des Ausgangswerts dieses Blocks zurück in Aktualisierungen für die Ströme.
- Mischen (): Anwendung einer -Residualfunktion vor dem Hinzufügen der Blockaktualisierung.
Diese Karten können aus statischen Parametern sowie eingegebenungsabhängigen Termen bestehen. Die Residuenkarte stellt den für die Stabilität entscheidenden Bestandteil dar, da sie im Laufe der Tiefe wiederholt multipliziert wird.
Was der HC-Artikel berichtet
Der HC-Artikel berichtet von einer 1,8-fach schnelleren Konvergenz bei der Konfiguration OLMoE-1B-7B DHC×4 im Vergleich zur Baseline, ergänzt durch zusätzliche Vorteile bei Modellen mit 500 Milliarden Parametern Tokens. Es handelt sich dabei um eine einzige getestete Konfiguration und nicht um einen allgemeinen Geschwindigkeitsfaktor für vier Datenströme.
Das Skalierungsproblem
Der Artikel zu mHC weist auf Instabilitäten hin, die auftreten, wenn das unbeschränkt skalierte HC-Modell auf die 27B-Version übertragen wird. Im folgenden Abschnitt wird der von ihm identifizierte Mechanismus erläutert.
Warum unbeschränkte HC instabil werden kann
Die Flexibilität, die HC seine Leistungsfähigkeit verleiht, ist zugleich der Faktor, der es zerstört. Sie zerstört die Identitätsabbildung, die erst ermöglicht, dass Residuen trainiert werden können.
Das Problem der zusammengesetzten Karte
In den Standardresiduen:
Wenn gilt, handelt es sich um die Identitätsrelation: . Das Signal durchläuft den Filter unverändert.
In Hyper-Connections umfasst der Restpfad eine Matrixmultiplikation:
Über L Schichten hinweg wird das Signal zu:
Das Verhalten hängt von der zusammengesetzten Matrix ab und nicht davon, ob die einzelnen Elemente über oder unter 1 liegen. Wenn aufeinanderfolgende Transformationen in einer ausgerichteten Richtung Operatorverstärkungen größer als eins aufweisen, können die Signale ansteigen; Verstärkungen kleiner als eins können sie hingegen abschwächen. Negative Elemente können außerdem zu Auslöschungseffekten führen.
Der Artikel zu mHC misst diesen Wert anhand der Amax Gain Magnitude: der maximalen absoluten Zeilensumme bei der vorwärtsgerichteten Propagierung sowie der Spaltensumme bei der rückwärtsgerichteten Propagierung in einer zusammengesetzten Residuenkarte. Im Experiment mit dem 27B HC-Modell nähert sich dieser Wert einem Maximum von 3.000 an und steht in Zusammenhang mit instabilen Lernverhalten.
Das Gestaltungsziel ist daher enger gefasst als die Vorgabe, dass jede Karte die Identitätsfunktion darstellen muss: Es soll eine Mischung zwischen den verschiedenen Strömen ermöglicht werden, während gleichzeitig eine Begrenzung der Verstärkung innerhalb der Gesamtkompositionen gewährleistet wird.
Die mHC-Beschränkung
mHC bewahrt die Inter-Stream-Beziehungen Routing bei, indem er jede verbleibende Mischmatrix auf den Birkhoff-Polytop, also die Menge der doppelt stochastischen Matrizen, beschränkt. Die Einträge dieser Matrizen sind nichtnegativ, und sowohl die Zeilen- als auch die Spaltensummen betragen eins. Durch diese Beschränkung wird jeder Ausgabestrom zu einer konvexen Kombination der Eingabestrome, und außerdem wird der Spektralnorm des Residuum-Mappings auf einen Wert begrenzt.
Was durch doppelte Stochastizität gewährleistet wird
mHC beschränkt die Mischmatrix H^res darauf, doppelt stochastisch zu sein: alle Einträge sind nichtnegativ, und die Summe jeder Zeile sowie jeder Spalte beträgt genau 1. Dadurch werden gleichzeitig drei Eigenschaften gewährleistet:
| Einschränkung | Regel | Konsequenz |
|---|---|---|
| Nichtnegativität | Alle Einträge liegen mindestens bei null. | Jeder Ausgabewert ist eine konvexe Kombination, wobei es zu keiner Vorzeichenabschwächung kommt. |
| Summe der Zeile = 1 | Jede Zeile ergibt eins. | Ein konstanter Signalwert bleibt über alle Streams hinweg unverändert. |
| Summe der Spalte = 1 | Jede Spalte ergibt eins. | Der globale Mittelwert über alle Streams bleibt konstant. |
Es handelt sich dabei nicht um eine wörtliche Erhaltung der euklidischen Energie. Ein doppelt stochastischer Abbildungsmechanismus kann Unterschiede zwischen den Datenströmen glätten. Was er bietet, ist eine Erhaltung des Mittelwerts zusammen mit einer nicht-expansiven Routing-Eigenschaft innerhalb der angegebenen Normgrenze.
Diese Einschränkung hat ebenfalls nützliche mathematische Konsequenzen:
- Spektralnorm ≤ 1: Die Restmappe Routing kann die euklidische Norm nicht vergrößern.
- Abgeschlossen unter Multiplikation: Das Produkt zweifach stochastischer Matrizen bleibt zweifach stochastisch, wodurch die Beschränkung auch bei komplexeren Strukturen weiterhin gilt.
- Konvexe Mischung: Gemäß dem Satz von Birkhoff–von Neumann liegt die Mappe im konvexen Hülle der Permutationsmatrizen.
Sinkhorn-Knopp-Projektion
Die lernbaren Residuallogits unterliegen keiner Beschränkung. mHC exponentiert sie zunächst, um eine positive Matrix zu erzeugen, und wendet anschließend abwechselnd die Normierung von Zeilen und Spalten an. Bei ausreichend vielen Iterationen nähert sich dieser Sinkhorn-Knopp-Prozess einer doppelt stochastischen Matrix an; in der Veröffentlichung wird 20 Iterationen als annähernde, differenzierbare Projektion verwendet.
Für die rohen Logits verläuft das Verfahren wie folgt:
S = exp(A)
repeat 20 times:
S = S / row_sum(S)
S = S / column_sum(S)
return S
Die Operationen sind differenzierbar, erweisen sich jedoch als nicht kostenlos. mHC stützt sich auf einen zusammengeführten Vorwärts-Kernel- und einen benutzerdefinierten Rückwärts-Kernel-Prozess, der die dazwischenliegenden Normalisierungszustände direkt auf dem Chip neu berechnet.
Details zur Parametrisierung
- Residualkarte: Durch Exponentiation in Kombination mit der Sinkhorn-Normalisierung entsteht die annähernd zweifach stochastische Struktur .
- Lese- und Schreibkarten: Die Sigmoid-Parameterisierung sorgt dafür, dass und nichtnegativ bleiben, wodurch Kompensationen durch Koeffizienten mit gemischten Vorzeichen vermieden werden.
Vollständige mHC-Architektur
Insgesamt:
Der Datenfluss durch jeden Block:
- Eingang: parallele Residueströme fließen in diese Schicht ein.
- Lesevorgang (): Die Ströme werden zu einem einzigen Vektor zusammengeführt, der von der Schichtfunktion verarbeitet wird. Eine Sigmoid-Funktion sorgt dafür, dass die Koeffizienten nichtnegativ bleiben.
- Berechnung: Der herkömmliche Transformer-Block (Attention oder MLP) verarbeitet diesen aggregierten Vektor.
- Schreibvorgang (): Die Ausgabe des Blocks wird in Aktualisierungen für die Ströme umgewandelt, wobei erneut nur nichtnegative Koeffizienten verwendet werden.
- Mischen (): Die annähernd doppelt stochastische Residuumkarte mischt die eingehenden Ströme, bevor die Aktualisierung hinzugefügt wird.
- Ausgang: Die aktualisierte Strömungsmatrix gelangt an die nächste Schicht.
Nur die restliche Mischkarte verwendet die Sinkhorn-Projektion. Die Lesekarten und Schreibkarten setzen auf nicht-negative Parametrisierungen. Dieser Unterschied ist von Bedeutung, da die Zusammensetzungsgarantie des Artikels auf anwendbar ist.
Für die gemeldete Overhead erforderliche Infrastruktur
Vier Ströme erhöhen den Zugriff auf das Residual-State-Memory, die Activation-Speicherung sowie die Pipeline-Kommunikation. Das in der Veröffentlichung angegebene Timing-Ergebnis von 6,7 % hängt von der gemeinsam entworfenen Implementierung ab.
Kernel Fusion
Die Implementierung kombiniert Operationen, die gemeinsam auf Speicher zugreifen, verwendet bei Bedarf gemischte Präzisionen und implementiert die meisten benutzerdefinierten Kernels mit TileLang. Der Sinkhorn-Loop sowie seine benutzerdefinierte rückwärtsgerichtete Ausführung laufen innerhalb spezieller Kernels, um den Speicherdurchsatz und die Startkosten zu verringern.
Selektive Neuberechnung
Das Speichern aller Zwischenzustände des Sinkhorn-Algorithmus zur Durchführung der Rückpropagierung würde den Speicherbedarf stark erhöhen. Stattdessen nutzt mHC:
- Befreit den Zwischenergebniswert Activations nach dem Forward-Pass.
- Berechnet diese Werte dynamisch während des Backward-Passes erneut.
An erweitertes DualPipe Der Zeitplan legt Überschneidungen bei Teilen der Kommunikation, Neuberechnung sowie der Schichtarbeit an den Grenzen von Pipeline fest. Die erreichte Überschneidung ist spezifisch für dieses Schulungssystem.
Berichteter Systemergebnis
Im Rahmen der großskaligen Implementierung des Papers führt ein Erweiterungsgrad von zu einer Verlängerung der Trainingszeit um 6,7 % im Vergleich zur Baseline. Es handelt sich dabei um ein Systemergebnis und nicht um die Zusatzbelastung einer einfachen Framework-Implementierung.
Was die Experimente zeigen
Im Vergleich mit den Modellen mit 27 Milliarden Parametern erreicht der unbeschränkte HC einen Spitzenwert für den kombinierten Amax-Gewinn von etwa 3.000. Bei einer annähernden Sinkhorn-Projektion über 20 Schritte weicht der kombinierte rückwärtsgerichtete Gewinn des mHC von einem Wert von eins ab und bleibt in der vorgestellten Analyse auf etwa 1,6 begrenzt.
Die Autoren trainieren außerdem 3B-, 9B- und 27B-Versionen von DeepSeek-V3, die auf diesem Konzept basieren MoE. Bei der 27B-Variante übertrifft mHC die herkömmliche Residual-Baseline in allen acht berichteten downstream-Anwendungen Benchmarks und liegt in sechs dieser Anwendungen vor HC; HC weist hingegen leichte Vorteile bei den Aufgaben GSM8K und MATH auf. Es handelt sich dabei um interne Pretraining-Experimente des Entwicklerteams, weshalb unabhängige Wiederholungen sowie Vergleiche mit anderen Architekturen weiterhin möglich sind.
Kompromisse und offene Fragen
mHC stellt kein universelles Ersatzlösung für jeden Model dar. Es bleiben vier Fragen offen:
- Systemoverhead: 6,7 % sind das optimierte Ergebnis aus der Literatur; andere Faktoren wie die Runtime, die Topologie des Geräts oder die Model können zu unterschiedlichen Kosten führen.
- Implementierungskomplexität: Eine Referenzimplementierung kann die Methode darstellen, doch um die beschriebene Throughput zu erreichen, sind angepasste Kernels, erneute Berechnungen sowie Änderungen am Zeitplan erforderlich.
- Mischungsverzerrung: Die doppelte Stochastizität bewahrt den Durchschnitt über die verschiedenen Ströme bei und verhindert eine Ausdehnung über , kann jedoch Unterschiede zwischen den Strömen abmildern. Der Block-Update-Prozess ändert dennoch die Gesamtrepräsentation.
- Beweisumfang: Die stärksten Belege stammen von sprachbasierten Model Pretraining-Methoden in auf DeepSeek-V3 inspirierten MoE-Architekturen. Eine Verallgemeinerung auf andere Model-Familien ist in dieser Arbeit noch nicht nachgewiesen worden.
Wichtige Erkenntnisse
- Residualverbindungen funktionieren aufgrund der Identitätsabbildung: der Fähigkeit, Signale unverändert weiterzuleiten.
- Hyper-Verbindungen skalieren die Breite statt die Tiefe, wodurch durch mehrere Ströme eine schnellere Konvergenz erreicht wird Routing.
- Unbeschränkte Hyper-Verbindungen können die Eigenschaft der Residuenerhaltung verlieren, wenn Residuumabbildungen über verschiedene Ebenen zusammengesetzt werden.
- mHC beschränkt das Mischen der Residuen auf den Birkhoff-Polytop, wodurch der mittlere Wert zwischen den Strömen erhalten bleibt und eine Begrenzung der Verstärkung gewährleistet wird.
- Sinkhorn-Knopp macht diese Beschränkung differenzierbar, wodurch ein End-zu-End-Training möglich wird.
- Der gemeldete Zusatzaufwand von 6,7 % ist ein Ergebnis des gesamten Systems, nicht allein eine Eigenschaft der Architektur.
mHC stellt einen vielversprechenden Ansatz dar, um eine umfassendere Resttopologie zu untersuchen, ohne dass die wiederholten Restkarten stark verzerrt werden. Ob es sich lohnt, ihn für einen weiteren Model einzusetzen, hängt von unabhängigen Verbesserungen der Qualität sowie den Kosten zur Implementierung seines Systemstapels ab.
Referenzen
- mHC: Mannigfaltigkeitsbeschränkte Hyper-Verbindungen - Xie et al. (DeepSeek) Tiefe Residuale Lernen für Bilderkennung - He et al. (ResNet)
- Hyper-Verbindungen - Ursprünglicher HC-Artikel TileLang - CUDA Kernel Optimierung Framework DualPipe - Pipeline Parallelisierungs-Scheduler für DeepSeek-V3
- ResiDual - Architektur mit dualen Residualpfaden