[!NOTE] Автоматический перевод Эта статья была автоматически переведена с оригинальной английской версии.

Гиперсоединения с ограничениями манифольда (mHC): объяснение метода глубокой шкалировки остатков в DeepSeek

Современное глубокое обучение основано на концепции остаточных связей. Технологии Hyper-Connections (HC) открывают новый архитектурный подход: они преобразуют остаточное состояние в несколько взаимодействующих потоков. DeepSeek’s Гиперсоединения с ограничениями манифольда (mHC) В данной статье рассматриваются методы обеспечения стабильности роутинг при работе с более крупными масштабами обучения.

Эта статья начинается с описания стандартных остаточных соединений, затем рассматриваются гипер-соединения и проблема нестабильности, которую они вызывают. Такая последовательность позволяет легче понять окончательное ограничение mHC и способы его реализации.

Кратко: HC заменяет одно остаточное состояние на несколько потоков, а также предоставляет обучаемые карты для считывания, записи и смешивания данных. Эти неограниченные по своим возможностям карты позволяют усиливать или ослаблять сигналы при их комбинировании между слоями. Метод mHC приблизительно проецирует карту смешивания остатков на политоп Биркгофа с использованием 20 итераций алгоритма Sinkhorn-Knopp. В статье представлены результаты стабильных экспериментов с моделями размером 3B, 9B и 27B претрейнинг; кроме того, благодаря разработке специальных ядер и механизмов планирования требуется на 6,7% больше времени на обучение при использовании четырех потоков.


Почему работают остаточные связи

Прежде чем рассматривать, как именно mHC решает поставленные задачи, необходимо понять, на чём он основан.

Проблема глубины

Добавление слоев позволяет увеличить пропускную способность, однако это также затрудняет процесс оптимизации и распространение сигнала. В зависимости от способа инициализации, нормализации и архитектуры градиенты в направлении движения данных активации или в обратном направлении могут уменьшаться, увеличиваться или становиться слабо определёнными по мере углубления в структуру сети.

Решение с остаточными составляющими

Этот Статья о ResNet было предложено изящное решение. Вместо изучения прямого соответствия модель изучает _остаток — разницу от идентичности функции:

Стандартное соединение остаточных значений

Полезной свойством является шорткат идентичности. Когда остаточная функция F(x)F(x) принимает значение ноль, слой действует как простой проводник сигнала. Из этого следуют два последствия:

  1. Прямой член градиента: при обратном распространении ошибки учитывается путь через элемент идентичности.
  2. Простая альтернативная маппинг-стратегия: ветвь с остатком может оставаться близкой к нулю, когда слою не требуется существенно изменять свое состояние.

Это не устраняет все задачи оптимизации, однако позволяет применять сети значительно более сложной структуры на практике.


Как нормализация по слоям влияет на путь остатков

Transformer-архитектура потребовала внесения изменений в структуру модели: необходимо было определить место размещения операции нормализации слоя (Layer Normalization, LN). На первый взгляд это кажется незначительной деталью, однако на самом деле такое решение имеет серьёзные последствия.

Компромиссы между подходами после и до применения LN

ВариантРазмещение LNПреимуществоКлючевое ограничение
Пост-LNПосле остаточного блокаЗначительный вклад в глубину моделиПри глубокой оптимизации может возникнуть дополнительная сложность.
Pre-LNПеред блоком остаточных данныхБолее прямой остаточный путьПредставления смежных слоев могут становиться всё более похожими друг на друга.

Этот ResiDual Архитектура объединяет остаточные пути типа Pre-LN и Post-LN. Метод HC выбирает иной подход, расширяя остаточное состояние до нескольких потоков.


Гипер-соединения добавляют параллельные потоки остаточных данных

Гиперсоединения (HC) принимает иной подход: увеличивает ширину остаточного потока вместо того, чтобы добавлять глубину.

Архитектура гиперсоединений

Что такое поток

В стандартном Transformer каждый токен обладает состоянием размером dd, которое передаётся между блоками сети. Механизм HC воспроизводит исходное состояние nn раз, в результате чего формируется скрытая матрица размером n×dn \times d.

В концепции Hyper-Connections стрим представляет собой одну из nn параллельных инстанций данного состояния.

Как мы их получаем? В начале работы сети первоначальный вход эмбеддинг копируется nn раз (где nn — это «коэффициент расширения», обычно равный 4). Стандартное dd-мерное скрытое состояние преобразуется в «гиперскрытую матрицу» размером n×dn \times d.

Копии начинаются одинаково, но затем различаются в результате того, что обученные карты считывают данные из потоков, записывают в них и смешивают их содержимое. В статье эти копии рассматриваются как различные паттерны связей на разных уровнях глубины; при этом не требуется, чтобы каждый поток имел фиксированную, читаемую человеком роль.

Основные механизмы

Вместо одного остаточного пути HC поддерживает nn параллельных потоков, проходящих через всю сеть. В каждом блоке трансформера выполняются три операции, каждая из которых управляется небольшими обучаемыми веса:

  1. Чтение (Hpre\mathcal{H}^{pre}): агрегация nn потоков в dd-мерный вход, который обрабатывается аттеншн или блоком прямой передачи.
  2. Запись (Hpost\mathcal{H}^{post}): преобразование выхода данного блока обратно в обновления для nn потоков.
  3. Смешивание (Hres\mathcal{H}^{res}): применение матрицы остатков размером n×nn \times n перед добавлением обновления блока.

Эти карты могут представлять собой статические параметры в сочетании с членами, зависящими от входных данных. Карта остатков является ключевой для обеспечения стабильности, поскольку она неоднократно умножается на протяжении всей глубины.

Что описывается в статье HC

Производительность HC

В статье по теме HC описывается в 1,8 раза более быстрая конвергенция для конфигурации OLMoE-1B-7B DHC×4 по сравнению с базовой версией, а также дополнительные преимущества на уровне 500 миллиардов нейронов токены. Речь идет именно об одной опробованной конфигурации, а не об общем коэффициенте ускорения для работы четырех потоков данных.

Проблема масштабирования

В статье о механизме MHC описывается нестабильность, возникающая при масштабировании неограниченной версии архитектуры HC до её варианта с 27 миллиардами нейронов. В следующем разделе рассматривается механизм, выявленный авторами исследования.


Почему неограниченный HC может стать нестабильным

Именно гибкость, обеспечивающая работу метода HC, является причиной его нестабильности. Она нарушает сопоставление идентитетов, без которого остаточные ошибки вообще не могли бы подвергаться обучению.

Проблема нестабильности HC

Проблема композитных карт

В стандартных остатках:

xl+1=xl+F(xl)x_{l+1} = x_l + F(x_l)

Когда F(x)0F(x) \rightarrow 0, выполняется тождество: xl+1=xlx_{l+1} = x_l. Сигнал проходит через него без изменений.

В модели Hyper-Connections остаточный путь включает операцию умножения матриц:

xl+1=Hlresxl+x_{l+1} = \mathbf{H}^{res}_l \cdot x_l + \dots

После прохождения через L слоёв сигнал принимает следующий вид:

xL=HLres×HL1res××H1res×x0x_L = \mathbf{H}^{res}_L \times \mathbf{H}^{res}_{L-1} \times \dots \times \mathbf{H}^{res}_1 \times x_0

Поведение системы определяется композитной матрицей, а не тем, находятся ли отдельные элементы выше или ниже значения 1. Если последовательные преобразования содержат коэффициенты усиления, превышающие единицу в согласованном направлении, сигналы могут усиливаться; коэффициенты, меньшие единицы, способны их ослаблять. Отрицательные значения также могут приводить к эффекту компенсации.

В статье по mHC этот показатель измеряется с помощью Amax Gain Magnitude — максимальной абсолютной суммы по строкам при прямом распространении сигнала и суммы по столбцам при обратном распространении в составленной карте остатков. В эксперименте с сетью размером 27B HC этот пик достигает значения 3,000, что совпадает с проявлением нестабильного поведения при обучении.

Коренная причина: потеря идентичности

Следовательно, цель проектирования ограниченнее, чем принудительное сделание каждой карты идентичной: речь идет о возможности смешивания данных между потоками при одновременном контроле уровня усиления в рамках составных структур.


Ограничение, связанное с mHC

механизм mHC сохраняет межстримовую связь роутинг, однако ограничивает каждую матрицу остаточной смешивающей процедуры политопом Биркхоффа — множеством двойственно стохастических матриц. Эти матрицы имеют ненегативные элементы, причём сумма элементов в каждой строке и каждом столбце равна единице. Благодаря этому ограничению каждый выходной поток представляет собой конвексную комбинацию входных потоков, а спектральный норма функции отображения остатков ограничивается значением единицы.

Решение mHC

Что гарантирует двойная стохастичность

mHC ограничивает матрицу смешивания H^res таким образом, что она является двойственно стохастической: все её элементы неотрицательны, а сумма элементов в каждой строке и столбце равна ровно 1. Это одновременно обеспечивает соблюдение трёх свойств:

ОграничениеПравилоПоследствие
НенегативностьВсе значения по меньшей мере равны нулю.Каждый результат представляет собой выпуклую комбинацию без эффекта аннулирования знаков.
Сумма по строке = 1Сумма значений в каждой строке равна единице.Постоянный сигнал во всех потоках остаётся неизменным.
Сумма столбцов = 1Сумма значений в каждой колонке равна единице.Глобальное среднее по всем потокам сохраняется.

Речь не идет о буквальном соблюдении закона сохранения евклидовой энергии. Двойственно стохастическая карта способна сглаживать различия между потоками. В рамках заданного предела нормы она обеспечивает сохранение среднего значения плюс свойство ненеэкспандентности роутинг.

Это ограничение также имеет полезные математические последствия:

  1. Норма спектра ≤ 1: остаточная маппинг роутинг не может увеличивать евклидову норму.
  2. Замыкание по умножению: произведение двойственно стохастических матриц остается двойственно стохастическим, поэтому данное ограничение сохраняется при комбинировании операций на разных глубинах.
  3. Конвексное смешивание: согласно теореме Биркгофа — фон Неймана, эта маппинг находится в конвексном щите перестановочных матриц.

Проекция Синкхорна–Кноппа

Логиты остаточных значений, подлежащие обучению, не имеют никаких ограничений. Алгоритм mHC сначала экспоненцирует их для получения положительной матрицы, затем последовательно применяет нормализацию к строкам и столбцам. При достаточном количестве итераций данный процесс Sinkhorn-Knopp приближается к двойственно стохастической матрице; в данной работе в качестве приблизительного метода дифференцируемой проекции используется 20 итераций.

Подробное описание алгоритма Синкхорна

Для сырых логитов AA процедура выглядит следующим образом:

S = exp(A)
repeat 20 times:
    S = S / row_sum(S)
    S = S / column_sum(S)
return S

Эти операции дифференцируемы, однако они не являются бесплатными. mHC опирается на объединённый фронтальный ядро и специальное заднее ядро, которые пересчитывают промежуточные состояния нормализации непосредственно на чипе.

Подробности параметризации


Полная архитектура mHC

В целом:

mHC Complete архитектура

Поток данных через каждый блок:

  1. Входные данные: в слой поступают nn параллельных остаточных потоков.
  2. Чтение (Hpre\mathcal{H}^{pre}): эти nn потоков объединяются в единый вектор, который затем используется функцией слоя. Для обеспечения ненегативности коэффициентов применяется функция сигмоида.
  3. Вычисления: стандартный блок Transformer (Аттеншн или MLP) обрабатывает этот единый агрегированный вектор.
  4. Запись (Hpost\mathcal{H}^{post}): выходной результат блока преобразуется в обновления для nn потоков, при этом коэффициенты снова остаются ненегативными.
  5. Смешивание (Hres\mathcal{H}^{res}): примерно двусторонне стохастическая карта остатков смешивает поступающие потоки перед добавлением обновлений.
  6. Выход: матрица обновлённых потоков передаётся на следующий слой.

Только карта остаточной смешивающей функции использует проекцию Синкхорна. Карты чтения и записи основаны на ненегативных параметризациях. Это различие имеет важное значение, поскольку гарантия составления, изложенная в статье, применима к пространству Hres\mathcal{H}^{res}.


Инфраструктура, необходимая для устранения отмеченных накладных расходов

Четыре потока увеличивают нагрузку на память с остаточным состоянием, объём хранения активация, а также интенсивность коммуникации пайплайн. Результаты тестов по времени выполнения, указанные в статье (6,7%), зависят от специально разработанной реализации, описанной ниже.

Фьюжн ядра

Эта реализация объединяет операции, требующие совместного доступа к памяти, применяет смешную точность там, где это целесообразно, и реализует большинство пользовательских ядер с TileLang. Цикл Sinkhorn и его специализированный обратный проход выполняются внутри отдельных ядер с целью снижения нагрузки на память и времени запуска.

Селективная пересчётность

Хранение всех промежуточных состояний Sinkhorn для целей обратного распространения ошибки приведёт к критическому увеличению объёма памяти. Вместо этого механизм mHC:

расширенная DualPipe График планирует перекрытие частей процессов передачи данных, повторных вычислений и работы слоев на границах пайплайн. Достигаемое уровень перекрытия характерен исключительно для данной системы обучения.

Результат работы системы

В рамках крупномасштабной конфигурации, используемой в данной статье, значение коэффициента расширения n=4n=4 приводит к увеличению времени обучения на 6,7% по сравнению с базовой версией. Речь идет о результатах работы всей системы, а не о дополнительных затратах, связанных с простой реализацией фреймворк.


Что устанавливают эксперименты

В ходе сравнения с моделью объёмом 27 млрд параметров неограниченная версия алгоритма HC достигает пика композитного коэффициента усиления Amax примерно на уровне 3 000. При использовании 20-шаговой приближённой проекции метода Sinkhorn композитный обратный коэффициент усиления модели mHC отклоняется от значения 1, но в представленном анализе остаётся в пределах примерно 1,6.

Авторы также тренируют варианты MoE, вдохновлённые моделью DeepSeek-V3, с размером параметров 3 млрд, 9 млрд и 27 млрд. При объёме 27 млрд параметров архитектура mHC превосходит стандартную базовую модель с использованием остаточных связей по всем восьми описанным задачам типа бенчмарки, а также обгоняет архитектуру HC в шести из восьми случаев; при этом HC показывает незначительно лучшие результаты на тестах GSM8K и MATH. Речь идёт о внутренних экспериментах претрейнинг, проведённых самой командой, разработавшей модель, поэтому возможность независимого воспроизведения результатов и сравнения с другими архитектурами пока остаётся открытой.


Компромиссы и нерешённые вопросы

mHC не является универсальным решением для всех модель. Остаются четыре вопроса:

  1. Накладные расходы системы: значение 6,7% соответствует результатам оптимизированной модели; при других вариантах рантайм, таких как топология устройства или форма модель, эти затраты могут существенно отличаться.
  2. Сложность реализации: базовая реализация позволяет реализовать данный метод, однако для достижения уровня, описанного в исследовании для throughput, требуются специальные ядра, повторные вычисления и изменения графика выполнения.
  3. Эффект смешивания: использование двойной стохастичности сохраняет среднее значение между потоками и препятствует их расширению через пространство Hres\mathcal{H}^{res}, но при этом может сглаживать различия между ними. Тем не менее обновление блоков всё равно влияет на общую структуру представления данных.
  4. Область применимости доказательств: наиболее убедительные доказательства получены на основе анализа языковых модель претрейнинг в архитектурах типа MoE, вдохновлённых DeepSeek-V3. Возможность переноса полученных результатов на другие семейства модель в данной работе пока не подтверждена.

Основные выводы

  1. Резидуальные соединения функционируют благодаря отображению идентичности: возможности передавать сигналы без каких-либо изменений.
  2. Гипер-соединения масштабируют ширину вместо глубины, что позволяет достигать более быстрой конвергенции за счёт использования нескольких потоков роутинг.
  3. Неконтролируемые гипер-соединения могут нарушать свойство сохранения резидуалов, когда отображения резидуалов комбинируются на разных уровнях глубины.
  4. mHC ограничивает смешивание резидуалов внутри Биркгоффова политопа, тем самым сохраняя среднее значение между потоками и контролируя амплификацию сигнала.
  5. Метод Sinkhorn-Knopp делает это ограничение дифференцируемым, что обеспечивает возможность тренировки модели «от конца до конца».
  6. Указанный показатель накладных расходов в 6,7% является результатом работы всей системы, а не только её архитектуры.

mHC представляет собой перспективный инструмент для изучения более обширной структуры остаточной топологии при одновременном сохранении хорошей условности повторяющихся карт остатков. Того, стоит ли применять его для реализации другого модель, будет определять отдельное улучшение качества результатов и затраты на создание соответствующей системной архитектуры.


Список литературы