NVIDIA Developer Blog→ оригинал

NVIDIA описала неравномерный тензорный параллелизм для обучения LLM на GPU

NVIDIA рассказала в своём Developer Blog о технике неравномерного тензорного параллелизма для обучения больших языковых моделей на кластерах из тысяч GPU. Метод призван повысить goodput — долю полезной вычислительной работы — за счёт индивидуального подбора степени параллелизма для разных частей модели.

AI-обработка оригинала NVIDIA Developer Blog; редакция Hamidun News
NVIDIA описала неравномерный тензорный параллелизм для обучения LLM на GPU
Источник: NVIDIA Developer Blog. Коллаж: Hamidun News.
◐ Слушать статью

NVIDIA опубликовала в корпоративном Developer Blog материал о технике неравномерного тензорного параллелизма (nonuniform tensor parallelism) — подходе, призванном повысить goodput, то есть долю полезной вычислительной работы, при обучении больших языковых моделей на кластерах из тысяч GPU.

Что такое goodput при обучении LLM

Обучение современных больших языковых моделей всё чаще выполняется на кластерах из тысяч графических процессоров и растягивается на недели, а иногда и месяцы непрерывной работы. При такой продолжительности резко растёт цена сбоев: падение отдельного узла, зависание GPU-«отстающего» или необходимость перезапуска из чекпоинта отнимают часть общего вычислительного времени. Goodput — метрика, которая отражает не просто суммарную загрузку GPU, а долю реально полезной, продуктивной работы с поправкой на подобные потери. Среди типичных причин её снижения — сетевые заторы между узлами, неравномерная загрузка отдельных GPU и время, которое уходит на сохранение и восстановление промежуточных чекпоинтов после сбоя.

  • Материал опубликован в NVIDIA Developer Blog и посвящён именно повышению goodput в обучении LLM
  • Речь идёт об инфраструктуре, рассчитанной на задания, охватывающие тысячи GPU одновременно
  • Такие тренировочные запуски могут длиться продолжительное время без остановки
  • Предлагаемый метод называется nonuniform tensor parallelism — «неравномерный тензорный параллелизм»

Как работает неравномерный тензорный параллелизм

Тензорный параллелизм — один из базовых способов распределённого обучения: отдельные матричные операции внутри слоёв модели разбиваются на части и считаются одновременно на разных GPU, что позволяет обучать модели, которые физически не помещаются в память одной видеокарты. Классический подход применяет одинаковую степень разбиения ко всем слоям модели без разбора. Неравномерный вариант, о котором пишет NVIDIA, подбирает степень параллелизма индивидуально для разных частей модели — с учётом их вычислительной нагрузки и объёма данных, которыми нужно обмениваться между GPU.

Цель — сократить простои и накладные расходы на коммуникацию между устройствами, повышая итоговый goodput без покупки дополнительного оборудования. Подобные техники обычно реализуются в связке с библиотеками распределённого обучения вроде Megatron-LM и платформой NeMo, которые NVIDIA развивает специально для тренировки больших моделей на своих GPU.

Тензорный параллелизм — не единственный способ распределить обучение между GPU: наряду с ним применяют пайплайн-параллелизм, при котором разные слои модели закрепляются за разными GPU и обрабатываются конвейером, и параллелизм данных, при котором на каждом GPU хранится полная копия модели, а между устройствами делятся сами обучающие примеры. На практике крупные тренировочные кластеры комбинируют все три подхода одновременно, и то, насколько удачно подобрана эта комбинация для конкретной архитектуры модели, напрямую определяет итоговый goodput.

Почему это важно для инфраструктуры ИИ

Даже небольшой процент выигрыша в эффективности превращается в заметную экономию, когда счёт идёт на тысячи GPU и недели непрерывного обучения. Обучение по-настоящему крупной современной модели требует вычислительных мощностей стоимостью в десятки и сотни миллионов долларов, поэтому даже однопроцентный прирост goodput выливается в значимую экономию времени, электроэнергии и денег. NVIDIA как крупнейший поставщик ускорителей для ИИ регулярно публикует подобные инженерные разборы, чтобы клиенты — компании, обучающие собственные LLM на инфраструктуре NVIDIA, — могли выжимать больше эффективности из уже имеющихся кластеров, не наращивая парк оборудования.

Что это значит

По мере роста масштабов обучения больших языковых моделей всё больше решает не только количество и мощность чипов, но и системный software-инжиниринг — то, насколько эффективно распределённая инфраструктура использует уже купленные GPU.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…