[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 4. Тренировка трансформера

#Перевод #Масштабирование #ЦОДа #Глава #Тренировка
[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 4. Тренировка трансформера

Наконец-то мы добрались непосредственно до того, как тренировать трансформер, не просто тренировать, а делать это эффективно и масштабируемо. Как мы уже знаем из прошлых глав, трансформер штука тяжелая и на один ускоритель обычно не влезает, поэтому цель масштабирования состоит в том, чтобы распихать тренировку модели по нескольким ускорителям, и желательно при этом, чтобы производительность и пропускная способность такой системы росли пропорционально количеству ускорителей в ней. А этого добиться довольно сложно, просто потому что чем больше ускорителей в системе, тем сложнее и накладнее передавать данные между частями системы и все это дело синхронизировать. Как мы видели в одной из предыдущих глав про шардинг матричных операций , распределенное матричное умножение требует разных дополнительных операций вроде AllGather или ReduceScatter, которые занимают шину данных и тратят процессорное время. В общем наша задача не просто масштабировать систему, а еще и понять, когда остановиться ,

Наконец-то мы добрались непосредственно до того, как тренировать трансформер, и не просто тренировать, а делать это эффективно и масштабируемо.

Как мы уже знаем из прошлых глав, трансформер штука тяжелая и на один ускоритель обычно не влезает, поэтому цель масштабирования состоит в том, чтобы распихать тренировку модели по нескольким ускорителям, и желательно при этом, чтобы производительность и пропускная способность такой системы росли пропорционально количеству ускорителей в ней. А этого добиться довольно сложно, просто потому что чем больше ускорителей в системе, тем сложнее и накладнее передавать данные между частями системы и все это дело синхронизировать. Как мы видели в одной из предыдущих глав про шардинг матричных операций, распределенное матричное умножение требует разных дополнительных операций вроде AllGather или ReduceScatter, которые занимают шину данных и тратят процессорное время. В общем наша задача не просто масштабировать систему, а еще и понять, когда остановиться, потому что накладные расходы становятся совсем неподъемными.

В этой главе мы обсудим четыре вида параллелизма, их достоинства, недостатки и когда что можно применять и/или комбинировать. Для простоты будем считать, что работаем внутри одного вычислительного кластера и учитывать только соединения между ускорителями.

Теперь кратко перечислим условные обозначения

Похожие статьи

Новак поручил принять допмеры по топливообеспечению ряда регионов Life.ru
Life.ru

Новак поручил принять допмеры по топливообеспечению ряда регионов

Правительство России усиливает контроль за рынком топлива. Вице-премьер Александр Новак обязал нефтяные компании и ответственные ведомства наладить поставки горючего в регионы, где возникли перебои, с...

Life.ru
Строим RAG вручную: как это работает под капотом Хабр
Хабр

Строим RAG вручную: как это работает под капотом

Имея некоторый опыт в построении классических ML и CV-проектов, я решил разобраться в NLP (Natural Language Processing) и собрать свою RAG-систему без использования сторонних RAG-фреймворков (LangChai...

Хабр
TechCrunch
TechCrunch

Does Mark Zuckerberg really believe AI is ‘for everyone’?

Meta released Glimmer this week, an open-weight AI model anyone can download and run on their own hardware — a contrast to Muse Spark, the company’s more powerful model that stays locked behind its ow...

TechCrunch
LG построит человекоподобных роботов с мозгами Nvidia — дебют намечен на 2027 год 3DNews
3DNews

LG построит человекоподобных роботов с мозгами Nvidia — дебют намечен на 2027 год

LG объявила о крупном стратегическом партнёрстве с Nvidia, ориентированном на автоматизацию промышленности и передовую робототехнику. Две компании намерены ускорить трансформацию производства и его пе...

3DNews
Nvidia выпустит мощнейшую ИИ-модель Nemotron 4 с триллионом параметров Ferra.ru
Ferra.ru

Nvidia выпустит мощнейшую ИИ-модель Nemotron 4 с триллионом параметров

Nvidia разрабатывает семейство ИИ-моделей под названием Nemotron 4. По данным источников СМИ, самая крупная версия этой модели будет содержать не менее триллиона параметров. Это много.

Ferra.ru
Forbes Russia
Forbes Russia

Инвесторы обвинили Селену Гомес и ее мать в обмане из-за стартапа Wondermind

Инвесторы подали в суд на Селену Гомес и других основательниц Wondermind — стартапа в сфере психического здоровья. Они вложили в него $1,2 млн в 2022 году и настаивают на том, что их ввели в заблужден...

Forbes Russia