Ускорение ускоренного использования резких параллелизмов в области сбора данных с учетом опыта, полученного на основе федеральной системы обучения
arXiv: 2609.20359v1 Annuale Type: кросс-бюллетень: Симбиотическое масштабирование моделей искусственного интеллекта и высокоэффективных компьютерных систем постоянно создает алгоритмические проблемы в их сближении. В качестве важнейшего примера можно привести базовые модели (ФМ), требующие многомесячной подготовки по тысячам передовых ГПС. Острый параллелизм данных (DP) является доминирующей стратегией ускорения таких расчетов путем деления данных и моделей на несколько ГПС. Вместе с тем, когда она применяется в широких масштабах, особенно на многоуровневых соединениях с неоднородными характеристиками, то ее использование сопряжено с непомерно высокими расходами на связь. Вдохновляемая эффективными принципами коммуникации в рамках федеративного обучения (ФЛ) эта работа предусматривает два гибридных алгоритма - FL+FSDP и FL + HSPD, - которые переплетают DP с агрегированными данными по модели FedAvg. Подобные подходы позволяют разбить крупные программы DP на более мелкие, не связанные друг с другом федеративные группы, что требует минимального межгруппового движения при сохранении глобального размера партии, ограниченной g