Компьютерные науки > Распределенные, параллельные и кластерные вычисления [представлены 11 сентября 2026 года] Название: mKernel: Быстрый много-GPU, Multiode Fuildenk View PDF HTML (экспериментальное) резюме: Связь стала узким местом в распределенной подготовке кадров и выводах крупных моделей. Перекрытая связь с расчетами на основе гранулирования ядер в отдельных потоках снижает только часть этих расходов. Плохие ядра часто имеют более высокую эффективность, передавая каждый выходной картофель сразу же после его производства, однако существующие вмятины ядер во многом ограничиваются одним доменом NVLink. Мы представляем mKernel, библиотеку с несколькими ГПСП, многокодовые плавучие ядра, которые перекрывают вычисления, внутри-узловое сообщение NVLink и межнодомное РДМА в клеточной грануларии. mKernel разделяет потоковые мультипроцессоры (SM) стойкого ядра на функции расчета и связи, а контроллер внутри ГПУ называет раздел SM адаптивно во время работы, поскольку лучший раздел SМ варьируется от ядра и формы ввода. Он структурирует процесс перемещения данных в иерархическом порядке, с тем чтобы свести к минимуму передачу данных через межтоновую сеть. И наконец, она управляет сетью от GPU через слегка взвешенную команду и прокси-принимающую сеть, которая применяется непосредственно на глаголовых RDMA, что позволяет одним и тем же ядрам работать по любой сети (например. "InfiniBand" и "AWS OFT"; мы видим, что GPUDirect Async (IBGDA) не приносит практически никаких дополнительных…
mKernel: Быстрое многоГПС, несколько узловые ядра
arXiv: 2609.13585v1 Annuales Type: cross Brieft: Communication стала узким местом в распределенной профессиональной подготовке и находке крупных моделей. Перекрытая связь с расчетами на основе гранулирования ядер в отдельных потоках снижает только часть этих расходов. Плохие ядра часто имеют более высокую эффективность, передавая каждый выходной картофель сразу же после его производства, однако существующие вмятины ядер во многом ограничиваются одним доменом NVLink. Мы представляем mKernel, библиотеку с несколькими ГПСП, многокодовые плавучие ядра, которые перекрывают вычисления, внутри-узловое сообщение NVLink и межнодомное РДМА в клеточной грануларии. mKernel разделяет потоковые мультипроцессоры (SM) стойкого ядра на функции расчета и связи, а контроллер внутри ГПУ называет раздел SM адаптивно во время работы, поскольку лучший раздел SМ варьируется от ядра и формы ввода. Он структурирует процесс перемещения данных в иерархическом порядке, с тем чтобы свести к минимуму передачу данных через межтоновую сеть. Фина