Компьютерные науки > Искусственный интеллект [представлен 14 сентября 2026 года] Название: Calibrate, затем путь: Измеренное исследование по обобщенным запросам для дезагрегированных LLM Serviving View PDF HTML (экспериментальный) Резюме: Дисгрегированные LLR в местах вычисления тяжелого предварительного наполнения и сильного декода памяти на отдельных пулах GPU. Такие системы, как DistServe, Splitwise и Moonkeak делают это разделение быстрым, но маршрут все еще определяет, какие случаи удовлетворяют каждый запрос. Мы изучаем роутер, который оценивает дополнительное время завершения в каждом случае с использованием точной оперативной длины, прогнозируемой длины выходных данных, после допуска давления KV и класса SLO. Мы разрабатываем эту политику в дискретном имитаторе событий, а также проверяем ее на восьми GPU NVIDIA A40, каждый из которых работает с VLM-двигателем, при этом NIXL переносит KV тайники между бассейнами. Вся рабочая нагрузка оценивается в насыщении. В трех смешанных, разрывных следах прибытия калиброванный маршрутизатор достигает наивысшей средней полезной мощности 0,864 по сравнению с 0,835-0.847 для круглого робина и наименьшего объема эвристики. На ней также показано наименьшее различие между следами. Он бьет по кругу Робин и длине эвристики на всех трех следах, и меньше всего загружен на двух. На третьем эта цифра достигает 0,003, а на втором - до звука. Калибровка аппаратных средств имеет значение: имитационные константы стоят 4,5 баллов за гудок и…
Калибрат, затем путь: Измеренное исследование обучаемых запросов для дезагрегирования LLM
arXiv: 2609.16206v1 Annuales Type: New Habstractive: Disgrated LLM Services вычисляет тяжелые предзаправочные и запоминающие декоды на отдельных пулах GPU. Такие системы, как DistServe, Splitwise и Moonkeak делают это разделение быстрым, но маршрут все еще определяет, какие случаи удовлетворяют каждый запрос. Мы изучаем роутер, который оценивает дополнительное время завершения в каждом случае с использованием точной оперативной длины, прогнозируемой длины выходных данных, после допуска давления KV и класса SLO. Мы разрабатываем эту политику в дискретном имитаторе событий, а также проверяем ее на восьми GPU NVIDIA A40, каждый из которых работает с VLM-двигателем, при этом NIXL переносит KV тайники между бассейнами. Вся рабочая нагрузка оценивается в насыщении. В трех смешанных, разрывных следах прибытия калиброванный маршрутизатор достигает наивысшей средней полезной мощности 0,864 по сравнению с 0,835-0.847 для круглого робина и наименьшего объема эвристики. На ней также показано наименьшее различие между следами. Он бьет вокруг Робина и длину эвристики на всех трех следах и