Реклама

Трансформеры-линеры могут легко учиться в кластере

#Трансформеры-линеры #Annualce #Type #Трансформеры #Последние

arXiv: 2610,09760v1 Annualce Type: кросс-бюллетень: Трансформеры имеют возможности для обучения в контексте, где некоторые известные алгоритмы обучения могут быть исполнены в переднем проходе через модель. Последние работы показывают, что трансформаторы могут точно выполнять алгоритм Ллойда в отношении $k-means, сгруппированные с очками в долл. В этой работе мы развиваем этот результат следующим образом: во-первых, мы представляем столь же экспрессивный, но более малый трансформатор, который выполняет алгоритм Ллойда с встроенным размером $d {\textsf {emb} = (d + lceil log_2 k /rceil) долларов. Затем мы обучаем этих трансформаторов изучению алгоритмов кластеризации при распределении задач группирования, а также теоретической характеристике и эмпирическому подтверждению факторов, влияющих на конвергенцию и распределение синтеза обучающих алмазов на основе стокастических градиентов. Наконец, мы проверим общий клюс.