Тренировка Text-to-Image Models 3,6× Быстрее

#Тренировка #Text-to-Image #Models #Быстрее #Статья

Статья URL: https://www.linum.ai/field-notes/jit-ddt Reservations URlew: httpss://news.ycombinator.com/teme?id=49729816 Пункты: 6 # Комментарии: 1

Linum v2 был скучен огромным размером окна его внимания. 720p, 5 секундный клип стоил 110 тысяч. Для сравнения, МЛМ видят образцы с менее чем 8K символов на 97% от их предварительной подготовки. Внимание в квадрате затрат, так что самый большой рычаг для ускорения подготовки моделей - это опустить окно контекста. Большинство регенеративных изображений и видеосистем - это модели слабительного диффузия (LDM). Они делят сжатие и генерацию на независимые тренированные модули: VAE (VAE) и DIT (Difsusion Transformer). Недавно модели пиксел-космического пространства, такие как джиТ, оказались многообещающей альтернативой. Она сокращает две модели до одной и позволяет диффузионной модели строить латентное пространство специально для поколения, вместо того чтобы полагаться на одно построенное для реконструкции. Когда джиТ тренировалась по нашему набору данных, он пытался создать тонкие детали. Мы предлагаем новую архитектуру энкодера-декадра (JiT-DDT), которая восстанавливает эту деталь и тренирует гораздо более эффективно, чем ее коллега по LDM. В отличие от Linum v2, JiT-DDT тренирует текстовую модель с 3,6× меньше GPU часов, даже несмотря на то что она генерирует изображения с 4x пикселями. В соответствии с лицензией Apache 2.0 можно использовать код JIT-DDT и модель весов. Мы надеемся, что, поделившись своими выводами с более широким сообществом, мы сможем побудить других к изучению также и более эффективных методов подготовки кадров. Это должно рассматриваться как…