Переосмысление контракционных потерь в рамках программы после прохождения профессиональной подготовки: дополнительные рамки с замороженным текстовым альбомом
arXiv: 2610.11374v1 Annualce Type: New Brieflook: CLIP служит в качестве базовой модели языка зрения и де-факто энкодера зрения для вниз по течению VLM, таких как LLAVA. Послеучебная подготовка представляет собой легкий путь для совершенствования CLIP, однако в ходе недавно проведенной работы утверждается, что стандартный контрастный ущерб не подходит для послеобучения из-за катастрофического забвения под небольшими партиями, мотивируя дизайны, которые отклоняются от противоположностной цели в пользу дистилляции. Мы вновь рассмотрим эту посылку и сделаем вывод о том, что для цели InfoNCE сообщаемое забвение обусловлено главным образом не недостаточным количеством негативных факторов, а неадекватным масштабом контрастной температуры в размере $tau долларов: при наличии достаточно небольшого объема средств на период после прохождения профессиональной подготовки контрастный курс улучшится вместо того, чтобы деградировать предварительно подготовленный CLIP, который мы объясняем через температурную зависимость градиента инфоНКЕ. Основываясь на этом выводе, мы предлагаем текст f (ComCLIP) легковесный один-эпоховый рецепт после тренировки, который заморозит текстовый энкодер CLIPS - так что re