Компьютерные науки > Компютерное видение и распознавание моделей [представлено 17 июля 2026 (v1), последний пересмотренный вариант 16 сентября 2026 года (эта версия, v3)] Название: Дебиасирование оценки текста-имплантации с помощью Имплицитной системы согласования моделей обмена информацией о моделировании PDF HTML (экспериментальное) резюме: По мере быстрого развития систем "Торма-изображение" (T2I), оценка культурной подлинности синтезированного контента приобретает все большее значение для справедливой и надежной регенеративной МА. Существующие показатели оценки Т2I и смешанные судьи часто полагаются на визуальные семантичные представления, которые не отражают имплицитных культурных норм, что ведет к предвзятым решениям о предпочтениях и упущению мелких культур. Кроме того, визуальные ответы на вопросы (VQA) оценщики обычно зависят от авторегрессивного текстового поколения, что ограничивает их масштабируемость для моделирования вознаграждения в режиме реального времени. Для устранения этих ограничений мы внедряем Имплицитную модель культурного согласования, построенную на легкой модели мультимодального языка (MLM) весом 4,2 млрд. Наша рамочная основа объединяет Имплицитный Культурный Проб с механизмом Скип-Сити (SkippCA), позволяющим поздним этапам семантических функций непосредственно присутствовать на ранних этапах визуального представления и лучше сохранять важные в культурном отношении детали. Оценки 3323 сложных и тщательно обработанных пар изображений из эталонного…
Разоблачение оценки текста на имущественный счет с помощью имплицитной модели вознаграждения за культурную гармонизацию
arXiv: 2607.15740v3 Вид уведомления: заменить перекрестное резюме: по мере быстрого развития систем T2I оценка культурной подлинности синтезированного контента приобретает все большее значение для справедливой и надежной системы адаптивной АИ. Существующие показатели оценки Т2I и смешанные судьи часто полагаются на визуальные семантичные представления, которые не отражают имплицитных культурных норм, что ведет к предвзятым решениям о предпочтениях и упущению мелких культур. Кроме того, визуальные ответы на вопросы (VQA) оценщики обычно зависят от авторегрессивного текстового поколения, что ограничивает их масштабируемость для моделирования вознаграждения в режиме реального времени. Для устранения этих ограничений мы внедряем Имплицитную модель культурного согласования, построенную на легкой модели мультимодального языка (MLM) весом 4,2 млрд. Наша система объединяет Имплицитный Культурный Проб с механизмом Скип-Вознаграждения (SkippCA), позволяющим поздним этапам семантических функций непосредственно заниматься ранними.