Разумное визуальное редактирование
arXiv: 261.10.12343v1 Тип уведомления: новое резюме: крупные мультимодальные модели (ММЖ) добились значительного прогресса в визуальном понимании и разработке, но по-прежнему сталкиваются с трудностями при визуальном редактировании, особенно при выполнении сложных инструкций, сохранении внешней согласованности и поддержке гибких форматов ввода данных. Для изучения этого пробела мы введем RISCEBench, первый контрольный показатель для оценки разумного и информированного визационного редактирования (РИСЕ), а также распространим его на RISEBench++ - более всеобъемлющий и тонкий эталонный критерий для этой новой задачи. RISEBench++ расширяет таксономию в иерархическую схему, охватывающую шесть аспектов: временные, каузальные, пространственные, логические и контрафактные обоснования вместе с смешанным рассуждениями о включении различных типов рассудков при многооборотном редактировании. Эти размеры далее разлагаются на 12 подкатегорий и 65 мелких типов задач. Мы расширяем форматы ввода данных, с тем чтобы включить в него многообразные модели кондиционирования и масштабируем эталонный показатель до 1000 человеко-аннотированных t