Рамки AI4AI для визуального токена
arXiv: 2608.07193v2 Annuales Type: заменить перекрестное резюме: Визуальная смазка может существенно снизить расходы на мультимодальные модели большого языка (MLM), однако существующие методы в значительной степени зависят от стационарной эвристики, изготовленной вручную, и дорогостоящих экспертных испытаний и ошибок. По мере диверсификации целей, бюджетов и образцовых архитектур ручная работа по расширению проектного пространства становится все труднее. Целью настоящего документа является создание системы AI4AI для визуального скручивания путем решения естественного вопроса: могут ли модели большого языка автоматически разрабатывать эффективные визуальные алгоритмы сокращения? Несмотря на то, что ММП обладают широкими алгоритмическими знаниями и сильными умениями рассуждать, их воплощение в эффективные решения специализированной задачи остается нетривиальным. Мы утверждаем, что ключом к этому является разработка надлежащего представления поискового государства, которое увязывает внутренние знания МЛМ со структурными требованиями и ограничениями визуального серфинга.