Компьютерные науки > Компютерное видение и распознавание шаблонов [представлен 31 мая 2025 года (v1), последний пересмотренный 16 сентября 2026 года (эта версия, v4)] Название: От согласования к синтезу: Противополагающая объемная грань для текстового до CT поколения PDF HTML (экспериментальное) резюме: Поощрять семантически контролируемый том 3D КТ из рентгенологических отчетов требует более чем насыщенного текстового энкодера, он должен быть увязан на языке зрения, основанного на объемном пространстве. Существующая система " текст-ХТ &qt; подходит к созданию условий на кодерах, предварительно подготовленных только с использованием языка или двухмерного языка зрения, обеспечивая кондиционирование сигналов, которые лингвистически экспрессивны, но объемно ослепляют. Мы утверждаем, что это структурное ограничение: качество 3D-языкового согласования, а не богатство текстового энкодера является основным узким местом для семантической контрольной способности в моделях объемного распространения. Для решения этой проблемы мы предлагаем ориентированный на поколение энкодер 3D-CLIP, обученный структурированным жесткими негативами и функционирующий исключительно на текстовом уровне. Этот дизайн увеличивает контрастные трудности без дополнительных расходов на 3D память, преодолевая ограничения в отношении малых партитур, присущие объемным кодификаторам. В результате этого формируется полностью скрытая модель рассеивания в конце-концов, которая действует непосредственно в 3D…
От согласования к синтезу: противоположная объемная грань для поколения тексто-СТ
arXiv: 2506,00633v4 Annuate Type: Замена перекрестного резюме: для создания семантически контролируемых 3D томов из рентгенологов требуется больше, чем просто богатый текстовый кодер. Существующая система " текст-ХТ &qt; подходит к созданию условий на кодерах, предварительно подготовленных только с использованием языка или двухмерного языка зрения, обеспечивая кондиционирование сигналов, которые лингвистически экспрессивны, но объемно ослепляют. Мы утверждаем, что это структурное ограничение: качество 3D-языкового согласования, а не богатство текстового энкодера является основным узким местом для семантической контрольной способности в моделях объемного распространения. Для решения этой проблемы мы предлагаем ориентированный на поколение энкодер 3D-CLIP, обученный структурированным жесткими негативами и функционирующий исключительно на текстовом уровне. Этот дизайн увеличивает контрастные трудности без дополнительных расходов на 3D память, преодолевая ограничения в отношении малых партитур, присущие объемным кодификаторам. Вытекающий из этого энкодерc