Эстетическая модель голоса, направленная на укрепление обучения людей, слушающих
arXiv: 2610.10.10868v1 Annuales Type: кросс-бюллетень: Мы введем модель речи, большую языковую модель для описания голосовой эстетики реальных или синтетических речевых ответов при естественном разговорном контексте. С учетом контекста и речевой речи CVAM описывает основные моменты, характеризующие голос, и предсказывает девять категорических атрибутов, охватывающих пол, поле, щупание, эмоции и роды. Основная проблема заключается в том, что такие сферы восприятия, как эмоциональные чувства и доставка, по своей сути субъективны и не имеют точной основы для истины. Поэтому мы собираем около 10 человеческих аннотаций для каждого из 3k реальных и синтетических ответов, полученных от CANDOR corpus. CVAM находится под наблюдением, отточенным на синтезированных эстетических описаниях и этикетках, а затем оптимизирован с помощью групповой относительной оптимизации политики в отношении человеческих судебных решений. Эксперименты показывают, что CVAM лучше согласуется с слушателями, чем Gemini 3.1 Pro и Open-Source LLM, и превосходит одночеловеческие-vs.-rest Ag