Реклама

Положительный довод в пользу верности: самопоказание LLM помогает прогнозировать модель поведения

#Положительный #Annuales #Type #Существующие #Gemini

arXiv: 2602.02639v2 Annuales Type: заменить резюме: самопояснения LLM часто представляются в качестве многообещающего инструмента для надзора IA, однако их верность истинному процессу аргументации модели плохо понята. Существующие метрики верности имеют серьезные ограничения, обычно полагаясь на выявление неверности путем состязательных попыток вызвать или обнаружить ошибки в рассуждениях. Эти методы не учитывают прогнозируемую ценность объяснений. Мы введем стандартизованную синхронизацию (NSG) - общую и масштабируемую метрику, основанную на идее о том, что верное объяснение должно позволить наблюдателю узнать критерии принятия решений моделью и тем самым лучше предсказать свое поведение по соответствующим вводимым данным. Мы оцениваем 18 моделей, имеющих самостоятельный и открытый вес на границах, например Gemini 3, GPT-5.2 и Cload 4.5, по 7000 контрфактических данных из популярных наборов данных в области здравоохранения, бизнеса и этики. Мы считаем, что самопояснения значительно улучшают прогнозирование поведения моделей (11-37% ГЯП). Самопояснения также обеспечивают