Вера и поведение в языковых моделях
arXiv: 2609.07943v1 Annuales Type: New Brieflow: Существует значительная неуверенность в том, что абстракции как убеждения или желания с пользой описывают поведение больших языковых моделей (LMS). Помимо того, что этот вопрос связан с научными интересами, на эти латентные количества часто ссылаются для разъяснения поведения МЛМ пользователям или для определения и оценки вредного поведения, которое имеет отношение к умыслу. Тем не менее в настоящее время у нас нет средств для систематической проверки того, хорошо ли применяются такие концепции, как «верие», к МЛМ и поэтому могут ли они быть плодотворными компонентами попыток привести модели в соответствие с человеческими интересами. Мы предлагаем подход к эмпирическому изучению таких вопросов, задаёмся вопросом о том, позволяет ли одна скрытая переменная, вытекающая из результатов МЛМ -- интерпретация в качестве определенной степени веры -- наблюдателю делать поддающиеся толкованию прогнозы того, как МЛС будут реагировать на новые сигналы. Мы считаем, что высокоэффективные модели с пользой для дела описывают как придерживающиеся веры.