Компьютерные науки > Машинное обучение [представлено 8 июня 2026 (v1), последнее пересмотренное 17 сентября 2026 года (эта версия, v2)) Название: Измерение под отбором: Декой-калибрированный аудит ошибок для языковых моделей Ви PDF HTML (экспериментальное резюме): Зная как часто не удается использовать языковую модель, не объясняет, где ее ошибки сосредоточены. Когда ревизоры изучают многие объяснения, наиболее сильная из наблюдаемых тенденций может возникнуть случайно. Мы введем Януса, процедуру проверки предлагаемых схем ошибок до их сообщения. Янус начинается с фиксированного перечня свойств, по которым производится оценка примеров да/нет, например, является ли вводимые данные длительными. По каждому виду имущества он сопоставляет коэффициенты погрешности модели с примерами этого и тех, кто не имеет его. Чтобы понять, насколько велика разница в случае случайности, она повторяет этот расчет после перемешивания знаков да/нет по примерам без изменения размеров группы. Эти переплетенные вещи называются приманками. Погрешность указывается только в том случае, если размер ее погрешности соответствует пороговому показателю с использованием приманок. На отдельных примерах такой же группы по-прежнему должен быть более высоким коэффициентом ошибок, а разница должна соответствовать минимальному уровню, который был выбран заранее. В ходе контролируемого эксперимента, в рамках которого модель должна найти код в документах с таблицами сотрудников, проектов и кодах обновления, Янус…
Оценка под отбором: проверка ошибок в работе языковых моделей
arXiv: 2606.09046v2 Annuales Type: заменить резюме: Зная, как часто не удается использовать языковую модель, не объясняет, где ее ошибки сосредоточены. Когда ревизоры изучают многие объяснения, наиболее сильная из наблюдаемых тенденций может возникнуть случайно. Мы введем Януса, процедуру проверки предлагаемых схем ошибок до их сообщения. Янус начинается с фиксированного перечня свойств, по которым производится оценка примеров да/нет, например, является ли вводимые данные длительными. По каждому виду имущества он сопоставляет коэффициенты погрешности модели с примерами этого и тех, кто не имеет его. Чтобы понять, насколько велика разница в случае случайности, она повторяет этот расчет после перемешивания знаков да/нет по примерам без изменения размеров группы. Эти переплетенные вещи называются приманками. Погрешность указывается только в том случае, если размер ее погрешности соответствует пороговому показателю с использованием приманок. На отдельных примерах, приведенных в та же группа, по-прежнему должна быть обеспечена более высокая доля ошибок и разница должна соответствовать минимальному уровню, который был выбран.