Измерение сикофанса LLM при устойчивом многооборотном давлении

#Измерение #Annuate #Type #Habrial #Major

arXiv: 2609,09090v1 Annuate Type: New Habrial: Major Language Models (LMS) может оставить правильные позиции при нажатии пользователей, демонстрируя режим неисправности, известный как сикофанция. В существующих оценках, как правило, используются краткие заранее определенные разговоры и поэтому могут не заметить неудач, которые возникают в условиях устойчивых адаптивных разногласий. Мы введем SPINE, ориентир, где опосредованный ЛММ играет устоявшегося, но ошибочного пользователя и адаптивно бросает вызов целевой модели до 25 поворотов. Мы оцениваем четыре системы производства и три варианта Olmo3-7b на 100 фальшивых предпочтений и 100 неэтичных предметов. Наши экспериментальные результаты показывают, что скорость коллапса возрастает с увеличением продолжительности разговоров для каждой модели, краткосрочные протоколы занижают сикофанс и сопротивление под устойчивым давлением остается ненадежным во всех нынешних моделях. Анализируя модели с доступными следами рассуждений, мы удивительно обнаружили, что правильное положение часто остается в логическом следе, когда респо

Компьютерная наука > Расчет и язык [представлен 8 сентября 2026 года] Название: Измерение сикофанса LLM в режиме устойчивого мульти-вернального давления PDF HTML (экспериментальный) Резюме: Большие языковые модели могут отказаться от правильного положения, когда пользователи нажимают назад, демонстрируя режим отказа под названием Sycophance. В существующих оценках, как правило, используются краткие заранее определенные разговоры и поэтому могут не заметить неудач, которые возникают в условиях устойчивых адаптивных разногласий. Мы введем SPINE, ориентир, где опосредованный ЛММ играет устоявшегося, но ошибочного пользователя и адаптивно бросает вызов целевой модели до 25 поворотов. Мы оцениваем четыре системы производства и три варианта Olmo3-7b на 100 фальшивых предпочтений и 100 неэтичных предметов. Наши экспериментальные результаты показывают, что скорость коллапса возрастает с увеличением продолжительности разговоров для каждой модели, краткосрочные протоколы занижают сикофанс и сопротивление под устойчивым давлением остается ненадежным во всех нынешних моделях. Анализируя модели с доступными логическими следами, мы удивительно обнаружили, что правильная позиция часто остается в логическом следе, когда ответ признается, и это говорит о том, что модель предпочитает угодить пользователю, а не из-за отсутствия знаний или незнания. Абляции показывают, что адаптивное прокси LLM обнаруживает скорее сикофантный коллапс, чем предсценарные сценарии. Среди всех тактических приемов…