API Контрольные параметры не переносятся в интерфейсы Chatbot

#Контрольные #Chatbot #Annuales #Type #Habrit

arXiv: 2609.08861v1 Annuales Type: New Habrit: Basic dates - центральная валюта в выпусках моделей: они содержат информацию о принятии решений по закупкам, формируют общественное доверие и оказывают влияние на политику. Однако одно из ключевых предположений, лежащих в основе контрольных показателей, заключается в том, что эффективность модели, измеряемая с помощью АПИ, точно отражает поведение развернутых систем. Мы опротестуем это предположение путем проверки ЧатгПТ, Клода и Джемини в семи системах и девяти контрольных показателях, охватывающих общие возможности, социальные предрассудки и сикофанс. Мы находим систематические АПИ - взаимоувязки как в точности, так и согласованности. В среднем оценки АПИ на 3,4 процентных пункта выше по точности и на 2,1 процентного пункта выше в соглашении о проведении испытаний-повторном тесте, чем соответствующие оценки интерфейса. В случае CATGPT разница в эффективности между API и доступом к интерфейсу превышает разницу только для APi между GPT 5.3 и GBT 5.4. По-другому, переключение на другую поверхность может ухудшить производительность в той же степени, что и понижение полной модели.

Компьютерная наука > Искусственное Разведка [представлено 8 сентября 2026 года] Название: API Basic Scores Do resliable Translation to Chatbot Interface View PDF HTML (экспериментальный) Резюме: Benchmark studies — это центральная валюта в выпусках моделей: они информируют о принятии решений по закупкам, формируют общественное доверие и оказывают влияние на политику. Однако одно из ключевых предположений, лежащих в основе контрольных показателей, заключается в том, что эффективность модели, измеряемая с помощью АПИ, точно отражает поведение развернутых систем. Мы опротестуем это предположение путем проверки ЧатгПТ, Клода и Джемини в семи системах и девяти контрольных показателях, охватывающих общие возможности, социальные предрассудки и сикофанс. Мы находим систематические АПИ - взаимоувязки как в точности, так и согласованности. В среднем оценки АПИ на 3,4 процентных пункта выше по точности и на 2,1 процентного пункта выше в соглашении о проведении испытаний-повторном тесте, чем соответствующие оценки интерфейса. В случае CATGPT разница в эффективности между API и доступом к интерфейсу превышает разницу только для APi между GPT 5.3 и GBT 5.4. Если говорить иначе, то переключение на другие поверхности может привести к снижению производительности в той же степени, что и понижение полного поколения моделей. Мы далее проверяем, могут ли взломанные системы контроля API воспроизвести поведение интерфейса с помощью различных системных сигналов, параметров выборки и логических…