Реклама

Оценка местных языковых моделей для воспроизводимой инженерии данных: Эмпирическое инженерное исследование по вопросам мобильности

#Оценка #Эмпирическое #Annualce #Type #Briet

arXiv: 2610.11482v1 Annualce Type: cross Briet: Context: Musitus: агенты большой языковой модели (LLM) все чаще используются в качестве помощников по разработке программного обеспечения и данных, однако данные о развертываемых на местах агентах с открытым весом остаются ограниченными. В существующих оценках зачастую подчеркивается скорее текстовая реакция или изолированное формирование кода, чем действительность полных инженерных артефактов. Цели: Мы оцениваем, могут ли местные агенты ЛММ производить корректные и воспроизводимые артефакты для разработки данных, количественно оценивать последствия состояния рабочего пространства в закрытом пространстве и изучать компромиссы по масштабу модели, архитектуре, квантуализации, времени работы, использованию инструментов и неудачам. Методы: Мы введем контрольный показатель, включающий 15 задач по обеспечению мобильности-потока работы, включая обнаружение данных, соединители, обработку транспортных средств, семантическое обогащение, проектирование объектов, проверку достоверности, визуализацию и отчетность. Детерминистские шашки оценивают подготовленные сценарии, таблицы, структурированные файлы, цифры и отчеты. Оценка 10 местных конфигураций