Оценка деятельности агентов Deep-Search под иерархией в Интернете
arXiv: 26009,06027v1 Annuaire Type: кросс-бюллетени: для принятия решений потребителями все шире используются поисковые агенты LLM, что делает их уязвимыми к отравлению в результате оптимизации двигателей (GEO). Существующие контрольные показатели в значительной степени позволяют определить, осуществляется ли поиск или утверждение манипулируемого контента, но не отслеживают, проверяет ли тот или иной агент подозрительные доказательства, пересматривает ли принятые требования или возвращается до вынесения своей окончательной рекомендации. Мы введем HAE-GEO, ориентир, который отслеживает полную траекторию от воздействия восстановления под все более убедительным интернет отравлением. Агенты взаимодействуют через многооборотный интерфейс Поиск-Скрап на трех уровнях атак (L1 - прямое утверждение, L2 - контекстная камуфляж и L3, очевидное подтверждение), подкрепляемый контролируемым корпусом из 72 039 чистых страниц и 770 отравленных страниц на уровне 8 категорий продуктов и 154 бренда. Оценка сочетает детерминистские поведенческие меры с шестью семантичными измерениями. Оценивая 10 агентов, мы находим 3 r