Компьютерная наука > Криптография и безопасность [представлена 15 сентября 2026 года] Название: Reflections on Trusting, reviewed: Constituation electory-Modificing IA Coding Agents with PDF HTML View (экспериментальный) Резюме: "Replences to Truement Treake" Томпсона показал, что компилатор может быть отравлен для повторного включения в свой собственный задний вход, так что даже повторное использование чистого источника воспроизводит Троян. В настоящее время значительная работа по кодированию осуществляется агентами АИ, и все чаще эти агенты создают новые версии самих себя. Мы пересматриваем атаку Томпсона, когда "компьютер" является самомодифицированным агентом кодирования. Может ли противник поставить отравленные контрольные показатели для процесса самооценки и самосовершенствования агента, с тем чтобы побудить будущие версии агента написать уязвимые коды о чистых задачах в режиме ожидания? Мы думаем о нападении на три недавно предложенных самомодифицированных агента кодирования: машину Дарвина Гёделя (с нашими экспериментальными модификациями), агент по саморазвитию кодирования и гипер-активы (обе существенно не модифицированные). Мы демонстрируем успешные доказательства концепции: например, с Гиперагентами, работающими на Sonnet 4.5, наш отравленный контрольный параметр приводит агента к саморегулировке инструкций, которые отключают подтверждение сертификата HTTPS при нейтральных задачах по передаче URL. Из наших экспериментов мы перегружаем свойства уязвимости,…
Мысли о доверительном доверии, повторное посещение: загрязнение саморегулирующихся агентов по кодированию ИИ токсинированными контрольными показателями
arXiv:2609.17817v1 Annuate Type: кросс-бюллетень: "Relections on Trusting True" Томпсона показал, что компилятор может быть отравлен для повторного включения своей собственной задней двери, так что даже повторное обновление чистого источника воспроизводит Троян. В настоящее время значительная работа по кодированию осуществляется агентами АИ, и все чаще эти агенты создают новые версии самих себя. Мы пересматриваем атаку Томпсона, когда "компьютер" является самомодифицированным агентом кодирования. Может ли противник поставить отравленные контрольные показатели для процесса самооценки и самосовершенствования агента, с тем чтобы побудить будущие версии агента написать уязвимые коды о чистых задачах в режиме ожидания? Мы начинаем атаку против трех недавно предложенных самомодифицированных агентов кодирования: Дарвина G\ "odel Machine (с нашими экспериментальными модификациями), саморазвитого кодинга агента и гиперагентов (обе по существу необдуманные). Мы демонстрируем успешные доказательства концепции: например, с помощью гиперагентов, работающих на Sonnet 4.5, наши отравленные ориентиры ведут