Безопасно в одном месте, риск на другом: увязка безопасности через периодические точки в Loped Language Models
arXiv: 2610.10.10625v1 Annualce Type: rectraview: Loped language Models (LOopLMs) — это эффективный подход к масштабированию возможностей моделей на основе многократного использования общих параметров в рамках регулярных этапов. Поскольку каждая повторяющаяся глубина может быть зачитана независимо, в одном LoopLM обнаруживается более широкое выходное пространство по всей глубине вывода и возникает важный вопрос: сохраняется ли безопасность на протяжении всего периода периодических расчетов. Предварительные оценки свидетельствуют о том, что более глубокое повторение может повысить уровень безопасности при возникновении вредных вопросов, однако в случае нападений на заключенных по-прежнему неясно. Поэтому мы проводим всеобъемлющую оценку безопасности ЛОДМ в ходе нападений на тюрьмы, направленных против различных глубин. Мы считаем, что успех атак может увеличиться на глубине более глубоких выводов, один и тот же вопрос способен вызвать различные модели поведения безопасности в разных глубинах, а нападения, направленные против одной глубины, могут передаваться другим. Кроме того, увязка СФТ и преференций не устраняет эти пробелы в области безопасности, стимулируя их