Компьютерные науки > Расчеты и язык [представлен 16 июня 2026 (v1), последний раз пересматривался 16 сентября 2026 года (эта версия, v2)) Название: Redact или Store? Резюме: Диалог в области образования является ценным, но чувствительным ресурсом для исследований: те же стенограммы, которые отражают подлинное обучение, часто фиксируют персональную идентифицирующую информацию (PII), связанную с содержанием учебных программ, где "Риеманн" может относиться к реальному студенту или математической концепции. Существующие подходы обусловливают компромисс между управлением и точностью. Коммерческие крупные языковые модели (ТМП) могут устранить эту двусмысленность, но при этом требуют направления студенческих данных третьим сторонам, в то время как местные системы распознавания образований сохраняют принципы управления, но чрезмерно отредактированные условия учебных программ. Мы предлагаем полностью местную каскадную систему, которая переформулирует деидентизацию от открытого признания образования до ограниченной сортировки конфиденциальности. Первый кандидат в профсоюз сочетает двух легких кодировщиков с детерминистскими правилами для чрезмерного увеличения числа кандидатов; наблюдатель, понимая контекст, затем принимает двоичный Redact/Seeping решение для каждого кандидата, используя окружающий диалог и роль оратора. Мы оцениваем три конфигурации рецензентов по отношению к исходным уровням только для одного семейства LLM и коммерческое API на расшифровке стенограмм с двух больших…
Отредактировать или сохранить? Полноместный каскад " ИА ' за деидентизацию образовательного диалога
arXiv: 2606.18372v2 Annuales Type: заменить перекрестное резюме: образовательный диалог является ценным, но чувствительным ресурсом для исследований: те же стенограммы, в которых фиксируется подлинное обучение (PII), часто описываемая персональной идентифицируемой информацией (P II) с содержанием учебных программ, где "Riemann" может относиться к реальному студенту или математическому понятию. Существующие подходы обусловливают компромисс между управлением и точностью. Коммерческие крупные языковые модели (ТМП) могут устранить эту двусмысленность, но при этом требуют направления студенческих данных третьим сторонам, в то время как местные системы распознавания образований сохраняют принципы управления, но чрезмерно отредактированные условия учебных программ. Мы предлагаем полностью местную каскадную систему, которая переформулирует деидентизацию от открытого признания образования до ограниченной сортировки конфиденциальности. Первый кандидат от профсоюза, предлагающий отзыв, сочетает два легковесных кодера с детерминистскими правилами для чрезмерного увеличения числа кандидатов; просмотрщик контекстного обзора затем делает двоичный Redact/Step решения по каждому кандидату с использованием сурро