QuanText: Защита секретов уровня данных при обмене текстовыми данными

#QuanText #Защита #Annuaire #Type #Hatural-Language

arXiv:2609.17995v1 Annuaire Type: New Hatural-Language Papers поддерживает многие прикладные и научно-исследовательские исследования, но выпуск текста может выявить чувствительные глобальные свойства основного источника данных, такие как доля записей, связанных с конкретным гендерным фактором, диагнозом или политической позицией. В настоящее время работа в основном сосредоточена на нападениях, связанных с вычислениями собственности и восстанавливающих такие глобальные свойства, тогда как защита этих секретных данных остается ограниченной. Дифференцированная конфиденциальность, хотя и является эффективным средством защиты личных записей, обеспечивает лишь слабую защиту совокупных свойств. Мы предлагаем использовать для текста (QuanText) метод произвольной количественной обработки данных, который является бесплатным и невыпуском данных на больших языках с использованием моделей агностиков, обеспечивающих защиту глобальных секретов в текстовых наборах данных при сохранении полезности данных. С учетом секретности набора данных, такой как доля записей с конкретным диагнозом и атрибуты, полезность которых должна быть сохранена, например тема

Компьютерные науки > Машинное обучение [представлено 16 сентября 2026 года] Название: QuanText: Защита секретов уровня данных в текстовом виде обмена данными PDF HTML (экспериментальный) резюме: наборы данных на Natural-языков поддерживают многие приложения и исследования вниз по течению, но выпускаемый текст может выявить чувствительные глобальные свойства основного источника данных, такие как доля записей, связанных с конкретным гендерным фактором, диагнозом или политической позицией. В настоящее время работа в основном сосредоточена на нападениях, связанных с вычислениями собственности и восстанавливающих такие глобальные свойства, тогда как защита этих секретных данных остается ограниченной. Дифференцированная конфиденциальность, хотя и является эффективным средством защиты личных записей, обеспечивает лишь слабую защиту совокупных свойств. Мы предлагаем использовать для текста (QuanText) метод произвольной количественной обработки данных, который является бесплатным и невыпуском данных на больших языках с использованием моделей агностиков, обеспечивающих защиту глобальных секретов в текстовых наборах данных при сохранении полезности данных. С учетом секретности набора данных, такой как доля записей с конкретным диагнозом и атрибуты, полезность которых должна быть сохранена, такие как тема и чувства, QuanText искажает как тайное распространение, так и распределение коррелятивных параметров. Она делает это, создавая дистрибуции для распространения кандидатов по секретным…