Оптимальная послеобработка синтетических данных для сопоставления корреляции Пирсона

#Оптимальная #Пирсона #Annuales #Type #Существующие

arXiv: 2510,02405v3 Annuales Type: заменить резюме: сохранение корреляции в синтетических данных представляет интерес для нескольких приложений. Существующие подходы касаются главным образом корреляционного сохранения в ходе процедуры выработки. Здесь мы рассматриваем это как проблему после обработки. С учетом оригинальных и синтетических табличных данных, мы стремимся к наименьшему изменению набора синтетических данных, который восстанавливает корреляционную матрицу Пирсона. При соответствующих предположениях мы выбираем уникальное ясно выраженное решение проблемы сведения к минимуму. Мы также обеспечиваем ограничение размера поправки с точки зрения первоначальной корреляции погрешности. Что касается цифровых показателей, то в рамках нескольких наборов данных и методов получения информации предлагаемый подход во многом обеспечивает сохранение маргинальных распределений, геометрии t-SNE и характеристик классификации. Этот метод является независимым от генератора и может применяться после синтеза без изменения процедуры производства.

Статистические данные > Методология [представлена 2 октября 2025 года (v1), последняя пересмотренная 16 сентября 2026 года (этот вариант, v3)] Название: Optimal Post-process of Synthetic Data for Pearson Corplementing View PDF HTML (экспериментальное) резюме: Сохранение корреляции в синтетических данных представляет интерес для нескольких приложений. Существующие подходы касаются главным образом корреляционного сохранения в ходе процедуры выработки. Здесь мы рассматриваем это как проблему после обработки. С учетом оригинальных и синтетических табличных данных, мы стремимся к наименьшему изменению набора синтетических данных, который восстанавливает корреляционную матрицу Пирсона. При соответствующих предположениях мы выбираем уникальное ясно выраженное решение проблемы сведения к минимуму. Мы также обеспечиваем ограничение размера поправки с точки зрения первоначальной корреляции погрешности. Что касается цифровых показателей, то в рамках нескольких наборов данных и методов получения информации предлагаемый подход во многом обеспечивает сохранение маргинальных распределений, геометрии t-SNE и характеристик классификации. Этот метод является независимым от генератора и может применяться после синтеза без изменения процедуры производства. История представления: Уссама Мохамед Эламин Оунисси [видение электронной почты] [v1] Ту, 2 октября 2025 года 03:14:57 UTC (81 KB) [ v2] Tue, 9 Jun 2026 07:27:44 UTS (815 KB)] [v3] Wed, 16 Sep 2026 14:25:23 UTK (790 KB). Текущий контекст…