Очистка данных с помощью типового программного обеспечения

#Очистка #Annuales #Type #Tabular #Foundation

arXiv:2604.25154v2 Annuales Type: заменить резюме: Tabular Foundation Models (TFMS) обеспечивает самую последнюю точность нулевой мощности на малых табличных наборах данных, однако их обучение в контексте предполагает приблизительно чистые вводимые данные: отсутствующие значения реального мира, выпадающие и дублирующие факторы создают предварительное несоответствие, которое ухудшает как точность, так и калибровку. Мы изучаем вопросы повышения квалификации для обработки данных в табличной форме, иллюстрируем политику последовательности операций по очистке и внедряем L2C-TFM с наградой, полученной с помощью модели (TFmawareReward). Мы четко понимаем, что это вознаграждение оптимизирует: оно урегулирует расстояние Вассерштейна между очищенными и первоначальными (грязными) данными — термином распределительной стабильности, который мы измеряем как диагностический. Из шести экспериментов на десяти наборах OpenML: i) три из семи проектов вознаграждения рушатся для дегенерации стратегий, так что наградная инженерия является нетривиальной; ii) в соответствии с 8-семенным протоколом многократного хранения, программа вознаграждения, полученная с помощью модели, соответствует случайному исходному уровню, предусматривающему получение прибыли от лесов на основе аккорда

Компьютерная наука > Машинное обучение [представлено 28 апреля 2026 (v1), последнее пересмотренное 17 сентября 2026 года (эта версия, v2)) Название: Model-Aware Data Clearing for Tabular Foundation Moделиs View PDF HTML (экспериментальное) Резюме: Tablual Funda Modoles (TMS) обеспечивает самую последнюю точность с нулевым значением на маленьких табличных наборах данных, однако их интертекстовое обучение предполагает приблизительно чистые вводимые данные: недостающие значения реального мира, выпадающие и дублирующие элементы создают предварительное несоответствие, которое ухудшает как точность, так и калибровку. Мы изучаем вопросы повышения квалификации для обработки данных в табличной форме, иллюстрируем политику последовательности операций по очистке и внедряем L2C-TFM с наградой, полученной с помощью модели (TFmawareReward). Мы четко понимаем, что это вознаграждение оптимизирует: оно урегулирует расстояние Вассерштейна между очищенными и первоначальными (грязными) данными — термином распределительной стабильности, который мы измеряем как диагностический. В рамках шести экспериментов на десяти наборах данных OpenML: i) три из семи проектов вознаграждения рушатся в целях дегенерации стратегий, поэтому инженерная деятельность является нетривиальной; ii) согласно протоколу с 8-семянным повторением, вознаграждение, покрывающее модель, соответствует произвольному исходному показателю точности (р=0.38), при этом преимущество ограничивается макроF1 для меньшинств под воздействием…