Как быстро джойнить датафреймы с геоданными на Apache Sedona

#Apache #Sedona #Привет #Хабр #Павел
Как быстро джойнить датафреймы с геоданными на Apache Sedona

Привет, Хабр! Я Павел Молчанов, Data Engineer из группы обработки гео- и медиаданных Big Data компании МТС Web Services. Наш продукт «ГеоЭффект» занимается расчетами различных геостатистик на основе телеком-данных (например, по туризму). У нас есть ежедневно обновляемая инфраструктурной командой витрина-источник с событиями (точками нахождения абонентов) на основе мобильной сети по всем регионам присутствия МТС. За сутки на каждого абонента приходится в среднем порядка 200 геособытий, общий объем данных в витрине — около 11 млрд записей в сутки. Однако в витрине-источнике не было привязки геособытий к административно-территориальной информации «Регион РФ / район», что критически важно нам как продуктовой команде, решающей бизнес-кейсы в интересах заказчиков. Отсюда и появилась задача — дообогатить витрину дополнительными атрибутами на основе координат геособытий. Так что в этом материале по мотивам доклада для Highload++ поделюсь, как мы это сделали, а еще ускорили джойн датафреймов с

Привет, Хабр! Я Павел Молчанов, Data Engineer из группы обработки гео- и медиаданных Big Data компании МТС Web Services. Наш продукт «ГеоЭффект» занимается расчетами различных геостатистик на основе телеком-данных (например, по туризму).

У нас есть ежедневно обновляемая инфраструктурной командой витрина-источник с событиями (точками нахождения абонентов) на основе мобильной сети по всем регионам присутствия МТС. За сутки на каждого абонента приходится в среднем порядка 200 геособытий, общий объем данных в витрине — около 11 млрд записей в сутки. Однако в витрине-источнике не было привязки геособытий к административно-территориальной информации «Регион РФ / район», что критически важно нам как продуктовой команде, решающей бизнес-кейсы в интересах заказчиков.

Отсюда и появилась задача — дообогатить витрину дополнительными атрибутами на основе координат геособытий. Так что в этом материале по мотивам доклада для Highload++ поделюсь, как мы это сделали, а еще ускорили джойн датафреймов с геоданными.

Пара слов по технологическому стеку: сейчас мы активно проводим подготовительные работы по переходу на Data LakeHouse, но пока что основная рабочая лошадка — Spark на старом добром Hadoop-кластере с HDFS и Hive Metastore. Так что повествование будет идти в контексте технологий Spark on YARN + Sedona + HDFS + Hive.

Похожие статьи

Российская газета
Российская газета

Как швейная фабрика в Мстиславле стала одним из индустриальных флагманов

Экономический потенциал белорусско-российского сотрудничества успешно реализуется не только на уровне промышленных гигантов и крупных административных единиц, но и раскрывается в малых районных центра...

Российская газета
РИА
РИА

Такер Карлсон назвал Россию его любимой страной

Американский журналист Такер Карлсон назвал Россию любимой страной из всех, где он был, и выразил желание посетить ее еще раз. РИА Новости, 12.08.2026

РИА
Аргументы и Факты
Аргументы и Факты

Филиппо: Зеленского поймали с поличным при попытке вызвать катастрофу

Во Франции обвинили Владимира Зеленского в попытке спровоцировать глобальную катастрофу.

Аргументы и Факты
Аргументы и Факты
Аргументы и Факты

Прогноз магнитных бурь по часам на 13 августа 2026 года. Инфографика

Смотрите в инфографике aif.ru, как будет меняться геомагнитная обстановка в течение дня 13 августа 2026 года.

Аргументы и Факты
Звездач
Звездач

Барановская прогулялись по Гонконгу в аксессуарах за 145 тысяч рублей 💎

Барановская прогулялись по Гонконгу в аксессуарах за 145 тысяч рублей 💎 Юлия решила не надевать все самое дорогое, а отдала предпочтение Louis Vuitton прямиком из 2010-х. Сейчас такую сумочку можно пр...

Звездач
"Взрывная" диарея добралась до Вашингтона и Нью-Йорка M24.ru
M24.ru

"Взрывная" диарея добралась до Вашингтона и Нью-Йорка

С мая 2026 года лабораторно подтверждено 13 895 случаев заражения

M24.ru