Реклама

Почему Дак-DB 2.0 быстрее

#Почему #Дак-DB #Статья #Commissions #URletter

Статья URL: https://mathduck.com/blog/why-dackdb-20-is-faster/Commissions URletter: httpss://news.ycombinator. com/item?id=50035530 Пункты: 40 # Комментарии: 12

Утк-DB 2.0 приближается эта осень, и альфа выходит! Я прогнал интересные функции на своем ноутбуке, и против S3, чтобы посмотреть, что действительно изменится для людей, которые строят столы и трубопроводы, а не двигатели баз данных. Потому что да, ДакБР 2.0 быстрее. Но чтобы получить скорость, нужно понять как формируются ваши данные и иногда как их моделировать. Этот пост охватывает три функции, которые я думаю имеют значение больше всего с числами, что у меня есть, плюс несколько спрятанных драгоценностей в журналах обязательств. Каждый номер ниже от одной машины (ноутбук M5) и моего домашнего интернета, который замедлит обе версии примерно одинаково. Начнем с самого простого и интересного: асинхика I/O. Async I/O: Запросы по S3 AWS гораздо быстрее. Это тот, который мне больше всего нравится, потому что в ваших запросах ничего не меняется. Вот вопрос, который читает файл 2.2 GB Parquet на S3 (Stack Overflow Голосование 228 миллионов строк, 2268 строчных групп) и считает голоса по типу. Он читает одну из четырёх колонок, около 230 МБ. Копирование кода CREATE S3 (TYPE s3, kredential_cyble, Region 'us-East-1'); SET capace_ext_files_cach = fail; — так что каждый прогон на самом деле бьет S3 SELECT View TypeId, счёт(*) AS из чтения_parquet(s3://usprd-madadock-open-Databasets/stackoverflown/parquet/2023-05/voots.parket) Ожидайте, что все пойдет быстрее, если вы прогоните это из облаков вычисления. Так что за чёрная магия здесь? Файл разбит на 2268 строк, примерно 122 000 рядов.…