home.social

#parquet — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #parquet, aggregated by home.social.

  1. «Переходи на Spark», говорили они. Сравнил pandas, Polars, DuckDB и PySpark на слабой машине

    Сценарий знакомый: открываешь в pandas файл побольше, ноутбук задумывается, и через минуту всё падает с MemoryError. Следом обычно звучит совет: для больших данных есть Spark. Я решил проверить его цифрами, но не на кластере, а на слабой машине с двумя ядрами и 5,8 ГБ памяти. Сравнил шесть вариантов: pandas, pandas с pyarrow, Polars, Polars в потоковом режиме, DuckDB и PySpark. Пять типовых операций, объёмы от 6 до 180 млн строк, контроль памяти и автоматическая сверка результатов между библиотеками. Эта сверка по дороге нашла баг, из-за которого Spark терял целый день данных. Кто сдался первым, кто удивил и почему переход на Spark часто не лучший выход, рассказываю под катом. Смотреть результаты

    habr.com/ru/articles/1087386/

    #pandas #polars #duckdb #pyspark #бенчмарк #анализ_данных #обработка_данных #parquet #python #производительность

  2. «Переходи на Spark», говорили они. Сравнил pandas, Polars, DuckDB и PySpark на слабой машине

    Сценарий знакомый: открываешь в pandas файл побольше, ноутбук задумывается, и через минуту всё падает с MemoryError. Следом обычно звучит совет: для больших данных есть Spark. Я решил проверить его цифрами, но не на кластере, а на слабой машине с двумя ядрами и 5,8 ГБ памяти. Сравнил шесть вариантов: pandas, pandas с pyarrow, Polars, Polars в потоковом режиме, DuckDB и PySpark. Пять типовых операций, объёмы от 6 до 180 млн строк, контроль памяти и автоматическая сверка результатов между библиотеками. Эта сверка по дороге нашла баг, из-за которого Spark терял целый день данных. Кто сдался первым, кто удивил и почему переход на Spark часто не лучший выход, рассказываю под катом. Смотреть результаты

    habr.com/ru/articles/1087386/

    #pandas #polars #duckdb #pyspark #бенчмарк #анализ_данных #обработка_данных #parquet #python #производительность

  3. «Переходи на Spark», говорили они. Сравнил pandas, Polars, DuckDB и PySpark на слабой машине

    Сценарий знакомый: открываешь в pandas файл побольше, ноутбук задумывается, и через минуту всё падает с MemoryError. Следом обычно звучит совет: для больших данных есть Spark. Я решил проверить его цифрами, но не на кластере, а на слабой машине с двумя ядрами и 5,8 ГБ памяти. Сравнил шесть вариантов: pandas, pandas с pyarrow, Polars, Polars в потоковом режиме, DuckDB и PySpark. Пять типовых операций, объёмы от 6 до 180 млн строк, контроль памяти и автоматическая сверка результатов между библиотеками. Эта сверка по дороге нашла баг, из-за которого Spark терял целый день данных. Кто сдался первым, кто удивил и почему переход на Spark часто не лучший выход, рассказываю под катом. Смотреть результаты

    habr.com/ru/articles/1087386/

    #pandas #polars #duckdb #pyspark #бенчмарк #анализ_данных #обработка_данных #parquet #python #производительность