#pyspark — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #pyspark, aggregated by home.social.
-
【AWS Glue】Glueジョブでdynamic_frameをソースに利用したらキャストエラーで困った話
https://dev.classmethod.jp/articles/aws-glue-glue-dynamic-frame-cast-error/#dev_classmethod #AWS_Glue #Apache_Spark #PySpark #Apache_Iceberg
-
AWS Glue for Spark のジョブから、AWS CodeArtifact を経由して PyPI のライブラリをインストールする
https://dev.classmethod.jp/articles/aws-glue-for-spark-aws-codeartifact-pypi/#dev_classmethod #AWS_Glue #AWS_CodeArtifact #PyPI #Spark #PySpark
-
AWS Glue 5.0からPythonのライブラリをrequirements.txtで指定できるようになったので検証してみた
https://dev.classmethod.jp/articles/aws-glue5-python-requirements-txt/ -
AWS Glue for Spark のチュートリアルをやってみた(ワークアラウンドとデータ確認手順付き)
https://dev.classmethod.jp/articles/aws-glue-for-spark-tutorial/ -
AWS Glue for SparkからDatabricksのテーブルにアクセスしてみた
https://dev.classmethod.jp/articles/aws-glue-for-spark-databricks/ -
Оптимизируем Shuffle в Spark
Привет, Хабр! Меня зовут Сергей Смирнов, я аналитик в продукте CVM в X5 Tech. Я занимаюсь разработкой инструмента анализа A/B экспериментов. Мы ежедневно считаем десятки метрик для сотен экспериментов на десятки миллионов клиентов –- это терабайты данных, поэтому наш инструмент разработан на Spark. В последнее время мы заметили, что существенную часть времени работы наших Spark-приложений занимает обмен данными (Shuffle) между исполнителями. В этой статье я расскажу о том, какие оптимизации помогли нам избавиться от самых тяжёлых операций Shuffle. Речь пойдёт не только о BroadcastJoin , но и о двух других неочевидных методах – предварительное репартицирование и бакетирование .
https://habr.com/ru/companies/X5Tech/articles/837348/
#spark #план_запроса #data_analysis #data_engineering #pyspark #shuffle #партицирование_в_spark #бакетирование_в_spark #оптимизация_shuffle #оптимизация_spark