#pyspark — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #pyspark, aggregated by home.social.
-
От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»
Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.
https://habr.com/ru/companies/magnit/articles/1056372/
#data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake
-
ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft
Q2. What are the main components of Azure Data Factory? Learn about the main components of Azure Data Factory! This video ... source
-
Spark SQL for Data Engineering 1 : I am going to start spark sql sessions as series. #sparksql
Spark SQL Part 1 : I am going to start spark sql sessions as series. #sparksql #deltalake #pyspark ' Databricks Notebooks code for ... source
-
ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft
Q13. How can you optimize the performance of an Azure Data Factory pipeline? Boost the performance of your Azure Data ... source
-
ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft
Q23. How did you handle a situation where a pipeline needed to run based on specific business events? Running pipelines ... source
-
GCP Interview Questions | Cloud Data Engineer #gcpdataengineer #databricks #pyspark #gcp
Q12. How to handle schema evolution and versioning in a data lake architecture on GCP? Learn how to manage schema ... source
-
Продвинутый анализ на PySpark: учимся работать с рекуррентными соотношениями
Обработка и анализ временных последовательностей (временных рядов) достаточно часто встречающаяся задача. Обычно она решается с помощью идентичных подходов и методов. Однако когда анализ временного ряда предполагает выражение каждого последующего элемента через предыдущие, возникают проблемы с эффективностью реализации такого анализа. Это особенно актуально в контексте больших данных. В данной статье я продемонстрирую подход к анализу и вычислению рекуррентных соотношений. В качестве примера будет представлена реализация на базе Apache Spark и Python метода экспоненциальной скользящей средней с использованием DataFrame API. Мы рассмотрим метод агрегации данных, совместимый со Spark Connect, который был добавлен в версию 3.1 (для Scala - начиная с версии фреймворка 3.0), а именно – функцию aggregate.
https://habr.com/ru/companies/axenix/articles/952278/
#apache_spark #pyspark #python #рекуррентные_соотношения #временные_ряды #анализ_данных #spark_connect
-
PySpark Data Bricks Syntax Cheat Sheet #pyspark #python #databricks
PySpark Syntax Cheat Sheet: I have covered the below operators/function from PySpark: 1. Drop table if already present 2. Create ... source
https://quadexcel.com/wp/pyspark-data-bricks-syntax-cheat-sheet-pyspark-python-databricks/
-
Что нового в Apache Spark 4.0
Apache Spark — это мощный фреймворк для распределённой обработки больших объёмов данных, позволяющий выполнять сложные вычисления на кластерах компьютеров с высокой производительностью и гибкостью. И вот 23 мая 2025 года компания Apache выпустила новую версию Spark 4. Стоит отметить, что Apache Spark — масштабный фреймворк с широким функционалом. В данной статье я сосредоточусь на нововведениях, которые в первую очередь затронут пользователей Spark SQL и PySpark.
https://habr.com/ru/companies/korus_consulting/articles/920766/
-
Spark on Kubernetes: наш путь к автоматизации через кастомный оператор Airflow
Всем привет! Меня зовут Дмитрий Третьяков, я ML Engineer в компании «Лента». Мы регулярно запускаем PySpark-приложения в Kubernetes-кластере, используя Airflow. Этот процесс важен для нашей ежедневной работы с данными, но в какой-то момент мы столкнулись с тем, что стандартный подход через SparkKubernetesOperator стал сдерживать развитие: не хватало гибкости, возникали сложности в сопровождении и процесс настройки был излишне сложным для разработчиков.
https://habr.com/ru/companies/lentatech/articles/914884/
#airflow #kubernetes #python3 #pyspark #dags #operator #spark #mlops #big_data #orchestrator
-
【AWS Glue】Glueジョブでdynamic_frameをソースに利用したらキャストエラーで困った話
https://dev.classmethod.jp/articles/aws-glue-glue-dynamic-frame-cast-error/#dev_classmethod #AWS_Glue #Apache_Spark #PySpark #Apache_Iceberg
-
Повышаем эффективность хранения данных до 300 раз с помощью таблиц SCD-2
Всем привет, меня зовут Василий. С 2021 года работаю в роли инженера данных в Х5 Tech, успел за это время познакомиться с несколькими интересными проектами и подходами в области обработки данных, об одном из которых пойдет речь далее. В этой статье расскажу о том, как можно повысить эффективность хранения данных за счет уменьшения их дублирования. Разберем, что из себя представляют Slowly Changing Dimensions-2 (далее SCD-2) таблицы и самостоятельно реализуем на PySpark алгоритм сохранения данных в них. Попутно поговорим о том, как находить изменения в любой таблице, даже если отсутствуют поля для выбора изменившихся записей, и научимся получать из созданной SCD-2 таблицы срезы на требуемую дату в прошлом.
https://habr.com/ru/companies/X5Tech/articles/911716/
#SCD #spark #python #обработка_данных #хранение_данных #нахождение_дельты #история_изменений #алгоритм_нахождения_изменений #pyspark #сжатие_данных
-
AWS Glue for Spark のジョブから、AWS CodeArtifact を経由して PyPI のライブラリをインストールする
https://dev.classmethod.jp/articles/aws-glue-for-spark-aws-codeartifact-pypi/#dev_classmethod #AWS_Glue #AWS_CodeArtifact #PyPI #Spark #PySpark
-
Контролируем качество данных с помощью Python
В работе с данными одной из самых больших трудностей является обеспечение их качества. В процессе анализа и обработки информации приходится сталкиваться с множеством проблем, таких как отсутствие нужных значений, неправильно отформатированные данные или ошибки, появляющиеся при сборе данных с веб-ресурсов. В этой статье мы рассмотрим, как с помощью Python можно автоматизировать процесс проверки и очистки данных, используя популярные библиотеки, такие как pandas и pyspark. Мы исследуем практические подходы к подготовке данных для анализа, включая поиск аномалий, постобработку и работу с пустыми значениями, что поможет обеспечить высокое качество данных для дальнейших исследований и принятия решений.
https://habr.com/ru/companies/otus/articles/903634/
#qa #data_analysis #качество_данных #аналитика_данных #Python_для_анализа_данных #pandas #Pyspark #Очистка_данных #Аномалии_в_данных
-
AWS Glue 5.0からPythonのライブラリをrequirements.txtで指定できるようになったので検証してみた
https://dev.classmethod.jp/articles/aws-glue5-python-requirements-txt/ -
AWS Glue for Spark のチュートリアルをやってみた(ワークアラウンドとデータ確認手順付き)
https://dev.classmethod.jp/articles/aws-glue-for-spark-tutorial/ -
AWS Glue for SparkからDatabricksのテーブルにアクセスしてみた
https://dev.classmethod.jp/articles/aws-glue-for-spark-databricks/ -
【Databricks】Auto LoaderとDLTを利用してS3に連携されるファイルで増分更新・洗い替えをしてみた
https://dev.classmethod.jp/articles/databricks-auto-loader-dlt-s3/ -
DatabricksのUnity Catalogを利用してS3にDelta Lakeを構築する
https://dev.classmethod.jp/articles/databricks-unity-catalog-s3-delta-lake/#dev_classmethod #Databricks #Amazon_S3 #Apache_Parquet #PySpark #AWS
-
What is Apache Spark? Learn Apache Spark in 15 Minutes
apachespark #databricks #sparkteam #dataengineering #pyspark #architecture In this video, I have covered the most important ... source
https://quadexcel.com/wp/what-is-apache-spark-learn-apache-spark-in-15-minutes/
-
Es peor que lo que pensábamos. El PR (Pull Request) de la corrección de ese bug se hizo en octubre del 2023, va para la version 3.0 y la última liberada de #Pandas es la 2.2.2
No me dejen empezar con #PySpark que es otro manojo de incoherencias. #OdioPython
EDICION
Era 2023, no 2024. Pa’ mas piedra! -
Опыт Звука: как реализовать рекомендательную систему аудиокниг с использованием больших языковых моделей (LLM)
Всем привет! На связи Дмитрий Берестнев , Chief Data Scientist в HiFi-стриминге Звук . Сегодня я расскажу о том, как мы реализовали систему подбора аудиокниг и зачем это вообще было сделано. В статье мы фокусируемся на принципе рекомендации похожих книг (а подходы для авторов в нашем случае были сделаны аналогично).
https://habr.com/ru/companies/zvuk/articles/869664/
#ml #llm #recsys #python #qdrant #векторы #hadoop #s3 #presto #pyspark