#pyspark — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #pyspark, aggregated by home.social.
-
От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»
Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.
https://habr.com/ru/companies/magnit/articles/1056372/
#data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake
-
🔍 Spark + Elasticsearch Debugging 🧵
Building a cybersecurity analytics platform. Hit 2 blockers:
❌ JAR path mismatch → Fixed absolute path
❌ No data nodes (single-node Docker ES) → Added es.nodes.wan.only=true✅ Result: 89 records loaded. Working pipeline!
Lesson: Verify JAR paths + disable node discovery for single-node ES.
#PySpark #Elasticsearch #DataEngineering #CyberSecurity #Debugging
-
@thealexmerced thanks! Added to wish list in manning. Better 2buy there vs Amazon to get the ai features?
I guess Manning got rid of old option to buy coins 2 read individual pages? was a cool feature 2 bad.
Thanks for reminder about #datafusion i guess it & #polars have excellent #iceberg support & can be used from #rust
I was thinking about replacing a #pyspark glue job with a rust #lambda on #aws
Just found your excellent medium account. Best of luck at your upcoming talk!
-
Built an end-to-end data pipeline using GCP, Airflow, PySpark, and BigQuery to analyze thermal anomaly data (India 🇮🇳 vs USA 🇺🇸).
Uncovered patterns in fire frequency, intensity, and seasonality through interactive dashboards.
#DataEngineering #GCP #Airflow #BigQuery #PySpark -
ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft
Q2. What are the main components of Azure Data Factory? Learn about the main components of Azure Data Factory! This video ... source
-
ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft
Q2. What are the main components of Azure Data Factory? Learn about the main components of Azure Data Factory! This video ... source
-
Spark SQL for Data Engineering 1 : I am going to start spark sql sessions as series. #sparksql
Spark SQL Part 1 : I am going to start spark sql sessions as series. #sparksql #deltalake #pyspark ' Databricks Notebooks code for ... source
-
Spark SQL for Data Engineering 1 : I am going to start spark sql sessions as series. #sparksql
Spark SQL Part 1 : I am going to start spark sql sessions as series. #sparksql #deltalake #pyspark ' Databricks Notebooks code for ... source
-
ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft
Q13. How can you optimize the performance of an Azure Data Factory pipeline? Boost the performance of your Azure Data ... source
-
ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft
Q23. How did you handle a situation where a pipeline needed to run based on specific business events? Running pipelines ... source
-
GCP Interview Questions | Cloud Data Engineer #gcpdataengineer #databricks #pyspark #gcp
Q12. How to handle schema evolution and versioning in a data lake architecture on GCP? Learn how to manage schema ... source
-
Продвинутый анализ на PySpark: учимся работать с рекуррентными соотношениями
Обработка и анализ временных последовательностей (временных рядов) достаточно часто встречающаяся задача. Обычно она решается с помощью идентичных подходов и методов. Однако когда анализ временного ряда предполагает выражение каждого последующего элемента через предыдущие, возникают проблемы с эффективностью реализации такого анализа. Это особенно актуально в контексте больших данных. В данной статье я продемонстрирую подход к анализу и вычислению рекуррентных соотношений. В качестве примера будет представлена реализация на базе Apache Spark и Python метода экспоненциальной скользящей средней с использованием DataFrame API. Мы рассмотрим метод агрегации данных, совместимый со Spark Connect, который был добавлен в версию 3.1 (для Scala - начиная с версии фреймворка 3.0), а именно – функцию aggregate.
https://habr.com/ru/companies/axenix/articles/952278/
#apache_spark #pyspark #python #рекуррентные_соотношения #временные_ряды #анализ_данных #spark_connect
-
PySpark Data Bricks Syntax Cheat Sheet #pyspark #python #databricks
PySpark Syntax Cheat Sheet: I have covered the below operators/function from PySpark: 1. Drop table if already present 2. Create ... source
https://quadexcel.com/wp/pyspark-data-bricks-syntax-cheat-sheet-pyspark-python-databricks/
-
Что нового в Apache Spark 4.0
Apache Spark — это мощный фреймворк для распределённой обработки больших объёмов данных, позволяющий выполнять сложные вычисления на кластерах компьютеров с высокой производительностью и гибкостью. И вот 23 мая 2025 года компания Apache выпустила новую версию Spark 4. Стоит отметить, что Apache Spark — масштабный фреймворк с широким функционалом. В данной статье я сосредоточусь на нововведениях, которые в первую очередь затронут пользователей Spark SQL и PySpark.
https://habr.com/ru/companies/korus_consulting/articles/920766/
-
Spark on Kubernetes: наш путь к автоматизации через кастомный оператор Airflow
Всем привет! Меня зовут Дмитрий Третьяков, я ML Engineer в компании «Лента». Мы регулярно запускаем PySpark-приложения в Kubernetes-кластере, используя Airflow. Этот процесс важен для нашей ежедневной работы с данными, но в какой-то момент мы столкнулись с тем, что стандартный подход через SparkKubernetesOperator стал сдерживать развитие: не хватало гибкости, возникали сложности в сопровождении и процесс настройки был излишне сложным для разработчиков.
https://habr.com/ru/companies/lentatech/articles/914884/
#airflow #kubernetes #python3 #pyspark #dags #operator #spark #mlops #big_data #orchestrator
-
【AWS Glue】Glueジョブでdynamic_frameをソースに利用したらキャストエラーで困った話
https://dev.classmethod.jp/articles/aws-glue-glue-dynamic-frame-cast-error/#dev_classmethod #AWS_Glue #Apache_Spark #PySpark #Apache_Iceberg
-
Повышаем эффективность хранения данных до 300 раз с помощью таблиц SCD-2
Всем привет, меня зовут Василий. С 2021 года работаю в роли инженера данных в Х5 Tech, успел за это время познакомиться с несколькими интересными проектами и подходами в области обработки данных, об одном из которых пойдет речь далее. В этой статье расскажу о том, как можно повысить эффективность хранения данных за счет уменьшения их дублирования. Разберем, что из себя представляют Slowly Changing Dimensions-2 (далее SCD-2) таблицы и самостоятельно реализуем на PySpark алгоритм сохранения данных в них. Попутно поговорим о том, как находить изменения в любой таблице, даже если отсутствуют поля для выбора изменившихся записей, и научимся получать из созданной SCD-2 таблицы срезы на требуемую дату в прошлом.
https://habr.com/ru/companies/X5Tech/articles/911716/
#SCD #spark #python #обработка_данных #хранение_данных #нахождение_дельты #история_изменений #алгоритм_нахождения_изменений #pyspark #сжатие_данных
-
AWS Glue for Spark のジョブから、AWS CodeArtifact を経由して PyPI のライブラリをインストールする
https://dev.classmethod.jp/articles/aws-glue-for-spark-aws-codeartifact-pypi/#dev_classmethod #AWS_Glue #AWS_CodeArtifact #PyPI #Spark #PySpark
-
Контролируем качество данных с помощью Python
В работе с данными одной из самых больших трудностей является обеспечение их качества. В процессе анализа и обработки информации приходится сталкиваться с множеством проблем, таких как отсутствие нужных значений, неправильно отформатированные данные или ошибки, появляющиеся при сборе данных с веб-ресурсов. В этой статье мы рассмотрим, как с помощью Python можно автоматизировать процесс проверки и очистки данных, используя популярные библиотеки, такие как pandas и pyspark. Мы исследуем практические подходы к подготовке данных для анализа, включая поиск аномалий, постобработку и работу с пустыми значениями, что поможет обеспечить высокое качество данных для дальнейших исследований и принятия решений.
https://habr.com/ru/companies/otus/articles/903634/
#qa #data_analysis #качество_данных #аналитика_данных #Python_для_анализа_данных #pandas #Pyspark #Очистка_данных #Аномалии_в_данных
-
AWS Glue 5.0からPythonのライブラリをrequirements.txtで指定できるようになったので検証してみた
https://dev.classmethod.jp/articles/aws-glue5-python-requirements-txt/ -
AWS Glue for Spark のチュートリアルをやってみた(ワークアラウンドとデータ確認手順付き)
https://dev.classmethod.jp/articles/aws-glue-for-spark-tutorial/ -
AWS Glue for SparkからDatabricksのテーブルにアクセスしてみた
https://dev.classmethod.jp/articles/aws-glue-for-spark-databricks/ -
【Databricks】Auto LoaderとDLTを利用してS3に連携されるファイルで増分更新・洗い替えをしてみた
https://dev.classmethod.jp/articles/databricks-auto-loader-dlt-s3/ -
DatabricksのUnity Catalogを利用してS3にDelta Lakeを構築する
https://dev.classmethod.jp/articles/databricks-unity-catalog-s3-delta-lake/#dev_classmethod #Databricks #Amazon_S3 #Apache_Parquet #PySpark #AWS
-
What is Apache Spark? Learn Apache Spark in 15 Minutes
apachespark #databricks #sparkteam #dataengineering #pyspark #architecture In this video, I have covered the most important ... source
https://quadexcel.com/wp/what-is-apache-spark-learn-apache-spark-in-15-minutes/
-
Es peor que lo que pensábamos. El PR (Pull Request) de la corrección de ese bug se hizo en octubre del 2023, va para la version 3.0 y la última liberada de #Pandas es la 2.2.2
No me dejen empezar con #PySpark que es otro manojo de incoherencias. #OdioPython
EDICION
Era 2023, no 2024. Pa’ mas piedra! -
Опыт Звука: как реализовать рекомендательную систему аудиокниг с использованием больших языковых моделей (LLM)
Всем привет! На связи Дмитрий Берестнев , Chief Data Scientist в HiFi-стриминге Звук . Сегодня я расскажу о том, как мы реализовали систему подбора аудиокниг и зачем это вообще было сделано. В статье мы фокусируемся на принципе рекомендации похожих книг (а подходы для авторов в нашем случае были сделаны аналогично).
https://habr.com/ru/companies/zvuk/articles/869664/
#ml #llm #recsys #python #qdrant #векторы #hadoop #s3 #presto #pyspark
-
Tomorrow will be the 10 month anniversary for the open-source book "Introduction to pyspark" 🥳 🎉🎉🎉.
This is an open and introductory book for the Python API of Apache Spark (pyspark).
Link to book project: https://github.com/pedropark99/Introd-pyspark
@Python @pythonhub #pyspark #python #community #datascience #data #spark #apache #bigdata #programming #book #tech #technology
-
🚀 Get ready for an insightful session with Sandra Oriji at 🐍PyCon Africa 2024! Discover the magic of #PySpark for data cleaning, transformation, and action operations on DataFrames. 🌟
🗓Date: Sept 24-28, 2024
📍 Location: Cedi Conference Center, University of Ghana 🇬🇭About the speaker:🔗https://africa.pycon.org/2024/speakers/L06yZrg/
🎟Hurry get your tickets at https://africa.pycon.org/2024/tickets/
-
Trying to pull documents from ElasticSearch using Pyspark on AWS Glue and… it's not pretty for debugging your problems!
Currently getting schema issues as it tries to parse nested fields and lists. But I don't know of a way to test locally, so I've got to keep editing and running Glue jobs.
-
A QuantumBlack team helped bring PySpark SQL support to pandera 👏🏼 we are so proud of this open source contribution and hope to keep them coming!
https://www.kdnuggets.com/2023/08/data-validation-pyspark-applications-pandera.html
-
New blog post: How to integrate Kedro and Databricks Connect 🔶
In this blog post, our colleague Diego Lira explains how to use Databricks Connect with Kedro for a development experience that works completely inside an IDE.
https://kedro.org/blog/how-to-integrate-kedro-and-databricks-connect
Install it with
```
pip install databricks-connect
```#kedro #python #pydata #datascience #databricks #dbx #spark #pyspark
-
🔥 Excited to share my latest article, "Lessons Learnt from PySpark Notebooks and Extracting APIs"! 🚀✨
📝 In this article, I explore my experience with PySpark Notebooks and the process of extracting APIs. 💡💻
🔎 Throughout my journey, I encountered challenges and gained valuable insights that I'd like to share with you. Whether you're a PySpark enthusiast or just getting started, there's something here for everyone! 📚🔬
🔗 Read the full article on my website Datameerkat and expand your PySpark skills today! Link: https://datameerkat.com/lessons-learnt-from-pyspark-notebooks-and-exctracting-apis
📖✨ I'd love to hear your thoughts, so feel free to leave a comment, and let's connect. 💬🤝
#DataScience #PySpark #Notebooks #APIs #DataManipulation #DataVisualization #Article #DataMeerkat #PowerBI #MicrosoftFabric
Looking forward to connecting with you all! 🌐📲 Let's dive into the world of PySpark together! 🚀💻
-
📝 "Bulk load to Elastic Search with PySpark"
👤 Valery C. Briz (@valerybriz)
🔗 https://dev.to/valerybriz/bulk-load-to-elastic-search-with-pyspark-2ohj
-
kedro-datasets 1.4.0 is out! 🔶 With a new SparkStreamingDataSet!
kedro-datasets is a separate PyPI package where Kedro datasets live. ⚠️ Notice that `kedro.extras.datasets` is deprecated and will be removed in Kedro 0.19, so install the new package now!
```
pip install "kedro-datasets==1.4.0"
```