home.social

#pyspark — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #pyspark, aggregated by home.social.

fetched live
  1. От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»

    Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.

    habr.com/ru/companies/magnit/a

    #data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake

  2. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q2. What are the main components of Azure Data Factory? Learn about the main components of Azure Data Factory! This video ... source

    quadexcel.com/wp/adf-interview

  3. Spark SQL for Data Engineering 1 : I am going to start spark sql sessions as series. #sparksql

    Spark SQL Part 1 : I am going to start spark sql sessions as series. #sparksql #deltalake #pyspark ' Databricks Notebooks code for ... source

    quadexcel.com/wp/spark-sql-for

  4. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q13. How can you optimize the performance of an Azure Data Factory pipeline? Boost the performance of your Azure Data ... source

    quadexcel.com/wp/adf-interview

  5. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q23. How did you handle a situation where a pipeline needed to run based on specific business events? Running pipelines ... source

    quadexcel.com/wp/adf-interview

  6. GCP Interview Questions | Cloud Data Engineer #gcpdataengineer #databricks #pyspark #gcp

    Q12. How to handle schema evolution and versioning in a data lake architecture on GCP? Learn how to manage schema ... source

    quadexcel.com/wp/gcp-interview

  7. Продвинутый анализ на PySpark: учимся работать с рекуррентными соотношениями

    Обработка и анализ временных последовательностей (временных рядов) достаточно часто встречающаяся задача. Обычно она решается с помощью идентичных подходов и методов. Однако когда анализ временного ряда предполагает выражение каждого последующего элемента через предыдущие, возникают проблемы с эффективностью реализации такого анализа. Это особенно актуально в контексте больших данных. В данной статье я продемонстрирую подход к анализу и вычислению рекуррентных соотношений. В качестве примера будет представлена реализация на базе Apache Spark и Python метода экспоненциальной скользящей средней с использованием DataFrame API. Мы рассмотрим метод агрегации данных, совместимый со Spark Connect, который был добавлен в версию 3.1 (для Scala - начиная с версии фреймворка 3.0), а именно – функцию aggregate.

    habr.com/ru/companies/axenix/a

    #apache_spark #pyspark #python #рекуррентные_соотношения #временные_ряды #анализ_данных #spark_connect

  8. PySpark Data Bricks Syntax Cheat Sheet #pyspark #python #databricks

    PySpark Syntax Cheat Sheet: I have covered the below operators/function from PySpark: 1. Drop table if already present 2. Create ... source

    quadexcel.com/wp/pyspark-data-

  9. Что нового в Apache Spark 4.0

    Apache Spark — это мощный фреймворк для распределённой обработки больших объёмов данных, позволяющий выполнять сложные вычисления на кластерах компьютеров с высокой производительностью и гибкостью. И вот 23 мая 2025 года компания Apache выпустила новую версию Spark 4. Стоит отметить, что Apache Spark — масштабный фреймворк с широким функционалом. В данной статье я сосредоточусь на нововведениях, которые в первую очередь затронут пользователей Spark SQL и PySpark.

    habr.com/ru/companies/korus_co

    #bigdata #sql #pyspark #spark #релиз

  10. Spark on Kubernetes: наш путь к автоматизации через кастомный оператор Airflow

    Всем привет! Меня зовут Дмитрий Третьяков, я ML Engineer в компании «Лента». Мы регулярно запускаем PySpark-приложения в Kubernetes-кластере, используя Airflow. Этот процесс важен для нашей ежедневной работы с данными, но в какой-то момент мы столкнулись с тем, что стандартный подход через SparkKubernetesOperator стал сдерживать развитие: не хватало гибкости, возникали сложности в сопровождении и процесс настройки был излишне сложным для разработчиков.

    habr.com/ru/companies/lentatec

    #airflow #kubernetes #python3 #pyspark #dags #operator #spark #mlops #big_data #orchestrator

  11. Повышаем эффективность хранения данных до 300 раз с помощью таблиц SCD-2

    Всем привет, меня зовут Василий. С 2021 года работаю в роли инженера данных в Х5 Tech, успел за это время познакомиться с несколькими интересными проектами и подходами в области обработки данных, об одном из которых пойдет речь далее. В этой статье расскажу о том, как можно повысить эффективность хранения данных за счет уменьшения их дублирования. Разберем, что из себя представляют Slowly Changing Dimensions-2 (далее SCD-2) таблицы и самостоятельно реализуем на PySpark алгоритм сохранения данных в них. Попутно поговорим о том, как находить изменения в любой таблице, даже если отсутствуют поля для выбора изменившихся записей, и научимся получать из созданной SCD-2 таблицы срезы на требуемую дату в прошлом.

    habr.com/ru/companies/X5Tech/a

    #SCD #spark #python #обработка_данных #хранение_данных #нахождение_дельты #история_изменений #алгоритм_нахождения_изменений #pyspark #сжатие_данных

  12. Контролируем качество данных с помощью Python

    В работе с данными одной из самых больших трудностей является обеспечение их качества. В процессе анализа и обработки информации приходится сталкиваться с множеством проблем, таких как отсутствие нужных значений, неправильно отформатированные данные или ошибки, появляющиеся при сборе данных с веб-ресурсов. В этой статье мы рассмотрим, как с помощью Python можно автоматизировать процесс проверки и очистки данных, используя популярные библиотеки, такие как pandas и pyspark. Мы исследуем практические подходы к подготовке данных для анализа, включая поиск аномалий, постобработку и работу с пустыми значениями, что поможет обеспечить высокое качество данных для дальнейших исследований и принятия решений.

    habr.com/ru/companies/otus/art

    #qa #data_analysis #качество_данных #аналитика_данных #Python_для_анализа_данных #pandas #Pyspark #Очистка_данных #Аномалии_в_данных

  13. Es peor que lo que pensábamos. El PR (Pull Request) de la corrección de ese bug se hizo en octubre del 2023, va para la version 3.0 y la última liberada de #Pandas es la 2.2.2

    No me dejen empezar con #PySpark que es otro manojo de incoherencias. #OdioPython

    EDICION
    Era 2023, no 2024. Pa’ mas piedra!

  14. Опыт Звука: как реализовать рекомендательную систему аудиокниг с использованием больших языковых моделей (LLM)

    Всем привет! На связи Дмитрий Берестнев , Chief Data Scientist в HiFi-стриминге Звук . Сегодня я расскажу о том, как мы реализовали систему подбора аудиокниг и зачем это вообще было сделано. В статье мы фокусируемся на принципе рекомендации похожих книг (а подходы для авторов в нашем случае были сделаны аналогично).

    habr.com/ru/companies/zvuk/art

    #ml #llm #recsys #python #qdrant #векторы #hadoop #s3 #presto #pyspark