home.social

#pyspark — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #pyspark, aggregated by home.social.

fetched live
  1. Как превратить LLM-разметку в универсальный Spark-пайплайн

    TL;DR: мы сделали llm_markup — Spark-приложение для массовой обработки данных через LLM API в существующем Airflow-контуре. Источник данных, промпт, формат ответа, лимиты и целевая таблица задаются конфигурацией. Инструмент берет на себя батчинг, распределение запросов, контроль нагрузки на API, валидацию ответов и сопоставление результата с исходными строками. Меня зовут Дима Иванов, я дата-инженер в Lamoda Tech. Я работал над llm_markup и в этой статье расскажу, как мы пришли к его архитектуре и какие задачи пришлось решить, чтобы инструмент стабильно работал в продакшене. Разберем это на двух примерах: оценке качества поиска и классификации негативных отзывов.

    habr.com/ru/companies/lamoda/a

    #data_engineering #llm #spark #pyspark #openaicompatible_api #llmразметка #обработка_текстов #распределённая_обработка_данных #data_pipelines

  2. Как превратить LLM-разметку в универсальный Spark-пайплайн

    TL;DR: мы сделали llm_markup — Spark-приложение для массовой обработки данных через LLM API в существующем Airflow-контуре. Источник данных, промпт, формат ответа, лимиты и целевая таблица задаются конфигурацией. Инструмент берет на себя батчинг, распределение запросов, контроль нагрузки на API, валидацию ответов и сопоставление результата с исходными строками. Меня зовут Дима Иванов, я дата-инженер в Lamoda Tech. Я работал над llm_markup и в этой статье расскажу, как мы пришли к его архитектуре и какие задачи пришлось решить, чтобы инструмент стабильно работал в продакшене. Разберем это на двух примерах: оценке качества поиска и классификации негативных отзывов.

    habr.com/ru/companies/lamoda/a

    #data_engineering #llm #spark #pyspark #openaicompatible_api #llmразметка #обработка_текстов #распределённая_обработка_данных #data_pipelines

  3. Как превратить LLM-разметку в универсальный Spark-пайплайн

    TL;DR: мы сделали llm_markup — Spark-приложение для массовой обработки данных через LLM API в существующем Airflow-контуре. Источник данных, промпт, формат ответа, лимиты и целевая таблица задаются конфигурацией. Инструмент берет на себя батчинг, распределение запросов, контроль нагрузки на API, валидацию ответов и сопоставление результата с исходными строками. Меня зовут Дима Иванов, я дата-инженер в Lamoda Tech. Я работал над llm_markup и в этой статье расскажу, как мы пришли к его архитектуре и какие задачи пришлось решить, чтобы инструмент стабильно работал в продакшене. Разберем это на двух примерах: оценке качества поиска и классификации негативных отзывов.

    habr.com/ru/companies/lamoda/a

    #data_engineering #llm #spark #pyspark #openaicompatible_api #llmразметка #обработка_текстов #распределённая_обработка_данных #data_pipelines

  4. От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»

    Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.

    habr.com/ru/companies/magnit/a

    #data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake

  5. От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»

    Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.

    habr.com/ru/companies/magnit/a

    #data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake

  6. От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»

    Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.

    habr.com/ru/companies/magnit/a

    #data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake

  7. 🔍 Spark + Elasticsearch Debugging 🧵

    Building a cybersecurity analytics platform. Hit 2 blockers:

    ❌ JAR path mismatch → Fixed absolute path
    ❌ No data nodes (single-node Docker ES) → Added es.nodes.wan.only=true

    ✅ Result: 89 records loaded. Working pipeline!

    Lesson: Verify JAR paths + disable node discovery for single-node ES.

    #PySpark #Elasticsearch #DataEngineering #CyberSecurity #Debugging

  8. 🔍 Spark + Elasticsearch Debugging 🧵

    Building a cybersecurity analytics platform. Hit 2 blockers:

    ❌ JAR path mismatch → Fixed absolute path
    ❌ No data nodes (single-node Docker ES) → Added es.nodes.wan.only=true

    ✅ Result: 89 records loaded. Working pipeline!

    Lesson: Verify JAR paths + disable node discovery for single-node ES.

    #PySpark #Elasticsearch #DataEngineering #CyberSecurity #Debugging

  9. @thealexmerced thanks! Added to wish list in manning. Better 2buy there vs Amazon to get the ai features?

    I guess Manning got rid of old option to buy coins 2 read individual pages? was a cool feature 2 bad.

    Thanks for reminder about #datafusion i guess it & #polars have excellent #iceberg support & can be used from #rust

    I was thinking about replacing a #pyspark glue job with a rust #lambda on #aws

    Just found your excellent medium account. Best of luck at your upcoming talk!

  10. @thealexmerced thanks! Added to wish list in manning. Better 2buy there vs Amazon to get the ai features?

    I guess Manning got rid of old option to buy coins 2 read individual pages? was a cool feature 2 bad.

    Thanks for reminder about #datafusion i guess it & #polars have excellent #iceberg support & can be used from #rust

    I was thinking about replacing a #pyspark glue job with a rust #lambda on #aws

    Just found your excellent medium account. Best of luck at your upcoming talk!

  11. Built an end-to-end data pipeline using GCP, Airflow, PySpark, and BigQuery to analyze thermal anomaly data (India 🇮🇳 vs USA 🇺🇸).
    Uncovered patterns in fire frequency, intensity, and seasonality through interactive dashboards.
    #DataEngineering #GCP #Airflow #BigQuery #PySpark

  12. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q2. What are the main components of Azure Data Factory? Learn about the main components of Azure Data Factory! This video ... source

    quadexcel.com/wp/adf-interview

  13. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q2. What are the main components of Azure Data Factory? Learn about the main components of Azure Data Factory! This video ... source

    quadexcel.com/wp/adf-interview

  14. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q2. What are the main components of Azure Data Factory? Learn about the main components of Azure Data Factory! This video ... source

    quadexcel.com/wp/adf-interview

  15. Spark SQL for Data Engineering 1 : I am going to start spark sql sessions as series. #sparksql

    Spark SQL Part 1 : I am going to start spark sql sessions as series. #sparksql #deltalake #pyspark ' Databricks Notebooks code for ... source

    quadexcel.com/wp/spark-sql-for

  16. Spark SQL for Data Engineering 1 : I am going to start spark sql sessions as series. #sparksql

    Spark SQL Part 1 : I am going to start spark sql sessions as series. #sparksql #deltalake #pyspark ' Databricks Notebooks code for ... source

    quadexcel.com/wp/spark-sql-for

  17. Spark SQL for Data Engineering 1 : I am going to start spark sql sessions as series. #sparksql

    Spark SQL Part 1 : I am going to start spark sql sessions as series. #sparksql #deltalake #pyspark ' Databricks Notebooks code for ... source

    quadexcel.com/wp/spark-sql-for

  18. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q13. How can you optimize the performance of an Azure Data Factory pipeline? Boost the performance of your Azure Data ... source

    quadexcel.com/wp/adf-interview

  19. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q13. How can you optimize the performance of an Azure Data Factory pipeline? Boost the performance of your Azure Data ... source

    quadexcel.com/wp/adf-interview

  20. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q23. How did you handle a situation where a pipeline needed to run based on specific business events? Running pipelines ... source

    quadexcel.com/wp/adf-interview

  21. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q23. How did you handle a situation where a pipeline needed to run based on specific business events? Running pipelines ... source

    quadexcel.com/wp/adf-interview

  22. GCP Interview Questions | Cloud Data Engineer #gcpdataengineer #databricks #pyspark #gcp

    Q12. How to handle schema evolution and versioning in a data lake architecture on GCP? Learn how to manage schema ... source

    quadexcel.com/wp/gcp-interview

  23. GCP Interview Questions | Cloud Data Engineer #gcpdataengineer #databricks #pyspark #gcp

    Q12. How to handle schema evolution and versioning in a data lake architecture on GCP? Learn how to manage schema ... source

    quadexcel.com/wp/gcp-interview

  24. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q10. How do you implement parameterization in an Azure Data Factory pipeline? Learn how to implement parameterization in ... source

    quadexcel.com/wp/adf-interview

  25. Продвинутый анализ на PySpark: учимся работать с рекуррентными соотношениями

    Обработка и анализ временных последовательностей (временных рядов) достаточно часто встречающаяся задача. Обычно она решается с помощью идентичных подходов и методов. Однако когда анализ временного ряда предполагает выражение каждого последующего элемента через предыдущие, возникают проблемы с эффективностью реализации такого анализа. Это особенно актуально в контексте больших данных. В данной статье я продемонстрирую подход к анализу и вычислению рекуррентных соотношений. В качестве примера будет представлена реализация на базе Apache Spark и Python метода экспоненциальной скользящей средней с использованием DataFrame API. Мы рассмотрим метод агрегации данных, совместимый со Spark Connect, который был добавлен в версию 3.1 (для Scala - начиная с версии фреймворка 3.0), а именно – функцию aggregate.

    habr.com/ru/companies/axenix/a

    #apache_spark #pyspark #python #рекуррентные_соотношения #временные_ряды #анализ_данных #spark_connect

  26. Продвинутый анализ на PySpark: учимся работать с рекуррентными соотношениями

    Обработка и анализ временных последовательностей (временных рядов) достаточно часто встречающаяся задача. Обычно она решается с помощью идентичных подходов и методов. Однако когда анализ временного ряда предполагает выражение каждого последующего элемента через предыдущие, возникают проблемы с эффективностью реализации такого анализа. Это особенно актуально в контексте больших данных. В данной статье я продемонстрирую подход к анализу и вычислению рекуррентных соотношений. В качестве примера будет представлена реализация на базе Apache Spark и Python метода экспоненциальной скользящей средней с использованием DataFrame API. Мы рассмотрим метод агрегации данных, совместимый со Spark Connect, который был добавлен в версию 3.1 (для Scala - начиная с версии фреймворка 3.0), а именно – функцию aggregate.

    habr.com/ru/companies/axenix/a

    #apache_spark #pyspark #python #рекуррентные_соотношения #временные_ряды #анализ_данных #spark_connect

  27. Продвинутый анализ на PySpark: учимся работать с рекуррентными соотношениями

    Обработка и анализ временных последовательностей (временных рядов) достаточно часто встречающаяся задача. Обычно она решается с помощью идентичных подходов и методов. Однако когда анализ временного ряда предполагает выражение каждого последующего элемента через предыдущие, возникают проблемы с эффективностью реализации такого анализа. Это особенно актуально в контексте больших данных. В данной статье я продемонстрирую подход к анализу и вычислению рекуррентных соотношений. В качестве примера будет представлена реализация на базе Apache Spark и Python метода экспоненциальной скользящей средней с использованием DataFrame API. Мы рассмотрим метод агрегации данных, совместимый со Spark Connect, который был добавлен в версию 3.1 (для Scala - начиная с версии фреймворка 3.0), а именно – функцию aggregate.

    habr.com/ru/companies/axenix/a

    #apache_spark #pyspark #python #рекуррентные_соотношения #временные_ряды #анализ_данных #spark_connect

  28. Part 1 : #PySpark Data Pre-processing Essentials #filtering || #Deduplication || Data Cleansing.

    Learn PySpark data pre-processing with our tutorial! Learn the art of filtering and deduplication, essential techniques for cleaning ... source

    quadexcel.com/wp/part-1-pyspar

  29. PySpark Data Bricks Syntax Cheat Sheet #pyspark #python #databricks

    PySpark Syntax Cheat Sheet: I have covered the below operators/function from PySpark: 1. Drop table if already present 2. Create ... source

    quadexcel.com/wp/pyspark-data-

  30. PySpark Data Bricks Syntax Cheat Sheet #pyspark #python #databricks

    PySpark Syntax Cheat Sheet: I have covered the below operators/function from PySpark: 1. Drop table if already present 2. Create ... source

    quadexcel.com/wp/pyspark-data-

  31. PySpark Data Bricks Syntax Cheat Sheet #pyspark #python #databricks

    PySpark Syntax Cheat Sheet: I have covered the below operators/function from PySpark: 1. Drop table if already present 2. Create ... source

    quadexcel.com/wp/pyspark-data-

  32. PySpark Data Bricks Syntax Cheat Sheet #pyspark #python #databricks

    PySpark Syntax Cheat Sheet: I have covered the below operators/function from PySpark: 1. Drop table if already present 2. Create ... source

    quadexcel.com/wp/pyspark-data-

  33. ADF Interview Questions | Cloud Data Engineer #databricks #pyspark #adf #datafactory #microsoft

    Q58. How can we implement parallel processing in Azure Data Factory Pipeline? ADF Parallel: ForEach & Copy Activity! ⚙️ Run ... source

    quadexcel.com/wp/adf-interview

  34. Что нового в Apache Spark 4.0

    Apache Spark — это мощный фреймворк для распределённой обработки больших объёмов данных, позволяющий выполнять сложные вычисления на кластерах компьютеров с высокой производительностью и гибкостью. И вот 23 мая 2025 года компания Apache выпустила новую версию Spark 4. Стоит отметить, что Apache Spark — масштабный фреймворк с широким функционалом. В данной статье я сосредоточусь на нововведениях, которые в первую очередь затронут пользователей Spark SQL и PySpark.

    habr.com/ru/companies/korus_co

    #bigdata #sql #pyspark #spark #релиз

  35. Что нового в Apache Spark 4.0

    Apache Spark — это мощный фреймворк для распределённой обработки больших объёмов данных, позволяющий выполнять сложные вычисления на кластерах компьютеров с высокой производительностью и гибкостью. И вот 23 мая 2025 года компания Apache выпустила новую версию Spark 4. Стоит отметить, что Apache Spark — масштабный фреймворк с широким функционалом. В данной статье я сосредоточусь на нововведениях, которые в первую очередь затронут пользователей Spark SQL и PySpark.

    habr.com/ru/companies/korus_co

    #bigdata #sql #pyspark #spark #релиз

  36. Что нового в Apache Spark 4.0

    Apache Spark — это мощный фреймворк для распределённой обработки больших объёмов данных, позволяющий выполнять сложные вычисления на кластерах компьютеров с высокой производительностью и гибкостью. И вот 23 мая 2025 года компания Apache выпустила новую версию Spark 4. Стоит отметить, что Apache Spark — масштабный фреймворк с широким функционалом. В данной статье я сосредоточусь на нововведениях, которые в первую очередь затронут пользователей Spark SQL и PySpark.

    habr.com/ru/companies/korus_co

    #bigdata #sql #pyspark #spark #релиз

  37. Google’s Data Engineering workflow for YouTube Recommendation system! #dataengineering #pyspark

    Join this channel to get access to perks: – – – Book a ... source

    quadexcel.com/wp/googles-data-

  38. Spark on Kubernetes: наш путь к автоматизации через кастомный оператор Airflow

    Всем привет! Меня зовут Дмитрий Третьяков, я ML Engineer в компании «Лента». Мы регулярно запускаем PySpark-приложения в Kubernetes-кластере, используя Airflow. Этот процесс важен для нашей ежедневной работы с данными, но в какой-то момент мы столкнулись с тем, что стандартный подход через SparkKubernetesOperator стал сдерживать развитие: не хватало гибкости, возникали сложности в сопровождении и процесс настройки был излишне сложным для разработчиков.

    habr.com/ru/companies/lentatec

    #airflow #kubernetes #python3 #pyspark #dags #operator #spark #mlops #big_data #orchestrator

  39. Spark on Kubernetes: наш путь к автоматизации через кастомный оператор Airflow

    Всем привет! Меня зовут Дмитрий Третьяков, я ML Engineer в компании «Лента». Мы регулярно запускаем PySpark-приложения в Kubernetes-кластере, используя Airflow. Этот процесс важен для нашей ежедневной работы с данными, но в какой-то момент мы столкнулись с тем, что стандартный подход через SparkKubernetesOperator стал сдерживать развитие: не хватало гибкости, возникали сложности в сопровождении и процесс настройки был излишне сложным для разработчиков.

    habr.com/ru/companies/lentatec

    #airflow #kubernetes #python3 #pyspark #dags #operator #spark #mlops #big_data #orchestrator

  40. Spark on Kubernetes: наш путь к автоматизации через кастомный оператор Airflow

    Всем привет! Меня зовут Дмитрий Третьяков, я ML Engineer в компании «Лента». Мы регулярно запускаем PySpark-приложения в Kubernetes-кластере, используя Airflow. Этот процесс важен для нашей ежедневной работы с данными, но в какой-то момент мы столкнулись с тем, что стандартный подход через SparkKubernetesOperator стал сдерживать развитие: не хватало гибкости, возникали сложности в сопровождении и процесс настройки был излишне сложным для разработчиков.

    habr.com/ru/companies/lentatec

    #airflow #kubernetes #python3 #pyspark #dags #operator #spark #mlops #big_data #orchestrator

  41. Повышаем эффективность хранения данных до 300 раз с помощью таблиц SCD-2

    Всем привет, меня зовут Василий. С 2021 года работаю в роли инженера данных в Х5 Tech, успел за это время познакомиться с несколькими интересными проектами и подходами в области обработки данных, об одном из которых пойдет речь далее. В этой статье расскажу о том, как можно повысить эффективность хранения данных за счет уменьшения их дублирования. Разберем, что из себя представляют Slowly Changing Dimensions-2 (далее SCD-2) таблицы и самостоятельно реализуем на PySpark алгоритм сохранения данных в них. Попутно поговорим о том, как находить изменения в любой таблице, даже если отсутствуют поля для выбора изменившихся записей, и научимся получать из созданной SCD-2 таблицы срезы на требуемую дату в прошлом.

    habr.com/ru/companies/X5Tech/a

    #SCD #spark #python #обработка_данных #хранение_данных #нахождение_дельты #история_изменений #алгоритм_нахождения_изменений #pyspark #сжатие_данных

  42. Повышаем эффективность хранения данных до 300 раз с помощью таблиц SCD-2

    Всем привет, меня зовут Василий. С 2021 года работаю в роли инженера данных в Х5 Tech, успел за это время познакомиться с несколькими интересными проектами и подходами в области обработки данных, об одном из которых пойдет речь далее. В этой статье расскажу о том, как можно повысить эффективность хранения данных за счет уменьшения их дублирования. Разберем, что из себя представляют Slowly Changing Dimensions-2 (далее SCD-2) таблицы и самостоятельно реализуем на PySpark алгоритм сохранения данных в них. Попутно поговорим о том, как находить изменения в любой таблице, даже если отсутствуют поля для выбора изменившихся записей, и научимся получать из созданной SCD-2 таблицы срезы на требуемую дату в прошлом.

    habr.com/ru/companies/X5Tech/a

    #SCD #spark #python #обработка_данных #хранение_данных #нахождение_дельты #история_изменений #алгоритм_нахождения_изменений #pyspark #сжатие_данных

  43. Повышаем эффективность хранения данных до 300 раз с помощью таблиц SCD-2

    Всем привет, меня зовут Василий. С 2021 года работаю в роли инженера данных в Х5 Tech, успел за это время познакомиться с несколькими интересными проектами и подходами в области обработки данных, об одном из которых пойдет речь далее. В этой статье расскажу о том, как можно повысить эффективность хранения данных за счет уменьшения их дублирования. Разберем, что из себя представляют Slowly Changing Dimensions-2 (далее SCD-2) таблицы и самостоятельно реализуем на PySpark алгоритм сохранения данных в них. Попутно поговорим о том, как находить изменения в любой таблице, даже если отсутствуют поля для выбора изменившихся записей, и научимся получать из созданной SCD-2 таблицы срезы на требуемую дату в прошлом.

    habr.com/ru/companies/X5Tech/a

    #SCD #spark #python #обработка_данных #хранение_данных #нахождение_дельты #история_изменений #алгоритм_нахождения_изменений #pyspark #сжатие_данных

  44. Контролируем качество данных с помощью Python

    В работе с данными одной из самых больших трудностей является обеспечение их качества. В процессе анализа и обработки информации приходится сталкиваться с множеством проблем, таких как отсутствие нужных значений, неправильно отформатированные данные или ошибки, появляющиеся при сборе данных с веб-ресурсов. В этой статье мы рассмотрим, как с помощью Python можно автоматизировать процесс проверки и очистки данных, используя популярные библиотеки, такие как pandas и pyspark. Мы исследуем практические подходы к подготовке данных для анализа, включая поиск аномалий, постобработку и работу с пустыми значениями, что поможет обеспечить высокое качество данных для дальнейших исследований и принятия решений.

    habr.com/ru/companies/otus/art

    #qa #data_analysis #качество_данных #аналитика_данных #Python_для_анализа_данных #pandas #Pyspark #Очистка_данных #Аномалии_в_данных

  45. Контролируем качество данных с помощью Python

    В работе с данными одной из самых больших трудностей является обеспечение их качества. В процессе анализа и обработки информации приходится сталкиваться с множеством проблем, таких как отсутствие нужных значений, неправильно отформатированные данные или ошибки, появляющиеся при сборе данных с веб-ресурсов. В этой статье мы рассмотрим, как с помощью Python можно автоматизировать процесс проверки и очистки данных, используя популярные библиотеки, такие как pandas и pyspark. Мы исследуем практические подходы к подготовке данных для анализа, включая поиск аномалий, постобработку и работу с пустыми значениями, что поможет обеспечить высокое качество данных для дальнейших исследований и принятия решений.

    habr.com/ru/companies/otus/art

    #qa #data_analysis #качество_данных #аналитика_данных #Python_для_анализа_данных #pandas #Pyspark #Очистка_данных #Аномалии_в_данных

  46. Контролируем качество данных с помощью Python

    В работе с данными одной из самых больших трудностей является обеспечение их качества. В процессе анализа и обработки информации приходится сталкиваться с множеством проблем, таких как отсутствие нужных значений, неправильно отформатированные данные или ошибки, появляющиеся при сборе данных с веб-ресурсов. В этой статье мы рассмотрим, как с помощью Python можно автоматизировать процесс проверки и очистки данных, используя популярные библиотеки, такие как pandas и pyspark. Мы исследуем практические подходы к подготовке данных для анализа, включая поиск аномалий, постобработку и работу с пустыми значениями, что поможет обеспечить высокое качество данных для дальнейших исследований и принятия решений.

    habr.com/ru/companies/otus/art

    #qa #data_analysis #качество_данных #аналитика_данных #Python_для_анализа_данных #pandas #Pyspark #Очистка_данных #Аномалии_в_данных