#data_engineer — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #data_engineer, aggregated by home.social.
-
От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»
Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.
https://habr.com/ru/companies/magnit/articles/1056372/
#data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake
-
От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»
Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.
https://habr.com/ru/companies/magnit/articles/1056372/
#data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake
-
От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»
Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.
https://habr.com/ru/companies/magnit/articles/1056372/
#data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake
-
Databricks Data and AI Summit 2026. Моя первая поездка в США
Недавно мне удалось посетить Data + AI Summit в Сан-Франциско в качестве Databricks MVP . Крупнейшую конференцию Databricks, посвященную данным, искусственному интеллекту. На мероприятии собралось более 30 000 участников из более чем 160 стран. Я много слышал и читал об этом саммите, но никогда не мог представить, что попаду на его. Все началось с того, что всем Databricks MVP предоставил бесплатный билет на мероприятие (стоимость билета без скидок около 1000$). Звучит конечно, здорово, но чтобы попасть нужна еще виза, билеты на самолёт и проживание в гостиннице. Хорошо хоть питание было организовано на самом мероприятии. На удивление записаться на визу в Кракове и получить её оказалось довольно просто, запись за неделю и через 2 дня уведомление, что виза одобрена, круто! Далее покупка билетов на самолёт примерно 1000$ в одну сторону и проживание в гостиннице около 150$ в сутки. К счатью моя компания приняла решние частично компенсировать расходы. Большое ей спасибо, возможно на тот момент я бы не решился поехать и выложить несколько тысяч долларов за мероприятие.
https://habr.com/ru/articles/1055724/
#databricks #dais #data_engineering #data_engineer #data_and_ai_summit
-
Databricks Data and AI Summit 2026. Моя первая поездка в США
Недавно мне удалось посетить Data + AI Summit в Сан-Франциско в качестве Databricks MVP . Крупнейшую конференцию Databricks, посвященную данным, искусственному интеллекту. На мероприятии собралось более 30 000 участников из более чем 160 стран. Я много слышал и читал об этом саммите, но никогда не мог представить, что попаду на его. Все началось с того, что всем Databricks MVP предоставил бесплатный билет на мероприятие (стоимость билета без скидок около 1000$). Звучит конечно, здорово, но чтобы попасть нужна еще виза, билеты на самолёт и проживание в гостиннице. Хорошо хоть питание было организовано на самом мероприятии. На удивление записаться на визу в Кракове и получить её оказалось довольно просто, запись за неделю и через 2 дня уведомление, что виза одобрена, круто! Далее покупка билетов на самолёт примерно 1000$ в одну сторону и проживание в гостиннице около 150$ в сутки. К счатью моя компания приняла решние частично компенсировать расходы. Большое ей спасибо, возможно на тот момент я бы не решился поехать и выложить несколько тысяч долларов за мероприятие.
https://habr.com/ru/articles/1055724/
#databricks #dais #data_engineering #data_engineer #data_and_ai_summit
-
Databricks Data and AI Summit 2026. Моя первая поездка в США
Недавно мне удалось посетить Data + AI Summit в Сан-Франциско в качестве Databricks MVP . Крупнейшую конференцию Databricks, посвященную данным, искусственному интеллекту. На мероприятии собралось более 30 000 участников из более чем 160 стран. Я много слышал и читал об этом саммите, но никогда не мог представить, что попаду на его. Все началось с того, что всем Databricks MVP предоставил бесплатный билет на мероприятие (стоимость билета без скидок около 1000$). Звучит конечно, здорово, но чтобы попасть нужна еще виза, билеты на самолёт и проживание в гостиннице. Хорошо хоть питание было организовано на самом мероприятии. На удивление записаться на визу в Кракове и получить её оказалось довольно просто, запись за неделю и через 2 дня уведомление, что виза одобрена, круто! Далее покупка билетов на самолёт примерно 1000$ в одну сторону и проживание в гостиннице около 150$ в сутки. К счатью моя компания приняла решние частично компенсировать расходы. Большое ей спасибо, возможно на тот момент я бы не решился поехать и выложить несколько тысяч долларов за мероприятие.
https://habr.com/ru/articles/1055724/
#databricks #dais #data_engineering #data_engineer #data_and_ai_summit
-
Big Data больше не для гигантов: связка Airflow + ClickHouse вытеснила Airflow + PostgreSQL
Открываю ноутбук. Захожу в метрики своего интернет-магазина. 500 тысяч посетителей в день. Каждый клик — событие. Каждый просмотр товара — строка в логах. Каждое добавление в корзину — ещё одна строка. За месяц — 15 миллионов событий. За год — почти 200 миллионов. Это не Google. Не Amazon. Это обычный средний магазин на ~100 человек. А теперь умножьте это на количество таблиц: пользователи, заказы, платежи, доставки, отзывы, просмотры, лайки, рефералы, купоны, возвраты... Поздравляю. Вы уже работаете с Big Data. В 2026 году это уже не привилегия корпораций, а стандарт ведения цифрового бизнеса. И как следствие этой "гонки вооружений" произошла тектоническая смена ориентиров. Классическая связка Airflow + PostgreSQL, которая ещё вчера считалась золотым стандартом, сегодня стремительно сдает позиции. Её место уверенно занимает дуэт Airflow + ClickHouse — технологический фундамент современной инженерии данных.
https://habr.com/ru/articles/1022460/
#clickhouse #postgresql #data_engineer #dwh #airflow #big_data #аналитика #рынок_труда #sql #python
-
Big Data больше не для гигантов: связка Airflow + ClickHouse вытеснила Airflow + PostgreSQL
Открываю ноутбук. Захожу в метрики своего интернет-магазина. 500 тысяч посетителей в день. Каждый клик — событие. Каждый просмотр товара — строка в логах. Каждое добавление в корзину — ещё одна строка. За месяц — 15 миллионов событий. За год — почти 200 миллионов. Это не Google. Не Amazon. Это обычный средний магазин на ~100 человек. А теперь умножьте это на количество таблиц: пользователи, заказы, платежи, доставки, отзывы, просмотры, лайки, рефералы, купоны, возвраты... Поздравляю. Вы уже работаете с Big Data. В 2026 году это уже не привилегия корпораций, а стандарт ведения цифрового бизнеса. И как следствие этой "гонки вооружений" произошла тектоническая смена ориентиров. Классическая связка Airflow + PostgreSQL, которая ещё вчера считалась золотым стандартом, сегодня стремительно сдает позиции. Её место уверенно занимает дуэт Airflow + ClickHouse — технологический фундамент современной инженерии данных.
https://habr.com/ru/articles/1022460/
#clickhouse #postgresql #data_engineer #dwh #airflow #big_data #аналитика #рынок_труда #sql #python
-
Big Data больше не для гигантов: связка Airflow + ClickHouse вытеснила Airflow + PostgreSQL
Открываю ноутбук. Захожу в метрики своего интернет-магазина. 500 тысяч посетителей в день. Каждый клик — событие. Каждый просмотр товара — строка в логах. Каждое добавление в корзину — ещё одна строка. За месяц — 15 миллионов событий. За год — почти 200 миллионов. Это не Google. Не Amazon. Это обычный средний магазин на ~100 человек. А теперь умножьте это на количество таблиц: пользователи, заказы, платежи, доставки, отзывы, просмотры, лайки, рефералы, купоны, возвраты... Поздравляю. Вы уже работаете с Big Data. В 2026 году это уже не привилегия корпораций, а стандарт ведения цифрового бизнеса. И как следствие этой "гонки вооружений" произошла тектоническая смена ориентиров. Классическая связка Airflow + PostgreSQL, которая ещё вчера считалась золотым стандартом, сегодня стремительно сдает позиции. Её место уверенно занимает дуэт Airflow + ClickHouse — технологический фундамент современной инженерии данных.
https://habr.com/ru/articles/1022460/
#clickhouse #postgresql #data_engineer #dwh #airflow #big_data #аналитика #рынок_труда #sql #python
-
Apache Superset 2026. Как работает Drill Down и Drill By
Работая с аналитикой, мы часто сталкиваемся с одной и той же проблемой: данные есть, но исследовать их неудобно. Представим типичную ситуацию. Есть таблица с десятками колонок и миллионами строк. Нужно понять, почему изменился какой-то показатель — например, выручка или конверсия. Обычно это превращается в цепочку SQL-запросов: сначала агрегируем данные по стране, потом по городу, потом по конкретному сегменту пользователей и тд. Если таких гипотез несколько, количество запросов быстро растёт с геометрической прогрессией. Каждый новый уровень детализации требует отдельного SQL. В какой-то момент хочется просто кликнуть по графику и мгновенно увидеть более детальные данные. Без написания нового запроса. Именно здесь на помощь приходят BI-инструменты. Один из самых популярных open-source инструментов для аналитики — Apache Superset .
https://habr.com/ru/articles/1010132/
#data_analyst #data_engineer #bi #sql #python #superset #apache
-
Apache Superset 2026. Как работает Drill Down и Drill By
Работая с аналитикой, мы часто сталкиваемся с одной и той же проблемой: данные есть, но исследовать их неудобно. Представим типичную ситуацию. Есть таблица с десятками колонок и миллионами строк. Нужно понять, почему изменился какой-то показатель — например, выручка или конверсия. Обычно это превращается в цепочку SQL-запросов: сначала агрегируем данные по стране, потом по городу, потом по конкретному сегменту пользователей и тд. Если таких гипотез несколько, количество запросов быстро растёт с геометрической прогрессией. Каждый новый уровень детализации требует отдельного SQL. В какой-то момент хочется просто кликнуть по графику и мгновенно увидеть более детальные данные. Без написания нового запроса. Именно здесь на помощь приходят BI-инструменты. Один из самых популярных open-source инструментов для аналитики — Apache Superset .
https://habr.com/ru/articles/1010132/
#data_analyst #data_engineer #bi #sql #python #superset #apache
-
Apache Superset 2026. Как работает Drill Down и Drill By
Работая с аналитикой, мы часто сталкиваемся с одной и той же проблемой: данные есть, но исследовать их неудобно. Представим типичную ситуацию. Есть таблица с десятками колонок и миллионами строк. Нужно понять, почему изменился какой-то показатель — например, выручка или конверсия. Обычно это превращается в цепочку SQL-запросов: сначала агрегируем данные по стране, потом по городу, потом по конкретному сегменту пользователей и тд. Если таких гипотез несколько, количество запросов быстро растёт с геометрической прогрессией. Каждый новый уровень детализации требует отдельного SQL. В какой-то момент хочется просто кликнуть по графику и мгновенно увидеть более детальные данные. Без написания нового запроса. Именно здесь на помощь приходят BI-инструменты. Один из самых популярных open-source инструментов для аналитики — Apache Superset .
https://habr.com/ru/articles/1010132/
#data_analyst #data_engineer #bi #sql #python #superset #apache
-
[Перевод] AI и Data engineering: Что реально происходит с профессией?
Сразу успокоим читателя: AI не вытеснил data-инженера из рабочего процесса. Наоборот, он сделал эту роль еще более значимой. И в этой статье объясняется, что именно это означает для вас и вашей профессии. Не с точки зрения технологий и инструментов, а с точки зрения изменения зоны ответственности. AI, как и везде, конечно классно справляется с некоторыми задачами, но всю ответственность по-прежнему несет человек. Весь контекст не передашь через промпт, и AI не делает компромиссных решений. Большинство систем не выходят из строя, потому что было сложно написать код. Выходят потому что решения по разработке были приняты поспешно, и без четкого понимания, кто и как этими системами будет пользоваться. И AI еще быстрее за нас принимает решения, но все те же риски «непонимания контекста» остаются.
https://habr.com/ru/articles/1002036/
#ai #качество_данных #data_quality #etl #data_engineering #data_engineer #schema #модель_данных #искусственный_интеллект #инженер_данных
-
[Перевод] AI и Data engineering: Что реально происходит с профессией?
Сразу успокоим читателя: AI не вытеснил data-инженера из рабочего процесса. Наоборот, он сделал эту роль еще более значимой. И в этой статье объясняется, что именно это означает для вас и вашей профессии. Не с точки зрения технологий и инструментов, а с точки зрения изменения зоны ответственности. AI, как и везде, конечно классно справляется с некоторыми задачами, но всю ответственность по-прежнему несет человек. Весь контекст не передашь через промпт, и AI не делает компромиссных решений. Большинство систем не выходят из строя, потому что было сложно написать код. Выходят потому что решения по разработке были приняты поспешно, и без четкого понимания, кто и как этими системами будет пользоваться. И AI еще быстрее за нас принимает решения, но все те же риски «непонимания контекста» остаются.
https://habr.com/ru/articles/1002036/
#ai #качество_данных #data_quality #etl #data_engineering #data_engineer #schema #модель_данных #искусственный_интеллект #инженер_данных
-
[Перевод] AI и Data engineering: Что реально происходит с профессией?
Сразу успокоим читателя: AI не вытеснил data-инженера из рабочего процесса. Наоборот, он сделал эту роль еще более значимой. И в этой статье объясняется, что именно это означает для вас и вашей профессии. Не с точки зрения технологий и инструментов, а с точки зрения изменения зоны ответственности. AI, как и везде, конечно классно справляется с некоторыми задачами, но всю ответственность по-прежнему несет человек. Весь контекст не передашь через промпт, и AI не делает компромиссных решений. Большинство систем не выходят из строя, потому что было сложно написать код. Выходят потому что решения по разработке были приняты поспешно, и без четкого понимания, кто и как этими системами будет пользоваться. И AI еще быстрее за нас принимает решения, но все те же риски «непонимания контекста» остаются.
https://habr.com/ru/articles/1002036/
#ai #качество_данных #data_quality #etl #data_engineering #data_engineer #schema #модель_данных #искусственный_интеллект #инженер_данных
-
Кастомные lookup-операторы в Django ORM
В этой статье рассмотрим тему кастомных lookup-операторов в Django ORM. Они позволяют расширить стандартный синтаксис Django, интегрируя свои SQL-функции и алгоритмы, при этом сохраняя привычный вид фильтрации.
-
Кастомные lookup-операторы в Django ORM
В этой статье рассмотрим тему кастомных lookup-операторов в Django ORM. Они позволяют расширить стандартный синтаксис Django, интегрируя свои SQL-функции и алгоритмы, при этом сохраняя привычный вид фильтрации.
-
Кастомные lookup-операторы в Django ORM
В этой статье рассмотрим тему кастомных lookup-операторов в Django ORM. Они позволяют расширить стандартный синтаксис Django, интегрируя свои SQL-функции и алгоритмы, при этом сохраняя привычный вид фильтрации.
-
Инфраструктура для Data-Engineer Liquibase
Liquibase — это по сути реализация принципов IaC, но для баз данных, что делает его ключевым инструментом для DataBase as Code (DBaC). Как IaC управляет инфраструктурой, так Liquibase управляет схемами баз данных, обеспечивая автоматизацию, консистентность и версионирование изменений.
https://habr.com/ru/articles/863242/
#liquibase #iac #миграции_для_БД #описание_БД_как_код #версионирование_БД #git_для_БД #git_для_инфраструктуры #data_engineering #data_engineer #dba
-
Инфраструктура для Data-Engineer Liquibase
Liquibase — это по сути реализация принципов IaC, но для баз данных, что делает его ключевым инструментом для DataBase as Code (DBaC). Как IaC управляет инфраструктурой, так Liquibase управляет схемами баз данных, обеспечивая автоматизацию, консистентность и версионирование изменений.
https://habr.com/ru/articles/863242/
#liquibase #iac #миграции_для_БД #описание_БД_как_код #версионирование_БД #git_для_БД #git_для_инфраструктуры #data_engineering #data_engineer #dba
-
Инфраструктура для Data-Engineer Liquibase
Liquibase — это по сути реализация принципов IaC, но для баз данных, что делает его ключевым инструментом для DataBase as Code (DBaC). Как IaC управляет инфраструктурой, так Liquibase управляет схемами баз данных, обеспечивая автоматизацию, консистентность и версионирование изменений.
https://habr.com/ru/articles/863242/
#liquibase #iac #миграции_для_БД #описание_БД_как_код #версионирование_БД #git_для_БД #git_для_инфраструктуры #data_engineering #data_engineer #dba
-
Рынок дата-инженеров и прогноз на 2025
В этой статье вы сможете узнать в каком состоянии находится рынок дата-инженеров в 2024-ом и что с ним будет в 2025-ом.
https://habr.com/ru/articles/864780/
#data_engineering #data_engineer #стоит_ли_становиться_data_engineer #дата_инженер #найм_в_ит #найм_дата_инженеров #рынок_для_датаинженеров #рынок_по_работе_с_данными #что_будет_с_it_рынком #будущее_data_engineering
-
Рынок дата-инженеров и прогноз на 2025
В этой статье вы сможете узнать в каком состоянии находится рынок дата-инженеров в 2024-ом и что с ним будет в 2025-ом.
https://habr.com/ru/articles/864780/
#data_engineering #data_engineer #стоит_ли_становиться_data_engineer #дата_инженер #найм_в_ит #найм_дата_инженеров #рынок_для_датаинженеров #рынок_по_работе_с_данными #что_будет_с_it_рынком #будущее_data_engineering
-
Рынок дата-инженеров и прогноз на 2025
В этой статье вы сможете узнать в каком состоянии находится рынок дата-инженеров в 2024-ом и что с ним будет в 2025-ом.
https://habr.com/ru/articles/864780/
#data_engineering #data_engineer #стоит_ли_становиться_data_engineer #дата_инженер #найм_в_ит #найм_дата_инженеров #рынок_для_датаинженеров #рынок_по_работе_с_данными #что_будет_с_it_рынком #будущее_data_engineering
-
Инфраструктура для Data-Engineer виртуальные окружения
В современной Python-разработке управление зависимостями и изоляция проектов являются критически важными аспектами. Независимо от того, работаете ли вы над небольшим скриптом или крупным проектом, правильная организация окружений поможет избежать конфликтов между пакетами и обеспечит воспроизводимость вашего кода.
https://habr.com/ru/articles/861412/
#виртуальные_окружения #data_engineering #data_engineer #разработка_на_python #python_разработка #работа_с_виртуальными_окружениями #poetry #venv #uv #conda
-
Инфраструктура для Data-Engineer виртуальные окружения
В современной Python-разработке управление зависимостями и изоляция проектов являются критически важными аспектами. Независимо от того, работаете ли вы над небольшим скриптом или крупным проектом, правильная организация окружений поможет избежать конфликтов между пакетами и обеспечит воспроизводимость вашего кода.
https://habr.com/ru/articles/861412/
#виртуальные_окружения #data_engineering #data_engineer #разработка_на_python #python_разработка #работа_с_виртуальными_окружениями #poetry #venv #uv #conda
-
Инфраструктура для Data-Engineer виртуальные окружения
В современной Python-разработке управление зависимостями и изоляция проектов являются критически важными аспектами. Независимо от того, работаете ли вы над небольшим скриптом или крупным проектом, правильная организация окружений поможет избежать конфликтов между пакетами и обеспечит воспроизводимость вашего кода.
https://habr.com/ru/articles/861412/
#виртуальные_окружения #data_engineering #data_engineer #разработка_на_python #python_разработка #работа_с_виртуальными_окружениями #poetry #venv #uv #conda
-
Инфраструктура для Data-Engineer форматы файлов
В современной дата-инженерии работа с данными неразрывно связана с различными форматами файлов. Каждый формат имеет свои особенности, преимущества и области применения. В этой статье мы рассмотрим наиболее популярные форматы, научимся с ними работать и поймем, когда какой формат лучше использовать.
https://habr.com/ru/articles/859968/
#json #avro #parquet #csv #orc #data_engineering #data_engineer #форматы_файлов #форматы_хранения #колоночные_файлы
-
Инфраструктура для Data-Engineer форматы файлов
В современной дата-инженерии работа с данными неразрывно связана с различными форматами файлов. Каждый формат имеет свои особенности, преимущества и области применения. В этой статье мы рассмотрим наиболее популярные форматы, научимся с ними работать и поймем, когда какой формат лучше использовать.
https://habr.com/ru/articles/859968/
#json #avro #parquet #csv #orc #data_engineering #data_engineer #форматы_файлов #форматы_хранения #колоночные_файлы
-
Инфраструктура для Data-Engineer форматы файлов
В современной дата-инженерии работа с данными неразрывно связана с различными форматами файлов. Каждый формат имеет свои особенности, преимущества и области применения. В этой статье мы рассмотрим наиболее популярные форматы, научимся с ними работать и поймем, когда какой формат лучше использовать.
https://habr.com/ru/articles/859968/
#json #avro #parquet #csv #orc #data_engineering #data_engineer #форматы_файлов #форматы_хранения #колоночные_файлы
-
Будь T-shape
Сегодня поговорим о T-shape — концепции, которая играет огромную роль для дата-инженеров и профессионалов в работе с данными. Почему важно быть не только специалистом в своей области, но и понимать, как работают другие направления? Почему T-shape подход лучше узкой специализации или полной универсальности?
https://habr.com/ru/articles/859850/
#data_engineering #data_engineer #tshape #ishape #развитие_в_it #карьера_в_it #что_учить #Что_изучать_в_IT #как_учиться_легко #как_учиться
-
Будь T-shape
Сегодня поговорим о T-shape — концепции, которая играет огромную роль для дата-инженеров и профессионалов в работе с данными. Почему важно быть не только специалистом в своей области, но и понимать, как работают другие направления? Почему T-shape подход лучше узкой специализации или полной универсальности?
https://habr.com/ru/articles/859850/
#data_engineering #data_engineer #tshape #ishape #развитие_в_it #карьера_в_it #что_учить #Что_изучать_в_IT #как_учиться_легко #как_учиться
-
Будь T-shape
Сегодня поговорим о T-shape — концепции, которая играет огромную роль для дата-инженеров и профессионалов в работе с данными. Почему важно быть не только специалистом в своей области, но и понимать, как работают другие направления? Почему T-shape подход лучше узкой специализации или полной универсальности?
https://habr.com/ru/articles/859850/
#data_engineering #data_engineer #tshape #ishape #развитие_в_it #карьера_в_it #что_учить #Что_изучать_в_IT #как_учиться_легко #как_учиться
-
Инфраструктура для Data-Engineer BI-tools
BI (Business Intelligence) – это инструмент или несколько инструментов, которые помогают собрать данные в нужный вид и посмотреть на бизнес со стороны данных. Чаще всего BI-инструментами пользуются аналитики. Они строят дашборды (витрины), выполняют Ad hoc задачи и в целом проводят анализ данных в этих инструментах. В этой статье я хотел бы показать куда уходят данные и что с ними происходит, когда пайплайны дата-инженеров заканчивают работу.
https://habr.com/ru/articles/856922/
#bi #bitools #biинструменты #дата_инженер #дата_инжиниринг #data_engineer #analytics #аналитика_продукта #аналитика_компании #bigdata
-
Инфраструктура для Data-Engineer BI-tools
BI (Business Intelligence) – это инструмент или несколько инструментов, которые помогают собрать данные в нужный вид и посмотреть на бизнес со стороны данных. Чаще всего BI-инструментами пользуются аналитики. Они строят дашборды (витрины), выполняют Ad hoc задачи и в целом проводят анализ данных в этих инструментах. В этой статье я хотел бы показать куда уходят данные и что с ними происходит, когда пайплайны дата-инженеров заканчивают работу.
https://habr.com/ru/articles/856922/
#bi #bitools #biинструменты #дата_инженер #дата_инжиниринг #data_engineer #analytics #аналитика_продукта #аналитика_компании #bigdata
-
Инфраструктура для Data-Engineer BI-tools
BI (Business Intelligence) – это инструмент или несколько инструментов, которые помогают собрать данные в нужный вид и посмотреть на бизнес со стороны данных. Чаще всего BI-инструментами пользуются аналитики. Они строят дашборды (витрины), выполняют Ad hoc задачи и в целом проводят анализ данных в этих инструментах. В этой статье я хотел бы показать куда уходят данные и что с ними происходит, когда пайплайны дата-инженеров заканчивают работу.
https://habr.com/ru/articles/856922/
#bi #bitools #biинструменты #дата_инженер #дата_инжиниринг #data_engineer #analytics #аналитика_продукта #аналитика_компании #bigdata
-
Что такое Data Driven подход
В современном мире бизнес сталкивается с необходимостью постоянно принимать решения. От их качества зависит не только успех отдельных проектов, но и будущее всей компании. В этой статье мы разберём основные подходы к принятию решений в бизнесе и узнаем, почему компании всё чаще строят свою работу на данных. А ещё расскажу о роли, без которой data-driven подход попросту невозможен – о роли дата-инженера.
https://habr.com/ru/articles/856920/
#data_driven #data_engineering #data_engineer #дата_инженер #дата_инжиниринг #принятие_решение_в_компаниях #data_governance #аналитика #аналитика_данных #рост_компании
-
Что такое Data Driven подход
В современном мире бизнес сталкивается с необходимостью постоянно принимать решения. От их качества зависит не только успех отдельных проектов, но и будущее всей компании. В этой статье мы разберём основные подходы к принятию решений в бизнесе и узнаем, почему компании всё чаще строят свою работу на данных. А ещё расскажу о роли, без которой data-driven подход попросту невозможен – о роли дата-инженера.
https://habr.com/ru/articles/856920/
#data_driven #data_engineering #data_engineer #дата_инженер #дата_инжиниринг #принятие_решение_в_компаниях #data_governance #аналитика #аналитика_данных #рост_компании
-
Что такое Data Driven подход
В современном мире бизнес сталкивается с необходимостью постоянно принимать решения. От их качества зависит не только успех отдельных проектов, но и будущее всей компании. В этой статье мы разберём основные подходы к принятию решений в бизнесе и узнаем, почему компании всё чаще строят свою работу на данных. А ещё расскажу о роли, без которой data-driven подход попросту невозможен – о роли дата-инженера.
https://habr.com/ru/articles/856920/
#data_driven #data_engineering #data_engineer #дата_инженер #дата_инжиниринг #принятие_решение_в_компаниях #data_governance #аналитика #аналитика_данных #рост_компании
-
SQL для Junior Data Engineers: примеры бизнес-задач
Вход в профессию Data Engineer требует не только владения инструментами для построения данных, но и уверенного знания SQL для решения задач различной сложности. Несмотря на то, что многие SQL-запросы могут казаться «аналитическими», на практике именно Data Engineers часто отвечают за их написание и оптимизацию. Ведь аналитикам и специалистам по продукту требуется быстрый и точный доступ к данным для их анализа, а это означает, что DE должны обеспечить доступ к нужным данным и помочь в создании запросов для обработки больших объемов информации. В этой статье я привожу примеры SQL-запросов, которые соответствуют уровню владения языком, необходимому для Junior Data Engineer.
-
SQL для Junior Data Engineers: примеры бизнес-задач
Вход в профессию Data Engineer требует не только владения инструментами для построения данных, но и уверенного знания SQL для решения задач различной сложности. Несмотря на то, что многие SQL-запросы могут казаться «аналитическими», на практике именно Data Engineers часто отвечают за их написание и оптимизацию. Ведь аналитикам и специалистам по продукту требуется быстрый и точный доступ к данным для их анализа, а это означает, что DE должны обеспечить доступ к нужным данным и помочь в создании запросов для обработки больших объемов информации. В этой статье я привожу примеры SQL-запросов, которые соответствуют уровню владения языком, необходимому для Junior Data Engineer.
-
SQL для Junior Data Engineers: примеры бизнес-задач
Вход в профессию Data Engineer требует не только владения инструментами для построения данных, но и уверенного знания SQL для решения задач различной сложности. Несмотря на то, что многие SQL-запросы могут казаться «аналитическими», на практике именно Data Engineers часто отвечают за их написание и оптимизацию. Ведь аналитикам и специалистам по продукту требуется быстрый и точный доступ к данным для их анализа, а это означает, что DE должны обеспечить доступ к нужным данным и помочь в создании запросов для обработки больших объемов информации. В этой статье я привожу примеры SQL-запросов, которые соответствуют уровню владения языком, необходимому для Junior Data Engineer.
-
Инфраструктура для Data-Engineer DBT
dbt является мощным фреймворком, который включает в себя два популярных языка: SQL + Python. При помощи dbt можно создавать разные " слои " данных или выделить dbt только под один слой, к примеру dm . При помощи понятного и всем известного SQL интерфейса можно создавать разные модели для вашего DWH или Data Lake.
https://habr.com/ru/articles/854990/
#dbt #что_такое_dbt #кратко_о_dbt #как_пользоваться_dbt #dbt_+_postgresql #дорожная_карта_dbt #дата_инженер #дата_инжиниринг #data_engineer #data_engineering
-
Инфраструктура для Data-Engineer DBT
dbt является мощным фреймворком, который включает в себя два популярных языка: SQL + Python. При помощи dbt можно создавать разные " слои " данных или выделить dbt только под один слой, к примеру dm . При помощи понятного и всем известного SQL интерфейса можно создавать разные модели для вашего DWH или Data Lake.
https://habr.com/ru/articles/854990/
#dbt #что_такое_dbt #кратко_о_dbt #как_пользоваться_dbt #dbt_+_postgresql #дорожная_карта_dbt #дата_инженер #дата_инжиниринг #data_engineer #data_engineering
-
Инфраструктура для Data-Engineer DBT
dbt является мощным фреймворком, который включает в себя два популярных языка: SQL + Python. При помощи dbt можно создавать разные " слои " данных или выделить dbt только под один слой, к примеру dm . При помощи понятного и всем известного SQL интерфейса можно создавать разные модели для вашего DWH или Data Lake.
https://habr.com/ru/articles/854990/
#dbt #что_такое_dbt #кратко_о_dbt #как_пользоваться_dbt #dbt_+_postgresql #дорожная_карта_dbt #дата_инженер #дата_инжиниринг #data_engineer #data_engineering
-
Чем можно заняться в IT
IT – это не пузырь, который может лопнуть. Оно уже настолько плотно вошло в нашу жизнь, что повсюду, куда бы мы ни посмотрели, мы видим его следы, и это не изменится. В этой статье вы узнаете, что такое IT и чем можно заняться в IT помимо программирования.
https://habr.com/ru/articles/852224/
#информация_для_junior #Направления_в_IT #Профили_в_IT #карьера_в_itиндустрии #не_только_программирование #карьера_в_it #рост_в_IT #Развитие_в_IT #data_engineer #data_engineering
-
Чем можно заняться в IT
IT – это не пузырь, который может лопнуть. Оно уже настолько плотно вошло в нашу жизнь, что повсюду, куда бы мы ни посмотрели, мы видим его следы, и это не изменится. В этой статье вы узнаете, что такое IT и чем можно заняться в IT помимо программирования.
https://habr.com/ru/articles/852224/
#информация_для_junior #Направления_в_IT #Профили_в_IT #карьера_в_itиндустрии #не_только_программирование #карьера_в_it #рост_в_IT #Развитие_в_IT #data_engineer #data_engineering
-
Чем можно заняться в IT
IT – это не пузырь, который может лопнуть. Оно уже настолько плотно вошло в нашу жизнь, что повсюду, куда бы мы ни посмотрели, мы видим его следы, и это не изменится. В этой статье вы узнаете, что такое IT и чем можно заняться в IT помимо программирования.
https://habr.com/ru/articles/852224/
#информация_для_junior #Направления_в_IT #Профили_в_IT #карьера_в_itиндустрии #не_только_программирование #карьера_в_it #рост_в_IT #Развитие_в_IT #data_engineer #data_engineering
-
Инфраструктура для Data-Engineer Data Lake Apache Iceberg
В этой статье вы узнаете что такое Apache Iceberg, как его можно использовать и для чего он вообще нужен. В статье также рассматривается вопрос Data Lake.
https://habr.com/ru/articles/850674/
#data #data_lake #data_engineering #data_engineer #apache_spark #apache_iceberg #sql #дата_лейк #озеро_данных #datalakehouse
-
Инфраструктура для Data-Engineer Data Lake Apache Iceberg
В этой статье вы узнаете что такое Apache Iceberg, как его можно использовать и для чего он вообще нужен. В статье также рассматривается вопрос Data Lake.
https://habr.com/ru/articles/850674/
#data #data_lake #data_engineering #data_engineer #apache_spark #apache_iceberg #sql #дата_лейк #озеро_данных #datalakehouse
-
Инфраструктура для Data-Engineer Data Lake Apache Iceberg
В этой статье вы узнаете что такое Apache Iceberg, как его можно использовать и для чего он вообще нужен. В статье также рассматривается вопрос Data Lake.
https://habr.com/ru/articles/850674/
#data #data_lake #data_engineering #data_engineer #apache_spark #apache_iceberg #sql #дата_лейк #озеро_данных #datalakehouse
-
Данные – это новая нефть
Данные – это реально нефть и даже лучше. Выгода от данных больше чем от нефти. Нефть заканчивается, а данные никогда не закончатся – это первое. А второе – данные можно перерабатывать и каждый раз получать выгоду.
https://habr.com/ru/articles/849066/
#что_такое_данные #аналитика_данных #аналитика #датаинженер #датаинженеры #датаинжиниринг #data_engineer #data_engineering #аналитика_больших_данных #почему_данные_нефть
-
Данные – это новая нефть
Данные – это реально нефть и даже лучше. Выгода от данных больше чем от нефти. Нефть заканчивается, а данные никогда не закончатся – это первое. А второе – данные можно перерабатывать и каждый раз получать выгоду.
https://habr.com/ru/articles/849066/
#что_такое_данные #аналитика_данных #аналитика #датаинженер #датаинженеры #датаинжиниринг #data_engineer #data_engineering #аналитика_больших_данных #почему_данные_нефть
-
Данные – это новая нефть
Данные – это реально нефть и даже лучше. Выгода от данных больше чем от нефти. Нефть заканчивается, а данные никогда не закончатся – это первое. А второе – данные можно перерабатывать и каждый раз получать выгоду.
https://habr.com/ru/articles/849066/
#что_такое_данные #аналитика_данных #аналитика #датаинженер #датаинженеры #датаинжиниринг #data_engineer #data_engineering #аналитика_больших_данных #почему_данные_нефть
-
Что такое Big Data | Биг Дата?
Big Data – термин, который вы можете часто встретить на просторах интернета. Вы можете найти множество статей, докладов и прочих материалов по этому термину, но давайте попробуем разобраться в нём, потому что он не так страшен, как о нём говорят.
https://habr.com/ru/articles/845536/
#что_такое_big_data #что_такое_биг_дата #информация_для_junior #дата_инженер #дата_инжиниринг #аналитика #аналитика_данных #аналитика_больших_данных #data_engineer #data_engineering
-
Что такое Big Data | Биг Дата?
Big Data – термин, который вы можете часто встретить на просторах интернета. Вы можете найти множество статей, докладов и прочих материалов по этому термину, но давайте попробуем разобраться в нём, потому что он не так страшен, как о нём говорят.
https://habr.com/ru/articles/845536/
#что_такое_big_data #что_такое_биг_дата #информация_для_junior #дата_инженер #дата_инжиниринг #аналитика #аналитика_данных #аналитика_больших_данных #data_engineer #data_engineering
-
Что такое Big Data | Биг Дата?
Big Data – термин, который вы можете часто встретить на просторах интернета. Вы можете найти множество статей, докладов и прочих материалов по этому термину, но давайте попробуем разобраться в нём, потому что он не так страшен, как о нём говорят.
https://habr.com/ru/articles/845536/
#что_такое_big_data #что_такое_биг_дата #информация_для_junior #дата_инженер #дата_инжиниринг #аналитика #аналитика_данных #аналитика_больших_данных #data_engineer #data_engineering
-
Инфраструктура для data engineer S3
S3 – это один из сервисов, который используется для построения Data Lake и обмена файлами. В этой статье рассказывается о технологии S3 со стороны дата-инженерии. Мы в статье рассмотрим как развернуть сервис, как им пользоваться и зачем он нужен в дата-инженерии
https://habr.com/ru/articles/827052/
#s3 #python #data #data_engineering #data_engineer #data_lake #data_lakehouse #pet #petпроекты #объектное_хранилище
-
Инфраструктура для data engineer S3
S3 – это один из сервисов, который используется для построения Data Lake и обмена файлами. В этой статье рассказывается о технологии S3 со стороны дата-инженерии. Мы в статье рассмотрим как развернуть сервис, как им пользоваться и зачем он нужен в дата-инженерии
https://habr.com/ru/articles/827052/
#s3 #python #data #data_engineering #data_engineer #data_lake #data_lakehouse #pet #petпроекты #объектное_хранилище
-
Инфраструктура для data engineer S3
S3 – это один из сервисов, который используется для построения Data Lake и обмена файлами. В этой статье рассказывается о технологии S3 со стороны дата-инженерии. Мы в статье рассмотрим как развернуть сервис, как им пользоваться и зачем он нужен в дата-инженерии
https://habr.com/ru/articles/827052/
#s3 #python #data #data_engineering #data_engineer #data_lake #data_lakehouse #pet #petпроекты #объектное_хранилище