home.social

#etl — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #etl, aggregated by home.social.

fetched live
  1. Из Oracle в PostgreSQL одним INSERT: DuckDB как ETL без Oracle-клиента

    Когда говорят о DuckDB, обычно вспоминают аналитику: локальные запросы к Parquet, быстрые агрегации, ноутбуки. Но у него есть свойство, к аналитике отношения не имеющее: он умеет соединять источник и приёмник данных внутри одного SQL-плана. С расширениями для Oracle и PostgreSQL перенос данных сводится к одному запросу — без Instant Client, без OCI, без Python и без промежуточных файлов. А если одной сессии Oracle мало, чтение разбивается на параллельные шарды, читающие один согласованный снимок по единому SCN.

    habr.com/ru/articles/1073924/

    #DuckDB #Oracle #PostgreSQL #ETL #ELT #миграция_данных #ora2pg #oracle_fdw #TNS #аналитика_данных

  2. Из Oracle в PostgreSQL одним INSERT: DuckDB как ETL без Oracle-клиента

    Когда говорят о DuckDB, обычно вспоминают аналитику: локальные запросы к Parquet, быстрые агрегации, ноутбуки. Но у него есть свойство, к аналитике отношения не имеющее: он умеет соединять источник и приёмник данных внутри одного SQL-плана. С расширениями для Oracle и PostgreSQL перенос данных сводится к одному запросу — без Instant Client, без OCI, без Python и без промежуточных файлов. А если одной сессии Oracle мало, чтение разбивается на параллельные шарды, читающие один согласованный снимок по единому SCN.

    habr.com/ru/articles/1073924/

    #DuckDB #Oracle #PostgreSQL #ETL #ELT #миграция_данных #ora2pg #oracle_fdw #TNS #аналитика_данных

  3. Из Oracle в PostgreSQL одним INSERT: DuckDB как ETL без Oracle-клиента

    Когда говорят о DuckDB, обычно вспоминают аналитику: локальные запросы к Parquet, быстрые агрегации, ноутбуки. Но у него есть свойство, к аналитике отношения не имеющее: он умеет соединять источник и приёмник данных внутри одного SQL-плана. С расширениями для Oracle и PostgreSQL перенос данных сводится к одному запросу — без Instant Client, без OCI, без Python и без промежуточных файлов. А если одной сессии Oracle мало, чтение разбивается на параллельные шарды, читающие один согласованный снимок по единому SCN.

    habr.com/ru/articles/1073924/

    #DuckDB #Oracle #PostgreSQL #ETL #ELT #миграция_данных #ora2pg #oracle_fdw #TNS #аналитика_данных

  4. ETL Global strengthens presence in Germany

    ETL Global has expanded its network in central Germany with the addition of ETL H&P Thüringen. The tax…
    #Germany #DE #Europe #EU #Europa #AnneSophieMeuche #ETLGlobal #ETL) #taxadvisoryfirms #taxobligations
    europesays.com/germany/70046/

  5. FlatAdapter для преобразования иерархических структур

    Превращаем иерархические структуры в набор плоских строк готовых для импорта в БД flat-adapter преобразует нетипизированные вложенные mapping в детерминированный список плоских строк. Библиотека умеет приводить scalar-типы, обрабатывать optional-поля, извлекать значения по путям, разворачивать вложенные FlatAdapter-ы и строить декартово произведение списков.

    habr.com/ru/articles/1068172/

    #etl #airflow #python #backend #data_compose #data_mining #dwh

  6. FlatAdapter для преобразования иерархических структур

    Превращаем иерархические структуры в набор плоских строк готовых для импорта в БД flat-adapter преобразует нетипизированные вложенные mapping в детерминированный список плоских строк. Библиотека умеет приводить scalar-типы, обрабатывать optional-поля, извлекать значения по путям, разворачивать вложенные FlatAdapter-ы и строить декартово произведение списков.

    habr.com/ru/articles/1068172/

    #etl #airflow #python #backend #data_compose #data_mining #dwh

  7. FlatAdapter для преобразования иерархических структур

    Превращаем иерархические структуры в набор плоских строк готовых для импорта в БД flat-adapter преобразует нетипизированные вложенные mapping в детерминированный список плоских строк. Библиотека умеет приводить scalar-типы, обрабатывать optional-поля, извлекать значения по путям, разворачивать вложенные FlatAdapter-ы и строить декартово произведение списков.

    habr.com/ru/articles/1068172/

    #etl #airflow #python #backend #data_compose #data_mining #dwh

  8. Как я собрала локальную MCP-платформу для мониторинга промышленных данных

    Что получится, если собрать PostgreSQL, Airflow, JupyterLab, MinIO, Superset, шесть MCP-сервисов и локальную модель Ollama в одном Docker Compose-стенде? Показываю полный путь синтетических промышленных данных: от витрин и проверок качества до Parquet-артефактов, MCP-инструментов и LLM-пояснений. Внутри — архитектура, воспроизводимый запуск, результаты проверок и открытый репозиторий.

    habr.com/ru/articles/1064802/

    #MCP #Model_Context_Protocol #Data_Engineering #Apache_Airflow #PostgreSQL #Docker_Compose #MinIO #Ollama #JupyterLab #ETL

  9. Как я собрала локальную MCP-платформу для мониторинга промышленных данных

    Что получится, если собрать PostgreSQL, Airflow, JupyterLab, MinIO, Superset, шесть MCP-сервисов и локальную модель Ollama в одном Docker Compose-стенде? Показываю полный путь синтетических промышленных данных: от витрин и проверок качества до Parquet-артефактов, MCP-инструментов и LLM-пояснений. Внутри — архитектура, воспроизводимый запуск, результаты проверок и открытый репозиторий.

    habr.com/ru/articles/1064802/

    #MCP #Model_Context_Protocol #Data_Engineering #Apache_Airflow #PostgreSQL #Docker_Compose #MinIO #Ollama #JupyterLab #ETL

  10. Как я собрала локальную MCP-платформу для мониторинга промышленных данных

    Что получится, если собрать PostgreSQL, Airflow, JupyterLab, MinIO, Superset, шесть MCP-сервисов и локальную модель Ollama в одном Docker Compose-стенде? Показываю полный путь синтетических промышленных данных: от витрин и проверок качества до Parquet-артефактов, MCP-инструментов и LLM-пояснений. Внутри — архитектура, воспроизводимый запуск, результаты проверок и открытый репозиторий.

    habr.com/ru/articles/1064802/

    #MCP #Model_Context_Protocol #Data_Engineering #Apache_Airflow #PostgreSQL #Docker_Compose #MinIO #Ollama #JupyterLab #ETL

  11. Всё по полочкам или как мы создавали единую метрику для сотен моделей антифрода

    Всем привет! Меня зовут Аня Шатшнайдер, я старший BI-разработчик в команде антифрода Авито . Мы пользуемся сотнями ИИ-моделей, чтобы бороться с действиями недобросовестных пользователей. Но иногда модели работают не так эффективно, как следует. Поэтому моя команда решила найти аутсайдеров и передать их на доработку DS-инженерам. Расскажу, как мы пересматривали подход к оценке моделей. Статья будет полезна аналитикам и DS, которые работают с несколькими ML-моделями в проде и хоть раз озадачились вопросом, как сравнивать их между собой.

    habr.com/ru/companies/avito/ar

    #аналитика_данных #etl #sql #antifraud #модель_данных #trino #bi

  12. Всё по полочкам или как мы создавали единую метрику для сотен моделей антифрода

    Всем привет! Меня зовут Аня Шатшнайдер, я старший BI-разработчик в команде антифрода Авито . Мы пользуемся сотнями ИИ-моделей, чтобы бороться с действиями недобросовестных пользователей. Но иногда модели работают не так эффективно, как следует. Поэтому моя команда решила найти аутсайдеров и передать их на доработку DS-инженерам. Расскажу, как мы пересматривали подход к оценке моделей. Статья будет полезна аналитикам и DS, которые работают с несколькими ML-моделями в проде и хоть раз озадачились вопросом, как сравнивать их между собой.

    habr.com/ru/companies/avito/ar

    #аналитика_данных #etl #sql #antifraud #модель_данных #trino #bi

  13. Всё по полочкам или как мы создавали единую метрику для сотен моделей антифрода

    Всем привет! Меня зовут Аня Шатшнайдер, я старший BI-разработчик в команде антифрода Авито . Мы пользуемся сотнями ИИ-моделей, чтобы бороться с действиями недобросовестных пользователей. Но иногда модели работают не так эффективно, как следует. Поэтому моя команда решила найти аутсайдеров и передать их на доработку DS-инженерам. Расскажу, как мы пересматривали подход к оценке моделей. Статья будет полезна аналитикам и DS, которые работают с несколькими ML-моделями в проде и хоть раз озадачились вопросом, как сравнивать их между собой.

    habr.com/ru/companies/avito/ar

    #аналитика_данных #etl #sql #antifraud #модель_данных #trino #bi

  14. Как LLM могут помочь определить Data Lineage

    Сегодня данные стали основой для принятия решений, а их качество и прозрачность — критичными факторами успеха любого бизнеса. Однако с ростом объёма информации и усложнением архитектуры баз данных аналитики всё чаще сталкиваются с такими проблемами, как неясность происхождения данных, трудность в отслеживании их преобразований, риски использования устаревших или некорректных метрик. Приходится постоянно полагаться на традиционную документацию, спецификации по загрузке данных или Source-to-Target mapping-файлы. Эти артефакты, как правило, быстро устаревают, не отражая актуальной логики преобразований, зашитой в ETL-процессах и SQL-коде. В результате необходимо вручную поддерживать актуальность такой документации, или, что ещё ресурсозатратнее, проведить реверс-инжиниринг тысяч строк SQL-кода хранилища данных для понимания реальных зависимостей. Эти проблемы обостряются в контексте постоянных изменений ИТ-ландшафта, например, миграции в облако, замены устаревших систем-источников (legacy systems) или интеграции новых платформ. И если нет понимания «жизненного цикла» данных, то это превращается в прямую угрозу для бизнес-непрерывности. Критичной задачей становится безопасное и контролируемое переключение существующих решений — витрин, дашбордов и отчётов — на новые источники данных при строгом условии минимизации или полного исключения влияния на конечных потребителей. Здесь на первый план выходит концепция Data Lineage. Это не просто инструмент для документирования пути данных от источника до конечного отчёта, а ключевой механизм управления изменениями. Data Lineage обеспечивает полную видимость всех исходных, промежуточных и итоговых объектов, позволяя точно оценить воздействие планируемой миграции, и даёт ответ на главные вопросы: - Какие витрины и отчёты зависят от этого источника? - Какие преобразования данных необходимо проверить или перенастроить? - Откуда в новой системе взять актуальные и корректные данные? Мы рассмотрим, как с помощью применения больших языковых моделей (LLM) для автоматического анализа SQL-кода и ETL-логики извлечь точный Data Lineage.

    habr.com/ru/companies/sberbank

    #data_lineage #llm #sql #etl

  15. Как LLM могут помочь определить Data Lineage

    Сегодня данные стали основой для принятия решений, а их качество и прозрачность — критичными факторами успеха любого бизнеса. Однако с ростом объёма информации и усложнением архитектуры баз данных аналитики всё чаще сталкиваются с такими проблемами, как неясность происхождения данных, трудность в отслеживании их преобразований, риски использования устаревших или некорректных метрик. Приходится постоянно полагаться на традиционную документацию, спецификации по загрузке данных или Source-to-Target mapping-файлы. Эти артефакты, как правило, быстро устаревают, не отражая актуальной логики преобразований, зашитой в ETL-процессах и SQL-коде. В результате необходимо вручную поддерживать актуальность такой документации, или, что ещё ресурсозатратнее, проведить реверс-инжиниринг тысяч строк SQL-кода хранилища данных для понимания реальных зависимостей. Эти проблемы обостряются в контексте постоянных изменений ИТ-ландшафта, например, миграции в облако, замены устаревших систем-источников (legacy systems) или интеграции новых платформ. И если нет понимания «жизненного цикла» данных, то это превращается в прямую угрозу для бизнес-непрерывности. Критичной задачей становится безопасное и контролируемое переключение существующих решений — витрин, дашбордов и отчётов — на новые источники данных при строгом условии минимизации или полного исключения влияния на конечных потребителей. Здесь на первый план выходит концепция Data Lineage. Это не просто инструмент для документирования пути данных от источника до конечного отчёта, а ключевой механизм управления изменениями. Data Lineage обеспечивает полную видимость всех исходных, промежуточных и итоговых объектов, позволяя точно оценить воздействие планируемой миграции, и даёт ответ на главные вопросы: - Какие витрины и отчёты зависят от этого источника? - Какие преобразования данных необходимо проверить или перенастроить? - Откуда в новой системе взять актуальные и корректные данные? Мы рассмотрим, как с помощью применения больших языковых моделей (LLM) для автоматического анализа SQL-кода и ETL-логики извлечь точный Data Lineage.

    habr.com/ru/companies/sberbank

    #data_lineage #llm #sql #etl

  16. Как LLM могут помочь определить Data Lineage

    Сегодня данные стали основой для принятия решений, а их качество и прозрачность — критичными факторами успеха любого бизнеса. Однако с ростом объёма информации и усложнением архитектуры баз данных аналитики всё чаще сталкиваются с такими проблемами, как неясность происхождения данных, трудность в отслеживании их преобразований, риски использования устаревших или некорректных метрик. Приходится постоянно полагаться на традиционную документацию, спецификации по загрузке данных или Source-to-Target mapping-файлы. Эти артефакты, как правило, быстро устаревают, не отражая актуальной логики преобразований, зашитой в ETL-процессах и SQL-коде. В результате необходимо вручную поддерживать актуальность такой документации, или, что ещё ресурсозатратнее, проведить реверс-инжиниринг тысяч строк SQL-кода хранилища данных для понимания реальных зависимостей. Эти проблемы обостряются в контексте постоянных изменений ИТ-ландшафта, например, миграции в облако, замены устаревших систем-источников (legacy systems) или интеграции новых платформ. И если нет понимания «жизненного цикла» данных, то это превращается в прямую угрозу для бизнес-непрерывности. Критичной задачей становится безопасное и контролируемое переключение существующих решений — витрин, дашбордов и отчётов — на новые источники данных при строгом условии минимизации или полного исключения влияния на конечных потребителей. Здесь на первый план выходит концепция Data Lineage. Это не просто инструмент для документирования пути данных от источника до конечного отчёта, а ключевой механизм управления изменениями. Data Lineage обеспечивает полную видимость всех исходных, промежуточных и итоговых объектов, позволяя точно оценить воздействие планируемой миграции, и даёт ответ на главные вопросы: - Какие витрины и отчёты зависят от этого источника? - Какие преобразования данных необходимо проверить или перенастроить? - Откуда в новой системе взять актуальные и корректные данные? Мы рассмотрим, как с помощью применения больших языковых моделей (LLM) для автоматического анализа SQL-кода и ETL-логики извлечь точный Data Lineage.

    habr.com/ru/companies/sberbank

    #data_lineage #llm #sql #etl

  17. Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации

    Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.

    habr.com/ru/articles/1060944/

    #airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners

  18. Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации

    Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.

    habr.com/ru/articles/1060944/

    #airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners

  19. Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации

    Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.

    habr.com/ru/articles/1060944/

    #airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners

  20. DE. Путь файла по слоям

    В исходном orders.csv было 11 строк. До BI-витрины дошло 7, а валовая сумма 4720.30 после применения бизнес-правил превратилась в 2200.30 выручки. Четыре строки не исчезли: каждая попала в rejects с конкретной причиной. На этом небольшом примере покажу весь путь данных через RAW, STG, CORE и MARTS. Разберём, где меняются строки и суммы, как пережить повторную доставку файла и какие проверки позволяют доверять итоговому дашборду. Внутри MinIO, Postgres и Airflow.

    habr.com/ru/articles/1062446/

    #Data_Engineering #ETL #DWH #пайплайн_данных #Apache_Airflow #PostgreSQL #MinIO #Data_Quality #CSV #BI

  21. DE. Путь файла по слоям

    В исходном orders.csv было 11 строк. До BI-витрины дошло 7, а валовая сумма 4720.30 после применения бизнес-правил превратилась в 2200.30 выручки. Четыре строки не исчезли: каждая попала в rejects с конкретной причиной. На этом небольшом примере покажу весь путь данных через RAW, STG, CORE и MARTS. Разберём, где меняются строки и суммы, как пережить повторную доставку файла и какие проверки позволяют доверять итоговому дашборду. Внутри MinIO, Postgres и Airflow.

    habr.com/ru/articles/1062446/

    #Data_Engineering #ETL #DWH #пайплайн_данных #Apache_Airflow #PostgreSQL #MinIO #Data_Quality #CSV #BI

  22. DE. Путь файла по слоям

    В исходном orders.csv было 11 строк. До BI-витрины дошло 7, а валовая сумма 4720.30 после применения бизнес-правил превратилась в 2200.30 выручки. Четыре строки не исчезли: каждая попала в rejects с конкретной причиной. На этом небольшом примере покажу весь путь данных через RAW, STG, CORE и MARTS. Разберём, где меняются строки и суммы, как пережить повторную доставку файла и какие проверки позволяют доверять итоговому дашборду. Внутри MinIO, Postgres и Airflow.

    habr.com/ru/articles/1062446/

    #Data_Engineering #ETL #DWH #пайплайн_данных #Apache_Airflow #PostgreSQL #MinIO #Data_Quality #CSV #BI

  23. AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

    Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.

    habr.com/ru/articles/1060962/

    #AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов

  24. AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

    Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.

    habr.com/ru/articles/1060962/

    #AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов

  25. AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

    Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.

    habr.com/ru/articles/1060962/

    #AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов

  26. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  27. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  28. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  29. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT