home.social

#etl — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #etl, aggregated by home.social.

  1. Как автоматизировать выгрузку данных из 1С: SQL или готовый ETL-инструмент

    Как организовать регулярную выгрузку данных из 1С, если ручной экспорт уже не справляется с объемом и частотой обновлений? В статье сравниваются два подхода: прямой доступ к базе через SQL и использование готового ETL-инструмента. Разбираем скорость, сложность настройки, требования к специалистам, риски для безопасности и сопровождения системы. Также показываем, в каких случаях оправдан SQL, а когда удобнее использовать готовый инструмент для автоматической выгрузки данных по расписанию без постоянного участия разработчика.

    habr.com/ru/companies/infostar

    # #выгрузка_данных #автоматизация #SQL #ETL #интеграция_данных #базы_данных #Data_Engineering #обработка_данных #аналитика_данных

  2. ETL log: как упростить работу инженеров данных. Опыт «Ленты»

    Привет, Хабр! На связи Александр Курносов, руководитель группы платформы данных, и Андрей Двинских, инженер больших данных. В ежедневной работе мы используем несколько инструментов. Чтобы разобраться с очередной задачей, приходится переключаться между ними, искать нужную информацию и собирать общую картину буквально по частям. В какой-то момент мы поняли, что большинство таких действий повторяются каждый день. Поэтому решили собрать самые востребованные сценарии в одном внутреннем инструменте. Так появился ETL log. В статье расскажем, почему решили его создать, какие задачи он помогает решать и как устроена работа с ним.

    habr.com/ru/companies/lentatec

    #etl #etlпроцессы #data_engineering #airflow #datahub #powerbi

  3. ETL log: как упростить работу инженеров данных. Опыт «Ленты»

    Привет, Хабр! На связи Александр Курносов, руководитель группы платформы данных, и Андрей Двинских, инженер больших данных. В ежедневной работе мы используем несколько инструментов. Чтобы разобраться с очередной задачей, приходится переключаться между ними, искать нужную информацию и собирать общую картину буквально по частям. В какой-то момент мы поняли, что большинство таких действий повторяются каждый день. Поэтому решили собрать самые востребованные сценарии в одном внутреннем инструменте. Так появился ETL log. В статье расскажем, почему решили его создать, какие задачи он помогает решать и как устроена работа с ним.

    habr.com/ru/companies/lentatec

    #etl #etlпроцессы #data_engineering #airflow #datahub #powerbi

  4. ETL log: как упростить работу инженеров данных. Опыт «Ленты»

    Привет, Хабр! На связи Александр Курносов, руководитель группы платформы данных, и Андрей Двинских, инженер больших данных. В ежедневной работе мы используем несколько инструментов. Чтобы разобраться с очередной задачей, приходится переключаться между ними, искать нужную информацию и собирать общую картину буквально по частям. В какой-то момент мы поняли, что большинство таких действий повторяются каждый день. Поэтому решили собрать самые востребованные сценарии в одном внутреннем инструменте. Так появился ETL log. В статье расскажем, почему решили его создать, какие задачи он помогает решать и как устроена работа с ним.

    habr.com/ru/companies/lentatec

    #etl #etlпроцессы #data_engineering #airflow #datahub #powerbi

  5. #Data #Integration Approaches and Methods in #ArcGIS tinyurl.com/yc4nxpen

    #ETL #interoperability #GIS #esri #mapping #GISchat #geospatial @esri @esrifederalgovt @esrislgov @esriblog @esritraining @arcgispro @arcgisonline @arcgisxprise @urisa

  6. Как я собрала локальную MCP-платформу для мониторинга промышленных данных

    Что получится, если собрать PostgreSQL, Airflow, JupyterLab, MinIO, Superset, шесть MCP-сервисов и локальную модель Ollama в одном Docker Compose-стенде? Показываю полный путь синтетических промышленных данных: от витрин и проверок качества до Parquet-артефактов, MCP-инструментов и LLM-пояснений. Внутри — архитектура, воспроизводимый запуск, результаты проверок и открытый репозиторий.

    habr.com/ru/articles/1064802/

    #MCP #Model_Context_Protocol #Data_Engineering #Apache_Airflow #PostgreSQL #Docker_Compose #MinIO #Ollama #JupyterLab #ETL

  7. Всё по полочкам или как мы создавали единую метрику для сотен моделей антифрода

    Всем привет! Меня зовут Аня Шатшнайдер, я старший BI-разработчик в команде антифрода Авито . Мы пользуемся сотнями ИИ-моделей, чтобы бороться с действиями недобросовестных пользователей. Но иногда модели работают не так эффективно, как следует. Поэтому моя команда решила найти аутсайдеров и передать их на доработку DS-инженерам. Расскажу, как мы пересматривали подход к оценке моделей. Статья будет полезна аналитикам и DS, которые работают с несколькими ML-моделями в проде и хоть раз озадачились вопросом, как сравнивать их между собой.

    habr.com/ru/companies/avito/ar

    #аналитика_данных #etl #sql #antifraud #модель_данных #trino #bi

  8. FIFO на миллионах строк: как подружить бонусы, SQL и асимметричный N×M-граф

    Всем привет! Меня зовут Иван Привалов , я разработчик в команде BI Авито Финтеха и в этой статье расскажу, как мы сделали FIFO-сопоставление между N начислений и M списаний для бонусов. Заодно покажу подвох, без которого SQL быстро превращался в тыкву. Статья будет полезна аналитикам и data-инженерам уровней мидл+, которые работают с финансовыми данными в Trino, Presto и Spark SQL.

    habr.com/ru/companies/avito/ar

    #trino #sql #fifo #мсфо #аналитика_данных #data_quality #etl #финансы #управленческий_учет #бонусы

  9. Строим машину времени для данных (SCD-2) на движке Trino под управлением Airflow

    Сегодня SCD-2-таблицы не только остаются актуальными для медленно меняющихся данных, но и, на мой взгляд, становятся гораздо проще в реализации благодаря новым технологиям и инструментам. Мне поручили пересобрать витрину в ходе миграции в наше новое хранилище данных. Итак, в этой статье мы будем: — строить Iceberg-таблицы SCD-2 с помощью Trino, SQL и Python; — попутно освоим прекрасные функции merge, MD5 и другие полезные инструменты; — напишем свой собственный оператор для Airflow для автоматизации ETL-процесса.

    habr.com/ru/companies/X5Tech/a

    #scd_type_2 #trino #iceberg #airflow #lakehouse #etl #slowly_changing_dimensions #data_mesh #витрина_данных #хранилище_данных

  10. Миграция с Greenplum. Эпизод I: Атака клонов и спасение на звёздных камнях

    В мае 2024 года Broadcom заархивировал публичный репозиторий Greenplum: последний коммит остался на месте, дальнейшая разработка ушла в закрытый репозиторий, enterprise-сборка теперь доступна только по подписке. Greenplum как живой OSS-проект остановился — но сам код, выпускавшийся с октября 2015-го, остался под Apache 2.0. Именно на этой кодовой базе стартанули остальные форки. Те, кто строил аналитику на Greenplum, оказались перед развилкой. Сообщество разделилось: Apache Cloudberry (incubating) , Greengage DB от Arenadata, WarehousePG от EDB. Каждый форк продолжает линию, но в собственной траектории. У компании с боевым кластером появляется конкретный вопрос: переехать/остаться в одном из этих форков или мигрировать на принципиально другую платформу и архитектурную парадигму. Эта статья (сага из трёх эпизодов) будет полезна, если у вас уже есть Greenplum-кластер, вы понимаете его DDL/ETL/backup-процессы и хотите оценить, насколько болезненным будет переход на StarRocks.

    habr.com/ru/articles/1031358/

    #starrocks #Lakehouse #greenplum #sql #миграция_данных #субд #mpp #dwh #olap #etl

  11. Использование Trino для построения ETL-процессов

    1. Введение. Trino: ключевые задачи и главные преимущества В современной архитектуре управления данными ETL-процессы рассматриваются не как вспомогательный инструмент, а как базовый механизм интеграции, трансформации и подготовки данных, поступающих из множества гетерогенных источников. Ключевая цель этих процессов - избавиться от хаоса и разрозненности данных, которые почти всегда появляются в больших распределенных компаниях [1] . В рамках ETL-конвейера выполняется автоматизированное извлечение данных из различных источников, их очистка, нормализация и приведение к единой модели, после чего подготовленные данные загружаются в централизованное аналитическое хранилище. Это даёт три главных преимущества: обеспечивает высокое качество и согласованность данных, структурирует информацию под нужды бизнес-отчетности, а также отделяет аналитическую нагрузку от операционных систем, повышая таким образом производительность системы в целом. ETL возник как вынужденная мера, так как во время его появления (1970–1990-е) не было ни высокоскоростных сетей, ни мощных распределенных движков аналитики, ни концепции Data Lake. Единственным надёжным способом построить аналитическую отчетность было физически извлекать данные из операционных систем и копировать их в отдельную специализированную базу. Именно поэтому ETL закрепился как основной архитектурный паттерн аналитических систем на долгие десятилетия. Увы, такой подход породил и массу проблем: это дублирование данных, долгие пайплайны, сложные зависимости, задержки обновления и огромные затраты на поддержку. Традиционным ETL-процессам становится всё труднее справляться с постоянно растущим объемом поступающих данных. Более того, большие сложности возникают при работе с уже накопленной информацией, ведь её требуется хранить на протяжении многих лет, а значит — сохранять возможность глубокого анализа по всей доступной истории.

    habr.com/ru/companies/neoflex/

    #Neoflex #Trino #ETL #ELT #Data_Lake #Lake_House

  12. Raster-enabling Apache Hop: @edigonzales continues his series on #geoenabling #ApacheHop, this time adding #raster support to his hop-gdal-plugin. Stefan walks through an #ETL pipeline that computes building heights from LiDAR and vector data using new raster transforms...
    spatialists.ch/posts/2026/04/0 #GIS #GISchat #geospatial #SwissGIS

  13. For one of my clients I'm creating a highly scalable, globally distributed web application to display and edit some business choices used by internal #ETL document generators. The application runs on #AWS using #cognito as its user authentication mechanism. Did you know that callback script URLs for Cognito can't end in a slash? I didn't. If yours does, be prepared for a world of pain.

  14. Балансируя на грани: как внедрить Differential Privacy в аналитические пайплайны на Python

    В этой статье я расскажу, как добавить механизмы Differential Privacy (DP) в ваши ETL‑ и аналитические пайплайны на Python, чтобы защитить пользовательские данные и при этом сохранить качество ключевых метрик. Пошаговые примеры с реальным кодом, советы по настройке ε‑бюджета и интеграции в Airflow помогут вам избежать самых распространённых подводных камней.

    habr.com/ru/articles/932322/

    #differential_privacy #приватность #аналитика #python #diffprivlib #etl #airflow #gdpr

  15. Как мы сделали одну большую песочницу для всех аналитиков

    В мире данных и аналитики, где каждый день генерируются огромные объемы информации, создание единой платформы для работы с данными становится неотъемлемой частью успешной стратегии бизнеса. Мы команда РСХБ.Цифра, в которой я, Кристина Проскурина , руковожу управлением бизнес-анализа данных, а Алексей Кошевой , руководитель отдела развития витрин данных «РСХБ-Интех», руководит разработкой аналитической отчетности и платформы по исследованию данных. В этой статье мы расскажем, как наша команда разработала единую песочницу для аналитиков, которая объединила все инструменты и ресурсы в одном месте, обеспечивая эффективность, удобство и возможность совместной работы. К песочнице

    habr.com/ru/companies/rshb/art

    #greenplum #песочница_для_аналитиков #бизнесанализ_данных #аналитическая_отчетность #Airflow #Озеро_данных #Visiology #ETL #PXF #ETLфреймворк