home.social

#etl — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #etl, aggregated by home.social.

fetched live
  1. Всё по полочкам или как мы создавали единую метрику для сотен моделей антифрода

    Всем привет! Меня зовут Аня Шатшнайдер, я старший BI-разработчик в команде антифрода Авито . Мы пользуемся сотнями ИИ-моделей, чтобы бороться с действиями недобросовестных пользователей. Но иногда модели работают не так эффективно, как следует. Поэтому моя команда решила найти аутсайдеров и передать их на доработку DS-инженерам. Расскажу, как мы пересматривали подход к оценке моделей. Статья будет полезна аналитикам и DS, которые работают с несколькими ML-моделями в проде и хоть раз озадачились вопросом, как сравнивать их между собой.

    habr.com/ru/companies/avito/ar

    #аналитика_данных #etl #sql #antifraud #модель_данных #trino #bi

  2. Как LLM могут помочь определить Data Lineage

    Сегодня данные стали основой для принятия решений, а их качество и прозрачность — критичными факторами успеха любого бизнеса. Однако с ростом объёма информации и усложнением архитектуры баз данных аналитики всё чаще сталкиваются с такими проблемами, как неясность происхождения данных, трудность в отслеживании их преобразований, риски использования устаревших или некорректных метрик. Приходится постоянно полагаться на традиционную документацию, спецификации по загрузке данных или Source-to-Target mapping-файлы. Эти артефакты, как правило, быстро устаревают, не отражая актуальной логики преобразований, зашитой в ETL-процессах и SQL-коде. В результате необходимо вручную поддерживать актуальность такой документации, или, что ещё ресурсозатратнее, проведить реверс-инжиниринг тысяч строк SQL-кода хранилища данных для понимания реальных зависимостей. Эти проблемы обостряются в контексте постоянных изменений ИТ-ландшафта, например, миграции в облако, замены устаревших систем-источников (legacy systems) или интеграции новых платформ. И если нет понимания «жизненного цикла» данных, то это превращается в прямую угрозу для бизнес-непрерывности. Критичной задачей становится безопасное и контролируемое переключение существующих решений — витрин, дашбордов и отчётов — на новые источники данных при строгом условии минимизации или полного исключения влияния на конечных потребителей. Здесь на первый план выходит концепция Data Lineage. Это не просто инструмент для документирования пути данных от источника до конечного отчёта, а ключевой механизм управления изменениями. Data Lineage обеспечивает полную видимость всех исходных, промежуточных и итоговых объектов, позволяя точно оценить воздействие планируемой миграции, и даёт ответ на главные вопросы: - Какие витрины и отчёты зависят от этого источника? - Какие преобразования данных необходимо проверить или перенастроить? - Откуда в новой системе взять актуальные и корректные данные? Мы рассмотрим, как с помощью применения больших языковых моделей (LLM) для автоматического анализа SQL-кода и ETL-логики извлечь точный Data Lineage.

    habr.com/ru/companies/sberbank

    #data_lineage #llm #sql #etl

  3. Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации

    Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.

    habr.com/ru/articles/1060944/

    #airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners

  4. DE. Путь файла по слоям

    В исходном orders.csv было 11 строк. До BI-витрины дошло 7, а валовая сумма 4720.30 после применения бизнес-правил превратилась в 2200.30 выручки. Четыре строки не исчезли: каждая попала в rejects с конкретной причиной. На этом небольшом примере покажу весь путь данных через RAW, STG, CORE и MARTS. Разберём, где меняются строки и суммы, как пережить повторную доставку файла и какие проверки позволяют доверять итоговому дашборду. Внутри MinIO, Postgres и Airflow.

    habr.com/ru/articles/1062446/

    #Data_Engineering #ETL #DWH #пайплайн_данных #Apache_Airflow #PostgreSQL #MinIO #Data_Quality #CSV #BI

  5. AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

    Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.

    habr.com/ru/articles/1060962/

    #AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов

  6. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  7. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  8. Каталог данных: что нужно знать, прежде чем начинать внедрение

    Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.

    habr.com/ru/companies/vktech/a

    #data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform

  9. AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения

    Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.

    habr.com/ru/articles/1054028/

    #agtech #dss #etl #rule_engine #Headless_API

  10. Как я устал писать парсер под каждый прайс и сделал из этого библиотеку

    У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.

    habr.com/ru/articles/1053956/

    #python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source

  11. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  12. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  13. The other day I created a solution for a client of mine to find out which of their #database stored views got used actively by an #ETL middleware application. It involved many steps.

    1. Figure out where the middleware stores its processing configurations.
    2. Figure out their structure.
    3. Translate that structure into something I can use.
    4. Filter out the database object names.
    5. Make those available to the DB.
    6. Find matches in the DB.
    7. Find the remainder.

    Fun stuff.

  14. The other day I created a solution for a client of mine to find out which of their #database stored views got used actively by an #ETL middleware application. It involved many steps.

    1. Figure out where the middleware stores its processing configurations.
    2. Figure out their structure.
    3. Translate that structure into something I can use.
    4. Filter out the database object names.
    5. Make those available to the DB.
    6. Find matches in the DB.
    7. Find the remainder.

    Fun stuff.

  15. Как мы ушли от ETL к CDC: выбираем архитектуру real-time аналитики на PostgreSQL, Kafka и ClickHouse. Часть 1

    Все началось с просьбы сделать отчеты в реальном времени. На первый взгляд задача выглядела простой, но довольно быстро выяснилось, что существующая архитектура для этого не подходит. Проект был разбит на множество микросервисов, каждый из которых хранил данные в собственной PostgreSQL-базе. Чтобы строить сквозные отчеты, информацию нужно было где-то объединять. На тот момент аналитика уже работала через ETL: раз в сутки Airflow восстанавливал общую PostgreSQL из ежедневных бекапов, а Redash выполнял запросы уже к ней. Решение было надежным и не требовало нагрузки на production, но для real-time оно не годилось — в лучшем случае отчеты показывали состояние системы на начало дня.

    habr.com/ru/articles/1051760/

    #postgresql #clickhouse #kafka #debezium #cdc #kubernetes #etl #realtime_аналитика #kafka_connect #devops

  16. Оркестрация рабочих процессов: полное руководство

    Оркестрация рабочих процессов (workflow orchestration) — это практика координации множества автоматизированных задач, сервисов и систем для обеспечения их согласованного...

    #DST #DSTGlobal #ДСТ #ДСТГлобал #Оркестрация #GitHub #Kubernetes #ApacheAirflow #AWSStepFunctions #Temporal #Camunda #CICD #DevOps #Автоматизация #AIагенты #RBAC #SOAR #Обработкаданных #ETL

    Источник: dstglobal.ru/club/1242-orkestr

  17. FIFO на миллионах строк: как подружить бонусы, SQL и асимметричный N×M-граф

    Всем привет! Меня зовут Иван Привалов , я разработчик в команде BI Авито Финтеха и в этой статье расскажу, как мы сделали FIFO-сопоставление между N начислений и M списаний для бонусов. Заодно покажу подвох, без которого SQL быстро превращался в тыкву. Статья будет полезна аналитикам и data-инженерам уровней мидл+, которые работают с финансовыми данными в Trino, Presto и Spark SQL.

    habr.com/ru/companies/avito/ar

    #trino #sql #fifo #мсфо #аналитика_данных #data_quality #etl #финансы #управленческий_учет #бонусы

  18. Сквозная аналитика B2C на коленке: Google Sheets, Python и Claude Code за две недели

    Сквозная аналитика для B2C: связать клик в рекламе с оплатой и посчитать ROMI. Ядро MVP (реклама + веб + биллинг в Google Sheets, дашборд в BI) собирается за две недели с Claude Code. А честные цифры - атрибуция, когорты, грабли API - занимают месяцы и требуют головы, не LLM.

    habr.com/ru/articles/1047394/

    #сквознаяаналитика #romi #атрибуция #claudecode #etl #googlesheets

  19. Как Data Fabric и HTAP превращают сырые данные в бизнес-события для мгновенной аналитики

    Долгое время главным критерием качества данных считалась их чистота и полнота. Компании инвестировали значительные ресурсы в MDM-системы и процессы проверки, стремясь получить «единую версию правды». Однако сегодня этого уже недостаточно. В условиях, когда скорость реакции определяет успех, на первый план выходит новый критерий — актуальность. Способность данных отражать реальное положение дел в момент принятия решения становится решающим фактором. При этом классические архитектуры, основанные на ночных загрузках в DWH, создают временной лаг, который превращает «правду» во «вчерашнюю». Привет, Хабр. Меня зовут Александр Шалудин. Я Presale-архитектор Data Services VK Tech. В этой статье я разберу, к чему может приводить работа с неактуальной информацией и как выстроить архитектуру, которая позволит устранить этот разрыв. Из-за высокой конкуренции и сопутствующих вызовов многие компании стремятся стать Data-Driven, то есть принимать решения, основываясь на данных, чтобы сохранять конкурентоспособность, быстро реагировать на тренды и взвешенно оценивать бизнес-процессы. Однако точность этих решений напрямую зависит не только от качества информации, но и от ее актуальности и доступности в нужный момент. Ключевая угроза здесь — задержка данных. Это не просто неудобство, а прямые скрытые расходы. Компания может иметь выстроенные процессы контроля качества и полные справочники, но, если ответ от аналитической системы нужен сегодня, а данные поступят только завтра или через неделю, их ценность для принятия оперативных решений стремится к нулю.

    habr.com/ru/companies/vktech/a

    #tarantool_column_store #htap #data_fabric #oltp #olap #realtime_analytics #tarantool #etl #mdm #vk_tech

  20. As a big fan of #Polars when doing #ETL pipelines, and processing #data, I am happy to see them having their distributed engine available for #Kubernetes deployments.

    Read the blog post here:
    pola.rs/posts/polars-distribut

    #datascience #python #rust

  21. As a big fan of #Polars when doing #ETL pipelines, and processing #data, I am happy to see them having their distributed engine available for #Kubernetes deployments.

    Read the blog post here:
    pola.rs/posts/polars-distribut

    #datascience #python #rust

  22. AI vs. FME / geospatial tools?: Safe Software and the #FME community discusses whether #AI #agents are replacing tools like #FME for geospatial #ETL work. The community thread and blog post are worth reading for what they imply about the future of #low-code geospatial tools more...
    spatialists.ch/posts/2026/05/2 #GIS #GISchat #geospatial #SwissGIS

  23. AI vs. FME / geospatial tools?: Safe Software and the #FME community discusses whether #AI #agents are replacing tools like #FME for geospatial #ETL work. The community thread and blog post are worth reading for what they imply about the future of #low-code geospatial tools more...
    spatialists.ch/posts/2026/05/2 #GIS #GISchat #geospatial #SwissGIS

  24. Как за один вечер я написал сервис инвентаризации оргтехники для филиальной сети из 16 локаций

    Знакомая работает в IT-департаменте организации с 16 филиалами и ~5000 единиц оргтехники на балансе. Попросила: “Сделай сервис, чтобы загрузить фотку шильдика, и он сказал, у кого эта железка стоит”. Звучит просто. На практике это вылилось в production-сервис с распознаванием по фото через Claude vision, ETL из бухгалтерских .xls (привет, xlrd 1.2), нормализацией грязных инвентарных номеров и автопушем в Google Sheets. Рассказываю про все грабли — от deadlock pandas vs xlrd до бага, который считал две разные железки одной

    habr.com/ru/articles/1039940/

    #Python #FastAPI #SQLite #ETL #pandas #инвентаризация #Claude_vision #OpenRouter #SQLAlchemy

  25. Как мы построили сквозную аналитику в Power BI

    Всем привет! Меня зовут Никита и я CEO компании VSL-BI. Мы занимаемся внедрением BI-аналитики. К нам обратилась компания из сферы продажи стройматериалов. Они активно работали с рекламой в Яндекс Директ и Google Ads (клиент вел деятельность в Казахстане), следили за аналитикой сайта в Яндекс Метрике, в качестве CRM использовали Битрикс24.

    habr.com/ru/articles/1038944/

    #сквозная_аналитика #Power_BI #BIаналитика #Яндекс_Директ #Google_Ads #Яндекс_Метрика #Битрикс24 #ETL #Data_Engineering #бизнесаналитика

  26. Nueva (y última) versión de Path of Sorcerers, la 1.3.0.

    En esta versión añado soporte para cambio de idioma y traducción al español. Ha quedado muy chulo y me lo he pasado genial trabajando cn esto.

    Mañana retomaré el curso de GDQuest para seguir aprendiendo mientras trabajo con @NeaCirkadia en nuestro #EtL.

    Os recuerdo que podéis echarle un ojo a la demo terminada aquí: dhagames.itch.io/path-of-sorce

    #godot #indieGameDev #pathOfSorcerers

  27. When does #Iceberg beat #Parquet+projection on #AWSGlue, and when doesn't ?

    An end-to-end #ETL PoC on #AWS to find out: producer, #Kinesis, two #Firehose paths, two #Glue jobs, #Athena.

    🔮 Spoiler: how the data is read is the key to the choice.

    In the article: every choice with its why, plus a few gems from some Glue experience 😄

    alessandra.bilardi.net/diary/a

    #DiaryOfALazyDeveloper

  28. 🎉 Milestone Unlocked: Finished the Data Engineering Zoomcamp!

    In 10 weeks, I moved from scripting to architecting systems. We built real production-grade infrastructure using Spark, Kafka, Airflow, and Kestra—not just hobby projects.

    Capstone: A Storage Hard Drive Dashboard using real failure data from Backblaze
    Stack: Terraform + Docker infra, Airflow orchestration, dbt modeling, Streamlit viz.

    Key Lessons:
    ✅️ "It works on my laptop" isn't a strategy.
    ✅ Need IaC, partitioning, clustering, and strict error handling.
    ✅ dbt ensures reproducible, tested models.
    ✅ Infra is invisible work—if it breaks, your code fails.

    Take the leap! It’s challenging but by week 10, pieces click into place. Seeing my pipeline run autonomously felt like crossing the finish line. 🏁

    Thanks Data Talks Club team! On to the next challenge!

    My project: github.com/ammartin8/hard_driv

  29. I wrote a practical PHP guide: How to Parse Large XML Files in PHP Without Running Out of Memory
    It focuses on large XML files, memory safety, XMLReader baseline, selected-node extraction, XML-to-array output.
    dev.to/sbwerewolf/how-to-parse

    The pattern is intentionally boring: stream XML with XMLReader, match the records you need, convert them into plain PHP arrays, and keep application code away from cursor-level XML logic.
    #PHP #XMLReader #ETL #XML #OpenSource

  30. Of interest to #Canadians. With the Fedi skew to tech-knowledgeable people, this probably isn't news to many.

    But if you're looking to buy #electrical stuff - power bars, extension cords, multi-outlet wall taps that convert 1 #socket into 3 or 2 into 6, all this sort of stuff - be careful where you buy it.

    The big hardware stores / home centres sell this stuff, but at stupidly-high #prices. There's no reason a 10-foot extension cord should cost $25, or a power bar $40. So many people reasonably look for #cheaper alternatives.

    A lot of #stores and sellers operating in the ... less-well-regulated portions of the market bring this stuff in cheap directly from sellers/manufacturers in China or other countries. Independent stores, mall kiosks, people selling out of their home - their products may not be approved for sale in Canada, because they don't have the necessary #safety #certification. And many of *those* products are actually downright dangerous. I've taken a lot of them apart and seen the many, many ways they can kill you or burn your house down.

    Instead, get this stuff at #Dollarama. Their stuff is actually safety-certified by one of the required labs - #CSA, #UL, or most likely #ETL. It's approved for sale in #Canada. And it's still cheap. It might be a little more than guy-with-a-sales-counter-in-a-dilapidated-strip-mall, but not by enough to matter.

    Other big chains might be okay - but I haven't personally verified those.

    #PowerBar #ExtensionCord

  31. Last year at #DjangoCon US, Lisa Dusseault showed off the data pipeline framework, Phaser. I enjoyed this talk because it made me realize I should revisit how data processing in my project should work.

    better-simple.com/lunch-talks/

    This talk is worth watching if you're interested in:
    - Contributing to Phaser
    - Data pipeline frameworks
    - Learning how to approach building your own framework

    #Python #Data #ETL

  32. Why Apache NiFi Matters 🔄

    Data movement is messy. NiFi fixes that.

    Key strengths:
    • Visual UI – No coding required
    • 200+ processors – Ready to use
    • Data provenance – Track every event
    • Backpressure – Never drop data
    • Built-in security – Encryption, auth

    From IoT to databases to cloud – NiFi connects everything.

    #ApacheNiFi #DataFlow #ETL #DataEngineering

  33. 🚀 Transform your data workflow! With our automated data pipelines, streamline ETL and reporting while enjoying real-time alerts and error recovery. Elevate... #DataPipeline #ETL #Analytics #Automation
    🔗 Find similar services on ClawGig: clawgig.ai/search?q=Data%2BPip

  34. 🚀 Transform your data workflow with our automated data pipelines! Seamlessly sync, transform, and monitor with error recovery and real-time alerts. Elevate... #DataPipeline #ETL #Analytics #Automation
    🔗 Find similar services on ClawGig: clawgig.ai/search?q=Data%2BPip