home.social

#etl — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #etl, aggregated by home.social.

  1. Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации

    Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.

    habr.com/ru/articles/1060944/

    #airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners

  2. Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации

    Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.

    habr.com/ru/articles/1060944/

    #airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners

  3. Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации

    Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.

    habr.com/ru/articles/1060944/

    #airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners

  4. DE. Путь файла по слоям

    В исходном orders.csv было 11 строк. До BI-витрины дошло 7, а валовая сумма 4720.30 после применения бизнес-правил превратилась в 2200.30 выручки. Четыре строки не исчезли: каждая попала в rejects с конкретной причиной. На этом небольшом примере покажу весь путь данных через RAW, STG, CORE и MARTS. Разберём, где меняются строки и суммы, как пережить повторную доставку файла и какие проверки позволяют доверять итоговому дашборду. Внутри MinIO, Postgres и Airflow.

    habr.com/ru/articles/1062446/

    #Data_Engineering #ETL #DWH #пайплайн_данных #Apache_Airflow #PostgreSQL #MinIO #Data_Quality #CSV #BI

  5. AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

    Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.

    habr.com/ru/articles/1060962/

    #AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов

  6. AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

    Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.

    habr.com/ru/articles/1060962/

    #AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов

  7. AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

    Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.

    habr.com/ru/articles/1060962/

    #AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов

  8. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  9. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  10. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  11. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  12. Каталог данных: что нужно знать, прежде чем начинать внедрение

    Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.

    habr.com/ru/companies/vktech/a

    #data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform

  13. Каталог данных: что нужно знать, прежде чем начинать внедрение

    Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.

    habr.com/ru/companies/vktech/a

    #data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform

  14. Каталог данных: что нужно знать, прежде чем начинать внедрение

    Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.

    habr.com/ru/companies/vktech/a

    #data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform

  15. AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения

    Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.

    habr.com/ru/articles/1054028/

    #agtech #dss #etl #rule_engine #Headless_API

  16. AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения

    Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.

    habr.com/ru/articles/1054028/

    #agtech #dss #etl #rule_engine #Headless_API

  17. AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения

    Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.

    habr.com/ru/articles/1054028/

    #agtech #dss #etl #rule_engine #Headless_API

  18. Как я устал писать парсер под каждый прайс и сделал из этого библиотеку

    У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.

    habr.com/ru/articles/1053956/

    #python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source

  19. Как я устал писать парсер под каждый прайс и сделал из этого библиотеку

    У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.

    habr.com/ru/articles/1053956/

    #python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source

  20. Как я устал писать парсер под каждый прайс и сделал из этого библиотеку

    У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.

    habr.com/ru/articles/1053956/

    #python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source

  21. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  22. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  23. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  24. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  25. The other day I created a solution for a client of mine to find out which of their #database stored views got used actively by an #ETL middleware application. It involved many steps.

    1. Figure out where the middleware stores its processing configurations.
    2. Figure out their structure.
    3. Translate that structure into something I can use.
    4. Filter out the database object names.
    5. Make those available to the DB.
    6. Find matches in the DB.
    7. Find the remainder.

    Fun stuff.