home.social

#etl — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #etl, aggregated by home.social.

  1. AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

    Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.

    habr.com/ru/articles/1060962/

    #AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов

  2. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  3. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  4. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  5. CROWler 2.0 has landed 🚀

    Highlights:
    • Redesigned Information Seeds for discovering and onboarding relevant sources
    • Rebuilt email/newsletter discovery that turns useful signals into structured data
    • More powerful AI and non-AI Agents 2.0
    • OpenAPI support for custom API plugins
    • More scalable events and analysis tools
    • Better performance, lower memory use and greater scalability

    github.com/pzaino/thecrowler

    What discovery pipeline will you build next?

    #TheCROWler #DataDiscovery #ETL #OSINT

  6. Каталог данных: что нужно знать, прежде чем начинать внедрение

    Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.

    habr.com/ru/companies/vktech/a

    #data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform

  7. Каталог данных: что нужно знать, прежде чем начинать внедрение

    Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.

    habr.com/ru/companies/vktech/a

    #data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform

  8. Каталог данных: что нужно знать, прежде чем начинать внедрение

    Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.

    habr.com/ru/companies/vktech/a

    #data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform

  9. AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения

    Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.

    habr.com/ru/articles/1054028/

    #agtech #dss #etl #rule_engine #Headless_API

  10. AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения

    Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.

    habr.com/ru/articles/1054028/

    #agtech #dss #etl #rule_engine #Headless_API

  11. AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения

    Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.

    habr.com/ru/articles/1054028/

    #agtech #dss #etl #rule_engine #Headless_API

  12. Как я устал писать парсер под каждый прайс и сделал из этого библиотеку

    У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.

    habr.com/ru/articles/1053956/

    #python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source

  13. Как я устал писать парсер под каждый прайс и сделал из этого библиотеку

    У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.

    habr.com/ru/articles/1053956/

    #python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source

  14. Как я устал писать парсер под каждый прайс и сделал из этого библиотеку

    У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.

    habr.com/ru/articles/1053956/

    #python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source

  15. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  16. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  17. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  18. it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs

  19. The other day I created a solution for a client of mine to find out which of their #database stored views got used actively by an #ETL middleware application. It involved many steps.

    1. Figure out where the middleware stores its processing configurations.
    2. Figure out their structure.
    3. Translate that structure into something I can use.
    4. Filter out the database object names.
    5. Make those available to the DB.
    6. Find matches in the DB.
    7. Find the remainder.

    Fun stuff.

  20. The other day I created a solution for a client of mine to find out which of their #database stored views got used actively by an #ETL middleware application. It involved many steps.

    1. Figure out where the middleware stores its processing configurations.
    2. Figure out their structure.
    3. Translate that structure into something I can use.
    4. Filter out the database object names.
    5. Make those available to the DB.
    6. Find matches in the DB.
    7. Find the remainder.

    Fun stuff.

  21. The other day I created a solution for a client of mine to find out which of their #database stored views got used actively by an #ETL middleware application. It involved many steps.

    1. Figure out where the middleware stores its processing configurations.
    2. Figure out their structure.
    3. Translate that structure into something I can use.
    4. Filter out the database object names.
    5. Make those available to the DB.
    6. Find matches in the DB.
    7. Find the remainder.

    Fun stuff.

  22. The other day I created a solution for a client of mine to find out which of their #database stored views got used actively by an #ETL middleware application. It involved many steps.

    1. Figure out where the middleware stores its processing configurations.
    2. Figure out their structure.
    3. Translate that structure into something I can use.
    4. Filter out the database object names.
    5. Make those available to the DB.
    6. Find matches in the DB.
    7. Find the remainder.

    Fun stuff.

  23. The other day I created a solution for a client of mine to find out which of their #database stored views got used actively by an #ETL middleware application. It involved many steps.

    1. Figure out where the middleware stores its processing configurations.
    2. Figure out their structure.
    3. Translate that structure into something I can use.
    4. Filter out the database object names.
    5. Make those available to the DB.
    6. Find matches in the DB.
    7. Find the remainder.

    Fun stuff.

  24. Как мы ушли от ETL к CDC: выбираем архитектуру real-time аналитики на PostgreSQL, Kafka и ClickHouse. Часть 1

    Все началось с просьбы сделать отчеты в реальном времени. На первый взгляд задача выглядела простой, но довольно быстро выяснилось, что существующая архитектура для этого не подходит. Проект был разбит на множество микросервисов, каждый из которых хранил данные в собственной PostgreSQL-базе. Чтобы строить сквозные отчеты, информацию нужно было где-то объединять. На тот момент аналитика уже работала через ETL: раз в сутки Airflow восстанавливал общую PostgreSQL из ежедневных бекапов, а Redash выполнял запросы уже к ней. Решение было надежным и не требовало нагрузки на production, но для real-time оно не годилось — в лучшем случае отчеты показывали состояние системы на начало дня.

    habr.com/ru/articles/1051760/

    #postgresql #clickhouse #kafka #debezium #cdc #kubernetes #etl #realtime_аналитика #kafka_connect #devops

  25. Как мы ушли от ETL к CDC: выбираем архитектуру real-time аналитики на PostgreSQL, Kafka и ClickHouse. Часть 1

    Все началось с просьбы сделать отчеты в реальном времени. На первый взгляд задача выглядела простой, но довольно быстро выяснилось, что существующая архитектура для этого не подходит. Проект был разбит на множество микросервисов, каждый из которых хранил данные в собственной PostgreSQL-базе. Чтобы строить сквозные отчеты, информацию нужно было где-то объединять. На тот момент аналитика уже работала через ETL: раз в сутки Airflow восстанавливал общую PostgreSQL из ежедневных бекапов, а Redash выполнял запросы уже к ней. Решение было надежным и не требовало нагрузки на production, но для real-time оно не годилось — в лучшем случае отчеты показывали состояние системы на начало дня.

    habr.com/ru/articles/1051760/

    #postgresql #clickhouse #kafka #debezium #cdc #kubernetes #etl #realtime_аналитика #kafka_connect #devops

  26. Как мы ушли от ETL к CDC: выбираем архитектуру real-time аналитики на PostgreSQL, Kafka и ClickHouse. Часть 1

    Все началось с просьбы сделать отчеты в реальном времени. На первый взгляд задача выглядела простой, но довольно быстро выяснилось, что существующая архитектура для этого не подходит. Проект был разбит на множество микросервисов, каждый из которых хранил данные в собственной PostgreSQL-базе. Чтобы строить сквозные отчеты, информацию нужно было где-то объединять. На тот момент аналитика уже работала через ETL: раз в сутки Airflow восстанавливал общую PostgreSQL из ежедневных бекапов, а Redash выполнял запросы уже к ней. Решение было надежным и не требовало нагрузки на production, но для real-time оно не годилось — в лучшем случае отчеты показывали состояние системы на начало дня.

    habr.com/ru/articles/1051760/

    #postgresql #clickhouse #kafka #debezium #cdc #kubernetes #etl #realtime_аналитика #kafka_connect #devops

  27. Оркестрация рабочих процессов: полное руководство

    Оркестрация рабочих процессов (workflow orchestration) — это практика координации множества автоматизированных задач, сервисов и систем для обеспечения их согласованного...

    #DST #DSTGlobal #ДСТ #ДСТГлобал #Оркестрация #GitHub #Kubernetes #ApacheAirflow #AWSStepFunctions #Temporal #Camunda #CICD #DevOps #Автоматизация #AIагенты #RBAC #SOAR #Обработкаданных #ETL

    Источник: dstglobal.ru/club/1242-orkestr

  28. Оркестрация рабочих процессов: полное руководство

    Оркестрация рабочих процессов (workflow orchestration) — это практика координации множества автоматизированных задач, сервисов и систем для обеспечения их согласованного...

    #DST #DSTGlobal #ДСТ #ДСТГлобал #Оркестрация #GitHub #Kubernetes #ApacheAirflow #AWSStepFunctions #Temporal #Camunda #CICD #DevOps #Автоматизация #AIагенты #RBAC #SOAR #Обработкаданных #ETL

    Источник: dstglobal.ru/club/1242-orkestr

  29. Оркестрация рабочих процессов: полное руководство

    Оркестрация рабочих процессов (workflow orchestration) — это практика координации множества автоматизированных задач, сервисов и систем для обеспечения их согласованного...

    #DST #DSTGlobal #ДСТ #ДСТГлобал #Оркестрация #GitHub #Kubernetes #ApacheAirflow #AWSStepFunctions #Temporal #Camunda #CICD #DevOps #Автоматизация #AIагенты #RBAC #SOAR #Обработкаданных #ETL

    Источник: dstglobal.ru/club/1242-orkestr

  30. Оркестрация рабочих процессов: полное руководство

    Оркестрация рабочих процессов (workflow orchestration) — это практика координации множества автоматизированных задач, сервисов и систем для обеспечения их согласованного...

    #DST #DSTGlobal #ДСТ #ДСТГлобал #Оркестрация #GitHub #Kubernetes #ApacheAirflow #AWSStepFunctions #Temporal #Camunda #CICD #DevOps #Автоматизация #AIагенты #RBAC #SOAR #Обработкаданных #ETL

    Источник: dstglobal.ru/club/1242-orkestr

  31. FIFO на миллионах строк: как подружить бонусы, SQL и асимметричный N×M-граф

    Всем привет! Меня зовут Иван Привалов , я разработчик в команде BI Авито Финтеха и в этой статье расскажу, как мы сделали FIFO-сопоставление между N начислений и M списаний для бонусов. Заодно покажу подвох, без которого SQL быстро превращался в тыкву. Статья будет полезна аналитикам и data-инженерам уровней мидл+, которые работают с финансовыми данными в Trino, Presto и Spark SQL.

    habr.com/ru/companies/avito/ar

    #trino #sql #fifo #мсфо #аналитика_данных #data_quality #etl #финансы #управленческий_учет #бонусы