#etl — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #etl, aggregated by home.social.
-
Watch Now: https://zurl.co/7QNmv
Extract, Transform & Load (ETL) Explained | ETL Process in Data Engineering | Beginner to Advanced
#ETL #DataEngineering #DataWarehouse #DataIntegration #SalesforceDataCloud #SQL #ELT #BusinessIntelligence #DataAnalytics #BigData #DataPipeline #CloudComputing #Informatica #Talend #AWSGlue #Peoplewoo #Salesforce #LearnETL #TechTutorial #DataEngineer -
Watch Now: https://zurl.co/7QNmv
Extract, Transform & Load (ETL) Explained | ETL Process in Data Engineering | Beginner to Advanced
#ETL #DataEngineering #DataWarehouse #DataIntegration #SalesforceDataCloud #SQL #ELT #BusinessIntelligence #DataAnalytics #BigData #DataPipeline #CloudComputing #Informatica #Talend #AWSGlue #Peoplewoo #Salesforce #LearnETL #TechTutorial #DataEngineer -
Watch Now: https://zurl.co/7QNmv
Extract, Transform & Load (ETL) Explained | ETL Process in Data Engineering | Beginner to Advanced
#ETL #DataEngineering #DataWarehouse #DataIntegration #SalesforceDataCloud #SQL #ELT #BusinessIntelligence #DataAnalytics #BigData #DataPipeline #CloudComputing #Informatica #Talend #AWSGlue #Peoplewoo #Salesforce #LearnETL #TechTutorial #DataEngineer -
Watch Now: https://zurl.co/7QNmv
Extract, Transform & Load (ETL) Explained | ETL Process in Data Engineering | Beginner to Advanced
#ETL #DataEngineering #DataWarehouse #DataIntegration #SalesforceDataCloud #SQL #ELT #BusinessIntelligence #DataAnalytics #BigData #DataPipeline #CloudComputing #Informatica #Talend #AWSGlue #Peoplewoo #Salesforce #LearnETL #TechTutorial #DataEngineer -
Watch Now: https://zurl.co/7QNmv
Extract, Transform & Load (ETL) Explained | ETL Process in Data Engineering | Beginner to Advanced
#ETL #DataEngineering #DataWarehouse #DataIntegration #SalesforceDataCloud #SQL #ELT #BusinessIntelligence #DataAnalytics #BigData #DataPipeline #CloudComputing #Informatica #Talend #AWSGlue #Peoplewoo #Salesforce #LearnETL #TechTutorial #DataEngineer -
TROCCOの開発・運用を楽にする?Chromeの「Geminiに相談」を試してみた
https://qiita.com/suginohara/items/238188d1f18152748e83?utm_campaign=popular_items&utm_medium=feed&utm_source=popular_items -
Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации
Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.
https://habr.com/ru/articles/1060944/
#airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners
-
Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации
Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.
https://habr.com/ru/articles/1060944/
#airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners
-
Заставляем Airflow самого заводить задачи в YouTrack без смс и регистрации
Работая единственным QA в команде, в обязанности которого активно входит мониторинг, я столкнулась с проблемами тайм-менеджмента: очень много времени уходит на анализ упавших пайплайнов, заведение однотипных задач, поднятие тревоги, отмена тревоги, потому что проблема уже исправляется и прочие прелести тестерской работы. В один прекрасный осенний денек, сидя на окне и думая о нем (мониторинге), я решила - хватит это терпеть. Посидела, погуглила, вспомнила родительские слова “Хочешь сделать что-то хорошо - сделай это сама”. Что ж таков путь.
https://habr.com/ru/articles/1060944/
#airflow #apache_airflow #etl #listener #dag #dags #youtrack #api #python #listeners
-
DE. Путь файла по слоям
В исходном orders.csv было 11 строк. До BI-витрины дошло 7, а валовая сумма 4720.30 после применения бизнес-правил превратилась в 2200.30 выручки. Четыре строки не исчезли: каждая попала в rejects с конкретной причиной. На этом небольшом примере покажу весь путь данных через RAW, STG, CORE и MARTS. Разберём, где меняются строки и суммы, как пережить повторную доставку файла и какие проверки позволяют доверять итоговому дашборду. Внутри MinIO, Postgres и Airflow.
https://habr.com/ru/articles/1062446/
#Data_Engineering #ETL #DWH #пайплайн_данных #Apache_Airflow #PostgreSQL #MinIO #Data_Quality #CSV #BI
-
AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети
Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.
https://habr.com/ru/articles/1060962/
#AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов
-
AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети
Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.
https://habr.com/ru/articles/1060962/
#AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов
-
AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети
Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.
https://habr.com/ru/articles/1060962/
#AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов
-
Ingénierie des données : *sculpter l’information*. #DataEngineering #Sculpture #Expertise #Tech #Luxe #ETL #Spark #Scala #Java #Python #Shell ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-sculpture-expertise-share-7479993797121220609-5f61/
-
Ingénierie des données : *sculpter l’information*. #DataEngineering #Sculpture #Expertise #Tech #Luxe #ETL #Spark #Scala #Java #Python #Shell ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-sculpture-expertise-share-7479993797121220609-5f61/
-
Ingénierie des données : *sculpter l’information*. #DataEngineering #Sculpture #Expertise #Tech #Luxe #ETL #Spark #Scala #Java #Python #Shell ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-sculpture-expertise-share-7479993797121220609-5f61/
-
Ingénierie des données : *sculpter l’information*. #DataEngineering #Sculpture #Expertise #Tech #Luxe #ETL #Spark #Scala #Java #Python #Shell ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-sculpture-expertise-share-7479993797121220609-5f61/
-
Ingénierie des données : *sculpter l’information*. #DataEngineering #Sculpture #Expertise #Tech #Luxe #ETL #Spark #Scala #Java #Python #Shell ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-sculpture-expertise-share-7479993797121220609-5f61/
-
Vos données sont une *soupe mal mixée* ? *Mixez-les*. #DataEngineering #Humour #Tech #NoBullshit #ETL #Optimisation ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-humour-tech-share-7479512369493270528-xmvr/
-
Vos données sont une *soupe mal mixée* ? *Mixez-les*. #DataEngineering #Humour #Tech #NoBullshit #ETL #Optimisation ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-humour-tech-share-7479512369493270528-xmvr/
-
Vos données sont une *soupe mal mixée* ? *Mixez-les*. #DataEngineering #Humour #Tech #NoBullshit #ETL #Optimisation ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-humour-tech-share-7479512369493270528-xmvr/
-
Vos données sont une *soupe mal mixée* ? *Mixez-les*. #DataEngineering #Humour #Tech #NoBullshit #ETL #Optimisation ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-humour-tech-share-7479512369493270528-xmvr/
-
Vos données sont une *soupe mal mixée* ? *Mixez-les*. #DataEngineering #Humour #Tech #NoBullshit #ETL #Optimisation ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-humour-tech-share-7479512369493270528-xmvr/
-
CROWler 2.0 has landed 🚀
Highlights:
• Redesigned Information Seeds for discovering and onboarding relevant sources
• Rebuilt email/newsletter discovery that turns useful signals into structured data
• More powerful AI and non-AI Agents 2.0
• OpenAPI support for custom API plugins
• More scalable events and analysis tools
• Better performance, lower memory use and greater scalabilityhttps://github.com/pzaino/thecrowler
What discovery pipeline will you build next?
-
CROWler 2.0 has landed 🚀
Highlights:
• Redesigned Information Seeds for discovering and onboarding relevant sources
• Rebuilt email/newsletter discovery that turns useful signals into structured data
• More powerful AI and non-AI Agents 2.0
• OpenAPI support for custom API plugins
• More scalable events and analysis tools
• Better performance, lower memory use and greater scalabilityhttps://github.com/pzaino/thecrowler
What discovery pipeline will you build next?
-
CROWler 2.0 has landed 🚀
Highlights:
• Redesigned Information Seeds for discovering and onboarding relevant sources
• Rebuilt email/newsletter discovery that turns useful signals into structured data
• More powerful AI and non-AI Agents 2.0
• OpenAPI support for custom API plugins
• More scalable events and analysis tools
• Better performance, lower memory use and greater scalabilityhttps://github.com/pzaino/thecrowler
What discovery pipeline will you build next?
-
CROWler 2.0 has landed 🚀
Highlights:
• Redesigned Information Seeds for discovering and onboarding relevant sources
• Rebuilt email/newsletter discovery that turns useful signals into structured data
• More powerful AI and non-AI Agents 2.0
• OpenAPI support for custom API plugins
• More scalable events and analysis tools
• Better performance, lower memory use and greater scalabilityhttps://github.com/pzaino/thecrowler
What discovery pipeline will you build next?
-
Données *éparpillées* ? *Assemblez-les*. #DataEngineering #DataEngineer #Puzzle #Stratégie #ROI #Leadership #Kafka #ETL ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-dataengineer-puzzle-share-7478732682080759809-O4vQ/
-
Données *éparpillées* ? *Assemblez-les*. #DataEngineering #DataEngineer #Puzzle #Stratégie #ROI #Leadership #Kafka #ETL ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-dataengineer-puzzle-share-7478732682080759809-O4vQ/
-
Données *éparpillées* ? *Assemblez-les*. #DataEngineering #DataEngineer #Puzzle #Stratégie #ROI #Leadership #Kafka #ETL ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-dataengineer-puzzle-share-7478732682080759809-O4vQ/
-
Données *éparpillées* ? *Assemblez-les*. #DataEngineering #DataEngineer #Puzzle #Stratégie #ROI #Leadership #Kafka #ETL ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-dataengineer-puzzle-share-7478732682080759809-O4vQ/
-
Ingénierie des données : *construire une cathédrale*. #DataEngineering #DataEngineer #Expertise #Tech #Luxe #ETL #Sécurité #RGPD ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-dataengineer-expertise-share-7478710263576453122-KpIB/
-
Ingénierie des données : *construire une cathédrale*. #DataEngineering #DataEngineer #Expertise #Tech #Luxe #ETL #Sécurité #RGPD ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-dataengineer-expertise-share-7478710263576453122-KpIB/
-
Ingénierie des données : *construire une cathédrale*. #DataEngineering #DataEngineer #Expertise #Tech #Luxe #ETL #Sécurité #RGPD ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-dataengineer-expertise-share-7478710263576453122-KpIB/
-
Ingénierie des données : *construire une cathédrale*. #DataEngineering #DataEngineer #Expertise #Tech #Luxe #ETL #Sécurité #RGPD ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-dataengineer-expertise-share-7478710263576453122-KpIB/
-
Ingénierie des données : *construire une cathédrale*. #DataEngineering #DataEngineer #Expertise #Tech #Luxe #ETL #Sécurité #RGPD ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-dataengineer-expertise-share-7478710263576453122-KpIB/
-
Каталог данных: что нужно знать, прежде чем начинать внедрение
Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.
https://habr.com/ru/companies/vktech/articles/1054554/
#data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform
-
Каталог данных: что нужно знать, прежде чем начинать внедрение
Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.
https://habr.com/ru/companies/vktech/articles/1054554/
#data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform
-
Каталог данных: что нужно знать, прежде чем начинать внедрение
Объем данных в компаниях постоянно растет, и это вынуждает бизнес и ИТ-специалистов перестраивать ИТ-ландшафт, чтобы упростить поиск, понимание и использование информации. В качестве одного из компонентов подобных модернизированных реализаций нередко рассматривают дата-каталог, который помогает навести порядок в метаданных и сделать данные более доступными. Вместе с тем хоть такой подход и имеет право на жизнь, но практика показывает, что наибольший потенциал каталоги данных раскрывают, когда их внедрению предшествует выстраивание базовых процессов управления: ответственности за данные, контроля качества и управления изменениями. Меня зовут Сергей Петриченко. Я продуктовый менеджер VK Data Platform . В этой статье разберем, почему каталог — это не первый шаг к порядку, а скорее мультипликатор уже существующей зрелости и что необходимо сделать, чтобы его внедрение принесло реальную пользу.
https://habr.com/ru/companies/vktech/articles/1054554/
#data_catalog #data_governance #метаданные #качество_данных #lineage #data_contracts #etl #sla #управление_данными #vk_data_platform
-
AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения
Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.
-
AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения
Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.
-
AgTech без хайпа: как мы строим систему, которая доводит агронома от симптома на поле до решения
Автор: Олег Линьков, Webformula ( webformula-agro.ru ) Агросектор — одна из самых недооценённых ниш для прикладного AgTech. Здесь нет хайпа вокруг LLM на каждом шагу, зато есть жёсткие ограничения, которые делают задачу интересной с инженерной точки зрения: сезонность с точностью до недель, географическая распределённость, аудитория с низкой толерантностью к нерелевантному шуму и предметная область, где ошибка в данных стоит реального урожая. Я двенадцать лет занимаюсь digital в агро и последние годы — построением систем, которые работают на стыке предметной агрономии и продуктовой инженерии. В этой статье — без маркетинга, только архитектура и продуктовая логика — разберу, как устроены три вещи: автоматизация сезонности в рекламных кампаниях, система поддержки решений (DSS) как алгоритмическое дерево, и триггерные коммуникации на базе погодного API. И почему в этой нише источник данных важнее модели.
-
Как я устал писать парсер под каждый прайс и сделал из этого библиотеку
У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.
https://habr.com/ru/articles/1053956/
#python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source
-
Как я устал писать парсер под каждый прайс и сделал из этого библиотеку
У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.
https://habr.com/ru/articles/1053956/
#python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source
-
Как я устал писать парсер под каждый прайс и сделал из этого библиотеку
У нас на проекте десятки прайсингов на топливо: один вендор шлёт CSV, другой Excel, третий JSON на вебхук. Данные одни и те же, но колонка цены везде называется по-своему, даты в трёх форматах, единицы то литры, то галлоны, а половина нужных полей просто отсутствует. И под каждый источник у меня жил отдельный парсер на сотню строк if-else. Сначала их было три, потом восемь, потом я перестал считать. А по-настоящему добило другое: эти парсеры ломались молча. Вендор тихо переименовывал колонку. В третий раз за месяц копируя один и тот же парсер, я понял, что так нельзя, и вынес логику маппинга из кода в данные. Из этого выросла библиотека fidelis: ты описываешь данные один раз как Pydantic-модель, а соответствие под каждый кривой источник один раз пишет LLM — в виде читаемой YAML-спеки, которую ты ревьюишь и коммитишь. Дальше LLM не нужен: чистый детерминированный Python, валидация каждой строки и отлов изменений схемы ещё в CI. Рассказываю, как дошёл до жизни такой и как это устроено.
https://habr.com/ru/articles/1053956/
#python #парсинг_данных #ETL #pydantic #обработка_csv #интеграция_данных #llm #конвейер_данных #валидация_данных #open_source
-
it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs
-
it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs
-
it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs
-
it is crazy how much info is packed into daily wsj is another example but how to access it all for a more holistic and granular view #etl jobs
-
The other day I created a solution for a client of mine to find out which of their #database stored views got used actively by an #ETL middleware application. It involved many steps.
1. Figure out where the middleware stores its processing configurations.
2. Figure out their structure.
3. Translate that structure into something I can use.
4. Filter out the database object names.
5. Make those available to the DB.
6. Find matches in the DB.
7. Find the remainder.Fun stuff.