home.social

#data_engineering — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #data_engineering, aggregated by home.social.

fetched live
  1. Книга: «Современная бизнес-аналитика. Увеличьте ценность данных с помощью Python и R»

    Привет, Хаброжители! Извлечение ценности из данных — сложный процесс. Чтобы превратить данные в информацию, бизнес-аналитик должен уметь работать с различными технологиями, включая базы данных, языки программирования и коммерческие аналитические инструменты. Преодолейте разрыв между миром технологий и бизнеса. Сосредоточьтесь на развитии необходимых навыков с помощью R и Python на примерах из реальной жизни. Узнайте, какие методологии стоит использовать для успешной реализации проектов.

    habr.com/ru/companies/piter/ar

    #python #статистика_в_it #data_mining #data_engineering #визуализация_данных #базы_данных #бизнесмодели #исследования_и_прогнозы_в_it

  2. Как я собрала локальную MCP-платформу для мониторинга промышленных данных

    Что получится, если собрать PostgreSQL, Airflow, JupyterLab, MinIO, Superset, шесть MCP-сервисов и локальную модель Ollama в одном Docker Compose-стенде? Показываю полный путь синтетических промышленных данных: от витрин и проверок качества до Parquet-артефактов, MCP-инструментов и LLM-пояснений. Внутри — архитектура, воспроизводимый запуск, результаты проверок и открытый репозиторий.

    habr.com/ru/articles/1064802/

    #MCP #Model_Context_Protocol #Data_Engineering #Apache_Airflow #PostgreSQL #Docker_Compose #MinIO #Ollama #JupyterLab #ETL

  3. Внутри ИИ‑Напарника: как работает оркестр агентов в ритейле

    Всем привет! Это Алексей из GlowByte. В прошлой статье я говорил о том, почему категорийный менеджер в большой сети часто чувствует себя одиноким среди сотен дашбордов: систем у него избыток, а компетентного собеседника, который был бы в его контексте и без своей повестки, рядом нет. Решение, которое мы GlowByte называем мультиагентной платформой, закрывает именно эту потребность. В новой статье разберём, что под капотом у такого решения и почему ИИ‑напарник ближе к партнёру по бизнесу, чем к очередному чат‑боту.

    habr.com/ru/companies/glowbyte

    #искусственный_интеллект #glowbyte #мультиагентные_системы #data_engineering #llm #prompt_injection #информационная_безопасность #ритейл #автоматизация_бизнеса #архитектура_платформы

  4. Apache Iceberg: Индиана Джонс и Каталог судьбы

    *.parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы или мусор из файлов и кого вообще к ним подпустят. Это каталог. Разбираю простым языком, что такое Apache Iceberg, зачем ему каталог - и почему тихая новость про Polaris важнее, чем кажется. В продолжении анонса новостей

    habr.com/ru/articles/1064224/

    #Apache_Iceberg #каталог_данных #Polaris #lakehouse #data_engineering #PostgreSQL #ClickHouse #Trino #DuckLake #объектное_хранилище

  5. Apache Spark и компиляция пользовательских функций UDF на Java в рантайме

    Привет, Хабр! Меня зовут Михаил Сичалов, я руководитель проектов и эксперт практики Applied Intelligence в компании Axenix. Это вводная статья из цикла работ, посвящённых реальным сценариям использования Apache Spark и сопутствующим техническим нюансам, с которыми я столкнулся за последнее десятилетие работы над проектами в области Data Engineering. Я решил систематизировать и переосмыслить свой опыт работы с этим фреймворком и поделиться с сообществом интересными и нестандартными аспектами, освоенными на практике. Несмотря на выразительность модуля Spark SQL с точки зрения описания преобразований над данными, зачастую возникает необходимость в создании пользовательских функций (UDF). Для этого в Apache Spark есть целое подмножество API, с помощью которого можно реализовать пользовательскую функцию произвольной сложности. Но что делать в случае, когда код функции становится доступным только в рантайме, а Spark используется в связке с Java API? В данной статье рассмотрим подход к подготовке, компиляции и исполнению Java-кода пользовательских функций в рантайме приложения Spark, а также, почему этого не стоит повторять.

    habr.com/ru/companies/axenix/a

    #apache_spark #java #janino #user_defined_function #compilers #runtime_compilation #data_engineering #блог_компании_Axenix

  6. DE. Путь файла по слоям

    В исходном orders.csv было 11 строк. До BI-витрины дошло 7, а валовая сумма 4720.30 после применения бизнес-правил превратилась в 2200.30 выручки. Четыре строки не исчезли: каждая попала в rejects с конкретной причиной. На этом небольшом примере покажу весь путь данных через RAW, STG, CORE и MARTS. Разберём, где меняются строки и суммы, как пережить повторную доставку файла и какие проверки позволяют доверять итоговому дашборду. Внутри MinIO, Postgres и Airflow.

    habr.com/ru/articles/1062446/

    #Data_Engineering #ETL #DWH #пайплайн_данных #Apache_Airflow #PostgreSQL #MinIO #Data_Quality #CSV #BI

  7. AI‑assisted development в малом бизнесе: как я собрала систему обработки отзывов для ресторанной сети

    Я маркетолог и до этого проекта не писала код. Но с помощью GPT собрала рабочую систему сбора, обработки и аналитики отзывов для ресторанной сети: 16 500 отзывов в одном контуре, более 9 500 записей в собственном хранилище, четыре XML-фида, мониторинг, автоответы и 130+ страниц документации. Все это обходится в 8,5К в месяц. Это кейс не только про AI-assisted development, но и про вполне прикладную пользу для бизнеса: меньше ручной работы, меньше пропусков и ошибок, единая аналитика и понятная стоимость эксплуатации. А заодно – честный разбор того, где AI действительно снижает порог входа в разработку, а где без человеческого контроля быстро начинает моросить.

    habr.com/ru/articles/1060962/

    #AIassisted_development #ChatGPT #автоматизация_бизнеспроцессов #Cloudflare_Workers #Cloudflare_D1 #serverless #ETL #интеграция_API #data_engineering #автоматизация_отзывов

  8. Пока все хоронили пайплайны, ClickHouse достраивал слои

    «Отдельные базы больше не нужны», «конец пайплайнов» - каждую неделю кто-то крупный со сцены хоронит то, что ты вчера поставил в прод. ClickHouse поступил ровно наоборот, и поэтому его анонсы стоит прочитать внимательно. Что реально показали на Open House 2026 и что из этого доедет до прода - разбор практика без вендорского глянца.

    habr.com/ru/articles/1056292/

    #clickhouse #postgresql #Clickstack #olap #lakehouse #data_engineering #observability #колоночная_субд #ClickHouse_Agents #Open_House_2026

  9. Databricks Data and AI Summit 2026. Моя первая поездка в США

    Недавно мне удалось посетить Data + AI Summit в Сан-Франциско в качестве Databricks MVP . Крупнейшую конференцию Databricks, посвященную данным, искусственному интеллекту. На мероприятии собралось более 30 000 участников из более чем 160 стран. Я много слышал и читал об этом саммите, но никогда не мог представить, что попаду на его. Все началось с того, что всем Databricks MVP предоставил бесплатный билет на мероприятие (стоимость билета без скидок около 1000$). Звучит конечно, здорово, но чтобы попасть нужна еще виза, билеты на самолёт и проживание в гостиннице. Хорошо хоть питание было организовано на самом мероприятии. На удивление записаться на визу в Кракове и получить её оказалось довольно просто, запись за неделю и через 2 дня уведомление, что виза одобрена, круто! Далее покупка билетов на самолёт примерно 1000$ в одну сторону и проживание в гостиннице около 150$ в сутки. К счатью моя компания приняла решние частично компенсировать расходы. Большое ей спасибо, возможно на тот момент я бы не решился поехать и выложить несколько тысяч долларов за мероприятие.

    habr.com/ru/articles/1055724/

    #databricks #dais #data_engineering #data_engineer #data_and_ai_summit

  10. ContentCombine: как я сделал мультинишевый контент-комбайн и запустил ежедневный SEO-дайджест

    Я сделал ContentCombine — мультинишевый контент-комбайн, который собирает материалы из RSS, Telegram, сайтов и других источников, нормализует их, считает скор, склеивает повторы в сюжеты, отделяет кейсы от шума и готовит ежедневный дайджест. Сначала движок работал на игровых новостях, потом я перенёс его на SEO и AI — без переписывания ядра, но с кучей неожиданных граблей: entity blobs, старые статьи под видом свежих, молчащие фиды, ложные тренды и LLM-недетерминизм в проде.

    habr.com/ru/articles/1052928/

    #ContentCombine #контенткомбайн #агрегатор_новостей #Data_Engineering #NLP #искусственный_интеллект #LLM #Python #SEO #автоматизация_контента

  11. Applied Statistics for Data Science: from visual diagnostics to drift detection by Gal Arav is the featured book 📖 on Leanpub!

    Launch Price $9.99 Special! — price will increase as I plan to steadily add more chapters over the coming weeks.

    Link: leanpub.com/applied-statistics

    #machine_learning #data_science #data_engineering #python

  12. Как я собрал базу визовых требований, где каждая ячейка ссылается на официальный источник

    Привет, сообщество. Где-то два месяца назад мне пришла в голову идея, очень простая по своей сути, но ой как обширная, если начать в ней копаться более подробно.

    habr.com/ru/articles/1050674/

    #визы #визовое_законодательство #загранпаспорт #релокация #эмиграция #открытые_данные #краудсорсинг #путешествия #data_engineering

  13. Data Mesh: что это и почему концепция не подходит большинству компаний в России

    Как устроен Data Mesh, какие требования подход предъявляет к бизнесу и почему большинству российских компаний сегодня зачастую важнее построить зрелое DWH, чем пытаться перейти к распределенной архитектуре данных

    habr.com/ru/articles/1049724/

    #data_mesh #bigdata #data_engineering #анализ_данных #бизнесаналитика

  14. The Data and AI Engineering Playbook by Ritesh Modi is the featured bundle of ebooks 📚 on Leanpub!

    Four volumes. 76 chapters. 2,000+ pages. The complete data-engineering arc from your first spark.read.csv to a production multi-agent system on Databricks, written for the engineer who gets paged when the pipeline breaks at 2 a.m.

    Link: leanpub.com/b/thedataandaiengi

    #data_engineering #distributed_systems #sql #python #databases #data_science #enterprise_data_modelling #data_analytics

  15. Обзор GPU-облаков в России для обычного пользователя в 2026

    Сейчас я учусь на 2 курсе магистратуры МИФИ по ML ( это моё второе высшее образование, по 1 специальности я психолог и TechHR с опытом 17+ лет), и пишу диплом о GENAI аватарах, в рамках диплома я создала прототип коммуникативной системы для HR и кандидатов на основе GENAI аватаров и LLM (подготовка для кандидатов к интервью, первичная оценка кандидатов + доп.сервисы - аналитика по ML-вакансиям в Real-Time). Мой диплом - это полноценный прототип системы с бэкэндом и UI, LLM, Gen-AI аватарами. Этот небольшой обзор - для моих локальных студенческих задач. Cейчас для меня важна невысокая стоимость GPU сервисов - для демо-версии на защите диплома в МИФИ, в связи с этим я сделала обзор GPU решений в России, которые подходят для студента, будут не слишком дорогими, и на перспективу - могут быть подходящими и для небольших Production решений.

    habr.com/ru/articles/1047814/

    #GPU #genai #ml #data_engineering #3D_Avatars #LLM

  16. Как я собрал эталонный Data Engineering проект: ClickHouse, Kafka, Spark, dbt, Airflow и Superset за одну команду

    Меня зовут Андрей, я работаю с данными. И так получается, что на реальных проектах у меня никогда не было возможности собрать идеальный, на мой взгляд стек. Поэтому я собрал его в идеальном пет проекте. Стать инженером данных

    habr.com/ru/articles/1047304/

    #data_engineering #data_science #data_mining #big_data #cryptocurrency

  17. Невозможно быть вне политики с Airflow Cluster Policies

    Привет, Хабр! Я Миша Онянов, Python-разработчик и платформенный инженер в крупнейшем проекте MAGNIT TECH – F&R. Из статьи вы узнаете, как с помощью механизма Cluster Policies в Apache Airflow вынести требования к DAG’ам в исполняемый код: - Поговорим о том, когда и зачем нужен отдельный слой Policies. - Посмотрим на примеры требований в больших data-инженерных проектах и способ их реализации с помощью политик. - Покажу нашу архитектуру, примеры кода и способы внедрения. - Сделаем выводы из моих ошибок, допущенных при разработке и внедрении. - В конце посмотрим, в каких ещё системах используется аналогичный механизм. Материал будет полезен всем, кто собирается внедрять или уже работает с Apache Airflow ✌️🥸

    habr.com/ru/companies/magnit/a

    #python #apache_airflow #apache_spark #data_engineering #mlops

  18. AI-метрдотель для ресторанной сети: архитектура, сценарии и интеграции

    Чат-боты в ресторанном бизнесе чаще всего начинают с простой задачи: снять часть нагрузки с менеджеров и отвечать гостям на типовые вопросы. На практике многие такие решения быстро упираются в ограничения. Бот отвечает шаблонно, не понимает свободный текст, не учитывает контекст гостя, не видит актуальные данные ресторана и при нестандартном запросе просит переформулировать вопрос или вручную переключает диалог на сотрудника. В проекте для ресторанной сети задача была другой: сделать не справочного бота, а AI-метрдотеля, который работает как цифровой сотрудник. Он должен понимать свободный текст, учитывать историю гостя, работать с бронированиями, обращаться к меню и базе знаний, проверять актуальные данные в ресторанных системах, принимать платежи, собирать отзывы и передавать диалог менеджеру в сценариях, где требуется участие человека. Такой продукт требует не только языковой модели. В основе должны быть база знаний, профиль гостя, интеграции с операционными системами ресторана, RAG, сценарная маршрутизация, контроль доступа, логирование и техническая архитектура, рассчитанная на работу с реальными бронями, оплатами и персональными данными.

    habr.com/ru/articles/1041262/

    #aiассистенты #rag #telegram_api #crmсистемы #проектирование_api #postgresql #qdrant #data_engineering #автоматизация_бизнеса #чатботы

  19. Контракты данных между командами: гайд по data contracts в дата‑пайплайнах

    Когда пайплайн отработал без ошибок, тесты зелёные, а в дашборде внезапно нули, проблема может быть не в инфраструктуре, а в отсутствии договорённостей между командами. В статье разбираем, как data contracts помогают фиксировать структуру, правила и ответственность за данные — и почему это спасает витрины, отчёты и нервы дата-инженеров.

    habr.com/ru/companies/otus/art

    #контракты_данных #data_contracts #датапайплайны #DWH #Data_Lake #Data_Engineering #dbt #Kafka #Schema_Registry #качество_данных

  20. rapeed: in-memory OLAP-движок с собственной алгеброй связей

    Меня зовут Андрей Рыжик, я Product Owner BI-направления в компании «Белый код». Эта статья – обзор платформы rapeed: in-memory OLAP-движка с собственным форматом хранения, нестандартной алгеброй связей между источниками и несколькими клиентами поверх единого ядра.

    habr.com/ru/companies/w_code/a

    #bi #olap #inmemory #аналитика_данных #data_engineering #высоконагруженные_системы #архитектура_по #distributed_systems #mpp #rapeed

  21. Единая база данных гостей для ресторанной сети: интеграция Telegram, Remarked, IIKO, RocketData и платёжных систем

    В ресторанных сетях данные о гостях часто распределены между несколькими системами. Бронирования хранятся в одном сервисе, чеки — в ресторанной учётной системе, переписки — в мессенджерах, отзывы — в агрегаторах, данные приложения — в отдельной базе, платежи — у эквайринга. Такая архитектура усложняет работу с клиентским профилем. У бизнеса нет единой истории взаимодействия с гостем, менеджеры работают с фрагментами данных, а сервис, маркетинг и аналитика опираются на неполную картину. Для ресторанной сети это напрямую влияет на персонализацию, качество обслуживания, LTV и повторные визиты. В проекте для сети из 10 ресторанов была реализована единая база данных гостей. Задача системы — собрать в одном профиле все взаимодействия клиента с бизнесом: от первого контакта и переписки до бронирований, чеков, отзывов, оплат, технических инцидентов и повторных визитов.

    habr.com/ru/articles/1041248/

    #data_engineering #customer_data_platform #iiko #базы_данных #telegram_api #клиентская_аналитика #искусственный_интеллект

  22. OCR для Data Lakehouse: от Apache Tika к собственному решению на базе Docling

    Привет, Хабр! Это Андрей Ловлин, руководитель команды «Фабрика данных. Платформа» компании Диасофт. В предыдущей статье мы рассказывали про S3 Архипелаг – слой хранения для нашей

    habr.com/ru/companies/diasoft_

    #data_engineering #data_lakehouse

  23. Как мы построили сквозную аналитику в Power BI

    Всем привет! Меня зовут Никита и я CEO компании VSL-BI. Мы занимаемся внедрением BI-аналитики. К нам обратилась компания из сферы продажи стройматериалов. Они активно работали с рекламой в Яндекс Директ и Google Ads (клиент вел деятельность в Казахстане), следили за аналитикой сайта в Яндекс Метрике, в качестве CRM использовали Битрикс24.

    habr.com/ru/articles/1038944/

    #сквозная_аналитика #Power_BI #BIаналитика #Яндекс_Директ #Google_Ads #Яндекс_Метрика #Битрикс24 #ETL #Data_Engineering #бизнесаналитика

  24. Вам продают ИИ. Покупать нужно не его

    Звонил мне на днях один знакомый CIO. Питерский, ритейл, средний бизнес, ничего особенного. Слушай, говорит, надо нам с ИИ что-то делать: все вокруг внедряют, конкуренты вон что-то запустили, на отраслевом Data Summit уши прожужжали, а у меня даже плана нет. И денег, кстати, особо на это не выделили, но не суть. Это был, кажется, пятый такой звонок за месяц. И знаете, что меня в них всех поражает? Спрашивают они одно и то же, и спрашивают неправильно. Не «нужен ли нам ИИ», а «куда бежать, чтобы не опоздать», - разница на самом деле огромная, потому что первый вопрос предполагает разбор задачи, а второй уже подразумевает, что бежать в любом случае надо, осталось только направление выбрать. Так вот, если коротко - не надо бежать. Сам я не специалист по нейросетям. Много лет вожусь с базами данных в банках, в ритейле, в системной интеграции, и работа моя: смотреть, как данные живут в настоящих, не презентационных компаниях, и решать, что из задуманного взлетит, а что разобьётся об реальность. Через этот фильтр я и предлагаю взглянуть на нынешний шум вокруг локальных LLM, RAG и «корпоративных помощников».

    habr.com/ru/articles/1037808/

    #llm #rag #искусственный_интеллект #локальные_модели #эмбеддинги #архитектура_данных #хранилища_данных #внедрение_ии #data_engineering #цена_ошибки

  25. Мультитенантность в FinOps: Проектируем ядро системы учета расходов

    «Кто виноват и что делать?» — эти два вопроса, которые классики русской литературы адресовали обществу, сегодня как никогда актуальны для IT-директоров и финансовых руководителей. Только «виноват» не конкретный человек, а не оптимально работающая инфраструктура, а ответ на вопрос «что делать?» — внедрять FinOps. FinOps — это не технология, а организационная методика. Важная часть инструментария для FinOps это правильно построенная информационная система, которая собирает, хранит и дает анализировать данные о расходах и нагрузке. В этой статье мы разберем архитектурное ядро такой системы.

    habr.com/ru/companies/inferit/

    #управление_проектами #облачные_вычисления #data_warehouse #системная_архитектура #itинфраструктура #big_data #devops #data_engineering #finops #финопс

  26. DWH в 2026: четыре зоны вместо Inmon, Kimball и Data Vault 2.0

    Когда инженер слышит «нам нужно хранилище данных», задача редко звучит однозначно. Кто-то задыхается на боевой OLTP-базе под аналитической нагрузкой. Кто-то впервые строит BI и не понимает, с какого края подходить. У кого-то накопились данные из десятка систем-источников, и существующих средств уже не хватает. У всех «хранилище». А правильный технический ответ зависит от условий задачи. За годы работы в банках, ритейле и системной интеграции мы пришли к простой картине: для среднего и крупного бизнеса большинство DWH-проектов сводится к четырёхзонной архитектуре поверх двух специализированных движков. Не Inmon, не Kimball-star-schema, не Data Vault 2.0 - и при этом не «modern data stack как у Databricks один-в-один». В этой статье разберу архитектуру по зонам, потом честно скажу что осталось живо от классических методологий и где они продолжают работать, а где безнадёжно отстали от колоночной эры. И в конце - типичные ошибки, которые наблюдаем в проектах коллег и собственных пилотах.

    habr.com/ru/articles/1035136/

    #dwh #data_warehouse #clickhouse #apache_iceberg #trino #lakehouse #data_engineering #архитектура_данных #data_vault #dba

  27. S3 Архипелаг: разворачиваем объектное хранилище за 15 минут

    На связи Илья Шуйков, руководитель продукта «Фабрика данных» компании Диасофт. В прошлой статье мы рассказали, зачем понадобилось строить свое объектное хранилище, и как устроен S3 Архипелаг изнутри. Теперь — практика: берем дистрибутив и разворачиваем рабочее хранилище.

    habr.com/ru/companies/diasoft_

    #объектное_хранилище #хранилище #s3 #объектное_хранилище_s3 #хранение_данных #data_engineering #фабрика_данных #Digital_QDataFactory #S3_Архипелаг

  28. Как я сделал Variables в Airflow 3 удобнее

    Ровно год назад, 22 апреля, вышел Airflow 3, который сильно изменил архитектуру и UX платформы. Но одно из изменений неожиданно ухудшило повседневную работу — Variables: маленькое поле ввода, неудобный JSON и отсутствие нормального редактирования. В статье разбираю, что именно сломалось в привычном сценарии и как я решил это с помощью собственного плагина.

    habr.com/ru/articles/1023060/

    #Python_plugin #Apache_Airflow #Airflow_Variables #JSON_configuration #DAG_configuration #Data_Engineering #Airflow_plugin #configuration_management

  29. От слов к числам: как математически отличить Middle от Senior

    Привет, Хабр! В своей первой статье про анализ вакансий C#/.Net разработчиков на рынке я выделила очень интересное замечание, которое определило тему сегодняшней статьи – « не количество навыков делает из мидла синьора, а образ его мышления ». Построить граф связности компетенций для синьора это конечно хорошо, но к сожалению, на практике применить его достаточно сложно. Сделав упор на навыки в своем исследовании, я получила зашумленный датасет, не поддающийся адекватной кластеризации. Так что пришло время попытаться пересмотреть подход к использованию полученных данных и попытаться вычленить из них тот качественный скачок, который отделит мидла от синьора.

    habr.com/ru/articles/1026186/

    #c# #грейды #теория #data_science #data_engineering