home.social

#data_lakehouse — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #data_lakehouse, aggregated by home.social.

  1. Iceberg и Paimon — строительные блоки Streaming Lakehouse

    Привет, Хабр! Я Алексей Новаков, ведущий инженер данных в Рунити. Сегодня разберемся, зачем Lakehouse понадобился streaming, почему одного Iceberg для этого не всегда хватает и как Iceberg и Paimon могут жить рядом в одном конвейере. Если сильно упростить, классический Lakehouse решает понятную задачу: берем дешевое объектное хранилище и добавляем поверх него то, чего не хватало обычному Data Lake — транзакции, schema evolution, snapshots, SQL, update/delete отдельных строк и одновременное чтение и запись. Но дальше возникает следующий вопрос: что делать, если аналитика должна видеть не вчерашние или часовые данные, а состояние, которое обновляется постоянно? Именно здесь Lakehouse начинает превращаться в Streaming Lakehouse — или Streamhouse.

    habr.com/ru/companies/runity/a

    #lakehouse #apache_iceberg #apache_paimon #apache_flink #upsert #changelog #cdc #s3 #data_lakehouse #snapshot

  2. Iceberg и Paimon — строительные блоки Streaming Lakehouse

    Привет, Хабр! Я Алексей Новаков, ведущий инженер данных в Рунити. Сегодня разберемся, зачем Lakehouse понадобился streaming, почему одного Iceberg для этого не всегда хватает и как Iceberg и Paimon могут жить рядом в одном конвейере. Если сильно упростить, классический Lakehouse решает понятную задачу: берем дешевое объектное хранилище и добавляем поверх него то, чего не хватало обычному Data Lake — транзакции, schema evolution, snapshots, SQL, update/delete отдельных строк и одновременное чтение и запись. Но дальше возникает следующий вопрос: что делать, если аналитика должна видеть не вчерашние или часовые данные, а состояние, которое обновляется постоянно? Именно здесь Lakehouse начинает превращаться в Streaming Lakehouse — или Streamhouse.

    habr.com/ru/companies/runity/a

    #lakehouse #apache_iceberg #apache_paimon #apache_flink #upsert #changelog #cdc #s3 #data_lakehouse #snapshot

  3. Iceberg и Paimon — строительные блоки Streaming Lakehouse

    Привет, Хабр! Я Алексей Новаков, ведущий инженер данных в Рунити. Сегодня разберемся, зачем Lakehouse понадобился streaming, почему одного Iceberg для этого не всегда хватает и как Iceberg и Paimon могут жить рядом в одном конвейере. Если сильно упростить, классический Lakehouse решает понятную задачу: берем дешевое объектное хранилище и добавляем поверх него то, чего не хватало обычному Data Lake — транзакции, schema evolution, snapshots, SQL, update/delete отдельных строк и одновременное чтение и запись. Но дальше возникает следующий вопрос: что делать, если аналитика должна видеть не вчерашние или часовые данные, а состояние, которое обновляется постоянно? Именно здесь Lakehouse начинает превращаться в Streaming Lakehouse — или Streamhouse.

    habr.com/ru/companies/runity/a

    #lakehouse #apache_iceberg #apache_paimon #apache_flink #upsert #changelog #cdc #s3 #data_lakehouse #snapshot