#data_lakehouse — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #data_lakehouse, aggregated by home.social.
-
Iceberg и Paimon — строительные блоки Streaming Lakehouse
Привет, Хабр! Я Алексей Новаков, ведущий инженер данных в Рунити. Сегодня разберемся, зачем Lakehouse понадобился streaming, почему одного Iceberg для этого не всегда хватает и как Iceberg и Paimon могут жить рядом в одном конвейере. Если сильно упростить, классический Lakehouse решает понятную задачу: берем дешевое объектное хранилище и добавляем поверх него то, чего не хватало обычному Data Lake — транзакции, schema evolution, snapshots, SQL, update/delete отдельных строк и одновременное чтение и запись. Но дальше возникает следующий вопрос: что делать, если аналитика должна видеть не вчерашние или часовые данные, а состояние, которое обновляется постоянно? Именно здесь Lakehouse начинает превращаться в Streaming Lakehouse — или Streamhouse.
https://habr.com/ru/companies/runity/articles/1083290/
#lakehouse #apache_iceberg #apache_paimon #apache_flink #upsert #changelog #cdc #s3 #data_lakehouse #snapshot
-
Iceberg и Paimon — строительные блоки Streaming Lakehouse
Привет, Хабр! Я Алексей Новаков, ведущий инженер данных в Рунити. Сегодня разберемся, зачем Lakehouse понадобился streaming, почему одного Iceberg для этого не всегда хватает и как Iceberg и Paimon могут жить рядом в одном конвейере. Если сильно упростить, классический Lakehouse решает понятную задачу: берем дешевое объектное хранилище и добавляем поверх него то, чего не хватало обычному Data Lake — транзакции, schema evolution, snapshots, SQL, update/delete отдельных строк и одновременное чтение и запись. Но дальше возникает следующий вопрос: что делать, если аналитика должна видеть не вчерашние или часовые данные, а состояние, которое обновляется постоянно? Именно здесь Lakehouse начинает превращаться в Streaming Lakehouse — или Streamhouse.
https://habr.com/ru/companies/runity/articles/1083290/
#lakehouse #apache_iceberg #apache_paimon #apache_flink #upsert #changelog #cdc #s3 #data_lakehouse #snapshot
-
Iceberg и Paimon — строительные блоки Streaming Lakehouse
Привет, Хабр! Я Алексей Новаков, ведущий инженер данных в Рунити. Сегодня разберемся, зачем Lakehouse понадобился streaming, почему одного Iceberg для этого не всегда хватает и как Iceberg и Paimon могут жить рядом в одном конвейере. Если сильно упростить, классический Lakehouse решает понятную задачу: берем дешевое объектное хранилище и добавляем поверх него то, чего не хватало обычному Data Lake — транзакции, schema evolution, snapshots, SQL, update/delete отдельных строк и одновременное чтение и запись. Но дальше возникает следующий вопрос: что делать, если аналитика должна видеть не вчерашние или часовые данные, а состояние, которое обновляется постоянно? Именно здесь Lakehouse начинает превращаться в Streaming Lakehouse — или Streamhouse.
https://habr.com/ru/companies/runity/articles/1083290/
#lakehouse #apache_iceberg #apache_paimon #apache_flink #upsert #changelog #cdc #s3 #data_lakehouse #snapshot