#lakehouse — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #lakehouse, aggregated by home.social.
-
Next Thursday, Oct 8th, I'm speaking about 🐘🧊 #ColdFront (transparent #PostgreSQL data tiering to Apache Iceberg) at the Iceberg Europe Community #Meetup in #London! Join in person or online.
-
Next Thursday, Oct 8th, I'm speaking about 🐘🧊 #ColdFront (transparent #PostgreSQL data tiering to Apache Iceberg) at the Iceberg Europe Community #Meetup in #London! Join in person or online.
-
Next Thursday, Oct 8th, I'm speaking about 🐘🧊 #ColdFront (transparent #PostgreSQL data tiering to Apache Iceberg) at the Iceberg Europe Community #Meetup in #London! Join in person or online.
-
Next Thursday, Oct 8th, I'm speaking about 🐘🧊 #ColdFront (transparent #PostgreSQL data tiering to Apache Iceberg) at the Iceberg Europe Community #Meetup in #London! Join in person or online.
-
Next Wednesday, Oct 7th, I'm speaking at the #London #PostgreSQL #Meetup! I'll present 🐘🧊 #ColdFront: transparent #Postgres data tiering to Apache Iceberg for the modern #Lakehouse.
RSVP: https://www.meetup.com/london-postgresql-meetup-group/events/316581290/
-
Next Wednesday, Oct 7th, I'm speaking at the #London #PostgreSQL #Meetup! I'll present 🐘🧊 #ColdFront: transparent #Postgres data tiering to Apache Iceberg for the modern #Lakehouse.
RSVP: https://www.meetup.com/london-postgresql-meetup-group/events/316581290/
-
Next Wednesday, Oct 7th, I'm speaking at the #London #PostgreSQL #Meetup! I'll present 🐘🧊 #ColdFront: transparent #Postgres data tiering to Apache Iceberg for the modern #Lakehouse.
RSVP: https://www.meetup.com/london-postgresql-meetup-group/events/316581290/
-
Next Wednesday, Oct 7th, I'm speaking at the #London #PostgreSQL #Meetup! I'll present 🐘🧊 #ColdFront: transparent #Postgres data tiering to Apache Iceberg for the modern #Lakehouse.
RSVP: https://www.meetup.com/london-postgresql-meetup-group/events/316581290/
-
Apache Iceberg: Индиана Джонс и Каталог судьбы в Lakehouse
В феврале этого года проект с красивым именем Polaris незаметно стал полноценным проектом фонда Apache. Новость прошла как-то мимо, ну стал и стал, мало ли. Между тем это одна из тех новостей, которые лет через пять, возможно, будут называть поворотной точкой. Потому что Polaris — это каталог. А каталог в мире Iceberg — то самое место, где на самом деле лежит власть над вашими данными. Звучит громко, понимаю. Поясню, откуда такая уверенность. Последние несколько лет хранилища данных строят по новой схеме: файлы лежат в объектном хранилище, поверх них открытый формат в виде метаданных, движки обработки живут отдельно в виде федеративного обработчика и ходят за данными. Схему назвали лейкхаусом (Data LakeHouse), а формат в ней почти везде один и тот же — Apache Iceberg. Вендоры за него отвоевались, открыли и согласовали, и все выдохнули. Данные наконец-то ничьи (формат parquet): лежат у вас, читаются чем угодно, никакой платформы-хозяина. Выдохнули рано. Зависимость от вендора никуда не делась, она переехала на другой уровень — в каталог. Сервис с виду лаконичный, держит одну-единственную вещь, указатель на актуальную версию таблицы. Заодно через него идут права доступа и временные ключи от хранилища. Получается, кто держит каталог, тот и решает, какие движки увидят ваши данные, а какие останутся снаружи. Начнём даже не с каталогов, а на шаг раньше — с того, что такое вообще Iceberg, вокруг которого последний год прыгают все вендоры.
https://habr.com/ru/articles/1084334/
#apache_iceberg #каталог_данных #polaris #lakehouse #postgresql #хранение_данных #s3 #метаданные #ducklake #lakehouseплатформа_данных
-
Apache Iceberg: Индиана Джонс и Каталог судьбы в Lakehouse
В феврале этого года проект с красивым именем Polaris незаметно стал полноценным проектом фонда Apache. Новость прошла как-то мимо, ну стал и стал, мало ли. Между тем это одна из тех новостей, которые лет через пять, возможно, будут называть поворотной точкой. Потому что Polaris — это каталог. А каталог в мире Iceberg — то самое место, где на самом деле лежит власть над вашими данными. Звучит громко, понимаю. Поясню, откуда такая уверенность. Последние несколько лет хранилища данных строят по новой схеме: файлы лежат в объектном хранилище, поверх них открытый формат в виде метаданных, движки обработки живут отдельно в виде федеративного обработчика и ходят за данными. Схему назвали лейкхаусом (Data LakeHouse), а формат в ней почти везде один и тот же — Apache Iceberg. Вендоры за него отвоевались, открыли и согласовали, и все выдохнули. Данные наконец-то ничьи (формат parquet): лежат у вас, читаются чем угодно, никакой платформы-хозяина. Выдохнули рано. Зависимость от вендора никуда не делась, она переехала на другой уровень — в каталог. Сервис с виду лаконичный, держит одну-единственную вещь, указатель на актуальную версию таблицы. Заодно через него идут права доступа и временные ключи от хранилища. Получается, кто держит каталог, тот и решает, какие движки увидят ваши данные, а какие останутся снаружи. Начнём даже не с каталогов, а на шаг раньше — с того, что такое вообще Iceberg, вокруг которого последний год прыгают все вендоры.
https://habr.com/ru/articles/1084334/
#apache_iceberg #каталог_данных #polaris #lakehouse #postgresql #хранение_данных #s3 #метаданные #ducklake #lakehouseплатформа_данных
-
Hours old is the new wrong.
StreamHouse, the streaming lakehouse, and why real-time data architecture suddenly has a name. A category just got a name On 15 September 2026, five companies that compete hard with each other put out a joint announcement. Aiven, Confluent, Redpanda, StreamNative and Ververica formed the Streamhouse Working Group. They didn’t launch a product. They published a definition. The group keeps the spec in a public repo, works on the open standards under it, and lets anyone use the name for free […]https://mayashenoi.com/2026/09/20/hours-old-is-the-new-wrong/
-
Hours old is the new wrong.
StreamHouse, the streaming lakehouse, and why real-time data architecture suddenly has a name. A category just got a name On 15 September 2026, five companies that compete hard with each other put out a joint announcement. Aiven, Confluent, Redpanda, StreamNative and Ververica formed the Streamhouse Working Group. They didn’t launch a product. They published a definition. The group keeps the spec in a public repo, works on the open standards under it, and lets anyone use the name for free […]https://mayashenoi.com/2026/09/20/hours-old-is-the-new-wrong/
-
Hours old is the new wrong.
StreamHouse, the streaming lakehouse, and why real-time data architecture suddenly has a name. A category just got a name On 15 September 2026, five companies that compete hard with each other put out a joint announcement. Aiven, Confluent, Redpanda, StreamNative and Ververica formed the Streamhouse Working Group. They didn’t launch a product. They published a definition. The group keeps the spec in a public repo, works on the open standards under it, and lets anyone use the name for free […]https://mayashenoi.com/2026/09/20/hours-old-is-the-new-wrong/
-
Hours old is the new wrong.
StreamHouse, the streaming lakehouse, and why real-time data architecture suddenly has a name. A category just got a name On 15 September 2026, five companies that compete hard with each other put out a joint announcement. Aiven, Confluent, Redpanda, StreamNative and Ververica formed the Streamhouse Working Group. They didn’t launch a product. They published a definition. The group keeps the spec in a public repo, works on the open standards under it, and lets anyone use the name for free […]https://mayashenoi.com/2026/09/20/hours-old-is-the-new-wrong/
-
Iceberg и Paimon — строительные блоки Streaming Lakehouse
Привет, Хабр! Я Алексей Новаков, ведущий инженер данных в Рунити. Сегодня разберемся, зачем Lakehouse понадобился streaming, почему одного Iceberg для этого не всегда хватает и как Iceberg и Paimon могут жить рядом в одном конвейере. Если сильно упростить, классический Lakehouse решает понятную задачу: берем дешевое объектное хранилище и добавляем поверх него то, чего не хватало обычному Data Lake — транзакции, schema evolution, snapshots, SQL, update/delete отдельных строк и одновременное чтение и запись. Но дальше возникает следующий вопрос: что делать, если аналитика должна видеть не вчерашние или часовые данные, а состояние, которое обновляется постоянно? Именно здесь Lakehouse начинает превращаться в Streaming Lakehouse — или Streamhouse.
https://habr.com/ru/companies/runity/articles/1083290/
#lakehouse #apache_iceberg #apache_paimon #apache_flink #upsert #changelog #cdc #s3 #data_lakehouse #snapshot
-
Iceberg и Paimon — строительные блоки Streaming Lakehouse
Привет, Хабр! Я Алексей Новаков, ведущий инженер данных в Рунити. Сегодня разберемся, зачем Lakehouse понадобился streaming, почему одного Iceberg для этого не всегда хватает и как Iceberg и Paimon могут жить рядом в одном конвейере. Если сильно упростить, классический Lakehouse решает понятную задачу: берем дешевое объектное хранилище и добавляем поверх него то, чего не хватало обычному Data Lake — транзакции, schema evolution, snapshots, SQL, update/delete отдельных строк и одновременное чтение и запись. Но дальше возникает следующий вопрос: что делать, если аналитика должна видеть не вчерашние или часовые данные, а состояние, которое обновляется постоянно? Именно здесь Lakehouse начинает превращаться в Streaming Lakehouse — или Streamhouse.
https://habr.com/ru/companies/runity/articles/1083290/
#lakehouse #apache_iceberg #apache_paimon #apache_flink #upsert #changelog #cdc #s3 #data_lakehouse #snapshot
-
Autonomous AI Lakehouse × Private Agent Factoryで音楽フェス運営分析 AI Agentを作ってみてみた
https://qiita.com/shirok/items/ad6a82f1cfe0ebc72f43?utm_campaign=popular_items&utm_medium=feed&utm_source=popular_items#qiita #oracle #autonomous_database #Lakehouse #AIエージェント #PrivateAgentFactory
-
Инфраструктура данных 2052: что, если у данных больше не будет «прода» и «истории»?
Если мысленно вернуться в 1980-е , аналитика во многом находилась буквально над production Данные появлялись в операционных системах, затем из них строились отчёты, выгрузки и аналитические витрины. Постепенно мы начали выносить аналитику подальше от production: появились отдельные хранилища, ETL, data warehouse, затем data lake, lakehouse и, наконец, огромный набор специализированных систем для streaming, batch, realtime и research Каждый раз мы решали вполне реальные проблемы своего времени. Но вместе с этим постепенно привыкли к довольно странной модели: production хранит настоящее, data lake - прошлое, Kafka - поток, а research живёт где-то ещё И вот здесь мне стало интересно немного заглянуть вперед... А что, если в 2052 году мы перестанем воспринимать всё это как разные сущности? Опираясь не на фантазии, а на то, что смог найти в технических блогах - не концепты, а реальные прототипы Если не хотите много читать, в конце статьи вся суть одной картинкой
-
Инфраструктура данных 2052: что, если у данных больше не будет «прода» и «истории»?
Если мысленно вернуться в 1980-е , аналитика во многом находилась буквально над production Данные появлялись в операционных системах, затем из них строились отчёты, выгрузки и аналитические витрины. Постепенно мы начали выносить аналитику подальше от production: появились отдельные хранилища, ETL, data warehouse, затем data lake, lakehouse и, наконец, огромный набор специализированных систем для streaming, batch, realtime и research Каждый раз мы решали вполне реальные проблемы своего времени. Но вместе с этим постепенно привыкли к довольно странной модели: production хранит настоящее, data lake - прошлое, Kafka - поток, а research живёт где-то ещё И вот здесь мне стало интересно немного заглянуть вперед... А что, если в 2052 году мы перестанем воспринимать всё это как разные сущности? Опираясь не на фантазии, а на то, что смог найти в технических блогах - не концепты, а реальные прототипы Если не хотите много читать, в конце статьи вся суть одной картинкой
-
reflection
dreaming… a random bit
** in the ending of The Daily Post’s Weekly Photo Challenges from WordPress, here’s your Sunday Weekly Photo Prompt: travel **
medicine buddha mantra: Tayata Om Bekandze Bekandze Maha Bekandze Radza Samudgate Soha
health, wealth, and prosperity: Om Vasudhare Svaha
Rate this:
#atlanta #blueSkies #calm #carriageLake #Georgia #green #home #homeward #houses #lake #lakehouse #lakeside #landscape #mirror #photography #pineTrees #pines #reflection #reflections #still #suburbs #summer #summertime #tree #trees #water #waterSEdge #weeklyPhotoChallenge -
reflection
dreaming… a random bit
** in the ending of The Daily Post’s Weekly Photo Challenges from WordPress, here’s your Sunday Weekly Photo Prompt: travel **
medicine buddha mantra: Tayata Om Bekandze Bekandze Maha Bekandze Radza Samudgate Soha
health, wealth, and prosperity: Om Vasudhare Svaha
Rate this:
#atlanta #blueSkies #calm #carriageLake #Georgia #green #home #homeward #houses #lake #lakehouse #lakeside #landscape #mirror #photography #pineTrees #pines #reflection #reflections #still #suburbs #summer #summertime #tree #trees #water #waterSEdge #weeklyPhotoChallenge -
reflection
dreaming… a random bit
** in the ending of The Daily Post’s Weekly Photo Challenges from WordPress, here’s your Sunday Weekly Photo Prompt: travel **
medicine buddha mantra: Tayata Om Bekandze Bekandze Maha Bekandze Radza Samudgate Soha
health, wealth, and prosperity: Om Vasudhare Svaha
Rate this:
#atlanta #blueSkies #calm #carriageLake #Georgia #green #home #homeward #houses #lake #lakehouse #lakeside #landscape #mirror #photography #pineTrees #pines #reflection #reflections #still #suburbs #summer #summertime #tree #trees #water #waterSEdge #weeklyPhotoChallenge -
reflection
dreaming… a random bit
** in the ending of The Daily Post’s Weekly Photo Challenges from WordPress, here’s your Sunday Weekly Photo Prompt: travel **
medicine buddha mantra: Tayata Om Bekandze Bekandze Maha Bekandze Radza Samudgate Soha
health, wealth, and prosperity: Om Vasudhare Svaha
Rate this:
#atlanta #blueSkies #calm #carriageLake #Georgia #green #home #homeward #houses #lake #lakehouse #lakeside #landscape #mirror #photography #pineTrees #pines #reflection #reflections #still #suburbs #summer #summertime #tree #trees #water #waterSEdge #weeklyPhotoChallenge -
RE: https://mastodon.social/@pgEdgeDistributedPostgres/117096307668109428
In 2 hours' time (11am Eastern) Antony Pegg will be hosting our #ColdFront webinar! If you're tired of data-lake-y buzzwords, come and hear me and my colleagues present a fresh new perspective, and see a live demo by the brilliant Paul Rothrock!
Register here 👇
https://us02web.zoom.us/webinar/register/WN_3oRFbue0QL2UI7j9DmCbFA#/registration -
RE: https://mastodon.social/@pgEdgeDistributedPostgres/117096307668109428
In 2 hours' time (11am Eastern) Antony Pegg will be hosting our #ColdFront webinar! If you're tired of data-lake-y buzzwords, come and hear me and my colleagues present a fresh new perspective, and see a live demo by the brilliant Paul Rothrock!
Register here 👇
https://us02web.zoom.us/webinar/register/WN_3oRFbue0QL2UI7j9DmCbFA#/registration -
RE: https://mastodon.social/@pgEdgeDistributedPostgres/117096307668109428
In 2 hours' time (11am Eastern) Antony Pegg will be hosting our #ColdFront webinar! If you're tired of data-lake-y buzzwords, come and hear me and my colleagues present a fresh new perspective, and see a live demo by the brilliant Paul Rothrock!
Register here 👇
https://us02web.zoom.us/webinar/register/WN_3oRFbue0QL2UI7j9DmCbFA#/registration -
RE: https://mastodon.social/@pgEdgeDistributedPostgres/117096307668109428
In 2 hours' time (11am Eastern) Antony Pegg will be hosting our #ColdFront webinar! If you're tired of data-lake-y buzzwords, come and hear me and my colleagues present a fresh new perspective, and see a live demo by the brilliant Paul Rothrock!
Register here 👇
https://us02web.zoom.us/webinar/register/WN_3oRFbue0QL2UI7j9DmCbFA#/registration -
Data Lake、Lakehouse、Iceberg、RDBMSをレイヤーで整理してみてみた ~Data CatalogからAI時代のData & AI Platformへ~
https://qiita.com/shirok/items/04aecee018da54b1b578?utm_campaign=popular_items&utm_medium=feed&utm_source=popular_items -
Something about the past, but also the future.
-
Something about the past, but also the future.
-
Something about the past, but also the future.
-
Something about the past, but also the future.
-
serene
dreaming… a random bit
** in the ending of The Daily Post’s Weekly Photo Challenges from WordPress, here’s your Sunday Weekly Photo Prompt: travel **
medicine buddha mantra: Tayata Om Bekandze Bekandze Maha Bekandze Radza Samudgate Soha
health, wealth, and prosperity: Om Vasudhare Svaha
Rate this:
#2025 #atlanta #bermudaGrass #blueSkies #carriageLake #clouds #cold #december #december2025 #Georgia #grass #home #houses #lake #lakehouse #lakeside #landscape #photography #pineTrees #pines #reflection #reflections #ripples #saturday #steepleChaseDrive #suburbs #tree #trees #water #waterSEdge #weekend #weeklyPhotoChallenge #windy #winter -
serene
dreaming… a random bit
** in the ending of The Daily Post’s Weekly Photo Challenges from WordPress, here’s your Sunday Weekly Photo Prompt: travel **
medicine buddha mantra: Tayata Om Bekandze Bekandze Maha Bekandze Radza Samudgate Soha
health, wealth, and prosperity: Om Vasudhare Svaha
Rate this:
#2025 #atlanta #bermudaGrass #blueSkies #carriageLake #clouds #cold #december #december2025 #Georgia #grass #home #houses #lake #lakehouse #lakeside #landscape #photography #pineTrees #pines #reflection #reflections #ripples #saturday #steepleChaseDrive #suburbs #tree #trees #water #waterSEdge #weekend #weeklyPhotoChallenge #windy #winter -
serene
dreaming… a random bit
** in the ending of The Daily Post’s Weekly Photo Challenges from WordPress, here’s your Sunday Weekly Photo Prompt: travel **
medicine buddha mantra: Tayata Om Bekandze Bekandze Maha Bekandze Radza Samudgate Soha
health, wealth, and prosperity: Om Vasudhare Svaha
Rate this:
#2025 #atlanta #bermudaGrass #blueSkies #carriageLake #clouds #cold #december #december2025 #Georgia #grass #home #houses #lake #lakehouse #lakeside #landscape #photography #pineTrees #pines #reflection #reflections #ripples #saturday #steepleChaseDrive #suburbs #tree #trees #water #waterSEdge #weekend #weeklyPhotoChallenge #windy #winter -
serene
dreaming… a random bit
** in the ending of The Daily Post’s Weekly Photo Challenges from WordPress, here’s your Sunday Weekly Photo Prompt: travel **
medicine buddha mantra: Tayata Om Bekandze Bekandze Maha Bekandze Radza Samudgate Soha
health, wealth, and prosperity: Om Vasudhare Svaha
Rate this:
#2025 #atlanta #bermudaGrass #blueSkies #carriageLake #clouds #cold #december #december2025 #Georgia #grass #home #houses #lake #lakehouse #lakeside #landscape #photography #pineTrees #pines #reflection #reflections #ripples #saturday #steepleChaseDrive #suburbs #tree #trees #water #waterSEdge #weekend #weeklyPhotoChallenge #windy #winter -
Data Catalog 第2回:Object Storage上のOracle Databaseマニュアルと文書インベントリParquetをカタログ化してみてみた
https://qiita.com/shirok/items/bb431a6bd37fb1ef0cd6?utm_campaign=popular_items&utm_medium=feed&utm_source=popular_items -
Apache Iceberg: Индиана Джонс и Каталог судьбы
parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы или мусор из файлов и кого вообще к ним подпустят. Это каталог. Разбираю просто, что такое Apache Iceberg, зачем ему каталог - и почему новость про Polaris важнее, чем кажется. В продолжение анонса новостей…
https://habr.com/ru/articles/1065864/
#iceberg #trino #lakehouse #database #базы_данных #s3 #lakehouseплатформа_данных #clickhouse #ducklake #dremio
-
Apache Iceberg: Индиана Джонс и Каталог судьбы
parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы или мусор из файлов и кого вообще к ним подпустят. Это каталог. Разбираю просто, что такое Apache Iceberg, зачем ему каталог - и почему новость про Polaris важнее, чем кажется. В продолжение анонса новостей…
https://habr.com/ru/articles/1065864/
#iceberg #trino #lakehouse #database #базы_данных #s3 #lakehouseплатформа_данных #clickhouse #ducklake #dremio
-
Apache Iceberg: Индиана Джонс и Каталог судьбы
*.parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы или мусор из файлов и кого вообще к ним подпустят. Это каталог. Разбираю простым языком, что такое Apache Iceberg, зачем ему каталог - и почему тихая новость про Polaris важнее, чем кажется. В продолжении анонса новостей
https://habr.com/ru/articles/1064224/
#Apache_Iceberg #каталог_данных #Polaris #lakehouse #data_engineering #PostgreSQL #ClickHouse #Trino #DuckLake #объектное_хранилище
-
Apache Iceberg: Индиана Джонс и Каталог судьбы
*.parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы или мусор из файлов и кого вообще к ним подпустят. Это каталог. Разбираю простым языком, что такое Apache Iceberg, зачем ему каталог - и почему тихая новость про Polaris важнее, чем кажется. В продолжении анонса новостей
https://habr.com/ru/articles/1064224/
#Apache_Iceberg #каталог_данных #Polaris #lakehouse #data_engineering #PostgreSQL #ClickHouse #Trino #DuckLake #объектное_хранилище
-
Outbound Access Protection for semantic models.
Outbound Access Protection (OAP) is a workspace-level network security and governance feature that blocks outbound traffic from a workspace by default and lets you allow only the destinations you explicitly trust.
#SemanticModel #DirectQuery #SQLServer #Azure #DataLake #Lakehouse
https://community.fabric.microsoft.com/t5/Power-BI-Updates-Blog/Outbound-Access-Protection-for-semantic-models-Preview/ba-p/5184917?wt.mc_id=DP-MVP-4015656 -
Оптимизация MPP-кластера: предсказываем потребление памяти SQL-запросов
В аналитике больших данных системы массивных параллельных вычислений часто находятся под постоянной нагрузкой в режиме 24/7. Из десятков и сотен тысяч запросов в день многие исполняются одновременно и конкурируют за ограниченные ресурсы вычислительного кластера. Чем рациональнее каждый отдельный запрос их использует, тем больше запросов система сможет обслуживать параллельно. Соответственно, выше пропускная способность за конкретный отрезок времени. Как правило, проблема нехватки ресурсов остро ощущается в пиковые часы нагрузки. Можно бесконечно до совершенства настраивать и править параметры сессии на каждый запрос индивидуально вручную, но нам — команде разработки платформы данных Data Ocean Nova — всегда хочется иметь более системный подход. В сегодняшней публикации мы расскажем о том, как реализовали идею автоматической системы предсказания потребления ресурсов SQL-запросами для Impala и StarRocks, основанную на ML-принципах, и сделали её частью платформы данных.
https://habr.com/ru/companies/datasapience/articles/1061866/
-
Оптимизация MPP-кластера: предсказываем потребление памяти SQL-запросов
В аналитике больших данных системы массивных параллельных вычислений часто находятся под постоянной нагрузкой в режиме 24/7. Из десятков и сотен тысяч запросов в день многие исполняются одновременно и конкурируют за ограниченные ресурсы вычислительного кластера. Чем рациональнее каждый отдельный запрос их использует, тем больше запросов система сможет обслуживать параллельно. Соответственно, выше пропускная способность за конкретный отрезок времени. Как правило, проблема нехватки ресурсов остро ощущается в пиковые часы нагрузки. Можно бесконечно до совершенства настраивать и править параметры сессии на каждый запрос индивидуально вручную, но нам — команде разработки платформы данных Data Ocean Nova — всегда хочется иметь более системный подход. В сегодняшней публикации мы расскажем о том, как реализовали идею автоматической системы предсказания потребления ресурсов SQL-запросами для Impala и StarRocks, основанную на ML-принципах, и сделали её частью платформы данных.
https://habr.com/ru/companies/datasapience/articles/1061866/
-
From the Leanpub Blog: Leanpub Book LAUNCH 🚀 Cracking the System Design Interview for Data Engineers. by ALEXEY BANAEV
#books #leanpublishing #selfpublishing #systemdesign #dataengineering #dataarchitecture #lakehouse #interviewprep
-
From the Leanpub Blog: Leanpub Book LAUNCH 🚀 Cracking the System Design Interview for Data Engineers. by ALEXEY BANAEV
#books #leanpublishing #selfpublishing #systemdesign #dataengineering #dataarchitecture #lakehouse #interviewprep
-
From the Leanpub Blog: Leanpub Book LAUNCH 🚀 Cracking the System Design Interview for Data Engineers. by ALEXEY BANAEV
#books #leanpublishing #selfpublishing #systemdesign #dataengineering #dataarchitecture #lakehouse #interviewprep
-
NEW! Leanpub Book LAUNCH 🚀 Cracking the System Design Interview for Data Engineers. by ALEXEY BANAEV
#books #leanpublishing #selfpublishing #systemdesign #dataengineering #dataarchitecture #lakehouse #interviewprep
-
NEW! Leanpub Book LAUNCH 🚀 Cracking the System Design Interview for Data Engineers. by ALEXEY BANAEV
#books #leanpublishing #selfpublishing #systemdesign #dataengineering #dataarchitecture #lakehouse #interviewprep
-
NEW! Leanpub Book LAUNCH 🚀 Cracking the System Design Interview for Data Engineers. by ALEXEY BANAEV
#books #leanpublishing #selfpublishing #systemdesign #dataengineering #dataarchitecture #lakehouse #interviewprep
-
Ускоряем федеративные запросы в StarRocks
Когда речь заходит про Lakehouse и федеративный доступ , многие вспоминают про Trino и… часто на этом все. Но федеративные запросы поддерживаются в том или ином виде довольно большим количеством СУБД, SQL-движков и систем для виртуализации данных. В этой статье постараемся немного расширить кругозор читателей, которым интересна данная тема: рассмотрим федеративные запросы на примере набирающего популярность и активно развивающегося StarRocks . Из статьи вы узнаете: что такое федеративные запросы, как обстоят дела с реализацией гетерогенного федеративного доступа в этой СУБД и какие изменения команда решения Data Ocean Nova реализовала для оптимизации в StarRocks и Impala с целью улучшения функционала доступа к внешним данным.
https://habr.com/ru/companies/datasapience/articles/1057930/
#starrocks #федеративные_системы #lakehouse #datalakehouse #dwh #mpp #jdbc #greenplum #trino
-
Ускоряем федеративные запросы в StarRocks
Когда речь заходит про Lakehouse и федеративный доступ , многие вспоминают про Trino и… часто на этом все. Но федеративные запросы поддерживаются в том или ином виде довольно большим количеством СУБД, SQL-движков и систем для виртуализации данных. В этой статье постараемся немного расширить кругозор читателей, которым интересна данная тема: рассмотрим федеративные запросы на примере набирающего популярность и активно развивающегося StarRocks . Из статьи вы узнаете: что такое федеративные запросы, как обстоят дела с реализацией гетерогенного федеративного доступа в этой СУБД и какие изменения команда решения Data Ocean Nova реализовала для оптимизации в StarRocks и Impala с целью улучшения функционала доступа к внешним данным.
https://habr.com/ru/companies/datasapience/articles/1057930/
#starrocks #федеративные_системы #lakehouse #datalakehouse #dwh #mpp #jdbc #greenplum #trino
-
売上は DB、ログは S3、契約書は SharePoint、バラバラなデータを AI で使う方法を調べてみてみた
https://qiita.com/shirok/items/0e42854634b2c5a371fa?utm_campaign=popular_items&utm_medium=feed&utm_source=popular_items -
Пока все хоронили пайплайны, ClickHouse достраивал слои
«Отдельные базы больше не нужны», «конец пайплайнов» - каждую неделю кто-то крупный со сцены хоронит то, что ты вчера поставил в прод. ClickHouse поступил ровно наоборот, и поэтому его анонсы стоит прочитать внимательно. Что реально показали на Open House 2026 и что из этого доедет до прода - разбор практика без вендорского глянца.
https://habr.com/ru/articles/1056292/
#clickhouse #postgresql #Clickstack #olap #lakehouse #data_engineering #observability #колоночная_субд #ClickHouse_Agents #Open_House_2026
-
Пока все хоронили пайплайны, ClickHouse достраивал слои
«Отдельные базы больше не нужны», «конец пайплайнов» - каждую неделю кто-то крупный со сцены хоронит то, что ты вчера поставил в прод. ClickHouse поступил ровно наоборот, и поэтому его анонсы стоит прочитать внимательно. Что реально показали на Open House 2026 и что из этого доедет до прода - разбор практика без вендорского глянца.
https://habr.com/ru/articles/1056292/
#clickhouse #postgresql #Clickstack #olap #lakehouse #data_engineering #observability #колоночная_субд #ClickHouse_Agents #Open_House_2026
-
TPC-DS в 07.2026. Lakehouse: Spark, Trino, StarRocks, Impala и Doris. GreenPlum & Cloudberry vs StarRocks как MPP
Привет, Хабр! На связи команда Data Sapience. С последней публикации результатов тестирования MPP-движков прошло уже несколько месяцев. За этот период произошел ряд изменений в базовых версиях open source движков и фреймворков, а также наша команда разработки внесла ряд улучшений и доработок. Все это может повлиять расстановку сил в рейтинге. В сегодняшней публикации мы представим максимальное число претендентов, среди которых: Spark 3.5.*, Spark 3.5.* + DataFusion Comet, Spark 4.0.1, Spark 4.0.1 + DataFusion Comet, StarRocks (core based 3.5+, 4.0+), Impala (core based 4.5), Trino (459, 476, 479) и новичок нашего рейтинга — Apache Doris. Статья поможет вам ответить на вопросы: стоит ли переходить на Spark 4 в поисках производительности; Как нативные вычисления влияют на результаты Spark; Как улучшилась производительность Trino за последние полгода; нужно ли присмотреться к Apache Doris, если вы ищете альтернативу Impala и StarRocks, и как эти проекты связаны между собой; какие оптимизационные улучшения были добавлены нами в StarRocks и Impala за последнее время. И на десерт мы покажем вам сравнение Greenplum, Cloudberry и StarRocks в режиме Shared-Nothing MPP.
https://habr.com/ru/companies/datasapience/articles/1054316/
#starrocks #trino #spark #impala #greenplum #bigdata #dwh #lakehouse #olap
-
TPC-DS в 07.2026. Lakehouse: Spark, Trino, StarRocks, Impala и Doris. GreenPlum & Cloudberry vs StarRocks как MPP
Привет, Хабр! На связи команда Data Sapience. С последней публикации результатов тестирования MPP-движков прошло уже несколько месяцев. За этот период произошел ряд изменений в базовых версиях open source движков и фреймворков, а также наша команда разработки внесла ряд улучшений и доработок. Все это может повлиять расстановку сил в рейтинге. В сегодняшней публикации мы представим максимальное число претендентов, среди которых: Spark 3.5.*, Spark 3.5.* + DataFusion Comet, Spark 4.0.1, Spark 4.0.1 + DataFusion Comet, StarRocks (core based 3.5+, 4.0+), Impala (core based 4.5), Trino (459, 476, 479) и новичок нашего рейтинга — Apache Doris. Статья поможет вам ответить на вопросы: стоит ли переходить на Spark 4 в поисках производительности; Как нативные вычисления влияют на результаты Spark; Как улучшилась производительность Trino за последние полгода; нужно ли присмотреться к Apache Doris, если вы ищете альтернативу Impala и StarRocks, и как эти проекты связаны между собой; какие оптимизационные улучшения были добавлены нами в StarRocks и Impala за последнее время. И на десерт мы покажем вам сравнение Greenplum, Cloudberry и StarRocks в режиме Shared-Nothing MPP.
https://habr.com/ru/companies/datasapience/articles/1054316/
#starrocks #trino #spark #impala #greenplum #bigdata #dwh #lakehouse #olap
-
Apache Paimon: steamhouse как логическое продолжение современных КХД
Apache Paimon: стриминговый lakehouse для дата-инженеров Сколько систем вы держите ради того, чтобы аналитики видели события через секунды, а годовые отчёты собирались без прогрузки всех данных целиком? Kafka, Flink, S3/HDFS, ClickHouse и бесконечная синхронизация состояния между ними. Apache Paimon стирает границу между стримингом и батчем: одна таблица на LSM-tree отдаёт свежие данные за секунды и одновременно служит источником для тяжёлой аналитики. Разбираем архитектуру, честные бенчмарки против Iceberg, Delta Lake и Hudi - где Paimon выигрывает, а где проигрывает - и проходим путь от первой таблицы до CDC-пайплайна в проде на рабочем коде.
https://habr.com/ru/articles/1053674/
#paimon #flink #java #streamhouse #dwh #streaming #batch #lakehouse #datalakehouse #datalake
-
Apache Paimon: steamhouse как логическое продолжение современных КХД
Apache Paimon: стриминговый lakehouse для дата-инженеров Сколько систем вы держите ради того, чтобы аналитики видели события через секунды, а годовые отчёты собирались без прогрузки всех данных целиком? Kafka, Flink, S3/HDFS, ClickHouse и бесконечная синхронизация состояния между ними. Apache Paimon стирает границу между стримингом и батчем: одна таблица на LSM-tree отдаёт свежие данные за секунды и одновременно служит источником для тяжёлой аналитики. Разбираем архитектуру, честные бенчмарки против Iceberg, Delta Lake и Hudi - где Paimon выигрывает, а где проигрывает - и проходим путь от первой таблицы до CDC-пайплайна в проде на рабочем коде.
https://habr.com/ru/articles/1053674/
#paimon #flink #java #streamhouse #dwh #streaming #batch #lakehouse #datalakehouse #datalake
-
The Season of Sinking by Daphne Woolsoncroft
When Imogen Bly’s mother is found dead in the lake near her mother’s home, Imogen leaves Seattle to help her twin sister, Amelia, take care of her mother’s home and belongings.
Imogen has been dealing with a recurring nightmare, and she soon figures out that it might have something to do with her hometown of Blair, Washington.
The local police believe her mother’s death is an accidental drowning, but Imogen and Amelia start to question the decision. They believe that someone wanted their mother dead.
While Imogen gets reacquainted with her teen crush, Rory from next door. Rory tries to help her look for answers to the death as well as what may have happened in her past.
Imogen and Amelia must deal with their loss alone. They never met their father. Their mother never even told them who he was.
Evidence leads them to believe her mother’s death is somehow also related to the disappearance of a local young woman a year earlier.
Imogen begins to question everyone they meet. Amelia wants to get the house sorted out so they can leave.
This is a story of secrets kept. Some to protect the girls and some to protect a killer. Imogen doesn’t know who to trust.
This was an interesting premise, but I found it hard to get hooked. The mother was dead before I could know enough about her to care. I didn’t find out about the missing person until the last half of the book and by then it felt like the author had to throw all the details out at the last minute.
As a reader, I felt like that character was one too many. I think this might have been more interesting if instead of creating Madison, the missing person; maybe the author could have made Amelia the missing person. That would have given Imogen more of a reason to want to know what happened and if the two incidents were related. I think that change would have given more of an edge to the story that I felt it needed. I did like the possible ghostly visit. I would also have liked more of that threaded into the story.
That said, the author is a hit true crime podcaster. That is enough to make me want to read what she writes.
I do believe this author writes well. I do like her style.
If you like a good domestic mystery, I would still say read this one. I own the author’s first book, Night Watcher. It became lost in my to be read pile. After reading this one, I hope to dig that one out and read it soon.
This is the author’s second book and a new release that comes out on July 7, 2026.
Thanks to NetGalley and Grand Central Publishing for sending this book for review. All opinions are my own.
I include links to purchase as a convenience to my readers. As an associate, I earn from qualified purchases.
Daphne Woolsoncroft books:
What I am currently reading:
The Mysterious Affair of Judith Potts by Robert Thorogood
Bamboozled by Barbara Barrett
Erie Ending by Christy Kendall
Disability Visibility by Alice Wong
I am caught up with my reviews but hope to have a book finished to review for Friday.
Happy Reading!
If you like a bargain, check out my Pango book shop. You can find it at this link:
https://pangobooks.com/bookstore/virginia468417
Rate this:
#BookReview #Books #Fiction #LakeHouse #MissingPerson #reading #WashingtonState