#clickhouse — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #clickhouse, aggregated by home.social.
-
Как я написал свой мигратор для ClickHouse — и почему он до сих пор жив
В 2020-м мне понадобилось версионировать схему ClickHouse в CI/CD, а готового инструмента под Go с поддержкой ClickHouse не нашлось ни одного. Пришлось написать свой — db-migrator . Со временем он оброс поддержкой Postgres, MySQL, а недавно и Iceberg, и разошёлся среди коллег по отрасли. В статье расскажу, чем миграции в ClickHouse отличаются от привычного Postgres/MySQL и какие инженерные развилки из-за этого пришлось пройти: ON CLUSTER для обычного реплицированного кластера, режим Replicated-базы, аккуратная таблица истории миграций на шардированном кластере и маскирование секретов в логах. Инструмент: https://github.com/raoptimus/db-migrator.go
https://habr.com/ru/articles/1075014/
#миграции #базы_данных #postgresql #iceberg #mysql #clickhouse #migration
-
От struct к компиляции под схему: ускоряем RowBinary-декодер на Python
Я автор aiochlite — асинхронного клиента ClickHouse на aiohttp . Раньше мой декодер RowBinary читал каждое числовое поле отдельно. Если брать 200 тысяч строк с десятью числовыми колонками, получалось два миллиона таких чтений, хотя все данные уже были в памяти. Сначала я думал использовать Cython, C или Rust. Но потом решил попробовать оптимизировать сам процесс: объединить соседние поля с фиксированной длиной в один struct , а полностью фиксированные строки разбирать с помощью Struct.iter_unpack . На числовых данных это ускорило работу примерно в 8.3 раза. Со смешанной схемой данных получилось интереснее: простая склейка почти не помогла. Главной проблемой осталась проверка типов внутри основного цикла. В итоге я начал генерировать и компилировать Python-функцию под конкретную схему ответа — это дало ускорение еще примерно в 1.7 раза. В статье я подробно рассказываю, как это работает, как я проводил замеры, сколько времени занимает генерация кода и в каких случаях такие оптимизации уже не нужны. Весь код и скрипты для тестов можно найти в репозитории.
https://habr.com/ru/articles/1072036/
#python #clickhouse #struct #rowbinary #оптимизация #производительность #бенчмарк #cpython #asyncio #бинарные_форматы
-
Стоковый ClickHouse занял 12 ГБ диска при 543 КБ данных: сколько на самом деле ест self-hosted observability
Полный self-hosted стек observability (Go-приложение + PostgreSQL + ClickHouse) живёт на VPS с 2 ядрами и 2 ГБ RAM. Но сначала стоковый ClickHouse занял 12 ГБ диска при 543 КБ полезных данных, держал 900 МБ памяти и мержил 11 миллионов строк каждые 30 секунд. Разбор с реальными замерами: куда всё ушло, какая гипотеза не подтвердилась, какая ошибка уронила прод и какие настройки в итоге вернули две трети памяти.
https://habr.com/ru/articles/1070270/
#clickhouse #devops #observability #selfhosted #postgresql #docker #vps
-
The backlog is the tell. ClickHouse's engineering team has a queue of optimizations they explored but never validated for production, and clearing it is job one for the new labs.
That detail matters more than the hire. Most industry research groups throw ideas over the wall. This one starts with unfinished work already in the queue, then uses it as a springboard.
-
pg_clickhouse v0.10: Subquery pushdown and 1000x faster TPC-H queries
https://clickhouse.com/blog/pg_clickhouse-whats-new-july-2026
Comments: https://news.ycombinator.com/item?id=49265031
#HackerNews #pg_clickhouse #ClickHouse #TPC_H #performance #improvement #subquery #pushdown #dataanalytics
-
#nixos saga update: it's working you guys. #vector is now pushing
journaldlogs to #clickhouse and it feels so goooooooodexcept for how it's bringing in the entire gcc toolchain
but it's fine it's fine, nobody cares, 3gb gha caches are normal right
-
Как за 5 недель построить рекомендательную систему в TravelTech: Kafka и MongoDB вместо Feature Store
Привет! Меня зовут Кристина, я MLOps-инженер в Туту. Занимаюсь тем, что помогаю рекомендательным системам добраться до прода со всеми компромиссами, горящими дедлайнами и новыми идеями. Эта статья — про один из таких запусков. В идеальном ML-мире запуск рекомендаций выглядит примерно так: полгода проектируют хранилище признаков (Feature Store), настраивают, откуда и как берутся данные, гоняют тяжёлые расчёты фичей и моделей, а отдельная команда следит, не деградирует ли модель из‑за изменений в данных. В реальном бизнесе у тебя есть 5 недель до старта высокого сезона, два инженера, DS и задача: сделать так, чтобы пользователь, который купил билет, сразу увидел релевантный отель. Рассказываем, как мы собрали работающую RecSys v1 на привычном стеке: Kafka, MongoDB, ClickHouse. При этом мы сознательно отказались от перфекционизма ради скорости. Инженерный вызов здесь не в масштабе и не в алгоритмах, а в контексте. Cross-sell в travel — это не «похожие товары». Пример Пользователь купил билет Москва → Сочи на 10–17 июля: значит, нужно показать отели именно в Сочи, именно на эти даты. Коллаборативная фильтрация без контекста поездки — «похожие пользователи → похожие отели» — не знает ни город, ни даты, ни то, что заказ только что оплачен и его ещё нет в DWH. Нужен подход, где контекст конкретной поездки — куда, когда, с кем — задаётся явно до ранжирования. «Правильный» путь — Feature Store и полноценная ML-платформа, занял бы 4–6 месяцев. Бизнесу нужно было проверить гипотезу на живом трафике. Мы собрали v1 на том, что уже работало в проде, с некоторыми компромиссами и без иллюзий насчёт идеальной архитектуры.
https://habr.com/ru/companies/tuturu/articles/1064442/
#рекомендательные_системы #mlops #kafka #clickhouse #feature_store #fastapi #catboost #travel_tech #mongodb
-
От 12 часов к 30 минутам: как мы join’им миллиарды товарных движений в ClickHouse
Всем привет! Меня зовут Муса. Наша команда занимается витринами данных по товарному учёту. Каждый день мы доставляем около 10 млрд записей в разных форматах. На этих данных строится различная аналитика, связанная с товарными запасами и движениями экземпляров. Перед нами встала задача: пять раз в день обогащать выгрузку из миллиардов экземплярных остатков дополнительными атрибутами для построения различного рода аналитики. История этих атрибутов уже измерялась десятками миллиардов записей. Первое решение выглядело просто: положить данные в ClickHouse и сделать JOIN. Но одна выгрузка считалась около 12 часов, а нам нужно было укладываться в десятки минут. В статье расскажу, про то, как мы смогли сократить время обработки примерно до 33 минут, про ключевой подход при работе с большими объёмами данных, а также попытаюсь донести важность локальности данных на примере реальной задачи.
https://habr.com/ru/companies/ozontech/articles/1064182/
#highload #clickhouse #backend #systemdesign #bigdata #базы_данны #sql #olap #архитектура_данных #ozon_tech
-
🎉 Wow, the tech world is positively electrified by Andy Pavlo's move to ClickHouse—because what the world really needed was another 'labs' buzzword! 🧪🤓 Is it just me, or does every #database startup sound like a LARPing session for tech bros trying to out-cloud each other? ☁️🔍
https://clickhouse.com/blog/andy-pavlo-joins-clickhouse #technews #startups #ClickHouse #AndyPavlo #buzzwords #HackerNews #ngated -
Andy Pavlo Joins ClickHouse to Establish ClickHouse Labs
https://clickhouse.com/blog/andy-pavlo-joins-clickhouse
Comments: https://news.ycombinator.com/item?id=49156011
#HackerNews #AndyPavlo #ClickHouse #ClickHouseLabs #TechNews #DataEngineering
-
[Перевод] Предел PostgreSQL: как кеш AI-тестов вырос до миллиарда записей и переехал на ClickHouse
От проблем PostgreSQL к скорости ClickHouse. Рассказываем, как переработали архитектуру кеширования для AI-тестов, чтобы выполнять более 2 млн запросов и обрабатывать 20 млрд записей в день, сохранив среднюю задержку поиска элементов на уровне 250 мс.
-
Apache Iceberg: Индиана Джонс и Каталог судьбы
parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы или мусор из файлов и кого вообще к ним подпустят. Это каталог. Разбираю просто, что такое Apache Iceberg, зачем ему каталог - и почему новость про Polaris важнее, чем кажется. В продолжение анонса новостей…
https://habr.com/ru/articles/1065864/
#iceberg #trino #lakehouse #database #базы_данных #s3 #lakehouseплатформа_данных #clickhouse #ducklake #dremio
-
🥳 Oh joy, another 'revolutionary' database written in #Rust, because the world clearly needed yet another one 🌍! Faster than #Postgres and ClickHouse? Sure, let's rewrite everything in Rust while we're at it, because who needs stability and maturity anyway? 🚀
https://github.com/malisper/pgrust/releases/tag/v0.2-release #revolutionarydatabase #ClickHouse #techtrends #innovation #HackerNews #ngated -
Postgres rewritten in Rust v0.2, now faster than Postgres and ClickHouse
https://github.com/malisper/pgrust/releases/tag/v0.2-release
Comments: https://news.ycombinator.com/item?id=49111925
#HackerNews #Postgres #Rust #ClickHouse #performance #database #v0.2
-
Apache Iceberg: Индиана Джонс и Каталог судьбы
*.parquet - данные лежат в открытом формате - казалось бы, бери кто хочешь. Но есть неприметный артефакт, от которого зависит, увидите вы таблицы или мусор из файлов и кого вообще к ним подпустят. Это каталог. Разбираю простым языком, что такое Apache Iceberg, зачем ему каталог - и почему тихая новость про Polaris важнее, чем кажется. В продолжении анонса новостей
https://habr.com/ru/articles/1064224/
#Apache_Iceberg #каталог_данных #Polaris #lakehouse #data_engineering #PostgreSQL #ClickHouse #Trino #DuckLake #объектное_хранилище
-
Observability в одном Go-бинарнике: как я собрал self-hosted без Kafka и Redis
Официальный self-hosted-вариант знакомого observability-стека — это под два десятка контейнеров: брокер, воркеры, кэш, отдельное аналитическое хранилище. Мне нужно было держать логи ошибок у себя, но для нескольких проектов такая инсталляция несоразмерна. Я решил выяснить, сколько из этого действительно необходимо — и собрал один Go-бинарник поверх PostgreSQL и ClickHouse, без Kafka и Redis. Внутри: почему брокер тут не нужен, как флаг --mode раскладывает систему по процессам при росте и почему перенос сводится к смене DSN в существующем Sentry SDK.
https://habr.com/ru/articles/1062624/
#observability #selfhosted #golang #clickhouse #opentelemetry #мониторинг
-
ClickHouse: сценарии, сильные стороны, лучшие практики работы в 2026 году
ClickHouse — один из самых востребованных инструментов для хранения и анализа больших объемов данных, обеспечивающий высокую производительность и наблюдаемость сервисов и приложений. Благодаря этим параметрам многие компании внедряют его в свои ИТ-инфраструктуры для решения задач аналитики, логирования и мониторинга. Однако, несмотря на широкое распространение, практика показывает, что далеко не все команды до конца осознают все особенности и нюансы работы с этой системой, что может приводить к неэффективному использованию ресурсов, ошибкам в проектировании и снижению общей производительности. Привет, Хабр. Меня зовут Александр Кривяков. Я пресейл-архитектор VK Data Platform , VK Tech. В этой статье я расскажу об основных принципах работы ClickHouse, а также покажу возможные архитектурные решения и типичные сценарии применения системы.
https://habr.com/ru/companies/vktech/articles/1061284/
#vk_cloud #clickhouse #olap #колоночное_хранение #большие_данные #data_platform #логирование #метрики #архитектура_данных #best_practices
-
SSB — «мы стояли на „плоскости“»
SSB — «мы стояли на „плоскости“» Предлагаемый текст представляет опыт ознакомления автора с тестом SSB в свете обычных прикладных вопросов BI‑проекта умеренного размаха. Автор пытается бросить пытливый взгляд на спектр перспективных возможностей, обеспечиваемых доступностью и масштабируемостью теста SSB.
https://habr.com/ru/articles/1060442/
#SSB #Postgres #ClickHouse #Sizing #MDX #Flat #Star #BI #DWH #КХД
-
Wednesday Links - Edition 2026-07-15
https://dev.to/0xkkocel/wednesday-links-edition-2026-07-15-1dlj
#java #jvm #gradle #github #spring #clickhouse -
🎉 Congrats on proving that #PgBouncer can scale like a caffeine-fueled hamster on a wheel! 🚀 Meanwhile, actual humans are still trying to figure out what #ClickHouse is doing managing #Postgres, like a cat herding an army of squirrels. 🐿️ Please, share more magical buzzword spells and impressive #SVG logos! 🙄
https://clickhouse.com/blog/pgbouncer-clickhouse-managed-postgres #scaling #techhumor #HackerNews #ngated -
We scaled PgBouncer to 4x throughput
https://clickhouse.com/blog/pgbouncer-clickhouse-managed-postgres
Comments: https://news.ycombinator.com/item?id=48872874
#HackerNews #PgBouncer #ClickHouse #Scaling #Throughput #Database #Performance
-
serprex and I collaborated on a post for the ClickHouse blog on the new re2 #PostgreSQL extension. Pretty nice to have a fast, alternate regular expression interface in Postgres with transparent pushdown to #ClickHouse.
https://clickhouse.com/blog/introducing-pg_re2-regex-in-postgres
-
Пока все хоронили пайплайны, ClickHouse достраивал слои
«Отдельные базы больше не нужны», «конец пайплайнов» - каждую неделю кто-то крупный со сцены хоронит то, что ты вчера поставил в прод. ClickHouse поступил ровно наоборот, и поэтому его анонсы стоит прочитать внимательно. Что реально показали на Open House 2026 и что из этого доедет до прода - разбор практика без вендорского глянца.
https://habr.com/ru/articles/1056292/
#clickhouse #postgresql #Clickstack #olap #lakehouse #data_engineering #observability #колоночная_субд #ClickHouse_Agents #Open_House_2026
-
🔄 Bridging Scala 🤝 Perl
Scala uses camelCase (`toJson`), Perl prefers snake_case (`to_json`). How to keep JSON logic consistent? 🤯
Instead of two-way translation, I folded both into a neutral canonical namespace. Combined with #ClickHouse view magic 🪄
Read the design trade-offs here 👇
[https://dev.to/p_pumulo/one-name-two-languages-giving-siunertaq-a-canonical-namespace-bdm]#scala #perl #Interoperability #Polyglot #Interoperability #LanguageBindings