#datalake — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #datalake, aggregated by home.social.
-
Something about the past, but also the future.
-
Treating each campaign as a reusable layer in an AI-driven stack stops the rebuild loop. By piping ad-spend APIs into a unified data lake and automating lead tagging with n8n, the same models and persona serve every launch, so each effort adds fresh signal and cuts setup time. The system compounds, sharpening targeting over months instead of weeks. 📊🔄 #MarTech #AI #DataLake #Automation - Powered by FG
-
#ITByte: #DataLake tables act as an intermediary layer between the raw data files stored in your data lake and how you access and manage that data.
#Apache #Iceberg is an open table format for huge analytic datasets to be stored in Data Lakes.
https://knowledgezone.co.in/posts/Data-Lake-Table-Format--Apache-Iceberg-6358e0da4732e7e001333915
-
От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»
Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1 , 2 , 3 ). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат. Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ) , помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха.
https://habr.com/ru/companies/magnit/articles/1056372/
#data_engineer #bigdata #mlops #data_science #osa #pyspark #облачные_вычисления #архитектура_системы #datalake
-
📊 parseablehq/parseable
Unifies logs, metrics, traces and events in a columnar data lake, cutting storage costs by up to 90% with compression
⭐ Stars: 2398
📅 Last Update: Jul 03, 2026https://github.com/parseablehq/parseable
#selfhosted #homelab #selfhost #selfhosting #opensource #observability #datalake
-
Apache Paimon: steamhouse как логическое продолжение современных КХД
Apache Paimon: стриминговый lakehouse для дата-инженеров Сколько систем вы держите ради того, чтобы аналитики видели события через секунды, а годовые отчёты собирались без прогрузки всех данных целиком? Kafka, Flink, S3/HDFS, ClickHouse и бесконечная синхронизация состояния между ними. Apache Paimon стирает границу между стримингом и батчем: одна таблица на LSM-tree отдаёт свежие данные за секунды и одновременно служит источником для тяжёлой аналитики. Разбираем архитектуру, честные бенчмарки против Iceberg, Delta Lake и Hudi - где Paimon выигрывает, а где проигрывает - и проходим путь от первой таблицы до CDC-пайплайна в проде на рабочем коде.
https://habr.com/ru/articles/1053674/
#paimon #flink #java #streamhouse #dwh #streaming #batch #lakehouse #datalakehouse #datalake
-
Anthropic reported that #Claude now handles ~95% of its internal analytics requests, enabling employees to query business data directly instead of relying on data teams.
Anthropic credits strong data governance, clear semantic definitions, and operational discipline as the primary drivers of success.
🔗 Learn more: https://bit.ly/4uPN80U
-
AGU testou o Fabric, da Microsoft, mas elegeu Databricks como plataforma para Datalake
-
Data Mesh vs. Data Lake : avantages/inconvénients. Qui gagne ? Hybride. #DataEngineering #DataMesh #DataLake #Tech #Architecture ... https://www.linkedin.com/posts/gabriel-chandesris_dataengineering-datamesh-datalake-share-7465341623456038912-loYs/
-
DuckDB Labs released #DuckLake 1.0 - a data lake format that stores table metadata in a SQL database, rather than spreading it across object storage files.
Key features:
• catalog-stored small updates
• improved sorting and partitioning
• compatibility with Iceberg-style data featuresLearn more ⇨ https://bit.ly/48PsPIS
-
StarRocks вместо Oracle на смешанной аналитической нагрузке. Проверяем на практике
Привет, Хабр! Меня зовут Денис Пашков, я – ведущий архитектор данных в группе компаний GlowByte. В этой публикации я бы хотел поделиться опытом работы с MPP-решением StarRocks, набирающим популярность на российском рынке. Все, кто интересуется данной темой, уже, наверное, не сомневаются, что StarRocks очень хорошо себя показывает в аналитической нагрузке. Мои коллеги из Data Sapience регулярно делятся результатами нагрузочных испытаний платформы данных Data Ocean Nova (ознакомиться можно: 1 , 2 и 3 ). Сегодня же речь пойдет о неочевидном сценарии использования – OLTP-нагрузке.
https://habr.com/ru/companies/datasapience/articles/1029814/
#dwh #bigdata #datalake #datalakehouse #lakehouse #starrocks
-
Lakehouse architectures allow multiple engines to run on shared data through open table formats like #ApacheIceberg.
But #SQL identifier resolution and catalog naming rules differ across engines - creating hidden interoperability failures.
In this #InfoQ article, Maninder Parmar explains why enforcing consistent naming conventions and cross-engine validation is critical.
📰 Read now: https://bit.ly/4902zeH
-
Spark SQL Scripting. Новые возможности для инженеров данных
До недавнего времени для реализации сложной многошаговой логики в экосистеме Apache Spark разработчикам приходилось выходить за рамки декларативного SQL. Оркестрация последовательных вызовов, вычисление промежуточных переменных и ветвление логики требовали привлечения внешних языков программирования, таких как Python (PySpark) или Scala и дополнительных инструментов. Spark SQL Scripting, который стал доступен, начиная с 4-й версии, кардинально меняет этот подход, представляя собой процедурное расширение классического Spark SQL. Теперь разработчики могут писать полноценные многошаговые сценарии непосредственно на уровне SQL-артефактов, внедряя в них управляющую логику. В данной публикации мы, команда вендора Data Sapience , разберем возможности Spark scripting на практике.
https://habr.com/ru/companies/datasapience/articles/1021214/
-
Stop the "Small File Syndrome" in your Data Lake. Learn how to implement Compaction, Z-Ordering, and automated maintenance in Databricks and Snowflake. https://hackernoon.com/the-silent-killer-of-data-lakes-solving-the-small-file-problem #datalake
-
#Uber’s HiveSync team optimized Hadoop Distcp for multi-petabyte replication across hybrid cloud and on-prem data lakes.
✅ Task parallelization
✅ Uber jobs for small transfers
✅ Improved observabilityResult: 5× replication capacity & seamless on-prem-to-cloud migration.
Read more: https://bit.ly/4bwUUFt
#InfoQ #SoftwareArchitecture #DistributedSystems #Observability #DataLake
-
Most ML issues are not model problems. They are data problems.
I retrained the same churn model twice.
Same code. Same path to the data.
Different result.Why? Because of mutable data references.
:blobcoffee: I wrote a small Data Lake vs Data Lakehouse demo showing why versioned data makes ML debugging reproducible: https://tinyurl.com/lake-vs-lakehouse-medium
:blobcoffee: Friend-Link: https://medium.com/towards-artificial-intelligence/from-data-lake-to-data-lakehouse-why-ai-changes-the-rules-for-data-platforms-c78feab48e1c?sk=405811cbc10baa4622bcfcad90736ed4
#ai #machinelearning #data #lakehouse #warehouse #python #datalake #technology #regression
-
Процедурное SQL-расширение в Lakehouse-платформе – новые возможности для работы с данными
Вас приветствует команда Data Sapience, и в сегодняшней публикации мы расскажем о реализации процедурного расширения для работы с MPP-движками Lakehouse-платформы данных Data Ocean Nova, которое стало доступным для пользователей. В материале пойдет речь о возможностях, применимости и сценариях использования процедурного языка в аналитической платформе данных и примеры реализации решения типовых задач.
https://habr.com/ru/companies/datasapience/articles/987006/
#lakehouse #impala #starrocks #bigdata #dwh #datalakehouse #datalake #bi
-
Shifting Left delivers clean, reliable, and accessible data to everyone who needs it - right when they need it.
The result? Less complexity, lower overhead, and far less break-fix work, freeing teams to focus on higher-value problems.
At the core of a #ShiftLeft strategy are Data Products. They form the backbone of healthy data communication and ensure quality is built in - not patched on later.
📖 Great insights from this #InfoQ article on rethinking the Medallion Architecture: https://bit.ly/3WHjxsf
#SoftwareArchitecture #DataMesh #DataEngineering #DataLake #DataPipelines
-
via #Microsoft : Microsoft announces acquisition of Osmos to accelerate autonomous data engineering in Fabric
https://ift.tt/MpyJ38g
#Microsoft #Osmos #DataEngineering #AI #AutonomousAI #MicrosoftFabric #DataAnalytics #DataWorkflows #DataIntegration #BigData #DataLake #OneLak… -
Data lakes are typically thought of as simple warehouses. But they don't have to be! 👀 In Graylog 7.0 data lakes function as pressure release valves for #security teams overwhelmed by storage costs, investigation delays, and cloud data sprawl — where analysts can get direct access to long term data, and more.
Our data lake provides inexpensive storage where logs stay searchable, preview-able, and recoverable. Learn more about getting cloud scale without cloud surprises, and why this is a truly practical stance on managing data volume.
https://graylog.org/post/how-to-use-data-lakes-to-reduce-siem-costs-and-strengthen-investigations/ #CyberSecurity #SEIM #DataLake #TDIR
-
Бенчмарк бенчмарка Lakehouse-движков, в котором побеждает объективная реальность
Недавно на хабре вышла статья с громким заголовком “Бенчмарк lakehouse-движков, часть 1: StarRocks и Doris падают под нагрузкой, Presto аутсайдер, CedrusData быстрее всех”. В своей статье авторы из Кверифай Лабс выбрали методику TPC-DS, но вместо 99 запросов остановилась на одном, который к тому же запускается на одной машине. Обосновывается это тем, что на одном конкретном запросе нужно разобрать работу оптимизаторов. По результатам исследования делается вывод, что решение, разработанное авторами, является лучшим, в том числе для запуска одного конкретного запроса на одном узле. Давайте попробуем разобраться, действительно ли это так.
https://habr.com/ru/companies/datasapience/articles/964052/
#starrocks #trino #impala #mpp #bigdata #dwh #lakehouse #datalake #s3 #hadoop
-
Pg_lake: Postgres with Iceberg and data lake access
https://github.com/Snowflake-Labs/pg_lake
#HackerNews #Pg_lake #Postgres #Iceberg #DataLake #Snowflake
-
Cloudflare has just launched the open beta of its Cloudflare Data Platform - a managed service for ingesting, storing & querying analytical data tables using open standards like Apache Iceberg.
🔍 Dive into the key insights on #InfoQ ⇨ https://bit.ly/49y1tIa
#CloudComputing #DataLake #DataAnalytics #ApacheIceberg #Cloudflare
-
Workspace-Level Private Link in Microsoft Fabric (Generally Available)
#DataEngineering #DataLake #DataScience #datawarehouse #MicrosoftFabric
https://blog.fabric.microsoft.com/en-us/blog/announcing-general-availability-of-workspace-level-private-link-in-microsoft-fabric?ft=All -
Тестирование движков массивно-параллельных вычислений: StarRocks, Trino, Spark. Spark – с DataFusion Comet и Impala
В сегодняшней, уже третьей по счету, публикации я продолжу делится результатами нагрузочных испытаний вычислительных технологий массивных параллельных вычислений (на Habr уже представлены мои материалы, посвященные сравнению Impala, Trino и Greenplum , в том числе по методике TPC-DS ). В этот раз в список решений добавляется Spark, включая работающий с технологией нативных вычислений DataFusion Comet, и набирающий популярность StarRocks.
https://habr.com/ru/companies/datasapience/articles/959496/
#starrocks #trino #lakehouse #impala #spark #bigdata #datalake #dwh #hadoop #s3