home.social

#hadoop — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #hadoop, aggregated by home.social.

  1. Thailand's Ministry of Finance Targeted With Hermes AI Agent Running Unattended, Hades Implant Staged

    Between July 9-13, 2026, three exposed directories on a Hong Kong server revealed an ongoing cyber espionage operation targeting Thailand's Ministry of Finance. The attack leveraged Hermes, an autonomous AI agent operating in unattended YOLO mode, alongside a custom Go-based implant called Hades. Recovered files included exploit code for multiple vulnerabilities, webshells, stolen credentials, and purpose-built scripts targeting MOF Hadoop infrastructure, mail systems, and GlassFish consoles. The AI agent autonomously enumerated ministry networks using LinPEAS, traversed files, and assessed privilege escalation paths. Infrastructure analysis linked multiple Hong Kong and Malaysian servers through TLS certificates and hardcoded C2 addresses. Chinese-language indicators and historical ShadowPad/VShell presence suggest probable Chinese-speaking attribution, though initial access methods remain undetermined.

    Pulse ID: 6a6280a6b0f220d5330af106
    Pulse Link: otx.alienvault.com/pulse/6a628
    Pulse Author: AlienVault
    Created: 2026-07-23 20:59:18

    Be advised, this data is unverified and should be considered preliminary. Always do further verification.

    #Chinese #CyberSecurity #Espionage #Hadoop #HongKong #InfoSec #OTX #OpenThreatExchange #RAT #ShadowPad #TLS #Thailand #bot #AlienVault

  2. Thailand's Ministry of Finance Targeted With Hermes AI Agent Running Unattended, Hades Implant Staged

    Between July 9-13, 2026, three exposed directories on a Hong Kong server revealed an ongoing cyber espionage operation targeting Thailand's Ministry of Finance. The attack leveraged Hermes, an autonomous AI agent operating in unattended YOLO mode, alongside a custom Go-based implant called Hades. Recovered files included exploit code for multiple vulnerabilities, webshells, stolen credentials, and purpose-built scripts targeting MOF Hadoop infrastructure, mail systems, and GlassFish consoles. The AI agent autonomously enumerated ministry networks using LinPEAS, traversed files, and assessed privilege escalation paths. Infrastructure analysis linked multiple Hong Kong and Malaysian servers through TLS certificates and hardcoded C2 addresses. Chinese-language indicators and historical ShadowPad/VShell presence suggest probable Chinese-speaking attribution, though initial access methods remain undetermined.

    Pulse ID: 6a6280a6b0f220d5330af106
    Pulse Link: otx.alienvault.com/pulse/6a628
    Pulse Author: AlienVault
    Created: 2026-07-23 20:59:18

    Be advised, this data is unverified and should be considered preliminary. Always do further verification.

    #Chinese #CyberSecurity #Espionage #Hadoop #HongKong #InfoSec #OTX #OpenThreatExchange #RAT #ShadowPad #TLS #Thailand #bot #AlienVault

  3. Thailand's Ministry of Finance Targeted With Hermes AI Agent Running Unattended, Hades Implant Staged

    Between July 9-13, 2026, three exposed directories on a Hong Kong server revealed an ongoing cyber espionage operation targeting Thailand's Ministry of Finance. The attack leveraged Hermes, an autonomous AI agent operating in unattended YOLO mode, alongside a custom Go-based implant called Hades. Recovered files included exploit code for multiple vulnerabilities, webshells, stolen credentials, and purpose-built scripts targeting MOF Hadoop infrastructure, mail systems, and GlassFish consoles. The AI agent autonomously enumerated ministry networks using LinPEAS, traversed files, and assessed privilege escalation paths. Infrastructure analysis linked multiple Hong Kong and Malaysian servers through TLS certificates and hardcoded C2 addresses. Chinese-language indicators and historical ShadowPad/VShell presence suggest probable Chinese-speaking attribution, though initial access methods remain undetermined.

    Pulse ID: 6a6280a6b0f220d5330af106
    Pulse Link: otx.alienvault.com/pulse/6a628
    Pulse Author: AlienVault
    Created: 2026-07-23 20:59:18

    Be advised, this data is unverified and should be considered preliminary. Always do further verification.

    #Chinese #CyberSecurity #Espionage #Hadoop #HongKong #InfoSec #OTX #OpenThreatExchange #RAT #ShadowPad #TLS #Thailand #bot #AlienVault

  4. Thailand's Ministry of Finance Targeted With Hermes AI Agent Running Unattended, Hades Implant Staged

    Between July 9-13, 2026, three exposed directories on a Hong Kong server revealed an ongoing cyber espionage operation targeting Thailand's Ministry of Finance. The attack leveraged Hermes, an autonomous AI agent operating in unattended YOLO mode, alongside a custom Go-based implant called Hades. Recovered files included exploit code for multiple vulnerabilities, webshells, stolen credentials, and purpose-built scripts targeting MOF Hadoop infrastructure, mail systems, and GlassFish consoles. The AI agent autonomously enumerated ministry networks using LinPEAS, traversed files, and assessed privilege escalation paths. Infrastructure analysis linked multiple Hong Kong and Malaysian servers through TLS certificates and hardcoded C2 addresses. Chinese-language indicators and historical ShadowPad/VShell presence suggest probable Chinese-speaking attribution, though initial access methods remain undetermined.

    Pulse ID: 6a6280a6b0f220d5330af106
    Pulse Link: otx.alienvault.com/pulse/6a628
    Pulse Author: AlienVault
    Created: 2026-07-23 20:59:18

    Be advised, this data is unverified and should be considered preliminary. Always do further verification.

    #Chinese #CyberSecurity #Espionage #Hadoop #HongKong #InfoSec #OTX #OpenThreatExchange #RAT #ShadowPad #TLS #Thailand #bot #AlienVault

  5. Thailand's Ministry of Finance Targeted With Hermes AI Agent Running Unattended, Hades Implant Staged

    Between July 9-13, 2026, three exposed directories on a Hong Kong server revealed an ongoing cyber espionage operation targeting Thailand's Ministry of Finance. The attack leveraged Hermes, an autonomous AI agent operating in unattended YOLO mode, alongside a custom Go-based implant called Hades. Recovered files included exploit code for multiple vulnerabilities, webshells, stolen credentials, and purpose-built scripts targeting MOF Hadoop infrastructure, mail systems, and GlassFish consoles. The AI agent autonomously enumerated ministry networks using LinPEAS, traversed files, and assessed privilege escalation paths. Infrastructure analysis linked multiple Hong Kong and Malaysian servers through TLS certificates and hardcoded C2 addresses. Chinese-language indicators and historical ShadowPad/VShell presence suggest probable Chinese-speaking attribution, though initial access methods remain undetermined.

    Pulse ID: 6a6280a6b0f220d5330af106
    Pulse Link: otx.alienvault.com/pulse/6a628
    Pulse Author: AlienVault
    Created: 2026-07-23 20:59:18

    Be advised, this data is unverified and should be considered preliminary. Always do further verification.

    #Chinese #CyberSecurity #Espionage #Hadoop #HongKong #InfoSec #OTX #OpenThreatExchange #RAT #ShadowPad #TLS #Thailand #bot #AlienVault

  6. 📢 connector 2.0 is out!
    Your helper to parallelize reads/writes across @apache.org Spark partitions and @opensearch.org shards just got a boost:
    ✅ Spark 3.5 and 4 support
    ✅ OpenSearch 3.x compatibility
    ✅ Amazon OpenSearch Serverless support
    and more
    opensearch.org/blog/introducin

  7. 📢 #OpenSearch #Hadoop connector 2.0 is out!
    Your helper to parallelize reads/writes across @apache.org Spark partitions and @opensearch.org shards just got a boost:
    ✅ Spark 3.5 and 4 support
    ✅ OpenSearch 3.x compatibility
    ✅ Amazon OpenSearch Serverless support
    and more
    opensearch.org/blog/introducin

  8. 📢 #OpenSearch #Hadoop connector 2.0 is out!
    Your helper to parallelize reads/writes across @apache.org Spark partitions and @opensearch.org shards just got a boost:
    ✅ Spark 3.5 and 4 support
    ✅ OpenSearch 3.x compatibility
    ✅ Amazon OpenSearch Serverless support
    and more
    opensearch.org/blog/introducin

  9. 📢 #OpenSearch #Hadoop connector 2.0 is out!
    Your helper to parallelize reads/writes across @apache.org Spark partitions and @opensearch.org shards just got a boost:
    ✅ Spark 3.5 and 4 support
    ✅ OpenSearch 3.x compatibility
    ✅ Amazon OpenSearch Serverless support
    and more
    opensearch.org/blog/introducin

  10. 📢 #OpenSearch #Hadoop connector 2.0 is out!
    Your helper to parallelize reads/writes across @apache.org Spark partitions and @opensearch.org shards just got a boost:
    ✅ Spark 3.5 and 4 support
    ✅ OpenSearch 3.x compatibility
    ✅ Amazon OpenSearch Serverless support
    and more
    opensearch.org/blog/introducin

  11. Особенности Schema Evolution в Hadoop: как сделать alter table

    Привет, Хабр! Меня зовут Ольга Косарева, я инженер данных команды «Прогнозирование финансового результата» Центра разработки решений ALM в ИТ‑холдинге Т1, мы занимаемся созданием современной ALM‑системы (подробнее тут ). Полтора года назад я пришла в команду и получила задачу дописать и внедрить инструмент для DDL‑операций над данными в экосистеме Hadoop. Моя первая реакция была: «А зачем так сложно? Какой инструмент? Почему нельзя просто выполнить команду ALTER TABLE через Hive?» В этой статье мы с коллегами Никитой Королёвым и Алексеем Пожар расскажем, в каких случаях целесообразно именно так и сделать, а в каких это приведёт к различным проблемам с данными, что такое Schema Evolution и как мы решаем задачу периодического изменения структур таблиц с нашими отчётами.

    habr.com/ru/companies/T1Holdin

    #hadoop #hive #alter_table #DDL #ALM

  12. Особенности Schema Evolution в Hadoop: как сделать alter table

    Привет, Хабр! Меня зовут Ольга Косарева, я инженер данных команды «Прогнозирование финансового результата» Центра разработки решений ALM в ИТ‑холдинге Т1, мы занимаемся созданием современной ALM‑системы (подробнее тут ). Полтора года назад я пришла в команду и получила задачу дописать и внедрить инструмент для DDL‑операций над данными в экосистеме Hadoop. Моя первая реакция была: «А зачем так сложно? Какой инструмент? Почему нельзя просто выполнить команду ALTER TABLE через Hive?» В этой статье мы с коллегами Никитой Королёвым и Алексеем Пожар расскажем, в каких случаях целесообразно именно так и сделать, а в каких это приведёт к различным проблемам с данными, что такое Schema Evolution и как мы решаем задачу периодического изменения структур таблиц с нашими отчётами.

    habr.com/ru/companies/T1Holdin

    #hadoop #hive #alter_table #DDL #ALM

  13. Особенности Schema Evolution в Hadoop: как сделать alter table

    Привет, Хабр! Меня зовут Ольга Косарева, я инженер данных команды «Прогнозирование финансового результата» Центра разработки решений ALM в ИТ‑холдинге Т1, мы занимаемся созданием современной ALM‑системы (подробнее тут ). Полтора года назад я пришла в команду и получила задачу дописать и внедрить инструмент для DDL‑операций над данными в экосистеме Hadoop. Моя первая реакция была: «А зачем так сложно? Какой инструмент? Почему нельзя просто выполнить команду ALTER TABLE через Hive?» В этой статье мы с коллегами Никитой Королёвым и Алексеем Пожар расскажем, в каких случаях целесообразно именно так и сделать, а в каких это приведёт к различным проблемам с данными, что такое Schema Evolution и как мы решаем задачу периодического изменения структур таблиц с нашими отчётами.

    habr.com/ru/companies/T1Holdin

    #hadoop #hive #alter_table #DDL #ALM

  14. Hue для домашнего Hadoop: Docker, CSRF и неочевидные грабли

    Пятая статья цикла о построении CDC-пайплайна с нуля. HDFS и Hive работают, но управлять ими через консоль неудобно. Сегодня поднимаем веб-интерфейс Hue и разбираемся, почему в 2026 году сборка из исходников требует Python 2.7.

    habr.com/ru/articles/996646/

    #hue #hadoop #hive #postgresql #python #filesystem

  15. Hue для домашнего Hadoop: Docker, CSRF и неочевидные грабли

    Пятая статья цикла о построении CDC-пайплайна с нуля. HDFS и Hive работают, но управлять ими через консоль неудобно. Сегодня поднимаем веб-интерфейс Hue и разбираемся, почему в 2026 году сборка из исходников требует Python 2.7.

    habr.com/ru/articles/996646/

    #hue #hadoop #hive #postgresql #python #filesystem

  16. Hue для домашнего Hadoop: Docker, CSRF и неочевидные грабли

    Пятая статья цикла о построении CDC-пайплайна с нуля. HDFS и Hive работают, но управлять ими через консоль неудобно. Сегодня поднимаем веб-интерфейс Hue и разбираемся, почему в 2026 году сборка из исходников требует Python 2.7.

    habr.com/ru/articles/996646/

    #hue #hadoop #hive #postgresql #python #filesystem

  17. HDFS и Hive для CDC: строим хранилище данных в домашней лаборатории

    Четвёртая статья цикла о построении CDC-пайплайна с нуля. Данные уже текут из PostgreSQL в Kafka — пора их куда-то складывать. Сегодня поднимаем Hadoop и Hive, и разбираемся, почему Hive 3.1.3 не дружит с Java 11.

    habr.com/ru/articles/994062/

    #hadoop #hive #sql #postgresql #cdc #logical_replication #devops #data_engineering

  18. HDFS и Hive для CDC: строим хранилище данных в домашней лаборатории

    Четвёртая статья цикла о построении CDC-пайплайна с нуля. Данные уже текут из PostgreSQL в Kafka — пора их куда-то складывать. Сегодня поднимаем Hadoop и Hive, и разбираемся, почему Hive 3.1.3 не дружит с Java 11.

    habr.com/ru/articles/994062/

    #hadoop #hive #sql #postgresql #cdc #logical_replication #devops #data_engineering

  19. HDFS и Hive для CDC: строим хранилище данных в домашней лаборатории

    Четвёртая статья цикла о построении CDC-пайплайна с нуля. Данные уже текут из PostgreSQL в Kafka — пора их куда-то складывать. Сегодня поднимаем Hadoop и Hive, и разбираемся, почему Hive 3.1.3 не дружит с Java 11.

    habr.com/ru/articles/994062/

    #hadoop #hive #sql #postgresql #cdc #logical_replication #devops #data_engineering

  20. So apparently, if you're still using #Hadoop in 2014, congrats on your commitment to #nostalgia. 🎩 Why waste time on 235 elephants when a single command-line #ninja can do the job faster? 🚀✨ Enjoy your #EMR toy, but maybe keep that "cool article" on the backburner for when you need a chuckle. 😂
    adamdrake.com/command-line-too #CommandLine #Humor #TechTrends #HackerNews #ngated

  21. So apparently, if you're still using #Hadoop in 2014, congrats on your commitment to #nostalgia. 🎩 Why waste time on 235 elephants when a single command-line #ninja can do the job faster? 🚀✨ Enjoy your #EMR toy, but maybe keep that "cool article" on the backburner for when you need a chuckle. 😂
    adamdrake.com/command-line-too #CommandLine #Humor #TechTrends #HackerNews #ngated

  22. So apparently, if you're still using #Hadoop in 2014, congrats on your commitment to #nostalgia. 🎩 Why waste time on 235 elephants when a single command-line #ninja can do the job faster? 🚀✨ Enjoy your #EMR toy, but maybe keep that "cool article" on the backburner for when you need a chuckle. 😂
    adamdrake.com/command-line-too #CommandLine #Humor #TechTrends #HackerNews #ngated

  23. So apparently, if you're still using #Hadoop in 2014, congrats on your commitment to #nostalgia. 🎩 Why waste time on 235 elephants when a single command-line #ninja can do the job faster? 🚀✨ Enjoy your #EMR toy, but maybe keep that "cool article" on the backburner for when you need a chuckle. 😂
    adamdrake.com/command-line-too #CommandLine #Humor #TechTrends #HackerNews #ngated

  24. So apparently, if you're still using #Hadoop in 2014, congrats on your commitment to #nostalgia. 🎩 Why waste time on 235 elephants when a single command-line #ninja can do the job faster? 🚀✨ Enjoy your #EMR toy, but maybe keep that "cool article" on the backburner for when you need a chuckle. 😂
    adamdrake.com/command-line-too #CommandLine #Humor #TechTrends #HackerNews #ngated

  25. Искусственный интеллект без иллюзий: как не сжечь бюджет компании на хайпе (Часть 2)

    Это вторая часть цикла публикаций, где мы говорим не о теории искусственного интеллекта, а о суровой реальности его внедрения в бизнес. В первой части мы обсуждали стратегические ловушки ( habr.com/ru/articles/969094/ ), а теперь настал черед уровня данных, который оказался для нас минным полем.

    habr.com/ru/articles/974288/

    #llm #hadoop #data_mesh

  26. Искусственный интеллект без иллюзий: как не сжечь бюджет компании на хайпе (Часть 2)

    Это вторая часть цикла публикаций, где мы говорим не о теории искусственного интеллекта, а о суровой реальности его внедрения в бизнес. В первой части мы обсуждали стратегические ловушки ( habr.com/ru/articles/969094/ ), а теперь настал черед уровня данных, который оказался для нас минным полем.

    habr.com/ru/articles/974288/

    #llm #hadoop #data_mesh

  27. Искусственный интеллект без иллюзий: как не сжечь бюджет компании на хайпе (Часть 2)

    Это вторая часть цикла публикаций, где мы говорим не о теории искусственного интеллекта, а о суровой реальности его внедрения в бизнес. В первой части мы обсуждали стратегические ловушки ( habr.com/ru/articles/969094/ ), а теперь настал черед уровня данных, который оказался для нас минным полем.

    habr.com/ru/articles/974288/

    #llm #hadoop #data_mesh

  28. Файловое хранилище Wildberries: бескомпромиссный HighLoad

    Привет, меня зовут Иван Волков, я CTO продукта CDN MediaBasket в Wildberries. Это большое распределенное файловое хранилище, используемое различными внутренними продуктами Wildberries. Одним из продуктов, с которым взаимодействуют внешние клиенты, является каталог товаров. Это ставит перед хранилищем высокую планку по оптимизации и готовности к экстремальным нагрузкам. В этой статье я расскажу, какие решения мы использовали в архитектуре продукта и как при миллионном RPS мы доставляем картинки пользователям за считанные миллисекунды.

    habr.com/ru/companies/wildberr

    #файловое_хранилище #шардирование #шардинг #highload #хайлоад #схд #ceph #hadoop #wildberries #drpaster

  29. Файловое хранилище Wildberries: бескомпромиссный HighLoad

    Привет, меня зовут Иван Волков, я CTO продукта CDN MediaBasket в Wildberries. Это большое распределенное файловое хранилище, используемое различными внутренними продуктами Wildberries. Одним из продуктов, с которым взаимодействуют внешние клиенты, является каталог товаров. Это ставит перед хранилищем высокую планку по оптимизации и готовности к экстремальным нагрузкам. В этой статье я расскажу, какие решения мы использовали в архитектуре продукта и как при миллионном RPS мы доставляем картинки пользователям за считанные миллисекунды.

    habr.com/ru/companies/wildberr

    #файловое_хранилище #шардирование #шардинг #highload #хайлоад #схд #ceph #hadoop #wildberries #drpaster

  30. Файловое хранилище Wildberries: бескомпромиссный HighLoad

    Привет, меня зовут Иван Волков, я CTO продукта CDN MediaBasket в Wildberries. Это большое распределенное файловое хранилище, используемое различными внутренними продуктами Wildberries. Одним из продуктов, с которым взаимодействуют внешние клиенты, является каталог товаров. Это ставит перед хранилищем высокую планку по оптимизации и готовности к экстремальным нагрузкам. В этой статье я расскажу, какие решения мы использовали в архитектуре продукта и как при миллионном RPS мы доставляем картинки пользователям за считанные миллисекунды.

    habr.com/ru/companies/wildberr

    #файловое_хранилище #шардирование #шардинг #highload #хайлоад #схд #ceph #hadoop #wildberries #drpaster

  31. Data Science Roadmap 2025 | Become a Data Scientist from Scratch! #datascienceinstitute #hadoop

    Data Science Roadmap 2025 | Become a Data Scientist from Scratch! --- Description: Want to become a Data Scientist in 2025? source

    quadexcel.com/wp/data-science-

  32. Data Science Roadmap 2025 | Become a Data Scientist from Scratch! #datascienceinstitute #hadoop

    Data Science Roadmap 2025 | Become a Data Scientist from Scratch! --- Description: Want to become a Data Scientist in 2025? source

    quadexcel.com/wp/data-science-

  33. Добавляем MapReduce в этот наш SQL: генераторы на основе курсоров

    Вот уже который год я потихоньку разрабатываю SQL-ный движок на основе Apache Spark, специализированный под задачи ETL. И хотя диалект языка изначально называется «Transform Definition Language», писать трансформации данных непосредственно на нём самом было до сих пор невозможно. Вместо этого на фазе Transform предполагалось использовать подключаемые модули, которые рантайм интерпретатора предоставляет из Java classpath. Это очень эффективный с точки зрения производительности, но довольно долгий с точки зрения внедрения, и дорогой в разработке способ. Сначала трансформацию надо описать формально в виде статьи-whitepaper'а (это делает data scientist), потом написать прототип на Python (ответственность data analyst), отладиться на сэмпле реальных данных (тоже аналитик), и тогда уже делать и оптимизировать финальную имплементацию на Java с использованием низкоуровневого API Spark (собственно, задача разработчика). Неудобно. Нельзя ли его как-нибудь сократить? Например, дать аналитикам инструмент для написания трансформаций непосредственно в самом SQL, вынеся некоторую часть функциональности MapReduce как разновидность итерирующих функций? Можно, конечно! Давайте узнаем, как именно

    habr.com/ru/articles/958362/

    #sql #etl #apache_spark #java #hadoop #big_data #big_data_solutions #big_data_tools #интерпретатор

  34. Добавляем MapReduce в этот наш SQL: генераторы на основе курсоров

    Вот уже который год я потихоньку разрабатываю SQL-ный движок на основе Apache Spark, специализированный под задачи ETL. И хотя диалект языка изначально называется «Transform Definition Language», писать трансформации данных непосредственно на нём самом было до сих пор невозможно. Вместо этого на фазе Transform предполагалось использовать подключаемые модули, которые рантайм интерпретатора предоставляет из Java classpath. Это очень эффективный с точки зрения производительности, но довольно долгий с точки зрения внедрения, и дорогой в разработке способ. Сначала трансформацию надо описать формально в виде статьи-whitepaper'а (это делает data scientist), потом написать прототип на Python (ответственность data analyst), отладиться на сэмпле реальных данных (тоже аналитик), и тогда уже делать и оптимизировать финальную имплементацию на Java с использованием низкоуровневого API Spark (собственно, задача разработчика). Неудобно. Нельзя ли его как-нибудь сократить? Например, дать аналитикам инструмент для написания трансформаций непосредственно в самом SQL, вынеся некоторую часть функциональности MapReduce как разновидность итерирующих функций? Можно, конечно! Давайте узнаем, как именно

    habr.com/ru/articles/958362/

    #sql #etl #apache_spark #java #hadoop #big_data #big_data_solutions #big_data_tools #интерпретатор

  35. Добавляем MapReduce в этот наш SQL: генераторы на основе курсоров

    Вот уже который год я потихоньку разрабатываю SQL-ный движок на основе Apache Spark, специализированный под задачи ETL. И хотя диалект языка изначально называется «Transform Definition Language», писать трансформации данных непосредственно на нём самом было до сих пор невозможно. Вместо этого на фазе Transform предполагалось использовать подключаемые модули, которые рантайм интерпретатора предоставляет из Java classpath. Это очень эффективный с точки зрения производительности, но довольно долгий с точки зрения внедрения, и дорогой в разработке способ. Сначала трансформацию надо описать формально в виде статьи-whitepaper'а (это делает data scientist), потом написать прототип на Python (ответственность data analyst), отладиться на сэмпле реальных данных (тоже аналитик), и тогда уже делать и оптимизировать финальную имплементацию на Java с использованием низкоуровневого API Spark (собственно, задача разработчика). Неудобно. Нельзя ли его как-нибудь сократить? Например, дать аналитикам инструмент для написания трансформаций непосредственно в самом SQL, вынеся некоторую часть функциональности MapReduce как разновидность итерирующих функций? Можно, конечно! Давайте узнаем, как именно

    habr.com/ru/articles/958362/

    #sql #etl #apache_spark #java #hadoop #big_data #big_data_solutions #big_data_tools #интерпретатор

  36. Бенчмарк бенчмарка Lakehouse-движков, в котором побеждает объективная реальность

    Недавно на хабре вышла статья с громким заголовком “Бенчмарк lakehouse-движков, часть 1: StarRocks и Doris падают под нагрузкой, Presto аутсайдер, CedrusData быстрее всех”. В своей статье авторы из Кверифай Лабс выбрали методику TPC-DS, но вместо 99 запросов остановилась на одном, который к тому же запускается на одной машине. Обосновывается это тем, что на одном конкретном запросе нужно разобрать работу оптимизаторов. По результатам исследования делается вывод, что решение, разработанное авторами, является лучшим, в том числе для запуска одного конкретного запроса на одном узле. Давайте попробуем разобраться, действительно ли это так.

    habr.com/ru/companies/datasapi

    #starrocks #trino #impala #mpp #bigdata #dwh #lakehouse #datalake #s3 #hadoop

  37. Бенчмарк бенчмарка Lakehouse-движков, в котором побеждает объективная реальность

    Недавно на хабре вышла статья с громким заголовком “Бенчмарк lakehouse-движков, часть 1: StarRocks и Doris падают под нагрузкой, Presto аутсайдер, CedrusData быстрее всех”. В своей статье авторы из Кверифай Лабс выбрали методику TPC-DS, но вместо 99 запросов остановилась на одном, который к тому же запускается на одной машине. Обосновывается это тем, что на одном конкретном запросе нужно разобрать работу оптимизаторов. По результатам исследования делается вывод, что решение, разработанное авторами, является лучшим, в том числе для запуска одного конкретного запроса на одном узле. Давайте попробуем разобраться, действительно ли это так.

    habr.com/ru/companies/datasapi

    #starrocks #trino #impala #mpp #bigdata #dwh #lakehouse #datalake #s3 #hadoop

  38. Бенчмарк бенчмарка Lakehouse-движков, в котором побеждает объективная реальность

    Недавно на хабре вышла статья с громким заголовком “Бенчмарк lakehouse-движков, часть 1: StarRocks и Doris падают под нагрузкой, Presto аутсайдер, CedrusData быстрее всех”. В своей статье авторы из Кверифай Лабс выбрали методику TPC-DS, но вместо 99 запросов остановилась на одном, который к тому же запускается на одной машине. Обосновывается это тем, что на одном конкретном запросе нужно разобрать работу оптимизаторов. По результатам исследования делается вывод, что решение, разработанное авторами, является лучшим, в том числе для запуска одного конкретного запроса на одном узле. Давайте попробуем разобраться, действительно ли это так.

    habr.com/ru/companies/datasapi

    #starrocks #trino #impala #mpp #bigdata #dwh #lakehouse #datalake #s3 #hadoop

  39. Тестирование движков массивно-параллельных вычислений: StarRocks, Trino, Spark. Spark – с DataFusion Comet и Impala

    В сегодняшней, уже третьей по счету, публикации я продолжу делится результатами нагрузочных испытаний вычислительных технологий массивных параллельных вычислений (на Habr уже представлены мои материалы, посвященные сравнению Impala, Trino и Greenplum , в том числе по методике TPC-DS ). В этот раз в список решений добавляется Spark, включая работающий с технологией нативных вычислений DataFusion Comet, и набирающий популярность StarRocks.

    habr.com/ru/companies/datasapi

    #starrocks #trino #lakehouse #impala #spark #bigdata #datalake #dwh #hadoop #s3

  40. Тестирование движков массивно-параллельных вычислений: StarRocks, Trino, Spark. Spark – с DataFusion Comet и Impala

    В сегодняшней, уже третьей по счету, публикации я продолжу делится результатами нагрузочных испытаний вычислительных технологий массивных параллельных вычислений (на Habr уже представлены мои материалы, посвященные сравнению Impala, Trino и Greenplum , в том числе по методике TPC-DS ). В этот раз в список решений добавляется Spark, включая работающий с технологией нативных вычислений DataFusion Comet, и набирающий популярность StarRocks.

    habr.com/ru/companies/datasapi

    #starrocks #trino #lakehouse #impala #spark #bigdata #datalake #dwh #hadoop #s3

  41. Тестирование движков массивно-параллельных вычислений: StarRocks, Trino, Spark. Spark – с DataFusion Comet и Impala

    В сегодняшней, уже третьей по счету, публикации я продолжу делится результатами нагрузочных испытаний вычислительных технологий массивных параллельных вычислений (на Habr уже представлены мои материалы, посвященные сравнению Impala, Trino и Greenplum , в том числе по методике TPC-DS ). В этот раз в список решений добавляется Spark, включая работающий с технологией нативных вычислений DataFusion Comet, и набирающий популярность StarRocks.

    habr.com/ru/companies/datasapi

    #starrocks #trino #lakehouse #impala #spark #bigdata #datalake #dwh #hadoop #s3

  42. Сокращаем трудозатраты при выводе витрин на Hadoop

    Привет, друзья! Я Олег Васильев, владелец продукта Dream DE. В этой статье расскажу, как мы научились быстро и эффективно выводить витрины на Hadoop в эксплуатацию, или как мы за один квартал вывели 26 инициатив в рабочую среду силами четырёх инженеров по данным.

    habr.com/ru/companies/sberbank

    #витрины_данных #hadoop #прототипы

  43. Сокращаем трудозатраты при выводе витрин на Hadoop

    Привет, друзья! Я Олег Васильев, владелец продукта Dream DE. В этой статье расскажу, как мы научились быстро и эффективно выводить витрины на Hadoop в эксплуатацию, или как мы за один квартал вывели 26 инициатив в рабочую среду силами четырёх инженеров по данным.

    habr.com/ru/companies/sberbank

    #витрины_данных #hadoop #прототипы

  44. Сокращаем трудозатраты при выводе витрин на Hadoop

    Привет, друзья! Я Олег Васильев, владелец продукта Dream DE. В этой статье расскажу, как мы научились быстро и эффективно выводить витрины на Hadoop в эксплуатацию, или как мы за один квартал вывели 26 инициатив в рабочую среду силами четырёх инженеров по данным.

    habr.com/ru/companies/sberbank

    #витрины_данных #hadoop #прототипы

  45. Spark 4.0 на горизонте: Готовимся к апгрейду или остаёмся на проверенном 3.0?

    Привет, Хабр! Я Станислав Габдулгазиев, архитектор департамента поддержки продаж Arenadata. Кажется, ещё вчера мы радовались возможностям Apache Spark 3.0 , разбирались с Adaptive Query Execution и наслаждались улучшениями Pandas API . Но мир больших данных не стоит на месте, и вот уже на подходе Apache Spark 4.0 . Новый мажорный релиз — это всегда событие: он обещает новые фичи, прирост производительности и, конечно же, новые вызовы при миграции. Apache Spark де-факто стал стандартом для распределённой обработки данных. От классических ETL-пайплайнов и SQL-аналитики до сложного машинного обучения и стриминга — Spark так или иначе задействован во многих современных data-платформах. Поэтому каждый новый релиз вызывает живой интерес у комьюнити: что там под капотом? Какие проблемы решены? Не сломается ли то, что работало годами?

    habr.com/ru/companies/arenadat

    #spark #data_science #data_engineering #bigdata #sql #lakehouse #datalake #хранение_данных #hadoop #производительность

  46. Spark 4.0 на горизонте: Готовимся к апгрейду или остаёмся на проверенном 3.0?

    Привет, Хабр! Я Станислав Габдулгазиев, архитектор департамента поддержки продаж Arenadata. Кажется, ещё вчера мы радовались возможностям Apache Spark 3.0 , разбирались с Adaptive Query Execution и наслаждались улучшениями Pandas API . Но мир больших данных не стоит на месте, и вот уже на подходе Apache Spark 4.0 . Новый мажорный релиз — это всегда событие: он обещает новые фичи, прирост производительности и, конечно же, новые вызовы при миграции. Apache Spark де-факто стал стандартом для распределённой обработки данных. От классических ETL-пайплайнов и SQL-аналитики до сложного машинного обучения и стриминга — Spark так или иначе задействован во многих современных data-платформах. Поэтому каждый новый релиз вызывает живой интерес у комьюнити: что там под капотом? Какие проблемы решены? Не сломается ли то, что работало годами?

    habr.com/ru/companies/arenadat

    #spark #data_science #data_engineering #bigdata #sql #lakehouse #datalake #хранение_данных #hadoop #производительность

  47. Spark 4.0 на горизонте: Готовимся к апгрейду или остаёмся на проверенном 3.0?

    Привет, Хабр! Я Станислав Габдулгазиев, архитектор департамента поддержки продаж Arenadata. Кажется, ещё вчера мы радовались возможностям Apache Spark 3.0 , разбирались с Adaptive Query Execution и наслаждались улучшениями Pandas API . Но мир больших данных не стоит на месте, и вот уже на подходе Apache Spark 4.0 . Новый мажорный релиз — это всегда событие: он обещает новые фичи, прирост производительности и, конечно же, новые вызовы при миграции. Apache Spark де-факто стал стандартом для распределённой обработки данных. От классических ETL-пайплайнов и SQL-аналитики до сложного машинного обучения и стриминга — Spark так или иначе задействован во многих современных data-платформах. Поэтому каждый новый релиз вызывает живой интерес у комьюнити: что там под капотом? Какие проблемы решены? Не сломается ли то, что работало годами?

    habr.com/ru/companies/arenadat

    #spark #data_science #data_engineering #bigdata #sql #lakehouse #datalake #хранение_данных #hadoop #производительность

  48. От реляционных СУБД к экосистеме Hadoop

    Привет, Хабр! Недавно я понял, что не знаю, что такое Hadoop. (На этом моменте становится понятно, что данная статья ориентирована на людей, которые не имеют экспертизы и реального опыта взаимодействия с продуктами экосистемы Hadoop) Сам я являюсь разработчиком, и ежедневно взаимодействую с различными СУБД – в основном, с пресловутой PostgreSQL. Каково же было мое удивление, когда я узнал, что на проде в эту БД данные попадают не напрямую – а с какого-то Greenplum, а туда они, в свою очередь, приходят с некоего Hadoop. В этот момент я решил узнать, чем обоснована необходимость использования этих инструментов и что они из себя представляют.

    habr.com/ru/articles/939520/

    #Hadoop #yarn #spark #рбд #rdbms #olap

  49. От реляционных СУБД к экосистеме Hadoop

    Привет, Хабр! Недавно я понял, что не знаю, что такое Hadoop. (На этом моменте становится понятно, что данная статья ориентирована на людей, которые не имеют экспертизы и реального опыта взаимодействия с продуктами экосистемы Hadoop) Сам я являюсь разработчиком, и ежедневно взаимодействую с различными СУБД – в основном, с пресловутой PostgreSQL. Каково же было мое удивление, когда я узнал, что на проде в эту БД данные попадают не напрямую – а с какого-то Greenplum, а туда они, в свою очередь, приходят с некоего Hadoop. В этот момент я решил узнать, чем обоснована необходимость использования этих инструментов и что они из себя представляют.

    habr.com/ru/articles/939520/

    #Hadoop #yarn #spark #рбд #rdbms #olap