home.social

#mapreduce — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #mapreduce, aggregated by home.social.

fetched live
  1. Как заставить LLM проанализировать хранилище из тысяч заметок, которое не влезает в контекст

    У меня в Obsidian накопилось под две тысячи заметок. Ежедневники, конспекты, обрывки идей, недописанные черновики. Граф‑вью честно показывает мне облако точек: красиво, но бесполезно. Какие заметки висят сиротами без единой связи, какие дублируют друг друга под разными тегами, какие кластеры тем так и не соединились, из графа не вытащить. Очевидная мысль: «отдам всё LLM, пусть разберётся». Но 2000 заметок это миллионы токенов. Ни в один контекст это не влезает, а если бы и влезло, стоило бы как крыло самолёта и утонуло бы в шуме. Так появился идея по созданию Vault Audit AI , плагин для Obsidian, который проводит аудит хранилища через LLM: находит сироты, кластеризует темы, предлагает теги и связи. Я его опубликовал в официальном каталоге и выложил на GitHub . В этой статье разберу инженерную начинку: как обойти лимит контекста через MapReduce, как не платить за повторный анализ, как абстрагировать четырёх LLM‑провайдеров под одним интерфейсом, и что пришлось переделать, чтобы пройти автоматическое ревью каталога. Код на TypeScript, фрагменты настоящие (слегка почищены от обёрток локализации ради читаемости).

    habr.com/ru/articles/1053366/

    #Obsidian #LLM #MapReduce #плагин #TypeScript #OpenRouter #Ollama #аудит_базы_знаний #RAG

  2. #ITByte: #MapReduce is a programming model and framework designed for processing large datasets in a parallel and distributed manner.

    It's particularly useful for tasks that can be broken down into smaller, independent pieces.

    knowledgezone.co.in/posts/What

  3. #ITByte: #MapReduce is a programming model and framework designed for processing large datasets in a parallel and distributed manner.

    It's particularly useful for tasks that can be broken down into smaller, independent pieces.

    knowledgezone.co.in/posts/What

  4. Как мы ускорили сбор аудиторий в 45 раз: с 6 минут до нескольких секунд

    К маю 2026 года средний сбор аудитории в нашей системе занимал 2 часа 50 минут. Проблема состояла из двух частей. Первая: 96.5% этого времени процесс стоял в очереди. Вторая: даже добравшись до исполнения, расчёт занимал 6 минут — десятки задач внутри DAG выполнялись над множествами в миллионы строк, и основным инструментом были JOIN. Мы последовательно устранили обе проблемы — 20 изменений, разбитых на шесть этапов. Ниже описан каждый шаг и итоговый результат. Все числа «до» и «после» получены одним и тем же SQL‑запросом по Postgres — это воспроизводимый замер. Домен обобщён: конкретная компания не имеет значения. Это платформа, которая по булевым условиям («траты > 5000 ₽ за последние 3 месяца» И «покупки в категории Рестораны ») собирает множество клиентских идентификаторов из 10-миллионной базы и доставляет его во внешние системы. Погрузиться

    habr.com/ru/articles/1045282/

    #java #kotlin #kotlin_coroutines #kotlin_native #s3 #clickhouse #batching #mapreduce

  5. 🚀✨ Behold, the thrilling tale of querying 3 billion vectors—a journey where Vicki Boykis heroically attempts to decode Jeff Dean's cryptic wisdom on #mapreduce. Spoiler: It's basically a nerdy treasure hunt for semantically similar items, but with more floating-point numbers than your brain can handle. 💻🧠
    vickiboykis.com/2026/02/21/que #HackerNews #VickiBoykis #treasureHunt #techJourney #floatingPoint #HackerNews #ngated

  6. 🚀✨ Behold, the thrilling tale of querying 3 billion vectors—a journey where Vicki Boykis heroically attempts to decode Jeff Dean's cryptic wisdom on #mapreduce. Spoiler: It's basically a nerdy treasure hunt for semantically similar items, but with more floating-point numbers than your brain can handle. 💻🧠
    vickiboykis.com/2026/02/21/que #HackerNews #VickiBoykis #treasureHunt #techJourney #floatingPoint #HackerNews #ngated

  7. ✅ Summary: Turning Data into Knowledge

    Map-Reduce for length, Prompt Chain for depth, and Dynamic Prompting for adaptability.
    We push LLM potential to the limit.

    Next: **3.3 RAG and Semantic Search**.
    When you have 1000 videos, how do you find that exact second you need? 🚀

    #BibiGPT #MapReduce #LLM #AIPrompt #SaaS

  8. ✅ 总结:从原始数据到结构化知识

    通过 Map-Reduce 解决长度,Prompt Chain 解决深度,Dynamic Prompting 解决适应性。
    BibiGPT 将 LLM 的潜力发挥到了极致。

    下一站:**3.3 RAG 与语义搜索**。
    当你有 1000 个视频时,如何瞬间找到你想看的那一秒?🚀

    #BibiGPT #MapReduce #LLM #AIPrompt #SaaS

  9. Обучаем ML-модели и запускаем batch-инференс на YTsaurus, как в Яндексе

    Привет! Меня зовут Алексей Архипенко, я руковожу группой разработки ML‑инфраструктуры в команде YTsaurus. Мы часть Yandex Infrastructure и предоставляем пользователям внутри Яндекса инфраструктурный фундамент для самых разных задач машинного обучения. YTsaurus — основная платформа для хранения и обработки данных Яндекса, которая доступна на GitHub под лицензией Apache 2.0. Это позволяет всем желающим загрузить систему на свои серверы, а также дорабатывать её под свои нужды. Мы уже писали в прошлых постах про её выход в опенсорс и дальнейшее развитие , а также кейсы использования в рекламе . Сегодня расскажу, как Яндекс запускает в ней почти все ML‑обучения и batch‑инференс.

    habr.com/ru/companies/yandex/a

    #ytsaurus #ml #batch_processing #gpu #gpu_вычисления #mapreduce #map_reduce

  10. Создаём мини-фреймворк для MapReduce в Scala с конкретной реализацией

    Статья демонстрирует построение минималистичного MapReduce-фреймворка на Scala для локальных экспериментов. Рассматриваются стадии Map , Shuffle и Reduce с ленивыми вычислениями через Iterator , а также абстракции ввода/вывода IO и локальные исполнители с виртуальными потоками.

    habr.com/ru/articles/966986/

    #MapReduce #Scala #java21 #многопоточность #функциональное_программирование #sbt #фреймворк #jvm #bigdata #data_engineering

  11. Распределенные вычисления в Apache Ignite 3

    В статье разбираются возможности распределённых вычислений в Apache Ignite 3 . Покажу, как развернуть кластер в Docker, задеплоить собственные джобы и сравнить Ignite 3 с предыдущей версией. Затронем новые возможности Ignite как полноценной распределённой платформы, а не просто in-memory кэша.

    habr.com/ru/articles/954928/

    #distributed_computing #распределённые_вычисления #colocated_computations #коллокационные_вычисления #inmemory_database #java #apache_ignite_3 #mapreduce

  12. #ITByte: #MapReduce is a programming model and framework designed for processing large datasets in a parallel and distributed manner.

    It's particularly useful for tasks that can be broken down into smaller, independent pieces.

    knowledgezone.co.in/posts/What

  13. #ITByte: #MapReduce is a programming model and framework designed for processing large datasets in a parallel and distributed manner.

    It's particularly useful for tasks that can be broken down into smaller, independent pieces.

    knowledgezone.co.in/posts/What

  14. Как мы заменили сотни Join’ов на один РТ-процессинг с 1kk RPS

    Как связаны скидки, пользовательские пути и огромные массивы данных в Яндекс Рекламе? Привет, Хабр! Меня зовут Максим Стаценко, я работаю с базами данных и яростно в них копаюсь с 2010 года, а в Big Data — с 2016. Сейчас работаю в Яндексе в DWH поиска и рекламы. Мы работаем с ОЧЕНЬ большими данными. Каждый день миллионы пользователей видят рекламу Яндекса, а наши системы обрабатывают огромные объёмы данных. Чтобы реклама работала эффективно, нам нужно в каждый момент времени иметь максимально полную информацию об истории жизни рекламного объявления, а значит нужно каким-то образом передавать данные от одного события к другому внутри рекламной воронки. Расскажу, как мы решали эту проблему.

    habr.com/ru/companies/oleg-bun

    #ytsaurus #mapreduce #olap #oltp #антифрод #распределенные_системы #оптимизация #обработка_данных #хранилища_данных

  15. Соединение SortMergeJoin в Apache Spark

    Рассмотрим, как реализован SortMergeJoin в Apache Spark, и заодно заглянем в исходный код на GitHub. Spark написан на языке Scala, и вся логика работы оператора доступна в открытом репозитории проекта. Вот здесь :) Первое, что рассмотрим - это конструктор кейс-класса 1. Конструктор SortMergeJoinExec

    habr.com/ru/companies/gnivc/ar

    #spark #join #hadoop #bigdata #mapreduce

  16. YTsaurus — два года в опенсорсе: чего мы достигли и куда движемся

    20 марта мы провели митап для пользователей YTsaurus — главной платформы для хранения и обработки больших данных в Яндексе от разработчиков из Yandex Infrastructure, которая уже успела зарекомендовать себя за пределами компании. Этот текст во многом основан на моем выступлении на митапе: я кратко расскажу, чего мы достигли, какие улучшения внесли и что ждёт пользователей в ближайшем будущем.

    habr.com/ru/companies/yandex/a

    #ytsaurus #map_reduce #mapreduce #большие_данные #big_data

  17. so, gonna write some stuff on #HDFS #MapReduce #yarn and maybe clustering. Also, #machinelearning was suggested but I think that may be too broad of a topic for this. I did cover Machine Learning in a blog back in 2023, but this time is for KB, not blog: openlogic.com/blog/using-cassa

    Hmm, perhaps some sort of ML performance (as in disk io, etc not accuracy) document would be good but still, where to even start.

    If anyone has beginner resources, I'll likely be pointing folks to some resources

  18. so, gonna write some stuff on #HDFS #MapReduce #yarn and maybe clustering. Also, #machinelearning was suggested but I think that may be too broad of a topic for this. I did cover Machine Learning in a blog back in 2023, but this time is for KB, not blog: openlogic.com/blog/using-cassa

    Hmm, perhaps some sort of ML performance (as in disk io, etc not accuracy) document would be good but still, where to even start.

    If anyone has beginner resources, I'll likely be pointing folks to some resources

  19. Новые динтаблицы: вторичные индексы, web assembly и ещё много улучшений к версии YTsaurus 24.1.0

    Динамические таблицы — это распределённая база данных, key‑value‑пары которой объединяются в привычные пользователям реляционных СУБД таблицы. В YTsaurus в них можно хранить огромные массивы данных, при этом их можно быстро читать — поэтому YTsaurus используют почти все сервисы Яндекса: Реклама, Маркет, Такси, даже Поиск при построении поисковой базы, и другие. Я руковожу службой разработки динамических таблиц в Yandex Infrastructure и раньше уже рассказывал , как мы оптимизировали чтение, улучшали выборку строк в SQL‑запросах и защищались от перегрузок. Сегодня вышла новая версия YTsaurus 24.1.0, в которой динамические таблицы получили ещё несколько долгожданных доработок. В статье расскажу про них подробнее.

    habr.com/ru/companies/yandex/a

    #ytsaurus #mapreduce #map_reduce #инфраструктура #большие_данные #big_data #алгоритмы

  20. The Hadoop ecosystem comprises various tools and frameworks designed to handle large-scale data processing and analytics. Let's discuss the core components, namely Hadoop, HBase, and Hive, along with other significant tools such as Pig, Sqoop, Flume, Oozie, and Zookeeper.

    linuxexpert.org/so-you-wanna-d

    #Hadoop #HBase #Hive #BigData #HadoopEcosystem #HDFS #MapReduce #YARN #Pig #Sqoop #Flume #Oozie #Zookeeper #DataProcessing #DataAnalytics #DataWarehousing #ETL #DataIngestion #Security

  21. The Hadoop ecosystem comprises various tools and frameworks designed to handle large-scale data processing and analytics. Let's discuss the core components, namely Hadoop, HBase, and Hive, along with other significant tools such as Pig, Sqoop, Flume, Oozie, and Zookeeper.

    linuxexpert.org/so-you-wanna-d

    #Hadoop #HBase #Hive #BigData #HadoopEcosystem #HDFS #MapReduce #YARN #Pig #Sqoop #Flume #Oozie #Zookeeper #DataProcessing #DataAnalytics #DataWarehousing #ETL #DataIngestion #Security

  22. Ускорение Python в 2 раза с помощью multiprocessing, async и MapReduce

    Python действительно может считаться относительно медленным языком программирования по сравнению с некоторыми другими языками, такими как C++ или Java. Однако, существуют различные библиотеки и инструменты, которые позволяют ускорить выполнение счетных задач в Python. Рассмотрим как можно ускорить анализ данных в 2 раза!

    habr.com/ru/articles/825206/

    #python3 #python #asyncio #async/await #multiprocessing #mapreduce

  23. #ITByte: #MapReduce is a programming model and framework designed for processing large datasets in a parallel and distributed manner.

    It's particularly useful for tasks that can be broken down into smaller, independent pieces.

    knowledgezone.co.in/posts/What

  24. #ITByte: #MapReduce is a programming model and framework designed for processing large datasets in a parallel and distributed manner.

    It's particularly useful for tasks that can be broken down into smaller, independent pieces.

    knowledgezone.co.in/posts/What

  25. ...and then you can have the joy of trying to track down #ByzantineErrors, just #YOLO living in anything-can-happen land.

    On the other hand, if you are using a bunch of #immutable vals and functions on those vals to work towards your solution, why, no one would fight -- there'd be nothing to fight over.

    So, IN THEORY, it'd be trivial to multitask this work, sharing it out to multiple CPU cores, or even to multiple servers via #MapReduce.

    8/

  26. On the other hand, if you are using a bunch of #immutable vals and functions on those vals to create new vals to work towards your solution, then none of those tasks running in parallel would fight -- there'd be nothing to fight over.

    So, IN THEORY, it'd be trivial to #MultiTask this work, sharing it out to multiple CPU cores, or even to multiple servers via #MapReduce.

    8/