home.social

#kv_cache — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #kv_cache, aggregated by home.social.

fetched live
  1. 3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать

    В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.

    habr.com/ru/companies/selectel

    #kv_cache #llm #llamacpp #sglang #vllm #selectel

  2. Как и зачем ускоряют LLM

    Мы знаем, что сегодняшние большие языковые модели основаны на архитектуре transformer , а самое важное понятие в трансформере это механизм attention . Вычисление attention происходит путем многократного произведения матриц. Но как модели с миллиардами параметров вычисляют эти матрицы? Почему генерация происходит так быстро? Как можно вычислить следующий токен, без многомиллионного перемножения? Сегодня вы узнаете об одном из самых важных понятий в современном ИИ — о KV cache . Мне нужны ответы!

    habr.com/ru/companies/bothub/a

    #kv_cache #cache #кеширование #ускорить_модель_ии #как_ускорить_ии #как_работает_kv_кеш #кеширование_llm #cache_llm #оптимизация_трансформера

  3. Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

    Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT, вероятнее всего, будет приятным. Но когда сервис неделю живет под реальной нагрузкой, начинаются проблемы: p99 растет, память утекает, а однажды прилетает OOM на запросе, который вчера проходил без проблем. Я Стас Погоржельский, технологический евангелист VK Cloud, неоднократно наблюдал этот сценарий в демонстрационных средах. Инференс редко выходит из строя сразу и явно; как правило, его работа постепенно ухудшается, оставаясь незаметной до достижения критического состояния. Ниже я разберу четыре механизма, приводящие к деградации производственной среды на длительном интервале: фрагментацию KV-кэша, нехватку памяти (OOM) при работе с длинным контекстом, блокировку очереди (head-of-line blocking) внутри батча и расхождение метрик p50 и p99. Для каждого случая опишу внутреннее поведение системы, способы воспроизведения проблемы и метрики, сигнализирующие о надвигающемся инциденте.

    habr.com/ru/companies/vktech/a

    #vk_cloud #llm_inference #kv_cache #gpu_memory #oom #latency_p99 #continuous_batching #paged_attention #vllm #tail_latency

  4. Сломанный кэш выглядит как рабочий: prompt caching для тех, кто строит LLM-агентов

    Кэш режет цену входных токенов в десять раз и держит юнит-экономику агентов, но ломается без единой ошибки в логах. Что на самом деле кэшируется, чем отличаются OpenAI, Anthropic и Google и как собрать промпт, который не убивает собственный кэш.

    habr.com/ru/articles/1048810/

    #prompt_caching #KV_cache #кэширование_контекста #LLMагенты #cache_control #Gemini_context_caching #cache_hit_rate #кэширование_промптов #промпткэш

  5. Калькулятор VRAM для локальных LLM: Какие модели ИИ запустятся у вас на компьютере?

    Когда я начал ковыряться с локальными LLM, главная боль была не в установке моделей, а в понимании, что вообще влезет в моё железо. Документация Hugging Face говорит “Llama 3.1 8B” — что это значит для моей видеокарты с 16 GB? А если хочу 32k контекст? А с Q4_K_M? Несколько недель назад мне попался open-source калькулятор whatmodelscanirun.ru. Прогнал его на трёх своих сетапах (4060 Ti, 3090, M2 Pro), сравнил предсказания с реальными запусками через llama.cpp и разобрался, как работает математика внутри. Спойлер: алгоритм правильный, но систематически переоценивает скорость на 15-25%.

    habr.com/ru/articles/1035862/

    #LLM #VRAM #llamacpp #локальные_модели #квантование #KV_cache #GQA #бенчмарк #GPU