#kvcache — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #kvcache, aggregated by home.social.
-
Как устроена токеномика — экономика мира ИИ
Долгое время разработчики жили в парадигме « закон Мура все исправит, а применительно для ИИ сделает вычисления вообще бесплатными». Серьезный сдвиг в ИТ-индустрии, произошедший на рубеже 2025–2026 годов показал нечто иное. Благодаря прошлому опыту разработчики ПО привыкли к тому, что масштабировать цифровой продукт относительно легко: вы пишете код один раз, а затраты на каждого нового пользователя падают почти до незначительных затрат. В мире генеративного ИИ все уперлось в физическую и экономическую стоимость каждого отдельного токена, а их расход по ряду причин оказался очень далек от оптимального. В эпоху генеративных моделей токен превратился в универсальную меру вычислений, точный аналог «киловатт-часа» для энергетика или «кубометра газа» для промышленника. Это фундаментальная расчетная единица, которая связала стоимость видеокарт, гигаватты электричества, многомиллионные инвестиции и строчки текста, которые получают пользователи. И она отличается от того, к чему мы привыкли. Если в классической SaaS-модели стоимость обслуживания каждого последующего пользователя уменьшается, то в мире LLM стоимость запроса почти не меняется, а с большими объемами начинает расти. Чтобы понять, как устроена эта «банковская система» цифровой эпохи, почему одни «буквы» стоят дороже других и что оптимальнее — корпоративный сервер или подписка на облачный сервис или серверная стойка, нам придется спуститься на уровень базовой логики работы ИИ и разобрать анатомию ее работы применительно к затратам.
https://habr.com/ru/companies/ru_mts/articles/1074100/
#Токеномика #finops #Llm #slm #себестоимость_ии #физика_инференса #kvcache #deepseek #амортизация_gpu #kimi_k3
-
Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег
Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не введение в трансформеры. Что вы унесёте: историю пяти последовательных конфигураций с тем, что каждая дала и чего стоила; рабочий набор флагов vLLM под одну карту Blackwell; три неочевидных бага и обходы; разбор реального счёта с отношением вход/выход 452:1. Главный вывод, если дальше читать некогда: на агентской нагрузке кэш префикса решает больше, чем выбор модели, размер карты и всё остальное вместе взятое. Мы шли к этому через четыре промежуточных стенда и потратили лишние месяцы, потому что не понимали, что именно меряем.
https://habr.com/ru/articles/1073300/
#vLLM #LiteLLM #prefix_caching #KVcache #локальные_LLM #инференс_LLM #Qwen #агентская_разработка #RTX_PRO_6000 #claude
-
Learn the difference between KV Cache and Prompt Cache, how each speeds up LLM inference, and how developers can improve cache reuse. https://hackernoon.com/prompt-cache-vs-kv-cache-for-llms #kvcache
-
Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация
На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему большинство генеративных LLM используют decoder-only архитектуру, чем LLaMA отличается от ванильного Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и GQA. Почему инференс LLM дорогой и какие оптимизации помогают его ускорять: fused kernels, FlashAttention, KV-cache и PagedAttention, continuous batching, speculative decoding, квантизация и дистилляция. Много схем и картинок, а также полный список вопросов с собесов в конце.
https://habr.com/ru/articles/1068944/
#LLM #архитектура_LLM #инференс_LLM #ускорение_LLM #оптимизация_LLM #Transformer #FlashAttention #KVcache #квантизация_LLM #Mixture_of_Experts
-
Инференс LLM: от KV-кэша до продакшен-деплоя
Привет! Я Саша Рыжов, MLOps-инженер в hh.ru , уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед.
-
Походка за двадцать минут и миллион рублей: что RL сделал с двуногими роботами и во что упёрся их «мозг»
За один 2026 год двуногие роботы успели пробежать полумарафон быстрее человеческого рекорда, довести публику до того, что CEO пришлось резать роботу ногу ножницами прямо на сцене, и провалить задачу «пройтись ровно» на презентации за миллионы долларов. Разбираю с первоисточниками, почему походка стала дешёвой инженерией — 20 минут на одной видеокарте, — а «живой» робот упирается в ватты, переполняющийся контекст и отсутствие непрерывного обучения.
https://habr.com/ru/articles/1057816/
#reinforcement_learning #RLлокомоция #гуманоидные_роботы #simtoreal #Isaac_Lab #VLAмодели #PPO #world_models #робототехника #KVcache
-
Почему дорогая LLM дороже: экономика инференса, которую видно в твоём 5-часовом лимите
Каждый из вас, кто работал с Claude или с ChatGPT, смотрел на свои лимиты Или задавался вопросом «Да как один запрос съел 10% от лимита» Я потратил неделю на то, чтобы разобраться в том, а что вообще отображают эти лимиты И на свет появилась третья статья из моей серии «А как вообще работают современные LLM» После этой статьи ты разберёшься, что скрыто за 5-часовым лимитом Claude и других LLM и как на этом можно экономить. А еще — из каких примитивов состоят лимиты и какая физика вычислений за этим стоит Ну а если работаешь с моделями по API, то вообще пушка бомба Осторожно: после прочтения вы не сможете смотреть на полоску лимитов как прежде 🥵 Че там Че там 👀
https://habr.com/ru/articles/1055054/
#LLM #MoE #activeпараметры #KVcache #инференс_LLM #outputтокены #reasoningтокены #VRAM #claude_code #codex
-
Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching
В первой части я вывел одно правило и предложил жить по нему: стабильное в начало, изменчивое в хвост , один символ в системном промпте обнуляет весь кэш. Правило рабочее, я сам собираю агента вокруг него. Но жить по закону, которого не понимаешь, неуютно. vLLM и paged attention я руками не писал, зато исходники открыты, и я полез в них за байтовой причиной. Что физически лежит на GPU в момент попадания в кэш, как движок управляет этой памятью и почему хватает одного символа, чтобы всё посыпалось.
https://habr.com/ru/articles/1054410/
#prompt_caching #KVcache #prefix_caching #PagedAttention #vLLM #LLM #инференс_LLM #GPU #prefill #оптимизация
-
Контекстное окно: почему нейросеть забывает части разговора
Представьте, что вы разговариваете с невероятно умным и эрудированным собеседником. Только очень странным. Несмотря на весь свой интеллект и тысячи фактов, которые он легко и непринужденно рассказывает, он не может ничего запомнить. Ваш диалог с ним каждый раз как бы начинается заново. Вы даете ему вводные, задаете вопросы, что-то уточняете, а он, на основе всего этого, выдает ответ. Однако, стоит вам задать следующий вопрос, как собеседник напрочь забывает все, о чем вы говорили. И чтобы отвечать более-менее связно, ему приходится сначала перечитать весь ваш диалог. Звучит странно? Возможно. Однако именно так работает большинство современных LLM. А разработчики, пытаясь нивелировать эту особенность, добавляют нейронкам различные обвязки и ухищрения, заметно усложняя логику для рядового пользователя. Чтобы лучше понимать, что происходит, давайте погрузимся в тему. И подробнее познакомимся с такой штукой, как «контекстное окно».
https://habr.com/ru/companies/bothub/articles/1047194/
#контекст #контекстное_окно #LLM #SelfAttention #токен #Lost_in_the_Middle #RAG #KVcache #нейросеть #вектор
-
🤖 Ah, the age-old question: Can I buy your KV cache? Because nothing says cutting-edge research like soliciting for key-value storage with the enthusiasm of a telemarketer. 📞 It's like a dating app for databases, but without the personality. 💾💔
https://arxiv.org/abs/2606.13361 #KVcache #Telemarketing #DatabaseResearch #TechHumor #DataStorage #HackerNews #ngated