#kvкэш — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #kvкэш, aggregated by home.social.
-
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.
https://habr.com/ru/articles/1081324/
#LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ
-
Контекст растёт, KV-кэш — нет: Qwen3.8-27B на ограниченной VRAM с CMF формате
Qwen3.8-27B в Q4TP занимает около 14,3 GB весов, но при длинном контексте упирается ещё и в KV-кэш. Для 16 full-attention слоёв этой гибридной модели FP16 KV-state растёт на 65 536 байт с каждым токеном: на 64K это около 4 ГиБ только для K/V. В экспериментальном режиме O(1) рантайм CMF заменяет растущий KV-кэш этих 16 слоёв фиксированным состоянием: четыре sink-токена, точное окно последних 128 токенов и 32 опорных представлений для дальней части. В использованном профиле GPU-state attention составляет 44,1 МиБ, и не увеличивается с длиной контекста.
https://habr.com/ru/articles/1080216/
#llm #qwen38 #kvcache #kvкэш #оптимизация #оптимизация_кода #cmf #cmf_формат
-
Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле
Разговор повторяется раз в месяц: платим за API прилично, может, купим свою карту? Сел и разложил все в цифры. Час своей 5090 в рублях, пропускная способность по замерам, точка безубыточности против семи сервисов, полная смета первого года. Разницу в 20 тысяч раз делает не железо, а то, сколько часов в сутки оно занято. Посчитать свое
https://habr.com/ru/articles/1066424/
#RTX_5090 #локальный_инференс #стоимость_токена #vLLM #KVкэш #окупаемость_GPU #LLM_на_своём_железе #DeepSeek #YandexGPT #TCO
-
vLLM Production Stack. Часть 1: Базовые возможности vLLM
Статья будет о том, как быстро начать работать с vLLM и vLLM Production Stack: от первого запуска модели до базовых режимов инференса через OpenAI-совместимый API. Разберем практические настройки и сценарии запуска — tool calling, thinking/non-thinking, мультимодальные и CPU-модели, а так же какие стартовые параметры сильнее всего влияют на память, производительность и стабильность. Отдельном рассмотрим полезные оптимизации для production-сценариев: FP8, Tensor Parallelism, KV-cache offloading, Speculative Decoding и ускорение холодного старта больших моделей.
https://habr.com/ru/articles/1016062/
#vLLM #vllm_production_stack #kubernetes #llm #vllmproductionstack #kvкэш
-
LatentMAS: Секрет AI-агентов, которые думают без слов, работают точнее и экономят до 80% токенов
Классические AI-агенты общаются текстом — это дорого и медленно. LatentMAS раскрывает секрет "безмолвного" общения: агенты обмениваются "мыслями" напрямую через общую латентную память (KV-кэш). Разбираемся, как эта архитектура позволяет добиться двузначного прироста точности и радикально сократить расходы на токены.
https://habr.com/ru/articles/972184/
#llm #LatentMAS #multiagent_системы #KVкэш #латентная_рабочая_память #LLM_агенты #экономия_токенов #оптимизация_llm #aiагенты