home.social

#kvкэш — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #kvкэш, aggregated by home.social.

fetched live
  1. Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

    Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.

    habr.com/ru/articles/1081324/

    #LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ

  2. Контекст растёт, KV-кэш — нет: Qwen3.8-27B на ограниченной VRAM с CMF формате

    Qwen3.8-27B в Q4TP занимает около 14,3 GB весов, но при длинном контексте упирается ещё и в KV-кэш. Для 16 full-attention слоёв этой гибридной модели FP16 KV-state растёт на 65 536 байт с каждым токеном: на 64K это около 4 ГиБ только для K/V. В экспериментальном режиме O(1) рантайм CMF заменяет растущий KV-кэш этих 16 слоёв фиксированным состоянием: четыре sink-токена, точное окно последних 128 токенов и 32 опорных представлений для дальней части. В использованном профиле GPU-state attention составляет 44,1 МиБ, и не увеличивается с длиной контекста.

    habr.com/ru/articles/1080216/

    #llm #qwen38 #kvcache #kvкэш #оптимизация #оптимизация_кода #cmf #cmf_формат

  3. Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле

    Разговор повторяется раз в месяц: платим за API прилично, может, купим свою карту? Сел и разложил все в цифры. Час своей 5090 в рублях, пропускная способность по замерам, точка безубыточности против семи сервисов, полная смета первого года. Разницу в 20 тысяч раз делает не железо, а то, сколько часов в сутки оно занято. Посчитать свое

    habr.com/ru/articles/1066424/

    #RTX_5090 #локальный_инференс #стоимость_токена #vLLM #KVкэш #окупаемость_GPU #LLM_на_своём_железе #DeepSeek #YandexGPT #TCO

  4. vLLM Production Stack. Часть 1: Базовые возможности vLLM

    Статья будет о том, как быстро начать работать с vLLM и vLLM Production Stack: от первого запуска модели до базовых режимов инференса через OpenAI-совместимый API. Разберем практические настройки и сценарии запуска — tool calling, thinking/non-thinking, мультимодальные и CPU-модели, а так же какие стартовые параметры сильнее всего влияют на память, производительность и стабильность. Отдельном рассмотрим полезные оптимизации для production-сценариев: FP8, Tensor Parallelism, KV-cache offloading, Speculative Decoding и ускорение холодного старта больших моделей.

    habr.com/ru/articles/1016062/

    #vLLM #vllm_production_stack #kubernetes #llm #vllmproductionstack #kvкэш

  5. LatentMAS: Секрет AI-агентов, которые думают без слов, работают точнее и экономят до 80% токенов

    Классические AI-агенты общаются текстом — это дорого и медленно. LatentMAS раскрывает секрет "безмолвного" общения: агенты обмениваются "мыслями" напрямую через общую латентную память (KV-кэш). Разбираемся, как эта архитектура позволяет добиться двузначного прироста точности и радикально сократить расходы на токены.

    habr.com/ru/articles/972184/

    #llm #LatentMAS #multiagent_системы #KVкэш #латентная_рабочая_память #LLM_агенты #экономия_токенов #оптимизация_llm #aiагенты