home.social

#kvкэш — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #kvкэш, aggregated by home.social.

fetched live
  1. Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле

    Разговор повторяется раз в месяц: платим за API прилично, может, купим свою карту? Сел и разложил все в цифры. Час своей 5090 в рублях, пропускная способность по замерам, точка безубыточности против семи сервисов, полная смета первого года. Разницу в 20 тысяч раз делает не железо, а то, сколько часов в сутки оно занято. Посчитать свое

    habr.com/ru/articles/1066424/

    #RTX_5090 #локальный_инференс #стоимость_токена #vLLM #KVкэш #окупаемость_GPU #LLM_на_своём_железе #DeepSeek #YandexGPT #TCO

  2. vLLM Production Stack. Часть 1: Базовые возможности vLLM

    Статья будет о том, как быстро начать работать с vLLM и vLLM Production Stack: от первого запуска модели до базовых режимов инференса через OpenAI-совместимый API. Разберем практические настройки и сценарии запуска — tool calling, thinking/non-thinking, мультимодальные и CPU-модели, а так же какие стартовые параметры сильнее всего влияют на память, производительность и стабильность. Отдельном рассмотрим полезные оптимизации для production-сценариев: FP8, Tensor Parallelism, KV-cache offloading, Speculative Decoding и ускорение холодного старта больших моделей.

    habr.com/ru/articles/1016062/

    #vLLM #vllm_production_stack #kubernetes #llm #vllmproductionstack #kvкэш

  3. LatentMAS: Секрет AI-агентов, которые думают без слов, работают точнее и экономят до 80% токенов

    Классические AI-агенты общаются текстом — это дорого и медленно. LatentMAS раскрывает секрет "безмолвного" общения: агенты обмениваются "мыслями" напрямую через общую латентную память (KV-кэш). Разбираемся, как эта архитектура позволяет добиться двузначного прироста точности и радикально сократить расходы на токены.

    habr.com/ru/articles/972184/

    #llm #LatentMAS #multiagent_системы #KVкэш #латентная_рабочая_память #LLM_агенты #экономия_токенов #оптимизация_llm #aiагенты