#vllm_production_stack — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #vllm_production_stack, aggregated by home.social.
-
vLLM Production Stack. Часть 1: Базовые возможности vLLM
Статья будет о том, как быстро начать работать с vLLM и vLLM Production Stack: от первого запуска модели до базовых режимов инференса через OpenAI-совместимый API. Разберем практические настройки и сценарии запуска — tool calling, thinking/non-thinking, мультимодальные и CPU-модели, а так же какие стартовые параметры сильнее всего влияют на память, производительность и стабильность. Отдельном рассмотрим полезные оптимизации для production-сценариев: FP8, Tensor Parallelism, KV-cache offloading, Speculative Decoding и ускорение холодного старта больших моделей.
https://habr.com/ru/articles/1016062/
#vLLM #vllm_production_stack #kubernetes #llm #vllmproductionstack #kvкэш