[Перевод] Запускаем LLM локально на Windows: WSL2, Docker, CUDA и vLLM
Большинство инструкций по локальному запуску LLM сводятся к одной-двум командам: вставьте их в терминал, дождитесь загрузки модели и готово. Такой подход работает ровно до первой ошибки. После этого становится непонятно, на каком из нескольких уровней возникла проблема: в Windows, WSL2, драйвере NVIDIA, Docker, CUDA или самом inference-сервере. В этой статье развернем Qwen3-0.6B на обычной NVIDIA-видеокарте под Windows 11 с использованием WSL2, Docker, NVIDIA Container Toolkit и vLLM.
https://habr.com/ru/articles/1091060/
#vLLM #qwen3 #Docker #CUDA #wsl2 #локальные_llm #GPU_inference #openaicompatible_api