#sglang — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #sglang, aggregated by home.social.
-
Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же
Наивная формула «веса + KV < VRAM» промахивается по двум причинам, и обе стоят денег. Первая: движок (vLLM, SGLang, TensorRT-LLM) резервирует почти всю память под свой пул ещё до того, как вы посчитали KV — поэтому ответ «сколько запросов влезет» всегда мимо, в сторону «влезет», а потом OOM под нагрузкой. Вторая, которую в уме не посчитать: на DeepSeek-V2-Lite обычная формула завышает KV в 7–11 раз, и промах уже в обратную сторону — зря откажетесь ставить модель. Я прогнал топ VRAM-калькуляторов из выдачи Google, показал на скриншотах, где ломается каждый (даже лучший), сверил числа с живым vLLM на A100/H100 — расхождение ~1% — и собрал ridgepoint: калькулятор, который считает как движок, а не как учебник. Ставится локально ( pip install ridgepoint ), GPU не нужен. Сколько реально влезет
https://habr.com/ru/articles/1079788/
#llm #inference #vllm #vram #kvcache #gpu #machine_learning #python #rust #sglang
-
Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же
Наивная формула «веса + KV < VRAM» промахивается по двум причинам, и обе стоят денег. Первая: движок (vLLM, SGLang, TensorRT-LLM) резервирует почти всю память под свой пул ещё до того, как вы посчитали KV — поэтому ответ «сколько запросов влезет» всегда мимо, в сторону «влезет», а потом OOM под нагрузкой. Вторая, которую в уме не посчитать: на DeepSeek-V2-Lite обычная формула завышает KV в 7–11 раз, и промах уже в обратную сторону — зря откажетесь ставить модель. Я прогнал топ VRAM-калькуляторов из выдачи Google, показал на скриншотах, где ломается каждый (даже лучший), сверил числа с живым vLLM на A100/H100 — расхождение ~1% — и собрал ridgepoint: калькулятор, который считает как движок, а не как учебник. Ставится локально ( pip install ridgepoint ), GPU не нужен. Сколько реально влезет
https://habr.com/ru/articles/1079788/
#llm #inference #vllm #vram #kvcache #gpu #machine_learning #python #rust #sglang
-
Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же
Наивная формула «веса + KV < VRAM» промахивается по двум причинам, и обе стоят денег. Первая: движок (vLLM, SGLang, TensorRT-LLM) резервирует почти всю память под свой пул ещё до того, как вы посчитали KV — поэтому ответ «сколько запросов влезет» всегда мимо, в сторону «влезет», а потом OOM под нагрузкой. Вторая, которую в уме не посчитать: на DeepSeek-V2-Lite обычная формула завышает KV в 7–11 раз, и промах уже в обратную сторону — зря откажетесь ставить модель. Я прогнал топ VRAM-калькуляторов из выдачи Google, показал на скриншотах, где ломается каждый (даже лучший), сверил числа с живым vLLM на A100/H100 — расхождение ~1% — и собрал ridgepoint: калькулятор, который считает как движок, а не как учебник. Ставится локально ( pip install ridgepoint ), GPU не нужен. Сколько реально влезет
https://habr.com/ru/articles/1079788/
#llm #inference #vllm #vram #kvcache #gpu #machine_learning #python #rust #sglang
-
Инференс LLM: от KV-кэша до продакшен-деплоя
Привет! Я Саша Рыжов, MLOps-инженер в hh.ru , уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед.
-
Инференс LLM: от KV-кэша до продакшен-деплоя
Привет! Я Саша Рыжов, MLOps-инженер в hh.ru , уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед.
-
Инференс LLM: от KV-кэша до продакшен-деплоя
Привет! Я Саша Рыжов, MLOps-инженер в hh.ru , уже три года занимаюсь развитием инфраструктуры для искусственного интеллекта. Компании, которые развивают GenAI, рано или поздно приходят к задачам по запуску LLM на собственном железе. В статье я расскажу, как обстоят дела с движками инференса в 2026 году и как запустить on‑prem-прод и не изобрести при этом велосипед.
-
Kimi K2.5 chạy trên ktkernel + sglang đạt 16 token/giây nhưng thiếu thẻ mở <think> trong chuỗi phản hồi, chỉ có </think>. Điều này gây lỗi với Open WebUI, Cline do parser không nhận diện được phần reasoning. Dù đã dùng --reasoning-parser kimi_k2 nhưng không hiệu quả. Cần tìm cách khôi phục thẻ mở <think>. #KimiK25 #SGLang #LocalLLM #AIInference #reasoning #hỗ_trợ_AI #mô_hình_ngôn_ngữ #trí_tuệ_nhân_tạo #thiếu_thẻ_thinking