home.social

#vllm — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #vllm, aggregated by home.social.

fetched live
  1. My golang #vllm dashboard is now also opensourced.

    Just because I am too lazy to setup Prometheus :D.

    github.com/awlx/vllm-dashboard

    #DGXSpark #AI

  2. 🎉🎈 Behold, the arrival of #vLLM #v0.28.0, yet another groundbreaking version #update that no one asked for! 🤖💤 In a world where #AI is supposed to solve our problems, vLLM is here to ensure that navigating #GitHub remains the most confounding thing since daylight saving time. 🌐🔍
    github.com/vllm-project/vllm/r #confusion #tech #news #HackerNews #ngated

  3. RT @vllm_project: Qwen3.8-Flash-Next von @AlibabaQwen hat Day-0-Support in vLLM, verifiziert auf NVIDIA- und AMD-GPUs. 🎉

    mehr auf Arint.info

    #AI #AMD #MachineLearning #NVIDIA #Qwen #vLLM #arint_info

    https://x.com/vllm_project/status/2092600887873286157

  4. Complete guide to LLM hosting in 2026. Compare Ollama, llama.cpp, vLLM, TGI, Docker Model Runner, LocalAI and cloud providers. Learn cost, performance, and infrastructure trade-offs.

    #AI #LLM #hosting #Self-Hosting #ollama #llama.cpp #vllm #infrastructure

    glukhov.org/llm-hosting/

  5. Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

    Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не введение в трансформеры. Что вы унесёте: историю пяти последовательных конфигураций с тем, что каждая дала и чего стоила; рабочий набор флагов vLLM под одну карту Blackwell; три неочевидных бага и обходы; разбор реального счёта с отношением вход/выход 452:1. Главный вывод, если дальше читать некогда: на агентской нагрузке кэш префикса решает больше, чем выбор модели, размер карты и всё остальное вместе взятое. Мы шли к этому через четыре промежуточных стенда и потратили лишние месяцы, потому что не понимали, что именно меряем.

    habr.com/ru/articles/1073300/

    #vLLM #LiteLLM #prefix_caching #KVcache #локальные_LLM #инференс_LLM #Qwen #агентская_разработка #RTX_PRO_6000 #claude

  6. Приватная LLM в облаке: развертываем RAG-систему в Managed Kubernetes

    Выход в продакшен с собственными языковыми моделями внутри корпоративного контура часто упирается в высокую стоимость GPU-оборудования и сложные риски. Внешние сервисы вроде ChatGPT не подходят из-за требований к безопасности данных, а аренда или покупка физических серверов может приводить к переплатам за простой в неактивные часы или, наоборот, падению сервиса при пиковых нагрузках. Помимо самой модели, бизнесу необходимо развертывать и связывать между собой векторные базы данных, сервисы векторизации и оркестраторы сценариев. Эту проблему решает запуск приватной LLM

    habr.com/ru/companies/selectel

    #selectel #kubernetes #managed_kubernetes #llm #rag #vllm #qdrant #gpu #mlops #devops

  7. Playing with the latest open weight models. Wow they are so good now compared to the last generation. Able to do a lot more on my own infra controlling all aspects! #ai #llamacpp #vllm

  8. Not a fan of Qwen 3.8 27B.

    Overthinks too much => wasted tokens.

    Has someone ran it without too much thinking? Does it perform well with that knob down, or letting it think all the way is required to be good?

    #AI #ArtificialIntelligence #LLM #Qwen #Qwen38 #Qwen3 #Ollama #LlamaCCP #vLLM #LargeLanguageModels #LocalAI

  9. 🔀 #Switchyard is a #Rust proxy & library for #LLM traffic: it routes requests across providers and translates between #OpenAI and #Anthropic APIs #opensource #AI

    Protocol translation covers OpenAI Chat, Anthropic Messages & OpenAI Responses — clients keep their native API while requests are served by #vLLM, NVIDIA NIM, #Ollama or any OpenAI-compatible endpoint
    🧵👇

  10. 3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать

    В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.

    habr.com/ru/companies/selectel

    #kv_cache #llm #llamacpp #sglang #vllm #selectel

  11. «Тосок бессмысл»: как я не смог заставить Gemma 4 писать хорошие стихи

    Дано: стихотворение. Тема — «тщетность накопления жизненного опыта», амфибрахий, четыре строки. Заканчивается словом «тосок». Такого слова в русском языке нет. Мой оценщик поставил этому тексту техничность 1.000 — идеал. К этому моменту я месяц жёг GPU-часы на арендной L40S, пытаясь заставить Gemma 4 писать русские стихи. У меня был план из четырёх пунктов, свежая статья с рабочим рецептом, размеченный корпус на 13 тысяч пар и собственная метрика, проверенная на Пушкине. План развалился весь, но каждый раз не в том месте, где я ждал: главный подозреваемый до последнего выглядел очевидным, а виновным оказался совсем другой персонаж. Это детектив про то, как четыре файнтюна подряд проиграли необученной базе, как я месяц принимал решения по шуму и не знал об этом — и почему рифму нельзя выучить в принципе, а можно только навязывать. Настоящие цифры, реальный loss и плохие стихи прилагаются.

    habr.com/ru/articles/1069520/

    #LLM #LoRA #файнтюнинг #Gemma #генерация_стихов #силлаботоника #рифма #ограниченное_декодирование #reward_hacking #vLLM

  12. Hermes c локальными LLM vs GigaCode: сравниваем агентов на реальных PHP/Symfony-задачах

    На YouTube очень часто мне попадаются видео, где сравнивают разные LLM для вайбкодеров: сделай 3D-аквариум с рыбками, напиши игру, слепи лендинг. Но по ним совсем непонятно, как эти модели поведут себя на существующем проекте с большой кодовой базой и можно ли их применять для ежедневных задач веб-разработчика. Уже давно пользуюсь Claude Code, и он, в принципе, закрывает все потребности. Но при активной разработке лимиты кончаются довольно быстро... Кроме того, есть риск блокировок, поэтому я всё чаще посматривал в сторону локальных LLM. Было интересно, когда же настанет момент, что их реально можно будет использовать в повседневной разработке. К сожалению, все модели, которые получалось запустить на своих 16 ГБ VRAM, не внушали оптимизма. Да, их можно использовать для суммаризации текста или написания короткого фрагмента кода, но до агентского кодинга им было очень далеко. И вот мне выдалась возможность поэкспериментировать с DGX Spark , который имеет 128 ГБ унифицированной памяти. Результатами этого эксперимента и хочу поделиться. В качестве агента для локальных моделей выбрал Hermes — его имя постоянно мелькало в обсуждениях, и многие его хвалили, так что решил попробовать именно его. Модели крутились через vLLM на DGX Spark: весь процесс — чтение кода, поиск нужных мест, внесение правок, запуск тестов и статического анализа — выполнялся самим агентом, без участия человека (но иногда нужно было написать «продолжай», когда работа прерывалась по каким-то причинам). Тестировал всё на реальных задачах из своего проекта на Symfony. Результатами первых прогонов поделился с коллегами, и им стало интересно, могут ли локальные модели конкурировать с детищем Сбера — тем более что GigaChat недавно обзавёлся агентным режимом. Так в сравнение добавился GigaCode (использовал его внутри GigaIDE) — облачный агент, который на момент написания статьи бесплатен.

    habr.com/ru/articles/1069216/

    #PHP #Symfony #GigaCode #Hermes #vllm #агентное_программирование #локальные_llm

  13. RT @Italianclownz: Es ist jetzt öffentlich verfügbar: vLLM für Windows für AMD-Hardware. Die README-Datei ist sehr detailliert. Es gibt einen Sicherheitsmechanismus, der verhindert, dass die VRAM-Grenzen überschritten werden; die README enthält dazu weitere Informationen. Vielen Dank an AMD für die hervorragende Hardware, die dies ermöglicht hat. R9700 AI Pro und Threadripper. Ich habe keine zweite R9700 AI Pro oder andere AMD-Karte zur Verfügung, um Parallelität zu testen. Ich hoffe, dass dies für alle genauso gut funktioniert wie für mich. github.com/charlie12345/vLLMfo

    mehr auf Arint.info

    #AI #AMD #Hardware #OpenSource #vLLM #Windows #arint_info

    https://x.com/Italianclownz/status/2086811324718215203#m

  14. SGLang vs vLLM for enterprise LLM inference!

    SRE Production & Benchmark Blueprint:
    • VRAM OOM Trap: Don't set 0.9 VRAM! CUDA Graph capture exhausts host RAM. Use 0.8.
    • FlashInfer Fix: Install ninja-build to prevent compilation failures.
    • Agent Benchmark: SGLang RadixAttention yields 5x faster TTFT for agents.
    • Security Warning: Never bind --host 0.0.0.0 without auth.

    servermo.com/blogs/sglang-vs-v

    #AI #DevOps #vLLM #SGLang #ServerMO

  15. Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve

    Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента. Guard стоит на входе/выходе LLM‑приложения. В статье речь про небольшую модель — чуть больше 0.5 Gb. Но она вызывается дважды за один ход диалога, и сначала пользователь ждет, пока guard проверит его запрос перед отправкой в LLM, затем — пока он проверит сгенерированный ответ перед выдачей пользователю. Моей задачей было ускорить такую небольшую guard‑модель (Locustfile, базовые benchmark‑конфиги и инструкции по воспроизведению экспериментов в репо ). Я потестила пять инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — переход бэкбона на Flash DeBERTa. Про допущенные ошибки, результаты и выводы — о том, как бы я построила подобную работу сейчас — ниже. Надеюсь, это сбережет вам время.

    habr.com/ru/articles/1067008/

    #gliner2 #gliner_guard #guardrails #tensorrt #vllm #nvidia #инференс_нейросетей #tritoninferenceserver

  16. 📊 Leads every instruction-following benchmark and nearly all tool-use benchmarks against models up to 4x its size, trailing only #Qwen3_5 9B on BFCLv4 — coding remains the weaker area

    🔧 Day-one support for #llamacpp (GGUF), #MLX, #vLLM, #SGLang and #ONNX across Apple, AMD, Qualcomm and NVIDIA hardware

  17. Хватит сливать данные в Claude и GPT: как поднять свой on‑prem LLM

    Представим на секунду, что есть проблема, которую над срочно пофиксить, в рабочем чате никто не отвечает, инженер, на котором висит этот проект недоступен. Ну и чтобы сделать все быстро и эффективно сотрудник берет репозиторий, закидывает в ChatGPT вместе со всеми чувствительными данными, оставив все.env файлы. И вот через минуту у него уже готовое результат, а у OpenAI уже есть все продовые креды данного проекта. Но ни у кого не было цели слить данные, был инженер со срочной задачей для которой он нашел самое быстрое решение. И в этот момент главное не совершить ошибку: нужно не запрещать, а предлагать альтернативу. Люди все равно будут пользоваться агентами, просто возможно после запрета, они будут делать это незаметно. В этой статье предлагаю разобраться почему сегодня это явление приобретает такой массовый характер, почему просто запретить — не выход, чем аренда GPU у облочного провайдера отличается от on‑prem и как развернуть инференс внутри команды, чтобы инженеры не порывались слить данные.

    habr.com/ru/companies/ruvds/ar

    #llm #openai #anthropic #vllm #ollama #selfhosted #onprem #onpremise #ruvds_статьи

  18. Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99

    Демо нагрузки и реальная нагрузка различаются. Демо всегда быстрое — если поставить модель и прогнать пару запросов, то latency вас обрадует, а TTFT, вероятнее всего, будет приятным. Но когда сервис неделю живет под реальной нагрузкой, начинаются проблемы: p99 растет, память утекает, а однажды прилетает OOM на запросе, который вчера проходил без проблем. Я Стас Погоржельский, технологический евангелист VK Cloud, неоднократно наблюдал этот сценарий в демонстрационных средах. Инференс редко выходит из строя сразу и явно; как правило, его работа постепенно ухудшается, оставаясь незаметной до достижения критического состояния. Ниже я разберу четыре механизма, приводящие к деградации производственной среды на длительном интервале: фрагментацию KV-кэша, нехватку памяти (OOM) при работе с длинным контекстом, блокировку очереди (head-of-line blocking) внутри батча и расхождение метрик p50 и p99. Для каждого случая опишу внутреннее поведение системы, способы воспроизведения проблемы и метрики, сигнализирующие о надвигающемся инциденте.

    habr.com/ru/companies/vktech/a

    #vk_cloud #llm_inference #kv_cache #gpu_memory #oom #latency_p99 #continuous_batching #paged_attention #vllm #tail_latency

  19. Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле

    Разговор повторяется раз в месяц: платим за API прилично, может, купим свою карту? Сел и разложил все в цифры. Час своей 5090 в рублях, пропускная способность по замерам, точка безубыточности против семи сервисов, полная смета первого года. Разницу в 20 тысяч раз делает не железо, а то, сколько часов в сутки оно занято. Посчитать свое

    habr.com/ru/articles/1066424/

    #RTX_5090 #локальный_инференс #стоимость_токена #vLLM #KVкэш #окупаемость_GPU #LLM_на_своём_железе #DeepSeek #YandexGPT #TCO

  20. Learn when to migrate from Ollama to vLLM. Migration signals, planning steps, Docker Compose setup, and a practical checklist for moving your local LLM server.

    #Ollama #vLLM #LLM #AI #Self-Hosting #Docker #API #DevOps

    glukhov.org/llm-hosting/compar