#dgx_spark — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #dgx_spark, aggregated by home.social.
-
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.
https://habr.com/ru/articles/1081324/
#LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ
-
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.
https://habr.com/ru/articles/1081324/
#LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ
-
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.
https://habr.com/ru/articles/1081324/
#LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ
-
DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57
TL;DR Железо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03. Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет. Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80. Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto . Явное включение дало +13.3% по среднему пяти прогонов на card‑like профиле (59.7 против 67.6) и +16.6% по медиане. B12X работает иначе: поднимает SSE‑derived частоту verification‑шагов на 16–18%, при этом выходные токены за шаг снижаются примерно на 2.5% в обоих профилях. Итоговый прирост клиентской decode‑метрики составил 13.3–14.6% по средним и 15.6–16.6% по медианам. Итог: 67.6 tok/s на одиночном запросе, 260 tok/s суммарно на 12 параллельных запросов. Отрицательные результаты, погрешности и границы применимости вынесены в отдельные разделы.
https://habr.com/ru/articles/1066164/
#DGX_Spark #vLLM #LLM_инференс #бенчмарк #спекулятивное_декодирование #GB10 #MoE #локальные_нейросети #speculative_decoding #DeepSeek_0731
-
DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново
DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.
https://habr.com/ru/articles/1055792/
#dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8