home.social

#dgx_spark — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #dgx_spark, aggregated by home.social.

fetched live
  1. Ngl I have a nvidia dgx spark at work and it’s so much fun to have a little self contained box that is reasonably capable and fits into a backpack.

    I’ve been running so many machine learning experiments (from “traditional learning” to “spectrum of vision models” to llms and transformers) just because I can do it without setting up any api keys and cloud compute nonsense or having my laptop work itself to the heat-death of the universe on its puny i7.

    Tempted to go into a cabin in the woods with zero internet and just constrain myself at programming, llm augmented sure, but completely autonomously on 70w of compute. Wild to think that this is where we are now, 4-5 years after copilot alpha.

    #llms #llm #nvidia #dgx_spark

  2. Ngl I have a nvidia dgx spark at work and it’s so much fun to have a little self contained box that is reasonably capable and fits into a backpack.

    I’ve been running so many machine learning experiments (from “traditional learning” to “spectrum of vision models” to llms and transformers) just because I can do it without setting up any api keys and cloud compute nonsense or having my laptop work itself to the heat-death of the universe on its puny i7.

    Tempted to go into a cabin in the woods with zero internet and just constrain myself at programming, llm augmented sure, but completely autonomously on 70w of compute. Wild to think that this is where we are now, 4-5 years after copilot alpha.

    #llms #llm #nvidia #dgx_spark

  3. Ngl I have a nvidia dgx spark at work and it’s so much fun to have a little self contained box that is reasonably capable and fits into a backpack.

    I’ve been running so many machine learning experiments (from “traditional learning” to “spectrum of vision models” to llms and transformers) just because I can do it without setting up any api keys and cloud compute nonsense or having my laptop work itself to the heat-death of the universe on its puny i7.

    Tempted to go into a cabin in the woods with zero internet and just constrain myself at programming, llm augmented sure, but completely autonomously on 70w of compute. Wild to think that this is where we are now, 4-5 years after copilot alpha.

  4. Ngl I have a nvidia dgx spark at work and it’s so much fun to have a little self contained box that is reasonably capable and fits into a backpack.

    I’ve been running so many machine learning experiments (from “traditional learning” to “spectrum of vision models” to llms and transformers) just because I can do it without setting up any api keys and cloud compute nonsense or having my laptop work itself to the heat-death of the universe on its puny i7.

    Tempted to go into a cabin in the woods with zero internet and just constrain myself at programming, llm augmented sure, but completely autonomously on 70w of compute. Wild to think that this is where we are now, 4-5 years after copilot alpha.

    #llms #llm #nvidia #dgx_spark

  5. Ngl I have a nvidia dgx spark at work and it’s so much fun to have a little self contained box that is reasonably capable and fits into a backpack.

    I’ve been running so many machine learning experiments (from “traditional learning” to “spectrum of vision models” to llms and transformers) just because I can do it without setting up any api keys and cloud compute nonsense or having my laptop work itself to the heat-death of the universe on its puny i7.

    Tempted to go into a cabin in the woods with zero internet and just constrain myself at programming, llm augmented sure, but completely autonomously on 70w of compute. Wild to think that this is where we are now, 4-5 years after copilot alpha.

    #llms #llm #nvidia #dgx_spark

  6. Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

    Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.

    habr.com/ru/articles/1081324/

    #LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ

  7. Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

    Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.

    habr.com/ru/articles/1081324/

    #LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ

  8. Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

    Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.

    habr.com/ru/articles/1081324/

    #LLM #inference #vLLM #CUDA #ROCm #DGX_Spark #AIагенты #ASR #KVкэш #локальный_ИИ

  9. DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57

    TL;DR Железо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03. Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет. Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80. Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto . Явное включение дало +13.3% по среднему пяти прогонов на card‑like профиле (59.7 против 67.6) и +16.6% по медиане. B12X работает иначе: поднимает SSE‑derived частоту verification‑шагов на 16–18%, при этом выходные токены за шаг снижаются примерно на 2.5% в обоих профилях. Итоговый прирост клиентской decode‑метрики составил 13.3–14.6% по средним и 15.6–16.6% по медианам. Итог: 67.6 tok/s на одиночном запросе, 260 tok/s суммарно на 12 параллельных запросов. Отрицательные результаты, погрешности и границы применимости вынесены в отдельные разделы.

    habr.com/ru/articles/1066164/

    #DGX_Spark #vLLM #LLM_инференс #бенчмарк #спекулятивное_декодирование #GB10 #MoE #локальные_нейросети #speculative_decoding #DeepSeek_0731

  10. DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57

    TL;DR Железо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03. Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет. Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80. Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto . Явное включение дало +13.3% по среднему пяти прогонов на card‑like профиле (59.7 против 67.6) и +16.6% по медиане. B12X работает иначе: поднимает SSE‑derived частоту verification‑шагов на 16–18%, при этом выходные токены за шаг снижаются примерно на 2.5% в обоих профилях. Итоговый прирост клиентской decode‑метрики составил 13.3–14.6% по средним и 15.6–16.6% по медианам. Итог: 67.6 tok/s на одиночном запросе, 260 tok/s суммарно на 12 параллельных запросов. Отрицательные результаты, погрешности и границы применимости вынесены в отдельные разделы.

    habr.com/ru/articles/1066164/

    #DGX_Spark #vLLM #LLM_инференс #бенчмарк #спекулятивное_декодирование #GB10 #MoE #локальные_нейросети #speculative_decoding #DeepSeek_0731

  11. DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57

    TL;DR Железо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03. Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет. Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80. Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto . Явное включение дало +13.3% по среднему пяти прогонов на card‑like профиле (59.7 против 67.6) и +16.6% по медиане. B12X работает иначе: поднимает SSE‑derived частоту verification‑шагов на 16–18%, при этом выходные токены за шаг снижаются примерно на 2.5% в обоих профилях. Итоговый прирост клиентской decode‑метрики составил 13.3–14.6% по средним и 15.6–16.6% по медианам. Итог: 67.6 tok/s на одиночном запросе, 260 tok/s суммарно на 12 параллельных запросов. Отрицательные результаты, погрешности и границы применимости вынесены в отдельные разделы.

    habr.com/ru/articles/1066164/

    #DGX_Spark #vLLM #LLM_инференс #бенчмарк #спекулятивное_декодирование #GB10 #MoE #локальные_нейросети #speculative_decoding #DeepSeek_0731

  12. 手のひらAIスパコン「DGX Spark」であえてゲーム開発、3時間のハッカソンで作ったとは思えない力作が集結した/日本初となる所有者限定の「DGX Sparkハッカソン」開催
    forest.watch.impress.co.jp/doc

    #forest_watch_impress #ハッカソン #DGX_Spark #イベント #genai #AIコーディング #システム_ファイル #ハードウェア #その他

  13. 手のひらAIスパコン「DGX Spark」であえてゲーム開発、3時間のハッカソンで作ったとは思えない力作が集結した/日本初となる所有者限定の「DGX Sparkハッカソン」開催
    forest.watch.impress.co.jp/doc

    #forest_watch_impress #ハッカソン #DGX_Spark #イベント #genai #AIコーディング #システム_ファイル #ハードウェア #その他

  14. 手のひらAIスパコン「DGX Spark」であえてゲーム開発、3時間のハッカソンで作ったとは思えない力作が集結した/日本初となる所有者限定の「DGX Sparkハッカソン」開催
    forest.watch.impress.co.jp/doc

    #forest_watch_impress #ハッカソン #DGX_Spark #イベント #genai #AIコーディング #システム_ファイル #ハードウェア #その他

  15. 手のひらAIスパコン「DGX Spark」であえてゲーム開発、3時間のハッカソンで作ったとは思えない力作が集結した/日本初となる所有者限定の「DGX Sparkハッカソン」開催
    forest.watch.impress.co.jp/doc

    #forest_watch_impress #ハッカソン #DGX_Spark #イベント #genai #AIコーディング #システム_ファイル #ハードウェア #その他

  16. DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

    DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.

    habr.com/ru/articles/1055792/

    #dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8

  17. DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

    DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.

    habr.com/ru/articles/1055792/

    #dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8

  18. DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

    DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.

    habr.com/ru/articles/1055792/

    #dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8

  19. DeepSeek‑V4‑Flash на двух DGX Spark: как мы убрали очередь и получили multi‑user

    Подняли DeepSeek‑V4‑Flash на двух GB10, упёрлись в потолок consumer Blackwell, прошли три тупика со спекулятивным декодингом — и в итоге получили параллельную работу ресёрч-агента и длинной генерации без очереди. Цифры из Grafana.

    habr.com/ru/articles/1050470/

    #dgx_spark #vllm #deepseekv4 #gb10 #tensor_parallel #AGmind #llm_inference #спекулятивный_декодинг

  20. DeepSeek‑V4‑Flash на двух DGX Spark: как мы убрали очередь и получили multi‑user

    Подняли DeepSeek‑V4‑Flash на двух GB10, упёрлись в потолок consumer Blackwell, прошли три тупика со спекулятивным декодингом — и в итоге получили параллельную работу ресёрч-агента и длинной генерации без очереди. Цифры из Grafana.

    habr.com/ru/articles/1050470/

    #dgx_spark #vllm #deepseekv4 #gb10 #tensor_parallel #AGmind #llm_inference #спекулятивный_декодинг

  21. DeepSeek‑V4‑Flash на двух DGX Spark: как мы убрали очередь и получили multi‑user

    Подняли DeepSeek‑V4‑Flash на двух GB10, упёрлись в потолок consumer Blackwell, прошли три тупика со спекулятивным декодингом — и в итоге получили параллельную работу ресёрч-агента и длинной генерации без очереди. Цифры из Grafana.

    habr.com/ru/articles/1050470/

    #dgx_spark #vllm #deepseekv4 #gb10 #tensor_parallel #AGmind #llm_inference #спекулятивный_декодинг

  22. Ubuntu 26.04 на клоне DGX Spark (Asus GX10)

    DGX Spark и его клоны поставляются с DGX OS (фактически, Ubuntu 24.04 с кучей дополнительных пакетов от Nvidia). Причем, драйвера используются довольно старые, версии 580, cuda toolkit тоже чуток устарел, 12-ой версии. Кроме того, стоит куча невразумительных пакетов с телеметрией (типа, для работы с Nvidia Sync), обвешано все какими-то левыми скриптами и странными настройками. Не то, чтобы это создавало прямо уж совсем серьезные проблемы, но сам факт наличия какого-то непонятного bloatware меня, как бывшего системного администратора - довольно сильно расстраивал. На форуме Nvidia кто-то уже написал, что ставил чистую Ubuntu 26.04 без серьезных трудностей, так что я решил сделать так же. Попутно захотелось перейти на ZFS ради возможности точно устанавливать размер файлового кэша и компрессии. Разумеется, сначала сделал полный бэкап на внешний nvme. Потом поставил Ubuntu 26.04 Desktop ARM, и оно даже успешно заработало, успешно установил необходимые пакеты и скомпилировал llama.cpp. Но появилась странная проблема с повышенным энергопотреблением - GX10 начал жрать из розетки во всех режимах на примерно 15 ватт больше. В idle - 41 ватт вместо 26, во время работы LLM - 195 вместо 180. Вроде бы немного, но для спарков и его клонов, с их системой охлаждения, работающей на пределе - это довольно критично. Чатгпт раскопал пост, где кто-то сетовал на похожую проблему с портами ConnectX-7 (и, как потом оказалось, это действительно была та самая проблема), но его предложения по деактивации этих портов и выгрузке драйверов никак не помогли.

    habr.com/ru/articles/1049206/

    #nvidia #dgx_spark #Ubuntu #llamacpp #vllm

  23. Ubuntu 26.04 на клоне DGX Spark (Asus GX10)

    DGX Spark и его клоны поставляются с DGX OS (фактически, Ubuntu 24.04 с кучей дополнительных пакетов от Nvidia). Причем, драйвера используются довольно старые, версии 580, cuda toolkit тоже чуток устарел, 12-ой версии. Кроме того, стоит куча невразумительных пакетов с телеметрией (типа, для работы с Nvidia Sync), обвешано все какими-то левыми скриптами и странными настройками. Не то, чтобы это создавало прямо уж совсем серьезные проблемы, но сам факт наличия какого-то непонятного bloatware меня, как бывшего системного администратора - довольно сильно расстраивал. На форуме Nvidia кто-то уже написал, что ставил чистую Ubuntu 26.04 без серьезных трудностей, так что я решил сделать так же. Попутно захотелось перейти на ZFS ради возможности точно устанавливать размер файлового кэша и компрессии. Разумеется, сначала сделал полный бэкап на внешний nvme. Потом поставил Ubuntu 26.04 Desktop ARM, и оно даже успешно заработало, успешно установил необходимые пакеты и скомпилировал llama.cpp. Но появилась странная проблема с повышенным энергопотреблением - GX10 начал жрать из розетки во всех режимах на примерно 15 ватт больше. В idle - 41 ватт вместо 26, во время работы LLM - 195 вместо 180. Вроде бы немного, но для спарков и его клонов, с их системой охлаждения, работающей на пределе - это довольно критично. Чатгпт раскопал пост, где кто-то сетовал на похожую проблему с портами ConnectX-7 (и, как потом оказалось, это действительно была та самая проблема), но его предложения по деактивации этих портов и выгрузке драйверов никак не помогли.

    habr.com/ru/articles/1049206/

    #nvidia #dgx_spark #Ubuntu #llamacpp #vllm

  24. Ubuntu 26.04 на клоне DGX Spark (Asus GX10)

    DGX Spark и его клоны поставляются с DGX OS (фактически, Ubuntu 24.04 с кучей дополнительных пакетов от Nvidia). Причем, драйвера используются довольно старые, версии 580, cuda toolkit тоже чуток устарел, 12-ой версии. Кроме того, стоит куча невразумительных пакетов с телеметрией (типа, для работы с Nvidia Sync), обвешано все какими-то левыми скриптами и странными настройками. Не то, чтобы это создавало прямо уж совсем серьезные проблемы, но сам факт наличия какого-то непонятного bloatware меня, как бывшего системного администратора - довольно сильно расстраивал. На форуме Nvidia кто-то уже написал, что ставил чистую Ubuntu 26.04 без серьезных трудностей, так что я решил сделать так же. Попутно захотелось перейти на ZFS ради возможности точно устанавливать размер файлового кэша и компрессии. Разумеется, сначала сделал полный бэкап на внешний nvme. Потом поставил Ubuntu 26.04 Desktop ARM, и оно даже успешно заработало, успешно установил необходимые пакеты и скомпилировал llama.cpp. Но появилась странная проблема с повышенным энергопотреблением - GX10 начал жрать из розетки во всех режимах на примерно 15 ватт больше. В idle - 41 ватт вместо 26, во время работы LLM - 195 вместо 180. Вроде бы немного, но для спарков и его клонов, с их системой охлаждения, работающей на пределе - это довольно критично. Чатгпт раскопал пост, где кто-то сетовал на похожую проблему с портами ConnectX-7 (и, как потом оказалось, это действительно была та самая проблема), но его предложения по деактивации этих портов и выгрузке драйверов никак не помогли.

    habr.com/ru/articles/1049206/

    #nvidia #dgx_spark #Ubuntu #llamacpp #vllm

  25. DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан

    NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в секунду на 35B MoE‑модели. После маркетинговых слайдов цифра выглядит грустно. Объяснение простое. NVFP4 в основной ветке vLLM и FlashInfer физически сломан на SM_121 — варианте Blackwell, который установлен в GB10. Ядра собраны под compute_120f , а нативные NVFP4-инструкции есть только в compute_120a и compute_121a . На SM_121 распаковка квантованных весов идёт через программные битовые манипуляции в шейдере, без участия тензорных ядер. Сообщество вытащило стек руками: нашло обходные пути, собрало рабочие конфигурации. Я прогнал на своём Spark шесть разных конфигураций vLLM — от стокового BF16 до форка с DFlash speculative decoding — и замерил каждую одинаковым тестом. В этой статье разбираю, что в итоге работает и что выбирать под разные задачи.

    habr.com/ru/articles/1033342/

    #vllm #dgx_spark #gb10 #blackwell #nvfp4 #llm #инференс #локальный_ии

  26. DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан

    NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в секунду на 35B MoE‑модели. После маркетинговых слайдов цифра выглядит грустно. Объяснение простое. NVFP4 в основной ветке vLLM и FlashInfer физически сломан на SM_121 — варианте Blackwell, который установлен в GB10. Ядра собраны под compute_120f , а нативные NVFP4-инструкции есть только в compute_120a и compute_121a . На SM_121 распаковка квантованных весов идёт через программные битовые манипуляции в шейдере, без участия тензорных ядер. Сообщество вытащило стек руками: нашло обходные пути, собрало рабочие конфигурации. Я прогнал на своём Spark шесть разных конфигураций vLLM — от стокового BF16 до форка с DFlash speculative decoding — и замерил каждую одинаковым тестом. В этой статье разбираю, что в итоге работает и что выбирать под разные задачи.

    habr.com/ru/articles/1033342/

    #vllm #dgx_spark #gb10 #blackwell #nvfp4 #llm #инференс #локальный_ии

  27. DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан

    NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в секунду на 35B MoE‑модели. После маркетинговых слайдов цифра выглядит грустно. Объяснение простое. NVFP4 в основной ветке vLLM и FlashInfer физически сломан на SM_121 — варианте Blackwell, который установлен в GB10. Ядра собраны под compute_120f , а нативные NVFP4-инструкции есть только в compute_120a и compute_121a . На SM_121 распаковка квантованных весов идёт через программные битовые манипуляции в шейдере, без участия тензорных ядер. Сообщество вытащило стек руками: нашло обходные пути, собрало рабочие конфигурации. Я прогнал на своём Spark шесть разных конфигураций vLLM — от стокового BF16 до форка с DFlash speculative decoding — и замерил каждую одинаковым тестом. В этой статье разбираю, что в итоге работает и что выбирать под разные задачи.

    habr.com/ru/articles/1033342/

    #vllm #dgx_spark #gb10 #blackwell #nvfp4 #llm #инференс #локальный_ии

  28. DGX Spark: мониторинг unified memory, когда NVML и dcgm‑exporter молчат

    Свежепоставленный мониторинг на DGX Spark. Открываю NVIDIA‑дашборд в Grafana — половина memory‑панелей пустые, прямые линии по нулю. Сначала кажется, что что‑то не настроил. Через полчаса доходит: это не у меня сломалось, это NVML на GB10 так работает. Это та область, где на GB10 половина стандартного observability‑стека просто не работает: NVML отдаёт [N/A] на memory.used и memory.total, dcgm‑exporter не ставится, nvtop в memory‑колонке показывает пустоту. В Grafana NVIDIA‑дашборды по умолчанию выглядят так, будто GPU вообще нет — и это не очевидно, потому что Grafana при отсутствии данных не кричит, а молча рисует ровную линию по нулю. Статья — про то, как я это место обошёл и что в итоге увидел в Grafana. Трёхуровневая схема: textfile collector для базовых метрик, per‑container attribution через docker top + nvidia-smi , и CLI‑фоллбэк на /proc/meminfo , который оказался полезен не только на Spark, но и на других Linux‑системах с единой памятью (unified memory) — AMD Strix Halo и подобные.

    habr.com/ru/articles/1031904/

    #dgx_spark #grafana #monitoring #nodeexporter #gb10 #arm64 #prometheus #observability

  29. DGX Spark: мониторинг unified memory, когда NVML и dcgm‑exporter молчат

    Свежепоставленный мониторинг на DGX Spark. Открываю NVIDIA‑дашборд в Grafana — половина memory‑панелей пустые, прямые линии по нулю. Сначала кажется, что что‑то не настроил. Через полчаса доходит: это не у меня сломалось, это NVML на GB10 так работает. Это та область, где на GB10 половина стандартного observability‑стека просто не работает: NVML отдаёт [N/A] на memory.used и memory.total, dcgm‑exporter не ставится, nvtop в memory‑колонке показывает пустоту. В Grafana NVIDIA‑дашборды по умолчанию выглядят так, будто GPU вообще нет — и это не очевидно, потому что Grafana при отсутствии данных не кричит, а молча рисует ровную линию по нулю. Статья — про то, как я это место обошёл и что в итоге увидел в Grafana. Трёхуровневая схема: textfile collector для базовых метрик, per‑container attribution через docker top + nvidia-smi , и CLI‑фоллбэк на /proc/meminfo , который оказался полезен не только на Spark, но и на других Linux‑системах с единой памятью (unified memory) — AMD Strix Halo и подобные.

    habr.com/ru/articles/1031904/

    #dgx_spark #grafana #monitoring #nodeexporter #gb10 #arm64 #prometheus #observability

  30. DGX Spark: мониторинг unified memory, когда NVML и dcgm‑exporter молчат

    Свежепоставленный мониторинг на DGX Spark. Открываю NVIDIA‑дашборд в Grafana — половина memory‑панелей пустые, прямые линии по нулю. Сначала кажется, что что‑то не настроил. Через полчаса доходит: это не у меня сломалось, это NVML на GB10 так работает. Это та область, где на GB10 половина стандартного observability‑стека просто не работает: NVML отдаёт [N/A] на memory.used и memory.total, dcgm‑exporter не ставится, nvtop в memory‑колонке показывает пустоту. В Grafana NVIDIA‑дашборды по умолчанию выглядят так, будто GPU вообще нет — и это не очевидно, потому что Grafana при отсутствии данных не кричит, а молча рисует ровную линию по нулю. Статья — про то, как я это место обошёл и что в итоге увидел в Grafana. Трёхуровневая схема: textfile collector для базовых метрик, per‑container attribution через docker top + nvidia-smi , и CLI‑фоллбэк на /proc/meminfo , который оказался полезен не только на Spark, но и на других Linux‑системах с единой памятью (unified memory) — AMD Strix Halo и подобные.

    habr.com/ru/articles/1031904/

    #dgx_spark #grafana #monitoring #nodeexporter #gb10 #arm64 #prometheus #observability

  31. Как я собрал на DGX Spark приватный AI-сервер, и теперь рассказываю, что туда вошло

    У меня на столе стоит небольшая золотистая коробочка размером чуть больше Mac mini. Внутри — приватный AI-сервер: чат с локальной 26B-моделью, поисковая индексация моих документов с GPU-парсингом, конструктор агентов в Dify, RAGFlow для тяжёлого парсинга PDF, мониторинг, бэкапы, опциональный кластер из двух машин по QSFP 200G. Тридцать контейнеров, пять минут на установку через sudo bash install.sh , ноль обращений к внешним API. Я делал это не как pet-project, а под себя — мне нужна была машина для работы с корпоративными документами, договорами и регламентами, которые ни при каких условиях нельзя отдавать в облачные ассистенты. Сборка получилась самостоятельным дистрибутивом — назвал его AGmind, выложил на GitHub под Apache 2.0. В статье разберу: — из чего собран стек и зачем там каждый компонент; — почему RAGFlow пришлось пересобрать с нуля и что я туда добавил; — как устроен кластер из двух Spark'ов; — пять конкретных грабель GB10, которые я ловил вечерами; — почему Claude Code за месяц превратил один из этих компонентов в работающий продукт, но при этом не заменил собственно программиста.

    habr.com/ru/articles/1030802/

    #dgx_spark #gb10 #arm64 #vllm #dify #ragflow #rag #llm

  32. Как я собрал на DGX Spark приватный AI-сервер, и теперь рассказываю, что туда вошло

    У меня на столе стоит небольшая золотистая коробочка размером чуть больше Mac mini. Внутри — приватный AI-сервер: чат с локальной 26B-моделью, поисковая индексация моих документов с GPU-парсингом, конструктор агентов в Dify, RAGFlow для тяжёлого парсинга PDF, мониторинг, бэкапы, опциональный кластер из двух машин по QSFP 200G. Тридцать контейнеров, пять минут на установку через sudo bash install.sh , ноль обращений к внешним API. Я делал это не как pet-project, а под себя — мне нужна была машина для работы с корпоративными документами, договорами и регламентами, которые ни при каких условиях нельзя отдавать в облачные ассистенты. Сборка получилась самостоятельным дистрибутивом — назвал его AGmind, выложил на GitHub под Apache 2.0. В статье разберу: — из чего собран стек и зачем там каждый компонент; — почему RAGFlow пришлось пересобрать с нуля и что я туда добавил; — как устроен кластер из двух Spark'ов; — пять конкретных грабель GB10, которые я ловил вечерами; — почему Claude Code за месяц превратил один из этих компонентов в работающий продукт, но при этом не заменил собственно программиста.

    habr.com/ru/articles/1030802/

    #dgx_spark #gb10 #arm64 #vllm #dify #ragflow #rag #llm

  33. Как я собрал на DGX Spark приватный AI-сервер, и теперь рассказываю, что туда вошло

    У меня на столе стоит небольшая золотистая коробочка размером чуть больше Mac mini. Внутри — приватный AI-сервер: чат с локальной 26B-моделью, поисковая индексация моих документов с GPU-парсингом, конструктор агентов в Dify, RAGFlow для тяжёлого парсинга PDF, мониторинг, бэкапы, опциональный кластер из двух машин по QSFP 200G. Тридцать контейнеров, пять минут на установку через sudo bash install.sh , ноль обращений к внешним API. Я делал это не как pet-project, а под себя — мне нужна была машина для работы с корпоративными документами, договорами и регламентами, которые ни при каких условиях нельзя отдавать в облачные ассистенты. Сборка получилась самостоятельным дистрибутивом — назвал его AGmind, выложил на GitHub под Apache 2.0. В статье разберу: — из чего собран стек и зачем там каждый компонент; — почему RAGFlow пришлось пересобрать с нуля и что я туда добавил; — как устроен кластер из двух Spark'ов; — пять конкретных грабель GB10, которые я ловил вечерами; — почему Claude Code за месяц превратил один из этих компонентов в работающий продукт, но при этом не заменил собственно программиста.

    habr.com/ru/articles/1030802/

    #dgx_spark #gb10 #arm64 #vllm #dify #ragflow #rag #llm

  34. Бенчмарк DGX Spark с LLM Qwen3: кому подойдет, почему 128 ГБ не серебряная пуля и о чем умолчал маркетинг NVIDIA

    У всех кто работает с LLM моделями случалось, что модель на 32B параметров не влезает в 24 ГБ VRAM вашей RTX 4090, offload на CPU убивает скорость, а облако — дорого и данные уходят на сторону. NVIDIA обещает нам решение: DGX Spark (он же GB10) с 128 ГБ unified memory за ~400-500 тысяч рублей. Мы потратили две недели на глубокие бенчмарки устройства и результаты оказались... неоднозначными. В статье будет много графиков, сравнение нескольких форматов квантизации, тесты разных объемов подаваемого контекста, сравнения с более привычными GPU и оценка финансовой эффективности такой покупки. Цель бенчмарка разобраться, в каких ситуациях DGX Spark показывает свои преимущества, а где его архитектурные ограничения становятся узким местом и предпочтительнее выбирать другие решения. Открыть бенчмарк

    habr.com/ru/articles/994058/

    #DGX_Spark #NVIDIA #Большие_языковые_модели #Нейросети #AI #Искусственный_интеллект #Бенчмарк #Промышленность #Qwen3 #Сезон_Heavy_Digital

  35. Бенчмарк DGX Spark с LLM Qwen3: кому подойдет, почему 128 ГБ не серебряная пуля и о чем умолчал маркетинг NVIDIA

    У всех кто работает с LLM моделями случалось, что модель на 32B параметров не влезает в 24 ГБ VRAM вашей RTX 4090, offload на CPU убивает скорость, а облако — дорого и данные уходят на сторону. NVIDIA обещает нам решение: DGX Spark (он же GB10) с 128 ГБ unified memory за ~400-500 тысяч рублей. Мы потратили две недели на глубокие бенчмарки устройства и результаты оказались... неоднозначными. В статье будет много графиков, сравнение нескольких форматов квантизации, тесты разных объемов подаваемого контекста, сравнения с более привычными GPU и оценка финансовой эффективности такой покупки. Цель бенчмарка разобраться, в каких ситуациях DGX Spark показывает свои преимущества, а где его архитектурные ограничения становятся узким местом и предпочтительнее выбирать другие решения. Открыть бенчмарк

    habr.com/ru/articles/994058/

    #DGX_Spark #NVIDIA #Большие_языковые_модели #Нейросети #AI #Искусственный_интеллект #Бенчмарк #Промышленность #Qwen3 #Сезон_Heavy_Digital

  36. Бенчмарк DGX Spark с LLM Qwen3: кому подойдет, почему 128 ГБ не серебряная пуля и о чем умолчал маркетинг NVIDIA

    У всех кто работает с LLM моделями случалось, что модель на 32B параметров не влезает в 24 ГБ VRAM вашей RTX 4090, offload на CPU убивает скорость, а облако — дорого и данные уходят на сторону. NVIDIA обещает нам решение: DGX Spark (он же GB10) с 128 ГБ unified memory за ~400-500 тысяч рублей. Мы потратили две недели на глубокие бенчмарки устройства и результаты оказались... неоднозначными. В статье будет много графиков, сравнение нескольких форматов квантизации, тесты разных объемов подаваемого контекста, сравнения с более привычными GPU и оценка финансовой эффективности такой покупки. Цель бенчмарка разобраться, в каких ситуациях DGX Spark показывает свои преимущества, а где его архитектурные ограничения становятся узким местом и предпочтительнее выбирать другие решения. Открыть бенчмарк

    habr.com/ru/articles/994058/

    #DGX_Spark #NVIDIA #Большие_языковые_модели #Нейросети #AI #Искусственный_интеллект #Бенчмарк #Промышленность #Qwen3 #Сезон_Heavy_Digital

  37. Just in case anyone out there is interested, the #dgx_spark does about 12min for the top 2bil passwords on an MD5 crypt hash. Sure that's not what it's meant for but come on...
    #hashcat
    #hashcat7
    #dgxspark
    #dgxsparkgb10
    #dgx

  38. Настольный дата-центр: как NVIDIA упаковала целый ИИ-кластер в корпус 15×15 см

    Совсем недавно NVIDIA представила DGX Spark — компактный AI-компьютер формата 150×150×50 мм. Внутри установлен Grace Blackwell Superchip GB10, объединяющий 20-ядерный ARM-процессор и GPU Blackwell, 128 ГБ единой LPDDR5X-памяти и накопитель до 64 ТБ. По уровню вычислительной мощности устройство сопоставимо с RTX 6000 Ada, но не требует серверной стойки, отдельного охлаждения и сложного подключения. DGX Spark рассчитан на специалистов, которым нужно запускать крупные языковые модели и дообучать нейросети локально — без облачных квот, задержек и рисков для данных. В статье разберем архитектуру системы, интерфейсы и охлаждение, а также реальные сценарии, где мини-суперкомпьютер действительно заменяет сервер — от генерации изображений до вычислений в материаловедении.

    habr.com/ru/companies/ru_mts/a

    #DGX_Spark #nvidia

  39. Настольный дата-центр: как NVIDIA упаковала целый ИИ-кластер в корпус 15×15 см

    Совсем недавно NVIDIA представила DGX Spark — компактный AI-компьютер формата 150×150×50 мм. Внутри установлен Grace Blackwell Superchip GB10, объединяющий 20-ядерный ARM-процессор и GPU Blackwell, 128 ГБ единой LPDDR5X-памяти и накопитель до 64 ТБ. По уровню вычислительной мощности устройство сопоставимо с RTX 6000 Ada, но не требует серверной стойки, отдельного охлаждения и сложного подключения. DGX Spark рассчитан на специалистов, которым нужно запускать крупные языковые модели и дообучать нейросети локально — без облачных квот, задержек и рисков для данных. В статье разберем архитектуру системы, интерфейсы и охлаждение, а также реальные сценарии, где мини-суперкомпьютер действительно заменяет сервер — от генерации изображений до вычислений в материаловедении.

    habr.com/ru/companies/ru_mts/a

    #DGX_Spark #nvidia

  40. Настольный дата-центр: как NVIDIA упаковала целый ИИ-кластер в корпус 15×15 см

    Совсем недавно NVIDIA представила DGX Spark — компактный AI-компьютер формата 150×150×50 мм. Внутри установлен Grace Blackwell Superchip GB10, объединяющий 20-ядерный ARM-процессор и GPU Blackwell, 128 ГБ единой LPDDR5X-памяти и накопитель до 64 ТБ. По уровню вычислительной мощности устройство сопоставимо с RTX 6000 Ada, но не требует серверной стойки, отдельного охлаждения и сложного подключения. DGX Spark рассчитан на специалистов, которым нужно запускать крупные языковые модели и дообучать нейросети локально — без облачных квот, задержек и рисков для данных. В статье разберем архитектуру системы, интерфейсы и охлаждение, а также реальные сценарии, где мини-суперкомпьютер действительно заменяет сервер — от генерации изображений до вычислений в материаловедении.

    habr.com/ru/companies/ru_mts/a

    #DGX_Spark #nvidia