home.social

#dgx_spark — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #dgx_spark, aggregated by home.social.

  1. Выбор агентской модели для кластеров из 2× DGX Spark (сентябрь 2026)

    В сентябре 2026 года на Hugging Face есть 3 модели, которые хочется поставить на пару DGX Spark под Claude Code: DeepSeek‑V4.1-Flash на 552B, GLM-5.3-Flash на 320B и Qwen3.8-Flash‑Next на 125B. Первая лучше всех в бенчмарках, но не помещается в 243 ГиБ даже в 4 битах. Вторая занимает 198 ГБ и грузится 15 минут . Третья влезает в один спарк — если не считать 2 ГБ, которых ей не хватает. Ниже — почему на этом кластере выбор делает арифметика памяти, а не таблица бенчмарков, почему 6 миллиардов активных параметров не дают 90 ток/с, и почему для Claude Code решающим оказывается не tok/s, а один флаг vLLM, который в самом быстром конфиге выключен.

    habr.com/ru/articles/1086334/

    #DGX_Spark #GB10 #vLLM #NVFP4 #MoE #тензорный_параллелизм #Claude_Code #prefix_caching #спекулятивное_декодирование #локальные_LLM

  2. Выбор агентской модели для кластеров из 2× DGX Spark (сентябрь 2026)

    В сентябре 2026 года на Hugging Face есть 3 модели, которые хочется поставить на пару DGX Spark под Claude Code: DeepSeek‑V4.1-Flash на 552B, GLM-5.3-Flash на 320B и Qwen3.8-Flash‑Next на 125B. Первая лучше всех в бенчмарках, но не помещается в 243 ГиБ даже в 4 битах. Вторая занимает 198 ГБ и грузится 15 минут . Третья влезает в один спарк — если не считать 2 ГБ, которых ей не хватает. Ниже — почему на этом кластере выбор делает арифметика памяти, а не таблица бенчмарков, почему 6 миллиардов активных параметров не дают 90 ток/с, и почему для Claude Code решающим оказывается не tok/s, а один флаг vLLM, который в самом быстром конфиге выключен.

    habr.com/ru/articles/1086334/

    #DGX_Spark #GB10 #vLLM #NVFP4 #MoE #тензорный_параллелизм #Claude_Code #prefix_caching #спекулятивное_декодирование #локальные_LLM

  3. Выбор агентской модели для кластеров из 2× DGX Spark (сентябрь 2026)

    В сентябре 2026 года на Hugging Face есть 3 модели, которые хочется поставить на пару DGX Spark под Claude Code: DeepSeek‑V4.1-Flash на 552B, GLM-5.3-Flash на 320B и Qwen3.8-Flash‑Next на 125B. Первая лучше всех в бенчмарках, но не помещается в 243 ГиБ даже в 4 битах. Вторая занимает 198 ГБ и грузится 15 минут . Третья влезает в один спарк — если не считать 2 ГБ, которых ей не хватает. Ниже — почему на этом кластере выбор делает арифметика памяти, а не таблица бенчмарков, почему 6 миллиардов активных параметров не дают 90 ток/с, и почему для Claude Code решающим оказывается не tok/s, а один флаг vLLM, который в самом быстром конфиге выключен.

    habr.com/ru/articles/1086334/

    #DGX_Spark #GB10 #vLLM #NVFP4 #MoE #тензорный_параллелизм #Claude_Code #prefix_caching #спекулятивное_декодирование #локальные_LLM