home.social

#speculative_decoding — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #speculative_decoding, aggregated by home.social.

  1. Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток/с на AMD Strix Halo

    Ornith‑1.0‑35B обошла Qwen3.5‑397B в Terminal‑Bench, а на нашем локальном срезе хорошо показала себя в агентном кодинге. Мы решили проверить, насколько быстрее она сможет работать на AMD Strix Halo с пропускной способностью памяти до 256 ГБ/с. В статье — результаты экспериментов с Vulkan, MTP, селективной квантизацией и n‑gram reuse: что не дало прироста, как удалось получить 99 ток/с без потери качества и каким способом 35B‑модель запустилась на Windows‑ноутбуке с 8 ГБ VRAM.

    habr.com/ru/articles/1060632/

    #llamacpp #Vulkan #AMD_Strix_Halo #Ornith #MoE #MTP #speculative_decoding #GGUF #LM_Studio #локальные_LLM

  2. Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток/с на AMD Strix Halo

    Ornith‑1.0‑35B обошла Qwen3.5‑397B в Terminal‑Bench, а на нашем локальном срезе хорошо показала себя в агентном кодинге. Мы решили проверить, насколько быстрее она сможет работать на AMD Strix Halo с пропускной способностью памяти до 256 ГБ/с. В статье — результаты экспериментов с Vulkan, MTP, селективной квантизацией и n‑gram reuse: что не дало прироста, как удалось получить 99 ток/с без потери качества и каким способом 35B‑модель запустилась на Windows‑ноутбуке с 8 ГБ VRAM.

    habr.com/ru/articles/1060632/

    #llamacpp #Vulkan #AMD_Strix_Halo #Ornith #MoE #MTP #speculative_decoding #GGUF #LM_Studio #локальные_LLM

  3. Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток/с на AMD Strix Halo

    Ornith‑1.0‑35B обошла Qwen3.5‑397B в Terminal‑Bench, а на нашем локальном срезе хорошо показала себя в агентном кодинге. Мы решили проверить, насколько быстрее она сможет работать на AMD Strix Halo с пропускной способностью памяти до 256 ГБ/с. В статье — результаты экспериментов с Vulkan, MTP, селективной квантизацией и n‑gram reuse: что не дало прироста, как удалось получить 99 ток/с без потери качества и каким способом 35B‑модель запустилась на Windows‑ноутбуке с 8 ГБ VRAM.

    habr.com/ru/articles/1060632/

    #llamacpp #Vulkan #AMD_Strix_Halo #Ornith #MoE #MTP #speculative_decoding #GGUF #LM_Studio #локальные_LLM

  4. DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

    DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.

    habr.com/ru/articles/1055792/

    #dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8

  5. DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

    DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.

    habr.com/ru/articles/1055792/

    #dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8

  6. DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

    DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата.

    habr.com/ru/articles/1055792/

    #dgx_spark #deepseek #vllm #спекулятивный_декодинг #speculative_decoding #dspark #llmинференс #бенчмарки #nvfp4 #nvfp8