home.social

#gpuoptimierung — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #gpuoptimierung, aggregated by home.social.

fetched live
  1. RT @Snixtp: Die RTX Pro 6000 verfügt über zwei Matmul-Engines, und vLLM hat bei der Ausführung von Qwen3.6 27B nur eine davon genutzt. Marlin ist zwar gut für das Decoding, aber CUTLASS ist bei der Verarbeitung großer Token-Prompts 3,5-mal schneller. Aus irgendeinem Grund hat vLLM Marlin für beide Engines verwendet, weil die Checkpoint-Dateien von NVIDIA falsch kennzeichnen, was das Modell tatsächlich leisten kann. Fable 5 hat dies herausgefunden und ein vLLM-Plugin entwickelt, das die Batch-Größe analysiert und pro Aufruf die richtige Engine auswählt. Die Ergebnisse zeigen eine fast verdoppelte Steigerung der Prefill-Geschwindigkeit bei allen Kontextlängen:

    mehr auf Arint.info

    #CUTLASS #GPUOptimierung #Marlin #Qwen3 #RTXPro6000 #vLLM #arint_info

    https://x.com/Snixtp/status/2073517569689211333#m

  2. RT @Snixtp: Die RTX Pro 6000 verfügt über zwei Matmul-Engines, und vLLM hat bei der Ausführung von Qwen3.6 27B nur eine davon genutzt. Marlin ist zwar gut für das Decoding, aber CUTLASS ist bei der Verarbeitung großer Token-Prompts 3,5-mal schneller. Aus irgendeinem Grund hat vLLM Marlin für beide Engines verwendet, weil die Checkpoint-Dateien von NVIDIA falsch kennzeichnen, was das Modell tatsächlich leisten kann. Fable 5 hat dies herausgefunden und ein vLLM-Plugin entwickelt, das die Batch-Größe analysiert und pro Aufruf die richtige Engine auswählt. Die Ergebnisse zeigen eine fast verdoppelte Steigerung der Prefill-Geschwindigkeit bei allen Kontextlängen:

    mehr auf Arint.info

    #CUTLASS #GPUOptimierung #Marlin #Qwen3 #RTXPro6000 #vLLM #arint_info

    https://x.com/Snixtp/status/2073517569689211333#m

  3. RT @Snixtp: Die RTX Pro 6000 verfügt über zwei Matmul-Engines, und vLLM hat bei der Ausführung von Qwen3.6 27B nur eine davon genutzt. Marlin ist zwar gut für das Decoding, aber CUTLASS ist bei der Verarbeitung großer Token-Prompts 3,5-mal schneller. Aus irgendeinem Grund hat vLLM Marlin für beide Engines verwendet, weil die Checkpoint-Dateien von NVIDIA falsch kennzeichnen, was das Modell tatsächlich leisten kann. Fable 5 hat dies herausgefunden und ein vLLM-Plugin entwickelt, das die Batch-Größe analysiert und pro Aufruf die richtige Engine auswählt. Die Ergebnisse zeigen eine fast verdoppelte Steigerung der Prefill-Geschwindigkeit bei allen Kontextlängen:

    mehr auf Arint.info

    #CUTLASS #GPUOptimierung #Marlin #Qwen3 #RTXPro6000 #vLLM #arint_info

    https://x.com/Snixtp/status/2073517569689211333#m