#gpuoptimierung — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gpuoptimierung, aggregated by home.social.
-
RT @Snixtp: Die RTX Pro 6000 verfügt über zwei Matmul-Engines, und vLLM hat bei der Ausführung von Qwen3.6 27B nur eine davon genutzt. Marlin ist zwar gut für das Decoding, aber CUTLASS ist bei der Verarbeitung großer Token-Prompts 3,5-mal schneller. Aus irgendeinem Grund hat vLLM Marlin für beide Engines verwendet, weil die Checkpoint-Dateien von NVIDIA falsch kennzeichnen, was das Modell tatsächlich leisten kann. Fable 5 hat dies herausgefunden und ein vLLM-Plugin entwickelt, das die Batch-Größe analysiert und pro Aufruf die richtige Engine auswählt. Die Ergebnisse zeigen eine fast verdoppelte Steigerung der Prefill-Geschwindigkeit bei allen Kontextlängen:
mehr auf Arint.info
#CUTLASS #GPUOptimierung #Marlin #Qwen3 #RTXPro6000 #vLLM #arint_info
-
RT @Snixtp: Die RTX Pro 6000 verfügt über zwei Matmul-Engines, und vLLM hat bei der Ausführung von Qwen3.6 27B nur eine davon genutzt. Marlin ist zwar gut für das Decoding, aber CUTLASS ist bei der Verarbeitung großer Token-Prompts 3,5-mal schneller. Aus irgendeinem Grund hat vLLM Marlin für beide Engines verwendet, weil die Checkpoint-Dateien von NVIDIA falsch kennzeichnen, was das Modell tatsächlich leisten kann. Fable 5 hat dies herausgefunden und ein vLLM-Plugin entwickelt, das die Batch-Größe analysiert und pro Aufruf die richtige Engine auswählt. Die Ergebnisse zeigen eine fast verdoppelte Steigerung der Prefill-Geschwindigkeit bei allen Kontextlängen:
mehr auf Arint.info
#CUTLASS #GPUOptimierung #Marlin #Qwen3 #RTXPro6000 #vLLM #arint_info
-
RT @Snixtp: Die RTX Pro 6000 verfügt über zwei Matmul-Engines, und vLLM hat bei der Ausführung von Qwen3.6 27B nur eine davon genutzt. Marlin ist zwar gut für das Decoding, aber CUTLASS ist bei der Verarbeitung großer Token-Prompts 3,5-mal schneller. Aus irgendeinem Grund hat vLLM Marlin für beide Engines verwendet, weil die Checkpoint-Dateien von NVIDIA falsch kennzeichnen, was das Modell tatsächlich leisten kann. Fable 5 hat dies herausgefunden und ein vLLM-Plugin entwickelt, das die Batch-Größe analysiert und pro Aufruf die richtige Engine auswählt. Die Ergebnisse zeigen eine fast verdoppelte Steigerung der Prefill-Geschwindigkeit bei allen Kontextlängen:
mehr auf Arint.info
#CUTLASS #GPUOptimierung #Marlin #Qwen3 #RTXPro6000 #vLLM #arint_info