Mô hình MoE siêu thưa (GPT-OSS-120B, Qwen3-Next-80B-A3B) đang là xu hướng tương lai! Cách tiếp cận mới: Dùng hệ chuyên gia siêu nhỏ để "cô đọng" mô hình 120B thành 30B, 7B bằng MXFP4, giải quyết khó khăn về tính phức tạp và chạy được trên thiết bị thông thường (96-8GB RAM/GPU). Ngoài ra, kỹ thuật giải mã spec hiệu quả hơn đã giúp tăng tốc suy luận ở mô hình GPT-OSS-120B. #AI #MachineLearning #MôHìnhLLM #EfficientAI #MoE #TechTrend
https://www.reddit.com/r/LocalLLaMA/comments/1qsx9r0/ultrasparse