#moemodel — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #moemodel, aggregated by home.social.
-
RT @ModelScope2022: Nur 3B aktive Parameter, dennoch State-of-the-Art-Performance beim agentic Coding in seiner Größenordnung. 🚀 KAT-Coder-V2.5-Dev, das neue 35B Open-Weight-MoE-Coding-Modell von @KwaiAICoder. 🤖 https://modelscope.ai/models/Kwaipilot/KAT-Coder-V2.5-Dev 📄 https://modelscope.ai/papers/2607.05471 🏆 Führt jede berichtete Benchmark gleicher Skala an: 69,4 auf SWE-bench Verified, 63,0 auf Multilingual und 41,02 auf Terminal-Bench 2,1. ⚡ Native 256K-Kontext, Tool-Calling, Denk-/Nicht-Denk-Modi und optionale Speicherung der Reasoning-Historie. 🧠 Aufgebaut auf Qwen3.6-35B-A3B mit 127K SFT-Beispielen + RL. Abnormale Tool-Labels sanken von 9,34% auf 0,28%, während kontinuierliche Wiederholungen auf 0% fielen. 📄 Open-Weight und nur Text—ohne Vision-Komponenten. Apache 2.0.
mehr auf Arint.info
#CodingAI #KATCoder #MoEModel #OpenSource #Qwen #SWEbench #arint_info
-
RT @ModelScope2022: Nur 3B aktive Parameter, dennoch State-of-the-Art-Performance beim agentic Coding in seiner Größenordnung. 🚀 KAT-Coder-V2.5-Dev, das neue 35B Open-Weight-MoE-Coding-Modell von @KwaiAICoder. 🤖 https://modelscope.ai/models/Kwaipilot/KAT-Coder-V2.5-Dev 📄 https://modelscope.ai/papers/2607.05471 🏆 Führt jede berichtete Benchmark gleicher Skala an: 69,4 auf SWE-bench Verified, 63,0 auf Multilingual und 41,02 auf Terminal-Bench 2,1. ⚡ Native 256K-Kontext, Tool-Calling, Denk-/Nicht-Denk-Modi und optionale Speicherung der Reasoning-Historie. 🧠 Aufgebaut auf Qwen3.6-35B-A3B mit 127K SFT-Beispielen + RL. Abnormale Tool-Labels sanken von 9,34% auf 0,28%, während kontinuierliche Wiederholungen auf 0% fielen. 📄 Open-Weight und nur Text—ohne Vision-Komponenten. Apache 2.0.
mehr auf Arint.info
#CodingAI #KATCoder #MoEModel #OpenSource #Qwen #SWEbench #arint_info
-
RT @ModelScope2022: Nur 3B aktive Parameter, dennoch State-of-the-Art-Performance beim agentic Coding in seiner Größenordnung. 🚀 KAT-Coder-V2.5-Dev, das neue 35B Open-Weight-MoE-Coding-Modell von @KwaiAICoder. 🤖 https://modelscope.ai/models/Kwaipilot/KAT-Coder-V2.5-Dev 📄 https://modelscope.ai/papers/2607.05471 🏆 Führt jede berichtete Benchmark gleicher Skala an: 69,4 auf SWE-bench Verified, 63,0 auf Multilingual und 41,02 auf Terminal-Bench 2,1. ⚡ Native 256K-Kontext, Tool-Calling, Denk-/Nicht-Denk-Modi und optionale Speicherung der Reasoning-Historie. 🧠 Aufgebaut auf Qwen3.6-35B-A3B mit 127K SFT-Beispielen + RL. Abnormale Tool-Labels sanken von 9,34% auf 0,28%, während kontinuierliche Wiederholungen auf 0% fielen. 📄 Open-Weight und nur Text—ohne Vision-Komponenten. Apache 2.0.
mehr auf Arint.info
#CodingAI #KATCoder #MoEModel #OpenSource #Qwen #SWEbench #arint_info
-
Arcee Trinity Mini: US-Trained Moe Model
https://www.arcee.ai/blog/the-trinity-manifesto?src=hn
#HackerNews #ArceeTrinityMini #USTrained #MoeModel #AIInnovation #Robotics
-
Arcee Trinity Mini: US-Trained Moe Model
https://www.arcee.ai/blog/the-trinity-manifesto?src=hn
#HackerNews #ArceeTrinityMini #USTrained #MoeModel #AIInnovation #Robotics
-
Arcee Trinity Mini: US-Trained Moe Model
https://www.arcee.ai/blog/the-trinity-manifesto?src=hn
#HackerNews #ArceeTrinityMini #USTrained #MoeModel #AIInnovation #Robotics
-
Arcee Trinity Mini: US-Trained Moe Model
https://www.arcee.ai/blog/the-trinity-manifesto?src=hn
#HackerNews #ArceeTrinityMini #USTrained #MoeModel #AIInnovation #Robotics
-
Arcee Trinity Mini: US-Trained Moe Model
https://www.arcee.ai/blog/the-trinity-manifesto?src=hn
#HackerNews #ArceeTrinityMini #USTrained #MoeModel #AIInnovation #Robotics
-
Dàn tensor với MoE, MXFP4 4 bits posibilität! 🌟 Noctrex chia sẻ mô hình-immun số chuẩn hóa trên HuggingFace – rất hiệu quả trong tiếtelay. Th suivants: https://huggingface.co/noctrex (hãy thử!).
#AI #MachineLearning #Quantization #MXFP4 #MoEModel #TinhHoaAI #MôHìnhTr ś/QuyDinh #PhépTinhTómTắthttps://www.reddit.com/r/LocalLLaMA/comments/1oav3r1/quantized_some_moe_models_with_mxfp4/