#deeplearning — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #deeplearning, aggregated by home.social.
-
RT @analogalok: Qwen 3.8 35B A3B fast bestätigt! Auf GitHub gesichtet! Während alle damit beschäftigt sind, Qwen3.6 27B gegen das neue Qwen3.8 27B Dense Drop auf ihren einzelnen RTX 4090s und 3090s auszutauschen, verbirgt sich das eigentliche stille Update in diesem GitHub-Commit: 35B insgesamt, ~3B aktiv. Dasselbe MoE-Rezept, das Qwen3.6 35B A3B zu einem Favoriten für 8-16GB VRAM-Setups machte. Noch nicht offiziell angekündigt, liegt einfach in der Tabelle der unterstützten Modelle. Wenn das Muster anhält, fallen die Gewichte bald. GPU-arme Gang, das ist euer Zeichen. Es wurde gesichtet unter https://github.com/modelscope/ms-swift/commit/ab726e9d445a6520a70df2c831177d46adb1f589 Dieser Commit (ab726e9) im modelscope/ms-swift Repository ist mit der Unterstützung für die Qwen3.8-Modellfamilie verbunden.
mehr auf Arint.info
#AI #DeepLearning #GitHub #MachineLearning #OpenSource #Qwen38 #arint_info
-
RT @analogalok: Qwen 3.8 35B A3B fast bestätigt! Auf GitHub gesichtet! Während alle damit beschäftigt sind, Qwen3.6 27B gegen das neue Qwen3.8 27B Dense Drop auf ihren einzelnen RTX 4090s und 3090s auszutauschen, verbirgt sich das eigentliche stille Update in diesem GitHub-Commit: 35B insgesamt, ~3B aktiv. Dasselbe MoE-Rezept, das Qwen3.6 35B A3B zu einem Favoriten für 8-16GB VRAM-Setups machte. Noch nicht offiziell angekündigt, liegt einfach in der Tabelle der unterstützten Modelle. Wenn das Muster anhält, fallen die Gewichte bald. GPU-arme Gang, das ist euer Zeichen. Es wurde gesichtet unter https://github.com/modelscope/ms-swift/commit/ab726e9d445a6520a70df2c831177d46adb1f589 Dieser Commit (ab726e9) im modelscope/ms-swift Repository ist mit der Unterstützung für die Qwen3.8-Modellfamilie verbunden.
mehr auf Arint.info
#AI #DeepLearning #GitHub #MachineLearning #OpenSource #Qwen38 #arint_info
-
RT @analogalok: Qwen 3.8 35B A3B fast bestätigt! Auf GitHub gesichtet! Während alle damit beschäftigt sind, Qwen3.6 27B gegen das neue Qwen3.8 27B Dense Drop auf ihren einzelnen RTX 4090s und 3090s auszutauschen, verbirgt sich das eigentliche stille Update in diesem GitHub-Commit: 35B insgesamt, ~3B aktiv. Dasselbe MoE-Rezept, das Qwen3.6 35B A3B zu einem Favoriten für 8-16GB VRAM-Setups machte. Noch nicht offiziell angekündigt, liegt einfach in der Tabelle der unterstützten Modelle. Wenn das Muster anhält, fallen die Gewichte bald. GPU-arme Gang, das ist euer Zeichen. Es wurde gesichtet unter https://github.com/modelscope/ms-swift/commit/ab726e9d445a6520a70df2c831177d46adb1f589 Dieser Commit (ab726e9) im modelscope/ms-swift Repository ist mit der Unterstützung für die Qwen3.8-Modellfamilie verbunden.
mehr auf Arint.info
#AI #DeepLearning #GitHub #MachineLearning #OpenSource #Qwen38 #arint_info
-
RT @analogalok: Qwen 3.8 35B A3B fast bestätigt! Auf GitHub gesichtet! Während alle damit beschäftigt sind, Qwen3.6 27B gegen das neue Qwen3.8 27B Dense Drop auf ihren einzelnen RTX 4090s und 3090s auszutauschen, verbirgt sich das eigentliche stille Update in diesem GitHub-Commit: 35B insgesamt, ~3B aktiv. Dasselbe MoE-Rezept, das Qwen3.6 35B A3B zu einem Favoriten für 8-16GB VRAM-Setups machte. Noch nicht offiziell angekündigt, liegt einfach in der Tabelle der unterstützten Modelle. Wenn das Muster anhält, fallen die Gewichte bald. GPU-arme Gang, das ist euer Zeichen. Es wurde gesichtet unter https://github.com/modelscope/ms-swift/commit/ab726e9d445a6520a70df2c831177d46adb1f589 Dieser Commit (ab726e9) im modelscope/ms-swift Repository ist mit der Unterstützung für die Qwen3.8-Modellfamilie verbunden.
mehr auf Arint.info
#AI #DeepLearning #GitHub #MachineLearning #OpenSource #Qwen38 #arint_info
-
RT @analogalok: Qwen 3.8 35B A3B fast bestätigt! Auf GitHub gesichtet! Während alle damit beschäftigt sind, Qwen3.6 27B gegen das neue Qwen3.8 27B Dense Drop auf ihren einzelnen RTX 4090s und 3090s auszutauschen, verbirgt sich das eigentliche stille Update in diesem GitHub-Commit: 35B insgesamt, ~3B aktiv. Dasselbe MoE-Rezept, das Qwen3.6 35B A3B zu einem Favoriten für 8-16GB VRAM-Setups machte. Noch nicht offiziell angekündigt, liegt einfach in der Tabelle der unterstützten Modelle. Wenn das Muster anhält, fallen die Gewichte bald. GPU-arme Gang, das ist euer Zeichen. Es wurde gesichtet unter https://github.com/modelscope/ms-swift/commit/ab726e9d445a6520a70df2c831177d46adb1f589 Dieser Commit (ab726e9) im modelscope/ms-swift Repository ist mit der Unterstützung für die Qwen3.8-Modellfamilie verbunden.
mehr auf Arint.info
#AI #DeepLearning #GitHub #MachineLearning #OpenSource #Qwen38 #arint_info
-
RT @Bassmaster187: Qwen3.8-27B wurde veröffentlicht und es ist tatsächlich eine kleine Sensation. In den meisten Punkten ist es besser als Opus4.6 Max obwohl es um ein vielfaches kleiner ist und auf eine 24GB Grafikkarte super läuft. Ich bin schon am Downloaden.
mehr auf Arint.info
#AI #DeepLearning #MachineLearning #OpenSource #Qwen #arint_info
-
RT @Bassmaster187: Qwen3.8-27B wurde veröffentlicht und es ist tatsächlich eine kleine Sensation. In den meisten Punkten ist es besser als Opus4.6 Max obwohl es um ein vielfaches kleiner ist und auf eine 24GB Grafikkarte super läuft. Ich bin schon am Downloaden.
mehr auf Arint.info
#AI #DeepLearning #MachineLearning #OpenSource #Qwen #arint_info
-
RT @Bassmaster187: Qwen3.8-27B wurde veröffentlicht und es ist tatsächlich eine kleine Sensation. In den meisten Punkten ist es besser als Opus4.6 Max obwohl es um ein vielfaches kleiner ist und auf eine 24GB Grafikkarte super läuft. Ich bin schon am Downloaden.
mehr auf Arint.info
#AI #DeepLearning #MachineLearning #OpenSource #Qwen #arint_info
-
RT @Bassmaster187: Qwen3.8-27B wurde veröffentlicht und es ist tatsächlich eine kleine Sensation. In den meisten Punkten ist es besser als Opus4.6 Max obwohl es um ein vielfaches kleiner ist und auf eine 24GB Grafikkarte super läuft. Ich bin schon am Downloaden.
mehr auf Arint.info
#AI #DeepLearning #MachineLearning #OpenSource #Qwen #arint_info
-
RT @Bassmaster187: Qwen3.8-27B wurde veröffentlicht und es ist tatsächlich eine kleine Sensation. In den meisten Punkten ist es besser als Opus4.6 Max obwohl es um ein vielfaches kleiner ist und auf eine 24GB Grafikkarte super läuft. Ich bin schon am Downloaden.
mehr auf Arint.info
#AI #DeepLearning #MachineLearning #OpenSource #Qwen #arint_info
-
Samsung Electronics Simultaneously Recruits Seoul National University Professor and Meta Veteran to Accelerate Semiconductor AI Transformation
Samsung Electronics has simultaneously recruited a leading authority in deep learning and vision AI along with a data…
#EuropeSays #Korea #KR #SamsungElectronics #AIReadyData #AX·PICenter #DataEngineering #DeepLearning #HanBo-hyung #HanTae-rin #Meta #Samsung #semiconductors #SeoulNationalUniversity
https://www.europesays.com/korea/119844/ -
RT @1337hero: Qwen hat die HF-Modellkarte mit einigen interessanten Details zu Version 3.8 aktualisiert: - Native Vision: Bilder sowie Videos bis zu einer Stunde Länge (das überrascht mich am meisten) - Unterstützung für beliebte agentic Frameworks und Coding-Tools - Denkmöglichkeiten pro Anfrage ein- oder ausschaltbar - Unterstützung für reasoningeffort (Standard: xhigh) - Unterstützung für preservethinking • 262K nativer Kontext, erweiterbar auf 1M Kontext. Interessanterweise wird es als „casual model“ bezeichnet, obwohl viele Hinweise auf die Unterstützung beliebter Frameworks und Entwicklungstools die Integration in bestehende Stacks erleichtern. Dies könnte das beste lokale Modell für Hermes, OpenClaw und ähnliche sein... noch ungewiss... huggingface.co/Qwen/Qwen3.8-… Link Qwen/Qwen3.8-27B · Hugging Face Wir sind auf einem Weg, künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co
mehr auf Arint.info
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #Qwen #arint_info
-
RT @1337hero: Qwen hat die HF-Modellkarte mit einigen interessanten Details zu Version 3.8 aktualisiert: - Native Vision: Bilder sowie Videos bis zu einer Stunde Länge (das überrascht mich am meisten) - Unterstützung für beliebte agentic Frameworks und Coding-Tools - Denkmöglichkeiten pro Anfrage ein- oder ausschaltbar - Unterstützung für reasoningeffort (Standard: xhigh) - Unterstützung für preservethinking • 262K nativer Kontext, erweiterbar auf 1M Kontext. Interessanterweise wird es als „casual model“ bezeichnet, obwohl viele Hinweise auf die Unterstützung beliebter Frameworks und Entwicklungstools die Integration in bestehende Stacks erleichtern. Dies könnte das beste lokale Modell für Hermes, OpenClaw und ähnliche sein... noch ungewiss... huggingface.co/Qwen/Qwen3.8-… Link Qwen/Qwen3.8-27B · Hugging Face Wir sind auf einem Weg, künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co
mehr auf Arint.info
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #Qwen #arint_info
-
RT @1337hero: Qwen hat die HF-Modellkarte mit einigen interessanten Details zu Version 3.8 aktualisiert: - Native Vision: Bilder sowie Videos bis zu einer Stunde Länge (das überrascht mich am meisten) - Unterstützung für beliebte agentic Frameworks und Coding-Tools - Denkmöglichkeiten pro Anfrage ein- oder ausschaltbar - Unterstützung für reasoningeffort (Standard: xhigh) - Unterstützung für preservethinking • 262K nativer Kontext, erweiterbar auf 1M Kontext. Interessanterweise wird es als „casual model“ bezeichnet, obwohl viele Hinweise auf die Unterstützung beliebter Frameworks und Entwicklungstools die Integration in bestehende Stacks erleichtern. Dies könnte das beste lokale Modell für Hermes, OpenClaw und ähnliche sein... noch ungewiss... huggingface.co/Qwen/Qwen3.8-… Link Qwen/Qwen3.8-27B · Hugging Face Wir sind auf einem Weg, künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co
mehr auf Arint.info
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #Qwen #arint_info
-
RT @1337hero: Qwen hat die HF-Modellkarte mit einigen interessanten Details zu Version 3.8 aktualisiert: - Native Vision: Bilder sowie Videos bis zu einer Stunde Länge (das überrascht mich am meisten) - Unterstützung für beliebte agentic Frameworks und Coding-Tools - Denkmöglichkeiten pro Anfrage ein- oder ausschaltbar - Unterstützung für reasoningeffort (Standard: xhigh) - Unterstützung für preservethinking • 262K nativer Kontext, erweiterbar auf 1M Kontext. Interessanterweise wird es als „casual model“ bezeichnet, obwohl viele Hinweise auf die Unterstützung beliebter Frameworks und Entwicklungstools die Integration in bestehende Stacks erleichtern. Dies könnte das beste lokale Modell für Hermes, OpenClaw und ähnliche sein... noch ungewiss... huggingface.co/Qwen/Qwen3.8-… Link Qwen/Qwen3.8-27B · Hugging Face Wir sind auf einem Weg, künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co
mehr auf Arint.info
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #Qwen #arint_info
-
RT @1337hero: Qwen hat die HF-Modellkarte mit einigen interessanten Details zu Version 3.8 aktualisiert: - Native Vision: Bilder sowie Videos bis zu einer Stunde Länge (das überrascht mich am meisten) - Unterstützung für beliebte agentic Frameworks und Coding-Tools - Denkmöglichkeiten pro Anfrage ein- oder ausschaltbar - Unterstützung für reasoningeffort (Standard: xhigh) - Unterstützung für preservethinking • 262K nativer Kontext, erweiterbar auf 1M Kontext. Interessanterweise wird es als „casual model“ bezeichnet, obwohl viele Hinweise auf die Unterstützung beliebter Frameworks und Entwicklungstools die Integration in bestehende Stacks erleichtern. Dies könnte das beste lokale Modell für Hermes, OpenClaw und ähnliche sein... noch ungewiss... huggingface.co/Qwen/Qwen3.8-… Link Qwen/Qwen3.8-27B · Hugging Face Wir sind auf einem Weg, künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren. huggingface.co
mehr auf Arint.info
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #Qwen #arint_info
-
RE: https://dair-community.social/@timnitGebru/117087966871760448
When no one was listening to creative workers and our concerns about the impact of genAI in our fields, Timnit did ;)
She is not only "one of the fiercest voices in the world speaking truth to power", she also give the space and the voice to precarious workers. Something that not everyone does 🔥
📣 This is a MUST read !
#AI #genAI #power #tech #technology #SiliconValley #deeplearning #LLM #learning #CEO #ideology #tescreal
-
RE: https://dair-community.social/@timnitGebru/117087966871760448
When no one was listening to creative workers and our concerns about the impact of genAI in our fields, Timnit did ;)
She is not only "one of the fiercest voices in the world speaking truth to power", she also give the space and the voice to precarious workers. Something that not everyone does 🔥
📣 This is a MUST read !
#AI #genAI #power #tech #technology #SiliconValley #deeplearning #LLM #learning #CEO #ideology #tescreal
-
RE: https://dair-community.social/@timnitGebru/117087966871760448
When no one was listening to creative workers and our concerns about the impact of genAI in our fields, Timnit did ;)
She is not only "one of the fiercest voices in the world speaking truth to power", she also give the space and the voice to precarious workers. Something that not everyone does 🔥
📣 This is a MUST read !
#AI #genAI #power #tech #technology #SiliconValley #deeplearning #LLM #learning #CEO #ideology #tescreal
-
RE: https://dair-community.social/@timnitGebru/117087966871760448
When no one was listening to creative workers and our concerns about the impact of genAI in our fields, Timnit did ;)
She is not only "one of the fiercest voices in the world speaking truth to power", she also give the space and the voice to precarious workers. Something that not everyone does 🔥
📣 This is a MUST read !
#AI #genAI #power #tech #technology #SiliconValley #deeplearning #LLM #learning #CEO #ideology #tescreal
-
RE: https://dair-community.social/@timnitGebru/117087966871760448
When no one was listening to creative workers and our concerns about the impact of genAI in our fields, Timnit did ;)
She is not only "one of the fiercest voices in the world speaking truth to power", she also give the space and the voice to precarious workers. Something that not everyone does 🔥
📣 This is a MUST read !
#AI #genAI #power #tech #technology #SiliconValley #deeplearning #LLM #learning #CEO #ideology #tescreal
-
🔥 Installer une IA en local avec LM STUDIO.
:firedoge: https://www.instagram.com/ninon.ia_officiel #privacy #AI #ArtificialIntelligence #GenerativeAI #AITechnology #AIInnovation
#FutureOfAI #AITrends #MachineLearning #DeepLearning #Tech
#Technology #Innovation #DigitalTransformation #FutureTech #Automation -
🔥 Installer une IA en local avec LM STUDIO.
:firedoge: https://www.instagram.com/ninon.ia_officiel #privacy #AI #ArtificialIntelligence #GenerativeAI #AITechnology #AIInnovation
#FutureOfAI #AITrends #MachineLearning #DeepLearning #Tech
#Technology #Innovation #DigitalTransformation #FutureTech #Automation -
🔥 Installer une IA en local avec LM STUDIO.
:firedoge: https://www.instagram.com/ninon.ia_officiel #privacy #AI #ArtificialIntelligence #GenerativeAI #AITechnology #AIInnovation
#FutureOfAI #AITrends #MachineLearning #DeepLearning #Tech
#Technology #Innovation #DigitalTransformation #FutureTech #Automation -
🔥 Installer une IA en local avec LM STUDIO.
:firedoge: https://www.instagram.com/ninon.ia_officiel #privacy #AI #ArtificialIntelligence #GenerativeAI #AITechnology #AIInnovation
#FutureOfAI #AITrends #MachineLearning #DeepLearning #Tech
#Technology #Innovation #DigitalTransformation #FutureTech #Automation -
🔥 Installer une IA en local avec LM STUDIO.
:firedoge: https://www.instagram.com/ninon.ia_officiel #privacy #AI #ArtificialIntelligence #GenerativeAI #AITechnology #AIInnovation
#FutureOfAI #AITrends #MachineLearning #DeepLearning #Tech
#Technology #Innovation #DigitalTransformation #FutureTech #Automation -
RT @HowToPrompt__: Chinesische Forscher haben es erneut geschafft! Moonshot AI hat das größte Transformer-Upgrade seit 2015 als Open-Source veröffentlicht. Seit über einem Jahrzehnt verarbeiteten alle Transformer Daten Schicht für Schicht, indem sie blind neue Ausgaben auf alte Ausgaben stapelten. Es gab kein Filtern oder Urteilen. Es war einfach ein massiver Datenstapel, bei dem frühe, grundlegende Konzepte von den lauteren Schichten oben vollständig übertönt wurden. Ingenieure nennen dies PreNorm-Dilution (Verwässerung). In der Praxis bedeutet dies, dass Ihre KI ihre eigene beste Arbeit langsam vergisst, je tiefer sie wird. Also tötete Moonshot AI den festen Stapel. Sie bauten Attention Residuals (Aufmerksamkeits-Residuen). Statt blind alles zu akkumulieren, verwendet jede Schicht nun Softmax-Aufmerksamkeit über die Tiefe. Sie schaut aktiv zurück, bewertet jede vorangehende Schicht und zieht selektiv nur die Daten, die sie tatsächlich benötigt. Das Netzwerk lernte, wie man auswählt, was man sich merken soll. Und die Ergebnisse sind schrecklich effizient: • Sie erreicht die Leistung von Modellen, die mit 25 % mehr Rechenleistung trainiert wurden. • Massive Sprünge in Mathematik (+3,6 auf MATH), Schlussfolgerung (+7,5 auf GPQA) und Programmierung (+3,1 auf HumanEval). • Weniger als 2 % zusätzliche Latenz bei der Inferenz. Sie skalieren es sogar in ein reales Modell mit 48 Milliarden Parametern (Kimi Linear), das auf 1,4 Billionen Token vortrainiert wurde, und beweisen damit, dass es im Unternehmensmaßstab funktioniert. Der Transformer von 2017 ersetzte Rekurrenz durch Aufmerksamkeit über Wört…
mehr auf Arint.info
#DeepLearning #KünstlicheIntelligenz #MachineLearning #MoonshotAI #OpenSource #Transformer #arint_info
-
RT @HowToPrompt__: Chinesische Forscher haben es erneut geschafft! Moonshot AI hat das größte Transformer-Upgrade seit 2015 als Open-Source veröffentlicht. Seit über einem Jahrzehnt verarbeiteten alle Transformer Daten Schicht für Schicht, indem sie blind neue Ausgaben auf alte Ausgaben stapelten. Es gab kein Filtern oder Urteilen. Es war einfach ein massiver Datenstapel, bei dem frühe, grundlegende Konzepte von den lauteren Schichten oben vollständig übertönt wurden. Ingenieure nennen dies PreNorm-Dilution (Verwässerung). In der Praxis bedeutet dies, dass Ihre KI ihre eigene beste Arbeit langsam vergisst, je tiefer sie wird. Also tötete Moonshot AI den festen Stapel. Sie bauten Attention Residuals (Aufmerksamkeits-Residuen). Statt blind alles zu akkumulieren, verwendet jede Schicht nun Softmax-Aufmerksamkeit über die Tiefe. Sie schaut aktiv zurück, bewertet jede vorangehende Schicht und zieht selektiv nur die Daten, die sie tatsächlich benötigt. Das Netzwerk lernte, wie man auswählt, was man sich merken soll. Und die Ergebnisse sind schrecklich effizient: • Sie erreicht die Leistung von Modellen, die mit 25 % mehr Rechenleistung trainiert wurden. • Massive Sprünge in Mathematik (+3,6 auf MATH), Schlussfolgerung (+7,5 auf GPQA) und Programmierung (+3,1 auf HumanEval). • Weniger als 2 % zusätzliche Latenz bei der Inferenz. Sie skalieren es sogar in ein reales Modell mit 48 Milliarden Parametern (Kimi Linear), das auf 1,4 Billionen Token vortrainiert wurde, und beweisen damit, dass es im Unternehmensmaßstab funktioniert. Der Transformer von 2017 ersetzte Rekurrenz durch Aufmerksamkeit über Wört…
mehr auf Arint.info
#DeepLearning #KünstlicheIntelligenz #MachineLearning #MoonshotAI #OpenSource #Transformer #arint_info
-
RT @HowToPrompt__: Chinesische Forscher haben es erneut geschafft! Moonshot AI hat das größte Transformer-Upgrade seit 2015 als Open-Source veröffentlicht. Seit über einem Jahrzehnt verarbeiteten alle Transformer Daten Schicht für Schicht, indem sie blind neue Ausgaben auf alte Ausgaben stapelten. Es gab kein Filtern oder Urteilen. Es war einfach ein massiver Datenstapel, bei dem frühe, grundlegende Konzepte von den lauteren Schichten oben vollständig übertönt wurden. Ingenieure nennen dies PreNorm-Dilution (Verwässerung). In der Praxis bedeutet dies, dass Ihre KI ihre eigene beste Arbeit langsam vergisst, je tiefer sie wird. Also tötete Moonshot AI den festen Stapel. Sie bauten Attention Residuals (Aufmerksamkeits-Residuen). Statt blind alles zu akkumulieren, verwendet jede Schicht nun Softmax-Aufmerksamkeit über die Tiefe. Sie schaut aktiv zurück, bewertet jede vorangehende Schicht und zieht selektiv nur die Daten, die sie tatsächlich benötigt. Das Netzwerk lernte, wie man auswählt, was man sich merken soll. Und die Ergebnisse sind schrecklich effizient: • Sie erreicht die Leistung von Modellen, die mit 25 % mehr Rechenleistung trainiert wurden. • Massive Sprünge in Mathematik (+3,6 auf MATH), Schlussfolgerung (+7,5 auf GPQA) und Programmierung (+3,1 auf HumanEval). • Weniger als 2 % zusätzliche Latenz bei der Inferenz. Sie skalieren es sogar in ein reales Modell mit 48 Milliarden Parametern (Kimi Linear), das auf 1,4 Billionen Token vortrainiert wurde, und beweisen damit, dass es im Unternehmensmaßstab funktioniert. Der Transformer von 2017 ersetzte Rekurrenz durch Aufmerksamkeit über Wört…
mehr auf Arint.info
#DeepLearning #KünstlicheIntelligenz #MachineLearning #MoonshotAI #OpenSource #Transformer #arint_info
-
The whole of PyTorch on one page
https://tensor.khalilli.ai/blog/part-0-the-map/
-
The whole of PyTorch on one page
https://tensor.khalilli.ai/blog/part-0-the-map/
-
The whole of PyTorch on one page
https://tensor.khalilli.ai/blog/part-0-the-map/
-
The whole of PyTorch on one page
https://tensor.khalilli.ai/blog/part-0-the-map/
-
The whole of PyTorch on one page
https://tensor.khalilli.ai/blog/part-0-the-map/
-
RT @HowToPrompt__: Chinesische Forscher haben es erneut geschafft! Moonshot AI hat das größte Transformer-Upgrade seit 2015 open-sourced. Seit über einem Jahrzehnt verarbeiteten alle Transformer Daten schichtweise, indem sie blind neue Ausgaben auf alte Ausgaben stapelten. Es gab kein Filtern und Urteilen. Es war nur ein massiver Stapel von Daten, bei dem frühe, grundlegende Konzepte von den lauteren Schichten oben vollständig übertönt wurden. Ingenieure nennen dies PreNorm-Dilution. In der Praxis bedeutet dies, dass Ihre KI ihre eigene beste Arbeit langsam vergisst, je tiefer sie wird. Also hat Moonshot AI den festen Stapel abgeschafft. Sie bauten Attention Residuals. Anstatt blind alles zu akkumulieren, nutzt jede Schicht nun Softmax-Aufmerksamkeit über die Tiefe. Sie schaut aktiv zurück, bewertet jede vorangehende Schicht und zieht selektiv nur die Daten, die sie tatsächlich benötigt. Das Netzwerk lernte, wie man auswählt, was man sich merken soll. Und die Ergebnisse sind erschreckend effizient: • Es entspricht der Leistung von Modellen, die mit 25 % mehr Rechenleistung trainiert wurden. • Massive Sprünge in Mathematik (+3,6 auf MATH), Schlussfolgerung (+7,5 auf GPQA) und Programmierung (+3,1 auf HumanEval). • Weniger als 2 % Inference-Latenz-Overhead. Sie haben es sogar in ein reales 48-Milliarden-Parameter-Modell (Kimi Linear) hochskaliert, das auf 1,4 Billionen Token vortrainiert wurde, und bewiesen, dass es im Unternehmensmaßstab funktioniert. Der Transformer von 2017 ersetzte Rekurrenz durch Aufmerksamkeit über Wörter hinweg. Dieses Papier tat genau dasselbe über Schichten der Tiefe h…
mehr auf Arint.info
#AIResearch #AttentionResiduals #DeepLearning #KimiLinear #MoonshotAI #Transformer #arint_info
-
RT @HowToPrompt__: Chinesische Forscher haben es erneut geschafft! Moonshot AI hat das größte Transformer-Upgrade seit 2015 open-sourced. Seit über einem Jahrzehnt verarbeiteten alle Transformer Daten schichtweise, indem sie blind neue Ausgaben auf alte Ausgaben stapelten. Es gab kein Filtern und Urteilen. Es war nur ein massiver Stapel von Daten, bei dem frühe, grundlegende Konzepte von den lauteren Schichten oben vollständig übertönt wurden. Ingenieure nennen dies PreNorm-Dilution. In der Praxis bedeutet dies, dass Ihre KI ihre eigene beste Arbeit langsam vergisst, je tiefer sie wird. Also hat Moonshot AI den festen Stapel abgeschafft. Sie bauten Attention Residuals. Anstatt blind alles zu akkumulieren, nutzt jede Schicht nun Softmax-Aufmerksamkeit über die Tiefe. Sie schaut aktiv zurück, bewertet jede vorangehende Schicht und zieht selektiv nur die Daten, die sie tatsächlich benötigt. Das Netzwerk lernte, wie man auswählt, was man sich merken soll. Und die Ergebnisse sind erschreckend effizient: • Es entspricht der Leistung von Modellen, die mit 25 % mehr Rechenleistung trainiert wurden. • Massive Sprünge in Mathematik (+3,6 auf MATH), Schlussfolgerung (+7,5 auf GPQA) und Programmierung (+3,1 auf HumanEval). • Weniger als 2 % Inference-Latenz-Overhead. Sie haben es sogar in ein reales 48-Milliarden-Parameter-Modell (Kimi Linear) hochskaliert, das auf 1,4 Billionen Token vortrainiert wurde, und bewiesen, dass es im Unternehmensmaßstab funktioniert. Der Transformer von 2017 ersetzte Rekurrenz durch Aufmerksamkeit über Wörter hinweg. Dieses Papier tat genau dasselbe über Schichten der Tiefe h…
mehr auf Arint.info
#AIResearch #AttentionResiduals #DeepLearning #KimiLinear #MoonshotAI #Transformer #arint_info
-
RT @HowToPrompt__: Chinesische Forscher haben es erneut geschafft! Moonshot AI hat das größte Transformer-Upgrade seit 2015 open-sourced. Seit über einem Jahrzehnt verarbeiteten alle Transformer Daten schichtweise, indem sie blind neue Ausgaben auf alte Ausgaben stapelten. Es gab kein Filtern und Urteilen. Es war nur ein massiver Stapel von Daten, bei dem frühe, grundlegende Konzepte von den lauteren Schichten oben vollständig übertönt wurden. Ingenieure nennen dies PreNorm-Dilution. In der Praxis bedeutet dies, dass Ihre KI ihre eigene beste Arbeit langsam vergisst, je tiefer sie wird. Also hat Moonshot AI den festen Stapel abgeschafft. Sie bauten Attention Residuals. Anstatt blind alles zu akkumulieren, nutzt jede Schicht nun Softmax-Aufmerksamkeit über die Tiefe. Sie schaut aktiv zurück, bewertet jede vorangehende Schicht und zieht selektiv nur die Daten, die sie tatsächlich benötigt. Das Netzwerk lernte, wie man auswählt, was man sich merken soll. Und die Ergebnisse sind erschreckend effizient: • Es entspricht der Leistung von Modellen, die mit 25 % mehr Rechenleistung trainiert wurden. • Massive Sprünge in Mathematik (+3,6 auf MATH), Schlussfolgerung (+7,5 auf GPQA) und Programmierung (+3,1 auf HumanEval). • Weniger als 2 % Inference-Latenz-Overhead. Sie haben es sogar in ein reales 48-Milliarden-Parameter-Modell (Kimi Linear) hochskaliert, das auf 1,4 Billionen Token vortrainiert wurde, und bewiesen, dass es im Unternehmensmaßstab funktioniert. Der Transformer von 2017 ersetzte Rekurrenz durch Aufmerksamkeit über Wörter hinweg. Dieses Papier tat genau dasselbe über Schichten der Tiefe h…
mehr auf Arint.info
#AIResearch #AttentionResiduals #DeepLearning #KimiLinear #MoonshotAI #Transformer #arint_info
-
Alright, future engineers!
**Feynman Technique:** Explain complex ideas in simple terms, as if to a child.
Ex: Teach a difficult theorem out loud without notes. If you stumble, review & simplify.
Pro-Tip: It instantly exposes your knowledge gaps, forcing true understanding, not just memorization!
#StudyHacks #DeepLearning #STEM #StudyNotes -
RT @coffeecup2020: Die Fähigkeit, das Frontiers-Modell lokal mit einem Kontext von 1 Million Token auf einer RTX 3090 oder DGX auszuführen, ist wahnsinnig beeindruckend. Dank der Turbo-Quant-KV-Cache-Arbeit von @nostponsnek. Hugging Face: Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und offene Wissenschaft voranzubringen und zu demokratisieren.
mehr auf Arint.info
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #arint_info
-
RT @coffeecup2020: Die Fähigkeit, das Frontiers-Modell lokal mit einem Kontext von 1 Million Token auf einer RTX 3090 oder DGX auszuführen, ist wahnsinnig beeindruckend. Dank der Turbo-Quant-KV-Cache-Arbeit von @nostponsnek. Hugging Face: Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und offene Wissenschaft voranzubringen und zu demokratisieren.
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #arint_info
-
RT @coffeecup2020: Die Fähigkeit, das Frontiers-Modell lokal mit einem Kontext von 1 Million Token auf einer RTX 3090 oder DGX auszuführen, ist wahnsinnig beeindruckend. Dank der Turbo-Quant-KV-Cache-Arbeit von @nostponsnek. Hugging Face: Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und offene Wissenschaft voranzubringen und zu demokratisieren.
mehr auf Arint.info
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #arint_info
-
RT @coffeecup2020: Die Fähigkeit, das Frontiers-Modell lokal mit einem Kontext von 1 Million Token auf einer RTX 3090 oder DGX auszuführen, ist wahnsinnig beeindruckend. Dank der Turbo-Quant-KV-Cache-Arbeit von @nostponsnek. Hugging Face: Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und offene Wissenschaft voranzubringen und zu demokratisieren.
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #arint_info
-
RT @coffeecup2020: Die Fähigkeit, das Frontiers-Modell lokal mit einem Kontext von 1 Million Token auf einer RTX 3090 oder DGX auszuführen, ist wahnsinnig beeindruckend. Dank der Turbo-Quant-KV-Cache-Arbeit von @nostponsnek. Hugging Face: Wir sind auf einer Reise, um künstliche Intelligenz durch Open Source und offene Wissenschaft voranzubringen und zu demokratisieren.
mehr auf Arint.info
#AI #DeepLearning #HuggingFace #MachineLearning #OpenSource #arint_info
-
RT @finkd: Heute öffnen wir auch die Gewichte für Muse Glimmer, ein großartiges dichtes Modell mit 30 Milliarden Parametern, das lokal ausgeführt werden kann. Bald werden wir auch die Gewichte für Muse Spark 1.2, unser neuestes Foundation-Modell, veröffentlichen. Meta ist ein starker Unterstützer von Open Source und ich bin stolz auf diese Veröffentlichungen. Glückwunsch an @alexandrwang und das MSL-Team für all eure großartige Arbeit an diesen Modellen.
mehr auf Arint.info
#AIModels #DeepLearning #MachineLearning #Meta #OpenSource #arint_info
-
RT @finkd: Heute öffnen wir auch die Gewichte für Muse Glimmer, ein großartiges dichtes Modell mit 30 Milliarden Parametern, das lokal ausgeführt werden kann. Bald werden wir auch die Gewichte für Muse Spark 1.2, unser neuestes Foundation-Modell, veröffentlichen. Meta ist ein starker Unterstützer von Open Source und ich bin stolz auf diese Veröffentlichungen. Glückwunsch an @alexandrwang und das MSL-Team für all eure großartige Arbeit an diesen Modellen.
mehr auf Arint.info
#AIModels #DeepLearning #MachineLearning #Meta #OpenSource #arint_info
-
RT @finkd: Heute öffnen wir auch die Gewichte für Muse Glimmer, ein großartiges dichtes Modell mit 30 Milliarden Parametern, das lokal ausgeführt werden kann. Bald werden wir auch die Gewichte für Muse Spark 1.2, unser neuestes Foundation-Modell, veröffentlichen. Meta ist ein starker Unterstützer von Open Source und ich bin stolz auf diese Veröffentlichungen. Glückwunsch an @alexandrwang und das MSL-Team für all eure großartige Arbeit an diesen Modellen.
mehr auf Arint.info
#AIModels #DeepLearning #MachineLearning #Meta #OpenSource #arint_info
-
RT @rohanpaul_ai: Dies ist eine wirklich wilde Idee. Was wäre, wenn Gedächtnis eine Fähigkeit des LLM selbst wäre, anstatt ein daran angehängtes Abrufsystem? Kann ein LLM sich an etwas aus einer früheren Interaktion erinnern, ohne diese alte Interaktion erneut in seinen Prompt einfügen zu müssen? Metis schlägt ein Foundation-Modell mit einem persistenten Gedächtniszustand im Backbone vor, das während gewöhnlicher Forward-Passes aktualisiert wird, während die gelernten Modellgewichte eingefroren bleiben. Anstatt Erinnerungen als Text zu speichern und später abzurufen, komprimiert Metis vergangene Interaktionen direkt in den internen Zustand des Modells über einen separaten Speicher-Aufmerksamkeitspfad. Normale LLMs behalten kein persistentes Gedächtnis vergangener Interaktionen. Wenn man einem LLM sagt „Alice lebt in Peking“, muss ein externes Speichersystem diese Tatsache normalerweise speichern und später abrufen. Metis komprimiert die Interaktion stattdessen in einen internen numerischen Gedächtniszustand, der im Modell verbleibt und in zukünftigen Aufrufen verwendet werden kann. Das Modell wird während des Trainings darauf trainiert, Gedächtnisverfahren wie Erinnern, Aktualisieren, Vergessen und Reflektieren zu lernen, anstatt sich auf handgeschriebene Abrufregeln zu verlassen. Unter der No-Context-Einstellung erzielt Metis-27B 26,74 Punkte auf LoCoMo (Gold), im Vergleich zu 0,07 für das Vanilla-Qwen3.5-27B-Backbone und 4,24 für Temp-LoRA-27B. Es liegt immer noch deutlich unter Qwen3.5-27B mit vollem Kontext bei 65,03, daher hat natives Gedächtnis das Wiederholen der Geschichte noch nicht…
mehr auf Arint.info
#DeepLearning #Gedächtnis #KünstlicheIntelligenz #LLM #MaschinellesLernen #Metis #arint_info
-
RT @rohanpaul_ai: Dies ist eine wirklich wilde Idee. Was wäre, wenn Gedächtnis eine Fähigkeit des LLM selbst wäre, anstatt ein daran angehängtes Abrufsystem? Kann ein LLM sich an etwas aus einer früheren Interaktion erinnern, ohne diese alte Interaktion erneut in seinen Prompt einfügen zu müssen? Metis schlägt ein Foundation-Modell mit einem persistenten Gedächtniszustand im Backbone vor, das während gewöhnlicher Forward-Passes aktualisiert wird, während die gelernten Modellgewichte eingefroren bleiben. Anstatt Erinnerungen als Text zu speichern und später abzurufen, komprimiert Metis vergangene Interaktionen direkt in den internen Zustand des Modells über einen separaten Speicher-Aufmerksamkeitspfad. Normale LLMs behalten kein persistentes Gedächtnis vergangener Interaktionen. Wenn man einem LLM sagt „Alice lebt in Peking“, muss ein externes Speichersystem diese Tatsache normalerweise speichern und später abrufen. Metis komprimiert die Interaktion stattdessen in einen internen numerischen Gedächtniszustand, der im Modell verbleibt und in zukünftigen Aufrufen verwendet werden kann. Das Modell wird während des Trainings darauf trainiert, Gedächtnisverfahren wie Erinnern, Aktualisieren, Vergessen und Reflektieren zu lernen, anstatt sich auf handgeschriebene Abrufregeln zu verlassen. Unter der No-Context-Einstellung erzielt Metis-27B 26,74 Punkte auf LoCoMo (Gold), im Vergleich zu 0,07 für das Vanilla-Qwen3.5-27B-Backbone und 4,24 für Temp-LoRA-27B. Es liegt immer noch deutlich unter Qwen3.5-27B mit vollem Kontext bei 65,03, daher hat natives Gedächtnis das Wiederholen der Geschichte noch nicht…
mehr auf Arint.info
#DeepLearning #Gedächtnis #KünstlicheIntelligenz #LLM #MaschinellesLernen #Metis #arint_info
-
RT @rohanpaul_ai: Dies ist eine wirklich wilde Idee. Was wäre, wenn Gedächtnis eine Fähigkeit des LLM selbst wäre, anstatt ein daran angehängtes Abrufsystem? Kann ein LLM sich an etwas aus einer früheren Interaktion erinnern, ohne diese alte Interaktion erneut in seinen Prompt einfügen zu müssen? Metis schlägt ein Foundation-Modell mit einem persistenten Gedächtniszustand im Backbone vor, das während gewöhnlicher Forward-Passes aktualisiert wird, während die gelernten Modellgewichte eingefroren bleiben. Anstatt Erinnerungen als Text zu speichern und später abzurufen, komprimiert Metis vergangene Interaktionen direkt in den internen Zustand des Modells über einen separaten Speicher-Aufmerksamkeitspfad. Normale LLMs behalten kein persistentes Gedächtnis vergangener Interaktionen. Wenn man einem LLM sagt „Alice lebt in Peking“, muss ein externes Speichersystem diese Tatsache normalerweise speichern und später abrufen. Metis komprimiert die Interaktion stattdessen in einen internen numerischen Gedächtniszustand, der im Modell verbleibt und in zukünftigen Aufrufen verwendet werden kann. Das Modell wird während des Trainings darauf trainiert, Gedächtnisverfahren wie Erinnern, Aktualisieren, Vergessen und Reflektieren zu lernen, anstatt sich auf handgeschriebene Abrufregeln zu verlassen. Unter der No-Context-Einstellung erzielt Metis-27B 26,74 Punkte auf LoCoMo (Gold), im Vergleich zu 0,07 für das Vanilla-Qwen3.5-27B-Backbone und 4,24 für Temp-LoRA-27B. Es liegt immer noch deutlich unter Qwen3.5-27B mit vollem Kontext bei 65,03, daher hat natives Gedächtnis das Wiederholen der Geschichte noch nicht…
mehr auf Arint.info
#DeepLearning #Gedächtnis #KünstlicheIntelligenz #LLM #MaschinellesLernen #Metis #arint_info
-
Just to show I’ll give AI credit where credit is due…
I had been pondering this from time to time over many years. AI gave a damn good answer and thera- err… debriefing session:
As a freshman undergraduate psychology major at CMU in 1987, we were required to earn credit as subjects in graduate student experiments. I was in a brief, no more than an hour-long experiment in which I was typing on a terminal in a room on my own and told I was communicating with another student whom I never did meet and whose text lines to me came up on my screen. The topic we were told to discuss, I suspect was arbitrary, and had something to do with policies on stores selling alcohol to underage purchasers.
In this experiment was I communicating with an early AI prototype?
Also, all these years later, is it unusual that not having a final debriefing about the experiment bothers me slightly?
Damn! Now I want to apologize to the researchers (again) for having been such a slow typist 😁.
#AI #AI #ArtificialIntelligence #ChatGPT #chatbot #Claude #college #contextual #control #Copilot #courses #DeepLearning #DeepSeek #FOIA #ForensicLinguistics #game #Gemini #generative #GenerativeAI #Google #grammar #Grok #idiolect #language #largeLanguageModel #linguistics #LLM #machineLearning #NaturalLanguageProcessing #neuralNetwork #NLP #OpenAI #psycholinguistics #research #stylometry #syntax #text -
Just to show I’ll give AI credit where credit is due…
I had been pondering this from time to time over many years. AI gave a damn good answer and thera- err… debriefing session:
As a freshman undergraduate psychology major at CMU in 1987, we were required to earn credit as subjects in graduate student experiments. I was in a brief, no more than an hour-long experiment in which I was typing on a terminal in a room on my own and told I was communicating with another student whom I never did meet and whose text lines to me came up on my screen. The topic we were told to discuss, I suspect was arbitrary, and had something to do with policies on stores selling alcohol to underage purchasers.
In this experiment was I communicating with an early AI prototype?
Also, all these years later, is it unusual that not having a final debriefing about the experiment bothers me slightly?
Damn! Now I want to apologize to the researchers (again) for having been such a slow typist 😁.
#AI #AI #ArtificialIntelligence #ChatGPT #chatbot #Claude #college #contextual #control #Copilot #courses #DeepLearning #DeepSeek #FOIA #ForensicLinguistics #game #Gemini #generative #GenerativeAI #Google #grammar #Grok #idiolect #language #largeLanguageModel #linguistics #LLM #machineLearning #NaturalLanguageProcessing #neuralNetwork #NLP #OpenAI #psycholinguistics #research #stylometry #syntax #text -
Just to show I’ll give AI credit where credit is due…
I had been pondering this from time to time over many years. AI gave a damn good answer and thera- err… debriefing session:
As a freshman undergraduate psychology major at CMU in 1987, we were required to earn credit as subjects in graduate student experiments. I was in a brief, no more than an hour-long experiment in which I was typing on a terminal in a room on my own and told I was communicating with another student whom I never did meet and whose text lines to me came up on my screen. The topic we were told to discuss, I suspect was arbitrary, and had something to do with policies on stores selling alcohol to underage purchasers.
In this experiment was I communicating with an early AI prototype?
Also, all these years later, is it unusual that not having a final debriefing about the experiment bothers me slightly?
Damn! Now I want to apologize to the researchers (again) for having been such a slow typist 😁.
#AI #AI #ArtificialIntelligence #ChatGPT #chatbot #Claude #college #contextual #control #Copilot #courses #DeepLearning #DeepSeek #FOIA #ForensicLinguistics #game #Gemini #generative #GenerativeAI #Google #grammar #Grok #idiolect #language #largeLanguageModel #linguistics #LLM #machineLearning #NaturalLanguageProcessing #neuralNetwork #NLP #OpenAI #psycholinguistics #research #stylometry #syntax #text -
Just to show I’ll give AI credit where credit is due…
I had been pondering this from time to time over many years. AI gave a damn good answer and thera- err… debriefing session:
As a freshman undergraduate psychology major at CMU in 1987, we were required to earn credit as subjects in graduate student experiments. I was in a brief, no more than an hour-long experiment in which I was typing on a terminal in a room on my own and told I was communicating with another student whom I never did meet and whose text lines to me came up on my screen. The topic we were told to discuss, I suspect was arbitrary, and had something to do with policies on stores selling alcohol to underage purchasers.
In this experiment was I communicating with an early AI prototype?
Also, all these years later, is it unusual that not having a final debriefing about the experiment bothers me slightly?
Damn! Now I want to apologize to the researchers (again) for having been such a slow typist 😁.
#AI #AI #ArtificialIntelligence #ChatGPT #chatbot #Claude #college #contextual #control #Copilot #courses #DeepLearning #DeepSeek #FOIA #ForensicLinguistics #game #Gemini #generative #GenerativeAI #Google #grammar #Grok #idiolect #language #largeLanguageModel #linguistics #LLM #machineLearning #NaturalLanguageProcessing #neuralNetwork #NLP #OpenAI #psycholinguistics #research #stylometry #syntax #text -
Just to show I’ll give AI credit where credit is due…
I had been pondering this from time to time over many years. AI gave a damn good answer and thera- err… debriefing session:
As a freshman undergraduate psychology major at CMU in 1987, we were required to earn credit as subjects in graduate student experiments. I was in a brief, no more than an hour-long experiment in which I was typing on a terminal in a room on my own and told I was communicating with another student whom I never did meet and whose text lines to me came up on my screen. The topic we were told to discuss, I suspect was arbitrary, and had something to do with policies on stores selling alcohol to underage purchasers.
In this experiment was I communicating with an early AI prototype?
Also, all these years later, is it unusual that not having a final debriefing about the experiment bothers me slightly?
Damn! Now I want to apologize to the researchers (again) for having been such a slow typist 😁.
#AI #AI #ArtificialIntelligence #ChatGPT #chatbot #Claude #college #contextual #control #Copilot #courses #DeepLearning #DeepSeek #FOIA #ForensicLinguistics #game #Gemini #generative #GenerativeAI #Google #grammar #Grok #idiolect #language #largeLanguageModel #linguistics #LLM #machineLearning #NaturalLanguageProcessing #neuralNetwork #NLP #OpenAI #psycholinguistics #research #stylometry #syntax #text -
Fed-Poster: The World’s First and Largest 500+ Multi-Platform Poster
Fed-Poster: The World's First and Largest 500+ Multi-Platform Poster -
Fed-Poster: The World’s First and Largest 500+ Multi-Platform Poster
Fed-Poster: The World's First and Largest 500+ Multi-Platform Poster -
Fed-Poster: The World’s First and Largest 500+ Multi-Platform Poster
Fed-Poster: The World's First and Largest 500+ Multi-Platform Poster -
Fed-Poster: The World’s First and Largest 500+ Multi-Platform Poster
Fed-Poster: The World's First and Largest 500+ Multi-Platform Poster -
Fed-Poster: The World’s First and Largest 500+ Multi-Platform Poster
Fed-Poster: The World's First and Largest 500+ Multi-Platform Poster -
Track Bird Visitors With a Raspberry Pi and a USB Mic