home.social

#deepseekv3 — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #deepseekv3, aggregated by home.social.

  1. RT @dunik_7: TRANSLASATION: Ein Labor der Tsinghua-Universität hat ein Projekt auf GitHub veröffentlicht, das einen H100-Rack im Wert von 400.000 US-Dollar durch eine einzelne 24-GB-Grafikkarte ersetzt. Das Projekt heißt ktransformers, und der Trick ist fast schon lächerlich einfach: Die Experten, die Sie tatsächlich nutzen, bleiben auf der GPU, während die anderen auf der CPU warten, bis sie benötigt werden. / DeepSeek-V3 und R1 mit 139K Kontext in 24GB VRAM / bis zu 28-fache Geschwindigkeitssteigerung gegenüber dem Standard-Setup / Fine-Tuning von DeepSeek-V3 über vier RTX 4090 statt eines Rechenzentrums / entwickelt vom MADSys-Labor der Tsinghua-Universität, nicht von einem Startup mit einer Landing Page. Apache 2.0, bereits über 17.000 Sterne. - github.com/kvcache-ai/ktransfo merken.

    mehr auf Arint.info

    #AIResearch #DeepSeekV3 #ktransformers #MachineLearning #OpenSource #TsinghuaUniversity #arint_info

    https://x.com/dunik_7/status/2078065378563887290#m

  2. RT @dunik_7: TRANSLASATION: Ein Labor der Tsinghua-Universität hat ein Projekt auf GitHub veröffentlicht, das einen H100-Rack im Wert von 400.000 US-Dollar durch eine einzelne 24-GB-Grafikkarte ersetzt. Das Projekt heißt ktransformers, und der Trick ist fast schon lächerlich einfach: Die Experten, die Sie tatsächlich nutzen, bleiben auf der GPU, während die anderen auf der CPU warten, bis sie benötigt werden. / DeepSeek-V3 und R1 mit 139K Kontext in 24GB VRAM / bis zu 28-fache Geschwindigkeitssteigerung gegenüber dem Standard-Setup / Fine-Tuning von DeepSeek-V3 über vier RTX 4090 statt eines Rechenzentrums / entwickelt vom MADSys-Labor der Tsinghua-Universität, nicht von einem Startup mit einer Landing Page. Apache 2.0, bereits über 17.000 Sterne. - github.com/kvcache-ai/ktransfo merken.

    mehr auf Arint.info

    #AIResearch #DeepSeekV3 #ktransformers #MachineLearning #OpenSource #TsinghuaUniversity #arint_info

    https://x.com/dunik_7/status/2078065378563887290#m

  3. RT @dunik_7: TRANSLASATION: Ein Labor der Tsinghua-Universität hat ein Projekt auf GitHub veröffentlicht, das einen H100-Rack im Wert von 400.000 US-Dollar durch eine einzelne 24-GB-Grafikkarte ersetzt. Das Projekt heißt ktransformers, und der Trick ist fast schon lächerlich einfach: Die Experten, die Sie tatsächlich nutzen, bleiben auf der GPU, während die anderen auf der CPU warten, bis sie benötigt werden. / DeepSeek-V3 und R1 mit 139K Kontext in 24GB VRAM / bis zu 28-fache Geschwindigkeitssteigerung gegenüber dem Standard-Setup / Fine-Tuning von DeepSeek-V3 über vier RTX 4090 statt eines Rechenzentrums / entwickelt vom MADSys-Labor der Tsinghua-Universität, nicht von einem Startup mit einer Landing Page. Apache 2.0, bereits über 17.000 Sterne. - github.com/kvcache-ai/ktransfo merken.

    mehr auf Arint.info

    #AIResearch #DeepSeekV3 #ktransformers #MachineLearning #OpenSource #TsinghuaUniversity #arint_info

    https://x.com/dunik_7/status/2078065378563887290#m

  4. DeepSeek-V3 from Scratch: Mixture of Experts (MoE) Table of Contents DeepSeek-V3 from Scratch: Mixture of Experts (MoE) The Scaling Challenge in Neural Networks Mixture of Experts (MoE): Mathematic...

    #Deep #Learning #DeepSeek #Machine #Learning #Neural #Networks #Tutorial #deepseek-v3 #expert #routing

    Origin | Interest | Match
  5. DeepSeek-V3 from Scratch: Mixture of Experts (MoE) Table of Contents DeepSeek-V3 from Scratch: Mixture of Experts (MoE) The Scaling Challenge in Neural Networks Mixture of Experts (MoE): Mathematic...

    #Deep #Learning #DeepSeek #Machine #Learning #Neural #Networks #Tutorial #deepseek-v3 #expert #routing

    Origin | Interest | Match
  6. 日本樂天推自家「AI 3.0」模型 源碼竟顯示使用 DeepSeek 基礎模型
    樂天集團 (Rakuten) 3 月 17 日公開旗下最新日語大型語言模型「Rakuten AI 3.0」,惟技術人員隨即發現 Hugging Face 上的設定檔案顯示其架構與中國 AI 公司 DeepSeek 的 DeepSeek-V3 模型高度吻合,兼且發布時被指悄然移除 DeepSeek-V3 原有開源授權聲明,觸發開源社群強烈批評,樂天面對查詢時拒絕披露基礎模型來源,僅稱「非公開」。
    #人工智能 #AI #DeepSeek #DeepSeek-V3
    unwire.hk/2026/03/22/rakuten-a

  7. Build DeepSeek-V3: Multi-Head Latent Attention (MLA) Architecture Table of Contents Build DeepSeek-V3: Multi-Head Latent Attention (MLA) Architecture The KV Cache Memory Problem in DeepSeek-V3 Mult...

    #Deep #Learning #Large #Language #Models #PyTorch #Transformers #Tutorial #attention #mechanisms #deepseek-v3

    Origin | Interest | Match
  8. DeepSeek-V3 Model: Theory, Config, and Rotary Positional Embeddings Table of Contents DeepSeek-V3 Model: Theory, Config, and Rotary Positional Embeddings Introduction to the DeepSeek-V3 Model The F...

    #DeepSeek-V3 #KV #Cache #MultiHead #Latent #Attention #RoPE #Tutorial #deepseekv3 #kv #cache

    Origin | Interest | Match
  9. r/LocalLLaMA tổng kết 2025: Một năm đột phá của AI nguồn mở! DeepSeek V3 khởi xướng "Open Source Strike Back", khiến Meta "hoảng loạn" và Sam Altman phải lên tiếng. Trung Quốc dẫn đầu với các mô hình mạnh mẽ như Qwen 3 và GPU giá phải chăng, trong khi Llama 4 của Meta bị đánh giá thấp. Cộng đồng LocalLLaMA vẫn là nơi thảo luận LLM chất lượng.

    #AIOpenSource #DeepSeek #Qwen #LocalLLaMA #AInguonmo #DeepSeekV3 #ThongkeAI

    reddit.com/r/LocalLLaMA/commen

  10. Beating GPT-5: DeepSeekMath-V2 Self-Corrects Logic Errors Presentational View Introduction Mathematics with the aid of artificial intelligence, is advancing rapidly. Innovations such as informal th...

    #ai-in-mathematics #deepseekmath-v2 #deepseek-v3 #open-source-ai-model #theorem-proving

    Origin | Interest | Match
  11. New benchmark shows Gemini 3 Pro outpaces Gemini 2.5 in trust, ethics and safety—69% vs 16%. The study, led by Phelim Bradley and Prolific, also pits DeepSeek V3 against the models, highlighting gaps in performance and reasoning. Dive into the full analysis for the numbers and implications. #Gemini3Pro #Gemini2_5 #DeepSeekV3 #TrustAndSafety

    🔗 aidailypost.com/news/gemini-3-

  12. 🚀 Welcome GLM-4.6 the Latest flagship #opensource #AI #llm with advanced agentic, reasoning & coding capabilities

    ⚡ Performance improvements over #GLM45 with competitive advantages against #DeepSeekV3 and #ClaudeSonnet4 across 8 public benchmarks covering agents, reasoning & coding

    🧵 👇

  13. 🚀 Welcome GLM-4.6 the Latest flagship #opensource #AI #llm with advanced agentic, reasoning & coding capabilities

    ⚡ Performance improvements over #GLM45 with competitive advantages against #DeepSeekV3 and #ClaudeSonnet4 across 8 public benchmarks covering agents, reasoning & coding

    🧵 👇

  14. 🚀 Welcome GLM-4.6 the Latest flagship #opensource #AI #llm with advanced agentic, reasoning & coding capabilities

    ⚡ Performance improvements over #GLM45 with competitive advantages against #DeepSeekV3 and #ClaudeSonnet4 across 8 public benchmarks covering agents, reasoning & coding

    🧵 👇

  15. 🚀 Welcome GLM-4.6 the Latest flagship #opensource #AI #llm with advanced agentic, reasoning & coding capabilities

    ⚡ Performance improvements over #GLM45 with competitive advantages against #DeepSeekV3 and #ClaudeSonnet4 across 8 public benchmarks covering agents, reasoning & coding

    🧵 👇

  16. 🚀 Welcome GLM-4.6 the Latest flagship #opensource #AI #llm with advanced agentic, reasoning & coding capabilities

    ⚡ Performance improvements over #GLM45 with competitive advantages against #DeepSeekV3 and #ClaudeSonnet4 across 8 public benchmarks covering agents, reasoning & coding

    🧵 👇

  17. Насколько зацензурен и опасен DeepSeek?

    Насколько предвзят искусственный интеллект? Принято ругать нейросети за трансляцию стереотипов человеческого мышления, которые были подсмотрены в датасетах предобучения. На деле ИИ куда более аккуратен, чем можно ожидать. Хороший пример — генерация фотографий бабочек. Как правило, дизайнеры-люди очень любят изображать бабочек в мёртвом виде. Дело в том, что энтомологи руководствуются строгими визуальными стандартами: вид сверху, расправленные на 180° крылья, чистый фон, симметрия.

    habr.com/ru/articles/949540/

    #DeepSeek #DeepSeekR1 #DeepSeekV3 #КНР #Китай #большие_языковые_модели #БЯМ #искусственный_интеллект #предвзятость #цензура

  18. 🧩 #Llama4Maverick nutzt 128 Experten für deutlich mehr Rechenleistung und schlägt sogar #GPT4o und #Gemini20 in Benchmarks – bei nur der Hälfte der aktiven Parameter von #DeepSeekv3.

    🎓 Beide #KIModelle wurden mithilfe des riesigen Lehrmodells #Llama4 Behemoth trainiert, das mit 288 Milliarden aktiven Parametern zu den leistungsstärksten weltweit zählt.

    👉 eicker.TV #Technik #Medien #Politik #Wirtschaft (2/2)

  19. 🧩 #Llama4Maverick nutzt 128 Experten für deutlich mehr Rechenleistung und schlägt sogar #GPT4o und #Gemini20 in Benchmarks – bei nur der Hälfte der aktiven Parameter von #DeepSeekv3.

    🎓 Beide #KIModelle wurden mithilfe des riesigen Lehrmodells #Llama4 Behemoth trainiert, das mit 288 Milliarden aktiven Parametern zu den leistungsstärksten weltweit zählt.

    👉 eicker.TV #Technik #Medien #Politik #Wirtschaft (2/2)

  20. Studie: #KI #Chatbots sind beim Zitieren von #News unbrauchbar
    derstandard.at/story/300000026

    "Untersucht wurden #ChatGPT Search (#OpenAI), #Perplexity, Perplexity Pro (Perplexity AI), #Gemini 2.0 Flash (#Google), #DeepseekV3 Search (#Deepseek), #Grok-2 Search, Grok-3 Search Beta (#xAI) sowie #Copilot (#Microsoft und OpenAI)."

    "#Grok3 [...] lieferte gleich in 96 Prozent aller Fälle falsche Antworten." 🤣

    #Nachrichten #Algorithmen #Automatisierung

  21. Studie: #KI #Chatbots sind beim Zitieren von #News unbrauchbar
    derstandard.at/story/300000026

    "Untersucht wurden #ChatGPT Search (#OpenAI), #Perplexity, Perplexity Pro (Perplexity AI), #Gemini 2.0 Flash (#Google), #DeepseekV3 Search (#Deepseek), #Grok-2 Search, Grok-3 Search Beta (#xAI) sowie #Copilot (#Microsoft und OpenAI)."

    "#Grok3 [...] lieferte gleich in 96 Prozent aller Fälle falsche Antworten." 🤣

    #Nachrichten #Algorithmen #Automatisierung

  22. »Chinese #AIlab #DeepSeek just released the latest version of their enormous #DeepSeekv3 model: The license is #MIT (that's new - previous DeepSeek v3 had a custom license).« simonwillison.net/2025/Mar/24/ #tech #media

  23. 🚀 DeepSeek V3 vs ChatGPT-4o: Which One Reigns Supreme?🤖

    AI is evolving fast! 🏎️ DeepSeek V3 and ChatGPT-4o are two of the most powerful LLMs in 2025. But which one is better?

    🔍 We compare:
    ✅ Accuracy & performance
    ✅ Multimodal capabilities
    ✅ Speed & efficiency
    ✅ Real-world applications

    📖 Read the full breakdown here:

    radargit.com/2025/02/03/deepse

    Which AI model do you prefer? Comment below! 👇

    #AI #DeepSeekV3 #ChatGPT4o #ArtificialIntelligence #Tech #MachineLearning #AICompari

  24. "A key component of the success is that it is #opensource. #DeepSeek-V3 is on GitHub with detailed docs on how it can be replicated. This has fueled a rush of people to try to make their own models." https://baixacultura.org/2025/01/29/a-corrida-da-ia-ganha-um-novo-capitulo-chines-e-open-source/

    A corrida da IA ganha um novo ...

  25. The Chinese firm said training the model cost just $5.6 million. Alibaba Cloud followed with a new generative AI model, while Microsoft alleges DeepSeek ‘distilled’ OpenAI’s work.#artificialintelligence #chatgpt #deepseek #deepseekr1 #deepseek-v3 #generativeai #Microsoft #nvidia #openai #reasoningmodels
    DeepSeek Chatbot Beats OpenAI on App Store Leaderboard
  26. Anyone out there who tried to run #deepseek V3 locally on a #linux machine? I'm curious if it can run with a consumer #nvidia or #amd card?

    #deepseekv3