#deepswe — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #deepswe, aggregated by home.social.
-
RT @bnjmn_marie: Mein erster vollständiger Durchlauf von Qwen3.8 27B auf DeepSWE 1.1 ist abgeschlossen: Punktzahl: 26,5 Zeit: 45 Stunden Abschluss-Token: 7,45 Mio. Gesamtinput- und Output-Token: 820 Mio. Modellaufrufe: 9.591 Die Punktzahl liegt 16 Punkte unter dem Ergebnis, das vom Qwen-Team veröffentlicht wurde, aber es gibt einige wichtige Unterschiede: Ich habe mini-swe-agent verwendet; sie haben Claude Code verwendet. Ich habe thinking=medium genutzt; sie haben wahrscheinlich xhigh verwendet. Ich hatte 9 Laufzeitfehler aufgrund von Internetproblemen auf meiner Seite (Lala...). Ich sollte diese Aufgaben erneut ausführen. Abgesehen davon habe ich dieselben Hyperparameter verwendet. Ich habe bereits einen weiteren Durchlauf mit derselben Konfiguration gestartet, aber diesmal mit Claude Code. Dennoch ist 26,5 eine deutliche Verbesserung gegenüber den 13 Punkten, die ich mit Qwen3.6 erzielt habe, und liegt 21 Punkte höher als Muse Glimmer im xhigh-Modus.
mehr auf Arint.info
#AI #DeepSWE #LLM #MachineLearning #Qwen3 #TechResults #arint_info
-
Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой
21 июля я сидел, обновлял ленту и ждал Gemini 3.5 Pro – тот самый флагман, который Google пообещала ещё в мае на I/O. «В следующем месяце», – сказали они тогда. Прошло два. Я уже мысленно прикрутил этот релиз к списку «когда-нибудь», но вместо флагмана компания выкатила… три модели тира Flash. Ни одной Pro. Знакомо, да? Как заказать премиум-бургер, а получить три сочных, неожиданно крутых стритфуда. И вот что интересно: в руки попали не просто «затычки», а модели, которые для 90% реальной работы полезнее ещё одной строчки в таблице интеллектов. Особенно когда выяснилось, что экономия в 17% выходных токенов на самом деле тянет за собой цепочку издержек и способна сделать агентную разработку дешевле почти вдвое. А ещё новая версия местами просела в чтении графиков – и об этом молчат почти все. Давайте разбираться без корпоративных слайдов: что реально дают эти модели, чем за них придётся заплатить вниманием и как не сломать свой пайплайн, обновляясь на последнюю версию.
https://habr.com/ru/companies/gptunnel/articles/1062994/
#Gemini_36_Flash #Google #бенчмарки_LLM #ИИагенты #Claude #Gemini_31_Pro #DeepSWE #Gemini_35_Flash_Cyber #ParseBench
-
🧠 #GLM 5.2 ha raggiunto il 44% di pass@1 su #DeepSWE, diventando il primo modello open-source nella leaderboard.
👉 I dettagli: https://www.linkedin.com/posts/alessiopomaro_glm-deepswe-ai-ugcPost-7475045454091702272-qRwa/
___
✉️ 𝗦𝗲 𝘃𝘂𝗼𝗶 𝗿𝗶𝗺𝗮𝗻𝗲𝗿𝗲 𝗮𝗴𝗴𝗶𝗼𝗿𝗻𝗮𝘁𝗼/𝗮 𝘀𝘂 𝗾𝘂𝗲𝘀𝘁𝗲 𝘁𝗲𝗺𝗮𝘁𝗶𝗰𝗵𝗲, 𝗶𝘀𝗰𝗿𝗶𝘃𝗶𝘁𝗶 𝗮𝗹𝗹𝗮 𝗺𝗶𝗮 𝗻𝗲𝘄𝘀𝗹𝗲𝘁𝘁𝗲𝗿: https://bit.ly/newsletter-alessiopomaro -
RT @uzairansar: MiniMax M3 wurde gerade zu DeepSWE hinzugefügt.
mehr auf Arint.info
#AIUpdate #ChineseAI #DeepSWE #KimiK26 #LLM #MiniMaxM3 #arint_info
-
Anthropic、IPO申請直前に旗艦モデルが大炎上——Claude Opus 4.8、アイデンティティ混乱と天文学的コストで批判殺到 — BigGo ファイナンス https://www.yayafa.com/2814557/ #AgenticAi #AI #Anthropic #ArtificialGeneralIntelligence #ArtificialIntelligence #ClaudeOpus48 #DeepSeek #DeepSWE #GPT55 #OpenAI #エージェント型AI #グレッグ・ブロックマン #ダイナミック・ワークフロー #ダリオ・アモデイ #人工知能 #汎用人工知能 #米証券取引委員会(SEC)
-
【Claude Opus 4.8検証】開発者テオ・ブラウン氏が1日で1,000ドルを消費し、「自分には合わない」と結論付けた理由 — BigGo ファイナンス https://www.yayafa.com/2810838/ #AgenticAi #AI #Anthropic #ArtificialGeneralIntelligence #ArtificialIntelligence #BridgewaterAssociates #ClaudeCode #ClaudeOpus48 #CODEX #DeepSWE #DynamicWorkflows #GPT55 #mythos #OpenAI #ProjectGlasswing #SWEBench #TheoBrowne #typescript #エージェント型AI #人工知能 #汎用人工知能