home.social

#deepswe — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #deepswe, aggregated by home.social.

fetched live
  1. RT @bnjmn_marie: Mein erster vollständiger Durchlauf von Qwen3.8 27B auf DeepSWE 1.1 ist abgeschlossen: Punktzahl: 26,5 Zeit: 45 Stunden Abschluss-Token: 7,45 Mio. Gesamtinput- und Output-Token: 820 Mio. Modellaufrufe: 9.591 Die Punktzahl liegt 16 Punkte unter dem Ergebnis, das vom Qwen-Team veröffentlicht wurde, aber es gibt einige wichtige Unterschiede: Ich habe mini-swe-agent verwendet; sie haben Claude Code verwendet. Ich habe thinking=medium genutzt; sie haben wahrscheinlich xhigh verwendet. Ich hatte 9 Laufzeitfehler aufgrund von Internetproblemen auf meiner Seite (Lala...). Ich sollte diese Aufgaben erneut ausführen. Abgesehen davon habe ich dieselben Hyperparameter verwendet. Ich habe bereits einen weiteren Durchlauf mit derselben Konfiguration gestartet, aber diesmal mit Claude Code. Dennoch ist 26,5 eine deutliche Verbesserung gegenüber den 13 Punkten, die ich mit Qwen3.6 erzielt habe, und liegt 21 Punkte höher als Muse Glimmer im xhigh-Modus.

    mehr auf Arint.info

    #AI #DeepSWE #LLM #MachineLearning #Qwen3 #TechResults #arint_info

    https://x.com/bnjmn_marie/status/2089775546943312076#m

  2. Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой

    21 июля я сидел, обновлял ленту и ждал Gemini 3.5 Pro – тот самый флагман, который Google пообещала ещё в мае на I/O. «В следующем месяце», – сказали они тогда. Прошло два. Я уже мысленно прикрутил этот релиз к списку «когда-нибудь», но вместо флагмана компания выкатила… три модели тира Flash. Ни одной Pro. Знакомо, да? Как заказать премиум-бургер, а получить три сочных, неожиданно крутых стритфуда. И вот что интересно: в руки попали не просто «затычки», а модели, которые для 90% реальной работы полезнее ещё одной строчки в таблице интеллектов. Особенно когда выяснилось, что экономия в 17% выходных токенов на самом деле тянет за собой цепочку издержек и способна сделать агентную разработку дешевле почти вдвое. А ещё новая версия местами просела в чтении графиков – и об этом молчат почти все. Давайте разбираться без корпоративных слайдов: что реально дают эти модели, чем за них придётся заплатить вниманием и как не сломать свой пайплайн, обновляясь на последнюю версию.

    habr.com/ru/companies/gptunnel

    #Gemini_36_Flash #Google #бенчмарки_LLM #ИИагенты #Claude #Gemini_31_Pro #DeepSWE #Gemini_35_Flash_Cyber #ParseBench

  3. 🧠 #GLM 5.2 ha raggiunto il 44% di pass@1 su #DeepSWE, diventando il primo modello open-source nella leaderboard.

    👉 I dettagli: linkedin.com/posts/alessiopoma

    ___
    ✉️ 𝗦𝗲 𝘃𝘂𝗼𝗶 𝗿𝗶𝗺𝗮𝗻𝗲𝗿𝗲 𝗮𝗴𝗴𝗶𝗼𝗿𝗻𝗮𝘁𝗼/𝗮 𝘀𝘂 𝗾𝘂𝗲𝘀𝘁𝗲 𝘁𝗲𝗺𝗮𝘁𝗶𝗰𝗵𝗲, 𝗶𝘀𝗰𝗿𝗶𝘃𝗶𝘁𝗶 𝗮𝗹𝗹𝗮 𝗺𝗶𝗮 𝗻𝗲𝘄𝘀𝗹𝗲𝘁𝘁𝗲𝗿: bit.ly/newsletter-alessiopomaro

    #AI #GenAI #GenerativeAI #IntelligenzaArtificiale #LLM 

  4. Opus 4.8 вышел и сразу проиграл GPT-5.5, $500M без лимитов и 21-летний баг MySQL 28 мая вышел Opus 4.8 — через 41 день после 4.7 и с...

    #Claude #Opus #4.8 #Dynamic #Workflows #DeepSWE #benchmark #DeepSeek #Code #Harness #Cerebras

    Origin | Interest | Match