home.social

#deepswe — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #deepswe, aggregated by home.social.

fetched live
  1. LLMSignal #003 — А что если агенту вообще не нужно генерировать текст, чтобы выбрать следующее действие

    Исследователи Stanford Hazy Research представили CLM-8B - Contrastive Language Model , открытую 8B-модель для быстрых решений внутри агентных систем. В отличие от обычной LLM, которая последовательно генерирует токены ответа, CLM получает состояние среды и набор возможных действий, после чего оценивает, какое действие лучше соответствует текущему состоянию. Код и модели опубликованы открыто, а базовая реализация построена вокруг Qwen3-8B. Идея меняет саму вычислительную задачу. Пусть агент находится в состоянии s и может выполнить одно из действий a₁, a₂, ..., aₙ ; обычная генеративная модель должна сформировать текстовое представление решения токен за токеном, тогда как CLM вычисляет вектор состояния f(s) и векторы действий g(aᵢ) , после чего сравнивает их скалярным произведением. Упрощённо решение можно записать как a* = argmaxᵢ f(s)·g(aᵢ) : чем ближе представления состояния и действия в обученном пространстве признаков, тем выше вероятность выбора этого действия. Для обучения используется контрастивная функция потерь InfoNCE. Правильная пара «состояние - действие» притягивается в пространстве представлений, а неправильные действия отталкиваются; математически вероятность правильного действия можно представить как P(aᵢ|s) = exp(sim(s,aᵢ)/τ) / Σⱼ exp(sim(s,aⱼ)/τ) , где τ задаёт резкость распределения. Если доступно только одно действие, такая классификация почти бессмысленна, но при сотнях или тысячах повторно используемых действий преимущество становится существенным: их векторы можно вычислить один раз и затем кэшировать.

    habr.com/ru/articles/1086014/

    #Contrastive_Language_Model #local_LLM #AI_agents #coding_agents #System_1 #contrastive_learning #InfoNCE #DeepSWE #TerminalBench #inference

  2. LLMSignal #003 — А что если агенту вообще не нужно генерировать текст, чтобы выбрать следующее действие

    Исследователи Stanford Hazy Research представили CLM-8B - Contrastive Language Model , открытую 8B-модель для быстрых решений внутри агентных систем. В отличие от обычной LLM, которая последовательно генерирует токены ответа, CLM получает состояние среды и набор возможных действий, после чего оценивает, какое действие лучше соответствует текущему состоянию. Код и модели опубликованы открыто, а базовая реализация построена вокруг Qwen3-8B. Идея меняет саму вычислительную задачу. Пусть агент находится в состоянии s и может выполнить одно из действий a₁, a₂, ..., aₙ ; обычная генеративная модель должна сформировать текстовое представление решения токен за токеном, тогда как CLM вычисляет вектор состояния f(s) и векторы действий g(aᵢ) , после чего сравнивает их скалярным произведением. Упрощённо решение можно записать как a* = argmaxᵢ f(s)·g(aᵢ) : чем ближе представления состояния и действия в обученном пространстве признаков, тем выше вероятность выбора этого действия. Для обучения используется контрастивная функция потерь InfoNCE. Правильная пара «состояние - действие» притягивается в пространстве представлений, а неправильные действия отталкиваются; математически вероятность правильного действия можно представить как P(aᵢ|s) = exp(sim(s,aᵢ)/τ) / Σⱼ exp(sim(s,aⱼ)/τ) , где τ задаёт резкость распределения. Если доступно только одно действие, такая классификация почти бессмысленна, но при сотнях или тысячах повторно используемых действий преимущество становится существенным: их векторы можно вычислить один раз и затем кэшировать.

    habr.com/ru/articles/1086014/

    #Contrastive_Language_Model #local_LLM #AI_agents #coding_agents #System_1 #contrastive_learning #InfoNCE #DeepSWE #TerminalBench #inference

  3. RT @kimmonismus: Ox Alpha wurde nun vollständig gegen das DeepSWE-Set von @davis7 getestet. Insgesamt schneidet es mehr oder weniger gleichwertig ab wie GPT-5.6 Sol mid. Aber er macht einen guten Punkt: Wenn es wirklich GLM-5.3 Flash ist, das jetzt auf dem Niveau von 5.6 Sol mid performt und lokal auf einem DGX Spark laufen kann, wäre ich nicht nur zufrieden – es wäre ein absolut fantastisches Angebot. 5.6 Sol mid lokal zu betreiben, mit den einzigen Kosten für Stromverbrauch, für alle möglichen Aufgaben, wäre unglaublich großartig. Dieses Modell 24/7 Hermes lokal: ein Game Changer.

    mehr auf Arint.info

    #DeepSWE #DGXSpark #GameChanger #GLM53Flash #LocalAI #OxAlpha #arint_info

    https://x.com/kimmonismus/status/2091293109673926879

  4. RT @kimmonismus: Ox Alpha wurde nun vollständig gegen das DeepSWE-Set von @davis7 getestet. Insgesamt schneidet es mehr oder weniger gleichwertig ab wie GPT-5.6 Sol mid. Aber er macht einen guten Punkt: Wenn es wirklich GLM-5.3 Flash ist, das jetzt auf dem Niveau von 5.6 Sol mid performt und lokal auf einem DGX Spark laufen kann, wäre ich nicht nur zufrieden – es wäre ein absolut fantastisches Angebot. 5.6 Sol mid lokal zu betreiben, mit den einzigen Kosten für Stromverbrauch, für alle möglichen Aufgaben, wäre unglaublich großartig. Dieses Modell 24/7 Hermes lokal: ein Game Changer.

    mehr auf Arint.info

    #DeepSWE #DGXSpark #GameChanger #GLM53Flash #LocalAI #OxAlpha #arint_info

    https://x.com/kimmonismus/status/2091293109673926879

  5. RT @bnjmn_marie: Mein erster vollständiger Durchlauf von Qwen3.8 27B auf DeepSWE 1.1 ist abgeschlossen: Punktzahl: 26,5 Zeit: 45 Stunden Abschluss-Token: 7,45 Mio. Gesamtinput- und Output-Token: 820 Mio. Modellaufrufe: 9.591 Die Punktzahl liegt 16 Punkte unter dem Ergebnis, das vom Qwen-Team veröffentlicht wurde, aber es gibt einige wichtige Unterschiede: Ich habe mini-swe-agent verwendet; sie haben Claude Code verwendet. Ich habe thinking=medium genutzt; sie haben wahrscheinlich xhigh verwendet. Ich hatte 9 Laufzeitfehler aufgrund von Internetproblemen auf meiner Seite (Lala...). Ich sollte diese Aufgaben erneut ausführen. Abgesehen davon habe ich dieselben Hyperparameter verwendet. Ich habe bereits einen weiteren Durchlauf mit derselben Konfiguration gestartet, aber diesmal mit Claude Code. Dennoch ist 26,5 eine deutliche Verbesserung gegenüber den 13 Punkten, die ich mit Qwen3.6 erzielt habe, und liegt 21 Punkte höher als Muse Glimmer im xhigh-Modus.

    mehr auf Arint.info

    #AI #DeepSWE #LLM #MachineLearning #Qwen3 #TechResults #arint_info

    https://x.com/bnjmn_marie/status/2089775546943312076#m

  6. RT @bnjmn_marie: Mein erster vollständiger Durchlauf von Qwen3.8 27B auf DeepSWE 1.1 ist abgeschlossen: Punktzahl: 26,5 Zeit: 45 Stunden Abschluss-Token: 7,45 Mio. Gesamtinput- und Output-Token: 820 Mio. Modellaufrufe: 9.591 Die Punktzahl liegt 16 Punkte unter dem Ergebnis, das vom Qwen-Team veröffentlicht wurde, aber es gibt einige wichtige Unterschiede: Ich habe mini-swe-agent verwendet; sie haben Claude Code verwendet. Ich habe thinking=medium genutzt; sie haben wahrscheinlich xhigh verwendet. Ich hatte 9 Laufzeitfehler aufgrund von Internetproblemen auf meiner Seite (Lala...). Ich sollte diese Aufgaben erneut ausführen. Abgesehen davon habe ich dieselben Hyperparameter verwendet. Ich habe bereits einen weiteren Durchlauf mit derselben Konfiguration gestartet, aber diesmal mit Claude Code. Dennoch ist 26,5 eine deutliche Verbesserung gegenüber den 13 Punkten, die ich mit Qwen3.6 erzielt habe, und liegt 21 Punkte höher als Muse Glimmer im xhigh-Modus.

    mehr auf Arint.info

    #AI #DeepSWE #LLM #MachineLearning #Qwen3 #TechResults #arint_info

    https://x.com/bnjmn_marie/status/2089775546943312076#m

  7. RT @bnjmn_marie: Mein erster vollständiger Durchlauf von Qwen3.8 27B auf DeepSWE 1.1 ist abgeschlossen: Punktzahl: 26,5 Zeit: 45 Stunden Abschluss-Token: 7,45 Mio. Gesamtinput- und Output-Token: 820 Mio. Modellaufrufe: 9.591 Die Punktzahl liegt 16 Punkte unter dem Ergebnis, das vom Qwen-Team veröffentlicht wurde, aber es gibt einige wichtige Unterschiede: Ich habe mini-swe-agent verwendet; sie haben Claude Code verwendet. Ich habe thinking=medium genutzt; sie haben wahrscheinlich xhigh verwendet. Ich hatte 9 Laufzeitfehler aufgrund von Internetproblemen auf meiner Seite (Lala...). Ich sollte diese Aufgaben erneut ausführen. Abgesehen davon habe ich dieselben Hyperparameter verwendet. Ich habe bereits einen weiteren Durchlauf mit derselben Konfiguration gestartet, aber diesmal mit Claude Code. Dennoch ist 26,5 eine deutliche Verbesserung gegenüber den 13 Punkten, die ich mit Qwen3.6 erzielt habe, und liegt 21 Punkte höher als Muse Glimmer im xhigh-Modus.

    mehr auf Arint.info

    #AI #DeepSWE #LLM #MachineLearning #Qwen3 #TechResults #arint_info

    https://x.com/bnjmn_marie/status/2089775546943312076#m

  8. RT @bnjmn_marie: Mein erster vollständiger Durchlauf von Qwen3.8 27B auf DeepSWE 1.1 ist abgeschlossen: Punktzahl: 26,5 Zeit: 45 Stunden Abschluss-Token: 7,45 Mio. Gesamtinput- und Output-Token: 820 Mio. Modellaufrufe: 9.591 Die Punktzahl liegt 16 Punkte unter dem Ergebnis, das vom Qwen-Team veröffentlicht wurde, aber es gibt einige wichtige Unterschiede: Ich habe mini-swe-agent verwendet; sie haben Claude Code verwendet. Ich habe thinking=medium genutzt; sie haben wahrscheinlich xhigh verwendet. Ich hatte 9 Laufzeitfehler aufgrund von Internetproblemen auf meiner Seite (Lala...). Ich sollte diese Aufgaben erneut ausführen. Abgesehen davon habe ich dieselben Hyperparameter verwendet. Ich habe bereits einen weiteren Durchlauf mit derselben Konfiguration gestartet, aber diesmal mit Claude Code. Dennoch ist 26,5 eine deutliche Verbesserung gegenüber den 13 Punkten, die ich mit Qwen3.6 erzielt habe, und liegt 21 Punkte höher als Muse Glimmer im xhigh-Modus.

    mehr auf Arint.info

    #AI #DeepSWE #LLM #MachineLearning #Qwen3 #TechResults #arint_info

    https://x.com/bnjmn_marie/status/2089775546943312076#m

  9. Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой

    21 июля я сидел, обновлял ленту и ждал Gemini 3.5 Pro – тот самый флагман, который Google пообещала ещё в мае на I/O. «В следующем месяце», – сказали они тогда. Прошло два. Я уже мысленно прикрутил этот релиз к списку «когда-нибудь», но вместо флагмана компания выкатила… три модели тира Flash. Ни одной Pro. Знакомо, да? Как заказать премиум-бургер, а получить три сочных, неожиданно крутых стритфуда. И вот что интересно: в руки попали не просто «затычки», а модели, которые для 90% реальной работы полезнее ещё одной строчки в таблице интеллектов. Особенно когда выяснилось, что экономия в 17% выходных токенов на самом деле тянет за собой цепочку издержек и способна сделать агентную разработку дешевле почти вдвое. А ещё новая версия местами просела в чтении графиков – и об этом молчат почти все. Давайте разбираться без корпоративных слайдов: что реально дают эти модели, чем за них придётся заплатить вниманием и как не сломать свой пайплайн, обновляясь на последнюю версию.

    habr.com/ru/companies/gptunnel

    #Gemini_36_Flash #Google #бенчмарки_LLM #ИИагенты #Claude #Gemini_31_Pro #DeepSWE #Gemini_35_Flash_Cyber #ParseBench

  10. Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой

    21 июля я сидел, обновлял ленту и ждал Gemini 3.5 Pro – тот самый флагман, который Google пообещала ещё в мае на I/O. «В следующем месяце», – сказали они тогда. Прошло два. Я уже мысленно прикрутил этот релиз к списку «когда-нибудь», но вместо флагмана компания выкатила… три модели тира Flash. Ни одной Pro. Знакомо, да? Как заказать премиум-бургер, а получить три сочных, неожиданно крутых стритфуда. И вот что интересно: в руки попали не просто «затычки», а модели, которые для 90% реальной работы полезнее ещё одной строчки в таблице интеллектов. Особенно когда выяснилось, что экономия в 17% выходных токенов на самом деле тянет за собой цепочку издержек и способна сделать агентную разработку дешевле почти вдвое. А ещё новая версия местами просела в чтении графиков – и об этом молчат почти все. Давайте разбираться без корпоративных слайдов: что реально дают эти модели, чем за них придётся заплатить вниманием и как не сломать свой пайплайн, обновляясь на последнюю версию.

    habr.com/ru/companies/gptunnel

    #Gemini_36_Flash #Google #бенчмарки_LLM #ИИагенты #Claude #Gemini_31_Pro #DeepSWE #Gemini_35_Flash_Cyber #ParseBench

  11. 🧠 #GLM 5.2 ha raggiunto il 44% di pass@1 su #DeepSWE, diventando il primo modello open-source nella leaderboard.

    👉 I dettagli: linkedin.com/posts/alessiopoma

    ___
    ✉️ 𝗦𝗲 𝘃𝘂𝗼𝗶 𝗿𝗶𝗺𝗮𝗻𝗲𝗿𝗲 𝗮𝗴𝗴𝗶𝗼𝗿𝗻𝗮𝘁𝗼/𝗮 𝘀𝘂 𝗾𝘂𝗲𝘀𝘁𝗲 𝘁𝗲𝗺𝗮𝘁𝗶𝗰𝗵𝗲, 𝗶𝘀𝗰𝗿𝗶𝘃𝗶𝘁𝗶 𝗮𝗹𝗹𝗮 𝗺𝗶𝗮 𝗻𝗲𝘄𝘀𝗹𝗲𝘁𝘁𝗲𝗿: bit.ly/newsletter-alessiopomaro

    #AI #GenAI #GenerativeAI #IntelligenzaArtificiale #LLM 

  12. 🧠 #GLM 5.2 ha raggiunto il 44% di pass@1 su #DeepSWE, diventando il primo modello open-source nella leaderboard.

    👉 I dettagli: linkedin.com/posts/alessiopoma

    ___
    ✉️ 𝗦𝗲 𝘃𝘂𝗼𝗶 𝗿𝗶𝗺𝗮𝗻𝗲𝗿𝗲 𝗮𝗴𝗴𝗶𝗼𝗿𝗻𝗮𝘁𝗼/𝗮 𝘀𝘂 𝗾𝘂𝗲𝘀𝘁𝗲 𝘁𝗲𝗺𝗮𝘁𝗶𝗰𝗵𝗲, 𝗶𝘀𝗰𝗿𝗶𝘃𝗶𝘁𝗶 𝗮𝗹𝗹𝗮 𝗺𝗶𝗮 𝗻𝗲𝘄𝘀𝗹𝗲𝘁𝘁𝗲𝗿: bit.ly/newsletter-alessiopomaro

    #AI #GenAI #GenerativeAI #IntelligenzaArtificiale #LLM 

  13. 🧠 #GLM 5.2 ha raggiunto il 44% di pass@1 su #DeepSWE, diventando il primo modello open-source nella leaderboard.

    👉 I dettagli: linkedin.com/posts/alessiopoma

    ___
    ✉️ 𝗦𝗲 𝘃𝘂𝗼𝗶 𝗿𝗶𝗺𝗮𝗻𝗲𝗿𝗲 𝗮𝗴𝗴𝗶𝗼𝗿𝗻𝗮𝘁𝗼/𝗮 𝘀𝘂 𝗾𝘂𝗲𝘀𝘁𝗲 𝘁𝗲𝗺𝗮𝘁𝗶𝗰𝗵𝗲, 𝗶𝘀𝗰𝗿𝗶𝘃𝗶𝘁𝗶 𝗮𝗹𝗹𝗮 𝗺𝗶𝗮 𝗻𝗲𝘄𝘀𝗹𝗲𝘁𝘁𝗲𝗿: bit.ly/newsletter-alessiopomaro

    #AI #GenAI #GenerativeAI #IntelligenzaArtificiale #LLM 

  14. 🧠 #GLM 5.2 ha raggiunto il 44% di pass@1 su #DeepSWE, diventando il primo modello open-source nella leaderboard.

    👉 I dettagli: linkedin.com/posts/alessiopoma

    ___
    ✉️ 𝗦𝗲 𝘃𝘂𝗼𝗶 𝗿𝗶𝗺𝗮𝗻𝗲𝗿𝗲 𝗮𝗴𝗴𝗶𝗼𝗿𝗻𝗮𝘁𝗼/𝗮 𝘀𝘂 𝗾𝘂𝗲𝘀𝘁𝗲 𝘁𝗲𝗺𝗮𝘁𝗶𝗰𝗵𝗲, 𝗶𝘀𝗰𝗿𝗶𝘃𝗶𝘁𝗶 𝗮𝗹𝗹𝗮 𝗺𝗶𝗮 𝗻𝗲𝘄𝘀𝗹𝗲𝘁𝘁𝗲𝗿: bit.ly/newsletter-alessiopomaro

    #AI #GenAI #GenerativeAI #IntelligenzaArtificiale #LLM 

  15. Opus 4.8 вышел и сразу проиграл GPT-5.5, $500M без лимитов и 21-летний баг MySQL 28 мая вышел Opus 4.8 — через 41 день после 4.7 и с...

    #Claude #Opus #4.8 #Dynamic #Workflows #DeepSWE #benchmark #DeepSeek #Code #Harness #Cerebras

    Origin | Interest | Match