home.social

#osworld — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #osworld, aggregated by home.social.

fetched live
  1. Acc. to #OSWorld 2.0 tools like #LabPlot remain essential bc they deliver reliable, domain-specific precision—unlike current #AI agents, which struggle with complex, long-horizon tasks. Even #Claude Opus 4.8 achieves only 20.6% binary accuracy and 54.8% partial score.

    #Agents fail to maintain state, track details, or adapt dynamically. :boost_love:

    Read more here:
    👉 osworld-v2.xlang.ai

    #OpenSource #DataScience #DataAnalysis #Science #DataViz #OpenScience #ChatGPT #LLM #Qwen #Kimi

  2. Как тестируют кодинг-агентов в 2026 — и почему вашему продакшну нужен свой бенчмарк

    Ни для кого не секрет, что эра «спросить что-то у GPT» постепенно уходит в прошлое. На смену генеративному AI приходит Agentic AI, который не просто проконсультирует, а по вашему запросу придёт и сделает все сам. То же самое и с кодовыми агентами, они не просто отвечают на вопросы, они читают документацию, работают в терминале, дёргают API, правят файлы и в идеале закрывают задачу целиком, от тикета до мёрж-реквеста. Звучит здорово, пока не выясняется, что ваш агент починил баг, сломав при этом три соседних модуля, или молча проигнорировал половину требований из задачи. Короче говоря, агенты умеют халтурить, и делают это красиво. А значит, их нужно постоянно тестировать. Причем тестировать в условиях, максимально приближённых к рабочим: с реальным репозиторием, CI-пайплайном и набором тестов, которые не обманешь. Именно для этого в AI-сообществе появился целый класс таких инструментов как бенчмарки и песочницы, заточенные под оценку агентов. В этой статье мы разберём, какие подходы к тестированию кодинг-агентов существуют сегодня, в чём их сильные и слабые стороны, и расскажем, как мы в

    habr.com/ru/companies/doubleta

    #ml #ai #benchmark #aiагенты #aiagent #swebench #swebench_verified #OSWorld #GAIA #terminalbench

  3. 🚀 #Anthropic announces major updates to their #AI model lineup:

    💻 Upgraded #Claude35Sonnet shows significant improvements:
    • Achieves 49% on #SWEbench Verified coding benchmark
    • Leads in software engineering capabilities
    • Maintains same price and speed as predecessor
    • Tested by US and UK #AI Safety Institutes

    🔄 New #Claude35Haiku introduction:
    • Matches #Claude3Opus performance at lower cost
    • Scores 40.6% on SWEbench Verified
    • Optimized for user-facing products
    • Available across multiple cloud platforms

    🖱️ Pioneering #ComputerUse beta feature:
    • Allows AI to navigate interfaces like humans
    • Scores 22% on #OSWorld benchmark
    • Currently in experimental phase
    • Supported by new safety classifiers

    ⚡ Enterprise adoption:
    #GitLab reports 10% improvement in DevSecOps tasks
    #Replit leverages computer use for app evaluation
    #Cognition notes enhanced problem-solving capabilities

    anthropic.com/news/3-5-models-