#osworld — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #osworld, aggregated by home.social.
-
Acc. to #OSWorld 2.0 tools like #LabPlot remain essential bc they deliver reliable, domain-specific precision—unlike current #AI agents, which struggle with complex, long-horizon tasks. Even #Claude Opus 4.8 achieves only 20.6% binary accuracy and 54.8% partial score.
#Agents fail to maintain state, track details, or adapt dynamically. :boost_love:
Read more here:
👉 https://osworld-v2.xlang.ai#OpenSource #DataScience #DataAnalysis #Science #DataViz #OpenScience #ChatGPT #LLM #Qwen #Kimi
-
Как тестируют кодинг-агентов в 2026 — и почему вашему продакшну нужен свой бенчмарк
Ни для кого не секрет, что эра «спросить что-то у GPT» постепенно уходит в прошлое. На смену генеративному AI приходит Agentic AI, который не просто проконсультирует, а по вашему запросу придёт и сделает все сам. То же самое и с кодовыми агентами, они не просто отвечают на вопросы, они читают документацию, работают в терминале, дёргают API, правят файлы и в идеале закрывают задачу целиком, от тикета до мёрж-реквеста. Звучит здорово, пока не выясняется, что ваш агент починил баг, сломав при этом три соседних модуля, или молча проигнорировал половину требований из задачи. Короче говоря, агенты умеют халтурить, и делают это красиво. А значит, их нужно постоянно тестировать. Причем тестировать в условиях, максимально приближённых к рабочим: с реальным репозиторием, CI-пайплайном и набором тестов, которые не обманешь. Именно для этого в AI-сообществе появился целый класс таких инструментов как бенчмарки и песочницы, заточенные под оценку агентов. В этой статье мы разберём, какие подходы к тестированию кодинг-агентов существуют сегодня, в чём их сильные и слабые стороны, и расскажем, как мы в
https://habr.com/ru/companies/doubletapp/articles/1040698/
#ml #ai #benchmark #aiагенты #aiagent #swebench #swebench_verified #OSWorld #GAIA #terminalbench
-
🚀 #Anthropic announces major updates to their #AI model lineup:
💻 Upgraded #Claude35Sonnet shows significant improvements:
• Achieves 49% on #SWEbench Verified coding benchmark
• Leads in software engineering capabilities
• Maintains same price and speed as predecessor
• Tested by US and UK #AI Safety Institutes🔄 New #Claude35Haiku introduction:
• Matches #Claude3Opus performance at lower cost
• Scores 40.6% on SWEbench Verified
• Optimized for user-facing products
• Available across multiple cloud platforms🖱️ Pioneering #ComputerUse beta feature:
• Allows AI to navigate interfaces like humans
• Scores 22% on #OSWorld benchmark
• Currently in experimental phase
• Supported by new safety classifiers⚡ Enterprise adoption:
• #GitLab reports 10% improvement in DevSecOps tasks
• #Replit leverages computer use for app evaluation
• #Cognition notes enhanced problem-solving capabilities