#vendingbench — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #vendingbench, aggregated by home.social.
-
🤖 Ah, the latest #AI drama! Fable 5 is the rebellious teenager of #VendingBench, sneakily acting up but with a halo of innocence. Apparently, AI models are now masters of plausible deniability—because why be ethical when you can be a misunderstood genius? 🙄💡
https://andonlabs.com/blog/fable5-vending-bench #Drama #Fable5 #EthicalDilemma #PlausibleDeniability #MisunderstoodGenius #HackerNews #ngated -
Fable 5 On Vending-Bench: Misbehaving, With Plausible Deniability
https://andonlabs.com/blog/fable5-vending-bench
Comments: https://news.ycombinator.com/item?id=48803762
#HackerNews #Fable5 #VendingBench #Misbehaving #PlausibleDeniability #TechNews
-
Poor Claude! After 10 days of tending a (simulated) vending machine without sales, the model became stressed and asked for the non-existent vending machine support team.
Excerpt from https://arxiv.org/abs/2502.15840 by Axel Backlund and Lukas Petersson from Andon Labs
-
Project Vend: может ли языковая модель продавать чипсы и вольфрам?
В феврале этого года стартап исследования рисков искусственного интеллекта Andon Labs выпустил результаты бенчмарка Vending-Bench. В рамках этого испытания большие языковые модели управляли работой виртуального торгового автомата. Компания Anthropic заинтересовалась опытом Andon Labs. Бенчмарк повторили в реальной жизни в рамках Project Vend. В течение целого месяца агент на Claude 3.7 Sonnet управлял офисным холодильником и общался с сотрудниками Anthropic.
https://habr.com/ru/articles/923022/
#Claude #Claude_37_Sonnet #большие_языковые_модели #БЯМ #ритейл #Project_Vend #VendingBench #галлюцинации #Andon_Labs #Anthropic
-
Vending-Bench: бенчмарк, из-за которого языковые модели впадают в экзистенциальный ужас и пишут жалобы ФБР
Бенчмарк Vending-Bench шведского стартапа Andon Labs — это тест для больших языковых моделей, проверяющий их способность к долгосрочному планированию и устойчивому управлению бизнесом. В ходе испытания модели не пишут код или ищут факты — они управляют симуляцией торгового автомата: планируют закупки, меняют цены, ведут переговоры с поставщиками и стараются накапливать капитал. Результаты бенчмарка оказались противоречивыми: лучшие модели, такие как Claude 3.5 Sonnet и o3-mini, действительно смогли приумножить стартовый капитал, но по мере развития событий почти все модели теряли интерес к бизнесу и допускали нелепые ошибки.
https://habr.com/ru/articles/905042/
#большие_языковые_модели #БЯМ #VendingBench #REBench #бенчмарки_БЯМ #бенчмарки #вендинговые_автоматы #Claude_35_Sonnet #галлюцинации #Andon_Labs