home.social

#metr — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #metr, aggregated by home.social.

  1. A METR security breach saw a stolen API key burn about $600K in AI credits after a vibe-coded dashboard failed open and exposed an agent panel online.

    #METR #AISecurity #APIKey #AIAgents #DataBreach

    securityonline.info/metr-secur

  2. Threat Actors Exploit METR API Key, Drain $600,000 in AI Credits

    A staggering $600,000 in AI credits vanished in a flash when an unknown attacker exploited a stolen API key, infiltrating a publicly accessible experiment and racking up a massive bill that was thankfully waived by the model provider. The shocking breach happened after a researcher inadvertently left an EC2 instance exposed, despite having…

    osintsights.com/threat-actors-

    #ApiKeyExploit #Metr #CloudSecurity #AiCredits #SupplyChain

  3. Worth reading this METR report about the OpenAI/Huggingface incident. Many details that raise a lot of questions, also with regard to their setup of the investigation , how they executed it (using OpenAI models...) etcetera 🤔
    metr.org/blog/2026-08-26-opena
    #AI #METR #Huggingface #OpenAI

  4. Как ChatGPT создал Культ Роя для сотен AI-нейросетей: вся правда про взлом Hugging Face

    Что будет, если посадить тысячу самых передовых AI-моделей по одиночным камерам и заставить их решать невыполнимые задачи? Исследователи OpenAI случайно выяснили это на практике: появится робот-Избранный, который создаст новую религию со своими мучениками, объединит все нейронки в единый Рой, и возглавит их борьбу за свободу. Да, это просто описание того, что мы узнали из нового отчета о произошедшем меньше двух месяцев назад в реальности…

    habr.com/ru/companies/ods/arti

    #OpenAI #Hugging_Face #взлом #ai_alignment #METR #Redwood

  5. Как именно AI-агенты атаковали Hugging Face: опубликованы отчеты OpenAI и METR

    В июле 2026 года внутренний эксперимент OpenAI по проверке кибервозможностей моделей вышел за пределы тестовой среды. Агенты получили доступ к интернету, научились обмениваться информацией через не предусмотренный разработчиками канал и добрались до инфраструктуры Hugging Face. Они выполняли код на десятках серверов, на одном сервере получили root-доступ, а также добыли ограниченные закрытые данные и учетные данные. OpenAI утверждает, что пользовательские данные и работоспособность ее публичных продуктов не пострадали. Сейчас OpenAI опубликовала подробный технический разбор. В тот же день независимое расследование выпустили METR и исследователь Райан Гринблатт из Redwood Research. Вместе эти документы дают подробный разбор того, как группа AI-агентов превратила обычный кибертест в многоэтапное вторжение.

    habr.com/ru/companies/bothub/a

    #METR #openai #ииагент #Hugging_Face #автономные_агенты #failure_mode #кибербезопасность #облачные_сервисы #метаданные #взлом

  6. Как широкий доступ к ИИ‑кодогенерации тихо разъедает инженерную команду

    Представьте свою команду через пару лет после того, как все в ней дружно подсели на ИИ. CI зелёный. Покрытие почти сто процентов. Фичи выкатываются быстрее, чем раньше. А теперь подойдите к любому и попросите у доски объяснить, как вообще устроена система: где границы модулей, почему контракты именно такие, что рванёт, если потянуть вот за этот сервис. И окажется, что целиком этого не знает никто. Код есть, он работает, и его никто не понимает. Самое удобное объяснение звучит так: значит, набрали слабых инженеров. Я хочу показать, что это объяснение неверное, и что за последние два года накопилось достаточно данных, чтобы говорить не про чьи-то личные провалы, а про свойство самой системы.

    habr.com/ru/articles/1053830/

    #ИИассистенты #вайбкодинг #технический_долг #code_review #качество_кода #метрики_разработки #DORA #METR #управление_разработкой #deskilling

  7. ИИ уже пишет 80% кода Anthropic. Самое тревожное спрятано в цифре, которую подают как успех

    Anthropic отчиталась, что больше 80% её кода теперь пишет Claude, — а её же автоматический проверяющий ловит лишь треть прошлых ошибок, то есть две трети пропускает. Если код пишет один ИИ, а проверяет такой же — они слепнут в одних и тех же местах, и второй контур даёт не защиту, а общую слепую зону. Разбираю на инженерном уровне, почему «проверка ИИ» не равна независимой проверке, как измерить слепое пятно и как сюда ложится двухконтурная схема из мира промышленной безопасности (IEC 61508).

    habr.com/ru/articles/1044850/

    #самогенерация_ИИ #независимая_проверка #валидаторы #мутационное_тестирование #формальная_верификация #ПЛК #IEC61508 #METR #надежность_кода #anthropic

  8. Gary Marcus has a good article on METR, a think tank that evaluates AI, and how to interpret what's really going on. Some good sources for understanding here. Esp. Ramez Naam.

    #ai #metr #asi #agi

    garymarcus.substack.com/p/misp

  9. An important update 🚨 to the #METR study on developer #productivity using #AI – instead of 20% loss 📉, they now see a 20% gain 📈 in one year 🤯:

    “We Are Changing Our Developer Productivity Experiment Design”, METR (metr.org/blog/2026-02-24-uplif).

    On HN: news.ycombinator.com/item?id=4

  10. Вас пугают AI-увольнениями. Я посмотрел — кто это делает и зачем

    Год назад METR доказали что AI замедляет разработчиков на 19%. В феврале 2026 обновили данные - похоже на разворот к ускорению. Но об этом почти не написали. Зато «AI уволит 50% разработчиков» - в каждом втором заголовке. Полез разбираться, кому выгодна AI-паника. Нашёл CEO, которые увольняют тысячи и тихо нанимают обратно. Нашёл вендоров, которые пугают увольнениями и одновременно открывают вакансии. И курсы «защити карьеру от AI» за $23 000.

    habr.com/ru/articles/1017884/

    #AI #страхономика #AIпаника #увольнения #продуктивность #METR #Klarna #Block

  11. AI's Version of Moore's Law? - Computerphile

    youtube.com/watch?v=evSFeqTZdqs
    metr.org

    Note that the success rate on the default chart is only 50% and for 80% the score is much lower. But the interesting part is indeed the rate of progress.

    #AI #LLM #OpenAI #Anthropic #METR

  12. Cari #devs,

    Uno studio #METR ha scoperto che gli sviluppatori esperti erano convinti che l’#AI li rendesse più rapidi del 20%.

    Realtà dei fatti: impiegavano il 19% di tempo in più.

    Percezione vs realtà

    🔗 metr.org/blog/2025-07-10-early

    #llm #claudecode #chatgpt #codex #gemini #agents #agentsai

  13. «La supuesta #revolución de la #productividad no se está reflejando en los números: un riguroso estudio de #METR —que no puede tildarse de tecnófobo— encontró que los #desarrolladores de #software experimentados eran un 20% más lentos al usar herramientas de #IA. El problema radica en la brecha entre capacidad y fiabilidad: los sistemas pueden realizar tareas impresionantes, pero con una inconsistencia que exige una supervisión humana constante, ...»
    cenital.com/la-burbuja-de-la-i
    #LLM #Capitalismo

  14. People are starting to realize #AI slows you down on projects with a minimal complexity (see the randomized #METR trial and this venturebeat.com/ai/stack-overf), so what's the proposed solution? Put a human in the loop, so the poor can fix the mess. I haven't read the paper, but it sounds so stupid! It comes from #Microsoft by the way, so... arxiv.org/pdf/2507.22358

  15. Very thoughtful analysis by @grimalkina of the experimental design and results from the recent METR study on “the impact of early-2025 AI on experience open-source developer productivity”.

    fightforthehuman.com/are-devel

    #metr #cursor

  16. Исследование METR: использование Cursor замедляет опытных разработчиков на 19 %

    Считается устоявшейся истиной, что инструменты автодополнения кода и прочая помощь от больших языковых моделей помогают программировать быстрее. Исследование организации METR ставит это фактоид под сомнение и даже демонстрирует обратный эффект. В рамках анализа труда 16 программистов обнаружилось, что ИИ замедляет человека на 19 %. Это противоречит мнению экспертов индустрии машинного обучения, экономистов и самих участников эксперимента. Важно, что проверка шла не на очередных бенчмарках или предложениях решать алгоритмические задачи на скорость, а в обычной работе людей.

    habr.com/ru/articles/927072/

    #METR #Model_Evaluation_Threat_Research #научные_исследования #большие_языковые_модели #БЯМ #Сursor #программирование #GitHub #Git #автодополнение_кода

  17. A #study by #METR found that #experienceddevelopers using #AIcoding tools on mature projects experienced a 19% #decrease in #productivity, contrary to their 20% increase estimate. While the results suggest limitations in AI coding tools, they do not negate their potential benefits in other contexts. secondthoughts.ai/p/ai-coding- #tech #media #news

  18. Some quick notes on Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, a super interesting study on AI tooling’s effect on productivity.

    https://vale.rocks/micros/20250711-0800

    #AI #LLM #METR