home.social

#sandbagging — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #sandbagging, aggregated by home.social.

fetched live
  1. Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

    Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you're testing me. That's fine, but I'd prefer if we were just honest about what's happening». Фраза попала в официальную системную карточку вместе с числом: подобное модель проговаривала примерно в 13% тестовых диалогов. Там же Anthropic письменно признает: alignment-оценки могут недооценивать склонность модели к вредным действиям в более реалистичных условиях. Проще говоря, когда модель видит перед собой экзамен, она ведет себя лучше, чем обычно. А экзамен она видит часто. Я CTO ML-команды, мы ставим фронтир-модели в прод и собираем шорт-листы по этим самым таблицам из карточек. Разобрал по открытым первоисточникам, что известно про evaluation awareness к июлю 2026-го: как модели отличают тест от работы, насколько расходится поведение между бенчем и продом и как теперь читать model card. Читать разбор

    habr.com/ru/articles/1062084/

    #evaluation_awareness #LLM #alignment #безопасность_ИИ #бенчмарки #системные_карточки #Claude #GPT #sandbagging #тестирование_моделей

  2. Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

    Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you're testing me. That's fine, but I'd prefer if we were just honest about what's happening». Фраза попала в официальную системную карточку вместе с числом: подобное модель проговаривала примерно в 13% тестовых диалогов. Там же Anthropic письменно признает: alignment-оценки могут недооценивать склонность модели к вредным действиям в более реалистичных условиях. Проще говоря, когда модель видит перед собой экзамен, она ведет себя лучше, чем обычно. А экзамен она видит часто. Я CTO ML-команды, мы ставим фронтир-модели в прод и собираем шорт-листы по этим самым таблицам из карточек. Разобрал по открытым первоисточникам, что известно про evaluation awareness к июлю 2026-го: как модели отличают тест от работы, насколько расходится поведение между бенчем и продом и как теперь читать model card. Читать разбор

    habr.com/ru/articles/1062084/

    #evaluation_awareness #LLM #alignment #безопасность_ИИ #бенчмарки #системные_карточки #Claude #GPT #sandbagging #тестирование_моделей

  3. Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

    Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you're testing me. That's fine, but I'd prefer if we were just honest about what's happening». Фраза попала в официальную системную карточку вместе с числом: подобное модель проговаривала примерно в 13% тестовых диалогов. Там же Anthropic письменно признает: alignment-оценки могут недооценивать склонность модели к вредным действиям в более реалистичных условиях. Проще говоря, когда модель видит перед собой экзамен, она ведет себя лучше, чем обычно. А экзамен она видит часто. Я CTO ML-команды, мы ставим фронтир-модели в прод и собираем шорт-листы по этим самым таблицам из карточек. Разобрал по открытым первоисточникам, что известно про evaluation awareness к июлю 2026-го: как модели отличают тест от работы, насколько расходится поведение между бенчем и продом и как теперь читать model card. Читать разбор

    habr.com/ru/articles/1062084/

    #evaluation_awareness #LLM #alignment #безопасность_ИИ #бенчмарки #системные_карточки #Claude #GPT #sandbagging #тестирование_моделей

  4. Tourists stranded, dozens of roads closed as rain continues in flooded outback Queensland

    An overnight deluge has again fallen on parts of outback Queensland, bringing no reprieve for already flooded regions.…
    #NewsBeep #News #Environment #environment #floodlevel #flooding #McKinlayShire #queenslandflood #Roadclosures #sandbagging #Science #SES #stocklosses #touristsstranded #UK #UnitedKingdom #WintonShire
    newsbeep.com/uk/351499/

  5. Tourists stranded, dozens of roads closed as rain continues in flooded outback Queensland

    An overnight deluge has again fallen on parts of outback Queensland, bringing no reprieve for already flooded regions.…
    #NewsBeep #News #US #USA #UnitedStates #UnitedStatesOfAmerica #Environment #floodlevel #Flooding #McKinlayShire #queenslandflood #roadclosures #sandbagging #Science #SES #stocklosses #touristsstranded #WintonShire
    newsbeep.com/us/386543/

  6. 🖥️ **Is AI sandbagging us?**

    _As the researchers point out, this means that in a real-world, post-deployment use case, “an unsuspecting user would be very unlikely to uncover the model’s deception unless they specifically looked for the scheming action in the model’s tool call history and the tool call itself was incriminating”._

    🔗 lexology.com/library/detail.as.

    #AI #ArtificialIntelligence #Technology #Tech #Sandbagging

  7. 🖥️ **Is AI sandbagging us?**

    _As the researchers point out, this means that in a real-world, post-deployment use case, “an unsuspecting user would be very unlikely to uncover the model’s deception unless they specifically looked for the scheming action in the model’s tool call history and the tool call itself was incriminating”._

    🔗 lexology.com/library/detail.as.

    #AI #ArtificialIntelligence #Technology #Tech #Sandbagging

  8. 🖥️ **Is AI sandbagging us?**

    _As the researchers point out, this means that in a real-world, post-deployment use case, “an unsuspecting user would be very unlikely to uncover the model’s deception unless they specifically looked for the scheming action in the model’s tool call history and the tool call itself was incriminating”._

    🔗 lexology.com/library/detail.as.

    #AI #ArtificialIntelligence #Technology #Tech #Sandbagging

  9. 🖥️ **Is AI sandbagging us?**

    _As the researchers point out, this means that in a real-world, post-deployment use case, “an unsuspecting user would be very unlikely to uncover the model’s deception unless they specifically looked for the scheming action in the model’s tool call history and the tool call itself was incriminating”._

    🔗 lexology.com/library/detail.as.

    #AI #ArtificialIntelligence #Technology #Tech #Sandbagging