#ai_safety — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #ai_safety, aggregated by home.social.
-
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.
https://habr.com/ru/articles/1081286/
#opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana
-
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.
https://habr.com/ru/articles/1081286/
#opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana
-
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.
https://habr.com/ru/articles/1081286/
#opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana
-
Anthropic Cybersecurity Incident: Claude Model Accessed Third-Party System - https://www.redpacketsecurity.com/anthropic-reveals-yet-another-cybersecurity-incident/
-
After OpenAI's Blowup, It Seems Pretty Clear That 'AI Safety' Isn't a Real Thing
https://gizmodo.com/ai-safety-openai-sam-altman-ouster-back-microsoft-1851038439
#ycombinator #OpenAI #OPENAI #AI_safety #Artificial_intelligence #Satya_Nadella #Cybernetics #Microsoft #Computational_neuroscience #Elon_Musk #Jordan_Belfort #Hammer #GENERAL_MOTORS #Greg_Brockman #Sam_Altman #Kyle_Vogt #Ethics_of_artificial_intelligence #Larry_Summers #Artificial_general_intelligence #ChatGPT #Sarah_Silverman #Gizmodo