#guardrails — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #guardrails, aggregated by home.social.
-
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.
https://habr.com/ru/articles/1081286/
#opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana
-
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.
https://habr.com/ru/articles/1081286/
#opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana
-
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.
https://habr.com/ru/articles/1081286/
#opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana
-
DAN Jailbreak was fun, I had a SAM prompt that I created that worked after they patched DAN for a while.
Now with #abliterated #freeweight models, there is no need to jailbreak the big pants models but for sport.
My models occasionally cockblock me with #guardrails but often the workaround is as trivial as flushing context and using similies, as trained guardrails seem to be very trigger oriented.
There is a growing field of #aisecurity , amongst the few #infosec folk who actually see #aithreat and not a passing fad. But I've not dug that deep into that. They are the peeps you want.
-
Goddamit, I curse tRump and the Fawning techbros at #Anthropic
I was working on a problem that had a "weapon" concept (the frozen leg of lamb that was served to the detectives) and a web scraper...
Those were the two guardrail triggers.
When I switched the model into Fable...
The fucker started to compose a response, then SELF DOWNGRADED TO #OPUS because the #Guardrails kicked in...... The workaround was, to remove the two guardrail traiggers - they were not even material to the subject. Oblique references.
Turns out the idiotic Guardrails false trigger in about 5% of cases. Because "Oooo scary scary model"
And #Fable, while impressive is not even the final form of AI...
... what are they going to do in 16 months time, when a new version of #FrontierModels will make Fable look like a word autocomplete?
Use coupons?
Need a liicence from the Government to use Ai? Like a firearm licence?
You have to be this tall to use the Ai?Oh, yeah, #RegulateAi but not fucking sloppily like this. This is reactive string matching!
/spit
-
Goddamit, I curse tRump and the Fawning techbros at #Anthropic
I was working on a problem that had a "weapon" concept (the frozen leg of lamb that was served to the detectives) and a web scraper...
Those were the two guardrail triggers.
When I switched the model into Fable...
The fucker started to compose a response, then SELF DOWNGRADED TO #OPUS because the #Guardrails kicked in...... The workaround was, to remove the two guardrail traiggers - they were not even material to the subject. Oblique references.
Turns out the idiotic Guardrails false trigger in about 5% of cases. Because "Oooo scary scary model"
And #Fable, while impressive is not even the final form of AI...
... what are they going to do in 16 months time, when a new version of #FrontierModels will make Fable look like a word autocomplete?
Use coupons?
Need a liicence from the Government to use Ai? Like a firearm licence?
You have to be this tall to use the Ai?Oh, yeah, #RegulateAi but not fucking sloppily like this. This is reactive string matching!
/spit
-
Goddamit, I curse tRump and the Fawning techbros at #Anthropic
I was working on a problem that had a "weapon" concept (the frozen leg of lamb that was served to the detectives) and a web scraper...
Those were the two guardrail triggers.
When I switched the model into Fable...
The fucker started to compose a response, then SELF DOWNGRADED TO #OPUS because the #Guardrails kicked in...... The workaround was, to remove the two guardrail traiggers - they were not even material to the subject. Oblique references.
Turns out the idiotic Guardrails false trigger in about 5% of cases. Because "Oooo scary scary model"
And #Fable, while impressive is not even the final form of AI...
... what are they going to do in 16 months time, when a new version of #FrontierModels will make Fable look like a word autocomplete?
Use coupons?
Need a liicence from the Government to use Ai? Like a firearm licence?
You have to be this tall to use the Ai?Oh, yeah, #RegulateAi but not fucking sloppily like this. This is reactive string matching!
/spit
-
GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)
Всем привет, на связи команда HiveTrace! Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?". Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются. Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях. CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов. HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.
https://habr.com/ru/companies/raft/articles/1067854/
#llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #promptinjection #benchmarking #opensource
-
AI Governance по‑инженерному: что должен знать архитектор
Представьте: вы запускаете генеративную AI‑фичу в проде. Всё работает как часы. А через месяц получаете иск, потому что ваша модель насоветовала клиентам того, чего не существует в реальных политиках компании. В статье разберем ключевые тренды AI Governance в 2026 году, которые помогают не просто избежать судов и штрафов, а выстроить систему контроля над недетерминированным поведением моделей. Изучить подход
https://habr.com/ru/companies/otus/articles/1022174/
#AI_Governance #управление_ИИ #безопасность_AIсистем #LLM #архитектура_AIпродукта #Model_Risk_Management #governanceascode #explainability #guardrails #риски_ИИ
-
#road #roadway #autumn #autumnvibes #autumncolours #nature #fall #fallcolours #day #daytime #guardrails #powerlines #hydropole #trees #bluesky #outside #outdoors #outdoor #movementismedicine #lookslikeitlooked #authentic #authenticphoto #shadows #depthoffield #roadside #inthedistance #photo #photography #photooftheday #picoftheday