#guardrails — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #guardrails, aggregated by home.social.
-
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.
https://habr.com/ru/articles/1081286/
#opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana
-
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.
https://habr.com/ru/articles/1081286/
#opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana
-
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.
https://habr.com/ru/articles/1081286/
#opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana
-
GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)
Всем привет, на связи команда HiveTrace! Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?". Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются. Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях. CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов. HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.
https://habr.com/ru/companies/raft/articles/1067854/
#llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #promptinjection #benchmarking #opensource
-
How it started: "We can vibe-code our web apps from now on! It'll be great!"
How it's going: https://translate.kagi.com/?from=en&to=valley%20girl%20but%20also%20describe%20iteration%20in%20Python&text=How%20are%20you%20feeling%20today%3F
#Kagi #AI #LLM #translate #guardrails #VibeCode #vibecoding #security #WeveHeardOfIt #ValleyGirl #Python
-
Дрейф, потеря контекста и «уверенная чушь»: протокол восстановления SDX-S
LLM умеют многое, но иногда ломаются так, что виноватым выглядит пользователь: контекст уезжает, инструкции исчезают, инструмент падает, а модель продолжает говорить уверенно, как будто всё нормально. Мы смотрим на это не как на “плохой ответ”, а как на деградацию состояния диалога . Если не поймать момент, по цепочке шагов и становится всё убедительнее. Мы собрали процедуру SDX-S: триггеры → диагностика причины → восстановление → критерии возврата . Ниже: состояния, “дашборд” и два кейса, где это реально спасает.
https://habr.com/ru/articles/985334/
#сезон_ии_в_разработке #llmjs #chatgpt5 #prompt_engineering #guardrails #hallucinationsinai #observability #finite_state_machine #tool_use #reliability
-
Дрейф, потеря контекста и «уверенная чушь»: протокол восстановления SDX-S
LLM умеют многое, но иногда ломаются так, что виноватым выглядит пользователь: контекст уезжает, инструкции исчезают, инструмент падает, а модель продолжает говорить уверенно, как будто всё нормально. Мы смотрим на это не как на “плохой ответ”, а как на деградацию состояния диалога . Если не поймать момент, по цепочке шагов и становится всё убедительнее. Мы собрали процедуру SDX-S: триггеры → диагностика причины → восстановление → критерии возврата . Ниже: состояния, “дашборд” и два кейса, где это реально спасает.
https://habr.com/ru/articles/985334/
#сезон_ии_в_разработке #llmjs #chatgpt5 #prompt_engineering #guardrails #hallucinationsinai #observability #finite_state_machine #tool_use #reliability
-
Дрейф, потеря контекста и «уверенная чушь»: протокол восстановления SDX-S
LLM умеют многое, но иногда ломаются так, что виноватым выглядит пользователь: контекст уезжает, инструкции исчезают, инструмент падает, а модель продолжает говорить уверенно, как будто всё нормально. Мы смотрим на это не как на “плохой ответ”, а как на деградацию состояния диалога . Если не поймать момент, по цепочке шагов и становится всё убедительнее. Мы собрали процедуру SDX-S: триггеры → диагностика причины → восстановление → критерии возврата . Ниже: состояния, “дашборд” и два кейса, где это реально спасает.
https://habr.com/ru/articles/985334/
#сезон_ии_в_разработке #llmjs #chatgpt5 #prompt_engineering #guardrails #hallucinationsinai #observability #finite_state_machine #tool_use #reliability