#guardrails — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #guardrails, aggregated by home.social.
-
Как мы построили multilabel guardrail-классификатор и как мы сделали его в 3 раза быстрее и дешевле
Привет, дорогой читатель! Мы не будем переворачивать календарь, а лучше расскажем, как построили систему, которая ловит небезопасный контент автоматически, в реальном времени и на двух языках. Давайте посмотрим, что у нас получилось и сколько это стоит в деньгах.
https://habr.com/ru/companies/raft/articles/1077768/
#информационная_безопасность #ии #ииагенты #гардрейл #guardrails #ml #bert
-
Как мы построили multilabel guardrail-классификатор и как мы сделали его в 3 раза быстрее и дешевле
Привет, дорогой читатель! Мы не будем переворачивать календарь, а лучше расскажем, как построили систему, которая ловит небезопасный контент автоматически, в реальном времени и на двух языках. Давайте посмотрим, что у нас получилось и сколько это стоит в деньгах.
https://habr.com/ru/companies/raft/articles/1077768/
#информационная_безопасность #ии #ииагенты #гардрейл #guardrails #ml #bert
-
Как мы построили multilabel guardrail-классификатор и как мы сделали его в 3 раза быстрее и дешевле
Привет, дорогой читатель! Мы не будем переворачивать календарь, а лучше расскажем, как построили систему, которая ловит небезопасный контент автоматически, в реальном времени и на двух языках. Давайте посмотрим, что у нас получилось и сколько это стоит в деньгах.
https://habr.com/ru/companies/raft/articles/1077768/
#информационная_безопасность #ии #ииагенты #гардрейл #guardrails #ml #bert
-
Атака на LLM, которую нельзя исправить патчем
Что вершит судьбу LLM в этом мире. Некая незримая инструкция или закон, подобно промту Господнему, парящим над миром? По крайне мере истинно то, что LLM не властен даже над своей волей. В 2025 году главной угрозой кибербезопасности по версии OWASP стал не вирус и не баг, а обычный человеческий язык. Многие думают, что проблему можно решить, просто запретить модели нарушать правила. Но это так не работает. Promt Injection нельзя просто выключить, потому что так вы все сломаете. Как работает главная уязвимость LLM? Почему с ней так тяжело бороться? И что все-таки делать, чтобы защититься от нее?
https://habr.com/ru/companies/bothub/articles/1060310/
#llm #promt_injection #ai #ai_security #promt #owasp #llm_security #guardrails #ии_угроза #bothub
-
2/2
"“If we build #AI systems tt r smarter than us, tt we don’t know how to control, & want to preserve themselves, they'll (do dangerous things) & win,” said Dr Bengio.. To keep such scenarios fr becoming reality, countries need to work together to decide on a common set of #guardrails & metrics to evaluate #risks of AI models.. many techs w te potential to cause harm — fr drugs & aircraft to bridges & elevators — r req'd to undergo #safetytesting & #regulatory scrutiny b4 they can be deployed" -
The “S” in Vibe Coding Stands for Security – Source: securityboulevard.com https://ciso2ciso.com/the-s-in-vibe-coding-stands-for-security-source-securityboulevard-com/ #SecurityBoulevard(Original) #rssfeedpostgeneratorecho #CyberSecurityNews #SecurityBoulevard #vulnerabilities #SocialFacebook #SocialLinkedIn #Cybersecurity #Guardrails #vibecoding #Spotlight #FEATURED #Security #SocialX