#guardrails — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #guardrails, aggregated by home.social.
-
Умеет ли Jev быть guard-моделью для LLM?
За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...
https://habr.com/ru/companies/raft/articles/1085414/
#jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark
-
Умеет ли Jev быть guard-моделью для LLM?
За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...
https://habr.com/ru/companies/raft/articles/1085414/
#jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark
-
Умеет ли Jev быть guard-моделью для LLM?
За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...
https://habr.com/ru/companies/raft/articles/1085414/
#jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark
-
We need a simple bot to respond to emails that would look like it has read the #email before replying to it
@
Training a custom topic identification neural network is expensive, let's use LLM
@
LLM starts #hallucinating and misleads the customers
@
Let's put #guardrails and stricter instructions
@
The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month -
We need a simple bot to respond to emails that would look like it has read the #email before replying to it
@
Training a custom topic identification neural network is expensive, let's use LLM
@
LLM starts #hallucinating and misleads the customers
@
Let's put #guardrails and stricter instructions
@
The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month -
We need a simple bot to respond to emails that would look like it has read the #email before replying to it
@
Training a custom topic identification neural network is expensive, let's use LLM
@
LLM starts #hallucinating and misleads the customers
@
Let's put #guardrails and stricter instructions
@
The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month -
We need a simple bot to respond to emails that would look like it has read the #email before replying to it
@
Training a custom topic identification neural network is expensive, let's use LLM
@
LLM starts #hallucinating and misleads the customers
@
Let's put #guardrails and stricter instructions
@
The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month -
We need a simple bot to respond to emails that would look like it has read the #email before replying to it
@
Training a custom topic identification neural network is expensive, let's use LLM
@
LLM starts #hallucinating and misleads the customers
@
Let's put #guardrails and stricter instructions
@
The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month -
Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов
Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.
https://habr.com/ru/companies/just_ai/articles/1084804/
#джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных
-
Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов
Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.
https://habr.com/ru/companies/just_ai/articles/1084804/
#джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных
-
Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов
Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.
https://habr.com/ru/companies/just_ai/articles/1084804/
#джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных
-
ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить
ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.
https://habr.com/ru/companies/lanit/articles/1082982/
#prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты
-
ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить
ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.
https://habr.com/ru/companies/lanit/articles/1082982/
#prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты
-
ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить
ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.
https://habr.com/ru/companies/lanit/articles/1082982/
#prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты