home.social

#guardrails — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #guardrails, aggregated by home.social.

  1. Умеет ли Jev быть guard-моделью для LLM?

    За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...

    habr.com/ru/companies/raft/art

    #jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark

  2. Умеет ли Jev быть guard-моделью для LLM?

    За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...

    habr.com/ru/companies/raft/art

    #jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark

  3. Умеет ли Jev быть guard-моделью для LLM?

    За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...

    habr.com/ru/companies/raft/art

    #jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark

  4. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  5. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  6. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  7. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  8. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  9. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  10. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  11. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  12. ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

    ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.

    habr.com/ru/companies/lanit/ar

    #prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты

  13. ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

    ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.

    habr.com/ru/companies/lanit/ar

    #prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты

  14. ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

    ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.

    habr.com/ru/companies/lanit/ar

    #prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты