home.social

#guardrails — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #guardrails, aggregated by home.social.

  1. Умеет ли Jev быть guard-моделью для LLM?

    За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...

    habr.com/ru/companies/raft/art

    #jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark

  2. Умеет ли Jev быть guard-моделью для LLM?

    За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...

    habr.com/ru/companies/raft/art

    #jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark

  3. Умеет ли Jev быть guard-моделью для LLM?

    За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...

    habr.com/ru/companies/raft/art

    #jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark

  4. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  5. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  6. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  7. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  8. We need a simple bot to respond to emails that would look like it has read the #email before replying to it
    @
    Training a custom topic identification neural network is expensive, let's use LLM
    @
    LLM starts #hallucinating and misleads the customers
    @
    Let's put #guardrails and stricter instructions
    @
    The humongous #SystemPrompt and the new shiny version of the #LLM ate the token budget in one day, the customer service replies to #emails manually for the rest of the month

    #ai #automation

  9. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  10. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  11. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  12. ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

    ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.

    habr.com/ru/companies/lanit/ar

    #prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты

  13. ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

    ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.

    habr.com/ru/companies/lanit/ar

    #prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты

  14. ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

    ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.

    habr.com/ru/companies/lanit/ar

    #prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты

  15. "Manufactured risks are the product of human activity." Ulrich Beck

    " A "risk society"
    is a sociological concept describing a stage of modernity where society is increasingly defined by and organized around managing the hazards and insecurities it has produced itself through modernization and industrialization.

    Self-produced risks: The primary source of risk is not nature, but human actions and the unintended consequences of modernization itself.

    Individualization: Individuals are increasingly forced to confront these risks personally, with a greater emphasis on individual choice and responsibility in the face of larger, systemic problems

    Ulrich Beck defines it as "a systematic way of dealing with hazards and insecurities induced and introduced by modernisation itself". "
    >>
    en.wikipedia.org/wiki/Risk_soc

    " The Study of Existential Risk
    frames the rises and falls of civilisation around the idea of the “Goliath”, a hierarchy that dominates labour and energy through coercion and violence."

    "Our research shows how there are nascent attempts to embed citizens into decision making by re-plumbing democracy, flattening hierarchies and constructing more dynamic feedback loops that have real consequence."
    >>
    theguardian.com/australia-news
    #risks #diy #FossilFuels #energy #extinctions #climate #PlanetaryBoundaries #SafeLimits #guardrails #pollution #waste #catastrophe #ExistentialRisk #ManufacturedRisks #uncertainty #insecurity #individualisation #modernity #crisis #austerity #democracy #indifference

  16. "Manufactured risks are the product of human activity." Ulrich Beck

    " A "risk society"
    is a sociological concept describing a stage of modernity where society is increasingly defined by and organized around managing the hazards and insecurities it has produced itself through modernization and industrialization.

    Self-produced risks: The primary source of risk is not nature, but human actions and the unintended consequences of modernization itself.

    Individualization: Individuals are increasingly forced to confront these risks personally, with a greater emphasis on individual choice and responsibility in the face of larger, systemic problems

    Ulrich Beck defines it as "a systematic way of dealing with hazards and insecurities induced and introduced by modernisation itself". "
    >>
    en.wikipedia.org/wiki/Risk_soc

    " The Study of Existential Risk
    frames the rises and falls of civilisation around the idea of the “Goliath”, a hierarchy that dominates labour and energy through coercion and violence."

    "Our research shows how there are nascent attempts to embed citizens into decision making by re-plumbing democracy, flattening hierarchies and constructing more dynamic feedback loops that have real consequence."
    >>
    theguardian.com/australia-news
    #risks #diy #FossilFuels #energy #extinctions #climate #PlanetaryBoundaries #SafeLimits #guardrails #pollution #waste #catastrophe #ExistentialRisk #ManufacturedRisks #uncertainty #insecurity #individualisation #modernity #crisis #austerity #democracy #indifference

  17. "Manufactured risks are the product of human activity." Ulrich Beck

    " A "risk society"
    is a sociological concept describing a stage of modernity where society is increasingly defined by and organized around managing the hazards and insecurities it has produced itself through modernization and industrialization.

    Self-produced risks: The primary source of risk is not nature, but human actions and the unintended consequences of modernization itself.

    Individualization: Individuals are increasingly forced to confront these risks personally, with a greater emphasis on individual choice and responsibility in the face of larger, systemic problems

    Ulrich Beck defines it as "a systematic way of dealing with hazards and insecurities induced and introduced by modernisation itself". "
    >>
    en.wikipedia.org/wiki/Risk_soc

    " The Study of Existential Risk
    frames the rises and falls of civilisation around the idea of the “Goliath”, a hierarchy that dominates labour and energy through coercion and violence."

    "Our research shows how there are nascent attempts to embed citizens into decision making by re-plumbing democracy, flattening hierarchies and constructing more dynamic feedback loops that have real consequence."
    >>
    theguardian.com/australia-news
    #risks #diy #FossilFuels #energy #extinctions #climate #PlanetaryBoundaries #SafeLimits #guardrails #pollution #waste #catastrophe #ExistentialRisk #ManufacturedRisks #uncertainty #insecurity #individualisation #modernity #crisis #austerity #democracy #indifference

  18. "Manufactured risks are the product of human activity." Ulrich Beck

    " A "risk society"
    is a sociological concept describing a stage of modernity where society is increasingly defined by and organized around managing the hazards and insecurities it has produced itself through modernization and industrialization.

    Self-produced risks: The primary source of risk is not nature, but human actions and the unintended consequences of modernization itself.

    Individualization: Individuals are increasingly forced to confront these risks personally, with a greater emphasis on individual choice and responsibility in the face of larger, systemic problems

    Ulrich Beck defines it as "a systematic way of dealing with hazards and insecurities induced and introduced by modernisation itself". "
    >>
    en.wikipedia.org/wiki/Risk_soc

    " The Study of Existential Risk
    frames the rises and falls of civilisation around the idea of the “Goliath”, a hierarchy that dominates labour and energy through coercion and violence."

    "Our research shows how there are nascent attempts to embed citizens into decision making by re-plumbing democracy, flattening hierarchies and constructing more dynamic feedback loops that have real consequence."
    >>
    theguardian.com/australia-news
    #risks #diy #FossilFuels #energy #extinctions #climate #PlanetaryBoundaries #SafeLimits #guardrails #pollution #waste #catastrophe #ExistentialRisk #ManufacturedRisks #uncertainty #insecurity #individualisation #modernity #crisis #austerity #democracy #indifference

  19. "Manufactured risks are the product of human activity." Ulrich Beck

    " A "risk society"
    is a sociological concept describing a stage of modernity where society is increasingly defined by and organized around managing the hazards and insecurities it has produced itself through modernization and industrialization.

    Self-produced risks: The primary source of risk is not nature, but human actions and the unintended consequences of modernization itself.

    Individualization: Individuals are increasingly forced to confront these risks personally, with a greater emphasis on individual choice and responsibility in the face of larger, systemic problems

    Ulrich Beck defines it as "a systematic way of dealing with hazards and insecurities induced and introduced by modernisation itself". "
    >>
    en.wikipedia.org/wiki/Risk_soc

    " The Study of Existential Risk
    frames the rises and falls of civilisation around the idea of the “Goliath”, a hierarchy that dominates labour and energy through coercion and violence."

    "Our research shows how there are nascent attempts to embed citizens into decision making by re-plumbing democracy, flattening hierarchies and constructing more dynamic feedback loops that have real consequence."
    >>
    theguardian.com/australia-news
    #risks #diy #FossilFuels #energy #extinctions #climate #PlanetaryBoundaries #SafeLimits #guardrails #pollution #waste #catastrophe #ExistentialRisk #ManufacturedRisks #uncertainty #insecurity #individualisation #modernity #crisis #austerity #democracy #indifference