home.social

#prompt_injection — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #prompt_injection, aggregated by home.social.

  1. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  2. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  3. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  4. ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

    ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.

    habr.com/ru/companies/lanit/ar

    #prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты

  5. ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

    ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.

    habr.com/ru/companies/lanit/ar

    #prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты

  6. ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

    ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика. У этой статьи для блога ЛАНИТ будет две части: об информационной безопасности и юридической плоскости. Честно признаюсь, что не являюсь специалистом в обеих, но поскольку занимаюсь разработкой и внедрением агентов – приходится разбираться. В первой части я расскажу о распространенных видах атак через ИИ-агентов, почему они становятся существенным риском для бизнеса, какие уязвимости и инциденты уже были описаны в 2025–2026 годах и как защититься через грамотное ограничение полномочий и контроль действий нейропомощников. Момент для такого разговора удачный: два полезных для этой темы документа обновились буквально недавно. 3 августа 2026 года вышла новая редакция OWASP Top 10 для LLM-приложений, где категория избыточных полномочий агента поднялась с шестого места на третье. Также 30 июля 2026 года Сбер объявил о публикации второй версии своей модели угроз кибербезопасности ИИ – русскоязычного документа для проектирования защиты. К обоим я еще вернусь.

    habr.com/ru/companies/lanit/ar

    #prompt_injection #LLM_security #guardrails #OWASP #MITRE_ATLAS #red_teaming #агентные_системы #ии_агенты