home.social

#prompt_injection — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #prompt_injection, aggregated by home.social.

  1. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  2. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  3. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных