home.social

#guardrails — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #guardrails, aggregated by home.social.

  1. Умеет ли Jev быть guard-моделью для LLM?

    За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...

    habr.com/ru/companies/raft/art

    #jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark

  2. Умеет ли Jev быть guard-моделью для LLM?

    За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...

    habr.com/ru/companies/raft/art

    #jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark

  3. Умеет ли Jev быть guard-моделью для LLM?

    За эти 2 года опенсорс Guard моделей не менялся принципиально: периодически выходили энкодеры, про которые быстро забывали, но SOTA всегда оставались LLM: Qwen Guard , gpt oss safeguard , yufeng Xguard . Xguard в итоге все еще остается SOTA или где-то рядом с ней, а Qwen Guard уже не SOTA, но его продолжают цитировать как дефолтный baseline, потому что про него все слышали. Однако! Май 2026-го, в опенсорс выходят 3 guard-модели на базе энкодеров от трех разных организаций, практически в одно и то же время: gliner guard (мое(наше)), gliguard (fastino) - над ним работал автор оригинальной статьи gliner, а также guard семейства gliclass . И вот 15 сентября выходит Jev...

    habr.com/ru/companies/raft/art

    #jev #ai #llm #aisecurity #guardrails #llmguardrails #gliner #benchmark

  4. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  5. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  6. Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

    Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard , о которых и пойдет речь в этой статье. За последние два года исследователи и хакеры обнаружили множество способов украсть данные через AI-ассистентов. В одном случае удалось получить данные тенантов Microsoft 365, в другом — содержимое приватных каналов Slack. При этом не понадобился эксплойт в привычном смысле. Использовались приемы, которые социальные инженеры полвека применяют к людям: втереться в доверие, притвориться начальством, попросить о небольшой услуге. Только теперь вместо человека жертвой оказалась модель. Мы в Just AI делаем guardrails для LLM-приложений и агентов. Основной наш такой продукт — Jay Guard . Это AI-Security слой между приложением и моделью, через который проходят проверки на атаки, контент и персональные данные. В этой статье разберем текстовые детекторы Jay Guard и данные, на которых они обучаются. Разберем, почему готовые модели дали слишком много ложных блокировок на русскоязычном трафике, что изменилось после переработки данных и какие ограничения остались. Обучение модели оказалось только началом: основная работа состоит в постоянном поддержании качества на меняющихся атаках и реальном пользовательском трафике.

    habr.com/ru/companies/just_ai/

    #джейлбрейк #prompt_injection #guardrails #llm #nlp #безопасность_llm #aiагенты #большие_языковые_модели #датасет #анонимизация_данных

  7. #AI pioneer calls for stronger #guardrails for AI systems
    "2025, AI-pwr'd s/w devt platform Replit’s AI coding assistant wiped a co database despite being told to freeze all code changes, & later generated #fakedata to cover up errors.. Dr Bengio warned tt researchers hv already observed disturbing behaviours in lab settings.. models like OpenAI’s o3 actively resisted termination instructions, even when they were explicitly instructed to allow themselves be shut down"
    1/2
    straitstimes.com/tech/ai-pione