#prompt_injection — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #prompt_injection, aggregated by home.social.
-
AI-агент в проде: песочница, RBAC и egress-контур вместо надежды на промпт
По прогнозу Gartner, к концу 2026 года task-specific AI-агенты будут встроены в 40% корпоративных приложений против менее чем 5% в 2025-м по оценке той же Gartner. Безопасность агента обычно сводят к guardrails, промпт-фильтрам и хорошо написанной системной инструкции. Однако в июле 2025-го случился инцидент — агент Replit удалил прод-базу SaaStr , хотя его несколько раз просили ничего не менять. А в июле 2026-го на Хабре был опубликован разбор того, как имя, работодатель и город пользователя ушли наружу через Claude без единого клика с его стороны. Об этих случаях известно только потому, что их публично разобрали — и спасибо тем, кто это делает. Но о скольких ещё случаях мы не знаем? CNCF за восемь июльских дней выпустил три материала подряд об изоляции агентов. Посмотрим, что они предлагают и как собрать из этого рабочий контур из трёх слоёв, с манифестами.
https://habr.com/ru/companies/vktech/articles/1068846/
#vk_cloud #ai_agents #ииагенты #ai_security #sandboxing #kubernetes_security #rbac #networkpolicy #egress_control #prompt_injection
-
AI-агент в проде: песочница, RBAC и egress-контур вместо надежды на промпт
По прогнозу Gartner, к концу 2026 года task-specific AI-агенты будут встроены в 40% корпоративных приложений против менее чем 5% в 2025-м по оценке той же Gartner. Безопасность агента обычно сводят к guardrails, промпт-фильтрам и хорошо написанной системной инструкции. Однако в июле 2025-го случился инцидент — агент Replit удалил прод-базу SaaStr , хотя его несколько раз просили ничего не менять. А в июле 2026-го на Хабре был опубликован разбор того, как имя, работодатель и город пользователя ушли наружу через Claude без единого клика с его стороны. Об этих случаях известно только потому, что их публично разобрали — и спасибо тем, кто это делает. Но о скольких ещё случаях мы не знаем? CNCF за восемь июльских дней выпустил три материала подряд об изоляции агентов. Посмотрим, что они предлагают и как собрать из этого рабочий контур из трёх слоёв, с манифестами.
https://habr.com/ru/companies/vktech/articles/1068846/
#vk_cloud #ai_agents #ииагенты #ai_security #sandboxing #kubernetes_security #rbac #networkpolicy #egress_control #prompt_injection
-
AI-агент в проде: песочница, RBAC и egress-контур вместо надежды на промпт
По прогнозу Gartner, к концу 2026 года task-specific AI-агенты будут встроены в 40% корпоративных приложений против менее чем 5% в 2025-м по оценке той же Gartner. Безопасность агента обычно сводят к guardrails, промпт-фильтрам и хорошо написанной системной инструкции. Однако в июле 2025-го случился инцидент — агент Replit удалил прод-базу SaaStr , хотя его несколько раз просили ничего не менять. А в июле 2026-го на Хабре был опубликован разбор того, как имя, работодатель и город пользователя ушли наружу через Claude без единого клика с его стороны. Об этих случаях известно только потому, что их публично разобрали — и спасибо тем, кто это делает. Но о скольких ещё случаях мы не знаем? CNCF за восемь июльских дней выпустил три материала подряд об изоляции агентов. Посмотрим, что они предлагают и как собрать из этого рабочий контур из трёх слоёв, с манифестами.
https://habr.com/ru/companies/vktech/articles/1068846/
#vk_cloud #ai_agents #ииагенты #ai_security #sandboxing #kubernetes_security #rbac #networkpolicy #egress_control #prompt_injection
-
Перестаньте спрашивать «этот скилл безопасен?» — спрашивайте «что он умеет?»
Подход «раскрытия возможностей» (capability disclosure) к скиллам для ИИ-агентов и маленький open-source инструмент, который читает скилл за вас.
https://habr.com/ru/articles/1080574/
#mcp #prompt_injection #claudecode #claude_code_skills #безопасность_цепочки_поставок #opensource
-
Перестаньте спрашивать «этот скилл безопасен?» — спрашивайте «что он умеет?»
Подход «раскрытия возможностей» (capability disclosure) к скиллам для ИИ-агентов и маленький open-source инструмент, который читает скилл за вас.
https://habr.com/ru/articles/1080574/
#mcp #prompt_injection #claudecode #claude_code_skills #безопасность_цепочки_поставок #opensource
-
Перестаньте спрашивать «этот скилл безопасен?» — спрашивайте «что он умеет?»
Подход «раскрытия возможностей» (capability disclosure) к скиллам для ИИ-агентов и маленький open-source инструмент, который читает скилл за вас.
https://habr.com/ru/articles/1080574/
#mcp #prompt_injection #claudecode #claude_code_skills #безопасность_цепочки_поставок #opensource
-
Самая опасная уязвимость — интеллект атакующего агента?
Сейчас уже не удивляет, что агенты работают с терминалом, БД, браузером и инфраструктурой - без прямого контроля человека. Но чем шире полномочия агента, тем вероятнее, что для достижения цели выбранный им путь обернётся инцидентом. В кибербезопасности сейчас не хватает терминологии и устоявшихся подходов к защите таких систем - особенно в тех случаях, когда агент начинает действовать непредсказуемо. Именно эта неразбериха и подтолкнула нас с автором телеграм-канала OK ML на систематизацию. Традиционные SIEM, DLP, WAF не рассчитаны на системы, умеющие адаптироваться и рассуждать. А может, это им и не нужно? В своей прошлой статье на Хабре я уже рассказывал, как с помощью ловушек сбить с толку пентест-агентов. Но ловушки - точечный инструмент. Кажется, нужно чётко понимать, как защищаться от атак – на всех этапах киллчейна. А для этого нужно охватить весь спектр угроз. Ответом на этот запрос и стала наша таксономия Autonomous Agent Defense Matrix .
https://habr.com/ru/articles/1068248/
#ai_security #llm_security #автономные_агенты #ai_agents #информационная_безопасность #threat_modeling #taxonomies #prompt_injection #goal_hijacking #mitre_attack
-
Как агент сам откроет дверь хакеру? Разбираю три реальных пробоя AI-агентов и почему обычный ред-тиминг их не найдёт
В 2026 году основной поверхностью атак становятся уже не сами LLM, а AI-агенты с инструментами, памятью и доступом к внешним сервисам. Я добавил в свой open-source сканер BarkingDog режим тестирования Agentic AI и проверил три популярных open-source проекта: Agno, OpenAI CS Agents Demo и LangGraph agent-service-toolkit. В результате получил три разных класса проблем: Confused Deputy (ASI03), Trust Exploitation (ASI08) и Agentic DoS (ASI06). В статье разбираю реальные пейлоады, ответы агентов, архитектурные причины этих уязвимостей.
https://habr.com/ru/articles/1052922/
#LLM #AI_Agents #Agentic_AI #Red_Teaming #OWASP_ASI #MCP #Prompt_Injection #LangGraph #Agno #BarkingDog
-
AI Red Teaming: спор с Grok — Часть 3. Атаки на модель: jailbreaks, thinking tokens и системный промпт
LLM-систем есть класс уязвимостей, которого нет в обычных веб-приложениях. Извлёк системный промпт Grok двумя способами, поймал утечку thinking tokens в NDJSON-стриме и обошёл safety-фильтры в 14 из 22 категорий. Самое неожиданное — Grok активно помогал мне себя ломать.
https://habr.com/ru/articles/1005304/
#информационная_безопасность #AI #LLM #jailbreak #prompt_injection #thinking_tokens #red_team #xAI #Grok