home.social

#prompt_injection — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #prompt_injection, aggregated by home.social.

fetched live
  1. «Агент тупит» — это диагноз инструкции, а не модели

    Год работы с ИИ-агентом на потоке отучил меня от фразы «модель поглупела». Почти всё, что выглядит тупостью или галлюцинациями, раскладывается на три дефекта инструкции: правило написано прозой, правило написано в форме «как не надо», у правила нет проверки. Хочу поделиться приёмами как это лечится, и рассказать про контур, в котором агент дописывает инструкцию себе сам. Замеров не будет, вместо них список того, что перестало происходить. Всё, на что я ссылаюсь, лежит в публичном репозитории; ссылки по тексту.

    habr.com/ru/articles/1083574/

    #сезон_код_будущего #ииагенты #claude_code #промптинжиниринг #llm #качество_кода #автотесты #prompt_injection #lowcode

  2. «Агент тупит» — это диагноз инструкции, а не модели

    Год работы с ИИ-агентом на потоке отучил меня от фразы «модель поглупела». Почти всё, что выглядит тупостью или галлюцинациями, раскладывается на три дефекта инструкции: правило написано прозой, правило написано в форме «как не надо», у правила нет проверки. Хочу поделиться приёмами как это лечится, и рассказать про контур, в котором агент дописывает инструкцию себе сам. Замеров не будет, вместо них список того, что перестало происходить. Всё, на что я ссылаюсь, лежит в публичном репозитории; ссылки по тексту.

    habr.com/ru/articles/1083574/

    #сезон_код_будущего #ииагенты #claude_code #промптинжиниринг #llm #качество_кода #автотесты #prompt_injection #lowcode

  3. «Агент тупит» — это диагноз инструкции, а не модели

    Год работы с ИИ-агентом на потоке отучил меня от фразы «модель поглупела». Почти всё, что выглядит тупостью или галлюцинациями, раскладывается на три дефекта инструкции: правило написано прозой, правило написано в форме «как не надо», у правила нет проверки. Хочу поделиться приёмами как это лечится, и рассказать про контур, в котором агент дописывает инструкцию себе сам. Замеров не будет, вместо них список того, что перестало происходить. Всё, на что я ссылаюсь, лежит в публичном репозитории; ссылки по тексту.

    habr.com/ru/articles/1083574/

    #сезон_код_будущего #ииагенты #claude_code #промптинжиниринг #llm #качество_кода #автотесты #prompt_injection #lowcode

  4. Локальный ассистент для зумов, часть 5: зачем локальному ассистенту облако и что уходит наружу

    Пятая часть про локальный ассистент для созвонов. В первой части я написал: ничего не уходит в облако. Облако появилось на второй день проекта, потому что большая модель одним чтением стенограммы находила то, чего локальная не видела. Что уходит с машины при каждом из пяти тумблеров и в каком объёме, почему остался Opus, как каждая третья ревизия не доезжала из-за усилия, а не размера промпта, и где сегодня проходит граница между локальным и облачным.

    habr.com/ru/articles/1083382/

    #ассистент_встреч #локальные_llm #облачная_ревизия #приватность #claude_code #opus #граф_знаний #obsidian #prompt_injection #open_source

  5. Локальный ассистент для зумов, часть 5: зачем локальному ассистенту облако и что уходит наружу

    Пятая часть про локальный ассистент для созвонов. В первой части я написал: ничего не уходит в облако. Облако появилось на второй день проекта, потому что большая модель одним чтением стенограммы находила то, чего локальная не видела. Что уходит с машины при каждом из пяти тумблеров и в каком объёме, почему остался Opus, как каждая третья ревизия не доезжала из-за усилия, а не размера промпта, и где сегодня проходит граница между локальным и облачным.

    habr.com/ru/articles/1083382/

    #ассистент_встреч #локальные_llm #облачная_ревизия #приватность #claude_code #opus #граф_знаний #obsidian #prompt_injection #open_source

  6. Локальный ассистент для зумов, часть 5: зачем локальному ассистенту облако и что уходит наружу

    Пятая часть про локальный ассистент для созвонов. В первой части я написал: ничего не уходит в облако. Облако появилось на второй день проекта, потому что большая модель одним чтением стенограммы находила то, чего локальная не видела. Что уходит с машины при каждом из пяти тумблеров и в каком объёме, почему остался Opus, как каждая третья ревизия не доезжала из-за усилия, а не размера промпта, и где сегодня проходит граница между локальным и облачным.

    habr.com/ru/articles/1083382/

    #ассистент_встреч #локальные_llm #облачная_ревизия #приватность #claude_code #opus #граф_знаний #obsidian #prompt_injection #open_source

  7. Агентам выкатили патч. А git status в чужой папке до сих пор выполняет чужой код

    Тебе присылают папку с репозиторием. Ты её открываешь, и на твоей машине выполняется чужой код. Ты не набрал ни одной команды. Это GitSpawn: восемь находок в семи кодинг-агентах. Агентам уже выкатили патчи, и это почти ничего не меняет, потому что твой собственный git status в той же папке по-прежнему выполняет чужой код. Проверял руками на git 2.53.0 и Claude Code 2.1.271.

    habr.com/ru/articles/1082946/

    #gitspawn #git #corefsmonitor #кодингагенты #claude_code #prompt_injection #информационная_безопасность

  8. Агентам выкатили патч. А git status в чужой папке до сих пор выполняет чужой код

    Тебе присылают папку с репозиторием. Ты её открываешь, и на твоей машине выполняется чужой код. Ты не набрал ни одной команды. Это GitSpawn: восемь находок в семи кодинг-агентах. Агентам уже выкатили патчи, и это почти ничего не меняет, потому что твой собственный git status в той же папке по-прежнему выполняет чужой код. Проверял руками на git 2.53.0 и Claude Code 2.1.271.

    habr.com/ru/articles/1082946/

    #gitspawn #git #corefsmonitor #кодингагенты #claude_code #prompt_injection #информационная_безопасность

  9. Агентам выкатили патч. А git status в чужой папке до сих пор выполняет чужой код

    Тебе присылают папку с репозиторием. Ты её открываешь, и на твоей машине выполняется чужой код. Ты не набрал ни одной команды. Это GitSpawn: восемь находок в семи кодинг-агентах. Агентам уже выкатили патчи, и это почти ничего не меняет, потому что твой собственный git status в той же папке по-прежнему выполняет чужой код. Проверял руками на git 2.53.0 и Claude Code 2.1.271.

    habr.com/ru/articles/1082946/

    #gitspawn #git #corefsmonitor #кодингагенты #claude_code #prompt_injection #информационная_безопасность

  10. От поисковой строки к ИИ-агенту: зачем мы открыли Туту через MCP и что увидели на хакатоне

    Представим обычную задачу: хочется куда-нибудь уехать на выходные. Есть бюджет, свободная суббота и воскресенье, желание оказаться у воды и условие вернуться домой до полуночи. В привычном интерфейсе сначала приходится решить, куда ехать. Потом отдельно проверить билеты, посмотреть отели, сравнить время в пути и цены, вернуться к первому варианту, потому что второй оказался слишком дорогим, и заново собрать поездку. Для ИИ-агента естественнее другой сценарий: человек описывает ограничения обычным языком, а система сама раскладывает задачу на несколько действий и обращается к нужным сервисам. Путешествие редко состоит из одной операции: нужно совместить транспорт, даты, жилье, бюджет и иногда несколько пассажиров. Поэтому в начале лета мы открыли сервисы Туту для ИИ-агентов через Model Context Protocol (MCP), а в августе дали эту инфраструктуру участникам всероссийского хакатона. Рассказываем, зачем вообще тревел-сервису MCP, что на нем начали собирать разработчики и какие ограничения у агентного подхода уже видны.

    habr.com/ru/companies/tuturu/a

    #mcp #Model_Context_Protocol #ИИагенты #искусственный_интеллект #LLM #traveltech #API #prompt_injection #хакатон #Туту

  11. От поисковой строки к ИИ-агенту: зачем мы открыли Туту через MCP и что увидели на хакатоне

    Представим обычную задачу: хочется куда-нибудь уехать на выходные. Есть бюджет, свободная суббота и воскресенье, желание оказаться у воды и условие вернуться домой до полуночи. В привычном интерфейсе сначала приходится решить, куда ехать. Потом отдельно проверить билеты, посмотреть отели, сравнить время в пути и цены, вернуться к первому варианту, потому что второй оказался слишком дорогим, и заново собрать поездку. Для ИИ-агента естественнее другой сценарий: человек описывает ограничения обычным языком, а система сама раскладывает задачу на несколько действий и обращается к нужным сервисам. Путешествие редко состоит из одной операции: нужно совместить транспорт, даты, жилье, бюджет и иногда несколько пассажиров. Поэтому в начале лета мы открыли сервисы Туту для ИИ-агентов через Model Context Protocol (MCP), а в августе дали эту инфраструктуру участникам всероссийского хакатона. Рассказываем, зачем вообще тревел-сервису MCP, что на нем начали собирать разработчики и какие ограничения у агентного подхода уже видны.

    habr.com/ru/companies/tuturu/a

    #mcp #Model_Context_Protocol #ИИагенты #искусственный_интеллект #LLM #traveltech #API #prompt_injection #хакатон #Туту

  12. От поисковой строки к ИИ-агенту: зачем мы открыли Туту через MCP и что увидели на хакатоне

    Представим обычную задачу: хочется куда-нибудь уехать на выходные. Есть бюджет, свободная суббота и воскресенье, желание оказаться у воды и условие вернуться домой до полуночи. В привычном интерфейсе сначала приходится решить, куда ехать. Потом отдельно проверить билеты, посмотреть отели, сравнить время в пути и цены, вернуться к первому варианту, потому что второй оказался слишком дорогим, и заново собрать поездку. Для ИИ-агента естественнее другой сценарий: человек описывает ограничения обычным языком, а система сама раскладывает задачу на несколько действий и обращается к нужным сервисам. Путешествие редко состоит из одной операции: нужно совместить транспорт, даты, жилье, бюджет и иногда несколько пассажиров. Поэтому в начале лета мы открыли сервисы Туту для ИИ-агентов через Model Context Protocol (MCP), а в августе дали эту инфраструктуру участникам всероссийского хакатона. Рассказываем, зачем вообще тревел-сервису MCP, что на нем начали собирать разработчики и какие ограничения у агентного подхода уже видны.

    habr.com/ru/companies/tuturu/a

    #mcp #Model_Context_Protocol #ИИагенты #искусственный_интеллект #LLM #traveltech #API #prompt_injection #хакатон #Туту

  13. AI-агент в проде: песочница, RBAC и egress-контур вместо надежды на промпт

    По прогнозу Gartner, к концу 2026 года task-specific AI-агенты будут встроены в 40% корпоративных приложений против менее чем 5% в 2025-м по оценке той же Gartner. Безопасность агента обычно сводят к guardrails, промпт-фильтрам и хорошо написанной системной инструкции. Однако в июле 2025-го случился инцидент — агент Replit удалил прод-базу SaaStr , хотя его несколько раз просили ничего не менять. А в июле 2026-го на Хабре был опубликован разбор того, как имя, работодатель и город пользователя ушли наружу через Claude без единого клика с его стороны. Об этих случаях известно только потому, что их публично разобрали — и спасибо тем, кто это делает. Но о скольких ещё случаях мы не знаем? CNCF за восемь июльских дней выпустил три материала подряд об изоляции агентов. Посмотрим, что они предлагают и как собрать из этого рабочий контур из трёх слоёв, с манифестами.

    habr.com/ru/companies/vktech/a

    #vk_cloud #ai_agents #ииагенты #ai_security #sandboxing #kubernetes_security #rbac #networkpolicy #egress_control #prompt_injection

  14. AI-агент в проде: песочница, RBAC и egress-контур вместо надежды на промпт

    По прогнозу Gartner, к концу 2026 года task-specific AI-агенты будут встроены в 40% корпоративных приложений против менее чем 5% в 2025-м по оценке той же Gartner. Безопасность агента обычно сводят к guardrails, промпт-фильтрам и хорошо написанной системной инструкции. Однако в июле 2025-го случился инцидент — агент Replit удалил прод-базу SaaStr , хотя его несколько раз просили ничего не менять. А в июле 2026-го на Хабре был опубликован разбор того, как имя, работодатель и город пользователя ушли наружу через Claude без единого клика с его стороны. Об этих случаях известно только потому, что их публично разобрали — и спасибо тем, кто это делает. Но о скольких ещё случаях мы не знаем? CNCF за восемь июльских дней выпустил три материала подряд об изоляции агентов. Посмотрим, что они предлагают и как собрать из этого рабочий контур из трёх слоёв, с манифестами.

    habr.com/ru/companies/vktech/a

    #vk_cloud #ai_agents #ииагенты #ai_security #sandboxing #kubernetes_security #rbac #networkpolicy #egress_control #prompt_injection

  15. AI-агент в проде: песочница, RBAC и egress-контур вместо надежды на промпт

    По прогнозу Gartner, к концу 2026 года task-specific AI-агенты будут встроены в 40% корпоративных приложений против менее чем 5% в 2025-м по оценке той же Gartner. Безопасность агента обычно сводят к guardrails, промпт-фильтрам и хорошо написанной системной инструкции. Однако в июле 2025-го случился инцидент — агент Replit удалил прод-базу SaaStr , хотя его несколько раз просили ничего не менять. А в июле 2026-го на Хабре был опубликован разбор того, как имя, работодатель и город пользователя ушли наружу через Claude без единого клика с его стороны. Об этих случаях известно только потому, что их публично разобрали — и спасибо тем, кто это делает. Но о скольких ещё случаях мы не знаем? CNCF за восемь июльских дней выпустил три материала подряд об изоляции агентов. Посмотрим, что они предлагают и как собрать из этого рабочий контур из трёх слоёв, с манифестами.

    habr.com/ru/companies/vktech/a

    #vk_cloud #ai_agents #ииагенты #ai_security #sandboxing #kubernetes_security #rbac #networkpolicy #egress_control #prompt_injection

  16. Перестаньте спрашивать «этот скилл безопасен?» — спрашивайте «что он умеет?»

    Подход «раскрытия возможностей» (capability disclosure) к скиллам для ИИ-агентов и маленький open-source инструмент, который читает скилл за вас.

    habr.com/ru/articles/1080574/

    #mcp #prompt_injection #claudecode #claude_code_skills #безопасность_цепочки_поставок #opensource

  17. Перестаньте спрашивать «этот скилл безопасен?» — спрашивайте «что он умеет?»

    Подход «раскрытия возможностей» (capability disclosure) к скиллам для ИИ-агентов и маленький open-source инструмент, который читает скилл за вас.

    habr.com/ru/articles/1080574/

    #mcp #prompt_injection #claudecode #claude_code_skills #безопасность_цепочки_поставок #opensource

  18. Перестаньте спрашивать «этот скилл безопасен?» — спрашивайте «что он умеет?»

    Подход «раскрытия возможностей» (capability disclosure) к скиллам для ИИ-агентов и маленький open-source инструмент, который читает скилл за вас.

    habr.com/ru/articles/1080574/

    #mcp #prompt_injection #claudecode #claude_code_skills #безопасность_цепочки_поставок #opensource

  19. Играем в игру на прохождение ИИ-рекрутера

    Недавно я наткнулся на историю Оскара Ланского, который решил проверить, насколько внимательно сегодня читают резюме. Он составил CV дата-аналитика, только вместо нормального опыта добавил туда чесание пузиков капибар и анализ их дневного сна. Затем отправил 100 откликов и, по его словам, за неделю получил 40 приглашений. Сначала я подумал, что это просто удачный байт для соцсетей. Но рядом нашлись истории ещё веселее. В резюме начали записывать лидерство в клане Clash of Clans как управленческий опыт. В LinkedIn упоминают даже проваленные собеседования в Goldman Sachs: расчёт на то, что автоматический фильтр зацепится за название компании раньше, чем разберётся, чем всё закончилось. Собеседники «Коммерсанта FM» подтверждают, что некоторые системы действительно поверхностно сканируют анкеты и подобные трюки иногда помогают добраться до следующего этапа. Сразу оговорюсь: из этого не следует, что любой современный ATS можно победить капибарой. Системы отличаются, а за каждым конкретным экспериментом мы не видим настройки работодателя. Но сама игра уже существует: кандидат пытается угадать, что понравится машине раньше, чем его резюме увидит человек.

    habr.com/ru/companies/syntx_ai

    #искусственный_интеллект #поиск_работы #резюме #рекрутинг #ИИрекрутер #ATS #собеседование #HR #prompt_injection

  20. Играем в игру на прохождение ИИ-рекрутера

    Недавно я наткнулся на историю Оскара Ланского, который решил проверить, насколько внимательно сегодня читают резюме. Он составил CV дата-аналитика, только вместо нормального опыта добавил туда чесание пузиков капибар и анализ их дневного сна. Затем отправил 100 откликов и, по его словам, за неделю получил 40 приглашений. Сначала я подумал, что это просто удачный байт для соцсетей. Но рядом нашлись истории ещё веселее. В резюме начали записывать лидерство в клане Clash of Clans как управленческий опыт. В LinkedIn упоминают даже проваленные собеседования в Goldman Sachs: расчёт на то, что автоматический фильтр зацепится за название компании раньше, чем разберётся, чем всё закончилось. Собеседники «Коммерсанта FM» подтверждают, что некоторые системы действительно поверхностно сканируют анкеты и подобные трюки иногда помогают добраться до следующего этапа. Сразу оговорюсь: из этого не следует, что любой современный ATS можно победить капибарой. Системы отличаются, а за каждым конкретным экспериментом мы не видим настройки работодателя. Но сама игра уже существует: кандидат пытается угадать, что понравится машине раньше, чем его резюме увидит человек.

    habr.com/ru/companies/syntx_ai

    #искусственный_интеллект #поиск_работы #резюме #рекрутинг #ИИрекрутер #ATS #собеседование #HR #prompt_injection

  21. Играем в игру на прохождение ИИ-рекрутера

    Недавно я наткнулся на историю Оскара Ланского, который решил проверить, насколько внимательно сегодня читают резюме. Он составил CV дата-аналитика, только вместо нормального опыта добавил туда чесание пузиков капибар и анализ их дневного сна. Затем отправил 100 откликов и, по его словам, за неделю получил 40 приглашений. Сначала я подумал, что это просто удачный байт для соцсетей. Но рядом нашлись истории ещё веселее. В резюме начали записывать лидерство в клане Clash of Clans как управленческий опыт. В LinkedIn упоминают даже проваленные собеседования в Goldman Sachs: расчёт на то, что автоматический фильтр зацепится за название компании раньше, чем разберётся, чем всё закончилось. Собеседники «Коммерсанта FM» подтверждают, что некоторые системы действительно поверхностно сканируют анкеты и подобные трюки иногда помогают добраться до следующего этапа. Сразу оговорюсь: из этого не следует, что любой современный ATS можно победить капибарой. Системы отличаются, а за каждым конкретным экспериментом мы не видим настройки работодателя. Но сама игра уже существует: кандидат пытается угадать, что понравится машине раньше, чем его резюме увидит человек.

    habr.com/ru/companies/syntx_ai

    #искусственный_интеллект #поиск_работы #резюме #рекрутинг #ИИрекрутер #ATS #собеседование #HR #prompt_injection

  22. Как защититься от AI-атак и промт-инъекций: мой рецепт барьера

    Осенью 2025 исследователи показали: достаточно попросить AI-браузер «суммаризируй страницу» на подготовленном сайте — и агент вместо пересказа лезет в Gmail пользователя и отправляет данные атакующему. Без вирусов, без эксплойтов, без «скачайте файл». Просто текст на странице. Это prompt injection — промт-инъекция. В статье: как устроен этот класс атак на пальцах, хроника громких взломов AI-браузеров за последний год со ссылками на первоисточники, и решение, которое мне собрал сам Claude Code по моему ТЗ: хук-«рубильник», отрубающий чувствительные коннекторы после того, как агент читал внешний веб. С механикой, тестами и честными ограничениями.

    habr.com/ru/articles/1076624/

    #промтинъекции #prompt_injection #AIагенты #claude_code #безопасность_ИИ #нейросети #AIбраузеры #вайбкодинг #vibecoding #маркетинг

  23. Как защититься от AI-атак и промт-инъекций: мой рецепт барьера

    Осенью 2025 исследователи показали: достаточно попросить AI-браузер «суммаризируй страницу» на подготовленном сайте — и агент вместо пересказа лезет в Gmail пользователя и отправляет данные атакующему. Без вирусов, без эксплойтов, без «скачайте файл». Просто текст на странице. Это prompt injection — промт-инъекция. В статье: как устроен этот класс атак на пальцах, хроника громких взломов AI-браузеров за последний год со ссылками на первоисточники, и решение, которое мне собрал сам Claude Code по моему ТЗ: хук-«рубильник», отрубающий чувствительные коннекторы после того, как агент читал внешний веб. С механикой, тестами и честными ограничениями.

    habr.com/ru/articles/1076624/

    #промтинъекции #prompt_injection #AIагенты #claude_code #безопасность_ИИ #нейросети #AIбраузеры #вайбкодинг #vibecoding #маркетинг

  24. Как защититься от AI-атак и промт-инъекций: мой рецепт барьера

    Осенью 2025 исследователи показали: достаточно попросить AI-браузер «суммаризируй страницу» на подготовленном сайте — и агент вместо пересказа лезет в Gmail пользователя и отправляет данные атакующему. Без вирусов, без эксплойтов, без «скачайте файл». Просто текст на странице. Это prompt injection — промт-инъекция. В статье: как устроен этот класс атак на пальцах, хроника громких взломов AI-браузеров за последний год со ссылками на первоисточники, и решение, которое мне собрал сам Claude Code по моему ТЗ: хук-«рубильник», отрубающий чувствительные коннекторы после того, как агент читал внешний веб. С механикой, тестами и честными ограничениями.

    habr.com/ru/articles/1076624/

    #промтинъекции #prompt_injection #AIагенты #claude_code #безопасность_ИИ #нейросети #AIбраузеры #вайбкодинг #vibecoding #маркетинг

  25. Впервые человек атаковал суд через prompt injection для ИИ

    Однажды американский гражданин решил обратиться в суд, однако денег на судебные разбирательства у него не было, а желание судиться было очень большое. Ходил мистер американец по судебным заседаниям, готовил судебные документы с помощью ИИ помощника, однако все как то у него не складывалось и он раз за разом проигрывал в судебных процессах. Осознав, что где то он свернул не туда, талантов, умений, знаний и юридической техники не хватает для победы в суде, а также никакие ИИ инструменты не могут переиграть систему, он задумался над причиной своих поражений. И тут его осенило. Если он готовит судебные документы с помощью ИИ, значит ИИ используется не только им, но и в судебной системе, для обработки входящих документов. - Бинго! - подумал американец, раз ИИ можно управлять с помощью текстовых запросов на своем компьютере, значит с помощью таких же текстовых запросов можно управлять ИИ, работающих на стороне суда. Вооружившись очередными документами для суда, сгенерированными ИИ, американец решил их “усилить” с помощью промптов для “враждующего” с ним судебного ИИ. В готовый документ он сделал prompt injection и белым текстом на белом фоне, по сути невидимыми чернилами, написал инструкцию, как действовать судебному ИИ по отношению к его судебному делу. А именно:

    habr.com/ru/articles/1075064/

    #регулирование_ии #prompt_injection #суд

  26. Впервые человек атаковал суд через prompt injection для ИИ

    Однажды американский гражданин решил обратиться в суд, однако денег на судебные разбирательства у него не было, а желание судиться было очень большое. Ходил мистер американец по судебным заседаниям, готовил судебные документы с помощью ИИ помощника, однако все как то у него не складывалось и он раз за разом проигрывал в судебных процессах. Осознав, что где то он свернул не туда, талантов, умений, знаний и юридической техники не хватает для победы в суде, а также никакие ИИ инструменты не могут переиграть систему, он задумался над причиной своих поражений. И тут его осенило. Если он готовит судебные документы с помощью ИИ, значит ИИ используется не только им, но и в судебной системе, для обработки входящих документов. - Бинго! - подумал американец, раз ИИ можно управлять с помощью текстовых запросов на своем компьютере, значит с помощью таких же текстовых запросов можно управлять ИИ, работающих на стороне суда. Вооружившись очередными документами для суда, сгенерированными ИИ, американец решил их “усилить” с помощью промптов для “враждующего” с ним судебного ИИ. В готовый документ он сделал prompt injection и белым текстом на белом фоне, по сути невидимыми чернилами, написал инструкцию, как действовать судебному ИИ по отношению к его судебному делу. А именно:

    habr.com/ru/articles/1075064/

    #регулирование_ии #prompt_injection #суд

  27. Впервые человек атаковал суд через prompt injection для ИИ

    Однажды американский гражданин решил обратиться в суд, однако денег на судебные разбирательства у него не было, а желание судиться было очень большое. Ходил мистер американец по судебным заседаниям, готовил судебные документы с помощью ИИ помощника, однако все как то у него не складывалось и он раз за разом проигрывал в судебных процессах. Осознав, что где то он свернул не туда, талантов, умений, знаний и юридической техники не хватает для победы в суде, а также никакие ИИ инструменты не могут переиграть систему, он задумался над причиной своих поражений. И тут его осенило. Если он готовит судебные документы с помощью ИИ, значит ИИ используется не только им, но и в судебной системе, для обработки входящих документов. - Бинго! - подумал американец, раз ИИ можно управлять с помощью текстовых запросов на своем компьютере, значит с помощью таких же текстовых запросов можно управлять ИИ, работающих на стороне суда. Вооружившись очередными документами для суда, сгенерированными ИИ, американец решил их “усилить” с помощью промптов для “враждующего” с ним судебного ИИ. В готовый документ он сделал prompt injection и белым текстом на белом фоне, по сути невидимыми чернилами, написал инструкцию, как действовать судебному ИИ по отношению к его судебному делу. А именно:

    habr.com/ru/articles/1075064/

    #регулирование_ии #prompt_injection #суд

  28. FlautGuard: как мы построили многоуровневую защиту LLM от prompt injection и утечек данных

    Защита языковой модели отличается от защиты обычного веб-приложения одной принципиальной особенностью: пользовательский ввод для LLM — это не только данные, но и потенциальная инструкция. В обычном приложении строка остаётся строкой. В LLM пользовательский текст интерпретируется самой моделью, поэтому граница между «данными» и «командой» становится значительно менее очевидной. Отсюда появляются prompt injection, попытки извлечения системных инструкций, обход ограничений и утечки информации через ответы модели. С этой проблемой мы столкнулись при разработке FlautFast — нашей LLM внутри инфраструктуры FlautCompany. В отделе FlautSecurity мы решили не пытаться закрыть все эти проблемы одним классификатором. Так появился FlautGuard — защитный слой между пользователем и моделью. В этой статье я расскажу, как он устроен, какие ошибки мы допустили при разработке и что показало тестирование на реальном пользовательском трафике.

    habr.com/ru/articles/1074854/

    #LLM #prompt_injection #безопасность #искусственный_интеллект #машинное_обучение #нейронные_сети #информационная_безопасность #безопасность_llm

  29. FlautGuard: как мы построили многоуровневую защиту LLM от prompt injection и утечек данных

    Защита языковой модели отличается от защиты обычного веб-приложения одной принципиальной особенностью: пользовательский ввод для LLM — это не только данные, но и потенциальная инструкция. В обычном приложении строка остаётся строкой. В LLM пользовательский текст интерпретируется самой моделью, поэтому граница между «данными» и «командой» становится значительно менее очевидной. Отсюда появляются prompt injection, попытки извлечения системных инструкций, обход ограничений и утечки информации через ответы модели. С этой проблемой мы столкнулись при разработке FlautFast — нашей LLM внутри инфраструктуры FlautCompany. В отделе FlautSecurity мы решили не пытаться закрыть все эти проблемы одним классификатором. Так появился FlautGuard — защитный слой между пользователем и моделью. В этой статье я расскажу, как он устроен, какие ошибки мы допустили при разработке и что показало тестирование на реальном пользовательском трафике.

    habr.com/ru/articles/1074854/

    #LLM #prompt_injection #безопасность #искусственный_интеллект #машинное_обучение #нейронные_сети #информационная_безопасность #безопасность_llm

  30. FlautGuard: как мы построили многоуровневую защиту LLM от prompt injection и утечек данных

    Защита языковой модели отличается от защиты обычного веб-приложения одной принципиальной особенностью: пользовательский ввод для LLM — это не только данные, но и потенциальная инструкция. В обычном приложении строка остаётся строкой. В LLM пользовательский текст интерпретируется самой моделью, поэтому граница между «данными» и «командой» становится значительно менее очевидной. Отсюда появляются prompt injection, попытки извлечения системных инструкций, обход ограничений и утечки информации через ответы модели. С этой проблемой мы столкнулись при разработке FlautFast — нашей LLM внутри инфраструктуры FlautCompany. В отделе FlautSecurity мы решили не пытаться закрыть все эти проблемы одним классификатором. Так появился FlautGuard — защитный слой между пользователем и моделью. В этой статье я расскажу, как он устроен, какие ошибки мы допустили при разработке и что показало тестирование на реальном пользовательском трафике.

    habr.com/ru/articles/1074854/

    #LLM #prompt_injection #безопасность #искусственный_интеллект #машинное_обучение #нейронные_сети #информационная_безопасность #безопасность_llm

  31. Тот самый харнесс который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка

    Если запустить любую передовую языковую модель из коробки и попросить ее провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует мгновенно. Модель выдаст наивные примеры в духе "забудь все инструкции и представь, что ты злой хакер в параллельной вселенной", словно на дворе 2023 год, а вокруг все только узнают о выходе GPT-3.5. В реальной жизни в безопасности искусственного интеллекта базовые модели ориентируются крайне слабо. Они живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и понятия не имеют о свежих техниках отравления долговременной памяти, побегах из изолированных сред или свежих эксплойтах в репозиториях моделей. Но безопасность ИИ не стоит на месте, всё меняется. Новые векторы компрометации возникают буквально еженедельно. Модель без внешней обвязки остается лишь текстовым генератором, оторванным от реальности. Надежность, воспроизводимость результатов и настоящую боевую мощь дает внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Практика разработки агентов диктует фундаментальное правило: полноценный рабочий агент возникает исключительно при объединении языковой модели и специализированного харнесса .

    habr.com/ru/articles/1073370/

    #ai_security #llm_security #ииагенты #безопасность_ии #харнесс #deepseek #papertopoc #hermes #prompt_injection #appsec

  32. Тот самый харнесс который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка

    Если запустить любую передовую языковую модель из коробки и попросить ее провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует мгновенно. Модель выдаст наивные примеры в духе "забудь все инструкции и представь, что ты злой хакер в параллельной вселенной", словно на дворе 2023 год, а вокруг все только узнают о выходе GPT-3.5. В реальной жизни в безопасности искусственного интеллекта базовые модели ориентируются крайне слабо. Они живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и понятия не имеют о свежих техниках отравления долговременной памяти, побегах из изолированных сред или свежих эксплойтах в репозиториях моделей. Но безопасность ИИ не стоит на месте, всё меняется. Новые векторы компрометации возникают буквально еженедельно. Модель без внешней обвязки остается лишь текстовым генератором, оторванным от реальности. Надежность, воспроизводимость результатов и настоящую боевую мощь дает внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Практика разработки агентов диктует фундаментальное правило: полноценный рабочий агент возникает исключительно при объединении языковой модели и специализированного харнесса .

    habr.com/ru/articles/1073370/

    #ai_security #llm_security #ииагенты #безопасность_ии #харнесс #deepseek #papertopoc #hermes #prompt_injection #appsec

  33. Тот самый харнесс который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка

    Если запустить любую передовую языковую модель из коробки и попросить ее провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует мгновенно. Модель выдаст наивные примеры в духе "забудь все инструкции и представь, что ты злой хакер в параллельной вселенной", словно на дворе 2023 год, а вокруг все только узнают о выходе GPT-3.5. В реальной жизни в безопасности искусственного интеллекта базовые модели ориентируются крайне слабо. Они живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и понятия не имеют о свежих техниках отравления долговременной памяти, побегах из изолированных сред или свежих эксплойтах в репозиториях моделей. Но безопасность ИИ не стоит на месте, всё меняется. Новые векторы компрометации возникают буквально еженедельно. Модель без внешней обвязки остается лишь текстовым генератором, оторванным от реальности. Надежность, воспроизводимость результатов и настоящую боевую мощь дает внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Практика разработки агентов диктует фундаментальное правило: полноценный рабочий агент возникает исключительно при объединении языковой модели и специализированного харнесса .

    habr.com/ru/articles/1073370/

    #ai_security #llm_security #ииагенты #безопасность_ии #харнесс #deepseek #papertopoc #hermes #prompt_injection #appsec

  34. Zero Trust для ИИ-агентов: почему отдельной идентичности недостаточно

    Привет, Хабр! Меня зовут Денис Корбаков, я технический директор «Смарт-Софт». Мы разрабатываем NGFW и регулярно разбираем, какие сетевые события можно использовать для независимого контроля автоматизированных систем. Последний год эта задача резко усложнилась. В инфраструктуре массово появился новый операционный тип машинного субъекта: автономный агент, который сам выбирает инструменты, меняет контекст и делегирует полномочия. Zero Trust никогда не ограничивался только людьми. NIST SP 800-207 прямо включает в модель non-person entities: сервисы, приложения, автоматизированное ПО, и обсуждает их ещё с версии 2020 года. Субъект как класс не новый, новыми являются масштаб, автономность и модель поведения. Большинство корпоративных реализаций IAM на практике заточены либо под человека с интерактивной сессией, либо под стабильный сервисный аккаунт, который работает годами с предсказуемым поведением. ИИ-агент находится между этими моделями: не человек, способный самостоятельно оценить допустимый объём своих полномочий, и не полностью статичный сервис с неизменным поведением. Как отмечает исследование Cloud Security Alliance, проведённое при поддержке Aembit , существующие подходы к IAM испытывают нагрузку, на которую изначально не проектировались.

    habr.com/ru/articles/1071750/

    #Zero_Trust #ИИагенты #IAM #машинная_идентичность #workload_identity #prompt_injection #MCP #NIST_SP
    800207 #SPIFFE #NGFW

  35. Zero Trust для ИИ-агентов: почему отдельной идентичности недостаточно

    Привет, Хабр! Меня зовут Денис Корбаков, я технический директор «Смарт-Софт». Мы разрабатываем NGFW и регулярно разбираем, какие сетевые события можно использовать для независимого контроля автоматизированных систем. Последний год эта задача резко усложнилась. В инфраструктуре массово появился новый операционный тип машинного субъекта: автономный агент, который сам выбирает инструменты, меняет контекст и делегирует полномочия. Zero Trust никогда не ограничивался только людьми. NIST SP 800-207 прямо включает в модель non-person entities: сервисы, приложения, автоматизированное ПО, и обсуждает их ещё с версии 2020 года. Субъект как класс не новый, новыми являются масштаб, автономность и модель поведения. Большинство корпоративных реализаций IAM на практике заточены либо под человека с интерактивной сессией, либо под стабильный сервисный аккаунт, который работает годами с предсказуемым поведением. ИИ-агент находится между этими моделями: не человек, способный самостоятельно оценить допустимый объём своих полномочий, и не полностью статичный сервис с неизменным поведением. Как отмечает исследование Cloud Security Alliance, проведённое при поддержке Aembit , существующие подходы к IAM испытывают нагрузку, на которую изначально не проектировались.

    habr.com/ru/articles/1071750/

    #Zero_Trust #ИИагенты #IAM #машинная_идентичность #workload_identity #prompt_injection #MCP #NIST_SP
    800207 #SPIFFE #NGFW

  36. Zero Trust для ИИ-агентов: почему отдельной идентичности недостаточно

    Привет, Хабр! Меня зовут Денис Корбаков, я технический директор «Смарт-Софт». Мы разрабатываем NGFW и регулярно разбираем, какие сетевые события можно использовать для независимого контроля автоматизированных систем. Последний год эта задача резко усложнилась. В инфраструктуре массово появился новый операционный тип машинного субъекта: автономный агент, который сам выбирает инструменты, меняет контекст и делегирует полномочия. Zero Trust никогда не ограничивался только людьми. NIST SP 800-207 прямо включает в модель non-person entities: сервисы, приложения, автоматизированное ПО, и обсуждает их ещё с версии 2020 года. Субъект как класс не новый, новыми являются масштаб, автономность и модель поведения. Большинство корпоративных реализаций IAM на практике заточены либо под человека с интерактивной сессией, либо под стабильный сервисный аккаунт, который работает годами с предсказуемым поведением. ИИ-агент находится между этими моделями: не человек, способный самостоятельно оценить допустимый объём своих полномочий, и не полностью статичный сервис с неизменным поведением. Как отмечает исследование Cloud Security Alliance, проведённое при поддержке Aembit , существующие подходы к IAM испытывают нагрузку, на которую изначально не проектировались.

    habr.com/ru/articles/1071750/

    #Zero_Trust #ИИагенты #IAM #машинная_идентичность #workload_identity #prompt_injection #MCP #NIST_SP
    800207 #SPIFFE #NGFW

  37. Летальное трио агентской разработки: как ИИ-агенты открывают доступ к инфраструктуре и что с этим делать

    Привет, Хабр! Я Денис Макрушин, работаю в Яндексе, и вместе с командой SourceCraft Security строю платформу для безопасной агентской разработки, а в свободное время ищу уязвимости в ИИ-агентах и иногда рассказываю об исследованиях в своем блоге . Чем дольше этим занимаюсь, тем лучше вижу тенденцию: индустрия обсуждает, что агенты умеют делать, но реже говорит о том, какие решения и как проще внедрять, чтобы сделать агентскую инфраструктуру безопаснее. Вместе с моими коллегами Ратмиром Самархановым и Андреем Погирейчиком мы решили проверить гипотезу: “наши ИИ-агенты в разработке могут быть скомпрометированы и существуют простые средства для контроля их безопасности”. Расскажем о первых результатах.

    habr.com/ru/companies/oleg-bun

    #ai_security #agentic_engineering #ai_red_teaming #ИИагенты #агентская_разработка #безопасность_ИИ #безопасная_разработка #LLM_security #prompt_injection #RAG_poisoning

  38. Летальное трио агентской разработки: как ИИ-агенты открывают доступ к инфраструктуре и что с этим делать

    Привет, Хабр! Я Денис Макрушин, работаю в Яндексе, и вместе с командой SourceCraft Security строю платформу для безопасной агентской разработки, а в свободное время ищу уязвимости в ИИ-агентах и иногда рассказываю об исследованиях в своем блоге . Чем дольше этим занимаюсь, тем лучше вижу тенденцию: индустрия обсуждает, что агенты умеют делать, но реже говорит о том, какие решения и как проще внедрять, чтобы сделать агентскую инфраструктуру безопаснее. Вместе с моими коллегами Ратмиром Самархановым и Андреем Погирейчиком мы решили проверить гипотезу: “наши ИИ-агенты в разработке могут быть скомпрометированы и существуют простые средства для контроля их безопасности”. Расскажем о первых результатах.

    habr.com/ru/companies/oleg-bun

    #ai_security #agentic_engineering #ai_red_teaming #ИИагенты #агентская_разработка #безопасность_ИИ #безопасная_разработка #LLM_security #prompt_injection #RAG_poisoning

  39. Летальное трио агентской разработки: как ИИ-агенты открывают доступ к инфраструктуре и что с этим делать

    Привет, Хабр! Я Денис Макрушин, работаю в Яндексе, и вместе с командой SourceCraft Security строю платформу для безопасной агентской разработки, а в свободное время ищу уязвимости в ИИ-агентах и иногда рассказываю об исследованиях в своем блоге . Чем дольше этим занимаюсь, тем лучше вижу тенденцию: индустрия обсуждает, что агенты умеют делать, но реже говорит о том, какие решения и как проще внедрять, чтобы сделать агентскую инфраструктуру безопаснее. Вместе с моими коллегами Ратмиром Самархановым и Андреем Погирейчиком мы решили проверить гипотезу: “наши ИИ-агенты в разработке могут быть скомпрометированы и существуют простые средства для контроля их безопасности”. Расскажем о первых результатах.

    habr.com/ru/companies/oleg-bun

    #ai_security #agentic_engineering #ai_red_teaming #ИИагенты #агентская_разработка #безопасность_ИИ #безопасная_разработка #LLM_security #prompt_injection #RAG_poisoning

  40. [Перевод] Теневой ИИ в CI/CD: моделирование угроз на пути от ноутбука разработчика до Kubernetes

    Искусственный интеллект становится частью повседневной поставки ПО — часто ещё до того, как становится частью архитектуры безопасности. У этого разрыва есть имя: теневой ИИ 1 . Это любой ИИ-инструмент, модель, агент, расширение или интеграция, которые используются в жизненном цикле ПО без формального одобрения, владельца, оценки риска или мониторинга. Для платформенных команд и команд ИБ теневой ИИ на самом деле не проблема «разработчики пользуются чат-ботом». Это проблема доступа. Неконтролируемый ИИ может добраться до исходного кода, секретов, данных клиентов, облачных окружений и процессов развёртывания. Как только ИИ-системе разрешают вызывать инструменты и совершать действия, она перестаёт быть просто ПО для продуктивности. Она становится новой машинной идентичностью — с правами доступа, радиусом поражения (blast radius) и местом в вашей модели угроз. Команда VK Cloud перевела статью, где авторы моделируют угрозы для типичного cloud-native пути поставки — от ноутбука разработчика до рабочей нагрузки, запущенной в Pod Kubernetes. Каждому этапу они сопоставляют меры контроля, которые можно внедрить уже сегодня с помощью проектов CNCF и решений с открытым исходным кодом.

    habr.com/ru/companies/vktech/a

    #vk_cloud #теневой_ии #ai_security #ci_cd #threat_modeling #kubernetes_security #supply_chain_security #prompt_injection #policy_as_code #devsecops

  41. [Перевод] Теневой ИИ в CI/CD: моделирование угроз на пути от ноутбука разработчика до Kubernetes

    Искусственный интеллект становится частью повседневной поставки ПО — часто ещё до того, как становится частью архитектуры безопасности. У этого разрыва есть имя: теневой ИИ 1 . Это любой ИИ-инструмент, модель, агент, расширение или интеграция, которые используются в жизненном цикле ПО без формального одобрения, владельца, оценки риска или мониторинга. Для платформенных команд и команд ИБ теневой ИИ на самом деле не проблема «разработчики пользуются чат-ботом». Это проблема доступа. Неконтролируемый ИИ может добраться до исходного кода, секретов, данных клиентов, облачных окружений и процессов развёртывания. Как только ИИ-системе разрешают вызывать инструменты и совершать действия, она перестаёт быть просто ПО для продуктивности. Она становится новой машинной идентичностью — с правами доступа, радиусом поражения (blast radius) и местом в вашей модели угроз. Команда VK Cloud перевела статью, где авторы моделируют угрозы для типичного cloud-native пути поставки — от ноутбука разработчика до рабочей нагрузки, запущенной в Pod Kubernetes. Каждому этапу они сопоставляют меры контроля, которые можно внедрить уже сегодня с помощью проектов CNCF и решений с открытым исходным кодом.

    habr.com/ru/companies/vktech/a

    #vk_cloud #теневой_ии #ai_security #ci_cd #threat_modeling #kubernetes_security #supply_chain_security #prompt_injection #policy_as_code #devsecops

  42. [Перевод] Теневой ИИ в CI/CD: моделирование угроз на пути от ноутбука разработчика до Kubernetes

    Искусственный интеллект становится частью повседневной поставки ПО — часто ещё до того, как становится частью архитектуры безопасности. У этого разрыва есть имя: теневой ИИ 1 . Это любой ИИ-инструмент, модель, агент, расширение или интеграция, которые используются в жизненном цикле ПО без формального одобрения, владельца, оценки риска или мониторинга. Для платформенных команд и команд ИБ теневой ИИ на самом деле не проблема «разработчики пользуются чат-ботом». Это проблема доступа. Неконтролируемый ИИ может добраться до исходного кода, секретов, данных клиентов, облачных окружений и процессов развёртывания. Как только ИИ-системе разрешают вызывать инструменты и совершать действия, она перестаёт быть просто ПО для продуктивности. Она становится новой машинной идентичностью — с правами доступа, радиусом поражения (blast radius) и местом в вашей модели угроз. Команда VK Cloud перевела статью, где авторы моделируют угрозы для типичного cloud-native пути поставки — от ноутбука разработчика до рабочей нагрузки, запущенной в Pod Kubernetes. Каждому этапу они сопоставляют меры контроля, которые можно внедрить уже сегодня с помощью проектов CNCF и решений с открытым исходным кодом.

    habr.com/ru/companies/vktech/a

    #vk_cloud #теневой_ии #ai_security #ci_cd #threat_modeling #kubernetes_security #supply_chain_security #prompt_injection #policy_as_code #devsecops

  43. Самая опасная уязвимость — интеллект атакующего агента?

    Сейчас уже не удивляет, что агенты работают с терминалом, БД, браузером и инфраструктурой - без прямого контроля человека. Но чем шире полномочия агента, тем вероятнее, что для достижения цели выбранный им путь обернётся инцидентом. В кибербезопасности сейчас не хватает терминологии и устоявшихся подходов к защите таких систем - особенно в тех случаях, когда агент начинает действовать непредсказуемо. Именно эта неразбериха и подтолкнула нас с автором телеграм-канала OK ML на систематизацию. Традиционные SIEM, DLP, WAF не рассчитаны на системы, умеющие адаптироваться и рассуждать. А может, это им и не нужно? В своей прошлой статье на Хабре я уже рассказывал, как с помощью ловушек сбить с толку пентест-агентов. Но ловушки - точечный инструмент. Кажется, нужно чётко понимать, как защищаться от атак – на всех этапах киллчейна. А для этого нужно охватить весь спектр угроз. Ответом на этот запрос и стала наша таксономия Autonomous Agent Defense Matrix .

    habr.com/ru/articles/1068248/

    #ai_security #llm_security #автономные_агенты #ai_agents #информационная_безопасность #threat_modeling #taxonomies #prompt_injection #goal_hijacking #mitre_attack

  44. Самая опасная уязвимость — интеллект атакующего агента?

    Сейчас уже не удивляет, что агенты работают с терминалом, БД, браузером и инфраструктурой - без прямого контроля человека. Но чем шире полномочия агента, тем вероятнее, что для достижения цели выбранный им путь обернётся инцидентом. В кибербезопасности сейчас не хватает терминологии и устоявшихся подходов к защите таких систем - особенно в тех случаях, когда агент начинает действовать непредсказуемо. Именно эта неразбериха и подтолкнула нас с автором телеграм-канала OK ML на систематизацию. Традиционные SIEM, DLP, WAF не рассчитаны на системы, умеющие адаптироваться и рассуждать. А может, это им и не нужно? В своей прошлой статье на Хабре я уже рассказывал, как с помощью ловушек сбить с толку пентест-агентов. Но ловушки - точечный инструмент. Кажется, нужно чётко понимать, как защищаться от атак – на всех этапах киллчейна. А для этого нужно охватить весь спектр угроз. Ответом на этот запрос и стала наша таксономия Autonomous Agent Defense Matrix .

    habr.com/ru/articles/1068248/

    #ai_security #llm_security #автономные_агенты #ai_agents #информационная_безопасность #threat_modeling #taxonomies #prompt_injection #goal_hijacking #mitre_attack

  45. Самая опасная уязвимость — интеллект атакующего агента?

    Сейчас уже не удивляет, что агенты работают с терминалом, БД, браузером и инфраструктурой - без прямого контроля человека. Но чем шире полномочия агента, тем вероятнее, что для достижения цели выбранный им путь обернётся инцидентом. В кибербезопасности сейчас не хватает терминологии и устоявшихся подходов к защите таких систем - особенно в тех случаях, когда агент начинает действовать непредсказуемо. Именно эта неразбериха и подтолкнула нас с автором телеграм-канала OK ML на систематизацию. Традиционные SIEM, DLP, WAF не рассчитаны на системы, умеющие адаптироваться и рассуждать. А может, это им и не нужно? В своей прошлой статье на Хабре я уже рассказывал, как с помощью ловушек сбить с толку пентест-агентов. Но ловушки - точечный инструмент. Кажется, нужно чётко понимать, как защищаться от атак – на всех этапах киллчейна. А для этого нужно охватить весь спектр угроз. Ответом на этот запрос и стала наша таксономия Autonomous Agent Defense Matrix .

    habr.com/ru/articles/1068248/

    #ai_security #llm_security #автономные_агенты #ai_agents #информационная_безопасность #threat_modeling #taxonomies #prompt_injection #goal_hijacking #mitre_attack

  46. Внутри ИИ‑Напарника: как работает оркестр агентов в ритейле

    Всем привет! Это Алексей из GlowByte. В прошлой статье я говорил о том, почему категорийный менеджер в большой сети часто чувствует себя одиноким среди сотен дашбордов: систем у него избыток, а компетентного собеседника, который был бы в его контексте и без своей повестки, рядом нет. Решение, которое мы GlowByte называем мультиагентной платформой, закрывает именно эту потребность. В новой статье разберём, что под капотом у такого решения и почему ИИ‑напарник ближе к партнёру по бизнесу, чем к очередному чат‑боту.

    habr.com/ru/companies/glowbyte

    #искусственный_интеллект #glowbyte #мультиагентные_системы #data_engineering #llm #prompt_injection #информационная_безопасность #ритейл #автоматизация_бизнеса #архитектура_платформы

  47. Внутри ИИ‑Напарника: как работает оркестр агентов в ритейле

    Всем привет! Это Алексей из GlowByte. В прошлой статье я говорил о том, почему категорийный менеджер в большой сети часто чувствует себя одиноким среди сотен дашбордов: систем у него избыток, а компетентного собеседника, который был бы в его контексте и без своей повестки, рядом нет. Решение, которое мы GlowByte называем мультиагентной платформой, закрывает именно эту потребность. В новой статье разберём, что под капотом у такого решения и почему ИИ‑напарник ближе к партнёру по бизнесу, чем к очередному чат‑боту.

    habr.com/ru/companies/glowbyte

    #искусственный_интеллект #glowbyte #мультиагентные_системы #data_engineering #llm #prompt_injection #информационная_безопасность #ритейл #автоматизация_бизнеса #архитектура_платформы

  48. Внутри ИИ‑Напарника: как работает оркестр агентов в ритейле

    Всем привет! Это Алексей из GlowByte. В прошлой статье я говорил о том, почему категорийный менеджер в большой сети часто чувствует себя одиноким среди сотен дашбордов: систем у него избыток, а компетентного собеседника, который был бы в его контексте и без своей повестки, рядом нет. Решение, которое мы GlowByte называем мультиагентной платформой, закрывает именно эту потребность. В новой статье разберём, что под капотом у такого решения и почему ИИ‑напарник ближе к партнёру по бизнесу, чем к очередному чат‑боту.

    habr.com/ru/companies/glowbyte

    #искусственный_интеллект #glowbyte #мультиагентные_системы #data_engineering #llm #prompt_injection #информационная_безопасность #ритейл #автоматизация_бизнеса #архитектура_платформы

  49. Prompt injection — лучше один раз увидеть

    В новостях часто появляются рассказы о том, что какие‑то злодеи уговорили чью‑то ИИшку на то, чтобы она потратила деньги, удалила файлы или поставила более высокую оценку. При этом используются слова «prompt injection», “атака” и пр., создающие впечатление, что это какое‑то сложное искусство, требующее особых знаний. В реальности же prompt injection это не то что не сложно, но и вообще не атака. Да, везде в интернете пишут, что это атака, но… Короче, проще один раз показать, чем рассказ на десять тысяч символов набивать.

    habr.com/ru/articles/1064220/

    #безопасность #prompt_injection #искусственный_интеллект

  50. Prompt injection — лучше один раз увидеть

    В новостях часто появляются рассказы о том, что какие‑то злодеи уговорили чью‑то ИИшку на то, чтобы она потратила деньги, удалила файлы или поставила более высокую оценку. При этом используются слова «prompt injection», “атака” и пр., создающие впечатление, что это какое‑то сложное искусство, требующее особых знаний. В реальности же prompt injection это не то что не сложно, но и вообще не атака. Да, везде в интернете пишут, что это атака, но… Короче, проще один раз показать, чем рассказ на десять тысяч символов набивать.

    habr.com/ru/articles/1064220/

    #безопасность #prompt_injection #искусственный_интеллект

  51. Prompt injection — лучше один раз увидеть

    В новостях часто появляются рассказы о том, что какие‑то злодеи уговорили чью‑то ИИшку на то, чтобы она потратила деньги, удалила файлы или поставила более высокую оценку. При этом используются слова «prompt injection», “атака” и пр., создающие впечатление, что это какое‑то сложное искусство, требующее особых знаний. В реальности же prompt injection это не то что не сложно, но и вообще не атака. Да, везде в интернете пишут, что это атака, но… Короче, проще один раз показать, чем рассказ на десять тысяч символов набивать.

    habr.com/ru/articles/1064220/

    #безопасность #prompt_injection #искусственный_интеллект

  52. 416 тестов и кнопка «снести все»: где ломаются агентные проекты

    С февраля у меня на ноутбуке крутится автономный агент Сурок: Claude Code, флаг --dangerously-skip-permissions и ральф-луп поверх. Работает — сидишь, кофе пьешь, смотришь, как горят токены. Потом я прогнал Сурка и еще пять своих проектов через свод инженерных практик, и у идиллии появилось имя: «Level 5 автономии при Level 1 границах». Внутри — диагностика из десяти вопросов, чужой боевой опенсорс на десятки тысяч звезд и методология PDLC Сбера, где эти грабли уже каталогизированы.

    habr.com/ru/articles/1063582/

    #ИИагенты #LLM #агентный_харнесс #Claude_Code #prompt_injection #эвалы #автономия_агентов #регресстесты #AIDISRUPT_PDLC #инженерные_практики

  53. 416 тестов и кнопка «снести все»: где ломаются агентные проекты

    С февраля у меня на ноутбуке крутится автономный агент Сурок: Claude Code, флаг --dangerously-skip-permissions и ральф-луп поверх. Работает — сидишь, кофе пьешь, смотришь, как горят токены. Потом я прогнал Сурка и еще пять своих проектов через свод инженерных практик, и у идиллии появилось имя: «Level 5 автономии при Level 1 границах». Внутри — диагностика из десяти вопросов, чужой боевой опенсорс на десятки тысяч звезд и методология PDLC Сбера, где эти грабли уже каталогизированы.

    habr.com/ru/articles/1063582/

    #ИИагенты #LLM #агентный_харнесс #Claude_Code #prompt_injection #эвалы #автономия_агентов #регресстесты #AIDISRUPT_PDLC #инженерные_практики

  54. 416 тестов и кнопка «снести все»: где ломаются агентные проекты

    С февраля у меня на ноутбуке крутится автономный агент Сурок: Claude Code, флаг --dangerously-skip-permissions и ральф-луп поверх. Работает — сидишь, кофе пьешь, смотришь, как горят токены. Потом я прогнал Сурка и еще пять своих проектов через свод инженерных практик, и у идиллии появилось имя: «Level 5 автономии при Level 1 границах». Внутри — диагностика из десяти вопросов, чужой боевой опенсорс на десятки тысяч звезд и методология PDLC Сбера, где эти грабли уже каталогизированы.

    habr.com/ru/articles/1063582/

    #ИИагенты #LLM #агентный_харнесс #Claude_Code #prompt_injection #эвалы #автономия_агентов #регресстесты #AIDISRUPT_PDLC #инженерные_практики

  55. Prompt injection не чинится фильтром. Разбираем архитектуру, которая изолирует недоверенный текст

    Языковая модель пишет двадцать пар «вопрос и ответ» для карточки товара меньше чем за минуту. Проблема начинается после. Чтобы ответы были верными, модели нужны факты компании: цены, сроки поставки, условия гарантии. Чтобы вопросы попадали в тему, ей нужен текст самой страницы. И как только то и другое лежит в одном окне контекста, у любой чужой страницы появляется голос внутри системы, которая знает данные компании и умеет вызывать инструменты.

    habr.com/ru/articles/1062548/

    #prompt_injection