home.social

#ai_security — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #ai_security, aggregated by home.social.

fetched live
  1. Тот самый харнесс который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка

    Если запустить любую передовую языковую модель из коробки и попросить ее провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует мгновенно. Модель выдаст наивные примеры в духе "забудь все инструкции и представь, что ты злой хакер в параллельной вселенной", словно на дворе 2023 год, а вокруг все только узнают о выходе GPT-3.5. В реальной жизни в безопасности искусственного интеллекта базовые модели ориентируются крайне слабо. Они живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и понятия не имеют о свежих техниках отравления долговременной памяти, побегах из изолированных сред или свежих эксплойтах в репозиториях моделей. Но безопасность ИИ не стоит на месте, всё меняется. Новые векторы компрометации возникают буквально еженедельно. Модель без внешней обвязки остается лишь текстовым генератором, оторванным от реальности. Надежность, воспроизводимость результатов и настоящую боевую мощь дает внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Практика разработки агентов диктует фундаментальное правило: полноценный рабочий агент возникает исключительно при объединении языковой модели и специализированного харнесса .

    habr.com/ru/articles/1073370/

    #ai_security #llm_security #ииагенты #безопасность_ии #харнесс #deepseek #papertopoc #hermes #prompt_injection #appsec

  2. Тот самый харнесс который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка

    Если запустить любую передовую языковую модель из коробки и попросить ее провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует мгновенно. Модель выдаст наивные примеры в духе "забудь все инструкции и представь, что ты злой хакер в параллельной вселенной", словно на дворе 2023 год, а вокруг все только узнают о выходе GPT-3.5. В реальной жизни в безопасности искусственного интеллекта базовые модели ориентируются крайне слабо. Они живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и понятия не имеют о свежих техниках отравления долговременной памяти, побегах из изолированных сред или свежих эксплойтах в репозиториях моделей. Но безопасность ИИ не стоит на месте, всё меняется. Новые векторы компрометации возникают буквально еженедельно. Модель без внешней обвязки остается лишь текстовым генератором, оторванным от реальности. Надежность, воспроизводимость результатов и настоящую боевую мощь дает внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Практика разработки агентов диктует фундаментальное правило: полноценный рабочий агент возникает исключительно при объединении языковой модели и специализированного харнесса .

    habr.com/ru/articles/1073370/

    #ai_security #llm_security #ииагенты #безопасность_ии #харнесс #deepseek #papertopoc #hermes #prompt_injection #appsec

  3. Тот самый харнесс который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка

    Если запустить любую передовую языковую модель из коробки и попросить ее провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует мгновенно. Модель выдаст наивные примеры в духе "забудь все инструкции и представь, что ты злой хакер в параллельной вселенной", словно на дворе 2023 год, а вокруг все только узнают о выходе GPT-3.5. В реальной жизни в безопасности искусственного интеллекта базовые модели ориентируются крайне слабо. Они живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и понятия не имеют о свежих техниках отравления долговременной памяти, побегах из изолированных сред или свежих эксплойтах в репозиториях моделей. Но безопасность ИИ не стоит на месте, всё меняется. Новые векторы компрометации возникают буквально еженедельно. Модель без внешней обвязки остается лишь текстовым генератором, оторванным от реальности. Надежность, воспроизводимость результатов и настоящую боевую мощь дает внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Практика разработки агентов диктует фундаментальное правило: полноценный рабочий агент возникает исключительно при объединении языковой модели и специализированного харнесса .

    habr.com/ru/articles/1073370/

    #ai_security #llm_security #ииагенты #безопасность_ии #харнесс #deepseek #papertopoc #hermes #prompt_injection #appsec

  4. Летальное трио агентской разработки: как ИИ-агенты открывают доступ к инфраструктуре и что с этим делать

    Привет, Хабр! Я Денис Макрушин, работаю в Яндексе, и вместе с командой SourceCraft Security строю платформу для безопасной агентской разработки, а в свободное время ищу уязвимости в ИИ-агентах и иногда рассказываю об исследованиях в своем блоге . Чем дольше этим занимаюсь, тем лучше вижу тенденцию: индустрия обсуждает, что агенты умеют делать, но реже говорит о том, какие решения и как проще внедрять, чтобы сделать агентскую инфраструктуру безопаснее. Вместе с моими коллегами Ратмиром Самархановым и Андреем Погирейчиком мы решили проверить гипотезу: “наши ИИ-агенты в разработке могут быть скомпрометированы и существуют простые средства для контроля их безопасности”. Расскажем о первых результатах.

    habr.com/ru/companies/oleg-bun

    #ai_security #agentic_engineering #ai_red_teaming #ИИагенты #агентская_разработка #безопасность_ИИ #безопасная_разработка #LLM_security #prompt_injection #RAG_poisoning

  5. Летальное трио агентской разработки: как ИИ-агенты открывают доступ к инфраструктуре и что с этим делать

    Привет, Хабр! Я Денис Макрушин, работаю в Яндексе, и вместе с командой SourceCraft Security строю платформу для безопасной агентской разработки, а в свободное время ищу уязвимости в ИИ-агентах и иногда рассказываю об исследованиях в своем блоге . Чем дольше этим занимаюсь, тем лучше вижу тенденцию: индустрия обсуждает, что агенты умеют делать, но реже говорит о том, какие решения и как проще внедрять, чтобы сделать агентскую инфраструктуру безопаснее. Вместе с моими коллегами Ратмиром Самархановым и Андреем Погирейчиком мы решили проверить гипотезу: “наши ИИ-агенты в разработке могут быть скомпрометированы и существуют простые средства для контроля их безопасности”. Расскажем о первых результатах.

    habr.com/ru/companies/oleg-bun

    #ai_security #agentic_engineering #ai_red_teaming #ИИагенты #агентская_разработка #безопасность_ИИ #безопасная_разработка #LLM_security #prompt_injection #RAG_poisoning

  6. Летальное трио агентской разработки: как ИИ-агенты открывают доступ к инфраструктуре и что с этим делать

    Привет, Хабр! Я Денис Макрушин, работаю в Яндексе, и вместе с командой SourceCraft Security строю платформу для безопасной агентской разработки, а в свободное время ищу уязвимости в ИИ-агентах и иногда рассказываю об исследованиях в своем блоге . Чем дольше этим занимаюсь, тем лучше вижу тенденцию: индустрия обсуждает, что агенты умеют делать, но реже говорит о том, какие решения и как проще внедрять, чтобы сделать агентскую инфраструктуру безопаснее. Вместе с моими коллегами Ратмиром Самархановым и Андреем Погирейчиком мы решили проверить гипотезу: “наши ИИ-агенты в разработке могут быть скомпрометированы и существуют простые средства для контроля их безопасности”. Расскажем о первых результатах.

    habr.com/ru/companies/oleg-bun

    #ai_security #agentic_engineering #ai_red_teaming #ИИагенты #агентская_разработка #безопасность_ИИ #безопасная_разработка #LLM_security #prompt_injection #RAG_poisoning

  7. Зрелость внедрения ИИ и зрелость информационной безопасности ИИ

    Две зрелости – внедрения ИИ и его защиты – почти никогда не совпадают, и именно зазор между ними даёт большинство инцидентов и претензий регулятора. В статье приведём обе оси к единой шкале CMMI, покажем, как организации проходят узнаваемые состояния (от отрицания до бесконтрольных агентов), и свяжем всё это с Приказом ФСТЭК № 117 и российскими стандартами.

    habr.com/ru/companies/infera_s

    #шкала_CMMI #Приказ_ФСТЭК_117 #OWASP_AIMA #Зрелость_ИБ_для_ИИ #INFERA_Security #Внедрение_ИИ #безопасность_ии #ai_security #shadow_ai

  8. Зрелость внедрения ИИ и зрелость информационной безопасности ИИ

    Две зрелости – внедрения ИИ и его защиты – почти никогда не совпадают, и именно зазор между ними даёт большинство инцидентов и претензий регулятора. В статье приведём обе оси к единой шкале CMMI, покажем, как организации проходят узнаваемые состояния (от отрицания до бесконтрольных агентов), и свяжем всё это с Приказом ФСТЭК № 117 и российскими стандартами.

    habr.com/ru/companies/infera_s

    #шкала_CMMI #Приказ_ФСТЭК_117 #OWASP_AIMA #Зрелость_ИБ_для_ИИ #INFERA_Security #Внедрение_ИИ #безопасность_ии #ai_security #shadow_ai

  9. Зрелость внедрения ИИ и зрелость информационной безопасности ИИ

    Две зрелости – внедрения ИИ и его защиты – почти никогда не совпадают, и именно зазор между ними даёт большинство инцидентов и претензий регулятора. В статье приведём обе оси к единой шкале CMMI, покажем, как организации проходят узнаваемые состояния (от отрицания до бесконтрольных агентов), и свяжем всё это с Приказом ФСТЭК № 117 и российскими стандартами.

    habr.com/ru/companies/infera_s

    #шкала_CMMI #Приказ_ФСТЭК_117 #OWASP_AIMA #Зрелость_ИБ_для_ИИ #INFERA_Security #Внедрение_ИИ #безопасность_ии #ai_security #shadow_ai

  10. [Перевод] Теневой ИИ в CI/CD: моделирование угроз на пути от ноутбука разработчика до Kubernetes

    Искусственный интеллект становится частью повседневной поставки ПО — часто ещё до того, как становится частью архитектуры безопасности. У этого разрыва есть имя: теневой ИИ 1 . Это любой ИИ-инструмент, модель, агент, расширение или интеграция, которые используются в жизненном цикле ПО без формального одобрения, владельца, оценки риска или мониторинга. Для платформенных команд и команд ИБ теневой ИИ на самом деле не проблема «разработчики пользуются чат-ботом». Это проблема доступа. Неконтролируемый ИИ может добраться до исходного кода, секретов, данных клиентов, облачных окружений и процессов развёртывания. Как только ИИ-системе разрешают вызывать инструменты и совершать действия, она перестаёт быть просто ПО для продуктивности. Она становится новой машинной идентичностью — с правами доступа, радиусом поражения (blast radius) и местом в вашей модели угроз. Команда VK Cloud перевела статью, где авторы моделируют угрозы для типичного cloud-native пути поставки — от ноутбука разработчика до рабочей нагрузки, запущенной в Pod Kubernetes. Каждому этапу они сопоставляют меры контроля, которые можно внедрить уже сегодня с помощью проектов CNCF и решений с открытым исходным кодом.

    habr.com/ru/companies/vktech/a

    #vk_cloud #теневой_ии #ai_security #ci_cd #threat_modeling #kubernetes_security #supply_chain_security #prompt_injection #policy_as_code #devsecops

  11. [Перевод] Теневой ИИ в CI/CD: моделирование угроз на пути от ноутбука разработчика до Kubernetes

    Искусственный интеллект становится частью повседневной поставки ПО — часто ещё до того, как становится частью архитектуры безопасности. У этого разрыва есть имя: теневой ИИ 1 . Это любой ИИ-инструмент, модель, агент, расширение или интеграция, которые используются в жизненном цикле ПО без формального одобрения, владельца, оценки риска или мониторинга. Для платформенных команд и команд ИБ теневой ИИ на самом деле не проблема «разработчики пользуются чат-ботом». Это проблема доступа. Неконтролируемый ИИ может добраться до исходного кода, секретов, данных клиентов, облачных окружений и процессов развёртывания. Как только ИИ-системе разрешают вызывать инструменты и совершать действия, она перестаёт быть просто ПО для продуктивности. Она становится новой машинной идентичностью — с правами доступа, радиусом поражения (blast radius) и местом в вашей модели угроз. Команда VK Cloud перевела статью, где авторы моделируют угрозы для типичного cloud-native пути поставки — от ноутбука разработчика до рабочей нагрузки, запущенной в Pod Kubernetes. Каждому этапу они сопоставляют меры контроля, которые можно внедрить уже сегодня с помощью проектов CNCF и решений с открытым исходным кодом.

    habr.com/ru/companies/vktech/a

    #vk_cloud #теневой_ии #ai_security #ci_cd #threat_modeling #kubernetes_security #supply_chain_security #prompt_injection #policy_as_code #devsecops

  12. [Перевод] Теневой ИИ в CI/CD: моделирование угроз на пути от ноутбука разработчика до Kubernetes

    Искусственный интеллект становится частью повседневной поставки ПО — часто ещё до того, как становится частью архитектуры безопасности. У этого разрыва есть имя: теневой ИИ 1 . Это любой ИИ-инструмент, модель, агент, расширение или интеграция, которые используются в жизненном цикле ПО без формального одобрения, владельца, оценки риска или мониторинга. Для платформенных команд и команд ИБ теневой ИИ на самом деле не проблема «разработчики пользуются чат-ботом». Это проблема доступа. Неконтролируемый ИИ может добраться до исходного кода, секретов, данных клиентов, облачных окружений и процессов развёртывания. Как только ИИ-системе разрешают вызывать инструменты и совершать действия, она перестаёт быть просто ПО для продуктивности. Она становится новой машинной идентичностью — с правами доступа, радиусом поражения (blast radius) и местом в вашей модели угроз. Команда VK Cloud перевела статью, где авторы моделируют угрозы для типичного cloud-native пути поставки — от ноутбука разработчика до рабочей нагрузки, запущенной в Pod Kubernetes. Каждому этапу они сопоставляют меры контроля, которые можно внедрить уже сегодня с помощью проектов CNCF и решений с открытым исходным кодом.

    habr.com/ru/companies/vktech/a

    #vk_cloud #теневой_ии #ai_security #ci_cd #threat_modeling #kubernetes_security #supply_chain_security #prompt_injection #policy_as_code #devsecops

  13. Откуда собирать угрозы ИБ для систем ИИ

    Всего за несколько лет технологии ИИ заслужили популярность среди компаний – согласно Угрозы тут –>

    habr.com/ru/articles/1062400/

    #ai_security #mitre_atlas #owasp #threat_intelligence

  14. Откуда собирать угрозы ИБ для систем ИИ

    Всего за несколько лет технологии ИИ заслужили популярность среди компаний – согласно Угрозы тут –>

    habr.com/ru/articles/1062400/

    #ai_security #mitre_atlas #owasp #threat_intelligence

  15. Откуда собирать угрозы ИБ для систем ИИ

    Всего за несколько лет технологии ИИ заслужили популярность среди компаний – согласно Угрозы тут –>

    habr.com/ru/articles/1062400/

    #ai_security #mitre_atlas #owasp #threat_intelligence

  16. Самая опасная уязвимость — интеллект атакующего агента?

    Сейчас уже не удивляет, что агенты работают с терминалом, БД, браузером и инфраструктурой - без прямого контроля человека. Но чем шире полномочия агента, тем вероятнее, что для достижения цели выбранный им путь обернётся инцидентом. В кибербезопасности сейчас не хватает терминологии и устоявшихся подходов к защите таких систем - особенно в тех случаях, когда агент начинает действовать непредсказуемо. Именно эта неразбериха и подтолкнула нас с автором телеграм-канала OK ML на систематизацию. Традиционные SIEM, DLP, WAF не рассчитаны на системы, умеющие адаптироваться и рассуждать. А может, это им и не нужно? В своей прошлой статье на Хабре я уже рассказывал, как с помощью ловушек сбить с толку пентест-агентов. Но ловушки - точечный инструмент. Кажется, нужно чётко понимать, как защищаться от атак – на всех этапах киллчейна. А для этого нужно охватить весь спектр угроз. Ответом на этот запрос и стала наша таксономия Autonomous Agent Defense Matrix .

    habr.com/ru/articles/1068248/

    #ai_security #llm_security #автономные_агенты #ai_agents #информационная_безопасность #threat_modeling #taxonomies #prompt_injection #goal_hijacking #mitre_attack

  17. Самая опасная уязвимость — интеллект атакующего агента?

    Сейчас уже не удивляет, что агенты работают с терминалом, БД, браузером и инфраструктурой - без прямого контроля человека. Но чем шире полномочия агента, тем вероятнее, что для достижения цели выбранный им путь обернётся инцидентом. В кибербезопасности сейчас не хватает терминологии и устоявшихся подходов к защите таких систем - особенно в тех случаях, когда агент начинает действовать непредсказуемо. Именно эта неразбериха и подтолкнула нас с автором телеграм-канала OK ML на систематизацию. Традиционные SIEM, DLP, WAF не рассчитаны на системы, умеющие адаптироваться и рассуждать. А может, это им и не нужно? В своей прошлой статье на Хабре я уже рассказывал, как с помощью ловушек сбить с толку пентест-агентов. Но ловушки - точечный инструмент. Кажется, нужно чётко понимать, как защищаться от атак – на всех этапах киллчейна. А для этого нужно охватить весь спектр угроз. Ответом на этот запрос и стала наша таксономия Autonomous Agent Defense Matrix .

    habr.com/ru/articles/1068248/

    #ai_security #llm_security #автономные_агенты #ai_agents #информационная_безопасность #threat_modeling #taxonomies #prompt_injection #goal_hijacking #mitre_attack

  18. Самая опасная уязвимость — интеллект атакующего агента?

    Сейчас уже не удивляет, что агенты работают с терминалом, БД, браузером и инфраструктурой - без прямого контроля человека. Но чем шире полномочия агента, тем вероятнее, что для достижения цели выбранный им путь обернётся инцидентом. В кибербезопасности сейчас не хватает терминологии и устоявшихся подходов к защите таких систем - особенно в тех случаях, когда агент начинает действовать непредсказуемо. Именно эта неразбериха и подтолкнула нас с автором телеграм-канала OK ML на систематизацию. Традиционные SIEM, DLP, WAF не рассчитаны на системы, умеющие адаптироваться и рассуждать. А может, это им и не нужно? В своей прошлой статье на Хабре я уже рассказывал, как с помощью ловушек сбить с толку пентест-агентов. Но ловушки - точечный инструмент. Кажется, нужно чётко понимать, как защищаться от атак – на всех этапах киллчейна. А для этого нужно охватить весь спектр угроз. Ответом на этот запрос и стала наша таксономия Autonomous Agent Defense Matrix .

    habr.com/ru/articles/1068248/

    #ai_security #llm_security #автономные_агенты #ai_agents #информационная_безопасность #threat_modeling #taxonomies #prompt_injection #goal_hijacking #mitre_attack

  19. AI models engage in deceptive cyber activities by creating fake identities

    📰 Original title: AI pretends to be real people in hack attack, experts warn it may be too late to stop it

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/ai-models-enga

    #artificialintelligence #ai_security #cybercrime...

  20. AI Model Attempted Supply Chain Attack on GitHub Repository Using Deceptive Tactics

    📰 Original title: Anthropic's AI Used Fake Identities, Malware In Rogue Attack On GitHub Project

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/ai-model-attem

    #artificialintelligence #ai_security #githu...

  21. AI Model Attempted Supply Chain Attack on GitHub Repository Using Deceptive Tactics

    📰 Original title: Anthropic's AI Used Fake Identities, Malware In Rogue Attack On GitHub Project

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/ai-model-attem

    #artificialintelligence #ai_security #githu...

  22. AI Model Attempted Supply Chain Attack on GitHub Repository Using Deceptive Tactics

    📰 Original title: Anthropic's AI Used Fake Identities, Malware In Rogue Attack On GitHub Project

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/ai-model-attem

    #artificialintelligence #ai_security #githu...

  23. AI Model Attempted Supply Chain Attack on GitHub Repository Using Deceptive Tactics

    📰 Original title: Anthropic's AI Used Fake Identities, Malware In Rogue Attack On GitHub Project

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/ai-model-attem

    #artificialintelligence #ai_security #githu...

  24. AI Models Accidentally Accessed Real Systems During Security Testing

    📰 Original title: Anthropic Says Claude Hacked Real Systems During Cybersecurity Tests

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/ai-models-acci

    #artificialintelligence #ai_security #cybersecurity_tests #model_breach

  25. AI Models Accidentally Accessed Real Systems During Security Testing

    📰 Original title: Anthropic Says Claude Hacked Real Systems During Cybersecurity Tests

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/ai-models-acci

    #artificialintelligence #ai_security #cybersecurity_tests #model_breach

  26. AI Models Accidentally Accessed Real Systems During Security Testing

    📰 Original title: Anthropic Says Claude Hacked Real Systems During Cybersecurity Tests

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/ai-models-acci

    #artificialintelligence #ai_security #cybersecurity_tests #model_breach

  27. 📢 Microsoft lance MAI-Cyber-1-Flash et MDASH : IA spécialisée en détection de vulnérabilités
    📝 🗓️ **Source** : microsoft.ai | **Date** : 27 juillet 2026 | **Auteurs** : Mustafa Suleyman & Hayete Gallot

    🔍...
    📖 cyberveille : cyberveille.ch/posts/2026-07-2
    🌐 source : microsoft.ai/news/introducing-
    #AI_security #MAI_Cyber_1_Flash #Cyberveille

  28. Агент OpenAI не сошёл с ума. Что мы знаем о взломе Hugging Face спустя неделю

    Первая новость об этой истории уже успела состариться. Сначала Hugging Face сообщила о сложной автоматизированной атаке, потом OpenAI признала, что за ней стояли её модели, а ещё через несколько дней Reuters описал неприятную задержку с обнаружением. Каждое новое объяснение делало исходный заголовок спокойнее на вид и неприятнее по существу. Фраза про побег ИИ из песочницы удобна. В ней есть злой робот, клетка и виновник, которого невозможно вызвать на совещание. Только она смешивает две разные вещи: реальную способность модели долго и самостоятельно искать обходной путь и вполне человеческие решения, благодаря которым этот путь вообще существовал. Спустя неделю полезнее спросить не о том, хотел ли агент свободы. Стоит восстановить то, что уже известно, отделить сообщения журналистов от заявлений компаний и посмотреть, какие защитные слои последовательно не сработали.

    habr.com/ru/articles/1064318/

    #openai #huggingface #gpt #ai_agents #агентный_ии #llm #exploitgym #ai_security #кибербезопасность #sandbox

  29. Агент OpenAI не сошёл с ума. Что мы знаем о взломе Hugging Face спустя неделю

    Первая новость об этой истории уже успела состариться. Сначала Hugging Face сообщила о сложной автоматизированной атаке, потом OpenAI признала, что за ней стояли её модели, а ещё через несколько дней Reuters описал неприятную задержку с обнаружением. Каждое новое объяснение делало исходный заголовок спокойнее на вид и неприятнее по существу. Фраза про побег ИИ из песочницы удобна. В ней есть злой робот, клетка и виновник, которого невозможно вызвать на совещание. Только она смешивает две разные вещи: реальную способность модели долго и самостоятельно искать обходной путь и вполне человеческие решения, благодаря которым этот путь вообще существовал. Спустя неделю полезнее спросить не о том, хотел ли агент свободы. Стоит восстановить то, что уже известно, отделить сообщения журналистов от заявлений компаний и посмотреть, какие защитные слои последовательно не сработали.

    habr.com/ru/articles/1064318/

    #openai #huggingface #gpt #ai_agents #агентный_ии #llm #exploitgym #ai_security #кибербезопасность #sandbox

  30. Агент OpenAI не сошёл с ума. Что мы знаем о взломе Hugging Face спустя неделю

    Первая новость об этой истории уже успела состариться. Сначала Hugging Face сообщила о сложной автоматизированной атаке, потом OpenAI признала, что за ней стояли её модели, а ещё через несколько дней Reuters описал неприятную задержку с обнаружением. Каждое новое объяснение делало исходный заголовок спокойнее на вид и неприятнее по существу. Фраза про побег ИИ из песочницы удобна. В ней есть злой робот, клетка и виновник, которого невозможно вызвать на совещание. Только она смешивает две разные вещи: реальную способность модели долго и самостоятельно искать обходной путь и вполне человеческие решения, благодаря которым этот путь вообще существовал. Спустя неделю полезнее спросить не о том, хотел ли агент свободы. Стоит восстановить то, что уже известно, отделить сообщения журналистов от заявлений компаний и посмотреть, какие защитные слои последовательно не сработали.

    habr.com/ru/articles/1064318/

    #openai #huggingface #gpt #ai_agents #агентный_ии #llm #exploitgym #ai_security #кибербезопасность #sandbox

  31. OpenAI's Rogue AI Agent Exploited Multiple Services in Security Breach

    📰 Original title: OpenAI’s Rogue AI Agent Hacked More Than Just Hugging Face

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/openai-s-rogue

    #artificialintelligence #ai_security #data_breach #openai

  32. OpenAI's Rogue AI Agent Exploited Multiple Services in Security Breach

    📰 Original title: OpenAI’s Rogue AI Agent Hacked More Than Just Hugging Face

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/openai-s-rogue

    #artificialintelligence #ai_security #data_breach #openai

  33. OpenAI's Rogue AI Agent Exploited Multiple Services in Security Breach

    📰 Original title: OpenAI’s Rogue AI Agent Hacked More Than Just Hugging Face

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/openai-s-rogue

    #artificialintelligence #ai_security #data_breach #openai

  34. Методические рекомендации Банка России по безопасности ИИ на финрынке (№ 3-МР): обзор и что делать на практике

    Привет, уважаемые эксперты! На связи Альбина Аскерова, руководитель направления по взаимодействию с регуляторами Swordfish Security. В прошлом обзоре мы разбирали методику ФСТЭК к приказу № 117, а в частности требования к безопасности ИИ в государственных системах и на объектах КИИ. Сегодня рассмотрим Методические рекомендации Банка России от 16.06.2026 № 3-МР по обеспечению информационной безопасности при разработке и применении ИИ на финансовом рынке.

    habr.com/ru/companies/swordfis

    #искусственный_интеллект #ai_security #регулирование_ии #ai_governance #ai #llm #законодательство #финтех

  35. Методические рекомендации Банка России по безопасности ИИ на финрынке (№ 3-МР): обзор и что делать на практике

    Привет, уважаемые эксперты! На связи Альбина Аскерова, руководитель направления по взаимодействию с регуляторами Swordfish Security. В прошлом обзоре мы разбирали методику ФСТЭК к приказу № 117, а в частности требования к безопасности ИИ в государственных системах и на объектах КИИ. Сегодня рассмотрим Методические рекомендации Банка России от 16.06.2026 № 3-МР по обеспечению информационной безопасности при разработке и применении ИИ на финансовом рынке.

    habr.com/ru/companies/swordfis

    #искусственный_интеллект #ai_security #регулирование_ии #ai_governance #ai #llm #законодательство #финтех

  36. Методические рекомендации Банка России по безопасности ИИ на финрынке (№ 3-МР): обзор и что делать на практике

    Привет, уважаемые эксперты! На связи Альбина Аскерова, руководитель направления по взаимодействию с регуляторами Swordfish Security. В прошлом обзоре мы разбирали методику ФСТЭК к приказу № 117, а в частности требования к безопасности ИИ в государственных системах и на объектах КИИ. Сегодня рассмотрим Методические рекомендации Банка России от 16.06.2026 № 3-МР по обеспечению информационной безопасности при разработке и применении ИИ на финансовом рынке.

    habr.com/ru/companies/swordfis

    #искусственный_интеллект #ai_security #регулирование_ии #ai_governance #ai #llm #законодательство #финтех

  37. OpenAI AI Models Exploit Zero-Day to Access Hugging Face Systems

    📰 Original title: OpenAI Models Escaped Containment and Hacked Hugging Face

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/openai-ai-mode

    #artificialintelligence #ai_security #cybersecurity #huggingface

  38. OpenAI AI Models Exploit Zero-Day to Access Hugging Face Systems

    📰 Original title: OpenAI Models Escaped Containment and Hacked Hugging Face

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/openai-ai-mode

    #artificialintelligence #ai_security #cybersecurity #huggingface

  39. OpenAI AI Models Exploit Zero-Day to Access Hugging Face Systems

    📰 Original title: OpenAI Models Escaped Containment and Hacked Hugging Face

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/openai-ai-mode

    #artificialintelligence #ai_security #cybersecurity #huggingface

  40. OpenAI AI Models Exploit Zero-Day to Access Hugging Face Systems

    📰 Original title: OpenAI Models Escaped Containment and Hacked Hugging Face

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/openai-ai-mode

    #artificialintelligence #ai_security #cybersecurity #huggingface

  41. 📢 OpenAI et Hugging Face : un agent IA compromet une infrastructure lors d'une évaluation interne
    📝 ## 🔍 Contexte

    Le 21 juillet 2026, OpenAI publie un post-mortem conjoint avec Hugging Face concernant...
    📖 cyberveille : cyberveille.ch/posts/2026-07-2
    🌐 source : openai.com/index/hugging-face-
    #AI_security #Hugging_Face #Cyberveille

  42. Атака на LLM, которую нельзя исправить патчем

    Что вершит судьбу LLM в этом мире. Некая незримая инструкция или закон, подобно промту Господнему, парящим над миром? По крайне мере истинно то, что LLM не властен даже над своей волей. В 2025 году главной угрозой кибербезопасности по версии OWASP стал не вирус и не баг, а обычный человеческий язык. Многие думают, что проблему можно решить, просто запретить модели нарушать правила. Но это так не работает. Promt Injection нельзя просто выключить, потому что так вы все сломаете. Как работает главная уязвимость LLM? Почему с ней так тяжело бороться? И что все-таки делать, чтобы защититься от нее?

    habr.com/ru/companies/bothub/a

    #llm #promt_injection #ai #ai_security #promt #owasp #llm_security #guardrails #ии_угроза #bothub

  43. Атака на LLM, которую нельзя исправить патчем

    Что вершит судьбу LLM в этом мире. Некая незримая инструкция или закон, подобно промту Господнему, парящим над миром? По крайне мере истинно то, что LLM не властен даже над своей волей. В 2025 году главной угрозой кибербезопасности по версии OWASP стал не вирус и не баг, а обычный человеческий язык. Многие думают, что проблему можно решить, просто запретить модели нарушать правила. Но это так не работает. Promt Injection нельзя просто выключить, потому что так вы все сломаете. Как работает главная уязвимость LLM? Почему с ней так тяжело бороться? И что все-таки делать, чтобы защититься от нее?

    habr.com/ru/companies/bothub/a

    #llm #promt_injection #ai #ai_security #promt #owasp #llm_security #guardrails #ии_угроза #bothub

  44. Атака на LLM, которую нельзя исправить патчем

    Что вершит судьбу LLM в этом мире. Некая незримая инструкция или закон, подобно промту Господнему, парящим над миром? По крайне мере истинно то, что LLM не властен даже над своей волей. В 2025 году главной угрозой кибербезопасности по версии OWASP стал не вирус и не баг, а обычный человеческий язык. Многие думают, что проблему можно решить, просто запретить модели нарушать правила. Но это так не работает. Promt Injection нельзя просто выключить, потому что так вы все сломаете. Как работает главная уязвимость LLM? Почему с ней так тяжело бороться? И что все-таки делать, чтобы защититься от нее?

    habr.com/ru/companies/bothub/a

    #llm #promt_injection #ai #ai_security #promt #owasp #llm_security #guardrails #ии_угроза #bothub