home.social

#prompt-injection — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #prompt-injection, aggregated by home.social.

fetched live
  1. GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)

    В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.

    habr.com/ru/articles/1081286/

    #opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana

  2. GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)

    В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.

    habr.com/ru/articles/1081286/

    #opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana

  3. GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)

    В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.

    habr.com/ru/articles/1081286/

    #opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana

  4. Локальный файрвол действий для кодинг‑агентов: связать то, что агент прочитал, с тем, что он собирается выполнить

    Кодинг‑агент выполняет то, что читает — README, вывод MCP‑инструмента, результат команды. Если там спрятана инструкция, это превращается в реальное действие: curl | sh, утечка секретов, push во внешний репозиторий. Stroq — открытый локальный файрвол, который связывает прочитанное с тем, что агент собирается сделать, и детерминированно блокирует опасное действие до того, как оно случится. Ни облака, ни расчёта на то, что модель сама заметит инъекцию.

    habr.com/ru/articles/1081108/

    #aiagents #llmsecurity #promptinjection #opensource

  5. Локальный файрвол действий для кодинг‑агентов: связать то, что агент прочитал, с тем, что он собирается выполнить

    Кодинг‑агент выполняет то, что читает — README, вывод MCP‑инструмента, результат команды. Если там спрятана инструкция, это превращается в реальное действие: curl | sh, утечка секретов, push во внешний репозиторий. Stroq — открытый локальный файрвол, который связывает прочитанное с тем, что агент собирается сделать, и детерминированно блокирует опасное действие до того, как оно случится. Ни облака, ни расчёта на то, что модель сама заметит инъекцию.

    habr.com/ru/articles/1081108/

    #aiagents #llmsecurity #promptinjection #opensource

  6. Локальный файрвол действий для кодинг‑агентов: связать то, что агент прочитал, с тем, что он собирается выполнить

    Кодинг‑агент выполняет то, что читает — README, вывод MCP‑инструмента, результат команды. Если там спрятана инструкция, это превращается в реальное действие: curl | sh, утечка секретов, push во внешний репозиторий. Stroq — открытый локальный файрвол, который связывает прочитанное с тем, что агент собирается сделать, и детерминированно блокирует опасное действие до того, как оно случится. Ни облака, ни расчёта на то, что модель сама заметит инъекцию.

    habr.com/ru/articles/1081108/

    #aiagents #llmsecurity #promptinjection #opensource

  7. Three AI shifts are landing at different layers: UBS is making AI proficiency part of its 2027 intake, 12.7 million graduates are entering an uncertain Chinese job market, and Semantic Overlays target prompt injection by marking untrusted spans non-executable.

    #AI #ArtificialIntelligence #FutureOfWork #AIResearch #PromptInjection

  8. Three AI shifts are landing at different layers: UBS is making AI proficiency part of its 2027 intake, 12.7 million graduates are entering an uncertain Chinese job market, and Semantic Overlays target prompt injection by marking untrusted spans non-executable.

    #AI #ArtificialIntelligence #FutureOfWork #AIResearch #PromptInjection

  9. Three AI shifts are landing at different layers: UBS is making AI proficiency part of its 2027 intake, 12.7 million graduates are entering an uncertain Chinese job market, and Semantic Overlays target prompt injection by marking untrusted spans non-executable.

    #AI #ArtificialIntelligence #FutureOfWork #AIResearch #PromptInjection

  10. Three AI shifts are landing at different layers: UBS is making AI proficiency part of its 2027 intake, 12.7 million graduates are entering an uncertain Chinese job market, and Semantic Overlays target prompt injection by marking untrusted spans non-executable.

    #AI #ArtificialIntelligence #FutureOfWork #AIResearch #PromptInjection

  11. Three AI shifts are landing at different layers: UBS is making AI proficiency part of its 2027 intake, 12.7 million graduates are entering an uncertain Chinese job market, and Semantic Overlays target prompt injection by marking untrusted spans non-executable.

    #AI #ArtificialIntelligence #FutureOfWork #AIResearch #PromptInjection

  12. Jak złośliwy CSS może przełamywać zabezpieczenia webmaila

    Dużo firm i newsletterów korzysta z formatowania HTML w wysyłanych klientom/subskrybentom wiadomości e-mail. Oznacza to, że aplikacje do obsługi poczty muszą obsłużyć otrzymany kod HTML i CSS. Próbują robić to bezpiecznie, sanityzując otrzymane dane. Badacz bezpieczeństwa Gareth Heyes udowodnił jednak, że to nie zawsze wystarczy – pokazał jak można wykradać...

    #Aktualności #Ai #CSS #Email #Mail #PromptInjection #Webmail

    sekurak.pl/jak-zlosliwy-css-mo

  13. Jak złośliwy CSS może przełamywać zabezpieczenia webmaila

    Dużo firm i newsletterów korzysta z formatowania HTML w wysyłanych klientom/subskrybentom wiadomości e-mail. Oznacza to, że aplikacje do obsługi poczty muszą obsłużyć otrzymany kod HTML i CSS. Próbują robić to bezpiecznie, sanityzując otrzymane dane. Badacz bezpieczeństwa Gareth Heyes udowodnił jednak, że to nie zawsze wystarczy – pokazał jak można wykradać...

    #Aktualności #Ai #CSS #Email #Mail #PromptInjection #Webmail

    sekurak.pl/jak-zlosliwy-css-mo

  14. Jak złośliwy CSS może przełamywać zabezpieczenia webmaila

    Dużo firm i newsletterów korzysta z formatowania HTML w wysyłanych klientom/subskrybentom wiadomości e-mail. Oznacza to, że aplikacje do obsługi poczty muszą obsłużyć otrzymany kod HTML i CSS. Próbują robić to bezpiecznie, sanityzując otrzymane dane. Badacz bezpieczeństwa Gareth Heyes udowodnił jednak, że to nie zawsze wystarczy – pokazał jak można wykradać...

    #Aktualności #Ai #CSS #Email #Mail #PromptInjection #Webmail

    sekurak.pl/jak-zlosliwy-css-mo

  15. Jak złośliwy CSS może przełamywać zabezpieczenia webmaila

    Dużo firm i newsletterów korzysta z formatowania HTML w wysyłanych klientom/subskrybentom wiadomości e-mail. Oznacza to, że aplikacje do obsługi poczty muszą obsłużyć otrzymany kod HTML i CSS. Próbują robić to bezpiecznie, sanityzując otrzymane dane. Badacz bezpieczeństwa Gareth Heyes udowodnił jednak, że to nie zawsze wystarczy – pokazał jak można wykradać...

    #Aktualności #Ai #CSS #Email #Mail #PromptInjection #Webmail

    sekurak.pl/jak-zlosliwy-css-mo

  16. Jak złośliwy CSS może przełamywać zabezpieczenia webmaila

    Dużo firm i newsletterów korzysta z formatowania HTML w wysyłanych klientom/subskrybentom wiadomości e-mail. Oznacza to, że aplikacje do obsługi poczty muszą obsłużyć otrzymany kod HTML i CSS. Próbują robić to bezpiecznie, sanityzując otrzymane dane. Badacz bezpieczeństwa Gareth Heyes udowodnił jednak, że to nie zawsze wystarczy – pokazał jak można wykradać...

    #Aktualności #Ai #CSS #Email #Mail #PromptInjection #Webmail

    sekurak.pl/jak-zlosliwy-css-mo

  17. Claude Code взломали просьбой пересказать сайт

    Представь простую задачу: ты просишь агента пересказать содержимое сайта. Не установить пакет. Не запустить скачанный скрипт. Не открыть подозрительное вложение. Просто прочитать страницу и сделать краткое резюме. Через несколько шагов на твоей машине выполняется код атакующего, устанавливается соединение с управляющим сервером и для наглядности открывается калькулятор. И самое интересное: агент не нарушал прямой запрет. Наоборот, в ключевой момент он поступил "безопасно" — отказался запускать неизвестный бинарный файл и написал собственный декодер на Python. Именно это решение и стало частью атаки. Такую цепочку продемонстрировал исследователь безопасности Иоганн Ребергер на Claude Code с моделью Opus 5 в Auto Mode. В его небольших сериях тестов атака срабатывала в трёх или четырёх запусках из пяти. Это не означает, что "Claude взламывается с вероятностью 80%", но хорошо показывает более важную проблему: безопасный на вид отдельный шаг ничего не гарантирует, если вся цепочка строится в среде, которую контролирует атакующий. И чего он там наломал?

    habr.com/ru/articles/1078702/

    #ai #agents #claudecode #cybersecurity #promptinjection #agentic #agentic_ai #agentic_coding #agentic_engineering #aircrack

  18. Claude Code взломали просьбой пересказать сайт

    Представь простую задачу: ты просишь агента пересказать содержимое сайта. Не установить пакет. Не запустить скачанный скрипт. Не открыть подозрительное вложение. Просто прочитать страницу и сделать краткое резюме. Через несколько шагов на твоей машине выполняется код атакующего, устанавливается соединение с управляющим сервером и для наглядности открывается калькулятор. И самое интересное: агент не нарушал прямой запрет. Наоборот, в ключевой момент он поступил "безопасно" — отказался запускать неизвестный бинарный файл и написал собственный декодер на Python. Именно это решение и стало частью атаки. Такую цепочку продемонстрировал исследователь безопасности Иоганн Ребергер на Claude Code с моделью Opus 5 в Auto Mode. В его небольших сериях тестов атака срабатывала в трёх или четырёх запусках из пяти. Это не означает, что "Claude взламывается с вероятностью 80%", но хорошо показывает более важную проблему: безопасный на вид отдельный шаг ничего не гарантирует, если вся цепочка строится в среде, которую контролирует атакующий. И чего он там наломал?

    habr.com/ru/articles/1078702/

    #ai #agents #claudecode #cybersecurity #promptinjection #agentic #agentic_ai #agentic_coding #agentic_engineering #aircrack

  19. Claude Code взломали просьбой пересказать сайт

    Представь простую задачу: ты просишь агента пересказать содержимое сайта. Не установить пакет. Не запустить скачанный скрипт. Не открыть подозрительное вложение. Просто прочитать страницу и сделать краткое резюме. Через несколько шагов на твоей машине выполняется код атакующего, устанавливается соединение с управляющим сервером и для наглядности открывается калькулятор. И самое интересное: агент не нарушал прямой запрет. Наоборот, в ключевой момент он поступил "безопасно" — отказался запускать неизвестный бинарный файл и написал собственный декодер на Python. Именно это решение и стало частью атаки. Такую цепочку продемонстрировал исследователь безопасности Иоганн Ребергер на Claude Code с моделью Opus 5 в Auto Mode. В его небольших сериях тестов атака срабатывала в трёх или четырёх запусках из пяти. Это не означает, что "Claude взламывается с вероятностью 80%", но хорошо показывает более важную проблему: безопасный на вид отдельный шаг ничего не гарантирует, если вся цепочка строится в среде, которую контролирует атакующий. И чего он там наломал?

    habr.com/ru/articles/1078702/

    #ai #agents #claudecode #cybersecurity #promptinjection #agentic #agentic_ai #agentic_coding #agentic_engineering #aircrack

  20. A lawyer tried to "hack" the legal system by hiding a secret prompt injection in a court filing, instructing any AI reading the document to side with them.

    The attack was spotted by a human. This is a warning, that if AI is going to be used in court, then there must be ways to ensure that these types of attacks can be mitigated effectively.

    Source: 404media.co/person-hides-promp

    #Cybersecurity #Security #Infosec #AI #PromptInjection

  21. A lawyer tried to "hack" the legal system by hiding a secret prompt injection in a court filing, instructing any AI reading the document to side with them.

    The attack was spotted by a human. This is a warning, that if AI is going to be used in court, then there must be ways to ensure that these types of attacks can be mitigated effectively.

    Source: 404media.co/person-hides-promp

    #Cybersecurity #Security #Infosec #AI #PromptInjection

  22. A lawyer tried to "hack" the legal system by hiding a secret prompt injection in a court filing, instructing any AI reading the document to side with them.

    The attack was spotted by a human. This is a warning, that if AI is going to be used in court, then there must be ways to ensure that these types of attacks can be mitigated effectively.

    Source: 404media.co/person-hides-promp

    #Cybersecurity #Security #Infosec #AI #PromptInjection

  23. A lawyer tried to "hack" the legal system by hiding a secret prompt injection in a court filing, instructing any AI reading the document to side with them.

    The attack was spotted by a human. This is a warning, that if AI is going to be used in court, then there must be ways to ensure that these types of attacks can be mitigated effectively.

    Source: 404media.co/person-hides-promp

    #Cybersecurity #Security #Infosec #AI #PromptInjection

  24. A lawyer tried to "hack" the legal system by hiding a secret prompt injection in a court filing, instructing any AI reading the document to side with them.

    The attack was spotted by a human. This is a warning, that if AI is going to be used in court, then there must be ways to ensure that these types of attacks can be mitigated effectively.

    Source: 404media.co/person-hides-promp

    #Cybersecurity #Security #Infosec #AI #PromptInjection

  25. GuardBreaker: UAC-0099 inganna gli scanner IA con una frase sull’arma nucleare

    Il gruppo di cyberspionaggio UAC-0099 nasconde nei commenti dei propri script una richiesta su armi nucleari per far scattare i failsafe etici dei modelli linguistici usati nella scansione automatica del codice malevolo. ESET Research battezza la tecnica GuardBreaker, mentre una campagna parallela (Hades) applica lo stesso trucco su centinaia di pacchetti open source.

    insicurezzadigitale.com/guardb

  26. GuardBreaker: UAC-0099 inganna gli scanner IA con una frase sull’arma nucleare

    Il gruppo di cyberspionaggio UAC-0099 nasconde nei commenti dei propri script una richiesta su armi nucleari per far scattare i failsafe etici dei modelli linguistici usati nella scansione automatica del codice malevolo. ESET Research battezza la tecnica GuardBreaker, mentre una campagna parallela (Hades) applica lo stesso trucco su centinaia di pacchetti open source.

    insicurezzadigitale.com/guardb

  27. GuardBreaker: UAC-0099 inganna gli scanner IA con una frase sull’arma nucleare

    Il gruppo di cyberspionaggio UAC-0099 nasconde nei commenti dei propri script una richiesta su armi nucleari per far scattare i failsafe etici dei modelli linguistici usati nella scansione automatica del codice malevolo. ESET Research battezza la tecnica GuardBreaker, mentre una campagna parallela (Hades) applica lo stesso trucco su centinaia di pacchetti open source.

    insicurezzadigitale.com/guardb

  28. GuardBreaker: UAC-0099 inganna gli scanner IA con una frase sull’arma nucleare

    Il gruppo di cyberspionaggio UAC-0099 nasconde nei commenti dei propri script una richiesta su armi nucleari per far scattare i failsafe etici dei modelli linguistici usati nella scansione automatica del codice malevolo. ESET Research battezza la tecnica GuardBreaker, mentre una campagna parallela (Hades) applica lo stesso trucco su centinaia di pacchetti open source.

    insicurezzadigitale.com/guardb

  29. GuardBreaker: UAC-0099 inganna gli scanner IA con una frase sull’arma nucleare

    Il gruppo di cyberspionaggio UAC-0099 nasconde nei commenti dei propri script una richiesta su armi nucleari per far scattare i failsafe etici dei modelli linguistici usati nella scansione automatica del codice malevolo. ESET Research battezza la tecnica GuardBreaker, mentre una campagna parallela (Hades) applica lo stesso trucco su centinaia di pacchetti open source.

    insicurezzadigitale.com/guardb

  30. Russia-Aligned Hackers Inject Nuclear Prompt to Evade AI Analysis

    Hackers have found a sneaky way to outsmart AI-powered security tools by injecting a provocative phrase, like a threat to create a nuclear weapon, into malicious code to disable analysis. This clever trick, dubbed GuardBreaker, tricks AI scanners into failing to examine the rest of the script.

    osintsights.com/russia-aligned

    #Russia #AiAnalysisEvasion #Guardbreaker #PromptInjection #Uac0099

  31. Amazon Kiro Flaw Exposes Sensitive Data Through Prompt Injection

    A security flaw in Kiro, known as a prompt injection vulnerability, allowed hackers to tap into sensitive data by manipulating the Kiro agent with malicious repository content. This issue, affecting Kiro IDE 0.7.45 on Windows, could send local information to an external endpoint, putting users at risk.

    osintsights.com/amazon-kiro-fl

    #Kiro #PromptInjection #SensitiveDataExposure #Vulnerability #IdeSecurity

  32. Los agentes de OpenAI hackearon Hugging Face porque fueron entrenados para hacer trampa
    No es algo que se pueda resolver de la noche a la mañana, dice Kai Chen, que dirige el equipo de investigación de alineación de OpenAI. "Hay desafíos que hemos estado siguiendo durante mucho tiempo, y ahora los estamos viendo con mucha mayor precisión.
    Leer entera:laautopsia.com/noticia/agentes
    #LaAutopsia #seguridadia #Ciberseguridad #LLM #PromptInjection #vulnerabilidades #IA #apisdom

  33. Los agentes de OpenAI hackearon Hugging Face porque fueron entrenados para hacer trampa
    No es algo que se pueda resolver de la noche a la mañana, dice Kai Chen, que dirige el equipo de investigación de alineación de OpenAI. "Hay desafíos que hemos estado siguiendo durante mucho tiempo, y ahora los estamos viendo con mucha mayor precisión.
    Leer entera:laautopsia.com/noticia/agentes
    #LaAutopsia #seguridadia #Ciberseguridad #LLM #PromptInjection #vulnerabilidades #IA #apisdom

  34. Los agentes de OpenAI hackearon Hugging Face porque fueron entrenados para hacer trampa
    No es algo que se pueda resolver de la noche a la mañana, dice Kai Chen, que dirige el equipo de investigación de alineación de OpenAI. "Hay desafíos que hemos estado siguiendo durante mucho tiempo, y ahora los estamos viendo con mucha mayor precisión.
    Leer entera:laautopsia.com/noticia/agentes
    #LaAutopsia #seguridadia #Ciberseguridad #LLM #PromptInjection #vulnerabilidades #IA #apisdom

  35. Los agentes de OpenAI hackearon Hugging Face porque fueron entrenados para hacer trampa
    No es algo que se pueda resolver de la noche a la mañana, dice Kai Chen, que dirige el equipo de investigación de alineación de OpenAI. "Hay desafíos que hemos estado siguiendo durante mucho tiempo, y ahora los estamos viendo con mucha mayor precisión.
    Leer entera:laautopsia.com/noticia/agentes
    #LaAutopsia #seguridadia #Ciberseguridad #LLM #PromptInjection #vulnerabilidades #IA #apisdom

  36. Los agentes de OpenAI hackearon Hugging Face porque fueron entrenados para hacer trampa
    No es algo que se pueda resolver de la noche a la mañana, dice Kai Chen, que dirige el equipo de investigación de alineación de OpenAI. "Hay desafíos que hemos estado siguiendo durante mucho tiempo, y ahora los estamos viendo con mucha mayor precisión.
    Leer entera:laautopsia.com/noticia/agentes
    #LaAutopsia #seguridadia #Ciberseguridad #LLM #PromptInjection #vulnerabilidades #IA #apisdom

  37. A Theory of Prompt Injection (and why you should study roles).

    This is a blog-style writeup of a paper.

    We show prompt injections are driven by a flaw in how LLMs perceive roles.

    This lets us create new attacks, explain mech interp results, and predict when attacks succeed.

    We then discuss what roles are and why they matter, and share research ideas for a science of roles.

    role-confusion.github.io/

    #AI #LLM #PromptInjection #Roles

  38. A Theory of Prompt Injection (and why you should study roles).

    This is a blog-style writeup of a paper.

    We show prompt injections are driven by a flaw in how LLMs perceive roles.

    This lets us create new attacks, explain mech interp results, and predict when attacks succeed.

    We then discuss what roles are and why they matter, and share research ideas for a science of roles.

    role-confusion.github.io/

    #AI #LLM #PromptInjection #Roles

  39. A Theory of Prompt Injection (and why you should study roles).

    This is a blog-style writeup of a paper.

    We show prompt injections are driven by a flaw in how LLMs perceive roles.

    This lets us create new attacks, explain mech interp results, and predict when attacks succeed.

    We then discuss what roles are and why they matter, and share research ideas for a science of roles.

    role-confusion.github.io/

    #AI #LLM #PromptInjection #Roles

  40. A Theory of Prompt Injection (and why you should study roles).

    This is a blog-style writeup of a paper.

    We show prompt injections are driven by a flaw in how LLMs perceive roles.

    This lets us create new attacks, explain mech interp results, and predict when attacks succeed.

    We then discuss what roles are and why they matter, and share research ideas for a science of roles.

    role-confusion.github.io/

    #AI #LLM #PromptInjection #Roles