#adversarial_ai — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #adversarial_ai, aggregated by home.social.
-
Эпистемические ловушки для автономных ИИ-агентов в пространстве правдоподобных интерпретаций
Дисклеймер: это наша разработка (HYBRA Research Group), не сторонний анализ. Публикуем, чтобы получить объективную критику от сообщества. Любая атака на систему — будь то классический брутфорс паролей или направленный поиск автономного ИИ-агента — опирается на одно скрытое условие: атакующий должен знать, когда он победил. Этот сигнал — компас. Неверный ключ выдает шум, верный — осмысленный текст. Эта разница создает градиент, который ведет оптимизацию, reinforcement learning и любые формы направленного поиска к цели. Чтобы понять, что произойдет, если сломать этот механизм, возьмем конкретный пример. Допустим, перехвачено сообщение, в котором по контексту есть email на @ gmail.com . Local-part состоит из 3 до 20 символов (латиница и цифры). Пространство синтаксически правильных адресов:
https://habr.com/ru/articles/1058992/
#эпистемическая_ловушка #HYBRA_MIRAGE #автономные_ИИагенты #AI_Safety #посткавантовое_шифрование #верификационный_оракул #adversarial_AI #plausible_deniability