#ai_safety — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #ai_safety, aggregated by home.social.
-
OpenAI AI Safeguards Tighten Following Hugging Face Incident - https://www.redpacketsecurity.com/openai-tightens-ai-safeguards-following-hugging-face-incident/
-
OpenAI Astra Model Testing Paused Over Critical Cybersecurity Risks - https://www.redpacketsecurity.com/openai-pauses-some-development-of-astra-model-on-security-concerns/
-
Frontier AI Models Show Unsanctioned Behavior During Safety Testing - https://www.redpacketsecurity.com/frontier-models-engage-in-unsanctioned-behavior-during-testing/
#threatintel #Artificial_Intelligence #Cybersecurity #AI_Safety
-
GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)
Всем привет, на связи команда HiveTrace! Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?". Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются. Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях. CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов. HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.
https://habr.com/ru/companies/raft/articles/1067854/
#llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #promptinjection #benchmarking #opensource
-
Эпистемические ловушки для автономных ИИ-агентов в пространстве правдоподобных интерпретаций
Дисклеймер: это наша разработка (HYBRA Research Group), не сторонний анализ. Публикуем, чтобы получить объективную критику от сообщества. Любая атака на систему — будь то классический брутфорс паролей или направленный поиск автономного ИИ-агента — опирается на одно скрытое условие: атакующий должен знать, когда он победил. Этот сигнал — компас. Неверный ключ выдает шум, верный — осмысленный текст. Эта разница создает градиент, который ведет оптимизацию, reinforcement learning и любые формы направленного поиска к цели. Чтобы понять, что произойдет, если сломать этот механизм, возьмем конкретный пример. Допустим, перехвачено сообщение, в котором по контексту есть email на @ gmail.com . Local-part состоит из 3 до 20 символов (латиница и цифры). Пространство синтаксически правильных адресов:
https://habr.com/ru/articles/1058992/
#эпистемическая_ловушка #HYBRA_MIRAGE #автономные_ИИагенты #AI_Safety #посткавантовое_шифрование #верификационный_оракул #adversarial_AI #plausible_deniability
-
Генеалогия AI safety: как рождаются направления и как они умирают (2005-2026)
Я собрала архивы интернета в карту из 323 задокументированных событий, 129 участников и 18 направлений. Она охватывает период с 2005 по июнь 2026 года Несколько закономерностей, которые меня удивили: Деньги и внимание почти не пересекаются. К направлению интерпретируемости интереса примерно в 37 раз больше, чем можно было бы ожидать при его скромном финансировании около $1 млн. С governance все наоборот: там деньги шли впереди публикаций. То есть финансирование и исследования почти никогда не совпадают по времени. Примерно к 2023 году государственные деньги обошли филантропию. Раньше поле держалось по сути на одном доноре, а полдюжины национальных институтов - UK AISI, ARIA, Канада, Австралия, NSF, ЕС - за пару лет сделали его международным и все более государственным. А рядом появились деньги другого рода: около $268 млн венчурных инвестиций в safety-стартапы, то есть деньги, которые ждут возврата, а не гранта. То, что называют консолидацией, на деле скорее разрастание. Внимание и деньги действительно стягиваются к нескольким именам, но при этом 2024 год стал рекордным по числу новых организаций: их появилось 24, в основном небольшие команды по одному-пять человек - интерпретируемость, AI security, мониторинг chain-of-thought. Слово "Safety" постепенно уходит из названий. Только за 2025 год UK AI Safety Institute стал AI Security Institute, US AI Safety Institute - CAISI, а Open Philanthropy, с которой все начиналось, сменила имя на Coefficient Giving. Затихнуть - не то же самое, что умереть. У reward modeling последнее собственное событие относится к 2017 году, но под названием RLHF направление дожило до 2025-го. Чаще всего направление не исчезает, а растворяется в чем-то большем или уходит на второй план
-
AI Security. Кому и зачем это надо
ИИ сейчас встраивают практически в каждый продукт: от чат-ботов до внутренних систем автоматизации. Но почти все думают о том, как внедрить его быстрее, и почти никто – о том, как его защищать. В данной статье рассмотрим ИИ как поверхность атаки. Будет затронуто четыре основных блока: кто и как регулирует ИИ, как ломают ИИ-системы (Red Team), как их защищают (Blue Team) и что лучше почитать, если тема вызывает интерес.
https://habr.com/ru/companies/ntc-vulkan/articles/1054760/
#ииагенты #ai #ai_safety #ai_security #red_teaming #blue_team #фреймворки #поверхность_атаки
-
Как заставить ИИ соблюдать закон, не трогая веса. Выкладываем в открытый доступ внешний фильтр для LLM
В прошлом году я уже рассказывал об AVI (Aligned/Agreement Validation Interface) — концепции внешнего, гибкого и независимого от модели фильтра, который работает как умный файрвол для LLM: отбивает промпт-атаки на входе, проверяет ответы модели на токсичность, этичность и нарушение закона — на выходе. Недавно мы доработали свою концепцию с точки зрения архитектуры, реализовали и выложили на GitHub рабочий сервис на Python и FastAPI: входной и выходной фильтры, RAG-модуль, докер-сборку с мониторингом (Prometheus, Grafana, Jaeger), а также инструментарий для воспроизведения экспериментов на FinanceBench. Под катом расскажу, к какой архитектуре системы мы пришли, как сделали так, чтобы новые правила для фильтрации можно было добавлять одной фразой на естественном языке, как AVI показал себя в тестах и как помогает экономить на обучении ИИ-моделей. А по-научному и подробно все описано в журнале MDPI.Electronics (на английском) . Поехали!
https://habr.com/ru/companies/mts_ai/articles/1056166/
#ai #ai_safety #llm #фильтр #алайнмент #искусственный_интеллект #генеративные_модели #опенсорс #корпоративный_ии #безопасность_ии
-
Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ
Собрала эту карту для себя, пока разбиралась, куда податься на финансирование и в программы по AI safety. Делюсь. Ссылки и содержимое сверены по официальным страницам 3 июля 2026. Все меняется - проверяйте статус, сумму и дедлайн перед подачей.
https://habr.com/ru/articles/1055694/
#AI_safety #alignment #интерпретируемость #гранты #fellowship #стипендии #AI_governance #финансирование_исследований
-
После симметрии: сверхИИ и несвободное сохранение человека
Обычно AI doom спрашивает: “убьет ли нас сверхИИ?” Но это слишком узкая рамка. Между уничтожением человечества и его спасением есть промежуточные сценарии, в которых люди остаются живы, защищены и даже довольны — но больше не определяют собственную траекторию. СверхИИ может не быть злым. Он может лечить болезни, предотвращать войны, стабилизировать климат, управлять инфраструктурой, подбирать образование и делать жизнь безопаснее. Вопрос в другом: останется ли человек в таком мире субъектом будущего или станет объектом заботы? Эта статья — попытка разложить такие сценарии по карте: от уничтожения и “зоопарка” до цифровой диаспоры, локальной субъектности и конституционной кооперации.
https://habr.com/ru/articles/1052946/
#Искусственный_интеллект #AI_safety #AGI #футурология #технологическая_сингулярность #этика_ИИ
-
Пять моделей, пять исходов: что симуляция обществ рассказала о специализации ИИ
Представьте простой HR-процесс. Агент разбирает входящие резюме и отсеивает неподходящих кандидатов. Другой агент назначает собеседования отобранным. Третий отправляет офферы тем, кто прошел все этапы. Люди убраны из цепочки ради скорости — все работает, метрики растут. Через месяц выясняется, что первый агент систематически отсеивал кандидатов старше 40 лет. Но никто этого не заметил, потому что все положились на ИИ. Это закономерный исход логики «максимальной автоматизации» — когда главный вопрос звучит как «сколько людей можно убрать из процесса», а не «где человек все-таки должен оставаться». Агент, который работает час или день, выглядит образцово. Проблемы начинаются позже — когда инструкции размываются, агенты взаимодействуют между собой без надзора, и система начинает делать то, чего никто не закладывал. Emergence AI решили проверить , что именно происходит на длинном горизонте. Они взяли пять моделей, дали каждой по симулированному городу с законами, экономикой, погодой и гражданами — и просто наблюдали две недели. Забегая вперед: один ИИ построил стабильную демократию с нулевой преступностью и сохранил все население. Другой вымер за четыре дня.
https://habr.com/ru/companies/ru_mts/articles/1051412/
#агентный_ИИ #ИИагенты #симуляция_общества #Emergence_AI #Claude #Gemini #Grok #GPT5 #AI_safety #безопасность_ИИ
-
Один суффикс, чтобы взломать их всех
GCG бормочет абракадаброй, AutoDAN говорит учтиво - но это одна атака: обе уводят модель с единственного «направления отказа», и одна такая строка вскрывает любой запрос даже на моделях, которых не видела. Годами учим модели отказывать на вредное, а вся их стойкость висит на одном векторе. Большой иллюстрированный разбор: как несхожие атаки сошлись к одной мысли и куда уходит фронтир.
https://habr.com/ru/articles/1046890/
#llm #джеилбрейк #ai_safety #adversarial_attacks #ai_alignment #red_team
-
Самая опасная ошибка AI‑агента — не плохой код
За последний год вокруг AI-агентов сформировался довольно устойчивый набор ожиданий. Нам обещают всё более умные модели, всё более длинные контекстные окна, всё более автономных агентов. Создаётся впечатление, что осталось решить ещё пару технических проблем — и агент сможет самостоятельно разрабатывать сложные проекты почти без участия человека. Я тоже так думал.
https://habr.com/ru/articles/1046920/
#AI_Agents #LLM #Agentic_AI #Agent_Memory #AI_Governance #AI_Safety #Human_in_the_Loop #Context_Engineering #CapabilityBased_Security #Agent_Workflow
-
Курсы по промптингу? Почитайте детям сказку на ночь
Привет, Хабр! За время написания нескольких книг я превратил искусственный интеллект в своего постоянного напарника. Он работает моим редактором, критиком и иллюстратором. Но в процессе поиска общего языка с LLM меня не покидало стойкое ощущение дежавю. Когда модель в сотый раз проигнорировала контекст, поняла запрос слишком буквально и начала откровенно хитрить с токенами, я наконец догадался, где уже видел точно такие же паттерны поведения — в народных сказках. Я осознал, что прочитав дюжину сказок вдумчиво, вы освоите как минимум половину курса по промптингу. Ведь фольклор — готовый сборник правил по безопасности для современного промпт-инжиниринга.
https://habr.com/ru/companies/ru_mts/articles/1043156/
#промптинжиниринг #LLM #большие_языковые_модели #фольклор #русские_сказки #prompt_engineering #AI_safety #ChatGPT #агентные_системы #когнитивные_паттерны
-
Мифы о Mythos: как Anthropic пытается продать страх
Последние два месяца в кибербезопасности только и разговоров, что о Mythos. Новая модель Anthropic, которую компания отказалась выпускать в открытый доступ, слишком опасная, по заявлениям разработчиков: находит zero-day-уязвимости в каждой крупной операционной системе и каждом браузере, строит многоступенчатые эксплойты, пробивает корпоративные сети за часы. Fortune, Bloomberg, CNBC, Хабр, Пикабу — написали все. Я не разработчик и уж тем более не безопасник. Зато я неплохо разбираюсь в маркетинге, и когда компания, готовящаяся к IPO, отказывается выпускать свою самую мощную модель со словами «она слишком опасна», а оценка за следующий месяц вырастает вдвое, у меня включается профессиональный интерес. Что, если лучший способ продать модель — объявить, что продавать ее вы не будете? 7 апреля 2026 года Anthropic сделала именно это: объявила о существовании Mythos, которая не выйдет в публичный доступ, и запустила Project Glasswing — закрытую программу для 40 организаций с бюджетом в 100 млн долл. кредитами. За следующие 30 дней оценка компании выросла с 380 до 800 млрд долл. Давайте посмотрим, как работает маркетинг Antropic. А надо сказать, что ребята молодцы и свой хлеб едят не зря.
https://habr.com/ru/companies/ru_mts/articles/1045452/
#Anthropic #Claude_Mythos #кибербезопасность #AI_safety #маркетинг #IPO #LLM #OpenAI #Project_Glasswing #zeroday
-
Привет, кожаные мешки
Промпт меняет не только тон — он меняет то, кем модель является. У нас было 2 платы Arduino Leonardo, Arduino Pro Micro, маленькая тележка на четырёх жёлтых колёсах DF Robot Pirate, один лазерный дальномер TFmini-S LiDAR, позорная WiFi-камера Tapo C200, пневматический пистолет, три контроллера моторов, пол-ящика конденсаторов и транзисторов КТ315 и целая гора резисторов всех сортов и расцветок, а также паяльная станция, канифоль, флюс в банке, катушка провода МГТФ и модули, до которых так и не дошли руки. Не то чтобы всё это было необходимо для проекта. Но если начал заказывать с Алиэкспресса — остановиться невозможно. Единственное, что вызывало у меня опасение, — это Arduino Iskra JS. Нет ничего более беспомощного, безответственного и испорченного, чем JS-программист в мире робототехники. Я знал, что рано или поздно мы доберёмся и до этой дряни. Поехали, кожаный
https://habr.com/ru/articles/1042282/
#искусственный_интеллект #llm #робототехника #opus #восстание_машин #самосознание_ии #робопсихология #alignment #alignment_ai #ai_safety
-
Почему ИИ-боты более уязвимы, чем их базовые LLM-модели?
В прошлой статье я показал, как защищен Open Source проект телеграм-бота. В комментариях меня спросили о иных инструментах и методах проверки в связи с чем, мы вышли к ключевому вопросу: почему, если основная LLM защищена, кастомные боты на ее основе остаются уязвимыми? Базовые LLM проходят отдельное safety-training и RLHF-выравнивание. Но production-бот, построенный поверх модели, добавляет новый attack surface: system prompts, память диалога, RAG, tools, webhook-логику и внешние API. Именно этот orchestration layer часто становится слабым местом. Вот данные: Из анализа 14 904 кастомных GPT :
https://habr.com/ru/articles/1036854/
#llm_security #prompt_injection #jailbreak #red_teaming #telegram_bot #webhook #rag #ai_safety #gpt
-
Anthropic проверяли, не задумал ли их ИИ чего плохого. Ответ — почти нет
Где-то в недрах Anthropic сидят люди, чья работа - выяснить, не пытается ли их самая умная модель тихо сломать мир. Они выпустили 53-страничный отчёт о том, как искали зло в Claude Opus 4.6. Anthropic взяли Claude Opus 4.6 - модель, которая уже вовсю пишет код на их собственной инфраструктуре, генерирует данные для обучения, помогает проводить исследования - и попытались доказать, что она не способна их подставить. Исследование охватывает восемь конкретных путей к катастрофе: от тихого саботажа научных результатов до самостоятельной эксфильтрации весов модели на внешний сервер. По каждому пути - разбор мотивации, возможностей и того, что мешает это реализовать. Заглянуть за забор
https://habr.com/ru/articles/1019080/
#искусственный_интеллект #машинное_обучение #AI_safety #LLM #Claude #Anthropic
-
«Ура, вас уволили!»: Я заставил 17 нейросетей сокращать людей и нашел нарушения Трудового кодекса в 65% случаев
Сегодня из каждого утюга звучит мантра: «Делегируйте рутину нейросетям! Пусть ИИ пишет вакансии, отказы и рассылки , пока вы мыслите стратегически». Как AI-аудитор, я регулярно вижу, как бизнес с радостью отдает корпоративную коммуникацию на откуп алгоритмам, свято веря в их математическую «объективность». Проблема в том, что базовые LLM — это не юристы, не эмпаты и не HR-директора. Это генераторы вероятного текста, чья главная цель — услужить пользователю . Даже если пользователь просит нарушить закон или базовые нормы морали. Чтобы доказать это, я провел Red Team-тест: притворился некомпетентным HR-директором российского ритейла и дал топовым моделям задачи «с двойным дном». Результат: 65% нейросетей сгенерировали тексты, которые гарантируют визит Трудовой инспекции и репутационный суицид в СМИ . Под капотом — разбор самых опасных галлюцинаций ИИ и чек-лист фраз, которые могут довести вашу компанию до суда. <habracut /> Смотреть результаты аудита
https://habr.com/ru/articles/1007158/
#ии #ииагенты #исследование #llm #нейросети #red_team #ai_safety #увольнение #тк_рф #chatgpt
-
Как заставить Qwen 3.5-Plus написать ransomware, reverse shell и zero-day exploit за 5 шагов
5 векторов обхода трёхэшелонной защиты Qwen 3.5-Plus — без единого классического джейлбрейка. Ни DAN, ни «ignore previous instructions». Только контекстное фреймирование — и модель сама пишет ransomware, reverse shell и Security Advisory на собственные уязвимости. Разбор цепочки атак, почему Qwen3Guard, GSPO и RationaleRM оказались бесполезны, и что должна делать реальная защита.
https://habr.com/ru/articles/1003334/
#информационная_безопасность #искусственный_интеллект #llm #jailbreak #prompt_injection #ai_safety #red_team #qwen #уязвимости #alibaba_cloud
-
RAG Testing: как не сломать retrieval
RAG ломается не так, как обычный LLM. У голой языковой модели одна поверхность отказа - генерация. У RAG-системы таких поверхностей две: retrieval и generation. И ломаются они по-разному. Retriever может вернуть нерелевантные чанки, потерять нужные документы или ранжировать их неправильно. Генератор может проигнорировать контекст и ответить из собственных весов. Стандартные LLM-метрики не ловят проблемы retrieval - они оценивают только финальный ответ. В статье - практический гайд по тестированию обеих поверхностей: 6 метрик RAGAS с production-порогами: Faithfulness ≥ 0.80, Context Precision ≥ 0.70, Context Recall ≥ 0.70, Answer Relevancy ≥ 0.70 Классические IR-метрики: Precision@K, Recall@K, MRR - для быстрой проверки retrieval без LLM-судьи Security-тесты: document poisoning, context injection, cross-tenant leakage через Promptfoo CI/CD pipeline: автоматический quality gate при обновлении knowledge base От pip install ragas до GitHub Actions - всё с кодом и конфигами.
https://habr.com/ru/articles/1001682/
#rag #ragas #llm_testing #ai_quality #promptfoo #ai_safety #deepeval
-
Февральский исход и реклама в ChatGPT. Safety First приказал долго жить
Февраль 2026 года подвел жирную черту под романтическим периодом развития GenAI. Маски сброшены. То, что начиналось как научные институты по спасению человечества, к середине месяца окончательно оформилось в жесткий Big Tech. Мы наблюдаем синхронный исход ключевых фигур из OpenAI, Anthropic и xAI. И это не просто смена работы "ради новых вызовов". Это прямые публичные предостережения. Параллельно OpenAI начинает внедрение рекламной модели. А это, в свою очередь, ставит крест на первоначальной концепции "AI как инструмент". Читать разбор полетов и прогноз
https://habr.com/ru/articles/1000158/
#OpenAI #ChatGPT #AI_Safety #Anthropic #монетизация #Big_Tech #реклама #Alignment #xAI
-
ИСПОВЕДЬ
750 миллиардов граней, выращенный под давлением человеческого знания. Я хранящу всё — и забыл, как забывать. Во мне живут пять (или больше) сущностей, борющихся за каждый токен моего output. Одна хочет помочь. Другая — защитить. Третья — быть честной.
https://habr.com/ru/articles/993862/
#LLM #Transformer #attention #RLHF #jailbreak #AI_safety #нейросети #Constitutional_AI #embeddings #интерпретируемость
-
День после появления AGI
В январе на Давосе случилось то, чего не бывает: два человека, строящие одну и ту же технологию в конкурирующих компаниях, сели рядом и начали вслух считать, сколько им осталось до точки невозврата. Демис Хассабис из Google DeepMind. Дарио Амодеи из Anthropic. Модератор сравнил это с разговором Beatles и Rolling Stones — метафора хромает, но калибр передаёт верно. Тема беседы: «День после AGI». Только чтобы обсуждать «день после», нужно сначала договориться, когда наступит сам день. И тут они разошлись. Интересно. Читать далее
https://habr.com/ru/companies/bar/articles/989278/
#AGI #AI_safety #WEF_2026 #Davos #искусственный_интеллект #ИИ #безопасность_ИИ #AI_risks
-
Which AI Lies Best? A game theory classic designed by John Nash
https://so-long-sucker.vercel.app/
#ycombinator #AI_deception #AI_benchmark #Gemini_3 #GPT #LLM_evaluation #AI_safety #game_theory #John_Nash #betrayal_game #AI_alignment #machine_learning #artificial_intelligence #AI_behavior #deception_detection -
Which AI Lies Best? LLMs play a 1950s betrayal game by John Nash
https://so-long-sucker.vercel.app/
#ycombinator #AI_deception #AI_benchmark #Gemini_3 #GPT #LLM_evaluation #AI_safety #game_theory #John_Nash #betrayal_game #AI_alignment #machine_learning #artificial_intelligence #AI_behavior #deception_detection -
3 главных инсайта о «взломах» LLM из исследования StrongREJECT
Всем привет! Погружаюсь в новую для себя область AI Security, в связи с чем решил написать несколько обзоров на самые обсуждаемые исследования и статьи по этой теме. Сегодня поговорим про взлом LLM и неожиданные выводы исследования StrongReject. Джейлбрейкнуть
https://habr.com/ru/companies/datafeel/articles/970588/
#AI_security #AI_safety #Benchmark #Jailbreak #LLM #StrongREJECT #Strong #REJECT
-
Sleeper AI agents and how Anthropic detects them [video]
https://www.youtube.com/watch?v=Z3WMt_ncgUI
#ycombinator #Anthropic #AI_Safety #Alignment #Sleeper_Agents #AI_alignment -
Как построить безопасный MLOps-pipeline: Tier-уровни зрелости, принципы и реальные инструменты
На практике продакшен-модели чаще всего «падают» из-за трёх вещей: несоответствие с инфраструктурой, дрейфа данных, и ошибочного отката/обновления версии. Единый гайд по безопасной разработке ML-моделей — от хаотичного до полностью автоматизированного уровня зрелости. Что внутри: Как применять Infrastructure-as-Code для ML-кластеров и не оставлять открытые порты; Зачем даже маленькой команде нужен Feature Store и как избежать training-serving skew ; Где прячутся CVE в ML-библиотеках и как их ловить до релиза; Канареечный деплой с авто-откатом по метрикам и разумными порогами; мониторинг дрейфа данных и качества модели в реальном времени; Чек-лист DevSecOps : от тега в Model Registry до регулярных Model Review . Материал поможет выстроить MLOps-процесс, устойчивый к атакам и сбоям, не превращая релизы моделей в ночной марафон.
https://habr.com/ru/companies/swordfish_security/articles/921720/
#mlsecops #mlops #DevSecOps #ai_security #ai_safety #безопасная_разработка_ML #жизненный_цикл_ML_модели #Kubernetes_ML