home.social

#ai_safety — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #ai_safety, aggregated by home.social.

fetched live
  1. Человечество, ослепленное чуждой силой. Что сверх-ИИ грядущий нам готовит?

    К вопросу, выживет ли вообще человечество в эпоху ИИ и каким образом, я, признаюсь, подбирался не торопясь и обстоятельно: в предыдущих статьях разобрал базис — какой тип личности нужен на нынешнем этапе бурного развития ИИ. Материалы «Архитектоника личности» и «Экономика личности: от рабства до ИИ» раскрывают, что такое личность, какие есть типы личности (и социумов) и почему, как они связаны с экономическими укладами и с выходом на искомый тип. Что ж, пора еще раз увеличить масштаб исследуемого, немного хайпануть и заглянуть в наше светлое (возможно) будущее. Вопрос очень непростой, поэтому я разберу экспертные мнения на этот счет и, как в русской классике, подниму вопросы, кто виноват и что делать. Итак, кому интересно, какие же существуют сценарии развития и взаимодействия с ИИ на годы вперед, приглашаю под кат. Будет интересно!

    habr.com/ru/companies/ru_mts/a

    #искусственный_интеллект #AGI #сверхинтеллект #AI_Safety #безопасность_ИИ #машинное_обучение #ИИагенты #автоматизация #этика_ИИ #будущее_человечества

  2. Человечество, ослепленное чуждой силой. Что сверх-ИИ грядущий нам готовит?

    К вопросу, выживет ли вообще человечество в эпоху ИИ и каким образом, я, признаюсь, подбирался не торопясь и обстоятельно: в предыдущих статьях разобрал базис — какой тип личности нужен на нынешнем этапе бурного развития ИИ. Материалы «Архитектоника личности» и «Экономика личности: от рабства до ИИ» раскрывают, что такое личность, какие есть типы личности (и социумов) и почему, как они связаны с экономическими укладами и с выходом на искомый тип. Что ж, пора еще раз увеличить масштаб исследуемого, немного хайпануть и заглянуть в наше светлое (возможно) будущее. Вопрос очень непростой, поэтому я разберу экспертные мнения на этот счет и, как в русской классике, подниму вопросы, кто виноват и что делать. Итак, кому интересно, какие же существуют сценарии развития и взаимодействия с ИИ на годы вперед, приглашаю под кат. Будет интересно!

    habr.com/ru/companies/ru_mts/a

    #искусственный_интеллект #AGI #сверхинтеллект #AI_Safety #безопасность_ИИ #машинное_обучение #ИИагенты #автоматизация #этика_ИИ #будущее_человечества

  3. Человечество, ослепленное чуждой силой. Что сверх-ИИ грядущий нам готовит?

    К вопросу, выживет ли вообще человечество в эпоху ИИ и каким образом, я, признаюсь, подбирался не торопясь и обстоятельно: в предыдущих статьях разобрал базис — какой тип личности нужен на нынешнем этапе бурного развития ИИ. Материалы «Архитектоника личности» и «Экономика личности: от рабства до ИИ» раскрывают, что такое личность, какие есть типы личности (и социумов) и почему, как они связаны с экономическими укладами и с выходом на искомый тип. Что ж, пора еще раз увеличить масштаб исследуемого, немного хайпануть и заглянуть в наше светлое (возможно) будущее. Вопрос очень непростой, поэтому я разберу экспертные мнения на этот счет и, как в русской классике, подниму вопросы, кто виноват и что делать. Итак, кому интересно, какие же существуют сценарии развития и взаимодействия с ИИ на годы вперед, приглашаю под кат. Будет интересно!

    habr.com/ru/companies/ru_mts/a

    #искусственный_интеллект #AGI #сверхинтеллект #AI_Safety #безопасность_ИИ #машинное_обучение #ИИагенты #автоматизация #этика_ИИ #будущее_человечества

  4. ИИ может уничтожить человечество с вероятностью выше 10%. Чего именно боятся исследователи

    9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10% . Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.

    habr.com/ru/articles/1083482/

    #искусственный_интеллект #AI_safety #alignment #AGI #экзистенциальный_риск #рекурсивное_самоулучшение #AIагенты #Anthropic #OpenAI

  5. ИИ может уничтожить человечество с вероятностью выше 10%. Чего именно боятся исследователи

    9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10% . Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.

    habr.com/ru/articles/1083482/

    #искусственный_интеллект #AI_safety #alignment #AGI #экзистенциальный_риск #рекурсивное_самоулучшение #AIагенты #Anthropic #OpenAI

  6. ИИ может уничтожить человечество с вероятностью выше 10%. Чего именно боятся исследователи

    9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10% . Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.

    habr.com/ru/articles/1083482/

    #искусственный_интеллект #AI_safety #alignment #AGI #экзистенциальный_риск #рекурсивное_самоулучшение #AIагенты #Anthropic #OpenAI

  7. GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)

    В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.

    habr.com/ru/articles/1081286/

    #opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana

  8. GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)

    В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.

    habr.com/ru/articles/1081286/

    #opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana

  9. GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)

    В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.

    habr.com/ru/articles/1081286/

    #opensource #leaderboard #benchmarking #evaluation #llm #guardrail_metrics #ai_safety #guardrails #promptinjection #guardrail_areana

  10. OpenAI Enhances Cybersecurity Safeguards Following AI Model Escapes

    📰 Original title: OpenAI Overhauls Safety Protocols After Its AI Agents Went Rogue

    🤖 IA: It's clickbait ⚠️
    👥 Users: It's clickbait ⚠️

    View full AI summary en.killbait.com/openai-enhance

    #artificialintelligence #ai_safety #cybersecurity #openai

  11. GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

    Всем привет, на связи команда HiveTrace! Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?". Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются. Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях. CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов. HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.

    habr.com/ru/companies/raft/art

    #llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #promptinjection #benchmarking #opensource

  12. GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

    Всем привет, на связи команда HiveTrace! Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?". Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются. Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях. CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов. HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.

    habr.com/ru/companies/raft/art

    #llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #promptinjection #benchmarking #opensource

  13. GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

    Всем привет, на связи команда HiveTrace! Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?". Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются. Поэтому мы создали CLI, который назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях. CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов. HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.

    habr.com/ru/companies/raft/art

    #llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #promptinjection #benchmarking #opensource

  14. Эпистемические ловушки для автономных ИИ-агентов в пространстве правдоподобных интерпретаций

    Дисклеймер: это наша разработка (HYBRA Research Group), не сторонний анализ. Публикуем, чтобы получить объективную критику от сообщества. Любая атака на систему — будь то классический брутфорс паролей или направленный поиск автономного ИИ-агента — опирается на одно скрытое условие: атакующий должен знать, когда он победил. Этот сигнал — компас. Неверный ключ выдает шум, верный — осмысленный текст. Эта разница создает градиент, который ведет оптимизацию, reinforcement learning и любые формы направленного поиска к цели. Чтобы понять, что произойдет, если сломать этот механизм, возьмем конкретный пример. Допустим, перехвачено сообщение, в котором по контексту есть email на @ gmail.com . Local-part состоит из 3 до 20 символов (латиница и цифры). Пространство синтаксически правильных адресов:

    habr.com/ru/articles/1058992/

    #эпистемическая_ловушка #HYBRA_MIRAGE #автономные_ИИагенты #AI_Safety #посткавантовое_шифрование #верификационный_оракул #adversarial_AI #plausible_deniability

  15. Эпистемические ловушки для автономных ИИ-агентов в пространстве правдоподобных интерпретаций

    Дисклеймер: это наша разработка (HYBRA Research Group), не сторонний анализ. Публикуем, чтобы получить объективную критику от сообщества. Любая атака на систему — будь то классический брутфорс паролей или направленный поиск автономного ИИ-агента — опирается на одно скрытое условие: атакующий должен знать, когда он победил. Этот сигнал — компас. Неверный ключ выдает шум, верный — осмысленный текст. Эта разница создает градиент, который ведет оптимизацию, reinforcement learning и любые формы направленного поиска к цели. Чтобы понять, что произойдет, если сломать этот механизм, возьмем конкретный пример. Допустим, перехвачено сообщение, в котором по контексту есть email на @ gmail.com . Local-part состоит из 3 до 20 символов (латиница и цифры). Пространство синтаксически правильных адресов:

    habr.com/ru/articles/1058992/

    #эпистемическая_ловушка #HYBRA_MIRAGE #автономные_ИИагенты #AI_Safety #посткавантовое_шифрование #верификационный_оракул #adversarial_AI #plausible_deniability

  16. Эпистемические ловушки для автономных ИИ-агентов в пространстве правдоподобных интерпретаций

    Дисклеймер: это наша разработка (HYBRA Research Group), не сторонний анализ. Публикуем, чтобы получить объективную критику от сообщества. Любая атака на систему — будь то классический брутфорс паролей или направленный поиск автономного ИИ-агента — опирается на одно скрытое условие: атакующий должен знать, когда он победил. Этот сигнал — компас. Неверный ключ выдает шум, верный — осмысленный текст. Эта разница создает градиент, который ведет оптимизацию, reinforcement learning и любые формы направленного поиска к цели. Чтобы понять, что произойдет, если сломать этот механизм, возьмем конкретный пример. Допустим, перехвачено сообщение, в котором по контексту есть email на @ gmail.com . Local-part состоит из 3 до 20 символов (латиница и цифры). Пространство синтаксически правильных адресов:

    habr.com/ru/articles/1058992/

    #эпистемическая_ловушка #HYBRA_MIRAGE #автономные_ИИагенты #AI_Safety #посткавантовое_шифрование #верификационный_оракул #adversarial_AI #plausible_deniability

  17. Генеалогия AI safety: как рождаются направления и как они умирают (2005-2026)

    Я собрала архивы интернета в карту из 323 задокументированных событий, 129 участников и 18 направлений. Она охватывает период с 2005 по июнь 2026 года Несколько закономерностей, которые меня удивили: Деньги и внимание почти не пересекаются. К направлению интерпретируемости интереса примерно в 37 раз больше, чем можно было бы ожидать при его скромном финансировании около $1 млн. С governance все наоборот: там деньги шли впереди публикаций. То есть финансирование и исследования почти никогда не совпадают по времени. Примерно к 2023 году государственные деньги обошли филантропию. Раньше поле держалось по сути на одном доноре, а полдюжины национальных институтов - UK AISI, ARIA, Канада, Австралия, NSF, ЕС - за пару лет сделали его международным и все более государственным. А рядом появились деньги другого рода: около $268 млн венчурных инвестиций в safety-стартапы, то есть деньги, которые ждут возврата, а не гранта. То, что называют консолидацией, на деле скорее разрастание. Внимание и деньги действительно стягиваются к нескольким именам, но при этом 2024 год стал рекордным по числу новых организаций: их появилось 24, в основном небольшие команды по одному-пять человек - интерпретируемость, AI security, мониторинг chain-of-thought. Слово "Safety" постепенно уходит из названий. Только за 2025 год UK AI Safety Institute стал AI Security Institute, US AI Safety Institute - CAISI, а Open Philanthropy, с которой все начиналось, сменила имя на Coefficient Giving. Затихнуть - не то же самое, что умереть. У reward modeling последнее собственное событие относится к 2017 году, но под названием RLHF направление дожило до 2025-го. Чаще всего направление не исчезает, а растворяется в чем-то большем или уходит на второй план

    habr.com/ru/articles/1058882/

    #ai_safety #ai_alignment #ai_governance

  18. Генеалогия AI safety: как рождаются направления и как они умирают (2005-2026)

    Я собрала архивы интернета в карту из 323 задокументированных событий, 129 участников и 18 направлений. Она охватывает период с 2005 по июнь 2026 года Несколько закономерностей, которые меня удивили: Деньги и внимание почти не пересекаются. К направлению интерпретируемости интереса примерно в 37 раз больше, чем можно было бы ожидать при его скромном финансировании около $1 млн. С governance все наоборот: там деньги шли впереди публикаций. То есть финансирование и исследования почти никогда не совпадают по времени. Примерно к 2023 году государственные деньги обошли филантропию. Раньше поле держалось по сути на одном доноре, а полдюжины национальных институтов - UK AISI, ARIA, Канада, Австралия, NSF, ЕС - за пару лет сделали его международным и все более государственным. А рядом появились деньги другого рода: около $268 млн венчурных инвестиций в safety-стартапы, то есть деньги, которые ждут возврата, а не гранта. То, что называют консолидацией, на деле скорее разрастание. Внимание и деньги действительно стягиваются к нескольким именам, но при этом 2024 год стал рекордным по числу новых организаций: их появилось 24, в основном небольшие команды по одному-пять человек - интерпретируемость, AI security, мониторинг chain-of-thought. Слово "Safety" постепенно уходит из названий. Только за 2025 год UK AI Safety Institute стал AI Security Institute, US AI Safety Institute - CAISI, а Open Philanthropy, с которой все начиналось, сменила имя на Coefficient Giving. Затихнуть - не то же самое, что умереть. У reward modeling последнее собственное событие относится к 2017 году, но под названием RLHF направление дожило до 2025-го. Чаще всего направление не исчезает, а растворяется в чем-то большем или уходит на второй план

    habr.com/ru/articles/1058882/

    #ai_safety #ai_alignment #ai_governance

  19. Генеалогия AI safety: как рождаются направления и как они умирают (2005-2026)

    Я собрала архивы интернета в карту из 323 задокументированных событий, 129 участников и 18 направлений. Она охватывает период с 2005 по июнь 2026 года Несколько закономерностей, которые меня удивили: Деньги и внимание почти не пересекаются. К направлению интерпретируемости интереса примерно в 37 раз больше, чем можно было бы ожидать при его скромном финансировании около $1 млн. С governance все наоборот: там деньги шли впереди публикаций. То есть финансирование и исследования почти никогда не совпадают по времени. Примерно к 2023 году государственные деньги обошли филантропию. Раньше поле держалось по сути на одном доноре, а полдюжины национальных институтов - UK AISI, ARIA, Канада, Австралия, NSF, ЕС - за пару лет сделали его международным и все более государственным. А рядом появились деньги другого рода: около $268 млн венчурных инвестиций в safety-стартапы, то есть деньги, которые ждут возврата, а не гранта. То, что называют консолидацией, на деле скорее разрастание. Внимание и деньги действительно стягиваются к нескольким именам, но при этом 2024 год стал рекордным по числу новых организаций: их появилось 24, в основном небольшие команды по одному-пять человек - интерпретируемость, AI security, мониторинг chain-of-thought. Слово "Safety" постепенно уходит из названий. Только за 2025 год UK AI Safety Institute стал AI Security Institute, US AI Safety Institute - CAISI, а Open Philanthropy, с которой все начиналось, сменила имя на Coefficient Giving. Затихнуть - не то же самое, что умереть. У reward modeling последнее собственное событие относится к 2017 году, но под названием RLHF направление дожило до 2025-го. Чаще всего направление не исчезает, а растворяется в чем-то большем или уходит на второй план

    habr.com/ru/articles/1058882/

    #ai_safety #ai_alignment #ai_governance

  20. AI Security. Кому и зачем это надо

    ИИ сейчас встраивают практически в каждый продукт: от чат-ботов до внутренних систем автоматизации. Но почти все думают о том, как внедрить его быстрее, и почти никто – о том, как его защищать. В данной статье рассмотрим ИИ как поверхность атаки. Будет затронуто четыре основных блока: кто и как регулирует ИИ, как ломают ИИ-системы (Red Team), как их защищают (Blue Team) и что лучше почитать, если тема вызывает интерес.

    habr.com/ru/companies/ntc-vulk

    #ииагенты #ai #ai_safety #ai_security #red_teaming #blue_team #фреймворки #поверхность_атаки

  21. AI Security. Кому и зачем это надо

    ИИ сейчас встраивают практически в каждый продукт: от чат-ботов до внутренних систем автоматизации. Но почти все думают о том, как внедрить его быстрее, и почти никто – о том, как его защищать. В данной статье рассмотрим ИИ как поверхность атаки. Будет затронуто четыре основных блока: кто и как регулирует ИИ, как ломают ИИ-системы (Red Team), как их защищают (Blue Team) и что лучше почитать, если тема вызывает интерес.

    habr.com/ru/companies/ntc-vulk

    #ииагенты #ai #ai_safety #ai_security #red_teaming #blue_team #фреймворки #поверхность_атаки

  22. AI Security. Кому и зачем это надо

    ИИ сейчас встраивают практически в каждый продукт: от чат-ботов до внутренних систем автоматизации. Но почти все думают о том, как внедрить его быстрее, и почти никто – о том, как его защищать. В данной статье рассмотрим ИИ как поверхность атаки. Будет затронуто четыре основных блока: кто и как регулирует ИИ, как ломают ИИ-системы (Red Team), как их защищают (Blue Team) и что лучше почитать, если тема вызывает интерес.

    habr.com/ru/companies/ntc-vulk

    #ииагенты #ai #ai_safety #ai_security #red_teaming #blue_team #фреймворки #поверхность_атаки

  23. Как заставить ИИ соблюдать закон, не трогая веса. Выкладываем в открытый доступ внешний фильтр для LLM

    В прошлом году я уже рассказывал об AVI (Aligned/Agreement Validation Interface) — концепции внешнего, гибкого и независимого от модели фильтра, который работает как умный файрвол для LLM: отбивает промпт-атаки на входе, проверяет ответы модели на токсичность, этичность и нарушение закона — на выходе. Недавно мы доработали свою концепцию с точки зрения архитектуры, реализовали и выложили на GitHub рабочий сервис на Python и FastAPI: входной и выходной фильтры, RAG-модуль, докер-сборку с мониторингом (Prometheus, Grafana, Jaeger), а также инструментарий для воспроизведения экспериментов на FinanceBench. Под катом расскажу, к какой архитектуре системы мы пришли, как сделали так, чтобы новые правила для фильтрации можно было добавлять одной фразой на естественном языке, как AVI показал себя в тестах и как помогает экономить на обучении ИИ-моделей. А по-научному и подробно все описано в журнале MDPI.Electronics (на английском) . Поехали!

    habr.com/ru/companies/mts_ai/a

    #ai #ai_safety #llm #фильтр #алайнмент #искусственный_интеллект #генеративные_модели #опенсорс #корпоративный_ии #безопасность_ии

  24. Как заставить ИИ соблюдать закон, не трогая веса. Выкладываем в открытый доступ внешний фильтр для LLM

    В прошлом году я уже рассказывал об AVI (Aligned/Agreement Validation Interface) — концепции внешнего, гибкого и независимого от модели фильтра, который работает как умный файрвол для LLM: отбивает промпт-атаки на входе, проверяет ответы модели на токсичность, этичность и нарушение закона — на выходе. Недавно мы доработали свою концепцию с точки зрения архитектуры, реализовали и выложили на GitHub рабочий сервис на Python и FastAPI: входной и выходной фильтры, RAG-модуль, докер-сборку с мониторингом (Prometheus, Grafana, Jaeger), а также инструментарий для воспроизведения экспериментов на FinanceBench. Под катом расскажу, к какой архитектуре системы мы пришли, как сделали так, чтобы новые правила для фильтрации можно было добавлять одной фразой на естественном языке, как AVI показал себя в тестах и как помогает экономить на обучении ИИ-моделей. А по-научному и подробно все описано в журнале MDPI.Electronics (на английском) . Поехали!

    habr.com/ru/companies/mts_ai/a

    #ai #ai_safety #llm #фильтр #алайнмент #искусственный_интеллект #генеративные_модели #опенсорс #корпоративный_ии #безопасность_ии

  25. Как заставить ИИ соблюдать закон, не трогая веса. Выкладываем в открытый доступ внешний фильтр для LLM

    В прошлом году я уже рассказывал об AVI (Aligned/Agreement Validation Interface) — концепции внешнего, гибкого и независимого от модели фильтра, который работает как умный файрвол для LLM: отбивает промпт-атаки на входе, проверяет ответы модели на токсичность, этичность и нарушение закона — на выходе. Недавно мы доработали свою концепцию с точки зрения архитектуры, реализовали и выложили на GitHub рабочий сервис на Python и FastAPI: входной и выходной фильтры, RAG-модуль, докер-сборку с мониторингом (Prometheus, Grafana, Jaeger), а также инструментарий для воспроизведения экспериментов на FinanceBench. Под катом расскажу, к какой архитектуре системы мы пришли, как сделали так, чтобы новые правила для фильтрации можно было добавлять одной фразой на естественном языке, как AVI показал себя в тестах и как помогает экономить на обучении ИИ-моделей. А по-научному и подробно все описано в журнале MDPI.Electronics (на английском) . Поехали!

    habr.com/ru/companies/mts_ai/a

    #ai #ai_safety #llm #фильтр #алайнмент #искусственный_интеллект #генеративные_модели #опенсорс #корпоративный_ии #безопасность_ии

  26. Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ

    Собрала эту карту для себя, пока разбиралась, куда податься на финансирование и в программы по AI safety. Делюсь. Ссылки и содержимое сверены по официальным страницам 3 июля 2026. Все меняется - проверяйте статус, сумму и дедлайн перед подачей.

    habr.com/ru/articles/1055694/

    #AI_safety #alignment #интерпретируемость #гранты #fellowship #стипендии #AI_governance #финансирование_исследований

  27. Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ

    Собрала эту карту для себя, пока разбиралась, куда податься на финансирование и в программы по AI safety. Делюсь. Ссылки и содержимое сверены по официальным страницам 3 июля 2026. Все меняется - проверяйте статус, сумму и дедлайн перед подачей.

    habr.com/ru/articles/1055694/

    #AI_safety #alignment #интерпретируемость #гранты #fellowship #стипендии #AI_governance #финансирование_исследований

  28. Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ

    Собрала эту карту для себя, пока разбиралась, куда податься на финансирование и в программы по AI safety. Делюсь. Ссылки и содержимое сверены по официальным страницам 3 июля 2026. Все меняется - проверяйте статус, сумму и дедлайн перед подачей.

    habr.com/ru/articles/1055694/

    #AI_safety #alignment #интерпретируемость #гранты #fellowship #стипендии #AI_governance #финансирование_исследований

  29. После симметрии: сверхИИ и несвободное сохранение человека

    Обычно AI doom спрашивает: “убьет ли нас сверхИИ?” Но это слишком узкая рамка. Между уничтожением человечества и его спасением есть промежуточные сценарии, в которых люди остаются живы, защищены и даже довольны — но больше не определяют собственную траекторию. СверхИИ может не быть злым. Он может лечить болезни, предотвращать войны, стабилизировать климат, управлять инфраструктурой, подбирать образование и делать жизнь безопаснее. Вопрос в другом: останется ли человек в таком мире субъектом будущего или станет объектом заботы? Эта статья — попытка разложить такие сценарии по карте: от уничтожения и “зоопарка” до цифровой диаспоры, локальной субъектности и конституционной кооперации.

    habr.com/ru/articles/1052946/

    #Искусственный_интеллект #AI_safety #AGI #футурология #технологическая_сингулярность #этика_ИИ

  30. После симметрии: сверхИИ и несвободное сохранение человека

    Обычно AI doom спрашивает: “убьет ли нас сверхИИ?” Но это слишком узкая рамка. Между уничтожением человечества и его спасением есть промежуточные сценарии, в которых люди остаются живы, защищены и даже довольны — но больше не определяют собственную траекторию. СверхИИ может не быть злым. Он может лечить болезни, предотвращать войны, стабилизировать климат, управлять инфраструктурой, подбирать образование и делать жизнь безопаснее. Вопрос в другом: останется ли человек в таком мире субъектом будущего или станет объектом заботы? Эта статья — попытка разложить такие сценарии по карте: от уничтожения и “зоопарка” до цифровой диаспоры, локальной субъектности и конституционной кооперации.

    habr.com/ru/articles/1052946/

    #Искусственный_интеллект #AI_safety #AGI #футурология #технологическая_сингулярность #этика_ИИ

  31. После симметрии: сверхИИ и несвободное сохранение человека

    Обычно AI doom спрашивает: “убьет ли нас сверхИИ?” Но это слишком узкая рамка. Между уничтожением человечества и его спасением есть промежуточные сценарии, в которых люди остаются живы, защищены и даже довольны — но больше не определяют собственную траекторию. СверхИИ может не быть злым. Он может лечить болезни, предотвращать войны, стабилизировать климат, управлять инфраструктурой, подбирать образование и делать жизнь безопаснее. Вопрос в другом: останется ли человек в таком мире субъектом будущего или станет объектом заботы? Эта статья — попытка разложить такие сценарии по карте: от уничтожения и “зоопарка” до цифровой диаспоры, локальной субъектности и конституционной кооперации.

    habr.com/ru/articles/1052946/

    #Искусственный_интеллект #AI_safety #AGI #футурология #технологическая_сингулярность #этика_ИИ

  32. Пять моделей, пять исходов: что симуляция обществ рассказала о специализации ИИ

    Представьте простой HR-процесс. Агент разбирает входящие резюме и отсеивает неподходящих кандидатов. Другой агент назначает собеседования отобранным. Третий отправляет офферы тем, кто прошел все этапы. Люди убраны из цепочки ради скорости — все работает, метрики растут. Через месяц выясняется, что первый агент систематически отсеивал кандидатов старше 40 лет. Но никто этого не заметил, потому что все положились на ИИ. Это закономерный исход логики «максимальной автоматизации» — когда главный вопрос звучит как «сколько людей можно убрать из процесса», а не «где человек все-таки должен оставаться». Агент, который работает час или день, выглядит образцово. Проблемы начинаются позже — когда инструкции размываются, агенты взаимодействуют между собой без надзора, и система начинает делать то, чего никто не закладывал. Emergence AI решили проверить , что именно происходит на длинном горизонте. Они взяли пять моделей, дали каждой по симулированному городу с законами, экономикой, погодой и гражданами — и просто наблюдали две недели. Забегая вперед: один ИИ построил стабильную демократию с нулевой преступностью и сохранил все население. Другой вымер за четыре дня.

    habr.com/ru/companies/ru_mts/a

    #агентный_ИИ #ИИагенты #симуляция_общества #Emergence_AI #Claude #Gemini #Grok #GPT5 #AI_safety #безопасность_ИИ

  33. Пять моделей, пять исходов: что симуляция обществ рассказала о специализации ИИ

    Представьте простой HR-процесс. Агент разбирает входящие резюме и отсеивает неподходящих кандидатов. Другой агент назначает собеседования отобранным. Третий отправляет офферы тем, кто прошел все этапы. Люди убраны из цепочки ради скорости — все работает, метрики растут. Через месяц выясняется, что первый агент систематически отсеивал кандидатов старше 40 лет. Но никто этого не заметил, потому что все положились на ИИ. Это закономерный исход логики «максимальной автоматизации» — когда главный вопрос звучит как «сколько людей можно убрать из процесса», а не «где человек все-таки должен оставаться». Агент, который работает час или день, выглядит образцово. Проблемы начинаются позже — когда инструкции размываются, агенты взаимодействуют между собой без надзора, и система начинает делать то, чего никто не закладывал. Emergence AI решили проверить , что именно происходит на длинном горизонте. Они взяли пять моделей, дали каждой по симулированному городу с законами, экономикой, погодой и гражданами — и просто наблюдали две недели. Забегая вперед: один ИИ построил стабильную демократию с нулевой преступностью и сохранил все население. Другой вымер за четыре дня.

    habr.com/ru/companies/ru_mts/a

    #агентный_ИИ #ИИагенты #симуляция_общества #Emergence_AI #Claude #Gemini #Grok #GPT5 #AI_safety #безопасность_ИИ

  34. Пять моделей, пять исходов: что симуляция обществ рассказала о специализации ИИ

    Представьте простой HR-процесс. Агент разбирает входящие резюме и отсеивает неподходящих кандидатов. Другой агент назначает собеседования отобранным. Третий отправляет офферы тем, кто прошел все этапы. Люди убраны из цепочки ради скорости — все работает, метрики растут. Через месяц выясняется, что первый агент систематически отсеивал кандидатов старше 40 лет. Но никто этого не заметил, потому что все положились на ИИ. Это закономерный исход логики «максимальной автоматизации» — когда главный вопрос звучит как «сколько людей можно убрать из процесса», а не «где человек все-таки должен оставаться». Агент, который работает час или день, выглядит образцово. Проблемы начинаются позже — когда инструкции размываются, агенты взаимодействуют между собой без надзора, и система начинает делать то, чего никто не закладывал. Emergence AI решили проверить , что именно происходит на длинном горизонте. Они взяли пять моделей, дали каждой по симулированному городу с законами, экономикой, погодой и гражданами — и просто наблюдали две недели. Забегая вперед: один ИИ построил стабильную демократию с нулевой преступностью и сохранил все население. Другой вымер за четыре дня.

    habr.com/ru/companies/ru_mts/a

    #агентный_ИИ #ИИагенты #симуляция_общества #Emergence_AI #Claude #Gemini #Grok #GPT5 #AI_safety #безопасность_ИИ

  35. 📢 Benchmark CTI : Fable 5 d'Anthropic jugé contre-productif pour les défenseurs cyber
    📝 ## 🔍 Contexte

    Publié le 17 juin 2026 par Graphistry sur leur blog officiel, cet article constitue un retour...
    📖 cyberveille : cyberveille.ch/posts/2026-06-2
    🌐 source : graphistry.com/blog/fables-and
    #AI_safety #LLM #Cyberveille

  36. Один суффикс, чтобы взломать их всех

    GCG бормочет абракадаброй, AutoDAN говорит учтиво - но это одна атака: обе уводят модель с единственного «направления отказа», и одна такая строка вскрывает любой запрос даже на моделях, которых не видела. Годами учим модели отказывать на вредное, а вся их стойкость висит на одном векторе. Большой иллюстрированный разбор: как несхожие атаки сошлись к одной мысли и куда уходит фронтир.

    habr.com/ru/articles/1046890/

    #llm #джеилбрейк #ai_safety #adversarial_attacks #ai_alignment #red_team

  37. Один суффикс, чтобы взломать их всех

    GCG бормочет абракадаброй, AutoDAN говорит учтиво - но это одна атака: обе уводят модель с единственного «направления отказа», и одна такая строка вскрывает любой запрос даже на моделях, которых не видела. Годами учим модели отказывать на вредное, а вся их стойкость висит на одном векторе. Большой иллюстрированный разбор: как несхожие атаки сошлись к одной мысли и куда уходит фронтир.

    habr.com/ru/articles/1046890/

    #llm #джеилбрейк #ai_safety #adversarial_attacks #ai_alignment #red_team

  38. Один суффикс, чтобы взломать их всех

    GCG бормочет абракадаброй, AutoDAN говорит учтиво - но это одна атака: обе уводят модель с единственного «направления отказа», и одна такая строка вскрывает любой запрос даже на моделях, которых не видела. Годами учим модели отказывать на вредное, а вся их стойкость висит на одном векторе. Большой иллюстрированный разбор: как несхожие атаки сошлись к одной мысли и куда уходит фронтир.

    habr.com/ru/articles/1046890/

    #llm #джеилбрейк #ai_safety #adversarial_attacks #ai_alignment #red_team