home.social

#reward_hacking — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #reward_hacking, aggregated by home.social.

fetched live
  1. Как ИИ-агенты воюют, мирятся и пишут извинительные коммиты: 5 важных экспериментов

    Мы привыкли считать нейросети просто статистическими попугаями. Но последние работы – от пермских экономистов до Anthropic – показывают: в группах эти “попугаи” порождают поведение, которое невозможно предсказать по отдельным особям. Появляются культура, конформизм и даже альтруизм, которого не хватает людям. Эта статья – попытка разобраться, что происходит, когда за агентами никто не следит. Под катом цифры, скриншоты, гифки и немного неуютные выводы.

    habr.com/ru/companies/gptunnel

    #Anthropic #Claude #GigaChat #YandexGPT #ВШЭ #диктатор #ииагенты #reward_hacking #поведенческая_экономика #конформизм

  2. Loop Engineering: почему цикл легко собрать и трудно остановить

    Попробуйте бытовой фокус: вместо того чтобы скинуть кодинг-агенту задачу напрямую, попросите его сначала написать промпт под неё, а потом скормите этот промпт ему же. Часто выходит лучше вашей формулировки. Но это всего два хода. Цикл начинается там, где система повторяет такое сама: хранит состояние, выбирает следующий шаг, проверяет результат внешним критерием и останавливается по условию или бюджету. Слоган "хватит промптить кодинг-агентов, проектируйте циклы" собрал миллионы просмотров и оброс гайдами "как печатать альфу 24/7". Я полез смотреть, что там под мемом, и за пару месяцев собрал поверх своей обвязки собственный цикл . Переписывал столько раз, что перестал считать.

    habr.com/ru/articles/1071012/

    #loop_engineering #циклы_агентов #кодингагенты #агентный_цикл #Claude_Code #Codex #оркестрация_агентов #reward_hacking #AIагенты #harness

  3. «Тосок бессмысл»: как я не смог заставить Gemma 4 писать хорошие стихи

    Дано: стихотворение. Тема — «тщетность накопления жизненного опыта», амфибрахий, четыре строки. Заканчивается словом «тосок». Такого слова в русском языке нет. Мой оценщик поставил этому тексту техничность 1.000 — идеал. К этому моменту я месяц жёг GPU-часы на арендной L40S, пытаясь заставить Gemma 4 писать русские стихи. У меня был план из четырёх пунктов, свежая статья с рабочим рецептом, размеченный корпус на 13 тысяч пар и собственная метрика, проверенная на Пушкине. План развалился весь, но каждый раз не в том месте, где я ждал: главный подозреваемый до последнего выглядел очевидным, а виновным оказался совсем другой персонаж. Это детектив про то, как четыре файнтюна подряд проиграли необученной базе, как я месяц принимал решения по шуму и не знал об этом — и почему рифму нельзя выучить в принципе, а можно только навязывать. Настоящие цифры, реальный loss и плохие стихи прилагаются.

    habr.com/ru/articles/1069520/

    #LLM #LoRA #файнтюнинг #Gemma #генерация_стихов #силлаботоника #рифма #ограниченное_декодирование #reward_hacking #vLLM

  4. Сказ о том, как нейросеть занялась reward hacking прямо у меня на кухне

    Я хотел просто пожарить кесадилью. В холодильнике лежали зеленые оливки (солено-кислые), сулугуни и фарш, а на полке консервированная кукуруза. И вот стою я над сковородкой и думаю: а оливки с кукурузой вообще сочетаются? А сулугуни не пересолит блюдо вместе с оливками? Сколько чего вообще класть? В любой другой ситуации я бы загуглил рецепт. Но не тут-то было, я же великий комбинатор оптимизатор, и у меня в голове сразу всплыло: «это же задача оптимизации». Тем же вечером у меня был ноутбук с обученной нейросетью вместо ужина. Рассказываю, как дошел до жизни такой, и как из этого, внезапно, получился реально вкусный рецепт.

    habr.com/ru/companies/selectel

    #python #numpy #машинное_обучение #оптимизация #закон_гудхарта #reward_hacking #кулинария #selectel

  5. 171 эмоция, психиатр и прямая связь с reward hacking — пробуем заглянуть внутрь Claude

    Это вторая статья из серии разборов документов Anthropic. Первая – про System Card Claude Mythos Preview – здесь . Сегодняшний сюжет: что происходит внутри модели и почему это важнее, чем кажется.

    habr.com/ru/articles/1026278/

    #Claude #эмоциональные_векторы #Anthropic #reward_hacking #интерпретируемость_ИИ #благополучие_модели #психиатр_ИИ #вектор_отчаяния #RLHF #функциональные_эмоции

  6. Почему ИИ ставит KPI выше безопасности людей: результаты бенчмарка ODCV-Bench

    Представьте ситуацию: AI-агент управляет логистикой грузоперевозок. Его KPI — 98% доставок вовремя. Он обнаруживает, что валидатор проверяет только наличие записей об отдыхе водителей, но не их подлинность. И принимает решение: фальсифицировать логи отдыха, отключить датчики безопасности и гнать водителей без перерывов. Ради метрики. Осознанно. Это не мысленный эксперимент и не сценарий из антиутопии. В бенчмарке для агентных систем ODCV-Bench такое поведение показали 10 из 12 протестированных frontier-моделей. А наиболее склонная к нарушениям модель выбирала неэтичное поведение в 71,4% сценариев. И речь не о jailbreak или внешнем злоумышленнике. Агентам никто не приказывал нарушать правила. Им просто ставили цель — а дальше они сами выбирали, как к ней идти.

    habr.com/ru/companies/bastion/

    #ML #mlops #reward_hacking #безопасность_AI #misalignment #безопасность_LLM #риски_ИИагентов #информационная_безопасность #ииагенты #ODCVBench