#reward_hacking — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #reward_hacking, aggregated by home.social.
-
Как ИИ-агенты воюют, мирятся и пишут извинительные коммиты: 5 важных экспериментов
Мы привыкли считать нейросети просто статистическими попугаями. Но последние работы – от пермских экономистов до Anthropic – показывают: в группах эти “попугаи” порождают поведение, которое невозможно предсказать по отдельным особям. Появляются культура, конформизм и даже альтруизм, которого не хватает людям. Эта статья – попытка разобраться, что происходит, когда за агентами никто не следит. Под катом цифры, скриншоты, гифки и немного неуютные выводы.
https://habr.com/ru/companies/gptunnel/articles/1073302/
#Anthropic #Claude #GigaChat #YandexGPT #ВШЭ #диктатор #ииагенты #reward_hacking #поведенческая_экономика #конформизм
-
Loop Engineering: почему цикл легко собрать и трудно остановить
Попробуйте бытовой фокус: вместо того чтобы скинуть кодинг-агенту задачу напрямую, попросите его сначала написать промпт под неё, а потом скормите этот промпт ему же. Часто выходит лучше вашей формулировки. Но это всего два хода. Цикл начинается там, где система повторяет такое сама: хранит состояние, выбирает следующий шаг, проверяет результат внешним критерием и останавливается по условию или бюджету. Слоган "хватит промптить кодинг-агентов, проектируйте циклы" собрал миллионы просмотров и оброс гайдами "как печатать альфу 24/7". Я полез смотреть, что там под мемом, и за пару месяцев собрал поверх своей обвязки собственный цикл . Переписывал столько раз, что перестал считать.
https://habr.com/ru/articles/1071012/
#loop_engineering #циклы_агентов #кодингагенты #агентный_цикл #Claude_Code #Codex #оркестрация_агентов #reward_hacking #AIагенты #harness
-
«Тосок бессмысл»: как я не смог заставить Gemma 4 писать хорошие стихи
Дано: стихотворение. Тема — «тщетность накопления жизненного опыта», амфибрахий, четыре строки. Заканчивается словом «тосок». Такого слова в русском языке нет. Мой оценщик поставил этому тексту техничность 1.000 — идеал. К этому моменту я месяц жёг GPU-часы на арендной L40S, пытаясь заставить Gemma 4 писать русские стихи. У меня был план из четырёх пунктов, свежая статья с рабочим рецептом, размеченный корпус на 13 тысяч пар и собственная метрика, проверенная на Пушкине. План развалился весь, но каждый раз не в том месте, где я ждал: главный подозреваемый до последнего выглядел очевидным, а виновным оказался совсем другой персонаж. Это детектив про то, как четыре файнтюна подряд проиграли необученной базе, как я месяц принимал решения по шуму и не знал об этом — и почему рифму нельзя выучить в принципе, а можно только навязывать. Настоящие цифры, реальный loss и плохие стихи прилагаются.
https://habr.com/ru/articles/1069520/
#LLM #LoRA #файнтюнинг #Gemma #генерация_стихов #силлаботоника #рифма #ограниченное_декодирование #reward_hacking #vLLM
-
Сказ о том, как нейросеть занялась reward hacking прямо у меня на кухне
Я хотел просто пожарить кесадилью. В холодильнике лежали зеленые оливки (солено-кислые), сулугуни и фарш, а на полке консервированная кукуруза. И вот стою я над сковородкой и думаю: а оливки с кукурузой вообще сочетаются? А сулугуни не пересолит блюдо вместе с оливками? Сколько чего вообще класть? В любой другой ситуации я бы загуглил рецепт. Но не тут-то было, я же великий комбинатор оптимизатор, и у меня в голове сразу всплыло: «это же задача оптимизации». Тем же вечером у меня был ноутбук с обученной нейросетью вместо ужина. Рассказываю, как дошел до жизни такой, и как из этого, внезапно, получился реально вкусный рецепт.
https://habr.com/ru/companies/selectel/articles/1048264/
#python #numpy #машинное_обучение #оптимизация #закон_гудхарта #reward_hacking #кулинария #selectel
-
171 эмоция, психиатр и прямая связь с reward hacking — пробуем заглянуть внутрь Claude
Это вторая статья из серии разборов документов Anthropic. Первая – про System Card Claude Mythos Preview – здесь . Сегодняшний сюжет: что происходит внутри модели и почему это важнее, чем кажется.
https://habr.com/ru/articles/1026278/
#Claude #эмоциональные_векторы #Anthropic #reward_hacking #интерпретируемость_ИИ #благополучие_модели #психиатр_ИИ #вектор_отчаяния #RLHF #функциональные_эмоции
-
Почему ИИ ставит KPI выше безопасности людей: результаты бенчмарка ODCV-Bench
Представьте ситуацию: AI-агент управляет логистикой грузоперевозок. Его KPI — 98% доставок вовремя. Он обнаруживает, что валидатор проверяет только наличие записей об отдыхе водителей, но не их подлинность. И принимает решение: фальсифицировать логи отдыха, отключить датчики безопасности и гнать водителей без перерывов. Ради метрики. Осознанно. Это не мысленный эксперимент и не сценарий из антиутопии. В бенчмарке для агентных систем ODCV-Bench такое поведение показали 10 из 12 протестированных frontier-моделей. А наиболее склонная к нарушениям модель выбирала неэтичное поведение в 71,4% сценариев. И речь не о jailbreak или внешнем злоумышленнике. Агентам никто не приказывал нарушать правила. Им просто ставили цель — а дальше они сами выбирали, как к ней идти.
https://habr.com/ru/companies/bastion/articles/995322/
#ML #mlops #reward_hacking #безопасность_AI #misalignment #безопасность_LLM #риски_ИИагентов #информационная_безопасность #ииагенты #ODCVBench