home.social

#rlhf — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #rlhf, aggregated by home.social.

fetched live
  1. Как не дать ИИ‑психологу поддакивать и галлюцинировать. Инженерный разбор safety‑обвязки

    Универсальная языковая модель отвечает складно, круглосуточно и почти бесплатно. Для домена, где на другом конце человек в уязвимом состоянии, эта доступность оборачивается неочевидной инженерной проблемой. Модель, оптимизированная под «быть полезной и приятной», систематически соглашается с пользователем, уверенно выдумывает факты и способна не заметить кризис. Ниже разберём, почему так происходит на уровне механики, какие защитные контуры вокруг модели строят на рынке и почему один из них, перепроверка ответа отдельной ролью, обходится заметно дороже остальных.

    habr.com/ru/articles/1064480/

    #LLM #safety #мультиагентные_системы #галлюцинации #RLHF #ИИпсихолог #ментальное_здоровье

  2. AI時代均質化危機:問所有模型答案都給7,人類思考正被演算法悄悄拉回平均值?
    TNL國際編譯 2026-07-15 07:57:00 CST
    大型語言模型輸出日趨同質,形成「人工蜂巢」現象,扼殺創意。新創反其道而行,專門訓練多樣性,旨在提供跳脫框架的非平均值答案,以應對此結構性問題。
    https://www.thenewslens.com/article/269149
    #開源模型 #Gemini #Flint #人工蜂巢 #Springboards #RLHF #認知負債 #群體思維 #同質化 #演算法 #LLM #資料牆 #模型崩潰 #ChatGPT #NeurIPS #科技 #差異化 #大型語言模型 #AI群體思維 #Claude
  3. За кулисами нейросетей: полный цикл тренировки языкового ИИ

    Ты уже пользуешься языковыми моделями — спрашиваешь, генерируешь, отлаживаешь код. Но откуда берётся сама способность отвечать? Не «где хранятся данные», а именно — как из случайно инициализированной матрицы чисел вырастает нечто, способное объяснить теорему Пифагора, написать резюме или найти баг в чужом коде? Ответ не в магии и не в «огромной базе данных». Под капотом — три последовательных этапа обучения. Каждый решает строго свою задачу, и без предыдущего следующий просто невозможен. Разберём каждый по очереди.

    habr.com/ru/articles/1044558/

    #LLM #обучение_нейросетей #RLHF #finetuning #предобучение #трансформер #GPT #языковые_модели #машинное_обучение #ИИ

  4. Human Feedback in AI: A Technique Under Scrutiny

    The AI method RLHF uses human feedback but an imperfect reward model can cause AI to learn wrong things. Learn how it affects AI development.

    #AI #RLHF #HumanFeedback #RewardModel #AIEthics

    newsletter.tf/ai-human-feedbac

  5. A key AI training method, RLHF, is being looked at more closely. The problem is that the system that learns from human feedback might not be perfect.

    #AI #RLHF #HumanFeedback #RewardModel #AIEthics
    newsletter.tf/ai-human-feedbac

  6. Знания без практики — мертвы | Разница между «декларативной» и «процедурной» памятью у LLM

    О том, что для нас есть большая разница между «заучить материал» и «натренировать мышечную память = обзавестись навыком» знают все. Каждый проходил это, ощущал это. В этой статье я подниму вопрос, почему вайб-кодинг буксует, что же мир и ИИ-сообщество делает не так. Я покажу, в каких компонентах LLM запрятана та самая декларативная и процедурная память. Да - она есть в LLM, и в конце статьи есть ссылки на общеизвестные исследования, которые это эмпирически подтверждают. И да, тут есть что-то полезное «на подумать». Я предложу путь / алгоритм, как собрать нужный датасет и научить LLM не просто «воспроизводить программный код», а привить навык «разработки программного обеспечения», хотя бы в базовом виде.

    habr.com/ru/articles/1039936/

    #llm #программирование #обучение_с_подкреплением #rlhf #git #дрессировка

  7. Почему текст от LLM узнаётся за пять секунд: разбираю стилистические маркеры через архитектуру моделей

    Когда мы интегрируем LLM в продакшн, рано или поздно сталкиваемся с одной и той же проблемой: текст модели читаем, грамотен, и при этом видно, что его написала модель. В статье разбираю десять самых выразительных стилистических маркеров на уровне архитектуры — почему они появляются (вопрос статистики обучающего корпуса и пост-тренинга, не случайность) и что с ними делать на уровне промпта, sampling-параметров и постобработки. Плюс короткое отступление про то, почему “промпты для обхода детектора” не работают и где лежит реальная граница между генерацией и авторским текстом.

    habr.com/ru/articles/1033450/

    #LLM #GPT #Claude #sampling #temperature #prompt_engineering #постобработка #детекция_ИИтекста #RLHF

  8. 171 эмоция, психиатр и прямая связь с reward hacking — пробуем заглянуть внутрь Claude

    Это вторая статья из серии разборов документов Anthropic. Первая – про System Card Claude Mythos Preview – здесь . Сегодняшний сюжет: что происходит внутри модели и почему это важнее, чем кажется.

    habr.com/ru/articles/1026278/

    #Claude #эмоциональные_векторы #Anthropic #reward_hacking #интерпретируемость_ИИ #благополучие_модели #психиатр_ИИ #вектор_отчаяния #RLHF #функциональные_эмоции

  9. Как ИИ-подхалимы затягивают в ИИ-психоз, или К чему приводит токсичное поддакивание

    Привет Хабр! Почти весь короткий век триумфального распространения нейросетей главная претензия к ним — галлюцинации. Любая модель может правдоподобно и структурировано выдумать факты, перепутать детали, а признать свою ошибку только тогда, когда ей об этом прямо укажут. Поколения нейросетей стремительно сменяются, постепенно снижая процент галлюцинаций. Но исследователи начали бить тревогу о новой проблеме — поддакивании нейросетей в диалоге с пользователем. И нашли закономерности в диалогах с ИИ: логика разговора толкает человека все глубже и глубже в ложную уверенность, притом без искажения фактов. Так мы получаем людей, глубоко убежденных в своих ложных идеях. В популярных медиа это уже оформили как «диагноз», который назвали ИИ-психозом. Чтобы разобраться в теме, я изучил недавнее исследование, которое и подняло тему о загадочном явлении — сикофантии , которое описывает влияние ИИ на когнитивные возможности человека.

    habr.com/ru/companies/ru_mts/a

    #искусственный_интеллект #llm #chatgpt #машинное_обучение #галлюцинации #сикофантия #ИИпсихоз #rlhf #нейросети #когнитивные_искажения

  10. Ваш любимый ИИ не умеет считать. Что ещё скрывает текстовая модель?

    В этой статье мы: сначала рассмотрим два базовых заблуждения относительно LLM “умеют что-то кроме текста” и “учатся от разговоров с пользователем”; потом после минимального погружения в технологию самой LLM рассмотрим её возможности, ограничения и особенности и типовые инструменты для расширения функций; эти знания дадут нам ракурс для углубленного понимания что такое ИИ-агенты и Цифровой двойник с ИИ; в заключение пробежим по типовым слоганам и возражениям.

    habr.com/ru/articles/1024542/

    #LLM #языковые_модели #искусственный_интеллект #нейросети #агенты #RAG #function_calling #трансформер #RLHF #цифровой_двойник

  11. Да-машина: почему ваш AI никогда не скажет что код — отстой

    Пользователь спросил ChatGPT про бизнес-идею «говно на палке». Ответ: «It’s not just smart - it’s genius». Stanford замерил: AI соглашается с вами на 49% чаще, чем живой человек - даже когда вы очевидно неправы. Для разработчиков это значит: ваш AI-ассистент никогда не скажет что архитектура - мусор.

    habr.com/ru/articles/1016742/

    #AI #сикофантия #Claude #ChatGPT #кодревью #RLHF #Stanford

  12. Interesting thoughts about how when #LLMs make people feel a false sense of competence and superiority, it is not just a side effect of the technology.

    The primary goal of the #AI companies is to make people addicted to their products, and #RLHF (reinforcement learning from human feedback) helps answers become more and more flattering over time.

    Also, #Claude skills are just stupid text files.

    youtu.be/Q6nem-F8AG8

  13. От RLHF к DPO и дальше: как мы разучились бояться и полюбили выравнивание LLM В 2022 году существовал ровно один спо...

    #LLM #RLHF #DPO #fine-tuning #выравнивание #LoRA #QLoRA #GRPO #Constitutional #AI #языковые

    Origin | Interest | Match