home.social

#rlvr — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #rlvr, aggregated by home.social.

  1. [Перевод] Как управлять reasoning effort в LLM

    Как современные LLM получают разные настройки reasoning effort: системные промпты, SFT, RLVR, штрафы за длину, reasoning budgets и on-policy-дистилляция. Разбираем DeepSeek V4, Nemotron 3 Ultra, Kimi K2.5 и K3, GLM-5, Qwen3 и Inkling.

    habr.com/ru/articles/1071250/

    #LLM #reasoning_models #reasoning_effort #RLVR #reinforcement_learning #inference_scaling

  2. → Les 4 étapes pour entrainer un LLM
    scienceetonnante.com/blog/2025

    « Voilà le principe de l'apprentissage par renforcement avec une récompense vérifiable [RLVR], qui permet de se passer d'humains qui doivent juger si la réponse est conforme ou pas. »

    #entrainer #LLM #apprentissage #RLVR #humains