home.social

#rlvr — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #rlvr, aggregated by home.social.

  1. Данные, которые нельзя выдумать: как мы собираем трейсы для тренировки агентских навыков Cotype

    Привет, Хабр! На днях мы выкатили третье поколение языковых моделей Cotype — флагманскую Cotype Pro 3 и ее облегченную версию Cotype Light 3 (к слову, лайт мы выкатили чутка раньше, но это не имеет значения). Почитать о характеристиках моделей можно вот в этом посте. Тут же мы расскажем вам о нюансах обучения — точнее о том, как мы учим наши модели выполнять многошаговые сценарии без запинок, что совершенно необходимо, так как они выступают ключевым компонентом наших корпоративных ИИ-агентов и мультиагентных систем. Велком под кат

    habr.com/ru/companies/ru_mts/a

    #agents #llm #rlvr #grpo #harness #synthetic_data #искусственный_интеллект #агентский_режим #ииагенты #ииагенты_для_бизнеса

  2. New research from Tsinghua shows that reasoning‑augmented LLMs solve tasks with fewer calls but don’t surpass raw capability. The study compares chain‑of‑thought prompting, RL‑based RLVR, and pass@1 metrics, highlighting efficiency gains for open‑source models. Worth a read for anyone tracking LLM benchmarks. #LLM #ChainOfThought #RLVR #PassAt1

    🔗 aidailypost.com/news/study-fin