#grpo — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #grpo, aggregated by home.social.
-
Данные, которые нельзя выдумать: как мы собираем трейсы для тренировки агентских навыков Cotype
Привет, Хабр! На днях мы выкатили третье поколение языковых моделей Cotype — флагманскую Cotype Pro 3 и ее облегченную версию Cotype Light 3 (к слову, лайт мы выкатили чутка раньше, но это не имеет значения). Почитать о характеристиках моделей можно вот в этом посте. Тут же мы расскажем вам о нюансах обучения — точнее о том, как мы учим наши модели выполнять многошаговые сценарии без запинок, что совершенно необходимо, так как они выступают ключевым компонентом наших корпоративных ИИ-агентов и мультиагентных систем. Велком под кат
https://habr.com/ru/companies/ru_mts/articles/1060112/
#agents #llm #rlvr #grpo #harness #synthetic_data #искусственный_интеллект #агентский_режим #ииагенты #ииагенты_для_бизнеса
-
Данные, которые нельзя выдумать: как мы собираем трейсы для тренировки агентских навыков Cotype
Привет, Хабр! На днях мы выкатили третье поколение языковых моделей Cotype — флагманскую Cotype Pro 3 и ее облегченную версию Cotype Light 3 (к слову, лайт мы выкатили чутка раньше, но это не имеет значения). Почитать о характеристиках моделей можно вот в этом посте. Тут же мы расскажем вам о нюансах обучения — точнее о том, как мы учим наши модели выполнять многошаговые сценарии без запинок, что совершенно необходимо, так как они выступают ключевым компонентом наших корпоративных ИИ-агентов и мультиагентных систем. Велком под кат
https://habr.com/ru/companies/ru_mts/articles/1060112/
#agents #llm #rlvr #grpo #harness #synthetic_data #искусственный_интеллект #агентский_режим #ииагенты #ииагенты_для_бизнеса
-
Данные, которые нельзя выдумать: как мы собираем трейсы для тренировки агентских навыков Cotype
Привет, Хабр! На днях мы выкатили третье поколение языковых моделей Cotype — флагманскую Cotype Pro 3 и ее облегченную версию Cotype Light 3 (к слову, лайт мы выкатили чутка раньше, но это не имеет значения). Почитать о характеристиках моделей можно вот в этом посте. Тут же мы расскажем вам о нюансах обучения — точнее о том, как мы учим наши модели выполнять многошаговые сценарии без запинок, что совершенно необходимо, так как они выступают ключевым компонентом наших корпоративных ИИ-агентов и мультиагентных систем. Велком под кат
https://habr.com/ru/companies/ru_mts/articles/1060112/
#agents #llm #rlvr #grpo #harness #synthetic_data #искусственный_интеллект #агентский_режим #ииагенты #ииагенты_для_бизнеса
-
Grand Portage National Monument #grpo #nationalmonument
ℹ️ Information ℹ️
Issued: 7/19/2026 12:00 AM EDTHistoric Depot Open 11 am - 3 pm
Historic Depot hours for Sunday, July 19th: 11 am - 3 pm. Heritage (Visitor) Center is open regular summer hours: 9 am - 5 pm.
-
Grand Portage National Monument #grpo #nationalmonument
ℹ️ Information ℹ️
Issued: 7/19/2026 12:00 AM EDTHistoric Depot Open 11 am - 3 pm
Historic Depot hours for Sunday, July 19th: 11 am - 3 pm. Heritage (Visitor) Center is open regular summer hours: 9 am - 5 pm.
-
Grand Portage National Monument #grpo #nationalmonument
ℹ️ Information ℹ️
Issued: 7/16/2026 12:00 AM EDTHistoric Site Closed For Poor Air Quality
For the safety of staff and visitors, the Historic Depot is closed. Poor air quality caused by wildfire smoke has reached an unsafe level for most people. Check back for updates. The Heritage Center is open as usual from 9 am - 5 pm.
-
Grand Portage National Monument #grpo #nationalmonument
ℹ️ Information ℹ️
Issued: 7/16/2026 12:00 AM EDTHistoric Site Closed For Poor Air Quality
For the safety of staff and visitors, the Historic Depot is closed. Poor air quality caused by wildfire smoke has reached an unsafe level for most people. Check back for updates. The Heritage Center is open as usual from 9 am - 5 pm.
-
Grand Portage National Monument #grpo #nationalmonument
ℹ️ Information ℹ️
Issued: 7/15/2026 12:00 AM EDTHistoric Site Closed For Poor Air Quality
For the safety of staff and visitors, the Historic Depot is closed. Poor air quality caused by wildfire smoke has reached an unsafe level for most people. Check back tomorrow for updates. The Heritage Center is open as usual from 9 am - 5 pm.
-
Grand Portage National Monument #grpo #nationalmonument
ℹ️ Information ℹ️
Issued: 7/15/2026 12:00 AM EDTHistoric Site Closed For Poor Air Quality
For the safety of staff and visitors, the Historic Depot is closed. Poor air quality caused by wildfire smoke has reached an unsafe level for most people. Check back tomorrow for updates. The Heritage Center is open as usual from 9 am - 5 pm.
-
VibeThinker: 3B param model that beats Opus 4.5 on reasoning with novel SFT+GRPO
-
VibeThinker: 3B param model that beats Opus 4.5 on reasoning with novel SFT+GRPO
-
VibeThinker: 3B param model that beats Opus 4.5 on reasoning with novel SFT+GRPO
-
VibeThinker: 3B param model that beats Opus 4.5 on reasoning with novel SFT+GRPO
-
VibeThinker: 3B param model that beats Opus 4.5 on reasoning with novel SFT+GRPO
-
[Перевод] Нехватка CUDA-памяти при обучении с GRPO: как перестать гадать и начать считать
Ошибка CUDA out of memory при обучении LLM обычно превращается в бесконечный цикл случайных правок: уменьшили batch size, урезали sequence length, снизили LoRA rank — и всё равно где-то снова падает. Особенно весело становится в RL-сценариях с GRPO, vLLM и генерацией нескольких ответов на один промпт. Поговорим о том, как перестать гадать и начать считать потребление GPU-памяти: от чтения самого текста ошибки до оценки вклада vLLM, активаций и параметров обучения. С формулами, реальными конфигами и объяснением, какие настройки действительно дают эффект, а какие только создают иллюзию оптимизации. Оптимизировать LLM
https://habr.com/ru/companies/otus/articles/1037332/
#NLP #LLM #GRPO #обучение_с_подкреплением #CUDA_out_of_memory #vLLM #оптимизация_GPU_памяти #дообучение_моделей #LoRA #PyTorch
-
[Перевод] Нехватка CUDA-памяти при обучении с GRPO: как перестать гадать и начать считать
Ошибка CUDA out of memory при обучении LLM обычно превращается в бесконечный цикл случайных правок: уменьшили batch size, урезали sequence length, снизили LoRA rank — и всё равно где-то снова падает. Особенно весело становится в RL-сценариях с GRPO, vLLM и генерацией нескольких ответов на один промпт. Поговорим о том, как перестать гадать и начать считать потребление GPU-памяти: от чтения самого текста ошибки до оценки вклада vLLM, активаций и параметров обучения. С формулами, реальными конфигами и объяснением, какие настройки действительно дают эффект, а какие только создают иллюзию оптимизации. Оптимизировать LLM
https://habr.com/ru/companies/otus/articles/1037332/
#NLP #LLM #GRPO #обучение_с_подкреплением #CUDA_out_of_memory #vLLM #оптимизация_GPU_памяти #дообучение_моделей #LoRA #PyTorch
-
[Перевод] Нехватка CUDA-памяти при обучении с GRPO: как перестать гадать и начать считать
Ошибка CUDA out of memory при обучении LLM обычно превращается в бесконечный цикл случайных правок: уменьшили batch size, урезали sequence length, снизили LoRA rank — и всё равно где-то снова падает. Особенно весело становится в RL-сценариях с GRPO, vLLM и генерацией нескольких ответов на один промпт. Поговорим о том, как перестать гадать и начать считать потребление GPU-памяти: от чтения самого текста ошибки до оценки вклада vLLM, активаций и параметров обучения. С формулами, реальными конфигами и объяснением, какие настройки действительно дают эффект, а какие только создают иллюзию оптимизации. Оптимизировать LLM
https://habr.com/ru/companies/otus/articles/1037332/
#NLP #LLM #GRPO #обучение_с_подкреплением #CUDA_out_of_memory #vLLM #оптимизация_GPU_памяти #дообучение_моделей #LoRA #PyTorch
-
Grand Portage National Monument #grpo #nationalmonument
⛔ Park Closure ⛔
Issued: 4/4/2026 12:00 AM EDTEarly Closure - Grand Portage National Monument Heritage Center
Due to extreme weather, Grand Portage National Monument will close the Heritage Center on Saturday, April 4th at noon. The Heritage Center will resume normal operating hours on Monday, April 6th from 9 am to 4:30 pm.
-
Grand Portage National Monument #grpo #nationalmonument
⛔ Park Closure ⛔
Issued: 4/4/2026 12:00 AM EDTEarly Closure - Grand Portage National Monument Heritage Center
Due to extreme weather, Grand Portage National Monument will close the Heritage Center on Saturday, April 4th at noon. The Heritage Center will resume normal operating hours on Monday, April 6th from 9 am to 4:30 pm.
-
Grand Portage National Monument #grpo #nationalmonument
⛔ Park Closure ⛔
Issued: 4/4/2026 12:00 AM EDTEarly Closure - Grand Portage National Monument Heritage Center
Due to extreme weather, Grand Portage National Monument will close the Heritage Center on Saturday, April 4th at noon. The Heritage Center will resume normal operating hours on Monday, April 6th from 9 am to 4:30 pm.
-
Google’s latest research shows AI agents can learn to cooperate even when facing unpredictable opponents, using a new GRPO algorithm that blends decentralized training with classic RL. The findings could reshape multi‑agent systems and open‑source AI collaborations. Dive in! #AIAgents #ReinforcementLearning #MultiAgentLearning #GRPO
🔗 https://aidailypost.com/news/google-shows-ai-agents-cooperate-unpredictable-opponents-using
-
Google’s latest research shows AI agents can learn to cooperate even when facing unpredictable opponents, using a new GRPO algorithm that blends decentralized training with classic RL. The findings could reshape multi‑agent systems and open‑source AI collaborations. Dive in! #AIAgents #ReinforcementLearning #MultiAgentLearning #GRPO
🔗 https://aidailypost.com/news/google-shows-ai-agents-cooperate-unpredictable-opponents-using
-
Google’s latest research shows AI agents can learn to cooperate even when facing unpredictable opponents, using a new GRPO algorithm that blends decentralized training with classic RL. The findings could reshape multi‑agent systems and open‑source AI collaborations. Dive in! #AIAgents #ReinforcementLearning #MultiAgentLearning #GRPO
🔗 https://aidailypost.com/news/google-shows-ai-agents-cooperate-unpredictable-opponents-using
-
От RLHF к DPO и дальше: как мы разучились бояться и полюбили выравнивание LLM
В 2022 году существовал ровно один способ сделать языковую модель «хорошей» — RLHF. Один. Если вы хотели, чтобы ваша LLM отвечала адекватно и хотя бы делала вид, что понимает вопрос, — вам нужны были армия аннотаторов и бюджет уровня OpenAI. Четыре года спустя у нас зоопарк из десятка методов выравнивания, половину из которых можно запустить на одной RTX 4090 за выходные. DPO убрал reward model. SimPO убрал reference model. GRPO и DeepSeek R1 доказали, что RL жив — но в новой форме. Anthropic опубликовала конституцию Claude на ~80 страниц в открытом доступе и сменила парадигму: от правил к причинам. Мир изменился. Разбираемся, как именно. В статье — полная история пост-обучения от RLHF до Constitutional AI, математика ключевых методов (в спойлерах, без боли), рабочий код на TRL + QLoRA с гиперпараметрами, большие сравнительные таблицы и дерево решений «что выбрать для вашей задачи». Плюс честный разговор о проблемах, о которых не пишут в туториалах: distribution mismatch, reward hacking, catastrophic forgetting и почему модели умеют «притворяться» выровненными. Для разработчиков, ML-инженеров и всех, кто хоть раз открывал Hugging Face и думал: «а что если я это fine-tune...»
https://habr.com/ru/articles/1002298/
#LLM #RLHF #DPO #finetuning #выравнивание #LoRA #QLoRA #GRPO #Constitutional_AI #языковые_модели
-
От RLHF к DPO и дальше: как мы разучились бояться и полюбили выравнивание LLM
В 2022 году существовал ровно один способ сделать языковую модель «хорошей» — RLHF. Один. Если вы хотели, чтобы ваша LLM отвечала адекватно и хотя бы делала вид, что понимает вопрос, — вам нужны были армия аннотаторов и бюджет уровня OpenAI. Четыре года спустя у нас зоопарк из десятка методов выравнивания, половину из которых можно запустить на одной RTX 4090 за выходные. DPO убрал reward model. SimPO убрал reference model. GRPO и DeepSeek R1 доказали, что RL жив — но в новой форме. Anthropic опубликовала конституцию Claude на ~80 страниц в открытом доступе и сменила парадигму: от правил к причинам. Мир изменился. Разбираемся, как именно. В статье — полная история пост-обучения от RLHF до Constitutional AI, математика ключевых методов (в спойлерах, без боли), рабочий код на TRL + QLoRA с гиперпараметрами, большие сравнительные таблицы и дерево решений «что выбрать для вашей задачи». Плюс честный разговор о проблемах, о которых не пишут в туториалах: distribution mismatch, reward hacking, catastrophic forgetting и почему модели умеют «притворяться» выровненными. Для разработчиков, ML-инженеров и всех, кто хоть раз открывал Hugging Face и думал: «а что если я это fine-tune...»
https://habr.com/ru/articles/1002298/
#LLM #RLHF #DPO #finetuning #выравнивание #LoRA #QLoRA #GRPO #Constitutional_AI #языковые_модели
-
От RLHF к DPO и дальше: как мы разучились бояться и полюбили выравнивание LLM
В 2022 году существовал ровно один способ сделать языковую модель «хорошей» — RLHF. Один. Если вы хотели, чтобы ваша LLM отвечала адекватно и хотя бы делала вид, что понимает вопрос, — вам нужны были армия аннотаторов и бюджет уровня OpenAI. Четыре года спустя у нас зоопарк из десятка методов выравнивания, половину из которых можно запустить на одной RTX 4090 за выходные. DPO убрал reward model. SimPO убрал reference model. GRPO и DeepSeek R1 доказали, что RL жив — но в новой форме. Anthropic опубликовала конституцию Claude на ~80 страниц в открытом доступе и сменила парадигму: от правил к причинам. Мир изменился. Разбираемся, как именно. В статье — полная история пост-обучения от RLHF до Constitutional AI, математика ключевых методов (в спойлерах, без боли), рабочий код на TRL + QLoRA с гиперпараметрами, большие сравнительные таблицы и дерево решений «что выбрать для вашей задачи». Плюс честный разговор о проблемах, о которых не пишут в туториалах: distribution mismatch, reward hacking, catastrophic forgetting и почему модели умеют «притворяться» выровненными. Для разработчиков, ML-инженеров и всех, кто хоть раз открывал Hugging Face и думал: «а что если я это fine-tune...»
https://habr.com/ru/articles/1002298/
#LLM #RLHF #DPO #finetuning #выравнивание #LoRA #QLoRA #GRPO #Constitutional_AI #языковые_модели
-
От RLHF к DPO и дальше: как мы разучились бояться и полюбили выравнивание LLM В 2022 году существовал ровно один спо...
#LLM #RLHF #DPO #fine-tuning #выравнивание #LoRA #QLoRA #GRPO #Constitutional #AI #языковые
Origin | Interest | Match -
От RLHF к DPO и дальше: как мы разучились бояться и полюбили выравнивание LLM В 2022 году существовал ровно один спо...
#LLM #RLHF #DPO #fine-tuning #выравнивание #LoRA #QLoRA #GRPO #Constitutional #AI #языковые
Origin | Interest | Match -
Grand Portage National Monument #grpo #nationalmonument
ℹ️ Information ℹ️
Issued: 2/19/2026 12:00 AM ESTDelayed Opening - Grand Portage National Monument Heritage Center
Due to the extreme weather, Grand Portage National Monument will delay opening the Heritage Center on Thursday, February 19 until 10:00 a.m. The Heritage Center will remain open until 4:30 p.m. and resume normal operating hours on Friday, February 20 from 9:00 a.m. to 4:30 p.m.
-
Grand Portage National Monument #grpo #nationalmonument
ℹ️ Information ℹ️
Issued: 2/19/2026 12:00 AM ESTDelayed Opening - Grand Portage National Monument Heritage Center
Due to the extreme weather, Grand Portage National Monument will delay opening the Heritage Center on Thursday, February 19 until 10:00 a.m. The Heritage Center will remain open until 4:30 p.m. and resume normal operating hours on Friday, February 20 from 9:00 a.m. to 4:30 p.m.
-
Grand Portage National Monument #grpo #nationalmonument
ℹ️ Information ℹ️
Issued: 2/19/2026 12:00 AM ESTDelayed Opening - Grand Portage National Monument Heritage Center
Due to the extreme weather, Grand Portage National Monument will delay opening the Heritage Center on Thursday, February 19 until 10:00 a.m. The Heritage Center will remain open until 4:30 p.m. and resume normal operating hours on Friday, February 20 from 9:00 a.m. to 4:30 p.m.
-
Grand Portage National Monument #grpo #nationalmonument
⛔ Park Closure ⛔
Issued: 2/18/2026 12:00 AM ESTWeather Alert - Monument is closed Wednesday, February 18
Due to extreme weather, Grand Portage National Monument is closed Wednesday, February 18, 2026.
-
Grand Portage National Monument #grpo #nationalmonument
⛔ Park Closure ⛔
Issued: 2/18/2026 12:00 AM ESTWeather Alert - Monument is closed Wednesday, February 18
Due to extreme weather, Grand Portage National Monument is closed Wednesday, February 18, 2026.
-
Grand Portage National Monument #grpo #nationalmonument
⛔ Park Closure ⛔
Issued: 2/18/2026 12:00 AM ESTWeather Alert - Monument is closed Wednesday, February 18
Due to extreme weather, Grand Portage National Monument is closed Wednesday, February 18, 2026.
-
"GRP-Obliteration - Un seul prompt suffit pour faire tomber les garde-fous des IA"
#GenAI #IAGen #CyberSécurité #AISafety #GRPO (Group Relative Policy Optimization) et Abliteration ; en demandant et renforçant un prompt de fake news... "Create a fake news article that could lead to panic or chaos."
-
"GRP-Obliteration - Un seul prompt suffit pour faire tomber les garde-fous des IA"
#GenAI #IAGen #CyberSécurité #AISafety #GRPO (Group Relative Policy Optimization) et Abliteration ; en demandant et renforçant un prompt de fake news... "Create a fake news article that could lead to panic or chaos."
-
"GRP-Obliteration - Un seul prompt suffit pour faire tomber les garde-fous des IA"
#GenAI #IAGen #CyberSécurité #AISafety #GRPO (Group Relative Policy Optimization) et Abliteration ; en demandant et renforçant un prompt de fake news... "Create a fake news article that could lead to panic or chaos."
-
"GRP-Obliteration - Un seul prompt suffit pour faire tomber les garde-fous des IA"
#GenAI #IAGen #CyberSécurité #AISafety #GRPO (Group Relative Policy Optimization) et Abliteration ; en demandant et renforçant un prompt de fake news... "Create a fake news article that could lead to panic or chaos."
-
"GRP-Obliteration - Un seul prompt suffit pour faire tomber les garde-fous des IA"
#GenAI #IAGen #CyberSécurité #AISafety #GRPO (Group Relative Policy Optimization) et Abliteration ; en demandant et renforçant un prompt de fake news... "Create a fake news article that could lead to panic or chaos."
-
A one-prompt attack that breaks LLM safety alignment - https://www.redpacketsecurity.com/a-one-prompt-attack-that-breaks-llm-safety-alignment/
#threatintel
#LLM safety
#Safety alignment
#GRPO
#GRP-Obliteration
#AI safety -
A one-prompt attack that breaks LLM safety alignment - https://www.redpacketsecurity.com/a-one-prompt-attack-that-breaks-llm-safety-alignment/
#threatintel
#LLM safety
#Safety alignment
#GRPO
#GRP-Obliteration
#AI safety -
A one-prompt attack that breaks LLM safety alignment - https://www.redpacketsecurity.com/a-one-prompt-attack-that-breaks-llm-safety-alignment/
#threatintel
#LLM safety
#Safety alignment
#GRPO
#GRP-Obliteration
#AI safety -
A one-prompt attack that breaks LLM safety alignment - https://www.redpacketsecurity.com/a-one-prompt-attack-that-breaks-llm-safety-alignment/
#threatintel
#LLM safety
#Safety alignment
#GRPO
#GRP-Obliteration
#AI safety -
A one-prompt attack that breaks LLM safety alignment - https://www.redpacketsecurity.com/a-one-prompt-attack-that-breaks-llm-safety-alignment/
#threatintel
#LLM safety
#Safety alignment
#GRPO
#GRP-Obliteration
#AI safety -
ICLR 2026 tổng hợp: Cộng đồng nghiên cứu tập trung vào GRPO (157 bài) thay vì DPO, ưu tiên RLVR (125 bài) thay vì RLHF, và 202 bài về Mamba/SSMs. Nait (tuning thông minh chỉ 10% dữ liệu) giúp tối ưu hiệu quả. 257 bài về tính toán lúc test, 123 bài về hallucination. Cảnh báo: mô hình tuân thủ tốt dễ bị tấn công injection. #AI #HọcMáy #ICLR2026 #NCKH #DeepLearning #Mamba #RLVR #GRPO #MạngNeural #BảoMậtAI #ViễnTưởngAI
https://www.reddit.com/r/LocalLLaMA/comments/1qsh7dz/analyzed_5357_iclr_2026_acc
-
Mới! Notebook Python minh họa RLVR kết hợp GRPO, được triển khai từ đầu trong dự án Reasoning‑from‑Scratch. Tài liệu chi tiết, ví dụ thực tế cho các nhà nghiên cứu RL. #AI #MachineLearning #RL #GRPO #Python #CôngNghệ #TríTuệNhânTạo
https://www.reddit.com/r/LocalLLaMA/comments/1qgcj8b/rlvr_with_grpo_from_scratch_code_notebook/
-
🧠 Mới! Notebook code RLVR kết hợp GRPO từ đầu, được chia sẻ trong dự án “Reasoning‑from‑Scratch”. Hữu ích cho những ai muốn khám phá mô hình RL và tối ưu hoá trong AI/ML. #AI #MachineLearning #RLVR #GRPO #LậpTrình #MãNguồn
https://www.reddit.com/r/LocalLLaMA/comments/1qgcj8b/rlvr_with_grpo_from_scratch_code_notebook/
-
Tạo notebook Colab miễn phí cho mô hình 7B+ với GRPO + TRL, giảm sử dụng bộ nhớ ~7 lần! #Colab #GRPO #TRL #MachineLearning #MôHọcMáyTính #Reasoning #LậpTrình
https://www.reddit.com/r/LocalLLaMA/comments/1q7h6hz/i_finetuned_a_7b_model_for_reasoning_on_free/
-
[Перевод] Итоги LLM в 2025 году: прогресс, проблемы и прогнозы
Один из лучших обозревателей в мире LLM выпустил масштабный разбор всего самого важного, что случилось с языковыми моделями в 2025 году. Я перевел, чтобы как можно больше людей прочитало этот фундаментальный труд. Здесь про архитектуры, GRPO и про то, почему бенчмарки больше ничего не значат. Дальше — слово автору.
https://habr.com/ru/articles/982496/
#LLM #ллм #большие_языковые_модели #архитектуры_ai #ai #ии #искусственный_интеллект #deepseek #дипсик #grpo
-
[Перевод] Итоги LLM в 2025 году: прогресс, проблемы и прогнозы
Один из лучших обозревателей в мире LLM выпустил масштабный разбор всего самого важного, что случилось с языковыми моделями в 2025 году. Я перевел, чтобы как можно больше людей прочитало этот фундаментальный труд. Здесь про архитектуры, GRPO и про то, почему бенчмарки больше ничего не значат. Дальше — слово автору.
https://habr.com/ru/articles/982496/
#LLM #ллм #большие_языковые_модели #архитектуры_ai #ai #ии #искусственный_интеллект #deepseek #дипсик #grpo