|
Download README.md from Jackwang111/M2RL-RL_Coding: direct link, hf CLI and curl.
- Browser
- Download file 1.95 kB
-
https://huggingface.co/Jackwang111/M2RL-RL_Coding/resolve/main/README.md
- Command line
-
hf download hf://Jackwang111/M2RL-RL_Coding/README.md
-
curl -L -o README.md https://huggingface.co/Jackwang111/M2RL-RL_Coding/resolve/main/README.md
1.95 kB
To Mix or To Merge?
Toward Multi-Domain Reinforcement Learning for Large Language Models
Haoqing Wangβ , Xiang Longβ , Ziheng Liβ , Yilong Xu, Tingguang Li, Yehui Tangβ
Samsung Research, Beijing, China Β· Peking University
π° News
- [2026.09.07] π The model checkpoints are now open-sourced on Hugging Face and ModelScope! Feel free to use our checkpoints for your post-training research (e.g., weight merging, multi-teacher on-policy distillation)!
- [2026.07.09] π Our paper is accepted to COLM 2026!
π Citation
If you find this work useful, please consider citing:
@inproceedings{
wang2026to,
title={To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models},
author={Haoqing Wang and Xiang Long and Ziheng Li and Yilong Xu and Tingguang Li and Yehui Tang},
booktitle={Third Conference on Language Modeling},
year={2026},
url={https://openreview.net/forum?id=jP7j5XkG8J}
}