I currently work on agent post-training at Alibaba Cloud. Previously, I worked with ByteDance Seed and Shanghai AI Laboratory. I received both my bachelor's and master's degrees in Automation from Xi'an Jiaotong University.
My research focuses on reinforcement learning for foundation models, agent post-training, reasoning and tool use, generative policies, and multimodal intelligence.
Yufei Zhan, Ziheng Wu, Yousong Zhu, Rongkun Xue, Guanghao Zhou, Ruipu Luo, Zhenghao Chen, Can Zhang, Yifan Li, Zhentao He, Zheming Yang, Ming Tang, Minghui Qiu, Jinqiao Wang
CVPR 2026 · Paper · arXiv
Introduces cue-guided visual rethinking to help multimodal language models revise misleading visual interpretations during complex reasoning.
Qingbin Li, Rongkun Xue, Jie Wang, Ming Zhou, Zhi Li, Xiaofeng Ji, Yongqi Wang, Miao Liu, Zheming Yang, Minghui Qiu, Jing Yang
arXiv 2025 · Paper · Code
Branches trajectories at high-entropy critical tokens to sustain exploration and mitigate entropy collapse in reinforcement learning with verifiable rewards.
Rongkun Xue, Jinouwen Zhang, Yazhe Niu, Dazhong Shen, Bingqi Ma, Yu Liu, Jing Yang
ICCV 2025 · Paper · Project · Code
Reuses pretrained continuous generative models as general-purpose feature extractors by reversing their generation process.
Rongkun Xue, Yazhe Niu, Shuai Hu, Zixin Yin, Yongqiang Yao, Jing Yang
ICML 2025 Tokenshop · Paper · OpenReview · Code
Learns highly compressed discrete speech representations designed for efficient spoken language modeling.
Jinouwen Zhang, Rongkun Xue, Yazhe Niu, Yun Chen, Jing Yang, Hongsheng Li, Yu Liu
arXiv 2024 · Paper · OpenReview · Code
Unifies and simplifies generative-policy optimization through GMPO and GMPG, with a standardized experimental framework for offline reinforcement learning.
Rongkun Xue, Jing Yang, Yuyang Jiang, Yiming Feng, Zi Yang
IEEE Intelligent Vehicles Symposium (IV) 2024 · Paper · arXiv
Combines motion-dynamic RRT, fluid-field modeling, and PPO for real-time long-range terrain-following and terrain-avoidance planning.
- Alibaba Cloud — Agent Post-training
- ByteDance Seed — Fast and Slow Reasoning for Foundation Models
- Shanghai AI Laboratory — Multimodal Foundation Model Training
For research collaboration, feel free to reach me at rongkunxue@outlook.com.