π¬ About Me
- I am a researcher on the Foundation Team at StepFun, working on post-training for the Step model family.
- My research interests include reinforcement learning, post-training, and optimization for foundation models.
- We are hiring researchers and interns across pre-training, post-training, multimodal, and speech, with opportunities in algorithms, infrastructure, and data. Feel free to send your resume and research interests to my email for a referral.
π Educations
- 2022.09 - 2026.06: B.Eng, Computer Science (Turing Honors Class), Renmin University of China, advisor Mingyang Yi.
π» Experiences
- 2026.06 - now: Researcher, LLM Post-training Team, StepFun, Beijing.
- 2026.01 - 2026.06: Research Intern, AI Infra and Data Team, JD.com, Beijing.
- 2025.03 - 2025.09: Research Intern, Reinforcement Learning Team, Zhongguancun Academy, Beijing.
- 2024.09 - 2025.03: Development Intern, LLM Pre-training Team, PixVerse, Beijing.
π Publications
PrePrints
- Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment
Yu Li*, Xiuyu Li*, Mingyang Yi, Jiaxing Wang, Liangxu Zhang, Zhaolong Xing, Zhen Chen
Preprint
- Your βProβ LLM Subscription May Actually Be βFreeβ: Exposing Fingerprint Spoofing Risks in LLM Inference Services
Jiahao Zhang*, Xiuyu Li*, Suhang Wang
Preprint
- OFA-Diffusion Compression: Compressing Diffusion Model in One-Shot Manner
Haoyang Jiang*, Zekun Wang*, Mingyang Yi, Xiuyu Li, Lanqing Hu, Junxian Cai, Qingbin Liu, Xi Chen, Ju Fan
Preprint
- Reasoning and Tool-use Compete in Agentic RL: From Quantifying Interference to Disentangled Tuning
Yu Li, Mingyang Yi, Xiuyu Li, Ju Fan, Fuxin Jiang, Binbin Chen, Peng Li, Jie Song, Tieying Zhang
Preprint 
π Selected Honors and Awards
- 2026.06: Special Award, Sa Shixuan Elite Fund, Renmin University of China (30,000 CNY)
- 2026.05: Research Funding, Anonymous Personal Sponsorship (5,000 USDT)
- 2022.11: Gold Medal, The 2022 ICPC Asia Shenyang Regional Contest