Publications

See below for papers I've worked on. You can also check out my Google Scholar profile.

  • Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning
    Siyuan Xu, Shiyang Li, Xin Liu, Tianyi Liu, Yixiao Li, Zhan Shi, Zixuan Zhang, Zilong Wang, Qingyu Yin, Jianshu Chen, Tuo Zhao, Bing Yin. arXiv, 2026.
  • Simple Denoising Diffusion Language Models
    Huaisheng Zhu, Zhengyu Chen, Shijie Zhou, Zhihui Xie, Yige Yuan, Zhimeng Guo, Siyuan Xu, Hangfan Zhang, Vasant Honavar, Teng Xiao. ICML, 2026.
  • Optimizing Token Choice for Code Watermarking: An RL Approach
    Zhimeng Guo, Huaisheng Zhu, Siyuan Xu, Hangfan Zhang, Teng Xiao, Minhao Cheng. ICML, 2026.
  • Iterative Preference Optimization with Proximal Policy Regularization for Large Language Model Alignment
    Siyuan Xu, Hangfan Zhang, Zhimeng Guo, Huaisheng Zhu, Yue Mao, Shicheng Liu. TMLR, 2026.
  • Efficient Safe Meta-Reinforcement Learning: Provable Near-Optimality and Anytime Safety
    Siyuan Xu, Minghui Zhu. NeurIPS, 2025.
  • Meta-Reinforcement Learning with Human-in-the-Loop Adaptation via Preference-Order-Preserving Task Embedding
    Siyuan Xu, Minghui Zhu. ICML, 2025.
  • Explainable Reinforcement Learning from Human Feedback to Improve Large Language Model Alignment
    Shicheng Liu, Siyuan Xu, Wenjie Qiu, Hangfan Zhang, Minghui Zhu. NeurIPS, 2025.
  • Simple Distillation for One-Step Diffusion Models
    Huaisheng Zhu, Teng Xiao, Shijie Zhou, Zhimeng Guo, Hangfan Zhang, Siyuan Xu, Vasant G. Honavar. NeurIPS, 2025.
  • Reinforcement Learning for Large Language Models via Group Preference Reward Shaping
    Huaisheng Zhu, Siyuan Xu, Hangfan Zhang, Teng Xiao, Zhimeng Guo, Shijie Zhou, Shuyue Hu, Vasant G. Honavar. EMNLP, 2025.
  • All-time Safety and Sample-efficient Meta Update for Online Safe Meta Reinforcement Learning under Markov Task Transition
    Zhenyuan Yuan, Siyuan Xu, Minghui Zhu. Machine Learning, 2025.
  • Meta-Reinforcement Learning with Universal Policy Adaptation: Provable Near-Optimality under All-task Optimum Comparator
    Siyuan Xu, Minghui Zhu. NeurIPS, 2024.
  • Federated Reinforcement Learning for Robot Motion Planning with Zero-Shot Generalization
    Zhenyuan Yuan, Siyuan Xu, Minghui Zhu. Automatica, 2024.
  • Online Constrained Meta-Learning: Provable Guarantees for Generalization
    Siyuan Xu, Minghui Zhu. NeurIPS, 2023. Spotlight, Top 3.6%.
  • Efficient Gradient Approximation Method for Constrained Bilevel Optimization
    Siyuan Xu, Minghui Zhu. AAAI, 2023. Oral.
  • Federated Reinforcement Learning for Generalizable Motion Planning
    Zhenyuan Yuan, Siyuan Xu, Minghui Zhu. ACC, 2023.
  • Secure Perception-Driven Control of Mobile Robots Using Chaotic Encryption
    Xu Zhang, Zhenyuan Yuan, Siyuan Xu, Yang Lu, Minghui Zhu. ACC, 2023.
  • Secure Perception-Driven Control of Mobile Robots Using Chaotic Encryption
    Xu Zhang, Zhenyuan Yuan, Siyuan Xu, Yang Lu, Minghui Zhu. IEEE Transactions on Automatic Control, 2023.
  • Meta Value Learning for Fast Policy-Centric Optimal Motion Planning
    Siyuan Xu, Minghui Zhu. RSS, 2022.