Publications
See below for papers I've worked on. You can also check out my Google Scholar profile.
-
Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning
Siyuan Xu, Shiyang Li, Xin Liu, Tianyi Liu, Yixiao Li, Zhan Shi, Zixuan Zhang, Zilong Wang, Qingyu Yin, Jianshu Chen, Tuo Zhao, Bing Yin. -
Simple Denoising Diffusion Language Models
Huaisheng Zhu, Zhengyu Chen, Shijie Zhou, Zhihui Xie, Yige Yuan, Zhimeng Guo, Siyuan Xu, Hangfan Zhang, Vasant Honavar, Teng Xiao. -
Optimizing Token Choice for Code Watermarking: An RL Approach
Zhimeng Guo, Huaisheng Zhu, Siyuan Xu, Hangfan Zhang, Teng Xiao, Minhao Cheng. -
Iterative Preference Optimization with Proximal Policy Regularization for Large Language Model Alignment
Siyuan Xu, Hangfan Zhang, Zhimeng Guo, Huaisheng Zhu, Yue Mao, Shicheng Liu.
-
Efficient Safe Meta-Reinforcement Learning: Provable Near-Optimality and Anytime Safety
Siyuan Xu, Minghui Zhu. -
Meta-Reinforcement Learning with Human-in-the-Loop Adaptation via Preference-Order-Preserving Task Embedding
Siyuan Xu, Minghui Zhu. -
Explainable Reinforcement Learning from Human Feedback to Improve Large Language Model Alignment
Shicheng Liu, Siyuan Xu, Wenjie Qiu, Hangfan Zhang, Minghui Zhu. -
Simple Distillation for One-Step Diffusion Models
Huaisheng Zhu, Teng Xiao, Shijie Zhou, Zhimeng Guo, Hangfan Zhang, Siyuan Xu, Vasant G. Honavar. -
Reinforcement Learning for Large Language Models via Group Preference Reward Shaping
Huaisheng Zhu, Siyuan Xu, Hangfan Zhang, Teng Xiao, Zhimeng Guo, Shijie Zhou, Shuyue Hu, Vasant G. Honavar. -
All-time Safety and Sample-efficient Meta Update for Online Safe Meta Reinforcement Learning under Markov Task Transition
Zhenyuan Yuan, Siyuan Xu, Minghui Zhu.
-
Online Constrained Meta-Learning: Provable Guarantees for Generalization
Siyuan Xu, Minghui Zhu. -
Efficient Gradient Approximation Method for Constrained Bilevel Optimization
Siyuan Xu, Minghui Zhu. -
Federated Reinforcement Learning for Generalizable Motion Planning
Zhenyuan Yuan, Siyuan Xu, Minghui Zhu. -
Secure Perception-Driven Control of Mobile Robots Using Chaotic Encryption
Xu Zhang, Zhenyuan Yuan, Siyuan Xu, Yang Lu, Minghui Zhu. -
Secure Perception-Driven Control of Mobile Robots Using Chaotic Encryption
Xu Zhang, Zhenyuan Yuan, Siyuan Xu, Yang Lu, Minghui Zhu.
-
Meta Value Learning for Fast Policy-Centric Optimal Motion Planning
Siyuan Xu, Minghui Zhu.