Publications
2026
- Evaluating Language Model Pluralism through In-the-wild Crowd Discussions
Gagan Mundada, Rohan Surana, Nandhini Swaminathan, Bodhisattwa Prasad Majumder, Junda Wu, Julian McAuley, Zhouhang Xie
ACL 2026 (main)
paper
- Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization (MISP-DPO)
Xintong Li, Chuhan Wang, Junda Wu, Rohan Surana, Tong Yu, Julian McAuley, Jingbo Shang
International Conference on Learning Representations (ICLR 2026)
- MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
Rohan Surana*, Amit Namburi*, Gagan Mundada*, Abhay Lal*, Zachary Novack, Julian McAuley, Junda Wu
International Conference on Acoustics Speech and Signal Processing (ICASSP 2026)
paper
- WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
Gagan Mundada*, Zihan Huang*, Rohan Surana*, Sheldon Yu, Jennifer Yuntong Zhang, Xintong Li, Tong Yu, Lina Yao, Jingbo Shang, Julian McAuley, Junda Wu
International Conference on Machine Learning (ICML 2026)
paper
- From Reviews to Dialogues: Active Synthesis for Zero-Shot LLM-based Conversational Recommender System
Rohan Surana*, J. Wu*, Z. Xie*, Y. Xia, H. Steck, D. Liang, N. Kallus, J. McAuley
EMNLP 2026 (Findings)
paper
2025
- In-context Ranking Preference Optimization (IRPO)
Junda Wu*, Rohan Surana*, Zhouhang Xie, Yiran Shen, Yu Xia, Tong Yu, Ryan A Rossi, Prithviraj Ammanabrolu, Julian McAuley
Conference on Language Modeling (COLM 2025)
paper
- Traceable and Explainable Multimodal Large Language Models: An Information-Theoretic View
Zihan Huang, Junda Wu, Rohan Surana, Raghav Jain, Tong Yu, Raghavendra Addanki, David Arbour, Sungchul Kim, Julian McAuley
Conference on Language Modeling (COLM 2025)
paper
- Image Difference Captioning via Adversarial Preference Optimization
Zihan Huang, Junda Wu, Rohan Surana, Tong Yu, David Arbour, Ritwik Sinha, Julian McAuley
EMNLP 2025
paper
Under Review / Survey
- RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts
Y. Xiong, X. Jiang, Rohan Surana, X. Li, S. Yu, N. L. Kuang, R. A. Rossi, J. Shang, T. Yu, J. McAuley, J. Wu
Preprint
paper
- Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering
S. Yu, T. Yu, X. Jiang, Rohan Surana, G. Mundada, S. Kim, L. Yao, J. McAuley, J. Wu
Preprint
paper
- MASS-DPO: Multi-Negative Active Sample Selection for Direct Policy Optimization
Rohan Surana*, X. Li, S. Yu, Y. J. Shen, C. Wang, T. Yu, P. Ammanabrolu, J. Shang, J. McAuley, J. Wu
Under Review
paper
- F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking
Rohan Surana, G. Mundada, J. Wu, X. Li, Y. Jiao, B. Jin, S. Zhou, T. Yu, R. Sinha, J. Han, J. Shang, J. McAuley
Under Review
paper
- Skill-R1: Agent Skill Evolution via Reinforcement Learning
Y. Vishe, Rohan Surana, X. Jiang, Z. Huang, X. Li, N. L. Kuang, T. Yu, R. A. Rossi, J. Shang, J. McAuley, J. Wu
Under Review
paper
- Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck
Z. Huang, J. Wu, T. Yu, Q. Yan, Rohan Surana, U. Bhattacharya, L. Yao, X. E. Wang, J. McAuley
Under Review
paper
- From Verifiable Rewards to Policy Learning: A Survey of Reinforcement Learning from Verifiable Rewards
G. Mundada*, Rohan Surana*, S. Yu, J. Y. Zhang, Z. Huang, Y. Xiong, X. Li, Y. Xia, R. Jain, C. Huang, N. L. Kuang, T. Yu, R. A. Rossi, D. Zhou, L. Yao, J. Shang, J. McAuley, J. Wu
Survey Paper
- Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning
Rohan Surana*, G. Mundada*, X. Jiang*, C. Wang*, Z. Tang, D. Jiao, Z. Huang, Y. Xiong, J. Wu, S. Yu, X. Li, R. Jain, N. Kuang, S. Zhou, B. Jin, Z. Chu, T. Yu, R. A. Rossi, K.-H. Huang, J. Shang, J. Han, J. McAuley
Survey Paper
paper
- AMPS: Adaptive Modality Preference Steering via Functional Entropy
Z. Huang, X. Li, Rohan Surana, T. Yu, R. Wang, J. McAuley, J. Shang, J. Wu
Under Review
paper