Diversity-Aware Policy Optimization for Large Language Model Reasoning
Published in NeurIPS, 2025
This work studies the relationship between solution diversity and reasoning potential in LLM reasoning, and proposes a diversity-aware policy optimization method for reinforcement learning training.
Recommended citation: Yao, J., Cheng, R., Wu, X., et al. (2025). "Diversity-Aware Policy Optimization for Large Language Model Reasoning." NeurIPS 2025 Spotlight.
Download Paper
