Diversity-Aware Policy Optimization for Large Language Model Reasoning

Published in NeurIPS, 2025

This work studies the relationship between solution diversity and reasoning potential in LLM reasoning, and proposes a diversity-aware policy optimization method for reinforcement learning training.

Recommended citation: Yao, J., Cheng, R., Wu, X., et al. (2025). "Diversity-Aware Policy Optimization for Large Language Model Reasoning." NeurIPS 2025 Spotlight.
Download Paper