Bibliography (6):

  1. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

  2. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

  3. Proximal Policy Optimization Algorithms

  4. https://github.com/ypwang61/One-Shot-RLVR