Bibliography (3):

  1. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

  2. ‘AI mode collapse’ directory

  3. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models