Bibliography (3):
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
‘AI mode collapse’ directory
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models