Decision Transformer: Reinforcement Learning via Sequence Modeling
What Can Transformers Learn In-Context? A Case Study of Simple Function Classes
Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization
Critical Data Size of Language Models from a Grokking Perspective
Grokking: Generalization Beyond Overfitting On Small Algorithmic Datasets
Scaling Laws vs Model Architectures: How does Inductive Bias Influence Scaling?
Perceiver IO: A General Architecture for Structured Inputs & Outputs