
Review of DeepSeek-v2

Review of MQA

Review of GQA

Review of Linear attention

Review of Roformer, which using RoPE as position embedding

Review of Scaling Laws which shows that the loss mainly depends on number of hyperparmeter, dataset size and compute.