논문 리뷰

1.[논문 리뷰] DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

post-thumbnail

2.[논문 리뷰] Fast Transformer Decoding: One Write-Head is All You Need

post-thumbnail

3.[논문 리뷰] GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

post-thumbnail

4.[논문 리뷰] Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention

post-thumbnail

5.[논문 리뷰] ROFORMER: Enhanced Transformer with Rotary Position Embedding

post-thumbnail

6.[논문 리뷰] Scaling Laws for Neural Language Models

post-thumbnail