[ICLR 2024] EFFICIENT STREAMING LANGUAGE MODELS WITH ATTENTION SINKS

Becky's Study Lab·2026년 8월 31일

PaperReview

목록 보기
28/28

요즘에 회사에서 agent 쪽 업무를 하면서,,
inference 쪽 관심이 많아졌고 KV cache, paged attention 등 좀 공부를 더 하고 싶어졌다.

그래서 저녁을 먹고 11시까지 공부를 하고 있다.
다행이도 다니느 회사는 포괄이라서 공부를 하고 집에가도 상관이 없다.
눈치 주는 사람도 없고, 남은 업무를 좀 하다 가도 되고 꽤 자유로운 편이다.
근데 오랜만에 논문 읽고 정리하는 걸 해보려고 하니 솔직히 신난다.

오늘은 tokenizer를 뜯어보려고 실제 허깅 페이스에서 gemma4-2B를 가져다가 tokenizer.json을 뜯어서 <bos><eos><turn><pad> 등을 확인하고,, 요즘 Gemini, GPT 모델들의 vocab size도 tokenizer 로 확인해보았다.
아주 재밌다.

📌 오늘의 논문 : (ICLR 2024)EFFICIENT STREAMING LANGUAGE MODELS WITH ATTENTION SINKS


profile
배우고 공부하고 기록하는 것을 멈추지 않는다.

0개의 댓글