
LLM 모델을 로드하기전에 보게되는 파일들이다. 모델마다 조금씩 다르지만 공통적인 파일 위주로 살펴보려고 한다.
모델의 구조에 대해 정의된 파일이다.

bos, eos, temperature, top_k, top_p 등 추론시 사용되는 파라미터들의 기본 값을 저장한 파일이다.
모델의 가중치를 저장한 파일이다. pytorch에서 사용되던 .bin 포맷보다 보안 및 로딩속도를 개선한 포맷이다.

모델이 사용할 스페셜 토큰들에 대한 정보를 저장한 파일이다. 대부분 bos, eos 토큰들이 정의되어 있으며, gemma3와 같은 multimodal 모델의 경우 이미지 처리(ex. <image_soft_token>)를 위한 토큰도 정의되어있다.

모든 스페셜 토큰이 정의되어 있는 파일이다.

tokenizer에 대한 설정과 상태를 정의한 파일이다.
normalizer
정규화방식 정의.
ex) NFC 정규화, 소문자화 등
pre_tokenizer
텍스트를 토큰화하기 전에 처리할 방식 정의.
ex) 공백을 기준으로 분할, Byte 단위로 분할, 정규식 기준으로 분할 등
post_processor
텍스트를 토큰화한 후에 처리할 방식 정의.
ex) 스페셜토큰을 자동으로 추가, ByteLevel 처리 등.
decoder
토큰화된 문자열을 원본 문자열로 복원하는 방식 정의.
ex) Ġ와 같은 바이트 특수 문자들 처리
model
대부분 BPE(Byte-Pair Encoding) 방식의 subword tokenizer이다.
vocab
문자열과 토큰 ID를 매핑해 encode와 decode시 사용.