Token classification 와 summarization fine-tuning 를 참고하면서 GPT2를 summarization task에 대해서 fine-tuning하고 있었다. 그러다가 제목과 같은 에러가 발생했다.
토크나이저에 padding=True, runcation=True 매개변수를 추가하라고 나오는데, 아무리 해도 똑같 에러가 계속 발생. 토크나이저를 거치기 전 컬럼들을 제거하는 것이다! dataset의 각 train, validation, test set들에 각각 토크나이저를 적용할 때 다음을 추가해보세요!
remove=[['컬럼1', '컬럼2', ...]]
tokenized_dataset = data.map(preprocess_function, batched=True, remove_columns=['article', 'highlights', 'id'])