


한 번의 backward() 실행으로 트리 구조로 연결되어 있는 next_functions 들을 모두 역전파
grad 업데이트(파라미터에 적용은 optimizer가 함)


gpu 성능에 제한을 받지 않고 large barch size와 같은 효과를 내기 위해 사용
batch마다 optimizer.zero_grad()를 하지 않고 grad를 정해진 구간만큼 accumulate함
모델을 evaluation 상태로 만듦
= .train(False)

단순히 Inference process에 validation set을 넣으면 됨
일반화 성능 확인 위해 validation 결과를 저장

Keras 코드처럼 짧은 코드로 train, inference 수행(trainer.fit)
생산성 측면에서 유리
충분한 학습 process 이해 이후 사용 권장