참고
RAG의 성능을 측정할 때 사용하는 지표로 BLEU와 ROUGE가 있다고 한다.
이에 대해서 이론을 정리하고, 예시를 살펴보자.
BLEU: 예측이 정답과 얼마나 “정확히 같은 n-그램”을 많이 포함했나(정밀도) + 짧으면 패널티.
ROUGE: 정답의 정보가 예측에 얼마나 “회수되었나”(재현율). 구현에 따라 F1도 흔함.
요약하면 BLEU는 ‘정밀도(precision) 중심’, ROUGE는 ‘재현율(recall) 중심’ 지표이다.

목적: 예측 문장이 정답과 얼마나 동일한 n-그램을 많이 포함했는지 평가. 정밀도 중심.
기본 원리:

실무 팁:
목적: 정답의 n-그램이 예측에서 얼마나 회수되었는지 평가. 재현율 중심. 구현에 따라 정밀도·F1도 보고.
대표 변형:
실무 팁:
둘 다 표면 중복에 의존. 동의어·패러프레이즈·사실성 판단에 약함.
한국어는 공백 기반 토큰화가 불안정. 형태소/서브워드 토큰화 일관화 필요.
RAG 평가에는 정확한 근거 회수와 사실성이 중요하므로, BLEU/ROUGE는 참고용으로 두고
아래 예시로 감 잡아보자. (영문 예시를 쓰면 토큰 경계가 명확해서 계산이 쉽다.)
🧑💻 예시 세팅
- 정답(Reference):
the cat is on the mat← 6토큰- 예측 A(Candidate A):
the cat is on mat← 5토큰- 예측 B(Candidate B):
a cat sits on the mat← 6토큰
BLEU는 예측 문장에 들어있는 n-그램이 정답에도 얼마나 많이 포함되었는지(정밀도)를 보고,
예측이 지나치게 짧으면 패널티(Brevity Penalty)를 준다.
🧑💻 1. A에 대한 BLEU-2
the cat, cat is, is on, on mat (4개)the cat, cat is, is on, on the, the mat (5개)the cat, cat is, is on) → 3/4 = 0.75🧑💻 2. B에 대한 BLEU-2
cat, on, the, mat) → 4/6 ≈ 0.667on the, the mat) → 예측 2-그램 5개 중 2/5 = 0.4⭐ 해석: A가 B보다 정밀도가 높고(특히 2-그램), A는 다소 짧지만 BP까지 고려해도 BLEU는 A가 더 높음.
ROUGE-N은 정답의 n-그램이 예측에 얼마나 회수되었는지(재현율)를 본다.
관례적으로 recall을 보고, 구현에 따라 Precision/F1도 함께 계산한다.
🧑💻 1. A에 대한 ROUGE
🧑💻 2. B에 대한 ROUGE
⭐ 해석: A가 정답의 토큰/구문을 더 많이 회수해서 ROUGE도 A가 높음.
ROUGE는 길게 쓰면 recall이 쉬워서 올라갈 수 있지만, 불필요한 군더더기도 함께 들어올 위험이 있어 F1을 같이 보는 경우가 많다 (정밀도 균형).