RAG는 검색(Retrieval)과 생성(Generation)이 합쳐진 시스템이라 둘을 따로 평가할 수도 있고, 전체를 한 번에 평가할 수도 있다. 따라서 평가 방식도 크게 독립 평가와 종단간 평가로 나뉘게 된다. 즉, 검색기만 따로 평가할 것인가 혹은 최종 답변만 볼 것인가의 차이이다.
독립 평가는 검색기와 생성기를 따로 평가하는 방식이다.
검색기(Retriever) 평가지표로는 Recall@K, Precision@K, MRR, nDCG가 주로 사용된다.
다음으로 Generator 독립평가에서는 전통 NLP 지표(BLEU, ROUGE, METEOR) 등을 많이 사용한다. 간혹 RAG 특화 Generator 평가로 Faithfulness(검색 문서에서의 충실성), Answer Relevance(질문과의 관련성), Groundedness(근거 기반성), Correctness(정답성)를 평가하기도 한다.
종단간 평가는 검색과 생성을 따로 평가하는 것이 아니라 최종 답변만을 가지고 평가하는 방식이다. 종단간 평가의 핵심 질문으로는 사용자 질문 해결 여부, 최종 답변 정확성, 출처 기반 답변 여부, 환각 여부, 사용자 만족도 등이 있으며, 실제 사용자 관점 평가에 가깝다고 할 수 있다. 여기서는 정답 일치율(Exact Match), 응답의 유용성, 사실성, 일관성 등을 평가하게 되며, 사람 평가(Human Evaluation)를 함께 병행하는 경우도 많다.
실제 RAG 시스템 평가에서는 둘을 함께 사용하며, RAGAS 프레임워크를 통해 RAG 평가를 자동화한다.
독립 평가는 시스템 내부의 병목이나 약점을 파악하는 데 유용하고, 종단간 평가는 사용자의 실제 경험에 더 가까운 평가 방식이다. 두 방식은 서로 보완적이며, RAG 시스템을 고도화하기 위해서는 둘 다 적절히 활용하는 것이 중요하다.