ChatGPT와 같은 LLM은 다양한 벤치마크를 통해 성능을 평가받습니다. MMLU, HumanEval, GSM8K처럼 이미 널리 사용되는 평가 지표도 많이 존재합니다.
하지만 최근에는 계획을 세우고, 도구를 사용하며, 스스로 작업을 수행하는 Agentic AI가 등장했습니다.
그렇다면 이러한 Agent는 기존 LLM과 같은 방식으로 평가할 수 있을까요?
이번 글에서는 Agentic AI를 평가하는 방법과 현재 사용되고 있는 대표적인 평가 방식에 대해 알아보겠습니다.
LLM의 성능 평가 요소는 다음과 같습니다.
연관된 대표적인 평가 벤치마크로는 MMLU,HumanEval,GSM8K,TruthfulQA 등이 있습니다.
Question -> LLM -> Answer
이라는 공통점을 가지고 있습니다.
즉, 입력에서 출력까지의 과정만을 평가합니다.
하지만 Agent의 흐름은 다릅니다.
Goal -> Planning -> Action -> Tool Use -> Environment -> Observation -> Re-Planning... -> Task Complete
의 과정을 거치죠
여기서 LLM 평가의 한계가 명확하게 나타납니다
그렇다면 Agent에 대해서는 무엇을 평가해야 할까요? 단순 정확도를 가지고 Agent의 성능이 좋다고 할 수 있을까요?
Agent의 평가 요소는 다음과 같습니다
현재에도 Agent를 평가하는 다양한 평가 지표가 있습니다
| Benchmark | 평가 대상 |
|---|---|
| SWE-bench | 실제 GitHub Issue 해결 |
| WebArena | 웹 브라우저 조작 |
| GAIA | 범용 문제 해결 |
| τ-bench | Tool 사용 및 사용자 상호작용 |
| TheAgentCompany | 실제 회사 업무 수행 |
Agent 평가에는 중요한 문제가 몇 개 있습니다.
정답이 하나가 아니다
1 -> 2 -> Goal
1 -> 4 -> 3 -> Goal
1 -> 6 -> 8 -> 7 -> 4 -> 3 -> Goal
등 여러가지 방법이 존재합니다.
또한 Agent는 실행 환경이 계속 변화하기 때문에 동일한 행동을 수행하더라도 결과가 달라질 수 있습니다. 이러한 비결정적(Non-deterministic) 환경에서는 하나의 정답만으로 성능을 평가하기 어렵다는 문제가 존재합니다.
사람 만족도를 수치화하기 어렵다
환경이 계속 변한다
비용도 성능이다
Multi-Agent 평가 부족
Long-term Memory 평가
이들이 시사하는 바는 다음과 같습니다.
벤치마크와 실제 서비스 환경은 다르다.
대부분의 벤치마크는 정해진 환경에서 평가되지만, 실제 서비스에서는 예측하지 못한 사용자 행동이나 외부 시스템의 변화가 발생한다. 따라서 벤치마크 성능이 높다고 해서 실제 서비스에서도 동일한 성능을 보장하는 것은 아니다.
LLM 시대에는 "얼마나 똑똑한가"를 평가했다면,
Agentic AI 시대에는 "실제 업무를 얼마나 안정적으로 수행하는가"를 평가하는 것이 더 중요해지고 있습니다.
앞으로의 Agent 평가는 단순히 성공 여부를 판단하는 것을 넘어, 시간과 비용, 신뢰성, 일관성, 안전성, 사용자 만족도, 그리고 여러 Agent 간 협업 능력까지 함께 고려하는 방향으로 발전할 것으로 보입니다.
결국 Agentic AI의 성능은 단순히 '얼마나 똑똑한가'를 넘어, '얼마나 신뢰할 수 있는 동료처럼 계획하고, 협업하며, 안정적으로 업무를 수행하는가'를 평가하는 방향으로 발전하고 있다고 생각합니다.