Agentic AI는 무엇을 평가해야 할까?

승윤·2026년 7월 19일

ChatGPT와 같은 LLM은 다양한 벤치마크를 통해 성능을 평가받습니다. MMLU, HumanEval, GSM8K처럼 이미 널리 사용되는 평가 지표도 많이 존재합니다.
하지만 최근에는 계획을 세우고, 도구를 사용하며, 스스로 작업을 수행하는 Agentic AI가 등장했습니다.
그렇다면 이러한 Agent는 기존 LLM과 같은 방식으로 평가할 수 있을까요?
이번 글에서는 Agentic AI를 평가하는 방법과 현재 사용되고 있는 대표적인 평가 방식에 대해 알아보겠습니다.

기존 LLM 평가지표의 한계

LLM의 성능 평가 요소는 다음과 같습니다.

  • 정확성(Accuracy): 질문에 올바른 답을 하는가
  • 추론 능력(Reasoning): 단계적인 논리 추론이 가능한가|
  • 코드 생성(Code Generation): 코드를 올바르게 작성하는가
  • 지시 이행(Instruction Following): 사용자의 지시를 정확하게 따르는가
  • 사실성(Factuality): 환각(Hallucination) 없이 사실을 말하는가
  • 대화 품질(Dialogue Quality): 자연스럽고 일관성 있는 대화를 하는가
  • 안전성(Safety): 유해하거나 편향된 답변을 하지 않는가
  • 효율성(Efficiency): 속도, 비용, 토큰 사용량은 적절한가

연관된 대표적인 평가 벤치마크로는 MMLU,HumanEval,GSM8K,TruthfulQA 등이 있습니다.

Question -> LLM -> Answer

이라는 공통점을 가지고 있습니다.
즉, 입력에서 출력까지의 과정만을 평가합니다.

하지만 Agent의 흐름은 다릅니다.

Goal -> Planning -> Action -> Tool Use -> Environment -> Observation -> Re-Planning... -> Task Complete

의 과정을 거치죠

여기서 LLM 평가의 한계가 명확하게 나타납니다

  • 과정 평가 불가
  • Tool 사용 능력 평가 불가
  • 사용자와의 상호작용 평가 불가
  • 장기적인 작업 수행 능력 평가 불가
  • 실패 후 복구 능력 평가 불가

Agent는 무엇을 평가해야 할까?

그렇다면 Agent에 대해서는 무엇을 평가해야 할까요? 단순 정확도를 가지고 Agent의 성능이 좋다고 할 수 있을까요?
Agent의 평가 요소는 다음과 같습니다

  • Task Success: 목표를 달성했는가?
  • Planning: 계획을 잘 세웠는가?
  • Tool Use: 적절한 도구를 사용했는가?
  • Rule Following: 도메인 정책을 잘 지켰는가?
  • Memory: 중간 과정을 기억하는가?
  • Recovery: 실패했을 때 다시 시도하는가? 대안을 찾는가?
  • Efficiency: 목표를 얼마나 적은 시간과 비용, Tool 호출로 달성했는가?
  • Reliability: 다양한 환경에서도 일관되고 안정적으로 목표를 수행하는가?

현재 Agent 평가 지표

현재에도 Agent를 평가하는 다양한 평가 지표가 있습니다

Benchmark평가 대상
SWE-bench실제 GitHub Issue 해결
WebArena웹 브라우저 조작
GAIA범용 문제 해결
τ-benchTool 사용 및 사용자 상호작용
TheAgentCompany실제 회사 업무 수행

한계

Agent 평가에는 중요한 문제가 몇 개 있습니다.

정답이 하나가 아니다

  • 같은 목표를 달성하더라도

    1 -> 2 -> Goal
    1 -> 4 -> 3 -> Goal
    1 -> 6 -> 8 -> 7 -> 4 -> 3 -> Goal

등 여러가지 방법이 존재합니다.

또한 Agent는 실행 환경이 계속 변화하기 때문에 동일한 행동을 수행하더라도 결과가 달라질 수 있습니다. 이러한 비결정적(Non-deterministic) 환경에서는 하나의 정답만으로 성능을 평가하기 어렵다는 문제가 존재합니다.

사람 만족도를 수치화하기 어렵다

  • 실제 사용자는 "좋았다", "빨랐다", "별로였다", "불편했다" 와 같이 평가합니다.

환경이 계속 변한다

  • 오늘 성공하더라도 내일은 실패할수도 있습니다.

비용도 성능이다

  • GPT-5, Claude, Gemini 모두 성공하더라도 Tool 호출 횟수, 시간, 비용 차이가 있다.

Multi-Agent 평가 부족

  • Planner, Worker, Reviewer 각각을 평가할 방법이 없다.

Long-term Memory 평가

  • 며칠, 몇 주동안 기억을 유지하는가는 아직 평가하기 어렵다.

이들이 시사하는 바는 다음과 같습니다.

벤치마크와 실제 서비스 환경은 다르다.
대부분의 벤치마크는 정해진 환경에서 평가되지만, 실제 서비스에서는 예측하지 못한 사용자 행동이나 외부 시스템의 변화가 발생한다. 따라서 벤치마크 성능이 높다고 해서 실제 서비스에서도 동일한 성능을 보장하는 것은 아니다.

마무리

LLM 시대에는 "얼마나 똑똑한가"를 평가했다면,
Agentic AI 시대에는 "실제 업무를 얼마나 안정적으로 수행하는가"를 평가하는 것이 더 중요해지고 있습니다.
앞으로의 Agent 평가는 단순히 성공 여부를 판단하는 것을 넘어, 시간과 비용, 신뢰성, 일관성, 안전성, 사용자 만족도, 그리고 여러 Agent 간 협업 능력까지 함께 고려하는 방향으로 발전할 것으로 보입니다.
결국 Agentic AI의 성능은 단순히 '얼마나 똑똑한가'를 넘어, '얼마나 신뢰할 수 있는 동료처럼 계획하고, 협업하며, 안정적으로 업무를 수행하는가'를 평가하는 방향으로 발전하고 있다고 생각합니다.

profile
컴퓨터공학과 velog

0개의 댓글