Agent-as-a-Judge: 서베이 논문 정리

jihyelee·2026년 1월 26일

llm-evaluation

목록 보기
7/7

배경지식

  • LLM-as-a-Judge
    • 평가자 LLM을 두고, 다른 LLM의 성능을 평가하는 방법
    • 1) 사람 평가의 시간/비용적 제약과 2) 전통적 평가 방식의 의미적 무감각함(semantic insensitivity) 극복 가능
      • 의미적 무감각함이란, 유의어나 유사한 표현에 대해서 다르게 평가할 수 있음을 의미
      • 예를 들어, 전통적 방식에서는 특정 키워드가 반드시 포함되어야 정답이라고 인식하고 유사한 단어로 동일한 의미를 표현했을 때는 틀렸다고 평가할 가능성이 높음

문제점

  • LLM-as-a-judge는 아래와 같은 한계를 가짐
    • 1) 모델 파라미터에 저장된 지식에 의거한 평가만 가능함
    • 2) 실제 세상에서의 관찰을 평가에 반영할 수 없음 (수동적)
    • 3) 다면적 평가 기준이 단일한 LLM-as-a-judge에 제공될 경우 인지 부하 발생 가능

해결책

Agent-as-a-Judge

핵심 키워드

  • 탈중앙화 (decentralization)
    • 평가자 LLM의 파라미터 지식 한계를 극복하기 위함
    • 멀티 에이전트, 전문가 지식 반영, 복잡한 평가 목표 서브 태스크로 분할 등
  • 실행 (execution)
    • 실제 세상의 피드백을 반영하고 환각(hallucination)을 줄이기 위함
  • 세세함 (fine-grained)
    • 다면적이고 복잡한 평가 기준을 제대로 평가하기 위함
    • 계획, 메모리 사용 등

분류

  • 단계적 (Procedural) Agent-as-a-Judge
    • 사전에 정의된 에이전틱 워크플로우 활용
  • 반응적 (Reactive) Agent-as-a-Judge
    • 실행 계획을 라우팅하며 외부 도구 혹은 서브 에이전트를 호출하는 등의 결정 내림
    • 단계적 Agent-as-a-Judge보다는 확장되었으나, 여전히 고정된 결정 공간을 가짐
  • 스스로 진화하는 (self-evolving) Agent-as-a-Judge
    • 실시간으로 평가 기준을 생성(synthesize)
    • 배운 지식을 바탕으로 메모리를 업데이트

방법론

  • 멀티 에이전트 협업
    • 집단 합의
      • 여러 다양한 에이전트들이 서로 합의에 이르게끔 함
    • 태스크 분해
      • 서브 태스크로 나눠 특화 에이전트 각각이 평가
  • 계획
    • 워크플로우 오케스트레이션
      • 에이전트가 어떻게 평가할지를 탐색
    • 평가 기준 발굴
      • 에이전트가 무엇을 평가할지를 탐색
  • 도구 통합
    • 증거 수집
      • 실행 결과, 중간 아티팩트 등 평가를 지지할 추가적 증거 수집
    • 정확성 검증
      • 도구를 사용해 평가 정확성 검증
  • 메모리와 개인화
    • 누적, 단계별 평가를 위한 중간 상태를 메모리에 저장
    • 사용자 선호, 평가 기준, 이전 피드백 등 사용자 관련 정보를 메모리에 통합
  • 최적화 패러다임
    • 학습을 통한 최적화 (training-time optimization)
      • SFT, RL 등을 활용한 평가 최적 LLM 학습
    • 추론을 통한 최적화 (test-time optimization)
      • 프롬프트, 워크플로우, 에이전트 상호작용 등

적용 도메인

  • 일반 도메인: 수학, 코딩, 사실관계 확인, 대화 및 상호작용, 멀티모달 및 비전 등
  • 전문 도메인: 의학, 법, 금융, 교육 등

한계

  • 연산 비용
    • 학습 및 추론에 더 많은 연산 비용이 소모됨
  • 지연시간 (latency)
    • 단계적 추론, 외부 도구 호출, 멀티 에이전트 통신 등 더 긴 지연시간 발생
  • 안전성
    • 외부 시스템 호출로 인한 안전성 이슈 발생 가능
    • 멀티 에이전트 상호작용을 통해 이슈 증식(propagation) 가능
  • 프라이버시
    • 영구(persistent) 메모리 사용시 혹은 개인화된 평가에서 발생 가능

향후 연구 방향

  • 개인화 (Personalization)
    • 언제 사용자의 새로운 선호를 반영하고, 평가 기준을 진화시키고, 오래된 피드백을 삭제할지 평가 Agent가 능동적으로 결정할 수 있어야 함
  • 일반화 (Generalization)
    • 역동적으로 평가 기준을 발굴하고 적용시킬 수 있어야 함
    • 1) 문맥을 이해하는 평가 기준 생성 (context-aware rubric generation)
    • 2) 태스크 난이도에 따른 평가 기준 스케일링 (adaptive multi-granularity scoring)
  • 상호작용성 (Interactivity)
    • 환경의 피드백, 사람의 피드백을 반영하여 발전할 수 있어야 함
  • 최적화 (Optimization)
    • 현재 추론 위주의 연구가 주를 이루나, Agent-as-a-Judge를 학습하는 연구도 필요
    • 1) RL을 활용한 복잡한 에이전틱 행동 양식 내재화
    • 2) 멀티 에이전트 환경을 위한 학습 최적화

참고. 논문 링크

profile
AI (NLP) Graduate Student at Seoul National University. Ex-AI Researcher & Engineer at LG CNS AI Lab | Currently AX Engineer at Samsung Electronics (R&D Campus).

0개의 댓글