modesta.log
로그인
modesta.log
로그인
Agent-as-a-Judge: 서베이 논문 정리
jihyelee
·
2026년 1월 26일
팔로우
2
agent
evaluation
논문리뷰
llm-evaluation
목록 보기
7/7
배경지식
LLM-as-a-Judge
평가자 LLM
을 두고, 다른 LLM의 성능을 평가하는 방법
1) 사람 평가의 시간/비용적 제약과 2) 전통적 평가 방식의 의미적 무감각함(semantic insensitivity) 극복 가능
의미적 무감각함이란, 유의어나 유사한 표현에 대해서 다르게 평가할 수 있음을 의미
예를 들어, 전통적 방식에서는 특정 키워드가 반드시 포함되어야 정답이라고 인식하고 유사한 단어로 동일한 의미를 표현했을 때는 틀렸다고 평가할 가능성이 높음
문제점
LLM-as-a-judge는 아래와 같은 한계를 가짐
1) 모델 파라미터에 저장된 지식에 의거한 평가만 가능함
2) 실제 세상에서의 관찰을 평가에 반영할 수 없음 (수동적)
3) 다면적 평가 기준이 단일한 LLM-as-a-judge에 제공될 경우 인지 부하 발생 가능
해결책
Agent-as-a-Judge
핵심 키워드
탈중앙화
(decentralization)
평가자 LLM의 파라미터 지식 한계를 극복하기 위함
멀티 에이전트, 전문가 지식 반영, 복잡한 평가 목표 서브 태스크로 분할 등
실행
(execution)
실제 세상의 피드백을 반영하고 환각(hallucination)을 줄이기 위함
세세함
(fine-grained)
다면적이고 복잡한 평가 기준을 제대로 평가하기 위함
계획, 메모리 사용 등
분류
단계적
(Procedural) Agent-as-a-Judge
사전에 정의된 에이전틱 워크플로우 활용
반응적
(Reactive) Agent-as-a-Judge
실행 계획을 라우팅하며 외부 도구 혹은 서브 에이전트를 호출하는 등의 결정 내림
단계적 Agent-as-a-Judge보다는 확장되었으나, 여전히 고정된 결정 공간을 가짐
스스로 진화하는
(self-evolving) Agent-as-a-Judge
실시간으로 평가 기준을 생성(synthesize)
배운 지식을 바탕으로 메모리를 업데이트
방법론
멀티 에이전트 협업
집단 합의
여러 다양한 에이전트들이 서로 합의에 이르게끔 함
태스크 분해
서브 태스크로 나눠 특화 에이전트 각각이 평가
계획
워크플로우 오케스트레이션
에이전트가 어떻게 평가할지를 탐색
평가 기준 발굴
에이전트가 무엇을 평가할지를 탐색
도구 통합
증거 수집
실행 결과, 중간 아티팩트 등 평가를 지지할 추가적 증거 수집
정확성 검증
도구를 사용해 평가 정확성 검증
메모리와 개인화
누적, 단계별 평가를 위한 중간 상태를 메모리에 저장
사용자 선호, 평가 기준, 이전 피드백 등 사용자 관련 정보를 메모리에 통합
최적화 패러다임
학습을 통한 최적화 (training-time optimization)
SFT, RL 등을 활용한 평가 최적 LLM 학습
추론을 통한 최적화 (test-time optimization)
프롬프트, 워크플로우, 에이전트 상호작용 등
적용 도메인
일반 도메인: 수학, 코딩, 사실관계 확인, 대화 및 상호작용, 멀티모달 및 비전 등
전문 도메인: 의학, 법, 금융, 교육 등
한계
연산 비용
학습 및 추론에 더 많은 연산 비용이 소모됨
지연시간
(latency)
단계적 추론, 외부 도구 호출, 멀티 에이전트 통신 등 더 긴 지연시간 발생
안전성
외부 시스템 호출로 인한 안전성 이슈 발생 가능
멀티 에이전트 상호작용을 통해 이슈 증식(propagation) 가능
프라이버시
영구(persistent) 메모리 사용시 혹은 개인화된 평가에서 발생 가능
향후 연구 방향
개인화
(Personalization)
언제 사용자의 새로운 선호를 반영하고, 평가 기준을 진화시키고, 오래된 피드백을 삭제할지 평가 Agent가 능동적으로 결정할 수 있어야 함
일반화
(Generalization)
역동적으로 평가 기준을 발굴하고 적용시킬 수 있어야 함
1) 문맥을 이해하는 평가 기준 생성 (context-aware rubric generation)
2) 태스크 난이도에 따른 평가 기준 스케일링 (adaptive multi-granularity scoring)
상호작용성
(Interactivity)
환경의 피드백, 사람의 피드백을 반영하여 발전할 수 있어야 함
최적화
(Optimization)
현재 추론 위주의 연구가 주를 이루나, Agent-as-a-Judge를 학습하는 연구도 필요
1) RL을 활용한 복잡한 에이전틱 행동 양식 내재화
2) 멀티 에이전트 환경을 위한 학습 최적화
참고.
논문 링크
jihyelee
AI (NLP) Graduate Student at Seoul National University. Ex-AI Researcher & Engineer at LG CNS AI Lab | Currently AX Engineer at Samsung Electronics (R&D Campus).
팔로우
이전 포스트
TRUEBench: 실제 생산성 기반의 모델 평가 벤치마크
0개의 댓글
댓글 작성