ORAK: A FOUNDATIONAL BENCHMARK FOR TRAINING AND EVALUATING LLM AGENTS ON DIVERSE VIDEO GAMES

lit·2025년 11월 16일

느낀점

  • 게임 MCP를 통해 평가 파이프라인과 재현 가능한 연구 흥미로움
  • 게임 파인튜닝이 수학 성능 향상을 도모하는 점이 식니함
  • 파인튜닝 데이터셋 필요, 4o가 가장 잘하는 모델이 아닌데 베이스로 설정한 이유 궁금
  • 수학 점수는 오르는데 다른 점수(창의성?, 글쓰기)등이 떨어지는지 궁금함

Abstract

LLM 에이전트는 지능적이고 인간이 선호하는 캐릭터를 가능하게 하여 게임 산업을 재편하고 있습니다.
그러나 현재의 게임 벤치마크는 실제 요구에 미치지 못합니다.
다양한 게임 장르에 걸친 LLM의 다양한 능력에 대한 평가, 복잡한 게임 플레이에 중요한 에이전트 모듈에 대한 연구, 그리고 사전 훈련된 LLM을 게이밍 에이전트로 적응시키기 위한 파인튜닝 데이터셋이 부족합니다.

이러한 격차를 해소하기 위해 모든 주요 장르를 아우르는 12개의 인기 비디오 게임에서 LLM 에이전트를 훈련하고 평가하기 위한 벤치마크인 Orak을 제시합니다.
MCP을 기반으로 구축된 플러그 앤 플레이 인터페이스를 사용하여, Orak은 다양한 게임 시나리오에서 에이전트 모듈에 대한 체계적이고 재현 가능한 연구를 지원합니다.

나아가 여러 장르를 포괄하는 전문가 LLM 게임 플레이 궤적의 파인튜닝 데이터셋을 공개하여, 일반 LLM을 효과적인 게임 에이전트로 전환합니다.
Orak은 게임 리더보드, LLM 배틀 아레나, 그리고 입력 양식, 에이전트 전략, 파인튜닝 효과에 대한 심층 분석을 포함하는 통합 평가 프레임워크를 제공하며, 다재다능한 게이밍 에이전트를 향한 기반을 마련합니다.

INTRODUCTION

'Orak'이라는 새로운 LLM 에이전트 평가 벤치마크를 소개하고 있습니다.

"LLM이 얼마나 비디오 게임을 잘하는지, 게임을 통해 얼마나 '지능적인 에이전트'처럼 행동하는지 시험지"를 만든 것입니다.

1.벤치마크가 필요한 이유? (기존 문제점)

① 단순한 환경: 대부분 텍스트 기반 게임이나 단순한 2D 격자 게임을 사용했습니다. (예: '진짜' 비디오 게임이 아님)

② 핵심 능력 평가 부족: LLM 에이전트의 핵심 능력인 memory, self-reflection, tool use 등을 제대로 평가하기 어려웠습니다.

③ 데이터 부족: LLM을 '게임 전문 에이전트'로 만들기 위한 파인튜닝 데이터셋이 없었습니다.

2.'Orak' 벤치마크의 주요 특징

12개의 '진짜' 비디오 게임 사용

스트리트 파이터, 슈퍼 마리오, 마인크래프트, 스타크래프트 2, 포켓몬 레드 등 실제로 수백만 명이 플레이하는 6개 장르의 유명 게임들로 구성됩니다.

액션 게임의 '세밀한 컨트롤', 어드벤처 게임의 '장기 기억', 전략 게임의 '복잡한 논리 및 계획' 등 LLM의 다양한 능력을 종합적으로 평가할 수 있습니다.

유연한 'plug-and-play' 인터페이스 (MCP)

LLM이 게임 환경이나 '자기 성찰', '계획' 같은 에이전트 기능들과 쉽게 상호작용할 수 있도록 설계되었습니다.

LLM 입장에서는 이 모든 기능이 호출 가능한 'tool'처럼 보이게 하여, 평가와 개발이 용이하도록 했습니다.

파인튜닝 데이터셋 제공

GPT-4o 같은 고성능 LLM이 Orak의 모든 게임을 플레이한 '모범 답안' 데이터셋을 함께 공개했습니다.

단순히 게임을 깨는 방법이 아니라, "게임을 어떻게 전략적으로 접근하고 언제 어떤 에이전트 능력을 사용해야 하는지"에 대한 'meta-knowledge'을 담고 있습니다.

3.주요 실험 결과

  • 독점 LLM의 우위: GPT-4o 같은 고성능 독점 LLM이 오픈소스 LLM보다 게임 전반에서 월등히 뛰어난 성능을 보였습니다.

  • 파인튜닝의 놀라운 효과: Orak 데이터셋으로 파인튜닝된 소형 LLM은 게임 실력이 크게 향상되었습니다.

  • 지식의 일반화:

    • 파인튜닝의 효과는 단순히 그 게임을 잘하게 되는 데 그치지 않았습니다.

    • 학습한 '게임 전략' 지식이 아예 처음 보는 다른 게임이나 심지어 수학 문제 풀이나 웹 브라우징 같은 게임이 아닌 작업에서도 성능 향상을 이끌어 냈습니다.

    • LLM이 '게임을 하는 법'이 아니라 '복잡한 문제를 전략적으로 접근하고 해결하는 법' 자체를 학습한 것입니다.

  • 시각 정보의 한계: 현재로서는 게임 화면을 visual state 것이 텍스트 정보만 받는 것보다 오히려 LLM의 성능에 방해가 되는 경우가 많았습니다.

ORAK

Orak이란?
"LLM 에이전트"를 위한 게임 벤치마크입니다.

단순히 글을 잘 쓰는지 보는 것이 아니라 LLM이 게임 속에서 '에이전트'로서 관찰하고, 생각하고, 행동하는 전반적인 능력을 평가합니다.

'Plug-and-play' 방식이 특징입니다.
평가 파이프라인(Orak)에 (A) 게임, (B) LLM 모델 (예: GPT-4, Qwen 등), (C) 에이전트 전략 (어떻게 생각하고 행동할지)을 쉽게 갈아 끼우면서 테스트할 수 있습니다.

LLM의 어떤 능력을 평가하나요?
Orak은 게임을 플레이하기 위해 LLM에게 필요한 7가지 핵심 능력을 정의하고 각 게임이 이 능력들을 얼마나 요구하는지 측정합니다. (1~3점으로 점수화)

  • 규칙 준수: 게임의 규칙을 얼마나 잘 따라야 하는가? (예: 5개 이상 규칙은 3점)

  • 논리적 추론: 행동을 결정하기 위해 몇 단계의 추론이 필요한가? (예: 3단계 이상은 3점)

  • 공간 추론: 공간적 이해(위치, 거리 등)가 얼마나 중요한가?

  • 장문 이해: 긴 스토리나 대화(500단어 이상)를 이해해야 하는가?

  • 장기 계획: 3단계 이상의 순차적인 계획이 필수적인가?

  • 오류 처리: 잘못된 행동 시, 몇 단계나 되돌아가서 다시 계획해야 하는가?

  • 확률 처리: 게임 내 무작위성(운)을 이해하고 대처해야 하는가?

예를 들어, 스트리트 파이터 같은 액션 게임은 '공간 추론'과 '규칙 준수'가 중요한 반면, 역전재판 같은 어드벤처 게임은 '장문 이해'와 '논리적 추론'이 훨씬 중요합니다.

FINE-TUNING: ALIGNING PRE-TRAINED LLMS INTO GAME AGENTS

GPT-4o, o3-mini와 같은 전문가 LLM이 여러 에이전트 모듈을 사용하여 Orak의 12개 게임을 모두 플레이하는 것으로부터 파인튜닝 데이터셋을 수집합니다.
환경 상호작용 궤적을 포함하는 이 데이터셋은 다양한 게임 장르를 해결하기 위해 에이전트 전략을 사용하는 방법에 대한 메타 지식을 담고 있습니다.

데이터 형식.

LLM의 게임플레이 궤적을 T=τ1,...,τTT = {\tau_1, . . . , \tau_T}로 표기합니다.
여기서 TT는 총 게임 단계 수이며 τt\tau_ttt번째 게임 단계에서 에이전트 전략에 의해 실행된 LLM 추론 시퀀스를 나타냅니다.
각 LLM 추론 시퀀스 τ\tauτ={(Xai,S,Yai)}i=1n\tau = \{(X_{a_i}, S, Y_{a_i})\}_{i=1}^n로 표현됩니다.
여기서 ai‘reflection’, ‘planning’, . . . , ‘action’a_i \in {\text{‘reflection’, ‘planning’, . . . , ‘action’}}은 시퀀스의 ii번째 에이전트 모듈이고, XaX_a는 에이전트 모듈 aa를 위한 프롬프트, SS는 게임 상태, YaY_a는 LLM의 해당 응답입니다.

데이터 선택.

Orak의 각 게임에 대해 수집된 모든 TT에서 1000개 이상의 LLM 추론 시퀀스 τ\tau를 확보할 때까지 전문가 LLM의 게임플레이 궤적을 수집합니다.
고품질 데이터를 보장하기 위해 수집된 TT를 게임 점수 기준으로 정렬하고 선택된 τ\tau의 수가 300개를 초과할 때까지 가장 높은 게임 점수를 가진 궤적을 선택합니다.
선택된 모든 궤적은 '성찰-계획-행동' 시퀀스를 따르므로 각 에이전트 모듈에 대해 약 300개의 샘플을 확보하게 됩니다.
12개 게임 모두에 대해 데이터 선택을 수행함으로써 파인튜닝 세트는 약 11,000개의 샘플로 구성됩니다.

데이터 증강.

언어적 다양성을 향상시키기 위해 패러프레이징을 통해 각 데이터 샘플 τ\tau를 증강합니다.
GPT-4o에 모든 게임 관련 정보를 보존하면서 게임 프롬프트 XaX_a를 다른 방식으로 표현하도록 요청하여,각 샘플 τ\tau당 10개의 증강된 샘플을 생성합니다.
파인튜닝 데이터셋은 SFT을 위한 것입니다.

EXPERIMENT

전반적인 게임 플레이 성능
결론: 상용 모델이 오픈소스 모델보다 전반적으로 훨씬 뛰어났습니다.

종합 1등: Gemini-2.5-pro (12개 게임 중 5개에서 1위)

2등 그룹: GPT-5 / GPT-4o

오픈소스 모델: 8B 미만의 소형 모델들은 복잡한 게임(마인크래프트, 스타듀 밸리 등)에서 거의 점수를 내지 못했습니다.
70B급의 대형 모델도 상용 모델에는 미치지 못했습니다.

1:1 대전 (LLM Arena)
두 모델이 직접 경쟁하는 게임에서의 결과입니다.

스트리트 파이터 III: 놀랍게도 오픈소스인 Minitron-8B가 다른 모든 모델을 이기고 1위를 차지했습니다.

스타크래프트 II: Claude-3.7-Sonnet이 1위를 차지했습니다.

에이전트 전략의 효과
'그냥' 행동하게(zero-shot) 하는 것과 '생각-계획-행동' (reflection-planning)처럼 복잡한 전략을 쓰게 하는 것을 비교했습니다.

GPT-4o (고성능 모델): '반성-계획' 같은 복잡한 전략을 사용할수록 성능이 꾸준히 향상되었습니다.

LLaMA-3.2-3B (소형 모델): 전략이 복잡해지자(예: '반성-계획') 오히려 성능이 떨어졌습니다. 가장 단순한 전략 중 하나인 '반성'만 사용했을 때 최고 성능이 나왔습니다.

시사점: 모델의 기본 성능(체급)에 따라 최적의 에이전트 전략이 다릅니다. 저성능 모델에 복잡한 프롬프트를 주면 오히려 혼란스러워할 수 있습니다.

시각 정보(이미지)의 효과
텍스트(게임 상태)만 주는 것, 이미지만 주는 것, 둘 다 주는 것을 비교했습니다.

이미지 전용: 성능이 모든 모델에서 크게 하락했습니다.

텍스트 + 이미지 (멀티모달): 결과가 엇갈렸습니다.

긍정적: 스트리트 파이터처럼 시각적 디테일이 중요한 게임에서는 성능이 향상되었습니다. (Claude 점수 16.6% 상승)

부정적: Ace Attorney(역전재판)처럼 텍스트와 내러티브가 중요한 게임에서는 오히려 성능이 하락했습니다. (GPT-4o 점수 31.8% 하락)

파인튜닝의 효과
LLM을 게임 플레이 데이터로 파인튜닝했을 때의 효과입니다.

Intra-game (게임 내 일반화): LLaMA 모델을 튜닝했더니, 같은 게임의 처음 보는 시나리오에서도 더 나은 성능을 보였습니다. (유효한 행동을 생성하는 능력이 향상됨)

OOD-game (다른 게임 일반화): 10개의 게임으로 학습했더니, 아예 처음 보는 다른 2개의 게임에서도 성능이 향상되었습니다. '반성'이나 '계획' 같은 의사결정 루틴 자체가 학습된 것으로 보입니다.

Non-game (게임 외 일반화): 가장 흥미로운 결과입니다.

LLaMA-3.2-3B 모델을 게임 플레이 데이터로만 파인튜닝했는데, 수학(Math500) 및 웹 탐색(WebShop) 벤치마크 점수가 향상되었습니다. (특히 WebShop에서는 0점이던 것이 8~12%로 상승)

시사점: 게임을 통해 학습된 '의사결정 능력'이 게임과 관련 없는 다른 작업(수학, 웹 탐색)으로 전이될 수 있음을 보여줍니다.

2048

AI마다 실력 차이가 엄청났다
대부분의 AI (Llama, Qwen 등): 게임을 아예 못 했습니다. 규칙을 이해하지 못하고, 그냥 한쪽 방향으로만 계속 움직이다가 게임이 끝나버렸습니다.

GPT-4o, Gemini-2.5-pro 등: 게임을 하긴 했지만, 전략이 없었습니다. 그냥 마구잡이로 움직이는 '랜덤' 플레이와 거의 비슷했습니다.

똑똑한 AI (o3, o3-mini 등): 이 모델들은 꽤 잘했습니다. o3 모델은 1024 타일까지 만들기도 했습니다.

놀라운 발견: 똑똑한 AI(o3)는 '큰 숫자를 구석에 몰아라' 같은 공략법을 따로 알려주지 않았는데도, 스스로 게임을 하면서 인간과 비슷한 전략을 터득했습니다.

'생각하는 기능'을 추가했더니 오히려 방해가 됐다?

AI에게 '반성'(과거의 수를 복기)이나 '계획'(다음 수를 예측) 같은 기능을 추가하는 실험을 했습니다.

원래 못하던 AI(Llama, GPT-4o)는 이 기능을 줘도 여전히 못했습니다.

반면, 원래 잘하던 AI(o3-mini)는 이 기능을 주자 오히려 성능이 더 나빠졌습니다.

이유 (추측): 똑똑한 AI는 이미 내부적으로 스스로 생각하고 계획하고 있는데, 밖에서 "자 이제부터 생각해!"라고 명령하니 오히려 혼란을 주거나 방해가 된 것으로 보입니다.

글자 vs. 그림, AI마다 잘하는 게 달랐다

게임판의 현재 상태를 '텍스트'(숫자 배열)로 줄 때와 '스크린샷'(그림)으로 줄 때를 비교했습니다.

GPT-4o: 그림보다 텍스트로 줬을 때 더 잘했습니다.

Gemini, Claude: 텍스트보다 그림으로 줬을 때 더 잘했습니다.

결론: AI 모델마다 텍스트 이해를 더 잘하는 모델이 있고, 시각적인(그림) 이해를 더 잘하는 모델이 있다는 것을 확인했습니다.

profile
AI Researcher

0개의 댓글