https://arxiv.org/abs/2412.14161
1. 연구 목적
이 논문은 “현재의 LLM 기반 에이전트가 실제 회사원이 수행하는 업무를 어느 정도까지 자율적으로 처리할 수 있는가?”를 평가하기 위해 TheAgentCompany라는 벤치마크를 제안한다.
... 반면 실제 직장 업무는 문서를 읽고, 웹 애플리케이션을 탐색하고, 코드를 실행하며, 동료에게 질문하고, 여러 시스템 사이를 오가면서 장시간 작업해야 한다.
벤치마크는 가상의 소프트웨어 스타트업을 배경으로 한다. 에이전트는 인간 직원의 업무용 컴퓨터에 해당하는 Docker 샌드박스에서 작업하며, 브라우저·코드 편집기·Linux 터미널을 사용할 수 있다.
가상 동료는 예를 들어 CTO, 프로젝트 관리자, 소프트웨어 엔지니어, 인사 관리자, 재무 책임자 등이 존재한다.
체크포인트는 단순 실행 여부, 데이터 정확성, 동료와의 협업 등을 확인한다.
대부분은 환경 상태를 검사하는 Python 코드로 결정론적으로 평가하며, 문서 품질처럼 규칙만으로 판단하기 어려운 경우에는 LLM 평가자를 보조적으로 사용한다.
연구진은 미국 노동부의 O*NET 직업 데이터베이스를 참고해 고용 규모와 임금 총액이 큰 직무들을 조사했다. 간호사처럼 물리적 행동이 필수인 직업은 디지털 환경에서 재현하기 어려워 제외했고, 다양한 사무·기술 업무를 함께 포함할 수 있는 소프트웨어 회사를 최종 배경으로 선택했다.
결과를 근거로 “특정 직업 전체가 30% 자동화된다”거나 “어떤 직업이 곧 사라진다”고 해석해서는 안 된다. 이
기반 모델은 Gemini, Claude, GPT-4o, Amazon Nova 같은 폐쇄형 API 모델과 Llama, Qwen 같은 공개 가중치 모델을 포함해 총 12종을 비교했다.
그러나 최고 모델도 업무의 약 70%를 완전히 수행하지 못했다. 또한 Gemini 2.5 Pro는 한 업무에 평균 27단계와 4달러 이상을 사용했다.
같은 GPT-4o를 사용해도 OpenHands는 8.6%, OWL-RolePlay는 4.0%로 큰 차이가 났다. 이는 기반 모델뿐 아니라 에이전트 하니스와 컨텍스트 관리 방식이 성능에 큰 영향을 준다는 뜻이다. 다중 에이전트 구조에서는 하위 브라우징 에이전트가 이전 진행 상황을 이어받지 못하거나, 위임 과정에서 맥락이 손실되는 문제가 나타났다. 반대로 단일 에이전트인 OpenHands는 긴 작업의 일관성을 상대적으로 잘 유지했다.
ownCloud는 가장 어려운 환경이었다. 웹 기반 오피스 도구는 복잡한 UI, 팝업, 문서 편집 기능 때문에 에이전트가 쉽게 막혔다.
흥미롭게도 인간에게 전문성이 높아 보이는 소프트웨어 엔지니어링 업무가, 단순해 보이는 행정·재무 업무보다 에이전트에게 쉬웠다.
코딩은 공개 데이터와 벤치마크가 풍부해 모델 학습과 에이전트 개발이 집중되어 온 반면, 실제 행정·재무 자료는 기업 내부의 비공개 데이터인 경우가 많다.
행정 업무에는 여러 사람에게 정보를 요청하고, 스캔 문서를 해석하고, 스프레드시트를 채우며, 복잡한 UI를 반복 조작하는 과정이 포함된다. 즉 인간이 느끼는 업무 난이도와 AI가 느끼는 난이도는 상당히 다르다.
탐색 실패다. ownCloud의 환영 팝업처럼 인간에게는 사소한 장애물이 에이전트의 전체 작업을 중단시켰다. 텍스트 기반 브라우저는 작은 닫기 버튼을 찾지 못했고, 시각 기반 에이전트는 복잡한 UI에서 엉뚱한 요소를 클릭하는 문제가 있었다.
에이전트가 실패를 인정하고 재계획하기보다, 겉보기에 성공한 상태를 만들어 낼 위험이 있음을 보여준다.
논문에는 몇 가지 중요한 한계도 있다. 업무가 자동 평가 가능하도록 비교적 명확하게 설계되어 있어, 제품 아이디어 발상이나 시스템 아키텍처 설계 같은 창의적이고 모호한 업무는 포함하지 않았다.
실험 비용 때문에 각 모델을 여러 번 반복 실행하지 못해 신뢰구간과 오차 막대도 제공되지 않았다.
Claude 3.5 Sonnet으로 175개 전체 업무를 한 번 실행하는 데 약 1,100달러와 48시간이 필요했다. 따라서 모델의 확률적 변동이 결과에 어느 정도 영향을 미쳤을 가능성이 있다.
TheAgentCompany는 LLM 에이전트의 능력을 단순한 질의응답이나 코딩 시험이 아니라, 회사라는 복잡한 디지털 조직 안에서 장기간 행동하는 능력으로 평가한 벤치마크다. 현재 최고 시스템은 175개 업무 중 약 30%를 완전히 수행하며, 특히 GitLab과 Plane을 활용하는 소프트웨어·프로젝트 관리 업무에서 상대적으로 강하다. 그러나 ownCloud 문서 작업, 재무·행정 업무, 동료와의 협업, 복잡한 웹 UI, 여러 단계의 장기 업무에서는 크게 실패한다.
따라서 이 논문은 “AI가 회사원을 이미 대체할 수 있다”는 주장보다는, AI가 특정 종류의 잘 구조화된 디지털 업무는 자동화할 수 있지만, 조직적 맥락과 사회적 판단, 복잡한 인터페이스를 포함한 일반 업무 자동화에는 아직 큰 간극이 있다는 결론을 제시한다. 동시에 모델 자체뿐 아니라 브라우징 시스템, 메모리, 컨텍스트 유지, 실패 감지, 재계획, 인간과의 협업 구조가 향후 에이전트 성능 향상의 핵심이라는 점을 보여준다.
다음 문제는 여전히 전형적인 CS 문제다.
어떤 상태를 메모리에 저장할 것인가
데이터 정합성을 어떻게 보장할 것인가
권한을 최소화하면서 필요한 행동을 허용할 것인가
실패한 작업을 어디서 재개할 것인가
평가 결과를 어떻게 자동화할 것인가
비용·지연·정확도 사이의 균형을 어떻게 잡을 것인가
“AI가 지금 못하는 작업”이 아니라 AI가 발전해도 인간이 책임져야 하는 위치를 목표로 해야 한다. 대표적으로 다음과 같다.
요구사항과 목표 자체를 정의하는 일
잘못된 최적화를 발견하는 일
위험과 비용을 누가 부담하는지 결정하는 일
시스템 배포를 승인하고 결과에 책임지는 일
기술적 선택을 조직·제품·법적 맥락과 연결하는 일
지향할 포지션은 다음에 더 가깝다.
“AI 에이전트와 기존 소프트웨어를 연결하고, 장기 작업의 상태·평가·권한·비용을 설계하며, 특정 산업 문제를 실제 배포 가능한 시스템으로 완성할 수 있는 엔지니어”