MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making (2024)

J.·2025년 9월 30일

Text & Speech Papers

목록 보기
10/12

✔ Basic Info

📌 MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making(2024)
🔗 https://arxiv.org/pdf/2404.15155

☑️Sum-up

  • 의료 분야에서 LLM 을 어떻게 효율적으로 협업에 활용할 수 있을지 다룸
  • LLM 단독 적용 한계 존재 → MDAgents (Medical Decision-making Agents) 적응형 멀티 에이전트 협업 프레임워크 제안
  • 의료 의사결정 모방 - 협업 구조를 가지고 있고, 주어진 의료 문제의 복잡도에 따라 팀 배정 및 문제 해결 절차 조정
  • 최신 LLM들과 실제 의료 지식 및 진단 벤치마크 기반 실험 결과
    • 의사보다 높은 정확도 보인 경우도 있었음
    • 의료지식 + 멀티모달 추론 능력 통합 가능성
    • 기존 방법론보다 최대 4.2% 성능 향상, 모더레이터 (중재자 역할) 리뷰 및 외부 의료 지식 도입시 정확도 평균 11.8% 향상

☑️Pre-Knowledge : MAS 의 등장 배경

LLM 은 창작 글쓰기, 추론, 의사결정 같은 고난도 과업 수행 가능한 수준까지 발전을 했으며 어느정도 인간 수준에 필적할 성능을 보임

그러나 아직 고유의 한계를 보임

  • 환각 (Hallucination)
  • 자기회귀적 특성
    • 이전까지 생성된 단어들을 기반으로 다음 단어 하나씩 예측하는데, 이는 긴 문장을 생성할수록 연산량이 폭발적으로 증가하여 대화형 챗봇처럼 실시간 반응성이 필요한 시스템에서는 느린 속도의 문제
  • 스케일링 법칙 제약
    • LLM 성능은 모델 크기, 학습 데이터 양, 컴퓨팅 자원에 따라 비례하는 것이 일반적
    • 그러나 일정 수준을 넘어서면 성능 향상 둔화 → 거대한 컴퓨팅 자원에도 불구하고 얻을 수 있는 이익 제한적
    • 이것이 MAS (Multi Agent System) 등장 배경 - Task 에 따라 LLM 이 나눠서 작동하기 때문에 자원 아낄 수 있다

Agentic LLM

  • LLM 을 두뇌, 혹은 구조 구성하는 책임자 역할을 하게 함
  • 외부 도구 및 계획을 통합해서 LLM 기반 에이전트가 행동하고 복잡한 문제를 풀어 외부 환경과 상호작용하고 학습하게 만듦
  • 다중 에이전트 시스템 (MAS) 가 협업하여 다단계 과제를 해결하는 구조 제안

✅Introduction

📌 문제점

  • 의료 의사결정 (Medical Decision-Making)은 복잡하고 다단계적 과정
  • 의사는 다양한 출처 정보를 빠르게 해석해야 하며 다양한 의료 데이터 (영상, 생체신호, 전자의무기록) 을 종합해 결정을 내려야 함
  • 최근 LLM은 의료 데이터 분석과 진단 대화, 인과적 추론 보조 툴로 좋은 성능을 가지긴 함
  • 그러나 실제 복잡한 임상 상황 적용에는 어려움 존재

📌 해결점

실제 임상에서 의사들이 여러 단계 거쳐 의사결정 하는 구조 본떠서 LLM 을 복잡도에 따라 배치하고 협업하게 함

✅ 프레임워크

  • 의료 문제 복잡도 분류 (Complexity Check)
  • 복잡도에 따라 에이전트 구성 (Recruitment)
  • 분석 및 합성 (Analysis and Synthesis)
  • 최종 결정 (Final Decision)

📌 기여점

  1. 세계 최초로 실제 의료 판단 방식 반영해 LLM 협업 시스템 제안
  2. 단일 모델 or 단순 그룹 방식보다 멀티에이전트 협업 방식이 우수 성능. 10개 벤치마크 중 7개에서 최고 성능 입증. 에이전트 수 조절하면서 성능과 효율성 사이 효과적 트레이드오프 달성
  3. MDAgents 가 기존 단일 및 그룹 방법보다 뛰어난 경건성(robustness) 보임
  4. Ablation 실험 통해 MDAgents 가 각 의료 의사결정 사례에 적합한 복잡도 수준 잘 찾아낼 능력 있다는 것도 확인

✅Framework (Method)

🧑‍⚕️ Moderator (조정자 에이전트)

역할: 일반의(GP) 혹은 응급실 의사처럼 작동하며, 의료 질의의 복잡도를 평가하고,

그에 따라 어느 경로(단일 에이전트 / MDT / ICT)를 선택할지 결정

  • 전체 MDAgents 시스템의 ****의사결정 흐름을 총괄
    • 질의가 단순하다면 → 단일 에이전트 할당
    • 중간 복잡도라면 → MDT
    • 복잡한 문제라면 → ICT
  • 이후 단계의 에이전트 구성, 토론, 결과 통합까지 감독
  • RAG 사용시 RAG 를 통해 외부 정보 검색해서 에이전트가 주장하는 내용 팩트체크도 진행.

👥 Recruiter (모집자 에이전트)

역할: Moderator의 복잡도 평가에 따라 적절한 전문가 팀을 구성시킴

  • Low complexity → PCP(Primary Care Physician) 하나만 배정
  • Moderate or High complexity → MDT 또는 ICT 구조로, 다양한 전문성을 가진 LLM들로 팀을 구성

즉, 이 에이전트는 실질적으로 “의료 인력 배치 담당자”처럼 작동

👨‍⚕️ General Doctor / Specialist (일반의 또는 전문의 LLM)

Recruiter가 구성한 팀에서 실제 질의에 답변하거나 분석하는 에이전트들

  • 일반의 (General Doctor):
    • 단순하거나 일상적인 문제에 대응
    • PCP로서 단독으로 작동하거나 MDT의 일원으로 참여
  • 전문의 (Specialist):
    • 외과, 종양, 심장 등 특정 도메인 지식 보유
    • 복잡한 질의의 경우 ICT 팀 구성 시 필수적으로 포함
    • 다양한 정보를 통합하여 보고서를 만들거나 팀 내 의견 조율을 담당

구조

실제 병원 진료 과정 모방해서 Multi LLM 들이 협업하는 구조 (4단계 구조)

Medical Quary 의 종류

카테고리설명특징 및 목적
Medical Knowledge일반 의학 지식 질문객관식 지식 기반
Differential Diagnosis (DDx)환자 데이터 기반 감별진단 추론임상 추론 중심
Multi-modal Reasoning이미지 기반 추론 질문시각+언어 통합

a.Complexity Check (복잡도 판단)

  • 주어진 의료 질의 (medical Query) 문제 난이도 자동분류: LLM 이 해결 가능한 정도 따라
    • Low
    • Moderate
    • High

b. Recruitment (팀 구성)

  • 판단 복잡도에 따라 특정 문제에 적합한 LLM Agent 팀 자동 구성

    • Low Complexity : PCC (Primary Care Clinician) 하나의 LLM 이 바로 답변 ex. 감기, 복통, 기본적 진단 등
    • Moderate Complexity: MDT(Multidisciplinary Team) 여러 LLM 들이 논의함 ex. 감별 진단이 필요한 내과적 질환, 다학제 협진이 필요한 사례 최대 N round 까지 토론 (Collaborative Discussion) 마치 사람들이 컨퍼런스에서 디스커션 하는 것과 유사
    • High Complexity: ICT (Integrated Care Team) 팀1, 팀2 로 나눠서 분산 협업한다음 각자 보고서 작성함 그 보고서를 기반으로 결론 도출 마치 전문의들이 공동 진단하는 것처럼 → 이 경우 한 팀에 리더가 있고, 리더 아래 리더의 의견을 보조하는 전문가 둘이 딸린 구조 (Intermediate 와 다름) ex. 중증 외과적 질환, 중복 질환 관리, 부서 간 진료 통합 필요

c. Analysis & Synthesis (분석 및 응답 구성)

  • Low Complexity → 단순 prompting 으로 구성
  • Moderate Complexity → 서로 논의하는 방식
  • High Complexity → 위에 나온 것처럼 팀 나눠 병렬 조사 후 보고서 작성 시켜서 + 멀티모달 데이터도 함께 처리 가능

d. Final Decision (최종 결정)

  • 분석 결과 종합해 최종 응답 생성
  • Moderater 나 외부지식도 개입 가능 구조

Language Models in Medical Decision-Making

의료 분야에서 LLM은 점차 다양한 작업에 사용되고 있으나, 복잡한 의사결정 과정을 포괄적으로 처리하지는 못했다.

  • LLM들은 다음과 같은 다양한 의료 작업에 활용됨:
    • 의료 질의 응답 (medical Q&A)
    • 병리 생물지식 검색
    • 임상 리스크 예측
    • 진단 제안
    • 영상 해석
    • 의사-환자 대화 시뮬레이션
    • 정신건강 평가
  • 예시
    • GPT-4 기반 LLM은 prompt 조정만으로도 USMLE(미국 의사 자격시험)에서 고득점을 받음.
    • Med-PaLM 등 일부 모델은 사전 훈련 없이도 높은 의료 정확도를 달성함.
  • 최근에는 prompt engineering이나 RAG (Retrieval-Augmented Generation) 기법을 결합해 성능을 더욱 향상시킴.
  • 특히 RAG 로 외부 자원을 활용하고 응답을 생성하여 성능을 높일 수 있음.

Multi-Agent Collaboration

복잡한 문제 해결을 위해 여러 LLM이 역할을 나누고 협력하는 다중 에이전트 프레임워크 연구가 활발히 진행되고 있음.

  • 멀티 에이전트 LLM에 관한 연구는 다음 방향으로 발전 중:
    • 각 에이전트가 다른 역할 (e.g. Assessor, Planner, Solver)을 수행
    • 다단계 문제 해결을 위해 에이전트들이 상호작용하며 점진적으로 결론 도출
  • 기존 방식 예시:
    • Voting: 여러 에이전트가 개별적으로 답을 낸 후 다수결

    • Debate: 서로 반박하고 토론하며 개선

    • ReConCile: 협상 및 중재 기반 합의

    • Multi-agent chat: 역할 분담된 에이전트 간 협의

      기존 제로샷 퓨샷 chain of thought 은 단일모델, voting, debate 등은 다중모델


☑️한계

대부분은 static (고정된 구조):

  • 에이전트 수, 역할, 상호작용 방식이 고정되어 있음.
  • 문제에 따라 최적화되지 않아 비효율적이거나 너무 복잡할 수 있음.
  • 복잡도에 따라 다른 전략이 필요하지만, 유연하게 조절되지 않음.

✅Experiments & Results

<데이터셋 설명>

이름입력설명주요 목표비고
MedQA텍스트 (다지선다 문제)의사 자격시험 문제 기반 고난도 QA. 의학 추론과 진단 능력을 평가.전문 의학 QA 평가USMLE, NMLE 기반 / GPT 평가용
PubMedQA논문 제목 + 초록PubMed 논문 초록을 읽고 Yes/No/Maybe로 답변하는 사실 검증 QA.논문 기반 사실성 QAFact-check / RAG 벤치마크로 활용
DDXPlus증상, 병력, 환자 정보감별 진단 리스트를 출력하는 QA. 임상의처럼 가능한 진단을 추론해야 함.감별 진단 평가임상의 사고 흐름을 재현하는 데이터셋
SymCat일반 증상 목록증상을 기반으로 질병 확률 분포를 예측. 간단한 증상 → 진단 매핑용.질병 분류 및 예측기초적 진단 시스템 개발용
JAMA의학 논문, 사례 텍스트JAMA 학술지 기반의 고난도 QA. 근거 기반 추론을 요구하며 의료 논문 수준의 지식을 반영.근거 중심 QA고난이도, 논문 기반 근거 필요
MedBullets정형 텍스트 문제의대생 및 레지던트 퀴즈 기반 데이터. 개념 평가용 고난도 퀴즈.의학 개념 퀴즈교육 플랫폼에서 수집됨
Path-VQA병리 이미지 + 질문병리학 슬라이드를 보고 진단에 대한 질문에 답변. 암/염증 여부 등 시각 단서 해석 요구.병리 이미지 QA시각적 의료추론 능력 측정
PMC-VQA논문 도표, 그림, 그래프 + 질문PMC 논문의 시각 정보를 기반으로 한 VQA. 도표 이해 및 시각적 추론 필요.논문 시각 정보 이해그래프, 이미지 기반 reasoning 필요
MIMIC-CXR흉부 X-ray + 판독 리포트MIMIC 병원 데이터 기반. 흉부 X-ray 영상과 방사선의 판독 결과를 포함. 진단, 설명 생성 등에 활용됨.영상 진단 및 리포트 생성370,000개 이상 이미지 포함된 대규모셋
MedVidQA의료 비디오 + 질문수술/교육 영상 기반 질의응답. 도구 식별, 맥락 이해, 시간적 추론 요구.의료 영상 기반 QA고난이도 멀티모달 reasoning 포함
  • Baseline1 (Single-agent) – 단일 LLM 에이전트만 사용하여 의사결정을 수행하는 방식 (Zero-shot, Few-shot, Few-shot CoT, Few-shot CoT-SC, Ensemble Refinement, Medprompt)
  • Baseline2 (Multi-agent) – 다중 에이전트가 협업을 통해 의사결정을 수행하는 방식 (Voting, MedAgents, Reconcile, AutoGen, DyLAN)
  • Adaptive (MDAgents) – 제안한 프레임워크 방식

Accuracy 기준 10개의 의료 벤치마크 중 7개에서 제일 높은 성능을 보임

특히 텍스트 기반 데이터셋들과 텍스트+이미지 데이터셋에서 성능이 높았음

Adaptive Decision-making Framework 효과

  • 어떤 난이도 수준이 적절한지를 판단하는 능력은 매우 중요하며 이러한 난이도에 따라 복잡도 수준을 분류하는 능력도 중요함
  • 이를 검증하기 위해, 25개의 의료 문제를 각 난이도 수준에서 10번씩 반복하여 수행하여 각 복잡도 수준에 대해 솔루션 정확도를 평가하고자 함
  • 제안 프레임워크는 80% 확률로 최적의 복잡도 수준을 선택할 수 있음을 보임

Moderator 와 RAG 효과

  • 외부 의료 지식 및 Moderator 리뷰(를 MDAgents에 통합했을 때 정확도에 미치는 영향을 측정하고자 함.

  • Moderator 의 리뷰라 하면

    • 첫 단계에서 질의의 복잡도를 판단하고,
    • 해당 문제를 어떤 경로(PCC, MDT, ICT)로 보낼지 결정
    • 팀이 답변을 만든 후, 그 답변을 검토(Review)해서 최종 결론을 낼지, 수정이 필요한지 판단
  • MedRAG와 Moderator의 리뷰(난이도 배정하는 애) 가 각각 성능을 향상시키며, 동시에 통합하여 사용할 경우 가장 정확도가 높았음.

Agent 수 어떤게 최적인가

  • 에이전트 수 3명일 때 정확도 최고(83.5%)를 달성
  • Group setting 일때 셋, team 은 한팀당 3명 에이전트일때 성능 최적
  • 에이전트 많다고 무조건 accuracy 높아지는거 아님

이 밖에 파라미터 조정 실험 → temperature 높이든 낮추든 거의 비슷하게 좋은 성능을 낸다는 실험, 멀티모달 데이터에서 일관된 의견 수렴 실험 → text, text+image, text+video 다 수렴하더라 등 실험 존재

✅Conclusion

  • MDAgents는 고정된 구조가 아니라, 문제에 맞게 LLM의 협업 구조를 유연하게 설정 가능
  • MDAgents는 멀티모달 추론 능력을 활용하고, LLM 간 협업 프로세스를 촉진함으로써 LLM 기반 의료 진단 시스템을 새로운 차원으로 확장하며, 자동화된 임상 추론의 경계를 넓히는 새로운 가능성 제시

☑️Thoughts

  • 의료 전문가 에이전트가 의료 전문가처럼 행동하는 방식은 MedRAG 사용 + 전문의 기능 prompting 으로 파인튜닝 없이 기존 LLM 이 주어진 role 에 따라만 작동한다 → 이 정도로도 이만큼의 성능을 내는건 대단하다고 생각했다.
  • 이는 논문의 Limitation 에도 언급되어 있듯, 의료 데이터에 특화하여 훈련된 파운데이션 모델 및 시스템을 통합하는 것이 향후 개선 사항
profile
AI & Languages galore.

0개의 댓글