✔ Basic Info
📌 MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making(2024)
🔗 https://arxiv.org/pdf/2404.15155
LLM 은 창작 글쓰기, 추론, 의사결정 같은 고난도 과업 수행 가능한 수준까지 발전을 했으며 어느정도 인간 수준에 필적할 성능을 보임
그러나 아직 고유의 한계를 보임
Agentic LLM
📌 문제점
📌 해결점
실제 임상에서 의사들이 여러 단계 거쳐 의사결정 하는 구조 본떠서 LLM 을 복잡도에 따라 배치하고 협업하게 함
✅ 프레임워크
📌 기여점
역할: 일반의(GP) 혹은 응급실 의사처럼 작동하며, 의료 질의의 복잡도를 평가하고,
그에 따라 어느 경로(단일 에이전트 / MDT / ICT)를 선택할지 결정
- 전체 MDAgents 시스템의 ****의사결정 흐름을 총괄
- 질의가 단순하다면 → 단일 에이전트 할당
- 중간 복잡도라면 → MDT
- 복잡한 문제라면 → ICT
- 이후 단계의 에이전트 구성, 토론, 결과 통합까지 감독
- RAG 사용시 RAG 를 통해 외부 정보 검색해서 에이전트가 주장하는 내용 팩트체크도 진행.
역할: Moderator의 복잡도 평가에 따라 적절한 전문가 팀을 구성시킴
- Low complexity → PCP(Primary Care Physician) 하나만 배정
- Moderate or High complexity → MDT 또는 ICT 구조로, 다양한 전문성을 가진 LLM들로 팀을 구성
즉, 이 에이전트는 실질적으로 “의료 인력 배치 담당자”처럼 작동
Recruiter가 구성한 팀에서 실제 질의에 답변하거나 분석하는 에이전트들
- 일반의 (General Doctor):
- 단순하거나 일상적인 문제에 대응
- PCP로서 단독으로 작동하거나 MDT의 일원으로 참여
- 전문의 (Specialist):
- 외과, 종양, 심장 등 특정 도메인 지식 보유
- 복잡한 질의의 경우 ICT 팀 구성 시 필수적으로 포함
- 다양한 정보를 통합하여 보고서를 만들거나 팀 내 의견 조율을 담당
실제 병원 진료 과정 모방해서 Multi LLM 들이 협업하는 구조 (4단계 구조)
Medical Quary 의 종류
| 카테고리 | 설명 | 특징 및 목적 |
|---|---|---|
| Medical Knowledge | 일반 의학 지식 질문 | 객관식 지식 기반 |
| Differential Diagnosis (DDx) | 환자 데이터 기반 감별진단 추론 | 임상 추론 중심 |
| Multi-modal Reasoning | 이미지 기반 추론 질문 | 시각+언어 통합 |

a.Complexity Check (복잡도 판단)
b. Recruitment (팀 구성)
판단 복잡도에 따라 특정 문제에 적합한 LLM Agent 팀 자동 구성

ex. 중증 외과적 질환, 중복 질환 관리, 부서 간 진료 통합 필요c. Analysis & Synthesis (분석 및 응답 구성)
d. Final Decision (최종 결정)
의료 분야에서 LLM은 점차 다양한 작업에 사용되고 있으나, 복잡한 의사결정 과정을 포괄적으로 처리하지는 못했다.
prompt engineering이나 RAG (Retrieval-Augmented Generation) 기법을 결합해 성능을 더욱 향상시킴.복잡한 문제 해결을 위해 여러 LLM이 역할을 나누고 협력하는 다중 에이전트 프레임워크 연구가 활발히 진행되고 있음.
Voting: 여러 에이전트가 개별적으로 답을 낸 후 다수결
Debate: 서로 반박하고 토론하며 개선
ReConCile: 협상 및 중재 기반 합의
Multi-agent chat: 역할 분담된 에이전트 간 협의
기존 제로샷 퓨샷 chain of thought 은 단일모델, voting, debate 등은 다중모델


대부분은 static (고정된 구조):
<데이터셋 설명>
| 이름 | 입력 | 설명 | 주요 목표 | 비고 |
|---|---|---|---|---|
| MedQA | 텍스트 (다지선다 문제) | 의사 자격시험 문제 기반 고난도 QA. 의학 추론과 진단 능력을 평가. | 전문 의학 QA 평가 | USMLE, NMLE 기반 / GPT 평가용 |
| PubMedQA | 논문 제목 + 초록 | PubMed 논문 초록을 읽고 Yes/No/Maybe로 답변하는 사실 검증 QA. | 논문 기반 사실성 QA | Fact-check / RAG 벤치마크로 활용 |
| DDXPlus | 증상, 병력, 환자 정보 | 감별 진단 리스트를 출력하는 QA. 임상의처럼 가능한 진단을 추론해야 함. | 감별 진단 평가 | 임상의 사고 흐름을 재현하는 데이터셋 |
| SymCat | 일반 증상 목록 | 증상을 기반으로 질병 확률 분포를 예측. 간단한 증상 → 진단 매핑용. | 질병 분류 및 예측 | 기초적 진단 시스템 개발용 |
| JAMA | 의학 논문, 사례 텍스트 | JAMA 학술지 기반의 고난도 QA. 근거 기반 추론을 요구하며 의료 논문 수준의 지식을 반영. | 근거 중심 QA | 고난이도, 논문 기반 근거 필요 |
| MedBullets | 정형 텍스트 문제 | 의대생 및 레지던트 퀴즈 기반 데이터. 개념 평가용 고난도 퀴즈. | 의학 개념 퀴즈 | 교육 플랫폼에서 수집됨 |
| Path-VQA | 병리 이미지 + 질문 | 병리학 슬라이드를 보고 진단에 대한 질문에 답변. 암/염증 여부 등 시각 단서 해석 요구. | 병리 이미지 QA | 시각적 의료추론 능력 측정 |
| PMC-VQA | 논문 도표, 그림, 그래프 + 질문 | PMC 논문의 시각 정보를 기반으로 한 VQA. 도표 이해 및 시각적 추론 필요. | 논문 시각 정보 이해 | 그래프, 이미지 기반 reasoning 필요 |
| MIMIC-CXR | 흉부 X-ray + 판독 리포트 | MIMIC 병원 데이터 기반. 흉부 X-ray 영상과 방사선의 판독 결과를 포함. 진단, 설명 생성 등에 활용됨. | 영상 진단 및 리포트 생성 | 370,000개 이상 이미지 포함된 대규모셋 |
| MedVidQA | 의료 비디오 + 질문 | 수술/교육 영상 기반 질의응답. 도구 식별, 맥락 이해, 시간적 추론 요구. | 의료 영상 기반 QA | 고난이도 멀티모달 reasoning 포함 |
Accuracy 기준 10개의 의료 벤치마크 중 7개에서 제일 높은 성능을 보임
특히 텍스트 기반 데이터셋들과 텍스트+이미지 데이터셋에서 성능이 높았음



외부 의료 지식 및 Moderator 리뷰(를 MDAgents에 통합했을 때 정확도에 미치는 영향을 측정하고자 함.
Moderator 의 리뷰라 하면
MedRAG와 Moderator의 리뷰(난이도 배정하는 애) 가 각각 성능을 향상시키며, 동시에 통합하여 사용할 경우 가장 정확도가 높았음.

이 밖에 파라미터 조정 실험 → temperature 높이든 낮추든 거의 비슷하게 좋은 성능을 낸다는 실험, 멀티모달 데이터에서 일관된 의견 수렴 실험 → text, text+image, text+video 다 수렴하더라 등 실험 존재
☑️Thoughts
- 의료 전문가 에이전트가 의료 전문가처럼 행동하는 방식은 MedRAG 사용 + 전문의 기능 prompting 으로 파인튜닝 없이 기존 LLM 이 주어진 role 에 따라만 작동한다 → 이 정도로도 이만큼의 성능을 내는건 대단하다고 생각했다.
- 이는 논문의 Limitation 에도 언급되어 있듯, 의료 데이터에 특화하여 훈련된 파운데이션 모델 및 시스템을 통합하는 것이 향후 개선 사항