[논문 정리] LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day

종은·2026년 2월 20일

Abstract

본 논문에서는 바이오메디컬 이미지에 대한 개방형 연구 질문에 답할 수 있는 비전-언어 대화형 어시스턴트 훈련을 위한 효율적인 비용의 접근 방식을 제안

PubMed Central에서 추출한 대규모, 광범위한 바이오메디컬 데이터셋을 활용
-> GPT-4를 사용하여 캡션에서 개방형 instruction-following 데이터를 자체 생성
-> 대규모 일반 도메인 비전-언어 모델을 미세 조정
=> 일반인이 바이오메디컬 지식을 습득하는 것처럼.

LLaVA-Med를 15시간 미만(A100 8개 사용) 훈련.
3가지 표준 바이오메디컬 시각 질의응답 데이터셋에서 LLaVA-Med의 미세 조정은 특정 지표에서 이전의 지도 학습 기반 SoTA 성능을 능가.

Conclusions

Text-only GPT-4와 외부 지식을 활용하여 데이터 큐레이션 파이프라인을 구축하는 self-instruct 접근을 사용하여 고품질의 생의학 언어-이미지 instruction-following 데이터셋을 LLaVA-Med에 적용.
3가지 VQA 데이터셋에서 이전 지도 학습 기반의 SoTA를 능가.

Introduction

멀티모달 입력을 기반으로 인간의 의도에 맞게 모델을 조정하도록
instruction tuning을 수행함으로써
LMM은 이미지 이해 및 추론과 같은 다양한 사용자 지향 비전-언어 작업에서
강력한 zero-shot 태스크 완료 성능을 띄도록.

LMM은 바이오메디컬 도메인에서 성능이 떨어짐.
기존의 방법들은 대개 훈련 세트에서 관찰된 뚜렷한 정답들 중 하나를 고르는 분류 문제로
개방형 instruction-following에는 적합하지 않음.
현재 연구들은 단일 모달 텍스트에 한정.

바이오메디컬 멀티모달 대화형 어시스턴트의 종단형 훈련을 위해 멀티모달 instruction tuning을 바이오 도메인으로 확장하는 LLaVA-Med를 제시.
LLaVA-Med는 GPT-4를 사용하여 PMC-15의 이미지-텍스트 쌍을 활용하여 다양한 바이오메디컬 멀티모달 instruction-following 데이터를 생성,
새로운 커리큘럼 학습 방법을 사용하여 대규모 바이오메디컬 도메인 VL 모델을 미세 조정.

바이오메디컬 멀티모달 instruction-following:
주석이 필요 없으며 PMC-15를 활용하여 바이오메디컬 이미지에 대한 연구 결과의 전체 스펙트럼을 포괄하는 다양한 바이오메디컬 멀티모달 instruction-following 데이터셋 생성.

LLaVA-Med:
이미지-텍스트 쌍을 그대로 사용하여 바이오메디컬 어휘를 정렬하도록 LLaVA를 미세 조정
-> 자체 생성한 instruction-following 데이터를 사용하여 모델을 계속 훈련하여 개방형 대화 의미론을 학습

Biomedical Visual Instruction-Following Data

학습용 멀티모달 바이오메디컬 데이터셋이 부족
-> concept alignment / instruction-following으로 구성된 데이터셋 생성

단일 라운드 instruction-following:
Human : Xq Xv<스톱>\n Assistant : Xc<스톱>\n
캡션의 길이에 따라 샘플링된 질문은 30단어를 기준으로 이미지를 간결하게 또는 자세하게 설명하도록 요청.

  • 이미지 캡션을 주어지면 GPT-4가 마치 이미지에 접근 가능한 것처럼 다중 라운드 질문과 답변을 생성하도록 요청하는 지시를 프롬프트에 설계.
  • 이미지에 대한 더 많은 맥락을 제공하기 위해 캡션뿐만 아니라 이미지를 언급하는 원본 PubMed - 논문의 문장도 포함하는 프롬프트를 생성.
  • 프롬프트에 퓨샷 예시를 수동으로 큐레이션.
  • 맥락 수집 위해 60K개의 이미지-텍스트 쌍을 샘플링, 원본 PubMed 논문에서 이미지를 언급하는 문장을 캡션에 대한 추가 맥락으로 사용.

Adapting Multimodal Conversational Models to the Biomedical Domain

일반 멀티모델 LLaVa를 바이오메디컬 도메인으로 지속적 훈련.
비전 인코더와 언어 모델을 연결하는 선형 프로젝션 레이어를 사용하는 동일한 네트워크 아키텍처를 활용.

  1. 바이오메디컬 개념 특징 정렬.
    PMC-15M을 600K 이미지-텍스트 쌍으로 필터링.
    단순 확장을 통해 instruction-following 데이터로 변환
    각 샘플에 대해 언어 지시와 이미지 입력이 주어지면 원본 캡션을 예측하도록 요청.
    훈련 시 비전 인코더와 LM 가중치를 모두 고정하고 프로젝션 행렬만 업데이트
    바이오메디컬 시각 개념의 이미지 특징은 사전 훈련된 LM(Language Model)의 텍스트 단어 임베딩에 정렬.
    => 정렬된 이미지-텍스트 토큰의 어휘를 생물의학 도메인으로 확장
  2. 종단 간(End-to-End) 지시 튜닝.
    시각 인코더 가중치만 고정하고 프로젝션 레이어와 LM의 사전 훈련된 가중치는 계속 업데이트.
    바이오메디컬 언어-이미지 instruction-following 데이터에 모델을 파인튜닝하여 바이오메디컬 챗봇을 개발.

다운스트림 데이터셋 파인튜닝: 두 단계 훈련 후 바이오메디컬 VQA 데이터셋 3개에 LLaVA-Med를 파인튜닝.
바이오메디컬 이미지가 문맥으로 주어지면, 여러 자연어 질문이 제공.
어시스턴트는 폐쇄형 및 개방형 질문 모두에 대해 자유 형식 텍스트로 응답, 각 폐쇄형 질문의 경우 프롬프트 내에 후보 답변 목록이 포함된 상태로 구성.

Discussion

장점:

  • 합리적인 개발 비용
  • 다른 도메인에 적용 가능
  • 낮은 서비스 비용
  • 부드러운 모델 적응

Experiments

  1. 개방형 바이오메디컬 비전 챗봇으로서 LLaVA-Med의 성능은?
  2. LLaVA-Med는 표준 벤치마크에서 기존 방법들과 어떻게 비교되는가?

5.1 Biomedical Visual Chatbot

PMC-15M에서 무작위로 50개의 보지 못한 이미지 및 캡션 쌍을 선택하고, 대화와 상세 설명의 두 가지 유형의 질문을 생성
2단계와 동일한 self-instruct 데이터 생성 파이프라인을 사용하여 수집
상세 설명 질문은 무작위

성능 정량화로 GPT-4 활용.
1단계 훈련만으로는 LLaVA-Med가 챗봇으로서 불충분
=> 바이오메디컬 도메인 범위가 개선되지만 다양한 지시를 따르는 능력을 잃기 때문
2단계 훈련을 거친 LLaVA-Med는 일반 도메인 LLaVA를 능가, 더 큰 인스트럭트 데이터로 훈련하면 성능이 향상

LLaVAMed는 바이오메디컬 지식으로 질문에 정확하게 답변, 반면 LLaVA는 hallucination.

5.2 Performance on Established Benchmarks

VQA-RAD: 영상의학과 QA 쌍으로 이루어짐, 폐쇄형/개방형
SLAKE: 영상의학과 QA 쌍으로 이루어진 medicV용 데이터셋
PathVQA: 병리학 이미지 데이터셋, 폐쇄형/개방형

평가 지표: 폐쇄형은 정확도, 개방형은 재현율.


SoTA와 비교:

  • 모든 LLaVA-Med 변형은 LLaVA를 능가.

  • LLaVA-Med의 미세 조정 성능은 VQA-RAD 및 PathVQA의 폐쇄형 질문에 대한 지도 학습 SoTA보다 높음.

  • 개방형 질문에 대해 LLaVA-Med는 SLAKE에서 SoTA, 반면 다른 데이터셋, 특히 기존 방법들과 비교했을 때 성능이 제한적

  • LLaVA-Med는 LLaVA를 크게 능가

  • 스테이지 1에서 더 오래 학습하는 것은 제로샷 전이를 향상, 스테이지 1만으로는 충분하지 않음.
    스테이지 1의 단일 이미지 캡셔닝 지시는 모델이 다양한 지시를 따르는 능력을 잃게 만들 수 있음.

  • 스테이지 2의 지시 따르기 데이터는 중요하며, 지시 데이터 양이 10K에서 60K로 증가함에 따라 성능이 일반적으로 향상.

  • 스테이지 2의 3에포크 학습 시 9에포크까지 다운스트림 데이터셋에서 더 오래 미세 조정하는 것이 성능 향상에 효과적

  • LLaMA/Vicuna로 인해 LLaVA-Med 학습에는 중국어 지시 따르기 데이터가 포함되어 있지 않지만 LLaVA-Med가 중국어 질문을 올바르게 이해하고 응답

바이오메디컬 챗봇:
Visual Med-Alpaca가 이미지 입력을 수용하는 유일한 기존 멀티모달 바이오메디컬 챗봇.
LLaVA-Med는 종단형 신경망 모델인 반면, Visual Med-Alpaca는 여러 이미지 캡셔닝 모델들을 LLM과 연결한 시스템.
Visual Med-Alpaca의 경우 분류기를 사용하여 해당 이미지에 대해 어떤 바이오메디컬 캡셔닝 모델이 책임을 질지 결정 후 텍스트 프롬프트가 변환된 시각 정보와 텍스트 질의를 병합하여 적절한 응답을 생성.
Visual Med-Alpaca는 5만 4천 개 샘플, LLaVA-Med는 훨씬 다양한 데이터셋.

바이오메디컬 시각적 질의응답(Biomedical Visual Question Answering, VQA):
바이오메디컬 이미지를 기반으로 질문에 답할 수 있는 모델을 구축하는 자동화된 접근 방식.
판별형, 생성형으로 구분.
판별형의 경우, VQA를 분류 문제로 취급.
모델은 훈련 세트에서 관찰된 미리 정의된 정답 집합 내에서 예측을 수행. 판별형 방법이 좋은 성능을 보이기는 하지만, 이는 닫힌 집합(closed-set) 예측만을 다루며, 추론 시점에 맞춤형 정답 세트가 제공될 경우 별도의 mitigation이 필요합니다.

이를 위해, 정답을 자유 형식의 텍스트 시퀀스로 예측.
후보 답안이 언어 지시(instruction) 내에 포함되어 있는 닫힌 집합 형태의 질문 또한 생성에 사용.

모델 아키텍처:
LLaVA-Med는 고정된(frozen) 이미지 인코더와 인과적 언어 모델(causal LM)을 새로운 학습 가능한 모듈로 연결한다는 점에서 언어 모델 프리픽스 튜닝과 유사.
<-> 반대로, LLaVA-Med는 선형 프로젝션과 7B 규모의 언어 모델을 사용.
<-> 41은 표준적인 지도 미세 조정만을 고려하며 다양한 모델링 선택지를 탐색하는 데 집중.
<-> 반면 PubMed Central에서 추출한 자유롭게 이용 가능한 광범위한 바이오메디컬 이미지-텍스트 쌍을 활용, GPT-4로 바이오메디컬 멀티모달 instruction-following 데이터를 스스로 생성.

0개의 댓글