BiomedCLIP & LLaVa-Med 용도에 맞게 모델 파악하기

종은·2026년 3월 13일

BiomedCLIP Methods

PMC-15M

  1. NCBI서 PubMed Central Open Access Subset (PMC-OA) 다운로드하여 XML, PDF, 미디어 및 보충 자료를 포함한 논문 전체 패키지를 추출
  2. PubMed Parser로 XML 파일 파싱, 원본 논문의 PMID & PMCID와 함께 캡션 및 해당 figure references를 추출
  3. JSONL 형식으로 저장된 JSON 객체가 됨.
  4. 그림 참조가 없거나 구문 오류 또는 정보 누락 오류가 있는 잘못된 형식의 XML 파일은 무시
  5. 300만 개 이상의 논문에서 1500만 개의 그림-캡션 쌍(PMC-15M)을 수집

PMC-Fine-Grained-46M

  1. PMC-15M에서 이미지-텍스트 쌍을 추출하고 정제하는 새로운 파이프라인임.
  2. 복합 그림(compound figures)을 하위 그림(sub-figures)과 캡션으로 분해하여 처리, 논문 내 텍스트 참조(in-line text references)를 이미지-텍스트 쌍의 추가 데이터 소스로 통합
  3. Data Ingestor: 논문 파일을 다운로드하고 처리 →
    Citance Extractor: 그림 참조를 위해 논문 텍스트를 파싱 →
    Caption Splitter: 정규식과 규칙을 사용하여 그림 캡션을 개별 라벨이 있는 하위 캡션으로 분리 →
    Citance Splitter: 각 라벨에 인용 문장 블록을 할당 →
    OCR 텍스트 감지 →
    Figure Splitter: 복합 이미지를 패널(하위 그림)로 분할 →
    Label-to-Panel Matcher: 라벨을 올바른 패널에 할당

일관되지 않은 라벨링 스타일, OCR 오류, 하위 그림에 대한 라벨의 모호한 위치와 같은 다양한 과제를 극복. OCR 텍스트에 대한 문자열 매칭, OCR 실수를 수정하기 위한 레이아웃 분석, 라벨과 패널을 매칭하기 위한 영역 기반 휴리스틱 등 고급 기술.

Cross-modal retrieval

  1. 이미지 및 텍스트 임베딩을 미리 계산하고 근사 최근접 이웃(ANN) 검색을 수행
    (CLIP 모델의 사전 학습된 비전 인코더와 텍스트 인코더를 사용하여 각각 그림과 캡션의 임베딩을 계산)
  2. 그림 임베딩이 주어지면 테스트 세트의 모든 캡션과 코사인 유사도를 계산하고 가장 유사한 k개의 캡션을 검색.
  3. 평가 지표는 그림의 원래 캡션이 검색된 k개 이내에 있는지 여부, 즉 R@k(Recall at top-k)를 측정. 마찬가지로 텍스트-이미지 교차 모달 검색에 대해서도 Recall@k를 평가.
  4. 여러 CLIP 모델을 baseline으로 고려. 인터넷에서 수집된 4억 개의 일반 도메인 쌍으로 학습된 OpenAI CLIP,
    8만 개의 방사선 이미지-캡션 쌍으로 OpenAI CLIP을 미세 조정한 PubMedCLIP,
    OpenAI CLIP을 PMC-15M에서 계속해서 사전 학습시킨 BiomedCLIP 변형 모델((i.e., BiomedCLIP ViT-B/16-224-GPT/77)과도 비교

Biomedical image classification

  1. ELEVATER: 사전 학습된 시각-언어 모델을 효율적으로 적응시키고 자동 하이퍼파라미터 튜닝 툴킷.
  • 제로샷, 퓨샷, 풀샷 평가 지원, 후자의 두 설정에 대해서는 선형 탐색(linear probing)과 전체 모델 미세 조정이 가능.
  • 또한 실험에서 사용한 의생명 데이터셋인 PatchCamelyon을 포함하여 다양한 도메인에서 수집된 20개의 이미지 분류 데이터셋을 포함.
  1. 표준 의생명 이미지 벤치마크인 LC25000, TCGA-TIL, RSNA에서 평가.

PatchCamelyon (PCam): 림프절 절편의 조직병리 스캔에서 가져온 327,680개의 컬러 이미지(96x96px)를 포함하며, 전이 조직 포함 여부를 나타내는 이진 라벨이 지정
LC25000: 25,000개의 조직병리 이미지(768x768px)를 포함. 폐 조직과 대장 조직의 양성 및 암종 이미지를 증강하여 생성되었으며 5개 클래스로 나뉨
TCGA-TIL: 폐선암(Lung Adenocarcinoma, LUAD) 사례의 H&E 전체 슬라이드 이미지에서 분할된 2,480개의 이미지 패치(500x500px)를 포함
RSNA Pneumonia: NIH 공공 데이터베이스에서 수집된 약 30,000개의 정면 흉부 엑스레이를 포함, 폐렴 유무를 분류하는 이진 라벨

  1. CLIP, MedCLIP, PubMedCLIP, PLIP, Med-Flamingo, LLaVA-Med를 포함한 경쟁 방법들과 성능을 비교.

MedCLIP: 대조 학습을 통해 짝지어지지 않은 대규모 이미지와 텍스트를 포함하도록 사전 학습을 확장. MedCLIP은 각각 사전 학습된 BioClinicalBERT와 Swin Transformer를 백본(CNN 등에서 이미지/데이터의 특징을 추출하는 기본 신경망 모델) 텍스트 인코더 및 비주얼 인코더로 사용하며, MIMIC-CXR 및 CheXpert 데이터셋에서 미세 조정(fine-tuning).

PubMedCLIP: PubMed 논문에서 추출한 8만 개의 방사선 이미지-텍스트 쌍으로 구성된 ROCO(Radiology Objects in COntext) 데이터셋에서 CLIP을 미세 조정.

PLIP: 의료용 트위터(Medical Twitter)에서 가져온 자연어 설명과 짝을 이룬 약 20만 8천 개의 병리 이미지 데이터셋인 OpenPath에서 사전 학습.

Med-Flamingo: OpenFlamingo-9B를 기반으로 하는 멀티모달 퓨샷 학습기. 출판물 및 교과서에서 추출한 200만 개의 인터리브된(이미지와 텍스트가 교차 배치된) 의료 이미지-텍스트 데이터로 추가 사전 학습을 진행, 개방형 시각 질의응답(open-ended VQA)을 위해 설계.

LLaVA-Med: BiomedCLIP을 확장한 모델, GPT-4로 생성된 지시 이행(instruction-following) 데이터를 사용하여 개방형 대화 의미론(conversational semantics)을 숙달하도록 추가 조정.

모델명핵심 아키텍처 (Text / Vision)주요 학습 데이터셋주요 특징 및 학습 방식
BiomedCLIPPubMedBERT / ViT-B/16PMC-15M (1,500만 쌍)CLIP을 의생명 도메인에 최적화하여 SOTA 달성, 도메인 특화 사전 학습
MedCLIPBioClinicalBERT / Swin TransformerMIMIC-CXR, CheXpert짝지어지지 않은(unpaired) 대규모 이미지/텍스트 활용, 대조 학습 확장
PubMedCLIPCLIP 구조 (GPT-2 / ViT)ROCO (8만 쌍, 방사선 영상)기존 CLIP 모델을 소규모 방사선 영상 데이터셋으로 미세 조정(Fine-tuning)
PLIPCLIP 구조 기반OpenPath (20.8만 쌍)의료용 트위터(Medical Twitter)의 병리 이미지와 자연어 설명을 활용
Med-FlamingoOpenFlamingo-9B 기반출판물/교과서 (200만 인터리브 데이터)멀티모달 few-shot 학습기, 개방형 시각 질의응답(VQA)에 특화 설계
LLaVA-MedBiomedCLIP + VicunaPMC-15M + GPT-4 생성 지시어커리큘럼 학습을 통해 전문가급 개방형 대화 능력을 갖춘 모델

BiomedCLIP

1. Input : 영상(2D or 3D), Text (문장 or tabular data)

논문에서 수집한 이미지-텍스트 쌍(2D 그림-문장 캡션).

  • 이후 복합 그림(compound figures)을 하위 그림(sub-figures)과 캡션으로 분해하여 처리
  • 논문 내 텍스트 참조(in-line text references)를 이미지-텍스트 쌍의 추가 데이터 소스로 통합

2. 모델 구조: image encoder, text encoder, fusion

데이터 수집: PubMed Central에서 이미지를 설명하는 캡션(Caption)을 쌍으로 추출하고,
듀얼 인코더와 대조 학습.

Image encoder, text encoder.
Image encoder: 의료 영상의 미세한 패턴(세포의 형태, 병변의 위치 등)을 읽어내기 위해 비전 트랜스포머(ViT) 구조를 사용. ViT-Small, ViT-Medium부터 ViT-Base까지 평가 결과 더 큰 ViT가 더 좋은 성능을 냈기에 ViT-B/16 채택.
Text encoder: GPT-2 → PubMedBERT. 더 긴 글을 읽을 수 있도록 유도.
tokenizer는 BPE(Byte-Pair Encoding) → WordPiece. 모든 단어를 문자로 쪼개고 빈도에 따라 탐욕적으로 더 큰 토큰을 형성하는 대신, 유니그램기반의 가능도(likelihood)를 사용.
두 인코더를 대조 학습: 이미지 벡터와 텍스트 벡터를 하나의 공간에 모아놓고, 서로 짝이 맞는 정보는 가깝게, 상관없는 정보는 멀게 배치하도록 두 인코더를 동시에 훈련. 이는 late fusion에 해당(맨 마지막 단계에서 두 벡터를 곱해 유사도 계산).

비전 인코더 초기화 방법: downstream tasks에서 random initialization < pre-trained ImageNet encoder 성능 좋음.
이미지 해상도: 해상도 증가가 하위 작업 성능을 일관되게 향상시키지는 않았고 이미지를 업샘플링하는 것은 노이즈를 유발하여 성능 저하의 원인이기에 224x224.
배치 크기: 더 큰 배치 크기가 일반적으로 더 나은 검증 성능, 하지만 downstream task에서는 4k부터 무의미. 4k 배치 크기를 선택.

3. 학습 방법 (freeze / training, 특별한 형태의 학습여부)

  1. Pre-training on PMC-15M

이미지와 텍스트의 연관성을 배우기 위해 두 인코더를 모두 훈련.
이미지 인코더 (ViT-B/16): ImageNet 가중치로 시작하지만, 의생명 이미지의 특징을 배우기 위해 전체 파라미터를 업데이트.
텍스트 인코더 (PubMedBERT): 이미 학습된 PubMedBERT를 가져와서 시작하며, 이미지와 짝을 맞추기 위해 함께 업데이트(fine-tuning).

  1. Downstream Tasks

ELEVATER 툴킷 사용.
Zero-shot: 인코더 전체를 frozen, 학습 없이 바로 추론.
Linear Probing: 인코더(이미지/텍스트)는 frozen, 그 위에 붙인 선형 레이어(Linear Layer)만 trained.
Full Model Fine-tuning: 인코더를 포함한 전체 모델을 다시 Train하여 특정 데이터셋에 최적화.

4. 학습할 때의 데이터셋 중 lung과 관련한 데이터

PMC-15M 및 PMC-Fine-Grained-46M 자체는 정확히 Lung만 분류하지 않음.
PMC-OA에서 다양한 논문을 포함하며 결과적으로 분류된 분야는 사진과 같이 특정 장기가 아닌 매체의 형식에 관함.

  1. 다만 벤치마크인 LC25000, TCGA-TIL, RSNA Pneumonia 데이터셋으로 평가했을 때의 성능으로 데이터가 얼마나 영향력을 끼쳤는지 미루어 볼 수 있음.

LC25000: 25,000개의 조직병리학 이미지, 폐 조직 750개(양성 250개, 선암 250개, 편평세포암 250개)와 대장 조직 500개(양성 250개, 선암 250개)로 구성된 HIPAA를 준수하며 출처가 검증된 모음에서 증강하여 생성. 데이터 세트는 폐 양성 조직, 폐 선암, 폐 편평세포암, 대장 선암, 대장 양성 조직의 다섯 가지 클래스로 나뉘며, 각 클래스에는 5,000개의 이미지가 포함. 다만 프롬프트 입력 시에는 명시되지 않음.
TCGA-TIL: The Cancer Genome Atlas (TCGA)의 폐선암(Lung Adenocarcinoma, LUAD) 사례에서 H&E 전체 슬라이드 이미지(WSI)에서 분할된 2,480개의 이미지 패치(500x500px)를 포함.
RSNA Pneumonia: NIH 공공 데이터베이스에서 수집된 약 30,000개의 정면 흉부 엑스레이를 포함, 정상 폐와 비교해 폐렴 유무를 이진 분류.

분류를 위해 클래스를 설명하는 짧은 텍스트 프롬프트를 사용하는 BiomedCLIP 모델의 제로샷 성능 조사 그림.
BiomedCLIP(BERT)와 BiomedCLIP(GPT)의 경우 각각 LC25000에서는 65, 60,
TCGA-TIL에서는 66, 71,
RSNA Pneumonia에서는 78, 81의 정확도를 기록.
이는 타 모델 대비 높은 숫자이지만 PCam이나 LC25000(Colon)에 비해서는 상대적으로 성능이 낮아 폐만 특이적으로 성능이 높다라고는 볼 수 없음. 하지만 acurracy 자체는 높은 편으로 폐 관련 분류가 잘 됨.

  1. 프록시 활용에서의 재현율을 통해 또한 성능을 파악할 수 있음.
    BiomedCLIP을 사용하여 PMC-15M 내에서 가장 유사한 데이터 포인트를 검색, 대신 검색된 공개 데이터 포인트들을 외부 모델에 질의, 답변들을 취합해 비공개 데이터에 대한 프록시 출력으로 사용하는 활용 이후에도 정확도를 측정. 폐 음영(Lung Opacity)과 무기폐(Atelectasis, 찌그러진 폐)에서 각각 88.80과 95.04의 높은 재현율. 이는 재현할 수 있을 만큼 관련 정보가 방대함을 의미함.

  2. 모델이 처리하는 input : 영상(2D or 3D), Text (문장 or tabular data)

  3. 모델 구조: image encoder, text encoder, Fusion 방식

  4. 학습하는 방법 (frozon한 것과 training 하는 것 구분, 특별한 형태의 학습여부)

  5. 학습할 때 사용한 데이터셋에 lung과 관련된 것이 있는지 살펴보기

LLaVa-Med

1. Input : 영상(2D or 3D), Text (문장 or tabular data)

Vision: 2D 이미지 처리. CXR(흉부 엑스레이), CT, MRI, 조직 병리(Histopathology) 등.
Text: 자연어 문장 형태의 입력을 처리. 사용자의 질문, instruction, 학습 시에는 이미지 캡션(Caption 및 In-line mention) 등.

2. 모델 구조: image encoder, text encoder, fusion

Image Encoder: CLIP 기반의 비전 인코더(Vision Transformer)를 사용
Text Encoder: Vicuna(7B 또는 13B) 모델 사용. LLaMA를 기반으로 지시어 학습(Instruction-tuning)을 거친 모델.
Fusion 방식: 선형 투영 레이어를 사용. 이미지 인코더의 시각적 특징을 이미지 토큰으로 변환. 이를 언어 모델의 임베딩 차원과 일치시켜 사용자의 텍스트 토큰 앞에 접두사(prefix) 형태로 붙여 함께 입력.

3. 학습 방법 (freeze / training, 특별한 형태의 학습여부)

  1. 2단계 학습법: Curriculum Learning

    1단계: Medical Concept Alignment

    60만 개의 이미지-캡션 쌍을 사용해 시각적 특징을 언어 모델의 어휘와 연결하는 어휘 확장 단계.
    비전 인코더, 언어 모델(LLM) 가중치 모두 frozen.
    연결부인 선형 투영 레이어만 training.

    2단계: Medical Instruction-Tuning

    GPT-4로 생성한 6만 개의 대화형 데이터를 사용하여 종단형(이미지-텍스트 처리 한번에) 대화 능력을 학습.
    비전 인코더만 frozen.
    선형 투영 레이어 + 언어 모델(LLM) 전체를 업데이트(training).
    특정 벤치마크(VQA-RAD 등)에 적용할 때는 전체 모델을 다시 fine-tuning 하기도.

  2. GPT-4 self-Instruction data generation
    이미지 캡션과 논문 in-line mentions를 GPT-4에게 보여주면
    이미지를 직접 보고 있는 것처럼 GPT-4가 가상의 질문-답변 쌍을 스스로 생성.
    의사 개입 필요 X.

4. 학습할 때의 데이터셋 중 lung과 관련한 데이터

학습 데이터: 직접 폐 조직을 명시하진 않았으나, PMC-15M에서 추출한 데이터 중 가장 흔한 5개 모달리티 중 CXR(흉부 엑스레이)과 CT(흉부 포함)가 포함.
예시로 논문의 Figure 1은 환자의 흉부 CT 스캔 예시를 보여주며, 우상엽(오른쪽 폐의 최상단부터 중간까지)의 병변 등 폐 관련 진단 내용을 다룸.

평가 데이터: VQA-RAD & SLAKE에서 Head, Chest(흉부), Abdomen 등을 골고루 포함.

예시로 table 2에서 흉부 엑스레이(CXR) 이미지에 대해 폐 내의 침윤(infiltrates)이 보인다는 등의 대화를 나눔.

0개의 댓글