
(1) 현재 의생명과학 데이터는 물리적 양과 자연어 내러티브를 포함한다.
(2) 제너럴리스트 의생명과학 AI 모델은 텍스트와 이미지 같은 다른 형식의 데이터를 동시에 처리해야 한다.
(3) 따라서 이미지-텍스트 쌍과 같은 높은 품질의 멀티모달 데이터가 필요하다.
(4) PMC-15M은 현존 데이터셋보다 몇십 배 더 큰 데이터셋이며 다양한 범위의 의생명과학 이미지를 지원한다.
(5) 4.4백만 논문에서 발췌된 1500만 이미지-텍스트 쌍을 지원.
(6) 이를 통해 바이오 VLM에 맞춰 BiomedCLIP을 사전학습했다.
(7) 검색 -> 분류 -> VQA까지 의생명과학 영상 작업을 추가적으로 수행하고 제거를 거쳤다.
(8) 또한 다양한 형식의 의생명과학 이미지 형식에서 대규모 사전학습 거친 결과 폐렴 검출 등 영상의학에서 더 우위를 차지했다.
(9) PMC-15M을 프록시로 사용해 보안 유지하는 방법 제안.
(1) 의생명과학 데이터는 현재 물리적인 양과 자연어 네러티브를 포함하는 멀티모달이다.
(2) 그러나 직접 선별의 비용과 규모 측정 때문에 그 중에서도 적은 양만 해석되고 사용에 적합한 구조를 갖췄다
(3) 멀티모달 학습은 크로스모달 상호작용을 통해 자기지도학습을 향상시켜 선별 병목 현상을 줄일 수 있다
(4) 또한 멀티모달 통합을 통해, 숨겨진 예측 신호를 파악할 수 있다.
(5) 그 결과로, 의생명과학 VL 기초 모델은 의생명과학 이미지와 텍스트를 통합해 구조화한다.
(6) 의생명과학 VL 모델은 두 장점이 있다. 첫 번째는 자기 지도 학습을 통해 대규모 데이터를 사전 학습해 모델은 파인튜닝을 위한 데이터가 소량만 존재하는 저자원 환경에서도 다양한 하위 응용 분야에 걸쳐 좋은 성능, 결과적으로 라벨링 비용을 절감.
(7) 둘째로는 고품질 이미지-텍스트 쌍 데이터를 사전학습함으로서 이미지 설명 생성과 VQA과 같은 복잡한 이해가 필요한 이미지와 텍스트 데이터를 이해할 수 있다.
(8) 기존 의생명과학 모델은 세 개의 한계가 있다. 첫 번째는 사전학습 데이터가 프라이빗이라 다수의 기초 모델에서 접근이 어렵다.
(9) 두 번째로는 이미지-텍스트 쌍 데이터셋이 상대적으로 적다.
(10) 마지막으로, 대부분 흉부 엑스레이(CXR)로 데이터셋의 다양성이 적다. 이는 다른 이미지 형식을 제한한다.
(11) 의생명과학 이미지-텍스트 쌍은 상대적으로 웹 자료와 품질이 부족하지만 ,
웹 이미지와 캡션 마이닝에서는 다양하고 확장성이 좋은 데이터셋이 선호된다.
(12) 우리는 1500만 쌍의 대규모 고품질 이미지-텍스트 쌍 데이터셋 PMC-15M을 개발했다.
(13) 세 개의 한계를 보완했다. 첫 번째로 데이터를 논문에서 발췌해 프라이버시 이슈를 없앴다.
(14) 두 번째로 몇십 배 규모이다.
(15) 세 번째로 의생명과학 내 어떤 세부항목도 지원하며 30개의 주요 의생명과학 이미지 형식 또한 지원한다. 의생명과학과 의료현장을 위한 다양하고 대표적인 데이터셋을 제공한다.
(16) 이런 PMC-15M을 기반으로 BiomedCLIP을 사전학습했고, 크로스모달 검색과 제로샷 이미지 분류, 의로 VQA 등 넓은 범위의 하위 작업의 성능을 향상시키는 SoTA를 달성했다.
(17) BiomedCLIP은 일반적인 도메인의 CLIP 모델보다 성능이 좋았으며 이는 의약에서의 중요성도 확인시켜준다.
(18) 더 큰 규모와 다양한 데이터를 사전학습한 결과 예전 모델보다 성능이 향상되었다.
(19) BiomedCLIP은 폐렴 검출과 같은 영상의학 작업에서 효과가 좋았다. -> 다양한 이미지 주제에서 전이학습의 잠재력이 있다.
(20) 마지막으로, 타 모델을 통한 소유권이 있는 데이터 분석에서 PMC-15M을 프록시로 사용함의 잠재력을 탐구했다.
(1) 우리는 논문에서 발췌된 거대 이미지-텍스트 쌍 데이터셋인 PMC-15M을 만들었다. PMC는 의생명과학 논문의 거대한 집합이다.
(2) SoTA를 위해 pubmed 논문을 사전학습함. -
(3) VL 사전학습을 위해 PMC 전체 논문에서의 풍부한 그림-설명 쌍을 제안한다.
(4) 우리는 PMC에서 완전한 논문 패키지와 함께 압축된 디렉토리를 추출했다. 각 논문은 XML, PEF, 미디어, 부가 요소로 이루어진다.
(5) 우리는 기초적인 논문인 PMID, PMCID와 함께 그림과 맞는 설명을 추출했다. 데이터셋은 1528만 쌍이다.
(6) 대규모 데이터셋의 처리와 복잡한 워크플로우를 위해 Azure Databrick를 사용했다.
(7) 의생명과학 이미지는 일반 도메인의 이미지보다 크기가 크며 설명은 CLIP의 표준 길이보다 길다는 것을 발견했다.
(8) PMC-15M의 다양성과 이미지 클래스의 범위를 위해 각 과학적 그림이 독립적인 패널 이미지가 되게끔 쪼개 PMC-•••-46M를 만들었다.
(9) 선별된 분류 기법을 통해 자동으로 배덩된 이미지 형식 키워드를 사용했다. BiomedCLIP에서의 임베딩을 통해 어떤 단어와 가까운 이미지를 배정해 각 이미지 형식의 빈도를 추정하기 위해서.
(10) 실제 형식보다 많이 집계됐지만 대략적인 숫자와 비슷했다.
(11) 1B는 PMC-46M에서 30개의 주요 이미지 형식을 보여준다.
(12) PMC의 이미지는 의생명과학 그림, 의료영상, 디지털 병리학, 현미경 사진 등등을 포함한 다양한 범위를 지원한다.
(1) BiomedCLIP은 CLIP의 의생명과학 판이다. -
(2) CLIP은 이미지-텍스트 쌍을 IntoNCE loss를 통해 높은 코사인 유사도를 가진 포지티브 쌍과 낮은 코사인 유사도를 가진 네거티브 쌍을 공간에서 임베딩하기 위해 이미지와 텍스트 인코더를 훈련한다.
(3) 인터넷의 이미지-텍스트 쌍을 학습한 기존 CLIP과 다르게 BiomedCLIP은 이를 적용해 특별한 의생명과학 이미지와 텍스트에 맞게끔 접근한다.
(4) 이러한 접근은 GPT-2를 텍스트 인코더로 사용하는 대신 PubMedBERT를 사용하고 토크나이저와 문맥 사이즈를 적응시켜 더 긴 의생명과학 글을 읽을 수 있게 한다.
(5) 이 접근은 두 개와 대조된다. PubMedCLIP은 PubMed Central의 제한된 데이터셋을 사용하는 기존 CLIP을 파인튜닝하고 MedCLIP은 의료지식을 학습단계로 통합하지만 기존 CLIP의 형식에 갇힌다.
(6) BiomedCLIP은 자세한 시각 정보를 파악하기 위한 더 큰 vision transformer 모델과 더 높은 이미지 해상도를 활용하며 이미지 처리에서 특정 도메인 적용이 가능하다.
(1) 하위 단계 작업이 가장 성능 향상에 중요하다.
(2) 일반 도메인에서는 성능 향상을 위해 사전학습 모델을 직접 비교분석을 가능하게 하는 복잡한 기준을 사용했다.
(3) 그와 반대로 의생명과학 VL 처리에서는 하위작업 평가에서 다른 작업과 데이터셋을 사용했다.
(4) 의생명과학 VL 사전학습을 가능하게 하고 의생명과학 VL 처리를 빠르게 하려고 중요한 하위 작업울 포함하는 8개의 VL 데이터셋을 통합했다
(1) 대응하는 이미지-텍스트 쌍, 텍스트-이미지쌍을 검색하는 크로스모달 검색을 평가했다.
(2) 이러한 검색 작업은 다양한 이미지 검색과 실제 적용에서의 텍스트 생성을 반영하며 별도 분리된 이미지-텍스트 쌍으로 자동 평가한다.

(3) CLIP이 의생명과학 도메인에서 성능이 안 좋아 도메인 특화 VLM이 필요
(4) 반대로, BiomedCLIP은 검색 성능이 좋았음.
(5) PubMedCLIP은 CLIP보다 성능 안 좋았음. CLIP 사전학습용 매우 작은 영상의학 이미지-텍스트 쌍만 사용함.
(6) 계속 보수 없이 소규모 데이터셋으로 사전학습할 경우 전부 다 잊어버릴 수도 있음.

(7) 위 그림은 텍스트 프롬프트가 주어진 상위 4개의 이미지 검색 결과. 정답이 노란 박스로 표기되어 있음.
(8) 일반 CLIP은 ‘흉부 엑스레이’와 같은 흔한 키워드를 이미지에 매칭시킬 수 있지만 ‘흉막 삼출’, ‘방추세포’, ‘동맥 스핀 라벨링(ASL)’ 과 같은 미묘한 의미는 구별하지 못함.
(9) 하지만 BiomedCLIP은 그뿐만 아니라 ‘오른쪽의 거대한 흉막 삼출’과 같은 고수준의 디테일을 인식.
(1) BiomedCLIP의 의생명과학 이미지 분류 성능 평가를 위해 5개의 데이터셋을 이용.

(2) 분류를 위해 클래스를 설명하는 짧은 텍스트 프롬프트를 사용하는 BiomedCLIP 모델의 제로샷 성능 조사.
(3) 제로샷에서 성능이 좋았으며 최고 accuracy를 달성.
(4) PubMedCLIP은 영상의학 데이터를 사용하여 지속적으로 사전 학습을 수행했기에 RSNA 벤치마크에서는 일반 도메인 CLIP보다 성능 좋음. 하지만 LC25000 및 TCGA-TIL과 같은 디지털 병리학 벤치마크에서는 일반적으로 저조.
(5) PLIP은 소셜 미디어의 디지털 병리학 데이터로 사전 학습되어 일부 병리학 벤치마크에서는 높은 성능. 하지만 RSNA에서는 낮은 성능. PCam에서도 저조. PCam의 병리학 이미지(전이성 종양이 있는 림프절)가 PLIP 학습에 포함 안 됐을 것.
(6) Med-Flamingo는 교차 배치된 이미지-텍스트 데이터에서 퓨샷 학습기로서 사전 학습, 해당 데이터는 VQA로 구성. 이 모델은 프롬프트 템플릿이나 테스트 예시와 관계없이 항상 동일한 답변이나 선택지를 생성. 이는 제로샷 멀티모달 추론 능력을 제한하고 폐쇄형 분류를 위한 지시사항 이행 능력을 저해하는 모델 특유의 사전 학습 방식 때문.
(8) 반면, BiomedCLIP은 다양한 이미지 소스의 모든 데이터셋에서 좋은 결과를 얻음, 기초 VLM 구축에 다양하고 대규모인 데이터셋으로 사전 학습하는 것이 중요.

(9) 리니어 프로빙(linear probing)으로 PCam과 RSNA에서의 퓨샷, 풀샷 성능을 평가.
(10) BiomedCLIP이 RSNA에서 BioViL 능가. + 10%의 레이블된 데이터만 사용하고도 전체 데이터 BioViL 성능보다 좋음.
(11) BiomedCLIP 사전 학습의 영상의학 이미지는 BioViL의 MIMIC-CXR 데이터보다 적고 이미지-텍스트 쌍 노이즈 심함. 따라서 RSNA에서 BiomedCLIP 성능이 도메인 때문은 아니며 영상의학 이외의 이미지 유형을 포함해 크고 다양한 PMC-15M 데이터셋을 전반적으로 사전 학습시켜 이미지 인코더가 더 견고해졌다는 뜻.
(1) 이전 연구들을 따라 METER 프레임워크를 사용해 분류 과제로 VQA를 구성.

(2) 모델 평가는 VQ-RAD와 SLAKE. 개방형/폐쇄형 질문의 정확도와 토큰 레벨 F1 점수 기재.
(3) BiomedCLIP은 두 영상의학 벤치마크에서 SoTA인 PubMedCLIP보다 우수, 전체 정확도 상승. 특히 VQA-RAD의 개방형 질문과 SLAKE의 모든 질문 유형에서 큰 차이.
(4) BiomedCLIP은 훨씬 큰 Med-PaLM M 및 지시어 인식 파인튜닝을 거친 BiomedGPT-B 모델과 대등. BiomedCLIP을 핵심 비전 인코더로 LLaVA 프레임워크에 통합하고 개방형 지시사항을 따르도록 파인튜닝한 LLaVA-Med는 두 데이터셋 다 가장 높은 성능.

(5) 추가로 PubMedCLIP 논문에서 가장 난이도가 높았던 사례들로 BiomedCLIP을 평가. PubMedCLIP같은 모델은 정답 못 맞춤. 4C에선 정답 X, 4D에선 질문 이해 X, 하지만 BiomedCLIP은 정답.
(6) 가장 난이도가 높았던 4B에서 MEVF는 신체 부위를 잘못 식별, QCR과 PubMedCLIP은 질문을 예/아니오로 판단. BiomedCLIP도 틀렸지만 가장 정확하게 장기 식별.
(7) 의료 VQA는 텍스트와 이미지 이해 능력을 동시에 요구하기에 PMC-15M에 포함된 방대한 양의 병렬 이미지-캡션 쌍 덕분에 이런 좋은 성능이 나옴.
(1) BiomedCLIP과 PMC-15M이 소유권이 있는 환자 데이터의 개인정보 보호 분석에 활용될 수 있는지 조사.
(2) 비공개 환자 데이터는 보안으로 외부 모델과 공유하는 것이 금지, 이로 인해 임상의들이 최신 모델 활용에 제약.
(3) 대신 PMC-15M을 비공개 환자 데이터의 프록시로 활용.
비공개 데이터 포인트를 외부 모델에 노출하지 않고도 분석 가능해짐.
(4) 이러한 근사치 분석의 정확도를 테스트함.

(5) Providence로부터 영상의학 이미지와 관련 임상 보고서를 수집하여 이를 비공개 환자 데이터로 간주 후, 비공개 데이터에 할당된 CheXbert 기반 레이블과 PMC-15M에서 검색된 가장 유사한 데이터 포인트들에 할당된 레이블을 비교.
(6) Recall과 F1에서 높은 일치도. PLIP이나 CLIP보다 높음.
폐 음영(Lung Opacity)과 무기폐(Atelectasis, 찌그러진 폐)에서 각각 88.80과 95.04의 재현율.
(7) 반면, 심비대(Cardiomegaly)에서는 BiomedCLIP이 CLIP보다 낮은 재현율. → 과학 논문의 캡션이 실제 임상 보고서만큼의 모든 의학적 상태를 다루지는 못 한다는 한계.

(8) Providence의 비공개 예시 이미지와 BiomedCLIP으로 검색된 상위 3개의 PMC 이미지 비교 분석.
(9) 검색된 PMC 이미지들의 캡션이 비공개 이미지 임상 보고서의 주요 소견들을 충분히 다룸.
(1) 이 연구가 관련 연구 중에서 가장 방대. 이전 데이터셋들보다 최소 몇 십배 크고 다양한 범위의 의생명과학 이미지를 포괄.
(2) 의생명과학 도메인에 특화된 적용 방법에 대해 연구했으며 의생명과학 VL 처리를 위한 BiomedCLIP을 제안.
(3) 8개의 표준 의생명과학 데이터셋 대상 실험에서 BiomedCLIP은 크로스모달 검색, 이미지 분류, VQA에서 SOTA. 다양한 의생명과학 이미지 작업에서 BiomedCLIP가 뛰어나며, 다양한 데이터를 활용한 대규모 사전 학습의 이점임.
(4) 또한 의생명과학 멀티모달 표현 학습과 밀접한 관련. 기존 VL 사전학습 연구는 대부분 제한된 양의 학습 데이터를 가진 흉부 엑스레이가 주제.
(5) ConVIRT는 자기 지도 학습을 위해 자연적으로 발생하는 의료 이미지-텍스트 쌍을 사용하는 방식을 개척, VL 사전 학습에서 대조 학습 잠재력 표함. 해당 이미지 인코더는 흉부 엑스레이 분류 및 검색과 같은 하위 작업에 기여.
(6) 하지만 텍스트 인코더는 일반 도메인용 어휘 사전이기에 의료 텍스트 처리 시 의료 어휘 사전 외 단어 튀어나옴. 워드피스 토큰화(word-piece tokenization)로 어느정도 해결할 수 있으나 일반적인 의생명 용어들이 쪼개지며 성능이 저하.
(7) GLoRIA는 동일한 일반 도메인용 어휘 사전을 사용해 짝지어진 보고서 내의 단어들과 이미지 영역별 어텐션 가중치를 대조해 의료 이미지의 전역/지역 표현을 공동 학습하여 ConVIRT를 확장.
(8) LoVT 또한 이미지 영역과 보고서 문장의 지역 표현을 정렬하는 유사한 사전 학습 방식을 제안.
(9) 이후 [41]은 의료 이미지의 지역적 특징과 텍스트 사이의 상호 정보량을 최대화하여 멀티모달 표현을 학습.
(10) PubMedCLIP은 PMC-15M에 비하면 아주 작은 ROCO 데이터셋(PubMed에서 수집)의 8만 방사선 이미지-캡션 쌍으로 원본 CLIP 파인튜닝.
(11) [43]은 이미지 또는 텍스트 전용 데이터에는 마스크 기반 VL 모델링을 사용, 이미지-텍스트 쌍 데이터에는 이진 교차 엔트로피(BCE)를 사용하는 믹스업 이미지-텍스트 사전 학습용 트랜스포머 프레임워크를 제안. 분류, 검색, 이미지 재생성이라는 세 가지 CXR 응용 분야에서 사전 학습된 모델 채택의 이점을 입증.
(12) MedCLIP도 이미지 전용 및 텍스트 전용 데이터를 포괄하도록 대조 학습을 확장. 이들은 가양성을 완화하기 위해 추가적인 의료 지식을 주입.
(13) MedAug는 환자 메타데이터를 활용해 동일 이미지의 증강을 넘어선 양성 이미지 쌍을 선택.
(14) BioViL은 CXR 이미지와 보고서에 맞춤화된 방사선 특화 의미론적 모델링을 통해 자기 지도 비전-언어 처리에서의 대조 학습을 개선, 방사선 자연어 추론 및 다양한 CXR 벤치마크에서 SOTA.
(15) [45]는 CXR 자기지도 멀티모달 사전학습이 CXR 해석에 있어 ImageNet 사전학습 모델보다 우수.
Methods
PMC-15M
PMC-Fine-Grained-46M
일관되지 않은 라벨링 스타일, OCR 오류, 하위 그림에 대한 라벨의 모호한 위치와 같은 다양한 과제를 극복. OCR 텍스트에 대한 문자열 매칭, OCR 실수를 수정하기 위한 레이아웃 분석, 라벨과 패널을 매칭하기 위한 영역 기반 휴리스틱 등 고급 기술.
Cross-modal retrieval
Biomedical image classification
PatchCamelyon (PCam): 림프절 절편의 조직병리 스캔에서 가져온 327,680개의 컬러 이미지(96x96px)를 포함하며, 전이 조직 포함 여부를 나타내는 이진 라벨이 지정Medical Visual Question Answering
METER 프레임워크 활용. 이는 VQA 작업을 분류 작업으로 구분. METER의 핵심 모듈은 이미지와 텍스트 인코딩에 대해 교차 모달 표현을 생성하는 트랜스포머 기반의 공동 어텐션(co-attention) 멀티모달 융합 모듈입니다.
VQA-RAD와 SLAKE 데이터셋에서 정확도(Accuracy)와 토큰 수준 F1 지표를 사용하여 평가.
VQA-RAD는 임상의가 수동으로 구성한 315개의 방사선 이미지와 3,515개의 질의응답 쌍. SLAKE는 숙련된 의사가 주석을 단 642개의 방사선 이미지와 7,000개 이상의 질의응답 쌍, VQA-RAD보다 더 많은 신체 부위를 다룸.
Privacy-preserving proprietary data analysis
Providence Healthcare organizatio에서 980개의 흉부 엑스레이 이미지와 관련 임상 보고서를 수집하여 이를 proprietary data로 취급. BiomedCLIP을 이미지-이미지 검색에 사용하여 PMC-15M 데이터셋에서 가장 유사한 이미지를 찾음.
계산 효율성을 최적화하기 위해 두 단계로 PMC-15M을 다운샘플링.
Proprietary images에 대해 해당 임상 보고서의 Findings(소견) 및 Impression(인상) 섹션에 CheXbert를 실행하여 No Findings(소견 없음)를 제외한 13개의 CheXbert 라벨을 획득.