More performant and scalable 과 SimCroP (MICCAI 2025)

Treeboy·2026년 1월 18일

CVPR준비

목록 보기
14/14

이번엔 중국과기대다. 또 fVLM 마냥 똑같은 task로 논문 두편 복사했다. 왜 이렇게 찍어내나 생각해봤는데, 사람이 워낙 많아서 그에 맞는 성과를 내기 위해 어쩔 수 없는 난사를 하는게 아닐까.

하여튼 똑같은 task 니 묶어서 리뷰하겠다.

More performant and scalable

들어가기 전에...

Reviewer 2: I still think that the author’s language is too flowery and detracts from the work personally

공감이다. 글이 난잡하고, 오타와 문법 오류도 많다. 중국어로 쓰고 LLM 돌려도 이렇게 틀리진 않을거같은데 학부생인가?

Motivation

아이디어는 간단하다. 무지성으로 contrastive learning 을 어떻게 하면 더 잘할까를 생각하지 말고, LLM 을 활용해서 report 정보를 정제하여 supervised learning 을 한 다음에 CLIP 을 하라는거다.

그게 끝이다. Supervised learning 을 하고 CLIP 을 하면 성능이 오른다는 뜻이다.

Key points

  • Image Encoder 으로는 ResNet18 을 사용
  • Qwen 보다 DeepSeek 성능이 좋았다고함
  • Zero-shot classifcation SoTA, runner-up 에는 fLVM 이랑 BrgSA 가 있었음

  • Sup AUC 가 오를 수록 CLIP 성능도 오른다고 함.
  • ASS 는 auxiliary segmentation (TotalSegmentator anatomical segmentation) 추가한거임
  • 한가지 주의할 것은, CLIP projection 에 있는 L2 normalization 을 없애야 supervised weights 를 조금 보존할 수 있다고 함.

Limitations

  • CLIP 해서 supervised 보다 성능이 많이 떨어지는데?
  • Label 이 안정확하면? Error propagation 있을 수 있음. (Reviewer 1이 LLM 라벨 정확한지부터 봐야한다고 지적함)

SimCrop

SimCrop 은 chest CT 에서 작은 finding (lung nodule 같은거) 이 있는 반면 reports 는 너무 복잡하다는 문제를 제기한다 (ViSD-Boost 랑 비슷한 narrative 이다).

들어가기 전에, vision feature fvf_v 는 CT 영상을 75% masking 하고 남은걸 ViT encoder 에 넣은 결과물이다. 아니 중요한걸 masking 해버리면 어카냐고? 나도모름 ㅋㅋ. 반면에, text feature ftf_t 는 masked & unmasked 같이 넣어서 embedding 했다 (물론 shape 때문에 그런거고 masked 가 정보를 유지한채로 가진 않음).

Similarity-driven alignment

Radiologist report 를 NsentN_{sent} 개의 sentences 로 나누고, 각 sentence 별로 unmasked patches와 similarity 를 계산하여 점수가 가장 높은 top K 를 매칭시킴. 매칭된 K 개의 patch 는 global average pooling 되어 그 sentence 의 features falignlf^l_{align} 이 됨.

이런식으로 짝지어진 pair 을 활용해 Nsent×NsentN_{sent}\times N_{sent} 의 similarity matrix 를 만들어 contrastive learning 을 진행함.

Cross-granularity fusion

Instance-level vision features: fI=GAP(fv)f^I=\mathrm{GAP}(f_v)
Word-patch level cross modal features: fW=CrossAttention(ft,fv)f^W=\mathrm{CrossAttention}(f_t,f_v)

이 두 feature 을 함께 활용해서 text reconstruction 을 수행한다

T^m=Dt(fI+fW)\hat T_m = D_t(f^I + f^W)

M3AE 라는 논문에서는 두번째인 fWf^W 부분 밖에 없었는데, global pooled feature 을 추가해서 sparse 한 병을 파악하는데 좀 도움을 주는 것이 의도임.

Results

일단 이제는 클리셰가 돼버린 classification 성능 대충 훑어보고요~ 근데 좀 흥미로운건 1% 만 썼을 때 (labeled data) 꽤 좋은 성능이 나온다. Representation learning 에서 크게 벗어나지 않나? 100% 로 Supervised learning 했을 때랑 비교가 필요하다고 생각한다.

Segmentation 이랑 ablation 도 있다!!

Segmentation results

LUNA16 은 lung nodule detection 이고 BTCV 는 abdomen organ segmentation dataset 이다. 근데 DSC 90 넘는게 어떻게 가능하지?? 쉬운 데이터셋인가. segmentation 은 다른 모델에 비해 성능 차이가 그렇게 뚜렷하지 않은 것 같다. 이정도면 그냥 random seed 바꿔가면서 돌려도 충분히 나올듯한 성능임.

Ablation study

WL 만 쓴걸 baseline 이라고 두었을 때, IL (global feature) 을 추가하는 것고 SA 를 추가했을 떄 RadChestCT 에서 3.6% 올라간 성능을 보여주었다.

Comments

  • Reviewer 2 가 fixed top-K patches 를 사용하는 것을 지적했고, 이는 해결이 되지 않았다.
  • Masked region 이 병을 포함한다면 어떻게 되는지도 해결돼지 않았다.
  • clause-level alignment and combining global and local features 는 도움이 되겠지만, 더 큰 임팩트를 위해서는 adaptive region selection and deeper integration between modalities 이 필요해 보인다.
profile
지식이 모자라서 논문리뷰를...

0개의 댓글