CLIP 모델에 대해서 이해해보자. 지금까지 어렴풋이 알고 있던 내용은 이미지와 텍스트를 동일 공간 상에 배치하여 서로 의미를 공유하도록 정렬시키는 모델. 이게 어떻게 가능하지? 그 표현 공간은 정확한가? 공간에 대한 신뢰도를 측정할 수 있는 방법에는 무엇이 있을까?하
https://arxiv.org/pdf/2203.02053