거대한 batch를 사용한 단순구조의 정렬독립적인 image encoder와 text encoder를 사용한 배치 안에 N개의 image-text 쌍이 있다고 가정모든 이미지와 텍스트를 embedding 공간으로 보낸 후 $N\\times N$ 크기의 similiari
양방향 self-attentionMasking이 없음. 따라서 sequence 내의 token 들은 자기 자신을 포함한 sequence 내의 다른 token 들을 볼 수 있음.예를 들어, 문장의 첫 번째 단어를 처리할 때문장의 마지막 단어 정보까지 참조할 수 있음. "

참고한 블로그는 여기SHA는 다음과 같이 attention score를 계산한다.원래는 Q를 모든 token을 각각 Q로 만들어 모든 token에 대한 importance를 계산해야 하지만, matrix operation을 통해 중첩되는 반복문 구조를 없앤다. 독립적으

참고한 블로그는 여기input sequence의 길이가 서로 다를 때, sequence의 길이를 통일하기 위해 추가된 padding을 가리기 위한 것.input token의 길이를 맞추기 위해 뒤에 0 같은 padding symbol을 추가한다. 이때 실제 attent

각 Head가 자신만의 K와 V를 가지기 때문에, 모델이 새로운 token을 생성할 때마다 이전의 모든 token에 해당하는 Key-Value cache를 메모리에서 불러와야 함.이로 인해 병목 현상이 생기고, 높은 메모리 대역을 필요로 했다.하나의 context에 대
CLIP을 보면, 다음과 같이 4배로 차원을 늘리는 구간이 존재함. 차원을 늘리는 것은 정보량을 늘리는 역할을 한다. 정보량을 늘렸다가 줄이는 데에는 다음과 같은 이유가 있다. 모델의 표현력 증가 bottleneck 효과를 이용한 중요한 정보 추출 1. 모델 표현
BLIP은 LLM과 Vision Encoder를 따로 학습시키지 않고도 둘 사이를 연결하는 모듈을 잘 학습시켜 VLM task에서 좋은 성능을 낸다. 하지만 few-shot class의 classification 문제에서 성능이 떨어진다.ITC, ITM, MLMITC는

시계열 data에서 LPF를 구현하기 위해서는 average를 구하는 방식을 취한다.가령, $a_1, a_2, a_3$의 평균 $m_1$에서 새로 들어오는 값 $a_4$가 있을 경우, $\\frac{a_1-a_4}{3} + m_1$을 해서 새로운 평균 $m_1$ 을 구
Graphic 기반 접근Face2Face : 얼굴의 표정을 바꿈source영상에서 facial expression을 추출이를 target vedio에 적용함FaceSwap : 얼굴을 완전히 교체랜드마크 기반의 3d 템플릿을 만들고얼굴 자체를 변경학습 기반 접근Deepf