
positional embedding(위치임베딩)
트랜스포머는 병렬적으로 시퀀스가 한번에 올라오기에 순서정보가 없다. 따라서 위치에 더해줄 값이 필요하다.
그 값을 정할때 결과에 영향을 주면 안되기에 규칙에 따른 제약이 있다. 이 규칙을 충족하는 것은 사인 코사인 함수의 값이 포지셔널 임베딩이다.

인코더 블럭, 디코더 블럭
인풋 아웃풋이 여러 번 통과하면서, 더 나은 품질(벡터)가 된다.
multi-head attention (인코더블럭)
속도향상, 긴 시퀀스 처리능력 향상
scaled dot-product attention 이 여러게 나눠서 동신에 진행된다.
키 쿼리 벨류가 각각의 헤드에 대해 64차원으로 투영된다. 각 헤드가 입력데이터의 다른 측면을 어텐션하게된다 -> 마치 CNN의 필터와 같은 효과
add & nom
raw embedding 과 self attention 으로 변형된 값이 더해진다. 이후 정규화 되어서 나간다.
shift right
출력 시퀀스를 오른쪽으로 한단계 이동하고 시퀀스의 시작에 시작토큰(SOS)를 추가한다. -> 첫단어를 예측하기 위해서 가상의 토큰을 넣는다.
masked attention
현재 토큰을 예측할때 뒤에 정보를 가린다.
encoder-decoder attetion

과거출력 + 입력출력시퀀스 모두를 참조
인코더만 사용
모델 예시 - BERT
더 나은 임베딩 벡터만 사용
디코더만 사용
모델예시 - GPT
Bidirectional Encoder Representations from Transformers
Bidirectional (양방향), Encoder Representations (인코더 표현), from Transformers (트랜스포머에서)
출력이 768차원의 히든스테이트 벡터로 이뤄져있다.
두개의 문장이 동시에 올라간다.
CLS
입력시퀀시의 전체를 반영한 토큰
분류 작업할때 하나하나의 토큰을 보지 않고 문장만 보겠다는 뜻
SEP
두개의 문장을 구분하기 위한 토큰
다양한 문장쌍 작업을 수행
토큰 구조

-> 토큰 임베딩 - 사전 훈련된 임베딩을 통해 고정된 크기의 벡터로 변환된 각 단어의 벡터표현
-> 세그먼트 임베딩 - 두문장의 경계 인식, 각 토큰이 입력된 두개의 문장 중에서 어떤 문장에 속하는지 나타냄
-> 위치 임베딩 - 단어의 순서 정보 제공
model.get_topic_info()

정의
이미지나 비디오 내에서 객체의 위치를 식별하고 경계를 표시하는 기술
객체 탐지 방법
1) 이미지 내에서 다양한 객체를 찾아내고 각 객체의 위치를 바운딩 박스로 표시
-> 객체가 존재하는지 + 위치파악 + 이미지 분류
2) localizration(객체위치탐색) + classification(해당 상자에 포함된 객체 예측)
객체탐지의 포인트
1) 정확도
2) 속도
3) 배경의 다양성
detection 과 segentation

객체 탐지 프로세스
1) localization
-> 객체가 있을만한 경계상자(ROI) 추출
2) classification
-> 추출된 ROI에서 객체 분류
※ one-stage detectors - 객체 위치와 클래스를 동시에 예측(YOLO, SSD)
※ two-stage detectors -위치먼저 찾은 뒤 객체 탐지
성능 평가 : Mean Average Precision(mAP)
클래스에 대한 평균
모델이 다양한 임계값과 클래스에 걸쳐 얼마나 잘 작동하는지데 대한 포괄적인 지표 -> 각 클래스의 평균