8/7 Today I Learned -1

boks·2024년 8월 7일
post-thumbnail

📖 학습한 내용

  • Transformer Attention
  • BERT
  • 객체 탐지

📖 핵심내용

📌 Transformer Attention

인코더 블럭

  • feed-forword network
    피드포워드 층은 활성화함수를 가지고 있기 때문에, 비선형성으로 학습을 한다. -> 모델이 더 복잡한 데이터 패턴과 관계를 학습할 수 있게 된다.
    다른 층은 가중치를 곱해주는 것 뿐이다.
  • positional embedding(위치임베딩)
    트랜스포머는 병렬적으로 시퀀스가 한번에 올라오기에 순서정보가 없다. 따라서 위치에 더해줄 값이 필요하다.
    그 값을 정할때 결과에 영향을 주면 안되기에 규칙에 따른 제약이 있다. 이 규칙을 충족하는 것은 사인 코사인 함수의 값이 포지셔널 임베딩이다.

  • 인코더 블럭, 디코더 블럭
    인풋 아웃풋이 여러 번 통과하면서, 더 나은 품질(벡터)가 된다.

  • multi-head attention (인코더블럭)
    속도향상, 긴 시퀀스 처리능력 향상
    scaled dot-product attention 이 여러게 나눠서 동신에 진행된다.
    키 쿼리 벨류가 각각의 헤드에 대해 64차원으로 투영된다. 각 헤드가 입력데이터의 다른 측면을 어텐션하게된다 -> 마치 CNN의 필터와 같은 효과

  • add & nom
    raw embedding 과 self attention 으로 변형된 값이 더해진다. 이후 정규화 되어서 나간다.

디코더 블럭

  • shift right
    출력 시퀀스를 오른쪽으로 한단계 이동하고 시퀀스의 시작에 시작토큰(SOS)를 추가한다. -> 첫단어를 예측하기 위해서 가상의 토큰을 넣는다.

  • masked attention
    현재 토큰을 예측할때 뒤에 정보를 가린다.

  • encoder-decoder attetion

    과거출력 + 입력출력시퀀스 모두를 참조

주요 응용 모델

  • 인코더만 사용
    모델 예시 - BERT
    더 나은 임베딩 벡터만 사용

  • 디코더만 사용
    모델예시 - GPT

📌 BERT

Bidirectional Encoder Representations from Transformers
Bidirectional (양방향), Encoder Representations (인코더 표현), from Transformers (트랜스포머에서)

  • 출력이 768차원의 히든스테이트 벡터로 이뤄져있다.

  • 두개의 문장이 동시에 올라간다.

  • CLS
    입력시퀀시의 전체를 반영한 토큰
    분류 작업할때 하나하나의 토큰을 보지 않고 문장만 보겠다는 뜻

  • SEP
    두개의 문장을 구분하기 위한 토큰
    다양한 문장쌍 작업을 수행

  • 토큰 구조

    -> 토큰 임베딩 - 사전 훈련된 임베딩을 통해 고정된 크기의 벡터로 변환된 각 단어의 벡터표현
    -> 세그먼트 임베딩 - 두문장의 경계 인식, 각 토큰이 입력된 두개의 문장 중에서 어떤 문장에 속하는지 나타냄
    -> 위치 임베딩 - 단어의 순서 정보 제공

  • BERT에서 토픽 클러스터링
model.get_topic_info()

📌 객체 탐지

  • 정의
    이미지나 비디오 내에서 객체의 위치를 식별하고 경계를 표시하는 기술

  • 객체 탐지 방법
    1) 이미지 내에서 다양한 객체를 찾아내고 각 객체의 위치를 바운딩 박스로 표시
    -> 객체가 존재하는지 + 위치파악 + 이미지 분류
    2) localizration(객체위치탐색) + classification(해당 상자에 포함된 객체 예측)

  • 객체탐지의 포인트
    1) 정확도
    2) 속도
    3) 배경의 다양성

  • detection 과 segentation

  • 객체 탐지 프로세스
    1) localization
    -> 객체가 있을만한 경계상자(ROI) 추출
    2) classification
    -> 추출된 ROI에서 객체 분류
    ※ one-stage detectors - 객체 위치와 클래스를 동시에 예측(YOLO, SSD)
    ※ two-stage detectors -위치먼저 찾은 뒤 객체 탐지

  • 성능 평가 : Mean Average Precision(mAP)
    클래스에 대한 평균
    모델이 다양한 임계값과 클래스에 걸쳐 얼마나 잘 작동하는지데 대한 포괄적인 지표 -> 각 클래스의 평균

📖 이후 학습 계획

profile
설계엔지니어의 변신

0개의 댓글