
Model : 과제(Task) 정의
Annotate : 주석 다는 과정
Train : 데이터를 모델에 학습시켜 봄
Test : 학습된 모델에 데이터를 Test해봄
Evaluate : 데이터 검수. 데이터가 적절히 만들어졌는지 확인하는 과정
Revise : 데이터의 수정 부분을 파악하여 Annotate를 수정하거나 과제를 조금더 확실히 정의하는 과정


문장 또는 텍스트에 대한 분류 레이블을 주석하는 유형
감성 분석, 주제 분류, 자연어 추론 등
구축 난이도는 낮은 편
텍스트의 일부를 선택하여 특정한 Label을 주석하는 유형
NER, 형태 분석 등
구축 난이도는 Task에 따라 천차만별
대상 간 관계를 주석하는 유형
관계 추출, 개체명 연결, 구문 분석 등
두 단계에 걸쳐 구축 해야 하므로 구축 난이도가 높음
주어진 텍스트에 대한 텍스트 또한 발화를 생성하는 유형
번역, 대화, 요약 등
데이터 구축 방식을 복합적으로 활용하여 다양한 정보를 주석하는 유형
질의 응답, 슬롯필링 대화 등
가이드라인 정합성
데이터 형식
통계 정보
모델 성능 확인
구축방법 측면의 오류 원인
가이드라인 측면의 오류 원인
데이터셋 측면의 오류 원인
학습모델 측면의 오류 원인
표본 추출
전수 검사
데이터 구축 기간을 넉넉하게 설정하기
검수에 충분한 시간을 확보
검수 내용을 어느 시점에 어떻게 반영할 것인가 하는 계획을 세움
작업 난이도에 따라 참여 인력을 산정하여 모집 및 관리 계획을 세움
각 단계별 작업 주체 및 검수 유형을 지정해야 함
외부 인력 및 자원을 활용할 경우 기본 단가 산정 기준을 잘 세워야 함

연산 사전 조건
세 명 이상의 관찰자 측정 값에 대한 일치도 측정
Cohen's 와 단지 관찰자 인원에 차이가 있을 뿐 나머지는 동일
N명의 관찰자라고 정했을 때, 항상 대상이 되는 N 인원을 고정시킬 필요는 없음