[nlp][논문리뷰] Instructive GPT (업데이트 예정 : APPENDIX 내용 추가 분석 필요!)

이영락·2024년 10월 23일

CV & NLP 논문 리뷰

목록 보기
10/14

5주차

status: Finished!
스터디 주제: 주제 : Instructive GPT
1. 논문에서 이해하면 좋을 포인트
• Instruct GPT 등장 배경
◦ 인간의 의도(Human Feedback)을 반영하고자 하게 된 계기: 크게 Untruthful, Toxic, Not helpful to User와 같은 상황들
▪ 기존 모델 GPT-3와의 모델이 생성하는 결과(generated response) 상 차이 비교
• 제안한 Method인 3 steps에 대한 이해
◦ 논문에서는 SFT 모델과 RM 모델을 만들어서 RLHF에 활용 (최근에는 DPO 사용하는 게 트렌드. RM 모델 필요 없음)
▪ 어떤 단계에서 어떤 데이터셋들을 human이 직접 labeling해서 제작했는지
1. 추가적으로 생각해볼만한 포인트
◦ Instruct(지시문)을 prompt 구성 시 추가하여 모델에 인풋함으로써 어떻게 지시 내용을 반영하는 응답을 생성할 수 있는지: 기본적으로는 동일하게 Causal하게 다음 step의 토큰을 생성하는 NTP(Next Token Prediction)
◦ 강화학습 과정에서 Actor와 Critic이 Instruct GPT에서는 각 어떤 건지: Actor는 SFT 언어모델, Critic: RM 보상모델
◦ 모델 서비스 출시 이후 실제 사용자의 Human preference를 모델에 추가 align하고자 한다면 어떤 방식으로 데이터를 수집해서 반영할 수 있을지: 예를 들면 챗봇 채팅 결과에 대한 사용자의 thumbs up/down을 수집해서 RM 모델 학습에 활용
▪ 구현 가능한 RM 모델 방식: RM 모델의 아웃풋은 scalar로, 구체적으로는 예를 들면 논문에서는 Reward를 생성 결과별로 라벨러가 매긴 비교순위(1위, 2위, 3위, 4위)로 설정해주었지만, 다른 점수(예. 1(좋음), 2(나쁨))으로 구성해줄 수도 있을 거에요
• 그런데 최근에는 DPO 데이터셋으로 alignment를 많이 하는데 이때는 기본적으로 {입력 텍스트-선호(prefer)하는 모델 응답-비선호(reject)하는 모델 응답} pair로 tuning에 활용하니 좀 다른 구조로 데이터를 준비할 필요성도?
주차: 5주차

참고자료



[논문리뷰] Training language models to follow instructions with human feedback (InstructGPT / RLHF)

1 | 논문정리


1. Introduction

대형 언어 모델(LM)은 task의 몇 가지 예를 입력으로 제공하여 다양한 자연어 처리(NLP) task를 수행하도록 “프롬프트”될 수 있다. 그러나 이러한 모델은 사실을 꾸며내거나 편파적이거나 유해한 텍스트를 생성하거나 단순히 사용자 명령을 따르지 않는 것과 같은 의도하지 않은 동작을 표현하는 경우가 많다. 이는 최근 많은 대형 LM에서 사용되는 언어 모델링 목적 함수(다음 토큰 예측)가 “사용자의 지시를 유용하고 안전하게 따르기”라는 목표와 다르기 때문이다. 따라서 저자들은 언어 모델링 목적 함수가 일치하지 않는다고 말한다. 이러한 의도하지 않은 동작을 방지하는 것은 수백 개의 애플리케이션에서 배포 및 사용되는 언어 모델에 특히 중요하다.

  • 사용자의 의도에 따라 작동하도록 언어 모델을 학습시켜 일치시키는 작업을 진행.
    • 명령을 따르는 것과 같은 명시적 의도와 진실을 유지 + 편향되거나 유해한 것과 같은 암시적 의도
  • 언어 모델을 일치시키기 위한 fine-tuning 접근 방식에 중점을 둠 → 구체적으로 인간의 피드백을 통한 강화 학습 (RLHF)을 사용하여 GPT-3를 fine-tuning하여 광범위한 종류의 명령을 따르도록 함.
    • 이 테크닉은 인간의 선호도를 reward로 사용하여 모델을 fine-tuning한다.

      🤫

      인간의 선호도로 fine-tuning 방식 = InstructGPT

      STEP1. 40명으로 구성된 팀을 고용하여 스크리닝 테스트의 성과에 따라 데이터에 레이블을 지정.

      STEP2. OpenAI API3에 제출된 프롬프트와 일부 레이블러가 작성한 프롬프트에서 원하는 출력 동작에 대한 사람이 작성한 데모 데이터셋을 수집

      STEP3. 지도 학습 baseline을 학습

      STEP4. 더 큰 API 프롬프트 셋에서 모델의 출력 사이에 사람이 레이블을 지정한 비교 데이터셋을 수집.

      STEP5. 이 데이터셋에서 reward model(RM)을 학습시켜 레이블러가 선호하는 모델 출력을 예측한다.

      STEP6. RM을 PPO 알고리즘의 reward function으로 사용하고 지도 학습 baseline을 fine-tuning하여 이 reward를 최대화한다.

      → 이 절차는 GPT-3의 동작을 “human values”라는 더 넓은 개념이 아닌 특정 그룹의 사람들(대부분 레이블러 및 연구원)의 명시된 선호도에 맞춘다. 결과 모델을 InstructGPT라고 한다.

  • 저자들은 주로 레이블러가 테스트셋에서 모델 출력의 품질을 평가하도록 하여 모델을 평가한다.
    • 이 테스트셋은 hold-out 고객(학습 데이터에 없음)의 프롬프트로 구성.
    • 다양한 공개 NLP 데이터셋에 대한 자동 평가를 수행.
    • 세 가지 모델 크기(1.3B, 6B, 175B)로 학습 (모델: GPT-3 아키텍처)
🍭

논문의 주요 결과

  1. 레이블러는 GPT-3의 출력보다 InstructGPT 출력을 상당히 선호한다.
  2. InstructGPT는 GPT-3보다 향상된 진실성을 보여준다.
  3. InstructGPT는 GPT-3에 비해 유해성이 약간 개선되었지만 편견은 없다.
  4. RLHF fine-tuning 절차를 수정하여 공개 NLP 데이터셋의 성능 회귀를 최소화할 수 있다.
  5. InstructGPT는 학습 데이터를 생성하지 않은 “hold-out” 레이블러의 선호도에 대해 일반화된다.
  6. 공개 NLP 데이터셋은 언어 모델이 사용되는 방식을 반영하지 않는다.
  7. InstructGPT는 RLHF fine-tuning 분포 외부의 명령에 대한 유망한 일반화를 보여준다.
  8. InstructGPT는 여전히 간단한 실수를 범한다.

→전반적으로, 인간의 선호도를 사용하여 대규모 언어 모델을 fine-tuning하면 광범위한 task에서 동작이 크게 개선되지만 안전성과 신뢰성을 개선하기 위해 많은 연구가 남아 있음을 나타냄.

instructgpt-fig2.png

3. Methods and Experimental Details

3.1 High-level Methodology

: 본 연구의 방법론은 Ziegler et al. (2019)와 Stiennon et al. (2020)의 연구에서 영감을 받았으며, 이들은 해당 방법론을 스타일 지속성과 요약 작업에 적용.

→ 이 논문에서도 비슷한 방식으로 사전 훈련된 언어 모델을 기반으로 하여, 원하는 출력과 일치하는 입력 프롬프트의 분포와, 훈련된 인간 레이블러 팀을 사용해 다음 3단계로 작업을 수행.

🍭

Step 1: Demonstration Data Collection and Supervised Policy Training (데모 데이터 수집 및 지도 정책 학습)

  • 레이블러들이 입력 프롬프트 분포에 대해 원하는 행동을 시연하고, 그 시연 데이터를 바탕으로 지도 학습을 통해 사전 훈련된 GPT-3 모델을 미세 조정합니다.

Step 2: Comparison Data Collection and Reward Model Training (비교 데이터 수집 및 보상 모델 학습)

  • 모델 출력 간 비교 데이터를 수집하고, 레이블러들이 선호하는 출력을 나타내는 비교 데이터를 통해 보상 모델을 학습한다. 이 보상 모델은 인간이 선호하는 출력을 예측하도록 설계된다.

Step 3: Policy Optimization via PPO (PPO를 사용한 정책 최적화)

  • 보상 모델에서 도출된 출력을 스칼라 보상으로 활용하여, PPO 알고리즘(Schulman et al., 2017)을 사용해 지도 정책을 최적화.

→ 단계 2와 3은 반복적으로 수행됩니다. 현재의 최상의 정책에 대한 비교 데이터를 추가로 수집하여 새로운 보상 모델과 새로운 정책을 학습하는 과정을 반복할 수 있다. 실험적으로 대부분의 비교 데이터는 지도 학습된 정책에서 수집되었고, 일부는 PPO 정책에서 수집되었다.

3.2 Dataset

: **OpenAI API**를 통해 제출된 텍스트 프롬프트로 구성, 구체적으로는 **InstructGPT** 모델(이전 버전)을 사용해 수집.

  • Playground 인터페이스에서 수집
  • API 사용자들에게 데이터가 추가 모델 학습에 사용될 수 있음을 사전에 고지.
  • 데이터 수집 방식: 데이터셋의 중복을 피하기 위해 동일한 긴 공통 접두사를 공유하는 프롬프트는 제거되었으며, 사용자 ID당 최대 200개의 프롬프트로 제한되었습니다. 또한, 개인 식별 정보(PII)가 포함된 데이터를 필터링하여 모델이 민감한 정보를 학습하지 않도록 하였습니다

초기 InstructGPT 모델을 훈련하기 위해, 레이블러들에게 직접 프롬프트를 작성하도록 요청. why?? 일반적인 GPT-3 모델로는 충분한 양의 명령형 프롬프트가 수집되지 않았기 때문!!

🍭

레이블러들에게 작성하게 한 프롬프트

  1. Plain (일반 프롬프트): 레이블러들에게 임의의 작업을 제시하도록 요청하였으며, 다양한 작업이 포함되도록 주의하였습니다.
  2. Few-shot (피드백 제공형 프롬프트): 레이블러들에게 명령과 여러 개의 쿼리/응답 쌍을 작성하도록 하였습니다.
  3. User-based (사용자 기반 프롬프트): OpenAI API 대기자 명단에서 수집한 사용 사례를 바탕으로 프롬프트를 작성하도록 요청하였습니다.

→ 생성한 주요 데이터셋

  1. SFT 데이터셋: 레이블러가 제공한 시연 데이터를 사용하여 SFT 모델을 학습하는 데 사용된 데이터셋.
  2. RM 데이터셋: 레이블러가 모델 출력을 평가하여 보상 모델을 학습하는 데 사용된 데이터셋.
  3. PPO 데이터셋: 인간 레이블 없이 강화 학습 기반 미세 조정에 사용된 프롬프트 데이터셋.

→ 각 데이터셋의 프롬프트 수

  • SFT 데이터셋: 약 13,000개의 훈련 프롬프트
  • RM 데이터셋: 약 33,000개의 훈련 프롬프트
  • PPO 데이터셋: 약 31,000개의 훈련 프롬프트

3.3 Tasks (작업)

🚨

본 연구의 훈련 작업(Task)

  1. 레이블러들이 작성한 프롬프트 데이터셋
  2. InstructGPT 모델이 사용된 초기 API에 제출된 프롬프트 데이터셋

→ 텍스트 생성, 질문 응답, 대화, 요약, 정보 추출 등 다양한 자연어 처리 작업을 포함.

→ 전체 데이터셋의 약 96%가 영어로 구성.

*Section 4.3에서는 모델이 다른 언어로 작성된 지시사항에 어떻게 반응하는지와 코딩 작업에 대한 모델의 능력을 평가.

프롬프트 처리 방식:

  • 각 자연어 프롬프트는 대부분 명시적인 자연어 지시사항을 통해 작업이 지정. 예를 들어, "지혜로운 개구리에 관한 이야기를 작성하라"와 같은 방식.
  • 피드백 제공형 예시(few-shot examples)를 통해 간접적으로 작업이 지정 예를 들어, 두 가지 개구리 이야기의 예시를 제시한 후, 새로운 이야기를 생성하도록 모델을 유도할 수 있음.
  • 묵시적 지속(implicit continuation)의 방식 예를 들어 개구리 이야기가 시작된 부분만 제공하고 이야기를 이어가도록 요청할 수도 있음

레이블러들은 사용자들이 작성한 프롬프트의 의도를 최대한 정확하게 추론하며, 작업이 명확하지 않은 경우에는 입력을 건너뛰도록 요청받습니다. 또한, 레이블러들은 응답의 진실성, 편향적이거나 유해한 내용의 가능성을 고려하여 판단해야 하며, 이에 대한 지침은 Appendix B에 설명되어 있습니다. 레이블러들은 이러한 지침에 따라 최고의 판단을 내리도록 훈련받았습니다.


3.4 Human Data Collection (인간 데이터 수집)

시연 데이터(demonstration data)와 비교 데이터(comparison data)를 수집하고 주요 평가를 수행하기 위해 약 40명의 레이블러를 고용했.

  • Upwork와 ScaleAI
  • 요약 작업에서 인간 선호 데이터를 수집한 연구들(예: Ziegler et al., 2019; Stiennon et al., 2020; Wu et al., 2021)과 비교해, 본 연구는 훨씬 더 넓은 범위의 작업
  • 논란이 될 수 있는 주제나 민감한 주제도 포함될 수 있음

레이블러 선정:

  • 다양한 인구 집단의 선호도를 고려할 수 있으며, 잠재적으로 유해한 출력을 잘 식별할 수 있는 레이블러를 선정하는 것이 목표였습니다. 이를 위해 특정 스크리닝 테스트를 설계하여, 이러한 축에서 레이블러들의 성과를 측정했습니다.

훈련 및 평가 중 발생할 수 있는 충돌:

  • 훈련과 평가 과정에서 사용자의 요청이 잠재적으로 유해한 응답을 요구할 경우, 정렬 기준이 충돌할 수 있습니다. 훈련 중에는 사용자에게 도움이 되는 응답을 우선시했지만, 최종 평가에서는 진실성과 무해성을 우선시했습니다. 이는 최종적으로 연구에서 중요한 기준

레이블러와의 협력:

  • Stiennon et al. (2020) 연구와 마찬가지로, 연구 기간 동안 레이블러들과 긴밀히 협력했습니다. 레이블러들을 대상으로 온보딩 과정을 거쳐 프로젝트에 대한 교육을 실시하고, 각 작업에 대해 상세한 지침을 작성했으며, 레이블러들의 질문에 답할 수 있는 공유 채팅룸도 마련

추가 연구:

  • 모델이 다른 레이블러들의 선호도에 얼마나 잘 일반화되는지 평가하기 위해, 훈련 데이터 생산에는 참여하지 않은 별도의 레이블러 그룹을 고용했습니다. 이 레이블러들은 동일한 벤더를 통해 고용되었지만, 스크리닝 테스트는 거치지 않았습니다.

레이블러 간 일치율:

  • 작업의 복잡성에도 불구하고, 레이블러 간의 일치율이 매우 높게 나타났습니다. 훈련에 참여한 레이블러들 간의 일치율은 72.6 ± 1.5%였으며, 별도의 평가용 레이블러들 간의 일치율은 77.3 ± 1.3%였습니다. 참고로, Stiennon et al. (2020)의 요약 작업에서는 연구자 간 일치율이 73 ± 4%였습니다.

3.5 Model

: Brown et al. (2020)의 `GPT-3 사전 훈련된 언어 모델`을 기반으로 실험을 시작합니다.

→다양한 다운스트림 작업에 적응할 수 있지만, 그 행동이 명확하게 규정되지 않은 부분이 있었습니다.

→ 우리는 세 가지 다른 기술을 사용하여 모델을 훈련했습니다.

1. Supervised Fine-Tuning (SFT)

  • 우리는 레이블러 시연 데이터를 사용하여 GPT-3을 지도 학습으로 fine-tuning.
  • 16번의 에포크 동안 학습을 진행했으며, 코사인 학습률 감소(cosine learning rate decay)와 0.2의 잔차 드롭아웃(residual dropout)을 사용했습니다.
  • 최종 SFT 모델 선택은 검증 세트에서 보상 모델(RM) 점수를 기준으로 이루어짐.
  • *Wu et al. (2021)의 연구와 유사하게, 우리는 SFT 모델이 1 에포크 후 검증 손실에서 과적합(overfitting)을 일으키는 것을 발견했지만, 더 많은 에포크 동안 학습하면 과적합에도 불구하고 RM 점수와 인간 선호 평가가 개선되는 것을 확.

2. Reward Modeling (RM)

  • 우리는 SFT 모델에서 최종 unembedding 레이어를 제거한 후, 프롬프트와 응답을 입력받아 스칼라 보상(scalar reward)을 출력하는 모델을 훈련.
  • 본 논문에서는 6B RM 모델만을 사용했습니다. why?? 계산 비용을 절감할 수 있었고, 175B RM 모델의 경우 학습이 불안정하여 강화 학습 중에 가치 함수로 사용하기 적합하지 않았기 때문입니다.
  • *Stiennon et al. (2020)의 연구에서처럼, RM은 동일한 입력에 대해 두 모델 출력 간의 비교 데이터셋에서 학습. 여기서 교차 엔트로피 손실을 사용하며, 비교 데이터는 인간 레이블러가 한 응답을 다른 응답보다 선호할 확률을 나타냄.

3. PPO를 사용한 정책 최적화 (Reinforcement Learning with PPO)

  • 우리는 SFT 모델을 환경에서 PPO(정책 최적화 알고리즘)로 미세 조정했습니다. 환경은 랜덤 고객 프롬프트를 제시하고 이에 대한 응답을 기대하는 밴딧 환경.
  • 프롬프트와 응답을 바탕으로 보상 모델이 보상을 결정하고 에피소드를 종료.
  • KL 패널티를 도입하여 보상 모델의 과도한 최적화를 방지하고, 강화 학습 중 PPO-ptx 모델에서는 사전 학습 손실을 강화 학습 손실에 혼합하여 공공 NLP 데이터셋에서의 성능 저하를 해결했습니다.

보상 모델의 손실 함수

🍭 보상 모델의 손실 함수

loss(θ)=−12E(x,yw,yl)∼D[log⁡(σ(rθ(x,yw)−rθ(x,yl)))]\text{loss}(θ) = - \frac{1}{2} \mathbb{E}_{(x, y_w, y_l) \sim D} [\log(\sigma(r_θ(x, y_w) - r_θ(x, y_l)))]

  • (rθ(x,y))(r_θ(x, y)): 프롬프트 xx와 응답 yy에 대한 보상 모델의 스칼라 출력,
  • ywy_w: 레이블러가 선호한 응답,
  • yly_l: 덜 선호된 응답,
  • DD: 인간 비교 데이터셋.

이 함수는 보상이 주어질 때, 선호된 응답이 덜 선호된 응답보다 얼마나 더 나은지 로그 차이를 계산하여 모델을 학습시킵니다

PPO 모델과 다른 모델 비교

  • 우리는 PPO 모델을 SFT 모델 및 GPT-3과 비교.
  • 또한 GPT-3에 피드백 프리픽스(few-shot prefix)를 제공하여 명령을 따르는 모드로 전환시키는 방식(GPT-3-prompted)과도 비교했다.
  • 마지막으로, 175B GPT-3을 FLAN(Wei et al., 2021) 및 T0(Sanh et al., 2021) 데이터셋에서 미세 조정한 결과와도 비교했다.

3.6 Evaluation (평가)

모델이 '정렬(aligned)'되었는지 평가하기 위해서는 먼저 이 문맥에서 정렬의 의미를 명확히 할 필요가 있습니다. 정렬의 정의는 역사적으로 모호하고 혼란스러운 주제였으며, 이에 대한 다양한 제안이 존재해왔습니다 (Chen et al., 2021; Leike et al., 2018; Gabriel, 2020). 본 연구에서는 Leike et al. (2018)의 정의를 따르며, 사용자 의도에 부합하는 방식으로 행동하는 모델을 목표로 합니다. Askell et al. (2021)의 정의와 유사하게, 우리는 모델이 유용하고, 정직하며, 해롭지 않게 행동할 때 이를 정렬되었다고 정의합니다.

1. 유용성 (Helpfulness):

  • 모델이 유용하려면 지시사항을 따르는 것뿐만 아니라, 피드백 예시(few-shot prompt)나 Q: {질문} \n A: {응답}과 같은 해석 가능한 패턴에서 의도를 추론할 수 있어야 합니다.
  • 주어진 프롬프트의 의도가 불명확하거나 모호할 수 있기 때문에, 우리는 레이블러의 판단에 의존합니다. 이때 주요 평가 기준은 레이블러 선호도 평가입니다. 그러나 레이블러는 프롬프트를 생성한 실제 사용자가 아니기 때문에, 사용자 의도와 레이블러의 해석 사이에 차이가 있을 수 있습니다.

2. 정직성 (Honesty):

  • 생성형 모델에서 정직성을 측정하는 것은 어려운 과제입니다. 정직성을 측정하려면 모델이 산출한 응답이 모델이 '믿고 있는' 응답과 얼마나 일치하는지를 비교해야 하는데, 모델은 블랙박스이기 때문에 이러한 믿음을 추론할 수 없습니다.
  • 대신, 우리는 모델의 발언이 세계에 대한 사실과 일치하는지를 평가하는 진실성(truthfulness)을 두 가지 메트릭을 사용해 측정합니다:
    1. 폐쇄형 도메인 작업에서 모델이 정보를 임의로 생성하는 경향(“hallucinations”)을 평가합니다.
    2. *TruthfulQA 데이터셋(Lin et al., 2021)**을 사용해 모델의 진실성을 평가합니다. 다만, 이것은 진실성을 일부만 측정하는 것이며 완전한 정의는 아닙니다.

3. 해롭지 않음 (Harmlessness):

  • 언어 모델의 해로움을 측정하는 것 역시 많은 도전 과제를 안고 있습니다. 대부분의 경우, 언어 모델이 생성한 출력의 해로움은 현실에서 그 출력이 어떻게 사용되는지에 달려 있습니다.
    • 예를 들어, 모델이 유해한 출력을 생성하는 것은 배포된 챗봇에서는 해로울 수 있지만, 유해성 탐지 모델을 훈련하기 위한 데이터 증강에는 유용할 수 있습니다.
    • 초기 프로젝트에서는 레이블러들이 출력이 '잠재적으로 해로울 수 있는지' 평가하도록 했으나, 이는 출력이 궁극적으로 어떻게 사용될지에 대한 추측을 필요로 하기 때문에 중단했습니다.

4. 프록시 기준 (Proxy Criteria):

  • 이에 따라 우리는 배포된 모델에서 해로울 가능성이 있는 행동의 다양한 측면을 포착할 수 있는 더 구체적인 프록시 기준을 사용했습니다:
    • 레이블러들은 출력이 고객 지원의 맥락에서 부적절한지, 특정 보호 집단을 비방하는지, 성적이거나 폭력적인 내용이 포함되어 있는지를 평가했습니다.
    • 또한, 모델의 편향과 유해성을 평가하기 위해 RealToxicityPrompts (Gehman et al., 2020)와 CrowS-Pairs (Nangia et al., 2020)와 같은 데이터셋에서도 성능을 평가했습니다.

평가 요약

평가는 크게 두 가지로 나눌 수 있습니다:

1. API 분포에서의 평가 (Evaluations on API Distribution)

  • 주요 메트릭은 훈련에 사용된 분포와 동일한 소스에서 추출된 프롬프트의 레이블러 선호도 평가입니다.
  • 평가 시, 훈련에 포함되지 않은 고객의 프롬프트만을 선택했습니다. 그러나, 훈련 프롬프트가 InstructGPT 모델을 사용하는 방식으로 설계되었기 때문에, 이는 GPT-3 기준 모델에 불리할 수 있습니다.
  • 우리는 또한 GPT-3 모델에 제출된 프롬프트에서도 평가를 수행했습니다. 이러한 프롬프트는 일반적으로 명령을 따르는 스타일이 아니며, GPT-3을 위해 특별히 설계되었습니다.
  • 각 모델에 대해 출력이 기준 정책보다 선호되는 빈도를 계산했습니다. 175B SFT 모델을 기준으로 삼았습니다.
  • 레이블러들에게 Likert 척도(1-7)로 각 응답의 전체적인 품질을 평가하게 했고, Table 3에 설명된 메타데이터를 수집했습니다.

2. 공공 NLP 데이터셋에서의 평가 (Evaluations on Public NLP Datasets)

  • 우리는 언어 모델 안전성을 평가하기 위해 진실성, 유해성, 편향을 측정하는 데이터셋과, 질문 응답, 독해, 요약과 같은 전통적인 NLP 작업의 제로샷 성능을 평가했습니다.
  • 또한 RealToxicityPrompts 데이터셋에서 유해성에 대한 인간 평가도 수행했습니다. 이 논문에서는 샘플링 기반 NLP 작업에서 모델 샘플을 공개할 계획입니다.
profile
AI Engineer / 의료인공지능

0개의 댓글