[Paper Review] Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

Sujin Koo·2026년 7월 14일

최근 대화형 음성 모델에 강화학습을 적용하는 실험을 준비하면서 관련 연구를 찾아보았다. 그중 Moshi와 PersonaPlex에 GRPO 기반 강화학습을 적용해 상호작용 성능을 개선한 논문인 Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models를 살펴보았다.

전반적으로

  • 짧은 utterance 데이터셋 사용하되, 상황에 따라 context 제공 필요
  • 대화 내용이나 대화 타이밍은 text token 으로 접근, 음성적인 부분을 speech token 으로 접근(물론 테스트 필요; 명확히 나누어 떨어지지 않을 것으로 생각됨)
  • llm judge reward를 통한 응답 품질 저하 방지
  • 여러 종류의 reward를 함께 사용할 때 normalization 처리
    에 대한 부분을 참고하면 좋을 것 같은 논문이었다.

1. 연구 목표

Full-duplex speech model은 사용자의 음성을 들으면서 동시에 말할 수 있는 모델이다. 따라서 자연스러운 턴테이킹, 백채널, 발화 중첩, 사용자 끼어들기 처리가 가능하다. 하지만 실제 대화에서는 다음과 같은 문제가 발생한다.

  • 사용자가 말을 끝냈는데도 응답이 늦음
  • 사용자가 잠시 멈춘 것을 턴 종료로 오인하고 말을 가로챔
  • 백채널을 거의 생성하지 않음
  • 부적절한 타이밍에 말을 시작함
  • 사용자가 끼어들어도 계속 말함

저자들은 이러한 문제가 기존 supervised learning의 한계에서 발생한다고 본다. Next-token likelihood 학습은 토큰 예측에는 효과적이지만, 언제 말하고, 언제 침묵하며, 얼마나 빠르게 응답할지 같은 interaction-level behavior를 직접 최적화하지 않는다.

논문은 학습과 추론 시 입력 분포가 달라지는 exposure bias도 원인으로 언급한다. 학습 중에는 이전 정답 출력을 보지만, 추론 중에는 모델 자신의 출력을 다시 입력으로 사용하므로 작은 오류가 이후 발화 타이밍과 내용에 누적될 수 있다.


2. 기존 연구의 한계

기존에도 full-duplex model에 RL이나 preference optimization을 적용한 연구가 있었다.

  • SALMONN-omni: DPO로 barge-in과 backchannel 개선
  • ORISE: REINFORCE 기반 online RL로 noisy environment에서 interaction 개선
  • ASPIRin: Moshi에 GRPO를 적용해 interaction timing 최적화

하지만 기존 연구는 일부 행동만 다루거나 하나의 모델에만 적용했으며, timing reward를 최적화했을 때 semantic quality가 떨어질 수 있었다.

이 논문의 주요 기여는 다음과 같다.

  1. 네 가지 interaction axis를 함께 최적화

    • Pause handling
    • Turn-taking
    • Backchanneling
    • User interruption
  2. 실제 인간 대화에서 짧은 학습 segment를 자동 추출

  3. 행동별 reward 설계

    • 침묵 유지
    • 응답 지연
    • 백채널 timing F1
    • interruption 이후 응답 지연
  4. LLM Judge reward로 의미 품질 유지


3. GRPO 학습 과정

GRPO는 동일한 입력에 대해 여러 응답을 생성하고, 그룹 안에서 상대적으로 좋은 응답의 확률을 높이는 방식이다.

  1. Pause, turn-taking, backchannel, interruption 중 하나의 음성 segment를 선택한다.
  2. 모델이 같은 입력에 대해 여러 응답을 생성한다.
  3. 각 응답에 interaction reward와 semantic reward를 부여한다.
  4. 그룹 평균보다 reward가 높은 응답은 positive advantage, 낮은 응답은 negative advantage를 받는다.
  5. 좋은 응답의 생성 확률은 높이고 나쁜 응답의 확률은 낮춘다.

논문에서는 하나의 입력마다 16개의 completion을 생성했다. 또한 KL penalty를 사용해 RL 모델이 기존 pretrained model에서 지나치게 멀어지는 것을 방지했다.


4. 짧은 segment와 context 사용

이 논문의 중요한 특징은 긴 멀티턴 대화 전체를 RL sample로 사용하지 않았다는 점이다. 대신 특정 행동이 명확히 나타나는 짧은 segment만 추출해 학습했다.

다만 짧은 target segment 앞에 이전 대화 context를 함께 입력했다.

  • Loss는 target segment에만 계산
  • Context 부분은 masking
  • 최대 context 길이는 학습 중 0초에서 30초까지 증가
  • 50% 확률로 context를 사용하고, 나머지는 context 없이 학습

Context를 제거하면 멀티턴 instruction-following 성능이 감소했다. 따라서 짧은 utterance를 target으로 사용하더라도, 긴 대화로 일반화하려면 이전 문맥을 입력하는 것이 중요하다.

향후 내가 실험을 진행함에 있어 target utterance는 짧게 사용하되(데이터셋 한계), 상황에 따라 이전 대화 context를 함께 제공하는 방식이 적절해 보인다.


5. Reward 설계

Pause handling

사용자가 문장 중간에 잠시 멈춘 경우 모델은 침묵해야 한다.

  • 생성 음성에 1초보다 긴 speech가 있으면 1
  • 그렇지 않으면 0

Turn-taking

사용자 발화가 끝난 뒤 모델이 말하기 시작할 때까지의 delay가 있을 때, 빠르게 응답할수록 reward가 높다.

Backchanneling

  • 1초 이하 speech: backchannel
  • 1초 초과 speech: takeover

생성된 backchannel이 실제 위치의 ±1초 안에 있으면 true positive로 판단하고, 최종 F1 score를 reward로 사용한다.

User interruption

사용자의 끼어들기 발화가 끝난 뒤 모델이 다시 말하기 시작할 때까지의 delay를 사용한다.


6. LLM Judge Reward

Turn-taking이나 interruption에서 delay만 최적화하면 모델이 문맥과 무관한 말을 빠르게 시작하거나, “yeah”, “okay” 같은 짧고 일반적인 응답만 생성할 수 있다.

이를 막기 위해 다음 과정을 사용한다.

  1. 사용자 음성과 모델 생성 음성을 ASR로 전사
  2. 전체 대화 context와 모델 응답을 LLM에 입력
  3. 문맥 적절성과 자연스러움을 평가
  4. 해당 점수를 semantic reward로 사용

실험에서는 Parakeet TDT를 ASR로, Qwen3-235B-A22B를 Judge로 사용했다.

평가 기준은 다음과 같다.

  • 0: 무관하거나 부자연스럽거나 의미 있는 응답이 없음
  • 1: 일부 관련은 있지만 일반적이고 구체성이 부족함
  • 2: 자연스럽고 구체적이며 문맥에 일관되게 기반함

Delay reward와 LLM reward는 범위가 다르기 때문에 각각 그룹 내에서 독립적으로 정규화한 뒤 동일한 가중치로 합친다.


7. Text token만 최적화한 이유

Moshi와 PersonaPlex는 audio token과 함께 parallel text token stream을 생성한다. 저자들은 text stream이 발화 내용뿐 아니라 모델이 언제 말하고 언제 침묵하는지도 암묵적으로 제어한다고 본다.

따라서 이 논문은 GRPO objective를 계산할 때 audio token probability는 제외하고 text token probability만 사용했다.

하지만 나에 경우에는 이를 두 부분으로 나눠 볼 필요가 있다.

  • 내용을 생성하는 것: text token과 밀접함
  • 특정 말투로 말하는 것: audio token과 prosody가 더 중요함

따라서 적절한 응답을 생성하는 것은 text stream 최적화로 개선될 가능성이 있다. 하지만 같은 문장을 원하는 말투로 생성시키고자 하려면 text-token-only RL만으로 충분하지 않을 것이다.


8. 주요 결과와 시사점

Moshi와 PersonaPlex 모두 RL 이후 pause handling, turn-taking, backchanneling, interruption 성능이 전반적으로 향상되었다. 특히 Moshi의 interruption latency는 1.377초에서 최대 0.409초로 감소했고, PersonaPlex의 turn-taking latency는 0.219초에서 0.079초까지 감소했다.

LLM Judge reward를 제거하면 semantic score뿐 아니라 멀티턴 turn-taking과 instruction-following 성능도 크게 떨어졌다. 이는 interaction reward만으로 학습할 경우 의미 품질이 손상될 수 있음을 보여준다.

profile
AI 😎

0개의 댓글