딥보이스 감지 기술개발

서유리·2023년 5월 11일

AI_Study

목록 보기
28/33

⭐ 딥보이스

  • 최근 딥보이스를 사용한 보이스피싱 범죄가 증가하고 있는 상황임
  • 최근에는 인공지능을 활용하여 보이스피싱 범죄를 수사과정과 검거 과정에 사용하려는 시도가 이루어지고 있음
  • 지금까지, AI 기술을 사용한 음성탐지 모델 개발 사항은 다음과 같다
    📝행정안전부는 AI로 '보이스피싱 음성탐지 모델'을 세계 최초로 개발함
    (https://eiec.kdi.re.kr/policy/materialView.do?num=235701&topic=)(https://www.aitimes.kr/news/articleView.html?idxno=27418)
    📁 국내외 약 6,000여 명으로부터 추출한 100만 개 이상의 외국어와 한국어 음성데이터를 활용
    📁 특히 한국어의 경우, 약 10만 개 이상의 일반인 음성데이터와 국과수가 보유 중인 실제 보이스피싱 사기범 음성데이터를 함께 사용하여 다양한 학습 과정성능 검증과정을 반복 시행함으로써 보이스피싱 화자 구분 등에 필요한 최적의 알고리즘
    ▶ 성능 검증결과, 범죄자의 음성을 정확하게 판별해내는 판독률이 기존 외산 분석모델 대비 약 77% 향상
  • 하지만...요즘에는 딥보이스를 활용한 범죄가 많이 일어남
  • 그러나, 아직까지 딥보이스 탐지 기술 연구는 부족함
    (https://news.mt.co.kr/mtview.php?no=2023021121345770356)
    🎯 딥보이스 탐지를 어떻게 개발할 수 있을까?
    🟠 딥보이스란? (= 딥페이크)
  • 인공지능의 딥러닝(심화학습) 기술로 '진짜 같은 가짜(fake)' 목소리를 만드는 목소리 바꿔치기 기술
  • 누군가의 음성 파일을 따서 다른 사람의 입모양에 덧씌우는 음성합성 기술이나 게임 등에서 이용자의 목소리를 캐릭터의 소리로 바꿔주는 음성변조 기술이 범죄에 악용되고 있음
    🟠 딥보이스의 핵심은 진짜 음성/가짜 음성을 구분할 수 있어야 함
    🤔 진짜/가짜를 어떻게 구별할 수 있을까?
    🧐 사실... 너무 막막해서 먼저, [EIRIC 세미나] 딥페이크 음성 탐지 기술 (정수환)교수님의 영상을 보고자 함 (https://www.youtube.com/watch?v=mnn1OqYAdW0)

⭐ 영상 보며 정리/요약
🌝 Audio Deepfake 생성
: 딥러닝 음성 합성을 통해 새로운 음성 컨텐츠 생성하는데, 아마존 Re:MARS 2022 컨퍼런스에서 할머니 목소리 학습을 통해 책을 읽어주는 알렉사 서비스 소개함 (2022. 06)/ 1분 or 30초, 최근 논문에는 5초의 음성만으로 다른사람의 목소리를 가져올 수 있음
🗣 Deepfake 음성 합성 기술 TTS (Text-to-Speech) voice synthesis는 순식간의 target 데이터와 딥러닝을 통해 원하는 내용(text)의 target 음성(speech)을 생성할 수 있음. 또한, 딥러닝 적용을 통해 target의 실제 목소리와 거의 유사한 음성 확보가 가능
🗣 Voice Conversion (Speech-to-Speech) synthesis는 Linguistic contents의 변화없이 target 음성과 비슷하게 생성. TTS 대비 음성의 품질은 다소 낮음
🗣 딥러닝 기반 다양한 음성 합성모델이 계속 개발되고 있음
🗣 최신 TTS 음성 합성 모델과 성능

  • Tacotron2 (구글), FastSpeech2, VITS (카카오 ENT)
  • JETS : JETS: Jointly Training FastSpeech2 and HiFi-GAN for End to End Text to Speech (2022)
    🗣 Deepfake 사이트 및 앱을 통해 Deepfake 음성생성 가능
    🗣 Deepfake 보이스피싱에 악용
  • 전화사기 피해액은 국내 7,744억원 (21 경찰청 자료)
  • 보이스피싱 조직 --> 보이스의 딥러닝 학습/위조 --> 보이스수집은 유튜브, sns--> 가족/지인 음성의 보이스피싱 금전요구
  • 가짜 음성 녹취록, 가짜뉴스 등
  • 음성을 1분 정도만 수집하면, 보이스학습이 가능
    🌝 Audio Deepfake Detection
  • 가짜 합성 음성 탐지
    : Automatic Speaker Verification (ASV)
    : Spoofing Countermeasure
    : Feature-based classification 오디오 파일은 오디오 샘플의 다양한 feature 기반 데이터셋으로 변환하고 이를 다양한 머신러닝 모델을 적용하여 분류
    : Image-based classfication Mel-spectogram으로 구성된 오디오 샘플을 딥러닝에 적용하여 분류
    : 다양한 feature를 이용하는 시도가 이루어지고 있음. Hand-crafted feature (Spectrogrem, Contant Q Cepstral Coefficients, Linear/Mel Frequency Cepstral Coefficients, High Frequency)
    🗣 생물학적 요소 (Biological Factor)를 활용한 탐지
  • 영어/한국어 text 기반이 아닌, 실제 사람의 음성이 가지는 주요 특징적 (또는 생물학적) 요소로 가짜 음성 탐지
    (음성의 감정, 음성 스타일, 억양이나 톤, 호흡 패턴 등)
  • TTS 시스템은 사람의 감정이나 기침 소리가 반영된 음성을 생성X
    🗣 생물학적 요소를 활용한 탐지 (BTS, Breathing-Talking-Silence Encoding)
    : TTS는 트레이닝 전 단계에서 오디오 데이터를 전처리
    : 사람이 대화 중 생성하는 숨소리와 같은 비언어적 소리에 대한 지식X
    : 기본 RawNet2 대비 성능 향상 (46.4%)
    🗣 사전단계에서 Data Augmentation, Model Fusion, Audio Deepfake 탐지 성능 평가(Equal Error Rate;EER 오탐과 미탐의 최적값)
    😊 Automatic Speaker Verification Challenges
  • ASVSpoof 2021 --> SASV 2022 --> ADD 2022 --> ASVSpoof5
    😊 Audio Deepfake Dataset
    📁 Deepfake 음성 생성 or Deepfake 음성 탐지 Dataset
  • Korean
    : AIHUB (한국지능정보사회진흥원)
    : KSS (Kaggle)
  • English
    : ASVspoof
    : fake_or_real
    : In-the-Wild
    : PartialSpoof
    : VCC2020
    : VCTK
    : LJ Speech
    🙁 현재 Audio Deepfake Detection 기술의 한계
  • Partially Fake Audio
  • Silence utterance (무음)
  • Noise utterance (Noise/Channel Variation/Several Encoding Schemes)
  • Adverarial Deepfake
    😊 향후 연구
  • 앞에서 언급한 기술의 한계와 더불어...
  • 주변소음, 음성 전달 채널로 인한 낮은 품질의 음성에서 Deepfake 탐지
  • 성능 좋은 VC의 출현 및 실시간적 악용은 위협적이므로 VC를 악용한 Deepfake에 대한 연구 필요
    👐 Q&A
  • 과연... 어떤 Feature가 가장 효과적일까???
    : 특정 Feature 보다는 데이터셋이 더 중요함 (ex. 노이즈제거)
profile
best of best

0개의 댓글