⭐ 딥보이스
- 최근 딥보이스를 사용한 보이스피싱 범죄가 증가하고 있는 상황임
- 최근에는 인공지능을 활용하여 보이스피싱 범죄를 수사과정과 검거 과정에 사용하려는 시도가 이루어지고 있음
- 지금까지, AI 기술을 사용한 음성탐지 모델 개발 사항은 다음과 같다
📝행정안전부는 AI로 '보이스피싱 음성탐지 모델'을 세계 최초로 개발함
(https://eiec.kdi.re.kr/policy/materialView.do?num=235701&topic=)(https://www.aitimes.kr/news/articleView.html?idxno=27418)
📁 국내외 약 6,000여 명으로부터 추출한 100만 개 이상의 외국어와 한국어 음성데이터를 활용
📁 특히 한국어의 경우,약 10만 개 이상의 일반인 음성데이터와 국과수가 보유 중인실제 보이스피싱 사기범 음성데이터를 함께 사용하여다양한 학습 과정과성능 검증과정을 반복 시행함으로써보이스피싱 화자 구분등에 필요한 최적의 알고리즘
▶ 성능 검증결과, 범죄자의 음성을 정확하게 판별해내는 판독률이 기존 외산 분석모델 대비 약 77% 향상- 하지만...요즘에는 딥보이스를 활용한 범죄가 많이 일어남
- 그러나, 아직까지 딥보이스 탐지 기술 연구는 부족함
(https://news.mt.co.kr/mtview.php?no=2023021121345770356)
🎯 딥보이스 탐지를 어떻게 개발할 수 있을까?
🟠 딥보이스란? (= 딥페이크)- 인공지능의 딥러닝(심화학습) 기술로 '진짜 같은 가짜(fake)' 목소리를 만드는 목소리 바꿔치기 기술
- 누군가의 음성 파일을 따서 다른 사람의 입모양에 덧씌우는 음성합성 기술이나 게임 등에서 이용자의 목소리를 캐릭터의 소리로 바꿔주는 음성변조 기술이 범죄에 악용되고 있음
🟠 딥보이스의 핵심은 진짜 음성/가짜 음성을 구분할 수 있어야 함
🤔 진짜/가짜를 어떻게 구별할 수 있을까?
🧐 사실... 너무 막막해서 먼저, [EIRIC 세미나] 딥페이크 음성 탐지 기술 (정수환)교수님의 영상을 보고자 함 (https://www.youtube.com/watch?v=mnn1OqYAdW0)
⭐ 영상 보며 정리/요약
🌝 Audio Deepfake 생성
: 딥러닝 음성 합성을 통해 새로운 음성 컨텐츠 생성하는데, 아마존 Re:MARS 2022 컨퍼런스에서 할머니 목소리 학습을 통해 책을 읽어주는 알렉사 서비스 소개함 (2022. 06)/ 1분 or 30초, 최근 논문에는 5초의 음성만으로 다른사람의 목소리를 가져올 수 있음
🗣Deepfake 음성 합성 기술TTS (Text-to-Speech) voice synthesis는 순식간의 target 데이터와 딥러닝을 통해 원하는 내용(text)의 target 음성(speech)을 생성할 수 있음. 또한, 딥러닝 적용을 통해 target의 실제 목소리와 거의 유사한 음성 확보가 가능
🗣 Voice Conversion (Speech-to-Speech) synthesis는 Linguistic contents의 변화없이 target 음성과 비슷하게 생성. TTS 대비 음성의 품질은 다소 낮음
🗣 딥러닝 기반 다양한 음성 합성모델이 계속 개발되고 있음
🗣 최신 TTS 음성 합성 모델과 성능
- Tacotron2 (구글), FastSpeech2, VITS (카카오 ENT)
- JETS : JETS: Jointly Training FastSpeech2 and HiFi-GAN for End to End Text to Speech (2022)
🗣 Deepfake 사이트 및 앱을 통해 Deepfake 음성생성 가능
🗣 Deepfake 보이스피싱에 악용- 전화사기 피해액은 국내 7,744억원 (21 경찰청 자료)
- 보이스피싱 조직 --> 보이스의 딥러닝 학습/위조 --> 보이스수집은 유튜브, sns--> 가족/지인 음성의 보이스피싱 금전요구
- 가짜 음성 녹취록, 가짜뉴스 등
- 음성을 1분 정도만 수집하면, 보이스학습이 가능
🌝 Audio Deepfake Detection- 가짜 합성 음성 탐지
:Automatic Speaker Verification (ASV)
:Spoofing Countermeasure
:Feature-based classification오디오 파일은 오디오 샘플의 다양한 feature 기반 데이터셋으로 변환하고 이를 다양한 머신러닝 모델을 적용하여 분류
:Image-based classficationMel-spectogram으로 구성된 오디오 샘플을 딥러닝에 적용하여 분류
: 다양한 feature를 이용하는 시도가 이루어지고 있음.Hand-crafted feature(Spectrogrem, Contant Q Cepstral Coefficients, Linear/Mel Frequency Cepstral Coefficients, High Frequency)
🗣 생물학적 요소 (Biological Factor)를 활용한 탐지- 영어/한국어 text 기반이 아닌, 실제 사람의 음성이 가지는 주요 특징적 (또는 생물학적) 요소로 가짜 음성 탐지
(음성의 감정, 음성 스타일, 억양이나 톤, 호흡 패턴 등)- TTS 시스템은 사람의 감정이나 기침 소리가 반영된 음성을 생성X
🗣 생물학적 요소를 활용한 탐지 (BTS, Breathing-Talking-Silence Encoding)
: TTS는 트레이닝 전 단계에서 오디오 데이터를 전처리
: 사람이 대화 중 생성하는 숨소리와 같은 비언어적 소리에 대한 지식X
: 기본 RawNet2 대비 성능 향상 (46.4%)
🗣 사전단계에서Data Augmentation,Model Fusion,Audio Deepfake 탐지 성능 평가(Equal Error Rate;EER 오탐과 미탐의 최적값)
😊 Automatic Speaker Verification Challenges- ASVSpoof 2021 --> SASV 2022 --> ADD 2022 --> ASVSpoof5
😊 Audio Deepfake Dataset
📁 Deepfake 음성 생성 or Deepfake 음성 탐지 Dataset- Korean
: AIHUB (한국지능정보사회진흥원)
: KSS (Kaggle)- English
: ASVspoof
: fake_or_real
: In-the-Wild
: PartialSpoof
: VCC2020
: VCTK
: LJ Speech
🙁 현재 Audio Deepfake Detection 기술의 한계- Partially Fake Audio
- Silence utterance (무음)
- Noise utterance (Noise/Channel Variation/Several Encoding Schemes)
- Adverarial Deepfake
😊 향후 연구- 앞에서 언급한 기술의 한계와 더불어...
- 주변소음, 음성 전달 채널로 인한 낮은 품질의 음성에서 Deepfake 탐지
- 성능 좋은 VC의 출현 및 실시간적 악용은 위협적이므로 VC를 악용한 Deepfake에 대한 연구 필요
👐 Q&A- 과연... 어떤 Feature가 가장 효과적일까???
: 특정 Feature 보다는 데이터셋이 더 중요함 (ex. 노이즈제거)