인터랙션 개발에 대하여(15)

Hi Beck·2023년 5월 9일

INSIGHT

목록 보기
21/25

바이노럴 녹음

바이노럴 녹음 = 음장을 포착하는 방법
스튜디오든 공연장이든 야외의 자연음이든 건강한 개인이 실제 현실 세계의 환경음을 듣는 방식과 유사하다.

실제로는 무지향성 마이크 두 개를 서로 반대방향으로 배치하고 18cm 정도 떨어뜨리면 성인의 귀 사이 거리와 비슷해진다. 이렇게 거리를 두면 마이크가 두뇌의 청각중추가 사용하는 두 귀의 시차와 강도 차이를 포착해, 사운드가 수평면(정점)을 따라 어디에서 오는지 방향을 감지할 수 있다.

현대적인 바이노럴 녹음 시스템은 보통 특수한 마네킹 머리에 내장된 마이크 캡슐 두 개로 구성되는데, 이 머리는 외부의 대측성(반대로 대칭되는) 귀 형태(귓바퀴)를 포함 해 자연적인 반사와 우리의 두뇌가 사운드 출처의 상하 각도를 판단할 때 활용하는 고주파(짧은 파장) 음파의 음조까지 포착한다. 이 시스템은 신중하게 배치된 개별 오디오 채널 두 개에서 앰비언트 사운드를 녹음해, 이런 중요한 두 귀의 시차와 귓바퀴 에서의 스펙트럼 단서를 간직한다.

일반적으로 마네킹 머리의 마이크 시스템은 청각적으로 가장 정확한 바이노럴 녹음 방식이다. 재생하면, 청취자는 실제로 녹음을 원한 정확한 지점에 있는 것처럼 가상 음향 이미지를 경험할 수 있다. 바이노럴 녹음이 미묘하고 고유한 위치 단서를 귀마다 별도로 포착하므로, 바이노럴 오디오 녹음에서 원래의 음장을 충실히 재현하려면 스테레오 헤드폰에서 재생하는 것이 공간적으로 가장 정확한 방법이다.

"마네킹 머리 녹음은 이퀄라이징이 필요하다."

마네킹 머리를 이용해 만든 바이노럴 녹음은 다른 어떤 녹음 방법과도 상당히 다르다.마네킹 머리는 사람의 머리와 같이 음장의 장애물 역할을 하므로, 마이크에 도달하기전에 복잡한 음파 굴절과 주파수 스펙트럼의 변조를 낳는다. 이 굴절과 사운드의 변조는 두 귀의 시차와 함께 우리 두뇌에 3D 공간 내 사운드 출처의 명확한 위치를 확인할 수 있게 해준다.

이제 녹음한 오디오를 헤드폰으로 재생할 때 일어나는 일을 고려해보자. 녹음된 자료를 적 절하게 이퀄라이징하지 않으면 음파가 헤드폰 스피커를 나온 후 실제로 고막에 도달하기 전에 청각 공동(외이 공동) 주변과 외이도에서 튕기면서 두 번째 왜곡과 사운드 스펙트럼 변조가 발생한다.
스피커를 통해 재생하면 청취자의 사운드 스펙트럼이 몸과 귀에 부딪히며 2차로 변조되는 더 많은 왜곡이 생겨나 비슷한 문제가 발생한다.
이런 현상 때문에, 녹음용 마네킹 머리 제조사마다 재생 전에 오디오 신호를 필터링하거나 다른 방식으로 원치 않는 왜곡을 처리하는 하드웨어 또는 소프트웨어 이퀄라이징 솔루션을 제공하고 있다.

하드웨어 솔루션 개요
시중에는 수많은 마네킹 머리 녹음 시스템이 나와있다. 제조사에 따라 일부 모델은 얼굴의 이목구비를 갖춘 반면(보통 임베드된 마이크에 도달하는 사운드 스펙트럼 전반에 는 영향이 거의 없음), 이목구비가 없는 대신 목과 상반신을 조립해서 이런 부분에서 나온 미묘한 사운드 반사를 포착하는 것도 있다. 그리고 머리와 상반신을 완전히 무시하는 것도 있다. 일반적으로 현대적 바이노럴 녹음 솔루션에서 대부분 찾을 수 있는 공통된 부분을 하나 꼽자면 대측성 귓바퀴 한 쌍으로, 귓바퀴의 스펙트럼 단서를 포착하고 좌우 녹음이 균일하게 되도록 보장한다.
그럼 세 가지 하드웨어 솔루션의 개요를 하이엔드의 프리시전 등급 시스템부터 시작해, 소비자급 유닛과 DIY 옵션 순으로 보자면, 정확히 활용하면 각각 설득력 있는 바이노럴 오디오 경험을 제시하지만, 풀 사운드 스펙트럼의 포착 정확도, 그에 따른 최종 결과물의 심도와 풍부함은 하이엔드와 로우엔드 사이에 상당한 차이가 있다.

가상 및 증강 현실 애플리케이션에서 바이노럴 녹음을 고려하는 연구원과 개발자는 활용할 하드웨어를 결정할 때 기대 품질과 사용자가 원하는 바를 세심히 고려해야 한다.

  • 현재 가장 첨단의 풀 헤드 바이노럴 녹음 시스템 기술로는 독일 헤어초겐라트
    Herzogenrath의 헤드 어쿠스틱스 GmbH를 들 수 있다.

헤드 어쿠스틱스 HMS IV 아첸 헤드
그림 8.7의 헤드 어쿠스틱스 HMS IV. 1 HEAD Measurement System IV.1은 독립형 하이 프리시 전 바이노럴 녹음 및 측정 시스템으로, 수학적으로 정의할 수 있는 상반신과 머리가 있다. 특히 단순화한 귓바퀴라는 것을 사용하는 점이 주목할 만하다.

모든 곡선, 융기 물결 모양을 실제의 귓바퀴 형태와 똑같이 만든 다른 녹음용 헤드와 달리, 헤드 어쿠 스틱스는 다른 접근법을 취한다. 음향에 필수적이라는 것이 입증된 평균적인 인간 외이의 구체적 구조를 확인한 창업자 클라우스 게누잇 박사Dr. Klaus Genuit 의 여러 해에 걸친 연구에 따르면, 귓바퀴는 '외이의 전달 기능에서 지향성 패턴에 중요한' 특성과 차원만 통합하도록 설계됐다. 단순화된 귓바퀴의 두드러진 모양은 외이 공동, 비대칭 외이도 구멍 등인데, 위치 측정 단서에 매우 중요한 부분이다.

HMS IV.1 마이크 캡슐은 녹음 헤드 측면으로 조금만 들어가 있다(5mm). 이 위치에서 음파는 보통 캡슐이 시뮬레이션된 외이도 속 더 깊이 배치됐다면 나타날 추가적 변조와 변화를 겪지 않는다. 마이크 캡슐을 인공 외이도 속에 넣지 않을 때 또 한가지 흥미로운 결과는 스윗스팟의 제한과 3D 공간 안에서의 사운드 배치에 대한 제약이 여전히 적용되긴 하지만, 포착한 오디오가 고정 스피커에서 매우 잘 재현된다는 점이 있다.

HMS IV.1은 외부 전원, 컴퓨터, 녹음장비 등에 연결하지 않고도 독립적으로 작동할 수 있다. 이러면 오디오는 유닛의 상반신 부분에 내장된 리더인 컴팩트 플래시 카드 에 녹음된다.
HMS IV.1 시스템은 선형LIN (이퀄라이징 없음), 무지향성 이퀄라이징, 프리필드 이퀄 라이징FF, 디퓨즈 필드 이퀄라이징, 커스터마이징을 위한 사용자 정의 이퀄라이징 설정이라는 서로 다른 다섯 가지 이퀄라이징 중 어떤 것이든 선택할 수 있다.

HMS IV.1은 사람의 귀에 비해 고명암비일 뿐 아니라, 중앙면을 따른 지점에서 거의 10에 가까운 주파수 반응으로 유명하다.

HMS IV.1은 주로 가장 미묘한 음향의 뉘앙스도 측정하고 포착해 연구해야 하는 기술 제품, 자동차 인테리어, 항공기 캐빈, 전화 기기의 음질 검토 및 최적화 애플리케이션 같은 하이엔드 측정기기 역할을 목표로 제작됐다는 점을 기억해두자. 따라서 이처럼 고도의 품질과 해상도를 겨냥하는 가상 및 증강 현실 애플리케이션 개발자에게는 상당한 혜택이 있을 수 있다.

3 디오사운드 프리 스페이스 프로
바이노럴 마이크 제조사로 워싱턴 밴쿠버의 3디오 제품으로,더미 헤드에 마이크 캡슐을 내장하는 방식과 달리, 그림 8.8에 있는 프리 스페이스 마이크 제품군은 머리 형태와는 완전히 다르지만, 약 18센티미터 정도의 성인 귀 사이 거리로 구분 된 디스크에 탑재된 실제와 비슷한 대측성 귓바퀴는 유지한다. 제조사에 따르면 귀 형태를 탑재한 디스크는 완벽히 현실적인 HRTF와 바이노럴 경험에 필요한 머리의 음영을 모두 제공하도록 특별히 설계됐다.

이 마이크는 고도로 유용한 두 가지 특성을 지닌다. 하나는 작은 크기로 거의 어떤 환경에서도 쉽게 녹음이 가능하다는 점이며, 다른 하나는 카메라, 그립 핸들, 삼각대를 부착할 수 있는 핫슈 hot she tshoe 어댑터가 제공된다는 점이다. 시스템은 팬텀 파워를 지원 하는 XLR 출력과 함께 휴대용 핸드헬드 녹음기로 오디오를 캡처할 수 있는 1/8인치 스테레오 출력 잭을 활용한다.

이 마이크에 쓰는 실리콘 고무 귓바퀴는 먼저 의료용 CT 스캐너(엑스선 컴퓨터 단층 촬영)로 귀 하나의 3D 스캔을 생성하고, 나온 모델을 보기 좋게 다듬고 더낮은 주파수 파장에 최적화되도록 조정한다.이 회사는 DIY 바이노럴 녹음 프로젝트에서 사용할 수 있도록 전자기기와 독립적으로 사용할 수 있는 귀 형태도 판매 한다.

인이어 입체 녹음 마이크
인공머리나 귓바퀴 형태를 완전히 배제한 채 바이노럴 녹음을 하고 싶다면, 가장 쉬우면서도 정확하고 저렴한 방법은 그냥 자기 머리와 귀를 활용하는 것이다. 바이노럴인이어 마이크 시스템은 상용으로 수십 개가 나와 있는데, 소비자 가격대의 성능과 감도 수준은 각양각색이다(피드백, 밸런스, 낮은 잡음 등). 고품질에 합리적인 가격대로는 그림 8.9의 롤랜드 CS-10EM이 있다.

이 제품은 바이노럴 마이크가 청취용과 같은 이어 버드에 내장돼, 사용자가 녹음과 동시에 모니터링할 수 있다는 점이 독특하다. 트윈 마이크 입력에 맞추기 위해, 최소한 롤랜드 R-05 같은 2채널 핸드헬드 필드 녹음기가 필요하다는 점을 기억해두자. 앞서 언급한 대로, 임베드된 위치 측정 단서를 보존하기 위해서는 좌우 채널 전용 녹음이 필수적이다.

바이노럴 녹음 파일 포맷
공학적 관점에서 바이노럴 녹음은 일반적으로 스테레오 오디오 파일과 같다. 두 개의 트랙이 있으며, 최종 편집은 어떤 포맷으로도 변환할 수 있다. 하지만 MP3처럼 흔히 사용되는 압축 파일 포맷으로 인코딩하면 최종 제품의 오디오 품질과 공간감이 상당히 떨어진다.

MP3MPEG-1 Audio Layer-3 압축은 코덱이 사람의 청각으로 듣기 어려운 오디오 주파수의 프리시전을 버리거나 감소시켜 전반적인 파일 크기를 크게 줄이는 음향 심리학 기반의 알고리즘을 활용하기 때문이다.
스마트폰의 음악 플레이리스트 등 일반적인 오디오 애플리케이션에는 MP3 포맷이 이상적이다. 바이노럴 녹음에서 이 압축 기술은 특히 구체적으로 추구하는 사운드 이벤트의 방향 단서에 극적인 영향을 줄 수 있다.

가상 및 증강 현실 애플리케이션용 바이노럴 오디오 녹음을 제작하는 연구원과 개발 자라면 항상 WAVWaveform Audio File Format, AIFFAudio Interchange File Format 같은 비압축 파일 포맷으로 녹음하고 조정해 전체 주파수 스펙트럼을 포착하고 보존해야 한다. 그런 다음 최종 제품을 믹스다운하고 포스트 프로덕션 과정에서 원하는 포맷으로 압축할 수 있지만, 음향적 디테일을 유지하려면 가능한 한 최상의 비트레이트를 유지해야 한다.

녹음된 바이노럴 오디오를 VR과 AR에서 어떻게 활용하는가?
가상 및 증강 현실 애플리케이션의 맥락에서 바이노럴 오디오 녹음을 활용하는 방법은 크 게 두 가지다.

1.환경 효과
바이노럴 녹음은 컴퓨터로 생성한 3D 시각 모델, 더 정확히 말해 특정 이벤트의 사운드 효 과와는 달리 구체적이지 않은 환경 효과를 보완하는 데 사용할 수 있다. 간단한 사례로, 동 일한 환경의 바이노럴 녹음이 결합된 숲의 3D 시각 모델을 생각해보자. 이 기술은 일부 가상 현실 게임 환경에서 사용되고 있지만, 특정 이벤트에 대한 것이 아니라 환경음을 제공하는 맥락에서만 적용된다.

2.시네마틱 VR
두 번째 방법은 360도 스테레오 동영상(혹은 단순한 스테레오 동영상)과 바이노럴 오디오 를 결합하는 것이다. 이런 종류의 적용 사례로는 뮤지션 벡의 'Sound and Vision', 뮤지션 뷰욕의 ‘Stone Milker’ 같은 뮤직 비디오가 있다. 최종 제품은 스테레오 헤드폰과 함께 스테레오 헤드마운트를 이용해 경험하게 된다.

실시간 바이노럴 사운드 합성

두 번째(그리고 현재 더 흔한 가상 및 증강 현실 애플리케이션의 바이노럴 사운드 적용 방법은 완전히 다른 접근법을 취한다.구별되는 좌우 채널로) 미리 녹음된 바이노럴 오디오를 청취자에게 제시하는 대신, 기존 모노 오디오 샘플을 7장에서 간략히 언급한 HRTF(머리 전달 함수) 측정 기반의 필터 쌍이 있는 디지털 신호 프로세서에 통과시킨다. 그러면 이런 오디오 샘플의 주파수 프로필이 조금 변조돼 사람의 상반신, 머리, 귓바퀴, 심지어는 공간의 음향 특성이 사운드에 주는 효과를 포함하게 된다. 이런 오디오 신호 수정은 문자 그대로, 두뇌가 사용하는 특정 단서를 인코딩해 현실 세계와 비견할 수 있는 정확도로 가상 사운드 출처의 정점과 상하 각도를 확인하게 해준다.

이런 디지털 필터를 통과하는 표준 사운드는 사람의 상반신, 머리, 외이를 수학적으로 재현한 것과 상호작용하면서 변조된다고도 생각할 수 있겠다. 따라서 이미 몸(혹은 마네킹 헤드)과의 상호작용으로 변조된 사운드를 녹음해 재생하는 대신, 단순한 모노 사운드를 같은 효과를 인코딩하는 디지털 필터에 통과시킨다.

방금 참조한 방법뿐 아니라, 실시간 오디오 합성에서 사용하는 HRTF와 바이노럴 사운드 외에 다른 기법도 사용할 수 있다. 예를 들어 방과 복잡한 환경 모델을 오프라인으로 직접 확보하거나 음향 물리적 모델링 접근법으로 추출할 수 있다.

HRTF 필터의 생성 방식
사람은 바이노럴 단서(두 귀의 시차 및 강도 차이)를 사용해 정점을 판단하고 모노 단서(귓바퀴의 사운드 주파수 프로필 변화)를 이용해 높이를 판단해 사운드 출처의 위치를 인지한다. 사운드의 이런 구체적 영향을 HRTF(머리 전달 함수)라 하며, 실제의 사람이나 바이노럴 녹음용 헤드 주변의 수백 개 위치에서 귀의 입구에 도달하는 경험적 사운드 측정으로 정량화할 수 있다. 이런 개별 사운드 측정은 머리 전달 자극 반응HRIR이라고 한다.
정확한 수학 용어로 HRTF는 HRIR의 단순한 푸리에 Fourier 변형, 혹은 만곡일 뿐이다.

자극 반응 측정
HRIR은 귀마다 다를 뿐 아니라, 사운드가 나온 방향에 따라서도 고유하다. 예를 들어 수직면을 따라 청취자 위의 한 지점에서 도달하는 사운드는 청취자 앞의 위치에서 도달하는 사운드와 (귀마다) 다르게 변형된다.
따라서 HRIR을 측정해, 개인의 머리(혹은 앞에 언급한 더미 헤드 중 하나) 주변에서 정 확히 정의된 수백 개의 위치에서 톤을 제어해야 한다. 더 많은 위치를 측정할수록 가상 사운드를 더 정확하게 배치할 수 있지만, 이런 데이터 포인트들 사이를 보간하는 기법에는 여러 가지가 있다.

HRIR 데이터의 프리시전 측정을 위해 수많은 방법론이 개발됐다. 보통 각각 중앙 청취 위치를 둘러싼 균등한 공간에 스피커를 배열하는 구조를 띤다. 현재 운영 중인 가장 정확한 시스템 중 하나는 오하이오 라이트 패터슨 공군 기지의 공군 연구소에 있는 오디토리 로컬라이제이션 퍼실리티ALF에 있다. 그림 8.10처럼 ALF는 직경 약 4미 터의 구체가 놓여 있는 커다란 무반향실로, 277개의 교차점마다 스피커가 배치돼 있다.

이제 당신의 귓바퀴를 친구의 귓바퀴로 바꾼다고 상상해보자. 그러면 주변 환경의 소리의 위치를 정확하게 측정하는 능력이 심각하게 줄어들 가능성이 크다. 각자의 귀 생김새의 차이를 감안하면 이는 놀라운 일이 아니다. HRIR, 따라서 HTRF가 사람마 다 매우 다양하다는 것은 잘 알려진 사실이다. 그런 만큼, 개인에 맞춰지지 않은 HRTF로 필터링된 사운드를 들을 경우 심각한 위치 측정 오류가 발생할 수 있다. 이런 오류는 전후와 상하 판단에서 가장 두드러진다.

공공 부문 HRTF 데이터베이스
현재로선 각 개인에 맞춘 HRTF를 생산하는 것이 비실용적이지만, 연구자들은 타깃 인구의 큰 그룹이 인지할 수 있는 공간 단서로 사운드를 처리하는 일반적 레퍼런스 필터를 뽑아내는 평균화 방법을 고안해냈다. 이런 레퍼런스 필터는 MIT와 UC 데이비스 같은 공공 기관에서 취합하고 배치한 여러 고도의 공간 해상도 모음에서 추출한 HRTF로 구성되는 경우가 많다.

위치를 안정화한 바이노럴 사운드
지금까지 바이노럴 사운드를 가상 및 증강 현실 애플리케이션에 적용하는 다양한 실행 기술을 알아봤는데, 단순화하기 위해 사용자를 수동적 청취자라고 가정했다. 하지만 현실에서 대부분의 애플리케이션을 활용할 때 사용자는 고개를 돌려 주변을 돌아보고 물리적 위치도 바꾸게 된다.

헤드 트래킹의 필요성
앞에서 살펴본 대로, 스테레오 오디오를 헤드폰으로 들으면 머릿속에서 두 개의 스피커 사이에 있는 것 같은 음장의 청각적 감각을 제공한다. 반대로 바이노럴 오디오를 헤드폰으로 전달하면 음장 한가운데에 있는 것 같은 몰입형 청각을 느낄 수 있다.
다시 말해, 음장이 현실 세계와 똑같이 머리 외부에 위치하는 것이다. 그래서 표준 오디 오의 재생과 청취에는 매우 좋다. 하지만 바이노럴 오디오는 가상 및 증강 현실 애플리케이션에서 사용할 때 문제가 있다. 바로 머리의 움직임이다.

머리와 몸을 움직이는 데도 바이노럴 음장에는 변화가 일어나지 않고 함께 움직인다. 그래서 오른쪽에서 들리는 차 경적 소리는 물리적으로 사운드의 출처쪽으로 몸을 돌린다 해도 계속 오른쪽에서 들려오게 된다.따라서 가상 및 증강 현실 애플리케이션의 시각적 컴포넌트와 마찬가지로, 그림 8.11 처럼 최소한 사용자 머리의 방향(롤, 피치, 요)을 추적해 오디오를 전달하는 시스템에 그 정보를 전달해야 한다. 이렇게 구현하면 입체 음장이 움직인다 하더라도 인지되는 효과는 고정된 상태를 유지할 것이다. 전반적인 사운드 위치 측정에 상당한 영향을 주기에 특히 머리의 움직임은 중요하다. 뭔가 더 잘 들으려고 그쪽으로 머리를 돌려 본 경험은 누구나 있을 것이다.
보통 하나 의 트래킹 유닛에서 나온 정보는 가상 및 증강 현실 시스템의 시각과 오디오 컴포넌트가 공유한다.

스피커의 입체 사운드는 어떤가?
바이노럴 오디오 녹음은 일반적인 스테레오 스피커로 재생할 수 있지만, 이때 혼선 crosstalk이 일어나 사운드의 공간 품질과 요소들의 방향성이 눈에 띄게 감소한다. 다시 말해, 두 귀가 각각 특정 귀를 위한 신호와 함께 다른 쪽 귀를 향한 신호, 즉 혼선 신호인 두 신호의 합을 받게 된다.
일반적 오디오 애플리 케이션을 위한 혼선 방지 솔루션은 이미 여러 해 동안 존재했지만, 아직도 청취자의 물리적 위치를 상대적으로 안정적으로 ('스윗스팟' 제약) 유지하는 등 여러 과제가 남아있다.

게임 애플리케이션 같은 실시간 바이노럴 합성의 경우, 고정된 스피커에 바이노럴 오디오를 전달할 때 해결해야 할 문제는 훨씬 난해하다. 혼선 방지를 적절히 제어하기 위해 사용자 머리의 위치와 방향을 트래킹해야할 뿐 아니라, 먼저 HRTF 필터로 사운드의 방향성을 전달하는 처리도 해야 한다. 이 이슈를 해결하기 위해 상당한 연구 개발 작업이 진행중이지만, 기존의 스피커 시스템을 통해 설득력 있는 바이노럴 오디오 씬을 전달하는 것은 가상 및 증강현실 애플리케이션에서는 아직 어려운 상황이다.

결론
정확히 적용하면 가상 및 증강 현실 애플리케이션에 풍부한 3D 음장을 추가할 경우, 몰입감과 사용성, 그리고 전반적 경험에 강력한 영향을 줄 수 있다.
(나중에 이 주제에 대해 심화 공부 시, 부록 A와 부록 B 를 활용.)

profile
Emotional realizer

0개의 댓글