오늘은 ICLR 2024에 등재된 DreamGaussian에 대한 논문을 리뷰할 것이다. 연구실 과제를 위해 이쪽 분야에 NeRF, Instant-NGP 등 다양한 논문에 대한 실험을 하는 중에 이 논문을 발견해서 읽었던 기억이 있다. 그 당시는 Arxiv에 올라와 있었는데, 대단하다 싶었었다. project page 결국 ICLR같은 메이저 학회에 등재된 것을 보고 역시나 싶었다. 처음 이 논문을 볼 때, https://xoft.tistory.com/ 를 참고했었다. 나의 부족한 리뷰를 보는 것 보다 여기를 참고하는 것을 추천한다.
source : https://arxiv.org/pdf/2309.16653.pdf

최근 3D 컨텐츠 생성 기술들은 SDS 최적화 기반 [DreamFusion] 을 적용하는데, 이는 실생활에 쓰이기엔 생성 속도에 한계가 있다. DreamGaussian에서는 3D Gaussian Splatting을 기반으로 Mesh Extraction과 Texture refinement in UV Space를 효과적으로 디자인한다. NeRF기반 보다 빠른 속도를 자랑한다. 우리는 3D Gaussian들을 메쉬 추출하는 효과적인 알고리즘을 소개하고 세부 사항을 다듬기 위한 새로운 단계를 적용한다.
요약하자면, 저자들의 기여는

이 섹션에서는 우리는 우리의 Image-to-3D & Text-to-3D에 관한 효율적인 3D 콘텐츠 생성의 두 단계 프레임워크를 소개한다. (Figure 2.) 먼저 우리는 3D Gaussian Splatting을 효율적인 SDS(Poole et al. 2022)(Section 3.1)을 통한 초기화로 생성 작업에 적용한다. 그 다음, 우리는 3D 가우시안들로부터 텍스처화된 메쉬를 추출하는 알고리즘을 제안한다.(Section 3.2) 이 텍스처는 이 다음 마지막 추출을 위해 UV-space 정제 단계에서 미분가능한 렌더링으로부터 정제된다. (Section 3.3)
SDS란 ?
https://jang-inspiration.com/dreamfusion
https://xoft.tistory.com/53
생성 단계에서 SDS를 사용한다고 하는데, 정확히 SDS의 원리를 이해하기가 쉽지 않았다. Bottom-Up을 통해 이해하려고 노려해야겠다. 혹시 잘 설명해줄 수 있는 분...? 코드를 통해 이해하게 될 수도..?>?>?
공간 밀도는 많은 수의 가우시안들로 묘사되기 때문에, 무차별적인 빽빽한 3D 밀도 그리드의 querying은 느리고 비효율적일 수 있다. 그래서 우리는 블록 차원의 지역 밀도 쿼리와 back-projected color를 기반으로 텍스쳐화된 메쉬를 추출하는 효율적인 알고리즘을 제시한다.
우리는 추출된 조악한 텍스처를 다듬기 위해서 추가로 두번째 단계를 사용한다. 텍스처 생성과 달리, 우리는 주어진 조악한 텍스처의 디테일을 향상시키려 한다. 그러나, UV-space를 SDS loss로 직접 미세 조정하는 것은 다음과 같은 아티팩트를 발생시키고, 이는 이전 연구에서 발견되었다. 이것은 미분가능한 레스터화에서 사용되는 mipmap 텍스처를 샘플링하는 기술 때문이다. SDS와 같은 모호한 가이드로 인해, 각 mipmap 레벨로 전파된 그라디언트는 과도하게 포화된 색상 블록을 초래한다. 따라서, 우리는 흐릿한 질감을 미세 조정하기 위해 보다 명확한 가이드를 찾고 있습니다.
우리는 SDEdit(Meng et al., 2021)의 Image-to-Image 합성과 재구성 세팅에서 영감을 얻었다. 우리는 초기화된 텍스처를 이미 가지고 있기 때문에, 우리는 임의의 카메라 시점 p 에서의 흐릿한 이미지를 랜더링할 수 있다. 그런 다음, 우리는 이미지를 랜덤 노이즈를 통해 변형시키고, 세밀한 이미지를 얻기 위해 2D Diffusion prior를 사용하는 다단계의 Denoising process에 적용한다.

이 작업에서는 DreamGaussian이라는 3D 콘텐츠 생성 프레임워크를 제안합니다. 이 프레임워크는 3D 콘텐츠 생성의 효율성을 크게 향상시킵니다. 우리는 효율적인 생성 가우시안 스플래팅 파이프라인을 설계하고, 가우시안에서 메시를 추출하는 알고리즘을 제안합니다. 우리의 질감 미세 조정 단계를 통해, 우리는 단일 이미지 또는 텍스트 설명에서 몇 분 내에 고품질 다각형 메시를 사용할 준비가 된 3D 자산을 생성할 수 있습니다.
이전 연구들과 공통된 문제점을 가지고 있습니다: 다중 면 Janus 문제, 과도하게 포화된 질감, 그리고 베이크된 조명입니다. 최근에 점수 편향 해결에 대한 최신 기술 발전(Armandpour et al., 2023; Hong et al., 2023), 카메라 조건에 따른 2D 확산 모델(Shi et al., 2023; Liu et al., 2023c; Zhao et al., 2023; Li et al., 2023b), 그리고 BRDF 자동 인코더(Xu et al., 2023b)를 활용하여 이러한 문제를 해결하는 것이 유망합니다. 게다가, 이미지에서 3D 결과로 생성된 후방 텍스처는 흐릿해 보일 수 있으며, 이는 더 긴 스테이지 2 훈련으로 완화될 수 있습니다.