NVIDIA Cosmos

공부용·2025년 9월 30일

1. 파운데이션 모델

파운데이션 모델은 방대한 양의 다양한 데이터로 사전 학습된 거대한 인공지능 모델을 의미한다. 특정 작업에만 특화된 기존의 AI 모델과 달리, 파운데이션 모델은 여러 가지 다른 작업에 유연하게 적용될 수 있는 범용성을 큰 특징으로 한다.

마치 사람이 다양한 경험과 지식을 통해 여러 분야의 문제를 해결할 수 있는 능력을 갖추는 것과 비슷하다. 파운데이션 모델은 대규모 데이터를 통해 세상의 다양한 패턴과 원리를 학습했기 때문에, 약간의 추가 학습(미세 조정, Fine-tuning)만 거치면 다양한 작업들을 수행할 수 있다.

  • 자연어 처리: 글을 쓰거나, 번역하거나, 질문에 답하는 등 언어와 관련된 작업을 수행한다.
  • 이미지 생성: 텍스트 설명만으로 고품질의 이미지를 만들어낸다.
  • 코드 생성: 프로그래밍 코드를 자동으로 작성해준다.

2. NVIDIA Cosmos의 월드 파운데이션 모델

NVIDIA Cosmos킄 특히 물리적 AI 시스템 개발에 초점을 맞춘 월드 파운데이션 모델(World Foundation Models, WFM)을 사용한다. 이 모델들은 단순히 텍스트나 이미지를 이해하는 것을 넘어, 현실 세계의 물리 법칙과 다양한 상호작용을 이해하고 예측하도록 훈련되었다.

Cosmos의 월드 파운데이션 모델은 다음과 같은 역할을 수행한다.

  • 가상 세계 생성: 텍스트나 이미지, 비디오 등을 입력받아 물리적으로 정확한 가상 환경과 시나리오를 영상으로 생성한다. 이를 통해 실제 환경에서 발생하기 어려운 위험한 상황이나 다양한 엣지 케이스(Edge Case)에 대한 데이터를 대량으로 만들어낼 수 있다.
  • 데이터 증강 및 보강: 로봇이나 자율주행차가 수집한 실제 주행 영상 데이터를 기반으로 다양한 환경(예: 다른 날씨, 시간대)의 영상으로 변환하여 학습 데이터의 양과 질을 높인다.
  • 미래 예측: 현재 상황으;ㄹ 바탕으로 앞으로 일어날 일을 예측하열 로봇이나 자율주행차가 더 안전하고 정확한 판단을 내릴 수 있도록 돕는다.

NVIDIA Comsmos의 파운데이션 모델은 현실 세계를 시뮬레이션하고 예측하는 강력한 도구로서, 개발자들이 더 빨고 효율적으로 물리적 AI 시스템을 구축할 수 잇도록 돕는 기술이다.

3. Physical AI와 월드 모델의 필요성

Physical AI의 정의

  • Physical AI는 센서(sensors)와 액추에이터(actuators)를 통해 물리적 세계와 직접 상호작용하는 인공지능을 의미한다.
  • 예: 로봇이 시각 센서로 호나경을 인지하고, 로봇 팔을 움직여 사물을 조작ㅎ사는 경우.

Physical AI의 당면 과제

  • 데이터 수집의 어려움
    • 현실 세계에서 실험 및 학습 데이터를 수집하는 과정은 비용과 시간이 많이 든다.
    • 실험 과정에서 실패하면 장비가 손상되거나 안전 문제가 발생할 수 있다.
  • 특히 AI가 초기 학습 단계에서 시행착오exploratory actions)를 겪을 때, 물리적 환경에서의 시도는 위험성을 동반한다.

해결책: 월드 모델 (World Foundation Model, WFM)

  • 물리 세계를 모사하는 디지털 트윈(digital twin)을 만들어, AI가 실제 환경에 투입되기 전 안전하게 학습할 수 있도록 한다.
  • WFM은 물리 법칙과 환경 상호작용의 일반적 지식을 학습하고, 이후 특정 작업 환경에 맞게 조정될 수 있다.

Cosmos 플랫폼이란?

  • NVIDIA가 제안한 Cosmos는 Physical AI 개발을 위한 World Foundation Model(WFM) 플랫폼이다.
  • Cosmos는 크게 두 단계를 따른다:
    1. Pre-training: 대규모 비디오 데이터 기반의 범용 월드 모델 학습.
    2. Post-training: 소규모 특화 데이터로 특정 환경/작업에 맞춘 Fine-tuning.



4. Cosmos의 핵심 철학: Pre-training & Post-training

월드 파운데이션 모델(WFM) 개념

  • WFM(World Foundation Model): 물리 세계를 일반적으로 학습한 후, 특정 환경에 맞게 조정 가능한 범용 월드 모델.
  • 핵심 아이디어:
    • Pre-trained WFM: 일반적 물리 법칙과 시각적 상호작용을 학습한 범용 모델.
    • Post-trained WFM: 특정 다운스트림 작업(로봇 조작, 자율주행 등)에 특화되도록 미세 조정된 모델.

Pre-trained WFM (범용 모델)

  • 데이터 기반: 대규모·다양한 비디오 데이터셋으로 학습.
  • 목표:
    • 물리 법칙, 상호작용 패턴, 시각적 일관성 학습.
    • 현실 세계 전반에 적용 가능한 generalist 모델 확보.

Post-trained WFM (특화 모델)

  • 방법: 사전 학습된 모델을 소규모의 특화 데이터셋으로 파인튜닝(fine-tuning)
  • 효과:
    • 훨씬 적은 데이터로도 특정 환경에 최적화.
    • 로봇 팔 제어, 카메라 뷰포인트 전환, 자율주행 등 다양한 다운스트림 작업에서 고성능 발휘.

Pre-training & Post-training 패러다임

  • Preptraining 에서 Post-training 구조는 효율적이고 확장성 있는 Physical AI 개발 전략을 제공한다.
  • 사전 학습된 범용 지식을 기반으로 하기 떄문에, 새로운 환경이나 작업에 맞추는 데 필요한 비용과 데이터 규모를 크게 절감할 수 있다.

5. Cosmos 플랫폼의 구성 요소

Video Curator

  • 대규모 비디오 데이터에서 고품질 학습 데이터를 선별하고 가공하는 파이프라인이다.
  • 장면 전환 없는 클립으로 분할하고, 저품질·정적 장면을 제거하며, 텍스트 설명을 생성한다.
  • 의미 중복 데이터를 제거하고, 해상도외 종횡비에 따라 데이터를 그룹화하여 학습 효율을 높인다.

Tokenizers

  • 비디오 데이터를 모델이 학습할 수 있는 효율적 토큰으로 변환한다.
  • Causal 설계로 미래 정보를 사용하지 않고 현재까지의 프레임만으로 토큰화한다.
  • Diffusion 모델용 연속 토큰과 Autoregressive 모델용 불연속 토큰을 모두 지원한다.
  • 높은 압축률과 우수한 복원 품질을 제공한다.

Pre-trained World Foundation Models

  • Cosmos의 핵심 구성 요소이다.
  • 대규모 비디오 데이터로 학습된 범용 WFM으로 물리 법칙과 시각적 상호작용을 일반적으로 이해한다.
  • Diffusion 기반과 Autoregressive 기반 두 가지 방식으로 구현된다.

Post-Training Samples

  • 사전 학습된 WFM을 특정 환경과 작업에 맞게 미세 조정하는 방법론과 예시를 제공한다.
  • 로봇 조작, 자율주행, 카메라 제어 등 다양한 다운스트림 응용을 가능하게 한다.

Guardrail

  • 유해하거나 위험한 입력과 출력을 차단하는 안전 장치이다.
  • 모델 사용 과정에서 발생할 수 있는 잘못된 상호작용을 방지한다.

6. 핵심 기술: 데이터 큐레이션 (Video Curator)

데이터의 중요성

  • 데이터는 모델 성능의 상한선을 결정한다.
  • 고품질·다양한 비디오 데이터를 확보하는 것이 WFM 구축의 핵심이다.

5단계 파이프라인

  1. Splitting

    • 긴 비디오를 장면 전환 없는 짧은 클립으로 분할한다.
    • 2초 미만은 제거하고, 60초 초과는 잘라서 일관성을 유지한다.
  2. Filtering

    • 가치 없는 데이터를 제거한다.
    • Motion Filtering: 정적 장면이나 불규칙한 카메라 움직임 제거.
    • Quality Filtering: 블러·노이즈·저화질 장면 배제.
    • Text Overlay Filtering: 후처리된 텍스트 오버레이 제거.
    • Video Type Filtering*: 애니메이션·게임 영상 등 불필요한 유형 제외.
  3. Annotation

    • VLM(Vision-Language Model)을 활용해 각 클립에 대한 상세 텍스트 설명을 생성한다.
    • 물리적 사실에 집중한 설명을 자동으로 부여한다.
  4. Deduplication

    • 의미적으로 중복되는 데이터를 제거한다.
    • 다양성을 확보하고 훈련 효율을 높인다.
  5. Sharding

    • 해상도, 종횡비, 길이에 따라 데이터를 그룹화한다.
    • 학습 효율성과 데이터 관리성을 향상시킨다.

성과

  • 약 20M 시간 분량의 원본 비디오에서 1억 개 이상의 학습용 클립을 생성했다.
  • 비디오와 이미지 데이터를 함께 처리하여 시각 품질과 학습 속도를 개선했다.

7. 핵심 기술: 토크나이저 (Tokenizer)

토크나이저의 역할

  • 비디오와 이미지 같은 고차원 데이터를 저차원 압축 토큰 시퀀스로 변환한다.
  • 모델 학습의 효율성을 높이고, 제한된 연산 자원에서도 대규모 학습을 가능하게 한다.
  • 비디오 코덱과 유사한 역할을 수행하지만, 시멘틱 정보를 최대한 보존하는 데 초점이 있다.

Cosmos 토크나이저의 특징

  1. Causal 설계
    • 미래 프레임 정보를 사용하지 않고 현재와 과거 프레임만으로 토큰화한다.
    • 이미지와 비디오의 공동 학습이 가능하며, Physical AI의 시간적 인과 구조와 일치한다.
  2. 연속(Continuous) & 불연속(Discrete) 토큰 지원
    • Continous: Diffusion 모델용으로 연속 벡터 형태의 토큰을 생성한다.
    • Discrete: Autoregressive 모델용으로 정수 인덱스 형태의 토큰을 생성한다.
  3. 압축률과 복원 품질
    • 높은 압축률에도 불구하고 원본 시각 정보를 잘 복원한다.
    • 기존 토크나이저보다 PSNR, SSIM 등 품질 지표에서 우수한 성능을 기록한다.
  4. 효율성
    • 기존 방법 대비 2배~12배 빠른 속도를 달성하며, GPU 메모리 자원을 효율적으로 사용한다.

성과

  • Cosmos Tokenizer는 다양한 해상도와 종횡비를 지원하며, 장시간 비디오도 처리할 수 있다.
  • 연속/불연속 토큰화 모두에서 최신 토크나이저 대비 우수한 압축-품질 균형을 보여준다.



8. 핵심 기술: 월드 파운데이션 모델 아키텍처

Diffusion 기반 WFM

  • 원리: 노이즈가 추가된 비디오에서 점진적으로 노이즈를 제거하여 현실적인 비디오를 생성한다.
  • 학습 단계:
    1. Text2World: 텍스트 프롬프트로부터 비디오 세계를 생성한다.
    2. Video2World: 이전 비디오와 텍스트 프롬프트를 조건으로 미래 비디오를 생성한다.
  • 특징: 고품질·사실적인 비디오 생성에 강점을 가진다.

Autoregressive 기반 WFM

  • 원리: LLM처럼 이전 비디오 토큰 시퀀스를 기반으로 다음 토큰을 예측한다.
  • 학습 단계:
    1. 순수 비디오 예측: 과거 비디오만으로 미래를 예측한다.
    2. 텍스트 조건부 예측: 텍스트 프롬프트를 추가 조건으로 사용하여 다음 비디오를 생성한다.
  • 특징:
    • LLM 기술을 그대로 활용할 수 있다.
    • 실시간 상호작용 잠재력이 크다.

Diffusion Decoder

  • Autoregressive 모델이 생성한 압축된 불연속 토큰을 Diffusion 모델로 디코딩해 품질을 높인다.
  • 두 방식의 장점을 결합하여 현실감과 상호작용성을 모두 확보한다.

9. 실제 적용 사례: Post-training을 통한 특화 모델

카메라 제어 (Camera Control)

  • 카메라의 6-DoF(6축 자유도) 포즈를 입력받아 원하는 시점으로 3D 세계를 탐색하는 비디오를 생성한다.
  • 사용자는 마치 가상 공간을 자유롭게 돌아다니는 것처럼 경험할 수 있다.

로보틱스 (Robotic Manipulation)

  • 명령 기반 예측: "책을 선반에 꽂아"와 같은 텍스트 명령을 이해하고 로봇이 수행하는 결과 영상을 생성한다.
  • 행동 기반 예측: 로봇 팔의 7-DoF 행동 벡터를 입력받아, 그 행동의 결과로 나타날 다음 프레임을 예측한다.
  • 로봇의 미래 상태를 더 정확하게 시뮬레이션할 수 있다.

자율주행 (Autonomous Driving)

  • 다중 시점 생성: 차량의 전방, 후방, 좌우 등 여러 카메라 시점의 영상을 동시에 일관성 있게 생성한다.
  • 궤적 제어: 차량의 미래 주행 경로를 조건으로 입력하면, 해당 경로를 따르는 주행 영상을 생성한다.
  • 실제 주행 데이터를 대체하거나 보완하는 학습 자원으로 활용할 수 있다.

의미

  • Pre-trained WFM을 소량의 특화 데이터로 파인튜닝하여 현실적이고 다양한 다운스트림 응용에 적용할 수 있음을 보여준다.
  • 데이터 효율성과 확장성이 뛰어나, 로보틱스와 자율주행 분야에서 실질적인 가치를 가진다.

10.결론

Cosmos의 의의

  • Cosmos는 Physical AI 개발의 가장 큰 병목이었던 데이터 문제를 해결할 수 있는 강력한 플랫폼을 제시한다.
  • 범용 WFM을 학습한 뒤, 소량의 특화 데이터로 효율적인 Post-training을 수행하여 다양한 실제 응용에 적용할 수 있음을 보여준다.

현재의 한계

  • 물리 법칙 이해 부족: 객체 영속성, 복잡한 상호작용 등 현실의 정밀한 물리 현상을 완전히 학습하지는 못한다.
  • 평가 지표 부재: 모델 성능을 객관적으로 측정할 표준화된 평가 지표가 아직 부족하다.

향후 발전 방향

  • Diffusion과 Autoregressive 모델의 하이브리드 접근법이 유망하다.
  • 실제 물리 시뮬레이터와 결합하여 더 정밀한 학습과 평가가 가능할 것으로 기대된다.
  • 대규모 비디오 데이터와 토크나이저 기술의 발전을 통해 WFM 품질은 지속적으로 향상될 것이다.

개인적인 생각

  • Cosmos는 단순히 비디오 생성 모델이 아니라, 실세계 학습을 안전하게 가속화하는 실험 플랫폼이라는 점에서 가치가 크다.
  • 특히 로보틱스와 자율주행 분야에서 데이터 수집 비용을 획기적으로 줄이고, 더 빠른 실험과 반복을 가능하게 할 것으로 보인다.
  • 장기적으로는 Physical AI의 시대를 앞당일 인프라가 될 수 있다.

레퍼런스

Cosmos World Foundation Model Platform for Physical AI

profile
공부 내용을 가볍게 적어놓는 블로그.

0개의 댓글