1. 파운데이션 모델
파운데이션 모델은 방대한 양의 다양한 데이터로 사전 학습된 거대한 인공지능 모델을 의미한다. 특정 작업에만 특화된 기존의 AI 모델과 달리, 파운데이션 모델은 여러 가지 다른 작업에 유연하게 적용될 수 있는 범용성을 큰 특징으로 한다.
마치 사람이 다양한 경험과 지식을 통해 여러 분야의 문제를 해결할 수 있는 능력을 갖추는 것과 비슷하다. 파운데이션 모델은 대규모 데이터를 통해 세상의 다양한 패턴과 원리를 학습했기 때문에, 약간의 추가 학습(미세 조정, Fine-tuning)만 거치면 다양한 작업들을 수행할 수 있다.
- 자연어 처리: 글을 쓰거나, 번역하거나, 질문에 답하는 등 언어와 관련된 작업을 수행한다.
- 이미지 생성: 텍스트 설명만으로 고품질의 이미지를 만들어낸다.
- 코드 생성: 프로그래밍 코드를 자동으로 작성해준다.
2. NVIDIA Cosmos의 월드 파운데이션 모델
NVIDIA Cosmos킄 특히 물리적 AI 시스템 개발에 초점을 맞춘 월드 파운데이션 모델(World Foundation Models, WFM)을 사용한다. 이 모델들은 단순히 텍스트나 이미지를 이해하는 것을 넘어, 현실 세계의 물리 법칙과 다양한 상호작용을 이해하고 예측하도록 훈련되었다.
Cosmos의 월드 파운데이션 모델은 다음과 같은 역할을 수행한다.
- 가상 세계 생성: 텍스트나 이미지, 비디오 등을 입력받아 물리적으로 정확한 가상 환경과 시나리오를 영상으로 생성한다. 이를 통해 실제 환경에서 발생하기 어려운 위험한 상황이나 다양한 엣지 케이스(Edge Case)에 대한 데이터를 대량으로 만들어낼 수 있다.
- 데이터 증강 및 보강: 로봇이나 자율주행차가 수집한 실제 주행 영상 데이터를 기반으로 다양한 환경(예: 다른 날씨, 시간대)의 영상으로 변환하여 학습 데이터의 양과 질을 높인다.
- 미래 예측: 현재 상황으;ㄹ 바탕으로 앞으로 일어날 일을 예측하열 로봇이나 자율주행차가 더 안전하고 정확한 판단을 내릴 수 있도록 돕는다.
NVIDIA Comsmos의 파운데이션 모델은 현실 세계를 시뮬레이션하고 예측하는 강력한 도구로서, 개발자들이 더 빨고 효율적으로 물리적 AI 시스템을 구축할 수 잇도록 돕는 기술이다.
3. Physical AI와 월드 모델의 필요성
Physical AI의 정의
- Physical AI는 센서(sensors)와 액추에이터(actuators)를 통해 물리적 세계와 직접 상호작용하는 인공지능을 의미한다.
- 예: 로봇이 시각 센서로 호나경을 인지하고, 로봇 팔을 움직여 사물을 조작ㅎ사는 경우.
Physical AI의 당면 과제
- 데이터 수집의 어려움
- 현실 세계에서 실험 및 학습 데이터를 수집하는 과정은 비용과 시간이 많이 든다.
- 실험 과정에서 실패하면 장비가 손상되거나 안전 문제가 발생할 수 있다.
- 특히 AI가 초기 학습 단계에서 시행착오exploratory actions)를 겪을 때, 물리적 환경에서의 시도는 위험성을 동반한다.
해결책: 월드 모델 (World Foundation Model, WFM)
- 물리 세계를 모사하는 디지털 트윈(digital twin)을 만들어, AI가 실제 환경에 투입되기 전 안전하게 학습할 수 있도록 한다.
- WFM은 물리 법칙과 환경 상호작용의 일반적 지식을 학습하고, 이후 특정 작업 환경에 맞게 조정될 수 있다.
Cosmos 플랫폼이란?
- NVIDIA가 제안한 Cosmos는 Physical AI 개발을 위한 World Foundation Model(WFM) 플랫폼이다.
- Cosmos는 크게 두 단계를 따른다:
- Pre-training: 대규모 비디오 데이터 기반의 범용 월드 모델 학습.
- Post-training: 소규모 특화 데이터로 특정 환경/작업에 맞춘 Fine-tuning.



4. Cosmos의 핵심 철학: Pre-training & Post-training
월드 파운데이션 모델(WFM) 개념
- WFM(World Foundation Model): 물리 세계를 일반적으로 학습한 후, 특정 환경에 맞게 조정 가능한 범용 월드 모델.
- 핵심 아이디어:
- Pre-trained WFM: 일반적 물리 법칙과 시각적 상호작용을 학습한 범용 모델.
- Post-trained WFM: 특정 다운스트림 작업(로봇 조작, 자율주행 등)에 특화되도록 미세 조정된 모델.
Pre-trained WFM (범용 모델)
- 데이터 기반: 대규모·다양한 비디오 데이터셋으로 학습.
- 목표:
- 물리 법칙, 상호작용 패턴, 시각적 일관성 학습.
- 현실 세계 전반에 적용 가능한 generalist 모델 확보.
Post-trained WFM (특화 모델)
- 방법: 사전 학습된 모델을 소규모의 특화 데이터셋으로 파인튜닝(fine-tuning)
- 효과:
- 훨씬 적은 데이터로도 특정 환경에 최적화.
- 로봇 팔 제어, 카메라 뷰포인트 전환, 자율주행 등 다양한 다운스트림 작업에서 고성능 발휘.
Pre-training & Post-training 패러다임
- Preptraining 에서 Post-training 구조는 효율적이고 확장성 있는 Physical AI 개발 전략을 제공한다.
- 사전 학습된 범용 지식을 기반으로 하기 떄문에, 새로운 환경이나 작업에 맞추는 데 필요한 비용과 데이터 규모를 크게 절감할 수 있다.

5. Cosmos 플랫폼의 구성 요소
Video Curator
- 대규모 비디오 데이터에서 고품질 학습 데이터를 선별하고 가공하는 파이프라인이다.
- 장면 전환 없는 클립으로 분할하고, 저품질·정적 장면을 제거하며, 텍스트 설명을 생성한다.
- 의미 중복 데이터를 제거하고, 해상도외 종횡비에 따라 데이터를 그룹화하여 학습 효율을 높인다.
Tokenizers
- 비디오 데이터를 모델이 학습할 수 있는 효율적 토큰으로 변환한다.
- Causal 설계로 미래 정보를 사용하지 않고 현재까지의 프레임만으로 토큰화한다.
- Diffusion 모델용 연속 토큰과 Autoregressive 모델용 불연속 토큰을 모두 지원한다.
- 높은 압축률과 우수한 복원 품질을 제공한다.
Pre-trained World Foundation Models
- Cosmos의 핵심 구성 요소이다.
- 대규모 비디오 데이터로 학습된 범용 WFM으로 물리 법칙과 시각적 상호작용을 일반적으로 이해한다.
- Diffusion 기반과 Autoregressive 기반 두 가지 방식으로 구현된다.
Post-Training Samples
- 사전 학습된 WFM을 특정 환경과 작업에 맞게 미세 조정하는 방법론과 예시를 제공한다.
- 로봇 조작, 자율주행, 카메라 제어 등 다양한 다운스트림 응용을 가능하게 한다.
Guardrail
- 유해하거나 위험한 입력과 출력을 차단하는 안전 장치이다.
- 모델 사용 과정에서 발생할 수 있는 잘못된 상호작용을 방지한다.

6. 핵심 기술: 데이터 큐레이션 (Video Curator)
데이터의 중요성
- 데이터는 모델 성능의 상한선을 결정한다.
- 고품질·다양한 비디오 데이터를 확보하는 것이 WFM 구축의 핵심이다.
5단계 파이프라인
-
Splitting
- 긴 비디오를 장면 전환 없는 짧은 클립으로 분할한다.
- 2초 미만은 제거하고, 60초 초과는 잘라서 일관성을 유지한다.
-
Filtering
- 가치 없는 데이터를 제거한다.
- Motion Filtering: 정적 장면이나 불규칙한 카메라 움직임 제거.
- Quality Filtering: 블러·노이즈·저화질 장면 배제.
- Text Overlay Filtering: 후처리된 텍스트 오버레이 제거.
- Video Type Filtering*: 애니메이션·게임 영상 등 불필요한 유형 제외.
-
Annotation
- VLM(Vision-Language Model)을 활용해 각 클립에 대한 상세 텍스트 설명을 생성한다.
- 물리적 사실에 집중한 설명을 자동으로 부여한다.
-
Deduplication
- 의미적으로 중복되는 데이터를 제거한다.
- 다양성을 확보하고 훈련 효율을 높인다.
-
Sharding
- 해상도, 종횡비, 길이에 따라 데이터를 그룹화한다.
- 학습 효율성과 데이터 관리성을 향상시킨다.
성과
- 약 20M 시간 분량의 원본 비디오에서 1억 개 이상의 학습용 클립을 생성했다.
- 비디오와 이미지 데이터를 함께 처리하여 시각 품질과 학습 속도를 개선했다.

7. 핵심 기술: 토크나이저 (Tokenizer)
토크나이저의 역할
- 비디오와 이미지 같은 고차원 데이터를 저차원 압축 토큰 시퀀스로 변환한다.
- 모델 학습의 효율성을 높이고, 제한된 연산 자원에서도 대규모 학습을 가능하게 한다.
- 비디오 코덱과 유사한 역할을 수행하지만, 시멘틱 정보를 최대한 보존하는 데 초점이 있다.
Cosmos 토크나이저의 특징
- Causal 설계
- 미래 프레임 정보를 사용하지 않고 현재와 과거 프레임만으로 토큰화한다.
- 이미지와 비디오의 공동 학습이 가능하며, Physical AI의 시간적 인과 구조와 일치한다.
- 연속(Continuous) & 불연속(Discrete) 토큰 지원
- Continous: Diffusion 모델용으로 연속 벡터 형태의 토큰을 생성한다.
- Discrete: Autoregressive 모델용으로 정수 인덱스 형태의 토큰을 생성한다.
- 압축률과 복원 품질
- 높은 압축률에도 불구하고 원본 시각 정보를 잘 복원한다.
- 기존 토크나이저보다 PSNR, SSIM 등 품질 지표에서 우수한 성능을 기록한다.
- 효율성
- 기존 방법 대비 2배~12배 빠른 속도를 달성하며, GPU 메모리 자원을 효율적으로 사용한다.
성과
- Cosmos Tokenizer는 다양한 해상도와 종횡비를 지원하며, 장시간 비디오도 처리할 수 있다.
- 연속/불연속 토큰화 모두에서 최신 토크나이저 대비 우수한 압축-품질 균형을 보여준다.



8. 핵심 기술: 월드 파운데이션 모델 아키텍처
Diffusion 기반 WFM
- 원리: 노이즈가 추가된 비디오에서 점진적으로 노이즈를 제거하여 현실적인 비디오를 생성한다.
- 학습 단계:
- Text2World: 텍스트 프롬프트로부터 비디오 세계를 생성한다.
- Video2World: 이전 비디오와 텍스트 프롬프트를 조건으로 미래 비디오를 생성한다.
- 특징: 고품질·사실적인 비디오 생성에 강점을 가진다.
Autoregressive 기반 WFM
- 원리: LLM처럼 이전 비디오 토큰 시퀀스를 기반으로 다음 토큰을 예측한다.
- 학습 단계:
- 순수 비디오 예측: 과거 비디오만으로 미래를 예측한다.
- 텍스트 조건부 예측: 텍스트 프롬프트를 추가 조건으로 사용하여 다음 비디오를 생성한다.
- 특징:
- LLM 기술을 그대로 활용할 수 있다.
- 실시간 상호작용 잠재력이 크다.
Diffusion Decoder
- Autoregressive 모델이 생성한 압축된 불연속 토큰을 Diffusion 모델로 디코딩해 품질을 높인다.
- 두 방식의 장점을 결합하여 현실감과 상호작용성을 모두 확보한다.
9. 실제 적용 사례: Post-training을 통한 특화 모델
카메라 제어 (Camera Control)
- 카메라의 6-DoF(6축 자유도) 포즈를 입력받아 원하는 시점으로 3D 세계를 탐색하는 비디오를 생성한다.
- 사용자는 마치 가상 공간을 자유롭게 돌아다니는 것처럼 경험할 수 있다.
로보틱스 (Robotic Manipulation)
- 명령 기반 예측: "책을 선반에 꽂아"와 같은 텍스트 명령을 이해하고 로봇이 수행하는 결과 영상을 생성한다.
- 행동 기반 예측: 로봇 팔의 7-DoF 행동 벡터를 입력받아, 그 행동의 결과로 나타날 다음 프레임을 예측한다.
- 로봇의 미래 상태를 더 정확하게 시뮬레이션할 수 있다.
자율주행 (Autonomous Driving)
- 다중 시점 생성: 차량의 전방, 후방, 좌우 등 여러 카메라 시점의 영상을 동시에 일관성 있게 생성한다.
- 궤적 제어: 차량의 미래 주행 경로를 조건으로 입력하면, 해당 경로를 따르는 주행 영상을 생성한다.
- 실제 주행 데이터를 대체하거나 보완하는 학습 자원으로 활용할 수 있다.
의미
- Pre-trained WFM을 소량의 특화 데이터로 파인튜닝하여 현실적이고 다양한 다운스트림 응용에 적용할 수 있음을 보여준다.
- 데이터 효율성과 확장성이 뛰어나, 로보틱스와 자율주행 분야에서 실질적인 가치를 가진다.
10.결론
Cosmos의 의의
- Cosmos는 Physical AI 개발의 가장 큰 병목이었던 데이터 문제를 해결할 수 있는 강력한 플랫폼을 제시한다.
- 범용 WFM을 학습한 뒤, 소량의 특화 데이터로 효율적인 Post-training을 수행하여 다양한 실제 응용에 적용할 수 있음을 보여준다.
현재의 한계
- 물리 법칙 이해 부족: 객체 영속성, 복잡한 상호작용 등 현실의 정밀한 물리 현상을 완전히 학습하지는 못한다.
- 평가 지표 부재: 모델 성능을 객관적으로 측정할 표준화된 평가 지표가 아직 부족하다.
향후 발전 방향
- Diffusion과 Autoregressive 모델의 하이브리드 접근법이 유망하다.
- 실제 물리 시뮬레이터와 결합하여 더 정밀한 학습과 평가가 가능할 것으로 기대된다.
- 대규모 비디오 데이터와 토크나이저 기술의 발전을 통해 WFM 품질은 지속적으로 향상될 것이다.
개인적인 생각
- Cosmos는 단순히 비디오 생성 모델이 아니라, 실세계 학습을 안전하게 가속화하는 실험 플랫폼이라는 점에서 가치가 크다.
- 특히 로보틱스와 자율주행 분야에서 데이터 수집 비용을 획기적으로 줄이고, 더 빠른 실험과 반복을 가능하게 할 것으로 보인다.
- 장기적으로는 Physical AI의 시대를 앞당일 인프라가 될 수 있다.
레퍼런스
Cosmos World Foundation Model Platform for Physical AI