이미지 생성 모델에 대해 이해하기

Keno Kim·2026년 8월 30일

현재 세대 이미지 모델 관점의 이해

  • 2026.08 기준 gpt-image-2, seedream-5.0-pro, nano banana 2 등 최신 모델들의 특징과 작동 원리에 대해 알아보자.
  • 이들은 모두 텍스트와 레퍼런스 이미지를 같이 입력으로 받으며, 생성/편집/추론을 할 수 있는 모델들이다.
Text ─────────┐
Image ────────┼──→ Multimodal Image Model → Image
Image ────────┤
Conversation ─┘

- GPT Image 2는 공식적으로 text input + image input/output + editing + high-fidelity image input을 지원한다. 
- Nano Banana 2는 아예 Gemini 계열의 natively multimodal reasoning model이고 text와 image를 입력받는다.
- Seedream 5.0 Pro 는 ByteDance가 multimodal image creation model이라고 정의한다.  

Seedream 4.0 아키텍처

  • Seedream 4.0 은 상용화된 모델이지만, 아키텍처 설계에 대한 논문이 공개되어 있다.
  • 이 모델은 텍스트와 레퍼런스 이미지들을 내부적으로 VLM 을 통해 이해하고 이를 DiT 이미지 생성 과정에 condition/context 로 활용한다.
    • 쉽게 이야기하면, 텍스트/레퍼런스 이미지를 모델이 내부적으로 이해하고, 이를 통해 이미지를 생성한다는 것이다.
    • 즉, 텍스트 입력에 이미지에 대한 정보를 주지 않아도 모델이 알아서 이해할 수 있다.
  • https://arxiv.org/abs/2509.20427
  • https://seed.bytedance.com/en/blog/seedream-4-0-officially-released-beyond-drawing-into-imagination
                    Text
                      │
Reference Image(s) ───┤
                      │
                      ▼
          Multimodal Conditioning
                      │
                      ▼
          ┌────────────────────────┐
          │ Efficient Diffusion    │
          │ Transformer (DiT)      │
          └───────────┬────────────┘
                      │
                Image Latents
                      │
                      ▼
             High-compression VAE
                      │
                      ▼
                    Image

Seedream 4.0 을 활용한 애플리케이션 아키텍처

  • 그렇다면 이러한 이미지 모델을 활용해서 이미지 관련 애플리케이션을 개발한다면, 어떤 구조로 설계해야 할까? 다음과 같이 2-step 으로 생각해 볼 수 있다.
  1. 이미지 모델에게 주는 input 은 모델에게 어떤 의미일까?
  • 이미지 모델이 받는 정보는 text prompt, reference image(s) 가 될텐데, 이걸 입력하는 입장에서는 어떻게 이해해야 할까?
Reference Image = 생성 결과가 참고해야 할 시각적 정보(visual evidence/context/source)
Text = 그 시각적 정보를 어떻게 해석하고 선택·변경·보존·조합할지 지정하는 언어적 instruction
  1. 애플리케이션 관점에서 이 input 은 어떻게 생성되는가?
  • 가장 단순한 방법은 사용자에게 text 와 reference image 를 직접 입력하도록 하는 것이다. 사용자는 이미지 모델 벤더의 웹 콘솔과 같은 사용자 경험을 하게 될 것이다.
  • 또는 LLM/VLM 을 통해 사용자 입력을 이해/재해석해서 input 을 개선할 수 있다.
    • 예를 들어, 사용자가 대충 입력한 값을 LLM 으로 풍부하게, 이미지 모델 친화적인 텍스트 프롬프트를 재구성할 수 있다.
    • 서비스 관점에서 VLM 으로 레퍼런스 이미지를 해석해서, 사용자에게 제약을 걸 수도 있다.
      • 예를 들어, 서비스를 통해 생성된 이미지는 브랜드 상품을 포함하면 안된다고 생각해 보자.
      • 모든 text input 에 브랜드 상품이 포함되면 제거해 주세요. 하고 추가할 수도 있겠지만, VLM 을 통해 이미지를 먼저 해석하고, 브랜드 상품이 있으면 제거하는 방식으로 만들수도 있다.

이미지 모델 best practices

Figure 1 → Base image
Figure 2 → Product reference
Figure 3 → Text reference
"Replace the product in Figure 1
with that in Figure 2.
For the title, copy the text
in Figure 3 to the top..."
Image 1 = base/content reference
Image 2 = style reference

→ Image 2의 style을
   Image 1에 적용

→ Image 1의 layout/object는 유지
profile
개발자의 생각 로그

0개의 댓글