알리바바, 오픈소스 이미지 대형 모델 공개! 중국어 렌더링 능력은 정말 놀랍습니다! 복잡한 폰트 배열도 완벽하게 처리하며, 바이트닷컴의 OpenAI와 맞서고 있습니다.

brooks wilson·2025년 8월 5일

알리바바, 오픈소스 이미지 대형 모델 공개! 중국어 렌더링 능력은 정말 놀랍습니다! 복잡한 폰트 배열도 완벽하게 처리하며, 바이트닷컴의 OpenAI와 맞서고 있습니다.
서예를 쓰고 PPT를 만들 수 있는 이미지 생성 모델이 등장했습니다!

알리바바, 오픈소스 이미지 생성 모델 공개! 중국어 렌더링 능력 테스트 결과 압도적! 복잡한 폰트 배열도 완벽히 처리, 바이트댄스 OpenAI와 맞서다 서예 작성, PPT 제작까지 가능한 이미지 생성 모델 등장!

중국 SOTA(최고 성능)급 오픈소스 이미지 생성 모델이 등장했습니다!

8월 5일 보도에 따르면, 오늘 알리바바는 Qwen-Image를 오픈소스로 공개했습니다. 이는 Qwen 시리즈 중 첫 번째 이미지 생성 기반 모델입니다. Qwen-Image는 복잡한 텍스트 렌더링 능력을 강조하며, 다양한 환경에서 다양한 언어와 스타일의 텍스트를 정확히 생성할 수 있으며, 붓글씨 서예를 작성하거나 텍스트와 이미지를 결합한 PPT 페이지를 직접 생성할 수 있습니다.

아래 그림에서 Qwen-Image는 힌트 텍스트에 언급된 ‘미야자키 하야오’ 스타일 요구사항을 정확히 재현했으며, 구도의 심도 변화에 따라 ‘클라우드 스토리지’, ‘클라우드 컴퓨팅’ 등 텍스트를 정확히 렌더링했습니다. 텍스트와 화면의 융합이 자연스럽습니다.

Qwen-Image는 영어 콘텐츠도 정확히 생성합니다.영어 입력어에 따라 서점의 쇼윈도 장면을 생성했으며, 모든 지정된 텍스트가 정확히 재현되었으며, 각 책에 대해 다른 스타일화된 폰트와 표지를 자동으로 생성해 책 제목과 잘 어울립니다.

텍스트 처리 외에도 Qwen-Image는 일반 이미지 생성 분야에서 다양한 예술 스타일을 지원합니다. 사진 수준의 사실적 장면부터 인상파 회화, 애니메이션 스타일부터 미니멀리즘 디자인까지 모두 소화합니다.

Qwen-Image는 20B 모델로, MMDiT(다모달 확산 트랜스포머) 아키텍처를 사용합니다. 여기서 'MM'은 모델이 이미지, 텍스트 등 다모달 콘텐츠를 생성하는 능력을 의미하며, 'DiT'는 확산 트랜스포머를 의미합니다.

Qwen 팀은 Qwen-Image를 여러 공개 벤치마크에서 평가했으며, 비교 대상은 글로벌 최상위 오픈소스 및 클로즈드소스 이미지 생성 모델입니다. 총 12개 항목에서 SOTA(최고 성능)를 달성했습니다.

일반 이미지 생성 테스트인 GenEval, DPG, OneIG-Bench 및 이미지 편집 테스트인 GEdit, ImgEdit, GSO에서 Qwen-Image는 Flux.1, BAGEL 등 오픈소스 모델, ByteDance의 SeedDream 3.0 및 OpenAI의 GPT Image 1 (High)를 넘어섰습니다.

텍스트 렌더링을 위한 LongText-Bench, ChineseWord 및 TextCraft 벤치마크 테스트 결과, Qwen-Image는 텍스트 렌더링 분야에서 특히 우수한 성능을 보여주었으며, 특히 중국어 텍스트 렌더링에서 기존 최첨단 모델인 SeedDream 3.0과 GPT Image 1(High)을 크게 앞섰습니다.

현재 Qwen-Image는 모다(MoDa), Hugging Face 등 커뮤니티에서 오픈소스로 공개되었으며, 일반 사용자는 QwenChat(chat.qwen.ai)에서 이미지 생성 기능을 선택해 이 모델을 직접 체험할 수 있습니다.

Qwen-Image의 기술 보고서는 동시에 오픈소스로 공개되었으며, 보고서는 이 모델의 구체적인 기술 구현을 상세히 설명합니다.

관련 링크:

모다 커뮤니티:
https://modelscope.cn/models/Qwen/Qwen-Image

허깅페이스:
https://huggingface.co/Qwen/Qwen-Image

기술 보고서:
https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen-Image/Qwen_Image.pdf
https://qwenimages.org/

  1. 아키텍처는 세 가지 핵심 구성 요소로 구성됩니다.
    다중 모델 협업을 통해 이미지 생성을 실현합니다.

Qwen 팀은 기존 이미지 생성 모델이 해상도와 세부 묘사에서 일정 수준의 진전을 이뤘지만, 다중 텍스트 렌더링, 비알파벳 언어(예: 중국어) 생성, 부분 텍스트 삽입 또는 텍스트와 시각적 요소 통합 등 특정 작업에서는 여전히 성능이 부족하다는 점을 관찰했습니다.

또한 주목받고 있는 Flux 이미지 생성 모델과 Qwen-Image를 비교했습니다. 동일한 프롬프트를 사용했을 때, 왼쪽의 Flux는 “2025년 여름 개봉”이라는 중국어 문구를 생성하지 못했으며, 시각적 충격력도 Qwen-Image에 비해 약간 부족했습니다.

▲실제 영화 포스터 생성 테스트, 프롬프트: SF 영화 포스터 제목 ‘GALAXY INVASION’, 금속 질감 폰트에 네온 효과와 파손된 가장자리, 배경은 우주 폭발, 작은 글씨로 ‘2025년 여름 개봉’ 표시.

두 번째로, 이미지 편집 측면에서 편집 결과와 원본 이미지 간의 정렬이 여전히 도전 과제입니다.먼저 시각적 일관성을 유지해야 합니다. 예를 들어 머리 색상을 변경하더라도 얼굴 특징은 유지해야 하며, 의미적 일관성도 필요합니다. 예를 들어 인물의 자세를 수정하더라도 신분과 장면의 일관성을 유지해야 합니다.

▲실제 이미지 편집 결과, 입력 단어는 '우주선 요소를 추가하고 2026년 여름 개봉으로 변경'입니다(왼쪽은 Flux, 오른쪽은 Qwen-Image)

중국 서예 장면에서, 우리는 Qwen-Image가 글씨 내용과 폰트를 자율적으로 선택하도록 했으며, 최종 결과는 다음과 같습니다.

Qwen-Image의 아키텍처는 세 개의 핵심 구성 요소로 구성되며, 이 세 요소가 협업하여 텍스트에서 이미지 생성을 실현합니다.

Qwen2.5-VL 다모달 대형 언어 모델 (MLLM)은 조건 코더로, 텍스트 입력에서 특징을 추출하는 역할을 합니다.

시스템 프롬프트는 Qwen2.5-VL에게 물체와 배경의 색상, 수량, 텍스트, 모양, 크기, 텍스처 및 공간 관계를 상세히 설명하도록 요구하여 이미지 생성을 위한 기반을 제공하고 모델이 세밀한 잠재 표현을 생성하도록 안내합니다.

Wan-2.1 비디오 생성 모델의 분할 자기 인코더(VAE)는 Qwen-Image의 이미지 토큰화기(tokenizer)로 사용됩니다.

이 분할 인코더는 입력 이미지를 압축된 잠재 표현으로 변환하며, 추론 단계에서 이를 해독하여 복원합니다. 주목할 점은 Qwen 팀이 Wan-2.1의 인코더를 동결하고 이미지 디코더만 미세 조정했음에도 불구하고 모델의 세부 표현력이 크게 향상되었다는 점입니다.

다모달 확산 트랜스포머(MMDiT)를 주 확산 모델로 사용해 텍스트 안내 하에 노이즈와 이미지 잠재 표현 간의 복잡한 연합 분포를 모델링합니다.

각 MMDiT에서 Qwen 팀은 다모달 확장형 RoPE 방법을 도입해 모델이 이미지 및 텍스트 토큰을 구분하면서 높은 해상도 이미지 생성 능력을 유지하고 텍스트 내용을 정확히 생성할 수 있도록 합니다.

  1. 수십억 규모 데이터셋 구축
    모델의 점진적 학습 기반 이미지 생성 능력

아키텍처 설계 완료 후, Qwen-Image는 데이터 엔지니어링, 점진적 학습 전략, 강화된 다중 작업 훈련 패러다임 및 확장 가능한 인프라 최적화를 통해 이미지 생성 모델의 일반적인 문제를 해결했습니다.

복잡한 프롬프트 정렬을 위해 Qwen 팀은 대규모 데이터 수집, 라벨링, 필터링, 합성 강화 및 카테고리 균형을 포함한 데이터 처리 워크플로우를 구축했습니다.

데이터 수집 및 분류 단계에서 해당 팀은 수십억 규모의 텍스트-이미지 쌍 데이터를 체계적으로 수집하고 라벨링했습니다. 이 데이터셋은 네 가지 핵심 분야로 구분됩니다:
(1) 자연(55%): 물체, 풍경, 도시, 식물, 동물, 실내, 음식 등 광범위한 카테고리를 포함하며, 모델이 다양하고 현실적인 이미지를 생성하는 기반이 됩니다.

(2) 디자인(27%): 포스터, 사용자 인터페이스, PPT, 그림, 조각, 디지털 아트 등을 포함하며, 텍스트, 복잡한 레이아웃, 예술적 스타일 등이 풍부해 모델이 예술적 지시, 텍스트 배열, 디자인 의미를 이해하는 데 필수적입니다.

(3)인물(13%): 초상화, 운동, 인물 활동 등을 포함하며, 모델이 실제적이고 다양한 인물 이미지를 생성하는 능력을 향상시키는 데 사용됩니다.

(4)합성 데이터(5%): 통제된 텍스트 렌더링 기술을 통해 생성된 데이터를 지칭하며, 다른 AI 모델이 생성한 이미지는 포함되지 않습니다. 이는 AI 생성 이미지가 초래할 수 있는 아티팩트, 텍스트 왜곡 및 편향 위험을 방지하여 데이터의 신뢰성을 보장합니다.

원본 데이터셋을 확보한 후, Qwen 팀은 7단계 점진적 데이터 필터링을 수행했습니다. 이는 초기 사전 훈련 데이터 정리, 이미지 품질 향상, 텍스트-이미지 정렬 최적화, 텍스트 렌더링 강화, 고해상도 정제, 카테고리 균형 조정 및 초상 강화, 균형 잡힌 다중 스케일 훈련을 포함합니다.

예비 훈련 단계에서 Qwen-Image는 커리큘럼 학습(curriculum learning) 전략을 채택했습니다. 기본적인 텍스트 렌더링 작업부터 시작해 점차 단락 수준과 레이아웃 민감형 설명 생성에 이르기까지 단계적으로 전환했습니다. 이 방법은 모델의 다양한 언어 이해 및 생성 능력을 크게 향상시켰으며, 특히 한자 등 표의 문자 언어에서 우수한 성능을 보였습니다.

이 점진적 학습 방식은 여러 측면에서 반영되었습니다.

해상도 측면에서 Qwen-Image는 256p부터 시작해 640p와 1328p로 점차 향상시켜 모델이 전체에서 세부 사항으로의 시각적 특징을 단계적으로 학습합니다.

데이터 품질도 점진적으로 향상됩니다. 초기에는 대규모 데이터를 활용해 기초 능력을 빠르게 구축한 후, 후반 단계에서 엄격한 데이터 필터링을 도입해 고품질·고해상도 데이터로 정제합니다.

텍스트 렌더링 능력은 점차 강화됩니다. 먼저 텍스트가 없는 일반 이미지 생성을 훈련한 후, 텍스트(특히 중국어)가 포함된 이미지를 단계적으로 추가하여 텍스트 렌더링 능력을专门 강화합니다.

데이터 분포 측면에서, 자연, 디자인, 인물 등 다양한 분야와 해상도별 데이터 비율은 훈련 상황에 따라 조정되어 과적합을 방지합니다.

이미지 편집 측면에서 Qwen-Image는 스타일 전환, 추가/삭제/수정, 세부 사항 강화, 텍스트 편집, 인물 자세 조정 등 다양한 작업을 지원합니다.

  1. 다중 작업 프레임워크를 통한 통합 생성 및 편집
    20만 회 이상의 대결 후 경쟁 분야 상위 3위권에 진입

이미지 생성 모델의 훈련은 인프라에 더 높은 요구사항을 제시합니다. 모델의 대규모 파라미터와 데이터 양을 처리하기 위해 Qwen 팀은 효율적인 분산 훈련 프레임워크를 설계했습니다.

이 프레임워크에는 생산자(Producer)와 소비자(Consumer)가 포함됩니다.
생산자는 모든 데이터 전처리 작업을 담당하며, 데이터 필터링, MLLM 특징 추출 및 VAE 인코딩을 수행합니다. 처리된 데이터는 해상도에 따라 고속 캐시에 저장됩니다.

소비자는 GPU 클러스터에 배포되어 모델 훈련에 집중합니다. 전용 HTTP 전송 계층을 통해 소비자는 생산자로부터 전처리된 배치 데이터를 비동기적으로, 복사 없이 가져올 수 있습니다.

이 프레임워크는 처리량 집약적인 사전 처리와 계산 집약적인 훈련을 분리하여 GPU 활용률과 전체 처리량을 크게 향상시켰으며, 데이터 파이프라인의 온라인 업데이트를 지원합니다.

Qwen 팀은 데이터 병렬화와 텐서 병렬화를 결합한 혼합 병렬화 전략을 채택했으며, 다중 헤드 어텐션 모듈에서 ‘헤드 병렬화’(head-wise parallelism)를 적용하여 통신 오버헤드를 줄였습니다.

예비 훈련 후, 이 팀은 감독 미세 조정(SFT)과 강화 학습(RL)을 통해 Qwen-Image의 생성 품질을 추가로 향상시키고 인간 선호도와 일치시켰습니다.

감독 미세 조정 단계에서는 계층적으로 조직된 고품질 데이터셋을 구축했으며, 모든 샘플은 인간이 정밀하게 라벨링하여 이미지 명확성, 세부 사항 풍부성, 밝기 표현, 사진 수준의 현실감을 강조했습니다. 이는 모델이 더 높은 품질의 시각적 콘텐츠를 생성하도록 안내합니다.

이후 강화 학습을 도입해 생성 선호도를 추가로 최적화했습니다. 주로 직접 선호도 최적화 방법을 사용했으며, 동일한 프롬프트에 대해 다중 후보 이미지를 생성하고 인간이 최상위와 최하위 샘플을 표시합니다. DPO 손실 함수는 스트림 매칭 프레임워크를 기반으로 모델이 “좋은”과 “나쁜” 샘플에 대한 속도 예측 차이를 비교해 매개변수를 업데이트합니다.

이 기반 위에 Qwen-Image는 그룹 상대 전략 최적화(GRPO)를 적용해 세밀한 조정을 수행합니다. 각 그룹의 생성 결과에서 보상 모델의 점수를 기반으로 우위 함수를 계산하고 이를 바탕으로 전략을 조정합니다. 탐색 능력을 강화하기 위해 GRPO는 샘플링 시 전통적인 ODE 대신 무작위 미분 방정식(SDE)을 사용합니다.

Qwen-Image는 통합된 다중 작업 프레임워크를 통해 텍스트에서 이미지(T2I)와 텍스트-이미지(TI2I, 즉 이미지 편집) 등 다양한 생성 모드를 지원합니다. 이미지 편집 작업에서 사용자가 제공한 참조 이미지는 Qwen2.5-VL을 통해 처리되며, 시각적 Transformer(ViT)로 인코딩된 후 텍스트 토큰(text tokens)과 결합되어 입력 시퀀스를 형성합니다.

이 과정에서 Qwen2.5-VL은 입력 이미지의 핵심 특징(색상, 모양, 크기, 텍스처, 물체, 배경)을 설명한 후, 사용자의 텍스트 지시가 해당 이미지를 어떻게 변경하거나 수정해야 하는지 해석합니다.

Qwen-Image는 사용자의 요구사항에 맞는 새로운 이미지를 생성하며, 적절한 경우 원본 입력 이미지와 일관성을 유지합니다.

다중 이미지 구분을 위해 Qwen 팀은 기존 단일 이미지 내 이미지 블록의 높이 및 너비를 위치시키는 MSRoPE를 확장하여 추가적인 ‘프레임(Frame)’ 차원을 도입했습니다. 이는 모델의 시각적 충실도 유지 및 사용자가 제공한 이미지와 구조적 일관성을 강화합니다.

Qwen 팀은 대규모 정량적 및 정성적 실험을 통해 Qwen-Image의 생성 및 편집 능력을 검증했습니다.

5,000개의 프롬프트와 20만 회 이상의 익명 대결이 진행된 AI Arena에서 Qwen-Image는 유일한 오픈소스 모델로 상위 3위에 진입했으며, GPT Image 1, FLUX.1 Pro 등보다 30점 이상 앞섰습니다.

주력 분야인 중국어 텍스트 생성 시나리오에서 Qwen-Image의 단일 문자 렌더링 정확도는 58.3%를 달성했습니다.

이미지 편집 작업에서 Qwen-Image는 GEdit, ImgEdit 등 차트에서 1위를 차지했으며, 심도 추정 및 제로 샘플 신시각 합성에서도 폐쇄형 모델과 동등하거나 더 우수한 성능을 보여주었습니다.

기술 보고서에서는 이 모델과 다른 모델의 생성 결과 비교도 제시되었습니다. 서점 창문 사례에서 Qwen-Image는 책 표지와 텍스트의 조합을 잘 처리했습니다.

복잡한 영어 텍스트 렌더링에서 왼쪽 두 모델은 다양한 수준의 문자 오류가 발생했지만, 오른쪽의 GPT Image 1(High)과 Qwen Image는 유사한 문제를 보이지 않았습니다.

이미지 편집 작업에서는 다른 세 모델 모두 힌트 텍스트에서 요구한 냉장고 스티커의 질감을 정확히 표현하지 못했지만, Qwen-Image의 결과물은 색상이나 모양 모두 힌트 텍스트 요구사항에 비교적 부합합니다.

  1. 결론: 알리바바, 이미지 모델 오픈소스화 지속
    사용성 더욱 향상

올해 6월, 알리바바는 Wan 2.1 이미지 생성 모델을 오픈소스화했으며 최대 14B 버전을 제공합니다.이번 Qwen-Image는 파라미터 수를 20B로 추가로 증가시켜 모델의 활용도가 더욱 향상되었습니다.

Qwen-Image는 텍스트 생성, 이미지 편집 등 특정 기능에 대한 최적화를 통해 포스터 제작, PPT 생성, 정밀한 이미지 편집 등 능력을 갖추게 되었습니다. 이러한 능력은 이미지 생성 기술이 실제 생산 환경에 적용되는 데 큰 의미를 갖습니다.

profile
enjoy the ai and life

0개의 댓글