TECH 으로 돌아가기
TECH HACKER NEWS 오늘 8분 읽기 31 READS

알리바바 Qwen Image 2.1 공개: 글자를 제대로 쓰고 편집까지 되는 오픈 이미지 모델, 뭐가 달라졌나

무슨 일이 있었나요?

알리바바 Qwen 팀이 이미지 생성 모델 Qwen Image의 새 버전, 2.1을 공개했어요. Qwen이라고 하면 보통 LLM을 떠올리는데, 사실 Qwen 팀은 작년 여름 Qwen-Image를 내놓으면서 이미지 생성 쪽에서도 존재감을 키워왔어요. 특히 '그림 속에 글자를 정확하게 써 넣는' 능력에서 당시 오픈 모델 중 최고 수준이라는 평가를 받았죠.

이번 2.1은 그 계보를 잇는 업데이트예요. 텍스트 렌더링, 이미지 편집의 일관성, 그리고 실제 사용성 쪽을 다듬은 버전으로 소개되고 있어요. 이전 세대와 마찬가지로 가중치를 공개하는 오픈 모델 노선을 유지하고 있고요.

이게 뭐냐면: 이미지 모델이 '글자'를 못 쓰는 이유

이미지 생성 모델을 써본 분이라면 한 번쯤 겪어보셨을 거예요. 'OPEN 24 HOURS라고 적힌 간판'을 그려달라고 하면 'OPFN 42 HOUSR' 같은 외계어가 나오는 거요. 왜 이러냐면, 확산 모델(diffusion model)은 이미지를 '전체적인 느낌'으로 학습하기 때문이에요. 노이즈 낀 이미지에서 조금씩 노이즈를 걷어내며 그림을 만드는 방식이라, 글자처럼 픽셀 하나 틀리면 의미가 바뀌는 정밀한 구조에 약해요.

Qwen-Image 계열이 여기서 강한 이유는 두 가지예요. 하나는 아키텍처예요. MMDiT(멀티모달 디퓨전 트랜스포머)라는 구조를 쓰는데, 텍스트와 이미지 정보를 한 트랜스포머 안에서 같이 처리해서 '어떤 글자가 어디에 들어가야 하는지'를 훨씬 정밀하게 잡아요. 다른 하나는 텍스트 인코더로 Qwen의 비전-언어 모델(Qwen-VL 계열)을 쓴다는 거예요. CLIP 같은 가벼운 인코더 대신 문장을 진짜로 이해하는 LLM이 프롬프트를 읽으니까, 긴 지시문이나 복잡한 레이아웃 요구를 더 잘 따라와요.

그리고 학습 데이터에서 한자 같은 복잡한 문자 렌더링을 집중적으로 다뤘기 때문에, 라틴 문자만 잘 쓰는 서구권 모델보다 동아시아 문자에 훨씬 강해요. 이건 한국 사용자에게 꽤 중요한 포인트인데, 아래에서 다시 이야기할게요.

생성과 편집을 한 모델로

Qwen-Image의 또 다른 축은 '편집'이에요. 처음엔 생성 모델과 편집 모델(Qwen-Image-Edit)이 따로 있었는데, 세대를 거치면서 하나의 모델이 생성과 편집을 같이 하는 방향으로 통합돼 왔어요.

편집이 뭐냐면, 기존 이미지를 넣고 '이 사람 옷을 파란색으로 바꿔줘', '배경을 해변으로 바꿔줘', '이 간판 글자를 영업 종료로 바꿔줘'처럼 자연어로 수정하는 기능이에요. 어려운 점은 '바꾸라고 한 부분만 바꾸고 나머지는 그대로 두는' 거예요. 얼굴이 미묘하게 바뀌거나, 배경 소품이 사라지거나 하면 실무에서는 못 써요. 2.1에서 강조하는 '일관성'이 바로 이 부분이에요. 여러 번 편집을 거쳐도 원본의 정체성이 유지되느냐가 이런 모델의 실력 척도거든요.

실제로 써보려면 방법은 어렵지 않아요. 허깅페이스에서 가중치를 받아서 diffusers 라이브러리로 돌리거나, ComfyUI에서 노드로 불러오면 돼요. 다만 풀 사이즈 모델은 VRAM을 꽤 먹기 때문에 소비자용 GPU에서는 FP8이나 GGUF 양자화 버전을 쓰는 경우가 많아요. 커뮤니티에서 양자화 버전이 며칠 안에 나오는 것도 오픈 모델의 장점이죠.

업계 맥락: 폐쇄형이 앞서가고, 오픈이 따라잡는 구도

이미지 생성 시장은 지금 폐쇄형 모델과 오픈 모델의 두 트랙으로 나뉘어 있어요.

폐쇄형 쪽에서는 구글의 제미나이 이미지 모델(나노 바나나로 불렸던 계열)과 OpenAI의 GPT Image가 편집 품질과 지시 따르기에서 기준을 세웠어요. 특히 대화하듯 여러 번 수정하는 경험은 폐쇄형이 먼저 대중화했죠.

오픈 쪽에서는 Black Forest Labs의 FLUX 시리즈가 가장 널리 쓰이고, 스테이블 디퓨전 3.5, HiDream, 그리고 바이트댄스의 Seedream 계열이 경쟁하고 있어요. 이 구도에서 Qwen-Image는 '텍스트 렌더링 + 편집 + 느슨한 라이선스'라는 조합으로 자리를 잡았어요. FLUX는 상업 이용에 별도 라이선스가 필요한 버전이 있는 반면, Qwen-Image는 초기부터 아파치 2.0을 내걸어서 서비스에 넣기가 훨씬 편했거든요.

그리고 큰 그림에서 보면, 알리바바는 Qwen LLM, Qwen-VL, Qwen-Image, 그리고 영상 모델 Wan까지 전 영역에서 오픈 모델을 계속 내고 있어요. 딥시크와 함께 '중국발 오픈 모델'이 서구 폐쇄형 모델의 대안으로 자리 잡는 흐름의 한 축이에요.

한국 개발자에게 주는 시사점

첫째, 한글 렌더링을 직접 테스트해보세요. Qwen-Image는 한자와 영어에 강하지만, 한글은 학습 데이터 비중이 다를 수 있어요. 한글 간판, 포스터, 썸네일 텍스트가 얼마나 정확히 나오는지는 직접 돌려봐야 알아요. 만약 잘 나온다면 국내 커머스 썸네일, 배너, 카드뉴스 자동 생성 같은 데 바로 쓸 수 있는 몇 안 되는 오픈 모델이 될 거예요.

둘째, 편집 모델은 '생성'보다 실무 활용도가 높아요. 상품 사진 배경 교체, 모델 착장 변경, 로컬라이징(외국 광고 이미지의 문구를 한글로 바꾸기) 같은 작업은 생성보다 편집 수요가 훨씬 많거든요. 자체 서버에서 돌릴 수 있는 편집 모델이 있다는 건 API 비용과 데이터 유출 걱정을 동시에 줄여줘요.

셋째, 라이선스를 확인하고 활용하세요. Qwen-Image 계열이 지켜온 아파치 2.0 라이선스가 2.1에도 그대로라면, 파인튜닝해서 자사 브랜드 스타일을 학습시키거나 LoRA를 얹어서 특정 캐릭터를 일관되게 그리게 하는 것도 걱정 없이 할 수 있어요. 공개 페이지에서 라이선스 항목을 꼭 한 번 확인하고 시작하세요.

마무리

한 줄로 정리하면, 'Qwen Image 2.1은 글자를 정확히 쓰고 편집이 되는 오픈 이미지 모델의 기준을 한 단계 더 올린 업데이트'예요.

여러분은 어떠세요? 이미지 생성을 실무에 쓰고 있다면 폐쇄형 API와 오픈 모델 중 뭘 선택하셨나요? 그리고 한글 렌더링이 되는 이미지 모델이 있다면 어떤 프로젝트에 가장 먼저 쓰고 싶으신가요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://qwen.ai/blog?id=qwen-image-2.1
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...