TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 25 READS

바운딩 박스로 그리고 상자 단위로 고치는 이미지 모델, FLUX 3 Image

바운딩 박스로 그리고 상자 단위로 고치는 이미지 모델, FLUX 3 Image
SOURCE IMAGE · HACKER NEWS

블랙 포레스트 랩스(Black Forest Labs)가 공개한 FLUX 3는 영상, 오디오, 이미지, 액션을 아우르는 멀티모달 모델이며, 그중 이미지를 생성하고 편집하는 부분이 FLUX 3 Image다. 기존의 텍스트-투-이미지 모델이 '한 문장을 주면 한 장이 나온다'는 방식이었다면, 이 모델은 이미지를 하나의 캔버스로 보고 그 위에 요소를 배치한 뒤 완성된 그림을 상자 단위로 고쳐 나가는 작업 흐름을 제안한다. 손대지 않은 부분은 처음 그대로 남는다는 점이 핵심 설계 원칙이다.

캔버스와 바운딩 박스

작업 방식은 구도를 직접 설계하는 데서 출발한다. 중요한 요소마다 박스를 그리고 그 안에 무엇이 들어갈지 설명한 다음, 장면 전체를 한 줄로 묶어 주면 모델이 각 요소를 지정한 상자 안에 렌더링한다. 어떤 화면비를 고르든 캔버스는 가로·세로 모두 0부터 1000까지의 격자로 표현되고, 각 상자는 [y_min, x_min, y_max, x_max] 좌표로 기록된다. 입력은 두 부분으로 나뉜다. 하나는 이미지 전체를 한 문단으로 묘사하는 글로벌 캡션이고, 다른 하나는 요소마다 한 행을 차지하는 JSON 배열 형태의 요소 테이블이다. 각 행은 id와 바운딩 박스, 설명을 담으며, 캡션은 animal_1처럼 요소가 처음 등장하는 지점에서 그 id를 인용한다. 좌표와 의미론적 id가 함께 묶여 있어 모델이 '무엇을 어디에' 둘지 명확하게 전달받는 구조다.

이 과정을 사람이 전부 손으로 할 필요는 없다. 한 줄의 지시와 화면비만 넘기면 LLM이 레이아웃을 대신 계획해 캡션과 요소 테이블을 작성하고, 중요한 모든 것에 박스와 id를 붙여 준다. 그렇게 만들어진 박스는 여전히 편집 가능하므로, 마음에 들지 않는 상자만 옮기면 나머지는 에이전트가 배치한 대로 모델이 채워 넣는다. 블랙 포레스트 랩스는 이 모델이 레이아웃과 구도를 네이티브하게 이해하도록 학습됐다고 설명하며, 그래서 에이전트가 텍스트 프롬프트만으로도 잘 짜인 이미지를 만들 수 있다고 본다.

상자 단위 편집과 고해상도

편집은 이 모델의 또 다른 축이다. 완성된 이미지에서 여러 상자를 한 번에 겨냥해 고칠 수 있는데, 각 상자는 다시 설명하거나 다른 것으로 교체하거나 위치를 옮기는 것이 가능하다. 예시로 제시된 것은 잠수복과 보드의 색을 상자별로 바꾸면서 나머지는 그대로 둔 편집, 그리고 다이버 두 명을 추가하는 픽셀 단위 편집이다. 건드리지 않은 영역이 정확히 유지되기 때문에 한 차례 편집을 거듭해도 이미지가 흐트러지지 않고 일관성을 지킨다. 또한 최대 10개의 참조 이미지를 함께 넣어 비교적 적은 노력으로 의도한 디자인을 구성할 수 있다.

출력 품질 면에서는 전체 해상도로 렌더링해 질감, 얼굴, 색 같은 작은 디테일을 보존한다는 점을 내세운다. 예시로 든 소바 가게 이미지는 5456×3072 픽셀로 전부 모델이 생성한 결과이며, 네이티브 4K 렌더링과 픽셀 단위 편집을 지원한다. 정밀한 구도와 해상도가 동시에 필요한 작업, 즉 사진 위에 조판한 타이포그래피, 콜라주와 패널 그리드, 에디토리얼 지면, 또는 모든 얼굴이 제자리를 가져야 하는 복잡한 군중 장면처럼 여러 요소가 엄격한 관계로 얽힌 구성에 적합하다고 안내한다.

실무자가 짚어야 할 지점

주목할 세부 사항은 프롬프트 업샘플러의 동작 방식이다. 짧은 요청은 업샘플러를 거쳐 FLUX 3가 학습된 형태의 조밀한 캡션으로 바뀐다. 이때 업샘플러가 사용자의 박스 주변으로 캡션을 작성하고 요소를 추가로 제안할 수는 있지만, 사용자가 직접 그린 박스는 같은 id와 같은 좌표 그대로 모델에 전달된다. 반대로 업샘플러가 덧붙인 요소는 캡션이 그것을 실제로 언급할 때만 살아남는다. 즉 의도한 배치는 보존되지만 자동으로 불어난 요소는 통제 범위 밖에 있을 수 있다는 뜻이어서, 결과를 검수할 때 이 경계를 염두에 둘 필요가 있다.

접근 경로는 두 가지다. 플레이그라운드에서 직접 박스를 그리거나, BFL API로 레이아웃 프롬프트를 보내 FLUX 3를 호출하는 방식이다. 대규모로 이미지 생성을 운영하는 기업을 위해서는 상용 가중치 라이선스가 제공되며, 자체 인프라에서 파인튜닝과 배포가 가능하다. 다만 현재 공개된 정보는 작업 방식과 기능 설명에 집중되어 있을 뿐, 구체적인 가격, 처리 속도, 경쟁 모델과의 정량적 성능 비교, 라이선스 세부 조건은 제시되지 않았다. 바운딩 박스 기반 구도 제어라는 접근이 실제 파이프라인에서 얼마나 손이 덜 가는지는 각자의 작업 성격에 맞춰 직접 검증해 봐야 할 영역으로 남는다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://bfl.ai/models/flux-3-image
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...