눈 쌓인 기와 담장 앞에 여인과 뿔 달린 짐승이 마주 섭니다. 같은 컴퓨터에서 프롬프트와 스타일을 바꾸자 강변의 CRT 머리 인물, 복고 게임장, 소나무 숲의 전사도 나왔습니다. 반면 포장마차 장면의 메뉴판은 한글처럼 보이지만 읽을 수 없는 글자로 채워졌습니다. 이 열 장을 함께 봐야 Z-Image Turbo의 쓸모와 한계가 보입니다.
이번 작업은 모델 순위 비교나 속도 벤치마크가 아닙니다. 제 PC에서 공개 워크플로를 로컬 모델 파일에 맞춰 실행하고, 한국적 단서를 넣은 서로 다른 장면 열 개가 실제로 출력되는지 확인한 기록입니다. 결과물은 생성 이미지이며 실재 장소·행사·인물의 기록 사진이 아닙니다.
눈 쌓인 기와 담장 앞의 판타지 장면. 로컬 ComfyUI의 Z-Image Turbo 출력원본 전체 보기
왜 이 구성이 편했나
Z-Image는 Tongyi-MAI가 공개한 6B 이미지 생성 모델 계열입니다. 공식 설명은 Turbo를 **8회 추론 단계(NFE)**로 쓰는 구성을 안내하고, 16GB급 소비자 GPU에서의 사용 가능성을 강조합니다. 이 말은 모든 PC에서 같은 시간이나 품질이 나온다는 보장은 아닙니다. 제가 확인한 것은 RTX 5070 Ti 16GB에서 이 워크플로로 열 장을 성공적으로 출력했다는 범위까지입니다.
한 번 노드를 연결해 놓은 뒤에는 장면마다 새 그래프를 짜지 않았습니다. 프롬프트, 스타일 프리셋, 시드를 바꾸며 1088×1600 세로 이미지를 각각 생성했습니다. 설계도를 고정하고 장면의 조건을 바꾸는 방식이라 어떤 파일과 설정을 썼는지 되짚기 쉽습니다. 로컬에서 실행했으므로 이미지를 외부 생성 서비스에 올려 처리하는 과정도 없었습니다. 다만 첫 설치, 모델 다운로드, GPU 메모리 관리까지 모두 손수 책임져야 하는 방식입니다.
강변의 CRT 머리 인물과 고양이. 같은 워크플로의 다른 장면원본 전체 보기
실제로 사용한 환경과 파일
표가 넓으면 좌우로 스크롤하여 확인하세요.
| 항목 | 이번 작업의 값 |
|---|---|
| GPU | NVIDIA RTX 5070 Ti, VRAM 16GB |
| ComfyUI | 0.37.0 |
| 커스텀 노드 | Z-Image Power Nodes 2.1.1 |
| 확산 모델 | z_image_turbo_bf16.safetensors |
| 텍스트 인코더 | qwen_3_4b_fp8_mixed.safetensors |
| VAE | ae.safetensors |
| 생성 설정 | 8 steps, 1088×1600 세로 |
| 결과 | 서로 다른 프롬프트·스타일·시드의 PNG 10장, 각 작업 성공 |
ComfyUI 기본 설치 경로를 기준으로 확산 모델은 ComfyUI/models/diffusion_models/, 텍스트 인코더는 ComfyUI/models/text_encoders/, VAE는 ComfyUI/models/vae/에 둡니다. 이미 다른 모델 경로를 연결해 쓰고 있다면 자신의 ComfyUI 설정을 따르세요. 파일 이름이 노드의 선택 목록에 나타나지 않으면 폴더와 재시작 여부부터 확인하는 편이 빠릅니다.
따라 하는 순서
- 모델 파일을 준비합니다. Comfy-Org의 Z-Image Turbo 배포 페이지에서 확산 모델·텍스트 인코더·VAE의 파일명과 출처를 확인합니다. 이 글의 표는 제가 실제로 선택한 조합입니다. 다른 정밀도나 체크포인트로 바꾸면 같은 출력이라고 볼 수 없습니다.
- ComfyUI에 노드를 설치합니다.
Z-Image Power Nodes를 설치하고 ComfyUI를 재시작했습니다. 제가 확인한 버전은 2.1.1입니다. 설치 방법은 노드 저장소의 안내를 따르세요. - 참고 워크플로를 불러옵니다. Martin Rizzo의
Z-Image Total Fun / Analog.1워크플로 JSON을 ComfyUI에 가져왔습니다. 원본 예시 사진을 가져다 쓴 것이 아니라, 공개된 노드 구성을 로컬 모델 파일에 맞게 바꾼 것입니다. 누락된 노드가 표시되면 Power Nodes 설치와 버전을 먼저 점검합니다. - 모델 선택과 출력 조건을 맞춥니다. 그래프에서 확산 모델, 텍스트 인코더, VAE가 위 파일을 가리키는지 확인합니다. 이번에는 8 steps와 1088×1600 세로 크기를 썼습니다. 노드가 여러 곳에서 파일을 참조한다면 한 곳만 바꾸고 끝내지 말고 전체 선택값을 확인해야 합니다.
- 장면을 바꿔 실행합니다. 장소·피사체·조명·스타일을 적은 프롬프트와 스타일 프리셋, 시드를 장면별로 바꿨습니다. 열 장은 한 번의 출력이 아니라 열 개의 별도 작업입니다. 작업을 큐에 넣은 뒤 PNG와 사용한 워크플로 JSON을 함께 보관하면 나중에 설정을 되짚기 쉽습니다.
- 원본 크기에서 검수합니다. 축소 미리보기만 보지 말고 간판, 손가락, 작은 로고 유사 글자, 피사체 수를 확대해서 봅니다. 이상한 글자를 카드의 텍스트 오버레이로 가리는 것과 원본 이미지의 문자 생성이 정확한 것은 다른 문제입니다.
한 장면에 실제로 넣은 영어 프롬프트는 다음과 같습니다. 스타일 프리셋은 80s Dark Fantasy Photo였습니다. 이 문장은 생성 뒤에 번역하거나 다듬은 문구가 아니라 해당 작업에 사용한 프롬프트입니다.
In falling snow near the stone walls of a Korean palace garden, a large dark-blue mythical beast with curling horns leans toward an adult Korean woman with flowing auburn hair and a dark winter cloak. She quietly offers it one vivid red camellia flower. The beast has a luminous amber eye and textured fur. Deep blue night, scattered warm lantern light, snowflakes and distant tiled palace roofs, intimate fairytale tension, no text bubble.
열 장에서 확인한 장점과 실패
눈 쌓인 기와 건물 장면, 야간 강변, 복고 게임장, 소나무 숲의 판타지 장면은 서로 다른 분위기를 한 그래프에서 만들 수 있다는 점을 보여줬습니다. 특히 간판처럼 읽어야 할 글자가 거의 없는 장면은 화면 전체를 쓰기 좋았습니다. 이것은 이번 열 장의 관찰이지 다른 모델보다 언제나 낫다는 판정은 아닙니다.
복고 게임장과 로봇 장면. 문자보다 구도와 분위기에 무게를 둔 출력원본 전체 보기
실패도 구체적입니다. 포장마차의 메뉴판과 병 라벨은 의사 한글로 나왔고, 다른 두 장의 간판에서도 비슷한 문제가 보였습니다. 조종석 장면의 옷소매에는 요청하지 않은 브랜드 로고와 닮은 글자가 생겼습니다. 택시 셀피는 프롬프트에 다섯 명을 적었지만 화면에는 네 명만 뚜렷하게 보였고, V자를 그린 손가락도 어색했습니다. no logos를 적어도 로고처럼 보이는 흔적이 남을 수 있다는 뜻입니다.
공식 자료가 언급하는 텍스트 렌더링 강점은 영어·중국어 중심입니다. 이를 한국어 간판 정확도로 옮겨 말할 근거는 없습니다. 정확한 한글이 필요한 포스터, 행사 안내, 제품 라벨이라면 배경 이미지를 만든 다음 검수된 글자를 별도 편집 단계에서 얹는 쪽이 안전합니다. 생성 장면을 실재 현장 사진처럼 소개하지 않는 것도 기본입니다.
소나무 숲의 판타지 전사. 읽어야 하는 글자 없이 장면을 구성한 출력원본 전체 보기
어떤 때 선택할까
16GB급 GPU가 있고 ComfyUI의 모델 파일과 노드를 직접 관리할 수 있다면, Z-Image Turbo는 같은 그래프를 두고 여러 분위기의 이미지를 빠르게 시도해 보는 출발점이 됩니다. 여기서 ‘빠르게’는 이번 구성의 8 steps를 말합니다. 다른 모델·GPU와 초 단위로 비교한 결과는 없습니다. 한글 문구나 정확한 인원·손 동작이 결과의 핵심이라면 프롬프트만 믿지 말고 별도의 수정과 검수 시간을 잡아야 합니다.
제작: 이미지 10장은 로컬 ComfyUI의 Z-Image Turbo로 생성했습니다. 이 글의 구성과 검수에는 Aside가 참여했습니다. 참고한 워크플로는 Martin Rizzo의 Analog.1이며, 예시 원본 사진을 복제하지 않았습니다.

