밈 속 인물을 우리 집 반려동물로 바꿔 보려고 이미지 두 장을 올리면, 결과는 두 가지 방향으로 어긋나기 쉽습니다. 동작은 비슷한데 얼굴이 다른 개체가 되거나, 얼굴은 닮았는데 원본의 넥타이와 구두가 그대로 남습니다. 어느 쪽이든 모델이 두 사진에서 무엇을 가져와야 하는지 정확히 몰랐기 때문입니다.
이 글은 그 어긋남을 줄이는 문장 구조를 다룹니다. 같은 사진 두 장으로 짧은 요청과 역할을 나눈 요청을 각각 생성해 비교했고, 두 번째 장면에서 같은 구조를 다시 적용했습니다. 실제로 입력한 문장은 그대로 아래에 붙였습니다.
출발점과 이 글의 범위
ai_newpd의 밈 변환 게시물은 밈 원본과 반려동물 사진을 순서대로 올리라고 안내합니다. 공개 캡션에는 원본의 동작과 표정은 살리고 얼굴, 털색, 무늬, 체형은 반려동물 사진을 기준으로 반영한다는 설명이 있습니다. 옷과 신발은 제거하고 안경이나 헤드폰 같은 소품은 유지하는 구성이라는 설명도 보입니다. 결과가 모델과 원본에 따라 달라질 수 있다는 주의도 함께 적혀 있습니다.
그 게시물이 댓글 참여자에게 따로 보내는 프롬프트 자료는 받지 않았고, 이 글에도 옮기지 않았습니다. 아래 문장은 공개 캡션에서 읽은 작동 원리만 참고해 새로 쓴 것입니다. 원작자의 표현이나 구성, 이미지를 가져오지 않았습니다. 원작자의 실제 프롬프트가 어떻게 생겼는지는 이 글로 알 수 없습니다.
시험에 쓴 재료
실제 반려동물 사진이나 남이 만든 밈은 쓰지 않았습니다. 권리 문제를 피하려고 재료도 모두 이 글을 위해 생성한 이미지입니다. 정체성 기준 사진은 삼색 털의 비글 계열 강아지 한 장입니다. 포즈 기준 그림은 책상에 엎드려 팔을 늘어뜨린 직장인 한 명이고, 두 번째 시험용 그림은 가방을 들고 뛰어오르는 직장인입니다.
자체 생성한 삼색 강아지 기준 사진원본 전체 보기
자체 생성한 책상에 엎드린 직장인 포즈 기준 그림원본 전체 보기
두 장 모두 사람이 찍은 기록 사진이 아니고 생성 이미지입니다. 따라서 이 시험은 실제 사진의 얼굴 유사도를 검증하지 않습니다. 확인할 수 있는 것은 같은 사진 쌍에서 문장 구조가 달라질 때 결과가 어떻게 달라지는지입니다.
짧은 요청에서 생긴 일
먼저 가장 흔한 요청을 그대로 넣었습니다. 첫 번째 이미지는 포즈 그림, 두 번째 이미지는 강아지 사진입니다.
Make the first image with the dog from the second image.
짧은 요청의 결과: 강아지에게 넥타이가 남았고 사람 다리와 구두가 의자 아래에 남은 이미지원본 전체 보기
결과는 절반만 성공했습니다. 엎드린 자세, 책상, 노트북, 헤드폰은 유지됐고 얼굴은 흰 줄무늬와 삼색 털로 강아지 사진을 따랐습니다. 하지만 원본의 파란 넥타이가 개의 가슴 앞에 그대로 남았고, 의자 아래에는 사람 다리와 구두가 보입니다. 원본에서 사라져야 할 것을 말하지 않았으니 모델은 장면의 일부로 보고 남겼습니다.
역할을 나눈 요청
두 번째 요청은 문장을 다섯 칸으로 나눴습니다. 각 이미지의 역할, 유지할 장면, 가져올 외모 특징, 지울 것, 몸의 제약입니다.
Image 1 is the pose reference (an illustration of a worker slumped over a desk). Image 2 is the identity reference (a real-looking dog). Recreate Image 1 with the dog from Image 2 as the only character, in the same pose, camera angle, desk, laptop, chair and pastel blue background. Keep the droopy, exhausted body language and closed eyes. Take the dog's face shape, ear shape, white blaze, brown eye patch and tricolor coat from Image 2. Remove the person, the shirt, the tie and the shoes. Keep the headphones around the neck and the round glasses as props. Keep the dog's natural body proportions and four legs; do not give it human hands. No text.
역할을 나눈 요청의 결과: 강아지가 책상에 엎드려 있고 넥타이와 구두가 없는 이미지원본 전체 보기
이번에는 넥타이, 구두, 사람 다리가 모두 사라졌습니다. 헤드폰과 둥근 안경은 소품으로 남았고, 늘어진 앞발이 의자 앞쪽으로 내려왔습니다. 눈은 감겨 있고 흰 줄무늬와 삼색 털, 늘어진 귀가 기준 사진과 같은 방향으로 읽힙니다. 다만 기준 사진에서 눈 위의 갈색 무늬는 이 컷에서 안경과 겹쳐 확인하기 어렵습니다. 얼굴 특징을 지정했다고 모든 특징이 보인다고 말할 수는 없습니다.
같은 구조를 다른 장면에 적용한 결과
포즈가 크게 다른 장면에서도 같은 구조가 통하는지 보려고 뛰어오르는 직장인 그림을 새로 만들었습니다. 지울 것은 셔츠, 사원증 줄, 신발로 바꾸고 유지할 소품은 가방으로 바꿨습니다. 두 발로 서는 포즈라서 사람 다리가 나오지 않도록 제약을 한 줄 더했습니다.
Image 1 is the pose reference (an illustration of a worker jumping in celebration). Image 2 is the identity reference (a real-looking dog). Recreate Image 1 with the dog from Image 2 as the only character, in the same mid-air pose, camera angle and warm yellow background. Keep the joyful, energetic body language and the tote bag. Take the dog's face shape, ear shape, white blaze and tricolor coat from Image 2. Remove the person, the clothes, the lanyard and the shoes. Keep the dog's natural body proportions and four legs; do not give it human hands or human legs. No text.
뛰어오르는 직장인 그림을 같은 구조로 강아지로 바꾼 결과원본 전체 보기
노란 배경, 위로 든 팔의 방향, 가방을 쥔 앞발이 유지됐습니다. 강아지의 흰 줄무늬와 삼색 털도 이어졌습니다. 이 컷에서는 사람 옷이나 신발이 보이지 않습니다. 다만 한 번 생성한 결과일 뿐이어서 같은 문장이 매번 같은 결과를 낸다고 보증하지는 않습니다. 이 실험의 시도 횟수는 장면마다 한 번이었습니다.
직접 쓸 때 채울 칸
아래 한국어 틀은 위 영어 문장의 구조를 옮긴 미실행 예시입니다. 괄호만 바꿔 쓰되, 이 틀을 그대로 시험한 결과는 없습니다.
첫 번째 이미지는 포즈 기준(밈 원본), 두 번째 이미지는 외모 기준([반려동물])입니다.
첫 번째 이미지의 구도, 카메라 각도, 배경, 동작과 표정은 유지하고 등장 인물은 두 번째 이미지의 동물 한 마리로만 바꿉니다.
두 번째 이미지에서 가져올 것: [얼굴형, 귀 모양, 털색, 무늬, 체형].
지울 것: [사람, 옷, 신발, 넥타이처럼 동물에게 어울리지 않는 것].
남길 소품: [안경, 헤드폰, 가방].
동물의 몸은 자연스러운 비율과 [네 다리]를 유지하고 사람 손이나 사람 다리는 만들지 않습니다. 글자는 넣지 않습니다.
각 칸이 하는 일은 다릅니다. 이미지 번호와 역할은 두 장이 섞이는 것을 막습니다. 유지할 장면은 모델이 배경과 구도까지 다시 상상하지 않게 합니다. 가져올 외모 특징은 막연한 닮음 대신 눈으로 확인할 기준을 줍니다. 지울 것은 실제 시험에서 가장 효과가 컸습니다.
바꿔 가며 조정하는 법
한 번에 하나만 고칩니다. 얼굴이 덜 닮았다면 외모 칸에 가장 눈에 띄는 특징 두세 개를 더 구체적으로 적습니다. 눈 위 무늬처럼 안경이나 소품에 가려지는 특징은 소품 위치와 충돌하는지 먼저 봅니다. 포즈가 어긋나면 동작 칸에서 어느 관절이나 방향을 고정할지 적습니다.
사람과 동물은 몸 구조가 다릅니다. 팔을 뻗는 포즈를 앞다리로 어떻게 바꿀지 적지 않으면 모델이 사람 손을 남기기도 합니다. 위 시험에서는 손과 다리의 제약을 문장에 넣어 해결했습니다. 반대로 포즈의 원본 의도가 두 발로 걷는 모습이라면 그 점도 명시해야 합니다.
기준 사진은 얼굴, 귀, 털 무늬, 몸통과 다리 비율이 보이는 한 장이 좋습니다. 얼굴 일부만 보이는 사진은 가려진 부분을 추정하게 만듭니다. 사진이 여러 장이라면 각 사진의 역할을 따로 적습니다. OpenAI의 이미지 프롬프트 가이드도 여러 입력 이미지를 쓸 때 각 이미지가 맡을 역할을 말로 정하고, 바꿀 것과 유지할 것을 나누라고 안내합니다. 이 글의 틀은 그 안내를 밈 변환에 적용한 것입니다.
지울 것과 남길 것을 따로 적는 이유
사람이 입은 옷은 밈에서 정체성의 일부처럼 보일 때가 많습니다. 정장 셔츠와 넥타이는 출근길의 피로를 말해 주는 장치이고, 신발 한 짝이 벗겨진 모습은 지친 정도를 보여 주는 단서입니다. 이런 요소를 모델이 어떻게 처리할지는 문장에 달려 있습니다. 아무 말도 하지 않으면 장면의 일부로 보고 그대로 두는 경우가 있었고, 이번 짧은 요청에서 넥타이와 구두가 남은 것이 그 예입니다.
그래서 소품은 세 갈래로 나눠 적습니다. 완전히 지울 것은 옷과 신발처럼 동물 몸에 맞지 않는 것입니다. 남길 것은 헤드폰, 안경, 가방처럼 밈의 웃음을 만드는 소품입니다. 모양을 바꿔야 할 것은 동물의 몸에 맞게 달라져야 하는 항목으로, 예를 들어 사람 손이 쥐던 물건을 앞발로 걸치는 방식입니다. 모양을 바꿀 소품은 위 시험에서 따로 지정하지 않았고, 가방이 앞발에 걸린 것은 모델의 해석이었습니다. 의도한 모양이 있다면 직접 적어 주는 편이 안전합니다.
남길 소품도 크기와 위치를 함께 쓰면 더 확실합니다. 둥근 안경은 눈 위에 겹치기 때문에 눈 위의 갈색 무늬를 가렸고, 헤드폰은 귀 모양을 일부 덮었습니다. 소품이 얼굴 특징과 충돌하면 어느 쪽을 우선할지 정해야 합니다. 이 시험에서는 소품을 우선했기 때문에 무늬가 덜 보였습니다. 얼굴 특징이 더 중요한 작업이라면 안경 같은 소품을 줄이는 쪽이 낫습니다.
결과를 기록하는 방법
같은 사진 쌍으로 여러 번 시도할 때는 어느 칸을 바꿨는지 한 줄씩 남겨 둡니다. 예를 들어 첫 시도에서 지울 것을 비웠더니 넥타이가 남았고, 둘째 시도에서 지울 것을 적었더니 사라졌다고 기록합니다. 기록이 쌓이면 자주 어긋나는 칸이 보이고, 그 칸을 기본 틀에 미리 넣어 둘 수 있습니다. 반대로 한 번에 여러 칸을 바꾸면 무엇이 효과를 냈는지 알 수 없습니다.
한계와 확인 순서
생성 결과는 닮은 느낌을 만들 뿐 같은 개체임을 보증하지 않습니다. 반려동물 특유의 무늬를 정확히 남겨야 한다면 결과를 기준 사진과 나란히 놓고 확인합니다. 줄무늬 위치, 귀 모양, 털색이 다르면 그 칸의 설명을 더 구체적으로 고칩니다.
밈 원본을 쓸 때는 권리도 확인해야 합니다. 이 글은 직접 생성한 그림으로만 시험했습니다. 남이 만든 이미지나 캐릭터를 올려 변환한 결과를 공개하거나 판매에 쓰려면 이용 조건을 따로 봐야 합니다. 얼굴이 나오는 사람 사진을 쓸 때는 본인의 동의도 필요합니다.
마지막으로 결과를 볼 때는 순서를 정하면 편합니다. 먼저 등장하는 개체 수를 셉니다. 다음으로 지우라고 한 옷과 신발이 남았는지 봅니다. 그다음 동작과 배경이 원본과 같은지, 마지막으로 얼굴 특징이 기준 사진과 맞는지 확인합니다. 어긋난 칸 하나만 고쳐 다시 생성하면 무엇이 효과를 냈는지 알아보기 쉽습니다.
짧은 요청이 쓸모없다는 뜻은 아닙니다. 소품이나 옷이 없는 밈이라면 짧은 문장으로도 충분할 수 있습니다. 이 시험이 보여 주는 것은 원본에 지워야 할 요소가 있을 때 그 요소를 문장에 적지 않으면 남을 수 있다는 점입니다.
출처
아이디어 출발점: ai_newpd, 밈 변환 공개 게시물. 작성법 교차 확인: OpenAI, 이미지 프롬프트 가이드. 시험에 쓴 모든 이미지와 프롬프트는 DMS.Labs가 직접 생성하고 작성했습니다. 위 영어 문장 세 개는 실제 입력본이고 한국어 틀은 미실행 예시입니다.

