배경
지시어 기반 이미지 편집(Instruction Guided Image Editing)은 '사탕을 사과로 바꿔줘'와 같은 자연어 명령을 통해 이미지의 특정 부분만 정밀하게 수정하는 기술입니다. 지시어 기반 이미지 편집이란 사용자가 입력한 자연어 지시문에 따라 원본 이미지의 특정 영역만 선택적으로 변경하는 편집 기법입니다. 사용자가 직관적이고 편리하게 이미지를 변형할 수 있도록 돕는 것이 핵심입니다.

기존 기술의 한계
기존 모델은 확산 모델 특유의 무작위성 때문에 동일 명령에도 결과가 매번 달라지고 배경이 왜곡되는 문제가 있었습니다. 만족스러운 결과를 얻기 위해 여러 번 반복 생성(Best-of-N)해야 하므로 연산 비용이 급증하는 비효율이 발생했습니다. ELECT는 생성 과정을 끝까지 수행하지 않고도 초기 단계에서 최적의 후보를 선별하여 이 문제를 해결합니다.
접근
OGQ GYN은 별도의 학습이나 외부 모델 없이 확산 과정 초기에 배경 불일치 점수(BIS, Background Inconsistency Score)를 측정하여 연산 비용을 줄이면서도 배경 왜곡을 방지하는 제로샷(Zero-shot) 프레임워크 ELECT를 개발하였습니다. 제로샷이란 별도의 추가 학습 없이 사전 훈련된 모델만으로 새로운 추론을 수행하는 방식입니다. 생성 초기 타임스텝에서 최적 후보를 식별함으로써, 전체 생성 사이클을 완주하지 않아도 고품질 편집 결과를 보장하는 접근을 적용하였습니다.
동작 방식
다수의 무작위 시드에 대해 배경 특징이 결정되는 초기 타임스텝까지만 병렬로 노이즈를 제거합니다. 이 단계에서 잠재 표현(Latent)을 추출해 원본과의 차이인 배경 불일치 점수를 산출하고, 왜곡이 최소화될 것으로 예측되는 최적의 시드 1개만을 선택해 나머지 과정을 진행합니다. 잠재 표현이란 확산 모델 내부에서 이미지 정보를 압축하여 표현하는 저차원 벡터입니다. 필요한 경우 다중 모달 대형 언어 모델로 생성한 프롬프트 변종들을 결합하여 최적의 조합을 결정함으로써 고품질 편집본을 보장합니다.
성과
OGQ GYN 연구팀은 연산 비용을 평균 41%에서 최대 61%까지 절감하였으며, VIEScore(Visual Instruction-guided Explainable score) 평가에서 평균 +0.56점의 성능 향상을 기록하여 효율성과 품질을 동시에 달성하였습니다.