배경
개방형 어휘 세그멘테이션(OVS, Open-vocabulary Segmentation)은 사전에 정의된 클래스 목록 없이도 텍스트로 입력된 임의의 개념을 이미지 내에서 픽셀 단위로 찾아내는 최종 목표(Task)를 가집니다. 이를 정교하게 수행하기 위해서는 이미지 속에 포함된 여러 개의 키워드를 동시에 인식하는 다중 레이블 텍스트 분류(Multi-Label Text Classification) 능력이 필수적입니다. 다중 레이블 텍스트 분류란 하나의 입력에 대해 여러 개의 레이블을 동시에 분류하는 기법을 의미합니다. 이 분야는 단순히 사물 하나를 찾는 것을 넘어, 복잡한 문장에 포함된 다양한 객체와 속성들을 누락 없이 식별하고, 그 각각의 위치를 정확히 시각화하는 시각-언어 정렬 기술의 정점을 지향합니다.


기존 기술의 한계
기존의 개방형 어휘 세그멘테이션 모델들은 주로 시각-언어 대조 학습 모델(CLIP, Contrastive Language-Image Pre-training)을 활용하여 이미지와 문장 전체를 하나의 벡터로 연결하는 방식을 사용했습니다. 시각-언어 대조 학습 모델이란 대규모 이미지-텍스트 쌍 데이터를 통해 시각 정보와 언어 정보를 동일한 표현 공간에 정렬하는 사전 훈련 모델입니다. 그러나 기존 방식은 입력 문장 내 다수의 형태소 중 특정 키워드에만 모델의 Attention 가중치가 과도하게 편향되는 단일 태그 편향(Single Tag Bias)라는 구조적 한계를 가지고 있습니다. 이로 인해 다중 객체가 포함된 복합 환경에서 모델이 단일 특징에 과적합되며, 결과적으로 장면 분할 과정에서의 정보 누락과 최종 세그멘테이션 정밀도의 저하를 야기하는 핵심 원인으로 작용합니다.
접근
OGQ GYN은 이러한 기술적 요구 사항을 충족시키기 위해 편향 제거 텍스트-이미지 정렬(Bias-Free Text-Image Alignment)이라는 새로운 기술을 제안하며, 문장에서 추출된 개별 태그들이 이미지의 각 영역과 독립적으로 연결되도록 돕는 TTD(Text-Tag Self-Distillation) 기법을 도입하였습니다. 이는 전체 문장에 대한 모델 Attention 응답이 개별 구성 단어들에 대한 응답의 총합과 등가 하게 되며, 매핑 구조를 통해 모델의 가중치가 특정 단어에 매몰되는 현상을 원천적으로 차단하여, 다중 레이블 전체에 대한 어텐션을 고르게 분산시켜 균형 있는 특징 추출 및 인식을 가능하게 합니다. 결과적으로 다중 레이블 텍스트 분류 성능을 강화함으로써, 복잡한 환경에서도 개방형 어휘 세그멘테이션을 정교하게 구현해 내는 해결책을 제시하였습니다.
동작 방식
TTD는 외부 라벨링 데이터나 무거운 자연어 처리(NLP, Natural Language Processing) 모델의 도움 없이, 이미지-텍스트 쌍만으로 모델 스스로 편향을 교정하는 자가 증류(Self-Distillation) 구조를 가집니다. 자가 증류란 별도의 외부 지도 신호 없이 모델 자체의 출력을 교사 신호로 활용하여 성능을 개선하는 학습 기법입니다. 먼저 입력된 문장에서 후보 단어를 선정하고 각 픽셀과의 유사도를 측정하는 픽셀-태그 점수화(Pixel-Tag Scoring) 과정을 통해 이미지와 실질적으로 연관된 유의미한 태그들을 추출합니다. 추출된 개별 태그들이 생성한 각각의 활성화 지도를 하나로 합치는 맵 통합(Map Union) 과정을 거치는데, 이는 특정 단어에만 편향되지 않은 이상적인 응답 지도의 기준이 됩니다. 최종적으로 문장 전체를 입력했을 때 나타나는 편향된 마스크가 이 통합된 맵 통합 결과와 일치하도록 유도하는 자가 증류를 수행함으로써, 특정 태그에 매몰되지 않고 모든 레이블을 균형 있게 인식하는 편향 제거 세그멘테이션 맵을 생성합니다.
성과
OGQ GYN 연구팀은 다중 태그 선택 정확도인 F1 점수(F1 Score)에서 기존 자연어 처리 방식 대비 +13% 상승을 기록하였으며, 평균 교차 합집합 비율(mIoU, Mean Intersection over Union) 61.1%로 기존 기준 모델(Baseline) 대비 +6.1% 상승, MaskCLIP 기준 정확도는 +15.4% 향상되었습니다. 평균 교차 합집합 비율이란 예측된 영역과 실제 영역 간의 겹침 정도를 백분율로 나타낸 세그멘테이션 정확도 지표입니다. 이는 텍스트 인식률의 획기적인 개선을 증명하며, 핵심 성과 지표(KPI, Key Performance Indicator)를 통해 TTD 기술의 성능을 정량적으로 검증하였습니다.