DiT 내부의 고정규범(High-norm) 토큰과 주의 집중 왜곡
연구진은 이미지 생성용 디퓨전 트랜스포머(DiT) 내부에서 발생하는 이상치 토큰(Outlier Tokens)의 거동을 분석했다. 분석 결과 사전 학습된 ViT(Vision Transformer) 인코더는 벡터의 길이가 비정상적으로 긴 고정규범(High-norm) 토큰을 생성하는 특성을 보였다. 이러한 고정규범 토큰은 실제 보유한 지역적 정보가 매우 제한적임에도 불구하고, 트랜스포머의 주의 집중(Attention) 메커니즘에서 수치적 우위를 통해 다른 토큰들의 주의를 불균형하게 흡수했다.
이상치 토큰 현상은 인코더뿐만 아니라 DiT 디노이저(Denoiser) 내부에서도 동일하게 나타났다. 연구진은 디노이저의 전체 계층 중 특히 중간 계층(Intermediate layers)에서 내부 이상치 토큰이 집중적으로 형성되는 것을 확인했다. 입력 데이터가 여러 층의 연산을 거치며 추상화되는 과정에서 특정 토큰의 값이 비정상적으로 증폭되었으며, 이는 해당 계층의 주의 집중 메커니즘을 왜곡하여 전체적인 정보 흐름을 방해하는 결과로 이어졌다.
이러한 현상은 현대적인 RAE-DiT(Representation Autoencoder-DiT) 파이프라인 전체에서 관찰되었다. RAE-DiT는 이미지를 잠재 공간으로 압축하는 인코더와 이를 다시 복원하는 디노이저로 구성된다. 사전 학습된 ViT 인코더가 생성한 이상치 표현이 디노이저로 전달되고, 여기에 디노이저 자체의 내부 이상치 토큰이 더해지면서 주의 집중 왜곡이 심화되었다. 결과적으로 소수의 토큰이 연산 자원을 독점하며 이미지의 지역적 의미론을 손상시키는 품질 저하를 유발했다.
단순 마스킹의 한계와 손상된 지역 패치 의미론
연구진은 고정규범 토큰을 단순히 제거하는 마스킹(Masking) 방식을 적용해 성능 변화를 측정했다. 마스킹은 수치가 높은 특정 토큰을 계산에서 제외하여 모델이 인식하지 못하게 하는 처리 방식이다. 실험 결과 단순 마스킹은 이미지 생성 품질의 유의미한 향상을 이끌어내지 못했다. 이는 이상치 토큰 문제가 단순히 몇 개의 극단적인 수치(Extreme values)가 존재하는 것만으로 발생하는 것이 아님을 입증했다.
성능 개선 실패의 근본 원인은 손상된 지역 패치 의미론(Corrupted local patch semantics)에 있었다. 지역 패치 의미론은 이미지를 작은 조각으로 나눈 패치가 가지는 고유한 의미 정보이다. 특정 토큰의 노름(Norm)이 비정상적으로 커지면 해당 영역의 세부 정보가 왜곡되거나 소실되는 현상이 동반되었다. 즉, 수치가 큰 것 자체가 문제가 아니라 그 위치에 있어야 할 유효한 정보가 이미 손상되어 모델이 잘못된 해석을 내리는 상태가 된 것이다.
결과적으로 모델은 유효한 정보가 없는 손상된 영역에 과도한 주의를 집중하게 되었다. 이는 이미지의 국소적인 품질 저하와 시각적 아티팩트(Artifact) 발생으로 직결되었다. 단순한 값의 삭제는 데이터의 공간적 연속성을 끊어내어 오히려 다른 형태의 정보 손실을 야기했으며, 모델의 추론 과정을 불안정하게 만드는 부작용을 낳았다. 따라서 수치적 제거가 아닌 구조적인 개입을 통한 주의 집중 흐름의 제어가 필요했다.
DSR(Dual-Stage Registers)의 3단계 개입 구조
연구진은 인코더와 디노이저 모두에 적용 가능한 레지스터 기반 개입 방법인 DSR(Dual-Stage Registers)을 도입했다. 레지스터는 모델이 연산 과정에서 특정 정보를 임시로 저장하거나 처리 방향을 조정하기 위해 사용하는 가상 공간이다. DSR은 이상치 토큰이 독점하는 주의 집중 가중치를 레지스터가 대신 흡수하는 싱크(Sink) 역할을 수행하여, 가중치가 유효한 토큰들로 적절히 분산되도록 유도한다.
첫 번째 단계인 학습 가능한 레지스터(Trained Registers)는 모델 학습 단계에서 함께 최적화된다. 이 레지스터는 학습 과정에서 이상치 토큰이 가져가는 과도한 주의 집중을 분산시키는 완충 지대로 작동한다. 모델이 특정 극단값에 매몰되지 않고 전체 문맥을 균형 있게 파악하도록 돕는 구조적 장치로 활용된다. 학습 가능한 레지스터는 모델의 가중치 자체를 최적화하여 이상치에 대한 내성을 키우는 방식이다.
두 번째 단계인 재귀적 테스트 시간 레지스터(Recursive Test-time Registers)는 모델 가중치가 고정된 추론 단계에서 작동한다. 이 레지스터는 이전 연산 단계의 결과물을 다시 입력값으로 사용하는 재귀적 구조를 통해 토큰 분포를 정상 범위로 점진적으로 보정한다. 별도의 재학습 없이 실행 시점의 데이터 특성에 맞춰 이상치 토큰의 영향을 억제하므로, 고정된 모델 구조 내에서 추론의 안정성을 확보하는 대안적 수단이 된다.
세 번째 단계인 디퓨전 레지스터(Diffusion Registers)는 디노이저의 노이즈 제거 과정에 특화되어 설계되었다. 디노이저는 무작위 노이즈를 단계적으로 제거하며 이미지를 복원하는데, 이 과정에서 발생하는 특유의 이상치 패턴을 정밀하게 제어한다. 생성 단계의 각 스텝에서 토큰 노름이 급격히 변하는 지점을 포착해 레지스터로 분산시킴으로써, 픽셀 값이 튀는 아티팩트 현상을 방지하고 생성 이미지의 정밀도를 높였다.
RAE-DiT 파이프라인 내 DSR 적용 및 작동 원리
DSR은 RAE-DiT 파이프라인의 두 핵심 구성 요소인 인코더와 디노이저에 계층적으로 적용된다. 먼저 ViT 인코더 단계에서는 학습 가능 레지스터 또는 테스트 시간 레지스터가 개입한다. 인코더가 이미지를 잠재 공간으로 압축하는 과정에서 발생하는 고정규범 토큰의 주의 집중 왜곡을 차단하여, 디노이저로 전달되는 표현(Representation)의 품질을 1차적으로 정돈한다.
이어지는 디노이저 단계에서는 디퓨전 레지스터가 추가로 작동한다. 디노이저는 인코더로부터 받은 표현과 노이즈 입력을 처리하며 최종 이미지를 생성한다. 이때 디노이저 중간 계층에서 자체적으로 발생하는 내부 이상치 토큰을 디퓨전 레지스터가 흡수한다. 인코더의 레지스터가 입력 데이터의 의미론적 왜곡을 막는다면, 디노이저의 레지스터는 생성 단계의 시각적 왜곡을 막는 이중 방어 체계를 구축한다.
이 구조는 기존의 마스킹 방식과 달리 정보의 공백을 만들지 않는다. 마스킹이 이상치와 함께 주변의 유효 정보까지 삭제하는 위험이 있었다면, DSR은 이상치 토큰이 유발하는 부정적인 영향만을 선택적으로 제어한다. 레지스터가 주의 집중의 흐름을 구조적으로 재설계함으로써, 모델은 손상된 지역 패치 의미론으로 인한 왜곡을 피하면서도 이미지의 전체적인 맥락과 세부 묘사를 동시에 유지할 수 있게 되었다.
ImageNet 및 T2I 생성 품질 검증과 설계 기준
연구진은 ImageNet 데이터셋과 대규모 텍스트-이미지(T2I) 생성 작업을 통해 DSR의 효과를 검증했다. 실험 결과 DSR을 적용한 모델은 이상치 토큰으로 인해 발생하던 비정상적인 점, 선, 색상 뭉침 등의 아티팩트를 유의미하게 감소시켰다. 특정 토큰에 쏠리던 주의 집중이 분산되면서 국소적 세부 묘사가 정확해졌고, 배경의 불필요한 노이즈가 줄어드는 결과가 확인되었다.
대규모 T2I 생성 작업에서도 프롬프트의 복잡도에 따른 생성 품질 편차가 줄어들었다. 특정 단어 조합에서 이미지가 뭉개지거나 형태가 무너지는 현상이 억제되었으며, 고해상도 이미지 생성 시 전체적인 구도와 세부 표현의 안정성이 유지되었다. 이는 DSR이 텍스트 의미를 이미지 공간으로 투영하는 경로에서 이상치 토큰의 방해 요소를 제거했기 때문에 가능한 결과였다.
DiT 기반 이미지 생성 모델의 품질을 높이기 위한 레지스터 설계 기준은 다음과 같다. 첫째, 모델 학습 및 대규모 파인튜닝이 가능한 환경에서는 '학습 가능한 레지스터(Trained Registers)'를 도입해 주의 집중을 분산시킨다. 둘째, 가중치가 고정된 추론 환경이나 빠른 적용이 필요한 경우에는 '재귀적 테스트 시간 레지스터(Recursive Test-time Registers)'를 선택한다. 셋째, 디노이저의 노이즈 제거 단계에서 발생하는 픽셀 아티팩트를 제어하기 위해 '디퓨전 레지스터(Diffusion Registers)'를 적용한다. DiT 엔지니어는 모델 중간 계층의 토큰 노름 분포를 측정하여 이상치 현상을 진단하고, 위 기준에 따라 인코더와 디노이저에 적절한 레지스터를 배치함으로써 생성 품질을 최적화해야 한다.




