#5 MLEP

·2026년 9월 7일

papers

목록 보기
6/7

1. 직관적 서사 및 상황극

  • 상황 및 핵심 목표 (Mission & Context):
    입력 이미지(xx)가 진짜 카메라로 찍은 실사 사진인지, 생성 모델(GAN, Diffusion 등)이 정교하게 빚어낸 가짜 AI 이미지(AIGI)인지 판별해야 한다. 기존 탐지기들은 특정 사물이나 배경(의미론적 정보, Semantics)에 시선이 팔려 아무리 라벨링을 해 줘도 AIGI 여부와 미세한 차이를 결부시키는 학습을 제대로 하지 못했고, 특히 처음 보는 생성 모델이나 새로운 사물이 등장하면 심하게 오작동했다.
    최종 목표는 이미지 속 사물(고양이, 자동차 등)의 형태를 완전히 무력화하고, 생성 모델 고유의 미세한 붓자국인 '국소 무작위성(Local Randomness)'만을 추출하여 어떤 도메인에서도 통하는 일반화된 판별 특성(MLEP)을 구축하는 것이다.
  • 등장인물 정의 (Agent Cast):

  • 시맨틱 간섭군(Semantic Context): "나 고양이야!", "나 해변 풍경이야!"를 외치며 이미지의 거시적 형태와 화려한 픽셀 대비로 판별관의 시선을 분산시키는 강력한 방해꾼.

  • 엔트로피 측정관(Local Entropy Metric, HH): 픽셀들의 대비나 형태 따위는 무시하고 오직 2×22 \times 2 픽셀 격자 안의 "정보 무질서도(Randomness)"만을 계산하는 무감각한 통계학자.

  • 미세 셔플러(Fine-grained Shuffler): 시맨틱 간섭군이 형체를 유지하지 못하도록 잘게 쪼개 사정없이 뒤섞어 버리는 현장 교란관.

  • 멀티스케일 탐색대(Multi-scale Resampler & Sliding Window): 다양한 해상도 축소 및 겹침 윈도우를 통해 미세 흔적부터 거시 흔적까지 다각도로 뒤지는 수색조.

  • 판별관(CNN Classifier): 정제된 엔트로피 패턴 지도(MLEP)를 받아 최종 판결(Real vs Fake)을 내리는 판사.

  • 상호작용 및 협상 대화극 (The Negotiation):
  • 1단계: 시맨틱 정보의 무장해제 (Shuffle 단계)

    시맨틱 간섭군: "우리는 고화질 텍스처와 형태를 가진 명화다. 우리를 보고 진짜인지 가짜인지 판별해 보아라!"
    미세 셔플러: "싫은데? 너희는 Siren과 같다. 너네 형체를 유지하는 한 그것만 보이기 시작할 거다(Content Bias)에 빠진다.
    이전 연구에서 좀 자르긴 했지만 그렇게 32×3232 \times 32 단위로 쪼개는 것도 부족하다.
    너희의 윤곽선과 시맨틱 구조가 완전히 붕괴되도록 아주 미세한 단위로 조각내어 위치를 뒤섞겠다."

  • 2단계: 픽셀 무작위성 측정 및 타협 (Local Entropy 연산)

    기존 NPR 방식: "인접한 픽셀끼리 뺄셈(Pixel Difference)을 해서 경계면의 아티팩트를 찾으면 되지 않는가?"

자연계 노이즈: "착각하지 마라. 나는 어두운 방에서 ISO를 올리고 찍은 진짜 카메라 센서의 열잡음(Thermal Noise)이다.

1차원 고역 통과 필터링 연산자의 노이즈 증폭:픽셀 차분은 이산 공간에서의 1차 미분(Differential Operation)이다:

ΔxI(x,y)=I(x+1,y)I(x,y)=I(x,y)[1,1]\Delta_x I(x, y) = I(x+1, y) - I(x, y) = I(x, y) * [-1, 1]주파수 영역에서 이는 고주파 증폭기 역할을 하므로, 이미지에 가산 백색 가우시안 노이즈(AWGN) ηN(0,σ2)\eta \sim \mathcal{N}(0, \sigma^2)가 더해질 경우 차분 신호의 분산은 본래 신호와 무관하게 급증한다:

엔트로피 측정관: "단순 뺄셈은 픽셀의 절대적 대비값에 의존하므로 시맨틱 잔재가 고스란히 남는다. 우리는 2×22 \times 2 패치 내 픽셀 분포의 순수한 무질서도(HH)만 계산한다.

후처리 압축군: "인터넷에 올라오는 사진들은 전부 나를 거친다. 고주파 성분을 지우는 가우시안 블러(Blurring)를 한 번 끼얹고, 손실 압축(JPEG)을 적용하겠다."
게다가, 생성 모델의 업샘플링이 남긴 인위적인 '매끄러움(Glossy & Smooth)'은 무작위성을 필연적으로 떨어뜨린다. 실제 자연광 사진은 최대 엔트로피(2.0)에 도달할 확률이 60%60\% 이상이지만, 생성 모델은 4050%40\sim 50\% 대에 갇힌다."

후처리 압축군: "한편 내 JPEG 블록 경계선이 만든 새로운 픽셀 차분마저 너는 생성 모델의 아티팩트라고 착각하고 있군."

  • 3단계: 다중 척도 감시망 구축 (Multi-granularity 결합)

    멀티스케일 탐색대: "단일 해상도의 작은 윈도우만 보면 생성 모델이 서로 다른 크기로 남겨둔 업샘플링 패턴을 놓칠 수 있다. 리샘플링 스케일을 다양화하고 겹치는 슬라이딩 윈도우를 씌워 촘촘한 엔트로피 특성 맵(MLEP)으로 엮어 올리겠다."
    판별관: "훌륭하다. 사물의 형태는 전부 증발했고 순수한 통계적 무질서도의 편차만 남았다. 이제 어떤 신종 생성 모델이 오더라도 내용물에 현혹되지 않고 가짜를 적발할 수 있다."


구체적으로 어떻게 엔트로피를 이용하는지 설명

1. [직관적 서사 및 상황극 (The Narrative / Dialogue)]

  • 상황 및 핵심 목표 (Mission & Context):
    입력 이미지(XX)가 실제 카메라로 촬영된 자연 사진(Real)인지, 생성형 모델이 합성한 가짜 이미지(AI-generated)인지 판별해야 한다. AI 생성물은 특유의 매끄러운 텍스처로 인해 국소 엔트로피가 낮게 측정되는 결함이 있다. 공격자는 이를 은폐하기 위해 전역에 가우시안 노이즈(N(0,σ2)\mathcal{N}(0, \sigma^2))를 인위적으로 주입하여 엔트로피를 강제로 만점(2.02.0)으로 끌어올리려 한다. 다중 세분성 국소 엔트로피(MLEP) 판별 시스템의 핵심 임무는 단순 노이즈 주입 공격을 가차 없이 적발하고, 반대로 가우시안 노이즈가 섞인 진짜 사진이 억울하게 가짜로 오탐(False Positive)되는 사태를 막아 진음성(True Negative)으로 구제하는 것이다.
  • 등장인물 정의 (Agent Cast):
  • 위조 공격자(인공 노이즈 에이전트, n\mathbf{n}): AI 특유의 매끄러운 픽셀 분포를 숨기기 위해 화면 전역에 독립항등분포(i.i.d.) 가우시안 노이즈를 살포하여 엔트로피 지표를 조작하려는 침입자.
  • 국소 엔트로피 감시관(LEPLEP): 2×22 \times 2 크기의 초미세 슬라이딩 윈도우를 들고 다니며 4개 픽셀의 값 분포를 계산해 {0,0.8,1.0,1.5,2.0}\{0, 0.8, 1.0, 1.5, 2.0\} 중 하나의 엔트로피 점수를 엄격히 매기는 심사관.
  • 다중 스케일 리샘플링 감찰관(X^(k)\hat{X}^{(k)}): 이미지를 축소(DownDown)했다가 다시 확대(UpUp)하며 해상도 변화에 따라 픽셀 관계가 어떻게 반응하는지 감시하는 스케일 분석관.
  • 패치 셔플링 중재관(Xπ\overline{X}_\pi): 이미지를 2×22 \times 2 조각 단위로 잘게 쪼개어 무작위로 섞어버림으로써 고수준 시맨틱(물체 형태) 편향을 완전히 파괴하는 블라인드 검사관.
  • 최종 판별기(CNN 백본 ff): 엔트로피 지도 텐서에 담긴 공간적·스케일적 패턴을 종합 추론하여 최종 진위 여부(yy)를 판정하는 대법관.
  • 상호작용 및 협상 대화극 (The Negotiation):

  • 1단계 (가우시안 노이즈의 위장과 단일 감시관의 혼란):

    위조 공격자(n\mathbf{n}): "AI 생성 이미지가 너무 매끄러워서 엔트로피가 낮다고? 그럼 이미지 전체에 무작위 가우시안 잡음을 골고루 뿌려주마. 이제 2×22 \times 2 윈도우 안의 4개 픽셀 값은 전부 제각각이니 엔트로피는 이론상 최댓값인 2.02.0에 도달한다! 완벽한 자연 사진처럼 보이지?"

  • 단일 윈도우 국소 엔트로피 계산 (식 6):

LEP(X^i,j)=m=ii+1n=jj+1p(xm,n)log2p(xm,n)LEP(\hat{X}_{i,j}) = -\sum_{m=i}^{i+1} \sum_{n=j}^{j+1} p(x_{m,n}) \log_2 p(x_{m,n})

  • 2×22 \times 2 윈도우 내 4개 픽셀의 출현 확률 p(xm,n)p(x_{m,n})에 기초하여 섀넌 엔트로피를 산출한다. 픽셀 값이 모두 같으면 00, 4개가 전부 다르면 최댓값 2.02.0을 갖는 이산 집합 V=0,0.8,1.0,1.5,2.0\mathbb{V}={0, 0.8, 1.0, 1.5, 2.0}으로 매핑된다.
  • 가우시안 잡음 nm,nN(0,σ2)\mathbf{n}_{m,n} \sim \mathcal{N}(0, \sigma^2)이 더해지면 연속 확률 밀도로 인해 4개 픽셀이 우연히 같을 확률이 00에 수렴하여, 거의 모든 국소 영역의 LEPLEP 값이 강제로 2.02.0에 수렴하게 된다.

국소 엔트로피 감시관(LEPLEP): "단순 평균 엔트로피 수치만 보면 확실히 2.02.0 근처로 급등했다. 하지만 무언가 수상하다. 픽셀 간의 유의미한 상호작용 없이 전체 화면이 균일하게 포화되어 있다."

  • 2단계 (리샘플링 감찰관의 압박과 위조 적발):

다중 스케일 리샘플링 감찰관(X^(k)\hat{X}^{(k)}): "스케일을 바꿔보자. 축소(DownDown) 후 보간 확대(UpUp)를 거치게 하면 백색 잡음(White Noise) 형태의 가우시안 노이즈는 이웃 픽셀들과 평균화(Low-pass Filtering)되어 급격히 스무딩된다. 반면 자연 사진의 질감은 [프랙탈적인 스케일 자기유사성]을 지녀 스케일이 변해도 고유의 엔트로피 붕괴 곡선을 유지한다. 스케일 1/2,1/41/2, 1/4 계층을 대조해 보니 엔트로피가 인위적인 기울기로 소멸하고 있다!"

패치 셔플링 중재관(Xπ\overline{X}_\pi): "패치를 섞어(L=2L=2) 블록 경계선(Inter-block)과 블록 내부(Intra-block)를 가로질러 조사해 봐도 마찬가지이다. 진짜 텍스처라면 나타나야 할 경계 전이 특성이 가우시안 노이즈에는 전혀 없다. 균일한 잡음으로 수치만 부풀린 가짜다."

최종 판별기(CNN ff): "MLEP는 단일 스칼라 점수가 아니라 스케일과 공간을 엮은 다채널 텐서 패턴이다. 공격자의 조작 패턴은 정상적인 자연 사진 분포에서 완전히 벗어났으므로 가짜(AI-generated)로 확정 판정한다."

  • 3단계 (자연 사진에 노이즈가 낀 경우의 구제 협상):

노이즈 섞인 자연 사진: "잠깐! 나는 실제 어두운 방에서 고감도(ISO)로 촬영되어 가우시안 센서 노이즈가 심하게 꼈을 뿐인 진짜 자연 사진이다. 엔트로피 패턴이 흔들렸다고 나를 AI 생성물로 오탐(False Positive)하는 것은 부당하다!"

중재관 및 감찰관의 타협안: "타당한 항변이다. 억울한 누명을 벗기려면 두 가지 증거를 채택해야 한다. 첫째, 다중 스케일 축소 과정에서 사라지는 고주파 잡음 아래에 본래 피사체의 스케일 불변 엔트로피 구조가 살아 숨 쉬고 있는지 대조한다.
둘째, 센서 노이즈 잔차를 분리하여 바탕 신호의 엔트로피 패턴을 복원하면 자연 사진 고유의 픽셀 의존성이 검증된다. 이를 통해 위양성을 방지하고 정상적인 진음성(Real)으로 판결하겠다."


2. [설계자의 공학적 고민 (The Engineering Intent)]

  • 단순 가우시안 노이즈가 판별기를 우회하지 못하는 이유:
    공격자는 엔트로피가 '픽셀 무작위도의 평균 스칼라값'이라는 점만 노려 단순 덧셈 노이즈로 LEPLEP 값을 2.02.0에 가깝게 포화시키려 시도한다. 그러나 MLEP 분류기는 단일 스칼라를 보지 않고, 셔플링된 패치 간 경계(Inter-patch)와 내부(Intra-patch), 그리고 다중 리샘플링 스케일(sk{1,1/2,1/4}s_k \in \{1, 1/2, 1/4\})이 결합된 3차원 특징 텐서 X^\hat{X}를 합성곱 계층(CNN)으로 공간 분석한다. 가우시안 노이즈는 공간적으로 무상관(Uncorrelated)이므로 전 영역에 비정상적인 균일성을 유발하며, 보간 리샘플링(DownUpDown \rightarrow Up) 시 선형 필터링에 의해 고주파가 깎여나가 엔트로피가 급감하는 고유의 왜곡 프로파일을 남긴다. CNN 백본은 이 기형적인 다채널 엔트로피 텍스처를 손쉽게 비정상 신호로 간파한다.
  • 노이즈 섞인 자연 사진을 위양성(FP) 없이 진음성(TN)으로 판별하는 공학적 해법:
    논문의 한계점(Limitations)에 명시되어 있듯, MLEP는 학습 시 노이즈 증강을 거치지 않으면 강한 잡음 환경에서 정확도가 174517 \sim 45%까지 하락하는 취약점을 보인다. 노이즈가 낀 실제 사진을 정상적인 진음성으로 구제하기 위해선 다음 세 가지 설계 보완이 필수적이다.
  1. 잡음 주입 데이터 증강(Noise-Robust Data Augmentation): 학습 단계에서 실제 사진과 가짜 사진 양쪽에 다양한 분산(σ2\sigma^2)의 가우시안 잡음을 주입하여 훈련한다. 이를 통해 CNN이 국소 백색잡음에 과적합되지 않고 잡음 기저에 깔린 근본적인 픽셀 의존성을 학습하도록 유도한다.
  1. 스케일 간 엔트로피 감쇠 기울기(Cross-Scale Entropy Gradient) 분석: 자연 이미지는 1/fα1/f^\alpha 전력 스펙트럼을 지녀 스케일 축소 후에도 고유의 엔트로피 구조를 보존한다. 반면 가우시안 잡음은 다운샘플링 평균화에 의해 엔트로피가 급격히 붕괴한다. 스케일 축소에 따른 엔트로피 감쇠 궤적을 상대적 특징으로 정규화하면 잡음의 영향을 상쇄하고 자연 사진 고유의 구조를 식별할 수 있다.
  2. 노이즈 잔차 분리(Residual Decoupling): 블라인드 디노이저나 에지 보존 필터를 전처리로 적용하여 이미지를 기저 신호(XbaseX_{\text{base}})와 잡음 잔차(RR)로 분리한다. 분리된 기저 신호에서 MLEP를 추출하고 잔차가 백색 가우시안 노이즈의 통계적 특성을 만족하는지 교차 검증함으로써, 고노이즈 자연 사진을 위양성 없이 진음성으로 온전히 분류해 낸다.

3. [수식 매핑 및 수학적 메커니즘 (Mathematical Breakdown)]

  • 패치 셔플링 연산 (식 1, 2):

X={Xπ(i,j)=Xi,j}1iHL,1jWL\overline{X} = \{\overline{X}_{\pi(i,j)} = X_{i,j}\}_{1 \le i \le \frac{H}{L}, 1 \le j \le \frac{W}{L}}

  • 미세 패치 크기 L=2L=2로 분할 후 전단사 함수 π\pi를 통해 무작위 치환한다.
  • 보폭(Stride) 11LEPLEP를 계산할 때 윈도우가 패치 경계를 가로지르며 블록 간(Inter-block) 엔트로피와 블록 내부(Intra-block) 엔트로피가 동시에 기록된다. 가우시안 노이즈는 패치 경계의 상관성을 완전히 파괴하여 균일한 잡음 텐서를 만들므로 구조적 패턴 학습 모델에 즉각 이상치로 감지된다.
  • 다중 스케일 리샘플링 피라미드 (식 3, 4, 5):

X~(k)=Up(Down(X~,sk),H,W),X^=Concat(X~(1),,X~(K))\tilde{X}_{\wedge}^{(k)} = Up\left(Down(\tilde{X}, s_k), H, W\right), \quad \hat{X} = Concat\left(\tilde{X}_{\wedge}^{(1)}, \dots, \tilde{X}_{\wedge}^{(K)}\right)

  • 스케일 팩터 sk1,1/2,1/4s_k \in {1, 1/2, 1/4}를 적용하여 축소 후 원본 크기로 보간 복원한다.
  • 선형 보간 커널 KinterpK_{\text{interp}}이 적용될 때, 가우시안 잡음 성분 n\mathbf{n}의 분산은 축소 비율에 비례하여 σ2/(sk1)2\sigma^2 / (s_k^{-1})^2 수준으로 급격히 감쇠한다. 이로 인해 스케일 계층 kk가 증가할수록 엔트로피가 급감하는 인위적 텐서 궤적이 X^RH×W×(CK)\hat{X} \in \mathbb{R}^{H \times W \times (C \cdot K)}에 각인된다.
  • 최종 분류 손실 및 판별 함수 (식 7):

LBCE=1Ni=1N[yilogf(Xi)+(1yi)log(1f(Xi))]\mathcal{L}_{BCE} = -\frac{1}{N} \sum_{i=1}^N \left[ y_i \log f(\overline{X}_i) + (1 - y_i) \log(1 - f(\overline{X}_i)) \right]

  • 판별기 ff는 엔트로피 맵 X\overline{X}의 공간적·채널 간 상관관계를 합성곱 신경망을 통해 학습한다.
  • 자연 사진에 노이즈가 주입되었을 때 진음성(y=0y=0) 판정을 유지하려면, 리샘플링 스케일 축에 따른 엔트로피 감쇠 불변 특성이 CNN 수용영역(Receptive Field) 내에서 보존되도록 목적함수 최적화 과정에 노이즈 정규화 항이나 증강 데이터셋이 매핑되어야 한다.
profile
검은바람 임시주민

0개의 댓글