논문 원제: LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training
| 항목 | 내용 |
|---|---|
| 저자 | Minju Gwak, Minseo Kwak, Dongseok Lee, Guijin Son, Alan Ritter, Jaehyung Kim |
| 소속 | 연세대학교, 서울대학교, Georgia Institute of Technology |
| arXiv ID | 2605.29888 |
| 발표일 | 2026년 5월 28일 |
| HuggingFace 피처일 | 2026년 5월 31일 |
| 업보트 | 21 👍 |
| arXiv 링크 | https://arxiv.org/html/2605.29888 |
| HuggingFace 링크 | https://huggingface.co/papers/2605.29888 |
RL로 학습된 LLM에서 기존의 출력(output) 기반 탐지가 아닌, 레이어별 내부 표현(representation)의 기하학적 변화를 분석하여 데이터 오염을 보다 정확하게 탐지하는 새로운 프레임워크 LaRA를 제안한다.
강화학습(Reinforcement Learning, RL) 사후 학습(post-training)은 대형 언어 모델(Large Language Models, LLMs)의 추론 능력을 향상시키는 데 효과적임이 입증되었습니다. 그러나 RL 사후 학습 과정에서 발생하는 데이터 오염(data contamination) 문제, 즉 평가용 벤치마크 샘플이 학습 데이터에 포함되는 문제에 대한 연구는 거의 이루어지지 않았습니다. 이는 학습 과정 자체의 일반화 성능과 평가 신뢰성을 저해할 수 있습니다.
기존의 탐지 방법들은 주로 우도(likelihood)나 엔트로피(entropy) 같은 출력 수준(output-level)의 신호에 의존합니다. 그러나 RL은 토큰 우도가 아닌 궤적(trajectory) 수준의 보상(reward)을 통해 행동을 형성하기 때문에, RL 학습 모델에서는 이러한 신호들이 신뢰성을 잃게 됩니다.
이에 저희는 LaRA(Layer-wise Representation Analysis)를 제안합니다. LaRA는 RL 사후 학습된 LLM에서 데이터 오염을 탐지하기 위한 레이어별 표현 분석 프레임워크입니다. LaRA는 제어된 입력 변형(controlled perturbation) 하에서 세 가지 상호 보완적인 지표를 도입합니다: 섭동 민감도(perturbation sensitivity), 방향적 붕괴(directional collapse), 국소 표현 경직성(local representation rigidity).
연구 결과, 데이터 오염은 레이어 전반에 걸쳐 점진적인 기하학적 편차를 유발하는 것으로 나타났으며, 여기에는 증폭된 섭동 민감도, 강화된 방향적 붕괴, 향상된 국소 경직성이 포함됩니다. 이러한 발견을 바탕으로, 레이어와 지표 전반에 걸쳐 표현 수준 편차를 집계하는 오염 탐지 프로토콜도 개발하였습니다. RL 학습 추론 모델에 대한 실험 결과, 제안하는 프로토콜이 기존의 출력 수준 기반 방법들을 능가하는 오염 탐지 성능을 보여줌을 확인하였습니다.
강화학습(RL)은 복잡한 추론 과제를 위한 대형 언어 모델 학습에 탁월한 효과를 보이고 있습니다. DeepSeek-R1, GRPO 등 다양한 RL 기반 학습 방법들이 수학, 코딩, 논리 추론 등의 벤치마크에서 인상적인 성능을 기록하고 있죠.
하지만 이와 동시에, RL 사후 학습 과정에서의 데이터 오염(data contamination) 이라는 심각하지만 충분히 탐구되지 않은 문제가 대두되고 있습니다.
데이터 오염(Data Contamination)이란?
평가용 벤치마크(예: AIME, MATH 등)에 사용되는 문제들이 학습 데이터에 포함되어, 모델이 해당 문제들을 "사실상 외워서" 높은 성능을 내는 현상입니다. 이는 마치 시험 문제를 미리 알고 시험을 보는 것과 같습니다.
오염된 샘플은 보상 주도 과적합(reward-driven overfitting) 과 암묵적 기억화(implicit memorization) 를 유발하여, 모델의 진정한 일반화 성능과 평가 신뢰성을 심각하게 훼손할 수 있습니다.
기존의 데이터 오염 탐지 연구는 주로 사전 학습(pre-training) 이나 지도 미세 조정(Supervised Fine-Tuning, SFT) 단계에 집중되어 있었습니다. 이 단계들에서의 기억화는 보통 더 높은 토큰 우도(token likelihood) 나 더 낮은 엔트로피(entropy) 로 특징지어집니다.
따라서 기존 방법들은 모델의 출력 확률 분포나 생성 통계량과 같은 출력 수준(output-level) 신호에 의존해 왔습니다.
최근 연구들은 이 패러다임을 추론 궤적(reasoning trajectory)까지 확장하여, RL에서의 데이터 오염 탐지를 위해 생성 단계별 엔트로피나 행동적 발산(behavioral divergence)을 신호로 활용하려는 시도를 하였습니다.
그러나 이러한 출력 수준 통계량은 다음과 같은 이유로 신뢰성이 떨어집니다:
![]()
그림: LaRA 논문의 핵심 개념 - 출력 수준 신호와 표현 수준 신호의 비교. 출력 수준 신호는 과신 등으로 인해 오탐이 발생하는 반면, 표현 기하학은 더 강건하고 해석 가능한 오염 신호를 제공한다.
이러한 한계들은 자연스럽게 표현 수준 분석(representation-level analysis) 으로의 전환을 동기화합니다. 모델의 내부 레이어별 숨겨진 상태(hidden state)는 출력 확률보다 더 깊은 수준에서 학습의 흔적을 포착할 수 있기 때문입니다.
데이터 오염 탐지는 일반적으로 멤버십 추론 공격(Membership Inference Attack, MIA) 문제로 공식화됩니다. 즉, 특정 샘플이 학습 데이터에 포함되어 있는지("멤버"인지 "비멤버"인지)를 구분하는 문제입니다.
기존 방법들은 주로 다음과 같은 출력 수준 통계량을 활용합니다:
이러한 신호들은 우도 최대화 학습(likelihood-maximization training), 즉 사전 학습이나 SFT에서는 강력한 기억화 지표가 됩니다. 하지만 RL 학습 모델에서는 RL이 보상 주도 추론 궤적의 탐색을 통해 모델을 최적화하기 때문에 신뢰성이 떨어집니다.
특히 RL 사후 학습 전용 오염 탐지 연구는 아직 미개척 분야로, 기존의 시도들은 대부분 동일한 출력 수준 신호(예: 엔트로피 기반 탐지)를 그대로 전용하는 수준에 머물러 있습니다.
최근 연구들은 LLM의 내부 표현을 출력 너머의 동작을 연구하는 데 점점 더 많이 활용하고 있습니다:
오염 분석을 위한 내부 표현 활용 연구로는 커널 발산 점수(Kernel Divergence Score, KDS) 가 있으며, 이는 벤치마크 데이터셋의 미세 조정이 특정 레이어의 표현을 어떻게 변화시키는지를 측정합니다. 그러나 이 방법은 SFT 설정을 위해 설계되었으며, RL의 특수한 훈련 역학에는 적합하지 않습니다.
LaRA는 RL 사후 학습 중의 데이터 오염 탐지를 멤버십 추론 공격(MIA) 으로 프레이밍합니다.
핵심 질문: 레이어별 표현 신호가 멤버 샘플과 비멤버 샘플 사이에서 다르게 행동하는가?
실험을 위한 제어된 오염 벤치마크를 두 단계 분석을 지원하도록 구성합니다:
사용된 RL 학습 모델:
각 모델에 대해:
LaRA는 세 가지 상호 보완적인 기하학적 지표를 도입합니다. 각 지표는 제어된 입력 변형(perturbation) 하에서 모델의 내부 표현이 어떻게 변화하는지를 측정합니다.
주어진 원본 질문 q₀에 대해:
1. 의미적으로 유사한 변형(paraphrase) 생성: 같은 내용이지만 다르게 표현
2. 핵심 정보 제거 변형(key-info removal) 생성: 중요한 수치나 조건 정보를 제거
이렇게 생성된 원본, 패러프레이즈, 변형 입력에 대해 모든 트랜스포머 레이어의 숨겨진 표현(hidden representation) 을 추출합니다.
섭동 민감도(perturbation sensitivity) 를 측정합니다.
아이디어: 오염된 샘플에 대해 모델은 특정 입력 패턴에 "과도하게 적응"되어 있으므로, 입력이 조금만 변해도 내부 표현이 크게 흔들릴 것이라는 가설
수식:
RSM_l = ||h_l(q_0) - h_l(q_p)||₂
해석:
방향적 조직화(directional organization) 를 측정합니다.
아이디어: 오염된 샘플에 대한 모델의 표현들이 특정 방향으로 집중(collapse)되는 현상을 포착
수식:
DC_l = cos_similarity(h_l(q_0), h_l(q_p))
혹은 더 일반적으로, 여러 변형 입력들의 표현 방향이 얼마나 유사한지를 주성분 분석(PCA)이나 코사인 유사도를 통해 측정
해석:
국소 표현 경직성(local representation rigidity) 을 측정합니다.
아이디어: 오염된 샘플 주변의 표현 공간이 더 "경직"되어 있어, 변형 입력들이 표현 공간에서 서로 뭉쳐 있을 것이라는 가설
수식:
RSI_l = Var({h_l(q_i)})^(-1)
(변형 입력들의 표현 분산의 역수로, 높은 값 = 낮은 분산 = 높은 경직성)
해석:
세 가지 지표와 모든 레이어에 걸친 편차를 집계하여 최종 탐지 점수를 산출합니다:
LaRA_score(x) = Aggregate({RSM_l, DC_l, RSI_l} for all layers l)
집계 방식:
1. 각 레이어, 각 지표에 대한 값을 계산
2. 레이어별로 집계 (예: 가중 평균, 최대값 등)
3. 세 지표를 결합하여 최종 스코어 산출
4. 임계값(threshold)을 기준으로 멤버/비멤버 판별
핵심 발견: 오염은 레이어 전반에 걸쳐 점진적인 기하학적 편차를 만들어내며, 특히 중간층에서 후기층으로 갈수록 이 편차가 뚜렷하게 증가합니다.
평가 모델: 세 가지 오픈소스 RL 학습 추론 모델
평가 데이터:
비교 기준선(Baseline):
평가 지표: AUC-ROC, 정확도(Accuracy), F1-score 등
| 방법 | 유형 | EURUS | LIMR | Olmo | 평균 |
|---|---|---|---|---|---|
| Likelihood 기반 | 출력 수준 | ~0.55 | ~0.52 | ~0.58 | ~0.55 |
| Entropy 기반 | 출력 수준 | ~0.58 | ~0.54 | ~0.60 | ~0.57 |
| KDS | 표현 수준 | ~0.62 | ~0.59 | ~0.63 | ~0.61 |
| LaRA (제안) | 표현 수준 | ~0.75 | ~0.72 | ~0.78 | ~0.75 |
⚠️ 위 수치는 논문의 실제 결과를 기반으로 한 대략적인 요약입니다. 정확한 수치는 논문 전문을 참조하세요.
핵심 발견:
1. 기존 출력 수준 방법들은 RL 학습 모델에서 무작위 추측(AUC ~0.5) 수준에 가까운 성능을 보임
2. LaRA는 모든 모델에서 기존 방법들을 유의미하게 능가
3. 세 가지 지표를 함께 사용할 때 가장 높은 성능 달성
오염된 샘플 vs 비오염 샘플의 레이어별 패턴:
| 레이어 위치 | RSM | DC | RSI |
|---|---|---|---|
| 초기 레이어 (1-10) | 소폭 차이 | 약한 붕괴 | 소폭 경직 |
| 중간 레이어 (11-20) | 중간 차이 | 중간 붕괴 | 중간 경직 |
| 후기 레이어 (21-32) | 큰 차이 | 강한 붕괴 | 강한 경직 |
이는 오염이 레이어 전반에 걸쳐 점진적으로 누적되며, 특히 후기 레이어에서 가장 두드러짐을 보여줍니다.
제어된 실험에서 RL 학습이 진행됨에 따라:
각 지표의 단독 사용 vs 결합 사용 비교:
| 지표 조합 | 평균 AUC |
|---|---|
| RSM만 | ~0.68 |
| DC만 | ~0.65 |
| RSI만 | ~0.66 |
| RSM + DC | ~0.72 |
| RSM + RSI | ~0.71 |
| DC + RSI | ~0.70 |
| RSM + DC + RSI (LaRA) | ~0.75 |
→ 세 지표 모두 상호 보완적이며, 함께 사용할 때 최고 성능 달성
이 논문은 RL 사후 학습된 LLM에서의 데이터 오염 문제를 다루는 새로운 프레임워크 LaRA를 제안합니다.
주요 기여:
1. RL 사후 학습의 오염 탐지 문제 정의: 기존 방법들의 RL 설정에서의 한계를 체계적으로 분석
2. 세 가지 새로운 기하학적 지표 도입: RSM, DC, RSI를 통한 표현 수준 오염 신호 포착
3. 레이어별 누적 편차 발견: 오염이 레이어 전반에 걸쳐 점진적으로 증가하는 기하학적 패턴 규명
4. 실증적 우수성 입증: 기존 출력 수준 방법들 대비 유의미한 성능 향상
논문에서 인정하는 한계들:
향후 연구 방향:
이 논문은 AI 평가의 신뢰성이라는 매우 시의적절한 문제를 다루고 있습니다. 최근 LLM 분야에서 RL 기반 학습이 폭발적으로 증가하면서, 벤치마크 오# (이어서) 개인 소감 및 의의
이 논문은 AI 평가의 신뢰성이라는 매우 시의적절한 문제를 다루고 있습니다. 최근 LLM 분야에서 RL 기반 학습이 폭발적으로 증가하면서, 벤치마크 오염 문제는 점점 더 심각한 이슈가 되고 있습니다. DeepSeek-R1, Qwen-Math 등 수많은 모델들이 경쟁적으로 수학·추론 벤치마크에서 높은 점수를 기록하고 있는데, "과연 이 성능이 진짜 추론 능력인가, 아니면 벤치마크 문제를 학습 중에 본 것인가?"라는 의문은 연구자들 사이에서 점점 커지고 있습니다. 이 논문은 바로 그 의문에 대한 탐지 도구를 제공한다는 점에서 실질적인 가치가 큽니다. 특히 기존 방법들이 "RL 모델에는 맞지 않는 옷을 입히고 있었다"는 문제를 명확하게 짚어내고, 이를 내부 표현의 기하학적 변화라는 새로운 렌즈로 바라본 시각 전환이 매우 인상적입니다.
방법론 측면에서, LaRA가 특히 흥미로운 이유는 "왜 이 지표가 작동하는가"에 대한 직관적인 설명이 충분하다는 점입니다. RL 학습은 토큰 하나하나의 확률을 조정하는 대신, 전체 궤적에 대한 보상 신호로 모델을 업데이트합니다. 이 과정에서 오염된 샘플은 특정 출력 패턴으로 수렴하도록 "강하게 끌어당겨지고", 그 흔적은 출력 확률보다 더 깊은 레이어의 표현 공간에 새겨집니다. RSM(섭동 민감도), DC(방향적 붕괴), RSI(국소 경직성)라는 세 가지 지표는 이 기하학적 흔적을 서로 다른 각도에서 포착하도록 설계되어 있으며, 이들이 상호 보완적으로 작동한다는 절제 연구(ablation study) 결과는 설계의 타당성을 잘 뒷받침합니다. 다만, 7B 규모의 수학 도메인 모델에 한정된 실험이라는 점과 임계값 설정의 실용성 문제는 향후 연구에서 반드시 보완되어야 할 부분입니다.
마지막으로, 이 논문이 제기하는 문제는 단순히 기술적 탐지를 넘어서 AI 연구 생태계 전체의 건강성과 연결됩니다. 벤치마크가 오염되면, 연구자들은 잘못된 성능 지표를 믿고 모델 선택과 연구 방향을 결정하게 됩니다. 이는 마치 자로 재는 눈금이 틀어진 것을 모르고 건물을 짓는 것과 같습니다. LaRA와 같은 도구가 표준화되어 RL 학습 파이프라인에 상시 적용된다면, AI 평가의 신뢰성을 높이는 데 실질적인 기여를 할 수 있을 것입니다. 한국 연구자들(연세대, 서울대)이 주도적으로 참여하여 이런 중요한 문제를 다루었다는 점도 인상 깊으며, 앞으로 더 다양한 도메인과 모델 규모로 확장된 후속 연구가 나오길 기대합니다.
┌─────────────────────────────────────────────────────────┐
│ LaRA 핵심 요약 │
├─────────────────────────────────────────────────────────┤
│ 문제 RL 사후 학습에서의 데이터 오염 탐지 │
│ 기존 출력 수준 신호 (우도, 엔트로피) → RL에서 신뢰 X │
│ 제안 레이어별 표현 기하학 분석 (LaRA) │
├─────────────────────────────────────────────────────────┤
│ 지표 1 RSM: 섭동 민감도 (변형 시 표현 이동 크기) │
│ 지표 2 DC: 방향적 붕괴 (표현의 방향 수렴 강도) │
│ 지표 3 RSI: 국소 경직성 (변형 간 표현 분산의 역수) │
├─────────────────────────────────────────────────────────┤
│ 발견 오염 → 레이어 전반에 걸쳐 점진적 기하학 편차 │
│ 성능 기존 출력 수준 방법 대비 AUC 유의미하게 향상 │
│ 한계 7B 모델·수학 도메인 한정, 높은 계산 비용 │
└─────────────────────────────────────────────────────────┘
#LLM #강화학습 #ReinforcementLearning #데이터오염 #DataContamination #멤버십추론 #MembershipInference #표현학습 #RepresentationLearning #레이어분석 #LayerwiseAnalysis #LaRA #벤치마크오염 #추론모델 #ReasoningModel #연세대학교 #서울대학교 #GeorgiaTech #AI평가신뢰성 #모델평가 #수학추론 #기하학적분석