논문 원제: UniSteer: Text-Guided Flow Matching in Activation Space for Versatile LLM Steering
저자: Yingdong Shi*, Ruiming Zhang*, Changming Li, Zhiyu Yang, Kaixing Zhang, Jingyi Yu, Kan Ren† (*공동 1저자, †교신저자)
소속: ShanghaiTech University
arXiv: 2605.30076 | HuggingFace: 링크
발표일: 2026년 5월 28일 | HF 피처일: 2026년 5월 31일 | 업보트: 21
텍스트 조건부 플로우 매칭(Flow Matching)으로 LLM 내부의 활성화(Activation)를 편집하여, 단일 모델 하나로 행동 제어·진실성 조향·세밀한 개념 조향·다중 제약 명령어 수행·활성화 공간 분류를 모두 처리하는 통합 프레임워크 UniSteer를 제안합니다.
활성화 기반 제어(Activation-based Control)는 추론(inference) 단계에서 LLM의 내부 표현에 개입함으로써 모델을 조향하는 방법으로, 페르소나(persona)나 스타일(style) 같은 행동 제어에 효과적인 패러다임으로 자리잡았습니다. 그러나 기존 방법들은 고정된 조향 방향(fixed steering direction)이나 태스크별 개입 모듈(task-specific intervention module)에 의존하는 경우가 많아, 세밀한 개념이나 복합적인 제약 조건에 적응하기 어렵다는 한계가 있습니다.
본 논문에서는 UniSteer를 제안합니다. UniSteer는 자연어 조건(natural-language condition)으로부터 잔차 스트림 활성화(residual-stream activation)에 대한 조건부 분포(conditional distribution)를 학습하는 텍스트 가이드 활성화 플로우 매칭(text-guided activation flow matching) 모델입니다. 각 목표 행동마다 별도의 개입을 학습하는 대신, UniSteer는 활성화 공간에서 범용 조건부 속도 필드(universal conditional velocity field)를 학습합니다.
추론 시에는 플로우 역전(flow inversion)을 수행합니다. 구체적으로, 소스(source) 활성화를 잠재 상태(latent state)로 부분적으로 이동시킨 뒤, 목표 텍스트 조건 하에서 재생성하여 동결된(frozen) LLM에 다시 주입합니다. 동일한 조건부 모델은 재구성 에너지(reconstruction energy)가 가장 낮은 텍스트 레이블을 선택하는 방식으로 활성화 공간 분류(activation-space classification)도 지원합니다.
세 가지 목표 LLM에 대한 실험을 통해, UniSteer가 행동 제어, 진실성 조향(truthfulness steering), 세밀한 개념 조향, 다중 제약 명령어 수행, 활성화 공간 분류에 걸쳐 통합된 인터페이스를 제공함을 보였습니다.
대형 언어 모델(LLM)의 행동을 제어하는 것은 안전하고 신뢰할 수 있으며 맞춤 가능한 배포를 위한 핵심 과제입니다. 프롬프팅(prompting)이나 파인튜닝(fine-tuning)이 아닌, 내부 표현에 직접 개입하는 활성화 기반 제어(activation-based control)는 모델 파라미터를 업데이트하지 않고도 모델 행동을 경량적이고 모듈식으로 제어할 수 있다는 점에서 매력적입니다.
📌 핵심 장점: 모델 파라미터를 건드리지 않으므로 원본 모델의 기능을 유지하면서, 원하는 행동(진실성, 거부, 페르소나, 스타일, 명령어 준수 등)을 조향할 수 있습니다.
기존 활성화 조향 방법들은 크게 두 가지 계열로 나뉩니다:
대조적 활성화 추가(Contrastive Activation Addition, CAA) 계열
학습된 개입 모듈(Learned Intervention Module) 계열
이 방법들은 여러 설정에서 효과적이지만, 다음과 같은 공통적인 한계가 있습니다:
| 한계 | 설명 |
|---|---|
| 고정 속성 의존성 | 사전 정의된 속성에 묶여 있어 새로운 개념에 적응 어려움 |
| 개별 학습 필요 | 각 목표 행동마다 별도의 방향/모듈을 학습해야 함 |
| 복합 제어 어려움 | 독립적으로 학습된 방향들이 고차원 활성화 공간에서 서로 간섭(interference) 발생 |
저자들은 활성화 조향을 텍스트 조건부 활성화 플로우 매칭(text-conditioned activation flow matching)으로 자연스럽게 재공식화할 수 있다고 주장합니다. 각 목표 행동마다 별도의 개입을 구성하는 대신, LLM 활성화에 대한 조건부 속도 필드(conditional velocity field)를 학습하는 것이 목표입니다. 여기서 편집 역학(editing dynamics)은 의미론적 텍스트 조건(semantic text condition)으로 지정됩니다.
이러한 관점은 행동 제어, 진실성 조향, 세밀한 개념 조향, 다중 제약 명령어 수행 등 이질적인 제어 목표들을 위한 통합 인터페이스를 제공합니다.
LLM의 내부 활성화에는 모델 행동에 관한 풍부하고 구조화된 정보가 담겨 있다는 연구들이 축적되어 왔습니다.
선형 프로브(Linear Probe) 및 비지도 표현 방법: Burns et al. (2022), Azaria and Mitchell (2023)은 진실성(truthfulness), 잠재 지식(latent knowledge), 사실성(factuality), 거부(refusal), 공간·시간 개념, 스타일, 감정, 심지어 태스크 복잡도와 관련된 잠재 방향 또는 부분 공간을 식별했습니다.
희소 오토인코더(Sparse Autoencoder, SAE): Cunningham et al. (2023), Gao et al. (2025)은 활성화에서 더 해석 가능한 특성 딕셔너리(feature dictionary)를 추출합니다.
잠재 공간 모니터(Latent-Space Monitor): Gupta and Jenner (2025)는 은닉 상태에서 안전하지 않거나 기만적인 행동을 감지할 수 있음을 보였습니다.
이러한 내부 정보의 풍부함은 조건부 활성화 조향을 위한 이론적 토대를 제공합니다.
대부분의 기존 방법은 대조적 예시에서 고정된 행동 방향을 구성하거나 태스크별 개입 모듈을 학습합니다. UniSteer는 이와 달리 자연어 조건부 속도 필드를 활성화에 대해 학습함으로써, 단일 모델이 단일 행동 및 복합 조향 조건을 모두 처리할 수 있게 합니다.
플로우 매칭(Flow Matching)은 고차원 생성을 위한 연속 시간 프레임워크를 제공합니다 (Lipman et al., 2023; Liu et al., 2022; Tong et al., 2023).
기존 연구는 생성 플로우와 확산 모델(Diffusion Model)이 두 가지를 지원함을 보였습니다:
UniSteer는 이미지 생성에서 확립된 이 특성들을 LLM 활성화 공간으로 전이(transfer)합니다.
![]()
그림 1: UniSteer 개요. (a) 학습 단계에서 동결된 언어 모델의 잔차 스트림 활성화를 추출하고 자연어 조건과 쌍을 이뤄 조건부 플로우를 학습합니다. (b) 추론 단계에서 플로우 역전을 통해 활성화를 편집하고 동결된 LLM에 주입합니다.
UniSteer는 동결된 언어 모델의 내부 표현을 조향하고 분류하기 위한 텍스트 조건부 활성화 플로우 모델입니다.
그림 1에서 보듯이:
기본 표기법 설명:
동결된 목표 언어 모델을 이라 합시다. 입력 시퀀스 가 주어질 때, 레이어 , 토큰 위치 에서의 잔차 스트림 활성화(residual-stream activation)를 로 표기합니다 (는 모델의 은닉 차원).
핵심 아이디어: 플로우 매칭으로 활성화 분포 모델링
UniSteer는 활성화를 확률적 생성 과정으로 봅니다. 구체적으로:
플로우 매칭 목표(Flow Matching Objective):
여기서:
💡 쉽게 말하면: "이 텍스트 조건()이 주어졌을 때, 노이즈()에서 출발해 해당 조건에 맞는 활성화()로 이동하는 '속도'를 학습"하는 것입니다.
추론 시 UniSteer가 활성화를 편집하는 과정은 2단계로 이뤄집니다:
소스 조건 하에서 소스 활성화 를 플로우를 역방향으로 부분적으로 이동시켜 중간 노이즈 상태 를 얻습니다:
여기서 는 부분 역전 강도(partial inversion strength)를 조절하는 하이퍼파라미터입니다. 가 작을수록 더 많이 역전되어 더 강한 편집 효과를 냅니다.
목표 조건 하에서 중간 상태 를 플로우를 순방향으로 이동시켜 편집된 활성화 를 얻습니다:
이렇게 얻어진 를 동결된 LLM의 해당 레이어에 주입하여 생성을 조향합니다.
🎯 핵심 직관: 마치 이미지 편집에서 "원본 이미지를 어느 정도 노이즈로 되돌렸다가, 새로운 스타일 지시로 다시 복원"하는 것처럼, 활성화를 소스 조건의 "색깔"을 지운 중간 상태로 만들었다가 목표 조건의 "색깔"로 새롭게 채우는 것입니다.
동일한 조건부 플로우 모델을 활성화 분류에도 활용할 수 있습니다. 레이블 집합 가 주어졌을 때, 각 레이블에 대한 재구성 에너지(Reconstruction Energy)를 계산합니다:
즉, " 조건으로 재구성했을 때 원래 활성화와 얼마나 가까운가?"를 측정하고, 에너지가 가장 낮은 레이블을 예측 클래스로 선택합니다:
💡 직관: "이 활성화가 어떤 텍스트 설명과 가장 잘 맞는가?"를 플로우 모델의 재구성 품질로 판단합니다. 이는 별도의 분류기 헤드(classifier head) 없이도 분류가 가능함을 의미합니다.
목표 LLM (Target LLMs): 세 가지 LLM에 대해 실험 수행
평가 태스크 (5가지 통합 인터페이스):
| 태스크 | 설명 |
|---|---|
| 행동 제어 (Behavioral Control) | 페르소나, 스타일 등 고수준 행동 조향 |
| 진실성 조향 (Truthfulness Steering) | 더 사실에 부합하는 응답 유도 |
| 세밀한 개념 조향 (Fine-grained Concept Steering) | 특정 세밀한 개념(예: 감정, 태도 등) 제어 |
| 다중 제약 명령어 수행 (Multi-constraint Instruction Following) | 여러 제약 조건을 동시에 충족 |
| 활성화 공간 분류 (Activation-Space Classification) | 내부 상태 기반 분류 |
UniSteer는 기존 CAA, RepE 등 고정 방향 기반 방법들과 비교하여:
기존 방법들이 사전 정의된 속성에 국한되는 반면, UniSteer는:
| 방법 | 단일 제약 | 2개 제약 | 3개 제약 |
|---|---|---|---|
| CAA | 높음 | 낮음 ↓↓ | 매우 낮음 ↓↓↓ |
| RepE | 높음 | 낮음 ↓↓ | 매우 낮음 ↓↓↓ |
| UniSteer | 높음 | 높음 ✓ | 높음 ✓ |
📊 기존 방법들은 여러 조향 방향이 서로 간섭해 성능이 급락하지만, UniSteer는 텍스트 조건 하나로 복합 제약을 통합적으로 처리하므로 성능 저하가 거의 없습니다.
별도의 분류기를 학습하지 않고도, 재구성 에너지 기반 분류가 지도 학습 프로브(supervised probe)와 경쟁력 있는 정확도를 달성합니다.
UniSteer는 LLM 내부 표현 제어 문제를 텍스트 조건부 활성화 플로우 매칭으로 재공식화함으로써 다음을 달성했습니다:
이 논문은 활성화 조향(Activation Steering) 분야에서 매우 흥미로운 방향 전환을 보여줍니다. 기존 방법들이 "이 행동을 위한 벡터를 따로 구해서 더한다"는 단순하지만 한계 명확한 접근에 머물렀다면, UniSteer는 이미지 생성 분야에서 이미 검증된 플로우 매칭의 철학을 활성화 공간으로 가져왔다는 점에서 개념적으로 매우 우아합니다. 특히 "소스 조건으로 역전 → 목표 조건으로 재생성"이라는 편집 파이프라인은, 이미지 편집 논문들(InstructPix2Pix, Prompt-to-Prompt 등)에서 익숙한 패턴을 LLM 내부에 적용한 것으로, 두 분야의 유사성이 생각보다 깊다는 것을 다시금 느끼게 합니다.
특히 인상적인 부분은 다중 제약 명령어 수행에서의 강점입니다. 기존 CAA 방식에서 여러 조향 벡터를 동시에 적용하면 서로 간섭을 일으킨다는 것은 잘 알려진 문제였는데, UniSteer는 자연어 조건 하나("A이면서 B이고 C한 스타일로")를 넣으면 조건부 속도 필드가 이를 통합적으로 처리하는 방식으로 이 문제를 우회합니다. 이는 단순히 성능 개선이 아니라, 문제를 다르게 정의함으로써 한계를 해소한 사례라 볼 수 있습니다.
다만 현실적인 도전 과제도 있습니다. 플로우 매칭 기반 편집은 추론 시 수치 적분(ODE solver)을 필요로 하므로 단순 벡터 덧셈보다 비용이 높고, 텍스트-활성화 쌍 학습 데이터를 어떻게 대규모로 구축할지도 과제입니다. 그럼에도 불구하고, "LLM 내부를 텍스트로 자유롭게 조종한다"는 비전은 LLM 정렬(alignment)과 해석 가능성(interpretability) 연구의 교차점에서 매우 중요한 발걸음이며, 앞으로 이 방향의 후속 연구가 기대됩니다.
#LLM #활성화조향 #플로우매칭 #UniSteer #표현공학 #AI안전성 #LLM제어 #FlowMatching #ActivationSteering #인공지능 #딥러닝 #NLP #언어모델해석 #ShanghaiTech #arXiv2026