논문 원제: UniSteer: Text-Guided Flow Matching in Activation Space for Versatile LLM Steering
| 항목 | 내용 |
|---|---|
| 저자 | Yingdong Shi, Ruiming Zhang, Changming Li, Zhiyu Yang, Kaixing Zhang, Jingyi Yu, Kan Ren† |
| 소속 | ShanghaiTech University |
| arXiv ID | 2605.30076 |
| 발표일 | 2026년 5월 28일 |
| HuggingFace 피처일 | 2026년 5월 30일 |
| 업보트 | 19 👍 |
| arXiv 링크 | https://arxiv.org/html/2605.30076 |
| HuggingFace 링크 | https://huggingface.co/papers/2605.30076 |
*Equal contribution (공동 1저자), †Corresponding author (교신저자)
자연어 텍스트 조건만으로 LLM 내부 활성화를 자유롭게 편집할 수 있는 범용 플로우 매칭 모델 UniSteer를 제안하며, 행동 제어·진실성·개념 조종·다중 제약 등을 단일 모델로 통합 처리한다.
활성화 기반 제어(Activation-based control)는 추론 시 대형 언어 모델(LLM)의 내부 표현에 직접 개입하여 모델의 행동을 조종하는 방식으로, 페르소나(persona)나 문체(style) 같은 속성을 제어하는 데 효과적인 패러다임으로 부상하고 있습니다.
그러나 기존 방법들은 고정된 조종 방향(fixed steering direction)이나 특정 작업에 특화된 개입 모듈(task-specific intervention module)에 의존하는 경우가 많아, 세밀한 개념이나 복합적 제약 조건에 적응하기 어렵다는 한계가 있습니다.
이에 본 논문에서는 UniSteer를 제안합니다. UniSteer는 텍스트 기반으로 유도되는 활성화 플로우 매칭 모델(text-guided activation flow matching model)로, 자연어 조건으로부터 잔차 스트림 활성화(residual-stream activation)의 조건부 분포를 학습합니다.
각 목표 행동마다 별도의 개입 방식을 학습하는 대신, UniSteer는 활성화 공간에서 범용적인 조건부 속도 필드(universal conditional velocity field)를 학습합니다. 추론 시에는 플로우 역산(flow inversion)을 수행하여, 소스 활성화를 잠재 상태(latent state)로 부분적으로 이동시킨 후, 목표 텍스트 조건 하에서 재생성하여 동결된(frozen) LLM에 다시 주입합니다.
동일한 조건부 모델은 재구성 에너지(reconstruction energy)가 가장 낮은 텍스트 레이블을 선택하는 방식으로 활성화 공간 분류(activation-space classification)도 지원합니다.
세 가지 목표 LLM에 대한 실험을 통해, UniSteer가 행동 제어, 진실성 조종, 세밀한 개념 조종, 다중 제약 명령 수행, 활성화 공간 분류에 걸쳐 통합된 인터페이스를 제공함을 입증합니다.
대형 언어 모델(LLM)을 안전하고 신뢰성 있게 맞춤형으로 배포하기 위해서는 모델의 행동을 세밀하게 제어하는 기술이 필수적입니다. 이를 위한 유망한 방향 중 하나가 바로 활성화 기반 제어(activation-based control)입니다. 이 방식은 추론 과정에서 동결된 LLM의 내부 표현에 직접 개입하여 모델 행동을 조종합니다.
프롬프팅(prompting)이나 파인튜닝(fine-tuning)과 비교했을 때, 활성화 개입(activation intervention)은 모델 파라미터를 전혀 수정하지 않고도 모델 행동에 영향을 줄 수 있는 경량화된 모듈식 방법이라는 장점이 있습니다. 진실성(truthfulness), 거부(refusal), 페르소나(persona), 문체(style), 명령 수행(instruction following) 등의 속성 조종에 특히 매력적입니다.
기존의 활성화 조종(activation steering) 방법들은 대체로 두 가지 범주로 나뉩니다:
1) 대조적 활성화 추가(Contrastive Activation Addition, CAA)
2) 표현 엔지니어링(Representation Engineering)
3) 학습된 개입 모듈(Learned Intervention Methods)
이런 방법들은 몇 가지 심각한 한계를 가집니다:
저자들은 활성화 조종을 텍스트 조건부 활성화 플로우 매칭(text-conditioned activation flow matching)으로 자연스럽게 정식화할 수 있다고 주장합니다.
각 목표 행동마다 별도의 개입을 구성하는 대신, LLM 활성화에 대한 조건부 속도 필드(conditional velocity field)를 학습하는 것이 목표입니다. 이때 편집 역학(editing dynamics)은 시맨틱 텍스트 조건(semantic text condition)으로 지정됩니다.
이 관점은 행동 제어, 진실성 조종, 세밀한 개념 조종, 다중 제약 명령 수행, 활성화 공간 분류 등 이질적인 제어 목표들을 위한 통합 인터페이스를 제공합니다.
점점 더 많은 연구들이 LLM의 내부 활성화에 풍부하고 구조화된 정보가 담겨 있음을 보여줍니다.
선형 프로브(Linear Probe) 및 비지도 표현 방법들(Burns et al., 2022; Azaria and Mitchell, 2023)은 진실성, 잠재 지식, 사실성, 거부, 공간·시간 개념, 문체, 감성, 주관적 평가, 심지어 작업 복잡도와 관련된 잠재 방향이나 부분공간을 발견했습니다.
희소 오토인코더(Sparse Autoencoder)는 활성화에서 더욱 해석 가능한 특징 사전(feature dictionary)을 추출합니다(Cunningham et al., 2023; Gao et al., 2025).
잠재 공간 모니터(Latent-space Monitor)는 숨겨진 상태에서 안전하지 않거나 기만적인 행동을 감지할 수 있습니다(Gupta and Jenner, 2025).
이러한 내부 정보의 풍부함이 조건부 활성화 조종의 이론적 기반을 제공합니다.
기존 방법들은 대조적 예시에서 고정된 행동 방향을 구성하거나(Panickssery et al., 2023; Turner et al., 2025; Zou et al., 2025), 작업별 개입 모듈을 학습합니다(Wu et al., 2024; Zhao et al., 2026; Luo et al., 2026).
효과적이기는 하지만, 이런 방법들은 보통 각 목표 행동마다 별도로 학습된 방향이나 모듈이 필요하며, 여러 요구를 결합할 때 간섭이 발생할 수 있습니다.
UniSteer는 대신 활성화에 대한 자연어 조건부 속도 필드를 학습함으로써, 단일 모델이 단일 행동과 복합 조종 조건 모두를 처리할 수 있게 합니다.
플로우 매칭(Flow Matching)은 고차원 생성을 위한 연속 시간 프레임워크를 제공합니다(Lipman et al., 2023; Liu et al., 2022; Tong et al., 2023).
이전 연구들은 생성 플로우와 확산 모델(diffusion model)이 두 가지 속성을 지원함을 보여줬습니다:
UniSteer는 이러한 속성들을 이미지 생성 영역에서 LLM 활성화 공간으로 이전합니다.
![]()
그림 1: UniSteer 전체 개요. (a) 학습 과정에서는 동결된 언어 모델의 선택된 레이어에서 잔차 스트림 활성화를 추출하고 자연어 조건과 쌍을 이룹니다. (b) 추론 과정에서는 플로우 역산을 통해 활성화 조종을 수행합니다.
UniSteer는 동결된 언어 모델의 내부 표현을 조종하고 분류하기 위한 텍스트 조건부 활성화 플로우 모델입니다.
UniSteer는 자연어 조건과 쌍을 이룬 잔차 스트림 활성화에 대한 조건부 플로우를 학습합니다. 학습 중에는 동결된 목표 모델의 선택된 레이어에서 잔차 스트림 활성화를 추출하고 자연어 조건과 쌍을 이룹니다. 동결된 조건 모델이 조건을 인코딩하고, 조건부 플로우 모델은 노이즈를 주어진 조건과 관련된 활성화로 수송(transport)하도록 학습됩니다. 이를 통해 모델 내부에 대한 텍스트 조건부 활성화 분포가 형성됩니다.
추론 시에는 관측된 활성화를 소스 조건 하에서 부분적으로 역산하고 목표 조건 하에서 재생성하여 편집합니다. 동일한 모델은 조건부 재구성 에너지를 비교하여 활성화 공간 분류에도 사용됩니다.
을 동결된 목표 언어 모델이라고 합시다. 입력 시퀀스 가 주어졌을 때, 번째 레이어의 잔차 스트림 활성화를 로 나타냅니다. 여기서 는 모델의 숨겨진 차원(hidden dimension)입니다.
플로우 매칭(Flow Matching)은 연속 정규화 플로우(Continuous Normalizing Flow, CNF)의 특수한 형태로, 노이즈 분포 에서 데이터 분포 으로의 확률 경로를 학습합니다.
핵심 아이디어는 속도 필드(velocity field) 를 학습하는 것인데, 여기서:
이 속도 필드는 다음 미분방정식을 정의합니다:
이를 통해 의 가우시안 노이즈를 의 조건부 활성화 분포로 변환할 수 있습니다.
조건부 플로우 매칭(Conditional Flow Matching, CFM)의 학습 목표는 다음과 같습니다:
여기서 은 시간 에서의 선형 보간(linear interpolation) 상태이고, 는 가우시안 노이즈, 는 자연어 조건입니다.
UniSteer의 추론 방식은 다음 두 단계로 이루어집니다:
1단계: 부분 역산 (Partial Inversion)
2단계: 목표 조건부 재생성 (Target-Conditioned Regeneration)
인젝션: 편집된 활성화 를 동결된 LLM의 해당 레이어에 다시 주입하여 생성을 조종
는 얼마나 깊이 역산할지를 조절하는 하이퍼파라미터입니다:
UniSteer는 조종뿐 아니라 분류도 수행할 수 있습니다. 이는 LLM 내부 활성화를 기반으로 모델이 현재 어떤 상태/행동에 있는지를 판별하는 기능입니다.
핵심 아이디어는 재구성 에너지(reconstruction energy)를 이용하는 것입니다:
재구성 에너지 는 활성화 를 조건 하에서 역산 후 재구성했을 때의 오류로 정의됩니다. 즉, "이 활성화가 조건 로 설명될 수 있는가?"를 에너지로 측정합니다.
에너지가 가장 낮은 레이블 이 해당 활성화에 가장 잘 맞는 조건으로 선택됩니다. 이는 별도의 분류기를 학습하지 않고도 동일한 플로우 모델로 분류를 수행할 수 있게 합니다.
목표 LLM: 세 가지 서로 다른 크기와 아키텍처의 LLM에서 실험
평가 작업: UniSteer는 아래 5가지 작업에서 평가됩니다:
| 작업 유형 | 설명 |
|---|---|
| 행동 제어 (Behavioral Control) | 페르소나, 문체, 거부 등 광범위한 행동 조종 |
| 진실성 조종 (Truthfulness Steering) | 모델 출력의 사실 정확도 향상 |
| 세밀한 개념 조종 (Fine-grained Concept Steering) | 특정 세부 개념 수준의 조종 |
| 다중 제약 명령 수행 (Multi-constraint Instruction Following) | 여러 행동 요구를 동시에 처리 |
| 활성화 공간 분류 (Activation-space Classification) | 내부 표현에서 행동/속성 분류 |
| 방법 | 행동 제어 점수 | 진실성 점수 | 적응성 |
|---|---|---|---|
| CAA | 중간 | 중간 | 낮음 (새 행동마다 재학습) |
| RepE | 중간 | 중간 | 낮음 (새 행동마다 재학습) |
| UniSteer | 높음 | 높음 | 높음 (텍스트 조건만 변경) |
기존 방법들은 "긍정적/부정적"처럼 이진 분류 수준의 조종에 최적화되어 있어, "약간 격식체(slightly formal)"나 "중간 정도의 유머(moderately humorous)"와 같은 세밀한 개념 차이를 표현하기 어렵습니다.
UniSteer는 텍스트 조건을 자유롭게 변경할 수 있어, 세밀한 개념 수준에서도 효과적인 조종이 가능합니다.
"유머러스하면서도 격식 있게, 그리고 간결하게 답변하라"처럼 여러 제약을 동시에 적용할 때:
재구성 에너지 기반 분류 방식이 별도의 프로브(probe)나 분류기를 학습하는 기존 방법들과 비슷하거나 우수한 성능을 달성합니다.
특히 레이블이 적은 환경(few-shot setting)에서 UniSteer의 분류 방식이 강점을 보입니다. 기존 프로브 방법들은 충분한 레이블 데이터가 필요한 반면, UniSteer의 에너지 기반 방식은 레이블 데이터 없이도 활성화 공간에서 분류가 가능합니다.
다양한 값에 따른 실험 결과:
UniSteer는 학습 시 본 적 없는 새로운 텍스트 조건에도 일반화되는 능력을 보입니다. 이는 자연어 인코더가 의미 공간(semantic space)에서 조건을 표현하기 때문으로, 의미적으로 유사한 새로운 표현도 효과적으로 처리할 수 있습니다.
본 논문에서는 LLM 활성화 조종을 위한 텍스트 조건부 플로우 매칭 모델 UniSteer를 제안했습니다. 핵심 기여는 다음과 같습니다:
| 비교 항목 | CAA/RepE (기존) | 학습된 개입 모듈 (기존) | UniSteer (제안) |
|---|---|---|---|
| 조종 방식 | 고정 벡터 추가 | 작업별 모듈 | 텍스트 조건부 플로우 |
| 새 행동 추가 시 | 별도 학습 필요 | 별도 학습 필요 | 텍스트 조건만 변경 |
| 세밀한 개념 표현 | 어려움 | 제한적 | 자연어로 자유롭게 |
| 다중 제약 처리 | 간섭 발생 | 간섭 발생 | 통합 처리 가능 |
| 분류 지원 | 별도 프로브 필요 | 별도 분류기 필요 | 재구성 에너지로 통합 |
| 모델 파라미터 수정 | 없음 | 없음 | 없음 (LLM 동결) |
| 유연성 | 낮음 | 낮음 | 높음 |
| 계산 비용 | 매우 낮음 | 낮음 | 중간 (ODE 풀이 필요) |
[입력 텍스트]
↓
[동결된 LLM 포워드 패스]
↓
[잔차 스트림 활성화 추출] h^src
↓
[UniSteer: 부분 역산]
소스 조건 c^src 하에서 t=1 → t=τ로 역방향 ODE 풀이
↓
[중간 잠재 상태] z_τ
↓
[UniSteer: 목표 조건부 재생성]
목표 조건 c^tgt 하에서 t=τ → t=1로 정방향 ODE 풀이
↓
[편집된 활성화] h^tgt
↓
[동결된 LLM에 주입]
↓
[조종된 텍스트 생성 출력]
UniSteer의 핵심 기술인 플로우 매칭을 좀 더 직관적으로 이해해 봅시다.
플로우 매칭은 두 분포 사이를 연속적으로 변환하는 경로를 학습하는 방법입니다. 이미지 생성 분야에서 확산 모델(Diffusion Model)의 대안으로 주목받고 있는 기술입니다.
쉽게 비유하자면:
🌊 물이 흐르는 강처럼, 노이즈(가우시안 분포)라는 출발지에서 데이터(활성화 분포)라는 목적지까지 "물의 흐름(velocity field)"을 학습합니다. 목적지를 바꾸면(텍스트 조건 변경) 물이 다른 방향으로 흐르게 됩니다.
기존 확산 모델과의 차이점:
| 항목 | 확산 모델 | 플로우 매칭 |
|---|---|---|
| 경로 | 확률적(stochastic) | 결정론적(deterministic) |
| 학습 | Score 함수 | 속도 필드(velocity field) |
| 샘플링 | 느린 반복 과정 | 직선 경로로 빠른 수렴 |
| 역산 | 근사적 | 정확한 ODE 역산 가능 |
UniSteer는 플로우 매칭의 정확한 역산 가능성을 활용하여, 소스 활성화를 잠재 공간으로 정확하게 역산하고 다시 목표 조건으로 재생성합니다.
트랜스포머(Transformer) 기반 LLM에서 잔차 스트림은 각 레이어를 통과하면서 누적 업데이트되는 주요 정보 흐름입니다.
입력 임베딩
↓
[레이어 1]
잔차 스트림 h¹ = h⁰ + Attention(h⁰) + MLP(h⁰)
↓
[레이어 2]
잔차 스트림 h² = h¹ + Attention(h¹) + MLP(h¹)
↓
...
↓
[레이어 L]
잔차 스트림 hᴸ → 최종 출력
각 레이어의 잔차 스트림에는 그 시점까지 처리된 모든 정보가 누적되어 있으며, 이 정보에는 모델의 현재 행동 경향, 사실적 지식, 문체 선호 등이 인코딩되어 있습니다. UniSteer는 바로 이 잔차 스트림을 가로채서 편집합니다.
UniSteer가 분류에 사용하는 재구성 에너지를 직관적으로 이해해 봅시다.
예를 들어, 어떤 활성화 가 "진실된 발화(truthful statement)"에서 나왔는지, "거짓 발화(deceptive statement)"에서 나왔는지 분류하고 싶다고 합시다.
h (분류할 활성화)
↓
[조건 A = "truthful"로 역산 후 재구성]
→ 재구성 오류 = 0.12 (낮음: 잘 맞음)
h (동일한 활성화)
↓
[조건 B = "deceptive"로 역산 후 재구성]
→ 재구성 오류 = 0.87 (높음: 잘 안 맞음)
→ 결론: 조건 A ("truthful")가 이 활성화를 더 잘 설명함
→ 분류 결과: "truthful"
이는 마치 "이 활성화가 어떤 텍스트 조건에서 가장 자연스럽게 생성될 수 있는가?"를 묻는 것과 같습니다. 실제로 별도의 분류기 학습 없이도 플로우 모델 하나로 분류가 가능하다는 점이 UniSteer의 우아한 특성입니다.
UniSteer가 가장 인상적인 이유는 바로 통합성(universality)에 있습니다. 기존의 활성화 조종 연구들이 "이 작업을 위한 벡터", "저 작업을 위한 모듈"처럼 파편화된 접근법을 취했다면, UniSteer는 자연어라는 가장 유연한 인터페이스를 통해 이 모든 것을 하나로 묶었습니다.
이 접근법은 최근 AI 연구의 큰 트렌드인 "하나의 범용 모델(universal model)" 패러다임과도 잘 맞아떨어집니다. GPT-4나 Claude처럼 단일 모델이 번역, 요약, 코딩 등 다양한 작업을 처리하는 것처럼, UniSteer도 단일 플로우 모델이 행동 제어부터 분류까지 다양한 활성화 편집 작업을 처리합니다. 특히 "새로운 조종 목표 = 새로운 텍스트 조건"이라는 단순한 원칙이 매우 실용적이라고 생각합니다. 연구자나 엔지니어가 새로운 LLM 행동을 제어하고 싶을 때, 모델을 재학습하거나 새로운 데이터셋을 구축하는 대신 텍스트 조건만 바꾸면 된다는 것은 현실적인 배포 환경에서 큰 장점입니다.
플로우 매칭(Flow Matching)은 이미지 생성 분야에서 주로 활약하던 기술이었습니다. Stable Diffusion 3나 FLUX 같은 최신 이미지 생성 모델들이 플로우 매칭을 채택하면서 주목받기 시작했는데, 이를 LLM의 내부 활성화 공간으로 가져온다는 발상이 매우 창의적입니다. LLM의 고차원 잔차 스트림 공간이 이미지 픽셀 공간과는 전혀 다른 구조를 가지고 있음에도 불구하고, 플로우 매칭의 핵심 아이디어(노이즈에서 데이터로의 연속적 변환, 정확한 역산 가능성)가 활성화 편집에도 유효함을 보인 것은 학문적으로도 의미 있는 발견입니다. 앞으로 플로우 기반 접근법이 LLM 해석 가능성(interpretability), 안전성(safety), 정렬(alignment) 연구에서도 새로운 도구로 자리 잡을 가능성이 있다고 봅니다.
물론 몇 가지 아쉬운 점도 있습니다. ODE 풀이가 필요한 만큼 단순한 벡터 덧셈보다는 추론 속도가 느리다는 점은 실시간 서비스에 적용할 때 걸림돌이 될 수 있습니다. 또한, 텍스트 조건을 어떻게 작성하느냐에 따라 성능이 달라질 수 있어서 프롬프트 엔지니어링(prompt engineering)에 대한 민감성이 여전히 존재합니다. 그럼에도 불구하고, UniSteer는 LLM 활성화 조종 연구에서 "텍스트 조건 + 플로우 매칭"이라는 새로운 패러다임을 제시했다는 점에서 향후 연구들이 이를 기반으로 더욱 발전된 방법론을 내놓을 것으로 기대됩니다. 모델 경량화, 더 다양한 언어 조건, 멀티모달 확장 등이 흥미로운 후속 연구 방향이 될 것입니다.
| 연구 | 설명 |
|---|---|
| Panickssery et al. (2023) | CAA: 대조적 활성화 추가를 통한 LLM 조종 |
| Turner et al. (2025) | 활성화 추가 기반 행동 제어 |
| Zou et al. (2025) | 표현 엔지니어링(RepE) |
| Wu et al. (2024) | 학습된 개입 방법 |
| Lipman et al. (2023) | 플로우 매칭 원본 논문 |
| Liu et al. (2022) | 직선 플로우(Rectified Flow) |
| Tong et al. (2023) | 조건부 플로우 매칭 |
| Burns et al. (2022) | LLM 잠재 지식 탐색 |
| Cunningham et al. (2023) | 희소 오토인코더를 통한 특징 추출 |
| Meng et al. (2022) | DDIM 역산을 통한 이미지 편집 (EDICT) |
#LLM #활성화조종 #ActivationSteering #플로우매칭 #FlowMatching #표현엔지니어링 #RepresentationEngineering #LLM제어 #텍스트조건부생성 #UniSteer #AI안전성 #AIAlignment #잠재공간편집 #ShanghaiTech #NLP #딥러닝 #ActivationSpace #ConditionalGeneration #LLMSteering #InferenceTimeControl
📌 이 포스트가 도움이 되셨나요? UniSteer 논문은 arXiv 2605.30076에서 원문을 확인하실 수 있으며, HuggingFace Papers에서도 관련 토론을 볼 수 있습니다.