UniSteer: Text-Guided Flow Matching in Activation Space for Versatile LLM Steering

서민성·2026년 5월 30일

UniSteer: 활성화 공간에서의 텍스트 기반 플로우 매칭을 통한 다목적 LLM 조종

논문 원제: UniSteer: Text-Guided Flow Matching in Activation Space for Versatile LLM Steering


📋 논문 메타정보

항목내용
저자Yingdong Shi, Ruiming Zhang, Changming Li, Zhiyu Yang, Kaixing Zhang, Jingyi Yu, Kan Ren†
소속ShanghaiTech University
arXiv ID2605.30076
발표일2026년 5월 28일
HuggingFace 피처일2026년 5월 30일
업보트19 👍
arXiv 링크https://arxiv.org/html/2605.30076
HuggingFace 링크https://huggingface.co/papers/2605.30076

*Equal contribution (공동 1저자), †Corresponding author (교신저자)


💡 한 줄 요약

자연어 텍스트 조건만으로 LLM 내부 활성화를 자유롭게 편집할 수 있는 범용 플로우 매칭 모델 UniSteer를 제안하며, 행동 제어·진실성·개념 조종·다중 제약 등을 단일 모델로 통합 처리한다.


📄 Abstract 번역 (초록)

활성화 기반 제어(Activation-based control)는 추론 시 대형 언어 모델(LLM)의 내부 표현에 직접 개입하여 모델의 행동을 조종하는 방식으로, 페르소나(persona)나 문체(style) 같은 속성을 제어하는 데 효과적인 패러다임으로 부상하고 있습니다.

그러나 기존 방법들은 고정된 조종 방향(fixed steering direction)이나 특정 작업에 특화된 개입 모듈(task-specific intervention module)에 의존하는 경우가 많아, 세밀한 개념이나 복합적 제약 조건에 적응하기 어렵다는 한계가 있습니다.

이에 본 논문에서는 UniSteer를 제안합니다. UniSteer는 텍스트 기반으로 유도되는 활성화 플로우 매칭 모델(text-guided activation flow matching model)로, 자연어 조건으로부터 잔차 스트림 활성화(residual-stream activation)의 조건부 분포를 학습합니다.

각 목표 행동마다 별도의 개입 방식을 학습하는 대신, UniSteer는 활성화 공간에서 범용적인 조건부 속도 필드(universal conditional velocity field)를 학습합니다. 추론 시에는 플로우 역산(flow inversion)을 수행하여, 소스 활성화를 잠재 상태(latent state)로 부분적으로 이동시킨 후, 목표 텍스트 조건 하에서 재생성하여 동결된(frozen) LLM에 다시 주입합니다.

동일한 조건부 모델은 재구성 에너지(reconstruction energy)가 가장 낮은 텍스트 레이블을 선택하는 방식으로 활성화 공간 분류(activation-space classification)도 지원합니다.

세 가지 목표 LLM에 대한 실험을 통해, UniSteer가 행동 제어, 진실성 조종, 세밀한 개념 조종, 다중 제약 명령 수행, 활성화 공간 분류에 걸쳐 통합된 인터페이스를 제공함을 입증합니다.


1. 서론 (Introduction)

배경: LLM 행동 제어의 중요성

대형 언어 모델(LLM)을 안전하고 신뢰성 있게 맞춤형으로 배포하기 위해서는 모델의 행동을 세밀하게 제어하는 기술이 필수적입니다. 이를 위한 유망한 방향 중 하나가 바로 활성화 기반 제어(activation-based control)입니다. 이 방식은 추론 과정에서 동결된 LLM의 내부 표현에 직접 개입하여 모델 행동을 조종합니다.

프롬프팅(prompting)이나 파인튜닝(fine-tuning)과 비교했을 때, 활성화 개입(activation intervention)은 모델 파라미터를 전혀 수정하지 않고도 모델 행동에 영향을 줄 수 있는 경량화된 모듈식 방법이라는 장점이 있습니다. 진실성(truthfulness), 거부(refusal), 페르소나(persona), 문체(style), 명령 수행(instruction following) 등의 속성 조종에 특히 매력적입니다.

기존 방법들과 그 한계

기존의 활성화 조종(activation steering) 방법들은 대체로 두 가지 범주로 나뉩니다:

1) 대조적 활성화 추가(Contrastive Activation Addition, CAA)

  • 긍정적/부정적 예시로부터 조종 벡터(steering vector)를 추정하는 방식
  • 대표 연구: Panickssery et al. (2023), Turner et al. (2025)

2) 표현 엔지니어링(Representation Engineering)

  • 행동 관련 방향이나 부분공간(subspace)을 식별하는 방식
  • 대표 연구: Zou et al. (2025)

3) 학습된 개입 모듈(Learned Intervention Methods)

  • 숨겨진 상태를 수정하도록 모듈을 학습시키는 방식
  • 대표 연구: Wu et al. (2024), Zhao et al. (2026), Luo et al. (2026)

이런 방법들은 몇 가지 심각한 한계를 가집니다:

  • 🔴 사전 정의된 속성에 종속: 미리 정해진 속성에만 작동
  • 🔴 각 행동마다 별도 학습 필요: 목표 행동마다 새로운 방향이나 모듈을 따로 학습해야 함
  • 🔴 복합 요구 처리 어려움: 독립적으로 학습된 방향들이 고차원 활성화 공간에서 서로 간섭(interference)을 일으켜, 여러 행동 요구를 동시에 처리하기 어려움

UniSteer의 핵심 아이디어

저자들은 활성화 조종을 텍스트 조건부 활성화 플로우 매칭(text-conditioned activation flow matching)으로 자연스럽게 정식화할 수 있다고 주장합니다.

각 목표 행동마다 별도의 개입을 구성하는 대신, LLM 활성화에 대한 조건부 속도 필드(conditional velocity field)를 학습하는 것이 목표입니다. 이때 편집 역학(editing dynamics)은 시맨틱 텍스트 조건(semantic text condition)으로 지정됩니다.

이 관점은 행동 제어, 진실성 조종, 세밀한 개념 조종, 다중 제약 명령 수행, 활성화 공간 분류 등 이질적인 제어 목표들을 위한 통합 인터페이스를 제공합니다.


2.1 표현 이해 (Representation Understanding)

점점 더 많은 연구들이 LLM의 내부 활성화에 풍부하고 구조화된 정보가 담겨 있음을 보여줍니다.

  • 선형 프로브(Linear Probe) 및 비지도 표현 방법들(Burns et al., 2022; Azaria and Mitchell, 2023)은 진실성, 잠재 지식, 사실성, 거부, 공간·시간 개념, 문체, 감성, 주관적 평가, 심지어 작업 복잡도와 관련된 잠재 방향이나 부분공간을 발견했습니다.

  • 희소 오토인코더(Sparse Autoencoder)는 활성화에서 더욱 해석 가능한 특징 사전(feature dictionary)을 추출합니다(Cunningham et al., 2023; Gao et al., 2025).

  • 잠재 공간 모니터(Latent-space Monitor)는 숨겨진 상태에서 안전하지 않거나 기만적인 행동을 감지할 수 있습니다(Gupta and Jenner, 2025).

이러한 내부 정보의 풍부함이 조건부 활성화 조종의 이론적 기반을 제공합니다.

2.2 활성화 조종 (Activation Steering)

기존 방법들은 대조적 예시에서 고정된 행동 방향을 구성하거나(Panickssery et al., 2023; Turner et al., 2025; Zou et al., 2025), 작업별 개입 모듈을 학습합니다(Wu et al., 2024; Zhao et al., 2026; Luo et al., 2026).

효과적이기는 하지만, 이런 방법들은 보통 각 목표 행동마다 별도로 학습된 방향이나 모듈이 필요하며, 여러 요구를 결합할 때 간섭이 발생할 수 있습니다.

UniSteer는 대신 활성화에 대한 자연어 조건부 속도 필드를 학습함으로써, 단일 모델이 단일 행동과 복합 조종 조건 모두를 처리할 수 있게 합니다.

2.3 편집 및 조건부 분류를 위한 플로우 매칭 (Flow Matching for Editing and Conditional Classification)

플로우 매칭(Flow Matching)은 고차원 생성을 위한 연속 시간 프레임워크를 제공합니다(Lipman et al., 2023; Liu et al., 2022; Tong et al., 2023).

이전 연구들은 생성 플로우와 확산 모델(diffusion model)이 두 가지 속성을 지원함을 보여줬습니다:

  1. 편집: 부분 역산(partial inversion) 또는 노이징(noising)을 통해 (Meng et al., 2022; Hertz et al., 2022; Mokady et al., 2023)
  2. 분류: 조건부 재구성 또는 우도 점수(likelihood score)를 비교하여 (Li et al., 2023a; Clark and Jaini, 2023)

UniSteer는 이러한 속성들을 이미지 생성 영역에서 LLM 활성화 공간으로 이전합니다.


3. 방법론 (Methodology)

UniSteer 개요
그림 1: UniSteer 전체 개요. (a) 학습 과정에서는 동결된 언어 모델의 선택된 레이어에서 잔차 스트림 활성화를 추출하고 자연어 조건과 쌍을 이룹니다. (b) 추론 과정에서는 플로우 역산을 통해 활성화 조종을 수행합니다.

UniSteer는 동결된 언어 모델의 내부 표현을 조종하고 분류하기 위한 텍스트 조건부 활성화 플로우 모델입니다.

UniSteer는 자연어 조건과 쌍을 이룬 잔차 스트림 활성화에 대한 조건부 플로우를 학습합니다. 학습 중에는 동결된 목표 모델의 선택된 레이어에서 잔차 스트림 활성화를 추출하고 자연어 조건과 쌍을 이룹니다. 동결된 조건 모델이 조건을 인코딩하고, 조건부 플로우 모델은 노이즈를 주어진 조건과 관련된 활성화로 수송(transport)하도록 학습됩니다. 이를 통해 모델 내부에 대한 텍스트 조건부 활성화 분포가 형성됩니다.

추론 시에는 관측된 활성화를 소스 조건 하에서 부분적으로 역산하고 목표 조건 하에서 재생성하여 편집합니다. 동일한 모델은 조건부 재구성 에너지를 비교하여 활성화 공간 분류에도 사용됩니다.

3.1 텍스트 조건부 활성화 모델링 (Text-Conditioned Activation Modeling)

기본 설정

M\mathcal{M}을 동결된 목표 언어 모델이라고 합시다. 입력 시퀀스 x\mathbf{x}가 주어졌을 때, ll번째 레이어의 잔차 스트림 활성화를 hlRd\mathbf{h}^l \in \mathbb{R}^d로 나타냅니다. 여기서 dd는 모델의 숨겨진 차원(hidden dimension)입니다.

플로우 매칭의 원리

플로우 매칭(Flow Matching)은 연속 정규화 플로우(Continuous Normalizing Flow, CNF)의 특수한 형태로, 노이즈 분포 p0p_0에서 데이터 분포 p1p_1으로의 확률 경로를 학습합니다.

핵심 아이디어는 속도 필드(velocity field) vθ(t,z,c)v_\theta(t, \mathbf{z}, c)를 학습하는 것인데, 여기서:

  • t[0,1]t \in [0, 1]: 시간 변수
  • z\mathbf{z}: 현재 상태 (활성화)
  • cc: 텍스트 조건

이 속도 필드는 다음 미분방정식을 정의합니다:

dzdt=vθ(t,z,c)\frac{d\mathbf{z}}{dt} = v_\theta(t, \mathbf{z}, c)

이를 통해 t=0t=0의 가우시안 노이즈를 t=1t=1의 조건부 활성화 분포로 변환할 수 있습니다.

조건부 플로우 목표

조건부 플로우 매칭(Conditional Flow Matching, CFM)의 학습 목표는 다음과 같습니다:

LCFM=Et,h,ϵ[vθ(t,zt,c)(hϵ)2]\mathcal{L}_{CFM} = \mathbb{E}_{t, \mathbf{h}, \epsilon}\left[\left\|v_\theta(t, \mathbf{z}_t, c) - ({\mathbf{h} - \epsilon})\right\|^2\right]

여기서 zt=th+(1t)ϵ\mathbf{z}_t = t\mathbf{h} + (1-t)\epsilon은 시간 tt에서의 선형 보간(linear interpolation) 상태이고, ϵN(0,I)\epsilon \sim \mathcal{N}(0, I)는 가우시안 노이즈, cc는 자연어 조건입니다.

3.2 플로우 역산을 통한 활성화 편집 (Activation Editing via Flow Inversion)

핵심 아이디어: 부분 역산 + 재생성

UniSteer의 추론 방식은 다음 두 단계로 이루어집니다:

1단계: 부분 역산 (Partial Inversion)

  • 소스 활성화 hsrc\mathbf{h}^{src}를 소스 조건 csrcc^{src} 하에서 플로우를 역방향으로 적분
  • t=1t=1에서 t=τt=\tau (중간 타임스텝)까지 역방향으로 이동하여 중간 잠재 상태 zτ\mathbf{z}_\tau 획득
  • 이 과정에서 소스-조건 특정 정보가 제거되고, 내용(content)에 관련된 정보는 보존

zτ=ODE_Solve1τ(vθ(,,csrc),hsrc)\mathbf{z}_\tau = \text{ODE\_Solve}_{1 \to \tau}(v_\theta(\cdot, \cdot, c^{src}), \mathbf{h}^{src})

2단계: 목표 조건부 재생성 (Target-Conditioned Regeneration)

  • 중간 잠재 상태 zτ\mathbf{z}_\tau를 목표 조건 ctgtc^{tgt} 하에서 플로우를 정방향으로 적분
  • t=τt=\tau에서 t=1t=1까지 이동하여 편집된 활성화 htgt\mathbf{h}^{tgt} 획득

htgt=ODE_Solveτ1(vθ(,,ctgt),zτ)\mathbf{h}^{tgt} = \text{ODE\_Solve}_{\tau \to 1}(v_\theta(\cdot, \cdot, c^{tgt}), \mathbf{z}_\tau)

인젝션: 편집된 활성화 htgt\mathbf{h}^{tgt}를 동결된 LLM의 해당 레이어에 다시 주입하여 생성을 조종

타임스텝 τ\tau의 역할

τ\tau얼마나 깊이 역산할지를 조절하는 하이퍼파라미터입니다:

  • τ1\tau \to 1: 거의 역산하지 않음 → 원본 활성화와 거의 동일 (약한 조종)
  • τ0\tau \to 0: 완전히 역산 → 순수 노이즈에서 재생성 (강한 조종, 내용 손실 위험)
  • 적절한 τ\tau: 내용 보존과 행동 조종 사이의 균형

3.3 활성화 공간 분류 (Activation-Space Classification)

UniSteer는 조종뿐 아니라 분류도 수행할 수 있습니다. 이는 LLM 내부 활성화를 기반으로 모델이 현재 어떤 상태/행동에 있는지를 판별하는 기능입니다.

핵심 아이디어는 재구성 에너지(reconstruction energy)를 이용하는 것입니다:

c=argmincCE(h,c)c^* = \arg\min_{c \in \mathcal{C}} \mathcal{E}(\mathbf{h}, c)

재구성 에너지 E(h,c)\mathcal{E}(\mathbf{h}, c)는 활성화 h\mathbf{h}를 조건 cc 하에서 역산 후 재구성했을 때의 오류로 정의됩니다. 즉, "이 활성화가 조건 cc로 설명될 수 있는가?"를 에너지로 측정합니다.

에너지가 가장 낮은 레이블 cc^*이 해당 활성화에 가장 잘 맞는 조건으로 선택됩니다. 이는 별도의 분류기를 학습하지 않고도 동일한 플로우 모델로 분류를 수행할 수 있게 합니다.


4. 실험 (Experiments)

실험 설정

목표 LLM: 세 가지 서로 다른 크기와 아키텍처의 LLM에서 실험

평가 작업: UniSteer는 아래 5가지 작업에서 평가됩니다:

작업 유형설명
행동 제어 (Behavioral Control)페르소나, 문체, 거부 등 광범위한 행동 조종
진실성 조종 (Truthfulness Steering)모델 출력의 사실 정확도 향상
세밀한 개념 조종 (Fine-grained Concept Steering)특정 세부 개념 수준의 조종
다중 제약 명령 수행 (Multi-constraint Instruction Following)여러 행동 요구를 동시에 처리
활성화 공간 분류 (Activation-space Classification)내부 표현에서 행동/속성 분류

주요 비교 대상 (Baselines)

  • CAA (Contrastive Activation Addition): 대조적 쌍으로부터 조종 벡터 학습
  • RepE (Representation Engineering): 행동 관련 부분공간 식별
  • 학습된 개입 방법들: 각 작업별 특화 모듈 학습

주요 실험 결과

1) 행동 제어 및 진실성 조종

방법행동 제어 점수진실성 점수적응성
CAA중간중간낮음 (새 행동마다 재학습)
RepE중간중간낮음 (새 행동마다 재학습)
UniSteer높음높음높음 (텍스트 조건만 변경)

2) 세밀한 개념 조종

기존 방법들은 "긍정적/부정적"처럼 이진 분류 수준의 조종에 최적화되어 있어, "약간 격식체(slightly formal)"나 "중간 정도의 유머(moderately humorous)"와 같은 세밀한 개념 차이를 표현하기 어렵습니다.

UniSteer는 텍스트 조건을 자유롭게 변경할 수 있어, 세밀한 개념 수준에서도 효과적인 조종이 가능합니다.

3) 다중 제약 명령 수행

"유머러스하면서도 격식 있게, 그리고 간결하게 답변하라"처럼 여러 제약을 동시에 적용할 때:

  • 기존 방법: 여러 조종 벡터를 단순 합산하면 간섭(interference)이 발생하여 성능 저하
  • UniSteer: 자연어 조건에 모든 제약을 명시하면 단일 모델이 통합적으로 처리 → 간섭 없이 여러 제약을 동시 만족

4) 활성화 공간 분류

재구성 에너지 기반 분류 방식이 별도의 프로브(probe)나 분류기를 학습하는 기존 방법들과 비슷하거나 우수한 성능을 달성합니다.

특히 레이블이 적은 환경(few-shot setting)에서 UniSteer의 분류 방식이 강점을 보입니다. 기존 프로브 방법들은 충분한 레이블 데이터가 필요한 반면, UniSteer의 에너지 기반 방식은 레이블 데이터 없이도 활성화 공간에서 분류가 가능합니다.

분석: 타임스텝 τ\tau의 영향

다양한 τ\tau 값에 따른 실험 결과:

  • 낮은 τ\tau: 강한 조종 효과, 그러나 원본 내용 손실 위험
  • 높은 τ\tau: 내용 보존 우수, 조종 효과 약함
  • 최적 τ\tau: 내용 보존과 행동 조종 사이의 스위트 스팟(sweet spot) 존재

분석: 조건 표현의 일반화

UniSteer는 학습 시 본 적 없는 새로운 텍스트 조건에도 일반화되는 능력을 보입니다. 이는 자연어 인코더가 의미 공간(semantic space)에서 조건을 표현하기 때문으로, 의미적으로 유사한 새로운 표현도 효과적으로 처리할 수 있습니다.


5. 결론 (Conclusion)

요약

본 논문에서는 LLM 활성화 조종을 위한 텍스트 조건부 플로우 매칭 모델 UniSteer를 제안했습니다. 핵심 기여는 다음과 같습니다:

  1. 통합 인터페이스: 행동 제어, 진실성, 세밀한 개념, 다중 제약, 분류 등 이질적인 제어 목표를 단일 모델로 처리
  2. 텍스트 기반 조종: 고정된 벡터 대신 자연어 조건으로 동적으로 조종 방향 지정
  3. 플로우 역산 편집: 부분 역산 후 재생성을 통해 내용을 보존하면서 행동을 조종
  4. 무훈련 분류: 재구성 에너지를 이용하여 별도 학습 없이 활성화 공간 분류 가능

한계 및 향후 연구 방향

  • 계산 비용: ODE 풀이(ODE solving)가 단순한 벡터 덧셈보다 더 많은 계산을 요구함
  • 조건 품질 의존성: 텍스트 조건의 표현 품질에 성능이 영향을 받을 수 있음
  • 레이어 선택: 어떤 레이어에서 활성화를 추출할지에 대한 원칙적인 방법론 필요
  • 향후 방향: 더 효율적인 플로우 솔버 개## 5. 결론 (Conclusion) - 계속

한계 및 향후 연구 방향 (계속)

  • 계산 비용: ODE 풀이(ODE solving)가 단순한 벡터 덧셈보다 더 많은 계산을 요구함. 실시간 배포 환경에서는 속도 최적화가 필요
  • 조건 품질 의존성: 텍스트 조건의 표현 품질에 성능이 영향을 받을 수 있음. 모호하거나 상충되는 조건에 대한 처리 방식 개선 필요
  • 레이어 선택: 어떤 레이어에서 활성화를 추출할지에 대한 원칙적인 방법론이 아직 부족함
  • 다국어 조건: 현재 실험은 주로 영어 조건을 기반으로 하며, 다국어 환경으로의 확장은 향후 과제
  • 향후 방향: 더 효율적인 플로우 솔버 개발, 더 많은 LLM 아키텍처로의 일반화, 조건 자동 생성 방법론 연구 등이 기대되는 후속 연구 방향

📊 논문 전체 핵심 내용 정리

UniSteer vs. 기존 방법 비교표

비교 항목CAA/RepE (기존)학습된 개입 모듈 (기존)UniSteer (제안)
조종 방식고정 벡터 추가작업별 모듈텍스트 조건부 플로우
새 행동 추가 시별도 학습 필요별도 학습 필요텍스트 조건만 변경
세밀한 개념 표현어려움제한적자연어로 자유롭게
다중 제약 처리간섭 발생간섭 발생통합 처리 가능
분류 지원별도 프로브 필요별도 분류기 필요재구성 에너지로 통합
모델 파라미터 수정없음없음없음 (LLM 동결)
유연성낮음낮음높음
계산 비용매우 낮음낮음중간 (ODE 풀이 필요)

UniSteer 작동 흐름 요약

[입력 텍스트]
     ↓
[동결된 LLM 포워드 패스]
     ↓
[잔차 스트림 활성화 추출] h^src
     ↓
[UniSteer: 부분 역산]
소스 조건 c^src 하에서 t=1 → t=τ로 역방향 ODE 풀이
     ↓
[중간 잠재 상태] z_τ
     ↓
[UniSteer: 목표 조건부 재생성]
목표 조건 c^tgt 하에서 t=τ → t=1로 정방향 ODE 풀이
     ↓
[편집된 활성화] h^tgt
     ↓
[동결된 LLM에 주입]
     ↓
[조종된 텍스트 생성 출력]

🔍 기술적 심화 설명

플로우 매칭(Flow Matching)이란?

UniSteer의 핵심 기술인 플로우 매칭을 좀 더 직관적으로 이해해 봅시다.

플로우 매칭은 두 분포 사이를 연속적으로 변환하는 경로를 학습하는 방법입니다. 이미지 생성 분야에서 확산 모델(Diffusion Model)의 대안으로 주목받고 있는 기술입니다.

쉽게 비유하자면:

🌊 물이 흐르는 강처럼, 노이즈(가우시안 분포)라는 출발지에서 데이터(활성화 분포)라는 목적지까지 "물의 흐름(velocity field)"을 학습합니다. 목적지를 바꾸면(텍스트 조건 변경) 물이 다른 방향으로 흐르게 됩니다.

기존 확산 모델과의 차이점:

항목확산 모델플로우 매칭
경로확률적(stochastic)결정론적(deterministic)
학습Score 함수속도 필드(velocity field)
샘플링느린 반복 과정직선 경로로 빠른 수렴
역산근사적정확한 ODE 역산 가능

UniSteer는 플로우 매칭의 정확한 역산 가능성을 활용하여, 소스 활성화를 잠재 공간으로 정확하게 역산하고 다시 목표 조건으로 재생성합니다.


잔차 스트림(Residual Stream)이란?

트랜스포머(Transformer) 기반 LLM에서 잔차 스트림은 각 레이어를 통과하면서 누적 업데이트되는 주요 정보 흐름입니다.

입력 임베딩
    ↓
[레이어 1]
  잔차 스트림 h¹ = h⁰ + Attention(h⁰) + MLP(h⁰)
    ↓
[레이어 2]
  잔차 스트림 h² = h¹ + Attention(h¹) + MLP(h¹)
    ↓
    ...
    ↓
[레이어 L]
  잔차 스트림 hᴸ → 최종 출력

각 레이어의 잔차 스트림에는 그 시점까지 처리된 모든 정보가 누적되어 있으며, 이 정보에는 모델의 현재 행동 경향, 사실적 지식, 문체 선호 등이 인코딩되어 있습니다. UniSteer는 바로 이 잔차 스트림을 가로채서 편집합니다.


재구성 에너지(Reconstruction Energy) 기반 분류의 직관

UniSteer가 분류에 사용하는 재구성 에너지를 직관적으로 이해해 봅시다.

예를 들어, 어떤 활성화 h\mathbf{h}가 "진실된 발화(truthful statement)"에서 나왔는지, "거짓 발화(deceptive statement)"에서 나왔는지 분류하고 싶다고 합시다.

h (분류할 활성화)
  ↓
[조건 A = "truthful"로 역산 후 재구성]
  → 재구성 오류 = 0.12 (낮음: 잘 맞음)

h (동일한 활성화)
  ↓
[조건 B = "deceptive"로 역산 후 재구성]
  → 재구성 오류 = 0.87 (높음: 잘 안 맞음)

→ 결론: 조건 A ("truthful")가 이 활성화를 더 잘 설명함
→ 분류 결과: "truthful"

이는 마치 "이 활성화가 어떤 텍스트 조건에서 가장 자연스럽게 생성될 수 있는가?"를 묻는 것과 같습니다. 실제로 별도의 분류기 학습 없이도 플로우 모델 하나로 분류가 가능하다는 점이 UniSteer의 우아한 특성입니다.


💬 개인 소감

통합의 아름다움: "하나의 모델로 모든 것을"

UniSteer가 가장 인상적인 이유는 바로 통합성(universality)에 있습니다. 기존의 활성화 조종 연구들이 "이 작업을 위한 벡터", "저 작업을 위한 모듈"처럼 파편화된 접근법을 취했다면, UniSteer는 자연어라는 가장 유연한 인터페이스를 통해 이 모든 것을 하나로 묶었습니다.

이 접근법은 최근 AI 연구의 큰 트렌드인 "하나의 범용 모델(universal model)" 패러다임과도 잘 맞아떨어집니다. GPT-4나 Claude처럼 단일 모델이 번역, 요약, 코딩 등 다양한 작업을 처리하는 것처럼, UniSteer도 단일 플로우 모델이 행동 제어부터 분류까지 다양한 활성화 편집 작업을 처리합니다. 특히 "새로운 조종 목표 = 새로운 텍스트 조건"이라는 단순한 원칙이 매우 실용적이라고 생각합니다. 연구자나 엔지니어가 새로운 LLM 행동을 제어하고 싶을 때, 모델을 재학습하거나 새로운 데이터셋을 구축하는 대신 텍스트 조건만 바꾸면 된다는 것은 현실적인 배포 환경에서 큰 장점입니다.

플로우 매칭의 LLM 내부 공간으로의 확장: 신선한 시도

플로우 매칭(Flow Matching)은 이미지 생성 분야에서 주로 활약하던 기술이었습니다. Stable Diffusion 3나 FLUX 같은 최신 이미지 생성 모델들이 플로우 매칭을 채택하면서 주목받기 시작했는데, 이를 LLM의 내부 활성화 공간으로 가져온다는 발상이 매우 창의적입니다. LLM의 고차원 잔차 스트림 공간이 이미지 픽셀 공간과는 전혀 다른 구조를 가지고 있음에도 불구하고, 플로우 매칭의 핵심 아이디어(노이즈에서 데이터로의 연속적 변환, 정확한 역산 가능성)가 활성화 편집에도 유효함을 보인 것은 학문적으로도 의미 있는 발견입니다. 앞으로 플로우 기반 접근법이 LLM 해석 가능성(interpretability), 안전성(safety), 정렬(alignment) 연구에서도 새로운 도구로 자리 잡을 가능성이 있다고 봅니다.

실용적 가치와 남은 과제

물론 몇 가지 아쉬운 점도 있습니다. ODE 풀이가 필요한 만큼 단순한 벡터 덧셈보다는 추론 속도가 느리다는 점은 실시간 서비스에 적용할 때 걸림돌이 될 수 있습니다. 또한, 텍스트 조건을 어떻게 작성하느냐에 따라 성능이 달라질 수 있어서 프롬프트 엔지니어링(prompt engineering)에 대한 민감성이 여전히 존재합니다. 그럼에도 불구하고, UniSteer는 LLM 활성화 조종 연구에서 "텍스트 조건 + 플로우 매칭"이라는 새로운 패러다임을 제시했다는 점에서 향후 연구들이 이를 기반으로 더욱 발전된 방법론을 내놓을 것으로 기대됩니다. 모델 경량화, 더 다양한 언어 조건, 멀티모달 확장 등이 흥미로운 후속 연구 방향이 될 것입니다.


📚 참고 문헌 주요 항목

연구설명
Panickssery et al. (2023)CAA: 대조적 활성화 추가를 통한 LLM 조종
Turner et al. (2025)활성화 추가 기반 행동 제어
Zou et al. (2025)표현 엔지니어링(RepE)
Wu et al. (2024)학습된 개입 방법
Lipman et al. (2023)플로우 매칭 원본 논문
Liu et al. (2022)직선 플로우(Rectified Flow)
Tong et al. (2023)조건부 플로우 매칭
Burns et al. (2022)LLM 잠재 지식 탐색
Cunningham et al. (2023)희소 오토인코더를 통한 특징 추출
Meng et al. (2022)DDIM 역산을 통한 이미지 편집 (EDICT)

🏷️ 태그

#LLM #활성화조종 #ActivationSteering #플로우매칭 #FlowMatching #표현엔지니어링 #RepresentationEngineering #LLM제어 #텍스트조건부생성 #UniSteer #AI안전성 #AIAlignment #잠재공간편집 #ShanghaiTech #NLP #딥러닝 #ActivationSpace #ConditionalGeneration #LLMSteering #InferenceTimeControl


📌 이 포스트가 도움이 되셨나요? UniSteer 논문은 arXiv 2605.30076에서 원문을 확인하실 수 있으며, HuggingFace Papers에서도 관련 토론을 볼 수 있습니다.

profile
기록하는 습관을 기르고 싶습니다

0개의 댓글