[논문 리뷰] BioPhi: A platform for antibody design, humanization, and humanness evaluation based on natural antibody repertoires and deep learning

정우현·2025년 6월 19일

서울대

목록 보기
5/44

💡 요약


✅ 1. 연구 목적 및 배경

항체 인간화(humanization)는 치료용 항체 개발의 핵심 단계이지만, 수작업에 의존하며 전문적인 지식이 요구되는 복잡한 과정

기존의 인간화 도구들은 대부분 폐쇄적이며, 기존의 Humanness Score는 해석 가능성(interpretable), 다양성(diversity), 세분성(granularity)이 부족함

본 논문에서는 공개형 플랫폼 BioPhi를 제안함:

  • 인간화 모델: Sapiens
  • 인간성 평가 점수: OASis
  • 자연 항체 레퍼토리: OAS (Observed Antibody Space) 활용

🖐 Monoclonal antibodies (mAbs, 단일클론항체) 란?

하나의 B세포 클론에서 유래한 항체로서, 하나의 특정 항원에만 특이적으로 결합하는 항체
현재 임상에서 가장 많이 사용되는 단백질 기반 치료제

mAb 개발 방식
Mouse(혹은 다른 동물) 를 면역화하여 항체를 얻음
하지만 이 동물 유래 항체는 사람 몸에서 "이물질" 로 인식되어 면역 반응(ADA) 을 유발할 수 있음
→ 안전성 및 효능 저하
→ Humanization 필요

🖐 ADA(Anti-Drug Antibody) 반응이란?

치료용 단백질 약물(특히 mAb 등)을 외부 물질로 인식하여,
환자의 면역체계가 항체를 생성하는 현상

🖐 Vernier Zone이란?

CDR 바로 아래 Framework 영역에 있는 아미노산 위치들
CDR의 3차원 구조와 안정성에 직접적 영향
마치 CDR을 받쳐주는 구조적 ‘버팀대’ 같은 역할

🖐 Back-mutation이란?

인간화 과정에서 프레임워크를 human germline으로 바꾼 후에도,
특정 위치(Vernier zone)는 다시 원래 mouse 서열로 되돌림

목적: CDR의 입체 구조 유지 → 항원 결합력 보존
But, humanness 저하 가능

🖐 Humanness Score란?

항체 서열이 얼마나 인간 서열과 유사한가를 정량화한 점수로,
면역원성(ADA 발생 가능성)을 예측하고 인간화의 정도 평가에 사용됨

🖐 기존의 humanness score 방법들

점수평가 방식특징
Z-score전체 서열을 기준으로, 인간 항체 라이브러리와의 평균 유사도간단하고 직관적이나 세밀한 구분 어려움
T20 score가장 유사한 상위 20개 인간 항체와의 평균 유사도일부 국소적 정보 반영 가능
HSC (Human String Content)서열을 9-mer 단위 펩타이드로 분해하여, 인간 germline과의 유사도 계산면역학적 관점 반영 (MHC 제시 모티프 기반)
MG score서열 내 두 위치 간 관계성까지 반영하는 Multivariate Gaussian 모델 기반 점수고차원 통계 관계 반영 가능

🖐 왜 9-mer 단위가 중요한가?

사람 면역체계는 외부 단백질을 짧은 펩타이드(8~11mer) 로 잘라 MHC에 제시
→ T세포가 이를 인식

따라서 9-mer 펩타이드 단위의 humanness는 실제 면역 반응과 직접적으로 관련됨

🖐 기존 humanness score 방법들의 한계점

1️⃣ 세분성 부족 (Granularity 문제)
대부분 하나의 숫자 점수로만 전체 서열의 humanness를 평가함
→ 특정 부위(예: CDR, Vernier 등)의 비인간성(high-risk position)을 구체적으로 파악하기 어려움

2️⃣ 참조 라이브러리의 다양성 부족
대부분의 점수는 소규모 human reference dataset에 기반
→ 인간 항체 다양성을 충분히 반영하지 못함

🖐 OAS (Observed Antibody Space) 란?

실제 인간 항체에서 유래된 펩타이드 서열의 거대한 참조 라이브러리
기존의 제한적인 인간 항체 라이브러리보다 훨씬 다양하고 풍부한 서열 정보를 포함


✅ 2. BioPhi 플랫폼 구성

✅ 2-1. OASis (Humanization 점수 평가)

9-mer 펩타이드 단위로 항체 서열을 분할하고 OAS DB에서 prevalence(등장 빈도)를 검색

펩타이드가 인구의 몇 %에서 발견되었는지를 바탕으로 인간성과 면역원성 평가

다양한 stringency:
loose (1%), relaxed (10%), medium (50%), strict (90%)

OASis percentile 제공: 0~100%로 인간화 정도 시각화

🖐 항체 다양성의 필요성

왜 다양한 항체 서열이 필요한가?

치료용 항체를 설계 시 해당 조건 만족 필요

  • 개발 가능성(developability): 안정성, 발현성, 응집성 등
  • 면역원성(immunogenicity): 면역 반응 유발 가능성 최소화
  • 후번역변형 위험성(PTM liability): 예기치 않은 당화, 산화 등 회피

이를 위해선 다양한 참조 서열 라이브러리가 필요하고, 항체 서열이 인간 서열 공간(human sequence space)에 속하는지를 평가해야 함

🖐 V 유전자 (V gene) 란?

V = Variable
항체의 가변 영역(variable region)을 암호화하는 유전자

구성요소설명
V (Variable)항체 가변 부위의 주된 서열을 담당
D (Diversity)(heavy chain에만 있음) V와 J 사이에 추가됨
J (Joining)V(D)와 연결되어 완전한 V(D)J exon을 만듦

이 조합(V(D)J recombination)이 다양한 항체를 만들어내는 핵심 원리

🖐 V 유전자 패밀리 (V gene family) 란?

유사한 서열을 가진 그룹끼리 '패밀리'로 묶은 것

ex) IGHV1, IGHV3, IGHV4
같은 IGHV (= Immunoglobulin Heavy Variable) 패밀리

같은 패밀리는 구조나 기능 면에서 유사성이 높기 때문에 분류 단위로 많이 사용되고, 분석할 때도 기준이 됨

🖐 Variable Region (가변 부위 서열) 란?

항체의 항원 결합 부위를 포함한 영역

주로 V(D)J로 구성되며, CDR1, CDR2, CDR3를 포함

항체 인간화나 면역원성 예측에서 가장 핵심적인 분석 대상

🖐 왜 V 유전자 기준으로 variable region을 추출하고 비교하는가?

V Gene Family와 IMGT 기준 서열을 활용하면,
항체 서열의 다양성과 인간 유사성을 과학적으로 정량화하고 비교할 수 있으며,
이는 인간화 설계와 면역원성 예측의 핵심 기반이 됨

이유설명
1. 항체 구조를 잘 설명할 수 있는 단위V 유전자는 항체 variable region의 대부분을 차지하기 때문에,
항체의 정체성과 구조를 정의하는 핵심 서열임
2. Germline 유전자 비교를 통해 인간화 정도 측정 가능인간의 V 유전자들과의 유사도는 항체가 '얼마나 인간적인가'를 평가하는 데 좋은 기준이 됨
3. 다양한 패밀리로부터 서열을 고르게 샘플링 가능각 V gene family로부터 균형 잡힌 데이터를 추출하면, 항체 서열 다양성을 더 잘 분석할 수 있음
4. 사람 항체 레퍼토리와 치료용 항체의 설계 연결실제 임상 항체도 특정 V gene 패밀리에서 유래되는 경우가 많아서, 디자인 시 유용한 비교 기준이 됨

🖐 UMAP 시각화로 본 서열 다양성

UMAP (Uniform Manifold Approximation and Projection)
→ 고차원 데이터를 2차원 또는 3차원으로 줄여서 시각화해주는 도구

항체 서열은 수십~수백 개의 아미노산으로 이루어진 고차원 정보
이걸 UMAP으로 2D에 투영하면, 서열 간 유사도에 따라 가까이/멀리 배치 가능

🖐 BioPhi의 OAS의 근거

✅ IMGT에서 정의한 정확한 인간 유전자 서열들(germline)

UMAP 상에서 비슷한 위치에 뭉쳐 있음 → 서로 매우 유사하다

✅ But, 실제 인간 항체 레퍼토리(OAS)는

많은 서열이 germline 유전자와 비슷하지 않음
→ 이들은 돌연변이, 체성 과변이(somatic hypermutation) 등으로 변형된 서열들임

✅ 사람 몸에서 생성되는 항체는, 정형적인 germline 서열보다 훨씬 다양하다는 의미

즉, 기존 인간화 기준이 정적인 germline 중심이었다면,
이제는 다양한 실제 인간 서열을 기준으로 해야 더 정확한 평가가 가능

OAS는 germline보다 훨씬 넓은 인간 서열 공간을 제공하므로,
humanness 평가나 인간화 설계의 기준으로 더 적합하다는 근거가 됨

🖐 왜 9-mer 펩타이드 인가?

길이이유
8-merMHC-II 분자에서 제시되는 펩타이드로는 너무 짧음
→ 면역원성 예측 부정확
10-mer정보는 풍부하지만, 데이터베이스 용량이 10배 이상 커짐
→ 현실적 비효율
9-merMHC-II 결합 예측에 충분하고, 계산량도 적절한 균형 잡힌 길이

🖐 OAS의 지표인 prevalence (등장 빈도) 란?

각 9-mer 펩타이드가 전체 사람 중 몇 %에서 나타났는지 계산

ex) PEPTIDE01이 231명 중 185명에게서 나타나면
→ prevalence = 185 / 231 = 80.1%

"얼마나 많은 사람에게서 공유되는 펩타이드인지" 파악 가능
→ 공공성(publicness)이 높을수록 인간 항체의 공통 패턴, 즉 인간 유사(human-like) 라고 판단

🖐 다양성 비교: OASis vs Germline

IMGT germline 유전자에서도 9-mer를 추출해 비교

80% 이상의 사람에게서 공유되는 펩타이드를 기준으로

OASis에서 얻은 9-mer의 종류 수(서열 공간의 폭)가
germline만 썼을 때보다 12배 더 큼

즉, 실제 사람 몸에서 만들어진 항체는 germline 유전자만으로는 절대 충분히 설명되지 않음

🔍
germline 유전자는 벽돌 틀(template)이고,
OASis 9-mer는 실제 사람들이 만든 수많은 벽돌 샘플들이라고 생각

이전에는 "이 벽돌은 벽돌틀이랑 비슷하니까 안전해"
라고만 평가

이제는 "이 벽돌은 200명 이상이 실제로 사용한 벽돌이다
→ 진짜 인간이 쓰는 안전한 벽돌이다"라고 평가

🖐 Germline 이란?

면역세포가 재조합이나 돌연변이를 일으키기 전의 '원래 유전자 서열'

🖐 항체 유전자 생성과정

인간의 B세포는 VDJ 재조합이라는 과정을 통해 다양한 항체를 만들어냄

이 재조합이 일어나기 이전의 유전자 서열이 바로 germline 유전자

IMGT 같은 DB에서는 인간 유전체에 존재하는 모든 공식적인 V, D, J 유전자 서열을 정리해놓았고, 이들이 전부 germline 서열

ex) IGHV1-6901, IGKV3-2001, IGHJ4*02
→ 이런 게 모두 germline 유전자들
면역반응 이전의 "기본 틀"

🖐 OAS도 IMGT 기반이면, 뭐가 다른가?

OAS(Observed Antibody Space)는 IMGT의 V/J 유전자 정보를 주석(annotation) 으로 사용해 정리된 DB
주석은 IMGT 기반이지만, 실제 데이터는 사람이 만들어낸 변이된 항체 서열

항목IMGT (Germline)OAS (Repertoire)
데이터 출처인간 유전체 분석 결과
→ 정적이고 제한된 유전자 집합
실제 사람 몸에서 나오는 B세포 항체 서열 수천만 개
서열 수수백 개수억 개 (OAS는 5억 이상)
내용변이 전 원형 유전자VDJ 재조합 + 체성 과변이 포함
→ 진짜 항체의 모습
다양성매우 제한적실제 면역반응을 반영한 폭발적인 다양성
용도기준점, alignmentAI 학습, 서열 확률성 평가, humanness 판별 등에 활용

IMGT germline은 "정해진 틀" (template, 유전적 기준)
OAS는 사람들이 실제로 만든 결과물 (진짜 항체가 어떻게 생겼는지를 보여줌)

🖐 그럼 OASis 데이터가 왜 그렇게 좋다고 자신하나?

1️⃣ 스케일의 차이
IMGT germline 기준: 수백 개 유전자
OASis: 1억 3,900만 개의 9-mer 펩타이드

2️⃣ 실제 인간 데이터 기반
OAS는 231명 이상의 실제 인간 개체에서 유래된 항체 서열
면역반응, 질병 상태, 백신 반응 등 다양한 면역 상황이 반영됨

3️⃣ Prevalence(등장 빈도) 기반 해석 가능
단순히 서열이 인간 유래인지 아닌지가 아니라
→ 이 서열이 얼마나 많은 사람에게서 반복적으로 나타나는지까지 평가 가능
→ 실제 면역원성 위험(=낯선 서열인가?)을 정량적으로 판단 가능함

4️⃣ Humanness 점수로서의 해석 가능성
IMGT 기준의 T20, Z-score는 단일 점수만 제공 → 해석 어려움
OASis는 위치별로 어느 부분이 인간적인지/비인간적인지 알려줌

🖐 OASis 점수 시스템이란?

1️⃣ Granularity (정밀성)
항체 전체 서열을 한 점수로만 평가하지 않고,
서열을 겹치는 9-mer 펩타이드 단위로 쪼개서 각각의 human prevalence(사람에게서 얼마나 자주 발견되는지)를 계산

즉, 어떤 부분이 비인간적인지까지 구체적으로 확인 가능
→ 서열 내 위험 위치를 정확히 파악 가능
→ 인간화 타깃 설정 가능

2️⃣ Interpretability (해석 용이성)
점수의 근거를 "이 펩타이드는 인구의 x%에서 발견됨" 같은 방식으로 펩타이드의 사람 내 출현율 기반 해석

3️⃣ OASis Identity Score (전체 항체 단위 점수)
특정 prevalence 기준 이상으로 인간에서 발견되는 펩타이드 비율을 계산

ex)
어떤 항체 서열이 100개의 9-mer 펩타이드를 갖고 있고,
이 중 80개가 전체 인간 인구의 50% 이상에서 발견되는 펩타이드라면,
→ OASis Identity Score (medium 기준) = 0.80 (80%)

4️⃣ OASis Percentile Score
IMGT mAb DB의 임상 단계 항체 544개를 기준으로,
해당 항체의 identity score가 임상 항체들 중 몇 퍼센트 수준인지를 0–100%로 환산

ex)
percentile = 100% → 가장 인간적인 임상 항체보다 더 인간적
percentile = 5% → 대부분의 인간 항체보다도 비인간적


✅ 2-2. Sapiens (Humanization Tool)

OAS에서 학습된 Transformer 기반의 딥러닝 모델
전문가와 유사한 결과를 달성하면서도 대규모 시퀀스 생성 가능

인간 항체 서열을 마스킹하고 이를 복원하는 masked language modeling 방식으로 학습

훈련 데이터: OAS에서 추출한 수천만 개의 human antibody sequence

입력 서열에서 비인간성(non-human-like) 아미노산을 인식하고 인간 유사 서열로 대체함

CDR(결합 부위)는 변경하지 않음

🖐 왜 Sapiens가 필요한가?

OASis humanness score는 항체를 9-mer 펩타이드 단위로 잘라서 평가

이 방식은 면역원성과 관련된 짧은 지역(local features)에 강점이 있지만,
서열 전체의 장거리 관계(long-range dependencies), 즉 구조적 안정성이나 전체적인 서열의 적합성은 반영 못함

Sapiens는 Transformer 기반으로 서열 전체의 문맥을 고려하여 인간적인 항체 서열을 학습

humanness 평가(OASis)와 Sapiens 모델 학습은 분리되어 있음 → 공정한 성능 평가 가능

🖐 Sapiens 모델 아키텍처

Transformer Encoder 기반 언어 모델

항체 서열 = 자연어 문장
아미노산 = 단어

✅ 학습 방식: Masked Language Modeling (BERT 방식과 동일)

항목내용
입력항체의 variable region 서열
마스킹무작위로 일부 아미노산을 마스킹하거나 잘못된 아미노산으로 바꿈
목표마스킹된 부분이 무엇이었는지 예측
특징어떤 부분이 마스킹됐는지 모르도록 학습 → 전체 서열 문맥 파악 필수

이 과정을 통해 "사람 항체라면 이런 패턴일 것이다"라는 언어 모델 학습

✅ 학습 데이터(OAS 데이터)

  • Heavy chain: 2천만 개 서열
  • Light chain: 1,900만 개 서열

각각 별도의 모델로 학습

정말 장거리 의존성을 배웠는가 확인을 위해, Sapiens의 Attention 해석 가능

✅ Sapiens 모델을 실제로 어떻게 항체 humanization에 적용하는가

1️⃣ Humanization의 목표(두 가지 동시 만족)

  1. Humanness 향상 (면역원성 낮춤)
  2. Parental 서열 보존 (결합력 유지)

실험적 평가는 결국 in vitro/in vivo에서 해야 하나,
그 전에 in silico 평가로 필터링 필요

2️⃣ 평가 지표 정의

지표정의
Humanness 증가OASis identity score 차이 (Humanized − Parental)
Preservation (보존율)두 서열 간 전체/버니어 영역 일치율
→ Total Preservation / Vernier Preservation

3️⃣ 비교 대상

총 25개의 Parental–Humanized 실험쌍을 기준으로 사용
(Clavero-Álvarez, Marks 등에서 수집)

이들을 Sapiens 결과와 비교하여 신뢰도 평가

4️⃣ 비교 방법

Baseline 방식: CDR Grafting 방식 2가지

방식설명목표
Straight CDR graftCDR을 인간 Germline에 그대로 붙임humanness 최우선
Vernier CDR graft위 방식에서 Vernier 위치는 되돌려(Patch back)parental 보존 최우선

Sapiens 방식: Recognize-and-Repair 기반 인간화

  1. Parental 서열을 입력
  2. Transformer attention을 통해 "비인간적" 위치 인식
  3. 각 위치에서 가장 가능성 높은 인간 아미노산으로 수정
    단, CDR은 절대 건드리지 않음 (결합력 보존 목적)
  4. Sapiens 1, 2, 3, 4: 반복 횟수에 따라 점진적 humanization 수행

5️⃣ 결과 비교

  1. Humanness 비교: OASis 기준
방법Humanness 수준 (OASis percentile)
Straight CDR graft가장 높음 (하지만 보존율 낮음)
Sapiens*3실험적 humanized 항체와 유사한 수준
Vernier CDR graftSapiens보다 약간 낮음
Hu-mAb오히려 낮음 (프레임워크에도 human peptide 거의 없음)
  1. Preservation 비교
항목Sapiens*3실험 서열
전체 보존율86%80%
Vernier 보존율86%86%

Sapiens*3은 humanness도 실험 수준 + 보존율은 오히려 더 높음

  1. 실제 mutation 유사도
    Sapiens*1~3이 가장 많은 shared mutations 달성
    → 전문가와 판단이 가장 비슷함

✅ 3. 결론

자동화 humanization의 현실적 가치

“과거에는 실험 후 마지막 단계였던 humanization이, 이제는 초기 설계에 도입될 수 있다.”

과거: 후보 항체를 수십 개 → 실험으로 추린 뒤 인간화
현재: 자동화 덕분에 초기 수천 개 단계에서 인간화 가능 → 시간과 비용 절약
미래: 통합된 in silico 인간화 + 최적화 + 안정성 예측 플랫폼으로 발전 가능

profile
In-silico Antibody Design & Engineering Lab Researcher, Seoul National University

0개의 댓글