Large Language Models as Molecular Design Engines

coticoger·2026년 3월 11일

Bioinformatics

목록 보기
2/2

INTRO

신규 분자와 소재의 설계는 여전히 과학계에서 중요한 연구 분야로 남아 있고 이를 해결하기 위해 새로운 합성 기법들이 지속적으로 개발되고 있다. 이는 에너지 저장 기술, 합금 설계, 2차원 소재 설계, 신약 개발을 포함한 광범위한 응용 분야에서 필수적이다. 이처럼 방대한 화학적 공간을 전략적으로 탐색하는 것이 이러한 문제들을 해결하는데 핵심적인 요소로 여겨지고 있다.

처음에는 Generative machine learning을 통해 사용하여 이러한 문제를 해결하려 하였지만, invalid or irrelevant 분자 구조가 생성되는 문제가 존재했다. 이후 기존의 모델을 많은 양의 데이터를 기반으로 fine-tuning하거나 retraining하였지만 이 과정에서 많은 양의 라벨링된 데이터가 요구되며, 복잡한 학습 절차, 막대한 계산 비용과 시간이 요구되면서 부담이 크고 비현실적이라는 문제를 제기하였다.

하지만 생성형 AI의 등장으로 패러다임에 변화가 생겼다. transformer 기반 모델은 다양한 분자 디자인 작업에 성공적으로 적용이 가능했다. 대표적인 예는 다음과 같다.

METHODEXPLAIN
5T5-type modelsantiviral durgs 디자인에 사용됨
Transformer-based VAElatent space를 통해 후보 분자들을 생성
치료용 표적 단백질 inhibitors 발굴
MolGPT원하는 scaffold와 물성을 만족하는 분자 생성

이러한 사례들은 다양한 분자 설계 문제 전반에 걸쳐 트랜스포머의 강력한 활용 가능성을 보여주었다.

LLM은 방대한 자연어 데이터를 기반으로 사전 학습된 transformer 아키텍처에 기반한 모델로, 다양한 분야에서 파급적인 영향을 미친다. Domain speific하게 학습이 되지 않았지만 높은 adaptation과 generalization 능력을 지닌다.

최근 연구에서는 LLM이 단순한 패턴 인식을 넘어 화학 원리를 포착하고 이를 복잡한 문제 해결에 적용할 수 있는 것으로 나타났다. 하지만 LLM이 인간 전문가와 유사한 수준의 화학적 이해를 보유하고 있다고 보기는 어려울 것이다. 기존 연구들은 LLM이 화학 데이터를 활용하여 SMILES 문자열을 유효하게 생성하고, 의미 있는 분자 구조 변형을 제안하며, 원하는 물성을 지닌 화합물의 발견 과정에 도움을 준다는 것을 보여주었다. 또한 LLM은 input data를 포맷팅하는데 유연하며 이는 기존의 chemistry-specific generative model의 문제점을 우회할 수 있게 해주었다.


METHOD

Data Set and Representation Learning (Fig - a)

데이터는 ZINC database(2억 3천만개)에서 약 130만 개의 small molecules를 가져와 사용하였다. 이때 분자량이 200 daltons미만이면서 질소를 포함하고, 최소 하나 이상의 수소 결합 공여체 또는 수용체를 갖는 small moleules 하위 집단을 사용하였다. (에너지 저장 기술 응용을 위해 양성자 전달을 촉진할 수 있는 분자들을 대상으로 하기 위함)

small molecules의 특징 표현에는 Morgan Fingerprint기반의 카운팅 방식 전략을 활용하였다. fingerprint 벡터 크기는 1024로 설정하였으며, raidus는 2개의 원자로 지정하였다. 모든 분자에 대해 공통 키 목록을 생성한 후, 특정 단편의 분자 내 출현 여부와 공통 키 포함 여부를 기반으로 카운트 방식 지문을 생성하였다.

이후 분자들의 3차원 latent embedding을 생성하기 위해 PCA를 수행하였고 이를 통해 분자들을 연속적인 좌표 공간에 매핑하는 것이 가능해졌다. ( 이렇게 계산된 좌표는 PCA에 사용된 분자들과 유사한 분자들과 강한 연관성이 있음)

PCA 임베딩은 대표적인 partent molecules를 선정하고 시각화를 수행하기 위한 목적으로만 사용되었으며 후속 예측 작업에서는 활용되지 않는다. 그러므로 PCA와 같은 선형 기법만으로도 충분하다.

t-SNE, UMAP과 같은 비선형 차원 축소 기법이 고려될 수 있지만, PCA는 구조가 단순하고 해석이 용이하고 계산 효율성이 높다는 장점이 있어 고차원 데이터를 저차원 공간으로 시각화하는데 적합하다.

PCA 임베딩 공간에서 다양한 분자 집합에 대한 LLM의 성능을 평가하기 위해 K-mean clustering을 적용하여 64개의 parent molecules를 선정하였고( k-mean clustering으로 선정된 64개의 중심점 중에서 가장 가까운 원자를 선택 ), 이렇게 선정된 parent molecules는 LLM을 이용한 분자 변형을 위해 canonical SMILES형태로 표현하였다. 임베딩은 변형 전후 분자 간의 관계를 정량화하는 용도로만 활용되었다.

LLM Interactions (Fig - b)

SOTA LLM인 Claude 3 Opus 모델을 활용하였다. 모델이 항상 가장 확률이 높은 토큰 출력을 선택하도록 temperature = 0으로 설정하였고 이는 생성 결과의 결정성을 높이고 출력이 보다 집중되도록 하여 무작위성이나 다양성을 줄인다.

최대 토큰 수는 1024로 설정하여 생성되는 출력의 길이를 제한하였다. (설명 없이 SMILES 형태 후보 molecules만 요청했기 때문이다)

LLM은 서로 다른 프롬프트에 따라 64개의 각 parent molecules에 대해 SMILES 형식의 응답을 생성하였다. 생성된 응답은 요청자에게 전달되며 이 후 후처리 과정을 거치게된다.

Prompts

Base Prompts

다음과 같은 시스템 프롬프트를 모델에 제공하였다

You are a chemoinformatis expert that an generate new molecules. Please provide only the Python formatted list of SMILES strings, like [SMILES1, SMILES2, SMILES3] without any additional explanations or text.

추가 정보는 다음 형식으로 제공되었다.

Given the molecule with SMILES representation 'smiles', generate n molecules that are prompt_detail. Respond with just the SMILES strings as elements of a Python list.

이렇게 smiles는 parent molecule의 SMILES로, n은 목표 후보 분자 개수로 설정하였다.

prompt_detail 은 아래 표에서 제시된 기준을 만족하는 분자 10개를 생성하게 하였으며, 이후 모델은 생성된 분자들의 SMILES 문자열을 Python 리스트 형식으로 반환하도록 지시하였다.

프롬프트를 설계하기 위해, Claude 3 Opus 모델을 활용하여 주어진 분자의 SMILES 표현에 대해 약한 변형 또는 대규모 변형을 유도할 수 있는 8개의 서로 다른 프롬프트를 제안하도록 하였다.(prompting for prompts)

Fine prompt : similar molecules라는 표현을 사용
Coarse prompt : completely different molecules라는 표현을 사용

Prompts for Guided Generation

분자의 eletronic structure 변형을 구체적으로 명시하는 보다 정교한 프롬프트를 추가로 고려하였다. (구체적으로, 생성되는 분자에 전자공여기(EDGs) 또는 전자 흡인기(EWGs)를 포함하도록 요구하였다.)

이는 자연어를 통해 세부 조건을 직접 표현할 수 있다는 LLM 기법 접근법의 중요한 장점을 보여준다.
해당 프롬프트들은 앞서 제시된 fine 기본 프롬프트(A-D)를 기반으로 구성되었으며, 구체적인 내용은 다음과 같다

Prompts for Controlled Molecular Generation

base prompt와 prompts for guided generation과 별도로, 아래 표에서 제시된 세 가지 추가 프롬프트를 고려했다. 이는 주어진 parent molecules와의 유사도 및 분자 변형 정도를 제어할 수 있도록 설계되었다.

해당 프롬프트들은 parent molecule의 SMILES와 비교했을 때의 유사도 수준을 언어적 표현으로 명시하였다.(거의 유사하지 않음 - 매우 낮은 Tanimoto 유사도, 부분적으로 유사함 - 낮은 Tanimoto 유사도, 중간 정도로 유사함 - 중간 수준의 Tanimoto 유사도)

Validation and Metrics

LLM으로부터 후보 SMILES 문자열을 받은 뒤, RDKit을 활용하여 이를 검증하였다.

  1. RDKit의 Chem.MolFromSmiles 와 Chem.SanitizeMol을 순차적으로 적용하여 SMILES 문자열이 유효한 분자를 나타내는지 확인하였다. 이 과정에서 분자 구조의 유효성과 표준 규칙 준수 여부를 검사한다.
  2. 이후 유효한 분자들은 canonicalform으로 변환되었고 canonical SMILES에 대해 추가적인 필터링을 수행하여 중복을 제거하고, 생성된 분자 집합에 변형되지 않은 parent molecule이 포함된 겨우 이를 제외하였다. (생성된 분자 목록에는 유효하고 고유한 SMILES만 남도록 하였으며, 평가 지표 계산 시에도 이들만을 고려하였다.)

이후 generate molecules는 다음 세가지 지표로 평가한다.

Tanimoto Similarity

각 프롬프트에 대해 parents와 children(generate molecule) 간의 Tanimoto similarity를 계산하였다.

각 SMILES 문자열을 분자 객체로 변환한 후, 1024 크기 벡터 및 radius가 2인 원자를 갖는 해시 기반 Morgan fingerprint를 생성하고, 두 fingerprint간의 Tanimoto similarity를 산출하였다.

특정 프롬프트에 대한 Tanimoto similarity T(cp,cg)T(c_p,c_g)는 parent molecule과 generate molecule의 Hash Morgan fingerprint를 이용해 계산되며, 구조적 특징 유사성을 기반으로 두 분자 간의 변화를 수치화한다. 이는 프롬프트가 generate molecule과 parent molecule 사이의 구조적 변화 규모에 미치는 영향을 정량적으로 나타낸다.

Validity Ratio

v=NvalidNgenv = \frac{N_{valid}}{N_{gen}}
  • NvalidN_{valid} : generate molecules 중 유효하고 중복되지 않는 분자 수 (except parent molecule)
  • NgenN_{gen} : 필터링 및 검증 이전에 LLM이 생성한 전체 SMILES 수

이 비율은 주어진 입력 조건에서 화학적으로 유효하고 새로운 구조를 생성하는 모델의 효율성을 나타내며, 이상적으로는 1에 가까울수록 바람직하다.

Chemical Diversity

δchem=11N(N1)i=1Nj=i+1NT(ci,cj)\delta_{chem} = 1 - \frac{1}{N(N-1)}\sum^N_{i=1}\sum^N_{j=i+1}T(c_i,c_j)
  • NN : 계산에 포함된 분자 수

필터링 및 검증을 거친 유효하고 고유한 생성 분자들 간의 이질성을 정량화하는 지표이다.

δchem\delta_{chem}의 특정 값에 대한 절대적인 선호 기준은 존재하지 않으며, 이는 탐색과 활용 간의 균형 문제가 존재하기 때문이다. δchem\delta_{chem} 값이 매우 낮으면 생성된 분자들이 거의 동일하여 의미 있는 변형이 이루어지지 않았음을 의미하고, 반대로 값이 지나치게 높으면 생성된 분자들이 서로 지나치게 상이하여 구조적 변형의 의미적 연관성이 낮아짐을 의미한다.


RESULTS AND DISCUSSION

Representative Examples

프롬프트 A ~ D까지는 parent molecule의 골격을 유지하면서 작용기에 작은 변화를 주는 방식으로, parent molecule와 유사하지만 미세한 차이를 보이는 자식 분자들을 생성하였다. 반면 E ~ H는 작용기와 골격 연결성 측면에서 parent molecule과 차이를 보이는 child molecule을 생성하였다. 하지만 분자의 크기가 비정상적으로 커지거나, 특이한 원소 또는 비현실적인 작용기가 포함되는 등의 비합리적인 변화는 나타나지 않았다.

프롬프트 D의 하위 프롬프트로 생성된 분자

두 parent molecules의 경우 각 각 생성된 10개의 children molecule는 RDKit 검증 결과 유효한 분자로 확인되었다.

프롬프트 D의 경우, LLM은 backbone을 분자의 중심 구조로 해석하여 해당 부분은 변경하지 않는 경향을 보였다. 대신 parent moleule (a)에서는 오른쪽 메틸기 부분에, (c)에서는 왼쪽 부분에 작용기를 추가하는 방식으로 변형이 이루어졌다.

특히 (c)의 경우, 부피가 큰 고리 구조가 추가되기도 했으며, 왼쪽의 카보닐기가 일부 제거되는 경우도 과날되었다. 이는 LLM이 해당 카보닐기를 항상 '주 골격'의 일부로 해석하지 않았기 때문으로 보인다.

Molecular Fingerprint Latent Space

LLM이 분자 구조를 변형할 때의 behavior를 quantify하기 위해 Morgan fingerprint를 기반으로 분자의 잠재공간 임베딩을 생성하였다. 이 임베딩은 각 분자를 quantitiative feature vetor로 표현하는 3차원 좌표 z를 제공한다.

  • latent dimension 1 : 값이 낮을수록 unconjugated rings, 높을수록 conjugated rings와 관련이 있는 것으로 보인다.
  • latent dimension 2 : 고리 구조의 빈도와 관련 있으며, 값이 낮을수록 선형 또는 사슬형 분자, 높을수록 고리 구조를 포함한 분자가 분포한다.
  • latent dimension 3 : 케톤 작용기의 영향을 크게 받으며, 값이 높은 분자들은 두 개 이상의 해당 작용기를 포함하는 경향을 보인다.

Base Prompt Performance

1. Tanimoto Similarity

Fine prompt가 Coarse prompt보다 전반적으로 더 높은 유사도를 보였다.

이 결과는 "similar molecules"라는 표현보다 "completely different molecules"라는 표현이 더 큰 구조적 변형을 유도함을 보여준다.

다만, 변형의 정도는 각 하위 프롬프트의 구체적인 지시 방식에 따라 달라졌으며, 이는 프롬프트 엔지니어링의 중요성을 보여준다

Fine PromptCorase Prompt
prompt B : 중앙값 0.69(가장 높음)
prompt A , C, D : 각 각 0.67, 0.68, 0.67
prompt F, G : 중앙값 0.009 (가장 낮음)
prompt H : 중앙값 0.10
prompt E : 중앙값 0.37 (예외적으로 높음)

prompt E가 높은 이유는 "atoms or bonds"라는 표현이 전체 구조 변화가 아닌 국소적 변형을 암시하기 때문으로 해석된다.

A~D그룹과 F~H 그룹 내에서는 매우 다른 표현을 사용했음에도 유사도 값이 거의 비슷하게 나타났다. 이는 변형의 규모를 나타내는 표현과 실제 변형 방식이 서로 독립적으로 작용할 수 있음을 시사한다.

2. Validity Ratio

대부분 프롬프트에서 중앙값 0.9 이상으로 나타났으며, 이는 화학적으로 유효하고 부모와 다른 고유 분자를 높은 비율로 생성했음을 의미한다.

이는 GAN 및 VAE 기반 generative model의 낮은 validity ratio(best 0.25)와 대조적이다. 또한 기존 generative model은 mode collapse 문제로 인해 고유 분자 생성 비율이 약 2%에 불과한 한계를 보였다.

LLM 기반 방법은 별도의 파인튜닝 없이 더 많은 유효,고유 분자를 안정적으로 생성하였으며 이는 GNN 결합 transformer, 조건부 transformer 등 기존 분자 생성 프레임워크의 대안이 될 수 있음을 시사한다.

당연하겠지만 Fine prompt는 작은 국소 변형만 허용하므로 구조적 제약이 커지므로 유효성 비율이 낮고 Coarse prompt는 완전히 다른 분자를 생성하도록 하여, 이미 화학적으로 타당한 구조를 선택하기 쉬워진다.

Validity Ratio 저하의 원인

  • SMILES 표현의 이산적 특성
  • LLM의 hallucination 현상
  • zero-shot 환경의 높은 난이도
  • parent SMIELS 복사
  • 중복 분자 생성

3. Chemical Diversity

우리는 Coarse prompt가 Fine prompt보다 더 높은 다양성을 유도함을 볼 수 있다. 이는 더 큰 구조 변형이 더 높은 다양성으로 이어진다는 경향과 이리하며 유사한 프롬프트 내에서도 분자들이 충분한 구조적 변이를 보여 mode collapse가 발생하지 않음을 확인한다.

즉, 프롬프트가 유도하는 화학공간 탐색 경로는 같은 범주의 프롬프트 내에서도 서로 다른 구조적 특징을 가진 분자들을 생성한다.

Evaluating Bias

각 하위 프롬프트의 behaivor를 면밀히 평가하기 위해, 잠재공간 z내에서 parent molecule과 child molecule 사이의 평균 변위를 제시한다. 위 이미지에서 parent molecule에서 child molecule로의 평균적인 이동을 화살표로 나타내었다.

여러 child molecule이 모든 방향으로 동일한 확률로 생성된다면 집단적 방향 변화는 0에 가까워야 하므로, 이러한 평균 이동을 일종의 bias로 간주하였다. 따라서 이상적인 결과는 길이가 거의 0에 가까운 화살표이며, 이는 분자 변형 방향이 완전히 무작위적임을 의미한다.

Fine prompt와 Coarse prompt를 비교하면, latent dimension 내 이동 규모에서 뚜렷한 차이를 보임을 확인할 수 있다. 또한 두 프롬프트 범주 내 개별 프롬프트들을 살펴보면, 각 프롬프트 고유의 경향성과 패턴이 존재함을 확인할 수 있다.

E, F, G, H 중에서도 E는 F, G, H에 비해 방향성이 작게 나타났다.(해당 프롬프트들이 화학공간을 탐색하거나 분자 변형을 수행하는 방식에 차이가 존재한다.) 특히 F와 G는 오른쪽 상단에 위치한 분자들을 생성하는 경향을 보였다. 이는 화학공간의 특정 영역에서 프롬프트 지시사항을 보다 효율적으로 만족시키는 경향 또는 선호도가 존재함을 의미한다.

H와 E의 이동 패턴을 보면 'significant structural changes'를 요구하는 H는 E보다 더 강한 방향성과 편향을 보였지만, F와 G만큼 집중적이지 않았다. 이는 특정 영역에 집중하기보다 여러 영역을 동시에 탐색하기 때문이다. 이러한 공격적이고 다방향적인 이동은 프롬프트에서 강조된 대규모 분자 변형 요구에서 비롯된 것으로 해석된다.

또한 분자들의 시작 위치와 이동경로를 살펴보면 흥미로운 패턴이 관찰된다. 일부 분자는 latent dimension의 하단 영역에서 시작하여 점차 위쪽으로 이동하며 여러 방향으로 분산되는 경향을 보인다. 하단 영역은 선형 및 사슬형 분자들이 주로 분포하며 위쪽은 고리 구조를 가진 분자들의 비중이 증가한다. 이러한 사슬 구조에서 고리 구조로의 전이는 명확한 목표 없이 프롬프트만을 기반으로 화학공간을 탐색하거나 활용하는 언어모델의 특성에서 비롯된 것으로 해석된다.

A~D 및 E에서는 부모 분자의 방향 변화를 나타내는 화살표들이 서로 상쇄되는 흥미로운 현상이 나타났다.

이러한 결과는 프롬프트로 엔지니어링이 latent dimension에서의 분자 진화를 정교하게 조절할 수 있음을 보여주었고 다양한 프롬프트 요구 조건에 따라 분자 구조를 적응적으로 변화시키는 모델의 능력을 입증한다.

Guided Generation

프롬프트 I ~ L 및 M ~ P는 이전 프롬프트들보다 화학적으로 더 구체적인 지시를 포함하며, parent molecule에 EWGs 또는 EDGs를 도입한 변형 분자를 생성하도록 설계되었다.

프롬프트 I ~ L 및 M ~ P 모두 parent molecule과 골격이 유사하면서, 지시된 EWGs 또는 EDGs를 child molecule에 도입하였고 프롬프트 지시사항을 크게 벗어나는 결과는 나타나지 않았다.

EDG 프롬프트의 경우, 해당 메틸기는 예상대로 아민기, 메톡시기, 알코올기 등 전자 밀도가 높은 작용기로 치환되었으며 EWG 프롬프트에서는 유사한 변형 경향이 나타났지만, 카복실산기, 에스터기, 니트릴기, 플루오린 포함 작용기 처럼 보다 복잡한 작용기들이 도입되었다.

Controlled Molecular Generation Performance

위 이미지를 보면 LLM은 프롬프트에 포함된 서술적 키워드를 효과적으로 구분하여 유사성 수준을 조절할 수 있음을 보여준다

  • barely similar : 매우 낮은 Tanimoto similarity(0.09)
  • marginally similar : 낮은 Tanimoto similarity(0.37)
  • moderately similar : 중간 수준의 Tanimoto similarity(0.63)

기본 프롬프트 A-D의 중앙값 Tanimoto similarity는 0.67 ~ 0.69 범위였다. 따라서 제어 프롬프트 Q, R, S는 프롬프트 내 키워드에 기반하여 parent molecule과의 유사성 수준을 정량적으로 조절할 수 있음을 보여준다.


CCONCLUSION

이 연구는 parent molecule의 SMILES 문자열 표현을 변형하는 방식을 통해 LLM의 분자 설계 역량을 탐구하였다. Claude 3 Opus가 프롬프트 형태의 지시사항에 따라 분자를 생성하고, 구조를 변형할 수 있음을 확인하였고 출력 중 97%가 부모 분자와 다른 화학적으로 유효한 분자로 나타났다.

또한 저차원 잠재공간에서 분자 변화를 정량화하여 프롬프트에 따른 LLM의 behavior를 평가하였다.

LLM은 간단한 서술형 프롬프트만으로 parent molecule과의 유사성 수준을 조절하였으며 자연어 기반의 간단한 지시를 통해 분자의 전자구조를 효과적으로 조절하였다.

이는 모델이 전자구조와 관련된 구체적 지시를 이해하고 이에 반응할 수 있음을 보여주며, 생성 분자의 물성을 목표에 맞게 정밀하게 제어할 수 있는 가능성을 제시한다.

0개의 댓글