AI 모델의 발달과 함께 해당 모델의 능력을 기반으로, 단순히 다음 단어 생성이 아닌 RAG나 AI AGENT를 통해 하나의 작업 프로세스가 만들어지고 있습니다.
해당 내용에선 RAG, AI AGENT를 포함된 하나의 프로세스로써 LLMops에서의 Security에 대해서 다루겠습니다.
→ 복잡성이 증가하면서 효용도 증가하는 만큼 위험 지형도 크게 확장됩니다.
이를 보호하기 위해 기존 보안 고려 사항 뿐 아니라,
에서 비롯되는 고유 취약점들에 대해서도 대비해야 합니다.
해당 내용은 2-1. 개인정보 보호, 2-2. 데이터 입력 경로와 신뢰 경계, 2-3. 데이터 포이즈닝 으로 설명하겠습니다.
(모델 관점)
LLMOps에서 사용하는 모델은 많은 양의 코퍼스(corpus)를 사전학습하거나 파운데이션 모델을 기반으로 특정 Task에 맞게 파인튜닝 등을 합니다.
위와같은 학습 과정에서 Sensitive Information이 들어갈 수 있고 그것들은 별다른 조치없이 평문으로 들어가게 된다면, LLM이 응답 시 개인정보가 포함된 응답을 하는 등 개인정보 유출이 발생하게 될 수 있습니다.

특히 어플리케이션에 내장된 LLM 같은 경우에 개인정보 관련 문제가 부각될 수 있습니다.
https://genai.owasp.org/llmrisk/llm022025-sensitive-information-disclosure/
해결책
(에이전트 관점)
에이전트 시스템 관점에서도 DB, API, 사용자 입력 등을 통해 다양한 민감 데이터와 상호작용 해서 다음과 같은 방법으로 민감 데이터를 보호합니다.
LLM 학습 데이터부터 RAG기반 DB, AIAGENT 동적 판단 내용까지 여러지점에서 데이터 주입되고 LLM은 그 데이터를 바탕으로 답변 생성합니다,
주입받는 데이터 형태도 색context, Agent 판단 근거, 운영 과정의 평가 dataset, finetuning dataset까지 다양합니다.
여기서 문제는 모델 자체는 주입받는 데이터의 출처와 무결성을 스스로 판단하는 능력이 없다는 점입니다.
어떤 데이터든 학습 데이터나 context로 주어지면 처리해서 그럴싸한 답변을 생성하게 됩니다.

오답이나 편향된 데이터가 들어가거나 오래되어 정보로써의 가치가 떨어진 정보가 들어가거나, 악성 지시문이 섞인 문서가 들어가게 된다면, LLM은 잘못된 출력을 하거나 시스템에 문제가 되는 행위를 하게 됩니다.
앞선 입력받는 데이터들에 대한 문제점을 데이터 포이즈닝으로 정리할 수 있습니다.

데이터 포이즈닝을 Rag를 기반으로 설명

데이터 포이즈닝 관점에서는 문서 수집 시 악성 지시문이 포함된 오염된 문서가 수집되어 데이터 오염이 발생할 수 있습니다. 또한 임베딩 단계에서는 벡터 왜곡, 즉 유사도가 조작된 문서가 삽입되어 TOP-K 이내에 걸리게 될 수 있습니다
https://arxiv.org/abs/2402.07867?ref=blog.aibox.today

악성 테스트(P)를 만드는 과정
→ Posioned Rag 논문 사례를 통해 오염된 문서 삽입과 임베딩 유사도 제어 부분을 확인할 수 있음
적대적 공격: 행위자가 모델을 조작해 민감 정보 유출 혹은 부정확, 편향된 출력을 생성하도록 하는 공격
프롬프트를 조작해서 모델이 데이터를 유출하거나, 허가되지 않은 작업을 수행하거나, 미리 설정된 제약 조건을 무시하도록 유도하는 공격 기법
예시)

사용자가 인위적으로 프롬프트를 조작하여 AI 모델에 내장된 보안 정책, 윤리적 제약, 콘텐츠 필터링을 우회하고 원래 허용되지 않은 답변을 이끌어내는 공격 기법


에이전트가 처리하는 외부 데이터(웹페이지, 이메일, 파일 안)에 악성 내용(지시어)을 숨겨 두었다가 해당 텍스트가 모델의 프롬프트로 불러와질 때 의도하지 않은 동작을 유발시키는 공격 기법
