AI 블랙박스 왜 중요한가?

penclicker·2025년 6월 1일

AI 모의해킹

목록 보기
2/5

Intro

우리는 요새 많은 AI 시스템과 서비스를 많이 접해지고 있다. ChatGPT 모먼트가 나온후, 여러 사람들이 Manual Search Engine (Google, Naver, 등) 을 하지 않고 ChatGPT로 모든것을 물어보고, 대화하고 일상생활에 많이 스며 들었다고 생각을 한다.

이러한 좋은 AI 환경을 보안에서도 활용이 가능하다. 예를들어서 우리가 어떠한 데이터를 AI 모델에 던져주었을때, AI가 코드를 분석하고 해당 코드는 "High Risk"라거나 "False Positive" 라는 대답을 받을수 있다.

허나 우리는 어떻게 AI가 해당 코드를 보고 "High Risk" 혹은 "False Postivie"라는 결론에 도달했는지 알수가 없다.

AI는 굉장히 복잡한 뉴럴 네트워크등으로 이루어져있다. 이러한 Inner Process가 굉장히 복잡해 우리가 추측으로도 어떻게 해당 AI가 어떠한 결과를 어떻게 도출해냈는지 알길이 없다.

AI 모델 특히 딥러닝 네트워크 경우, 수백만개의 패러미터와 레이어가 존재하며 이러한 수백만개의 패러미터와 레이어를 이해해야 AI가 어떠한 답을 도출해냈는지 알수있기 때문에 사람으로서는 쉽게 어떻게 AI가 해당결과를 도출해 냈는지 알기 쉽지 않을것이다.

Why Does It Matter

  1. 신뢰와 검증
    보안에서 시스템이 특정 결정을 내린 이유를 이해할 필요가 있다. 시스템이 과연 Legit한 Threat을 발견했는지 아니면 과연 이 Threat이 편향된 데이터셋으로 인해 잘못된 Threat을 감지한것인지 알 수 있어야 한다.

  2. 적대적 공격
    여러 공격자들이 블랙 박스의 특성을 이용해 악의적인 입력 데이터를 생성하여 AI시트템을 속여 잘못된 결정을 만들수 있게 한다. 모델이 어떻게 작동하는지 알지 못하면 방어하기가 훨씬 더 어려워진다

  3. 데이터 오염
    훈련 데이터가 손상이 되면, 블랙 박스 모델은 악성 패턴들을 학습할 수 있다.

  4. 편향과 공정성
    AI 모델은 훈련 데이터에서 편향을 물려받을 수 있으며, 이로 인해 불공정하거나 차별적인 결과가 발생할 수 있다.

Example

멀웨어 디텍션을 한번 예시로 들어볼수있다. 만약 AI가 어떠한것을 멀웨어로 flag 했을경우, 우리는 왜 이러한것을 flag했는지 이유를 모른다. 과연 이것이 소스코드의 흐름에서 악성코드 패턴을 감지한것인지 어떠한것이 해당 Alert를 트리거 했는지 우리는 알수가 없기 때문이다.

What Should We Do?

요즘 많은 AI 서비스나 시스템 모델들이 대부분 블랙박스 환경을 제공한다. 물론 요새는 DeepSeek처럼 어떻게 해당 결과를 도출했는지 알려주는 AI모델들도 많이 나오는 추새지만 여러 AI들이 블랙박스형식으로 나온다는것은 무시할수 없는점이다.

그렇다면 우리는 어떠한 형식으로 질문을 해볼수 있을까?

우리는 다음과 같은 형식으로 질문을 해볼수 있다.

  1. 왜 그 결과가 만들어 진건지
  2. 어떻게 그 결과가 만들어 진건지
  3. AI 모델이 해당 질문으로 트레이닝 된 데이터는 무엇인지

물론 위의 질문들을 한다고 정확하게 Inner Layer들을 알수는 없지만 그래도 적어도 우리가 Black Box 형식에서 어느정도 벗어날수 있다는 점인거 같다.

profile
Security Researcher | Penetration Tester (모든 포스트는 안전한 보안을 위한 모의해킹 방법론입니다. 안전한 보안을 만드는것을 지향합니다.)

0개의 댓글