객관식

류동훈·2026년 6월 19일

지능형영상처리 기말 모의 객관식 (40문항)

출력 크기 공식: Hout=(Hin+2pk)/s+1H_{out}=\lfloor (H_{in}+2p-k)/s\rfloor+1


I. 신경망 기초 (1~4)

1. 퍼셉트론에서 편향(bias)을 도입하는 기하학적 이유로 옳은 것은?
① 기울기를 0으로 만들기 위해
② 결정 경계(직선)가 원점을 벗어날 수 있게 하기 위해
③ 출력을 항상 양수로 만들기 위해
④ 가중치 수를 줄이기 위해

정답 ② — 편향이 없으면 결정 직선이 항상 원점을 지남. 편향으로 자유 이동 가능.

2. 활성화 함수가 전혀 없는 다층 신경망에 대한 설명으로 옳은 것은?
① 은닉층이 많을수록 표현력이 무조건 증가한다
② 단층(선형) 신경망과 수학적으로 동일하다
③ 기울기 소실이 발생하지 않는다
④ 분류 문제에서 가장 성능이 좋다

정답 ② — 선형 변환의 합성은 결국 하나의 선형층과 같음.

3. 다음 중 하이퍼파라미터가 아닌 것은?
① 학습률 ② 은닉층 노드 개수 ③ 결합 가중치 ww ④ 미니배치 크기

정답 ③ww는 학습 대상=파라미터. 나머지는 사람이 정하는 하이퍼파라미터.

4. 뉴런의 가중합 zz를 바르게 나타낸 것은?
z=xiwi+bz=\sum x_i w_i + b
z=xiwiz=\prod x_i w_i
z=(xiwi)z=\sum (x_i - w_i)
z=max(xiwi)z=\max(x_i w_i)

정답 ① — 가중합 z=xiwi+bz=\sum x_i w_i + b, 이후 y^=g(z)\hat{y}=g(z).


II. 활성화 함수 (5~8)

5. 시그모이드 함수의 식으로 옳은 것은?
11+ez\dfrac{1}{1+e^{z}}11+ez\dfrac{1}{1+e^{-z}}ezezez+ez\dfrac{e^z-e^{-z}}{e^z+e^{-z}}max(0,z)\max(0,z)

정답 ②p=1/(1+ez)p=1/(1+e^{-z}). ③은 tanh, ④는 ReLU.

6. tanh 함수에 대한 설명으로 옳은 것은?
① 출력 범위가 0~1이다
② 출력의 평균이 0이라 은닉층에서 sigmoid보다 유리하다
③ 미분이 불가능하다
④ 입력이 음수면 항상 0을 출력한다

정답 ② — tanh: 범위 -1~1, 평균 0 → 은닉층에서 유리.

7. ReLU가 sigmoid·tanh보다 기울기 소실에 강한 이유는?
① 출력이 항상 1이기 때문
② 양의 구간에서 기울기가 1로 유지되어 1 이하 값의 연속 곱이 줄기 때문
③ 미분이 불가능하기 때문
④ 출력 범위가 -1~1이기 때문

정답 ② — sigmoid/tanh는 양끝 기울기가 0에 가깝고 1 이하 값이 누적 곱해짐.

8. 스텝(step) 함수가 현대 딥러닝 학습에 부적합한 가장 큰 이유는?
① 계산이 느려서
② 0에서 미분이 불가능해 역전파를 할 수 없어서
③ 출력이 음수라서
④ 채널 수를 바꾸기 때문

정답 ② — 0에서 미분 불가 → 역전파 불가 → sigmoid로 근사.


III. 손실함수 (9~10)

9. 이미지 다중 분류 모델의 출력층 함수와 손실 함수 조합으로 일반적인 것은?
① Linear + MSE
② Sigmoid + MSE
③ Softmax + Cross Entropy
④ ReLU + BCE

정답 ③ — 다중 분류 = Softmax + Cross Entropy.

10. Softmax + Cross Entropy 조합에서 출력 y^\hat{y}에 대한 손실의 기울기 dL/dydL/dy는?
y^y\hat{y}\cdot yy^y\hat{y}-yyy^2y-\hat{y}^2log(y^)\log(\hat{y})

정답 ② — 깔끔한 결과 dL/dy=y^ydL/dy=\hat{y}-y (암기). 부호 주의.


IV. 최적화 알고리즘 (11~14)

11. 최근 대부분의 딥러닝 모델에서 가장 많이 쓰이는 최적화 알고리즘은?
① 순수 SGD ② AdaGrad ③ Adam ④ 모든 경우의 수 탐색

정답 ③ — Adam이 최근 표준.

12. Adam의 일반적인 기본 하이퍼파라미터로 옳은 것은?
β1=0.5, β2=0.5\beta_1=0.5,\ \beta_2=0.5
β1=0.9, β2=0.999\beta_1=0.9,\ \beta_2=0.999
β1=0.999, β2=0.9\beta_1=0.999,\ \beta_2=0.9
β1=1, β2=1\beta_1=1,\ \beta_2=1

정답 ②β1=0.9, β2=0.999\beta_1=0.9,\ \beta_2=0.999, 학습률 0.001~0.0001.

13. SGD + Momentum의 속도 갱신식으로 옳은 것은? (μ\mu: 모멘텀 계수)
vt=μvt1+Lv_t = \mu v_{t-1} + \nabla L
vt=Lμvt1v_t = \nabla L - \mu v_{t-1}
vt=μLv_t = \mu \nabla L
vt=vt1v_t = v_{t-1}

정답 ①vt=μvt1+Lv_t=\mu v_{t-1}+\nabla L, θθηvt\theta\leftarrow\theta-\eta v_t.

14. 기본 경사하강법의 가중치 갱신식으로 옳은 것은? (η\eta: 학습률)
ww+ηE/ww \leftarrow w + \eta\,\partial E/\partial w
wwηE/ww \leftarrow w - \eta\,\partial E/\partial w
wηww \leftarrow \eta\,w
wwE/ηw \leftarrow w - \partial E/\partial \eta

정답 ②wnew=woldηE/ww_{new}=w_{old}-\eta\,\partial E/\partial w.


V. 가중치 초기화 (15~16)

15. ReLU 활성화 함수에 권장되는 가중치 초기화와 표준편차는?
① Xavier, 1/n\sqrt{1/n}
② He, 2/n\sqrt{2/n}
③ He, 1/n\sqrt{1/n}
④ Xavier, 2/n\sqrt{2/n}

정답 ② — He = ReLU용, 2/n\sqrt{2/n}.

16. sigmoid·tanh 계열에 권장되는 초기화 방법은?
① He ② Xavier ③ Zero ④ One

정답 ② — Xavier = sigmoid·tanh용(1/n\sqrt{1/n}).


VI. CNN 기초 (17~23)

17. 입력 28×28, 커널 3×3, stride=2, padding=1일 때 출력 한 변의 크기는?
① 13 ② 14 ③ 26 ④ 28

정답 ②(28+23)/2+1=13+1=14\lfloor(28+2-3)/2\rfloor+1=13+1=14.

18. 입력 32×32, 커널 5×5, stride=1, padding=0일 때 출력 한 변의 크기는?
① 26 ② 27 ③ 28 ④ 32

정답 ③(32+05)/1+1=27+1=28\lfloor(32+0-5)/1\rfloor+1=27+1=28.

19. 입력 채널 32, 3×3 필터 64개인 합성곱층의 파라미터(편향 포함) 수는?
① 576 ② 640 ③ 18,496 ④ 2,048

정답 ③(3×3×32+1)×64=289×64=18496(3\times3\times32+1)\times64=289\times64=18496.

20. 제로 패딩(zero padding)의 주된 목적은?
① 채널 수를 늘리기 위해
② 합성곱 연산 후 이미지 크기를 유지하기 위해
③ 특징 추출 성능을 직접 높이기 위해
④ 파라미터 수를 줄이기 위해

정답 ② — 패딩 목적 = 크기 유지(특징 강화 ✗).

21. 풀링(pooling) 연산에 대한 설명으로 옳은 것은?
① 채널 수를 늘린다
② 채널 수는 그대로 두고 공간 크기만 줄인다
③ 가중치를 학습한다
④ 패딩과 동일한 연산이다

정답 ② — 풀링: 채널 불변, 크기만 축소, 학습 파라미터 없음.

22. 합성곱층에서 필터(커널)의 개수가 결정하는 것은?
① 입력 채널 수 ② 출력 채널 수 ③ 커널 크기 ④ 스트라이드

정답 ② — 필터 개수 = 출력 채널 수 (MLP 뉴런 수 역할).

23. 마지막 풀링 출력이 7×7×64일 때 Flatten 후 벡터의 길이는?
① 64 ② 448 ③ 3,136 ④ 4,096

정답 ③7×7×64=31367\times7\times64=3136.


VII. 배치 정규화 · 규제화 (24~27)

24. 배치 정규화(BN)의 연산 순서로 옳은 것은?
① 정규화 → 평균 → 분산 → 스케일·시프트
② 평균 μB\mu_B → 분산 σB2\sigma_B^2 → 정규화 x^\hat{x} → 스케일·시프트 γx^+β\gamma\hat{x}+\beta
③ 스케일·시프트 → 정규화 → 평균 → 분산
④ 분산 → 평균 → 스케일·시프트 → 정규화

정답 ② — 평균 → 분산 → 정규화 → 스케일·시프트.

25. 배치 정규화 식 yi=γx^i+βy_i=\gamma\hat{x}_i+\beta에서 γ,β\gamma,\beta는?
① 미니배치 평균과 분산
② 학습 가능한 파라미터(스케일·시프트)
③ 고정 상수 1과 0
④ 입력 픽셀 값

정답 ②γ,β\gamma,\beta=학습 파라미터 / μB,σB2\mu_B,\sigma_B^2는 배치 통계량.

26. 배치 정규화는 일반적으로 어디에 배치하는가?
① 입력층 바로 앞
② Affine/Conv 직후, 활성화 함수 직전
③ Softmax 직후
④ 손실 함수 계산 후

정답 ② — 활성화 입력 분포를 평균0·분산1로 맞추기 위해 활성화 직전.

27. 드롭아웃(dropout)에 대한 설명으로 옳은 것은?
① 추론(예측) 시에도 노드를 무작위로 끈다
② 학습 시 무작위로 노드를 비활성화하고, 추론 시에는 모든 노드를 사용한다
③ 가중치를 0으로 초기화하는 기법이다
④ 합성곱층에서만 쓸 수 있다

정답 ② — 학습 시 랜덤 비활성화, 추론 시 전체 노드 사용.


VIII. 고급 CNN 모델 (28~31)

28. ResNet의 스킵 연결(skip connection)의 효과로 옳은 것은?
① 파라미터를 0으로 만든다
② 역전파를 쉽게 해 기울기 소실을 완화하고 깊은 신경망을 가능하게 한다
③ 채널 수를 항상 절반으로 줄인다
④ 활성화 함수를 제거한다

정답 ② — 스킵 연결로 역전파 용이 → 기울기 소실 완화 → 깊은 망 가능.

29. VGGNet의 특징으로 옳은 것은?
① 모든 Conv가 7×7 필터를 사용
② 모든 Conv는 3×3 필터·stride 1, 모든 풀링은 2×2·stride 2 사용
③ 풀링을 전혀 쓰지 않음
④ 활성화 함수로 sigmoid를 사용

정답 ② — VGG: 3×3 conv·stride1, 2×2 pool·stride2.

30. AlexNet이 LeNet-5에서 개선한 핵심 사항은?
① 활성화 함수로 ReLU를 도입해 기울기 소실 문제를 완화
② 합성곱을 제거
③ 전결합층만 사용
④ 배치 정규화를 최초로 도입

정답 ① — AlexNet: ReLU 도입으로 기울기 소실 완화.

31. Inception(인셉션) 모듈의 핵심 아이디어는?
① 1×1 커널만 사용
② 서로 다른 크기의 필터·풀링을 한꺼번에 적용하고 결과를 합침
③ 풀링을 두 번 연속 적용
④ 스킵 연결로만 구성

정답 ② — 여러 크기 필터·풀링을 모두 구현해 합침.


IX. 하이퍼파라미터 · 학습 (32~33)

32. 과적합(overfitting)의 원인/징후로 옳은 것은?
① 데이터 표본이 부족하거나 모델 파라미터가 과다할 때 발생
② 학습률이 항상 0일 때만 발생
③ 활성화 함수를 쓰면 항상 발생
④ 풀링층이 많을수록 반드시 발생

정답 ① — 데이터 부족 / 파라미터 과다 → 과적합.

33. 입력 데이터 정규화(평균 빼고 표준편차로 나눔)의 목적은?
① 채널 수를 늘리기 위해
② 경사하강법에서 경사 방향이 안정되어 학습 속도가 빨라지게 하기 위해
③ 출력 클래스 수를 맞추기 위해
④ 파라미터 수를 늘리기 위해

정답 ② — 정규화로 경사 방향 안정 → 학습 속도 향상.


X. 전이학습 (34~35)

34. 전이학습(transfer learning)에 대한 설명으로 옳은 것은?
① 데이터 없이 모델을 만드는 기법
② 다른 사람이 큰 데이터로 학습한 모델의 파라미터를 출발점으로 삼아, 적은 데이터로 새 문제를 푸는 기법
③ 모델을 처음부터 학습시키는 기법
④ 가중치를 모두 0으로 초기화하는 기법

정답 ② — 사전학습 모델을 출발점으로, 적은 데이터로 새 문제 해결.

35. 전이학습의 "미세조정(fine-tuning)" 방식에 대한 설명으로 옳은 것은?
① 모든 층을 동일한 높은 학습률로 학습
② 사전 학습된 부분은 낮은 학습률로 풀어 학습하고, 추가된 층은 상대적으로 높은 학습률로 학습
③ 사전 학습된 부분을 완전히 고정하고 절대 바꾸지 않음
④ 분류기를 제거하고 아무것도 추가하지 않음

정답 ② — 사전학습부=낮은 학습률, 추가층=높은 학습률.


XI. 객체 탐지 (36~38)

36. 이미지 분류와 객체 탐지(object detection)의 차이로 옳은 것은?
① 객체 탐지는 클래스만 예측한다
② 객체 탐지는 클래스 + 물체의 위치(경계 박스)를 함께 예측한다
③ 이미지 분류는 위치까지 예측한다
④ 둘은 완전히 동일하다

정답 ② — 객체 탐지 = 클래스 + 위치(경계 박스).

37. 비최대 억제(NMS)의 목적으로 옳은 것은?
① 클래스 수를 늘린다
② 같은 물체에 대해 겹치는 중복 박스를 제거한다
③ 이미지 해상도를 높인다
④ 활성화 함수를 교체한다

정답 ② — NMS = 중복 박스 제거 (IoU로 중첩 판단).

38. 단일 단계 탐지기(YOLO·SSD)와 2단계 탐지기(R-CNN 계열)의 비교로 옳은 것은?
① 단일 단계가 항상 더 정확하다
② 단일 단계는 빠르고 간단하지만 성능이 소폭 하락할 수 있다
③ 2단계는 ROI 추출 없이 동작한다
④ R-CNN은 단일 단계 탐지기다

정답 ② — 단일 단계: 빠르고 간단하나 성능 소폭 하락. R-CNN 계열은 2단계.


XII. GAN (39~40)

39. GAN의 구성과 학습 방식으로 옳은 것은?
① 생성자(G) 하나로만 구성, 지도 학습
② 생성자(G)와 판별자(D)가 적대적으로 경쟁하며 학습
③ 판별자(D)만으로 구성
④ 정답 레이블이 반드시 필요하다

정답 ② — G와 D의 적대적 학습. GAN은 정답 레이블 불필요.

40. GAN의 생성자(G)가 일반적인 분류 CNN과 다른 점은?
① 합성곱을 쓰지 않는다
② 풀링 대신 업샘플(업스케일)로 이미지 크기를 키운다
③ 활성화 함수가 없다
④ 출력이 클래스 레이블이다

정답 ② — G는 풀링 대신 업샘플로 크기 확대. D는 일반 CNN 분류기.


📌 자주 틀리는 함정 모음

  • 출력 크기: 마지막 +1stride로 나누기를 빠뜨리기 쉬움.
  • 파라미터 수: 입력 채널 CinC_{in} 곱하기와 편향 +1 둘 다 누락 주의.
  • 풀링 vs Conv: 풀링은 채널 불변, Conv는 채널 변함.
  • He vs Xavier: He=ReLU(2/n\sqrt{2/n}), Xavier=sigmoid(1/n\sqrt{1/n}).
  • BN의 γ,β\gamma,\beta(학습 파라미터) vs μB,σB2\mu_B,\sigma_B^2(배치 통계량) 구분.
  • softmax+CE 기울기: y^y\hat{y}-y (부호 주의).
profile
AI를 좋아하고 공부하는 대학생

0개의 댓글