출력 크기 공식:
1. 퍼셉트론에서 편향(bias)을 도입하는 기하학적 이유로 옳은 것은?
① 기울기를 0으로 만들기 위해
② 결정 경계(직선)가 원점을 벗어날 수 있게 하기 위해
③ 출력을 항상 양수로 만들기 위해
④ 가중치 수를 줄이기 위해
정답 ② — 편향이 없으면 결정 직선이 항상 원점을 지남. 편향으로 자유 이동 가능.
2. 활성화 함수가 전혀 없는 다층 신경망에 대한 설명으로 옳은 것은?
① 은닉층이 많을수록 표현력이 무조건 증가한다
② 단층(선형) 신경망과 수학적으로 동일하다
③ 기울기 소실이 발생하지 않는다
④ 분류 문제에서 가장 성능이 좋다
정답 ② — 선형 변환의 합성은 결국 하나의 선형층과 같음.
3. 다음 중 하이퍼파라미터가 아닌 것은?
① 학습률 ② 은닉층 노드 개수 ③ 결합 가중치 ④ 미니배치 크기
정답 ③ — 는 학습 대상=파라미터. 나머지는 사람이 정하는 하이퍼파라미터.
4. 뉴런의 가중합 를 바르게 나타낸 것은?
①
②
③
④
정답 ① — 가중합 , 이후 .
5. 시그모이드 함수의 식으로 옳은 것은?
① ② ③ ④
정답 ② — . ③은 tanh, ④는 ReLU.
6. tanh 함수에 대한 설명으로 옳은 것은?
① 출력 범위가 0~1이다
② 출력의 평균이 0이라 은닉층에서 sigmoid보다 유리하다
③ 미분이 불가능하다
④ 입력이 음수면 항상 0을 출력한다
정답 ② — tanh: 범위 -1~1, 평균 0 → 은닉층에서 유리.
7. ReLU가 sigmoid·tanh보다 기울기 소실에 강한 이유는?
① 출력이 항상 1이기 때문
② 양의 구간에서 기울기가 1로 유지되어 1 이하 값의 연속 곱이 줄기 때문
③ 미분이 불가능하기 때문
④ 출력 범위가 -1~1이기 때문
정답 ② — sigmoid/tanh는 양끝 기울기가 0에 가깝고 1 이하 값이 누적 곱해짐.
8. 스텝(step) 함수가 현대 딥러닝 학습에 부적합한 가장 큰 이유는?
① 계산이 느려서
② 0에서 미분이 불가능해 역전파를 할 수 없어서
③ 출력이 음수라서
④ 채널 수를 바꾸기 때문
정답 ② — 0에서 미분 불가 → 역전파 불가 → sigmoid로 근사.
9. 이미지 다중 분류 모델의 출력층 함수와 손실 함수 조합으로 일반적인 것은?
① Linear + MSE
② Sigmoid + MSE
③ Softmax + Cross Entropy
④ ReLU + BCE
정답 ③ — 다중 분류 = Softmax + Cross Entropy.
10. Softmax + Cross Entropy 조합에서 출력 에 대한 손실의 기울기 는?
① ② ③ ④
정답 ② — 깔끔한 결과 (암기). 부호 주의.
11. 최근 대부분의 딥러닝 모델에서 가장 많이 쓰이는 최적화 알고리즘은?
① 순수 SGD ② AdaGrad ③ Adam ④ 모든 경우의 수 탐색
정답 ③ — Adam이 최근 표준.
12. Adam의 일반적인 기본 하이퍼파라미터로 옳은 것은?
①
②
③
④
정답 ② — , 학습률 0.001~0.0001.
13. SGD + Momentum의 속도 갱신식으로 옳은 것은? (: 모멘텀 계수)
①
②
③
④
정답 ① — , .
14. 기본 경사하강법의 가중치 갱신식으로 옳은 것은? (: 학습률)
①
②
③
④
정답 ② — .
15. ReLU 활성화 함수에 권장되는 가중치 초기화와 표준편차는?
① Xavier,
② He,
③ He,
④ Xavier,
정답 ② — He = ReLU용, .
16. sigmoid·tanh 계열에 권장되는 초기화 방법은?
① He ② Xavier ③ Zero ④ One
정답 ② — Xavier = sigmoid·tanh용().
17. 입력 28×28, 커널 3×3, stride=2, padding=1일 때 출력 한 변의 크기는?
① 13 ② 14 ③ 26 ④ 28
정답 ② — .
18. 입력 32×32, 커널 5×5, stride=1, padding=0일 때 출력 한 변의 크기는?
① 26 ② 27 ③ 28 ④ 32
정답 ③ — .
19. 입력 채널 32, 3×3 필터 64개인 합성곱층의 파라미터(편향 포함) 수는?
① 576 ② 640 ③ 18,496 ④ 2,048
정답 ③ — .
20. 제로 패딩(zero padding)의 주된 목적은?
① 채널 수를 늘리기 위해
② 합성곱 연산 후 이미지 크기를 유지하기 위해
③ 특징 추출 성능을 직접 높이기 위해
④ 파라미터 수를 줄이기 위해
정답 ② — 패딩 목적 = 크기 유지(특징 강화 ✗).
21. 풀링(pooling) 연산에 대한 설명으로 옳은 것은?
① 채널 수를 늘린다
② 채널 수는 그대로 두고 공간 크기만 줄인다
③ 가중치를 학습한다
④ 패딩과 동일한 연산이다
정답 ② — 풀링: 채널 불변, 크기만 축소, 학습 파라미터 없음.
22. 합성곱층에서 필터(커널)의 개수가 결정하는 것은?
① 입력 채널 수 ② 출력 채널 수 ③ 커널 크기 ④ 스트라이드
정답 ② — 필터 개수 = 출력 채널 수 (MLP 뉴런 수 역할).
23. 마지막 풀링 출력이 7×7×64일 때 Flatten 후 벡터의 길이는?
① 64 ② 448 ③ 3,136 ④ 4,096
정답 ③ — .
24. 배치 정규화(BN)의 연산 순서로 옳은 것은?
① 정규화 → 평균 → 분산 → 스케일·시프트
② 평균 → 분산 → 정규화 → 스케일·시프트
③ 스케일·시프트 → 정규화 → 평균 → 분산
④ 분산 → 평균 → 스케일·시프트 → 정규화
정답 ② — 평균 → 분산 → 정규화 → 스케일·시프트.
25. 배치 정규화 식 에서 는?
① 미니배치 평균과 분산
② 학습 가능한 파라미터(스케일·시프트)
③ 고정 상수 1과 0
④ 입력 픽셀 값
정답 ② — =학습 파라미터 / 는 배치 통계량.
26. 배치 정규화는 일반적으로 어디에 배치하는가?
① 입력층 바로 앞
② Affine/Conv 직후, 활성화 함수 직전
③ Softmax 직후
④ 손실 함수 계산 후
정답 ② — 활성화 입력 분포를 평균0·분산1로 맞추기 위해 활성화 직전.
27. 드롭아웃(dropout)에 대한 설명으로 옳은 것은?
① 추론(예측) 시에도 노드를 무작위로 끈다
② 학습 시 무작위로 노드를 비활성화하고, 추론 시에는 모든 노드를 사용한다
③ 가중치를 0으로 초기화하는 기법이다
④ 합성곱층에서만 쓸 수 있다
정답 ② — 학습 시 랜덤 비활성화, 추론 시 전체 노드 사용.
28. ResNet의 스킵 연결(skip connection)의 효과로 옳은 것은?
① 파라미터를 0으로 만든다
② 역전파를 쉽게 해 기울기 소실을 완화하고 깊은 신경망을 가능하게 한다
③ 채널 수를 항상 절반으로 줄인다
④ 활성화 함수를 제거한다
정답 ② — 스킵 연결로 역전파 용이 → 기울기 소실 완화 → 깊은 망 가능.
29. VGGNet의 특징으로 옳은 것은?
① 모든 Conv가 7×7 필터를 사용
② 모든 Conv는 3×3 필터·stride 1, 모든 풀링은 2×2·stride 2 사용
③ 풀링을 전혀 쓰지 않음
④ 활성화 함수로 sigmoid를 사용
정답 ② — VGG: 3×3 conv·stride1, 2×2 pool·stride2.
30. AlexNet이 LeNet-5에서 개선한 핵심 사항은?
① 활성화 함수로 ReLU를 도입해 기울기 소실 문제를 완화
② 합성곱을 제거
③ 전결합층만 사용
④ 배치 정규화를 최초로 도입
정답 ① — AlexNet: ReLU 도입으로 기울기 소실 완화.
31. Inception(인셉션) 모듈의 핵심 아이디어는?
① 1×1 커널만 사용
② 서로 다른 크기의 필터·풀링을 한꺼번에 적용하고 결과를 합침
③ 풀링을 두 번 연속 적용
④ 스킵 연결로만 구성
정답 ② — 여러 크기 필터·풀링을 모두 구현해 합침.
32. 과적합(overfitting)의 원인/징후로 옳은 것은?
① 데이터 표본이 부족하거나 모델 파라미터가 과다할 때 발생
② 학습률이 항상 0일 때만 발생
③ 활성화 함수를 쓰면 항상 발생
④ 풀링층이 많을수록 반드시 발생
정답 ① — 데이터 부족 / 파라미터 과다 → 과적합.
33. 입력 데이터 정규화(평균 빼고 표준편차로 나눔)의 목적은?
① 채널 수를 늘리기 위해
② 경사하강법에서 경사 방향이 안정되어 학습 속도가 빨라지게 하기 위해
③ 출력 클래스 수를 맞추기 위해
④ 파라미터 수를 늘리기 위해
정답 ② — 정규화로 경사 방향 안정 → 학습 속도 향상.
34. 전이학습(transfer learning)에 대한 설명으로 옳은 것은?
① 데이터 없이 모델을 만드는 기법
② 다른 사람이 큰 데이터로 학습한 모델의 파라미터를 출발점으로 삼아, 적은 데이터로 새 문제를 푸는 기법
③ 모델을 처음부터 학습시키는 기법
④ 가중치를 모두 0으로 초기화하는 기법
정답 ② — 사전학습 모델을 출발점으로, 적은 데이터로 새 문제 해결.
35. 전이학습의 "미세조정(fine-tuning)" 방식에 대한 설명으로 옳은 것은?
① 모든 층을 동일한 높은 학습률로 학습
② 사전 학습된 부분은 낮은 학습률로 풀어 학습하고, 추가된 층은 상대적으로 높은 학습률로 학습
③ 사전 학습된 부분을 완전히 고정하고 절대 바꾸지 않음
④ 분류기를 제거하고 아무것도 추가하지 않음
정답 ② — 사전학습부=낮은 학습률, 추가층=높은 학습률.
36. 이미지 분류와 객체 탐지(object detection)의 차이로 옳은 것은?
① 객체 탐지는 클래스만 예측한다
② 객체 탐지는 클래스 + 물체의 위치(경계 박스)를 함께 예측한다
③ 이미지 분류는 위치까지 예측한다
④ 둘은 완전히 동일하다
정답 ② — 객체 탐지 = 클래스 + 위치(경계 박스).
37. 비최대 억제(NMS)의 목적으로 옳은 것은?
① 클래스 수를 늘린다
② 같은 물체에 대해 겹치는 중복 박스를 제거한다
③ 이미지 해상도를 높인다
④ 활성화 함수를 교체한다
정답 ② — NMS = 중복 박스 제거 (IoU로 중첩 판단).
38. 단일 단계 탐지기(YOLO·SSD)와 2단계 탐지기(R-CNN 계열)의 비교로 옳은 것은?
① 단일 단계가 항상 더 정확하다
② 단일 단계는 빠르고 간단하지만 성능이 소폭 하락할 수 있다
③ 2단계는 ROI 추출 없이 동작한다
④ R-CNN은 단일 단계 탐지기다
정답 ② — 단일 단계: 빠르고 간단하나 성능 소폭 하락. R-CNN 계열은 2단계.
39. GAN의 구성과 학습 방식으로 옳은 것은?
① 생성자(G) 하나로만 구성, 지도 학습
② 생성자(G)와 판별자(D)가 적대적으로 경쟁하며 학습
③ 판별자(D)만으로 구성
④ 정답 레이블이 반드시 필요하다
정답 ② — G와 D의 적대적 학습. GAN은 정답 레이블 불필요.
40. GAN의 생성자(G)가 일반적인 분류 CNN과 다른 점은?
① 합성곱을 쓰지 않는다
② 풀링 대신 업샘플(업스케일)로 이미지 크기를 키운다
③ 활성화 함수가 없다
④ 출력이 클래스 레이블이다
정답 ② — G는 풀링 대신 업샘플로 크기 확대. D는 일반 CNN 분류기.
+1과 stride로 나누기를 빠뜨리기 쉬움.+1 둘 다 누락 주의.