26Z05d

Young-Kyoo Kim·2026년 8월 4일

운영팀이 단순히 ArgoCD, Jenkins, Nexus 등 CI/CD 플랫폼 도구만 관리(Platform Operations)하는 수준을 넘어, 운영 환경(Production) 배포 파이프라인의 실행, 배포 승인/검증, 배포 실패 시 롤백(Rollback), 서비스 검증까지 직접 책임지는 배포 운영(Release & Deployment Management)을 전담하게 된다면, CI/CD & DevOps 도메인의 공수는 대폭 증가하게 됩니다.

1,000노드 / 5클러스터 Data Lakehouse 환경 기준으로, 배포 책임까지 전담할 때 추가되는 세부 Task와 공수 반영 수치를 정밀하게 산정해 드립니다.


1. 배포 책임(Release Management) 전담 시 추가되는 핵심 Task

운영 환경 배포를 직접 책임지면 다음 5가지 영역의 업무가 새롭게 추가되거나 대폭 확대됩니다.

  1. 배포 승인 및 변경 관리 (Change Management):
  • 폐쇄망 환경 특성상 배포 전 보안 검수, 변경 요청서(CR) 승인, 배포 체크리스트 확인.
  1. 운영 환경 배포 작업 직접 수행 (Release Execution):
  • 정기/비정기 배포 시 ArgoCD Sync 승인, Canary/Blue-Green 배포 진행 상태 모니터링.
  • Spark/Trino/Airflow 등 Data Lakehouse Batch/Streaming Job 배포 시 데이터 파이프라인 영향도 확인.
  1. 배포 후 건강 상태 검증 (Post-Deployment Verification):
  • 배포 직후 Pod Status, Metrics, Error Log, Health Check Endpoint 모니터링.
  1. 장애 발생 시 롤백 수행 (Emergency Rollback):
  • 배포 실패 또는 이상 감지 시 이전 Helm Chart Revision / Git Commit으로 즉시 Rollback 및 이슈 핫픽스(Hotfix) 파이프라인 가동.
  1. 야간/주말 배포 유지보수 지원 (Off-Hours Deployment):
  • 서비스 영향도를 최소화하기 위해 주중 야간(22시 이후) 또는 주말에 진행되는 정기 배포 수행.

2. 추가 Task별 정량적 공수 산정 (1,000노드 / 5클러스터 기준)

Task ID세부 Task 항목연간 발생 건수 (Volume)건당 평균 소요시간연간 총 소요시간 (Hours)
DOP-01~06기존 DevOps & Air-Gap 파이프라인 플랫폼 관리(기존 수치)(기존 수치)2,460 시간
DEP-01[신규] 운영 환경 변경 요청(CR) 검수 및 배포 승인 절차 수행주 5회 (연 250회)1 시간250 시간
DEP-02[신규] 운영 환경 K8s App / Helm 배포 실행 및 모니터링주 4회 (연 200회)3 시간600 시간
DEP-03[신규] Data Lakehouse 파이프라인 (Spark/Airflow Job) 배포주 2회 (연 100회)2 시간200 시간
DEP-04[신규] 야간/주말 정기 배포 수행 및 배포 후 Health Check연 48 회 (주 1회)4 시간192 시간
DEP-05[신규] 배포 실패 시 긴급 Rollback 및 Hotfix 파이프라인 수행연 36 회4 시간144 시간
DEP-06[신규] Canary / Progressive Delivery (Argo Rollouts) 정책 튜닝연 24 회6 시간144 시간
소계DevOps, CI/CD & 배포 운영 통합 영역3,990 시간 (2.49 FTE)

3. 도메인별 공수 및 FTE 변화 비교

운영 환경 배포 책임을 포함함에 따라 DevOps 도메인의 순수 공수가 기존 2,460시간에서 3,990시간으로 약 +1,530시간(+62%) 폭증하며, 전체 인력 산정에 다음과 같이 반영됩니다.

구분플랫폼 도구만 운영 시 (기존)운영 환경 배포 책임 포함 시 (변경)공수 및 인원 변화
DevOps & CI/CD 공수2,460 시간 (1.54 FTE)3,990 시간 (2.49 FTE)+1,530 시간 (+0.95 FTE)
전체 pure workload 합계12,948 시간 (8.10 FTE)14,478 시간 (9.05 FTE)+1,530 시간 (+0.95 FTE)
DevOps 도메인 전담 인원2 명 (정/부)3 명+1 명 증원
전체 추천 인원 (R&R 기준)13~15 명14~16 명+1 명 증원

4. 경영진 보고 및 제안사 협상 적용 논리

  1. DevOps 영역 인원 1명 증원의 정당성 확보:
  • 단순 CI/CD 도구 관리에서 "운영 환경 배포 및 Rollback 책임"까지 범위가 확장되었으므로, DevOps 팀 인원을 기존 2명(정/부)에서 3명으로 1명(약 1,500시간 공수) 추가 배치하는 것이 논리적으로 완벽히 정당화됩니다.
  1. 배포 승인/실행 공수의 객관적 증명:
  • 연간 200회 이상의 운영 배포, 야간 배포(연 48회), 긴급 롤백(연 36회)에 들어가는 정량적 시간(1,530시간)을 수식으로 제시함으로써 "운영 배포를 담당하므로 사람이 더 필요하다"는 제안사의 주장을 약 1명(+1 FTE) 수준으로 깔끔하게 캡(Cap)을 씌워 제한할 수 있습니다.
  1. 전체 인력 수렴 수치:
  • 배포 책임이라는 큰 업무가 추가되었음에도 불구하고, 1,000노드 기준 전체 상주 SM 인력은 14~16명 선에서 완벽히 커버 가능함을 입증할 수 있습니다. (제안사의 25~36명 요구는 여전히 2배 가까운 과다 산정임)

==

HW/OS 물리 유지보수를 제외하고, DevOps/SRE 플랫폼 엔지니어링 전담 영역에 집중하여 각 도메인별 세부 Task를 세분화하여 정리했습니다.

기준 규모는 노드 1,000대 / 클러스터 5개 (폐쇄망, AIStor S3, Cilium eBPF, GitOps) 환경입니다.


💡 1인당 가용시간 산정 기준 (기본 전제)

  • 1인 연간 총 근무시간: 2,000시간 (주 40시간 ×\times 50주)
  • 실가용률 (Net Availability): 80% (휴가, 교육, 회의, 문서화, 피크타임 대응 등 20% 제외)
  • 1인 연간 실가용시간 (Net Work Hours): 1,600시간 (2,000h×0.82,000 \text{h} \times 0.8)

1. K8s Platform Operations (컨트롤 플레인 & 코어 컴포넌트)

Task ID세부 Task 항목연간 발생 건수 (Volume)건당 평균 소요시간연간 총 소요시간 (Hours)
K8S-01K8s Major/Minor 버전 업그레이드 (클러스터당 연 2회)10 회24 시간240 시간
K8S-02Worker Node OS Rolling Reboot 및 Kubelet 패치 검증1,000 대 ×\times 연 2회0.5 시간1,000 시간
K8S-03Control Plane (etcd, API Server, Controller) 튜닝 및 백업/복구 테스트월 2회 ×\times 5개 Cluster8 시간96 시간
K8S-04Custom Resource Definition (CRD) 및 Admission Webhook 관리/검증연 36 회8 시간288 시간
K8S-05K8s Core 장애 대응 (Node NotReady, OOM, PBD/Eviction 이슈 조치)주 3회 (연 150회)4 시간600 시간
K8S-06Multi-Cluster Topology 및 Federation / Ingress Controller 관리월 2회 ×\times 5개 Cluster6 시간120 시간
K8S-07Namespace 생성, Quota/LimitRange 설정 및 Multi-tenancy Isolation 관리주 2회 (연 100회)2 시간200 시간
K8S-08Container Runtime (containerd) & CGroup v2 이슈 분석 및 튜닝연 24 회6 시간144 시간
소계Kubernetes Platform Domain2,688 시간 (1.68 FTE)

2. Cilium eBPF Network & Security

Task ID세부 Task 항목연간 발생 건수 (Volume)건당 평균 소요시간연간 총 소요시간 (Hours)
CIL-01Cilium CNI 버전 업그레이드 및 Kernel 호환성 검증5개 Cluster ×\times 연 2회16 시간160 시간
CIL-02eBPF Map Size 튜닝 및 Connection Tracking (Conntrack) 최적화연 24 회8 시간192 시간
CIL-03Cilium Network Policy (L3/L4/L7) 작성, 검증 및 감사 대응주 2회 (연 100회)3 시간300 시간
CIL-04BGP Control Plane / MetalLB 라우팅 설정 및 Top-of-Rack(ToR) 스위치 연동 협조연 24 회6 시간144 시간
CIL-05Hubble Observability 튜닝 및 네트워크 병목/패킷 드롭 트러블슈팅주 2회 (연 100회)4 시간400 시간
CIL-06Service Mesh (Cilium Envoy-based) / Gateway API 정책 관리연 36 회6 시간216 시간
소계Cilium Network Domain1,412 시간 (0.88 FTE)

3. AIStor (S3 Object Storage) Operations

Task ID세부 Task 항목연간 발생 건수 (Volume)건당 평균 소요시간연간 총 소요시간 (Hours)
AIS-01AIStor Storage Pool 증설 및 NVMe/SAS 노드 신규 편입/Decommission분기 1회 ×\times 10개 Pool16 시간640 시간
AIS-02Erasure Coding Set 튜닝, Healing Process 및 Scanner 트래픽 모니터링주 2회 (연 100회)6 시간600 시간
AIS-03S3 Lifecycle Policy (ILM, Tiering to Cold/Tape) 수립 및 모니터링월 2회 (연 24회)8 시간192 시간
AIS-04S3 Bucket 생성, Quota, Access Key / IAM Policy 및 Cross-Region Replication 관리주 3회 (연 150회)2 시간300 시간
AIS-05S3 Performance Optimization (TTFB, IOPS, High-throughput Read/Write 분석)연 36 회10 시간360 시간
AIS-06Disk Degraded / Quorum Loss 발생 시 S3 Data Integrity 및 Rebalancing 검증주 1회 (연 50회)8 시간400 시간
AIS-07AIStor Binary/Operator 업그레이드 및 MinIO Vendor Technical Escalation연 12 회16 시간192 시간
소계AIStor Storage Domain2,684 시간 (1.68 FTE)

4. DevOps, GitOps & Air-Gapped Pipeline

Task ID세부 Task 항목연간 발생 건수 (Volume)건당 평균 소요시간연간 총 소요시간 (Hours)
DOP-01ArgoCD Application / App-of-Apps 구조 설계 및 Cluster Sync 관리5개 Cluster ×\times 주 1회4 시간1,040 시간
DOP-02Helm Chart 표준 패키징, Versioning 및 Helm Repository (Nexus/Harbor) 관리주 2회 (연 100회)4 시간400 시간
DOP-03[폐쇄망] 외부 Container Image / Helm Chart 보안 검수 및 Air-Gap 반입 승인주 3회 (연 150회)2 시간300 시간
DOP-04Private Registry (Nexus/Harbor) Storage Cleanup, Garbage Collection & Garbage Image 삭제월 2회 (연 24회)6 시간144 시간
DOP-05CI/CD Runner / Pipeline (Argo Workflows / Jenkins) 템플릿 관리 및 최적화연 48 회6 시간288 시간
DOP-06Infrastructure as Code (AWX / Ansible Playbook, Terraform) 작성 및 관리연 36 회8 시간288 시간
소계DevOps & GitOps Domain2,460 시간 (1.54 FTE)

5. Security, Auth & Compliance (Vault / Keycloak / AD)

Task ID세부 Task 항목연간 발생 건수 (Volume)건당 평균 소요시간연간 총 소요시간 (Hours)
SEC-01Vault Cluster 운영, Unseal Key / Root Token 관리 & PKI Engine (Cert-Manager) 관리연 36 회8 시간288 시간
SEC-02Keycloak Realm / Client 관리, AD/LDAP 연동 및 SSO Authentication 유지보수연 48 회6 시간288 시간
SEC-03Vault Agent / Secret Injection 튜닝 및 Application Secret Rotation주 2회 (연 100회)2 시간200 시간
SEC-04K8s RBAC (Role, ClusterRole, ServiceAccount) 생성 및 접근 권한 승인/감사주 4회 (연 200회)1 시간200 시간
SEC-05Kyverno / OPA Policy 작성 및 이미지 서명 (Cosign) 검증 정책 유지보수연 24 회8 시간192 시간
SEC-06폐쇄망 보안 감사 (Audit Log 분석, 취약점 스캔, 보안 조치 요구사항 이행)분기 1회 (연 4회)40 시간160 시간
소계Security & Auth Domain1,328 시간 (0.83 FTE)

6. Observability & Data Platform Infrastructure Support

Task ID세부 Task 항목연간 발생 건수 (Volume)건당 평균 소요시간연간 총 소요시간 (Hours)
OBS-01Kube-Prometheus-Stack, Thanos Cluster 유지보수 및 Compactor 튜닝월 2회 (연 24회)8 시간192 시간
OBS-02OpenSearch / Vector 로그 파이프라인 관리, Index Lifecycle Management (ISM) 튜닝주 1회 (연 50회)6 시간300 시간
OBS-03Grafana Dashboard 작성, Alertmanager Rule 설정 및 False Alert (오알람) 튜닝주 2회 (연 100회)4 시간400 시간
OBS-04APM (OpenTelemetry Operator) Collector 배포 및 Tracing Pipeline 관리연 24 회8 시간192 시간
OBS-05[Lakehouse 지원] Spark / Trino / Iceberg Operator 인프라 이슈 지원 (K8s 수준)주 2회 (연 100회)4 시간400 시간
소계Observability & Data Support Domain1,484 시간 (0.93 FTE)

7. Architecture, Enablement & Escalation (공통 영역)

Task ID세부 Task 항목연간 발생 건수 (Volume)건당 평균 소요시간연간 총 소요시간 (Hours)
ARC-01L3 중대 장애 (SEV-1/2) 분석, Post-mortem 작성 및 근본 원인 (RCA) 보고연 12 회16 시간192 시간
ARC-02Runbook / SOP (표준 운영 절차서) 작성 및 폐쇄망 지식베이스 업데이트주 1회 (연 50회)4 시간200 시간
ARC-03개발팀 / 데이터팀 대상 플랫폼 사용 가이드 교육 및 Tech Q&A 대응주 2회 (연 100회)2 시간200 시간
ARC-04신규 데이터센터 / 클러스터 확장 아키텍처 검토 및 Vendor 정기 리뷰 회의주 1회 (연 50회)6 시간300 시간
소계Architecture & Enablement Domain892 시간 (0.56 FTE)

📊 종합 요약 (1,000노드 / 5클러스터 기준)

도메인 영역연간 총 순수 업무시간 (Hours)순수 필요 FTE (Hours / 1,600h)R&R 정/부 (Primary/Secondary) 최소 인원
1. K8s Platform2,688 시간1.68 명2 명
2. Cilium Network1,412 시간0.88 명2 명 (백업 강제)
3. AIStor Storage2,684 시간1.68 명2 명
4. DevOps / GitOps2,460 시간1.54 명2 명
5. Security & Auth1,328 시간0.83 명2 명 (백업 강제)
6. Observability1,484 시간0.93 명2 명 (백업 강제)
7. Architecture & Lead892 시간0.56 명1 명 (총괄 1명)
순수 Workload 합계12,948 시간8.10 명13 명
Slack Factor (20%)연차/휴가/병가/비상대응+1.62 명(R&R 최소 인원에 흡수 가능)
최종 추천 산출 인원Work-Hours 기반 9.7명 \rightarrow R&R 안전율 적용 시 13~15명****

💡 핵심 시사점

  1. Work-Hours 기반 순수 공수: 1,000노드/5클러스터 환경의 pure workload는 연간 약 12,948시간 (순수 8.1 FTE, 여유율 반영 시 약 10명)입니다.
  2. R&R 정/부(SPOF 방지) 이중화 고려 시: 7개 도메인에 대한 정/부 백업 체계를 완전하게 가동하려면 최소 13~15명이 도출됩니다.
  3. 제안사 대응 카드: 노드가 1,000대 수준일 때 제안사가 25~36명을 요구하는 것은 실제 발생할 수 있는 업무시간(12,948시간)의 3배 이상을 과다 청구하고 있음을 이 세부 Task 표로 증명할 수 있습니다.

0개의 댓글