운영팀이 단순히 ArgoCD, Jenkins, Nexus 등 CI/CD 플랫폼 도구만 관리(Platform Operations)하는 수준을 넘어, 운영 환경(Production) 배포 파이프라인의 실행, 배포 승인/검증, 배포 실패 시 롤백(Rollback), 서비스 검증까지 직접 책임지는 배포 운영(Release & Deployment Management)을 전담하게 된다면, CI/CD & DevOps 도메인의 공수는 대폭 증가하게 됩니다.
1,000노드 / 5클러스터 Data Lakehouse 환경 기준으로, 배포 책임까지 전담할 때 추가되는 세부 Task와 공수 반영 수치를 정밀하게 산정해 드립니다.
1. 배포 책임(Release Management) 전담 시 추가되는 핵심 Task
운영 환경 배포를 직접 책임지면 다음 5가지 영역의 업무가 새롭게 추가되거나 대폭 확대됩니다.
- 배포 승인 및 변경 관리 (Change Management):
- 폐쇄망 환경 특성상 배포 전 보안 검수, 변경 요청서(CR) 승인, 배포 체크리스트 확인.
- 운영 환경 배포 작업 직접 수행 (Release Execution):
- 정기/비정기 배포 시 ArgoCD Sync 승인, Canary/Blue-Green 배포 진행 상태 모니터링.
- Spark/Trino/Airflow 등 Data Lakehouse Batch/Streaming Job 배포 시 데이터 파이프라인 영향도 확인.
- 배포 후 건강 상태 검증 (Post-Deployment Verification):
- 배포 직후 Pod Status, Metrics, Error Log, Health Check Endpoint 모니터링.
- 장애 발생 시 롤백 수행 (Emergency Rollback):
- 배포 실패 또는 이상 감지 시 이전 Helm Chart Revision / Git Commit으로 즉시 Rollback 및 이슈 핫픽스(Hotfix) 파이프라인 가동.
- 야간/주말 배포 유지보수 지원 (Off-Hours Deployment):
- 서비스 영향도를 최소화하기 위해 주중 야간(22시 이후) 또는 주말에 진행되는 정기 배포 수행.
2. 추가 Task별 정량적 공수 산정 (1,000노드 / 5클러스터 기준)
| Task ID | 세부 Task 항목 | 연간 발생 건수 (Volume) | 건당 평균 소요시간 | 연간 총 소요시간 (Hours) |
|---|
| DOP-01~06 | 기존 DevOps & Air-Gap 파이프라인 플랫폼 관리 | (기존 수치) | (기존 수치) | 2,460 시간 |
| DEP-01 | [신규] 운영 환경 변경 요청(CR) 검수 및 배포 승인 절차 수행 | 주 5회 (연 250회) | 1 시간 | 250 시간 |
| DEP-02 | [신규] 운영 환경 K8s App / Helm 배포 실행 및 모니터링 | 주 4회 (연 200회) | 3 시간 | 600 시간 |
| DEP-03 | [신규] Data Lakehouse 파이프라인 (Spark/Airflow Job) 배포 | 주 2회 (연 100회) | 2 시간 | 200 시간 |
| DEP-04 | [신규] 야간/주말 정기 배포 수행 및 배포 후 Health Check | 연 48 회 (주 1회) | 4 시간 | 192 시간 |
| DEP-05 | [신규] 배포 실패 시 긴급 Rollback 및 Hotfix 파이프라인 수행 | 연 36 회 | 4 시간 | 144 시간 |
| DEP-06 | [신규] Canary / Progressive Delivery (Argo Rollouts) 정책 튜닝 | 연 24 회 | 6 시간 | 144 시간 |
| 소계 | DevOps, CI/CD & 배포 운영 통합 영역 | | | 3,990 시간 (2.49 FTE) |
3. 도메인별 공수 및 FTE 변화 비교
운영 환경 배포 책임을 포함함에 따라 DevOps 도메인의 순수 공수가 기존 2,460시간에서 3,990시간으로 약 +1,530시간(+62%) 폭증하며, 전체 인력 산정에 다음과 같이 반영됩니다.
| 구분 | 플랫폼 도구만 운영 시 (기존) | 운영 환경 배포 책임 포함 시 (변경) | 공수 및 인원 변화 |
|---|
| DevOps & CI/CD 공수 | 2,460 시간 (1.54 FTE) | 3,990 시간 (2.49 FTE) | +1,530 시간 (+0.95 FTE) |
| 전체 pure workload 합계 | 12,948 시간 (8.10 FTE) | 14,478 시간 (9.05 FTE) | +1,530 시간 (+0.95 FTE) |
| DevOps 도메인 전담 인원 | 2 명 (정/부) | 3 명 | +1 명 증원 |
| 전체 추천 인원 (R&R 기준) | 13~15 명 | 14~16 명 | +1 명 증원 |
4. 경영진 보고 및 제안사 협상 적용 논리
- DevOps 영역 인원 1명 증원의 정당성 확보:
- 단순 CI/CD 도구 관리에서 "운영 환경 배포 및 Rollback 책임"까지 범위가 확장되었으므로, DevOps 팀 인원을 기존 2명(정/부)에서 3명으로 1명(약 1,500시간 공수) 추가 배치하는 것이 논리적으로 완벽히 정당화됩니다.
- 배포 승인/실행 공수의 객관적 증명:
- 연간 200회 이상의 운영 배포, 야간 배포(연 48회), 긴급 롤백(연 36회)에 들어가는 정량적 시간(1,530시간)을 수식으로 제시함으로써 "운영 배포를 담당하므로 사람이 더 필요하다"는 제안사의 주장을 약 1명(+1 FTE) 수준으로 깔끔하게 캡(Cap)을 씌워 제한할 수 있습니다.
- 전체 인력 수렴 수치:
- 배포 책임이라는 큰 업무가 추가되었음에도 불구하고, 1,000노드 기준 전체 상주 SM 인력은 14~16명 선에서 완벽히 커버 가능함을 입증할 수 있습니다. (제안사의 25~36명 요구는 여전히 2배 가까운 과다 산정임)
==
HW/OS 물리 유지보수를 제외하고, DevOps/SRE 플랫폼 엔지니어링 전담 영역에 집중하여 각 도메인별 세부 Task를 세분화하여 정리했습니다.
기준 규모는 노드 1,000대 / 클러스터 5개 (폐쇄망, AIStor S3, Cilium eBPF, GitOps) 환경입니다.
💡 1인당 가용시간 산정 기준 (기본 전제)
- 1인 연간 총 근무시간: 2,000시간 (주 40시간 × 50주)
- 실가용률 (Net Availability): 80% (휴가, 교육, 회의, 문서화, 피크타임 대응 등 20% 제외)
- 1인 연간 실가용시간 (Net Work Hours): 1,600시간 (2,000h×0.8)
| Task ID | 세부 Task 항목 | 연간 발생 건수 (Volume) | 건당 평균 소요시간 | 연간 총 소요시간 (Hours) |
|---|
| K8S-01 | K8s Major/Minor 버전 업그레이드 (클러스터당 연 2회) | 10 회 | 24 시간 | 240 시간 |
| K8S-02 | Worker Node OS Rolling Reboot 및 Kubelet 패치 검증 | 1,000 대 × 연 2회 | 0.5 시간 | 1,000 시간 |
| K8S-03 | Control Plane (etcd, API Server, Controller) 튜닝 및 백업/복구 테스트 | 월 2회 × 5개 Cluster | 8 시간 | 96 시간 |
| K8S-04 | Custom Resource Definition (CRD) 및 Admission Webhook 관리/검증 | 연 36 회 | 8 시간 | 288 시간 |
| K8S-05 | K8s Core 장애 대응 (Node NotReady, OOM, PBD/Eviction 이슈 조치) | 주 3회 (연 150회) | 4 시간 | 600 시간 |
| K8S-06 | Multi-Cluster Topology 및 Federation / Ingress Controller 관리 | 월 2회 × 5개 Cluster | 6 시간 | 120 시간 |
| K8S-07 | Namespace 생성, Quota/LimitRange 설정 및 Multi-tenancy Isolation 관리 | 주 2회 (연 100회) | 2 시간 | 200 시간 |
| K8S-08 | Container Runtime (containerd) & CGroup v2 이슈 분석 및 튜닝 | 연 24 회 | 6 시간 | 144 시간 |
| 소계 | Kubernetes Platform Domain | | | 2,688 시간 (1.68 FTE) |
2. Cilium eBPF Network & Security
| Task ID | 세부 Task 항목 | 연간 발생 건수 (Volume) | 건당 평균 소요시간 | 연간 총 소요시간 (Hours) |
|---|
| CIL-01 | Cilium CNI 버전 업그레이드 및 Kernel 호환성 검증 | 5개 Cluster × 연 2회 | 16 시간 | 160 시간 |
| CIL-02 | eBPF Map Size 튜닝 및 Connection Tracking (Conntrack) 최적화 | 연 24 회 | 8 시간 | 192 시간 |
| CIL-03 | Cilium Network Policy (L3/L4/L7) 작성, 검증 및 감사 대응 | 주 2회 (연 100회) | 3 시간 | 300 시간 |
| CIL-04 | BGP Control Plane / MetalLB 라우팅 설정 및 Top-of-Rack(ToR) 스위치 연동 협조 | 연 24 회 | 6 시간 | 144 시간 |
| CIL-05 | Hubble Observability 튜닝 및 네트워크 병목/패킷 드롭 트러블슈팅 | 주 2회 (연 100회) | 4 시간 | 400 시간 |
| CIL-06 | Service Mesh (Cilium Envoy-based) / Gateway API 정책 관리 | 연 36 회 | 6 시간 | 216 시간 |
| 소계 | Cilium Network Domain | | | 1,412 시간 (0.88 FTE) |
3. AIStor (S3 Object Storage) Operations
| Task ID | 세부 Task 항목 | 연간 발생 건수 (Volume) | 건당 평균 소요시간 | 연간 총 소요시간 (Hours) |
|---|
| AIS-01 | AIStor Storage Pool 증설 및 NVMe/SAS 노드 신규 편입/Decommission | 분기 1회 × 10개 Pool | 16 시간 | 640 시간 |
| AIS-02 | Erasure Coding Set 튜닝, Healing Process 및 Scanner 트래픽 모니터링 | 주 2회 (연 100회) | 6 시간 | 600 시간 |
| AIS-03 | S3 Lifecycle Policy (ILM, Tiering to Cold/Tape) 수립 및 모니터링 | 월 2회 (연 24회) | 8 시간 | 192 시간 |
| AIS-04 | S3 Bucket 생성, Quota, Access Key / IAM Policy 및 Cross-Region Replication 관리 | 주 3회 (연 150회) | 2 시간 | 300 시간 |
| AIS-05 | S3 Performance Optimization (TTFB, IOPS, High-throughput Read/Write 분석) | 연 36 회 | 10 시간 | 360 시간 |
| AIS-06 | Disk Degraded / Quorum Loss 발생 시 S3 Data Integrity 및 Rebalancing 검증 | 주 1회 (연 50회) | 8 시간 | 400 시간 |
| AIS-07 | AIStor Binary/Operator 업그레이드 및 MinIO Vendor Technical Escalation | 연 12 회 | 16 시간 | 192 시간 |
| 소계 | AIStor Storage Domain | | | 2,684 시간 (1.68 FTE) |
4. DevOps, GitOps & Air-Gapped Pipeline
| Task ID | 세부 Task 항목 | 연간 발생 건수 (Volume) | 건당 평균 소요시간 | 연간 총 소요시간 (Hours) |
|---|
| DOP-01 | ArgoCD Application / App-of-Apps 구조 설계 및 Cluster Sync 관리 | 5개 Cluster × 주 1회 | 4 시간 | 1,040 시간 |
| DOP-02 | Helm Chart 표준 패키징, Versioning 및 Helm Repository (Nexus/Harbor) 관리 | 주 2회 (연 100회) | 4 시간 | 400 시간 |
| DOP-03 | [폐쇄망] 외부 Container Image / Helm Chart 보안 검수 및 Air-Gap 반입 승인 | 주 3회 (연 150회) | 2 시간 | 300 시간 |
| DOP-04 | Private Registry (Nexus/Harbor) Storage Cleanup, Garbage Collection & Garbage Image 삭제 | 월 2회 (연 24회) | 6 시간 | 144 시간 |
| DOP-05 | CI/CD Runner / Pipeline (Argo Workflows / Jenkins) 템플릿 관리 및 최적화 | 연 48 회 | 6 시간 | 288 시간 |
| DOP-06 | Infrastructure as Code (AWX / Ansible Playbook, Terraform) 작성 및 관리 | 연 36 회 | 8 시간 | 288 시간 |
| 소계 | DevOps & GitOps Domain | | | 2,460 시간 (1.54 FTE) |
5. Security, Auth & Compliance (Vault / Keycloak / AD)
| Task ID | 세부 Task 항목 | 연간 발생 건수 (Volume) | 건당 평균 소요시간 | 연간 총 소요시간 (Hours) |
|---|
| SEC-01 | Vault Cluster 운영, Unseal Key / Root Token 관리 & PKI Engine (Cert-Manager) 관리 | 연 36 회 | 8 시간 | 288 시간 |
| SEC-02 | Keycloak Realm / Client 관리, AD/LDAP 연동 및 SSO Authentication 유지보수 | 연 48 회 | 6 시간 | 288 시간 |
| SEC-03 | Vault Agent / Secret Injection 튜닝 및 Application Secret Rotation | 주 2회 (연 100회) | 2 시간 | 200 시간 |
| SEC-04 | K8s RBAC (Role, ClusterRole, ServiceAccount) 생성 및 접근 권한 승인/감사 | 주 4회 (연 200회) | 1 시간 | 200 시간 |
| SEC-05 | Kyverno / OPA Policy 작성 및 이미지 서명 (Cosign) 검증 정책 유지보수 | 연 24 회 | 8 시간 | 192 시간 |
| SEC-06 | 폐쇄망 보안 감사 (Audit Log 분석, 취약점 스캔, 보안 조치 요구사항 이행) | 분기 1회 (연 4회) | 40 시간 | 160 시간 |
| 소계 | Security & Auth Domain | | | 1,328 시간 (0.83 FTE) |
| Task ID | 세부 Task 항목 | 연간 발생 건수 (Volume) | 건당 평균 소요시간 | 연간 총 소요시간 (Hours) |
|---|
| OBS-01 | Kube-Prometheus-Stack, Thanos Cluster 유지보수 및 Compactor 튜닝 | 월 2회 (연 24회) | 8 시간 | 192 시간 |
| OBS-02 | OpenSearch / Vector 로그 파이프라인 관리, Index Lifecycle Management (ISM) 튜닝 | 주 1회 (연 50회) | 6 시간 | 300 시간 |
| OBS-03 | Grafana Dashboard 작성, Alertmanager Rule 설정 및 False Alert (오알람) 튜닝 | 주 2회 (연 100회) | 4 시간 | 400 시간 |
| OBS-04 | APM (OpenTelemetry Operator) Collector 배포 및 Tracing Pipeline 관리 | 연 24 회 | 8 시간 | 192 시간 |
| OBS-05 | [Lakehouse 지원] Spark / Trino / Iceberg Operator 인프라 이슈 지원 (K8s 수준) | 주 2회 (연 100회) | 4 시간 | 400 시간 |
| 소계 | Observability & Data Support Domain | | | 1,484 시간 (0.93 FTE) |
7. Architecture, Enablement & Escalation (공통 영역)
| Task ID | 세부 Task 항목 | 연간 발생 건수 (Volume) | 건당 평균 소요시간 | 연간 총 소요시간 (Hours) |
|---|
| ARC-01 | L3 중대 장애 (SEV-1/2) 분석, Post-mortem 작성 및 근본 원인 (RCA) 보고 | 연 12 회 | 16 시간 | 192 시간 |
| ARC-02 | Runbook / SOP (표준 운영 절차서) 작성 및 폐쇄망 지식베이스 업데이트 | 주 1회 (연 50회) | 4 시간 | 200 시간 |
| ARC-03 | 개발팀 / 데이터팀 대상 플랫폼 사용 가이드 교육 및 Tech Q&A 대응 | 주 2회 (연 100회) | 2 시간 | 200 시간 |
| ARC-04 | 신규 데이터센터 / 클러스터 확장 아키텍처 검토 및 Vendor 정기 리뷰 회의 | 주 1회 (연 50회) | 6 시간 | 300 시간 |
| 소계 | Architecture & Enablement Domain | | | 892 시간 (0.56 FTE) |
📊 종합 요약 (1,000노드 / 5클러스터 기준)
| 도메인 영역 | 연간 총 순수 업무시간 (Hours) | 순수 필요 FTE (Hours / 1,600h) | R&R 정/부 (Primary/Secondary) 최소 인원 |
|---|
| 1. K8s Platform | 2,688 시간 | 1.68 명 | 2 명 |
| 2. Cilium Network | 1,412 시간 | 0.88 명 | 2 명 (백업 강제) |
| 3. AIStor Storage | 2,684 시간 | 1.68 명 | 2 명 |
| 4. DevOps / GitOps | 2,460 시간 | 1.54 명 | 2 명 |
| 5. Security & Auth | 1,328 시간 | 0.83 명 | 2 명 (백업 강제) |
| 6. Observability | 1,484 시간 | 0.93 명 | 2 명 (백업 강제) |
| 7. Architecture & Lead | 892 시간 | 0.56 명 | 1 명 (총괄 1명) |
| 순수 Workload 합계 | 12,948 시간 | 8.10 명 | 13 명 |
| Slack Factor (20%) | 연차/휴가/병가/비상대응 | +1.62 명 | (R&R 최소 인원에 흡수 가능) |
| 최종 추천 산출 인원 | Work-Hours 기반 9.7명 → R&R 안전율 적용 시 13~15명**** | | |
💡 핵심 시사점
- Work-Hours 기반 순수 공수: 1,000노드/5클러스터 환경의 pure workload는 연간 약 12,948시간 (순수 8.1 FTE, 여유율 반영 시 약 10명)입니다.
- R&R 정/부(SPOF 방지) 이중화 고려 시: 7개 도메인에 대한 정/부 백업 체계를 완전하게 가동하려면 최소 13~15명이 도출됩니다.
- 제안사 대응 카드: 노드가 1,000대 수준일 때 제안사가 25~36명을 요구하는 것은 실제 발생할 수 있는 업무시간(12,948시간)의 3배 이상을 과다 청구하고 있음을 이 세부 Task 표로 증명할 수 있습니다.