대규모 Kubernetes 클러스터에서 특정 워크로드의 스케줄링 지연이 발생하거나, 노드 자원 활용률이 불균형하게 나타나는 문제가 지속될 때, 기본 스케줄러의 한계를 극복하고 최적의 스케줄링을 달성하기 위한 방안을 제시해 주십시오. 이에는 커스텀 스케줄러 구현, 스케줄러 확장(Scheduler Extender), 또는 고급 스케줄링 정책(Taints/Tolerations, Node Affinity/Anti-Affinity, PriorityClass)의 복합적인 활용이 포함될 수 있습니다.
힌트 · Kubernetes 스케줄링 파이프라인의 Predicate와 Priority 단계에 대한 이해를 바탕으로, 스케줄러 확장 포인트 활용 또는 Multi-Scheduler 구성 방안, 그리고 QoS 클래스 및 리소스 요청/제한 설정의 중요성을 강조할 수 있습니다.
모범답안
대규모 클러스터에서 스케줄링 지연이나 자원 불균형 문제는 기본 스케줄러의 한계를 보여줍니다. 이를 해결하기 위해 저는 다음과 같은 복합적인 접근 방식을 고려할 것입니다.
먼저, 특정 워크로드의 요구사항이 복잡하거나 고도화된 경우, 커스텀 스케줄러를 구현하여 Predicate 및 Priority 로직을 세밀하게 조정할 수 있습니다. 예를 들어, 특정 하드웨어 가속기 사용이나 복잡한 네트워크 토폴로지 고려가 필요할 때 유용합니다.
또는, 기존 스케줄러의 기능을 확장하는 Scheduler Extender를 활용하여 외부 로직을 통합하는 것도 좋은 방법입니다. 이는 기존 스케줄러를 유지하면서 유연성을 확보할 수 있습니다.
이와 더불어, Taints/Tolerations, Node Affinity/Anti-Affinity, PriorityClass와 같은 고급 스케줄링 정책을 적극적으로 활용하여 워크로드와 노드 간의 관계를 명확히 정의하고, 우선순위를 관리하여 자원 활용률을 최적화할 것입니다. 특히, 특정 워크로드가 특정 노드에만 스케줄링되도록 하거나, 특정 워크로드 간의 격리를 보장하는 데 효과적입니다.
이러한 방안들을 워크로드의 특성과 클러스터 환경에 맞게 조합하여 적용함으로써, 스케줄링 지연을 줄이고 노드 자원 활용률을 균형 있게 개선할 수 있다고 생각합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 Docker / Kubernetes 면접 질문
- Kubernetes Service의 주요 타입(ClusterIP, NodePort, LoadBalancer)을 설명하고, 각각의 타입이 어떤 방식으로 외부 트래픽을 Pod로 라우팅하며, 어떤 상황에 적합한지 비교하여 설명해 주세요.
- Kubernetes 환경에서 애플리케이션의 복잡한 배포, 관리, 운영 라이프사이클을 자동화하기 위해 Custom Resource Definition(CRD)과 Controller를 활용하는 Operator 패턴을 설계하고 구현해야 한다면, 어떤 핵심 구성 요소를 고려하고 어떤 방식으로 애플리케이션의 상태 관리 및 자동 복구를 구현할 것인지 설명해 주십시오.
- MSA 환경에서 Kubernetes 기반의 서비스 메쉬(Service Mesh)를 도입하여 Blue/Green 배포, Canary 배포, A/B 테스트와 같은 고급 트래픽 관리 전략을 구현하려고 합니다. 서비스 메쉬가 이러한 전략들을 어떻게 지원하며, 특히 요청 기반 라우팅(request-based routing) 및 폴트 인젝션(fault injection)과 같은 기능들을 어떻게 활용하여 실제 운영 환경에 적용할 수 있을지 구체적인 시나리오와 함께 설명해 주십시오.
- Kubernetes가 다양한 컨테이너 런타임(Docker, containerd, CRI-O 등)과 상호작용할 수 있도록 하는 Container Runtime Interface(CRI)의 역할과 중요성에 대해 설명하고, 만약 특정 요구사항(예: 보안 강화, 성능 최적화)을 위해 기존 런타임 대신 자체 개발한 커스텀 컨테이너 런타임을 Kubernetes 클러스터에 통합해야 한다면, 어떤 단계를 거쳐야 하며 어떤 기술적 고려사항이 있을지 설명해 주십시오.
- Kubernetes 환경에서 대규모 데이터베이스나 고성능 컴퓨팅(HPC) 워크로드와 같이 I/O 성능이 매우 중요한 스테이트풀 애플리케이션을 운영할 때, PersistentVolume(PV) 및 PersistentVolumeClaim(PVC)을 활용한 스토리지 솔루션의 성능 병목 현상을 진단하고 최적화하기 위한 방안을 제시해 주십시오. 특히, Container Storage Interface(CSI)를 활용한 커스텀 스토리지 드라이버 개발 또는 기존 드라이버 최적화 관점에서 설명해 주십시오.
- Kubernetes 클러스터 내에서 Pod 간 통신 문제를 진단하고 해결해야 할 때, 특히 Network Policy와 CNI(Container Network Interface) 플러그인의 복합적인 상호작용으로 인해 발생하는 문제에 초점을 맞춰 설명해 주십시오. 특정 Pod가 예상치 못하게 다른 Pod와 통신하지 못하거나, 외부 네트워크 접근에 실패하는 상황을 가정하고, 문제 진단 방법과 해결 절차를 구체적으로 제시해 주십시오.