대규모 ML 학습 및 추론 워크로드를 클라우드 환경에서 운영할 때, 비용 효율성을 극대화하면서도 성능 SLA(Service Level Agreement)를 충족시키기 위한 고급 리소스 최적화 전략에 대해 설명하시오. 특히 GPU 활용률 최적화, 스팟 인스턴스(Spot Instance) 활용, 서버리스 ML 추론 아키텍처 구현 방안을 포함하여 논하시오.
힌트 · Kubernetes 기반 GPU 스케줄링, 워크로드 오케스트레이션, 예측 스케일링, 모델 경량화 및 ONNX/TensorRT 활용을 고려합니다.
모범답안
클라우드 환경에서 대규모 ML 워크로드를 운영할 때 비용 효율성과 성능 SLA를 동시에 잡는 것은 중요한 과제입니다. 몇 가지 전략을 융합적으로 활용해야 합니다.
먼저, GPU 활용률을 극대화해야 합니다. Kubernetes 기반 GPU 스케줄링을 통해 여러 워크로드가 GPU 자원을 효율적으로 공유하도록 합니다. 워크로드 오케스트레이션 도구를 사용하여 학습 작업의 우선순위를 관리하고, 필요에 따라 GPU 자원을 동적으로 할당합니다.
다음으로, 스팟 인스턴스를 적극적으로 활용합니다. 스팟 인스턴스는 저렴하지만 중단될 수 있으므로, 내결함성을 고려한 설계가 필수적입니다. 체크포인팅, 재시작 로직, 그리고 예측 스케일링을 통해 스팟 인스턴스 중단에 대비합니다.
마지막으로, 서버리스 ML 추론 아키텍처를 구축합니다. 모델 경량화 기술 (가지치기, 양자화)과 ONNX/TensorRT 같은 추론 엔진을 사용하여 모델 크기를 줄이고 추론 속도를 높입니다. 서버리스 플랫폼의 오토 스케일링 기능을 활용하여 트래픽 변화에 유연하게 대응하고, 사용량 기반으로 비용을 지불하여 자원 낭비를 줄입니다. 이러한 전략들을 통해 비용을 절감하면서도 성능 SLA를 만족시킬 수 있습니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 MLOps 면접 질문
- 복잡한 DAG(Directed Acyclic Graph) 구조를 가지며, 다양한 데이터 소스와 컴퓨팅 환경(온프레미스, 클라우드)에 분산된 ML 파이프라인을 구축할 때, 파이프라인의 견고성(Robustness)을 높이기 위한 고급 에러 처리 및 복구 전략(Retry, Rollback, Dead-letter Queue 등)을 MLOps 관점에서 어떻게 설계할 것인지 설명하시오.
- 금융, 의료와 같이 규제가 엄격한 산업에서 ML 모델을 배포하고 운영할 때, 모델의 투명성(Transparency), 공정성(Fairness), 책임성(Accountability)을 보장하기 위한 모델 거버넌스(Model Governance) 프레임워크를 MLOps 파이프라인에 어떻게 통합할 것인지 구체적인 절차와 필요한 도구를 포함하여 설명하시오.
- 여러 버전의 ML 모델을 동시에 프로덕션 환경에서 A/B 테스트하거나 멀티암드 밴딧(Multi-armed Bandit) 전략을 적용하여 최적의 모델을 점진적으로 탐색하는 고급 실험 플랫폼을 설계해야 합니다. 이러한 플랫폼이 갖춰야 할 핵심 기능(트래픽 분할, 지표 수집, 통계적 유의성 분석, 자동 배포/롤백)과 아키텍처적 고려사항에 대해 설명하시오.
- 미션 크리티컬한 ML 서비스의 높은 가용성(High Availability)과 재해 복구(Disaster Recovery)를 보장하기 위한 MLOps 시스템 아키텍처를 설계해야 합니다. 액티브-액티브(Active-Active) 또는 액티브-패시브(Active-Passive) 구성, 다중 리전(Multi-Region) 배포 전략, 그리고 데이터 동기화 및 일관성 유지 방안에 대해 설명하시오.