패스잇
AI / 데이터 · 심화

대규모 ML 학습 및 추론 워크로드를 클라우드 환경에서 운영할 때, 비용 효율성을 극대화하면서도 성능 SLA(Service Level Agreement)를 충족시키기 위한 고급 리소스 최적화 전략에 대해 설명하시오. 특히 GPU 활용률 최적화, 스팟 인스턴스(Spot Instance) 활용, 서버리스 ML 추론 아키텍처 구현 방안을 포함하여 논하시오.

힌트 · Kubernetes 기반 GPU 스케줄링, 워크로드 오케스트레이션, 예측 스케일링, 모델 경량화 및 ONNX/TensorRT 활용을 고려합니다.

GPU 활용률스팟 인스턴스서버리스 추론오토 스케일링모델 압축

모범답안

클라우드 환경에서 대규모 ML 워크로드를 운영할 때 비용 효율성과 성능 SLA를 동시에 잡는 것은 중요한 과제입니다. 몇 가지 전략을 융합적으로 활용해야 합니다.

먼저, GPU 활용률을 극대화해야 합니다. Kubernetes 기반 GPU 스케줄링을 통해 여러 워크로드가 GPU 자원을 효율적으로 공유하도록 합니다. 워크로드 오케스트레이션 도구를 사용하여 학습 작업의 우선순위를 관리하고, 필요에 따라 GPU 자원을 동적으로 할당합니다.

다음으로, 스팟 인스턴스를 적극적으로 활용합니다. 스팟 인스턴스는 저렴하지만 중단될 수 있으므로, 내결함성을 고려한 설계가 필수적입니다. 체크포인팅, 재시작 로직, 그리고 예측 스케일링을 통해 스팟 인스턴스 중단에 대비합니다.

마지막으로, 서버리스 ML 추론 아키텍처를 구축합니다. 모델 경량화 기술 (가지치기, 양자화)과 ONNX/TensorRT 같은 추론 엔진을 사용하여 모델 크기를 줄이고 추론 속도를 높입니다. 서버리스 플랫폼의 오토 스케일링 기능을 활용하여 트래픽 변화에 유연하게 대응하고, 사용량 기반으로 비용을 지불하여 자원 낭비를 줄입니다. 이러한 전략들을 통해 비용을 절감하면서도 성능 SLA를 만족시킬 수 있습니다.

읽었다면, 이제 직접 답해볼 차례예요

패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.

함께 보는 MLOps 면접 질문

← MLOps 면접 질문 전체 보기