AI / 데이터 · 심화
미션 크리티컬한 ML 서비스의 높은 가용성(High Availability)과 재해 복구(Disaster Recovery)를 보장하기 위한 MLOps 시스템 아키텍처를 설계해야 합니다. 액티브-액티브(Active-Active) 또는 액티브-패시브(Active-Passive) 구성, 다중 리전(Multi-Region) 배포 전략, 그리고 데이터 동기화 및 일관성 유지 방안에 대해 설명하시오.
힌트 · 지역별 데이터 복제, 로드 밸런싱, 자동 페일오버, 데이터베이스 일관성 모델, Chaos Engineering을 고려합니다.
액티브-액티브다중 리전데이터 동기화자동 페일오버멱등성
모범답안
미션 크리티컬한 ML 서비스의 HA/DR을 위한 MLOps 아키텍처는 크게 액티브-액티브와 액티브-패시브 구성으로 나눌 수 있습니다. 저는 액티브-액티브 구성을 선호합니다.
액티브-액티브 구성은 다중 리전에 걸쳐 서비스를 배포하고, 각 리전에서 트래픽을 처리합니다. 로드 밸런서를 통해 사용자 요청을 분산하고, 한 리전에 장애가 발생하면 자동으로 다른 리전으로 트래픽을 전환하는 자동 페일오버 시스템을 구축합니다.
데이터 동기화는 매우 중요합니다. 데이터베이스는 글로벌 분산 데이터베이스를 사용하거나, 리전 간 데이터 복제를 통해 일관성을 유지합니다. 데이터 변경 시 멱등성을 보장하여 데이터 불일치 문제를 최소화합니다.
Chaos Engineering을 통해 시스템의 복원력을 주기적으로 테스트하고, 잠재적인 문제점을 사전에 발견하여 개선합니다. 이러한 방식으로 높은 가용성과 재해 복구 능력을 확보할 수 있습니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 MLOps 면접 질문
- 금융, 의료와 같이 규제가 엄격한 산업에서 ML 모델을 배포하고 운영할 때, 모델의 투명성(Transparency), 공정성(Fairness), 책임성(Accountability)을 보장하기 위한 모델 거버넌스(Model Governance) 프레임워크를 MLOps 파이프라인에 어떻게 통합할 것인지 구체적인 절차와 필요한 도구를 포함하여 설명하시오.
- 여러 버전의 ML 모델을 동시에 프로덕션 환경에서 A/B 테스트하거나 멀티암드 밴딧(Multi-armed Bandit) 전략을 적용하여 최적의 모델을 점진적으로 탐색하는 고급 실험 플랫폼을 설계해야 합니다. 이러한 플랫폼이 갖춰야 할 핵심 기능(트래픽 분할, 지표 수집, 통계적 유의성 분석, 자동 배포/롤백)과 아키텍처적 고려사항에 대해 설명하시오.
- 대규모 ML 학습 및 추론 워크로드를 클라우드 환경에서 운영할 때, 비용 효율성을 극대화하면서도 성능 SLA(Service Level Agreement)를 충족시키기 위한 고급 리소스 최적화 전략에 대해 설명하시오. 특히 GPU 활용률 최적화, 스팟 인스턴스(Spot Instance) 활용, 서버리스 ML 추론 아키텍처 구현 방안을 포함하여 논하시오.