프로덕션 환경에 배포된 ML 모델의 성능을 지속적으로 모니터링해야 하는 이유는 무엇이며, 데이터 드리프트(Data Drift)와 컨셉 드리프트(Concept Drift)를 감지하는 방법과 대응 전략에 대해 설명해 주세요.
힌트 · 모델 모니터링은 성능 저하를 조기에 감지하여 비즈니스 손실을 막습니다. 데이터 드리프트는 입력 데이터 분포 변화, 컨셉 드리프트는 입력-출력 관계 변화를 의미하며, 재학습 또는 모델 업데이트로 대응합니다.
모범답안
프로덕션 환경에 배포된 ML 모델 성능을 지속적으로 모니터링하는 것은 매우 중요합니다. 모델은 학습 데이터와 다른 실제 데이터에 노출될 수 있고, 시간이 지남에 따라 데이터의 특성이 변할 수 있기 때문입니다. 성능 저하를 조기에 감지하지 못하면 예측 정확도가 떨어져 비즈니스에 부정적인 영향을 미칠 수 있습니다.
데이터 드리프트는 모델 입력 데이터의 분포가 학습 데이터와 달라지는 현상입니다. 이를 감지하기 위해 통계적 거리 측정 방법(예: 쿨백-라이블러 발산, 젠센-섀넌 발산)을 사용할 수 있습니다. 컨셉 드리프트는 입력 데이터와 출력 데이터 간의 관계가 변하는 현상입니다. 예를 들어, 스팸 메일의 정의가 시간이 지나면서 바뀌는 경우가 있습니다. 컨셉 드리프트는 모델 성능 지표(정확도, 정밀도, 재현율 등)를 지속적으로 모니터링하여 감지할 수 있습니다.
데이터 드리프트나 컨셉 드리프트가 감지되면 모델을 재학습하거나 새로운 데이터를 반영하여 모델을 업데이트하는 전략을 사용해야 합니다. 또한, 드리프트에 강건한 모델을 설계하거나, 능동 학습(Active Learning)과 같은 기법을 적용하여 모델의 적응력을 높일 수도 있습니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 MLOps 면접 질문
- ML 모델 개발 과정에서 수많은 실험이 이루어지는데, 이러한 ML 실험을 효율적으로 추적하고 관리하기 위한 방법과 MLflow Tracking과 같은 도구가 제공하는 이점을 설명해 주세요.
- 전통적인 소프트웨어 CI/CD 파이프라인과 MLOps의 CI/CD 파이프라인(Continuous Training/CT 포함)은 어떤 주요 차이점을 가지며, MLOps에서 CT가 왜 중요한지 설명해 주세요.
- ML 모델을 프로덕션 환경에 배포할 때, A/B 테스트 배포와 카나리(Canary) 배포 전략을 각각 어떤 상황에 적용할 수 있으며, 각 전략의 장단점은 무엇인지 비교 설명해 주세요.
- 대규모 프로덕션 환경에서 모델 성능 저하를 일으키는 데이터 드리프트(Data Drift)와 컨셉 드리프트(Concept Drift)를 효과적으로 탐지하고, 이를 자동으로 완화하기 위한 MLOps 시스템 설계 방안에 대해 설명하고, 재학습(Retraining) 전략과 롤백(Rollback) 메커니즘을 포함하여 구체적인 구현 방안을 제시하시오.
- 실시간(Real-time) 서빙과 배치(Batch) 학습을 모두 지원하는 확장 가능한 피처 스토어(Feature Store)를 설계한다고 가정해 봅시다. 온라인 스토어와 오프라인 스토어 간의 데이터 일관성(Consistency)을 유지하고, 피처 검색 지연 시간(Latency)을 최소화하며, 데이터 거버넌스를 확보하기 위한 아키텍처 및 기술 스택 선택에 대해 설명하시오.
- 복잡한 DAG(Directed Acyclic Graph) 구조를 가지며, 다양한 데이터 소스와 컴퓨팅 환경(온프레미스, 클라우드)에 분산된 ML 파이프라인을 구축할 때, 파이프라인의 견고성(Robustness)을 높이기 위한 고급 에러 처리 및 복구 전략(Retry, Rollback, Dead-letter Queue 등)을 MLOps 관점에서 어떻게 설계할 것인지 설명하시오.