AI / 데이터 · 심화
프로덕션 환경에 배포된 머신러닝 모델이 시간이 지남에 따라 성능이 저하되는 현상(Model Drift)을 경험하고 있습니다. 데이터 드리프트와 컨셉트 드리프트의 차이점을 설명하고, 각 유형의 드리프트를 효과적으로 감지하고 자동으로 대응하기 위한 모니터링 시스템 설계 방안과 구체적인 지표들을 제시해주세요.
힌트 · 데이터 분포 변화 감지 기법 (KS-test, KL-divergence), 모델 예측 성능 변화 감지, 재학습(retraining) 전략, 롤백(rollback) 메커니즘 등을 포함해야 합니다.
데이터 드리프트컨셉트 드리프트모니터링 시스템분포 변화성능 지표
모범답안
면접관님, 모델 드리프트는 머신러닝 모델의 성능 저하를 의미하며, 크게 데이터 드리프트와 컨셉트 드리프트로 나눌 수 있습니다. 데이터 드리프트는 모델 입력 데이터의 분포가 학습 데이터와 달라지는 현상이고, 컨셉트 드리프트는 입력 데이터와 타겟 변수 사이의 관계가 변하는 현상입니다.
데이터 드리프트 감지를 위해 KS-test나 KL-divergence를 사용하여 학습 데이터와 실시간 데이터의 분포 차이를 모니터링합니다. 컨셉트 드리프트는 모델의 예측 성능 지표(정확도, F1-score 등) 변화를 통해 감지할 수 있습니다.
모니터링 시스템은 데이터/컨셉트 드리프트 감지 시 알람을 발생시키고, 자동 재학습 또는 모델 롤백을 수행하도록 설계할 수 있습니다. 재학습 주기는 드리프트 발생 빈도와 모델 성능 저하 정도에 따라 조정하며, 롤백은 이전 버전의 안정적인 모델로 신속하게 전환하여 서비스 영향을 최소화합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 데이터 전처리 과정에서 특성 스케일링(Feature Scaling)이 필요한 이유를 설명하고, 대표적인 방법인 표준화(Standardization)와 정규화(Normalization)의 차이점 및 각각의 적용 사례를 비교하여 설명해 보세요.
- 실제 데이터에서 결측치(Missing Data)가 발생하는 원인과 이를 처리하기 위한 다양한 전략(예: 제거, 대체)을 설명하고, 각 전략의 장단점 및 데이터 특성에 따른 적절한 처리 방법을 논의해 보세요.
- 서비스 개선을 위해 A/B 테스트를 설계했습니다. 하지만 테스트 결과가 예상과 달리 명확한 인과 관계를 보여주지 못하고 혼란 변수(confounding variables)의 영향이 의심되는 상황입니다. 이러한 상황에서 A/B 테스트의 한계를 극복하고 신뢰할 수 있는 인과 관계를 추론하기 위한 고급 통계적 또는 머신러닝 기반 접근 방식은 무엇이 있으며, 각 방법의 가정과 적용 시 고려사항을 설명해주세요.
- 강화 학습 에이전트를 실제 서비스에 적용할 때, 초기 단계에서의 탐험(Exploration)과 이후 단계에서의 활용(Exploitation) 균형을 어떻게 효과적으로 조절할 수 있을까요? 특히, 고차원 상태 공간과 희소한 보상(sparse rewards) 환경에서 탐험 전략을 개선하기 위한 고급 기법들과 그 적용 시 유의사항을 설명해주세요.
- 복수의 시계열 데이터가 존재하고, 이들 간의 인과 관계를 파악하여 특정 시계열에 대한 외부 개입(intervention)의 효과를 측정하고자 합니다. 예를 들어, 특정 마케팅 캠페인이 제품 판매량 시계열에 미친 영향을 분석해야 할 때, 단순 상관 분석을 넘어선 인과적 효과를 추정하기 위한 고급 시계열 분석 기법과 그 한계를 설명해주세요.
- 대규모 복합 시스템에서 발생하는 비정상적인 로그 패턴이나 센서 데이터를 실시간으로 탐지해야 합니다. 정상 데이터는 풍부하지만 비정상 데이터는 매우 희귀하고 그 유형도 다양하여 레이블링이 어렵습니다. 이러한 환경에서 효과적인 비지도(Unsupervised) 또는 준지도(Semi-supervised) 기반의 이상 탐지 시스템을 설계하고 구축하기 위한 접근 방식과 최신 기술들을 설명해주세요.