서비스 개선을 위해 A/B 테스트를 설계했습니다. 하지만 테스트 결과가 예상과 달리 명확한 인과 관계를 보여주지 못하고 혼란 변수(confounding variables)의 영향이 의심되는 상황입니다. 이러한 상황에서 A/B 테스트의 한계를 극복하고 신뢰할 수 있는 인과 관계를 추론하기 위한 고급 통계적 또는 머신러닝 기반 접근 방식은 무엇이 있으며, 각 방법의 가정과 적용 시 고려사항을 설명해주세요.
힌트 · 도구 변수(Instrumental Variables), 경향 점수 매칭(Propensity Score Matching), 이중 강건 추정(Doubly Robust Estimation) 등의 방법을 고려하고, 각 방법의 강점과 약점, 핵심 가정을 설명하세요.
모범답안
A/B 테스트 결과가 명확하지 않다면, 몇 가지 고급 통계 방법을 고려해볼 수 있습니다.
첫째, **경향 점수 매칭(Propensity Score Matching)**은 처치 그룹과 통제 그룹 간의 특성을 비슷하게 만들어 혼란 변수의 영향을 줄이는 방법입니다. 하지만 관측되지 않은 변수는 통제할 수 없다는 한계가 있습니다.
둘째, 도구 변수(Instrumental Variables) 방법은 처치 변수에 영향을 주지만 결과 변수에는 직접적인 영향을 주지 않는 도구 변수를 찾아 인과 관계를 추론합니다. 적절한 도구 변수를 찾는 것이 어렵다는 단점이 있습니다.
셋째, **이중 강건 추정(Doubly Robust Estimation)**은 경향 점수 모델과 결과 모델 중 하나만 정확하면 일관된 추정치를 제공합니다. 두 모델 모두 잘못되면 결과가 왜곡될 수 있습니다.
마지막으로, 베이지안 A/B 테스팅은 사전 지식을 활용하여 불확실성을 정량화하고, 더 유연하게 결과를 해석할 수 있도록 돕습니다.
각 방법은 데이터의 특성과 가정에 따라 적합성이 다르므로, 신중하게 선택해야 합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 분류 모델의 성능을 평가할 때 정확도(Accuracy) 외에 정밀도(Precision), 재현율(Recall), F1-Score와 같은 다른 지표들이 왜 필요한지 설명하고, 각 지표가 어떤 상황에서 중요하게 활용되는지 구체적인 예시를 들어 설명해 보세요.
- 데이터 전처리 과정에서 특성 스케일링(Feature Scaling)이 필요한 이유를 설명하고, 대표적인 방법인 표준화(Standardization)와 정규화(Normalization)의 차이점 및 각각의 적용 사례를 비교하여 설명해 보세요.
- 실제 데이터에서 결측치(Missing Data)가 발생하는 원인과 이를 처리하기 위한 다양한 전략(예: 제거, 대체)을 설명하고, 각 전략의 장단점 및 데이터 특성에 따른 적절한 처리 방법을 논의해 보세요.
- 프로덕션 환경에 배포된 머신러닝 모델이 시간이 지남에 따라 성능이 저하되는 현상(Model Drift)을 경험하고 있습니다. 데이터 드리프트와 컨셉트 드리프트의 차이점을 설명하고, 각 유형의 드리프트를 효과적으로 감지하고 자동으로 대응하기 위한 모니터링 시스템 설계 방안과 구체적인 지표들을 제시해주세요.
- 강화 학습 에이전트를 실제 서비스에 적용할 때, 초기 단계에서의 탐험(Exploration)과 이후 단계에서의 활용(Exploitation) 균형을 어떻게 효과적으로 조절할 수 있을까요? 특히, 고차원 상태 공간과 희소한 보상(sparse rewards) 환경에서 탐험 전략을 개선하기 위한 고급 기법들과 그 적용 시 유의사항을 설명해주세요.
- 복수의 시계열 데이터가 존재하고, 이들 간의 인과 관계를 파악하여 특정 시계열에 대한 외부 개입(intervention)의 효과를 측정하고자 합니다. 예를 들어, 특정 마케팅 캠페인이 제품 판매량 시계열에 미친 영향을 분석해야 할 때, 단순 상관 분석을 넘어선 인과적 효과를 추정하기 위한 고급 시계열 분석 기법과 그 한계를 설명해주세요.