AI / 데이터 · 중급
실제 데이터에서 결측치(Missing Data)가 발생하는 원인과 이를 처리하기 위한 다양한 전략(예: 제거, 대체)을 설명하고, 각 전략의 장단점 및 데이터 특성에 따른 적절한 처리 방법을 논의해 보세요.
힌트 · 결측치 유형(MAR, MCAR, NMAR)을 고려하여 제거 또는 대체 방법을 선택하며, 대체의 경우 평균, 중앙값, 최빈값, 모델 기반 방법 등이 있습니다.
결측치 유형MCAR/MAR/MNAR결측치 제거결측치 대체편향 발생 가능성
모범답안
면접관님, 결측치는 실제 데이터 분석에서 흔히 발생하는 문제입니다. 발생하는 원인은 크게 세 가지 유형으로 나눌 수 있습니다. 완전히 무작위 결측(MCAR), 무작위 결측(MAR), 비무작위 결측(NMAR)입니다.
결측치 처리 전략으로는 크게 제거와 대체 방법이 있습니다. 제거는 간단하지만 데이터 손실이 크고, 특히 NMAR인 경우 편향을 유발할 수 있습니다.
대체 방법은 평균, 중앙값, 최빈값 등을 사용하는 간단한 방법과, 회귀 모델이나 k-NN 알고리즘을 활용하는 복잡한 방법이 있습니다. 간단한 방법은 구현이 쉽지만 데이터의 분산을 왜곡할 수 있고, 복잡한 방법은 더 정확하지만 모델 구축에 노력이 필요합니다.
데이터 특성에 따라 적절한 방법을 선택해야 합니다. MCAR인 경우에는 제거해도 큰 문제가 없지만, MAR이나 NMAR인 경우에는 대체 방법을 사용하는 것이 좋습니다. 또한, 결측치가 많은 변수는 제거하는 것보다 대체하는 것이 더 나을 수 있습니다. 중요한 것은 각 방법의 장단점을 이해하고, 데이터의 특성을 고려하여 최적의 방법을 선택하는 것입니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 머신러닝 모델 평가 시 교차 검증(Cross-Validation)이 필요한 이유와 K-Fold Cross-Validation의 동작 원리를 설명하고, 이 방법이 모델의 일반화 성능 평가에 어떻게 기여하는지 설명해 보세요.
- 분류 모델의 성능을 평가할 때 정확도(Accuracy) 외에 정밀도(Precision), 재현율(Recall), F1-Score와 같은 다른 지표들이 왜 필요한지 설명하고, 각 지표가 어떤 상황에서 중요하게 활용되는지 구체적인 예시를 들어 설명해 보세요.
- 데이터 전처리 과정에서 특성 스케일링(Feature Scaling)이 필요한 이유를 설명하고, 대표적인 방법인 표준화(Standardization)와 정규화(Normalization)의 차이점 및 각각의 적용 사례를 비교하여 설명해 보세요.
- 서비스 개선을 위해 A/B 테스트를 설계했습니다. 하지만 테스트 결과가 예상과 달리 명확한 인과 관계를 보여주지 못하고 혼란 변수(confounding variables)의 영향이 의심되는 상황입니다. 이러한 상황에서 A/B 테스트의 한계를 극복하고 신뢰할 수 있는 인과 관계를 추론하기 위한 고급 통계적 또는 머신러닝 기반 접근 방식은 무엇이 있으며, 각 방법의 가정과 적용 시 고려사항을 설명해주세요.
- 프로덕션 환경에 배포된 머신러닝 모델이 시간이 지남에 따라 성능이 저하되는 현상(Model Drift)을 경험하고 있습니다. 데이터 드리프트와 컨셉트 드리프트의 차이점을 설명하고, 각 유형의 드리프트를 효과적으로 감지하고 자동으로 대응하기 위한 모니터링 시스템 설계 방안과 구체적인 지표들을 제시해주세요.
- 강화 학습 에이전트를 실제 서비스에 적용할 때, 초기 단계에서의 탐험(Exploration)과 이후 단계에서의 활용(Exploitation) 균형을 어떻게 효과적으로 조절할 수 있을까요? 특히, 고차원 상태 공간과 희소한 보상(sparse rewards) 환경에서 탐험 전략을 개선하기 위한 고급 기법들과 그 적용 시 유의사항을 설명해주세요.