패스잇
AI / 데이터 · 중급

실제 데이터에서 결측치(Missing Data)가 발생하는 원인과 이를 처리하기 위한 다양한 전략(예: 제거, 대체)을 설명하고, 각 전략의 장단점 및 데이터 특성에 따른 적절한 처리 방법을 논의해 보세요.

힌트 · 결측치 유형(MAR, MCAR, NMAR)을 고려하여 제거 또는 대체 방법을 선택하며, 대체의 경우 평균, 중앙값, 최빈값, 모델 기반 방법 등이 있습니다.

결측치 유형MCAR/MAR/MNAR결측치 제거결측치 대체편향 발생 가능성

모범답안

면접관님, 결측치는 실제 데이터 분석에서 흔히 발생하는 문제입니다. 발생하는 원인은 크게 세 가지 유형으로 나눌 수 있습니다. 완전히 무작위 결측(MCAR), 무작위 결측(MAR), 비무작위 결측(NMAR)입니다.

결측치 처리 전략으로는 크게 제거와 대체 방법이 있습니다. 제거는 간단하지만 데이터 손실이 크고, 특히 NMAR인 경우 편향을 유발할 수 있습니다.

대체 방법은 평균, 중앙값, 최빈값 등을 사용하는 간단한 방법과, 회귀 모델이나 k-NN 알고리즘을 활용하는 복잡한 방법이 있습니다. 간단한 방법은 구현이 쉽지만 데이터의 분산을 왜곡할 수 있고, 복잡한 방법은 더 정확하지만 모델 구축에 노력이 필요합니다.

데이터 특성에 따라 적절한 방법을 선택해야 합니다. MCAR인 경우에는 제거해도 큰 문제가 없지만, MAR이나 NMAR인 경우에는 대체 방법을 사용하는 것이 좋습니다. 또한, 결측치가 많은 변수는 제거하는 것보다 대체하는 것이 더 나을 수 있습니다. 중요한 것은 각 방법의 장단점을 이해하고, 데이터의 특성을 고려하여 최적의 방법을 선택하는 것입니다.

읽었다면, 이제 직접 답해볼 차례예요

패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.

함께 보는 데이터 사이언스 면접 질문

← 데이터 사이언스 면접 질문 전체 보기