AI / 데이터 · 기초
데이터 전처리 과정에서 결측치(Missing Value)를 발견했을 때, 이를 처리하는 주요 방법 세 가지를 설명해 주세요.
힌트 · 결측치 제거, 평균/중앙값/최빈값 대체, 예측 모델을 이용한 대체 등이 있습니다.
결측치 유형 분석대체 (Imputation)삭제 (Deletion)모델 기반 예측데이터 편향
모범답안
면접관님, 데이터 전처리 시 결측치 처리 방법은 크게 세 가지로 나눌 수 있습니다.
첫째, 결측치가 있는 행 또는 열을 삭제하는 방법입니다. 이는 간단하지만, 데이터 손실을 초래할 수 있으므로 결측치 비율이 낮을 때 고려합니다.
둘째, 평균, 중앙값, 최빈값 등으로 결측치를 대체하는 방법입니다. 데이터 분포에 따라 적절한 값을 선택해야 하며, 특히 중앙값은 이상치에 덜 민감합니다. 예를 들어, pandas에서는 df['column'].fillna(df['column'].mean())과 같이 사용할 수 있습니다.
셋째, 머신러닝 모델을 활용하여 결측치를 예측하고 대체하는 방법입니다. 다른 변수들과의 관계를 고려하여 더 정확한 대체가 가능하지만, 모델 구축 및 검증에 시간이 소요될 수 있습니다. 어떤 방법을 선택할지는 결측치의 유형, 데이터의 특성, 그리고 분석 목적에 따라 신중하게 결정해야 합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 데이터 사이언스란 무엇이며, 일반적인 데이터 분석과 어떤 차이가 있다고 생각하십니까?
- 데이터의 종류를 크게 범주형 데이터와 연속형 데이터로 나눌 수 있습니다. 각각의 특징과 실생활에서의 예시를 들어 설명해 주세요.
- 탐색적 데이터 분석(EDA)은 왜 중요하며, EDA를 수행할 때 주로 어떤 방법을 사용하시나요?
- 데이터의 중심 경향을 나타내는 대표적인 통계량으로 평균, 중앙값, 최빈값이 있습니다. 각 통계량이 어떤 상황에서 유용하게 사용되는지 설명해 주세요.
- 머신러닝의 주요 세 가지 유형인 지도 학습, 비지도 학습, 강화 학습에 대해 간략히 설명하고 각각의 대표적인 알고리즘 예시를 들어주세요.