AI / 데이터 · 중급
분류 모델의 성능을 평가할 때 정확도(Accuracy) 외에 정밀도(Precision), 재현율(Recall), F1-Score와 같은 다른 지표들이 왜 필요한지 설명하고, 각 지표가 어떤 상황에서 중요하게 활용되는지 구체적인 예시를 들어 설명해 보세요.
힌트 · 정확도는 불균형 데이터셋에서 오해를 줄 수 있으며, 각 지표는 오분류의 유형(False Positive, False Negative)에 따라 중요도가 달라집니다.
불균형 데이터오차 행렬정밀도-재현율 트레이드오프임계값비용 민감 학습
모범답안
분류 모델 성능 평가 시 정확도만으로는 부족한 경우가 많습니다. 특히 데이터 불균형이 심할 때 정확도는 높은 값을 보이지만 실제 성능을 제대로 반영하지 못할 수 있습니다.
정밀도는 모델이 True라고 예측한 것 중 실제 True의 비율을 나타냅니다. 스팸 메일 분류에서 정밀도가 높다면, 스팸 메일이라고 분류한 것 중 실제로 스팸 메일인 비율이 높다는 의미입니다. 중요한 메일이 스팸으로 분류되는 것을 최소화해야 할 때 중요합니다.
재현율은 실제 True인 것 중 모델이 True라고 예측한 비율입니다. 암 진단 모델에서 재현율이 높다면, 실제로 암 환자를 암 환자로 정확하게 진단하는 비율이 높다는 의미입니다. 암 환자를 놓치는 것을 최소화해야 할 때 중요합니다.
F1-Score는 정밀도와 재현율의 조화 평균으로, 두 지표를 균형 있게 고려합니다. 어떤 지표가 더 중요한지 판단하기 어려울 때 유용하게 사용됩니다.
이처럼 각 지표는 오분류의 유형(False Positive, False Negative)에 따라 중요도가 달라지므로, 상황에 맞는 지표를 선택하여 모델을 평가해야 합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- Gradient Boosting과 Random Forest는 대표적인 앙상블 학습 방법입니다. 두 방법의 주요 차이점과 각각의 장단점을 설명하고, 어떤 상황에서 어떤 방법을 선택하는 것이 더 유리한지 논의해 보세요.
- 머신러닝 모델에서 과적합을 방지하기 위한 정규화(Regularization) 기법인 L1과 L2 정규화의 원리와 차이점을 설명하고, 각각이 모델의 가중치에 어떤 효과를 가져오는지 예시를 들어 설명해 보세요.
- 머신러닝 모델 평가 시 교차 검증(Cross-Validation)이 필요한 이유와 K-Fold Cross-Validation의 동작 원리를 설명하고, 이 방법이 모델의 일반화 성능 평가에 어떻게 기여하는지 설명해 보세요.
- 데이터 전처리 과정에서 특성 스케일링(Feature Scaling)이 필요한 이유를 설명하고, 대표적인 방법인 표준화(Standardization)와 정규화(Normalization)의 차이점 및 각각의 적용 사례를 비교하여 설명해 보세요.
- 실제 데이터에서 결측치(Missing Data)가 발생하는 원인과 이를 처리하기 위한 다양한 전략(예: 제거, 대체)을 설명하고, 각 전략의 장단점 및 데이터 특성에 따른 적절한 처리 방법을 논의해 보세요.
- 서비스 개선을 위해 A/B 테스트를 설계했습니다. 하지만 테스트 결과가 예상과 달리 명확한 인과 관계를 보여주지 못하고 혼란 변수(confounding variables)의 영향이 의심되는 상황입니다. 이러한 상황에서 A/B 테스트의 한계를 극복하고 신뢰할 수 있는 인과 관계를 추론하기 위한 고급 통계적 또는 머신러닝 기반 접근 방식은 무엇이 있으며, 각 방법의 가정과 적용 시 고려사항을 설명해주세요.