AI / 데이터 · 중급
머신러닝 모델 평가 시 교차 검증(Cross-Validation)이 필요한 이유와 K-Fold Cross-Validation의 동작 원리를 설명하고, 이 방법이 모델의 일반화 성능 평가에 어떻게 기여하는지 설명해 보세요.
힌트 · 교차 검증은 데이터 분할의 무작위성을 줄여 모델의 일반화 성능을 신뢰성 있게 평가하며, 과적합 방지에도 도움을 줍니다.
과적합일반화 성능K-Fold데이터 분할편향-분산 트레이드오프
모범답안
머신러닝 모델을 평가할 때 교차 검증은 필수적입니다. 단 한 번의 데이터 분할로 모델 성능을 평가하면, 우연히 특정 데이터셋에만 잘 맞는 모델이 나올 수 있습니다. 이를 과적합이라고 하는데, 교차 검증은 이러한 편향을 줄여 모델의 일반화 성능을 더 신뢰성 있게 측정하도록 돕습니다.
K-Fold 교차 검증은 전체 데이터를 K개의 동일한 크기의 폴드(fold)로 나눕니다. 그리고 K번의 반복을 수행하는데, 각 반복마다 하나의 폴드를 테스트셋으로 사용하고 나머지 K-1개의 폴드를 훈련셋으로 사용합니다. 이렇게 모든 폴드가 한 번씩은 테스트셋으로 사용되므로, 데이터 분할의 무작위성에 덜 영향을 받게 됩니다.
결과적으로 K번의 평가 결과를 평균 내어 최종 모델 성능을 산출합니다. 이는 모델이 다양한 데이터 샘플에 대해 얼마나 일관되게 좋은 성능을 보이는지를 보여주므로, 실제 서비스 환경에서의 일반화 성능을 더 정확하게 예측할 수 있게 해줍니다. 이는 결국 편향-분산 트레이드오프에서 분산을 줄여 모델의 안정성을 높이는 데 기여합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 머신러닝 모델에서 편향-분산 트레이드오프(Bias-Variance Trade-off)의 개념을 설명하고, 모델 복잡도와 이 트레이드오프가 어떻게 관련되는지 구체적인 예시를 들어 설명해 보세요.
- Gradient Boosting과 Random Forest는 대표적인 앙상블 학습 방법입니다. 두 방법의 주요 차이점과 각각의 장단점을 설명하고, 어떤 상황에서 어떤 방법을 선택하는 것이 더 유리한지 논의해 보세요.
- 머신러닝 모델에서 과적합을 방지하기 위한 정규화(Regularization) 기법인 L1과 L2 정규화의 원리와 차이점을 설명하고, 각각이 모델의 가중치에 어떤 효과를 가져오는지 예시를 들어 설명해 보세요.
- 분류 모델의 성능을 평가할 때 정확도(Accuracy) 외에 정밀도(Precision), 재현율(Recall), F1-Score와 같은 다른 지표들이 왜 필요한지 설명하고, 각 지표가 어떤 상황에서 중요하게 활용되는지 구체적인 예시를 들어 설명해 보세요.
- 데이터 전처리 과정에서 특성 스케일링(Feature Scaling)이 필요한 이유를 설명하고, 대표적인 방법인 표준화(Standardization)와 정규화(Normalization)의 차이점 및 각각의 적용 사례를 비교하여 설명해 보세요.
- 실제 데이터에서 결측치(Missing Data)가 발생하는 원인과 이를 처리하기 위한 다양한 전략(예: 제거, 대체)을 설명하고, 각 전략의 장단점 및 데이터 특성에 따른 적절한 처리 방법을 논의해 보세요.