AI / 데이터 · 기초
머신러닝 모델에서 과적합(Overfitting)과 과소적합(Underfitting)은 무엇이며, 이 두 가지 문제를 해결하기 위한 기본적인 방법은 무엇이 있을까요?
힌트 · 과적합은 모델이 훈련 데이터에 너무 맞춰진 경우, 과소적합은 충분히 학습되지 않은 경우입니다. 데이터 증강, 정규화, 모델 복잡도 조절 등으로 해결할 수 있습니다.
과적합과소적합규제교차 검증데이터 증강
모범답안
면접관님, 머신러닝 모델에서 과적합과 과소적합은 모델의 성능을 평가하고 개선하는 데 중요한 개념입니다.
과적합은 모델이 훈련 데이터에는 지나치게 잘 맞지만, 실제 새로운 데이터에는 제대로 작동하지 못하는 현상입니다. 마치 시험 문제만 외워서 풀고 응용 문제에는 약한 학생과 같습니다. 해결 방법으로는 더 많은 데이터를 확보하거나, 정규화(L1, L2 규제)를 통해 모델의 복잡도를 줄이거나, 교차 검증을 통해 모델을 평가하는 방법 등이 있습니다. 데이터 증강도 좋은 방법입니다.
반대로 과소적합은 모델이 너무 단순해서 훈련 데이터조차 제대로 학습하지 못하는 경우입니다. 이 경우에는 모델의 복잡도를 높이거나, 더 많은 특징을 추가하거나, 더 긴 시간 동안 학습시키는 방법 등을 고려할 수 있습니다. 더 강력한 모델을 사용하는 것도 방법입니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 탐색적 데이터 분석(EDA)은 왜 중요하며, EDA를 수행할 때 주로 어떤 방법을 사용하시나요?
- 데이터의 중심 경향을 나타내는 대표적인 통계량으로 평균, 중앙값, 최빈값이 있습니다. 각 통계량이 어떤 상황에서 유용하게 사용되는지 설명해 주세요.
- 머신러닝의 주요 세 가지 유형인 지도 학습, 비지도 학습, 강화 학습에 대해 간략히 설명하고 각각의 대표적인 알고리즘 예시를 들어주세요.
- 머신러닝 모델에서 편향-분산 트레이드오프(Bias-Variance Trade-off)의 개념을 설명하고, 모델 복잡도와 이 트레이드오프가 어떻게 관련되는지 구체적인 예시를 들어 설명해 보세요.
- Gradient Boosting과 Random Forest는 대표적인 앙상블 학습 방법입니다. 두 방법의 주요 차이점과 각각의 장단점을 설명하고, 어떤 상황에서 어떤 방법을 선택하는 것이 더 유리한지 논의해 보세요.
- 머신러닝 모델에서 과적합을 방지하기 위한 정규화(Regularization) 기법인 L1과 L2 정규화의 원리와 차이점을 설명하고, 각각이 모델의 가중치에 어떤 효과를 가져오는지 예시를 들어 설명해 보세요.