AI / 데이터 · 중급
머신러닝 모델에서 편향-분산 트레이드오프(Bias-Variance Trade-off)의 개념을 설명하고, 모델 복잡도와 이 트레이드오프가 어떻게 관련되는지 구체적인 예시를 들어 설명해 보세요.
힌트 · 편향은 모델의 단순성으로 인한 오류, 분산은 모델의 복잡도로 인한 훈련 데이터에 대한 과도한 민감성을 의미하며, 둘 사이의 균형점을 찾는 것이 중요합니다.
편향분산과소적합과적합모델 복잡도
모범답안
면접관님, 머신러닝 모델의 편향-분산 트레이드오프는 모델이 얼마나 정확하고 안정적인 예측을 하는지에 대한 중요한 개념입니다.
편향은 모델이 너무 단순해서 데이터의 복잡한 패턴을 제대로 학습하지 못하는 경우 발생합니다. 이를 과소적합이라고 하며, 훈련 데이터와 테스트 데이터 모두에서 낮은 성능을 보입니다. 반면, 분산은 모델이 너무 복잡해서 훈련 데이터에만 지나치게 맞춰진 경우 발생합니다. 이를 과적합이라고 하며, 훈련 데이터에서는 높은 성능을 보이지만, 새로운 데이터에서는 성능이 떨어집니다.
예를 들어, 집 값을 예측하는 모델을 생각해 보겠습니다. 선형 회귀 모델은 단순해서 편향이 높을 수 있습니다. 반대로, 매우 복잡한 결정 트리 모델은 훈련 데이터의 모든 세부 사항을 학습하여 분산이 높을 수 있습니다. 따라서, 적절한 복잡도의 모델을 선택하여 편향과 분산 사이의 균형을 맞추는 것이 중요합니다. 이를 위해 교차 검증 등을 활용하여 모델의 성능을 평가하고, 규제 기법 등을 사용하여 모델의 복잡도를 조절할 수 있습니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 데이터의 중심 경향을 나타내는 대표적인 통계량으로 평균, 중앙값, 최빈값이 있습니다. 각 통계량이 어떤 상황에서 유용하게 사용되는지 설명해 주세요.
- 머신러닝의 주요 세 가지 유형인 지도 학습, 비지도 학습, 강화 학습에 대해 간략히 설명하고 각각의 대표적인 알고리즘 예시를 들어주세요.
- 머신러닝 모델에서 과적합(Overfitting)과 과소적합(Underfitting)은 무엇이며, 이 두 가지 문제를 해결하기 위한 기본적인 방법은 무엇이 있을까요?
- Gradient Boosting과 Random Forest는 대표적인 앙상블 학습 방법입니다. 두 방법의 주요 차이점과 각각의 장단점을 설명하고, 어떤 상황에서 어떤 방법을 선택하는 것이 더 유리한지 논의해 보세요.
- 머신러닝 모델에서 과적합을 방지하기 위한 정규화(Regularization) 기법인 L1과 L2 정규화의 원리와 차이점을 설명하고, 각각이 모델의 가중치에 어떤 효과를 가져오는지 예시를 들어 설명해 보세요.
- 머신러닝 모델 평가 시 교차 검증(Cross-Validation)이 필요한 이유와 K-Fold Cross-Validation의 동작 원리를 설명하고, 이 방법이 모델의 일반화 성능 평가에 어떻게 기여하는지 설명해 보세요.