AI / 데이터 · 중급
머신러닝 모델에서 과적합을 방지하기 위한 정규화(Regularization) 기법인 L1과 L2 정규화의 원리와 차이점을 설명하고, 각각이 모델의 가중치에 어떤 효과를 가져오는지 예시를 들어 설명해 보세요.
힌트 · L1은 가중치를 0으로 만들어 특성 선택 효과가 있고, L2는 가중치를 작게 유지하여 모델의 복잡도를 줄이는 데 기여합니다.
L1 정규화L2 정규화가중치 감소희소성릿지 회귀
모범답안
면접관님, L1, L2 정규화는 모델의 과적합을 막기 위해 사용하는 대표적인 기법입니다. 둘 다 모델의 복잡도를 줄여 일반화 성능을 높이는 데 목적이 있습니다.
L1 정규화는 손실 함수에 가중치의 절대값 합을 더하는 방식입니다. 특징으로는 일부 가중치를 정확히 0으로 만들 수 있다는 점입니다. 이는 모델에서 중요하지 않은 특성을 자동으로 제거하는 효과를 가져와, 모델을 더 단순하고 해석하기 쉽게 만들어 줍니다. 예를 들어, 100개의 특성 중 10개만 중요한 경우, L1 정규화를 통해 나머지 90개의 가중치를 0으로 만들어 불필요한 특성을 제거할 수 있습니다.
반면 L2 정규화는 손실 함수에 가중치 제곱의 합을 더합니다. L2 정규화는 가중치를 0에 가깝게 만들지만, 정확히 0으로 만들지는 않습니다. 모든 특성을 조금씩 활용하면서 가중치를 작게 유지하여 모델의 복잡도를 줄이는 데 기여합니다. 릿지 회귀가 L2 정규화를 사용하는 대표적인 예시입니다.
따라서 L1은 희소한 모델을 만들 때, L2는 모든 특성을 활용하면서 안정적인 모델을 만들 때 유용합니다. 상황에 따라 적절한 정규화 방식을 선택하는 것이 중요합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 머신러닝 모델에서 과적합(Overfitting)과 과소적합(Underfitting)은 무엇이며, 이 두 가지 문제를 해결하기 위한 기본적인 방법은 무엇이 있을까요?
- 머신러닝 모델에서 편향-분산 트레이드오프(Bias-Variance Trade-off)의 개념을 설명하고, 모델 복잡도와 이 트레이드오프가 어떻게 관련되는지 구체적인 예시를 들어 설명해 보세요.
- Gradient Boosting과 Random Forest는 대표적인 앙상블 학습 방법입니다. 두 방법의 주요 차이점과 각각의 장단점을 설명하고, 어떤 상황에서 어떤 방법을 선택하는 것이 더 유리한지 논의해 보세요.
- 머신러닝 모델 평가 시 교차 검증(Cross-Validation)이 필요한 이유와 K-Fold Cross-Validation의 동작 원리를 설명하고, 이 방법이 모델의 일반화 성능 평가에 어떻게 기여하는지 설명해 보세요.
- 분류 모델의 성능을 평가할 때 정확도(Accuracy) 외에 정밀도(Precision), 재현율(Recall), F1-Score와 같은 다른 지표들이 왜 필요한지 설명하고, 각 지표가 어떤 상황에서 중요하게 활용되는지 구체적인 예시를 들어 설명해 보세요.
- 데이터 전처리 과정에서 특성 스케일링(Feature Scaling)이 필요한 이유를 설명하고, 대표적인 방법인 표준화(Standardization)와 정규화(Normalization)의 차이점 및 각각의 적용 사례를 비교하여 설명해 보세요.