과적합(Overfitting)을 방지하기 위한 대표적인 정규화 기법인 Dropout과 L1/L2 정규화의 원리 및 각각의 장단점을 비교 설명하고, 실제 모델 학습 시 어떤 기준으로 선택하는 것이 좋을지 의견을 제시해 주세요.
힌트 · Dropout은 무작위로 뉴런을 비활성화하여 앙상블 효과를 내고, L1/L2는 가중치 크기에 페널티를 부여합니다. L1은 희소성(Sparsity)에 유리하고, L2는 가중치 감소에 효과적입니다.
모범답안
과적합 방지를 위한 Dropout과 L1/L2 정규화에 대해 설명드리겠습니다.
Dropout은 학습 시 무작위로 일부 뉴런을 비활성화하여, 특정 뉴런에 과도하게 의존하는 것을 방지합니다. 이는 여러 개의 작은 모델을 앙상블하는 효과를 주어 일반화 성능을 높입니다. 장점은 구현이 간단하고 효과적이라는 것이지만, 학습 속도가 느려질 수 있다는 단점이 있습니다.
L1/L2 정규화는 손실 함수에 가중치의 크기에 비례하는 페널티 항을 추가하는 방식입니다. L1 정규화는 가중치 중 일부를 0으로 만들어 특징 선택 효과, 즉 희소성을 유도하는 데 유리합니다. L2 정규화는 가중치 값들을 전반적으로 작게 만들어 가중치 감쇠(weight decay) 효과를 통해 과적합을 방지합니다. L1은 희소성이 중요할 때, L2는 전반적인 가중치 크기를 줄여 안정적인 학습을 원할 때 주로 사용됩니다.
실제 모델 학습 시 선택 기준은 데이터셋의 특성과 모델의 복잡성에 따라 달라집니다. 특징이 많고 일부 특징만 중요한 경우 L1이 유용할 수 있고, 모델이 너무 복잡하여 과적합이 심하게 발생하는 경우 L2나 Dropout을 함께 사용하는 것이 효과적입니다. 보통은 L2 정규화를 기본으로 사용하고, 과적합이 여전히 심하면 Dropout을 추가하거나 L1을 고려하는 방식으로 접근합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 딥러닝 면접 질문
- 순환 신경망(RNN)에서 발생하는 장기 의존성(Long-term dependency) 문제를 해결하기 위해 LSTM과 GRU가 어떤 방식으로 고안되었는지, 각 게이트의 역할을 중심으로 설명해 주세요.
- 어텐션 메커니즘(Attention Mechanism)이 시퀀스-투-시퀀스(Seq2Seq) 모델에서 어떤 문제를 해결하며, 기존 RNN 기반 모델 대비 어떤 이점을 제공하는지 구체적인 동작 원리를 예시와 함께 설명해 주세요.
- 배치 정규화(Batch Normalization)가 딥러닝 모델 학습 과정에 어떤 긍정적인 영향을 미치는지, 내부 공변량 변화(Internal Covariate Shift) 관점에서 설명하고, 추론 시에는 어떻게 동작하는지 설명해 주세요.
- Adam, RMSprop, 그리고 SGD 옵티마이저의 주요 차이점은 무엇이며, 각각의 옵티마이저가 어떤 상황에서 더 효과적인지, 그리고 실제 딥러닝 프로젝트에서 옵티마이저를 선택할 때 고려해야 할 사항들을 설명해 주세요.
- 전이 학습(Transfer Learning)이 딥러닝 모델 개발 과정에서 어떤 이점을 제공하는지 설명하고, 특히 데이터셋이 적거나 특정 도메인에 특화된 문제를 해결할 때 어떻게 활용될 수 있는지 구체적인 예시와 함께 설명해 주세요.
- 엣지 디바이스나 리소스 제약이 있는 환경에 딥러닝 모델을 배포할 때, 모델의 정확도 손실을 최소화하면서 추론 속도를 극대화하고 메모리 사용량을 줄이기 위한 구체적인 모델 압축 및 양자화 전략에 대해 설명하고, 각 기법의 장단점과 적용 시 고려사항을 논하시오.