AI / 데이터 · 중급
순환 신경망(RNN)에서 발생하는 장기 의존성(Long-term dependency) 문제를 해결하기 위해 LSTM과 GRU가 어떤 방식으로 고안되었는지, 각 게이트의 역할을 중심으로 설명해 주세요.
힌트 · LSTM은 입력, 망각, 출력 게이트를 통해 셀 상태(Cell State)를 조절하며, GRU는 업데이트와 리셋 게이트로 더 간결하게 정보를 제어하여 장기 의존성 문제를 완화합니다.
LSTMGRU게이트기억 셀vanishing gradient
모범답안
RNN은 이론적으로 긴 시퀀스 정보를 처리할 수 있지만, 실제로는 기울기 소실 문제 때문에 장기 의존성을 잘 학습하지 못합니다. LSTM과 GRU는 이러한 문제를 해결하기 위해 고안되었습니다.
LSTM은 '셀 상태'라는 핵심 개념을 도입하여 정보를 오랫동안 유지할 수 있도록 합니다. 세 개의 게이트, 즉 입력 게이트, 망각 게이트, 출력 게이트가 셀 상태를 제어합니다. 망각 게이트는 어떤 정보를 버릴지 결정하고, 입력 게이트는 어떤 새로운 정보를 셀 상태에 저장할지 결정합니다. 마지막으로 출력 게이트는 셀 상태를 기반으로 어떤 정보를 출력할지 결정합니다.
GRU는 LSTM을 간소화한 모델입니다. 셀 상태와 hidden state를 합치고, 업데이트 게이트와 리셋 게이트라는 두 개의 게이트만 사용합니다. 업데이트 게이트는 과거 정보를 얼마나 유지할지 결정하고, 리셋 게이트는 과거 정보를 얼마나 활용할지 결정합니다. GRU는 구조가 간단하여 학습 속도가 빠르다는 장점이 있습니다.
결론적으로, LSTM과 GRU는 게이트를 통해 정보의 흐름을 효과적으로 제어하여 장기 의존성 문제를 완화하고, RNN의 성능을 향상시킵니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 딥러닝 면접 질문
- 딥러닝 모델을 학습할 때 흔히 발생하는 문제인 과적합(Overfitting)과 과소적합(Underfitting)은 각각 무엇을 의미하며, 이들이 모델 성능에 미치는 영향은 무엇인가요?
- 과적합(Overfitting)을 방지하기 위한 대표적인 정규화(Regularization) 기법 세 가지(L1, L2, Dropout)에 대해 간략하게 설명해주세요.
- ResNet과 VGG 네트워크의 주요 차이점은 무엇이며, ResNet이 깊은 네트워크에서 VGG보다 더 좋은 성능을 보이는 핵심적인 이유를 설명해 주세요.
- 어텐션 메커니즘(Attention Mechanism)이 시퀀스-투-시퀀스(Seq2Seq) 모델에서 어떤 문제를 해결하며, 기존 RNN 기반 모델 대비 어떤 이점을 제공하는지 구체적인 동작 원리를 예시와 함께 설명해 주세요.
- 배치 정규화(Batch Normalization)가 딥러닝 모델 학습 과정에 어떤 긍정적인 영향을 미치는지, 내부 공변량 변화(Internal Covariate Shift) 관점에서 설명하고, 추론 시에는 어떻게 동작하는지 설명해 주세요.
- 과적합(Overfitting)을 방지하기 위한 대표적인 정규화 기법인 Dropout과 L1/L2 정규화의 원리 및 각각의 장단점을 비교 설명하고, 실제 모델 학습 시 어떤 기준으로 선택하는 것이 좋을지 의견을 제시해 주세요.