AI / 데이터 · 중급
어텐션 메커니즘(Attention Mechanism)이 시퀀스-투-시퀀스(Seq2Seq) 모델에서 어떤 문제를 해결하며, 기존 RNN 기반 모델 대비 어떤 이점을 제공하는지 구체적인 동작 원리를 예시와 함께 설명해 주세요.
힌트 · 어텐션은 인코더의 모든 출력에 가중치를 부여하여 디코더가 매 시점마다 입력 시퀀스의 관련 부분에 집중할 수 있게 합니다. 이는 정보 병목 현상을 줄이고 장거리 의존성 학습 능력을 향상시킵니다.
장거리 의존성병목 현상가중치 합문맥 벡터정렬(Alignment)
모범답안
어텐션 메커니즘은 Seq2Seq 모델에서 인코더의 정보를 하나의 고정된 크기의 문맥 벡터에 압축하는 과정에서 발생하는 정보 손실, 즉 병목 현상을 해결합니다. 특히 입력 시퀀스가 길어질수록 앞부분 정보가 소실되는 장거리 의존성 문제가 심각해지는데, 어텐션은 이를 완화합니다.
기존 RNN 기반 모델은 마지막 hidden state만을 디코더에 전달하는 반면, 어텐션은 인코더의 모든 hidden state를 활용합니다. 디코더의 각 시점마다, 인코더의 hidden state 각각에 가중치를 부여하여 가중합을 계산하고, 이를 문맥 벡터로 사용합니다. 이 가중치는 디코더의 현재 hidden state와 인코더의 각 hidden state 간의 유사도를 기반으로 결정됩니다.
예를 들어, "나는 학교에 갑니다"를 영어로 번역할 때, 디코더가 "go"를 생성하는 시점에서 어텐션은 "갑니다"에 높은 가중치를 부여하여 디코더가 해당 단어에 집중하도록 돕습니다. 이를 통해 번역 품질을 향상시키고, 장거리 의존성 문제도 효과적으로 해결할 수 있습니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 딥러닝 면접 질문
- 과적합(Overfitting)을 방지하기 위한 대표적인 정규화(Regularization) 기법 세 가지(L1, L2, Dropout)에 대해 간략하게 설명해주세요.
- ResNet과 VGG 네트워크의 주요 차이점은 무엇이며, ResNet이 깊은 네트워크에서 VGG보다 더 좋은 성능을 보이는 핵심적인 이유를 설명해 주세요.
- 순환 신경망(RNN)에서 발생하는 장기 의존성(Long-term dependency) 문제를 해결하기 위해 LSTM과 GRU가 어떤 방식으로 고안되었는지, 각 게이트의 역할을 중심으로 설명해 주세요.
- 배치 정규화(Batch Normalization)가 딥러닝 모델 학습 과정에 어떤 긍정적인 영향을 미치는지, 내부 공변량 변화(Internal Covariate Shift) 관점에서 설명하고, 추론 시에는 어떻게 동작하는지 설명해 주세요.
- 과적합(Overfitting)을 방지하기 위한 대표적인 정규화 기법인 Dropout과 L1/L2 정규화의 원리 및 각각의 장단점을 비교 설명하고, 실제 모델 학습 시 어떤 기준으로 선택하는 것이 좋을지 의견을 제시해 주세요.
- Adam, RMSprop, 그리고 SGD 옵티마이저의 주요 차이점은 무엇이며, 각각의 옵티마이저가 어떤 상황에서 더 효과적인지, 그리고 실제 딥러닝 프로젝트에서 옵티마이저를 선택할 때 고려해야 할 사항들을 설명해 주세요.