패스잇
AI / 데이터 · 중급

경사 하강법(Gradient Descent)의 기본적인 원리를 설명하고, SGD(Stochastic Gradient Descent), Adam, RMSprop과 같은 다양한 최적화(Optimizer) 알고리즘들이 어떻게 경사 하강법을 개선하는지 각각의 특징과 장단점을 비교하여 설명해 주세요.

힌트 · 경사 하강법은 손실 함수의 기울기를 따라 최소값을 찾아갑니다. SGD는 배치 크기, Adam과 RMSprop은 학습률을 동적으로 조절하여 수렴 속도와 안정성을 향상시킵니다.

손실 함수학습률미분배치 크기모멘텀

모범답안

경사 하강법은 모델의 손실 함수를 최소화하는 파라미터를 찾는 기본적인 최적화 알고리즘입니다. 손실 함수의 기울기(gradient)를 계산하여, 기울기의 반대 방향으로 파라미터를 조금씩 업데이트하면서 손실을 줄여나가는 방식이죠.

SGD는 각 업데이트마다 하나의 데이터 샘플만 사용해서 계산 속도는 빠르지만, 업데이트 방향이 불안정할 수 있습니다.

Adam과 RMSprop은 학습률을 동적으로 조절하여 이러한 단점을 개선합니다. RMSprop은 과거 기울기의 지수 이동 평균을 사용하여 학습률을 조정하고, Adam은 RMSprop에 모멘텀 개념을 더해 업데이트 방향을 부드럽게 만들어 줍니다.

Adam은 일반적으로 좋은 성능을 보이지만, 데이터에 따라 RMSprop이 더 나은 경우도 있습니다. SGD는 단순하지만, 적절한 학습률 스케줄링과 함께 사용하면 좋은 성능을 낼 수 있습니다. 각 알고리즘은 장단점이 뚜렷하므로, 문제에 따라 적절한 알고리즘을 선택하는 것이 중요합니다.

읽었다면, 이제 직접 답해볼 차례예요

패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.

함께 보는 AI / 머신러닝 면접 질문

← AI / 머신러닝 면접 질문 전체 보기