AI / 데이터 · 중급
경사 하강법(Gradient Descent)의 기본적인 원리를 설명하고, SGD(Stochastic Gradient Descent), Adam, RMSprop과 같은 다양한 최적화(Optimizer) 알고리즘들이 어떻게 경사 하강법을 개선하는지 각각의 특징과 장단점을 비교하여 설명해 주세요.
힌트 · 경사 하강법은 손실 함수의 기울기를 따라 최소값을 찾아갑니다. SGD는 배치 크기, Adam과 RMSprop은 학습률을 동적으로 조절하여 수렴 속도와 안정성을 향상시킵니다.
손실 함수학습률미분배치 크기모멘텀
모범답안
경사 하강법은 모델의 손실 함수를 최소화하는 파라미터를 찾는 기본적인 최적화 알고리즘입니다. 손실 함수의 기울기(gradient)를 계산하여, 기울기의 반대 방향으로 파라미터를 조금씩 업데이트하면서 손실을 줄여나가는 방식이죠.
SGD는 각 업데이트마다 하나의 데이터 샘플만 사용해서 계산 속도는 빠르지만, 업데이트 방향이 불안정할 수 있습니다.
Adam과 RMSprop은 학습률을 동적으로 조절하여 이러한 단점을 개선합니다. RMSprop은 과거 기울기의 지수 이동 평균을 사용하여 학습률을 조정하고, Adam은 RMSprop에 모멘텀 개념을 더해 업데이트 방향을 부드럽게 만들어 줍니다.
Adam은 일반적으로 좋은 성능을 보이지만, 데이터에 따라 RMSprop이 더 나은 경우도 있습니다. SGD는 단순하지만, 적절한 학습률 스케줄링과 함께 사용하면 좋은 성능을 낼 수 있습니다. 각 알고리즘은 장단점이 뚜렷하므로, 문제에 따라 적절한 알고리즘을 선택하는 것이 중요합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 AI / 머신러닝 면접 질문
- 머신러닝 모델의 과적합(Overfitting)을 방지하기 위한 정규화(Regularization) 기법 중 L1 정규화, L2 정규화, 드롭아웃(Dropout)의 원리와 각각의 특징, 그리고 언제 어떤 기법을 사용하는 것이 적절한지 비교 설명해 주세요.
- 신경망에서 활성화 함수(Activation Function)의 역할은 무엇이며, ReLU, Sigmoid, Tanh 함수 각각의 특징과 장단점을 비교하고, 현대 딥러닝 모델에서 ReLU 계열 함수가 주로 사용되는 이유를 설명해 주세요.
- 머신러닝 모델 학습 시 사용되는 손실 함수(Loss Function)의 개념과 역할에 대해 설명하고, 회귀 문제에서 주로 사용되는 MSE(Mean Squared Error)와 분류 문제에서 주로 사용되는 Cross-Entropy 손실 함수를 비교하여 설명해 주세요.
- 분류(Classification) 모델의 성능을 평가할 때 사용되는 지표인 Precision, Recall, F1-score, 그리고 ROC-AUC의 개념을 각각 설명하고, 특정 상황(예: 암 진단, 스팸 메일 분류)에서 어떤 지표가 더 중요하게 고려될 수 있는지 구체적인 예시를 들어 설명해 주세요.
- 대규모 언어 모델(LLM)을 프로덕션 환경에 배포할 때, 서비스 지연 시간(latency)을 최소화하고 처리량(throughput)을 극대화하기 위한 아키텍처 설계 전략과 최적화 기법에 대해 설명하고, 특히 KV Cache, quantization, distillation의 적용 방안을 구체적인 예시와 함께 제시해 주십시오.
- 실제 서비스에 강화 학습(Reinforcement Learning) 에이전트를 적용할 때, 탐험(exploration)과 활용(exploitation)의 균형을 효과적으로 조절하기 위한 고급 전략에는 어떤 것들이 있으며, 특히 오프라인 RL(Offline RL) 기법이 이러한 문제 해결에 어떻게 기여할 수 있는지 설명해 주십시오.