머신러닝 모델 학습 시 사용되는 손실 함수(Loss Function)의 개념과 역할에 대해 설명하고, 회귀 문제에서 주로 사용되는 MSE(Mean Squared Error)와 분류 문제에서 주로 사용되는 Cross-Entropy 손실 함수를 비교하여 설명해 주세요.
힌트 · 손실 함수는 모델 예측과 실제 값의 차이를 측정하여 모델이 학습해야 할 방향을 제시합니다. MSE는 연속적인 값 예측에, Cross-Entropy는 확률 분포 간의 차이를 측정하는 데 적합합니다.
모범답안
손실 함수는 머신러닝 모델이 예측한 값과 실제 값 사이의 차이를 수치화하는 함수입니다. 모델 학습 과정에서 이 손실 함수의 값을 최소화하는 방향으로 모델의 파라미터를 조정하게 됩니다. 즉, 손실 함수는 모델이 얼마나 '잘못' 예측하고 있는지를 나타내는 지표이며, 모델이 학습해야 할 방향을 제시하는 역할을 합니다.
회귀 문제에서는 주로 MSE(Mean Squared Error)를 사용합니다. MSE는 예측값과 실제값의 차이의 제곱의 평균으로, 예측값들이 실제값 주변에 얼마나 흩어져 있는지를 나타냅니다. 값이 작을수록 모델의 예측 성능이 좋다고 할 수 있습니다.
반면, 분류 문제에서는 Cross-Entropy 손실 함수를 주로 사용합니다. Cross-Entropy는 예측 확률 분포와 실제 확률 분포 간의 차이를 측정합니다. 특히, 모델이 예측한 확률이 실제 레이블에 가까울수록 손실이 작아지도록 설계되어 있습니다. 예를 들어, 이미지를 '고양이' 또는 '강아지'로 분류하는 문제에서 모델이 '고양이'일 확률을 90%로 예측했는데 실제 레이블이 '고양이'라면 손실이 작아지고, '강아지'라면 손실이 커지는 방식입니다. MSE는 연속적인 값을 예측하는 데 적합하고, Cross-Entropy는 확률 분포를 예측하는 데 적합하다는 차이가 있습니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 AI / 머신러닝 면접 질문
- 머신러닝 모델의 편향-분산 트레이드오프(Bias-Variance Trade-off) 개념을 설명하고, 모델의 복잡도 변화에 따라 편향과 분산이 어떻게 변화하는지 구체적인 예를 들어 설명해 주세요.
- 머신러닝 모델의 과적합(Overfitting)을 방지하기 위한 정규화(Regularization) 기법 중 L1 정규화, L2 정규화, 드롭아웃(Dropout)의 원리와 각각의 특징, 그리고 언제 어떤 기법을 사용하는 것이 적절한지 비교 설명해 주세요.
- 신경망에서 활성화 함수(Activation Function)의 역할은 무엇이며, ReLU, Sigmoid, Tanh 함수 각각의 특징과 장단점을 비교하고, 현대 딥러닝 모델에서 ReLU 계열 함수가 주로 사용되는 이유를 설명해 주세요.
- 경사 하강법(Gradient Descent)의 기본적인 원리를 설명하고, SGD(Stochastic Gradient Descent), Adam, RMSprop과 같은 다양한 최적화(Optimizer) 알고리즘들이 어떻게 경사 하강법을 개선하는지 각각의 특징과 장단점을 비교하여 설명해 주세요.
- 분류(Classification) 모델의 성능을 평가할 때 사용되는 지표인 Precision, Recall, F1-score, 그리고 ROC-AUC의 개념을 각각 설명하고, 특정 상황(예: 암 진단, 스팸 메일 분류)에서 어떤 지표가 더 중요하게 고려될 수 있는지 구체적인 예시를 들어 설명해 주세요.
- 대규모 언어 모델(LLM)을 프로덕션 환경에 배포할 때, 서비스 지연 시간(latency)을 최소화하고 처리량(throughput)을 극대화하기 위한 아키텍처 설계 전략과 최적화 기법에 대해 설명하고, 특히 KV Cache, quantization, distillation의 적용 방안을 구체적인 예시와 함께 제시해 주십시오.