AI / 데이터 · 기초
머신러닝 모델 학습 과정에서 훈련 데이터(Training Data)의 역할과 중요성에 대해 설명해주세요.
힌트 · 모델이 패턴을 학습하고 예측 능력을 개발하는 데 사용되는 데이터이며, 데이터의 양과 품질이 모델 성능에 큰 영향을 미칩니다.
모델_학습일반화과적합_방지특징_추출데이터_품질
모범답안
훈련 데이터는 머신러닝 모델이 학습하는 데 사용되는 가장 기본적인 재료입니다. 모델은 훈련 데이터를 통해 데이터의 패턴, 특징, 그리고 정답(레이블) 간의 관계를 학습하고, 이를 바탕으로 새로운 데이터에 대한 예측 능력을 갖추게 됩니다.
훈련 데이터의 양과 질은 모델 성능에 직접적인 영향을 미칩니다. 충분한 양의 데이터를 확보해야 모델이 다양한 상황에 대한 일반화 능력을 키울 수 있습니다. 또한, 데이터의 품질이 낮으면 모델이 잘못된 패턴을 학습하여 예측 정확도가 떨어질 수 있습니다.
따라서 훈련 데이터를 준비할 때는 데이터의 양뿐만 아니라 품질 관리에도 신경 써야 합니다. 이상치 제거, 결측치 처리, 데이터 정규화 등의 전처리 과정을 통해 데이터 품질을 향상시키는 것이 중요합니다. 또한, 과적합을 방지하기 위해 데이터 증강 기법을 활용하거나, 정규화 방법을 적용하기도 합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 AI / 머신러닝 면접 질문
- 지도 학습(Supervised Learning)이란 무엇인지 설명하고, 실제 데이터에서 어떤 문제 해결에 주로 사용되는지 예시를 들어 설명해주세요.
- 비지도 학습(Unsupervised Learning)이란 무엇이며, 지도 학습과의 주요 차이점은 무엇입니까?
- 강화 학습(Reinforcement Learning)의 기본적인 개념과 주요 구성 요소(에이전트, 환경, 보상)에 대해 설명해주세요.
- 머신러닝 모델 학습 시 오버피팅(Overfitting)과 언더피팅(Underfitting)이 발생하는 원인을 설명하고, 각각을 해결하기 위한 구체적인 방법들을 제시해 보세요.
- 머신러닝 모델의 편향-분산 트레이드오프(Bias-Variance Trade-off) 개념을 설명하고, 모델의 복잡도 변화에 따라 편향과 분산이 어떻게 변화하는지 구체적인 예를 들어 설명해 주세요.
- 머신러닝 모델의 과적합(Overfitting)을 방지하기 위한 정규화(Regularization) 기법 중 L1 정규화, L2 정규화, 드롭아웃(Dropout)의 원리와 각각의 특징, 그리고 언제 어떤 기법을 사용하는 것이 적절한지 비교 설명해 주세요.