패스잇
AI / 데이터 · 중급

데이터 전처리 과정에서 특성 스케일링(Feature Scaling)이 필요한 이유를 설명하고, 대표적인 방법인 표준화(Standardization)와 정규화(Normalization)의 차이점 및 각각의 적용 사례를 비교하여 설명해 보세요.

힌트 · 스케일링은 알고리즘의 성능 향상과 수렴 속도 개선에 기여하며, 표준화는 평균 0, 분산 1로, 정규화는 0과 1 사이로 데이터를 조정합니다.

특성 스케일링표준화정규화RobustScalerMinMaxScaler

모범답안

특성 스케일링은 모델의 성능 향상과 학습 속도 개선을 위해 필요합니다. 특히, 특성들의 스케일이 크게 다를 경우, 일부 알고리즘은 특정 특성에 과도하게 민감하게 반응할 수 있습니다.

표준화(Standardization)는 데이터의 평균을 0, 분산을 1로 조정하여 정규 분포에 가깝게 만듭니다. 이상치에 덜 민감하며, 일반적으로 대부분의 경우에 잘 작동합니다. 예를 들어, 키와 몸무게처럼 단위가 다르고 범위 차이가 큰 데이터를 다룰 때 유용합니다.

정규화(Normalization)는 데이터를 0과 1 사이의 값으로 변환합니다. MinMaxScaler가 대표적이며, 데이터가 특정 범위 내에 있을 때 효과적입니다. 이미지 픽셀 값을 0과 1 사이로 조정하는 경우에 사용할 수 있습니다.

데이터에 이상치가 많다면, 표준화 대신 RobustScaler를 사용하는 것이 좋습니다. RobustScaler는 중앙값과 IQR을 사용하여 이상치의 영향을 줄입니다.

읽었다면, 이제 직접 답해볼 차례예요

패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.

함께 보는 데이터 사이언스 면접 질문

← 데이터 사이언스 면접 질문 전체 보기