AI / 데이터 · 기초
탐색적 데이터 분석(EDA)은 왜 중요하며, EDA를 수행할 때 주로 어떤 방법을 사용하시나요?
힌트 · 데이터의 패턴, 이상치, 관계를 파악하여 모델링 방향을 설정합니다. 시각화, 통계 요약 등을 활용합니다.
데이터 시각화가설 검정이상치 탐지데이터 요약변수 간 관계
모범답안
탐색적 데이터 분석(EDA)은 데이터 과학 프로젝트에서 매우 중요한 단계입니다. EDA를 통해 데이터의 특성을 파악하고, 숨겨진 패턴이나 이상치를 발견하여 모델링 방향을 설정할 수 있기 때문입니다. 잘못된 데이터로 모델을 만들면 성능이 떨어지거나 잘못된 결론을 내릴 수 있는데, EDA는 이러한 위험을 줄여줍니다.
EDA를 수행할 때는 다양한 방법을 사용합니다. 먼저, 데이터의 전체적인 모습을 파악하기 위해 기술 통계량(평균, 중앙값, 표준편차 등)을 확인하고, 히스토그램이나 박스 플롯과 같은 시각화 도구를 사용하여 데이터의 분포를 살펴봅니다. 변수 간의 관계를 파악하기 위해 산점도나 상관계수를 활용하기도 합니다. 또한, 이상치를 탐지하고 처리하는 것도 중요한 부분입니다. 필요에 따라 가설 검정을 통해 데이터에 대한 통계적 추론을 수행하기도 합니다. 이러한 과정을 통해 얻은 인사이트는 데이터 전처리, feature engineering, 모델 선택 등 후속 단계에 큰 영향을 미칩니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 데이터 사이언스란 무엇이며, 일반적인 데이터 분석과 어떤 차이가 있다고 생각하십니까?
- 데이터의 종류를 크게 범주형 데이터와 연속형 데이터로 나눌 수 있습니다. 각각의 특징과 실생활에서의 예시를 들어 설명해 주세요.
- 데이터 전처리 과정에서 결측치(Missing Value)를 발견했을 때, 이를 처리하는 주요 방법 세 가지를 설명해 주세요.
- 데이터의 중심 경향을 나타내는 대표적인 통계량으로 평균, 중앙값, 최빈값이 있습니다. 각 통계량이 어떤 상황에서 유용하게 사용되는지 설명해 주세요.
- 머신러닝의 주요 세 가지 유형인 지도 학습, 비지도 학습, 강화 학습에 대해 간략히 설명하고 각각의 대표적인 알고리즘 예시를 들어주세요.
- 머신러닝 모델에서 과적합(Overfitting)과 과소적합(Underfitting)은 무엇이며, 이 두 가지 문제를 해결하기 위한 기본적인 방법은 무엇이 있을까요?