AI / 데이터 · 기초
데이터의 중심 경향을 나타내는 대표적인 통계량으로 평균, 중앙값, 최빈값이 있습니다. 각 통계량이 어떤 상황에서 유용하게 사용되는지 설명해 주세요.
힌트 · 평균은 일반적이지만 이상치에 민감, 중앙값은 이상치에 강함, 최빈값은 범주형 데이터에 유용합니다.
평균중앙값최빈값이상치분포
모범답안
면접관님, 데이터의 중심 경향을 나타내는 평균, 중앙값, 최빈값은 데이터 분석에서 매우 중요한 기초 통계량입니다.
평균은 모든 값을 더해서 개수로 나눈 값으로, 계산이 쉽고 직관적입니다. 하지만 이상치에 매우 민감하다는 단점이 있습니다. 예를 들어, 연봉 데이터에 극단적으로 높은 연봉이 포함되어 있다면 평균 연봉이 실제보다 훨씬 높게 왜곡될 수 있습니다.
중앙값은 데이터를 크기 순서대로 나열했을 때 가장 가운데 있는 값입니다. 이상치의 영향을 덜 받기 때문에, 데이터에 극단값이 많을 때 데이터의 중심 경향을 더 잘 나타냅니다. 연봉 데이터처럼 이상치가 예상되는 경우에 평균보다 중앙값이 더 적절한 대표값이 될 수 있습니다.
최빈값은 데이터에서 가장 많이 나타나는 값입니다. 주로 범주형 데이터에서 유용하게 사용됩니다. 예를 들어, 좋아하는 색깔을 조사했을 때 가장 많은 사람이 선택한 색깔이 최빈값이 됩니다. 연속형 데이터에서도 사용할 수 있지만, 데이터가 특정 값에 몰려 있지 않으면 의미 있는 정보를 얻기 어려울 수 있습니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 데이터의 종류를 크게 범주형 데이터와 연속형 데이터로 나눌 수 있습니다. 각각의 특징과 실생활에서의 예시를 들어 설명해 주세요.
- 데이터 전처리 과정에서 결측치(Missing Value)를 발견했을 때, 이를 처리하는 주요 방법 세 가지를 설명해 주세요.
- 탐색적 데이터 분석(EDA)은 왜 중요하며, EDA를 수행할 때 주로 어떤 방법을 사용하시나요?
- 머신러닝의 주요 세 가지 유형인 지도 학습, 비지도 학습, 강화 학습에 대해 간략히 설명하고 각각의 대표적인 알고리즘 예시를 들어주세요.
- 머신러닝 모델에서 과적합(Overfitting)과 과소적합(Underfitting)은 무엇이며, 이 두 가지 문제를 해결하기 위한 기본적인 방법은 무엇이 있을까요?
- 머신러닝 모델에서 편향-분산 트레이드오프(Bias-Variance Trade-off)의 개념을 설명하고, 모델 복잡도와 이 트레이드오프가 어떻게 관련되는지 구체적인 예시를 들어 설명해 보세요.