패스잇

AI / 데이터

데이터 사이언스 면접 질문

가설 검정과 표본 분포, A/B 테스트, 상관과 인과, 피처 엔지니어링, EDA — 데이터 사이언스 면접은 모델링보다 "데이터로 올바른 결론을 끌어내는 통계적 사고"를 봅니다. 분석 실무에서 바로 묻는 질문을 모범답안으로 담았습니다.

총 21문제 · 기초 7 · 중급 7 · 심화 7 · 모범답안 포함

데이터 사이언스 면접 질문 — 기초

Q1 기초

데이터 사이언스란 무엇이며, 일반적인 데이터 분석과 어떤 차이가 있다고 생각하십니까?

힌트 · 데이터 사이언스는 데이터 분석을 넘어 예측, 의사결정 지원, 문제 해결을 목표로 합니다. 통계, 머신러닝, 프로그래밍 지식을 활용합니다.

데이터 사이언스는 단순히 데이터를 분석하는 것을 넘어, 데이터를 활용해 미래를 예측하고, 의사 결정을 돕고, 궁극적으로 문제를 해결하는 학문입니다.

전체 모범답안 펼치기

데이터 사이언스는 단순히 데이터를 분석하는 것을 넘어, 데이터를 활용해 미래를 예측하고, 의사 결정을 돕고, 궁극적으로 문제를 해결하는 학문입니다.

일반적인 데이터 분석은 과거의 데이터를 요약하고 시각화하여 현재 상황을 파악하는 데 집중하는 반면, 데이터 사이언스는 통계적 모델링, 머신러닝 등의 기법을 활용하여 미래를 예측하고, 데이터 간의 인과관계를 추론하며, 데이터 기반의 의사 결정을 지원하는 데 더 큰 비중을 둡니다. 예를 들어, 데이터 분석은 매출 데이터를 분석하여 어떤 제품이 잘 팔리는지 파악하는 데 그칠 수 있지만, 데이터 사이언스는 고객 데이터를 분석하여 어떤 고객에게 어떤 제품을 추천해야 매출이 증가할지 예측하는 데 활용될 수 있습니다.

#통계적 모델링#머신러닝#인과관계 추론#예측 분석#데이터 기반 의사결정

이 질문 단독 페이지 →

Q2 기초

데이터의 종류를 크게 범주형 데이터와 연속형 데이터로 나눌 수 있습니다. 각각의 특징과 실생활에서의 예시를 들어 설명해 주세요.

힌트 · 범주형은 이산적인 값, 연속형은 무한한 값입니다. 명목/순서형, 구간/비율형으로 세분화될 수 있습니다.

면접관님, 데이터는 크게 범주형 데이터와 연속형 데이터로 나눌 수 있습니다.

전체 모범답안 펼치기

면접관님, 데이터는 크게 범주형 데이터와 연속형 데이터로 나눌 수 있습니다.

범주형 데이터는 몇 개의 정해진 범주, 즉 이산적인 값으로 표현되는 데이터를 말합니다. 예를 들어, 혈액형(A, B, O, AB)이나 거주 지역(서울, 경기, 강원) 등이 있습니다. 범주형 데이터는 다시 명목형과 순서형으로 나눌 수 있는데, 명목형은 단순히 분류를 위한 것이고 순서형은 순위나 서열을 나타냅니다.

반면 연속형 데이터는 측정 가능한 모든 값, 즉 무한한 값을 가질 수 있는 데이터를 의미합니다. 키, 몸무게, 온도 등이 대표적인 예시입니다. 연속형 데이터는 구간형과 비율형으로 나뉘는데, 구간형은 0의 의미가 없고 비율형은 0이 절대적인 기준점을 가집니다. 예를 들어, 온도는 구간형이고, 길이는 비율형 데이터입니다.

#범주형 데이터#연속형 데이터#명목 척도#등간 척도#비율 척도

이 질문 단독 페이지 →

Q3 기초

데이터 전처리 과정에서 결측치(Missing Value)를 발견했을 때, 이를 처리하는 주요 방법 세 가지를 설명해 주세요.

힌트 · 결측치 제거, 평균/중앙값/최빈값 대체, 예측 모델을 이용한 대체 등이 있습니다.

면접관님, 데이터 전처리 시 결측치 처리 방법은 크게 세 가지로 나눌 수 있습니다.

전체 모범답안 펼치기

면접관님, 데이터 전처리 시 결측치 처리 방법은 크게 세 가지로 나눌 수 있습니다.

첫째, 결측치가 있는 행 또는 열을 삭제하는 방법입니다. 이는 간단하지만, 데이터 손실을 초래할 수 있으므로 결측치 비율이 낮을 때 고려합니다.

둘째, 평균, 중앙값, 최빈값 등으로 결측치를 대체하는 방법입니다. 데이터 분포에 따라 적절한 값을 선택해야 하며, 특히 중앙값은 이상치에 덜 민감합니다. 예를 들어, pandas에서는 df['column'].fillna(df['column'].mean())과 같이 사용할 수 있습니다.

셋째, 머신러닝 모델을 활용하여 결측치를 예측하고 대체하는 방법입니다. 다른 변수들과의 관계를 고려하여 더 정확한 대체가 가능하지만, 모델 구축 및 검증에 시간이 소요될 수 있습니다. 어떤 방법을 선택할지는 결측치의 유형, 데이터의 특성, 그리고 분석 목적에 따라 신중하게 결정해야 합니다.

#결측치 유형 분석#대체 (Imputation)#삭제 (Deletion)#모델 기반 예측#데이터 편향

이 질문 단독 페이지 →

Q4 기초

탐색적 데이터 분석(EDA)은 왜 중요하며, EDA를 수행할 때 주로 어떤 방법을 사용하시나요?

힌트 · 데이터의 패턴, 이상치, 관계를 파악하여 모델링 방향을 설정합니다. 시각화, 통계 요약 등을 활용합니다.

탐색적 데이터 분석(EDA)은 데이터 과학 프로젝트에서 매우 중요한 단계입니다. EDA를 통해 데이터의 특성을 파악하고, 숨겨진 패턴이나 이상치를 발견하여 모델링 방향을 설정할 수 있기 때문입니다. 잘못된 데이터로…

전체 모범답안 펼치기

탐색적 데이터 분석(EDA)은 데이터 과학 프로젝트에서 매우 중요한 단계입니다. EDA를 통해 데이터의 특성을 파악하고, 숨겨진 패턴이나 이상치를 발견하여 모델링 방향을 설정할 수 있기 때문입니다. 잘못된 데이터로 모델을 만들면 성능이 떨어지거나 잘못된 결론을 내릴 수 있는데, EDA는 이러한 위험을 줄여줍니다.

EDA를 수행할 때는 다양한 방법을 사용합니다. 먼저, 데이터의 전체적인 모습을 파악하기 위해 기술 통계량(평균, 중앙값, 표준편차 등)을 확인하고, 히스토그램이나 박스 플롯과 같은 시각화 도구를 사용하여 데이터의 분포를 살펴봅니다. 변수 간의 관계를 파악하기 위해 산점도나 상관계수를 활용하기도 합니다. 또한, 이상치를 탐지하고 처리하는 것도 중요한 부분입니다. 필요에 따라 가설 검정을 통해 데이터에 대한 통계적 추론을 수행하기도 합니다. 이러한 과정을 통해 얻은 인사이트는 데이터 전처리, feature engineering, 모델 선택 등 후속 단계에 큰 영향을 미칩니다.

#데이터 시각화#가설 검정#이상치 탐지#데이터 요약#변수 간 관계

이 질문 단독 페이지 →

Q5 기초

데이터의 중심 경향을 나타내는 대표적인 통계량으로 평균, 중앙값, 최빈값이 있습니다. 각 통계량이 어떤 상황에서 유용하게 사용되는지 설명해 주세요.

힌트 · 평균은 일반적이지만 이상치에 민감, 중앙값은 이상치에 강함, 최빈값은 범주형 데이터에 유용합니다.

면접관님, 데이터의 중심 경향을 나타내는 평균, 중앙값, 최빈값은 데이터 분석에서 매우 중요한 기초 통계량입니다.

전체 모범답안 펼치기

면접관님, 데이터의 중심 경향을 나타내는 평균, 중앙값, 최빈값은 데이터 분석에서 매우 중요한 기초 통계량입니다.

평균은 모든 값을 더해서 개수로 나눈 값으로, 계산이 쉽고 직관적입니다. 하지만 이상치에 매우 민감하다는 단점이 있습니다. 예를 들어, 연봉 데이터에 극단적으로 높은 연봉이 포함되어 있다면 평균 연봉이 실제보다 훨씬 높게 왜곡될 수 있습니다.

중앙값은 데이터를 크기 순서대로 나열했을 때 가장 가운데 있는 값입니다. 이상치의 영향을 덜 받기 때문에, 데이터에 극단값이 많을 때 데이터의 중심 경향을 더 잘 나타냅니다. 연봉 데이터처럼 이상치가 예상되는 경우에 평균보다 중앙값이 더 적절한 대표값이 될 수 있습니다.

최빈값은 데이터에서 가장 많이 나타나는 값입니다. 주로 범주형 데이터에서 유용하게 사용됩니다. 예를 들어, 좋아하는 색깔을 조사했을 때 가장 많은 사람이 선택한 색깔이 최빈값이 됩니다. 연속형 데이터에서도 사용할 수 있지만, 데이터가 특정 값에 몰려 있지 않으면 의미 있는 정보를 얻기 어려울 수 있습니다.

#평균#중앙값#최빈값#이상치#분포

이 질문 단독 페이지 →

Q6 기초

머신러닝의 주요 세 가지 유형인 지도 학습, 비지도 학습, 강화 학습에 대해 간략히 설명하고 각각의 대표적인 알고리즘 예시를 들어주세요.

힌트 · 지도 학습은 레이블 데이터 사용(회귀, 분류), 비지도 학습은 레이블 없이 패턴 발견(클러스터링), 강화 학습은 보상 기반 학습입니다.

머신러닝은 크게 지도 학습, 비지도 학습, 강화 학습 세 가지 유형으로 나눌 수 있습니다.

전체 모범답안 펼치기

머신러닝은 크게 지도 학습, 비지도 학습, 강화 학습 세 가지 유형으로 나눌 수 있습니다.

지도 학습은 레이블이 있는 데이터를 사용하여 모델을 학습시키는 방법입니다. 예를 들어, 스팸 메일 분류처럼 메일 내용을 보고 스팸인지 아닌지 예측하는 분류 문제가 있고, 집 크기와 방 개수를 가지고 집 가격을 예측하는 회귀 문제가 있습니다. 대표적인 알고리즘으로는 선형 회귀, 로지스틱 회귀, 의사 결정 트리, 서포트 벡터 머신(SVM) 등이 있습니다.

비지도 학습은 레이블이 없는 데이터를 사용하여 데이터의 숨겨진 패턴이나 구조를 찾는 방법입니다. 고객 데이터를 분석하여 비슷한 성향의 그룹으로 묶는 클러스터링이 대표적인 예시입니다. K-평균 클러스터링, DBSCAN 등이 있습니다.

강화 학습은 에이전트가 환경과 상호작용하면서 보상을 최대화하는 방향으로 학습하는 방법입니다. 예를 들어, 게임에서 승리하는 방법을 스스로 학습하거나, 로봇이 특정 작업을 수행하는 방법을 배우는 데 사용됩니다. Q-러닝, SARSA, 심층 강화 학습(Deep Reinforcement Learning) 등이 있습니다.

#지도 학습#비지도 학습#강화 학습#분류#군집화

이 질문 단독 페이지 →

Q7 기초

머신러닝 모델에서 과적합(Overfitting)과 과소적합(Underfitting)은 무엇이며, 이 두 가지 문제를 해결하기 위한 기본적인 방법은 무엇이 있을까요?

힌트 · 과적합은 모델이 훈련 데이터에 너무 맞춰진 경우, 과소적합은 충분히 학습되지 않은 경우입니다. 데이터 증강, 정규화, 모델 복잡도 조절 등으로 해결할 수 있습니다.

면접관님, 머신러닝 모델에서 과적합과 과소적합은 모델의 성능을 평가하고 개선하는 데 중요한 개념입니다.

전체 모범답안 펼치기

면접관님, 머신러닝 모델에서 과적합과 과소적합은 모델의 성능을 평가하고 개선하는 데 중요한 개념입니다.

과적합은 모델이 훈련 데이터에는 지나치게 잘 맞지만, 실제 새로운 데이터에는 제대로 작동하지 못하는 현상입니다. 마치 시험 문제만 외워서 풀고 응용 문제에는 약한 학생과 같습니다. 해결 방법으로는 더 많은 데이터를 확보하거나, 정규화(L1, L2 규제)를 통해 모델의 복잡도를 줄이거나, 교차 검증을 통해 모델을 평가하는 방법 등이 있습니다. 데이터 증강도 좋은 방법입니다.

반대로 과소적합은 모델이 너무 단순해서 훈련 데이터조차 제대로 학습하지 못하는 경우입니다. 이 경우에는 모델의 복잡도를 높이거나, 더 많은 특징을 추가하거나, 더 긴 시간 동안 학습시키는 방법 등을 고려할 수 있습니다. 더 강력한 모델을 사용하는 것도 방법입니다.

#과적합#과소적합#규제#교차 검증#데이터 증강

이 질문 단독 페이지 →

읽기만으론 부족합니다 — 직접 말해보세요

패스잇 앱에서 데이터 사이언스 질문에 직접 답하면 AI가 1:1로 답변을 코칭합니다.

데이터 사이언스 면접 질문 — 중급

Q8 중급

머신러닝 모델에서 편향-분산 트레이드오프(Bias-Variance Trade-off)의 개념을 설명하고, 모델 복잡도와 이 트레이드오프가 어떻게 관련되는지 구체적인 예시를 들어 설명해 보세요.

힌트 · 편향은 모델의 단순성으로 인한 오류, 분산은 모델의 복잡도로 인한 훈련 데이터에 대한 과도한 민감성을 의미하며, 둘 사이의 균형점을 찾는 것이 중요합니다.

면접관님, 머신러닝 모델의 편향분산 트레이드오프는 모델이 얼마나 정확하고 안정적인 예측을 하는지에 대한 중요한 개념입니다.

전체 모범답안 펼치기

면접관님, 머신러닝 모델의 편향-분산 트레이드오프는 모델이 얼마나 정확하고 안정적인 예측을 하는지에 대한 중요한 개념입니다.

편향은 모델이 너무 단순해서 데이터의 복잡한 패턴을 제대로 학습하지 못하는 경우 발생합니다. 이를 과소적합이라고 하며, 훈련 데이터와 테스트 데이터 모두에서 낮은 성능을 보입니다. 반면, 분산은 모델이 너무 복잡해서 훈련 데이터에만 지나치게 맞춰진 경우 발생합니다. 이를 과적합이라고 하며, 훈련 데이터에서는 높은 성능을 보이지만, 새로운 데이터에서는 성능이 떨어집니다.

예를 들어, 집 값을 예측하는 모델을 생각해 보겠습니다. 선형 회귀 모델은 단순해서 편향이 높을 수 있습니다. 반대로, 매우 복잡한 결정 트리 모델은 훈련 데이터의 모든 세부 사항을 학습하여 분산이 높을 수 있습니다. 따라서, 적절한 복잡도의 모델을 선택하여 편향과 분산 사이의 균형을 맞추는 것이 중요합니다. 이를 위해 교차 검증 등을 활용하여 모델의 성능을 평가하고, 규제 기법 등을 사용하여 모델의 복잡도를 조절할 수 있습니다.

#편향#분산#과소적합#과적합#모델 복잡도

이 질문 단독 페이지 →

Q9 중급

Gradient Boosting과 Random Forest는 대표적인 앙상블 학습 방법입니다. 두 방법의 주요 차이점과 각각의 장단점을 설명하고, 어떤 상황에서 어떤 방법을 선택하는 것이 더 유리한지 논의해 보세요.

힌트 · Gradient Boosting은 순차적 학습을 통해 이전 모델의 오차를 보완하고, Random Forest는 독립적인 여러 트리를 병렬로 학습시킨 후 결과를 집계합니다.

Gradient Boosting과 Random Forest는 앙상블 학습의 대표적인 방법이지만, 학습 방식과 목표에서 차이가 있습니다. Random Forest는 배깅(Bagging) 기반으로, 여러 개의 결정 트리…

전체 모범답안 펼치기

Gradient Boosting과 Random Forest는 앙상블 학습의 대표적인 방법이지만, 학습 방식과 목표에서 차이가 있습니다. Random Forest는 배깅(Bagging) 기반으로, 여러 개의 결정 트리를 독립적으로 학습시켜 결과를 평균냅니다. 분산을 줄여 과적합을 방지하는 데 효과적이며, 비교적 빠른 속도를 가집니다.

반면 Gradient Boosting은 부스팅(Boosting) 기반으로, 이전 모델의 오차를 보완하는 방식으로 순차적으로 학습합니다. 따라서 Random Forest보다 높은 예측 성능을 보이는 경우가 많지만, 과적합 가능성이 높고 학습 시간이 오래 걸릴 수 있습니다.

일반적으로 Random Forest는 비교적 간단한 문제나 빠른 속도가 중요한 경우에 유리하며, Gradient Boosting은 높은 정확도가 필요한 복잡한 문제에 더 적합합니다. 데이터의 특성과 요구되는 성능, 그리고 계산 자원을 고려하여 적절한 방법을 선택해야 합니다.

#배깅(Bagging)#부스팅(Boosting)#결정 트리#과적합#편향-분산 트레이드오프

이 질문 단독 페이지 →

Q10 중급

머신러닝 모델에서 과적합을 방지하기 위한 정규화(Regularization) 기법인 L1과 L2 정규화의 원리와 차이점을 설명하고, 각각이 모델의 가중치에 어떤 효과를 가져오는지 예시를 들어 설명해 보세요.

힌트 · L1은 가중치를 0으로 만들어 특성 선택 효과가 있고, L2는 가중치를 작게 유지하여 모델의 복잡도를 줄이는 데 기여합니다.

면접관님, L1, L2 정규화는 모델의 과적합을 막기 위해 사용하는 대표적인 기법입니다. 둘 다 모델의 복잡도를 줄여 일반화 성능을 높이는 데 목적이 있습니다.

전체 모범답안 펼치기

면접관님, L1, L2 정규화는 모델의 과적합을 막기 위해 사용하는 대표적인 기법입니다. 둘 다 모델의 복잡도를 줄여 일반화 성능을 높이는 데 목적이 있습니다.

L1 정규화는 손실 함수에 가중치의 절대값 합을 더하는 방식입니다. 특징으로는 일부 가중치를 정확히 0으로 만들 수 있다는 점입니다. 이는 모델에서 중요하지 않은 특성을 자동으로 제거하는 효과를 가져와, 모델을 더 단순하고 해석하기 쉽게 만들어 줍니다. 예를 들어, 100개의 특성 중 10개만 중요한 경우, L1 정규화를 통해 나머지 90개의 가중치를 0으로 만들어 불필요한 특성을 제거할 수 있습니다.

반면 L2 정규화는 손실 함수에 가중치 제곱의 합을 더합니다. L2 정규화는 가중치를 0에 가깝게 만들지만, 정확히 0으로 만들지는 않습니다. 모든 특성을 조금씩 활용하면서 가중치를 작게 유지하여 모델의 복잡도를 줄이는 데 기여합니다. 릿지 회귀가 L2 정규화를 사용하는 대표적인 예시입니다.

따라서 L1은 희소한 모델을 만들 때, L2는 모든 특성을 활용하면서 안정적인 모델을 만들 때 유용합니다. 상황에 따라 적절한 정규화 방식을 선택하는 것이 중요합니다.

#L1 정규화#L2 정규화#가중치 감소#희소성#릿지 회귀

이 질문 단독 페이지 →

Q11 중급

머신러닝 모델 평가 시 교차 검증(Cross-Validation)이 필요한 이유와 K-Fold Cross-Validation의 동작 원리를 설명하고, 이 방법이 모델의 일반화 성능 평가에 어떻게 기여하는지 설명해 보세요.

힌트 · 교차 검증은 데이터 분할의 무작위성을 줄여 모델의 일반화 성능을 신뢰성 있게 평가하며, 과적합 방지에도 도움을 줍니다.

머신러닝 모델을 평가할 때 교차 검증은 필수적입니다. 단 한 번의 데이터 분할로 모델 성능을 평가하면, 우연히 특정 데이터셋에만 잘 맞는 모델이 나올 수 있습니다. 이를 과적합이라고 하는데, 교차 검증은 이러한 편향…

전체 모범답안 펼치기

머신러닝 모델을 평가할 때 교차 검증은 필수적입니다. 단 한 번의 데이터 분할로 모델 성능을 평가하면, 우연히 특정 데이터셋에만 잘 맞는 모델이 나올 수 있습니다. 이를 과적합이라고 하는데, 교차 검증은 이러한 편향을 줄여 모델의 일반화 성능을 더 신뢰성 있게 측정하도록 돕습니다.

K-Fold 교차 검증은 전체 데이터를 K개의 동일한 크기의 폴드(fold)로 나눕니다. 그리고 K번의 반복을 수행하는데, 각 반복마다 하나의 폴드를 테스트셋으로 사용하고 나머지 K-1개의 폴드를 훈련셋으로 사용합니다. 이렇게 모든 폴드가 한 번씩은 테스트셋으로 사용되므로, 데이터 분할의 무작위성에 덜 영향을 받게 됩니다.

결과적으로 K번의 평가 결과를 평균 내어 최종 모델 성능을 산출합니다. 이는 모델이 다양한 데이터 샘플에 대해 얼마나 일관되게 좋은 성능을 보이는지를 보여주므로, 실제 서비스 환경에서의 일반화 성능을 더 정확하게 예측할 수 있게 해줍니다. 이는 결국 편향-분산 트레이드오프에서 분산을 줄여 모델의 안정성을 높이는 데 기여합니다.

#과적합#일반화 성능#K-Fold#데이터 분할#편향-분산 트레이드오프

이 질문 단독 페이지 →

Q12 중급

분류 모델의 성능을 평가할 때 정확도(Accuracy) 외에 정밀도(Precision), 재현율(Recall), F1-Score와 같은 다른 지표들이 왜 필요한지 설명하고, 각 지표가 어떤 상황에서 중요하게 활용되는지 구체적인 예시를 들어 설명해 보세요.

힌트 · 정확도는 불균형 데이터셋에서 오해를 줄 수 있으며, 각 지표는 오분류의 유형(False Positive, False Negative)에 따라 중요도가 달라집니다.

분류 모델 성능 평가 시 정확도만으로는 부족한 경우가 많습니다. 특히 데이터 불균형이 심할 때 정확도는 높은 값을 보이지만 실제 성능을 제대로 반영하지 못할 수 있습니다.

전체 모범답안 펼치기

분류 모델 성능 평가 시 정확도만으로는 부족한 경우가 많습니다. 특히 데이터 불균형이 심할 때 정확도는 높은 값을 보이지만 실제 성능을 제대로 반영하지 못할 수 있습니다.

정밀도는 모델이 True라고 예측한 것 중 실제 True의 비율을 나타냅니다. 스팸 메일 분류에서 정밀도가 높다면, 스팸 메일이라고 분류한 것 중 실제로 스팸 메일인 비율이 높다는 의미입니다. 중요한 메일이 스팸으로 분류되는 것을 최소화해야 할 때 중요합니다.

재현율은 실제 True인 것 중 모델이 True라고 예측한 비율입니다. 암 진단 모델에서 재현율이 높다면, 실제로 암 환자를 암 환자로 정확하게 진단하는 비율이 높다는 의미입니다. 암 환자를 놓치는 것을 최소화해야 할 때 중요합니다.

F1-Score는 정밀도와 재현율의 조화 평균으로, 두 지표를 균형 있게 고려합니다. 어떤 지표가 더 중요한지 판단하기 어려울 때 유용하게 사용됩니다.

이처럼 각 지표는 오분류의 유형(False Positive, False Negative)에 따라 중요도가 달라지므로, 상황에 맞는 지표를 선택하여 모델을 평가해야 합니다.

#불균형 데이터#오차 행렬#정밀도-재현율 트레이드오프#임계값#비용 민감 학습

이 질문 단독 페이지 →

Q13 중급

데이터 전처리 과정에서 특성 스케일링(Feature Scaling)이 필요한 이유를 설명하고, 대표적인 방법인 표준화(Standardization)와 정규화(Normalization)의 차이점 및 각각의 적용 사례를 비교하여 설명해 보세요.

힌트 · 스케일링은 알고리즘의 성능 향상과 수렴 속도 개선에 기여하며, 표준화는 평균 0, 분산 1로, 정규화는 0과 1 사이로 데이터를 조정합니다.

특성 스케일링은 모델의 성능 향상과 학습 속도 개선을 위해 필요합니다. 특히, 특성들의 스케일이 크게 다를 경우, 일부 알고리즘은 특정 특성에 과도하게 민감하게 반응할 수 있습니다.

전체 모범답안 펼치기

특성 스케일링은 모델의 성능 향상과 학습 속도 개선을 위해 필요합니다. 특히, 특성들의 스케일이 크게 다를 경우, 일부 알고리즘은 특정 특성에 과도하게 민감하게 반응할 수 있습니다.

표준화(Standardization)는 데이터의 평균을 0, 분산을 1로 조정하여 정규 분포에 가깝게 만듭니다. 이상치에 덜 민감하며, 일반적으로 대부분의 경우에 잘 작동합니다. 예를 들어, 키와 몸무게처럼 단위가 다르고 범위 차이가 큰 데이터를 다룰 때 유용합니다.

정규화(Normalization)는 데이터를 0과 1 사이의 값으로 변환합니다. MinMaxScaler가 대표적이며, 데이터가 특정 범위 내에 있을 때 효과적입니다. 이미지 픽셀 값을 0과 1 사이로 조정하는 경우에 사용할 수 있습니다.

데이터에 이상치가 많다면, 표준화 대신 RobustScaler를 사용하는 것이 좋습니다. RobustScaler는 중앙값과 IQR을 사용하여 이상치의 영향을 줄입니다.

#특성 스케일링#표준화#정규화#RobustScaler#MinMaxScaler

이 질문 단독 페이지 →

Q14 중급

실제 데이터에서 결측치(Missing Data)가 발생하는 원인과 이를 처리하기 위한 다양한 전략(예: 제거, 대체)을 설명하고, 각 전략의 장단점 및 데이터 특성에 따른 적절한 처리 방법을 논의해 보세요.

힌트 · 결측치 유형(MAR, MCAR, NMAR)을 고려하여 제거 또는 대체 방법을 선택하며, 대체의 경우 평균, 중앙값, 최빈값, 모델 기반 방법 등이 있습니다.

면접관님, 결측치는 실제 데이터 분석에서 흔히 발생하는 문제입니다. 발생하는 원인은 크게 세 가지 유형으로 나눌 수 있습니다. 완전히 무작위 결측(MCAR), 무작위 결측(MAR), 비무작위 결측(NMAR)입니다.

전체 모범답안 펼치기

면접관님, 결측치는 실제 데이터 분석에서 흔히 발생하는 문제입니다. 발생하는 원인은 크게 세 가지 유형으로 나눌 수 있습니다. 완전히 무작위 결측(MCAR), 무작위 결측(MAR), 비무작위 결측(NMAR)입니다.

결측치 처리 전략으로는 크게 제거와 대체 방법이 있습니다. 제거는 간단하지만 데이터 손실이 크고, 특히 NMAR인 경우 편향을 유발할 수 있습니다.

대체 방법은 평균, 중앙값, 최빈값 등을 사용하는 간단한 방법과, 회귀 모델이나 k-NN 알고리즘을 활용하는 복잡한 방법이 있습니다. 간단한 방법은 구현이 쉽지만 데이터의 분산을 왜곡할 수 있고, 복잡한 방법은 더 정확하지만 모델 구축에 노력이 필요합니다.

데이터 특성에 따라 적절한 방법을 선택해야 합니다. MCAR인 경우에는 제거해도 큰 문제가 없지만, MAR이나 NMAR인 경우에는 대체 방법을 사용하는 것이 좋습니다. 또한, 결측치가 많은 변수는 제거하는 것보다 대체하는 것이 더 나을 수 있습니다. 중요한 것은 각 방법의 장단점을 이해하고, 데이터의 특성을 고려하여 최적의 방법을 선택하는 것입니다.

#결측치 유형#MCAR/MAR/MNAR#결측치 제거#결측치 대체#편향 발생 가능성

이 질문 단독 페이지 →

데이터 사이언스 면접 질문 — 심화

Q15 심화

서비스 개선을 위해 A/B 테스트를 설계했습니다. 하지만 테스트 결과가 예상과 달리 명확한 인과 관계를 보여주지 못하고 혼란 변수(confounding variables)의 영향이 의심되는 상황입니다. 이러한 상황에서 A/B 테스트의 한계를 극복하고 신뢰할 수 있는 인과 관계를 추론하기 위한 고급 통계적 또는 머신러닝 기반 접근 방식은 무엇이 있으며, 각 방법의 가정과 적용 시 고려사항을 설명해주세요.

힌트 · 도구 변수(Instrumental Variables), 경향 점수 매칭(Propensity Score Matching), 이중 강건 추정(Doubly Robust Estimation) 등의 방법을 고려하고, 각 방법의 강점과 약점, 핵심 가정을 설명하세요.

A/B 테스트 결과가 명확하지 않다면, 몇 가지 고급 통계 방법을 고려해볼 수 있습니다.

전체 모범답안 펼치기

A/B 테스트 결과가 명확하지 않다면, 몇 가지 고급 통계 방법을 고려해볼 수 있습니다.

첫째, **경향 점수 매칭(Propensity Score Matching)**은 처치 그룹과 통제 그룹 간의 특성을 비슷하게 만들어 혼란 변수의 영향을 줄이는 방법입니다. 하지만 관측되지 않은 변수는 통제할 수 없다는 한계가 있습니다.

둘째, 도구 변수(Instrumental Variables) 방법은 처치 변수에 영향을 주지만 결과 변수에는 직접적인 영향을 주지 않는 도구 변수를 찾아 인과 관계를 추론합니다. 적절한 도구 변수를 찾는 것이 어렵다는 단점이 있습니다.

셋째, **이중 강건 추정(Doubly Robust Estimation)**은 경향 점수 모델과 결과 모델 중 하나만 정확하면 일관된 추정치를 제공합니다. 두 모델 모두 잘못되면 결과가 왜곡될 수 있습니다.

마지막으로, 베이지안 A/B 테스팅은 사전 지식을 활용하여 불확실성을 정량화하고, 더 유연하게 결과를 해석할 수 있도록 돕습니다.

각 방법은 데이터의 특성과 가정에 따라 적합성이 다르므로, 신중하게 선택해야 합니다.

#Causal Inference#Propensity Score Matching#Instrumental Variables#Regression Discontinuity Design#Bayesian A/B Testing

이 질문 단독 페이지 →

Q16 심화

프로덕션 환경에 배포된 머신러닝 모델이 시간이 지남에 따라 성능이 저하되는 현상(Model Drift)을 경험하고 있습니다. 데이터 드리프트와 컨셉트 드리프트의 차이점을 설명하고, 각 유형의 드리프트를 효과적으로 감지하고 자동으로 대응하기 위한 모니터링 시스템 설계 방안과 구체적인 지표들을 제시해주세요.

힌트 · 데이터 분포 변화 감지 기법 (KS-test, KL-divergence), 모델 예측 성능 변화 감지, 재학습(retraining) 전략, 롤백(rollback) 메커니즘 등을 포함해야 합니다.

면접관님, 모델 드리프트는 머신러닝 모델의 성능 저하를 의미하며, 크게 데이터 드리프트와 컨셉트 드리프트로 나눌 수 있습니다. 데이터 드리프트는 모델 입력 데이터의 분포가 학습 데이터와 달라지는 현상이고, 컨셉트 드…

전체 모범답안 펼치기

면접관님, 모델 드리프트는 머신러닝 모델의 성능 저하를 의미하며, 크게 데이터 드리프트와 컨셉트 드리프트로 나눌 수 있습니다. 데이터 드리프트는 모델 입력 데이터의 분포가 학습 데이터와 달라지는 현상이고, 컨셉트 드리프트는 입력 데이터와 타겟 변수 사이의 관계가 변하는 현상입니다.

데이터 드리프트 감지를 위해 KS-test나 KL-divergence를 사용하여 학습 데이터와 실시간 데이터의 분포 차이를 모니터링합니다. 컨셉트 드리프트는 모델의 예측 성능 지표(정확도, F1-score 등) 변화를 통해 감지할 수 있습니다.

모니터링 시스템은 데이터/컨셉트 드리프트 감지 시 알람을 발생시키고, 자동 재학습 또는 모델 롤백을 수행하도록 설계할 수 있습니다. 재학습 주기는 드리프트 발생 빈도와 모델 성능 저하 정도에 따라 조정하며, 롤백은 이전 버전의 안정적인 모델로 신속하게 전환하여 서비스 영향을 최소화합니다.

#데이터 드리프트#컨셉트 드리프트#모니터링 시스템#분포 변화#성능 지표

이 질문 단독 페이지 →

Q17 심화

강화 학습 에이전트를 실제 서비스에 적용할 때, 초기 단계에서의 탐험(Exploration)과 이후 단계에서의 활용(Exploitation) 균형을 어떻게 효과적으로 조절할 수 있을까요? 특히, 고차원 상태 공간과 희소한 보상(sparse rewards) 환경에서 탐험 전략을 개선하기 위한 고급 기법들과 그 적용 시 유의사항을 설명해주세요.

힌트 · Epsilon-greedy 변형 (annealing), UCB (Upper Confidence Bound), 엔트로피 보너스, Curiosity-driven exploration, Intrinsic Motivation 등의 기법을 다루세요.

강화 학습 에이전트를 실제 서비스에 적용할 때 탐험과 활용의 균형은 매우 중요합니다. 초기에는 충분한 탐험을 통해 다양한 경험을 쌓아야 하지만, 어느 정도 학습이 진행된 후에는 최적의 정책을 활용하여 성능을 극대화해…

전체 모범답안 펼치기

강화 학습 에이전트를 실제 서비스에 적용할 때 탐험과 활용의 균형은 매우 중요합니다. 초기에는 충분한 탐험을 통해 다양한 경험을 쌓아야 하지만, 어느 정도 학습이 진행된 후에는 최적의 정책을 활용하여 성능을 극대화해야 합니다.

고차원 상태 공간과 희소한 보상 환경에서는 단순히 ε-greedy 방식을 사용하는 것만으로는 효과적인 탐험이 어렵습니다. 따라서 다음과 같은 고급 기법들을 고려할 수 있습니다.

  • ε-greedy 변형 (Annealing): 시간이 지남에 따라 ε 값을 점진적으로 감소시켜 초기에는 탐험을 장려하고, 후반에는 활용에 집중하도록 합니다.
  • UCB (Upper Confidence Bound): 각 행동의 가치에 대한 불확실성을 고려하여, 아직 충분히 탐색되지 않은 행동을 우선적으로 선택합니다.
  • Intrinsic Motivation (Curiosity-driven Exploration): 외부 보상이 희소한 경우, 에이전트 스스로 새로운 경험을 추구하도록 내재적 보상을 부여합니다. 예를 들어, 예측 오류가 큰 상태를 방문하는 것에 대한 보상을 줄 수 있습니다.

이러한 기법들을 적용할 때에는 다음과 같은 점에 유의해야 합니다.

  • 하이퍼파라미터 튜닝: 각 기법들은 다양한 하이퍼파라미터를 가지고 있으며, 환경에 따라 최적의 값을 찾아야 합니다.
  • 안전성: 실제 서비스에 적용하기 전에 충분한 시뮬레이션을 통해 안전성을 확보해야 합니다. 특히, 탐험 과정에서 예상치 못한 위험한 상황이 발생할 수 있으므로, 이에 대한 대비가 필요합니다.
  • 성능 모니터링: 지속적인 성능 모니터링을 통해 에이전트가 올바르게 학습하고 있는지 확인하고, 필요에 따라 정책을 수정해야 합니다.
#ε-greedy#UCB#Thompson Sampling#Intrinsic Motivation#Curiosity-driven Exploration

이 질문 단독 페이지 →

Q18 심화

복수의 시계열 데이터가 존재하고, 이들 간의 인과 관계를 파악하여 특정 시계열에 대한 외부 개입(intervention)의 효과를 측정하고자 합니다. 예를 들어, 특정 마케팅 캠페인이 제품 판매량 시계열에 미친 영향을 분석해야 할 때, 단순 상관 분석을 넘어선 인과적 효과를 추정하기 위한 고급 시계열 분석 기법과 그 한계를 설명해주세요.

힌트 · Granger Causality, Vector Autoregression (VAR) 모델, Structural Causal Models (SCM) for time series, Causal Impact 등의 방법을 언급하고, 가정을 설명하세요.

네, 말씀하신 것처럼 시계열 데이터 간의 인과 관계를 파악하고 개입 효과를 측정하는 것은 단순 상관 분석으로는 어렵습니다. 몇 가지 고급 기법과 그 한계를 설명드리겠습니다.

전체 모범답안 펼치기

네, 말씀하신 것처럼 시계열 데이터 간의 인과 관계를 파악하고 개입 효과를 측정하는 것은 단순 상관 분석으로는 어렵습니다. 몇 가지 고급 기법과 그 한계를 설명드리겠습니다.

먼저, Granger Causality는 한 시계열이 다른 시계열을 예측하는 데 도움이 되는지 확인하는 방법입니다. 하지만 이는 진정한 인과 관계를 의미하는 것이 아니라 예측력에 기반한 관계일 뿐입니다.

VAR(Vector Autoregression) 모델은 여러 시계열 간의 상호 의존성을 모델링하는 데 유용합니다. 충격 반응 분석 등을 통해 특정 변수의 변화가 다른 변수에 미치는 영향을 추정할 수 있습니다. 하지만 VAR 모델은 데이터에 존재하는 모든 변수를 고려해야 하며, 누락된 변수가 있다면 결과가 왜곡될 수 있습니다.

더 나아가 **Structural Causal Models (SCM)**를 시계열에 적용하여 인과 관계를 명확히 정의하고 개입 효과를 추정할 수 있습니다. 하지만 SCM은 데이터 생성 과정에 대한 사전 지식이 필요하며, 모델 구조를 잘못 설정하면 잘못된 결론을 내릴 수 있습니다.

CausalImpact는 개입 전후의 시계열 데이터를 비교하여 개입의 인과적 효과를 추정하는 베이지안 구조 시계열 모델입니다. 다른 시계열을 공변량으로 사용하여 개입이 없었다면 발생했을 결과를 예측하고 실제 결과와 비교합니다. 하지만 CausalImpact는 공변량 선택에 따라 결과가 달라질 수 있으며, 개입 시점이 명확해야 합니다. Prophet과 같은 모델을 사용하여 추세와 계절성을 분리하고, 개입 효과를 더 정확하게 추정할 수도 있습니다.

이러한 방법들은 각각 장단점이 있으며, 데이터의 특성과 분석 목적에 따라 적절한 방법을 선택해야 합니다. 또한, 모든 인과 추론 방법은 특정한 가정을 전제로 하므로, 결과를 해석할 때 주의해야 합니다.

#인과추론#개입분석#CausalImpact#Prophet#Granger Causality

이 질문 단독 페이지 →

Q19 심화

대규모 복합 시스템에서 발생하는 비정상적인 로그 패턴이나 센서 데이터를 실시간으로 탐지해야 합니다. 정상 데이터는 풍부하지만 비정상 데이터는 매우 희귀하고 그 유형도 다양하여 레이블링이 어렵습니다. 이러한 환경에서 효과적인 비지도(Unsupervised) 또는 준지도(Semi-supervised) 기반의 이상 탐지 시스템을 설계하고 구축하기 위한 접근 방식과 최신 기술들을 설명해주세요.

힌트 · Autoencoders (Variational Autoencoders), One-Class SVM, Isolation Forest, Generative Adversarial Networks (GANs) for anomaly detection, Self-supervised learning 등을 고려하세요.

네, 말씀하신 환경은 이상 탐지에서 흔히 겪는 어려운 문제입니다. 저는 다음과 같은 접근 방식을 고려할 수 있습니다.

전체 모범답안 펼치기

네, 말씀하신 환경은 이상 탐지에서 흔히 겪는 어려운 문제입니다. 저는 다음과 같은 접근 방식을 고려할 수 있습니다.

우선, Autoencoder 또는 Variational Autoencoder (VAE)를 활용하여 정상 데이터의 특징을 학습합니다. Autoencoder는 입력 데이터를 압축하고 복원하는 과정에서 정상 데이터의 잠재 공간(latent space)을 학습하므로, 비정상 데이터는 복원 오차가 크게 나타나는 경향이 있습니다. VAE는 잠재 공간에 확률 분포를 부여하여 더 robust한 이상 탐지를 가능하게 합니다.

다음으로, Isolation Forest를 사용하여 데이터 포인트를 고립시키는 데 필요한 분할 횟수를 기반으로 이상치를 탐지할 수 있습니다. Isolation Forest는 정상 데이터보다 이상 데이터를 더 쉽게 고립시킬 수 있다는 점을 활용합니다.

One-Class SVM은 정상 데이터만을 학습하여 정상 범위를 정의하고, 이 범위를 벗어나는 데이터를 이상치로 판단합니다.

만약 일부 레이블링된 데이터가 있다면 준지도 학습 방식으로 접근할 수 있습니다. 예를 들어, Self-supervised learning을 통해 데이터 자체에서 레이블을 생성하고, 이를 활용하여 모델을 학습시킬 수 있습니다.

마지막으로, Federated Learning을 활용하여 여러 시스템에 분산된 데이터를 활용하여 모델을 학습할 수 있습니다. 이를 통해 데이터 프라이버시를 보호하면서도 전체적인 모델 성능을 향상시킬 수 있습니다. 각 시스템에서 학습된 모델을 중앙 서버에서 통합하여 최종 모델을 생성합니다.

이러한 방법들을 상황에 맞게 조합하고, 다양한 평가 지표를 사용하여 최적의 모델을 선택하는 것이 중요합니다.

#Autoencoder#Isolation Forest#One-Class SVM#VAE#Federated Learning

이 질문 단독 페이지 →

Q20 심화

금융 대출 심사 모델이 특정 소수 그룹에 대해 편향된 결과를 도출하고 있음을 발견했습니다. 이러한 편향이 발생할 수 있는 원인들을 설명하고, 모델 개발 파이프라인의 각 단계(데이터 수집, 전처리, 모델 학습, 평가)에서 편향을 감지하고 효과적으로 완화하기 위한 기술적 전략들을 구체적인 지표와 함께 제시해주세요.

힌트 · Demographic Parity, Equalized Odds, Predictive Parity 등의 공정성 지표, 데이터 증강, Adversarial Debiasing, Reweighing, Post-processing 등의 기법을 다루세요.

면접관님, 금융 대출 심사 모델의 편향은 심각한 문제이며, 여러 원인이 있을 수 있습니다.

전체 모범답안 펼치기

면접관님, 금융 대출 심사 모델의 편향은 심각한 문제이며, 여러 원인이 있을 수 있습니다.

가장 흔한 원인은 데이터 불균형입니다. 특정 소수 그룹의 데이터가 부족하거나, 긍정적(대출 상환) 사례가 현저히 적을 수 있습니다. 또한, 특성 편향도 문제입니다. 예를 들어, 특정 지역의 우편번호가 소득 수준과 연관되어 간접적으로 인종 정보를 반영할 수 있습니다.

모델 개발 파이프라인 각 단계에서 편향을 감지하고 완화하는 전략은 다음과 같습니다.

  1. 데이터 수집: 대표성 있는 데이터를 확보하고, 소수 그룹에 대한 데이터를 의도적으로 증강합니다.
  2. 전처리: 불필요한 특성을 제거하고, 민감한 특성을 직접 사용하지 않도록 주의합니다.
  3. 모델 학습: 재가중(Reweighting)을 통해 소수 그룹의 데이터에 더 높은 가중치를 부여하거나, 적대적 학습(Adversarial Learning)을 사용하여 모델이 민감한 특성을 예측하지 못하도록 합니다.
  4. 평가: Demographic Parity (그룹별 승인율 동일), Equal Opportunity (실제 상환 그룹에서 승인율 동일) 등의 공정성 지표를 사용하여 모델을 평가하고, 편향을 완화하는 방향으로 모델을 조정합니다.

이러한 기술적 전략들을 통해 모델의 공정성을 높이고, 소수 그룹에 대한 차별을 줄일 수 있습니다.

#데이터 불균형#특성 편향#공정성 지표 (Demographic Parity, Equal Opportunity)#재가중 (Reweighting)#적대적 학습 (Adversarial Learning)

이 질문 단독 페이지 →

Q21 심화

초거대 언어 모델(LLM)과 같이 수십억 개 이상의 파라미터를 가진 모델을 학습시키기 위해 분산 학습 환경을 구축해야 합니다. 단일 GPU로는 학습이 불가능한 모델을 효율적으로 학습시키기 위한 데이터 병렬화(Data Parallelism)와 모델 병렬화(Model Parallelism)의 차이점을 설명하고, 각 방식의 장단점 및 실제 구현 시 고려해야 할 기술적 도전 과제(예: 통신 오버헤드, 메모리 관리)를 논해주세요.

힌트 · Horovod, DeepSpeed, Megatron-LM, FSDP (Fully Sharded Data Parallel), Zero Redundancy Optimizer (ZeRO) 등의 기술과 gradient accumulation, mixed precision training 등을 언급하세요.

초거대 모델 학습을 위한 분산 학습은 크게 데이터 병렬화와 모델 병렬화로 나뉩니다. 데이터 병렬화는 전체 데이터를 나누어 각 GPU에서 동일한 모델을 학습시키는 방식입니다. 구현이 비교적 간단하지만, 모델 크기가 커…

전체 모범답안 펼치기

초거대 모델 학습을 위한 분산 학습은 크게 데이터 병렬화와 모델 병렬화로 나뉩니다. 데이터 병렬화는 전체 데이터를 나누어 각 GPU에서 동일한 모델을 학습시키는 방식입니다. 구현이 비교적 간단하지만, 모델 크기가 커지면 각 GPU에 모델 전체가 올라가야 하므로 메모리 제약이 발생할 수 있습니다. Horovod나 DeepSpeed 같은 라이브러리를 사용해 통신 오버헤드를 줄이고, gradient accumulation을 통해 GPU 활용률을 높일 수 있습니다.

모델 병렬화는 모델 자체를 여러 GPU에 나누어 학습시키는 방식입니다. 메모리 제약은 줄일 수 있지만, GPU 간 통신량이 많아지고 구현이 복잡해집니다. Megatron-LM이나 FSDP 같은 기술은 모델 병렬화를 효율적으로 구현하기 위한 솔루션을 제공합니다. 특히 FSDP는 모델 파라미터를 쪼개어 각 GPU에 분산 저장하고 필요할 때만 통신하여 메모리 효율성을 높입니다. ZeRO와 같은 최적화 기법을 활용하여 메모리 사용량을 더욱 줄일 수도 있습니다. 두 방식 모두 mixed precision training을 통해 메모리 사용량을 줄이고 학습 속도를 높일 수 있습니다.

#데이터 병렬화#모델 병렬화#통신 오버헤드#메모리 관리#GPU 활용률

이 질문 단독 페이지 →

함께 보면 좋은 AI / 데이터 면접 질문

← 전체 면접 질문 카테고리 보기

보유한 데이터 사이언스 질문은 이게 전부가 아닙니다

패스잇 앱에는 직무별 면접 질문 수천 개와 모범답안이 담겨 있습니다. AI 모의면접으로 직접 답하고, 약점을 분석받아 보세요.