패스잇

AI / 데이터

AI / 머신러닝 면접 질문

지도·비지도 학습, 과적합과 정규화, 편향-분산 트레이드오프, 경사하강법, 평가지표(정밀도·재현율·F1) — 머신러닝 면접은 모델을 "돌려 봤다"를 넘어 왜 그렇게 학습하고 평가하는지를 봅니다. 자주 나오는 개념을 모범답안과 함께 단계별로 정리했습니다.

총 21문제 · 기초 7 · 중급 7 · 심화 7 · 모범답안 포함

AI / 머신러닝 면접 질문 — 기초

Q1 기초

인공지능(AI)이란 무엇이며, 대표적인 응용 분야에는 어떤 것들이 있습니까?

힌트 · 인간의 지적 능력을 모방하는 기술이며, 자연어 처리, 이미지 인식, 자율 주행 등이 대표적입니다.

인공지능(AI)은 인간의 지능을 모방하여 컴퓨터가 학습, 추론, 문제 해결 등의 능력을 수행할 수 있도록 하는 기술입니다. 핵심은 데이터를 기반으로 스스로 학습하는 머신러닝이며, 특히 딥러닝은 인공 신경망을 통해 복…

전체 모범답안 펼치기

인공지능(AI)은 인간의 지능을 모방하여 컴퓨터가 학습, 추론, 문제 해결 등의 능력을 수행할 수 있도록 하는 기술입니다. 핵심은 데이터를 기반으로 스스로 학습하는 머신러닝이며, 특히 딥러닝은 인공 신경망을 통해 복잡한 문제를 해결하는 데 효과적입니다.

대표적인 응용 분야로는 자연어 처리(NLP)가 있습니다. 챗봇이나 번역 서비스처럼 컴퓨터가 인간의 언어를 이해하고 생성하도록 돕습니다. 이미지 인식(컴퓨터 비전)은 사진이나 영상 속 객체를 식별하고 분석하는 데 사용되며, 자율 주행 자동차, 의료 영상 분석 등에 활용됩니다. 이 외에도 데이터 분석을 통해 예측 모델을 만들거나, 로봇 제어, 게임 등 다양한 분야에서 AI가 활용되고 있습니다.

#머신러닝#딥러닝#데이터 분석#자연어 처리#컴퓨터 비전

이 질문 단독 페이지 →

Q2 기초

머신러닝(Machine Learning)이란 무엇인지 설명하고, AI와의 관계를 간략히 설명해주세요.

힌트 · 데이터를 기반으로 학습하여 예측이나 결정을 수행하는 AI의 한 분야입니다.

머신러닝은 인공지능(AI)의 한 분야로, 명시적인 프로그래밍 없이 컴퓨터가 데이터로부터 학습할 수 있도록 하는 기술입니다. 즉, 데이터 속에서 패턴을 발견하고, 이를 바탕으로 미래를 예측하거나 의사 결정을 내리는 알…

전체 모범답안 펼치기

머신러닝은 인공지능(AI)의 한 분야로, 명시적인 프로그래밍 없이 컴퓨터가 데이터로부터 학습할 수 있도록 하는 기술입니다. 즉, 데이터 속에서 패턴을 발견하고, 이를 바탕으로 미래를 예측하거나 의사 결정을 내리는 알고리즘을 개발하는 것이죠.

AI는 인간의 지능을 모방하는 더 넓은 개념이고, 머신러닝은 AI를 구현하는 여러 방법 중 하나입니다. 예를 들어, 스팸 메일 필터링, 이미지 인식, 추천 시스템 등이 머신러닝을 활용한 대표적인 사례입니다. 지도 학습, 비지도 학습 등 다양한 학습 방법이 존재하며, 데이터의 특성과 문제 해결 목적에 따라 적절한 방법을 선택하게 됩니다.

#데이터 기반 학습#알고리즘#패턴 인식#인공지능#지도 학습/비지도 학습

이 질문 단독 페이지 →

Q3 기초

딥러닝(Deep Learning)이란 무엇이며, 기존 머신러닝 기법과 어떤 차이점이 있습니까?

힌트 · 여러 층의 신경망을 사용하여 복잡한 패턴을 학습하는 머신러닝의 하위 분야입니다. 특징 추출을 자동으로 수행합니다.

딥러닝은 머신러닝의 한 분야로, 여러 층으로 구성된 인공신경망을 사용하여 복잡한 데이터의 패턴을 학습하는 기술입니다.

전체 모범답안 펼치기

딥러닝은 머신러닝의 한 분야로, 여러 층으로 구성된 인공신경망을 사용하여 복잡한 데이터의 패턴을 학습하는 기술입니다.

기존 머신러닝 기법과의 가장 큰 차이점은 특징 추출 방식에 있습니다. 기존 머신러닝에서는 사람이 직접 데이터의 특징을 추출하고 모델에 입력해야 했지만, 딥러닝은 신경망이 데이터로부터 자동으로 특징을 학습합니다. 이러한 자동 특징 추출 능력 덕분에 딥러닝은 이미지, 음성, 텍스트 등 복잡한 데이터를 다루는 데 특히 효과적입니다. 계층적인 구조를 통해 저수준의 특징부터 고수준의 추상적인 특징까지 학습할 수 있다는 점도 중요한 차이점입니다.

#인공신경망#표현학습#특징추출#계층적 구조#자동화

이 질문 단독 페이지 →

Q4 기초

지도 학습(Supervised Learning)이란 무엇인지 설명하고, 실제 데이터에서 어떤 문제 해결에 주로 사용되는지 예시를 들어 설명해주세요.

힌트 · 정답(레이블)이 있는 데이터를 사용하여 모델을 학습시키며, 스팸 메일 분류나 주택 가격 예측 등에 활용됩니다.

지도 학습은 정답, 즉 '레이블'이 붙어있는 데이터를 이용해서 모델을 학습시키는 방법입니다. 마치 선생님이 학생에게 문제와 정답을 알려주면서 공부시키는 것과 비슷하다고 생각하시면 됩니다.

전체 모범답안 펼치기

지도 학습은 정답, 즉 '레이블'이 붙어있는 데이터를 이용해서 모델을 학습시키는 방법입니다. 마치 선생님이 학생에게 문제와 정답을 알려주면서 공부시키는 것과 비슷하다고 생각하시면 됩니다.

주로 어떤 값을 예측하거나, 어떤 종류로 분류하는 문제에 많이 사용됩니다. 예를 들어, 스팸 메일 분류는 메일 내용을 보고 스팸인지 아닌지 판단하는 문제인데, 과거 스팸 메일과 정상 메일 데이터를 학습시켜서 새로운 메일이 왔을 때 스팸 여부를 예측할 수 있습니다. 또 다른 예로는 주택 가격 예측이 있습니다. 과거 주택의 크기, 위치, 건축 연도 등의 정보를 이용해서 주택 가격을 예측하는 모델을 만들 수 있습니다. 지도 학습 알고리즘으로는 선형 회귀, 로지스틱 회귀, 의사 결정 트리, 서포트 벡터 머신 등이 있습니다.

#레이블링된 데이터#분류#회귀#예측 모델#지도 학습 알고리즘

이 질문 단독 페이지 →

Q5 기초

비지도 학습(Unsupervised Learning)이란 무엇이며, 지도 학습과의 주요 차이점은 무엇입니까?

힌트 · 정답(레이블)이 없는 데이터에서 패턴이나 구조를 찾아내며, 고객 세분화나 이상 탐지 등에 사용됩니다.

비지도 학습은 정답, 즉 레이블이 없는 데이터를 이용해서 데이터 자체의 숨겨진 구조나 패턴을 찾아내는 머신러닝 방법입니다. 예를 들어 고객 데이터를 분석해서 비슷한 특징을 가진 그룹으로 묶는 고객 세분화나, 정상적인…

전체 모범답안 펼치기

비지도 학습은 정답, 즉 레이블이 없는 데이터를 이용해서 데이터 자체의 숨겨진 구조나 패턴을 찾아내는 머신러닝 방법입니다. 예를 들어 고객 데이터를 분석해서 비슷한 특징을 가진 그룹으로 묶는 고객 세분화나, 정상적인 데이터와는 확연히 다른 이상 데이터를 탐지하는 데 활용될 수 있습니다.

지도 학습과의 가장 큰 차이점은 바로 '레이블'의 유무입니다. 지도 학습은 입력 데이터와 그에 대한 정답 레이블이 함께 주어지기 때문에, 모델이 데이터와 레이블 사이의 관계를 학습하여 새로운 데이터에 대한 예측을 수행할 수 있습니다. 반면 비지도 학습은 레이블이 없기 때문에, 모델이 데이터 자체의 특성을 파악하여 클러스터링이나 차원 축소와 같은 작업을 수행합니다.

#레이블 없음#데이터 자체 구조#클러스터링#차원 축소#지도 학습 비교

이 질문 단독 페이지 →

Q6 기초

강화 학습(Reinforcement Learning)의 기본적인 개념과 주요 구성 요소(에이전트, 환경, 보상)에 대해 설명해주세요.

힌트 · 에이전트가 환경과 상호작용하며 보상을 최대화하는 방향으로 학습하는 방식입니다.

강화 학습은 에이전트가 환경과 상호작용하면서 보상을 최대화하는 방향으로 학습하는 머신러닝 방법입니다.

전체 모범답안 펼치기

강화 학습은 에이전트가 환경과 상호작용하면서 보상을 최대화하는 방향으로 학습하는 머신러닝 방법입니다.

강화 학습의 주요 구성 요소는 다음과 같습니다.

  • 에이전트(Agent): 환경을 인지하고 행동을 수행하는 주체입니다. 예를 들어, 게임을 하는 AI 플레이어라고 생각할 수 있습니다.

  • 환경(Environment): 에이전트가 상호작용하는 대상입니다. 에이전트에게 상태를 제공하고, 에이전트의 행동에 따라 다음 상태와 보상을 결정합니다.

  • 보상(Reward): 에이전트의 행동에 대한 피드백입니다. 긍정적인 보상은 행동을 강화하고, 부정적인 보상은 행동을 억제합니다. 에이전트는 누적 보상을 최대화하는 방향으로 학습합니다.

에이전트는 환경으로부터 상태를 관찰하고, 그 상태에 기반하여 행동을 선택합니다. 그리고 환경은 에이전트의 행동에 따라 다음 상태와 보상을 에이전트에게 제공합니다. 이러한 상호작용을 통해 에이전트는 최적의 정책(어떤 상태에서 어떤 행동을 해야 하는지)을 학습하게 됩니다. 가치 함수는 특정 상태 또는 행동이 얼마나 좋은지를 나타내는 지표로, 정책을 평가하고 개선하는 데 사용됩니다.

#에이전트#환경#보상#정책#가치 함수

이 질문 단독 페이지 →

Q7 기초

머신러닝 모델 학습 과정에서 훈련 데이터(Training Data)의 역할과 중요성에 대해 설명해주세요.

힌트 · 모델이 패턴을 학습하고 예측 능력을 개발하는 데 사용되는 데이터이며, 데이터의 양과 품질이 모델 성능에 큰 영향을 미칩니다.

훈련 데이터는 머신러닝 모델이 학습하는 데 사용되는 가장 기본적인 재료입니다. 모델은 훈련 데이터를 통해 데이터의 패턴, 특징, 그리고 정답(레이블) 간의 관계를 학습하고, 이를 바탕으로 새로운 데이터에 대한 예측…

전체 모범답안 펼치기

훈련 데이터는 머신러닝 모델이 학습하는 데 사용되는 가장 기본적인 재료입니다. 모델은 훈련 데이터를 통해 데이터의 패턴, 특징, 그리고 정답(레이블) 간의 관계를 학습하고, 이를 바탕으로 새로운 데이터에 대한 예측 능력을 갖추게 됩니다.

훈련 데이터의 양과 질은 모델 성능에 직접적인 영향을 미칩니다. 충분한 양의 데이터를 확보해야 모델이 다양한 상황에 대한 일반화 능력을 키울 수 있습니다. 또한, 데이터의 품질이 낮으면 모델이 잘못된 패턴을 학습하여 예측 정확도가 떨어질 수 있습니다.

따라서 훈련 데이터를 준비할 때는 데이터의 양뿐만 아니라 품질 관리에도 신경 써야 합니다. 이상치 제거, 결측치 처리, 데이터 정규화 등의 전처리 과정을 통해 데이터 품질을 향상시키는 것이 중요합니다. 또한, 과적합을 방지하기 위해 데이터 증강 기법을 활용하거나, 정규화 방법을 적용하기도 합니다.

#모델_학습#일반화#과적합_방지#특징_추출#데이터_품질

이 질문 단독 페이지 →

읽기만으론 부족합니다 — 직접 말해보세요

패스잇 앱에서 AI / 머신러닝 질문에 직접 답하면 AI가 1:1로 답변을 코칭합니다.

AI / 머신러닝 면접 질문 — 중급

Q8 중급

머신러닝 모델 학습 시 오버피팅(Overfitting)과 언더피팅(Underfitting)이 발생하는 원인을 설명하고, 각각을 해결하기 위한 구체적인 방법들을 제시해 보세요.

힌트 · 오버피팅은 모델 복잡도, 데이터 부족, 언더피팅은 모델 단순함, 특성 부족이 원인입니다. 데이터 증강, 정규화, 모델 복잡도 조절 등으로 해결할 수 있습니다.

면접관님, 머신러닝 모델 학습 시 오버피팅과 언더피팅은 모델의 성능을 저해하는 주요 원인입니다.

전체 모범답안 펼치기

면접관님, 머신러닝 모델 학습 시 오버피팅과 언더피팅은 모델의 성능을 저해하는 주요 원인입니다.

오버피팅은 모델이 학습 데이터에 지나치게 적합되어, 새로운 데이터에 대한 예측 성능이 떨어지는 현상입니다. 이는 모델이 너무 복잡하거나, 학습 데이터가 부족할 때 발생하기 쉽습니다. 해결 방법으로는 데이터 증강, 정규화(L1, L2 규제), 교차 검증을 통한 모델 평가, 그리고 모델의 복잡도를 줄이는 방법 등이 있습니다. 예를 들어, 결정 트리의 깊이를 제한하거나, 신경망의 레이어 수를 줄일 수 있습니다.

반대로 언더피팅은 모델이 너무 단순하여 학습 데이터를 제대로 학습하지 못하는 현상입니다. 이는 모델의 표현력이 부족하거나, 중요한 특징을 제대로 반영하지 못할 때 발생합니다. 해결 방법으로는 더 복잡한 모델을 사용하거나, 새로운 특징을 추가하는 방법이 있습니다. 또한, 모델의 학습 시간을 늘리거나, 학습 알고리즘을 변경하는 것도 고려해볼 수 있습니다.

#과적합#과소적합#규제#교차검증#데이터 증강

이 질문 단독 페이지 →

Q9 중급

머신러닝 모델의 편향-분산 트레이드오프(Bias-Variance Trade-off) 개념을 설명하고, 모델의 복잡도 변화에 따라 편향과 분산이 어떻게 변화하는지 구체적인 예를 들어 설명해 주세요.

힌트 · 편향은 모델의 예측과 실제 값의 차이, 분산은 학습 데이터에 따른 모델 예측의 변동성을 의미합니다. 모델 복잡도가 증가하면 편향은 줄고 분산은 증가하는 경향이 있습니다.

면접관님, 머신러닝 모델의 편향분산 트레이드오프는 모델이 얼마나 정확하고 안정적인 예측을 하는지를 나타내는 중요한 개념입니다.

전체 모범답안 펼치기

면접관님, 머신러닝 모델의 편향-분산 트레이드오프는 모델이 얼마나 정확하고 안정적인 예측을 하는지를 나타내는 중요한 개념입니다.

편향은 모델이 데이터를 얼마나 단순화해서 바라보는지를 의미합니다. 편향이 높으면 모델이 너무 단순해서 데이터의 복잡한 패턴을 제대로 학습하지 못하고, 과소적합 문제가 발생합니다. 반대로 분산은 모델이 학습 데이터에 얼마나 민감하게 반응하는지를 나타냅니다. 분산이 높으면 모델이 학습 데이터에만 지나치게 맞춰져서 새로운 데이터에 대한 예측 성능이 떨어지는 과적합 문제가 발생합니다.

모델의 복잡도가 증가하면 일반적으로 편향은 감소하고 분산은 증가합니다. 예를 들어, 선형 회귀 모델은 편향이 높고 분산이 낮은 모델입니다. 반면, 고차 다항 회귀 모델이나 복잡한 신경망 모델은 편향은 낮지만 분산이 높을 수 있습니다. 따라서, 적절한 모델 복잡도를 선택하여 편향과 분산을 균형있게 유지하는 것이 중요합니다. 이를 위해 교차 검증 등의 방법을 사용하여 모델의 성능을 평가하고 최적의 모델을 선택합니다.

#편향#분산#과소적합#과적합#모델 복잡도

이 질문 단독 페이지 →

Q10 중급

머신러닝 모델의 과적합(Overfitting)을 방지하기 위한 정규화(Regularization) 기법 중 L1 정규화, L2 정규화, 드롭아웃(Dropout)의 원리와 각각의 특징, 그리고 언제 어떤 기법을 사용하는 것이 적절한지 비교 설명해 주세요.

힌트 · L1은 가중치 희소성 유도, L2는 가중치 크기 감소, 드롭아웃은 뉴런 일부 비활성화로 과적합을 방지합니다. 특성 선택, 가중치 감소, 앙상블 효과 등 각 기법의 장단점을 고려합니다.

면접관님, 머신러닝 모델의 과적합을 방지하기 위한 정규화 기법에 대해 설명드리겠습니다.

전체 모범답안 펼치기

면접관님, 머신러닝 모델의 과적합을 방지하기 위한 정규화 기법에 대해 설명드리겠습니다.

L1 정규화는 가중치의 절대값 합을 손실 함수에 추가하여, 일부 가중치를 정확히 0으로 만듭니다. 이는 모델의 특성 선택(Feature Selection) 효과를 가져와, 중요하지 않은 특성을 제거하여 모델을 단순화합니다. 따라서, 모델의 해석력을 높이고 싶거나, 데이터에 관련 없는 특성이 많다고 판단될 때 유용합니다.

L2 정규화는 가중치의 제곱 합을 손실 함수에 추가하여, 가중치 값을 전반적으로 작게 만듭니다. 이는 모든 특성을 활용하되, 각 특성이 모델에 미치는 영향을 줄여 과적합을 방지합니다. L2 정규화는 일반적으로 L1보다 성능이 좋으며, 대부분의 경우에 기본적으로 적용해볼 만한 좋은 선택입니다.

드롭아웃은 신경망 학습 시 각 레이어의 뉴런을 무작위로 비활성화하는 기법입니다. 이는 각 뉴런이 특정 특성에 과도하게 의존하는 것을 막고, 앙상블 효과를 통해 일반화 성능을 향상시킵니다. 드롭아웃은 특히 깊은 신경망 모델에서 과적합을 줄이는 데 효과적입니다.

어떤 기법을 사용할지는 데이터의 특성, 모델의 복잡도, 그리고 원하는 결과에 따라 달라집니다. 특성 선택이 중요하다면 L1, 전반적인 가중치 감소가 필요하면 L2, 깊은 신경망에서는 드롭아웃을 고려해볼 수 있습니다. 물론, 여러 기법을 함께 사용하는 것도 좋은 방법입니다.

#L1 정규화#L2 정규화#드롭아웃#희소성#가중치 감쇠

이 질문 단독 페이지 →

Q11 중급

신경망에서 활성화 함수(Activation Function)의 역할은 무엇이며, ReLU, Sigmoid, Tanh 함수 각각의 특징과 장단점을 비교하고, 현대 딥러닝 모델에서 ReLU 계열 함수가 주로 사용되는 이유를 설명해 주세요.

힌트 · 활성화 함수는 비선형성을 도입하여 복잡한 패턴 학습을 가능하게 합니다. ReLU는 계산 효율성과 기울기 소실 문제 완화에 강점이 있어 널리 사용됩니다.

면접관님, 신경망에서 활성화 함수는 각 뉴런의 출력값을 결정하는 중요한 역할을 합니다. 선형 변환된 입력에 비선형성을 더해, 신경망이 복잡한 패턴을 학습할 수 있도록 돕습니다.

전체 모범답안 펼치기

면접관님, 신경망에서 활성화 함수는 각 뉴런의 출력값을 결정하는 중요한 역할을 합니다. 선형 변환된 입력에 비선형성을 더해, 신경망이 복잡한 패턴을 학습할 수 있도록 돕습니다.

ReLU는 입력이 0보다 크면 그대로 출력하고, 0 이하이면 0을 출력하는 간단한 함수입니다. 계산이 빠르고 기울기 소실 문제를 완화해주는 장점이 있지만, 음수 입력에 대해 항상 0을 출력하는 Dying ReLU 문제가 발생할 수 있습니다.

Sigmoid는 0과 1 사이의 값을 출력하여 확률 해석에 용이하지만, 입력값이 클수록 기울기가 소실되는 문제가 있습니다. Tanh는 -1과 1 사이의 값을 출력하며 Sigmoid보다 기울기 소실 문제가 덜하지만, 여전히 기울기 소실 문제가 존재합니다.

현대 딥러닝 모델에서는 ReLU 계열 함수가 주로 사용됩니다. ReLU의 빠른 계산 속도와 기울기 소실 문제 완화 효과 덕분에 학습 속도를 크게 향상시킬 수 있기 때문입니다. Leaky ReLU나 ELU와 같은 변형된 ReLU 함수들은 Dying ReLU 문제를 해결하기 위해 제안되었습니다.

#비선형성#ReLU#Sigmoid#Gradient Vanishing#Tanh

이 질문 단독 페이지 →

Q12 중급

머신러닝 모델 학습 시 사용되는 손실 함수(Loss Function)의 개념과 역할에 대해 설명하고, 회귀 문제에서 주로 사용되는 MSE(Mean Squared Error)와 분류 문제에서 주로 사용되는 Cross-Entropy 손실 함수를 비교하여 설명해 주세요.

힌트 · 손실 함수는 모델 예측과 실제 값의 차이를 측정하여 모델이 학습해야 할 방향을 제시합니다. MSE는 연속적인 값 예측에, Cross-Entropy는 확률 분포 간의 차이를 측정하는 데 적합합니다.

손실 함수는 머신러닝 모델이 예측한 값과 실제 값 사이의 차이를 수치화하는 함수입니다. 모델 학습 과정에서 이 손실 함수의 값을 최소화하는 방향으로 모델의 파라미터를 조정하게 됩니다. 즉, 손실 함수는 모델이 얼마나…

전체 모범답안 펼치기

손실 함수는 머신러닝 모델이 예측한 값과 실제 값 사이의 차이를 수치화하는 함수입니다. 모델 학습 과정에서 이 손실 함수의 값을 최소화하는 방향으로 모델의 파라미터를 조정하게 됩니다. 즉, 손실 함수는 모델이 얼마나 '잘못' 예측하고 있는지를 나타내는 지표이며, 모델이 학습해야 할 방향을 제시하는 역할을 합니다.

회귀 문제에서는 주로 MSE(Mean Squared Error)를 사용합니다. MSE는 예측값과 실제값의 차이의 제곱의 평균으로, 예측값들이 실제값 주변에 얼마나 흩어져 있는지를 나타냅니다. 값이 작을수록 모델의 예측 성능이 좋다고 할 수 있습니다.

반면, 분류 문제에서는 Cross-Entropy 손실 함수를 주로 사용합니다. Cross-Entropy는 예측 확률 분포와 실제 확률 분포 간의 차이를 측정합니다. 특히, 모델이 예측한 확률이 실제 레이블에 가까울수록 손실이 작아지도록 설계되어 있습니다. 예를 들어, 이미지를 '고양이' 또는 '강아지'로 분류하는 문제에서 모델이 '고양이'일 확률을 90%로 예측했는데 실제 레이블이 '고양이'라면 손실이 작아지고, '강아지'라면 손실이 커지는 방식입니다. MSE는 연속적인 값을 예측하는 데 적합하고, Cross-Entropy는 확률 분포를 예측하는 데 적합하다는 차이가 있습니다.

#손실 함수#MSE#Cross-Entropy#회귀#분류

이 질문 단독 페이지 →

Q13 중급

경사 하강법(Gradient Descent)의 기본적인 원리를 설명하고, SGD(Stochastic Gradient Descent), Adam, RMSprop과 같은 다양한 최적화(Optimizer) 알고리즘들이 어떻게 경사 하강법을 개선하는지 각각의 특징과 장단점을 비교하여 설명해 주세요.

힌트 · 경사 하강법은 손실 함수의 기울기를 따라 최소값을 찾아갑니다. SGD는 배치 크기, Adam과 RMSprop은 학습률을 동적으로 조절하여 수렴 속도와 안정성을 향상시킵니다.

경사 하강법은 모델의 손실 함수를 최소화하는 파라미터를 찾는 기본적인 최적화 알고리즘입니다. 손실 함수의 기울기(gradient)를 계산하여, 기울기의 반대 방향으로 파라미터를 조금씩 업데이트하면서 손실을 줄여나가는…

전체 모범답안 펼치기

경사 하강법은 모델의 손실 함수를 최소화하는 파라미터를 찾는 기본적인 최적화 알고리즘입니다. 손실 함수의 기울기(gradient)를 계산하여, 기울기의 반대 방향으로 파라미터를 조금씩 업데이트하면서 손실을 줄여나가는 방식이죠.

SGD는 각 업데이트마다 하나의 데이터 샘플만 사용해서 계산 속도는 빠르지만, 업데이트 방향이 불안정할 수 있습니다.

Adam과 RMSprop은 학습률을 동적으로 조절하여 이러한 단점을 개선합니다. RMSprop은 과거 기울기의 지수 이동 평균을 사용하여 학습률을 조정하고, Adam은 RMSprop에 모멘텀 개념을 더해 업데이트 방향을 부드럽게 만들어 줍니다.

Adam은 일반적으로 좋은 성능을 보이지만, 데이터에 따라 RMSprop이 더 나은 경우도 있습니다. SGD는 단순하지만, 적절한 학습률 스케줄링과 함께 사용하면 좋은 성능을 낼 수 있습니다. 각 알고리즘은 장단점이 뚜렷하므로, 문제에 따라 적절한 알고리즘을 선택하는 것이 중요합니다.

#손실 함수#학습률#미분#배치 크기#모멘텀

이 질문 단독 페이지 →

Q14 중급

분류(Classification) 모델의 성능을 평가할 때 사용되는 지표인 Precision, Recall, F1-score, 그리고 ROC-AUC의 개념을 각각 설명하고, 특정 상황(예: 암 진단, 스팸 메일 분류)에서 어떤 지표가 더 중요하게 고려될 수 있는지 구체적인 예시를 들어 설명해 주세요.

힌트 · Precision은 예측의 정확도, Recall은 실제 양성의 재현율을 나타냅니다. F1-score는 둘의 조화 평균이며, ROC-AUC는 분류 모델의 전반적인 성능을 측정합니다. 상황에 따라 False Positive 또는 False Negative의 중요도가 달라집니다.

면접관님, 분류 모델 성능 평가 지표에 대해 설명드리겠습니다.

전체 모범답안 펼치기

면접관님, 분류 모델 성능 평가 지표에 대해 설명드리겠습니다.

Precision은 모델이 양성으로 예측한 것 중 실제 양성의 비율입니다. Recall은 실제 양성 중 모델이 정확히 양성으로 예측한 비율을 의미합니다. F1-score는 Precision과 Recall의 조화 평균으로, 두 지표를 균형 있게 고려할 때 유용합니다. ROC-AUC는 모델이 양성/음성을 얼마나 잘 구별하는지 나타내는 지표로, 0과 1 사이의 값으로 표현됩니다.

암 진단에서는 Recall이 더 중요할 수 있습니다. 암에 걸렸는데 음성으로 잘못 판단하면(False Negative) 치료 시기를 놓칠 수 있기 때문입니다. 반면, 스팸 메일 분류에서는 Precision이 더 중요할 수 있습니다. 정상 메일을 스팸으로 잘못 분류하면(False Positive) 중요한 정보를 놓칠 수 있기 때문입니다. 상황에 따라 어떤 오류가 더 치명적인지를 고려하여 적절한 지표를 선택해야 합니다.

#정밀도 (Precision)#재현율 (Recall)#F1-score#ROC-AUC#임계값 (Threshold)

이 질문 단독 페이지 →

AI / 머신러닝 면접 질문 — 심화

Q15 심화

대규모 언어 모델(LLM)을 프로덕션 환경에 배포할 때, 서비스 지연 시간(latency)을 최소화하고 처리량(throughput)을 극대화하기 위한 아키텍처 설계 전략과 최적화 기법에 대해 설명하고, 특히 KV Cache, quantization, distillation의 적용 방안을 구체적인 예시와 함께 제시해 주십시오.

힌트 · KV Cache는 토큰 생성 시 반복 계산을 줄이고, quantization은 모델 크기와 연산량을 감소시키며, distillation은 더 작고 빠른 모델을 만듭니다.

LLM 프로덕션 배포 시 지연 시간 최소화 및 처리량 극대화를 위해 다음과 같은 전략을 고려합니다.

전체 모범답안 펼치기

LLM 프로덕션 배포 시 지연 시간 최소화 및 처리량 극대화를 위해 다음과 같은 전략을 고려합니다.

첫째, KV Cache를 활용하여 이전 토큰 생성 시 계산된 Key와 Value 값을 저장하고 재사용합니다. 예를 들어, Transformer 모델에서 각 레이어의 Attention 연산 시 반복되는 계산을 줄여 토큰 생성 속도를 향상시킵니다.

둘째, Quantization을 통해 모델 가중치를 낮은 정밀도로 변환합니다. FP16 또는 INT8 Quantization을 적용하여 모델 크기를 줄이고 연산 속도를 높일 수 있습니다. TensorRT와 같은 라이브러리를 사용하여 GPU 연산을 최적화할 수 있습니다.

셋째, Distillation을 통해 더 작고 빠른 모델을 만듭니다. 큰 모델(Teacher)의 지식을 작은 모델(Student)에게 전달하여 성능을 유지하면서 모델 크기를 줄입니다.

마지막으로, 모델 추론을 위한 병렬 처리 방안을 고려합니다. Tensor Parallelism 또는 Pipeline Parallelism을 통해 여러 GPU에 모델을 분산시켜 처리량을 늘릴 수 있습니다.

#KV Cache#Quantization#Distillation#TensorRT#병렬 처리

이 질문 단독 페이지 →

Q16 심화

실제 서비스에 강화 학습(Reinforcement Learning) 에이전트를 적용할 때, 탐험(exploration)과 활용(exploitation)의 균형을 효과적으로 조절하기 위한 고급 전략에는 어떤 것들이 있으며, 특히 오프라인 RL(Offline RL) 기법이 이러한 문제 해결에 어떻게 기여할 수 있는지 설명해 주십시오.

힌트 · Epsilon-greedy, UCB, Thompson Sampling 등의 전략과 함께, 오프라인 RL은 기존 데이터를 활용하여 안전하게 정책을 학습하여 탐험 위험을 줄일 수 있습니다.

실제 서비스에 강화 학습 에이전트를 적용할 때 탐험과 활용의 균형은 매우 중요합니다. 단순히 εgreedy처럼 확률적으로 탐험하는 것 외에, UCB(Upper Confidence Bound)나 Thompson Sam…

전체 모범답안 펼치기

실제 서비스에 강화 학습 에이전트를 적용할 때 탐험과 활용의 균형은 매우 중요합니다. 단순히 ε-greedy처럼 확률적으로 탐험하는 것 외에, UCB(Upper Confidence Bound)나 Thompson Sampling 같은 베이지안 기반 전략을 활용하여 불확실성이 높은 행동에 더 많은 탐험 기회를 부여하는 고급 기법들이 있습니다.

특히 오프라인 RL은 이러한 탐험 위험을 크게 줄여줍니다. 기존에 수집된 데이터를 활용하여 정책을 학습하기 때문에, 실제 환경에서 위험한 탐험을 수행할 필요가 없습니다. Behavior Cloning과 같이 기존 행동을 모방하는 것부터 시작하여, Conservative Policy Optimization 기법을 통해 학습된 정책이 기존 데이터 분포에서 벗어나지 않도록 제약함으로써 안전성을 확보할 수 있습니다. 이를 통해 실제 서비스에 적용 시 발생할 수 있는 예기치 못한 부정적 영향을 최소화하면서 효과적인 정책 학습이 가능합니다.

#ε-greedy#UCB#Thompson Sampling#Behavior Cloning#Conservative Policy Optimization

이 질문 단독 페이지 →

Q17 심화

프로덕션 환경에서 운영 중인 머신러닝 모델의 성능이 점진적으로 저하될 때, 데이터 드리프트(Data Drift)와 모델 드리프트(Model Drift)를 효과적으로 감지하고 진단하기 위한 모니터링 시스템 설계 방안과, 이에 대한 자동화된 대응 전략에 대해 설명해 주십시오.

힌트 · 데이터 분포 변화를 감지하는 통계적 방법론과 모델 예측 성능 지표 모니터링을 포함하며, 드리프트 감지 시 자동 재학습 또는 알림 시스템을 고려해야 합니다.

"프로덕션 환경에서 모델 성능 저하를 감지하고 대응하기 위한 모니터링 시스템은 크게 두 가지 축으로 설계할 수 있습니다. 첫째, 데이터 드리프트 감지를 위해 입력 데이터의 분포 변화를 모니터링합니다. 이를 위해 쿨백…

전체 모범답안 펼치기

"프로덕션 환경에서 모델 성능 저하를 감지하고 대응하기 위한 모니터링 시스템은 크게 두 가지 축으로 설계할 수 있습니다. 첫째, 데이터 드리프트 감지를 위해 입력 데이터의 분포 변화를 모니터링합니다. 이를 위해 쿨백-라이블러 발산(Kullback-Leibler divergence)이나 젠센-섀넌 발산(Jensen-Shannon divergence) 같은 통계적 지표를 활용하여 학습 데이터와 실시간 데이터 간의 분포 차이를 측정하고, 특정 임계값을 넘으면 드리프트로 판단합니다. 둘째, 모델 드리프트 감지를 위해 예측 성능 지표, 예를 들어 정확도, 정밀도, 재현율 등을 지속적으로 모니터링합니다.

드리프트가 감지되면 자동화된 대응 전략을 실행합니다. 우선, 알림 시스템을 통해 담당자에게 즉시 알립니다. 동시에, 모델 재학습 파이프라인을 트리거하여 최신 데이터로 모델을 업데이트합니다. 재학습된 모델은 A/B 테스팅을 통해 기존 모델과 비교하여 성능이 개선되었는지 확인하고, 성능이 개선된 경우에만 배포합니다. 이러한 과정을 자동화하여 모델 성능 저하에 신속하게 대응할 수 있도록 합니다."

#데이터 드리프트#모델 드리프트#모니터링 지표#자동 재학습#A/B 테스팅

이 질문 단독 페이지 →

Q18 심화

GAN(Generative Adversarial Network) 또는 Diffusion Model과 같은 생성 모델 학습 시 발생하는 모드 붕괴(Mode Collapse) 현상이 무엇인지 설명하고, 이를 완화하거나 해결하기 위한 고급 기법들(예: WGAN, VAE, Conditioning, Loss Function 개선 등)을 비교 분석하여 설명해 주십시오.

힌트 · 모드 붕괴는 생성 모델이 학습 데이터의 일부 모드만 생성하는 현상으로, 다양한 손실 함수, 아키텍처 변경, 조건부 생성 등을 통해 해결할 수 있습니다.

모드 붕괴는 생성 모델이 학습 데이터의 모든 다양성을 포착하지 못하고, 특정 몇 가지 모드만 반복적으로 생성하는 현상입니다. 예를 들어, 사람 얼굴을 생성하는 모델이 항상 같은 표정이나 각도의 얼굴만 만든다면 모드…

전체 모범답안 펼치기

모드 붕괴는 생성 모델이 학습 데이터의 모든 다양성을 포착하지 못하고, 특정 몇 가지 모드만 반복적으로 생성하는 현상입니다. 예를 들어, 사람 얼굴을 생성하는 모델이 항상 같은 표정이나 각도의 얼굴만 만든다면 모드 붕괴가 발생한 것입니다.

이를 해결하기 위한 고급 기법으로는 여러 가지가 있습니다.

WGAN(Wasserstein GAN)은 기존 GAN의 불안정한 학습을 개선하고 모드 붕괴를 완화하는 데 효과적입니다. Wasserstein 거리를 사용하여 판별자와 생성자 간의 거리를 측정함으로써, 더 부드러운 그래디언트를 얻고 학습 안정성을 높입니다.

VAE(Variational Autoencoder)는 생성 모델 자체의 구조적 특징으로 모드 붕괴를 완화하는 데 기여할 수 있습니다. VAE는 잠재 공간을 정규 분포로 가정하고 이를 통해 샘플링하기 때문에, 잠재 공간의 각 지점이 데이터의 특정 모드에 대응될 가능성이 높아져 다양성을 확보하는 데 유리합니다.

Conditioning은 생성 과정에 추가적인 정보를 주입하여 특정 모드를 생성하도록 유도하는 기법입니다. 예를 들어, 특정 클래스의 이미지를 생성하고 싶을 때 해당 클래스 정보를 조건으로 제공하면, 모델은 그 조건에 맞는 이미지만 생성하게 되어 모드 붕괴를 방지하고 원하는 결과물을 얻을 수 있습니다.

Loss Function 개선 또한 중요한 역할을 합니다. 예를 들어, Feature Matching이나 Minibatch Discrimination과 같은 기법들은 생성된 샘플들이 실제 데이터의 통계적 특성을 더 잘 반영하도록 유도하여 모드 붕괴를 줄입니다.

이러한 기법들은 각각 장단점을 가지며, 문제 상황에 따라 적절히 조합하여 사용하는 것이 중요합니다.

#모드 붕괴#생성 다양성#WGAN#VAE#Conditioning

이 질문 단독 페이지 →

Q19 심화

의료 진단이나 금융 신용 평가와 같이 높은 투명성과 신뢰성이 요구되는 도메인에서, 블랙박스 AI 모델의 의사결정을 설명하기 위한 XAI(Explainable AI) 기법들을 비교하고, 특히 LIME, SHAP, 그리고 인과관계(Causal Inference) 기반 설명 기법의 장단점 및 실제 적용 시 고려사항을 논해 주십시오.

힌트 · LIME과 SHAP은 사후 설명 기법으로 국소적/전역적 설명을 제공하며, 인과관계 기반 기법은 의사결정의 근본 원인을 파악하는 데 유용합니다.

의료 진단이나 금융 신용 평가처럼 신뢰성이 중요한 분야에서 블랙박스 AI 모델의 의사결정을 설명하는 것은 필수적입니다. LIME, SHAP, 그리고 인과관계 기반 기법은 각각 고유한 장단점을 가집니다.

전체 모범답안 펼치기

의료 진단이나 금융 신용 평가처럼 신뢰성이 중요한 분야에서 블랙박스 AI 모델의 의사결정을 설명하는 것은 필수적입니다. LIME, SHAP, 그리고 인과관계 기반 기법은 각각 고유한 장단점을 가집니다.

LIME은 특정 예측에 대해 모델이 어떤 특성에 집중했는지 국소적으로 설명하는 데 강점이 있습니다. 모델 자체를 이해하기보다는 예측 결과에 대한 직관적인 설명을 제공하죠. 하지만 설명의 안정성이 떨어질 수 있고, 복잡한 상호작용을 포착하기 어렵다는 단점이 있습니다.

SHAP은 게임 이론에 기반하여 각 특성이 예측에 기여하는 정도를 정량적으로 보여줍니다. 국소적 설명뿐만 아니라 전역적 특성 중요도도 파악할 수 있어 LIME보다 더 체계적인 설명을 제공합니다. 다만, 계산 비용이 높고 해석이 다소 복잡할 수 있습니다.

인과관계 기반 기법은 단순히 특성 중요도를 넘어 '왜' 그런 예측이 나왔는지 근본적인 원인을 파악하는 데 초점을 맞춥니다. 이는 모델의 편향성을 탐지하거나, 실제 세상의 메커니즘을 이해하는 데 매우 유용합니다. 하지만 인과관계를 정확히 추론하는 것이 기술적으로 어렵고, 데이터만으로는 인과관계를 명확히 규명하기 어려운 경우가 많습니다.

실제 적용 시에는 설명하려는 도메인의 특성, 요구되는 설명의 수준(국소적 vs. 전역적, 상관관계 vs. 인과관계), 그리고 계산 자원 등을 종합적으로 고려하여 적절한 기법을 선택하거나 조합해야 합니다.

#LIME#SHAP#인과관계 추론#모델 투명성#특성 중요도

이 질문 단독 페이지 →

Q20 심화

분산된 데이터 환경에서 프라이버시를 보호하면서 머신러닝 모델을 학습시키는 연합 학습(Federated Learning)의 핵심 원리를 설명하고, 통신 오버헤드(communication overhead), 이질적인 데이터 분포(non-IID data), 그리고 모델 수렴(convergence) 문제와 같은 주요 도전 과제를 해결하기 위한 고급 전략들을 제시해 주십시오.

힌트 · 연합 학습은 중앙 서버 없이 분산된 클라이언트에서 학습하며, 통신 효율화, 클라이언트 샘플링, 개인화된 모델 학습 등으로 도전 과제를 해결합니다.

연합 학습은 데이터를 중앙 서버로 모으지 않고, 각 클라이언트에서 로컬 모델을 학습시킨 후, 그 모델들을 평균화하여 글로벌 모델을 만드는 방식입니다. 프라이버시를 보호하면서 머신러닝을 가능하게 하죠.

전체 모범답안 펼치기

연합 학습은 데이터를 중앙 서버로 모으지 않고, 각 클라이언트에서 로컬 모델을 학습시킨 후, 그 모델들을 평균화하여 글로벌 모델을 만드는 방식입니다. 프라이버시를 보호하면서 머신러닝을 가능하게 하죠.

하지만 몇 가지 어려움이 있습니다. 첫째, 통신 오버헤드가 클 수 있는데, 모델 압축이나 모델 업데이트 빈도 조절을 통해 해결할 수 있습니다. 둘째, 클라이언트마다 데이터 분포가 다를 수 있는데 (Non-IID 데이터), 클라이언트 샘플링 전략을 조정하거나, 개인화된 모델 학습을 통해 극복할 수 있습니다. 셋째, 모델 수렴 속도가 느릴 수 있는데, 적절한 학습률 스케줄링이나, advanced optimizer를 사용하는 것이 도움이 됩니다.

더 나아가, 차등 프라이버시 기술을 적용하여 각 클라이언트의 업데이트에 노이즈를 추가하거나, 동형 암호화를 사용하여 모델 업데이트를 암호화된 상태로 처리하는 방법도 고려할 수 있습니다.

#모델 평균화#차등 프라이버시#Non-IID 데이터#모델 압축#동형 암호화

이 질문 단독 페이지 →

Q21 심화

대규모 그래프 데이터(예: 소셜 네트워크, 추천 시스템)에 Graph Neural Network(GNN)를 적용할 때 발생하는 확장성(scalability) 문제와 메모리 제약 사항을 극복하기 위한 고급 기법들(예: GraphSAGE, Cluster-GCN, Sampling 기반 기법)을 비교 분석하고, 각 기법의 장단점 및 적합한 적용 시나리오를 설명해 주십시오.

힌트 · GNN은 노드 임베딩을 학습하지만, 대규모 그래프에서는 이웃 노드 샘플링이나 그래프 클러스터링을 통해 연산 및 메모리 효율성을 높입니다.

대규모 그래프에 GNN을 적용할 때 확장성 문제가 발생하는데, 전체 그래프를 메모리에 올리는 것이 어렵고, 모든 노드의 이웃 정보를 계산하는 데 시간이 오래 걸리기 때문입니다.

전체 모범답안 펼치기

대규모 그래프에 GNN을 적용할 때 확장성 문제가 발생하는데, 전체 그래프를 메모리에 올리는 것이 어렵고, 모든 노드의 이웃 정보를 계산하는 데 시간이 오래 걸리기 때문입니다.

이를 해결하기 위한 주요 기법으로 GraphSAGE, Cluster-GCN, Sampling 기반 기법들이 있습니다.

GraphSAGE는 전체 그래프 노드를 사용하는 대신, 각 노드의 이웃을 샘플링하여 임베딩을 학습합니다. 메모리 효율적이지만, 샘플링 과정에서 정보 손실이 발생할 수 있습니다. 대규모 그래프에서 노드 간 관계가 복잡하고 다양한 경우에 적합합니다.

Cluster-GCN은 그래프를 여러 클러스터로 분할하고, 각 클러스터 내에서 GNN을 학습합니다. 클러스터 내부의 연결은 유지하면서 클러스터 간 연결은 줄여 메모리 사용량을 줄입니다. 하지만 클러스터링 성능에 따라 결과가 달라질 수 있습니다. 그래프가 비교적 명확한 커뮤니티 구조를 가질 때 효과적입니다.

Sampling 기반 기법은 GraphSAGE 외에도 다양한 샘플링 전략을 사용합니다. 예를 들어, 레이어별로 다른 샘플링 비율을 적용하거나, 중요 노드를 더 많이 샘플링하는 방식 등이 있습니다. 특정 노드에 대한 정보 손실을 최소화해야 하는 경우에 유용합니다.

각 기법은 장단점이 뚜렷하므로, 그래프의 특성, 연산 자원, 그리고 원하는 정확도를 고려하여 적절한 기법을 선택해야 합니다.

#GraphSAGE#Cluster-GCN#Sampling#계층적 학습#메모리 효율성

이 질문 단독 페이지 →

함께 보면 좋은 AI / 데이터 면접 질문

← 전체 면접 질문 카테고리 보기

보유한 AI / 머신러닝 질문은 이게 전부가 아닙니다

패스잇 앱에는 직무별 면접 질문 수천 개와 모범답안이 담겨 있습니다. AI 모의면접으로 직접 답하고, 약점을 분석받아 보세요.