초거대 언어 모델(LLM)과 같이 수십억 개 이상의 파라미터를 가진 모델을 학습시키기 위해 분산 학습 환경을 구축해야 합니다. 단일 GPU로는 학습이 불가능한 모델을 효율적으로 학습시키기 위한 데이터 병렬화(Data Parallelism)와 모델 병렬화(Model Parallelism)의 차이점을 설명하고, 각 방식의 장단점 및 실제 구현 시 고려해야 할 기술적 도전 과제(예: 통신 오버헤드, 메모리 관리)를 논해주세요.
힌트 · Horovod, DeepSpeed, Megatron-LM, FSDP (Fully Sharded Data Parallel), Zero Redundancy Optimizer (ZeRO) 등의 기술과 gradient accumulation, mixed precision training 등을 언급하세요.
모범답안
초거대 모델 학습을 위한 분산 학습은 크게 데이터 병렬화와 모델 병렬화로 나뉩니다. 데이터 병렬화는 전체 데이터를 나누어 각 GPU에서 동일한 모델을 학습시키는 방식입니다. 구현이 비교적 간단하지만, 모델 크기가 커지면 각 GPU에 모델 전체가 올라가야 하므로 메모리 제약이 발생할 수 있습니다. Horovod나 DeepSpeed 같은 라이브러리를 사용해 통신 오버헤드를 줄이고, gradient accumulation을 통해 GPU 활용률을 높일 수 있습니다.
모델 병렬화는 모델 자체를 여러 GPU에 나누어 학습시키는 방식입니다. 메모리 제약은 줄일 수 있지만, GPU 간 통신량이 많아지고 구현이 복잡해집니다. Megatron-LM이나 FSDP 같은 기술은 모델 병렬화를 효율적으로 구현하기 위한 솔루션을 제공합니다. 특히 FSDP는 모델 파라미터를 쪼개어 각 GPU에 분산 저장하고 필요할 때만 통신하여 메모리 효율성을 높입니다. ZeRO와 같은 최적화 기법을 활용하여 메모리 사용량을 더욱 줄일 수도 있습니다. 두 방식 모두 mixed precision training을 통해 메모리 사용량을 줄이고 학습 속도를 높일 수 있습니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 복수의 시계열 데이터가 존재하고, 이들 간의 인과 관계를 파악하여 특정 시계열에 대한 외부 개입(intervention)의 효과를 측정하고자 합니다. 예를 들어, 특정 마케팅 캠페인이 제품 판매량 시계열에 미친 영향을 분석해야 할 때, 단순 상관 분석을 넘어선 인과적 효과를 추정하기 위한 고급 시계열 분석 기법과 그 한계를 설명해주세요.
- 대규모 복합 시스템에서 발생하는 비정상적인 로그 패턴이나 센서 데이터를 실시간으로 탐지해야 합니다. 정상 데이터는 풍부하지만 비정상 데이터는 매우 희귀하고 그 유형도 다양하여 레이블링이 어렵습니다. 이러한 환경에서 효과적인 비지도(Unsupervised) 또는 준지도(Semi-supervised) 기반의 이상 탐지 시스템을 설계하고 구축하기 위한 접근 방식과 최신 기술들을 설명해주세요.
- 금융 대출 심사 모델이 특정 소수 그룹에 대해 편향된 결과를 도출하고 있음을 발견했습니다. 이러한 편향이 발생할 수 있는 원인들을 설명하고, 모델 개발 파이프라인의 각 단계(데이터 수집, 전처리, 모델 학습, 평가)에서 편향을 감지하고 효과적으로 완화하기 위한 기술적 전략들을 구체적인 지표와 함께 제시해주세요.