패스잇
AI / 데이터 · 심화

실시간(Real-time) 서빙과 배치(Batch) 학습을 모두 지원하는 확장 가능한 피처 스토어(Feature Store)를 설계한다고 가정해 봅시다. 온라인 스토어와 오프라인 스토어 간의 데이터 일관성(Consistency)을 유지하고, 피처 검색 지연 시간(Latency)을 최소화하며, 데이터 거버넌스를 확보하기 위한 아키텍처 및 기술 스택 선택에 대해 설명하시오.

힌트 · Kappa 아키텍처, CDC(Change Data Capture), Redis/Cassandra, Apache Hudi/Delta Lake, Feast와 같은 솔루션을 활용할 수 있습니다.

CAP 이론Eventual ConsistencyFeature MaterializationRedisApache Kafka

모범답안

실시간 서빙과 배치 학습을 모두 지원하는 확장 가능한 피처 스토어 설계 시, 핵심은 온라인/오프라인 스토어 간의 일관성과 낮은 지연 시간 확보입니다.

아키텍처는 카파 아키텍처를 기반으로, 데이터 소스의 변경 사항을 CDC(Change Data Capture) 기술로 실시간 스트림(Apache Kafka 등)에 발행합니다. 이 스트림은 온라인 스토어(Redis 등)와 오프라인 스토어(Apache Hudi/Delta Lake 등)로 각각 푸시됩니다.

온라인 스토어는 낮은 지연 시간의 피처 검색을 위해 Redis와 같은 인메모리 데이터베이스를 사용하고, 오프라인 스토어는 배치 학습 및 히스토리 조회를 위해 Hudi/Delta Lake와 같은 데이터 레이크 솔루션을 활용합니다.

데이터 일관성은 이벤트 기반 아키텍처와 재처리 메커니즘을 통해 확보하며, CAP 이론을 고려하여 일관성보다는 가용성과 파티션 내성을 우선시하는 eventual consistency 모델을 채택합니다. 피처는 필요에 따라 오프라인 스토어에서 미리 계산(Feature Materialization)하여 온라인 스토어에 로드하는 방식을 사용합니다. 데이터 거버넌스는 메타데이터 관리 및 접근 제어 기능을 통해 강화합니다. Feast와 같은 오픈소스 피처 스토어 솔루션은 이러한 요구사항을 충족하는 데 도움이 될 수 있습니다.

읽었다면, 이제 직접 답해볼 차례예요

패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.

함께 보는 MLOps 면접 질문

← MLOps 면접 질문 전체 보기