Feature Store Platform의 역할과 필요성
Feature Store는 원본 데이터를 ML 모델이 소비할 수 있는 형태로 변환하는 중앙집중식 데이터 플랫폼입니다. 데이터 과학팀이 피처 엔지니어링에 소요하는 시간이 전체 작업의 약 80%를 차지하는 상황에서, 여러 팀이 동일 피처를 반복 계산하고 정의 불일치가 발생하는 문제를 해결합니다.
이원 저장소 아키텍처
프로덕션급 Feature Store는 오프라인 스토어(S3, Delta Lake 등의 객체 저장소)와 온라인 스토어(Redis, DynamoDB 등의 저지연 데이터베이스)로 구성됩니다. 오프라인 스토어는 학습 데이터셋 생성을 위해 방대한 historical feature를 관리하며, 온라인 스토어는 실시간 추론 시 p99 10ms 이내의 응답 시간으로 피처 벡터를 제공합니다. 핵심은 두 저장소가 동일한 피처 정의로부터 생성되어 학습-서빙 간의 데이터 스큐(Training-Serving Skew)를 완전히 제거하는 것입니다.
피처 레지스트리와 변환 엔진
Feature Store의 메타데이터 계층인 피처 레지스트리는 모든 피처의 정의, 스키마, 버전, 소유권을 중앙에서 관리합니다. DSL(Domain-Specific Language) 또는 Python/SQL로 정의된 피처 변환 로직은 Spark(배치)나 Flink(스트리밍)를 통해 오프라인·온라인 저장소에 동시에 물리화됩니다. 이는 단일 소스 오브 트루(Single Source of Truth)를 보장합니다.