WIA 표준

WIA-DATA-004 v1.0

데이터 파이프라인 표준

확장 가능하고 신뢰할 수 있는 데이터 흐름

버전 1.0.0 | 데이터 카테고리

이 표준에 대하여

弘益人間 (홍익인간) - 널리 인간을 이롭게 하라

데이터는 현대 사회의 원유입니다.
하지만 원유만으로는 아무것도 할 수 없습니다.
정제하고, 변환하고, 전달해야 합니다.
데이터 파이프라인은 바로 그 정제소입니다.

WIA-DATA-004는 현대 데이터 인프라의 핵심인 데이터 파이프라인을 표준화합니다. 데이터를 수집(Extract)하고, 변환(Transform)하며, 적재(Load)하는 전체 과정을 체계적으로 정의합니다.

왜 데이터 파이프라인이 중요한가?

핵심 개념

📥

Extract (추출)

다양한 소스에서 데이터를 수집합니다. API, 데이터베이스, 파일, 스트림 등

🔄

Transform (변환)

데이터를 정제하고, 정규화하고, 보강하고, 집계합니다

💾

Load (적재)

변환된 데이터를 목적지에 저장합니다. 데이터 웨어하우스, 레이크, 마트 등

🎯

Orchestration (오케스트레이션)

워크플로우를 관리하고 스케줄링합니다. Airflow, Prefect, Dagster 등

ETL vs ELT

특성 ETL ELT
순서 Extract → Transform → Load Extract → Load → Transform
변환 위치 별도 처리 엔진 데이터 웨어하우스 내부
적합한 경우 레거시 시스템, 제한된 저장소 클라우드 환경, 빅데이터
장점 데이터 프라이버시, 네트워크 효율 빠른 로딩, 유연한 변환
도구 Talend, Informatica dbt, Snowflake, BigQuery

Batch vs Stream Processing

특성 Batch Stream
처리 시점 주기적 (시간, 일, 주) 실시간 (밀리초 ~ 초)
데이터 크기 대량 (GB ~ TB) 소량 연속 (KB ~ MB)
지연시간 분 ~ 시간 밀리초 ~ 초
사용 사례 리포트, 분석, 백업 알림, 모니터링, 실시간 대시보드
도구 Spark Batch, Airflow Kafka, Flink, Spark Streaming

핵심 원칙

  1. 멱등성 (Idempotency): 같은 작업을 여러 번 실행해도 같은 결과
  2. 복원력 (Resilience): 실패해도 자동으로 복구
  3. 관찰성 (Observability): 모든 것을 모니터링하고 로깅
  4. 확장성 (Scalability): 데이터가 증가해도 성능 유지
  5. 데이터 품질: 쓰레기 입력 = 쓰레기 출력 방지

주요 도구와 기술

이 책에서 배울 내용

홍익인간의 정신으로

데이터 파이프라인은 단순한 기술이 아닙니다. 데이터를 통해 인류에게 가치를 전달하는 통로입니다. 올바른 데이터를 올바른 시간에 올바른 장소에 전달함으로써, 우리는 더 나은 의사결정을 내리고, 더 나은 제품을 만들며, 궁극적으로 인류를 이롭게 할 수 있습니다.