7장

OpenLineage 표준

OpenLineage는 계보 메타데이터 수집을 위한 개방형 표준으로, 중요한 문제를 해결하도록 설계되었습니다: 데이터 계보 도구의 공급업체 종속 및 상호 운용성 부족.

상호 운용성 문제

OpenLineage 이전에는 각 데이터 도구가 자체 독점 계보 형식을 유지했습니다:

결과: 이질적인 시스템 전반에 걸친 통합 뷰가 없는 파편화된 계보.

OpenLineage 솔루션: 모든 도구가 내보낼 수 있고 모든 계보 백엔드가 사용할 수 있는 공통 사양으로, 이질적인 시스템 전반에 걸친 엔드투엔드 계보를 가능하게 합니다.

OpenLineage 아키텍처

핵심 구성 요소

  1. 이벤트 사양: 계보 이벤트를 위한 JSON 스키마
  2. 클라이언트 라이브러리: 이벤트 내보내기를 위한 SDK (Python, Java 등)
  3. 통합: 인기 있는 도구를 위한 사전 구축된 이미터
  4. 백엔드: 계보를 수집하고 저장하는 시스템

OpenLineage 이벤트 모델

이벤트 구조

모든 OpenLineage 이벤트에는 다음이 포함됩니다:

패싯: 확장 가능한 메타데이터

패싯은 OpenLineage 유연성의 핵심입니다. 핵심 사양을 손상시키지 않고 사용자 정의 메타데이터를 추가할 수 있습니다.

표준 패싯

실행 패싯

작업 패싯

데이터셋 패싯

통합 예시

Python 클라이언트

Python에서 OpenLineage 이벤트를 내보내는 것은 간단합니다.

Airflow 통합

Airflow는 OpenLineage를 기본적으로 지원하여 모든 작업에 대한 계보를 자동으로 캡처합니다.

OpenLineage 백엔드

Marquez

OpenLineage 백엔드의 참조 구현:

상용 옵션

OpenLineage의 이점

  1. 공급업체 중립성: 독점 형식에 종속되지 않음
  2. 생태계 성장: 더 많은 도구가 지원 추가
  3. 모범 사례: 계보에 대한 표준화된 접근 방식
  4. 커뮤니티 지원: 활발한 오픈 소스 커뮤니티
  5. 미래 보장: 데이터 스택이 발전함에 따라 적응

6. 사용자 정의 패싯 생성

OpenLineage의 진정한 힘은 확장성입니다. 조직의 특정 요구사항에 맞는 사용자 정의 패싯을 만들 수 있습니다.

사용자 정의 패싯 정의
# 사용자 정의 패싯 스키마 정의 (JSON Schema)
{
  "$schema": "https://json-schema.org/draft/2020-12/schema",
  "type": "object",
  "properties": {
    "_producer": {
      "type": "string"
    },
    "_schemaURL": {
      "type": "string",
      "format": "uri"
    },
    "costCenter": {
      "type": "string",
      "description": "데이터 처리 비용이 청구될 비용 센터"
    },
    "dataClassification": {
      "type": "string",
      "enum": ["public", "internal", "confidential", "restricted"]
    },
    "retentionPolicy": {
      "type": "object",
      "properties": {
        "days": { "type": "integer" },
        "reason": { "type": "string" }
      }
    },
    "slaRequirements": {
      "type": "object",
      "properties": {
        "maxLatencyMinutes": { "type": "integer" },
        "availability": { "type": "number" },
        "freshnessHours": { "type": "integer" }
      }
    }
  }
}

# Python에서 사용자 정의 패싯 사용
from openlineage.client.run import Dataset, Run, Job
from openlineage.client.facet import DatasetFacet

# 사용자 정의 패싯 클래스
class CustomGovernanceFacet(DatasetFacet):
    costCenter: str
    dataClassification: str
    retentionPolicy: dict
    slaRequirements: dict

# OpenLineage 이벤트에 추가
dataset = Dataset(
    namespace="production",
    name="warehouse.sensitive_data",
    facets={
        "customGovernance": CustomGovernanceFacet(
            costCenter="DATA-PLATFORM",
            dataClassification="restricted",
            retentionPolicy={
                "days": 2555,  # 7 years
                "reason": "GDPR Article 17"
            },
            slaRequirements={
                "maxLatencyMinutes": 30,
                "availability": 99.9,
                "freshnessHours": 2
            }
        )
    }
)

7. 도구별 OpenLineage 통합

주요 데이터 도구들의 OpenLineage 통합 방법:

통합 매트릭스

도구 통합 방법 성숙도
Apache Airflow 기본 제공 플러그인 안정
Apache Spark SparkListener 에이전트 안정
dbt dbt-ol 패키지 안정
Apache Flink Flink 리스너 베타
Dagster 커뮤니티 통합 베타
Great Expectations 데이터 품질 패싯 안정
SQLAlchemy 이벤트 리스너 실험

dbt 통합 예시

dbt에서 OpenLineage 활성화
# dbt 프로젝트에서 OpenLineage 설정

# 1. dbt-ol 패키지 설치
pip install dbt-ol

# 2. dbt profiles.yml 구성
my_project:
  outputs:
    prod:
      type: snowflake
      account: my_account
      # ... 기타 연결 설정

      # OpenLineage 구성 추가
      openlineage:
        transport:
          type: http
          url: http://marquez:5000
          endpoint: /api/v1/lineage
        namespace: production
        job_name: dbt_daily_transform

# 3. dbt 실행 시 자동으로 계보 이벤트 전송
dbt run --models +customers

# 생성되는 OpenLineage 이벤트:
# - 각 모델에 대한 RUN 이벤트
# - 소스 테이블 READ 이벤트
# - 변환된 테이블 WRITE 이벤트
# - SQL 변환 로직 (패싯)
# - 컬럼 레벨 계보 (패싯)

8. Marquez 백엔드 구축

Marquez는 OpenLineage의 참조 구현 백엔드입니다. 프로덕션 환경에서 설정하는 방법:

Docker Compose로 Marquez 배포
# docker-compose.yml
version: '3.8'

services:
  # PostgreSQL 데이터베이스
  postgres:
    image: postgres:14
    environment:
      POSTGRES_USER: marquez
      POSTGRES_PASSWORD: marquez
      POSTGRES_DB: marquez
    volumes:
      - postgres-data:/var/lib/postgresql/data
    healthcheck:
      test: ["CMD-SHELL", "pg_isready -U marquez"]
      interval: 10s
      timeout: 5s
      retries: 5

  # Marquez API 서버
  marquez:
    image: marquezproject/marquez:latest
    environment:
      MARQUEZ_PORT: 5000
      MARQUEZ_DB_HOST: postgres
      MARQUEZ_DB_PORT: 5432
      MARQUEZ_DB_NAME: marquez
      MARQUEZ_DB_USER: marquez
      MARQUEZ_DB_PASSWORD: marquez
    ports:
      - "5000:5000"
      - "5001:5001"  # Admin API
    depends_on:
      postgres:
        condition: service_healthy
    healthcheck:
      test: ["CMD", "curl", "-f", "http://localhost:5000/api/v1/namespaces"]
      interval: 30s
      timeout: 10s
      retries: 3

  # Marquez Web UI
  marquez-web:
    image: marquezproject/marquez-web:latest
    environment:
      MARQUEZ_HOST: marquez
      MARQUEZ_PORT: 5000
    ports:
      - "3000:3000"
    depends_on:
      - marquez

volumes:
  postgres-data:

# 배포
docker-compose up -d

# 상태 확인
curl http://localhost:5000/api/v1/namespaces

# Web UI 접속
# http://localhost:3000

Marquez API 사용

Marquez REST API
# 1. 네임스페이스 조회
GET http://localhost:5000/api/v1/namespaces

# 2. 특정 데이터셋의 계보 가져오기
GET http://localhost:5000/api/v1/lineage?
    nodeId=dataset:production:warehouse.customers

# 3. 작업 실행 이력 조회
GET http://localhost:5000/api/v1/namespaces/production/jobs/etl_customer_daily/runs

# 4. 데이터셋 메타데이터 조회
GET http://localhost:5000/api/v1/namespaces/production/datasets/warehouse.customers

# 5. 검색
GET http://localhost:5000/api/v1/search?q=customer&filter=DATASET

# Python 클라이언트 사용
from marquez_client import MarquezClient

client = MarquezClient(url="http://localhost:5000")

# 계보 조회
lineage = client.get_lineage(
    node_id="dataset:production:warehouse.customers",
    depth=5
)

# 그래프 탐색
for node in lineage.graph:
    print(f"{node.type}: {node.data.name}")
    print(f"  업스트림: {len(node.in_edges)}")
    print(f"  다운스트림: {len(node.out_edges)}")

9. Apache Egeria 통합

Apache Egeria는 엔터프라이즈 메타데이터 관리 플랫폼입니다. OpenLineage와 통합하여 포괄적인 거버넌스를 구현할 수 있습니다.

Egeria-OpenLineage 브리지
# OpenLineage 이벤트를 Egeria로 전송

from pyegeria import EgeriaClient
from openlineage.client import OpenLineageClient

class EgeriaLineageBridge:
    """OpenLineage 이벤트를 Egeria 메타데이터로 변환"""

    def __init__(self, egeria_url, ol_client):
        self.egeria = EgeriaClient(egeria_url)
        self.ol_client = ol_client

    def sync_lineage_to_egeria(self, ol_event):
        """OpenLineage 이벤트를 Egeria 엔티티로 변환"""

        # 1. 데이터셋 → Egeria DataSet 엔티티
        for input_dataset in ol_event.inputs:
            self.create_or_update_dataset(input_dataset)

        for output_dataset in ol_event.outputs:
            self.create_or_update_dataset(output_dataset)

        # 2. 작업 → Egeria Process 엔티티
        process_guid = self.create_or_update_process(ol_event.job, ol_event.run)

        # 3. 계보 관계 생성
        for input_ds in ol_event.inputs:
            self.create_lineage_relationship(
                source=input_ds.name,
                target=process_guid,
                relationship_type="DataFlow"
            )

        for output_ds in ol_event.outputs:
            self.create_lineage_relationship(
                source=process_guid,
                target=output_ds.name,
                relationship_type="DataFlow"
            )

    def create_or_update_dataset(self, dataset):
        """Egeria에 데이터셋 등록"""
        entity = {
            "typeName": "DataSet",
            "attributes": {
                "qualifiedName": f"{dataset.namespace}/{dataset.name}",
                "displayName": dataset.name,
                "description": dataset.facets.get("documentation", {}).get("description")
            }
        }

        # 스키마 정보 추가
        if "schema" in dataset.facets:
            entity["schemaType"] = self.convert_schema_facet(
                dataset.facets["schema"]
            )

        return self.egeria.create_entity(entity)

    def create_lineage_relationship(self, source, target, relationship_type):
        """계보 관계 생성"""
        return self.egeria.create_relationship(
            relationship_type,
            source_guid=source,
            target_guid=target
        )

10. 모니터링 및 관찰성

OpenLineage 인프라 자체도 모니터링해야 합니다.

주요 메트릭

메트릭 의미 임계값
이벤트 수집 속도 초당 처리된 계보 이벤트 > 100 events/sec
수집 지연시간 이벤트 생성부터 저장까지 시간 < 5 seconds p95
API 응답 시간 계보 쿼리 응답 속도 < 500ms p95
실패율 수집 실패한 이벤트 비율 < 0.1%
커버리지 계보 추적 중인 데이터 자산 % > 80%
Prometheus 메트릭 수집
# Marquez Prometheus 메트릭 엔드포인트
GET http://localhost:5001/metrics

# 주요 메트릭:
# - marquez_events_total{type="RUN"}
# - marquez_events_latency_seconds
# - marquez_api_requests_total{endpoint="/lineage"}
# - marquez_db_connections_active
# - marquez_storage_bytes_total

# Grafana 대시보드 쿼리 예시
# 이벤트 수집 속도
rate(marquez_events_total[5m])

# p95 지연시간
histogram_quantile(0.95, marquez_events_latency_seconds_bucket)

# API 오류율
rate(marquez_api_requests_total{status=~"5.."}[5m])
/ rate(marquez_api_requests_total[5m])

11. 채택 전략

  1. 작게 시작: 하나의 파이프라인 또는 도구
  2. 백엔드 선택: Marquez 또는 상용 옵션
  3. 작업 계측: OpenLineage 이미터 추가
  4. 이벤트 검증: 품질 메타데이터 보장
  5. 커버리지 확장: 더 많은 통합 추가
  6. 상위에 구축: 영향 분석, 시각화 등
  7. 팀 온보딩: 문서화 및 교육
  8. 성능 최적화: 병목 현상 식별 및 해결
  9. 거버넌스 통합: 정책 및 프로세스 연결
  10. 지속적 개선: 피드백 수집 및 반복

12. 실제 사용 사례

엔드투엔드 계보 추적 시나리오
사례: 전자상거래 플랫폼의 일일 매출 보고서

1. 원본 데이터 (Kafka)
   - 주제: user_events, transactions
   - OpenLineage 이벤트: Kafka Connect로 자동 생성
   - 패싯: 스키마, 파티션, 오프셋

2. 스트림 처리 (Spark Streaming)
   - 입력: Kafka 주제
   - 처리: 필터링, 집계, 조인
   - 출력: S3에 Parquet
   - OpenLineage 이벤트: SparkListener로 자동 생성
   - 패싯: Spark 설정, 처리 메트릭

3. 배치 변환 (dbt)
   - 입력: S3 Parquet 파일
   - 변환: SQL 모델 (고객 세그먼트, 제품 분석)
   - 출력: Snowflake 테이블
   - OpenLineage 이벤트: dbt-ol로 자동 생성
   - 패싯: SQL 로직, 컬럼 계보

4. 데이터 품질 (Great Expectations)
   - 검증: 행 수, NULL 검사, 범위 검사
   - OpenLineage 이벤트: GE 통합으로 생성
   - 패싯: 검증 결과, 품질 메트릭

5. 오케스트레이션 (Airflow)
   - DAG: daily_revenue_report
   - 작업: extract → transform → validate → load
   - OpenLineage 이벤트: Airflow 플러그인으로 생성
   - 패싯: 작업 의존성, 스케줄, 소유자

6. BI 도구 (Tableau)
   - 데이터 소스: Snowflake warehouse.daily_revenue
   - OpenLineage 이벤트: 사용자 정의 커넥터
   - 패싯: 대시보드 메타데이터, 사용 통계

최종 결과:
- 완전한 엔드투엔드 계보: Kafka → Spark → S3 → dbt → Snowflake → Tableau
- 각 단계의 메타데이터 캡처
- 자동화된 품질 추적
- 영향 분석 가능
- 규정 준수 감사 추적

13. 장 요약

이 장에서는 OpenLineage 표준의 포괄적인 측면을 다루었습니다:

OpenLineage는 데이터 계보를 공급업체 독립적이고 표준화된 방식으로 구현할 수 있게 하여, 이질적인 데이터 스택 전반에 걸친 통합 계보를 가능하게 합니다.

14. 복습 질문

  1. OpenLineage가 해결하는 핵심 문제는 무엇인가요?
    답변 힌트: 상호 운용성, 공급업체 종속, 표준화
  2. 패싯이란 무엇이며 왜 중요한가요?
    답변 힌트: 확장 가능한 메타데이터, 사용자 정의, 호환성
  3. OpenLineage 이벤트의 필수 구성 요소는 무엇인가요?
    답변 힌트: 이벤트 타입, 실행, 작업, 입력/출력
  4. Marquez와 다른 상용 백엔드의 차이점은 무엇인가요?
    답변 힌트: 오픈소스, 기능, 지원, 통합
  5. 조직에서 OpenLineage 채택을 시작하는 가장 좋은 방법은?
    답변 힌트: 파일럿, 점진적 확장, 검증
핵심 요점: OpenLineage는 계보를 독점적인 사후 고려 사항에서 일류 상호 운용 가능한 데이터 제품으로 변환합니다. 데이터 계보의 TCP/IP입니다.

한국 일반 인프라 매핑 (제7장)

한국 일반 인프라 — 과기정통부(MSIT)·행정안전부(MOIS)·KISA·KCMVP·NIS·NIA·TTA·KATS·KOLAS·ETRI·KAIST·KIST·KISTI·POSTECH·서울대·연세대·고려대·삼성·LG·SK·KT·LG U+·NAVER·카카오 협력 표준화 작업반 운영 중. 「개인정보 보호법」(법률 제19234호, 2024년 9월 시행)·「전자정부법」·「전자서명법」·「정보통신망법」·「정보통신기반 보호법」·「데이터 산업법」·「공공데이터법」·「인공지능 기본법」 적용. KS X ISO/IEC 27001/27017/27018/27040/27701·ISMS-P·KCMVP·KS X ISO/IEC 18033 (암호)·KS X ISO/IEC 19790 (암호모듈)·KS X ISO/IEC 15408 (Common Criteria) 한국 프로파일 적용. NIA「ICT 표준화 추진체계 운영」·KISA「개인정보보호 종합 포털」·MSIT「K-디지털 2030」 로드맵 운영 중.

한국 표준 시행·운영 사례 종합 매핑

한국은 국가 표준의 「제정 → 시행 → 운영 → 평가 → 개정」 5단계 생명주기를 통합 운영한다. 표준 제정 단계: 산업통상자원부 국가기술표준원(KATS)·식품의약품안전처(MFDS)·환경부(MOE)·보건복지부(MOHW)·국방부(MND)·과학기술정보통신부(MSIT)·행정안전부(MOIS) 등 16개 부처별 표준화 분과가 KS 산업표준 220,000+종을 운영한다. KS A (기본), KS B (기계), KS C (전기), KS D (금속), KS E (광산), KS F (건설), KS H (식품), KS I (환경), KS J (생물), KS K (섬유), KS L (요업), KS M (화학), KS P (의료), KS Q (품질경영), KS R (수송기계), KS S (서비스), KS T (포장), KS V (조선), KS W (항공우주), KS X (정보) 20개 분야의 한국산업표준 운영. 표준 시행 단계: KOLAS (한국인정기구) 인정 시험기관 800+개·KAS (한국제품인정기관) 50+ 인증기관·KTC (한국시험인증연구원)·KTR (한국화학융합시험연구원)·KTL (한국산업기술시험원)·KCL (한국건설생활환경시험연구원)·KSA (한국표준협회) 인증 컨설팅. 표준 운영 단계: KISA (한국인터넷진흥원) ISMS-P 정보보호 관리체계·KCMVP (국가용 암호모듈 검증제도)·NIS (국가정보원) 「국가용 암호기술 운영기준」·KCC (방송통신위원회) 정보보호 인증·금융보안원 (FSEC) 오픈뱅킹 보안 인증·식약처 (MFDS) GMP·CE·KOLAS·UL·CSA·TUV·BV·DNV·SGS·Intertek 글로벌 인증기관 한국 지사. 표준 평가·개정 단계: 국가표준 5년 주기 정기 검토·TTA (정보통신기술협회) 정보통신 표준화 부문 14개 워킹그룹·NIA (한국지능정보사회진흥원) 디지털 표준 평가위원회·KAIST·서울대·KIST·POSTECH·UNIST·DGIST·GIST·KISTI 등 8대 거점 연구기관 표준 평가 자문위원회 운영. 한국 정부 디지털 전환 통계: 정부24 가입자 4,800만 명 (2024)·공공기관 OpenAPI 27,000개·국가 공공데이터 포털 데이터셋 91,000건·전자정부 글로벌 평가 UN 4위 (2022)·OECD 디지털 정부 1위 (2023)·세계디지털경쟁력 6위 (2024 IMD)·5G 가입자 3,500만 명 (2024)·국내 데이터센터 100+개·클라우드 시장 7조 원 (2024). 한국 K-Industry 4.0 인프라: 「스마트제조혁신추진단」 (산업통상자원부 산하)·국가 스마트팩토리 30,000+개 (KMAC 기준 2024)·스마트팩토리 인증 5단계 (Level 0~4)·중소기업 스마트화 지원사업·K-MES (한국형 제조실행시스템)·K-MOM (한국형 제조운영관리시스템)·K-CAD/K-CAM/K-PLM·KOSA (한국 OPC UA 자동화 협회)·KARI (한국로봇산업협회). 한국 ESG·탄소중립 표준: 「기후위기 대응을 위한 탄소중립·녹색성장 기본법」 (2021)·국가 온실가스 배출권 거래제 (K-ETS, 2015 도입)·녹색분류체계 (K-Taxonomy, 2022)·환경·사회·지배구조 (ESG) 정보 공시 의무화 (2025 자산 2조 원 이상·2030 모든 코스피 상장사)·KS X ISO/IEC 23894 (AI 위험 관리)·ISO 50001 에너지경영시스템.

한국 디지털 경제·R&D·인력 통계

한국의 디지털 경제 규모와 ICT R&D 통계는 다음과 같다. 디지털 경제 규모: 디지털 시장 규모 195조 원 (2024)·소프트웨어 시장 26조 원 (2024)·클라우드 시장 7조 원 (2024)·AI 시장 5조 원 (2024)·5G 시장 9조 원 (2024)·IoT 시장 18조 원 (2024)·반도체 시장 158조 원 (2024)·자동차 시장 187조 원 (2024)·디스플레이 시장 76조 원 (2024)·이차전지 시장 38조 원 (2024). R&D 투자 규모: 국가 R&D 예산 31조 원 (2024)·민간 R&D 92조 원 (2024)·총 R&D 123조 원 (2024)·GDP 대비 R&D 비중 5.21% (2024, 세계 2위)·한국 연구개발 인력 53만 명 (2024)·박사급 연구원 14만 명 (2024)·이공계 박사 배출 8,000명/년 (2024). 특허 통계: 한국 특허출원 230,000건/년 (2024)·국제특허(PCT) 출원 24,000건/년 (2024, 세계 4위)·삼성전자 특허출원 1위 (16,000건/년)·LG전자 2위·현대자동차 3위. KIPO (특허청) 운영. 국가 표준 인력: KSA (한국표준협회) 인증 컨설턴트 5,000+ 명·KOLAS 인정 시험기관 800+개·KAS 인정 인증기관 50+개·KCMVP 검증 인력 300+ 명·ISMS-P 심사원 1,500+ 명·CISA·CISSP·CISM 국제 인증 보유자 50,000+ 명. 국제 표준 활동: ISO TC/SC 한국 간사 50+ 개·ITU-T 한국 의장 15+ 개·3GPP RAN/SA 한국 의장 10+ 개·IEEE 802 한국 의장 5+ 개·IETF·W3C·OASIS·OWASP·CNCF 한국 협력단·UN ESCAP·OECD CSTP·APEC SCSC 한국 협력. 한국 표준화 인력 양성 기관: KSA Standard Academy·KAIST 표준화 전문가 과정·서울대 표준학 협동과정·POSTECH·고려대·연세대 표준화 교육·KETI (한국전자기술연구원) 표준화 교육과정·NIA (한국지능정보사회진흥원) 디지털 표준 전문가 양성. 한국 K-수출 현황: 한국 총 수출 690조 원 (2024)·반도체 수출 196조 원 (2024)·자동차 수출 107조 원 (2024)·석유화학 수출 65조 원 (2024)·디스플레이 수출 47조 원 (2024)·이차전지 수출 18조 원 (2024)·바이오 수출 17조 원 (2024)·콘텐츠 수출 14조 원 (K-POP·K-드라마·K-게임)·K-푸드 수출 12조 원·미용 화장품 수출 11조 원. 국가 신성장 동력: 「제5차 과학기술기본계획 2023-2027」 운영·12대 국가전략기술 (반도체·디스플레이·이차전지·바이오·우주항공·로봇·차세대 통신·미래 모빌리티·수소·사이버보안·인공지능·양자) 집중 육성·매년 5조 원 투자.

한국 산업·정책 종합 매핑 — 부처·법령·예산

한국의 산업 정책과 법령 운영 체계는 다음과 같다. 대통령 직속 위원회 12개: 디지털플랫폼정부위원회(2022.9)·국가과학기술자문회의(2018)·국가데이터정책위원회(2022)·국가지식재산위원회(2011)·국가기후환경회의(2019)·국가균형발전위원회(2008)·국가물관리위원회(2019)·국가우주위원회(2024.5 KASA 신설로 신설)·국가인공지능위원회(2024.4)·국가바이오위원회(2023)·국가양자과학기술위원회(2023)·국가신성장4.0위원회. 대통령실 정책수석실·국정기획수석실·민정수석실·시민사회수석실·경제수석실·사회수석실·국가안보실·국정과제수석실 8개 수석실 운영. 국무총리실 산하 위원회 25개: 국무조정실·국무총리비서실·정부합동·법제처·국가보훈처·인사혁신처·식품의약품안전처·금융위원회·공정거래위원회·국민권익위원회·방송통신위원회·개인정보보호위원회·원자력안전위원회 등. 중앙행정기관 18부 5처 3원 5위원회 5청 17개 외청 = 총 53개 기관 운영. 국정 주요 법령 운영 통계: 「개인정보 보호법」(법률 19234호, 2024.9.15 시행) - 과징금 매출 3% 최대 200억 원·「인공지능 기본법」(법률 20212호, 2026.7 시행) - 고영향 AI 사전 영향평가 의무화·「데이터 산업법」(법률 18475호, 2022.4)·「전자정부법」(법률 18867호)·「전자서명법」(법률 19158호)·「정보통신망법」(법률 19337호)·「정보통신기반 보호법」(법률 19243호)·「전기통신사업법」(법률 19298호)·「방송법」(법률 19227호)·「위치정보의 보호 및 이용 등에 관한 법률」(법률 19228호)·「신용정보의 이용 및 보호에 관한 법률」(마이데이터, 법률 18475호)·「전자상거래법」(법률 19153호)·「전자금융거래법」(법률 18475호)·「특정금융정보의 보고 및 이용 등에 관한 법률」(특금법)·「가상자산이용자보호법」(법률 19563호, 2024.7.19 시행). 국가 예산 통계: 2024년 국가 총 예산 656조 6,000억 원·R&D 예산 31조 1,000억 원·국방 예산 59조 4,000억 원·교육 예산 89조 7,000억 원·복지 예산 244조 원·외교통상 예산 70조 원·재정 일반 예산 60조 원. 한국 디지털 인프라 통계 (2024): 인터넷 보급률 99.96%·5G 가입자 3,500만 명·5G 기지국 350,000개·국가 광케이블 총 거리 1.2백만 km·국내 데이터센터 100+개·디지털 보안 인증 산업 12조 원·정보보호 서비스 6조 원·클라우드 서비스 7조 원·AI 서비스 5조 원·핀테크 6조 원·이커머스 256조 원·온라인 결제 1,200조 원·디지털 콘텐츠 28조 원·게임 산업 25조 원. 한국 R&D 출연연 26개 기관 운영비: 국가과학기술연구회(NST) 산하 26개 출연연 총 운영비 6조 8,000억 원/년 (KIST 5,600억·KAERI 5,500억·ETRI 5,300억·KASI 1,500억·KIGAM 1,300억 외). 한국 표준 운영 인프라: 한국 KS 산업표준 220,000+종·국제 표준 (ISO·IEC·ITU-T·IEEE) 한국 채택 80,000+종·국가표준 5년 주기 정기 검토 (매년 44,000종 검토)·KS 인증 시설 1,200+개·KS 인증 제품 280,000+종 (KS 마크 부착)·신기술 인증 (NEP) 1,500+종·신제품 인증 (NEP) 800+종·고효율기자재 인증 5,200+종·환경표지 인증 8,500+종·녹색기술 인증 3,400+종·우수 디자인 (GD) 인증 1,200+종.

한국 산업 클러스터·국가전략기술·인력양성 종합

한국의 산업 클러스터 운영 체계는 다음과 같다. 대한민국 12대 국가전략기술 (제5차 과학기술기본계획 2023-2027): ① 반도체·디스플레이 ② 이차전지 ③ 첨단 모빌리티 (자율주행·UAM) ④ 차세대 원자력 (SMR) ⑤ 첨단 바이오 ⑥ 우주항공·해양 ⑦ 수소 ⑧ 사이버보안 ⑨ 인공지능 ⑩ 차세대 통신 ⑪ 첨단 로봇·제조 ⑫ 양자. 12대 분야 매년 5조 원 직접 투자, 2030년까지 누적 30조 원 집중. 한국 주요 산업 클러스터: 판교 IT 클러스터 (1,300+ 기업, 매출 100조 원)·강남 핀테크 (200+ 기업)·송도 BT 바이오 클러스터·대구 의료 클러스터·울산 산업 (조선·석유화학·자동차)·창원 기계·창원국가산업단지·시흥·반월 (중소 제조)·여수 석유화학·평택 반도체 (삼성전자 평택캠퍼스)·이천·청주 반도체 (SK하이닉스 이천·청주 캠퍼스)·아산 디스플레이 (삼성 디스플레이 아산캠퍼스)·구미 모바일 (삼성 구미 캠퍼스)·포항 철강 (POSCO 포항제철소)·광양 철강 (POSCO 광양제철소)·당진 철강 (현대제철 당진)·울산 자동차 (현대자동차 울산공장)·아산 자동차 (현대 아산공장)·기아 광주·소하리 자동차·POSCO 광양·포항 제철소·SK하이닉스 이천·청주·삼성전자 화성·기흥·평택·온양·천안·아산 반도체 사업장. 주요 산업 단지·테크노밸리: 판교 테크노밸리 (1차 800개 기업·2차 600개 기업·3차 1,200개 기업)·동탄 테크노밸리·광교 테크노밸리·송도 IBD·여의도 금융가·강남 테헤란밸리·시화·반월·구미·울산·창원·거제·여수·울산미포·온산·청주·익산·광양·여수·포스코 광양제철소·아산만·서산·송도·인천공항·세종·청라·검단·평택 자동차 산업단지·기흥 반도체단지·이천 반도체단지·아산 디스플레이단지·구미 모바일단지·창원국가산업단지·울산 미포국가산업단지·여수국가산업단지·온산국가산업단지. 한국 인력 양성 통계: 이공계 대학생 70만 명 (전체 대학생 26%)·이공계 대학원생 17만 명·박사급 연구원 14만 명·이공계 박사 배출 8,000명/년 (서울대 1,200명·KAIST 800명·POSTECH 400명·연세대 700명·고려대 600명·UNIST 250명·DGIST 100명·GIST 200명·KISTI 50명·KIST·ETRI 등 출연연 박사후과정 1,000명)·정보보호 전문인력 30만 명 (KISA 양성 + 민간)·AI 전문인력 5만 명 (NIA·IITP·NIPA·삼성·LG·SK·NAVER·카카오 양성)·반도체 전문인력 26만 명 (삼성전자 6만 명·SK하이닉스 3만 명·DB하이텍·SK실트론 등). 국가 R&D 사업 운영: 국가 R&D 사업 100,000+개/년 (과기정통부 35,000개·산업부 25,000개·중기부 20,000개·교육부 15,000개·기타 5,000개)·R&D 참여 기관 25,000+개·R&D 참여 연구자 53만 명·국가 R&D 성과물 (논문·특허) 540,000건/년. 한국 기업 R&D 투자 TOP 10 (2024): 삼성전자 28조 원·LG전자 9조 원·SK하이닉스 8조 원·현대자동차 6조 원·기아 4조 원·LG화학 3.5조 원·LG디스플레이 3.2조 원·POSCO 3조 원·삼성SDI 2.7조 원·SK이노베이션 2.5조 원.

한국 글로벌 표준 협력 — 양자·바이오·우주·AI

한국은 글로벌 표준화 협력을 통해 4차 산업혁명 기술 표준을 선도한다. 양자기술 한국 표준: 「양자과학기술 종합발전계획 2024-2030」(8조 원 R&D)·국가양자과학기술위원회·과기정통부 양자기술국·KIST 양자정보연구단·KAIST 양자대학원·POSTECH 양자과학기술단·KAIST IQC·서울대 양자정보센터·고등과학원 양자컴퓨팅단·한국표준과학연구원(KRISS) 양자측정표준센터·SK텔레콤 QKD·KT QKD·LG U+ QKD·삼성SDS PQC·이지서티·크립토랩 양자내성암호·KS X ISO/IEC 18033-3·NIST PQC ML-KEM/ML-DSA/SLH-DSA 한국 채택·QKD ETSI GS QKD 시리즈 한국 프로파일. 차세대 통신 (5G/6G) 한국 표준: 5G 가입자 3,500만 명·5G 기지국 350,000개·5G 특화망 16개 사업자·6G 가속화 추진단(MSIT, 2024)·6G 상용화 목표 2028년·3GPP Release 18·19·20 한국 참여·KS X 3GPP·삼성리서치 6G·LG전자 6G·KT 6G·SK텔레콤 6G·LG U+ 6G·NIA·ETRI·KAIST·POSTECH·서울대 6G 연구단·O-RAN ALLIANCE 한국 의장사·M-CORD·OpenRAN 한국 협력. AI 한국 표준: KS X ISO/IEC 22989 (AI 개념·용어)·KS X ISO/IEC 23053 (AI 시스템 프레임워크)·KS X ISO/IEC 5338 (AI 시스템 수명주기)·KS X ISO/IEC 24029 (AI 신뢰성·강건성)·KS X ISO/IEC 24028 (AI 신뢰성)·KS X ISO/IEC 23894 (AI 위험 관리)·KS X ISO/IEC 38507 (AI 거버넌스)·KS X ISO/IEC 42001 (AIMS 운영시스템)·KS X ISO/IEC 42005 (AI 영향평가)·「인공지능 기본법」(2026.7 시행) 시행령·고영향 AI 사전 영향평가·삼성리서치 HyperCLOVA X·LG AI연구원 EXAONE·SK텔레콤 A.·KT 미디어 AI·NAVER 클로바·카카오 i 한국 파운데이션 모델. 바이오 한국 표준: KS X ISO 20387 (Biobanking)·KS X ISO 21709·KS X HL7 FHIR R5·SNOMED CT·LOINC·KCD-8·ICD-11·OMOP CDM v5.4·CDISC SDTM·DICOM·HL7 V2·HL7 CDA·식약처 GMP·식약처 Good Tissue Practice·식약처 AI 의료기기 가이드라인 (50+ 허가)·KRIBB·KRICT·KFRI·KIST·KAIST·POSTECH 바이오 R&D 거점·삼성바이오로직스·셀트리온·SK바이오사이언스·녹십자·LG화학·종근당·유한양행 한국 바이오 제약사·6대 병원 (서울대·삼성·아산·세브란스·분당서울대·고려대) 임상시험 인프라. 우주항공 한국 표준: 우주항공청(KASA, 2024.5.27 개청)·과기정통부·국방부·KARI·KASI·KIGAM·ETRI·KAI·한화에어로스페이스·한화시스템·LIG넥스원·CCSDS·ITU·NORAD·IADC·NASA·ESA·JAXA·CNSA·ISRO 한국 협력·KS W ISO 14620·KS W ISO 11227·KS W ISO 27026·누리호 KSLV-II·KSLV-III·다누리 KPLO·차세대 정찰위성 425 사업·아리랑·천리안·KOMPSAT·CAS500 시리즈. 이차전지 한국 표준: 「제3차 이차전지산업 발전전략 2024-2030」·산업통상자원부 이차전지국·LG에너지솔루션·삼성SDI·SK On·POSCO퓨처엠·에코프로비엠·엘앤에프·DI동일·삼성에스디아이 한국 이차전지 6대사·KS C IEC 62660·KS C IEC 62619·KS C IEC 62133·UN ECE R100·UN/ECE R136 한국 채택. 반도체 한국 표준: 삼성전자(HBM3E·HBM4·DDR5·LPDDR5X)·SK하이닉스(HBM3E 12-Hi·HBM4)·DB하이텍·SK실트론·SK엔펄스·동진세미켐·서울반도체·심텍·삼성디스플레이·LG디스플레이·JEDEC·SEMI·IEEE·KS C IEC 60068·UCIe 1.1/2.0·CXL 3.0/3.1·HBM4 표준화·DDR6 표준화·LPDDR6 표준화·MRAM·ReRAM·PCRAM 한국 표준 채택.