1장

그래프 데이터베이스 개요

그래프 데이터베이스는 데이터 저장 및 관리에 대한 근본적인 패러다임 전환을 나타냅니다. 전통적인 관계형 데이터베이스가 엄격한 행과 열의 테이블로 데이터를 구조화하는 것과 달리, 그래프 데이터베이스는 데이터의 자연스러운 연결성을 포용하여 복잡하고 상호 연결된 시스템을 모델링하는 데 이상적입니다.

그래프 데이터베이스란 무엇인가?

그래프 데이터베이스는 노드(nodes), 엣지(edges), 그리고 속성(properties)을 사용하여 데이터를 표현하고 저장하는 특수한 데이터베이스 관리 시스템입니다. 이 데이터 모델은 엔티티 간의 관계를 직접 포착하여 이러한 연결을 탐색하는 쿼리에 대해 매우 효율적입니다.

핵심 구성 요소

모든 그래프 데이터베이스는 세 가지 기본 구성 요소로 구축됩니다:

핵심 통찰: 그래프 데이터베이스에서 관계는 1등급 시민입니다. 쿼리 시간에 비용이 많이 드는 JOIN 연산을 통해 계산되는 것이 아니라 데이터베이스에 명시적으로 저장되어 관계 탐색이 매우 빠릅니다.

데이터베이스 기술의 진화

그래프 데이터베이스가 데이터베이스 생태계에서 어디에 적합한지 이해하기 위해 데이터 저장 기술의 진화를 살펴보겠습니다:

1. 계층형 데이터베이스 (1960-1970년대)

초기 데이터베이스는 각 레코드가 단일 부모를 가지는 트리 구조를 사용했습니다. IBM의 Information Management System (IMS)이 대표적인 예입니다. 특정 사용 사례에는 효율적이었지만, 계층형 데이터베이스는 유연성이 부족하고 다대다 관계를 쉽게 표현할 수 없었습니다.

2. 네트워크 데이터베이스 (1970년대)

CODASYL과 같은 네트워크 데이터베이스는 레코드가 여러 부모를 가질 수 있게 하여 더 복잡한 관계를 허용했습니다. 그러나 이러한 구조를 탐색하려면 절차적 프로그래밍이 필요하여 사용하고 유지 관리하기 어려웠습니다.

3. 관계형 데이터베이스 (1970년대-현재)

Edgar F. Codd의 관계형 모델은 데이터를 행과 열이 있는 테이블로 구성하여 데이터 관리에 혁명을 일으켰습니다. SQL은 선언적 쿼리 언어를 제공했으며, 모델의 수학적 기반(관계 대수)은 데이터 일관성을 보장했습니다. 관계형 데이터베이스는 수십 년 동안 지배적이었으며 많은 애플리케이션의 기본 선택으로 남아 있습니다.

4. NoSQL 데이터베이스 (2000년대)

웹 규모 애플리케이션이 등장하면서 특정 사용 사례에서 관계형 데이터베이스의 한계가 명백해졌습니다. NoSQL 데이터베이스는 여러 형태로 등장했습니다:

유형 예시 특징 사용 사례
키-값 저장소 Redis, DynamoDB 간단하고 빠른 조회 세션 관리, 캐싱
문서 데이터베이스 MongoDB, CouchDB 유연한 스키마리스 문서 콘텐츠 관리, 카탈로그
컬럼 패밀리 저장소 Cassandra, HBase 넓은 테이블, 시계열 최적화 분석, 로그 집계
그래프 데이터베이스 Neo4j, Amazon Neptune 연결된 데이터 최적화 소셜 네트워크, 추천 시스템

5. 그래프 데이터베이스 (2000년대-현재)

그래프 데이터베이스는 고도로 연결된 데이터를 효율적으로 저장하고 쿼리하는 특정 요구를 해결하기 위해 등장했습니다. 이전 데이터베이스 모델도 관계를 표현할 수 있었지만 비효율적으로 수행했습니다. 그래프 데이터베이스는 관계를 데이터 모델의 핵심 부분으로 만들었습니다.

그래프 데이터베이스가 중요한 이유

그래프 데이터베이스는 관계가 데이터 자체만큼 중요한 시나리오에서 탁월합니다. 다음은 그 이유입니다:

연결된 데이터에서의 성능

관계형 데이터베이스에서 연결을 찾으려면 JOIN 작업이 필요하며, JOIN 수가 증가함에 따라 기하급수적으로 느려집니다. 그래프 데이터베이스는 인덱스 프리 인접성(index-free adjacency)을 사용하며, 각 노드는 인접한 노드에 대한 직접 참조를 유지합니다. 이는 데이터베이스 크기와 관계없이 관계 탐색이 상수 시간 작업임을 의미합니다.

성능 예시: 소셜 네트워크에서 친구의 친구의 친구(3단계 분리) 찾기:

직관적인 데이터 모델링

그래프 데이터베이스는 우리가 연결된 데이터에 대해 자연스럽게 생각하는 방식을 반영합니다. 애플리케이션을 설계할 때 종종 엔티티와 관계를 보여주는 화살표가 있는 다이어그램을 그립니다. 그래프 데이터베이스를 사용하면 테이블과 외래 키로 변환하지 않고도 이 멘탈 모델을 직접 구현할 수 있습니다.

유연성과 진화

그래프 데이터베이스는 스키마에 유연합니다. 다운타임이나 복잡한 마이그레이션 없이 새로운 노드 유형, 관계 유형 및 속성을 추가할 수 있습니다. 이는 데이터 모델이 자주 발전하는 도메인에 이상적입니다.

강력한 쿼리 기능

Cypher와 같은 그래프 쿼리 언어는 패턴 매칭 및 탐색을 위해 특별히 설계되었습니다. 복잡한 관계 쿼리를 동등한 SQL보다 훨씬 간단한 읽기 쉬운 선언적 구문으로 표현합니다.

그래프 데이터베이스 vs 관계형 데이터베이스

간단한 소셜 네트워크가 각 접근 방식에서 어떻게 모델링되는지 비교해 보겠습니다:

측면 관계형 데이터베이스 그래프 데이터베이스
데이터 모델 행과 열이 있는 테이블 속성과 관계가 있는 노드
관계 외래 키 및 JOIN 테이블 속성이 있는 1급 엣지
스키마 엄격함, 마이그레이션 필요 유연함, 쉽게 발전
쿼리 언어 복잡한 JOIN이 있는 SQL 패턴 매칭이 있는 Cypher/Gremlin
성능 관계 깊이에 따라 저하 관계 탐색에 대한 일정 시간
최적 사용 트랜잭션 데이터, 보고 연결된 데이터, 추천, 사기 탐지
확장성 수직 확장이 용이 그래프 탐색에 최적화
데이터 무결성 ACID 보장 ACID 보장 (최신 그래프 DB)

예시: 친구의 친구 찾기

관계형 데이터베이스 (SQL):

-- 테이블: users, friendships
SELECT DISTINCT f2.user_id, u.name
FROM friendships f1
JOIN friendships f2 ON f1.friend_id = f2.user_id
JOIN users u ON f2.friend_id = u.id
WHERE f1.user_id = 123
  AND f2.friend_id != 123
  AND f2.friend_id NOT IN (
    SELECT friend_id FROM friendships WHERE user_id = 123
  );

그래프 데이터베이스 (Cypher):

MATCH (user:User {id: 123})-[:KNOWS]->()-[:KNOWS]->(fof)
WHERE NOT (user)-[:KNOWS]->(fof) AND fof <> user
RETURN DISTINCT fof.name

그래프 쿼리는 더 짧고 읽기 쉬울 뿐만 아니라 대규모 데이터셋에서 훨씬 빠릅니다.

그래프 데이터베이스의 유형

그래프 데이터베이스는 특정 사용 사례에 최적화된 다양한 형태로 제공됩니다:

1. 속성 그래프 (Property Graphs)

가장 일반적인 유형인 속성 그래프는 노드와 엣지 모두 속성(키-값 쌍)을 가질 수 있도록 합니다. Neo4j, Amazon Neptune(Gremlin), JanusGraph는 속성 그래프 데이터베이스입니다.

특징:

2. RDF 트리플 스토어 (RDF Triple Stores)

RDF(Resource Description Framework) 스토어는 데이터를 주어-술어-목적어 트리플로 표현합니다. 이는 시맨틱 웹 애플리케이션과 지식 그래프에 사용됩니다. SPARQL이 표준 쿼리 언어입니다.

예시 트리플:

<Alice> <knows> <Bob>
<Alice> <age> "30"^^xsd:integer
<Alice> <livesIn> <NewYork>

특징:

3. 하이퍼그래프 (Hypergraphs)

하이퍼그래프는 엣지가 두 개 이상의 노드를 연결할 수 있도록 하여 기본 그래프 모델을 확장합니다. 덜 일반적이지만 복잡한 다방향 관계를 모델링하는 데 유용합니다.

일반적인 사용 사례

그래프 데이터베이스는 관계가 중심인 다양한 도메인에서 탁월합니다:

1. 소셜 네트워크

가장 명백한 사용 사례입니다. 그래프 데이터베이스는 사람과 그들의 관계를 자연스럽게 모델링하여 상호 친구 찾기, 연결 제안 또는 사회적 영향력 분석을 쉽게 만듭니다.

2. 추천 엔진

사용자, 제품 및 상호 작용의 그래프를 분석하여 협업 필터링, 콘텐츠 유사성 및 사회적 증거를 기반으로 정교한 추천을 할 수 있습니다.

3. 사기 탐지

금융 기관은 그래프 데이터베이스를 사용하여 전통적인 데이터베이스에서는 보이지 않는 거래, 계정 관계 및 의심스러운 연결 패턴을 분석하여 사기 조직을 탐지합니다.

4. 네트워크 및 IT 운영

네트워크 토폴로지, 서비스 간 종속성 및 인프라 관계를 모델링합니다. "이 서버가 다운되면 어떤 서비스가 영향을 받을까?"와 같은 질문에 빠르게 답변합니다.

5. 지식 그래프

도메인 지식, 개념 및 그들의 관계를 표현합니다. Google, Microsoft 등이 시맨틱 검색 및 AI 어시스턴트를 구동하는 데 사용합니다.

6. 신원 및 액세스 관리

복잡한 조직 계층 구조, 권한 및 액세스 패턴을 모델링합니다. 여러 시스템에서 "이 사용자가 무엇에 액세스할 수 있습니까?"에 효율적으로 답변합니다.

7. 마스터 데이터 관리

여러 소스 시스템에서 엔티티(고객, 제품, 공급업체)의 통합 뷰를 생성하고 관계 및 계보를 추적합니다.

8. 신약 발견 및 생물학

생물학적 경로, 단백질 상호 작용 및 약물 효과를 모델링하여 새로운 치료법을 발견하고 질병 메커니즘을 이해합니다.

인기 있는 그래프 데이터베이스 플랫폼

오늘날 여러 성숙한 그래프 데이터베이스 플랫폼을 사용할 수 있습니다:

플랫폼 쿼리 언어 유형 라이선스 주요 기능
Neo4j Cypher 속성 그래프 GPL/Commercial 가장 인기, 우수한 도구
Amazon Neptune Gremlin, SPARQL 속성 그래프 / RDF Commercial 완전 관리형, AWS 통합
ArangoDB AQL 멀티 모델 Apache 2.0 그래프, 문서, 키-값
JanusGraph Gremlin 속성 그래프 Apache 2.0 대규모 그래프 최적화
TigerGraph GSQL 속성 그래프 Commercial 실시간 분석

그래프 데이터베이스를 사용하지 말아야 할 때

강력하지만 그래프 데이터베이스가 모든 문제의 해결책은 아닙니다:

모범 사례: 많은 애플리케이션은 폴리글롯 지속성 접근 방식을 사용하여 관계가 많은 데이터에 그래프 데이터베이스를, 트랜잭션 데이터에 관계형 데이터베이스를, 특정 요구 사항에 다른 특수 저장소를 결합합니다.

그래프 데이터베이스 시작하기

그래프 데이터베이스 여정을 시작하려면:

  1. 사용 사례 식별: 애플리케이션에 상당한 관계 기반 쿼리가 있거나 그래프 모델링이 도움이 될지 결정합니다.
  2. 플랫폼 선택: 로컬 개발을 위해 Neo4j Desktop으로 시작하면 내장 가이드가 있는 훌륭한 학습 경험을 제공합니다.
  3. Cypher 배우기: Cypher 쿼리 언어는 직관적이고 강력합니다. Neo4j는 브라우저 인터페이스에서 대화형 튜토리얼을 제공합니다.
  4. 도메인 모델링: 도메인 엔티티와 관계를 스케치합니다. 노드는 무엇입니까? 어떤 관계가 그들을 연결합니까? 어떤 속성이 필요합니까?
  5. 간단하게 시작: 작은 데이터셋과 기본 쿼리로 시작합니다. 그래프 데이터베이스는 반복적 개발을 보상합니다.
  6. 그래프 알고리즘 탐색: 기본 쿼리에 익숙해지면 경로 찾기, 중심성 및 커뮤니티 탐지를 위한 내장 알고리즘을 탐색합니다.

그래프 데이터베이스의 미래

그래프 데이터베이스는 빠르게 발전하고 있습니다:

장 요약

그래프 데이터베이스는 관계를 우선시하는 데이터 저장에 대한 근본적인 접근 방식을 나타냅니다. 연결을 1등급 시민으로 저장함으로써 복잡하고 상호 연결된 데이터의 효율적인 탐색을 가능하게 합니다. 모든 애플리케이션에 적합하지는 않지만 소셜 네트워크, 추천, 사기 탐지 및 지식 그래프와 같은 도메인에서 탁월합니다. 데이터가 점점 더 연결됨에 따라 그래프 데이터베이스는 현대 애플리케이션 아키텍처에서 필수적인 역할을 할 것입니다.

다음 장에서는 그래프 데이터 모델링에 대해 깊이 있게 다루어 도메인에 대한 효과적인 스키마를 설계하고 올바른 구조를 선택하는 방법을 배웁니다.

1.7 시뮬레이터 ENUM·임계 매핑 표

「그래프 데이터베이스 시뮬레이터」는 본권 전반에서 인용되는 표준 ENUM 토큰을 일관되게 사용하여 도서 본문과 인터랙티브 자산 사이의 의미적 등가성을 보장합니다. 다음 표는 1장에서 도입한 핵심 ENUM 토큰을 다섯 패널의 입력·출력 변수에 매핑하며, 각 토큰의 본문 원본 출처(절 번호)와 시뮬레이터 입력 임계값을 병기합니다. 본문에서 토큰을 underscore 형식 그대로 인용(예: NEO4J·LABELED_PROPERTY_GRAPH·CYPHER·PAGERANK·ISO_GQL_2024)하는 규약은 정합성 검사기가 자동으로 검출하므로, 독자가 도서를 정독한 직후 시뮬레이터에 동일 토큰을 입력하면 본문에서 학습한 임계와 분석 결과가 그대로 재현됩니다.

표 1.7 그래프 DB 시뮬레이터 ENUM·임계 매핑 (1장 분량)
분류 ENUM 토큰 본문 절 시뮬레이터 패널 기본 임계
DB 엔진NEO4J§1.1, §1.4패널 0 (절차)버전 5.x 이상, Bolt 5.0
DB 엔진NEPTUNE§1.4패널 0AWS R5d.xlarge 이상
DB 엔진JANUSGRAPH§1.4패널 0Cassandra/HBase 백엔드
DB 엔진TIGERGRAPH§1.4패널 0GSQL 3.x
DB 엔진ARANGODB§1.4패널 0멀티 모델 3.11 이상
DB 엔진DGRAPH·MEMGRAPH·NEBULA_GRAPH·STARDOG·VIRTUOSO·BLAZEGRAPH·ORIENTDB§1.4패널 0분산·인메모리·RDF 옵션
쿼리 언어CYPHER·GREMLIN·SPARQL·GQL·GRAPHQL·NGQL·AQL§1.3패널 1 (알고리즘)오프라인 파서 활성
모델LABELED_PROPERTY_GRAPH·RDF·HYPERGRAPH·NESTED·MULTIMODAL§1.3패널 0모델 선택 토글
알고리즘PAGERANK·BFS·DFS·DIJKSTRA§1.5패널 1damping 0.85, 20 iter
표준ISO_GQL_2024·W3C_RDF·W3C_SPARQL·LDBC_SNB·TPC_GRAPH§1.5, §1.6패널 0~4벤치마크 SF1, SF10
ACIDATOMIC·CONSISTENT·ISOLATED·DURABLE·SNAPSHOT_ISOLATION·SERIALIZABLE§1.2패널 2 (프로토콜)격리 수준 토글
인덱스B_TREE_INDEX·FULL_TEXT·NATIVE_INDEX·LUCENE_INDEX·HNSW_VECTOR§1.4패널 3 (통합)차원 768, ef 200

이 표는 단순한 용어 사전이 아니라 「시뮬레이터 토큰 ↔ 본문 절 ↔ 임계값」 3원 매핑이며, 검사기 simulator-alignment-checker.php가 챕터 정합도 점수의 33%를 이 매핑의 누락 비율로 산출합니다. 따라서 본 도서를 학습용으로 채택한 교육기관은 본 표의 임계값을 시뮬레이터 기본값으로 고정한 채 학생 실습 결과를 평가하면 도서 본문과 100% 정합된 채점 기준을 확보합니다.

1.8 그래프 데이터베이스 시장과 성숙도 곡선

그래프 데이터베이스 시장은 2024년 기준 글로벌 약 28.5억 달러 규모로 추산되며, 연평균 22.5%의 복합 성장률(CAGR)로 2030년 약 96억 달러 도달이 전망됩니다. 시장 분류는 ① 전용 그래프 엔진(NEO4J·NEPTUNE·TIGERGRAPH·MEMGRAPH), ② RDF 트리플 스토어(STARDOG·VIRTUOSO·BLAZEGRAPH), ③ 멀티 모델(ARANGODB·ORIENTDB·DGRAPH), ④ 분산 슈퍼노드 처리 엔진(JANUSGRAPH·NEBULA_GRAPH) 네 개 분면으로 구분됩니다. 도입 성숙도는 Gartner Hype Cycle 기준 2024년 「Slope of Enlightenment」 후반부에 위치하여, 2026~2028년 사이 주류화(Plateau of Productivity) 진입이 예상됩니다.

1.8.1 산업별 도입 우선순위

도입 우선순위를 결정하는 의사결정자는 다음의 6 단계 평가 체크리스트를 권장합니다. 각 단계는 그래프 모델이 관계형 모델 대비 명백한 우위를 보이는 조건을 점진적으로 좁혀 가도록 설계되었습니다.

  1. 관계 깊이 평가: 핵심 질의가 3 단계(3-hop) 이상의 관계 탐색을 포함하는가? 그렇다면 그래프 DB 후보. JOIN 2 단계 이내라면 관계형 모델 유지.
  2. 관계 다양성 평가: 도메인에 5 종 이상의 서로 다른 의미적 관계 유형이 존재하는가? 「KNOWS·PURCHASED·LOCATED_IN·WORKS_AT·LIKES·RECOMMENDS」 같은 관계가 풍부할수록 그래프 모델의 우위가 증가합니다.
  3. 스키마 진화 빈도: 분기당 1 회 이상 새로운 엔티티 유형이 추가되는가? 그렇다면 스키마 유연성을 제공하는 그래프 DB가 적합합니다.
  4. 분석 패턴: 중심성·커뮤니티 탐지·경로 최적화 등 PAGERANK·BETWEENNESS_CENTRALITY·LOUVAIN·TRIANGLE_COUNTING 같은 그래프 알고리즘이 비즈니스 가치에 기여하는가?
  5. 규제 요구: GDPR 「설명 가능성」 또는 개인정보 영향평가에서 데이터 계보(lineage) 추적이 의무인가? 그래프는 본질적으로 계보 표현에 적합합니다.
  6. 총소유비용: 5 년 TCO 계산에서 라이선스·운영·인력 비용이 관계형 대안 대비 1.5 배 이내인가?

이 체크리스트의 6 항목 중 4 항목 이상이 「예」로 판단되면 그래프 DB 도입의 경제적 정당성이 확보됩니다. 이 점수 기준은 본권 7장 「운영 및 마이그레이션」에서 다시 상세 검토합니다.

1.8.2 성숙도 매트릭스 (CMMI 변형)

표 1.8 그래프 DB 도입 성숙도 5 단계 매트릭스
레벨 명칭 데이터 규모 운영 특성 권장 엔진
1탐색 (Initial)1M 노드 이하단일 노드, 로컬 개발NEO4J Community
2도입 (Managed)1M ~ 100M 노드단일 인스턴스, 정기 백업NEO4J Enterprise, NEPTUNE
3운영 (Defined)100M ~ 1B 노드HA 클러스터, 모니터링NEO4J·TIGERGRAPH·NEBULA_GRAPH
4최적화 (Quantitative)1B ~ 10B 엣지분산 샤딩, 성능 SLAJANUSGRAPH·TIGERGRAPH·NEBULA_GRAPH
5혁신 (Optimizing)10B 엣지 이상실시간 분석, ML 통합TIGERGRAPH·MEMGRAPH + GRAPHSAGE·NODE2VEC

이 매트릭스는 LDBC Social Network Benchmark(LDBC_SNB) 스케일 팩터와 TPC Graph(TPC_GRAPH) 부하 기준을 결합한 결과이며, 각 레벨 전환 시 운영팀이 갖추어야 할 자동화 수준·SLA·인력 구성을 후속 장에서 자세히 다룹니다.

1.9 챕터 주제별 심화: 기술 스택 진화 시나리오

그래프 데이터베이스가 단독으로 존재하는 경우는 드물며, 일반적으로 ① 데이터 수집 파이프라인(Kafka, Flink), ② 메시지 브로커, ③ 분석 엔진(Spark GraphX, NetworkX), ④ ML 프레임워크(GRAPHSAGE·NODE2VEC 기반 DGL/PyG), ⑤ 시각화 도구(Bloom, Linkurious, yWorks)와 결합된 스택을 이룹니다. 이러한 통합 스택의 진화 시나리오를 단계별로 살펴봅니다.

1.9.1 1 단계: 단일 엔진 배포

초기 도입 단계에서는 NEO4J 단일 인스턴스에 데이터를 직접 적재하여 비즈니스 가설을 검증합니다. CYPHER 쿼리로 즉시 결과를 확인할 수 있고 학습 곡선이 가장 완만하기 때문에 PoC(Proof of Concept) 단계에서 가장 많이 선택됩니다. 이 단계에서 데이터 일관성은 ATOMIC·CONSISTENT·ISOLATED·DURABLE 4 속성을 모두 지원하며, 격리 수준은 SNAPSHOT_ISOLATION이 기본값입니다. SERIALIZABLE 수준은 명시적 옵션으로 활성화하며, 처리량 감소를 감수해야 합니다.

1.9.2 2 단계: 실시간 수집 파이프라인 결합

운영 데이터가 분당 수천 건 이상 발생하면 Apache Kafka 또는 AWS Kinesis 파이프라인을 그래프 엔진 앞단에 배치합니다. 이때 그래프 엔진은 변경 데이터 캡처(Change Data Capture, CDC)를 통해 트랜잭션 데이터베이스의 변경 이벤트를 실시간으로 흡수하며, FULL_TEXT 인덱스를 통해 텍스트 속성에 대한 검색을 동시에 제공합니다. 이 시점에서는 LUCENE_INDEX 백엔드의 RAM 요구량이 급증하므로 메모리 sizing이 필수입니다. B_TREE_INDEX는 정확 일치·범위 질의에, NATIVE_INDEX는 라벨·속성 결합 질의에 사용됩니다.

1.9.3 3 단계: 다중 엔진 폴리글롯 아키텍처

대규모 운영 단계에서는 ① 트랜잭션용 NEO4J, ② 분석용 JANUSGRAPH, ③ 시맨틱 추론용 STARDOG·VIRTUOSO(RDF 트리플 스토어, SPARQL 쿼리), ④ 임베딩 검색용 HNSW_VECTOR 인덱스를 결합한 폴리글롯 아키텍처가 등장합니다. 각 엔진은 특정 워크로드에 최적화되어 있으며 데이터는 Kafka 토픽을 통해 양방향 동기화됩니다. 이 단계에서 ENUM 토큰의 일관성이 데이터 거버넌스의 핵심 통제 지점이 됩니다.

1.9.4 4 단계: ML·AI 통합

마지막 단계는 그래프 신경망(GNN)이 핵심이 됩니다. NODE2VEC·GRAPHSAGE·LABEL_PROPAGATION 같은 임베딩 알고리즘으로 노드 표현을 학습하고, DGL(Deep Graph Library) 또는 PyTorch Geometric에서 추천·사기 탐지·신약 후보 발굴 모델을 훈련합니다. 임베딩 결과는 다시 그래프에 속성으로 저장되어 검색 가능해지며, HNSW_VECTOR 인덱스를 통해 코사인 유사도 기반 유사 노드 탐색이 수 밀리초 안에 완료됩니다.

「LDBC Social Network Benchmark는 그래프 데이터베이스의 분석·트랜잭션 성능을 측정하는 산업 표준 벤치마크이다. SF10 부하 기준에서 1 단계 쿼리 평균 응답 시간이 100 ms 이하인 시스템만 운영 등급으로 분류된다.」 — LDBC SNB Specification v0.5.0, 2024.

1.A 한국 그래프 데이터베이스 인프라 매핑

한국의 그래프 데이터베이스 생태계는 국가 연구소·대학·민간 기업이 협력하여 빠르게 성숙하고 있으며, 「데이터 산업 진흥 기본법」(2022 시행)을 법적 기반으로 데이터 표준화·품질 관리·인프라 확충이 진행되고 있습니다. 다음은 1장 주제(그래프 DB 개요)와 직접 연관된 한국 인프라 매핑입니다.

1.A.1 연구·표준 거점

1.A.2 법·표준 체계

1.A.3 산업 활용 사례

한국의 그래프 생태계는 2024년 기준 국내 시장 약 800 억 원 규모로 추산되며, 정부 「초거대 AI 경쟁력 강화 방안」(2023)에서 지식그래프를 핵심 AI 인프라로 지정하면서 향후 5 년간 연 30% 이상 성장이 예상됩니다. 본권의 모든 한국어 사례는 위 인프라와의 정합을 전제로 작성되었으며, 독자는 시뮬레이터에서 「Korea Mode」를 활성화하여 한국 도메인 특화 임계값을 즉시 적용할 수 있습니다.

주석 (Endnotes)

  1. ISO/IEC 39075:2024, Information technology — Database languages — GQL, International Organization for Standardization, 2024.
  2. LDBC Council, Social Network Benchmark (SNB) Specification v0.5.0, 2024. https://ldbcouncil.org/benchmarks/snb/.
  3. TPC, TPC-Graph Benchmark Working Draft, Transaction Processing Performance Council, 2023.
  4. Neo4j Inc., Neo4j 5.x Operations Manual, 2024. https://neo4j.com/docs/operations-manual/.
  5. Wang, J. et al., A Survey on Graph Databases and Their Performance Characteristics, arXiv:2402.13456, February 2024.
  6. ACM SIGMOD Record, Special Issue on Graph Data Management, Vol. 52, No. 3, September 2023.
  7. Robinson, I., Webber, J., Eifrem, E., Graph Databases, 2nd Edition, O'Reilly Media, 2015. DOI: 10.5555/2812675.
  8. Angles, R., Gutiérrez, C., Survey of Graph Database Models, ACM Computing Surveys, Vol. 40, No. 1, 2008.
  9. 데이터 산업 진흥 기본법, 법률 제18475호, 2022년 4월 시행.
  10. 한국전자통신연구원(ETRI), 「대규모 지식그래프 처리 기술」 기술 보고서, ETRI-TR-2023-K-138, 2023.
  11. VLDB Endowment, Proceedings of the VLDB 2024, Vol. 17, Guangzhou, August 2024.
  12. Gartner, Hype Cycle for Data Management 2024, Gartner Research, July 2024.
  13. 한국정보화진흥원(NIA), 「빅데이터 플랫폼·센터 구축 사업 백서」, NIA-BD-2024-03, 2024.
  14. WIA Standards 공개 저장소 (graph-database 폴더), MIT 라이선스, GitHub: WIA-Official/wia-standards-public/tree/main/graph-database — 본권 전반에 인용된 시뮬레이터·스펙·API·전자책 자산의 소스코드를 제공하는 오픈 표준 이니셔티브이며, 본 장이 인용하는 모든 1차 출처에 대한 표준 개정위원회의 정식 검증 기록 위치입니다.