The Brief FactStack이 되었습니다

FactStack

Databricks OpenSharing이란, Qumulo NeuralSearch 연동으로 분산 데이터 통합 거버넌스 구현하는 법

데이터 인프라

한마디로

여러 곳에 흩어진 데이터를 옮기지 않고도 한 곳에서 찾고 분석할 수 있게 해주는 연동이에요

한눈에

Databricks OpenSharing은 에이전트 스킬, AI 모델, 비정형 데이터까지 아우르는 오픈 프로토콜입니다. 이번에 스토리지 업체 Qumulo의 NeuralSearch와 연동되면서, 온프레미스와 클라우드, 엣지에 흩어진 데이터를 복제하지 않고도 SQL, 자연어, 의미론적 검색으로 찾고 쿼리할 수 있게 됐어요. Unity Catalog로 거버넌스를 한곳에 모을 수 있다는 점이 데이터팀 실무에 바로 영향을 줍니다.

AS-IS: 분산 데이터는 왜 복제부터 했나

대규모 조직은 보통 데이터센터, 엣지 로케이션, 여러 클라우드에 데이터가 흩어져 있고, AI나 분석 작업을 하려면 이 데이터를 한곳으로 복제해오는 과정이 필요했어요. Qumulo SVP Brandon Whitelaw는 "조직들이 AI와 분석을 지원하려고 대규모 데이터셋을 환경마다 복사하는 비용과 복잡성, 지연을 더 이상 감당할 수 없다"고 밝혔습니다. 이 복제 과정 자체가 거버넌스를 흩어놓고 시간을 잡아먹는 병목이었습니다.

이번 내용: NeuralSearch와 OpenSharing 통합

Qumulo NeuralSearch는 크롤러나 별도 인덱싱 없이 SQL, 자연어, 의미론적 검색으로 비정형 데이터를 검색 가능한 형태로 바꿔주는 Qumulo의 스토리지 내장 플랫폼입니다. 이게 Databricks OpenSharing과 결합하면서, 고객은 코어, 클라우드, 엣지 환경 전반의 정형 데이터를 데이터 복제나 운영 복잡성 추가 없이 찾고 쿼리하고 협업할 수 있게 됐어요. 결과적으로 Unity Catalog를 통해 위치, 리전, 클라우드 공급자를 아우르는 단일한 지리 분산 데이터 뷰가 만들어집니다. Qumulo는 Apache Iceberg와 Delta Lake 같은 오픈 테이블 포맷, 그리고 Parquet 같은 하위 파일 포맷을 동시에 지원하는 통합 파일/오브젝트 플랫폼으로, 멀티 리전과 멀티 클라우드 환경에 데이터를 투영하는 방식을 처음 구현했다고 설명합니다.

실무 적용 포인트

CDO나 데이터 분석 VP 입장에서는 대규모 비정형 데이터를 거버넌스하면서 AI 가치 실현 속도를 높이는 게 과제였는데요. 이번 연동으로 생성형 AI, RAG 애플리케이션, 고급 분석 워크로드에 직접 데이터를 공급할 수 있게 됩니다. Databricks 컴퓨트를 Qumulo의 엣지투코어 스토리지 프레임워크에 안전하게 직결하면서, 지리 분산 워크로드에 따르던 지연시간을 줄이고 지속적인 데이터 복제 부담 없이 인사이트 도출 속도를 높일 수 있어요. 실무 체크포인트로는 다음을 확인해볼 만합니다.

  • 현재 온프레미스, 엣지, 클라우드에 흩어진 데이터가 Unity Catalog로 통합 거버넌스될 대상인지
  • RAG나 에이전트 AI 워크로드에서 데이터 복제 비용이 실제로 병목이었는지
  • 금융, 바이오, 제조 등 규제가 많은 업종이라면 벤더 락인 없는 오픈 아키텍처가 조달 조건에 맞는지

Databricks SVP Stephen Orban은 "고객들이 독점적 아키텍처에 얽매이지 않고 폭넓은 생태계에서 기업 데이터를 자유롭게 활용하고 싶어한다"며, 이번 파트너십이 비독점적인 단일 진실 공급원(single source of truth)을 가능하게 한다고 설명했습니다.

자주 묻는 질문

bigquery 란 무엇이고 Databricks와 어떻게 다른가요

BigQuery는 Google Cloud의 서버리스 데이터 웨어하우스이고, Databricks는 데이터 레이크하우스 기반의 Data + AI 플랫폼이에요. 이번 원문에서는 BigQuery 관련 내용은 다루지 않고, Databricks가 Qumulo와 연동해 분산 스토리지 데이터를 Unity Catalog로 거버넌스하는 사례를 다룹니다.

cdp란 무엇이고 이번 연동과 관련 있나요

CDP(Customer Data Platform)는 고객 데이터를 통합 관리하는 플랫폼을 뜻하는데요. 이번 원문은 CDP가 아니라 Qumulo의 비정형 스토리지 데이터와 Databricks OpenSharing 연동을 다룬 내용이라, CDP 사례로 직접 연결되는 정보는 없습니다.

마테크 뜻이 궁금한데 이 연동이 마테크와 관련 있나요

마테크(MarTech)는 마케팅 기술을 통칭하는 말이에요. 이번 Qumulo-Databricks 연동은 마케팅 전용 도구는 아니고, 금융, 바이오, 제조 같은 업종의 분산 데이터 거버넌스와 AI 워크로드를 위한 데이터 인프라 통합 사례입니다.

마케팅 데이터 분석 툴로 Databricks를 쓸 수 있나요

원문에서는 마케팅 분석 사례가 아니라 RAG와 에이전트 AI, 고급 분석 워크로드를 위한 데이터 통합 사례를 다뤘습니다. 데이터팀이 분산된 원천 데이터를 복제 없이 쿼리하고 거버넌스하는 인프라로 활용할 수 있다는 점에서 분석 워크로드 전반에 적용 가능합니다.

에디터 노트

데이터 복제 없는 통합 거버넌스는 데이터팀 예산과 AI 프로젝트 속도에 직접 영향을 주는 실질적 변화입니다. 다만 이번 발표는 Qumulo와 Databricks 양사의 파트너십 보도자료 성격이 강해서, 실제 도입 사례나 성능 수치는 아직 공개되지 않은 점을 감안해야 해요.

참고 출처 | 원문 보기

태그

용어 풀이
Databricks
데이터브릭스
Unity Catalog
유니티 카탈로그
OpenSharing
오픈셰어링
Qumulo
쿠물로

이 노트는 자동 검증을 거쳐 발행되었습니다. 오류 제보는 편집팀이 즉시 확인합니다.

공유

관련 마테크