The Brief FactStack이 되었습니다

FactStack

Snowflake Observe on Apache Iceberg란, 관찰성 데이터를 자체 S3에 여는 방법

데이터 인프라

한마디로

관찰성 데이터를 Apache Iceberg 형식으로 자기 S3에 저장해서 Spark, DuckDB, Trino 등 어떤 엔진으로도 바로 쿼리할 수 있게 만드는 기능이에요

한눈에

Snowflake의 Observe가 Apache Iceberg 지원을 사설 미리보기로 공개했어요. 로그, 메트릭, 추적 같은 관찰성 데이터를 OpenTelemetry로 수집해 자신의 AWS S3 버킷에 Iceberg 테이블 형식으로 저장하고, Observe 밖에서도 Spark, DuckDB, Trino, PyIceberg 같은 Iceberg 호환 엔진이 그 데이터를 직접 읽을 수 있게 됩니다. 관찰성 데이터가 벤더 전용 포맷 안에 갇혀 있던 구조에서 벗어나, 팀 전체가 같은 데이터 저장소를 공유하는 방향으로 바뀌는 변화예요.

AS-IS: 관찰성 데이터는 왜 갇혀 있었나

전통적인 관찰성 플랫폼은 단일 벤더의 인터페이스만 쓰도록 설계돼서, 데이터가 다른 곳에서도 쓰일 거라는 전제가 없었어요. 엔지니어링 팀은 관찰성 도구에서 트러블슈팅을 하고 비즈니스, 데이터 팀은 다른 도구에서 작업하다 보니, 텔레메트리 신호와 비즈니스 데이터를 조인하려면 ETL이나 수동 export, 커스텀 파이프라인이 필요했습니다. 벤더 플랫폼의 한계를 넘어서려 하거나 텔레메트리 위에서 분석을 돌리고 싶을 때, 데이터를 꺼내는 일 자체가 어려웠던 게 실무의 오래된 문제였어요.

이번 내용: S3에 Iceberg 테이블로 직접 저장

Observe on Iceberg에서는 텔레메트리가 사용자의 AWS 계정 안 S3 버킷에 Iceberg 테이블로 바로 기록됩니다. Observe는 사용자가 만들고 통제하는 IAM 역할로 그 버킷에 접근하고, 역할을 회수하거나 데이터 레이크 설정을 제거하면 Observe는 접근 권한을 잃어요. 데이터는 v3 테이블 스펙을 쓰는 Snowflake 관리형 Iceberg 테이블로 구성되고, compaction과 파일 크기 조정, 스냅샷, 메타데이터 관리가 자동으로 이뤄지기 때문에 테이블을 직접 유지보수하지 않아도 고성능 쿼리가 가능하다고 해요. 여러 데이터 레이크를 구성할 수 있고 데이터셋은 서로 격리되도록 설계됐습니다. 사설 미리보기에서는 별도 export나 ETL 단계 없이 기존 Observe 파이프라인으로 데이터를 수집하고, 모니터링, 대시보드, OPAL 변환, AI SRE, correlation 같은 Observe 기능이 Iceberg 기반 데이터셋에서도 동일하게 동작하도록 설계됐다고 밝혔어요.

쿼리 개방과 비용 구조 변화

Observe는 Observe API 위에 읽기 전용 Iceberg REST Catalog를 노출해서, 어떤 Iceberg 호환 쿼리 엔진이든 테이블을 발견하고 직접 읽을 수 있게 했습니다. 이 상호운용성은 Snowflake Horizon Catalog가 뒷받침하고, 현재 Apache Spark, DuckDB, Trino, PyIceberg가 동작한다고 합니다. 외부 엔진은 S3 버킷에서 데이터 파일을 바로 읽고, 이 경로는 Observe를 거치지 않아요. 초기 고객 대화에서 나온 활용 사례로는 텔레메트리와 내부 비즈니스 데이터 조인, 과거 텔레메트리에 대한 주기적 배치 작업, 자체 자격증명으로 원시 텔레메트리를 직접 감사, ML 모델 학습용 데이터 준비 등이 있었어요. Iceberg는 스토리지와 컴퓨트를 분리하기 때문에 실행한 쿼리에 대해서만 비용을 지불하고, 데이터를 서로 다른 시스템으로 복제하는 비용도 없앨 수 있다고 설명합니다.

실무 적용 포인트

관찰성 데이터와 비즈니스 데이터를 한 소스에서 다루려는 데이터 팀이라면 사설 미리보기 신청과 Iceberg REST Catalog 연동 가능성부터 확인해볼 만해요. IAM 역할 통제권이 자신에게 있다는 점, 데이터 레이크를 여러 개로 나눠 격리할 수 있다는 점, 그리고 Observe 밖에서도 같은 데이터를 Spark나 DuckDB로 바로 쿼리할 수 있다는 점을 체크리스트로 삼아 도입 여부를 검토하면 됩니다.

자주 묻는 질문

CDP 뜻이 뭔가요

CDP는 Customer Data Platform의 줄임말로 고객 데이터를 한곳에 모아 통합 프로필을 만들고 마케팅이나 분석에 활용하는 플랫폼을 말해요. 이번 Observe on Iceberg 소식은 CDP 자체 기능은 아니지만, 관찰성 데이터를 개방형 포맷으로 열어 다른 데이터와 조인하기 쉽게 만든다는 점에서 데이터 통합이라는 목적은 비슷합니다.

Apache Iceberg란 무엇인가요

Apache Iceberg는 Parquet 같은 컬럼형 파일 위에 스키마 진화, 파티셔닝, 스냅샷, 카탈로그 기능을 더한 오픈 테이블 포맷이에요. 어떤 호환 엔진이든 커스텀 통합 없이 테이블을 발견하고 읽을 수 있게 해주는 게 핵심입니다.

마케팅 데이터 분석 툴로 Spark, DuckDB, Trino를 쓸 수 있나요

네, Observe on Iceberg 환경에서는 이 엔진들이 S3 버킷의 Iceberg 테이블을 Observe를 거치지 않고 직접 읽을 수 있다고 안내하고 있어요. 관찰성 데이터를 비즈니스, 마케팅 데이터와 함께 분석하려는 데이터 팀에게는 파이프라인을 새로 짜지 않고도 조인 분석을 할 수 있는 경로가 열리는 셈입니다.

기존 관찰성 도구 대비 비용 차이가 있나요

원문에서는 스토리지와 컴퓨트가 분리돼 실행한 쿼리에만 비용을 내는 구조이고, 데이터 복제 비용을 없앨 수 있다고 설명해요. 다만 실제 절감액은 데이터 볼륨, 클라우드 제공사, 리전, 기존 벤더 계약에 따라 달라질 수 있다고 단서를 달았습니다.

에디터 노트

벤더 종속 없이 관찰성 데이터를 열어둔다는 방향 자체는 데이터 팀 입장에서 반길 만한 변화예요. 다만 아직 사설 미리보기 단계라 성능이나 접근성이 실제 운영 환경에서 어떻게 검증될지는 더 지켜봐야 합니다. 비용 절감 폭도 원문이 스스로 밝혔듯 계약 조건과 데이터 볼륨에 따라 크게 달라질 수 있어요.

참고 출처 | 원문 보기

태그

용어 풀이
Snowflake
스노우플레이크
Apache Iceberg
아파치 아이스버그
observability
관찰성
데이터 레이크
데이터 레이크

이 노트는 자동 검증을 거쳐 발행되었습니다. 오류 제보는 편집팀이 즉시 확인합니다.

공유

관련 마테크