BigQuery identity columns란, 고유 ID 자동생성으로 파이프라인 단순화하는 법
한마디로
BigQuery가 테이블마다 겹치지 않는 번호를 자동으로 매겨주는 identity columns 기능을 내놨어요
한눈에
BigQuery identity columns는 테이블 컬럼에 64비트 정수 값을 순차적으로 자동 생성해주는 신규 기능입니다. 그동안 ETL 도구나 애플리케이션 코드에서 직접 계산하던 고유 키 생성 작업을 BigQuery가 대신 맡아주는 게 핵심이고요. CREATE TABLE 문에서 옵션 하나만 정의하면 INSERT, MERGE 같은 표준 DML과 자연스럽게 연동됩니다.
AS-IS: 서러게이트 키를 직접 관리하던 부담
데이터 엔지니어들은 데이터 적재를 매끄럽고 안정적으로 만들 방법을 늘 찾아왔어요. 지금까지는 테이블에 고유 식별자를 넣으려면 애플리케이션 로직이나 ETL 도구 단에서 미리 유니크 키 값을 계산해둬야 했습니다. 이 작업이 파이프라인 코드에 켜켜이 쌓이면서 유지보수 부담을 키우는 요인이 됐고요.
이번 발표: identity columns가 하는 일
Google Cloud는 이번에 BigQuery에 identity columns를 도입한다고 밝혔습니다. 컬럼을 정의하면 순차적인 64비트 정수 값을 자동으로 생성해서 테이블 내 고유 식별자를 관리하는 방식이에요. 설정 방법도 CREATE TABLE 문 안에서 GENERATED ALWAYS AS IDENTITY 또는 GENERATED BY DEFAULT AS IDENTITY 절을 쓰는 두 가지로 단순합니다. 새 행이 들어올 때마다 자동으로 고유 값이 부여되도록 표준 DML 작업과 통합돼 있고, INSERT든 MERGE든 기존 워크플로에 맞춰 유연하게 적용할 수 있다고 설명합니다.
실무 적용 포인트
ID 생성 책임을 BigQuery로 넘기면 데이터 파이프라인의 복잡도를 크게 줄이고 인사이트 도출 작업에 더 집중할 수 있어요. 마케팅 데이터를 직접 적재하고 관리하는 팀이라면 다음을 점검해보면 좋습니다.
- 현재 ETL 코드나 애플리케이션 로직에서 서러게이트 키를 미리 계산하는 부분이 있는지 확인하기
- 신규 테이블 설계 시 GENERATED ALWAYS AS IDENTITY와 GENERATED BY DEFAULT AS IDENTITY 중 어떤 방식이 적합한지 검토하기
- INSERT, MERGE 작업이 많은 파이프라인에서 보일러플레이트 코드를 걷어낼 여지가 있는지 살펴보기
자주 묻는 질문
bigquery 란 무엇인가요
BigQuery는 Google Cloud가 제공하는 데이터 분석 플랫폼입니다. 이번에 발표된 identity columns는 이 플랫폼에 새로 추가된 기능으로, 테이블 컬럼에 순차적인 고유 정수 값을 자동 생성해주는 역할을 합니다.
identity columns는 어떻게 설정하나요
CREATE TABLE 문 안에서 GENERATED ALWAYS AS IDENTITY 또는 GENERATED BY DEFAULT AS IDENTITY 절을 지정하면 됩니다. 설정 이후에는 INSERT나 MERGE 같은 표준 DML 작업에서 별도 처리 없이 고유 값이 자동으로 채워집니다.
기존 방식과 뭐가 다른가요
기존에는 ETL 도구나 애플리케이션 코드에서 고유 키를 미리 계산해서 넣어야 했습니다. identity columns를 쓰면 그 계산과 관리를 BigQuery가 네이티브로 처리해서 SQL 코드가 더 간결해집니다.
bigquery vs motherduck 비교는 어떤가요
원문에는 MotherDuck과의 직접 비교 내용이 없습니다. 이번 발표는 BigQuery 자체의 신규 기능인 identity columns 소개에 한정돼 있어요.
에디터 노트
서러게이트 키 생성 로직을 SQL 밖으로 빼낼 수 있다는 점에서 데이터 파이프라인을 직접 짜는 실무팀엔 코드 정리 효과가 분명합니다. 다만 원문에 성능 벤치마크나 비용 변화, 다른 웨어하우스와의 비교 데이터는 없어서 실제 운영 규모에서 체감 효과는 별도로 검증해봐야 합니다.
참고 출처 | 원문 보기
태그
- BigQuery
- 빅쿼리
- identity columns
- 아이덴티티 컬럼
- 데이터 파이프라인
- 데이터 파이프라인
이 노트는 자동 검증을 거쳐 발행되었습니다. 오류 제보는 편집팀이 즉시 확인합니다.
관련 마테크
- BigQuery TabFM이란, SQL 한 줄로 이탈, 사기 예측하는 방법BigQuery에 새로 붙은 TabFM으로 데이터 사이언티스트 없이도 SQL 한 줄로 이탈, 사기 예측을 돌릴 수 있어요
- dbt와 BigQuery Data Agent Kit로 데이터 파이프라인 몇 분 만에 만드는 법자연어 프롬프트 하나로 dbt 모델부터 파이프라인 배포, 장애진단까지 자동화하는 도구예요
- BigQuery와 Salesforce Data 360 연동법, Agentforce Coworker 실사용기까지 8월 정리BigQuery를 Data 360에 연결하는 방법과 Agentforce Coworker 실제 써본 후기를 모은 Salesforce 커뮤니티 8월 소식이에요
- BigQuery 연동 AI 에이전트 사례, Dataflow로 생성형 AI 비용 90%대 줄이는 방법경량 CPU 모델로 먼저 걸러내고 복잡한 5% 미만만 BigQuery 조회하는 AI 에이전트에 넘기는 하이브리드 파이프라인 설계예요