비정형 데이터Unstructured Data
한마디로
이미지, 영상, 음성, 텍스트 문서처럼 표나 정해진 항목으로 미리 정리되어 있지 않은 형태의 데이터를 말해요.
비정형 데이터는 엑셀 표나 데이터베이스처럼 행과 열이 명확히 정해진 형태가 아니라, 사진이나 동영상, 녹음 파일, 이메일 본문, 상담 채팅 기록처럼 자유로운 형식으로 존재하는 데이터를 가리켜요. 반대로 회원 이름, 나이, 구매 금액처럼 항목별로 값이 딱딱 정해져 있는 데이터는 정형 데이터라고 부르는데, 실제로 기업이 다루는 데이터의 상당 부분은 이런 정형 데이터보다 비정형 데이터의 비중이 훨씬 크다고 알려져 있어요. 문제는 이 데이터가 형식이 제각각이다 보니 기존의 표 기반 분석 도구로는 곧바로 집계하거나 검색하기가 어렵다는 점이에요.
이 개념이 실무에서 중요해진 이유는 최근 인공지능 기술이 발전하면서 비정형 데이터를 사람이 읽는 것과 비슷한 수준으로 이해하고 분류할 수 있게 되었기 때문이에요. 예전에는 고객이 남긴 상담 내용이나 리뷰 텍스트, 상품 이미지를 사람이 하나하나 읽거나 눈으로 확인해야 했지만, 이제는 이런 데이터를 자동으로 읽어서 감정이 긍정적인지 부정적인지 분류하거나, 이미지 속에 어떤 물체가 있는지 인식하는 작업이 가능해졌어요. 그 결과 그동안 활용되지 못하고 쌓여만 있던 비정형 데이터가 새로운 인사이트를 뽑아낼 수 있는 자산으로 재평가받고 있어요.
마케팅이나 서비스 운영 실무에서는 고객센터 통화 녹음, SNS에 올라온 게시글, 리뷰 사진 등이 대표적인 비정형 데이터에 해당해요. 이런 데이터를 분석에 활용하려면 우선 텍스트나 이미지를 컴퓨터가 계산할 수 있는 형태로 바꿔주는 전처리 과정이 필요하고, 개인정보가 포함된 경우가 많아서 수집과 저장 단계부터 보안과 프라이버시 관리에 신경 써야 해요. 데이터 양이 방대하고 형식이 다양한 만큼 저장 공간과 처리 비용도 정형 데이터보다 많이 들기 때문에, 어떤 비정형 데이터를 우선적으로 분석할지 목적을 명확히 정하고 접근하는 것이 실무에서는 효율적이에요.
이 항목은 자동 검증을 거쳐 발행되었습니다. 오류 제보는 편집팀이 즉시 확인합니다.
이 글이 도움이 됐다면
로그인 없이 누를 수 있어요 · 다시 누르면 취소