임베딩Embedding
한마디로
텍스트를 의미를 담은 숫자 벡터로 변환한 것이에요. 의미가 비슷한 글은 벡터도 가까워서, 유사도 계산의 기반이 돼요
임베딩은 '말을 좌표로 바꾸는' 기술이에요. '강아지'와 '반려견'은 글자는 다르지만 의미가 비슷하니, 임베딩하면 숫자 공간에서 가까이 위치해요.
이게 의미 기반 검색(시맨틱 검색)과 RAG의 토대예요. 키워드가 정확히 일치하지 않아도 '의미가 가까운' 문서를 찾을 수 있거든요. 마케팅에선 비슷한 고객 문의 묶기, 유사 콘텐츠 추천 등에 쓰여요.
텍스트 임베딩이 대표지만, 이미지·상품·고객 행동도 같은 방식으로 벡터화할 수 있어요. 그래서 활용 폭이 넓어요 — VoC(고객의 소리)를 임베딩해 비슷한 불만끼리 자동 군집화하거나, 상품 임베딩으로 '취향이 비슷한' 추천을 만들거나, 유사 오디언스를 찾는 식이죠. 추천 엔진·검색·세그먼테이션의 공통 기반 기술이라고 보면 돼요.
실무에서 알아둘 것 하나 — 임베딩은 모델마다 '좌표계'가 달라서, 서로 다른 모델로 만든 벡터끼리는 비교할 수 없어요. 임베딩 모델을 바꾸면 쌓아둔 벡터를 다시 만들어야 한다는 뜻이라, RAG·검색 시스템 설계 때 모델 교체 비용까지 계산에 넣는 게 좋아요.
헷갈리는 용어 구분
관련 용어
- 벡터 데이터베이스임베딩 벡터를 저장하고 빠르게 검색하는 DB예요. Pinecone, Supabase pgvector 등이 있고, RAG의 검색 엔진 역할을 해요
- 시맨틱 검색(의미 검색)키워드 일치가 아니라 '의미 유사도'로 찾는 검색이에요. 단어가 달라도 뜻이 가까우면 찾아줘요
- 검색 증강 생성외부 문서를 검색해 그 내용을 근거로 답변을 생성하는 방식이에요. 환각을 줄이고 최신·사내 정보를 답에 반영할 수 있어요
- 청킹(문서 분할)긴 문서를 검색 가능한 작은 조각으로 나누는 전처리예요. 조각 크기를 잘 잡아야 RAG 검색 품질이 좋아져요
- 콘텐츠 추천 엔진사용자의 행동·취향 데이터로 '다음에 볼만한' 콘텐츠를 자동으로 골라 보여주는 시스템이에요. 유튜브 추천 영상, 넷플릭스 추천작, 쇼핑몰의 '이 상품 어때요'가…
태그
공유
이 글이 도움이 됐다면
로그인 없이 누를 수 있어요 · 다시 누르면 취소