The Brief FactStack이 되었습니다

FactStack

멀티모달Multimodal

모델 기초

한마디로

텍스트뿐 아니라 이미지, 음성, 영상 등 여러 형태(modality)를 함께 이해하고 다루는 모델이에요

멀티모달은 '여러 감각을 동시에 쓰는' 모델이에요. 사진을 보여주며 '이거 뭐야?'라고 묻거나, 영상과 음성을 입력으로 받는 게 가능하죠. 원리는 텍스트, 이미지, 소리를 같은 의미 공간의 숫자(임베딩)로 바꿔 한 모델이 함께 다루게 하는 것입니다. 그래서 그림 속 글자를 읽고 도표의 추세를 말로 설명하는 일이 됩니다.

마케팅에선 이미지 광고 분석, 제품 사진 기반 카피 생성, 음성 고객응대 등에 직결돼요. 텍스트만 다루던 시절보다 활용 폭이 훨씬 넓어졌습니다. 요즘 주요 모델은 대부분 멀티모달이라 별도 기능이라기보다 기본 사양에 가까워졌어요.

주의할 점은 비용과 환각이에요. 이미지 입력은 텍스트보다 토큰을 많이 써서 비용이 빠르게 늘고, 사진 속 수치나 표를 읽을 때 그럴듯하게 틀리는 일이 여전히 있으니 숫자가 걸린 작업이라면 결과를 원본과 대조하는 절차를 붙여야 합니다.

헷갈리는 용어 구분

태그

관련 용어

공유