멀티모달Multimodal
한마디로
텍스트뿐 아니라 이미지, 음성, 영상 등 여러 형태(modality)를 함께 이해하고 다루는 모델이에요
멀티모달은 '여러 감각을 동시에 쓰는' 모델이에요. 사진을 보여주며 '이거 뭐야?'라고 묻거나, 영상과 음성을 입력으로 받는 게 가능하죠. 원리는 텍스트, 이미지, 소리를 같은 의미 공간의 숫자(임베딩)로 바꿔 한 모델이 함께 다루게 하는 것입니다. 그래서 그림 속 글자를 읽고 도표의 추세를 말로 설명하는 일이 됩니다.
마케팅에선 이미지 광고 분석, 제품 사진 기반 카피 생성, 음성 고객응대 등에 직결돼요. 텍스트만 다루던 시절보다 활용 폭이 훨씬 넓어졌습니다. 요즘 주요 모델은 대부분 멀티모달이라 별도 기능이라기보다 기본 사양에 가까워졌어요.
주의할 점은 비용과 환각이에요. 이미지 입력은 텍스트보다 토큰을 많이 써서 비용이 빠르게 늘고, 사진 속 수치나 표를 읽을 때 그럴듯하게 틀리는 일이 여전히 있으니 숫자가 걸린 작업이라면 결과를 원본과 대조하는 절차를 붙여야 합니다.
헷갈리는 용어 구분
태그
관련 용어
- 거대 언어 모델대규모 텍스트로 학습해 사람처럼 글을 이해하고 생성하는 언어 모델이에요. GPT, Claude, Gemini가 여기에 해당해요
- 파운데이션 모델광범위한 데이터로 사전학습해 다양한 작업에 범용으로 갖다 쓰는 기반 모델이에요. LLM은 그중 언어에 특화된 버전이에요
- AI 이미지 생성글로 원하는 장면이나 스타일을 설명하면 AI가 그 내용을 분석해 그에 어울리는 새로운 이미지를 만들어내는 기술이에요.
- 임베딩텍스트를 의미를 담은 숫자 벡터로 변환한 것이에요. 의미가 비슷한 글은 벡터도 가까워서, 유사도 계산의 기반이 돼요
- 실시간 음성 AI사람이 말하면 끊김이나 어색한 침묵 없이 곧바로 알아듣고 자연스러운 목소리로 답하는 음성 기반 AI 시스템이에요.
공유