멀티모달
Multimodal
텍스트, 이미지, 오디오 등 여러 형태의 데이터를 처리하는 AI. GPT-4V, Gemini가 대표적.
Multimodal
텍스트, 이미지, 오디오 등 여러 형태의 데이터를 처리하는 AI. GPT-4V, Gemini가 대표적.
멀티모달(Multimodal) AI는 텍스트, 이미지, 오디오, 비디오 등 여러 형태의 데이터를 동시에 이해하고 처리할 수 있는 인공지능입니다. 단일 모달리티만 처리하는 기존 모델과 달리, 멀티모달 모델은 "이 이미지에서 무엇이 보이나요?"라는 질문에 이미지를 보고 텍스트로 답할 수 있습니다.
멀티모달 AI의 발전은 Transformer 아키텍처의 성공과 함께 가속화되었습니다. 2021년 CLIP(Contrastive Language-Image Pre-training)이 이미지와 텍스트를 같은 임베딩 공간에 매핑하는 방법을 제시했고, 2023년 GPT-4V, Gemini가 실시간 비전-언어 상호작용을 실현했습니다. 2024년에는 Gemini 1.5, Claude 3가 100만 토큰 이상의 긴 컨텍스트에서 멀티모달 추론을 수행합니다.
멀티모달 모델의 핵심 원리는 각 모달리티를 공통 표현 공간으로 변환하는 것입니다. 이미지는 Vision Transformer(ViT)로, 오디오는 Whisper 같은 인코더로 토큰화되어 언어 모델에 입력됩니다. Cross-modal attention이 서로 다른 모달리티 간의 관계를 학습하며, 이를 통해 "이미지의 이 부분을 설명해줘"같은 정밀한 참조가 가능해집니다.
2024-2025년 멀티모달 AI의 활용이 폭발적으로 늘고 있습니다. 의료 분야에서 X-ray와 환자 기록을 함께 분석하고, 자율주행에서 카메라와 LiDAR를 통합하며, 창작 분야에서 이미지와 프롬프트로 영상을 생성합니다. GPT-4o는 실시간 음성-비전-텍스트를 통합하여 진정한 멀티모달 대화를 실현했습니다.
| 모델 | 이미지 이해 | 문서 분석 | 비용 (이미지) | 컨텍스트 |
|---|---|---|---|---|
| GPT-4o | 최상급 | 최상급 | ~$0.01/이미지 | 128K |
| Claude 3.5 Sonnet | 최상급 | 최상급 | ~$0.008/이미지 | 200K |
| Gemini 1.5 Pro | 상급 | 상급 | ~$0.002/이미지 | 2M |
| LLaVA 1.6 | 중상급 | 중급 | 오픈소스 | 32K |
| Qwen2-VL 72B | 상급 | 상급 | 오픈소스 | 128K |
* 2025년 1월 기준, 이미지당 비용은 표준 해상도 기준
# 멀티모달 AI 활용 예제
import anthropic
import openai
import base64
# 이미지를 base64로 인코딩
def encode_image(image_path):
with open(image_path, "rb") as f:
return base64.standard_b64encode(f.read()).decode("utf-8")
# Claude Vision 예제
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-3-5-sonnet-20241022",
max_tokens=1024,
messages=[
{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/png",
"data": encode_image("chart.png")
}
},
{
"type": "text",
"text": "이 차트를 분석하고 주요 인사이트를 알려주세요."
}
]
}
]
)
print(response.content[0].text)
# OpenAI GPT-4o Vision 예제
client = openai.OpenAI()
response = client.chat.completions.create(
model="gpt-4o",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "이 이미지에서 텍스트를 추출해주세요."},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{encode_image('document.png')}",
"detail": "high" # 고해상도 분석
}
}
]
}
],
max_tokens=500
)
print(response.choices[0].message.content)
"문서 자동 분류 시스템에 멀티모달 도입하면 스캔 문서도 처리 가능합니다. Claude 3.5 Sonnet이 OCR 없이도 표, 도장, 손글씨를 인식하더라고요. 기존 OCR 파이프라인 제거하면 비용도 줄어요."
"멀티모달 모델은 Vision Encoder와 Language Model을 연결하는 방식입니다. CLIP처럼 대조학습으로 이미지-텍스트 정렬을 학습하거나, LLaVA처럼 projection layer로 비전 토큰을 언어 모델 공간에 매핑합니다. Cross-attention으로 모달리티 간 상호작용을 학습하죠."
"GPT-4o가 실시간 음성-비전 통합을 지원하지만, 현재는 API에서 음성 입력이 제한됩니다. 풀 멀티모달 경험을 원하면 Gemini Live API가 더 나을 수 있어요. 다만 한국어 음성 품질은 GPT-4o가 우세해요."
멀티모달 모델은 이미지를 타일로 분할합니다. 4K 이미지는 비용이 10배 이상 증가할 수 있습니다. 용도에 맞게 리사이징하세요.
단순 텍스트 추출은 Tesseract OCR이 빠르고 저렴합니다. 복잡한 레이아웃, 맥락 이해가 필요할 때만 멀티모달을 사용하세요.
이미지 전처리로 해상도 최적화, 단순 OCR과 멀티모달을 용도별로 분리, 이미지당 비용 모니터링. detail="low" 옵션으로 비용 절감 가능합니다.