🤖 AI/ML

RunPod

GPU Cloud Platform

GPU 클라우드 컴퓨팅 플랫폼. A100, H100 GPU를 초 단위로 대여. AWS 대비 최대 77% 저렴.

📖 상세 설명

RunPod는 AI/ML 워크로드를 위한 GPU 클라우드 플랫폼입니다. A100, H100 등 최신 NVIDIA GPU를 초 단위 과금으로 제공하며, AWS나 GCP 대비 최대 77%까지 저렴한 가격이 특징입니다. Stable Diffusion, LLM 추론, 모델 훈련 등에 널리 사용됩니다.

2020년에 설립되어 GPU 클라우드 시장에서 빠르게 성장했습니다. 기존 클라우드 대비 간소화된 인터페이스와 ML 특화 기능으로 개인 개발자부터 스타트업까지 폭넓게 채택되고 있습니다. Community Cloud와 Secure Cloud 두 가지 옵션을 제공합니다.

핵심 특징은 Serverless GPU 기능입니다. 요청이 없을 때는 비용이 발생하지 않고, 요청 시 자동으로 GPU가 할당됩니다. 도커 컨테이너 기반으로 환경을 쉽게 구성할 수 있고, 템플릿을 통해 Stable Diffusion, ComfyUI 등을 원클릭 배포할 수 있습니다.

데이터 전송 비용(Ingress/Egress)이 무료이고, Persistent Storage로 데이터를 유지할 수 있어 반복적인 ML 실험에 효율적입니다. 특히 Stable Diffusion 커뮤니티에서 가장 인기 있는 클라우드 플랫폼으로 자리잡았습니다.

💻 코드 예제

import runpod

# RunPod API 키 설정
runpod.api_key = "your_api_key_here"

# Serverless 엔드포인트 호출 예시
def run_inference():
    """RunPod Serverless로 추론 실행"""
    endpoint = runpod.Endpoint("your_endpoint_id")

    # 동기 실행 (결과 대기)
    result = endpoint.run_sync({
        "input": {
            "prompt": "A futuristic city at sunset",
            "num_inference_steps": 30
        }
    }, timeout=120)

    return result

# Pod 생성 예시 (On-Demand)
def create_pod():
    """GPU Pod 생성"""
    pod = runpod.create_pod(
        name="my-training-pod",
        image_name="runpod/pytorch:2.1.0-py3.10-cuda11.8.0-devel-ubuntu22.04",
        gpu_type_id="NVIDIA A100 80GB PCIe",
        gpu_count=1,
        volume_in_gb=50,
        container_disk_in_gb=20,
        ports="8888/http,22/tcp",  # Jupyter + SSH
        env={
            "JUPYTER_PASSWORD": "your_password"
        }
    )
    print(f"Pod 생성됨: {pod['id']}")
    return pod

# Serverless Worker 핸들러 예시
def handler(event):
    """Serverless endpoint handler"""
    prompt = event["input"]["prompt"]
    # 모델 추론 로직
    result = model.generate(prompt)
    return {"output": result}

runpod.serverless.start({"handler": handler})

📊 성능 & 비용

2025년 1월 기준 RunPod GPU 가격입니다. 초 단위 과금이며, 장기 약정 시 추가 할인이 제공됩니다.

GPU 모델 VRAM On-Demand (시간) 1년 약정 (시간)
NVIDIA H100 SXM 80GB $2.69 $2.65
NVIDIA A100 SXM 80GB $1.39 $1.22
NVIDIA A100 PCIe 80GB $1.19 $1.14
NVIDIA RTX 4090 24GB $0.44 $0.39
NVIDIA RTX 3090 24GB $0.22 $0.20

비교: AWS p5.48xlarge(H100 8개)는 시간당 $98.32이지만, RunPod에서 동일 구성은 약 $21.52로 77% 절감. 데이터 전송 비용이 무료인 점도 큰 장점입니다.

🗣️ 실무에서 이렇게 말하세요

💬 GPU 비용 논의에서
"LLM 파인튜닝에 RunPod A100 80GB 쓰면 시간당 $1.19에요. AWS p4d.24xlarge가 $32/시간인 것 대비 95% 이상 저렴해요. 7B 모델 LoRA 파인튜닝 2시간이면 $3 이하로 가능합니다."
💬 Stable Diffusion 배포 논의에서
"Stable Diffusion 서버리스 배포는 RunPod가 최적이에요. Cold start 시간이 10초 내외고, 요청 없을 때는 비용이 0이에요. 템플릿에서 Automatic1111이나 ComfyUI 원클릭 배포 됩니다."
💬 면접에서
"개인 프로젝트에서 RunPod를 활용해 70B 모델 추론 서버를 구축했습니다. Serverless 기능으로 요청 시에만 GPU가 활성화되어 월 비용을 $50 이하로 유지하면서 99% 이상 응답 시간 2초 미만을 달성했어요."

⚠️ 흔한 실수 & 주의사항

Pod 종료 안 하고 방치

사용 후 Pod를 Stop하지 않으면 계속 과금됩니다. 자동 종료 설정(Idle Timeout)을 꼭 활성화하세요.

Community Cloud에 민감 데이터 저장

Community Cloud는 비용이 저렴하지만 개인 GPU 제공자의 하드웨어입니다. 민감 데이터는 Secure Cloud를 사용하세요.

올바른 방법

모델 가중치는 Network Volume에 저장하여 Pod 재시작 시에도 유지되게 하고, Serverless는 cold start 시간을 고려해 설계하세요.

🔗 관련 용어

📚 더 배우기