Ana içeriğe geç
Saniye başına faturalandırma · Sıfıra ölçekleme

Serverless GPU’lar

Yapay zekâ iş yüklerinizi serverless GPU’larda çalıştırın. Kendi modelinizi getirin, bir GPU seçin ve işler geldikçe sıfırdan worker limitinize kadar ölçeklenen bir queue endpoint’i alın — GPU süresinin saniyesi başına faturalandırılır, worker’lar sıfıra indiğinde hiçbir ücret yoktur.

Serverless GPU’lar sınırlı bir beta ile kullanıma açılıyor.

GPU’lar ve fiyatlandırma

L40S

48 GB VRAM

high availability
$0.000975 /sn
$3.51 /sa worker başına
Deploy edin

A100

80 GB VRAM

low availability
$0.0014 /sn
$5.04 /sa worker başına
Deploy edin

A4000,RTX4000

16 GB VRAM

no capacity
$0.000225 /sn
$0.81 /sa worker başına
Deploy edin

L4

24 GB VRAM

low availability
$0.00045 /sn
$1.62 /sa worker başına
Deploy edin

H100

80 GB VRAM

high availability
$0.001525 /sn
$5.49 /sa worker başına
Deploy edin

2x L40S

96 GB VRAM

high availability
$0.00195 /sn
$7.02 /sa worker başına
Deploy edin

RTX 4090

24 GB VRAM

high availability
$0.00055 /sn
$1.98 /sa worker başına
Deploy edin

A6000

48 GB VRAM

low availability
$0.0006 /sn
$2.16 /sa worker başına
Deploy edin

H200

141 GB VRAM

low availability
$0.0025 /sn
$9.00 /sa worker başına
Deploy edin

B200

180 GB VRAM

low availability
$0.0038 /sn
$13.68 /sa worker başına
Deploy edin

Ücretler tek bir GPU worker’ının çalışma süresinin saniyesi başınadır — bir worker’ın kapanmadan önce bir sonraki işi beklediği boşta kalma saniyeleri dâhil. Uygunluk anlık kapasiteyi yansıtır ve gün içinde değişir.

Nasıl çalışır

  1. 1

    Bir deployment oluşturun

    Bir şablon seçin, bir GPU belirleyin, ölçekleme limitlerinizi ayarlayın. Endpoint’iniz dakikalar içinde yayında — cluster yok, driver yok, kapasite planlaması yok.

  2. 2

    İşleri queue API ile gönderin

    Her deployment, katalog modelleriyle aynı queue API üzerinde özel bir endpoint alır: bir iş POST edin, durumu sorgulayın, sonucu alın.

  3. 3

    Worker’ları ve logları canlı izleyin

    Dashboard worker durumlarını, kuyruk derinliğini ve canlı bir log akışını gösterir. Kullanım saniye başına ölçülür ve saatlik olarak kapanır.

Bir iş gönderin

curl -X POST https://queue.modelrunner.run/{username}/{alias} \
  -H "Authorization: Key $MRUN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{ "prompt": "..." }'
# → { "request_id": "...", "status_url": "...", "response_url": "..." }

Bir şablonla başlayın

LLM Server (vLLM)

Serve any open-weights LLM by Hugging Face id on a dedicated serverless GPU. Submit prompts through the queue API; scale-to-zero when idle.

Sıkça sorulan sorular

Serverless GPU nedir?
İşler geldiğinde başlayan, boşta kaldığında sıfıra inen GPU worker’ları. Bir deployment oluşturursunuz — bir şablon artı bir GPU ve ölçekleme limitleri — ve özel bir queue endpoint’i alırsınız; worker’ları ModelRunner çalıştırır, logları akıtır ve saniyeleri ölçer.
Serverless GPU faturalandırması nasıl işler?
Her GPU için gösterilen ücret üzerinden, worker süresinin saniyesi başına. Deployment’lar boşta kaldığında sıfıra iner; yani hiç iş almayan bir endpoint’i açık tutmanın maliyeti yoktur. Kullanım canlı olarak ölçülür ve saatlik ücretlere dönüşür; her deployment için aylık harcama üst sınırı belirleyebilirsiniz.
Bir deployment’a işleri nasıl gönderirim?
Her deployment, queue.modelrunner.run üzerinde {username}/{alias} biçiminde bir endpoint alır — katalog modelleriyle aynı queue API. API anahtarınızla bir iş POST edin, durum URL’sini sorgulayın ve tamamlandığında sonucu alın.
GPU’larımı çalışırken izleyebilir miyim?
Evet. Dashboard her deployment için canlı worker’ları (durum, GPU, bölge, çalışma süresi), kuyruk derinliğini, akan bir log kuyruğunu, istek geçmişini ve saatlik kullanımı gösterir.

Deploy etmeye hazır mısınız?

Dashboard’dan bir deployment oluşturun ve ilk işinizi dakikalar içinde gönderin.