LLM API
Öncü ve açık ağırlıklı dil modelleri, OpenAI uyumlu tek bir chat completions endpoint’inin arkasında: herhangi bir OpenAI SDK’sini ya da OpenAI uyumlu aracı tek bir ModelRunner anahtarıyla model başına bir base URL’ye yönlendirin, model değiştirmek için URL’yi değiştirin. Yayımlanan giriş/çıkış ücretleri üzerinden token başına faturalandırılır; model destekliyorsa streaming, tool calling ve JSON mode dâhildir.
Şu anda 6 dil modeli kullanılabilir — hepsi ücretsiz Playground’da ya da herhangi bir OpenAI SDK’si ve OpenAI uyumlu araçla çalıştırılabilir.
Dokümantasyon, model sayfaları ve destek İngilizcedir. Faturalandırma ABD doları üzerinden yapılır.
LLM modelleri ve fiyatlandırma
| Model | Uç nokta | Fiyat | Bağlam | Özellikler |
|---|---|---|---|---|
| GLM-5.2 Fast Preview | z-ai/glm-5.2-fast-preview | $2.8 in · $8.8 out per 1M tokens | 1M | reasoning, tool calling, json mode |
| DeepSeek V4 Pro | deepseek/v4 | $2.4 in · $4.8 out per 1M tokens | 1M | reasoning, tool calling, json mode |
| GLM-5.2 | z-ai/glm-5.2 | $1.4 in · $4.4 out per 1M tokens | 1M | reasoning, tool calling, json mode |
| Gemini 3.5 Flash-Lite | google/gemini-3.5-flash-lite | $0.3 in · $2.5 out per 1M tokens | 1M | tool calling, json mode |
| Gemini 3.7 Flash | google/gemini-3.7-flash | $1.5 in · $7.5 out per 1M tokens | 1M | reasoning, tool calling, json mode |
| Gemini 3.5 Flash | google/gemini-3.5-flash | $1.5 in · $9 out per 1M tokens | 1M | reasoning, tool calling, json mode |
Kataloğun tamamı modeller sayfasında; yapılandırma başına güncel maliyetler ise fiyatlandırma sayfasında.
Herhangi bir OpenAI SDK’sini tek değişiklikle bağlayın
base_url değerini https://queue.modelrunner.run/<owner>/<alias> olarak ayarlayın, bearer token olarak bir ModelRunner API anahtarı verin ve model kimliği olarak <owner>/<alias> kullanın — /chat/completions ekini SDK kendisi ekler. Model değiştirmek için yalnızca adresi değiştirin; başka hiçbir şey değişmez. Her model sayfası, doğrulanmış entegrasyonları (LangChain, Vercel AI SDK, LiteLLM, Aider, …) tam yapılandırmasıyla listeler.
cURL
# Synchronous, OpenAI-compatible — the reply is in the response (or streams)
curl https://queue.modelrunner.run/z-ai/glm-5.2-fast-preview/chat/completions \
-H "Authorization: Bearer $MODELRUNNER_API_KEY" \
-H "Content-Type: application/json" \
-d '{ "messages": [{ "role": "user", "content": "..." }] }'Sıkça sorulan sorular
Bir LLM API çağrısı ne kadar tutar?
Her dil modeli kendi yayımlanmış ücretleri üzerinden token başına faturalandırılır — 1M giriş token’ı ve 1M çıkış token’ı için ayrı fiyatlar, yukarıdaki tabloda ve her model sayfasında gösterilir; model destekliyorsa cache’lenmiş giriş indirimli ücretlendirilir. Reasoning (thinking) token’ları, model ayrı fiyatlandırmadıkça çıkış ücretinden işler. Abonelik ve istek başına alt sınır yoktur: kısa bir çağrı, ön ödemeli kredinizden bir sentin kesri kadar, altı ondalık basamağa kadar hassas biçimde düşer.
API üzerinden bir LLM’i nasıl çağırırım?
Her dil modeli, POST https://queue.modelrunner.run/<owner>/<alias>/chat/completions adresindeki senkron ve OpenAI uyumlu chat completions endpoint’i ile sunulur. Herhangi bir OpenAI SDK’sini ya da OpenAI uyumlu aracı base_url https://queue.modelrunner.run/<owner>/<alias> adresine, bir ModelRunner API anahtarıyla (Authorization: Bearer <key>) ve model <owner>/<alias> ile yönlendirin; SDK /chat/completions ekini kendisi ekler ve yanıt response body içinde gelir — ya da "stream": true ile Server-Sent Events olarak. Bu modeller, medya modellerinin kullandığı asenkron kuyruk yoluna gönderilmez.
Hangi araçlar bununla çalışır?
OpenAI chat completions API’sini konuşan her şey: resmî OpenAI Python ve Node SDK’leri, LangChain (base_url verilmiş ChatOpenAI), Vercel AI SDK (@ai-sdk/openai-compatible), LiteLLM, Aider ve OpenAI uyumlu sağlayıcı ayarı olan editör araçları. Claude Code aynı base URL’ye, Anthropic uyumlu /v1/messages endpoint’i üzerinden bağlanır (ANTHROPIC_BASE_URL + ANTHROPIC_AUTH_TOKEN) ve her MCP istemcisi, ModelRunner MCP sunucusunun run_model aracıyla bir dil modelini çağırabilir. Her model sayfası, gerçek bir çağrıyla doğruladığımız entegrasyonları, yapıştırılacak tam config’iyle birlikte listeler.
Bu modeller streaming, tool calling ve JSON mode destekliyor mu?
Streaming her modelde vardır ("stream": true, data: [DONE] ile biten Server-Sent Events döner). Tool calling (tool_choice ile birlikte OpenAI biçiminde bir tools dizisi) ve JSON mode (response_format {"type": "json_object"}) alttaki model destekliyorsa çalışır — hangisinin desteklediğini her model sayfasındaki ve yukarıdaki tablodaki özellikler satırı söyler. Reasoning modelleri ayrıca, düşünme derinliğiyle maliyeti dengelemek için reasoning_effort alır.
Hangi LLM’i seçmeliyim?
Yüksek hacimli sınıflandırma, çıkarım, etiketleme ve çeviri için en ucuz kademeyi; günlük özetleme, yeniden yazma ve sohbet özellikleri için genel amaçlı bir Flash sınıfı modeli; önemsiz olmayan kodlama, çok adımlı ajan döngüleri ve tek geçişte verilen yanıtın çoğu zaman yanlış olduğu zor akıl yürütme işleri için ise bir thinking modelini (reasoning özelliği) kullanın. Kapalı bir model kabul edilebilir değilse, MIT lisanslı açık ağırlıklı satırlar seçenektir. Her model sayfasında bir maliyet hesaplayıcı ve kademe karşılaştırması vardır.
