Model Detayları
HunyuanImage 3.0 Instruct, bir metin prompt’unu yüksek kaliteli bir görsele dönüştürür. 80 milyar parametreli HunyuanImage 3.0 temel modelinin instruction-tuned checkpoint’idir ve uzun, karmaşık, çok parçalı prompt’ları çözümleyip render’dan önce sahneyi planlayan dahili bir muhakeme adımına sahiptir. Böylece tek bir prompt’ta birden fazla özneyi, uzamsal ilişkileri, ışığı ve stili tek tek yazdığınızda sonuç, her talimatı ham bir diffusion geçişine göre daha sadık biçimde izler. En-boy oranını `image_size` ile ayarlayın (`square_hd`, `portrait_16_9`, `landscape_16_9` gibi hazır ayarlar, açıkça bir `{width, height}` ya da seçimi modele bırakmak için `auto`); `num_images` ile de çağrı başına en fazla dört varyasyon üretin.
Bu varyantta prompt genişletme varsayılan olarak açıktır: bir dil modeli, üretimden önce kısa prompt’ları detaylandırır. Yazdığınız ifadenin kelimesi kelimesine korunmasını istediğinizde `enable_prompt_expansion` alanını `false` yapın. Bu varyant negative prompt ya da denoising adımı kontrolü sunmaz — muhakeme adımı bunu kendi içinde halleder — bu yüzden örnekleyiciyi yönlendirmekten çok ne istediğinizi tarif etmeye göre ayarlanmıştır.
## En uygun olduğu işler - Birden fazla öznenin, uzamsal yerleşimin, ışığın ve atmosferin birlikte tutması gereken uzun, zengin ayrıntılı prompt’lar - Sıradan bir text-to-image modelinin bir kısmını atlamaya eğilimli olduğu karmaşık, çok parçalı talimatlar - Ayrıntılı bir yazılı açıklamadan fotogerçekçi ve stilize görseller - Bir brief’ten konsept çizim, editoryal illüstrasyon, poster ve pazarlama görselleri - Kare olmayan en-boy oranlarında, aralarından seçmek için aynı anda birkaç kompozisyon varyantı üretmek
## Şu durumlarda başka bir model seçin - Sıfırdan üretmek yerine mevcut bir görseli düzenlemek, yeniden tarzlamak ya da değiştirmek istiyorsanız — bir görsel düzenleme modeli kullanın - Dönüştürmek istediğiniz bir referans fotoğrafınız varsa ve yapısını korumak istiyorsanız — bir image-to-image modeli kullanın - Örnekleyiciyi doğrudan yönlendirmek için negative prompt ya da inference adımı kontrolü gerekiyorsa — bu varyant bunları sunmaz; temel HunyuanImage 3.0 text-to-image varyantını kullanın - En ucuz ve en hızlı taslaklar gerekiyorsa ve biraz sadakatten ödün verebiliyorsanız — damıtılmış, hızlı bir text-to-image modeli kullanın - Video gerekiyorsa — bir text-to-video ya da image-to-video modeli kullanın
## İpuçları - Net ve betimleyici prompt’lar yazın, her gereksinimi açıkça belirtin; muhakeme adımı kısa anahtar kelime listelerinden çok yapılandırılmış, eksiksiz talimatları ödüllendirir - Kısa brief’lerde `enable_prompt_expansion` alanını açık bırakın (varsayılan); prompt’unuz zaten kesinse ve kelimesi kelimesine korunmasını istiyorsanız `false` yapın - Yaygın en-boy oranları için `image_size` hazır ayarlarını kullanın, kesin bir tuval için açıkça bir `{width, height}` nesnesi verin ya da boyutları modelin seçmesi için `auto` kullanın - Üretilen her görsel megapiksel başına faturalanır; bu yüzden daha büyük boyutlar ve daha yüksek `num_images` daha pahalıya gelir
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("tencent/hunyuan-image/v3/instruct/text-to-image", { input: { prompt: "a snow leopard on a rocky ledge at golden hour, telephoto compression, sharp fur detail, cinematic lighting", image_size: "landscape_16_9", num_images: 1, output_format: "png", }, }); ```





