Model Detayları
Florence-2 Large OCR with Region, bir fotoğrafta metnin nerede geçtiğini bulur, okur ve tespit ettiği her metin bölgesinin, tanınan metni gösteren etiketli bir kutu olarak çizildiği aynı görseli döndürür. Bir görsel URL’si verin; bulduğu her metin bölgesini — tabelalar, ürün etiketleri, başlıklar, basılı satırlar — işaretleyen bir görsel alırsınız, yanında da bölge başına yapılandırılmış sonuçlar gelir (her kutunun konumu ve okuduğu metin). Ne prompt ne de ince ayar gerekir: bir görsel girer, işaretlenmiş bir görsel çıkar. Microsoft’un Florence-2 vision-language temel modeli üzerine kuruludur; tespit ve tanımayı tek geçişte birleştirir, böylece metnin hem *ne* dediğini hem de karede *nerede* durduğunu görürsünüz.
## En uygun olduğu işler - Tabelalardaki, ürün etiketlerindeki, fişlerdeki ve belge fotoğraflarındaki metni okuyup yerini bulmak - İnceleme ya da kalite kontrol için metnin görselde nerede durduğunu etiketli kutularla göstermek - Ambalajlarda, reklamlarda ya da UI ekran görüntülerinde metnin yerleşimini ve kapsamını kontrol etmek - Yalnızca düz bir string değil, hem okunan metnin hem de konumunun gerektiği, konuma dayalı OCR
## Şu durumlarda başka bir model seçin - Kutu ya da koordinat olmadan yalnızca ham metni istiyorsanız — metin döndüren sade bir OCR / metin tanıma modeli kullanın - Metin yerine metin dışı nesneleri (insanlar, araçlar, eşyalar) tespit etmek istiyorsanız — bir nesne tespiti modeli kullanın - Metin bölgeleri yerine sahneyi anlatan yazılı bir açıklama istiyorsanız — bir görsel açıklama (image captioning) modeli kullanın
## İpuçları - Net ve makul ölçüde yüksek çözünürlüklü bir fotoğraf verin; küçük ya da düşük kontrastlı metin, piksel arttıkça daha kolay okunur. - Dönen görsel, metin bölgesi kutularının ve etiketlerin zaten çizili olduğu standart bir PNG’dir; doğrudan gösterebilir ya da orijinaliyle karşılaştırabilirsiniz. - Ayarlanacak eşik ya da prompt yoktur — aynı görsel üzerindeki her çalıştırma deterministiktir. - En iyi sonucu basılı ya da tabela tarzı metinde verir; yoğun paragraflar ve bitişik el yazısı daha zordur.
## Sınırlamalar - Basılı ve iri puntolu metni iyi okur; küçük, bulanık, stilize ya da el yazısıyla yazılmış metin atlanabilir veya yanlış okunabilir. - Üst üste binen ya da sıkışık metin bölgeleri birleştirilebilir ya da bölünebilir. - Çok döndürülmüş ya da belirgin biçimde eğik metnin yeri bulunabilir ama daha az güvenilir okunur.
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("microsoft/florence-2-large/ocr-with-region", { input: { image_url: "https://media.modelrunner.ai/example-storefront-sign.png", }, }); ```



