OCR — Görselden Metin
Bir görseldeki yazıyı metne çevirir. Faturalar, dokümanlar, kimlik kartları, ekran görüntüleri için ideal.
Mevcut modeller
| Model | Özellik |
|---|---|
spook-ocr (önerilen) | Türkçe + İngilizce, basılı + el yazısı |
İki yol var
Yeni: /v1/vision/ocr (önerilen)
v2.0.0 ile gelen yeni alias. OpenAI tarzı şeması — SDK ile rahat çağrılır.
Yeni alias yolu (v2.0.0+)
bash
curl https://app.qevron.ai/v1/vision/ocr \
-H "Authorization: Bearer sk-..." \
-H "Content-Type: application/json" \
-d '{
"model": "spook-ocr",
"image": "data:image/jpeg;base64,...",
"language": "tr"
}'Eski yol (custom_test — hâlâ çalışır)
bash
curl https://app.qevron.ai/api/channel/87/custom_test \
-H "Authorization: Bearer sk-..." \
-H "Content-Type: application/json" \
-d '{
"model": "spook-ocr",
"image": "data:image/jpeg;base64,..."
}'Channel id (87) admin panelinden değişebilir. Tercih edilen artık alias yolu — channel id sabitlemek zorunda kalmıyorsun.
Python
python
import base64, requests
with open("fatura.jpg", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
resp = requests.post(
"https://app.qevron.ai/v1/vision/ocr",
headers={"Authorization": "Bearer sk-..."},
json={
"model": "spook-ocr",
"image": f"data:image/jpeg;base64,{b64}",
"language": "tr",
},
)
data = resp.json()
print(data)Yanıt şekli
Şu an upstream'in çıktısını doğrudan döner (ham). v2.0.0 sonrası bir minor sürüm normalize edecek:
json
{
"text": "Tüm görseldeki metin ardışık şekilde",
"blocks": [
{"text": "Başlık", "bbox": [x, y, w, h], "confidence": 0.98},
{"text": "Detay satırı", "bbox": [...], "confidence": 0.95}
]
}İpuçları
- Yüksek çözünürlük (1280+ px) verim arttırır.
- Eğri-çarpık görsel için önce
spook-background'la temizle, sonra OCR çek. languageparametresi opsiyonel ama önerilen — yanlış dile sapmayı engeller (özellikle "I", "1", "l" karakterlerinde).
Sorun çözme
- Boş metin → görsel düşük çözünürlüklü ya da bulanık. 1024 px altı zorlanır.
- Yanlış karakterler (l ↔ 1, O ↔ 0) →
languageparametresini ver. Türkçe içeriktetr, İngilizce'deen. - PDF için? → Önce PDF'yi sayfa-sayfa JPG'ye çevir (
pdfium,pdf2image), sonra her sayfayı bu endpoint'e gönder. Ya da PDF Ayrıştırma endpoint'ini kullan.
Devam: Nesne tespiti · VQA — Görsel anlama