Skip to content

OCR — Görselden Metin

Bir görseldeki yazıyı metne çevirir. Faturalar, dokümanlar, kimlik kartları, ekran görüntüleri için ideal.

Mevcut modeller

ModelÖzellik
spook-ocr (önerilen)Türkçe + İngilizce, basılı + el yazısı

İki yol var

Yeni: /v1/vision/ocr (önerilen)

v2.0.0 ile gelen yeni alias. OpenAI tarzı şeması — SDK ile rahat çağrılır.

Yeni alias yolu (v2.0.0+)

bash
curl https://app.qevron.ai/v1/vision/ocr \
  -H "Authorization: Bearer sk-..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "spook-ocr",
    "image": "data:image/jpeg;base64,...",
    "language": "tr"
  }'

Eski yol (custom_test — hâlâ çalışır)

bash
curl https://app.qevron.ai/api/channel/87/custom_test \
  -H "Authorization: Bearer sk-..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "spook-ocr",
    "image": "data:image/jpeg;base64,..."
  }'

Channel id (87) admin panelinden değişebilir. Tercih edilen artık alias yolu — channel id sabitlemek zorunda kalmıyorsun.

Python

python
import base64, requests

with open("fatura.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

resp = requests.post(
    "https://app.qevron.ai/v1/vision/ocr",
    headers={"Authorization": "Bearer sk-..."},
    json={
        "model": "spook-ocr",
        "image": f"data:image/jpeg;base64,{b64}",
        "language": "tr",
    },
)
data = resp.json()
print(data)

Yanıt şekli

Şu an upstream'in çıktısını doğrudan döner (ham). v2.0.0 sonrası bir minor sürüm normalize edecek:

json
{
  "text": "Tüm görseldeki metin ardışık şekilde",
  "blocks": [
    {"text": "Başlık", "bbox": [x, y, w, h], "confidence": 0.98},
    {"text": "Detay satırı", "bbox": [...], "confidence": 0.95}
  ]
}

İpuçları

  • Yüksek çözünürlük (1280+ px) verim arttırır.
  • Eğri-çarpık görsel için önce spook-background'la temizle, sonra OCR çek.
  • language parametresi opsiyonel ama önerilen — yanlış dile sapmayı engeller (özellikle "I", "1", "l" karakterlerinde).

Sorun çözme

  • Boş metin → görsel düşük çözünürlüklü ya da bulanık. 1024 px altı zorlanır.
  • Yanlış karakterler (l ↔ 1, O ↔ 0)language parametresini ver. Türkçe içerikte tr, İngilizce'de en.
  • PDF için? → Önce PDF'yi sayfa-sayfa JPG'ye çevir (pdfium, pdf2image), sonra her sayfayı bu endpoint'e gönder. Ya da PDF Ayrıştırma endpoint'ini kullan.

Devam: Nesne tespiti · VQA — Görsel anlama

Qevron — AI gateway. Arpanet / OpenAI / Anthropic / Gemini uyumlu.