Skip to content

Görsel + Soru-Cevap (VQA)

Bir görsel + soru verirsin, model görseli "okur" ve sorunu cevaplar. OpenAI vision formatı — görsel image_url content tipi olarak chat completion içine gömülür.

Mevcut modeller

ModelÖzellik
spook-vision (önerilen, yerel)Multimodal, hızlı, GPU üzerinden
gpt-4oOpenAI üzerinden — yüksek kalite, daha pahalı
claude-3-5-sonnetAnthropic üzerinden

curl

bash
curl https://app.qevron.ai/v1/chat/completions \
  -H "Authorization: Bearer sk-..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "spook-vision",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Bu görselde ne var?"},
        {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,..."}}
      ]
    }]
  }'

Python (openai SDK)

python
import base64
from openai import OpenAI

client = OpenAI(api_key="sk-...", base_url="https://app.qevron.ai/v1")

# Yerel dosyadan
with open("foto.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

resp = client.chat.completions.create(
    model="spook-vision",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Bu fotoğrafta kaç kişi var, ne yapıyorlar?"},
            {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
        ],
    }],
)
print(resp.choices[0].message.content)

URL'den de geçer:

python
{"type": "image_url", "image_url": {"url": "https://example.com/foto.jpg"}}

Boyut limiti

  • Maksimum payload: 50 MB (data URL + JSON tüm gövde).
  • Önerilen: client tarafında 1280 px maksimum genişlik + JPEG 0.85 kalite → ~150–300 KB.
  • Çok büyük görsel gönderirsen ingress (nginx/Caddy) 413 dönebilir.

Hangisi vision için?

İhtiyaçModel
"Bu görselde ne var?" — genel betimlemespook-vision
Detaylı analiz / akıl yürütmegpt-4o (OpenAI anahtarı varsa)
Görseldeki yazıyı çıkarmak (OCR)spook-ocr — özel endpoint, OCR sayfası
Nesneleri bbox ile saymakspook-detect — özel endpoint, Detect sayfası

Sorun çözme

  • "413 Request Entity Too Large" → görsel çok büyük. Client'ta downscale + JPEG sıkıştır.
  • "image format not supported"data:image/png;base64,... veya data:image/jpeg;base64,... prefix'ini doğru ver.
  • Yanlış cevap → daha spesifik soru sor; "Bu görselde ne var?" çok genel, "Köpek kaç tane?" daha güvenilir.

Devam: OCR · Nesne tespiti

Qevron — AI gateway. Arpanet / OpenAI / Anthropic / Gemini uyumlu.