Görsel + Soru-Cevap (VQA)
Bir görsel + soru verirsin, model görseli "okur" ve sorunu cevaplar. OpenAI vision formatı — görsel image_url content tipi olarak chat completion içine gömülür.
Mevcut modeller
| Model | Özellik |
|---|---|
spook-vision (önerilen, yerel) | Multimodal, hızlı, GPU üzerinden |
gpt-4o | OpenAI üzerinden — yüksek kalite, daha pahalı |
claude-3-5-sonnet | Anthropic üzerinden |
curl
bash
curl https://app.qevron.ai/v1/chat/completions \
-H "Authorization: Bearer sk-..." \
-H "Content-Type: application/json" \
-d '{
"model": "spook-vision",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Bu görselde ne var?"},
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,..."}}
]
}]
}'Python (openai SDK)
python
import base64
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://app.qevron.ai/v1")
# Yerel dosyadan
with open("foto.jpg", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
resp = client.chat.completions.create(
model="spook-vision",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Bu fotoğrafta kaç kişi var, ne yapıyorlar?"},
{"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
],
}],
)
print(resp.choices[0].message.content)URL'den de geçer:
python
{"type": "image_url", "image_url": {"url": "https://example.com/foto.jpg"}}Boyut limiti
- Maksimum payload: 50 MB (data URL + JSON tüm gövde).
- Önerilen: client tarafında 1280 px maksimum genişlik + JPEG 0.85 kalite → ~150–300 KB.
- Çok büyük görsel gönderirsen ingress (nginx/Caddy) 413 dönebilir.
Hangisi vision için?
| İhtiyaç | Model |
|---|---|
| "Bu görselde ne var?" — genel betimleme | spook-vision |
| Detaylı analiz / akıl yürütme | gpt-4o (OpenAI anahtarı varsa) |
| Görseldeki yazıyı çıkarmak (OCR) | spook-ocr — özel endpoint, OCR sayfası |
| Nesneleri bbox ile saymak | spook-detect — özel endpoint, Detect sayfası |
Sorun çözme
- "413 Request Entity Too Large" → görsel çok büyük. Client'ta downscale + JPEG sıkıştır.
- "image format not supported" →
data:image/png;base64,...veyadata:image/jpeg;base64,...prefix'ini doğru ver. - Yanlış cevap → daha spesifik soru sor; "Bu görselde ne var?" çok genel, "Köpek kaç tane?" daha güvenilir.
Devam: OCR · Nesne tespiti