Sesten Metne (STT)
Bir ses dosyası alır, içindeki konuşmayı metne çevirir. Whisper formatıyla %100 uyumlu — OpenAI Whisper kullanıyorsan tek satır değişikliğiyle Qevron'a geçebilirsin.
Mevcut modeller
| Model | Ne için? | Özellik |
|---|---|---|
solab-stt (önerilen) | Türkçe + İngilizce karışık konuşma | Whisper-large-v3 türevi, faster-whisper |
whisper-1 | OpenAI üzerinden | OpenAI anahtarı ekli channel'da |
curl
bash
curl https://app.qevron.ai/v1/audio/transcriptions \
-H "Authorization: Bearer sk-..." \
-F "model=solab-stt" \
-F "file=@/yol/ses.wav" \
-F "language=tr"Python (openai SDK)
python
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://app.qevron.ai/v1")
with open("kayit.wav", "rb") as f:
resp = client.audio.transcriptions.create(
model="solab-stt",
file=f,
language="tr", # önerilen — yanlış dile sapmayı engeller
)
print(resp.text)Dil ipucu
language parametresini her zaman ver. Otomatik dil tespiti küçük örneklerde yanılabilir; ses sadece bir kelime ya da çok kısa cümlelerse tr yerine en'e sapma riski artar.
Desteklenen formatlar
wav, mp3, m4a, ogg, flac, webm, mpga. Mono 16 kHz tercih edilir; multi-channel girdiyi sunucu downmix eder.
Whisper-özgü parametreler
bash
-F "prompt=Diyalogda geçen özel isimler: Köray, Arpanet, Qevron"
-F "temperature=0"
-F "response_format=verbose_json" # segment + timestamp döner- prompt — başlangıç bağlamı; özel isimler / jargonlar burada verilirse Whisper daha doğru transkribe eder.
- temperature — varsayılan 0; 1'e doğru yükselt sadece çok özel durumlarda.
- response_format —
text(varsayılan),json,verbose_json(timestamp'lı segment'ler),srt,vtt.
Akış (streaming)
"stream": true ekle, parça parça delta'lar alırsın. Henüz tüm SDK'lar destekleyemiyor — Python openai>=1.50 ile çalışır. (Bkz. v2.0.0 streaming notu.)
python
stream = client.audio.transcriptions.create(
model="solab-stt", file=open("kayit.wav","rb"), stream=True
)
for delta in stream:
print(delta.text, end="", flush=True)Sorun çözme
- Boş cevap →
languageparametresini doğru ver, dosya formatı destekleniyor mu kontrol et. - Yanlış dil →
language=trekle. - Çok yavaş → 30 sn üstü kayıtları parçalara böl. Whisper tek dosyada 30 sn'lik pencereler halinde çalışır.