Skip to content

Sesten Metne (STT)

Bir ses dosyası alır, içindeki konuşmayı metne çevirir. Whisper formatıyla %100 uyumlu — OpenAI Whisper kullanıyorsan tek satır değişikliğiyle Qevron'a geçebilirsin.

Mevcut modeller

ModelNe için?Özellik
solab-stt (önerilen)Türkçe + İngilizce karışık konuşmaWhisper-large-v3 türevi, faster-whisper
whisper-1OpenAI üzerindenOpenAI anahtarı ekli channel'da

curl

bash
curl https://app.qevron.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-..." \
  -F "model=solab-stt" \
  -F "file=@/yol/ses.wav" \
  -F "language=tr"

Python (openai SDK)

python
from openai import OpenAI

client = OpenAI(api_key="sk-...", base_url="https://app.qevron.ai/v1")

with open("kayit.wav", "rb") as f:
    resp = client.audio.transcriptions.create(
        model="solab-stt",
        file=f,
        language="tr",   # önerilen — yanlış dile sapmayı engeller
    )
print(resp.text)

Dil ipucu

language parametresini her zaman ver. Otomatik dil tespiti küçük örneklerde yanılabilir; ses sadece bir kelime ya da çok kısa cümlelerse tr yerine en'e sapma riski artar.

Desteklenen formatlar

wav, mp3, m4a, ogg, flac, webm, mpga. Mono 16 kHz tercih edilir; multi-channel girdiyi sunucu downmix eder.

Whisper-özgü parametreler

bash
-F "prompt=Diyalogda geçen özel isimler: Köray, Arpanet, Qevron"
-F "temperature=0"
-F "response_format=verbose_json"   # segment + timestamp döner
  • prompt — başlangıç bağlamı; özel isimler / jargonlar burada verilirse Whisper daha doğru transkribe eder.
  • temperature — varsayılan 0; 1'e doğru yükselt sadece çok özel durumlarda.
  • response_formattext (varsayılan), json, verbose_json (timestamp'lı segment'ler), srt, vtt.

Akış (streaming)

"stream": true ekle, parça parça delta'lar alırsın. Henüz tüm SDK'lar destekleyemiyor — Python openai>=1.50 ile çalışır. (Bkz. v2.0.0 streaming notu.)

python
stream = client.audio.transcriptions.create(
    model="solab-stt", file=open("kayit.wav","rb"), stream=True
)
for delta in stream:
    print(delta.text, end="", flush=True)

Sorun çözme

  • Boş cevaplanguage parametresini doğru ver, dosya formatı destekleniyor mu kontrol et.
  • Yanlış dillanguage=tr ekle.
  • Çok yavaş → 30 sn üstü kayıtları parçalara böl. Whisper tek dosyada 30 sn'lik pencereler halinde çalışır.

Devam: Telefon ajanı (CalleKit) · TTS — Metinden Sese

Qevron — AI gateway. Arpanet / OpenAI / Anthropic / Gemini uyumlu.