Birçok kişi sesli konuşurken sözü uzatıp, geri döner ve kelimelerimize takılırız. Google’ın yeni Gemini 3.5 Transcribe’ı, kusurlu konuşmamızı göz önünde bulundurarak tasarlandı. Şirketin bugüne kadarki en hassas konuşmadan metne dönüştürme modeli olarak duyurulan bu ürün, dağınık ve cilasız konuşmanızı, önce bir haber spikeri gibi konuşmanızı beklemeden temiz ve biçimlendirilmiş metne dönüştürüyor.
Gemini 3.5 Transcribe konuşmada istenmeyen sesleri temizliyor
İki yardımcı model olan Gemini 3.5 Live ve Gemini 3.5 Live Experimental ile birlikte gelen bu üç model, Google’ın “Gemini Audio” olarak adlandırdığı ürünü oluşturuyor. Model, “ııı” ve “eee” gibi dolgu kelimelerini otomatik olarak kaldırıyor, böylece transkribe edilmiş metniniz her sözlü aksaklığı içermiyor. Ayrıca, kendi kendini düzeltmeleri gerçek zamanlı olarak yakalıyor; yani “Salı günü buluşalım, hayır, Çarşamba” derseniz, Çarşamba demek istediğinizi anlıyor ve buna göre ayarlama yapıyor. Metninizi yalnızca sesinizi kullanarak da düzenleyebilirsiniz. Model ayrıca, görüntü oluşturma veya dosya analizi gibi görevleri, fonksiyon çağrısı yoluyla diğer Gemini modellerine devredebilir; bu özellik şu anda macOS’taki Gemini uygulamasında aktiftir.
Google, bunu desteklemek için güçlü doğruluk rakamları bildiriyor; gerçek zamanlı akış için kelime hata oranı sadece %4 ve önceden kaydedilmiş ses için %2,6’dır. Ayrıca 85’ten fazla dil, bölgesel aksan ve özel jargon desteği de sunuyor. Hatta bir kayıtta konuşmayı zaman damgalarıyla birlikte üç farklı konuşmacıya kadar atfedebiliyor.

