Google, Gemini ailesine sesli konuşmaları metne dönüştüren yeni bir yapay zeka modeli ekledi. Gemini 3.5 Transcribe adını taşıyan model, özellikle gürültülü ortamlarda konuşmaları daha doğru algılamaya ve günlük konuşma dilini daha iyi anlamaya odaklanıyor.
Google, Gemini 3.5 Transcribe'ı bugüne kadar geliştirdiği en doğru konuşmadan metne dönüştürme modeli olarak tanımlıyor. Şirket, yeni modelin arka plan seslerinin yoğun olduğu ortamlarda ve teknik terimlerin kullanıldığı konuşmalarda önceki modellere göre daha az hata yaptığını belirtiyor.
Konuşurken yapılan hataları kendi düzeltebiliyor
Gemini 3.5 Transcribe yalnızca duyduğu kelimeleri metne aktarmıyor. Model, konuşma sırasında yapılan bazı hataları düzeltebiliyor, "ııı", "eee" gibi dolgu ifadelerini kaldırabiliyor ve ortaya çıkan metni otomatik olarak düzenleyebiliyor.
Google ayrıca modeli insanların doğal konuşma biçimlerini anlayacak şekilde geliştirdiğini söylüyor. Böylece kullanıcılar sesli komut verirken önceden belirlenmiş kalıplarla konuşmak zorunda kalmıyor. Model ayrıca kullanıcıların eklediği özel kelimeleri, farklı yazımları ve belirli alanlarda kullanılan terimleri tanıyabiliyor.
Gemini 3.5 Transcribe gerektiğinde dosya analizi veya görsel oluşturma gibi kendi alanının dışındaki işleri diğer Gemini modellerine aktarabiliyor.
Google hata oranlarını da açıkladı

Şirketin paylaştığı verilere göre Gemini 3.5 Transcribe, canlı konuşmaların yazıya aktarılmasında ortalama yüzde 4,0 kelime hata oranına (WER) sahip. Önceden kaydedilmiş içeriklerde ise bu oran yüzde 2,6'ya kadar düşüyor.
Model özellikle arka plan gürültüsünün bulunduğu ortamlarda konuşmaları ayırt etmeye odaklanıyor. Sipariş numaraları ve posta kodları gibi harflerle rakamların birlikte kullanıldığı ifadeleri de daha doğru biçimde metne aktarabiliyor.
Google, yeni modeli macOS'taki Gemini uygulamasında ve Android'deki Gboard'un Rambler özelliğinde kullanmaya başladı. Şirket, bu iki alanda da konuşma tanıma performansında artış gördüğünü belirtiyor.
85 dili ve farklı aksanları destekliyor
Gemini 3.5 Transcribe toplam 85 dili destekliyor. Model bölgesel aksanları ve farklı lehçeleri de tanıyabiliyor.
Önceden kaydedilmiş ses dosyalarında üç kişiye kadar konuşmacıları birbirinden ayırabiliyor ve konuşmalara zaman damgası ekleyebiliyor. Kullanıcılar ayrıca modele özel kelime listeleri tanımlayabiliyor. Bu özellik şirket isimleri, ürün adları veya belirli mesleklerde kullanılan terimler gibi standart sözlüklerde bulunmayan ifadelerin doğru yazılması için kullanılabiliyor.
Chrome'a da geliyor
Google, Gemini 3.5 Transcribe'ı geliştiriciler için Gemini API üzerinden genel önizlemeye açtı. Geliştiriciler modele Google AI Studio ve Google Antigravity üzerinden erişebiliyor. Model; sesli asistanlar, gerçek zamanlı altyazı sistemleri ve görüşme sonrasında konuşmaları analiz eden araçlarda kullanılabiliyor.
Son kullanıcılar ise yeni modeli Android ve macOS üzerinde deneyebiliyor. Google, Gemini 3.5 Transcribe desteğini yakında Chrome'a da getirecek. Böylece kullanıcılar internet sitelerindeki metin alanlarına klavyeyi kullanmadan konuşarak yazı girebilecek.
Gemini'de bir dönem sona erdi: Yapay zeka görsellerindeki logo kaldırılabiliyorGüncel
Rakiplere gözdağı veren büyüme: Gemini tarihi barajı aştıGüncel