
Google Gemini 3.8 Live duyuruldu: GPT-Live-1’e çok daha ucuz rakip
Google DeepMind, gerçek zamanlı sesli yapay zeka alanındaki rekabeti yeni modelleri Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking ile kızıştırıyor. Özellikle geliştiriciler ve ses tabanlı yapay zeka uygulamaları için hazırlanan yeni modeller, doğal konuşmanın yanında görsel girdileri işleme, araçları kullanma ve konuşma devam ederken karmaşık görevler üzerinde çalışma gibi yetenekleri bir araya getiriyor.
Google’ın yeni hamlesinin en dikkat çekici taraflarından biri ise fiyatlandırma. Şirket, sesli yapay zeka tarafında OpenAI’ın kısa süre önce geliştiricilere sunduğu GPT-Live-1 modeline kıyasla çok daha düşük maliyetli bir alternatif oluşturmayı hedefliyor.
Gemini 3.8 Live neler sunuyor?
Gemini 3.8 Live, klasik bir sesli asistandan daha fazlasını hedefleyen gerçek zamanlı bir yapay zeka modeli olarak tasarlandı. Model, kullanıcıyla sesli konuşma sürerken farklı araçlardan ve API’lerden yararlanabilecek, görsel içerikleri değerlendirebilecek ve bazı görevleri konuşmayı tamamen durdurmadan yerine getirebilecek şekilde geliştirildi.
Google’ın Gemini Live altyapısında 97 farklı dil desteği bulunuyor. Bu da yeni modellerin yalnızca İngilizce konuşan kullanıcıları hedeflemediğini, çok dilli uygulamalarda da kullanılabileceğini gösteriyor. Google’ın geliştirici belgelerinde Live API’nin Türkçe dahil 97 dili desteklediği belirtiliyor.
Yeni Gemini 3.8 Live ailesi iki temel seçeneğe ayrılıyor:
Gemini 3.8 Live, hız ve maliyet verimliliğinin önemli olduğu gerçek zamanlı uygulamalar için geliştirildi. Sesli müşteri hizmetleri, dijital asistanlar, eğitim uygulamaları ve etkileşimli yapay zeka karakterleri bu modele uygun kullanım alanları arasında yer alıyor.
Gemini 3.8 Live Extended Thinking ise daha karmaşık sorular ve çok adımlı işlemler için daha fazla muhakeme kapasitesi sunuyor. Google’ın açıklamasına göre model, karmaşık bir görev üzerinde çalışırken konuşmayı tamamen kesmek yerine kullanıcıya işlemin sürdüğünü belirten doğal sesli geri bildirimler verebiliyor. Google ayrıca yeni Gemini 3.8 ses modelleri tarafından üretilen seslere SynthID filigranı uygulandığını belirtiyor.
Gemini 3.8 Live benchmark sonuçlarında da iddialı
Google’ın yeni modelleri yalnızca fiyatıyla değil, performans tarafında da dikkat çekiyor.
Artificial Analysis tarafından hazırlanan konuşmadan konuşmaya yapay zeka testlerinde Gemini 3.8 Live Extended Thinking için 82,6 puanlık sonuç bildiriliyor. Bu değer modelin güncel Speech-to-Speech değerlendirmelerinde üst sıralara çıkmasını sağlıyor.
Artificial Analysis’ın sesli yapay zeka karşılaştırmaları; konuşma muhakemesi, ajan performansı, konuşma dinamikleri ve farklı görevlerdeki başarı gibi ölçütleri birlikte değerlendiriyor. Platformun güncel listelerinde OpenAI ve Google modellerinin gerçek zamanlı sesli yapay zeka alanında oldukça yakın bir rekabet içinde olduğu görülüyor.
Ancak benchmark sonuçlarının doğrudan “hangi model daha doğal konuşuyor?” sorusuna tek başına cevap vermediğini belirtmek gerekiyor. Ses kalitesi, gecikme süresi, konuşmanın kesilebilmesi ve aynı anda dinleyip konuşabilme gibi özellikler gerçek kullanım deneyiminde en az yapay zeka muhakeme performansı kadar önemli.
Google’ın en büyük avantajı fiyat olabilir
Gemini 3.8 Live ailesinin geliştiriciler açısından en güçlü taraflarından biri maliyet avantajı.
Google’ın yeni model için açıklanan fiyatlandırmasına göre ses girişi yaklaşık dakika başına 0,005 dolar, ses çıkışı ise yaklaşık dakika başına 0,018 dolar seviyesinde.
Bu fiyatlandırmayla sürekli giriş ve çıkışın hesaba katıldığı bir saatlik yoğun sesli kullanımın yaklaşık 1,38 dolar civarında maliyet oluşturması mümkün.
OpenAI tarafında ise GPT-Live-1 ses oturumlarının fiyatı dakika başına 0,05 dolar olarak açıklanmış durumda. Bu ücret yalnızca gerçek zamanlı ses katmanını kapsıyor; kullanılan arka uç modeli ve bazı araç çağrıları ayrıca ücretlendirilebiliyor. Bir saatlik kesintisiz GPT-Live-1 oturumunun yalnızca ses katmanı yaklaşık 3 dolar seviyesine ulaşıyor.
Dolayısıyla uzun süre çalışan müşteri hizmetleri botları veya binlerce kullanıcının bulunduğu sesli yapay zeka uygulamalarında Google’ın fiyat farkı oldukça önemli hale gelebilir.
GPT-Live-1 doğal konuşmada hâlâ avantajlı olabilir
Fiyat ve bazı benchmark sonuçları Google lehine görünse de OpenAI’ın önemli bir teknik avantajı bulunuyor: full duplex konuşma.
GPT-Live-1 kullanıcı konuşurken aynı anda dinlemeye ve konuşmaya devam edebiliyor. Böylece gerçek hayattaki bir telefon görüşmesine daha yakın şekilde duraksamaları, söz kesmeleri ve konuşma sırasında verilen kısa tepkileri yönetebiliyor.
OpenAI, GPT-Live-1’i doğrudan gerçek zamanlı ve doğal sesli etkileşim için geliştirdiğini belirtiyor. Şirketin verilerine göre model konuşma sırasında duraklamaları ve kesintileri yönetebiliyor ve gerektiğinde daha karmaşık işlemleri arka plandaki başka modellere veya araçlara aktarabiliyor.
Bu nedenle yalnızca maliyet veya yapay zeka muhakeme puanlarına bakıldığında Gemini 3.8 Live oldukça avantajlı görünse de, insana en yakın konuşma deneyimi konusunda GPT-Live-1 bazı uygulamalarda hâlâ daha güçlü bir seçenek olabilir.
Sesli yapay zeka rekabetinde fiyat savaşı başlıyor
Google ve OpenAI arasındaki rekabet artık yalnızca metin üreten büyük dil modelleriyle sınırlı değil. Yeni mücadele alanlarından biri de gerçek zamanlı sesli yapay zeka sistemleri.
Bu teknolojilerin özellikle çağrı merkezleri, oyun karakterleri, eğitim uygulamaları, yapay zeka asistanları ve otomobil içi sesli sistemlerde hızla yayılması bekleniyor. Böyle bir ortamda dakika başına birkaç sentlik maliyet farkı bile milyonlarca dakikalık kullanımda şirketler için ciddi bütçe farkları oluşturabilir.
Google’ın Gemini 3.8 Live ile izlediği yaklaşımın yüksek performansı mümkün olduğunca düşük maliyetle sunmak olduğu görülüyor. OpenAI ise GPT-Live-1 ile daha doğal, kesintisiz ve insan konuşmasına yakın bir etkileşim deneyimini öne çıkarıyor.
Kısacası geliştiriciler açısından tercih artık yalnızca “hangi model daha akıllı?” sorusuna bağlı olmayacak. Ses kalitesi, gecikme, muhakeme yeteneği, araç kullanımı ve dakika başına maliyet gibi faktörlerin tamamı yeni nesil sesli yapay zeka uygulamalarının hangi modeli tercih edeceğini belirleyecek.



