Yapay Zeka

Gemini videoları artık çok daha akıllı analiz ediyor: Saatler süren içerikleri bile tarayabilecek

Google, Gemini’nin video analiz yeteneklerini önemli ölçüde geliştiren “agentic video understanding” özelliğini duyurdu. Yeni sistem sayesinde Gemini, bir videonun tamamını sabit bir yöntemle incelemek yerine hangi bölümlere odaklanması gerektiğine kendisi karar verebiliyor. Böylece özellikle uzun videolarda hem maliyet hem de kullanılan token miktarı ciddi biçimde azalırken analiz doğruluğu da yükseliyor.

Google’ın paylaştığı verilere göre yeni yöntem, video analizi sırasında token tüketimini yüzde 88’e kadar, maliyeti ise yüzde 66’ya kadar azaltabiliyor. Şirket ayrıca belirli video analiz testlerinde doğruluk oranının yüzde 7’ye kadar arttığını belirtiyor.

Yeni teknoloji ilk aşamada Gemini 3.7 Flash, Gemini 3.6 Flash ve Gemini 3.5 Flash-Lite modellerinde kullanıma sunuldu.

gemini istatistik

Gemini artık videonun tamamını aynı şekilde izlemiyor

Gemini daha önce de kullanıcıların yüklediği videoları analiz edebiliyordu. Ancak klasik yöntemde video belirli bir kare hızında işleniyor ve görüntülerin büyük bölümü modele aktarılıyordu.

Google’ın “static processing” olarak tanımladığı bu yöntemde Gemini varsayılan olarak videoyu belirli aralıklarla karelere ayırarak analiz ediyor. Özellikle saatler süren videolarda bu yaklaşım, çok fazla token kullanılmasına ve analiz maliyetinin yükselmesine neden olabiliyor.

Yeni agentic video understanding sistemi ise farklı çalışıyor.

Gemini artık sorulan soruya göre videonun:

  • hangi bölümlerini incelemesi gerektiğini,
  • ne kadar hızlı tarama yapacağını,
  • görüntü karelerine mi,
  • sese mi,
  • yoksa video transkriptine mi

odaklanacağını dinamik olarak belirleyebiliyor.

Başka bir ifadeyle yapay zekâ, videonun her saniyesini aynı ayrıntı seviyesinde işlemek yerine ihtiyaç duyduğu anları bulup bu bölümlere yoğunlaşıyor.

Saatler süren videolarda önemli anları bulabilecek

Yeni sistemin en önemli avantajlarından biri uzun video içeriklerinde ortaya çıkıyor.

Google, teknolojinin 10 dakikalık eğitim videolarından 90 dakikalık derslere ve birkaç saatlik kayıtlara kadar uzun içeriklerde özellikle verimli olduğunu belirtiyor.

Gemini, örneğin birkaç saatlik bir konferans videosuna yüklenen “Bu sunumda duyurulan en önemli üç yenilik neydi?” şeklindeki bir soruya cevap vermek için tüm içeriği aynı ayrıntıyla analiz etmek zorunda kalmayacak.

Bunun yerine yapay zekâ videoyu tarayarak ilgili bölümlere ulaşabilecek ve gerektiğinde bu bölümleri daha ayrıntılı biçimde inceleyebilecek.

Bu yaklaşım özellikle eğitim videoları, konferanslar, toplantı kayıtları, güvenlik kamera görüntüleri ve uzun YouTube içerikleri gibi büyük miktarda video verisinin analiz edildiği alanlarda önemli olabilir.

Saniyeden daha kısa anları bile tespit edebiliyor

Google’ın yeni teknolojide öne çıkardığı özelliklerden biri de sub-second moment retrieval, yani bir saniyeden daha kısa süren belirli anların tespit edilebilmesi.

Bu yetenek sayesinde Gemini, videoda çok kısa süre görünen bir nesneyi veya gerçekleşen hızlı bir hareketi bulmaya çalışabiliyor.

Örneğin uzun bir spor videosunda belirli bir hareketin gerçekleştiği anın bulunması veya bir kayıtta yalnızca birkaç kare boyunca görünen görsel bir hatanın tespit edilmesi mümkün hale geliyor.

Yeni yöntem ayrıca görüntü anomalilerinin tespit edilmesi konusunda da daha hassas analiz yapılmasını sağlayabiliyor.

gemini istatistik img2

Nesne ve hareket sayımı da daha doğru hale geliyor

Gemini’nin geliştirilmiş video analiz özellikleri yalnızca videoları özetlemekle sınırlı değil.

Sistem artık fiziksel hareketleri ve görüntü içerisindeki farklı nesneleri daha ayrıntılı şekilde takip edebiliyor.

Google’ın paylaştığı örnek kullanım senaryoları arasında:

hareket sayımı, nesne takibi, belirli olayların kaç kez gerçekleştiğinin hesaplanması ve görüntü bozukluklarının tespit edilmesi bulunuyor.

Bu özellikler yapay zekâ tabanlı video analizinin spor, üretim, güvenlik, eğitim ve medya gibi alanlarda daha yaygın kullanılmasının önünü açabilir.

Token tüketimi yüzde 88’e kadar azalıyor

Yeni sistemin geliştiriciler açısından belki de en dikkat çekici tarafı maliyet tarafında ortaya çıkıyor.

Video işleme, yapay zekâ modelleri için oldukça büyük miktarda veri anlamına geliyor. Uzun videoların çok sayıda kareye bölünerek analiz edilmesi de kullanılan token miktarını hızla artırabiliyor.

Google’ın gerçekleştirdiği testlere göre agentic video understanding kullanıldığında token tüketimi yüzde 88’e kadar azaltılabiliyor.

Toplam video analiz maliyetinde ise yüzde 66’ya kadar tasarruf sağlanabiliyor.

Üstelik Google bu özelliği kullanmak için geliştiricilerden ayrı bir özellik ücreti talep etmiyor. Analizler standart Gemini API token fiyatlandırması üzerinden ücretlendiriliyor.

Bu nedenle özellikle büyük miktarda video işleyen uygulamalar için yeni sistem oldukça önemli bir maliyet avantajı sağlayabilir.

Daha az veri işleyip daha doğru sonuç verebiliyor

İşlenen veri miktarının azalması normal şartlarda analiz kalitesinin düşmesi anlamına gelebilir. Google’ın açıkladığı benchmark sonuçları ise yeni sistemde tersinin gerçekleşebildiğini gösteriyor.

Şirketin testlerinde agentic video understanding ile çalışan Gemini modelleri, bazı standart video analiz testlerinde doğruluk oranını yüzde 7’ye kadar artırmayı başardı.

Google’a göre desteklenen modeller arasında Gemini 3.7 Flash, kalite ve maliyet verimliliği açısından en güçlü sonucu sunuyor.

Bunun temel nedeni Gemini’nin artık videoyu körü körüne taramak yerine soruya göre ilgili bölümleri belirleyip analiz gücünü bu noktalara yönlendirmesi.

Agentic video understanding hangi Gemini modellerinde var?

Google’ın açıklamasına göre yeni video analiz teknolojisi şu modellerde destekleniyor:

Gemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash-Lite

Geliştiriciler özelliği Gemini API yapılandırmasında video işleme yöntemini “agentic” olarak seçerek kullanabiliyor.

Özellik hem doğrudan yüklenen videolarda hem de desteklenen YouTube videolarında kullanılabiliyor.

Şimdilik Gemini uygulamasında kullanılamıyor

Yeni özelliği hemen Gemini uygulamasını açarak denemek isteyen kullanıcıların ise biraz daha beklemesi gerekiyor.

Agentic video understanding şu anda ağırlıklı olarak geliştiricilere ve kurumsal kullanıcılara yönelik olarak:

Google AI Studio üzerinden Gemini API ve Gemini Enterprise Agent Platform içerisinde kullanılabiliyor.

Google, teknolojinin yakında Gemini uygulamasındaki Flash ve Flash-Lite modellerine de geleceğini açıkladı.

Şirket kesin bir küresel dağıtım tarihi paylaşmadığı için Türkiye’deki Gemini kullanıcılarının özelliğe tam olarak ne zaman erişeceği de şimdilik belli değil.

YouTube’un “Ask YouTube” özelliğine de geliyor

Google’ın planları yalnızca Gemini uygulamasıyla sınırlı değil.

Şirket, önümüzdeki aylarda agentic video understanding teknolojisinin YouTube’daki “Ask YouTube” özelliğinin altyapısında da kullanılacağını açıkladı.

Böylece kullanıcıların izledikleri bir video hakkında soru sorması durumunda Gemini yalnızca video transkriptine dayanmak yerine görüntü içerisindeki olayları da daha ayrıntılı şekilde analiz edebilecek.

Bu özellikle eğitim videoları, ürün incelemeleri, uzun röportajlar ve teknik içeriklerde oldukça kullanışlı olabilir.

Bir kullanıcı örneğin bir saatlik videoda belirli bir ürünün hangi dakikada gösterildiğini, belirli bir olayın kaç kez gerçekleştiğini veya konuşulan konuyla eş zamanlı olarak ekranda hangi bilgilerin görüntülendiğini sorabilir.

Gemini’nin video analizinde yeni dönem

Google’ın yeni yaklaşımı, yapay zekâ modellerinin video analiz ederken kullandığı yöntemde önemli bir değişime işaret ediyor.

Bir videonun tamamının aynı hızda ve aynı ayrıntıyla modele aktarılması yerine yapay zekânın hangi bölümleri inceleyeceğine kendisinin karar vermesi, özellikle uzun video içeriklerinde ciddi verimlilik sağlayabilir.

Token kullanımının yüzde 88’e, analiz maliyetinin ise yüzde 66’ya kadar düşebilmesi; video tabanlı yapay zekâ uygulamalarının geliştiriciler için daha ekonomik hale gelmesini sağlayabilir.

Gemini uygulamasına ve daha sonra YouTube’a yapılacak entegrasyonlarla birlikte bu teknolojinin yalnızca geliştiricilerin kullandığı bir araç olmaktan çıkıp günlük kullanıcıların uzun videolarla etkileşim biçimini de değiştirmesi bekleniyor.

İlgili Haberler

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Başa dön tuşu