
Nous Research, Hermes Desktop ile Yerel Yapay Zeka Modeli Kurulumunu Tek Tıkla Kolaylaştırdı
Nous Research, Hermes Desktop için sunduğu yeni yerel model kurulum sistemiyle açık kaynaklı yapay zeka modellerini bilgisayarda çalıştırmayı önemli ölçüde kolaylaştırdı. Yeni sistem; bilgisayarın donanımını analiz ediyor, uygun modeli ve quantization seviyesini belirliyor, gerekli dosyaları indiriyor ve llama.cpp tabanlı çalışma ortamını otomatik olarak yapılandırıyor.
Yerel yapay zeka modellerini çalıştırmak son yıllarda giderek daha popüler hale gelse de süreç halen özellikle yeni kullanıcılar açısından oldukça teknik olabiliyor. Kullanıcıların ekran kartı belleğini kontrol etmesi, uygun GGUF dosyasını seçmesi, quantization seviyeleri arasında karar vermesi, bağlam uzunluğunu ayarlaması ve GPU katmanlarının ne kadarının belleğe aktarılacağını hesaplaması gerekebiliyor.
Hermes Desktop yerel model kurulumu, Nous Research’ün yeni sistemiyle bu işlemlerin büyük bölümünü kullanıcıdan gizleyerek daha basit bir deneyim sunmayı amaçlıyor.
Hermes Desktop Yerel Yapay Zeka Modelini Otomatik Seçiyor
Nous Research tarafından geliştirilen Hermes Desktop’ın yeni yerel model sistemi, kullanıcının bilgisayarındaki donanımı değerlendirerek hangi modellerin çalıştırılabileceğini önceden belirliyor.
Hermes’in resmi belgelerine göre uygulama, model indirilmeden önce her modeli kullanıcının mevcut donanımıyla karşılaştırıyor. Model listesindeki seçenekler daha sonra bellek uyumluluğuna göre sınıflandırılıyor.
Yeşil olarak gösterilen modeller tamamen GPU belleğine sığabiliyor. Sarı veya amber olarak işaretlenen modeller sistem RAM’inden de yararlanarak çalışabiliyor ancak bunun performans üzerinde olumsuz etkisi bulunabiliyor. Kırmızı işaretlenen modeller ise mevcut sistem için fazla büyük kabul ediliyor.
Böylece kullanıcı, onlarca gigabaytlık bir modeli indirdikten sonra modelin ekran kartına sığmadığını fark etmek yerine uyumluluk durumunu indirme işleminden önce görebiliyor.
Quantization Seçimini de Hermes Yapıyor
Yerel büyük dil modellerinde performansı ve bellek kullanımını belirleyen en önemli unsurlardan biri quantization, yani model ağırlıklarının daha düşük hassasiyetle saklanması.
Hermes Desktop bu seçimi de otomatikleştiriyor.
Sistem, mümkün olduğu durumlarda tamamen GPU belleğine sığabilecek en yüksek kaliteli model sürümünü seçiyor. Daha düşük belleğe sahip ekran kartlarında ise aynı modelin daha sıkıştırılmış bir sürümü tercih ediliyor.
Nous Research bunun için ayrıca bir kalite sınırı belirlemiş durumda. Hermes belgelerine göre sistem 4-bit’in altında quantization seçenekleri sunmuyor. Şirket, bu seviyenin altında yaşanan kalite kaybını kabul edilebilir bulmadığını belirtiyor.
Bir bilgisayar modelin 4-bit sürümünü dahi çalıştıramıyorsa Hermes modeli otomatik olarak daha fazla sıkıştırmak yerine donanımla uyumlu olmadığını kullanıcıya bildiriyor.
llama.cpp Kurulumu Otomatik Yapılıyor
Hermes Desktop’ın yerel model altyapısının merkezinde açık kaynaklı llama.cpp bulunuyor.
Kullanıcı yerel model özelliğini etkinleştirdiğinde Hermes, bilgisayarın donanımına uygun resmi llama.cpp sürümünü indiriyor, çalışma ortamını yapılandırıyor ve sonraki güncellemeleri yönetiyor.
Yerel modeller için başlangıç kurulumu şu bölüm üzerinden gerçekleştirilebiliyor:
Settings → Providers → Local Models
İlk kurulum sırasında ise kullanıcı doğrudan yerel model çalıştırma seçeneğini tercih edebiliyor.
Hermes’in yapılandırma sisteminde CUDA, Metal, Vulkan, HIP ve CPU gibi farklı altyapılar için seçenekler bulunuyor. Masaüstü uygulaması bu ayarları kullanıcı adına gerçekleştirdiğinden çoğu kişinin GPU katmanları, context size veya backend gibi teknik seçeneklerle tek tek uğraşması gerekmiyor.
En Az 64K Bağlam Penceresi Hedefleniyor
Nous Research’ün yeni sistemindeki dikkat çekici özelliklerden biri de context window, yani modelin tek konuşmada değerlendirebileceği bilgi miktarının dinamik olarak yönetilmesi.
Hermes, modeli doğrudan mümkün olan en büyük bağlam penceresiyle başlatmak yerine GPU belleğine tamamen sığabilecek bir başlangıç değeri kullanıyor.
Konuşma uzadıkça bağlam penceresi modelin desteklediği maksimum seviyeye doğru genişletilebiliyor.
Nous Research’e göre Hermes tarafından önerilen modeller için en az 64K context window garanti ediliyor.
Model GPU belleğini aşmaya başladığında Hermes gerekli verilerin bir bölümünü sistem RAM’ine taşıyabiliyor. Bu işlem gerçekleştirilirken performans üzerinde en az etki yaratması beklenen model ağırlıklarına öncelik veriliyor.
Özellikle attention cache’in RAM’e taşınmaması hedeflenerek geniş bağlam penceresinin korunmasına çalışılıyor.
Uzun Konuşmalarda Önce Bağlam Alanı Büyütülüyor
Hermes’in konuşma yönetimi de klasik otomatik özetleme sistemlerinden biraz farklı çalışıyor.
Sistem, konuşma uzadığı anda geçmiş mesajları hemen sıkıştırmak yerine önce modelin mevcut bağlam penceresini genişletiyor.
Konuşma sıkıştırma işlemi yalnızca model maksimum context window sınırına ulaştığında devreye giriyor.
Bu yaklaşım sayesinde mümkün olduğu sürece daha fazla orijinal konuşma içeriğinin doğrudan modelin bağlamında tutulması hedefleniyor.
Kullanılmayan Modeller 15 Dakika Sonra GPU Belleğinden Çıkarılıyor
Yerel yapay zeka modelleri özellikle yüksek parametre sayılarında ciddi miktarda ekran kartı belleği kullanabiliyor.
Hermes bu konuda da otomatik bir bellek yönetimi sistemi kullanıyor.
Yerel bir model 15 dakika boyunca kullanılmadığında GPU belleğinden otomatik olarak kaldırılıyor. Kullanıcı tekrar mesaj gönderdiğinde model yeniden yükleniyor.
Bu sayede Hermes kullanılmadığı zamanlarda ekran kartı belleğini sürekli olarak meşgul etmiyor.
Kullanıcılar ayrıca Hermes Desktop durum çubuğu üzerinden GPU kullanımı, GPU belleği ve sistem RAM kullanımını takip edebiliyor.
Hugging Face Üzerinden Başka Modeller de Eklenebiliyor
Hermes kullanıcıları yalnızca Nous Research tarafından hazırlanan model kataloğuyla sınırlı değil.
Uygulamadaki Find more models özelliği üzerinden Hugging Face üzerinde bulunan modeller aranabiliyor.
Hermes burada da indirilecek dosyaları kullanıcının donanımıyla karşılaştırarak hangi model sürümünün GPU belleğine uygun olduğunu gösterebiliyor.
Bilgisayarda zaten bulunan .gguf formatındaki modeller de Hermes’e eklenebiliyor. Uygulama mevcut model dosyasını yeniden kopyalamak yerine doğrudan dosyanın bulunduğu konumu kullanabiliyor.
Ayrıca deneyimli kullanıcılar isterse Hermes’in yönettiği llama.cpp ortamını kullanmak zorunda değil. Halihazırda çalışan bir llama-server algılandığında Hermes bunu kullanabiliyor veya OpenAI uyumlu özel bir yerel sunucu tanımlanabiliyor.
Yerel Modellerde Veriler Bilgisayardan Çıkmıyor
Yerel yapay zeka modellerinin en önemli avantajlarından biri gizlilik.
Nous Research’ün belgelerine göre model indirildikten sonra yerel kullanım sırasında istemlerin ve konuşmaların bulut tabanlı bir model sağlayıcısına gönderilmesi gerekmiyor. Yerel model kullanmak için ayrıca bir API anahtarı veya hesap gerekmiyor.
Bu özellik özellikle özel belgeler, şirket verileri veya internet bağlantısının bulunmadığı ortamlarda yapay zeka kullanmak isteyen kişiler açısından Hermes Desktop’ı daha ilgi çekici hale getirebilir.
Bununla birlikte kullanıcıların tamamen yerel çalışmak istiyorsa Hermes içerisinde ayrıca etkinleştirdikleri çevrim içi araçların veya diğer hizmetlerin ağ bağlantısı kullanabileceğini göz önünde bulundurması gerekiyor.
Hermes Desktop Hangi Sistemlerde Çalışıyor?
Hermes Desktop’ın masaüstü uygulaması Windows, macOS ve Linux için geliştiriliyor. Nous Research’ün güncel platform belgelerinde Windows 10/11 ile Apple Silicon tabanlı macOS sistemleri birinci seviye desteklenen platformlar arasında gösteriliyor. Linux tarafında da Hermes Agent için resmi destek bulunuyor ve masaüstü uygulamasının Linux paketleri hazırlanabiliyor.
Yerel modellerde donanım ihtiyacı ise seçilen modelin boyutuna göre önemli ölçüde değişiyor.
Nous Research, 8 GB veya daha fazla GPU belleğinin küçük katalog modelleri için, 16 GB ve üzerinin ise daha büyük 27B-35B sınıfındaki modeller için daha uygun olduğunu belirtiyor.
Dolayısıyla tek tıkla kurulum modeli seçme sürecini kolaylaştırsa da modelin çalışma performansını belirleyen temel faktörlerden biri yine kullanıcının donanımı olmaya devam ediyor.
Açık Kaynaklı Yerel Yapay Zeka Kullanımı Daha Kolay Hale Geliyor
Yerel büyük dil modellerinin önündeki en önemli engellerden biri uzun süredir kurulum karmaşıklığı.
Ollama, llama.cpp ve benzeri projeler bu süreci önemli ölçüde basitleştirmiş olsa da model boyutu, VRAM ihtiyacı, quantization ve context window gibi kavramlar özellikle ilk kez yerel model çalıştıracak kullanıcılar açısından halen kafa karıştırıcı olabiliyor.
Nous Research’ün Hermes Desktop yaklaşımı ise kullanıcıdan yalnızca hangi modeli kullanmak istediğine karar vermesini bekleyerek teknik ayarların büyük bölümünü otomatikleştiriyor.
Hermes Agent’ın MIT lisansı altında açık kaynak olarak geliştirilmesi de projenin dikkat çeken taraflarından biri.
Yeni sistem başarılı olduğu takdirde, güçlü bir ekran kartına sahip olduğu halde karmaşık kurulum süreçleri nedeniyle yerel yapay zekadan uzak duran kullanıcıların açık modelleri çok daha kolay deneyebilmesinin önünü açabilir.
Özellikle yapay zeka modellerinin giderek büyüdüğü ve farklı quantization sürümlerinin çoğaldığı düşünüldüğünde, donanımı analiz edip uygun modeli ve çalışma ayarlarını otomatik belirleyen sistemlerin yerel yapay zekanın yaygınlaşmasında önemli bir rol oynaması beklenebilir.




