DeepSeek’in Yeni Modeli, Verimli LLM’ler İçin Bir Şablon Oluşturuyor

DeepSeek'in yeni modeli, verimli LLM'ler için kaynak tüketimini azaltarak daha akıllı çözümler sunuyor.

DeepSeek, güncellenmiş Flash modelinin yeni versiyonunu tanıttı. Bu model, daha akıllı ve kaynak tüketimi düşük yapılar sunuyor.

Çin merkezli yapay zeka şirketi DeepSeek, maliyet ve gecikme optimizasyonu sağlanan Flash modelinin güncellenmiş versiyonunu tanıttı. Yeni versiyon 4.1, beklenenden daha büyük mimari iyileştirmeler içeriyor ve bu değişiklikler, daha büyük, daha akıllı ve daha az kaynak tüketen modellere kapı açabilir.

763 milyar parametreye sahip olan bu yeni model, önceki versiyonundan 2.5 kat daha büyük. Aslında, bu model, DeepSeek’in 2025 yılında tanıttığı V3 ve R1 modellerinden daha büyük bir yapıya sahip. Ancak, bu kadar büyük bir parametre sayısına rağmen, DeepSeek V4.1 Flash’ın bellek gereksinimleri beklenenden çok daha düşük.

Verimli LLM için mimari değişiklikler

DeepSeek, bu başarıyı iki ana iyileştirme ile elde etti. İlk olarak, modelin birden fazla oturum arasında durumunu takip etmek için kullandığı anahtar-değer (KV) önbelleklerinin yönetiminde önemli değişiklikler yapıldı. Bu KV önbellekleri, özellikle yüksek hacimli uygulamalarda bellek tüketimini artırabiliyor. Modelin çeşitli dikkat mekanizmalarındaki güncellemeler ve yeni bir nedensel kodlayıcı-çözücü (CED) tanıtımı, istemci yanıt performansını artırırken KV önbellek tüketimini %13 ile %25 arasında bir orana düşürdü.

Bu değişiklikler sayesinde, V4.1 sürümü aynı KV önbellek alanında dört ila sekiz kat daha fazla kullanıcıyı destekleyebiliyor. DeepSeek’in teknik raporu, mimari değişiklikler hakkında daha fazla detay sunuyor, ancak en ilginç değişikliklerden biri, farklı bir model ağırlığı türünün tanıtılması.

N-gram parametreleri ve avantajları

763 milyar parametreden 196 milyarı, DeepSeek’in ‘koşullu bellek modülü’ olarak adlandırdığı N-gram parametreleri. Bu yapı sayesinde, bellek ile hesaplama ayrılarak, DeepSeek’in modellerinin daha akıllı hale gelmesi sağlanıyor ve aynı zamanda gereken hesaplama ve bellek kaynakları da azaltılıyor. N-gram’lar, belirli bir bağlamda token gruplarını ifade ediyor ve bu sayede model, sorulara daha hızlı ve etkili yanıtlar verebiliyor.

Modern LLM’lerde model boyutu ile zeka arasındaki ilişki iyi biliniyor. DeepSeek’in N-gram parametreleri, verilerin erişim şekliyle ilgili olarak ilginç bir avantaj sunuyor. Bu parametreler, modelin bellek üzerindeki yükünü artırmadan, çıkarım sırasında kullanılabilir parametre sayısını artırmanın bir yolunu sağlıyor. Sonuç olarak, DeepSeek V4.1 Flash, daha akıllı ve daha uygun maliyetli çözümler sunarak yapay zeka alanında önemli bir adım atmış oluyor.

Kaynak: The Register

29.Peron
29.Peron

Reklamcılık mezunuyum. Bir dönem reklam ajanslarında metin yazarı olarak çalıştım; markalara hikâyeler yazdım, sonra o hikâyelerin içine sıkışan emeği fark edip akademiye sığındım. Şu anda Üsküdar Üniversitesi’nde Medya ve Kültürel Çalışmalar alanında yüksek lisans yapıyorum. Çalışma alanım; kreatif endüstri işçilerinin güvencesizliği.

Sosyolojiyle aramda inişli çıkışlı bir aşk var. Hatta bu ilişkinin bana verdiği ilhamla kaleme aldığım Egemen Aşk İdeolojisi Üzerine adlı bir deneme kitabı yazdım — ne diyelim, herkesin bir yarası var.

Uzun lafın kısası: “Bu çocuk bir şeylerle uğraşıyor” desinler, yeter.
“Ne iş yapıyorsun?” sorusuna hâlâ net bir cevabım yok; ama “neyle dertleniyorsun?” denirse, oturur konuşuruz.

Yazılar: 257

Bir yorum

Cevap Bırak

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir