DeepSeek, güncellenmiş Flash modelinin yeni versiyonunu tanıttı. Bu model, daha akıllı ve kaynak tüketimi düşük yapılar sunuyor.
Çin merkezli yapay zeka şirketi DeepSeek, maliyet ve gecikme optimizasyonu sağlanan Flash modelinin güncellenmiş versiyonunu tanıttı. Yeni versiyon 4.1, beklenenden daha büyük mimari iyileştirmeler içeriyor ve bu değişiklikler, daha büyük, daha akıllı ve daha az kaynak tüketen modellere kapı açabilir.
763 milyar parametreye sahip olan bu yeni model, önceki versiyonundan 2.5 kat daha büyük. Aslında, bu model, DeepSeek’in 2025 yılında tanıttığı V3 ve R1 modellerinden daha büyük bir yapıya sahip. Ancak, bu kadar büyük bir parametre sayısına rağmen, DeepSeek V4.1 Flash’ın bellek gereksinimleri beklenenden çok daha düşük.
Verimli LLM için mimari değişiklikler
DeepSeek, bu başarıyı iki ana iyileştirme ile elde etti. İlk olarak, modelin birden fazla oturum arasında durumunu takip etmek için kullandığı anahtar-değer (KV) önbelleklerinin yönetiminde önemli değişiklikler yapıldı. Bu KV önbellekleri, özellikle yüksek hacimli uygulamalarda bellek tüketimini artırabiliyor. Modelin çeşitli dikkat mekanizmalarındaki güncellemeler ve yeni bir nedensel kodlayıcı-çözücü (CED) tanıtımı, istemci yanıt performansını artırırken KV önbellek tüketimini %13 ile %25 arasında bir orana düşürdü.
Bu değişiklikler sayesinde, V4.1 sürümü aynı KV önbellek alanında dört ila sekiz kat daha fazla kullanıcıyı destekleyebiliyor. DeepSeek’in teknik raporu, mimari değişiklikler hakkında daha fazla detay sunuyor, ancak en ilginç değişikliklerden biri, farklı bir model ağırlığı türünün tanıtılması.
N-gram parametreleri ve avantajları
763 milyar parametreden 196 milyarı, DeepSeek’in ‘koşullu bellek modülü’ olarak adlandırdığı N-gram parametreleri. Bu yapı sayesinde, bellek ile hesaplama ayrılarak, DeepSeek’in modellerinin daha akıllı hale gelmesi sağlanıyor ve aynı zamanda gereken hesaplama ve bellek kaynakları da azaltılıyor. N-gram’lar, belirli bir bağlamda token gruplarını ifade ediyor ve bu sayede model, sorulara daha hızlı ve etkili yanıtlar verebiliyor.
Modern LLM’lerde model boyutu ile zeka arasındaki ilişki iyi biliniyor. DeepSeek’in N-gram parametreleri, verilerin erişim şekliyle ilgili olarak ilginç bir avantaj sunuyor. Bu parametreler, modelin bellek üzerindeki yükünü artırmadan, çıkarım sırasında kullanılabilir parametre sayısını artırmanın bir yolunu sağlıyor. Sonuç olarak, DeepSeek V4.1 Flash, daha akıllı ve daha uygun maliyetli çözümler sunarak yapay zeka alanında önemli bir adım atmış oluyor.
Kaynak: The Register




[…] acımasızca öldürülmesi, onun bu yolda ilerlemesinin başlangıç kıvılcımını oluşturuyor. Ancak bu psikolojik yara, Frank Castle’ın Siancong Savaşı’ndaki (Vietnam Savaşı […]