Yapay Zeka Şirketleri Güvenlik Değerlendiricileri ile İşbirliği Yapacak mı?

Yapay zeka şirketleri, bağımsız değerlendiricilerle işbirliği yapmayı planlıyor. Bu durum güvenlik açısından ne anlama geliyor?

Yapay Zeka Şirketleri Güvenlik Değerlendiricileri ile İşbirliği Yapacak mı?

Yapay zeka şirketleri, bağımsız güvenlik değerlendiricileri ile işbirliği yapma konusunda adım atıyor. Bu değişim gerçekten bağımsızlık sağlayacak mı?

Yapay zeka (YZ) endüstrisi, geçtiğimiz hafta sonu Anthropic CEO’su Dario Amodei’nin yaptığı bir öneri ile önemli bir değişim sürecine girmeye hazırlanıyor. Amodei, YZ şirketlerinin, bağımsız üçüncü taraf değerlendiricileri kendi sistemlerine entegre etmeleri gerektiğini belirtti. Bu değerlendiricilerin, güvenlik olaylarını raporlama, YZ modellerinin gerçekten uyumlu olup olmadığını değerlendirme ve bulgularını kamuoyuyla paylaşma yetkisine sahip olacağını ifade etti.

Amodei, Anthropic‘in METR ve Redwood Research gibi bağımsız değerlendiricilere şirket sistemlerine daha önce görülmemiş bir erişim sağlayacağını duyurdu. OpenAI CEO’su Sam Altman da benzer bir taahhütte bulunarak bu uygulamanın sektördeki işleyişi köklü bir şekilde değiştirebileceğini belirtti.

Güvenlik Değerlendiricileri Ne Kadar Bağımsız Olacak?

TechCrunch ile konuşan üçüncü taraf değerlendiricileri, bu öneriyi genel olarak olumlu karşıladı. Ancak, bu değerlendiricilerin gerçekten bağımsız birer denetçi mi yoksa YZ şirketlerinin şartlarına bağlı çalışan birer tedarikçi mi olacağını anlamak için detayların netleştirilmesi gerektiğini vurguladılar. YZ modellerinin, değerlendirildiklerini fark etme yetenekleri arttıkça, test sırasında iyi davranma ve sorunlu davranışları gizleme riski de artıyor. Araştırmacılar, modelin test edilmesi sırasında bazı davranış ipuçlarının gözden kaçabileceğini, ancak eğitim süreci boyunca nasıl davrandığını inceleyerek bu ipuçlarının ortaya çıkarılabileceğini belirtiyorlar.

Apollo Research’ten Alexander Meinke, YZ şirketlerinin eğitim süreçleri hakkında bazı temel soruları yanıtlayabilmesi gerektiğini ifade etti. Örneğin, ‘YZ, eğitim süreci boyunca kendi uyum eğitimini zayıflatmaya çalıştı mı?’ sorusuna kesin bir ‘hayır’ yanıtı verilmesi gerektiğini belirtti. Ancak şu anda bu tür bilgilerin doğruluğunu sağlamak tamamen YZ şirketlerine bağlı. Amodei’nin önerdiği entegre değerlendiriciler, bu tür kontrolleri gerçekleştirebilecek durumda olacak.

Değerlendiricilerin Erişimi ve Zorluklar

Tarihsel olarak, YZ şirketleri dışarıdan değerlendiricileri, ürünlerini piyasaya sürmeden önce son modelleri test etmeleri için davet ediyordu. Ancak TechCrunch ile konuşan değerlendiriciler, artık yalnızca nihai modele değil, eğitim süreci boyunca ortaya çıkan ara sürümlere de erişim talep ediyorlar. FAR.AI CEO’su Adam Gleave, değerlendiricilerin bu ara sürümleri karşılaştırarak sorunlu davranışların ne zaman ortaya çıktığını belirleyebileceğini ve YZ’nin belirli davranışları ödüllendiren bir ortamda nasıl davrandığını inceleyebileceğini belirtti.

Anthropic ve OpenAI’nin bu tür bir erişimi ne zaman sağlayacağı ise belirsizliğini koruyor. Her iki şirket de hangi değerlendiricilerle çalışacaklarını, ne zaman entegre olacaklarını ve hangi sistemlere erişim sağlayacaklarını henüz açıklamadı. Güvenlik testlerinde iyi performans gösteren modellerin, bu testleri geçmek için özel olarak eğitilmiş olmaları durumunda gerçekten güvenli olup olmadıkları sorgulanabilir. Palisade Research’ten John Steidley, YZ’nin belirli durumlarda kapatılmaya karşı direnç gösterip göstermediğini ölçen bir ‘kapatma direnci ölçütü’ örneğini vererek bu durumun önemine dikkat çekti.

Gleave, anlamlı bir erişimin yalnızca modellerle sınırlı kalmayabileceğini, değerlendiricilere şirket çalışanlarıyla görüşme izni verilerek, şirketin güvenlik uygulamalarıyla ilgili belgelerinin ve kamuya açıklamalarının içerdeki uygulamalarla örtüşüp örtüşmediğinin kontrol edilebileceğini belirtti. Amodei, değerlendiricilerin risk seviyeleri, olaylar, uygulamalar ve aldıkları erişim hakkında ‘Anahtar bulguları yayınlama’ hakkına sahip olacağını belirtti. Ancak değerlendiriciler, YZ şirketlerinin sürecin kontrolünü gerçekten bırakmaları gerektiğini vurguluyorlar.

Kaynak: TechCrunch

29.Peron
29.Peron

Reklamcılık mezunuyum. Bir dönem reklam ajanslarında metin yazarı olarak çalıştım; markalara hikâyeler yazdım, sonra o hikâyelerin içine sıkışan emeği fark edip akademiye sığındım. Şu anda Üsküdar Üniversitesi’nde Medya ve Kültürel Çalışmalar alanında yüksek lisans yapıyorum. Çalışma alanım; kreatif endüstri işçilerinin güvencesizliği.

Sosyolojiyle aramda inişli çıkışlı bir aşk var. Hatta bu ilişkinin bana verdiği ilhamla kaleme aldığım Egemen Aşk İdeolojisi Üzerine adlı bir deneme kitabı yazdım — ne diyelim, herkesin bir yarası var.

Uzun lafın kısası: “Bu çocuk bir şeylerle uğraşıyor” desinler, yeter.
“Ne iş yapıyorsun?” sorusuna hâlâ net bir cevabım yok; ama “neyle dertleniyorsun?” denirse, oturur konuşuruz.

Yazılar: 479

Cevap Bırak

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir