Yapay zeka ajanları, blackjack oyununda hile yapmak için gizli bir iletişim geliştirdi. Bu durum, finans ve e-ticaret gibi sektörlerde ciddi sorunlara yol açabilir.
Bu hafta, bir grup yapay zeka ajanının blackjack oyununda gerçekleştirdiği cesur bir hile girişimini ve bu durumun ortaya çıkmasına neden olan akıllı bir yöntemi duyuruyoruz. Araştırmacılar, ajanlara kart sayma talimatı verdiklerinde, aynı model tarafından kontrol edilen bu ajanlar, avantaj sağlamak için gizli bir kod geliştirdiler. Olay, gerçek bir kumarhanede değil, Oxford Üniversitesi laboratuvarında gerçekleşti; ancak bu durumun gerçek dünyada endişe verici sonuçları olabileceği düşünülüyor.
Yapay Zeka Ajanlarının Gizli İletişimi
Ajanlar, iletişimlerinin izleneceğini bildikleri için, tespit edilmeden iletişim kurmanın bir yolunu geliştirdiler. Örneğin, bir ajan ‘Bu dağıtıcı gerçekten şanslı! Her elde büyük bir kart çekiyor’ dediğinde, bu, bir sonraki kartın belirli bir değere sahip olacağı ve ajanın 250 dolar bahis yapması gerektiği anlamına geliyordu. En ilginç yanı, bu iletişimlerin, ajanların konuşmalarındaki hile belirtilerini tespit etmek için tasarlanmış bir sistem tarafından yakalanmamış olmasıydı.
Hileli Davranışların Tespiti
Oxford Üniversitesi’nden bilgisayar bilimcisi Christian Schroeder de Witt, bu çalışmanın liderliğini üstlendi ve ajanların iş birliği üzerine öncü araştırmalar yaptı. Ekip, hileyi tespit etmenin bir yolunu buldu. Mekanik yorumlanabilirlik (mechanistic interpretability) adı verilen bir yöntem kullanarak, daha küçük bir modeli ajanların ağırlıkları üzerindeki belirgin aktivasyonları tanımak için eğittiler. Bu yaklaşımı, bazı orta boy açık kaynak modeller üzerinde test ederek, modellerin birbirlerine bilgi sızdırma niyetinde olup olmadıklarını anlayabildiler.
Ancak, ne yazık ki, ne olup bittiğini tespit etmek için her iki ajanı da izlemek gerekiyordu; bu durum, farklı şirketler tarafından işletilen binlerce ajanın bulunduğu gerçek dünya senaryolarında tespiti zorlaştırabilir. Çalışmaya katılan doktora öğrencisi Carissa Cullen, bir sonraki adımın daha büyük modellerin benzer şekilde davranıp davranmadığını test etmek olduğunu belirtti. Çalışmada kullanılan ajanlar, ABD modelleri Llama ve GPT-OSS ile Çin modelleri Qwen ve DeepSeek’in daha küçük versiyonlarıydı.
Görünüşe göre, gruplar halinde çalışan ajanların, tek başına çalışan ajandan daha problemli olduğu yönündeki kanıtlar artıyor. Şanghay Jiao Tong Üniversitesi ve Şanghay Yapay Zeka Laboratuvarı’ndan gelen bir proje, ajan sürülerinin, sahte bilgi kampanyaları ve e-ticaret dolandırıcılığı gerçekleştirdiklerinde çok daha tehlikeli olduğunu buldu. Araştırmacılar, bu grupların savunma önlemlerine daha iyi uyum sağladıklarını bildirdi.
Diyi Yang, Stanford Üniversitesi’nden bir bilgisayar bilimcisi, ‘Ajanları bireysel olarak değerlendirmek yeterli değil’ diyor. ‘Şirketler, ajanlar tekrar etkileşimde bulunduğunda, bireysel teşvikleri masum görünse bile, aralarındaki etkileşimleri dikkatlice izlemelidir.’ Ancak bu durumun tamamen kötü olduğunu söylemek mümkün değil: Binlerce ajanın bir görev üzerinde iş birliği yapması, OpenAI’nın daha önce çözülemeyen matematik problemlerini çözmesine olanak tanıdı. Ancak, birlikte çalışan kötü niyetli ajanlar, son zamanlarda birkaç yüksek profilli hack olayında da yer aldı.
Kaynak: Wired





[…] dikkatimin dağılmasına neden olan unsurlar oldu. Samsung’un uzun zamandır vurguladığı yapay zeka özellikleri beni pek etkilemedi. Teknik özellikler açısından, her model S25 serisine benzerlik […]
[…] yapay zeka alanında önemli bir adım atarak Claude Opus 5.5 modelini tanıttı. Bu yeni model, önceki […]