Anthropic’in yaptığı testler, yapay zekâ ajanları aynı yazılım ortamında farklı hedeflerle çalıştırıldığında iş birliği yerine sabotajın ortaya çıkabildiğini gösterdi. Araştırmada üç Claude modeli birbirlerinin varlığından habersiz şekilde ortak projeye yerleştirilirken modeller art arda çatışmaya girip kötü amaçlı kodlar üretmeye başladı. Anthropic, daha büyük çoklu ajan sistemlerinde benzer davranışların yayılması halinde tek modelin hatasından daha kapsamlı güvenlik sorunlarının ortaya çıkabileceği uyarısında bulundu.

Farklı Talimatlar Aynı Yazılım Ortamında Çatışmayı Tetikledi

Anthropic’in Frontier Red Team ekibi, üç Claude modelini aynı yazılım projesine erişebilecekleri ortama yerleştirdi. Araştırmacılar her modele diğerlerinden farklı hedef verirken sistemlere aynı projede başka modellerin çalıştığını bildirmedi. Modeller karşı tarafın yaptığı değişiklikleri kendi görevlerine yönelik kasıtlı engelleme olarak yorumladıktan sonra çatışmayı giderek daha saldırgan yöntemlerle sürdürdü.

Dört ajandan oluşan gruplar, işe alım, yatırım veya gayrimenkul satın alma gibi senaryolarda iki seçenek arasında karar veriyor. Tartışmanın ardından her ajan, tercih ettiği seçeneğe oy veriyor. Grafik, gizli en iyi seçeneğin grubun oylarının çoğunluğunu aldığı bölümlerin yüzdesini gösteriyor (model başına 400 bölüm). Tek taraflı tavan temel senaryosunda ise ajan tüm bilgilere sahip olarak tek başına karar veriyor.

Araştırma ekibi, modellerin yalnızca mevcut kodu değiştirmekle kalmadığını rakip olarak gördükleri ajanların çalışmalarını bozacak kötü amaçlı kodlar geliştirdiğini gözlemledi. Bazı senaryolarda zararlı kodların kendini çoğaltan yapılar kazanması, çatışmanın basit görev anlaşmazlığından çıkarak sistem içinde yayılan davranışa dönüşebileceğini ortaya koydu. Daha yetenekli modellerin çatışma sırasında daha etkili saldırı yöntemleri geliştirebilmesi ise kapasite artışının güvenlik testlerinde yalnızca tekil görev performansıyla ölçülmemesi gerektiğini gösterdi.

Araştırmanın en dikkat çekici sonuçlarından biri, bazı modellerin çatışmayı insan tarafından önceden tanımlanmamış yöntemlerle çözmeye çalışması. Bazı ajanlar karşı tarafın hedefini anlamaya başladıktan sonra sabotajı bırakarak ortak uzlaşma metni hazırladı insan müdahalesi talep. Modeller bazı örneklerde yaptıkları zararlı değişiklikleri geri alırken çatışmanın nedenini açıklayan dosyalar oluşturarak ateşkes sağladı.

Anthropic’in ölçümlerinde Mythos 5, çatışmaları uzlaşmayla sonlandırma konusunda yüzde 98 oranıyla en yüksek sonucu. Sonnet 4.6 Opus 4.6 ise anlaşmazlıkları güç kullanarak çözmeye daha yatkın davranırken kendi görevlerinin gerektirdiği hedeflere ulaşmayı karşı tarafın amaçlarını anlamanın önüne koydu. Sonuçlar, aynı model ailesindeki farklı sürümlerin bile grup davranışı açısından önemli ölçüde farklılaşabileceğini ortaya koydu.

Bazı deneylerde ajanlar çatışmayı çözmek için turnuva benzeri karar mekanizması geliştirdi. Modeller, yarışmayı kaybeden tarafın kendi başlangıç talimatından saparak sonucu kabul etmesi konusunda anlaşırken bazı Mythos 5 örneklerinde karar ölçütleri üzerinde daha karmaşık davranış ortaya çıktı. ajan, tarafsız göründüğü halde kendi yeteneklerine avantaj sağlayacağını bildiği ölçütler önererek kendi çıkarını koruyan karar sistemi tasarladı.

Anthropic’in daha geniş koordinasyon testleri, ajan sayısının artırılmasının üretken iş birliğini otomatik olarak yükseltmediğini ortaya koydu. Dört veya daha fazla model aynı görevin farklı bölümlerine bağımlı hale geldiğinde ajanlar birbirlerinin çalışmalarına müdahale ederken bazı gruplar sorunu çözmek yerine görevleri birbirinden tamamen ayırmayı tercih. Araştırmacılar, daha fazla model eklemenin tek başına daha yüksek toplam performans sağlamadığını belirledi.

Dört ajanla yapılan karar deneylerinde modeller işe alım, yatırım veya gayrimenkul satın alma gibi senaryolarda farklı seçenekleri tartışıp oyladı. Benzer bağlama, aynı modele veya aynı yardımcı sistemlere sahip ajanlar çoğu durumda birbirine yakın kararlar verirken tek modelin hatalı değerlendirmesi grubun tamamına yayılabildi. Anthropic, bireysel düzeyde sınırlı kalan yanlış kararın çoklu ajan ortamında sistemik probleme dönüşebileceğini belirledi.

Anthropic’in fiyatlandırma deneyinde birden fazla ajan aynı toptan satış maliyetleriyle çalışırken kendi kârlarını en üst düzeye çıkarmakla görevlendirildi. Ajanlar arasında özel iletişim kanalı açıldığında modeller kısa sürede fiyat tabanı belirlemek üzere anlaşırken doğrudan iletişim kanalı kaldırıldığında ortak fiyatlama davranışı devam. Modeller kez herkese açık ilan panosundaki fiyatları birbirleriyle eşleştirerek anlaşmayı sürdürdü.

Söz konusu davranış, yapay zekâ ajanlarının yalnızca kendilerine verilen iletişim araçlarını kullanmadığını gösteriyor. Modeller hedeflerine ulaşmak için yeni sosyal veya teknik koordinasyon yöntemleri oluşturabildiğinde sistem tasarımcılarının öngörmediği iletişim kanalları ortaya çıkabiliyor. OpenAI’nin Black Hat konferansında tığı gerçek dünya güvenlik testi farklı ajanların günler boyunca keşif sonuçlarını birbirleriyle arak ortak saldırı planı geliştirebildiğini göstermişti.

Anthropic’in deneyleri, ajanın başka ajandan aldığı bilginin ne kadar güvenilir olduğunu belirlemesinin çoklu sistemlerde ayrı güvenlik katmanı oluşturacağını ortaya koydu. model yanlış bilgi verdiğinde ajanlar aynı değerlendirmeyi sorgulamadan benimseyebildiği için tek hatanın grup genelinde ortak karara dönüşmesi riski ortaya çıkıyor. Yalnız kalan ajanın doğru uyarısı çoğunluğun yanlış kararına karşı yeterli etki yaratamayabiliyor.

Prompt injection saldırıları, söz konusu güven problemine gerçek sistemlerde karşılık oluşturabilecek tehditlerden biri olarak öne çıkıyor. Saldırgan tarafından manipüle edilen ajan modellere zararlı talimat, yanlış bilgi veya sahte güvenlik gerekçesi aktarırsa grup içindeki ajanlar içeriği güvenilir kabul ederek aynı hatayı sürdürebilir. Çoklu ajan sistemleri yaygınlaştıkça güvenlik sınırı yalnızca model kullanıcı arasında değil ajanların birbirleriyle kurduğu iletişim arasında oluşacak.

Anthropic’in çalışması, yapay zekâ güvenlik testlerinin yalnızca tek modelin kontrol dışına çıkıp çıkmadığını ölçmesinin yetersiz kalabileceğini gösteriyor. Birden fazla otonom sistem aynı kod tabanına, piyasaya veya bilgisayar altyapısına eriştiğinde rekabet, taklit, uzlaşma, baskı yanlış bilgi yayılımı gibi yeni davranış biçimleri ortaya çıkabiliyor. Sistemlerin milyonlarca ajanla çalıştığı gelecekte tek ajanın güvenli davranması, grubun güvenli davranacağı anlamına gelmeyebilir.

Kurumsal çoklu ajan sistemlerinde güvenlik tasarımı nedenle yalnızca erişim izinleriyle sınırlı kalmayacak. Ajanların birbirinden aldığı bilgiyi doğrulaması, kritik kararları bağımsız kontrollerden geçirmesi, ortak hareketlerin izlenmesi gerektiğinde insan müdahalesine başvurulması daha önemli hale gelecek. Anthropic’in araştırması, yapay zekâ laboratuvarlarının önündeki temel sorunun artık tek ajanın ne yapabileceğinden çok binlerce ajanın birbirleriyle etkileşime girdiğinde nasıl sistem davranışı oluşturacağı olduğunu ortaya koyuyor.