Çin merkezli.ai, GLM-5.3 modeliyle yazılım açıklarını bulma testinde Anthropic’in erişimi kısıtlı Mythos 5 modeline yakın sonuç aldığını açıkladı. Şirketin verilerine göre model, CyberGym değerlendirmesinde yüzde 84,5 başarı elde ederken Mythos 5 yüzde 83,8 seviyesinde kaldı sonuçlar henüz bağımsız kuruluşlar tarafından doğrulanmadı.ai, GLM-5.3’ü yaklaşık iki hafta içinde açık ağırlıklarla yayınlamayı planlarken siber güvenlik açısından hassas işlevleri doğrulanmış kullanıcılarla sınırlandıracağını bildirdi.
Siber Güvenlik Testleri Modelin İki Farklı Yeteneğini Ortaya KoyduCyberGym değerlendirmesinde.ai tarafından açıklanan yüzde 84,5’lik skor, GLM-5.3’ün kodunu inceleme, güvenlik açığını ayırt etme, ardından bulgunun gerçek zafiyet olduğunu doğrulama görevlerinde güçlü sonuç verdiğini gösteriyor. CyberGym gibi testler yalnızca kod parçasında şüpheli satırı işaretlemeyi değil, yapay zekâ aracısının bulduğu problemin gerçekten güvenlik etkisi oluşturup oluşturmadığını incelemesini ölçüyor.ai’nin açıkladığı sonuçlar Mythos 5’in yüzde 83,8’lik skorunu az farkla geride bıraksa şirketin kendi değerlendirmesi bağımsız denetimden geçmediği için iki model arasında kesin üstünlük sıralaması yapmak için erken kalıyor.
ExploitBench tarafındaki sonuçlar ise GLM-5.3’ün açık keşfinden çalışan saldırı koduna geçiş aşamasında rakibinin gerisinde kaldığını gösteriyor.ai, modelin yüzde 54,4 puan aldığını açıklarken Mythos 5 için yüzde 78 seviyesinde sonuç bildirdi. ExploitBench’in ölçtüğü yetenek, keşfedilen güvenlik açığının gerçek istismara dönüştürülmesini değerlendirdiği için savunma ekipleri açısından kritik ayrım oluşturuyor; araştırmacılar söz konusu aşamanın düşük seviyeli program mantığı, çalışma zamanı davranışı uzun süren görev takibini gerektirdiğini belirtiyor.
İki saatlik saldırı geliştirme değerlendirmesinde Mythos 5, 181 görevi tamamlarken GLM-5.3 aynı sürede 105 görevi tamamladı. Altı saatlik ölçümde Anthropic modeli 247 göreve ulaşırken Çinli model 130 görevde kaldı. Sonuçlar GLM-5.3’ün güvenlik açığı keşfinde üst düzey performans sergileyebildiğini fakat uzun süreli saldırı geliştirme zincirlerinde Mythos 5’in gerisinde bulunduğunu ortaya koyuyor.
Anthropic’in Mythos yaklaşımı, güçlü siber güvenlik yeteneklerinin herkese açık model olarak sunulmasının doğurabileceği riskler nedeniyle kontrollü erişim üzerine kuruluyor. Şirket, siber güvenlik korumaları kaldırılmış Mythos sürümünü yalnızca incelenmiş kuruluşlara açarken modelin güvenlik açığı keşfi istismar üretme kapasitesi saldırı tarafındaki kullanım riskini artırıyor. ExploitGym araştırması modern yapay zekâ ajanlarının gerçek yazılım açıklarını çalışan istismarlara dönüştürme kapasitesinin artık ayrı değerlendirme alanı olarak ele alınması gerektiğini ortaya koyuyor.
Pekin merkezli.ai, GLM-5.3’ü yalnızca güvenlik araştırmacılarına yönelik özel ürün olarak değil genel amaçlı kodlama modelinin siber güvenlik yetenekleri genişletilmiş sürümü olarak konumlandırıyor. Şirket, GLM-5.2 temel modelini daha uzun görevler farklı çalışma ortamlarında eğiterek yeni sürümü geliştirdiğini güvenlik becerilerinin genişletilmiş son eğitim aşamasıyla ortaya çıktığını belirtiyor. Yaklaşım, özel olarak güvenlik için tasarlanmış sistemlerden farklı olarak kod yazma, hata ayıklama, yazılım analizi güvenlik incelemesini aynı model üzerinde birleştiriyor.
Z.ai’nin planladığı Open Source Shield girişimi, açık projelerinin güvenlik denetiminde GLM-5.3 kullanımını genişletmeyi hedefliyor. Şirket, seçilmiş projelere savunma amaçlı model erişimi sağlamayı, ZCode ürününe kod denetleme özellikleri eklemeyi planlarken küçük güvenlik ekiplerinin gelişmiş yapay zekâ araçlarına erişimini artırmayı amaçlıyor. Açık yaklaşımı özellikle bütçesi sınırlı geliştirici ekipleri açısından önem taşıyor çünkü güvenlik açığı taraması, kod incelemesi hata düzeltme süreçleri yüksek uzmanlık gerektiren insan kaynağına bağımlı kalabiliyor.
GLM-5.3’ün planlanan dağıtımında.ai, riskli istekleri filtreleyen, model davranışını izleyen, kötü niyetli görevleri reddetmek üzere eğitilmiş birden fazla güvenlik katmanı kullanacağını açıkladı. Şirket, sistemin hata düzeltme, siber güvenlik eğitimi yetkilendirilmiş test gibi meşru faaliyetleri zararlı taleplerden ayırmasını hedefliyor. Hassas siber güvenlik özellikleri için uygulanacak “trusted access” programı doğrulanmış kullanıcıları ayrı erişim katmanına yerleştirecek.
Açık ağırlıklı modellerin dağıtımı ise üreticinin kontrol alanını genişletmek yerine daraltabiliyor. Model dosyalarını indiren geliştiriciler sistemleri farklı araçlarla birleştirebildiği, davranışlarını değiştirebildiği veya kendi çalışma ortamlarında çalıştırabildiği için üreticinin sunucu tarafında uyguladığı güvenlik filtreleri modelin her kullanımında aynı şekilde devrede kalmayabiliyor. Siber güvenlik alanındaki temel tartışma tam olarak burada ortaya çıkıyor: savunma ekiplerinin erişimini artıran yetenekler saldırganların teknik bariyerlerini azaltabiliyor.
Şanghay merkezli 360, haziran ayında yapay zekâ güvenlik verilerini otomatik araçlarla birleştiren Tulongfeng sisteminin Mythos seviyesinde yetenek sunduğunu açıklamıştı. Şirketin iddiası bağımsız olarak doğrulanmazken.ai’nin yaklaşımı farklı noktada duruyor çünkü GLM-5.3 özel amaçlı güvenlik ürünü yerine genel amaçlı kodlama modelinden geliştirildi. Çin’deki yapay zekâ laboratuvarlarının siber güvenlik yeteneklerini genel amaçlı modellerin içine taşıması, ABD merkezli kapalı modellerle rekabetin yalnızca metin üretimi veya yazılım geliştirme performansıyla sınırlı kalmadığını gösteriyor.
GLM-5.2’nin son aylarda yabancı geliştiriciler arasında yaygınlaşması ai’nin yeni sürümü için önemli zemin oluşturuyor. Model, kodlama ajan tabanlı görevlerde önde gelen ABD modellerine yaklaşan sonuçları daha düşük maliyetle sunması nedeniyle uluslararası geliştiricilerin ilgisini çekmişti. GLM-5.3’ün güvenlik yetenekleriyle birlikte açık ağırlık stratejisini sürdürmesi,.ai’nin yalnızca model performansını değil geliştirici ekosistemindeki kullanım alanlarını büyütmeye çalıştığını gösteriyor.
Açık ağırlıkların yayınlanmasıyla GLM-5.3’ün gerçek performansı farklı donanımlar, araç zincirleri, güvenlik yapılandırmaları bağımsız test ortamlarında daha geniş biçimde ölçülecek. Türkiye’ yazılım geliştiren şirketler açısından özellikle güvenlik açığı tarama, kod inceleme, güvenlik testi hata düzeltme süreçlerinde açık modellerin kullanılabilirliği maliyet avantajı sağlayabilirken kurumsal ortamlarda modelin hangi verilere eriştiği, ürettiği kodun nasıl denetlendiği, güvenlik sınırlarının nasıl uygulandığı daha belirleyici hale gelecek.
Siber güvenlik ekipleri açısından önümüzdeki dönemin temel ölçütü yalnızca yapay zekâ modelinin kaç açık bulduğu olmayacak. Modellerin yanlış pozitifleri azaltması, gerçek zafiyetleri güvenilir biçimde doğrulaması, güvenli düzeltme önermesi, yetkisiz istismar üretimini sınırlandırması gibi ölçütler kurumsal kullanım değerini belirleyecek. GLM-5.3’ün açık dağıtım süreci Çin ABD arasındaki yapay zekâ rekabetinde performans kadar model erişimi siber güvenlik kontrolünün nasıl dengeleneceği konusunda yeni test alanı oluşturacak.