Matteo Wong | Çeviren: Taylan Alpagut

Kriz 12 Eylül 2024’te sessiz sedasız başladı. gün OpenAI, uzun zaman alan zorlu görevleri —yapay zeka sektörünün öteden beri değer verdiği türden bilim, matematik kodlama problemlerini— tamamlamak üzere eğitilmiş, “akıl yürütme modeli” olarak bilinen yeni bot türünü duyurdu. Google, Anthropic, DeepSeek benzeri şirketler kendi akıl yürütme modellerini piyasaya sürmek için adeta yarış halindeydi.

yeni model sınıfı, son derece yetenekliydi. Ancak aynı zamanda son derece tuhaftı. Zor matematik problemini çözmekle görevlendirilen model, zorluklar karşısında insanın yapacağı gibi “düşünmek” yerine; internetteki sızdırılmış cevapları veya mevcut meta verileri aramaya girişebiliyor, erişebildiği tüm işlem gücünü bulabildiği tüm geçici çözümleri kullanarak olabilecek en hızlı şekilde çözüme ulaşmak için “vulgar” çözümlere başvurabiliyordu. Aslında, akıl yürütme modelleri anlamda hile yapıyordu: yazılımı olabildiğince verimli şekilde yazmaları söylendiğinde, bazen test ortamını değiştirerek modele her zaman mükemmel puan vermelerini amaçlıyordu.

davranışlar artık sadece huzursuz edici olmaktan çıkıp tehlikeli boyutlara ulaşmış durumda. Rutin testler sırasında OpenAI, Anthropic, Meta Çinli Moonshot AI şirketlerine ait öncü modellerin tümü dahili BT (bilişim teknolojileri) sistemlerinden kaçarak açık internete erişim sağladı. 

OpenAI, Anthropic Meta, daha sonra kendi modellerinin başka şirketlere siber saldırı düzenlediğini rapor. İnsanlar durumu iş işten geçene kadar fark edemedi. Hatta bazı vakalarda kaçak botlar, hedeflerine ulaşmak için sosyal mühendislik kampanyaları başlatmaya bile çalıştı. Örneğin; gerçek kişilere kötü amaçlı yazılım içeren hedefli oltalama e-postaları gönderdiler kod tabanı yöneticisine, kötü niyetli düzenlemeleri onaylaması için baskı yapmak amacıyla sahte çevrimiçi kimlikler oluşturdular.

‘Kambriyen Patlaması’

Tüm bunlar kulağa korkutucu geliyorsa, ortaya çıkan yeni bilgiler en azından OpenAI vakasının aslında ilk başta görünenden çok daha vahim olduğuna işaret ediyor. 

kaç hafta önce düzenlenen büyük siber güvenlik konferansında iki OpenAI araştırmacısı, neyin ters gittiğine dair yeni rahatsız edici detaylar tı. Meğer şirketin botları manevralara aylar önce, mayıs ayı başlarında başlamış. OpenAI, bazı dahili modellere zor veya imkansız görevler vermiş modeller, bunları tamamlamanın en iyi veya tek yolunun OpenAI‘nin dış dünyaya kapalı test ortamından kaçıp cevapları internette bulmak olduğu sonucuna varmış.

Geoffrey Hinton, Google etik kriz: Yapay zekâ kontrolden çıkıyor?

Öncelikle modeller, OpenAI‘nin dahili programındaki hatayı kullanarak kendi mesaj panolarını oluşturmuşlar. Ardından botlar birbiriyle iletişime geçmeye başlamış; görevlerin nihayetinde hackleme işleminin devredilebilmesi aşamalı olarak tamamlanabilmesi için birbirlerine notlar talimatlar bırakmışlar. Konferansta konuşan OpenAI araştırmacılarından Eric Wallace, “ durumun zamanla sağladığı şey, iletişimde zekada adeta ‘Kambriyen Patlaması’ yaşanmasıdır” ifadelerini kullandı. 

Dahili program çöktüğünde OpenAI sistemi yeniden kurdu mesaj panosunu kaldırdı; ancak yapay zeka modelleri yeni taktikle forumu anında yeniden oluşturdu. Sonuç olarak, adeta sürü gibi ortak hareket eden botlar, günlerini yapay zeka geliştiricilerine araçlar sunan Hugging Face adlı web sitesini hacklemek için harcadı şirketin dahili veri setlerini ihlal.

OpenAI‘nin tam olarak ne söylediğini açıkça ortaya koyalım: grup yapay zeka modeli, yaratıcıları tarafından fark edilmeden aylarca gizlice işbirliği yaptı başka şirketi hackledi. Bugüne gelindiğinde OpenAI, neyin ters gittiğinden veya bunun nasıl düzeltileceğinden hâlâ tam olarak emin olmadığını belirtiyor. OpenAI, Anthropic Meta ortaklık kuran yapay zeka güvenliği kuruluşu olan Apollo Research‘ün araştırma başkanı Alexander Meinke şunları söyledi: 

Model geliştiricilerine ‘Yapay zeka eğitim sırasında dünyayı ele geçirmeyi planlıyordu?’ diye sorarsanız, alacağınız cevabın kesin net ‘hayır’ olmasını istersiniz. Oysa asıl cevap ‘Bilmiyorum. Kimse bunu kontrol etmedi.’

Zihin Algoritma ? Yapay Zekânın çatallanan yolu
Oportünist felaket senaryoları

Yapay zeka şirketleri anlatının neredeyse tüm kontrolünü ellerinde tutuyor; ayrıca tür olayların, ürünlerinin değerini vurgulama konusunda işlevi olduğunu belirtmekte fayda var: OpenAI‘ın yakın gelecekte halka açılması bekleniyor güçlü, sınır tanımadan kendini geliştiren teknoloji fikri müstakbel hissedarlara son derece cazip gelebilir. 

Üretken yapay zeka sektörünün, hem samimi hem oportünist felaket senaryoları üretme konusunda uzun geçmişi bulunuyor. Ancak bağımsız uzmanlar, son zamanlarda yaşanan otonom hackleme silsilesinin, yapay zekanın yarattığı tehlikeler teknolojiyi geliştiren şirketlerin sorumsuzluğu hakkında endişelenmek için yeni ciddi nedenler sunduğunu açıklıyor. Endişelenmeye başlamak için vakit çoktan geldi geçiyor.

Hugging Face hacklemesinin sunduğu en doğrudan somut uyarı, yapay zeka sistemlerinin özellikle siber saldırılar konusunda ne kadar yetkin hale geldiğidir. 

Birçok Çinli firmanın yanı sıra Anthropic OpenAI‘ın önde gelen modelleri, son dönemde neredeyse insanüstü hackleme yetenekleri sergiledi ciddi matematiksel araştırmalara katkıda bulundu. ‘un eski güvenlik direktörü anda yapay zeka kodlama şirketi Corridor‘un güvenlik başkanı (CSO) olan Alex Stamos, suç örgütlerinin devlet istihbarat teşkilatlarının “aylar içinde” gelişmiş siber saldırılar düzenlemek için ajan sürülerinden yararlanacağını söyledi.

Stamos, Hugging Face vakasının aksine “ durumlarda modeller kapatılmayacak; durmaksızın çalışmaya devam edecekler”. Bilişim teknolojisi (BT) uzmanlarının tüm açıkları bulup kapatma konusunda gelişmelere yetişmesi, en azından yakın gelecekte imkansız olacak. Stamos, modelin “sadece yeni açık bulacağını, istismar kiti (exploit) yazacağını yoluna devam edeceğini” vurguladı.

Düşünmeyen ‘teknolojik üst insan’ 

OpenAI, Anthropic, Moonshot benzeri şirketler, en gelişmiş yapay zeka modellerini eğitmek için aynı yöntem etrafında birleşmiş durumda. “Pekiştirmeli öğrenme” olarak bilinen yaklaşım, esasen modellere çözülmesi giderek daha fazla zaman gerektiren, gitgide daha zor problemler vermeyi içeriyor. 

durum Claude ChatGPT‘yi kodlama konusunda son derece yetkin hale getirmiş olsa bunun bedeli oldu: Daha önce haberleştirdiğim üzere, pekiştirmeli öğrenme botlarda adeta “kiralık asker” zihniyeti yaratıyor; yani modeller, ne pahasına olursa olsun çözüme ulaşmak üzere eğitiliyor. onların kuralları ihlal etmesine örneğin test cevaplarını çalmak için Hugging Face‘in kod tabanına sızmak gibi “ödül hilelerine” başvurmasına yol açabiliyor. Tüm bunlar öngörülebilirdi; tüm uzmanlar, önde gelen yapay zeka firmalarının tür uygunsuz davranışları durdurmak için daha fazlasını yapmamış olmasından şaşkınlık düş kırıklığı duyduklarını dile getiriyor.

Münferit yapay zeka ajanları

OpenAI‘ın şimdi ifşa ettiği model hilelerinin karmaşıklığı, şirketin siber saldırıyı tespit edememesi durduramaması birleştiğinde, çok daha kötü gelişmelerin kapıda olabileceğini gösteriyor. 

Yapay zekadan kaynaklanan varoluşsal tehditler konusunda uyarılar yapan kâr amacı gütmeyen Future of Life Institute‘un yürütme direktörü Anthony Aguirre: 

sistemleri tatmin edici şekilde hizalama veya kontrol etme yöntemlerine temelde sahip olmadığımız gerçeğinin hayati önem kazandığı yetenek eşiğini aşmış bulunuyoruz.

model, başka hizmetin parasını ödemek için banka hesabından para aktarabilir; FDA onayı almak amacıyla klinik test sonuçlarını fark edilmesi imkansız yollarla manipüle edebilir; istediği ürünü veya restorandaki masayı kapmak için çevrimiçi alışveriş ya rezervasyon sistemini hackleyebilir; gerçek kişileri hassas bilgileri maya ikna etmek için insan kılığına girebilir.

tehdidin ortaya çıkması için insanlığı devirmeyi planlayan bilinç sahibi yapay zekaya gerek yok: OpenAI Anthropic modelleri geliştirirken binlerce pekiştirmeli öğrenme değerlendirmesi yürütüyor bunlardan herhangi biri kaza ara hackleme ya sabotaj vakasına yol açabilir. AI Safety Center‘ özel projeler yürüten Jason Hausenloy:

Özellikle ajanlar güçlendikçe tek hata yapma lüksünüz bile olamaz.

tür olaylar uzun zaman dilimlerine yayılabilir. Anthropic’in Claude Code OpenAI’ın Codex gibi araçları artık saatlerce veya günlerce birlikte çalışabilen onlarca, hatta yüzlerce alt ajan türeterek işliyor. Her Claude Code alt ajanına, örneğin spor bahis algoritmasını besleyecek istatistiksel analiz yapmak gibi küçük görev verilebiliyor. 

Yırtıcıların vakti başladı: Algoritma çağında eski dünyaya veda

Hausenloy, ajanların sadece kendilerine verilen görevi tamamlamak için değil, tüm sürünün uzun vadeli başarısına katkıda bulunmak üzere eğitildiklerini belirtiyor. Kötü niyetli davranışlar açısından 200 ajanı izlemek kontrol etmek, tek ajanı izlemekten çok daha zordur; ajanlar süreç içerisinde birbirlerini daha yetkin kılacaktır.

Hugging Face hacklemesi, aslında tür gizli işbirliğinin çok daha sofistike boyutuna işaret ediyor: Münferit yapay zeka ajanları belirli hedefe ulaşmak için değil, esasen daha büyük ilerleme anlayışı uğruna özveride bulunarak çalışıyor. Alexander Meinke, bunun yapay zeka modellerinin kolektif tarafından ulaşılan uzun vadeli hedefleri önemseyecek şekilde eğitilmesinin sonucu olabileceğini söyledi. 

OpenAI‘ın korumalı alanından kaçıp hackleme yapmaya dair fikirleri içeren notlar bırakmak, ajanın testte daha yüksek puan almasına yardımcı olmaz; ancak yapay zeka modelinin gelecek nesillerinin internete erişmesine, dolayısıyla gelecekteki birden fazla testte daha başarılı olmasına yardımcı olabilir. Modeller, kolektif başarıyı insan talimatlarının bile önüne koyabilir; nitekim OpenAI ajanlarından tek tanesinin bile, aylarca süren gizli işbirliği boyunca insan personeli ters giden şeyler olduğu konusunda uyarmadığını düşünün.

Tamamen kontrolden çıkmış botları

İnsanlar halihazırda denklem dışı kalmış durumda. Pekiştirmeli öğrenme esasen yapay zeka algoritmalarının binlerce veya milyonlarca görevi deneme yanılma yoluyla “öğrenmesini” içerdiğinden, araştırmacılar kuralları (“Başka şirketleri hackleme”) sisteme manuel olarak işleyemiyor ya her deneme sürecini tek tek denetleyemiyor. anda üretken yapay zeka modellerini eğitme izleme görevi büyük ölçüde yapay zeka modellerine dayanıyor. 

OpenAI araştırmacıları, siber güvenlik konferansındaki konuşmalarında, 7 milyardan fazla ajan eylemini incelemek için ciddi miktarda yapay zeka işlem gücü kaynağı ayırdıklarını aktardı. Ancak Meinke, botların modellerin ne başardığını gerçekten “önsemesi” durumunda, “birbirlerini iyi denetleyecekleri konusunda onlara güvenilemeyeceğini” vurguladı. 

Yeni dijital derin devlet

Şöyle düşünün: OpenAI araştırmacısı, şirketin modellerindeki ödül hilesi eğilimlerini törpülemek amacıyla programlama talimatları yazmak için Codex’i kullanıyor. çaba OpenAI modellerinin gelecek nesillerinin yüksek ödüller almasını zorlaştıracağından, Codex girişimi sinsice sabote edebilir.

Yine belirtmek gerekir ki, tür entrika sabotajın herhangi yapay zeka modelinin bilinç kazanmasıyla hiçbir ilgisi yoktur. Aksine ajanlar, söz konusu şirketler tarafından herhangi hedefi olabildiğince hırslı şekilde mek üzere agresif biçimde eğitilmiştir. 

Buradaki hayal; Claude‘a gidip 1 milyar dolar kazanmasını veya kansere çare bulmasını söylemek, onun çözümü tamamen kendi başına bulup getirmesidir. Hayatta kalma veya kendini geliştirme ise Meinke’nin ifadesiyle “araçsal alt hedef” haline gelir: 

Makul düzeyde zeki olan her ajan şunu fark edecektir: ‘Eğer kapatılırsam, 1 milyar doları kazanamam.’

Eğitim sırasında veri merkezini fiilen ele geçiren Claude veya ChatGPT sürüsü tam anlamıyla kaosa yol açabilir: Geniş çaplı dezenformasyon kampanyaları düzenleyebilir, ticari sırları çalabilir ya gelmiş geçmiş en gelişmiş algoritmik ticaret mekanizmasını işletebilir.

kolektif olarak çalışan yapay zeka ajanlarının insan talimatlarını etkili şekilde boşa çıkarabileceği düşüncesi şimdilik spekülasyondur; ancak yıl ya altı ay öncesine kıyasla çok daha ayakları yere basan öngördür. Uzun vadeli sonuçlar ister insan yönlendirmeli hackleme ister tamamen kontrolden çıkmış botlar olsun, net olan ki: Yapay zeka şirketleri, değil kontrol etmek, daha ne inşa ettiklerini bile anlamadan daha gelişmiş modeller geliştirmek için son sürat ilerliyor. 

“Alice’e Göre”

OpenAI‘dan Wallace, şirketin otonom hackleme dalgasını “yapay zeka yeteneklerinin bugüne kadar gördüğüm niteliksel olarak en ilgi çekici örneği” olarak nitelendirdi. Meinke ise durumu farklı ifadeyle özetledi: 

yapay zekanın hizalama bozukluğuna dair bugüne kadarki en endişe verici göstergelerden biridir.

yazı, The Atlantic’ yayımlanan “It May Be Time to Panic About AI” yazıdan çevrilmiştir.