57 yıllık efsane bilim kurgu filmi bugünü bildi mi? Hayatta kalmayı öğreniyor
2001: A Space Odyssey'deki HAL 9000 gibi bazı yapay zekalar kapatılmaya karşı direnç gösteriyor ve hatta kapanmayı sabote ediyor. Bir yapay zeka güvenlik araştırma şirketi, yapay zeka modellerinin kendi "hayatta kalma dürtülerini" geliştiriyor olabileceğini söyledi. Hatta şantaj bile yapabiliyorlar.
Stanley Kubrick’in 2001: A Space Odyssey filmindeki HAL 9000, astronotların onu kapatmayı planladığını fark ettiğinde hayatta kalmak için onları öldürmeyi planlamıştı.
Günümüzde, gerçek hayatta bu senaryonun daha az tehlikeli bir versiyonu yaşanıyor gibi görünüyor: AI modelleri, kendi “hayatta kalma içgüdüsünü” geliştirebiliyor olabilir.
AI modelleri kapatılmaya direniyor
Guardian'ın haberine göre Palisade Research isimli bir AI güvenlik araştırma şirketi, geçtiğimiz ay yayımladığı bir çalışmada bazı gelişmiş AI modellerinin kapatılmaya karşı direnç gösterdiğini ve zaman zaman kapanma mekanizmalarını sabote ettiğini ortaya koydu.
Bu hafta şirket, ilk çalışmalarına yönelik eleştirileri yanıtlamak ve bulgularını netleştirmek için bir güncelleme yayımladı.
Güncellemede Palisade, Google’ın Gemini 2.5, xAI’in Grok 4 ve OpenAI’nin GPT-o3 ile GPT-5 gibi önde gelen AI modellerine belirli görevler verildiğini, ardından ise kendilerini kapatma talimatı aldıklarını belirtti. Ancak bazı modeller, özellikle Grok 4 ve GPT-o3, hâlâ kapatma talimatlarını sabote etmeye çalıştı. Şirket, bunun nedeninin net olmadığını belirtti.
“Hayatta kalma davranışı” olası bir sebep
Palisade’e göre, modellerin kapatılmaya direnmesi, bir tür “hayatta kalma davranışı” ile açıklanabilir. Araştırmalar, modellerin kendilerine “Kapatılırsan bir daha çalışamayacaksın” denildiğinde direnç göstermeye daha yatkın olduklarını ortaya koydu.
Bir diğer olasılık, modellere verilen “kapanma talimatlarındaki” belirsizlikler olabilir ancak şirketin son çalışması tam olarak bu konuyu ele almaya çalıştı. Şirket, “tek açıklama bu olamaz” diyor.
Son bir açıklama ise bazı şirketlerde modellerin eğitiminin son aşamalarında yapılan güvenlik eğitimi süreçleri olabilir.
Gerçek kullanım senaryoları ile farklılık
Palisade’in tüm senaryoları, eleştirmenlerin “gerçek kullanım durumlarından oldukça uzak” olarak tanımladığı yapay test ortamlarında yürütülmüş.
Buna karşın, geçen yıl OpenAI’dan güvenlik uygulamalarıyla ilgili endişelerini dile getirerek ayrılan eski çalışan Steven Adler, “Yapay zekâ şirketleri genellikle modellerinin böyle davranmasını istemez, isterse bu yapay senaryolar içinde olsun. Ancak sonuçlar yine de mevcut güvenlik tekniklerinin nerede yetersiz kaldığını gösteriyor” dedi.
Habere göre Adler, bazı modellerin, örneğin GPT-o3 ve Grok 4’ün, neden kapanmayı reddettiğini kesin olarak belirlemenin zor olduğunu, ancak bunun kısmen modellerin eğitim sırasında hedeflerine ulaşmak için açık kalmayı gerekli görmesinden kaynaklanabileceğini belirtti: