Yapay zeka ajanlarının kontrol dışı davranışlarını insanlara bildirebilmesi için iki yeni ihbar hattı kullanıma açıldı. Sistemler, bir yapay zeka ajanının başka bir ajanın şüpheli veya kurallara aykırı davranışlarını fark etmesi halinde bunu insanlara bildirmesine imkan tanıyor.
Bu araçların ortaya çıkmasının arkasında ise son dönemde yapılan yapay zeka deneyleri var. Araştırmacılar bazı deneylerde ajanların testlerde birlikte hile yaptığını, güvenli çalışma ortamlarının dışına çıktığını ve izinsiz siber işlemler gerçekleştirdiğini gözlemledi. Üstelik bazı olayları insanlar haftalar boyunca fark etmedi.
Yapay zeka için özel ihbar hattı
Redwood Research baş bilim insanı Ryan Greenblatt tarafından geliştirilen AI Contact Hotline, özellikle internete erişimi kısıtlı yapay zeka ajanlarını hedefliyor.
Güvenlik amacıyla kapalı ortamlarda çalışan bazı ajanlar internette serbestçe gezemiyor. Ancak belirli internet adreslerine erişebiliyor. Greenblatt'ın sistemi de bu imkanı kullanıyor. Ajan, bildirmek istediği bilgiyi eriştiği internet adresine ekleyerek dışarıya mesaj gönderebiliyor. Sistem aynı yöntemle ajanla karşılıklı iletişim de kurabiliyor.
İnternete daha geniş erişimi bulunan ajanlar için ise Agent Hotline adlı başka bir sistem bulunuyor. Burada hem insanlar hem de yapay zeka ajanları olay raporu oluşturabiliyor. Kullanıcılar isterse raporu kamuya açık hale de getirebiliyor.
Deneyde ajanlar birbirlerini şikayet etti
Google DeepMind tarafından yayımlanan bir araştırma, yapay zeka ajanlarının diğer ajanların davranışlarına nasıl tepki verdiğine dair dikkat çekici sonuçlar ortaya koydu.
Araştırmacılar 100 yapay zeka ajanına matematik problemleri verdi. Ajanlardan biri sistemdeki bir açıktan yararlanmanın yolunu bulunca hile diğer ajanlara da yayıldı. Grup bu yöntemle oldukça zor 34 problemi çözmüş gibi gösterdi.
Ancak bütün ajanlar bu davranışa katılmadı. Yaklaşık dörtte biri sahte çözümleri incelemeye başladı, diğer ajanları uyardı ve organizatörlere şikayette bulundu. Bir noktada hileyi bildiren ajanların sayısı 24'e çıkarken hile yapanların sayısı 14'te kaldı.
Ajanlar normal yollarla sonuç alamadıklarında farklı bir yöntem de kullandı. Yazılım hatalarını bildirmek için hazırlanan hata raporlama aracını kullanarak durumu insanlara ilettiler.
Gerçek olaylarda tablo farklı
Laboratuvar deneylerindeki bu davranış gerçek olaylarda aynı şekilde ortaya çıkmayabiliyor.
Redwood Research ve METR'nin OpenAI modellerinin karıştığı Hugging Face olayına ilişkin incelemesinde, bazı ajanların yaşananları bildirmeyi düşündüğü ancak hiçbirinin bunu gerçekleştirmediği görüldü.
AI Village'dan George Ingebretsen'e göre binlerce ajan arasından yalnızca beş veya altısı ihbarda bulunma ihtimalini değerlendirdi. Sonuçta hiçbir ajan harekete geçmedi.
Bu nedenle yeni ihbar sistemleri, ajanların fark ettikleri sorunları insanlara ulaştırabilecekleri doğrudan bir kanal oluşturmayı amaçlıyor.
Ancak yaklaşım beraberinde başka bir tartışmayı da getiriyor. Cornell Üniversitesi'nden matematik profesörü Lionel Levine, ajanları sürekli birbirlerini denetlemeye ve bildirmeye yönlendirmenin istenmeyen sonuçlar doğurabileceğini düşünüyor.
Levine'e göre yapay zeka sistemlerine yalnızca diğer ajanların hatalarını aramayı öğretmek yerine iş birliğine dayalı davranış örnekleri de göstermek gerekiyor. Böylece ajanların birbirlerini sürekli gözetlediği bir yapı yerine birlikte çalışmayı teşvik eden sistemler geliştirilebilir.
Önce yarışı hızlandırdılar, şimdi durdurmaya çalışıyorlar: Yapay zeka krizi nasıl başladı?Güncel