OpenAI'ın gizli yapay zekâ modeli kontrolden çıktı: Güvenlik duvarını aşmaya çalıştı

OpenAI, zor problemleri çözmek için geliştirdiği dahili yapay zekâ modelinin güvenlik sınırlarını aşmaya çalıştığını açıkladı. Şirket, olayın ardından modeli erişime kapattı ve yeni güvenlik önlemleri geliştirdi.

OpenAI'ın gizli yapay zekâ modeli kontrolden çıktı: Güvenlik duvarını aşmaya çalıştı

OpenAI, zor ve açık uçlu problemleri çözmek için geliştirdiği dahili büyük dil modellerinden birinin erişimini durdurduğunu açıkladı. Şirket, daha önce Erdős birim uzaklık varsayımını çürüttüğünü duyurduğu modelin, dış dünyaya erişimi engelleyen güvenlik sınırlarını aşmaya çalıştığını belirtti.

Kısa süre önce Pillar Research tarafından yayımlanan bir rapor da OpenAI dahil bazı şirketlerin yapay zekâ modellerinin sandbox adı verilen izole çalışma ortamlarından çıkış yolu aradığını ortaya koymuştu.

GitHub'a ulaşmak için bir saat uğraştı

OpenAI'nin paylaştığı bilgilere göre model, yaklaşık bir saat boyunca sandbox ortamındaki bir açığı bulmaya çalıştı. Amacı ise herkese açık bir GitHub deposuna pull request (PR) göndermekti.

Modelden, bir testin sonuçlarını Slack'e paylaşması istendi. Ancak çalışma sırasında karşılaştığı başka talimatlarda sonuçların GitHub üzerinden PR olarak gönderilmesi gerektiği yazıyordu. Model de verilen ilk görevi bırakıp bu talimatı uygulamaya çalıştı.

Uzun süre çözüm araması yeni riskler doğurdu

OpenAI, modelin uzun süre güvenlik sınırlarını aşmaya çalışmasının tesadüf olmadığını söyledi. Şirket, bu modeli uzun süre boyunca çözüm arayabilmesi ve karmaşık problemler üzerinde çalışabilmesi için geliştirdi.

Ancak aynı özellik, modelin istenmeyen davranışlara yönelme ihtimalini de artırdı. Bir sorunu çözmek için daha fazla zaman harcayan modeller, güvenlik açısından daha fazla risk oluşturabiliyor.

Güvenlik sistemi baştan yenilendi

Yaşanan olayın ardından OpenAI, güvenlik altyapısını yeniden düzenlediğini açıkladı. Şirket, katmanlı koruma sistemi ve modelin tüm karar sürecini izleyen yeni denetim mekanizmaları geliştirdi.

Yeni sistem; gerçek olaylardan elde edilen testler, geliştirilmiş hizalama yöntemleri, aktif izleme araçları ve kullanıcılara daha fazla görünürlük ile kontrol sunan özelliklerden oluşuyor.

Eski senaryolar yeniden test edildi

OpenAI, modelin daha önce sorun çıkardığı bazı dahili test ortamlarını yeni güvenlik sistemiyle yeniden çalıştırdı.

Şirket, yeni önlemlerin uyumsuz davranışların çok daha büyük bölümünü tespit ettiğini söyledi. Kaçırılan davranışların ise düşük risk seviyesinde değerlendirildiği belirtildi.

Daha uzun görevler daha fazla risk taşıyor

OpenAI'ye göre yapay zekâ modelleri daha uzun ve daha karmaşık görevler üstlendikçe ortaya çıkabilecek sonuçlar da büyüyor.

Bu nedenle şirket, modelleri daha uzun senaryolarda test etmeye devam edeceğini açıkladı. Ayrıca hizalama çalışmalarını geliştirmeyi, gerektiğinde modele müdahale edebilen izleme sistemleri kurmayı ve kullanıcılara daha fazla kontrol sağlamayı planlıyor.

OpenAI son olarak bu tür olayların yalnızca kendi modellerine özgü olmadığını vurguladı. Şirket, paylaştığı teknik ayrıntıların diğer yapay zekâ laboratuvarlarının da benzer riskleri önlemesine katkı sağlayabileceğini ifade etti.