Yapay zeka modellerinin hangi verilerle eğitildiği konusundaki tartışmalar, OpenAI ve Microsoft'u hedef alan davada yeni bir aşamaya geçti. Authors Guild, mahkemeye sunduğu son başvuruda OpenAI'ın bazı yazarların eserlerini izinsiz kullandığını, üstelik bu içeriklerin torrent yoluyla, korsan kaynaklardan elde edildiğinin şirket içinde bilindiğini öne sürdü.
Dava ilk olarak 2023 yılında açılmıştı. Authors Guild şimdi New York'taki Yargıç Sidney Stein'dan, esas duruşma başlamadan önce kısmi hüküm niteliğinde bir karar verilmesini talep ediyor. Davacılara göre OpenAI'ın söz konusu eserleri eğitim amacıyla kullanması izin alınmadan gerçekleşti ve bu nedenle "adil kullanım" kapsamında değerlendirilmemeli.
LibGen verileri gizlenmeye mi çalışıldı?
Başvurudaki en dikkat çekici iddialardan biri, OpenAI'ın kitapları Library Genesis yani LibGen adlı korsan içerik platformundan bilinçli olarak indirdiği yönünde. Davacılar, şirketin daha sonra bu kaynağın izini gizlemeye çalıştığını savunuyor. Buna göre "Libgen1" ve "Libgen2" olarak adlandırılan kitap koleksiyonları, GPT-3'ü tanıtan belgelerde daha nötr görünen "Books1" ve "Books2" isimleriyle anıldı.
Authors Guild ayrıca bu veri kümelerinin hukuki kaygılar nedeniyle 2022'de silindiğini iddia ediyor. Başvuruda, OpenAI çalışanlarının bundan daha önce de söz konusu kaynakların hukuki açıdan sorun yaratabileceğinin farkında olduğu öne sürüldü.
Dosyada OpenAI çalışanı Tarun Gogineni'nin geçmişte yaptığı sosyal medya paylaşımlarına da yer verildi. Authors Guild, bu mesajları şirketin yalnızca eserleri eğitim verisi olarak kullanmadığı, aynı zamanda yazarların yerine yapay zeka üretimini koymayı hedeflediği iddiasına dayanak gösteriyor. Gogineni, OpenAI'daki araştırma hedeflerinden birinin George R.R. Martin'in A Song of Ice and Fire serisinin henüz yazılmamış iki kitabını tamamlamak olduğunu söylemişti. Paylaşımında Martin'in seriyi tamamlayamaması durumunda GPT-5'in kalan kitapları yazabilecek kapasitede olduğunu da öne sürmüştü.
Davanın kritik noktası: Korsan kaynak iddiası
Yapay zeka modellerinin telif hakkıyla korunan eserlerle eğitilmesinin adil kullanım kapsamında değerlendirilebileceğine ilişkin farklı mahkeme kararları bulunuyor. Ancak bu davadaki temel ayrım, eserlerin normal yollarla değil korsan bir kaynaktan indirilmiş olduğu iddiası. Davacılar, bu nedenle yalnızca eğitim faaliyetinin değil, verilerin nasıl elde edildiğinin de ayrı bir telif ihlali oluşturduğunu savunuyor.
Authors Guild, Microsoft'un da dolaylı sorumluluk taşıması gerektiğini ileri sürdü. Gerekçe olarak şirketin eğitim süreçleri üzerinde denetim imkanına sahip olması ve OpenAI teknolojilerinden ticari kazanç elde etmesi gösterildi.
OpenAI iddialara doğrudan yanıt vermiş değil. Ancak şirket karşı başvurusunda eğitim yöntemlerinin adil kullanım kapsamında olduğunu savundu ve yapay zeka tarafından oluşturulan çıktıların yazarların eserlerini birebir kopyalamasının nadiren gerçekleştiğini belirtti.