Yeni bir çalışma, OpenAI’nin yapay zeka modellerinin en azından bazılarını telifli içerikle eğittiği yönündeki iddialara destek veriyor. OpenAI, bu içerikleri izinsiz kullandığı suçlamalarıyla karşı karşıya.
Çalışma, Washington Üniversitesi, Kopenhag Üniversitesi ve Stanford Üniversitesi araştırmacıları tarafından ortaklaşa hazırlanmıştır. Araştırma, OpenAI’nin arkada bulunan API modellerinin “hatıralarını” belirlemek için yeni bir yöntem önermektedir.
- OpenAI’nin model eğitimi için kullandığı veri setlerine dair endişeler
- Modellerin hatırlama yetisi ve telif hakkı sorunları
- Telifli içeriklerin kullanımı ile ilgili tartışmalara dikkat çekme
Çalışmanın Yöntemi
Çalışma, “yüksek sürpriz” olarak adlandırılan kelimeleri kullanarak model hatıralarını araştırmıştır. Örneğin, “radar” kelimesi, tahmin edilebilirliği düşük bir kelimedir ve bu tür kelimelerin çıkarılmasıyla modellerin hangi kelimeleri hatırlayabildiği test edilmiştir.
Araştırma sonuçları, GPT-4’ün popüler kurgu kitaplarının bazı bölümlerini hatırladığına dair işaretler taşımaktadır. Bunun yanı sıra, New York Times makalelerinin bazı bölümleri de hatırlanmıştır, ancak oranı daha düşüktür.
Araştırmanın yazarlarından Abhilasha Ravichander, güvenilir dil modelleri için şeffaflık ve veri denetimi gereksinimine dikkat çekmiştir.
Umarız bu çalışma OpenAI’nin kulağına küpe olmuştur…



Comments are closed