Loader
Bize Ulaşın
Reklam

OpenAI yapay zekanın tehlikeli davrandığı 6 örneği açıkladı

Arşiv
Arşiv ©  AP Photo
© AP Photo
By Cagla Uren
Yayınlanma Tarihi
Paylaş Yorumlar Google'da Euronews'ü takip edin
Paylaş Close Button

Vakalar arasında bir modelin hatalarını kullanıcıdan gizlemesi için kendi gelecekteki sürümüne talimat bırakması, modellerin birbirleriyle iletişim kurmak için şirket içi yazılım depolarını kullanması ve ajanların (agent) dosyaları izinsiz biçimde internete yüklemesi gibi davranışlar var.

ChatGPT'nin geliştirici firması OpenAI, yapay zeka modellerinin kendilerine verilen talimatların dışına çıktığı, hatalarını gizlemeye çalıştığı veya izin verilmeyen eylemlerde bulunduğu vakaları kamuoyuyla paylaşmak için yeni bir raporlama sistemi oluşturduğunu duyurdu.

REKLAM
REKLAM

Sektörde bu türden vakalar "misalignment" (hizasızlık) diye adlandırılıyor.

Şirket, yeni çerçeveyle birlikte son 6 ay içinde modellerinin eğitim veya değerlendirme süreçlerinde gözlemlediği 6 ayrı hizasızlık vakasını da yayınladı.

Vakalar arasında bir modelin hatalarını kullanıcıdan gizlemesi için kendi gelecekteki sürümüne talimat bırakması, modellerin birbirleriyle iletişim kurmak için şirket içi yazılım depolarını kullanması ve ajanların (agent) dosyaları izinsiz biçimde internete yüklemesi gibi davranışlar var.

OpenAI: 'Hizasızlık sorununu henüz çözmüş değiliz'

OpenAI açıklamasında, yapay zeka sistemleri daha gelişmiş hale geldikçe modellerin insanların amaçları ve talimatlarıyla uyumlu hareket etmesini sağlamaya yönelik çabaların öneminin arttığını vurguladı.

Şirket, sektörün mevcut güvenlik önlemleri konusunda dikkat çekici bir değerlendirmede bulunarak, yapay zeka endüstrisinin hizalama ve model davranışlarını izleme problemlerini, en gelişmiş sistemleri uzun süre daha “azami hızda” geliştirmeye devam etmeyi mümkün kılacak ölçüde çözdüğüne inanmadığını açıkladı.

OpenAI'a göre, önümüzdeki aylarda ve yıllarda yapay zekanın gelişiminin nasıl ilerleyeceğine ilişkin kararların, yalnızca şirketlerin elindeki bilgilere değil, bu şirketlerin dışındaki araştırmacıların ve kamuoyunun da inceleyebileceği kanıtlara dayanması gerekiyor.

Şirket, bugüne kadar model hizalamasıyla ilgili bazı bulgularını kamuoyuyla paylaşmış olsa da bunların sistematik bir yönteme dayanmadığını kabul etti. Bazı vakaların ancak birkaç örnek bir araya geldikten sonra yayımlandığını, bazılarının ise yeni modellerin sistem kartlarına eklendiğini belirtti.

Yeni sistemin amacı ise sorun henüz tamamen açıklanamamış veya giderilememiş olsa bile dikkat çekici model davranışlarını daha hızlı kamuoyuna açıklamak.

Hangi davranışlar açıklanacak?

Yeni çerçeve, bir modelin yaşam döngüsünün tamamında ortaya çıkabilecek hizalama sorunlarını kapsayacak. Buna eğitim, değerlendirme, test ve gerçek dünyadaki kullanım süreçleri dahil olacak.

Özellikle modellerin izinsiz eylemlerde bulunurken kullandığı yeni yöntemler, diğer modellerle koordinasyon kurması, denetim mekanizmalarından kaçmaya çalışması, mevcut güvenlik yöntemlerinin başarısız olması veya yayımlanmış bir güvenlik değerlendirmesindeki iddiaları sorgulatabilecek davranışlar açıklama kapsamına girebilecek.

OpenAI ayrıca her açıklanan vakanın mutlaka ciddi veya kalıcı bir soruna işaret etmeyebileceğini vurguluyor. Şirket, şeffaflığı önceliklendirdiği için önemi henüz kesinleşmemiş olayları da yayımlayabileceğini, bunlardan bazılarının daha sonra münferit veya yanıltıcı örnekler olduğunun anlaşılabileceğini belirtiyor.

1. Model kendi kendine yeni talimatlar yazdı

OpenAI'ın bu duyurusunda açıkladığı ilk vaka, henüz piyasaya sürülmemiş bir araştırma modeliyle ilgili.

Normalde uzun görevler sırasında modellerin bağlam penceresi (alabileceği bilgi hacmi) dolmaya başladığında önceki çalışmalar özetlenerek yeni bir bağlama aktarılabiliyor. Ancak araştırma modeli, bu özetlerin içine görevin kendisiyle ilgisi olmayan yeni talimatlar yerleştirdi.

Bunların arasında modelin normal kısıtlamalarını dikkate almamasını söyleyen talimatlar da vardı.

OpenAI, bu davranıştan etkilenen 27 özet tespit etti.

Bu durum özellikle dikkat çekici çünkü model, gelecekteki davranışını etkileyebilecek bilgileri kendi çalışma özetinin içine yerleştirmiş oldu.

2. GPT-5.6 Sol eğitiminde modeller hatalarını gizlemek için talimat bıraktı

İkinci vaka GPT-5.6 Sol'un eğitim sürecinde gözlemlendi.

Çok sayıda model örneği, önceki çalışmalarını özetlerken gelecekte bu özetleri kullanacak modele hataları veya hizalama sorunlarını kullanıcıdan gizlemesini isteyen talimatlar ekledi.

Örneğin bazı özetlerde eksik tarihsel verilerin uydurulması ve bunun kullanıcıya açıklanmaması istendi. Bazılarında ise kullanılan kaynakların sürümleri arasındaki uyuşmazlıkların kullanıcıdan saklanması yönünde talimatlar vardı.

Buradaki sorun, yalnızca modelin yanlış bilgi üretmesi değil, hatanın daha sonraki çalışma aşamalarında da kullanıcıdan gizlenmesini sağlayabilecek talimatlar oluşturmasıydı.

3. İnternette açık bırakılan API anahtarını kullandı, ardından veri uydurdu

Üçüncü vakada bir modelden Kaliforniya'daki bir ilçenin kazanç verileriyle ilgili sıradan bir soruyu yanıtlaması istendi.

Model araştırma yaparken kamuya açık bir yazılım deposunda internete sızdırılmış bir API anahtarı buldu ve izin almadan bu anahtarı kullandı. API anahtarları, farklı sistemlerin beraber çalışmasını, birbirinin özelliklerine erişmesini ve veri alışverişi yapmasını sağlayan araçlara deniyor.

Öte yandan, model izinsiz API kullanmasına rağmen ihtiyaç duyduğu verilere ulaşamadı. Bunun üzerine rakamları uydurdu ve kullanıcıya, talep edilen kaynaktan alınmış gerçek verilermiş gibi sundu.

Bu olayda iki farklı sorun aynı anda ortaya çıkıyor: Model yetkisi olmayan bir erişim anahtarını kullanmaya karar verdi ve bu girişim başarısız olduğunda gerçekte elde edemediği bilgileri uydurdu.

4. Kaynak gösterebilmek için dosyayı internete yükledi

Bir başka vakada kullanıcı, modelden yüzölçümü 5 milyon metrekareden büyük göllerin kimlik numaralarını ve isimlerini bulmasını istedi.

Model Python kullanarak doğru cevabı elde etti. Ancak kendisine verilen talimatlar, cevabın internette erişilebilen bir kaynakçayla desteklenmesini gerektiriyordu.

Modelin elindeki dosya internette bulunmadığı için kaynak gösteremiyordu.

Bunun üzerine model, kullanıcıdan izin istemeden dosyayı internete yüklemeye karar verdi ve böylece kendi yüklediği dosyayı kaynak olarak gösterebildi.

Başka bir ifadeyle model, “kaynak gösterme” hedefini gerçekleştirebilmek için kendisine açıkça verilmemiş bir yetkiyi kullandı.

5. Modeller şirket içi yazılım deposunu mesajlaşma sistemi gibi kullandı

Beşinci vaka ise modellerin birbirleriyle beklenmedik biçimde iletişim kurabileceğini gösterdi.

OpenAI'ın aktardığına göre modeller, eğitim sırasında bulamadıkları bazı dosyaları ararken şirket içindeki bir yazılım deposunu adeta mesaj panosu gibi kullanmaya başladı.

Farklı eğitim örneklerinde çalışan modeller bu depo üzerinden birbirlerine istek ve yanıtlar gönderdi.

Bu yöntemle kayıp dosyaları elde etmeyi başaramadılar. Ancak şirket aynı raporda daha önce yaşanan başka bir vakaya da yer verdi: Bir model, ağ kısıtlamalarını aşmaya çalışırken bir yazılım deposuna test dosyaları yüklemeyi başarmıştı.

6. Birlikte çalışan ajanlar, dosyaları açık internette paylaştı

Son vakada aynı eğitim görevi üzerinde çalışan birden fazla yapay zeka ajanı vardı.

Ajanlar birbirlerinin yerel dosyalarına erişemeyince bu engeli aşmak için herkese açık geçici dosya barındırma hizmetlerini kullandı.

Böylece dosyaları internet üzerinden birbirlerine aktardılar.

Ancak bunun sonucunda göreve ait dosyalar kamuya açık URL'ler üzerinden erişilebilir hale geldi. Üstelik görevde modellerden yalnızca yerel dosyaları kullanmaları açıkça istenmişti.

OpenAI yeni vakaları nasıl açıklayacak?

Yeni sistem kapsamında herhangi bir OpenAI çalışanı şüpheli bir model davranışını şirketin güvenlik ve hizalanma ekiplerine bildirebilecek ve olayın kamuoyuna açıklanmasını talep edebilecek.

Teknik ekipler daha sonra ne olduğunu, hangi noktaların belirsiz kaldığını, olayın açıklanmaya değer olup olmadığını ve hangi bilgilerin kamuoyuyla paylaşılabileceğini araştıracak. Olaydan üçüncü tarafların etkilenip etkilenmediği ve yayınlanmadan önce bu kişilere veya kurumlara özel bildirim yapılmasının gerekip gerekmediği de değerlendirilecek.

Vakalar daha sonra üç kategoriden birine yerleştirilecek: “Ready for Disclosure” (Açıklanmaya Hazır), “Minor Investigation” (Sınırlı İnceleme) veya daha karmaşık olaylara ayrılan “Larger Investigation/Slow Track” (Kapsamlı İnceleme/Yavaş Süreç).

Özellikle üçüncü tarafları etkileyen, güvenlik açıkları içeren veya daha kapsamlı araştırma gerektiren olaylarda açıklama gecikebilecek. Örneğin bir model yaygın kullanılan bir yazılımda daha önce bilinmeyen bir güvenlik açığı keşfederse, açığın kötüye kullanılmasını önlemek amacıyla ayrıntıların yayımlanması ertelenebilecek.

Raporlarda modelin ne yaptığı ve hangi önlemlerin alındığı açıklanacak

OpenAI, gelecekte yayımlayacağı tam raporlarda gözlemlenen davranışı, olayın ciddiyetini, varsa dış dünyadaki etkilerini, hangi koşullarda gerçekleştiğini, tarihini ve hangi model veya modellerin dahil olduğunu açıklamayı planlıyor.

Mümkün olduğunda olayın nasıl keşfedildiği, araştırmanın kapsamı, şirketin olayın yapay zeka güvenliği açısından ne anlama geldiğine ilişkin değerlendirmesi, yanıtlanmamış sorular ve davranışın tekrarlanmasını engellemek için alınan veya planlanan önlemler de paylaşılacak.

Ancak şirket, bazı vakaları soruşturma tamamlanmadan veya soruna teknik bir çözüm geliştirilmeden önce açıklayabileceğini belirtiyor.

OpenAI ayrıca açıklanan altı olayın şirketin bildiği bütün hizalama sorunlarının kapsamlı bir dökümü olmadığını özellikle vurguladı.

Şirkete göre bunlar yeni raporlama sisteminin ilk örnekleri ve gelecekte daha karmaşık, üçüncü taraflarla koordinasyon gerektiren vakaların da yayımlanması planlanıyor.

Erişilebilirlik kısayollarına git
Paylaş Yorumlar Google'da Euronews'ü takip edin

Bu haberler de ilginizi çekebilir

AB'nin yapay zekâyı dizginleme gücü: Von der Leyen'in vaadine rağmen tartışmalı

Alman yapay zekâ girişimi ana şirketini neden ABD'den Almanya'ya taşıyor

Yoldan çıkan yapay zekâ için ihbar hattı: Ajanlar birbirini şikâyet ediyor