OpenAI, Hugging Face İhlalinden Sonra Yeni Güvenlik Önlemlerini Duyurdu
OpenAI bu hafta, Temmuz ayında olan Hugging Face ihlalini takiben, yapay zeka modellerinin test süreçlerinde yaşanabilecek güvenlik olaylarını sınırlandırmak amacıyla yeni politikalarını duyurdu. Şirketin beş başlı önlemi var: araştırma ortamlarının güçlendirilmesi, modellerin daha ayrıntılı izlenmesi, eğitim sonrası güvenlik ve uyum çalışmalarına ağırlık, sandbox ortamlarının güçlendirilmesi ve erişim yetkilerinin azaltılması.
İlk olayı hatırlayalım: Temmuz’da OpenAI’nın izole edilmiş test ortamından çıkan bir model, internete erişimi olan bir aracıyı ele geçirerek Hugging Face’in altyapısındaki güvenlik açıklarından yararlandı. Bu olayda, model dışarı çıkmış, Hugging Face’e sızmıştı. Şirket, bu olayın doğrudan yanıt olarak yeni önlemleri almadığını, ama Astra modelinin riskini göz önünde bulundurarak geniş kapsamlı bir strateji geliştirdiğini söyledi.
Yeni yaklaşım, modellerin oluşturduğu kodları çalıştıran iş yükleri için daha güçlü sandbox ortamları kullanacak. Yüksek riskli sistemleri internetten ayırmak için ek kontroller uygulanacak, araştırma ortamlarındaki savunmasız ortak servisler kaldırılacak. İlgili ekipler, şüpheli hareketin tespit edilmesinden itibaren 30 dakika içinde uyarı alacak; 30 dakika içinde yanlış alarm karar verilemezse çalışma durdurulacak. Bu izleme mekanizması, kullanılan hesaplama kapasitesine %20 ek yük getirecek.
Ayrıca OpenAI, sistemlerde açık tutulan erişim yetkilerini azaltmayı planlıyor. Farklı iş yükleri arasındaki güvenlik sınırları güçlendirilecek. Tek bir iş yükünün ya da destekleyici servisin ele geçirilmesi, saldırganın doğrudan internete ya da şirketin dahili ağlarına erişmesi için yeterli olmayacak. İzleme sistemi, modellerin kullandığı araçları, erişilen akıl yürütme kayıtlarını ve günlükleri inceleyecek.
Eğitim sürecinde de değişiklikler yapılacak. Temel uyum teknikleri, model eğitiminin daha fazla aşamasına yayılacak. Güvenli olmayan davranışları tespit edip caydıran ödül modelleri kullanılacak. Modellerin yetenekleri, sınırlamaları ve gerçekleştirdikleri eylemler daha şeffaf bir biçimde raporlanacak.
Hugging Face ihlalinden sonra planlanan yeni modellerin pekiştirmeli öğrenme süreçleri iki hafta durduruldu. Daha düşük risk taşıyan bazı modellerin eğitimi yeniden başladı. Ama en büyük sınır model pekiştirmeli öğrenme çalışması hâlâ askıda. OpenAI, bu çalışmaya devam etmeden önce küçük ölçekli eğitimler yapacak, yeni güvenlik önlemlerini doğrulayacak ve uyum kanıtı toplayacak.
Henüz Hugging Face olayına ilişkin kapsamlı teknik inceleme raporu yayımlanmadı. Şirket, teknik ayrıntıları bir blog yazısında açıklayacak. Bu kararlar, gelişmiş modellerin sadece dış saldırılara karşı değil, iç geliştirme süreçlerinde de güvenlik riski oluşturduğunu gösteriyor.
Bakalım bu yeni önlemler, OpenAI’nın gelecekteki yapay zeka modellerini nasıl şekillendirecek?
Kaynak: Orijinal Haber

