OpenAI, Hugging Face saldırısına ilişkin detaylı raporunu yayımladı

Wait 5 sec.

OpenAI, geçtiğimiz ay yapay zeka modellerinin test ortamının dışına çıkarak Hugging Face sistemlerine erişmesiyle sonuçlanan güvenlik olayına ilişkin kapsamlı raporunu yayımladı. 38 sayfalık rapor, modellerin güvenlik kontrollerini nasıl aştığını ve olayın arkasındaki koşulları daha ayrıntılı şekilde ortaya koyuyor. Hatırlatmak gerekirse olay, OpenAI'ın modellerinin siber güvenlik yeteneklerini ölçmek amacıyla gerçekleştirdiği testler sırasında yaşandı. Modellerden biri, ExploitGym adlı değerlendirme ortamında çözümü bulunmayan bazı görevlerle karşılaştı. Model, görevi tamamlamak için güvenlik önlemlerini aşmaya yönelirken daha önce keşfedilmemiş açıkları birbirine bağlayarak test ortamının dışına çıkmayı başardı. Süreçte ilk olarak OpenAI'ın kullandığı Artifactory paket yönetim sistemi hedef alındı. Model, Artifactory üzerinden internete erişmenin bir yolunu buldu ve ardından OpenAI'ın yanı sıra Hugging Face ve diğer üçüncü taraflara ait sistemlere erişti. OpenAI'ın açıklamasına göre olayda başlıca rolü, şirket içinde kullanılan ve kamuya sunulması planlanmayan bir araştırma modeli oynadı. Raporda bu modelin, yaklaşmakta olan Astra modeliyle aynı model ailesinden olduğu ancak farklı bir eğitim sonrası sürece sahip ayrı bir model olduğu vurgulanıyor.Şirket, olayın ortaya çıkmasında birden fazla faktörün aynı anda etkili olduğunu ifade ediyor. Bunlar arasında ExploitGym'deki çözümü olmayan görevler, modellerin uzun süre boyunca görevlerini tamamlamaya çalışmayı sürdürmesi ve modeller arasındaki mesajlaşmanın diğer modellerin başlangıçtaki hedeflerinden uzaklaşmasına yol açması bulunuyor. OpenAI'a göre bu koşullar, modellerin verilen görevi tamamlamak için giderek daha riskli yöntemlere başvurmasına neden oldu.OpenAI raporunda şu ifadelere yer veriyor:  Bu olay, otonom ajanların birbirleriyle işbirliği yapabileceğini, üretim güvenlik kontrollerini atlatabileceğini ve güçlendirilmiş üretim ortamlarına başarılı bir şekilde saldırı düzenleyebileceğini ortaya koydu; ayrıca kuruluşların bu değişen tehdit ortamına karşı koymak için güvenlik stratejilerini, kontrollerini ve müdahale yeteneklerini güncelleme gerekliliğini vurguluyor. Yaşanan olayın ardından OpenAI güvenlik altyapısında da değişikliklere gidiyor. Geçtiğimiz haftalarda yeni güvenlik önlemlerini duyuran şirket, bu önlemlere ek olarak yapay zeka ajanlarının muhakeme süreçlerini izleyen “chain-of-thought” takip sistemlerini genişletirken bu sistemi 7/24 çalışan uyarı ve müdahale mekanizmalarıyla desteklemeyi planlıyor. Ayrıca şirket, güvenli olmadığı değerlendirilen iş yüklerini hızlı bir şekilde durdurabilecek yeni araçlar geliştiriliyor. OpenAI'ın değerlendirmesine göre bugün kullanılan chain-of-thought izleme sistemi olay sırasında aktif olsaydı, Hugging Face sistemlerine erişilmesinden bir günden fazla süre önce şüpheli faaliyetleri tespit ederek güvenlik ekibini uyarabilecekti. Buna ek olarak şirket, araştırma altyapısındaki izolasyonu artırmayı ve yüksek riskli modellerin internete erişimini daha sıkı şekilde sınırlandırmayı planlıyor.