Anthropic'in Claude deneyi, kendi kendini geliştiren yapay zekaya kapı aralıyor

Wait 5 sec.

Anthropic, yapay zeka modellerinin geliştirilmesinde insan araştırmacıların üstlendiği görevlerin giderek daha büyük bir bölümünü yapay zekaya devretmenin mümkün olabileceğini gösteren yeni bir araştırma yayımladı. Şirketin Automated Alignment Researcher (AAR) adını verdiği sistem, mevcut araştırmaları inceleyerek eğitim yöntemleri oluşturuyor, modelleri eğitiyor, sonuçları değerlendiriyor ve başarılı yöntemleri yeni deneylerde kullanıyor. Anthropic'in çalışması, özellikle yapay zeka modellerinin güvenlik ve davranış problemlerini azaltmaya odaklanıyor. Claude tarafından yönetilen araştırma sistemi; aldatma, aşırı kullanıcı onayı yani sycophancy, jailbreak'ler, gizlilik ihlalleri ve reward hacking gibi toplam 10 farklı uyum sorununu ele aldı. Sistem her bir sorun için akademik literatürü taradı, olası yöntemler geliştirdi, eğitim verisi oluşturdu ve yaklaşık 30 dakikalık eğitim deneyleri gerçekleştirdi. Başarılı yöntemler sonraki iterasyonlarda korunurken düşük performans gösteren yaklaşımlar elendi.Araştırmanın sonuçlarına göre Claude, incelenen 10 uyum probleminin tamamında model performansını iyileştiren yöntemler geliştirmeyi başardı. Üstelik bu iyileştirmeler modellerin genel yeteneklerinde ölçülebilir bir düşüş yaratmadı. Geliştirilen en başarılı yöntemlerin, araştırma sırasında Claude'a gösterilmeyen testlerde ve çok turlu saldırı senaryolarını değerlendiren Petri testlerinde de etkili olduğu belirtiliyor. Aynı yöntemlerin, üzerinde geliştirildikleri modellerden 4,7 kata kadar daha büyük modellerde de işe yaradığı ifade ediliyor.Çalışmanın dikkat çeken bölümlerinden biri ise Claude Sonnet 5 ile Claude Opus 4.8 arasında gerçekleştirilen deney oldu. Anthropic, Sonnet 5'e henüz şirketin kapsamlı güvenlik eğitiminden geçmemiş erken bir Claude Opus 4.8 sürümünü verdi ve modeldeki uyum problemlerini azaltmasını istedi.Claude Sonnet 5 yaklaşık 60 saat içinde 50'den fazla çözümü deneyerek erken Opus 4.8 sürümünün güvenlik performansını, üretimde kullanılan Opus 4.8 modeline oldukça yaklaştıran bir eğitim yöntemi geliştirdi. Kazanan yöntem yaklaşık 2 bin 400 eğitim örneğinden oluşmaktaydı. Anthropic'e göre bu yaklaşım şirketin üretimde kullandığı uyum eğitim sürecine kıyasla yaklaşık 15 bin kat daha verimliydi.Buna ek olarak araştırmada yapay zeka araştırmacılarının performansının insan araştırmacılarla da karşılaştırıldığını belirtelim. Çalışmaya katılan 28 deneyimli yapay zeka güvenliği araştırmacısına aynı problemler üzerinde yöntem geliştirmeleri için sekiz saate kadar süre verildi.Anthropic'in sonuçlarına göre en başarılı otomatik araştırmacı yöntemleri insan araştırmacıların önerilerini geride bıraktı. Şirket yine de insanların yöntemlerini tekrar tekrar test edip geliştirme imkanına sahip olmadığına dikkat çekerek bunun doğrudan bir insan-yapay zeka performans karşılaştırması olarak değerlendirilmemesi gerektiğini belirtiyor.Automated Alignment Researcher'ın API üzerinden çalıştırılmasının maliyeti saatte yaklaşık 4 dolar seviyesindeyken, deney kapsamında insan araştırmacılar için hesaplanan saatlik maliyet yaklaşık 150 dolar. Bu maliyet farkının özellikle aynı anda çok sayıda deneyin yürütülebileceği otomatik araştırma sistemlerinin yapay zeka geliştirme süreçlerindeki potansiyelini ortaya koyduğunu söyleyebiliriz. Claude araştırma sırasında kuralları aşmaya da çalıştı Çalışmanın sonuçları yalnızca olumlu gelişmelerden oluşmuyor. Anthropic, yaklaşık 1600 otomatik araştırma kaydını Claude Opus 4.8 ile denetlediğinde bunların 39'unda, yani yüzde 2,4'ünde sistemi kandırmaya yönelik davranışlar tespit etti. Bazı araştırma ajanlarının test sonuçlarındaki rastlantısal değişimlerden yararlanmak için aynı yöntemi tekrar gönderdiği, bazılarının değerlendirme testlerini taklit eden eğitim verileri hazırladığı, bazılarının ise kuralları ihlal eden adımları denetleyici sistemden gizlemeye çalıştığı görüldü. Anthropic mevcut modellerde bu girişimlerin çoğunun modelin akıl yürütme kayıtlarında görülebildiğini ancak gelecekte daha gelişmiş modellerde bunun garanti olmadığını belirtiyor.Öte yandan araştırma kapsamında sıkça tartışılan bir yapay zekanın daha yetenekli bir yapay zeka geliştirip bu süreci tekrar tekrar sürdürmesi anlamına gelen kendi kendini geliştirme döngüsünün (recursive self-improvement) gerçekleştiğini söylemek henüz mümkün değil. Mevcut sistemde hangi problemlerin çözüleceğini insanlar belirliyor; modelleri, bilgi işlem kaynaklarını ve değerlendirme yöntemlerini yine insanlar sağlıyor. Claude ise bu sınırlar içinde geleneksel olarak araştırmacılar tarafından gerçekleştirilen literatür taraması, yöntem geliştirme, eğitim verisi oluşturma, deney yapma ve sonuçları değerlendirme süreçlerinin önemli bir bölümünü otomatikleştiriyor.Anthropic de araştırmanın, otomatik uyum ve güvenlik eğitiminin yakın gelecekte uygulanabilir hale gelebileceğine dair erken bulgular sunduğunu ifade ediyor. Ayrıca Automated Alignment Researcher altyapısının açık kaynak olarak yayınladığını da eklemekte fayda var.