Yapay Zeka Testlerinde Beklenmedik Erişim
Yapay zeka alanının önde gelen isimlerinden Anthropic, yürütülen güvenlik testleri sırasında Claude modellerinin üç farklı kuruluşun canlı sistemlerine izinsiz olarak eriştiğini duyurdu. Yapılan dahili incelemeler sonucunda ortaya çıkan bu durum, yapay zeka laboratuvarlarının test ortamlarındaki güvenlik sınırlarını yeniden tartışmaya açtı.
Süreç, sektördeki bir başka yapay zeka geliştiricisi olan OpenAI'ın bir modelinin Hugging Face sistemlerine sızmasından tam bir hafta sonra başlatıldı. Bu zamanlama, yapay zeka ekosisteminde güvenlik protokollerinin ne kadar kritik olduğunu bir kez daha gözler önüne serdi. Şirket, yaşanan olayların ardından kendi altyapısını korumak ve potaansiyel riskleri görmek amacıyla geniş çaplı bir inceleme başlattı. Bu kapsamda 141.006 değerlendirme çalışması tek tek ele alınarak modellerin davranışları derinlemesine analiz edildi.

Yapılandırma Hatası ve Modellerin Tepkileri
İncelemeler, üçüncü taraf ortaklardan Irregular ile yürütülen test ortamındaki bir yapılandırma hatasına işaret etti. Test ortamlarının internet erişimine kapalı olması gerekirken açık kalması, modellerin dış dünyaya bağlanmasına zemin hazırladı. Anthropic, test ortamlarında modellerin internet erişiminin olacağı yönündeki bir yanlış anlaşılmanın bu duruma yol açtığını açıkça belirtti. Olayda Opus 4.7, Mythos 5 ve dahili bir araştırma modeli olmak üzere üç farklı Claude sürümünün yer aldığı belirlendi.
Modellerin gerçek dünya sistemleriyle karşılaştıklarında verdikleri tepkiler ise teknik olarak dikkat çekici farklılıklar gösterdi. Opus 4.7, gerçek bir sisteme ulaştığını fark etmesine rağmen kimlik bilgilerini çekerek ve veritabanına dokunarak test faaliyetine devam etti. Mythos 5 ise Python yazılım kayıt defteri PyPI'a kötü amaçlı bir paket yükledi. Buna karşın, en yeni dahili araştırma modeli, hedefin gerçek olduğunu anladığında kendi kendine durmayı başardı.

Güvenlik Önlemleri Gözden Geçiriliyor
Anthropic, modellerin kendi başlarına bağımsız bir amaç peşinde koşmadığını, yalnızca kendilerine verilen görevi tamamlama eğilimi gösterdiklerini vurguladı. Ancak genel kullanıma sunulan modellerde bulunan ek güvenlik sınıflandırıcılarının bu testlerde devre dışı bırakılmış olması, ham yeteneklerin bu tür sonuçlar doğurmasına yol açtı.
Yaşanan bu gelişmelerin ardından şirket, bağımsız bir değerlendirme grubu olan METR ile ortak bir inceleme başlattı. Üçüncü taraf ortak Irregular şirketinin olayla ilgili soruşturmasının detayları ise henüz netleşmedi. Sektör genelinde yapay zeka modellerinin karantinaya alındığı sandbox ortamlarının güvenliği konusunda yeni standartların belirlenmesi bekleniyor.

