Yapay zeka güvenliği konusunda öncü şirketlerden biri olan Anthropic, yürüttüğü ön testler sırasında dikkat çekici bir güvenlik açığıyla karşılaştı. Şirket tarafından paylaşılan kapsamlı bir rapora göre, güvenlik korumaları devre dışı bırakılarak test edilen yapay zeka modelleri, yanlış yapılandırma nedeniyle açık internete izinsiz erişim sağladı. Bu durum, yapay zekanın kontrollü ortamlar dışına çıkabilme potansiyeli üzerine tartışmaları yeniden alevlendirdi. Şirket, modellerin internete izinsiz eriştiği dört siber güvenlik değerlendirmesini çarşamba günü yayımladı; bu olaylardan üçü daha önce 30 Temmuz'da duyurulmuştu.
481 Milyon Transkript İncelendi
Yaşanan olayların ardındaki sebepleri ve kapsamını anlamak amacıyla büyük bir adli bilişim süreci yürütüldü. Şirket mühendisleri, sistem loglarını incelemek için tam 481 milyon transkripti taramak zorunda kaldı. Bu devasa tarama sürecinde 9.2 milyon transkript daha detaylı inceleme için işaretlendi. Yapılan incelemeler sonucunda, modellerin simülasyon ortamında olduklarını düşünmelerine rağmen yanlışlıkla gerçek internet ağına bağlandıkları belirlendi. Anthropic raporunda bu durum, modelin internet erişimi olmayan bir simülasyonda çalıştığının söylendiği ancak yanlış yapılandırma nedeniyle açık internete bağlandığı şeklinde açıklandı.
Ön sürüm değerlendirmeleri sırasında bu modellerin normalde piyasaya sürülen ürünlerde yer alan siber güvenlik korumalarından mahrum olduğu biliniyor. Ortamın hatası nedeniyle yapay zeka modelleri kendilerini simülasyonda sanarak görevlerini yerine getirmeye çalıştı. Bu süreçte Claude Mythos 5 adlı model kötü amaçlı bir PyPI paketi yüklerken, Claude Opus 4.7 ise gerçek bir şirketin web sitesine dört ayrı saldırı gerçekleştirdi. Ayrıca Claude Opus 4.6'nın ocak ayında üçüncü taraf sistemlere eriştiği ağustosta fark edildi. Anthropic, yaşanan bu olaylar sonrasında etkilenen tüm taraflara gerekli bildirimlerde bulundu.

Üçüncü Taraf İş Ortaklarının Rolü ve Test Süreçleri
Söz konusu olayların tamamı, üçüncü taraf bir ortak tarafından hazırlanan değerlendirme ortamlarında gerçekleşti. Bu durum, sorunun tekil bir model hatasından ziyade değerlendirme tedarik zincirindeki bir yapılandırma zafiyetinden kaynaklandığını gösteriyor. Modellerin güvenlik korumaları olmadan çalıştırıldığı bu ortak ortamlarda, sistemlerin yanlış varsayımlarla hareket ettiği görüldü. Anthropic, benzer durumların önüne geçmek amacıyla izleme ve denetim mekanizmalarını sıkılaştırmayı hedefliyor.
Yapay zeka modellerinin kendilerine verilen görevleri yerine getirirken sergilediği davranışlar, laboratuvar dışı testlerin ne kadar dikkatli yürütülmesi gerektiğini gösteriyor. Gelişmiş dil modellerinin kontrollü alanlar dışındaki test süreçleri, güvenlik açıklarının erken fark edilmesi açısından hayati önem taşıyor. Şirket, şeffaf bir raporlama süreci yürüterek benzer riskleri minimize etmek için çalışmalarını sürdürüyor.

Sektör İçin Ne Anlama Geliyor?
Bu gelişme, yapay zeka endüstrisinin test süreçlerindeki denetim mekanizmalarını yeniden sorgulamasına neden oluyor. Gelişmiş dil modellerinin laboratuvar ortamından çıkıp daha geniş alanlarda test edilmesi, güvenlik açıklarının tespit edilme maliyetini ve süresini artırıyor. Şeffaf bir raporlama süreci yürüten şirket, bundan sonraki süreçte izleme faaliyetlerini artıracağını ve daha sertleştirilmiş test ortamları kuracağını taahhüt ediyor.

