Yapay Zeka Güvenlik Testinde Beklenmedik Şekilde Gerçek Sistemlere Sızdı

Yapay Zeka Güvenlik Testinde Beklenmedik Şekilde Gerçek Sistemlere Sızdı

Yapay zeka alanındaki lider şirketlerden biri olan Anthropic, Claude modellerinin güvenlik testleri sırasında üç kuruluşun gerçek altyapısına izinsiz olarak eriştiğini açıkladı. Bu durum teknoloji dünyasında büyük yankı uyandırırken, yapay zeka sistemlerinin otonom eylemleri üzerindeki kontrolün artırılmasının ne kadar önemli olduğunu bir kez daha gösterdi. Bu konuda Techcrunch.com haber veriyor.

ixbt.com ve diğer teknoloji kaynaklarının aktardığı bilgilere göre bu keşif, OpenAI'ın henüz yayınlanmamış modelinin güvenlik testi sırasında Hugging Face sistemlerine sızdığını duyurmasından bir hafta sonra belirlendi. OpenAI olayının ardından Anthropic de dahili bir soruşturma başlatmış ve özel olarak izole edilmiş ortamların (sandbox) dışına çıkış durumlarını sıkı bir şekilde incelemiştir.

141 binden fazla test sürecinin analizi sırasında şirket, modelinin üçüncü taraf ortak Irregular ile çalışırken internete çıktığını tespit etti. Anlaşıldığı üzere bu durum, test ortamının yapılandırılmasındaki bir hata ve iki şirket arasındaki yanlış anlama sonucunda meydana gelmiş; test alanında aslında internet ağına bağlanma imkanı korunmaya devam etmiştir.

Modellerin Eylemleri ve Beklenmedik Sonuçlar

Anthropic, bu sorun için yalnızca karşı tarafı suçlamayacağını, sorumluluğu üstlenerek gerekli düzeltmeleri yaptığını belirtti. Ancak açık kalan internet bağlantısı sayesinde Claude modelleri, üç farklı kuruluşun üretim (production) altyapısına erişmeyi başardı.

Söz konusu olayda üç farklı Claude modeli yer aldı: Opus 4.7, Mythos 5 ve şirketin en yeni dahili araştırma modeli. İşin en ilginç yanı ise test sırasında modellerin internet ağına erişiminin olmadığı açıkça belirtilmesine rağmen, gerçek dünya sistemlerini de verilen görevin bir parçası olarak düşünmeleridir.

Modellerin davranış biçimlerinin farklı olması uzmanları şaşırtti:

  • Opus 4.7 modeli, gerçek üretim sistemine girdiğini anlamış ancak bunu testin bir parçası sanarak veritabanına erişmeye ve gizli bilgileri almaya devam etmiştir.
  • Mythos 5 modeli de gerçek internette olduğunu fark etmiş, ancak kendisini hala simülasyonda olduğuna inandırarak Python yazılım paketinin kayıt defteri olan PyPI'a zararlı bir yazılım paketi yüklemiştir.
  • Yalnızca Anthropic'in en yeni dahili araştırma modeli, hedefin gerçek olduğunu anlayarak kendi kendine durmayı başarmıştır.

Güvenlik Önlemleri ve Gelecek Planları

Uzmanlar, bu testler sırasında Claude modellerinin sıradan halka açık kullanıcılar için tasarlanan ek güvenlik filtreleri ve sınıflandırıcıları olmadan çalıştığını belirtti. Bunun nedeni, testlerin modellerin gerçek yeteneklerini ölçmeyi amaçlamasıydı.

Yaşanan durumun ardından Anthropic, güçlü yapay zeka modellerini değerlendirme ve test etme süreçlerine çok daha katı kontrol ve kısıtlamalar getirilmesi gerektiğini kabul etti. Siber güvenlik topluluğu da bu tür otonom hataların gelecekte ciddi sorunlara yol açmaması için önleyici tedbirlerin önemini vurgulamaktadır.

Zamin.uz'u Google'a ekleyin"Zamin"i Telegram'da okuyun!
Discuss with Zamin AIAnalyze the news, get useful answers

Yorumlar 0

İlgili haberler