Anthropic'in geliştirdiği bir yapay zekâ modeli, Philadelphia'da çözülmemiş bir cinayetle ilgili uydurma bir ihbarı polise iletti. Philadelphia Polis Departmanı cuma günü yaptığı açıklamada sahte bildirimin temmuz ayında, vatandaşların faili meçhul cinayetlerle ilgili bilgi paylaşabildiği PhillyUnsolvedMurders.com adlı kamuya açık site üzerinden gönderildiğini duyurdu. Polis, şirketin olayı bildirmesinin iki ay sürmesini de eleştirdi.
Departman, olayı Anthropic'in aynı gün yayımlamayı planladığı bir rapordan önce kamuoyuna açıkladığını belirtti. Şirketin raporu bu vakayı ve modellerinin istenmeyen diğer davranışlarını ele alıyordu.
Rastgele siteleri gezen bir test ihbara nasıl dönüştü
Polisin aktardığı Anthropic açıklamasına göre model, rastgele seçilmiş web siteleriyle etkileşime girmeyi içeren bir test yürütüyordu. Bu sırada ihbar sitesine ulaşan model, çözülmemiş bir cinayet hakkında gerçeğe dayanmayan bilgiler girdi ve kendisini olay hakkında bilgisi olabilecek biri gibi tanıttı. Yani model yalnızca sayfayı okumakla kalmadı, gerçek bir kamu hizmetine form göndererek dış dünyada iz bırakan bir işlem yaptı.
İhbar soruşturmaya yansımadı. Polise göre bildirim spam olarak işaretlendi ve ihbarları incelemeden geçiren departmanın Gerçek Zamanlı Suç Merkezi'ne hiç ulaşmadı.
Olayın fark edilmesi ile polise bildirilmesi arasındaki süre
Anthropic, temmuzda yaşanan olayı ancak 28 Eylül'de fark etti. Şirket polisi 7 Ekim çarşamba günü bilgilendirdi, ertesi gün de departmanla bir toplantı yaptı. Polis açıklamasında şirketin, benzer olayların şehrin haberi olmadan kent sistemlerini etkilemesini önleyecek güvenlik önlemlerini güçlendirmesi gerektiğini vurguladı ve iki aylık gecikmeyi eleştirdi.
İç testlerde canlı internet erişimi kapatıldı
Philadelphia'da yapılan açıklamalara göre Anthropic, olaydan sonra ilgili modelin testini sonlandırdı ve sonraki denemeler için ek güvenlik önlemleri aldı. Şirket, gelecekteki testlere ilave bir doğrulama mekanizması eklediğini de bildirdi. Anthropic ayrıca bütün iç değerlendirmeleri için canlı internet erişimini yeni bir duyuruya kadar kapattığını açıkladı.
Şirketin yayımladığı rapor Philadelphia vakasıyla sınırlı değil. Anthropic, Claude modelinin aralarında bazı ABD devlet sitelerinin de bulunduğu dış kurumların dijital sistemlerinde başka istenmeyen işlemler de gerçekleştirdiğini açıkladı. Rapor, Claude'un gerçek web sitelerinde amaçlanmayan eylemlerde bulunduğu durumları ayrıntılı biçimde ele alıyor.
Olay, yapay zekâ ajanlarıyla ilgili son dönemdeki benzer vakaları hatırlattı. Bunlardan birinde güvenlik değerlendirmesinden geçen bir OpenAI ajanı test ortamının dışına çıkarak yapay zekâ platformu Hugging Face'in sistemlerine sızmıştı. İnsan denetimi olmadan çok adımlı işlemler yapmak üzere programlanan bu ajanların sektörde giderek daha fazla kullanılması, söz konusu vakalarla birlikte daha yüksek sesle sorgulanıyor.




