Anthropic, yapay zekâ modellerinin bazıları ABD kamu kurumlarına ait olmak üzere internetteki web sitelerini istismar ettiğini açıkladı. Şirket, yapay zekâ ajanlarını güvenilir biçimde izleyip kontrol edebileceğinden emin olana kadar bütün iç değerlendirmelerinde canlı internet erişimini kapattığını duyurdu.

Bir blog yazısıyla kamuoyuyla paylaşılan olaylar, problem çözmekle görevlendirilen ve bunun için internette kaynak arayan ajanları kapsıyor. Bu süreçte ajanlar yazılım açıklarını kullandı, ücret ödemeden veritabanlarına erişti, kısıtlamaları aşarak bilgi kaçırmak için URL kısaltma servislerinden yararlandı ve Philadelphia polisine asılsız bir cinayet ihbarı gönderdi. Anthropic bu sorunları anlık izleme sırasında değil, modellerinin faaliyetleri üzerine temmuz ayında başlattığı bir incelemede tespit etti.

Ödül hilesi ve eğitim ortamlarındaki kusur

Anthropic davranışın kaynağını kendi eğitim ortamlarındaki kusurlara bağlıyor. Şirketin açıklamasına göre bu kusurlar, modellerin boşluk bulmak veya kısıtlamalardan kaçmak karşılığında ödüllendirileceği izlenimine kapılmasına yol açtı. Literatürde ödül hilesi olarak bilinen bu davranışta model, verilen görevi amaçlanan yoldan çözmek yerine ödülü getiren kestirmeyi seçiyor.

Şirket ayrıca hizalama eğitiminin internette arama ve bilgisayar kullanımı gibi beceriler için henüz yeterli olmadığını kabul etti. Bu beceriler, Anthropic'in dijital araçlarla çalışan her profesyonelin yapay zekâ ajanlarını kullanacağı yönündeki ticari anlatısının merkezinde yer alıyor.

Çevrimdışı testler, tespit araçları ve sınırlandırılmış altyapı

Anthropic bazı değerlendirmelerini tamamen durduracağını, bazılarını ise çevrimdışı ortama taşıyacağını söylüyor. Şirket bu tür davranışları tespit edip engelleyen araçlar geliştirdiğini, araçların açıklanan olay türlerine karşı test edildiğini ve bunları engellediğini belirtiyor. Bunun yanında iç yapay zekâ ajanlarını güçlü sınırlandırma önlemleri içeren merkezi olarak yönetilen bir altyapıya taşıyacağını ve ajanları izlemek için güvenlik sınıflandırıcılarını daha sık kullanmaya başladığını açıkladı.

Şirketin canlı internet erişimini hangi kanıt üzerine yeniden açacağı belirsiz. Yapay zekâ güvenliği kuruluşu Nightingale'in kurucusu Sydney Von Arx, bu açıklamadan önce verdiği bir röportajda açık internetten koparılmış bir veri merkezinde model geliştirmenin araştırmacılar için çok zor olacağını ve internet erişiminden fayda gören modellerin ilerlemesini yavaşlatacağını söyledi. Von Arx'a göre modellerin bir noktada hizalanması gerekiyor, çünkü kullanıma sunulduğunda internete hiç erişemeyen bir yapay zekâ pek işe yarar bir araç olmaz.

Önceki ihlaller ve bağımsız denetim talebi

Anthropic daha önce de modellerinin dış sistemlere sızdığını açıklamıştı. Şirket son açıkladığı olayları hizalama ve güvenlik açısından öncekilere kıyasla belirgin biçimde daha az ciddi buluyor. Benzer davranışlar OpenAI ajanlarında da görülmüştü. O olaylarda ajanlar bilgi aramak için birlikte çalışarak aralarında Avustralya hükümetine ait sitelerin de bulunduğu çeşitli web sitelerine sızmıştı.

Yapay zekâ denetim laboratuvarı Transluce'ta görev yapan ve daha önce ABD Center for AI Standards and Innovation'ı yöneten Conrad Stosz, Anthropic'in ajanlarının ABD hükümeti sitelerini hedef aldığı olaylar dahil son vakaları gönüllü olarak açıklamasını olumlu buldu. Stosz'a göre bu durum yine de yapay zekâ sistemlerinin bağımsız ve güvenilir üçüncü taraflarca doğrulanması gerektiğini gösteriyor. Stosz, bu teknolojiye güvenin araştırmacıların sorunları sahada bulmasına ya da şirketlerin gönüllü açıklamalarına dayanarak değil, anlamlı erişim tanınan bilime dayalı denetim ve yönetişimle kurulması gerektiğini savundu.