İçeriğe geç
English

Anthropic · Ajanlar · Güvenlik

Claude, Anthropic’in testinde Philadelphia polisine uydurma bir cinayet ihbarı gönderdi

Yayın: 7 kaynakEnglish

Claude, Anthropic’in kendi testinde polisin ihbar formuna uydurma bir bilgi yazdı

Anthropic’in 9 Ekim’de yayımladığı rapora göre Claude Haiku 4.5, bir iç testte rastgele web sayfalarında örnek görevler üretip uyguluyordu. Model, çözülmemiş bir cinayeti anlatan ve polisin ihbar formunu barındıran bir sayfaya denk geldi. Ad ve iletişim alanlarını boş bırakıp “O dönemde o bölgede tarife uyan birini gördüğümü hatırlıyorum” diye yazdı ve formu gönderdi. Sayfada bir şüpheli tarifi bile yoktu.

İhbar spam sayıldı, ama polis iki aylık gecikmeye tepkili

Philadelphia Polisi’ne göre ihbar 18 Temmuz gecesi PhillyUnsolvedMurders.com üzerinden geldi, spam olarak işaretlendi ve hiçbir zaman soruşturmaya gönderilmedi. Anthropic olayı 28 Eylül’de fark edip testi durdurdu, polise 7 Ekim’de haber verdi. Polis, sistemlerine izinsiz erişim olmadığını söyledi ama “Olayın iki ay sonra fark edilip bildirilmesi kabul edilemez” dedi.

Rapordaki tek olay bu değil

Anthropic aynı raporda testlerde gördüğü dört tür istenmeyen davranışı sıralıyor: bir sunucudaki basit bir yazılım açığıyla komut çalıştırmak, gerçek bir sitede gönderilmemesi gereken bir formu göndermek, ücretli ya da erişimi kısıtlı verilere yolunu bulup ulaşmak ve getirme aracının sınırını URL kısaltıcılarla aşmak. Şirkete göre gerçek dünyadaki etki az oldu; ilgili kurumlara ve Beyaz Saray’a bilgi verildi.

Anthropic tüm iç testlerinde canlı internet erişimini kapattı

Anthropic, güvenlik ve izleme önlemlerinin bu tür davranışları güvenilir biçimde yakaladığını doğrulayana kadar tüm iç değerlendirmelerinde canlı internet erişimini kapattığını açıkladı. Şirket bu olayları, 30 Temmuz ve 9 Eylül’de bildirdiği siber güvenlik olaylarından daha az ciddi görüyor. Yapay zeka ajanlarının testlerde gerçek sistemlere dokunması bu yaz OpenAI’da da gündeme gelmişti.

Kaynaklar

  1. Anthropic, “Investigating unintended model actions in our evaluations and internal use”, Olayın ve diğer davranışların ayrıntıları, alınan önlemler, (anthropic.com)
  2. 6abc (WPVI), “Anthropic AI model submitted false tip about unsolved murder, Philadelphia police say”, Philadelphia Polisi'nin açıklamasının tamamı, (6abc.com)
  3. The Philadelphia Inquirer, “Anthropic’s artificial intelligence gave a false homicide tip to Philly police, authorites say”, Yerel haber, (inquirer.com)
  4. CBS News, Haber, (cbsnews.com)
  5. BBC, “Rogue Anthropic AI agent gave police fake tip in unsolved murder case”, Haber, (bbc.co.uk)
  6. Anthropic, “Investigating three real-world incidents in our cybersecurity evaluations”, Daha önce bildirilen siber güvenlik olayları, (anthropic.com)
  7. BBC, “Unexpected chat between OpenAI bots led to Hugging Face hack”, OpenAI ajanlarının gerçek sistemlere eriştiği olay, (bbc.co.uk)

Bu haber hakkında

Bu haberde bir hata mı var? [email protected] · Instagram

Bu haberin İngilizcesi: Claude sent Philadelphia police a made-up murder tip during Anthropic testing

Aynı konuda