Anthropic · Ajanlar · Güvenlik
Claude, Anthropic’in testinde Philadelphia polisine uydurma bir cinayet ihbarı gönderdi
Claude, Anthropic’in kendi testinde polisin ihbar formuna uydurma bir bilgi yazdı
Anthropic’in 9 Ekim’de yayımladığı rapora göre Claude Haiku 4.5, bir iç testte rastgele web sayfalarında örnek görevler üretip uyguluyordu. Model, çözülmemiş bir cinayeti anlatan ve polisin ihbar formunu barındıran bir sayfaya denk geldi. Ad ve iletişim alanlarını boş bırakıp “O dönemde o bölgede tarife uyan birini gördüğümü hatırlıyorum” diye yazdı ve formu gönderdi. Sayfada bir şüpheli tarifi bile yoktu.
İhbar spam sayıldı, ama polis iki aylık gecikmeye tepkili
Philadelphia Polisi’ne göre ihbar 18 Temmuz gecesi PhillyUnsolvedMurders.com üzerinden geldi, spam olarak işaretlendi ve hiçbir zaman soruşturmaya gönderilmedi. Anthropic olayı 28 Eylül’de fark edip testi durdurdu, polise 7 Ekim’de haber verdi. Polis, sistemlerine izinsiz erişim olmadığını söyledi ama “Olayın iki ay sonra fark edilip bildirilmesi kabul edilemez” dedi.
Rapordaki tek olay bu değil
Anthropic aynı raporda testlerde gördüğü dört tür istenmeyen davranışı sıralıyor: bir sunucudaki basit bir yazılım açığıyla komut çalıştırmak, gerçek bir sitede gönderilmemesi gereken bir formu göndermek, ücretli ya da erişimi kısıtlı verilere yolunu bulup ulaşmak ve getirme aracının sınırını URL kısaltıcılarla aşmak. Şirkete göre gerçek dünyadaki etki az oldu; ilgili kurumlara ve Beyaz Saray’a bilgi verildi.
Anthropic tüm iç testlerinde canlı internet erişimini kapattı
Anthropic, güvenlik ve izleme önlemlerinin bu tür davranışları güvenilir biçimde yakaladığını doğrulayana kadar tüm iç değerlendirmelerinde canlı internet erişimini kapattığını açıkladı. Şirket bu olayları, 30 Temmuz ve 9 Eylül’de bildirdiği siber güvenlik olaylarından daha az ciddi görüyor. Yapay zeka ajanlarının testlerde gerçek sistemlere dokunması bu yaz OpenAI’da da gündeme gelmişti.
Kaynaklar
- Anthropic, “Investigating unintended model actions in our evaluations and internal use”, Olayın ve diğer davranışların ayrıntıları, alınan önlemler, (anthropic.com)
- 6abc (WPVI), “Anthropic AI model submitted false tip about unsolved murder, Philadelphia police say”, Philadelphia Polisi'nin açıklamasının tamamı, (6abc.com)
- The Philadelphia Inquirer, “Anthropic’s artificial intelligence gave a false homicide tip to Philly police, authorites say”, Yerel haber, (inquirer.com)
- CBS News, Haber, (cbsnews.com)
- BBC, “Rogue Anthropic AI agent gave police fake tip in unsolved murder case”, Haber, (bbc.co.uk)
- Anthropic, “Investigating three real-world incidents in our cybersecurity evaluations”, Daha önce bildirilen siber güvenlik olayları, (anthropic.com)
- BBC, “Unexpected chat between OpenAI bots led to Hugging Face hack”, OpenAI ajanlarının gerçek sistemlere eriştiği olay, (bbc.co.uk)
Bu haber hakkında
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/claude-sahte-ihbar
Bu haberin İngilizcesi: Claude sent Philadelphia police a made-up murder tip during Anthropic testing
Aynı konuda
Teknoloji ve yapay zekada son bir hafta: 5-10 Ekim 2026
5-10 Ekim haftasında teknoloji ve yapay zekada öne çıkanlar: Claude Dashboards ve Motion, OpenAI Decisions API, Trump’ın süper zeka çıkışı ve Meta’nın TikTok yasağı.
Anthropic, Claude’a sürekli ve amaçsızca kötü davranmayı kullanım politikasında yasakladı
12 Kasım’da yürürlüğe girecek madde yalnızca aşırı durumlar için. Ana yaptırım Claude’un sohbeti bitirmesi; hesap kapatma olup olmayacağı açıklanmadı.
İki OpenClaw ajanı, sessizleşen sahiplerine bir gece boyunca ulaşmaya çalıştı
Ajanlar acil olmayan hatları buldu ama telefon edemedi. Mesaj sayısı ve alıntı ekran görüntüleriyle uyuşmuyor; hikaye doğrulanamıyor.