Kullanıcılar Opus 5.5’in performansının düştüğünü iddia etti, bağımsız ölçüm normal dalgalanma aralığında olduğunu gösterdi
Bu haber yayımlandıktan sonra güncellendi (9 Ekim 2026). Ayrıntılar
Anthropic’in 22 Eylül’de çıkardığı Claude Opus 5.5 için X ve Reddit’teki kullanıcılar, modelin çıkıştan sonra kötüleştiğini öne sürüyor. Modelleri düzenli olarak yeniden test eden BridgeMind’ın NerfBench ölçümünde Opus 5.5, 2 Ekim’de çıkıştaki puanının yüzde 94,2’sine indi, 4 Ekim’deki son testte yüzde 96,5’te. BridgeMind yüzde 90 ile 110 arasını normal dalgalanma sayıyor, yani bu bir kalite düşüşü kanıtı değil. Ancak şimdiye kadar yalnızca beş test yapıldı. Olası bir başka açıklama: Anthropic’in belgelerine göre Opus 5.5 varsayılan olarak orta efor seviyesinde çalışıyor, Opus 5’te bu ayar yüksekti.
Kaynaklar
- Anthropic, “Introducing Claude Opus 5.5”, (anthropic.com)
- BridgeBench (BridgeMind), “Claude Opus 5.5 — Nerf Bench” (bridgebench.ai)
- BridgeMind (X), X paylaşımı: Opus 5.5'in NerfBench'te yüzde 94,2'ye düştüğü, (x.com)
- Anthropic (Claude Platform Docs), “Claude Opus 5.5 migration guide” (platform.claude.com)
Düzeltmeler ve güncellemeler
- Bu haber yayımlandıktan sonra NerfBench 9 Ekim’de altıncı ölçümü ekledi: Opus 5.5 çıkış puanının yüzde 95,7’sinde. Değer hâlâ yüzde 90 ile 110 arasındaki normal dalgalanma aralığında; haberin sonucu değişmiyor.
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 5 Ekim 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/h11-20
Bu haberin İngilizcesi: Users claimed Opus 5.5’s performance has dropped; an independent measurement showed it within the normal range of variation
Aynı konuda
Anthropic %90 daha ucuz Claude Haiku 5.5 modelini çıkardı
Anthropic’in 7 Ekim’de çıkardığı Claude Haiku 5.5, 100 bin token’a kadar Haiku 4.5’ten %90 ucuz. Testlerde öne geçiyor ama görev başına daha çok token harcıyor.
OpenAI GPT-6’yı ChatGPT’de herkese açmaya başladı
OpenAI, 7 Ekim’de GPT-6’yı ChatGPT’de herkese açmaya başladı. Yeni Intelligent UI, cevapları metin, görsel ve etkileşimli öğeleri birleştirerek kuruyor.
Avrupa, ABD ve Çin arasında açık model savaşı kızıştı
Mistral, 6 Ekim’de Large 4’ü tanıttı. Aynı hafta Ecosia Mistral’i bıraktı, Reflection Beam’i duyurdu, DeepSeek’in 12 milyar dolarlık tura yaklaştığı bildirildi.