Kullanıcılar Opus 5.5’in performansının düştüğünü iddia etti, bağımsız ölçüm normal dalgalanma aralığında olduğunu gösterdi
Bu haber yayımlandıktan sonra güncellendi (9 Ekim 2026). Ayrıntılar
Anthropic’in 22 Eylül’de çıkardığı Claude Opus 5.5 için X ve Reddit’teki kullanıcılar, modelin çıkıştan sonra kötüleştiğini öne sürüyor. Modelleri düzenli olarak yeniden test eden BridgeMind’ın NerfBench ölçümünde Opus 5.5, 2 Ekim’de çıkıştaki puanının yüzde 94,2’sine indi, 4 Ekim’deki son testte yüzde 96,5’te. BridgeMind yüzde 90 ile 110 arasını normal dalgalanma sayıyor, yani bu bir kalite düşüşü kanıtı değil. Ancak şimdiye kadar yalnızca beş test yapıldı. Olası bir başka açıklama: Anthropic’in belgelerine göre Opus 5.5 varsayılan olarak orta efor seviyesinde çalışıyor, Opus 5’te bu ayar yüksekti.
Kaynaklar
- Anthropic, “Introducing Claude Opus 5.5”, (anthropic.com)
- BridgeBench (BridgeMind), “Claude Opus 5.5 — Nerf Bench” (bridgebench.ai)
- BridgeMind (X), X paylaşımı: Opus 5.5'in NerfBench'te yüzde 94,2'ye düştüğü, (x.com)
- Anthropic (Claude Platform Docs), “Claude Opus 5.5 migration guide” (platform.claude.com)
Düzeltmeler ve güncellemeler
- Bu haber yayımlandıktan sonra NerfBench 9 Ekim’de altıncı ölçümü ekledi: Opus 5.5 çıkış puanının yüzde 95,7’sinde. Değer hâlâ yüzde 90 ile 110 arasındaki normal dalgalanma aralığında; haberin sonucu değişmiyor.
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 5 Ekim 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/opus-5-5-nerfbench
Bu haberin İngilizcesi: Users claimed Opus 5.5’s performance has dropped; an independent measurement showed it within the normal range of variation
Aynı konuda
Robot testleri: en iyi model bile 84 robot görevinin sadece %19’unu başardı, 63 görev hiçbir model tarafından çözülemedi
7 Ekim’de yayımlanan RobotWorld testinde en iyi model GPT-6 Astra, 84 simülasyon görevinin yalnızca 16’sını tamamladı; 63 görevi hiçbir model çözemedi.
AWS, Çin’in GLM 5.3 modelini kendi platformuna ekledi
AWS, Pekin merkezli Z.ai’nin (eski adıyla Zhipu AI) 753 milyar parametreli GLM 5.3 modelini 5 Ekim’de uygun kurumsal müşteriler için Amazon Bedrock’a ekledi.
Microsoft, biri 60 dilde gerçek zamanlı yazıya döken üç yeni ses modeli çıkardı
Microsoft AI 1 Ekim’de üç ses modeli duyurdu: 60 dilde gerçek zamanlı yazıya döken MAI-Transcribe-2-Streaming ve 23 dilli MAI-Voice-2.1 ile Flash sürümü.