İçeriğe geç
English

Anthropic · Modeller · Güvenlik

Anthropic, Opus’a yaklaşan Sonnet 5.5 modelini yayınladı

Yayın: Güncellendi: 5 kaynakEnglish

Bu haber yayımlandıktan sonra güncellendi (9 Ekim 2026). Ayrıntılar

Anthropic, Claude Sonnet 5.5’i Claude’un X hesabından (@claudeai) şöyle duyurdu: “Karşınızda Claude Sonnet 5.5, Claude 5.5 ailesinin ikinci modeli. Sonnet 5’e göre açık bir yükseltme; %30’dan fazla daha hızlı çalışıyor ve çoğu işte %30’a kadar daha ucuz.”

Sonnet 5.5, Terminal-Bench 4.0’da %70,6 ile Opus 5.5’i geçti, diğer testlerde de ona yakın kalıyor. Yine de öbür iki kodlama testinde, FrontierCode ve CursorBench’te önde olan Opus 5.5.

Daha fazla düşünmek her zaman işe yaramıyor. FrontierCode’da Sonnet 5.5, en yüksek ayar Max’te bir alt ayardan daha düşük puan aldı. Anthropic’e göre Max’te kod incelemesini daha sık alt ajanlara bölüyor; incelenen iki örnekte bu, zaman aşımına ya da görevin dışına taşan değişikliklere yol açtı.

FrontierCode 1.1 skoru

  • Opus 5.5 %54,4
  • Sonnet 5.5, Xhigh ayarı %52,1
  • Sonnet 5.5, Max ayarı (en yüksek) %46,2
  • Sonnet 5 %42,4

Artificial Analysis Intelligence Index’in ilk beş sırasından üçü artık Claude modellerinin. Sonnet 5.5, 56 puanla Fable 5.1’in bile önünde; yalnızca 58 puanlı Opus 5.5’in arkasında.

Bilgi tarafında ise iki yönlü bir tablo var. Artificial Analysis’in AA-Omniscience testinde Sonnet 5.5, Opus 5.5’ten daha az soruyu doğru yanıtladı. Buna karşılık doğru bilemediği sorularda yanlış cevap uydurma oranı Opus’tan düşük.

AA-Omniscience, en yüksek ayar

  • Doğruluk, Opus 5.5 %66
  • Doğruluk, Sonnet 5.5 %54
  • Halüsinasyon oranı, Opus 5.5 %59
  • Halüsinasyon oranı, Sonnet 5.5 %47 (düşük olan iyi)

Anthropic’e göre Sonnet 5.5, birkaç testte düşük ya da orta ayarda bile Sonnet 5’in en iyi skorunu yaklaşık onda bir maliyetle geçiyor. Anthropic’in grafiklerindeki bilgi işi testi AA-Briefcase’te de orta ayardaki Sonnet 5.5, Sonnet 5’in en iyi skorunun üstünde.

Ama bu ucuzluk en yüksek ayarda tersine dönüyor. Artificial Analysis’e göre Max ayarındaki Sonnet 5.5, bugüne kadar ölçtükleri modeller içinde görev başına en çok token harcayanı oldu. Maliyeti de Sonnet 5’ten yaklaşık %50 yüksek çıktı.

Görev başına çıktı token’ı

  • Sonnet 5.5, Max 193 bin
  • Opus 5.5, Max 119 bin
  • Sonnet 5, Max 118 bin
  • GPT-6 Astra, Max 27 bin
  • Sonnet 5.5, Medium 19 bin

Sonnet 5.5, Opus modellerindeki siber güvenlik önlemleriyle gelen ilk Sonnet. Anthropic, zararsız siber güvenlik işlerinde bile daha fazla ret beklenmesi gerektiğini söylüyor. Gizli akıl yürütmesini çekip başka modelleri eğitme girişimleri de ilk kez bir Sonnet’te engelleniyor.

Sonnet 5.5’teki yeni önlemler

  • Riskli siber güvenlik talebi → Sonnet 5 yanıtlıyor
  • Zararsız siber güvenlik işi → Daha fazla ret bekleniyor
  • Gizli akıl yürütmeyi çekme girişimi → Engelleniyor, yedek model yok

Sonnet 5.5, Pokémon Red’i yalnızca ekran görüntülerine bakarak bitiren ilk Sonnet modeli oldu. Anthropic ayrıca yüksek hacimli ve düşük maliyetli işler için tasarlanan Haiku 5.5’in önümüzdeki haftalarda geleceğini söylüyor.

İki not daha

  • Pokémon Red → Yalnızca ekran görüntüleriyle bitirdi
  • Claude Haiku 5.5 → Önümüzdeki haftalarda geliyor

X kullanıcısı @full_kelly_, Claude’un Sonnet 5.5 duyurusuna şu yanıtı verdi: “yapay zekayı yavaşlatmalıyız / neyse, işte Opus 5.5 / güncelleme: işte Sonnet 5.5”

Kaynaklar

  1. Claude (@claudeai), X paylaşımı (Sonnet 5.5 duyurusu), (x.com)
  2. Anthropic, “Introducing Claude Sonnet 5.5”, (anthropic.com)
  3. Anthropic, “System Card: Claude Sonnet 5.5”, (anthropic.com)
  4. Artificial Analysis, “Claude Sonnet 5.5 reaches #2 on the Artificial Analysis Intelligence Index”, (artificialanalysis.ai)
  5. Full Kelly (@full_kelly_), X paylaşımı (Claude'un duyurusuna yanıt), (x.com)

Düzeltmeler ve güncellemeler

  1. Instagram’da yayımlanan ilk metnin başlığında Sonnet 5.5 “Opus’tan iyi” diye geçiyordu; metinde de Artificial Analysis Intelligence Index’in ilk beş sırasından dördünün Claude modellerinin olduğu yazıyordu. Anthropic’in tablosunda Sonnet 5.5, Opus 5.5’i yalnızca Terminal-Bench 4.0’da geçiyor ve ilk beşte üç Claude modeli var; başlık ve metin düzeltildi.
  2. Bu haber yayımlandıktan sonra, Anthropic 7 Ekim’de Claude Haiku 5.5’i yayınladı ve aynı duyuruda Sonnet 5.5’in önbellek okuma fiyatını yarıya indirdi.

Bu haber hakkında

Bu haber Instagram’da @jarrus.ai hesabında 29 Eylül 2026 tarihinde paylaşıldı.

Bu haberde bir hata mı var? [email protected] · Instagram

Bu haberin İngilizcesi: Anthropic unveils Sonnet 5.5, a model that comes close to Opus

Aynı konuda