İçeriğe geç
English

Araştırma · Modeller · Anthropic

C5R’ın yapay zekanın yönettiği laboratuvarında en iyi model görevlerin yalnızca %45’ini başardı

Yayın: 2 kaynakEnglish

San Francisco merkezli C5R, 24 Eylül’de on iki haftada kurduğu ve biyoloji, kimya ile malzeme bilimini birleştiren Facility-0 laboratuvarını ve modellerin fiziksel deneyleri ne kadar yürütebildiğini ölçen SciUniverse testini tanıttı. Öncü modellerin başarı oranı %9,4 ile %45,3 arasında kaldı; ilk sırada %45,3 ile Anthropic’in Claude Fable 5.1’i var. Hatalar tekrar eden türden: donmuş numuneyi pipetle çekmeye çalışmak, DNA içeren kuyucuklarda aynı pipet ucunu yeniden kullanmak, kapağı açık plakaları çalkalamak, spektroskopi verisindeki gürültüyü yanlış okumak. Sonuç şu: modeller bilimi biliyor ama laboratuvarın fiziksel gerçekliğini sezemiyor.

Kaynaklar

  1. C5R, X paylaşımı (@c5rcorp), (x.com)
  2. C5R, “Can frontier models carry out scientific work?” (c5r.net)

Bu haber hakkında

Bu haber Instagram’da @jarrus.ai hesabında 29 Eylül 2026 tarihinde paylaşıldı.

Bu haberde bir hata mı var? [email protected] · Instagram

Bu haberin İngilizcesi: In C5R’s AI-run lab, the best model completed only 45% of the tasks

Aynı konuda