Araştırma · Modeller · Anthropic
C5R’ın yapay zekanın yönettiği laboratuvarında en iyi model görevlerin yalnızca %45’ini başardı
San Francisco merkezli C5R, 24 Eylül’de on iki haftada kurduğu ve biyoloji, kimya ile malzeme bilimini birleştiren Facility-0 laboratuvarını ve modellerin fiziksel deneyleri ne kadar yürütebildiğini ölçen SciUniverse testini tanıttı. Öncü modellerin başarı oranı %9,4 ile %45,3 arasında kaldı; ilk sırada %45,3 ile Anthropic’in Claude Fable 5.1’i var. Hatalar tekrar eden türden: donmuş numuneyi pipetle çekmeye çalışmak, DNA içeren kuyucuklarda aynı pipet ucunu yeniden kullanmak, kapağı açık plakaları çalkalamak, spektroskopi verisindeki gürültüyü yanlış okumak. Sonuç şu: modeller bilimi biliyor ama laboratuvarın fiziksel gerçekliğini sezemiyor.
Kaynaklar
- C5R, X paylaşımı (@c5rcorp), (x.com)
- C5R, “Can frontier models carry out scientific work?” (c5r.net)
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 29 Eylül 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/sciuniverse-testi
Bu haberin İngilizcesi: In C5R’s AI-run lab, the best model completed only 45% of the tasks
Aynı konuda
Robot testleri: en iyi model bile 84 robot görevinin sadece %19’unu başardı, 63 görev hiçbir model tarafından çözülemedi
7 Ekim’de yayımlanan RobotWorld testinde en iyi model GPT-6 Astra, 84 simülasyon görevinin yalnızca 16’sını tamamladı; 63 görevi hiçbir model çözemedi.
OpenAI’ın görsel modeli, yoğun metin içeren görsellerde neredeyse kusursuz skor aldı
Westlake Üniversitesi öncülüğündeki UltraText Bench testinde OpenAI’ın GPT Image 2 modeli 100 üzerinden 99,35 puanla 24 yapılandırma arasında birinci oldu.
AWS, Çin’in GLM 5.3 modelini kendi platformuna ekledi
AWS, Pekin merkezli Z.ai’nin (eski adıyla Zhipu AI) 753 milyar parametreli GLM 5.3 modelini 5 Ekim’de uygun kurumsal müşteriler için Amazon Bedrock’a ekledi.