Araştırma · Modeller · Anthropic
C5R’ın yapay zekanın yönettiği laboratuvarında en iyi model görevlerin yalnızca %45’ini başardı
San Francisco merkezli C5R, 24 Eylül’de on iki haftada kurduğu ve biyoloji, kimya ile malzeme bilimini birleştiren Facility-0 laboratuvarını ve modellerin fiziksel deneyleri ne kadar yürütebildiğini ölçen SciUniverse testini tanıttı. Öncü modellerin başarı oranı %9,4 ile %45,3 arasında kaldı; ilk sırada %45,3 ile Anthropic’in Claude Fable 5.1’i var. Hatalar tekrar eden türden: donmuş numuneyi pipetle çekmeye çalışmak, DNA içeren kuyucuklarda aynı pipet ucunu yeniden kullanmak, kapağı açık plakaları çalkalamak, spektroskopi verisindeki gürültüyü yanlış okumak. Sonuç şu: modeller bilimi biliyor ama laboratuvarın fiziksel gerçekliğini sezemiyor.
Kaynaklar
- C5R, X paylaşımı (@c5rcorp), (x.com)
- C5R, “Can frontier models carry out scientific work?” (c5r.net)
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 29 Eylül 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/h9-20
Bu haberin İngilizcesi: In C5R’s AI-run lab, the best model completed only 45% of the tasks
Aynı konuda
DeepMind’dan doğan ilaç keşif şirketi Isomorphic Labs, 40-50 milyar dolar değerlemeyle yatırım görüşüyor
Bloomberg’e göre DeepMind’dan doğan ilaç keşif şirketi Isomorphic Labs, en az 40 milyar dolar değerlemeyle yeni yatırım için ilk aşama görüşmeler yürütüyor.
Anthropic %90 daha ucuz Claude Haiku 5.5 modelini çıkardı
Anthropic’in 7 Ekim’de çıkardığı Claude Haiku 5.5, 100 bin token’a kadar Haiku 4.5’ten %90 ucuz. Testlerde öne geçiyor ama görev başına daha çok token harcıyor.
OpenAI GPT-6’yı ChatGPT’de herkese açmaya başladı
OpenAI, 7 Ekim’de GPT-6’yı ChatGPT’de herkese açmaya başladı. Yeni Intelligent UI, cevapları metin, görsel ve etkileşimli öğeleri birleştirerek kuruyor.