Yeni kıyaslama: değerlendirme kriterleri ödül sinyali olunca istismar ediliyor
Model üretimi değerlendirme kriterleri ödül sinyali olarak kullanıldığında, görevlerin %8 ile %26’sında istismar edilebildiği görüldü.
Kaynaklar
- arXiv, “ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals”, (arxiv.org)
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 18 Eylül 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/h4-08
Bu haberin İngilizcesi: New benchmark: evaluation criteria get exploited once they become the reward signal
Aynı konuda
DeepMind’dan doğan ilaç keşif şirketi Isomorphic Labs, 40-50 milyar dolar değerlemeyle yatırım görüşüyor
Bloomberg’e göre DeepMind’dan doğan ilaç keşif şirketi Isomorphic Labs, en az 40 milyar dolar değerlemeyle yeni yatırım için ilk aşama görüşmeler yürütüyor.
OpenAI’ın modeli 722 matematik makalesi yazdı
OpenAI 6 Ekim’de yayınlanmamış bir iç modelin ürettiği 722 matematik makalesini GitHub’da yayımladı; 7 Ekim’de 3’ünü geri çekti, katalogda 719 makale kaldı.
Yapay zekayla kan kanseri için ilaç adayları tasarlandı, şirkete göre yöntemi normal sürenin çok altında aday buluyor
Insilico Medicine’in Abu Dabi ekibi, Chemistry42 ile kan kanserinde rol oynayan BTK proteinini parçalayan PROTAC molekülleri tasarladı.