AI Evaluator Forum’un AEF-1 standardı bağımsız değerlendirmelerde kullanılmaya başladı
Bu haber yayımlandıktan sonra düzeltildi (9 Ekim 2026). Ayrıntılar
Aralık 2025’te kurulan AI Evaluator Forum’un standardı beş sütun tanımlıyor: yeterli erişim ve kaynak, çıkar çatışmasının asgariye indirilmesi, analitik özerklik, şeffaf yöntem ve sonuçlar, hassas bilginin korunması. Standart Anthropic, Google, Meta ve OpenAI’ı kapsayan bağımsız değerlendirmelerde kullanılmaya başladı. Karşı okuma aynı hafta geldi: yüzden fazla uzman imzaladıkları açık mektupta Anthropic ve OpenAI’ın gerçekten bağımsız güvenlik değerlendiricilerine ihtiyacı olduğunu söyledi.
Kaynaklar
- AI Evaluator Forum, “AEF-1: Minimum Operating Conditions for Independent Third Party AI Evaluations”, (aievaluatorforum.org)
- AI Evaluator Forum, “Minimum Conditions for Embedding Evaluators”, açık mektup, (aievaluatorforum.org)
- International Business Times, “More Than 100 AI Experts Sign a Letter Saying that OpenAI & Anthropic Need Independent AI Safety Evaluators”, (ibtimes.com)
Düzeltmeler ve güncellemeler
- Instagram’da yayımlanan ilk metnin başlığında xAI, OpenAI ve Anthropic’in AEF-1 standardını birlikte imzaladığı yazıyordu. AI Evaluator Forum’un sayfasında imzacı şirket listesi yok ve şirketlerin standardı imzaladığını gösteren bir kaynak bulunamadı; başlık düzeltildi.
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 21 Eylül 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/aef-1-standardi
Bu haberin İngilizcesi: The AI Evaluator Forum’s AEF-1 standard has started appearing in independent assessments
Aynı konuda
Robot testleri: en iyi model bile 84 robot görevinin sadece %19’unu başardı, 63 görev hiçbir model tarafından çözülemedi
7 Ekim’de yayımlanan RobotWorld testinde en iyi model GPT-6 Astra, 84 simülasyon görevinin yalnızca 16’sını tamamladı; 63 görevi hiçbir model çözemedi.
OpenAI’ın görsel modeli, yoğun metin içeren görsellerde neredeyse kusursuz skor aldı
Westlake Üniversitesi öncülüğündeki UltraText Bench testinde OpenAI’ın GPT Image 2 modeli 100 üzerinden 99,35 puanla 24 yapılandırma arasında birinci oldu.
AWS, Çin’in GLM 5.3 modelini kendi platformuna ekledi
AWS, Pekin merkezli Z.ai’nin (eski adıyla Zhipu AI) 753 milyar parametreli GLM 5.3 modelini 5 Ekim’de uygun kurumsal müşteriler için Amazon Bedrock’a ekledi.