Robot testleri: en iyi model bile 84 robot görevinin sadece %19’unu başardı, 63 görev hiçbir model tarafından çözülemedi
Aralarında HKUST, Stanford ve MIT’nin de bulunduğu 11 kurumdan 33 araştırmacı, 7 Ekim’de RobotWorld adlı yeni bir test yayımladı. Simülasyonda yürütülen 84 görev; nesne manipülasyonu, yürüme, sürüş ve dron kontrolünü kapsıyor. En iyi sonucu OpenAI’ın GPT-6 Astra modeli aldı: 84 görevin yalnızca 16’sını, yani yüzde 19’unu tamamladı. Anthropic’in Claude Opus 5.5 modeli 13 görevle (yüzde 15,5) ikinci oldu; Kimi K3 iki, DeepSeek V4.1 Flash ve Gemini 3.8 Flash birer görev başardı. Beş modelin başarıları birleştirildiğinde bile 63 görev çözümsüz kaldı. Araştırmacılara göre modeller hedef pozisyona ulaşsa da nesneyi kaybediyor, hatalarını geç düzeltiyor ya da bitmemiş işi bitmiş sanıyor.
Kaynaklar
- arXiv, “RobotWorld: Benchmarking Multimodal Agents for Robot Use Across Diverse Tasks and Embodiments”, (arxiv.org)
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 10 Ekim 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/robotworld-testi
Bu haberin İngilizcesi: Robot tests: even the best model completed only 19% of 84 robot tasks, and 63 tasks were solved by no model
Aynı konuda
OpenAI’ın görsel modeli, yoğun metin içeren görsellerde neredeyse kusursuz skor aldı
Westlake Üniversitesi öncülüğündeki UltraText Bench testinde OpenAI’ın GPT Image 2 modeli 100 üzerinden 99,35 puanla 24 yapılandırma arasında birinci oldu.
ChatGPT’nin Mac uygulamasında özel sohbetleri açığa çıkarabilecek bir güvenlik açığı bulundu ve kapatıldı
Patrick Wardle’ın bulduğu CVE-2026-100754 açığı, ChatGPT’nin Mac uygulamasında sohbet geçmişini açığa çıkarabiliyordu; OpenAI açığı 25 Eylül’de giderdi.
Anthropic, Bay Area’da biyoloji deneyleri yapan bir laboratuvar işletiyor
Anthropic, Bay Area’da Claude’un insan gözetiminde otomatik laboratuvar cihazlarını yönetmesini hedefleyen bir biyoloji laboratuvarı işletiyor.