İçeriğe geç
English

Robotik · Araştırma · OpenAI

Robot testleri: en iyi model bile 84 robot görevinin sadece %19’unu başardı, 63 görev hiçbir model tarafından çözülemedi

Yayın: 1 kaynakEnglish

Aralarında HKUST, Stanford ve MIT’nin de bulunduğu 11 kurumdan 33 araştırmacı, 7 Ekim’de RobotWorld adlı yeni bir test yayımladı. Simülasyonda yürütülen 84 görev; nesne manipülasyonu, yürüme, sürüş ve dron kontrolünü kapsıyor. En iyi sonucu OpenAI’ın GPT-6 Astra modeli aldı: 84 görevin yalnızca 16’sını, yani yüzde 19’unu tamamladı. Anthropic’in Claude Opus 5.5 modeli 13 görevle (yüzde 15,5) ikinci oldu; Kimi K3 iki, DeepSeek V4.1 Flash ve Gemini 3.8 Flash birer görev başardı. Beş modelin başarıları birleştirildiğinde bile 63 görev çözümsüz kaldı. Araştırmacılara göre modeller hedef pozisyona ulaşsa da nesneyi kaybediyor, hatalarını geç düzeltiyor ya da bitmemiş işi bitmiş sanıyor.

Kaynaklar

  1. arXiv, “RobotWorld: Benchmarking Multimodal Agents for Robot Use Across Diverse Tasks and Embodiments”, (arxiv.org)

Bu haber hakkında

Bu haber Instagram’da @jarrus.ai hesabında 10 Ekim 2026 tarihinde paylaşıldı.

Bu haberde bir hata mı var? [email protected] · Instagram

Bu haberin İngilizcesi: Robot tests: even the best model completed only 19% of 84 robot tasks, and 63 tasks were solved by no model

Aynı konuda