Modeller · Çip ve donanım · Alibaba
Açık kaynak bir motor, 125 milyar parametreli Qwen modelini 12 GB’lık bir oyun ekran kartında saniyede 60-95 token hızında çalıştırıyor
Strata adlı açık kaynak (MIT lisanslı) motor, Alibaba’nın ağustosta yayımladığı Qwen3.8-Flash-Next modelini sıradan bir oyun bilgisayarında çalıştırıyor. Model 125 milyar parametreli ama uzman karışımı mimarisi sayesinde her token için yalnızca yaklaşık 6 milyarı devreye giriyor. En sık kullanılan uzmanlar ekran kartında, tamamı RAM’de tutuluyor. Projenin kendi ölçümüne göre 12 GB’lık RTX 5070’te en sıkıştırılmış sürüm saniyede 94 token yazıyor, daha büyük sürümler 53 ile 79 arasında kalıyor. En az 32 GB RAM gerekiyor. Rakamları henüz bağımsız bir test doğrulamadı.
Kaynaklar
- Strata (GitHub), “Strata”, açık kaynak çıkarım motorunun GitHub deposu, (github.com)
- Qwen (Alibaba), “Qwen3.8-Flash-Next”, Qwen ekibinin model deposu ve sürüm notu, (github.com)
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 5 Ekim 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/h11-18
Bu haberin İngilizcesi: An open-source engine runs a 125-billion-parameter Qwen model on a 12 GB gaming graphics card at 60-95 tokens per second
Aynı konuda
Anthropic %90 daha ucuz Claude Haiku 5.5 modelini çıkardı
Anthropic’in 7 Ekim’de çıkardığı Claude Haiku 5.5, 100 bin token’a kadar Haiku 4.5’ten %90 ucuz. Testlerde öne geçiyor ama görev başına daha çok token harcıyor.
OpenAI GPT-6’yı ChatGPT’de herkese açmaya başladı
OpenAI, 7 Ekim’de GPT-6’yı ChatGPT’de herkese açmaya başladı. Yeni Intelligent UI, cevapları metin, görsel ve etkileşimli öğeleri birleştirerek kuruyor.
Microsoft, 120 milyar parametreli modelleri yerel olarak çalıştırabilen 5.999 dolarlık bir geliştirici bilgisayarını ön siparişe açtı
Microsoft, Nvidia’nın RTX Spark süper çipini taşıyan Surface RTX Spark Dev Box’ı 7 Ekim’de 5.999 dolardan ön siparişe açtı; teslimatlar Kasım’da başlıyor.