Modeller · Çip ve donanım · Alibaba
Açık kaynak bir motor, 125 milyar parametreli Qwen modelini 12 GB’lık bir oyun ekran kartında saniyede 60-95 token hızında çalıştırıyor
Strata adlı açık kaynak (MIT lisanslı) motor, Alibaba’nın ağustosta yayımladığı Qwen3.8-Flash-Next modelini sıradan bir oyun bilgisayarında çalıştırıyor. Model 125 milyar parametreli ama uzman karışımı mimarisi sayesinde her token için yalnızca yaklaşık 6 milyarı devreye giriyor. En sık kullanılan uzmanlar ekran kartında, tamamı RAM’de tutuluyor. Projenin kendi ölçümüne göre 12 GB’lık RTX 5070’te en sıkıştırılmış sürüm saniyede 94 token yazıyor, daha büyük sürümler 53 ile 79 arasında kalıyor. En az 32 GB RAM gerekiyor. Rakamları henüz bağımsız bir test doğrulamadı.
Kaynaklar
- Strata (GitHub), “Strata”, açık kaynak çıkarım motorunun GitHub deposu, (github.com)
- Qwen (Alibaba), “Qwen3.8-Flash-Next”, Qwen ekibinin model deposu ve sürüm notu, (github.com)
Bu haber hakkında
Bu haber Instagram’da @jarrus.ai hesabında 5 Ekim 2026 tarihinde paylaşıldı.
Bu haberde bir hata mı var? [email protected] · Instagram
Kısa link: thejarrus.com/strata-qwen
Bu haberin İngilizcesi: An open-source engine runs a 125-billion-parameter Qwen model on a 12 GB gaming graphics card at 60-95 tokens per second
Aynı konuda
AWS, Çin’in GLM 5.3 modelini kendi platformuna ekledi
AWS, Pekin merkezli Z.ai’nin (eski adıyla Zhipu AI) 753 milyar parametreli GLM 5.3 modelini 5 Ekim’de uygun kurumsal müşteriler için Amazon Bedrock’a ekledi.
Nvidia, 100 milyar parametreye kadar modelleri yerel çalıştıran DGX Spark’ın 64 GB’lık sürümünü tanıttı
Nvidia, masaüstü yapay zeka bilgisayarı DGX Spark’ın 23 Ekim’den itibaren 4.999 dolardan satılacak 64 GB’lık yapılandırmasını 2 Ekim’de duyurdu.
Microsoft, biri 60 dilde gerçek zamanlı yazıya döken üç yeni ses modeli çıkardı
Microsoft AI 1 Ekim’de üç ses modeli duyurdu: 60 dilde gerçek zamanlı yazıya döken MAI-Transcribe-2-Streaming ve 23 dilli MAI-Voice-2.1 ile Flash sürümü.