Çin ile ABD merkezli yapay zeka şirketleri arasındaki rekabet hız kesmeden devam ediyor. Alibaba da bu yarışta yeni kozunu ortaya koydu. Şirket, bugüne kadar geliştirdiği en büyük ve en güçlü yapay zeka modeli olan Qwen3.8-Max'i duyurdu.
Model şu anda QwenCloud üzerinden kullanılabiliyor. Alibaba, model ağırlıklarını ise gelecek hafta Hugging Face ve ModelScope üzerinden açık kaynak olarak paylaşacağını açıkladı.
2,4 trilyon parametreye sahip
Qwen3.8-Max, 2,4 trilyon toplam parametreye sahip bir "mixture-of-experts" (MoE) modeli olarak geliştirildi. Ancak her istekte bunların yalnızca 95 milyar parametresi aktif hale geliyor. Bu yöntem hem işlem maliyetini hem de yanıt süresini düşürmeyi hedefliyor.
Model yalnızca metin değil; görsel ve video içeriklerini de işleyebiliyor. Ayrıca 1 milyon tokene kadar bağlam penceresi desteği sunuyor. Bu da tek seferde çok daha uzun belgeler ve kapsamlı projeler üzerinde çalışabilmesini sağlıyor.
Günlerce durmadan yazılım geliştirebiliyor
Alibaba'nın paylaştığı bilgilere göre Qwen3.8-Max, otonom yazılım geliştirme görevlerini 10 günden uzun süre kesintisiz sürdürebiliyor.
Şirket, modelin kurum içindeki bir yazılım mühendisliği projesini 16 günde tamamladığını da belirtti. Bu nedenle Alibaba, yeni modeli özellikle kod geliştirme ve uzun süre bağımsız çalışması gereken yapay zeka ajanı görevleri için konumlandırıyor.
Çinli yapay zeka şirketleri farkı kapatıyor
Qwen3.8-Max'in tanıtılması, Çinli şirketlerin ABD merkezli rakiplerine hızla yaklaştığını gösteren son örneklerden biri oldu.
Kısa süre önce Moonshot AI, 2,8 trilyon parametreli Kimi K3 modelini duyurmuştu. DeepSeek ise geçtiğimiz hafta yayımladığı DeepSeek-V4-Flash modeliyle özellikle kodlama ve yapay zeka ajanı görevlerinde önemli geliştirmeler sunduğunu açıklamıştı.
Performans testlerinde öne çıkan sonuçlar
Alibaba'nın paylaştığı resmi test sonuçlarına göre Qwen3.8-Max;
Kodlama, yapay zeka ajanı ve genel yetenekleri ölçen 7 farklı değerlendirmede Fable 5 ve GPT-5.6 Sol'u geride bıraktı.
Görüntü ve çok modlu yapay zeka testlerinde ise 36 farklı kıyaslamanın büyük bölümünde rakip modellerden daha yüksek puan aldı.
Kod üretimi, belge analizi, OCR, video anlama, mobil uygulama kullanımı ve görsel muhakeme gibi birçok alanda önceki Qwen sürümüne göre önemli artış gösterdi.
Bu sonuçlar şirketin kendi paylaştığı benchmark verilerine dayanıyor. Farklı kullanım senaryolarında gerçek performans değişiklik gösterebilir.
Fiyat rekabeti hızlanabilir
Çin merkezli yapay zeka modellerinin hızlı yükselişi, OpenAI ve Anthropic üzerindeki rekabet baskısını artırıyor. Bu durumun önümüzdeki dönemde yapay zeka servislerinde daha düşük fiyatlar, daha esnek kullanım seçenekleri ve geliştiricilere yönelik yeni dağıtım modellerini beraberinde getirmesi bekleniyor.
Kodlama ve yapay zeka ajanı testleri
| Test | Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| DeepSWE 1.1 | 59.0 | 70.0 | 73.0 | 21.6 | 56.6 |
| NL2Repo-Bench | 69.4 | — | — | 47.2 | 55.9 |
| FrontierSWE | 70.0 | 88.8 | — | 40.7 | 73.5 |
| MLS-Bench-Lite | 42.8 | 49.9 | 46.2 | 31.7 | 41.0 |
| PaperBench | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
| AndroidBench | 69.8 | 84.5 | 74.0 | 56.5 | 70.2 |
| QwenSWEBench | 84.0 | 86.3 | 73.5 | 63.4 | 80.7 |
| QwenQoderBench | 62.7 | 63.1 | 53.8 | 36.8 | 58.4 |
| QwenReactBench | 1694 | 1770 | 1564 | 1538 | 1724 |
| QwenSVGBench | 1648 | 1690 | 1758 | 1499 | 1713 |
Genel yapay zeka ajanı testleri
| Test | Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
| CoWorkBench | 72.3 | 75.9 | 71.5 | 64.6 | 74.8 |
| WorkSpaceBench | 66.8 | 68.7 | 65.6 | 61.4 | 67.7 |
| JobBench | 48.4 | 57.4 | 45.4 | 31.3 | 53.4 |
| SkillsBench | 65.1 | 70.9 | 73.5 | 61.2 | 70.2 |
| Agents' Last Exam | 27.0 / 45.1 | — | 30.6 / 53.6 | 11.8 / 31.1 | 27.0 / 52.4 |
| Automation-Bench | 27.2 | 29.1 | 29.7 | 14.2 | 27.3 |
| Toolathlon Verified | 76.2 | 77.9 | 74.9 | 49.7 | 72.5 |
| WideSearch | 72.9 | 81.2 | — | 75.2 | 81.9 |
| HLE w/ Tools | 57.9 | 64.5 | 58.0 | 53.5 | 56.2 |
Genel yetenek testleri
| Test | Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
| GPQA Diamond | 92.0 | 92.6 | 94.1 | 92.4 | 92.6 |
| HLE | 45.7 | 53.3 | 47.2 | 41.4 | 43.6 |
| IFBench | 62.2 | 63.5 | 72.7 | 79.1 | 82.8 |
| $OneMillion-Bench | 41.8 | 55.9 | 53.8 | 44.4 | 52.5 |
| HealthBench | 52.4 | — | 55.3 | 54.5 | 60.2 |
| PLawBench | 69.6 | 70.2 | 72.3 | 58.9 | 73.2 |
| PRBench-Legal | 52.7 | 57.6 | 57.6 | 48.5 | 57.6 |
| PRBench-Finance | 51.9 | 55.8 | 55.5 | 46.8 | 58.3 |
| MRCR v2 256K | 83.2 | — | 93.8 | 86.7 | 92.9 |
| LongBench v2 | 69.1 | — | 67.1 | 65.3 | 66.3 |
Çok modlu (multimodal) testler
Muhakeme ve görsel anlama
| Test | Fable 5 | Gemini 3.1 Pro | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|---|---|
| MMMU-Pro | 81.2 | 80.5 | 83.0 | 82.3 |
| MathVision | 92.7 | 87.4 | 90.8 | 95.2 |
| BabyVision | 42.5 | 55.9 | 65.5 | 82.0 |
| HLE-VL | — | 43.9 | 51.2 | 52.2 |
| LogicVista | 85.7 | 82.6 | 89.7 | 91.9 |
| HiPhO | 78.6 | 85.4 | 86.8 | 90.0 |
| PhyX | 71.7 | 79.4 | 79.1 | 83.5 |
| SLAKE | 86.6 | 82.9 | 85.1 | 90.8 |
| PMC-VQA | 63.2 | 62.5 | 62.3 | 66.2 |
Görsel ajan ve kodlama
| Test | Fable 5 | Gemini 3.1 Pro | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|---|---|
| OSWorld Verified | 85.0 | 76.2 | 83.2 | 86.1 |
| ScreenSpot Pro | 87.3 | 68.1 | 81.3 | 84.5 |
| WebArena Verified | 71.3 | 64.3 | 69.7 | 66.8 |
| AndroidWorld | 88.8 | 70.7 | 77.6 | 85.3 |
| MobileWorld | 85.5 | 58.1 | 76.9 | 77.8 |
| Vision2Web | 70.5 | — | 62.1 | 69.0 |
| Parametric CAD Bench | 87.5 | 73.5 | 86.2 | 91.5 |
Belge ve ofis görevleri
| Test | Fable 5 | Gemini 3.1 Pro | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|---|---|
| CharXiv | 87.9 | 84.4 | 85.1 | 88.4 |
| OmniDocBench 1.5 | 89.5 | 90.0 | 86.7 | 92.1 |
| OCR-Bench V2 | 65.3 | 64.6 | 69.0 | 74.2 |
| CC-OCR-Bench V2 | 72.4 | 68.9 | 68.0 | 79.6 |
| MTVQA-Test | 41.6 | 54.3 | 52.7 | 56.6 |
| MADQA | 86.0 | 81.1 | 87.8 | 91.8 |
| QwenVisualOffice | 32.4 | 39.6 | 29.5 | 44.6 |
Gerçek dünya ve video testleri
| Test | Fable 5 | Gemini 3.1 Pro | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|---|---|
| RealWorldQA | 85.9 | 83.5 | 83.7 | 88.0 |
| ERQA | 70.0 | 68.0 | 70.0 | 77.8 |
| LingoQA | 77.4 | 66.8 | 72.6 | 84.8 |
| VideoMME | — | 86.7 | 89.5 | 90.4 |
| VideoMMMU | 81.2 | 85.3 | 85.0 | 88.7 |
| MMVU | 72.0 | 77.9 | 81.2 | 82.4 |
| MLVU | — | 84.7 | 87.6 | 90.8 |
| TVBench | — | 73.0 | 83.2 | 81.9 |
| LVBench | — | 75.1 | 78.8 | 81.8 |
| EgoLife | 82.3 | — | 70.8 | 80.3 |
| VideoDR | 77.1 | — | 71.3 | 73.2 |