Alibaba'dan OpenAI'a dev meydan okuma: Qwen3.8-Max resmen tanıtıldı

Alibaba, şimdiye kadarki en büyük yapay zeka modeli Qwen3.8-Max'i tanıttı. 2,4 trilyon parametreye sahip model; kodlama, görüntü işleme ve uzun süreli yapay zeka ajanı görevleriyle dikkat çekiyor.

Alibaba'dan OpenAI'a dev meydan okuma: Qwen3.8-Max resmen tanıtıldı

Çin ile ABD merkezli yapay zeka şirketleri arasındaki rekabet hız kesmeden devam ediyor. Alibaba da bu yarışta yeni kozunu ortaya koydu. Şirket, bugüne kadar geliştirdiği en büyük ve en güçlü yapay zeka modeli olan Qwen3.8-Max'i duyurdu.

Model şu anda QwenCloud üzerinden kullanılabiliyor. Alibaba, model ağırlıklarını ise gelecek hafta Hugging Face ve ModelScope üzerinden açık kaynak olarak paylaşacağını açıkladı.

2,4 trilyon parametreye sahip

Qwen3.8-Max, 2,4 trilyon toplam parametreye sahip bir "mixture-of-experts" (MoE) modeli olarak geliştirildi. Ancak her istekte bunların yalnızca 95 milyar parametresi aktif hale geliyor. Bu yöntem hem işlem maliyetini hem de yanıt süresini düşürmeyi hedefliyor.

Model yalnızca metin değil; görsel ve video içeriklerini de işleyebiliyor. Ayrıca 1 milyon tokene kadar bağlam penceresi desteği sunuyor. Bu da tek seferde çok daha uzun belgeler ve kapsamlı projeler üzerinde çalışabilmesini sağlıyor.

Günlerce durmadan yazılım geliştirebiliyor

Alibaba'nın paylaştığı bilgilere göre Qwen3.8-Max, otonom yazılım geliştirme görevlerini 10 günden uzun süre kesintisiz sürdürebiliyor.

Şirket, modelin kurum içindeki bir yazılım mühendisliği projesini 16 günde tamamladığını da belirtti. Bu nedenle Alibaba, yeni modeli özellikle kod geliştirme ve uzun süre bağımsız çalışması gereken yapay zeka ajanı görevleri için konumlandırıyor.

Çinli yapay zeka şirketleri farkı kapatıyor

Qwen3.8-Max'in tanıtılması, Çinli şirketlerin ABD merkezli rakiplerine hızla yaklaştığını gösteren son örneklerden biri oldu.

Kısa süre önce Moonshot AI, 2,8 trilyon parametreli Kimi K3 modelini duyurmuştu. DeepSeek ise geçtiğimiz hafta yayımladığı DeepSeek-V4-Flash modeliyle özellikle kodlama ve yapay zeka ajanı görevlerinde önemli geliştirmeler sunduğunu açıklamıştı.

Performans testlerinde öne çıkan sonuçlar

Alibaba'nın paylaştığı resmi test sonuçlarına göre Qwen3.8-Max;

Kodlama, yapay zeka ajanı ve genel yetenekleri ölçen 7 farklı değerlendirmede Fable 5 ve GPT-5.6 Sol'u geride bıraktı.

Görüntü ve çok modlu yapay zeka testlerinde ise 36 farklı kıyaslamanın büyük bölümünde rakip modellerden daha yüksek puan aldı.

Kod üretimi, belge analizi, OCR, video anlama, mobil uygulama kullanımı ve görsel muhakeme gibi birçok alanda önceki Qwen sürümüne göre önemli artış gösterdi.

Bu sonuçlar şirketin kendi paylaştığı benchmark verilerine dayanıyor. Farklı kullanım senaryolarında gerçek performans değişiklik gösterebilir.

Fiyat rekabeti hızlanabilir

Çin merkezli yapay zeka modellerinin hızlı yükselişi, OpenAI ve Anthropic üzerindeki rekabet baskısını artırıyor. Bu durumun önümüzdeki dönemde yapay zeka servislerinde daha düşük fiyatlar, daha esnek kullanım seçenekleri ve geliştiricilere yönelik yeni dağıtım modellerini beraberinde getirmesi bekleniyor.

Kodlama ve yapay zeka ajanı testleri

Test Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max Qwen3.8-Max
Terminal Bench 2.1 84.6 84.6 88.8 74.5 86.6
SWE-bench Pro 69.2 80.0 64.6 60.6 67.7
DeepSWE 1.1 59.0 70.0 73.0 21.6 56.6
NL2Repo-Bench 69.4 47.2 55.9
FrontierSWE 70.0 88.8 40.7 73.5
MLS-Bench-Lite 42.8 49.9 46.2 31.7 41.0
PaperBench 80.3 88.8 90.5 64.8 93.0
AndroidBench 69.8 84.5 74.0 56.5 70.2
QwenSWEBench 84.0 86.3 73.5 63.4 80.7
QwenQoderBench 62.7 63.1 53.8 36.8 58.4
QwenReactBench 1694 1770 1564 1538 1724
QwenSVGBench 1648 1690 1758 1499 1713

Genel yapay zeka ajanı testleri

Test Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max Qwen3.8-Max
CoWorkBench 72.3 75.9 71.5 64.6 74.8
WorkSpaceBench 66.8 68.7 65.6 61.4 67.7
JobBench 48.4 57.4 45.4 31.3 53.4
SkillsBench 65.1 70.9 73.5 61.2 70.2
Agents' Last Exam 27.0 / 45.1 30.6 / 53.6 11.8 / 31.1 27.0 / 52.4
Automation-Bench 27.2 29.1 29.7 14.2 27.3
Toolathlon Verified 76.2 77.9 74.9 49.7 72.5
WideSearch 72.9 81.2 75.2 81.9
HLE w/ Tools 57.9 64.5 58.0 53.5 56.2

Genel yetenek testleri

Test Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max Qwen3.8-Max
GPQA Diamond 92.0 92.6 94.1 92.4 92.6
HLE 45.7 53.3 47.2 41.4 43.6
IFBench 62.2 63.5 72.7 79.1 82.8
$OneMillion-Bench 41.8 55.9 53.8 44.4 52.5
HealthBench 52.4 55.3 54.5 60.2
PLawBench 69.6 70.2 72.3 58.9 73.2
PRBench-Legal 52.7 57.6 57.6 48.5 57.6
PRBench-Finance 51.9 55.8 55.5 46.8 58.3
MRCR v2 256K 83.2 93.8 86.7 92.9
LongBench v2 69.1 67.1 65.3 66.3

Çok modlu (multimodal) testler

Muhakeme ve görsel anlama

Test Fable 5 Gemini 3.1 Pro GPT-5.6 Sol Qwen3.8-Max
MMMU-Pro 81.2 80.5 83.0 82.3
MathVision 92.7 87.4 90.8 95.2
BabyVision 42.5 55.9 65.5 82.0
HLE-VL 43.9 51.2 52.2
LogicVista 85.7 82.6 89.7 91.9
HiPhO 78.6 85.4 86.8 90.0
PhyX 71.7 79.4 79.1 83.5
SLAKE 86.6 82.9 85.1 90.8
PMC-VQA 63.2 62.5 62.3 66.2

Görsel ajan ve kodlama

Test Fable 5 Gemini 3.1 Pro GPT-5.6 Sol Qwen3.8-Max
OSWorld Verified 85.0 76.2 83.2 86.1
ScreenSpot Pro 87.3 68.1 81.3 84.5
WebArena Verified 71.3 64.3 69.7 66.8
AndroidWorld 88.8 70.7 77.6 85.3
MobileWorld 85.5 58.1 76.9 77.8
Vision2Web 70.5 62.1 69.0
Parametric CAD Bench 87.5 73.5 86.2 91.5

Belge ve ofis görevleri

Test Fable 5 Gemini 3.1 Pro GPT-5.6 Sol Qwen3.8-Max
CharXiv 87.9 84.4 85.1 88.4
OmniDocBench 1.5 89.5 90.0 86.7 92.1
OCR-Bench V2 65.3 64.6 69.0 74.2
CC-OCR-Bench V2 72.4 68.9 68.0 79.6
MTVQA-Test 41.6 54.3 52.7 56.6
MADQA 86.0 81.1 87.8 91.8
QwenVisualOffice 32.4 39.6 29.5 44.6

Gerçek dünya ve video testleri

Test Fable 5 Gemini 3.1 Pro GPT-5.6 Sol Qwen3.8-Max
RealWorldQA 85.9 83.5 83.7 88.0
ERQA 70.0 68.0 70.0 77.8
LingoQA 77.4 66.8 72.6 84.8
VideoMME 86.7 89.5 90.4
VideoMMMU 81.2 85.3 85.0 88.7
MMVU 72.0 77.9 81.2 82.4
MLVU 84.7 87.6 90.8
TVBench 73.0 83.2 81.9
LVBench 75.1 78.8 81.8
EgoLife 82.3 70.8 80.3
VideoDR 77.1 71.3 73.2