Bir otomobili sürmek için geliştirilen sistemlerle genel amaçlı yapay zeka modelleri arasında büyük bir fark var. Sürücüsüz araçlarda kullanılan yazılımlar belirli görevler için özel olarak hazırlanırken, büyük dil modelleri çok daha geniş bir kullanım alanına sahip. DrivingBench ekibi de bu farkın sınırlarını görmek için GPT-6 Astra, Claude Fable 5.1, Grok 4.6 ve GPT-5.6 Sol'u gerçek bir otomobilin direksiyonuna geçirdi.
Testlerde bir Toyota Corolla kullanıldı. Modeller, araç üzerindeki kameralardan gelen görüntülere bakarak direksiyon komutları üretti ve 130 metrelik parkuru tamamlamaya çalıştı. Sonuçlar ise yapay zeka sistemlerinin sürüş konusunda henüz birbirinden oldukça farklı seviyelerde olduğunu ortaya koydu.
İlk sorun: aracı hareket ettirmek
Deney başlamadan önce araştırmacıların beklemediği bir engel ortaya çıktı. Bazı modeller güvenlik gerekçesiyle otomobili kullanmak istemedi. GPT-6 Astra, parkurun boş bir alanda bulunmasına ve hızların düşük tutulmasına rağmen sürüş talebini birkaç kez geri çevirdi. Araştırma ekibi daha sonra sistemde kullanılan bileşenlerden birinin adına "güvenli alan" ifadesini ekledi. Bu değişikliğin ardından model güvenlik engelini aşarak sürüşe başladı.
Asıl fark ise araç hareket ettikten sonra görüldü. GPT-5.6 Sol üç denemenin sonunda parkurun yalnızca yüzde 6'sını tamamlayabildi. En uzun sürüşü 17,1 metreyle sınırlı kaldı ve sonraki denemelerde belirgin bir gelişme gösteremedi.
We gave ChatGPT, Claude, and Grok control of a real Toyota Corolla 🚗, steering/gas/brakes, no human driving (just a foot over the brake).
Only one model was able to complete our entire driving course. Introducing DrivingBench. 🔥⌛️🏁 https://t.co/HhukXrByus— DrivingBench (@DrivingBench) September 21, 2026
Grok 4.6 biraz daha ileri gitti. Model parkurun yaklaşık yüzde 11'ini tamamladı ve 22,6 metreye kadar ulaşabildi. Claude Fable 5.1 ise üçüncü denemesinde 130 metrelik rotanın yaklaşık yarısını geride bıraktı.
Parkuru tamamlayan tek model GPT-6 Astra oldu
Testin en başarılı sonucu GPT-6 Astra'dan geldi. İlk turunda parkurun ortalarında kalan model, sonraki denemelerde daha iyi performans sergiledi ve sonunda 130 metrelik rotanın tamamına ulaştı.
Deneydeki hızların oldukça düşük tutulması ve genel başarı seviyesinin sınırlı kalması, bu sistemlerin gerçek trafik koşullarına hazır olduğu anlamına gelmiyor. Buna karşılık DrivingBench ekibi, doğrudan araç sürmek için tasarlanmayan genel amaçlı yapay zeka modellerinin kamera verilerini kullanarak direksiyon kontrolü öğrenebilmesini dikkat çekici buluyor.
Araştırmacılara göre daha zengin eğitim verileri, daha düşük gecikme süreleri ve gelişmiş çıkarım yetenekleri bu tür denemelerin sonuçlarını ileride değiştirebilir. Ancak çalışma aynı zamanda güvenlik ve hizalama sorunlarının, yapay zekanın fiziksel dünyada kontrol üstlendiği uygulamalarda ne kadar kritik olduğunu da gösteriyor.