GPT, Claude ve Grok otomobil kullandı, parkuru yalnızca biri tamamladı

Büyük dil modelleri bu kez metin üretmek yerine direksiyon başına geçti. Dört yapay zeka modeli, kameralarla donatılmış bir Toyota Corolla'yı 130 metrelik parkurda sürmeye çalıştı; bazıları birkaç metre sonra kalırken bir model rotanın tamamını bitirdi.

GPT, Claude ve Grok otomobil kullandı, parkuru yalnızca biri tamamladı

Bir otomobili sürmek için geliştirilen sistemlerle genel amaçlı yapay zeka modelleri arasında büyük bir fark var. Sürücüsüz araçlarda kullanılan yazılımlar belirli görevler için özel olarak hazırlanırken, büyük dil modelleri çok daha geniş bir kullanım alanına sahip. DrivingBench ekibi de bu farkın sınırlarını görmek için GPT-6 Astra, Claude Fable 5.1, Grok 4.6 ve GPT-5.6 Sol'u gerçek bir otomobilin direksiyonuna geçirdi.

Testlerde bir Toyota Corolla kullanıldı. Modeller, araç üzerindeki kameralardan gelen görüntülere bakarak direksiyon komutları üretti ve 130 metrelik parkuru tamamlamaya çalıştı. Sonuçlar ise yapay zeka sistemlerinin sürüş konusunda henüz birbirinden oldukça farklı seviyelerde olduğunu ortaya koydu.

İlk sorun: aracı hareket ettirmek

Deney başlamadan önce araştırmacıların beklemediği bir engel ortaya çıktı. Bazı modeller güvenlik gerekçesiyle otomobili kullanmak istemedi. GPT-6 Astra, parkurun boş bir alanda bulunmasına ve hızların düşük tutulmasına rağmen sürüş talebini birkaç kez geri çevirdi. Araştırma ekibi daha sonra sistemde kullanılan bileşenlerden birinin adına "güvenli alan" ifadesini ekledi. Bu değişikliğin ardından model güvenlik engelini aşarak sürüşe başladı.

Asıl fark ise araç hareket ettikten sonra görüldü. GPT-5.6 Sol üç denemenin sonunda parkurun yalnızca yüzde 6'sını tamamlayabildi. En uzun sürüşü 17,1 metreyle sınırlı kaldı ve sonraki denemelerde belirgin bir gelişme gösteremedi.

Grok 4.6 biraz daha ileri gitti. Model parkurun yaklaşık yüzde 11'ini tamamladı ve 22,6 metreye kadar ulaşabildi. Claude Fable 5.1 ise üçüncü denemesinde 130 metrelik rotanın yaklaşık yarısını geride bıraktı.

Parkuru tamamlayan tek model GPT-6 Astra oldu

Testin en başarılı sonucu GPT-6 Astra'dan geldi. İlk turunda parkurun ortalarında kalan model, sonraki denemelerde daha iyi performans sergiledi ve sonunda 130 metrelik rotanın tamamına ulaştı.

Deneydeki hızların oldukça düşük tutulması ve genel başarı seviyesinin sınırlı kalması, bu sistemlerin gerçek trafik koşullarına hazır olduğu anlamına gelmiyor. Buna karşılık DrivingBench ekibi, doğrudan araç sürmek için tasarlanmayan genel amaçlı yapay zeka modellerinin kamera verilerini kullanarak direksiyon kontrolü öğrenebilmesini dikkat çekici buluyor.

Araştırmacılara göre daha zengin eğitim verileri, daha düşük gecikme süreleri ve gelişmiş çıkarım yetenekleri bu tür denemelerin sonuçlarını ileride değiştirebilir. Ancak çalışma aynı zamanda güvenlik ve hizalama sorunlarının, yapay zekanın fiziksel dünyada kontrol üstlendiği uygulamalarda ne kadar kritik olduğunu da gösteriyor.