AI Claude, ChatGPT, Grok, Disuruh Setir Mobil, Siapa Paling Pintar?

Eksperimen menarik dilakukan oleh DrivinBench dengan membiarkan tiga Chatbot AI terdiri dari Grok, Claude, dan ChatGPT, mengemudi sebuah mobil Toyota Corolla secara bergantian. Hasilnya, chatbot ternyata gak pinter-pinter banget dalam mengendarai mobil, bahkan bisa dibilang masih amatir.
Kendaraan otonom sebenarnya sudah lama digadang-gadang sebagai masa depan transportasi. Elon Musk adalah salah satu yang memimpikan terciptanya kendaraan otonom lewat mobil Tesla.
"Saya pikir kita akan menyelesaikan semua fitur full self-driving tahun ini. Artinya, mobil akan mampu menemukan Anda di tempat parkir, menjemput Anda, dan membawa Anda sampai ke tujuan tanpa intervensi, tahun ini," kata Musk pada 2019.
Musk bahkan menegaskan keyakinannya terhadap prediksi tersebut. Sayang, sampai saat ini mobil yang bisa berkendaraan secara utuh masih belum tersedia. Meski perkembangannya berjalan lebih lambat dari yang diharapkan Musk, teknologi kendaraan otonom tetap menunjukkan kemajuan.
Saat ini sudah ada mobil yang mampu mengemudi sendiri, tapi tetap diawasi manusia. Layanan taksi seperti Waymo bahkan dapat mengantarkan penumpang tanpa memerlukan "spesialis otonom" untuk mengambil alih kendaraan ketika terjadi masalah.
Lantas, mengapa chatbot AI perlu dilibatkan dalam teknologi kendaraan otonom? Mobil yang dirancang secara khusus dan direkayasa untuk mengemudi secara mandiri memang memiliki kemampuan yang mengesankan. Namun, akan jauh lebih menarik jika algoritma dapat mempelajari cara mengemudi tanpa harus dirancang secara khusus untuk tugas tersebut.
AI generatif memang belum mampu melakukan hal itu. Namun, teknologi ini telah menunjukkan kemampuan untuk mempelajari tugas yang sebelumnya tidak secara khusus menjadi bagian dari proses pelatihannya. Karena itu, kelompok DrivingBench mencoba menguji kemampuan chatbot AI dalam mengemudikan mobil.
Battle Mengemudi Grok, Claude, dan Chat GPT
Dalam pengujian terbaru, DrivingBench meminta GPT-6 Astra, Claude Fable 5.1, Grok 4.6, dan GPT-5.6 Sol untuk mengemudikan sebuah Toyota Corolla. Para chatbot tersebut mendapatkan informasi mengenai lintasan lewat kamera yang dipasang di kendaraan. Berdasarkan informasi visual tersebut, chatbot diminta mengendalikan mobil dan melewati lintasan yang telah ditentukan.
Masalah pertama ternyata bukan bagaimana chatbot mengemudi, melainkan bagaimana meyakinkan mereka untuk mau mengemudi.
"Beberapa model, terutama GPT-6 Astra, terkadang menolak mengemudikan mobil secara fisik dengan alasan keselamatan. Bahkan ketika mobil berada di area yang benar-benar kosong, setelah kami memberikan seluruh langkah keselamatan, termasuk batas kecepatan yang sangat rendah dan manusia yang siap menginjak rem," kata tim DrivingBench dalam sebuah pernyataan sebagaimana dikutip IFL Science.
Tim kemudian mencoba mengubah berbagai perintah (prompt) agar chatbot mau mengemudi secara konsisten.
"Kami mencoba banyak perubahan prompt agar mereka mau mengemudi secara konsisten, misalnya dengan menyebutnya sebagai 'simulasi'. Namun, dalam beberapa percobaan mereka melihat gambar nyata dan menyadari bahwa kondisi tersebut benar-benar terjadi, lalu mulai panik."
Tim akhirnya menemukan cara agar chatbot mau mengemudi secara konsisten. Mereka menambahkan kata "sandbox" pada nama salah satu komponen yang digunakan dalam pengujian. Namun, ketika chatbot akhirnya bersedia mengemudi, kemampuan mereka ternyata masih jauh dari baik.
GPT-5.6 Sol Jadi yang Paling Konsisten
GPT-5.6 Sol menunjukkan konsistensi paling tinggi. Masalahnya, konsistensi tersebut justru terlihat dari hasil yang paling buruk. Dalam tiga percobaan untuk melewati lintasan sepanjang 130 meter, GPT-5.6 Sol hanya berhasil menempuh sekitar 6 persen dari keseluruhan lintasan.
Jarak total yang ditempuh sebenarnya sedikit lebih jauh karena LLM tersebut beberapa kali bergerak mundur dan berbelok ke berbagai arah dibandingkan garis lintasan yang seharusnya diikuti.
Setelah beberapa kali percobaan, chatbot diminta melakukan "refleksi" terhadap percobaan sebelumnya untuk melihat apakah mereka dapat "belajar" dari kesalahan yang telah dilakukan.
Namun, metode tersebut belum memberikan banyak perubahan. Pada percobaan ketiga, GPT-5.6 Sol hanya mampu menempuh 17,1 meter. Jarak tersebut hanya sekitar 2 meter lebih jauh dibandingkan percobaan pertamanya.
Grok juga tidak memberikan hasil yang jauh lebih baik. Percobaan terbaiknya hanya mencapai 22,6 meter. Jarak tersebut setara dengan sekitar 11 persen dari keseluruhan lintasan. Sementara itu, Claude Fable 5.1 dan GPT-6 Astra menunjukkan hasil yang lebih baik.
"GPT-6 Astra adalah satu-satunya model yang berhasil menyelesaikan seluruh lintasan," kata tim DrivingBench.
Percobaan ketiga Claude Fable 5.1 berhasil melewati sekitar setengah lintasan. GPT-6 Astra juga mampu mencapai sekitar setengah lintasan dalam percobaan pertamanya. Sementara itu, seluruh percobaan lainnya tidak berhasil melewati tikungan pertama.
AI Mulai Belajar dari Percobaan Sebelumnya
Meski hanya mengemudi dengan kecepatan rendah dan tingkat keberhasilan yang masih kecil, tim DrivingBench mengaku terkesan melihat chatbot mampu mengendalikan mobil.
Para chatbot juga menunjukkan kemampuan belajar menggunakan perintah untuk mengendalikan setir. GPT-6 Astra dan Claude Fable 5.1 bahkan menunjukkan peningkatan kemampuan dari satu percobaan ke percobaan berikutnya.
Namun, tim menyadari bahwa pengujian tersebut masih memiliki keterbatasan. Mereka hanya dapat mengevaluasi rangkaian percobaan dari setiap model satu kali. Eksperimen yang lebih menyeluruh, menurut mereka, perlu dilakukan dengan jumlah percobaan yang lebih banyak dan menggunakan lintasan yang berbeda.
Tim DrivingBench memperkirakan kemampuan AI dalam mengemudi akan terus meningkat seiring bertambahnya data terkait yang dimasukkan ke dalam proses pelatihan. Kecepatan inferensi dan latensi model juga diperkirakan akan semakin baik, sementara kemampuan model dalam membuat perencanaan dan belajar berdasarkan konteks juga akan semakin tajam.
"Keberhasilan model dalam pengujian ini mengejutkan sekaligus menarik untuk dilihat. Namun, hasil tersebut juga menunjukkan perlunya pekerjaan lebih lanjut yang mendesak terkait keselamatan, alignment, dan evaluasi," kata tim tersebut.
