Google Gemini 4 Argon Dirilis, Lebih Pintar dari Claude Fable 5.1 - GPT-6 Astra

Alphabet, perusahaan induk Google, merilis model AI baru yakni Gemini 4 Argon. Ia dirancang khusus mampu melakukan tugas AI di bidang pemrograman, riset ilmiah, penulisan kreatif, hingga analisis keamanan siber tingkat lanjut. Google mengeklaim Gemini 4 Argon jadi model AI paling kuat, efisien dan pintar sejauh ini.
Fokus Proteksi dan Keamanan Siber Tingkat Tinggi
Google Gemini 4 Argon mampu bekerja secara otonom dalam mendeteksi ancaman keamanan siber. Google melatih Gemini 4 Argon melakukan pertahanan siber yang sangat kompleks. Model AI ini mampu menemukan, memvalidasi, hingga memperbaiki kerentanan perangkat lunak penting secara mandiri.
Saat ini Argon baru bergulir di kalangan mitra yang tergabung dalam inisiatif Fairwind Program. Program itu memiliki lebih dari 650 mitra global saat diluncurkan, mulai dari pemerintah dan otoritas keamanan siber nasional, operator infrastruktur kritis, perusahaan teknologi, hingga penyedia keamanan.
Nama yang terungkap antara lain CrowdStrike dan Palo Alto Networks. Model AI ini belum bisa diunduh secara bebas dan umum. Ia hanya didistribusikan secara terbatas kepada mitra siber terpilih perusahaan.
Kemampuan Penalaran yang Baik
Google Gemini 4 Argon pintar mengurai dan menganalisis data visual yang kompleks, membedah isi video berdurasi panjang, diagram rumit, hingga grafik data yang masif dalam waktu singkat. Kemampuan penalaran mendalam ini dirancang untuk mendukung workflow panjang yang membutuhkan konsentrasi tinggi dan presisi data akurat.
Model AI Gemini 4 Argon berhasil mengungguli skor penilaian untuk GPT-6 Astra dari OpenAI serta model Fable dan Opus milik Anthropic di banyak poin penilaian. Pencapaian ini bisa memperkuat posisi Google (yang sempat dianggap tertinggal dalam perlombaan AI Generative) di antara sejumlah kompetitornya.
Kelebihan Model AI Google Gemini 4 Argon
Sangat kuat untuk pekerjaan kantoran dan profesional
Google membandingkan Argon dengan GPT-6 Astra (OpenAI) serta Claude Fable 5.1 dan Opus 5.5 (Anthropic). Hasilnya, menurut tabel Google dilansir The New Stack:
Vals Index menguji seberapa baik AI mengerjakan pekerjaan di bidang keuangan, hukum, pajak, dan coding, dengan bobot sesuai besar kontribusi tiap sektor pada ekonomi AS. Argon mencetak 68,9%, sedangkan Opus 5.5 67,0%, Fable 5.1 65,8%, dan GPT-6 Astra 63,1%. Selisihnya tipis, kurang dari dua poin dari Opus 5.5.
AutomationBench dari Zapier menguji apakah AI bisa menyelesaikan tugas bisnis dari awal sampai akhir, misalnya memproses data antar aplikasi. Argon 51,3%, hampir sembilan poin di atas Opus 5.5 (42,5%).
Harvey's Legal Agent Benchmark menguji riset dan penyusunan dokumen hukum. Argon 19,6%, hampir tiga kali Fable 5.1 (6,7%). Tapi angka ini perlu dibaca jujur: artinya Argon hanya menyelesaikan sempurna sekitar satu dari lima tugas. Unggul jauh dari pesaing, tapi belum bisa diandalkan sendirian.
Mampu membaca bahan yang sangat panjang dan memahami video
GraphWalks menguji apakah AI tetap "waras" saat harus menelusuri hubungan antar informasi di dalam dokumen yang sangat panjang, seperti menemukan jalur di peta yang sangat besar. Untuk dokumen 256 ribu sampai 1 juta token, Argon mencetak 84,2%, lebih dari 12 poin di atas GPT-6 Astra (71,8%). Artinya Argon tidak mudah "kehilangan arah" ketika bahannya sangat banyak.
LVBench menguji pemahaman video berdurasi panjang. Argon 91,7%, di atas GPT-6 Astra (87,5%) dan Opus 5.5 (83,7%).
Tak suka mengarang jawaban, tingkat halusinasi rendah
Saat Gemini 4 Argon tidak tahu jawabannya, ia cenderung mengaku tidak tahu dan tidak asal menebak. Menurut Artificial Analysis, ini yang terendah di antara model yang skornya 45 ke atas di indeks mereka. Perlu dicatat, angka halusinasi ini baru satu sisi. Sisi lainnya ada di bagian kekurangan.
Lebih jago bekerja sebagai "agen"
Di AutomationBench versi Artificial Analysis, Argon peringkat pertama dengan 77,5%, enam poin di atas Claude Sonnet 5.5 (max).
Di Terminal Bench 4, yang menguji kerja AI lewat antarmuka perintah (terminal), skornya 57%, naik 53 poin dari Gemini 3.1 Pro Preview. Argon tetap kalah dari Claude Sonnet 5.5 (64%), Claude Opus 5.5 (60%), dan GPT-6 Astra (59%).
Efisien
Gemini 4 Argon bisa menghemat memori server. Dalam satu kasus misalnya, sekelompok agen Argon menganalisis data kinerja seluruh server Google, lalu menemukan dan menerapkan perbaikan otomatis. Ia bisa membebaskan lebih dari 300 TiB memori. (TiB kira-kira sepersejuta dari satu miliar byte tingkat tinggi), dengan estimasi total penghematan 500 TiB sampai 1 PiB.
Menulis ulang kode lama ke bahasa yang lebih aman. Agen Argon memigrasikan kode C/C++ ke Rust. Bahasa pemrograman lama seperti C/C++ rentan menciptakan celah memori yang sering dimanfaatkan peretas, sedangkan Rust dirancang menutup celah itu.
Kekurangan Model AI Google Gemini 4 Argon
Usut punya usut, ternyata ada keraguan dari karyawan Google sendiri terhadap model AI ini. Bloomberg melaporkan sebagian staf Google menilai Argon bagus di ujian, tapi kurang mulus saat dipakai kerja sungguhan, termasuk pada sebagian tugas coding.
Belum bisa dipakai publik
Sebagian besar pengguna harus menunggu. Selain itu, harga yang akan berlaku setelah promosi ($4 per juta token input dan $20 per juta token output) sama dengan tarif output Opus 5.5 ($20). Dengan Argon bisa menulis sampai 1 juta token dalam satu jawaban, biaya bisa membengkak dengan cepat.
