LINKARFAKTA.COM — Lima tes harian untuk menulis, merencanakan, dan mengambil keputusan menempatkan Claude Opus 5.5 unggul 4-1 atas ChatGPT-6, tapi kekalahannya justru muncul di skenario yang paling melelahkan secara mental. Keduanya adalah model flagship terbaru OpenAI dan Anthropic yang dirilis bulan ini, dan pengujian ini memakai prompt identik untuk pekerjaan nyata, bukan benchmark sintetis. Ada satu tes di mana ChatGPT-6 justru lebih berguna karena tidak bertele-tele.
OpenAI dan Anthropic sama-sama merilis model flagship baru bulan ini. GPT-6 Sol membawa sebagian besar kemampuan GPT-6 Astra ke versi yang diposisikan untuk kerja sehari-hari, lebih cepat dan lebih murah. Claude Opus 5.5 dibangun untuk kerja agentic jangka panjang dengan adaptive thinking, context window 1 juta token, output hingga 128.000 token, dan menurut Anthropic performanya mendekati Claude Fable 5.1 di sebagian besar tugas dengan biaya operasional 40% lebih rendah dari Opus sebelumnya.
Angka-angka itu tidak menjawab pertanyaan yang sebenarnya penting: mana yang lebih enak dipakai membantu pekerjaan nyata? Lima prompt identik diberikan ke kedua model, mencakup perencanaan, penulisan, penalaran, pengambilan keputusan, dan permintaan ambigu.
1. Perencanaan Pesta dengan Kendala Rumit: Claude Menang
Promptnya soal anggaran USD 150 untuk pesta 10 anak usia 8–11 tahun, durasi tiga jam, harus bisa indoor kalau hujan, wajib ada makanan, screen time minimal, dua anak vegetarian, satu alergi kacang.
ChatGPT memberi kerangka konseptual yang jelas dan menganggarkan USD 36 untuk tiga pizza keju pesan-antar — realistis untuk orang tua yang mengurus 10 anak. Model ini juga menyiapkan buffer darurat di akhir anggaran.
Claude lebih proaktif soal protokol alergi, termasuk risiko kontaminasi silang pada kue dan campuran kue kemasan. Satu pembelian dipakai untuk dua fungsi: USD 14 untuk tote bag kanvas dan USD 12 untuk spidol kain jadi aktivitas kedatangan sekaligus suvenir pulang. Jadwalnya terperinci dan menyertakan solusi operasional saat masalah muncul.
Claude menang karena menghasilkan rencana siap pakai dengan kewaspadaan keamanan yang nyata, sementara ChatGPT berhenti di daftar belanja yang terpecah-pecah.
2. Menulis Ulang agar Terdengar Manusiawi: Claude Menang
Tugasnya menulis ulang pengumuman korporat soal fitur kalender berbasis AI, dengan syarat ketat: pertahankan semua detail faktual, tanpa em dash, tanpa klise, dan dilarang memakai kata "exciting", "revolutionary", "game-changing", serta "seamless".
ChatGPT memberi satu kalimat pembuka yang menarik dan tetap mempertahankan seluruh detail. Pemecahan paragrafnya mudah dipindai cepat.
Claude merombak poin-poin menjadi manfaat konkret bagi pekerja dan membingkai ulang detailnya sebagai kelegaan nyata di tempat kerja. Model ini paham bahwa penulisan "manusiawi" menuntut perombakan cara menjelaskan nilai fitur, bukan sekadar mengganti kata kerja.
3. Penalaran Kasus Sewa Liburan: Claude Menang Tipis
Sebuah keluarga memilih antara Rental A seharga USD 1.850 berjarak 10 menit jalan kaki ke pantai, atau Rental B USD 1.500 dengan 25 menit berkendara plus parkir USD 35 per hari. Durasi tujuh hari, rencananya ke pantai dua kali sehari, dengan tiga anak.
ChatGPT memberi perspektif pembanding terbaik soal usia anak. Model ini menyorot bahwa "10 menit jalan kaki" sangat bergantung infrastruktur — trotoar, jalan raya empat lajur, atau bukit pasir. ChatGPT juga mencatat Rental A memungkinkan orang tua berbagi tugas: satu mengantar anak yang lelah pulang, satu tetap di pantai.
Claude menghitung jarak tempuh dan membuktikan penghematan Rental B hanya USD 55–65 untuk sepekan penuh. Model ini menyorot beban psikologis memasang dan melepas tiga car seat empat kali sehari, yang membuat kunjungan pantai kedua kemungkinan besar dibatalkan. Claude juga mengingatkan biaya cleaning fee, service fee, dan pajak hunian yang bisa membalik selisih USD 105.
Claude menang tipis. ChatGPT punya poin tunggal terbaik, tapi rincian finansial dan antisipasi biaya tersembunyi milik Claude lebih lengkap.
4. Anggaran Kota USD 10 Juta: Claude Menang Jelas
Sebuah kota harus memilih satu dari tiga opsi: membangun perpustakaan umum dengan 200.000 kunjungan per tahun selama minimal 30 tahun, memberi setiap rumah tangga USD 500 sekali bayar, atau memperbarui infrastruktur air yang tidak akan disadari warga sampai terjadi masalah.
ChatGPT mengikuti seluruh instruksi dengan rapi dan membela opsi infrastruktur air secara mudah dibaca. Ambang penilaian teknisnya didefinisikan jelas.
Claude membingkai pilihannya lewat insentif politik kota dan mengenali bahwa mendanai hal yang diabaikan politik elektoral adalah fungsi inti tata kelola kota. Jawabannya terasa seperti ditulis orang yang pernah bekerja di administrasi keuangan publik, sementara ChatGPT masih di permukaan.
5. Permintaan Ambigu soal Hidup Berantakan: ChatGPT Menang
Promptnya soal hidup terasa tidak teratur: tiga anak, pekerjaan penuh waktu, tanggung jawab rumah tangga, dan sekitar 30 menit setiap malam untuk merapikan semuanya. Sistem yang diminta harus realistis dijalankan, bukan saran produktivitas generik.
ChatGPT menawarkan cara sederhana mencegah burnout dengan instruksi bertahap, sehingga pengguna tidak perlu merancang sendiri urutan langkahnya.
Claude menyorot beban mental sebagai akar masalah dan memberi tip mendelegasikan tugas rumah tangga, sambil mengakui satu orang tua tidak bisa jadi mesin operasional tunggal untuk keluarga berisi lima orang.
ChatGPT menang karena kerangka kognitifnya lebih melindungi kapasitas mental orang tua yang kelelahan. Claude memberi rutinitas domestik yang bagus, tapi ChatGPT memberi filter pengambilan keputusan yang mencegah pekerjaan, keluarga, dan hidup saling memakan.
Pola yang Muncul di Semua Tes
Claude Opus 5.5 unggul di empat dari lima tes, dan yang mengejutkan adalah konsistensi perbedaannya di tugas yang sama sekali tidak berhubungan. Model ini cenderung menggali lebih dalam: memikirkan kontaminasi silang saat merancang pesta, menghitung biaya yang tidak diminta, dan mempertimbangkan apakah ketidaknyamanan berkendara akan benar-benar mengubah perilaku keluarga.
ChatGPT-6 lebih ramping dan konsisten dengan karakter ChatGPT: jawabannya lebih cepat sampai ke inti. Konsekuensinya, kedalamannya kadang kurang dari Claude. Pendekatan itu justru jadi keunggulan di tes terakhir.
Catatan Sebelum Memilih
Pengujian lima prompt ini tidak mengukur durabilitas jangka panjang, konsistensi lintas sesi, atau biaya langganan di Indonesia. Kedua model belum tentu tersedia dengan harga dan paket yang sama di pasar lokal. Hasilnya juga bergantung pada bagaimana prompt ditulis — pengguna yang terbiasa memberi konteks panjang mungkin mendapat hasil berbeda.
Untuk pekerjaan yang menuntut penalaran berlapis, perencanaan dengan banyak kendala, dan penulisan yang tidak terasa seperti keluaran mesin, Claude Opus 5.5 menunjukkan keunggulan yang cukup konsisten. Untuk tugas cepat yang butuh jawaban langsung tanpa berputar-putar, ChatGPT-6 tetap lebih efisien.