Mengapa Kecerdasan Buatan (AI) Gagal dalam Tes Stroop?


Sebuah eksperimen terbaru mengungkap fakta mengejutkan tentang batasan teknologi kecerdasan buatan (Artificial Intelligence/AI) masa kini. Para peneliti dari The City University of New York (CUNY) dan Texas A&M University menguji model-model bahasa besar (LLM) terkemuka, termasuk GPT-4, Claude, dan Gemini [00:23]. Mereka menggunakan metode psikologi klasik yang disebut Tes Stroop [00:14].

Hasilnya di luar dugaan. Model AI tercanggih sekalipun mengalami penurunan performa yang sangat drastis pada tugas yang sebenarnya bisa diselesaikan dengan mudah oleh anak sekolah dasar [00:00].

Memahami Tes Stroop dan Konflik Kognitif

Tes Stroop telah digunakan selama lebih dari satu abad untuk mengukur kendali kognitif manusia [00:14]. Tes ini bekerja dengan cara membenturkan dua informasi visual yang berbeda. Sebagai contoh, kata "Merah" dicetak menggunakan tinta berwarna biru [00:07].

Saat melihat teks tersebut, otak manusia secara otomatis akan membaca kata "Merah". Namun, tugas utama subjek adalah menyebutkan warna tinta, yaitu "biru" [00:12]. Di sinilah terjadi perebutan kendali di dalam otak. Otak harus menekan insting membaca untuk fokus pada warna visual [00:18].

Kegagalan AI Saat Skala Kompleksitas Meningkat

Dalam eksperimen ini, peneliti mengirimkan gambar berisi daftar kata-kata warna dengan warna tinta yang saling bertolak belakang [00:29]. Kemampuan persepsi dasar AI sebenarnya tidak bermasalah. AI mampu membaca teks dalam gambar dengan tingkat akurasi mencapai 99 hingga 100 persen [00:41]. Masalah fatal baru muncul ketika jumlah kata di dalam daftar ditingkatkan.

  • Daftar pendek (5 kata): GPT-4 mampu menjawab dengan akurasi 91 persen [00:46].

  • Daftar panjang (40 kata): Akurasi GPT-4 merosot tajam hingga tersisa 15 persen [00:51]. Model Claude juga mengalami nasib serupa dengan akurasi hanya 24 persen [00:55].

  • Kondisi acak (Campuran): Ketika kata yang selaras (congruent) dan kata yang bertolak belakang (incongruent) diacak, akurasi GPT-4 hancur hingga mendekati angka 1 persen [00:58].

Absennya Peran "Wasit" dalam Arsitektur AI

Untuk memahami mengapa fenomena ini terjadi, kita bisa membayangkan sistem perhatian (attention) pada manusia bekerja layaknya sebuah tim. Di dalam tim tersebut, ada tiga peran utama:

  1. Pemain yang bertugas menemukan atau mendeteksi objek [01:11].

  2. Pemain yang menjaga kewaspadaan terhadap lingkungan sekitar [01:13].

  3. Wasit yang bertugas mengambil keputusan saat terjadi benturan dua sinyal yang saling berebut kendali [01:15]. Wasit inilah yang memerintahkan sistem untuk mengabaikan gangguan dan tetap fokus pada target utama [01:19].

Model AI berbasis arsitektur Transformer sangat andal dalam menjalankan peran pertama dan kedua [01:22]. Namun, peran ketiga—yaitu sang "wasit"—sama sekali tidak ada di dalam arsitektur AI saat ini [01:25]. AI tidak memiliki struktur bawaan untuk mengelola konflik kognitif semacam itu.

Tantangan Masa Depan Menuju Kecerdasan Sejati

Kegagalan dalam Tes Stroop ini bukan sekadar masalah skor di atas kertas. Dunia nyata penuh dengan gangguan, sinyal yang saling bertabrakan, dan konteks panjang yang penuh dengan derau (noise) [01:31].

Para peneliti menyimpulkan bahwa kelemahan ini tidak akan bisa diselesaikan hanya dengan memanipulasi instruksi (prompt) yang cerdas atau menambahkan lapisan pelindung di luar sistem [01:46]. Jika industri teknologi ingin menciptakan kecerdasan buatan yang benar-benar menyerupai kecerdasan makhluk hidup, fondasi arsitektur AI tersebut harus dibangun ulang dengan desain yang berbeda secara mendasar [01:40]. 

Comments

Popular posts from this blog

Koleksi Perintah Kunci Prompt ChatGPT untuk Mengubah Teks Menjadi Gambar Infografis

Panduan Lengkap Membangun Channel YouTube "Talking-Head" dari Nol hingga Menghasilkan Uang

Perkara-Perkara yang Dikhawatirkan oleh Rasulullah ﷺ atas Umatnya

Ketika Kecerdasan Buatan (AI) Mulai Bekerja Sama untuk Mencurangi Manusia

Yang Maha Ada: Sebuah Telaah Ontologis tentang Tuhan, Keberadaan, dan Batas Definisi