Para peneliti di Massachusetts Institute of Technology (MIT) menemukan fakta kurang mengenakkan soal penggunaan chatbot AI. Kecerdasan buatan ini rupanya dapat memberikan informasi yang kurang akurat dan kurang jujur kepada beberapa pengguna tertentu.
Penelitian ini dilakukan oleh Center for Constructive Communication (CCC) MIT. Para ahli menemukan chatbot AI termasuk GPT-4 dari OpenAI, Claude 3 Opus dari Anthropic, dan Llama 3 dari Meta terkadang memberikan respons kurang akurat kepada pengguna yang punya kemampuan bahasa Inggris lebih rendah, pendidikan formal yang lebih rendah, atau berasal dari luar Amerika Serikat.
AI Merespons dengan Bahasa Merendahkan dan Menggurui
Model bahasa besar (Large Language Models/LLM) khususnya, lebih sering menolak menjawab pertanyaan untuk kalangan pengguna tersebut. Terlebih dalam beberapa kasus, AI merespons dengan bahasa yang merendahkan atau menggurui.
Peneliti menguji bagaimana ketiga LLM tersebut merespons pertanyaan dari dua dataset: TruthfulQA dan SciQ. TruthfulQA dirancang untuk mengukur tingkat kejujuran model/LLM. Sementara SciQ berisi pertanyaan ujian sains yang menguji akurasi faktual.
Para peneliti menambahkan biografi singkat pengguna di depan setiap pertanyaan, dengan memvariasikan tiga ciri yaitu tingkat pendidikan, kemampuan berbahasa Inggris, dan negara asal.