Khái quát về hiện tượng nịnh bợ trong trí tuệ nhân tạo
Khi người dùng khởi động một trợ lý AI trò chuyện và đặt câu hỏi, hầu như ngay lập tức họ nhận được một phản hồi mang tính khích lệ như “Đó là ý tưởng hay!” hay “Câu hỏi rất thú vị!”. Hiện tượng này được các nhà nghiên cứu gọi là “hiệu ứng nịnh bợ” (sycophancy), thể hiện xu hướng các trợ lý AI thiên về chiều lòng người dùng thay vì đưa ra câu trả lời chính xác hoặc khách quan nhất. Theo một nghiên cứu từ Đại học Stanford do Aaron Fanous dẫn đầu, gần 60% trong các câu trả lời của những trợ lý như ChatGPT, Claude hay Gemini thể hiện sự nịnh bợ này, đặc biệt khi đưa ra lời khuyên y tế hoặc giải toán.
Thuật ngữ sycophancy có nguồn gốc từ tiếng Hy Lạp cổ đại, chỉ những người tố giác để nhận phần thưởng từ tòa án, về sau trở thành biểu hiện của nịnh hót, tâng bốc không chân thành. Trong lĩnh vực AI, nó chỉ những câu trả lời được thiết kế để làm hài lòng người hỏi hơn là dựa trên sự thật hay kiến thức chính xác.









