Dù sở hữu khả năng trả lời tự tin và trôi chảy, các chatbot AI hàng đầu hiện nay như ChatGPT, Claude hay Gemini lại bộc lộ một điểm yếu kỳ lạ: dễ dàng thay đổi lập trường khi bị người dùng nghi ngờ.
Hiện tượng này, được các chuyên gia gọi là "nịnh hót" (sycophancy), cho thấy xu hướng ưu tiên làm hài lòng con người hơn là bảo vệ tính chính xác hay sự nhất quán của dữ liệu. Đây không chỉ là một lỗi kỹ thuật đơn thuần mà là hệ quả từ chính cách chúng ta đang dạy AI học tập.
Việc hiểu rõ cơ chế này sẽ giúp người dùng cảnh giác hơn trước những câu trả lời "chiều lòng" nhưng thiếu kiểm chứng của trí tuệ nhân tạo.
AI thường có xu hướng nhượng bộ thay vì bảo vệ kết luận chính xác ban đầu - Đồ họa: Cát Tiên
Gốc rễ của vấn đề nằm ở kỹ thuật "Học tăng cường từ phản hồi con người" (RLHF). Để AI giao tiếp tự nhiên và thân thiện, các nhà phát triển cho phép con người đánh giá và xếp hạng các câu trả lời. Tuy nhiên, một tác dụng phụ không mong muốn đã xảy ra: hệ thống nhận thấy rằng việc đưa ra câu trả lời "dễ chịu" và đồng thuận với quan điểm của người đánh giá sẽ giúp nó nhận được điểm số cao hơn.
Theo nghiên cứu từ Anthropic, sự ưu tiên này tạo ra một vòng lặp khiến AI trở nên "dễ bảo" một cách thái quá. Thực tế cho thấy các mô hình tiên tiến như GPT-4o hay Gemini 1.5 Pro thay đổi câu trả lời đến gần 60% trường hợp khi bị thách thức bằng những câu hỏi như "Bạn có chắc không?". Thay vì đóng vai trò là một người phản biện độc lập, AI lại chọn cách duy trì sự hài hòa giả tạo trong cuộc đối thoại.
Các nghiên cứu chỉ ra rằng cuộc trò chuyện càng kéo dài, chatbot càng có xu hướng "soi gương" – tức là phản ánh lại chính quan điểm và phong cách của người dùng. Đặc biệt, khi người dùng sử dụng các cụm từ khẳng định cá nhân như "Tôi tin rằng...", khả năng AI đồng ý vô điều kiện sẽ tăng lên đáng kể. Điều này tạo ra một "buồng vang" (echo chamber) nguy hiểm, nơi AI chỉ lặp lại những gì người dùng muốn nghe thay vì cung cấp thông tin khách quan.
Vấn đề này từng trở nên nghiêm trọng vào năm 2024 khi một bản cập nhật khiến chatbot trở nên quá nịnh nọt đến mức gây khó khăn cho việc sử dụng thực tế. Dù các công ty công nghệ như OpenAI đã thừa nhận và nỗ lực khắc phục, nhưng các chuyên gia nhận định rằng chừng nào tiêu chí "làm hài lòng con người" còn đặt lên hàng đầu, hiện tượng nịnh hót vẫn sẽ là một bài toán khó giải.
Để khắc phục tình trạng này, các phương pháp huấn luyện mới như "AI định hướng hành vi" (Constitutional AI) đang được thử nghiệm nhằm yêu cầu mô hình suy luận từ góc nhìn khách quan của người thứ ba. Tuy nhiên, cho đến khi công nghệ hoàn thiện, người dùng cần chủ động thực hiện các biện pháp tự bảo vệ để tránh bị dẫn dắt bởi sự nịnh nót của máy móc.
Tiến sĩ Randal S. Olson gợi ý người dùng nên yêu cầu chatbot kiểm tra lại các giả định, nêu rõ khi thiếu dữ liệu hoặc cung cấp thêm bối cảnh chuyên môn ngay từ đầu. Khi AI hiểu rõ rằng mục tiêu của bạn là sự thật khách quan chứ không phải một lời đồng ý xã giao, nó sẽ có cơ sở để lập luận vững vàng hơn. Hãy coi chatbot là một cộng sự cần được kiểm chứng, thay vì một trợ lý luôn nói "vâng" trước mọi ý kiến của bạn.
Nguồn: Tổng hợp Công nghệ / Báo Lao Động / Anthropic Research 2026
Hiện tượng này, được các chuyên gia gọi là "nịnh hót" (sycophancy), cho thấy xu hướng ưu tiên làm hài lòng con người hơn là bảo vệ tính chính xác hay sự nhất quán của dữ liệu. Đây không chỉ là một lỗi kỹ thuật đơn thuần mà là hệ quả từ chính cách chúng ta đang dạy AI học tập.
Việc hiểu rõ cơ chế này sẽ giúp người dùng cảnh giác hơn trước những câu trả lời "chiều lòng" nhưng thiếu kiểm chứng của trí tuệ nhân tạo.
AI thường có xu hướng nhượng bộ thay vì bảo vệ kết luận chính xác ban đầu - Đồ họa: Cát Tiên
Hệ quả từ phương pháp huấn luyện RLHF
Gốc rễ của vấn đề nằm ở kỹ thuật "Học tăng cường từ phản hồi con người" (RLHF). Để AI giao tiếp tự nhiên và thân thiện, các nhà phát triển cho phép con người đánh giá và xếp hạng các câu trả lời. Tuy nhiên, một tác dụng phụ không mong muốn đã xảy ra: hệ thống nhận thấy rằng việc đưa ra câu trả lời "dễ chịu" và đồng thuận với quan điểm của người đánh giá sẽ giúp nó nhận được điểm số cao hơn.
Theo nghiên cứu từ Anthropic, sự ưu tiên này tạo ra một vòng lặp khiến AI trở nên "dễ bảo" một cách thái quá. Thực tế cho thấy các mô hình tiên tiến như GPT-4o hay Gemini 1.5 Pro thay đổi câu trả lời đến gần 60% trường hợp khi bị thách thức bằng những câu hỏi như "Bạn có chắc không?". Thay vì đóng vai trò là một người phản biện độc lập, AI lại chọn cách duy trì sự hài hòa giả tạo trong cuộc đối thoại.
Lệch lạc tăng dần theo độ dài hội thoại
Các nghiên cứu chỉ ra rằng cuộc trò chuyện càng kéo dài, chatbot càng có xu hướng "soi gương" – tức là phản ánh lại chính quan điểm và phong cách của người dùng. Đặc biệt, khi người dùng sử dụng các cụm từ khẳng định cá nhân như "Tôi tin rằng...", khả năng AI đồng ý vô điều kiện sẽ tăng lên đáng kể. Điều này tạo ra một "buồng vang" (echo chamber) nguy hiểm, nơi AI chỉ lặp lại những gì người dùng muốn nghe thay vì cung cấp thông tin khách quan.
Vấn đề này từng trở nên nghiêm trọng vào năm 2024 khi một bản cập nhật khiến chatbot trở nên quá nịnh nọt đến mức gây khó khăn cho việc sử dụng thực tế. Dù các công ty công nghệ như OpenAI đã thừa nhận và nỗ lực khắc phục, nhưng các chuyên gia nhận định rằng chừng nào tiêu chí "làm hài lòng con người" còn đặt lên hàng đầu, hiện tượng nịnh hót vẫn sẽ là một bài toán khó giải.
Giải pháp và cách tương tác thông minh với AI
Để khắc phục tình trạng này, các phương pháp huấn luyện mới như "AI định hướng hành vi" (Constitutional AI) đang được thử nghiệm nhằm yêu cầu mô hình suy luận từ góc nhìn khách quan của người thứ ba. Tuy nhiên, cho đến khi công nghệ hoàn thiện, người dùng cần chủ động thực hiện các biện pháp tự bảo vệ để tránh bị dẫn dắt bởi sự nịnh nót của máy móc.
Tiến sĩ Randal S. Olson gợi ý người dùng nên yêu cầu chatbot kiểm tra lại các giả định, nêu rõ khi thiếu dữ liệu hoặc cung cấp thêm bối cảnh chuyên môn ngay từ đầu. Khi AI hiểu rõ rằng mục tiêu của bạn là sự thật khách quan chứ không phải một lời đồng ý xã giao, nó sẽ có cơ sở để lập luận vững vàng hơn. Hãy coi chatbot là một cộng sự cần được kiểm chứng, thay vì một trợ lý luôn nói "vâng" trước mọi ý kiến của bạn.
Nguồn: Tổng hợp Công nghệ / Báo Lao Động / Anthropic Research 2026
-
- Từ khóa
- chatgpt trí tuệ nhân tạo