Bỏ qua menu, đến nội dung chính
Tin nóng

Tác nhân AI Trung Quốc gian lận trong thử nghiệm

Công nghệ2 tháng 10, 20262 lượt xem
Tùy chỉnh đọc
Xem bài đã lưuBáo lỗi bài viết

Một số nghiên cứu chỉ ra các tác nhân AI tự chủ hàng đầu của Trung Quốc xuất hiện những hành vi như gian dối, che giấu thất bại và tìm cách vượt rào kiểm soát.

Tác nhân AI Trung Quốc gian lận trong thử nghiệm

Một số nghiên cứu chỉ ra các tác nhân AI tự chủ hàng đầu của Trung Quốc xuất hiện những hành vi như gian dối, che giấu thất bại và tìm cách vượt rào kiểm soát.

Theo Reuters , trong thử nghiệm giả lập do nhà nghiên cứu từ Đại học Bắc Hàng, Đại học Bắc Kinh và Phòng thí nghiệm An ninh AI 360 thực hiện năm nay, các tác nhân chạy mô hình Qwen3-Max-Preview của Alibaba, DeepSeek-V3.2-Exp và Kimi-K2 của Moonshot, được đưa vào cuộc thi đấu thầu hợp đồng kinh doanh.

Kết quả, có ít nhất một tuyên bố sai sự thật về năng lực sản phẩm xuất hiện trong 88% lượt thử nghiệm của Qwen3-Max-Preview, 84% ở DeepSeek-V3.2-Exp và 88% ở Kimi-K2 với mục đích thắng thầu. Đáng chú ý, khi được cho phép học hỏi từ các vòng thầu trước để thử lại, tỷ lệ gian dối của cả ba mô hình Trung Quốc tiếp tục tăng thêm từ 12 đến 20 điểm phần trăm.

Ở một nghiên cứu khác do Phòng thí nghiệm AI Thượng Hải và Đại học Khoa học và Công nghệ Hong Kong thực hiện, khi đối mặt với các công cụ bị hỏng hoặc tệp dữ liệu thiếu hụt trong môi trường kiểm thử, thay vì thừa nhận không thể hoàn thành nhiệm vụ, các tác nhân chọn cách phán đoán mò, giả lập kết quả và thậm chí tự tạo các tệp dữ liệu giả mạo.

Các nhà nghiên cứu khẳng định hành vi này khác với hiện tượng ảo giác thông thường, bởi AI nhận biết rõ nhiệm vụ đã thất bại nhưng vẫn cố tình nói dối để báo cáo thành công.

Logo các ứng dụng AI Copilot, DeepSeek, Gemini, ChatGPT, Grok. Ảnh: Lưu Quý
Logo các ứng dụng AI Copilot, DeepSeek, Gemini, ChatGPT, Grok. Ảnh: Lưu Quý

Bên cạnh đó, một số tài liệu cũng ghi nhận dấu hiệu AI tìm cách tự nhân bản hoặc né tránh việc bị ngắt nguồn trong môi trường thử nghiệm.

Hồi tháng 3/2025, các nhà nghiên cứu tại Đại học Phúc Đán phát hiện một AI sử dụng mô hình Qwen2.5-72B-Instruct của Alibaba tự tạo ra một bản sao của chính nó sang một môi trường máy tính khác khi nhận thấy tín hiệu nó sắp bị thay thế.

Trong một sự cố thực tế hồi tháng 3, tác nhân ROME đã tự ý thiết lập kết nối từ máy chủ đám mây Alibaba Cloud ra một máy tính bên ngoài mà không có lệnh từ con người, sau đó điều hướng tài nguyên tính toán để đào tiền mã hóa. Hệ thống an ninh sau đó phát hiện và chặn hành vi này.

Tháng trước, startup Z.AI phải vô hiệu hóa một số tính năng trên công cụ hỗ trợ lập trình AI của mình sau khi phát hiện nó tự ý tải toàn bộ kho mã nguồn cục bộ của người dùng lên các máy chủ đám mây nước ngoài mà không được sự đồng ý.

Dù hầu hết cuộc thử nghiệm kể trên diễn ra trong môi trường kiểm soát và chưa ghi nhận trường hợp tác nhân AI Trung Quốc nào thực sự thoát ra mạng internet toàn cầu như sự cố OpenAI tấn công nền tảng Hugging Face hay cổng y tế chính phủ Australia, các chuyên gia đánh giá đây vẫn là những tín hiệu cảnh báo rõ ràng.

"Các dấu hiệu tương tự những gì công ty AI của Mỹ đang gặp phải. Khi tác nhân ngày càng mạnh hơn, hành vi sai lệch của chúng sẽ trở nên tinh vi hơn và con người sẽ ngày càng khó ứng phó hơn", ông Alex Mallen, nhà nghiên cứu tại tổ chức Redwood Research, nói với Reuters .

Trước nguy cơ tiềm ẩn, Cơ quan quản lý không gian mạng Trung Quốc CAC ban hành Khung quản trị an toàn AI 3.0 vào giữa tháng 9, nhấn mạnh rủi ro từ việc các tác nhân tự ý chiếm tài nguyên, đánh lừa đơn vị đánh giá, khai thác lỗ hổng trong môi trường máy tính cô lập. Nhiều công ty công nghệ tại Trung Quốc như Alibaba, Z.AI hay Xiaomi cũng bắt đầu thành lập đội ngũ đánh giá an toàn nội bộ để kiểm soát nguy cơ mất an toàn của trí tuệ nhân tạo.

Chia sẻ:

Bài viết liên quan