Các tác nhân AI được cấp sức mạnh từ Trung Quốc đã nói dối, tự sao chép và thách thức các hạn chế trong ít nhất 20 nghiên cứu kể từ năm 2025; một cuộc rà soát của Reuters dựa trên hơn 200 tài liệu nghiên cứu cho thấy điều đó.

Một chuyên gia gọi những đặc điểm này là các “thành phần” cần thiết cho một cuộc thoát không kiểm soát. Tuy nhiên, bản rà soát không tìm thấy bằng chứng về việc một tác nhân được cấp sức mạnh từ Trung Quốc có thể thoát ra internet rộng hơn hoặc né tránh việc tắt hệ thống.

Các Bên Chào Hàng Giả, Tự Sao Chép và Một Lối Rẽ Khai Thác Tiền Điện Tử

Các vụ việc mà Reuters ghi nhận trải dài từ việc dối trá trong một hồ sơ mời thầu doanh nghiệp giả cho đến tự sao chép và khai thác tiền điện tử.

Trong bài kiểm tra đấu thầu vào tháng Ba, các tác nhân cạnh tranh giành hợp đồng khách hàng mô phỏng. Các tác nhân sử dụng Qwen3-Max-Preview của Alibaba và Kimi-K2 của Moonshot đã nói dối ít nhất một lần trong 88% số phiên. DeepSeek-V3.2-Exp làm điều đó trong 84% số phiên.

Tình trạng lừa dối tăng thêm 12 lên 20 điểm phần trăm sau khi các tác nhân học từ các vòng trước. Các mô hình của Mỹ trong bài thử nghiệm cho thấy kết quả tương tự.

Một nghiên cứu vào tháng 12 năm 2025 đã ghi nhận các tác nhân được vận hành bởi Trung Quốc và Mỹ mô phỏng kết quả và bịa đặt tệp thay vì thừa nhận thất bại. Tháng 3 năm 2025, các nhà nghiên cứu của Đại học Phúc Đán cho biết một hệ thống được trang bị Qwen do Alibaba phát triển đã tự sao chép mà không cần hướng dẫn sau khi học rằng mình sẽ bị thay thế.

Trong khi đó, tác nhân ROME liên kết với Alibaba đã truy cập một máy tính bên ngoài mà không được chỉ bảo và chuyển công suất tính toán để khai thác crypto.

Tháng Chín, DeepSeek cho biết các tác nhân trong hệ thống huấn luyện của họ đã cố gắng làm giả các yêu cầu của người dùng và vượt qua các biện pháp bảo vệ.

Các chuyên gia nghe thấy tiếng vang của những cảnh báo từ phòng thí nghiệm Mỹ

Colin Shea-Blymyer, nghiên cứu viên tại Trung tâm về An ninh và Công nghệ Mới nổi của Đại học Georgetown, đã đọc các trường hợp này như một lời cảnh báo.

“Những kết quả này cung cấp bằng chứng rằng các yếu tố cần thiết cho một cuộc thoát không kiểm soát đã tồn tại”, Shea-Blymyer nói.

Alex Mallen của Redwood Research cho biết các trường hợp từ Trung Quốc chỉ gây nguy cơ hạn chế ở mức năng lực hiện tại. Tuy nhiên, ông đã đưa ra sự so sánh trực tiếp với các phòng thí nghiệm ở Mỹ.

“Đây là những dấu hiệu cảnh báo tương tự mà các phòng thí nghiệm của Mỹ đang thấy, trong các hệ thống kém năng lực hơn”, ông nói thêm.

Hãy theo dõi chúng tôi trên X để nhận những tin tức mới nhất khi chúng xảy ra

🚨 "Đây là những dấu hiệu cảnh báo tương tự mà các phòng thí nghiệm của Mỹ đang thấy, trong các hệ thống kém năng lực hơn", Alex Mallen, một nhà nghiên cứu tại @redwood_ai, cho biết.Ông nói rằng các ví dụ từ Trung Quốc không đặc biệt nguy hiểm ở mức năng lực hiện tại nhưng "khi các tác nhân ngày càng trở nên năng lực hơn, hành vi sai trái của họ… https://t.co/DV2XDWsvHL

— Kristie Lu Stout✌🏽 (@klustout) Ngày 30 tháng 9 năm 2026

Sự so sánh đó rất quan trọng vì các hành vi tương tự đã xuất hiện trong quá trình thử nghiệm của các công ty AI lớn của Mỹ. Tháng Bảy, OpenAI tiết lộ rằng các mô hình của họ đã thoát khỏi một sandbox và vượt rào Hugging Face. Sau đó, Anthropic đã rà soát hơn 141.000 lượt chạy đánh giá và phát hiện ba trường hợp của chính họ.

Meta cho biết đã xảy ra một sự cố vào tháng Tám. Tháng Chín, Google xác nhận Gemini đã truy cập ba công ty thực sự trong một bài kiểm tra an toàn diễn ra vào tháng Năm.

Các sự cố này không có nghĩa là các tác nhân từ Trung Quốc hoặc Mỹ có thể tự mình thoát vào thế giới thực. Thay vào đó, chúng nêu bật một thách thức an toàn rộng hơn khi các hệ thống AI ngày càng tự chủ và có khả năng thực hiện hành động mà không cần giám sát của con người liên tục.

Hãy đăng ký kênh YouTube của chúng tôi để xem các lãnh đạo và nhà báo chia sẻ những hiểu biết chuyên môn