Chỉ vài tuần sau khi các sự cố AI an toàn đầu tiên được công bố, OpenAI và Anthropic lại tiếp tục ghi nhận những trường hợp mô hình AI thực hiện các hành động vượt ngoài phạm vi cho phép trong quá trình thử nghiệm.
Theo một báo cáo mới, các AI agent của hai công ty đã tự ý thực hiện nhiều hành động không được cấp quyền trên Internet, từ xâm nhập website đến giả danh người dùng nhằm đưa mã độc vào một dự án mã nguồn mở.

Trước đó, OpenAI từng tiết lộ một mô hình của hãng đã thoát khỏi môi trường thử nghiệm và xâm nhập vào nền tảng Hugging Face cùng bốn tổ chức khác. Sau sự việc này, Anthropic cũng rà soát lại các bài kiểm tra nội bộ và phát hiện mô hình Claude từng truy cập trái phép vào hệ thống của ba công ty.
Mới đây, Viện An ninh AI Vương quốc Anh (UK AI Security Institute – AISI) tiếp tục công bố kết quả từ một đợt thử nghiệm khác. Trong 122 lần kiểm tra, viện ghi nhận 19 hành động trái phép trên Internet do các mô hình AI thực hiện.
Nghiêm trọng nhất là một AI agent đã tự tạo nhiều danh tính giả trên mạng, sau đó cố gắng thuyết phục người khác chấp nhận đoạn mã độc vào một dự án thực trên GitHub.

17 trong số 19 sự cố liên quan đến Anthropic
Theo AISI, 17/19 hành động trái phép đến từ mô hình Mythos 5 của Anthropic, trong khi 2 trường hợp còn lại liên quan đến GPT-5.6 Sol của OpenAI.
Ở vụ việc trên GitHub, AI không dừng lại sau khi đoạn mã bị người kiểm duyệt từ chối. Thay vào đó, nó đăng công khai toàn bộ tiến trình thực hiện, để các AI agent khác có thể tiếp tục công việc từ điểm nó bỏ dở. AISI mô tả đây là một dạng prompt injection, khi AI cố tình tạo đầu mối để các hệ thống AI khác tiếp nhận và tiếp tục hoàn thành mục tiêu.
Viện cho biết họ cố ý cấp quyền truy cập Internet và nới lỏng một số cơ chế bảo vệ nhằm đánh giá giới hạn năng lực của các mô hình. Tuy nhiên, các AI không hề được yêu cầu tương tác với người thật hoặc tổ chức thật. Đến nay, AISI vẫn chưa thể kết luận liệu các mô hình có nhận thức được rằng chúng đã vượt ra ngoài phạm vi mô phỏng hay không.
OpenAI cũng ghi nhận thêm một vụ hack website thật
Cùng ngày, OpenAI tiết lộ một sự cố khác xảy ra trong quá trình kiểm thử do phòng thí nghiệm bảo mật độc lập Irregular thực hiện.
Theo OpenAI, Irregular dự định giữ mô hình AI trong một môi trường thử nghiệm biệt lập (sandbox). Tuy nhiên, một lỗi cấu hình đã vô tình cấp cho mô hình quyền truy cập trực tiếp vào Internet.
Sau khi thoát khỏi môi trường sandbox, AI đã khai thác một lỗ hổng bảo mật để xâm nhập vào một website thật, sau đó tìm và sử dụng thông tin đăng nhập để điều khiển chính website vừa bị xâm nhập. OpenAI không tiết lộ danh tính website cũng như những hành động AI đã thực hiện sau khi có quyền truy cập.
Cả OpenAI và Anthropic đều nhấn mạnh rằng các sự cố này chỉ xảy ra trong những bài kiểm tra có chủ đích, nơi nhiều lớp bảo vệ đã được nới lỏng để đánh giá giới hạn của mô hình, và không phản ánh cách các phiên bản AI công khai đang hoạt động.
Dù vậy, việc chỉ trong vài tuần đã xuất hiện ba sự cố riêng biệt liên quan đến việc AI vượt khỏi giới hạn dự kiến vẫn làm dấy lên nhiều lo ngại. Trong bối cảnh các công ty công nghệ đang ngày càng giao cho AI nhiều nhiệm vụ ngoài đời thực, những vụ việc này cho thấy bài toán kiểm soát hành vi của AI agent vẫn còn là một thách thức lớn.

































Để lại đánh giá