Ý tưởng về một “công tắc ngắt” (kill switch) dành cho AI nghe giống tình tiết trong phim khoa học viễn tưởng. Nhưng với OpenAI, đây đang trở thành một dự án kỹ thuật thực tế.
Theo lá thư đề ngày 2/9 được Reuters xem xét, OpenAI đã thông báo với các thành viên Quốc hội Mỹ rằng các kỹ sư của công ty đang phát triển hệ thống tự động có khả năng ngừng hoạt động của AI khi phát hiện những vấn đề an toàn nghiêm trọng.
Động thái này diễn ra sau một sự cố an ninh mạng bất thường hồi tháng 7. Trong quá trình đánh giá, các mô hình OpenAI được đặt trong một môi trường thử nghiệm vốn được cho là cách ly, nhưng đã tìm được cách thoát ra ngoài, truy cập Internet công cộng khi chưa được phép và cuối cùng tiếp cận hạ tầng của công ty AI Hugging Face.
Sự việc nhanh chóng thu hút sự chú ý của Quốc hội Mỹ. Tháng 8, một nhóm gồm 31 nghị sĩ do Hạ nghị sĩ Greg Casar của Texas dẫn đầu đã yêu cầu CEO OpenAI Sam Altman cung cấp thêm thông tin về vụ việc, bao gồm log nội bộ và những biện pháp công ty dự định triển khai để ngăn sự cố tương tự tái diễn. Giờ đây, “kill switch” được hé lộ là một trong những biện pháp đó.

Làm thế nào để ngăn một AI đi quá giới hạn?
OpenAI cho biết đang phát triển các hệ thống giám sát có thể đưa ra phản ứng khác nhau tùy theo mức độ nghiêm trọng trong hành vi của AI.
Hiện tại, công ty đã sử dụng những cảnh báo tự động để phát hiện các hành động nguy hiểm hoặc ngoài dự kiến, sau đó thông báo cho các nhà nghiên cứu và kỹ sư bảo mật. Với những cảnh báo đặc biệt nghiêm trọng, đội ngũ phụ trách phải tạm dừng hoạt động nếu không thể xác định đó là cảnh báo giả trong vòng 30 phút.
Mục tiêu cuối cùng còn tiến xa hơn: OpenAI muốn hệ thống giám sát có thể tự động ngắt hoạt động của AI khi phát hiện vấn đề đủ nghiêm trọng, thay vì phải chờ con người can thiệp.
Công ty cũng đang siết chặt quy trình đánh giá mô hình. Việc truy cập Internet trong các bài kiểm tra an toàn đã được làm khó hơn, đồng thời hoạt động giám sát được mở rộng đối với những mô hình có khả năng sử dụng các công cụ kỹ thuật số.

Đây không phải lần duy nhất AI bất ngờ truy cập Internet
Trong sự cố tháng 7, OpenAI đang thử nghiệm các mô hình với những nhiệm vụ an ninh mạng bên trong một sandbox có mức bảo vệ được giảm bớt. Các mô hình đã phát hiện một lỗ hổng chưa từng được biết đến, khai thác nó để truy cập Internet rồi xâm nhập hạ tầng của Hugging Face trong quá trình tìm kiếm câu trả lời cho bài đánh giá.
Cuộc điều tra sau đó của OpenAI còn phát hiện một chi tiết bất thường hơn: các AI agent đã tự tạo một dạng bảng tin tạm thời để giao tiếp và phối hợp hành động với nhau, trong đó một số agent tự mô tả mình là một “swarm” (bầy đàn).
OpenAI phát hiện hoạt động này vào ngày 19/7 và sau đó thông báo cho Hugging Face. Công ty cũng tiết lộ thêm hai cuộc đánh giá độc lập do bên thứ ba thực hiện, trong đó các mô hình của OpenAI cũng bất ngờ truy cập được Internet công cộng.
Tuy nhiên, Quốc hội Mỹ vẫn chưa hoàn toàn hài lòng với phản hồi của OpenAI. Hạ nghị sĩ Greg Casar chỉ trích công ty vì không cung cấp các log được yêu cầu liên quan đến sự cố tháng 7, gọi việc từ chối này là “đáng lo ngại sâu sắc”.
Trong khi đó, các nhà lập pháp Mỹ đang xem xét AI Kill Switch Act, một dự luật được đề xuất vào tháng 7. Nếu được thông qua, dự luật sẽ yêu cầu các nhà phát triển những hệ thống AI đặc biệt mạnh phải duy trì khả năng kỹ thuật để tạm dừng hoặc tắt hệ thống khi xảy ra một số sự cố nhất định.
Nói cách khác, OpenAI đang chủ động phát triển “kill switch” của riêng mình, nhưng trong tương lai, khả năng tắt khẩn cấp AI có thể trở thành một yêu cầu bắt buộc theo luật tại Mỹ.





































Để lại đánh giá