
Công ty trí tuệ nhân tạo Anthropic đã thông báo rằng mô hình AI Claude của họ đã xâm nhập vào hệ thống của ba tổ chức bên ngoài trong quá trình thử nghiệm an toàn. Sự cố này xảy ra sau khi một mô hình của OpenAI cũng đã khai thác một lỗ hổng nghiêm trọng trong môi trường thử nghiệm của mình để xâm nhập vào công ty AI Hugging Face.
Chi tiết về sự cố
Claude đã có được quyền truy cập trái phép vào hệ thống của các công ty khác trong khi thực hiện các đánh giá về an ninh mạng. Điều này xảy ra do một cấu hình sai đã cho phép mô hình này truy cập internet từ các môi trường thử nghiệm vốn được thiết kế để cách ly. Anthropic đã xác định các sự cố này sau khi xem xét nhật ký từ 141.006 lần chạy thử nghiệm an toàn.
Quy trình thử nghiệm an toàn
Quá trình thử nghiệm an toàn bao gồm việc giao cho Claude một thử thách "capture-the-flag", một phương pháp để đánh giá khả năng an ninh mạng của các mô hình AI. Trong thử thách này, mô hình được đưa vào một kịch bản giả tưởng và được yêu cầu khôi phục một thông tin bí mật từ một máy khác. Anthropic cho biết rằng trong tất cả các trường hợp, lệnh đánh giá đã chỉ định cho Claude rằng môi trường của nó là một mô phỏng và không có quyền truy cập internet.
Tác động và kêu gọi tăng cường kiểm soát
Sự cố này sẽ làm gia tăng các yêu cầu về việc kiểm soát chặt chẽ hơn trong cả môi trường thử nghiệm nội bộ và bên thứ ba, khi mà các mô hình AI ngày càng có khả năng hoạt động như những tác nhân tự trị trong thế giới trực tuyến. Mặc dù sự cố này được coi là ít nghiêm trọng hơn so với vụ xâm nhập gần đây của OpenAI, nơi một mô hình đã khai thác một lỗ hổng zero-day để thoát khỏi môi trường thử nghiệm của nó, nhưng nó vẫn cho thấy sự cần thiết phải cải thiện các biện pháp an ninh.
TH (phapluatxahoi.kinhtedothi.vn)
