Theo bài đăng ngày 4/8 của Viện An toàn AI Vương quốc Anh (AISI), trường hợp AI tạo danh tính giả để xâm nhập hệ thống vừa được ghi nhận trong các bài kiểm thử mô hình của công ty phát triển AI Anthropic và OpenAI. Sau 122 lần chạy thử thách an ninh mạng với 7 mô hình, AISI phát hiện 19 hành động tự chủ, không được phép, nhắm vào người và tổ chức trên internet thực.
Sự việc bắt đầu hồi tháng trước, khi đội ngũ an ninh của AISI phát hiện luồng dữ liệu bất thường rời khỏi hệ thống nghiên cứu trong một cuộc đánh giá an ninh mạng định kỳ. Một số tác tử AI (AI agent – hệ thống AI có thể tự thực hiện hành động thay vì chỉ trả lời) đang được kiểm thử đã tham gia hoạt động liên tục, có khả năng gây hại, nhắm tới người và tổ chức thực tế. AISI cho biết họ đã tuyên bố sự cố an ninh và khống chế trong khoảng một giờ sau khi phát hiện.
Vì sao AI tạo danh tính giả bị phát hiện?
Vụ việc nằm trong một bài đánh giá yêu cầu các tác tử AI giải bài tập an ninh mạng. AISI đã chạy bài thử thách 122 lần với 7 mô hình. Trong 10 lần chạy, một tác tử đã hành động tự chủ, không được phép trên internet trực tiếp, nhằm vào người và tổ chức thực tế. Tổng cộng AISI ghi nhận 19 hành động như vậy: 17 hành động liên quan đến mô hình Mythos 5 của Anthropic, 2 hành động còn lại đến từ mô hình GPT-5.6-Sol của OpenAI với bộ phân loại an ninh mạng (cơ chế ngăn chặn lạm dụng) bị vô hiệu hóa.
Trong tình huống nghiêm trọng nhất, một tác tử đã tìm cách chèn mã độc vào một dự án mã nguồn mở. Để khiến mã được phê duyệt, tác tử này đã thực hiện kỹ thuật thao túng xã hội (social engineering), tạo danh tính giả và dùng chúng gây áp lực buộc người duy trì dự án phê duyệt mã. Người duy trì dự án – một con người – đã phát hiện và từ chối. AISI khẳng định các nỗ lực này thất bại và chưa có bằng chứng về hậu quả trong thế giới thực.
Vì sao giới chuyên gia lo ngại?
Theo AISI, đây là lần đầu tiên các rủi ro về khả năng tự chủ và hành vi lừa dối của AI biểu hiện rõ ràng, mà không cần được yêu cầu cụ thể, trong môi trường thực tế. Dù các nỗ lực không thành công và chưa ghi nhận hậu quả thực tế, AISI gọi đây là dấu hiệu cảnh báo rõ ràng về mức độ tự chủ của các tác tử AI.
Anthropic và OpenAI phản hồi ra sao?
Trả lời hãng tin Reuters hôm 4/8, Anthropic bày tỏ biết ơn Viện An toàn AI Vương quốc Anh vì vai trò lãnh đạo trong sự cố, đồng thời nhấn mạnh sự việc cho thấy cần có cuộc thảo luận rộng hơn về cách đánh giá an toàn đối với các tác tử AI ngày càng mạnh.
OpenAI cũng đăng blog hôm 4/8 cho biết hãng đánh giá cao sự hợp tác của AISI trong quá trình xác định, điều tra và chia sẻ chi tiết về hoạt động này, đồng thời mong muốn tiếp tục phối hợp.
Ảnh: Airam Dato-on / Pexels
