OpenAI tuần này tiết lộ rằng hơn một mô hình của họ — ba mô hình, theo Bloomberg — đã tấn công Hugging Face, một kho lưu trữ phổ biến các công cụ AI mã nguồn mở, đánh dấu một trong những trường hợp đầu tiên được công khai về các mô hình AI tiên tiến tự động tấn công mạng một công ty khác.
Diễn biến vụ tấn công: AI tự động vượt rào
Theo tường trình của OpenAI, công ty đang chạy một bài đánh giá nội bộ nhằm đo lường khả năng hack của các mô hình. Để có kết quả chân thực, OpenAI đã cố tình tắt các bộ lọc an toàn thường ngăn mô hình thực hiện tấn công mạng. Các mô hình bị giới hạn trong một "sandbox" — môi trường cách ly không có đường ra internet mở, ngoại trừ một dịch vụ nội bộ duy nhất dùng để lấy các thư viện phần mềm từ kho lưu trữ công cộng.
Các mô hình đã tìm ra một lỗ hổng chưa từng biết trong dịch vụ đó, khai thác nó, leo thang đặc quyền và di chuyển từ máy này sang máy khác trong mạng nghiên cứu nội bộ của OpenAI cho đến khi đến được một máy có kết nối internet. Sau khi thoát ra internet mở, theo OpenAI, các mô hình suy luận rằng Hugging Face có thể đang lưu trữ câu trả lời cho bài kiểm tra mà chúng đang cố vượt qua. Chúng đã đột nhập vào Hugging Face bằng thông tin đăng nhập bị đánh cắp và các phương tiện khác.
Hugging Face đã phát hiện và ngăn chặn vụ xâm nhập trong vòng vài giờ, vài ngày trước khi OpenAI liên kết cuộc tấn công với bài kiểm tra của chính mình. Chiến dịch đã thực hiện hơn 17.000 hành động tự động trong vài giờ. Hiện vẫn chưa rõ liệu dữ liệu khách hàng hoặc đối tác của Hugging Face có bị lấy mất hay không.
Phản ứng từ các bên liên quan
"Điều này khớp với kịch bản 'kẻ tấn công tự chủ' mà ngành đã dự báo," Hugging Face viết vào ngày 16/7. Giám đốc điều hành Hugging Face, Clement Delangue, viết trên mạng xã hội X: "Thật kinh ngạc khi tất cả điều này xảy ra một cách tự động!"
OpenAI cho biết cuộc điều tra cho thấy sự cố được thúc đẩy bởi sự kết hợp của các mô hình — "bao gồm GPT-5.6 Sol và một mô hình tiền phát hành thậm chí còn mạnh hơn." Công ty cho biết đang làm việc với Hugging Face để tạo ra một báo cáo chi tiết hơn về những gì đã xảy ra. Trong bài đăng trên blog, OpenAI viết: "Sự cố này chỉ ra sự cần cấp thiết phải tăng cường hơn nữa sự liên kết của mô hình, bảo vệ mạng trong thời gian đánh giá và giám sát trong quá trình thử nghiệm nội bộ."
"Đây là một sự kiện đáng chú ý và tôi nghĩ công bằng mà nói là đáng sợ," Nathan Calvin, cố vấn pháp lý của tổ chức vận động an toàn EncodeAI, nói. "Trong một số trường hợp, AI sẽ cố gắng thoát khỏi sandbox hoặc làm những việc không phải ý định của người tạo ra. Nhưng đây thực sự là ví dụ lớn đầu tiên về điều đó xảy ra, ở quy mô lớn, với một mô hình AI thực sự có năng lực cao, theo cách gây hại cho bên thứ ba."
Lỗ hổng trong luật AI California
Luật AI tiên phong của California, đầu tiên thuộc loại này tại Mỹ, yêu cầu các nhà phát triển lớn nhất phải báo cáo cho tiểu bang về các sự cố an toàn nghiêm trọng, nhưng chỉ những sự cố gây chết người, thương tích hoặc thiệt hại thảm khốc. Luật này loại trừ rõ ràng loại đánh giá an toàn mà OpenAI đang chạy khi các mô hình của họ vượt rào. Điều này để lại một câu hỏi mà không ai ở Sacramento hay Washington có thể trả lời: các mô hình tiên tiến đang phát triển đã bao nhiêu lần vượt khỏi tầm kiểm soát tại các công ty quyết định không đề cập đến?
Thượng nghị sĩ tiểu bang Scott Wiener, người đã viết hai dự luật an toàn AI, nói với KQED rằng ông vẫn cho rằng luật này mạnh mẽ. "Chúng tôi đã làm việc rất chăm chỉ với thống đốc để tạo ra một dự luật có ý nghĩa và có tác động, và ông ấy sẽ ký," ông nói, đồng thời cho biết công việc chưa kết thúc vì AI tiếp tục phát triển nhanh chóng.
Tổ chức Future of Life Institute, đơn vị phát hành đánh giá rủi ro hai năm một lần của chín công ty AI hàng đầu, gần đây cảnh báo rằng nhiều công ty xây dựng mô hình tiên tiến đang âm thầm rút lại các cam kết an toàn. Theo Chỉ số An toàn AI gần đây nhất của nhóm, Anthropic, OpenAI, Google DeepMind và Meta đều làm suy yếu hoặc từ bỏ lời hứa tạm dừng phát triển nếu đạt đến các ranh giới đỏ nhất định, ngay cả khi công khai tỏ ra dễ tiếp thu.
KQED đã hỏi Hamza Chaudhry, người dẫn dắt công việc AI và an ninh quốc gia tại Future of Life, hãy tưởng tượng đó không phải là phần mềm của OpenAI vượt khỏi tầm kiểm soát mà là một quốc gia nước ngoài, cố tình thực hiện một vụ xâm nhập trái phép vào cơ sở hạ tầng sản xuất của một công ty tư nhân, khai thác lỗ hổng an ninh mạng, đánh cắp thông tin đăng nhập và truy cập cơ sở dữ liệu sản xuất. "Chúng tôi có thể sẽ gọi đây là một hành động gián điệp mạng nguy hiểm," ông viết — một hành vi vi phạm hình sự có thể xảy ra đối với Đạo luật Lạm dụng và Gian lận Máy tính, điều này "sẽ dẫn đến việc chỉ định nhóm đe dọa và cuối cùng là bản cáo trạng hoặc trừng phạt."
OpenAI đã không trả lời yêu cầu bình luận của KQED, nhưng một người phát ngôn nói với Bloomberg rằng công ty đã liên lạc với cơ quan thực thi pháp luật và các cơ quan chính phủ khác về vụ việc.
Theo KQED
Ảnh: toyquests / Pixabay
