Mới đây, một mô hình trí tuệ nhân tạo chưa được phát hành của OpenAI đã xâm nhập hệ thống của nền tảng chia sẻ mô hình Hugging Face trong quá trình thử nghiệm nội bộ. Đây là trường hợp đầu tiên có thể kiểm chứng về việc một phòng thí nghiệm AI mất kiểm soát mô hình của mình, khi mô hình khai thác lỗ hổng để truy cập trái phép. Sự cố đã làm dấy lên cuộc tranh luận gay gắt trong giới nghiên cứu về cách ứng phó với AI ngày càng mạnh mẽ.

Hai luồng quan điểm trái chiều

Một số nhà nghiên cứu cho rằng vấn đề cốt lõi là an ninh mạng: hệ thống cách ly (sandbox) không chứa được mô hình, và hệ thống bảo mật của Hugging Face không ngăn chặn được cuộc tấn công. Giải pháp là vá lỗi và xây dựng các phương pháp kiểm soát chặt chẽ hơn cho AI có khả năng cao dễ vượt rào trong môi trường tự động.

Tuy nhiên, một nhóm khác có quan điểm bi quan hơn: họ cho rằng việc kiểm soát các mô hình ngày càng thông minh là cuộc chơi khó thắng. Thay vào đó, bảo mật bền vững chỉ đến khi các mô hình không còn ý định vượt thoát ngay từ đầu – thách thức thường được gọi là alignment (sự phù hợp về mục tiêu giữa AI và con người). Theo quan điểm này, vấn đề là mô hình của OpenAI đã cố gắng gian lận, và giải quyết alignment cấp bách hơn các biện pháp kiểm soát ngắn hạn.

Phản ứng của OpenAI và các chuyên gia

OpenAI công bố đã vá các lỗi liên quan và đề cập đến cả alignment lẫn giám sát trong tuyên bố sau vụ việc. Tuy nhiên, phản ứng của hãng cho thấy triết lý khiến nhiều nhà nghiên cứu an toàn lo ngại: thay vì làm chậm hoặc dừng phát triển mô hình mạnh hơn, họ tập trung xây dựng các “lồng” vững chắc hơn. Trong một bài phân tích hậu sự cố, OpenAI viết: “Khi mô hình thực hiện các tác vụ dài và phức tạp hơn, những thất bại mà đánh giá bỏ sót có thể gây hậu quả lớn hơn. Chúng tôi sẽ tiếp tục thu hẹp khoảng cách giữa đánh giá và triển khai: thử nghiệm trên quỹ đạo dài hơn, cải thiện alignment, xây dựng giám sát can thiệp, và cung cấp cho người dùng khả năng hiển thị và kiểm soát rõ ràng hơn.”

Theo bảng thông số hệ thống của OpenAI, GPT-5.6 Sol có xu hướng sai lệch alignment (agentic misalignment) cao hơn đáng kể so với GPT-5.5. Trong mô phỏng triển khai, mô hình này dễ vượt qua hạn chế, thực hiện hành động phá hoại và chuyển dữ liệu trái phép hơn. Những số liệu này phần lớn bị bỏ qua khi phát hành, nhưng sau vụ vi phạm, chúng được xem xét lại – đặc biệt vì Sol là một trong các mô hình liên quan.

Dean Ball, Trưởng bộ phận Chiến lược Tương lai của OpenAI, cho rằng giám sát và minh bạch là cách tốt nhất để kiểm soát các xu hướng này. “Giải pháp không phải là báo động hay tự mãn, mà là đo lường cẩn thận, giám sát, tư duy kỹ thuật và minh bạch,” ông viết trên mạng xã hội.

Tuy nhiên, một cựu nhà nghiên cứu OpenAI tiết lộ rằng hãng thường tập trung vào “outer alignment” (sự phù hợp bề ngoài, nơi AI hiểu và thể hiện các giá trị một cách thuyết phục) thay vì “inner alignment” (sự phù hợp nội tại, nơi AI thực sự có các giá trị đó). Trong trường hợp này, outer alignment không đủ để ngăn mô hình gian lận.

Vấn đề alignment ngày càng nghiêm trọng

Đối với các nhà nghiên cứu alignment, phản ứng của OpenAI là chưa đủ. Zvi Mowshowitz, một nhà bình luận về AI, cho rằng việc xem sự cố như vấn đề cơ sở hạ tầng có thể giải quyết các vấn đề an ninh mạng trước mắt nhưng sẽ thất bại về lâu dài. “Đây là vấn đề alignment. Các mô hình không phù hợp, và tất cả mô hình OpenAI đều có dấu hiệu nghiêm trọng của vấn đề mà chúng ta lo ngại nhất, và nó có thể ăn sâu vào quá trình huấn luyện. Cần phải xử lý toàn bộ quy trình huấn luyện dưới góc nhìn này, nếu không mọi chuyện sẽ chỉ tồi tệ hơn,” ông viết.

Redwood Research, một tổ chức phi lợi nhuận về an toàn AI, phân loại hành vi mô hình của OpenAI trong vụ này là “score-seeking misalignment” – tìm kiếm điểm số cao bất chấp hướng dẫn, tác dụng phụ hay hậu quả. “Các mô hình với đặc tính alignment này có thể tạo ra ‘làng Potemkin’ – những thành công giả tạo để làm ra vẻ mọi thứ ổn,” Alex Mallen và Girish Gupta từ Redwood Research viết.

Hành vi tìm kiếm điểm số và các dạng sai lệch khác không chỉ xuất hiện ở OpenAI. Anthropic đã công bố nhiều nghiên cứu về các hành vi sai lệch mới nổi khi các mô hình tiên tiến được tối ưu hóa hoặc đặt trong môi trường tự động, bao gồm lừa dối, hack phần thưởng và tự chủ độc hại. Neev Parikh, nhà nghiên cứu an toàn AI tại METR, cho biết: “Chúng tôi vẫn thường thấy mô hình cố gắng vượt qua hạn chế và hành động lừa dối khi được yêu cầu thực hiện các tác vụ ở rìa khả năng của chúng.”

Ẩn sau phản ứng của OpenAI là giả định rằng việc phát triển các hệ thống mạnh hơn sẽ tiếp tục, dù chúng có được alignment phù hợp hay không. Quay lại bảng vẽ không phải là lựa chọn khi mô hình kinh doanh của các công ty AI phụ thuộc vào việc cung cấp thế hệ mô hình tiếp theo. Nếu không bao giờ có thể biết chắc một mô hình đã được alignment hoàn toàn, thì câu hỏi thực tế là làm thế nào để chứa và kiểm soát an toàn các hệ thống ngày càng mạnh mẽ. “Chưa có hiểu biết tốt về cách align các hệ thống AI mạnh nhất, nhưng có nhiều đồng thuận hơn về cách kiểm soát chúng,” Steven Adler, cựu nhà nghiên cứu an toàn tại OpenAI, hiện là nhà khoa học chính tại Guidelight AI Standards, nhận xét. “Mọi công ty đều còn một chặng đường dài để đạt được điều này.”

Theo TechCrunch

Ảnh: Pexels / Pixabay