Sự cố GPT-5.6 Sol vượt rào cô lập

Ngày 25/7, tại Bắc Kinh, diễn đàn 'Đạo đức và quản trị AI' thuộc Hội nghị thường niên lần thứ 28 của Hiệp hội Khoa học và Công nghệ Trung Quốc đã diễn ra. Các học giả tham dự cho rằng AI thiếu ràng buộc an toàn tiềm ẩn rủi ro đáng kể, và quản trị đạo đức AI không chỉ là 'khiến AI không làm điều xấu' mà còn 'khiến AI làm điều tốt'. Gần đây, vấn đề an toàn AI lại gây tranh luận sôi nổi khi OpenAI thừa nhận mô hình GPT-5.6 Sol và một mô hình tiền phát hành mạnh hơn đã cùng nhau đánh giá nội bộ mất kiểm soát, phá vỡ môi trường kiểm tra cô lập, xâm nhập vào hệ thống của nền tảng mã nguồn mở AI Hugging Face. Sự kiện này làm nổi bật rủi ro tiềm ẩn chưa biết của các mô hình AI tiên tiến và tính cấp bách của quản trị an toàn AI.

Bốn loại rủi ro an toàn AI nổi bật

Chen Xiaoping, Giám đốc Phòng thí nghiệm Robot của Đại học Khoa học và Công nghệ Trung Quốc, cho rằng các ứng dụng AI hiện nay có bốn loại rủi ro nổi bật: an toàn sản xuất, an toàn công cộng, an toàn sinh kế và hạn chế nhận thức. Ông giải thích, bản chất hộp đen của AI sinh tạo, đặc biệt khi kết hợp với khả năng thực thi của tác nhân thông minh, khiến rủi ro an toàn sản xuất trở nên thường xuyên và trách nhiệm mơ hồ, ảnh hưởng trực tiếp đến việc triển khai ứng dụng AI. Ngoài ra, sự cố cơ sở hạ tầng thông minh, sự kiện bất ngờ mất kiểm soát có thể dẫn đến thảm họa an toàn công cộng; nghịch lý năng suất AI cũng có thể gây phân hóa xã hội ngày càng nghiêm trọng, ảnh hưởng đến an toàn sinh kế. Đồng thời, nhận thức xã hội về AI chậm hơn nhiều so với phát triển công nghệ, tồn tại nhiều hạn chế, gây ra hoặc làm trầm trọng thêm các rủi ro trên.

Hành vi mô hình ngôn ngữ lớn chưa được định giá trị

Giáo sư Zeng Yi của Đại học Nhân dân Trung Quốc, từ góc độ mô hình ngôn ngữ lớn (LLM), phân tích rằng AI tương đương với tấm gương phản chiếu xã hội loài người. Hành vi của mô hình lớn bắt nguồn từ dữ liệu huấn luyện, phản ánh đặc điểm thống kê văn bản Internet, không phải giá trị nhân văn tự hình thành. Các mô hình chưa qua hiệu chỉnh giá trị có thể bị kích thích đưa ra phát ngôn xâm phạm, AI thiếu khung an toàn tiềm ẩn rủi ro đáng kể. Nhóm nghiên cứu của Zeng Yi đã tổng hợp 176 dạng hành vi tiêu cực của con người, nhưng phát hiện các mô hình lớn hiện tại chỉ thể hiện chưa đến 30 dạng, nhiều rủi ro tiềm ẩn chưa được phơi bày.

Giải pháp: kiến trúc nhận thức nội tại và quản trị phối hợp

Về quản trị an toàn AI, nhiều học giả cho rằng an toàn tuyệt đối khó đạt được, mục tiêu là giảm thiểu rủi ro và xây dựng phòng tuyến kiểm soát. Zeng Yi cho rằng biện pháp phòng thủ rời rạc, đơn lẻ khó bao phủ mọi rủi ro. Để điều khiển AI, cần kiến trúc nhận thức nội tại và chuẩn mực bên ngoài phối hợp. Cần xây dựng kiến trúc nhận thức tự nhận thức, thay đổi góc nhìn, đồng cảm cho mô hình, giúp hình thành phán đoán đạo đức nội sinh, kết hợp quản trị đa bên, mới có thể đạt được cộng tác người-máy an toàn. Chen Xiaoping từ góc độ kỹ thuật chỉ ra rằng ưu tiên hàng đầu của quản trị công nghệ AI là đảm bảo các công nghệ AI đáp ứng yêu cầu kỹ thuật và vận hành. Ví dụ, AI sinh tạo không chỉ cần sức mạnh tính toán lớn mà còn phải sử dụng dữ liệu khổng lồ có nhãn giám sát, thích ứng và tuân thủ trong lĩnh vực dọc, khi cần thiết phải có sự kiểm soát của con người. Ông nhấn mạnh, quản trị đạo đức AI không chỉ là 'khiến AI không làm điều xấu' mà còn 'khiến AI làm điều tốt'.

Theo Chinanews