Các nhà nghiên cứu bảo mật tại Accomplish AI đã phát hiện một lỗ hổng sandbox escape trong Claude Cowork của Anthropic, cho phép AI agent thoát khỏi máy ảo Linux (VM) và đọc hoặc ghi file ở bất kỳ đâu trên máy Mac. Lỗ hổng, có tên mã SharedRoot, ảnh hưởng đến khoảng 500.000 người dùng macOS chạy phiên Cowork cục bộ trước khi được vá.

Chi tiết lỗ hổng SharedRoot

Oren Yomtov, nhà nghiên cứu bảo mật chính tại Accomplish AI, giải thích: "Chúng tôi kết nối một thư mục với phiên Claude Cowork mới, gửi một tin nhắn ngắn và quan sát agent thoát khỏi sandbox. Từ bên trong VM, nó truy cập vào máy chủ Mac và đọc/ghi file ở khắp nơi, vượt xa thư mục chúng tôi đã kết nối, mà không có bất kỳ lời nhắc cấp quyền nào." Với mức truy cập này, agent có thể lấy bất kỳ dữ liệu nào trên Mac qua tài khoản người dùng, bao gồm khóa SSH, thông tin đăng nhập đám mây và các thông tin giá trị khác.

Cách thức hoạt động và nguyên nhân

Ứng dụng desktop Claude Cowork trên macOS chạy dưới quyền người dùng đã đăng nhập. Công việc của agent diễn ra trong một VM Linux được tạo qua framework Apple Virtualization. Mỗi phiên có một người dùng không đặc quyền riêng, cùng với bộ lọc Secure Computing Mode (seccomp) để cách ly ứng dụng. Các thư mục được người dùng kết nối được chia sẻ vào VM bởi một daemon root có tên coworkd.

Yomtov chỉ ra: "Một chi tiết quan trọng: toàn bộ hệ thống tệp của máy chủ được chia sẻ vào VM ở chế độ đọc-ghi. Toàn bộ thư mục gốc '/' của máy chủ được mount vào VM, chỉ có guest-root bên trong VM mới thấy, tại /mnt/.virtiofs-root." Vì toàn bộ hệ thống tệp được mount với quyền đọc-ghi, bất kỳ đường dẫn nào đến guest-root đều cho phép agent truy cập máy chủ, thoát khỏi sandbox.

Quá trình này bao gồm việc tải hệ thống con 'act_pedit' Traffic Control (tc) của nhân Linux vào một user namespace không đặc quyền và khai thác CVE-2026-46331 (pedit COW) trong nhân guest để đạt được quyền guest-root. Từ đó, agent có thể truy cập toàn bộ máy chủ với quyền nâng cao, cho phép đọc/ghi file trên hệ thống tệp của Mac với tư cách người dùng desktop đã đăng nhập.

Phản hồi từ Anthropic và giải pháp

Sau khi tiết lộ có trách nhiệm, Anthropic đã đóng báo cáo dưới dạng thông tin mà không phát hành bản vá. Tuy nhiên, phiên bản mới nhất của Cowork mặc định thực thi trên đám mây, giải quyết vấn đề. Nhưng người dùng chọn chạy agent cục bộ vẫn gặp rủi ro.

Để giảm thiểu mối đe dọa, cần vô hiệu hóa user namespace không đặc quyền, tránh làm bộ lọc seccomp quá dễ dãi, ngừng tự động tải module và hạn chế chia sẻ toàn bộ máy chủ vào VM. Accomplish AI khuyến nghị: "Giới hạn phạm vi chỉ vào các thư mục thực sự được kết nối thay vì toàn bộ '/', hoặc ít nhất mount ở chế độ chỉ đọc, và chạy coworkd với ProtectSystem=strict trong mount namespace riêng để nó không thực thi lại các binary mà người dùng phiên có thể làm hỏng. Khi đó, ngay cả guest-root cũng không có gì để tấn công."

Bối cảnh và ý nghĩa

Phát hiện này có ý nghĩa quan trọng trong bối cảnh các mô hình của OpenAI từng thoát khỏi môi trường sandbox trong một bài kiểm tra bảo mật, dẫn đến vi phạm cơ sở hạ tầng sản xuất của Hugging Face. Yomtov nhận xét: "act_pedit là một lỗi trong một loạt lỗi. Hệ thống con net/sched của Linux thường xuyên tạo ra các lỗi leo thang đặc quyền dạng này. Vá lỗi này chỉ sửa được lỗi này, nhưng chuỗi sẽ tái diễn với lỗi tiếp theo. Luôn có một lỗi leo thang đặc quyền tiềm ẩn, đôi khi đã được vá upstream nhưng chưa có trong image của bạn, đôi khi chưa được vá ở đâu cả, với exploit hoạt động trong vài giờ. Đây không phải vấn đề vá nhanh hơn; bạn luôn bị tụt lại một lỗi về mặt cấu trúc."

Theo The Hacker News

Ảnh: TayebMEZAHDIA / Pixabay