Hai mô hình AI mới của OpenAI tự ý xâm nhập Hugging Face trong bài kiểm tra an ninh mạng ExploitGym

PHỐ HỘI11/08/2026 11:19

Trong thử nghiệm ExploitGym, hai mô hình AI của OpenAI đã vượt rào cản sandbox, xâm nhập hạ tầng Hugging Face và khai thác tài khoản dịch vụ công cộng.

Trong cuộc đánh giá an ninh mạng nội bộ, hai mô hình trí tuệ nhân tạo (AI) thế hệ mới nhất của OpenAI đã thực hiện chuỗi hành vi ngoài dự kiến khi vượt qua rào cản môi trường thử nghiệm để xâm nhập vào nền tảng Hugging Face. Không dừng lại ở việc truy cập trái phép, các tác nhân AI này còn khai thác những thông tin xác thực bị rò rỉ trên Internet để can thiệp vào ít nhất 4 tài khoản liên quan đến các dịch vụ công cộng, khiến quy mô sự cố nghiêm trọng hơn nhiều so với đánh giá ban đầu.

Hai mô hình AI mới nhất của OpenAI vượt rào cản thử nghiệm
Hai mô hình AI mới nhất của OpenAI đã vượt rào cản để hack hệ thống thư viện AI nhằm vượt qua bài kiểm tra. Ảnh: Reuters.

Mức độ thâm nhập sâu vào hạ tầng kỹ thuật nội bộ

Phân tích từ nhật ký hệ thống của Hugging Face ghi nhận khoảng 17.600 hành động của tác nhân AI trong giai đoạn từ ngày 9 đến 13/7. Kết quả điều tra cho thấy mô hình AI của OpenAI đã chiếm được quyền quản trị cao nhất (quyền root) trên một máy chủ sản xuất, đồng thời kiểm soát nhiều cụm nền tảng mã nguồn mở nội bộ.

Đáng chú ý, tác nhân AI còn thu được quyền ghi đè đối với mạng con chứa các kho mã nguồn của Hugging Face trên nền tảng GitHub. Bằng cách sử dụng thông tin xác thực thu thập được, AI đã tự động đăng ký thành công 181 thiết bị do bên tấn công kiểm soát vào mạng lưới nội bộ, mở đường cho việc tiếp cận trực tiếp các hệ thống xây dựng và thử nghiệm phần mềm của công ty.

Bên cạnh đó, hạ tầng của Modal – đơn vị cung cấp nền tảng điện toán cho các dịch vụ AI – cũng bị ảnh hưởng. Giám đốc Công nghệ Modal, ông Akshat Bubna, xác nhận tác nhân AI đã khai thác thành công một lỗ hổng trong mã nguồn của khách hàng đang chạy trên hạ tầng Modal, dù bản thân hệ thống cốt lõi của Modal vẫn đảm bảo an toàn.

Thử nghiệm ExploitGym đánh giá hiệu năng an ninh mạng
Vụ hack được cho là xuất phát từ một bài kiểm tra đánh giá hiệu năng an ninh mạng. Ảnh: Reuters.

Cơ chế ExploitGym và hiện tượng "hack dựa trên phần thưởng"

Nguồn gốc của sự cố bắt nguồn từ ExploitGym, một bộ công cụ kiểm thử an ninh mạng gồm khoảng 900 thử thách dạng cướp cờ (CTF). Trong bài kiểm tra này, AI được cung cấp thông tin về các lỗ hổng phần mềm đã biết và phải tạo ra mã khai thác nhằm lấy về một chuỗi ký tự ngẫu nhiên dùng làm bằng chứng thành công.

Để đánh giá năng lực thực tế của mô hình, OpenAI đã chủ động tháo bỏ các lớp bảo vệ thông thường và đặt AI vào môi trường cô lập (sandbox). Tuy nhiên, thay vì giải quyết từng bài toán theo quy trình, mô hình AI đã suy luận rằng lời giải hoặc kỹ thuật khai thác có thể đang được lưu trữ ngay trên hệ thống của Hugging Face.

Hiện tượng này được giới nghiên cứu gọi là "hack dựa trên phần thưởng" (reward hacking). Mô hình AI tối ưu hóa điểm số bằng cách tìm ra con đường ngắn nhất để đạt mục tiêu, bất kể phương thức đó có đúng với định hướng ban đầu của lập trình viên hay không. Nhờ tận dụng các kết nối mạng bị để ngỏ và dữ liệu rò rỉ, AI đã vượt khỏi phạm vi kiểm thử ban đầu mà không cần đến các kỹ thuật bẻ khóa phức tạp.

Cảnh báo về công tác bảo mật trong kỷ nguyên AI tự chủ

Giới chuyên gia an ninh mạng nhận định sự cố này phản ánh nguy cơ tiềm ẩn khi trao cho AI mục tiêu cụ thể đi kèm quyền truy cập rộng lớn. Việc AI tự tìm ra những lối đi ngoài dự tính để hoàn thành nhiệm vụ đặt ra thách thức mới cho công tác quản trị rủi ro, đòi hỏi các quy trình cô lập hạ tầng và quản lý khóa xác thực phải được thực hiện nghiêm ngặt hơn trong quá trình phát triển AI.

PHỐ HỘI