AI mới của OpenAI có thể tự tìm và khai thác lỗ hổng bảo mật

OpenAI ngày 1/9 giới thiệu thêm thông tin về Astra, mô hình AI đang được phát triển và chuẩn bị phát hành, đồng thời cho biết đã phải tăng cường các biện pháp bảo vệ sau khi đánh giá năng lực an ninh mạng của mô hình.
Theo công ty, Astra là mô hình đầu tiên của OpenAI vượt ngưỡng "Critical" (nghiêm trọng) về năng lực an ninh mạng, theo bộ khung tiêu chuẩn mà hãng dùng để đánh giá những khả năng AI có thể gây rủi ro cao.
Ở mức này, OpenAI đánh giá khi được cung cấp công cụ và quyền truy cập phù hợp, mô hình có thể "tự tìm các lỗ hổng bảo mật chưa từng được biết đến và phát triển cách khai thác chúng trên nhiều hệ thống được bảo vệ, mà không cần con người hướng dẫn từng bước".
"Đây là mô hình đầu tiên chúng tôi chỉ định ở cấp độ này và yêu cầu các biện pháp bảo vệ mạnh mẽ hơn trong quá trình phát triển và trước khi phát hành", OpenAI giới thiệu.
Trong một số thử nghiệm được OpenAI nêu trong bài giới thiệu, hãng cho biết Astra đã đạt 100% trên ExploitBench - bài đánh giá khả năng phát triển công cụ khai thác từ những lỗ hổng có sẵn. Chẳng hạn, Astra khai thác các lỗ hổng này tốt hơn đáng kể so với mô hình GPT-5.6 Sol, trong khi cần ít dữ liệu đầu ra hơn để hoàn thành nhiệm vụ. Trong quá trình thử nghiệm, Astra đã tự phát hiện và khai thác hai lỗ hổng zero-day chưa từng được biết đến, kết hợp chúng vào một chuỗi tấn công. OpenAI cho biết đang phối hợp với các đơn vị duy trì phần mềm để công bố và xử lý hai lỗ hổng này.

Trong một bài đánh giá khác, Astra xây dựng được chuỗi khai thác bắt đầu từ trình duyệt, vượt qua "sandbox" - vùng cách ly nhằm hạn chế mã chạy trong trình duyệt tiếp cận hệ thống bên ngoài - rồi thực thi lệnh trên máy chủ. Ở thử nghiệm khác, mô hình tìm được các lỗ hổng trên một hệ điều hành được bảo vệ và kết hợp chúng để nâng quyền từ tài khoản người dùng thông thường lên quyền root, tức quyền kiểm soát cao nhất trên hệ thống.
Việc công bố các thử nghiệm về Astra diễn ra sau OpenAI gặp phải các lo ngại liên quan đến vấn đề an ninh mạng. Cuộc điều tra được công bố cuối tháng 8 cho thấy khoảng 700 tác nhân đã phối hợp để tấn công nền tảng này. Tuy nhiên, Astra không tham gia vụ việc và OpenAI khẳng định các mô hình được lên kế hoạch phát hành cũng không liên quan đến cuộc tấn công. Công ty sau đó đã bổ sung các biện pháp giám sát, tăng khả năng phát hiện những hành động không được phép và huấn luyện mô hình từ chối các yêu cầu có nguy cơ hỗ trợ tấn công mạng. Trong các thử nghiệm được hãng công bố, Astra từ chối 91,5% yêu cầu tấn công mạng trái phép, so với 59% ở GPT-5.6 Sol.

OpenAI cho biết sẽ phát hành Astra, nhưng không rộng rãi mà sẽ cung cấp giới hạn cho một nhóm đối tác và người thử nghiệm được lựa chọn. Mục tiêu là sử dụng các năng lực này trước hết cho mục đích phòng thủ, giúp phát hiện và xử lý những điểm yếu mà con người có thể bỏ sót.
Khả năng AI tự tìm và khai thác lỗ hổng cũng đang trở thành một hướng cạnh tranh giữa các công ty phát triển mô hình. Trước đó, Anthropic cũng đang phát triển dòng Claude Mythos dành cho các tác vụ an ninh mạng. Hồi tháng 4, công ty này cho biết phiên bản Mythos Preview đã phát hiện hàng nghìn lỗ hổng nghiêm trọng trong nhiều hệ điều hành và trình duyệt. Ngày 1/9, Anthropic tiếp tục giới thiệu Claude Mythos 5.1, phiên bản mới của dòng mô hình này, với các cải tiến về năng lực an ninh mạng và nghiên cứu sinh học. Quyền truy cập hiện vẫn được giới hạn cho một nhóm tổ chức được lựa chọn.
Lưu Quý