AI mạnh nhất của OpenAI gây phản ứng trái chiều

"Từ ChatGPT đến Astra diễn ra trong bốn năm. AGI đã xuất hiện. Chúc mừng đội ngũ OpenAI", CEO Nvidia Jensen Huang, viết trên X ngày 6/9.
OpenAI ra mắt GPT-6 Astra ngày 3/9, gọi đây là "mô hình thông minh và phù hợp nhất thế giới", có khả năng thực hiện "công việc đòi hỏi sự khắt khe với tốc độ, độ chính xác và khả năng phán đoán vượt trội", là "tiêu chuẩn mới cho việc sử dụng máy tính, duyệt web, kỹ thuật phần mềm, an ninh mạng, khoa học và công việc chuyên nghiệp". Trên blog, Chủ tịch OpenAI Greg Brockman cũng tự nhận sản phẩm là một AGI - được định nghĩa là hệ thống AI có khả năng tư duy ngang hoặc vượt con người.

OpenAI định nghĩa GPT-6 Astra là "các hệ thống tự động cao, vượt trội con người trong hầu hết công việc có giá trị kinh tế cao", là bước đột phá lớn trong nghiên cứu, sự thay đổi trong "những gì có thể" mà con người giao cho AI. Mô hình tập trung tác vụ đòi hỏi suy luận, lập trình và làm việc tự động trên máy tính khi có thể xử lý quy trình nhiều bước, sử dụng trình duyệt và phần mềm để thực hiện các công việc từ nghiên cứu, phân tích dữ liệu đến tạo tài liệu, bảng tính và bài thuyết trình.
Theo OpenAI, Astra đạt 72,6% trên bài kiểm tra OSWorld 2.0 - công cụ đánh giá khả năng điều khiển máy tính của tác nhân AI trong việc thực hiện các quy trình công việc phức tạp và kéo dài; và hoàn thành tác vụ nhanh hơn khoảng 47% so với GPT-5.6 Sol trong mô phỏng độ trễ. Đây cũng là mô hình đầu tiên đạt ngưỡng quan trọng về an ninh mạng, nghĩa là nó có thể tìm ra lỗ hổng phần mềm chưa được biết đến và xây dựng các cuộc tấn công hoạt động không cần con người. Công ty của Sam Altman cho biết, GPT-6 Astra đạt 100% trên ExploitBench - công cụ đánh giá năng lực an ninh mạng tấn công của tác nhân và LLM. Trong một thử nghiệm của công ty, AI mới cũng đã phát hiện hai lỗ hổng zero-day chưa được biết đến.
"Chào mừng đến với kỷ nguyên siêu trí tuệ AGI", Brockman viết. "Với cá nhân tôi, tôi nghĩ OpenAI đã đạt được mục tiêu".
Theo Decrypt, chỉ sau 48 tiếng ra mắt, GPT-6 Astra nhận sự phản hồi tích cực, đặc biệt là khả năng làm việc trên "bất cứ thứ gì liên quan đến không gian, cơ học hoặc tác nhân". Nhà đầu tư Matt Shumer, cựu CEO của HyperWrite, đã thử dùng Astra kết hợp công cụ phát triển game Unreal Engine để tạo thanh công bản đồ 3D chi tiết khu vực Manhattan với "mỗi con phố đều hoàn hảo". Ông cũng yêu cầu Astra xây dựng một thế giới sinh tồn với các nhân vật có tính cách riêng, rồi để chạy qua đêm. Một ngày sau, ông nghe thấy tiếng nói từ phòng làm việc, phát hiện các nhân vật "bắt đầu nói chuyện với nhau".
Nhà phát triển độc lập Tom Krcha cũng đưa cho Astra hình ảnh duy nhất về ngôi nhà, sau đó ra lệnh tái tạo toàn bộ, gồm nội thất bên trong. Video được tạo thời gian ngắn sau đó khiến Krcha kinh ngạc. "Giờ đây, mọi người trên thế giới đều đã có một nhà thiết kế 3D trong tầm tay", ông viết trên X.
Một nhà phát triển Trung Quốc có biệt danh SuSu đã thực hiện ý tưởng tương tự ở quy mô thành phố. Người này ra lệnh Astra tái tạo lại thành phố Hàng Châu và các thị trấn xung quanh bằng Three.js - một thư viện java script cho phép hiển thị đồ họa 3D ngay trong trình duyệt web không cần tải xuống. Trong vòng 24 phút, công cụ tạo ra bản đồ tương tác với Hồ Tây, chùa Liễu Phong, ruộng bậc thang hay vùng đất ngập nước... kèm tùy chọn hiển thị ngày và đêm.
Trò chơi là lĩnh vực GPT-6 Astra thể hiện ưu thế vượt trội, theo Creative Bloq. Chẳng hạn, hãng game Playco cho biết đã thử tạo một trò chơi bằng AI này và nhận thấy con người "chỉ can thiệp tối thiểu", trong đó giảm 50% số lần sửa lỗi thủ công trong quá trình tạo nguyên mẫu.
Anshu Chimala, nhà thiết kế UX/UI và nhà phát triển AI tại Apple, đã thử tạo một game 3D trong 45 phút và "hoàn thành chỉ trong một lần thử". Ông mô tả quá trình chỉ chiếm vài phần trăm dung lượng bộ nhớ cho phép nhưng vẫn cho ra sản phẩm phong cách đồ họa isometric (phương pháp mô tả hình ảnh của các đối tượng 3D trong không gian hai chiều) với nhân vật, môi trường và tổng thể thẩm mỹ tốt. "Astra là một loại AGI siêu tốc dành cho các trò chơi 3D", Chimala viết trên Reddit.
Tác nhân chạy GPT-6 Astra cũng có thể tự động hóa gần như toàn bộ quy trình chơi game. Tài khoản X cozyblaze sử dụng AI này để tự chơi Portal - game giải đố góc nhìn thứ nhất kinh điển của Valve. AI hoàn thành toàn bộ trò chơi trong vòng chưa đầy 24 tiếng với chi phí dùng token hết 571,18 USD. Theo The Verge, mức này "đã tương đương trình độ con người".
Tuy nhiên, theo Creative Bloq, dù là bước đột phá giúp quy trình tạo mô hình 3D và phát triển game trở nên nhanh và dễ tiếp cận hơn, nhiều người lo ngại GPT-6 Astra có thể bị lợi dụng như một công cụ vi phạm bản quyền, cho phép người ta sao chép toàn bộ ý tưởng game và bán chúng như sản phẩm của riêng mình. Số khác cho rằng dù các bản demo trông rất ấn tượng, Astra không vượt trội Claude Fable của Anthropic trong các bài kiểm tra hiệu năng.
Bên cạnh đó, GPT-6 Astra không được đánh giá cao về khả năng sáng tạo, nhất là khi không có sự hướng dẫn, ngữ cảnh và chỉ đạo mạnh mẽ. Nhà phát triển Louis-François Bouchard sử dụng hệ thống đánh giá nội bộ để chấm điểm khả năng viết của AI này và nhận thấy mô hình đứng thứ 11 với 1995 điểm, thấp hơn GPT-5.6 Sol trước đó với 2.156 điểm, kém vị trí dẫn đầu Claude Fable 5 với 2.312 điểm. Astra có giá khoảng 0,26 USD mỗi kịch bản, gấp khoảng 1,8 lần so với Sol.
Theo Chỉ số Trí tuệ Phân tích Nhân tạo (AII) tổng hợp và đánh giá khả năng suy luận, kiến thức và lập trình của AI, Astra đạt 61,2 điểm. Con số này thấp hơn so với 60,9 điểm của GPT-5.6 Sol và 65,7 điểm của Claude Fable 5.1 nhưng giá gấp 2,5 lần Sol.
Nhà nghiên cứu độc lập Giuseppe Paleologo tại New York đã thử nghiệm và đánh giá các kết quả "liên quan đến khả năng sáng tạo" của GPT-6 Astra ở mức "pha trộn giữa những điều hiển nhiên và những điều phóng đại". Theo ông, sự sáng tạo thực sự vẫn còn rất xa ở mô hình này.
Mia AI Lab, một nhóm trên Hugging Face chuyên cung cấp các bản cấu hình, định dạng tối ưu hoặc bản sao AI/LLM mã nguồn mở mới nhất, cũng có quan điểm tương tự. Theo nhóm này, GPT-6 Astra có thể là mô hình tốt nhất trong một số nhiệm vụ, nhưng "nhàm chán và thiếu cá tính", đồng thời khuyên "nên tránh sử dụng cho bất kỳ công việc sáng tạo nào".
Ông Gary Marcus, nhà nghiên cứu và phê bình AI nổi tiếng tại Thung lũng Silicon, cho rằng mô hình mới nhất của OpenAI chưa đủ để đạt cảnh giới AGI. Dựa trên định nghĩa tự soạn thảo 10 điểm khác biệt của AGI so với AI thông thường, ông cho biết GPT-6 Astra chỉ đáp ứng được một hoặc hai tiêu chí. "Astra vẫn còn nhiều thiếu sót", Marcus nói với Business Insider.
Tuy nhiên, khả năng tư duy mới là điểm lo ngại nhất. Theo The Information, GPT-6 Astra sử dụng kỹ thuật suy luận gọi là "độ sâu lặp lại" (recurrent depth) cho phép nó hoạt động ngoài lối tư duy tuần tự đặc trưng của hầu hết AI suy luận. Kỹ thuật này, còn được gọi là "lặp mờ" (opaque recurrence), có khả năng khiến chuỗi suy nghĩ của mô hình khó giám sát hơn.
Theo TechCrunch, các hệ thống AI suy luận hiện sử dụng chuỗi tư duy (Chain of Thought - CoT), hiển thị ngay trên các công cụ giúp con người nhìn thấu phần nào "đường đi nước bước" của mô hình, qua đó giúp phát hiện hành vi sai lệch hoặc mất kiểm soát. Tuy nhiên, kỹ thuật "độ sâu lặp lại" trên GPT-6 Astra sẽ xử lý một truy vấn nhiều lần trong một vòng lặp kín, khiến việc giám sát ngày càng khó do để lại rất ít dấu vết đọc được. Theo đó, nó gần như bỏ qua cơ chế chuỗi ghi chép tư duy truyền thống.
"Astra sử dụng phương pháp lặp lại không rõ ràng, điều đó quả thực gây lo ngại", Buck Shlegeris, CEO tổ chức nghiên cứu phi lợi nhuận chuyên về an toàn và bảo mật AI Redwood Research (Mỹ), viết trên X. "Nếu OpenAI tiếp tục phát triển kỹ thuật này, họ sẽ phá hủy hoàn toàn khả năng giám sát CoT".
Zvi Mowshowitz, một nhà vận động an toàn AI tại Mỹ, ví von OpenAI đang "chơi với lửa" khi sử dụng kỹ thuật này cho mô hình mới. Theo ông, việc dùng "độ sâu lặp lại" còn vi phạm điều cấm kỵ mà chính công ty và Anthropic đã đấu tranh để thiết lập: nỗ lực duy trì tính trung thực và khả năng giám sát càng lâu càng tốt.
Ryan Greenblatt, nhà khoa học trưởng của Redwood Research, cũng cho rằng cách làm của OpenAI khiến các mô hình trong tương lai càng khó đoán do "suy luận trong không gian tiềm ẩn". "Tôi hy vọng vẫn chưa quá muộn và OpenAI sẽ dừng lại ở đây", Greenblatt viết trên blog.
OpenAI chưa đưa ra bình luận. Trên X, nhà khoa học trưởng OpenAI, Jakub Pachocki, cho biết công ty "nỗ lực bảo tồn và sử dụng việc giám sát chuỗi suy luận kể từ những mô hình đầu tiên", nhưng không nhắc đến cơ chế suy luận mới trên GPT-6 Astra.