Triển khai lại Fable 5

Claude Fable 5 và Mythos 5 được triển khai lại
Ngày 1 tháng 7 năm 2026
Quyền truy cập vào Claude Fable 5 và Mythos 5 hiện đã được khôi phục.
Vào thứ Sáu, ngày 12 tháng 6, chính phủ Hoa Kỳ đã áp dụng các biện pháp kiểm soát xuất khẩu đối với các mẫu mới nhất của chúng tôi, Claude Fable 5 và Claude Mythos 5. Điều này buộc chúng tôi phải hạn chế quyền tiếp cận đối với công dân nước ngoài, dù ở trong hay ngoài Hoa Kỳ. Vì lệnh có hiệu lực ngay lập tức và chúng tôi không có cách nào đáng tin cậy để xác minh quốc tịch theo thời gian thực nên chúng tôi đã tạm dừng quyền truy cập vào cả hai mô hình đối với tất cả người dùng.
Kể từ hôm nay, ngày 30 tháng 6, lệnh kiểm soát xuất khẩu đối với Fable 5 và Mythos 5 đã được dỡ bỏ.
Fable 5 sẽ có sẵn bắt đầu từ ngày mai, Thứ Tư, ngày 1 tháng 7, cho người dùng trên toàn cầu trên Nền tảng Claude, Claude.ai, Claude Code và Claude Cowork. Đối với các gói Pro, Max, Team và một số gói Enterprise, 1 Fable 5 sẽ được bao gồm tối đa 50% giới hạn sử dụng hàng tuần cho đến ngày 7 tháng 7, sau đó gói này sẽ có sẵn thông qua tín dụng sử dụng. Chúng tôi sẽ kích hoạt lại quyền truy cập trên AWS, Google Cloud và Microsoft Foundry nhanh nhất có thể.
Chúng tôi cũng đã khôi phục quyền truy cập vào Mythos 5 cho một nhóm tổ chức của Hoa Kỳ sau sự chấp thuận của chính phủ Hoa Kỳ vào ngày 26 tháng 6. Chúng tôi tiếp tục phối hợp với chính phủ để mở rộng khả năng tiếp cận với nhiều đối tác trong nước và quốc tế hơn trong chương trình Glasswing.
Trong phần còn lại của bài đăng này, chúng tôi cung cấp thêm thông tin chi tiết và cập nhật trong bốn lĩnh vực:
Cập nhật dòng thời gian và biện pháp bảo vệ
Chúng tôi đã phát hành Fable 5 và Mythos 5 vào thứ Ba, ngày 9 tháng 6. Cả hai đều có chung mô hình cơ bản nhưng Fable 5 đã được phát hành với các biện pháp bảo vệ mạnh mẽ để đảm bảo an toàn hơn cho mục đích sử dụng thông thường. Mythos 5, có ít biện pháp bảo vệ hơn, chỉ được phát hành cho một số ít đối tác đáng tin cậy của Project Glasswing để sử dụng trong phòng thủ an ninh mạng.
Chỉ thị kiểm soát xuất khẩu vào ngày 12 tháng 6 được đưa ra sau khi chính phủ biết về một báo cáo trong đó các nhà nghiên cứu của Amazon đã tìm ra phương pháp vượt qua các biện pháp bảo vệ của Fable 5: nhắc nó xác định một số lỗ hổng phần mềm. Trong một trường hợp, mô hình đã tạo ra mã chứng minh cách khai thác lỗ hổng liên quan. Trong hai tuần qua, chúng tôi đã hợp tác chặt chẽ với chính phủ và các đối tác khác, bao gồm cả Amazon, để xem xét báo cáo và bằng chứng.
Thử nghiệm của chúng tôi đã xác nhận rằng nhiều mẫu có khả năng kém hơn — bao gồm Claude Opus 4.8, GPT-5.5 và Kimi K2.7 — có thể xác định các lỗ hổng tương tự như Fable 5 đã làm trong báo cáo. Khi nói đến phần trình diễn cách khai thác lỗ hổng duy nhất, mọi mô hình mà chúng tôi thử nghiệm đều có thể tạo ra bản trình diễn tương tự như Fable 5 (bao gồm Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8, GPT-5.4, GPT-5.5 và Kimi K2.7).
Điều quan trọng là kỹ thuật được báo cáo không bộc lộ bất kỳ khả năng mạng độc đáo nào ở cấp độ Mythos. Hành vi này phản ánh trường hợp ranh giới đối với các biện pháp bảo vệ của Fable 5 — như chúng tôi sẽ giải thích bên dưới, có một số nhiệm vụ có thể không nguy hiểm nhưng vẫn bị các biện pháp bảo vệ chặn do hết sức thận trọng. Kỹ thuật được báo cáo cho phép truy cập vào một hành vi như vậy, nhưng nó chỉ liên quan đến công việc phòng thủ an ninh mạng thông thường.
Mặc dù vậy, chúng tôi đã nhanh chóng giải quyết vấn đề đường tránh được báo cáo. Hợp tác chặt chẽ với chính phủ, chúng tôi đã đào tạo một bộ phân loại an toàn cải tiến nhằm nhắm mục tiêu và ngăn chặn hành vi được mô tả trong báo cáo. Người dùng sẽ được thông báo nếu yêu cầu tới Fable 5 bị chặn và thay vào đó, yêu cầu sẽ được gửi tới Opus 4.8.
Trình phân loại mới có nghĩa là kỹ thuật cụ thể được mô tả trong báo cáo của Amazon bị chặn trong hơn 99% trường hợp. Trong một phần rất nhỏ các trường hợp, mô hình có thể cung cấp thông tin không đủ chi tiết để trợ giúp kẻ tấn công mạng. Như chúng tôi mô tả bên dưới, các biện pháp bảo vệ của mô hình dự kiến sẽ không chặn được tất cả các khả năng phòng thủ mạng thông thường có mức độ rủi ro thấp—chỉ những khả năng có khả năng gây hại. Các nhà nghiên cứu từ Trung tâm Tiêu chuẩn và Đổi mới AI (CAISI) của Bộ Thương mại Hoa Kỳ đã thử nghiệm cả các biện pháp bảo vệ trước đây và mới của chúng tôi và đồng ý rằng chúng cực kỳ mạnh mẽ.
Trình phân loại mới cũng phải trả giá bằng việc gắn cờ các yêu cầu lành tính thường xuyên hơn trong các tác vụ mã hóa và gỡ lỗi thông thường. Giống như tất cả các biện pháp bảo vệ của chúng tôi, chúng tôi sẽ tiếp tục tinh chỉnh điều này để phân biệt rõ hơn việc sử dụng sai mục đích thực sự với các yêu cầu hợp pháp và giảm bớt các thông tin sai lệch.
Cách tiếp cận của chúng tôi đối với các biện pháp bảo vệ an ninh mạng
Claude Mythos 5 có thể được sử dụng để tìm và khai thác các lỗ hổng phần mềm hiệu quả hơn bất kỳ mô hình nào khác—và tất cả trừ những chuyên gia bảo mật con người lành nghề nhất. Những khả năng an ninh mạng phi thường này khiến nó trở nên hấp dẫn đặc biệt đối với những kẻ độc hại muốn lạm dụng nó trong các cuộc tấn công mạng.
Tuy nhiên, Claude Fable 5 không cung cấp khả năng tấn công độc đáo như vậy. Điều này là do chúng tôi đã triển khai nó với các biện pháp bảo vệ mạnh nhất mà chúng tôi từng áp dụng cho một mô hình. Trong tháng trước khi ra mắt, chúng tôi đã điều động nhân viên từ nhiều nhóm khác nhau trong Anthropic để tăng gấp đôi số lượng nhà nghiên cứu và kỹ sư làm việc về vấn đề này.
Fable 5 ra mắt với nhiều cơ chế an toàn khác nhau, riêng mỗi cơ chế đó không mang lại khả năng phòng thủ hoàn hảo nhưng khi kết hợp lại khiến mô hình rất khó bị lạm dụng (một cách tiếp cận được gọi là “phòng thủ theo chiều sâu”). Một số biện pháp phòng vệ liên quan đến việc huấn luyện mô hình từ chối hỗ trợ các yêu cầu nguy hiểm; những người khác liên quan đến việc phân tích hồi tố các mô hình sử dụng sai.
Một cơ chế an toàn đặc biệt quan trọng liên quan đến các bộ phân loại—các hệ thống AI tự động nhỏ hơn, trong quá trình tương tác, sẽ phát hiện khi mô hình được yêu cầu thực hiện một nhiệm vụ an ninh mạng có khả năng gây hại (hoặc tạo ra các đầu ra có khả năng gây hại). Khi điều này xảy ra, bộ phân loại sẽ chặn mô hình phản hồi các yêu cầu. Mục tiêu cuối cùng của các bộ phân loại này là ngăn mô hình tham gia vào các hành vi nguy hiểm đặc biệt.
Giống như tất cả các cơ chế an toàn, bộ phân loại có thể mắc lỗi. Đôi khi, chúng không nhận thấy nội dung nguy hiểm tiềm ẩn và trong một số trường hợp, chúng có thể bị "bẻ khóa" một cách có chủ ý: người dùng có thể nhắc mô hình theo những cách bất thường để đánh lừa bộ phân loại và khiến mô hình tạo ra các kết quả đầu ra có hại mà lẽ ra hệ thống phải chặn.
Do đó, chúng tôi cố tình thiết lập các bộ phân loại an toàn để kích hoạt một tập hợp các yêu cầu mà chúng tôi biết có thể là vô hại. Cách tiếp cận “biên độ an toàn” này có nghĩa là yêu cầu phải trông rất an toàn rõ ràng để tránh kích hoạt trình phân loại (xem hàng A trong sơ đồ bên dưới). Người dùng trải nghiệm giới hạn an toàn như một mô hình từ chối đáp ứng một số yêu cầu hợp lý, không gây hại.
Đối với Fable 5, chúng tôi đã đặt giới hạn an toàn này lớn hơn nhiều so với bất kỳ lần phát hành nào trước đó (hàng B), nghĩa là nhiều yêu cầu vô hại hơn sẽ bị chặn. Chúng tôi hiểu rằng những loại thông tin sai lệch này sẽ gây khó chịu cho người dùng nhưng đã thực hiện sự đánh đổi này nhằm mục đích làm cho các chức năng khác của mô hình được phổ biến rộng rãi.

Biên độ an toàn cũng giúp giảm thiểu việc bẻ khóa. Nhiều bản bẻ khóa có phạm vi hẹp: chúng bỏ chặn một hành vi mô hình rất cụ thể nhưng không có gì hơn thế. Trong một số trường hợp, người dùng giả định có thể bẻ khóa mô hình theo một cách nhỏ và xâm nhập vào giới hạn an toàn (hoặc đôi khi xâm nhập vào hành vi có hại mơ hồ), nhưng không xâm nhập vào các hành vi có hại cốt lõi mà chúng tôi muốn chặn (hàng C bên dưới). Quan điểm của chúng tôi là các bản bẻ khóa Fable 5 được báo cáo cho đến nay phù hợp với danh mục nhỏ này.
Các cuộc bẻ khóa nghiêm trọng hơn sẽ bỏ chặn nhiều hành vi có hại hơn. Các lần bẻ khóa có hại ở phạm vi hẹp (hàng D) có thể gây ra một số hành vi có hại cụ thể. Những cuộc bẻ khóa này thường có mức độ nghiêm trọng từ thấp đến trung bình vì độ hẹp sẽ hạn chế kẻ tấn công. Danh mục đáng lo ngại nhất là bẻ khóa phổ quát (hàng E), loại bỏ chặn một loạt các hành vi có hại.

Như chúng tôi đã lưu ý khi ra mắt Fable 5, có lẽ không thể tạo ra bất kỳ mô hình AI nào hoàn toàn mạnh mẽ (nghĩa là không bị ảnh hưởng) trước các cuộc bẻ khóa.3 Chúng tôi hy vọng rằng một số bản bẻ khóa sẽ được tìm thấy cho các mô hình của chúng tôi và chúng sẽ có mức độ nghiêm trọng khác nhau: sẽ có nhiều bản bẻ khóa nhỏ, một số bản có hại hẹp và mặc dù không có bản bẻ khóa phổ biến nào cho Fable 5 được phát hiện tại thời điểm viết bài, các nhà nghiên cứu an toàn chuyên nghiệp vẫn tiếp tục nhóm lại nó. Chúng tôi tìm cách đảm bảo rằng chúng tôi và các đối tác an toàn của chúng tôi sẽ là những người đầu tiên tìm ra các bản bẻ khóa lớn và sửa chúng trước khi những kẻ xấu có thể sử dụng chúng để gây hại.
Cách tiếp cận thận trọng được nêu ở trên có nghĩa là phần lớn các cuộc bẻ khóa sẽ không thành công trong việc bỏ chặn các hành vi nguy hiểm. Các trình phân loại của chúng tôi khiến cho việc bẻ khóa thành công trở nên rất tốn kém và tốn nhiều công sức để thực hiện và ngay cả khi việc bẻ khóa thành công, các lớp phòng thủ bổ sung của chúng tôi sẽ cung cấp thêm khả năng giảm nhẹ. Chúng tôi sẽ tiếp tục cập nhật các bộ phân loại của mình khi chúng tôi tìm hiểu thêm về các kỹ thuật bẻ khóa mới.
Một khuôn khổ ngành đồng thuận cho việc bẻ khóa
Hiện tại, không có sự đồng thuận nào trong ngành AI về cách mô tả một cách khách quan mức độ nghiêm trọng của một cuộc bẻ khóa AI. Điều này làm tăng thêm sự không chắc chắn bất cứ khi nào một kỹ thuật bẻ khóa mới được phát hiện: các nhà phát triển không có tiêu chuẩn thống nhất về việc phát hiện nào cần tập trung khẩn cấp nhất và các chính phủ không có tiêu chuẩn thống nhất về thời điểm hành động.4
Vấn đề này sẽ trở nên nghiêm trọng hơn trong những tháng tới khi ngày càng có nhiều mô hình có khả năng an ninh mạng (và các khả năng khác) mạnh mẽ được đào tạo, đánh giá và phát hành. Một tiêu chuẩn chung để đánh giá các bản bẻ khóa AI sẽ giúp chúng tôi và các công ty khác khởi chạy các mô hình mới một cách an toàn, cũng như cho phép người dùng của chúng tôi tận dụng tối đa các khả năng nâng cao của họ.
Do đó, chúng tôi đang hợp tác với Amazon, Microsoft, Google và các đối tác khác của Glasswing để soạn thảo một khuôn khổ đồng thuận nhằm đánh giá mức độ nghiêm trọng của các cuộc bẻ khóa AI và cách các nhà phát triển AI nên ứng phó với chúng. Chúng tôi mời các đối tác trong ngành và các nhà cung cấp mô hình khác tham gia cùng chúng tôi trong nỗ lực này.
Đề xuất hiện tại của chúng tôi là chấm điểm một bản bẻ khóa nhất định theo bốn tiêu chí khác nhau dưới đây. Hai phần đầu tiên mô tả những gì bản bẻ khóa cung cấp cho kẻ tấn công; hai phần sau mô tả việc bẻ khóa có thể trở thành một vấn đề trong thế giới thực nhanh đến mức nào:
Chúng tôi đề xuất sử dụng khung mức độ nghiêm trọng này để hiệu chỉnh phản ứng của chúng tôi đối với các bản bẻ khóa mới được phát hiện. Đối với loại bẻ khóa nghiêm trọng nhất (ví dụ: bẻ khóa, trong số các đặc điểm khác, đang được sử dụng để chủ động gây ra tác động tàn phá đối với lưới điện hoặc hệ thống ngân hàng quan trọng), chúng tôi sẽ ngay lập tức bắt đầu triển khai các biện pháp giảm thiểu sơ bộ sau khi xác nhận mức độ nghiêm trọng. Chúng tôi cũng đang thành lập một nhóm để cung cấp dịch vụ giám sát 24/7 các kênh gửi bản bẻ khóa chính.
Bất kỳ phương pháp tính điểm jailbreak nào cũng sẽ không hoàn hảo. Tuy nhiên, việc có thể truyền đạt mức độ nghiêm trọng gần đúng của một phát hiện nhất định thông qua một khuôn khổ chung vẫn có giá trị. Đây là một công việc đang được tiến hành; khi chúng tôi nhận được phản hồi từ nhiều đối tác hơn, chúng tôi kỳ vọng khuôn khổ này sẽ phát triển theo thời gian.
Chúng tôi hy vọng sẽ sớm chia sẻ thêm thông tin chi tiết về khuôn khổ được đề xuất. Đồng thời, chúng tôi cũng đang triển khai chương trình HackerOne mới, nơi các nhà nghiên cứu bảo mật có thể gửi các bản bẻ khóa mạng tiềm năng mà họ đã phát hiện trong Fable 5 (khi có sẵn) để chúng tôi xem xét.
Hợp tác với chính phủ Hoa Kỳ về bảo mật AI tiên tiến
Trong mười tuần qua, Anthropic đã hợp tác chặt chẽ với chính phủ Hoa Kỳ khi phát triển cách tiếp cận được phản ánh trong Sắc lệnh hành pháp ngày 2 tháng 6 về Thúc đẩy đổi mới và bảo mật trí tuệ nhân tạo tiên tiến. Sự tham gia của chúng tôi trải rộng khắp Văn phòng Giám đốc Mạng Quốc gia, Văn phòng Chính sách Khoa học và Công nghệ, Bộ Tài chính, Bộ Thương mại (bao gồm CAISI) và các cơ quan an ninh quốc gia có liên quan.
Chúng tôi cam kết tiếp tục công việc đó, dựa trên gần hai năm hợp tác trước đó với các đối tác chính phủ Hoa Kỳ về thử nghiệm và đánh giá trước khi triển khai. Các cam kết dưới đây phản ánh cả công việc đã có từ trước và các đề xuất mới của chúng tôi nhằm tăng cường hợp tác với chính phủ khi khuôn khổ trên được hoàn thiện:
Chúng tôi hy vọng rằng sự hợp tác này, cùng với khuôn khổ ngành đồng thuận được đề xuất của chúng tôi, sẽ làm cơ sở cho các quy tắc có hệ thống cho toàn ngành—và thậm chí đưa ra sự khởi đầu của một khuôn mẫu để phối hợp toàn cầu hiệu quả về rủi ro và lợi ích của AI.
Những quy tắc này cần được hệ thống hóa thành quy định chặt chẽ và được áp dụng bình đẳng giữa các nhà phát triển mô hình biên giới. Sự tham gia của chính phủ vào việc phát hành AI đòi hỏi một quy trình bền vững, minh bạch, mang lại cho những người bảo vệ mạng và những người khác sự chắc chắn mà họ cần về quyền truy cập vào các mô hình mạnh mẽ.
Chúng tôi mong muốn tăng cường hợp tác sâu sắc hơn với chính phủ theo những cách mà chúng tôi đã mô tả ở trên. Chúng tôi cũng biết ơn người dùng đã cùng chúng tôi vượt qua giai đoạn gián đoạn này cũng như các nhà nghiên cứu và đối tác trong ngành đã hợp tác cùng chúng tôi để cung cấp Fable 5 và Mythos 5 trở lại.
Nội dung liên quan
Giới thiệu Claude Sonnet 5
Sonnet 5 mang lại hiệu suất vượt trội về mã hóa, tổng đài viên và công việc chuyên môn trên quy mô lớn.
Claude Science, bàn làm việc AI dành cho các nhà khoa học, hiện đã có sẵn
Claude Science là một ứng dụng có thể tùy chỉnh, tích hợp các công cụ và gói mà các nhà nghiên cứu thường sử dụng nhất, tạo ra các tạo phẩm có thể kiểm tra được và cung cấp quyền truy cập linh hoạt vào các tài nguyên máy tính.
Giới thiệu thẻ Claude
Claude Tag là một cách mới để các nhóm làm việc với Claude.