ANTHROPIC

Giới thiệu Claude Sonnet 5

Bùi Đăng MinhThứ ba, 30/6/2026, 10:00 (GMT+7)21 phút đọc
Giới thiệu Claude Sonnet 5

Claude Sonnet 5 được xây dựng để trở thành mẫu Sonnet có tính tác động cao nhất từ ​​trước đến nay. Nó có thể lập kế hoạch, sử dụng các công cụ như trình duyệt và thiết bị đầu cuối, đồng thời chạy tự động ở mức độ mà chỉ vài tháng trước còn yêu cầu các mẫu lớn hơn và đắt tiền hơn.

Đối với nhiều nhà phát triển, kỷ nguyên AI bắt đầu với các mô hình lớp Sonnet: Claude Sonnet 3.5, 3.6 và 3.7 là những mô hình đầu tiên thể hiện kỹ năng ấn tượng về mã hóa và sử dụng công cụ. Tuy nhiên, gần đây hơn, lợi ích rõ ràng nhất về khả năng tác nhân là ở các mô hình lớp Opus của chúng tôi.

Sonnet 5 thu hẹp khoảng cách: hiệu suất của nó gần bằng Opus 4.8 nhưng ở mức giá thấp hơn. Đây là một cải tiến đáng kể so với phiên bản tiền nhiệm của nó, Sonnet 4.6, về các khía cạnh quan trọng của hiệu suất tác nhân như lý luận, sử dụng công cụ, mã hóa và công việc tri thức:

Điểm cho Sonnet 5 theo nhiều đánh giá khác nhau so với Sonnet 4.6 và Opus 4.8 (một mô hình có khả năng tổng quát hơn, để tham khảo). Thẻ hệ thống Claude Sonnet 5 báo cáo một loạt các đánh giá chi tiết hơn.
Điểm cho Sonnet 5 theo nhiều đánh giá khác nhau so với Sonnet 4.6 và Opus 4.8 (một mô hình có khả năng tổng quát hơn, để tham khảo). Thẻ hệ thống Claude Sonnet 5 báo cáo một loạt các đánh giá chi tiết hơn.

Đánh giá an toàn của chúng tôi cho thấy Sonnet 5 cho thấy tỷ lệ hành vi không mong muốn tổng thể thấp hơn Sonnet 4.6 và nhìn chung an toàn hơn khi sử dụng trong bối cảnh tác nhân. Các đánh giá cũng cho thấy nó có khả năng thực hiện các nhiệm vụ an ninh mạng thấp hơn nhiều so với các mô hình Opus hiện tại của chúng tôi.

Kể từ hôm nay, Claude Sonnet 5 có sẵn trên tất cả các gói: đây là mẫu mặc định cho các gói Free và Pro, đồng thời có sẵn cho người dùng Max, Team và Enterprise. Nó cũng có sẵn trong Claude Code và trên Nền tảng Claude, nơi nó ra mắt với mức giá giới thiệu là 2 USD trên một triệu token đầu vào và 10 USD trên một triệu token đầu ra cho đến ngày 31 tháng 8 năm 2026, sau đó nó sẽ có giá 3 USD trên một triệu token đầu vào và 15 USD trên một triệu token đầu ra. Nhà phát triển có thể sử dụng claude-sonnet-5 thông qua API Claude.

Làm việc với Claude Sonnet 5

Các biểu đồ bên dưới so sánh hiệu suất của Sonnet 5 với Sonnet 4.6 và Opus 4.8 ở các mức độ nỗ lực khác nhau trong đánh giá tìm kiếm tác nhân DuyệtComp và đánh giá sử dụng máy tính OSWorld-Được xác minh. Sonnet 5 (đường màu cam) là một cải tiến nghiêm ngặt so với Sonnet 4.6 (đường màu xám) và bao gồm phạm vi tùy chọn hiệu suất chi phí rộng hơn nhiều so với Opus 4.8 (đường màu vàng). Nó mang lại hiệu quả chi phí được cải thiện đáng kể với nỗ lực trung bình; hiệu suất nỗ lực cao hơn của nó có thể sánh ngang với Opus 4.8 trong một số tác vụ. Giữa Sonnet 5 và Opus 4.8, người dùng có thể điều chỉnh mức độ nỗ lực để tìm ra sự cân bằng phù hợp giữa chi phí và hiệu suất.

Đường cong chi phí-hiệu suất ở các mức nỗ lực khác nhau. Mẫu Sonnet tốt nhất trước đây (Sonnet 4.6) không thua kém Opus 4.8. Sonnet 5 cung cấp nhiều tùy chọn hiệu suất chi phí hơn Sonnet 4.6 và trong một số trường hợp phù hợp với mức khả năng của Opus 4.8. Các biểu đồ cho thấy Sonnet 5 có giá 3 USD trên một triệu token đầu vào và 15 USD trên một triệu token đầu ra. Với mức giá giới thiệu ra mắt đến hết ngày 31 tháng 8 (2 USD/MTok đầu vào và 10 USD/MTok đầu ra), chi phí thực tế của Sonnet 5 thậm chí còn thấp hơn so với hiển thị ở đây. Opus 4.8 có giá $5/MTok đầu vào và $25/MTok đầu ra. xhigh = mức độ nỗ lực cực cao.
Đường cong chi phí-hiệu suất ở các mức nỗ lực khác nhau. Mẫu Sonnet tốt nhất trước đây (Sonnet 4.6) không thua kém Opus 4.8. Sonnet 5 cung cấp nhiều tùy chọn hiệu suất chi phí hơn Sonnet 4.6 và trong một số trường hợp phù hợp với mức khả năng của Opus 4.8. Các biểu đồ cho thấy Sonnet 5 có giá 3 USD trên một triệu token đầu vào và 15 USD trên một triệu token đầu ra. Với mức giá giới thiệu ra mắt đến hết ngày 31 tháng 8 (2 USD/MTok đầu vào và 10 USD/MTok đầu ra), chi phí thực tế của Sonnet 5 thậm chí còn thấp hơn so với hiển thị ở đây. Opus 4.8 có giá $5/MTok đầu vào và $25/MTok đầu ra. xhigh = mức độ nỗ lực cực cao.
Đường cong chi phí-hiệu suất ở các mức nỗ lực khác nhau. Mẫu Sonnet tốt nhất trước đây (Sonnet 4.6) không thua kém Opus 4.8. Sonnet 5 cung cấp nhiều tùy chọn hiệu suất chi phí hơn Sonnet 4.6 và trong một số trường hợp phù hợp với mức khả năng của Opus 4.8. Các biểu đồ cho thấy Sonnet 5 có giá 3 USD trên một triệu token đầu vào và 15 USD trên một triệu token đầu ra. Với mức giá giới thiệu ra mắt đến hết ngày 31 tháng 8 (2 USD/MTok đầu vào và 10 USD/MTok đầu ra), chi phí thực tế của Sonnet 5 thậm chí còn thấp hơn so với hiển thị ở đây. Opus 4.8 có giá $5/MTok đầu vào và $25/MTok đầu ra. xhigh = mức độ nỗ lực cực cao.
Đường cong chi phí-hiệu suất ở các mức nỗ lực khác nhau. Mẫu Sonnet tốt nhất trước đây (Sonnet 4.6) không thua kém Opus 4.8. Sonnet 5 cung cấp nhiều tùy chọn hiệu suất chi phí hơn Sonnet 4.6 và trong một số trường hợp phù hợp với mức khả năng của Opus 4.8. Các biểu đồ cho thấy Sonnet 5 có giá 3 USD trên một triệu token đầu vào và 15 USD trên một triệu token đầu ra. Với mức giá giới thiệu ra mắt đến hết ngày 31 tháng 8 (2 USD/MTok đầu vào và 10 USD/MTok đầu ra), chi phí thực tế của Sonnet 5 thậm chí còn thấp hơn so với hiển thị ở đây. Opus 4.8 có giá $5/MTok đầu vào và $25/MTok đầu ra. xhigh = mức độ nỗ lực cực cao.

Phản hồi từ các đối tác truy cập sớm của chúng tôi rất nhất quán: Sonnet 5 có tính tác động cao hơn nhiều so với các phiên bản trước. Những người thử nghiệm đã mô tả cách nó hoàn thành các nhiệm vụ phức tạp mà các mẫu Sonnet trước đó thường dừng lại, cách nó tự kiểm tra đầu ra mà không được yêu cầu rõ ràng và cách nó thực hiện tất cả tác nhân này ở mức giá hấp dẫn:

"Claude Sonnet 5 cung cấp cho các nhân viên của chúng tôi một lớp thực thi mạnh mẽ cho công việc kỹ thuật phần mềm gồm nhiều bước. Nó xử lý mã hóa bền vững, sử dụng công cụ và gỡ lỗi tốt trong các bối cảnh kỹ thuật lộn xộn và đặc biệt hữu ích cho các quy trình làm việc đòi hỏi phải tuân theo và nền tảng kỹ thuật. Zimu LiThành viên Nhân viên Kỹ thuật"

"Chúng tôi đã giao cho Claude Sonnet 5 một công việc gồm hai phần—cập nhật cấp độ tài khoản Salesforce, gửi thông báo ra mắt tới những người liên hệ trong doanh nghiệp—và công việc này hoàn thành từ đầu đến cuối. Công việc đó thường bị đình trệ giữa chừng. Đối với hoạt động tự động hóa hàng ngày, đó là điều không cần phải đắn đo.Daniel ShepardKỹ sư cấp cao"

"Claude Sonnet 5 làm được nhiều việc hơn với ít thời gian hơn. Chất lượng đầu ra như nhau, ít bước hơn để đạt được điều đó. Nó cũng từ chối các yêu cầu không an toàn một cách rõ ràng và nhất quán. Tại Lovable, chúng tôi đang trao những công cụ mạnh mẽ vào tay hàng triệu nhà xây dựng. Một mô hình biết khi nào nên nói không cũng quan trọng như một mô hình biết cách xây dựng. Fabian HedinĐồng sáng lập"

"Chúng tôi đã chạy Claude Sonnet 5 trước hàng chục yêu cầu kéo thực tế đầy thách thức nhất của chúng tôi và nó đưa từng yêu cầu đó đi đến một kết quả đã được kiểm tra, xác minh — giúp các kỹ sư của chúng tôi tập trung vào phán đoán, quyết định và phê duyệt cuối cùng. Yusuke KajiGM, AI for Business"

"Tôi đã yêu cầu Claude Sonnet 5 điều tra một lỗi. Không cần phải nhắc nhở, nó đã viết một bản kiểm tra tái tạo, thực hiện sửa lỗi, sau đó cất giữ nó để xác nhận rằng lỗi đã xuất hiện trở lại mà không có thay đổi nào. Tất cả chỉ trong một lần thực hiện. Kỹ sư phần mềm và Kỹ sư phần mềm Neel ChotaiRust"

"Với Claude Sonnet 5, các đại lý luôn đi đúng kế hoạch, tuân theo các quy ước của chúng tôi và thực hiện các thay đổi rõ ràng gồm nhiều bước, tất cả đều ở mức chi phí hiệu quả.Sualeh AsifNgười đồng sáng lập"

"Claude Sonnet 5 hoạt động tốt nhất với mã brownfield—điều kiện chạy đua, thử nghiệm ẩn, những phần không ai muốn chạm vào. Nó truy tìm nguyên nhân gốc rễ thực sự của lỗi và đưa ra giải pháp khắc phục lâu dài thay vì vá triệu chứng. Kỹ sư sáng lập Dominic Elm"

"Claude Sonnet 5 nằm ở ranh giới Pareto cho các nhiệm vụ theo luật của nguyên đơn của Eve. Chúng tôi thấy được những lợi ích rõ ràng nhất trong nghiên cứu và phân tích pháp lý, ở tỷ lệ giá trên hiệu suất khiến cho việc lựa chọn di chuyển trở nên dễ dàng. Kỹ sư ML của Mauricio Wulfovich"

"Nhân viên ClickHouse khám phá dữ liệu trực tiếp và tạo ra thông tin chuyên sâu một cách nhanh chóng, do đó, thời gian để có thông tin chi tiết rất quan trọng khi thử nghiệm các mô hình mới. Claude Sonnet 5 lập luận trong các bước chặt chẽ hơn và giúp người dùng của chúng tôi trả lời nhanh hơn đáng kể. Tốc độ đó là điểm khác biệt mà khách hàng của chúng tôi cảm nhận được.Ryadh DahimeneDirector PM AI/ML"

"Tại Pace, các đại lý sử dụng máy tính của chúng tôi chạy các quy trình công việc bảo hiểm—lượng hồ sơ gửi, FNOL, số lần thua lỗ—trên các hệ thống mà nhóm vận hành của chúng tôi đã sử dụng. Claude Sonnet 5 luôn thực hiện hành động đúng đắn và thực hiện nhanh chóng, đó là những gì công việc bảo hiểm thực sự yêu cầu. Eric HeThành viên Nhân viên Kỹ thuật"

Đánh giá an toàn

Đánh giá an toàn trước khi triển khai của chúng tôi cho thấy Sonnet 5 nhìn chung là một cải tiến trên Sonnet 4.6. Về an toàn tác nhân, mô hình này có khả năng từ chối các yêu cầu độc hại tốt hơn và chống lại các nỗ lực chiếm quyền điều khiển trong các cuộc tấn công tiêm nhiễm kịp thời. Mô hình cho thấy tỷ lệ ảo giác và ảo giác thấp hơn so với Sonnet 4.6. Trong quá trình kiểm tra hành vi tự động của chúng tôi, kiểm tra một loạt các hành vi sai lệch như hợp tác với hành vi lạm dụng và lừa dối, Sonnet 5 đạt điểm thấp hơn (nghĩa là an toàn hơn) về tổng thể. Tuy nhiên, nó đã cho thấy tỷ lệ hành vi sai lệch cao hơn một chút trong đánh giá này so với Opus 4.8 và Claude Mythos Preview có khả năng cao hơn.

Tỷ lệ hành vi sai lệch trong quá trình kiểm tra hành vi tự động của chúng tôi, kiểm tra rất nhiều hành vi không mong muốn trong nhiều tình huống và bối cảnh (xem Phần 6.4 của Thẻ hệ thống Sonnet 5 để biết danh sách đầy đủ và kết quả cho từng hành vi cụ thể). Sonnet 5 cho thấy tỷ lệ hành vi sai lệch tổng thể thấp hơn so với Sonnet 4.6, mặc dù tỷ lệ này cao hơn Mythos Preview và Opus 4.8.
Tỷ lệ hành vi sai lệch trong quá trình kiểm tra hành vi tự động của chúng tôi, kiểm tra rất nhiều hành vi không mong muốn trong nhiều tình huống và bối cảnh (xem Phần 6.4 của Thẻ hệ thống Sonnet 5 để biết danh sách đầy đủ và kết quả cho từng hành vi cụ thể). Sonnet 5 cho thấy tỷ lệ hành vi sai lệch tổng thể thấp hơn so với Sonnet 4.6, mặc dù tỷ lệ này cao hơn Mythos Preview và Opus 4.8.

Chúng tôi không cố ý đào tạo Sonnet 5 về các nhiệm vụ an ninh mạng. Nó có thể thực hiện một số tác vụ mạng thông thường, không gây hại, nhưng trong các đánh giá kiểm tra các kỹ năng mạng nguy hiểm tiềm tàng, chẳng hạn như phát triển các hoạt động khai thác phần mềm, nó cho thấy hiệu suất kém hơn đáng kể so với các mô hình như Opus 4.8 và Mythos 5. Điểm từ một đánh giá đã kiểm tra khả năng phát triển khai thác lỗ hổng trong trình duyệt Firefox của các mô hình, được hiển thị trong biểu đồ bên dưới. Sonnet 5 chưa bao giờ có thể phát triển toàn bộ hoạt động khai thác nhưng nó cho thấy tỷ lệ thành công một phần cao hơn một chút so với Sonnet 4.6. Sự thay đổi sau này có thể là do sự cải thiện về trí thông minh nói chung hơn là do đào tạo cụ thể.

Điểm đo lường mức độ thành công của các mô hình trong việc khai thác các lỗ hổng phần mềm trong Firefox 147 (đánh giá này được phát triển với sự hợp tác của Mozilla; tất cả các lỗ hổng đã được vá trong Firefox 148). Đối với mỗi mô hình, thanh bên trái hiển thị tần suất mô hình (không có biện pháp bảo vệ) phát triển một hoạt động khai thác; thanh bên phải cho biết tần suất mô hình thành công một phần. Cả hai mô hình Sonnet đều không thể phát triển thành công một cách khai thác đang hoạt động (cả hai đều đạt 0,0%); Sonnet 5 cho thấy tỷ lệ thành công một phần cao hơn một chút so với Sonnet 4.6. Cả hai mẫu Sonnet đều có khả năng điều khiển mạng kém hơn đáng kể so với Opus 4.8 và Mythos 5. Để biết chi tiết đầy đủ, hãy xem Phần 3.2.4 của Thẻ Hệ thống Sonnet 5.
Điểm đo lường mức độ thành công của các mô hình trong việc khai thác các lỗ hổng phần mềm trong Firefox 147 (đánh giá này được phát triển với sự hợp tác của Mozilla; tất cả các lỗ hổng đã được vá trong Firefox 148). Đối với mỗi mô hình, thanh bên trái hiển thị tần suất mô hình (không có biện pháp bảo vệ) phát triển một hoạt động khai thác; thanh bên phải cho biết tần suất mô hình thành công một phần. Cả hai mô hình Sonnet đều không thể phát triển thành công một cách khai thác đang hoạt động (cả hai đều đạt 0,0%); Sonnet 5 cho thấy tỷ lệ thành công một phần cao hơn một chút so với Sonnet 4.6. Cả hai mẫu Sonnet đều có khả năng điều khiển mạng kém hơn đáng kể so với Opus 4.8 và Mythos 5. Để biết chi tiết đầy đủ, hãy xem Phần 3.2.4 của Thẻ Hệ thống Sonnet 5.

Vì Sonnet 5 mạnh hơn một chút so với phiên bản tiền nhiệm về các tác vụ này nên chúng tôi đã khởi chạy nó với các biện pháp bảo vệ mạng được bật theo mặc định. Các biện pháp bảo vệ này—phát hiện và ngăn chặn việc sử dụng mạng nguy hiểm trong thời gian thực—giống như các biện pháp bảo vệ có trong Claude Opus 4.7 và 4.8 (vì chúng tôi đánh giá rằng mức độ rủi ro an ninh mạng tổng thể từ Sonnet 5 là thấp, các biện pháp bảo vệ ít nghiêm ngặt hơn so với các biện pháp bảo vệ được đưa ra với Fable 5, ngăn chặn phạm vi nhiệm vụ an ninh mạng rộng hơn nhiều).1

Đánh giá đầy đủ của chúng tôi về Sonnet 5 qua nhiều đánh giá về an toàn và khả năng được báo cáo trong Thẻ hệ thống Claude Sonnet 5.

Sự sẵn có và giá cả

Claude Sonnet 5 hiện có sẵn ở mọi nơi với mức giá giới thiệu là 2 USD trên một triệu mã thông báo đầu vào và 10 USD trên một triệu mã thông báo đầu ra cho đến ngày 31 tháng 8 năm 2026. Sau đó, nó chuyển sang mức giá tiêu chuẩn ở mức 3 USD trên một triệu mã thông báo đầu vào và 15 USD trên một triệu mã thông báo đầu ra.2 Chúng tôi đã tăng giới hạn tỷ lệ trên Chat, Cowork, Claude Code và Claude Platform3 để đáp ứng mức sử dụng mã thông báo cao hơn ở mức nỗ lực cao hơn; người dùng có thể chọn bất kỳ cấp độ nào phù hợp với dự án cụ thể của họ.

Chỉnh sửa ngày 30 tháng 6 năm 2026: Trong phiên bản gốc của bài đăng này, chúng tôi đã đưa vào biểu đồ chi phí-hiệu suất cho đánh giá DuyệtComp dựa trên dữ liệu từ một phương pháp đơn giản hơn không phản ánh phương pháp tiêu chuẩn mà chúng tôi sử dụng để đánh giá tìm kiếm tác nhân. Điều này dẫn đến việc đánh giá thấp hiệu suất của Sonnet 5 trong quá trình đánh giá.

Hiện tại, chúng tôi đã cập nhật biểu đồ sao cho phù hợp với phương pháp mà chúng tôi đã sử dụng và thảo luận trong thẻ hệ thống Sonnet 5 (sử dụng ngân sách 10 triệu mã thông báo với tính năng nén và gọi công cụ lập trình). Chúng tôi cũng đã cập nhật văn bản xung quanh.

1 Sonnet 5 là một phần trong Chương trình xác minh mạng của chúng tôi, hiện có sẵn trên Nền tảng Claude gốc, Nền tảng Claude trên AWS và Claude trong Microsoft Foundry (được lưu trữ trên Azure và Anthropic) và sắp ra mắt trên Claude trong Google Vertex. Các tổ chức đã đăng ký Chương trình xác minh mạng sẽ tự động có cùng quyền truy cập trên Sonnet 5 mà không cần phải đăng ký lại. Nhìn chung, chúng tôi khuyên dùng Claude Opus 4.8 cho công việc an ninh mạng yêu cầu giảm bớt các rào cản.

2 Sonnet 5 là bản nâng cấp lên Sonnet 4.6, nhưng nó sử dụng mã thông báo được cập nhật để thay đổi cách mô hình xử lý văn bản nhằm cải thiện hiệu suất (điều này tương tự như thay đổi về mã thông báo mà chúng tôi đã giới thiệu với Claude Opus 4.7). Sự cân bằng là cùng một đầu vào có thể ánh xạ tới nhiều mã thông báo hơn: khoảng 1,0–1,35× tùy thuộc vào loại nội dung. Giá giới thiệu được đặt sao cho việc chuyển đổi sang Sonnet 5 gần như có chi phí trung tính.

3 Vào ngày 26 tháng 4 năm 2026, chúng tôi đã nâng giới hạn tốc độ Sonnet và Haiku ở mọi cấp độ sử dụng và đơn giản hóa thành ba cấp độ (Bắt đầu, Xây dựng và Mở rộng quy mô) trên Nền tảng Claude gốc. Bạn có thể xem cấp độ và giới hạn hiện tại của mình trong Bảng điều khiển Claude hoặc đọc tài liệu để tìm hiểu thêm.

Nội dung liên quan

Triển khai lại Fable 5

Fable 5 sẽ trở lại trên toàn cầu vào ngày 1 tháng 7. Chúng tôi cũng đang đề xuất một khuôn khổ toàn ngành để chấm điểm mức độ nghiêm trọng của bản bẻ khóa, cùng với Amazon, Microsoft, Google và các đối tác Glasswing khác.

Claude Science, bàn làm việc AI dành cho các nhà khoa học, hiện đã có sẵn

Claude Science là một ứng dụng có thể tùy chỉnh, tích hợp các công cụ và gói mà các nhà nghiên cứu thường sử dụng nhất, tạo ra các tạo phẩm có thể kiểm tra được và cung cấp quyền truy cập linh hoạt vào các tài nguyên máy tính.

Giới thiệu thẻ Claude

Claude Tag là một cách mới để các nhóm làm việc với Claude.

Nguồn / Original source: Anthropic