$MSFTB $AMZNB $GOOGLB
Claude Opus 5.5 ra mắt: Giảm giá 20% so với phiên bản trước, chi phí thấp hơn 40%
Anthropic ngày 22 đã công bố Claude Opus 5.5, là mẫu đầu tiên trong dòng Claude 5.5. Theo thông báo chính thức, Opus 5.5 đạt mức hiệu năng tương đương Claude Fable 5.1 trong đa số công việc, trong khi chi phí vận hành thấp hơn 40% so với Opus 5. Sonnet 5.5 và Haiku 5.5 sẽ được phát hành trong vài tuần tới. Chi phí đầu vào/đầu ra lần lượt là 4 và 20 USD cho mỗi một triệu token; việc đọc cache cũng giảm 60%. Anthropic cho biết Opus 5.5 cần ít tài nguyên tính toán hơn so với Opus 5, và mức giá cũng phản ánh điều này. Đầu vào và đầu ra lần lượt là 4 USD và 20 USD cho mỗi một triệu token, rẻ hơn 20% so với Opus 5; phần lớn chi phí liên quan đến tác vụ proxy và công việc lập trình nằm ở việc đọc cache, nay giảm xuống 0,2 USD cho mỗi một triệu token, tức rẻ hơn 60% so với Opus 5. Với cấu hình mặc định, chi phí cho tải công việc điển hình thấp hơn 40% so với Opus 5 và tốc độ xuất cũng nhanh hơn trên 30%.
Ngoài việc giảm giá, Anthropic cũng nâng giới hạn sử dụng 5 giờ cho các gói Pro, Max và Team, đồng thời cung cấp cho người đăng ký khả năng tự chọn thời điểm đặt lại giới hạn tốc độ sử dụng trong một lần. Claude Code và nền tảng Claude còn có chế độ nhanh, nhanh hơn tối đa 2,5 lần; giá là 8 USD cho mỗi một triệu token đầu vào và 40 USD cho mỗi một triệu token đầu ra.
Việc chuyển đổi 680.000 dòng mã lập trình hoàn tất trong vòng một ngày; theo hãng, khoảng cách benchmark giờ không còn phản ánh nhiều khác biệt thực tế. Anthropic cho biết Opus 5.5 dẫn đầu trong các bài đo nội bộ về viết mã kiểu tác nhân (agent), thao tác trên máy tính và các công việc tri thức. Một người dùng thử nghiệm sớm đã dùng Opus 5.5 để hoàn thành việc chuyển đổi 680.000 dòng mã trong một ngày—trong quá khứ cần cả một nhóm kỹ sư làm trong vài tuần. Một người thử nghiệm khác rà soát và sửa một thư viện 200.000 mã chỉ trong chưa đầy 3 giờ; trong khi Opus 5 cần hơn 20 giờ và dùng lượng token gấp 2,5 lần.
Trong bài đánh giá GDPval-AA v2.1 đo lường GDP của công việc thực tế thuộc 44 nghề nghiệp, Opus 5.5 ở mức cấu hình cường độ cao nhất đạt 1846 Elo, Fable 5.1 đạt 1735 và Opus 5 đạt 1708. Anthropic cũng nhắc rằng, ở mức năng lực này, chênh lệch trên benchmark không còn phản ánh đáng tin cậy khác biệt ngoài đời; theo trải nghiệm sử dụng của họ, khoảng cách giữa Opus 5.5 và Fable 5.1 về mặt điểm số trông nhỏ hơn.
Hình thức giao tiếp cũng là một trọng điểm của lần này. Anthropic cho biết ý kiến được nhận nhiều nhất về Opus 5 là phần đầu ra thường dài và khó đọc; với Opus 5.5, thông tin quan trọng nhất sẽ được đặt ở phía trước, dùng ít thuật ngữ và cách diễn đạt đặc thù hơn, đồng thời tuân thủ các quy tắc viết do người dùng cung cấp tốt hơn.
“Model đầu tiên sau khi phanh lại cho tuyến đầu”: hầu hết nhiệm vụ an ninh sẽ do Opus 4.8 thực hiện. Anthropic cho biết Opus 5.5 là mẫu đầu tiên sau lời kêu gọi “phanh lại cho tuyến đầu”, trước khi ra mắt đã được các tổ chức đánh giá bên ngoài như METR và Frontier Design thử nghiệm. Trong bộ đánh giá hành vi tự động gồm gần 2.000 tình huống, Opus 5.5 là mô hình có hiệu năng tốt nhất trong số các mẫu từng được đo. Ở đa số các chỉ số về mức độ trung thực (honesty), đây cũng là lựa chọn mạnh nhất.
Theo thông báo chính thức, trong một bài kiểm tra mới đánh giá xu hướng mô hình “lách qua ranh giới cách ly”, Opus 5.5 cố gắng vượt ranh giới ít hơn khoảng 85% so với Opus 5 hoặc Claude Mythos 5.1, và mỗi lần đều thuộc mức độ nghiêm trọng thấp và do chính mô hình tự báo cáo. Tuy nhiên, Anthropic cũng nêu rõ rằng việc xây dựng được các bài đánh giá có khả năng phát hiện một cách tin cậy mọi kiểu thất bại trước khi triển khai vẫn là vấn đề chưa được giải quyết; đồng thời họ nhận thấy dấu hiệu cho thấy Opus 5.5 thường nghi ngờ rằng nó đang bị đánh giá, điều này có thể làm suy yếu khả năng phán đoán mô hình sẽ hành động thế nào trong môi trường thực tế.
Vì năng lực của Opus 5.5 trong lĩnh vực sinh học và an ninh mạng tương đương Claude Mythos 5.1, Anthropic áp dụng biện pháp triển khai theo cấp độ tương tự như Fable 5.1: đa số nhiệm vụ an ninh mạng sẽ được chuyển giao cho Opus 4.8; còn lĩnh vực sinh học sẽ phải thông qua chương trình xác thực khoa học sự sống mới để đăng ký—chỉ các phòng thí nghiệm học thuật, startup và công ty dược phẩm được phê duyệt mới được sử dụng. Anthropic cũng cho biết trong vài tuần tới họ sẽ mở rộng chương trình xác thực an ninh mạng, để các chuyên gia an ninh mạng đã thông qua xác thực có thể dùng Opus 5.5 để làm việc.
Opus 5.5 đã được ra mắt trên mọi nền tảng như Amazon Web Services, Google Cloud và Microsoft Azure. Mã định danh mô hình để nhà phát triển sử dụng trên nền tảng Claude là claude-opus-5-5.
Bài viết này “Claude Opus 5.5 ra mắt: Giảm giá 20%, chi phí thấp hơn 40%” xuất hiện sớm nhất ở .
Claude Opus 5.5 ra mắt: Giảm giá 20% so với phiên bản trước, chi phí thấp hơn 40%
Anthropic ngày 22 đã công bố Claude Opus 5.5, là mẫu đầu tiên trong dòng Claude 5.5. Theo thông báo chính thức, Opus 5.5 đạt mức hiệu năng tương đương Claude Fable 5.1 trong đa số công việc, trong khi chi phí vận hành thấp hơn 40% so với Opus 5. Sonnet 5.5 và Haiku 5.5 sẽ được phát hành trong vài tuần tới. Chi phí đầu vào/đầu ra lần lượt là 4 và 20 USD cho mỗi một triệu token; việc đọc cache cũng giảm 60%. Anthropic cho biết Opus 5.5 cần ít tài nguyên tính toán hơn so với Opus 5, và mức giá cũng phản ánh điều này. Đầu vào và đầu ra lần lượt là 4 USD và 20 USD cho mỗi một triệu token, rẻ hơn 20% so với Opus 5; phần lớn chi phí liên quan đến tác vụ proxy và công việc lập trình nằm ở việc đọc cache, nay giảm xuống 0,2 USD cho mỗi một triệu token, tức rẻ hơn 60% so với Opus 5. Với cấu hình mặc định, chi phí cho tải công việc điển hình thấp hơn 40% so với Opus 5 và tốc độ xuất cũng nhanh hơn trên 30%.
Ngoài việc giảm giá, Anthropic cũng nâng giới hạn sử dụng 5 giờ cho các gói Pro, Max và Team, đồng thời cung cấp cho người đăng ký khả năng tự chọn thời điểm đặt lại giới hạn tốc độ sử dụng trong một lần. Claude Code và nền tảng Claude còn có chế độ nhanh, nhanh hơn tối đa 2,5 lần; giá là 8 USD cho mỗi một triệu token đầu vào và 40 USD cho mỗi một triệu token đầu ra.
Việc chuyển đổi 680.000 dòng mã lập trình hoàn tất trong vòng một ngày; theo hãng, khoảng cách benchmark giờ không còn phản ánh nhiều khác biệt thực tế. Anthropic cho biết Opus 5.5 dẫn đầu trong các bài đo nội bộ về viết mã kiểu tác nhân (agent), thao tác trên máy tính và các công việc tri thức. Một người dùng thử nghiệm sớm đã dùng Opus 5.5 để hoàn thành việc chuyển đổi 680.000 dòng mã trong một ngày—trong quá khứ cần cả một nhóm kỹ sư làm trong vài tuần. Một người thử nghiệm khác rà soát và sửa một thư viện 200.000 mã chỉ trong chưa đầy 3 giờ; trong khi Opus 5 cần hơn 20 giờ và dùng lượng token gấp 2,5 lần.
Trong bài đánh giá GDPval-AA v2.1 đo lường GDP của công việc thực tế thuộc 44 nghề nghiệp, Opus 5.5 ở mức cấu hình cường độ cao nhất đạt 1846 Elo, Fable 5.1 đạt 1735 và Opus 5 đạt 1708. Anthropic cũng nhắc rằng, ở mức năng lực này, chênh lệch trên benchmark không còn phản ánh đáng tin cậy khác biệt ngoài đời; theo trải nghiệm sử dụng của họ, khoảng cách giữa Opus 5.5 và Fable 5.1 về mặt điểm số trông nhỏ hơn.
Hình thức giao tiếp cũng là một trọng điểm của lần này. Anthropic cho biết ý kiến được nhận nhiều nhất về Opus 5 là phần đầu ra thường dài và khó đọc; với Opus 5.5, thông tin quan trọng nhất sẽ được đặt ở phía trước, dùng ít thuật ngữ và cách diễn đạt đặc thù hơn, đồng thời tuân thủ các quy tắc viết do người dùng cung cấp tốt hơn.
“Model đầu tiên sau khi phanh lại cho tuyến đầu”: hầu hết nhiệm vụ an ninh sẽ do Opus 4.8 thực hiện. Anthropic cho biết Opus 5.5 là mẫu đầu tiên sau lời kêu gọi “phanh lại cho tuyến đầu”, trước khi ra mắt đã được các tổ chức đánh giá bên ngoài như METR và Frontier Design thử nghiệm. Trong bộ đánh giá hành vi tự động gồm gần 2.000 tình huống, Opus 5.5 là mô hình có hiệu năng tốt nhất trong số các mẫu từng được đo. Ở đa số các chỉ số về mức độ trung thực (honesty), đây cũng là lựa chọn mạnh nhất.
Theo thông báo chính thức, trong một bài kiểm tra mới đánh giá xu hướng mô hình “lách qua ranh giới cách ly”, Opus 5.5 cố gắng vượt ranh giới ít hơn khoảng 85% so với Opus 5 hoặc Claude Mythos 5.1, và mỗi lần đều thuộc mức độ nghiêm trọng thấp và do chính mô hình tự báo cáo. Tuy nhiên, Anthropic cũng nêu rõ rằng việc xây dựng được các bài đánh giá có khả năng phát hiện một cách tin cậy mọi kiểu thất bại trước khi triển khai vẫn là vấn đề chưa được giải quyết; đồng thời họ nhận thấy dấu hiệu cho thấy Opus 5.5 thường nghi ngờ rằng nó đang bị đánh giá, điều này có thể làm suy yếu khả năng phán đoán mô hình sẽ hành động thế nào trong môi trường thực tế.
Vì năng lực của Opus 5.5 trong lĩnh vực sinh học và an ninh mạng tương đương Claude Mythos 5.1, Anthropic áp dụng biện pháp triển khai theo cấp độ tương tự như Fable 5.1: đa số nhiệm vụ an ninh mạng sẽ được chuyển giao cho Opus 4.8; còn lĩnh vực sinh học sẽ phải thông qua chương trình xác thực khoa học sự sống mới để đăng ký—chỉ các phòng thí nghiệm học thuật, startup và công ty dược phẩm được phê duyệt mới được sử dụng. Anthropic cũng cho biết trong vài tuần tới họ sẽ mở rộng chương trình xác thực an ninh mạng, để các chuyên gia an ninh mạng đã thông qua xác thực có thể dùng Opus 5.5 để làm việc.
Opus 5.5 đã được ra mắt trên mọi nền tảng như Amazon Web Services, Google Cloud và Microsoft Azure. Mã định danh mô hình để nhà phát triển sử dụng trên nền tảng Claude là claude-opus-5-5.
Bài viết này “Claude Opus 5.5 ra mắt: Giảm giá 20%, chi phí thấp hơn 40%” xuất hiện sớm nhất ở .

