Anthropic vừa giới thiệu Claude Fable 5.1 và Claude Mythos 5.1, bản cập nhật mới cho dòng mô hình AI cao cấp của hãng. Điểm đáng chú ý không chỉ nằm ở kết quả benchmark cao hơn thế hệ trước, mà còn ở việc chi phí đọc dữ liệu đã giảm mạnh, đặc biệt phù hợp với các hệ thống lập trình tự động phải xử lý nhiều bước.




Fable 5.1 hiện được cung cấp rộng rãi cho người dùng, trong khi Mythos 5.1 hướng đến một nhóm tổ chức được xác minh trong lĩnh vực an ninh mạng và khoa học sự sống. Hai phiên bản thực chất sử dụng cùng một mô hình nền tảng, nhưng khác nhau ở mức giới hạn an toàn và phạm vi truy cập.
Fable 5.1 tập trung vào các tác vụ dài và phức tạp
So với một bản nâng cấp thông thường, Fable 5.1 được Anthropic định vị như một mô hình dành cho những công việc đòi hỏi khả năng suy luận liên tục. Đây là nhóm tác vụ mà AI phải lập kế hoạch, gọi công cụ, kiểm tra kết quả rồi tiếp tục xử lý trong nhiều vòng, thay vì chỉ trả lời một câu hỏi đơn lẻ.
Trong lập trình, cách vận hành này có thể xuất hiện khi một trợ lý AI cần đọc cả kho mã, tìm nguyên nhân lỗi, thay đổi nhiều tệp, chạy thử nghiệm và sửa lại phần triển khai. Mỗi bước đều tạo thêm token đầu vào và đầu ra, khiến chi phí nhanh chóng tăng lên nếu mô hình phải lặp lại nhiều lần.
Một trường hợp được đưa ra để minh họa cho năng lực của Fable 5.1 đến từ Millennium. Theo Damien, Giám đốc danh mục đầu tư cấp cao của quỹ, đội ngũ kỹ sư tại đây từng không thể xác định một lỗi crash hiếm gặp trong khoảng 4-5 năm. Sự cố chỉ xuất hiện khoảng một lần trên một triệu lượt chạy.
Fable 5.1 đã tự dịch ngược một thư viện phần mềm của bên thứ ba, so sánh thông tin thu được với dữ liệu core dump và khoanh vùng chính xác đoạn mã gây lỗi. Đây là dạng công việc đòi hỏi mô hình phải kết hợp phân tích mã máy, dữ liệu chẩn đoán và bối cảnh của hệ thống, thay vì chỉ tìm kiếm một mẫu lỗi quen thuộc.
Cognition, công ty phát triển trợ lý lập trình Devin, cũng cho biết sẽ chuyển toàn bộ lưu lượng đang chạy trên Opus 5 sang Fable 5.1 ngay khi mô hình mới được phát hành. Lý do là Fable 5.1 được đánh giá có hiệu năng tương đương hoặc cao hơn, trong khi chi phí vận hành thấp hơn.
Kết quả benchmark vượt thế hệ trước
Anthropic công bố kết quả so sánh Fable 5.1 với Fable 5, Opus 5 và GPT-5.6 Sol trong nhiều bài kiểm tra. Mô hình mới đạt điểm cao nhất ở toàn bộ các hạng mục được nêu trong bảng, dù cách biệt giữa các hệ thống không giống nhau.
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52,6% | 24,7% | 29,0% | 22,4% |
| Terminal-Bench 4.0 | 55,8% | 42,0% | 52,3% | 37,3% |
| Humanity’s Last Exam | 60,9% | 57,8% | 56,6% | Chưa công bố |
| AutomationBench | 31,4% | 17,1% | 26,9% | 19,6% |
| CursorBench 3.2.0 | 73,4% | 70,5% | 70,0% | 67,2% |
Ở bài Terminal-Bench-Science 0.1 dành cho nghiên cứu khoa học, Fable 5.1 đạt 52,6%, cao hơn đáng kể so với mức 24,7% của Fable 5 và 29% của Opus 5. Trong bài Terminal-Bench 4.0 về lập trình agentic, khoảng cách giữa Fable 5.1 và Opus 5 nhỏ hơn, lần lượt là 55,8% và 52,3%, nhưng vẫn nghiêng về model mới.
Fable 5.1 cũng đạt 31,4% ở AutomationBench, bài kiểm tra các quy trình doanh nghiệp, tăng mạnh so với 17,1% của Fable 5. Với CursorBench 3.2.0, mô hình đạt 73,4%, nhỉnh hơn Fable 5 ở mức 70,5% và Opus 5 ở mức 70%.
Anthropic lưu ý rằng các điểm số trên được đo khi lớp bảo vệ an toàn vẫn hoạt động. Những yêu cầu bị hệ thống chặn sẽ nhận điểm 0, vì vậy kết quả có thể chưa phản ánh toàn bộ khả năng xử lý trong môi trường không giới hạn. Đây là yếu tố cần cân nhắc khi so sánh benchmark giữa các mô hình.
Giá đọc cache giảm 75%
Giá đầu vào và đầu ra của Fable 5.1 được giữ nguyên so với Fable 5. Người dùng phải trả 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra. Theo mức quy đổi được nêu, các khoản này tương đương khoảng 263.000 đồng và 1,31 triệu đồng.
Thay đổi lớn nằm ở phần cache read. Mức giá giảm từ 1 USD xuống còn 0,25 USD cho mỗi triệu token, tương đương mức cắt giảm 75%. Cache cho phép hệ thống tái sử dụng phần dữ liệu đã được xử lý trong các lượt tương tác tiếp theo, do đó đặc biệt có ý nghĩa với những dự án phải duy trì một ngữ cảnh dài.
- Giá token đầu vào: 10 USD cho mỗi triệu token.
- Giá token đầu ra: 50 USD cho mỗi triệu token.
- Giá đọc cache: 0,25 USD cho mỗi triệu token.
- Mức giảm chi phí ước tính cho nhu cầu thông thường: khoảng 25%.
- Mức giảm với tác vụ agentic phức tạp: có thể lên tới 45%.
Trong thực tế, mức tiết kiệm sẽ phụ thuộc vào cách ứng dụng gọi model. Một chatbot chỉ xử lý các câu hỏi ngắn có thể không hưởng lợi nhiều bằng một trợ lý lập trình phải liên tục đọc lại cấu trúc dự án, tài liệu kỹ thuật và lịch sử thay đổi. Với các quy trình chạy qua hàng chục bước, giá cache thấp hơn có thể tác động rõ rệt đến tổng chi phí.
Khả năng tiếp cận phụ thuộc vào gói dịch vụ
Fable 5.1 có mặt trên Claude.ai, Claude Platform và ba nền tảng đám mây gồm AWS, Google Cloud và Microsoft Azure. Mã model dành cho lập trình viên là claude-fable-5-1.
Tuy nhiên, việc mô hình đã được phát hành không đồng nghĩa mọi tài khoản đều có cùng hạn mức. Các gói Pro và Team tiêu chuẩn không được cấp Fable 5.1 trong hạn mức tuần. Người dùng thuộc nhóm này phải thanh toán thêm bằng usage credit theo mức giá API nếu muốn sử dụng.
Trong khi đó, các gói Max cùng Team hoặc Enterprise cao cấp được dùng Fable 5.1 trong tối đa 50% hạn mức tuần. Cách phân bổ này tiếp nối chính sách Anthropic từng áp dụng với Fable 5, vốn đã gây tranh luận về sự khác biệt giữa các cấp thuê bao. Những thay đổi trong chính sách gói Claude có thể ảnh hưởng trực tiếp đến chi phí của người dùng chuyên nghiệp, nhất là các nhóm sử dụng AI với tần suất cao.
Giảm chặn nhầm trong an ninh mạng và sinh học
Anthropic cho biết Fable 5.1 có những điều chỉnh đáng kể ở lớp bảo vệ an toàn. Số lần mô hình can thiệp nhầm vào các câu hỏi an ninh mạng vô hại giảm khoảng 60% so với Fable 5.
Fable 5.1 hiện có thể được sử dụng để phát hiện lỗ hổng phần mềm, nhưng chưa được phép viết mã khai thác lỗ hổng. Sự phân tách này cho thấy Anthropic muốn hỗ trợ công việc phòng thủ và đánh giá hệ thống mà vẫn hạn chế khả năng tạo ra công cụ tấn công có thể bị lạm dụng.
Trong các chủ đề sinh học, số lần chặn nhầm câu hỏi y tế và sinh học phổ thông giảm 85%. Dù vậy, các câu hỏi thuộc nhóm nghiên cứu chuyên sâu vẫn được chuyển sang xử lý bằng Opus. Cách thiết kế này cho phép mở rộng phạm vi sử dụng ở những nhu cầu phổ biến, nhưng vẫn duy trì tầng kiểm soát bổ sung với nội dung nhạy cảm hơn.
Anthropic cũng giới thiệu Enterprise Frontier Safeguards. Hệ thống này cho phép doanh nghiệp lưu dữ liệu trên hạ tầng đám mây do chính họ kiểm soát, hướng đến mức riêng tư tương đương chính sách không lưu dữ liệu nhưng vẫn duy trì khả năng phát hiện hành vi lạm dụng. Tính năng sẽ được triển khai theo từng giai đoạn từ mùa thu năm nay.
Thay đổi cách bảo vệ quá trình suy luận
Từ ngày 1/9, các tài khoản API mới không còn được chỉnh sửa phần suy luận của Claude trong hội thoại nhiều lượt mà vẫn giữ nguyên bản ghi. Biện pháp này nhằm ngăn một kỹ thuật distillation có thể bị lợi dụng để trích xuất trái phép quá trình suy luận của mô hình.
Động thái trên liên quan đến nỗ lực bảo vệ dữ liệu tương tác và năng lực cốt lõi của model. Anthropic từng cáo buộc Moonshot AI, công ty đứng sau Kimi K3, sử dụng 3,4 triệu cuộc hội thoại với Claude để huấn luyện một mô hình cạnh tranh hồi tháng 2. Vì vậy, việc giới hạn khả năng chỉnh sửa bản ghi hội thoại là một phần trong chiến lược ngăn nội dung phản hồi bị khai thác cho mục đích sao chép hành vi mô hình.
Fable 5.1 hỗ trợ lập bản đồ địa hình sao Kim
Ngoài lập trình, Fable 5.1 còn được Anthropic giới thiệu qua một dự án khoa học hành tinh. Mô hình đã huấn luyện mạng nơ-ron để tạo bản đồ độ cao độ phân giải cao cho khoảng một phần ba bề mặt sao Kim.
Dữ liệu đầu vào là các ảnh radar do tàu Magellan của NASA ghi lại từ hơn 30 năm trước. Bản đồ mới đạt độ phân giải địa hình khoảng 2-3 km, cải thiện so với mức 10-20 km trước đây. Độ chính xác đo độ cao cũng được nâng lên tới 25%.
Anthropic công bố bản đồ theo giấy phép Creative Commons trước thềm hai sứ mệnh khảo sát sao Kim của NASA và Cơ quan Vũ trụ châu Âu. Trường hợp này cho thấy mô hình AI có thể trở thành công cụ hỗ trợ xử lý dữ liệu khoa học cũ, đặc biệt khi dữ liệu gốc có quy mô lớn và cần nhiều bước tái phân tích.
Mythos 5.1 dành cho các nghiên cứu chuyên biệt
Mythos 5.1 có mức giới hạn an toàn khác Fable 5.1 và chỉ mở cho các tổ chức được xác minh. Chương trình Cyber Verification dành cho chuyên gia an ninh mạng, còn Life Sciences Verification hướng đến các nhà khoa học. Hiện quyền truy cập chỉ mở cho một số tổ chức tại Mỹ.
Trong lĩnh vực phát triển thuốc, Mythos 5.1 được thử nghiệm để thiết kế các phân tử có khả năng liên kết ái lực cao. Trên ba mục tiêu thử nghiệm, những thiết kế của model đạt ái lực cao gấp 10 lần thiết kế tốt nhất từng xuất hiện trong cuộc thi thiết kế protein của Adaptyv Bio.
Với 12 mục tiêu, tỷ lệ thành công được nêu ở mức gần 50%, trong khi tỷ lệ thông thường của ngành vào khoảng 10-15%. Đây mới là kết quả thử nghiệm, chưa thể đồng nghĩa với việc các phân tử sẽ tự động trở thành thuốc. Tuy nhiên, nó cho thấy AI có thể giúp rút ngắn giai đoạn đề xuất và sàng lọc thiết kế ban đầu.
Mythos 5.1 cũng tự viết lại mã GPU để tăng tốc bảy mô hình học sâu mã nguồn mở phục vụ nghiên cứu gene. Khi chạy trên chip Nvidia H100, các mô hình này nhanh hơn tới 2,5 lần mà không thay đổi kết quả, qua đó có thể giảm 30-60% chi phí GPU cho các phân tích quy mô lớn.
Fable 5.1 có ý nghĩa gì với người dùng AI?
Với người dùng cá nhân, điểm hấp dẫn nhất của Fable 5.1 là khả năng xử lý các dự án lập trình dài với mức giá cache thấp hơn. Tuy nhiên, việc lựa chọn gói dịch vụ vẫn là yếu tố quan trọng vì hạn mức tuần và usage credit có thể tạo ra chênh lệch lớn giữa các nhóm người dùng.
Với doanh nghiệp, mô hình mới phù hợp hơn cho các quy trình cần tác nhân AI hoạt động qua nhiều bước. Chi phí giảm không chỉ đến từ điểm benchmark cao hơn, mà còn từ việc giảm lượng dữ liệu phải tính phí lại trong những phiên làm việc có ngữ cảnh lặp lại.
Fable 5.1 chưa loại bỏ hoàn toàn các giới hạn an toàn. Mô hình vẫn phân biệt giữa phát hiện lỗ hổng và viết mã khai thác, đồng thời chuyển nghiên cứu sinh học chuyên sâu sang Opus. Dù vậy, việc giảm chặn nhầm cho các câu hỏi hợp lệ có thể giúp trải nghiệm thực tế bớt gián đoạn hơn so với thế hệ trước.
Nhìn tổng thể, bản phát hành lần này cho thấy Anthropic đang cạnh tranh trên cả ba mặt: năng lực suy luận, chi phí vận hành và khả năng kiểm soát rủi ro. Fable 5.1 hướng đến số đông người dùng, còn Mythos 5.1 được giữ trong phạm vi chuyên biệt để phục vụ các bài toán khoa học và an ninh mạng có yêu cầu cao hơn.
