Claude 5.1 vừa ra mắt! Mô hình mạnh nhất thế giới đã có mặt

chaincatcherchaincatcher

Nguồn: Follow AI's Machine Heart


Vừa rồi, Anthropic đã ra mắt các mô hình thế hệ tiếp theo Claude Fable 5.1 và Claude Mythos 5.1.

Anthropic tuyên bố rằng Claude Fable 5.1 là một trong những mô hình công khai mạnh mẽ nhất, được thiết kế cho suy luận phức tạp, các tác vụ kéo dài và quy trình tác nhân. Claude Mythos 5.1 đại diện cho việc khám phá các ranh giới năng lực cao hơn của họ.

Điều quan trọng cần lưu ý là mặc dù cả hai chia sẻ cùng năng lực mô hình nền tảng, các biện pháp an toàn khác nhau đã được áp dụng cho các kịch bản sử dụng khác nhau.

Fable 5.1 mở cho người dùng phổ thông, nhà phát triển và doanh nghiệp, trong khi Mythos 5.1 hướng đến các đối tác lĩnh vực rủi ro cao đã được thẩm định, duy trì kiểm soát truy cập chặt chẽ hơn.

Nói cách khác, một mô hình chịu trách nhiệm tham gia các tác vụ thực tế, trong khi mô hình còn lại được giữ trong môi trường kiểm soát chặt chẽ hơn. Đây cũng có thể là sự khám phá của Anthropic về các hình thức tương lai của sản phẩm AI: các mô hình mạnh nhất có thể không nhất thiết được cung cấp cho mọi người theo cùng một hình thức.

Tuyên bố chính thức chỉ ra rằng hai mô hình này đại diện cho những tiến bộ đáng kể về năng lực của dòng Claude và chứng minh cách họ tiếp tục thúc đẩy triển khai an toàn trong khi nâng cao năng lực mô hình.

Là mô hình "mạnh nhất hiện tại", Fable 5.1 vẫn thể hiện ấn tượng. Dữ liệu chính thức cho thấy Fable 5.1 vượt trội so với mô hình hàng đầu trước đó Fable 5 trong nhiều bài kiểm tra chuẩn.

Tuy nhiên, với năng lực lớn hơn, giá đã giảm. Anthropic cho biết Fable 5.1 duy trì cùng mức giá cơ bản, trong khi chi phí đọc bộ nhớ đệm đã giảm 75% so với Fable 5. Trong thực tế sử dụng, điều này giảm tổng chi phí của mô hình cho các khối lượng công việc điển hình khoảng 25%; đối với các khối lượng công việc tác nhân hóa cao, chi phí có thể giảm tới 45%.

Có vẻ như ngay cả các mô hình mạnh nhất cũng đang tập trung vào hiệu quả chi phí.

Chúng ta hãy xem xét kỹ hơn.

 

Các tầng thấp hơn bắt kịp thế hệ trước, Fable 5.1 tập trung vào "hiệu quả chi phí"

Thay vì chỉ đơn giản làm mới bảng xếp hạng, Anthropic muốn nhấn mạnh lần này: Fable 5.1 có thể hoàn thành các tác vụ trước đây yêu cầu các tầng cao của Fable 5 với chi phí suy luận thấp hơn.

Theo các bài kiểm tra chính thức, Fable 5.1 đã đạt được hiệu suất gần bằng hoặc thậm chí vượt qua Fable 5 ở cường độ suy luận thấp đến trung bình. Claude Code mặc định cường độ suy luận cao, trong khi Claude Cowork và Claude .ai mặc định cường độ trung bình, cho phép người dùng điều chỉnh giữa tốc độ, chi phí và hiệu quả dựa trên độ phức tạp của tác vụ.

Cụ thể, Fable 5.1 đạt điểm 52,6% trong bài kiểm tra chuẩn tác nhân nghiên cứu khoa học Terminal - Bench - Science 0.1, tăng hơn gấp đôi so với 24,7% của Fable 5; trong Terminal - Bench 4.0, Fable 5.1 đạt 55,8%, với Mythos 5.1 mạnh hơn đạt 60,9%.

Trong các bài kiểm tra công việc tri thức, thao tác máy tính và quy trình kinh doanh, mô hình mới cũng cho thấy sự cải thiện. Điểm AutomationBench tăng từ 17,1% của Fable 5 lên 31,4%, và CursorBench 3.2.0 cải thiện từ 70,5% lên 73,4%.

Trong nhiều bài kiểm tra chuẩn, điểm của Fable 5.1 vượt qua Fable 5, với sự cải thiện đáng kể nhất ở năng lực tác nhân nghiên cứu khoa học và quy trình công việc kinh doanh.

Trong bài kiểm tra Terminal - Bench 4.0, cả Fable 5.1 và Mythos 5.1 đều vượt qua Mythos 5 thế hệ trước ở các cường độ suy luận khác nhau.

Trong bài kiểm tra Terminal - Bench - Science 0.1, Fable 5.1 đạt điểm tối đa 52,6%, hơn gấp đôi so với Fable 5.

Anthropic tin rằng một thay đổi quan trọng ở Fable 5.1 là sự sẵn sàng theo dõi nguyên nhân gốc rễ của vấn đề, khiến nó phù hợp hơn để thực hiện các tác vụ phức tạp kéo dài hàng giờ hoặc thậm chí hàng chục giờ.

Công ty đầu tư Millennium phát hiện trong quá trình thử nghiệm rằng một đoạn mã nội bộ gặp sự cố khoảng một lần mỗi triệu lần chạy. Vấn đề này đã gây khó khăn cho đội ngũ kỹ thuật trong bốn đến năm năm, và các mô hình khác không xác định được nguyên nhân. Fable 5.1 đã xác định vấn đề là do lỗi trong thư viện chương trình bên thứ ba bằng cách tháo rời thư viện của nhà cung cấp bên ngoài và so sánh các tệp kết xuất lõi.

Ramp cũng đã cho Fable 5.1 chạy liên tục trong 38 giờ. Sau khi phát hiện ra rằng kết quả học máy ban đầu bị ảnh hưởng bởi lỗi gắn nhãn, mô hình đã tự động sửa lỗi và đồng thời khởi chạy sáu bộ thí nghiệm, cuối cùng biên soạn kết quả mới và các khuyến nghị tiếp theo.

 

Từ viết mã đến tiến hành nghiên cứu khoa học

Trong bản phát hành này, Anthropic dành một phần đáng kể để thảo luận về hiệu suất của Fable 5.1 và Mythos 5.1 trong nghiên cứu khoa học.

Trong các thí nghiệm thiết kế protein, các nhà nghiên cứu đã yêu cầu Mythos 5.1 gọi các công cụ thiết kế và gấp protein mã nguồn mở, sau đó gửi các thiết kế được tạo ra đến hai tổ chức bên ngoài để xác nhận thực nghiệm.

Đối với ba protein mục tiêu, ái lực liên kết của các phối tử do Mythos 5.1 thiết kế đạt gấp mười lần so với các giải pháp tốt nhất trong cuộc thi thiết kế protein liên quan Adaptyv Bio. Khi đối mặt với mười hai protein mục tiêu, tỷ lệ trúng phối tử hiệu quả của mô hình đạt gần 50%, trong khi mức phổ biến trong ngành do Anthropic cung cấp là 10% đến 15%.

Fable 5.1 cũng sử dụng các hình ảnh radar do tàu vũ trụ Magellan của NASA thu thập hơn 30 năm trước để tạo ra bản đồ độ cao mới có độ phân giải cao cho khoảng một phần ba bề mặt Sao Kim.

Hình ảnh radar của Sao Kim do tàu vũ trụ Magellan của NASA chụp, với một núi lửa hình khiên nhỏ đường kính khoảng 15 km ở trung tâm.

Bản đồ gốc chỉ có thể trình bày chi tiết ở tỷ lệ 10 đến 20 km, trong khi bản đồ mới cải thiện độ phân giải lên 2 đến 3 km, với độ chính xác đo chiều cao được cải thiện tới 25%. Anthropic có kế hoạch công bố công khai bản đồ này theo giấy phép chia sẻ tri thức cho các sứ mệnh tương lai như VERITAS của NASA và EnVision của Cơ quan Vũ trụ Châu Âu.

Trong lĩnh vực sinh học tính toán, Mythos 5.1 đã cải thiện tốc độ chạy của bảy mô hình học sâu protein và gen mã nguồn mở lên tới 2,5 lần bằng cách viết các nhân GPU tùy chỉnh và lưu trữ các kết quả trung gian, trong khi vẫn duy trì kết quả đầu ra nhất quán. Trong một số tác vụ phân tích toàn bộ gen, dự kiến sẽ giảm chi phí GPU từ 30% đến 60%.

Sau khi tối ưu hóa bảy mô hình protein và gen mã nguồn mở, tốc độ suy luận của Mythos 5.1 tăng từ 1,4 đến 2,5 lần.

Anthropic nhằm sử dụng các trường hợp này để chứng minh rằng mô hình đang phát triển từ việc tổ chức thông tin và viết mã sang đề xuất giải pháp, chạy công cụ và cung cấp kết quả nghiên cứu có thể được xác nhận thực nghiệm.

Giá bộ nhớ đệm giảm 75%, với các tác vụ tác nhân trở nên rẻ hơn tới 45%.

Ngoài hiệu suất, giá là thay đổi trực tiếp nhất ở Fable 5.1.

Giá đầu vào và đầu ra của Fable 5.1 không được điều chỉnh, vẫn ở mức $10 mỗi triệu token và $50 tương ứng, nhưng giá đọc bộ nhớ đệm đã giảm 75%, xuống còn $0,25 mỗi triệu token.

Đọc bộ nhớ đệm đề cập đến việc mô hình tái sử dụng ngữ cảnh đã xử lý. Tỷ lệ của nó có thể hạn chế trong Hỏi đáp thông thường, nhưng trong các tác vụ tác nhân yêu cầu đọc lặp lại cơ sở mã, hội thoại lịch sử và kết quả công cụ, bộ nhớ đệm thường chiếm một phần chi phí chính.

Theo tính toán của Anthropic dựa trên dữ liệu sử dụng thực tế từ tháng 8 năm 2026, tổng chi phí chạy các tác vụ điển hình với Fable 5.1 thấp hơn khoảng 25% so với Fable 5; đối với các tác vụ tác nhân phức tạp với ngữ cảnh dài hơn và gọi công cụ thường xuyên, mức giảm chi phí có thể đạt tới khoảng 45%.

Sau khi giảm giá đọc bộ nhớ đệm, chi phí của các tác vụ điển hình với Fable 5.1 giảm khoảng 25%, trong khi chi phí của các tác vụ tác nhân hóa cao giảm tới khoảng 45%.

Fable 5.1 hiện có sẵn trên Claude .ai, Claude Code và Claude API, và cũng được cung cấp thông qua AWS, Google Cloud và Microsoft Azure. Các nhà phát triển có thể gọi mô hình mới qua claude-fable-5-1.

 

Cơ chế chống chưng cất được tăng cường

Fable 5.1 và Mythos 5.1 thực sự sử dụng cùng một mô hình cơ bản, với sự khác biệt chính là các hạn chế an toàn.

Fable 5.1 hoàn toàn mở cho người dùng phổ thông và doanh nghiệp; Mythos 5.1 có các hạn chế an ninh mạng và khoa học sự sống nới lỏng hơn và hiện chỉ có sẵn cho các cá nhân và tổ chức đã được thẩm định.

Trong lĩnh vực an ninh mạng, Fable 5.1 đã có thể giúp người dùng phát hiện lỗ hổng phần mềm nhưng vẫn không thể trực tiếp tạo ra các chương trình khai thác. Các tác vụ lưỡng dụng như kiểm tra thâm nhập, tạo khai thác và quét lỗ hổng dựa trên tệp nhị phân vẫn có thể được chuyển đến các mô hình có hạn chế chặt chẽ hơn.

Sau khi điều chỉnh, phiên bản mới của cơ chế bảo vệ an ninh mạng đã giảm dương tính giả khoảng 60% so với Fable 5. Tỷ lệ dương tính giả của cơ chế an toàn sinh học đối với các câu hỏi sinh học và y tế cơ bản cũng giảm 85%, trong khi các năng lực nâng cao liên quan đến nghiên cứu khoa học sự sống chủ yếu được mở thông qua chương trình đánh giá Mythos 5.1.

Anthropic cũng đã ra mắt Enterprise Frontier Safeguards. Các doanh nghiệp có thể lưu trữ dữ liệu trong cơ sở hạ tầng đám mây do họ kiểm soát, với doanh nghiệp chịu trách nhiệm đánh giá thủ công mặc định, do đó đạt được hiệu quả bảo mật gần như "không lưu giữ dữ liệu" trong khi vẫn duy trì khả năng giám sát an ninh. Cơ chế này dự kiến sẽ được triển khai theo từng giai đoạn bắt đầu từ mùa thu này.

Đối với việc chưng cất mô hình quy mô lớn, Fable 5.1 cũng đã thêm các hạn chế mới. Các tài khoản API được tạo sau ngày đó sẽ không thể sửa đổi thủ công ngữ cảnh trước đó trong các cuộc đối thoại nhiều lượt trong khi vẫn giữ lại các bản ghi suy nghĩ lịch sử của Claude. Anthropic cho biết thay đổi này chủ yếu nhằm chặn một phương pháp trích xuất năng lực đã được công khai.

Ngoài ra, để đáp ứng các yêu cầu của Đạo luật Trí tuệ Nhân tạo của EU, đầu ra văn bản của Fable 5.1 sẽ bao gồm hình mờ vô hình. Anthropic cũng đã bắt đầu thử nghiệm quy mô nhỏ các API phát hiện, ban đầu mở cho các cơ quan quản lý, phương tiện truyền thông, tổ chức kiểm chứng thông tin và các tổ chức nghiên cứu.

Cuối cùng, người dùng mạng đã đúng; người đến sớm được dùng 5.1 trước.

Nội dung này chỉ mang tính chất tham khảo và cung cấp thông tin, không phải lời khuyên đầu tư liên quan đến BTCC. BTCC luôn cố gắng cung cấp thông tin chính xác, nhưng không đảm bảo tuyệt đối về tính xác thực, độ chính xác hoặc bản quyền nội dung trên.

Đề xuất

Vàng phá vỡ dưới 4.300 USD khi áp lực vĩ mô gia tăng; BTC giữ mức 77KBên trong OpenAI, AI đã xây dựng ba thế hệ 'nền văn minh'Podcast của Ultraman hé lộ tin sốc: Khả năng vận hành máy tính của Astra đã đạt trình độ con ngườiTrái phiếu Mỹ mới là 'sát thủ tối thượng' của bong bóng AI? Cảnh báo: Lợi suất 10 năm phá 5% có thể là điểm kích nổRủi ro chứng khoán Hàn? Goldman Sachs: Nhà đầu tư cá nhân đã rút lui, 'đạn mua lại' cạn kiệt vào tháng 10, chỉ còn trông chờ khối ngoại