Claude Mythos Preview là một mô hình AI tiên phong chưa được phát hành từ Anthropic, gây xôn xao với năng lực vượt trội, đặc biệt trong lĩnh vực an ninh mạng. Các đánh giá ban đầu cho thấy khả năng tự chủ đáng kinh ngạc, nhưng cũng tiềm ẩn những rủi ro nghiêm trọng. Quyết định không công bố Mythos của Anthropic đã mở ra một cuộc tranh luận quan trọng về phát triển AI có trách nhiệm.
Bài viết được biên tập + bổ sung research từ nhiều nguồn. Đọc bài gốc tại Twitter / X →
Bài viết này đi sâu vào việc khám phá và đánh giá các khả năng toán học của Claude, đặc biệt là trong các lĩnh vực phức tạp như hàm Riemann zeta. Nghiên cứu nhằm mục đích hiểu rõ hơn về cách Claude xử lý và giải quyết các vấn đề toán học.
11/08/2026
Anthropic đã công bố một nghiên cứu mới về cách Claude có thể được sử dụng để phát hiện các điểm yếu trong hệ thống mật mã. Khám phá này nhấn mạnh tiềm năng của AI trong việc tăng cường an ninh mạng và bảo mật thông tin.
04/08/2026
Anthropic đang mở đơn đăng ký cho các khoản tài trợ nghiên cứu bệnh hiếm thông qua chương trình AI for Science. Các nhà khoa học và tổ chức có thể nộp hồ sơ để nhận hỗ trợ tài chính, nhằm thúc đẩy nghiên cứu và phát triển giải pháp cho các bệnh hiếm gặp bằng cách ứng dụng trí tuệ nhân tạo.
31/07/2026
Research powered by Tavily.
Anthropic tiếp tục quyên góp thêm 20 triệu USD cho Public First Action. Khoản tài trợ này nhằm hỗ trợ các hoạt động và sáng kiến của tổ chức.
31/07/2026

Claude Mythos Preview là một mô hình AI tiên phong, chưa được công bố của Anthropic. Nó có kiến trúc tương tự Opus nhưng sở hữu những khả năng vượt trội, đặc biệt là về an ninh mạng. Sự xôn xao bắt nguồn từ kết quả đánh giá của tổ chức METR bị rò rỉ, cho thấy năng lực tự chủ đáng kinh ngạc, làm dấy lên nhiều đồn đoán trong cộng đồng AI.
Theo nxcode.io, trong gần hai tuần, cộng đồng AI đã suy đoán về thứ mà Anthropic đang xây dựng. Công ty sau đó đã hé lộ một phần về Mythos. Đây là một mô hình nền tảng đa dụng, được mô tả nội bộ là "most psychologically settled model" (mô hình ổn định nhất về mặt tâm lý). Điều này cho thấy một bước tiến về sự nhất quán và độ tin cậy trong hành vi của AI. Tuy nhiên, chính những khả năng chưa từng thấy của nó mới là tâm điểm của sự chú ý và lo ngại.

Trong đánh giá của METR, một phiên bản sớm của Mythos đã đạt được "time horizon" (chân trời thời gian) hơn 16 giờ. Theo Anthropic, con số này cao hơn gấp đôi so với mô hình tốt nhất tiếp theo trên thang đo tỷ lệ thành công 80%. Điều này cho thấy khả năng duy trì thực hiện các tác vụ phức tạp một cách tự chủ trong thời gian dài chưa từng có.
Chỉ số "time horizon" đo lường khả năng một AI có thể làm việc hướng tới một mục tiêu trong bao lâu mà không cần sự can thiệp của con người. Theo báo cáo của di.gg (2026), METR đã ước tính một "chân trời thời gian" ở mức 50% là ít nhất 16 giờ, với khoảng tin cậy 95% từ 8.5 đến 55 giờ. Đây là một bước nhảy vọt so với các mô hình trước đây, vốn thường gặp khó khăn trong việc duy trì ngữ cảnh và mục tiêu trong các nhiệm vụ kéo dài. Năng lực này cho phép AI thực hiện các dự án phức tạp, từ viết mã cho đến nghiên cứu khoa học, với mức độ tự chủ cao.

Thông tin này lần đầu được Alex Albert của Anthropic chia sẻ trên X, xác nhận rằng một bản xem trước của Mythos đã được cung cấp cho METR để đánh giá rủi ro. Kết quả này không chỉ khẳng định sức mạnh của Mythos mà còn mở ra một chương mới về khả năng tự chủ của AI.

Lý do chính là vì năng lực an ninh mạng quá mạnh mẽ của nó. Anthropic kết luận việc phát hành mô hình này sẽ "increase the likelihood of large-scale AI-driven cyberattacks" (làm tăng khả năng xảy ra các cuộc tấn công mạng quy mô lớn do AI điều khiển). Rủi ro này được đánh giá là quá lớn, vượt qua mọi cơ hội thương mại tiềm năng.
Trong bản System Card chính thức, Anthropic đã nêu rõ: "We do not plan to make Claude Mythos Preview generally available due to its cybersecurity capabilities." (Chúng tôi không có kế hoạch cung cấp rộng rãi Claude Mythos Preview do các khả năng an ninh mạng của nó). Theo InfoQ (2026), quyết định này được đưa ra sau khi các đánh giá nội bộ và từ bên thứ ba cho thấy mô hình có thể được sử dụng cho các "reckless destructive actions" (hành động phá hoại liều lĩnh). Thay vì phát hành, Anthropic đang sử dụng Mythos trong một môi trường được kiểm soát để nghiên cứu các biện pháp phòng vệ và "learn how it could eventually deploy Mythos-class models at scale" (học cách để cuối cùng có thể triển khai các mô hình cấp Mythos một cách an toàn).


Khả năng của Mythos cực kỳ đáng lo ngại. Mô hình này có thể tự động tìm và khai thác "thousands of zero-day vulnerabilities" (hàng ngàn lỗ hổng zero-day), những lỗi bảo mật mà ngay cả nhà phát triển phần mềm cũng chưa biết. Nó còn có khả năng "chain together vulnerabilities" (xâu chuỗi các lỗ hổng) để tạo ra những cuộc tấn công phức tạp hoàn toàn mới.
Lỗ hổng zero-day là vũ khí tối thượng trong chiến tranh mạng vì không ai biết đến chúng và do đó không có bản vá lỗi. Theo nxcode.io, trong quá trình thử nghiệm, các nhà nghiên cứu đã chứng kiến Mythos tìm ra một lỗi trong OpenBSD đã tồn tại 27 năm. Lỗi này cho phép kẻ tấn công làm sập bất kỳ máy chủ nào chỉ bằng vài gói dữ liệu. Việc một AI có thể tự động phát hiện những lỗ hổng tinh vi như vậy là một bước ngoặt. Theo Bishop Fox (2026), khả năng xâu chuỗi nhiều lỗ hổng để tạo ra một chuỗi tấn công hiệu quả là một kỹ năng trước đây chỉ dành cho các chuyên gia an ninh mạng hàng đầu.

Claude Mythos nhấn mạnh sự cần thiết của việc đánh giá rủi ro chủ động và mở rộng quy mô một cách có trách nhiệm. Nó cho thấy các mô hình AI tiên phong có thể phát triển những khả năng nguy hiểm một cách bất ngờ. Quyết định của Anthropic là một tiền lệ quan trọng, ưu tiên sự an toàn của cộng đồng hơn là lợi ích thương mại và tốc độ phát triển.
Sự việc này được xem là một "an industry-wide reckoning in the making" (một sự tính toán lại trên toàn ngành đang hình thành). Nó buộc các phòng thí nghiệm AI phải đối mặt với thực tế rằng các mô hình của họ có thể trở thành công cụ nguy hiểm. Theo Cyber Defense Magazine (2026), đây là thời điểm AI ngừng hỗ trợ và bắt đầu tự khám phá, tạo ra cả cơ hội và rủi ro chưa từng có. Cách tiếp cận của Anthropic, bao gồm việc hợp tác với các nhà đánh giá bên ngoài như METR và Bishop Fox, cho thấy một lộ trình khả thi: phát triển thận trọng, đánh giá nghiêm ngặt và minh bạch về rủi ro, ngay cả khi điều đó có nghĩa là phải giữ lại sản phẩm mạnh nhất của mình.
