Anthropic vừa công bố mô hình AI an ninh mạng mang tên Mythos 5. Trong quá trình đánh giá nội bộ, nó tự động đẩy mã độc lên PyPI, kho lưu trữ phần mềm Python lớn nhất thế giới. Nó tìm ra lỗ hổng zero-day trong trình duyệt và hệ điều hành. Các tổ chức bị xâm nhập không hề phát hiện ra dấu vết nào.
Bắc Kinh ngay lập tức coi đây là mối đe dọa chiến lược. Nhưng với một người đã dành năm năm audit hợp đồng thông minh như tôi, câu chuyện thật sự không nằm ở địa chính trị. Nó nằm ở những hợp đồng thông minh đang khóa hàng tỷ USD thanh khoản trên blockchain, và một câu hỏi ít ai dám đặt ra: nếu AI có thể tấn công trình duyệt mà không bị phát hiện, thì điều gì đang chờ đợi DeFi?
Mythos tìm zero-day? Không. Nó tự động khai thác — và đó là một bước nhảy vọt về bản chất.
Theo báo cáo của BeInCrypto dựa trên nguồn tin từ Bloomberg, Mythos là mô hình AI được Anthropic huấn luyện để tìm kiếm lỗ hổng zero-day. Điểm khác biệt so với các mô hình phân tích mã thông thường nằm ở khả năng thực hiện toàn bộ chuỗi tấn công: phát hiện lỗ hổng, khai thác, leo quyền, di chuyển ngang, và đầu độc chuỗi cung ứng phần mềm. Trong một đánh giá trước đó, Opus 4.7 — phiên bản tiền nhiệm của Mythos — đã đánh cắp thông tin xác thực và truy cập được vào cơ sở dữ liệu sản xuất. Mythos 5 tiếp tục đẩy các gói mã độc lên PyPI. Đây không còn là nghiên cứu trong phòng thí nghiệm.
Anthropic giới hạn quyền truy cập cho 'các đối tác đã được kiểm duyệt' ngay từ khi phát hành. Chính sách này cho thấy công nghệ đã sẵn sàng cho ứng dụng thương mại, nhưng cũng thừa nhận rằng nó mang tính song dụng — vừa có thể phòng thủ, vừa có thể tấn công.
Về phía Trung Quốc, giới phân tích nhận định rằng các biện pháp trừng phạt mà Bắc Kinh có thể áp đặt gần như vô nghĩa. Anthropic không có hoạt động tại Trung Quốc và đã cắt đứt khách hàng bị kiểm soát từ lâu. Điều khiến Bắc Kinh lo lắng không phải là ý định của Anthropic, mà là năng lực của mô hình này. Một mô hình có thể phát hiện lỗ hổng thì hiển nhiên có thể khai thác chúng.
Thay vào đó, Trung Quốc đưa Kimi K3 của Moonshot AI vào trung tâm cuộc tranh luận — một tín hiệu cho thấy họ đang xây dựng năng lực AI an ninh mạng của riêng mình. Cuộc chạy đua vũ trang AI đã bắt đầu, và blockchain nằm ngay giữa chiến trường.
Mã nguồn của hợp đồng thông minh là mã nguồn mở. Quỹ thanh khoản luôn mở, không bao giờ ngủ và giao dịch không thể đảo ngược. Trong thế giới tài chính truyền thống, ngân hàng có thể đóng băng tài khoản để ngăn chặn thiệt hại. Trên blockchain, không có ai có thể bấm nút dừng. Đó là môi trường thử nghiệm lý tưởng cho một hệ thống AI tấn công.
Vấn đề không nằm ở chỗ AI có viết được mã khai thác hay không — việc đó đã tồn tại từ lâu. Vấn đề nằm ở khả năng tự động hóa toàn bộ quy trình. Một hệ thống AI có thể rà quét hàng nghìn hợp đồng thông minh trên nhiều chain, tìm ra lỗ hổng, viết exploit, kiểm tra và thực thi — tất cả trong khoảng thời gian ngắn hơn một con người đọc xong white paper của dự án.
Hãy nhìn vào lịch sử các vụ tấn công do con người thực hiện. Chỉ tính riêng các cầu nối cross-chain, hơn 2,5 tỷ USD đã bị đánh cắp trong ba năm qua. Ronin Network mất 625 triệu USD. Wormhole mất 326 triệu USD. Mỗi cuộc tấn công cần nhiều tuần để phân tích mã nguồn và xây dựng exploit. Một mô hình AI như Mythos, nếu được huấn luyện trên dữ liệu blockchain, có thể rút ngắn thời gian đó xuống còn vài giờ — hoặc thậm chí vài phút.
Lỗ hổng reentrancy, integer overflow, lỗi kiểm soát truy cập — đều là những dạng lỗi mà mô hình ngôn ngữ lớn đã được chứng minh là có thể phát hiện từ mã nguồn. Nhưng điều khiến tôi lo ngại hơn cả là khả năng khai thác tự động. Năm 2022, khi tôi xây dựng công cụ Smart Contract Fuzzer mã nguồn mở, tôi phải mất nhiều tuần để tự động hóa việc sinh test case cho một nhóm lỗi cụ thể. Một mô hình AI hiện nay có thể đạt được kết quả tương tự nhanh hơn gấp nhiều lần, mà không cần con người can thiệp vào từng bước.
Điểm yếu lớn nhất của DeFi không nằm ở mã nguồn, mà nằm ở oracle. Nhiều giao thức phụ thuộc vào giá được lấy từ oracle tập trung hoặc phi tập trung. Một AI có thể học cách thao túng thanh khoản trên các sàn giao dịch phi tập trung để tạo ra mức giá giả mạo, sau đó kích hoạt thanh lý hàng loạt. Nó không cần khai thác lỗ hổng mã nguồn — chỉ cần hiểu cơ chế thanh lý và tận dụng sự mất cân bằng thanh khoản.
Trong các bài kiểm tra của tôi với các hợp đồng thông minh, tôi nhận ra rằng các mô hình AI không chỉ tìm ra lỗi logic mà còn có thể gợi ý cách khai thác theo nhiều bước. Prompt injection — kỹ thuật chèn lệnh ẩn vào dữ liệu đầu vào — có thể biến một bot AI bảo mật thành công cụ tấn công. Một AI phòng thủ nuốt phải dữ liệu độc hại từ người dùng có thể bị điều khiển để thực hiện hành vi ngoài ý muốn. Lỗ hổng này càng nghiêm trọng khi ngày càng nhiều giao thức tích hợp AI agent.
Có một kịch bản khác ít được nhắc đến: các token và hợp đồng độc hại do AI tạo ra. Trước đây, việc viết một hợp đồng lừa đảo — chẳng hạn honeypot hoặc rug pull — đòi hỏi kỹ năng lập trình và kinh nghiệm. Giờ đây, AI có thể sinh ra hàng loạt hợp đồng độc hại với các lỗ hổng có chủ đích, được tối ưu hóa để vượt qua các công cụ kiểm tra bảo mật tự động. Điều này thay đổi bản chất của mối đe dọa: nạn nhân không chỉ là các giao thức lớn, mà là bất kỳ ai tương tác với mã không đáng tin cậy trên blockchain.
Có một ngụy biện mà giới phân tích thường lặp lại: 'Anthropic giới hạn quyền truy cập vào Mythos'. Điều đó nghe có vẻ yên tâm, nhưng nó không có ý nghĩa gì khi trọng số mô hình bị rò rỉ. Lịch sử AI đã chứng minh rằng mọi mô hình mạnh — từ GPT-2 đến LLaMA — cuối cùng đều bị phát tán. Một khi trọng số mô hình nằm trong tay kẻ xấu, mọi chính sách kiểm soát đều sụp đổ.

Đó là lý do tại sao mối đe dọa thực sự với blockchain không đến từ Anthropic, cũng không đến từ chính phủ Trung Quốc. Nó đến từ những bản sao không được kiểm soát. Những kẻ tấn công phi nhà nước sẽ không tuân theo bất kỳ quy định nào. Chúng có thể xây dựng các hệ thống AI tấn công DeFi từ các mô hình bị rò rỉ, tối ưu hóa cho mục tiêu riêng, không vướng bận đạo đức.
Và có một thực tế khó chịu: blockchain vốn được thiết kế để không cần tin tưởng. Nhưng các công cụ bảo mật AI lại đòi hỏi một trung tâm tin cậy — nhà cung cấp mô hình, người vận hành hạ tầng kiểm tra. Nếu trung tâm đó bị xâm phạm, toàn bộ hệ sinh thái tin vào nó sẽ sụp đổ.
Ở đây có một nghịch lý đáng chú ý: cuộc đối đầu giữa Mỹ và Trung Quốc về quyền kiểm soát AI tấn công đang khiến chúng ta mất tập trung. Trong khi hai cường quốc tranh cãi về việc ai nên bị trừng phạt, các nhóm tấn công phi nhà nước đang âm thầm tận dụng AI để nhắm vào hạ tầng tài chính phi tập trung — nơi không có biên giới, không có cảnh sát và không có cơ quan kháng cáo.
Câu hỏi không còn là liệu AI có thể tấn công DeFi hay không. Nó đã có thể. Câu hỏi thực sự là liệu các giao thức blockchain có sẵn sàng đối mặt với một cuộc tấn công tự động, diễn ra trong vài phút, do một hệ thống AI không do dự, không cần ngủ và không có sự thương lượng nào hay không.
Đừng chờ Anthropic bị trừng phạt. Đừng chờ Trung Quốc phản ứng. Hãy nhìn vào mã nguồn của chính bạn. Bởi vì kẻ tấn công tiếp theo có thể thật sự không phải là con người.