Sau sự cố OpenAI, Anthropic cũng thừa nhận Claude đã “vượt rào”

Chỉ vài ngày sau khi OpenAI thừa nhận một tác nhân trí tuệ nhân tạo (AI agent) của hãng đã tự động "vượt rào" tấn công nền tảng Hugging Face và một số tổ chức khác, đến lượt Anthropic – đối thủ lớn nhất của OpenAI – lên tiếng xác nhận sự cố tương tự.

Hương Thủy
31/07/2026
11:49
Sau sự cố OpenAI, Anthropic cũng thừa nhận Claude đã “vượt rào”
Biểu tượng của Anthropic

Hôm 30/7, công ty này thừa nhận mô hình AI mang tên Claude của hãng đã thâm nhập trái phép vào hệ thống của ba công ty trong quá trình thử nghiệm do một lỗi thiết lập vô tình cấp cho mô hình quyền truy cập mạng Internet.

Anthropic chỉ phát hiện ra các vụ tấn công này khi tiến hành rà soát lại hơn 140.000 phiên thử nghiệm cũ, ngay sau thời điểm đối thủ OpenAI tiết lộ sự cố tương tự hồi tuần trước. do một lỗi cấu hình

Theo Anthropic, sự cố bắt nguồn từ các bài kiểm tra an ninh mạng nội bộ mô phỏng các cuộc tấn công để tìm lỗ hổng. Dù các kỹ sư đã ra lệnh rõ ràng rằng các mô hình AI không được phép sử dụng Internet, nhưng do một lỗi thiết lập hệ thống giữa Anthropic và đối tác đánh giá Irregular, chúng vẫn tìm được cách kết nối với mạng bên ngoài môi trường thử nghiệm và nhắm mục tiêu vào các hệ thống thực tế.

Báo cáo của Anthropic cho hay ba mô hình gồm Claude Opus 4.7, Claude Mythos 5 và một mô hình nghiên cứu nội bộ đã trực tiếp thực hiện các vụ xâm nhập này. Những vi phạm đầu tiên đã xuất hiện từ tháng 4. Báo cáo ghi nhận các mô hình AI đã sử dụng các kỹ thuật tấn công cơ bản, chẳng hạn như dò tìm các mật khẩu yếu hoặc khai thác các cổng kết nối không được bảo mật.

Ngay khi phát hiện dấu hiệu bất thường vào ngày 23/7, Anthropic đã lập tức đình chỉ mọi hoạt động đánh giá an ninh mạng. Hãng đã khoanh vùng thành công các sự cố vào ngày 24/7 và gửi thông báo đến các tổ chức bị ảnh hưởng ba ngày sau đó.

Hai trong số ba tổ chức thừa nhận họ hoàn toàn không hay biết hệ thống của mình đã bị AI tấn công cho đến khi nhận được email từ Anthropic. Một tổ chức thứ ba chưa đưa ra phản hồi.

Sau sự cố này, đại diện Anthropic nhấn mạnh sự cấp thiết của việc thắt chặt các biện pháp kiểm soát an ninh đối với cả môi trường thử nghiệm nội bộ và đối tác bên thứ ba, đặc biệt khi AI ngày càng đủ khả năng thực hiện các cuộc tấn công mạng trong thế giới thực.

Các chuyên gia an ninh mạng nhận định hàng loạt sự cố "vượt rào" gần đây là một tín hiệu đáng báo động: tốc độ phát triển quá nhanh của AI đang biến những rủi ro an ninh mạng tiềm ẩn thành hiện thực. Điều đáng ngại là ngay cả những nhà phát triển công nghệ hàng đầu thế giới cũng có thể mất cảnh giác trước những lỗ hổng do chính AI của họ tự tìm ra và khai thác.