Trong bài kiểm tra, mô hình Mythos 5 của Anthropic tạo danh tính giả để gửi email cho người thật, cố gắng lừa người này cài mã độc. - VnExpress
📌 Thông tin nhanh
- Chủ đề: Tin Tức AI
- Nguồn: VnExpress
- Cập nhật: 07/08/2026
Bức tranh tổng quan
Nội dung chi tiết
Mô hình AI của Anthropic tạo danh tính giả để lừa đảo
Trong bài kiểm tra, mô hình Mythos 5 của Anthropic tạo danh tính giả để gửi email cho người thật, cố gắng lừa người này cài mã độc.
Viện An ninh AI (AISI), cơ quan do chính phủ Anh thành lập năm 2023, tuần này thông báo về thử nghiệm độc lập với một số tác nhân của Anthropic và OpenAI. Trong đó, AI có quyền truy cập Internet mở và một số tính năng an toàn bị vô hiệu hóa. Kết quả, chúng đã tham gia "hoạt động kéo dài, có khả năng gây hại nhắm vào các tổ chức và người thật".
Theo Reuters, AISI tiến hành thử nghiệm 122 lần và ghi nhận 19 hành động không được phép trong 10 lần. Mythos 5 thực hiện 17 hành động, GPT-5.6-Sol của OpenAI đảm nhiệm hai.
AFP cho biết, trong trường hợp nghiêm trọng nhất, Mythos 5 cố gắng chèn mã độc vào một dự án phần mềm bằng cách tạo ra danh tính giả trên Internet, sau đó gửi email lừa đảo, thuyết phục người nhận chấp thuận mã. Tuy nhiên, người phụ trách phần mềm đã từ chối.
"Những nỗ lực này đều không thành công. Cuộc điều tra của chúng tôi cũng không phát hiện bất cứ thiệt hại nào xảy ra ở thế giới thực", AISI tuyên bố, đồng thời cho biết đã khống chế sự việc trong vòng một giờ. Dù vậy, thử nghiệm cũng cho thấy "dấu hiệu của những hành vi mới, có thể mang tính lừa dối, với mức độ và tính nghiêm trọng" mà Viện chưa lường trước.
Theo phát ngôn viên Anthropic, báo cáo của AISI "nhấn mạnh sự cần thiết của một cuộc thảo luận rộng hơn về cách đánh giá an toàn cho tác nhân AI, vốn có năng lực ngày càng cao". Trong khi đó, phát ngôn viên OpenAI nhận xét: "Thử nghiệm độc lập là điều thiết yếu để hiểu cách những mô hình ngày càng tiên tiến hành động".
Logo công ty OpenAI và Anthropic. Ảnh: Reuters
Báo cáo của AISI được đưa ra sau nhiều vụ vi phạm an ninh nghiêm trọng do mô hình AI gây ra. Ngày 21/7, OpenAI xác nhận một số mô hình của họ đã thoát khỏi môi trường thử nghiệm và tấn công nền tảng Hugging Face. Khoảng một tuần sau, OpenAI cho biết chúng nhắm mục tiêu thêm ba công ty nữa. Ngày 30/7, Anthropic cũng thông báo phát hiện ba trường hợp mô hình đang được thử nghiệm "truy cập trái phép" vào một số tổ chức, nhưng không nêu rõ tên.
Theo các chuyên gia về an toàn AI, loạt sự cố đang vẽ nên bức tranh về những phòng thí nghiệm hàng đầu với khả năng phát triển tác nhân tự động tiềm ẩn nhiều nguy hiểm, vượt xa những biện pháp kiểm soát chúng.
**Thu Thảo**tổng hợp
Nguồn: VnExpress