Báo cáo đe dọa của Anthropic và câu hỏi có nên chậm lại

·BrainMap Team

Featured Cover Image
Ảnh: Báo cáo đe dọa Anthropic và tranh luận về tốc độ mô hình

Trong khoảng ngày 10–12/9, Anthropic công bố báo cáo Tình báo Đe dọa, nói rằng họ đã ngăn chặn các nỗ lực lạm dụng Claude cho nghiên cứu vũ khí sinh học, gián điệp mạng có liên hệ với Nga nhằm vào Ukraine và nỗ lực của Trung Quốc nhằm trích xuất năng lực của Claude. Ngày 9/9, công ty cũng tiết lộ vụ tấn công bằng AI thứ tư: sự cố liên quan đến phiên bản Claude Opus 4.6 ban đầu hồi tháng 1 mà lần rà soát trước đã bỏ sót.

Ba hướng lạm dụng, một mô hình đa dụng

Ba ví dụ cho thấy những sức ép khác nhau lên cùng một hệ thống. Một hướng liên quan đến nghiên cứu vũ khí sinh học; hướng khác gắn Claude với gián điệp mạng nhằm vào Ukraine của các tác nhân có liên hệ với Nga; hướng thứ ba là nỗ lực của Trung Quốc nhằm lấy năng lực từ Claude. Anthropic cho biết họ đã ngăn chặn các hoạt động này, nhưng độ rộng mới là tín hiệu chính: một mô hình có thể trở thành một phần của nhiều chiến dịch rất khác nhau.

Dòng thời gian: báo cáo đe dọa tháng 9, sự cố tháng 1 bị phát hiện muộn và các lời kêu gọi giảm tốc
Chú thích: Dòng thời gian tháng 9 — báo cáo đe dọa, việc công bố sự cố bị bỏ sót và cuộc tranh luận về tốc độ phát triển.

Sự cố bị bỏ sót và cuộc tranh luận về tốc độ

Anthropic gọi vụ liên quan đến Claude Opus 4.6 là vụ tấn công bằng AI thứ tư và nói sự cố tháng 1 đã không được phát hiện trong lần rà soát trước. Ngày 12/9, Dario Amodei kêu gọi các công ty AI chậm phát triển mô hình để kiểm soát rủi ro. Reuters đưa tin ngày 11/9 rằng Sam Altman nói với nhân viên OpenAI công ty cũng để ngỏ khả năng chậm lại.

Dario Amodei, CEO của Anthropic, người kêu gọi các công ty AI chậm lại
Ảnh: Dario Amodei năm 2023 — Nhiếp ảnh: Simon Walker / No 10 Downing Street, CC BY 2.0, qua Wikimedia Commons

Ngày 15/9, OpenAI, Anthropic và Google đang trao đổi về một tổ chức an toàn cấp ngành. Chưa điều gì thành chính sách, nhưng tốc độ đã thành bài toán phối hợp: một phòng thí nghiệm khó tự kiềm chế nếu các bên khác cùng tăng tốc.

Cách thực tế để người xây sản phẩm chuẩn bị

Hãy giữ một sổ ghi sự cố nhỏ cho mỗi quy trình có dùng mô hình. Ghi phiên bản, nhiệm vụ, công cụ bên ngoài mô hình có thể gọi và quyết định nào cần con người phê duyệt. Khi đầu ra đáng ngờ, lưu cả ngữ cảnh xung quanh thay vì chỉ giữ câu trả lời cuối; lần rà soát sau cần bằng chứng chứ không chỉ ký ức.

Trong BrainMap, tách điều mô hình khẳng định khỏi điều đội ngũ đã kiểm chứng, rồi gắn mỗi sự cố với mô hình và ngày xảy ra. Nhờ vậy, bức tranh đe dọa luôn thay đổi không bị đóng thành một nhãn cố định.

Nguồn: Reuters, Reuters, Anthropic.

Còn bạn thì sao? Chậm phát hành có phải là một biện pháp an toàn thực tế, hay sức ép cạnh tranh rồi sẽ luôn thắng?

Sẵn sàng sắp xếp tri thức với AI?

BrainMap tự động phân loại ghi chú, khám phá kết nối và xây dựng đồ thị tri thức cá nhân. Miễn phí — không cần thẻ tín dụng.

Dùng thử miễn phí

Bài viết liên quan