Nhà nghiên cứu Jacob Coxon của tổ chức Anthropic thảo luận về những lo ngại liên quan đến an toàn của trí tuệ nhân tạo.
Nhà nghiên cứu Jacob Coxon của công ty Anthropic đã từ chức sau khi cảnh báo rằng sự cạnh tranh giữa các phòng thí nghiệm AI hàng đầu có thể vượt quá khả năng bảo vệ được thiết kế để quản lý các rủi ro của AI tiên tiến.

Nhà nghiên cứu Jacob Coxon đã rời công ty AI Anthropic, cảnh báo cuộc đua xây dựng các hệ thống ngày càng mạnh đang diễn ra nhanh hơn khả năng theo kịp của những biện pháp bảo đảm an toàn. Coxon thông báo từ chức vào thứ ba, ngày 8/9.

Cựu nghiên cứu viên Anthropic cảnh báo sự cạnh tranh giữa các phòng thí nghiệm AI hàng đầu đang thúc đẩy các công ty phát triển những hệ thống ngày càng mạnh, đồng thời cáo buộc họ "đang đánh cược với sinh mạng chúng ta".

Coxon, người đã có 3 năm nghiên cứu giai đoạn tiền huấn luyện tại OpenAI và Anthropic, cho biết ông sẽ rời hẳn ngành AI vì không còn tin rằng từng công ty riêng lẻ có thể quản lý một cách có trách nhiệm những rủi ro gắn với các hệ thống ngày càng có năng lực.

Vì sao Jacob Coxon rời Anthropic

Mối lo ngại của Coxon tập trung vào khả năng xuất hiện trí tuệ nhân tạo có thể tự cải thiện: những hệ thống giả định có khả năng tự nâng cao năng lực và cuối cùng vượt con người trong nhiều loại nhiệm vụ.

Trao đổi với The Wall Street Journal, Coxon cho rằng những kịch bản quyết liệt nhất có thể khiến quá trình phát triển AI "mất kiểm soát" vào cuối năm 2027. Đây là đánh giá của cá nhân ông, không phải dự báo chính thức của ngành.

Những nhận định trên phản ánh đánh giá của Coxon về hướng đi của quá trình phát triển AI. Chúng không chứng minh rằng siêu trí tuệ tự cải thiện sẽ xuất hiện theo mốc thời gian đó, cũng không cho thấy các hậu quả thảm khốc là điều chắc chắn xảy ra.

Các bài đăng của Jacob Coxon trên X ngày 9 tháng 9 năm 2026.

Coxon cho rằng cạnh tranh AI đang làm suy yếu an toàn

Những chỉ trích của Coxon không có nghĩa Anthropic đã từ bỏ nghiên cứu an toàn AI.

Thay vào đó, ông cho rằng cạnh tranh giữa các công ty như Anthropic và OpenAI tạo sức ép buộc họ tiếp tục phát triển những mô hình có năng lực cao hơn, ngay cả khi các nhà nghiên cứu nhận thấy những rủi ro tiềm ẩn nghiêm trọng.

Coxon cho biết theo kinh nghiệm của ông, các rủi ro này đã được Anthropic "hiểu rất rõ", trong khi nhiều người tại OpenAI chưa thực sự nhận thức đầy đủ về điều ông coi là những hệ lụy ở quy mô nền văn minh.

Ông kêu gọi các nhà phát triển AI tăng cường phối hợp và cho rằng để ngăn một cuộc đua toàn cầu mất kiểm soát, cuối cùng có thể cần đến các biện pháp như tạm dừng việc tiếp tục nâng cao năng lực của hệ thống.

Đề xuất này hiện vẫn là quan điểm của Coxon, chưa phải tiêu chuẩn được toàn ngành thống nhất.

Nhà nghiên cứu Anthropic lặp lại những cảnh báo rộng hơn về rủi ro AI

Việc Coxon từ chức thu hút thêm sự chú ý sau khi Evan Hubinger, trưởng nhóm khoa học về căn chỉnh AI tại Anthropic, công khai bày tỏ những lo ngại tương tự về các hệ thống AI tiên tiến.

Hubinger cho biết đánh giá cá nhân của ông là xác suất AI gây ra sự tuyệt chủng của loài người trong thập kỷ tới cao hơn 10%. Ông cũng nói Anthropic đang thực sự nỗ lực giải quyết các rủi ro về căn chỉnh, nhưng hiện chưa có giải pháp rõ ràng để kiểm soát một hệ thống siêu trí tuệ trong tương lai.

Con số này là đánh giá rủi ro cá nhân của Hubinger, không phải xác suất đã được chứng minh hay dự báo chính thức của Anthropic.

Các chuyên gia vẫn chia rẽ sâu sắc về cả khả năng xảy ra những kịch bản trên lẫn tốc độ xuất hiện của các hệ thống siêu trí tuệ. Một số chuyên gia an toàn AI cho rằng tốc độ cải thiện năng lực nhanh chóng khiến việc chuẩn bị cho những hậu quả có thể thảm khốc là cần thiết, trong khi những người hoài nghi nhận định các dự đoán về siêu trí tuệ sắp xuất hiện vẫn rất thiếu chắc chắn.

Bất đồng này cho thấy một trong những thách thức cốt lõi của tranh luận về an toàn AI: hậu quả tiềm tàng có thể vô cùng lớn, nhưng khả năng xảy ra và thời điểm xuất hiện vẫn rất khó đo lường.

Việc Coxon từ chức có ý nghĩa gì với tranh luận về an toàn AI?

Việc Coxon rời đi không chứng minh AI đang tiến gần đến ngưỡng mất kiểm soát hoặc đe dọa sự tồn vong của nhân loại.

Tuy nhiên, đây là thêm một lời kể từ người trong cuộc cho thấy một số nhà nghiên cứu đang xây dựng các hệ thống AI tiên phong tin rằng rủi ro nghiêm trọng đến mức họ phải cân nhắc lại việc tiếp tục tham gia ngành này.

Cảnh báo của Coxon cũng đặt ra câu hỏi chính sách rộng hơn: liệu các biện pháp bảo đảm an toàn mang tính tự nguyện do từng công ty triển khai có đủ hiệu quả hay không, khi chính những doanh nghiệp này chịu sức ép thương mại và cạnh tranh đáng kể phải đưa ra các mô hình có năng lực cao hơn.

Với các nhà hoạch định chính sách và toàn ngành công nghệ, vấn đề chưa được giải quyết là liệu có nên áp dụng các quy định chặt chẽ hơn hoặc những giới hạn được phối hợp trước khi các hệ thống AI mạnh hơn xuất hiện, thay vì chờ đến khi hậu quả của chúng trở nên rõ ràng.

Hiện tại, việc Coxon từ chức bổ sung thêm một tiếng nói nổi bật từ nội bộ vào cuộc tranh luận ngày càng công khai về việc các công ty phát triển AI tiên tiến có nên tự chịu trách nhiệm đặt ra giới hạn cho mình, hay chính phủ và các tổ chức quốc tế cần đóng vai trò lớn hơn trong việc quyết định cuộc đua này nên đi xa đến đâu.

Tại thời điểm bài viết được đăng, cả Anthropic và OpenAI đều chưa công khai phản hồi các cáo buộc của Coxon.