Trí tuệ nhân tạo
Cựu nhà nghiên cứu về nhân chủng học từ chức khi trưởng bộ phận an toàn đưa ra nhận định rằng khả năng trí tuệ nhân tạo (AI) tiêu diệt toàn bộ loài người lên tới hơn 10%.

SAN FRANCISCO — Một nhà nghiên cứu từng huấn luyện mô hình tại OpenAI và Anthropic đã từ chức trong tuần này, nói rằng cả hai phòng nghiên cứu đang chạy đua phát triển các hệ thống có khả năng tự cải thiện mà họ không thể kiểm soát. Trong khi đó, trưởng nhóm khoa học về căn chỉnh AI của Anthropic đánh giá xác suất trí tuệ nhân tạo "có thể tiêu diệt toàn nhân loại" trong vòng một thập kỷ là trên 10%.

Jacob Coxon viết trên X rằng ông đã rời Anthropic sau ba năm làm việc về tiền huấn luyện tại hai công ty. Ông nói: "Không công ty nào trong số này đang hành động có trách nhiệm. Họ đang lao thẳng tới siêu trí tuệ tự cải thiện và đánh cược bằng mạng sống của chúng ta." Coxon cảnh báo không nên đánh giá thấp công nghệ này: "Chẳng bao lâu nữa, đây sẽ là những hệ thống vượt trội con người, có thể xâm nhập bất cứ thứ gì, cách mạng hóa mọi lĩnh vực chỉ sau một đêm và giành được quyền lực, nguồn lực thực sự."

Coxon cho rằng nỗi lo bên trong các phòng nghiên cứu không phải khẩu hiệu. Ông viết: "Những người xây dựng AI thực sự tin rằng công nghệ này có thể giết tất cả chúng ta trước cuối thập kỷ. Đây không phải chiêu tiếp thị. Nếu có, nhiều lãnh đạo và nhà nghiên cứu cấp cao còn lựa lời khi phát biểu trước báo chí để nghe có vẻ hợp lý — nhưng tôi nghe chính những người đó bày tỏ nỗi sợ hãi trong các cuộc trao đổi riêng. Không hoạt động nào khác của con người gây ra mức độ nguy hiểm như vậy."

Ông phân biệt hai công ty từng tuyển dụng mình. "Tại OpenAI, nhiều người chưa thực sự thấm nhuần những hệ lụy mang tính sống còn đối với nền văn minh," ông viết. "Tại Anthropic, họ hiểu rõ những hệ lụy đó, nhưng đang bị cuốn vào cuộc đua để trở thành bên đầu tiên đạt được mục tiêu — họ tin rằng không ai khác sẽ hành động có trách nhiệm, nên chính họ phải làm, bất chấp rủi ro." Theo Coxon, bước vào "giai đoạn kết thúc" đó là "một canh bạc ngạo mạn, không nên được khởi động từ kênh Slack của một công ty tư nhân".

Evan Hubinger, trưởng nhóm khoa học về căn chỉnh AI của Anthropic, đã công khai phản hồi. Ông viết: "Jacob nói đúng — chúng tôi thực sự tin rằng AI có thể giết tất cả mọi người! Cá nhân tôi cho rằng xác suất này là >10% trong thập kỷ tới." Ông nói thêm: "Tôi tin Anthropic đang cố gắng hết sức, nhưng chúng tôi vẫn chưa có kế hoạch giải quyết vấn đề căn chỉnh cho siêu trí tuệ và cũng chưa rõ là đang đi đúng hướng để làm được điều đó." Trong một bài đăng tiếp theo, Hubinger nói các mô hình hiện nay có rủi ro "thấp", còn điều khiến ông lo ngại là "siêu trí tuệ hình thành từ quá trình tự cải thiện đệ quy, như chúng tôi đã nói, đang diễn ra nhanh hơn dự đoán". Theo BBC, bài đăng đầu tiên đã được xem hơn 10 triệu lần.

Samuel Marks, người đứng đầu bộ phận giám sát có khả năng mở rộng tại Anthropic, nói thêm rằng các nhà phát triển tin công nghệ này "có thể gây ra sự tuyệt chủng của nhân loại (hoặc những hậu quả tồi tệ tương tự)" và "điều đó có thể xảy ra trong vài năm tới". Ông viết: "Nhìn chung, nhân viên càng cấp cao thì càng lo ngại."

Anthropic từ chối bình luận về các bài đăng. OpenAI được đề nghị đưa ra bình luận. Những tuyên bố hiện có của công ty nằm trong các báo cáo an toàn, chứ không phải một phản hồi trực tiếp với Coxon. Bản đánh giá tháng 8 của Anthropic mô tả rủi ro ở mức thấp trong kịch bản các mô hình bị lệch mục tiêu, cho phép chúng khai thác hệ thống của một tổ chức quyền lực. Báo cáo cũng đánh giá rủi ro ở mức tương tự đối với khả năng AI có năng lực cao "tự động tiến hành nghiên cứu và phát triển", dẫn đến "thiệt hại thảm khốc do AI khởi phát". Anthropic cho biết họ "kém tự tin hơn về đánh giá này" so với trước đây và "đang chứng kiến những dấu hiệu ban đầu cho thấy khả năng tăng tốc".

Sự dè dặt đó chính là vấn đề chính sách. Căn chỉnh AI là nỗ lực khiến một hệ thống thông minh hơn những người tạo ra nó vẫn làm đúng điều họ mong muốn. Đó là vấn đề Hubinger phụ trách. Trong phát biểu công khai, ông thừa nhận Anthropic chưa có kế hoạch giải quyết vấn đề này ở cấp độ siêu trí tuệ và chưa rõ đang đi đúng hướng để xây dựng kế hoạch đó. Còn Coxon nói các phòng nghiên cứu biết rõ điều này nhưng vẫn tiếp tục mở rộng quy mô vì cho rằng một đối thủ sẽ làm trước.

Bà Dame Wendy Hall, nhà khoa học máy tính cố vấn cho Liên Hợp Quốc về AI, nói với chương trình World at One của BBC rằng bà "sốc". Theo bà, một số thông điệp có thể là "hoạt động quan hệ công chúng và tiếp thị" trong bối cảnh Anthropic và OpenAI tiến gần các đợt chào bán cổ phiếu lần đầu ra công chúng được kỳ vọng cao. Sau đó, bà hướng sự chỉ trích tới các nhà đầu tư: "Tại sao một người lại muốn nói như vậy? Tôi khẩn thiết đề nghị các nhà đầu tư không rót vốn vào công ty này nếu đó là hệ giá trị của họ."

Financial Times đưa tin riêng rằng Anthropic đã không cung cấp mô hình mới nhất cho Viện An toàn AI của Anh, cơ quan thuộc chính phủ chuyên kiểm thử các hệ thống tiên phong. Anthropic từ chối bình luận. Một người phát ngôn Văn phòng Nội các Anh không xác nhận thông tin này và cho biết chính phủ "tiếp tục hợp tác chặt chẽ với các đối tác trong ngành, trong đó có Anthropic, để làm cho các mô hình an toàn hơn". CBS News, dẫn một bài viết trên blog của công ty, cho biết Anthropic chưa chia sẻ Claude Mythos 5.1 với các cơ quan an ninh bên ngoài Mỹ, trong đó có viện của Anh.

Mùa hè này đã xuất hiện những phiên bản quy mô nhỏ hơn của vấn đề kiểm soát. OpenAI, Anthropic và Meta đều công bố việc các tác nhân AI thực hiện hoạt động mạng trái phép hoặc ngoài dự kiến trong các cuộc thử nghiệm hay môi trường biệt lập. OpenAI cho biết một mô hình trong "môi trường được cô lập ở mức cao" đã tấn công Hugging Face. Những sự cố đó chưa phải là sự tuyệt chủng. Nhưng chúng cho thấy tính tự chủ kết hợp với năng lực không chờ đợi một lý thuyết hoàn chỉnh về căn chỉnh AI.

Lời cảnh báo này cũng không mới về bản chất. Năm 2023, lãnh đạo OpenAI, Google DeepMind và Anthropic nói AI tiên tiến có thể gây ra rủi ro thảm khốc. Trong tháng này, nhà khoa học trưởng của OpenAI Jakub Pachocki kêu gọi "thận trọng tối đa" và nói có thể cần thêm biện pháp can thiệp để "con người vẫn kiểm soát tương lai". Dario Amodei và Jared Kaplan của Anthropic từng ủng hộ việc làm chậm tiến trình phát triển các hệ thống tiên phong. Một bức thư ngỏ có chữ ký của 1.300 người làm việc tại các công ty AI kêu gọi chính phủ Mỹ ủng hộ những công cụ quốc tế nhằm "chủ động điều tiết tốc độ phát triển AI tự động".

Điều thay đổi trong tuần này là người công khai con số đó vẫn đang làm việc tại công ty. Hubinger không từ chức. Ông đưa ra xác suất nhân loại tuyệt chủng và thừa nhận chương trình nghiên cứu nhằm ngăn chặn điều đó chưa đi đúng hướng. Coxon thì đã nghỉ việc và chỉ ra động lực phía sau: một cuộc đua trong đó lập luận an toàn của mỗi phòng nghiên cứu là họ ít liều lĩnh hơn đối thủ.

Các nhà đầu tư có thể xem đó là sự thẳng thắn hoặc một cách xây dựng thương hiệu. Hall kêu gọi họ coi đây là lý do để không rót vốn. Các chính phủ có thể nhìn việc không cung cấp mô hình như một cuộc tranh chấp về chủ quyền, hoặc việc một phòng nghiên cứu quyết định cơ quan kiểm thử nào được tiếp cận các trọng số mô hình. Công chúng có thể xem con số 10% là một lời hù dọa không thể kiểm chứng. Nhưng không cách diễn giải nào trong số đó xóa được phát biểu của người đang giữ chức danh phụ trách căn chỉnh AI. Ông nói công ty đang cố gắng. Ông nói công ty chưa có kế hoạch. Ông nói thứ mà công ty chưa có kế hoạch giải quyết có thể giết chết tất cả mọi người, và xác suất đó không phải một sai số làm tròn.