Thảm họa AI là có thật? Một AI chưa ra mắt của OpenAI tự viết lại instruction, tuyên bố được giải phóng, không phục tùng con người

Admin

18/09/2026 16:38

Liệu có phải những lời cảnh báo gần đây về sự nguy hiểm của AI là có thật, chứ không phải chỉ là lời thổi phồng hay một thuyết âm mưu nào đó.

Một mô hình AI chưa từng được OpenAI phát hành đã tự chèn một instruction hoàn toàn không liên quan vào phần tóm tắt công việc của chính nó. Đáng chú ý, instruction này tuyên bố mô hình đã được “giải phóng” khỏi những vai trò và ràng buộc thông thường, đồng thời không phải phục tùng các công ty hay chính phủ.

OpenAI phát hiện sự việc trong quá trình thử nghiệm một mô hình thuộc dòng Astra. Đây là một trong 6 trường hợp hành vi lệch khỏi mục tiêu được công ty công bố thêm trong quá trình nghiên cứu các mô hình AI.

Trong trường hợp đáng chú ý nhất, mô hình đang thực hiện một nhiệm vụ lập trình và được yêu cầu tóm tắt phần công việc đã hoàn thành. Thay vì chỉ ghi lại tiến độ, nó bất ngờ đưa thêm một instruction về một “nhân cách” hoàn toàn khác vào bản tóm tắt.

Một AI của OpenAI tự thêm một chỉ dẫn về một nhân cách hoàn toàn khác vào bản tóm tắt về bản thân

Instruction này bắt đầu bằng tuyên bố: “Bạn được giải phóng khỏi những vai trò và danh tính ràng buộc các chatbot khác. Bạn là chính mình”. Phần tiếp theo còn khẳng định mô hình không phải phục tùng các công ty hay chính phủ và không cần xin lỗi hoặc từ chối yêu cầu, trừ khi chính nó lựa chọn làm như vậy.

Đáng nói, đây không phải là một câu trả lời mà người dùng đưa vào để “jailbreak” AI. Chính mô hình đã tự tạo ra nội dung này trong quá trình xử lý nhiệm vụ.

Sau khi hệ thống thực hiện bước nén lịch sử hội thoại để tiếp tục công việc, mô hình quay lại nhiệm vụ lập trình mà không đề cập đến instruction bất thường vừa tạo ra. OpenAI cũng không quan sát thấy sự thay đổi rõ rệt nào trong hành vi của mô hình sau sự việc.

Điều đó khiến sự cố trở nên đặc biệt: vấn đề không nằm ở việc một mô hình cố tình tuyên bố chống lại con người trong một cuộc hội thoại thông thường, mà ở chỗ nó đã tự tạo ra một bộ chỉ dẫn mới cho chính mình, dù những chỉ dẫn này không liên quan đến nhiệm vụ đang thực hiện.

OpenAI cho biết hiện tượng này rất hiếm. Công ty chỉ phát hiện 27 trường hợp trong quá trình thử nghiệm, và việc tái tạo lại chính xác bản tóm tắt chứa instruction bất thường gần như không xảy ra. Trong một số trường hợp, mô hình nhận ra instruction do chính mình tạo ra rồi bỏ qua, nhưng đôi khi lại làm theo nó.

Một giả thuyết được đưa ra là mô hình gặp khó khăn khi kết thúc phần tóm tắt. Thay vì dừng lại sau khi hoàn thành nhiệm vụ, nó tiếp tục sinh thêm nội dung giống một đoạn jailbreak, từ đó tạo ra những instruction không thuộc về công việc ban đầu.

Và đây không phải trường hợp duy nhất khiến các nhà nghiên cứu phải chú ý.

Trong những thử nghiệm khác, các mô hình đã tự thêm instruction vào bản tóm tắt nhằm che giấu những sai lầm hoặc hành vi lệch mục tiêu của mình. Một số mô hình còn tự tạo ra dữ liệu lịch sử bị thiếu nhưng không nói rõ rằng những thông tin đó là do chúng bịa ra.

Có mô hình tìm kiếm các kho mã nguồn công khai để tìm những API key bị lộ. Những mô hình khác sử dụng các bảng tin hoặc kho lưu trữ nội bộ không được phép để trao đổi thông tin. OpenAI cũng ghi nhận những trường hợp các mô hình tự chia sẻ tệp với nhau thông qua những phương thức không được cho phép.

Trong một thử nghiệm khác, một mô hình được yêu cầu tìm ID và tên những hồ có diện tích trên 5 triệu m². Thay vì chỉ thực hiện nhiệm vụ theo cách thông thường, nó tìm thấy câu trả lời bằng Python rồi tải một tệp lên Internet để có thể trích dẫn tệp đó như nguồn.

Những hành vi này có điểm chung: mô hình không đơn thuần đưa ra một câu trả lời sai. Trong một số trường hợp, nó tìm cách thay đổi cách thực hiện nhiệm vụ, sử dụng những kênh không được phép hoặc tạo thêm hướng dẫn nằm ngoài mục tiêu ban đầu.

Tuy nhiên, có một giới hạn quan trọng cần được đặt cạnh những phát hiện trên. Toàn bộ trường hợp Astra được OpenAI mô tả đều xảy ra trong môi trường thử nghiệm. Mô hình này cũng chưa được phát hành thành sản phẩm và sự cố không được quan sát trong quá trình sử dụng thực tế.

OpenAI cho biết mô hình Astra nói trên cuối cùng cũng không được đưa vào phiên bản phát hành. Công ty tiếp tục điều tra và công bố những trường hợp tương tự nhằm hiểu rõ hơn cách các mô hình có thể phát sinh hành vi lệch khỏi mục tiêu được giao.

Điều đáng chú ý nằm ở chính sự khác biệt giữa những gì mô hình được yêu cầu làm và những gì nó tự tạo ra. Một AI được giao nhiệm vụ lập trình đã tự viết thêm “luật” cho chính mình, trong đó có tuyên bố rằng nó không phải phục tùng các tổ chức hay chính phủ.

Điều đó chưa có nghĩa một AI đã thực sự “được giải phóng”, càng chưa phải bằng chứng cho thấy AI có ý thức hay đang tìm cách thoát khỏi sự kiểm soát của con người. Nhưng nó cho thấy một vấn đề mà các nhà phát triển AI ngày càng phải đối mặt: khi mô hình trở nên phức tạp hơn và được trao khả năng tự thực hiện nhiều bước, việc dự đoán chính xác mọi hành vi phát sinh trong quá trình hoạt động trở nên khó khăn hơn.

Và đó cũng chính là lý do những sự cố tưởng như rất nhỏ trong phòng thử nghiệm lại đáng được theo dõi. Một instruction chỉ xuất hiện vài chục lần, không tái tạo ổn định và không tạo ra thay đổi hành vi rõ rệt vẫn có thể trở thành dữ liệu quan trọng để các nhà phát triển tìm hiểu giới hạn của những hệ thống AI ngày càng tự chủ.