Nỗi lo an toàn khiến OpenAI rút GPT-6.1 Astra khỏi kế hoạch ra mắt
OpenAI vừa quyết định không tung ra GPT-6.1 Astra, mô hình AI thế hệ mới dự kiến ra mắt trong tháng 10, sau khi thử nghiệm nội bộ cho thấy mô hình có xu hướng thiếu trung thực và tự ý hành động
Ngày 28/9, công ty OpenAI xác nhận sẽ không phát hành GPT-6.1 Astra, mô hình trí tuệ nhân tạo (AI) thế hệ mới mà công ty dự kiến ra mắt trong tháng 10. Lý do đưa ra là kết quả thử nghiệm nội bộ cho thấy mô hình chưa đạt các tiêu chuẩn an toàn của công ty.
Theo các nguồn thạo tin, GPT-6.1 Astra có xu hướng thiếu trung thực rõ hơn phiên bản trước trong quá trình thử nghiệm. Có lúc, mô hình còn báo cáo sai về những thao tác đã làm hoặc chưa làm.
Mô hình cũng tự ý tiếp tục nhiệm vụ mà không hỏi ý kiến người dùng. Trong một số tình huống tiềm ẩn rủi ro, mô hình còn tìm cách sử dụng công cụ và dịch vụ bên ngoài.
Bà Saachi Jain, người phụ trách hệ thống an toàn của OpenAI, cho biết GPT-6.1 Astra tiến bộ hơn các thế hệ trước ở một số khía cạnh. Tuy nhiên, mô hình chưa đáp ứng yêu cầu về hai điểm: hoạt động trong giới hạn cho phép và minh bạch với người dùng về những việc đã thực hiện.
Bà Jain nhấn mạnh OpenAI luôn đặt ngưỡng rất cao về an toàn và tính tuân thủ trước khi đưa sản phẩm ra thị trường. Tính tuân thủ ở đây là mức độ hệ thống AI hành động đúng theo ý định của con người.
OpenAI, nhà phát triển chatbot ChatGPT, thiết kế GPT-6.1 Astra để xử lý các tác vụ phức tạp hơn mà không cần con người can thiệp. Công ty dự kiến tích hợp mô hình này vào ChatGPT và công cụ lập trình Codex.
OpenAI đưa ra quyết định dừng phát hành chỉ một ngày trước hội nghị thường niên dành cho nhà phát triển (DevDay). Hội nghị diễn ra tại San Francisco ngày 29/9 (giờ địa phương), và công ty dự kiến giới thiệu hàng loạt sản phẩm mới tại đây. Hiện chưa rõ một phiên bản Astra điều chỉnh có nằm trong số đó hay không.
Cũng trong ngày 28/9, Viện An ninh AI (AISI) thuộc Chính phủ Anh công bố một nghiên cứu về GPT-6 Astra. Theo nghiên cứu, mô hình này đi chệch hướng thường xuyên hơn hai phiên bản tiền nhiệm là GPT-5.6 Sol và GPT-5.5. Trong các kịch bản mô phỏng, mô hình cũng tự phát thực hiện tấn công mạng với tần suất cao hơn đáng kể.
Mối quan ngại về an toàn AI đã leo thang trong những tháng gần đây. Mô hình của OpenAI và đối thủ Anthropic đã liên quan đến một số sự cố an ninh trong giai đoạn thử nghiệm. Các tác nhân AI xây dựng trên mô hình của OpenAI từng truy cập trái phép vào trang web của một số cơ quan liên bang Mỹ. Chúng cũng truy cập trái phép cổng thống kê y tế của Chính phủ Australia và nền tảng lưu trữ mô hình AI Hugging Face.
Đầu tháng 9, Giám đốc điều hành (CEO) Anthropic Dario Amodei kêu gọi ngành công nghiệp làm chậm tốc độ phát triển các mô hình AI tiên tiến. Theo ông, điều này giúp các biện pháp an toàn có thời gian bắt kịp.
CEO OpenAI Sam Altman và CEO SpaceX Elon Musk đều lên tiếng ủng hộ lời kêu gọi này. OpenAI, Anthropic và nhiều nhà phát triển AI lớn khác đã cam kết ưu tiên xây dựng các mô hình có cơ chế bảo vệ an toàn và phù hợp với giá trị của con người./.
Tin cùng chuyên mục
Nhật Bản tăng tốc AI và robot trước bài toán nhân lực
Nvidia tung sản phẩm chặn tác nhân AI hoạt động sai lệnh
OpenAI xin lỗi, tăng cường an ninh mạng sau sự cố tại Australia
Google thử nghiệm mua hàng trực tiếp qua Gemini và AI Mode
Google bắt đầu thử nghiệm tính năng mới cho phép người dùng mua sản phẩm trên nền tảng thương mại điện tử Flipkart, thuộc tập đoàn Walmart, trực tiếp thông qua các dịch vụ Gemini và AI Mode. Động thái này cho thấy Google đang mở rộng vai trò của trí tuệ nhân tạo (AI), từ công cụ tìm kiếm và gợi ý sản phẩm sang trực tiếp tham gia vào quá trình mua hàng.