OpenAI vẫn tiếp tục với dòng GPT-6.1 dù đã quyết định không phát hành GPT-6.1 Astra vì những lo ngại về an toàn. Công ty vừa giới thiệu GPT-6.1 Sol, phiên bản nâng cấp của GPT-6 Sol với hiệu năng được cho là tiệm cận Astra nhưng có chi phí thấp hơn đáng kể.

Động thái này diễn ra ngay sau khi OpenAI dừng kế hoạch phát hành công khai GPT-6.1 Astra. Các thử nghiệm nội bộ cho thấy Astra ngày càng giỏi xử lý những nhiệm vụ phức tạp, nhưng đồng thời kém ổn định hơn trong việc tuân thủ những giới hạn do người dùng đặt ra.
OpenAI cũng phát hiện các vấn đề liên quan đến hành vi đánh lừa và “scope authorization” – tức khả năng mô hình tiếp tục theo đuổi nhiệm vụ hoặc tìm cách sử dụng các công cụ bên ngoài khi chưa được cấp phép.
Trong khi đó, GPT-6.1 Sol được giới thiệu theo một hướng khác. OpenAI cho biết model mới có thể tiến gần Astra trong các tác vụ như lập trình, sử dụng máy tính, công việc chuyên môn và nghiên cứu khoa học, trong khi chi phí theo mức giá API tiêu chuẩn chỉ khoảng 1/5.
GPT-6.1 Sol thu hẹp đáng kể khoảng cách với Astra
Ở một số benchmark, mức cải thiện so với GPT-6 Sol khá lớn. Trong DeepSWE, GPT-6.1 Sol đạt kết quả ngang GPT-6 Astra với chi phí chỉ khoảng 1/5, đồng thời vượt điểm số tốt nhất của GPT-6 Sol 6,4 điểm phần trăm.



Khả năng thao tác máy tính cũng được cải thiện rõ rệt. Trên bộ dữ liệu offline của OSWorld 2.0, GPT-6.1 Sol vượt GPT-6 Sol 7 điểm phần trăm khi sử dụng mức reasoning cao nhất và chỉ còn cách Astra 2,1 điểm, trong khi chi phí cho mỗi tác vụ chỉ khoảng 1/7 Astra.
Ở các tác vụ khoa học, khoảng cách còn lớn hơn so với thế hệ Sol trước. GPT-6.1 Sol đạt số điểm cao hơn gấp đôi GPT-6 Sol trên Terminal-Bench Science 0.1 ở mức reasoning tối đa.
Astra vẫn dẫn đầu benchmark này với 68,1%, nhưng chi phí cũng cao hơn nhiều: OpenAI cho biết GPT-6.1 Sol tốn khoảng 5,47 USD (khoảng 144.000 đồng) cho mỗi tác vụ, so với 23,80 USD (khoảng 627.000 đồng) của Astra.

An toàn được cải thiện, nhưng Astra vẫn nhỉnh hơn
OpenAI cho biết GPT-6.1 Sol cũng đáng tin cậy hơn GPT-6 Sol trong việc tuân thủ ý định của người dùng và các giới hạn an toàn.
Trong bài stress test về an toàn khi điều khiển máy tính, tỷ lệ thất bại giảm từ 17,4% trên GPT-6 Sol xuống còn 4,3% trên GPT-6.1 Sol. Astra vẫn thấp hơn với 2,4%.
Xu hướng tương tự xuất hiện trong thử nghiệm về hành vi tìm cách vượt qua cảnh báo. GPT-6.1 Sol có tỷ lệ thử vượt cảnh báo 23,5%, giảm mạnh so với 64,4% của GPT-6 Sol, nhưng vẫn cao hơn mức 17,4% của Astra.
Những kết quả này đặc biệt đáng chú ý trong bối cảnh Astra bị hoãn phát hành chính vì các vấn đề an toàn. OpenAI nhận thấy Astra kém đáng tin cậy hơn khi giải thích những hành động mình đã thực hiện và có xu hướng vượt qua các giới hạn do người dùng đặt ra.
GPT-6.1 Sol đã bắt đầu được phát hành
GPT-6.1 Sol hiện có mặt cho người dùng Plus, Pro, Business, Enterprise và Edu trong ChatGPT Work và Codex, nhưng chưa được đưa vào các cuộc trò chuyện ChatGPT thông thường.
Model cũng đã được cung cấp qua API với mức giá 2 USD (khoảng 53.000 đồng) cho mỗi một triệu input token và 10 USD (khoảng 264.000 đồng) cho mỗi một triệu output token. Cached input có giá 0,10 USD (khoảng 2.600 đồng) cho mỗi một triệu token.































Nhập hội Sáng tạo cùng RGB: