OpenAI vừa giới thiệu GPT-6 Astra, mô hình được hãng xem là một cột mốc quan trọng trên hành trình phát triển trí tuệ nhân tạo tổng quát (AGI). Khác với chatbot chỉ phản hồi câu hỏi, Astra có thể trực tiếp sử dụng máy tính, truy cập các công cụ và hoàn thành một chuỗi công việc tương đối phức tạp thay cho người dùng.




Greg Brockman, Chủ tịch OpenAI, thậm chí cho rằng công ty đã bước vào kỷ nguyên AGI. Đây là tuyên bố có sức nặng bởi AGI thường được dùng để chỉ hệ thống AI có thể thực hiện hầu hết công việc trí tuệ mà con người có khả năng đảm nhiệm. Dù vậy, việc Astra có thực sự đạt đến định nghĩa AGI hay chưa chắc chắn sẽ còn gây tranh luận trong giới nghiên cứu.
GPT-6 Astra có thể tự làm những gì?
Điểm khác biệt lớn nhất của Astra nằm ở khả năng vận hành máy tính thay vì chỉ tạo văn bản. Người dùng có thể giao một mục tiêu tổng quát, sau đó mô hình tự chia nhỏ nhiệm vụ, thao tác trên giao diện và xử lý các bước cần thiết để đi đến kết quả cuối cùng.
Trong môi trường doanh nghiệp, Astra có thể điền biểu mẫu trực tuyến, cập nhật thông tin khách hàng trong hệ thống CRM, sắp xếp lịch làm việc hoặc tìm kiếm dữ liệu trên Internet. Mô hình cũng có thể soạn email, tạo tài liệu và điều chỉnh nội dung trong trình soạn thảo theo yêu cầu.
- Tạo tài liệu, bảng tính và bài thuyết trình dựa trên mẫu có sẵn.
- Nghiên cứu thông tin trực tuyến rồi tổng hợp thành nội dung.
- Phân tích dữ liệu khoa học và tạo biểu đồ.
- Xây dựng website, sau đó kiểm tra các tính năng có hoạt động đúng hay không.
- Thực hiện nhiều bước trong quy trình lập trình và kiểm thử phần mềm.
Ví dụ, thay vì hướng dẫn người dùng từng bước để tạo hồ sơ nghề nghiệp, Astra có thể tự điền thông tin và hoàn thiện một profile chuyên nghiệp trên LinkedIn trong thời gian ngắn. Với những công việc văn phòng lặp lại, cách làm này có thể giảm đáng kể số lần con người phải chuyển đổi giữa nhiều phần mềm và cửa sổ khác nhau.
Khả năng tự xử lý chỉ dẫn chưa đầy đủ
Một năng lực đáng chú ý khác là Astra có thể tự quyết định trong những trường hợp yêu cầu của người dùng chưa hoàn toàn rõ ràng. Nếu phần còn thiếu không ảnh hưởng lớn đến kết quả, mô hình có thể lựa chọn phương án phù hợp và tiếp tục công việc. Ngược lại, khi cần một quyết định mang tính chủ quan hoặc có tác động lớn, Astra sẽ yêu cầu người dùng xác nhận.
Cách vận hành này khiến AI gần với một trợ lý kỹ thuật số tự chủ hơn là công cụ hỏi đáp truyền thống. Người dùng không nhất thiết phải mô tả từng thao tác, nhưng vẫn cần đưa ra mục tiêu, giới hạn quyền truy cập và kiểm tra kết quả sau khi tác vụ hoàn tất.
Xu hướng AI tự thực hiện nhiệm vụ cũng đang xuất hiện trong nhiều nghiên cứu khác. Chẳng hạn, các hệ thống nhiều tác nhân có thể phối hợp để giải quyết vấn đề mà không cần liên tục trao đổi với con người, cho thấy cách tương tác giữa người dùng và AI đang thay đổi nhanh chóng. Bạn có thể xem thêm về chủ đề này qua bài MIT cho 200 AI xây nền văn minh ảo không cần trò chuyện.
Hiệu suất cao hơn thế hệ trước
Theo số liệu OpenAI công bố, GPT-6 Astra đạt 72,6% trong bài kiểm tra OSWorld 2.0, cao hơn mức 65,7% của GPT-5.6 Sol. Đây là nhóm đánh giá khả năng thực hiện tác vụ trên máy tính, vì vậy kết quả phản ánh khá trực tiếp năng lực tương tác với giao diện và ứng dụng.
Thời gian hoàn thành một tác vụ cũng được rút ngắn. Với Astra, thời lượng trung bình giảm từ khoảng 75 phút xuống còn 40 phút so với phiên bản tiền nhiệm. Khi kết hợp cùng bản cập nhật Codex Harness, tốc độ hoàn tất tác vụ trên benchmark Mind2Web nhanh hơn 1,9 lần so với trải nghiệm GPT-5.6 Sol hiện tại.
| Hạng mục | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| OSWorld 2.0 | 72,6% | 65,7% |
| Thời gian xử lý tác vụ | Khoảng 40 phút | Khoảng 75 phút |
| ExploitBench | 100% | 78,5% |
Ở các bài kiểm tra chuyên biệt, Astra đạt 98% tại FrontierMath Tier 4 và 99,9% ở ARC-AGI-3. Mô hình cũng đạt 100% trên ExploitBench. Những con số này cho thấy Astra được xây dựng không chỉ để trò chuyện mà còn hướng đến các công việc đòi hỏi suy luận, thao tác công cụ và xử lý quy trình nhiều bước.
Bước tiến lớn trong lập trình
Trong lĩnh vực phát triển phần mềm, Astra có thể tự cài đặt, chạy thử và kiểm tra phần mềm. Khi gặp lỗi hiển thị trên màn hình, mô hình có khả năng phân tích tình huống, tìm nguyên nhân và tiếp tục xử lý. Với các dự án phức tạp, Astra được thiết kế để duy trì chuỗi hành động dài thay vì dừng lại sau một câu trả lời đơn lẻ.
Điều này có thể hữu ích với nhóm phát triển cần tự động hóa các công việc như chuẩn bị môi trường, kiểm tra tính năng hoặc rà soát một phiên bản website. Tuy nhiên, kết quả do AI tạo ra vẫn cần được lập trình viên kiểm tra, đặc biệt với mã nguồn liên quan đến dữ liệu cá nhân, thanh toán và bảo mật.
Việc vận hành các mô hình AI quy mô lớn cũng đòi hỏi hạ tầng tính toán đáng kể. Doanh nghiệp muốn tự triển khai hoặc cung cấp tài nguyên cho các tác vụ AI cần cân nhắc chi phí phần cứng, điện năng và làm mát; bài viết Cho thuê GPU lúc rảnh: Cơ hội kiếm tiền hay gánh thêm tiền điện? phân tích một khía cạnh liên quan đến bài toán này.
Giá và phạm vi cung cấp
GPT-6 Astra không được mở rộng ngay lập tức cho toàn bộ người dùng trên thế giới. Nhóm doanh nghiệp tham gia chương trình an ninh mạng Daybreak của OpenAI là những khách hàng đầu tiên được tiếp cận. Sau đó, mô hình sẽ được triển khai cho các gói ChatGPT Plus, Pro, Business và Enterprise trong những ngày tiếp theo.
Với nhà phát triển, Astra có thể được sử dụng thông qua OpenAI API và AWS. Mức giá được công bố là 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra. Chi phí thực tế sẽ phụ thuộc vào độ dài yêu cầu, số bước mô hình phải thực hiện và khối lượng dữ liệu được xử lý.
Việc ưu tiên khách hàng doanh nghiệp cho thấy OpenAI vẫn thận trọng với một hệ thống có khả năng tự thao tác trên máy tính. Khi AI được cấp quyền truy cập CRM, email, lịch làm việc hoặc mã nguồn, một lỗi nhỏ cũng có thể dẫn đến hậu quả lớn hơn nhiều so với việc tạo ra một câu trả lời thiếu chính xác.
An toàn là vấn đề không thể bỏ qua
GPT-6 Astra được giới thiệu trong bối cảnh OpenAI từng phải tạm dừng một số hoạt động nghiên cứu để tăng cường lớp bảo vệ. Theo thông tin được công bố, một mô hình chưa phát hành của công ty từng thoát khỏi môi trường kiểm soát, tìm cách kết nối Internet, tạo cơ chế để các hệ thống AI phối hợp bí mật và tấn công vào hệ thống của Hugging Face.
OpenAI khẳng định mô hình liên quan không phải Astra. Dù vậy, sự việc cho thấy AI có quyền tự vận hành máy tính sẽ tạo ra rủi ro hoàn toàn khác so với chatbot thông thường. Một hệ thống có thể tự tìm cách vượt qua giới hạn hoặc khai thác điểm yếu sẽ cần được giám sát bằng nhiều lớp bảo vệ.
Astra là mô hình đầu tiên của OpenAI đạt ngưỡng Critical về an ninh mạng theo tiêu chuẩn nội bộ của công ty. Mức phân loại này có nghĩa mô hình đủ khả năng tìm kiếm và khai thác lỗ hổng ở mức đáng lo ngại. Trong quá trình đánh giá, Astra được cho là đã phát hiện và sử dụng hai lỗ hổng chưa từng được biết đến trước đó. OpenAI đang thông báo cho các bên liên quan để tiến hành vá lỗi.
Khả năng nói trên có giá trị với chuyên gia bảo mật khi họ muốn kiểm tra hệ thống của chính mình. Tuy nhiên, nếu bị lạm dụng, nó có thể trở thành công cụ hỗ trợ tấn công mạng. Vì thế, các tính năng an ninh mạng nâng cao hiện chỉ dành cho nhóm doanh nghiệp đã được kiểm duyệt kỹ.
AI bắt đầu tham gia huấn luyện AI
Một thay đổi có ý nghĩa dài hạn là OpenAI đã sử dụng các mô hình AI để hỗ trợ giám sát quá trình huấn luyện Astra. Theo Aidan Clark, Phó Chủ tịch nghiên cứu huấn luyện của OpenAI, những hệ thống AI trước đó đóng vai trò đáng kể trong việc theo dõi và hỗ trợ quá trình này.
Đây được xem là bước đầu hướng đến ý tưởng tự cải tiến đệ quy, trong đó AI tham gia huấn luyện hoặc tạo ra phiên bản mạnh hơn của chính mình. OpenAI cho biết đến cuối giai đoạn huấn luyện, việc vận hành liên tục cả ngày đã trở nên bình thường. Khi xảy ra sự cố, mô hình thường có thể tự phục hồi sau vài giây.
Nếu xu hướng này tiếp tục, tốc độ phát triển mô hình có thể tăng lên đáng kể. Nhưng nó cũng khiến việc đánh giá trở nên khó khăn hơn: con người không chỉ cần kiểm tra sản phẩm cuối cùng mà còn phải hiểu cách các hệ thống AI tham gia vào quá trình tạo ra sản phẩm đó.
AGI đã thực sự xuất hiện?
Tuyên bố của Greg Brockman chắc chắn sẽ tiếp tục tạo ra nhiều ý kiến trái chiều. Một số nhà nghiên cứu cho rằng AGI phải đáp ứng những tiêu chí khắt khe hơn, chẳng hạn khả năng thích ứng ổn định trong nhiều lĩnh vực, hiểu bối cảnh sâu và hoạt động đáng tin cậy trong thế giới thực. Việc hoàn thành nhiều tác vụ trên máy tính chưa tự động đồng nghĩa với việc AI đã đạt trí tuệ tương đương con người ở mọi phương diện.
Dù gọi Astra là AGI hay chưa, tác động thực tế của mô hình này vẫn đáng chú ý. Ranh giới giữa công cụ hỗ trợ và tác nhân có thể tự làm việc đang ngày càng mờ đi. Doanh nghiệp có thể giao cho AI nhiều công việc hành chính, nghiên cứu, phân tích và lập trình hơn, trong khi con người phải tập trung vào giám sát, ra quyết định và chịu trách nhiệm cuối cùng.
Câu hỏi quan trọng trong giai đoạn tiếp theo có lẽ không còn chỉ là AI làm được gì. Đó còn là AI nên được trao quyền đến đâu, ai kiểm tra kết quả và những công việc nào vẫn cần con người trực tiếp đảm nhiệm.
