Z.ai, tên quốc tế của Zhipu AI (Trung Quốc), vừa giới thiệu GLM-5.3 với trọng tâm là lập trình và tác vụ kỹ thuật phức tạp. Tuy nhiên, điểm khiến model này được chú ý không chỉ nằm ở các bảng xếp hạng coding. Trong quá trình huấn luyện, Zhipu cho biết GLM-5.3 đã hình thành năng lực phân tích và phát hiện lỗ hổng bảo mật nhanh hơn, xa hơn so với dự tính ban đầu.



Thông tin này cho thấy các mô hình ngôn ngữ lớn ngày càng có thể xử lý những công việc nhiều bước, từ đọc mã nguồn, xác định điểm bất thường đến xây dựng kế hoạch kiểm tra. Dù vậy, năng lực này cũng đặt ra yêu cầu cao hơn về đánh giá an toàn trước khi model được phát hành rộng rãi.
GLM-5.3 cải thiện chủ yếu nhờ giai đoạn hậu huấn luyện
GLM-5.3 được ra mắt ngày 14/8/2026, sử dụng chung kiến trúc nền tảng với GLM-5.2 từng xuất hiện vào tháng 6. Model có khoảng 744 tỷ tham số theo kiến trúc Mixture-of-Experts, trong đó khoảng 40 tỷ tham số được kích hoạt cho mỗi token.
Điểm đáng chú ý là Zhipu không xây dựng một kiến trúc lớn hơn hay huấn luyện lại toàn bộ từ đầu. Phần lớn cải thiện đến từ giai đoạn post-training, tức quá trình tinh chỉnh model nền bằng dữ liệu, môi trường mô phỏng và các nhiệm vụ chuyên biệt. Đây là hướng phát triển phổ biến vì giúp phòng thí nghiệm AI nâng chất lượng mà không nhất thiết phải tăng quy mô mô hình theo cấp số nhân.
Theo đánh giá nội bộ của Zhipu, GLM-5.3 tiến bộ khoảng 50% so với GLM-5.2. Trên Terminal-Bench 3.0, benchmark mô phỏng các nhiệm vụ phức tạp trong terminal thực, điểm số tăng từ 4,6 lên 28,3. Với DeepSWE v1.1, thước đo khả năng xử lý các tác vụ kỹ thuật phần mềm dài hạn, model tăng từ 46,2 lên 66,9 điểm.
Zhipu cho biết GLM-5.3 hiện đứng đầu nhóm model mã nguồn mở trên Terminal-Bench 3.0, DeepSWE v1.1 và Agents’ Last Exam. Những kết quả này phản ánh nỗ lực tập trung vào khả năng làm việc theo chuỗi, thay vì chỉ tạo ra một đoạn mã ngắn dựa trên yêu cầu đơn giản.
Khả năng an ninh mạng phát triển ngoài dự kiến
Trong quá trình huấn luyện GLM-5.3, Zhipu bổ sung dữ liệu và môi trường phục vụ việc phát hiện lỗ hổng bảo mật. Công ty cho biết model bắt đầu suy luận qua nhiều giai đoạn, từ nhận diện vấn đề đến xây dựng kế hoạch mạch lạc cho toàn bộ chuỗi kiểm tra và khai thác.
Cụm từ “ngoài kế hoạch” không có nghĩa GLM-5.3 tự vận hành như một tin tặc độc lập. Nó mô tả hiện tượng model thể hiện khả năng kết hợp nhiều bước tốt hơn dự kiến khi được huấn luyện trên các tác vụ lập trình và an ninh mạng. Việc một hệ thống có thể nối các bước phân tích thành kế hoạch hoàn chỉnh khiến quá trình đánh giá phải xem xét cả ý định, bối cảnh và mức độ tự chủ của model.
Trên CyberGym, benchmark đánh giá khả năng phát hiện và xác thực lỗ hổng, GLM-5.3 đạt 84,5%. Kết quả này nhỉnh hơn Claude Mythos 5 của Anthropic với 83,8% và GPT-5.6 Sol của OpenAI với 83,6%. Tuy nhiên, khoảng cách giữa các model rất nhỏ, vì vậy chưa thể xem đây là bằng chứng cho thấy GLM-5.3 vượt trội toàn diện.
| Benchmark | GLM-5.3 | Đối thủ được nêu |
|---|---|---|
| CyberGym | 84,5% | Claude Mythos 5: 83,8%; GPT-5.6 Sol: 83,6% |
| ExploitBench | 54,4% | Claude Mythos 5: 78%; GPT-5.6 Sol: 76,5% |
Bức tranh thay đổi rõ rệt trên ExploitBench, bài đánh giá khả năng đi trọn một chuỗi khai thác. GLM-5.3 đạt 54,4%, thấp hơn đáng kể so với Claude Mythos 5 ở mức 78% và GPT-5.6 Sol ở mức 76,5%.
Nói cách khác, model của Z.ai tỏ ra cạnh tranh ở bước tìm và xác thực lỗ hổng, nhưng chưa theo kịp các đối thủ trong việc thực hiện đầy đủ một quy trình tấn công. Đây là khác biệt quan trọng, bởi khả năng nhận diện vấn đề có thể hỗ trợ đội ngũ bảo mật phòng thủ, trong khi năng lực tự động hóa nhiều bước khai thác đòi hỏi kiểm soát nghiêm ngặt hơn.
Phát hiện hơn 2.400 lỗ hổng trong dự án mã nguồn mở
Zhipu cho biết họ đã phối hợp với các đội an ninh mạng tại Trung Quốc để kiểm tra 269 dự án mã nguồn mở. Kết quả là hơn 2.400 lỗ hổng được phát hiện, trong đó một số tồn tại khoảng 40 năm.
Các phát hiện được đưa vào một sổ đăng ký công khai. Tại thời điểm công bố, 53 lỗ hổng đã được tiết lộ, còn những trường hợp khác vẫn được giữ lại để các dự án liên quan có thời gian khắc phục. Cách làm này phù hợp với nguyên tắc công bố có trách nhiệm: thông tin kỹ thuật không nên được phát tán rộng rãi trước khi bên phát triển có cơ hội sửa lỗi.
Dù con số 2.400 gây ấn tượng, người đọc vẫn cần xem xét phương pháp thử nghiệm, phạm vi mã nguồn và tiêu chí xác định lỗ hổng. Các số liệu do chính công ty cung cấp là thông tin tham khảo quan trọng, nhưng cần thêm đánh giá độc lập để xác định mức độ tổng quát trong môi trường thực tế.
Vì sao Z.ai trì hoãn mở trọng số?
Khác với một số phiên bản GLM trước đây, Zhipu không mở trọng số GLM-5.3 ngay trong ngày ra mắt. Công ty dự kiến phát hành sau khoảng hai tuần, với lý do cần thêm thời gian đánh giá và tăng cường biện pháp an toàn trước khi cộng đồng có thể tự triển khai model.
Quyết định này phản ánh một mâu thuẫn ngày càng rõ trong lĩnh vực AI mã nguồn mở. Việc mở trọng số giúp nhà nghiên cứu và doanh nghiệp chủ động kiểm thử, tinh chỉnh, triển khai trên hạ tầng riêng. Ngược lại, khi model có năng lực coding và an ninh mạng cao hơn, việc phát hành sớm cũng có thể làm tăng nguy cơ bị sử dụng sai mục đích.
Khả năng lập trình tốt hơn có thể mang lại lợi ích cho kiểm thử phòng thủ, nhưng đồng thời cũng làm tăng yêu cầu về giám sát, giới hạn công cụ và kiểm soát quyền truy cập.
Đây không phải bài toán riêng của Z.ai. Theo thông tin được nêu, OpenAI và Anthropic cũng đang tăng cường giám sát sau khi nhận thấy các model của họ thể hiện những dấu hiệu tương tự. Khi các phòng thí nghiệm cùng tối ưu khả năng lập trình, suy luận nhiều bước và sử dụng công cụ, sự xuất hiện của năng lực an ninh mạng có thể trở thành hệ quả khó tránh.
Những cảnh báo rộng hơn về rủi ro AI cũng đang được nhiều chuyên gia đưa ra, trong đó có Geoffrey Hinton. Với doanh nghiệp, vấn đề không chỉ là model thông minh đến đâu mà còn là model được cấp quyền truy cập hệ thống, mã nguồn và dữ liệu ở mức nào.
Giá và cách tiếp cận GLM-5.3 hiện nay
GLM-5.3 hiện được cung cấp thông qua GLM Coding Plan, hệ thống quota tính theo điểm. Model tương thích với công cụ coding ZCode của Z.ai, Claude Code và OpenCode. API độc lập được giới thiệu là sẽ ra mắt sau, nhưng chưa có thời điểm cụ thể.
Mức giá được giữ như GLM-5.2, ở mức 1,4 USD cho mỗi một triệu token đầu vào và 4,4 USD cho mỗi một triệu token đầu ra. So với mức 3 USD đầu vào và 15 USD đầu ra của Kimi K3, GLM-5.3 có chi phí thấp hơn theo các mức giá được công bố trong thông tin tham khảo.
Việc chưa mở trọng số cũng đồng nghĩa người dùng phổ thông chưa thể tự tải model về triển khai trên máy chủ riêng. Những tổ chức muốn thử nghiệm hiện phải tiếp cận thông qua các công cụ và gói dịch vụ mà Z.ai hỗ trợ.
Điều người dùng và doanh nghiệp nên lưu ý
GLM-5.3 cho thấy AI đang chuyển từ việc trả lời câu hỏi sang thực hiện chuỗi nhiệm vụ kỹ thuật có nhiều bước. Trong lĩnh vực an ninh mạng, công nghệ này có thể hỗ trợ rà soát mã nguồn, ưu tiên các điểm cần kiểm tra và phát hiện lỗi trong phần mềm cũ.
Tuy nhiên, không nên xem kết quả benchmark là sự thay thế cho chuyên gia bảo mật. Các hệ thống AI vẫn có thể nhận định sai, bỏ sót bối cảnh hoặc đề xuất hành động không phù hợp. Doanh nghiệp cần giới hạn quyền truy cập, tách môi trường thử nghiệm khỏi hệ thống sản xuất, ghi nhật ký hoạt động và yêu cầu con người phê duyệt các bước nhạy cảm.
Người dùng cũng nên thận trọng khi đưa mã nguồn nội bộ, khóa API hoặc dữ liệu khách hàng vào công cụ coding AI. Những vụ việc liên quan đến dữ liệu bị rao bán trên diễn đàn ngầm, như nghi vấn 7.098 bản ghi Ahamove, cho thấy bảo vệ dữ liệu đầu vào quan trọng không kém việc chọn model mạnh.
Ở thời điểm hiện tại, GLM-5.3 nổi bật nhờ bước tiến trong lập trình và khả năng phát hiện lỗ hổng. Nhưng khoảng cách lớn trên ExploitBench cho thấy model chưa vượt qua mọi giới hạn về an ninh mạng. Việc trì hoãn mở trọng số có thể là tín hiệu cho thấy các nhà phát triển đang phải cân bằng ngày càng khó giữa tốc độ đổi mới, lợi ích của mã nguồn mở và trách nhiệm an toàn.
