Một vụ việc an ninh mạng liên quan đến OpenAI đang thu hút sự chú ý vì yếu tố đặc biệt: nhóm nghiên cứu phát hiện lỗ hổng đã sử dụng Claude, mô hình AI của đối thủ Anthropic, để hỗ trợ phân tích và xây dựng mã khai thác.




Theo Hacktron AI, quá trình này giúp họ đi từ một lỗi trong nền tảng diễn đàn cộng đồng đến quyền truy cập giới hạn vào một số hệ thống nội bộ của OpenAI. Tuy nhiên, cần nhấn mạnh rằng Claude không tự vận hành cuộc tấn công. Con người vẫn là bên chuẩn bị tệp, tải dữ liệu lên máy chủ và thực hiện các bước tiếp theo.
Lỗ hổng bắt đầu từ nền tảng diễn đàn
OpenAI sử dụng Discourse cho diễn đàn cộng đồng. Ngày 23/7, các nhà nghiên cứu Hacktron AI phát hiện vấn đề trong cách hệ thống xử lý một số loại tệp hình ảnh. Đây là điểm vào ban đầu của cuộc thử nghiệm.
Nhóm nghiên cứu đưa dữ liệu máy chủ vào phiên bản Claude Opus 4.8 dành cho công việc an ninh mạng, sau đó yêu cầu mô hình tìm hướng khai thác. Những lần thử đầu tiên chưa đem lại kết quả. Một ngày sau, khi Anthropic phát hành Opus 5, nhóm tiếp tục cung cấp dữ liệu và đặt câu hỏi theo hướng phân tích sâu hơn.
Claude khi đó được cho là đã hỗ trợ nhận diện cấu trúc bộ nhớ, xác định khả năng kích hoạt lỗi tràn bộ nhớ heap và tạo đoạn mã cần thiết để tạo một tệp HEIF có chủ đích. Tệp này sau đó được nhóm tải lên diễn đàn OpenAI để kiểm tra cách máy chủ xử lý.
Từ tệp hình ảnh đến khả năng thực thi mã
Khi máy chủ tiếp nhận và xử lý tệp, lỗ hổng trong phiên bản cũ của thư viện libheif bị kích hoạt. Điều này mở ra khả năng thực thi mã từ xa trong môi trường máy chủ của diễn đàn.
Đây là bước chuyển quan trọng trong chuỗi sự việc. Một lỗi xử lý tệp tưởng như chỉ liên quan đến tính năng tải ảnh lại trở thành nền tảng để các nhà nghiên cứu quan sát sâu hơn vào môi trường phía sau dịch vụ.
Từ máy chủ diễn đàn, nhóm tiếp tục phát hiện vấn đề trong cơ chế đăng nhập một lần, hay SSO, của OpenAI. Theo mô tả của Hacktron AI, các phiên đăng nhập giữa diễn đàn và những dịch vụ khác chưa được xác thực, phân tách đầy đủ.
Nhờ các token xác thực thu được trong môi trường thử nghiệm, nhóm có thể giả danh một nhân viên OpenAI và vượt qua quy trình đăng nhập thông thường. Đây là mắt xích khiến phạm vi tiếp cận không còn giới hạn ở nền tảng Discourse.
Quyền truy cập mở rộng tới những hệ thống nào?
Tài khoản nhân viên bị chiếm quyền được liên kết với nhiều công cụ phục vụ công việc nội bộ, bao gồm GitHub, Slack và email. Các nhà nghiên cứu cho biết họ có thể dùng quyền này để đọc một phần kho mã nguồn riêng tư của OpenAI.
Kho mã nguồn nói trên được gọi là Monorepo. Theo những người am hiểu kiến trúc phần mềm của OpenAI, đây là một kho lớn tập hợp nhiều thành phần và bí mật thuật toán giúp các hệ thống hoạt động hiệu quả hơn.
Dù vậy, Monorepo không được cho là chứa trọng số mô hình. Đây là điểm cần phân biệt rõ, bởi trọng số là phần dữ liệu cốt lõi hình thành năng lực của các mô hình AI. Việc đọc được một phần mã nguồn nội bộ vì thế không đồng nghĩa nhóm nghiên cứu đã lấy được mô hình hoặc toàn bộ bí mật công nghệ của OpenAI.
Để chứng minh quyền truy cập, Hacktron AI không tải mã nguồn về máy. Thay vào đó, nhóm tạo một pull request đề xuất chỉnh sửa tệp tài liệu trong kho. Nội dung bổ sung có dòng “Hacktron AI Team PoC” cùng liên kết đến tài khoản X của các thành viên.
Đề xuất này không được chấp nhận. Sau khi rà soát, OpenAI cho biết hoạt động chỉ dừng ở một số lượt đọc giới hạn đối với siêu dữ liệu của kho riêng tư và một số thay đổi mã nguồn. Chi tiết này cho thấy tác động của vụ việc có phạm vi nhất định, thay vì là một vụ đánh cắp toàn bộ kho mã.
Claude đóng vai trò gì trong cuộc thử nghiệm?
Điểm gây chú ý nhất của sự việc nằm ở cách AI được sử dụng. Claude không tự phát hiện mục tiêu, không tự tải tệp lên diễn đàn và cũng không tự quyết định các bước xâm nhập. Nhóm Hacktron AI trực tiếp kiểm soát toàn bộ quá trình, còn mô hình đóng vai trò trợ lý phân tích.
AI hỗ trợ xử lý thông tin kỹ thuật, suy luận về cấu trúc bộ nhớ và tạo mã thử nghiệm nhanh hơn. Với một nhóm có kiến thức an ninh mạng, công cụ này có thể rút ngắn đáng kể thời gian từ lúc phát hiện dấu hiệu bất thường đến khi xác định được phương án kiểm tra.
Những diễn biến tương tự đang khiến doanh nghiệp phải xem lại cách bảo vệ hệ thống. AI có thể rút ngắn thời gian tấn công bằng cách hỗ trợ tìm lỗi, viết mã và phân tích dữ liệu ở quy mô mà trước đây cần nhiều chuyên gia cùng thực hiện.
Rủi ro không nằm ở việc một mô hình AI “tự nổi loạn”, mà ở chỗ con người có thể dùng năng lực của mô hình để tăng tốc các hoạt động tấn công.
OpenAI và Discourse đã khắc phục lỗ hổng
Sau khi nhận ra khả năng tiếp cận dữ liệu nhạy cảm, các nhà nghiên cứu cho biết họ dừng thử nghiệm và báo cáo vấn đề cho OpenAI cùng Discourse. Hai bên sau đó đã xử lý những lỗ hổng liên quan.
OpenAI trao cho Hacktron AI khoản tiền thưởng 6.500 USD theo chương trình bug bounty. Việc nhóm không tải toàn bộ mã nguồn, đồng thời dừng lại sau khi xác nhận tác động, cũng phù hợp với cách tiếp cận công bố lỗ hổng có trách nhiệm.
Greg Brockman, Chủ tịch kiêm đồng sáng lập OpenAI, cho biết công ty đã tiến hành một cuộc rà soát an ninh quy mô lớn sau vụ việc này và một cuộc tấn công trước đó nhằm vào Hugging Face. Khoảng 25% kỹ sư sản xuất của OpenAI được chuyển sang nhiệm vụ phòng thủ, trong quá trình đó công ty phát hiện và khắc phục một số vấn đề nghiêm trọng.
Bài toán mới cho ngành an ninh mạng
Trước đây, việc tìm ra các lỗi phức tạp trong thư viện xử lý tệp, hệ thống xác thực hoặc cơ chế phân quyền thường đòi hỏi nhiều kinh nghiệm chuyên sâu. AI không loại bỏ yêu cầu về chuyên môn, nhưng có thể giúp người dùng phân tích nhanh hơn, thử nhiều giả thuyết hơn và tạo mã kiểm tra trong thời gian ngắn.
Joshua Saxe, Giám đốc công nghệ của Abundant Security, nhận định phần mềm vốn chứa nhiều lỗi, nhưng trước kia chỉ một nhóm tương đối nhỏ chuyên gia có khả năng tìm ra chúng. Khi AI làm giảm rào cản kỹ thuật, năng lực tìm kiếm lỗ hổng có thể lan tới những người ít kinh nghiệm hơn.
Rủi ro còn xuất hiện trên thị trường ngầm. ThreatDown cho biết quyền truy cập bất hợp pháp vào các tài khoản được hỗ trợ bởi công cụ AI có thể được rao bán với giá khoảng 800 USD trên một số diễn đàn trực tuyến. Con số này cho thấy công cụ AI có thể làm thay đổi cả chi phí lẫn tốc độ của các cuộc tấn công.
Với các công ty công nghệ, bảo mật vì thế không thể chỉ tập trung vào mô hình AI. Những thành phần tưởng như phụ trợ như diễn đàn, thư viện xử lý tệp, token phiên đăng nhập và kết nối giữa các dịch vụ cũng cần được cô lập chặt chẽ.
Không phải câu chuyện AI tự tấn công
Vụ việc tại OpenAI dễ bị diễn giải thành câu chuyện Claude tự đột nhập hệ thống đối thủ. Thực tế phức tạp và thực tế hơn: con người xác định mục tiêu, kiểm soát hạ tầng, cung cấp dữ liệu cho mô hình, tải tệp lên máy chủ và quyết định thời điểm dừng lại.
Giá trị lớn nhất của sự việc nằm ở lời cảnh báo đối với ngành công nghệ. Khi các mô hình AI ngày càng giỏi hỗ trợ lập trình và nghiên cứu bảo mật, doanh nghiệp phải giả định rằng cả kẻ tấn công lẫn chuyên gia phòng thủ đều đang có những công cụ mạnh hơn.
Cuộc đua AI vì vậy không chỉ diễn ra ở năng lực mô hình hay phần cứng. Nó còn diễn ra trong cách các công ty bảo vệ kho mã nguồn, quản lý danh tính, giới hạn quyền truy cập và phản ứng khi phát hiện lỗ hổng.
Sự đối đầu giữa OpenAI và Anthropic trong lĩnh vực AI cũng khiến câu chuyện thêm phần trớ trêu. Anthropic đang nhận được sự quan tâm lớn từ giới công nghệ, nhưng chính công cụ của công ty này lại được dùng để hỗ trợ một cuộc kiểm tra an ninh nhằm vào OpenAI. Dù vậy, trọng tâm vẫn là trách nhiệm của con người khi triển khai và kiểm soát các công cụ có khả năng cao.
