Trang chủ AI AI phát hiện quá nhiều lỗi trong hơn 40 triệu dòng mã...
AI

AI phát hiện quá nhiều lỗi trong hơn 40 triệu dòng mã Linux

Các công cụ AI đang giúp rà soát kho mã Linux ở quy mô chưa từng có, nhưng tốc độ phát hiện lỗi cũng khiến đội ngũ duy trì rơi vào tình trạng quá tải.
Dũng Virgo Dũng Virgo
04/09/2026 12 phút đọc 12 lượt xem
Chia sẻ: f 𝕏
Tổng quan bài viết

Việc đưa AI vào kiểm tra mã nguồn đang tạo ra một nghịch lý lớn với dự án Linux: hệ thống có thể phát hiện nhiều vấn đề hơn trước, nhưng con người lại không đủ thời gian để xử lý toàn bộ báo cáo được gửi tới.

Danh sách bản vá và báo cáo lỗi được xem xét trong quá trình phát triển Linux
Các thành phần mã nguồn Linux cũ được rà soát bằng công cụ tự động
Trao đổi của người duy trì Linux về lượng bản vá do AI hỗ trợ

Nhân Linux hiện có hơn 40 triệu dòng mã sau khoảng 35 năm phát triển. Trong kho mã khổng lồ này không chỉ có những thành phần cốt lõi vận hành máy chủ, máy tính cá nhân và smartphone, mà còn tồn tại nhiều trình điều khiển dành cho phần cứng cũ hoặc rất ít người còn sử dụng. Đây chính là khu vực mà các công cụ phân tích tự động và mô hình AI có thể khai thác hiệu quả.

Số lượng CVE tăng mạnh không đồng nghĩa Linux kém an toàn

Dữ liệu được Greg Kroah-Hartman, một trong những người duy trì nhánh Linux ổn định, chia sẻ trước thềm hội nghị Kernel Recipes 2026 cho thấy số lỗ hổng được gán mã CVE trong mỗi phiên bản nhân Linux đang tăng nhanh.

CVE là hệ thống định danh chung dành cho các lỗ hổng bảo mật đã được công bố. Trong phần lớn vòng đời của Linux 6.x, mỗi phiên bản thường xử lý khoảng 500 CVE. Con số này đã vượt 1.000 từ Linux 7.0 và lên trên 1.500 ở Linux 7.2. Nếu xu hướng tiếp tục, Linux 7.3 có thể là phiên bản đầu tiên tiến gần hoặc vượt mốc 2.000 CVE.

Tuy nhiên, cách hiểu “Linux tạo ra hàng nghìn lỗi mới” là không chính xác. Nhiều vấn đề đã tồn tại trong mã nguồn từ trước, nhưng chỉ được phát hiện khi hệ thống được rà soát với tần suất và quy mô lớn hơn. AI, phân tích tĩnh và fuzzing đang mở rộng đáng kể phạm vi kiểm tra so với khả năng của các nhà phát triển khi làm thủ công.

Số CVE tăng có thể phản ánh năng lực phát hiện được cải thiện, thay vì cho thấy chất lượng bảo mật của Linux đột ngột suy giảm.

AI đang soi cả những vùng mã ít được chú ý

Trong một dự án lâu đời như Linux, phần mã được sử dụng thường xuyên luôn nhận được sự quan tâm lớn. Ngược lại, các trình điều khiển cho thiết bị cũ, phần cứng chuyên biệt hoặc nền tảng gần như đã biến mất khỏi thị trường có thể ít được kiểm tra hơn.

AI có lợi thế ở việc đọc và so sánh lượng mã rất lớn trong thời gian ngắn. Công cụ có thể tìm các đường đi bất thường, nhận diện cách xử lý dữ liệu đáng ngờ hoặc đề xuất vị trí cần kiểm tra sâu hơn. Những công việc này vốn tốn nhiều giờ nếu chỉ dựa vào việc xem xét thủ công.

Một số phát hiện đã cho thấy giá trị thực tế. Các bản ghi CVE trong năm nay từng có những lỗi được tìm ra bằng phương pháp phân tích tĩnh có hỗ trợ AI, sau đó được nhóm bảo mật sản phẩm của Intel xác nhận. Greg Kroah-Hartman cũng sử dụng công cụ fuzzing có AI chạy cục bộ để đưa dữ liệu bất thường vào kernel và tìm ra các tình huống có thể gây lỗi.

Fuzzing không chứng minh mọi báo cáo đều là lỗ hổng nghiêm trọng. Phương pháp này chủ yếu tạo ra nhiều đầu vào bất thường để quan sát phản ứng của phần mềm. AI có thể giúp chọn kịch bản kiểm thử và phát hiện mẫu đáng ngờ nhanh hơn, nhưng kết quả cuối cùng vẫn cần chuyên gia phân tích.

Nút thắt mới nằm ở khâu xác minh

Vấn đề lớn nhất không phải là AI có tìm được lỗi hay không, mà là chất lượng và khối lượng báo cáo sau khi quá trình quét kết thúc. Một mô hình có thể mất vài phút để tạo ra cảnh báo hoặc bản vá thử nghiệm. Đội ngũ duy trì sau đó phải đọc lại mã, tái hiện hiện tượng, xác định mức độ ảnh hưởng và kiểm tra khả năng tương thích với các thành phần khác.

Không phải phát hiện nào cũng nghiêm trọng. Có báo cáo chỉ liên quan đến một trình điều khiển ít người dùng. Có trường hợp bản vá chưa được kiểm tra đầy đủ. Thậm chí, mô hình có thể suy luận sai và mô tả một vấn đề không tồn tại. Nếu tất cả kết quả đều được chuyển thẳng cho người duy trì, thời gian dành cho việc lọc báo cáo có thể lớn hơn thời gian sửa các lỗi thực sự quan trọng.

Tình trạng này đặc biệt rõ trong quá trình chuẩn bị Linux 7.3. Tại nhánh mạng net-next, Jakub Kicinski ước tính khoảng một phần ba đến một nửa trong tổng số 648 bản vá của chu kỳ liên quan đến lỗi ưu tiên thấp, công việc dọn dẹp hoặc các chỉnh sửa được AI thúc đẩy.

Nhóm mạng Linux vì vậy phải xử lý đồng thời nhiều loại nhiệm vụ: đánh giá lỗ hổng có thể ảnh hưởng đến hàng triệu thiết bị, xác minh các cảnh báo nhỏ và rà soát những bản vá do máy tạo ra. Kicinski mô tả nhóm phụ trách đang “hoàn toàn quá tải”.

Mã cũ đứng trước câu hỏi về chi phí duy trì

AI và fuzzing khiến những phần mã từng gần như không tạo thêm công việc nay liên tục xuất hiện trong danh sách cần điều tra. Điều này buộc cộng đồng Linux phải cân nhắc lại giá trị của việc duy trì khả năng tương thích với mọi loại phần cứng trong quá khứ.

Hồi tháng 4, nhà phát triển Andrew Lunn đề xuất loại bỏ gần 28.000 dòng mã mạng dành cho phần cứng sử dụng chuẩn ISA và PCMCIA. Đây là những nền tảng đã rất cũ, với số người dùng thực tế ít hơn nhiều so với trước đây.

Trong Linux 7.3, một số mã trình điều khiển cũ của SGI và IBM đang bị loại bỏ. FreeVxFS, trình điều khiển cho một hệ thống tệp lâu đời, cũng đã được gỡ bỏ sau khi người duy trì nhận định phần mã này chủ yếu trở thành mục tiêu của các công cụ dò lỗi tự động.

Quyết định loại bỏ mã cũ không chỉ nhằm giảm kích thước dự án. Nó còn giúp đội ngũ tập trung nguồn lực vào các thành phần đang phục vụ người dùng hiện tại. Dù vậy, đây là bài toán cần cân nhắc kỹ vì Linux vẫn được triển khai trong nhiều môi trường đặc thù, nơi phần cứng cũ có thể chưa thể thay thế ngay.

Cộng đồng Linux không loại bỏ hoàn toàn AI

Phản ứng của các nhà phát triển không phải là cấm mọi báo cáo hoặc bản vá có sự hỗ trợ của AI. Điều họ phản đối là việc gửi trực tiếp kết quả chưa được kiểm chứng rồi yêu cầu người duy trì tự làm công đoạn thẩm định.

Greg Kroah-Hartman đã hạn chế các bản vá do mô hình ngôn ngữ tạo ra trong khu vực staging của kernel, ngoại trừ những bản vá bảo mật hợp lệ. Hướng dẫn đóng góp cũng cảnh báo rằng báo cáo do AI tạo ra nhưng chưa được con người xác minh có thể làm lãng phí thời gian của cả dự án.

Thay vì xem AI như một nhà phát triển tự động, cộng đồng Linux đang hướng tới vai trò trợ lý. Công cụ có thể hỗ trợ tìm kiếm, phân loại, tóm tắt, kiểm tra các mẫu mã lặp lại hoặc phát hiện những điểm cần ưu tiên. Con người vẫn phải chịu trách nhiệm về quyết định đưa bản vá vào kernel.

Ở chiều ngược lại, đội ngũ phát triển có thể phải sử dụng AI để xử lý chính lượng nội dung do AI tạo ra. Một số mô hình tiên tiến đang được xem xét cho các nhiệm vụ như đánh giá bản vá, phát hiện kết quả bịa đặt và tự động hóa công việc hành chính lặp lại. Đây là hướng tiếp cận thực tế hơn so với kỳ vọng để AI tự sửa toàn bộ nhân Linux.

Bài học cho bảo mật phần mềm quy mô lớn

Câu chuyện của Linux cho thấy tự động hóa không làm biến mất nhu cầu về chuyên gia. Khi công cụ có thể mở rộng khả năng tìm kiếm, giá trị của con người chuyển sang việc xác minh, ưu tiên và chịu trách nhiệm.

Với một lỗi trong thành phần được hàng triệu thiết bị sử dụng, tốc độ xử lý là yếu tố quan trọng. Nhưng một báo cáo sai hoặc bản vá thiếu kiểm tra cũng có thể tạo ra rủi ro mới. Vì vậy, quy trình hiệu quả cần phân biệt rõ giữa cảnh báo ban đầu, lỗi có thể tái hiện, lỗ hổng đã được xác nhận và bản vá sẵn sàng phát hành.

Những tranh luận này cũng xuất hiện trong các công cụ AI hỗ trợ lập trình nói chung. Người dùng có thể tham khảo thêm góc nhìn về năng lực coding và reasoning của các mô hình mới trong bài Gemini 3.8 Flash, nhưng việc mô hình viết được mã không đồng nghĩa mã đó đã an toàn để đưa vào sản phẩm.

AI rõ ràng đang giúp Linux tìm thấy nhiều vấn đề hơn và sớm hơn. Tuy nhiên, chừng nào máy móc chưa thể tự chứng minh phát hiện, đánh giá tác động trên toàn hệ thống và chịu trách nhiệm cho bản vá, con người vẫn là mắt xích quyết định. Thách thức mới của Linux không còn chỉ là tìm lỗi, mà là xây dựng quy trình đủ nhanh để lọc và xử lý những gì AI phát hiện.

Có thể bạn quan tâm

Bài viết liên quan