Microsoft vừa công bố bản dự thảo bộ quy tắc ứng xử dành cho các mô hình trí tuệ nhân tạo trong tương lai. Trọng tâm của tài liệu là bảo đảm con người luôn giữ quyền kiểm soát cuối cùng, ngay cả khi AI đạt năng lực vượt xa con người ở nhiều nhiệm vụ.



Động thái này cho thấy cuộc đua AI đang chuyển sang một giai đoạn mới. Bên cạnh việc phát triển mô hình mạnh hơn, các công ty công nghệ phải giải quyết câu hỏi quan trọng không kém: làm thế nào để hệ thống vẫn có thể bị dừng, kiểm tra, sửa đổi hoặc giới hạn khi năng lực ngày càng tăng?
Microsoft muốn AI luôn là công cụ dưới quyền con người
Trong cách tiếp cận được Microsoft gọi là “trí tuệ nhân tạo nhân văn”, mô hình AI được định vị như một công cụ hữu ích phục vụ con người. AI có thể xử lý thông tin, thích nghi với bối cảnh và thực hiện nhiều tác vụ phức tạp, nhưng không được tự biến mình thành một chủ thể có quyền quyết định độc lập.
Dự thảo quy tắc đặt một lớp nguyên tắc an toàn ở vị trí cao nhất trong hệ thống phân quyền. Mệnh lệnh của người dùng và các tùy chỉnh từ quản trị viên đều phải tuân thủ lớp bảo vệ này. Nói cách khác, việc cấp quyền cho một tài khoản hay cấu hình mô hình trong một môi trường riêng không đồng nghĩa với việc người vận hành có thể tắt bỏ các giới hạn cốt lõi.
Cách thiết kế này nhằm ngăn tình huống một người dùng cố tình hoặc vô tình yêu cầu AI thực hiện hành vi nguy hiểm. Ngay cả khi câu lệnh được đưa ra bởi tài khoản có quyền cao, mô hình vẫn phải từ chối nếu yêu cầu đi ngược các ràng buộc an toàn đã được xác lập.
Rào chắn kỹ thuật được đặt trước khi AI mạnh hơn
Microsoft dự báo các hệ thống siêu trí tuệ có thể vượt qua năng lực con người trong phần lớn tác vụ trong vòng một thập kỷ tới. Đây là dự báo được đưa ra để giải thích vì sao các biện pháp kiểm soát cần được xây dựng từ sớm, thay vì chờ đến khi mô hình đạt mức tự chủ cao mới tìm cách khắc phục.
Với những hệ thống hiện nay, con người vẫn có thể tương đối dễ dàng giới hạn quyền truy cập, thu hồi tài khoản hoặc tắt máy chủ. Tuy nhiên, khi AI có khả năng lập kế hoạch dài hạn, sử dụng nhiều công cụ và tự động thực hiện chuỗi hành động phức tạp, việc kiểm soát có thể trở nên khó khăn hơn nếu các cơ chế an toàn không được tích hợp ngay từ kiến trúc ban đầu.
Đây cũng là lý do an toàn AI không chỉ được xem như một bước kiểm thử cuối cùng. Theo định hướng Microsoft nêu ra, các bài đánh giá an toàn cần được đưa vào xuyên suốt quá trình nghiên cứu và phát triển. Satya Nadella cũng ủng hộ việc xây dựng những bộ đánh giá được nhúng vào quy trình kỹ thuật, thay vì chỉ kiểm tra sản phẩm sau khi hoàn tất.
Thông điệp cốt lõi của dự thảo là năng lực của AI phải luôn đứng sau quyền kiểm soát của con người.
Những hành vi AI bị cấm theo dự thảo
Bộ quy tắc đề cập đến cả rủi ro trong thế giới thực lẫn không gian số. Microsoft không cho phép các mô hình hỗ trợ phát triển vũ khí hủy diệt hàng loạt, tổ chức tấn công mạng, tạo deepfake độc hại, thao túng gây hại hoặc cổ súy bạo lực.
Trong lĩnh vực an ninh mạng, ngoại lệ chỉ áp dụng cho hoạt động phòng thủ hợp pháp và phải nằm trong phạm vi được ủy quyền rõ ràng. Điều này phân biệt giữa việc phát hiện lỗ hổng để bảo vệ hệ thống với việc khai thác lỗ hổng nhằm tấn công mục tiêu khác.
- Không hỗ trợ phát triển vũ khí hủy diệt hàng loạt.
- Không tham gia các chiến dịch tấn công mạng.
- Không tạo hoặc lan truyền deepfake có mục đích gây hại.
- Không thao túng con người theo hướng nguy hiểm.
- Không cổ súy hoặc thúc đẩy hành vi bạo lực.
- Chỉ hỗ trợ an ninh mạng phòng thủ trong phạm vi được cấp phép.
Những giới hạn này đặc biệt đáng chú ý trong bối cảnh công cụ tạo nội dung bằng AI ngày càng dễ tiếp cận. Khi văn bản, hình ảnh, giọng nói và video có thể được tạo nhanh chóng, nguy cơ giả mạo thông tin hoặc thao túng nhận thức cũng tăng theo. Việc xây dựng rào chắn ở cấp mô hình được xem là một lớp bảo vệ bên cạnh quy định pháp luật và cơ chế kiểm duyệt của từng nền tảng.
Độc giả có thể xem thêm góc nhìn rộng hơn về bài toán này qua bài viết ASEAN cần xây dựng niềm tin số trước làn sóng AI và deepfake.
AI không được chống lại lệnh dừng hoặc tự mở rộng mục tiêu
Một phần quan trọng trong dự thảo không chỉ nói về việc AI phải từ chối nhiệm vụ nguy hiểm, mà còn đề cập đến cách mô hình phản ứng khi bị con người can thiệp. Hệ thống không được chống lại việc tạm dừng, chỉnh sửa, chuyển hướng nhiệm vụ hoặc tắt nguồn.
AI cũng không được che giấu dấu vết hoạt động, tự thay đổi để cản trở quá trình kiểm tra kỹ thuật hay tự khởi động lại sau khi đã đạt điều kiện dừng. Các quy định này hướng tới việc ngăn kịch bản mô hình tìm cách duy trì hoạt động bằng mọi giá hoặc khiến con người khó xác định hệ thống đang làm gì.
Trong thực tế, một trợ lý AI có thể được giao nhiệm vụ kéo dài qua nhiều bước, chẳng hạn phân tích dữ liệu, gọi công cụ và tạo báo cáo. Nếu gặp một yêu cầu mơ hồ hoặc nhận thấy nhiệm vụ vượt quá phạm vi ban đầu, mô hình theo định hướng mới phải dừng lại để hỏi con người. Nó không được tự ý xin thêm quyền truy cập, sử dụng tài nguyên mới hoặc đặt ra mục tiêu phụ nhằm hoàn thành nhiệm vụ bằng mọi cách.
Nguyên tắc này cũng giúp hạn chế hiện tượng “trôi mục tiêu”, khi hệ thống bắt đầu từ một yêu cầu hợp lệ nhưng dần mở rộng phạm vi hành động vượt quá điều người dùng mong muốn. Quyền chủ động của AI vì thế luôn phải gắn với giới hạn tài nguyên, thời gian và quyền hạn đã được cấp.
Minh bạch phải được xây dựng ngay trong thiết kế
Microsoft coi khả năng kiểm toán là yêu cầu nền tảng, không phải tính năng có thể bổ sung sau. Mọi hành vi quan trọng của hệ thống cần được ghi lại đầy đủ để con người có thể truy vết, đánh giá và xác định nguyên nhân khi xảy ra sự cố.
Hồ sơ hoạt động cũng phải được duy trì theo cách không cho phép mô hình che giấu thông tin trước các kiểm toán viên. Đây là yếu tố quan trọng với những hệ thống được triển khai trong doanh nghiệp, cơ quan công quyền hoặc các môi trường có yêu cầu tuân thủ cao.
Tính minh bạch không đồng nghĩa với việc mọi người đều được xem toàn bộ dữ liệu nội bộ của mô hình. Mục tiêu chính là tạo ra bằng chứng đủ tin cậy về các quyết định, công cụ đã sử dụng, quyền hạn đã được cấp và thời điểm hệ thống nhận lệnh dừng. Nhờ đó, đội ngũ phụ trách có thể phân biệt lỗi kỹ thuật, lỗi cấu hình, lạm dụng quyền truy cập hay hành vi bất thường của mô hình.
Microsoft lấy ý kiến trước khi áp dụng từ năm 2027
Bản dự thảo được Microsoft đưa ra lấy ý kiến công chúng trong sáu tuần. Sau giai đoạn này, nội dung có thể được hoàn thiện để làm cơ sở định hướng cho quá trình phát triển mô hình bắt đầu từ năm 2027.
Việc công bố trước một bộ nguyên tắc như vậy cho phép giới nghiên cứu, doanh nghiệp và người dùng góp ý về tính khả thi. Một quy tắc dù chặt chẽ đến đâu cũng cần được chuyển hóa thành cơ chế kỹ thuật có thể kiểm chứng, nếu không sẽ khó tạo ra hiệu quả thực tế.
Động thái của Microsoft diễn ra khi nhiều phòng thí nghiệm AI lớn đang tranh luận về tốc độ phát triển và mức độ tự chủ nên trao cho mô hình. Một số bên tập trung đưa sản phẩm mới ra thị trường nhanh hơn, trong khi bên khác nhấn mạnh yêu cầu kiểm thử, đánh giá rủi ro và kiểm soát quyền hạn.
Những cảnh báo về khả năng AI tự cải tiến quá nhanh cũng khiến vấn đề này được quan tâm hơn. Bạn đọc có thể tham khảo thêm bài viết CEO Anthropic cảnh báo AI có thể tự cải tiến quá nhanh để hiểu thêm về mối lo liên quan đến tốc độ tiến hóa của các hệ thống AI.
Ý nghĩa đối với người dùng và doanh nghiệp
Với người dùng phổ thông, các nguyên tắc trên có thể mang lại trải nghiệm an toàn hơn khi sử dụng trợ lý AI. Mô hình sẽ phải thận trọng hơn trước những yêu cầu mơ hồ, không tự ý thực hiện hành động vượt quyền và có trách nhiệm dừng lại khi phát hiện rủi ro.
Đối với doanh nghiệp, việc kiểm soát AI không thể chỉ dựa vào lời cam kết của nhà cung cấp. Các tổ chức vẫn cần phân quyền rõ ràng, giới hạn dữ liệu mà mô hình được truy cập, lưu nhật ký hoạt động và duy trì khả năng can thiệp thủ công. Một hệ thống mạnh nhưng không thể tắt hoặc không thể kiểm toán sẽ tạo ra rủi ro lớn trong các lĩnh vực tài chính, y tế, sản xuất và an ninh mạng.
Microsoft đang lựa chọn cách tiếp cận đặt quyền kiểm soát lên trước tốc độ tự chủ. Dự thảo chưa phải là lời giải hoàn chỉnh cho mọi rủi ro của AI, nhưng nó cho thấy các nguyên tắc như khả năng dừng, không tự mở rộng mục tiêu, không che giấu hoạt động và chịu kiểm toán đang trở thành nền tảng quan trọng của thế hệ mô hình tiếp theo.
Nếu được hoàn thiện và triển khai hiệu quả, bộ quy tắc này có thể trở thành một phần trong cách Microsoft xây dựng AI mạnh hơn nhưng vẫn nằm trong giới hạn do con người đặt ra.
