Trang chủ › Khám phá › Claude phát hiện hệ thống DNA lặp mới mang tên ART
Khám phá

Claude phát hiện hệ thống DNA lặp mới mang tên ART

Claude đã nhận ra một hệ thống enzyme và chuỗi DNA lặp bất thường trong dữ liệu gene. Tuy nhiên, chức năng sinh học của ART vẫn chưa được xác định.
Dũng Virgo Dũng Virgo
26/09/2026 13 phút đọc 2 lượt xem
Chia sẻ: f 𝕏
Tổng quan bài viết

Một hệ thống enzyme chưa từng được mô tả đang thu hút sự chú ý sau khi được Claude phát hiện trong quá trình phân tích dữ liệu gene quy mô lớn. Anthropic đặt tên cho hệ thống này là ART, viết tắt của array-associated reverse transcriptase, có thể tạm dịch là enzyme phiên mã ngược liên kết với mảng lặp.

Các nhà nghiên cứu kiểm tra mẫu sinh học trong phòng thí nghiệm
Minh họa thực khuẩn thể và vật liệu di truyền của nó
Hình minh họa enzyme phiên mã ngược bên cạnh chuỗi DNA
Đồ họa mô phỏng các đoạn DNA lặp trong hệ thống ART

Phát hiện này đáng chú ý vì Claude không chỉ tìm thấy một gene bất thường. Mô hình còn nhận ra những đoạn DNA lặp nằm cạnh enzyme phiên mã ngược, từ đó đặt câu hỏi liệu đây có thể là một hệ thống sinh học mới hay không. Dù vậy, ART hiện vẫn chỉ là một giả thuyết đang được kiểm chứng, chưa thể xem là “CRISPR thế hệ mới” hay một công cụ chỉnh sửa gene sẵn sàng sử dụng.

Claude phát hiện ART ngoài mục tiêu tìm kiếm ban đầu

Nhóm nghiên cứu khoa học sự sống của Anthropic ban đầu giao cho Claude nhiệm vụ tìm các protein đối tác chưa từng được mô tả, thường xuất hiện gần enzyme phiên mã ngược. Đây là nhóm enzyme có khả năng tạo DNA dựa trên khuôn RNA và tồn tại trong nhiều hệ thống di truyền khác nhau.

Trong khoảng 21,5 giờ, 949 phiên làm việc của Claude Mythos 5 đã rà soát khoảng 1,94 tỷ cụm protein. Hệ thống xác định gần 200.000 enzyme phiên mã ngược, sau đó sàng lọc 3.564 họ protein đối tác. Trong tổng số 119 nhiệm vụ được thực hiện, 98 nhiệm vụ phát sinh từ chính các tác nhân AI trong quá trình phân tích.

Manh mối về ART xuất hiện khi Claude quay lại kiểm tra một ứng viên từng bị loại. Mô hình nhận thấy một enzyme phiên mã ngược có nét tương đồng với enzyme trong retron nằm cạnh một gene chưa rõ chức năng. Gene này sau đó được xác định là một tiểu đơn vị RNA polymerase của thực khuẩn thể khổng lồ.

Thay vì dừng ở đó, Claude đặt vấn đề về vùng DNA nằm phía trước enzyme. Các hệ thống retron thường liên quan đến RNA không mã hóa, vì vậy một tác nhân AI đề xuất đọc trực tiếp khu vực này để tìm thêm dấu hiệu bất thường.

Mảng DNA lặp có điểm giống nhưng không đồng nhất với CRISPR

Khi phân tích một đoạn DNA dài khoảng 2.900 nucleotide, Claude nhận ra các chuỗi dài 16 nucleotide lặp lại, xen kẽ với những đoạn đệm dài từ 100 đến 200 nucleotide. Mô hình xác định 14 đoạn lặp và đặt câu hỏi liệu chúng có phải một mảng lặp tương tự cấu trúc thường thấy trong CRISPR hay không.

Điểm đáng chú ý là Claude không sử dụng một công cụ chuyên dụng để nhận diện trình tự lặp. Mô hình phát hiện mô hình này trong lúc đọc trực tiếp chuỗi DNA, sau đó tự viết mã phân tích, đối chiếu với các thành phần DNA không mã hóa đã biết và kiểm tra tài liệu khoa học trước khi gửi báo cáo cho các nhà nghiên cứu.

Tuy nhiên, sự tương đồng về hình thức không đồng nghĩa ART có cùng chức năng với CRISPR. Các nhà nghiên cứu không tìm thấy gene cas ở gần những thành viên ART được xác định. Đây là một trong những lý do quan trọng cho thấy ART không phải một hệ thống CRISPR bị bỏ sót.

Vì sao các công cụ gene trước đây không nhận ra ART?

Một phần nguyên nhân nằm ở cách các công cụ phân tích bộ gene được xây dựng. Những phần mềm tìm CRISPR thường dựa trên kích thước điển hình của các đoạn lặp và đoạn đệm. Khi dữ liệu thực tế lệch khỏi những ngưỡng này, một cấu trúc mới có thể không được đánh dấu dù vẫn tồn tại rõ ràng trong trình tự.

Trong trường hợp này, MinCED thường tìm các đoạn đệm dài 26-50 nucleotide, còn CRISPRCasFinder sử dụng khoảng 25-60 nucleotide. Ngược lại, các đoạn đệm trong ART dài tới 120-220 nucleotide. Kích thước lớn hơn nhiều khiến hệ thống nằm ngoài phạm vi mà các công cụ truyền thống ưu tiên kiểm tra.

Anthropic cũng thực hiện các thử nghiệm đối chứng để đánh giá vai trò của cách đưa dữ liệu cho AI. Khi chuỗi DNA được đặt trực tiếp trong ngữ cảnh, những phiên bản Claude mạnh nhất nhận diện mảng lặp với tỷ lệ trên 90%; Mythos 5 đạt 96%. Khi DNA được cung cấp dưới dạng tệp kèm công cụ phân tích, tỷ lệ nhận diện giảm mạnh, mức thấp nhất chỉ còn 32%.

Gần 40% lượt thử thậm chí không đọc liên tục quá 200 nucleotide. Kết quả này cho thấy khả năng của AI không chỉ phụ thuộc vào mô hình, mà còn phụ thuộc vào cách dữ liệu được trình bày. Một hệ thống có thể bỏ qua manh mối quan trọng nếu quá trình đọc bị chia nhỏ hoặc hoàn toàn lệ thuộc vào bộ công cụ có sẵn.

ART gồm những thành phần nào?

Trong quá trình mở rộng tìm kiếm, Anthropic xác định 95 thành viên thuộc họ ART. Có 28 thành viên chứa mảng lặp rõ ràng, mỗi mảng gồm 3-21 bản sao. Các đoạn đệm của ART dài hơn đáng kể so với những đoạn thường thấy trong CRISPR và có xu hướng được bảo tồn theo cùng thứ tự ở các thực khuẩn thể gần nhau.

Một dữ liệu đáng chú ý đến từ thực khuẩn thể SA1, được phân lập từ nước thải tại một trang trại lợn ở Sơn Đông, Trung Quốc. Dữ liệu công khai cho thấy sau 15 phút nhiễm, RNA được phiên mã từ mảng ART có thể chiếm tới 8% tổng lượng RNA của thực khuẩn thể. Những RNA này sau đó được cắt thành các đoạn ngắn.

Phòng thí nghiệm Anthropic đưa hệ thống ART của SA1 vào E. coli và quan sát được các đoạn RNA ngắn tương tự. Đây là dấu hiệu cho thấy mảng DNA có thể liên quan đến quá trình tạo hoặc xử lý RNA, nhưng chưa đủ để giải thích vai trò của enzyme phiên mã ngược hay protein đối tác.

Chức năng của ART vẫn còn là câu hỏi mở

Hiện chưa có bằng chứng hoàn chỉnh cho thấy enzyme phiên mã ngược trong ART thực sự hoạt động. Các nhà nghiên cứu cũng chưa xác nhận những RNA ngắn quan sát được có phải là cơ chất của enzyme hay không, cũng như chưa biết protein đối tác có tương tác trực tiếp với enzyme hay đóng vai trò khác.

Nói cách khác, Anthropic mới xác định được một mô hình di truyền bất thường và các dấu hiệu cho thấy nó có thể hoạt động trong tế bào. Từ đó đến việc hiểu cơ chế, xác định chức năng và chứng minh khả năng ứng dụng vẫn là một chặng đường dài.

Phát hiện một cấu trúc DNA mới chỉ là bước khởi đầu. Chức năng sinh học phải được xác nhận bằng thí nghiệm, thay vì suy ra hoàn toàn từ sự tương đồng về trình tự.

Khoảng cách này từng xuất hiện trong lịch sử CRISPR. Các chuỗi lặp liên quan đến CRISPR được phát hiện từ năm 1987, nhưng giới khoa học phải mất khoảng 20 năm mới xác định được vai trò của chúng trong cơ chế phòng vệ của vi khuẩn. Đến năm 2013, CRISPR mới được phát triển thành công cụ chỉnh sửa gene trong tế bào động vật có vú.

AI có thể tìm manh mối, nhưng con người vẫn giữ vai trò quyết định

Khả năng phát hiện ART của Claude cũng chưa ổn định. Khi nhóm nghiên cứu chạy lại cùng quy trình 10 lần, AI gần như luôn tiếp cận được vùng chứa ART. Tuy nhiên, cả 10 lần đều không tự chủ động đọc phần DNA ở phía thượng nguồn để nhận ra các chuỗi lặp.

Trong 19 báo cáo ban đầu do Mythos 5 tạo ra, ART chỉ đứng thứ ba. Chính các nhà nghiên cứu con người đã lựa chọn báo cáo này để kiểm tra sâu hơn. Việc xác nhận ART là một họ độc lập, tìm đủ 95 thành viên và tiến hành các thử nghiệm sinh học đều cần sự tham gia của con người.

Điều này cho thấy cách mô tả chính xác hơn là Claude đã thực hiện một bước phát hiện quan trọng trong quy trình nghiên cứu, chứ chưa tự mình hoàn thành một khám phá sinh học từ đầu đến cuối. AI có thể mở rộng phạm vi tìm kiếm và nhận ra những mẫu dữ liệu khó thấy, nhưng việc đặt câu hỏi đúng, thiết kế thí nghiệm và diễn giải kết quả vẫn cần các nhà khoa học.

Zhang Feng, một trong những nhà khoa học tiên phong về chỉnh sửa gene CRISPR, đánh giá ART là ví dụ thú vị về việc tác nhân AI tham gia vào khám phá sinh học. Ông cho rằng các mảng RNA lặp liên quan đến enzyme phiên mã ngược đáng để nghiên cứu thêm, nhưng không gọi ART là “CRISPR tiếp theo”.

Từ phát hiện tính toán đến công cụ sinh học còn rất xa

ART cho thấy AI có thể hỗ trợ hiệu quả trong việc rà soát dữ liệu sinh học khổng lồ, đặc biệt khi các công cụ truyền thống bị giới hạn bởi những tiêu chí được định nghĩa từ trước. Đây là hướng phát triển đáng chú ý trong nghiên cứu AI, tương tự cách các hệ thống trí tuệ nhân tạo đang được thử nghiệm để phân tích dữ liệu y tế và khoa học.

Tuy nhiên, không nên đánh đồng khả năng nhận diện mẫu với khả năng hiểu cơ chế sinh học. Một chuỗi lặp có thể liên quan đến quá trình xử lý RNA, điều hòa gene hoặc một chức năng chưa được biết đến; chỉ thí nghiệm có kiểm soát mới giúp phân biệt các khả năng này.

Với ART, những câu hỏi quan trọng nhất vẫn chưa có lời giải: enzyme phiên mã ngược có hoạt tính hay không, các RNA ngắn được tạo ra để làm gì, protein đối tác tương tác với thành phần nào và toàn bộ hệ thống đem lại lợi ích gì cho thực khuẩn thể.

Phát hiện của Claude vì thế nên được xem là một cột mốc trong quy trình tìm kiếm giả thuyết, không phải một sản phẩm sinh học hoàn chỉnh. AI đã giúp con người chú ý đến một cấu trúc từng bị bỏ qua, còn câu trả lời về ý nghĩa thực sự của ART vẫn phải đến từ phòng thí nghiệm.

Độc giả quan tâm đến những ứng dụng rộng hơn của trí tuệ nhân tạo có thể tham khảo thêm bài viết về AI biên và hướng phát triển các hệ thống AI chuyên biệt. Trong trường hợp của ART, giá trị lớn nhất hiện nay nằm ở khả năng giúp các nhà nghiên cứu nhìn thấy những manh mối mà phương pháp tự động thông thường có thể bỏ qua.

Có thể bạn quan tâm

Bài viết liên quan