Phát triển AI giải mã “ngôn ngữ” bộ gene người

Các nhà nghiên cứu Israel và Mỹ phối hợp với Nvidia phát triển mô hình nền tảng bộ gene (gFM), sử dụng trí tuệ nhân tạo (AI) để tìm kiếm những quy luật ẩn trong hơn 3 tỷ “chữ cái” của ADN, qua đó làm rõ mối liên hệ giữa biến đổi di truyền, bệnh tật và phản ứng với điều trị.

Đức Trung
01/10/2026
17:17
AI phân tích trình tự DNA và các cấu trúc sinh học, mở ra hướng tiếp cận mới trong nghiên cứu bộ gene và cơ chế bệnh tật. (Ảnh: linkedin.com)
AI phân tích trình tự DNA và các cấu trúc sinh học, mở ra hướng tiếp cận mới trong nghiên cứu bộ gene và cơ chế bệnh tật. (Ảnh: linkedin.com)

Các nhà nghiên cứu Israel và Mỹ đang phối hợp với tập đoàn công nghệ Nvidia phát triển một mô hình AI quy mô lớn nhằm tìm kiếm những quy luật ẩn trong hơn 3 tỷ “chữ cái” cấu thành bộ gene người, qua đó xác định mối liên hệ giữa các biến đổi di truyền với bệnh tật và phản ứng của từng bệnh nhân đối với phương pháp điều trị.

Dự án do ARC - bộ phận đổi mới sáng tạo của Trung tâm Y tế Sheba (Israel), phối hợp với Trường Y Icahn thuộc hệ thống Mount Sinai ở New York (Mỹ) và Nvidia triển khai. Trong khuôn khổ chương trình hợp tác kéo dài 3 năm với tổng vốn đầu tư hàng chục triệu USD, các bên sẽ phát triển Mô hình nền tảng bộ gene (gFM), sử dụng AI để nhận diện các mẫu hình trong trình tự ADN và kết nối chúng với cơ chế sinh học, bệnh tật cũng như hiệu quả điều trị.

Hiện khoa học đã có khả năng đọc gần như toàn bộ hơn 3 tỷ “chữ cái” trong bộ gene người, song việc hiểu ý nghĩa của chúng vẫn là thách thức lớn. Chưa đến 2% bộ gene trực tiếp mã hóa protein, trong khi phần lớn còn lại thuộc các vùng không mã hóa, bao gồm những cơ chế điều hòa quyết định thời điểm gene được kích hoạt, mức độ biểu hiện và loại tế bào mà gene hoạt động. Đây cũng là những khu vực có thể chứa "lời giải" cho nguyên nhân của nhiều bệnh, sự khác biệt giữa các cá nhân và lý do một phương pháp điều trị hiệu quả với người này nhưng không hiệu quả với người khác.

Cách tiếp cận của gFM có những điểm tương đồng với các mô hình ngôn ngữ lớn. Thay vì học từ khối lượng lớn từ và câu, mô hình được huấn luyện trên lượng dữ liệu ADN khổng lồ để tìm ra các “quy tắc” ẩn trong bộ gene, chẳng hạn những trình tự nào thường xuất hiện cùng nhau, biến đổi nào có thể làm gián đoạn cơ chế điều hòa và một khác biệt di truyền có thể ảnh hưởng như thế nào tới hoạt động của gene.

Điểm đáng chú ý của dự án là kết hợp mô hình AI với dữ liệu y tế thực tế. Sheba và Mount Sinai cung cấp cơ sở dữ liệu di truyền, thông tin y khoa và chuyên môn lâm sàng, trong khi Nvidia cung cấp năng lực tính toán, hạ tầng AI và kinh nghiệm xây dựng các mô hình quy mô lớn. Mục tiêu không chỉ là phát hiện những trình tự ADN đáng chú ý mà còn đối chiếu dự báo của AI với tình trạng thực tế của bệnh nhân, gồm người nào phát triển bệnh, bệnh biểu hiện như thế nào và phản ứng ra sao với điều trị.

Mô hình AI phân tích trình tự di truyền và tìm kiếm những mẫu hình ẩn trong “ngôn ngữ” DNA. (Ảnh: NVIDIA/Arc Institute)
Mô hình AI phân tích trình tự di truyền và tìm kiếm những mẫu hình ẩn trong “ngôn ngữ” DNA. (Ảnh: NVIDIA/Arc Institute)

Trong giai đoạn đầu, dự án sẽ tập trung vào sức khỏe tâm thần và các rối loạn thần kinh - tâm thần, lĩnh vực có cơ chế di truyền đặc biệt phức tạp. Với những bệnh như tâm thần phân liệt, thông thường không tồn tại một đột biến đơn lẻ có thể giải thích căn bệnh mà nguy cơ liên quan đến sự kết hợp của nhiều biến thể trên toàn bộ bộ gene, mỗi biến thể chỉ đóng góp một phần nhỏ. Một mô hình có khả năng phân tích đồng thời hàng nghìn vùng gene có thể giúp các nhà khoa học xác định những biến thể thực sự quan trọng.

Mục tiêu của dự án trong 3 năm tới không phải giải thích toàn bộ phần bộ gene không mã hóa protein, mà là tìm ra những mẫu hình và mối liên hệ các công cụ hiện nay khó phát hiện./. 

Tin cùng chuyên mục

Hà Nội tăng tốc chuyển dịch vụ Internet sang sử dụng IPv6 only

Hà Nội tăng tốc chuyển dịch vụ Internet sang sử dụng IPv6 only

Hà Nội đặt mục tiêu tăng tốc chuyển đổi hạ tầng mạng, hệ thống và dịch vụ Internet sang IPv6 only theo lộ trình, từng bước giảm phụ thuộc IPv4, đồng bộ trong cơ quan nhà nước và doanh nghiệp, hướng tới tỷ lệ sử dụng IPv6 đạt 90-100% vào năm 2030.

Cảnh báo rủi ro pháp lý từ các tác nhân AI tự hành

Cảnh báo rủi ro pháp lý từ các tác nhân AI tự hành

Anthropic cảnh báo khả năng tự hành của các tác nhân AI có thể làm gia tăng nguy cơ gây thiệt hại, đồng thời đặt ra những câu hỏi pháp lý chưa có lời giải rõ ràng về trách nhiệm đối với hành động của AI.

Công nghệ nối dài cánh tay cho hàng Việt Nam

Công nghệ nối dài cánh tay cho hàng Việt Nam

Không chỉ đưa sản phẩm lên các sàn thương mại điện tử, công nghệ đang mở rộng cách doanh nghiệp Việt Nam tiếp cận người mua quốc tế thông qua dữ liệu sản phẩm, gian hàng số và kết nối giao thương trực tuyến. Cùng với đó, mô hình “xuất khẩu tại chỗ”, TP. Hồ Chí Minh đang tích cực kết nối nhà mua hàng quốc tế đến các nhà máy, vùng nguyên liệu, nối dài cánh tay cho hàng Việt vươn xa.

Hạ tầng số định hình thế hệ khu công nghiệp mới

Hạ tầng số định hình thế hệ khu công nghiệp mới

Làn sóng đầu tư vào bán dẫn, trung tâm dữ liệu và trí tuệ nhân tạo đang đặt ra yêu cầu mới cho khu công nghiệp. Để nắm bắt cơ hội, Việt Nam cần kết nối hạ tầng số với nguồn điện, nước, nhân lực và khả năng vận hành bền vững.