Khi nào thì có thể nói AI đã tạo ra một phát hiện khoa học?
Anthropic tuyên bố hệ thống AI của mình đã đạt được phát hiện đầu tiên trong lĩnh vực sinh học phân tử, nhưng giới sinh học phản ứng gay gắt vì cho rằng tìm ra một mẫu gen lạ không đồng nghĩa với việc tạo ra một khám phá khoa học thực sự. Câu chuyện đặt ra câu hỏi lớn: đâu là tiêu chuẩn để xác nhận AI đã thực sự tạo ra phát hiện khoa học?

Anthropic vừa gây chú ý khi tuyên bố hệ thống AI của mình đã tạo ra phát hiện khoa học đầu tiên trong lĩnh vực sinh học phân tử. Nhưng giới nghiên cứu sinh học lại không đồng tình, và câu chuyện này mở ra một cuộc tranh luận quan trọng về việc chúng ta nên đánh giá AI trong khoa học như thế nào.
Hôm thứ Tư tuần trước, Anthropic thông báo rằng hồi đầu năm, công ty đã thành lập một phòng thí nghiệm sinh học phân tử, nơi các tác nhân AI (agent) dựa trên Claude đọc tài liệu và đưa ra phỏng đoán về những bài toán sinh học khó, còn các nhà khoa học người thật thì chạy thí nghiệm dựa trên những gì AI báo cáo. Và phòng thí nghiệm do AI vận hành này, theo lời công ty, đã đạt được phát hiện đầu tiên.
Hệ thống 950 tác nhân AI đã làm gì?
Để hiểu điều Anthropic tuyên bố, hãy hình dung bạn đang lật giở một thư viện gồm hàng triệu trình tự ADN, được tích lũy khi các nhà khoa học giải mã ngày càng nhiều sinh vật sống. Một bước tiến có thể là tìm ra một trình tự đặc biệt mã hóa một loại enzyme thú vị. Sau đó, bạn cần tìm hiểu enzyme đó làm gì và cuối cùng là cách điều khiển nó để phục vụ mục đích hữu ích.
Theo Anthropic, hệ thống gồm 950 tác nhân AI của họ sau 21 giờ đã không tìm ra một trình tự hoàn toàn mới. Thay vào đó, các tác nhân này đánh dấu một mẫu lặp lại bao quanh một enzyme đã biết — một mẫu cụ thể mà Anthropic khẳng định chưa từng được ghi nhận trước đây. Nhưng nếu đọc thông báo của Anthropic, trong đó gọi mẫu này là "gợi nhớ" đến những gì dẫn tới công nghệ chỉnh sửa gen CRISPR — thứ "đã thay đổi nền khoa học và y học" — thì có cảm giác như đội quân tác nhân AI này thực sự đã tìm ra điều gì đó đáng kể.
Phản ứng từ giới sinh học
Những tuyên bố này đã khiến một số nhà sinh học tức giận. Một bài đăng lan truyền của một nhà sinh học, sau đó được chủ tịch kiêm CEO hãng dược Eli Lilly ủng hộ, cho rằng: "Tìm ra một cụm gen kỳ lạ và các đoạn lặp lại thường là phần dễ. Phần khó, và cũng là nơi tạo ra phát hiện thực sự, là tìm hiểu xem hệ thống đó thực sự làm gì."
Nói cách khác, các tác nhân AI chỉ giúp một phần công việc phòng thí nghiệm mang tính thủ công. Đó chưa phải là một phát hiện.
Đây là lời nhắc nhở rằng ngay cả khi AI làm được điều gì đó ấn tượng — như tìm ra một mẫu trong khối dữ liệu sinh học khổng lồ mà mắt người khó nhận ra — kết quả đó vẫn có thể chưa phải là một bước đột phá cho khoa học. Điều mới lạ với AI có thể là bình thường, không đáng ngạc nhiên, hoặc đơn giản là không quá quan trọng đối với một nhà sinh học.
Những nghi ngờ chồng chất
Làm vấn đề thêm rối, Mario Rodríguez Mestre, một nhà sinh học tại Đại học Copenhagen, cuối tuần qua nói rằng nhóm của ông đã khám phá ra mẫu cụ thể này từ trước, theo tờ New York Times. Mestre, người thường xuyên trò chuyện với Claude trong công việc, tự hỏi liệu nhóm Anthropic có học được từ những cuộc trò chuyện của ông hay không. Anthropic phủ nhận điều này, nhưng Mestre nói ông sẽ ngừng sử dụng Claude hoàn toàn.
Một phần vấn đề nằm ở chỗ các công ty AI không trình bày hệ thống của mình đơn thuần như công cụ để nhà khoa học sử dụng, giống như kính hiển vi hay siêu máy tính. Họ khẳng định chính hệ thống AI đang tạo ra phát hiện. Với một số người, cách tiếp cận đó không tương thích với cách khoa học thực sự vận hành, khi tri thức mới thường nảy sinh từ sự hợp tác và một kho công cụ ngày càng mở rộng.
Tiêu chuẩn đánh giá đang bị bóp méo
Cách đặt vấn đề này cũng khiến người ta hoài nghi hơn với tiến bộ thực sự khi nó xuất hiện. Thu hẹp 200.000 ứng viên xuống còn vài lựa chọn đáng khám phá là một kỳ công không nhỏ; đó là công việc khoa học chính đáng. Việc một chatbot đa dụng có thể làm công việc đó là điều đáng chú ý, ngay cả khi con người hỗ trợ định hướng và cuối cùng chạy thí nghiệm.
Nhưng một khi tiêu chuẩn là liệu chính Claude có tạo ra phát hiện hay không, tất cả điều đó trở thành bằng chứng cho một bên trong cuộc tranh luận chỉ có hai đáp án: đột phá hoặc thất bại.
Một khi đánh giá AI bằng việc liệu nó đã tạo ra phát hiện hay chưa, người ta cũng dễ dàng dịch chuyển cột mốc ngay cả sau khi nó thực sự ghi điểm. Đầu tháng này, OpenAI nói nhóm tác nhân của mình đã giải quyết một bài toán trị giá triệu đô trong toán học. Nhưng vài tuần sau, gần như mọi người hoài nghi AI trên bảng tin của tôi đều chia sẻ một bài viết đặt câu hỏi liệu đó có phải bài toán thực sự quan trọng không.
Bài học cho tương lai
Cần nói rõ, bài viết đó không lập luận rằng lời giải của OpenAI sai. Thay vào đó, nó cho rằng kết quả cụ thể đó có thể không phải là điều mà các nhà toán học quan tâm nhất. Cộng thêm cáo buộc từ một nhà toán học rằng các mô hình có thể đã dùng một phần công trình của ông mà không ghi nguồn, người ta bị dẫn tới suy nghĩ rằng hoặc OpenAI gian lận, hoặc lời giải không quan trọng. Hoặc cả hai.
Đó là một phần điều khiến Lucas Harrington, nhà sinh học viết bài chỉ trích thông báo của Anthropic, lo ngại. Ông kết thúc bằng một gợi ý: các công ty AI nên "đặt tiêu chuẩn cao ngay từ bây giờ, để khi AI thực sự khám phá ra một cơ chế sinh học hoàn toàn mới, mọi người hiểu được đó là điều lớn lao đến nhường nào."
Nhưng khi Sam Altman của OpenAI và Dario Amodei của Anthropic đang chạy đua để vượt mặt nhau, việc nâng cao tiêu chuẩn cho các đột phá khoa học do AI tạo ra có lẽ là điều cuối cùng họ nghĩ tới.
Góc nhìn cho độc giả Việt Nam
Với cộng đồng nghiên cứu và công nghệ Việt Nam, câu chuyện này mang lại bài học thực tế. Khi các doanh nghiệp và nhóm nghiên cứu trong nước bắt đầu ứng dụng AI vào khoa học, y tế hay dược phẩm, việc phân biệt rõ giữa "AI hỗ trợ tìm mẫu" và "AI tạo ra phát hiện" là cực kỳ quan trọng. Đừng để những tuyên bố hào nhoáng đánh lạc hướng khỏi giá trị thực của công cụ — và cũng đừng vội gạt bỏ những đóng góp âm thầm nhưng thiết thực mà AI mang lại cho quá trình nghiên cứu.

