Giả thuyết Nữ hoàng Đỏ: Hướng đi mới cho AI tự cải tiến không chạm trần

Công nghệ16 tháng 8, 2026·6 phút đọc

Các nhà nghiên cứu từ Đại học Cambridge, NVIDIA và Flower Labs đã phát triển 'Red Queen Gödel Machine' – một phương pháp cho phép AI tự cải tiến vượt qua giới hạn của các bài kiểm tra cố định bằng cách để bộ đánh giá cùng tiến hóa với tác tử. Phương pháp này không chỉ cải thiện hiệu suất đáng kể trong viết bài khoa học và chứng minh toán học mà còn giúp giảm chi phí tính toán tới 13 lần nhờ kết hợp mô hình mã nguồn mở.

Giả thuyết Nữ hoàng Đỏ: Hướng đi mới cho AI tự cải tiến không chạm trần

Giả thuyết Nữ hoàng Đỏ: Bước đột phá giúp AI tự cải tiến không còn 'dậm chân tại chỗ'

Các nhà nghiên cứu từ Đại học Cambridge hợp tác cùng NVIDIA và Flower Labs vừa công bố một phương pháp mang tên Red Queen Gödel Machine, cho phép các tác tử AI tự cải tiến vượt qua "trần đánh giá" mà chúng thường gặp phải. Thay vì cải thiện AI dựa trên một bài kiểm tra cố định, hệ thống mới cho phép bộ đánh giá (evaluator) và tác tử cùng tiến hóa song song, liên tục nâng cao tiêu chuẩn.

Điểm đáng chú ý là phương pháp này còn giúp cắt giảm đáng kể chi phí tài nguyên tính toán. Khi kết hợp mô hình mã nguồn mở NVIDIA Nemotron 3 Ultra với công cụ đắt tiền như ChatGPT-5.5, chi phí token tìm kiếm đã giảm khoảng 13 lần mà vẫn đạt hiệu suất tương đương trong một số tác vụ.

Vấn đề: "Trần kính" của các bài kiểm tra cố định

Trước đây, các tác tử AI có thể tự cải thiện bằng cách tự sửa mã nguồn, thử nghiệm các phiên bản khác nhau và giữ lại những thay đổi tốt hơn. Tuy nhiên, quá trình này luôn bị giới hạn bởi một bộ đánh giá, benchmark hoặc bộ kiểm thử cố định. Khi AI đã học hết những gì tín hiệu cố định đó có thể phân biệt, tốc độ cải thiện sẽ chững lại hoặc dừng hẳn.

"Một tác tử tự cải tiến chỉ có thể giỏi bằng bài kiểm tra chấm điểm nó. Bài kiểm tra không chỉ đo lường tiến trình, mà nó định nghĩa tiến trình – do đó hiệu quả của bài kiểm tra trở thành trần nhà mà tác tử không thể trèo qua." – Alex Iacob, nghiên cứu sinh tiến sĩ tại Phòng thí nghiệm Hệ thống Máy học (Machine Learning Systems Lab) dưới sự hướng dẫn của Giáo sư Nic Lane.

Giải pháp: Đồng tiến hóa tác tử và bộ đánh giá

Ý tưởng chính của Red Queen Gödel Machine là cho phép cả tác tử và bộ đánh giá cùng phát triển. Thay vì cố định bài kiểm tra, hệ thống sẽ tìm kiếm qua nhiều phiên bản AI khác nhau, đồng thời cải thiện chính bộ đánh giá.

Quy trình hoạt động của hệ thống được chia thành nhiều giai đoạn:

  • Trong mỗi giai đoạn, bộ đánh giá được giữ cố định để tiến trình có thể được đo lường một cách đáng tin cậy
  • Tại các điểm kiểm tra (checkpoints), một bộ đánh giá mạnh hơn có thể thay thế bộ cũ nếu nó hoạt động tốt hơn trên các ví dụ ground-truth đáng tin cậy
  • Điểm số từ bộ đánh giá cũ sau đó được loại bỏ, để giai đoạn tiếp theo được dẫn dắt bởi tiêu chuẩn mới khắt khe hơn

Điều này tạo ra một vòng lặp tự cải tiến nơi tác tử và bộ đánh giá cùng tiến bộ, trong khi hệ thống vẫn được neo vào các kiểm tra đáng tin cậy.

Minh họa khái niệm Nữ hoàng Đỏ trong AIMinh họa khái niệm Nữ hoàng Đỏ trong AI

Kết quả ấn tượng trong khoa học và toán học

Trong các thử nghiệm, Red Queen Gödel Machine đã cho thấy hiệu quả vượt trội so với các phương pháp self-improving trước đây ở hai lĩnh vực cụ thể:

  • Viết và phản biện bài báo khoa học: Các tác tử đồng tiến hóa đạt được tỷ lệ chấp nhận cao hơn từ 1.78 đến 1.86 lần dưới một hội đồng đa dạng gồm các agent-as-a-judge
  • Viết và chấm điểm chứng minh toán cấp độ Olympic: Các bộ chấm điểm đồng tiến hóa đạt độ chính xác ground-truth cao hơn 9%

Nguồn gốc cái tên "Nữ hoàng Đỏ"

Cái tên thú vị này được lấy cảm hứng từ nhân vật Nữ hoàng Đỏ (Red Queen) trong cuốn tiểu thuyết Through the Looking-Glass của Lewis Carroll – người nổi tiếng với câu nói với Alice rằng: "Ở đây, cô phải chạy nhanh hết sức chỉ để giữ nguyên vị trí của mình." Giả thuyết Nữ hoàng Đỏ trong sinh học tiến hóa (đề xuất năm 1973) cũng dựa trên nhân vật này, cho rằng các loài phải liên tục thích nghi, tiến hóa và sinh sôi để tồn tại khi đối đầu với các loài khác cũng đang không ngừng tiến hóa.

Giảm chi phí với mô hình mã nguồn mở

Một phát hiện quan trọng khác từ nghiên cứu là việc sử dụng các mô hình mã nguồn mở trong một phần công việc có thể giảm đáng kể chi phí phát triển hệ thống AI tự cải tiến.

Trong một thí nghiệm, nhóm nghiên cứu đã kết hợp NVIDIA Nemotron 3 Ultra với ChatGPT-5.5 để đồng tiến hóa các AI viết và phản biện bài khoa học. Ở nhiệm vụ phản biện bài báo, thiết lập lai này đạt hiệu suất gần bằng khi chỉ dùng ChatGPT, nhưng chi phí token tìm kiếm chỉ bằng khoảng 1/13.

"Đây là một kết quả hẹp, và chúng ta nên cẩn trọng không phóng đại nó. Nhưng nó cũng chỉ ra nơi phương pháp này có thể đi. Nếu các mô hình mở có thể đảm nhận phần lớn việc tìm kiếm trong khi các mô hình frontier mạnh hơn dẫn dắt quá trình cải tiến cấp cao, thì chúng ta có một con đường khả thi để xây dựng các hệ thống tác tử mở mạnh mẽ hơn nhiều với chi phí thấp hơn nhiều." – Giáo sư Nic Lane, đồng tác giả nghiên cứu.

Đồng quan điểm, Daniel Burkhardt, Giám đốc Quan hệ Nhà phát triển tại NVIDIA, nhận định: "Nỗ lực này cho thấy các mô hình mở có thể đóng vai trò quan trọng trong các hệ thống tác tử tiên tiến. Các mô hình NVIDIA Nemotron được thiết kế để hiệu quả và có năng lực cho các khối lượng công việc suy luận và tác tử, và công trình này cho thấy chúng có thể được sử dụng như một phần của vòng lặp tự cải tiến rộng hơn."

Minh họa quá trình đồng tiến hóa giữa tác tử và bộ đánh giáMinh họa quá trình đồng tiến hóa giữa tác tử và bộ đánh giá

Hướng đi tương lai

Nhóm nghiên cứu thừa nhận công trình vẫn còn ở giai đoạn sơ bộ, và cần có các chân trời tìm kiếm dài hơn để hiểu phương pháp này có thể mở rộng đến đâu. Tuy nhiên, kết quả cho thấy sự xuất hiện của một lớp hệ thống tự cải tiến mới, nơi tác tử và bộ đánh giá tự đệ quy nâng đỡ lẫn nhau, mở ra con đường hướng tới trí tuệ AI tác tử mạnh mẽ hơn, hiệu quả hơn và mở hơn.

Bài báo "The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators" đã được đăng tải trên arXiv. Phương pháp bên dưới sẽ được mã nguồn mở để cộng đồng rộng rãi có thể áp dụng, trong khi nhóm nghiên cứu tiếp tục điều tra cách tiếp cận tự cải tiến này hoạt động trên nhiều tác vụ AI khác nhau với quy mô thử nghiệm lớn hơn đáng kể.

Biểu tượng Athena Swan của khoaBiểu tượng Athena Swan của khoa

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗