Google ra mắt Android Bench 2.0: Đánh giá AI theo tác vụ dài hạn và cách chấm điểm liên tục

Phần mềm09 tháng 10, 2026·5 phút đọc

Google vừa phát hành Android Bench 2.0, bản nâng cấp lớn cho khung đánh giá các mô hình AI và tác nhân (agent) trong lĩnh vực phát triển ứng dụng Android. Phiên bản mới bổ sung tác vụ dài hạn (LHT), đánh giá dựa trên tác nhân và cơ chế chấm điểm liên tục, giúp phản ánh chính xác hơn năng lực xử lý các bài toán lập trình phức tạp gồm nhiều bước.

Google vừa công bố Android Bench 2.0, một bản nâng cấp quan trọng cho khung đánh giá (benchmark) dùng để đo lường năng lực của các mô hình AI và tác nhân (agent) khi giải quyết các bài toán phát triển ứng dụng Android. Đây được xem là bước tiến đáng chú ý trong bối cảnh các mô hình ngôn ngữ lớn ngày càng được kỳ vọng có thể tham gia trực tiếp vào quy trình viết mã.

Điểm nhấn của phiên bản này là việc bổ sung tác vụ dài hạn (Long-Horizon Tasks — LHT), cơ chế đánh giá dựa trên tác nhân và phương pháp chấm điểm liên tục, nhằm phản ánh sát hơn hiệu suất thực tế của AI trong những công việc lập trình nhiều bước.

Vì sao các benchmark cũ không còn đủ?

Các bộ đánh giá truyền thống thường chỉ kiểm tra khả năng sinh mã ở một bài toán đơn lẻ, với kết quả được chấm theo kiểu "đúng hoặc sai". Cách tiếp cận này bộc lộ nhiều hạn chế khi AI ngày càng được dùng như một trợ lý lập trình thực thụ.

Trong thực tế, một lập trình viên Android hiếm khi chỉ giải quyết một hàm riêng lẻ. Họ phải đọc hiểu toàn bộ dự án, sửa nhiều tệp tin, chạy thử, gỡ lỗi và lặp lại quy trình đó cho đến khi tính năng hoạt động đúng. Các benchmark cũ gần như không đo được năng lực này.

Android Bench 2.0 ra đời để lấp khoảng trống đó, tập trung vào những gì mà giới nghiên cứu gọi là "tác vụ dài hạn" — chuỗi hành động kéo dài, đòi hỏi mô hình duy trì ngữ cảnh và ra quyết định nhất quán qua nhiều bước.

Tác vụ dài hạn: đo năng lực "làm việc thật"

Theo mô tả từ Google, tác vụ dài hạn là những bài toán mà mô hình phải hoàn thành thông qua nhiều bước nối tiếp nhau, thay vì chỉ đưa ra một câu trả lời duy nhất.

  • Mô hình phải hiểu mục tiêu tổng thể của tính năng cần xây dựng.
  • Tự chia nhỏ công việc thành các bước hợp lý.
  • Thực hiện thay đổi trên nhiều tệp tin trong dự án.
  • Tự kiểm tra, phát hiện lỗi và điều chỉnh nếu cần.

Kiểu đánh giá này gần với cách con người làm việc hơn, đồng thời phơi bày rõ những điểm yếu của AI như mất ngữ cảnh giữa các bước, sửa sai lan sang phần khác của mã nguồn, hay bỏ dở công việc giữa chừng.

Đánh giá dựa trên tác nhân

Điểm đổi mới thứ hai là đánh giá dựa trên tác nhân. Thay vì yêu cầu mô hình sinh ra một đoạn mã rồi dừng lại, Android Bench 2.0 cho phép mô hình hoạt động như một tác nhân: tự chạy công cụ, đọc kết quả trả về và điều chỉnh hành động tiếp theo.

Cách đánh giá này mô phỏng đúng vòng lặp mà các trợ lý lập trình AI hiện nay đang hướng tới: viết mã — chạy thử — đọc lỗi — sửa — chạy lại.

Điều này có nghĩa là kết quả benchmark sẽ phản ánh năng lực của mô hình khi được tích hợp vào các công cụ như trợ lý trong IDE hay hệ thống tự động sửa lỗi, chứ không chỉ là khả năng sinh mã thuần túy.

Chấm điểm liên tục thay cho đúng/sai

Cơ chế chấm điểm liên tục là thay đổi thứ ba đáng chú ý. Thay vì chỉ tính điểm khi bài toán được giải hoàn toàn, hệ thống sẽ ghi nhận cả những tiến bộ từng phần.

  • Một mô hình giải đúng một nửa yêu cầu sẽ được điểm tương ứng, thay vì bị coi là thất bại hoàn toàn.
  • Điều này giúp phân biệt rõ hơn giữa các mô hình có năng lực gần nhau.
  • Kết quả cũng phản ánh chính xác hơn mức độ hữu ích thực tế, bởi trong công việc lập trình, tiến bộ một phần vẫn có giá trị.

Cách chấm điểm này đặc biệt quan trọng với các tác vụ dài hạn, nơi việc hoàn thành trọn vẹn cả chuỗi hành động là rất khó và hiếm mô hình nào đạt được.

Ý nghĩa với cộng đồng phát triển Android

Với các nhóm phát triển ứng dụng tại Việt Nam, những thay đổi này có thể ảnh hưởng trực tiếp đến cách lựa chọn công cụ AI hỗ trợ lập trình. Khi các benchmark phản ánh sát năng lực thực tế hơn, doanh nghiệp có thêm cơ sở để đánh giá xem mô hình nào thực sự tiết kiệm thời gian trong các dự án Android quy mô lớn.

Bên cạnh đó, việc tập trung vào tác vụ dài hạn cũng cho thấy xu hướng chung của ngành: AI đang chuyển từ vai trò "gợi ý mã" sang vai trò tác nhân tự chủ, có thể đảm nhận những phần việc kéo dài và phức tạp hơn.

Android Bench 2.0 hiện được xem là một trong những bộ đánh giá chuyên biệt hiếm hoi cho nền tảng Android, và nhiều khả năng sẽ trở thành thước đo tham chiếu cho các mô hình AI lập trình trong thời gian tới.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗