NEEDLE: Chuẩn đánh giá tìm kiếm mà công cụ tìm kiếm của bạn không thể "học thuộc lòng"

Công nghệ27 tháng 8, 2026·7 phút đọc

NEEDLE là một benchmark mã nguồn mở, hoạt động liên tục do Keenable phát triển nhằm đo lường chất lượng công cụ tìm kiếm dành riêng cho AI agents. Khác với các benchmark tĩnh dễ bị overfitting và rò rỉ dữ liệu, NEEDLE sử dụng dữ liệu mới liên tục từ nhiều nguồn khác nhau, phản ánh đúng nhu cầu tìm kiếm thực tế của agent. Bài viết phân tích những hạn chế của benchmark hiện tại, lý do cần benchmark động và cách NEEDLE đang thay đổi cách đánh giá công cụ tìm kiếm.

NEEDLE: Chuẩn đánh giá tìm kiếm mà công cụ tìm kiếm của bạn không thể "học thuộc lòng"

NEEDLE: Chuẩn đánh giá tìm kiếm mà công cụ tìm kiếm của bạn không thể "học thuộc lòng"

Trong bối cảnh AI agents ngày càng chiếm phần lớn lưu lượng truy cập web, các chuẩn đánh giá (benchmark) tĩnh truyền thống đang bộc lộ những lỗ hổng nghiêm trọng về overfitting và rò rỉ dữ liệu. Keenable, một startup tìm kiếm cho AI vừa gọi vốn 26 triệu USD từ Accel và Conviction, đã giới thiệu NEEDLE – một benchmark mã nguồn mở, hoạt động liên tục với dữ liệu mới theo từng giờ, nhằm đo lường chính xác chất lượng của các công cụ tìm kiếm trước các tác vụ agentic đa dạng.

Bài viết này sẽ phân tích những khiếm khuyết của benchmark tĩnh, lý do NEEDLE được thiết kế như một "cỗ máy học tập" và cách nó đang vẽ lại bức tranh về hiệu suất của Google, Bing, Brave cũng như các startup tìm kiếm AI.

Vấn đề nan giải của các benchmark tĩnh

Hầu hết các benchmark hiện tại như BrowseComp hay SimpleQA đều sử dụng một bộ câu hỏi cố định, đóng băng theo thời gian. Điều này tạo điều kiện cho các hệ thống "gian lận" một cách tinh vi thông qua overfitting hoặc ghi nhớ câu trả lời.

Các hệ thống có thể overfit trên dữ liệu kiểm tra một cách gián tiếp. Qwen3-Max-Instruct đứng đầu bảng xếp hạng SimpleQA Verified của Epoch AI – một bảng xếp hạng mà chính Epoch cũng cảnh báo có khả năng bị ô nhiễm.

Tệ hơn, các tác nhân tìm kiếm chỉ cần tải benchmark trực tiếp từ HuggingFace để đọc đáp án giữa quá trình đánh giá. Việc cho phép thực thi Python hoặc Bash tùy chỉnh càng khiến việc này trở nên dễ dàng: một lệnh wget và một lệnh grep là "nhiệm vụ tìm kiếm" đã hoàn thành.

Ngay cả khi không có rò rỉ dữ liệu, việc ghi nhớ cũng làm sai lệch kết quả. Một mô hình đã "thuộc lòng" đáp án sẽ bỏ qua phần "khó tìm" và truy vấn trực tiếp kết quả cuối cùng, khiến benchmark mất đi ý nghĩa vốn có.

Giải pháp NEEDLE: Benchmark động, dữ liệu luôn mới

NEEDLE (viết tắt của News, Everyday, Expert, Deep-tail, và Legal Evaluation) được xây dựng từ các nguồn dữ liệu công khai, bao phủ các loại truy vấn đặc trưng cho nhu cầu tìm kiếm của agent:

  • News: Các câu chuyện mới và đang phát triển, được tạo mới hàng giờ từ nguồn RSS và Google Trends.
  • Finance: Các truy vấn về công ty và hồ sơ SEC, đáp án lấy từ Wikidata, GLEIF, và SEC XBRL.
  • Scholar: Tìm kiếm tài liệu chuyên môn, từ tiêu đề bị suy giảm đến mô tả "nửa nhớ nửa quên".
  • AgenticRare: Các thực thể hiếm, tên gọi dài, lấy mẫu từ nhật ký tìm kiếm thực tế của các agent.
  • Legal: Tìm kiếm các bản án cụ thể hoặc phần của Bộ luật Liên bang Hoa Kỳ.

Điểm mấu chốt là mọi tác vụ được chạy lại hàng ngày hoặc hàng giờ trên một tập truy vấn mới. Điều này khiến việc ghi nhớ hay rò rỉ dữ liệu trở nên gần như bất khả thi.

Mô tả các loại truy vấn trong NEEDLEMô tả các loại truy vấn trong NEEDLE

Kết quả so sánh và phát hiện bất ngờ

NEEDLE được sử dụng để so sánh Keenable với Google, Bing, Brave cùng các startup tìm kiếm AI như Tavily, Parallel, Exa. Kết quả cho thấy một sự phân hóa rõ rệt:

  • Các truy vấn chứa tiêu đề bài báo hoặc sự kiện công ty gần như đã được giải quyết hoàn toàn.
  • Truy vấn từ khóa dựa trên chi tiết toàn văn giúp phân biệt các công cụ index toàn bộ nội dung với những công cụ chỉ index metadata.
  • Với mô tả ngôn ngữ tự nhiên và "nửa nhớ", các công cụ dựa trên lexical gần như ngừng hoạt động.
  • Tập khó nhất là AgenticRare – truy vấn về thực thể hiếm từ log thực tế của agent. Ngay cả công cụ tốt nhất cũng bỏ sót nhiều kết quả mà "tập thể" các công cụ khác tìm thấy.

Khoảng cách giữa chất lượng hiện tại và khả năng đạt được càng lớn khi tập truy vấn càng giống với cách agents thực sự tìm kiếm.

Biểu đồ so sánh hiệu suất các công cụ tìm kiếmBiểu đồ so sánh hiệu suất các công cụ tìm kiếm

Một phát hiện đáng chú ý khác là sự phụ thuộc lẫn nhau giữa các công cụ tìm kiếm. Bằng cách phân tích "tỷ lệ sai chung" – khi hai công cụ cùng trả về những tài liệu không liên quan giống nhau cho cùng một truy vấn – NEEDLE cho thấy một số hệ thống có vẻ dùng chung một index nguồn. Điều này giải thích vì sao các công cụ tự xây dựng index riêng, tối ưu cho agent, lại có chất lượng vượt trội trên tập AgenticRare.

Vì sao sở hữu index là chìa khóa?

Theo Keenable, việc liên kết (federating) các công cụ tìm kiếm khác có một trần giới hạn: bạn không thể cải thiện khả năng truy xuất mà bạn không sở hữu. Việc thuê index của người khác chỉ cho phép cải thiện phần ngọn như sắp xếp lại kết quả hay thay đổi snippet.

Sở hữu index độc lập mở ra ba lợi thế lớn:

  • Độc nhất về dữ liệu: Có thể truy xuất các tài liệu mà không công cụ nào khác có, giúp agent trả lời những câu hỏi trước đây không thể trả lời.
  • Kiểm soát độ trễ: Keenable hiện đạt p50 là 200ms và đặt mục tiêu p95 cũng là 200ms – một yếu tố quan trọng trong các vòng lặp tác vụ của agent.
  • Điểm mạnh khi kết hợp (ensembling): Kết hợp nhiều index độc lập mang lại độ phủ tốt hơn từng index riêng lẻ, khác hẳn việc "tái chế" index của người khác.

Agents khác con người, và đang thay đổi liên tục

Bài viết chỉ ra sự khác biệt cơ bản trong hành vi tìm kiếm giữa con người và AI agents. Con người thường gửi một truy vấn duy nhất và "lười" đọc sâu. Agents thì khác: chúng tìm kiếm theo cụm, thường cách nhau vài giây do gọi song song, và liên tục tinh chỉnh truy vấn theo các mẫu như thêm bộ lọc site:, trích dẫn chính xác, thu hẹp phạm vi ngày, hoặc loại bỏ từ khóa.

Một nghiên cứu SIGIR'26 trên 14 triệu yêu cầu tìm kiếm agentic cho thấy agents ít mắc lỗi chính tả hơn con người gấp 3 lần, đồng thời bỏ qua các giả định mà bộ nhớ đệm (caching) và sửa lỗi chính tả được xây dựng dựa trên.

Điều đáng nói là agents đang "hồi sinh" các toán tử tìm kiếm mà con người đã bỏ từ lâu, đồng thời cách chúng tìm kiếm thay đổi theo từng mô hình mới. Không công cụ nào có thể thích nghi một lần là xong.

Các công cụ tìm kiếm truyền thống như Google được tối ưu cho con người: tối ưu cho click, thời gian lưu trú, và đề xuất video. Đây là lựa chọn hợp lý cho người dùng hiện tại, nhưng lại là "ngõ cụt" cho các agent – vì video là một khối gần như không thể truy xuất nội dung (opaque blob) đối với máy.

Kết luận: Tương lai thuộc về cỗ máy học tập

NEEDLE là một bước tiến quan trọng trong việc đo lường và cải thiện chất lượng tìm kiếm cho AI agents. Bằng cách hoạt động liên tục và sử dụng dữ liệu động, nó không chỉ phơi bày những hạn chế của các benchmark tĩnh mà còn định nghĩa lại câu hỏi trọng tâm: không phải ai giỏi nhất hôm nay, mà là ai đang cải thiện nhanh nhất.

Quan điểm của Keenable rất rõ ràng: các công cụ tìm kiếm nên cải thiện từ việc được sử dụng theo cách mà chất lượng không phải là kết quả của một nỗ lực kỹ thuật đơn thuần, mà là một thuộc tính của kiến trúc – một "cỗ máy học tập" thực thụ. Trong hai năm tới, tìm kiếm sẽ trở thành một trong những hạ tầng giá trị nhất cho AI, và giá trị đó sẽ thuộc về những cỗ máy biết học từ chính người dùng của mình.

Logo và giao diện NEEDLE BenchmarkLogo và giao diện NEEDLE Benchmark

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗