Tự tay xây dựng công cụ tìm kiếm riêng để 'khai tử' Google

13 tháng 8, 2026·4 phút đọc

Một nhà phát triển phần mềm tại Anh đã tạo ra Marlin, một công cụ tìm kiếm mã nguồn mở tự xây dựng với chi phí chỉ khoảng 10 USD cho thuê GPU đám mây. Marlin sử dụng mô hình ngôn ngữ nhỏ để phân loại, gắn thẻ và lập chỉ mục hơn 560.000 trang web theo sở thích cá nhân, giúp người dùng thoát khỏi sự phụ thuộc vào các kết quả tìm kiếm thương mại hóa của Google.

Tự tay xây dựng công cụ tìm kiếm riêng để 'khai tử' Google

Tự tay xây dựng công cụ tìm kiếm riêng để 'khai tử' Google

Nếu bạn đã chán ngán việc kết quả tìm kiếm bị lấn át bởi những nội dung thương mại hóa, thì một nhà phát triển tại Anh đã chứng minh rằng bạn hoàn toàn có thể tự xây dựng công cụ tìm kiếm cho riêng mình. Dự án Marlin của Alex Morley-Finch, một kỹ sư phần mềm sống tại Nottingham, đã tạo ra một công cụ tìm kiếm cá nhân với chi phí cực rẻ, chỉ khoảng 10 USD cho thời gian sử dụng GPU đám mây.

Thay vì phụ thuộc vào các thuật toán phức tạp và hệ thống máy chủ khổng lồ, Morley-Finch xây dựng Marlin với một cách tiếp cận hoàn toàn khác: một trình thu thập dữ liệu chỉ tập trung vào trang chủ, kết hợp với một mô hình ngôn ngữ nhỏ để tự động phân loại và gắn thẻ nội dung.

Ý tưởng đằng sau Marlin

Trong bài viết chia sẻ về dự án, Morley-Finch chia sẻ rằng anh muốn có một công cụ tìm kiếm cho những thứ mà anh thực sự quan tâm, như các trang portfolio cá nhân, tạp chí độc lập, dự án nghệ thuật kỳ lạ, hoặc phần mềm do một người tự phát triển. "Đó là những trường hợp mọi người tự tay làm điều gì đó và chia sẻ lên internet", anh giải thích.

Anh mô tả Marlin một cách đơn giản: "Một trình thu thập dữ liệu chỉ nhìn vào trang chủ, một mô hình ngôn ngữ nhỏ đọc từng trang và viết tên, vài câu mô tả, một danh mục và một số thẻ. Không quét IP, không Redis, không lưu trữ toàn bộ HTML, không có bộ lập lịch thu thập lại và không hỗ trợ đa người dùng."

Kiến trúc bốn thành phần

Marlin hoạt động dựa trên bốn quy trình chính:

  • Fetcher (Trình tải dữ liệu): Thu thập các tên miền theo danh sách ưu tiên.
  • Worker (Trình xử lý): Gửi yêu cầu đến một mô hình ngôn ngữ tương thích OpenAI nhỏ để phân tích nội dung.
  • Steward (Trình giám sát): Ngăn chặn các trang chất lượng thấp lọt vào chỉ mục tìm kiếm.
  • API và giao diện web: Cho phép người dùng theo dõi quá trình và thực hiện tìm kiếm với các bộ lọc.

Thất bại đầu tiên và bài học kinh nghiệm

"Phiên bản đầu tiên hoạt động trong vài giờ. Chỉ cần trỏ nó vào một mẫu tên miền, xem các trang được tóm tắt và tìm kiếm chúng. Tuyệt vời", Morley-Finch kể lại. "Nhưng đến chiều Chủ nhật, tôi nhìn vào những gì đã được lập chỉ mục và nhận ra đó là một web sai lầm."

Hơn 90% kết quả thu thập ban đầu là "các trang web doanh nghiệp và tài liệu kỹ thuật", thay vì những nội dung cá nhân mà anh mong muốn. Thay vì chặn các tên miền cụ thể, Morley-Finch đã xây dựng một hệ thống trọng số (weighting system) để đẩy các trang mong muốn lên đầu hàng đợi thu thập và đẩy những trang không mong muốn xuống cuối danh sách.

Thách thức lớn nhất: Phân loại và gắn thẻ

Một vấn đề lớn mà Morley-Finch gặp phải là việc phân loại và gắn thẻ khi để mô hình ngôn ngữ tự do sáng tạo. "Tôi để mô hình tự phát minh ra tên danh mục và thẻ, với lý thuyết rằng nó sẽ dạy tôi cách phân loại thay vì tôi đoán trước", anh giải thích. Kết quả là anh có tới 671 danh mục khác nhau (nhiều danh mục chỉ dùng một lần) và hơn 121.000 thẻ (hơn một nửa chỉ được sử dụng một lần duy nhất).

Morley-Finch phải xây dựng một công cụ gộp thủ công để dọn dẹp đống hỗn độn này, và anh thừa nhận rằng thiết kế này "khó có thể mở rộng quy mô ngoài một dự án sở thích" bởi vì việc để mô hình tự do sáng tạo sẽ nhanh chóng vượt khỏi tầm kiểm soát.

Kết luận từ tác giả

Dù còn nhiều hạn chế, Morley-Finch vẫn tin rằng bất kỳ ai sẵn sàng dành một ngày cuối tuần để mày mò đều có thể tái tạo dự án này. "Tôi nghĩ điều này rất khả thi trong một ngày cuối tuần, và đủ rẻ để chi phí GPU không phải là lý do khiến bạn không thử", anh viết. "Mã nguồn sẽ được công bố công khai, vì vậy bạn có thể trỏ trình thu thập dữ liệu của mình đến bất cứ nơi nào sự tò mò dẫn dắt."

Dự án Marlin đã được đăng tải trên GitHub với đầy đủ hướng dẫn chi tiết, bao gồm cách xây dựng danh sách trọng số dựa trên ưu tiên cá nhân, cùng với tùy chọn thuê GPU đám mây nếu phần cứng của bạn không đủ mạnh. Đây là một giải pháp thú vị cho những ai đang tìm cách thoát khỏi "sự xâm lấn" của Google và các công cụ tìm kiếm thương mại khác.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗