DoorDash: Từ mô hình dự đoán đơn lẻ đến nền tảng đề xuất tác tử (Agentic) quy mô lớn
Sudeep Das từ DoorDash trình bày cách công ty chuyển từ các mô hình dự đoán một lần sang nền tảng đề xuất tác tử, sử dụng bộ nhớ người dùng dựa trên ngôn ngữ tự nhiên, ID ngữ nghĩa RQ-VAE cho danh mục và tìm kiếm có cơ sở để tăng đáng kể độ liên quan và tỷ lệ chuyển đổi. Đây là hướng đi quan trọng cho các hệ thống gợi ý thương mại điện tử hiện đại.
DoorDash: Từ mô hình dự đoán đơn lẻ đến nền tảng đề xuất tác tử (Agentic) quy mô lớn
Trong bối cảnh người dùng ngày càng kỳ vọng cao về trải nghiệm cá nhân hóa, các hệ thống gợi ý truyền thống dựa trên dự đoán một lần đang dần bộc lộ giới hạn. Tại hội nghị công nghệ gần đây, Sudeep Das từ DoorDash đã chia sẻ chi tiết về hành trình chuyển đổi từ kiến trúc cũ sang một nền tảng đề xuất tác tử (agentic) tiên tiến, hứa hẹn mang lại bước nhảy vọt về độ chính xác và hiệu quả kinh doanh.
Sự cần thiết của một nền tảng tác tử
DoorDash, một trong những nền tảng giao đồ ăn lớn nhất tại Mỹ, từng phụ thuộc vào các mô hình học máy "one-shot" — tức chỉ dự đoán một lần dựa trên ngữ cảnh hiện tại. Tuy nhiên, khi nhu cầu người dùng phức tạp hơn (ví dụ: đặt đồ ăn theo bữa, theo tâm trạng, hoặc kết hợp nhiều món), phương pháp này không còn đủ khả năng đáp ứng.
Das nhấn mạnh rằng mục tiêu của nền tảng mới là tạo ra một hệ thống có khả năng hiểu ngữ cảnh liên tục và đưa ra các hành động gợi ý logic theo thời gian thực.
"Chúng tôi không chỉ dự đoán món ăn tiếp theo, mà xây dựng một hệ thống hiểu được toàn bộ bối cảnh — thời điểm, vị trí, lịch sử và ý định — để có thể chủ động đề xuất."
Bộ nhớ người dùng dựa trên ngôn ngữ tự nhiên
Một điểm đáng chú ý trong bài trình bày là việc sử dụng bộ nhớ người dùng dạng ngôn ngữ (language-native consumer memory). Thay vì lưu trữ các vector phân loại cứng nhắc, DoorDash mã hóa sở thích và hành vi của người dùng thành các biểu diễn văn bản trung gian.
Điều này giúp hệ thống dễ dàng kết hợp với các mô hình ngôn ngữ lớn (LLM) để suy luận linh hoạt hơn, ví dụ: nhận ra rằng nếu một người dùng từng đặt phở vào các tối thứ Sáu, hệ thống có thể đề xuất các món ăn nhẹ hoặc nước uống liên quan mà không cần lập trình cứng.
ID ngữ nghĩa RQ-VAE cho danh mục
Để biểu diễn danh mục sản phẩm (hàng chục nghìn nhà hàng và món ăn) một cách hiệu quả, DoorDash sử dụng RQ-VAE (Residual Quantized Variational Autoencoder) để tạo ra các ID ngữ nghĩa thay vì ID số nguyên hoặc vector thô.
- RQ-VAE giúp nén thông tin sản phẩm thành các token rời rạc có cấu trúc.
- Các token này thể hiện được mối quan hệ ngữ nghĩa giữa các món (ví dụ: "pizza" và "burrito" có thể dùng chung một số token chung).
- Nhờ đó, mô hình có thể gợi ý các mặt hàng chưa từng xuất hiện trong dữ liệu lịch sử của người dùng, nhưng vẫn có tính tương đồng về đặc điểm.
Đây là một hướng đi giúp giảm tải tính toán và tăng độ bao phủ của hệ thống.
Tìm kiếm có cơ sở (Grounded Search)
Một trụ cột thứ ba là grounded search — tìm kiếm được "neo" chặt với dữ liệu thực tế chứ không chỉ dựa vào suy luận ngôn ngữ thuần túy. Khi người dùng gõ từ khóa, hệ thống kết hợp kết quả truy vấn với danh mục ID ngữ nghĩa và bộ nhớ người dùng.
Việc này đảm bảo rằng các đề xuất không bị "ảo giác" từ LLM, mà luôn bám sát vào kho hàng có thật cũng như các ràng buộc về thời gian giao hàng, giá cả và đánh giá.
Kết quả và ý nghĩa cho thị trường Việt Nam
Theo chia sẻ của Das, cách tiếp cận này đã giúp DoorDash tăng đáng kể độ liên quan của gợi ý và tỷ lệ chuyển đổi trên toàn nền tảng, đồng thời giảm độ trễ phản hồi nhờ tối ưu hóa kiến trúc.
Với các doanh nghiệp công nghệ Việt Nam — đặc biệt là các nền tảng giao đồ ăn, bán lẻ hoặc thương mại điện tử — bài học từ DoorDash cho thấy:
- Việc đặt bộ nhớ người dùng lên trung tâm thay vì chỉ dựa vào click-stream là một bước tiến lớn.
- Xây dựng các ID ngữ nghĩa cho danh mục có thể giúp hệ thống gợi ý hoạt động tốt hơn với dữ liệu thưa, một vấn đề thường gặp tại các thị trường đang phát triển.
- Việc kết hợp LLM với tìm kiếm truyền thống (grounded) là cách an toàn và hiệu quả để nâng cao trải nghiệm mà không gặp rủi ro sai lệch.
Tóm lại, bài trình bày của Sudeep Das không chỉ là một bức tranh kỹ thuật chi tiết, mà còn là một "kim chỉ nam" cho bất kỳ đội ngũ nào muốn hiện đại hóa hệ thống gợi ý của mình trong kỷ nguyên AI tác tử.
