Perplexity hợp tác Nvidia ra mắt Portable Computer: AI agent chạy hoàn toàn cục bộ, chi phí token bằng 0
Perplexity vừa công bố Portable Computer, phiên bản nền tảng agent AI chạy hoàn toàn trên phần cứng người dùng sở hữu, khởi đầu với siêu máy tính để bàn DGX Spark của Nvidia và các máy Linux trang bị GPU RTX. Sản phẩm này đánh dấu nỗ lực táo bạo nhất nhằm đưa khối lượng công việc AI agent nghiêm túc rời khỏi đám mây, với toàn bộ mô hình, tệp tin và quy trình đều nằm trên thiết bị, không tiêu tốn tín dụng thanh toán nào. Đáng chú ý, mọi tác vụ mặc định khởi chạy cục bộ và chỉ gửi dữ liệu lên đám mây khi có sự cho phép của người dùng.

Perplexity vừa chính thức ra mắt Portable Computer, một phiên bản của nền tảng agent AI "Computer" chạy hoàn toàn trên phần cứng người dùng đã sở hữu — khởi đầu với siêu máy tính để bàn DGX Spark của Nvidia và các máy Linux trang bị GPU RTX. Đây là một trong những nỗ lực táo bạo nhất cho đến nay nhằm chuyển khối lượng công việc AI agent nghiêm túc từ đám mây xuống thiết bị cục bộ.
Trọn bộ ngăn xếp AI cục bộ trong một ứng dụng duy nhất
Portable Computer tái hiện trải nghiệm của Perplexity Computer — nền tảng agent cho công việc tri thức — ngay trên máy người dùng. Toàn bộ hệ thống bao gồm mô hình ngôn ngữ cục bộ, bộ khung agent (agent harness), công cụ suy luận, trình kết nối và hộp cát bảo mật được đóng gói trong một ứng dụng duy nhất. Điểm mấu chốt nằm ở sự đóng gói này: với hầu hết các ngăn xếp AI cục bộ hiện nay, người dùng phải tự lắp ráp và vận hành từng thành phần riêng lẻ — tải trọng số mô hình, dựng máy chủ suy luận, kết nối công cụ và tinh chỉnh hiệu suất.
"Trong lịch sử, việc khởi động một ngăn xếp AI cục bộ thực sự rất đau đớn," Nate, phó chủ tịch kỹ thuật hạ tầng và doanh nghiệp của Perplexity, chia sẻ trong buổi họp báo thứ Hai. "Với Portable Computer, chúng tôi tập trung vào việc tạo ra trải nghiệm đơn giản, trực tiếp để người dùng có thể bắt đầu nhanh chóng."
Trong một buổi demo, hệ thống đóng vai nhà đầu tư cá nhân xem xét thư mục chứa các tài liệu đầu tư nhạy cảm — loại dữ liệu tài chính mà nhiều người e ngại tải lên dịch vụ đám mây. Chạy mô hình Qwen 27B tham số trên DGX Spark, agent xem xét từng tài liệu và phát hiện các trường hợp nhà đầu tư phải trả phí không cần thiết. Giao diện thường hiển thị số dư tín dụng đám mây "đứng yên ở con số 0," Nate nhấn mạnh, "vì mọi thứ đang diễn ra trên thiết bị."
Một demo khác cho thấy khía cạnh kết hợp: agent phân tích dữ liệu CSV cục bộ rồi đẩy báo cáo hoàn chỉnh lên kênh Slack qua hệ sinh thái trình kết nối — minh chứng rằng ưu tiên cục bộ không có nghĩa là mất kết nối.
Tại sao thiết kế đồng bộ mô hình và bộ khung agent vượt trội hơn framework thông dụng
Cùng với sản phẩm, Perplexity công bố bài nghiên cứu lập luận rằng agent cục bộ hiệu quả đòi hỏi mô hình và bộ khung agent phải được thiết kế cùng nhau. Các framework thông dụng thường giả định một mô hình tiên phong có thể hấp thụ ngữ cảnh khổng lồ, điều hướng hệ thống công cụ phức tạp và lập kế hoạch dài hạn — điều mà mô hình nhỏ cục bộ khó đáp ứng.
Perplexity phát hiện rằng dù Qwen 3.8 27B quảng cáo ngữ cảnh 260.000 token, mô hình này bắt đầu hoạt động kém hiệu quả khi vượt 100.000 token. Do đó, công ty xây dựng một bộ khung tối giản: prompt hệ thống ngắn gọn, bộ công cụ cốt lõi nhỏ và các kỹ năng tải/lỡ theo nhu cầu. Họ chuyển các trình kết nối phổ biến như Gmail và GitHub từ máy chủ MCP ngốn token thành công cụ dòng lệnh gọn nhẹ, thêm các móc tự kiểm tra theo dõi trạng thái tác vụ, và áp dụng hộp cát OS luôn bật. Nếu hộp cát không khả dụng, bộ khung sẽ tự vô hiệu hóa — khác biệt hoàn toàn với các bộ khung mã nguồn mở chạy lệnh với toàn quyền người dùng mặc định.
Kinh tế token: Động lực chuyển agent AI từ đám mây xuống phần cứng cục bộ
Chiến lược đằng sau sản phẩm trở nên rõ ràng khi xem xét cách khối lượng công việc AI đã thay đổi. Trò chuyện (chat) mang tính bột phát — hỏi một câu, nhận câu trả lời, xong. Agent thì khác.
"Với agent, bạn muốn chúng luôn hoạt động nếu có thể. Bạn muốn agent thực sự tiêu thụ nhiều token nhất có thể," Nader, giám đốc công nghệ phát triển của Nvidia, nhận định. "Điều chúng tôi thấy là nhu cầu token vô độ, và đó là điểm khiến AI cục bộ tuyệt vời. Như bạn thấy qua các demo, bạn không bị tính phí theo token. Bạn không phải trả tiền cho token. Vì vậy nó thực sự hoàn hảo cho agent."
Điều này định hình lại giá trị của phần cứng cục bộ. Một agent chạy hàng giờ để rà soát tài liệu, tự kiểm tra công việc và lặp lại các phân tích sẽ tạo ra hóa đơn API khổng lồ trên đám mây. Trên thiết bị người dùng đã sở hữu, chi phí biên của các token này tiến về 0. Bài nghiên cứu của Perplexity lập luận rõ ràng: khi agent mở rộng quy mô, chi phí token và luân chuyển dữ liệu "trở nên khó kiểm soát hơn bao giờ hết." Thực thi cục bộ giải quyết cả hai vấn đề cùng lúc — chi phí vì suy luận miễn phí, và quyền riêng tư vì token nhạy cảm không bao giờ rời khỏi ranh giới thiết bị.
Điểm thú vị nhất về mặt thương mại nằm ở mô hình lai. Trên Terminal Bench 2.1, một điểm chuẩn lập trình khó, mô hình Qwen hoàn toàn cục bộ đạt 59,6% với chi phí biên gần như bằng 0. Cho phép leo thang lên "cố vấn" Claude Opus 5 trên đám mây nâng điểm lên 73,0% với chi phí ước tính 0,415 USD/tác vụ. Chạy riêng mô hình tiên phong đạt 82,4% với chi phí 0,65 USD/tác vụ. Nói cách khác, leo thang khôi phục khoảng 3/5 khoảng cách so với hiệu suất tiên phong với chi phí khoảng 2/3 — và người dùng tự quyết định khi nào đáng để đánh đổi. Trước mỗi cuộc gọi cố vấn, bộ khung chạy bộ phân loại PII trên ngữ cảnh gửi đi và hiển thị chính xác những gì sẽ rời khỏi thiết bị.
Vị thế của Portable Computer so với Ollama và ngăn xếp AI cục bộ DIY
Khi được hỏi về mối quan hệ với các công cụ suy luận cục bộ hiện có như Ollama, Nate phân định rõ ràng: các công cụ này giải quyết các tầng khác nhau của vấn đề.
"Phần lớn nỗ lực ở đây tập trung vào tầng bộ khung agent," ông nói, lưu ý rằng hệ thống sử dụng vLLM để lưu trữ suy luận mô hình bên dưới, với chế độ nâng cao cho phép người dùng cắm điểm cuối suy luận của riêng mình. "Chúng tôi đã hậu huấn luyện kỹ lưỡng cả mô hình Qwen và Nemotron để đạt kết quả tốt nhất... Trọng tâm của chúng tôi là mài giũa toàn bộ ngăn xếp từ trên xuống dưới, kết hợp suy luận mô hình và bộ khung."
Nader ví von dí dỏm hơn: "Chỉ cần chạy suy luận nhanh trên Spark thì có đường đi dễ dàng — bạn có thể dùng Ollama. Nhưng khi bắt đầu làm những việc phức tạp hơn, mang tính agent hơn, bạn đột nhiên cần hiệu suất cao hơn. Bạn tìm đến các mô hình khác, các bộ khung khác, và nó giống như đại dương — càng lặn sâu, càng thấy sâu thêm."
Ý nghĩa chiến lược của liên minh Nvidia-Perplexity
Sản phẩm mở rộng mối quan hệ hợp tác đã được xây dựng hơn một năm. Vào tháng 6/2025, Nvidia và Perplexity công bố hợp tác đưa mô hình AI có chủ quyền đến các nhà xuất bản và nhà mạng viễn thông châu Âu — một phần trong chiến dịch của CEO Jensen Huang nhằm thuyết phục chính phủ rằng "mọi quốc gia cần hạ tầng trí tuệ quốc gia." Bài thuyết phục về AI có chủ quyền — dữ liệu "thuộc về người dân, đất nước, văn hóa của bạn" — về mặt triết lý là cùng một lập luận mà Portable Computer đưa ra ở quy mô một chiếc bàn làm việc: trí tuệ bạn kiểm soát, chạy trên phần cứng bạn sở hữu.
Cả hai công ty đều có logic tư lợi rõ ràng. Perplexity, đối mặt với áp lực pháp lý từ các nhà xuất bản — bao gồm vụ kiện của The New York Times tháng 12/2025 và tranh chấp trước đó với Forbes — có được sản phẩm có nền kinh tế không phụ thuộc vào việc tính phí từng token, và một lợi thế khác biệt hóa vào các doanh nghiệp nhạy cảm về quyền riêng tư trong lĩnh vực luật, y tế và tài chính. Nvidia có được ứng dụng sát thủ cho DGX Spark — thiết bị theo thừa nhận của người tham dự, "dễ mua hơn dễ dùng." Khi một phóng viên hỏi liệu Spark có thể được bán kèm Portable Computer và mô hình Nemotron cài sẵn hay không, Nader khéo léo không loại trừ khả năng: "Điều đó thật tuyệt... mục tiêu là đảm bảo trải nghiệm siêu mượt cho mọi người dùng."
Những câu hỏi còn bỏ ngỏ
Hiện vẫn còn nhiều câu hỏi. Những con số ấn tượng nhất của Perplexity đến từ điểm chuẩn nội bộ của chính công ty, và họ thừa nhận mô hình nhỏ vẫn thua kém đáng kể so với các mô hình tiên phong ở các nhiệm vụ suy luận phức tạp — leo thang cố vấn "thu hẹp nhưng không đóng hoàn toàn khoảng cách." Sản phẩm hiện chỉ hỗ trợ Linux, mức tối thiểu 24GB VRAM loại trừ phần lớn PC tiêu dùng, và Apple silicon — nơi có nhiều người đam mê AI cục bộ nhiệt tình nhất — vắng bóng khỏi lộ trình. "Chúng tôi rất tập trung vào phần cứng Nvidia hiện tại," Nate trả lời khi được hỏi.
Nhưng hướng đi đã rõ ràng. Các nhà nghiên cứu của Perplexity mô tả sản phẩm là một phần của "sự dịch chuyển rộng lớn hơn trong đó các agent ngày càng mạnh mẽ chuyển từ hạ tầng từ xa sang thiết bị cá nhân và cục bộ." Trong hai năm qua, ngành AI đo tham vọng bằng gigawatt và token/đô la. Portable Computer đề xuất một thước đo khác — một thước đo không bao giờ cạn.