Rampart: Công cụ mã nguồn mở che giấu thông tin cá nhân ngay trên trình duyệt
Rampart là hệ thống lọc thông tin cá nhân (PII) mã nguồn mở chạy hoàn toàn trên thiết bị, kết hợp biểu thức chính quy với mô hình MiniLM nhỏ gọn chỉ 14,7 MB. Công cụ này giúp bảo vệ dữ liệu nhạy cảm trước khi gửi đến các chatbot AI, đạt độ chính xác 98,42% mà không cần gửi dữ liệu lên máy chủ từ xa.

Khi bạn gõ nội dung vào một chatbot AI, bạn có thể vô tình tiết lộ nhiều thông tin về bản thân hơn mức mong muốn. Một yêu cầu nhờ soạn email có thể chứa tên bạn và đồng nghiệp; một câu hỏi về hóa đơn y tế có thể kèm theo địa chỉ và số tài khoản; một lời than phiền có thể tiết lộ bạn là ai và sống ở đâu. Và những gì bạn gõ vào không hề ở lại với bạn — chúng được truyền đến một máy chủ từ xa mà bạn không có cách nào kiểm tra.
Nguyên tắc thiết kế cốt lõi của Rampart rất đơn giản: thông tin cá nhân duy nhất mà bạn có thể chắc chắn là riêng tư chính là thông tin không bao giờ rời khỏi thiết bị của bạn.
Rampart là gì?
Rampart là một hệ thống lọc thông tin cá nhân (PII) mã nguồn mở, hoạt động hoàn toàn trên thiết bị, được thiết kế như tuyến phòng thủ đầu tiên giúp đảm bảo dữ liệu cá nhân của bạn không rời khỏi thiết bị.
Công cụ này kết hợp hai lớp xử lý:
- Lớp quy tắc tất định (deterministic): Dựa trên biểu thức chính quy (regex) để phát hiện các thông tin có cấu trúc như số an sinh xã hội, số thẻ tín dụng, số điện thoại, số tài khoản ngân hàng, email, địa chỉ IP và giấy tờ tùy thân.
- Lớp mô hình ngôn ngữ nhỏ (MiniLM): Đảm nhận việc nhận diện tên người và địa chỉ đường phố — những thông tin mà quy tắc không thể bao quát hết.
Vì sao Rampart ra đời?
Thông thường, việc loại bỏ PII đồng nghĩa với hai lựa chọn: hoặc tin tưởng một máy chủ từ xa, hoặc tải các tệp nhị phân nặng về máy khách. Cả hai đều tồn tại những thách thức lớn:
- Cam kết về quyền riêng tư của AI gần như không thể kiểm chứng: Về nguyên tắc, không thể xác minh các tuyên bố bảo mật của nhà cung cấp AI. Một phiên bản runtime mới triển khai có thể vô tình ghi log thông tin nhạy cảm của người dùng, và các dịch vụ luôn tiềm ẩn rủi ro nội bộ như lỗ hổng zero-day hay mối đe dọa từ người trong tổ chức.
- Hầu hết mô hình loại bỏ PII có kích thước khổng lồ: Ví dụ, OpenAI Privacy Filter nặng tới ~2,8 GB, mất khoảng 38 phút để tải về trình duyệt trên kết nối yếu (10 Mbps). Điều này thu hẹp đáng kể nhóm người dùng có thể hưởng lợi.
Cách Rampart hoạt động
Mọi thứ diễn ra ngay trong trình duyệt, tại khoảnh khắc giữa lúc bạn gõ tin nhắn và lúc gửi đi — không có máy chủ nào tham gia vào quy trình.
Thông số kỹ thuật nổi bật:
- Kích thước mô hình (bao gồm tokenizer): 14,7 MB
- Độ trễ trung vị (p50) trên trình duyệt (WebGPU): 3,9 ms
- Tỷ lệ nhận diện thông tin riêng tư, bảy ngôn ngữ: 98,4%
Trước khi tin nhắn được gửi đi, hai "bộ đọc" sẽ phân tích nó ngay trên thiết bị của bạn.
Bộ đọc thứ nhất là tập hợp các quy tắc. Biểu thức chính quy kết hợp với kiểm tra hợp lệ thực tế sẽ xử lý các thông tin có cấu trúc: số an sinh xã hội, thẻ tín dụng, số điện thoại, số định tuyến và tài khoản, email, địa chỉ IP, giấy tờ tùy thân. Cách này mang tính tất định và tốc độ cao.
Bộ đọc thứ hai là một mô hình ngôn ngữ nhỏ. Vì quy tắc không thể lường trước mọi tên người hay địa chỉ, MiniLM sẽ đọc câu với sự thấu hiểu ngữ cảnh sâu hơn, rồi che giấu thông tin mà nó phát hiện trong một danh mục cụ thể.
Ví dụ, khi bạn gõ một câu đầy thông tin cá nhân vào chat:
- Trước khi che giấu: "Tên tôi là Maria Garcia, số an sinh xã hội của tôi là 123-45-6789, và tôi kiếm được 1.950 đô la một tháng. Bạn có thể giúp tôi tìm nhà ở giá phải chăng không?"
- Sau khi che giấu: "Tên tôi là [GIVEN_NAME] [SURNAME], số an sinh xã hội của tôi là [SSN], và tôi kiếm được 1.950 đô la một tháng. Bạn có thể giúp tôi tìm nhà ở giá phải chăng không?"
Điểm đáng chú ý là trình duyệt lưu trữ tạm thời các PII liên quan ngay trên thiết bị bạn để điền lại vào chỗ trống khi cần.
Kết quả đo lường
Rampart được huấn luyện trên bộ dữ liệu OpenPII 1.5M của AI4Privacy cùng một bộ sinh dữ liệu tổng hợp giúp củng cố cả 17 loại thực thể với đầu vào kiểu chat có chủ đích lộn xộn. Các con số dưới đây đến từ một tập kiểm thử 30.000 dòng OpenPII độc lập, trải rộng bảy ngôn ngữ dùng chữ Latinh, được chấm điểm đầu-cuối bằng quy trình đã phát hành.
- Rampart (Tất định + mô hình · 14,7 MB): 98,42%
- OpenAI Privacy Filter (Mô hình · ~2,8 GB): 97,4%
- GLiNER small v2.1 (Mô hình · ~600 MB): 94,2%
- Community BERT-small PII (Mô hình · ~29 MB): 81,5%
- Microsoft Presidio (Tất định + mô hình · ~13 MB): 65%
- AWS Bedrock Guardrails (Mô hình · Đám mây): 63,8%
Đáng chú ý, Rampart đạt độ chính xác cao nhất trong khi có kích thước nhỏ hơn OpenAI Privacy Filter tới gần 190 lần.
Hạn chế hiện tại
Rampart vẫn là một sản phẩm ở giai đoạn alpha, được định vị là tuyến phòng thủ đầu tiên trong nỗ lực quản lý PII toàn diện hơn cho các trải nghiệm chat AI. Hiện tại, công cụ hỗ trợ bảy ngôn ngữ: tiếng Anh, Tây Ban Nha, Pháp, Đức, Ý, Bồ Đào Nha và Hà Lan.
Bắt đầu sử dụng
Bạn có thể tải mô hình trên HuggingFace, cài đặt thư viện NPM, hoặc đọc bản whitepaper. Dưới đây là ví dụ sử dụng cơ bản trong TypeScript:
import { createGuard } from "@nationaldesignstudio/rampart";
const guard = await createGuard();
const safe = await guard.protect(
"My name is John Wick. I live at 88 Cedar Lane, Brookvale, CT 06482.",
);
console.log(safe.text);
// "My name is [GIVEN_NAME_1]. I live at [BUILDING_NUMBER_1] [STREET_NAME_1], Brookvale, CT 06482."
const reply = await llm(safe.text);
console.log(guard.reveal(reply));
// "Thanks John Wick, Brookvale CT 06482 works for eligibility."
Ý nghĩa với người dùng Việt Nam
Với người dùng Việt Nam — đặc biệt là những ai thường xuyên làm việc với chatbot AI để soạn email, dịch tài liệu hay hỏi đáp về giấy tờ hành chính — Rampart gợi mở một hướng tiếp cận đáng quan tâm. Cách làm "xử lý ngay trên trình duyệt" giúp loại bỏ nỗi lo dữ liệu bị ghi log ở máy chủ nước ngoài, vốn là mối quan ngại thực tế trong bối cảnh các quy định về bảo vệ dữ liệu cá nhân ngày càng được siết chặt tại Việt Nam.
Tuy nhiên, hiện tại Rampart chưa hỗ trợ tiếng Việt — đây có thể là cơ hội cho cộng đồng mã nguồn mở trong nước tham gia đóng góp, mở rộng tập ngôn ngữ và bổ sung các mẫu nhận diện đặc thù như số CCCD, số điện thoại Việt Nam hay mã số thuế cá nhân.
Bài viết liên quan

Phần mềm
Microsoft ra mắt Execution Containers 1.0.0: Lớp cách ly bảo vệ AI agent
09 tháng 10, 2026
Công nghệ
Bitwarden và mô hình giấy phép kép: Khi mã nguồn mở phải cân bằng giữa cộng đồng và thương mại
10 tháng 10, 2026

Công nghệ
LLM không hề là điều tất yếu: Vì sao làn sóng AI không miễn trừ được sự phản kháng
10 tháng 10, 2026