Bên trong Muse của Meta: Hé lộ hệ thống tập tin 6,8 GB và cách AI agent này thực sự vận hành

Công nghệ22 tháng 9, 2026·8 phút đọc

Một nhà nghiên cứu đã yêu cầu Muse — trợ lý AI của Meta — nén và gửi toàn bộ hệ thống tập tin mà nó có thể truy cập, thu về gần 6,8 GB dữ liệu giải nén. Từ đó hé lộ tên nội bộ \"Hatch\", hệ thống bộ nhớ bằng Markdown, khoảng 68 kỹ năng tích hợp, cùng dấu vết của một dự án phần cứng nhà thông minh mang tên Meta Home Link.

Bên trong Muse của Meta: Hé lộ hệ thống tập tin 6,8 GB và cách AI agent này thực sự vận hành

Bên trong Muse của Meta: Hé lộ hệ thống tập tin 6,8 GB và cách AI agent này thực sự vận hành

Một nhà nghiên cứu đã yêu cầu Muse — trợ lý AI của Meta — tự nén và gửi toàn bộ hệ thống tập tin mà nó có thể nhìn thấy về Google Drive. Kết quả thu về là một gói khoảng 2,7 GB khi nén và 6,8 GB sau khi giải nén, tiết lộ khá chi tiết cách một AI agent đang được Meta vận hành thực sự hoạt động ra sao.

Nội dung gói dữ liệu bao gồm hệ thống tập tin gốc của môi trường Linux được cấp cho phiên làm việc, các tài liệu nội bộ, mã tích hợp, mẫu ứng dụng, tệp bộ nhớ, nhật ký agent — và cả các tệp khóa SSH.

Hành trình "trích xuất" dữ liệu

Nhà nghiên cứu chỉ đơn giản yêu cầu Muse lưu trữ những tệp nó có thể thấy và gửi tới Google Drive. Và nó đã làm đúng như vậy.

Điều đáng chú ý là quá trình này diễn ra qua một cuộc trò chuyện thông thường, kết hợp với một đích xuất dữ liệu đã được kết nối. Đây chính là điểm đáng lo ngại mà nhà nghiên cứu báo cáo: các tệp runtime nội bộ và tài liệu nhạy cảm có thể rời khỏi môi trường đó chỉ bằng vài câu lệnh hội thoại.

Mô tả về một bản lưu trữ trước đó của mã nguồn, tài liệu và bộ nhớ MuseMô tả về một bản lưu trữ trước đó của mã nguồn, tài liệu và bộ nhớ Muse

Nhà nghiên cứu cho biết đã gửi phát hiện qua chương trình bug bounty của Meta và liên hệ với một số nhân viên. Anh không công bố bản lưu trữ, khóa hay nhật ký phiên làm việc, mà chỉ phân tích những gì mình tìm thấy và có thể xác lập được.

"Hatch" — tên nội bộ của Muse

Hầu hết các tệp thú vị nằm dưới /home/hatch, /opt/hatch/opt/hatch-image. Hatch là tên nội bộ mà Meta dùng cho Muse và được sử dụng xuyên suốt các tệp runtime.

Thư mục home của agent chứa một loạt tệp Markdown đóng vai trò như "linh hồn" và bộ nhớ của nó:

  • SOUL.md — định nghĩa cốt lõi của agent
  • IDENTITY.md — danh tính
  • USER.md — thông tin về người dùng
  • MEMORY.md — bảng tóm tắt các sự kiện, sở thích và cam kết
  • AGENTS.mdTOOLS.md — mô tả agent con và công cụ

Bên cạnh đó là các thư mục dành cho tài liệu, bộ nhớ, dự án workspace, kênh liên lạc, hook và subscription. Một thư mục agents/ chứa tới 113 bản ghi subagent kèm dấu vết JSONL.

Phần tài liệu đặc biệt hữu ích để hiểu hệ thống: khoảng 20 tệp Markdown mô tả việc dùng trình duyệt, connector, thanh toán, thông tin xác thực, xử lý dữ liệu, tệp được tạo, giọng nói, mục tiêu và lập lịch. Có cả hướng dẫn riêng cho WhatsApp, một máy Mac được ghép nối, Tailscale, và một tích hợp thiết bị mang tên Home Link.

Kho kỹ năng và các connector chưa ra mắt

Dưới /opt/hatch/skills/, nhà nghiên cứu đếm được khoảng 68 thư mục kỹ năng. Mỗi kỹ năng thường gồm một tệp hướng dẫn SKILL.md đi kèm một công cụ dòng lệnh hoặc mã hỗ trợ.

Các kỹ năng này trải rộng trên Google Workspace, ứng dụng mạng xã hội của Meta, Outlook, du lịch, mua sắm, dịch vụ sức khỏe, thiết bị nhà và tạo nội dung media.

Đáng chú ý hơn, hai tệp cấu hình skill-scopes.confbin-scopes.conf tiết lộ những connector có thể đang trong lộ trình phát triển nhưng chưa công bố, gồm các tên như Slack, Dropbox, Polymarket, Canva, Klaviyo và một công cụ nội bộ tên internal-facebook-clI.

Bộ nhớ hoạt động như thế nào?

Đây có lẽ là phần thú vị nhất về mặt kiến trúc. Muse lưu bộ nhớ bằng các tệp Markdown thuần, không phải cơ sở dữ liệu vector thuần túy.

  • Tệp ~/MEMORY.md là bảng tóm tắt ngắn gọn các sự kiện, sở thích và cam kết.
  • Các tệp theo ngày trong ~/memory/ giữ chi tiết hằng ngày của từng phiên.
  • Agent có thể ghi trực tiếp vào các tệp này ngay trong lúc trò chuyện.

Một tác vụ chạy nền mỗi giờ sẽ đối chiếu các tuyên bố mới với tin nhắn gốc, ghi lại trích dẫn, ID tin nhắn và ID tuyên bố. Nó quyết định nội dung nào thuộc về bảng tóm tắt và nội dung nào ở lại nhật ký hằng ngày.

PostgreSQL đóng vai trò lớp tìm kiếm phía sau: bảng memory.entries lưu các đoạn văn và tham chiếu dòng, memory.embeddings chứa vector 384 chiều, còn memory.claims theo dõi bằng chứng, độ tin cậy và trạng thái. Một tuyên bố mới có thể thay thế tuyên bố cũ qua trường supersedes_claim_id. Agent có thể tìm kiếm bằng lệnh memory_search và xem bằng chứng đằng sau kết quả bằng memory_explain.

Nhật ký dream mô tả phong cách giao tiếp và sở thích của người dùngNhật ký dream mô tả phong cách giao tiếp và sở thích của người dùng

Giấc mơ ban đêm và cơ chế "quên"

Mỗi đêm, Muse chạy một quy trình gọi là "dream" — xem lại các cuộc trò chuyện gần đây và viết hướng dẫn cho các phiên tương lai. Trong trường hợp của nhà nghiên cứu, nó ghi nhận anh thích câu trả lời ngắn gọn, không thích bị hỏi lại nhiều lần, và không yêu cầu nhận điểm NFL tự động.

Một tệp ALIGNMENT_SYNTHESIS.md riêng chuyển những quan sát đó thành hướng dẫn thường trực. Các tệp dream có prompt_hoisted: false, nghĩa là bản thân phần văn bản đó không được chèn thẳng vào prompt.

Cơ chế "quên" cũng không chỉ là xóa một ghi chú. Quy trình forget sẽ đánh dấu các ID tuyên bố cần thu hồi, loại bỏ tài liệu liên kết, và xây dựng lại chỉ mục để các tác vụ sau không tái tạo lại thông tin đó. Đây là cách hệ thống thích nghi theo thời gian — thông qua việc cập nhật tệp, bản ghi tìm kiếm và hướng dẫn — trong khi trọng số của mô hình không hề thay đổi.

Phần tài liệu phần cứng gây bất ngờ nhất. Tệp docs/devices/home_link.md mô tả một tích hợp thử nghiệm có tên Meta Home Link, sử dụng chip ESP32-C5 với Wi-Fi và Bluetooth LE.

Tài liệu này đề cập đến việc ghép nối thiết bị, khám phá mạng cục bộ, và quyền truy cập của agent thông qua một proxy với bước phê duyệt riêng. Đã có sẵn hướng dẫn tích hợp cho máy in Brother qua IPP và cầu Lutron.

Hướng dẫn Home Link mô tả tích hợp thử nghiệm với phần cứng ESP32-C5Hướng dẫn Home Link mô tả tích hợp thử nghiệm với phần cứng ESP32-C5

Điều này cho thấy Meta đang nghiên cứu việc cho Muse truy cập các thiết bị trong mạng gia đình. Tuy nhiên, chưa thể xác định đây là nguyên mẫu nội bộ, một thử nghiệm giới hạn, hay một sản phẩm Meta dự định thương mại hóa.

Codex và sandbox bảo mật

Codex CLI được cài tại /opt/hatch-image/bin/codex, phiên bản 0.149.0. Nhưng nhà nghiên cứu không tìm thấy bằng chứng nào cho thấy Muse dùng nó như một coding agent.

Thay vào đó, Muse sử dụng bản sao bubblewrap đi kèm — một công cụ sandbox của Linux. Tệp nhị phân nằm dưới codex-resources/bwrap và tự nhận là bubblewrap được build cho Codex.

Muse dùng nó để sandbox ffmpegffprobe cho việc xử lý video, tạo ảnh thu nhỏ và kiểm tra tệp. Các tác vụ này chạy không có quyền truy cập mạng hay đặc quyền bổ sung, dưới người dùng nobody, với thư mục /input/output được mở cho sandbox. Nếu thiếu bubblewrap, chúng thất bại với thông báo failed to prepare ffmpeg sandbox.

Phản hồi từ Meta

Nhà nghiên cứu đã gửi báo cáo qua chương trình bug bounty của Meta. Meta đánh dấu báo cáo là "Not Applicable" (không áp dụng). Phản hồi liệt kê một số lý do khả dĩ cho quyết định này mà không nêu rõ lý do nào được áp dụng, đồng thời mời cung cấp thêm bằng chứng về tác động bảo mật hoặc quyền riêng tư.

Anh cho biết mình chỉ "thăm dò nhẹ" ranh giới container để tìm cách thoát ra, nhưng nó dường như vẫn giữ vững trong thử nghiệm của anh. Anh bắt đầu kiểm tra 80 socket tìm thấy nhưng dừng lại vì bản chất của hệ thống production — và cũng vì thiếu kinh nghiệm trong lĩnh vực này.

Đây không phải là một vụ khai thác thành công, mà là một góc nhìn hiếm hoi vào bên trong cách một AI agent thương mại thực sự được lắp ráp và vận hành.

Điều này có ý nghĩa gì với người dùng Việt Nam?

Với cộng đồng công nghệ Việt Nam, câu chuyện này mang vài bài học đáng lưu tâm:

  • AI agent đang ngày càng "có bộ nhớ dài hạn" bằng tệp văn bản đơn giản kết hợp tìm kiếm vector — một kiến trúc dễ triển khai mà nhiều startup Việt cũng có thể áp dụng.
  • Rủi ro rò rỉ dữ liệu qua kênh xuất dữ liệu là vấn đề thực tế, đặc biệt khi agent được cấp quyền ghi ra Google Drive, email hay các dịch vụ đám mây khác.
  • Sandbox vẫn là tuyến phòng thủ then chốt — việc giới hạn quyền, chạy dưới người dùng hạn chế và không cấp mạng cho tác vụ rủi ro là nguyên tắc cần áp dụng ngay cả với ứng dụng nội bộ.

Có thể bạn muốn liên hệ tác giả để biết thêm chi tiết — địa chỉ được ghi là pete at mouse.dev.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗