AutoBot: điều khiển bằng giọng nói cho các tác vụ AI chạy dài, vượt mặt Claude Opus 5 trên OSWorld 2.0
AutoBot là một harness mã nguồn mở (giấy phép MIT) cho phép quản lý các tác vụ AI chạy dài bằng giọng nói, tự sửa lỗi harness và ghi nhớ theo thời gian. Dự án đạt 32,41% trên OSWorld 2.0 — vượt Claude Opus 5 Max — và đứng đầu bảng xếp hạng AssistantBench với 50,70%.

AutoBot: điều khiển bằng giọng nói cho các tác vụ AI chạy dài, vượt mặt Claude Opus 5 trên OSWorld 2.0
AutoBot là một harness agentic mã nguồn mở (giấy phép MIT) do lập trình viên độc lập phát triển, cho phép người dùng điều khiển các tác vụ AI chạy dài bằng giọng nói tự nhiên, đặt điện thoại xuống và để hệ thống tự quản lý cho đến khi hoàn thành. Dự án đạt 32,41% độ chính xác trên OSWorld 2.0 — vượt qua Claude Opus 5 Max — và đứng đầu bảng xếp hạng AssistantBench với 50,70%. Đây là dự án cá nhân nhằm hiện thực hóa ý tưởng "Jarvis" cá nhân, không nhằm mục đích thương mại.
Điểm nổi bật của AutoBot
AutoBot không phải là một mô hình AI mới hay một chatbot, mà là sự kết hợp giữa ChatGPT gốc trên máy Mac và một workspace vận hành riêng biệt. Workspace này chứa "hợp đồng vận hành" trong tệp AGENTS.md, các phân vùng quyền riêng tư, bộ nhớ chọn lọc, và một máy trạng thái mục tiêu cục bộ.
Biểu đồ hiệu suất AssistantBench của AutoBot đạt 50,70%
Các khả năng chính bao gồm:
- Giọng nói gốc (Native Voice): Cho phép thảo luận tác vụ, kiểm tra tiến độ và điều chỉnh công việc rảnh tay.
- Sổ cái cục bộ (Local ledger): Theo dõi các đầu ra chưa hoàn thành và bằng chứng cần thiết để xác nhận hoàn tất.
- Bộ nhớ phân cấp: Lưu trên ổ đĩa, với quá trình "hợp nhất và khóa học nightly" giúp agent tích lũy kiến thức theo thời gian.
- Hệ thống nhịp tim (Heartbeat): Duy trì thực thi liên tục ngay cả khi phiên làm việc bị gián đoạn.
Theo mô tả của tác giả, "các quy trình khó trở thành nâng cấp cho chính agent. AutoBot tự sửa harness, xác thực độc lập các thay đổi và mang chúng đi tiếp." Điều này tạo ra khả năng tích lũy năng lực mà không cần huấn luyện lại mô hình.
Hiệu suất trên các benchmark
AutoBot đạt kết quả ấn tượng trên hai benchmark quan trọng:
- OSWorld 2.0: 32,41% độ chính xác nhị phân và 64,28% độ chính xác một phần trên 108 tác vụ — so sánh với ảnh chụp bảng xếp hạng ngày 10/09/2026. Kết quả này đưa Sol Max từ vị trí thứ 4 lên vị trí thứ nhất, vượt qua Claude Opus 5 Max của Anthropic.
- AssistantBench: Đứng đầu bảng xếp hạng ẩn chính thức với độ chính xác 50,70% trên 181 tác vụ.
Kết quả OSWorld 2.0 của AutoBot với 32,41% độ chính xác
Tác giả nhấn mạnh đây là kết quả trên một harness hoạt động trong dự án, không cần máy ảo (VM) hay hạ tầng phức tạp.
Quyền riêng tư theo phân vùng
Một trong những điểm khác biệt của AutoBot là hệ thống phân vùng quyền riêng tư dựa trên mối quan hệ và mục đích:
- PRIVATE: Thông tin cá nhân nhạy cảm, tài chính, sức khỏe — không bao giờ chia sẻ tự động.
- FAMILY_FRIENDS: Mối quan hệ, sự kiện, mẫu giao tiếp cá nhân được ủy quyền.
- WORK: Tổ chức, dự án, đồng nghiệp, khách hàng — không dùng cho giao tiếp cá nhân.
- SHARED: Thông tin tối thiểu được chủ động chia sẻ chung, chỉ khi chọn tham gia.
Các phân vùng này là thư mục chỉ dành cho chủ sở hữu và quy tắc vận hành trong một tài khoản macOS. Chúng không phải là kho lưu trữ mã hóa riêng biệt hay ranh giới bảo mật phần cứng.
Quy trình hoàn thành dựa trên bằng chứng
AutoBot yêu cầu mỗi mục tiêu bền vững phải trải qua năm giai đoạn có thứ tự:
research_complete— nghiên cứu hoàn tấtdraft_complete— bản nháp hoàn tấtdestination_updated— đích đến đã cập nhậtsave_confirmed— lưu đã xác nhậnrendered_readback_verified— đọc lại kết quả hiển thị đã xác thực
Runtime cục bộ thực thi thứ tự giai đoạn, băm bằng chứng, và yêu cầu nhãn người xác thực khác với nhãn người sản xuất. Điều này ngăn chặn tình trạng một tác vụ tự báo cáo "đã xong" mà không có bằng chứng thực tế.
Ghi chú cho người dùng Việt Nam
AutoBot là dự án cá nhân, không bán sản phẩm. Để sử dụng, người dùng cần:
- Máy MacBook (yêu cầu Node 22 trở lên cho runtime nâng cao).
- Tài khoản ChatGPT có gói trả phí (do nhu cầu sử dụng thường xuyên).
- Bật nhiều quyền hệ thống như ghi màn hình, trợ năng, micro — có thể cần khởi động lại ứng dụng ít nhất ba lần trong lần thiết lập đầu tiên.
Đáng lưu ý, người dùng Việt Nam cần kiểm tra khả năng truy cập ChatGPT theo khu vực và gói dịch vụ hiện có, vì AutoBot phụ thuộc vào các tính năng hiện tại của ChatGPT như Voice, Goals và Computer Use.
So sánh với các dự án tương tự
Tác giả so sánh AutoBot với OpenClaw và Hermes — hai dự án harness agentic khác. Điểm khác biệt chính là AutoBot yêu cầu người xác thực độc lập cho mỗi giai đoạn hoàn thành, yêu cầu tuyến ghi chính chủ (first-party) sạch theo mặc định, và giới hạn học giọng điệu theo kênh và đối tượng.
Tuy nhiên, tác giả thừa nhận đây là "khác biệt trong hợp đồng vận hành, không phải bảo đảm thực thi không lỗi". Các phân vùng quyền riêng tư chỉ mang tính thủ tục trong một máy Mac, không phải cách ly hệ điều hành hay danh tính mật mã.
Bạn có thể tìm hiểu thêm và tải mã nguồn tại GitHub của dự án.


