Paper Office: Bộ công cụ Python giúp AI agent chỉnh sửa Word, PowerPoint và Excel chuẩn xác hơn
Paper Instruments vừa ra mắt Paper Office, bộ thư viện Python cho phép các AI agent thao tác với file Word, PowerPoint và Excel một cách an toàn và chính xác hơn. Kết quả thử nghiệm trên 5 mô hình và 61 tác vụ cho thấy tỷ lệ thành công đạt 92,5%, vượt trội so với các thư viện mã nguồn mở truyền thống.

Paper Instruments vừa công bố Paper Office, một bộ thư viện Python cho phép các AI agent thao tác trực tiếp với các tệp Word, PowerPoint và Excel. Điểm đáng chú ý là bộ công cụ này được xây dựng dựa trên các thư viện mã nguồn mở lâu đời như python-docx, python-pptx và OpenPyxl, nhưng bổ sung thêm các lớp bảo vệ giúp giảm thiểu lỗi khi chỉnh sửa tài liệu.
Theo kết quả thử nghiệm trên 5 mô hình AI và 61 tác vụ khác nhau, các gói Paper kết hợp với hướng dẫn đã đạt tỷ lệ thành công 92,5%, so với 80,7% khi dùng các gói gốc không có kỹ năng bổ trợ, và 69,5% khi dùng bộ kỹ năng Office tương đương của Anthropic.
Vấn đề của các giải pháp hiện tại
Các tệp DOCX, PPTX và XLSX thực chất là những tệp nén ZIP chứa nhiều tệp XML, hình ảnh và tài nguyên liên kết với nhau theo chuẩn Office Open XML (OOXML). Điều này có nghĩa là ngay cả một thay đổi nhỏ về nội dung hiển thị cũng có thể đòi hỏi phải cập nhật đồng bộ ở nhiều vị trí khác nhau trong cấu trúc tệp.
Các thư viện Python tiêu chuẩn như python-docx, python-pptx và openpyxl tuy đã trưởng thành nhưng không được cập nhật trong nhiều năm. Chúng thiếu độ bao phủ tính năng và các cam kết về tính đúng đắn cho nhiều quy trình quan trọng.
Khi gói thư viện không thể diễn đạt được các thao tác cần thiết, mô hình AI thường phải chuyển sang viết script bao hoặc can thiệp trực tiếp vào OOXML thô, gây ô nhiễm ngữ cảnh và dẫn đến những lỗi âm thầm khó phát hiện.
Các lỗi này thường xuất hiện ở những chỗ như neo bình luận, bảng tính biểu đồ, trường dữ liệu, XML tùy chỉnh và các phụ thuộc công thức.
Ba gói công cụ chính
Paper Office giữ nguyên cách nhập quen thuộc, cho phép các câu lệnh như import docx, from pptx import Presentation và import openpyxl vẫn hoạt động bình thường.
Paper DOCX mở rộng python-docx với khả năng tìm kiếm toàn văn bản, theo dõi chỉnh sửa, quản lý bình luận và soạn thảo nội dung. Thư viện hỗ trợ tìm kiếm văn bản xuyên qua các đoạn bị phân mảnh, tạo đánh dấu theo dõi kiểu Word gốc, quản lý chuỗi bình luận có trả lời, điền nội dung vào các điều khiển nội dung, và tạo dấu trang cùng các trường tự động.
Paper PPTX bổ sung khả năng kiểm tra định dạng kế thừa, tạo bullet gốc, chỉnh sửa slide và hình dạng có bảo vệ. Điểm nổi bật là tính năng nhân bản slide an toàn về quan hệ, giúp biểu đồ được nhân bản có workbook nhúng riêng biệt thay vì dùng chung. Thư viện cũng hỗ trợ chỉnh sửa bảng có ô gộp, cập nhật hình ảnh và biểu đồ an toàn, cùng khả năng so sánh cấu trúc slide theo mã định danh cố định.
Paper XLSX mở rộng openpyxl với lưu trữ bảo toàn gói, chỉnh sửa cấu trúc có nhận biết tham chiếu, và tính năng tính toán lại dựa trên LibreOffice. Khi chèn hoặc xóa hàng, cột, các công thức phụ thuộc, tên vùng, vùng in và tham chiếu biểu đồ đều được cập nhật tự động hoặc từ chối thao tác nếu không an toàn.
Kết quả thử nghiệm đáng chú ý
Nhóm nghiên cứu đã đánh giá trên 5 mô hình gồm Opus 5, GLM 5.3 Flash, GPT 5.6 Sol, Grok 4.6 và DeepSeek v4.1 Flash, với 61 tác vụ chia thành 27 tác vụ DOCX, 15 tác vụ PPTX và 19 tác vụ XLSX.
- DOCX: 83,0% khi không dùng kỹ năng, 84,4% với kỹ năng Anthropic, và 96,3% với Paper
- PPTX: 84,0% khi không dùng kỹ năng, 74,7% với kỹ năng Anthropic, và 92,0% với Paper
- XLSX: 74,7% khi không dùng kỹ năng, 44,2% với kỹ năng Anthropic, và 87,4% với Paper
Đáng chú ý, trong tổng số 915 lượt chạy được ghi nhận, các agent phải viết code can thiệp trực tiếp vào ZIP của tệp Office trong 78,7% trường hợp khi dùng gói gốc không có kỹ năng, 50,5% khi dùng kỹ năng Anthropic, nhưng chỉ còn 1,6% khi dùng Paper.
Ví dụ thực tế
Với một tác vụ yêu cầu mở rộng bình luận trong tệp DOCX, thêm phản hồi và đánh dấu cuộc thảo luận đã giải quyết, mô hình DeepSeek dùng gói gốc không có kỹ năng đã thêm đúng văn bản nhưng không cập nhật chính xác các liên kết kết nối phản hồi. Paper đã duy trì những liên kết này thông qua API bình luận của mình.
Trong một tác vụ XLSX yêu cầu thêm quý dự báo và cập nhật biểu đồ cùng tổng số hàng năm, cả ba thiết lập đều đưa ra con số doanh thu và EBITDA chính xác. Tuy nhiên, với gói gốc, một số quy tắc xác thực dữ liệu và định dạng vẫn bao phủ các vùng ô cũ, và agent không dùng kỹ năng đã để quý cũ tồn tại trong biểu đồ. Paper đã cập nhật các vùng phụ thuộc để tạo ra workbook đạt mọi kiểm tra.
Ý nghĩa với người dùng Việt Nam
Đối với các doanh nghiệp và chuyên gia Việt Nam thường xuyên làm việc với tài liệu Office — từ kế toán, luật sư đến tư vấn và ngân hàng — sự phát triển này mở ra triển vọng tự động hóa các quy trình xử lý tài liệu phức tạp mà vẫn đảm bảo tính toàn vẹn của dữ liệu gốc.
Điểm mấu chốt mà nhóm nghiên cứu nhấn mạnh là phần mềm nền tảng, bên cạnh prompt và kỹ năng, vẫn là một đòn bẩy quan trọng để tối ưu hóa hiệu suất của agent. Nói cách khác, để AI thực sự hữu dụng trong công việc tri thức, không chỉ cần mô hình tốt mà còn cần những công cụ được thiết kế đúng cho mục đích đó.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Hiệu sách cũ Nhật Bản tăng doanh số gấp 5 lần vì bị mua theo tấn để phục vụ AI
24 tháng 9, 2026