ABBYY đưa OCR truyền thống vào dây chuyền AI với FineParser

Phần mềm22 tháng 9, 2026·4 phút đọc

ABBYY ra mắt FineParser, công cụ OCR tự lưu trữ chạy trong container Docker trên CPU, giúp giữ nguyên bố cục bảng biểu và cấu trúc tài liệu trước khi chuyển cho các mô hình ngôn ngữ lớn xử lý.

ABBYY đưa OCR truyền thống vào dây chuyền AI với FineParser

ABBYY vừa đóng gói công cụ nhận dạng ký tự quang học (OCR) FineReader của mình thành một giải pháp tự lưu trữ (self-hosted), phục vụ việc chuyển đổi tài liệu thành văn bản có cấu trúc để các hệ thống AI có thể sử dụng.

Sản phẩm mới mang tên FineParser chạy trong container Docker trên CPU, không cần đến GPU. Điểm mấu chốt là nó cố gắng bảo toàn bố cục của tài liệu trong quá trình trích xuất nội dung.

Điểm khác biệt nằm ở cách tiếp cận "tất định"

FineParser nhận ảnh tài liệu ở nhiều ngôn ngữ khác nhau và chuyển chúng thành văn bản có cấu trúc, định dạng rõ ràng — để sau đó có thể xử lý bằng các mô hình ngôn ngữ lớn (LLM) hiện đại. Tuy nhiên, đây không phải mục đích duy nhất: công ty cho biết công cụ này còn có thể hỗ trợ đưa văn bản in vào hệ thống quản trị nội dung (CMS) hiện đại, phục vụ lưu trữ, hoặc đóng vai trò một công đoạn trong dây chuyền sản xuất nào đó.

ABBYY mô tả cách tiếp cận của FineParser là AI "tất định" (deterministic AI). Thay vì tạo ra một phiên bản nội dung "trông có vẻ hợp lý", nó trích xuất chính xác văn bản và cấu trúc tài liệu. Kết quả đầu ra sau đó mới được chuyển sang hệ thống AI tạo sinh — vốn có độ dự đoán kém hơn nhiều.

Trước khi một LLM có thể sử dụng tài liệu, phải có thứ gì đó đọc nó một cách chính xác. ABBYY đặt cược rằng cách tiếp cận OCR lâu đời của mình — chạy trên CPU, giữ nguyên bố cục, và để việc tạo văn bản cho công cụ khác — vẫn còn chỗ đứng trong dây chuyền AI.

Bảo toàn cấu trúc: yếu tố sống còn

Việc giữ nguyên cấu trúc nghĩa là công cụ phải nhận diện được các cột theo đúng thứ tự đọc, các tiêu đề, và cả bảng biểu — kể cả những bảng không có đường viền — thay vì trả về một mớ văn bản lộn xộn.

Theo ABBYY, FineParser còn xử lý được chữ viết tay và hỗ trợ hơn 200 ngôn ngữ. Lập trình viên có thể gửi tài liệu qua REST API của FineParser và nhận kết quả dưới dạng văn bản thuần, JSON, hoặc DocLang — một định dạng gọn nhẹ được thiết kế riêng cho đầu vào của LLM.

Hệ sinh thái và điều kiện sử dụng

Bên cạnh FineParser, ABBYY còn cung cấp NeoML, một framework học máy có thể lập trình được, là phần mềm mã nguồn mở (FOSS) và có sẵn trên GitHub. Công ty cũng phát hành SDK OCR cho các doanh nghiệp muốn nhúng engine FineReader vào sản phẩm của riêng họ.

Bản thân FineParser không phải mã nguồn mở, dù ABBYY vẫn duy trì một kho GitHub để cung cấp ví dụ và hỗ trợ cộng đồng. Công cụ tự lưu trữ này có gói miễn phí cho phép xử lý 1.000 trang mỗi tháng trong một năm. Các gói thuê bao trả phí sẽ kết nối tới máy chủ cấp phép để xác thực; triển khai hoàn toàn ngoại tuyến (offline) yêu cầu gói Enterprise.

Góc nhìn cho người dùng Việt Nam

Với các doanh nghiệp Việt Nam đang bước vào quá trình số hóa tài liệu — từ hồ sơ hành chính, hợp đồng, đến chứng từ kế toán — bài toán giữ nguyên bố cục bảng biểu luôn là điểm đau lớn. Các giải pháp OCR thuần túy thường trả về văn bản rối, buộc phải chỉnh sửa thủ công tốn kém.

Việc FineParser chạy trên CPU mà không cần GPU là lợi thế đáng kể về chi phí hạ tầng, đặc biệt với các đơn vị không có sẵn cụm máy chủ GPU. Kết hợp giữa OCR tất định để "đọc đúng" và LLM để "hiểu và sinh nội dung" có thể là hướng đi thực tế cho nhiều dự án chuyển đổi số tại Việt Nam, nơi khối lượng tài liệu giấy còn rất lớn.

Đôi khi, chính phần công nghệ cũ kỹ lại là phần hữu ích nhất trong cả dây chuyền.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗