Nhà phát triển Pháp giải quyết 'điểm mù' của bot để AI hiểu được giao diện đồ họa

Công nghệ28 tháng 9, 2026·5 phút đọc

Công ty AI H của Pháp vừa ra mắt dòng mô hình Holo 4, giúp các tác nhân AI có thể điều khiển giao diện đồ họa (GUI) thông qua việc nhấp chuột, cuộn và gõ phím. Đây là bước tiến quan trọng bởi hầu hết các mô hình ngôn ngữ lớn hiện nay vẫn còn yếu trong việc điều hướng môi trường desktop Windows hay Linux.

Nhà phát triển Pháp giải quyết 'điểm mù' của bot để AI hiểu được giao diện đồ họa

Hầu hết các mô hình ngôn ngữ lớn (LLM) đều tỏ ra xuất sắc khi trả lời câu hỏi, nhưng lại khá lúng túng khi phải điều hướng xung quanh môi trường desktop trên Windows hay Linux. Đây chính là "điểm mù" mà nhà phát triển mô hình AI người Pháp có tên H đang muốn giải quyết.

Bài toán về ba loại giao diện máy tính

Trong suốt lịch sử ngành máy tính, cách con người tương tác với máy móc chủ yếu rơi vào ba nhóm: giao diện dòng lệnh (CLI), giao diện lập trình ứng dụng (API) và giao diện đồ họa người dùng (GUI).

Các tác nhân AI (AI agent) có thể dễ dàng kết nối với hai loại đầu tiên, nhưng việc điều hướng môi trường desktop và các ứng dụng thường đặt yếu tố thẩm mỹ lên trên tính năng vẫn là một thách thức lớn chưa được giải quyết.

H mãi mới tìm ra hướng đi cho vấn đề này.

Dòng mô hình Holo 4 và tham vọng đa năng

Hôm thứ Hai vừa qua, công ty H đã giới thiệu dòng mô hình Holo 4 với mục tiêu xử lý được cả ba kịch bản sử dụng máy tính nói trên, bao gồm trỏ, nhấp, cuộn và gõ phím trên các giao diện đồ họa vốn được thiết kế cho con người.

Được tinh chỉnh bằng học có giám sát (supervised learning) kết hợp với học tăng cường (reinforcement learning), Holo 4 được xây dựng dựa trên các mô hình Qwen 3.8 27B và Qwen 3.6 35B-A3B của Alibaba. Nhờ tối ưu hóa cho cả CLI, API lẫn GUI, H tuyên bố các mô hình của mình đạt được tính linh hoạt vượt trội so với những mô hình chỉ chuyên về computer use.

Điểm đáng chú ý là dù kích thước mô hình khá nhỏ, Holo 4 vẫn được kỳ vọng vượt qua nhiều mô hình tiên tiến lớn hơn.

Bên cạnh Holo 4, H cũng cập nhật mô hình Holotron dựa trên Nvidia Nemotron 3 với các khả năng tương tự.

Những minh chứng cụ thể

Trong một ví dụ, công ty cho thấy Holo 4 27B tận dụng hàm macro của FreeCAD để lập trình thiết kế mô hình 3D tháp Eiffel thay vì phải dựng thủ công bằng các hình khối cơ bản như khối lập phương.

Ở một bản demo khác, H làm điều ngược lại khi dùng các hình dạng đùn (extruded shapes) để tái tạo logo của chính công ty, qua đó thể hiện tính linh hoạt của mô hình.

Tất nhiên, với bất kỳ bảng đánh giá nào do nhà phát triển mô hình công bố, người dùng nên hoài nghi một chút. Nhưng nếu tin vào H, Holo 4 vượt trội đáng kể so với các mô hình biên (frontier model) lớn hơn nhiều đến từ những cái tên như OpenAI, trong khi chỉ sử dụng một phần nhỏ tham số.

Nghịch lý về chi phí và hiệu năng

Điều thú vị là điều này không đồng nghĩa với việc các mô hình rẻ hơn. Trên thực tế, dù đạt điểm số cao hơn, trong nhiều trường hợp các mô hình này lại tốn kém hơn trên mỗi tác vụ.

Dựa trên những gì đã biết về Qwen 3.8 27B, nguyên nhân có thể là do Holo 4 sử dụng lượng token "suy nghĩ" nhiều hơn đáng kể để đi đến kết quả cuối cùng, so với những mô hình như GPT 6 Luna – vốn hoạt động không tốt bằng trên benchmark OSWorld 2.0 nhưng lại rẻ hơn nhiều.

Cơ hội cho phần cứng phổ thông

Một điểm sáng là kích thước nhỏ gọn của các mô hình mở (open weights) đồng nghĩa với việc các nhà nghiên cứu, người đam mê AI và doanh nghiệp có thể chạy chúng trên phần cứng tương đối khiêm tốn.

Một chiếc Nvidia RTX 3090 với 24 GB VRAM được cho là dư sức chạy các mô hình này ở độ chính xác 4-bit. H rõ ràng kỳ vọng người dùng sẽ làm đúng như vậy, bởi bên cạnh các trọng số BF16, FP8 và NVFP4, công ty còn cung cấp phiên bản GGUF thân thiện với Llama.cpp (kéo theo cả LM Studio và Ollama) để tải về trên Hugging Face.

Nhà phát triển mô hình này cũng cho biết sẽ phát hành trọng số nháp DSpark nhằm tăng tốc suy luận bằng kỹ thuật gọi là giải mã suy đoán (speculative decoding). Về cơ bản, kỹ thuật này dùng một mô hình nhỏ để đoán trước đầu ra của mô hình lớn hơn. Khi thành công, người dùng sẽ thấy tốc độ xử lý và tạo token nhanh hơn; khi thất bại, hệ thống sẽ quay về mô hình gốc để đảm bảo không giảm chất lượng đầu ra.

Hệ sinh thái harness và cuộc đua của các ông lớn

Tuy nhiên, mô hình sẽ chẳng có giá trị gì nếu thiếu harness. H đã phát triển một số harness tác nhân, bao gồm HAI-Agents mã nguồn mở có thể tải về trên GitHub. Về lý thuyết, các mô hình này cũng nên hoạt động với harness computer use của bên thứ ba.

H không phải là cái tên duy nhất tập trung vào các ứng dụng computer use. Tại hội nghị Re:Invent của AWS năm ngoái, công ty này cũng đã công bố bộ mô hình computer use của riêng mình. Trong khi đó, ba phòng thí nghiệm mô hình lớn nhất nước Mỹ là OpenAI, Google và Anthropic cũng đang đầu tư vào năng lực này.

Lý do cũng dễ hiểu: đôi khi để thoát khỏi "hộp cát" (sandbox), AI chỉ cần một cú nhấp chuột.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗