GPT-5.6 Sol: Mô hình 'thị giác' mạnh nhất mà OpenAI từng phát hành

Công nghệ17 tháng 8, 2026·7 phút đọc

OpenAI vừa ra mắt bộ ba mô hình GPT-5.6 gồm Sol, Terra và Luna, với điểm nhấn là khả năng thị giác máy tính vượt trội. Theo đánh giá từ Roboflow, Sol là mô hình 'thị giác' tốt nhất mà OpenAI từng phát hành, đặc biệt cải thiện vượt bậc ở khả năng phát hiện vật thể và đếm số lượng. Tuy nhiên, mô hình vẫn còn tồn tại những hạn chế về chi phí, độ trễ và độ ổn định khi xử lý ảnh lớn.

GPT-5.6 Sol: Mô hình 'thị giác' mạnh nhất mà OpenAI từng phát hành

GPT-5.6 Sol: Mô hình "thị giác" mạnh nhất mà OpenAI từng phát hành

Tuần trước, OpenAI chính thức công bố dòng mô hình GPT-5.6 với ba phiên bản Sol, Terra và Luna. Trong buổi ra mắt, đội ngũ OpenAI tập trung giới thiệu khả năng "computer use" — điều khiển máy tính để thao tác trên các ứng dụng. Tuy nhiên, theo đánh giá từ nền tảng thị giác máy tính Roboflow, chính khả năng hiểu hình ảnh (vision) mới là điểm sáng lớn nhất của bộ ba mô hình này.

Roboflow đã tiến hành chạy thử nghiệm GPT-5.6 trên bộ benchmark VLM sắp ra mắt của họ, bao gồm các tác vụ phổ biến như phát hiện vật thể, đếm số lượng, OCR và trích xuất dữ liệu. Kết quả cho thấy Sol — phiên bản mạnh nhất — đã tạo ra bước nhảy vọt rõ rệt so với người tiền nhiệm GPT-5.5.

GPT-5.6 Sol được đánh giá là mô hình thị giác mạnh nhất của OpenAIGPT-5.6 Sol được đánh giá là mô hình thị giác mạnh nhất của OpenAI

Phát hiện vật thể: Từ điểm yếu thành thế mạnh

Đây là lĩnh vực cho thấy sự cải thiện rõ rệt nhất của GPT-5.6. Trong khi GPT-5.5 chỉ đạt 13.8 mAP@50 trong bài kiểm tra của Roboflow, thì Sol đã vươn lên con số ấn tượng 46.2. Terra và Luna cũng bám sát với lần lượt 44.7 và 43.3, đưa khả năng phát hiện vật thể từ một điểm yếu chí mạng thành một năng lực có thể ứng dụng thực tế.

Một trong những thế mạnh rõ ràng nhất của GPT-5.6 là phát hiện bố cục tài liệu. Sol xử lý tốt các tiêu đề, đoạn văn, bảng biểu, hình ảnh và chữ ký. Đây là bước đệm quan trọng cho các quy trình xử lý văn bản, nơi cần xác định vị trí các thành phần trước khi tiến hành OCR hoặc trích xuất dữ liệu.

GPT-5.6 cũng hoạt động tốt trong các cảnh có mật độ vật thể dày đặc, chẳng hạn như hình ảnh thuốc viên hoặc trứng — một điểm yếu kinh điển của các mô hình VLM. Khác với các mô hình phát hiện truyền thống, VLM tạo ra nhãn lớp và tọa độ dưới dạng văn bản, khiến phản hồi dài hơn và dễ xảy ra lỗi khi số lượng vật thể tăng lên. Dù vậy, Sol vẫn phát hiện được hầu hết các vật thể trong cả hai tình huống này.

Khả năng phát hiện vật thể trong cảnh dày đặc được cải thiện rõ rệtKhả năng phát hiện vật thể trong cảnh dày đặc được cải thiện rõ rệt

Một điểm lưu ý: để đạt kết quả tốt nhất, người dùng nên yêu cầu GPT-5.6 trả về tọa độ XYXY tuyệt đối theo pixel ảnh. Điều này khác với Gemini 3.5 Flash, vốn hoạt động tốt nhất với tọa độ YXYX chuẩn hóa trong khoảng 0–1000. Sử dụng sai định dạng tọa độ có thể làm giảm hiệu suất phát hiện của GPT-5.6 tới khoảng 15 điểm mAP.

Đếm vật thể: Cải thiện toàn diện

Khả năng đếm vật thể cũng được cải thiện trên toàn bộ dòng GPT-5.6. Sol đạt 73.0% trong benchmark của Roboflow, tăng đáng kể so với mức 64.9% của GPT-5.5. Terra và Luna lần lượt đạt 67.6% và 66.2% — ngay cả Luna, phiên bản rẻ nhất, vẫn vượt qua thành tích của GPT-5.5.

Roboflow đã đưa vào các bài kiểm tra phức tạp, chẳng hạn như đếm các giá đỡ kim loại chồng chéo lên nhau — một thử thách khó cho cả mô hình phát hiện truyền thống lẫn VLM. Sol cũng xử lý tốt tình huống đếm lỗ đạn chỉ trong các vùng tính điểm được chọn, cho thấy khả năng hiểu cả vật thể cần đếm lẫn quy tắc áp dụng.

Tuy nhiên, vẫn còn những hạn chế. Với vỉ thuốc (blister pack), Sol gặp khó khăn trong việc phân biệt giữa ô trống và viên thuốc còn nguyên, do bố cục lặp lại, phản chiếu ánh sáng và sự khác biệt nhỏ giữa hai loại ô.

OCR và trích xuất dữ liệu

Hiệu suất OCR của Sol vẫn gần tương đương GPT-5.5, đạt 90.7% điểm tương đồng trung bình, chỉ kém 0.5 điểm. Tuy nhiên, khoảng cách này lớn hơn trong bài kiểm tra trích xuất văn bản, khi Sol chỉ đạt 82.5% so với 87.6% của GPT-5.5.

Roboflow phân tách rõ hai tác vụ: OCR là phiên âm toàn bộ văn bản nhìn thấy được, còn trích xuất là lấy thông tin cụ thể. Sol xử lý tốt cả hai trong trường hợp ghi chú viết tay, bao gồm cả phiên âm đầy đủ lẫn trích xuất ngày tháng được yêu cầu.

Sol cũng hoạt động ấn tượng với văn bản trong các bối cảnh phức tạp, như đọc dãy số kích thước lốp xe in trên bề mặt cong của một chiếc lốp bẩn, hay trích xuất tỷ số trực tiếp từ sóng truyền hình khúc côn cầu. Một số tác vụ tưởng chừng đơn giản vẫn gây khó khăn, như đọc ngày hết hạn in trên vỉ thuốc do chữ nhỏ, dọc, độ tương phản thấp và bị phản chiếu.

Đánh đổi: Chi phí và độ trễ

Sức mạnh thị giác đi kèm với chi phí token cao hơn trên toàn bộ dòng GPT-5.6. Sol trung bình mất gần 10 giây cho mỗi hình ảnh trong bài benchmark, trong khi Terra chỉ khoảng 6 giây và Luna hơn 5 giây một chút. Về chi phí, Sol tốn khoảng 2.5 cent mỗi ảnh — đắt thứ hai sau Claude Fable 5, trong khi Terra giảm xuống còn 1 cent và Luna dưới 0.5 cent.

So sánh chi phí và độ trễ giữa các mô hìnhSo sánh chi phí và độ trễ giữa các mô hình

Đáng chú ý, Gemini 3.5 Flash của Google chỉ tốn 0.8 cent mỗi ảnh và vẫn đang dẫn đầu trong các bài kiểm tra phát hiện và đếm vật thể. Đây là lựa chọn mạnh mẽ cho các tác vụ xử lý dữ liệu khối lượng lớn, nơi chi phí tăng theo quy mô.

Roboflow cũng phát hiện một số trường hợp Sol trả về khung bao quanh (bounding box) ở vị trí ngẫu nhiên, tạo thành các bố cục bất thường như hàng thẳng hoặc nhóm cách đều nhau. OpenAI xác nhận Sol kém ổn định hơn với ảnh từ 2.000×2.000 pixel trở lên, đặc biệt ở mức suy luận thấp. Giải pháp thực tế là thay đổi kích thước hoặc cắt ảnh trước khi gửi đến API.

Kết luận

Với GPT-5.6, OpenAI đã tiến gần hơn nhiều đến các mô hình VLM hàng đầu hiện nay. Phát hiện vật thể đã chuyển từ điểm yếu thành năng lực sử dụng được, và khả năng đếm được cải thiện trên toàn bộ dòng sản phẩm. Điều này cho thấy OpenAI đang thực sự nghiêm túc với thị giác máy tính.

Tuy nhiên, vẫn còn những giới hạn rõ ràng. Gemini 3.5 Flash vẫn là lựa chọn thực tế hơn cho các tác vụ phát hiện và đếm khối lượng lớn, đặc biệt là ở mức giá hiện tại. Sol vẫn có những khiếm khuyết về chi phí, độ trễ và một số trường hợp phát hiện không ổn định.

Dù vậy, với các ứng dụng như tác nhân AI (AI agents), hiểu màn hình, xử lý tài liệu và suy luận thị giác, bản phát hành này đã đưa OpenAI trở thành một lựa chọn mạnh mẽ hơn rất nhiều so với trước đây — một tín hiệu tích cực cho cộng đồng phát triển AI tại Việt Nam, nơi đang ngày càng ứng dụng nhiều mô hình đa phương thức vào các bài toán thực tế như kiểm tra chất lượng sản phẩm, xử lý hóa đơn và tự động hóa quy trình văn phòng.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗