Trọng số mở không phải là mã nguồn mở: Vì sao nhãn dán được AI ưa chuộng đang gây tranh cãi

Công nghệ15 tháng 9, 2026·8 phút đọc

Việc tải một mô hình AI ngày càng dễ dàng, nhưng hiểu được cách nó được tạo ra hay thay đổi hệ thống từ gốc lại là câu chuyện khác. Sự nhầm lẫn giữa "trọng số mở" và "mã nguồn mở" đang làm dấy lên tranh luận về định nghĩa thực sự của AI nguồn mở.

Trọng số mở không phải là mã nguồn mở: Vì sao nhãn dán được AI ưa chuộng đang gây tranh cãi

Ngành công nghiệp AI có thói quen lạm dụng từ "mở". Nó xuất hiện trong các buổi ra mắt sản phẩm, bài báo nghiên cứu, tranh luận chính sách và cả thuyết trình của nhà đầu tư. Một công ty công bố các tệp mô hình lên Hugging Face, lập trình viên chạy chúng trên GPU của riêng mình, và bản phát hành đó nhanh chóng được gọi là "mô hình mã nguồn mở". Không hẳn vậy. Nó có thể chỉ là trọng số mở (open weights).

Sự khác biệt này không chỉ là chuyện kỹ thuật. Nó quyết định liệu bạn chỉ có thể triển khai một mạng nơ-ron đã hoàn thiện, hay có thể thực sự kiểm tra, tái tạo, thay đổi và phân phối lại hệ thống đã tạo ra nó. Một hệ thống mã nguồn mở đích thực phải cho phép bạn làm được tất cả những điều trên.

Trọng số mở và mã nguồn mở khác nhau ở đâu?

Trọng số là các tham số số học được học ra trong quá trình huấn luyện. Cùng với kiến trúc mô hình và mã suy luận, chúng cho phép một mô hình ngôn ngữ lớn (LLM) hoạt động. Bạn có thể tải một mô hình trọng số mở về, tự lưu trữ, tinh chỉnh nó trên tài liệu nội bộ và tránh phải định tuyến các câu lệnh qua API độc quyền.

Trọng số mở được công khai công bố. Chúng quan trọng vì chạy cục bộ có thể mang lại quyền kiểm soát tốt hơn đối với dữ liệu, quyền riêng tư, chi phí, những thay đổi API từ nhà cung cấp và tình trạng khóa cứng vào nhà cung cấp. Chúng cũng giúp xây dựng một hệ sinh thái lớn gồm các môi trường chạy mô hình cục bộ, nhà cung cấp suy luận, công cụ tinh chỉnh và các mô hình chuyên biệt ở tầng sau.

Tổ chức Sáng kiến Nguồn mở (OSI) — đơn vị quản lý Định nghĩa Nguồn mở (OSD) — phân biệt rõ ràng: "Open Weights đề cập đến trọng số và độ lệch cuối cùng của một mạng nơ-ron đã được huấn luyện." Những giá trị đó quyết định cách mô hình diễn giải câu lệnh và tạo ra đầu ra. Việc công bố chúng có thể cho phép người khác tinh chỉnh, thích nghi hoặc triển khai mô hình. Nhưng OSI nói thêm rằng chỉ riêng trọng số chỉ phơi bày "một phần nhỏ thông tin cần thiết để có thể chịu trách nhiệm đầy đủ".

Lời cảnh báo từ giới chuyên gia

James Landay, giám đốc Viện Stanford về AI lấy con người làm trung tâm (HAI), giải thích: "Trọng số mở là một bước tiến. Bạn có thể tải mô hình, chạy nó trên máy của mình, giữ nó ngoài đường ống dữ liệu của người khác. Nhưng bạn vẫn không thể thấy cách nó được xây dựng, nó được huấn luyện trên cái gì, hay vì sao nó hành xử theo cách đó. Đó không phải là mô hình mở. Đó là phân phối mở."

Nếu không có dữ liệu huấn luyện hoặc tài liệu đủ chi tiết, người ngoài không thể xác định được nguồn nào đã được sử dụng, tài liệu có bản quyền hay riêng tư nào có thể đã bị đưa vào, dữ liệu được chọn lọc hay loại bỏ ra sao, ngôn ngữ và cộng đồng nào bị đại diện thiếu, liệu dữ liệu đánh giá có bị rò rỉ vào tập huấn luyện hay không, và những phương pháp căn chỉnh và an toàn nào đã ảnh hưởng đến mô hình sau giai đoạn tiền huấn luyện.

"Có một khoảng cách lớn giữa AI trọng số mở và AI mã nguồn mở." — James Landay, Viện Stanford HAI

Định nghĩa gây tranh cãi của OSI

OSI có định nghĩa riêng về AI nguồn mở: Định nghĩa AI Nguồn mở (OSAID 1.0). Định nghĩa này yêu cầu các tham số mô hình, bao gồm cả trọng số, phải được cung cấp theo các điều khoản do OSI phê duyệt, nhưng không quy định một cơ chế pháp lý cụ thể nào để làm điều đó.

Luca Antiga, CTO của Lightning AI và là người đóng góp nổi bật cho PyTorch, cho rằng cách OSAID xử lý trọng số để lại "một lỗ hổng lớn khiến các giấy phép trở nên kém hiệu quả trong việc xác định liệu các hệ thống AI được OSI cấp phép có thể được áp dụng trong bối cảnh thực tế hay không".

Không chỉ có vậy. Bruce Perens, tác giả của Định nghĩa Nguồn mở gốc, đã lên tiếng chỉ trích OSAID vào năm 2024. Ông tuyên bố: "Đây không phải là Mã nguồn mở! Thật đáng tiếc khi chính Sáng kiến Nguồn mở giờ lại tham gia vào việc 'tẩy trắng nguồn mở' (openwashing)."

Bradley Kuhn, thành viên chính sách tại Software Freedom Conservancy (SFC), và Richard Fontana, cố vấn thương mại cấp cao của Red Hat, đã kêu gọi bãi bỏ OSAID, lập luận: "OSI đã hành động quá nhanh khi áp đặt một thỏa hiệp chính sách quá tham vọng lên cộng đồng. OSAID đã tạo ra một rạn nứt trong cộng đồng phần mềm tự do nguồn mở (FOSS); rạn nứt đó đã gây tổn hại nghiêm trọng đến uy tín, thẩm quyền và ảnh hưởng của OSI."

Một nỗ lực dung hòa mới

OSI thừa nhận khi OSAID 1.0 được công bố vào tháng 10 năm 2024 rằng định nghĩa này sẽ tiếp tục phát triển. Những người chỉ trích cho rằng các thiếu sót cốt lõi của nó vẫn chưa được giải quyết.

Dù vậy, Mike Dolan của Linux Foundation đã đệ trình giấy phép Open Model, Data, and Weights (OpenMDW) lên OSI. Giấy phép này ra đời từ năm 2025 và có đóng góp từ các tên tuổi như Amazon, Meta, IBM, Microsoft và Nvidia, mang lại cho nó sự hậu thuẫn đáng kể từ ngành.

Mã nguồn mở truyền thống xoay quanh mã nguồn. Nhưng LLM là một câu chuyện khác: chúng kết hợp mã, kiến trúc và trọng số số học bắt nguồn từ các tập dữ liệu huấn luyện có thể là độc quyền, có bản quyền hoặc không được tiết lộ. Câu trả lời của OpenMDW là định nghĩa các điều khoản riêng cho kiến trúc, dữ liệu huấn luyện và trọng số của mô hình, đưa các thành phần do bên cấp phép cung cấp vào một thỏa thuận duy nhất.

Nghe có vẻ hợp lý, nhưng hồ sơ đệ trình đã gặp phản đối trên danh sách thư duyệt giấy phép của OSI. Stefano Maffulli, cựu giám đốc điều hành OSI, người lãnh đạo tổ chức trong thời gian OSAID được xây dựng, nói: "Tôi vẫn có cảm giác rằng việc xem xét OpenMDW bị ảnh hưởng bởi định kiến ý thức hệ: vì chúng ta không thích các ông lớn công nghệ, mà AI giờ đây chính là các ông lớn công nghệ, nên chúng ta không thích AI; vì thế, chúng ta sẽ làm mọi cách để chặn nó."

Vì sao điều này quan trọng với người dùng Việt Nam

Đối với cộng đồng công nghệ và các doanh nghiệp Việt Nam đang cân nhắc ứng dụng AI mã nguồn mở, sự khác biệt này ảnh hưởng trực tiếp đến quyết định đầu tư. Nếu chỉ là trọng số mở, bạn có thể chạy mô hình cục bộ để tiết kiệm chi phí và bảo vệ dữ liệu — một lợi ích rõ ràng. Nhưng bạn không thể kiểm chứng đầy đủ về nguồn gốc dữ liệu huấn luyện, các vấn đề bản quyền tiềm ẩn, hay mức độ an toàn thực sự của mô hình.

Điều này đặc biệt quan trọng với các tổ chức tài chính, y tế và cơ quan nhà nước, nơi yêu cầu về tuân thủ và khả năng kiểm toán là bắt buộc. Việc gọi một mô hình là "mã nguồn mở" khi thực chất nó chỉ mở trọng số có thể dẫn đến những hiểu lầm về nghĩa vụ pháp lý và rủi ro vận hành.

Tương lai của "AI mở"

Đã quá muộn để vùi đầu vào cát. Như Landay của Stanford đặt vấn đề: "Trọng số mở trả lời câu hỏi 'Tôi có thể chạy cái này không?' Mã nguồn mở trả lời câu hỏi 'Tôi có thể tin cậy nó, cải thiện nó và xây dựng điều tiếp theo dựa trên nó không?' Hiện tại gần như tất cả mọi người — cả các phòng thí nghiệm Mỹ lẫn Trung Quốc — đều đang trả lời câu hỏi đầu tiên nhưng chưa đâu gần tới câu hỏi thứ hai."

Chúng ta cần cả hai. Việc OSI có chấp nhận OpenMDW hay không vẫn còn bỏ ngỏ. Tuy nhiên, OpenMDW và những người ủng hộ nó ít nhất đang cố gắng thiết lập các điều khoản cấp phép bao trùm cả mã, dữ liệu và trọng số cùng lúc.

Nếu không ai thành công, "AI mở" có nguy cơ trở thành một cách nói tự mâu thuẫn — hoặc chỉ đơn thuần là một thuật ngữ tiếp thị công nghệ rỗng tuếch khác.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗