GitHub ra mắt bộ dữ liệu mở giúp thúc đẩy phát triển AI đa ngôn ngữ

Công nghệ15 tháng 6, 2026·7 phút đọc

GitHub vừa công bố bộ dữ liệu "GitHub Multilingual Repositories Dataset" dưới giấy phép CC0-1.0, giúp các nhà nghiên cứu tìm kiếm nội dung phát triển phần mềm đa ngôn ngữ. Bộ dữ liệu này cung cấp siêu dữ liệu phân loại ngôn ngữ cho hơn 40 triệu kho lưu trữ công khai, nhằm thúc đẩy sự đa dạng trong các công cụ AI hiện đại.

GitHub ra mắt bộ dữ liệu mở giúp thúc đẩy phát triển AI đa ngôn ngữ

Phần mềm có thể được viết bằng các ngôn ngữ lập trình, nhưng ngôn ngữ con người mới thực sự là cốt lõi của sự hợp tác giữa các nhà phát triển. Các lập trình viên giải thích cách thức hoạt động của dự án trong tệp README, nhờ giúp đỡ qua các vấn đề (issues) và xem xét, tranh luận để cải thiện mã nguồn trong các yêu cầu kéo (pull requests). Sự hợp tác này thường diễn ra bằng tiếng Anh, nhưng không phải lúc nào cũng vậy. Khi AI ngày càng đóng vai trò quan trọng trong quy trình xây dựng phần mềm, nội dung dành cho nhà phát triển đa ngôn ngữ trở nên quan trọng hơn bao giờ hết.

Hôm nay, GitHub đã chính thức phát hành bộ dữ liệu GitHub Multilingual Repositories Dataset. Đây là bộ dữ liệu siêu dữ liệu ở cấp độ kho lưu trữ, được thiết kế để giúp các nhà nghiên cứu và nhà phát triển khám phá các kho lưu trữ công khai trên GitHub có chứa nội dung ngôn ngữ tự nhiên không phải tiếng Anh.

GitHub Multilingual DatasetGitHub Multilingual Dataset

Trong quá trình xây dựng bộ dữ liệu này, GitHub nhận thấy sự phân bố ngôn ngữ khác nhau đáng kể giữa README, issues và pull requests. Ví dụ, tiếng Hàn là ngôn ngữ không phải tiếng Anh phổ biến nhất trong văn bản của các issues, nhưng chỉ đứng thứ năm trong các README. Trong khi đó, tiếng Bồ Đào Nha lại dẫn đầu danh sách README không phải tiếng Anh với hơn 3 triệu kho lưu trữ.

Bộ dữ liệu hiện đã có sẵn trên GitHub theo giấy phép CC0-1.0. Đây là bước thực hiện cam kết mà GitHub đưa ra vào năm 2025, như một phần của Cam kết Kỹ thuật số Châu Âu (European Digital Commitments) của Microsoft, nhằm làm cho dữ liệu đa ngôn ngữ dễ tiếp cận hơn, bao gồm cả cho các nhà phát triển AI mã nguồn mở.

Bộ dữ liệu này chứa những gì?

GitHub Multilingual Repositories Dataset được thiết kế có chủ đích không phải là một bản đổ dữ liệu thô (raw dump) của nội dung kho lưu trữ. Thay vào đó, nó là một bộ dữ liệu siêu dữ liệu giúp các nhà phát triển và nhà nghiên cứu tìm thấy các kho lưu trữ nơi có thể đang diễn ra sự hợp tác đa ngôn ngữ. Bộ dữ liệu này bao gồm hơn 80 triệu hàng phân loại trên hơn 40 triệu kho lưu trữ.

Đối với mỗi kho lưu trữ công khai, bộ dữ liệu cung cấp:

  • Phân loại ngôn ngữ cho tệp README, issue được bình luận nhiều nhất và pull request được bình luận nhiều nhất, sử dụng 150 ký tự đầu tiên làm mẫu đầu vào. Các văn bản dưới 20 ký tự bị loại bỏ.
  • Phân loại từ ba công cụ: fastText, gcld3 và lingua-py, đi kèm với điểm tin cậy (confidence score). Bộ dữ liệu chỉ bao gồm các phân loại có độ tin cậy > 0.5.
  • Siêu dữ liệu của kho lưu trữ: thời gian tạo, dung lượng đĩa, số sao (stars), số nhánh (forks), ngôn ngữ lập trình chính, giấy phép SPDX, số lượng issue và pull request, cũng như ngày chụp nhanh (snapshot date).

GitHub cố tình không gộp ba bộ phân loại này thành một nhãn duy nhất. Các bộ phân loại khác nhau có độ phủ và hiệu chuẩn độ tin cậy khác nhau, đặc biệt là đối với các ngôn ngữ ít tài nguyên (lower-resource languages). Bằng cách cung cấp cả ba, người dùng có thể tự quyết định mức độ nghiêm ngặt họ muốn.

Bạn có thể làm gì với bộ dữ liệu này?

Bộ dữ liệu này được thiết kế cho những loại công việc khó thực hiện với văn bản web chung:

  • Khám phá các kho lưu trữ có khả năng chứa tài liệu hoặc sự hợp tác của nhà phát triển bằng các ngôn ngữ cụ thể.
  • Nghiên cứu cách các cộng đồng nhà phát triển không nói tiếng Anh sử dụng issues, pull requests và README.
  • Xây dựng bộ dữ liệu đánh giá (evaluation sets) cho các công cụ lập trình AI, trình tạo tài liệu hoặc trợ lý đánh giá cần hoạt động tốt trên nhiều ngôn ngữ.
  • Thúc đẩy các nhà ra quyết định mở rộng phạm vi bảo phủ ngôn ngữ cho các công cụ và tính năng AI mới bằng các lập luận có dữ liệu về sự đa dạng ngôn ngữ phong phú của các nhà phát triển.
  • Đo lường mức độ đại diện của các ngôn ngữ Châu Âu và các ngôn ngữ khác bị thiếu đại diện trong mã nguồn mở.

Một số lưu ý quan trọng

Việc xác định ngôn ngữ là một nhiệm vụ khó khăn, đặc biệt là trong các kho lưu trữ phần mềm. Văn bản trong kho lưu trữ thường ngắn gọn. Nó có thể bao gồm các huy hiệu (badges), mẫu, lệnh cài đặt, đoạn mã, tên người dùng hoặc nội dung hỗn hợp ngôn ngữ. Một mẫu 150 ký tự có thể không đại diện cho toàn bộ kho lưu trữ. Các bộ phân loại cũng thay đổi về độ phủ và hiệu chuẩn, đặc biệt là đối với các ngôn ngữ ít tài nguyên.

Do đó, bộ dữ liệu này không nên được coi là điểm chuẩn chuẩn xác (ground-truth benchmark) để xác định ngôn ngữ. Thay vào đó, nó được thiết kế như một công cụ khám phá minh bạch. Người dùng có thể kiểm tra các phân loại, điểm tin cậy và nguồn, sau đó chọn các đánh đổi giữa độ chính xác (precision) và độ phủ (recall) phù hợp với quy trình nghiên cứu hoặc phát triển của riêng mình.

Bộ dữ liệu cũng không nên được sử dụng để suy ra các thuộc tính nhạy cảm về chủ sở hữu kho lưu trữ, người đóng góp hoặc cộng đồng. Các tín hiệu này là siêu dữ liệu ở cấp độ kho lưu trữ, không phải thuộc tính cấp độ cá nhân.

Tại sao dữ liệu đa ngôn ngữ mở lại quan trọng?

Hiện nay, nhiều ngôn ngữ Châu Âu vẫn bị thiếu đại diện trong văn bản trực tuyến được sử dụng để xây dựng và đánh giá các hệ thống AI. Điều này tạo ra rủi ro rằng các công cụ AI hoạt động tốt cho một số nhà phát triển, ngôn ngữ và cộng đồng, trong khi bỏ lại những người khác phía sau. Dữ liệu mở có giúp thu hẹp khoảng cách này.

GitHub xây dựng bộ dữ liệu này vì nội dung của nhà phát triển khác với văn bản web chung. README, issues và pull requests chứa ngôn ngữ của sự hợp tác phần mềm: hướng dẫn cài đặt, báo cáo lỗi, yêu cầu tính năng, bình luận đánh giá và các quy chuẩn cộng đồng. Ngữ cảnh đó có thể giúp xây dựng các hệ thống AI hiểu rõ hơn về cách các nhà phát triển thực sự làm việc.

Bằng cách làm cho các tín hiệu nội dung đa ngôn ngữ của nhà phát triển dễ dàng tìm thấy và phân tích hơn, bộ dữ liệu này cung cấp cho các nhà nghiên cứu, nhà phát triển mã nguồn mở và người xây dựng mô hình một công cụ khác để nghiên cứu sự đại diện của ngôn ngữ trong phát triển phần mềm. Nó có thể giúp xác định các khoảng trống, hỗ trợ đánh giá tốt hơn và thông báo cho các công cụ AI bao trùm hơn cho các nhà phát triển trên khắp Châu Âu và beyond.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗