Huấn luyện AI phân tán: Khi mạng giữa các trung tâm dữ liệu trở thành bài toán hóc búa

Công nghệ09 tháng 10, 2026·14 phút đọc

Khi các mô hình AI ngày càng lớn, việc huấn luyện không còn gói gọn trong một trung tâm dữ liệu mà trải rộng trên hàng trăm kilômét. Điều này đặt ra những thách thức mới về băng thông, độ trễ và quang học cho hạ tầng mạng kết nối giữa các trung tâm dữ liệu.

Huấn luyện AI phân tán: Khi mạng giữa các trung tâm dữ liệu trở thành bài toán hóc búa

Huấn luyện AI quy mô lớn từ lâu đã vượt ra khỏi giới hạn của một trung tâm dữ liệu duy nhất. Google cho biết Gemini được huấn luyện đồng bộ trên các cụm máy đặt tại nhiều địa điểm khác nhau. Microsoft đã kết nối các trung tâm dữ liệu AI ở Wisconsin và Georgia thành cái mà hãng gọi là một siêu máy tính AI phân tán. AWS kết nối các cụm tính toán AI trên phạm vi rộng để Anthropic xây dựng mô hình Claude. Meta xây dựng các tuyến kết nối trung tâm dữ liệu dung lượng cao nhằm hỗ trợ huấn luyện mô hình. Gần đây, CoreWeave và Google Cloud công bố huấn luyện xuyên đám mây qua một tuyến kết nối riêng, và Azure nhiều khả năng sẽ nối gót trong thời gian tới.

Sự lan rộng địa lý này một phần xuất phát từ giới hạn của từng trung tâm dữ liệu hay cụm trong cùng một khuôn viên, vốn ngày càng căng thẳng trước nhu cầu tính toán và điện năng của các mô hình mới. Cisco ước tính một mô hình ngày nay có thể cần cụm lên tới hàng chục nghìn GPU. Theo các nhà nghiên cứu tại Epoch AI, đến năm 2030, những lần huấn luyện mô hình tiên phong lớn nhất có thể tiêu thụ 4-16GW điện năng. Việc phân tán tính toán cho phép các hyperscaler và đơn vị vận hành trung tâm dữ liệu xây dựng ở những nơi có nhiều điện năng, không gian hơn và ít ràng buộc về quy hoạch.

Cách huấn luyện một mô hình ngôn ngữ lớn

Cốt lõi của một LLM là mạng nơ-ron với hàng tỷ tham số số học, hay còn gọi là trọng số, được điều chỉnh trong quá trình huấn luyện. Một lô dữ liệu huấn luyện đi qua mô hình, mô hình đưa ra dự đoán. Hệ thống đo sai số và tính toán xem các trọng số nên thay đổi thế nào. Trọng số được cập nhật và quy trình bắt đầu lại. Ở quy mô của các mô hình hiện đại, công việc này được phân tán trên hàng nghìn GPU và các bộ tăng tốc khác như AWS Trainium hay Google TPU.

Các GPU khác nhau có thể xử lý những lô dữ liệu riêng biệt hoặc những phần khác nhau của mô hình. Nhưng chúng không thể hoạt động hoàn toàn độc lập: tại nhiều thời điểm, chúng phải trao đổi kết quả và đồng bộ trước khi giai đoạn huấn luyện tiếp theo có thể bắt đầu.

Dữ liệu mà mạng truyền giữa các bộ tăng tốc thường không phải là văn bản hay hình ảnh dùng để huấn luyện mô hình, mà là những mảng dữ liệu số lớn như gradient và kết quả trung gian. Hàng nghìn bộ tăng tốc có thể cần trao đổi và kết hợp dữ liệu đó gần như cùng lúc.

"Nếu bạn nhìn vào bất kỳ tác vụ huấn luyện nào, nó về cơ bản là sự lặp đi lặp lại của tính toán và đồng bộ. Bạn tính toán các trọng số, truyền chúng đi để đồng bộ mọi GPU trong cụm, rồi khởi động lại quá trình tính toán. Điều đó có nghĩa là lưu lượng dạng bùng nổ diễn ra theo chu kỳ trong suốt quá trình huấn luyện", Ramesh Sivakolundu thuộc nhóm kiến trúc Silicon One của Cisco giải thích.

Hàng nghìn bộ tăng tốc có thể hoàn tất một giai đoạn tính toán và bắt đầu truyền thông cùng lúc. Điều này có thể dẫn tới vấn đề "incast", khi nhiều nguồn gửi cùng đổ về một đích và lưu lượng đến nhanh hơn khả năng xử lý của tuyến kế tiếp.

Vấn đề cốt lõi nằm ở việc đồng bộ. Trong một tác vụ huấn luyện đồng bộ, một nhóm GPU không thể đơn giản bỏ qua nhóm chậm hơn và tiếp tục độc lập. Việc trao đổi trên toàn mạng phải hoàn tất trước khi các GPU tham gia có thể chuyển sang giai đoạn tiếp theo. Do đó, độ trễ mạng trở thành độ trễ tính toán.

"Bạn không muốn mạng trở thành điểm nghẽn trong quá trình huấn luyện. Ý tưởng là giữ cho các GPU luôn bận rộn và không để mạng tạo thêm độ trễ vào chương trình huấn luyện tổng thể", Sivakolundu nói.

Điều đó không có nghĩa là mọi hiện tượng tắc nghẽn hay mất gói đều khiến toàn bộ quá trình huấn luyện dừng lại hoàn toàn. Tuy nhiên, một luồng bị trễ hoặc bị mất có thể cần truyền lại, kéo dài thao tác truyền thông tập thể và khiến các bộ tăng tốc khác phải chờ. Những sự cố nghiêm trọng hơn có thể buộc quá trình huấn luyện quay về một điểm kiểm tra đã lưu.

Một kiểu kết nối liên trung tâm khác biệt

"Bên trong một trung tâm dữ liệu, bạn có thể giả định rằng mình đã xây dựng một mạng lưới đầy đủ kết nối các rack GPU với băng thông như đã hoạch định", Itamar Gold, giám đốc quản lý sản phẩm tại Cisco, cho biết.

Điểm mà Gold muốn nói là với mô hình "scale-across" (mở rộng xuyên trung tâm), các khối lượng công việc AI phối hợp có thể phải đi qua một hạ tầng liên cơ sở bị hạn chế hơn so với mạng nội bộ của từng cơ sở. Theo ông, lưu lượng hướng tới cơ sở kia có thể bị dồn qua một kênh hẹp hơn, và một đợt bùng nổ đồng bộ có thể biến kênh đó thành điểm tắc nghẽn tạm thời.

Kết nối trung tâm dữ liệu liên kết truyền thống nối các môi trường trung tâm dữ liệu vốn độc lập với nhau, thường được xây dựng để đảm bảo dự phòng, phạm vi phủ và phân phối khối lượng công việc. Lưu lượng chạy trên đó thường là lưu lượng sao chép hoặc dữ liệu ứng dụng, và các luồng là bất đồng bộ, nghĩa là một luồng không nhất thiết phải hoàn tất cùng nhịp với các luồng khác.

Trong huấn luyện AI scale-across, mạng liên cơ sở trở thành một phần của tính toán phân tán có phối hợp, thay vì chỉ đơn thuần di chuyển dữ liệu giữa các hệ thống độc lập. Vì vậy, việc có đủ băng thông và đảm bảo truyền tải dự đoán được là điều thiết yếu.

Từ rack đến khu vực

Bên trong một rack, yêu cầu băng thông có thể rất lớn, lên tới 800Gbps-1,6Tbps, nhưng khoảng cách lại ngắn. Các làn nối tiếp tốc độ cao kết hợp để một cụm GPU trông như một đơn vị tính toán duy nhất. Khi hạ tầng AI được mở rộng ra toàn bộ cơ sở, tức "scale out", các rack vẫn cần kết nối lên tới 1,6T. Ở tốc độ dữ liệu này, cáp đồng thường chỉ giới hạn trong khoảng cách ngắn. Các kết nối xuyên hàng rack và xuyên tầng trung tâm dữ liệu thay vào đó dùng quang học cắm rời, với các tuyến scale-out kéo dài từ vài trăm mét đến khoảng 2km.

"Scale-across" mở rộng hạ tầng AI có phối hợp ra nhiều cơ sở, khiến hành vi mạng liên cơ sở trở thành một phần hiệu năng của khối lượng công việc. Tùy kiến trúc, các tuyến này có thể trải qua khoảng cách đô thị hoặc vùng, thậm chí xa hơn. Theo mô hình hóa của Cisco về các triển khai AI phân tán lớn, yêu cầu băng thông tổng hợp có thể đạt khoảng 14 lần mức cơ sở của kết nối trung tâm dữ liệu thông thường.

Trước hết, quang học tầm ngắn trong trung tâm dữ liệu không được thiết kế để mang tín hiệu 400-800 Gbps qua hàng trăm kilômét. Với khoảng cách này, các đơn vị vận hành cần quang học mạch lạc (coherent optics) sử dụng điều chế tinh vi và xử lý tín hiệu số hiệu năng cao để giữ tín hiệu quang tốc độ cao khả dụng trên các tuyến cáp quang đô thị và vùng, bù đắp cho những suy hao vật lý trở nên rõ rệt hơn theo khoảng cách.

Số cổng cũng quan trọng không kém. Cisco ước tính việc kết nối hai site AI 100MW có thể cần 12.000 đến 32.000 cổng quang mạch lạc ở lớp scale-across, so với khoảng 1.000 đến 2.000 cho kết nối trung tâm dữ liệu thông thường giữa các cơ sở tương đương. Với 400G hoặc 800G mỗi cổng, con số này cộng lại thành dung lượng tổng hợp hàng petabit. Việc di chuyển lượng dữ liệu lớn như vậy cũng là bài toán về điện năng và không gian.

Các module quang mạch lạc cắm rời đưa chức năng transponder mạch lạc trực tiếp vào cổng router hoặc switch, tránh phải dùng một dàn transponder DWDM độc lập riêng. Cisco cho biết cách này giảm không gian rack, điện năng và làm mát cần thêm cho lớp quang liên cơ sở, một yếu tố quan trọng khi bản thân các nhà máy AI đã bị giới hạn về điện năng.

Bài toán độ trễ

Ngay cả khi có đủ băng thông và quang học phù hợp, khoảng cách vẫn làm tăng độ trễ. Nếu tắc nghẽn hình thành, mạng cần thời gian để phát tín hiệu yêu cầu bên gửi giảm tốc độ. Trên một hạ tầng AI cục bộ, phản hồi có thể đến nhanh chóng. Nhưng nếu kết nối kéo dài qua 100 km cáp quang, lượng dữ liệu được truyền đi trước khi bên gửi biết có vấn đề sẽ lớn hơn đáng kể.

Cisco tính toán rằng trên một kết nối 800 Gbps trải dài 100 km, khoảng 100 MB dữ liệu có thể đã đang trên đường truyền trong khoảng thời gian phản hồi đó. Cisco lập luận rằng những vòng phản hồi dài hơn này làm tăng giá trị của các chip mạng được thiết kế với bộ đệm sâu hơn đáng kể. Các kiến trúc chuyển mạch bộ đệm nông vốn dành cho độ trễ rất thấp bên trong trung tâm dữ liệu có ít khả năng hấp thụ lưu lượng hơn khi phản hồi tắc nghẽn phải đi qua một tuyến đường dài.

"Lý do bạn cần bộ đệm sâu hơn khi khoảng cách tăng lên là bạn không nhận được phản hồi về việc truyền gói trong khoảng thời gian dài hơn. Nếu bạn không đệm đủ sâu, bạn có thể rơi vào tình trạng mất và truyền lại gói, làm tăng độ trễ", Sivakolundu nói.

Bộ đệm sâu hấp thụ một đợt bùng nổ hoặc gián đoạn tạm thời trong khi quản lý lưu lượng và tín hiệu tắc nghẽn giải quyết vấn đề gốc rễ. Tắc nghẽn kéo dài vẫn cần thêm dung lượng hoặc thay đổi cách phân phối lưu lượng.

Bộ đệm tương tự cũng giúp xử lý tình trạng cấp băng thông vượt mức (oversubscription). Nếu tổng dung lượng đổ vào một kết nối liên cơ sở lớn hơn dung lượng của chính tuyến đó, một đợt bùng nổ đồng bộ có thể đến nhanh hơn khả năng tiêu thoát của tuyến. Bộ đệm cho lưu lượng dư thừa đó một chỗ để chờ mà không bị mất, trong khi các cơ chế kiểm soát tắc nghẽn phản ứng.

Thay vì chia bộ đệm khả dụng thành lượng cố định cho mỗi cổng, bộ đệm chia sẻ là một vùng nhớ gói chung có thể được cấp phát ở bất cứ nơi nào tắc nghẽn xuất hiện. Điều đó cho phép một tuyến bận rộn hấp thụ đợt bùng nổ lớn hơn mà không mất gói.

"Càng kết nối xa, bạn càng có thể cần đệm nhiều hơn. Bạn cũng cần sự linh hoạt để đặt càng nhiều bộ đệm càng tốt ở nơi cần thiết, có thể trên một cổng hoặc vài cổng mà bạn đã xác định có luồng gặp vấn đề. Cách tiếp cận của chúng tôi là một bộ đệm duy nhất, được chia sẻ hoàn toàn", Gold nói.

Huấn luyện AI có một đặc điểm hữu ích: phần lớn truyền thông tập thể của nó mang tính lặp lại và do đó dễ dự đoán hơn lưu lượng kết nối trung tâm dữ liệu. Cách tiếp cận của Cisco là dùng quản lý tắc nghẽn chủ động để định hướng hoặc lên lịch lưu lượng trước khi một đợt bùng nổ dự đoán được gây ra vấn đề, đồng thời vẫn giữ bộ đệm sâu như một tấm lưới an toàn cho tắc nghẽn nhất thời và các sự kiện khó lường như đứt tuyến. Hai cách tiếp cận này bổ trợ cho nhau: một cách cố tránh hàng đợi, cách kia cho mạng một nơi để đặt lưu lượng khi hàng đợi hình thành.

Cisco đặt cược vào thiết kế đồng bộ

Kiến trúc scale-across của Cisco sử dụng Silicon One P200, một bộ xử lý định tuyến 51,2 Tbps lập trình được với bộ đệm sâu, có mặt trong các nền tảng Cisco 8223 và Cisco N9000. Những hệ thống này có thể được ghép với quang học cắm rời mạch lạc 400G và 800G của Cisco cho các tuyến đường dài, trong khi các hệ thống truyền tải mở như Cisco Open Transport 3000 và Cisco NCS 1014 đảm nhận lớp truyền tải quang khi cần.

Các module quang mạch lạc cắm rời tạo ra bước sóng DWDM trực tiếp từ hệ thống định tuyến, trong khi hệ thống truyền tải khuếch đại và mang các bước sóng đó qua hạ tầng cáp quang. Với các tuyến cần nhiều cặp sợi song song, Cisco Open Transport 3000 dùng thiết kế đa đường ray kết hợp các thành phần quang của nhiều đường ray vào một line card. Cisco tuyên bố cách này giảm 75% điện năng trên mỗi đường ray và 80% không gian rack. Khi cần một hệ thống truyền tải riêng, NCS 1014 có thể cung cấp dung lượng 12,8 Tbps từ một line card 1RU.

P200 có bộ xử lý mạng lập trình được chạy hoàn tất (run-to-completion) và bộ công cụ P4, mà Cisco cho biết cho phép phát triển hỗ trợ giao thức, đo từ xa và các tính năng xử lý gói khác bằng phần mềm thay vì mọi thay đổi đều phụ thuộc vào một thế hệ chip mới.

"Với scale-across, nơi các đơn vị vận hành vẫn đang thử nghiệm nhiều cấu trúc liên kết và phương pháp quản lý lưu lượng khác nhau, chính sự linh hoạt lập trình được này có thể cho phép các chức năng mạng tiến hóa mà không buộc phải thay chip mỗi khi có yêu cầu mới", Sivakolundu nói.

Cisco cũng tích hợp bảo vệ dựa trên phần cứng cho lưu lượng liên cơ sở trong thiết kế đó, với lập luận rằng mã hóa không nên tạo thêm một điểm nghẽn xử lý cho hạ tầng huấn luyện.

Một phần quan trọng trong đề xuất của Cisco là thiết kế đồng bộ. Một ASIC mạng được định hình từ nhiều năm trước khi router hoàn chỉnh đến trung tâm dữ liệu. Cisco lập luận rằng vì các nhóm silicon, hệ thống và quang học của hãng nằm trong cùng một công ty, các yêu cầu về mật độ cổng, bộ đệm, điện năng, đo từ xa và giao diện quang có thể phản hồi ngược vào thiết kế chip, thay vì nhóm hệ thống chỉ nhận một ASIC thương mại rồi tìm cách xây dựng quanh nó.

Điều đó không có nghĩa scale-across đã chốt một kiến trúc được phê chuẩn duy nhất. Bản thân Cisco chia bài toán thành các triển khai trong khuôn viên, đô thị và vùng, và nhiều đơn vị vận hành đang thử nghiệm các kết hợp khác nhau giữa kỹ thuật mạng và kỹ thuật huấn luyện.

Các triển khai khác nhau đáng kể tùy đơn vị vận hành, bao gồm khoảng cách, cấu trúc liên kết và thiết kế khối lượng công việc, trong khi vấn đề chung là duy trì hiệu năng AI có phối hợp xuyên các site. Tuy nhiên, công nghệ này vẫn đang ở giai đoạn đầu.

"Chúng tôi đang thấy những triển khai ban đầu, nhưng đây là một quá trình và tôi nghĩ sẽ mất vài năm", Gold nói.

Thiết kế mạng cho huấn luyện phân tán sẽ không xóa bỏ độ trễ do khoảng cách, nhưng có thể giữ cho tuyến kết nối đó không trở thành điểm nghẽn. Điều này cho các hyperscaler và đơn vị vận hành trung tâm dữ liệu sự linh hoạt để bổ sung năng lực tính toán ở nơi có điện năng và không gian, trong khi vẫn coi nhiều site như một phần của cùng một hạ tầng huấn luyện.

Nội dung được tài trợ bởi Cisco.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗