Chip MTIA 400 mới của Meta: 'Con dao hai lưỡi' vừa huấn luyện AI vừa phục vụ quảng cáo
Tại hội nghị Hot Chips, Meta đã trình làng chi tiết về MTIA 400 - thế hệ chip tăng tốc AI đầu tiên dành riêng cho việc huấn luyện mô hình ngôn ngữ lớn, nhưng lại mang trong mình 'nhiệm vụ kép' là chạy hệ thống gợi ý quảng cáo (DLRM). Chip này nhanh hơn khoảng 20% so với Nvidia Blackwell ở độ chính xác cao, nhưng vẫn chưa thể thay thế hoàn toàn GPU của AMD hay Nvidia cho các tác vụ suy luận AI tiên tiến.

Chip MTIA 400 mới của Meta: 'Con dao hai lưỡi' vừa huấn luyện AI vừa phục vụ quảng cáo
Meta vừa chính thức hé lộ kiến trúc chi tiết của MTIA 400 (Meta Training and Inference Accelerator) - thế hệ chip tăng tốc AI đầu tiên được thiết kế chuyên dụng cho việc huấn luyện các mô hình ngôn ngữ lớn (LLM). Tuy nhiên, điểm đặc biệt của con chip này nằm ở 'tính cách hai mặt': ngoài việc tăng tốc huấn luyện, nó vẫn phải đảm nhận vai trò quan trọng là chạy hệ thống gợi ý quảng cáo - nguồn thu chính của gã khổng lồ mạng xã hội. Dù sở hữu hiệu năng ấn tượng, MTIA 400 vẫn chưa phải là 'át chủ bài' đủ sức thay thế hoàn toàn GPU của Nvidia hay AMD.
Slide thiết kế của Meta về MTIA 400 tại Hot Chips
Chiến lược đi ngược xu hướng
Thông thường, nếu xây dựng một chip tăng tốc AI tùy chỉnh, các công ty thường bắt đầu với các tác vụ suy luận (inference) vì chúng đơn giản hơn, cụm hệ thống nhỏ hơn và chỉ cần tập trung vào một việc duy nhất: phục vụ token. OpenAI với chip Jalapeño là một ví dụ điển hình.
Tuy nhiên, Meta đang đi ngược lại xu hướng này. MTIA 400 không phải là chip suy luận GenAI thông thường mà được thiết kế để phục vụ công việc 'nặng ký' nhất: huấn luyện các mô hình AI tạo sinh. Điều này khác biệt so với các thế hệ chip trước đó của Meta, vốn chỉ tập trung vào việc phục vụ quảng cáo, tương tự như Amazon và Google đã làm.
'Nhiệm vụ kép': Vừa huấn luyện, vừa kiếm tiền
Điểm độc đáo nhất của MTIA 400 chính là sự kết hợp bất thường giữa hai khối lượng công việc có yêu cầu hiệu năng trái ngược nhau:
- Huấn luyện LLM: Cực kỳ tốn tài nguyên tính toán, thường cần hàng chục nghìn chip tăng tốc để hoàn thành trong thời gian hợp lý.
- Suy luận DLRM (Deep Learning Recommender Model): Chủ yếu bị giới hạn bởi băng thông bộ nhớ, khiến phần lớn sức mạnh tính toán (FLOPS) của chip bị bỏ phí nếu chỉ dùng cho việc này.
Tuy nhiên, việc 'ôm' cả hai vai trò này có thể không tệ, bởi Meta đang đốt rất nhiều tiền vào chi phí điện toán. Việc chip có thể 'gánh' thêm công việc sinh lời cao như phục vụ quảng cáo là một lợi thế kinh tế rõ ràng.
Ứng dụng phần cứng chuyên dụng luôn phù hợp nhất với các khối lượng công việc đã được hiểu rõ. Chip của Meta cũng không phải là ngoại lệ. Tuy nhiên, nó khó có thể thay thế GPU của AMD hay Nvidia trong việc huấn luyện các mô hình tiên tiến như Muse Spark của Meta Superintelligence Labs.
'Giải phẫu' MTIA 400
Xét về thiết kế, MTIA 400 trông khá giống với GPU Rubin của Nvidia hoặc MI355X của AMD. Con chip này được xây dựng trên kiến trúc đa khuôn (multi-die) không đồng nhất, bao gồm:
- Hai khuôn tính toán (compute dies)
- Hai khuôn I/O
- Một khuôn SoC phụ trách kết nối máy chủ và điều phối khối lượng công việc
Cận cảnh cấu trúc gói chip MTIA 400 của Meta
Dấu ấn của Broadcom trong sản phẩm này là rất rõ ràng, khi họ cung cấp nền tảng công nghệ XPU. Các khuôn tính toán được sản xuất trên tiến trình 3nm (nhiều khả năng của TSMC), bao gồm một lưới 6x8 phần tử xử lý (processing elements).
Thông số hiệu năng chính
- Sức mạnh tính toán: 12 petaFLOPS với độ chính xác MXFP4 ở xung nhịp 1.7 GHz.
- So sánh với đối thủ: Nhanh hơn khoảng 20% so với các chip Blackwell mạnh nhất của Nvidia ở độ chính xác cao hơn (thường dùng để huấn luyện), nhưng mức tiêu thụ điện năng tương đương.
- Điểm yếu: Chậm hơn từ 3 đến 3.3 lần so với GPU Rubin và Instinct MI455X mới nhất của Nvidia và AMD.
- Bộ nhớ: 8 ngăn xếp HBM3e với dung lượng 36 GB mỗi ngăn, tổng cộng 288 GB và băng thông 9.2 TB/s. Con số này cao hơn 15% so với thế hệ trước của đối thủ, nhưng chỉ bằng chưa đến một nửa băng thông của GPU mới nhất hiện nay.
- Kết nối: Cặp khuôn I/O cung cấp băng thông chip-to-chip lên tới 1.2 TB/s qua RDMA, nhiều khả năng sử dụng giao thức Ethernet.
Cấu trúc tính toán bên trong MTIA 400
Thiết kế hệ thống: Học theo 'anh lớn'
Kiến trúc hệ thống của MTIA 400 cũng rất giống với các rack hệ thống NVL72 (Nvidia) và Helios (AMD). Cụ thể:
- Mỗi blade tính toán gồm 4 chip MTIA 400, kết nối qua bộ chuyển mạch PCIe với một CPU x86 và một NIC mở rộng quy mô.
- Mỗi rack có 18 blade tính toán và 8 blade chuyển mạch, tạo thành một cụm thống nhất gồm 72 chip tăng tốc.
Meta chưa công bố quy mô tối đa của cụm hệ thống, chỉ cho biết có thể "mở rộng lên tới hàng nghìn chip". Tuy nhiên, ở quy mô rack, hệ thống này đã đủ sức cạnh tranh với GB200 và GB300 của Nvidia cho các tác vụ huấn luyện.
Lộ trình tương lai: MTIA 450 và MTIA 500
Meta đang tích cực phát triển các thế hệ chip tiếp theo để mở rộng hệ sinh thái của mình:
| Tên chip | Mục tiêu | Cải tiến chính | Thời điểm |
|---|---|---|---|
| MTIA 400 | Huấn luyện LLM + Suy luận DLRM | Nền tảng hiện tại | Đã ra mắt |
| MTIA 450 | Suy luận tối ưu | Tăng gấp đôi băng thông bộ nhớ (nhiều khả năng dùng HBM4) | Dự kiến sản xuất năm sau |
| MTIA 500 | Chưa rõ | Tăng 50% băng thông (thêm 4 ngăn HBM4) và gấp đôi số khuôn tính toán | Dự kiến năm 2027 |
Việc phát triển MTIA 450 đặc biệt đáng chú ý vì nó hứa hẹn sẽ cực kỳ phù hợp để chạy các hệ thống gợi ý dựa trên LLM mà Meta đã nhắc đến trong nhiều quý gần đây.
Tóm lại, MTIA 400 là một bước đi chiến lược của Meta nhằm giảm sự phụ thuộc vào các nhà cung cấp GPU bên ngoài cho các khối lượng công việc quan trọng. Dù chưa thể thay thế hoàn toàn Nvidia hay AMD trong mọi tác vụ, con chip này thể hiện tham vọng lớn của Meta trong việc kiểm soát toàn bộ hạ tầng AI của mình, từ việc huấn luyện các mô hình tiên tiến đến tối ưu hóa nguồn thu quảng cáo.