Atlassian tái cấu trúc hệ thống metrics quy mô lớn với OpenTelemetry

Công nghệ29 tháng 9, 2026·3 phút đọc

Atlassian đã công bố quá trình chuyển đổi từ gostatsd sang OpenTelemetry cho nền tảng metrics tiếp nhận dữ liệu từ khoảng 100.000 máy chủ trải khắp 14 khu vực. Với cam kết SLO 99,95%, đội ngũ kỹ thuật phải thực hiện thay đổi mà không làm gián đoạn các chỉ số phục vụ cảnh báo sản xuất.

Atlassian vừa công bố chi tiết hành trình chuyển đổi nền tảng metrics nội bộ từ gostatsd sang OpenTelemetry — một trong những dự án hạ tầng quan trọng bậc nhất của công ty phần mềm này.

Hệ thống mới tiếp nhận dữ liệu từ khoảng 100.000 máy chủ trải rộng trên 14 khu vực địa lý. Điều đáng chú ý là dịch vụ cũ vận hành với cam kết SLO 99,95%, nghĩa là đội ngũ kỹ thuật phải thay đổi toàn bộ phần lõi của nền tảng mà không được phép làm gián đoạn dòng dữ liệu phục vụ các cảnh báo sản xuất.

Vì sao phải thay đổi?

gostatsd từng là lựa chọn phổ biến cho việc thu thập metrics theo giao thức StatsD. Tuy nhiên, khi quy mô hạ tầng của Atlassian tăng lên, những hạn chế của công cụ này dần lộ rõ:

  • Khó mở rộng theo chiều ngang khi số lượng máy chủ tăng vọt
  • Thiếu chuẩn hóa trong cách thu thập và truyền tải dữ liệu
  • Hạn chế khả năng tích hợp với các hệ thống observability hiện đại

Trong khi đó, OpenTelemetry đã trở thành chuẩn mở được cộng đồng rộng lớn hậu thuẫn, hỗ trợ cả ba trụ cột quan sát: metrics, logs và traces.

Việc chuyển đổi không chỉ là thay công cụ, mà là tái định hình toàn bộ cách nền tảng thu thập, xử lý và phân phối dữ liệu đo lường.

Thách thức khi SLO ở mức 99,95%

Với mức cam kết dịch vụ 99,95%, thời gian gián đoạn cho phép trong một năm chỉ vào khoảng vài giờ. Điều này đồng nghĩa đội ngũ Atlassian không thể áp dụng cách tiếp cận "tắt rồi bật lại".

Các cảnh báo sản xuất phụ thuộc trực tiếp vào luồng metrics, nên bất kỳ khoảng trống dữ liệu nào cũng có thể dẫn tới:

  • Cảnh báo sai hoặc bỏ sót sự cố nghiêm trọng
  • Ảnh hưởng dây chuyền tới các dịch vụ khác trong hệ sinh thái
  • Mất niềm tin từ các đội vận hành và phát triển sản phẩm

Do đó, chiến lược được triển khai theo hướng chuyển đổi dần dần, chạy song song hai hệ thống trong giai đoạn quá độ để đối chiếu kết quả trước khi cắt hoàn toàn hệ thống cũ.

Bài học cho các đội hạ tầng

Câu chuyện của Atlassian phản ánh một xu hướng rõ nét: OpenTelemetry đang trở thành lựa chọn mặc định cho hạ tầng observability quy mô lớn. Với các doanh nghiệp công nghệ tại Việt Nam đang mở rộng hệ thống lên hàng nghìn máy chủ, đây là bài học đáng tham khảo:

  • Ưu tiên chuẩn mở thay vì công cụ độc quyền để tránh bị khóa vào nhà cung cấp
  • Duy trì khả năng chạy song song khi di trú hệ thống quan trọng
  • Đặt chỉ số SLO làm ràng buộc thiết kế ngay từ đầu, không phải yêu cầu bổ sung sau

Việc di trú thành công ở quy mô 100.000 máy chủ cho thấy các nền tảng mã nguồn mở chuẩn hóa đã đủ chín muồi để gánh vác những khối lượng công việc khắt khe nhất trong môi trường sản xuất.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗