Tôi huấn luyện một mạng nơ-ron tí hon để nén dữ liệu. Nó vẽ ra một hình ngũ giác.

Công nghệ23 tháng 9, 2026·3 phút đọc

Một lập trình viên tái tạo lại nghiên cứu \"Toy Models of Superposition\" của Anthropic từ đầu bằng NumPy, tự tay suy ra đạo hàm và không dùng bất kỳ con số sao chép nào. Kết quả bất ngờ: mạng nơ-ron nhỏ bé tự động học được cách biểu diễn dữ liệu thành hình ngũ giác.

Có những thí nghiệm tưởng chừng đơn giản lại hé lộ điều sâu sắc về cách mạng nơ-ron "suy nghĩ". Mới đây, một tác giả trên Towards Data Science đã tái tạo nghiên cứu nổi tiếng "Toy Models of Superposition" của Anthropic — hoàn toàn từ đầu, chỉ bằng NumPy, tự suy ra đạo hàm bằng tay và không sao chép bất kỳ con số nào.

Điều thú vị nằm ở kết quả: mạng nơ-ron tí hon ấy, khi được huấn luyện để nén dữ liệu, đã tự động "vẽ" ra một hình ngũ giác.

Chuyện gì đang diễn ra?

Ý tưởng cốt lõi của superposition (chồng chập) là hiện tượng mạng nơ-ron biểu diễn nhiều đặc trưng (feature) khác nhau trong cùng một không gian ít chiều hơn số lượng đặc trưng. Nghe có vẻ mâu thuẫn, nhưng đây chính là cơ chế giúp các mô hình lớn như GPT hay Claude có thể "ghi nhớ" hàng triệu khái niệm dù số chiều ẩn hữu hạn.

Trong thí nghiệm này, mạng nơ-ron bị ép nén dữ liệu nhiều chiều vào một không gian nhỏ hơn. Thay vì phân bổ đều các hướng biểu diễn, nó chọn cách sắp xếp các vector đặc trưng thành một cấu trúc đối xứng — và cấu trúc ấy, với một số cấu hình, chính là một hình ngũ giác.

Tại sao lại là hình ngũ giác?

Đây không phải chuyện ngẫu nhiên. Khi số chiều bị giới hạn, mạng nơ-ron phải tìm cách "xếp" các đặc trưng sao cho ít chồng lấn nhất có thể. Về mặt hình học, việc đặt các vector trên một đa giác đều giúp tối ưu khoảng cách góc giữa chúng — giảm thiểu nhiễu (interference) khi giải nén.

  • Với 5 đặc trưng cần biểu diễn trong không gian 2 chiều, hình ngũ giác là lời giải tối ưu.
  • Với số đặc trưng khác, ta có thể thấy hình tam giác, tứ giác, hoặc các cấu trúc phức tạp hơn.
  • Hiện tượng này phản ánh cách mạng nơ-ron "tự tổ chức" để cân bằng giữa khả năng biểu diễn và mức độ nhiễu.

Điều đáng kinh ngạc không phải là mạng vẽ được hình ngũ giác, mà là nó tự tìm ra cấu trúc hình học tối ưu mà không ai dạy.

Tự suy đạo hàm — không dùng thư viện

Điểm đáng chú ý về mặt kỹ thuật: tác giả không dùng PyTorch hay TensorFlow. Toàn bộ quá trình lan truyền xuôi (forward) và lan truyền ngược (backward) được viết tay bằng NumPy, với đạo hàm được suy ra thủ công.

Cách làm này có giá trị lớn về mặt giáo dục. Nó buộc người viết phải hiểu tường tận từng phép toán:

  • Ma trận trọng số được khởi tạo và cập nhật thủ công.
  • Hàm mất mát (loss) phản ánh mục tiêu nén và tái tạo dữ liệu.
  • Gradient được tính bằng tay, đảm bảo không có "hộp đen" nào che giấu logic.

Ý nghĩa với cộng đồng AI Việt Nam

Với các bạn đang học machine learning hoặc nghiên cứu AI tại Việt Nam, bài toán này là một bài tập tuyệt vời để hiểu sâu về superpositioninterpretability (khả năng diễn giải mô hình). Thay vì chỉ chạy các mô hình lớn, việc tự tay tái tạo những thí nghiệm nhỏ như thế này giúp xây dựng trực giác vững chắc về cách mạng nơ-ron hoạt động.

Xu hướng AI interpretability đang ngày càng được chú ý, đặc biệt khi các mô hình ngôn ngữ lớn trở nên phổ biến. Hiểu được cơ chế bên trong như superposition là bước đầu để kiểm soát và tin tưởng các hệ thống AI trong tương lai.

Nếu bạn tò mò, hãy thử tự viết lại thí nghiệm này — có thể bạn sẽ phát hiện ra những hình dạng thú vị khác mà mạng nơ-ron tạo ra.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗