Bạn suy nghĩ như một người theo trường phái Bayes nhưng lại được dạy như một người theo trường phái tần suất
Từ một thanh sô-cô-la không có nhãn giá đến một mô hình hỗn hợp tiếp thị trên PyMC, và tích phân 200 năm tuổi đứng giữa câu chuyện đó. Bài viết lý giải vì sao trực giác tự nhiên của chúng ta vốn mang tư duy Bayes, trong khi trường học lại dạy ta tư duy tần suất.
Bạn suy nghĩ như một người theo trường phái Bayes nhưng lại được dạy như một người theo trường phái tần suất
Có một nghịch lý thú vị trong cách chúng ta học xác suất. Khi đối mặt với một thanh sô-cô-la không có nhãn giá, bộ não của bạn ngay lập tức đưa ra phán đoán dựa trên những gì đã biết trước đó. Nhưng khi bước vào lớp học, bạn lại bị yêu cầu tính toán theo một lối tư duy hoàn toàn khác. Khoảng cách giữa hai cách tiếp cận này chính là câu chuyện về Bayes và tần suất — và về một tích phân đã tồn tại suốt 200 năm.
Trực giác tự nhiên của chúng ta vốn là Bayes
Hãy tưởng tượng bạn đứng trước quầy hàng và cầm một thanh sô-cô-la không có nhãn giá. Bạn không hề hoang mang. Ngay lập tức, bộ não bạn ước lượng: thanh này trông tương tự những thanh khác giá khoảng 20 nghìn, nhưng nó to hơn một chút, lại nằm ở quầy cao cấp nên có thể đắt hơn. Bạn vừa cập nhật niềm tin của mình dựa trên bằng chứng mới.
Đó chính là suy luận Bayes trong dạng thuần khiết nhất. Chúng ta bắt đầu với một niềm tin ban đầu (prior), rồi điều chỉnh nó khi có thêm dữ liệu (likelihood), để đi đến một niềm tin hậu nghiệm (posterior). Con người làm điều này hàng trăm lần mỗi ngày mà không hề viết ra một công thức nào.
Định lý Bayes nổi tiếng phát biểu đúng điều đó:
Xác suất của giả thuyết khi có dữ liệu bằng xác suất ban đầu của giả thuyết nhân với khả năng xảy ra dữ liệu, chia cho xác suất của dữ liệu.
Vậy tại sao trường học lại dạy tần suất?
Trong lớp học thống kê truyền thống, ta được dạy rằng xác suất là tần suất xảy ra của một sự kiện khi lặp lại thí nghiệm vô số lần. Đồng xu công bằng có xác suất ra mặt ngửa là 0,5 vì nếu tung vô hạn lần, tỷ lệ đó sẽ tiến về 0,5.
Cách tiếp cận tần suất này có ưu điểm lớn: nó khách quan, dựa trên dữ liệu quan sát được, và không đòi hỏi ta phải đưa vào bất kỳ niềm tin chủ quan nào. Vì thế nó trở thành nền tảng của thống kê cổ điển — kiểm định giả thuyết, giá trị p, khoảng tin cậy. Tất cả đều xây trên nền tảng tần suất.
Nhưng đây là mâu thuẫn: bộ não của chúng ta không vận hành theo tần suất. Con người không chạy hàng triệu thí nghiệm trong đầu để tính xác suất. Chúng ta đưa ra phán đoán dựa trên kinh nghiệm, bối cảnh và bằng chứng trước mắt — tức là tư duy Bayes.
Từ thanh sô-cô-la đến mô hình hỗn hợp tiếp thị
Sự khác biệt này không chỉ là triết lý suông. Trong thực tế, nó ảnh hưởng trực tiếp đến cách ta xây dựng mô hình. Lấy ví dụ về mô hình hỗn hợp tiếp thị (marketing mix model) — công cụ dùng để đo lường hiệu quả của các kênh quảng cáo khác nhau.
Cách tiếp cận tần suất truyền thống sẽ cố gắng tìm ra một con số chính xác cho mỗi kênh, kèm theo giá trị p để khẳng định "kênh này có tác động hay không". Vấn đề là khi có nhiều kênh tương quan với nhau, mô hình tần suất thường cho ra kết quả bất ổn, thậm chí vô lý.
Cách tiếp cận Bayes — chẳng hạn khi triển khai trên PyMC, một thư viện suy luận Bayes bằng Python — cho phép ta mã hóa những hiểu biết sẵn có vào mô hình. Bạn biết rằng ngân sách quảng cáo hợp lý chỉ nằm trong một khoảng nhất định? Hãy đưa nó vào như prior. Bạn tin rằng hiệu ứng quảng cáo sẽ giảm dần theo thời gian? Hãy mã hóa điều đó vào cấu trúc mô hình.
Kết quả không phải là một con số chính xác duy nhất, mà là một phân phối hậu nghiệm — thể hiện đầy đủ mức độ bất định của ước lượng. Điều này gần gũi hơn nhiều với cách con người thực sự đưa ra quyết định.
- Niềm tin ban đầu giúp mô hình ổn định khi dữ liệu ít.
- Phân phối hậu nghiệm cho ta biết không chỉ ước lượng mà cả độ bất định.
- Cập nhật liên tục giúp mô hình thích nghi khi có dữ liệu mới.
Tích phân 200 năm tuổi đứng giữa
Vậy điều gì khiến Bayes không thống trị hoàn toàn? Câu trả lời nằm ở một tích phân. Để tính được phân phối hậu nghiệm, về nguyên tắc ta phải tính xác suất biên của dữ liệu — tích phân trên toàn bộ không gian tham số. Với những mô hình đơn giản, việc này có thể giải tích được. Nhưng với mô hình thực tế hàng chục, hàng trăm tham số, tích phân này không thể giải bằng công thức.
Trong hơn 200 năm, đây chính là rào cản khiến suy luận Bayes chỉ tồn tại trên lý thuyết. Chỉ đến cuối thế kỷ 20, với sự phát triển của các phương pháp lấy mẫu Markov Chain Monte Carlo (MCMC) và sức mạnh tính toán của máy tính hiện đại, chúng ta mới có thể xấp xỉ tích phân đó một cách hiệu quả.
Các thư viện như PyMC, Stan hay NumPyro đã biến điều từng bất khả thi thành vài dòng mã. Bạn khai báo mô hình, máy tính lo phần toán học còn lại. Đây là lý do làn sóng Bayes đang trở lại mạnh mẽ trong cộng đồng khoa học dữ liệu.
Ý nghĩa với người làm công nghệ Việt Nam
Với các kỹ sư và nhà phân tích dữ liệu tại Việt Nam, hiểu rõ hai trường phái này không chỉ là chuyện học thuật. Nhiều bài toán thực tế — dự báo nhu cầu, định giá, đánh giá hiệu quả tiếp thị, phát hiện bất thường — đều hưởng lợi từ tư duy Bayes, đặc biệt khi dữ liệu ít hoặc cần kết hợp với hiểu biết chuyên gia.
Tuy nhiên, điều đó không có nghĩa là vứt bỏ công cụ tần suất. Kiểm định giả thuyết cổ điển vẫn đơn giản, nhanh và phù hợp với nhiều tình huống. Điều quan trọng là biết khi nào dùng công cụ nào, và hiểu rằng cả hai đều chỉ là những lăng kính khác nhau để nhìn cùng một thực tại.
Sự thật thú vị là bạn đã là một người theo trường phái Bayes từ trước khi bước chân vào lớp học thống kê đầu tiên. Việc học lại tư duy đó — với sự hỗ trợ của máy tính hiện đại — không phải là tiếp thu điều gì xa lạ, mà là quay về với chính trực giác của mình.


