Dạy AI chơi piano jazz theo phong cách từng nghệ sĩ bằng cross-attention
Lấy cảm hứng từ cuốn sách étude của Dick Hyman năm 1994, một nhóm nghiên cứu đã tinh chỉnh mô hình transformer Aria trên MIDI piano để sinh nhạc theo phong cách của 12 nghệ sĩ jazz. Nhờ lớp cross-attention có cổng điều khiển, bản nhạc sinh ra được phân loại đúng nghệ sĩ mục tiêu tới 70% thời gian, so với 37% khi không có điều kiện hóa.

Dạy AI chơi piano jazz theo phong cách của từng nghệ sĩ bằng cross-attention
Năm 1994, nghệ sĩ piano Dick Hyman xuất bản cuốn In the Styles of… The Great Jazz Pianists, gồm mười lăm étude nguyên tác, mỗi bài viết theo lối chơi của một bậc thầy — từ Scott Joplin đến Bill Evans. Thay vì chép lại các đoạn solo, Hyman sáng tác nhạc mới mang dấu ấn riêng của từng người: những "chuỗi nốt chạy nhanh cả hai tay" của Art Tatum, kiểu "gảy đàn như guitar ở tay trái" của Erroll Garner, hay những "tremolo và glissando" của Oscar Peterson.
Câu hỏi đặt ra cho dự án này rất đơn giản: liệu một mô hình học máy có thể làm được điều Hyman đã làm — không chỉ nhận diện ai đang chơi, mà còn chơi theo đúng lối của người đó?
Minh họa dự án học phong cách nghệ sĩ piano jazz
Từ nhận diện đến tái tạo phong cách
Nhóm nghiên cứu tinh chỉnh Aria, một transformer được tiền huấn luyện trên lượng lớn MIDI piano, bằng các bản biểu diễn solo của 12 nghệ sĩ jazz trong bộ dữ liệu PiJAMA. Họ thêm vào mô hình một lớp cross-attention có cổng điều khiển (gated cross-attention), lớp này đọc một embedding đã học cho từng nghệ sĩ — cụ thể là bốn vector cho mỗi người.
Điểm đáng chú ý: lớp cross-attention được chèn vào tám lớp cuối của transformer, và mỗi bước sinh nhạc đều tham chiếu tới embedding đó. Nhờ vậy, phong cách không bị phai nhạt dần trong quá trình sinh — điều thường xảy ra với cách tiếp cận dùng "tiền tố gợi ý" (prompt prefix) thông thường. Một cổng học được, khởi tạo ở giá trị 0,1, sẽ điều chỉnh mức độ ảnh hưởng của lớp này, giúp quá trình tinh chỉnh bắt đầu từ hành vi gốc của Aria rồi dần học cách "lắng nghe" nghệ sĩ.
Phép thử: máy phân loại có nhận ra ai đang chơi?
Để kiểm tra phong cách có thực sự truyền tải hay không, nhóm nghiên cứu dùng một bộ phân loại nghệ sĩ piano chạy trượt dọc theo bản nhạc được sinh ra. Kết quả:
- Khi có điều kiện hóa, 70% bản nhạc sinh tiếp được gán đúng cho nghệ sĩ mục tiêu
- Khi không có điều kiện hóa, con số này chỉ còn 37%
- Một bộ phân loại thứ hai, chỉ được huấn luyện trên nhạc do máy sinh, có thể nhận diện bản thu âm thật với độ chính xác 95%
Một phát hiện thú vị: perplexity — thước đo tiêu chuẩn cho mô hình sinh — gần như không phân biệt được hai mô hình đã tinh chỉnh. Lý do là khi đã có các nốt nhạc thật đứng trước, nốt tiếp theo khá dễ đoán bất kể ai đang chơi. Phong cách chỉ thể hiện rõ khi mô hình tự do sinh nhạc và phải giữ đúng "tính cách" trên chính đầu ra của mình.
Perplexity gần như không phân tách được hai mô hình đã tinh chỉnh; trong khi mức độ đồng thuận của bộ phân loại gần như tăng gấp đôi. Xác suất ngẫu nhiên chỉ là 8%.
Mười hai nghệ sĩ, mức độ thành công rất khác nhau
Nhóm chọn 12 nghệ sĩ trong số 30 người của PiJAMA dựa trên tính tách biệt — tức là những người mà một mô hình tiền huấn luyện đã dễ dàng phân biệt nhất. Nhưng ngay trong nhóm này, khả năng bắt chước cũng chênh lệch rõ rệt:
- Hank Jones và Dick Hyman: bản nhạc sinh tiếp được gán đúng tới 96%
- Cedar Walton: chỉ đạt 29%
Một chi tiết đáng chú ý về mật độ nốt nhạc: mọi bản sinh đều tạo ra cùng số lượng nốt, nhưng Garner nén chúng vào 1 phút 26 giây, còn Walton trải dài tới 2 phút 45 giây. Chính sự khác biệt về mật độ này cũng là một phần dấu ấn của mỗi nghệ sĩ.
Giới hạn cần lưu ý
Toàn bộ dự án chỉ dùng MIDI, được kết xuất trong trình duyệt trên một cây đàn piano lấy mẫu. Mô hình được huấn luyện trên các bản chép tự động từ thu âm thương mại, nên sắc thái và việc dùng pedal chỉ mang tính xấp xỉ, và âm thanh nghe "phẳng" hơn so với đĩa nhạc thật.
Đáng chú ý, các bản nhạc được chấm điểm là kết quả chọn lọc, không phải bản sao. Chúng được chọn từ kho nhạc do máy sinh — với mỗi nghệ sĩ, nhóm chọn hai bản điểm cao nhất trong tám ứng viên. Bài báo cũng kiểm tra rằng các bản sinh tiếp không sao chép bản thu âm huấn luyện: chúng ít giống bản biểu diễn gần nhất trong tập huấn luyện hơn so với các bản thu thật chưa từng thấy.
Cuối cùng, điểm số đến từ bộ phân loại, không phải người nghe. Đây là bộ phân loại mạnh (đạt 98,8% trên các bài hát chưa từng thấy), nhưng nó cũng có "thói quen" riêng: nhiều lỗi của nó trên nhạc sinh ra lại rơi vào Dick Hyman — có lẽ cũng hợp lý, với một nghệ sĩ đã dành cả sự nghiệp chơi theo phong cách của người khác. Một nghiên cứu thính giác với người nghe thật là bước tiếp theo tự nhiên.


