Viết như năm 1866: LLM học lại cách viết điện báo để tiết kiệm token

Công nghệ07 tháng 10, 2026·10 phút đọc

Một thử nghiệm mang tên Telegraph Test cho thấy các mô hình ngôn ngữ lớn có thể viết theo phong cách điện báo (cablese) để giảm 25-49% token đầu ra mà vẫn giữ nguyên độ chính xác khi máy khác đọc lại. Kỹ thuật này tận dụng đặc tính vốn đã tồn tại trong trọng số mô hình, không cần huấn luyện lại, không cần thay đổi API — chỉ cần một câu lệnh.

Viết như năm 1866: LLM học lại cách viết điện báo để tiết kiệm token

Viết như năm 1866: LLM học lại cách viết điện báo để tiết kiệm token

Năm 1866, mỗi từ gửi qua cáp điện báo xuyên Đại Tây Dương tốn 10 đô la — tương đương khoảng 2.600 đô la ngày nay. Các công ty điện báo tính tiền theo từng từ, và cả một ngành công nghiệp viết tắt ra đời từ cấu trúc giá đó.

Gần 160 năm sau, lịch sử đang lặp lại — nhưng lần này người trả tiền là các đội ngũ phát triển ứng dụng AI. API của mô hình ngôn ngữ lớn cũng tính tiền theo token, và token chính là "từ" của thời đại số. Một thử nghiệm mang tên Telegraph Test đang chứng minh rằng các mô hình ngôn ngữ hiện đại có thể viết theo phong cách điện báo cổ điển để cắt giảm gần một nửa hóa đơn đầu ra, mà không làm giảm độ chính xác khi máy khác đọc lại.

So sánh cách viết điện báo năm 1866 và năm 2026So sánh cách viết điện báo năm 1866 và năm 2026

Hai chiến lược nén từ thời điện báo

Khi mỗi từ đều bị tính tiền, giới kinh doanh thế kỷ 19 phát triển hai cách tiếp cận khác nhau để nén thông tin:

Sổ mã (Codebook): Các nhà xuất bản bán những từ điển mã thương mại khổng lồ. Cuốn Bentley's ABC Telegraphic Code dài tới cả nghìn trang, ánh xạ toàn bộ cụm từ kinh doanh thành một từ mã duy nhất. Ví dụ:

OTTER — có thể có nghĩa là tàu hơi nước đã đến, hàng hóa nguyên vẹn, xin chuyển số dư.

Một cuộc đàm phán 40 từ có thể rút gọn thành trao đổi 6 từ mã. Đây là công nghệ thay thế: thông điệp vẫn tồn tại nguyên vẹn dưới dạng văn xuôi, chỉ là từ điển đổi tên các khối của nó.

Cablese (văn phong điện báo): Các nhân viên điện báo và phóng viên tự phát triển một định dạng viết riêng, ví dụ:

ARRIVE TUESDAY BRING FUNDS STOP CONFIRM WIFE SAILS FRIDAY.

Phong cách kỷ luật này tiết kiệm từ mà không mất nghĩa, và nó ra đời một cách tự nhiên từ chi phí của phương tiện truyền thông. Theo thời gian, khi điện thoại, fax và email khiến chi phí mỗi từ sụp đổ, định dạng này cũng phai nhạt — nhưng vẫn sống sót ở đâu đó, chẳng hạn văn hóa viết tắt của SMS 160 ký tự, rồi đến Twitter thời kỳ đầu.

Đại Tây Dương tuyến cáp đầu tiên được tàu Great Eastern thả xuốngĐại Tây Dương tuyến cáp đầu tiên được tàu Great Eastern thả xuống

Token là từ bị tính tiền một lần nữa

Hóa đơn API của mô hình ngôn ngữ lớn chính là hóa đơn điện báo thời hiện đại — bạn trả tiền theo từng token. Nhóm nghiên cứu đã chạy thử cả hai chiến lược cổ điển trên các mô hình hiện đại:

  • Sổ mã: Lấy văn bản có sẵn, thay thế bằng từ mã từ một từ điển cố định. Kết quả chỉ tiết kiệm khoảng 10%. Phần lớn văn xuôi không có hình dạng từ điển, và phép thay thế không thể xóa đi những từ mà tác giả đã viết — nó chỉ có thể đổi tên chúng.
  • Cablese: Yêu cầu mô hình "Viết một bản ghi hoàn chỉnh theo phong cách điện báo; bỏ mạo từ và từ đệm; viết tắt; giữ nguyên từng sự kiện, con số và danh từ riêng — viết thường, không viết hoa toàn bộ."

Vì sao kỹ thuật này hoạt động trên nhiều mô hình?

Câu trả lời nằm ở chính trọng số của mô hình. Văn phong điện báo, sổ mã, cùng họ hàng của cablese trong gia đình "phong cách telegram" rộng lớn hơn (tiêu đề báo, văn phong teletype, ghi chú, viết tắt SMS) đều nằm trong kho dữ liệu "toàn bộ tri thức nhân loại" mà hầu hết mô hình chia sẻ.

Hai quan sát củng cố giả thuyết này:

  • Các mô hình tạo ra cablese trôi chảy, đúng chuẩn chỉ từ một câu lệnh duy nhất — không ví dụ, không sổ mã.
  • Các mô hình độc giả trong ma trận đa họ chưa từng thấy câu lệnh đó: chúng được đưa các bản ghi nén một cách "lạnh" và đọc với độ chính xác tương đương, trên bốn họ mô hình khác nhau.

Khả năng trôi chảy zero-shot được chia sẻ như vậy rất khó giải thích, trừ khi quy ước này đã tiềm ẩn trong văn bản chung của nhân loại.

Các con số từ thử nghiệm

Nhóm nghiên cứu đã xây dựng một benchmark gồm 50 đoạn văn và khoảng 1.300 câu hỏi, so sánh độ chính xác khi mô hình trả lời từ nhiều phiên bản thông tin khác nhau:

Điều kiệnMô hình nhận đượcĐộ chính xác neoSo với đối chứng
Đoạn văn, trả lời plaintextToàn bộ đoạn văn91,5%1,00 (tham chiếu)
Đoạn văn, trả lời cableseToàn bộ đoạn, văn phong ngắn gọn74,4%0,81
+ Chuyển ngược về plaintextCâu trả lời ngắn gọn được mở rộng78,8%0,86
Bản ghi plaintextTóm tắt plaintext75,8%1,00 (tham chiếu)
Bản ghi cableseTóm tắt nén82,5%1,09
Bản ghi đã giải mãBản ghi cablese, mở rộng lại81,6%1,08

Kết quả then chốt: Các mô hình hạ nguồn — bao gồm bốn họ chưa từng được xem ví dụ — trả lời câu hỏi từ bản ghi nén tốt ngang hoặc tốt hơn so với từ plaintext, với tỷ lệ phục hồi từ 0,99 đến 1,10.

Mã ABC của Bentley — công nghệ nén thông tin thời điện báoMã ABC của Bentley — công nghệ nén thông tin thời điện báo

Khi nào nén là miễn phí?

Điều này phụ thuộc vào vị trí của bước nén:

  • Nén trong lúc mô hình đang soạn nội dung (trả lời bằng cablese, điểm 0,81, có thể phục hồi một phần lên 0,86) — bạn phải trả một "thuế văn phong".
  • Nén sau khi nội dung đã hoàn tất, thành một bản ghi mà máy sẽ đọc (1,08 đến 1,09) — không có gì phải trả.

Cablese thuộc về khoảng giữa "nội dung đã chốt" và "máy tiêu thụ": bộ nhớ tạm, kho lưu trữ ký ức, bàn giao giữa các agent. Nó không thuộc nơi mô hình vẫn đang suy nghĩ dở dang.

Một cảnh báo quan trọng về mô hình có suy luận bắt buộc

Các mô hình cho phép tắt suy luận sẽ tính chi phí nén sạch sẽ. Nhưng gpt-5-mini có suy luận bắt buộc (API từ chối tắt), và cablese khiến nó suy nghĩ gần gấp 3 lần — chi phí đầu ra tăng gấp đôi dù văn bản ngắn hơn. Tỷ lệ phục hồi của nó là 0,99, cao nhất trong nhóm nhưng vẫn không tiết kiệm token.

Bài học: Bạn phải nén bằng những mô hình mà bạn có thể kiểm soát quá trình suy nghĩ của chúng.

Điều này có nghĩa gì với chi phí vận hành?

Một số kết luận rút ra:

  • Một nửa chi phí đắt đỏ của mọi hóa đơn LLM là chi phí tùy chọn cho văn bản mà máy tiêu thụ. Token đầu ra đắt gấp 3-5 lần token đầu vào, và với lưu lượng mô hình viết cho mô hình khác, một nửa có thể cắt được ở bất kỳ API lớn nào — chỉ với một câu lệnh, không huấn luyện, không thiết lập.
  • Bộ nhớ agent trở nên rộng gấp đôi. Lưu bộ nhớ tạm và tóm tắt dưới dạng cablese: các mô hình — độc giả dự kiến — đọc chúng ngang hoặc tốt hơn plaintext, ở mọi họ được thử nghiệm.
  • Lựa chọn mô hình quan trọng ngang câu lệnh. Cùng một câu lệnh nén bản ghi của gemma khoảng 40% và của Qwen khoảng 49%, tính trên đồng hồ đo riêng của từng nhà cung cấp — khả năng nén là một thuộc tính đo được, theo từng mô hình, và ở quy mô lớn khoảng chênh đó là tiền thật.
  • Tính kiểm toán vẫn sống sót. Khác với các giao thức agent tự phát, cablese con người đọc được, được cố định bởi quy ước, và có thể giải mã theo yêu cầu — token co lại mà không mất dấu vết kiểm toán.

Biểu đồ biên giới giữa nén và khả năng kiểm toánBiểu đồ biên giới giữa nén và khả năng kiểm toán

So sánh với các giao thức nén tự phát

Đã có nhiều nghiên cứu cho thấy LLM tự tạo ra các giao thức nén mạnh hơn — ví dụ BabelTele (arXiv, tháng 6/2026) đạt 99,5% độ trung thực ngữ nghĩa ở 27,9% độ dài gốc, hay các framework bỏ qua văn bản hoàn toàn để truyền vector nhúng thô giữa các agent. Vậy tại sao vẫn cần cablese nếu nó chỉ nén được khoảng 2 lần thay vì 6 lần?

Vì các giao thức tự phát có chung một đặc điểm: dày đặc, hiệu quả, di động giữa các mô hình — nhưng không ổn định (chúng trôi dạt khi đàm phán tiếp diễn) và không thể đọc được với con người.

Cablese thì ngược lại: là một chuẩn đã biết, mang tính xác định cao hơn, tổng quát hóa được, không cần thiết lập hay đàm phán ban đầu, và đọc được — do đó kiểm toán được. Hai kỹ thuật nằm ở hai điểm khác nhau trên cùng một biên giới nén/kiểm toán, và khối lượng công việc của bạn sẽ quyết định chọn điểm nào.

Cách thử nghiệm được đo lường

Một mô hình được cấp một đoạn văn cùng bộ câu hỏi cố định với đáp án ngắn, có thể kiểm tra — một ngày tháng, một cái tên, một con số. Nó trả lời từ một phiên bản thông tin duy nhất. Câu trả lời đúng khi trùng khớp với đáp án kỳ vọng theo quy tắc chuỗi cố định — không có giám khảo, không có tùy biến. Mọi điểm số sau đó được chia cho điểm của đối chứng plaintext của chính nó, nên 1,00 luôn có nghĩa là "tốt ngang tiếng Anh thuần".

Các so sánh là theo cặp, cùng câu hỏi trả lời trong cả hai điều kiện, và được kiểm định bằng McNemar. Nói đơn giản: bỏ qua những câu cả hai điều kiện đều đúng hoặc đều sai, chỉ nhìn vào những "lượt trao đổi" — câu mà đúng một điều kiện làm đúng.

Thử nghiệm trả lời ba câu hỏi về bất kỳ mô hình nào, với cùng ngân hàng đoạn văn đóng băng, cùng câu hỏi neo và cùng bộ chấm điểm xác định:

  1. Nó viết gọn đến mức nào? Với cùng câu lệnh cablese, bản ghi của nó ngắn hơn bao nhiêu so với bản plaintext?
  2. Người khác có đọc được không? Khi một họ mô hình khác trả lời câu hỏi bằng bản ghi nén đó, độ chính xác có giữ được không?
  3. Mỗi lần dùng tốn bao nhiêu? Đọc lại cho máy, chép lại cho người — đo riêng, vì chúng hành xử khác nhau.

Kết luận

Không cần phần cứng mới, không huấn luyện, không thay đổi API — chỉ một câu lệnh. Hoặc các agent của bạn có gần gấp đôi ngữ cảnh ở đầu nén, hoặc cùng khối lượng công việc với một nửa hóa đơn đầu ra.

Đây là một tối ưu hóa lớn đã được kiểm chứng, và theo tác giả, đơn giản là chưa ai đang làm. Không ai có thể biết những con số này mà không chạy thử nghiệm — một bản phát hành mô hình không đi kèm dòng thông số "viết cablese gọn" — và các mô hình được phát hành hàng tháng. Đó chính là mục đích của benchmark: một buổi chiều tính toán cho mỗi mô hình mới, và thuộc tính này trở thành một con số trên bảng thay vì một câu chuyện truyền miệng.

Toàn bộ thử nghiệm có thể tái tạo tại: github.com/Travis42/telegraph-test

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗