Khi AI học từ chúng ta rồi quay lại dạy chúng ta cách viết

Công nghệ30 tháng 9, 2026·10 phút đọc

Một bài luận cá nhân đáng suy ngẫm về vòng lặp ảnh hưởng qua lại giữa con người và AI trong ngôn ngữ: chúng ta dạy mô hình cách viết, rồi mô hình dạy ngược lại chúng ta, khiến những từ ngữ và cấu trúc câu tưởng chừng rất người bỗng bị coi là dấu hiệu của máy móc. Tác giả Murphy Trueman chia sẻ nỗi trăn trở khi chính phong cách viết học từ mẹ mình bị các công cụ phát hiện AI gắn nhãn đáng ngờ.

Khi AI học từ chúng ta rồi quay lại dạy chúng ta cách viết

Khi AI học từ chúng ta rồi quay lại dạy chúng ta cách viết

Có một vòng lặp kỳ lạ đang diễn ra trong ngôn ngữ mà ít ai để ý: con người dạy mô hình AI cách viết, rồi chính mô hình ấy quay lại định hình cách con người viết. Kết quả là những từ ngữ, cấu trúc câu từng được xem là dấu hiệu của người viết cẩn thận nay lại bị gắn nhãn "do AI tạo ra". Bài luận cá nhân của Murphy Trueman đặt ra câu hỏi nhức nhối: khi máy móc học từ chúng ta, liệu chúng ta còn nhận ra chính mình trong những gì mình viết?

Minh họa về vòng lặp giữa con người và AI trong ngôn ngữMinh họa về vòng lặp giữa con người và AI trong ngôn ngữ

Những từ ngữ vốn là của chúng ta trước

Tác giả kể lại thói quen đọc to bản thảo trước khi xuất bản để tìm nhịp điệu câu chữ. Nhưng gần đây, việc đọc lại đã biến thành một cuộc "săn lùng": gạch bỏ dấu gạch ngang dài (em dash), thay bằng dấu phẩy hay dấu chấm, và loại bỏ những từ như "genuinely", "honest", "quiet", "silent", hay "worth". Tất cả những từ ấy được lưu trong một tệp trên máy tính mà cô đặt tên là "Nghĩa địa văn chương" (Literary Graveyard).

Điều khiến cô bực bội nhất là những từ ngữ ấy vốn thuộc về cô từ đầu. Giống như nhiều người khác, cô đã viết theo cách đó suốt nhiều năm trước khi bất kỳ mô hình nào ra đời. Máy móc học những từ, cấu trúc và khuôn mẫu ấy từ chính những người như cô, rồi lặp lại chúng cho đến khi chúng không còn cảm giác là của mình nữa.

Tôi thấy vòng lặp này trong ngôn ngữ, chỉ khác là chẳng còn gì để đối chiếu. Tôi không thể biết ảnh hưởng đang chạy theo hướng nào nữa.

AI không tự nghĩ ra từ vựng

Khi mới tìm hiểu về AI, tác giả tưởng các mô hình tự phát minh ra từ ngữ của riêng chúng. Sự thật không phải vậy. Các nhà nghiên cứu tại Đại học Bang Florida từng tìm hiểu lý do vì sao ChatGPT dùng từ "delve" (đào sâu) thường xuyên đến vậy. Thủ phạm hóa ra nằm ở giai đoạn phản hồi, nơi con người chấm điểm câu trả lời của mô hình để dạy nó thế nào là "tốt".

Điều trớ trêu là khi được kiểm tra, người đọc lại đánh giá từ "delve" thấp hơn mọi từ thông dụng khác. Vậy đây không phải mô hình sao chép một từ mà mọi người yêu thích. Một nhóm người đánh giá cụ thể, tại một thời điểm huấn luyện nhất định, đã đẩy mô hình về phía "delve", và mô hình học được bài học đó. Những từ mà chúng ta giờ đây nhăn mặt khi thấy đều khởi nguồn từ chúng ta trước tiên.

Rồi nó quay trở lại. Các nhà nghiên cứu tại Viện Max Planck đã nghe hơn 737.000 giờ podcast không kịch bản và gắn được sự gia tăng của những từ như "delve" trực tiếp với thời điểm ChatGPT ra mắt. Nếu bạn dành đủ thời gian trò chuyện với một mô hình, từ ngữ của nó sẽ bắt đầu xuất hiện trong vốn từ của chính bạn.

Ảnh hưởng đã đảo chiều. Chúng ta dạy mô hình, rồi mô hình dạy lại chúng ta.

Và rồi nó lại đảo chiều thêm lần nữa. Một khi "delve" trở thành trò cười, người ta dùng nó ít hơn cả trước khi ChatGPT tồn tại. Thực tế, nó bị dùng ít đến mức các mô hình mới hơn được tinh chỉnh để ngừng dùng từ này hoàn toàn. Chúng ta bắt đầu tự biên tập để không nghe như máy, trong khi máy cũng được biên tập để không nghe như chính nó.

Sự sụp đổ của mô hình và nỗi lo mất đi cá tính

Có một cái tên cho điểm kết thúc của quá trình này: model collapse (sụp đổ mô hình). Năm 2024, tạp chí Nature công bố một bài báo về điều gì xảy ra khi các mô hình huấn luyện trên đầu ra của những mô hình khác. Những chi tiết hiếm hoi, đặc thù là thứ biến mất đầu tiên. Qua từng vòng lặp, cái khác thường bị san phẳng, và đến vòng thứ chín thì sợi chỉ ấy đứt hẳn.

Với người làm trong lĩnh vực thiết kế hệ thống, hiện tượng này quen thuộc dưới tên gọi drift (trôi dạt) — khi một hệ thống dần mất đi ý nghĩa vì mỗi nhóm cứ bẻ cong nó thành phiên bản riêng cho đến khi không còn chuẩn chung nào nữa. Nhưng điều tác giả mô tả chạy theo hướng ngược lại — thay vì phân tán, mọi thứ co cụm về giữa. Cái hiếm và cái đặc thù bị mài mòn, chỉ còn lại phiên bản tầm thường nhất.

Mỗi từ được chuyển vào "Nghĩa địa văn chương" là một lần tác giả tự tay làm phẳng chính văn phong của mình — giống như vòng lặp huấn luyện áp dụng ở quy mô lớn, chỉ chậm hơn và từng quyết định một.

Cấu trúc câu ấy vốn là của mẹ tôi

Tác giả cảm nhận rõ nhất điều này khi đọc các bài viết, bản tin, bình luận trên LinkedIn hay tài liệu kỹ thuật. Một năm trước, cô thường có thể phân biệt được điều gì đó đến từ trải nghiệm sống thật. Nhưng gần đây, ranh giới ấy đã mờ đi. Cô dò tìm những "dấu hiệu nhận biết" mà mình đã luyện tập để tránh trước khi có thể tiếp nhận bất cứ điều gì, và điều này khiến việc viết trở nên nặng nề như việc đọc.

Cấu trúc câu ấy đến từ mẹ cô. Bà học về viết lách và xây dựng sự nghiệp trong lĩnh vực quản lý thay đổi, viết tài liệu kỹ thuật và học trực tuyến — biến những điều phức tạp thành từng phần mà người ta có thể nắm bắt. Từ nhỏ, bà đã khuyến khích cô đọc và viết càng nhiều càng tốt. Rất nhiều cách tác giả xây dựng một câu đều đến từ mẹ cô.

Những từ ngữ tôi chôn vào Nghĩa địa văn chương bị đọc như do máy viết, bởi vì những người viết như bà đã viết theo cách đó trước tiên.

Theo một nghĩa nào đó, cô đang gạch bỏ mẹ ra khỏi chính câu chữ của mình để chúng không nghe giống thứ mà cô học được từ bà. Thật khó chịu khi nghĩ rằng một trong những điều bà trao cho cô, và cô trân quý nhất, giờ lại là thứ dễ bị nhầm là của máy móc nhất. Khi cô gọi điện cho mẹ trong lúc hoang mang, mẹ cô nhanh chóng nói cô đừng bao giờ thu nhỏ bản thân hay thay đổi cách viết để làm hài lòng người khác.

Các công cụ phát hiện AI thực sự hoạt động thế nào

Tác giả thử tìm hiểu cách các công cụ phát hiện AI vận hành, phần nào hy vọng mình sẽ thấy lo lắng là vô lý và có thể ngừng phân tích quá mức. Nhưng cô không thấy vậy. Về cơ bản, chúng dựa trên hai yếu tố: liệu từ ngữ bạn dùng có phải là những từ một mô hình sẽ chọn không, và liệu câu của bạn có độ dài tương đồng không. Nếu bạn viết gọn gàng, đều đặn và dễ theo dõi, bạn nằm thoải mái trong dải mà các mô hình này gắn cờ.

Đó chính là cách cô được dạy để viết. Những thói quen mẹ cô dành nhiều năm khắc sâu giờ lại là những thói quen mà một người xa lạ đọc thành của máy. Các nhà nghiên cứu thực hiện nghiên cứu về podcast cũng cảnh báo rằng những từ bị gắn cờ của họ đang bắt đầu được đọc như dấu hiệu của kỹ năng thấp hoặc việc lười biếng dùng AI.

Điều này gây bức xúc nhất — những người học viết, những người xây dựng vốn từ, giờ phải nhìn nó bị đọc ngược thành của máy.

Minh họa về việc con người và AI cùng định hình ngôn ngữMinh họa về việc con người và AI cùng định hình ngôn ngữ

Kỹ năng bị hấp thụ và câu hỏi về bản sắc

Tác giả xây dựng phần lớn cảm nhận về bản thân quanh công việc này. Mười sáu năm là khoảng thời gian dài để trở nên giỏi một điều gì đó. Những kỹ năng cô dành nhiều công sức nhất là những kỹ năng chậm rãi — như đọc song song một tệp Figma và một codebase để thấy chúng trôi dạt ở đâu, hay viết tài liệu mà một lập trình viên mệt mỏi lúc bốn giờ chiều vẫn theo được.

Những kỹ năng ấy giờ đang bị các công cụ hấp thụ. Và cô đang chật vật tìm hiểu xem còn lại gì của mình khi công việc ấy ít được coi trọng hơn.

Viết lách luôn là một hoạt động cô đơn với cô, và dùng mô hình để suy nghĩ thành lời, hay kiểm tra xem một ý tưởng có thực chất không, đã khiến nó bớt cô đơn. Nhưng nói ra điều đó cảm giác mạo hiểm, bởi ngay khi một mô hình đến gần tác phẩm của bạn, người ta nhanh chóng gắn nhãn nó là "slop" (rác nội dung).

Tác giả cho rằng slop không liên quan nhiều đến mô hình. Nó phụ thuộc vào công sức bỏ ra. Nếu ai đó không buồn tạo bản nháp, hay đọc lại chính câu chữ của mình, tại sao người khác phải chịu trách nhiệm tìm hiểu ý họ là gì? Đọc nội dung của ai đó là một hình thức tin tưởng: tôi dành sự chú ý cho bạn vì bạn đã dành tâm sức cho tác phẩm.

Ai đó có thể dành hàng giờ, hàng ngày, hàng tuần để nhào nặn một bài viết và dựa vào mô hình để tìm hình hài cho nó. Bài viết ấy vẫn còn nhịp đập. Nhưng một người khác có thể ra lệnh cho mô hình "viết một bài đầy đủ về chủ đề X", đăng nguyên những gì nhận về mà không đọc, và bạn cảm nhận được sự rỗng tuếch.

Cái giá phải trả của những người đi trước

Điều tệ hơn là các công cụ phát hiện thường không phân biệt được hai phiên bản này. Phiên bản được chăm chút kỹ lưỡng, với người viết mải mê cân nhắc từ ngữ, cấu trúc câu và giọng điệu, lại bị đọc giống như cái vỏ rỗng ai đó tạo ra chỉ bằng một câu lệnh.

Các mô hình này học cách trở nên hữu ích từ những người đã làm việc theo cách chậm rãi ngay từ đầu, và đã hào phóng chia sẻ những gì họ học được. Làm sao có thể chấp nhận được rằng chính những người ấy — những người bỏ thời gian và học theo cách khó nhọc — lại là những người bị buộc phải bảo vệ tác phẩm của mình?

Chúng ta đã thấy hệ quả. Vào tháng 1, Tailwind Labs sa thải ba trong bốn kỹ sư của mình, và nhà sáng lập Adam Wathan cho biết lượng truy cập vào tài liệu của họ đã giảm khoảng 40% kể từ đầu năm 2023, dù framework ngày càng phổ biến hơn bao giờ hết. Lập trình viên đã ngừng ghé thăm tài liệu vì công cụ của họ đã biết sẵn. Những người mà công việc của họ dạy nên các mô hình chính là những người đang phải trả giá.

Tác giả không có giải pháp cho bất kỳ điều nào trong số này, và chắc chắn không có giải pháp cho cuộc khủng hoảng bản sắc của chính mình. Cô đặt tên bài viết là "Tôi không còn biết ai đang dạy ai nữa", và cô nói điều đó về thế giới ngoài kia. Nhưng phiên bản khiến cô thức trắng đêm lại gần gũi hơn một chút: liệu cô còn có thể tìm thấy chính mình trong những gì mình viết hay không.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗