Tôi đã tạo một avatar số tương tác của chính mình — và bạn có thể trò chuyện với nó
Một nhà báo công nghệ được startup Synthesia tạo cho avatar số tương tác dựa trên chính khuôn mặt và giọng nói của mình, huấn luyện để trả lời các câu hỏi về một bài điều tra. Trải nghiệm này gợi lên nhiều suy nghĩ về tương lai của báo chí, về niềm tin và về việc liệu chúng ta có nên nhân bản chính mình bằng AI.

Khi Alexandru Voica, trưởng bộ phận truyền thông của Synthesia — startup chuyên về tạo video bằng AI — gửi cho tôi đường link dẫn tới thành viên mới nhất trong đội PR của anh ấy vào mùa hè năm nay, tôi khá bất ngờ. Đó là một avatar ảo tương tác mang hình dáng của chính anh, được huấn luyện để trả lời những câu hỏi báo chí thường gặp về Synthesia, chẳng hạn như công ty làm gì và hoạt động ra sao.
Chỉ một ngày trước đó, tôi còn ngồi trong một buổi tọa đàm, nơi các nhân viên PR hỏi tôi có phiền không khi nhận được những lời chào mời viết bằng văn bản do AI tạo ra. Nhưng avatar của Alexandru đã vượt xa điều đó — với tôi, nó giống như "trùm cuối" của việc dùng AI trong ngành PR.
Synthesia và cơn sốt avatar số
Vào tháng 9, Synthesia mời tôi tới văn phòng mới của họ ở New York. Vốn có trụ sở tại Anh, Synthesia là một trong những startup avatar số đang lên nhanh, sánh vai cùng D-ID, HeyGen và Colossyan. Công ty đạt định giá 4 tỷ USD hồi đầu năm nay và cho biết đã vượt 100 triệu USD doanh thu định kỳ hằng năm (ARR) vào năm ngoái.
Synthesia cho phép doanh nghiệp tạo các video đào tạo tương tác bằng avatar AI. Gần đây, họ ra mắt sản phẩm mang tên Roleplay Sessions, cho phép nhân viên luyện tập — ví dụ như thuyết trình bán hàng — với một avatar AI tương tác, có thể phản hồi và chấm điểm câu trả lời của họ.
Khi tôi tới dự buổi khai trương văn phòng mới và họ hỏi tôi có muốn sở hữu một avatar AI của riêng mình không, tôi đồng ý ngay không chút do dự. Tất nhiên là tôi muốn có một bản sao số của chính mình. Hôm đó tôi ăn mặc khá xinh, tóc tai cũng gọn gàng.
Trước khi gặp bản sao số của mình, tôi vốn thờ ơ với avatar, nhưng tôi cảm nhận chúng sẽ không thể tránh khỏi việc trở thành một phần trong đời sống trực tuyến hằng ngày.
Tôi từng nghe nói có người trên Instagram tạo avatar giống mình để hỗ trợ sản xuất nội dung mạng xã hội. Tôi thấy tất cả những điều này rất thú vị, và có lẽ đó là lý do giờ đây tôi không ngần ngại giới thiệu với bạn bản sao số của mình.
Đây là lần đầu tiên Synthesia tạo avatar số cho một nhà báo (và cũng là lần đầu cho bất kỳ ai ngoài Voica). Nó được huấn luyện dựa trên bài viết của tôi về lý do vì sao các startup được quỹ đầu tư mạo hiểm hậu thuẫn lại phạm nhiều gian lận hơn so với các startup không có vốn đầu tư mạo hiểm, và nó chỉ trả lời những câu hỏi liên quan tới bài viết đó.
Cách tôi tạo ra bản sao số của mình
Để làm ra nó, tôi bước vào một studio phim mini nằm trong văn phòng Synthesia, nơi họ chụp cho tôi rất nhiều bức ảnh và ghi âm giọng nói của tôi trong hai phút. Tôi phải đồng ý cho phép tạo những avatar này, và thế là "Dom số" ra đời.
Họ tạo cho tôi một avatar cá nhân (chỉ đọc bất kỳ kịch bản nào tôi đưa vào) — có và không có kính — và hai avatar tương tác (có thể nói chuyện lại và lắng nghe tôi), cũng có và không có kính.
Chúng tôi chọn một bài báo để huấn luyện avatar tương tác, rồi một trong các nhóm của họ xây dựng nó. Avatar tương tác của tôi được vận hành bởi sự kết hợp của các mô hình chuyển giọng nói thành văn bản, video, ngôn ngữ và chuyển văn bản thành giọng nói.
Cụ thể hơn, ngăn xếp công nghệ của avatar tôi bao gồm các mô hình video và giọng nói của chính Synthesia, dù công ty cũng cho phép khách hàng chọn giải pháp thay thế từ các phòng thí nghiệm khác như Cartesia, ElevenLabs, Google hay OpenAI. Doanh nghiệp cũng có thể chọn tự lưu trữ avatar trên đám mây bất kỳ hoặc trả tiền để Synthesia lưu trữ.
- Mô hình chuyển giọng nói thành văn bản biến lời người dùng nói thành chữ.
- Mô hình ngôn ngữ dạng tác tử (agentic) hiểu văn bản và có thể hành động dựa trên đó.
- Mô hình chuyển văn bản thành giọng nói biến phản hồi thành âm thanh.
- Cuối cùng, mô hình video do Synthesia xây dựng sẽ làm cho avatar chuyển động khi nói.
Nhìn chung, Synthesia xây dựng ba loại sản phẩm: một nền tảng tạo và phân phối video với avatar cổ điển, nơi ai đó gõ kịch bản và avatar đọc lại; một nền tảng tác tử tên Sessions cho phép mọi người tương tác với avatar trong các khảo sát hoặc đóng vai; và một nền tảng API để lấy các mô hình video và giọng nói của Synthesia kết hợp với các dịch vụ công nghệ khác nhằm tạo avatar tương tác hoặc những sản phẩm khác.
Trải nghiệm thực tế và phản ứng của người thân
Đội ngũ Synthesia mất vài ngày để tạo xong avatar cho tôi. Đầu tiên tôi thử với avatar cá nhân, gõ một kịch bản khá chung chung để xem giọng AI của mình nghe thế nào. Tôi cho nó nói về việc mùa thu đã về ở New York — mùa yêu thích của tôi trong năm. Giọng khá chính xác, và tôi mừng vì nó không bắt được chút khàn giọng mà tôi có khi thu âm mẫu.
Tôi cho vài người bạn không làm công nghệ xem, họ thấy vừa thú vị vừa rợn người.
Rồi tôi cho họ xem avatar tương tác. Nó mang tính xác định (deterministic), nghĩa là chỉ nói những gì nó được huấn luyện để phản hồi — trong trường hợp này là bài viết về gian lận đầu tư mạo hiểm. Tôi hỏi nó những câu như tôi từng ở đâu trước khi vào TechCrunch hay tôi sống ở khu nào của New York, nhưng lần nào nó cũng hướng tôi trở lại bài báo.
Bạn bè tôi không nghĩ giọng nói giống tôi lắm và cho rằng hình dáng không đẹp bằng avatar cá nhân, nhưng dù sao nó cũng đủ giống để gây cảm giác hơi rợn người.
Mẹ tôi gọi nó là "tuyệt vời" — một lời khen khá cao từ bà. Bà và bố tôi cứ thử hỏi nó những câu "chỉ họ mới biết" về tôi, nhưng mô hình không trả lời, lần nào cũng đưa họ trở lại bài viết về gian lận đầu tư mạo hiểm.
"Mẹ không nhớ là mình đã sinh ra hai đứa con," bà đùa sau khi thử mô hình.
Tương lai của báo chí và nỗi lo về bản sao số
Trải nghiệm này khiến tôi suy nghĩ về tương lai của nghề báo. Liệu mọi người có chấp nhận mở bản tin lên và thấy nó được dẫn bởi một avatar? Một nhà đầu tư nói ngay với tôi rằng không. Đúng là hiện nay có rất nhiều phản đối với "rác AI" đã tràn vào mạng xã hội và các nền tảng chia sẻ tin tức.
Nhưng những người khác tôi hỏi lại không chắc chắn như vậy. Liệu avatar có thể bổ trợ — hoặc thậm chí thay thế — nhà báo? Liệu các CEO có muốn trò chuyện với avatar AI của một nhà báo thay vì con người thật?
Điều tôi thích ở nghề của mình là được kết nối với con người, viết bài và nghiên cứu những chủ đề mới. Nhưng phần lớn nhất của nghề báo là niềm tin. Điều đó dường như không thể nào bị thuê ngoài cho AI.
Ngoài lĩnh vực báo chí, tôi tin rằng ý tưởng nhân bản chính mình có thể hấp dẫn. Không còn phải dồn công việc sau kỳ nghỉ hay kỳ nghỉ lễ, vì một phiên bản của bạn luôn túc trực để trả lời câu hỏi.
Chúng ta sẽ phải chờ xem việc dùng avatar phát triển ra sao trong giới doanh nghiệp Mỹ. Nhưng giờ khi đã có bản sao của riêng mình, tôi thấy trong lòng có nhiều cảm xúc lẫn lộn. Sau khi qua đi cảm giác mới lạ ban đầu, tôi quan sát kỹ avatar của mình sau khi nó ngừng nói và chờ đợi — chờ điều gì thì tôi không rõ. Có lẽ tôi chờ nó chớp mắt. Hoặc nói điều gì mới, hoặc mỉm cười, hoặc chỉ để cho tôi biết rằng nó ý thức được.
Vì các bản sao số của tôi mang tính xác định, chúng sẽ không bao giờ làm vậy. Nhưng tôi có thể hình dung việc ai đó dễ dàng rơi vào chút "loạn thần AI" với một bản sao không xác định — tức là được vận hành bởi chatbot tự do diễn giải.
Tôi nói với một nhà đầu tư rằng, dù tương lai của bản sao số ra sao, tôi dự đoán thế hệ của tôi — Gen Z — có lẽ sẽ không quen với chúng. Chúng mang hơi hướng khoa học viễn tưởng: mọi thứ ta từng thấy trong phim giờ đều hiện diện. Nhưng tôi phải nói rằng, tôi thấy avatar số bớt gây sốc hơn người máy hình người. Ít nhất với một avatar, nếu mọi thứ trở nên kỳ quặc, tôi luôn có thể đăng xuất.
Và cho tới lúc đó, đây là avatar cá nhân của tôi, điểm qua cho bạn những tin tức nổi bật nhất trên trang của chúng tôi trong tuần này!
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026
Công nghệ
Rác AI đã xâm nhập vào tập dữ liệu huấn luyện của bạn: Ba cách phát hiện tôi đã thử nghiệm
26 tháng 9, 2026