AI

Giọng nói cũng là yếu tố nhận diện: Nhật đưa ra phán quyết đầu tiên về nhân bản giọng nói bằng AI

Bùi Đăng Minh•Thứ ba, 6/10/2026•6 phút đọc
Giọng nói cũng là yếu tố nhận diện: Nhật đưa ra phán quyết đầu tiên về nhân bản giọng nói bằng AI

Từ tháng 7/2024 đến tháng 9/2025, một tài khoản TikTok ẩn danh ở Nhật, có khoảng 210.000 người theo dõi, đã đăng ít nhất 188 video về truyền thuyết đô thị và những câu chuyện kỳ bí. Mỗi video của tài khoản này đạt trung bình khoảng 1,47 triệu lượt xem, mang về 500.000 đến 750.000 yên mỗi tháng. Điểm chung của tất cả là giọng đọc: trầm, khàn, rất giống Kenjiro Tsuda, diễn viên lồng tiếng quen thuộc với anh em fan anime qua vai Kento Nanami trong Jujutsu Kaisen và Seto Kaiba trong Yu-Gi-Oh!. Chỉ là Tsuda chưa bao giờ đọc những video đó, giọng nói đó được tạo bằng AI.

[​IMG]
[​IMG]

Ngày 30/9/2026 vừa rồi, Tòa án Quận Tokyo ra phán quyết trong vụ Tsuda kiện đơn vị vận hành TikTok. Trên thực tế thì đây là vụ kiện đầu tiên ở Nhật liên quan đến việc nhân bản giọng nói bằng AI. Thẩm phán chủ tọa Aya Takahashi kết luận rằng “giọng nói con người là biểu tượng cho nhân cách của một cá nhân, cũng như hình ảnh” và cá nhân mình nghĩ rằng câu này quan trọng hơn rất nhiều so với bản chất vụ kiện, vì nó là lần đầu tiên con người đặt giọng nói ngang hàng với gương mặt trong mắt pháp luật.

Bản quyền hình ảnh và tại sao giọng nói trước giờ được coi là ngoại lệ

Nhật Bản có một khái niệm pháp lý gọi là “quyền công bố” (publicity right). Hiểu đơn giản, đây là quyền của người nổi tiếng được kiểm soát việc người khác dùng tên tuổi và hình ảnh của mình để kiếm tiền. Nếu một hãng in mặt ca sĩ lên bao bì sản phẩm mà không xin phép, họ vi phạm quyền này. Tòa án Tối cao Nhật đã công nhận quyền công bố từ năm 2012, trong vụ bộ đôi ca sĩ Pink Lady kiện một tạp chí dùng ảnh của họ chưa xin phép.

Lập luận của Tik Tok: đó là giọng nam chung chung và tài khoản cũng đã vội xoá video

Ngược lại, phía TikTok lập luận rằng giọng đọc trong các video chỉ là “một giọng nam chung chung”. Họ nói mô hình AI được huấn luyện từ giọng của một người bạn của chủ tài khoản, không phải từ giọng Tsuda. Lập luận này nghe có lý nếu xét theo cách AI hoạt động. Không ai có quyền sở hữu một “kiểu giọng” như trầm hay khàn, mà thực ra thì hàng triệu đàn ông có chất giọng trầm trầm này. Nếu mọi giọng trầm khàn đều bị coi là bắt chước Tsuda, thì luật sẽ trở nên vô lý. Tuy nhiên, phía của Tsuda đâu để yên như vậy. Luật sư của ông đã đưa ra kết quả phân tích âm học và cho rằng giọng đọc trong video là sự bắt chước có chủ đích chất giọng “trầm và bóng” đặc trưng của ông. Ngoài ra, tòa không xem giọng nói chỉ là dữ liệu âm thanh vô chủ và việc dùng giọng nói của người khác mà không được phép có thể vi phạm quyền công bố khi mục đích là khai thác sức hút thương mại của giọng nói ấy.

565893.jpg
565893.jpg

TikTok lấp liếm đó là giọng chung chung, và tài khoản cũng đã xoá video trước khi Toà kịp xử Mình thấy điểm mấu chốt nằm ở chữ “sức hút thương mại”. Tòa không nói ai có giọng giống Tsuda cũng vi phạm. Tòa nói rằng khi một người cố tình tạo ra giọng giống Tsuda để thu hút người xem và kiếm tiền, thì họ đang lấy đi thứ thuộc về Tsuda. Một tài khoản kiếm hàng trăm nghìn yên mỗi tháng từ một chất giọng quen tai với fan anime khó có thể nói đó là trùng hợp. Có một chi tiết khiến phán quyết này mang tính biểu tượng nhiều hơn thực tế. Các bản tin mình đọc được chưa nói rõ mức bồi thường, nếu có, nhưng điều chắc chắn là toà sẽ bác bỏ yêu cầu gỡ bỏ video liên quan tới Tsudua, vì tài khoản và video đã bị gỡ từ trước, còn gì đâu để mà gỡ. Chi tiết này cho thấy một vấn đề pháp lý chắc chắc sẽ lặp đi lặp lại nhiều lần: tài khoản vi phạm có thể kiếm tiền trong hơn một năm, rồi biến mất khi bị kiện. Thời gian xử lý của toàn án thường khá chậm và nó đã đủ để bên bị đơn tẩu tán video, đồng thời mọc lên một tài khoản khác. Phán quyết của toà chỉ có giá trị tạo tiền lệ, nhưng nó không lấy lại được khoản tiền đã kiếm, cũng không ngăn được tài khoản tiếp theo thực hiện hành vi tương tự. Ngoài ra, luật sư của Tsuda còn cáo buộc hành vi cạnh tranh không lành mạnh theo Luật Chống cạnh tranh không lành mạnh của Nhật. Luật này ra đời trước thời AI tạo giọng rất lâu, nên việc áp dụng nó cho giọng nói tổng hợp vẫn là câu hỏi pháp lý còn mở.

Không chỉ một mình Nhật, Mỹ cũng đã có xu thế tương tự và điều này tác động gì?

Thực ra tổng hợp một hồi thì thấy phán quyết ở Tokyo nằm trong một xu hướng rộng hơn nhiều. Tháng 8/2026, một hội đồng chuyên gia của Bộ Tư pháp Nhật đã khuyến nghị nên đối xử với giọng nói như hình ảnh. Tòa án Quận Tokyo giờ đã đi theo đúng hướng đó dù chưa có luật mới.

1716292883772-tdy-news-7a-kaylee-hartung-scarlett-johansson-240521-1920x1080-ok4nk3.webp
1716292883772-tdy-news-7a-kaylee-hartung-scarlett-johansson-240521-1920x1080-ok4nk3.webp

Scarlett Johansson cũng từng buộc OpenAI phải dừng giọng nói Sky vì nó giống cô một cách bất ngờ Điểm chung của các vụ việc này là pháp luật đang dần chấp nhận một ý tưởng: giọng nói không chỉ là âm thanh, mà là một phần danh tính khi người khác có thể nghe, nhận ra, và vì vậy có thể bị lợi dụng vì mục đích cá nhân hay lợi ích kinh tế. Thật ra, những phán quyết như thế này hoàn toàn không cấm việc AI tạo giọng. Những công cụ đọc văn bản bằng giọng tổng hợp, giọng ảo tự thiết kế hay giọng được cấp phép vẫn hoàn toàn hợp pháp. Thứ bị nhắm tới là việc cố tình sao chép giọng của một người cụ thể, dễ nhận ra, để kiếm tiền từ sức hút của họ. Dĩ nhiên, ranh giới của việc này sẽ còn gây tranh cãi với nhiều câu hỏi: giống đến mức nào thì bị coi là bắt chước? Phân tích âm học có đủ làm bằng chứng không? Nếu mô hình được huấn luyện từ giọng người khác nhưng kết quả lại giống một người nổi tiếng thì sao? Vụ Tsuda chưa trả lời hết những câu hỏi này, và mình nghĩ các vụ tiếp theo sẽ phải làm rõ dần những yếu tố này. Với giới lồng tiếng Nhật, một ngành mà tên tuổi gắn liền với chất giọng, đây là lần đầu tiên họ có một phán quyết để dựa vào. Diễn viên lồng tiếng Megumi Ogata, người lồng tiếng Shinji Ikari trong Evangelion, cũng từng lên tiếng kêu gọi Nhật bảo vệ giọng nói trước AI. Với họ, phán quyết hôm 30/9 là một bước quan trọng: từ giờ, giọng nói của họ được tòa án Nhật công nhận là thuộc về chính họ.

Nguồn / Original source: Tinh tế