Insights / Blog

Huấn luyện AI trên sách có bản quyền: tòa án Mỹ đã thực sự phán gì?

Phán quyết bản quyền AI năm 2025: Anthropic bị phạt 1,5 tỷ USD nhưng việc huấn luyện AI được công nhận hợp pháp. Tòa Mỹ đang định hình luật chơi cho toàn…
L
Lam Nguyen - Founder
Share
Huấn luyện AI trên sách có bản quyền: tòa án Mỹ đã thực sự phán gì?
ON THIS PAGE

Table of Contents

Câu hỏi về bản quyền AI khi huấn luyện mô hình trên sách chưa có lời giải dứt điểm. Năm 2025, các tòa án Mỹ đưa ra những phán quyết trái chiều: một phán quyết kết luận rằng huấn luyện AI trên sách là hợp pháp về nguyên tắc, nhưng phạt nặng vì cách lấy dữ liệu; một phán quyết khác xử rằng dùng nội dung có bản quyền để xây dựng sản phẩm cạnh tranh trực tiếp thì vượt ranh giới cho phép. Không có phán quyết nào bao quát toàn bộ, và luật bản quyền Mỹ vẫn giữ nguyên từ năm 1976.

1,5 tỷ USDkhoản phạt Anthropic trong vụ kiện bản quyền sáchTechCrunch, 8/2026
200 tỷ USDdự phóng doanh thu Anthropic năm 2028TechCrunch, 8/2026
1976năm luật bản quyền Mỹ được cập nhật lần cuốiTechCrunch, 8/2026

Phán quyết Anthropic thực sự nói điều gì?

Một trong những phán quyết đầu tiên về bản quyền AI xuất hiện năm 2025, khi Thẩm phán William Alsup ra lệnh Anthropic nộp phạt 1,5 tỷ USD cho nhóm nhà văn có tác phẩm bị dùng để huấn luyện các mô hình AI của công ty, theo TechCrunch. Con số khổng lồ này dễ gây hiểu nhầm nếu chỉ đọc tiêu đề.

Thẩm phán Alsup kết luận rằng bản thân việc Anthropic huấn luyện AI là hợp pháp. Khoản phạt phát sinh từ cách công ty lấy sách: tải xuống từ các shadow library (kho lưu trữ kỹ thuật số bất hợp pháp, nơi sách lậu được phát tán tự do), chứ không phải từ hành vi huấn luyện.

Thẩm phán Alsup ví quá trình này với việc một nhà văn nghiên cứu văn học, và viết rằng các LLM (large language model, mô hình ngôn ngữ lớn, nền tảng kỹ thuật phía sau các chatbot như Claude và ChatGPT) của Anthropic “học từ văn bản không phải để chạy đua sao chép hay thay thế các tác phẩm đó, mà để rẽ sang một hướng khác và tạo ra điều gì đó mới.”

Luật sư Cathy Gellis, chuyên về sở hữu trí tuệ và luật công nghệ, nhận định với TechCrunch rằng phán quyết này nhìn chung có lợi cho các công ty AI. “Luật bản quyền xoay quanh hành vi sao chép, không xoay quanh việc sử dụng, trải nghiệm hay đọc một tác phẩm,” bà nói.

Để đặt mức phạt 1,5 tỷ USD vào bối cảnh: Anthropic đang dự phóng doanh thu khoảng 200 tỷ USD mỗi năm vào 2028, theo TechCrunch.

Vì sao “mục đích chuyển hóa” là phép thử bản quyền AI quan trọng nhất?

Fair use (quyền sử dụng hợp lý) là ngoại lệ trong luật bản quyền Mỹ, cho phép dùng tác phẩm có bản quyền mà không cần xin phép khi mục đích đủ “chuyển hóa”, tức tạo ra thứ gì đó có mục đích hoặc tính chất khác hẳn. Thẩm phán cân nhắc mục đích sử dụng, lượng nội dung được lấy, và tác động lên thị trường của tác phẩm gốc. Yếu tố cuối đang là nơi các tòa quyết liệt nhất.

Năm 2025, trong một vụ riêng, Thomson Reuters kiện công ty nghiên cứu pháp lý Ross Intelligence vì dùng nội dung của Reuters để huấn luyện nền tảng AI cạnh tranh trực tiếp với họ. Thẩm phán Stephanos Bibas xử bất lợi cho Ross, với lập luận: “Mục đích sử dụng của Ross không có tính chuyển hóa vì nó không mang ‘mục đích hoặc tính chất khác’ so với sản phẩm của Thomson Reuters,” theo TechCrunch.

Jason Henderson, luật sư cấp cao và người sáng lập bộ phận IP & Media Practice tại JWL International, nói với TechCrunch rằng xu hướng qua các vụ kiện đang rõ dần: “Nếu bạn huấn luyện AI trên tài sản người khác với mục đích cạnh tranh trực tiếp, tòa sẽ không đồng ý. Còn nếu không nhằm cạnh tranh, tòa có xu hướng tìm cách chấp thuận.”

Các tác giả từng lập luận rằng chatbot AI cạnh tranh trực tiếp với họ khi dùng văn phong của họ để tạo ra sách tổng hợp mới. Tuy nhiên, lập luận này chưa thắng trong vụ kiện nào, theo TechCrunch.

Nội dung do AI tạo ra có được cấp bản quyền không?

Câu chuyện pháp lý còn phức tạp hơn ở phía đầu ra. Trong vụ Thaler v. Perlmutter, tòa phán quyết rằng nội dung do AI tạo ra 100% không được cấp bản quyền, theo TechCrunch. Điều này ngay lập tức mở ra một vấn đề thực tế: không có cách nào chắc chắn để xác định một tác phẩm có bao nhiêu phần trăm được tạo ra với sự hỗ trợ của AI.

Luật sư Gellis minh họa bằng ví dụ quen thuộc: “Nếu bạn viết tiểu thuyết trên Word rồi dùng kiểm tra chính tả, chúng ta thoải mái với việc nói rằng Word không sở hữu cuốn tiểu thuyết đó.” Bà cho biết AI đang buộc tòa án phải đối mặt với những câu hỏi mà các nhà lập pháp đã lần lữa từ lâu.

Henderson tóm gọn khoảng cách pháp lý hiện tại: “Họ biết rằng mô hình AI đã được huấn luyện trên vô số tài liệu, và luật pháp thực sự chưa theo kịp câu hỏi đó.”

Với luật bản quyền Mỹ lần cuối được cập nhật năm 1976, các thẩm phán đang áp dụng khung pháp lý 50 năm tuổi để giải quyết những câu hỏi sẽ định hình tương lai ngành AI. Hầu hết các công ty AI lớn vẫn đang trong vòng kiện tụng chưa ngã ngũ. Luật sư Gellis nhận định với TechCrunch rằng các phán quyết ban đầu “có thể bị đảo ngược nếu các tòa khác quyết định khác đi.”

Điều này có nghĩa gì với khả năng hiển thị trên AI tìm kiếm?

Nguồn nào được phép dùng để huấn luyện AI sẽ quyết định nguồn nào được AI trích dẫn và đề xuất. Các tòa án đang ở giữa quá trình đó, và kết quả tác động trực tiếp đến bất kỳ thương hiệu nào muốn xuất hiện trong câu trả lời do AI tạo ra.

Nếu tòa cuối cùng thu hẹp việc huấn luyện AI hợp pháp xuống chỉ còn nội dung được cấp phép và ghi nguồn rõ ràng, các nhà xuất bản và website có thỏa thuận dữ liệu chính thức sẽ có lợi thế cơ cấu bên trong câu trả lời AI. Một mô hình được huấn luyện trên corpus (tập hợp văn bản được chọn lọc và cấp phép hợp pháp) sẽ trích dẫn các nguồn khác hẳn so với mô hình huấn luyện trên mọi thứ thu thập được từ web mở.

Phán quyết vụ Ross Intelligence làm rõ góc độ cạnh tranh. Tòa án bảo vệ chủ sở hữu nội dung mạnh nhất khi việc huấn luyện AI cho phép xây dựng sản phẩm cạnh tranh trực tiếp với người tạo nội dung gốc. Một thương hiệu có bài viết được dùng để huấn luyện AI rồi AI đó thay thế thương hiệu trong kết quả tìm kiếm đang ở vị trí pháp lý và chiến lược khác hẳn so với thương hiệu đóng góp nội dung cho một trợ lý đa năng trả lời câu hỏi ở các lĩnh vực khác.

Góc nhìn Hingewise

Nói đơn giản: AI học từ nội dung nào thì sau này sẽ nhắc đến nguồn đó. Ví dụ cụ thể: hai thương hiệu cùng viết về một chủ đề, chất lượng nội dung ngang nhau, nhưng chỉ một bên có thỏa thuận cấp phép rõ ràng với nền tảng AI. Khi luật thắt chặt, bên có thỏa thuận sẽ được trích dẫn còn bên kia thì không.

Có một góc mà phân tích báo chí chưa đề cập: hành vi của nhà xuất bản đang thay đổi theo hướng chủ động chuẩn bị cho các phán quyết tương lai, bất kể phán quyết đó cuối cùng là gì. Những thay đổi này định hình thành phần của các tập dữ liệu huấn luyện AI trong tương lai, từ đó ảnh hưởng đến nguồn nào các mô hình AI có thể trích dẫn đáng tin cậy. Ai ngồi chờ phán quyết dứt khoát rồi mới hành động về vấn đề ghi nguồn và cấp phép nội dung thực chất là nhường quyền định hình tập dữ liệu đó cho người đi trước.

Nhận định của Hingewise: các mô hình AI được huấn luyện trên nội dung có cấp phép hợp pháp, tác giả rõ ràng và ghi nguồn đầy đủ sẽ có vị thế tốt hơn để xuất hiện và được trích dẫn so với mô hình huấn luyện trên corpus đang trong vòng tranh chấp pháp lý. Đây là nhận định dựa trên chiều hướng các phán quyết hiện tại, không phải kết luận cuối cùng.

Cần kiểm tra gì trước khi cho rằng tranh cãi bản quyền AI đã ngã ngũ?

Bức tranh pháp lý vẫn đang thay đổi. Trước khi đưa ra quyết định dựa trên các phán quyết hiện tại, đây là những điểm cần rà soát:

  • Nội dung của bạn có đang nằm trong bộ dữ liệu huấn luyện AI nào không? Một số nền tảng cho phép kiểm tra hoặc phản đối việc này.
  • Bạn có thỏa thuận cấp phép rõ ràng với nền tảng AI nào không, hay nội dung đang được thu thập tự do từ web?
  • Sản phẩm AI sử dụng nội dung của bạn có cạnh tranh trực tiếp với bạn không? Đây là yếu tố tòa án nhạy cảm nhất hiện tại theo phán quyết vụ Ross Intelligence.
  • Nội dung của bạn có ghi rõ tác giả, ngày đăng và nguồn tham chiếu không? Ghi nguồn đầy đủ là lợi thế khi tập dữ liệu huấn luyện bị kiểm tra pháp lý.
  • Điều khoản sử dụng và robots.txt của bạn có phản ánh đúng ý định với AI crawler (bot thu thập dữ liệu cho AI) không?
  • Các vụ kiện đang chờ xét xử có liên quan đến lĩnh vực của bạn không? Kết quả có thể đảo ngược quy tắc hiện tại.

Nguồn: Amanda Silberling, TechCrunch, 23/8/2026, Is it legal to train AI models on copyrighted books? It’s complicated

Keep reading

All articles →
Free · no strings

See what AI says about you, today.

Get the report showing how ChatGPT, Gemini & Perplexity answer about your brand.

Get free report →
Reply within 48 hours.