6 Sept 2026

...

KHI SÁCH GIẤY TRỞ THÀNH “NGUYÊN LIỆU” CHO AI Hàng triệu cuốn sách được mua về, cắt bỏ gáy bằng máy thủy lực, đưa qua hệ thống quét công nghiệp rồi tiêu hủy. Nghe giống một câu chuyện dystopia về ngày tận thế của sách, nhưng phần cốt lõi của câu chuyện này đã xuất hiện trong chính hồ sơ tòa án liên quan đến Anthropic. Các tài liệu được công khai trong vụ Bartz v. Anthropic cho thấy từ năm 2024, công ty đứng sau Claude triển khai một dự án nội bộ mang tên Project Panama. Một tài liệu mô tả mục tiêu bằng câu rất thẳng: “Project Panama is our effort to destructively scan all the books in the world”, đồng thời nhấn mạnh công ty không muốn hoạt động này được biết đến rộng rãi. MUA SÁCH, CẮT GÁY, QUÉT RỒI HỦY Quy trình về cơ bản mang tính công nghiệp. Anthropic mua sách với số lượng lớn, thuê đơn vị chuyên quét tài liệu cắt gáy để tách từng trang, số hóa nội dung rồi loại bỏ bản giấy. Hồ sơ cho thấy có gói công việc dự kiến xử lý từ 500.000 đến 2 triệu cuốn chỉ trong sáu tháng. CÙNG LÀ SÁCH ĐỂ HUẤN LUYỆN AI, NHƯNG TÒA CHIA THÀNH HAI CHUYỆN Trong phán quyết năm 2025, Thẩm phán William Alsup phân biệt khá rõ hai nguồn sách của Anthropic. Việc mua sách giấy hợp pháp rồi số hóa để phục vụ huấn luyện AI được ông xem là fair use; ngược lại, việc tải hàng triệu bản sách từ các thư viện lậu như LibGen và Pirate Library Mirror không được hợp thức hóa chỉ vì mục đích cuối cùng là huấn luyện AI. Phần sách lậu sau đó trở thành trung tâm của thỏa thuận dàn xếp trị giá 1,5 tỷ USD. Đến tháng 7/2026, tòa đã phê chuẩn thỏa thuận; danh sách cuối cùng gồm 482.460 tác phẩm, với mức chi trả ước tính khoảng 3.000 USD cho mỗi tác phẩm trước các khoản phí và phân bổ liên quan. Anthropic cũng phải tiêu hủy các file có nguồn gốc từ những bản tải lậu thuộc phạm vi thỏa thuận. TẠI SAO AI BỖNG THÈM SÁCH GIẤY? Có một lý do kỹ thuật rất thực dụng. Internet từng là kho văn bản khổng lồ cho các mô hình ngôn ngữ, nhưng từ khi AI tạo sinh bùng nổ, ngày càng nhiều nội dung trên web lại do chính AI viết. Huấn luyện thế hệ AI tiếp theo trên lượng lớn văn bản do AI trước đó tạo ra đặt ra vấn đề về chất lượng và nguy cơ suy giảm dữ liệu. Sách, đặc biệt những cuốn xuất bản trước làn sóng generative AI, lại có những phẩm chất rất hấp dẫn: phần lớn do con người viết, được biên tập, có cấu trúc dài, lập luận và câu chuyện xuyên suốt. Tài liệu nội bộ được công bố cho thấy Anthropic cũng quan tâm đến chất lượng dữ liệu và nguy cơ liên quan đến việc mô hình tiếp tục học từ nội dung bị “nhiễm” bởi AI. TỪ THƯ VIỆN THÀNH CHUỖI CUNG ỨNG DỮ LIỆU Sau khi câu chuyện Project Panama được công khai, nhiều báo cáo xuất hiện về những đơn hàng sách cũ có quy mô bất thường, đôi khi lên tới hàng nghìn đầu sách, trong đó có cả sách đã ngừng xuất bản. Tuy nhiên, cần thận trọng ở điểm này: không phải mọi giao dịch lớn như vậy đều xác định được phòng lab AI đứng sau, và tổng số sách đang bị số hóa theo phương thức này trên toàn ngành hiện chưa có con số đáng tin cậy. Đây cũng là chỗ câu chuyện vượt khỏi tranh luận thuần túy về copyright. Với một cuốn sách phổ thông còn hàng chục nghìn bản, việc một bản bị cắt gáy gần như chẳng ảnh hưởng gì. MỘT NGHỊCH LÝ CỦA THỜI ĐẠI AI Suốt nhiều năm, người ta hình dung AI sẽ đọc internet để học về thế giới. Nhưng khi internet ngày càng chứa nhiều thứ do AI tạo ra, các công ty AI lại phải quay ngược về một trong những kho dữ liệu lâu đời nhất của loài người: sách giấy. Và thế là xuất hiện một chuỗi cung ứng rất lạ của thế kỷ XXI: mua sách → cắt gáy → quét → đưa vào kho dữ liệu → hủy bản giấy → huấn luyện AI. Project Panama cho thấy cuộc đua AI không chỉ diễn ra trong những trung tâm dữ liệu chứa hàng chục nghìn GPU. Nó đã đi ngược trở lại các kho sách cũ, những nhà bán sách thanh lý và những cuốn sách tưởng như chẳng còn mấy giá trị thương mại. ⸻ 🌐 passion.cuongdc.co 🌐 Telegram/CuongDC


KHI SÁCH GIẤY TRỞ THÀNH “NGUYÊN LIỆU” CHO AI Hàng triệu cuốn sách được mua về, cắt bỏ gáy bằng máy thủy lực, đưa qua hệ thống quét công nghiệp rồi tiêu hủy. Nghe giống một câu chuyện dystopia về ngày tận thế của sách, nhưng phần cốt lõi của câu chuyện này đã xuất hiện trong chính hồ sơ tòa án liên quan đến Anthropic. Các tài liệu được công khai trong vụ Bartz v. Anthropic cho thấy từ năm 2024, công ty đứng sau Claude triển khai một dự án nội bộ mang tên Project Panama. Một tài liệu mô tả mục tiêu bằng câu rất thẳng: “Project Panama is our effort to destructively scan all the books in the world”, đồng thời nhấn mạnh công ty không muốn hoạt động này được biết đến rộng rãi. MUA SÁCH, CẮT GÁY, QUÉT RỒI HỦY Quy trình về cơ bản mang tính công nghiệp. Anthropic mua sách với số lượng lớn, thuê đơn vị chuyên quét tài liệu cắt gáy để tách từng trang, số hóa nội dung rồi loại bỏ bản giấy. Hồ sơ cho thấy có gói công việc dự kiến xử lý từ 500.000 đến 2 triệu cuốn chỉ trong sáu tháng. CÙNG LÀ SÁCH ĐỂ HUẤN LUYỆN AI, NHƯNG TÒA CHIA THÀNH HAI CHUYỆN Trong phán quyết năm 2025, Thẩm phán William Alsup phân biệt khá rõ hai nguồn sách của Anthropic. Việc mua sách giấy hợp pháp rồi số hóa để phục vụ huấn luyện AI được ông xem là fair use; ngược lại, việc tải hàng triệu bản sách từ các thư viện lậu như LibGen và Pirate Library Mirror không được hợp thức hóa chỉ vì mục đích cuối cùng là huấn luyện AI. Phần sách lậu sau đó trở thành trung tâm của thỏa thuận dàn xếp trị giá 1,5 tỷ USD. Đến tháng 7/2026, tòa đã phê chuẩn thỏa thuận; danh sách cuối cùng gồm 482.460 tác phẩm, với mức chi trả ước tính khoảng 3.000 USD cho mỗi tác phẩm trước các khoản phí và phân bổ liên quan. Anthropic cũng phải tiêu hủy các file có nguồn gốc từ những bản tải lậu thuộc phạm vi thỏa thuận. TẠI SAO AI BỖNG THÈM SÁCH GIẤY? Có một lý do kỹ thuật rất thực dụng. Internet từng là kho văn bản khổng lồ cho các mô hình ngôn ngữ, nhưng từ khi AI tạo sinh bùng nổ, ngày càng nhiều nội dung trên web lại do chính AI viết. Huấn luyện thế hệ AI tiếp theo trên lượng lớn văn bản do AI trước đó tạo ra đặt ra vấn đề về chất lượng và nguy cơ suy giảm dữ liệu. Sách, đặc biệt những cuốn xuất bản trước làn sóng generative AI, lại có những phẩm chất rất hấp dẫn: phần lớn do con người viết, được biên tập, có cấu trúc dài, lập luận và câu chuyện xuyên suốt. Tài liệu nội bộ được công bố cho thấy Anthropic cũng quan tâm đến chất lượng dữ liệu và nguy cơ liên quan đến việc mô hình tiếp tục học từ nội dung bị “nhiễm” bởi AI. TỪ THƯ VIỆN THÀNH CHUỖI CUNG ỨNG DỮ LIỆU Sau khi câu chuyện Project Panama được công khai, nhiều báo cáo xuất hiện về những đơn hàng sách cũ có quy mô bất thường, đôi khi lên tới hàng nghìn đầu sách, trong đó có cả sách đã ngừng xuất bản. Tuy nhiên, cần thận trọng ở điểm này: không phải mọi giao dịch lớn như vậy đều xác định được phòng lab AI đứng sau, và tổng số sách đang bị số hóa theo phương thức này trên toàn ngành hiện chưa có con số đáng tin cậy. Đây cũng là chỗ câu chuyện vượt khỏi tranh luận thuần túy về copyright. Với một cuốn sách phổ thông còn hàng chục nghìn bản, việc một bản bị cắt gáy gần như chẳng ảnh hưởng gì. MỘT NGHỊCH LÝ CỦA THỜI ĐẠI AI Suốt nhiều năm, người ta hình dung AI sẽ đọc internet để học về thế giới. Nhưng khi internet ngày càng chứa nhiều thứ do AI tạo ra, các công ty AI lại phải quay ngược về một trong những kho dữ liệu lâu đời nhất của loài người: sách giấy. Và thế là xuất hiện một chuỗi cung ứng rất lạ của thế kỷ XXI: mua sách → cắt gáy → quét → đưa vào kho dữ liệu → hủy bản giấy → huấn luyện AI. Project Panama cho thấy cuộc đua AI không chỉ diễn ra trong những trung tâm dữ liệu chứa hàng chục nghìn GPU. Nó đã đi ngược trở lại các kho sách cũ, những nhà bán sách thanh lý và những cuốn sách tưởng như chẳng còn mấy giá trị thương mại. ⸻ 🌐 passion.cuongdc.co 🌐 Telegram/CuongDC

This Is The Newest Post