0 引言
以 ChatGPT、Sora、DeepSeek 等为代表的人工智能大模型,其核心能力的形成高度依赖对海量数据的训练与学习。这些训练数据中包含了大量正处于著作权保护期内的作品,高质量的作品数据对于提升模型的生成质量与(试读)...