计算机行业：浅析AI大模型训练数据来源与版权挑战

[Table_Page] 深度分析|计算机证券研究报告 [Table_Title] 计算机行业浅析 AI 大模型训练数据来源与版权挑战 [Table_Summary] 核心观点: AI 大模型训练数据来源广泛。在算力可获得性提升以及算法同质化趋势下,训练数据成为影响大模型性能的重要因素。区别于传统 AI 模型,大语言模型通常使用公共文本数据集的混合体作为预训练语料库,而多模态大模型则需要大规模的图片和音视频等多模态数据。这些训练数据的来源广泛,包含公开渠道、企业自研、直接购买与合作交换等。内容持有者对 AI厂商态度各异。部分内容持有者针对 AI 平台提出了各种维权诉求,已有数十起版权诉讼正在进行中。同时,另一部分内容持有者则选择了授权合作道路。版权纠纷实质上是商业利益之争, 内容持有者具体选择诉讼还是合作取决于其商业模式、内容独特性和行业结构等因素。作家和艺术家们普遍倾向于抵制 AI 公司并控诉其侵权行为,而新闻媒体在版权斗争中则难以形成统一阵线。确保训练数据的合法来源对于 AIGC 发展非常关键。我们在去年的《从 Adobe 看 AIGC 如何重塑创意工具行业》报告中提到,训练 ...