阿里巴巴申请公布大型语言模型训练相关专利
专利摘要显示,本发明实施例中,通过获取多个初始采样数据,初始采样数据包括图像、图像的辅助文 本信息以及图像的标准审核结果;根据每个初始采用数据生成思维链数据,并确定思维链数据集合;根 据思维链数据集合对基础大型语言模型进行全量微调,确定中间大型语言模型;根据中间大型语言模型 以及多个所述初始采样数据,迭代生成多个中间思维链数据;进而根据预先设置的奖励函数,确定各所 述中间思维链数据的奖励数值;最后采用组相对策略优化算法GRPO对所述中间大型语言模型进行强化 学习,确定目标大型语言模型。通过上述方法,可以提高大型语言模型的可解释性和审核精度。 企查查APP显示,近日,阿里巴巴(中国)有限公司申请公布"一种基于思维链训练大型语言模型的方 法、装置和设备"专利。 (原标题:阿里巴巴申请公布大型语言模型训练相关专利) ...