Workflow
可验证奖励强化学习(RLVR)
icon
Search documents
OpenAI路线遭质疑,Meta研究员:根本无法构建超级智能
3 6 Ke· 2025-06-20 12:00
超级智能(Superintelligence)是处于 AGI 之上、甚至通用能力超过人类的更高维 AI 发展方向。 学术头条在不改变原文大意的情况下,对整体内容做了精编,如下: 然而,在 Meta AI 研究员 Jack Morris 看来,Altman 提到超级智能的"工程问题",在于"构建大量适用于不同任务的 RL 环境,并训练 LLM 同时处理所有 这些任务"。他认为,这一由 OpenAI 等公司当前大力推进的路径——基于 LLM 的 RL——根本无法构建超级智能。 "我谦卑的预测是:LLM 将继续在训练分布内的任务上变得更好。随着我们收集更多类型的任务并进行训练,这将产生在广泛任务上越来越有用的 LLM。但它不会成为一个单一的超级智能模型。" Morris 在一篇题为"Superintelligence, from First Principles"的博客中,探讨了构建超级智能的 3 种可能方式:完全由监督学习(SL)、来自人类验证者 的强化学习(RL)、来自自动验证器的 RL。 扎克伯格不惜以一亿美金年薪挖角 OpenAI 等竞争对手的动作背后,便暴露了 Meta 等头部玩家追求"超级智能"的巨大野 ...
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
机器之心· 2025-05-28 08:09
机器之心报道 编辑:泽南、+0 我们训练了这么久,都在训练些什么? 这是今年最「好笑」的一篇论文。 本文一出,所有的大语言模型(LLM)+ 强化学习(RL)都要被质疑是否有意义了。 这周二,一篇来自华盛顿大学、艾伦人工智能实验室、伯克利的论文引爆了 AI 界。 作者驳斥了最近大模型领域盛行的强化学习方式,他们发现: 使用虚假奖励训练 Qwen2.5-Math-7B 模型也可以提高 MATH-500 的成绩,如果是随机奖 励,成绩能提高 21%,如果是错误奖励,成绩能提升 25%(真实奖励能提升 28.8%)。 这是怎么一回事?大模型的训练技巧真的有用吗?该工作的作者写了一篇博客进行了介绍: 质疑强化学习 (RLVR) 传统观点 近一段时间,可验证奖励强化学习(RLVR)已成为增强大型语言模型(LLM)推理能力的标准方法。传统观点认为,高质量的监督信号对于有效的 RLVR 训 练至关重要。最近的研究挑战了这一假设,表明使用 RLVR 对单个样本或无监督样本进行训练仍然可以在 Qwen-Math 模型上取得显著的进步。 但是,我们不禁要问:单样本或无监督 RLVR 中的训练信号来自哪里?为了提供有意义的 RLVR ...