模型评估

Search documents
北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”
量子位· 2025-06-26 14:11
北京大学DS-Lab团队 投稿 量子位 | 公众号 QbitAI 北京大学DS-Lab 发布 ScholarSearch, 旨在对LLMs的检索、信息整合及推理能力进行综合性、极限性考验。 研究团队招募了来自北京大学各个学院的本科和研究生志愿者,并为他们提供了集中培训。志愿者从公开可访问的在线出版物和网站中选择材 料,以制定需要网络搜索解答的学术问题。 LLMs能当科研助手了? 北大出考题,结果显示:现有模型都不能胜任。 北京大学DS-Lab发布ScholarSearch,这是首个专门用于评估大语言模型在学术研究中复杂信息检索能力的数据集,包含223道高难度的学 术检索题目及其答案。 它对具备联网搜索能力的代表性模型及纯推理模型进行了评估,结果显示,顶尖的纯推理模型,如GPT-4.1、DeepSeek-R1,在处理这些问 题时准确率普遍低于9%。 具备搜索功能的模型,相较于其无搜索能力的版本,准确率有显著提升,例如,GPT-4o-mini的准确率提升超过四倍。 尽管浏览能力带来了显著改进,但即便是最先进的搜索增强型模型,如 GPT-4o-search-preview,其准确率仅为18.83% 。 方法 Ope ...
一文读懂深度表格数据表示学习 | 南京大学
量子位· 2025-06-25 00:33
南京大学博士生蒋俊鹏 投稿 量子位 | 公众号 QbitAI 在AI应用中,表格数据的重要性愈发凸显,广泛应用于金融、医疗健康、教育、推荐系统及科学研究领域。 深度神经网络(DNN)凭借其强大的表示学习能力,在表格数据建模上展现出令人瞩目的潜力。 南京大学团队系统介绍了表格表示学习这一研究领域,他们将现有方法按泛化能力划分为三大类: 专用模型 (Specialized)、可迁移模型(Transferable)和通用模型(General) 。 除此之外,他们还比较了DNN与传统方法——树模型的优劣,并剖析表格数据学习中的核心挑战,讨论了集 成学习方法以及开放环境下的表格学习和多模态表格任务等扩展方向。同时,考虑到不同数据集之间方法表现 差异显著,研究团队还探讨了数据集收集、评估与分析的系统策略,旨在建立跨数据集的稳健评估体系。 背景 表格数据本质上是一种 结构化的信息表示方式 ,在组织与表达复杂数据关系方面具有天然优势。 此研究聚焦于 有监督的表格机器学习任务 ,主要包括分类与回归两类常见问题。 除了结构化的组织形式外,表格数据通常还具有 属性类型异质性 ,即包含数值型、类别型或混合型等多种数 据类型,且这些数 ...
大模型进入 RL 下半场,模型评估为什么重要?
Founder Park· 2025-05-13 03:42
大模型进入 RL 下半场。前段时间,OpenAI Agent Reseacher 姚顺雨的博客文章《The second half》掀起热议,从「模型算法」到「实际效用」, 如何重新定义问题和设计真实用例的 evaluation 变得尤为重要。 从评测基准到实际应用效果,现有的评估体系怎样有效衡量 Agent 产品的 ROI ?对于创企、希望 应用 AI 的企业来说,如何用好模型的测评结果来指导产品的开发落地? SuperCLUE 在模型测评领域有着深厚的经验,与国内外众多模型及 Agent 团队保持着紧密的联系 与交流。 SuperCLUE 近期推出了中文通用 AI 智能体的测评基准 AgentCLUE-General,对主流 的 Agent 产品能力进行了深度剖析。 我们特别邀请到 SuperCLUE 的联合创始人朱雷,一起聊聊当前大模型、Agent 评估中的核心难 题。 本周四(5 月 15 日),20 点 - 22 点,线上分享 。目前还有少量名额,扫描下方海报二维码报 名。 更多阅读 Agent 产品如何定价?一文说清 AI 产品的四种付费模式 Agent 如何在企业里落地?我们和火山引擎聊了聊 转 ...
万字解读OpenAI产品哲学:先发布再迭代、不要低估模型微调和评估
Founder Park· 2025-04-15 11:56
今天凌晨, OpenAI 发布了新模型 GPT-4.1 ,相对比 4o,GPT-4.1 在编程和指令遵循方面的能力显 著提升,同时还宣布 GPT-4.5 将会在几个月后下线。 不少人吐槽 OpenAI 让人迷惑的产品发布逻辑——GPT-4.1 晚于 4.5 发布,以及混乱的模型命名,这 些问题,都能在 OpenAI CPO Kevin Weil 最近的一期播客访谈中得到解答。 在访谈中,Kevin Weil 分享了 OpenAI 在产品方面的路线规划,以及所拥护的产品发布哲学「迭代 部署」,对于近期火热的 4o 图片生成功能,也做了内部的复盘。 Kevin Weil 表示,「我们尽量保持轻量级,因为它不可能完全正确。我们会在半路放弃一些不正确 的做法或研究计划,因为我们会不断学习新的东西。 我们有一个哲学叫做迭代部署,与其等你完全 了解模型的所有能力后再发布,不如先发布,即使不完美,然后公开迭代。 」 背景:Kevin Weil 是 OpenAI 的首席产品官,负责管理 ChatGPT、企业产品和 OpenAI API 的开发。在加入 OpenAI 之前,Kevin 曾担任 Twitter、Instagram ...