Workflow
端到端生成
icon
Search documents
何恺明CVPR 2025报告深度解读:生成模型如何迈向端到端?
自动驾驶之心· 2025-06-28 13:34
点击下方 卡片 ,关注" 大模型之心Tech "公众号 戳我 -> 领取大模型巨卷干货 写在前面 在深度学习的历史长河中,AlexNet的横空出世曾彻底改写识别模型的命运——它让"逐层训练"成为过去式,端到端学 习从此一统江湖。而今天,当我们望向生成模型的浩瀚星空,扩散模型的多步迭代、自回归模型的时序依赖,是否仍 在重演"前AlexNet时代"的困局? 何恺明老师在 CVPR 2025 workshop上的最新分享 《Towards End-to-End Generative Modeling》 ,正以手术刀般的视 角剖开这场技术演进的历史轮回。他不仅回溯了识别与生成的"硬币双面"关系——一边是数据到语义的抽象流,一边 是噪声到实例的具象流,更带来了MeanFlow这把"瑞士军刀":用平均速度替代复杂积分,让ImageNet生成从250步迭 代压缩到1步完成,FID指标直逼传统多步模型的天花板。 这不禁让人思考:生成模型的"AlexNet时刻"是否已至? 今天,就让我们以何恺明老师的报告为锚点, 回顾 一下生成模型技术丛林的深度漫游,解锁那些正在重塑生成模型范 式的关键思想。 此外,借着这个话题,我们也同步 ...
何恺明新身份:谷歌DeepMind杰出科学家
机器之心· 2025-06-26 00:30
机器之心报道 机器之心编辑部 恭喜谷歌。 刚刚,有网友爆料,自己在公司收到了「欢迎何恺明加入」的邮件,何恺明疑似加入谷歌。 在搜索何恺明个人主页后,我们可以确认,他确实加入了谷歌,不过是以兼职的形式,职位是谷歌 DeepMind 杰出科学家 (Distinguished Scientist)。 个人主页:https://people.csail.mit.edu/kaiming/ 关于何恺明在谷歌的具体研究方向,目前还搜不到详细信息。 不过,我们可以根据他最近发表的研究推测一下。前段时间,他所在的团队发布了一篇题为「Mean Flows for One-step Generative Modeling」的论文(参见《 何恺 明团队又发新作: MeanFlow 单步图像生成 SOTA,提升达 50% 》)。在最近的 CVPR workshop 上,他也重点介绍了这一论文所代表的方向。 在分享中,他指出,在 AlexNet 之前,逐层训练更为流行,如深度信念网络(DBN)和去噪自编码器(DAE)。但 AlexNet 之后,识别模型普遍实现了端到端训 练,大大简化了模型设计和训练的复杂性。 不过,有趣的是,今天的生成 ...
何恺明CVPR最新讲座PPT上线:走向端到端生成建模
机器之心· 2025-06-19 09:30
机器之心报道 编辑:张倩 生成模型会重现识别模型的历史吗? 今年的 CVPR 已经在美国田纳西州纳什维尔顺利闭幕。除了交流论文、互加好友,很多参会者还参加了个非常有意思的项目 —— 追星。 这个「星」自然是学术明星。从前方发来的实况来看,MIT 副教授何恺明可能是人气最高的那一个。他的讲座全场爆满,还有很多同学晒出了与恺明大神的合 影。 其实,这次现身 CVPR 会场的何恺明有着多重身份,包括但不限于最佳论文奖委员会成员、「Visual Generative Modeling: What's After Diffusion?」workshop 演讲嘉 宾等。 这个 workshop 聚焦的主题是扩散模型之后的视觉生成建模演进方向。 近年来,扩散模型迅速超越了先前的方法,成为视觉生成建模中的主导方法,广泛应用于图像、视频、3D 物体等的生成。然而,这些模型也存在一些显著的局限 性,例如生成速度较慢、生成过程中人类干预有限,以及在模拟复杂分布(如长视频)时面临挑战。 这个 workshop 旨在探索视觉生成建模中能够超越扩散模型的方法,何恺明在活动中做了主题为「Towards End-to-End Generat ...