腾讯混元OCR模型宣布开源 参数仅为1B 多项核心能力达到SOTA效果
智通财经APP获悉,11月25日,腾讯混元推出全新开源模型 HunyuanOCR,参数仅为1B,依托于混元原 生多模态架构打造,获得多项业界OCR应用榜单SOTA(最先进水平)成绩。据介绍,HunyuanOCR 具有 高度易用性,不仅体积小,便于部署,得益于混元原生多模态大模型"端到端"的理念设计,各项功能仅 需单次前向推理即可直达最优结果,较业界级联方案更高效和便捷,性价比高。 混元OCR专家模型依托于混元原生多模态架构打造,主要由三大部分组建构成:原生分辨率视频编码 器、自适应视觉适配器和轻量化混元语言模型。 不同于其他开源的OCR专家模型或系统,HunyuanOCR模型的训练和推理均采用全端到端范式,通过规 模化的高质量应用导向数据,结合在线强化学习,模型表现出了非常稳健的端到端推理能力。 值得注意的是,混元OCR多项核心能力达到SOTA效果,其中在复杂文档解析的OmniDocBench测评 中,获得了最高的94.1分,效果超过了谷歌的Gemini3-pro等一众领先的模型;文字检测和识别能力,在 自建覆盖了9大应用场景(文档、艺术字、街景、手写、广告、票据、截屏、游戏、视频)的基准上,大 幅度领先同类 ...