OCR
Search documents
“扫描识字”便宜200倍,DeepSeek革了Adobe们的命
Guan Cha Zhe Wang· 2026-01-28 09:46
当开年以来AI界都在讨论智能体和AI员工的话题时,DeepSeek在1月27日悄无声息地发布了一项看似"无聊"的更新——DeepSeek-OCR2。 作为2025年10月20日DeepSeek-OCR1发布后时隔三个月的最新更新,尽管看似并不如传说中的V4让人期待,但是DeepSeek-OCR2的公布可能直接敲响了 OCR(文档识别)这个千亿级市场的丧钟。 过去十年,OCR一直是一门隐秘而暴利的生意。从Adobe的PDF编辑器,到扫描全能王的会员费,再到亚马逊AWS Textract昂贵的API调用,无数公司靠 着"教机器认字"赚取了丰厚的利润。 这种模式的死穴在于"不懂逻辑"。遇到报纸的跨栏排版,它会把两篇无关的文章拼在一起;面对扭曲的发票,就找不到对齐线;对于密集的小字财报,只 能看到模糊化的文本。 而DeepSeek-OCR2引入了"视觉因果流"的概念。在DeepEncoder-V2中,研究团队用一种类语言模型结构替代了原先基于CLIP的视觉编码模块,并在编码器 内部引入可学习的"因果流查询token"。 其编码器同时包含双向注意力与因果注意力两种处理模式,原始视觉信息通过双向注意力进行全局感知,而新增 ...