Workflow
8.9ms,推理速度新记录!1块钱百万token,浪潮信息AI服务器加速智能体产业化
LCXXLCXX(SZ:000977) 量子位·2025-09-29 04:57

克雷西 henry 发自 凹非寺 量子位 | 公众号 QbitAI 一百万Token的输出推理成本,只要一块钱了。 今年的人工智能计算大会上,浪潮信息发布了超扩展AI服务器元脑HC1000,把AI推理成本狠狠地打了下来。 与此同时,浪潮信息还推出另一杀手锏——元脑SD200超节点,也将DeepSeek-R1的Token生成时间打到了毫秒量级。 △ 浪潮信息首席AI战略官刘军 随着AI竞赛进入智能体产业化阶段,能力、速度和成本成为了决胜的核心三要素。 元脑SD200和元脑HC1000,将为多智能体协同与复杂任务推理的规模化落地,提供高速度、低成本的算力基础设施。 DeepSeek-R1推理进入10ms时代 首先来看 元脑SD200 超节点AI服务器。 特别是在速度上,元脑SD200率先将大模型端到端推理延迟控制在了10ms以内。 实测中,元脑SD200在运行DeepSeek-R1时,TPOT(每Token输出时间)仅有 8.9ms ,领先了前SOTA(15ms)近一倍,还使 DeepSeek-R1 671B的推理性能实现了最高16.3倍的 超线性扩展率 。 它可以在单机内同时运行DeepSeek-R1、Kimi ...