阿里云发布全新多模态交互开发套件 可应用于AI眼镜、机器人等
据阿里云公众号消息,在阿里云通义智能硬件展上,阿里云全新发布多模态交互开发套件。该套件集成 了千问、万相、百聆三款通义基础大模型,并预置十多款生活休闲、工作效率等领域的Agent和MCP工 具,除了能听、会看,还能思考并且与物理世界交互,可应用于AI眼镜、学习机、陪伴玩具、智能机 器人等硬件设备。 该套件还接入了阿里云百炼平台生态,用户不仅可以添加其他开发者提供的MCP和Agent模板,还能通 过A2A协议兼容三方Agent,极大程度地扩展了应用的能力边界,帮助企业灵活搭建业务场景。 现场,阿里云还展示了面向智能穿戴设备、陪伴机器人、具身智能等领域的解决方案。例如,在AI眼 镜领域,基于千问VL、百聆CosyVoice等模型,阿里云打造了感知层、规划层、执行层以及长期记忆的 完整交互链路,可一站式实现同声传译、拍照翻译、多模态备忘录、录音转写功能。 此外,该套件预置十多款MCP工具和Agent,覆盖生活、工作、娱乐、教育等多个场景。例如,基于预 置的出行规划Agent,用户可直接调用路线规划、旅行攻略、吃喝玩乐探索等能力。 在芯片层面,该套件适配了30多款主流ARM、RISC-V和MIPS架构终端芯片平台,满 ...