作者丨胡世鑫
编辑丨叶锦言
出品丨深网·腾讯新闻小满工作室
大模型开始进入更多终端设备。Gartner预计,2026年全球AI PC出货量将达到1.43亿台,在PC市场中的占比约55%;Counterpoint预计,2025年GenAI手机出货量将超过4亿部,占全球智能手机市场约三分之一。
手机、汽车、机器人和各类智能硬件厂商都在尝试把AI能力放到本地设备上,但随之出现的问题也更具体:模型不能只是变小,还要在有限算力、功耗和内存带宽下保持可用。
6月12日,在2026北京智源大会期间,面壁智能CEO李大海和其团队AI Infra负责人李宇轩就端侧模型等问题分享了观点。
李大海认为,端侧模型当前最大的制约不在模型能力本身,而在于需要和芯片、内存和带宽等共建良性生态。云端模型可以依赖集中算力做更大规模训练和推理,但落地到终端设备时,要面对电池、散热、体积和延迟限制,模型设计方式也会不同。
面壁智能提出的关键词是“密度定律”,即在更小参数规模内尽可能保留模型能力。其近期发布的MiniCPM5-1B只有10亿参数。李大海称,有社区研究者将MiniCPM5-1B与GPT-4o早期版本在AA-Index上的得分作了对比,二者分差已经较小。
不过,模型得分并不等于用户马上能感知到变化。端侧AI要进入具体产品,还需要硬件条件和应用场景配合。李大海提到,目前有一批国产存算一体端侧AI芯片正在流片,如果这些芯片在功耗、算力和带宽上满足需求,端侧应用会有更多展开。
按集微咨询发布的报告援引弗若斯特沙利文数据,全球智能设备AI SoC市场规模2025年为450亿美元,预计2030年达到1438亿美元。这也是端侧AI讨论中,芯片端进展被反复提及的原因之一。
国产算力适配是李宇轩负责的重点。他介绍,面壁智能已在华为昇腾完成1.58bit极低位宽量化感知训练,效率达到标准精度的95%以上;剩余损耗主要来自量化器开销。这并不是华为平台与英伟达平台之间的横向比较,而是指在华为平台上,极低位宽量化训练相较普通训练的效率表现。
李宇轩还提到,训练对精度的要求高于推理,一张卡如果只验证过推理,进入训练环节仍可能遇到精度问题。面壁智能的做法是先用小模型在国产卡上做“模型风洞”测试,完成评测和对齐后,再推进大规模训练。
李大海对国产芯片生态的判断更直接。他表示,目前国产芯片的软件生态完善度仍有很大发展空间,我们需要持续共建,现阶段,模型公司不能像在英伟达集群上那样完全自主完成算子开发和训练适配,需要和芯片公司深度配合。面壁智能也参与了智源研究院主导的FlagOS国产软件生态建设。
谈到端云关系,李大海用云游戏的失败做类比。过去不少公司尝试把游戏渲染放到云端,但云游戏长期不温不火,一个重要原因是用户对交互延迟和帧率稳定性要求高。类似地,手机智能体、车内控制和设备交互这类场景,对实时性和稳定性要求更高,更适合在端侧完成。
他认为,端侧不是替代云端,而是重新划分任务边界。上下文管理、高频交互、隐私敏感和低延迟任务更适合放在本地,更复杂的推理和重任务仍可以交给云端。
落地层面,面壁智能端侧模型已在吉利银河M9智能座舱量产上车。李大海称,相关功能并非默认开启,需要用户主动打开,车厂反馈显示主动打开比例较高。此外,面壁智能也在手机、无人机、潜水器等终端上推进部署。
李大海还提到一个远期方向:端侧AI可能走向“模型即芯片”,即模型公司生产与自身模型深度匹配的芯片。但他也表示,这还有很长的路要走。模型迭代可以很快,芯片流片背后仍有大量工作难以被AI自动化替代。
面壁智能成立于2022年,核心团队来自清华大学NLP实验室。今年一季度,公司完成两轮融资,累计融资规模超10亿元人民币。