云端装不下的野心,正在转向终端
-
17小时前
牛透社

7月19日,WAIC 2026期间,面壁智能在上海举办端侧AI创新与行业发展论坛。现场发布的《端侧智能2026——规模化落地元年》报告,将2026年定义为端侧智能从概念验证走向规模化应用的产业拐点。
围绕这一判断,面壁智能在现场集中发布了一系列产品与产业合作进展。公司推出MiniCPM5-2B端侧文本模型和全新VLA具身模型,并公布 AI for AI 标准、开发者生态计划、汽车AIBox、CPM for Legal、具身智能解决方案及AgentVerse行业方案。产品横跨模型、训练工具、硬件、智能体平台和行业应用,覆盖手机、汽车、机器人、法律、园区和工业等场景。
当大模型进入这些场景,过去以参数规模、榜单成绩和通用能力为主的评价体系开始失效了。因为终端设备的内存、功耗和散热空间有限,芯片架构高度分散,产品生命周期又远长于模型迭代周期。一个模型即使能力足够,也可能因为运行速度、适配成本、车规验证或供应链问题,最终无法进入量产。
端侧AI的竞争门槛也随之抬高。传统模型公司需要在压缩模型之后再解决适配芯片,软硬件协同、开发工具、行业数据和规模交付等关卡。即使模型被压的足够小,也只解决“能不能装进去”的问题;能否进入真实设备和业务流程,并在几十万乃至上百万台终端上长期稳定运行,才真正决定一家公司的竞争地位。
面壁智能CEO李大海在采访中用“端侧主内,云端主外”概括端云分工,并进一步明确了公司作为端侧AI基础设施提供者的定位。模型、智能体、行业解决方案、开发者生态,构成了这一定位的具体支撑。

面壁智能CEO 李大海
这一定位也开始在客户和资本两端得到验证。近日,三星选择面壁智能作为端侧模型合作方;另据媒体报道,面壁智能2026年上半年累计融资超过50亿元,估值超过200亿元,本轮融资引入国新基金、中网投等国家级产业基金,多重国资与产业资本加注,充分印证市场对其端侧全栈路线的高度认可。
对一家2022年孵化于清华大学NLP实验室的模型公司来说,这些变化也在重新划定它的竞争边界。面壁需要回答的,不再只是如何训练出更高密度的大模型,还包括如何穿过芯片、硬件、供应链和行业交付之间的层层接口。
这也是端侧AI走向规模化必须回答的问题:
当模型离开云端、进入真实设备和生产现场,竞争的核心究竟是模型能力,还是一套贯穿模型、芯片、硬件、开发生态和行业交付的全栈体系?
01端侧模型开始争夺每一寸算力
云端大模型可以不断增加参数和算力,终端却受制于内存、功耗、散热,以及不同芯片、计算架构和软件栈。模型太大,设备装不下;功耗太高,续航和发热难以控制;响应太慢,实时交互也很难成立。

在有限空间里,装下更强智能
面壁智能CTO曾国洋此前接受媒体采访时直言:“如果模型太大,跑不动就是跑不动,补贴钱没用;功耗太高会发热,你不可能补贴一个冰块。”
因此,端侧模型很难沿用云端大模型的竞争方式。能力强不强依然重要,但还要看这些能力消耗了多少参数、内存和算力。同样的硬件条件下,模型的知识密度越高、运行效率越高,留给操作系统、传感器和其他应用的资源就越多,整机成本也更容易控制。
面壁智能所说的“知识密度”,指的正是单位参数和单位资源能够承载多少有效智能。它并非单纯追求把模型做密,是希望在浓缩的同时,尽量保留推理、知识、代码和智能体等能力。对端侧产品来说,这种比例往往比模型的绝对规模更重要。
MiniCPM过去两年的演进,基本围绕这条路线展开。2024年2月,面壁智能首次开源2B规模的MiniCPM,尝试证明轻量化模型也可以达到可用水平。此后,MiniCPM逐步扩展到文本、多模态、语音和具身智能,并开始进入汽车和智能硬件。截至2026年6月底,系列模型累计下载量超过3800万次,已搭载于吉利银河M9、长安马自达EZ-60等车型。
开源下载量反映关注度,终端搭载才是真正的检验。模型能否在既定芯片、功耗和成本下运行,比榜单上的几分之差更重要。
论坛上发布的MiniCPM5-2B延续了这一路线。同系列此前开源的1B版本只有10亿参数,INT4量化后体积约0.5GB,可以部署在手机、平板、电脑和车机上。按照面壁公布的数据,这款模型在AA榜单中获得17.9分,达到这一水平所使用的输出Token约为1500万,部分能力相近的大尺寸模型则需要超过2.68亿输出Token。
这组数据所反映的,不只是训练效率。训练成本越低,模型迭代和适配的速度越快;量化后对存储和内存的占用越少,也越容易进入现有终端。这些技术指标最终会影响芯片选型、响应速度、续航和整机成本。
李大海在采访中给出了一个更直观的参照。按照面壁的评测口径,1B、2B规模的MiniCPM模型,已经可以在部分任务上达到两年前GPT-4o的能力水平。不同模型很难脱离具体任务和评测方法直接比较,但这个变化本身值得注意,过去只能由更大模型完成的一部分任务,正在被压缩进更小的参数空间。
面壁智能总裁雷升涛提到,一家合作伙伴曾用20多亿参数的Dense模型完成产品原型,但模型在可接受成本的硬件上运行太慢,迟迟无法投产。换用知识密度更高、运行效率更好的模型后,能力和速度达到要求,产品才得以上市。
原型验证可以依靠额外算力,量产却会受很多因素约束。模型少占一些内存、降低一点功耗、缩短一些延迟,都可能影响产品能否落地。知识密度因此不只是模型指标,也关系到产品能否成立。
面壁智能与清华大学团队此前提出“密度定律”,认为开源大模型的最高能力密度约每3.5个月翻一番,同等智能所需的参数规模会持续下降。李大海将其称为面壁的“第一性原理”。面壁选择端侧路线,很大程度上建立在这个判断之上。李大海称,未来模型能力还会继续提高,但承载这些能力所需的参数、算力和能耗会不断下降。
在李大海的设想中,端侧模型最终要在远低于30瓦的功耗下,形成接近甚至超过普通人的智能水平。这仍是一个长期目标,但它解释了面壁为什么从文本模型一路扩展到视觉、语音、全模态和具身智能。几条产品线看似分散,但底层方向相同,都是把更多能力压缩进有限的计算资源,再送入不同类型的终端。
此次展示的MiniCPM-V 4.6、MiniCPM-o 4.5和VoxCPM2,分别覆盖视觉、全模态和语音。相比文本模型,它们要处理更多图像、声音和环境信息,对内存、带宽和响应速度要求更高。模型压缩得够不够、响应快不快、能否适配不同手机和车载平台,都会直接影响部署成本和使用体验。
模型变小,只解决了“装得进去”的问题。手机、汽车和机器人采用的芯片与软件环境不同,同一模型可能需要分别适配。面壁的ARK推理框架,就是为了缩短这一步。
端侧模型的竞争因此有两层,即先把更多能力融入知识密度更高的模型,再让它在不同设备上稳定运行。终端厂商最终关心的是能否装进去,跑得够不够快,功耗能能否控制,以及成本能否支撑量产。
02 VLA具身模型发布,AI进入真实世界
面壁智能在论坛上发布的全新VLA具身模型,将端侧AI进一步带入机器人和物理世界。
过去的大模型主要处理写作、搜索、问答等数字任务,机器人则要在真实环境中感知周围、规划动作、执行任务,并在失败后及时调整。
这类任务很难完全依赖云端。因为展馆、园区、工厂和仓储的网络未必稳定,部分视频和业务数据也不适合上传。况且,机器人操作还要求实时响应,延迟不仅影响效率,在一些场景中还关系到安全。

云端提供外部能力,端侧完成实时感知、本地判断与现场执行
面壁智能此前已发布MiniCPM-Robot,这是一款1.5B参数端侧VLA模型。VLA即Vision-Language-Action,从多模态理解模型出发,融入与真实世界交互的能力。面壁智能采取了一条"从面到点"的反向路径,以通用智能为起点,让机器人直接处理普适、长程、流水线式任务,而非先锁定单一场景做专用Skill再扩展。两年半的MiniCPM-V/O多模态积累,让MiniCPM-Robot具备高效的视觉Token压缩能力,在保留完整历史观测记忆的同时,计算量与不保留记忆时持平。
此次发布的VLA具身模型延续了这一路线。通过压缩视觉Token,机器人在长程任务中可以保留完整的历史观察,用于后续判断,同时不会明显增加计算开销。
雷升涛将面壁选择具身智能的标准概括为三点:场景是否真正需要端侧,方案能否规模复制,产品能否形成商业闭环。园区和仓储网络不稳定,部分数据不宜上传;相比一次性交付项目,面壁更看重可复制的产品;模型装进设备后,也要给用户带来愿意付费的价值。具身智能同时符合这三个条件。
WAIC期间,面壁智能联合乐聚机器人展示了展厅导览和园区巡检Agent。导览机器人可在无网环境下完成讲解、问答、环境理解、路线规划和避障;巡检方案结合多模态模型与CV模型,可识别30余种异常,检测成功率超过95%,敏感数据留在本地处理。
进入企业现场后,机器人还要完成一连串连续任务,并能在某个环节出错时及时重试和恢复。面壁为此推出RoboHarness框架,负责统一调度VLA模型、导航系统等模块,管理长程任务中的上下文和记忆。
在与吉利汽车的合作中,双方围绕生产仓储场景共同训练VLA模型,将多模态模型、机器人本体和导航系统接入RoboHarness,推动具身智能进入实际生产流程。
机器人进入真实生产场景后,稳定运行、失败恢复和持续迭代都成为硬性指标,端侧模型也由单一功能模块逐渐进入企业生产系统。
03 从“AI for AI”标准到开发者生态,端侧AI补基础设施
端侧AI规模化落地,还有一个经常被忽略的问题,那就是模型如何真正被企业和开发者使用。
在云端,大模型通常以API或私有化部署方式提供服务。到了端侧,不同设备采用不同芯片平台,对应不同软件栈、量化方案和推理优化路径,同一个模型进入手机、汽车、机器人和工业设备,需要分别处理部署和适配。
论坛上,面壁智能与中国信息通信研究院人工智能所联合启动《AI For AI标准》并做前瞻发布。“AI for AI”是指用AI参与模型训练、代码开发、系统优化和应用构建,提升AI系统本身的开发效率。

补齐基础设施,模型才能跑向更多终端
该标准将AI参与模型研发的程度分为五级,从L1提示建议、L2辅助研发,到L3自主生产、L4自我改进,再到L5协同演化,面壁深度参与标准制定。
这套标准要解决三个问题,即能力分级是否可对齐,信任判断是否可传递,评测判据是否可验证。从更长的技术周期看,AI for AI是Scaling Law之后的"二级火箭",当算力和电力成为一级火箭的天花板,提升智能转换效率成为新的增长变量。
面壁在中国的训练实践中,模型工程效率提升了100倍。
ForgeTrain训练框架是这一方向的落地。它是全球首个完全由AI编写、零人类代码介入的生产级大模型训练框架,在英伟达H100上训练速度超过英伟达自研的Megatron框架10%,在华为昇腾系列上已完整跑通预训练流程。
面壁使用ForgeTrain在昇腾芯片上完成MiniCPM5-1B预训练,该模型在AA榜单位列2B规模以下第一。BitCPM-CANN是中国首个基于昇腾训练的1.58-bit端侧大模型,包含0.5B到8B四个尺寸,相比传统BF16精度,推理阶段释放约6倍显存红利,模型能力保留率维持在90%到97.2%,意味着同样的设备内存可以承载远超以往的模型能力。
标准和工具之外,端侧AI还需要开发者生态。论坛上,面壁联合开源社区OpenBMB启动"全球开发者大使计划"和"MiniCPM火种计划",面向开发者开放资源。上海期智研究院、光速进化等开发者代表分享了在智能眼镜、智能家庭领域的成果。
松果派是面壁推出的端侧AI原生开发硬件,集成多模态硬件、MiniCPM系列模型和Agent运行环境,开发者可通过自然语言指令直接驱动硬件功能开发,支持全链路离线运行。
PilotDeck是面壁联合清华大学THUNLP实验室、OpenBMB和AI9stars在5月开源的智能体操作系统,以"WorkSpace"为核心设计,可同时操作多个互不干扰的任务,支持AI智能体24小时在线工作。AgentVerse则面向智能体开发和协作,端侧模型加入后可在本地设备上承担实时和隐私敏感任务。
面向行业伙伴,面壁同步推出了“面壁+行业伙伴计划”。面壁提供基础模型、AgentVerse平台、私有化部署、算力和商业化渠道,合作伙伴则带来行业认知、业务规则、私有数据、应用场景和客户资源。
论坛现场,来自政务、财务、教育、风控等领域的八位合作伙伴分享了落地成果。雷升涛在采访中提到,客户现在更关心论文中的技术细节和具体落地周期,而不再只是了解模型和公司。
在他看来,面壁也正从单纯的技术提供者,转向端侧AI生态的建设者。客户问题的变化,反映出端侧AI正在从技术展示走向实际部署。
04 AIBox首发,模型公司进入汽车量产体系
机器人验证了端侧AI进入物理世界的可能性,汽车则是端侧智能规模化交付最重要的入口。
论坛上,长安汽车与面壁智能完成战略合作签约,汽车行业共研AIBox正式首发。三方角色清晰,长安以前瞻EE架构开放整车生态接口,英特尔提供面向大模型优化的芯片底座,面壁将SuperMate 2.0部署其中,注入深度记忆、情景理解和主动行动能力。
英特尔副总裁、端侧计算和物理AI事业部中国区总经理高嵩现场致辞并与面壁签署合作备忘录,合作从车载拓展到家居领域。目前方案已在长安马自达EZ-60等多款车型落地,目标年底助力30万辆量产车搭载。
端侧智能上车面临一个现实矛盾,即车机SoC从选型到量产通常需要两三年,大模型却每三四个月就会迭代一轮。传统座舱架构很难跟上模型更新速度。
AIBox试图用独立算力模块解决这一问题。它不依赖原有座舱SoC,可以独立升级和扩展,为车载大模型提供本地算力,兼顾低延迟与数据隐私。未来,这套方案还计划从汽车延伸到PC和家居等终端。

AIBox,连接两种速度
面壁目前已完成5款主流座舱芯片的量产级适配,并在6款AIBox平台上推进商业化,验证了68个可量产场景。
但从产业落地看,车载AI仍面临一个现实问题,即如何从语音助手升级,走向真正有价值的智能交互。
面壁智能相关负责人认为,汽车座舱正在从屏幕操作转向主动的全模态交互。座舱通过声音、图像和车内环境理解用户需求,主动提供服务,不再依赖用户反复唤醒。
这类持续感知和本地推理,对延迟、隐私和算力都有较高要求,也是AIBox需要独立算力的原因。李大海将端云分工概括为“端侧主内,云端主外”,也就是说,端侧掌握用户状态、场景和隐私信息,负责理解需求;云端补充外部知识和复杂能力。
30万辆交付本身也是一场压力测试。面壁智能副总裁周树峰在牛透社的采访中谈到,最容易被外界低估的是算法和芯片的融合。今天95%以上的汽车座舱没有办法直接运行任何大模型,必须采用激进的技术策略让模型快速部署,同时还要兼容座舱平台其他应用和传统算法占用的算力与存储带宽资源。
进入汽车领域后,大模型厂商还要跨过芯片适配、整车集成、车规验证和长期交付等环节。商业模式也从一次性交付,逐步转向License授权、订阅收费和按效果付费。
05 从行业方案到全栈布局,端侧AI开启体系化竞争
此外,面壁智能还发布了CPM for Legal、具身智能解决方案和AgentVerse行业方案,分别面向法律服务、机器人和企业智能体应用,探索端侧AI进入行业、融入业务流程的具体路径。
CPM for Legal 是面壁推出的首款专业法律服务基础设施级产品,由面壁与法信数智、竞天公诚联合打造,将大模型与智能体能力嵌入法律业务的具体流程。该业务由副总裁舒怡牵头,面壁也由此开始围绕行业落地,搭建专门的业务团队与交付体系。
具身智能解决方案则将MiniCPM-Robot、RoboHarness与机器人本体、导航系统连接起来,形成完整方案。这一方案已在吉利汽车的生产仓储场景,以及乐聚机器人的导览、巡检场景中得到验证。AgentVerse主要服务企业智能体应用,端侧模型可以在本地承担实时响应和隐私敏感任务。
这套行业拓展路径,需要依靠合作伙伴补足行业能力。面壁提供基础模型、AgentVerse平台、私有化部署和商业化渠道,合作伙伴则带来行业知识、业务规则、私有数据和客户场景。
李大海将“行业认知与端侧 AI 的结合”视为护城河。雷升涛则将面壁定位为技术使能者,由面壁提供模型及智能体的感知、决策和执行能力,合作伙伴补充行业知识、业务规则与客户场景。
目前,面壁已进入航天、工业、民航、医疗和家居等领域。围绕这些场景,面壁正在搭建覆盖模型、训练工具、AIBox、Agent 平台和行业方案的端侧 AI 体系。

从模型到交付,形成完整链路
手机、汽车、机器人和工业设备的芯片与软件环境各不相同,模型进入终端后,还要解决适配、部署和交付问题。
这也在改变大模型公司的竞争方式。模型能力仍是基础,但真正拉开差距的,是能否把技术做成产品,嵌入设备和业务流程,并实现规模化交付。
端侧AI也许不会取代云端,更现实的分工是,云端负责复杂计算和知识供给,端侧承担实时感知、本地决策和现场执行。竞争重心也将从模型榜单转向真实终端。芯片能否适配,设备能否稳定运行,方案能否批量复制,决定了技术最终能走多远。模型跑分只能证明能力,规模交付才能建立壁垒。
-
本文作者:牛透社
责任编辑:Alex
本文来源:牛透社
-
分享到: