进入AI推理时代,一个核心的问题是AI如何大规模落地?这就不可避免地要回答云端AI和端侧AI的协同问题。

“如果完全依赖云端,它或许能成为极其强大的生产力工具,但很难成为一个有温度、真正理解个人的AI智能体。”高通公司产品技术专家朱元堃说。

高通公司产品技术专家朱元堃

这句话点出了端侧AI最核心的价值,也划开了生产力工具与个人AI之间的边界。

云端模型拥有强大的算力和丰富的公共知识,可以快速回答问题、生成内容、完成复杂任务。但一个真正理解用户的个人AI,还需要知道这个人是谁、身处什么环境、过去做过什么以及此刻想要什么。

这些信息不在云端,而在离用户最近的手机、PC、智能眼镜和可穿戴设备里。

近日,在财新圆桌-AI系列“智能体时代终端产业的下一站”活动上,由高通公司委托,全球著名信息技术与消费科技咨询顾问公司IDC独立开展研究的《从AI设备到个人AI:智能体驱动的终端进化与产业重构》白皮书正式发布。IDC将当前的产业变化称为“AI超级大周期”。

IDC中国副总裁王吉平

IDC中国副总裁王吉平表示,今年手机市场预计下滑约13%,PC市场预计下滑约11%。传统终端市场承压的同时,智能眼镜、Mini PC、录音卡等新型终端正在增长。

王吉平认为,终端产业的增长逻辑也正在改变。过去的AI for device,是在手机、PC等既有设备上增加图片处理、文档总结等单点功能;AI for user则要以智能体为核心,围绕同一个用户调度不同终端和算力。

“个人AI是以智能体为核心运行载体、以用户为中心展开运行的智能系统。”王吉平说。终端产业也将从单一设备的智能化,转向分布式的端、边、云协同,竞争维度则从硬件参数进一步扩展到软硬件与AI服务的一体化能力。

当越来越多终端拥有数十TOPS算力,真正的个人AI为什么依然没有出现?

核心要跨过三道坎,从“能算”到“懂你”,从“跑起来”到“一直在线”,再从设备互联走向智能体围绕用户自由流转。

云端让AI更强,端侧让AI真正懂你

过去几年,行业谈论端侧AI,通常指在手机或者PC上运行一个本地模型。模型可以完成图片处理、文本总结或文档生成,这只是AI for device——设备增加了AI功能,并不意味着它已经成为个人AI。

个人AI的核心差异是“上下文”。

朱元堃指出,完整的智能体体验包含感知、记忆、推理和工具执行四个部分。终端通过摄像头、麦克风和各类传感器感知周围环境,把长期信息沉淀为个人记忆,再基于当下情境理解用户意图,最终调用应用、设备或云端服务完成任务。

感知与记忆,是云端最难独立完成的两个环节。云端可以拥有比终端更大的模型,却无法天然获得最实时、最连续的个人信息。完全依赖云端的AI可以成为强大的通用工具,但很难形成对某一个人的长期理解。

因此,端侧AI也不是云端AI的缩小版。

云端面对的是大量用户提交的复杂计算任务,端侧主要服务于单个用户。云端擅长调用大模型和公共知识,端侧负责实时感知、个人记忆与隐私数据。二者不是相互替代,而是根据任务、成本、时延和隐私要求动态分工。

“用户最终在意的并不一定是绝对最快的答案,而是最符合自己需求的答案。即使响应时间稍长,用户也愿意等,因为它真正懂我。”朱元堃说。

这也是“有温度”背后的技术含义:AI不仅能给出正确答案,还要结合个人历史和当前情境,给出适合这个用户的答案。

但要让终端持续理解用户,仅有大模型和更高算力并不够。

端侧AI比TOPS更棘手的,是内存和续航

TOPS曾经是端侧AI芯片最醒目的标签。

随着NPU算力不断提升,单一峰值指标已经越来越难解释真实体验。那端侧AI是否仍应主要看TOPS?朱元堃表示,“算力依然是芯片选型的重要参考,但算力是基础,不是唯一标准。”

相比单项算力,高通更关注AI Benchmark的综合表现,包括首字时间、解码速度、内存占用和模型精度。只有硬件算力,没有软件、内存与系统协同,峰值TOPS很难转化为稳定的用户体验。

更深层的变化在于,端侧智能体面对的工作负载已经不同。

云端推理通常从接收明确任务开始,持续执行到任务完成。个人智能体则大部分时间处于感知状态,推理占比次之,真正执行复杂任务的时间更少。它需要长期在线,却不能让摄像头、麦克风和模型持续唤醒CPU与系统内存。

这让低功耗感知成为端侧智能体的第一道工程难题。

骁龙移动平台的传感器中枢(Sensing Hub)正是为了应对数十毫安、甚至个位数毫安的应用场景,它从架构设计上专注于超长续航和超低能耗的技术特征,从而能够完成用户场景的有效感知和识别。

传感器中枢以Micro NPU、始终感知ISP、DSP和独立内存处理低功耗感知;CPU负责系统调度;Hexagon NPU承担主要AI推理;调制解调器在需要时调用边缘和云端能力。

这套异构架构的目标不是让所有计算单元同时达到最高性能,而是根据不同负载,把任务放在能效最合适的单元上。

即便如此,端侧最先撞上的仍然是内存墙。

“端侧智能体的主要问题其实还是内存和续航的限制,而非性能的限制。”朱元堃对雷峰网表示。

一方面,模型参数、个人记忆和上下文都需要占用内存,终端又受到物理尺寸与成本限制;另一方面,端侧模型在解码阶段需要反复读取权重,内存带宽直接影响词元生成速度。

高通正在探索3D内存堆叠等技术路径。即使不考虑全新的内存架构,从LPDDR5X升级至LPDDR6,理论内存带宽也可以提升约50%。这意味着,当端侧NPU算力继续增长,内存带宽能否同步提升,将越来越直接地决定算力利用率。

另外,云端通过预填充与解码分离,也就是PD分离,提高集群资源利用率,这并不适用于端侧。朱元堃指出,端侧预填充通常完成较快,解码阶段更容易受内存带宽限制,云端的资源调度方法不能被原样照搬。

峰值算力决定智能体能做什么,内存与功耗决定它能否每天持续工作。

设备互联不难,难的是让个人记忆安全流转

如果个人AI只有一台设备,它对用户的理解依然是片面的。

手机知道用户的位置和通信习惯,PC记录工作流程,眼镜看到用户眼前的世界,耳机和手表则掌握声音、运动与健康信息。设备越多,智能体获得的上下文越完整。

这也是高通提出“所有设备都将成为智能体端点”的原因。基于统一的底层技术架构和AI软件栈,模型和应用可以在手机、PC、汽车、眼镜等不同终端之间迁移,再根据各设备的性能、功耗、内存和时延做出取舍。

跨终端覆盖,正是高通成为个人AI时代领导力的关键。

王吉平表示:“高通的一大优势在于支持大量端侧设备,不仅是手机,还有智能眼镜、物联网设备等。广泛的端侧设备基础,正是未来边缘侧发展的核心。”

与苹果、谷歌通过操作系统和模型构建纵向生态不同,高通是一条横向平台路线。从Oryon CPU、Adreno GPU、Hexagon NPU和传感器中枢,到连接能力与统一AI软件栈,高通为不同品牌、不同形态的终端提供一套共同的计算底座。

如果个人AI的终局是一套围绕用户运行的分布式系统,竞争力就不再来自一颗NPU的峰值算力,而是能否同时提供计算、感知、连接和跨终端部署能力。以此衡量,高通已经是个人AI底层计算平台的领导者之一。

技术上的连接并非最难的一步。

“跨设备协同本质上并不是一个技术问题,而是一个产业协同和生态共建的问题。”朱元堃说。通信产业有3GPP统一标准,不同厂商可以按照共同标准研发;AI产业仍处于探索阶段,跨品牌、跨操作系统和跨模型的协同规则尚未形成。

海外市场中,谷歌同时掌握Gemini和Android,苹果也能在自己的软硬件生态内推动AI能力。国内市场则有不同的手机品牌、操作系统和模型供应商,背后是更加复杂的利益链。

个人AI强调以用户为中心,今天的终端生态却仍然以厂商账号、操作系统和品牌边界为中心。

谁拥有用户的长期记忆?谁决定哪些上下文可以在不同设备之间流转?用户更换手机品牌后,个人智能体能否继续认识他?模型厂商、OEM、操作系统和芯片平台,谁会掌握个人AI最重要的入口?

这些问题比连接协议更难回答。

“有温度”也存在另一面。个人AI越想理解用户,就越需要持续感知摄像头、麦克风、位置和行为信息,这些恰好也是最敏感的个人数据。

“从用户买单的角度来看,交互能力是最关键的,也就是全感知的交互体验,这是用户当下最迫切的需求。而最大的短板,我认为是安全问题。”王吉平说。

全时感知既是个人AI区别于传统AI应用的核心价值,也是产业必须跨过的信任门槛。端侧计算能够减少敏感数据上传云端,却不等于自动解决了隐私问题。如果用户无法控制设备记住什么、调用什么以及向谁共享,持续感知就可能从个性化能力变成新的风险源。

芯片算力让个人AI具备了运行的可能,低功耗感知、内存与软件协同决定它能否持续工作,跨设备生态和数据权利则决定它最终属于厂商,还是属于用户。

真正的个人AI,不是知道用户越多越好,而是用户能够决定它知道什么、记住什么,以及把什么交给云端。