手机里的AI为什么还是不够聪明:端侧大模型的算力与内存之困
2026年的手机圈,几乎在同一时间集体喊出了同一个口号:AI。谷歌Pixel 11带着Tensor G6登场,荣耀掏出会转头的Robot Phone,苹果也被确认将用上首款台积电2nm的A20 Pro。芯片参数一个比一个漂亮,NPU算力翻倍、端侧推理快了几倍。可真把这些机器拿到手里,不少人的第一反应却是:这AI,怎么还是有点笨?
问题不在算力,至少不全在算力。过去衡量手机AI能力,大家习惯看TOPS(每秒万亿次操作),仿佛数字越大越聪明。但今年芯片设计的一个明显转向是:NPU正在从通用推理加速器,变成专为Transformer和MoE架构定制的处理器。苹果在A19 Pro的GPU里塞进AI加速器,让GPU、矩阵单元、神经网络引擎三路并行;谷歌Tensor G6为矩阵运算深度优化。算力确实上来了,可用户感知到的快,往往卡在另一个地方。
这个被忽视的瓶颈叫内存带宽。大模型生成文字靠的是自回归解码——每吐出一个字,都要从头到尾把整个模型的权重读一遍。以一个70亿参数、FP16精度约14GB的模型为例,在LPDDR5X约85GB/s的带宽下,纯靠带宽算出的理论速度上限只有每秒5个token左右。换句话说,芯片再能算,数据喂不进来,模型也只能干瞪眼。这也是为什么有人拿中端机跑个小模型,等一个回答要两三分钟,App直接冻死。
更麻烦的是成本。端侧AI想流畅,就得堆内存带宽,而内存正在变贵。行业数据显示,iPhone 18系列的256GB版本,内存占整机物料成本的比例,正从2025年的约10%爬升到2027年上半年的40%以上;LPDDR6标准虽已发布,但量产受高内存价格和先进制程产能制约。于是出现一个略显讽刺的局面:手机算力竞赛重启,价格却短期降不下来,AI手机想降价还得等LPDDR6真正铺开、内存市场冷却。
所以当下最务实的判断是:端侧能跑通的是小模型(比如每秒30 token的3B模型),真正的大模型推理仍离不开云端。很多人新鲜感一过,第一件事就是去设置里关掉大部分端侧AI功能,不是不爱AI,是硬件还没跟上想象力。等到模型压缩更狠、内存带宽更宽、Agentic OS把任务串联起来,手机才会从被动应答的工具变成主动办事的终端。在那之前,别被发布会上的参数晃花了眼——慢一点,反而清醒。
科技 2026-08-18 13:42:47 通过 菜菜虫 浏览(9)
共有0条评论!