高通CEO:2028年手机将全天跑千亿参数大模型
当旗舰手机的内存还在 16GB 上下徘徊时,高通 CEO 克里斯蒂亚诺·安蒙(Cristiano Amon)已经把目光投向了 2028 年。在 10 月 8 日接受科技播客 Fireside Alpha 访谈时(片段于 10 月 10 日公开),安蒙透露:多家走在 AI 前沿的公司正在要求高通,交付能够“全天、每天”持续运行千亿参数大模型的智能手机——而且,已经有公司在造这样的手机了。
事件:AI 公司向高通下了“千亿参数”订单
在这次访谈中,安蒙表示他“要小心,不能透露名字,但一些 AI 公司——一些走在 AI 前沿的公司——正在……”打造这样的手机。他没有点名具体是哪家公司,但确认需求是真实存在的。
时间表定在 2028 年。目标并不是“偶尔跑一次大模型”,而是让 100B 参数模型常驻、全天持续运行——这意味着模型要一直待在内存里,在后台持续推理,而不是加载一次就卸载。
对照当下高通的端侧能力:最新旗舰平台骁龙 8 Elite Gen 6 与 8 Elite Extreme Gen 6(2nm 工艺),其中 Extreme 版的 Hexagon NPU 搭载全新 Element Accelerator 和更大的共享内存池,可在端侧运行 300 亿参数以上的 MoE(混合专家)模型,上下文窗口约 3.2 万 token。100B 的目标,是当下能力的三倍以上。
他描绘的使用场景是 Agentic AI(智能体):软件不再等你打开 App 输入指令,而是替你看、替你推理、替你行动。这样的系统必须常驻内存、全天在后台做推理,还不能让手机午饭前就发烫、下午三点就没电。
背景:内存是挡在前面的一道墙
先算一笔账
即使经过 4-bit 量化,1000 亿参数模型也需要约 50GB 内存,还不算操作系统、应用和上下文缓存的开销;2-bit 量化仍需约 25GB 内存专门留给模型。而现实是:在 DRAM 供应危机下,手机短期内恐怕连 16GB 这一档都难以跨越。仅仅一年前,安卓旗舰还常见 24GB LPDDR5X,如今不少厂商已在内存涨价潮中退回了高内存版本。
安蒙自己也承认了这一点:手机厂商必须想办法塞进“相当可观”的内存,而眼下供应紧张、价格飞涨。这与我们此前的报道相互印证:10 月 4 日《内存荒来了:特斯拉AI5砍内存,英伟达也扛不住》、10 月 9 日《三星手机Q4最高减产30%:内存涨价吞利润》——AI 数据中心正在吞噬全球 DRAM 产能,手机成了被挤压的一方。
技术上怎么跨过去
- MoE + 专家卸载:每个 token 只激活一小部分专家,常驻内存,其余专家放在闪存里——这是目前最被看好的路线。
- 闪存跑模型:苹果也在研究把 LLM 跑在机身闪存上,但 UFS/NVMe 的速度远不如 DRAM,推理速度会打折。
- 封装革新:苹果 A20 Pro 与骁龙 8 Elite Extreme Gen 6 都在芯片封装上做了调整,试图把更多内存“贴”近算力。
- 激进量化与蒸馏:超过 4-bit 的量化会让模型质量明显下滑,推理任务尤其如此;更现实的市场策略可能是蒸馏出的 200–300 亿参数模型——它在手机上可以达到接近 100B 的质量。
Wccftech 的评论也很直接:CEO 喊出目标却没有给出路线图,这目前还只是一个“美好的想象”。
影响与展望:端侧 AI 的“战书”
如果 2028 年真的实现,手机将从“需要你打开才能用的助手”,变成“一直在你口袋里替你办事的智能体”。中国厂商已经在卷端侧助手:据新浪 10 月 11 日的 AI 热点速递,OPPO 小布助手月活 1.65 亿、小米超级小爱月活 9594 万;努比亚 NaviX Ultra 则直接把自己定位成“AI 智能体手机”。
但也要泼一盆冷水:内存墙、发热墙、功耗墙一个都没倒。DRAM 供应链(三星、SK 海力士、美光)反而可能成为端侧 AI 时代新的“卡脖子”环节——谁能拿到内存,谁才能谈端侧大模型。
短期内更现实的路径是“30B 级端侧 MoE + 云端协同”:手机跑轻量智能体,重活交给云。安蒙的 2028 年目标,更像是在给供应链和 AI 公司下“战书”:内存,准备好了吗?