当前位置:首页>游戏攻略>AI 搬进手机之后,一些游戏规则变了

AI 搬进手机之后,一些游戏规则变了

  • 更新时间 2026-08-19 23:25:47
AI 搬进手机之后,一些游戏规则变了

你每天用手机问 AI 问题,等它回答要 2 秒。但同样聪明的模型,跑在你自己手机上,只要 20 毫秒。

差 100 倍。 没有云端,没有流量,没有人在看你的对话。只有一个 14MB 的模型,安安静静住在你的手机里。

这不是未来的事。Apple Intelligence、Google Gemini Nano、骁龙 8 至尊版——它们已经在这么干了。

把视角拉高一点看,你会发现一件有意思的事:所有人都在讨论云端大模型谁更强,而真正的变革,已经悄悄从服务器搬到了你的口袋。

这篇文章想聊三个问题:为什么是现在?14MB 是怎么做到的?以及,这件事跟你到底有什么关系?

先说延迟。这是端侧 AI 最直观的优势。

你在手机上问 ChatGPT 一个问题,等 2 秒才看到回答。这 2 秒里发生了什么?信号从手机传到基站,穿过光缆到达云端服务器,GPU 集群处理你的请求,结果再原路返回。大部分时间不是在“思考”,而是在路上。

端侧推理完全不同。模型直接跑在手机的 NPU 上,NPU 全称 Neural Processing Unit,是专门用来跑 AI 模型的硬件单元。数据不用出门。延迟从秒级掉到毫秒级,不是优化带来的质变,是架构层面的降维打击。

数字说话。

Raspberry Pi 5 上跑 Needle 2(一个 4500 万参数的端侧模型),

Prefill 速度 800+ tokens/sec,

Decode速度500+ tokens/sec。

iPhone 16 Pro 跑 3B 参数的 LLM,大约 4 tok/sec。

iPad Pro M4 跑 13B 模型,能到 15 tok/sec。

你可能觉得 4 tok/sec不够快。但换个角度想:一个模型,跑在手机上,实时给你生成文字——这在两年前需要一张A100。

能耗这笔账,很少有人算过

速度快只是硬币的一面。另一面是成本。

云端推理的能耗数据很惊人。根据 arXiv 和 Microsoft Research 的实测,一次 GPT-4o 短查询消耗约 0.42 Wh,GPT-4.5 长查询可以到 30 Wh 以上。什么概念?如果你一天用 8 次 ChatGPT,一天的能耗大约是 3.73 Wh——差不多能给两部手机充满电。

端侧推理的能耗呢?毫瓦级。

同样是运行模型,NPU 的能效比 CPU 高 100 倍,比 GPU 高 10 倍(Qualcomm 数据)。一次端侧推理的能耗大约是 0.001 Wh,和云端的 0.3-40 Wh 相比,差了三个数量级。

更关键的是边际成本。云端按 token 计费,用得越多花得越多。端侧模型下载之后,每次推理成本为零。一个月十万次推理,云端要花几百到几千美元,端侧是 0。

续航方面,实测数据:

  • • iPad Pro M4 持续推理能撑 5 小时
  • • Galaxy S25 Ultra 3.5 小时
  • • iPhone 16 Pro 3 小时
  • • iPhone 16 2 小时

不算完美,但已经够用。

大厂已经在做了

如果你还以为端侧 AI 是实验室概念,看看这些已经上线的产品。

Apple Intelligence 跑在 A18 芯片上,端侧模型大约 3B 参数。用了 2-bit 量化感知训练(从训练阶段就让模型适应低精度)、KV-cache 共享、低 bit 调色板、Adapter 机制(rank 16 的 adapter 只需要数十 MB 内存)。苹果声称,这套端侧模型在人类评估中超越了 Phi-3-mini、Mistral-7B、Gemma-7B 和 Llama-3-8B。

Google Gemini Nano 有两个版本:Nano-1(1.8B 参数)和 Nano-2(3.25B 参数),4-bit 量化,上下文窗口 4096 tokens。通过 Android AICore 系统服务部署,需要 12GB 以上 RAM 加旗舰芯片。Pixel 8 Pro 及以上、Galaxy S25 系列都支持。完全本地,零成本,sub-second 延迟。

三星 Galaxy S25 系列 搭载骁龙 8 Elite for Galaxy,12GB RAM,端侧跑 Gemini Nano 的同时还有 Galaxy AI 做端云混合。TalkBack 图像描述功能是第一个非 Google 应用使用 AICore 的案例——屏幕阅读器能为视障用户描述图像内容,全部端侧完成。

这不是零散的产品尝试。2026 年 Q1,45% 的旗舰机已经搭载端侧 AI 大模型。

Counterpoint 预测,端侧模型参数规模从 2023 年的 7B 增长到 2024 年的 13B,2025 年会到 17B。

14MB 为什么能干大事

说到“把大模型塞进小设备”,绕不开量化技术。

一个模型训练完之后,里面每个数字原本用 32 位浮点数(FP32)表示。量化就是把这些数字的精度降低,从而压缩模型体积。

打个比方。你有一本精装百科全书,内容没变,但纸张变薄、字号变小,最后变成了一本口袋书。阅读体验略有下降,但核心信息都在。

不同量化格式的权衡,大致是这样的:

格式
内存占用(相对 FP16)
速度提升
精度损失
INT8
~50%
1.3-1.8x
<1%
INT4
~25%
1.4-1.8x
1-3%
2-bit
~12.5%
任务特定
任务特定

INT4 量化已经相当成熟,模型压到原体积的 1/4,精度损失 1-3%,大多数生产场景能接受。模型越大,量化越友好——70B 模型比 8B 模型量化后损失更小。

2-bit 是更激进的玩法。 Cactus Compute 的 Needle 2 用 CQ2-bit 量化,4500 万参数,14MB 模型体积,压缩比 12.5 倍。它在 Mobile-Actions 基准测试上超越了 FunctionGemma 270M、LFM2.5 230M 和 Apple FM——这些都是参数量大它几十倍甚至上百倍的模型。

怎么做到的?Needle 2 用了两个关键架构创新:

  1. 1. Simple Attention Network 替代了传统的密集投影层
  2. 2. engram 系统 把世界知识存储在哈希 n-gram 表中,而不是全部塞进神经网络权重
  3. 3. Walsh-Hadamard 变换 用固定数学变换替代需要学习的参数

这不是简单地把大模型“压小”,而是专门为极端硬件条件重新设计的架构。端侧 AI 的核心逻辑不是“缩小版云端”,是另一条技术路线。

芯片军备竞赛,NPU 成了主角

硬件端的进展同样激进。

高通最新的骁龙 8 Elite Gen 5,据 Counterpoint 报道,NPU 算力预计达到 100 TOPS,3nm 工艺。相比上一代,NPU 加速比 CPU 快 100 倍,比 GPU 快 10 倍。5ms 内能完成 56 个以上的模型推理,CPU 只能做 13 个。对比 Apple A19 Pro,效率提升 27%;对比联发科天玑 9500,效率提升 40%。

苹果 A18 的 16 核 Neural Engine 专门为 Apple Intelligence 优化。联发科天玑 9300 的 APU 790,整数和浮点性能提升 2 倍,功耗降低 45%,大模型处理速度提升 8 倍。

软件生态也在跟上。Android 15 上,38% 的应用已经通过 NPU 路由 AI 推理,这个数字还在涨。

更大的图景

有意思的是,把上面这些信息放在一起看,你会发现一个模式。

端侧 AI 不是要替代云端。 它是一个混合架构的两条腿。高频、低延迟、隐私敏感的任务,在手机本地用小模型解决。复杂推理、需要海量知识的任务,还是上云。

当你把 Apple Intelligence 和 Google Gemini Nano 的策略放在一起对比,会发现它们选择了不同的路径:

  • • 苹果:“端侧优先,服务器兜底”——端侧 3B 模型处理大部分日常任务,复杂的交给自家服务器模型(对标 DBRX-Instruct 和 Mixtral-8x22B 级别)
  • • Google:“端云混合”——Gemini Nano 处理基础任务,Gemini Ultra 处理复杂任务,中间有一个智能路由

这两条路,哪个更好?我觉得没有标准答案。苹果的端侧能力更强,适合隐私敏感场景。Google 的端云协同更灵活,适合需要深度推理的场景。

但方向是一致的:让 AI 无处不在,而不是只在打开某个 App 时才存在。

这跟你有什么关系

普通用户来说,端侧 AI 意味着 AI 会真正融入手机系统的每个角落,而不是停留在一个独立的 App 里。

你的相册能理解你拍的内容,帮你搜索照片,数据不离开手机。你的助手能理解上下文,帮你调用其他 App 完成任务,响应速度从 2 秒变成 20 毫秒。你的输入法能根据你正在写的对话推荐回复,而不需要你上传聊天记录。

这些场景有一个共同特点:高频、低延迟、隐私敏感。 恰好是端侧 AI 的主场。

开发者来说,一个新的技术栈正在形成。模型压缩、NPU 编程、端云混合架构——这些技能的需求在快速增长。Qwen3-8B 已经支持 MCP 工具调用,端侧 Agent 的生态正在搭建。如果你在做 AI 应用开发,现在是时候认真考虑“端侧优先”的架构设计了。

投资人和行业观察者来说,值得盯住三个信号:

  1. 1. 芯片 NPU 的算力军备竞赛还没到头
  2. 2. 模型压缩技术,特别是 2-bit 以下的突破会释放新场景
  3. 3. 应用层的机会可能比基础设施层更大,当基础设施足够成熟,价值会流向应用场景

下次别人说“AI 必须联网才能用”,你可以把这篇文章甩给他。14MB 的模型、20 毫秒的响应、零边际成本——端侧 AI 不是概念,是正在发生的现实。

一个判断

回到开头那个 2 秒 vs 20 毫秒的对比。

云端 2 秒,不只是在等网络。等的是数据中心的排队、GPU 的调度、结果的传输。端侧 20 毫秒,不只是省了网络。省的是整个云端基础设施的开销。

这 100 倍的差距,背后是一次计算范式的转移。AI 从“访问远程服务”变成“使用本地能力”。

就像个人电脑让计算从大型机走向桌面,移动互联网让信息从 PC 走向口袋,端侧 AI 让智能从云端走向终端。

Gartner 把 SLM(Small Language Model,小语言模型)列为 2026 年设备端 AI 转型的关键驱动力。Dell 把年度技术预测的主题定为“The Power of Small”。Edge AI 市场 2026 年 300 亿美元,2033 年预计超过 1000 亿美元,年复合增长率 21-37%。

当所有人都在比谁的云端模型参数更大、跑分更高的时候,另一条路线已经悄悄铺开了基础设施。等大家反应过来的时候,AI 可能已经住在你手机里了。

而 100 倍的差距,才刚刚开始显现。

最新文章

随机文章