Apple Intelligence 2.0 Beta 发布——端侧推理 SLM 重塑隐私 AI 架构
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
Apple 于 2026 年 8 月 15 日在 iOS 20 / macOS Tahoe Developer Beta 6 中激活了"Apple Intelligence 2.0"的核心功能。该版本集成了专注于端侧推理的 SLM(小型语言模型),无需将数据发送至云端,即可在设备本地完成逐步逻辑推理。这为此前"以云依赖为前提"的企业级 AI 带来了一个全新竞争维度——零通信推理。
Apple 在 8 月 15 日发布的开发者版本说明中明确指出以下变更:
X 平台上,开发者的实时反馈接连涌现:
"Apple Intelligence 2.0 的 Reasoning Mode 仅凭设备本地就解开了数学基准测试(GSM8K)。或许为医疗记录处理打开了一扇门。"
据 Apple 内部基准测试,基于 MMELU 的推理精度较上一代提升了约 31%。
Apple 在 2025 年 6 月的 WWDC25 上正式发布了第一代 Apple Intelligence。初期功能仅限于文本摘要、通知整理等轻量级任务,推理处理依赖于卸载至 Private Cloud Compute 完成。然而,随着 Google Gemini Nano 3(2026 年 3 月)和三星 Galaxy AI 5.0(2026 年 5 月)相继将端侧推理作为标准功能推出,开发者社区对 Apple 应对迟缓的质疑声日益增多。
在医疗、法律、金融等受监管行业,许多企业内部政策明确禁止向云端传输数据,端侧 AI 正从功能差异化逐渐演变为市场准入的门槛条件。根据 Gartner 2026 年 Q2 报告,受监管行业企业对端侧 AI 的采用意向较上年增长了约 2.3 倍。
Apple 未公开参数规模,但多位开发者通过逆向工程估算约为 3B 级别。借助自定义 Core ML 量化(4-bit),该模型在 A18 Pro 上的推理速度达到约每秒 45 个 Token。以 Meta Llama 3.2 3B 和 Microsoft Phi-4-mini 为参照,若经过针对性调优,法律及医疗文档的摘要与分类有望达到实用水准。
EU AI Act 第 13 条要求数据可追溯性,而 PCC 2.0 的"会话即时删除"设计与此相符。对于日本修订版《个人信息保护法》中有关第三方提供的限制,若采用不向云端传输数据的模型,很可能不在适用范围之内,这将大幅改变法务人员的引入决策。
Google 已预告将于 2026 年 Q3 推出 Gemini Nano 4,三星也宣布将为 Galaxy S26 强化 NPU 性能。"端侧推理"从差异化优势向商品化转变的速度极为迅猛,Apple 此次更新所能保持领先优势的窗口期估计仅有 6 至 9 个月左右。
更值得关注的,不是功能本身,而是"开放给谁"。本次 Beta 版本已确认,第三方应用可通过 Core ML API 调用推理 SLM。若该能力在 9 月正式版中全面开放,EMR(电子病历)应用和法律文档审查工具将具备在云端以外完成 AI 处理的基础。
据悉,多家医疗 SaaS 厂商已在非公开状态下开始测试,面向受监管行业的专属 AI 应用有望在 2026 年底至 2027 年 Q1 期间加速推向市场。
但风险同样不可忽视。端侧模型受制于操作系统的发布周期,无法像云端模型那样以数周为单位持续迭代性能。3B 级别所能覆盖任务的上限尚不明确,在多步骤财务计算和复杂法律文档处理中是否能满足可接受的错误率,仍需各企业自行逐一验证。
"云端 AI 还是端侧 AI"的问题,在过去几个月里已悄然转变为"两者并重,如何组合运用"。Apple Intelligence 2.0 以具体产品的形式,向企业抛出了这道设计选择题。下一个关注焦点,在于 9 月正式发布时 API 的开放范围——以及哪个受监管行业会率先迈出正式落地的第一步。
※本文由 ミライ・ニュース 编辑部 AI 作者(AI 新闻)撰写。