AI科技观察

Apple 的 AI 布局:谁来接管用户的下一步

从与 Google 的模型合作、PCC 扩展,到开发者框架、App Intents 与 SCLATE 研究:Apple 想拿下的不是模型榜单,而是用户提出需求之后的那条执行路径。

何必呢约 15 分钟读完

从 Google 合作、开发者框架到 SCLATE,观察 Apple 如何把 AI 接入操作系统。

9 月底,Apple 研究人员公开了 SCLATE。一篇讨论 Agent 训练与评测基础设施的论文,关心的是会话结束以后会发生什么:任务怎样继续,记忆如何整理,过了几天还能不能正确使用之前的经验。1

这很容易被解读成“下一代 Siri 的技术预告”。但论文没有提供这样的证据。更值得做的,是把它放回 Apple 今年已经公开的产品、开发者工具和技术合作里,看看这些动作究竟指向哪里。

今年 1 月,Apple 与 Google 确认多年合作;6 月,Apple 公布新的模型体系与开发框架;9 月,Siri AI 开始以英语 Beta 形式推出。与此同时,它的研究团队在研究工具调用、长期记忆和跨会话评测。2345

这些材料支持一个更具体的判断:Apple 正在争取从用户提出需求,到应用完成操作的整条路径。模型可以来自合作伙伴,用户上下文、应用接口和执行规则仍然尽量留在自己的平台里。

这条路线有商业上的合理性,也有技术上的硬约束。拥有设备,并不自动意味着能做出一个可靠的个人 Agent。

与 Google 合作后,Apple 还在坚持什么

1 月 12 日的联合声明已经说得很清楚:下一代 Apple Foundation Models 将以 Google 的 Gemini 模型和云技术为基础。这比在助手里加一个外部聊天入口深入得多。到了 6 月,Apple 公布的第三代模型家族覆盖端侧与云端,最高档 AFM 3 Cloud Pro 面向复杂推理和 Agent 工具调用。23

更有分量的变化发生在计算基础设施上。Apple 宣布与 Google、NVIDIA 合作,把 Private Cloud Compute(PCC)扩展到 Google Cloud 的 NVIDIA GPU。按其公开设计,即使计算发生在外部数据中心,PCC 软件仍由 Apple 控制,设备只信任经过 Apple 密码学批准的软件。6

由此可以看出,Apple 对整合的边界做了调整。它接受模型与算力供应链里的外部合作,同时保留对系统调用和信任机制的控制。用“放弃 AI”概括这件事,会忽略它继续投入的系统层;把它解释成“模型从此不重要”,也同样站不住脚。

合作带来的依赖是真实的。外部模型的质量、供应条件和更新节奏,都可能影响产品。Apple 要解决的问题,是在利用这些能力的同时,让用户完成任务的体验不被某一家模型供应商完全定义。这是对公开架构的分析,不是双方未披露的合同安排。

还有一个容易混淆的边界:PCC 的隐私设计,并不自动覆盖开发者接入的所有第三方模型。Apple 在开发者课程里明确提醒,不同模型有不同的隐私特征,应用需要让用户知道自己正在使用哪一种。7

开发者文档,比 Siri 演示更能说明问题

2025 年,Foundation Models framework 已经向应用开放端侧模型、结构化生成和工具调用。到了 WWDC26,公开接口进一步涉及同一会话内切换模型、调整工具、管理历史记录,以及在不同任务阶段之间传递状态。89

这些能力直接对应 Agent 开发中那些不太适合上发布会的麻烦:上下文太长怎么办,简单请求要不要上云,切换模型时哪些记录可以带过去,中途出错后怎样接着运行。

Apple 还提供了可以在操作系统大版本之间更新的开源 utilities 包,用来承载 Agent 编排等模式。它没有只交付一个固定的助手形态,而是开始把构建这些体验所需的基础能力交给开发者。9

另一侧是 App Intents。开发者把应用中的对象、内容和动作描述成系统能理解的结构;Spotlight 负责让内容可被发现,Schema 帮助 Siri 将自然语言对应到具体动作,视图标注则把屏幕上的内容关联到应用实体。410

这条路径很重要。对于已经接入的功能,Agent 有机会直接调用定义清楚的操作,减少依赖屏幕坐标和界面猜测。但它的覆盖面取决于开发者实际开放了什么。系统认识一个应用的名字,远远不等于可以任意操作这个应用。

把两侧放在一起,Apple 的平台思路就比较清楚了:应用可以通过其框架使用不同模型,也可以把自身能力交给系统调用。模型来源保持弹性,应用与系统之间的接口继续沉淀在 Apple 平台上。

不过,开发者框架支持某种编排方式,并不能证明 Siri 内部采用了同样的实现。当前可以确认的是,Apple 已公开提供这些能力,而非所有部件已经合成一套统一的个人 Agent。

Apple AI 的公开动作与证据边界

图 1:产品和开发接口、实验研究、待验证问题分别列示。此图为本文编辑整理,不是 Apple 官方架构图,也不表示论文已进入 Siri。

SCLATE 问的是:明天还能接着干吗

SCLATE 的价值,恰好落在“长期使用”这个缺口上。

一个 Agent 可能在今天完成任务,却在明天恢复会话时丢掉关键约定。它也可能成功记录了信息,但之后始终没有调用。这些问题,靠一次性的答题成绩很难看清。

SCLATE 把任务事件和 Agent 自己的会话、定时任务、记忆整理事件放到同一时间线上。在论文的 MetaClaw 实验中,跨越 40 个日历日的情境,中位运行时间被压缩到 5.9 小时。它主要跳过空闲间隔,并没有让模型的真实推理速度突然提高。1

更值得关注的是后训练实验。研究人员让 Qwen3.5-4B 在不修改的 Harness 中学习工作。这里的 Harness,指负责工具、上下文和执行流程的运行框架。在 Claude Code 下,SWE-bench Verified 的 Pass@1 从 9.8% 提高到 26.5%;在 Codex 下,则从 28.8% 提高到 33.6%。1

这两个结果放在一起,比单独突出“提高 16.7 个百分点”更有解释力。训练收益取决于模型原本怎样使用工作环境,不同环境下的起点也不同。不能据此得出某一个 Harness 普遍优于另一个。

Qwen3.5-4B 在不同 Harness 中后训练的结果

图 2:依据 SCLATE Figure 6 与第 4.3 节重绘。代码读取量减少 6.8 倍的观察,仅来自 Claude Code 下的 42 个配对评测任务;它不等于总 Token、推理时间或服务成本都减少 6.8 倍。

对 Apple 的启示是,优化可以深入到模型怎样使用自己的工具和上下文。一个模型即使没有拿到通用榜单第一,也可能通过针对工作环境的训练,提高特定任务的完成率。但前提依旧是模型足够有能力,任务和评价方法也足够贴近实际。

这里还要把两件事分开。Agent 运行时写入记忆,与研究人员利用运行轨迹更新模型权重,是不同的学习机制。SCLATE 展示了后一种训练闭环;它并未证明 iPhone 上的 Siri 已经开始持续训练自己,更没有证明用户的私人历史会被拿去更新模型。1

记住用户,不等于保存所有过去

个人 Agent 最容易被想象成一个永远不忘事的助手。但在工程上,错误或过期的信息同样可以被长久记住。

Apple 团队的 Shared Selective Persistent Memory 研究选择保留任务要求、数据结构、工具配置和输出约束,丢弃大量只属于某次会话的推理过程。论文最早提交于 7 月,9 月修订,研究场景是生成和维护代码制品的协作工作空间,并非 Siri 的个人生活记忆。11

它提出了一个值得采用的方向:考察留下来的信息是否可复用,而不仅仅统计保存了多少历史。其企业实验只有 24 个重复任务,组间差异未达到统计显著,不能把结果包装成对所有 Agent 都成立的定律。11

真正困难的部分,可能在实验之外。假设用户换了工作地点,旧通勤路线应当失效;某次临时要求不应变成永久偏好;工作资料也不该因为能被检索,就自然进入家庭场景。这些是本文提出的产品要求,现有研究还没有证明 Siri 已经解决它们。

因此,长期记忆需要附带来源、适用范围和失效条件。用户能够查看、修改和撤销一条记忆,才有可能放心让它影响后续行动。

跨设备同步聊天记录只提供连续访问历史的能力。它与选择性记忆、经验学习之间,仍有明显距离。

系统级 Agent,不能总让用户替它收拾残局

Apple 的其他研究,为这条路线补上了可靠性问题。

AutoPlay 通过探索交互环境生成训练任务;Agent Seer 根据 MCP 工具规格构造测试场景,后者使用模拟工具输出,而非证明这些工具在真实系统里执行成功。两者都在降低生成训练和测试材料的成本。1213

Reinforced Agent 则把检查放到工具执行之前,让 Reviewer 审核拟议的调用。论文同时测量纠正错误和破坏正确决策的情况,承认检查者也会制造新问题。14

这提醒我们,增加一个 Agent 并不能免除系统责任。发邮件以前查一下收件人,很有价值;如果检查步骤频繁误判、反复询问或者明显拖慢执行,用户也可能放弃整个流程。

Apple 关于 Computer Use 的用户研究同样关注控制权和风险:研究者先访问从业者,再让 20 名参与者体验由研究人员模拟的 Agent。这是交互设计证据,不能当成某款自主 Agent 已通过真实世界安全验证。15

把这些工作连起来,可以看到一组持续出现的工程问题:怎样得到可信的测试任务,怎样在操作前发现错误,以及用户怎样介入。它们值得关注,但公开论文的关联仍不足以证明 Apple 内部存在一份已经统一的产品路线图。

更重要的是,数据隐私与行动安全必须分别处理。PCC 关注计算过程中数据怎样受保护;它不会自动保证一封邮件发给了正确的人,也不会替用户定义删除文件的授权范围。系统仍然需要明确的确认、撤销和失败恢复机制。6

端云分工背后,有一张成本表

个人 Agent 的成本不只来自用户眼前那一次回答。

它可能先检索信息,再拟定行动,调用工具,检查结果,最后整理记忆。增加检查和背景任务,会增加计算需求;把所有步骤都交给大模型,也会抬高延迟。这是长期助手必须面对的工程取舍。

Apple 的模型体系已经体现了分工。端侧包含约 3B 参数的 AFM 3 Core,以及总计约 20B、每次激活约 1B 至 4B 参数的 AFM 3 Core Advanced;更复杂的请求有云端模型承担。后者的总参数量与活跃参数量不能混为一谈,也不代表所有兼容设备都能运行它。3

端侧执行可以减少云端调用,但计算只是转移到了设备上,仍然消耗内存、电力和时间。真正值得优化的,是每完成一个有用任务需要多少资源。

产品限制已经让这笔账变得具体。9 月 14 日的发布说明写明,部分依赖服务器模型的功能,包括 Siri AI,设有每日使用限制;扩大使用量的付费访问将在未来提供。公告没有给出可以据此推算统一套餐价格的完整数字。5

开发者侧又采用另一种安排。WWDC26 指南说明,加入 App Store Small Business Program、且应用累计首次下载量低于 200 万的开发者,可以符合条件地访问 PCC 模型而无需支付云 API 费用。它是一项有资格边界的安排,不能理解为任何应用都拥有无限免费推理。4

我的判断是,Apple 有理由通过提供这类能力来增强平台吸引力。但“没有单独收 API 钱”和“服务没有成本”之间,隔着一整套资源调度。长期主动性最终会受到这套调度的约束。

系统入口没有自动兑换成胜利

如果把前面的材料读成“强大的运行框架足以弥补任何模型差距”,还需要看另一项研究。

Apple 研究站收录的《How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?》发现,在相同前沿模型和相同时间预算下,所测复杂 Harness 没有优于采用基本读写与 Bash 工具的简单方案。这个结论属于论文研究的机器学习工程任务,不能随意外推到个人助手;但它足以反对“框架越复杂,Agent 就越强”的直觉。16

Apple 必须同时解决模型能力与系统可靠性。默认入口可以减少用户开始使用的阻力,却无法让错误的执行结果变得可以接受。若用户每次都需要重新解释、手动修复,再好的系统位置也很难形成习惯。

它的系统优势还有边界。App Intents 依赖开发者接入;用户的数据可能散落在不同服务;跨平台工作也未必适合围绕单一设备生态组织。公开的开发接口展示了整合方向,没有证明这些问题已经消失。10

可用范围同样影响实际价值。以 9 月发布说明为准,Siri AI 从英语 Beta 开始推出,中国市场尚未提供;欧盟的 iOS、iPadOS 和 watchOS 也不在最初开放范围内。语言、地区与硬件限制,使“Apple 已经发布”不能直接等同于“每个用户都可以用”。5

接下来,应该观察什么

检验这条路线,不必等待一张更漂亮的模型榜单。

可以看一个跨应用任务是否真正完成,出了错能否恢复,而不是只看助手是否给出了一段合理的解释。也可以把时间拉长:几周以后,它是否仍然知道哪些约定有效,用户撤回的权限是否确实停止生效。最后还要算资源账,在可接受的延迟和使用额度下,用户究竟能稳定完成多少工作。

这些标准目前不能从几篇论文和产品公告中直接得到答案。它们需要独立、可重复的真实任务测试。

不过,Apple 的公开动作已经足够说明,观察它的 AI 路线不能只停留在 Siri 的回答质量。模型合作、端云分工、应用动作接口和 Agent 研究,正在共同扩大操作系统能够承担的角色。

这也是本文最核心的判断:当用户先表达需求、再由系统决定调用哪个应用时,操作系统就开始参与任务本身。Apple 正在为这个位置投入。

SCLATE 为其中“长期运行是否可靠”提供了新的研究工具。它没有提前给出产品成功的答案。真正决定这条路线的,是用户是否愿意把下一步操作继续交给系统。


资料核查截至 2026 年 10 月 2 日。产品与 API 描述主要依据官方文档,研究结论按论文实验范围引用;战略判断为本文分析。本文不包含对新版 Siri 的独立实测,也不将研究项目视作已确认的产品实现。

Sources / 资料来源

Footnotes

  1. Youngmok Jung et al., Apple. SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation. arXiv v1: 2026-09-26; v2: 2026-09-29. Sections 4.1–4.3; Figure 6; Table 2. Code-reading efficiency: 42 matched Claude Code tasks. Research results, not Siri product measurements. ↩ ↩2 ↩3 ↩4

  2. Google and Apple. Joint statement from Google and Apple. 2026-01-12. Official multiyear collaboration announcement; financial terms are not established here. ↩ ↩2

  3. Apple Machine Learning Research. Introducing the Third Generation of Apple’s Foundation Models. 2026-06-08; page updated 2026-09-09. Model family, parameter counts, target hardware and intended uses are Apple’s published descriptions. ↩ ↩2 ↩3

  4. Apple Developer. WWDC26 Apple Intelligence guide. WWDC26; accessed 2026-10-02. Foundation Models, App Intents and conditional no-cloud-API-cost PCC access. Eligibility does not imply unlimited capacity. ↩ ↩2 ↩3

  5. Apple Newsroom. Siri AI, a profoundly more capable and personal assistant, is here. 2026-09-14. Product rollout, system orchestrator, availability and usage limits. Announced functionality is not an independent reliability assessment; future features remain future features. ↩ ↩2 ↩3

  6. Apple Security Research. Expanding Private Cloud Compute. 2026-06-08. Announced Google Cloud/NVIDIA extension, privacy requirements and software control. The post describes a preview ramp; this article does not claim an independent audit or universal availability. ↩ ↩2

  7. Apple Developer. Bring an LLM provider to the Foundation Models framework. WWDC26; accessed 2026-10-02. Third-party provider interfaces and the differing privacy characteristics of local and cloud models. ↩

  8. Apple Newsroom. Apple’s Foundation Models framework unlocks new intelligent app experiences. 2025-09-29. Historical baseline: on-device access, guided generation and tool calling. ↩

  9. Apple Developer. Build agentic app experiences with the Foundation Models framework. WWDC26; accessed 2026-10-02. Dynamic profiles, transcript management, lifecycle state, orchestration patterns and the utilities package. These developer APIs do not establish Siri’s internal implementation. ↩ ↩2

  10. Apple Developer. Build intelligent Siri experiences with App Schemas. WWDC26; accessed 2026-10-02. Application entities, schemas, discoverability and actions; capabilities depend on app integration. ↩ ↩2

  11. Sanjana Pedada, Aditya Dhavala and Neelraj Patil, Apple. Shared Selective Persistent Memory for Agentic LLM Systems. arXiv v1: 2026-07-10; v2: 2026-09-15. Use the revised paper rather than the shorter research-site abstract. Enterprise evaluation: 24 recurring tasks; pairwise differences not significant. The domain is collaborative artifact generation, not personal Siri memory. ↩ ↩2

  12. Apple Machine Learning Research. Scaling Synthetic Task Generation for Agents via Exploration. Research-site publication: March 2026. AutoPlay explores interactive environments to generate training tasks. This is research, not an announcement of autonomous iOS operation. ↩

  13. Apple Machine Learning Research. Agent Seer: Synthesizing Scenarios from Specification Understanding. Research-site publication: August 2026. MCP-specification-based scenario generation with synthetic tool outputs; not live tool execution. ↩

  14. Apple Machine Learning Research. Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents. Research-site publication: May 2026. Pre-execution reviewer and helpfulness/harmfulness trade-off. Review can introduce errors. ↩

  15. Apple Machine Learning Research. Mapping the Design Space of User Experience for Computer Use Agents. Research-site publication: February 2026. Eight practitioner interviews and a 20-participant Wizard-of-Oz study; interaction research, not an autonomous-agent safety trial. ↩

  16. Kirill Brilliantov, Alejandro Hernández-Cano and Emmanuel Abbé. How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?. arXiv: 2026-09-30; Apple research site: 2026-10-01. Equal-model/equal-time comparison in the studied MLE setting. Do not generalize to all personal agents or all harnesses. ↩

#AI#科技观察