2026年9月9日,苹果新任CEO John Ternus走上Apple Park的舞台,这是自9月1日接替Tim Cook以来他的第一场秋季产品发布会。
在折叠屏iPhone Duo和iPhone 18 Pro的光芒下,Apple Watch Series 12和Ultra 4显得没那么引人注目。但真正值得讨论的升级,藏在了这块手表新增的麦克风里。
苹果将其命名为「Audio Intelligence」,一套包括四项核心功能的音频智能工具:Sound Recognition(声音识别)可识别警笛、门铃和婴儿哭声;Live Rewind让用户双击表冠即可转录此前15秒的对话内容;Siri Recap则通过环境聆听自动为整段对话生成标题、摘要和要点。此外还有更快的设备端Shazam音乐识别。
从实用角度看,这些功能的价值很直观——会议漏听的要点、咖啡馆里没听清的一句话、一天结束时想回顾的关键讨论。但问题也随之而来:一块始终戴在手腕上、能够随时捕捉周围声音的设备,与「窃听器」的边界到底在哪里?
从麦克风到摘要:一条不留下任何痕迹的数据通道
苹果为Audio Intelligence构建了一条极端的数据处理链路。这套链路是目前消费电子领域最复杂的端侧隐私方案之一,完整地展示了苹果在AI时代的核心哲学:用硬件架构来解决软件层面的信任问题。
以最能引发关注的Siri Recap为例,它经历了以下处理阶段:
第一步,监听与判断。手表麦克风持续捕捉环境声音,但苹果设计了一个专用AI模型,只用于判断「是否正在发生对话」——这个阶段不录音、不转录任何内容。
第二步,安全隔离。一旦检测到对话,原始音频进入手表S11芯片内部的Secure Exclave。这是一个与主处理器物理隔离的安全存储区域,操作系统、应用程序、甚至用户本人和苹果都无法直接访问。音频在此被加密,并通过苹果专有的安全蓝牙协议传输到配对的iPhone。传输完成后,原始音频立即从手表端删除。
第三步,设备端转录与提炼。iPhone接收加密音频后,使用本地语音识别和语言模型进行转录,然后去掉填充词、重复短语等非核心信息,生成一份「最小化语意版本」。苹果的描述是:将对话浓缩为其「核心含义」。处理完成后,原始音频立即从iPhone端删除。
第四步,安全筛除。在本地运行的另一个安全模型对文本进行过滤,屏蔽可能的有害内容——包括诱导自我伤害的言论、仇恨言论,以及财务数据、政府标识符、认证信息等敏感个人数据。
第五步,私有云计算。经过筛除的浓缩文本被加密发送到苹果的Private Cloud Compute服务器集群。PCC是苹果专为AI计算设计的私有云架构,其核心承诺是:数据不会存储在PCC中,不留日志,Apple无法访问,独立安全专家可随时验证这一承诺。一同发送的还有用于提升摘要质量的上下文信息,包括「正在播放」的音乐或播客来源数据、日历数据、高精度位置标签(家庭/工作/学校),但不包含精确位置。
第六步,摘要生成与同步。在PCC中,苹果的基础模型为对话生成标题和摘要,最终结果经端到端加密同步到用户的Siri应用。
苹果反复强调了一个核心承诺:原始音频「不会被创建或存储」,Apple自身也无法访问。
Live Rewind的设计同样周严。手表通过Secure Exclave缓冲区持续保留最近15秒的音频,旧的音频被新的不断覆盖。用户双击表冠时,这15秒缓冲区的加密音频传输到iPhone处理。如果传输失败——比如iPhone不在范围内——音频会自动删除。启动Live Rewind时,手表会发出可听见的提示音(即使在静音模式下),同时屏幕显示全屏动画和麦克风指示器,让周围人知道正在发生转录。
此外,Siri Recap和Live Rewind都明确不识别或标记说话者。Apple Support页面写道:「Siri Recap可能包含对话中提到的名字,但不会直接归属说话者(例如不会标记为『张三说了什么』或『说话者A vs 说话者B』)。」
当「始终在听」成为新常态
尽管苹果在隐私设计上做了大量工作,业界和社交媒体对Audio Intelligence的反馈仍然复杂。
TechCrunch评价称,苹果正在「让科技始终在监听你」这一想法变得常态化。WIRED的报道标题直指核心:「Apple Doesn't Want You to Worry About the New Apple Watch's Listening Features」——苹果不希望你担心新手表的监听功能。WIRED的文章进一步指出,「随着时间的推移,AI的攻击面——即可能包含缺陷或被攻击的服务和系统总量——增长速度快于我们能充分理解其影响的速度。」
争议的核心不在于数据是否上传云端——因为苹果的方案确实不传原始音频。争议在于行为本身。
一块手表,戴在手腕上,靠近你的谈话对象,在咖啡馆、会议室、家中、电梯里,随时可以通过双击表冠「回溯」过去15秒的对话。Live Rewind确实有提示音,但一个数码表冠的隐秘双击动作,远比掏出手机拍照或录像容易隐匿。
法律层面同样存在灰色地带。在美国多个州和欧洲多个国家,录音需要双方同意。虽然苹果不保存原始音频,但文字转录的法律地位尚不明确。法院如何看待这些转录内容?它们是否可以作为证据使用?Apple Watch的使用者是否负有告知义务:「我戴了一只能随时回溯对话的手表」?
苹果并非没有意识到这些矛盾。值得特别注意的是限制条件:Live Rewind和Siri Recap需要依赖Apple Intelligence的iPhone 16或更新机型(不含16e),支持范围仅限于英语环境,2026年底以beta形式推出,且首发不含欧盟。欧盟的缺席并非偶然——这从侧面反映了苹果自身对GDPR合规风险的审慎判断。13岁以下用户不可使用,18岁以下子账户需家长同意并开启。
品牌资产变现:当「隐私即卖点」面临极限测试
将Audio Intelligence放到更大的商业格局中看,它对苹果的战略意义远比「一个酷功能」深远得多。
第一,这是一次「隐私即卖点」的极限测试。自2016年拒绝FBI解锁iPhone以来,苹果一直将隐私作为核心品牌资产。在AI时代,当Google、微软和三星纷纷将AI功能绑定云端算力时,苹果选择了一条更重但更安全的路——设备端优先,云端仅做匿名化计算。如果Google或三星发布类似功能,将面临更为猛烈的隐私质疑;而对于一个已经花了近十年向用户灌输「隐私是基本人权」的品牌,一部分用户愿意因为「连Apple都无法访问」这样的承诺而选择信任。这是一种品牌溢价在AI时代的直接变现。
第二,它为Apple Watch打开了新的产品叙事空间。Apple Watch此前最重要的转型是从iPhone配件到健康可穿戴。但这个方向的天花板正在逼近:心率和血氧监测已经很难做出差异化,续航更是绕不开的硬伤。Audio Intelligence将手表的定位从「身体感知器」延伸为「环境感知器」。智能家居的声学入口、会议辅助的硬件载体、听力障碍人士的环境感知工具——这些都不是健康赛道,而是感知计算赛道。在可穿戴设备竞争日趋同质化的当下,这是一个有足够差异度的叙事方向。
第三,S11芯片及Secure Exclave构建了硬件护城河。Audio Intelligence仅限Series 12和Ultra 4使用,依赖S11芯片中的Secure Exclave硬件隔离区域。这意味着老用户无法通过软件更新获得这些功能。对于计划在未来两三年换机的用户,这可能是一个关键的升级理由。同时,苹果也在悄然拉高整个Apple Watch产品线的硬件安全基线——当Secure Exclave成为新常态后,后续的软件功能可以直接构建在已经部署的硬件之上,而不需要重新设计安全架构。
完美的技术方案,解决不了不完美的伦理问题
苹果在Audio Intelligence上展示的技术自信,始于芯片和架构层面的硬件隔离。Secure Exclave加上Private Cloud Compute构成的「可信任执行链」,是目前消费电子行业应对AI隐私问题最可落地的方案之一。
但技术的完美不能消解伦理的拷问。当「始终聆听」以「保护隐私」的方式降临时,社会需要的不只是技术架构的透明,还有对行为边界的公共讨论。苹果可以保证数据不上传,但它无法保证用户的同事、朋友、家人在被「现场回溯」时感到舒适——即使提示音响起。
有一点是确定的:可穿戴设备从「感知身体」走向「感知环境」,这条路一旦开启就不会回头。苹果只是第一个用硬件锁和加密协议为这条路上保险的公司。Siri Recap和Live Rewind将于2026年底以测试版形式上线,仅支持英语,欧盟用户暂不可用。留给市场和监管者的时间,恰好够一次关于边界的深度讨论。
双击表冠时那一声提示音,比隐私白皮书上的任何承诺都更诚实。






快报