AI手机迈入系统级Agent时代,苹果、荣耀、豆包加速布局
近一年间,人工智能几乎是每一场手机新品亮相活动中被提及最多的词汇。无论是接入ChatGPT、DeepSeek等大语言模型,还是打造专属AI助理与智能体,各大手机品牌纷纷向市场宣告自己已抢占AI时代的先机。然而,当越来越多的设备具备了问答、图片编辑、文档摘要等功能后,仅仅将一个大模型塞进手机,已不足以构建真正的竞争壁垒。AI手机面临的下个关键命题愈发清晰:它能否切实为用户完成实际事务?在取得用户许可的前提下,任务执行的深度又该如何界定?
各品牌正沿着各自的路径寻求解答。
9月15日,苹果正式推送iOS 27更新,搭载全新一代Siri AI。该版本的能力主要聚焦于基于个人语境检索照片、邮件和备忘录,以及在短信、音乐、提醒事项等内置应用中执行简单指令等较为初级的使用场景。
同日傍晚,荣耀对外发布了MagicOS 11。该系统被定位为业界首个将系统级Agent Harness(智能体运行框架)投入商业应用的移动操作系统,官方宣称其AI助手YOYO最多可连续执行上百个步骤的长链条任务,并将率先搭载于荣耀Magic9系列机型之上。
紧随其后,中兴通讯旗下努比亚定于9月16日推出NaviX Ultra。这款由中兴通讯携手字节跳动共同开发、预装豆包手机助手的新型号,也被业内冠以"第二代豆包手机"之名。
三场间隔极短的发布活动,表面上展示的是三款截然不同的产品,本质上却指向同一核心议题:当模型能力日趋成为通用底座,AI怎样才能更深层地嵌入手机操作系统之中?

图片来源:每经媒资库
从"能应答"迈向"能干活"
此前一段时间内,大模型产业链已逐步梳理出较为明确的协作格局:模型公司专注基础模型的训练与迭代,芯片供应商提供算力支撑,终端品牌则承担硬件制造和用户触达的职责,并依托自有应用体系构建一定程度的Agent功能。这种架构能让最前沿的大模型能力迅速触及终端用户,但其局限性也十分明显。大多数手机品牌实质上充当的是"集成组装者"的角色,一旦底层模型趋于一致,AI手机带给用户的体验也随之陷入雷同。
竞争的差异化重心,因此开始向模型层面之外迁移。谁拥有操作系统的主导权、谁把控应用与服务的生态网络,将直接决定AI在手机中的渗透程度,并由此催生出多条不同的技术实现路径。
尽管苹果不再坚持底层模型的全部自主开发,但对操作系统的管控力度丝毫未减:模型可以源自外部合作方,但AI以何种方式进入iPhone、被授予哪些权限、如何调度系统与应用的既有能力,这些规则依旧由苹果单方面制定。
反观大模型公司切入手机领域,所面对的格局恰好颠倒——模型自主研发、能力可控,但操作系统、硬件平台以及大量系统级权限均不在其掌控范围内。2025年12月,中兴通讯与字节跳动联合推出了搭载豆包手机助手技术预览版的努比亚M153工程样机(即外界所称的"豆包手机一代"),正是这一跨界合作模式的初步探索。在该方案中,豆包手机助手输出模型层与智能体层面的能力,而努比亚则提供硬件平台及与手机系统深度耦合的底层支撑。当时用户仅需一句自然语言指令,手机便能自动完成以往需要十几次手动点击才能搞定的复合操作,如自动购票、下单外卖、批量填表等。
GUI(图形用户界面)Agent由此一度被视为AI手机最具潜力的技术方向之一,其优势极为直白:不必苦等每一个应用专门为AI开发适配接口,AI只要能"读懂"屏幕上显示的内容,就能如同人类手指般操控现成应用。然而,该工程机面世后没多久,多款主流应用及建设银行、农业银行等金融类App便针对此类自动化行为施加了不同力度的技术封锁与安全管控措施。
这一局面直接影响了第二代豆包手机的技术决策。据知情人士透露,NaviX Ultra不再单一依赖GUI模拟点击的方式,转而引入了MCP(模型上下文协议)等标准化协议调用手段。豆包手机的这次升级映射出AI手机商业化落地的一道现实关卡:对于大模型企业来说,真正的瓶颈早就不只是让模型"听得懂人话",而在于如何获得稳定、合规且长期可用的系统与应用调用通道。
就手机品牌与大模型公司在打造AI手机上的区别,荣耀MagicOS AI产品部总经理张冲近日在接受包含《每日经济新闻》在内的多家媒体采访时指出,豆包在自动化执行维度上表现强劲,荣耀今年的自动执行水平已与豆包持平,但在环境感知、系统服务覆盖以及主动服务场景和用户体验的沉淀上更具优势。"根本原因在于,手机本身的系统功能和服务体系在整体进行AI化重构时还不够彻底,因为助手归对方管,但手机不归对方管,所以系统服务层面天然存在落差。"张冲如是说。
基于此,手机品牌着手将AI能力向操作系统内核进一步延伸。本次MagicOS 11最核心的变革之一,便是引入了系统级Agent Harness(智能体调度引擎)。
若将大模型视为Agent的"中枢神经",那么Harness便是衔接"中枢"与手机各项功能模块的一套协调调度体系:模型承担理解用户需求和逻辑推演的角色,Harness则统筹感知采集、任务拆解、工具调用与动作执行,并依据每一步的执行反馈动态修正后续策略。
"此前行业内讨论Agent,目光大多聚焦在模型这个'大脑'本身的进化上。但当Agent开始应对真实世界中的复合型任务时,最终能否把事办漂亮,还要看它能捕捉到哪些信息、如何规划执行路径、可调用的工具有多丰富,以及在执行途中能否根据实时状况灵活应变。"张冲表示。在他眼中,即便是相同的模型,经由不同的系统协同机制驱动,最终呈现给用户的Agent体验也可能大相径庭。
从系统内核到应用版图
即便操作系统内部的课题得到妥善解决,AI手机的完整落地也不过走完了前半程。
手机品牌可以直接调用闹钟、日历、摄像头等原生功能,却无权提供航班预订、网约车叫车等外部服务。过去十几年移动互联网浪潮中沉淀下来的海量高频刚需,至今仍握在第三方应用和互联网平台手中。
因此,一个真正具备跨场景任务执行能力的Agent,不仅要在系统内部"四通八达",还必须突破系统边界,深入第三方服务的生态网络。这恰是Agent手机区别于传统智能手机交互范式的最大分野。
在过去十余年里,用户办成一件事的标准流程通常是:先意识到需求,再去搜索对应的App,打开App后寻找具体功能入口。但荣耀MagicOS总裁孙建发认为,在Agentic OS的范式下,未来这种主从关系或将发生逆转。"在Agentic OS中,当用户在智能设备上完成某项事务时,未来的执行主体将从App变为Agent,而App则有可能退化为Agent执行任务时所调用的一个工具组件。"
举个例子,当用户对手机说出"帮我订一张明天下午飞上海的机票,顺便把行程安排写进日历"时,理想情况下,Agent应能自主解析需求、对接票务服务、完成购买确认,再将时间地点同步写入日历。用户既不需要事先判断该打开哪家OTA平台,也不必在多个App和页面之间来回跳转。即便App本身并不会因此消亡,人与App之间的互动关系也将发生转变:从前是用户主动搜寻App,今后则更多由Agent代替用户去定位App背后所需的服务资源。
那么,Agent究竟该以怎样的形式接入这些外部服务?当前业界尚无定论,GUI、MCP、Skills、API以及A2A等多种技术方案正并行推进。
简而言之,MCP旨在让Agent顺畅连接外部工具与数据源;A2A侧重于解决不同Agent之间的互通与协作问题;Skills和API可将特定能力模块化地向Agent开放;GUI则不依赖任何标准化接口,直接解读应用界面并模拟真人操作。
GUI的核心长处在于"几乎所有东西都能尝试着去点":哪怕某个App从未为AI做过专门的接口适配,Agent仍可通过识别界面上的按钮和文本来尝试完成任务;但代价是它对界面改版、应用安全策略以及权限校验格外敏感。相比之下,MCP、Skills、API等手段更像是一条获得了应用方授权的专用通道,调用效率与运行稳定性更优,权限边界也更清晰,前提条件是应用方愿意将自己的服务对外开放。
张冲将两者类比为"高速公路"与普通公路的关系。"不管走GUI这条路,还是走MCP、Skills那条路,目的都是帮用户把事办成。就目前来看,MCP和Skills更像是用户之"