端侧AI爆发前夜,明略科技(2718.HK)锁定了哪些关键卡位
几乎所有头部AI公司都在赋予大模型"操控计算机"的本领。OpenAI的产品线从Operator演进至Computer Use,Anthropic的Claude和谷歌的Gemini同样在向桌面环境、浏览器及各类应用纵深渗透。然而,当智能体从对话框中走出、踏入真实的物理设备时,用户体验的关键便不再单纯取决于模型的智力水平,而在于它能否准确解析屏幕内容、精准捕捉用户意图、灵活调度各类软件,并在受限于设备性能的环境下持续、稳定地完成既定任务。
这正是明略科技长期深耕端侧AI赛道的重要动因之一。从面向计算机操作的Mano-CUA,到端侧语音识别方案OctoASR,再到专为Apple Silicon打造的推理加速引擎Cider,直至支撑人机协同的Agent编排平台Octo——明略科技实质上是在构建一条相当完整的价值链条:使AI能够感知设备界面、理解用户指令、高效运行于有限算力之上,并最终将多个异构AI协调为统一的执行力。这一布局所折射出的,远不止是模型部署形态的切换。一方面,移动终端和PC正逐步拥有日益充沛的AI处理能力;另一方面,Agent范式正将AI的角色从"应答提问"拓展为"自主且持续地执行任务"。
**01 端侧AI的风口从何而来**
关于AI手机与AI PC的讨论已延续了数年时间。当下,硬件层面的AI能力正以极快的速度走向大众市场,与此同时,Agent又将AI引向了更加依赖本地设备深度参与的工作场景。这两股力量恰好在同一时间窗口交汇。
从硬件维度来看,Gartner预测AI PC在全球PC市场份额将由2024年的15.6%攀升至2026年的54.7%,其中搭载AI功能的笔记本电脑在2026年将占据整体笔记本市场的58.7%。Counterpoint Research的数据则显示,具备生成式AI能力的智能手机预计在2026年将贡献全球手机出货量的45%,到2027年这一数字将进一步扩大至52%。换言之,端侧AI正从旗舰机型的锦上添花,演变为各类主流终端的默认配置。底层芯片与终端设备已将基础设施铺设完毕,核心议题随之转变为:AI究竟能在这些设备上承担哪些实际工作?
Agent恰好将这个命题推至聚光灯下。倘若AI仅停留在对话层面,云端大模型足以覆盖绝大多数场景;可一旦AI开始驱动浏览器、唤起应用程序、读写本地文件,乃至不间断地运转一到两个小时的复合任务,终端设备就绝不仅仅是一块用来呈现答案的显示屏。OpenAI推出的Computer-Using Agent已能通过解读屏幕截图并模拟鼠标键盘输入来串联完成多步计算机操作;谷歌发布的Windows版Gemini同样标志着AI正以更紧密的方式嵌入日常桌面办公流。因此,端侧AI之所以被再度聚焦,并非仅仅因为手机和PC多了一颗NPU芯片,而是因为Agent需要真正深入"作业现场"。设备本地的屏幕画面、文件系统、麦克风采集、已安装的应用程序以及当前的交互状态,都是纯云端模型天然难以实时、持续获取的信息源。AI若要实现从"指导你该怎么做"到"直接帮你做完"的跨越,就必然要向这些信息产生的源头靠拢。
**02 端侧AI目前处于什么阶段**
若以最终落地效果为标准来划分,端侧AI的发展大体走过了三个层次。
第一个层次回答的是"能否运行"的问题。模型体量需从数十亿乃至数百亿参数大幅缩减至适配终端的尺度,同时还要兼顾NPU、GPU、内存容量及功耗等多重约束。此阶段的技术重心集中在模型量化、知识蒸馏、算子级优化以及推理框架搭建上,目标十分直接:把原本只能跑在数据中心服务器上的模型塞进一台消费者手中的真机。
第二个层次关注的是"是否实用"。语音转写、视觉理解、文本摘要、实时翻译等功能开始作为独立卖点出现在具体产品中。端侧模型不必追求全能,只需在特定任务上做到响应迅速且表现稳定即可。
第三个层次追问的是"能否可靠交付"。AI必须能够读懂屏幕、在不同应用间穿梭调用、提取本地数据、执行连贯的操作序列,并且应对任务执行过程中随时可能出现的突发状况。抵达这一层级后,端侧AI的挑战已从单一模型的优化问题,升级为一整套系统工程问题:模型体积要够小,却不能在瘦身过程中丧失完成复杂任务所需的能力;推理延迟要够低,否则Agent每次点击后等待数秒,整条工作流便会彻底失去可用性;数据应尽可能保留在本地,但同时要避免本地模型因上下文窗口受限而表现退化;此外,单靠一个Agent远远不够,它还须具备调用其他Agent及外部工具的协作能力。
**03 明略科技的路径:将AI融入企业的真实业务流**
围绕端侧AI,明略科技已构建了多层次的产品矩阵:在模型层,Mano-CUA赋予AI解析并操作计算机图形界面的能力;OctoASR是一个参数量仅为0.8B的端侧语音识别模型,能够在macOS上完全离线完成音频解码与文字转写。在引擎层,Cider专门针对Apple Silicon架构进行推理路径优化,帮助模型更高效地榨取设备端的计算资源。在更上层的编排层,Octo承担着将多个异构Agent整合为统一体的角色,构建起跨平台、跨运行时、跨Agent的协同网络。
将这四大模块拼合在一起看:Mano-CUA回答"AI如何动手操作",OctoASR回答"AI如何接收声音",Cider回答"AI如何高效运转",Octo回答"多个AI如何协同作战"。它们共同指向一个根本性课题——如何将孤立的模型能力转化为终端上切实可行的工作产出。
这条技术路线同时也对应着三组颇为务实的商业考量。
其一是推理成本的核算。面对会议纪要自动生成、智能客服辅助、终端办公提效这类高频刚需场景,若全部依赖云端推理,每一次请求都将带来持续的算力支出与网络传输开销。端侧方案虽不会让AI运算变得"免费",但能够将相当比例的负载下沉至设备端,从而削减网络往返次数和对云端的反复调用。
其二是数据安全与合规的考量。金融、医疗健康、高端制造等领域存在大量不宜外传至公有云的数据。OctoASR将语音转写流程封闭在本地完成,Octo则支持全栈私有化部署,二者的结合使得企业得以将敏感信息和Agent的运行环境牢牢锁定在自身可控的安全域之内。
其三是交付模式的转变。企业客户真正需要的往往不是某个"万能大模型",而是面向具体业务场景的能力组合方案:部分环节依赖视觉解析,部分环节需要语音交互,部分环节要求对接企业内部知识库,还有部分环节涉及多步逻辑推理。当模型、推理引擎与Agent协作层能够模块化地自由拼装时,AI的交付模式便有望从"采购一个模型"升级为"按需配置一整套能力体系"。
**04 端侧AI下一步的增长空间**
如果说此前端侧AI的核心命题是"如何让模型在本地跑起来",那么下一个阶段更值得关注的方向,则是设备如何进化为Agent的上下文入口。端侧AI的核心价值资产,或许会逐渐从"在本机加载一个模型"转向"持续积累并掌控丰富的本地上下文"。
与此同时,端侧AI与操作系统之间的权力关系也可能经历重构。传统模式下,操作系统充当应用的管理者,由用户自行选择打开哪个App、按下哪个按钮;而在Agent主导的新范式中,用户只需陈述目标,由Agent来判断应当调用哪个应用、启用哪个模型、激活哪种能力组合。
站在明略科技的视角来看,端侧AI的这些未来走向也为既有产品版图打开了更广阔的想象空间。Mano-CUA承载设备感知与动作执行,OctoASR提供本地化的语音交互入口,Cider保障端侧算力的使用效率,而Octo所构建的多Agent协作机制,则有可能将这些分散在各处的端侧能力与云端大模型、企业既有信息系统有机贯通,形成一个内外联动的完整智能生态。