星尘智能引入字节跳动前强化学习专家孙鹏,聚焦机器人强化学习后训练

作者: admin | 发布于: 2026-09-02 14:37 | 分类: 科技资讯

2024年9月2日,曾担任字节跳动强化学习领域核心研究员、并执掌腾讯Robotics X智能体中心的孙鹏宣布入职星尘智能,其新角色聚焦于机器人强化学习领域的技术攻关与落地应用。

在学术与工业界,孙鹏长期专注于强化学习(RL)、单体及群体智能体(Agent/MARL)等前沿方向,积累了涵盖机器人RL、超大规模分布式训练架构以及大语言模型RL对齐等多维度的研究与工程经验。据悉,此次加盟后,他将主导搭建并壮大星尘智能内部的机器人强化学习研发团队,加速核心技术迭代与实际场景落地。

自创立以来,星尘智能始终秉持"为AI而生"的产品哲学,主张机器人的本体硬件、数据采集体系与人工智能算法必须一体化协同演进,而非各自独立开发。经过数年打磨,这一理念已构建起一条贯通底层基础模型与商业化专用模型、前端协作型Agent、以及基于强化学习的后阶段训练的端到端技术链路。

具体而言,星尘智能旗下的Lumo基座模型家族持续深化机器人在感知、推理与行为规划层面的能力:Lumo-1致力于解析动作意图背后的因果逻辑;Lumo-2则开创了面向家庭场景的隐式世界动作建模路径,首次将Latent World Dynamics机制融入其中——先在潜在表征空间推演未来状态演化,再据此输出最优动作序列。在前端层面,名为Philia的Agent系统专注于长程记忆维护、复杂任务调度、多机协作及拟人化自然对话。而在整条技术链中,强化学习被视为连接基础模型能力与大规模真实世界部署之间的关键桥梁,其核心使命在于赋予机器人通过与物理环境的反复互动和任务结果反馈来持续自我修正、不断精进行为决策策略的能力。