研究方向

智能是一个
持续演进的 过程。

以数字与物理世界为环境,以持续进化为方法:通过交互积累经验,通过强化学习将反馈转化为能力,再通过技能组合应对新的任务与场景。

机器如何进化

同一套学习机制,
贯穿两个世界。

不同项目的规模与载体各不相同,但遵循同一个机制:智能体应当根据行动带来的反馈持续学习,让能力在训练结束后仍能不断成长。

01

交互

通过与其他智能体、社会、工具和环境交互,持续产生新的经验。

02

强化学习

将环境与社会反馈转化为学习信号,持续改善决策。

03

自我进化

从系统自身经验中产生新的学习信号、训练任务与能力。

04

组合泛化

复用并重新组合已掌握的技能,应对训练中未曾遇到的情境。

01智能体 · 社会 · 仿真

数字世界

智能如何在数字交互中成长?

数字世界为智能体提供可扩展的沟通、社会交互与快速实验环境。借助 OASIS,我们可以在百万级智能体群体中,观察行为与智能如何随交互而演变。

系统与论文OASIS ↗
02空间 · 身体 · 行动

物理世界

如何将智能转化为可靠的物理行动?

物理世界让学习扎根于空间、身体和行动结果。SPAgent 将多模态推理与空间工具相连接;Future 则通过可组合的策略、评测基准与硬件基础设施,推进具身智能的持续进化。

系统与论文SPAgent ↗Future ↗

统一的研究理念

进化,源于智能体、经验与世界之间的持续互动。