从奖励模型,
走向奖励世界。
如果智能体所处的环境,也能产生它学习所需的信号,会怎样?
许多后训练流程依赖模型或人类为回答评分。在 OASIS 社会奖励项目中,我们探索另一种反馈来源:模拟社会中其他智能体的回应。
在 OASIS 中,智能体可以发帖、评论、转发、点赞,并相互关注。[1] 这些交互持续产生大规模反馈。我们将反馈转化为奖励,利用强化学习更新策略,再让更新后的智能体回到环境中。
社会仿真平台既是行动的场所,也是奖励的来源。
这是一项早期探索。实验表明,智能体会适应社会反馈,但能力向外部评测的迁移效果并不一致。同时,一个核心挑战也逐渐显现:社会奖励什么,便会塑造智能体学到什么。
交互、学习、回归。
指令进入社会环境后,智能体开始交互。仿真平台记录提示词与模型输出所组成的轨迹,并根据社会反馈生成奖励。随后,近端策略优化算法(PPO)[2] 据此更新策略参数。
更新后的智能体回到仿真环境,产生下一轮经验。智能体及其产生的反馈,共同构成一个持续演进的学习环境。
模型能否适应
社会反馈?
我们首先构建了一个由 196 个大语言模型智能体组成的模拟社会。智能体反复发帖并相互回应。我们用点赞数作为社会影响力的简单代理指标,让仿真平台无需为每次行动新增人工偏好标注,即可产生奖励。
下面的定性示例展示了策略的初步变化。经过两个社会强化学习训练轮次,模型的回应更直接面向读者,也更注重互动。
“作业太多,感到不知所措?深呼吸,把它拆成更小的任务!你可以的!#作业帮助 #学习技巧”
“同学们!别让作业压垮你!把它拆成小任务,定时休息,需要时寻求帮助。记住,每份作业都是学习和成长的机会。”
“朋友们!我知道作业可能让人喘不过气,但别忘了休息并保持专注……继续努力,需要帮助时不要犹豫。”
更多参与,
更多互动。
在模拟社会中,我们观察到零点赞帖子的比例下降,获得正向互动的帖子比例上升。每帖平均点赞数从 0.6767 提升至 0.7065,总发帖数从 43,443 增至 52,790.
相对变化
相对变化
初始群体规模
学到的能力能否迁移到
仿真环境之外?
我们在代码与推理基准上评估模型检查点,包括 HumanEval[4]、MBPP[5]和 BIG-Bench Hard(BBH)[6],并使用 AlpacaEval 2 评估指令遵循能力[7]。结果并不一致:部分得分提高,另一些持平或下降。
在通用社会环境中,HumanEval 得分从 62.2 提高至 65.24,但 Math 与 AlpacaEval 2 略有下降。在面向代码的环境中,报告的 BBH 平均得分从 52.4 提高至 64.5。这些观察促使我们进一步研究社会环境如何影响能力迁移。
查看完整评测数值
| 评测基准 | 基线 | 训练后 | 变化(百分点) |
|---|---|---|---|
| 通用社会环境 | |||
| HumanEval | 62.2 | 65.24 | +3.04 |
| MBPP | 57.8 | 58.2 | +0.40 |
| Math | 27.7 | 27.46 | -0.24 |
| AlpacaEval 2 | 22.92 | 20.25 | -2.67 |
| 代码导向环境 | |||
| HumanEval | 62.2 | 64.0 | +1.80 |
| MBPP | 57.8 | 58.2 | +0.40 |
| BBH 平均分 | 52.4 | 64.5 | +12.10 |
| Math 零样本 | 27.7 | 28.2 | +0.50 |
这些结果来自探索性的模型检查点比较。目前尚无重复实验的波动范围与置信区间,因此应谨慎解读较小的分数差异。
社会影响力,
并不等于正确性。
受欢迎的回答仍然可能是错的。智能体可能学会吸引注意,却并未变得更有用。
当智能体开始相互学习,这类激励可能不断放大。在社会内部获得更多奖励,并不必然意味着在外部任务上表现更好。
奖励投机的早期迹象
早期实验显示,将单个强化学习阶段的交互数据从约 3 万条增至 6 万条,可能使代码能力回落至接近基础模型的水平。输出格式也变得不稳定,有时会导致动作解析失败。
下一步,我们希望奖励 有价值的贡献:帮助其他智能体解决问题,给出可验证的方案,改善群体结果,或提升协作效率。
从社会影响力,
走向社会贡献。
点赞是我们有意选择的简单起点。更丰富的社会还可以提供其他信号:代码是否被复用,讨论是否收敛到正确答案,群体是否解决了个体无法独立解决的问题。
社会影响力
研究点赞、转发、评论和参与如何改变行为。
基于任务的奖励
将社会反馈与可验证性、正确性、协作和任务成功相联系。
持续演进的社会
交互、更新,再回到不断演进的多智能体环境。
社会动态与安全
研究从众效应、错误信息、群体极化与自发形成的规范。
OASIS 社会奖励研究尚未证明,社会反馈是一条普遍可靠的模型能力提升路径。但实验表明,智能体会适应社会产生的奖励,部分学习效果能够迁移至仿真环境之外,而环境设计对此有重要影响。
长期方向是让智能体进入不断产生新经验的世界,并研究这样的世界能否支持有价值、可持续的学习。
研究状态:早期探索。结果与示例来自项目内部展示材料,所有报告结果均为初步结果。网络连线为概念示意。
参考文献
以下文献介绍了仿真平台、算法、基础模型与评测工具。本文中的社会奖励实验结果来自项目内部实验,并非来自这些参考文献。原始材料将数学评测标记为“Math”和“Math 0-shot”,未注明具体数据集或版本。
- Ziyi Yang, Zaibin Zhang, et al. OASIS:支持百万智能体的开放社会交互仿真. 2024. ↩
- John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov. Proximal Policy Optimization Algorithms. 2017. ↩
- Meta. Meta-Llama-3-8B-Instruct: Model Card. 2024. ↩
- Mark Chen et al. Evaluating Large Language Models Trained on Code. 2021. ↩
- Jacob Austin et al. Program Synthesis with Large Language Models. 2021. ↩
- Mirac Suzgun et al. Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them. 2022. ↩
- Tatsu Lab. AlpacaEval: Official Repository and AlpacaEval 2.0 Documentation. ↩
引用本文
OASIS 项目组:《大语言模型智能体能否向社会学习?》,OASIS 社会奖励,2026 年 9 月,研究博客。
@misc{oasis2026socialreward,
author = {{OASIS Project}},
title = {Can {LLM} agents learn from society?},
year = {2026},
month = sep,
howpublished = {OASIS Social Reward research blog},
url = {https://zhangzaibin.github.io/evolving-machines/zh/research/oasis-social-reward/}
}