项目背景与目标
人在协作任务中不仅需要观察环境,还需要推测他人的目标、知识状态和下一步行动。例如,两个人一起整理房间时,一个人可能会根据同伴正在走向的位置,推断其想要拿取的物体,并提前让路或递交工具。这类能力通常被称为心理理论(Theory of Mind),也是认知推理、社会协作和人机交互中的核心问题。
当前许多智能体评测环境主要关注单个智能体的任务完成率,较少显式考察智能体是否能够表示并利用“他人可能知道什么、想做什么、会怎么行动”。本项目旨在构建一个轻量级多智能体网格环境 MindGrid,要求智能体在部分可观测、目标不完全共享、需要沟通或协作的任务中完成推理决策。学生需要实现基本环境、构建不同类型的智能体,并分析心理理论建模是否能提升协作表现。
本项目适合作为本科生小组课程作业。重点不在于开发大型平台,而在于清楚定义任务、实现可运行 baseline、给出可解释的实验比较。
核心任务设计
任务一:多智能体协作环境构建(20分)
构建一个简单的二维网格世界,用于模拟两个或多个智能体在部分可观测条件下完成协作任务。环境可以自行实现,也可以基于 MiniGrid、PettingZoo、Overcooked-AI 等已有环境修改。
环境至少应支持以下元素:
- 多个智能体,每个智能体拥有自己的位置、视野和可执行动作。
- 多个物体或目标点,例如钥匙、箱子、门、工具、任务区域等。
- 部分可观测机制,例如智能体只能看到局部视野,或只能知道部分物体状态。
- 一个需要协作才能完成的任务,例如一名智能体开门、另一名智能体搬运物体,或两名智能体需要交换信息后选择正确目标。
期望产出:
- 环境代码和运行说明。
- 至少 3 个不同难度的任务场景。
- 每个场景的截图或录屏。
- 对状态空间、动作空间、奖励函数和任务成功条件的说明。
评分维度:
- 环境可运行性(8分)
- 任务设计清晰度(6分)
- 部分可观测与协作机制设计(4分)
- 可视化或日志记录(2分)
任务二:协作推理智能体实现与对比(40分)
在任务一的环境中实现并比较不同类型的智能体。学生至少需要完成一个规则型 baseline 和一个学习或语言模型驱动的智能体。
可选智能体包括:
- 规则型智能体:基于手写策略完成导航、交互和简单协作。
- 强化学习智能体:使用 PPO、DQN、A2C 等方法训练策略。
- 大语言模型智能体:将环境状态转化为自然语言描述,由 LLM 输出动作或高层计划。
- 心理理论智能体:维护对其他智能体目标、可见信息或下一步动作的估计,并据此调整自己的策略。
建议比较以下问题:
- 只根据自身观察行动的智能体,与显式建模同伴状态的智能体相比,表现有何差异?
- 在部分可观测程度增加时,不同智能体的任务成功率如何变化?
- 加入简单沟通机制后,智能体是否更容易完成任务?
期望产出:
- 至少两类智能体的实现代码。
- 至少一个定量评估指标,例如成功率、平均完成步数、平均奖励或沟通次数。
- 至少 20 次运行结果的统计表格。
- 对典型成功和失败案例的简要分析。
评分维度:
- baseline 实现完整性(10分)
- 学习型或 LLM 智能体实现(10分)
- 心理理论变量或同伴建模设计(10分)
- 实验对比与结果分析(10分)
任务三:开放探索与改进(40分)
在完成前两项任务的基础上,选择一个开放问题进行深入探索。目标是提出一个具体改进,并用实验说明它是否有效。
可选方向包括:
- 更好的同伴建模:预测同伴目标、视野、动作或错误信念。
- 更好的沟通策略:限制通信轮数或消息长度,研究智能体如何选择最有用的信息。
- 更复杂的任务组合:加入诱饵目标、动态障碍、临时角色分工或任务冲突。
- 更强的规划能力:结合搜索、树搜索、LLM planning 或 hierarchical policy。
- 更好的可解释性分析:可视化智能体对同伴目标的估计过程,分析失败原因。
本任务不要求一定超过所有 baseline,但需要清楚说明改进方法、实验设置和结果变化。如果改进失败,也可以得分,但需要分析失败原因。
期望产出:
- 一个明确的开放问题。
- 一个可运行的改进方法。
- 与任务二 baseline 的对比实验。
- 对结果的解释,包括有效、无效或不稳定的原因。
评分维度:
- 问题定义清晰度(8分)
- 方法设计合理性(12分)
- 实验对比充分性(12分)
- 结果解释与反思(8分)
数据集与技术栈
推荐环境:
- MiniGrid / PettingZoo:用于快速构建多智能体网格任务。
- Overcooked-AI:用于协作烹饪任务和多智能体协作 baseline。
- 自建 Python 网格环境:适合做轻量级课程项目。
推荐技术栈:
- Python 3.9+
- NumPy / Pandas:环境状态、实验日志和结果分析。
- PyTorch / Stable-Baselines3:强化学习 baseline。
- OpenAI API / transformers / LangChain:LLM 智能体和自然语言推理模块。
- Matplotlib / Seaborn:结果图表。
- Streamlit / Gradio:可选,用于展示环境运行过程。
评估标准与预期成果
评分分配(100分):
- 任务一:20分,完成多智能体协作环境和任务场景。
- 任务二:40分,实现并比较不同协作推理智能体。
- 任务三:40分,完成一个开放探索方向并进行实验分析。
预期交付物:
- 完整代码:环境、智能体、实验脚本和 README。
- 实验报告:包括背景、任务定义、方法、实验结果、案例分析和不足反思。
- 可视化材料:任务场景截图、运行录屏或轨迹可视化。
- 结果文件:实验日志、统计表格和主要图表。
加分项:
- 构建网页或交互式界面展示智能体运行过程,最多额外 10 分。
- 加入人类参与实验,例如让人类观察者判断智能体意图,并与模型估计对比,最多额外 10 分。
- 将任务扩展到 3 个以上智能体或更复杂的开放环境,最多额外 10 分。
最终成绩超过 100 分时按 100 分计算。
参考文献
- Baker, C. L., Saxe, R., & Tenenbaum, J. B. (2009). Action understanding as inverse planning. Cognition, 113(3), 329-349. https://doi.org/10.1016/j.cognition.2009.07.005
- Rabinowitz, N. C., Perbet, F., Song, H. F., Zhang, C., Eslami, S. M. A., & Botvinick, M. (2018). Machine theory of mind. In Proceedings of the 35th International Conference on Machine Learning (pp. 4218-4227). PMLR. https://proceedings.mlr.press/v80/rabinowitz18a.html
- Carroll, M., Shah, R., Ho, M. K., Griffiths, T. L., Seshia, S. A., Abbeel, P., & Dragan, A. D. (2019). On the utility of learning about humans for human-AI coordination. In Advances in Neural Information Processing Systems 32. https://papers.nips.cc/paper_files/paper/2019/hash/f5b1b89d98b7286673128a5fb112cb9a-Abstract.html
- Lowe, R., Wu, Y., Tamar, A., Harb, J., Abbeel, P., & Mordatch, I. (2017). Multi-agent actor-critic for mixed cooperative-competitive environments. In Advances in Neural Information Processing Systems 30. https://papers.nips.cc/paper_files/paper/2017/hash/68a9750337a418a86fe06c1991a1d64c-Abstract.html
- Chevalier-Boisvert, M., Willems, L., & Pal, S. (2018). Minimalistic Gridworld Environment for Gymnasium. GitHub repository. https://github.com/Farama-Foundation/Minigrid
- Terry, J. K., Black, B., Grammel, N., Jayakumar, M., Hari, A., Sullivan, R., Santos, L. S., Dieffendahl, C., Horsch, C., Perez-Vicente, R., Williams, N. L., Lokesh, Y., & Ravi, P. (2021). PettingZoo: Gym for multi-agent reinforcement learning. In Advances in Neural Information Processing Systems 34. https://proceedings.neurips.cc/paper/2021/hash/7ed2d3454c5eea71148b11d0c25104ff-Abstract.html