MindGrid: 基于心理理论的多智能体协作推理仿真

项目背景与目标

人在协作任务中不仅需要观察环境,还需要推测他人的目标、知识状态和下一步行动。例如,两个人一起整理房间时,一个人可能会根据同伴正在走向的位置,推断其想要拿取的物体,并提前让路或递交工具。这类能力通常被称为心理理论(Theory of Mind),也是认知推理、社会协作和人机交互中的核心问题。

当前许多智能体评测环境主要关注单个智能体的任务完成率,较少显式考察智能体是否能够表示并利用“他人可能知道什么、想做什么、会怎么行动”。本项目旨在构建一个轻量级多智能体网格环境 MindGrid,要求智能体在部分可观测、目标不完全共享、需要沟通或协作的任务中完成推理决策。学生需要实现基本环境、构建不同类型的智能体,并分析心理理论建模是否能提升协作表现。

本项目适合作为本科生小组课程作业。重点不在于开发大型平台,而在于清楚定义任务、实现可运行 baseline、给出可解释的实验比较。

核心任务设计

任务一:多智能体协作环境构建(20分)

构建一个简单的二维网格世界,用于模拟两个或多个智能体在部分可观测条件下完成协作任务。环境可以自行实现,也可以基于 MiniGrid、PettingZoo、Overcooked-AI 等已有环境修改。

环境至少应支持以下元素:

  • 多个智能体,每个智能体拥有自己的位置、视野和可执行动作。
  • 多个物体或目标点,例如钥匙、箱子、门、工具、任务区域等。
  • 部分可观测机制,例如智能体只能看到局部视野,或只能知道部分物体状态。
  • 一个需要协作才能完成的任务,例如一名智能体开门、另一名智能体搬运物体,或两名智能体需要交换信息后选择正确目标。

期望产出:

  • 环境代码和运行说明。
  • 至少 3 个不同难度的任务场景。
  • 每个场景的截图或录屏。
  • 对状态空间、动作空间、奖励函数和任务成功条件的说明。

评分维度:

  • 环境可运行性(8分)
  • 任务设计清晰度(6分)
  • 部分可观测与协作机制设计(4分)
  • 可视化或日志记录(2分)

任务二:协作推理智能体实现与对比(40分)

在任务一的环境中实现并比较不同类型的智能体。学生至少需要完成一个规则型 baseline 和一个学习或语言模型驱动的智能体。

可选智能体包括:

  • 规则型智能体:基于手写策略完成导航、交互和简单协作。
  • 强化学习智能体:使用 PPO、DQN、A2C 等方法训练策略。
  • 大语言模型智能体:将环境状态转化为自然语言描述,由 LLM 输出动作或高层计划。
  • 心理理论智能体:维护对其他智能体目标、可见信息或下一步动作的估计,并据此调整自己的策略。

建议比较以下问题:

  • 只根据自身观察行动的智能体,与显式建模同伴状态的智能体相比,表现有何差异?
  • 在部分可观测程度增加时,不同智能体的任务成功率如何变化?
  • 加入简单沟通机制后,智能体是否更容易完成任务?

期望产出:

  • 至少两类智能体的实现代码。
  • 至少一个定量评估指标,例如成功率、平均完成步数、平均奖励或沟通次数。
  • 至少 20 次运行结果的统计表格。
  • 对典型成功和失败案例的简要分析。

评分维度:

  • baseline 实现完整性(10分)
  • 学习型或 LLM 智能体实现(10分)
  • 心理理论变量或同伴建模设计(10分)
  • 实验对比与结果分析(10分)

任务三:开放探索与改进(40分)

在完成前两项任务的基础上,选择一个开放问题进行深入探索。目标是提出一个具体改进,并用实验说明它是否有效。

可选方向包括:

  • 更好的同伴建模:预测同伴目标、视野、动作或错误信念。
  • 更好的沟通策略:限制通信轮数或消息长度,研究智能体如何选择最有用的信息。
  • 更复杂的任务组合:加入诱饵目标、动态障碍、临时角色分工或任务冲突。
  • 更强的规划能力:结合搜索、树搜索、LLM planning 或 hierarchical policy。
  • 更好的可解释性分析:可视化智能体对同伴目标的估计过程,分析失败原因。

本任务不要求一定超过所有 baseline,但需要清楚说明改进方法、实验设置和结果变化。如果改进失败,也可以得分,但需要分析失败原因。

期望产出:

  • 一个明确的开放问题。
  • 一个可运行的改进方法。
  • 与任务二 baseline 的对比实验。
  • 对结果的解释,包括有效、无效或不稳定的原因。

评分维度:

  • 问题定义清晰度(8分)
  • 方法设计合理性(12分)
  • 实验对比充分性(12分)
  • 结果解释与反思(8分)

数据集与技术栈

推荐环境:

  • MiniGrid / PettingZoo:用于快速构建多智能体网格任务。
  • Overcooked-AI:用于协作烹饪任务和多智能体协作 baseline。
  • 自建 Python 网格环境:适合做轻量级课程项目。

推荐技术栈:

  • Python 3.9+
  • NumPy / Pandas:环境状态、实验日志和结果分析。
  • PyTorch / Stable-Baselines3:强化学习 baseline。
  • OpenAI API / transformers / LangChain:LLM 智能体和自然语言推理模块。
  • Matplotlib / Seaborn:结果图表。
  • Streamlit / Gradio:可选,用于展示环境运行过程。

评估标准与预期成果

评分分配(100分):

  • 任务一:20分,完成多智能体协作环境和任务场景。
  • 任务二:40分,实现并比较不同协作推理智能体。
  • 任务三:40分,完成一个开放探索方向并进行实验分析。

预期交付物:

  • 完整代码:环境、智能体、实验脚本和 README。
  • 实验报告:包括背景、任务定义、方法、实验结果、案例分析和不足反思。
  • 可视化材料:任务场景截图、运行录屏或轨迹可视化。
  • 结果文件:实验日志、统计表格和主要图表。

加分项:

  • 构建网页或交互式界面展示智能体运行过程,最多额外 10 分。
  • 加入人类参与实验,例如让人类观察者判断智能体意图,并与模型估计对比,最多额外 10 分。
  • 将任务扩展到 3 个以上智能体或更复杂的开放环境,最多额外 10 分。

最终成绩超过 100 分时按 100 分计算。

参考文献

Previous
Next