基于这一理念,上海交通大学与牛津大学的研究团队提出了一项创新方案 —— 基于多智能体模拟的数据合成。团队提出了 MATRIX——AI 社会模拟器,构建了一个由 1000 多个 AI 智能体组成的模拟社会。在这个模拟社会中,每一个 AI 智能体代表了一个拥有独立身份和人格的数字人,这些 AI 智能体可以模拟出复杂的交流和互动模式,涵盖了从App开发到商业活动的广泛场景。基于这些场景,团队进一步开发了 MATRIX-Gen 数据合成器,能够根据不同需求合成高度多样化且高质量的训练指令数据。
本研究提出的后训练系统旨在利用基于多智能体模拟技术构建的 AI 模拟社会,合成高质量的训练数据,以提升预训练大语言模型的指令跟随能力。该系统的核心理念源于人类在现实场景中提问的方式 —— 人们基于自身需求提出多样且深入的问题。因此,本研究通过 AI 模拟社会合成人类社会中的场景,并利用这些场景引导 LLM 提出信息丰富、贴近现实的问题,从而产生高质量的训练数据。
如下图所示,该系统包含三个步骤:
1. 合成社会场景:利用多智能体模拟技术构建 AI 模拟社会,该社会中的每个场景由一组 AI 智能体及其对应的文本行动构成。为了确保社会场景的真实性和多样性,本研究设计了大规模人类社会模拟器 MATRIX,创建了一个包含各种 AI 智能体的互动环境。此模拟器充分发挥了 LLM 的角色扮演能力,使得 AI 智能体能够逼真地模拟人类行为,进行规划、观察和行动,进而生成丰富且高度真实的社会场景。
为了合成多样且丰富的场景,以助力数据的合成,本研究提出了人类社会模拟器 MATRIX。该模拟器的输入为若干 AI 智能体档案,输出为文本形式的场景。通过模拟人类的 AI 智能体和结构化的通信机制,MATRIX 实现了大规模的人类社会模拟,从而生成多样且真实的场景。
模拟人类的智能体:每个 AI 智能体根据匿名化的真实人类档案进行初始化,并由 LLM 生成其个性和人生目标。这些目标进一步分解为可实行的步骤,形成 AI 智能体的行动计划。例如,一个医学教授的生活目标可能包括传播科学常识,而其计划则包括进行研究、发表论文、进行讲座和组织教育项目。这些步骤引导 AI 智能体未来的行动,确保它们朝着目标努力并展现出有目的的行为。当出现新观察时,AI 智能体会根据其记忆和个性做出反应;在没有新观察的情况下,它们则遵循既定计划追求目标。
结构化的通信机制:受人类社会中同质性现象的启发,大家根据相似特征对 AI 智能体进行分组,以减少不必要的连接,从而提高模拟的可扩展性。在每组中,本研究引入一个集中调节器来管理组内和组间的沟通。这一设计促进了相似 AI 智能体之间的更多互动,同时仍允许长距离交流,丰富信息流并增强真实性。此外,这种结构化通信机制能够防止 AI 智能体接收到过多无关信息,确保模拟的有效性。
本研究提出了一种基于 AI 智能体社会模拟的后训练数据合成框架。依托 MATRIX 合成的 AI 模拟社会,MATRIX-Gen 能够可控地合成高质量的多样数据。在通用和专用任务中,仅使用 0.2% 的数据,即可获得优于大模型研发领军团队 Meta AI 所用数据集的模型训练效果,突显了 MATRIX-Gen 在数据合成中的优势。
本研究希翼该数据合成框架能够帮助定量研究何种类型的数据更适合用于监督微调和偏好优化,深入探讨不同数据特性对模型性能的影响。此外,大家展望通过引入更强大的 AI 智能体,如具备工具调用能力的 AI 智能体,以及接入更丰富的环境,进一步合成更复杂的数据,从而提升大语言模型在复杂任务中的表现。