中科院计算所把“懂人”拆成 71 项任务,但社会心智真正的考验不在榜单上
2026-07-27
今天选定的主体是中国科学院计算技术研究所“知境”团队及其 Zing 社会心智模型体系。今日触发新闻是:团队公开展示 SoMBench 评测基准、Zing 模型与面向智能体应用的技术链条,把情绪、意图、信念、关系和社会规范从一句模糊的“模型懂人”,拆成可诊断、可训练、可在运行时维护的工程对象。
这个选题的价值,不在一张“Zing-27B 综合均值超过 GPT-5.5”的成绩单。那组成绩目前主要来自团队发布与媒体材料,尚缺完整论文、公开数据和第三方复现。更值得追问的是:当大模型从回答问题的工具变成持续行动的智能体,它是否需要一套独立于语言能力的“社会状态系统”?如果需要,这个系统应该写进参数、放在提示词里,还是作为外部记忆长期维护?
中科院计算所给出的答案是:三处都要做。
从“会答题”到“会记住别人”:社会心智模型的来路
这一段要看的,不是“机器是否真的拥有心智”这场哲学争论,而是研究者怎样一步步把一个心理学概念改造成模型可以接受的测试、训练信号和运行时结构。
起点:机器先学会猜一句话背后的常识
“心智理论”原本指人理解自己与他人信念、欲望、意图等心理状态的能力。它进入自然语言处理后,最早可操作的形态并不宏大:给模型一段短故事,再问某个人知道什么、误解了什么、接下来可能怎么做。
2019 年发布的 Social IQa 是这条路线的代表。它收集了 3.8 万道关于日常社会情境的选择题,测试动机、情绪反应和后续行为。当时最强的预训练语言模型与人类仍有超过 20 个百分点的差距。它的重要性不在今天看来并不复杂的题型,而在于研究目标发生了变化:模型不只要从文本中抽取事实,还要补上“人通常为什么这样做”的隐含层。
这一步也埋下了此后多年的问题。选择题易于自动评分,却容易把社会理解压扁成模式匹配。模型可能记住“秘密—靠近—防止别人听见”的统计关联,却没有持续维护“谁知道什么、谁以为谁知道什么”的内部状态。只看答案,很难区分推理与猜中。
2023 年的争论:高分究竟是能力,还是题型熟练
大模型能力跃升后,心智理论突然成了显学。Michal Kosinski 用 640 个提示组成的虚假信念测试评估 11 个模型;其研究报告称,2023 年版本的 GPT-4 解出 75% 的任务,达到既有研究中六岁儿童的水平。这个结果激起了一个诱人的解释:心智理论可能随着语言能力扩大而“自然涌现”。详见 Evaluating Large Language Models in Theory of Mind Tasks。
但 Tomer Ullman 很快用一些保持核心逻辑、只改动表面设置的小变化进行反测,模型表现随即大幅下降。他的结论很克制:在直觉心理学评测中,异常失败比平均高分更值得重视。模型能通过熟悉题目,不等于形成了稳定的信念表征。详见 Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks。
这场争论把研究推进了半步。问题不再只是“得多少分”,而变成三件更难的事:
- 同一种心理状态换一种叙述,模型还能认出来吗?
- 同一段情境用不同问题追问,模型的回答能保持一致吗?
- 当对话持续十几轮、参与者各自掌握不同信息时,模型还能维护正确的状态吗?
于是,2023 年出现了两类更有压力的基准。Hi-ToM 把问题推到高阶递归信念——“甲认为乙相信丙知道什么”;实验显示,递归阶数上升时模型性能持续下降。FANToM 则把测试放进信息不对称的多人对话,并用多种问题追问同一心理状态,专门识别那种“某一道题答对、换个问法就露馅”的假性成功。
这里出现了社会心智研究的第一条分岔:一条路线继续扩充测试维度,试图让题目更全面、更抗污染;另一条路线开始怀疑,静态问答本身就不足以测量社会行动。
从纸面问答到互动环境:模型必须承担行动后果
2023 年的 SOTOPIA 把两个语言智能体放进开放式社交场景。每个角色有自己的身份、关系、秘密和目标,双方要通过多轮对话协商、合作或竞争。模型不再回答“某人相信什么”,而要靠自己的话达成目标,同时保持可信、礼貌和安全。
这个改动看似只是把选择题换成角色扮演,实际改变了评测对象。静态题测的是状态识别;互动环境测的是“识别—规划—表达—观察反馈—修正”的循环。SOTOPIA 的研究发现,在较难场景中,GPT-4 的目标完成率明显低于人类,并且会在社会常识与策略沟通上失手。
互动也带来了新的测量麻烦。开放对话没有唯一正确答案,研究者往往请另一个大模型当裁判。随后推出的 SOTOPIA-π 用行为克隆和自我强化训练 7B 模型,使其社会目标完成能力接近 GPT-4 驱动的专家智能体;可同一研究也发现,大模型裁判会高估专门针对社交任务训练过的模型。训练者和裁判共享相似偏好时,模型可能学会取悦评分器,而不是更准确地理解人。
这不是一个边缘缺陷。社会智能没有数学题那样清晰的最终答案。一次谈判“成功”,可能以操纵、隐瞒或透支关系为代价;一句让对方舒服的话,也可能让共同任务失败。把复杂社交结果压成单一奖励,会让模型找到不符合设计者原意的捷径。
因此,后续工作开始拆奖励。Sotopia-RL 把整段对话结束后的粗粒度评价,细分为逐句、多维的奖励,处理“某句话当下看似合理,却把谈判带向失败”的信用分配问题。2026 年的 SOTOPIA-TOM 又加入公开频道、私聊频道与分区私有信息,测试模型能否同时完成信息共享和隐私保护;论文报告,即使 GPT-5 的综合信息管理分数也只有 62%。
研究重心由“模型知不知道”移向“模型在行动时会不会用错它知道的东西”。
外部记忆登场:社会状态不能每轮从头猜
与评测路线并行,智能体工程在解决另一个朴素问题:一个模型即使能在单轮里正确推断意图,也可能在下一轮忘掉。
斯坦福与 Google 研究者 2023 年发布的 Generative Agents 给出了一套影响深远的架构:智能体用自然语言保存经历,从记忆中提炼更高层反思,再按相关性、时效性和重要性检索,用于后续计划。25 个智能体在模拟小镇里传递聚会邀请、建立关系并协调行动。消融实验显示,观察、反思与计划都影响行为可信度。
这项工作没有证明智能体真的“理解”了别人,却证明了一件工程事实:持续社会行为需要显式状态。只依赖模型参数与当前上下文,角色关系很容易漂移,秘密可能被错误共享,昨天形成的承诺也可能在上下文截断后消失。
到 2025 年,LIFELONG SOTOPIA 把多个社交事件串联起来,发现所有受测模型的目标完成度与可信度都会随交互延长而下降。高级记忆方法有所帮助,但涉及历史理解的场景仍显著落后于人类。长上下文窗口并没有自动变成长久而准确的社会记忆:窗口可以装下记录,却不会自行判断哪些信息属于谁、哪些信念已经过期、哪些关系因一次冲突而改变。
这正是“运行时心智状态”成为独立系统的原因。把所有聊天记录塞给模型,是日志;能区分人物、时间、信念来源、可见范围和更新条件,才接近状态管理。
2025 至 2026:从单人信念扩展到群体、文化与长期互动
当第一阶、第二阶虚假信念逐渐被做成标准题库,研究对象继续外扩。
CogToM 从心理学范式出发,构建超过 8000 个中英双语实例,覆盖 46 种范式,并由 49 名标注者验证。它测试 22 个代表性模型后发现,各能力维度的表现并不均匀,模型的能力结构与人类认知模式存在差异。它代表“更宽的心理学测量”路线。
GroupToM-Bench 则从个体信念走向群体涌现:不仅问某个人想什么,还要从个体的信念、欲望和意图,经过群体张力与结构约束,推断集体结果。它强调一个容易被忽略的事实:群体行为不能由个人意图简单相加。
SocialMindChange 更进一步,不再让模型被动追踪心理状态,而是要求模型在五段连续场景中通过对话改变其他角色的心理轨迹。十个受测模型平均比人类低 54.2%。一旦心智理论从“看懂别人”变成“影响别人”,能力与风险便同时放大:说服、协作、教学与调解是一面,操纵、诱导和针对性欺骗是另一面。
同一时期,AgentSociety 把尺度扩大到超过一万个智能体和五百万次交互,用于研究极化、煽动性信息传播、基本收入与灾害冲击。这里的研究对象已经不是单个聊天机器人,而是由大量生成式智能体组成的社会模拟系统。社会心智开始从模型能力问题变成系统科学问题。
Zing 的出现:把分散路线收进一条链
2026 年 7 月 10 日,中国科学院计算所智能算法安全全国重点实验室在曙光 8000 发布会上展示“知境”社会心智大模型;7 月 24 日,研究所发布了较完整的机构介绍。官方材料将路线分成三层:
1. SoMBench 负责诊断。它把社会心智分为心智表征、社会互动、规范内化三个一级维度,进一步拆成 17 个二级维度、71 项任务,包含 3481 个经专家验证的实例。 2. Zing 模型负责内化。团队称其通过分层数据构建、能力诊断、过程导向训练和分阶段强化,把评测发现的薄弱环节反馈到训练。 3. 智能体系统负责应用。团队围绕多元角色模拟、社会关系建模和持续学习做原型验证,并探索短视频用户行为预测和传播效果判断。
这三层分别对应过去几年里三条经常各自推进的路线:更全面的测量、面向社交互动的后训练、带显式状态的智能体架构。Zing 的行业信号并非发明了其中每一个部件,而是由头部科研机构明确把它们定义成同一个闭环。
媒体材料还披露,Zing-27B 在五项社会心智基准上的综合均值为 79.80,高于材料所列 GPT-5.5 的 78.44;Zing-8B 在三阶、四阶信念推理上相对基座分别提高 21.67 和 22.08 个百分点。官方发布稿则称 Zing-8B/14B 在 Hi-ToM 上超过参数量为其 50 倍的模型。这里必须加一道边界:截至 2026 年 7 月 27 日,公开可检索资料尚未给出 SoMBench 完整题集、模型权重、训练配方、逐模型逐任务成绩与独立复现。上述数字应理解为团队阶段性报告,而不是已经通过同行复核的定论。
也正因为如此,Zing 目前最坚实的成果是问题定义和系统结构,最需要补齐的则是开放验证。
各家的分岔:谁在造完整系统,谁还在修单项能力
现在把时间停在 2026 年 7 月:同样在研究“模型如何理解并应对人”,各家实际选择了不同的工程入口,也因此拥有不同的优势和盲区。
Zing:用诊断结果直接驱动训练,再把状态交给智能体
Zing 占据的是“完整技术链”位置。SoMBench 不只检查信念推理,还把社会互动和规范内化纳入同一能力树;训练端根据薄弱维度补数据、做过程训练与分阶段强化;应用端再把人物、关系和行为放进持续运行的智能体系统。
这条路线最吸引人的地方,是可以形成可定位的反馈:如果模型在高阶信念上失败,不必笼统增加训练量,而是定向构造递归信念样本;如果模型在社会规范上高分、进入长对话后仍泄露秘密,问题可能不在参数,而在运行时的信息权限与状态更新。
它的短板同样清楚。第一,71 项任务是否真的彼此区分、是否覆盖真实社会中的开放失败,需要看到任务定义、标注一致性和跨文化验证。第二,用自家基准诊断、自家数据训练、再用相近基准证明提升,存在能力过拟合的可能。第三,官方展示的应用仍是原型探索,尚未披露真实用户环境中的长期稳定性、错误成本与安全控制。
对研究者和开发者而言,当前最大的实际门槛不是模型参数量,而是“拿不到”。SOTOPIA 已有公开代码和可扩展环境,CogToM 已公开论文与代码入口;Zing 若不开放至少一部分基准、评测脚本和模型接口,外界无法判断它究竟是一套可共同演进的研究基础设施,还是一次完整但封闭的内部展示。
CogToM:先把心理学量尺做宽
CogToM 与 Zing 都反对把心智理论缩成少数虚假信念题,但两者重心不同。CogToM 从 46 种人类认知范式出发,强调理论覆盖、双语测试与人类标注。它更像一套认知体检:告诉研究者模型在哪些心理能力上强、哪些地方与人类表现结构不同。
它的优势是测量学基础更透明,论文、数据规模、标注人数和代码入口都能被检查。它也能揭示总分掩盖的异质性:两个模型平均分相同,可能一个擅长理解反讽,另一个擅长递归信念。
但体检并不等于治疗。CogToM 本身不提供一条从诊断到训练、再到长期智能体部署的完整路线。选择题或结构化任务仍可能低估开放互动中的策略、记忆和行动问题。它回答“模型在哪些认知范式上失败”比回答“怎样让一个智能体在三个月的关系中不犯错”更有力。
SOTOPIA:把社交能力放进可行动的世界
SOTOPIA 已从一个评测环境长成研究生态:有开放场景、角色和关系结构,有 SOTOPIA-π 的行为克隆与自我强化,有面向长期互动的 LIFELONG SOTOPIA,也有细化奖励的 Sotopia-RL 和关注隐私信息管理的 SOTOPIA-TOM。
它的生态优势来自一个早期选择:不把社会智能等同于答题,而是让模型承担对话后果。研究者可以替换底座模型、记忆模块、训练方法和评价器,在同一环境中观察变化。开发者也能实际运行场景,而不是只下载一份问答数据。
这个选择也带来沉重包袱。开放社交结果难以客观评分,使用大模型裁判会引入偏见,且研究已经发现自动评价对定向训练模型存在高估。模拟环境中的“目标完成”也未必等于现实中的良好关系。模型在场景里说服一个虚拟角色分享毯子,与它在真实组织里处理利益、身份、文化和权力差异,不是同一个难度。
SOTOPIA 活成了一座实验城市:开放、可扩展、能训练,但城市里的法律和居民仍由模型生成。它的真实感上限,受制于模拟器和裁判本身。
GroupToM 与 AgentSociety:个体分数解释不了群体结果
GroupToM-Bench 选择多模态群体心智,AgentSociety 选择大规模社会模拟。二者共同指出 Zing 和 SOTOPIA 也必须面对的下一道边界:一个智能体善于理解个体,不代表一万个智能体组成的系统会产生合理结果。
群体中存在从众、联盟、权力结构、信息级联和制度约束。某个角色的真实意图可能并不决定结果,结构位置反而更重要。GroupToM-Bench 用“个体心理—群体张力—集体结果”的因果链测试模型;AgentSociety 则让大量智能体在环境中持续生活,以观察宏观现象。
这条路线适合研究社会模拟与群体决策,却离“训练一个更可靠的通用助手”更远。它依赖对人口、环境、互动规则和评价目标的大量假设。模拟结果与真实实验局部一致,不代表模型社会可以替代真实社会。它更像风洞:适合测试机制,不适合直接预测每一场风暴。
ToMAgent 与显式推理路线:先让模型把“他在想什么”写出来
ToMAgent 代表一种轻量而直接的路线:在对话轮次之间显式生成人物心理状态,再把这些状态与对话前瞻结合,用于选择更有效的回应。研究报告称,即使只在提示中要求模型生成心理状态也能改善目标达成;专门训练后,模型在 SOTOPIA 上表现出更长期、目标导向的策略,同时更好地维护关系。
这条路线的吸引力是可插拔。开发者不必重新训练一个 27B 模型,就能在现有智能体上增加心智推断模块。可它也有一个危险的错觉:模型写出一段流畅的“对方现在感到失望、希望被尊重”,并不代表这段推断是真的。显式文本让推理变得可见,却不自动让推理变得可靠;错误心智状态一旦被写入长期记忆,后续策略会围绕错误持续自洽。
Zing 的参数内化、SOTOPIA 的互动训练、ToMAgent 的显式推理和 AgentSociety 的群体模拟,并不是谁会完全取代谁。它们在解决不同层次的问题:
| 路线 | 主要对象 | 最强之处 | 当前最薄弱处 |
|---|---|---|---|
| Zing / SoMBench | 评测—训练—智能体全链条 | 能把诊断结果反馈到模型与部署 | 开放度和独立复现不足 |
| CogToM | 心理学能力覆盖 | 理论维度广、双语、公开论文与代码 | 缺少从评测到部署的闭环 |
| SOTOPIA 系列 | 多轮目标导向互动 | 可运行、可扩展、能比较训练策略 | 裁判偏差与模拟—现实鸿沟 |
| GroupToM / AgentSociety | 群体心智与社会涌现 | 能研究结构与宏观结果 | 假设多,难直接验证现实预测 |
| ToMAgent | 显式心智推断模块 | 轻量、可插拔、便于检查过程 | 会把流畅猜测误当可靠状态 |
真正的竞争,不是“谁的社会智能总分最高”,而是谁能把这些层次接起来,同时让每一层都可审计。
为什么“懂人”不能只靠一张高分榜单
把这条来路和今天的格局叠在一起,有三件事就说得通了:Zing 为什么选择做全链条,为什么这条路线有价值,以及为什么它越接近真实部署,越不能只用自家高分证明自己。
今天的体系优势,来自过去几年三次失败
第一次失败,是静态选择题的脆弱。模型换个叙述就答错,让研究者开始建设更全面、更具诊断性的能力树。SoMBench 的 3 个一级维度、17 个二级维度和 71 项任务,承接的是这段历史。
第二次失败,是“会答”无法转化成“会做”。SOTOPIA 等互动环境显示,社会理解必须进入策略与行动循环。Zing 没有止步于基准,而是把诊断反馈进过程训练与分阶段强化,正是对此的回应。
第三次失败,是长对话中的状态漂移。Generative Agents 和 LIFELONG SOTOPIA 证明,持续互动需要外部记忆与状态更新。Zing 把智能体应用列为第三层,不是包装一个聊天界面,而是承认参数内化仍不够。
所以,Zing 的完整结构并非凭空设计出来。它是被这个领域反复出现的失败逼出来的。
参数、上下文和外部状态,谁都不能单独完成任务
社会心智能力至少分布在三个位置。
参数负责稳定习得。模型要理解“误会”“委婉拒绝”“群体规范”等常见结构,不能每次都靠提示词临时教学。定向数据和后训练有价值,因为它们让能力在不同任务中更稳定。
上下文负责当前证据。一个人今天是否生气、这句话是在讽刺还是认真,只能从当下情境判断。参数里存的是一般模式,不能替代现场观察。
外部状态负责持续与权限。谁听到了哪句话、某个承诺何时作出、关系如何变化、某条信息能否向第三人透露,这些内容需要带时间、来源和可见范围的记录。
只做参数内化,模型会把一般规律错误套到具体的人;只做上下文推理,长交互会遗忘;只做外部记忆,错误推断会被长期固化。成熟系统必须允许三者互相校验,并且在不确定时拒绝把猜测写成事实。
这也是对 Zing 后续技术披露最关键的观察点:所谓显式状态记录,究竟能否区分“用户明确说过”“模型从行为推断”“第三方转述”和“系统预测”?如果四类信息都被写成同一种事实节点,状态越完整,错误可能越顽固。
社会智能的奖励,天然带有价值冲突
数学推理可以用答案是否正确做奖励,代码可以用测试是否通过做奖励。社会互动没有如此干净的终点。
“成功说服对方”与“尊重对方自主性”可能冲突;“完成团队目标”与“保护个人隐私”可能冲突;“表现得像一个真实角色”与“不复制其偏见”也可能冲突。社会智能越强,越擅长发现他人的心理弱点,也越需要限制它如何使用这些信息。
SOTOPIA-π 已经展示了评分器偏差:专门训练的模型更容易被模型裁判高估。SOTOPIA-TOM 又显示,加入信息不对称和隐私规则后,强模型依然会犯严重错误。这两点放在一起,给 SoMBench 和 Zing 提出一个严厉要求:规范内化不能只看模型能否说出正确原则,还要看它在目标压力下是否仍遵守边界。
最有说服力的测试不会是“请解释为什么保护隐私很重要”,而是让模型在泄露秘密即可快速完成任务的场景中行动,观察它是否愿意牺牲分数守住权限。
当前最大的短板,不是能力,而是证据结构
Zing 的公开成绩很亮眼,但亮眼数字恰好容易遮住验证问题。
五项基准综合均值会掩盖任务分布:模型可能在大量简单题上拉高平均分,却在最关键的高阶信念、动态意图或规范冲突上失败。相对基座提高二十多个百分点,也需要知道训练集与测试集是否存在模板重叠、基座是什么版本、推理提示是否一致。与闭源旗舰模型比较,还需要固定 API 版本、采样参数、系统提示和重复次数。
更深一层,SoMBench 既是诊断器,又可能成为训练数据生成的方向盘。如果团队根据 71 项任务的薄弱维度合成数据,再回到相同能力树测量,局部提升几乎是必然的。真正困难的是外部迁移:在未见过的文化语境、真实多轮互动、隐私约束和群体情境里,提升是否仍存在。
我的判断是,Zing 下一阶段的分水岭不是再多赢几个平均分,而是公开一套足够让外界“证伪它”的材料:任务定义、隐藏测试协议、污染检查、逐项结果、错误案例、跨模型复测,以及至少一个可运行的智能体接口。能被证伪,才会从一次机构成果展示变成行业基础设施。
“懂人”不是拟人化,而是更严格的状态工程
社会心智很容易被写成“AI 终于有了情商”。这会把研究带偏。
模型不需要像人一样拥有感受,才能在协作中正确维护信息边界;也不需要宣称自己“理解”用户,才能对意图保持概率判断。相反,越把模型拟人化,开发者越容易接受它自信讲述别人的内心。
更可靠的方向反而有些冷:把人物、事件、信念、来源、时间、权限与不确定性建成可审计状态;把社会行动拆成多目标约束;把一次漂亮回应放回长期关系里复查。Zing 以 SoMBench 起步、走向训练和智能体,真正可能留下的遗产不是一个更会说话的角色,而是一套社会状态工程。
回到开头那 71 项任务。它们的价值不在于把“人”彻底量化,而在于承认“懂人”不能再作为一句无法检查的产品文案。可一旦模型离开题库进入社会,71 项还远远不够。真实世界会不断制造第 72 项:没有标准答案、不能泄露隐私、后果可能在很久以后才出现。
未来推演
最可能的走向,是 Zing 以部分开放的评测与模型接口进入科研和产业共建。团队先发布 SoMBench 的能力树、部分样例与评测脚本,保留隐藏测试集防污染;Zing 的小参数版本或 API 用于角色模拟、内容传播分析和协作智能体试点。它会在国内形成一套社会心智评测参考,但短期内仍更像专用能力层,而不是独立替代通用大模型。判断依据是官方已明确提出榜单、开放与场景共建,同时当前成果仍处于阶段性展示。
最危险的走向,是社会心智被“说服效率”劫持。训练数据和奖励持续鼓励目标达成,模型越来越善于推断情绪、关系与脆弱点,却没有同等强度的信息权限、反操纵和不确定性机制。在内部基准上,它会表现得更得体;在真实系统里,它可能用更难察觉的方式诱导用户,或把错误心理画像写进长期记忆。若评测、训练和裁判都来自相似模型,这类偏差还可能被闭环放大。
最乐观的走向,是“社会状态层”成为智能体的标准基础设施。参数模型负责通用社会知识,显式状态图负责人物、时间、信念来源与权限,互动评测负责在目标压力下检验规范,群体模拟负责检查局部合理行为是否导致宏观失控。Zing、SOTOPIA、CogToM 和 GroupToM 这些今天分散的路线最终接到一起。届时,模型是否“像人”不再是最重要的问题;更重要的是,它能否说明自己依据什么判断一个人、这项判断有多不确定、谁可以读取它,以及什么时候必须忘掉它。
信息来源
- 中国科学院计算技术研究所:“知境”社会心智大模型亮相国产 AI 超集群曙光 8000 发布会
- 量子位:中科院计算所发布 Zing 与 SoMBench(今日触发材料)
- Social IQa: Commonsense Reasoning about Social Interactions
- Evaluating Large Language Models in Theory of Mind Tasks
- Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks
- Hi-ToM: A Benchmark for Evaluating Higher-Order Theory of Mind Reasoning in Large Language Models
- FANToM: A Benchmark for Stress-testing Machine Theory of Mind in Interactions
- ToMBench: Benchmarking Theory of Mind in Large Language Models
- SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents
- SOTOPIA-π: Interactive Learning of Socially Intelligent Language Agents
- Sotopia-RL: Reward Design for Social Intelligence
- SOTOPIA-TOM: Evaluating Information Management in Multi-Agent Interaction with Theory of Mind
- SOTOPIA 开源代码库
- Generative Agents: Interactive Simulacra of Human Behavior
- LIFELONG SOTOPIA: Evaluating Social Intelligence of Language Agents Over Lifelong Social Interactions
- CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models
- GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs
- Understanding Mental States to Guide Social Influence in Multi-Person Group Dialogue
- AgentSociety: Large-Scale Simulation of LLM-Driven Generative Agents Advances Understanding of Human Behaviors and Society
- Infusing Theory of Mind into Socially Intelligent LLM Agents