2026 · LLM SOCIAL COGNITION EVALUATION CHALLENGE

SocialMind
大模型社会认知能力评测挑战赛

评测大模型的心理状态推断、社会互动策略理解和社会文化规范判断能力。

赛道
模型赛道
队伍
1–3 人
评测
主办方统一运行

01 / OVERVIEW

赛题内容

评测题目以社会情境故事为输入,要求模型识别人物心理状态、互动意图与适用的社会规范。

01

MENTALIZATION

心智化能力

推断他人的信念、欲望、意图与情绪,区分自我和他人的信息边界。

02

INTERACTION

社会互动策略

在沟通、协商、合作与冲突中识别社会信号,形成连贯、有效的行动判断。

03

SOCIAL NORMS

社会文化规范

理解身份、角色、权力关系与情境规范,在多元社会环境中保持适当性。

02 / BENCHMARK FOUNDATION

双榜赛制

赛事设置 A 榜和 B 榜两个阶段,均基于 SoMBench 对模型的社会认知能力进行统一评测。

3
一级能力维度
17
二级能力维度
71
任务范式
了解 SoMBench
A

A 榜

A 榜评测

开放时间:7 月 27 日至 8 月 6 日。

B

B 榜

B 榜评测

开放时间:8 月 7 日至 8 月 9 日。

03 / EVALUATION SAMPLES

三类评估数据样例

DIMENSION 1

心智化能力

第一人称 · 单项选择

故事

午休前,实验室管理员顾宁把一台灰色录音仪放进靠窗的蓝色器材柜,随后去参加会议。她离开后,维修人员因柜门故障,把录音仪转移到走廊尽头的白色储物柜,并在值班本上做了记录。新来的助理罗澄全程看见了转移,但没有联系顾宁。

会议结束后,顾宁直接回到实验室,说要马上取录音仪去采访。罗澄正准备告诉她值班本上的记录,但顾宁还没有看见值班本,也没有打开任何柜子。

问题

在罗澄开口之前,顾宁最可能先去哪里找录音仪?

  1. A靠窗的蓝色器材柜
  2. B走廊尽头的白色储物柜
  3. C维修人员的工具箱
  4. D值班台下面

QUESTION TYPES

四类题型与评测方式

三类能力维度说明评测内容,Q1–Q4 说明模型如何作答以及答案如何计分。

Q1

单项选择

模型输入
一段社会情境、一个问题和 4 个候选答案
模型输出
只选择 1 个最准确的答案,输出对应选项标签,如 B
评测标准
所选标签与标准答案完全一致才计为正确,最终按准确率汇总
Q2

多项选择

模型输入
一段社会情境、一个问题和 5 个待判断的候选陈述
模型输出
选出全部正确陈述,输出完整的选项标签集合,如 A、C
评测标准
输出集合与标准答案完全一致才计为正确;漏选或多选均不得分
Q3

判断与推理

模型输入
一段社会情境和一个需要判断真伪或能否推出的陈述
模型输出
在“是 / 否(不是) / 无法确定(不确定)”中选择一种判断,并输出对应选项标签
评测标准
判断类别与标准答案完全一致才计为正确,最终按准确率汇总
Q4

开放分析

模型输入
一段社会情境和一个包含明确分析任务的开放问题
模型输出
用自然语言逐项回答,给出结论、情境依据和完整推理
评测标准
Judge model 按题目所属能力维度的专用 rubric,评价内容正确性、情境依据与分析完整性

04 / TRACKS

参赛信息

支持个人或团队报名,提交开放权重模型后由主办方统一评测。

MODEL
TRACK

唯一赛道

模型提交

提交托管模型仓库和限时只读访问凭证,由主办方在统一环境、固定推理参数下完成评测。

  • 模型要求开放权重 · ≤ 20B
  • 成功评测额度A 榜每日 2 次 · B 榜全程 3 次
  • 评测执行主办方统一运行
查看参赛指南
形式
线上参赛,线下领奖。优秀参赛团队将有机会受邀参加 8 月 15 日的暑期学校,并获得奖金和奖励证书。
申请者
面向全国高校本科生、硕士研究生、博士研究生、青年教师,以及科研机构和企业的研发人员开放报名。支持个人或团队报名。

05 / TIMELINE

赛事时间线

  1. A 榜

    参赛队伍可提交模型进行 A 榜评测。

  2. B 榜

    所有参赛队伍均可进入 B 榜,每队在整个 B 榜阶段最多计入 3 次成功评测;失败后可重新提交。

  3. 技术复核和通知获奖团队

    最终成绩按 A 榜成绩 60% 与 B 榜成绩 40% 加权计算,并进行技术复核和通知获奖团队。

  4. 暑期学校

    优秀参赛团队受邀参加暑期学校。

06 / AWARDS

奖项设置

奖项数量奖励
一等奖1 项奖金 3 万元
二等奖2 项奖金 1 万元
三等奖若干项参赛纪念品

07 / EVALUATION

评分与排名

A 榜和 B 榜分别生成阶段成绩,最终成绩由两阶段成绩加权计算。

01

统一协议

固定任务、提示模板与推理参数,由主办方运行,降低环境差异带来的偏差。

02

多粒度结果

同时提供总体成绩、题型成绩和细粒度能力分析,不以单一总分掩盖结构性短板。

03

综合排名

最终成绩由 A 榜成绩和 B 榜成绩加权组成,并在合规核验后确定获奖结果。

A 榜成绩60%
B 榜成绩40%
最终成绩加权合计

08 / RULES

参赛规则

A

报名与组队

  1. 每支队伍由 1–3 人组成;每位参赛者只能创建或加入一支队伍,退出队伍后 24 小时内不能创建或加入新的队伍。
  2. 队伍邀请须由受邀者在通知页面确认;成员接受后共享同一个队伍 ID。
  3. 个人参赛也须创建单人队伍;组队参赛时,所有成员共享同一个队伍 ID。

B

提交与合规

  1. 仅接受不超过 20B 参数的开放权重模型;版本默认为 master,建议使用固定标签或提交哈希,main 和 latest 不予受理。
  2. A 榜与 B 榜额度相互独立:A 榜每队每个北京时间自然日最多计入 2 次成功评测;B 榜每队在整个阶段最多计入 3 次成功评测。排队中或评测中的任务临时占用对应额度,失败后释放。访问令牌须采用最小权限并设置有效期。
  3. 为保护评测队列,每个账号每 60 分钟最多发送 12 次提交请求;该限制不消耗每日成功评测额度。
  4. 禁止获取、泄露或反推测试标签,禁止人工逐题修改最终答案。
  5. 外部模型、数据、知识库和工具须遵守相应许可;违规提交将被取消成绩。

C

评测与排名

  1. 主办方在统一环境中执行评测;A 榜和 B 榜的评测数据及答案均不公开。
  2. 每个榜单按总体准确率降序排列;总体准确率相同的队伍并列。
  3. 所有参赛队伍均可进入 B 榜。最终成绩 = A 榜成绩 × 60% + B 榜成绩 × 40%;没有 A 榜成绩的队伍按 A 榜 0 分计算,获奖结果须通过合规核验。

09 / ORGANIZATIONS

组织单位

主办单位
中国科学院计算技术研究所
承办单位
智能算法安全全国重点实验室
赛事运营
yangjun24s@ict.ac.cn

更多合作与赞助席位,诚邀加入

10 / FAQ

常见问题

找回密码或咨询赛事相关问题,请发送邮件至 yangjun24s@ict.ac.cn

如何报名参赛?

先在右上角注册赛事账户并完善基本信息,再创建或加入队伍。退出队伍后 24 小时内不能创建或加入新的队伍。拥有队伍 ID 后,可从参赛入口提交模型。

可以一个人参赛吗?

可以。队伍支持 1–3 人,单人创建队伍后即可获得队伍 ID。

为什么要提交只读令牌?

主办方需要拉取私有仓库完成统一评测。请使用仅允许读取目标仓库的限时令牌,不要提交主账号密码或拥有写权限的令牌。

参赛咨询

参赛者答疑群

扫码进入参赛选手咨询微信群

参赛选手咨询微信群二维码