SOCIALMIND CHALLENGE / ENTRY GUIDE

参赛指南与评测规范

仅接受不超过 20B 参数的开放权重模型,由主办方统一评测。

模型提交

01 / UNIFIED PROTOCOL

统一推理协议

主办方按统一提示模板与推理参数运行参赛模型。

protocolcot
temperature0.6
top_p0.95
max_tokens8192
n_samples1

输入

相同任务与运行条件

所有模型使用相同的任务输入与运行条件。

输出

统一解析与评分

所有输出由同一评测程序解析、计分与汇总。

02 / DATA AND INPUT

赛题任务与数据说明

任务包括心智化能力、社会互动策略和社会文化规范。

01 / MENTALIZATION

心智化能力

信念、意图、情绪、知识状态与多阶心理推断

02 / INTERACTION

社会互动策略

言语行为、沟通、协作、冲突与策略选择

03 / SOCIAL NORMS

社会文化规范

身份、角色、权力关系、偏见与情境适当性

参考训练数据

仅用于帮助理解赛题,实际训练效果不作保证。参赛者可在此基础上进行数据清洗和数据合成。

样本
3,816
能力维度
71
题型
Q1–Q3
下载训练数据

公开测试数据

覆盖 71 个能力维度和 Q1–Q3 题型。测试样例不包含在真实测试数据中。

样本
213
能力维度
71
格式
JSONL
下载测试数据

03 / SCORING

评测流程、计分与排名

所有队伍均可进入 B 榜;最终成绩 = A 榜成绩 × 60% + B 榜成绩 × 40%。

锁定版本

按提交的仓库与 revision 加载模型

准备输入

按统一协议构造输入

统一推理

按固定模板与参数运行

统一判分

按内部评分配置处理

聚合发布

生成总分与三类能力成绩

04 / BEFORE SUBMISSION

模型提交规范

模型仓库须保持可访问,模型能够正常加载。

  1. 登录赛事账户,并创建或加入队伍;退出队伍后 24 小时内不能创建或加入新的队伍。
  2. 准备可加载的 ModelScope 仓库;版本默认为 master,建议使用固定标签或提交哈希,main 和 latest 不予受理。
  3. 模型须为开放权重模型,参数规模不得超过 20B。A 榜与 B 榜额度相互独立:A 榜每队每日最多计入 2 次成功评测;B 榜每队全程最多计入 3 次成功评测。排队中或评测中的任务临时占用对应额度,失败后释放。
  4. 为保护评测队列,每个账号每 60 分钟最多发送 12 次提交请求;该限制独立于每日成功评测额度。
  5. 仅创建目标仓库的限时只读令牌,不要提交账号密码、写权限令牌或覆盖其他仓库的令牌。
  6. 确认模型权重、配置及所需自定义代码齐全,且许可证允许赛事评测。
  7. 提交前请确认模型能够在评测环境中使用 Transformers 4.51.3 和 vLLM 0.8.5.post1 成功执行 vllm serve;无法启动的模型将无法完成评测。
  8. 禁止获取、泄露或反推 A/B 榜标签,禁止人工逐题修改最终答案。