—模型 / 实验代号
—已有评测结果
—计划或进行中
ASIBench统一主评测集
模型总表保留评测摘要,完整统计、轨迹包与验收信息请查看“评测结果与轨迹”。
| 代号 | 说明 | 底座 | 训练起点 | 最终 iter | 训练数据 | 训练规模 | Checkpoint | 评测摘要 | 均分 | Δ Base | 训练状态 | W&B | 模型状态 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 载入中… | |||||||||||||
记录数、token 口径与重复率分开记录;路径名中的 500k 不再视为数据条数。
| 数据代号 | 用于 | Train | Validation | 组成 | Token / 筛选口径 | 重复率 | S3 路径 | CPFS 路径 | 备注 |
|---|
ASIBench 200 task × 3 replicate;完整评测统计与轨迹资产统一展示。每套目录同时保存 canonical-manifest.json 和 SHA256SUMS。
| 模型 | Checkpoint | 评测 | 均分 | Δ Base | 95% CI | p-value / 显著性 | Tasks | Runs | 归档大小 | S3 轨迹包 | Manifest | 校验和 | 验收状态 | 备注 |
|---|
G2 2.5E 推理当前进行中;固定 ASIBench 200×3 配置和 checkpoint
G2-D 训练从 G2 2.5E 加训 Director 1,028 + Reviewer 330
G2-D 推理测量角色数据相对 G2 2.5E 的独立增量
G2-DW 训练从 G2-D 继续加训 Formal Worker 6,326 条
G2-DW 推理测量 Worker 相对 G2-D 的独立增量,并与 G3 比较