模型训练与评测

模型 / 实验代号
已有评测结果
计划或进行中
ASIBench统一主评测集

iter、训练起点和数据规模均独立展示;评测统计默认采用 600 对逐轮配对主口径。自动训练记录:正在连接…

代号说明底座训练起点最终 iter训练数据训练规模Checkpoint评测均分Δ Base95% CIp-value / 显著性训练状态W&B模型状态
载入中…

记录数、token 口径与重复率分开记录;路径名中的 500k 不再视为数据条数。

数据代号用于TrainValidation组成Token / 筛选口径重复率S3 路径CPFS 路径备注

推理评测的不可变 200 实例基线;以归档内实际目录为准,不按 seed × task 重新生成。

#Seed 目录Task ID完整 Instance ID
载入中…

ASIBench 200 task × 3 replicate;完整评测统计与轨迹资产统一展示。每套目录同时保存 canonical-manifest.json 和 SHA256SUMS。

模型Checkpoint评测均分Δ Base95% CIp-value / 显著性TasksRuns归档大小S3 轨迹包Manifest校验和验收状态备注
G2 2.5E 推理固定 ASIBench 200×3 配置和 checkpoint
G2-D 训练已完成至 iter48;最终权重已上传 S3,485 个对象完整核验
G2-DW 第一阶段约 1 epoch,最终 iter72;第二阶段实际选择 iter62 作为父权重
G2-DW 第二阶段从 iter62 新增 1 epoch,已完成至 iter135;累计约 1.866 epoch
G2-DW 推理下一步:评测 Worker 增量,并与 G2-D、G3 比较