Skip to content

评测:缺少可合法复现的历史 blind-run 证据 #11

Description

@ZZDR1023

用户可见症状

当前 benchmark harness 已有确定性 synthetic cases,但 alpha 不能诚实地给出三道真实历史题的 blind-run / one-shot 对比、任务类型覆盖或质量结论,因为仓库尚未取得可合法再分发或由用户明确授权使用的完整赛题材料与 scoring reference。

查重与关联

已逐条复核全部开放 Issue #3#4#5#9 和关闭 Issue #1

外部前提(当前阻断)

必须由用户或材料权利人提供以下任一安全来源,并明确允许本项目的测试、存储和报告用途:

  1. 可公开再分发的赛题包、许可证/来源 URL、reference/scoring 规则;或
  2. 用户提供的私有材料及明确的仅本地验收授权范围。

不得自行从网络抓取受版权保护的同题答案、题包或 reference,不得把未获授权材料提交到仓库、Issue、PR、日志或公开 benchmark fixture。

后续范围

在外部前提满足后,为每个 case 建立独立、可审计 manifest 与 provenance:

  • 冻结题包 SHA-256、license/source、允许任务类型、blind/reference policy、预算和 hard checks;
  • solve 阶段隔离 scoring reference,保留现有 reference firewall;
  • 用同一 frozen case/evaluation contract 比较 agent 与 one-shot;
  • 明确记录 measurednot_runblockedunavailable,未知 token/cost/review 仍为 null
  • 不暴露私有题面、reference answer、宿主绝对路径、凭据、cookie 或模型 token。

验收

至少三道授权历史 case 均有可审计 provenance 和独立 SHA;每道 case 的 blind agent/one-shot 运行可复现并使用相同评分契约;报告不把缺失指标、blocked 或 unavailable 计为成功。由主控独立执行合法性、blind-firewall、结果可复现及报告去敏复核后,再进入人验收。

非目标

  • 不在没有合法材料前伪造历史成绩或把 synthetic coverage 宣称为历史 benchmark。
  • 不联网检索同题解答,不扩大 Runtime/Orchestrator/API 范围。
  • 当前不派 code worker;等待材料和授权。

Metadata

Metadata

Assignees

Labels

P1主功能或 Alpha 验收受阻,进入最近批次enhancementNew feature or request

Projects

No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions