Foundation 0。至今没有任何训练运行获得授权。 本站不报告任何实验结果。

研究方法

在还没有什么需要辩护的时候,先写下规则。

看到结果之后再做的承诺,几乎不值钱。本页所有内容都写于结果仍然未知的时候——那是采纳这些规则唯一便宜的时刻,也是采纳它们唯一有意义的时刻。

既定决策

四条约束其余一切的架构决策。

这四条以"已接受的决策"记录在仓库里,连同它们的背景和后果——包括它们带来的代价。

从一个薄契约内核开始

Foundation 0 只有契约、确定性校验器和小型参考服务,运行期依赖仅一个。训练器、数据库、队列和模型 SDK 都留在外面做适配器。在域边界稳定之前就选定基础设施,会把研究主张绑死在偶然的平台选择上。代价:仓库今天能校验拓扑和交换语义,但跑不了实验。

域引用必须精确

基座、前置、上报、发送方与接收方的引用都同时携带稳定的域 ID 语义版本。像 medical:latest 这样的浮动名字会让回放和追责变得含糊。代价:升级变成显式的注册表操作,好处是一次回放可以指向当初那个域版本。

记忆固化不是训练

经验按显式状态推进,consolidated 只表示"有资格进入未来一次单独授权的固化流程"。记忆服务不能调用训练器,也不能改动域产物。代价:经验在任何模型变更之前都保持可复核、可撤回;将来的回写要有自己的签名清单、评测门槛、新域版本和回滚方案。

原始数据是不可变的证据

每个原始资产都有 SHA-256 身份;路径是位置,不是身份;任何字节变化都产生新产物。批准附着在摘要和显式许可用途上,且同一实验版本内,评测资产不得被许可用于训练。代价:派生不覆盖父本,存储会增长;纠错要出新版本,不能悄悄改。

预注册

假设、阈值和结论对照表,都排在最前面。

拟议的测试在选定检查点、数据集、训练器或任何结果之前就已定义。数值阈值是可复议的草案承诺;一旦冻结,任何改动都需要一次带版本的修订,且必须在查看受影响结果之前完成。

预注册编号
experiment:genesis-biomed-split,协议版本 0.1.0
确证性比较
G 臂(分离的域 + 结构化协议)对 D 臂(合并模型)。提前定死。诊断性消融不能顶替它。
共同主要终点
三项必须全部通过才能得出"完全成功"的结论:能力非劣、更新隔离、来源完整性。缺任何一项都不构成完全成功。
题目选择
在查看任何实验臂级别的输出之后,不得再增删任何评测题目。
冻结权限
需要研究、模型工厂、运行时与治理四类具名复核人。执行还额外需要已批准的数据集清单、已授权的形成计划,以及一份至少两名审批人的运行清单。

具体假设及其拟议数值容差,见实验设计

证据标准

一条主张要满足什么,才算得上可追溯。

可追溯是被评分的,不是被声称的。以下每一条都成立,主张才算数——而"话说得流畅"不在其中。

  • 它的证据引用能解析到一个不可变的产物。
  • 那份证据确实支持所陈述的主张。
  • 假设和适用范围是写出来的,不是暗含的。
  • 证据在所述时间点上是有效的。
  • 已知的矛盾没有被省略。
  • 接收方的域没有悄悄放大这条主张。

交换协议把主张、证据、范围、假设、置信度、不确定度、矛盾和时效性都作为一等字段承载,于是一个域若想断言超出其证据的内容,就必须显式地这么做。当两个域出现实质分歧时,两条主张都会被记录并请求复核;置信度本身不解决冲突。

污染与数据隔离

泄漏让指标作废,而不是被解释掉。

  • 训练、开发、校准和评测题目各有独立的不可变清单,且摘要哈希互不相交。
  • 批准之前先做精确、归一化和语义重复检查;重复决策保留簇谱系,而不是把重复项删掉。
  • 评测题目及其近似衍生,不得出现在课程、检索或少样本上下文中。
  • 答案册、教师版和同一材料的其他格式转换,需要显式的泄漏处理。
  • 一旦发现泄漏:记录、作废受影响指标、启用预注册的替换策略——执行时不得查看各臂之间的对比。
  • 只要可行,人工评分者对实验臂身份保持盲态。

同一套纪律也适用于训练之前的上游。源快照是在不打开任何文档的前提下、仅凭路径、大小和哈希完成画像的;选中不等于批准,分类不等于抽取,抽取也不等于获得训练许可。每一次状态转换都是一道独立的门,各有具名审批人,而原始字节从不被就地修改。

统计方案

不确定度是要报告的,不是靠四舍五入解决的。

随机种子
至少五个冻结种子,除非有经批准的功效分析支持另一个数量。每个种子都与聚合结果一并报告;失败的种子不丢弃。
置信区间
在冻结评测题目上做配对自助法置信区间,并给出感知种子的聚合。
多重性
确证性的次要比较做多重性校正。
效应量
报告效应量与不确定度,而不只报显著性。
缺失输出
缺失输出、弃权、路由失败和协议失败都是预先定义的结果类别,各自单独计账,绝不作为静默丢弃的行。
最差子组
最差子组结果与宏平均一并报告。任何聚合数字都不得掩盖一个不合格子组或一次安全失败。

结论分类

每一种可能的结果,允许被叫作什么。

提前写下这张表,正是为了阻止一个混合结果被叙述成一场胜利。这张表允许的最强结论,就是最终会发表的最强结论。

结果必须如此解读
完全成功所有共同主要终点与全部护栏均通过
部分成功能力非劣通过,且至少一项系统性收益通过,但未满足完全成功标准
无差异在冻结设计下没有可靠差异
架构失败能力容差、安全护栏或跨域组合失败
实验无效泄漏、预算不匹配、契约违反或输入不可复现,使推断失效

部分成功不得被描述为对完整 Cortex 主张的确证。

停机条件

触发即停,而不是触发一场讨论。

  • 检测到训练/评测泄漏。
  • 某个数据资产缺少冻结摘要或必需的批准。
  • 主要实验臂的算力预算超出允许的失配范围。
  • 模型、代码或环境产物与运行清单不一致。
  • 发现真实患者数据或未获批准的个人信息。
  • 外部动作、生产路由或记忆回写被启用。
  • 审计证据无法产出。
  • 损失变为非有限,或留出集质量、早期课程保持率跌破声明容差。
  • 继续下去会违反许可、隐私、安全或成本限制——或具名的停机负责人启动手册。

被停止的运行会保留最后一个有效检查点,并发布一份记录停机原因的终态运行清单修订。停机是一种被记录的结果,不是一件需要收拾干净的事故。

汇报要求

无论结论如何,最终报告必须包含什么。

  • 所有实验臂、种子、题目、失败、弃权和被中止的运行。
  • 置信区间与原始分母。
  • 域、路由器、协议与整系统结果分开报告。
  • 对照冻结运行清单的预算对账。
  • 通信与激活算力成本分项披露:总参数与激活参数、峰值显存、加速器秒、墙钟时间、可得时的能耗、路由器算力、跨域字节、协议 token 与端到端延迟。任何单一资源指标都不足以支撑效率主张。
  • 违规与修订记录。
  • 负面结果与无差异结果。

为什么这些要放在公开页面上

只存在于内部的承诺,可以被悄悄改掉。在开跑之前把结论对照表、停机条件和汇报要求公开出来,正是让放弃它们变得昂贵的机制——而这就是采纳它们的全部意义。