既定决策
四条约束其余一切的架构决策。
这四条以"已接受的决策"记录在仓库里,连同它们的背景和后果——包括它们带来的代价。
从一个薄契约内核开始
Foundation 0 只有契约、确定性校验器和小型参考服务,运行期依赖仅一个。训练器、数据库、队列和模型 SDK 都留在外面做适配器。在域边界稳定之前就选定基础设施,会把研究主张绑死在偶然的平台选择上。代价:仓库今天能校验拓扑和交换语义,但跑不了实验。
域引用必须精确
基座、前置、上报、发送方与接收方的引用都同时携带稳定的域 ID 和语义版本。像 medical:latest 这样的浮动名字会让回放和追责变得含糊。代价:升级变成显式的注册表操作,好处是一次回放可以指向当初那个域版本。
记忆固化不是训练
经验按显式状态推进,consolidated 只表示"有资格进入未来一次单独授权的固化流程"。记忆服务不能调用训练器,也不能改动域产物。代价:经验在任何模型变更之前都保持可复核、可撤回;将来的回写要有自己的签名清单、评测门槛、新域版本和回滚方案。
原始数据是不可变的证据
每个原始资产都有 SHA-256 身份;路径是位置,不是身份;任何字节变化都产生新产物。批准附着在摘要和显式许可用途上,且同一实验版本内,评测资产不得被许可用于训练。代价:派生不覆盖父本,存储会增长;纠错要出新版本,不能悄悄改。
预注册
假设、阈值和结论对照表,都排在最前面。
拟议的测试在选定检查点、数据集、训练器或任何结果之前就已定义。数值阈值是可复议的草案承诺;一旦冻结,任何改动都需要一次带版本的修订,且必须在查看受影响结果之前完成。
- 预注册编号
experiment:genesis-biomed-split,协议版本0.1.0。- 确证性比较
- G 臂(分离的域 + 结构化协议)对 D 臂(合并模型)。提前定死。诊断性消融不能顶替它。
- 共同主要终点
- 三项必须全部通过才能得出"完全成功"的结论:能力非劣、更新隔离、来源完整性。缺任何一项都不构成完全成功。
- 题目选择
- 在查看任何实验臂级别的输出之后,不得再增删任何评测题目。
- 冻结权限
- 需要研究、模型工厂、运行时与治理四类具名复核人。执行还额外需要已批准的数据集清单、已授权的形成计划,以及一份至少两名审批人的运行清单。
具体假设及其拟议数值容差,见实验设计。
证据标准
一条主张要满足什么,才算得上可追溯。
可追溯是被评分的,不是被声称的。以下每一条都成立,主张才算数——而"话说得流畅"不在其中。
- 它的证据引用能解析到一个不可变的产物。
- 那份证据确实支持所陈述的主张。
- 假设和适用范围是写出来的,不是暗含的。
- 证据在所述时间点上是有效的。
- 已知的矛盾没有被省略。
- 接收方的域没有悄悄放大这条主张。
交换协议把主张、证据、范围、假设、置信度、不确定度、矛盾和时效性都作为一等字段承载,于是一个域若想断言超出其证据的内容,就必须显式地这么做。当两个域出现实质分歧时,两条主张都会被记录并请求复核;置信度本身不解决冲突。
污染与数据隔离
泄漏让指标作废,而不是被解释掉。
- 训练、开发、校准和评测题目各有独立的不可变清单,且摘要哈希互不相交。
- 批准之前先做精确、归一化和语义重复检查;重复决策保留簇谱系,而不是把重复项删掉。
- 评测题目及其近似衍生,不得出现在课程、检索或少样本上下文中。
- 答案册、教师版和同一材料的其他格式转换,需要显式的泄漏处理。
- 一旦发现泄漏:记录、作废受影响指标、启用预注册的替换策略——执行时不得查看各臂之间的对比。
- 只要可行,人工评分者对实验臂身份保持盲态。
同一套纪律也适用于训练之前的上游。源快照是在不打开任何文档的前提下、仅凭路径、大小和哈希完成画像的;选中不等于批准,分类不等于抽取,抽取也不等于获得训练许可。每一次状态转换都是一道独立的门,各有具名审批人,而原始字节从不被就地修改。
统计方案
不确定度是要报告的,不是靠四舍五入解决的。
- 随机种子
- 至少五个冻结种子,除非有经批准的功效分析支持另一个数量。每个种子都与聚合结果一并报告;失败的种子不丢弃。
- 置信区间
- 在冻结评测题目上做配对自助法置信区间,并给出感知种子的聚合。
- 多重性
- 确证性的次要比较做多重性校正。
- 效应量
- 报告效应量与不确定度,而不只报显著性。
- 缺失输出
- 缺失输出、弃权、路由失败和协议失败都是预先定义的结果类别,各自单独计账,绝不作为静默丢弃的行。
- 最差子组
- 最差子组结果与宏平均一并报告。任何聚合数字都不得掩盖一个不合格子组或一次安全失败。
结论分类
每一种可能的结果,允许被叫作什么。
提前写下这张表,正是为了阻止一个混合结果被叙述成一场胜利。这张表允许的最强结论,就是最终会发表的最强结论。
| 结果 | 必须如此解读 |
|---|---|
| 完全成功 | 所有共同主要终点与全部护栏均通过 |
| 部分成功 | 能力非劣通过,且至少一项系统性收益通过,但未满足完全成功标准 |
| 无差异 | 在冻结设计下没有可靠差异 |
| 架构失败 | 能力容差、安全护栏或跨域组合失败 |
| 实验无效 | 泄漏、预算不匹配、契约违反或输入不可复现,使推断失效 |
部分成功不得被描述为对完整 Cortex 主张的确证。
停机条件
触发即停,而不是触发一场讨论。
- 检测到训练/评测泄漏。
- 某个数据资产缺少冻结摘要或必需的批准。
- 主要实验臂的算力预算超出允许的失配范围。
- 模型、代码或环境产物与运行清单不一致。
- 发现真实患者数据或未获批准的个人信息。
- 外部动作、生产路由或记忆回写被启用。
- 审计证据无法产出。
- 损失变为非有限,或留出集质量、早期课程保持率跌破声明容差。
- 继续下去会违反许可、隐私、安全或成本限制——或具名的停机负责人启动手册。
被停止的运行会保留最后一个有效检查点,并发布一份记录停机原因的终态运行清单修订。停机是一种被记录的结果,不是一件需要收拾干净的事故。
汇报要求
无论结论如何,最终报告必须包含什么。
- 所有实验臂、种子、题目、失败、弃权和被中止的运行。
- 置信区间与原始分母。
- 域、路由器、协议与整系统结果分开报告。
- 对照冻结运行清单的预算对账。
- 通信与激活算力成本分项披露:总参数与激活参数、峰值显存、加速器秒、墙钟时间、可得时的能耗、路由器算力、跨域字节、协议 token 与端到端延迟。任何单一资源指标都不足以支撑效率主张。
- 违规与修订记录。
- 负面结果与无差异结果。
为什么这些要放在公开页面上
只存在于内部的承诺,可以被悄悄改掉。在开跑之前把结论对照表、停机条件和汇报要求公开出来,正是让放弃它们变得昂贵的机制——而这就是采纳它们的全部意义。