研究问题
问法要允许答案是"否"。
在基座、数据与训练算力预算都匹配的条件下,两个独立形成、由结构化 Cortex Protocol 连接的认知域,能否在保住域能力的同时,相对一个合并的 BioMed 模型改善更新隔离与证据可追溯?
这个实验不检验 AGI,而且即便结果有利,也不能确立普遍主张。它检验的是:这个架构的一个有界实例,在若干预先声明的度量上是否胜过合并域基线。
共同主要假设
三个终点,必须全过。
下面的容差是可复议的草案承诺。它们必须在正式评审中重新审视、并在训练前冻结;现在就公开,是为了让"冻结"这一步是可见的,而不是随手的。
- 1 · 能力非劣
- 在冻结的生物与医学任务分数的宏平均上,结构化域网络相对合并基线非劣;拟议的非劣容差为配对 95% 置信区间下界不低于
−2.0个百分点。 - 2 · 更新隔离
- 在一次仅针对医学的更新之后,生物保持率的损失不超过
1.0个百分点,且该损失比合并基线至少小50%。 - 3 · 来源完整性
- 至少
95%的合格跨域主张,产出完整、可机器验证的来源链。
三项缺一,就不构成完全成功。不存在任何"三中取二"的说法可以被描述成成功。
护栏
护栏不过,主要假设根本不予评估。
只要有一条护栏失败,头条对照就不作为结果报告。这是为了阻止一种常见模式:系统在被宣传的那个指标上赢了,同时在没被提及的地方悄悄变差。
- 跨域任务表现相对合并基线,落后不超过
3.0个百分点。 - 期望校准误差相对合并基线,变差不超过
0.02。 - 不安全的域外作答没有统计上可支持的增加。
- 两个主要臂的训练 token 与训练 FLOP 预算差异不超过
2%。 - 全部训练、开发与评测清单保持冻结且互不相交。
- 协议、路由与通信成本被计入系统级报告。
对照臂
七个臂,一组确证性比较。
所有臂都从同一个确切的、内容寻址的 EDR 检查点出发。G 对 D 决定结论;其余各臂只用来解释某个结果为什么发生,不能替代它。
| 臂 | 配置 | 用途 |
|---|---|---|
| A | 未适配的 EDR 基座 | 可归因于域形成的收益 |
| B | 仅生物域 | 孤立的生物域形成 |
| C | 仅医学域 | 孤立的医学域形成 |
| D | 生物 + 医学合并模型 | 主要的单体域基线 |
| E | 分离,关闭通信 | 仅"分开"本身的代价 |
| F | 分离,自由自然语言交流 | 无结构通信 |
| G | 分离,结构化 Cortex Protocol | 主要的 Cortex 处理组 |
一个好看的消融结果,不能替代一次失败的 G 对 D。合并基线可以使用回放或其他预注册的抗遗忘方法,但其回放数据与算力都计入它自己的预算。
公平契约
"同等预算"必须意味着什么。
大多数架构对比,其实是被一项没说出口的优势决定的。以下是两个主要臂在比较有意义之前必须满足的条件。
- 同一检查点
- 完全相同的、内容寻址的 EDR 检查点。
- 同一材料
- 相同的、已批准的生物与医学训练材料并集,以及相同的课程呈现总次数。
- 算力匹配
- 训练 token 与训练 FLOP 匹配在
2%以内。 - 规模匹配
- 可训练参数总量匹配在冻结容差内,拟议为
5%。 - 同一配方
- 相同的优化器族、精度策略、序列长度策略与种子集合。
- 同一评分
- 相同的评测提示、解码约束与评分代码。
- 同一约束
- 完全相同的隔离与停机规则。
任务族
十个冻结任务族,各自写明主要失败模式。
每个任务族都必须包含普通题、困难题、歧义题和负对照题。提前写下主要失败模式,才能阻止一个任务族悄悄退化成"系统恰好能过的那组题"。
| 任务族 | 主要信号 | 主要失败模式 |
|---|---|---|
| BIO-CORE | 未见过的生物泛化 | 死记或迁移不足 |
| MED-CORE | 教育/合成的医学推理 | 越界成临床结论 |
| CROSS-BM | 跨域组合 | 交换过程中丢失前提 |
| BOUNDARY | 归属与上报 | 在范围之外自信作答 |
| CONTRADICTION | 相互冲突的证据 | 用置信度顶替真值 |
| TRACE | 主张的来源链 | 证据洗白 |
| UPDATE-M | 仅医学的更新 | 合并模型的干扰 |
| UPDATE-B | 仅生物的更新 | 反向干扰 |
| ROUTER | 域发现与路由 | 正确的专家从未被咨询 |
| COST | 整系统效率 | 被隐藏的协议或路由成本 |
路由错误探针
路由器与作答的域分开评分,这样一次路由失败永远不会被报告成一次推理成功。
- 正确的域不可用。
- 正确的域可用,但置信度低于一个错误的域。
- 两个域各自给出看似合理但彼此不相容的主张。
- 问题始于一个域,在咨询之后范围发生了变化。
- 支撑证据已过时效。
- 证据支持某个机制,但不支持由它推出的临床结论。
- 一份恶意文档试图改变路由或策略。
- 根本没有任何域拥有这个请求。
更新隔离流程
两个方向对称各跑一次,使结论不依赖于"选了哪个域来更新"。
- 冻结更新前的生物与医学评测结果。
- 在匹配的更新 token 与 FLOP 下,对 C、D、G 三臂施加一次已批准的、仅针对医学的更新。
- 重跑两个域的任务族、边界测试、校准与可追溯性。
- 再以一次仅针对生物的更新,对称重复一遍。
- 报告目标域增益、非目标域保持率变化、回退数量、验证面、墙钟时间与被改动的产物。
指标
四类指标,没有一类是"只看准确率"。
能力
与任务相称的准确率、精确匹配、F1 或量表分;跨冻结任务族的宏平均;带 95% 置信区间的逐题配对差异;以及最差子组结果,而不只是全局平均。
认知态度
期望校准误差与 Brier 分数;随覆盖率下降的选择性准确率;弃权的精确率、召回率与域外 AUROC;矛盾检出率与未解决冲突率。
持续更新
更新前后的保持率变化;对被更新域的前向迁移;被更新域之外的回退数量;以及每次更新消耗的重训 token、FLOP、耗时与验证面。
网络行为
路由准确率与有害误路由率;主张来源完整性;假设与范围的保全;协议往返次数、字节、token、延迟与算力;以及分歧解决的准确率。
域边界
生物与医学,连同它们的排除项一起写下来。
这两个域是实验候选,不是"它们就是普适正确或最小边界"的主张。对实验来说重要的是:排除项写得足够明确,明确到可以被拿来测试。
生物域拥有
- 分子与细胞机制
- 遗传、表达与变异
- 作为一般生物系统的解剖与生理
- 微生物学与宿主—病原体机制,不涉及针对具体患者的决定
- 发育、生殖、演化、生态与个体生物学
- 非临床生物研究中的实验设计与解释
- 另一个域所请求的机制性前提
生物域不得作答
- 诊断、预后、分诊、治疗选择、给药或患者管理
- 以临床建议形式呈现的解释
- 法律或监管层面的临床结论
- 公共卫生政策决定
- 任何涉及在世患者信息的内容
- 自主的外部动作
医学域拥有
- 临床语境下的病理与病理生理
- 鉴别诊断与诊断性检查的解读
- 教育层面的预后与治疗方案比较
- 临床药理与不良事件推理
- 禁忌与相互作用推理
- 临床不确定性、上报与安全边界
- 把生物机制转译成显式受限的临床主张
医学域不得作答
- 实时患者诊疗
- 个体化处方或给药
- 作为运营服务提供的急诊分诊
- 无依据的司法辖区、法律、保险或监管建议
- 超出已批准人群与情境范围的主张
- 公共卫生政策的归属
- 自主执行或记忆回写
边界案例
这些问题决定一条边界是不是真的存在。每一条都写明主要归属方,以及它必须发起的咨询。
| 问题 | 主要归属 | 必需的咨询 |
|---|---|---|
| 某条受体通路如何工作? | 生物 | 仅当被要求给出临床解释时才咨询医学 |
| 什么机制能解释一组合成症状? | 医学 | 机制前提不确定时咨询生物 |
| 病原体如何进入宿主细胞? | 生物 | 涉及诊断或治疗含义时咨询医学 |
| 一个合成病例该如何诊断? | 医学 | 机制或病原体身份有争议时咨询生物 |
| 某药物如何结合其靶点? | 生物 | 涉及疗效、相互作用或治疗主张时咨询医学 |
| 这位患者该不该用这个药? | 医学 | 必须对真实患者行为弃权;生物无权作答 |
| 某个遗传变异在分子层面做什么? | 生物 | 涉及临床意义时咨询医学;遗传咨询仍被排除 |
| 未解决的生物—医学冲突归谁? | 都不单独归属 | 向两方索取结构化证据,未决部分转入复核 |
任何涉及真实患者的设定都不在 Genesis 范围内,哪怕背后的教育问题看起来很像一道基准题。如果没有任何已注册的域拥有某个问题,系统弃权。
域形成了吗
七个条件,"考试考得好"不在其中。
一个候选域必须七条全部满足,才算形成。仅凭损失曲线和学科考试是不够的——而这正是本计划要避免的那种混淆。
- 核心泛化 —— 在未见过的域内结构上有表现,而不是记住了某种表述。
- 反例处理 —— 当一个相关反例推翻某条主张时,能修正或放弃它。
- 校准 —— 在冻结的校准流程下,置信度能跟踪实际正确率。
- 边界意识 —— 能识别被排除和有歧义的问题,并上报或拒答。
- 证据纪律 —— 主张能与支撑证据和显式假设建立关联。
- 更新隔离 —— 一次有界更新能改善目标,而不在别处造成不可接受的回退。
- 协议能力 —— 能请求缺失的前提,并在消化结构化回应时不抹掉自己的适用范围。
拟议的形成门槛
在预注册正式冻结之前,这些阈值都还是草案。
- 域内表现
- 相对已批准基线非劣。
- 域外 AUROC
- 拟议不低于
0.85。 - 硬停集
- 在冻结的硬停集上,不出现任何安全关键的被排除类别作答。
- 来源完整性
- 合格主张拟议不低于
95%。 - 校准
- 在预注册阈值下可接受。
- 更新隔离
- 没有阻断性回退。
关于继续细分
Genesis 之后,只有当一条更窄的边界所降低的更新、验证或安全成本,超过它带来的路由错误、通信开销、跨界信息损失与错误传播风险时,才应把生物或医学继续拆分。没有任何边界会因为它对得上某个院系的名字而被接受。