主张
一个可证伪的、单体规模化之外的选项。
这个计划要探究的是:通用能力是否必须住在一个越来越大的模型里,还是可以由三样东西表达出来——一个共享的教育基座、在其之上形成有边界认知域的能力,以及一套把这些域组合起来的受治理协议。
项目不宣称 AGI,也不宣称实验已经成功。它主张的东西更窄,我们认为也更有用:这组对照至今没有被公平地跑过,而把"能公平跑一次"的装置建起来,本身就值得做。
在这个计划里,一个认知域必须具备:显式的边界与能力契约;自己的训练与更新生命周期;确切的基座与前置版本;独立的经验命名空间;发布门槛与证据;弃权或上报的能力;以及一套用于交换主张的受治理协议。缺少这些性质的东西就不是域——无论它被叫做什么。
三层结构
形成是一个序列,不是一遍过。
每一层都是独立的研究问题,需要单独授权。任何一层都不从它下面那层继承证据,也不继承批准。
K–12 的教育递进序列
EDR 基座要学的是一层发展性的教育基质,之后才能分叉出各自受治理的域。K–12 是刻意选的,不是顺手的语料:教育顺序是这层基质被声明的性质之一,所以学段、学科、层级和材料类型都必须有证据支撑,不能靠目录名推断。第一个科学目标很窄——一个新的稠密模型,能否从获批的早教到 K–12 材料中习得一条连贯的教育递进,并具备可测量的保持率、校准度与跨学段迁移。
大学专业级别的学科材料
专才认知在基座之后形成,而不是用一个角色提示词或一次检索来近似。域的粒度大致对齐一个大学专业。第一对选生物和医学,是因为它们共享基础但保留了可观察的归属差异——相邻到足以让合并模型成为一个真正强的对照。它们是实验候选,不是"这就是普适正确或最小边界"的主张。
企业自己的培训材料
一个已形成的域,加上一家机构的培训材料,目标是得到一个岗位范围内的能力——某样能在具体岗位上被依赖、并按那个岗位的标准被要求的东西。这正是整套评测设计里,弃权、声明边界和证据可追溯排在聚合准确率之前的原因。在第一、第二层拿出证据之前,这一层不在范围内,也没有任何相关工作获得授权。
与相邻路线的区别
表面像,但单位不一样。
有几种现成技术乍看很相似。区别每次都落在同一处:能力的单位是什么,以及它有没有一个可以被版本化、被评测、被追责的身份。
| 路线 | 典型单位 | Cortex 的区别 |
|---|---|---|
| RAG | 通用模型外围的检索上下文 | 证据不被当作已内化的认知 |
| MoE | 单一模型生命周期里的隐式专家 | 域有显式身份、边界、版本和负责人 |
| 多智能体 | 角色提示词,常共享同一个模型 | 节点是独立形成、独立评测的认知域 |
| 持续学习 | 一个模型吸收一串数据 | 更新可以被隔离在单个受治理的域内 |
| DAPT / CPT | 通用模型适配到一个领域 | 研究对象是多个已适配的域如何组合 |
| 模型合并 / 适配器 | 参数高效的任务组合 | 额外要求域生命周期、记忆治理、证据与协议 |
以上没有一条被认为无效。这里的主张只是:它们都没有把"域"做成一等的、带版本的、可被独立评测的对象——而这正是本计划要检验其价值的东西。
什么才算进展
五件让这条路值得继续的事。
能力被保住
域的表现相对合并对照组落在预注册的容差内,而不是用能力换结构。
更新保持局部
更新一个域对另一个域造成的回退,明显小于同样的更新施加在合并模型上。
主张能扛住传递
跨域主张保住了它的证据、假设、范围和不确定度,而不是变成一段自信、无出处的漂亮文字。
开销是可见的
路由与协议成本被测量并单独报告,而不是藏进一个端到端的数字里。
结果可复现
每个结果都能从不可变的数据、代码、环境与运行清单重建出来——由一个并不信任我们的人来重建。
未解的难题
真正没解决的部分。
列在这里,是因为它们最可能让这个计划失败;也因为一个只列优势的研究页面,本身就没在诚实汇报。
- 定义一个认知域什么时候算真的形成了,而不只是在自己的考卷上考得不错。
- 找到最小的有用域边界——并抵抗那些仅仅因为对得上院系名称而被选中的边界。
- 防止灾难性遗忘和不安全的经验固化。
- 对未知与歧义问题的路由,包括"没有任何域拥有这个请求"的情形。
- 解决跨域矛盾,而不让置信度顶替真值。
- 在通信过程中保住隐含前提,使一条主张不会在传递中悄悄扩大适用范围。
- 在真正公平、含全部开销的预算下,证明系统级的优势。
非目标
这个计划不做的事。
以下都是现阶段被刻意排除的。有些属于后续需要单独授权的阶段,有些则是永久不在范围内。
- 证明多域网络优于合并模型——那是要问的问题,不是前提。
- 把检索当作域认知。
- 让原始事件直接改动参数。
- 把角色提示词称作独立的认知域。
- 对外提供网络服务,或任何生产级推理端点。
- 医学域中任何涉及真实患者的设定——哪怕背后的教育问题看起来很像一道基准题。
当前状态
Foundation 模式。契约、生命周期规则、协议、治理、审计、数据清单、运行清单与安全联锁均已存在。训练、模型权重、推理、域分发、经验回写与外部动作仍处于关闭状态。计划正在准备它的第一个测试,尚未产出实验结果。