研究计划
一个越来越大的模型,是假设,不是结论。
Octoryn Cortex 项目要问的是:通用能力是否必须存在于单一的规模化模型之中,还是可以被形成为有边界的认知域,再通过一套受治理的协议组合起来。我们把契约、预算,以及判定它失败的条件都先公开——在第一次训练之前,而不是在拿到结果之后。
工作进展到哪里
契约已经建好。什么都还没有被训练。
仓库里有带版本的域清单、不可变更的交换协议、记忆状态机、数据集与运行清单、安全联锁,以及一条只可追加的哈希审计链。里面没有训练运行、没有模型权重、没有基准分数、也没有推理服务。所有操作性开关都处于关闭状态;只要项目仍在 foundation 模式,任何一个开关被打开,诊断工具就会直接判定失败。
问题
规模化确实有效。但这不等于它是唯一有效的路。
更大的模型、更多的数据持续带来能力,这一点这里没有任何争议。但"它有效"已经悄悄变成了"它是唯一路径",而后面这句话,从来没有在同等预算下跟一个认真的替代方案比过。有三个更窄的问题是可以回答的。
一个域,到底什么时候才算形成了?
一个角色提示词不是域,一个检索索引也不是域。我们要求它有显式边界、自己的生命周期与版本、独立的记忆命名空间、发布门槛,以及弃权的能力——然后还得证明这个区别是可测量的。
组合到底要付多少代价?
路由开销、协议开销、跨域交换的成本,在大多数报告里是看不见的。这里把它们当作一等成本来计,与 FLOPs、激活参数和延迟并列——因为一个靠隐藏自身开销取胜的架构,并没有赢。
什么结果能证伪这个假设?
如果在同等预算下,合并模型在能力、保持率和更新成本上都追平了域网络,那么这个假设就是错的。这组对照是预注册的,结论对照表在任何一个实验臂开跑之前就已写好。
主张
能力是分层形成的,每一层都得自己挣来下一层。
能力按序列构建,不是一遍过。每一层都是独立的研究问题,需要单独授权;任何一层都不会从它下面那层继承证据,也不继承批准。
K–12 的教育递进序列
基座沿着一条发展性的学习序列形成,而不是沿着一份爬取来的语料。教育材料的顺序本身被当作要被学到的性质,而不是数据来源留下的副产品——所以学段、学科和层级必须有证据支撑,不能靠目录名推断。
大学专业级别的学科材料
一个认知域的粒度,大致对齐一个大学专业。第一对之所以选生物和医学,正是因为它们相邻:近到足以让单个合并模型成为一个真正强的对照,而不是一个挑出来挨打的稻草人基线。
企业自己的培训材料
一个已经形成的域,加上一家机构自己的培训材料,目标是得到一个岗位范围内的能力。这一层解释了为什么全程把弃权、声明边界和证据可追溯排在聚合准确率之前:要在某个岗位上被依赖的东西,必须能够拒答、能引用、能上报。在第一、第二层拿出证据之前,这一层不在范围内。
完整的目标、非目标与未解难题,见目标与范围。
方法
域负责提出,协议负责承载不确定。
一个域不会因为话说得流畅就拿到最终发言权。它给出的是一条附带证据、适用范围、前提假设、置信度和已知矛盾的主张,而接收方无权悄悄把它的适用范围放大。流畅不等于可追溯。
版本必须精确,否则不开跑
每个域都要写明它确切的基座、前置依赖和模型产物。一次运行在启动前就被绑定到不可变的输入、预算、输出和审计证据上;其中任何一项发生变化,产生的是一个新的运行身份,而不是一次无声的修订。
记忆不是训练
经验要经过显式的阶段,从原始观察走到被批准的固化,中间需要人工授权。原始事件永远不会直接改动参数。一个悄悄从刚看到的东西里学习的系统,事后是没法审计的。
弃权是一等结果
域不仅按答对与否计分,也按是否正确地拒答和上报计分。路由器与作答的域分开评分,这样路由失败不会被算成推理成功。
先有来源,才有内容
源快照是在不打开任何一份文档的前提下,仅凭路径、大小和哈希完成画像的。选中不等于批准,分类不等于抽取,抽取也不等于获得训练许可——每一步都是独立的门,各有具名审批人。
立场
在边界之外自信作答,是失败,不是特性。
这个计划所指向的系统,是要在真实工作里被依赖的;而一个流畅的错误答案,代价往往由一个根本无从核对的人承担。所以真正有意思的工程问题,不是模型多经常是对的,而是它知不知道自己被形成来知道的那条边在哪——并且说出来。
这也是为什么治理在这里是先做的。那些清单、审计链和双人授权的门,不是拿到结果之后补上去的合规表演;它们恰恰是一个结果值得被相信的理由。一个说不清究竟是哪些字节、哪份代码、哪笔预算产生了某个数字的计划,并没有产生一项发现。
我们不宣称 AGI,也不宣称这个架构会赢。我们主张的是:这组对照值得被诚实地跑一次,并且要先把那套让"两种结果都能被诚实回答"的装置建起来。
这里没有任何东西被训练过
这个页面背后没有模型、没有检查点、没有基准分数。已经存在的,是一次未来的运行必须满足的契约层。任何关于 Octoryn Cortex 项目的能力宣称——无论来自我们还是任何人——在运行清单及其证据被公开之前,都是没有依据的。
继续读