Foundation 0。至今没有任何训练运行获得授权。 本站不报告任何实验结果。

计划与路线图

这是一串门,不是一张待执行的排期表。

首轮周期把一份已接收的原始快照,经由受治理的清洗,带到一次有界的 200M 参数试跑。每个里程碑都有硬性支出上限和出口门槛。没有任何里程碑会授权下一个,未用完的预算也不结转。

周期目标

首轮周期要回答的三个问题。

源能不能变成数据集?

已接收的源,能否在不依赖 NAS、也不依赖旧项目任何产物的前提下,转换成一份可复现、可复核的原生文本数据集?

分词器能不能表示它?

新训练的分词器,能否以可接受的保真度和效率,跨学段表示这批已批准的中英文教育材料?

有界试跑能不能从中学到东西?

一个 200M 参数的试跑,能否在冻结数据集上完成训练,并留下有效检查点、完整评测证据和实测成本?

周期以一个 go/hold/stop 决定收尾,对象是一次单独立项的 500M 基座试跑。它不包含 Cortex Genesis,也不包含任何域形成工作。

固定范围

在任何东西开跑之前就被绑定的事项。

源快照
snapshot:education-cn-raw-20260730 —— 496,175 个确切的 S3 对象版本,2,510,613,958,218 已接收字节。
不可变性
原始数据在 S3 中保持不可变,永不被写入。派生产物引用确切的父摘要。
干净谱系
旧的代码、分词器、检查点、数据集派生与基准声明都被排除在输入之外。这意味着"从受治理的原始材料重新开始",而不是"直接在原始文件上训练"。
模态
只处理原生文本与结构。音频与视频从不被解码、采样、转写或嵌入;它们在对账证据中保留终态的 excluded 处置。
延后项
OCR 与图像理解不在首轮预算内。纯扫描件页面保留显式的延后或不支持记录,而不会变成静默的空文本。
项目模式
全程 foundation,所有操作性开关保持 false
预算封套
首轮 AWS 基础设施 4,000 澳元(含 GST)。人工的法务、隐私、文化与质量复核工时不包含在内。

里程碑

从快照到决策的九道门。

下面每个上限都只针对该里程碑本身。耗时主要由人工复核和 AWS 配额决定,而不是 GPU 运行时间——首轮周期的现实区间是四到七周,不含尚未解决的权利与隐私决定。

M0 —— 范围与执行契约冻结

0 澳元

冻结音视频排除规则、具名数据负责人与两名独立审批人、不可变的存储前缀、已复核的容器镜像摘要、每作业支出与墙钟上限,以及确定性的 Batch 并发、重试与容量上限。

出口:每一个身份、前缀、摘要、上限、复核人与停机流程都是确切的。就绪报告仍然显示执行处于关闭状态,但规划层面不再有含糊之处。

M1 —— 512 条记录的格式金丝雀

100 澳元

跑已经选定的金丝雀——512 条记录,覆盖全部 212 个有数据的扩展名/体积分层——使用指定版本的 S3 读取。验证签名、活动内容风险、加密、损坏、不支持的格式与抽取器路由。

出口:512 个输入全部收敛到终态处置;原始数据零写入;每条结果都绑定其确切源版本与流水线摘要;没有任何音视频主体被解码。

M2 —— 有界的原生文本抽取试点

250 澳元

在 DOCX、PPTX、原生文本 PDF、纯文本、XML/HTML/RTF/CSV 以及选定的旧版 Office 分层中,确定性地选出一个有代表性的试点。演练恶意软件扫描、有界容器处理、抽取、归一化、谱系、断点续跑与终态对账。

出口:每个输入一个终态处置;重复执行确定性阶段产生一致摘要;资源上限被实测;失败与隔离样本进入人工复核。

M3 —— 全量合格源清洗

1,200 澳元

把每一个合格的原生文本对象跑过恶意软件筛查、有界抽取、确定性归一化、初步的语言/学科/层级标注,以及不可变的派生分片。

出口:完整的已接收清单精确对账;每个对象都有显式终态结果;没有任何东西被覆盖;产出量与课程分布被公开。

M4 —— 去重、风险复核与数据集冻结

600 澳元

精确、归一化文本与有界近似重复聚类;冻结开发与评测族;筛查重叠;完成权利、隐私、文化与质量复核。去重只做加权或选代表,从不删除谱系。

出口:训练/开发/评测清单摘要互不相交;未解决污染为零;受限或权利不明的条目不出现在已批准分区中;精确的记录、字节、单元与 token 计数被冻结。

M5 —— 分词器对比与已批准分片

250 澳元

仅使用已批准的训练分区,训练并比较一个 48K SentencePiece unigram 分词器与一个 48K byte-level BPE。测量分学段的中英文 fertility、数学与科学符号的往返保真、字节回退与 token 计数稳定性。

出口:从冻结证据中选出一个候选;训练器、配置、种子、输入清单与产物摘要确切;开发与评测内容从未被检视;分片顺序与 token 计数可复现。

M6 —— 50M 合成冒烟

100 澳元 · ≤4 小时

一个随机初始化的模型,只跑确定性合成数据,并在结构上被禁止引用研究数据集冻结。用于验证打包、BF16 执行、日志、心跳、非有限损失停机、检查点发布、续跑与拆除。

出口:该作业无法读取任何研究数据;检查点/续跑保持运行谱系;紧急停机与零容量拆除被演示;不作出任何训练质量声明。GPU 启动需要一条新的显式指令。

M7 —— 200M 已批准数据试跑

600 澳元 · ≤24 小时

用一张 H100,在冻结的已批准课程切片上训练选定的最小稠密模型,参数不超过 200M。记录吞吐、利用率、显存、损失、留出集递进、重启行为与精确成本。

出口:全部输入、代码、环境、镜像、分词器、种子与输出不可变;损失有限;课程保持率证据完整;无泄漏或未批准输入;所有计费算力回到零容量。

M8 —— 试跑复盘与规模决策

300 澳元

把预算、产物、质量、失败、利用率与"每澳元有效 token",对照预注册的晋级标准做一次对账。

出口:发布且仅发布一个决定——go(另行立项准备 500M 提案)、hold(指明重跑前必须修正的缺陷)或 stop(保留产物并关闭本周期)。M8 本身不能启动 500M 训练。

另加 600 澳元的项目应急、存储与有界重试。总上限 4,000 澳元。拟议的 GPU 目标是单台 p5.4xlarge、一张 H100 80 GB;此前的八卡草案处于禁用状态,未经修订不得用于本周期。

规模阶梯

模型规模由实测选出,不是提前假定。

第一个获授权的模型族是常规的稠密 decoder-only Transformer。MoE、域路由、适配器、记忆回写与多域通信被刻意排除在基座基线之外——如果基座自身就含有隐式路由,后续与独立形成的域做比较就无法解释了。

架构
稠密 decoder-only Transformer,含 RMSNorm、SwiGLU、RoPE、分组查询注意力与绑定嵌入。
规模封套
合成冒烟 ≤ 50M;数据试跑 ≤ 200M;基座试跑 ≤ 500M。这些是选型上限,不是已声明的参数量——必须选出满足冻结质量与系统门槛的最小候选,更大的候选需要实测证据。
上下文
合成打包测试用 2K,数据与基座试跑暂定 4K
分词器
只从已批准的训练分区训练。必须在不依赖空格的前提下保住中文,保留数学、科学记号与代码片段,定义确定性的 Unicode 归一化,并且从不检视冻结的评测分区。
仍待定
词表规模、参数量、层/宽/头维度、位置编码细节、精度与优化器、课程配比与阶段排程,以及 token、FLOP、时间与金额预算——全部等待抽取与 token 画像完成。

阶梯顺序是:流水线冒烟 → 数据试跑 → 基座试跑 → 规模决策 → EDR 基座候选。没有哪一步会自动授权下一步;每一步都有自己不可变的运行清单、预算、停机条件和两名审批人。

就绪门

在实验可以被"提出"之前,必须先过的门。

草案文档存在,不构成某道门已通过的证据。机器可读的就绪报告返回 not_ready,这在准备期是正确状态;它只会由被引用的已授权证据变为就绪,绝不会因为文件存在而变。

G0 —— 契约冻结

  • 带版本的域清单已存在
  • 协议主张携带证据、假设、范围、置信度、不确定度、矛盾与时效性
  • 记忆没有"原始直达固化"的捷径
  • Forge 计划是声明式的,且要求数据集批准
  • Foundation 模式阻止操作性功能
  • 协议与清单 0.1.0 经四类负责人复核

G1 —— 科学预注册

  • 定义可证伪的主要假设
  • 冻结两个主要臂的参数与算力预算
  • 冻结域内、跨域、未知边界与可追溯性任务
  • 定义负对照与路由错误探针
  • 在训练之前定义成功、部分成功、无差异与停机条件

G2 —— 域边界

  • 批准生物域的归属、排除与上报规则
  • 批准医学域的归属、司法辖区、人群与高风险禁令
  • 定义"什么证据能说明域已形成"
  • 定义域外与弃权测试
  • 定义共享问题的冲突解决行为

G3 —— 数据与检查点治理

  • 选定带出处与许可的确切 EDR 检查点
  • 每一份数据切片都以不可变摘要登记在册
  • 许可、隐私、同意、文化与污染复核完成
  • 训练/评测分离与泄漏检查获批

传输、对账、单向校验和与确定性清单已被接收,金丝雀也已选出——但版本绑定、清洗、权利复核与分区冻结仍未完成。这不构成 G3 通过。

G4 —— 运行隔离

  • 隔离的产物命名空间与预算
  • 可复现的环境与种子策略
  • 算力调度与紧急停机
  • 没有生产路由或外部动作
  • 签名的运行清单与只可追加的审计汇

AWS 边界、单节点优先的阶梯、检查点策略、预算封套与紧急停机流程均已有草案。没有任何算力被开通。这不构成 G4 通过。

G5 —— 授权

  • 形成计划已冻结
  • 至少两名具名审批人
  • 每个数据集都被标记为批准用于训练
  • 训练开关仅在实验专属配置中启用
  • 显式的用户授权被记录在确切的阶段门修订中

今天明确不存在的东西

没有模型或分词器。没有数据集或下载脚本。没有优化器或训练循环。没有推理端点。没有基准分数。没有实验跟踪集成。没有定时任务。没有活跃的域。没有自动记忆固化。诊断工具通过,只说明当前配置在内部是安全的;它不代表任何一道门已经通过。

周期之后

刻意留在当前封套之外的事项。

没有任何下游里程碑会从这份路线图继承授权、未用预算或批准。

  • EDR 500M 基座试跑 —— 仅在 M8 给出 go 之后。
  • EDR 基座候选 —— 规模由实测的 token 量、质量与成本选出,而不是提前假定。
  • Cortex Genesis 数据集形成 —— 冻结生物与医学的边界及匹配数据。
  • Cortex Genesis 实验 —— 即实验设计中描述的那组对照。
  • Octoryn 认知网络试点 —— 仅当 Genesis 的证据支持域组合时。