EvoSpeech · 未来 14 天执行路线(SOTA Census 版)¶
历史快照,已停止执行。 本文件保存 2026-07-20 的 SOTA Census/G1–G4 工程接入路线, 用于追溯当时的假设、结果和决策,不再定义当前 TODO。历史 G4 现在只解释为 Transport Qualified。当前路线见
../ROADMAP_14D.md,完成标准见../EVALUATION_DOD.md。
时间:2026-07-20 → 2026-08-02
这 14 天的目标从“冻结 8 个模型后马上做原创 seed”修订为:建立足够宽、证据分级、真实可运行的本地 SOTA 前沿,然后由前沿证据决定 seed。
不要求把 40 个 Census 条目全下载全跑:paper-only、挑战报告和通信标准本来就不都能本地 复现。但 27 个公开可运行/可审计对象必须各有执行决定,当前前沿不能因为旧短名单上限被删掉。
一、14 天交付物¶
configs/sota_census_v1.json:无数量上限的模型/标准/挑战/论文 Census;configs/sota_execution_matrix_v1.json:所有公开可运行代表的 wave、状态、下一 gate;reports/sota_reproduction_status_v1.md:成功、失败、deferred、许可、硬件和依赖证据;reports/sota_stress_v1.md:至少 3 个神经教师的 native → legal stress 曲线;reports/baseline_matrix_v1.md:达到公平合同的模型在中英统一数据上的条件化比较;- 至少 3 张
knowledge/speech-codecs/机制卡; - Coverage Gate 通过时生成
docs/SEED_CODEC_DECISION.md;没通过则交付缺口和下一周限时计划, 不凭偏好偷跑 seed。
二、先看懂这轮在做什么¶
找全重要方向
↓ Census:谁重要、来源是什么、证据到哪一级
筛出可执行对象
↓ Matrix:每个公开模型何时跑、下一关是什么
先跑作者原生配置
↓ 确认模型真的能重建,而不是只会下载
保存真实 token/bitstream
↓ fresh decoder 独立重建,实际文件计字节
统一中英小样本
↓ 看质量、文字、身份、速度、内存,失败也入表
合法降低码率/资源
↓ 找到每个强模型“什么最后才消失、什么最先坏”
提炼共同机制
↓
决定第一个原创 Baseline
这不是为“做排行榜”而安装模型。它在回答:最强模型的优势究竟来自 encoder、量化器、token 时率、decoder 先验、训练规模还是非因果条件;其中哪一部分能被压入我们的通信约束。
三、逐日任务、产物和验证¶
Day 1 · 7/20:冻结 Census v1 与证据等级¶
- [x] 建立 40 项综合快照,覆盖通信锚点、波形 codec、语义/声学 tokenizer、流式/部署、 资源挑战、标准和 2026 机制论文;
- [x] 所有条目保存一手来源;可固定的 Git 源码保存 40 位 revision;
- [x] 分清
local_smoke / open_runnable / open_framework / open_code_partial / challenge_report / paper_only / standard_or_licensed; - [x] Stable、SNAC、Mimi、X-Codec 2.0 等不再是互斥替补;
- [x] 增加机器审计,防止重要代表和可运行对象从计划中消失。
Milestone C1 · Census Audited:已通过。
验证命令:
通过标准:≥30 项、关键类别齐全、关键代表齐全、ID 唯一、来源合法、全部公开 runnable 有
execution decision、Wave 0 只能标 infrastructure_qualified。当前结果:40 项、27 项执行决定、
5 个专项测试通过。
Day 2 · 7/21:固定 Wave 1/2 的 checkpoint、许可和最小命令¶
按以下顺序逐项做 source audit,不加载大权重:
- Wave 1:DAC、FocalCodec-Stream、Stable Codec、Mimi、LPCNet、SNAC;
- Wave 2:MOSS-Audio-Tokenizer、Quark HCodec、BigCodec、WavTokenizer、X-Codec 2.0、 TaDiCodec。
每个系统写入:
- [x] 官方 checkpoint URL 与不可变 revision/hash;
- [x] code / checkpoint / dataset 的许可和 gated 状态;
- [x] 作者 native point、采样率、因果/流式声明、合法 rate knob;
- [x] 预计权重大小、依赖、Python/PyTorch 范围和 Apple Silicon 风险;
- [x] 最小 encode/decode 调用和是否需要另外下载声码器/语义 encoder;
- [x] 若作者没有完整推理路径,立即从
open_runnable降为open_code_partial,不猜。
Milestone C1b · Sources Audited:2026-07-19 已通过。 Wave 1 6/6、Wave 2 6/6 完成;
初审固定 26 个权重文件;执行 HCodec 1.0/1.5 时补出其未声明的 HuBERT 与 Wav2Vec2 权重,现为
28 个权重文件。MOSS Nano/full v1/full v2、HuBERT 与 Wav2Vec2 config 共 14 个可执行身份文件。
静态审计、在线 Hub/LFS + executable-identity 审计及 8 个
专项回归测试通过。Stable Codec 因 CUDA FlashAttention/无 CPU 支持标 Mac 平台 deferred;
Quark HCodec 2.0 无权重;TaDiCodec 需要文本和 prompt 语音,不能直接进入公平 payload 表。
详见 docs/SOTA_SOURCE_AUDIT_V1.md。
Day 3–5 · 7/22–7/24:Wave 1 原生复现¶
每个系统使用 .model-envs/<id>,禁止污染核心 .venv。单系统第一次安装/修复限 120 分钟;
超时保存命令、日志、环境锁和最后错误,标 deferred 后继续下一个。
建议执行顺序:
- SNAC:2026-07-19 已完成。第一个新多尺度 token 教师和 packed 格式已通过 G1/G2;
- DAC:2026-07-19 已完成。建立高保真、非 low-bit 能力教师及官方
.dac文件锚点; - FocalCodec-Stream:2026-07-19 已完成整句 native point。建立 causal 低帧率教师;
- Mimi:2026-07-19 已完成整句 native point。建立现代 causal 语义/声学 token 教师;
- LPCNet:2026-07-19 已完成 native point。建立小型部署教师;
- Stable Codec:source audit 已给出
platform_deferred,只在 CUDA/FlashAttention 主机恢复, 本机不下载 3.81 GB 权重。
SNAC 节点结果:8/8 中英/critical 成功;三尺度实际 12-bit code 均值 992.0 bps,带
确定性 transport header 的真实文件均值 1712.7 bps;fresh decoder 只凭 payload 重建,抽样
WAV 字节级复现;冷进程 CPU encode/decode RTF 1.348/1.039,最大 RSS 976.1 MiB,decoder+
quantizer state 50.17 MiB。该结果证明“可运行与可计账”,不证明质量排名。首轮因 runner
错误解析 venv symlink 而 8/8 失败,失败记录保留;修复和回归测试已落地。机器摘要见
experiments/sota_smoke_snac_native_v1.json。
DAC 节点结果:固定源码只能加载官方 release 0.0.5 .pth,不能直接加载此前登记的 HF
Transformers model.safetensors;现已分开两条来源合同。原生结构实测 50 frame/s × 12 个
10-bit codebook,完整表示均值 6003.8 bps,而不是此前由不一致 HF 配置推导的 3750 bps。
修复上游 .dac 对 exact-hop 长度少 8 samples 的 reshape 缺陷后,8/8 中英/critical 成功;
官方 .dac 文件均值 10397.5 bps,MPS 冷进程 encode/decode RTF 2.006/1.383,最大 RSS
1074.3 MiB,decoder+quantizer state 200.86 MiB。普通长度和 exact-hop 各做一次 fresh decoder,
WAV 均字节级复现。首轮 3/8 成功、5 个 exact-hop 失败的产物保留。机器摘要见
experiments/sota_smoke_dac_native_v1.json。
FocalCodec-Stream 节点结果:固定 4k causal checkpoint,实际 12-bit token 均值 600.38 bps,
带冻结身份/长度 header 的 payload 均值 1482.44 bps;8/8 中英/critical 成功,普通长度与奇数
长度各一次 fresh decoder WAV 字节级复现。MPS 冷进程 encode/decode RTF 1.510/1.390,最大
RSS 2940.7 MiB,decoder path 448.79 MiB。首轮 7/8 暴露 24→16 kHz 奇数长度多 1 sample,
现只允许 ±1 sample 并确定性裁剪/补零,超过即失败。checkpoint 是 causal 且上游给出 80 ms
理论延迟,但本轮调用整句 token path,因此诚实登记 streaming=false;stateful chunk 等价性
是下一 gate。机器摘要见 experiments/sota_smoke_focalcodec_stream_native_v1.json。
Mimi 节点结果:固定 kyutai/mimi Transformers checkpoint,12.5 Hz × 8 个 2048-entry
codebook 的理论表示为 1100 bps;有限句帧取整后实测均值 1107.52 bps,完整 payload 均值
2049.12 bps。CPU 冷进程 encode/decode RTF 0.554/0.563,最大 RSS 1039.1 MiB,decoder path
218.51 MiB;8/8 中英/critical 成功,独立重放字节级一致。source audit 原先记录的 Moshi
loaders.get_mimi 与该官方 Transformers 转换 checkpoint key 不兼容;正式路径改为严格固定
transformers==4.45.0,不以 strict=False 掩盖错配。本轮仍是整句 API,故 streaming=false。
机器摘要见 experiments/sota_smoke_mimi_native_v1.json。
LPCNet 节点结果:固定源码与 2ddc476 模型包,使用 Apple clang/NEON static build;clean
rebuild 二进制 SHA-256 一致。默认 shared build 因 demo 调用 hidden 内部符号而链接失败,改用
官方 --disable-shared --enable-static 配置闭环,无算法补丁。8/8 raw 8-byte/40-ms packet
往返成功,表示和完整文件码率同为均值 1604.88 bps;CPU 冷进程 encode/decode RTF
0.051/0.202,最大 RSS 40.3 MiB。learned decoder weights 6.66 MiB、完整二进制 8.10 MiB,
仍不满足最终 ≤5 MiB 合同。机器摘要见 experiments/sota_smoke_lpcnet_native_v1.json。
Milestone C2 已完成:Wave 1 为 5 个 G2 passed + Stable Codec 1 个 Mac platform deferred; 六项都有明确结论,且超过 ≥4 G1 / ≥3 G2 门槛。
MOSS Nano 节点结果:固定 22M 参数、48 kHz stereo checkpoint 与 checkpoint 内两份
remote-code SHA;本地离线严格加载。16 个 1024-entry RVQ 的理论表示为 2000 bps,8 句有限帧
取整后均值 2013.67 bps,完整 payload 均值 3629.18 bps。CPU 冷进程 encode/decode RTF
0.960/0.855,最大 RSS 671.7 MiB,8/8 中英/critical 成功,fresh decoder 与独立重放字节级
一致。MPS token 与 CPU 完全一致但冷 encode 更慢,故正式用 CPU。机器摘要见
experiments/sota_smoke_moss_audio_tokenizer_nano_native_v1.json。
完整 v1 单句节点结果(2026-07-20):两个 shard 共 7,098,461,728 bytes,整文件 SHA-256
均匹配;remote code 与固定 GitHub revision 完全一致。1,774,566,400 参数严格加载无缺失/多余
key;最短句保存 32×41 真实 10-bit token,表示 4006.11 bps、完整 payload 6720 bps。
encoder 与两个 fresh decoder 均在独立 CPU 进程运行,encode/decode RTF 9.14/6.78;进程树峰值
RSS 3.62/3.84 GB,未触发 24 GiB guard。第二次 decoder 输出 SHA 与第一次完全一致。这里较低
RSS 来自 safetensors/OS 按需映射,不把 7.10 GB shared weights 错写成 3.84 GB 模型。
该节点只证明一条英文短句的 G2 与内存可行,不是 8 句 G4,更不是质量 SOTA。机器摘要见
experiments/sota_probe_moss_audio_tokenizer_full_v1_memory_v1.json。
完整 v1 G4(2026-07-20):正式 runner 已把 guard 证据写进每一行;3 英 + 3 中 +
2 critical 共 50.415 秒全部成功。表示码率句均值 4027.34 bps,完整 payload 句均值
5611.22 bps;encode/decode 冷进程 RTF 均值 5.55/4.49,最大进程树 RSS 3.90 GB,16 个阶段
均未越过 24 GiB。中文 critical 第三次 fresh decode 与正式 WAV 字节一致。机器摘要见
experiments/sota_smoke_moss_audio_tokenizer_full_v1_native_v1.json。这完成 G4,不代表 ASR、
speaker、表达或听测质量通过。
完整 v2 单句节点(2026-07-20):3 shard 共 8,495,058,856 bytes 全部匹配;2.124B 参数
严格加载。v2 checkpoint remote code 与 GitHub 固定源码不同,且暴露两个上游陷阱:
output_loading_info tuple 崩溃、未显式补帧会丢最后 75 ms。adapter 以 Transformers 基类保留
严格 key 检查,并把每声道补 240 samples 后得到 32×41 token。表示 4006.11 bps、完整 payload
7374.66 bps;encode/decode RTF 14.75/14.49,所有尝试最高进程树 RSS 4.42 GB。两个 fresh decoder
字节一致。该节点仍只是单句 G2/内存可行。
完整 v2 G4(2026-07-20):冻结 3 英 + 3 中 + 2 critical 共 50.415 秒全部成功。
表示码率句均值 4027.34 bps,完整 payload 句均值 5991.76 bps;encode/decode 冷进程 RTF
均值 13.37/13.15,最大进程树 RSS 4.12 GB,16 个阶段均未越过 24 GiB。中文 critical 的
第三个 fresh decoder 输出与正式 WAV 字节一致。机器摘要见
experiments/sota_smoke_moss_audio_tokenizer_full_v2_native_v1.json。MOSS 三个尺度的 G4
至此封口,但统一内容、身份、表达和听测质量仍未开始。
Quark HCodec 1.0 G4(2026-07-20):固定 582.20 MB codec 后又发现官方 encoder
会通过第三方 mirror 浮动下载 377.51 MB bosonai/hubert_base;现已把 HuBERT revision、config
与 weight 一并冻结。冻结 3 英 + 3 中 + 2 critical 共 50.415 秒全部成功,每句均保存
acoustic/semantic 各 4×T 的 10-bit 双流;表示/完整 payload 句均值 2006.10/3397.51 bps。
冷进程 encode/decode RTF 句均值 2.56/2.01,最大 RSS 1.77 GB,16 个阶段均未越 24 GiB;中文
critical 的第三个 fresh decoder 输出字节一致。官方 README 的直接脚本命令因相对导入实际失败,
adapter 在不修改源码的前提下建立显式 package context。机器摘要见
experiments/sota_smoke_quark_hcodec_1_0_native_v1.json。
Quark HCodec 1.5 单句探针(2026-07-20):固定 2.75 GB codec 后发现官方 encoder 还会
通过第三方 mirror 浮动下载 1.27 GB facebook/wav2vec2-large-xlsr-53,现已把它作为独立 encoder
身份冻结并离线加载。固定阈值 0.6 把最短英文句的 82 个 25 Hz 基帧合并为 65 组;adapter 对
上游八份重复长度逐一交叉核验,只传一个共享 3-bit 长度和八个 10-bit code,即 83 bits/group,
表示码率 1647.33 bps。encoder、fresh decoder 与第二次重放的最大 RSS 5.81 GB,均未越 24 GiB;
两次输出字节一致。机器摘要见
experiments/sota_probe_quark_hcodec_1_5_native_v1.json。这只批准扩展,不是 G4 或质量结论。
Quark HCodec 1.5 G4(2026-07-20):固定阈值 0.6 的 3 英 + 3 中 + 2 critical 全部通过,
1264 个基础帧合并为 808 组,长度直方图为 1:682, 2:36, 3:20, 4:15, 5:8, 6:10,
7:6, 8:31。表示码率句均值/聚合值 1363.37/1330.24 bps,完整 payload 为
3190.48/2959.43 bps;相同 8 句下比 HCodec 1.0 的表示聚合码率低 33.68%,但尚未验证质量等价。
英文/中文 aggregate 分别为 1528.15/1159.42 bps,但单句范围 980.59–1773.27 bps,样本太少,
不能解释成语言效应。encode/decode RTF 句均值 5.85/5.21,最大 RSS 5.91 GB;中文否定句第三次
fresh replay 字节一致。机器摘要见 experiments/sota_smoke_quark_hcodec_1_5_native_v1.json。
BigCodec 单句探针(2026-07-20):固定源码 09845ab… 与 637,937,326-byte checkpoint,
严格加载 159,436,290 参数、533 个 state keys 零 missing/unexpected。官方 requirements.txt
漏列 tqdm,补齐后官方脚本又因硬编码 .cuda() 在本机失败;35 包 Python 3.9.22 CPU wrapper
使用不变的官方类、state dict、padding 和量化公式。最短句输出 263 个 8192-entry indices,
13-bit 表示 3419 bits / 1043.97 bps;exact-hop 仍多出的 3.97 bps 来自上游始终补 1–200 samples。
code-derived embedding 与上游量化 embedding 最大误差 2.38e-7。fresh decoder 与第二次重放
WAV 字节一致;最大 RSS 1.79 GB。机器摘要见 experiments/sota_probe_bigcodec_native_v1.json。
BigCodec G4(2026-07-20):冻结 3 英 + 3 中 + 2 critical 全部通过,4,039 个真实 indices
计为 52,507 bits,句均值/聚合表示码率 1041.66/1041.49 bps;有限文件完整 payload 聚合为
2171.57 bps。1–200 sample 的官方 padding(包括 exact-hop 多补一帧)解释了相对渐近 1040 bps
的偏差。encode/decode RTF 句均值 6.37/5.76,最大 RSS 2.12 GB;所有输出 exact-length、finite,
中文否定句第三次 fresh replay 字节一致。机器摘要见
experiments/sota_smoke_bigcodec_native_v1.json。该结果不包含质量指标,也不授权伪造 rate curve。
WavTokenizer small 单句探针(2026-07-20):固定源码 5cf440d… 与 1,589,082,492-byte
checkpoint,官方 loader 严格加载 80,913,988 参数/289 state keys。最短句在 24 kHz 恰为
78,600 samples,产生 131 个 4096-entry codes;真实 12-bit 表示为 1572 bits / 480.00 bps,
token body 197 bytes,完整 payload 1195 bytes / 2919.08 bps。codes_to_features 与 encoder
量化特征误差为 0;fresh decoder 和第三次 replay 输出 SHA-256 同为 de0afa27…52db。主动
guard 采样峰值 1.24 GB,输出 exact-length、finite。机器摘要见
experiments/sota_probe_wavtokenizer_small_native_v1.json。
WavTokenizer small G4(2026-07-20):冻结 3 英 + 3 中 + 2 critical 全部通过,共 2,019 个
真实 codes、24,228 representation bits;按 50.415063 秒加权的表示码率为 480.57 bps,有限文件
完整 payload 为 1752.17 bps。五句实测 partial-hop padding,odd-length 英文 critical 经 24 kHz
裁掉 238 samples、16 kHz 再校正 -1 sample 后精确恢复原长;第三次 source-blind replay 与正式
重建 SHA-256 同为 2e911947…cd3。encode/decode RTF 句均值 1.38/2.16,最大进程树 RSS
1.58 GB。所有输出 finite;两句共出现 3 个负满幅 PCM16 样本,因此 transport/accounting G4
通过,但削波必须进入统一质量指标检查。机器摘要见
experiments/sota_smoke_wavtokenizer_small_native_v1.json。
WavTokenizer large unified 单句探针(2026-07-20):固定 1,759,224,573-byte checkpoint,
SHA-256 72182c1b…8205。官方仓库没有另附 config;checkpoint metadata 记录了训练时的 75-token
resume_config lineage 路径,不能当当前推理配置,因此以 state dict 和运行时结构裁决:40-token YAML 严格加载 80,913,988
参数/289 state keys,ratios (4,5,5,6)、hop 600、单 q4096 codebook 全吻合。最短句产生 131
个真实 codes,1572 bits / 480.00 bps;完整 payload 1224 bytes / 2989.92 bps。encode/decode RTF
2.59/3.56,最大进程树 RSS 1.24 GB,第三次 source-blind replay SHA-256 与正式重建同为
d51d814e…45e2。与 small 同句的 131 个 token 零位置相同,只证明权重学到不同表示,不构成
质量排名。机器摘要见 experiments/sota_probe_wavtokenizer_large_unified_native_v1.json。
WavTokenizer large unified G4(2026-07-20):冻结 8 句全部通过,共 2,019 个真实 codes、
24,228 representation bits;与 small 相同,聚合表示码率 480.57 bps。large 完整 payload 聚合
1788.99 bps,相对 small 的 1752.17 bps 只多出每文件 29-byte checkpoint/variant 身份。五句
partial-hop 与 odd-length 的 238-sample trimming、-1 sample 校正均通过,第三次 replay 与正式
重建 SHA-256 同为 777e6af6…ae34。encode/decode RTF 句均值 1.46/2.17,最大进程树 RSS
1.55 GB;8 句无满幅样本。small 与 large 的 2,019 个 token 位置全部不同,证明表示不同,但
削波、token identity 和单次 CPU timing 都不是质量结论。机器摘要见
experiments/sota_smoke_wavtokenizer_large_unified_native_v1.json。
下一节点:WavTokenizer large speech 75-token guarded 单句真实 code 探针;把它作为独立系统, 不把不同 hop、训练 checkpoint 和 token rate 冒充 large unified 的纯 rate knob。
每个通过系统必须:
- [x] 运行冻结的 3 英 + 3 中 + 2 critical;
- [x] 保存重建 WAV、encoder 输出、stdout/stderr、环境和 checkpoint hash;
- [x] fresh decoder 进程不接收原音路径;
- [x] 文件非空、音频有限值、时长合理;
- [x] 记录 encode/decode RTF、峰值 RSS、模型/decoder bytes;
- [x] 作者推荐点与本地配置逐字段对应。
Milestone C2 · Wave 1 Accounted(2026-07-19 已通过):六项均有 passed / reproducible_failed /
hardware_deferred / license_deferred 之一;至少 4 项通过 G1 原生重建,至少 3 项通过 G2 保存
表示和独立解码。若达不到,不修改门槛;报告真实平台边界。
Day 6–8 · 7/25–7/27:Wave 2 前沿宽度¶
按 checkpoint 已固定、下载成本和机制互补性安排:
- MOSS:Nano/full v1/full v2 均已 8/8 G4;后续进入合法 rate curve 与统一指标;
- Quark HCodec:1.0 与 1.5 均完成冻结 8 句 G4;1.5 固定 0.6 阈值逐句保存 group-length 分布, 后续进入统一质量指标与上游支持的合法 threshold curve;
- BigCodec:159.44M 参数冻结 8 句真实 13-bit 单码本 payload G4 已通过;后续统一指标与机制卡, 不制造未获上游支持的 rate sweep;
- WavTokenizer:small 与 large unified 40-token 均完成冻结 8 句 G4;下一步 large speech 75-token 单句探针,同时把两个 40-token 点排入含削波检查的同 rate 统一质量比较;
- X-Codec 2.0:至少中英 native smoke,确认语义增强是否改动原话;
- TaDiCodec:先定义 target text / prompt text / prompt speech 的 side-information 合同;在 payload-only decoder 未证明前不下载、不进入公平 codec smoke。
Milestone C3 · Frontier Breadth(2026-07-20 已达到):Wave 2 已有 MOSS、Quark HCodec、 BigCodec、WavTokenizer 四个家族完成 G1–G4;其余保留完整阻塞或待执行证据。 所有通过点进入同一个 result schema;OOM、unsupported、license failure 都落结构化结果,不缺行。
Day 9 · 7/28:补 Wave 3 的高信息缺口¶
不追求把 Wave 3 十二项都安装。选择能修补当前覆盖盲区的 2–3 项:
- 缺共同框架对照:SoundStream/ESPnet、FunCodec 或 HiFiCodec;
- 缺流式部署:AudioDec 或 Lyra;
- 缺 factorized representation:FACodec 或 TiCodec;
- 缺 decoder 先验:FlowDec;
- 缺语义 token 历史锚:SpeechTokenizer。
选择写入 execution matrix,未选者保留明确的后续 wave,不从 Census 删除。
验证:能用一句话说明每个补跑系统修复了哪个机制/约束盲区;不能以“更有名”作为唯一理由。
Day 10–11 · 7/29–7/30:合法 stress curve¶
至少选择 3 个已经 native 通过且机制不同的神经教师:
- EnCodec:RVQ 1.5/3/6/12/24 kbps;
- Focal/Stable/BigCodec 中至少一个低率/scaling 教师;
- DAC/SNAC/Mimi/Quark/WavTokenizer 中至少一个高能力、多尺度或流式教师。
每个点只能改作者支持的 RVQ depth、码本、FSQ 配置、帧率、带宽、因果模式或 decoder 资源。 不允许把 token 文件 zip 后称作 codec 码率,也不允许丢 token 却不重新验证 decoder 合同。
报告:
- [ ]
author_nominal_bps、representation_bps、measured_packed_bps; - [ ]
B_tx / M_dec / C_dec / L / F; - [ ] 原音与重建 ΔWER/ΔCER、critical、speaker、F0/voicing 和质量指标;
- [ ] 内容、实体、身份、表达、自然度、算力各自在哪个点先坏;
- [ ] 不能合法调率的模型标“capability/mechanism teacher”,不伪造曲线。
Milestone C4 · Stress Evidence:≥3 个教师各有 native + 至少一个 stress 点;结果可从 payload 文件重算,失败顺序不靠主观印象。
Day 12–13 · 7/31–8/1:统一中英本地前沿¶
只让通过 G3 真实计账的系统进入公平 payload 图;其他系统进入能力/资源诊断图并带警告。
数据:
- 英文:LibriSpeech test-clean 固定 60 句;
- 中文:FLEURS 普通话固定 30 句,另审计 AISHELL-1 确定性子集;
- 德/法/西/日/韩:FLEURS 各 10 句快速 probe;
- 私有录音:只做关键实体与真实设备压力,不冒充标准 benchmark。
至少画:
- bitrate–内容忠实;
- bitrate–感知质量;
- bitrate–身份/韵律;
- bitrate–decoder size/RTF/latency;
- capability 图和 constrained 图分开。
Milestone C5 · Local Conditional Frontier:报告能够回答“在什么数据、码率、延迟、模型 大小和硬件条件下谁处于前沿”,禁止输出一个跨条件总冠军。
Day 14 · 8/2:Coverage Gate 与 seed 决策¶
通过条件:
- Wave 1 六项全部有结论;
- Wave 2 至少 4/6 完成 G1–G4;
- 至少 6 个神经家族完成统一 smoke;
- 至少 3 个神经教师完成 stress;
- 覆盖高能力、低码率、流式、部署、多尺度/语义五种机制;
- 至少 3 张机制卡,每张都有可证伪的“小学生能否继承”假设。
若通过:写 docs/SEED_CODEC_DECISION.md,比较 Codec 2 参数流、LPCNet/FARGAN、小 residual、
SOTA 教师最小学生四类基质,选出 48 小时内能闭环的 seed v0。
若未通过:不为了赶日期假装通过;把未过项压成 3–5 天限时补充计划。Census 已经足够全面时, 不能再用“又有新论文”无限追加前置项。
四、这 14 天用户需要做什么¶
目前不需要重新录音,也不需要人工听 5000 票。只有以下情况需要用户介入:
- 新 gated 模型需要接受官方条款;
- 某许可明确要求用户决定是否仅限研究/非商用;
- 20–30 题新协议听测用于检查自动指标是否在近前沿失灵。
其他下载、隔离环境、smoke、计账、指标和审计由本地自动完成并逐节点汇报。
五、14 天内明确不做¶
- 不把 40 个 Census 条目强行塞进一张伪公平总榜;
- 不因模型默认码率高、decoder 大或不是专门 low-bit 而排除;
- 不把 paper-only 的作者 MOS/WER 当成本地结果;
- 不等待每一篇论文开放代码后才做实验;
- 不在 Coverage Gate 前启动大规模 AI evolution;
- 不先建 MAP-Elites、island 或通用 agent 平台;
- 不用更多同格式英文单听者总体票替代内容、身份和多语言证据。
六、两周后的决策¶
- Go to Seed:C1–C5 和 Coverage Gate 通过,进入 seed v0 的 48 小时实现;
- Short Extension:Census/Matrix 合格,但 runnable coverage 少 1–2 项;限时补 3–5 天;
- Platform-Limited:大部分现代前沿在 M5/32 GB 无法运行;保留加载证据,选择能本地复现的 最近代表,并明确计划需要何种云/GPU 资源;
- Evaluation-Limited:模型能跑但真实 representation/统一指标不可信;先修计账和基准,不启动 AI。