跳转至

EvoSpeech · 未来 14 天执行路线(SOTA Census 版)

历史快照,已停止执行。 本文件保存 2026-07-20 的 SOTA Census/G1–G4 工程接入路线, 用于追溯当时的假设、结果和决策,不再定义当前 TODO。历史 G4 现在只解释为 Transport Qualified。当前路线见 ../ROADMAP_14D.md,完成标准见 ../EVALUATION_DOD.md

时间:2026-07-20 → 2026-08-02

这 14 天的目标从“冻结 8 个模型后马上做原创 seed”修订为:建立足够宽、证据分级、真实可运行的本地 SOTA 前沿,然后由前沿证据决定 seed。

不要求把 40 个 Census 条目全下载全跑:paper-only、挑战报告和通信标准本来就不都能本地 复现。但 27 个公开可运行/可审计对象必须各有执行决定,当前前沿不能因为旧短名单上限被删掉。

一、14 天交付物

  1. configs/sota_census_v1.json:无数量上限的模型/标准/挑战/论文 Census;
  2. configs/sota_execution_matrix_v1.json:所有公开可运行代表的 wave、状态、下一 gate;
  3. reports/sota_reproduction_status_v1.md:成功、失败、deferred、许可、硬件和依赖证据;
  4. reports/sota_stress_v1.md:至少 3 个神经教师的 native → legal stress 曲线;
  5. reports/baseline_matrix_v1.md:达到公平合同的模型在中英统一数据上的条件化比较;
  6. 至少 3 张 knowledge/speech-codecs/ 机制卡;
  7. Coverage Gate 通过时生成 docs/SEED_CODEC_DECISION.md;没通过则交付缺口和下一周限时计划, 不凭偏好偷跑 seed。

二、先看懂这轮在做什么

找全重要方向
  ↓  Census:谁重要、来源是什么、证据到哪一级
筛出可执行对象
  ↓  Matrix:每个公开模型何时跑、下一关是什么
先跑作者原生配置
  ↓  确认模型真的能重建,而不是只会下载
保存真实 token/bitstream
  ↓  fresh decoder 独立重建,实际文件计字节
统一中英小样本
  ↓  看质量、文字、身份、速度、内存,失败也入表
合法降低码率/资源
  ↓  找到每个强模型“什么最后才消失、什么最先坏”
提炼共同机制
决定第一个原创 Baseline

这不是为“做排行榜”而安装模型。它在回答:最强模型的优势究竟来自 encoder、量化器、token 时率、decoder 先验、训练规模还是非因果条件;其中哪一部分能被压入我们的通信约束。

三、逐日任务、产物和验证

Day 1 · 7/20:冻结 Census v1 与证据等级

  • [x] 建立 40 项综合快照,覆盖通信锚点、波形 codec、语义/声学 tokenizer、流式/部署、 资源挑战、标准和 2026 机制论文;
  • [x] 所有条目保存一手来源;可固定的 Git 源码保存 40 位 revision;
  • [x] 分清 local_smoke / open_runnable / open_framework / open_code_partial / challenge_report / paper_only / standard_or_licensed
  • [x] Stable、SNAC、Mimi、X-Codec 2.0 等不再是互斥替补;
  • [x] 增加机器审计,防止重要代表和可运行对象从计划中消失。

Milestone C1 · Census Audited:已通过。

验证命令:

python3 scripts/audit_sota_census.py
pytest tests/test_sota_census.py -q

通过标准:≥30 项、关键类别齐全、关键代表齐全、ID 唯一、来源合法、全部公开 runnable 有 execution decision、Wave 0 只能标 infrastructure_qualified。当前结果:40 项、27 项执行决定、 5 个专项测试通过。

Day 2 · 7/21:固定 Wave 1/2 的 checkpoint、许可和最小命令

按以下顺序逐项做 source audit,不加载大权重:

  1. Wave 1:DAC、FocalCodec-Stream、Stable Codec、Mimi、LPCNet、SNAC;
  2. Wave 2:MOSS-Audio-Tokenizer、Quark HCodec、BigCodec、WavTokenizer、X-Codec 2.0、 TaDiCodec。

每个系统写入:

  • [x] 官方 checkpoint URL 与不可变 revision/hash;
  • [x] code / checkpoint / dataset 的许可和 gated 状态;
  • [x] 作者 native point、采样率、因果/流式声明、合法 rate knob;
  • [x] 预计权重大小、依赖、Python/PyTorch 范围和 Apple Silicon 风险;
  • [x] 最小 encode/decode 调用和是否需要另外下载声码器/语义 encoder;
  • [x] 若作者没有完整推理路径,立即从 open_runnable 降为 open_code_partial,不猜。

Milestone C1b · Sources Audited:2026-07-19 已通过。 Wave 1 6/6、Wave 2 6/6 完成; 初审固定 26 个权重文件;执行 HCodec 1.0/1.5 时补出其未声明的 HuBERT 与 Wav2Vec2 权重,现为 28 个权重文件。MOSS Nano/full v1/full v2、HuBERT 与 Wav2Vec2 config 共 14 个可执行身份文件。 静态审计、在线 Hub/LFS + executable-identity 审计及 8 个 专项回归测试通过。Stable Codec 因 CUDA FlashAttention/无 CPU 支持标 Mac 平台 deferred; Quark HCodec 2.0 无权重;TaDiCodec 需要文本和 prompt 语音,不能直接进入公平 payload 表。 详见 docs/SOTA_SOURCE_AUDIT_V1.md

Day 3–5 · 7/22–7/24:Wave 1 原生复现

每个系统使用 .model-envs/<id>,禁止污染核心 .venv。单系统第一次安装/修复限 120 分钟; 超时保存命令、日志、环境锁和最后错误,标 deferred 后继续下一个。

建议执行顺序:

  1. SNAC:2026-07-19 已完成。第一个新多尺度 token 教师和 packed 格式已通过 G1/G2;
  2. DAC:2026-07-19 已完成。建立高保真、非 low-bit 能力教师及官方 .dac 文件锚点;
  3. FocalCodec-Stream:2026-07-19 已完成整句 native point。建立 causal 低帧率教师;
  4. Mimi:2026-07-19 已完成整句 native point。建立现代 causal 语义/声学 token 教师;
  5. LPCNet:2026-07-19 已完成 native point。建立小型部署教师;
  6. Stable Codec:source audit 已给出 platform_deferred,只在 CUDA/FlashAttention 主机恢复, 本机不下载 3.81 GB 权重。

SNAC 节点结果:8/8 中英/critical 成功;三尺度实际 12-bit code 均值 992.0 bps,带 确定性 transport header 的真实文件均值 1712.7 bps;fresh decoder 只凭 payload 重建,抽样 WAV 字节级复现;冷进程 CPU encode/decode RTF 1.348/1.039,最大 RSS 976.1 MiB,decoder+ quantizer state 50.17 MiB。该结果证明“可运行与可计账”,不证明质量排名。首轮因 runner 错误解析 venv symlink 而 8/8 失败,失败记录保留;修复和回归测试已落地。机器摘要见 experiments/sota_smoke_snac_native_v1.json

DAC 节点结果:固定源码只能加载官方 release 0.0.5 .pth,不能直接加载此前登记的 HF Transformers model.safetensors;现已分开两条来源合同。原生结构实测 50 frame/s × 12 个 10-bit codebook,完整表示均值 6003.8 bps,而不是此前由不一致 HF 配置推导的 3750 bps。 修复上游 .dac 对 exact-hop 长度少 8 samples 的 reshape 缺陷后,8/8 中英/critical 成功; 官方 .dac 文件均值 10397.5 bps,MPS 冷进程 encode/decode RTF 2.006/1.383,最大 RSS 1074.3 MiB,decoder+quantizer state 200.86 MiB。普通长度和 exact-hop 各做一次 fresh decoder, WAV 均字节级复现。首轮 3/8 成功、5 个 exact-hop 失败的产物保留。机器摘要见 experiments/sota_smoke_dac_native_v1.json

FocalCodec-Stream 节点结果:固定 4k causal checkpoint,实际 12-bit token 均值 600.38 bps, 带冻结身份/长度 header 的 payload 均值 1482.44 bps;8/8 中英/critical 成功,普通长度与奇数 长度各一次 fresh decoder WAV 字节级复现。MPS 冷进程 encode/decode RTF 1.510/1.390,最大 RSS 2940.7 MiB,decoder path 448.79 MiB。首轮 7/8 暴露 24→16 kHz 奇数长度多 1 sample, 现只允许 ±1 sample 并确定性裁剪/补零,超过即失败。checkpoint 是 causal 且上游给出 80 ms 理论延迟,但本轮调用整句 token path,因此诚实登记 streaming=false;stateful chunk 等价性 是下一 gate。机器摘要见 experiments/sota_smoke_focalcodec_stream_native_v1.json

Mimi 节点结果:固定 kyutai/mimi Transformers checkpoint,12.5 Hz × 8 个 2048-entry codebook 的理论表示为 1100 bps;有限句帧取整后实测均值 1107.52 bps,完整 payload 均值 2049.12 bps。CPU 冷进程 encode/decode RTF 0.554/0.563,最大 RSS 1039.1 MiB,decoder path 218.51 MiB;8/8 中英/critical 成功,独立重放字节级一致。source audit 原先记录的 Moshi loaders.get_mimi 与该官方 Transformers 转换 checkpoint key 不兼容;正式路径改为严格固定 transformers==4.45.0,不以 strict=False 掩盖错配。本轮仍是整句 API,故 streaming=false。 机器摘要见 experiments/sota_smoke_mimi_native_v1.json

LPCNet 节点结果:固定源码与 2ddc476 模型包,使用 Apple clang/NEON static build;clean rebuild 二进制 SHA-256 一致。默认 shared build 因 demo 调用 hidden 内部符号而链接失败,改用 官方 --disable-shared --enable-static 配置闭环,无算法补丁。8/8 raw 8-byte/40-ms packet 往返成功,表示和完整文件码率同为均值 1604.88 bps;CPU 冷进程 encode/decode RTF 0.051/0.202,最大 RSS 40.3 MiB。learned decoder weights 6.66 MiB、完整二进制 8.10 MiB, 仍不满足最终 ≤5 MiB 合同。机器摘要见 experiments/sota_smoke_lpcnet_native_v1.json

Milestone C2 已完成:Wave 1 为 5 个 G2 passed + Stable Codec 1 个 Mac platform deferred; 六项都有明确结论,且超过 ≥4 G1 / ≥3 G2 门槛。

MOSS Nano 节点结果:固定 22M 参数、48 kHz stereo checkpoint 与 checkpoint 内两份 remote-code SHA;本地离线严格加载。16 个 1024-entry RVQ 的理论表示为 2000 bps,8 句有限帧 取整后均值 2013.67 bps,完整 payload 均值 3629.18 bps。CPU 冷进程 encode/decode RTF 0.960/0.855,最大 RSS 671.7 MiB,8/8 中英/critical 成功,fresh decoder 与独立重放字节级 一致。MPS token 与 CPU 完全一致但冷 encode 更慢,故正式用 CPU。机器摘要见 experiments/sota_smoke_moss_audio_tokenizer_nano_native_v1.json

完整 v1 单句节点结果(2026-07-20):两个 shard 共 7,098,461,728 bytes,整文件 SHA-256 均匹配;remote code 与固定 GitHub revision 完全一致。1,774,566,400 参数严格加载无缺失/多余 key;最短句保存 32×41 真实 10-bit token,表示 4006.11 bps、完整 payload 6720 bps。 encoder 与两个 fresh decoder 均在独立 CPU 进程运行,encode/decode RTF 9.14/6.78;进程树峰值 RSS 3.62/3.84 GB,未触发 24 GiB guard。第二次 decoder 输出 SHA 与第一次完全一致。这里较低 RSS 来自 safetensors/OS 按需映射,不把 7.10 GB shared weights 错写成 3.84 GB 模型。

该节点只证明一条英文短句的 G2 与内存可行,不是 8 句 G4,更不是质量 SOTA。机器摘要见 experiments/sota_probe_moss_audio_tokenizer_full_v1_memory_v1.json

完整 v1 G4(2026-07-20):正式 runner 已把 guard 证据写进每一行;3 英 + 3 中 + 2 critical 共 50.415 秒全部成功。表示码率句均值 4027.34 bps,完整 payload 句均值 5611.22 bps;encode/decode 冷进程 RTF 均值 5.55/4.49,最大进程树 RSS 3.90 GB,16 个阶段 均未越过 24 GiB。中文 critical 第三次 fresh decode 与正式 WAV 字节一致。机器摘要见 experiments/sota_smoke_moss_audio_tokenizer_full_v1_native_v1.json。这完成 G4,不代表 ASR、 speaker、表达或听测质量通过。

完整 v2 单句节点(2026-07-20):3 shard 共 8,495,058,856 bytes 全部匹配;2.124B 参数 严格加载。v2 checkpoint remote code 与 GitHub 固定源码不同,且暴露两个上游陷阱: output_loading_info tuple 崩溃、未显式补帧会丢最后 75 ms。adapter 以 Transformers 基类保留 严格 key 检查,并把每声道补 240 samples 后得到 32×41 token。表示 4006.11 bps、完整 payload 7374.66 bps;encode/decode RTF 14.75/14.49,所有尝试最高进程树 RSS 4.42 GB。两个 fresh decoder 字节一致。该节点仍只是单句 G2/内存可行。

完整 v2 G4(2026-07-20):冻结 3 英 + 3 中 + 2 critical 共 50.415 秒全部成功。 表示码率句均值 4027.34 bps,完整 payload 句均值 5991.76 bps;encode/decode 冷进程 RTF 均值 13.37/13.15,最大进程树 RSS 4.12 GB,16 个阶段均未越过 24 GiB。中文 critical 的 第三个 fresh decoder 输出与正式 WAV 字节一致。机器摘要见 experiments/sota_smoke_moss_audio_tokenizer_full_v2_native_v1.json。MOSS 三个尺度的 G4 至此封口,但统一内容、身份、表达和听测质量仍未开始。

Quark HCodec 1.0 G4(2026-07-20):固定 582.20 MB codec 后又发现官方 encoder 会通过第三方 mirror 浮动下载 377.51 MB bosonai/hubert_base;现已把 HuBERT revision、config 与 weight 一并冻结。冻结 3 英 + 3 中 + 2 critical 共 50.415 秒全部成功,每句均保存 acoustic/semantic 各 4×T 的 10-bit 双流;表示/完整 payload 句均值 2006.10/3397.51 bps。 冷进程 encode/decode RTF 句均值 2.56/2.01,最大 RSS 1.77 GB,16 个阶段均未越 24 GiB;中文 critical 的第三个 fresh decoder 输出字节一致。官方 README 的直接脚本命令因相对导入实际失败, adapter 在不修改源码的前提下建立显式 package context。机器摘要见 experiments/sota_smoke_quark_hcodec_1_0_native_v1.json

Quark HCodec 1.5 单句探针(2026-07-20):固定 2.75 GB codec 后发现官方 encoder 还会 通过第三方 mirror 浮动下载 1.27 GB facebook/wav2vec2-large-xlsr-53,现已把它作为独立 encoder 身份冻结并离线加载。固定阈值 0.6 把最短英文句的 82 个 25 Hz 基帧合并为 65 组;adapter 对 上游八份重复长度逐一交叉核验,只传一个共享 3-bit 长度和八个 10-bit code,即 83 bits/group, 表示码率 1647.33 bps。encoder、fresh decoder 与第二次重放的最大 RSS 5.81 GB,均未越 24 GiB; 两次输出字节一致。机器摘要见 experiments/sota_probe_quark_hcodec_1_5_native_v1.json。这只批准扩展,不是 G4 或质量结论。

Quark HCodec 1.5 G4(2026-07-20):固定阈值 0.6 的 3 英 + 3 中 + 2 critical 全部通过, 1264 个基础帧合并为 808 组,长度直方图为 1:682, 2:36, 3:20, 4:15, 5:8, 6:10, 7:6, 8:31。表示码率句均值/聚合值 1363.37/1330.24 bps,完整 payload 为 3190.48/2959.43 bps;相同 8 句下比 HCodec 1.0 的表示聚合码率低 33.68%,但尚未验证质量等价。 英文/中文 aggregate 分别为 1528.15/1159.42 bps,但单句范围 980.59–1773.27 bps,样本太少, 不能解释成语言效应。encode/decode RTF 句均值 5.85/5.21,最大 RSS 5.91 GB;中文否定句第三次 fresh replay 字节一致。机器摘要见 experiments/sota_smoke_quark_hcodec_1_5_native_v1.json

BigCodec 单句探针(2026-07-20):固定源码 09845ab… 与 637,937,326-byte checkpoint, 严格加载 159,436,290 参数、533 个 state keys 零 missing/unexpected。官方 requirements.txt 漏列 tqdm,补齐后官方脚本又因硬编码 .cuda() 在本机失败;35 包 Python 3.9.22 CPU wrapper 使用不变的官方类、state dict、padding 和量化公式。最短句输出 263 个 8192-entry indices, 13-bit 表示 3419 bits / 1043.97 bps;exact-hop 仍多出的 3.97 bps 来自上游始终补 1–200 samples。 code-derived embedding 与上游量化 embedding 最大误差 2.38e-7。fresh decoder 与第二次重放 WAV 字节一致;最大 RSS 1.79 GB。机器摘要见 experiments/sota_probe_bigcodec_native_v1.json

BigCodec G4(2026-07-20):冻结 3 英 + 3 中 + 2 critical 全部通过,4,039 个真实 indices 计为 52,507 bits,句均值/聚合表示码率 1041.66/1041.49 bps;有限文件完整 payload 聚合为 2171.57 bps。1–200 sample 的官方 padding(包括 exact-hop 多补一帧)解释了相对渐近 1040 bps 的偏差。encode/decode RTF 句均值 6.37/5.76,最大 RSS 2.12 GB;所有输出 exact-length、finite, 中文否定句第三次 fresh replay 字节一致。机器摘要见 experiments/sota_smoke_bigcodec_native_v1.json。该结果不包含质量指标,也不授权伪造 rate curve。

WavTokenizer small 单句探针(2026-07-20):固定源码 5cf440d… 与 1,589,082,492-byte checkpoint,官方 loader 严格加载 80,913,988 参数/289 state keys。最短句在 24 kHz 恰为 78,600 samples,产生 131 个 4096-entry codes;真实 12-bit 表示为 1572 bits / 480.00 bps, token body 197 bytes,完整 payload 1195 bytes / 2919.08 bps。codes_to_features 与 encoder 量化特征误差为 0;fresh decoder 和第三次 replay 输出 SHA-256 同为 de0afa27…52db。主动 guard 采样峰值 1.24 GB,输出 exact-length、finite。机器摘要见 experiments/sota_probe_wavtokenizer_small_native_v1.json

WavTokenizer small G4(2026-07-20):冻结 3 英 + 3 中 + 2 critical 全部通过,共 2,019 个 真实 codes、24,228 representation bits;按 50.415063 秒加权的表示码率为 480.57 bps,有限文件 完整 payload 为 1752.17 bps。五句实测 partial-hop padding,odd-length 英文 critical 经 24 kHz 裁掉 238 samples、16 kHz 再校正 -1 sample 后精确恢复原长;第三次 source-blind replay 与正式 重建 SHA-256 同为 2e911947…cd3。encode/decode RTF 句均值 1.38/2.16,最大进程树 RSS 1.58 GB。所有输出 finite;两句共出现 3 个负满幅 PCM16 样本,因此 transport/accounting G4 通过,但削波必须进入统一质量指标检查。机器摘要见 experiments/sota_smoke_wavtokenizer_small_native_v1.json

WavTokenizer large unified 单句探针(2026-07-20):固定 1,759,224,573-byte checkpoint, SHA-256 72182c1b…8205。官方仓库没有另附 config;checkpoint metadata 记录了训练时的 75-token resume_config lineage 路径,不能当当前推理配置,因此以 state dict 和运行时结构裁决:40-token YAML 严格加载 80,913,988 参数/289 state keys,ratios (4,5,5,6)、hop 600、单 q4096 codebook 全吻合。最短句产生 131 个真实 codes,1572 bits / 480.00 bps;完整 payload 1224 bytes / 2989.92 bps。encode/decode RTF 2.59/3.56,最大进程树 RSS 1.24 GB,第三次 source-blind replay SHA-256 与正式重建同为 d51d814e…45e2。与 small 同句的 131 个 token 零位置相同,只证明权重学到不同表示,不构成 质量排名。机器摘要见 experiments/sota_probe_wavtokenizer_large_unified_native_v1.json

WavTokenizer large unified G4(2026-07-20):冻结 8 句全部通过,共 2,019 个真实 codes、 24,228 representation bits;与 small 相同,聚合表示码率 480.57 bps。large 完整 payload 聚合 1788.99 bps,相对 small 的 1752.17 bps 只多出每文件 29-byte checkpoint/variant 身份。五句 partial-hop 与 odd-length 的 238-sample trimming、-1 sample 校正均通过,第三次 replay 与正式 重建 SHA-256 同为 777e6af6…ae34。encode/decode RTF 句均值 1.46/2.17,最大进程树 RSS 1.55 GB;8 句无满幅样本。small 与 large 的 2,019 个 token 位置全部不同,证明表示不同,但 削波、token identity 和单次 CPU timing 都不是质量结论。机器摘要见 experiments/sota_smoke_wavtokenizer_large_unified_native_v1.json

下一节点:WavTokenizer large speech 75-token guarded 单句真实 code 探针;把它作为独立系统, 不把不同 hop、训练 checkpoint 和 token rate 冒充 large unified 的纯 rate knob。

每个通过系统必须:

  • [x] 运行冻结的 3 英 + 3 中 + 2 critical;
  • [x] 保存重建 WAV、encoder 输出、stdout/stderr、环境和 checkpoint hash;
  • [x] fresh decoder 进程不接收原音路径;
  • [x] 文件非空、音频有限值、时长合理;
  • [x] 记录 encode/decode RTF、峰值 RSS、模型/decoder bytes;
  • [x] 作者推荐点与本地配置逐字段对应。

Milestone C2 · Wave 1 Accounted(2026-07-19 已通过):六项均有 passed / reproducible_failed / hardware_deferred / license_deferred 之一;至少 4 项通过 G1 原生重建,至少 3 项通过 G2 保存 表示和独立解码。若达不到,不修改门槛;报告真实平台边界。

Day 6–8 · 7/25–7/27:Wave 2 前沿宽度

按 checkpoint 已固定、下载成本和机制互补性安排:

  • MOSS:Nano/full v1/full v2 均已 8/8 G4;后续进入合法 rate curve 与统一指标;
  • Quark HCodec:1.0 与 1.5 均完成冻结 8 句 G4;1.5 固定 0.6 阈值逐句保存 group-length 分布, 后续进入统一质量指标与上游支持的合法 threshold curve;
  • BigCodec:159.44M 参数冻结 8 句真实 13-bit 单码本 payload G4 已通过;后续统一指标与机制卡, 不制造未获上游支持的 rate sweep;
  • WavTokenizer:small 与 large unified 40-token 均完成冻结 8 句 G4;下一步 large speech 75-token 单句探针,同时把两个 40-token 点排入含削波检查的同 rate 统一质量比较;
  • X-Codec 2.0:至少中英 native smoke,确认语义增强是否改动原话;
  • TaDiCodec:先定义 target text / prompt text / prompt speech 的 side-information 合同;在 payload-only decoder 未证明前不下载、不进入公平 codec smoke。

Milestone C3 · Frontier Breadth(2026-07-20 已达到):Wave 2 已有 MOSS、Quark HCodec、 BigCodec、WavTokenizer 四个家族完成 G1–G4;其余保留完整阻塞或待执行证据。 所有通过点进入同一个 result schema;OOM、unsupported、license failure 都落结构化结果,不缺行。

Day 9 · 7/28:补 Wave 3 的高信息缺口

不追求把 Wave 3 十二项都安装。选择能修补当前覆盖盲区的 2–3 项:

  • 缺共同框架对照:SoundStream/ESPnet、FunCodec 或 HiFiCodec;
  • 缺流式部署:AudioDec 或 Lyra;
  • 缺 factorized representation:FACodec 或 TiCodec;
  • 缺 decoder 先验:FlowDec;
  • 缺语义 token 历史锚:SpeechTokenizer。

选择写入 execution matrix,未选者保留明确的后续 wave,不从 Census 删除。

验证:能用一句话说明每个补跑系统修复了哪个机制/约束盲区;不能以“更有名”作为唯一理由。

Day 10–11 · 7/29–7/30:合法 stress curve

至少选择 3 个已经 native 通过且机制不同的神经教师:

  • EnCodec:RVQ 1.5/3/6/12/24 kbps;
  • Focal/Stable/BigCodec 中至少一个低率/scaling 教师;
  • DAC/SNAC/Mimi/Quark/WavTokenizer 中至少一个高能力、多尺度或流式教师。

每个点只能改作者支持的 RVQ depth、码本、FSQ 配置、帧率、带宽、因果模式或 decoder 资源。 不允许把 token 文件 zip 后称作 codec 码率,也不允许丢 token 却不重新验证 decoder 合同。

报告:

  • [ ] author_nominal_bpsrepresentation_bpsmeasured_packed_bps
  • [ ] B_tx / M_dec / C_dec / L / F
  • [ ] 原音与重建 ΔWER/ΔCER、critical、speaker、F0/voicing 和质量指标;
  • [ ] 内容、实体、身份、表达、自然度、算力各自在哪个点先坏;
  • [ ] 不能合法调率的模型标“capability/mechanism teacher”,不伪造曲线。

Milestone C4 · Stress Evidence:≥3 个教师各有 native + 至少一个 stress 点;结果可从 payload 文件重算,失败顺序不靠主观印象。

Day 12–13 · 7/31–8/1:统一中英本地前沿

只让通过 G3 真实计账的系统进入公平 payload 图;其他系统进入能力/资源诊断图并带警告。

数据:

  • 英文:LibriSpeech test-clean 固定 60 句;
  • 中文:FLEURS 普通话固定 30 句,另审计 AISHELL-1 确定性子集;
  • 德/法/西/日/韩:FLEURS 各 10 句快速 probe;
  • 私有录音:只做关键实体与真实设备压力,不冒充标准 benchmark。

至少画:

  1. bitrate–内容忠实;
  2. bitrate–感知质量;
  3. bitrate–身份/韵律;
  4. bitrate–decoder size/RTF/latency;
  5. capability 图和 constrained 图分开。

Milestone C5 · Local Conditional Frontier:报告能够回答“在什么数据、码率、延迟、模型 大小和硬件条件下谁处于前沿”,禁止输出一个跨条件总冠军。

Day 14 · 8/2:Coverage Gate 与 seed 决策

通过条件:

  1. Wave 1 六项全部有结论;
  2. Wave 2 至少 4/6 完成 G1–G4;
  3. 至少 6 个神经家族完成统一 smoke;
  4. 至少 3 个神经教师完成 stress;
  5. 覆盖高能力、低码率、流式、部署、多尺度/语义五种机制;
  6. 至少 3 张机制卡,每张都有可证伪的“小学生能否继承”假设。

若通过:写 docs/SEED_CODEC_DECISION.md,比较 Codec 2 参数流、LPCNet/FARGAN、小 residual、 SOTA 教师最小学生四类基质,选出 48 小时内能闭环的 seed v0。

若未通过:不为了赶日期假装通过;把未过项压成 3–5 天限时补充计划。Census 已经足够全面时, 不能再用“又有新论文”无限追加前置项。

四、这 14 天用户需要做什么

目前不需要重新录音,也不需要人工听 5000 票。只有以下情况需要用户介入:

  1. 新 gated 模型需要接受官方条款;
  2. 某许可明确要求用户决定是否仅限研究/非商用;
  3. 20–30 题新协议听测用于检查自动指标是否在近前沿失灵。

其他下载、隔离环境、smoke、计账、指标和审计由本地自动完成并逐节点汇报。

五、14 天内明确不做

  • 不把 40 个 Census 条目强行塞进一张伪公平总榜;
  • 不因模型默认码率高、decoder 大或不是专门 low-bit 而排除;
  • 不把 paper-only 的作者 MOS/WER 当成本地结果;
  • 不等待每一篇论文开放代码后才做实验;
  • 不在 Coverage Gate 前启动大规模 AI evolution;
  • 不先建 MAP-Elites、island 或通用 agent 平台;
  • 不用更多同格式英文单听者总体票替代内容、身份和多语言证据。

六、两周后的决策

  • Go to Seed:C1–C5 和 Coverage Gate 通过,进入 seed v0 的 48 小时实现;
  • Short Extension:Census/Matrix 合格,但 runnable coverage 少 1–2 项;限时补 3–5 天;
  • Platform-Limited:大部分现代前沿在 M5/32 GB 无法运行;保留加载证据,选择能本地复现的 最近代表,并明确计划需要何种云/GPU 资源;
  • Evaluation-Limited:模型能跑但真实 representation/统一指标不可信;先修计账和基准,不启动 AI。