EvoSpeech · 未来 30 天路线图¶
历史快照,已停止执行。 本文件保存 2026-07-20 以 G1–G4、seed 和首轮 AI smoke 为中心 的旧路线,不再提供当前日期承诺。当前路线见
../ROADMAP_30D.md, 完成标准见../EVALUATION_DOD.md。
时间:2026-07-20 → 2026-08-18
月目标不是“把评测系统修到完美”,而是跑完第一条完整科研链:
SOTA 原生复现 → rate/resource stress → 机制提炼 → 受约束原创种子 → 常规搜索 → AI 进化 smoke test。
历史前两周见 ROADMAP_14D_CENSUS_2026-07-20.md,
当前候选地图见 ../SOTA_MAP.md。
Week 1 · 7/20–7/26:SOTA Census、Wave 1 与本地可运行前沿¶
交付¶
- 维护不设数量上限的综合 Census,核实论文、代码、权重、许可、因果性、码率和资源;
- 对所有公开 runnable 代表给出 execution wave,不再用替补逻辑删除独立机制;
- Wave 1 六项全部得到 passed / reproducible failed / hardware deferred / license deferred 结论;
- Wave 2 至少四项固定 checkpoint、许可和最小推理路径;
- 至少跑通 Opus、Codec 2、EnCodec 加三个新神经家族的中英文 smoke;
- 至少三个 SOTA 教师完成作者原生点 + 一个合法 low-rate/resource 点;
- 建立统一 adapter 结果格式,保存日志、中间表示、资源和版本信息。
Gate W1 · Frontier Runnable¶
- 论文声明与本地测量严格分列;
- 每个 Wave 1 家族有固定版本和可复现命令,Wave 2 未固定项有精确阻塞;
- 每个失败模型有失败类型和复现日志;
- 能力、低码率、流式、部署、多尺度/语义和通信锚点均有代表;
- 不以 low-bit 标签过滤默认码率较高但机制重要的教师。
W1 不要求候选安全隔离。官方基线适配器是可信代码,目标是复现,不是假设它在主动作弊。
来源阶段状态(2026-07-19):Wave 1 6/6 与 Wave 2 6/6 已固定源码、权重 revision/LFS SHA、许可、最小入口和 rate knob。Stable Codec 在本机平台 deferred;TaDiCodec 因文本/prompt side information 暂不进入公平 payload 表。下一步从 SNAC native smoke 开始。
执行更新(2026-07-19):SNAC、DAC、FocalCodec-Stream、Mimi、LPCNet 均已 8/8 通过 G1/G2;Stable Codec 为本机 platform deferred,故 Wave 1 六项已有完整结论,C2 正式通过。 LPCNet raw payload 均值 1604.88 bps、CPU decode RTF 0.202,但 learned decoder weights 6.66 MiB, 尚不满足最终 ≤5 MiB。Mimi 与 FocalCodec 的 stateful streaming 均未测试,不能用论文能力 冒充本地实时结果。
Wave 2 更新(2026-07-20):MOSS Nano、1.775B full v1 与 2.124B full v2 均完成冻结 8 句 G4。两个 full 模型的 32 个 encoder/decoder 阶段都在 24 GiB 主动停止线下通过,最大 进程树 RSS 分别为 3.90/4.12 GB;中文 critical 的额外 fresh replay 均字节一致。这是 transport/accounting/resource 资格,不是统一质量结论。随后已转向并完成 Quark HCodec 1.0 双流离散表示与 fresh decoder 的同级资格验证。
Quark 更新(2026-07-20):HCodec 1.0 已在冻结 8 句完成 acoustic/semantic 双流真实 payload、fresh decoder、计账和 24 GiB guarded G4;表示/完整 payload 句均值 2006.10/3397.51 bps,最大 RSS 1.77 GB,中文 critical 的第三次重放字节一致。执行时发现的 官方浮动 HuBERT 和无效 README 直跑命令均已用固定本地依赖与显式 package context 封口。 2.75 GB HCodec 1.5 adaptive 单句探针也已通过:补齐隐藏的 1.27 GB Wav2Vec2 encoder 身份, 固定 0.6 阈值把 82 个基帧合并为 65 组,以一个共享 3-bit 长度加八个 10-bit code 计为 1647.33 bps;两次 fresh decode 字节一致。随后冻结 8 句 G4 也已 8/8 通过:808/1264 groups, 表示句均值/聚合值 1363.37/1330.24 bps,最大 RSS 5.91 GB,中文 critical 第三次重放字节一致。 相同集合下码率比 HCodec 1.0 低 33.68%,但质量等价尚未验证。HCodec 转入统一指标队列;其后 BigCodec 也已完成(见下),2.0 在权重发布前保持 open-code-partial。
BigCodec 更新(2026-07-20):官方 checkpoint、159.44M 参数和单码本 80 fps × 13 bits =
1040 bps 均已本地验证。上游漏列 tqdm 且推理脚本硬编码 CUDA;固定 35 包 Python 3.9.22
CPU wrapper 沿用不变的官方类与公式,单句保存 263 个真实 indices,表示 1043.97 bps,两个
fresh decoder 输出字节一致,峰值 RSS 1.79 GB。随后冻结 8 句 guarded G4 以 8/8 通过:4,039
个真实 indices、聚合表示/完整 payload 码率 1041.49/2171.57 bps、峰值 RSS 2.12 GB,中文
critical 第三次重放字节一致。其后 WavTokenizer small 单句也已完成(见下);BigCodec 的统一
内容/质量指标仍未开始,且没有已验证的第二个合法 rate point。
WavTokenizer 更新(2026-07-20):small speech 40-token checkpoint、80.91M 参数和
40 fps × 12 bits = 480 bps 已由本地真实 codes 验证。固定 25 包 Python 3.9.22 / torch 2.0.0
CPU 环境在最短句产生 131 个 codes,code-derived feature 误差为 0;两个 fresh decoder 输出
字节一致,主动 guard 峰值 1.24 GB。随后冻结 8 句 G4 以 8/8 通过:2,019 个 codes、聚合表示/
完整 payload 码率 480.57/1752.17 bps、峰值 RSS 1.58 GB;odd-length critical 完成 exact-length
trimming 与第三次字节一致重放。两句共 3 个负满幅 PCM16 样本进入削波检查。下一节点为 large
unified 40-token。该 checkpoint 随后已完成单句 guarded 探针:官方仓库虽未附 config,但 state
dict 与运行时严格确认相同的 80.91M 参数、600-sample hop 和 480 bps;131 个真实 codes 可由两次
source-blind fresh decoder 字节一致重建,峰值 RSS 1.24 GB。随后 large unified 冻结 8 句也以
8/8 通过:2,019 个真实 codes、聚合表示/完整 payload 码率 480.57/1788.99 bps、峰值 RSS
1.55 GB,odd-length 第三次重放一致且无满幅样本。small 与 large unified 推理结构相同、训练覆盖
不同,现已具备进入同 rate 共同质量指标的 transport 资格;large speech 75-token 下一步另作
独立系统,不冒充纯 rate sweep。
Week 2 · 7/27–8/2:Wave 2、统一基线与 seed Coverage Gate¶
交付¶
- 英文 60 句、中文 30 句主评测;德/法/西/日/韩各 10–30 句泛化探针;
author_nominal_bps / representation_bps / measured_packed_bps三口径分账;- Wave 2 至少 4/6 完成 source→native→saved representation→accounting→统一 smoke;
- 至少三个教师的 rate/resource 曲线、忠实度崩溃顺序和机制卡;
- 质量、内容、身份、表达、RTF、decoder 大小的多张 Pareto 图;
- Coverage Gate 通过后交付
docs/SEED_CODEC_DECISION.md;若只差 1–2 项则限时延长 3–5 天; - seed v0 实现移到 Gate 后的 48 小时,不因日历提前。
Gate W2 · Coverage Sufficient¶
- 本地基线表能指出不同约束下的前沿代表,而不是宣布一个“总冠军”;
- 每个公平 Pareto 点都有可保存、可独立解码的实际字节;
- Wave 1 全部有结论,Wave 2 至少 4/6 完成 G1–G4;
- ≥6 个神经家族通过统一 smoke,≥3 个教师有 stress curve,≥3 张机制卡;
- seed 决策明确继承至少一个 SOTA 教师机制,并说明为端侧合同删掉了什么。
W2 的真实 bitstream 是科学可比性要求,不等同于完整 CandidateContract 安全工程。
Week 3 · 8/3–8/9:实现原创种子并把它变成可研究的问题¶
1. 冻结搜索空间¶
- [ ] 按
SEED_CODEC_DECISION.md在 48 小时内实现完整 seed v0; - [ ] 先做至少 5 个手工/随机变体,确认两个以上方向产生可解释变化;
- [ ] 把 seed v0 整理成固定 I/O 骨架和 3–8 个可变维度;
- [ ] 每个变量写物理意义、范围、预期影响和非法组合;
- [ ] 建立 3 句 smoke、10 句 fast、英文/中文 full 三层评测;
- [ ] 记录每个候选的配置、代码 hash、bitstream hash、指标、耗时和父代。
验证:同一配置重复 3 次结果一致;非法配置不会污染档案;fast 层与 full 层的淘汰方向在一组已知变体上基本一致。
2. 先跑非 AI 对照¶
- [ ] 手工调参:限定 2–4 小时并记录每一步;
- [ ] 随机搜索:至少 20 个候选;
- [ ] TPE/贝叶斯优化:同候选数和同墙钟预算;
- [ ] 画 best-so-far 曲线、分布和 Pareto 移动,不只摘单个最好数字。
这些对照不是给 AI 设置“必须全胜”的口号。它们分别告诉我们:搜索空间是否有信号、常规优化是否已经足够、人工先验价值有多大。
3. 回答是否值得接 AI¶
Gate W3 · Searchable:
- 随机变体之间有稳定可测的差异;
- 至少一种常规方法比默认种子更好,证明空间不是死的;
- 单候选 fast 评估足够快,预计一晚可跑至少 20 个;
- 指标提升没有明显靠改词、丢身份或逃避真实码率获得。
如果 W3 不通过,先改 seed 或参数域;不要用 LLM 给一个不可搜索的问题制造热闹。
Week 4 · 8/10–8/18:最小护栏与第一次 AI 进化 smoke¶
1. 只实现自动搜索真正需要的护栏¶
CandidateContract Lite¶
- [ ]
encoder(input.wav) -> payload.bin;evaluator 独立读取文件字节; - [ ]
decoder(payload.bin) -> decoded.wav,decoder 不接收原音路径; - [ ] encoder/decoder 分进程和工作目录,限制超时、内存/输出大小;
- [ ] 本地 runner 明确命名为 trusted/dev,不冒充恶意代码安全沙箱;
- [ ] 用原音旁路、少报字节、共享临时文件三个攻击夹具验证接口边界。
Evaluator Guardrail Lite¶
- [ ] 中英内容至少使用两个不同 ASR 家族做晋级复核;内循环可用一个快速评委;
- [ ] 关键数字、金额、验证码、否定使用人工文本锚定的实体对齐;原音 ASR 不可靠时输出 abstain;
- [ ] speaker evaluator 至少用第二模型复核前沿候选,不要求进入每个 fast 评估;
- [ ] 五个已知关键实体漏检全部进入回归测试;unsupported/abstain 不得记为通过。
这四项在此时出现,是因为从这一周起 AI 能主动试探 evaluator。它们不是前两周寻找 SOTA 的前置条件。
2. 最小 AI runner¶
- [ ] 输入:seed/父代、允许修改的代码或配置、最近失败、完整指标和固定研究说明;
- [ ] 输出:一个可审计 diff 或参数配置,加一段可证伪假设;
- [ ] 自动执行 smoke → fast → 必要时 full;所有失败入档,不静默吞错;
- [ ] 先用单档案/单父代实现,不在首轮引入 MAP-Elites、岛屿和复杂元提示;
- [ ] 连续生成并评估 20–50 个候选,人工不在中间挑结果。
3. 同预算比较¶
- [ ] AI 组与 Week 3 的随机/TPE 采用相同候选数和墙钟预算;
- [ ] no-evolution LLM 作为额外对照:每次只见初始种子,不见父代历史;
- [ ] 报告存活率、失败类型、best-so-far、最终分布和 Pareto 前沿;
- [ ] 前 5 名候选逐个检查是否利用评估漏洞,并做最小消融。
Gate W4 / M1 · First Closed Loop¶
月底满足以下条件即可进入下个月扩大进化,不要求已经战胜 SOTA:
- 至少 6 个神经前沿家族完成本地统一 smoke,其中至少三个教师有 native+stress 曲线;
- 原创 seed 有真实 bitstream、固定搜索空间和常规搜索结果;
- AI 能无人干预完成 20–50 个候选,失败全部留痕;
- AI 与随机/TPE/no-evolution 的同预算结果可以比较;
- 最佳候选没有通过改词、身份坍缩或码率口径作弊获得分数;
- 能写出一页结论:AI 是否提供增益、增益发生在哪、下一轮该改搜索还是改表示。
Go / Conditional Go / No-Go¶
- Go:闭环稳定,AI 至少发现一个经复核的 Pareto 改进;下月做独立重复、扩大数据和更强搜索;
- Conditional Go:闭环稳定但 AI 不优于随机/TPE;这仍是有效结果,下月先诊断 prompt、档案或问题抽象;
- No-Go:seed 本身不可搜索,或 evaluator 可被明显钻空子;停止扩候选数,修 seed/裁判而不是堆 agent 框架。
本月不作为阻塞项¶
- 六语全部达到双 ASR 和论文级听测;
- 真正第三方 hostile sandbox、sealed hidden 和完整容器基础设施;
- 树莓派拿不到时的 ARM 最终合同;host RTF 先用于筛选,但不得宣称端侧达标;
- MAP-Elites、岛屿进化、模型 ensemble 和通宵数百候选;
- 弱网 App、丢包/FEC 产品化、MCU 部署;
- 论文没有代码的 2026 模型本地复现。
这些都重要,但只有在第一个“模型 → 基准 → 原创种子 → 自动改进”闭环成立后,继续投入才有杠杆。
防止两种失控¶
失控 A:永远追新模型¶
Census 每月增量更新且不设数量上限;执行矩阵按 wave 冻结。新论文立即进入合适证据等级, 但只有公开可运行或机制明显改变当前 Coverage Gate 时才调整当月执行顺序。这样既不漏 SOTA, 也不让“又有一篇新论文”无限推迟原创实验。
失控 B:永远加固评测¶
新问题只有在会让本月结论不可比、让 AI 明显作弊或让关键内容被错误判定时才升为 P0;覆盖扩张、报告美化和产品安全进入后续版本。