EvoSpeech · 长期方向判断书¶
本文件回答三个问题:这条路为什么值得走十年;走到哪里算哪一级;什么证据才允许改道。 与
CHARTER.md(冻结合同)、TODO.md(当前主线)和docs/RESTART_PLAN.md(逐模型顺序) 配套。复盘节奏:每季度重读一次本文件。
一、核心判断:什么会复利,什么会商品化¶
从 karpathy/autoresearch 和 AlphaEvolve 两个样本能读出同一条结构性趋势:
会迅速商品化的(不要把身家押在单一实例上): - 某一版模型权重和单点榜单位置(每季度被刷新) - agent 框架 / 推理引擎 / 部署运行时(transcribe.cpp 类工作,优秀但会被复制) - 脱离机制、资源和数据条件的单点 SOTA 数字
会长期复利的(押这里): 1. Environment:一个真实、有余地、可低成本反复实验的问题世界 2. Evaluator:不可作弊的裁判——AlphaEvolve 论文自己承认,它的唯一硬边界就是"必须存在自动评估器";谁把一个难评估的领域变成可评估,谁就把该领域接入了整条自动发现管线 3. Experience Archive:带谱系的成功与失败档案——进化数据库的价值随时间单调增长 4. program.md 层:karpathy 点破的关键——人类的长期产出物不是实验代码,而是"研究组织代码"。它随每次战役迭代,且只属于你 5. Frontier Observatory + Mechanism Cards:持续复现能力 SOTA 与受约束 SOTA, 保存 rate/resource 曲线、失败顺序和可提炼机制。模型会换代,这些压缩经验会复利
EvoSpeech 的长期赌注因此可以精确表述为:
语音是一个含人类感知维度的领域。AlphaEvolve 只在纯机器可评分的问题上证明过自己。 如果我能用"级联评估 + 人耳终审校准"把语音变成进化算法可靠运行的领域, 我就同时拥有了:一个有真实价值的 codec 成果 + 一套能迁移到所有"感知类领域"的自动发现方法论。 codec 是培养皿,方法论是生物。
模型进步对这条路是正 Beta:SOTA 语音模型越强,能力教师越好;coding 模型越强, 每晚候选质量越高;推理越便宜,进化树越大。我们不与浪潮竞争,也不站在岸上等它 商品化;我们持续复现它、压缩它、理解它,把浪潮变成受约束系统的燃料。
SOTA 降维打击是主研究路线,不是外部风险¶
Low-bit 是约束条件,不是方法门派。很多真正的跃迁会先出现在大模型、高码率、离线或 生成任务中:更好的表示、更强 decoder 先验、更稳的语义/声学分解、新量化和因果蒸馏。 长期路线必须同时维护:
- 能力前沿:允许大模型/高码率,用来回答当前最强方法为什么强;
- 受约束前沿:真实 payload、小 decoder、低延迟和忠实合同,用来决定最终胜利。
每个重要教师都经历 native reproduction → rate/resource sweep → failure decomposition →
mechanism card → constrained student。大 decoder 作为预共享先验必须计入 M_dec/C_dec/L,
但不能因为暂时不能部署就拒绝研究。详细纪律见 docs/RESEARCH_MINDSET.md。
多语言为什么是科学探针,不是范围膨胀¶
“最小充分”不是脱离语言的单一数字。普通话声调可能属于词义,日语 pitch accent 可能不出现在正字法文本中,韩语音系和德语复合词又会暴露不同的表示损失。因此长期 对象应理解为条件化 Pareto 边界,而不是把所有语言压成一个总 WER。
执行上仍守住中英第一年主合同;中/德/法/西/日/韩公共小集从第一月起只做泛化 probe。
只有当数据、双评委和语言专用 normalization 成熟后,某语言才升级为合同语言。这样既能
尽早发现“只对英语有效”的假进展,又不会把第一阶段的工程范围扩大六倍。具体协议见
docs/MULTILINGUAL_EVAL.md。
“忠实”不是一个可以互相抵消的总分¶
125 票英文 pilot 证明总体自然度票适合发现 codec 家族级失真,但没有直接验证内容、 身份和表达。长期 evaluator 因而保持一个不可压扁的合同向量:
F =(内容、身份、表达、总体质量、实时/资源、码率)
内容与关键实体是 hard veto;更自然不能补偿数字、否定、说话人或语气的改变。
每个自动代理只能由对应的人类任务校准,具体协议见 docs/LISTENING_PROTOCOL.md。
四维人工任务只用于周期校准与前沿候选终审,内循环仍由自动 evaluator 承担,避免
“为了完备而永远不开跑”。
二、四级天梯(每级都有判定实验,不许模糊)¶
L1 · 研究环出生(目标:第 3–6 个月)¶
命题:系统从 SOTA 教师机制出发,发现一个我事前没有明确指定、能在受约束学生中成立的编码改进。 判定实验:public-test Pareto 改进 + sealed hidden 成立 + 消融证明因果 + 分维度盲听不劣 + 至少 3 次独立 campaign。随机搜索、no-evolution LLM、TPE/贝叶斯优化和限时人工调参 分别报告;“autoresearch 有效”必须写清胜过了哪一层,不能由单次 best-of-N 推出。 意义:证明"计算可以在这个领域兑换成知识"。这是整条路的存在性证明。
L2 · Codec 胜利(目标:第 9–18 个月)¶
命题:payload ≤1.2 kbps,decoder ≤5 MB,廉价 ARM 单核实时,中英未见说话人,盲听全面优于同码率 Codec 2,内容错误不劣于低码率 Opus。 判定实验:冻结协议下同时对比最强相关 SOTA 教师、同资源前沿、Codec 2/Opus 通信锚点 + 第三方可复现包(代码、测试集、参考硬件型号、脚本一键出表)。 意义:第一个外界无法辩驳的成果;也是接触 Codec 2 / Xiph / IETF MLCODEC 社区的入场券。
L3 · 通信相变(目标:第 18–36 个月)¶
命题:在人为限制到 2–3 kbps 实际带宽 + 丢包的网络里,两人用普通设备连续自然对话;旁边的 Opus/WebRTC 方案无法维持。 判定实验:现场随机内容(数字、人名、否定句由第三方临场出题),非预录;全程录像;关键内容零改词。 意义:公众一眼能懂的"以前不可能→现在可以"。这是本项目的李世石时刻,也是弱网对讲产品(WeakLink Voice)的发令枪。
L4 · 基础设施(目标:5–10 年)¶
命题:分层 bitstream 规范(内容/表达/身份/声学残差)+ 微型开放 reference decoder,≥2 个独立实现互操作。 判定实验:不依赖我的训练环境,第三方按规范实现 decoder 并互相解码;旧 bitstream 三年后仍可播放。 意义:从"我的模型"变成"协议"。声音世界 UTF-8 的第一块真实砖。
天梯纪律:不允许跳级宣传。L1 没过不谈 L2 的数字;L2 没过不做 L3 的 demo。
三、时间线与检查点¶
12 个月内(承接当前 TODO 与逐模型 DoD)¶
| 节点 | 检查内容 | 未达标动作 |
|---|---|---|
| M3(90 天) | 双前沿地图 + SOTA stress curve + 原创 seed + 进化闭环 + L1 首次尝试 | 闭环未成 → 判断卡在教师复现、seed、裁判还是搜索,停加新框架 |
| M6(180 天) | L1 达成,或两轮归因修正后的诚实失败报告 | 连续两轮进化不优于对照 → 触发《方向听证会》(见五) |
| M9 | L2 攻坚中:自有候选进入 codec2_1300 与 700C 之间的空档 | 无进展 → 检查是否在错误抽象层进化(AlphaEvolve §2.1) |
| M12 | L2 判定实验,公开技术报告 + 复现包 | 差距明确可归因 → 续 6 个月;不可归因 → 听证会 |
3 年¶
- L2 完成,L3 立项;进化系统扩展到 300–1000 bps 多档、分层 bitstream、联合信道编码
- 档案里累计 ≥10 个"AI 发现、人类验证"的改进;发现速率 R(见四)连续两个季度上升
- 决策点:是否成立小型研究实体(我 + 1 语音 DSP + 1 嵌入式,agent 承担实验主体)
5 年¶
- L3 完成;WeakLink Voice 在至少一个真实场景(户外/远洋/救灾演练)被第三方使用
- 方法论迁移第一次尝试:把同一套"级联评估 + 进化档案"搬到第二个感知类领域(TTS 表示 / 音频修复 / 端侧视觉),验证它不是 codec 专用
10 年¶
- L4:开放规范 + 多实现互操作;或者——同样体面的结局——codec 本身被更大的浪潮覆盖,但"在感知类领域运行自动发现"的方法论、档案与声誉成为主资产
- 十年后的身份目标不是"某 codec 的作者",而是"证明了感知类领域可以自动做研究的人"
四、季度仪表盘(每季度末,一小时,诚实作答)¶
北极星速率: R = 第三方可复现的 Pareto 改进数 ÷(GPU 小时 + λ·人类小时) R 连续两个季度下降 = 系统性问题,触发听证会。
六问(源自更早的自我约束,保留): 1. 本季度是否产生了外部可验证的成果? 2. 活跃核心命题是否仍然只有一个? 3. 学习是否直接解除了实验瓶颈(而非研究娱乐)? 4. 积累的是代码/数据/档案/评估资产,还是只有想法? 5. 固定成本是否仍允许随时转向? 6. 睡眠、身体、伴侣关系是否被吞噬?
三个专属新问(来自 autoresearch/AlphaEvolve 视角): 7. 这个季度 program.md 迭代了几版?(人是否真的在"编程研究组织",还是又退回亲手调参) 8. 评估器发现并修补了几个作弊漏洞?(零 = 没在认真攻击自己) 9. 进化组相对随机、no-evolution 与 TPE 三层对照的优势各自是扩大还是缩小? (只赢随机说明会优化;再赢 no-evolution 才支持档案/上下文价值;是否赢 TPE 判断 程序级搜索是否超过常规参数优化。)
三个 SOTA→学生问题: 10. 本季度完整研究了哪个 Frontier Teacher,而不是只收藏了哪些论文? 11. 哪条 rate/resource 曲线改变了我们对“最小充分表示”的理解? 12. 哪个教师机制被提炼进受约束学生,提炼后保留/丢失了什么?
加固封口规则:每个 arena 大版本冻结前先列有限 P0。新评审项只有在会导致作弊、 错误裁决或不可比结果时才能并入 P0;便利性、新指标和覆盖扩张进入小版本/Q2。 封口不是忽略缺陷,而是防止“无限加固”吞掉真实实验。
五、改道规则(防止"第 11 次方向升级")¶
历史教训:过去一年方向翻转 ≥4 次,每次都被单个漂亮论证说服。因此:
《方向听证会》程序(唯一合法的改道通道): 1. 触发条件(满足其一):M6/M12 门槛失败且归因指向方向而非执行;R 连降两季;外部世界发生结构性变化(见六) 2. 写两页备忘录:现方向的沉没资产清单 + 新方向的 EV 估算 + "少了我,新方向会不会照样发生"(反事实检验) 3. 冷却 14 天,期间不动手 4. 找一位技术同行做魔鬼代言人过一遍 5. 改道 = 修宪,CHARTER 与本文件同步改,旧方向资产归档不删除
明确不算改道理由的:新论文很惊艳、某大厂发了新模型、benchmark 又刷新了、"我想到一个更根本的问题"。这些一律进《想法停车场》(ideas.md),季度复盘时统一看。
六、外部剧变预案(scenario planning)¶
| 剧变 | 概率感 | 预案 |
|---|---|---|
| 大厂开源 <500bps 高质量 codec | 中 | 立即进入 Observatory,先复现 native/stress curve 和机制卡。若满足全合同,L2 改写为“更小 decoder / 更低算力 / 抗幻觉分层”;若不满足,则作为教师蒸馏 |
| 模型能力跳变(coding agent 强一个数量级) | 高 | 利好。第一时间重跑同一战役对比发现速率,把差值写成公开报告(这本身就是 autoresearch 领域的贡献) |
| GPU/推理价格暴跌 | 高 | 扩大进化树与神经赛道预算;提前准备好"预算翻十倍怎么花"的作战计划,别临时挥霍 |
| IETF MLCODEC 标准窗口收紧 | 低中 | L2 一完成就投工作组邮件列表,用可复现包说话;标准化是马拉松,早挂号 |
| 语音赛道整体过热/资本涌入 | 中 | 不融资跟风;守住"开放 + 可复现 + 微型端侧"的差异位,这个生态位大公司结构性不想要 |
七、资源升级的触发线(避免过早扩张,也避免小气误事)¶
- 租 GPU:环境与恢复能力提前建设,但昂贵长跑仍须 L1 达成且 20 分钟预算被证明是瓶颈;
在此之前只允许有硬成本上限的
C1–C3GPU probe/one-batch/短跑,用来解除 CUDA-only 模型和 验证迁移链,不把“已经能租 GPU”误当成“应该扩大训练”。买 GPU 另做总拥有成本裁决。 - 第一位合作者(语音 DSP 或嵌入式):当且仅当 L2 攻坚中出现连续 4 周的领域知识瓶颈,且 agent + 文献无法解除
- 开源时点:竞技场(arena + 基线 + 测试协议)在 M6 后开源——评估器开放才有公信力;进化系统本体可晚半年
- 接触实验室/社区:带着 L1 的验证包接触,不带 PPT 接触
- 融资:默认不。除非 L3 需要真实无线电/卫星信道实验且成本超出现金流,再考虑 grant 类资金(不稀释控制权优先)
八、一句话版本(贴在显示器上)¶
向 SOTA 学本质,用 low-bit 做压力测试,用通信合同约束现实; 机制卡比模型名长寿,档案比单次胜利重要,诚实实验比漂亮 demo 重要。