跳转至

EvoSpeech · Research Mindset

冻结日期:2026-07-19

本文件定义项目的思考方式。任何新的 AI、合作者或研究会话,在修改 TODO、选择模型或设计实验之前,必须先读本文件与 CHARTER.md

一、一句话身份

我们不属于“传统 low-bit codec”这个方法门派。我们研究最强语音智能在极端信息、算力和延迟约束下还能保留什么,并把其中真正有效的机制压缩成可验证、可部署的通信系统。

因此:

  • Low-bit 是约束,不是模型筛选标签;
  • SOTA 是教师、能力上界和机制来源,不只是被比较的对手;
  • 小模型、传统 codec 和通信标准是部署教师,不是落后代名词;
  • 原创性来自理解、提炼、组合和验证机制,而不是为了原创而从零造一个弱模型。

二、为什么必须持续研究 SOTA

强模型可能通过更好的表示、生成先验、训练目标、因果蒸馏或量化方式,整体移动 rate–distortion 曲线。项目本地结果已经出现这种现象:EnCodec 1.5 kbps 在多个维度明显超过相近码率的 Codec 2。

如果只研究历史上专门为 low-bit 设计的系统,我们容易被锁在旧表示和旧 decoder 的局部最优中。相反,先理解当前最强模型“为什么强”,再把它压入 low-bit,可能形成真正的降维打击。

但不追逐排行榜本身。我们追踪的是可迁移机制:

  • 表示把内容、身份、表达和微观声学如何分开;
  • 哪些 latent 在降码率时最晚崩溃;
  • decoder 先验补回了什么;
  • 哪些 token 可以预测、降帧率、熵编码或不发送;
  • 因果化、蒸馏和量化损失了什么;
  • 更大模型带来的收益能否迁移到小 decoder。

三、同时维护两张前沿

1. 能力前沿(Capability Frontier)

允许大模型、离线、非因果和较高码率。它回答:

在当前最强方法下,语音表示和重建究竟可以好到什么程度?

这张前沿中的模型是 Frontier Teacher。它们不需要满足最终产品合同,但必须进入知识库和机制研究。

2. 受约束前沿(Deployable Frontier)

同时考虑真实 payload、decoder 体积、算力、延迟、因果性以及内容/身份/表达忠实度。它回答:

在我们的真实端侧通信合同下,当前最好能做到什么?

最终成果必须推进这张前沿。能力前沿的数字不能冒充产品胜利,受约束前沿也不能拒绝从能力前沿学习。

四、每个“低码率”结果必须付清五本账

大型 decoder 相当于双方预先共享的大量先验知识。它不是作弊,但不能免费。任何结果同时报告:

  1. 传输账 B_tx:实际可解码 payload bytes 和 on-wire bytes;
  2. 共享先验账 M_dec:decoder 权重、固定字典、speaker prompt 或其他接收端资源;
  3. 计算账 C_dec:RTF、峰值内存、硬件和能耗代理;
  4. 时间账 L:因果性、帧长、look-ahead、算法延迟和首包延迟;
  5. 忠实度账 F:内容、身份、表达、总体质量与稳健性。

项目优化的不是孤立的 min(B_tx),而是条件化 Pareto 面:

P = Pareto(B_tx, M_dec, C_dec, L, F | 语言、说话方式、信道)

第一年挑战仍是在 M_dec ≤ 5 MB、ARM 单核实时、中英忠实的条件下把 B_tx 推向 1.2 kbps;SOTA 大模型负责告诉我们这个目标该用什么机制逼近。

五、SOTA → Low-Bit 的标准研究漏斗

每个重要 SOTA 家族按同一顺序研究:

Stage A · Native Reproduction

先在作者推荐配置下复现。原生能力没有复现,就不能解释其 low-bit 退化。

Stage B · Rate/Resource Sweep

在架构允许的旋钮上逐步施加约束:减少 RVQ 层、码本/latent 维度、降低帧率、token 丢弃/预测、量化、蒸馏、因果化或 decoder 缩小。保存完整曲线,不只挑一个好点。

Stage C · Failure Decomposition

分别观察内容、关键实体、身份、表达、听感、延迟和资源在哪个位置先崩溃。总体 MOS 不能掩盖改词或身份坍缩。

Stage D · Mechanism Card

每个模型必须沉淀一张机制卡:

模型为什么强?
真正的新机制是什么?
收益依赖多大 decoder / 多长上下文 / 什么训练数据?
哪个 bitrate knob 最有效?
第一个失败维度是什么?
哪一部分能提炼到 ≤5 MB 因果 decoder?
下一条可证伪实验是什么?

Stage E · Constrained Student

原创 Baseline 优先实现机制的最小版本,而不是复制整个教师。教师可以是离线/大模型,学生必须逐步满足真实 bitstream 和端侧合同。

Stage F · Search and Evolution

只有学生已经完整可跑、搜索空间有信号、常规优化能移动指标之后,才让 AI 自动进化。AI 的任务是发现更好的机制实现,不是替代问题定义。

六、四类模型都必须保留

角色 例子 教给我们的东西
能力教师 高质量神经 codec、强 tokenizer、基础语音表示 什么表示和 decoder 先验能达到最高能力
低码率教师 Stable Codec、FocalCodec-Stream、SNAC 等 强方法怎样在稀缺 token 下分配信息
部署教师 LPCNet、FARGAN、微型/因果模型 怎样把神经机制变成小、快、流式实现
通信锚点 Opus、Codec 2、标准 codec 真实 bitstream、延迟、鲁棒性和工程纪律

任何一类都不能代表全部 SOTA。短期执行名单可以有限,但长期观察列表不能因为默认码率高或模型大而排除一个重要机制。

七、十条研究原则

  1. Low-bit 是压力测试,不是方法身份。
  2. 先复现教师原生能力,再解释低码率退化。
  3. 永远同时维护能力前沿和受约束前沿。
  4. 大型 decoder 的共享先验必须单独付账。
  5. 与最强相关基线比较,不只打最弱的 Codec 2。
  6. 提炼机制优先于复制模型,实验优先于搭框架。
  7. 内容、身份、表达、质量不可压成能互相赎买的一个总分。
  8. 论文声明、理论 token rate、本地实际 bytes 和端侧数据必须分开。
  9. 原创 seed 先接受手工/随机/TPE 检验,再接 AI 进化。
  10. 失败、反例和退化曲线是知识资产,不能只归档赢家。

八、避免四个常见误区

误区 1:默认码率高,所以不值得看

错误。高码率 SOTA 可能拥有最好的表示或 decoder;问题是能否通过 rate sweep 和蒸馏提取机制。

误区 2:token 少,所以已经是通信 codec

错误。还要检查真实打包、side information、因果性、decoder 大小、延迟和忠实度。

误区 3:大模型不能部署,所以研究价值低

错误。大模型可以作为 oracle、教师、上界和消融平台;但它的结果不能冒充受约束胜利。

误区 4:SOTA 会快速变化,所以不值得积累

模型权重和榜单会变化;机制卡、统一 stress test、失败档案、评估协议和蒸馏经验会复利。

九、执行上的固定节奏

  • 每周:按冻结的 execution wave 工作;新论文进入 Census,但不自动打断当前 wave;
  • 每月:增量扫描能力、受约束、挑战和标准前沿,更新 Census 与 SOTA_MAP.md
  • 每季度:选择 1–2 个真正改变机制理解的新教师做完整 rate/resource sweep;
  • 每个原创 seed:必须写清它继承了哪个教师机制,以及为了端侧合同牺牲了什么;
  • 每次 AI 战役:都保留教师、通信锚点、默认 seed、随机和 TPE 对照。

运行环境也服从同一研究纪律:本地 Apple Silicon 用于快速证伪、MPS 小训练、听测和端侧检查; Linux CPU container 用于可移植评测;Linux/NVIDIA container 用于正式训练。三者共享 experiment capsule,不共享未经验证的“环境应该差不多”假设。完整规范见 ENVIRONMENT_AND_TRAINING.md

十、贴在显示器上的版本

向 SOTA 学本质,用 low-bit 做压力测试,用通信合同约束现实,用 AI 扩大搜索,用实验决定方向。