EvoSpeech · SOTA Census、条件化前沿与本地执行队列¶
更新时间:2026-07-19
SOTA 不是 8 个名字,也不是一张总排行榜。项目不再设置候选数量上限;low-bit 只是一种压力条件,不是入场门槛。
本文件是人类可读解释。完整机器事实以
configs/sota_census_v1.json 和
configs/sota_execution_matrix_v1.json 为准。
一、本轮纠偏结论¶
原来的 8 家族短名单适合作为首轮工程启动清单,不足以支持“我们已经比较 SOTA”。特别是:
- 把 SNAC 当作 Stable Codec 的替补、把 X-Codec 2.0 当作 Mimi 的替补是不合理的。它们的 token 层级、语义/声学组织和研究用途不同,应该分别研究;
- MOSS-Audio-Tokenizer、QuarkAudio HCodec、BigCodec、WavTokenizer、AudioDec、 SoundStream/ESPnet-Codec、FunCodec/HiFiCodec、TiCodec/TaDiCodec 等公开代表不能只留在旁注;
- LRAC 这类资源受限挑战、EVS/LC3plus 这类通信标准和没有可运行代码的新论文必须进入 同一 Census,但证据层级不能混在一起;
- 已完成的 Opus / Codec 2 / EnCodec 8 句结果统一降级为 Wave 0 管线验收:它证明本地 能保存真实文件、独立解码和计账,不证明谁是能力 SOTA、低码率 SOTA 或部署 SOTA。
因此现在采用两层结构:
- SOTA Census:不设数量上限,记录所有与研究问题实质相关的重要模型、标准、挑战系统和 机制论文;每月增量更新,旧条目不因新论文出现而删除;
- Execution Matrix:对所有公开可运行代表给出明确 wave、当前状态和下一个 gate。排序只 决定执行先后,不决定谁更重要,更不允许用“替补”删除另一个机制。
二、SOTA 是条件化前沿,不是宇宙总榜¶
项目同时维护至少六条前沿:
| 前沿 | 核心问题 | 不能忽略的条件 |
|---|---|---|
| 能力/重建前沿 | 原生配置能把语音重建到多好 | 数据、采样率、decoder 规模、是否离线 |
| 同码率前沿 | 同样真实传输字节下谁更忠实 | packed bytes、side information、熵编码 |
| 低码率内容前沿 | 极少 bit 下文字和关键实体何时坏 | 原音 ASR 基线、语言、实体/否定/数字 |
| 流式通信前沿 | 实时因果条件下谁更好 | look-ahead、算法延迟、packet/on-wire 开销 |
| 部署前沿 | 小设备能否实时运行 | decoder artifact、RTF、RAM、目标硬件 |
| 表示/生成前沿 | token 是否利于语言建模和生成 | 这不自动等于原话、身份和表达忠实 |
高码率、大 decoder、离线 SOTA 仍可能是最重要的教师。我们会先理解它为什么强,再问在 低码率、小 decoder、低延迟下哪些能力仍然成立。反过来,一个 400 bps 论文结果也不能因为 数字小就自动胜过成熟通信 codec;它可能使用大规模预共享先验、不同数据或非因果条件。
三、证据等级必须分开¶
| 等级 | 能说什么 | 不能说什么 |
|---|---|---|
local_smoke |
固定本地实现已跑通可保存表示和独立解码 | 还不能叫统一基准或本地 SOTA |
open_runnable |
官方代码和权重/产物公开,可进入本地尝试 | 未跑前不能引用作者数字作本地排名 |
open_framework |
可通过维护中的公共框架复现 | 必须标清不是作者原始实现 |
open_code_partial |
代码或权重存在,但闭环完整性未核实 | 不能假定能公平 encode→bytes→decode |
challenge_report |
挑战官方结果成立 | 没有公开产物时不能伪造本地复现 |
paper_only |
机制和论文声明值得研究 | 不能进入本地数值 Pareto |
standard_or_licensed |
是现实部署的重要参照 | 未解决实现/许可前不强行本地运行 |
四、Census v1 覆盖¶
Census v1 共 40 项,不是“全世界所有论文”的虚假宣称,而是当前可审计的综合快照;审计 脚本要求关键类别和重要代表必须存在。它覆盖以下几组:
A. 现实通信、参数和部署锚点¶
- Opus、Codec 2、LPCNet/FARGAN、Lyra;
- EVS、LC3plus 作为标准/许可观察线;
- LRAC 2025 Track 1 的 teamwzqaq、nano_codec、aitd_go 作为资源受限挑战前沿,公开复现 未核实前只保留官方结果等级。
B. 波形重建与高能力教师¶
- EnCodec、DAC、AudioDec、FlowDec;
- SoundStream(通过 ESPnet-Codec 参考实现)、FunCodec/FreqCodec、HiFiCodec;
- Stable Codec、BigCodec、FocalCodec-Stream。
C. 现代 token、语义/声学和多语言教师¶
- SNAC、Mimi、WavTokenizer、X-Codec 2.0;
- SpeechTokenizer、SemantiCodec、FACodec、TiCodec、TaDiCodec;
- MOSS-Audio-Tokenizer、QuarkAudio HCodec、Step-Audio Tokenizer;
- ReasoningCodec/UniAudio 2 当前只有部分可核验发布路径,暂不冒充完整 runnable。
D. 2026 机制雷达¶
- EntangleCodec:语义/声学纠缠表示与 flow decoder;声明的代码地址在本次快照无法解析,故
暂列
paper_only; - VoCodec:voicing-driven quantization;
- P2PSynCodec:只发送较不可预测的 VQ,由 decoder 预测额外 latent;
- ContextCodec:content context 与 acoustic stream 分层;
- CFMDCTCodec、AugCodec、Dual-TIRE streaming TiCodec。
这些论文不会因为没代码而被忽视,但也不会用作者表格制造“本地已经领先/落后”的假象。
五、27 项本地执行矩阵¶
旧的“8 个冻结、失败才替补”规则已撤销。新矩阵对 27 个可运行或可做组件审计的公开对象 逐一给出决定。
Wave 0 · 已完成,但只算基础设施资格¶
| 系统 | 当前证据 | 下一 gate |
|---|---|---|
| Opus | 8/8 native smoke,Ogg 文件独立解码 | raw packet / container / on-wire 分账 |
| Codec 2 | 8/8 raw bitstream smoke | 1.2/1.6 kbps 合法模式 |
| EnCodec | 8/8 10-bit packed 表示独立解码 | 1.5/3/6/12 kbps RVQ curve |
结果在 experiments/sota_smoke_anchors_native_v1.json。禁止把这三个点画成“SOTA 榜”。
Wave 1 · 先校准互补教师¶
DAC、FocalCodec-Stream、Stable Codec、Mimi、LPCNet、SNAC 都是 must_attempt。目标不是
先选赢家,而是尽快覆盖:高保真 RVQ、流式低帧率、scaling/FSQ、现代流式语义/声学 token、
小型参数神经合成、多尺度 token。Stable 和 SNAC、Mimi 和 X-Codec 2.0 均不再互为替补。
2026-07-19 source audit 后,DAC、Focal、Mimi、LPCNet、SNAC 已具备固定权重/模型包和本机
尝试条件;Stable 官方当前硬依赖 CUDA FlashAttention 且不支持 CPU,因此在 Apple M5 上标为
platform_deferred,不下载 3.81 GB 权重、不从 Census 删除。
| 系统 | 当前证据 | 下一 gate |
|---|---|---|
| SNAC 24 kHz | 8/8 三尺度 12-bit packed payload;fresh decoder;实际表示均值 992.0 bps | 统一内容/质量指标与机制卡;无合法 rate sweep |
| DAC 16 kHz | 8/8 官方 .dac;fresh decoder;完整 12-codebook 表示均值 6003.8 bps |
n_quantizers 合法曲线、统一指标与机制卡 |
| FocalCodec-Stream 4k causal | 8/8 12-bit token payload;fresh decoder;表示均值 600.38 bps | stateful streaming 等价性、官方 2k/4k/65k 曲线、统一指标 |
| Mimi 24 kHz q8 | 8/8 11-bit token payload;fresh decoder;表示均值 1107.52 bps | stateful streaming 等价性、num_quantizers 曲线、统一指标 |
| LPCNet 1.6k | 8/8 官方 raw packet;fresh decoder;均值 1604.88 bps;CPU decode RTF 0.202 | 统一指标与部署机制卡;无已核实的第二码率点 |
| Stable Codec | 官方 CUDA/FlashAttention 约束,本机平台 deferred | CUDA 主机恢复 |
五个通过结果见各自 experiments/sota_smoke_*_native_v1.json。它们使 Wave 1 G2 passed
达到 5/6,另 1 个为有证据的 platform deferred;但目前没有统一质量指标,因此不能据此做 SOTA
质量排序。FocalCodec 与 Mimi 本轮都只验证 causal checkpoint 的整句路径,未验证 chunk-state
streaming;Mimi checkpoint 走其官方 Transformers 转换路径,不与旧 Moshi loader 静默混用。
LPCNet 实际运行 packet-state path,但尚未测量端到端 latency;其 6.66 MiB decoder weights 也
明确说明“小型部署教师”不等于满足本项目 ≤5 MiB 合同。
Wave 2 · 当前前沿宽度¶
MOSS-Audio-Tokenizer、QuarkAudio HCodec、BigCodec、WavTokenizer、X-Codec 2.0、TaDiCodec。
大模型如果因 32 GB 内存或 Apple Silicon 不可运行,状态记为 hardware_deferred,保留下载/加载
探针和失败日志;不能从研究地图删除。
六项均已完成 source audit:MOSS 的 v1/v2/Nano、Quark HCodec 1.0/1.5、BigCodec、
WavTokenizer 40/75-token、Transformers-native X-Codec 2.0、TaDiCodec 权重都已固定。
Quark HCodec 2.0 当前没有权重文件;TaDiCodec 官方重建需要文本与 prompt 语音,未定义额外
信息合同前只作机制教师。完整数字和入口见
SOTA_SOURCE_AUDIT_V1.md。
| 系统 | 当前证据 | 下一 gate |
|---|---|---|
| MOSS Nano 48 kHz q16 | 8/8 真实 10-bit RVQ payload;fresh decoder;表示均值 2013.67 bps | 合法 RVQ curve 与统一指标 |
| MOSS full v1 24 kHz q32 | 8/8 guarded G4;表示句均值 4027.34 bps;峰值 RSS 3.90 GB | 统一内容/质量指标与合法 RVQ curve |
| MOSS full v2 48 kHz q32 | 8/8 guarded G4;表示句均值 4027.34 bps;峰值 RSS 4.12 GB | 统一内容/质量指标、合法 RLFQ curve 与 streaming gate |
| Quark HCodec 1.0 16 kHz q4+q4 | 8/8 双流 guarded G4;表示句均值 2006.10 bps;峰值 RSS 1.77 GB | 统一内容/质量指标 |
| Quark HCodec 1.5 16 kHz adaptive q4+q4 | 8/8 guarded G4;808/1264 groups;聚合 1330.24 bps;峰值 RSS 5.91 GB | 统一指标与合法 threshold curve |
| BigCodec 16 kHz single q8192 | 8/8 guarded G4;4,039 个真实 13-bit indices;聚合 1041.49 bps;峰值 RSS 2.12 GB | 统一指标与机制卡;不伪造 rate curve |
| WavTokenizer small 24 kHz q4096 | 8/8 guarded G4;2,019 个真实 12-bit codes;聚合 480.57 bps;峰值 RSS 1.58 GB;odd-length 重放一致 | small 统一指标/削波检查 |
| WavTokenizer large unified 24 kHz q4096 | 8/8 guarded G4;2,019 个真实 12-bit codes;聚合 480.57 bps;峰值 RSS 1.55 GB;odd-length 重放一致 | 与 small 做同 rate 共同指标;不是受控训练消融 |
| X-Codec 2.0 / TaDiCodec | source audit 完成,尚未本地 native | 按 execution matrix 逐项执行 |
MOSS Nano 是 Wave 2 第一个 G2/G4 通过点。它验证的是同一家族的小型部署变体、remote-code 身份和 48 kHz stereo→arena mono 合同。完整 v1 另行下载 7.10 GB 权重并通过 8 句 G4,证明 我们没有用 Nano 替代 SOTA;full v2 也已独立完成 8 句 G4。但 G4 仍只是本地复现资格, 不是质量排名;三者必须在后续统一指标中保留为不同 scaling/deployment 点。
Wave 3 · 公共框架、部署和表示覆盖¶
SoundStream/ESPnet、AudioDec、FlowDec、FunCodec、HiFiCodec、Lyra、SpeechTokenizer、 SemantiCodec、FACodec、TiCodec、Step-Audio Tokenizer,以及作为 decoder 构件研究的 FARGAN。 Wave 3 不是“不重要”,只是对当前“先校准能力/低码率/流式边界”的信息增益稍后。
每个新系统第一次安装/修复预算仍为 120 分钟。超时意味着本轮 deferred 并留下可复现日志,
不是删除候选;每一 wave 内也可按下载、硬件和依赖并行性调整顺序。
六、每个系统必须过的 gate¶
G0 source audit
官方来源、revision、checkpoint、许可、语言/数据声明
↓
G1 native reconstruction
作者推荐配置能重建本地音频;失败则停止解释其 low-bit 能力
↓
G2 saved representation
encoder 保存真实表示,fresh decoder 只凭表示和固定共享权重重建
↓
G3 accounting
author nominal / theoretical representation / packed bytes 分列
↓
G4 unified smoke
同一 3 英 + 3 中 + 2 critical,保存 RTF/RSS/model bytes/failures
↓
G5 legal stress curve
只用官方支持的 RVQ、码本、帧率、latent、因果或资源旋钮
↓
G6 common benchmark
英中主集 + 多语言 probe + 统一指标,才进入条件化本地 Pareto
G1 或 G2 失败仍是有效研究结果;必须保存错误、环境和复现命令。G3 做不到的模型可进质量/ 机制诊断,不进入“公平 payload Pareto”。
七、统一本地报告合同¶
每个系统至少记录:
identity: name / family / source revision / checkpoint revision / license
conditions: sample rate / causal / streaming / look-ahead / algorithmic latency
rate: author nominal / representation / measured packed / container / on-wire
resources: encoder / decoder bytes / encode RTF / decode RTF / peak RSS / hardware
fidelity: original ER / reconstructed ER / ΔWER or ΔCER / critical entities
quality: STOI / PESQ where valid / mel / F0 / voicing / speaker similarity
scope: languages / datasets / unsupported cases / crashes / OOM
research: mechanism / failure order / extractable student hypothesis
约束:
- 原音和重建音使用同一预处理;
- 模型权重不计逐句 payload,但必须进入 decoder 资源账;
- prompt、speaker reference、文本和其他 side information 必须计入合同;
- 作者跨数据集 MOS/WER 与本地实测分列;
- 生成/语言模型 token 的“有用”不自动等于通信忠实;
- capability、low-rate、streaming、deployment 图分别画,不用单一总分抹平约束。
八、何时才允许开始原创 seed¶
不要求 40 项全部跑完——这会让项目永远不开工;也不允许只跑 3 个旧锚点就宣布了解前沿。 启动 seed 决策需满足有限的 Coverage Gate:
- Wave 1 六项都收到明确结论:通过、可复现失败或硬件/许可 deferred;
- Wave 2 至少完成 4/6 的 G1–G4,其余两项有完整阻塞证据;
- 至少 6 个神经家族完成统一 smoke,其中至少 3 个完成合法 stress 点;
- 同时覆盖高能力、低码率、流式、部署、多尺度/语义五种机制;
- 至少 3 张机制卡形成可证伪的“教师机制 → 小学生”假设;
- 本地报告能明确回答哪些系统属于不同约束平面,不能给一个伪总冠军。
达到这个 Gate 后,Census 继续月更,但不会用“还有新论文”无限推迟原创实验。
九、维护规则¶
- 每月扫描新增论文、官方 release、checkpoint 和挑战结果,提交 census diff;
- 新条目只要与语音最小充分表示、重建、流式或部署有实质关系即可进入,不要求 low-bit 标签;
- 公开可运行的重要代表必须获得执行决策,不能只写在 prose;
- paper-only 在代码开放后升级证据等级并进入执行矩阵;
- 模型被新工作超过后保留其机制卡、失败曲线和环境,历史知识不删除;
- 每季度至少完整 stress 一个不以 low-bit 为卖点的能力教师;
- 每个原创 seed 必须引用至少一个前沿机制和一个通信/部署锚点。
运行审计:
审计会检查:关键前沿和类别覆盖、来源与 revision 格式、证据等级、执行矩阵引用、Wave 0
不得冒充排名,以及所有 local_smoke/open_runnable/open_framework 项必须有执行决定。