跳转至

EvoSpeech · SOTA Census、条件化前沿与本地执行队列

更新时间:2026-07-19

SOTA 不是 8 个名字,也不是一张总排行榜。项目不再设置候选数量上限;low-bit 只是一种压力条件,不是入场门槛。

本文件是人类可读解释。完整机器事实以 configs/sota_census_v1.jsonconfigs/sota_execution_matrix_v1.json 为准。

一、本轮纠偏结论

原来的 8 家族短名单适合作为首轮工程启动清单,不足以支持“我们已经比较 SOTA”。特别是:

  1. 把 SNAC 当作 Stable Codec 的替补、把 X-Codec 2.0 当作 Mimi 的替补是不合理的。它们的 token 层级、语义/声学组织和研究用途不同,应该分别研究;
  2. MOSS-Audio-Tokenizer、QuarkAudio HCodec、BigCodec、WavTokenizer、AudioDec、 SoundStream/ESPnet-Codec、FunCodec/HiFiCodec、TiCodec/TaDiCodec 等公开代表不能只留在旁注;
  3. LRAC 这类资源受限挑战、EVS/LC3plus 这类通信标准和没有可运行代码的新论文必须进入 同一 Census,但证据层级不能混在一起;
  4. 已完成的 Opus / Codec 2 / EnCodec 8 句结果统一降级为 Wave 0 管线验收:它证明本地 能保存真实文件、独立解码和计账,不证明谁是能力 SOTA、低码率 SOTA 或部署 SOTA。

因此现在采用两层结构:

  • SOTA Census:不设数量上限,记录所有与研究问题实质相关的重要模型、标准、挑战系统和 机制论文;每月增量更新,旧条目不因新论文出现而删除;
  • Execution Matrix:对所有公开可运行代表给出明确 wave、当前状态和下一个 gate。排序只 决定执行先后,不决定谁更重要,更不允许用“替补”删除另一个机制。

二、SOTA 是条件化前沿,不是宇宙总榜

项目同时维护至少六条前沿:

前沿 核心问题 不能忽略的条件
能力/重建前沿 原生配置能把语音重建到多好 数据、采样率、decoder 规模、是否离线
同码率前沿 同样真实传输字节下谁更忠实 packed bytes、side information、熵编码
低码率内容前沿 极少 bit 下文字和关键实体何时坏 原音 ASR 基线、语言、实体/否定/数字
流式通信前沿 实时因果条件下谁更好 look-ahead、算法延迟、packet/on-wire 开销
部署前沿 小设备能否实时运行 decoder artifact、RTF、RAM、目标硬件
表示/生成前沿 token 是否利于语言建模和生成 这不自动等于原话、身份和表达忠实

高码率、大 decoder、离线 SOTA 仍可能是最重要的教师。我们会先理解它为什么强,再问在 低码率、小 decoder、低延迟下哪些能力仍然成立。反过来,一个 400 bps 论文结果也不能因为 数字小就自动胜过成熟通信 codec;它可能使用大规模预共享先验、不同数据或非因果条件。

三、证据等级必须分开

等级 能说什么 不能说什么
local_smoke 固定本地实现已跑通可保存表示和独立解码 还不能叫统一基准或本地 SOTA
open_runnable 官方代码和权重/产物公开,可进入本地尝试 未跑前不能引用作者数字作本地排名
open_framework 可通过维护中的公共框架复现 必须标清不是作者原始实现
open_code_partial 代码或权重存在,但闭环完整性未核实 不能假定能公平 encode→bytes→decode
challenge_report 挑战官方结果成立 没有公开产物时不能伪造本地复现
paper_only 机制和论文声明值得研究 不能进入本地数值 Pareto
standard_or_licensed 是现实部署的重要参照 未解决实现/许可前不强行本地运行

四、Census v1 覆盖

Census v1 共 40 项,不是“全世界所有论文”的虚假宣称,而是当前可审计的综合快照;审计 脚本要求关键类别和重要代表必须存在。它覆盖以下几组:

A. 现实通信、参数和部署锚点

  • Opus、Codec 2、LPCNet/FARGAN、Lyra;
  • EVS、LC3plus 作为标准/许可观察线;
  • LRAC 2025 Track 1 的 teamwzqaq、nano_codec、aitd_go 作为资源受限挑战前沿,公开复现 未核实前只保留官方结果等级。

B. 波形重建与高能力教师

  • EnCodec、DAC、AudioDec、FlowDec;
  • SoundStream(通过 ESPnet-Codec 参考实现)、FunCodec/FreqCodec、HiFiCodec;
  • Stable Codec、BigCodec、FocalCodec-Stream。

C. 现代 token、语义/声学和多语言教师

  • SNAC、Mimi、WavTokenizer、X-Codec 2.0;
  • SpeechTokenizer、SemantiCodec、FACodec、TiCodec、TaDiCodec;
  • MOSS-Audio-Tokenizer、QuarkAudio HCodec、Step-Audio Tokenizer;
  • ReasoningCodec/UniAudio 2 当前只有部分可核验发布路径,暂不冒充完整 runnable。

D. 2026 机制雷达

  • EntangleCodec:语义/声学纠缠表示与 flow decoder;声明的代码地址在本次快照无法解析,故 暂列 paper_only
  • VoCodec:voicing-driven quantization;
  • P2PSynCodec:只发送较不可预测的 VQ,由 decoder 预测额外 latent;
  • ContextCodec:content context 与 acoustic stream 分层;
  • CFMDCTCodec、AugCodec、Dual-TIRE streaming TiCodec。

这些论文不会因为没代码而被忽视,但也不会用作者表格制造“本地已经领先/落后”的假象。

五、27 项本地执行矩阵

旧的“8 个冻结、失败才替补”规则已撤销。新矩阵对 27 个可运行或可做组件审计的公开对象 逐一给出决定。

Wave 0 · 已完成,但只算基础设施资格

系统 当前证据 下一 gate
Opus 8/8 native smoke,Ogg 文件独立解码 raw packet / container / on-wire 分账
Codec 2 8/8 raw bitstream smoke 1.2/1.6 kbps 合法模式
EnCodec 8/8 10-bit packed 表示独立解码 1.5/3/6/12 kbps RVQ curve

结果在 experiments/sota_smoke_anchors_native_v1.json。禁止把这三个点画成“SOTA 榜”。

Wave 1 · 先校准互补教师

DAC、FocalCodec-Stream、Stable Codec、Mimi、LPCNet、SNAC 都是 must_attempt。目标不是 先选赢家,而是尽快覆盖:高保真 RVQ、流式低帧率、scaling/FSQ、现代流式语义/声学 token、 小型参数神经合成、多尺度 token。Stable 和 SNAC、Mimi 和 X-Codec 2.0 均不再互为替补。

2026-07-19 source audit 后,DAC、Focal、Mimi、LPCNet、SNAC 已具备固定权重/模型包和本机 尝试条件;Stable 官方当前硬依赖 CUDA FlashAttention 且不支持 CPU,因此在 Apple M5 上标为 platform_deferred,不下载 3.81 GB 权重、不从 Census 删除。

系统 当前证据 下一 gate
SNAC 24 kHz 8/8 三尺度 12-bit packed payload;fresh decoder;实际表示均值 992.0 bps 统一内容/质量指标与机制卡;无合法 rate sweep
DAC 16 kHz 8/8 官方 .dac;fresh decoder;完整 12-codebook 表示均值 6003.8 bps n_quantizers 合法曲线、统一指标与机制卡
FocalCodec-Stream 4k causal 8/8 12-bit token payload;fresh decoder;表示均值 600.38 bps stateful streaming 等价性、官方 2k/4k/65k 曲线、统一指标
Mimi 24 kHz q8 8/8 11-bit token payload;fresh decoder;表示均值 1107.52 bps stateful streaming 等价性、num_quantizers 曲线、统一指标
LPCNet 1.6k 8/8 官方 raw packet;fresh decoder;均值 1604.88 bps;CPU decode RTF 0.202 统一指标与部署机制卡;无已核实的第二码率点
Stable Codec 官方 CUDA/FlashAttention 约束,本机平台 deferred CUDA 主机恢复

五个通过结果见各自 experiments/sota_smoke_*_native_v1.json。它们使 Wave 1 G2 passed 达到 5/6,另 1 个为有证据的 platform deferred;但目前没有统一质量指标,因此不能据此做 SOTA 质量排序。FocalCodec 与 Mimi 本轮都只验证 causal checkpoint 的整句路径,未验证 chunk-state streaming;Mimi checkpoint 走其官方 Transformers 转换路径,不与旧 Moshi loader 静默混用。 LPCNet 实际运行 packet-state path,但尚未测量端到端 latency;其 6.66 MiB decoder weights 也 明确说明“小型部署教师”不等于满足本项目 ≤5 MiB 合同。

Wave 2 · 当前前沿宽度

MOSS-Audio-Tokenizer、QuarkAudio HCodec、BigCodec、WavTokenizer、X-Codec 2.0、TaDiCodec。 大模型如果因 32 GB 内存或 Apple Silicon 不可运行,状态记为 hardware_deferred,保留下载/加载 探针和失败日志;不能从研究地图删除。

六项均已完成 source audit:MOSS 的 v1/v2/Nano、Quark HCodec 1.0/1.5、BigCodec、 WavTokenizer 40/75-token、Transformers-native X-Codec 2.0、TaDiCodec 权重都已固定。 Quark HCodec 2.0 当前没有权重文件;TaDiCodec 官方重建需要文本与 prompt 语音,未定义额外 信息合同前只作机制教师。完整数字和入口见 SOTA_SOURCE_AUDIT_V1.md

系统 当前证据 下一 gate
MOSS Nano 48 kHz q16 8/8 真实 10-bit RVQ payload;fresh decoder;表示均值 2013.67 bps 合法 RVQ curve 与统一指标
MOSS full v1 24 kHz q32 8/8 guarded G4;表示句均值 4027.34 bps;峰值 RSS 3.90 GB 统一内容/质量指标与合法 RVQ curve
MOSS full v2 48 kHz q32 8/8 guarded G4;表示句均值 4027.34 bps;峰值 RSS 4.12 GB 统一内容/质量指标、合法 RLFQ curve 与 streaming gate
Quark HCodec 1.0 16 kHz q4+q4 8/8 双流 guarded G4;表示句均值 2006.10 bps;峰值 RSS 1.77 GB 统一内容/质量指标
Quark HCodec 1.5 16 kHz adaptive q4+q4 8/8 guarded G4;808/1264 groups;聚合 1330.24 bps;峰值 RSS 5.91 GB 统一指标与合法 threshold curve
BigCodec 16 kHz single q8192 8/8 guarded G4;4,039 个真实 13-bit indices;聚合 1041.49 bps;峰值 RSS 2.12 GB 统一指标与机制卡;不伪造 rate curve
WavTokenizer small 24 kHz q4096 8/8 guarded G4;2,019 个真实 12-bit codes;聚合 480.57 bps;峰值 RSS 1.58 GB;odd-length 重放一致 small 统一指标/削波检查
WavTokenizer large unified 24 kHz q4096 8/8 guarded G4;2,019 个真实 12-bit codes;聚合 480.57 bps;峰值 RSS 1.55 GB;odd-length 重放一致 与 small 做同 rate 共同指标;不是受控训练消融
X-Codec 2.0 / TaDiCodec source audit 完成,尚未本地 native 按 execution matrix 逐项执行

MOSS Nano 是 Wave 2 第一个 G2/G4 通过点。它验证的是同一家族的小型部署变体、remote-code 身份和 48 kHz stereo→arena mono 合同。完整 v1 另行下载 7.10 GB 权重并通过 8 句 G4,证明 我们没有用 Nano 替代 SOTA;full v2 也已独立完成 8 句 G4。但 G4 仍只是本地复现资格, 不是质量排名;三者必须在后续统一指标中保留为不同 scaling/deployment 点。

Wave 3 · 公共框架、部署和表示覆盖

SoundStream/ESPnet、AudioDec、FlowDec、FunCodec、HiFiCodec、Lyra、SpeechTokenizer、 SemantiCodec、FACodec、TiCodec、Step-Audio Tokenizer,以及作为 decoder 构件研究的 FARGAN。 Wave 3 不是“不重要”,只是对当前“先校准能力/低码率/流式边界”的信息增益稍后。

每个新系统第一次安装/修复预算仍为 120 分钟。超时意味着本轮 deferred 并留下可复现日志, 不是删除候选;每一 wave 内也可按下载、硬件和依赖并行性调整顺序。

六、每个系统必须过的 gate

G0 source audit
   官方来源、revision、checkpoint、许可、语言/数据声明
G1 native reconstruction
   作者推荐配置能重建本地音频;失败则停止解释其 low-bit 能力
G2 saved representation
   encoder 保存真实表示,fresh decoder 只凭表示和固定共享权重重建
G3 accounting
   author nominal / theoretical representation / packed bytes 分列
G4 unified smoke
   同一 3 英 + 3 中 + 2 critical,保存 RTF/RSS/model bytes/failures
G5 legal stress curve
   只用官方支持的 RVQ、码本、帧率、latent、因果或资源旋钮
G6 common benchmark
   英中主集 + 多语言 probe + 统一指标,才进入条件化本地 Pareto

G1 或 G2 失败仍是有效研究结果;必须保存错误、环境和复现命令。G3 做不到的模型可进质量/ 机制诊断,不进入“公平 payload Pareto”。

七、统一本地报告合同

每个系统至少记录:

identity: name / family / source revision / checkpoint revision / license
conditions: sample rate / causal / streaming / look-ahead / algorithmic latency
rate: author nominal / representation / measured packed / container / on-wire
resources: encoder / decoder bytes / encode RTF / decode RTF / peak RSS / hardware
fidelity: original ER / reconstructed ER / ΔWER or ΔCER / critical entities
quality: STOI / PESQ where valid / mel / F0 / voicing / speaker similarity
scope: languages / datasets / unsupported cases / crashes / OOM
research: mechanism / failure order / extractable student hypothesis

约束:

  1. 原音和重建音使用同一预处理;
  2. 模型权重不计逐句 payload,但必须进入 decoder 资源账;
  3. prompt、speaker reference、文本和其他 side information 必须计入合同;
  4. 作者跨数据集 MOS/WER 与本地实测分列;
  5. 生成/语言模型 token 的“有用”不自动等于通信忠实;
  6. capability、low-rate、streaming、deployment 图分别画,不用单一总分抹平约束。

八、何时才允许开始原创 seed

不要求 40 项全部跑完——这会让项目永远不开工;也不允许只跑 3 个旧锚点就宣布了解前沿。 启动 seed 决策需满足有限的 Coverage Gate

  1. Wave 1 六项都收到明确结论:通过、可复现失败或硬件/许可 deferred;
  2. Wave 2 至少完成 4/6 的 G1–G4,其余两项有完整阻塞证据;
  3. 至少 6 个神经家族完成统一 smoke,其中至少 3 个完成合法 stress 点;
  4. 同时覆盖高能力、低码率、流式、部署、多尺度/语义五种机制;
  5. 至少 3 张机制卡形成可证伪的“教师机制 → 小学生”假设;
  6. 本地报告能明确回答哪些系统属于不同约束平面,不能给一个伪总冠军。

达到这个 Gate 后,Census 继续月更,但不会用“还有新论文”无限推迟原创实验。

九、维护规则

  • 每月扫描新增论文、官方 release、checkpoint 和挑战结果,提交 census diff;
  • 新条目只要与语音最小充分表示、重建、流式或部署有实质关系即可进入,不要求 low-bit 标签;
  • 公开可运行的重要代表必须获得执行决策,不能只写在 prose;
  • paper-only 在代码开放后升级证据等级并进入执行矩阵;
  • 模型被新工作超过后保留其机制卡、失败曲线和环境,历史知识不删除;
  • 每季度至少完整 stress 一个不以 low-bit 为卖点的能力教师;
  • 每个原创 seed 必须引用至少一个前沿机制和一个通信/部署锚点。

运行审计:

python3 scripts/audit_sota_census.py

审计会检查:关键前沿和类别覆盖、来源与 revision 格式、证据等级、执行矩阵引用、Wave 0 不得冒充排名,以及所有 local_smoke/open_runnable/open_framework 项必须有执行决定。