跳转至

SOTA v1 复现环境与版本卡

冻结日期:2026-07-19

历史环境卡。 本文件保留最初 8 家族的精确环境和依赖事实;它不再定义完整 SOTA 范围。当前范围与执行顺序见 configs/sota_census_v1.jsonconfigs/sota_execution_matrix_v1.json。 2026-07-20 起,跨 Apple Silicon、Linux CPU 与云端 CUDA 的正式环境合同改由 ENVIRONMENT_AND_TRAINING.mdruntime_profiles_v1.json 定义;本页的 .model-envs 继续作为已发生 native smoke 的历史证据,不自动等价于 container reproduction。

历史机器清单:configs/sota_shortlist_v1.json

当前自动审计:scripts/audit_sota_census.py

结论

S1 最初冻结了 8 个家族:Opus、Codec 2、EnCodec、LPCNet、 FocalCodec-Stream、Stable Codec、DAC、Mimi。它同时覆盖能力教师、低码率教师、 部署教师和现实通信锚点;DAC 明确是因为高能力而入选,而不是因为带有 low-bit 标签。

这 8 个现在定义 Wave 0/1 的历史起点和已固定版本,不再是整个执行上限。当前状态为:

  • 3 个已安装并通过统一 native smoke:Opus、Codec 2、EnCodec;
  • 5 个已完成隔离/源码 smoke:SNAC、DAC、FocalCodec-Stream、Mimi、LPCNet;
  • Stable Codec 因官方 CUDA/FlashAttention 硬约束保持 platform_deferred
  • Stable Codec 仍是 gated 仓库,但项目所有者已完成许可,固定 revision 的认证下载已验证;
  • SNAC、X-Codec 2.0 已从“失败替补”升级为独立 must_attempt 研究对象。

一、固定主机

字段 本轮固定值
OS macOS 26.5, build 25F71
架构 arm64
CPU Apple M5
统一内存 32 GiB
核心 Python 3.12.2,uv 管理的 .venv
核心 PyTorch 2.13.0
torchaudio / NumPy 2.11.0 / 2.2.6
加速 MPS available = true;每个模型仍须分别验证是否真正使用和是否数值一致
本地二进制 opus-tools 0.2 + libopus 1.6.1;Codec 2 Homebrew 1.2.0

主机卡只说明本轮机器,不把 Apple M5 上的 RTF 外推到手机、服务器 GPU 或其他论文硬件。 正式表格必须保留 reference_hardware

二、最初 8 家族与精确版本

ID 本轮角色 固定源码 固定权重/状态 环境
opus 通信 + 部署锚点 v1.6.122244de… 本机 libopus 1.6.1 Homebrew
codec2 通信 + 部署 + low-bit 1.2.006d4c11… 本机 Codec 2 1.2.0 Homebrew
encodec 能力 + low-bit 教师 v0.1.1f1479a6… 24 kHz checkpoint SHA-256 d7cc33bc…,93,171,529 bytes 核心 .venv
lpcnet 部署 + low-bit 教师 7dc9942… 2ddc476 模型包 Apple M5 static NEON smoke 已通过
focalcodec_stream 流式能力 + low-bit + 部署 912b7f2… HF f60218e… MPS 整句 native smoke 已通过;streaming gate 待做
stable_codec scaling/FSQ + low-bit 教师 ecbb280… HF 15c3ee1…,gated、已授权 隔离环境;ready-to-install
dac 非 low-bit 能力教师 1.0.0c7cfc5d… HF 16 kHz 7c2fc5e… 隔离 Python 环境
mimi 现代流式能力/部署教师 e6a55d2… HF 89091b3… 隔离 Transformers CPU smoke 已通过;streaming 待验证

这 8 项的完整 40/64 位 revision 和合法 rate knob 保留在历史 JSON;新增系统的版本与状态 只维护在 Census/Execution Matrix,避免两个主清单互相漂移。

三、隔离策略

现有 .venv 是已经验证过的基线环境,不直接安装任何新 SOTA 的依赖。新环境放在 已忽略的 .model-envs/<id>/,安装命令和锁文件则提交到仓库。

这不是洁癖,而是已经发现真实冲突:当前核心环境是 torch 2.13.0、 huggingface-hub 1.24.0;固定的 Moshi 源码要求 torch <2.10、huggingface-hub <1.0。 若直接安装,resolver 很可能降级核心依赖,使旧结果不可复现。

每个新模型遵守以下预算:

  1. 安装、修复和第一次官方示例最多 120 分钟;
  2. 超时后保存命令、源码 revision、stderr 和已尝试修复,标 deferred 后继续下一个;
  3. 不使用浮动 main 或未固定 checkpoint 重跑正式结果;
  4. 自动下载的模型文件必须记录来源、revision、字节数和 SHA-256;
  5. 安装成功不等于复现成功,必须经过统一中英 smoke。

新的默认方向是把 Linux-compatible 正式运行迁入 model-family container overlay;已有 venv 不 批量重建或删除,而是在模型进入 D4–D7 时逐个做 native-versus-container 审计。需要 MPS、 CoreML、本机二进制或真机的路径保留为 documented_native_exception

四、已知环境风险

系统 当前风险 处理规则
LPCNet autogen.sh 会联网取模型;shared demo 调用 hidden internal symbol 校验固定 tar 后直接 autoreconf;使用可复现 static NEON 配置,不改算法源码
FocalCodec 核心环境没有 safetensors 在隔离环境安装;先验证 CPU/MPS native point
Stable Codec 单份 safetensors 约 3.81 GB,另有等价 .ckpt 约 3.81 GB 只下载 safetensors,避免重复占用;失败则标 deferred,SNAC 仍独立执行
DAC descript-audiotoolsargbind 依赖面较大 独立环境;优先官方 16 kHz checkpoint 与 .dac 文件闭环
Mimi 与核心 torch/HF hub 明确冲突;固定 Hub 权重 key 属于 Transformers 转换版而非 Moshi 旧 loader 固定 transformers==4.45.0 的独立 CPU 环境;不以 strict=False 混用权重;MLX/streaming 另设 gate

磁盘占用、峰值 RSS、模型参数/权重大小和实际加速后端不在安装前猜测;它们在 S2 native smoke 中实测后写入结果卡。未知值保持未知,不用论文的另一种硬件数字代替本机测量。

五、S1 验证记录

执行:

.venv/bin/python -m json.tool configs/sota_shortlist_v1.json
.venv/bin/python scripts/audit_sota_shortlist.py --check-local
.venv/bin/python -m pytest -q

2026-07-19 结果:

PASS: evo-sota-shortlist-v1
systems=8 installed=3 blocked=1
roles=communication_anchor,deployment_teacher,frontier_teacher,low_bit_teacher
10 passed

历史审计器当时同时阻止:超过 8 个候选、重复 ID、角色缺失、未固定 Git/Hugging Face revision、 无效状态、缺少非 low-bit 能力教师、声明已安装但本地命令/包不存在。

这是 S1 冻结当时的历史输出。2026-07-19 稍后,项目所有者完成 Stable Codec 许可; hf auth whoami 确认账户 alex8092,并成功从固定 revision 下载 README.md。当前清单审计为 installed=3 ready=5 blocked=0。这是许可检查当时的历史状态;后续 source audit 将 Stable 在本机的执行状态修正为 platform_deferred,见下文。

六、S1 尚未证明什么

  • 没有证明 5 个新模型能在 Apple Silicon 完整运行;这是 S2 的工作;
  • 没有证明论文标称码率等于本地实际 packed payload;
  • 没有比较跨论文 MOS/WER,也没有产生新的 SOTA 排名;
  • 没有决定原创 seed 应基于 Codec 2、LPCNet/FARGAN、神经 residual 还是 SOTA 学生;
  • Stable Codec 许可访问已经解决;后续固定源码审计证明它当前硬依赖 CUDA FlashAttention 且不支持 CPU,Apple M5 不再盲目下载权重,等待 CUDA 主机。

S2a 后按 Execution Matrix 分 wave 推进;Stable、SNAC、Mimi、X-Codec 2.0 都独立尝试, 并同步给已安装的 EnCodec 增加合法 rate stress 点。

2026-07-19 · Wave 1/2 source audit 更新

12 个系统的 checkpoint、许可、入口与 LFS SHA 已冻结。Stable Codec 的本机状态由许可层面的 ready_to_install 修正为运行层面的 platform_deferred;SNAC、Mimi、DAC、FocalCodec 和 LPCNet 仍可在隔离环境/源码构建中继续。完整裁决见 SOTA_SOURCE_AUDIT_V1.md

2026-07-19 · 已安装锚点 native smoke 更新

anchors-native-v1-raw 已完成 Opus 12k、Codec 2 3.2k、EnCodec 24k 的 3 × 8 句运行, 24/24 成功。三者都保存真实 payload,并由新 decoder 进程重建;EnCodec 使用新建的确定性 10-bit packed 格式。机器摘要见 experiments/sota_smoke_anchors_native_v1.json,大体积音频、 payload 和日志保留在本地 results/sota_smoke_v1/anchors-native-v1-raw/

这次测得的是逐句冷启动:包含输入转换、进程启动、模型加载、codec 运算和输出转换。 因此 EnCodec mean encode/decode RTF 约 0.502/0.458、峰值 RSS 约 975 MiB,不能与论文的 稳态 GPU throughput 混写。其 decoder+quantizer state 约 60.45 MiB,也清楚说明它当前是 能力教师,不满足本项目最终 ≤5 MB decoder 目标。

2026-07-19 · SNAC 隔离环境与 native smoke 更新

SNAC 使用独立 Python 3.11.12 / torch 2.7.1 CPU 环境,完整锁在 environments/snac-native-v1.txt;源码固定为 8f79a71…,checkpoint 固定为 HF revision d73ad176…pytorch_model.bin 实测 79,488,254 bytes、SHA-256 4b8164cc6606bfa627f1a784734c1e539891518f1191ed9194fe1e3b9b4bff40

正式 8 句运行全部成功:实际三尺度 code 为 985.9–1000.3 bps,带格式头的 payload 为 1402.8–2232.7 bps;冷进程 CPU encode/decode RTF 均值 1.348/1.039,最大 RSS 976.1 MiB, encoder state 25.52 MiB,decoder+quantizer state 50.17 MiB。fresh decoder 抽样生成的 WAV 与原运行 SHA-256 相同。首轮隔离解释器 symlink bug 的失败未删除;runner 现有专项回归测试。 机器摘要见 experiments/sota_smoke_snac_native_v1.json

2026-07-19 · DAC 隔离环境与 native smoke 更新

DAC 使用独立 Python 3.11.12 / torch 2.7.1 MPS 环境,完整锁在 environments/dac-native-v1.txt;源码固定为 c7cfc5d2…。固定源码的 DAC.load() 只读取 项目原生 .pth,因此 native smoke 改用官方 GitHub release 0.0.5 的 16 kHz checkpoint: 296,820,733 bytes、SHA-256 95ab7176b67137d4d4c6c54b8d6ef3cea797faec228cb03ad084badcad570b4d。 此前固定的 HF model.safetensors 是 Transformers 转换版,保留但不与该源码静默混用。

加载后实测 hop_length=320、50 frame/s、12 个 10-bit codebook,所以完整表示约 6000 bps。 正式 fixed run 8/8 成功:表示均值 6003.8 bps,官方 .dac 文件均值 10397.5 bps;冷进程 MPS encode/decode RTF 均值 2.006/1.383,最大 RSS 1074.3 MiB,encoder state 82.10 MiB, decoder+quantizer state 200.86 MiB。普通长度和 exact-hop 句子均用 fresh decoder 字节级复现。

第一轮 dac-native-v1 保留为 3/8:5 个输入长度恰好为 320 samples 整数倍时,官方 decompress 内部先得到 N-8 再按 N reshape。adapter 只对这一已验证条件把解码合同长度临时 设为 N-8,走完官方 decoder 后确定性补 8 个零样本(0.5 ms),并强制最终长度为 N; payload、原长度和 code 均未改写。专项单测与 exact-hop fresh replay 防止该兼容层被掩盖。 机器摘要见 experiments/sota_smoke_dac_native_v1.json

2026-07-19 · FocalCodec-Stream 隔离环境与 native smoke 更新

FocalCodec 使用独立 Python 3.11.12 / torch 2.7.1 MPS 环境,完整锁在 environments/focalcodec-stream-native-v1.txt;源码固定 912b7f2…,4k causal checkpoint 固定 HF revision f60218e…model.safetensors 实测 995,981,096 bytes、SHA-256 5bda5565…6808,config 2,089 bytes、SHA-256 9deaf762…7385。上游本地 loader 会把标准 model.safetensors 错找成 config.safetensors,因此 adapter 显式读取固定 config 与 safetensors, 没有退回联网加载或浮动 torch.hub

final run 8/8 成功:实际 12-bit token 表示 600.0–601.5 bps,完整 payload 1101.4–2110.5 bps;MPS 冷进程 encode/decode RTF 均值 1.510/1.390,最大 RSS 2940.7 MiB, encoder+compressor 501.02 MiB,quantizer+decompressor+decoder 448.79 MiB。普通句与奇数长度 critical 句均 fresh replay 字节级一致。

首轮 focalcodec-stream-native-v1 保留为 7/8:24→16 kHz 重采样对 83,441-sample 输入多输出 1 sample。payload 现保存原长;decoder 只接受 ±1 sample 的数学舍入并确定性裁剪/补零,超过 即失败。checkpoint 全链路 causal,官方理论 latency 80 ms;但本轮是整句 token path,因此 结果明确记 streaming=false,不能声称已验证 stateful real-time streaming。机器摘要见 experiments/sota_smoke_focalcodec_stream_native_v1.json

2026-07-19 · Mimi 隔离环境与 native smoke 更新

Mimi 使用独立 Python 3.11.12 / torch 2.7.1 CPU 环境,完整锁在 environments/mimi-transformers-native-v1.txt;源码依据固定 e6a55d27…,checkpoint 固定 HF revision 89091b3e…model.safetensors 实测 384,649,828 bytes、SHA-256 bac7e850…a5e,config 1,117 bytes、SHA-256 aca6f44b…c36

来源审计在运行时得到纠偏:该 Hub repo 明确是官方 Transformers 转换版,参数 key 与 MimiModel 一致,却与同 revision Moshi 的 loaders.get_mimi 旧 state-dict 合同不一致。 正式 adapter 因此固定 transformers==4.45.0、只读本地 snapshot 并严格构造模型;没有用 strict=False 放过大量 missing/unexpected keys。CPU/MPS 探针 token 完全一致,但冷启动 CPU 更快,因此正式 timing 使用 CPU。

8/8 final run 成功:8 个 2048-entry codebook 的 11-bit 表示均值 1107.52 bps(理论 1100), 完整 payload 均值 2049.12 bps;CPU 冷进程 encode/decode RTF 0.554/0.563,最大 RSS 1039.1 MiB,encoder/decoder path 分别 210.52/218.51 MiB。fresh decoder 重放字节级一致。 架构虽 causal,本轮调用整句 API,因此明确记录 streaming=false。机器摘要见 experiments/sota_smoke_mimi_native_v1.json

2026-07-19 · LPCNet static NEON 环境与 native smoke 更新

LPCNet 源码固定 7dc99429…,模型包 2ddc476 实测 102,536,511 bytes、SHA-256 2d8866d6…87f0。不调用会联网下载的 autogen.sh;校验并提取模型后直接 autoreconf -isf。 构建使用 Apple clang 21.0.0、autoconf 2.73、automake 1.18.1、libtool 2.5.4、 -O3 -ffast-math -mcpu=native,完整卡见 environments/lpcnet-native-v1.txt

默认 shared build 编译完成但 demo 链接 _lpc_from_cepstrum 失败:实现存在于 liblpcnet,内部 visibility 却是 hidden。官方 --disable-shared --enable-static 配置成功,无源码补丁;clean rebuild 生成相同的 8,496,120-byte arm64 binary,SHA-256 00c036d8…72b,只链接 libSystem。

8/8 final run 成功:官方 raw packet 的表示和 packed 码率均值 1604.88 bps,差于理论 1600 只来自尾包补零;CPU 冷进程 encode/decode RTF 0.051/0.202,最大 RSS 40.3 MiB。decoder 的 30 个 lpcnet_arrays 原始 learned weights 合计 6,984,564 bytes,完整二进制 8,496,120 bytes, 两者均超过最终 ≤5 MiB 合同。fresh decoder 只凭 raw bitstream 字节级重放。机器摘要见 experiments/sota_smoke_lpcnet_native_v1.json

2026-07-19 · MOSS-Audio-Tokenizer Nano 隔离环境与 full memory decision

Nano 使用独立 Python 3.11.12 / torch 2.7.0 / Transformers 5.0.0 CPU 环境,完整锁在 environments/moss-audio-tokenizer-nano-native-v1.txt。checkpoint 固定 HF revision 6aa02b01…,87,922,568-byte safetensors SHA-256 34d9880d…f67。运行时发现 checkpoint 自带的 configuration/modeling Python 与 GitHub 8c50ac4c… 并不相同;因此 adapter 另外固定 二者 SHA-256 b2d67dc4…b8aa / b14af7c1…930,连同 config 与 index 一起逐文件校验,设置 HF_HUB_OFFLINE=1 后才以 trust_remote_code=True 从本地加载。静态扫描未发现联网、子进程 执行或文件删除路径;唯一动态 import 是可选 flash_attn

模型实测 21,969,664 参数、48 kHz 双声道、12.5 Hz、16 个 1024-entry RLFQ。arena mono 在 encoder 前复制为 stereo,decoder 后平均回 mono;payload 保存 10-bit token 和精确长度,不含 原音。8/8 final run 的表示均值 2013.67 bps,完整 payload 均值 3629.18 bps;CPU 冷进程 encode/decode RTF 0.960/0.855,最大 RSS 704,364,544 bytes,encoder/decoder path 各 46,074,880 bytes。MPS 对一秒 probe 生成完全相同 token,但冷 encode 为 5.01 s,对应 CPU 0.216 s,故正式选择 CPU。fresh decoder 重放字节级一致。

完整 v1/v2 未下载权重即用固定 config/index 和 meta tensors 核对:分别为 1.775B/2.124B 参数, 实际 tensor bytes 7.10/8.49 GB;checkpoint 文件略大于 tensor bytes是 safetensors header 开销。 两者按 24 GiB 单进程停止线都有权重层面的余量,但 activation/框架复制未知。裁决为:下一轮只 下载 v1,两 shard 校验后对最短句做 CPU 严格加载与 fresh decode;峰值超过 24 GiB 或出现系统 内存压力立即停止。v2 等待 v1 实测,不用 Nano 的小 RSS 作线性保证。机器摘要见 experiments/sota_smoke_moss_audio_tokenizer_nano_native_v1.json

2026-07-20 · MOSS-Audio-Tokenizer full v1 单句 guarded probe

full v1 复用隔离 Python 3.11.12 / torch 2.7.0 / Transformers 5.0.0,独立锁见 environments/moss-audio-tokenizer-full-v1-native-v1.txt。HF revision 3cd226ba… 的两个 shard 分别为 4,998,259,168 / 2,100,202,560 bytes,重新计算 SHA-256 为 037f441e…f28 / a187d73d…582,与 source audit 完全一致。该 checkpoint 的 configuration/modeling 文件与固定 GitHub 8c50ac4c… 逐字一致;config、index、代码和两个 shard 仍在每个进程加载前全部校验。

run_with_memory_guard.py 每 250 ms 统计目标进程及后代 RSS,超过 24 GiB 即终止整个进程组。 先用 20 MiB 限额运行 64 MiB 分配器,0.43 秒内以退出码 125 截停,证明 guard 不是事后报告。 真实 encoder/fresh decoder 峰值进程树 RSS 为 3,619,110,912 / 3,838,787,584 bytes,均未越线; 系统前后没有持续内存压力。RSS 低于 7,098,265,600 tensor bytes 是按需映射,只能作为该阶段 resident set,不能改写 shared model size。

最短英文句产生 32×41 code,10-bit 表示 4006.11 bps、完整 2,751-byte payload 为 6720 bps; CPU 冷进程 encode/decode RTF 9.14/6.78。encoder 同时报告 audio_codes_lengths=40,但 40 帧只 能覆盖 76,800 个 24 kHz samples,小于原始 78,600;官方整句 decode 使用完整 code tensor。 adapter 因此保存 ceil(T/1920)=41 帧和精确原长,decoder 输出 78,720 后确定性裁掉 120 samples。 两次 fresh decoder 的 16 kHz WAV SHA-256 同为 ec49d8eb…395

机器摘要见 experiments/sota_probe_moss_audio_tokenizer_full_v1_memory_v1.json。边界是单句 G2, 并非 8 句 G4;下一步在相同 guard 下跑完整中英/critical smoke,再单独处理 full v2。

2026-07-20 · MOSS-Audio-Tokenizer full v1 guarded G4

正式 runner 现用同一 run_with_memory_guard.py 包住每条 encoder 与 decoder,并把 limit、轮询 周期、两阶段进程树峰值和是否越线写入结果行;审计器对 full v1 缺失 guard、峰值越线或聚合 不一致均硬失败。冻结 3 英 + 3 中 + 2 critical 共 50.415 秒,8/8 保存真实 payload 并由 fresh decoder 重建;decoder 日志不含原音路径,输出全部 finite 且与 header 精确样本数一致。

句均值表示/完整文件码率为 4027.34/5611.22 bps,encode/decode 冷进程 RTF 均值 5.55/4.49; encoder/decoder 最大进程树 RSS 3,681,697,792/3,902,881,792 bytes,16 阶段均未触发 25,769,803,776-byte 停止线。运行前后系统 free-memory 为 34%/41%。中文否定 critical 的第三个 fresh decoder 输出 SHA-256 b04c300b…a83b,与正式输出字节一致。

机器摘要见 experiments/sota_smoke_moss_audio_tokenizer_full_v1_native_v1.json。G4 只封口 transport、独立解码、计账和资源资格;统一 ASR/实体、speaker、表达、听测和 streaming 仍待测。 该节点完成时的下一步是 full v2 最短单句 guarded probe;后续结果见下节。

2026-07-20 · MOSS-Audio-Tokenizer full v2 单句 guarded probe

固定 HF revision f6e20e54… 的 3 shard 共 8,495,058,856 bytes,SHA-256 全部匹配;4 个 config/index/remote-code Git blob 也进入 live 审计。v2 checkpoint remote code 与固定 GitHub 源码不同,正式执行身份因此两者并列记录。模型为 2,123,701,248 参数、8,494,804,992 tensor bytes、48 kHz stereo、32×1024 RLFQ;权重 FP32,CPU compute 使用 bf16,FlashAttention 请求 在本机明确回落 SDPA。

首次严格加载暴露 remote from_pretrainedoutput_loading_info=True tuple 的处理 bug;adapter 改为直接调用同版本 Transformers 基类 loader,保留 missing/unexpected/mismatched/error 检查, 再显式执行 remote dtype finalization。第二次执行发现未补帧时只返回 40 个完整 code frames,会 丢最后 3,600 个 48 kHz samples。正式合同在 encoder 前把每声道补 240 samples 到 3,840 边界, 运输 41 帧与原长,decoder 确定性裁回 240 samples;表示仍为约 4 kbps,不采用错误的 8 kbps 推导。

成功 encoder/decode/replay 峰值进程树 RSS 为 4.29/3.51/3.81 GB;包含两个合同失败尝试的最高值 4.42 GB,均未触发 24 GiB guard。encode/decode RTF 14.75/14.49;输出精确 52,400 samples、 finite 且非静音,两次 fresh decoder SHA-256 同为 16cd7315…f835。机器摘要见 experiments/sota_probe_moss_audio_tokenizer_full_v2_memory_v1.json。下一节点为 v2 冻结 8 句 G4。

2026-07-20 · MOSS-Audio-Tokenizer full v2 guarded G4

相同固定 checkpoint、remote-code 身份、显式逐声道补帧和 base-loader workaround 扩展到冻结 3 英 + 3 中 + 2 critical。50.415 秒 8/8 成功,保存 634 个 32×T 10-bit RLFQ frames; 有限句长取整后的表示码率句均值/aggregate 为 4027.34/4024.19 bps,完整 payload 为 5991.76/5775.58 bps。所有输出精确等于 header 的 16 kHz sample count、finite 且非静音, decoder 命令均不含原音路径。

16 个冷进程阶段的 encode/decode RTF 句均值为 13.37/13.15;encoder/decoder 最大进程树 RSS 4,121,952,256/3,852,681,216 bytes,均未触发 25,769,803,776-byte guard。运行前后系统 free-memory 为 34%/41%。中文否定 critical 再由第三个 fresh decoder 仅凭 payload 重放, SHA-256 97ab45ed…9081 与正式 WAV 字节一致,重放峰值 RSS 3.02 GB。

机器摘要见 experiments/sota_smoke_moss_audio_tokenizer_full_v2_native_v1.json。这将 full v2 升级为 G4,但不证明 ASR/实体、speaker、表达、听测、stateful streaming 或质量 SOTA。

2026-07-20 · Quark HCodec 1.0 单句双流探针

官方源码固定 c4004e2…,codec 权重固定 71541fd…、582,195,700 bytes。源码审计发现 HCodecTokenizer 还会把 HF_ENDPOINT 强制改到第三方 mirror,并浮动下载 bosonai/hubert_base。因此正式 encoder 另行固定 HuBERT d7a7039… 的 1,375-byte config 与 377,510,632-byte safetensors;三文件 SHA-256 均在加载前重算。隔离环境使用 Python 3.10.10、 PyTorch 2.5.0、Transformers 4.49.0 与 vector-quantize-pytorch 1.22.15。

官方 python audio_tokenizer.py 因相对导入没有 package context 会立即失败;adapter 以显式 package identity 加载原始 vq 源码,并逐式复现官方 HuBERT hidden-state 混合与幅度压缩,不改 上游文件。另因仓库提交了 __pycache__,首次 source-clean guard 在推理前拒绝;修订后的合同 核对固定 HEAD 与所有非 pyc 跟踪文件,并把运行时 bytecode 重定向到隔离缓存。

成功 encoder 输出 acoustic/semantic 各 4×82 个 1024-entry code,原音补 80 samples;表示 2003.05 bps,820-byte packed tokens,完整 payload 1,796 bytes / 4387.18 bps。codec/HuBERT tensor bytes 为 582,088,744/377,486,848;fresh decoder 只加载 codec。encode/decode RTF 5.28/2.43,最大进程树 RSS 1.56 GB。输出精确 52,400 samples、finite 且非静音;第二次 fresh decode SHA-256 同为 0044bc7c…97f3。机器摘要见 experiments/sota_probe_quark_hcodec_1_0_native_v1.json;当前只是单句 G2,不是 G4 或质量结论。

2026-07-20 · Quark HCodec 1.0 冻结 8 句 G4

沿用完全相同的固定源码、codec、HuBERT、隔离环境和双流 payload 合同,正式 runner 完成 3 英 + 3 中 + 2 critical 共 50.415 秒。8/8 encoder 与 fresh decoder 成功;acoustic/semantic 始终各为 4×T,每流累计 1,264 frames。表示码率句均值/聚合值为 2006.10/2005.75 bps; 完整 payload 句均值/聚合值为 3397.51/3246.33 bps。

16 个冷进程阶段的 encode/decode RTF 句均值为 2.56/2.01;encoder/decoder 最大进程树 RSS 为 1,766,080,512/1,444,823,040 bytes,均未触发 25,769,803,776-byte guard。全部输出与 payload 声明的原始 sample 数精确一致、finite 且非静音。中文否定 critical 再由第三个 fresh decoder 仅凭 payload 重放,SHA-256 8dd05d5c…eeb6 与正式 WAV 字节一致,重放峰值 RSS 1.44 GB。

机器摘要见 experiments/sota_smoke_quark_hcodec_1_0_native_v1.json。这将 HCodec 1.0 升级为 G4,但不证明 ASR/实体、speaker、表达、听测、causal streaming、实时性或质量 SOTA;下一步是 HCodec 1.5 的 guarded 单句内存与 adaptive-payload 合同探针。

2026-07-20 · Quark HCodec 1.5 单句 adaptive-payload 探针

1.5 使用独立 .model-envs/quark_hcodec_v1_5/venv,Python 3.10.10 与 122 包精确冻结在 environments/quark-hcodec-1.5-native-v1.txt。源码固定 c4004e2… 及 HCodec-1.5 subtree 8588607…;2,747,714,452-byte codec 权重严格加载 1,293 keys、零 missing/unexpected。 官方 encoder 隐含浮动加载 facebook/wav2vec2-large-xlsr-53,现也固定 revision、config 与 1,269,737,156-byte 权重并完全离线加载。codec/Wav2Vec2 分别为 678,417,154/315,438,720 参数; encoder tensor 合计 4.01 GB,fresh decoder 只加载 2.75 GB codec tensors。

官方固定手动阈值 0.6 将 82 个 25 Hz 基帧合并为 65 组,长度范围 1–6、均值 1.262。上游把 length-1 重复注入 4 acoustic + 4 semantic 的每个 composite index,且 decoder 会用 semantic 长度静默覆盖 acoustic 长度。adapter 因此交叉核验八份长度,传一个共享 3-bit length 和八个 10-bit codes:83 bits/group,共 5,395 bits / 1647.33 bps;上游重复长度口径另列 2064.12 bps, 不得混用。完整短文件 payload 1,956 bytes / 4778.02 bps,明确包含身份与 header 固定开销。

encode/decode/replay RTF 为 10.40/8.26/8.53,最大采样进程树 RSS 5,811,322,880 bytes,均未触发 25,769,803,776-byte guard。fresh decoder 命令不接收原音、不加载 Wav2Vec2;两次 52,400-sample 输出 SHA-256 同为 f74d82ba…06c3。机器摘要见 experiments/sota_probe_quark_hcodec_1_5_native_v1.json。该节点是单句 G2,只批准固定 0.6 阈值 的冻结 8 句 G4;不证明中英稳健性、内容/实体/身份/表达/听测质量、流式实时或 Pareto 优势。

2026-07-20 · Quark HCodec 1.5 冻结 8 句 G4

沿用单句探针完全相同的源码、codec、Wav2Vec2、122 包环境、固定阈值 0.6 和 83 bits/group 合同,正式 runner 完成 3 英 + 3 中 + 2 critical 共 50.415063 秒。8/8 encoder 与 fresh decoder 成功;1264 个 25 Hz 基帧合并为 808 组,group ratio 0.6392,长度均值 1.564。总直方图为 1:682, 2:36, 3:20, 4:15, 5:8, 6:10, 7:6, 8:31

表示码率句均值/聚合值为 1363.37/1330.24 bps,完整 payload 为 3190.48/2959.43 bps;单句 表示范围 980.59–1773.27 bps,说明固定 threshold 不是固定码率。英文四句 aggregate 1528.15 bps、中文四句 1159.42 bps,但组内跨度也很大,不能从 4+4 句推断语言效应。相同基础帧下 HCodec 1.0 聚合 2005.75 bps,1.5 的表示低 33.68%;这不含任何质量等价证明。

16 个冷进程 encode/decode RTF 句均值为 5.85/5.21;最大进程树 RSS 5,911,412,736 bytes,均未 触发 25,769,803,776-byte guard。中文否定 critical 的第三个 fresh decoder 只凭 payload 重放, SHA-256 a5ab0c04…04d1 与正式 WAV 字节一致。输出均 exact-length、finite、非静音;英文中句 有 1 个 PCM16 sample 到达负满幅,作为后续质量/clipping 检查项保留,不把它误记为 transport 失败,也不应忽略。

机器摘要见 experiments/sota_smoke_quark_hcodec_1_5_native_v1.json。HCodec 1.5 升为 G4, 但内容、关键实体、speaker、表达、听测、causal streaming、实时性与质量 Pareto 仍未验证。

2026-07-20 · BigCodec 单句真实 index payload 探针

源码固定 09845ab…vq subtree 固定 3f28dcd…;checkpoint 固定 c654883…、 637,937,326 bytes。上游只写“Python 3.9”且 requirements 不固定版本,还漏列 inference.py 实际导入的 tqdm。第一次官方命令因此在模型加载前失败;补齐 tqdm 后,第二次在 encoder.eval().cuda() 明确失败,因为 Apple torch 无 CUDA。最终独立环境使用 Python 3.9.22、 PyTorch 2.5.0 CPU 与 35 个精确锁定包,不改上游源码文件。

官方 encoder 76,530,704 参数、decoder/quantizer 82,905,586 参数,总计 159,436,290;533 个 checkpoint state keys 严格加载,零 missing/unexpected。encoder+decoder tensors 637,752,072 bytes, fresh decoder 只加载 331,625,800 bytes。结构实测为一个 8192-entry、8-dim factorized codebook, hop 200 samples,因此原生表示为 80 fps × 13 bits = 1040 bps。

最短 3.275 秒句子恰有 52,400 samples,但上游 padding 表达式仍额外补 200 samples,产生 263 tokens;真实表示 3419 bits / 1043.97 bps,packed token body 428 bytes,完整 payload 1,317 bytes / 3217.10 bps。adapter 把 indices 送回上游 vq2emb,与 encoder 侧量化 embedding 最大绝对误差 2.38e-7。fresh decoder 裁掉 200 samples 后输出精确 52,400 samples;第二次 fresh replay SHA-256 同为 5a4e495d…0400。encode/decode RTF 9.60/5.61,最大进程树 RSS 1.79 GB,全部未越 24 GiB guard。

机器摘要见 experiments/sota_probe_bigcodec_native_v1.json。这将 BigCodec 升为单句 G2 并批准 冻结 8 句 G4;不证明多句稳健性、内容/实体/speaker/表达/听测质量、CUDA 等价、流式或 Pareto。

2026-07-20 · BigCodec 冻结 8 句 guarded G4

相同 24 GiB 主动进程树 guard 下,3 英 + 3 中 + 英文数字 critical + 中文否定 critical 全部完成 独立 encoder→真实 .bigc→fresh decoder。4,039 个真实单码本 indices 共 52,507 representation bits;按 50.415063 秒加权为 1041.49 bps(句均值 1041.66),完整自描述 payload 聚合为 2171.57 bps。前者与标称 1040 bps 的偏差来自上游固定补 1–200 samples、exact-hop 也多补完整 200 samples 的规则,两个口径均保留而不混写。

所有重建 WAV 均 exact original length、finite,encode/decode RTF 句均值 6.37/5.76。16 个正式 encoder/decoder 进程最大进程树 RSS 2,116,337,664 bytes,未触发 25,769,803,776-byte 停止线。 中文否定句的第三个 fresh decoder 仅接收 payload,输出 SHA-256 10357191…19af,与正式重建逐字节一致。机器摘要见 experiments/sota_smoke_bigcodec_native_v1.json

BigCodec 因此升为 G4 并转入统一内容/质量指标与机制卡;该结果仍不证明 ASR/实体、speaker、 表达、听测、CUDA 等价、实时性或 Pareto 优势。未核实第二个官方 rate point,所以禁止用抽帧 或截断 codebook 人造 rate curve。下一执行项为 WavTokenizer small 40-token CPU native roundtrip。

2026-07-20 · WavTokenizer small 40-token 单句真实 code 探针

源码固定 5cf440d…,small speech checkpoint 固定 917d513…、1,589,082,492 bytes、SHA-256 d44c40fb…d004。建立 Python 3.9.22 / torch 2.0.0 / torchaudio 2.0.1 / NumPy 1.23.5 的 25 包隔离 runtime lock;官方 requirements 中 Lightning、fairseq、torchcrepe、PESQ、matplotlib、 Transformers 和 tensorboardX 属训练/评估路径,本次未安装,也不声称复现全量训练环境。

官方 from_pretrained0802 严格加载 80,913,988 参数、289 state keys,完整 inference state 为 340,459,156 tensor bytes;1.59 GB checkpoint 不能冒充实际 decoder 常驻权重。组件审计显示 public encode 至少使用 50,006,020 tensor bytes,public code decode 至少使用 272,037,644 bytes, 但官方 loader 当前在两个进程都物化完整 340.46 MB,剪枝值仅是未来部署下界而非已测包体。

最短句从 52,400 个 16 kHz samples 经官方 resampler 得到 78,600 个 24 kHz samples,输出 131 个真实 q4096 codes。12-bit 表示为 1572 bits / 480.00 bps,packed body 197 bytes;完整自描述 payload 为 1195 bytes / 2919.08 bps。codes_to_features 与 encoder 特征最大误差 0;fresh decoder 输出精确 52,400 samples、finite,第三个 decoder 只凭 payload 重放,正式与 replay SHA-256 均为 de0afa27…52db

第一次正式 adapter 运行被结构断言正确拦下:YAML 写 downsample [6,5,5,4],而 pinned SEANetEncoder 内部存储实际执行顺序 (4,5,5,6);乘积和 600-sample hop 不变。失败日志保留, 断言改为运行时身份后新 run-id 通过。成功 encode/decode/replay 的主动 guard 采样峰值 1.24 GB, 进程自身 ru_maxrss 最高 1.29 GB,均未触发 24 GiB 停止线。

机器摘要见 experiments/sota_probe_wavtokenizer_small_native_v1.json。这将 small 40-token 点升为 单句 G2,并批准冻结 8 句 G4;尚未验证 partial-hop trimming、中英文 critical 内容、听感、 speaker、表达、实时性或 Pareto。large 40/75-token 变体保持已审计未下载。

2026-07-20 · WavTokenizer small 40-token 冻结 8 句 G4

同一固定源码、checkpoint 和 25 包 runtime 在 24 GiB 主动 guard 下完成 3 英 + 3 中 + 2 critical。八句共 50.415063 秒、2,019 个真实 q4096 codes、24,228 representation bits; 句均值/聚合表示码率为 480.63/480.57 bps,完整自描述 payload 聚合为 1752.17 bps。有限句的 0–480 sample padding 解释了聚合值略高于渐近 480 bps,不是语言效应。

五句覆盖 partial-hop。odd-length 英文 critical 从 125,162 个 24 kHz samples 解码到 125,400, 裁掉 238 samples 后重采样,并在 16 kHz 校正 -1 sample,最终精确恢复 83,441 samples;第三个 fresh decoder 只接收 payload,输出与正式重建 SHA-256 同为 2e911947…cd3。encode/decode RTF 句均值 1.38/2.16,16 个正式进程的最大进程树 RSS 1,581,400,064 bytes,未触发 25,769,803,776-byte 停止线。

所有输出 exact-length、finite;两句中共检测到 3 个负满幅 PCM16 样本、无正满幅样本。这不 影响 payload、计账或确定性重放的 G4 结论,但必须作为后续统一质量指标的削波检查,不能把 G4 写成质量 SOTA。机器摘要见 experiments/sota_smoke_wavtokenizer_small_native_v1.json。small 先进入统一指标;下一执行 gate 为 large unified 40-token guarded 单句真实 code 探针,large speech 75-token 随后作为独立系统验证。

最终独立重算还发现:manifest 为显示而保留的六位小数把 odd-length 句的 5.2150625 秒写作 5.215063 秒,旧 runner 曾把显示值误作码率/RTF 分母。runner 与 auditor 已统一改用真实 num_samples / sample_rate_hz,并保留历史结果 fallback;该修正只改变约 0.000046 bps 的末位, 不改变上述两位小数结论,但封住了未来短音频上的系统性计账误差。

2026-07-20 · WavTokenizer large unified 40-token 单句真实 code 探针

novateur/WavTokenizer-large-unify-40token 固定 revision 7dc47a9… 下载唯一 checkpoint; 1,759,224,573 bytes 与 SHA-256 72182c1b…8205 均匹配 source audit。仓库只含权重和 429-byte README,没有 large config。checkpoint 的 1,091 个完整训练 state keys / 847,735,396 tensor bytes 包含 discriminator 等训练状态;metadata 的 resume_config 记录 75-token 训练 lineage, 而 resume_model 名称指向 40-token 训练。这些训练机 lineage 字符串不作为推理身份依据。

以固定源码中的 40-token YAML 调用官方 from_pretrained0802,推理子网严格加载且无 missing/unexpected keys:80,913,988 参数、289 state keys、340,459,156 tensor bytes;运行时 encoder ratios (4,5,5,6)、40 fps、单 q4096、decoder hop 600。它与 small 的已观察推理结构和 规模一致,差异在 checkpoint 权重与作者报告的约 8 万小时 speech/audio/music 训练覆盖。因此 这是相同 token rate 的 SOTA-first 对照,不是参数量、结构或训练数据的受控因果消融。

复用同一 25 包 Python 3.9.22 / torch 2.0.0 隔离环境,最短 3.275 秒句产生 131 个真实 codes; 12-bit 表示 1572 bits / 480.00 bps,packed body 197 bytes,完整自描述 payload 1224 bytes / 2989.92 bps。相对 small 多出的 29 payload bytes 来自更长 checkpoint/variant 身份,不是表示 码率增加。codes_to_features 误差为 0,输出精确 52,400 samples、finite、无满幅样本。

encode/decode RTF 为 2.59/3.56,正式阶段最大进程树 RSS 1,241,841,664 bytes。第三个 fresh decoder 只接收 payload,输出与正式重建 SHA-256 同为 d51d814e…45e2;重放 guard 峰值 1,223,983,104 bytes。与 small 同句比较,large 的 131 个 token 在 131 个位置全部不同,但这只 证明权重产生不同表示,不证明质量更高。机器摘要见 experiments/sota_probe_wavtokenizer_large_unified_native_v1.json;下一 gate 为冻结 8 句 G4。

2026-07-20 · WavTokenizer large unified 40-token 冻结 8 句 G4

相同固定源码、checkpoint、25 包 runtime 和 24 GiB guard 在 3 英 + 3 中 + 2 critical 上完成 8/8 encoder→真实 .wvt→fresh decoder。50.4150625 秒共 2,019 个 q4096 codes、24,228 representation bits;句均值/聚合表示码率 480.63/480.57 bps,完整 payload 聚合 1788.99 bps。 token body 与 small 逐句完全同长;large 每文件多 29 bytes,仅来自更长的 checkpoint/variant 身份字符串,因此不能把 header 差异当编码开销能力差异。

五句覆盖 0–480 个 24 kHz partial-hop padding。odd-length 英文 critical 的 125,162 samples 解码到 125,400,裁掉 238 后重采样并校正 -1 个 16 kHz sample,最终精确恢复 83,441 samples; 第三次 source-blind decoder 输出与正式重建 SHA-256 同为 777e6af6…ae34。encode/decode RTF 句均值 1.46/2.17,正式 16 个进程最大进程树 RSS 1,549,893,632 bytes,未触发停止线。

所有输出 exact-length、finite,8 句无正负满幅 PCM16 样本。small 同集合有 3 个负满幅样本, 因此“削波计数”作为后续共同质量指标预注册;它不是单独的胜负裁判。两个 checkpoint 在全部 2,019 个对应 token 位置上零相同,同时推理 shape 与表示 bit 数相同,这证明 code identity/权重 行为不同,但 codebook 可能存在置换,不能从 token ID 距离推导声学质量。机器摘要见 experiments/sota_smoke_wavtokenizer_large_unified_native_v1.json。下一 gate 为 large speech 75-token guarded 单句探针。