SOTA v1 复现环境与版本卡¶
冻结日期:2026-07-19
历史环境卡。 本文件保留最初 8 家族的精确环境和依赖事实;它不再定义完整 SOTA 范围。当前范围与执行顺序见
configs/sota_census_v1.json和configs/sota_execution_matrix_v1.json。 2026-07-20 起,跨 Apple Silicon、Linux CPU 与云端 CUDA 的正式环境合同改由ENVIRONMENT_AND_TRAINING.md和runtime_profiles_v1.json定义;本页的.model-envs继续作为已发生 native smoke 的历史证据,不自动等价于 container reproduction。
历史机器清单:configs/sota_shortlist_v1.json
当前自动审计:scripts/audit_sota_census.py
结论¶
S1 最初冻结了 8 个家族:Opus、Codec 2、EnCodec、LPCNet、 FocalCodec-Stream、Stable Codec、DAC、Mimi。它同时覆盖能力教师、低码率教师、 部署教师和现实通信锚点;DAC 明确是因为高能力而入选,而不是因为带有 low-bit 标签。
这 8 个现在定义 Wave 0/1 的历史起点和已固定版本,不再是整个执行上限。当前状态为:
- 3 个已安装并通过统一 native smoke:Opus、Codec 2、EnCodec;
- 5 个已完成隔离/源码 smoke:SNAC、DAC、FocalCodec-Stream、Mimi、LPCNet;
- Stable Codec 因官方 CUDA/FlashAttention 硬约束保持
platform_deferred; - Stable Codec 仍是 gated 仓库,但项目所有者已完成许可,固定 revision 的认证下载已验证;
- SNAC、X-Codec 2.0 已从“失败替补”升级为独立
must_attempt研究对象。
一、固定主机¶
| 字段 | 本轮固定值 |
|---|---|
| OS | macOS 26.5, build 25F71 |
| 架构 | arm64 |
| CPU | Apple M5 |
| 统一内存 | 32 GiB |
| 核心 Python | 3.12.2,uv 管理的 .venv |
| 核心 PyTorch | 2.13.0 |
| torchaudio / NumPy | 2.11.0 / 2.2.6 |
| 加速 | MPS available = true;每个模型仍须分别验证是否真正使用和是否数值一致 |
| 本地二进制 | opus-tools 0.2 + libopus 1.6.1;Codec 2 Homebrew 1.2.0 |
主机卡只说明本轮机器,不把 Apple M5 上的 RTF 外推到手机、服务器 GPU 或其他论文硬件。
正式表格必须保留 reference_hardware。
二、最初 8 家族与精确版本¶
| ID | 本轮角色 | 固定源码 | 固定权重/状态 | 环境 |
|---|---|---|---|---|
opus |
通信 + 部署锚点 | v1.6.1 → 22244de… |
本机 libopus 1.6.1 | Homebrew |
codec2 |
通信 + 部署 + low-bit | 1.2.0 → 06d4c11… |
本机 Codec 2 1.2.0 | Homebrew |
encodec |
能力 + low-bit 教师 | v0.1.1 → f1479a6… |
24 kHz checkpoint SHA-256 d7cc33bc…,93,171,529 bytes |
核心 .venv |
lpcnet |
部署 + low-bit 教师 | 7dc9942… |
2ddc476 模型包 |
Apple M5 static NEON smoke 已通过 |
focalcodec_stream |
流式能力 + low-bit + 部署 | 912b7f2… |
HF f60218e… |
MPS 整句 native smoke 已通过;streaming gate 待做 |
stable_codec |
scaling/FSQ + low-bit 教师 | ecbb280… |
HF 15c3ee1…,gated、已授权 |
隔离环境;ready-to-install |
dac |
非 low-bit 能力教师 | 1.0.0 → c7cfc5d… |
HF 16 kHz 7c2fc5e… |
隔离 Python 环境 |
mimi |
现代流式能力/部署教师 | e6a55d2… |
HF 89091b3… |
隔离 Transformers CPU smoke 已通过;streaming 待验证 |
这 8 项的完整 40/64 位 revision 和合法 rate knob 保留在历史 JSON;新增系统的版本与状态 只维护在 Census/Execution Matrix,避免两个主清单互相漂移。
三、隔离策略¶
现有 .venv 是已经验证过的基线环境,不直接安装任何新 SOTA 的依赖。新环境放在
已忽略的 .model-envs/<id>/,安装命令和锁文件则提交到仓库。
这不是洁癖,而是已经发现真实冲突:当前核心环境是 torch 2.13.0、
huggingface-hub 1.24.0;固定的 Moshi 源码要求 torch <2.10、huggingface-hub <1.0。
若直接安装,resolver 很可能降级核心依赖,使旧结果不可复现。
每个新模型遵守以下预算:
- 安装、修复和第一次官方示例最多 120 分钟;
- 超时后保存命令、源码 revision、stderr 和已尝试修复,标 deferred 后继续下一个;
- 不使用浮动
main或未固定 checkpoint 重跑正式结果; - 自动下载的模型文件必须记录来源、revision、字节数和 SHA-256;
- 安装成功不等于复现成功,必须经过统一中英 smoke。
新的默认方向是把 Linux-compatible 正式运行迁入 model-family container overlay;已有 venv 不
批量重建或删除,而是在模型进入 D4–D7 时逐个做 native-versus-container 审计。需要 MPS、
CoreML、本机二进制或真机的路径保留为 documented_native_exception。
四、已知环境风险¶
| 系统 | 当前风险 | 处理规则 |
|---|---|---|
| LPCNet | autogen.sh 会联网取模型;shared demo 调用 hidden internal symbol |
校验固定 tar 后直接 autoreconf;使用可复现 static NEON 配置,不改算法源码 |
| FocalCodec | 核心环境没有 safetensors | 在隔离环境安装;先验证 CPU/MPS native point |
| Stable Codec | 单份 safetensors 约 3.81 GB,另有等价 .ckpt 约 3.81 GB |
只下载 safetensors,避免重复占用;失败则标 deferred,SNAC 仍独立执行 |
| DAC | descript-audiotools、argbind 依赖面较大 |
独立环境;优先官方 16 kHz checkpoint 与 .dac 文件闭环 |
| Mimi | 与核心 torch/HF hub 明确冲突;固定 Hub 权重 key 属于 Transformers 转换版而非 Moshi 旧 loader | 固定 transformers==4.45.0 的独立 CPU 环境;不以 strict=False 混用权重;MLX/streaming 另设 gate |
磁盘占用、峰值 RSS、模型参数/权重大小和实际加速后端不在安装前猜测;它们在 S2 native smoke 中实测后写入结果卡。未知值保持未知,不用论文的另一种硬件数字代替本机测量。
五、S1 验证记录¶
执行:
.venv/bin/python -m json.tool configs/sota_shortlist_v1.json
.venv/bin/python scripts/audit_sota_shortlist.py --check-local
.venv/bin/python -m pytest -q
2026-07-19 结果:
PASS: evo-sota-shortlist-v1
systems=8 installed=3 blocked=1
roles=communication_anchor,deployment_teacher,frontier_teacher,low_bit_teacher
10 passed
历史审计器当时同时阻止:超过 8 个候选、重复 ID、角色缺失、未固定 Git/Hugging Face revision、 无效状态、缺少非 low-bit 能力教师、声明已安装但本地命令/包不存在。
这是 S1 冻结当时的历史输出。2026-07-19 稍后,项目所有者完成 Stable Codec 许可;
hf auth whoami 确认账户 alex8092,并成功从固定 revision 下载 README.md。当前清单审计为
installed=3 ready=5 blocked=0。这是许可检查当时的历史状态;后续 source audit 将 Stable
在本机的执行状态修正为 platform_deferred,见下文。
六、S1 尚未证明什么¶
- 没有证明 5 个新模型能在 Apple Silicon 完整运行;这是 S2 的工作;
- 没有证明论文标称码率等于本地实际 packed payload;
- 没有比较跨论文 MOS/WER,也没有产生新的 SOTA 排名;
- 没有决定原创 seed 应基于 Codec 2、LPCNet/FARGAN、神经 residual 还是 SOTA 学生;
- Stable Codec 许可访问已经解决;后续固定源码审计证明它当前硬依赖 CUDA FlashAttention 且不支持 CPU,Apple M5 不再盲目下载权重,等待 CUDA 主机。
S2a 后按 Execution Matrix 分 wave 推进;Stable、SNAC、Mimi、X-Codec 2.0 都独立尝试, 并同步给已安装的 EnCodec 增加合法 rate stress 点。
2026-07-19 · Wave 1/2 source audit 更新¶
12 个系统的 checkpoint、许可、入口与 LFS SHA 已冻结。Stable Codec 的本机状态由许可层面的
ready_to_install 修正为运行层面的 platform_deferred;SNAC、Mimi、DAC、FocalCodec 和
LPCNet 仍可在隔离环境/源码构建中继续。完整裁决见
SOTA_SOURCE_AUDIT_V1.md。
2026-07-19 · 已安装锚点 native smoke 更新¶
anchors-native-v1-raw 已完成 Opus 12k、Codec 2 3.2k、EnCodec 24k 的 3 × 8 句运行,
24/24 成功。三者都保存真实 payload,并由新 decoder 进程重建;EnCodec 使用新建的确定性
10-bit packed 格式。机器摘要见 experiments/sota_smoke_anchors_native_v1.json,大体积音频、
payload 和日志保留在本地 results/sota_smoke_v1/anchors-native-v1-raw/。
这次测得的是逐句冷启动:包含输入转换、进程启动、模型加载、codec 运算和输出转换。 因此 EnCodec mean encode/decode RTF 约 0.502/0.458、峰值 RSS 约 975 MiB,不能与论文的 稳态 GPU throughput 混写。其 decoder+quantizer state 约 60.45 MiB,也清楚说明它当前是 能力教师,不满足本项目最终 ≤5 MB decoder 目标。
2026-07-19 · SNAC 隔离环境与 native smoke 更新¶
SNAC 使用独立 Python 3.11.12 / torch 2.7.1 CPU 环境,完整锁在
environments/snac-native-v1.txt;源码固定为 8f79a71…,checkpoint 固定为 HF revision
d73ad176…,pytorch_model.bin 实测 79,488,254 bytes、SHA-256
4b8164cc6606bfa627f1a784734c1e539891518f1191ed9194fe1e3b9b4bff40。
正式 8 句运行全部成功:实际三尺度 code 为 985.9–1000.3 bps,带格式头的 payload 为
1402.8–2232.7 bps;冷进程 CPU encode/decode RTF 均值 1.348/1.039,最大 RSS 976.1 MiB,
encoder state 25.52 MiB,decoder+quantizer state 50.17 MiB。fresh decoder 抽样生成的 WAV
与原运行 SHA-256 相同。首轮隔离解释器 symlink bug 的失败未删除;runner 现有专项回归测试。
机器摘要见 experiments/sota_smoke_snac_native_v1.json。
2026-07-19 · DAC 隔离环境与 native smoke 更新¶
DAC 使用独立 Python 3.11.12 / torch 2.7.1 MPS 环境,完整锁在
environments/dac-native-v1.txt;源码固定为 c7cfc5d2…。固定源码的 DAC.load() 只读取
项目原生 .pth,因此 native smoke 改用官方 GitHub release 0.0.5 的 16 kHz checkpoint:
296,820,733 bytes、SHA-256 95ab7176b67137d4d4c6c54b8d6ef3cea797faec228cb03ad084badcad570b4d。
此前固定的 HF model.safetensors 是 Transformers 转换版,保留但不与该源码静默混用。
加载后实测 hop_length=320、50 frame/s、12 个 10-bit codebook,所以完整表示约 6000 bps。
正式 fixed run 8/8 成功:表示均值 6003.8 bps,官方 .dac 文件均值 10397.5 bps;冷进程
MPS encode/decode RTF 均值 2.006/1.383,最大 RSS 1074.3 MiB,encoder state 82.10 MiB,
decoder+quantizer state 200.86 MiB。普通长度和 exact-hop 句子均用 fresh decoder 字节级复现。
第一轮 dac-native-v1 保留为 3/8:5 个输入长度恰好为 320 samples 整数倍时,官方
decompress 内部先得到 N-8 再按 N reshape。adapter 只对这一已验证条件把解码合同长度临时
设为 N-8,走完官方 decoder 后确定性补 8 个零样本(0.5 ms),并强制最终长度为 N;
payload、原长度和 code 均未改写。专项单测与 exact-hop fresh replay 防止该兼容层被掩盖。
机器摘要见 experiments/sota_smoke_dac_native_v1.json。
2026-07-19 · FocalCodec-Stream 隔离环境与 native smoke 更新¶
FocalCodec 使用独立 Python 3.11.12 / torch 2.7.1 MPS 环境,完整锁在
environments/focalcodec-stream-native-v1.txt;源码固定 912b7f2…,4k causal checkpoint
固定 HF revision f60218e…。model.safetensors 实测 995,981,096 bytes、SHA-256
5bda5565…6808,config 2,089 bytes、SHA-256 9deaf762…7385。上游本地 loader 会把标准
model.safetensors 错找成 config.safetensors,因此 adapter 显式读取固定 config 与 safetensors,
没有退回联网加载或浮动 torch.hub。
final run 8/8 成功:实际 12-bit token 表示 600.0–601.5 bps,完整 payload 1101.4–2110.5 bps;MPS 冷进程 encode/decode RTF 均值 1.510/1.390,最大 RSS 2940.7 MiB, encoder+compressor 501.02 MiB,quantizer+decompressor+decoder 448.79 MiB。普通句与奇数长度 critical 句均 fresh replay 字节级一致。
首轮 focalcodec-stream-native-v1 保留为 7/8:24→16 kHz 重采样对 83,441-sample 输入多输出
1 sample。payload 现保存原长;decoder 只接受 ±1 sample 的数学舍入并确定性裁剪/补零,超过
即失败。checkpoint 全链路 causal,官方理论 latency 80 ms;但本轮是整句 token path,因此
结果明确记 streaming=false,不能声称已验证 stateful real-time streaming。机器摘要见
experiments/sota_smoke_focalcodec_stream_native_v1.json。
2026-07-19 · Mimi 隔离环境与 native smoke 更新¶
Mimi 使用独立 Python 3.11.12 / torch 2.7.1 CPU 环境,完整锁在
environments/mimi-transformers-native-v1.txt;源码依据固定 e6a55d27…,checkpoint 固定
HF revision 89091b3e…。model.safetensors 实测 384,649,828 bytes、SHA-256
bac7e850…a5e,config 1,117 bytes、SHA-256 aca6f44b…c36。
来源审计在运行时得到纠偏:该 Hub repo 明确是官方 Transformers 转换版,参数 key 与
MimiModel 一致,却与同 revision Moshi 的 loaders.get_mimi 旧 state-dict 合同不一致。
正式 adapter 因此固定 transformers==4.45.0、只读本地 snapshot 并严格构造模型;没有用
strict=False 放过大量 missing/unexpected keys。CPU/MPS 探针 token 完全一致,但冷启动 CPU
更快,因此正式 timing 使用 CPU。
8/8 final run 成功:8 个 2048-entry codebook 的 11-bit 表示均值 1107.52 bps(理论 1100),
完整 payload 均值 2049.12 bps;CPU 冷进程 encode/decode RTF 0.554/0.563,最大 RSS
1039.1 MiB,encoder/decoder path 分别 210.52/218.51 MiB。fresh decoder 重放字节级一致。
架构虽 causal,本轮调用整句 API,因此明确记录 streaming=false。机器摘要见
experiments/sota_smoke_mimi_native_v1.json。
2026-07-19 · LPCNet static NEON 环境与 native smoke 更新¶
LPCNet 源码固定 7dc99429…,模型包 2ddc476 实测 102,536,511 bytes、SHA-256
2d8866d6…87f0。不调用会联网下载的 autogen.sh;校验并提取模型后直接 autoreconf -isf。
构建使用 Apple clang 21.0.0、autoconf 2.73、automake 1.18.1、libtool 2.5.4、
-O3 -ffast-math -mcpu=native,完整卡见 environments/lpcnet-native-v1.txt。
默认 shared build 编译完成但 demo 链接 _lpc_from_cepstrum 失败:实现存在于 liblpcnet,内部
visibility 却是 hidden。官方 --disable-shared --enable-static 配置成功,无源码补丁;clean
rebuild 生成相同的 8,496,120-byte arm64 binary,SHA-256 00c036d8…72b,只链接 libSystem。
8/8 final run 成功:官方 raw packet 的表示和 packed 码率均值 1604.88 bps,差于理论 1600
只来自尾包补零;CPU 冷进程 encode/decode RTF 0.051/0.202,最大 RSS 40.3 MiB。decoder 的
30 个 lpcnet_arrays 原始 learned weights 合计 6,984,564 bytes,完整二进制 8,496,120 bytes,
两者均超过最终 ≤5 MiB 合同。fresh decoder 只凭 raw bitstream 字节级重放。机器摘要见
experiments/sota_smoke_lpcnet_native_v1.json。
2026-07-19 · MOSS-Audio-Tokenizer Nano 隔离环境与 full memory decision¶
Nano 使用独立 Python 3.11.12 / torch 2.7.0 / Transformers 5.0.0 CPU 环境,完整锁在
environments/moss-audio-tokenizer-nano-native-v1.txt。checkpoint 固定 HF revision
6aa02b01…,87,922,568-byte safetensors SHA-256 34d9880d…f67。运行时发现 checkpoint
自带的 configuration/modeling Python 与 GitHub 8c50ac4c… 并不相同;因此 adapter 另外固定
二者 SHA-256 b2d67dc4…b8aa / b14af7c1…930,连同 config 与 index 一起逐文件校验,设置
HF_HUB_OFFLINE=1 后才以 trust_remote_code=True 从本地加载。静态扫描未发现联网、子进程
执行或文件删除路径;唯一动态 import 是可选 flash_attn。
模型实测 21,969,664 参数、48 kHz 双声道、12.5 Hz、16 个 1024-entry RLFQ。arena mono 在 encoder 前复制为 stereo,decoder 后平均回 mono;payload 保存 10-bit token 和精确长度,不含 原音。8/8 final run 的表示均值 2013.67 bps,完整 payload 均值 3629.18 bps;CPU 冷进程 encode/decode RTF 0.960/0.855,最大 RSS 704,364,544 bytes,encoder/decoder path 各 46,074,880 bytes。MPS 对一秒 probe 生成完全相同 token,但冷 encode 为 5.01 s,对应 CPU 0.216 s,故正式选择 CPU。fresh decoder 重放字节级一致。
完整 v1/v2 未下载权重即用固定 config/index 和 meta tensors 核对:分别为 1.775B/2.124B 参数,
实际 tensor bytes 7.10/8.49 GB;checkpoint 文件略大于 tensor bytes是 safetensors header 开销。
两者按 24 GiB 单进程停止线都有权重层面的余量,但 activation/框架复制未知。裁决为:下一轮只
下载 v1,两 shard 校验后对最短句做 CPU 严格加载与 fresh decode;峰值超过 24 GiB 或出现系统
内存压力立即停止。v2 等待 v1 实测,不用 Nano 的小 RSS 作线性保证。机器摘要见
experiments/sota_smoke_moss_audio_tokenizer_nano_native_v1.json。
2026-07-20 · MOSS-Audio-Tokenizer full v1 单句 guarded probe¶
full v1 复用隔离 Python 3.11.12 / torch 2.7.0 / Transformers 5.0.0,独立锁见
environments/moss-audio-tokenizer-full-v1-native-v1.txt。HF revision 3cd226ba… 的两个 shard
分别为 4,998,259,168 / 2,100,202,560 bytes,重新计算 SHA-256 为 037f441e…f28 /
a187d73d…582,与 source audit 完全一致。该 checkpoint 的 configuration/modeling 文件与固定
GitHub 8c50ac4c… 逐字一致;config、index、代码和两个 shard 仍在每个进程加载前全部校验。
新 run_with_memory_guard.py 每 250 ms 统计目标进程及后代 RSS,超过 24 GiB 即终止整个进程组。
先用 20 MiB 限额运行 64 MiB 分配器,0.43 秒内以退出码 125 截停,证明 guard 不是事后报告。
真实 encoder/fresh decoder 峰值进程树 RSS 为 3,619,110,912 / 3,838,787,584 bytes,均未越线;
系统前后没有持续内存压力。RSS 低于 7,098,265,600 tensor bytes 是按需映射,只能作为该阶段
resident set,不能改写 shared model size。
最短英文句产生 32×41 code,10-bit 表示 4006.11 bps、完整 2,751-byte payload 为 6720 bps;
CPU 冷进程 encode/decode RTF 9.14/6.78。encoder 同时报告 audio_codes_lengths=40,但 40 帧只
能覆盖 76,800 个 24 kHz samples,小于原始 78,600;官方整句 decode 使用完整 code tensor。
adapter 因此保存 ceil(T/1920)=41 帧和精确原长,decoder 输出 78,720 后确定性裁掉 120 samples。
两次 fresh decoder 的 16 kHz WAV SHA-256 同为 ec49d8eb…395。
机器摘要见 experiments/sota_probe_moss_audio_tokenizer_full_v1_memory_v1.json。边界是单句 G2,
并非 8 句 G4;下一步在相同 guard 下跑完整中英/critical smoke,再单独处理 full v2。
2026-07-20 · MOSS-Audio-Tokenizer full v1 guarded G4¶
正式 runner 现用同一 run_with_memory_guard.py 包住每条 encoder 与 decoder,并把 limit、轮询
周期、两阶段进程树峰值和是否越线写入结果行;审计器对 full v1 缺失 guard、峰值越线或聚合
不一致均硬失败。冻结 3 英 + 3 中 + 2 critical 共 50.415 秒,8/8 保存真实 payload 并由 fresh
decoder 重建;decoder 日志不含原音路径,输出全部 finite 且与 header 精确样本数一致。
句均值表示/完整文件码率为 4027.34/5611.22 bps,encode/decode 冷进程 RTF 均值 5.55/4.49;
encoder/decoder 最大进程树 RSS 3,681,697,792/3,902,881,792 bytes,16 阶段均未触发
25,769,803,776-byte 停止线。运行前后系统 free-memory 为 34%/41%。中文否定 critical 的第三个
fresh decoder 输出 SHA-256 b04c300b…a83b,与正式输出字节一致。
机器摘要见 experiments/sota_smoke_moss_audio_tokenizer_full_v1_native_v1.json。G4 只封口
transport、独立解码、计账和资源资格;统一 ASR/实体、speaker、表达、听测和 streaming 仍待测。
该节点完成时的下一步是 full v2 最短单句 guarded probe;后续结果见下节。
2026-07-20 · MOSS-Audio-Tokenizer full v2 单句 guarded probe¶
固定 HF revision f6e20e54… 的 3 shard 共 8,495,058,856 bytes,SHA-256 全部匹配;4 个
config/index/remote-code Git blob 也进入 live 审计。v2 checkpoint remote code 与固定 GitHub
源码不同,正式执行身份因此两者并列记录。模型为 2,123,701,248 参数、8,494,804,992 tensor
bytes、48 kHz stereo、32×1024 RLFQ;权重 FP32,CPU compute 使用 bf16,FlashAttention 请求
在本机明确回落 SDPA。
首次严格加载暴露 remote from_pretrained 对 output_loading_info=True tuple 的处理 bug;adapter
改为直接调用同版本 Transformers 基类 loader,保留 missing/unexpected/mismatched/error 检查,
再显式执行 remote dtype finalization。第二次执行发现未补帧时只返回 40 个完整 code frames,会
丢最后 3,600 个 48 kHz samples。正式合同在 encoder 前把每声道补 240 samples 到 3,840 边界,
运输 41 帧与原长,decoder 确定性裁回 240 samples;表示仍为约 4 kbps,不采用错误的 8 kbps 推导。
成功 encoder/decode/replay 峰值进程树 RSS 为 4.29/3.51/3.81 GB;包含两个合同失败尝试的最高值
4.42 GB,均未触发 24 GiB guard。encode/decode RTF 14.75/14.49;输出精确 52,400 samples、
finite 且非静音,两次 fresh decoder SHA-256 同为 16cd7315…f835。机器摘要见
experiments/sota_probe_moss_audio_tokenizer_full_v2_memory_v1.json。下一节点为 v2 冻结 8 句 G4。
2026-07-20 · MOSS-Audio-Tokenizer full v2 guarded G4¶
相同固定 checkpoint、remote-code 身份、显式逐声道补帧和 base-loader workaround 扩展到冻结
3 英 + 3 中 + 2 critical。50.415 秒 8/8 成功,保存 634 个 32×T 10-bit RLFQ frames;
有限句长取整后的表示码率句均值/aggregate 为 4027.34/4024.19 bps,完整 payload 为
5991.76/5775.58 bps。所有输出精确等于 header 的 16 kHz sample count、finite 且非静音,
decoder 命令均不含原音路径。
16 个冷进程阶段的 encode/decode RTF 句均值为 13.37/13.15;encoder/decoder 最大进程树 RSS
4,121,952,256/3,852,681,216 bytes,均未触发 25,769,803,776-byte guard。运行前后系统
free-memory 为 34%/41%。中文否定 critical 再由第三个 fresh decoder 仅凭 payload 重放,
SHA-256 97ab45ed…9081 与正式 WAV 字节一致,重放峰值 RSS 3.02 GB。
机器摘要见 experiments/sota_smoke_moss_audio_tokenizer_full_v2_native_v1.json。这将 full v2
升级为 G4,但不证明 ASR/实体、speaker、表达、听测、stateful streaming 或质量 SOTA。
2026-07-20 · Quark HCodec 1.0 单句双流探针¶
官方源码固定 c4004e2…,codec 权重固定 71541fd…、582,195,700 bytes。源码审计发现
HCodecTokenizer 还会把 HF_ENDPOINT 强制改到第三方 mirror,并浮动下载
bosonai/hubert_base。因此正式 encoder 另行固定 HuBERT d7a7039… 的 1,375-byte config 与
377,510,632-byte safetensors;三文件 SHA-256 均在加载前重算。隔离环境使用 Python 3.10.10、
PyTorch 2.5.0、Transformers 4.49.0 与 vector-quantize-pytorch 1.22.15。
官方 python audio_tokenizer.py 因相对导入没有 package context 会立即失败;adapter 以显式
package identity 加载原始 vq 源码,并逐式复现官方 HuBERT hidden-state 混合与幅度压缩,不改
上游文件。另因仓库提交了 __pycache__,首次 source-clean guard 在推理前拒绝;修订后的合同
核对固定 HEAD 与所有非 pyc 跟踪文件,并把运行时 bytecode 重定向到隔离缓存。
成功 encoder 输出 acoustic/semantic 各 4×82 个 1024-entry code,原音补 80 samples;表示
2003.05 bps,820-byte packed tokens,完整 payload 1,796 bytes / 4387.18 bps。codec/HuBERT
tensor bytes 为 582,088,744/377,486,848;fresh decoder 只加载 codec。encode/decode RTF
5.28/2.43,最大进程树 RSS 1.56 GB。输出精确 52,400 samples、finite 且非静音;第二次 fresh
decode SHA-256 同为 0044bc7c…97f3。机器摘要见
experiments/sota_probe_quark_hcodec_1_0_native_v1.json;当前只是单句 G2,不是 G4 或质量结论。
2026-07-20 · Quark HCodec 1.0 冻结 8 句 G4¶
沿用完全相同的固定源码、codec、HuBERT、隔离环境和双流 payload 合同,正式 runner 完成
3 英 + 3 中 + 2 critical 共 50.415 秒。8/8 encoder 与 fresh decoder 成功;acoustic/semantic
始终各为 4×T,每流累计 1,264 frames。表示码率句均值/聚合值为 2006.10/2005.75 bps;
完整 payload 句均值/聚合值为 3397.51/3246.33 bps。
16 个冷进程阶段的 encode/decode RTF 句均值为 2.56/2.01;encoder/decoder 最大进程树 RSS
为 1,766,080,512/1,444,823,040 bytes,均未触发 25,769,803,776-byte guard。全部输出与 payload
声明的原始 sample 数精确一致、finite 且非静音。中文否定 critical 再由第三个 fresh decoder
仅凭 payload 重放,SHA-256 8dd05d5c…eeb6 与正式 WAV 字节一致,重放峰值 RSS 1.44 GB。
机器摘要见 experiments/sota_smoke_quark_hcodec_1_0_native_v1.json。这将 HCodec 1.0 升级为
G4,但不证明 ASR/实体、speaker、表达、听测、causal streaming、实时性或质量 SOTA;下一步是
HCodec 1.5 的 guarded 单句内存与 adaptive-payload 合同探针。
2026-07-20 · Quark HCodec 1.5 单句 adaptive-payload 探针¶
1.5 使用独立 .model-envs/quark_hcodec_v1_5/venv,Python 3.10.10 与 122 包精确冻结在
environments/quark-hcodec-1.5-native-v1.txt。源码固定 c4004e2… 及 HCodec-1.5 subtree
8588607…;2,747,714,452-byte codec 权重严格加载 1,293 keys、零 missing/unexpected。
官方 encoder 隐含浮动加载 facebook/wav2vec2-large-xlsr-53,现也固定 revision、config 与
1,269,737,156-byte 权重并完全离线加载。codec/Wav2Vec2 分别为 678,417,154/315,438,720 参数;
encoder tensor 合计 4.01 GB,fresh decoder 只加载 2.75 GB codec tensors。
官方固定手动阈值 0.6 将 82 个 25 Hz 基帧合并为 65 组,长度范围 1–6、均值 1.262。上游把
length-1 重复注入 4 acoustic + 4 semantic 的每个 composite index,且 decoder 会用 semantic
长度静默覆盖 acoustic 长度。adapter 因此交叉核验八份长度,传一个共享 3-bit length 和八个
10-bit codes:83 bits/group,共 5,395 bits / 1647.33 bps;上游重复长度口径另列 2064.12 bps,
不得混用。完整短文件 payload 1,956 bytes / 4778.02 bps,明确包含身份与 header 固定开销。
encode/decode/replay RTF 为 10.40/8.26/8.53,最大采样进程树 RSS 5,811,322,880 bytes,均未触发
25,769,803,776-byte guard。fresh decoder 命令不接收原音、不加载 Wav2Vec2;两次 52,400-sample
输出 SHA-256 同为 f74d82ba…06c3。机器摘要见
experiments/sota_probe_quark_hcodec_1_5_native_v1.json。该节点是单句 G2,只批准固定 0.6 阈值
的冻结 8 句 G4;不证明中英稳健性、内容/实体/身份/表达/听测质量、流式实时或 Pareto 优势。
2026-07-20 · Quark HCodec 1.5 冻结 8 句 G4¶
沿用单句探针完全相同的源码、codec、Wav2Vec2、122 包环境、固定阈值 0.6 和 83 bits/group
合同,正式 runner 完成 3 英 + 3 中 + 2 critical 共 50.415063 秒。8/8 encoder 与 fresh decoder
成功;1264 个 25 Hz 基帧合并为 808 组,group ratio 0.6392,长度均值 1.564。总直方图为
1:682, 2:36, 3:20, 4:15, 5:8, 6:10, 7:6, 8:31。
表示码率句均值/聚合值为 1363.37/1330.24 bps,完整 payload 为 3190.48/2959.43 bps;单句 表示范围 980.59–1773.27 bps,说明固定 threshold 不是固定码率。英文四句 aggregate 1528.15 bps、中文四句 1159.42 bps,但组内跨度也很大,不能从 4+4 句推断语言效应。相同基础帧下 HCodec 1.0 聚合 2005.75 bps,1.5 的表示低 33.68%;这不含任何质量等价证明。
16 个冷进程 encode/decode RTF 句均值为 5.85/5.21;最大进程树 RSS 5,911,412,736 bytes,均未
触发 25,769,803,776-byte guard。中文否定 critical 的第三个 fresh decoder 只凭 payload 重放,
SHA-256 a5ab0c04…04d1 与正式 WAV 字节一致。输出均 exact-length、finite、非静音;英文中句
有 1 个 PCM16 sample 到达负满幅,作为后续质量/clipping 检查项保留,不把它误记为 transport
失败,也不应忽略。
机器摘要见 experiments/sota_smoke_quark_hcodec_1_5_native_v1.json。HCodec 1.5 升为 G4,
但内容、关键实体、speaker、表达、听测、causal streaming、实时性与质量 Pareto 仍未验证。
2026-07-20 · BigCodec 单句真实 index payload 探针¶
源码固定 09845ab…、vq subtree 固定 3f28dcd…;checkpoint 固定 c654883…、
637,937,326 bytes。上游只写“Python 3.9”且 requirements 不固定版本,还漏列 inference.py
实际导入的 tqdm。第一次官方命令因此在模型加载前失败;补齐 tqdm 后,第二次在
encoder.eval().cuda() 明确失败,因为 Apple torch 无 CUDA。最终独立环境使用 Python 3.9.22、
PyTorch 2.5.0 CPU 与 35 个精确锁定包,不改上游源码文件。
官方 encoder 76,530,704 参数、decoder/quantizer 82,905,586 参数,总计 159,436,290;533 个 checkpoint state keys 严格加载,零 missing/unexpected。encoder+decoder tensors 637,752,072 bytes, fresh decoder 只加载 331,625,800 bytes。结构实测为一个 8192-entry、8-dim factorized codebook, hop 200 samples,因此原生表示为 80 fps × 13 bits = 1040 bps。
最短 3.275 秒句子恰有 52,400 samples,但上游 padding 表达式仍额外补 200 samples,产生 263
tokens;真实表示 3419 bits / 1043.97 bps,packed token body 428 bytes,完整 payload 1,317 bytes /
3217.10 bps。adapter 把 indices 送回上游 vq2emb,与 encoder 侧量化 embedding 最大绝对误差
2.38e-7。fresh decoder 裁掉 200 samples 后输出精确 52,400 samples;第二次 fresh replay
SHA-256 同为 5a4e495d…0400。encode/decode RTF 9.60/5.61,最大进程树 RSS 1.79 GB,全部未越
24 GiB guard。
机器摘要见 experiments/sota_probe_bigcodec_native_v1.json。这将 BigCodec 升为单句 G2 并批准
冻结 8 句 G4;不证明多句稳健性、内容/实体/speaker/表达/听测质量、CUDA 等价、流式或 Pareto。
2026-07-20 · BigCodec 冻结 8 句 guarded G4¶
相同 24 GiB 主动进程树 guard 下,3 英 + 3 中 + 英文数字 critical + 中文否定 critical 全部完成
独立 encoder→真实 .bigc→fresh decoder。4,039 个真实单码本 indices 共 52,507 representation
bits;按 50.415063 秒加权为 1041.49 bps(句均值 1041.66),完整自描述 payload 聚合为
2171.57 bps。前者与标称 1040 bps 的偏差来自上游固定补 1–200 samples、exact-hop 也多补完整
200 samples 的规则,两个口径均保留而不混写。
所有重建 WAV 均 exact original length、finite,encode/decode RTF 句均值 6.37/5.76。16 个正式
encoder/decoder 进程最大进程树 RSS 2,116,337,664 bytes,未触发 25,769,803,776-byte 停止线。
中文否定句的第三个 fresh decoder 仅接收 payload,输出 SHA-256
10357191…19af,与正式重建逐字节一致。机器摘要见
experiments/sota_smoke_bigcodec_native_v1.json。
BigCodec 因此升为 G4 并转入统一内容/质量指标与机制卡;该结果仍不证明 ASR/实体、speaker、 表达、听测、CUDA 等价、实时性或 Pareto 优势。未核实第二个官方 rate point,所以禁止用抽帧 或截断 codebook 人造 rate curve。下一执行项为 WavTokenizer small 40-token CPU native roundtrip。
2026-07-20 · WavTokenizer small 40-token 单句真实 code 探针¶
源码固定 5cf440d…,small speech checkpoint 固定 917d513…、1,589,082,492 bytes、SHA-256
d44c40fb…d004。建立 Python 3.9.22 / torch 2.0.0 / torchaudio 2.0.1 / NumPy 1.23.5 的
25 包隔离 runtime lock;官方 requirements 中 Lightning、fairseq、torchcrepe、PESQ、matplotlib、
Transformers 和 tensorboardX 属训练/评估路径,本次未安装,也不声称复现全量训练环境。
官方 from_pretrained0802 严格加载 80,913,988 参数、289 state keys,完整 inference state 为
340,459,156 tensor bytes;1.59 GB checkpoint 不能冒充实际 decoder 常驻权重。组件审计显示
public encode 至少使用 50,006,020 tensor bytes,public code decode 至少使用 272,037,644 bytes,
但官方 loader 当前在两个进程都物化完整 340.46 MB,剪枝值仅是未来部署下界而非已测包体。
最短句从 52,400 个 16 kHz samples 经官方 resampler 得到 78,600 个 24 kHz samples,输出 131
个真实 q4096 codes。12-bit 表示为 1572 bits / 480.00 bps,packed body 197 bytes;完整自描述
payload 为 1195 bytes / 2919.08 bps。codes_to_features 与 encoder 特征最大误差 0;fresh
decoder 输出精确 52,400 samples、finite,第三个 decoder 只凭 payload 重放,正式与 replay
SHA-256 均为 de0afa27…52db。
第一次正式 adapter 运行被结构断言正确拦下:YAML 写 downsample [6,5,5,4],而 pinned
SEANetEncoder 内部存储实际执行顺序 (4,5,5,6);乘积和 600-sample hop 不变。失败日志保留,
断言改为运行时身份后新 run-id 通过。成功 encode/decode/replay 的主动 guard 采样峰值 1.24 GB,
进程自身 ru_maxrss 最高 1.29 GB,均未触发 24 GiB 停止线。
机器摘要见 experiments/sota_probe_wavtokenizer_small_native_v1.json。这将 small 40-token 点升为
单句 G2,并批准冻结 8 句 G4;尚未验证 partial-hop trimming、中英文 critical 内容、听感、
speaker、表达、实时性或 Pareto。large 40/75-token 变体保持已审计未下载。
2026-07-20 · WavTokenizer small 40-token 冻结 8 句 G4¶
同一固定源码、checkpoint 和 25 包 runtime 在 24 GiB 主动 guard 下完成 3 英 + 3 中 + 2 critical。八句共 50.415063 秒、2,019 个真实 q4096 codes、24,228 representation bits; 句均值/聚合表示码率为 480.63/480.57 bps,完整自描述 payload 聚合为 1752.17 bps。有限句的 0–480 sample padding 解释了聚合值略高于渐近 480 bps,不是语言效应。
五句覆盖 partial-hop。odd-length 英文 critical 从 125,162 个 24 kHz samples 解码到 125,400,
裁掉 238 samples 后重采样,并在 16 kHz 校正 -1 sample,最终精确恢复 83,441 samples;第三个
fresh decoder 只接收 payload,输出与正式重建 SHA-256 同为 2e911947…cd3。encode/decode RTF
句均值 1.38/2.16,16 个正式进程的最大进程树 RSS 1,581,400,064 bytes,未触发
25,769,803,776-byte 停止线。
所有输出 exact-length、finite;两句中共检测到 3 个负满幅 PCM16 样本、无正满幅样本。这不
影响 payload、计账或确定性重放的 G4 结论,但必须作为后续统一质量指标的削波检查,不能把 G4
写成质量 SOTA。机器摘要见 experiments/sota_smoke_wavtokenizer_small_native_v1.json。small
先进入统一指标;下一执行 gate 为 large unified 40-token guarded 单句真实 code 探针,large
speech 75-token 随后作为独立系统验证。
最终独立重算还发现:manifest 为显示而保留的六位小数把 odd-length 句的 5.2150625 秒写作
5.215063 秒,旧 runner 曾把显示值误作码率/RTF 分母。runner 与 auditor 已统一改用真实
num_samples / sample_rate_hz,并保留历史结果 fallback;该修正只改变约 0.000046 bps 的末位,
不改变上述两位小数结论,但封住了未来短音频上的系统性计账误差。
2026-07-20 · WavTokenizer large unified 40-token 单句真实 code 探针¶
从 novateur/WavTokenizer-large-unify-40token 固定 revision 7dc47a9… 下载唯一 checkpoint;
1,759,224,573 bytes 与 SHA-256 72182c1b…8205 均匹配 source audit。仓库只含权重和 429-byte
README,没有 large config。checkpoint 的 1,091 个完整训练 state keys / 847,735,396 tensor
bytes 包含 discriminator 等训练状态;metadata 的 resume_config 记录 75-token 训练 lineage,
而 resume_model 名称指向 40-token 训练。这些训练机 lineage 字符串不作为推理身份依据。
以固定源码中的 40-token YAML 调用官方 from_pretrained0802,推理子网严格加载且无
missing/unexpected keys:80,913,988 参数、289 state keys、340,459,156 tensor bytes;运行时
encoder ratios (4,5,5,6)、40 fps、单 q4096、decoder hop 600。它与 small 的已观察推理结构和
规模一致,差异在 checkpoint 权重与作者报告的约 8 万小时 speech/audio/music 训练覆盖。因此
这是相同 token rate 的 SOTA-first 对照,不是参数量、结构或训练数据的受控因果消融。
复用同一 25 包 Python 3.9.22 / torch 2.0.0 隔离环境,最短 3.275 秒句产生 131 个真实 codes;
12-bit 表示 1572 bits / 480.00 bps,packed body 197 bytes,完整自描述 payload 1224 bytes /
2989.92 bps。相对 small 多出的 29 payload bytes 来自更长 checkpoint/variant 身份,不是表示
码率增加。codes_to_features 误差为 0,输出精确 52,400 samples、finite、无满幅样本。
encode/decode RTF 为 2.59/3.56,正式阶段最大进程树 RSS 1,241,841,664 bytes。第三个 fresh
decoder 只接收 payload,输出与正式重建 SHA-256 同为 d51d814e…45e2;重放 guard 峰值
1,223,983,104 bytes。与 small 同句比较,large 的 131 个 token 在 131 个位置全部不同,但这只
证明权重产生不同表示,不证明质量更高。机器摘要见
experiments/sota_probe_wavtokenizer_large_unified_native_v1.json;下一 gate 为冻结 8 句 G4。
2026-07-20 · WavTokenizer large unified 40-token 冻结 8 句 G4¶
相同固定源码、checkpoint、25 包 runtime 和 24 GiB guard 在 3 英 + 3 中 + 2 critical 上完成
8/8 encoder→真实 .wvt→fresh decoder。50.4150625 秒共 2,019 个 q4096 codes、24,228
representation bits;句均值/聚合表示码率 480.63/480.57 bps,完整 payload 聚合 1788.99 bps。
token body 与 small 逐句完全同长;large 每文件多 29 bytes,仅来自更长的 checkpoint/variant
身份字符串,因此不能把 header 差异当编码开销能力差异。
五句覆盖 0–480 个 24 kHz partial-hop padding。odd-length 英文 critical 的 125,162 samples
解码到 125,400,裁掉 238 后重采样并校正 -1 个 16 kHz sample,最终精确恢复 83,441 samples;
第三次 source-blind decoder 输出与正式重建 SHA-256 同为 777e6af6…ae34。encode/decode RTF
句均值 1.46/2.17,正式 16 个进程最大进程树 RSS 1,549,893,632 bytes,未触发停止线。
所有输出 exact-length、finite,8 句无正负满幅 PCM16 样本。small 同集合有 3 个负满幅样本,
因此“削波计数”作为后续共同质量指标预注册;它不是单独的胜负裁判。两个 checkpoint 在全部
2,019 个对应 token 位置上零相同,同时推理 shape 与表示 bit 数相同,这证明 code identity/权重
行为不同,但 codebook 可能存在置换,不能从 token ID 距离推导声学质量。机器摘要见
experiments/sota_smoke_wavtokenizer_large_unified_native_v1.json。下一 gate 为 large speech
75-token guarded 单句探针。