Listening Protocol v1(规格;最小实现待完成)¶
来源:2026-07-19 外部评审对 125 票 pilot 的分析。v0 页面(整体偏好 AB)已完成其 pilot 使命,正式听测按本规格执行。官方来源已核实: ITU-T P.808 用于众包听测的训练、环境、 设备、可靠性筛选与统计;ITU-T P.835 说明不同 感知构念应分开评分。它们提供方法纪律,不等于直接定义了 EvoSpeech 的四维任务。
当前实现状态:97c053d 已取消每票后的自动揭晓,但 blind AB 与带 codec 名称的
sighted table 仍在同一 HTML,系统名也仍存在页面数据中。因此当前只能称为
默认不揭晓的 v0.1;完成下面的页面物理分离和日志字段后,才称 v1。
v0 的四个已确认缺口(修复动机)¶
- 每票后揭晓系统名 → 听者会学会各 codec 的“声纹签名”(已取消自动揭晓;页面物理分离待完成)
- 无原音参考 → "更自然"≠"更像原说话人/更忠实原语气"
- 分析器丢弃 tie → 无法学习指标的 JND 阈值,而预测 tie 对进化系统可能比预测胜负更重要
- 无播放时长记录 → 中位投票间隔 8.5s < 完整听 A+B 所需 ~12s,部分判断基于片段
四维分任务设计(不是每对连答四题——防光环效应与疲劳)¶
| 维度 | 任务形式 | 校准的代理指标 |
|---|---|---|
| 内容 | 听写/选择数字、金额、姓名、否定关系(不问"哪个好") | ΔER、实体准确率 |
| 身份 | 给同说话人原音参考,选 A/B 谁更像 | speaker embedding |
| 表达 | 播原句参考,判断谁更保留重音/节奏/语气 | F0、voicing、时长 |
| 总体 | 现有 A/B/tie | PESQ/STOI/mel |
原则:每个代理指标只能用对应的人类维度校准。spk-sim 与总体听感 96% 一致 不能证明它测的是身份——可能只是跟整体音质共变。内容是硬 veto,自然度不能补偿。
试次设计¶
- A/B 位置严格平衡;15–20% 的关键题在间隔 ≥10 题后换序重复(位置效应估计 来自预先设计,不是看到异常再选择性复测)
- 混入已知质量锚点(高/低)与测谎题
- 记录:A/B 实际播放秒数、重播次数、耳机/环境声明、置信度(可选)
- 探索轮与预注册确认轮分开保存,预注册轮先写假设再听
v1 页面与数据最低合同¶
listen_blind.html不生成 sighted table,不在可见文本中出现 codec 名;音频资源使用 session 内的 opaque condition ID。condition→codec 映射单独保存,session 结束后才供分析器读取。listen_diagnostic.html才允许 reference、codec 名、指标和全系统表格;不得与正式票写入同一 localStorage key。- 每票保存字段:
session_id / task_id / dimension / utt / condition_a / condition_b / position_seed / vote / confidence / played_ms_a / played_ms_b / replay_a / replay_b / ts。 skip必须记录原因或至少记录 skip 事件,不能静默换题;同一task_id不得因连续点击重复入账。- 页面只负责收集,不在浏览器中计算“谁赢”;原始导出不可手改,清洗规则版本化。
分析规则¶
- tie 不丢弃:用于估计每个指标的 JND 阈值
- 按听者和句子聚类 bootstrap 报置信区间;同一听者的 N 票不是 N 个独立样本
- 位置效应单独报告
- 代理指标须在未参与校准的句子与 codec 家族上验证
best metric agreement不能只在明显跨家族题上计算;必须单列 near-frontier/focus 子集- 旧 v0 去重规则(3 秒内同任务连击)必须进入分析代码和测试,不能只写在账本中
执行计划¶
- 实现 v1 页面与日志字段 → 用 20–30 道英文题验证协议本身(不再堆同格式英文票)
- 主要人工预算转中文 private-critical:内容听写(数字/金额/验证码/否定)+ 多说话人身份 + 语气句表达
- 德/法/西/日/韩的内容与语言特有表达(pitch accent、连音)必须母语者;非母语者只能判爆音/水声/机械感
- 对外结论必须:多听者、分维度、正式协议、预注册
预算上限¶
- 内循环:100% 自动指标,不调用人耳;
- 周期校准:每次 evaluator/codec 家族发生实质变化后,做 20–30 题单听者协议检查;
- 候选晋级:只对 Pareto 前沿少数候选做四维中的相关任务,不要求每对连答四维;
- 对外结论:另立多听者预注册实验,不从内部 pilot 票数“累积升级”。
这套上限保证四维不会变成无限人工成本,同时保留“每个代理指标只能由对应人类构念校准”的纪律。