英文题目:Trigger Sound Suppression for Misophonia

标签:#音频分离 | #时频分析 | #数据集 | #流式处理 | #医疗音频

评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Vaishnavi Vidyasagar:机构信息未在 arXiv HTML 中可靠披露
  • Jasmine Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Mahima Uliyar:机构信息未在 arXiv HTML 中可靠披露
  • Seunghyun Oh:机构信息未在 arXiv HTML 中可靠披露
  • Emily Catherine Gates:机构信息未在 arXiv HTML 中可靠披露
  • Mark Zachary Rosenthal:机构信息未在 arXiv HTML 中可靠披露
  • Shyamnath Gollakota:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

误音症患者对咀嚼等特定触发声高度不耐受,现有耳塞与降噪会连带抹除对话等有用声音,难点在于低延迟下只去除用户指定的触发成分并完整保留残余声场景。本文先经双人校验构建覆盖10类口腔鼻腔触发声的13356条干净片段数据集,再用头相关脉冲响应在线合成双耳混合训练样本,随后由流式双路径网络在查询向量控制下直接估计残余信号,最后在误音症人群中检验主观痛苦是否缓解。与通用目标声音提取相比,关键差异是将任务定义为查询条件下的残余声重建而非目标声提取,并与降噪加回灌架构对齐以容忍10 ms级算法延迟。在咀嚼触发混合的听音评测中模型输出相对原始音频使主观痛苦下降2.37点,单触发查询下残余声改善达19.86 dB SI-SNRi。该结论目前仅在合成双耳混合与咀嚼单类离线听音验证下成立,对更弱触发、多触发并发与真实房间混响的外推尚未验证。原文披露了Orange Pi 5B上的分块处理耗时,训练算力与总时长未披露。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

误音症为什么需要选择性抑制而不是全部静音?

输入是日常声景中反复出现的特定触发音,目标是让误音症患者能继续参与对话而不被触发音淹没,必须保留的信息是触发音之外的语音、环境提示音和社交声音,输出是去掉用户指定触发类后的残差声景。论文交代的背景是,误音症表现为对咀嚼、咂嘴、吸鼻等口鼻音的强烈情绪与生理反应,可导致社交回避与功能受损,而耳塞与主动降噪是把所有声音一起压掉,白色噪声掩蔽则易引起听觉疲劳。

对于刚进入音频领域的研究生,关键学习依赖是先分清抑制与提取的方向:提取是把目标拿出来听,抑制是把目标拿掉后听剩下的。本文只研究后者,且成功标准不是分贝数本身,而是患者报告的困扰是否下降。论文把 10 类常见触发列为咀嚼、咳嗽、饮水吞咽、嚼口香糖爆裂音、重呼吸、咂嘴、喷嚏、吸鼻、敲击、清嗓,并强调现有语料对这些类覆盖不全、标签多为弱标签且常与其他声音共存,因此需要自建可训练分离模型的孤立录音集合。

已有路线在输入目标与验证方式上有何不同?

同输入的工作是目标声音提取,它用类别标签、注册音频或文本作线索从混合声中分离目标,近年已做到低功耗硬件上的流式分离,但论文指出这些系统多评估警笛、鸟鸣、语音、音乐等通用类,没有在误音症触发类上验证。同目标的工作是误音症治疗与听力学策略,代表性人群研究估计患病率约 5-20%,一项心理治疗随机对照试验仅 37% 患者有临床改善,尚无药物治疗,耳内噪声发生器与掩蔽只能提供部分且非选择性缓解。

同运行阶段的工作是实时助听约束,超过 20-30 毫秒的延迟可被感知,已有工作用流式模型、低延迟短时傅里叶变换与端侧加速器,但未评估触发类,也多评估音质而非困扰。本文的对照点是有源的:输入同样是混合声,目标同样是实时处理,但监督与验证不同,本文用触发类查询作监督,用每类分离指标加患者困扰评分作验证。学习时不要把类别差异当成同条件胜负,例如通用环境音上好的模型不能直接推定在咀嚼与吞咽这类宽带低能量瞬态上也好。

任务的形式化输入与期望输出是什么?

论文把双耳场景记为左右 2 通道的混合信号,每个声源带有标签,标签为零代表非触发源,大于等于 1 代表某种触发类。用户通过多热查询向量说明哪些触发类让自己困扰,该向量长度等于触发类别数,某 1 位为 1 即表示要抑制该类。给定查询后,场景被分解为触发分量与残差分量,触发分量是所有标签属于查询集合的声源之和,残差是混合减去触发分量。期望输出是通道平均后的残差信号,也就是完整场景减去被查询触发音。

举例来说,若查询只选中咀嚼,系统要做的是从包含餐厅背景加咀嚼的 5 秒混合中去掉咀嚼事件,保留背景人声与环境声,而不是输出咀嚼本身。这个例子只是帮助理解方向,论文实际训练与评估用的是随机位置、随机触发背景比的合成双耳混合。形式化把问题从降噪改为条件减法,后续网络、损失与指标都围绕残差的估计误差展开。

从混合波形到残差波形的全景经过哪些步骤?

沿一个样本走完流程有助于建立依赖关系。输入是双耳混合波形与多热查询向量,表示是对 2 通道做短时傅里叶变换并堆叠实部与虚部,再经因果卷积映射到隐通道。组件是堆叠的流式 TF-GridNet 块,每块包含沿频率的谱阶段与沿时间的时序阶段,查询在每块输入处注入。目标是直接估计残差的频谱,再经因果转置卷积与逆变换回到时域波形。训练时用合成混合的已知残差作监督,推理时用同样的分块状态处理方式逐块输出。

论文探索两类模型:一是在全部触发类上的单触发多分类模型,训练与测试时查询集合大小为 1;二是多触发多热查询模型,训练与测试要处理 1-3 个触发的任意组合。对比基线是同数据集上训练的时域目标提取模型 Waveformer,论文报告自家模型在 3 种触发数量条件下都优于该基线。整体延迟预算由分帧的前视与块长决定,默认配置给出 10 毫秒算法延迟,并在 Orange Pi 设备上实时运行。

流式双路径块与查询注入如何分工?

白话来说,双路径是指一个路径看同一时刻不同频率之间的关系,另一个路径看同一频率不同时刻的演变。英文名是 TF-GridNet,T 代表时间,F 代表频率,Grid 代表在这张时频格子上交替建模。残差谱阶段用沿频率的双向长短时记忆网络捕捉谐波与共振结构,残差时序阶段用沿时间单向长短时记忆网络保证流式因果,即输出不依赖未来超出前视范围的样本。多热查询的英文是 multi-hot query,特征线性调制的英文是 FiLM。查询注入的做法是用两个线性层把查询向量映射为每通道的缩放与偏置,作用在每块输入的隐通道上,相当于告诉每一层当前要压掉哪几类。

目标声音提取 × 触发音抑制: 目标声音提取负责按类别线索从混合声中取出目标成分,触发音抑制则反用该能力,分工是前者定位查询类触发成分,后者输出全场景减去该成分后的残差,搭配理由是误音症需要保留对话与环境音,组合意义是把提取变成可查询的减法操作。

论文的分解公式把这种减法写清楚,符号含义是 t 为查询触发分量,r 为残差,x 为混合,s 为各声源,Q 为查询集合,n 为采样点。计算目标是给定查询后估计 r,而不是估计 t 后再相减的间接路线,原文实现是网络直接输出残差谱。

\[\mathbf{t}_{\mathbf{q}}[n]=\!\!\sum_{i\,:\,\ell_{i}\in\mathcal{Q}}\!\!\mathbf{s}_{i}[n],\qquad\mathbf{r}_{\mathbf{q}}[n]=\mathbf{x}[n]-\mathbf{t}_{\mathbf{q}}[n].\]

该公式只定义目标,不包含网络参数与优化步骤,梯度路径与损失在训练节另行说明。

多热查询 × 特征线性调制: 多热查询负责说明用户当前对哪些触发类不耐受,特征线性调制负责把该向量映射为每层通道的缩放与偏置,分工是一个给条件、一个执行条件,搭配理由是同一模型要处理 1-3 类的任意组合,组合意义是无需为每种组合训练独立模型即可切换抑制目标。

分帧的前视与回看如何决定延迟与因果性?

白话来说,短时傅里叶变换分帧就是每次取一小段波形做频谱,当前块是必须输出的最新样本,回看是已经见过的过去样本,前视是为提高质量而多等的未来样本。英文分别是 current chunk、lookback、lookahead,算法延迟的英文是 algorithmic latency。论文沿用低延迟综合窗的做法,合成窗在前面的回看部分置零,在剩余的当前块加前视部分求解重构,因此算法延迟等于当前块加前视除以采样率。默认取 6/6/4 毫秒,即当前块 6 毫秒、回看 6 毫秒、前视 4 毫秒,在 16 千赫采样率下对应 256 个采样点的量级,算法延迟为 10 毫秒。消融中保持三者之和 16 毫秒使傅里叶长度固定,只改变配比,例如 4/12/0 表示不要前视从而完全因果,但质量会下降。

短时傅里叶变换分帧 × 算法延迟: 短时傅里叶变换分帧负责把当前块与回看和前视样本拼成一帧做频域分离,算法延迟负责度量必须等待前视才能输出的时间,分工是一个定计算窗口、一个定可听延迟,搭配理由是助听设备对延迟敏感,组合意义是通过调整当前块、回看与前视的配比在质量与延迟之间取舍。

实际处理时间取决于硬件,论文报告在 Orange Pi 5B 上每 6 毫秒块平均处理 5.22 毫秒、95 分位 5.41 毫秒,说明该配置在该设备上能跟上实时节拍,但这只是特定硬件的测量,不能推广为所有助听形态的延迟。原文未报告在助听专用加速器上的功耗与帧率,复现时应把算法延迟与设备处理时间分开记录。

混合如何合成、损失如何计算、参数如何更新?

训练的真实计算过程是全监督的合成混合训练,不是无训练的检索或规则。构造上,每条 5 秒样本抽 1-3 个不同类的触发事件加一个背景源,每个声源用 CIPIC 头相关脉冲响应卷积成双耳信号,方向在 1250 个测量位置中均匀抽取,触发片段随机摆位或裁剪,不足 5 秒则补零并在前后随机留静音,触发与背景比在 0-15 分贝内抽取,聚焦触发至少与背景一样响的区间,更安静的触发留作未来工作。

采样上,触发类先均匀抽取不重复,再在类内均匀抽片段,避免按片段数偏向大类,近静音片段会被重采样。优化上,单触发多分类模型每轮 30,000 条、每类 31,000 条训练 100 轮,多触发模型从最优单触发检查点微调 50 轮,每次混合的触发数在 1、2、3 中均匀抽取。优化器用 AdamW,初始学习率 1x10^{-4},无权重衰减,每秩批量 2,梯度裁剪范数为 1,若验证信噪比改善量 5 轮不提升则学习率减半并选验证最优检查点。

损失是多分辨率短时傅里叶变换损失加 10 倍 L1 损失减 0.1 倍信噪比项,符号中 s 为真值残差,s 帽为预测残差,原文未给出多分辨率的具体窗参数与信噪比项是否截断,复现时需以公开代码为准。

\[\mathcal{L}=\mathcal{L}_{\mathrm{MRSTFT}}(\hat{s},s)+\lambda_{1}\,\lVert\hat{s}-s\rVert_{1}-\lambda_{\mathrm{snr}}\,\mathrm{SNR}(\hat{s},s)\]

下表把可复现的训练与推理配置收拢为一行一事实,表前问题是哪些量是原文明确给出的冻结配置、哪些是更新策略,公平条件是同为本文默认 10 毫秒系统的设置,指标方向是延迟越低越好、吞吐需跟上块长。

环节关键参数取值条件说明作用
网络GridNet 层数与隐维度six GridNet layers and a 32-dimensional latent spaceOrangePi 配置定模型容量
延迟算法延迟与分块10 ms (6 ms chunk plus 4 ms lookahead)默认推理定实时预算
优化优化器与学习率AdamW with an initial learning rate of 1x10^{-4}no weight decay定更新起点
批与裁剪批量与梯度范数a batch size of 2 per rank, and gradient clipping with the norm set to 1分布训练定更新稳定
轮与量单触发训练量100 epochs with 30,000 samples per epoch (3,000 samples per trigger class)每类均衡定类覆盖

表后解释是,该表的主要收益是给出可直接照抄的起点:6 层 32 维加 10 毫秒分帧是论文验证过可在 Orange Pi 上实时的容量,代价是批量很小且依赖验证集选点,未胜出项是原文未报告权重衰减与学习率之外的正则细节,若复现不稳定应先检查分块训练与推理状态一致,而不是先调大模型。原文明确说训练与推理用相同分块模式以匹配状态处理,这是流式复现最易遗漏的一步。

数据从哪来、如何划分、用什么指标与硬件?

数据来源是人工筛选而非直接拿弱标签训练。候选来自 FSD50K、ESC-50、Freesound 标签、CoughVID、MATA、VocalSound、Deeply 非言语发声集与 YouTube 元数据,2 名标注者确认类别并确保触发孤立无背景噪声,最终得到跨 10 类的干净触发片段与背景片段,背景含非触发环境家居音、TAU 城市声景、语音与音乐,纳入语音音乐是因为它们与口腔触发在频谱上重叠。划分按触发与背景各自 80/10/10% 切分训练验证测试且无重叠,评估与测试混合用固定索引种子生成以保证可重现。

指标是残差域的信噪比改善量与尺度不变信噪比改善量,前者对幅度缩放敏感,后者允许最优缩放,论文用两者差距判断幅度是否保真。听感评估用 10 点困扰量表与自评人体模型的效价唤醒度量表,均为越低或越高各有方向,不能把自动指标当成人评。硬件是 Orange Pi 5B 的 Arm Cortex-A76,报告处理时间而非助听芯片功耗。

数据部分数量来源说明划分方式用途
干净触发13,356 clean trigger clips across 10 classes人工确认孤立80/10/10% into train/val/test with no overlap训练分离
背景总量26,742 background clips含环境与城市声景80/10/10% into train/val/test with no overlap合成混合
真实背景5,142 real recordings非触发类录音80/10/10% into train/val/test with no overlap保真背景
城市声景21,600 TAU urban scene clips from environments such as restaurants, classrooms, and transportationTAU 2024 移动评估仅取 10 秒片段过滤覆盖社交场景
受试样本mean DMQ Impairment of 31.3 (SD 6.0, median 32) out of a possible 4830 名咀嚼困扰者ten random audio samples, each 5 seconds in length人评验证

表后解释是,该表的收益是明确数据规模与划分口径,代价是多数触发仍是近麦克风网音,混响房间与助听麦克风的实录缺失,论文在局限中承认这是仿真与真实使用的差距。未评测边界是触发比背景更安静的区间被明确留到未来工作,因此当前结论只支持触发至少与背景一样响的 regime,不能推广到微弱触发。

抑制后困扰真的下降了吗?波形与量表说了什么?

测的是咀嚼混合经多触发模型处理后的感受变化,与谁比是同一批测试源片段的原始版与模型输出版,条件一致在单声道、随机顺序、受试不知哪段经过处理,并提供放松重置减少情绪 carryover。指标方向是困扰与唤醒度越低越好,效价越高越好。关键数字是困扰降 2.37 点、唤醒度降 2.13 点、效价升 1.59 点,三者配对 t 检验均 p 小于 0.001,效应量 d 约 0.97、1.03 与负 1.10。支持的判断是抑制改变了更宽的情绪反应而非单一量表抖动,限制是抑制后困扰仍高于地板值,论文解释为背景中可能还有餐具、打字等个体特有触发,且 2 名非受试者确认输出中听不到咀嚼,说明下降确来自去掉咀嚼。

主观困扰 × 效价与唤醒度: 主观困扰负责直接记录听到咀嚼混合音后的不适强度,效价与唤醒度负责记录情绪的正负方向与激活强度,分工是一个测临床相关的主诉、一个测更宽的情绪反应,搭配理由是分贝改善不等于感受改善,组合意义是用三个一致变化的量表交叉验证抑制是否改变了整体情绪反应。

下表把人评的核心数字收拢,表前问题是在受试偏向较重症状时改善是否稳定,公平条件是同受试配对比较,指标方向已如上。

测量变化量t 值d 值统计结论
困扰Distress fell by 2.37 points (t(29)=5.30, p<.001, d=0.97)t(29)=5.30d=0.97p<.001
唤醒度arousal by 2.13 points (t(29)=5.62, p<.001, d=1.03)t(29)=5.62d=1.03p<.001
效价valence rose by 1.59 points (t(29)=-6.03, p<.001, d=-1.10)t(29)=-6.03d=-1.10p<.001
样本mean DMQ Impairment of 31.3 (SD 6.0, median 32) out of a possible 48N=30ten random audio samples, each 5 seconds in length中重度偏重
意愿兴趣与影响约 8 分段8.73/10 类高分跨学业家庭社交约 8/10待验证的意愿非疗效

表后解释是,主要收益是三项指标同向改善且效应量大,代价是样本是招募的咀嚼困扰且 DMQ 偏高的人群,不能推广到所有触发与轻症,未胜出项是背景中未建模的触发未被去除,这反而成为反证,说明若要地板级缓解还需扩大触发覆盖。自动指标上论文报告吸鼻 16.91 分贝与喷嚏 16.47 分贝最易分,饮水 10.73 分贝与咀嚼 11.88 分贝最难,且每类残差两指标差距在 1.30 分贝内,支持幅度基本保真。

下面先导读图 1:该图是单样本的时域波形三行对比,横轴是 0-5 秒时间,纵轴是幅度,教学价值在于直观看到脉冲触发被去掉而背景连续性被保留。

看图路径: 1. 先看最上一行输入混合波形中孤立的高幅脉冲位置;2. 再对比中间真值行是否已看不到这些脉冲而只剩连续背景;3. 最后检查最下一行模型输出的包络与真值是否同量级连续;4. 注意上下两行纵轴量级差异约十倍不要误读为波形消失

原论文 Figure 1:Time-domain waveforms for gum popping suppression: input mixture, ground truth, and model output.

论文图 1。原论文 Figure 1::“Time-domain waveforms for gum popping suppression: input mixture, ground truth, and model output.”。

对可见内容的解释是,第一行输入混合在约 1 秒、2.2 秒、4 秒与 4.5 秒处可见孤立高幅脉冲,对应嚼口香糖爆裂音叠加在低幅连续背景上;第二行真值已看不到这些脉冲,只剩全程连续的低幅背景;第三行模型输出同样没有高幅脉冲且包络与真值相近,支持模型恢复了残差的时域包络与细结构。需注意纵轴量级不同,输入行约正负 0.025,真值与输出行约正负 0.0025,不能因视觉高度不同误判背景被放大或压缩,论文也称输出幅度正确保留了非触发音。

残差信号 × 信噪比改善量: 残差信号负责定义期望输出即全场景减去被查询触发成分,信噪比改善量负责度量估计残差相对混合输入接近真值的程度,分工是一个定目标、一个定偏离目标的减少量,搭配理由是选择性抑制不能只看触发去掉了多少,还要看背景是否被保留,组合意义是用残差域指标同时约束去除与保留。

去掉前视与增加触发数会付出什么代价?

测的是同一多触发模型在不同分帧预算与不同并发触发数下的表现,比较条件是保持傅里叶总长 16 毫秒只改当前块回看前视配比,以及用同参数量模型压 1-3 类触发。指标方向是信噪比改善量与尺度不变改善量越高越好,延迟越低越好。关键数字是完全因果的 4/12/0 在 4 毫秒延迟下相对 8/4/4 损失 3.70 分贝 SNRi 与 4.21 分贝 SI-SNRi,说明前视对质量贡献明显。另 1 维是触发数越多改善量越降,因为同容量要压任意组合的 1-3 类。支持的判断是默认 6/6/4 的 10 毫秒是在质量与延迟间的折中,限制是该消融只报单触发查询条件,未给出多触发查询下的延迟质量曲线。

配置算法延迟SNRi 代价SI-SNRi 代价总长与因果性
4/12/0 vs 8/4/44 ms latencycosts 3.70 dB SNRi4.21 dB SI-SNRikeeping their sum constant at 16 ms so the STFT length remains fixed
完全因果4 ms latencycosts 3.70 dB SNRi4.21 dB SI-SNRiyields a fully causal model at 4 ms latency
易分触发Sniffling (16.91 dB)Sneezing (16.47 dB)脉冲谱 distinctbroadband low-energy transients overlap more heavily with background speech
难分触发Drinking (10.73 dB)Chewing (11.88 dB)宽带低能量overlap more heavily with background speech and ambient noise
趋势触发数越多改善越降同参数量压 1-3 类任意组合未给出逐数组合表

表后解释是,主要收益是给出可部署的因果选项:若必须零前视,可用 4 毫秒完全因果模型但要接受约 3-4 分贝损失;若能容忍 10-12 毫秒,则保留前视更划算。代价与反例是难分触发恰是临床最常见的咀嚼与吞咽,它们的宽带低能量瞬态与语音环境音重叠最多,因此平均指标好看不等于主诉场景好过,未评测边界还包括混响与助听麦克风下的衰减,论文把这部分留作未来工作。

哪些结论不能从现有证据推出?

论文直接报告的是合成双耳混合上的残差指标与在线单声道听评改善,有限解释是 10 毫秒算法延迟落在先前深学习助听架构允许的范围内,方法是先用主动降噪压掉全场景再回注处理后声音,但本文未实测该端到端链路。未验证推测是把实验室改善等同于日常佩戴疗效,原文明确列出三项缺口:在位混响房间与助听麦克风实录缺失、触发覆盖仅 10 类且个体触发可超出此表、模型只输出单声道平均残差而非双耳信号。

相关性不是因果,例如兴趣 8.73/10 与失去后影响 8.63/10 是意愿调查,不能当成症状治愈率。缺失证据不是技术错误,例如未测量误判率、长期佩戴疲劳与算力功耗,就不应承诺这些量得到改善。总体趋势不等于每组都成立,例如触发数增加时平均改善下降,但具体哪两类组合最难,原文未逐项报告,复述时不要编造组合排名。

要复现应先固定哪些信息条件与检查点?

复现先做三件事。第一固定数据与种子:按 80/10/10% 无重叠划分触发与背景,用固定索引种子生成评估与测试混合,触发类先均匀抽不重复再类内均匀抽片段,5 秒窗随机摆位,触发背景比 0-15 分贝,只复现触发不弱于背景的区间。第二固定模型与状态:用 6 层 32 维的 Orange Pi 配置,6/6/4 毫秒分帧,查询经 FiLM 注入每块,训练与推理用相同分块模式,先训单触发 100 轮每轮 30,000 条再微调多触发 50 轮,损失权重为多分辨率谱损失加 10 倍 L1 减 0.1 倍信噪比,学习率 1x10^{-4}无权重衰减,批量每秩 2,梯度裁剪 1,验证 SNRi 5 轮不升则减半。

第三固定评估口径:残差域同时报 SNRi 与 SI-SNRi 并看差距是否在 1.30 分贝内,人评用同受试配对、5 秒单声道随机盲听、困扰唤醒效价三量表。资源状态是本次未能确认可达:原文写代码模型数据将开源,但本次没有来源绑定且完成 HTTPS 验证的资源,不得声称已公开或可下载,应以原文仓库占位与后续版本为准。部署到助听形态还需按先前工作思路优化到 AI 加速器并补双耳输出与真人佩戴评估。

何时值得尝试这种选择性抑制?

当用户的主诉集中在咀嚼等少数可枚举触发、且需要保留对话与环境音时,值得尝试按查询做减法的路线,而不是全静音或掩蔽。复现优先级是先在 10 毫秒默认配置上验证难分触发的残差保真,再测 4 毫秒完全因果的可接受损失,最后才扩触发类与实录混响。还需补的验证是双耳保留、误判导致有用音被吞的代价、以及长期佩戴的困扰复发率。本文的判断是,流式查询抑制在受控合成与在线听评中显示了可复述的去除与保留能力,可能作为现有治疗的互补手段,但待验证的是真实声学链路与更广触发谱下的稳定性,初学者应把分贝改善与情绪改善分开记录,避免用前者证明后者。

📎 论文与评分元数据

排名:前50% | 文档类型:应用研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-30 语音/音乐/音频论文速递