研究条目

Ontology-based Target Sound Extraction

📄 从“只会抽叶子”到“整棵树都能点名”:用本体距离重塑目标声音提取的条件空间 英文题目:Ontology-based Target Sound Extraction 一句话:为解决固定叶粒度提取无法响应粗粒度查询的问题,论文在 AudioSet 三层本体上对比多热与全本体独热两种条件化并用 CPCC 损失对齐嵌入欧氏距离与树最短路径,使单次前向在根、中间、叶三级分别达到 6.43/6.66/7.10 dB SI-SNRi,但代价是完全合成数据与单一本体限制了真实泛化验证。 标签:#音频分离 | #对比学习 | #模型评估 评分:5.7/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Carlos Hernandez-Olivan:机构信息未在 arXiv HTML 中可靠披露 Marc Delcroix:机构信息未在 arXiv HTML 中可靠披露 Tsubasa Ochiai:机构信息未在 arXiv HTML 中可靠披露 Naohiro Tawara:机构信息未在 arXiv HTML 中可靠披露 Shoko Araki:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把目标声音提取(Target Sound Extraction, TSE)从固定叶节点提升到本体(Ontology)任意层级单次前向提取,并用共表型相关系数(Cophenetic Correlation Coefficient, CPCC)把树最短路径距离显式压进嵌入(Embedding)欧氏几何,思路干净且对叶级也有增益。短板是评估完全依赖自合成的 5 秒混合与单一 AudioSet 衍生三层树,未做真实录音、跨本体泛化或主观听感,且未开源、未报告方差与显著性检验,让 0.7-1.0 dB 级提升的可信度打折扣。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 484 字 阅读 →
研究条目

Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution

📄 听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验 英文题目:Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution 一句话:为检验被动指纹是否真的持久可复现且与内容无关,论文用 PIPDP 三探针把指纹按人耳可感知性拆开,证明在保持听感透明时位深抖动仍能让溯源准确率下降 48.2%,而改情感只带来约 1.00% 的波动,代价是结论仍受限于 10 类闭集与代理透明度阈值。 标签:#语音伪造检测 | #自监督学习 | #鲁棒性 | #可解释性 评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Yupei Li:机构信息未在 arXiv HTML 中可靠披露 Qiyang Sun:机构信息未在 arXiv HTML 中可靠披露 Emmanouil Benetos:机构信息未在 arXiv HTML 中可靠披露 Berrak Sisman:机构信息未在 arXiv HTML 中可靠披露 Björn Schuller:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于首次把被动指纹(passive fingerprint)按人耳可感知性拆分为可感知与不可感知两类,并用可控扰动与情感提示做了可验证的诊断,视角比单纯测鲁棒性更贴近取证可靠性。短板是核心结论高度依赖闭集 10 分类与 DNSMOS / STOI 代理的可感知阈值,且扰动与情感实验的统计与跨检测器一致性论证不足,难以支撑“不可感知指纹更可信”的强泛化宣称。 ...

 · 更新于 2026-09-05 · 约 8 分钟 · 1582 字 阅读 →
研究条目

Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech

📄 一句里换一种口音:用帧级掩码把全局引导切开 英文题目:Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech 一句话:针对句内码本切换中嵌入短语被载体口音同化的泄露问题,论文在离散扩散 TTS 的推理时用自注意力探测得到短语掩码并以独立尺度 λ 做语言对比引导,在 1200 条 12 方向合成语料上将嵌入短语语言准确率从 0.233 提至 0.518,代价是 UTMOS 轻度下降与需回退到 eager 注意力的 2.26 倍推理开销。 标签:#语音合成 | #扩散模型 | #语音克隆 | #多语言 | #零样本 评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Che Hyun Lee:Department of Electrical and Computer Engineering, Seoul National University Sangkwon Park:Department of Electrical and Computer Engineering, Seoul National University Donghun Kang:Department of Electrical and Computer Engineering, Seoul National University Dongwook Lee:Interdisciplinary Program in Artificial Intelligence, Seoul National University Youngho Cho:机构信息未在 arXiv HTML 中可靠披露 Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露 Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把全局分类器无关引导 Classifier-Free Guidance (CFG) 拆成帧级可控的语言对比引导,并用模型自注意力自举定位短语边界,实现了无训练的句内口音解耦,思路干净且与离散扩散的迭代去噪天然互补。短板是核心证据完全绑定在 OmniVoice 单一骨干和合成文本上,对自回归架构、真实自发码本切换及长时韵律连贯性的外推缺乏严格验证,推理侧需退回 eager 注意力导致的 2.26 倍开销也削弱了即插即用的说服力。 ...

 · 更新于 2026-09-05 · 约 8 分钟 · 1693 字 阅读 →
研究条目

Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation

📄 别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读 英文题目:Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation 一句话:论文把 TTS 友好文本生成定义为偏好对齐问题,用仅 40 个权重的可解释特征线性奖励 FaRM 替代数十亿参数黑盒奖励模型,在仅 10 个样本时仍保持稳定,并在启发式、TTS→ASR 往返与人工听感三重验证下取得最均衡的友好度与有用性权衡,代价是输出偏长且目前仅验证英语双域单引擎。 标签:#语音合成 | #强化学习 | #语音交互 | #大语言模型 | #数据集 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Thibaut Thonet:机构信息未在 arXiv HTML 中可靠披露 Jos Rozen:机构信息未在 arXiv HTML 中可靠披露 Laurent Besacier:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把语音合成(Text-to-Speech,TTS)友好文本生成显式定义为可度量的偏好对齐问题,并用可解释特征线性奖励替代黑盒奖励模型,在仅 10 个样本的低数据 regime 下仍能维持稳定提升,工程链路完整且验证了廉价启发式与昂贵链路及人工听感的一致性。短板是数据集均为合成或半合成且仅覆盖英语咖啡点单与菜谱两域,启发式权重与 TTS→ASR 链路均高度依赖单一引擎与正则设计,输出偏长问题仅做单点权重干预,外推到真实多引擎、多语言部署的可信度不足。 ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1309 字 阅读 →
研究条目

Soft Posterior Speaker Injection for Multi-Talker Speech Recognition

📄 不做硬切分:用连续说话人占比给 Whisper 注入重叠感知 英文题目:Soft Posterior Speaker Injection for Multi-Talker Speech Recognition 一句话:针对重叠语音下硬切分会不可逆截断语音的问题,论文用混合归一化的连续说话人占比通过多层 FiLM 与解码器记忆提示注入 Whisper,在受控双说话人合成集上相对同骨干 SOT 降低 1.1 个点 cpWER 且在高重叠区间增益更大,但在 LibriCSS 零样本上与基线持平、仅靠冻结后验的重叠富集适配才拉开差距,代价是两遍编码的推理开销。 标签:#语音识别 | #语音大模型 | #说话人日志 评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Jian Zhu:机构信息未在 arXiv HTML 中可靠披露 Cheng Luo:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用连续的混合归一化说话人占比代替硬切分,通过多层特征线性调制(Feature-wise Linear Modulation,FiLM)与解码器记忆提示的互补注入,在可控重叠上做出统计显著的小幅提升并设计了冻结后验的域迁移策略。短板是核心增益仅 1.1 个点且依赖合成数据的能量比软标签与两遍编码,零样本在真实 LibriCSS 上与基线持平,整体仍是 Whisper-medium 上的精巧插件而非可扩展的多说话人范式。 ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1467 字 阅读 →
研究条目

TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models

📄 会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒 英文题目:TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models 一句话:TAG-Bench 把时序音频定位从 30 秒单区间拉到 20 分钟一对多枚举,用 1750 条人工校验问答与并集 IoU/计数/格式三层度量揭示即使最强的 FireRedAudio 也仅 31.2 mIoU 且所有模型计数准确率不过 13.2% 的系统性短板。 标签:#音频理解 | #音频大模型 | #音频事件检测 | #基准测试 | #长音频处理 评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yuhang Dai:机构信息未在 arXiv HTML 中可靠披露 Xin Shu:机构信息未在 arXiv HTML 中可靠披露 Zengxi Li:机构信息未在 arXiv HTML 中可靠披露 Lei Xie:机构信息未在 arXiv HTML 中可靠披露 Xiangang Li:机构信息未在 arXiv HTML 中可靠披露 Jianwei Yu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音频时序定位从 30 秒短片段与单区间检测拉到 20 分钟长音频与一对多枚举的真实痛点,并用 21 个系统的统一自由文本评测撕开了当前大音频语言模型连时间都说不清的遮羞布;短板是所有结论都建立在规则解析的混合度量上,数据与评测代码承诺尚未兑现,且 1750 条查询在 8 个子集上的诊断粒度与统计效力仍显单薄。 ...

 · 更新于 2026-09-05 · 约 8 分钟 · 1668 字 阅读 →
研究条目

TEIDAN: A Multilingual Multiparty Dialogue Corpus

📄 三个人怎么把话说完:TEIDAN 用统一的停顿尺子量出日英对话的节奏差 英文题目:TEIDAN: A Multilingual Multiparty Dialogue Corpus 一句话:TEIDAN 用三人围桌开放讨论与 200 毫秒为界的间歇单元统一采集日英多模态对话,通过过滤回馈后的伪轮次统计揭示英语长段陈述与日语增量协同的节奏分化,但受限于熟人度混淆与不足十小时的规模而只能作描述性对照。 标签:#多模态模型 | #多语言 | #数据集 评分:5.1/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Taiga Mori:Graduate School of Informatics, Kyoto University, Japan Koji Inoue:Graduate School of Informatics, Kyoto University, Japan Mikey Elmers:Graduate School of Informatics, Kyoto University, Japan Divesh Lala:Graduate School of Informatics, Kyoto University, Japan Tatsuya Kawahara:Graduate School of Informatics, Kyoto University, Japan 💬 毒舌点评 贡献在于首次以统一协议把自然三人围桌讨论做成可跨日英对照的多模态语料,并沿用 Corpus of Spontaneous Japanese(CSJ)的间歇单元(Inter-Pausal Unit,IPU,≥200 ms 静音为界)实现时间对齐转写,对多方轮替与指称研究确有填空价值;硬伤是总量仅 9 小时 46 分 57 秒、69 个会话,且跨语言对照在熟人-陌生人、话题数与会话时长上完全混淆,却仍做日英定量对比,尚未开放数据与基线模型,离可复用基准尚有距离。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 777 字 阅读 →
研究条目

TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models

📄 掐点说话:TimeSteer 把联合音视频扩散模型的隐式时间搬到明处 英文题目:TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models 一句话:针对联合音视频扩散模型只管说什么不管何时说的问题,TimeSteer 在推理时用时序敏感注意力头定位源区间并用分区读图在预测干净隐空间搬运内容,在 SpeechShift 上将 HR0.2 提升 2 倍以上而 WER 与画质几乎不掉,代价仅为每步一次无梯度前向。 标签:#音视频生成 | #扩散模型 | #语音合成 | #多模态模型 评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Chao Zhou:机构信息未在 arXiv HTML 中可靠披露 Yiling Chen:机构信息未在 arXiv HTML 中可靠披露 Qi Chu:机构信息未在 arXiv HTML 中可靠披露 Tao Gong:机构信息未在 arXiv HTML 中可靠披露 Nenghai Yu:机构信息未在 arXiv HTML 中可靠披露 Tianyi We:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把联合音视频扩散模型中隐含的时序结构显式化为可编辑的目标到源读图映射,无需训练即可把语音精确塞进任意区间,思路干净且在 LTX-2 与 daVinci-MagiHuman 两个异构骨干上均有效。短板是所有证据仍困在 5 秒短片段与 8 步蒸馏采样器内,对长时多轮对话、真实语速自然度以及口型同步的人工主观评估几乎空白,承诺开源的 SpeechShift 与代码尚未兑现也削弱了可验证性。 ...

 · 更新于 2026-09-05 · 约 9 分钟 · 1803 字 阅读 →
研究条目

TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data

📄 不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer 英文题目:TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data 一句话:为破解音频到乐谱转录长期缺真实配对数据的困境,TUTTI 用 NotaGen 生成 36 万对合成音频-ABC 乐谱预训练纯 Transformer 编码器-解码器,再在真实数据上微调,在钢琴与弦乐四重奏上超越专用基线并零样本泛化到未见过的萨克斯,代价是评估仍限于 14.8 秒切块且合成到真实的域差距未被量化。 标签:#音乐转录 | #预训练 | #Transformer | #数据集 | #迁移学习 评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jianhuai Hu:机构信息未在 arXiv HTML 中可靠披露 Yashan Wang:机构信息未在 arXiv HTML 中可靠披露 Shangda Wu:机构信息未在 arXiv HTML 中可靠披露 Zhancheng Guo:机构信息未在 arXiv HTML 中可靠披露 Shijie Liang:机构信息未在 arXiv HTML 中可靠披露 Wuna Meng:机构信息未在 arXiv HTML 中可靠披露 Chuanqi Yang:机构信息未在 arXiv HTML 中可靠披露 Xiaobing Li:机构信息未在 arXiv HTML 中可靠披露 Feng Yu:机构信息未在 arXiv HTML 中可靠披露 Maosong Sun:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用 NotaGen 生成的 363610 对合成数据把数据饥渴的 Transformer 硬生生喂成了跨乐器通用转录器,在弦乐四重奏等任务上把总分从 84.9 拉到 95.6 的提升是实打实的。短板是整套流水线对合成到真实的域差距缺乏量化分析,EPR 与 SFZ 渲染的真实性未经听感或声学指标验证,且声称开源的 TuttiCorpus 与代码在截稿时仍为承诺状态。 ...

 · 更新于 2026-09-05 · 约 8 分钟 · 1563 字 阅读 →
研究条目

U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement

📄 相位不再复用:当 Transformer 学会看懂复数谱图 英文题目:U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement 一句话:针对卷积难以捕捉长程时频依赖且复用含噪相位限制音质的问题,U-PAST 用复数谱图的 Transformer 编码加 U-Net 解码直接重建幅度和相位,在混响失配下取得最优 SI-SDR,并在匹配条件下以小参数取得最高 PESQ-wb,但低计算量尚未转化为时延优势。 标签:#语音增强 | #Transformer | #模型评估 评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Cao Duong Ly:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129 Jörn Anemüller:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129 💬 毒舌点评 用 1.17M 至 2.40M 参数和 4.39G 至 4.71G MACs 在混响失配下实现对全部基线的 SI-SDR 超越,证明了复数域 Transformer-U-Net 对相位感知与长程建模的协同价值,效率-鲁棒性权衡清晰。短板是所谓首个复数混合架构本质为 AST 分块嵌入与复数 U-Net 的工程拼接,未提出新注意力或复数算子,在其余 3 个条件下仍落后 TF-GridNet 1.62 dB 至 2.44 dB SI-SDR,且未开源任何代码与权重,复现与落地价值受限,低 MACs 也未转化为时延优势。 ...

 · 更新于 2026-09-05 · 约 8 分钟 · 1637 字 阅读 →
研究条目

VoiceLongMemEval: Do Assistants Remember How You Sounded?

📄 只记得你说了什么,却忘了你怎么说的:长程副语言记忆的缺口 英文题目:VoiceLongMemEval: Do Assistants Remember How You Sounded? 一句话:VoiceLongMemEval 把“怎么说”埋进约 10 万 token 的多会话历史,用三级对抗门控逼答案只能从副语言恢复,证明 8 个模型在描述条件下均显著超越盲文本、而 Whisper 级联会系统性丢掉递送信号,代价是全合成数据与仅 oracle 区间的有限外推。 标签:#语音情感识别 | #大语言模型 | #音频理解 | #基准测试 评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Ramit Pahwa:机构信息未在 arXiv HTML 中可靠披露 Parivesh Priye:机构信息未在 arXiv HTML 中可靠披露 Apoorva Beedu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 首次把副语言记忆从单句感知拉长到约 100k tokens 的多会话记忆,设计三级对抗门控确保答案不可从文本推断,概念干净且切中级联式语音助手的结构性缺陷;短板是 523 题全部为大语言模型合成与 Dia 1.6B 合成语音,仅 202 题核心集过盲对抗门控,衍生 321 题未单独门控,音频验证仅限 2 个 7B 模型且为 evidence-only 的 Oracle 评测,生态说服力与自然度仍有距离。 ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1422 字 阅读 →
研究条目

XVAE-WMT: Explainable Wavelet-Temporal Variational Autoencoder for Blind Source Separation of Heart and Lung Sounds

📄 单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作 英文题目:XVAE-WMT: Explainable Wavelet-Temporal Variational Autoencoder for Blind Source Separation of Heart and Lung Sounds 一句话:针对单通道心肺音频带重叠与非平稳耦合的盲分离难题,XVAE-WMT 以连续小波前端、时序一致性正则与软掩码约束改造变分自编码器,并用 SHAP 筛选潜维度,在人工混合集上取得 26.8 dB SDR 的同时保留可解释的分离路径。 标签:#音频分离 | #变分自编码器 | #医疗音频 | #可解释性 | #无监督学习 评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Yasaman Torabi:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada. Shahram Shirani:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada. James P. Reilly:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada. 💬 毒舌点评 将连续小波变换(Continuous Wavelet Transform, CWT)、时序一致性(Temporal Consistency, TC)与软掩码塞进变分自编码器(Variational Autoencoder, VAE)并用SHAP(SHapley Additive exPlanations)做事后剪枝,工程拼装完整且在自制混合集上指标亮眼。问题在于双数据集均为人工随机混合、无真实临床混合验证,时序平滑项与掩码的因果归因被过度包装为可解释性,且关键超参数与统计显著性缺失导致可信度打折。 ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1456 字 阅读 →
研究条目

Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment

📄 没有配对报告时,如何让呼吸声自己找到临床语义? 英文题目:Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment 一句话:REACH 用 GPT-4 把离散元数据蒸馏为结构化报告来锚定冻结的 MedSigLIP 文本空间,并以 Sigmoid 对比损失加掩码重建与第 10 远负采样对齐呼吸音编码器,在 9 任务上实现 61.3% 零样本 AUC 的同时把线性探测推至 71.6%,代价是细粒度分级仍近随机且依赖合成文本的措辞稳定性。 标签:#音频分类 | #对比学习 | #自监督学习 | #多模态模型 评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Mustafa Talha İlerisoy:机构信息未在 arXiv HTML 中可靠披露 Hung Manh Pham:机构信息未在 arXiv HTML 中可靠披露 Mathias Funk:机构信息未在 arXiv HTML 中可靠披露 Mykola Pechenizkiy:机构信息未在 arXiv HTML 中可靠披露 Aaqib Saeed:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用冻结的 MedSigLIP 文本空间作锚点、以 GPT-4 把离散元数据蒸馏为 2-3 行标准化报告来填补呼吸音音频-报告配对真空,并用 SigLIP 损失加掩码重建正则与 FAISS 第 10 远负采样来防止对齐崩塌,思路干净且在 9 任务上把零样本从通用模型的 51% 拉到 61% 可用区间。短板是所谓零样本高度依赖合成报告的措辞与 prompt 模板,相似度采样与温度等关键超参不透明,且 T3 Covid 咳嗽 51.3% 与 T9 五级 COPD 分级 52.1% 仍近随机,平均数掩盖了细粒度任务的失效,宣称的通用临床零样本能力被高估。 ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1252 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-09-02

语音/音乐/音频论文速递 2026-09-02 共分析 23 篇论文 ⚡ 今日概览 ✅ 筛选入选 23 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频分类 3 篇 ███ #多模态模型 2 篇 ██ #语音合成 2 篇 ██ #语音增强 2 篇 ██ #语音情感识别 2 篇 ██ #音频分离 2 篇 ██ #语音交互 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(23 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 BiMTokenizer: Preserving Semantic-Acoustic Balance in… 8.3 前25% 方法研究 #语音编码 🥈 A Composable Evaluation System for Reproducible Omni… 8.3 前25% 系统技术报告 #多模态模型 🥉 Phrase-Localized Language-Contrastive Guidance… 8.2 前25% 方法研究 #语音合成 4. Zero-Shot Respiratory Sound Classification through LLM… 7.8 前25% 方法研究 #音频分类 5. A Unified Uncertainty-Aware Back-End for Speaker… 7.8 前25% 方法研究 #说话人验证 6. ABSE-NET: A Lightweight Neural Model for Active… 7.5 前25% 方法研究 #语音增强 7. TUTTI: Toward generalizable audio-to-score… 7.4 前50% 方法研究 #音乐转录 8. Perceptible or Not? Diagnosing Passive Fingerprints… 7.4 前50% 方法研究 #语音伪造检测 9. Ready to Speak: Aligning LLMs for TTS-Friendly Text… 7.4 前50% 方法研究 #语音合成 10. On the Human and Computer Alignment of Attribute-Based… 7.3 前50% 数据集与基准 #音乐检索 11. TimeSteer: Inference-Time Speech Scheduling in Joint… 7.2 前50% 方法研究 #音视频生成 12. VoiceLongMemEval: Do Assistants Remember How You… 7.1 前50% 数据集与基准 #语音情感识别 13. Cleaner Speech, Weaker Generalization: Revisiting Pitt… 7.0 前50% 数据集与基准 #音频分类 14. TAG-Bench: Benchmarking Temporal Audio Grounding in… 6.9 前50% 数据集与基准 #音频理解 15. Artificial Rosetta Stone: Constrained Maximum A… 6.8 前50% 方法研究 #音乐理解 16. XVAE-WMT: Explainable Wavelet-Temporal Variational… 6.6 前50% 方法研究 #音频分离 17. U-PAST: A Phase-Aware Audio Spectrogram Transformer-U… 6.4 前50% 方法研究 #语音增强 18. Conversation Coach: A Voice-enabled AI System that… 6.3 前50% 系统技术报告 #语音交互 19. Soft Posterior Speaker Injection for Multi-Talker… 6.2 前50% 方法研究 #语音识别 20. Heard but Not Heeded: Paralinguistic Information… 6.0 前50% 方法研究 #语音情感识别 21. Ontology-based Target Sound Extraction 5.7 前50% 方法研究 #音频分离 22. MADS: A Multiview Acoustic Descriptor Set Beyond… 5.7 前50% 方法研究 #音频分类 23. TEIDAN: A Multilingual Multiparty Dialogue Corpus 5.1 后 50% 数据集与基准 #多模态模型 📋 论文列表 🥇 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling ...

 · 更新于 2026-09-05 · 约 24 分钟 · 4954 字 阅读 →
研究条目

Accurate Plate Reverb Parameter Estimation Using Two-Stage Evolutionary Search

📄 把响度与形状拆开:用归一化解耦让板混响参数在病态地形中收敛 英文题目:Accurate Plate Reverb Parameter Estimation Using Two-Stage Evolutionary Search 一句话:从单条板混响脉冲响应反演 6 个物理参数时,论文用峰值归一化的 CMA-ES 形状搜索加未归一化的 μ 三等分搜索两阶段解耦,并在 50 条合成 IR 上以无压缩单分辨率 L1-STFT 损失实现 10^-14 量级 NMSE,代价是单样本最坏数百秒的黑盒评估与对边界拾音点的系统性失效。 标签:#音乐理解 #端到端 #模型评估 评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Byunghoo Park:机构信息未在 arXiv HTML 中可靠披露 Jayeon Yi:机构信息未在 arXiv HTML 中可靠披露 Takyoung Kim:机构信息未在 arXiv HTML 中可靠披露 Minje Kim:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把板混响物理反演这个病态多峰黑盒问题用归一化解耦的两阶段演化搜索拆得干净,并用逐项消融实锤无界对数压缩是收敛崩塌的元凶,诊断比方法本身更值钱。短板是全程只在两组各 50 条合成脉冲响应上自证,无真实录音、无噪声与模型失配测试、无多次种子统计,且单样本最多 400 重启与 30000 次仿真评估的最坏耗时超 600 秒,离实时与大规模部署相去甚远。 ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1482 字 阅读 →
研究条目

Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages

📄 当解码器缺的不是声音,而是下一词的语义证据 英文题目:Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages 一句话:针对转录稀缺导致解码器目标端先验不足的问题,SAMA-ASR 在冻结 Whisper 上插入语义-声学双锚点门控适配器,在 30 小时闽南语与客家语上以自动生成的普通话翻译锚点实现约 30% 与 19% 的相对 CER 下降,代价是依赖配对翻译与额外的 ST 推理开销。 标签:#语音识别 #Adapter #语音翻译 #低资源 #多语言 评分:8.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Kuan-Tang Huang:National Taiwan Normal University, Taiwan;EZAI, Taiwan Cheng-Yeh Yang:National Taiwan Normal University, Taiwan Chien-Chun Wang:National Taiwan Normal University, Taiwan Hung-Shin Lee:National Taiwan Normal University, Taiwan Hsin-Min Wang:Academia Sinica, Taiwan Berlin Chen:National Taiwan Normal University, Taiwan 💬 毒舌点评 亮点在于把低资源自动语音识别(Automatic Speech Recognition,ASR)重新定义为目标端生成证据不足问题,并用冻结骨干加语义-声学双锚点门控适配器的极简设计同时解决语义引导与声学落地,消融与冷启动分析相当扎实。短板是验证仅限两套汉语方言且依赖配对普通话翻译,极低资源与弱翻译器下的失效边界已被作者自行暴露,跨语系泛化与真实无配对场景的可用性仍存疑。 ...

 · 更新于 2026-09-05 · 约 8 分钟 · 1582 字 阅读 →
研究条目

Audio-Driven Adversarial Defense for 3D Talking Face Generation with totally Visual Fidelity Preservation

📄 不改脸只改声:把保护藏进人耳听不见的掩蔽阴影 英文题目:Audio-Driven Adversarial Defense for 3D Talking Face Generation with totally Visual Fidelity Preservation 一句话:针对单目视频重建的 3D 肖像可被任意语音驱动滥用的风险,该工作把防御从视觉像素转向音频信号,用心理声学掩蔽约束的频域扰动诱导渲染嘴型坍缩,在 11 个身份的小规模评测中以更低的音频感知距离实现与视觉防御相当的口型破坏,但压缩与重采样的鲁棒性与主观听感仍待实测补足。 标签:#语音合成 #鲁棒性 #模型评估 评分:4.3/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.6/1.5 | 清晰度 0.5/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Rui-Qing Sun:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Chen-Hao Cui:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Hui-Yang Zhao:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Tian Lan:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Zhijing Wu:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Xian-Ling Mao:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China 💬 毒舌点评 把视觉域主动防御搬到音频域并用心理声学掩蔽做不可感知约束的切入点值得肯定,算是对3D场口型驱动滥用风险的模态级回应。但论文充斥2018会议信息与2608 arXiv编号矛盾、DOI占位符、QQ邮箱与多处乱码,实验仅在11个身份的HDTF子集上对比2个基线且无方差与显著性检验,声称的MP3/AAC与重采样后信道鲁棒性、主观听感验证均未提供实测,关键超参数与优化细节大量缺失,视觉完全保真的主张缺乏可复现支撑。 ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1083 字 阅读 →
研究条目

Beyond Speech: Dual-Domain SSL Fusion for Unified All-Type Audio Deepfake Detection

📄 类型未知时如何判真假:用两套耳朵听同一段音频 英文题目:Beyond Speech: Dual-Domain SSL Fusion for Unified All-Type Audio Deepfake Detection 一句话:面对语音、环境声、歌声、音乐四类混合且类型未知的真假判别,论文用 EAT-large 与 XLS-R-300M 的双域互补融合构建统一决策边界,并在评测集上以 95.58% Macro-F1 取得第二,代价是依赖封闭挑战集且未开源复现细节。 标签:#音频伪造检测 #自监督学习 #模型融合 评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Cunhang Fan:State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, School of Computer Science and Technology, Anhui University, Hefei, Anhui, China Junqin Cao:State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, School of Computer Science and Technology, Anhui University, Hefei, Anhui, China Tian Gao:Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta, Hefei, Anhui, China Zhipeng Xie:Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta, Hefei, Anhui, China Jun Xue:Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University, Wuhan, Hubei, China Zhao Lv:State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, School of Computer Science and Technology, Anhui University, Hefei, Anhui, China Xin Fang:University of Science and Technology of China, Hefei, Anhui, China 💬 毒舌点评 用 EAT-large 管宽带声学事件、XLS-R-300M 管波形与语音细节的双域分工思路清晰,token 维拼接规避帧对齐、让注意力在统一池中自适应选线索的做法务实,保守的双重门控语音精炼也确实避免了硬路由的类型误判雪崩。但本质仍是 24 层加权求和加拼接再池化的常规融合,对伪造机理没有新假设与新约束,挑战集第二名的成绩建立在闭源、固定阈值 0.5、无显著性检验和仅在 AT-ADD 内验证的封闭环境下,可迁移性与开放域稳健性论证单薄。 ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1461 字 阅读 →
研究条目

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

📄 长字幕为什么总在最后两层才说谎:用问答把数据、训练和推理锁在一起 英文题目:Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning 一句话:针对长段落音频字幕同时要求长片段、长文本与逐字转录保真的结构性缺口,论文用音频锚定问答统一检验数据、训练与推理三阶段,并以层间曲率抑制迟滞坍缩,在保持开源骨干不变的前提下把字幕的下游可用性推到接近闭源旗舰的水平。 标签:#音频字幕生成 #SFT #音频理解 #音频大模型 #数据集 评分:6.8/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fengji Ma:The Hong Kong University of Science and Technology (Guangzhou) Yan Rong:The Hong Kong University of Science and Technology (Guangzhou) Xu Li:机构信息未在 arXiv HTML 中可靠披露 Chen Zhang:Kling Team, Kuaishou Technology Pengfei Wan:Kling Team, Kuaishou Technology Li Liu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音频锚定问答(audio-grounded question answering)这一单一验证原语贯穿数据、训练、推理三阶段,并用层间曲率捕捉迟滞坍缩这一可验证的幻觉信号,思路比单纯堆数据更干净。短板是核心数据管线完全依赖 Gemini 3.1 Pro 这一闭源黑盒自检,成本与可复现性存疑,且 Late-Layer Semantic-Entropy Collapse 的理论刻画仍停留在现象描述与二阶差分启发式层面,缺乏形式化假设与边界分析。 ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1068 字 阅读 →
研究条目

CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations

📄 用对比学习给 JEPA 当老师:7M 参数如何靠目标设计逼近 330M 大模型 英文题目:CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations 一句话:针对对比学习全局强局部弱、JEPA 局部强却依赖 EMA 且易坍缩的矛盾,CoJEPA 用同一 ViT-1D 主干在类别令牌上做对比、在序列令牌上做掩码潜预测,以对比梯度替代 EMA 实现稳定,并在 7 个音乐任务上尤其以调性与和声取得显著增益,代价是深层谐波信息衰退与私有数据限制复现。 标签:#音乐理解 #自监督学习 #对比学习 #Transformer #音乐检索 评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Gabriel Meseguer-Brocal:机构信息未在 arXiv HTML 中可靠披露 Yuexuan Kong:机构信息未在 arXiv HTML 中可靠披露 Romain Hennequin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用对比学习梯度直接替代联合嵌入预测架构的指数移动平均教师,单主干在类别令牌与序列令牌上分工施加全局对比与局部潜空间预测,7.1M 参数在调性与和声任务上逼近 330M 的 MusicFM,思路干净且有效。短板是预训练依赖未公开的 22M 私有曲库且无代码权重,掩码比例在方法章与训练章表述矛盾,层间性能波动大却缺乏对预测器深度与损失权重的消融,稳定性声明缺少损失曲线与坍缩度量支撑。 ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1263 字 阅读 →