语音/音乐/音频论文速递 2026-09-02
共分析 23 篇论文
⚡ 今日概览
✅ 筛选入选 23 篇 → 🔬 深度分析完成
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #音频分类 | 3 篇 | ███ |
| #多模态模型 | 2 篇 | ██ |
| #语音合成 | 2 篇 | ██ |
| #语音增强 | 2 篇 | ██ |
| #语音情感识别 | 2 篇 | ██ |
| #音频分离 | 2 篇 | ██ |
| #语音交互 | 1 篇 | █ |
| #语音伪造检测 | 1 篇 | █ |
📊 论文评分排行榜(23 篇,按分数降序)
📋 论文列表
🥇 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡
标签:#语音编码 | #端到端 | #语音合成 | #语音质量评估 | #知识蒸馏
评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xin Zhang:Wuhan University of Technology, Wuhan, China
- Lin Li:Wuhan University of Technology, Wuhan, China
- Chuanbo Liu:Wuhan University of Technology, Wuhan, China
- Jianquan Liu:NEC Laboratories Asia Pacific, Singapore;NEC Corporation, Japan
- Kong Aik Lee:The Hong Kong Polytechnic University, Hong Kong
💡 毒舌点评
亮点在于用双向状态空间模型(Bidirectional State-Space Model, Bi-SSM)与固定 Leech 格量化把单塔做到 1.1 kbps 下反超双塔,效率指标也实打实降了 60%以上 MACs。短板是所有 SOTA 声明几乎只在 16 kHz LibriSpeech 960 小时闭环内自洽,跨语种与噪声泛化仅点到为止,且 196560 词表对自回归建模的代价被轻描淡写。
📌 核心摘要
低比特率语音编解码器(Speech Codec)在 1 kbps 量级面临语义保真与声学重建的直接竞争,近期主流通过双塔解耦缓解冲突但参数与计算开销显著上升。BiMTokenizer 重回单塔范式,核心是用双向 Mamba 骨干提供全上下文时序建模,并以残差球面 Leech 量化(Residual Spherical Leech Quantization, RSLQ)用固定高分离度格点替代可学习码本。与单塔基线相比,该组合在不增加塔数的前提下同时提升时序表达与量化稳定性。在 LibriSpeech test-clean 上,BiMTokenizer-Whisper 在 1.1 kbps、12.5 Hz、5 级量化下取得同档最低词错误率与最优 PESQ-NB 3.56 等重建指标,并在 ARCH 语音理解任务上以平均 45.91% 居编解码器首位。结果表明单塔通过骨干与瓶颈的精细化设计仍可实现语义-声学平衡,为面向语音大模型(Speech Large Language Model, Speech LLM)的低码率离散化提供了更轻量的路径。主要边界在于离线双向依赖限制流式部署,且超大固定码本增大了自回归预测难度。
🔗 开源资源
- 代码:https://github.com/ZhangXinWhut/BiMTokenizer
- 模型权重:https://github.com/ZhangXinWhut/BiMTokenizer,论文中说明代码和模型权重均在该 GitHub 仓库提供,未提及独立的 HuggingFace 或 ModelScope 链接
- 数据集:训练使用 LibriSpeech 训练集 960 小时 16 kHz 数据,评测涉及 LibriSpeech test-other、Seed-TTS-Eval 含中文和英文子集,LLM 语音生成训练使用 Emilia 数据集约 96.7K 小时含 46.8K 小时英文和 49.9K 小时中文以及 VoxBox 数据集,论文中未提供数据集直接下载链接
- Demo:论文中未提及
- 复现材料:论文附录 C 提供详细重建损失、对抗损失和特征匹配损失公式,附录 A 提供 8 层双向 Mamba-1 编码器与解码器结构及上下采样细节,训练配置为单阶段训练 1000000 步,使用 2 张 NVIDIA H100 GPU,每张 GPU 批量大小为 64,有效批量大小为 128,优化器为 AdamW 参数为 beta1 为 0.8 beta2 为 0.9 权重衰减为 0.01,余弦退火调度在 30000 步预热后从 1×10-4 衰减至 0,模型总参数量为 253M,量化器帧率为 12.5 Hz 码本每层 196560 条目共 5 层总码率为 1100 bps,TTS 变体为每层 2048 条目共 8 层
- 论文中引用的开源项目:BiMTokenizer https://github.com/ZhangXinWhut/BiMTokenizer,HuBERT large ls960 ft https://huggingface.co/facebook/hubert-large-ls960-ft,UniSpeech speaker verification https://github.com/microsoft/UniSpeech/tree/main/downstreams/speaker_verification,另提及 Whisper-small、SenseVoice-small、Qwen3-0.6B、Qwen3-TTS、Spark-TTS、EnCodec、DAC、SoundStream、BigCodec、XCodec2.0、XY-Tokenizer、SimWhisper-Codec、Mamba、ExtBiMamba、SwiGLU、Residual Spherical Leech Quantization、Lookup-Free Quantization、Binary Spherical Quantization、Finite Scalar Quantization、MPD、MS-STFTD,未提供除上述 3 个链接外的其他 URL
🥈 评测比模型更碎:用一套可组合的流水线让全模态分数可比、可复现
英文题目:A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation
标签:#多模态模型 | #模型评估 | #基准测试
评分:8.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.3/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Hodong Lee:NAVER Cloud AI;Korea University
- Sanghee Park:NAVER Cloud AI;KAIST AI
- Dohoon Ryu:NAVER Cloud AI
- Jungwhan Kim:NAVER Cloud AI
- Junyeob Kim:Seoul National University
- Soyoon Kim:NAVER Cloud AI
- Geewook Kim:NAVER Cloud AI;KAIST AI
💡 毒舌点评
用统一中间模式把 4 类推理后端与 4 个评测框架打通,将 N×M pairwise 集成降至 N+M,并用产物钉扎与轻量 CPU 验证器解决分数不可比与复现难的工程痛点,思路务实且已在 HyperCLOVA X 8 B Omni 研发中落地。代价是贡献偏系统整合而非建模突破,验证器仅做文本三元组二分类、准确率 85.0 仍落后最强闭源裁判约 5 个点,对视觉 grounding、音频质量与多模态生成等非文本维度无能为力。
📌 核心摘要
全模态基础模型需在文本、图像、视频、音频上统一评测,但现有工具链的推理引擎、提示模板与指标实现互不兼容,导致环境割裂与分数不可比。OmniEvaluator 提出可组合评测系统,通过统一中间模式将任意推理引擎与任意评测框架解耦,单次安装覆盖 4 个推理后端(HuggingFace Transformers、vLLM、SGLang、商用 API)、4 个评测框架(built-in、lm-eval-harness、lmms-eval、VLMEvalKit)与 1000+ 基准,并以产物记录完整配置实现精确复现。系统提供联邦化推理共享与内置轻量验证器,后者基于 Qwen3-0.6B 经 LoRA 微调并量化为 8-bit GGUF,可在 CPU 上通过 llama.cpp 运行。与已有工作相比,新颖性在于不重写基准而以适配器复用社区实现,并以统一后处理与单一指标实现消除同名指标阈值差异,用语义验证替代易受提示与解析器影响的规则匹配。实验显示规则分数在跨引擎与提示不一致时波动可达 88.4 点,验证器波动仅 1.9 至 4.4 点;验证器在 1566 样本人工校验集上准确率 85.0,持平 GPT-5.4-mini 82.8 与 Claude-Haiku-4.5 84.3,落后 Claude-Opus-4.8 90.4 约 5.4 点;联邦模式在相同 GPU 预算下取得 1.3 至 2.8 倍端到端加速。该系统已用于 HyperCLOVA X 8B Omni 并开源,对全模态模型选型与回归具有实用价值。主要局限是依赖上游框架实现、验证器仅判断文本语义正确性且未覆盖多模态生成质量。
🔗 开源资源
- 代码:https://github.com/naver-ai/omni-evaluator ,安装方式为 git clone –recursive 后 pip install -e . ,示例代码位于 https://github.com/naver-ai/omni-evaluator/tree/main/demo
- 模型权重:论文中未提及独立的 HuggingFace 或 ModelScope 链接,OmniEval Verifier 基于 Qwen3-0.6B 训练并以 8 bit Q8 GGUF 格式随代码仓库 https://github.com/naver-ai/omni-evaluator 发布,可通过 llama.cpp 在 CPU 上运行
- 数据集:论文中未提及公开数据集链接,Verifier 训练数据来自 16 个模型在 155 个基准上的评估产物及人工验证的 held-out 测试集 1566 样本,未提供下载地址或开源协议
- Demo:在线演示与评估仪表盘随仓库 https://github.com/naver-ai/omni-evaluator 发布,演示视频地址为 https://www.youtube.com/watch?v=4Z5VZZWyXqY ,演示样例位于 https://github.com/naver-ai/omni-evaluator/tree/main/demo
- 复现材料:附录 B 提供单命令安装与服务端启动方法,附录 C 提供 Verifier 训练细节,基础模型为 Qwen3-0.6B ,LoRA r 8 alpha 16 dropout 0.05 ,可训练参数约 5.05M ,学习率 1e-4 ,余弦调度 warmup 0.1 ,最多 3 轮训练,每次运行生成包含 prompt 模板、生成参数、模型版本、基准版本和指标设置的 provenance-rich 产物用于精确复现
- 论文中引用的开源项目:llama.cpp https://github.com/ggml-org/llama.cpp ,HuggingFace Transformers ,vLLM ,SGLang ,lm-eval-harness ,lmms-eval ,VLMEvalKit ,其中除 llama.cpp 外论文中未提及具体 URL
🥉 一句里换一种口音:用帧级掩码把全局引导切开
标签:#语音合成 | #扩散模型 | #语音克隆 | #多语言 | #0 样本
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Che Hyun Lee:Department of Electrical and Computer Engineering, Seoul National University
- Sangkwon Park:Department of Electrical and Computer Engineering, Seoul National University
- Donghun Kang:Department of Electrical and Computer Engineering, Seoul National University
- Dongwook Lee:Interdisciplinary Program in Artificial Intelligence, Seoul National University
- Youngho Cho:机构信息未在 arXiv HTML 中可靠披露
- Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露
- Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于把全局分类器无关引导 Classifier-Free Guidance (CFG) 拆成帧级可控的语言对比引导,并用模型自注意力自举定位短语边界,实现了无训练的句内口音解耦,思路干净且与离散扩散的迭代去噪天然互补。短板是核心证据完全绑定在 OmniVoice 单一骨干和合成文本上,对自回归架构、真实自发码本切换及长时韵律连贯性的外推缺乏严格验证,推理侧需退回 eager 注意力导致的 2.26 倍开销也削弱了即插即用的说服力。
📌 核心摘要
码本切换场景下零样本多语言文本转语音 Text-to-Speech (TTS) 普遍出现口音泄露,嵌入的外语短语被矩阵载体语言同化。论文提出短语定位语言对比引导 Phrase-Localized Language-Contrastive Guidance (LCG),在离散扩散语言模型 Discrete Diffusion Language Model (DLM) 推理时用帧级掩码将全局 CFG 拆分为矩阵与嵌入短语两路独立引导,并通过自注意力探测自动获得短语边界。相较以往全局 CFG 或需微调的双语嵌入方案,LCG 无需训练与外部对齐模型,通过双标签并集与边缘膨胀提升召回,并以独立尺度 \(\lambda\) 解耦语言转向强度。在 5 语言 12 方向共 1,200 条合成码本切换语料上,LCG 将嵌入短语语言准确率从 0.233 提升至 0.518,混合错误率从 0.564 降至 0.445,同时说话人相似度与整体自然度基本保持。该方法为大规模多语言 TTS 提供了轻量可控的推理时口音修复路径,但评估仍以合成文本和离散扩散骨干为主,对低资源语言与自回归模型的泛化待验证。
🔗 开源资源
- 代码:论文中未在正文直接给出 URL,但项目页与验证信息显示代码仓库为 https://github.com/saga1214/PhraseLocalizedLCG,附带演示页 https://saga1214.github.io/PhraseLocalizedLCG/
- 模型权重:论文中未提及独立的权重下载链接,正文及附录 Table 11 仅列出所用模型名称与许可证,未提取到可验证的 HuggingFace 或 ModelScope URL,具体包括 OmniVoice 0.81B Apache-2.0、Whisper-large-v3 Apache-2.0、WavLM-base-plus-sv CC BY-SA 3.0、UTMOS MIT、Qwen3-ForcedAligner-0.6B Apache-2.0、MOSS-TTS-v1.5 8B Apache-2.0,其中 Table 11 标注 Name with Link 但提取文本中未显示具体 URL
- 数据集:论文自建并声称开源 1,200 条合成 code-switching 基准语料,覆盖 5 种语言 12 个方向,用于复现研究,但提取文本中未给出该自建语料的具体下载 URL,引用的第三方数据集包括 LJSpeech Public Domain、KSS Dataset CC BY-NC-SA 4.0、CML-TTS CC BY 4.0、CSS10 Apache-2.0,Table 11 标注含链接但未提取到具体 URL
- Demo:https://saga1214.github.io/PhraseLocalizedLCG/
- 复现材料:论文中未提及训练配置与检查点,方法为 training-free 无需训练,附录提供复现相关材料包括 Appendix A 质量 MOS 与 AB 测试细节、Appendix D 注意力权重鲁棒性分析、Appendix E 人工撰写 code-switching 文本评估、Appendix F 外部系统对照,评估流程使用相同参考语音与矩阵语言条件
- 论文中引用的开源项目:OmniVoice、Whisper-large-v3、WavLM-base-plus-sv、UTMOS、Qwen3-ForcedAligner-0.6B、MOSS-TTS-v1.5、LJSpeech、KSS Dataset、CML-TTS、CSS10,论文 Table 11 标注各项目含超链接但提取文本中未显示具体 URL,未提及则写未提供可提取 URL
从 demo/项目页面验证发现(已更新开源评分):
4. 没有配对报告时,如何让呼吸声自己找到临床语义?
英文题目:Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment
标签:#音频分类 | #对比学习 | #自监督学习 | #多模态模型
评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Mustafa Talha İlerisoy:机构信息未在 arXiv HTML 中可靠披露
- Hung Manh Pham:机构信息未在 arXiv HTML 中可靠披露
- Mathias Funk:机构信息未在 arXiv HTML 中可靠披露
- Mykola Pechenizkiy:机构信息未在 arXiv HTML 中可靠披露
- Aaqib Saeed:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
用冻结的 MedSigLIP 文本空间作锚点、以 GPT-4 把离散元数据蒸馏为 2-3 行标准化报告来填补呼吸音音频-报告配对真空,并用 SigLIP 损失加掩码重建正则与 FAISS 第 10 远负采样来防止对齐崩塌,思路干净且在 9 任务上把 0 样本从通用模型的 51%拉到 61%可用区间。短板是所谓 0 样本高度依赖合成报告的措辞与 prompt 模板,相似度采样与温度等关键超参不透明,且 T3 Covid 咳嗽 51.3%与 T9 5 级 COPD 分级 52.1%仍近随机,平均数掩盖了细粒度任务的失效,宣称的通用临床 0 样本能力被高估。
📌 核心摘要
呼吸音自监督编码器虽能分辨爆裂音与哮鸣音等细粒度模式,但嵌入空间缺乏与临床术语的语义锚定,导致每遇新病种仍需有标签微调,难以零样本部署。REACH 提出将预训练单模态呼吸音编码器与冻结的医学文本编码器 MedSigLIP 对齐,通过医学大语言模型将离散元数据转化为结构化临床报告作为对比学习的语义锚点,并以 Sigmoid 对比损失结合掩码重建正则与相似度感知的负采样保持声学流形。新颖之处在于解耦声学预训练与临床语言接地,无需真实音频-报告配对即可完成模态桥接,且模块化适配任意 Transformer 音频主干。在 6 个数据集 9 个任务的基准上,REACH 零样本平均 AUC 达到 61.3%,线性探测平均 AUC 为 71.6%,以约 43% 公开数据超越全量基线与通用音频文本模型。该范式为低资源临床音频提供了可复用的对齐路径,但合成报告的幻觉风险、文本模板敏感性与细粒度分级任务的低区分度仍限制其外推到真实诊疗流程。
🔗 开源资源
- 代码:https://github.com/mtilerisoy/REACH
- 模型权重:论文中未提及
- 数据集:论文使用 6 个公开呼吸声数据集完成 9 项任务,分别为 CovidUK、COUGHVID、ICBHI、Coswara、KAUH 和 Resp.@TR,论文中未提供具体下载链接或开源协议说明
- Demo:论文中未提及
- 复现材料:论文明确训练配置为文本编码器保持冻结,仅更新音频编码器与投影头,学习率为 \(1\times10^{-5}\),训练 100 轮,采用 SigLIP 形式的 sigmoid 对比损失并结合掩码重建正则项,使用 FAISS 进行相似度感知的负采样(50% 样本替换为第 10 远负例),评估包含线性探测、kNN 和零样本 3 种协议,论文中未提及检查点发布位置
- 论文中引用的开源项目:OPERA 家族包含 OCT、OCE 和 OGT、CLAP、Qwen2-Audio 7B、Audio-Flamingo-3、OpenSMILE、VGGish、AudioMAE、FAISS、SigLIP,论文中未提供上述项目的具体链接
5. 当嵌入不再确定:把不确定性从打分一路带到校准的后端闭环
标签:#说话人验证 | #对比学习 | #鲁棒性 | #模型融合 | #基准测试
评分:7.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Junjie Li:机构信息未在 arXiv HTML 中可靠披露
- Kong Aik Lee:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于把协方差从打分 1 路用到归一化和校准,补上了以往不确定性只停留在前端的断层,工程闭环做得完整且在双骨干上均有提升。短板是 3 段式增益拆开看每个增量都很小且部分 minDCF 反而变差,过度依赖 U^3-xi 这一特定不确定性估计器,对不确定性质量本身缺乏鲁棒性分析。
📌 核心摘要
针对说话人验证(Speaker Verification,SV)中时长、噪声与信道导致试次可靠性差异但传统后端将嵌入视为确定性的问题,论文提出统一的不确定性感知后端,将每条语音表示为后验均值即说话人嵌入(speaker embedding)与对角协方差构成的均值-方差对,并贯穿打分、归一化与校准三阶段。不确定性感知余弦打分(uncertainty-aware cosine scoring)以协方差调整有效范数实现试次相关的尺度缩放,不确定性感知自适应 S 范数(Uncertainty-Aware AS-Norm,UAS-Norm)分别对队列均值、标准差与对称组合引入可靠性加权与尺度补偿,不确定性感知质量测度函数校准(Uncertainty-Aware Quality Measure Function,UQMF)则将协方差调整的嵌入范数与队列统计量作为校准特征。与仅在前端或初始相似度引入不确定性的方法不同,该框架无需重训编码器即可将可靠性信息传播至后续后端。实验在 VoxCeleb2 训练、VoxCeleb1-O / E / H 评测上,ECAPA-TDNN 与 ResNet 双骨干的完整流水线相对传统流水线的平均相对提升分别达到 28.01% 与 27.15%,且目标-非目标分数重叠相对降低 8.1%。该设计为现有归一化与校准流水线提供了即插式可靠性接口,但增益对不确定性估计质量与评测工作点敏感,个别 minDCF 出现退化。
🔗 开源资源
- 代码: https://github.com/mrjunjieli/wespeaker_u_cube
- 模型权重: 论文中未提及具体权重下载链接,仅说明部分结果直接使用 WeSpeaker 预训练模型
- 数据集: 训练使用 VoxCeleb2。评估使用 VoxCeleb1-O、VoxCeleb1-E、VoxCeleb1-H。增强依赖 MUSAN 语料库与 RIR 数据库。论文中未提供直接下载链接
- Demo: 论文中未提及
- 复现材料: 训练流程遵循 WeSpeaker 工具包提供的 VoxCeleb2 管线。ECAPA-TDNN 为 6.19 M 参数。ResNet 为 6.63 M 参数。UAS-Norm 无可学习参数,UQMF 保持逻辑回归结构且仅改变输入特征。协方差相关范数与投影不确定度可跨试次缓存
- 论文中引用的开源项目: WeSpeaker 工具包,ECAPA-TDNN,ResNet,MUSAN 语料库,RIR 数据库。论文中未提供上述项目的具体 URL
6. 开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消?
英文题目:ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids
标签:#语音增强 | #CNN | #主动降噪 | #助听器 | #模型压缩
评分:7.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- De Hu:机构信息未在 arXiv HTML 中可靠披露
- Xue Du:机构信息未在 arXiv HTML 中可靠披露
- Qingying Zhao:机构信息未在 arXiv HTML 中可靠披露
- Qintuya Si:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于把双耳最小方差无失真响应波束形成器(binaural minimum variance distortionless response beamformer,BMVDR)与轻量后滤波级联,用 0.112 M 参数实现开耳式场景下的泄漏对消且摆脱耳内误差麦克风,工程指向清晰。短板是评估完全依赖 Hearpiece 实测头相关脉冲响应(head-related impulse response,HRIR)合成的 24 小时仿真数据,未见真实开耳助听器佩戴、非线性次级路径或主观听感验证,且核心公式中空间线索误差定义存在明显笔误,削弱严谨性观感。
📌 核心摘要
开耳式助听器为缓解闭耳式带来的堵塞效应而引入通气孔,但外部噪声经通气孔泄漏至耳道会污染增强语音并引发梳状滤波,导致传统双耳语音增强(binaural speech enhancement,BSE)失效。ABSE-NET 提出主动式双耳语音增强(active binaural speech enhancement,ABSE)级联框架,前级用双耳最小方差无失真响应波束形成器(BMVDR)做粗增强并保留空间线索,后级轻量神经网络(lightweight neural network,LNN)以前级输出与参考麦克风信号为输入联合完成泄漏对消与失真补偿。与依赖耳内误差麦克风的自适应滤波类 ABSE 不同,该方法仅在训练阶段使用误差信号,推理阶段无需耳内麦克风。在 Librispeech 与 NOISEX-92 合成、基于 Hearpiece 数据库的双耳仿真集上,ABSE-NET 以 0.184G 浮点运算量(floating point operations,FLOPs)取得 3.626 的感知语音质量评估(perceptual evaluation of speech quality,PESQ)与 0.955 的短时客观可懂度(short-time objective intelligibility,STOI),在参数量仅为对照方法约 1/28 的情况下保持竞争力。该工作为资源受限的可穿戴助听设备提供了可部署的主动增强路径,但当前验证仍局限于受控合成声学环境,外推至真实佩戴与个体化耳道特性仍需检验。
🔗 开源资源
- 代码:https://github.com/Bream101/ABSE-NET
- 模型权重:论文中未提及
- 数据集:论文中未提及获取链接与开源协议,使用的公开数据集包括 Librispeech 数据集用于干净语音、NOISEX-92 数据集用于噪声信号、Hearpiece 数据库用于头相关脉冲响应 HRIRs,未提供直接下载链接
- Demo:论文中未提及
- 复现材料:论文在第 4.1 节提供了训练配置,STFT 采用长度为 320 采样点且跳长为 160 采样点的 Hanning 窗,信号下采样至 16 kHz,信噪比 SNR 随机设为 -5 dB 至 0 dB,共生成 43200 个时长为 2 秒的样本约 24 小时,按 8:1:1 划分为训练集验证集测试集且无重叠,HRIRs 选自 24 个入射方向其中 12 个用于训练另外 12 个用于验证和测试,BMVDR 波束形成器采用理想或失配的 ATF 并通过语音活动检测估计 SCM,LNN 输入采用帧级归一化,FA 模块重复 L = 4 次,所有 RMB-Conv1D 层核大小为 {1,3,5}
- 论文中引用的开源项目:论文中未提及具体链接,仅提及数据集与数据库名称包括 Librispeech 数据集、NOISEX-92 数据集、Hearpiece 数据库
7. 不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer
英文题目:TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data
标签:#音乐转录 | #预训练 | #Transformer | #数据集 | #迁移学习
评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jianhuai Hu:机构信息未在 arXiv HTML 中可靠披露
- Yashan Wang:机构信息未在 arXiv HTML 中可靠披露
- Shangda Wu:机构信息未在 arXiv HTML 中可靠披露
- Zhancheng Guo:机构信息未在 arXiv HTML 中可靠披露
- Shijie Liang:机构信息未在 arXiv HTML 中可靠披露
- Wuna Meng:机构信息未在 arXiv HTML 中可靠披露
- Chuanqi Yang:机构信息未在 arXiv HTML 中可靠披露
- Xiaobing Li:机构信息未在 arXiv HTML 中可靠披露
- Feng Yu:机构信息未在 arXiv HTML 中可靠披露
- Maosong Sun:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于用 NotaGen 生成的 363610 对合成数据把数据饥渴的 Transformer 硬生生喂成了跨乐器通用转录器,在弦乐四重奏等任务上把总分从 84.9 拉到 95.6 的提升是实打实的。短板是整套流水线对合成到真实的域差距缺乏量化分析,EPR 与 SFZ 渲染的真实性未经听感或声学指标验证,且声称开源的 TuttiCorpus 与代码在截稿时仍为承诺状态。
📌 核心摘要
音频到乐谱转录(Audio-to-Score, A2S)长期受限于高质量真实配对数据稀缺,现有模型多为单乐器专用且依赖卷积神经网络(Convolutional Neural Network, CNN)前端。TUTTI 提出以数据为中心的范式,利用符号音乐生成模型 NotaGen 大规模生成多乐器 ABC 乐谱并经表现力渲染与 SFZ 采样合成音频,构建纯合成预训练语料。模型采用标准 Transformer 编码器-解码器,将功率谱图经线性投影后直接输入编码器,并以层次化解码器分两级生成小节级块与字符级 ABC 符号。与以往混合 CNN-RNN 及定制层次解码器不同,该工作验证了在充足合成数据下纯注意力架构无需专用声学前端即可取得竞争力。预训练后在真实数据上微调,模型在 ASAP 钢琴、四重奏及未见过的萨克斯数据上均超越专用基线,并展现出多乐器预训练优于单乐器预训练的泛化性。其意义在于为通用 A2S 提供了可扩展的数据引擎与统一架构基线,局限在于全曲长音频转录、合成分布偏差及真实演奏噪声鲁棒性仍未充分验证。
🔗 开源资源
- 代码:https://github.com/a-musiclover/TUTTI
- 模型权重:论文中未提及
- 数据集:TuttiCorpus 包含 363610 个音频-乐谱对获取地址为 https://github.com/a-musiclover/TUTTI 论文声明将公开释放未提及具体开源协议
- Demo:论文中未提及
- 复现材料:模型配置包含 9 层 patch-level encoder 与 decoder 并配备 3 层 character-level decoder 隐藏维度 512 参数量 88.9M 词表大小 128 输入谱图维度 1025 。音频处理参数为采样率 22050 Hz 窗口大小 2048 跳长 160 最大输入时长 14.8 秒目标响度 -23.0 LUFS 。优化器为 AdamW 预训练学习率 2e-4 微调阶段取 1e-5 预热步数 1000 训练轮数 32 。预训练使用 8 张 H800 GPU 每卡批次 10 耗时约 6 天 。微调使用 6 张 H800 GPU 每卡批次 6 。数据集划分比例为 95% 训练 5% 测试
- 论文中引用的开源项目:sfizz https://github.com/sfztools/sfizz 、Parangonar https://github.com/sildater/parangonar 、NotaGen 论文中未提供链接
8. 听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验
英文题目:Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution
标签:#语音伪造检测 | #自监督学习 | #鲁棒性 | #可解释性
评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yupei Li:机构信息未在 arXiv HTML 中可靠披露
- Qiyang Sun:机构信息未在 arXiv HTML 中可靠披露
- Emmanouil Benetos:机构信息未在 arXiv HTML 中可靠披露
- Berrak Sisman:机构信息未在 arXiv HTML 中可靠披露
- Björn Schuller:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于首次把被动指纹(passive fingerprint)按人耳可感知性拆分为可感知与不可感知 2 类,并用可控扰动与情感提示做了可验证的诊断,视角比单纯测鲁棒性更贴近取证可靠性。短板是核心结论高度依赖闭集 10 分类与 DNSMOS / STOI 代理的可感知阈值,且扰动与情感实验的统计与跨检测器一致性论证不足,难以支撑“不可感知指纹更可信”的强泛化宣称。
📌 核心摘要
为解决语音深度伪造溯源中被动指纹是否持久、可复现且与内容无关这一未验证前提,论文提出可感知-不可感知被动指纹诊断协议 Perceptible-Imperceptible Passive-fingerprint Diagnostic Protocol(PIPDP),通过多证据一致性校验、可感知透明扰动与提示驱动的情感可感知属性消融分别检验两类指纹的可靠性。方法上以 10 个生成器与 3 种跨架构溯源器构成的闭集溯源流水线为载体,用残差能量与 Grad-CAM 显著性验证指纹存在性,再用 5 类频域/时域扰动与情感提示对比两类指纹对溯源的贡献。与以往将指纹视为单一可分类信号不同,该工作显式引入人耳感知轴并设计训练无关的输入消融来解耦两类线索。关键结果显示不可感知扰动在保持感知透明时仍大幅削弱溯源,而情感驱动的可感知变化对溯源影响有限,提示不可感知线索更持久。意义在于为取证级溯源提供了更可信的指纹选择依据,但结论受限于闭集设定、有限的生成器与情感覆盖以及感知透明度的代理指标。
🔗 开源资源
- 代码:https://anonymous.4open.science/r/Perceptible-or-Not-3FCB/
- 模型权重:论文中提供了 HiggsAudioV3 权重链接 https://huggingface.co/bosonai/higgs-audio-v3-tts-4b ,其余 9 个生成器权重链接论文中未提及
- 数据集:使用 VCTK 数据集随机采样 2500 条语音按 1800 / 450 / 250 划分为训练集域内测试集和 OOD 测试集,另从 ESD 数据集选取 10 个说话人各 100 条英文脚本构建 Full-OOD 测试集,全部 25000 条合成数据及处理代码已发布于 https://anonymous.4open.science/r/Perceptible-or-Not-3FCB/ ,论文中未提供 VCTK 与 ESD 的独立下载链接
- Demo:论文中未提及
- 复现材料:论文中提及 10 路闭集归因设置冻结 WavLM 与 w2v-bert 特征提取器训练配置及 Grad-CAM 可视化细节,完整代码与数据已发布于 https://anonymous.4open.science/r/Perceptible-or-Not-3FCB/ ,论文中未提及独立检查点下载链接
- 论文中引用的开源项目:GPT-SoVITS 链接为 https://github.com/RVC-Boss/GPT-SoVITS ,HiggsAudioV3 链接为 https://huggingface.co/bosonai/higgs-audio-v3-tts-4b ,SynthID 链接为 https://deepmind.google/models/synthid/ ,其余提及的 FreeVC kNN-VC CosyVoice2 XTTS-v2 Qwen3-TTS F5-TTS AudioSeal WavLM w2v-bert RawNet2 AASIST 论文中未提供链接
9. 别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读
英文题目:Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
标签:#语音合成 | #强化学习 | #语音交互 | #大语言模型 | #数据集
评分:7.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Thibaut Thonet:机构信息未在 arXiv HTML 中可靠披露
- Jos Rozen:机构信息未在 arXiv HTML 中可靠披露
- Laurent Besacier:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
把语音合成(Text-to-Speech,TTS)友好文本生成显式定义为可度量的偏好对齐问题,并用可解释特征线性奖励替代黑盒奖励模型,在仅 10 个样本的低数据 regime 下仍能维持稳定提升,工程链路完整且验证了廉价启发式与昂贵链路及人工听感的一致性。短板是数据集均为合成或半合成且仅覆盖英语咖啡点单与菜谱两域,启发式权重与 TTS→ASR 链路均高度依赖单一引擎与正则设计,输出偏长问题仅做单点权重干预,外推到真实多引擎、多语言部署的可信度不足。
📌 核心摘要
论文针对大语言模型(Large Language Model,LLM)输出偏书面化、含符号缩写与紧凑数字导致语音合成效果差的问题,将语音合成友好文本生成形式化为偏好对齐任务,目标是在不依赖后处理文本规范化模块的前提下让 LLM 原生输出可直接朗读的文本。方法上复用 Feature-aware Sampling and Tuning(FaST)框架,通过大模型自动发现约 40 个可解释特征,以特征函数线性加权构成轻量奖励模型并经采样-调优迭代对齐。相比提示工程、监督微调(Supervised Fine-Tuning,SFT)、直接偏好优化(Direct Preference Optimization,DPO)及基于传统奖励模型的组相对策略优化(Group Relative Policy Optimization,GRPO)和拒绝采样微调(Rejection-sampling Fine-Tuning,RFT),FaST 在两数据集上取得最均衡的友好度与有用性权衡。评估体系结合模式启发式 1-5 分、Kyutai Pocket TTS 到 Wav2Vec2-large 的往返误码率及 N=14 人的 MUSHRA 听感测试,验证了启发式与人工判断的强相关。意义在于为级联式 LLM→TTS 语音助手提供了低延迟、引擎无关的文本端优化路径,局限在于仅验证 3B/4B 规模模型、英语单 TTS 引擎及合成域,存在输出偏长与领域覆盖窄的问题。
🔗 开源资源
- 代码:https://github.com/naver/tts-friendly-gen
- 模型权重:论文中未发布自训练权重,实验所用基座模型为 https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507 对应 Qwen3-4B 模型与 https://huggingface.co/HuggingFaceTB/SmolLM3-3B 对应 SmolLM3-3B 模型
- 数据集:自建偏好数据集 CORA 与 Recipe 均已开源于 https://github.com/naver/tts-friendly-gen ,其中 Recipe 基于 RecipeNLG 数据集 https://huggingface.co/datasets/mbien/recipe_nlg 采样 300 条构建,每条样本包含 1 个 TTS-friendly chosen 回复与 1 个 TTS-unfriendly rejected 回复
- Demo:论文中未提及
- 复现材料:附录 D 表 9 提供 Reward model 与生成模型微调的完整训练配置,附录 C 提供启发式指标计算脚本并声明将随代码发布,附录 F 提供 SmolLM3-3B 上的复现结果,论文声明数据集、指标与代码均已公开于 https://github.com/naver/tts-friendly-gen
- 论文中引用的开源项目:Qwen3-4B-Instruct-2507 https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507 ,SmolLM3-3B https://huggingface.co/HuggingFaceTB/SmolLM3-3B ,RecipeNLG https://huggingface.co/datasets/mbien/recipe_nlg ,PolyNorm-Bench https://github.com/apple/ml-speech-polynorm-bench
10. 把“像不像”拆开问:当音乐相似度被迫按属性回答时,人与机器在哪儿对齐、又在哪儿分叉
英文题目:On the Human and Computer Alignment of Attribute-Based Music Matches
标签:#音乐检索 | #对比学习 | #音乐生成 | #数据集 | #模型评估
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Roser Batlle-Roca:机构信息未在 arXiv HTML 中可靠披露
- Woosung Choi:机构信息未在 arXiv HTML 中可靠披露
- Joan Serrà:机构信息未在 arXiv HTML 中可靠披露
- Fabio Morreale:机构信息未在 arXiv HTML 中可靠披露
- Wei-Hsiang Liao:机构信息未在 arXiv HTML 中可靠披露
- Xavier Serra:机构信息未在 arXiv HTML 中可靠披露
- Emilia Gómez:机构信息未在 arXiv HTML 中可靠披露
- Yuki Mitsufuji:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于把音乐相似性从玄学整体打分拆成 5 个可操作的维度,并用 83 位专家三元组强迫选择把人机对齐这件事真正落到了可度量的基准上,MATCHA 的设计比空谈版权风险要扎实得多;短板是核心结论几乎被“哪个指标本来就是为哪个属性设计的就对齐哪个属性”所解释,且 AI 生成子集有 1/2 因生成伪影直接失效,暴露出基准构建与生成可控性之间的循环论证。
📌 核心摘要
论文针对生成式音乐中训练数据复现难以客观评估的问题,指出已有音频相似度指标缺乏与人类感知在细粒度音乐属性上的对齐验证。方法核心是构建三元组强迫选择感知实验与对应的 Music Replication Assessment(MiRA,音乐复现评估)框架对比分析,将相似性拆解为旋律、和声、节奏、嗓音与音色 5 个属性,并引入 MATCHA 数据集。与以往整体相似度打分相比,新意在于属性级解耦与同时覆盖抄袭、版本与 AI 生成三类强匹配场景的受控三元组设计。主要结果显示人类在属性层面可达成可度量的一致性,其中旋律一致性最高而和声与音色较低;在非合成伪影子集上计算指标呈现互补的部分对齐,CoverID 贴近旋律与和声,CLAP 与 Discogs-EffNet 覆盖节奏、音色与嗓音。该工作为生成式音乐的原创性审计与归因提供了可复用的感知锚定基准,但结论受限于西方音乐与强匹配采样带来的外推边界。
🔗 开源资源
- 代码:https://github.com/roserbatlleroca/matcha,元数据文件链接为 https://github.com/roserbatlleroca/matcha/metadata/raw_cases.csv,论文中说明预处理脚本已在该仓库提供并将在接收后补全
- 模型权重:论文中未提及独立的 HuggingFace 或 ModelScope 直链,仅说明使用 Stable Audio Open 官方实现 stable-audio-tools 提供的预训练检查点 stable-audio-open-1.0,未给出下载 URL
- 数据集:MATCHA 数据集,包含 300 个三元组用例的 1105 条专家标注,来自 83 名参与者,获取方式为元数据与标注通过 https://github.com/roserbatlleroca/matcha 公开发布,音频通过 Zenodo 分发,AS 子集将在论文接收后以 CC-BY-NC 4.0 协议发布,HP HV AM 子集因版权限制仅提供受限访问,论文中引用的第三方数据源包括 SMP 数据集与 Discogs-VI 数据集
- Demo:论文中未提及
- 复现材料:论文在附录提供完整生成配置,全部生成在单张 NVIDIA H100 PCIe 82 GB 上运行,驱动版本为 570.172.08,CUDA 版本为 12.8,使用固定随机种子 42 生成 10 秒片段,DDIM 反演步数为 100,采样步数为 100,CFG scale 为 6.0,反演阶段 \(\eta\) 为 0.0,生成阶段 \(\eta\) 为 0.3 与 0.5,\(\sigma_{min}\) 为 0.1,\(\sigma_{max}\) 为 1.0,采样器为 v-DDIM,相关超参数汇总于 Table 4,整体流程汇总于 Algorithm 1,原始标注与用例元数据已保留于仓库
- 论文中引用的开源项目:madmom 库,Essentia 库,Stable Audio Open 与 stable-audio-tools 实现,MiRA 评估框架包含 CoverID,PaSST 对应的 KL divergence,CLAP,Discogs-EffNet,DDIM inversion 方法,论文中未提供上述项目的具体 URL
11. 掐点说话:TimeSteer 把联合音视频扩散模型的隐式时间搬到明处
英文题目:TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models
标签:#音视频生成 | #扩散模型 | #语音合成 | #多模态模型
评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Chao Zhou:机构信息未在 arXiv HTML 中可靠披露
- Yiling Chen:机构信息未在 arXiv HTML 中可靠披露
- Qi Chu:机构信息未在 arXiv HTML 中可靠披露
- Tao Gong:机构信息未在 arXiv HTML 中可靠披露
- Nenghai Yu:机构信息未在 arXiv HTML 中可靠披露
- Tianyi We:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于把联合音视频扩散模型中隐含的时序结构显式化为可编辑的目标到源读图映射,无需训练即可把语音精确塞进任意区间,思路干净且在 LTX-2 与 daVinci-MagiHuman 2 个异构骨干上均有效。短板是所有证据仍困在 5 秒短片段与 8 步蒸馏采样器内,对长时多轮对话、真实语速自然度以及口型同步的人工主观评估几乎空白,承诺开源的 SpeechShift 与代码尚未兑现也削弱了可验证性。
📌 核心摘要
针对联合音视频扩散模型只能控制生成内容而无法控制语音何时出现的问题,论文提出推理时语音调度(inference-time speech scheduling)任务,要求在不微调骨干的前提下将每段引述语音及其耦合的视觉口型放置到用户指定的起止区间。核心方法是 TimeSteer,训练无关且在去噪过程中介入:通过时序敏感的文本到音频交叉注意力头定位每段语音的模型隐含源区间,再在预测的干净隐空间上构建区域感知的目标到源读图映射进行内容搬运。相较于仅改写提示词或在注意力上施加窗口约束的基线,新方法区分语音区间内的仿射等比缩放与非语音间隙的三次曲率桥接,实现了语速自适应与时序连续性。与已有音视频评测只关注同步与保真不同,论文同步发布 SpeechShift 基准以量化区间可控性。在 LTX-2 上 HR0.2 从 0.21 提升至 0.73,IoU 从 0.63 提升至 0.87,同时 WER 保持 0.07 附近,表明可控性大幅提升而质量未显著退化。该工作为可脚本化的影视与交互生成提供了即插即用的时序控制层,但目前验证局限于短片段、固定语速可拉伸假设及自动转录对齐的区间估计。
🔗 开源资源
- 代码:论文中未提及代码链接,论文在附录 C 中说明将于发表后发布 TimeSteer、benchmark 构建、baseline 适配和评估的源代码,许可为允许研究免费使用
- 模型权重:论文中未提及,论文说明所有方法在同一 backbone 上使用官方发布的 checkpoint 进行对比,涉及 LTX-2 和 daVinci-MagiHuman 的 FP8 量化蒸馏版本,未给出 HuggingFace 或 ModelScope 具体链接
- 数据集:SpeechShift,包含 400 个 prompt、600 个 utterance 级目标和 102 个场景,每种说话人-话语结构各 100 个 prompt,每个条目含场景 prompt、带引号话语列表、说话人、目标 begin-end 区间及元数据,论文说明将于发表后发布数据集及构建元数据,许可为允许研究免费使用,论文中未提供下载链接
- Demo:论文中未提及
- 复现材料:论文附录 B 给出 Region-Aware Latent Remapping 推导,附录 C 给出复现细节,实验环境为 Python 3.10 和 NVIDIA RTX A6000 GPU,主对比使用固定随机种子 42 生成 5 秒音视频片段,LTX-2 为 24 FPS,daVinci-MagiHuman 为 25 FPS,均使用 FP8 量化蒸馏配置和 8 步采样器,算法 1 给出 TimeSteer 伪代码
- 论文中引用的开源项目:LTX-2 联合音视频扩散 backbone、daVinci-MagiHuman 联合音视频扩散 backbone、FreeAudio、Prompt Relay,论文中未提供具体链接
12. 只记得你说了什么,却忘了你怎么说的:长程副语言记忆的缺口
英文题目:VoiceLongMemEval: Do Assistants Remember How You Sounded?
标签:#语音情感识别 | #大语言模型 | #音频理解 | #基准测试
评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Ramit Pahwa:机构信息未在 arXiv HTML 中可靠披露
- Parivesh Priye:机构信息未在 arXiv HTML 中可靠披露
- Apoorva Beedu:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
首次把副语言记忆从单句感知拉长到约 100 k tokens 的多会话记忆,设计 3 级对抗门控确保答案不可从文本推断,概念干净且切中级联式语音助手的结构性缺陷;短板是 523 题全部为大语言模型合成与 Dia 1.6 B 合成语音,仅 202 题核心集过盲对抗门控,衍生 321 题未单独门控,音频验证仅限 2 个 7 B 模型且为 evidence-only 的 Oracle 评测,生态说服力与自然度仍有距离。
📌 核心摘要
针对长程多会话对话中助手只记住说了什么却丢掉怎么说的盲区,论文提出 VoiceLongMemEval(VLME)基准,强制每个答案只能从副语言元数据中恢复。方法以 LongMemEval 为干草堆底座,叠加 12 类情绪、韵律五元组(语速、音高、响度、停顿、逐字强调)、5 类声音事件(laughs/sighs/coughs/clears_throat/gasps)、讽刺与不确定性标记及声学描述的三渲染层,并通过盲不可解(G1)、描述可解(G2)与表层清洁(G3)三级对抗门控筛题。相比已有长记忆与副语言感知基准,该工作首次系统度量跨会话的副语言记忆与更新,并量化级联自动语音识别流水线在记忆层面的信息损失。实验显示 8 个模型在描述条件下相对盲文本均有 +0.089 至 +0.383 的显著提升(\(p<0.001\)),结构化标签渲染可达 0.757,音频原生 7B 模型在语音输入下达到 0.412 超过盲基线 0.325,而 Whisper large-v3 级联仅 0.254。该基准为语音助手记忆系统保留结构化副语言标注并配合检索时提示提供了可复用评估框架,但合成数据分布、仅 10k-15k tokens 的 Oracle 评测与有限音频模型覆盖限制了外推。
🔗 开源资源
- 代码:论文中未提及可公开访问的 GitHub 链接,仅在正文第 1 节声明 Code and dataset will be made available upon acceptance,在 NeurIPS 自查表第 5 题声明匿名仓库位于 ANONYMIZED-URL-HERE,去匿名版本将在发表后公开
- 模型权重:论文中未提及权重发布链接或 HuggingFace / ModelScope 地址,仅说明评估使用了托管的前沿模型 API 以及开源权重模型,未提供下载链接
- 数据集:论文中未提及公开数据集链接,介绍的新资产为 VoiceLongMemEval 即 VLME 基准,包含文本条目、提示词、门控规则、音频合成脚本和清单,论文声明包含在上述匿名仓库中并将在发表后公开发布,未给出 HuggingFace 数据集链接、文件数或开源协议的 URL,提及音频均为机器生成且音色克隆自已授权的 RAVDESS 参考片段,人工质检通过 91 / 104 个片段,通过率为 87.5%
- Demo:论文中未提及在线演示链接
- 复现材料:论文在第 4 节说明评估条件、上下文机制、模型列表、解码设置和随机种子数量,附录提供完整提示词和分条件细节,匿名仓库据称包含复现主实验结果的完整评估代码和使用说明,音频合成配方在第 3 节及附录中记录,包含 \(guidance\_scale=3.0\)、\(temperature=1.8\)、\(top\_p=0.9\)、\(top\_k=45\) 和按片段固定的随机种子,未提供具体训练配置或检查点保存路径
- 论文中引用的开源项目:论文提及以下资产但均未在正文中给出具体 URL 链接,分别为 RAVDESS、Dia TTS 来自 Nari Labs 2025、Whisper large-v3、Qwen2-Audio-7B、Qwen2.5-Omni-7B、Qwen2.5-72B-Instruct,以及用于对比评估的 Gemma 3-12B、Llama 3.3-70B、Llama 4 Maverick 等,论文在第 12 题自查表中说明已按各自许可证和服务条款使用
13. 越干净,越脆弱:当语音增强抹掉了阿尔茨海默病的线索
标签:#音频分类 | #自监督学习 | #基准测试 | #鲁棒性
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Luqi Sun:Center for Language and Speech Processing (CLSP), Johns Hopkins University
- Shreeram Suresh Chandra:机构信息未在 arXiv HTML 中可靠披露
- Lin Zhang:机构信息未在 arXiv HTML 中可靠披露
- You-Jin Li:Research Center for Information Technology Innovation, Academia Sinica
- Brian MacWhinney:University of Michigan, Ann Arbor
- Yu Tsao:Research Center for Information Technology Innovation, Academia Sinica
- Emily Mower Provost:Carnegie Mellon University
- Berrak Sisman:Center for Language and Speech Processing (CLSP), Johns Hopkins University
💡 毒舌点评
贡献在于把 Pitt 家族“越干净越好”的集体无意识拽到台前,用同域/跨域与匹配/失配增强的四重对照证明去噪带来的分布偏移代价,对长期把 ADReSS 当即插即用基准的社区是一记必要的警钟。缺陷也同样直白:全部跨域结论压在仅 56 例的 English Lu Corpus 这一根独苗上,原始 Pitt/Pitt/ADReSS/ADReSSo 的增强管线均未公开却用 5 种现代增强器做代理归因,对“干净为何更差”仅靠 DNSMOS 的 BAK 抬升与单例 Mel 谱图定性描述,未能量化停顿、迟疑、词汇贫乏等病理标志究竟被何种伪影抹平。
📌 核心摘要
论文针对基于语音的阿尔茨海默病(Alzheimer’s Disease, AD)检测长期依赖 Pitt Corpus 及其衍生策展版本(Pitt、ADReSS、ADReSSo、ADReSS-M)的现状,质疑语音增强(Speech Enhancement, SE)、音量归一化与人口学平衡等预处理是否提升真实场景鲁棒性。作者不提出新检测器,而是构建基准级对照框架,系统比较未处理的 Pitt-origin 与 4 个衍生集在同域与跨域、匹配与失配增强条件下的行为差异。核心假设是增强会引入伪影与谱平滑,造成训练分布与自然采集语音的偏移,使模型拟合处理痕迹而非病理特征。主结果在敏感层选择(Sensitive Layer Selection, SLS)模型上显示:Pitt-origin 在未处理 Lu 语料上跨域 Macro-F1 达 0.7449,为全部组合最高,且显著优于增强训练集;5 种现代增强器下的匹配训练-测试仍普遍低于该基线;大音频语言模型(Large Audio-Language Model, LALM)Kimi-Audio 在增强集上出现明显的 AD 类偏向,且在加入转录与 2 样本示例后仍不消失。实际意义是提醒未来基准构建与临床部署应保留原始分布并报告增强细节,而非盲目追求更干净的语音。局限在于仅以英语 Cookie Theft 任务与单一小型外部集验证,且未深入量化增强对病理声学线索的损伤机制。
🔗 开源资源
- 代码:https://github.com/Sleepwalker554/Back_to_Origin
- 模型权重:论文中未提及
- 数据集:Pitt-origin / Pitt 共 552 条、ADReSS 共 156 条、ADReSSo / ADReSS-M 共 237 条、English Lu Corpus 共 56 条,全部通过 DementiaBank 获取,论文中未提供直接下载链接
- Demo:论文中未提及
- 复现材料:论文在附录中提供模型结构与实现细节,已发布代码包含完整训练配置,3 类自训练模型均在 NVIDIA RTX 5090 GPU 上训练,其中 SLS-based 模型含 169K 可训练参数,XLSR-based 模型含 168K 可训练参数,eGeMAPS-based 模型含 6.2K 可训练参数
- 论文中引用的开源项目:OpenSMILE toolkit 论文中未提供链接、XLS-R 论文中未提供链接、eGeMAPS 论文中未提供链接、Kimi-Audio 论文中未提供链接、Qwen3-Omni 论文中未提供链接、Qwen2-Audio 论文中未提供链接、Audio Flamingo 3 论文中未提供链接、ultravox-v0_5-llama-3_2-1b 论文中未提供链接、DNSMOS 论文中未提供链接
14. 会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒
英文题目:TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models
标签:#音频理解 | #音频大模型 | #音频事件检测 | #基准测试 | #长音频处理
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yuhang Dai:机构信息未在 arXiv HTML 中可靠披露
- Xin Shu:机构信息未在 arXiv HTML 中可靠披露
- Zengxi Li:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
- Xiangang Li:机构信息未在 arXiv HTML 中可靠披露
- Jianwei Yu:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于把音频时序定位从 30 秒短片段与单区间检测拉到 20 分钟长音频与 1 对多枚举的真实痛点,并用 21 个系统的统一自由文本评测撕开了当前大音频语言模型连时间都说不清的遮羞布;短板是所有结论都建立在规则解析的混合度量上,数据与评测代码承诺尚未兑现,且 1750 条查询在 8 个子集上的诊断粒度与统计效力仍显单薄。
📌 核心摘要
该工作针对大音频语言模型(Large Audio Language Model, LALM)能描述内容却难以精确定位何时发生的系统性评估缺失,提出时序音频定位(Temporal Audio Grounding, TAG)任务,要求模型对自然语言查询返回全部匹配时间区间。方法核心是构建 TAG-Bench 基准,包含 1750 条人工校验的查询-录音对、总计 149.5 小时音频,划分为 8 个源相关的诊断子集,覆盖词、声学事件、声学描述、语义、模糊语义、情感以及 2 个约 17 分钟长音频子集,其中 22.1% 为多区间真值(387 条,平均 4.02 个区间,最多 18 个)。创新在于联合覆盖抽象度跨度、秒级到分钟级时长、一对多真值与统一自由文本评测协议,并引入并集交并比(Intersection over Union, IoU)、广义 IoU(generalized IoU, gIoU)、中点绝对误差(Midpoint Absolute Error, MAE)与计数准确率分离边界误差、遗漏与格式失效。21 个系统评测中 FireRedAudio 以 31.2 mIoU 居首且是唯一在 2 个长音频子集均超过 20 mIoU 的系统,但其在 IoU >= 0.7 时召回仅 21.5%,9 个系统低于 5 mIoU,全部模型在一对多计数准确率上不超过 13.2%。该基准为长音频导航、取证与编辑等应用提供了可复用的诊断工具,但作者明确其为描述性诊断套件而非因子解耦的受控实验,外推至更长上下文与因果归因需谨慎。
🔗 开源资源
- 代码:论文中未提及代码链接,论文仅在摘要和结论中表述为 We will release the TAG-Bench data and evaluation code to support future research,未给出 GitHub 或其他仓库的 URL
- 模型权重:论文中未提及,未提供 TAG-Bench 专用模型权重或 HuggingFace / ModelScope 链接,评估的 21 个对比系统仅作为被测对象列出名称
- 数据集:TAG-Bench 基准数据集包含 1750 个查询-录音对,覆盖 149.5 小时音频,分为 8 个子集,22.1% 查询为一对多,论文声明将发布数据但未给出下载链接或开源协议,构建来源提及 AudioSet-strong、AudioCaps、Clotho、DESED 等开放数据集和播客等长音频素材,未提供具体下载 URL
- Demo:论文中未提及
- 复现材料:论文中未提及训练配置和检查点,评估复现相关材料仅描述了评测协议,包括基于规则的 free-form 输出解析、union-based IoU、mIoU、R@0.3 / R@0.5 / R@0.7、gIoU、MAE 及其覆盖率 Cvg 和计数准确率等指标定义,未提供配置文件或运行脚本链接
- 论文中引用的开源项目:论文正文提及以下第三方项目名称但未在所提供的文本中给出对应 URL:Audio Flamingo 2、AF2 Sound-CoT、Audio Flamingo 3、FireRedAudio、GLM-4-Voice-9B、Kimi-Audio-7B、MiDashengLM-7B、MiMo-Audio-7B-Instruct、MOSS-Audio-4B-Instruct、MOSS-Audio-4B-Thinking、MOSS-Audio-8B-Instruct、MOSS-Audio-8B-Thinking、Step-Audio-2-mini-Base、Step-Audio-2-mini、Step-Audio-2-mini-Think、Step-Audio-R1、LLaMA-Omni2-14B、LLaMA-3.1-8B-Omni、Gemini-3.1-Pro、LAT-Audio、TimeAudio,以及基准 MMAU、MMAU-Pro 和数据源 AudioSet-strong、AudioCaps、Clotho、DESED,均未提供可点击链接
15. 把拉格从玄学拉回有限状态:当重建变成约束 MAP 的精确动态规划
标签:#音乐理解 | #自回归模型 | #音乐生成 | #理论分析
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Saanvi Raghavendran:Abstract Math Institute
- Abhishek Bhattacharjee:Abstract Math Institute
💡 毒舌点评
亮点在于把印度古典音乐中常被混为一谈的概率建模、硬约束满足与历史真实性做了清晰切割,并对有限记忆约束下的约束最大后验(Constrained Maximum A Posteriori, Constrained MAP)给出了可验证的动态规划最优性证明,数学写作比多数计算音乐学论文更自律。短板是实证部分仅基于 6 条测试序列的 Yaman 自动转录流水线,且符号真值本身由同一套基频跟踪与主音估计产生,所谓真实数据评估本质是流水线自洽性检验,离档案级重建的证据标准差距很大。
📌 核心摘要
论文针对受损哼唱或录音片段的符号化重建这一逆问题,提出人工罗塞塔石碑(Artificial Rosetta Stone, ARS)框架,将拉格(Raga)建模为有限符号字母表与显式约束系统,并用 k 阶马尔可夫(Order-k Markov)模型刻画上下文相关的旋律转移概率。为解决稀疏估计,引入对称狄利克雷(Symmetric Dirichlet)先验得到后验均值平滑,并将缺失音符补全形式化为带观测一致性与语法可行性约束的约束 MAP 优化,通过动态规划实现全局最优解。合成对照中二阶模型在 10% 掩码下取得约 0.539 的缺失符号准确率,真实 Yaman 音频衍生序列上二阶模型在 10%、30%、50% 掩码下分别取得 0.470、0.414、0.371 的均值,始终高于 0.143 的均匀基线且呈现 k=2 > k=3 > k=1 的稳定排序。工作价值在于为符号层面的拉格重建提供了可检验的定理承载核心与可复现的流水线模板,而非宣称恢复历史演奏本身。主要局限是符号化抽象丢弃了连续音高、甘马克(Gamaka)轨迹与塔拉(Tala)节奏,且真实评估缺乏专家转录与授权档案语料支撑。
🔗 开源资源
- 代码:https://github.com/mathacker23/ArtificialRosettaStone(论文首页脚注与第 4 节给出),https://github.com/mathacker23/ARS_V2(第 10.7 节 Code Availability 给出的提交稿对应仓库)
- 模型权重:论文中未提及
- 数据集:合成数据集为 6 个 raga 启发的符号字母表配合 \(k\) 为 1、2、3 与缺失率 10%、30%、50% 的可复现合成实验,真实音频数据集为来自 RagaVeda 仓库的 42 个 Yaman 片段共约 44.6 分钟经自动音高提取与量化后得到 30 条可用符号序列,论文中未提供数据集直接下载链接与明确开源协议且声明该来源无完整许可与出处文档
- Demo:论文中未提及
- 复现材料:仓库包含 Markov 估计器与精确动态规划解码器及掩码评估循环与合成生成器与真实音频预处理流水线与穷举搜索验证代码,附带实验配置与固定随机种子与图表生成脚本与单元测试,README 提供环境与复现表格图表的精确命令并记录与投稿手稿对应的 commit 或 release,附录 C 提供 10 项可复现性检查清单涵盖种子固定与训练验证测试分离与掩码独立生成与测试标签隔离的阶数选择
- 论文中引用的开源项目:RagaVeda 仓库(真实 Yaman 音频来源,论文中未提供 URL),Darbar Raga Explorer(Yaman 上下文描述参考,论文中未提供 URL)
16. 单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作
标签:#音频分离 | #变分自编码器 | #医疗音频 | #可解释性 | #无监督学习
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yasaman Torabi:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada.
- Shahram Shirani:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada.
- James P. Reilly:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada.
💡 毒舌点评
将连续小波变换(Continuous Wavelet Transform, CWT)、时序一致性(Temporal Consistency, TC)与软掩码塞进变分自编码器(Variational Autoencoder, VAE)并用 SHAP(SHapley Additive exPlanations)做事后剪枝,工程拼装完整且在自制混合集上指标亮眼。问题在于双数据集均为人工随机混合、无真实临床混合验证,时序平滑项与掩码的因果归因被过度包装为可解释性,且关键超参数与统计显著性缺失导致可信度打折。
📌 核心摘要
心肺音单通道盲源分离受非平稳、频带重叠与周期性耦合制约,传统独立成分分析(Independent Component Analysis, ICA)与非负矩阵分解(Non-Negative Matrix Factorization, NMF)的独立性与平稳性假设失效。XVAE-WMT以无监督VAE为主干,引入CWT时频前端、时序一致性正则与后验软掩码,并在潜空间以SHAP排序实现维度筛选与分离。与依赖短时傅里叶变换(Short-Time Fourier Transform, STFT)的有监督及VAE基线相比,该框架无需成对干净信号且提供潜空间归因。核心证据为在数据集一上达到26.8 dB信号失真比(Signal-to-Distortion Ratio, SDR)与32.8 dB信号干扰比(Signal-to-Interference Ratio, SIR),相对最强非VAE基线ECNet提升约12.0 dB SDR。该方法为电子听诊与远程监护提供了可解释的单麦克风分离管线。边界在于评估依赖人工混合与1秒切片,真实混叠、跨设备泛化与临床可用性尚未验证。
🔗 开源资源
- 代码:https://github.com/Torabiy/XVAE
- 模型权重:论文中未提及
- 数据集:论文中使用2个数据集,未提供直接下载链接。数据集1为Kaggle Respiratory Sound Database与CirCor DigiScope Heart Sound Database混合构建,重采样至16 kHz并切分为1秒帧,生成24383个心脏片段和18144个肺部片段,随机配对生成混合信号。数据集2为自采HLS-CMDS临床人体模型数据集,重采样和归一化后生成25000个混合信号。论文中未提及开源协议和下载链接
- Demo:论文中未提及
- 复现材料:论文在正文和Algorithm 1中提供了训练配置。输入为CWT幅值scalogram,使用Mexican Hat母小波。对比了STFT前端F为256和CWT前端F为200两种配置。编码器为卷积结构,输出潜在变量z维度为128的均值mu和对数方差log sigma2,解码器为转置卷积并以sigmoid输出时频掩码。损失函数为L等于Lrec加beta乘LKL加lambdaTC乘LTC,其中Lrec为MSE重构损失,LKL为KL散度,LTC为时序一致性正则项。训练数据为1秒帧的wavelet spectrogram,未提及检查点保存路径和完整超参数表
- 论文中引用的开源项目:论文中引用了Kaggle Respiratory Sound Database和CirCor DigiScope Heart Sound Database等数据集,以及SHAP等可解释性工具,但正文中未提供对应的开源项目链接
17. 相位不再复用:当 Transformer 学会看懂复数谱图
英文题目:U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement
标签:#语音增强 | #Transformer | #模型评估
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Cao Duong Ly:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129
- Jörn Anemüller:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129
💡 毒舌点评
用 1.17 M 至 2.40 M 参数和 4.39 G 至 4.71 G MACs 在混响失配下实现对全部基线的 SI-SDR 超越,证明了复数域 Transformer-U-Net 对相位感知与长程建模的协同价值,效率-鲁棒性权衡清晰。短板是所谓首个复数混合架构本质为 AST 分块嵌入与复数 U-Net 的工程拼接,未提出新注意力或复数算子,在其余 3 个条件下仍落后 TF-GridNet 1.62 dB 至 2.44 dB SI-SDR,且未开源任何代码与权重,复现与落地价值受限,低 MACs 也未转化为时延优势。
📌 核心摘要
论文针对单通道语音增强中卷积网络需经多层堆叠间接捕获长程时频依赖、且多数方法复用含噪相位限制感知质量的问题,提出相位感知的混合架构 U-PAST。方法将复数短时傅里叶变换(Short-Time Fourier Transform, STFT)的对数幅度与相位作为双通道图像,按 \(16 \times 16\) 无重叠分块展平为 \(512\) 维向量,经可学习投影 \(E \in \mathbb{R}^{512 \times 96}\) 与二维正弦位置编码 \(E_{pos} \in \mathbb{R}^{256 \times 96}\) 映射为 \(N=256\) 个 token,送入 1 至 12 层、3 头的 Transformer 编码器建模全局自注意力,再经特征投影与 4 级复数 U-Net 解码器层次化上采样直接重建复数谱。该设计区别于仅做掩码预测并复用噪声相位的 ViT 增强方案与纯卷积复数 U-Net,实现了全局上下文与细节重建的结合。在 DNS 非混响匹配、DNS 混响失配、VoiceBank-DEMAND 与 LibriMix 重构的 4 个条件下,2.40M 参数的 U-PAST-H 在混响失配以 \(9.76\) dB SI-SDR 取得全部模型最佳,在其余 3 个条件分别落后最强的 TF-GridNet \(1.62\) dB 至 \(2.44\) dB,但在匹配条件取得全场最高的 \(3.41\) PESQ-wb。工作以小 footprint 提供了有竞争力的效率与鲁棒性权衡,但推理时延未随 MACs 优势转化为硬件效率,且缺乏统计显著性与真实录制验证。
🔗 开源资源
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:论文中使用 3 个公开语料库,均未在正文中提供直接下载链接,具体为 DNS Challenge 2020 数据集、VoiceBank-DEMAND 语料库、LibriMix 语料库,其中 LibriMix 测试集基于 LibriSpeech test-clean 生成并混合 WHAM! 噪声,训练集为 DNS 数据集 100 小时干净语音与噪声在 0 到 20 dB SNR 范围内混合,验证集 1 小时,论文中未提及数据集获取链接与开源协议细节
- Demo:论文中未提及
- 复现材料:论文中未提及检查点与完整训练脚本,正文第 4 节提供了部分可复现配置,包括 3 种 MR-STFT 分辨率,对应 FFT 大小为 512,1024,2048,hop 大小为 50,120,240,窗长为 240,600,1200,损失权重 lambda_sc 为 0.5,lambda_mag 为 0.5,lambda1 为 1.0,lambda2 为 1.0,lambda3 为 0.05,评估了 4 种模型变体 U-PAST-S 1.17M 参数 4.39G MACs,U-PAST-B 1.51M 参数 4.48G MACs,U-PAST-L 1.96M 参数 4.60G MACs,U-PAST-H 2.40M 参数 4.71G MACs,采样率 16 kHz,未提供代码仓库或配置文件链接
- 论文中引用的开源项目:论文引用了多个第三方基线与工具但未在正文中提供具体 URL,包括 CleanUNet,CUNet-S 与 CUNet-B,TF-GridNet 与 X-TF-GridNet,MP-SENet,Audio Spectrogram Transformer,DNSMOS 评估工具,论文中未提及上述项目的链接
18. 想练好一句难开口的话,机器得先学会怎么“演人”:Conversation Coach 的延迟与演技取舍
英文题目:Conversation Coach: A Voice-enabled AI System that Helps Practice Difficult Workplace Conversations
标签:#语音交互 | #端到端 | #语音合成 | #大语言模型
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Fanyou Wu:机构信息未在 arXiv HTML 中可靠披露
- Suraj Maharjan:机构信息未在 arXiv HTML 中可靠披露
- Ainur Yessenalina:机构信息未在 arXiv HTML 中可靠披露
- Dennis Xu Chen:机构信息未在 arXiv HTML 中可靠披露
- Rahul Srivastava:机构信息未在 arXiv HTML 中可靠披露
- Srinivasan H. Sengamedu:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于把端到端语音到语音与级联流水线的取舍放在真实的 410000 人规模部署中验证,并给出可复用的时延、成本与角色一致性量化对比。短板是核心评估依赖 148 个合成场景与大语言模型作为评委,且未开源任何代码、模型或数据,导致外部几乎无法复现或检验其声称的人格一致性优势。
📌 核心摘要
论文针对管理者在艰难职场对话前缺乏高保真口语演练手段的问题,提出以语音为先的 Conversation Coach 系统,用于模拟不同员工人格与情绪反应的年度绩效等敏感对话。方法核心包含三模块流水线:会前配置基于 DISC 模型与反馈接收风格生成9种人格-反应组合的系统提示,实时角色扮演并行实现 Nova Sonic 2 端到端与 Amazon Transcribe + Claude Sonnet 4.5 + Amazon Polly 级联两种架构,会后由 Claude 生成内容与合规性反馈。相较已有文本机器人与孤立的语音对话研究,新意在于将延迟、打断、人格一致性与合规反馈纳入统一设计框架,并在同一场景下对两种主流语音架构做生产级对比。主要结果显示端到端在中位首次音频时延上为1.4秒对比级联的4.2秒,成本约0.05美元对比0.39美元,而级联在角色依从与真实性等维度上获4个评委一致的有利评价。系统在6个月内被40000余名管理者使用,呈现面向低绩效员工的针对性使用模式。该工作为语音教练类应用的架构选型提供了实证依据,但局限在于合成数据评估、缺乏因果有效性验证以及未提供可复现产物。
🔗 开源资源
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及开源模型权重链接,评估使用的均为闭源商用模型,包括 Nova Sonic 2(amazon.nova-2-sonic-v1:0,voice tiffany)、Claude Sonnet 4.5(anthropic.claude-sonnet-4-5-20250929-v1:0,通过 Amazon Bedrock 调用)、Claude Opus 4.5(claude-opus-4-5-20251101-v1:0)、Nova Pro(us.amazon.nova-pro-v1:0)、MiniMax M2.5(minimax.minimax-m2.5)和 GLM-5(zai.glm-5),以及 Amazon Transcribe 与 Amazon Polly(generative engine,voice Ruth)
- 数据集:论文中未提及公开数据集链接或开源协议,评估数据为自建数据,包含10段人工对话建立的验证集和148个合成场景(覆盖3种员工画像乘以9种人格-反应类型共27种配置,每种配置约6个),生成296份转录文本,其中28个场景包含故意设置的隐私违规用于检测评估,论文未说明对外发布计划
- Demo:论文中未提及在线演示链接
- 复现材料:论文中提供了部分复现所需的配置细节,包括所有大语言模型操作 temperature 设为0.7,级联架构使用 Amazon Transcribe 流式模式进行自动语音识别,语音质量评估使用 UTMOS,成本估算基于10轮会话,以及附录 C.2 中的反馈生成提示词和附录 A 中的4个评测模型 ID,部署数据覆盖6个月内54000余次会话和40000余名管理者,但未提供训练配置或检查点
- 论文中引用的开源项目:论文正文中未提供任何第三方开源项目的具体 URL 链接,提及的工具与项目包括 UTMOS(Saeki et al. 2022,用于语音质量评估)、Meta AI 2025 与 Yang et al. 2025 提及的开源替代方案(仅在局限性中提及未探索),均未给出可访问链接
19. 不做硬切分:用连续说话人占比给 Whisper 注入重叠感知
英文题目:Soft Posterior Speaker Injection for Multi-Talker Speech Recognition
标签:#语音识别 | #语音大模型 | #说话人日志
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jian Zhu:机构信息未在 arXiv HTML 中可靠披露
- Cheng Luo:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
亮点在于用连续的混合归一化说话人占比代替硬切分,通过多层特征线性调制(Feature-wise Linear Modulation,FiLM)与解码器记忆提示的互补注入,在可控重叠上做出统计显著的小幅提升并设计了冻结后验的域迁移策略。短板是核心增益仅 1.1 个点且依赖合成数据的能量比软标签与两遍编码,0 样本在真实 LibriCSS 上与基线持平,整体仍是 Whisper-medium 上的精巧插件而非可扩展的多说话人范式。
📌 核心摘要
多说话人自动语音识别(Multi-Talker Automatic Speech Recognition,MT-ASR)在重叠语音下易受硬性语音活动检测(Voice Activity Detection,VAD)或日志边界误差的不可逆截断影响,而串行输出训练(Serialized Output Training,SOT)虽避免显式切分却未对预训练编码器进行说话人活动条件化。本文提出软后验说话人注入(Soft Posterior Speaker Injection,SPSI),通过轻量头预测帧级说话人后验并以多层 FiLM 与解码器说话人记忆提示注入 Whisper。在受控双说话人 LibriSpeech 重叠合成集上,SPSI 相对同骨干 SOT 将话语平均受限排列词错率(constrained permutation Word Error Rate,cpWER)从 50.7% 降至 49.6%,高重叠区间降幅更大,且在冻结后验并进行重叠富集延续训练后于 LibriCSS 持留集取得 5.1 个点的额外下降。该方法无需外部日志或分离模块即可在推理时完成两遍共享编码注入。局限在于零样本 LibriCSS 与 SOT 相当、增益高度依赖合成预训练的后验校准且仅验证双说话人、30 秒以内的 oracle 窗口,离真实会议级端到端评估仍有距离。
🔗 开源资源
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:LibriSpeech(用于合成 2 说话人重叠数据,论文中通过 LibriSpeech clean 子集按信噪比 -5 至 5 dB 与 RT60 0.25 至 0.75 s 混合构建,官方获取地址 https://www.openslr.org/12/ )和 LibriCSS(用于域迁移评估,官方获取地址 https://github.com/chenzhehuai/libri-css ),论文中未提及自建合成数据的公开下载链接或开源协议
- Demo:论文中未提及
- 复现材料:论文第 2 章与第 3 章提供了部分训练配置,包含基于 Whisper medium 的 2 轮编码结构,FiLM 注入位置为第 8 16 24 块,speaker memory K 为 4,损失为 \(\mathcal{L}_{\mathrm{ASR}}\) 加 \(\lambda \mathcal{L}_{\mathrm{diar}}\),合成集上 backbone 学习率 \(2\times10^{-6}\) 扩展模块学习率 \(5\times10^{-5}\) 且按 high-overlap 验证集 cpWER 选点,LibriCSS 上冻结 posterior head \(\phi\) 并采用 backbone 学习率 \(5\times10^{-7}\) 扩展模块学习率 \(2\times10^{-6}\) 训练 6 轮后再以 \(3\times10^{-7}\) 和 \(1\times10^{-6}\) 在 OV-heavy 子集继续 4 轮,论文中未提及检查点下载链接与完整配置文件附录
- 论文中引用的开源项目:Whisper https://github.com/openai/whisper ,LibriSpeech https://www.openslr.org/12/ ,LibriCSS https://github.com/chenzhehuai/libri-css
20. 听见了却不听从:音频大模型在编码器里记住语气,在解码器里忘记语气
英文题目:Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models
标签:#语音情感识别 | #多模态模型 | #可解释性 | #模型评估
评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Bhuvan Koduru:Language Technologies Institute;Carnegie Mellon University
- Dareen Safar B Alharthi:Language Technologies Institute;Carnegie Mellon University
- Rita Singh:Language Technologies Institute;Carnegie Mellon University
- Bhiksha Raj:Language Technologies Institute;Carnegie Mellon University
💡 毒舌点评
亮点在于用中心化核对齐(Centered Kernel Alignment, CKA)与线性探测(Linear Probing)的解离现象干净地揭示了“编码强、利用弱”的结构性鸿沟,并以训练目标作为解释变量给出可信的对照线索。短板是全篇建立在 Expresso 的 4 个说话人、7 类风格的封闭受控集上,外推性存疑,且梯度反转层(Gradient Reversal Layer, GRL)干预仅在单线性投影器上做最小化验证,离真正可用的解耦训练还很远,输出评估依赖关键词映射的启发式分桶也引入了额外噪声。
📌 核心摘要
论文要解决音频语言模型(Audio Language Model, ALM)是否真正利用副语言(Paralinguistic)信息的问题,即模型能否感知说话方式而非仅转录内容。方法核心是设计四段式贯穿分析框架,对 Whisper-large-v2、Qwen2-Audio-7B Instruct、Qwen2.5-Omni-7B 与 Chroma-4B 在 Expresso 受控风格数据集上同步追踪从音频编码器到投影器再到解码器输出的表征演化。相比以往仅孤立分析语音编码器或仅评估输出,本文首次将线性中心化核对齐(Linear CKA)、留一说话人(Leave-One-Speaker-Out, LOSO)线性探测、开放式语气预测与内容-韵律泄露度量(Content-Prosody Leakage)结合,定位信息丢失的具体边界。与已有方法相比,新处在于揭示投影器仅重塑几何而不删除信息,而解码器行为由训练目标决定。为支撑结论,编码器 late encoder(编码器顶层三分之一)探测精度达 82% 至 85%,而输出端语气感知仅 19.7% 至 53.7%,泄露率在内容驱动模型中高达 0.977 而在声学驱动模型中降至 0.272。实际意义在于指出当前音频语言模型“听见但不听从”的系统性缺陷,为设计副语言感知的训练目标与非线性投影提供方向。主要局限是数据集规模小、仅覆盖说话风格单一维度且仅评估文本输出,对语音生成端的韵律利用未作检验。
🔗 开源资源
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及具体权重下载链接,研究使用的 4 个开源模型为 Whisper-large-v2、Qwen2-Audio-7B Instruct、Qwen2.5-Omni-7B 和 Chroma-4B,论文中未提供对应的 HuggingFace 或 ModelScope URL
- 数据集:Expresso 数据集(Nguyen et al., 2023),包含 7 种说话风格标签(confused、default、enunciated、happy、laughing、sad、whisper),通过固定文本和说话人并改变风格构建跨风格配对,共 31896 对,论文中未提供数据集下载链接或开源协议链接
- Demo:论文中未提及
- 复现材料:论文在附录中提供了详细复现配置,Appendix A 给出线性 CKA 实现细节,Appendix B 给出线性探针训练配置为 scikit-learn LogisticRegression,\(L_2\) 正则化 \(C=0.1\),max_iter=500,solver=saga,tol=1e-3,class_weight=balanced,采用 4 折 LOSO 交叉验证并按训练集统计量标准化特征,Appendix C 给出非线性 MLP 探针配置为 MLPClassifier,隐藏层宽度 256,\(L_2\) alpha=1e-3,max_iter=300 并启用早停,Appendix H 给出 GRL 干预训练细节,仅训练多模态 projector 约 5M 参数,附加 7 分类风格头和 20 分类内容头,内容标签通过 TF-IDF 加 KMeans 聚类为 20 簇,训练 5 轮,使用 AdamW 优化器,学习率 1e-4,权重衰减 0.01,余弦调度预热比例 5%,批次大小 8,使用 8 张 V100-32GB,数据集划分为 8511 训练片段和 2123 验证片段
- 论文中引用的开源项目:Whisper-large-v2、Qwen2-Audio-7B Instruct、Qwen2.5-Omni-7B、Chroma-4B、Expresso 数据集、scikit-learn LogisticRegression 与 MLPClassifier、Claude by Anthropic,论文中未提供上述项目的具体 URL 链接
21. 从“只会抽叶子”到“整棵树都能点名”:用本体距离重塑目标声音提取的条件空间
标签:#音频分离 | #对比学习 | #模型评估
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Carlos Hernandez-Olivan:机构信息未在 arXiv HTML 中可靠披露
- Marc Delcroix:机构信息未在 arXiv HTML 中可靠披露
- Tsubasa Ochiai:机构信息未在 arXiv HTML 中可靠披露
- Naohiro Tawara:机构信息未在 arXiv HTML 中可靠披露
- Shoko Araki:机构信息未在 arXiv HTML 中可靠披露
💡 毒舌点评
把目标声音提取(Target Sound Extraction, TSE)从固定叶节点提升到本体(Ontology)任意层级单次前向提取,并用共表型相关系数(Cophenetic Correlation Coefficient, CPCC)把树最短路径距离显式压进嵌入(Embedding)欧氏几何,思路干净且对叶级也有增益。短板是评估完全依赖自合成的 5 秒混合与单一 AudioSet 衍生 3 层树,未做真实录音、跨本体泛化或主观听感,且未开源、未报告方差与显著性检验,让 0.7-1.0 dB 级提升的可信度打折扣。
📌 核心摘要
本体驱动的目标声音提取要求从单通道混合中按语义查询在任意本体层级提取目标,现有系统仅在固定叶类别上条件化或依赖先检测再逐叶提取后聚合,无法在训练时利用层次结构。本文提出基于本体的 TSE 框架,在 AudioSet 衍生三层树(根 Level 0、中间 Level 1、叶)全部节点上构建可学习类别嵌入表,并引入 CPCC 损失使嵌入空间欧氏距离与树最短路径距离的 Pearson 相关最大化。对比三种条件化:叶提取后聚合基线、全本体独热(One-hot)独立嵌入、基于后代叶激活的多热(Multi-hot)条件化,结合 CPCC 正则实现单次前向的根、中间、叶三级提取。关键证据来自 8k 测试混合:多热结合 CPCC 在根、中间、叶分别达到 6.43 dB、6.66 dB、7.10 dB 的尺度不变信噪比提升(Scale-Invariant Signal-to-Noise Ratio improvement, SI-SNRi),明显优于全本体独热(4.75/5.12/5.73 dB)与聚合基线。框架为分层环境声提取提供了可复用的条件化范式,局限在于数据完全合成、未验证真实场景与零样本外推,且 CPCC 权重敏感性未做系统分析。
🔗 开源资源
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:论文中未提及公开数据集下载链接,论文说明数据集为自合成数据集,基于 FSD50K、LibriSpeech、SynthSOD 和 MoisesDB 4 个公开数据集按本体层次采样合成,包含 48000 个训练混合、4000 个验证混合和 8000 个测试混合,每个混合时长为 5 秒,包含 3 至 5 个目标,论文中未提供合成后数据集的发布链接或开源协议
- Demo:论文中未提及
- 复现材料:论文提供了部分训练配置,嵌入维度 \(D=256\),编码器与解码器各使用 1 层 1D-Conv 与 1D-DeConv,卷积核大小为 16 步长为 8,分离模块使用 512 个滤波器和 8 个 block 并使用 global layer norm,嵌入模块使用 2 层全连接层配合 ReLU 和 layer norm,CPCC 损失权重 \(\lambda=0.1\),批大小为 8,学习率为 1e-5,论文中未提及检查点或附录链接
- 论文中引用的开源项目:论文引用了 FSD50K、LibriSpeech、SynthSOD、MoisesDB、SoundBeam 架构和 AudioSet 本体,论文中未提供上述项目的具体 URL 链接
22. 别只看频谱长什么样:用 19 维力学视角重写环境声音的描述方式
英文题目:MADS: A Multiview Acoustic Descriptor Set Beyond Standard Spectral Summaries
标签:#音频分类 | #集成学习 | #音频事件检测 | #可解释性
评分:5.7/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Utsab Ghosh:ABV-Indian Institute of Information Technology and Management, Gwalior, India
- Roshni Chakraborty:ABV-Indian Institute of Information Technology and Management, Gwalior, India
💡 毒舌点评
亮点在于把 19 维物理启发的多视角声学描述子集(Multi-view Acoustic Descriptor Set, MADS)做得紧凑可解释,在经典机器学习流水线上以 1/2 维度压过 38 维传统基线;短板是所有物理量(有效质量、动能、PDE 残差)均为启发式代理且缺乏消融与深度前端对比,所谓物理性更多是命名包装而非可验证的动力学建模。
📌 核心摘要
环境声音分类长期依赖紧凑手工摘要(compact handcrafted summaries)或固定时频前端如对数梅尔(log-mel)表示,难以显式区分激励、阻尼与随机性不同的声源。MADS将波形的一阶差分视为速度、二阶差分视为加速度,并结合谱质心轨迹构造有效质量代理,统一提取机械能、谱锚点、时序动力学与随机性一致性4个视角共19维描述子。以ESC-10、ESC-50与MSoS(Making Sense of Sounds)为基准,在投票集成(Voting ensemble, RF+XGB+LR)下达到81.00%与52.78%的峰值准确率,在MSoS上达到67.48%,均超过26维MFCC基线与38维谱摘要基线。与已有方法相比,新颖性在于将声信号视为阻尼振荡与能量传递过程而非仅谱形状。实际意义是为可解释、轻量部署提供了结构化描述子层,并宣称可作为未来帧级与深度兼容表示的基础。局限在于仅在经典分类器上验证,未与深度时频模型或可学习前端对比,且物理假设未经消融与理论约束检验。
🔗 开源资源
- 代码:论文中未提及代码链接,原文在第1页说明 Due to double Blind review protocol the code link to the github repo is not provided and will be provided on acceptance
- 模型权重:论文中未提及
- 数据集:论文中使用3个公开基准数据集但未提供下载链接,分别为ESC-50与ESC-10包含2000个音频片段来自Piczak 2015和MSoS包含5个类别来自Kroos et al. 2019,论文中未提及具体获取链接或开源协议
- Demo:论文中未提及
- 复现材料:论文中提及部分复现细节但未提供检查点,包含使用StandardScaler进行z-score标准化,对ESC-10和ESC-50采用官方5折交叉验证,对MSoS采用官方train/test划分,在5个随机种子4242至4646上报告均值和标准差,使用19维MADS对比26维B1基线和38维B2基线,未提及训练配置文件或检查点链接
- 论文中引用的开源项目:论文中提及8个分类器工具但未提供具体链接,分别为1-NN和3-NN、Logistic Regression、SVM with RBF kernel、Random Forest、Gaussian Naive Bayes、XGBoost、soft-voting ensemble,以及StandardScaler预处理工具,均未在原文中给出URL
23. 三个人怎么把话说完:TEIDAN 用统一的停顿尺子量出日英对话的节奏差
标签:#多模态模型 | #多语言 | #数据集
评分:5.1/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Taiga Mori:Graduate School of Informatics, Kyoto University, Japan
- Koji Inoue:Graduate School of Informatics, Kyoto University, Japan
- Mikey Elmers:Graduate School of Informatics, Kyoto University, Japan
- Divesh Lala:Graduate School of Informatics, Kyoto University, Japan
- Tatsuya Kawahara:Graduate School of Informatics, Kyoto University, Japan
💡 毒舌点评
贡献在于首次以统一协议把自然 3 人围桌讨论做成可跨日英对照的多模态语料,并沿用 Corpus of Spontaneous Japanese(CSJ)的间歇单元(Inter-Pausal Unit,IPU,≥200 ms 静音为界)实现时间对齐转写,对多方轮替与指称研究确有填空价值;硬伤是总量仅 9 小时 46 分 57 秒、69 个会话,且跨语言对照在熟人-陌生人、话题数与会话时长上完全混淆,却仍做日英定量对比,尚未开放数据与基线模型,离可复用基准尚有距离。
📌 核心摘要
面向群组人机交互需参与多方对话的现实需求,既有资源多为会议、任务型、文本或表演场景,缺乏可跨语言比较的自然面对面三方讨论多模态语料。TEIDAN(Triadic Discussion Corpus)以三人围桌开放式观点讨论为域,采用独立领夹麦克风、麦克风阵列与面向参与者的摄像机同步采集,并以 CSJ 规范的 IPU 为转写单元提供带时间戳文本。相较既往仅将日语子集用于指称识别、下一说话人预测与语音活动投射(Voice Activity Projection)等任务评测,本文首次作为语料资源论文完整描述日英两部分并新增英语扩展:日语 12 组 36 会话 3 小时 39 分 10 秒、英语 11 组 33 会话 6 小时 07 分 46 秒,合计 57 名独立参与者、69 会话、9 小时 46 分 57 秒,日英共享 island/travel/life 三话题以保证可比性。基于过滤回馈(backchannel,I 标签)与非语言发声后的伪轮次(pseudo-turn,同一说话人连续 IPU 归并)统计,英语平均伪轮次时长 4.65 秒、每轮 2.08 个 IPU,显著长于日语的 2.95 秒、1.55 个 IPU,最长英语伪轮次达 188.0 秒;质性示例呈现英语长段陈述与日语增量式协同构建及非过渡相关位置(Transition-Relevance Place,TRP)处的极简插入差异。该资源为轮替、指称识别与多模态接地提供了可观测平台,但混淆变量、规模与未发布状态限制了外推与基准化强度。
🔗 开源资源
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:TEIDAN 多模态多方对话语料库,日语 12 组 36 会话 3 小时 39 分 10 秒 12384 个 IPU,英语 11 组 33 会话 6 小时 07 分 46 秒 17370 个 IPU,合计 69 会话 9 小时 46 分 57 秒 29754 个 IPU,论文明确表示正在考虑在尊重参与者按人退出限制条件下发布,尚未提供具体下载链接或开源协议
- Demo:论文中未提及
- 复现材料:论文中未提及训练配置与检查点,仅在正文与附录中描述采集方案与转录规范,包括 3 人圆桌面对面讨论、每组 3 话题、每人独立领夹麦克风与麦克风阵列及面向参与者的相机、基于 Corpus of Spontaneous Japanese 的 IPU 转录单元以 200 ms 以上停顿为边界、行内标签 I/F/D/?/N/P
- 论文中引用的开源项目:Corpus of Spontaneous Japanese (CSJ) (Maekawa and others, 2003),论文中未提供该项目链接