共分析 43 篇论文
⚡ 今日概览
✅ 筛选入选 43 篇 → 🔬 深度分析完成
🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #语音情感识别 | 5 篇 | █████ |
| #语音识别 | 4 篇 | ████ |
| #全双工语音交互 | 2 篇 | ██ |
| #强制对齐 | 2 篇 | ██ |
| #文本到语音 | 2 篇 | ██ |
| #言语神经解码 | 2 篇 | ██ |
| #语音对话系统 | 2 篇 | ██ |
| #音乐生成 | 2 篇 | ██ |
📊 论文评分排行榜(43 篇,按分数降序)
📋 论文列表
🖼️ 有图的论文会在这里展示首张原论文图;原图链接见对应独立页面。
🥇 从六类情绪到四十类表演:VoiceNet 把野外语音的细粒度听感变成可检索的表示评测
英文题目:VoiceNet: Fine-Grained Voice Understanding Beyond Emotion at Scale
标签:#语音情感识别 | #基准设计 | #语音属性识别 | #数据集 | #对比学习
评分:8.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Christoph Schuhmann:机构信息未在 arXiv HTML 中可靠披露
- Robert Kaczmarczyk:LAION e.V. Scalable Learning & Multi-Purpose AI (SLAMPAI) Lab, Forschungszentrum Jülich GmbH
- Gollam Rabby:机构信息未在 arXiv HTML 中可靠披露
- Felix Friedrich:机构信息未在 arXiv HTML 中可靠披露
- Maurice Kraus:L3S Research Center Black Forest Labs Computer Science Department, TU Darmstadt
- Gijs Wijngaard:LAION e.V. Scalable Learning & Multi-Purpose AI (SLAMPAI) Lab, Forschungszentrum Jülich GmbH
- Kourosh Nadi:机构信息未在 arXiv HTML 中可靠披露
- Huu Nguyen:机构信息未在 arXiv HTML 中可靠披露
- Kristian Kersting:L3S Research Center Black Forest Labs Computer Science Department, TU Darmstadt;Ontocord.AI German Research Center for Artificial Intelligence (DFKI)
- Sören Auer:Hessian Center for AI (hessian.AI) Leibniz Universität Hannover
📌 核心摘要
输入为野外许可开放的真人语音片段,输出为细粒度情感与谈话风格文本描述的匹配程度,难点在于自然语音情感混合且高度主观,传统 6 至 9 类棚录表演基准无法刻画富有表现力合成已经具备的表演粒度。流程分四环:先以 EmpathicInsight-Voice 对 Emilia-Large 打 40 维情感分并按情感 logit 与 3000 类 WavLM 说话人聚类分层采样得到 Emolia-Balanced,再用 MOSS-Audio-8B-Thinking 以 18 组提示生成每片段 61 个属性值的密集描述,然后训练 VoiceCLAP-Small 双塔与 VoiceCLAP-Large 单塔微调做语音文本对比对齐,最后以余弦相似在 VoiceNet-Emo 与 VoiceNet-Ext 上做阈值与排序评测。与通用音频字幕预训练的根本机制差异在于监督从声音事件转向稠密嗓音表演描述,因而 7 个通用 CLAP 在新基准上平均 Spearman 绝对值低于 0.1。在 VoiceNet-Emo 上 VoiceCLAP-Large 取得每提示平衡准确率 0.7021 与平均 Spearman 相关 0.3719,超越零样本基座 LCO-Embedding-Omni-7B 约 0.039 并高于个体专家与多数标签的一致性参照,但作者明确这只是与聚合标签更对齐而非超越人类感知。结论仅适用于表征层检索与排序,不外推到对话生成与端到端助手行为,且谈话风格子集因标注一致性过低只能作探索性探测。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/LAION-AI/emolia-bench — 链接可访问(HTTP 200)
代码相关资源:https://github.com/LAION-AI/voicenet — 链接可访问(HTTP 200)
代码相关资源:https://github.com/LAION-AI/emotion-annotations — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/laion/Empathic-Insight-Voice-Small — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/laion/Empathic-Insight-Voice-Plus — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/laion/voicenet-dimension-predictors-commercial — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/VoiceNet/voiceclap-small — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/VoiceNet/voiceclap-large — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/laion/Emolia — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/laion/emolia-balanced-5M-subset — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/laion/emolia-voicenet-gemini-annotations — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/VoiceNet/emolia-thinking — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 多人房间里何时该开口:Duplex-MPE 把称呼判断变成可听的说话控制
英文题目:Duplex-MPE: Benchmarking Multi-Party Interaction in Full-Duplex Dialogue
标签:#全双工语音交互 | #基准设计 | #基准测试 | #流式处理
评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Chengqian Ma:机构信息未在 arXiv HTML 中可靠披露
- Wenhao Feng:机构信息未在 arXiv HTML 中可靠披露
- Weixuan Jin:机构信息未在 arXiv HTML 中可靠披露
- Gaole Dai:机构信息未在 arXiv HTML 中可靠披露
- Tianyu Xie:机构信息未在 arXiv HTML 中可靠披露
- Yuexiao Ma:机构信息未在 arXiv HTML 中可靠披露
- Zhaolu Kang:机构信息未在 arXiv HTML 中可靠披露
- Xiangyu Zhao:机构信息未在 arXiv HTML 中可靠披露
- Xiawu Zheng:机构信息未在 arXiv HTML 中可靠披露
- Fei Chao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该基准研究多方共享对话中的选择性参与,输入为连续房间音频加语音职责前导,输出是助手何时起音、说什么、何时保持沉默与何时止话,难点在于无转写与说话人标签下推断每轮称呼对象并抑制非目标语音干扰。方法链分四步衔接,脚本生成先产生场景属性、轮次标签与标准答案并输出配对脚本,配对改写再保持任务不变而翻转是否点名助手形成显式与隐式两版请求。语音合成与调度接着将两版脚本合成连续音频流并控制应答窗口后输入计时,计时加语义评分最后判定起音、正确性、沉默与止话。相比只测打断恢复或指定用户拒答的已有基准,关键机制差异是将非目标语音同时作为后文证据与解决请求事件,并用独立分母分别计分以防高覆盖掩盖乱说话。在2000组配对场景的基准评测下,显式请求的条件回答准确率为0.9039,高于隐式请求的条件回答准确率0.7911。结论仅适用于合成英语客厅与会议类场景,外推至真实混响、重叠与多语言时尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
模型相关资源:https://huggingface.co/openbmb/MiniCPM-o-4_5 — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/kyutai/moshiko-pytorch-bf16 — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/CofeAI/FLM-Audio — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/maitrix-org/Voila-autonomous-preview — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/VITA-MLLM/Freeze-Omni — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 多人语音里记住谁对谁说了什么:交互图记忆与按轮增益的检索智能体
标签:#音频问答 | #检索增强 | #强化学习 | #说话人识别 | #语音
评分:8.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Wenxu Jia:Zhejiang University;MeituanEqual contribution (co-first authors).Corresponding author.
- Xize Cheng:Zhejiang University
- Zihan Zhang:Zhejiang University
- Dongjie Fu:Zhejiang University
- Linjun Li:Zhejiang University
- Wenshi Chen:MeituanEqual contribution (co-first authors).Corresponding author.
- Yangyang Wu:Zhejiang University
- Tao Jin:Zhejiang University
📌 核心摘要
多方口语长期记忆的输入是跨8轮至12轮会话的多人语音对话与查询,输出是需归因到说话人与受话者的个性化答案,难点在于声学身份漂移、事实更新冲突与跨层跨模态证据分散。先做增量说话人识别,其输入是逐轮语音与ECAPA-TDNN声纹,职责是以置信门控滑动平均更新匿名声纹库并在会话后保守合并,输出是稳定的说话人标识。再做交互感知记忆构建,其输入是上一步的说话人标识与对话文本,职责是用大语言模型从局部窗口抽取交互图、事实记忆与参与者画像并链接声纹与姓名,输出是分层跨模态记忆。最后做自适应智能体检索作答,其输入是上一步的分层记忆、查询语音与累积证据,职责是识别提问者声纹并按证据缺口重写查询、选择记忆层工具与说话人过滤器后迭代取证融合,输出是个性化答案。相对固定检索与终局答案奖励搜索,其按轮奖励新获支持证据覆盖与排名的证据增益组相对策略优化鼓励互补取证,减少冗余检索。在VoxPolyBench基准下,VoxPolyMem的得分为85.0,高于w/o RL的得分84.0。结论限于合成语音与受控事件规划场景,未验证真实口音、重叠语音与长时漂移下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://voxpolymem.github.io/VoxPolyBench/demo/ — 链接可访问(HTTP 200)
数据相关资源:https://voxpolymem.github.io/VoxPolyBench/demo/ — 链接可访问(HTTP 200)
演示资源:https://voxpolymem.github.io/VoxPolyBench/demo/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 把每个边界都算分:FA-Bench 如何让强制对齐与识别时间戳放在同一尺子上比较
标签:#强制对齐 | #基准设计 | #基准测试 | #语音 | #鲁棒性
评分:8.1/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Wei Chu:机构信息未在 arXiv HTML 中可靠披露
- Yuanzhe Dong:机构信息未在 arXiv HTML 中可靠披露
- Ke Tan:机构信息未在 arXiv HTML 中可靠披露
- Dong Han:机构信息未在 arXiv HTML 中可靠披露
- Yichao Zhou:机构信息未在 arXiv HTML 中可靠披露
- Ruchao Fan:机构信息未在 arXiv HTML 中可靠披露
- Bingshen Mu:机构信息未在 arXiv HTML 中可靠披露
- Jingbei Li:机构信息未在 arXiv HTML 中可靠披露
- Vishwas Shetty:机构信息未在 arXiv HTML 中可靠披露
- Sarthak Bisht:机构信息未在 arXiv HTML 中可靠披露
- Ziyue Qiu:机构信息未在 arXiv HTML 中可靠披露
- Massa Baali:机构信息未在 arXiv HTML 中可靠披露
- Rita Singh:机构信息未在 arXiv HTML 中可靠披露
- Bhisha Raj:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
强制对齐(forced alignment / FA)需在给定音频与文本时输出词与音素(phone)级时间边界,而实际文本常来自识别器并叠加噪声、音乐与混响,导致跨系统比较长期不可比。FA-Bench 构建统一框架,先固定转写归一化、留人划分与 TIMIT-39 音素映射,再在同一音频上并行评测参考文本轨道与识别后对齐轨道,最后用计入全部边界与相邻标签的容限 F1 替代仅算命中词的平均绝对误差(mean absolute error / MAE)。与已有仅检查匹配词或单侧边界的做法不同,该机制把漏识、误识与 utterance 边缘都计为代价,并按边界位置与相邻匹配数分组诊断失分来源。该统一协议同时覆盖二十一个开源模型与九个商业接口的干净与退化音频,便于复现与选型。在 Buckeye 测试集上 Google Chirp 2 经 Olign 重对齐后词级 20 ms F1 平均提升约 40%,而 Whisper 时间整体偏早约 150 ms,7 个商业接口中 7 个起点偏晚。该结论限于英语朗读与对话语音及 4 种合成退化条件,未验证多语、重叠与真实远场外推。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/olewave/fa-bench — 链接可访问(HTTP 200)
复现相关资源:https://github.com/olewave/fa-bench/tree/main/records — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 谁来说与怎么说分开:用短音频示例控制零样本合成的口音
英文题目:DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS
标签:#文本到语音 | #流匹配 | #语音克隆 | #LoRA
评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ambuj Mehrish:机构信息未在 arXiv HTML 中可靠披露
- Abhinaba Roy:机构信息未在 arXiv HTML 中可靠披露
- Alex Ivanov:机构信息未在 arXiv HTML 中可靠披露
- Tawsif Ahmed:机构信息未在 arXiv HTML 中可靠披露
- Dorien Herremans:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
零样本语音合成输入为待合成文本加短时说话人提示,输出为保留该音色的语音,难点是提示同时携带口音且训练中每说话人仅对应一种口音,导致身份与口音无法独立控制。冻结XLS-R抽取第15层帧特征并掩码平均,经MLP映射为128维单位口音向量,输出进入原型锚定步骤。23行可学习原型表经余弦贴近与温度对比目标锚定该空间,解码器以概率0.5伯努利混合接收编码向量或原型,并用停止梯度切断流匹配损失对编码器的直接更新,使编码器只学向原型靠拢。口音向量经无偏置映射与非仿射层归一化后按均方根幅度缩放送入时间步嵌入与文本嵌入,借助自适应层归一化广播至全部变换器块,推理时丢弃原型表仅用样本编码向量,并以单一权重w插值无口音、有口音与无条件速度场实现连续调控。与标签条件和合成后再转换两条路线不同,该方法把口音视为可替换的全局调制源而非离散标签或重渲染,避免波形级转换而更好保留音色。在1134条已见口音评测下,DEFINE样本路径的准确率为0.196,高于F5-TTS加Seed-VC级联的准确率0.188。该持平的适用边界仅限已见与域外口音,在378条保留口音设置下样本路径的准确率为0.127,低于级联的准确率0.175,人类听感仅验证原型查表路径,原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/AMAAI-Lab/define — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 从方向点到区域图:SAID 为何先学能量再学类别
英文题目:SAID: Semantic Acoustic Imaging Detector for Sound Event Localization and Detection
标签:#联合声音事件检测定位 | #注意力机制 | #多通道 | #预训练 | #空间音频信号
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Runbang Wang:机构信息未在 arXiv HTML 中可靠披露
- Zining Liang:机构信息未在 arXiv HTML 中可靠披露
- Yin Cao:机构信息未在 arXiv HTML 中可靠披露
- Qiuqiang Kong:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语义声成像要求从四通道音频为每个活跃声源预测一张带类别标签的声学图,输出需同时包含空间区域、区域内能量分布与声音类别,而声源数量、位置与范围均随时间变化且邻近源易混叠。语义声成像检测器先由音频到球面编码器将时频特征经球面交叉注意力转换为按方向排布的全景特征,再由球面到成像解码器以槽位查询在多尺度空间特征上做掩膜注意力以解码出每源掩膜、活跃度与类别,最后由细化模块将低分辨率掩膜与图特征点积上采样为高分辨率图谱。该链条中无类别声能预训练先教会编码器定位能量,其输出的全景特征直接作为解码器的键值来源,主训练再经匈牙利匹配联合优化掩膜、活跃度与分类并在真实录音上微调。与传统联合声音事件检测定位只输出类别加点的机制不同,该方法以方向网格查询与掩膜注意力显式建模区域与能量,具有区域级感知的实际意义。在官方DCASE2026 Task 3 Track A评测集下,CUHK(SAID)的Macro mAP为0.1080,高于Medisensing的Macro mAP 0.0662。该结论目前仅在该挑战赛的13类录音与稀疏化重建评测下成立,对开放环境大范围移动声源与小能量源的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/IN03X/SAID — 链接可访问(HTTP 200)
演示资源:https://github.com/IN03X/SAID — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 给预训练乐谱模型加装动机方向盘:MotiGen 的提示注入与两阶段课程
英文题目:Getting Motif-ated: Controllable AI Compositions from Injected Motif Prompts
标签:#符号音乐生成 | #课程学习 | #注意力机制 | #音乐
评分:8.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Chao Peter Yang:Yale University;New Haven, CT
- Cynthia Rudin:Duke University;Durham, NC
- Yue Jiang:Duke University;Durham, NC
- Simon Mak:Duke University;Durham, NC
- Stephen Ni-Hahn:Chinese University of Hong Kong, Shenzhen;Shenzhen, Guangdong
📌 核心摘要
符号音乐生成(symbolic music generation)的输入是抽象动机(motif)的音程类别序列,输出是包含并发展该动机的单声部ABC乐谱,难点在于预训练模型会忽略未见过的提示行且长程解码中提示影响快速衰减。MotiGen先将旋律解析为移调不变的音程类别并挖掘高频模式,再把目标模式以前缀注释行注入乐谱头部,随后在补丁级解码器对提示位置施加标量注意力偏置,最后用聚焦裁剪到完整乐谱的两阶段课程建立提示与内容的关联。与冻结模型的事后转向不同,该偏置在训练与推理时一致施加,使模型学会利用被强调通道。在分层抽样24个动机、每动机生成50首的评测下,完整方法的身体包含率指标为92.3%,高于无提示基线的身体包含率指标36.8%。结论限于单声部、4音动机与ABC记谱体系,未验证多声部、节奏动机与大规模主观听感。训练成本为单张NVIDIA RTX A6000上总计不足1个GPU月,未报告推理延迟与吞吐。
🔗 开源资源
代码相关资源:https://github.com/cpyang123/motigen — 链接可访问(HTTP 200)
演示资源:https://motigen-site.github.io/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 情感相似不是分类对错,而是谁更接近参考:SES-Bench 与 SES-Judge 的对齐做法
英文题目:Toward Human-Aligned Judgement of Speech Emotion Similarity
标签:#语音质量评估 | #偏好优化 | #主观评测 | #语音 | #基准测试
评分:7.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yun-Shao Tsai:机构信息未在 arXiv HTML 中可靠披露
- Yi-Cheng Lin:机构信息未在 arXiv HTML 中可靠披露
- Chih-Kai Yang:机构信息未在 arXiv HTML 中可靠披露
- Ho-Jung Cheng:机构信息未在 arXiv HTML 中可靠披露
- Tsun-Yi Chang:机构信息未在 arXiv HTML 中可靠披露
- Sheng-Wei Wu:机构信息未在 arXiv HTML 中可靠披露
- Yi-Shan Chen:机构信息未在 arXiv HTML 中可靠披露
- Hsiang-Chun Chang:机构信息未在 arXiv HTML 中可靠披露
- Liang-Chieh Lee:机构信息未在 arXiv HTML 中可靠披露
- Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
表现力语音生成评估需要判断候选语音与参考语音在情感表达上的接近程度,输入为参考与候选语音对,输出为相似度分数,难点是嵌入余弦与类别标签推导的排序常与人耳偏好不一致。作者先构建语音情感相似度基准(Speech Emotion Similarity Benchmark,SES-Bench),用零样本语音合成与语音转换生成候选对并收集5人7级比较标注,再冻结维度情感识别编码器并经层加权融合得到话语嵌入,然后以累积Logit序数回归将双候选分数差映射为7类偏好分布进行训练。与直接用融合嵌入余弦或提示大型音频语言模型(Large Audio-Language Model,LALM)做判断相比,该方法显式建模偏好方向与强度差异,因而更贴合人类分级判断。在848个测试三元组评测下,语音情感相似度判别器(Speech Emotion Similarity Judge,SES-Judge)的Spearman相关为0.5297,高于VAD回归融合余弦基线的Spearman相关0.4820。该结论限于英语MSP-Podcast训练与CREMA-D测试的表演化情感,未验证跨语言、强口音与长时风格化生成的泛化能力。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/danielqwer/Speech-Emotion-Similarity.git → https://github.com/danielqwer/Speech-Emotion-Similarity — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/3loi/SER-Odyssey-Baseline-WavLM-Multi-Attributes — 链接可访问(HTTP 200)
数据相关资源:https://github.com/danielqwer/Speech-Emotion-Similarity.git → https://github.com/danielqwer/Speech-Emotion-Similarity — 链接可访问(HTTP 200)
第三方资源:https://www.anthropic.com/news/claude-opus-5 — 链接可访问(HTTP 200)
第三方资源:https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 背景里的记忆:CUE-Mem 检验长期用户记忆能否留住边缘线索
英文题目:CUE-Mem: Benchmarking Long-Term User Memory via Implicit Cues in Multimodal Conversations
标签:#音视频问答 | #基准设计 | #基准测试 | #多模态模型
评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yulin Hu:机构信息未在 arXiv HTML 中可靠披露
- Yanyan Zhao:机构信息未在 arXiv HTML 中可靠披露
- Zimo Long:机构信息未在 arXiv HTML 中可靠披露
- Xing Fu:机构信息未在 arXiv HTML 中可靠披露
- Mengtong Ji:机构信息未在 arXiv HTML 中可靠披露
- Weixiang Zhao:机构信息未在 arXiv HTML 中可靠披露
- Yutai Hou:机构信息未在 arXiv HTML 中可靠披露
- Qianchao Wang:机构信息未在 arXiv HTML 中可靠披露
- Dandan Tu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该基准输入为平均32.4会话的多轮文本图像音频对话,输出为四选一记忆问答,要求从从未被言明的背景证据中恢复用户画像,难点在于单条线索极弱且分散在约354天跨度的长历史中。构建链先由ALOE与PersonaHub种子扩展为六域结构化画像并指派模态与证据类型,再将规划展开为按时间排序的事件组并合成为多会话对话与受控图像音频,最后经自动与人工审查剔除泄漏与不一致样本。评测链将同一历史分别送入文本化记忆系统与原生多模态检索系统,对比显式与隐式条件下的记忆恢复与使用。与已有前景事实型多模态记忆评测不同,该工作以可复现的边缘物体与环境声为目标证据,迫使系统保留并聚合纵向弱信号。在CUE-Mem文本化记忆评测下,Qwen3.6-35B-A3B的Memory Avg.准确率为38.5,低于Oracle Evidence的Memory Avg.准确率80.8。而人类读全历史显隐接近,证明瓶颈在保留与检索而非题目不可答。结论仅适用于合成中文单年稳定偏好与受控复现线索,不覆盖偏好漂移、矛盾披露与开放式记忆更新。该结论的适用边界受限于合成画像与受控线索,偏好漂移与开放更新尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
- 代码相关资源:https://github.com/yulinlp/CUE-MEM — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 在同一压缩预算下兼顾速度、保真与语义:SAGE 如何重排音频自编码器的三难
标签:#音频编码 | #知识蒸馏 | #变分自编码器 | #音乐
评分:7.8/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Francesco Brigante:Sapienza University of Rome, Italy
- Luca Cerovaz:Sapienza University of Rome, Italy;Paradigma
- Davide Marincione:Sapienza University of Rome, Italy
- Giorgio Strano:机构信息未在 arXiv HTML 中可靠披露
- Luca Zhou:机构信息未在 arXiv HTML 中可靠披露
- Emanuele Rodolà:机构信息未在 arXiv HTML 中可靠披露
- Michele Mancusi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为44.1kHz立体声音乐波形,输出为可直接逆变换的复数频谱重建与紧凑潜表示,难点在于同时兼顾高保真重建、语义结构化潜空间与低推理延迟。方法链先以复数短时傅里叶变换将波形转为堆叠左右声道实虚部的时频图,再经三阶段SwinV2编码器逐级压缩为对角高斯潜变量并采样得到下游可用的潜表示。接着冻结的对比语言音频预训练教师在延迟门控后对时域平均的潜描述子做余弦对齐,使潜空间获得语义结构,该对齐输出约束编码器而不直接进入解码重建。最后镜像解码器加残差后网在冻结编码器后做对抗微调恢复频谱细节,其输出即为最终波形重建。与波形卷积和一致性自编码器相比,关键差异在于频谱原生分层建模加语义蒸馏与重建解耦训练,避免了声码器和相位重建,具有保持潜语义不变下提升感知的实际意义。在10s未见商业音乐的MUSHRA主观评测下,SAGE的得分为81.6±2.7,低于SAME-L的得分81.8±2.6。该结论适用边界仅限音乐重建与音乐语义探测,对语音、环境声和长时生成的迁移尚未验证。两阶段训练成本共计1536与3043个A100 GPU小时,推理开销与Stable Audio Open同为0.0045实时率,延迟远低于大基线。
🔗 开源资源
代码相关资源:https://github.com/francescobrigante/SAGE — 链接不可用(HTTP 404)
模型相关资源:https://github.com/francescobrigante/SAGE — 链接不可用(HTTP 404)
演示资源:https://sage-music.pages.dev/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 自己服务器上做听感实验:PANEL 把问卷、筛查、统计和数据治理装进一个链接
英文题目:PANEL: An Open-Source, Self-Hosted Web Platform for Human Evaluation of Generative Models
标签:#音乐生成 | #主观评测 | #开源工具
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Matteo Spanio:机构信息未在 arXiv HTML 中可靠披露
- Andrea Poltronieri:机构信息未在 arXiv HTML 中可靠披露
- Mart'ın Rocamora:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
生成模型依赖人类判断作为最终标准,但现有听测框架重感知协议而轻实验设计,商业问卷平台无法自托管,公开擂台又不支持实验室自有模型与自招被试的受控比较。PANEL以自托管Web服务组织研究流程,先在浏览器研究室中编排条件、刺激与7种题型并生成单一分发链接,冻结后的研究结构进入服务端执行阶段。接着服务端执行筛选与分支逻辑,被试在自有设备上完成单刺激评分或成对偏好任务,其提交的非试点会话进入持续分析阶段,平台汇总分布、跨条件检验、胜率与Bradley-Terry得分并导出可复现包。相对webMUSHRA、BeaqleJS、Go Listen、PsyToolkit、Qualtrics与Chatbot Arena等方案,关键机制差异在于把条件与刺激管理、7种题型与注意力控制、跨条件检验与Bradley-Terry建模、同意版本与留存擦除集中于实验室可控基础设施。在Pavlovia托管评测设置下,Pavlovia服务的费用指标为£0.24每参与者,高于PANEL自托管服务的费用指标£0每参与者。适用边界限于多秒级评分与偏好判断等无需精确刺激呈现时序的范式,浏览器时序、大规模并发与长期纵向留存尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/matteospanio/panel — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 声学损坏下语种识别为何域内准、域外垮:从可控小库到 126 语大系统的域泛化检验
标签:#语言识别 | #评测协议 | #鲁棒性 | #多语言 | #语音
评分:7.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Francois Derrida:机构信息未在 arXiv HTML 中可靠披露
- Raphaël Duroselle:机构信息未在 arXiv HTML 中可靠披露
- Thomas Courtat:机构信息未在 arXiv HTML 中可靠披露
- Jean-François Bonastre:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
口语语言识别 Language Identification 以语音波形为输入、输出 4 至 126 种语言标签,在加性 babble 与风噪、削波失真、声码器编码等声学腐蚀 Acoustic Corruption 下出现严重跨域退化。该工作先基于 CommonVoice v22 构造受控腐蚀数据集 CWWS,将同一语句列表同步施加不同腐蚀并在域间隔离说话人以剥离内容与说话人混淆,再在 DomainBed 框架下以留一域方式比较经验风险最小化与显式对齐方法。机制差异在于后者用最大均值差异或域对抗分支约束特征不变性,前者仅靠多源混合训练隐式覆盖多样性。小规模 4 语言评测中多源 ERM-DG 在 4 个目标域平均准确率为 85.8%,MMD-DG 同为 85.8%、DANN-DG 为 86.4%,未形成稳定超越;Oracle 目标域选模型仅带来约 0.8 个百分点以内提升。大规模 FLEURS 与 VoxLingua107 上 126 语言 MMS-LID-126 系统复现同一趋势,且在完全未见的 LPC10 上最高仅 70.1%,表明多样性有助于近域而难覆盖编码失真类远域。结论仅适用于合成腐蚀,未验证口音、情感、信道交织的真实偏移。原文未披露训练推理部署成本。
🔗 开源资源
代码相关资源:https://github.com/AMIAD-Research/DomainBed — 链接不可用(HTTP 404)
模型相关资源:https://huggingface.co/facebook/wav2vec2-large-100k-voxpopuli — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/facebook/mms-lid-126 — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/facebook/mms-1b — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 记住说了什么还不够:VoxMem 考住语音模型的谁说、怎么说与背景声
英文题目:VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models
标签:#音频问答 | #基准设计 | #基准测试 | #长音频处理
评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yang Xiao:机构信息未在 arXiv HTML 中可靠披露
- Vidhyasaharan Sethu:机构信息未在 arXiv HTML 中可靠披露
- Eun-Jung Holden:机构信息未在 arXiv HTML 中可靠披露
- Ting Dang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
多会话语音助手需在数十分钟历史中回答依赖音频的记忆问题,输入为按时间戳排列的多会话用户音频与助手文本,输出为简短开放答案或证据不足拒答,难点是目标证据稀疏且与同话题干扰会话高度混淆。VoxMem先按记忆操作与声学证据规划结构化题目与金答案,再将证据会话写成用户与助手隔离生成的对话文本,最后用固定音色合成用户语音并叠加受控副语言与环境声后组装嵌套历史。该设计与已有评测的关键差异是同时固定题目与证据而只扩展干扰上下文,并强制音频原生题目在转录后不可解。在32K参考预算下15个大音频语言模型中最强者整体准确率仅为38.5%,专有模型平均33.0%而开源模型平均21.9%,语义记忆显著优于说话人与声学记忆。该结论适用于合成英语多用户助手场景,对真实噪声、真实说话人重叠、自发副语言及超长部署的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 听不清却说听清了:音频大模型转写可靠性的编码器预判
标签:#语音识别 | #迁移学习 | #语音 | #音频大模型 | #鲁棒性
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Amirhosein Javadi:Apple;University of California San Diego
- Richa Dixit:Apple
- Mehrdad Farajtabar:Apple
- Minsik Cho:Apple
- Devang Naik:Apple
- Mohammad Samragh:Apple
📌 核心摘要
输入为可能含背景噪声、音乐干扰与混响的语音录音,输出是目标音频大模型转写是否可靠的四分类判断,难点在于标称信噪比与感知质量都无法决定特定模型在特定语句上的实际词错误率(Word Error Rate,WER)。方法先固定语音与干扰源并二分搜索每个语音干扰对的临界信噪比以确定可靠与退化区间的信噪比分界,再按词错误率阈值划分四类并在类内区间采样训练样本以保持标签由目标模型行为决定,最后用冻结编码器加可学习时序池化与轻量分类器在解码前预测类别,其中上一步的区间采样输出直接作为本步分类器的训练输入。与需要先解码再估计不确定性或词错误率的方法不同,该方法直接复用编码阶段已计算的声学表征并避免执行语言模型解码器。在域内测试集下,Qwen audio encoder + reliability predictor的Macro-F1为81.10%,高于Fe-WER的Macro-F1 70.77%。结论适用于受控加性干扰与混响条件,对真实口音语速与语义混淆引起的失败尚未验证。预测头仅含约0.33M可训练参数,附加计算量相对编码器与解码器可忽略。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 87M 参数做文本到音频:单流与共享调制换来的低显存部署
英文题目:TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment
标签:#音频生成 | #流匹配 | #Transformer | #高效推理
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Junxi Liu:机构信息未在 arXiv HTML 中可靠披露
- Xiquan Li:机构信息未在 arXiv HTML 中可靠披露
- Wenhao Guan:机构信息未在 arXiv HTML 中可靠披露
- Yifan Duan:机构信息未在 arXiv HTML 中可靠披露
- Zhikang Niu:机构信息未在 arXiv HTML 中可靠披露
- Yanru Huo:机构信息未在 arXiv HTML 中可靠披露
- Ziyang Ma:机构信息未在 arXiv HTML 中可靠披露
- Xie Chen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
文本到音频生成需由自然语言描述生成10秒级现实声景,难点在于小容量模型同时保持声学语义对齐、分布保真与44.1 kHz波形细节。TA-CLAP先将输入描述映射为音频对齐的词级表示与池化全局条件,为后续生成提供声学语义基础。TA-DiT接着将该词级表示与加噪音频隐变量投影至共享隐空间并拼接进行联合自注意力,同时将池化条件与时间步结合送入跨块共享调制网络生成归一化与门控参数,仅由音频侧输出预测流匹配速度场以生成音频隐变量。TA-VAE解码器最后承接该生成隐变量,由高度压缩表示重建44.1 kHz波形,质量感知筛选的微调数据进一步支撑小容量训练。与双流分支加每块独立自适应层归一化的主流设计不同,该工作以跨模态共享注意力与跨块共享调制网络削减重复参数。在AudioCaps测试集下,TinyAudio的FAD指标为2.65,低于Tango-Full的FAD指标2.68。其适用边界在于高频细节、复杂时序组合与单步采样下的分布偏移。部署成本为推理期87M参数与0.48 GB峰值显存,单步变体TinyAudio-MF在四核CPU配额下10秒音频稳态实时系数为0.715,单卡GPU端实时系数为0.010。
🔗 开源资源
代码相关资源:https://github.com/junxi25liu/TinyAudio — 链接可访问(HTTP 200)
数据相关资源:https://audiostock.net/ — 链接不可用(HTTP 403)
演示资源:https://tinyaudio-project.github.io/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 不等说完就知道回哪一句:RePlay 把全双工隐状态直接做成检索查询
英文题目:RePlay: Retrieval-Based Voice Playback for Multi-Turn spoken dialogue
标签:#语音对话系统 | #检索增强 | #轮次切换 | #语音
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.5/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Sathvik Udupa:机构信息未在 arXiv HTML 中可靠披露
- Naveen Kumar:机构信息未在 arXiv HTML 中可靠披露
- Ryan Folmsbee:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
面向娱乐角色、场馆导览与客服等需逐字可控内容与固定演绎的语音交互,输入为连续用户语音与固定台词库,输出为回应时机与预录音频,要求在重叠与停顿下低延迟且不篡改台词。探测阶段对PersonaPlex做逐层逐帧探测,找到回合起始标识回灌后可解码出整句回复的最早层与帧,其隐状态输出进入截断阶段。截断阶段仅保留前16层并丢弃后16层与语音生成器,将文本流简化为轮次分类,其轮次起始判定输出进入检索阶段。检索阶段在起始帧用嵌入头将隐状态映射到文本嵌入空间并按余弦相似度检索对应台词直接播放。与边说边检索知识再生成的全双工方案不同,该设计在回合边界直接检索回复本体并立即播放,省去自动语音识别与语音合成。在模拟多轮面试评测下,RePlay的对话质量得分Q为3.76,高于Cascade C的对话质量得分Q 2.99,且中位延迟为383 ms,该结论的适用边界受限于封闭台词场景。该结论限于300句封闭台词与合成训练加小规模真人验证,新意图泛化与精确选句仍偏弱。原文未披露训练步数、优化器、学习率与推理部署成本。
🔗 开源资源
第三方资源:https://github.com/resemble-ai/chatterbox — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/BreezeBlue/Breeze-TTS-2 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 交接不丢结构:OneVoice 用显式会话记录守住说话人、转写与时间
英文题目:OneVoice: An Intermediate Representation for Agentic Speech Pipelines
标签:#音频事件检测 | #评测协议 | #语音 | #大语言模型
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Vipul Charugundla:机构信息未在 arXiv HTML 中可靠披露
- Dancheng Liu:机构信息未在 arXiv HTML 中可靠披露
- Jinjun Xiong:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
智能体语音管线需在自动语音识别、说话人分离与强制对齐等多工具间传递说话人、时间、发音与行为事件,输入为异构工具产物而输出为可聚合的会话级事件清单,难点是标识漂移与时间脱钩导致聚合失稳。先以上游异构工具产物为输入,由OneVoice以会话、说话人与轮次三级稳定标识与多层转写为职责组织证据,输出可直接关联的统一会话记录。再以上一步输出的统一会话记录为输入,由模式校验器负责检查时间包含与引用一致,输出通过或标错的记录与错误定位。最后以标错记录与错误定位为输入,由生产智能体负责至多3轮修复并交下游聚合智能体合并,输出会话级事件清单,前一步的校验信号直接决定回退修复还是向后传播。与隐式交接相比该显式内容层保留了结构与关系而非仅统一格式。在Ultrasuite儿童语音事件聚合任务评测下,OneVoice的F1指标为0.868,从隐式交接的F1指标0.265升至0.868。该结论仅在2类受控聚合与链接任务和3个大语言模型上验证,尚未证明在噪声、重叠语音或长时会议中的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Charugundlavipul/OneVoice — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 合成嘴型补不上真实视频:用音频驱动 talking head 给 AVSR 扩数据
英文题目:Improving Audiovisual Speech Recognition through Synthetic Visual Data Augmentation
标签:#音视频语音识别 | #数据增强 | #音视频 | #语音 | #低资源
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Pol Buitrago:机构信息未在 arXiv HTML 中可靠披露
- Pol Gàlvez:机构信息未在 arXiv HTML 中可靠披露
- Javier Hernando:organization=Universitat Politècnica de Catalunya (UPC), addressline=Carrer de Jordi Girona, 1–3, city=Barcelona, postcode=08034, country=Spain;organization=Barcelona Supercomputing Center (BSC), addressline=Carrer de Jordi Girona, 29, city=Barcelona, postcode=08034, country=Spain
📌 核心摘要
视听语音识别以音频加唇动视频为输入并输出转写文本,瓶颈是已标注视听数据稀缺且跨语言覆盖不均,低资源语言几乎无法训练多模态模型。该工作构建语音驱动视觉合成管线AVSynthGen,先用正面人脸检测加dlib68点关键点做嘴部可见性几何过滤,再为每条真实语音随机配一张过滤后人脸图像并重复成与音频等长静帧视频,最后用Wav2Lip加生成对抗网络变体只动画嘴部区域生成唇同步视频并继承原音频转写标签。随后在真实、合成与混合数据上微调AV-HuBERT英文预训练编码器加随机初始化6层Transformer解码器。西班牙语场景验证合成作为增强的叠加价值,加泰罗尼亚语场景验证零真实视听下的独立训练可行性,评测只在真实视听测试集上计算词错误率WER。与直接收集更多真实视听语料不同,该方法把大规模纯音频语料转化为可扩展的唇同步视觉监督,使视觉模态可随音频资源线性增长而不改变识别架构。在CMU-MOSEASes基准视听评测设置下,MixedVisuales的WER为12.9%,低于RealVisuales的WER15.4%。结论仅适用于嘴部可见的近正面朗读与广播类场景,对强姿态变化、自发重叠语音与极端噪声的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/Pol-Buitrago/SynthAVSR — 链接可访问(HTTP 200)
模型相关资源:https://dl.fbaipublicfiles.com/avhubert/model/lrs3_vox/clean-pretrain/large_vox_iter5.pt — 链接可访问(HTTP 200)
复现相关资源:https://github.com/Pol-Buitrago/SynthAVSR — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 又安静又准确的角落是空的:给 Whisper 同时补上该闭嘴和该开口的证据
标签:#语音识别 | #数据增强 | #多语言 | #基准测试 | #数据集
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Husein Zolkepli:Scicom (MSC) Berhad, Malaysia
📌 核心摘要
Whisper在无语音音频上虚构流利语句且经伪标签蒸馏污染后代模型,任务要求输入任意音频时仅在有声学证据时输出转写、无语音时输出空白,难点是仅加负样本的抑制训练会形成拒绝发射先验而误删真实语音。作者先构建八臂基准同步度量无语音抑制与真实语音恢复,使只输出空白的模型无处隐藏并为每轮微调提供同一轴线比较。再从非语音输出中归纳40891条100种语言幻觉词表并经文本到语音合成为真实发音的正样本,使同一文本既出现在空白目标侧又出现在转写目标侧。最后以空白标注噪声音乐加真实语音的混合数据对whisper-large-v3做低秩适配与全量配对微调,迫使模型依据声学证据而非语言先验决定停止还是转写,相对仅过滤语料或仅加负样本的关键差异是同时教授抑制与判别。在八臂基准评测下,最优检查点的静音词发射错误率为2.4%,低于基线whisper-large-v3的错误率61.9%。其适用边界受限于16kHz近场合成与朗读类正样本及马来加权混合训练,全部微调在FLEURS多语言字符错误率上差于基线,窄带电话语音与极低覆盖语言等场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 整句判情绪为何不够:把情绪放回语音时间轴上的定位与训练
标签:#语音情感识别 | #SFT | #音频事件检测 | #数据集构建 | #语音
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Abdelrahman Mohamed:Aalborg University;Pioneer Centre for AI
- Lars Kai Hansen:Technical University of Denmark;Pioneer Centre for AI
- Zheng-Hua Tan:Aalborg University;Pioneer Centre for AI
📌 核心摘要
音频情绪识别(Audio Emotion Recognition,AER)长期把整段录音判为单个标签,在多人、重叠与背景笑声下标签归属含糊不清。本文把任务重构为时间情感定位(Temporal Affective Grounding,TAG),要求模型输出多个语音片段各自的起止时间、转写、音色描述(tone description)与情绪标签。数据链先用语音活动检测(Voice Activity Detection,VAD)与 WhisperX 强制对齐清洗 IEMOCAP、MELD 与 Emov-DB,再由 Flamingo-Next 生成音色并经 openSMILE 声学特征规范化,最后拼接成含 2 到 4 个片段的多段样本。训练提出掩蔽时间情感定位(Masked Temporal Affective Grounding,M-TAG),在完整语言建模损失外增加情绪首词元损失与距离加权时间戳损失,并在第二遍前向前向中掩蔽音色与语音上下文以迫使模型依赖音频。相对最强基线 Audio-Reasoner,EMO-TAG 在 MELD 多段集情绪时长 F1 达到 54.55%,超出 23.12 个百分点,IEMOCAP 多段集达到 63.72%,超出 35.17 个百分点。该结论限于 8 类基本情绪与最长 30 秒的拼接评测,细粒度情绪与真实长对话外推尚未验证。单次训练使用 8 张 AMD MI250X 约 46 小时,全部探索约 30000 GPU 小时。
🔗 开源资源
第三方资源:https://huggingface.co/Qwen/Qwen2-Audio-7B-Instruct — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/openai/whisper-large-v3 — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/nvidia/audio-flamingo-next-think-hf — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/Qwen/Qwen3-14B — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/BAAI/bge-large-en-v1.5 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 不等后端说完就开口:在 80 毫秒帧里直接塞进原文的上下文跨接
英文题目:Context Spanning: A Communication Framework for Full-Duplex Speech Models and External LLM Backends
标签:#全双工语音交互 | #检索增强 | #语音 | #流式处理 | #实时处理
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Seonghyeon Go:机构信息未在 arXiv HTML 中可靠披露
- Yongwoo Kim:机构信息未在 arXiv HTML 中可靠披露
- Hyeonjin Cha:机构信息未在 arXiv HTML 中可靠披露
- Jaeho Shin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音交互要求模型在持续听与说的同一时间轴上完成取轮、打断与后台应答,输入为用户与智能体双路音频流及内部文本思考,输出为语音与文本的同步延续,难点在于检索结果到达时不能阻塞80 ms级帧解码与自回归生成。方法链第一步由前端复用Moshi架构做实时双工解码,在预测到检索触发词后生成不依赖外部知识的前导填充并将实时转写累积的上下文库请求送入异步后端。第二步由外部大模型后端基于上下文库执行检索增强、工具调用与答案合成,其返回的文本结果以内嵌起始与结束标记的跨段形式等待注入。第三步在后端就绪并抢到帧预算后,前端将跨段以块预填充单次前向写入流、更新键值缓存后继续自回归解码主体应答。与压缩后加到用户音频向量的做法不同,该机制直接注入原始文本并在训练时屏蔽跨段损失,从而保留精确数值并避免误认为用户发言。在口语问答与数学推理评测中,搭配GPT-4.1后端时在GSM8K上响应正确率达到67.4%,显著高于同类压缩注入基线。该结论仅适用于单轮知识问答与工具调用场景,多轮衔接对话与复杂打断下的外推尚未验证。训练使用2张RTX Pro 6000完成一个全参数epoch,推理需前后端各占1张同型GPU,原文未披露完整训练与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/mindlogic-ai/ContextSpanning → https://github.com/mindlogic-ai/Context-Spanning — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 在极 noisy 警用电台上做伪标签:内部置信度失灵时用外部语义判断来过滤
标签:#语音识别 | #半监督学习 | #领域适应 | #低资源
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Kaavya Chaparala:机构信息未在 arXiv HTML 中可靠披露
- Su Huang:机构信息未在 arXiv HTML 中可靠披露
- Stephen L. Miller:机构信息未在 arXiv HTML 中可靠披露
- Rhiannon N. Miller:机构信息未在 arXiv HTML 中可靠披露
- Anjalie Field:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
广播警务通信(Broadcast Police Communication,BPC)语音识别(Automatic Speech Recognition,ASR)需将高噪声短语音转写为文本,难点在于信道噪声重、术语地域化强且人工标注昂贵,而现成大模型词错率极高。该工作构建无监督伪标签(Pseudo-labeling)链条:先用现成模型对无标注训练音频生成伪转写并去除循环幻觉,再经由过滤器筛除低质样本,最后用保留数据微调原模型形成闭环。相对依赖模型内部对数概率与注意力权重的过滤,外部大语言模型(Large Language Model,LLM)评审人利用参数知识判断警务语境合理性,机制上跳出失配声学下的过度自信。经定制数字归一化后,在芝加哥语料上较强基线词错率由0.3439降至0.3051,在巴尔的摩语料上由0.3611降至0.3496。链条还考察多轮自训练与跨模型伪标签复用,以检验新增映射能否带来持续增益。其结论适用边界受限于巴尔的摩与芝加哥两城英语警用电台,甲骨文阈值过滤仍大幅领先,跨城直接迁移失效且多轮迭代增益微弱,更大范围外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
数据相关资源:https://broadcastify.com → https://www.broadcastify.com/ — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/1808.10583 — 链接可访问(HTTP 200)
第三方资源:https://ieeexplore.ieee.org/document/9814838/ — 链接可访问(HTTP 202)
第三方资源:https://ieeexplore.ieee.org/document/9585401/ — 链接可访问(HTTP 202)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 不靠参数记忆回答教义:一个阿拉伯语语音平台如何把检索、配额与可观测性做成可运行产品
英文题目:Muslim: A Deployed Arabic Voice AI Platform for Grounded Islamic Knowledge
标签:#语音对话系统 | #检索增强 | #语音识别 | #文本到语音
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Yahya Mohamed Elnawasany:Independent Researcher, Egypt
📌 核心摘要
该平台输入为阿拉伯语口语提问与古兰经朗读音频,输出为带出处语音答复、真实诵读片段与朗读纠错反馈,难点在于方言与经文词汇识别偏差、宗教内容不可幻觉以及单机图形处理器容量下的实时服务。语音链路先由端点切分与NeMo阿拉伯语转写将音频变为文本,其输出进入大语言模型由其决定调用六路检索工具,检索命中的经注圣训与元数据再进入生成与播报环节。经文朗读请求绕过合成直接播放真人诵读以保全 tajweed 规范,普通答复则走自托管合成输出并由令牌签入配额与容量判断。与通用助手的参数记忆作答不同,该设计强制先检索后生成并以确定性归一化验证器替代声学 tajweed 建模。在SILMA开源阿拉伯语语音合成基准测试集下,Fasih-TTS-V1的CER为1.3%,低于人工录音基线的CER 1.8%。在124例自带朗读验证套件下确定性验证器准确率为98.4%,典型条件下端到端语音延迟为0.9秒至1.7秒。适用边界是现代标准阿拉伯语与已索引经注圣训范围,方言、未覆盖教法问题与单主机宕机时无法保证服务。原文未披露训练、推理或部署成本。
🔗 开源资源
- 模型相关资源:https://huggingface.co/NightPrince — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 在脑电噪声中做减法:AFA-Net 如何用差分注意力找准注意说话人
英文题目:AFA-Net: A Differential Attention Approach for Auditory Attention Detection
标签:#言语神经解码 | #注意力机制 | #脑信号 | #CNN | #言语感知
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Philip H. Lee:机构信息未在 arXiv HTML 中可靠披露
- Shreeram Suresh Chandra:机构信息未在 arXiv HTML 中可靠披露
- Karan Thakkar:机构信息未在 arXiv HTML 中可靠披露
- John H.L. Hansen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
听觉注意检测(Auditory Attention Detection, AAD)以多通道脑电(Electroencephalography, EEG)为输入,输出双说话人场景下被注意说话人的二分类判决,难点在于EEG信噪比非常低且伪迹与背景活动易被传统注意力平均化。本文方法链由三步构成:共空间模式(Common Spatial Patterns, CSP)预处理先增强注意与非注意状态的类别可分性,时空补丁模块(SpatioTemporal Patch Module, STPM)再用时域与空域卷积提取局部嵌入,焦点注意模块(Focus Attention Module, FAM)最后以差分注意力捕捉全局依赖并送入分类器。与香草注意力(Vanilla Attention)被迫分配全正权重不同,差分机制用双注意力图相减实现零权重乃至负权重,从而显式抑制无关特征。在KUL数据集2s决策窗上该模型达到96.8%准确率,相对最强基线MHANet的95.9%形成显著优势并保持极低参数量。该结论目前仅限于受试者内划分的丹麦语与荷兰语双人听音任务,未验证跨被试、跨语言与实时耳机端迁移能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 循环配乐不跟随画面时:冻结时空编码器加微调解码器为何在 SNES 上更稳
标签:#音乐生成 | #多模态学习 | #视频到声音生成 | #数据集 | #游戏音频
评分:7.0/10 | 创新 1.1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Felipe Marra:机构信息未在 arXiv HTML 中可靠披露
- Lucas N. Ferreira:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理以游戏画面为条件生成背景音乐的视频到音乐任务,输入为10秒游戏视频片段,输出为30秒波形音乐,难点在于渲染画面与真实视频分布差异大,且合成配乐按关卡循环而非跟随屏幕事件。方法链分为三步:先用音频指纹为每个游戏建Dejavu库,把含音效解说的实录音频映射到Zophar’s Domain的干净原声并以置信度0.01过滤,再把三十二帧视频经编码器转为特征序列并经线性投影送入解码器,最后由微调后的MusicGen medium解码器经交叉注意力自回归生成离散音频token序列。与经文本或文本嵌入中转的范式不同,主模型采用直接映射且冻结编码器只训练解码器,保留预训练视觉特征稳定以适配跨域泛化。在测试集按体裁平均的客观评测下,冻结ViViT的FADVGGish为10.53±3.60,低于MusicGen Base的FADVGGish 13.90±4.09。该结论仅在超级任天堂复古像素风格与11类体裁划分内验证,对现代3D游戏与事件同步型配乐尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://felipemarra.github.io/demo-v2m-4-gameplay-videos-v1/ — 链接可访问(HTTP 200)
数据相关资源:https://felipemarra.github.io/demo-v2m-4-gameplay-videos-v1/ — 链接可访问(HTTP 200)
数据相关资源:https://www.zophar.net/music/nintendo-snes-spc — 链接可访问(HTTP 200)
演示资源:https://felipemarra.github.io/demo-v2m-4-gameplay-videos-v1/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 四人竞说加噪声下只看脑电不够:MAESTRO 把注视、头动和第一视角一起录下来
英文题目:MAESTRO: a Multimodal Auditory-attention Egocentric Speech-TRacking Open corpus
标签:#言语神经解码 | #多模态学习 | #数据集 | #基准测试 | #脑信号
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- K M Naimul Hassan:机构信息未在 arXiv HTML 中可靠披露
- Ali Alavi:the Department of Computer Science and Engineering, The Ohio State University, Columbus, OH 43210 USA
- Donald S. Williamson:the Department of Computer Science and Engineering, The Ohio State University, Columbus, OH 43210 USA
📌 核心摘要
听觉注意解码需从听者信号中判别四路前方竞争英语语音加后方家用噪声中的被注意说话人,难点在于真实混响与可变信噪比下神经跟踪微弱且眼动头动与神经信号相互耦合。基线先对窗内四路语音包络做排序直方图均衡以消除削波幅值捷径,使四路包络仅保留时序差异并输出净化后的包络。接着多编码器扩张卷积分别编码听者模态与净化语音包络,脑电分支经时间中心化相关得到槽位分数而行为分支经时域池化与感知机得到位置分数。然后两类分数相加判决注意槽位,并以端到端融合训练配合模态丢弃防止单一模态主导。与仅用脑电相比,该融合引入朝向性行为证据从而在短窗下互补神经信息。在留一被试评测条件下按信噪比分箱的解码任务下,最优多模态组合的准确率为60.9%,高于脑电基线的准确率54.2%。结论仅适用于固定声源位置与中等信噪比英语听音,移动声源与跨语言外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/ASPIRE-OSU/MAESTRO — 链接不可用(HTTP 404)
数据相关资源:https://huggingface.co/datasets/aspire-osu/maestro-eeg-dataset — 链接不可用(HTTP 401)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 先算峰在哪里再验证:解码器痕迹支撑的廉价合成语音初筛
英文题目:Tracing Decoder Artifacts for Compact Synthetic Speech Screening
标签:#语音伪造检测 | #时频分析 | #集成学习 | #高效推理 | #语音
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yi Chen Liu:机构信息未在 arXiv HTML 中可靠披露
- Jian Liu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为任意16 kHz语音波形,输出为真伪二值判定与可疑样本转交决策,难点在于不调用大型预训练编码器仍要保持极低漏检并应对生成器漂移。该文先解析解码器上采样与逆短时傅里叶变换(Inverse Short-Time Fourier Transform, iSTFT)重建可能产生的周期性谱峰位置,再在波形端测量宽带谱残差与候选频率局部峰显著性,随后提取线性频率倒谱系数(Linear-Frequency Cepstral Coefficients, LFCCs)的分布统计与调制谱以刻画谱形时变,最后由梯度提升树(Gradient-Boosted Tree)融合四组特征完成低成本初筛。与端到端波形网络不同,该方法以生成机理推导测量位置并直接计算声学证据,保留了可解释的伪影链路。在7种合成器与2种真人源构成的同源测试集下,所提筛选器的等错率指标为0.021%,低于RawTFNet的等错率指标0.046%。在留一生成器与未见合成器上性能波动明显,跨架构外推仍是主要边界,级联分析显示其可在0.050%漏检约束下大幅减少后端大模型调用,原文披露了前后端单次推理能耗估计与部署能量模型。跨生成器泛化波动表明其适用边界受限于未见解码器架构,外推至新合成器尚未验证。原文在A100-SXM4-80GB硬件上实测后端单次推理开销并建模级联延迟与吞吐下的能量收益。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 双耳空间线索如何解开同类多人中的发声者混淆
标签:#音视频理解 | #多模态学习 | #声源定位 | #空间音频信号 | #基准测试
评分:6.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Saijun Wang:机构信息未在 arXiv HTML 中可靠披露
- Guanfeng Tang:机构信息未在 arXiv HTML 中可靠披露
- Hongbo Zhao:机构信息未在 arXiv HTML 中可靠披露
- Zhicheng Lei:机构信息未在 arXiv HTML 中可靠披露
- Yutong Zhang:机构信息未在 arXiv HTML 中可靠披露
- Wei Ye:机构信息未在 arXiv HTML 中可靠披露
- Rui Fan:organization=College of Electronic and Information Engineering, Tongji University, Shanghai 201804, China;organization=College of Electronic and Information Engineering, Shanghai Institute of Intelligent Science and Technology, State Key Laboratory of Autonomous Intelligent Unmanned Systems, Tongji University, Shanghai 201804, China
📌 核心摘要
双耳音视频实例分割 Binaural Audio-Visual Instance Segmentation 即 BiAVIS 以同步双耳音频与单帧 RGB 图像为输入,输出可见发声实例的掩膜与类别,难点在于同语义类多候选间的实例级歧义。方法 BiAVISM 分三步推进:双通道语谱编码与双耳差异编码先从左右声道提取蕴含耳间差的特征 \(F_b\) 并送入后继模块;纯音频声源定位分支将该特征池化后解码为发声概率图与类别概率图,为分割提供空间与语义先验;查询级音视融合以双耳特征为键值对目标查询做交叉注意力,再由类掩膜解码器输出实例并用一致性损失约束。与单声道方法仅做全局语义条件不同,该机制在查询进入视觉解码前即注入位置相关的听觉先验,因而能抑制显著但静默目标。在 BiAVIS-Bench 上相对最强单声道基线在 mAP 上提升 17.22% 且在 FSLA 上提升 7.71%,所对比的最强基线分属不同方法。结论限于相机与仿真头相对位姿固定的采集条件与有限类别,跨设备与强混响泛化尚未验证。单帧 1280×720 推理中位时延约 145 ms 且峰值显存约 2.6 GiB。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 分得开还要对得上人:雷达位移给鸡尾酒会分离定序
标签:#语音分离 | #多模态学习 | #说话人识别 | #数据集 | #语音
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yanlin Xu:机构信息未在 arXiv HTML 中可靠披露
- Yiwei Ru:机构信息未在 arXiv HTML 中可靠披露
- Mupei Li:机构信息未在 arXiv HTML 中可靠披露
- Yongji Liu:机构信息未在 arXiv HTML 中可靠披露
- Jie Wang:机构信息未在 arXiv HTML 中可靠披露
- Zhenan Sun:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
单通道鸡尾酒会感知需同时从单麦克风混合中分离波形并将各分离流归属到物理声源,纯音频盲分离依赖声学统计可分性而存在固有置换模糊且缺乏空间约束。所提两阶段框架先对混合音频编码并对各源雷达位移序列提取喉部机械运动特征,再经门控残差融合将雷达先验注入双路径循环网络分离器得到无序波形。随后冻结分离器,将无序语音槽位编码为音频流嵌入并将雷达序列池化为雷达身份嵌入,以二者内积相似矩阵与双向匹配损失学习跨模态一对一对应。与仅优化排列不变信失真比的纯音频基线不同,该方法以距离分辨的电磁反射几何约束打破对称性,为分离提供互补运动线索并显式解决有序归属。在两人干净混合分离任务下,RadarVox的有序SI-SDR为7.11,高于DPRNN的有序SI-SDR为-6.44。该结论限于近距离朗读式采集与库内混合生成,真实并发重叠、大动作干扰及远距离衰减下尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 跨模态蒸馏没有教会听觉分辨行人,只是把判定点推向多数类
英文题目:Cross-Modal Knowledge Distillation for Acoustic Pedestrian Detection
标签:#音频分类 | #知识蒸馏 | #环境声 | #音视频
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yonghyun Kim:机构信息未在 arXiv HTML 中可靠披露
- Chaeyeon Han:机构信息未在 arXiv HTML 中可靠披露
- Sancho Gatungay:机构信息未在 arXiv HTML 中可靠披露
- Subhrajit Guhathakurta:机构信息未在 arXiv HTML 中可靠披露
- Alexander Lerch:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
声学行人检测以单通道环境音频为输入,逐秒判定记录器附近6米内有无行人,难点在于脚步声微弱且易被城市噪声掩蔽,同时标签重度不平衡。先由冻结Mask2Former视觉分支以同区域视频裁剪为输入,抽取最高分行人查询并经按折拟合的二分类头输出教师软目标,为跨模态监督提供来源。再以单通道音频为输入,经冻结VGGish编码器与单层多头Transformer及二分类头生成学生预测,并将上一步教师软目标与学生预测共同送入蒸馏加加权交叉熵训练目标,且该音频分支为唯一的推理通路。最后以真值与教师多数类概率质量为输入,由条件门控按阈值决定是否保留行人样本蒸馏项,幸存项经重归一化后与加权交叉熵加权相加,从而改变训练目标构成。相对无条件蒸馏,该少数类选择性监督的实际意义在于分离操作点漂移与排序判别增益,避免将多数类准确率上升误读为检测能力提升。在ASPED留一会话5折交叉验证设置下,LogitKDTFD的宏准确率为73.7%,高于基线的宏准确率72.9%。结论仅适用于重度不平衡下的视频到音频存在性检测,未验证其他不平衡比例与多轮统计稳定性。该结论的适用边界受限于单校园ASPED与单轮运行,尚未验证其他不平衡比例与多折统计稳定性下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/yonghyunk1m/cmkd-ped-detect — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
31. 排序对了还不够:用校准与顺序监督补上嵌入式关键词检测的阈值缺口
英文题目:CORD-KWS: Calibrated, Order-Aware Detection for Open-Vocabulary Keyword Spotting
标签:#关键词检测 | #对比学习 | #CTC | #语音
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ramesh Gundluru:机构信息未在 arXiv HTML 中可靠披露
- Adarsh Arigala:机构信息未在 arXiv HTML 中可靠披露
- Sri Rama Murty Kodukula:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
开放词汇关键词检测(Open-Vocabulary Keyword Spotting)要求对任意文本关键词直接判定语音是否包含该词,难点在于发音混淆词的区分和跨关键词统一阈值的检测校准。该方法采用 Conformer 声学编码器与双向门控循环单元(Bidirectional Gated Recurrent Unit,BiGRU)音素文本编码器分别生成共享空间的语音嵌入与文本嵌入并计算余弦相似度,再按音素编辑距离挖掘难负样本扩充对比分母以强化混淆区分,接着在编码器输出端池化前并联帧级联结时序分类(Connectionist Temporal Classification,CTC)头约束音素顺序,最后经单调仿射加 Sigmoid 的检测头对绝对分数做二分类监督。相比交叉注意力(Cross-Attention)逐对重算融合表示的做法,该路线保留单次声学编码加内积打分的 O(1) 注册优势,而单调头只修正整体偏移而不改变排序。与已有最强基线相比,在 LibriPhrase-hard 上等错误率(Equal Error Rate,EER)由约 20.09% 降至 9.64%,在 LibriPhrase-easy 上达到 0.43%,同时超越交叉注意力最强基线 PLCL@T 的 9.96% 和 1.21%。该结论目前仅在孤立英语短语对评测上成立,连续语音、多语言和噪声外推尚未量化验证。原文未披露训练、推理或部署成本实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
32. 标签写对了声音却不对:NVAlign 用可微奖励直接打通连续自回归流匹配语音
标签:#文本到语音 | #流匹配 | #后训练 | #语音
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Qiaolin Wang:机构信息未在 arXiv HTML 中可靠披露
- Pedro Sandoval-Segura:机构信息未在 arXiv HTML 中可靠披露
- Anunaya Joshi:机构信息未在 arXiv HTML 中可靠披露
- Edvardas Jurkonis:机构信息未在 arXiv HTML 中可靠披露
- Jake Downie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
连续自回归流匹配(Autoregressive Flow Matching,AR-FM)文本到语音(Text-to-Speech,TTS)需按内联非言语发声(Non-Verbal Vocalization,NVV)标签生成笑、叹息等事件,但稀有标签监督稀缺导致漏发与混淆。NVAlign先在NVV标注语料上分别监督微调TTS与基于Qwen3-Omni-30B的NVV感知自动语音识别(NV-Aware ASR,NV-ASR)模型,再冻结NV-ASR并以目标标签概率为可微奖励。生成时无梯度采样声学补丁序列,再经两步梯度代理回传奖励梯度并联合更新自回归骨干与流匹配头,同时以说话人一致性、相似性、预测平均意见分与信号惩罚及参考速度正则约束漂移。相对流匹配似然比与偏好方法,该机制避免随机微分方程似然估计,直接优化标签似然并保留连续采样可微性。在100文本独立听感集上VoxCPM2人工准确率由43.2%升至47.6%,dots.tts由63.2%升至65.4%,英语生产系统由39.8%升至54.0%;NVV-SuperBench人工子集上VoxCPM2由27.4%升至34.9%,生产系统由33.7%升至53.7%,但dots.tts由57.1%降至54.4%。结论限于离散单标签事件与冻结评测器覆盖标签集,重叠或连续发声、韵律退化及训练推理成本尚未验证。
🔗 开源资源
- 第三方资源:https://github.com/yifan123/flow_grpo — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
33. 只有 14 小时标注也能做识别:Basaà语调迁移与字符级解码的第一条基线
英文题目:Automatic Speech Recognition for the Basaà Language: A Low-Resource Approach
标签:#语音识别 | #SFT | #低资源 | #跨语言 | #语音
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Sophie Gertrude Ngo Mock:机构信息未在 arXiv HTML 中可靠披露
- Charles Moudina Varmantchaonala:机构信息未在 arXiv HTML 中可靠披露
- Paul Dayang:机构信息未在 arXiv HTML 中可靠披露
- Jean Michel Nlong:机构信息未在 arXiv HTML 中可靠披露
- Christopher Gies:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
巴萨语自动语音识别的输入为16 kHz单声道原始波形,输出为带声调变音符号的巴萨语字符序列,难点在于仅有十余小时标注语音、声调最小对立、元音长短对立、前鼻化与内爆音缺失于主流预训练音素分布以及黏着形态带来的开放词汇。先将16 kHz单声道原始波形送入七块卷积特征抽取器,负责从原始采样学习局部声学模式并压缩输出约20ms一帧的潜表示以保留声调谱时细节,再将该潜表示送入24层跨语言Transformer编码器,负责建模长时依赖与跨语言声学模式并经全量微调适配新音系输出上下文表示。最后将该上下文表示送入线性联结时序分类头,负责映射为逐帧巴萨语字符分布并以联结时序分类损失学习无帧级对齐映射,其输出经贪婪解码折叠重复与空白得到最终转写。与为英语和法语设计的需大词典与海量数据的传统架构不同,该方案依赖多语言自监督表示迁移加免词典字符建模,直接复用已习得的班图语系共性而无需发音词典。在Mozilla Common Voice 21.0巴萨语验证集评测下,终期模型的WER为14.13%,低于初期模型的WER 93.77%。结论仅适用于以Mpo方言Babimbi变体为主的朗读式短句场景,向其余11种方言、自发对话及噪声条件的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://mozilladatacollective.com/datasets/cmqigrvys00i3nr07ngkpb6b2 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
34. 能认出指令却不敢静默:语音智能体何时该行动
英文题目:Do Audio LLMs Listen Before They Act? Diagnosing Acoustic-Context Gating in Voice Agents
标签:#语音交互 | #基准设计 | #后训练 | #音频大模型
评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yanjie Zhang:机构信息未在 arXiv HTML 中可靠披露
- Nanchen Hu:机构信息未在 arXiv HTML 中可靠披露
- Yushi Sun:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音代理输入为连续语音与工具清单,输出为保持静默、调用工具或直接回答,难点在于相同文字在穿戴者近场指令与旁观者远场话语下应触发相反动作。方法链先由VGBench构造侧话归因、自言自语拒动与说话人切换三类反事实诊断,将指定文本固定而联合改变声源、距离渲染与时间边界,再用统一动作契约对现成音频大模型做贪婪解码行为探测,最后以联合监督微调VoxGate学习条件动作映射并用反事实配对组相对策略优化做探索性保持。与把编址当作前端检测分数的前人工作不同,该文把多线索声学语境直接绑定到可执行动作选择而非感知答案。在固定20%VGBench测试集下,VoxGate监督训练的切换静默准确率为91.3%,高于Base Qwen的切换静默准确率0.0%。联合训练在保持近场穿戴者与纯文本对照工具选择的同时学习门控,因子化对照进一步分离声源改变与远场渲染的独立效应。上述结论适用边界受限于单次划分与单次运行,尚未验证开放说话人集合、自然旁观者语音与新房间混响下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
35. 先算通道比值,再学有界修正:PRIME-ANC 一次前向合成听者专属滤波器
标签:#主动降噪 | #CNN | #数据增强 | #高效推理
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yaokun Huang:机构信息未在 arXiv HTML 中可靠披露
- Chunyang Xu:机构信息未在 arXiv HTML 中可靠披露
- Haowen Hua:机构信息未在 arXiv HTML 中可靠披露
- Sen Lin:机构信息未在 arXiv HTML 中可靠披露
- Shichao Hu:机构信息未在 arXiv HTML 中可靠披露
- Mengyao Zhu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
前馈主动噪声控制 Active Noise Control / ANC 需为每个听者声学条件由校准的主路径与次路径合成因果有限脉冲响应 Finite Impulse Response / FIR 滤波器,难点在于次路径谱零点与非最小相位使直接求逆不稳定且稀疏支撑难以覆盖新听者。PRIME-ANC 先由校准估计构造正则化路径比幅度基,再由共享卷积网络依据路径特征预测正负 12 dB 有界对数幅度修正,接着经实倒谱最小相位 Minimum-Phase / MP 重建与截断得到 2048 抽头 FIR 并以实测降噪目标端到端训练。与固定基线和跨路径共享滤波相比,该机制把解析逆的物理先验与数据驱动的路径相关修正解耦,避免直接预测抽头的相位不稳定问题。在PANDAR耳机库评测设置下,PRIME-ANC的降噪Noise Reduction / NR指标为17.76 dB,高于比率基线的降噪Noise Reduction / NR指标10.09 dB。结论仅适用于校准路径准确且噪声分布接近训练的耳机场景,未验证佩戴偏移与路径估计误差下的外推能力。原文披露单模型训练约 161.6 s 与单查询合成约 0.717 ms 的核心耗时,但未披露完整训练硬件配置与端到端部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
36. 缺失与噪声并存时,用可靠性给每个模态定压缩与补全的额度
英文题目:Reliability-aware Cross-sample Enhancement for Robust Multimodal Sentiment Analysis
标签:#语音情感识别 | #检索增强 | #多模态学习 | #鲁棒性
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Menghua Jiang:School of Computer Science and Engineering, Sun Yat-sen University
- Haokai Gao:School of Computer Science, South China Normal University
- Xiangui Kang:School of Computer Science and Engineering, Sun Yat-sen University
- Haifeng Hu:School of Electronics and Information Technology, Sun Yat-sen University
- Sijie Mai:School of Computer Science, South China Normal University
📌 核心摘要
多模态情感分析需从文本、音频与视觉序列预测连续情感分或离散类别,现实难点是噪声污染与模态缺失常常未知且共存。可靠性感知跨样本增强先以自适应变分信息瓶颈将各模态映射为超球面分布并按可靠性压缩,输出去噪后的单模态表示进入下一步。可靠性感知模态增强再从记忆库检索高置信且标签一致的邻居来校准当前表示,记忆库按蓄水池采样维护以提供稳定候选。随后超模态生成与多级融合将增强特征、共享上下文与原始特征按浓度参数加权聚合后输出预测。与已有信息瓶颈或跨样本增强方法的关键差异是同一不确定性量同时控制压缩强度、邻居选择与融合权重,因而能一致地抑制不可靠模态。在CMU-MOSI完整模态测试集下,RCE的Acc7准确率为50.22%,高于w/o HMG变体的Acc7准确率46.72%。其中等强度椒盐噪声下在CMU-MOSEI上落后于KAN-MCP与HME,显示其适用边界受限于中等强度突发离群点与大数据集检索融合稳定性,跨语言与实时交互场景尚未验证。原文复杂度分析披露了参数量、计算量与单轮训练耗时,表明其训练成本中等增加而推理开销主要来自记忆库检索。
🔗 开源资源
- 第三方资源:https://imotions.com/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
37. 先降噪再融合:差分注意力如何让脑电和语音互补
英文题目:Differential Attention Unlocks Complementary EEG and Speech Fusion for Emotion Recognition
标签:#语音情感识别 | #多模态学习 | #注意力机制 | #语音 | #脑信号
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Philip H. Lee:\authorrefmark1Independent Researcher, USA
- Shreeram Suresh Chandra:\authorrefmark2Center for Language and Speech Processing (CLSP), Johns Hopkins University, Baltimore, MD, USA
- John H.L. Hansen:\authorrefmark3Center for Robust Speech Systems (CRSS), University of Texas at Dallas, Richardson, TX, USA
📌 核心摘要
多模态情感识别的输入为同步脑电信号与语音波形,输出为离散情绪类别,难点在于眼动肌电伪迹会污染共享表示并导致朴素融合不如单语音模态。该工作提出情感语音脑EmoSpeechBrain,先以局部时空卷积提取脑电局部结构,再用6层差异注意力抑制共有噪声并建模全局依赖,接着经双向跨模态注意力交互后由门控对齐模块完成共享空间对齐与筛选。与香草注意力仅依赖高频段不同,该设计通过两路注意力图相减显式稀疏化伪迹响应,并以瓶颈门控保留跨模态互补信息。语音侧采用冻结的WavLM-Large提取声学表征,从而为不同脑电编码器比较提供统一公平的基准条件。在PME4数据集留一被试交叉验证下平衡准确率达到0.734,显著高于最强脑电基线CBraMod的0.605与单模态对照。作者承认未与既有脑电语音融合方法同协议对比,因此结论外推至一般融合策略仍待验证。原文未披露训练、推理或部署成本,未提供代码与权重链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
38. 音节模型能否对上真实舌唇动作:用 CTW 在 Maeda 空间里检验语音规划
英文题目:Assessing a Mathematical Model of Syllable Production via CTW Alignment with EMA Data
标签:#强制对齐 | #统计分析 | #语音 | #发声与构音
评分:6.1/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Frédéric Berthommier:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该研究输入为规则法语短语的文本音节结构与单说话人电磁发音仪(Electromagnetic Articulography, EMA)记录,输出为六维前田(Maeda)参数轨迹与共振峰(formant)轨迹的结构对应性判定,难点在于协同发音调制与语速差异使直接帧对比不可行。方法链分三步:先将传感器坐标线性投影到功能性发音自由度并做拷贝合成得到参照轨迹,再由复平面音节图前向生成具前视规划的合成轨迹,最后用非对称典型时间规整(Canonical Time Warping, CTW)将合成轨迹扭曲到实测时间网格后比较相关性。该路线与神经端到端发音反演的差异在于以显式音节图与无权重叠加协同发音代替数据驱动隐变量,保留语言学可读控制变量。在63个短语配对检验中,一致条件F1相关均值0.83、F2相关均值0.85,显著高于异语音配对且经Holm校正后9个指标均显著,支撑语音一致带来结构对应。结论仅适用于高度规则、音系简化为4元音加2辅音类比的受控法语材料与单人数据,无法外推自发语音、多说话人或完整辅音系统。原文未披露训练推理部署成本,无神经训练过程。
🔗 开源资源
代码相关资源:https://github.com/FBerthommier/EMA-to-Maeda — 链接可访问(HTTP 200)
数据相关资源:https://doi.org/10.5281/zenodo.22961484 → https://zenodo.org/records/22961484 — 链接可访问(HTTP 200)
数据相关资源:https://github.com/FBerthommier/EMA-to-Maeda — 链接可访问(HTTP 200)
复现相关资源:https://doi.org/10.5281/zenodo.22961484 → https://zenodo.org/records/22961484 — 链接可访问(HTTP 200)
复现相关资源:https://github.com/FBerthommier/EMA-to-Maeda — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
39. 噪声下耳语转正常语音:不动转换器,只修复输入的内容特征
英文题目:WhisperVC-AV: Audio-Visual Content Restoration for Noise-Robust Whisper-to-Normal Voice Conversion
标签:#语音转换 | #多模态学习 | #音视频 | #鲁棒性
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ziyue Yin:机构信息未在 arXiv HTML 中可靠披露
- Dong Liu:机构信息未在 arXiv HTML 中可靠披露
- Ming Li:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
耳语到正常语音转换(Whisper-to-Normal Voice Conversion,W2N)需从缺乏周期激励的耳语中恢复语言内容与说话人身份,而环境噪声会进一步淹没本已脆弱的声学内容线索。WhisperVC-AV 先用冻结的声学编码器抽取含噪内容特征并结合同步唇动视频做输入侧修复,再将修复特征送入冻结的 WhisperVC 对齐网络与生成器完成跨发音映射与波形重建。修复环节先由时序卷积构建声学上下文并以其为查询在邻域内注意力选择视觉特征,再由声视上下文联合预测门控残差并叠加回原特征。与直接在转换器内融合视觉的方案不同,该设计将噪声鲁棒性与已学映射解耦,保留了预训练转换能力。在 AISHELL6-Whisper 视频子集 2248 条测试语音上,以 Qwen3-ASR 评估时 0 dB MUSAN 噪声下字符错误率(Character Error Rate,CER)由 WhisperVC 的 36.29% 降至 28.88%,6 种信噪比噪声平均由 20.43% 降至 16.58%。该结论限于近场同步唇视频与干净注册语音条件,未验证无约束视频、混响、含噪注册与人耳听感外推。原文未披露优化器、学习率、批量大小、训练轮数、硬件与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
40. 预言上限不是可实现的互补:冻结编码器下分支分歧为何换不成融合精度
标签:#语音情感识别 | #多模态学习 | #音视频 | #模型评估
评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Benjamin Hurt:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音视频情感识别的输入是人物说话的音频与面部视频片段,输出为离散情绪标签,难点在于双分支经常在不同样本上各对各错,而融合系统必须仅从输入判断该信谁。作者固定冻结音频与视觉编码器,只训练轻量多层感知机头,先分别得到音频分支与视觉集成的正确性,再定义预言机上限、相对强分支的头room与拼接融合的实际增益。相比把预言机差距直接读作可回收预算的惯例,该工作引入转换率与双错率,并以污染编码器、干净编码器与可控噪声退化对照分离分支精度与互补性。在CREMA-D语料下,干净音频编码器条件的预言机头room指标为+0.186,高于受污染编码器条件的预言机头room指标+0.055。拼接融合至多转化约半数头room,可学习路由器在各语料与编码器条件下均被普通拼接超越,说明硬选择回避了逐样本识别难题而固定混合更有效。该结论受限于冻结编码器、两套录音室语料与三格设计,未验证微调主干、自发野外数据与更强软融合的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
41. 把协和感写进可逆算子:对齐与插值不再只算欧氏距离
英文题目:Perceptually Motivated Alignment and Interpolation of Pitch-Aligned Time-Frequency Representations
标签:#音乐理解 | #信号处理 | #音乐 | #听觉与音乐认知
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Shahan Nercessian:机构信息未在 arXiv HTML 中可靠披露
- Jeff Sontag:机构信息未在 arXiv HTML 中可靠披露
- Alejandro Koretzky:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理音高对齐时频表示跨语境比对与连续过渡问题,输入为色度图等非负音高分布,输出为保持感知协和性的对齐置换或插值分布,难点在于调性模糊且欧氏色度距离不符合协和感知。首先将音调区间向量重构为可逆实数傅里叶算子并引入感知平滑,输出保留音高轴的滤波表示并送入对齐搜索。然后以该空间距离定义置换目标,用匈牙利算法求解线性分配近似并以2-opt贪心精化求解二次分配,其输出的对齐分布进入插值阶段。最后在四五度圈上做圆周最优传输插值,并用圆柱自编码器解耦音阶根音、密度与色彩以实现结构化连续变化。相比欧氏色度直接淡入淡出,关键差异在于权重编码协和先验且传输沿谐波近邻路径移动能量,因而过渡更符合声部进行与调性逻辑。在合成序列对齐任务下,Hungarian+2-opt的TIV距离指标为89.847,低于无对齐基线的TIV距离指标130.450。该结论适用边界受限于12维色度与小规模合成验证,尚未验证在真实录音、复调转录噪声及主观听感上的泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://tiv-ext.netlify.app — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
42. 分布对不齐时怎么办:最优传输在语音中的对齐与迁移教程
标签:#语音增强 | #文献综述方法 | #领域适应 | #语音
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:综述 | arXiv 原文
👥 作者与机构
- Xugang Lu:机构信息未在 arXiv HTML 中可靠披露
- Yu Tsao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文面向语音中噪声混响、说话人通道差异及声学与文本异构表示导致的分布失配,输入为源域与目标域语音样本集或声学序列与语言序列,输出为分布间距离、对齐耦合与跨域映射后的增强特征和识别结果,其难点在于时序动态、支撑集不重叠与跨模态不可比。方法链分三步:先以蒙日问题、Kantorovich松弛、Wasserstein距离与对偶势建立静态最优传输基础并由Brenier定理刻画最优映射,其输出的耦合与势函数进入下一步;再以Benamou-Brenier公式、连续性方程、薛定谔桥与流匹配建立动态随机演化视角,将静态耦合扩展为概率路径;最后以熵正则Sinkhorn、神经最优传输与Gromov-Wasserstein实现可计算对齐,并嵌入语音增强、识别与情感和伪造检测的损失或适配模块。与逐样本均方误差、平均绝对误差、交叉熵及KL散度相比,关键差异在于沿Wasserstein测地线度量几何差异并允许质量分裂与跨空间结构对齐,因而在域偏移下更具可解释的迁移意义。在语音增强任务评测设置下,PFPL的PESQ分数高于MAE基线的PESQ分数的定性描述仅见数值1与编号22而无两方法可比数值,故原文未提供可核对的关键定量结果。结论适用边界仅限存在分布偏移或跨模态共享结构时成立,同分布或无对应关系时的增益尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
43. 预处理链为何先击中无声阻塞:阈值能救回 F1 却救不回排序
英文题目:Audio Preprocessing Effects on Stuttering Detection: A Class-Specific Analysis
标签:#病理语音评估 | #统计分析 | #语音 | #鲁棒性
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Anisha Pattanayak:机构信息未在 arXiv HTML 中可靠披露
- Hanie Kang:机构信息未在 arXiv HTML 中可靠披露
- Huang-Cheng Chou:机构信息未在 arXiv HTML 中可靠披露
- Sudarsana Reddy Kadiri:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
口吃事件检测以 3 s 播客片段为输入,输出阻塞、声音重复、词重复、延长、插话五类多标签判断,难点是无声阻塞几乎无声学能量,易被前端当非语音删掉。方法链分三步:先用去噪、响度归一化至-23 LUFS、Opus编码与WebRTC VAD构造十余种退化版本,输出长度变化的退化音频;再用冻结WavLM Base+提取帧级隐状态并做掩码平均得到片段向量,避免填充影响池化。最后用一对多逻辑回归在干净音频训练、在退化音频测试,片段向量进入分类器按节目集分组做五折交叉验证,并用节目集聚类成对自助法报告F1差值的点式区间。与以往只比表示或只谈识别体验不同,该工作按类别、按阶段、按指标分解前端代价,并分离阈值重调与匹配重训的贡献。在SEP-28k语料按节目集分组五折交叉验证设置下,全链条退化音频的阻塞F1为0.465,低于干净音频的阻塞F1 0.638,阈值重调后恢复至0.630,匹配重训加调阈值为0.628,而阻塞ROC-AUC仅由0.620升至0.633,远低于干净的0.724。结论限于该语料与仿真链,跨设备实测与时序事件定位尚未验证,训练推理成本未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。























![原论文 Fig. 1:An overview of the regions of Cameroon where the Basaà language is spoken, adapted from \\[7\\].](https://arxiv.org/html/2609.32408v1/figures/bassaaspeaking-regions.png)






