共分析 62 篇论文
⚡ 今日概览
✅ 筛选入选 62 篇 → 🔬 深度分析完成
🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #文本到语音 | 6 篇 | ██████ |
| #语音情感识别 | 4 篇 | ████ |
| #语音识别 | 4 篇 | ████ |
| #语音增强 | 3 篇 | ███ |
| #说话人分离标注 | 3 篇 | ███ |
| #音频分类 | 3 篇 | ███ |
| #音频水印 | 3 篇 | ███ |
| #音频深度伪造检测 | 3 篇 | ███ |
📊 论文评分排行榜(62 篇,按分数降序)
📋 论文列表
🖼️ 有图的论文会在这里展示首张原论文图;原图链接见对应独立页面。
🥇 只改几个词更难抓:SPADE 用 12 种语言考验部分伪造定位的跨模型泛化
英文题目:SPADE: A Multilingual Dataset for Speech Partial Deepfake Detection and Localization
标签:#音频深度伪造检测 | #基准设计 | #多语言 | #数据集
评分:8.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yuan Tseng:The University of Texas at Austin
- Aishwarya Fursule:机构信息未在 arXiv HTML 中可靠披露
- Andrew Zijun Ma:机构信息未在 arXiv HTML 中可靠披露
- Vamshi Nallaguntla:机构信息未在 arXiv HTML 中可靠披露
- Anderson Avila:Institut national de la recherche scientifique
- Shruti Kshirsagar:Wichita State University
- David Harwath:The University of Texas at Austin
📌 核心摘要
部分伪造定位(Partial Deepfake Localization)要求对原始波形逐帧判定哪些区间被合成或编辑替换,难点在于篡改占比小、过渡自然且生成器与语言高度多样。作者从12种语言的公开语料采样并用强制对齐获得词级时间戳,再用大语言模型改写转录并混合短多跨与长单跨两种编辑模式以覆盖不同篡改长度。接着对每段编辑分别调用语音编辑模型或语音合成模型生成后做15毫秒交叉淡化拼接,得到内容改变(content-altered)与内容不变(content-unchanged)各半的部分伪造样本。与仅做波形直拼的旧数据集相比,该流水线同时引入编辑模型条件生成与合成模型重对齐拼接,减少了可被频谱不连续轻易检出的捷径。在英语训练西班牙语测试的跨语言评测设置下,多短编辑测试的EER为5.86,低于单长编辑测试的EER 27.48。该结论仅在干净朗读与自发语音及所用5种生成器范围内成立,对强噪声、混响和未见商业克隆系统的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
模型相关资源:https://huggingface.co/Misha24-10/F5-TTS_RUSSIAN — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/meta-llama/Llama-3.1-8B-Instruct — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/rogertseng/spade — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 把水印藏进编解码器保留的潜变量方向:DeltaMark 对神经编解码重合成的鲁棒性
英文题目:Latent Audio Watermarking for Robustness to Neural Codec Resynthesis
标签:#音频水印 | #CNN | #鲁棒性 | #语音
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Lovro Brulec:机构信息未在 arXiv HTML 中可靠披露
- Sahil Karawade:机构信息未在 arXiv HTML 中可靠披露
- Leonard Kinzinger:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频水印需在语音中不可感知嵌入16位载荷并在神经编解码器重合成后仍可解码,难点在于波形域细微信号易被感知编码视作冗余丢弃。先由冻结EnCodec编码器将3秒波形映射为128×225连续潜表示,负责提供可保留的嵌入载体,输出潜表示进入嵌入步骤。再由三层多层感知机嵌入器将16位载荷映射为加性潜扰动并叠加到前一步潜表示上,经冻结解码器合成为含水印波形,完成潜嵌入与波形生成。最后将含水印波形经随机波形失真或编解码器循环后的失真音频送入残差卷积提取器,负责在攻击下联合训练恢复比特,输出解码载荷。与AudioSeal和WavMark等波形域方法不同,该方法占据编解码器重建倾向保留的通道结构化潜方向而非波形细节。在LibriSpeech test-clean评测条件下经4次24 kbps EnCodec重合成后,DeltaMark的检测指标TPR为89.3%,高于AudioSeal的检测指标TPR 11.2%。该结论不外推到全部神经编解码器,在 TiCodec-1g4r 上检测仅余 6.9%,且端到端音质受限于冻结载体重建。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Munich-Music-Labs/latent-audio-watermarking — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 门控只在新模态上打开:在冻结嵌入模型里加音频与热成像而不改动旧输出
英文题目:Modality-Gated Deep Adapters: Adding a Modality to a Frozen Embedding Model with Exact Preservation
标签:#音频检索 | #Adapter | #对比学习 | #形式化分析 | #多模态学习
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Abdul Basit Tonmoy:机构信息未在 arXiv HTML 中可靠披露
- Kazi Fardinul Hoque:机构信息未在 arXiv HTML 中可靠披露
- Md. Shahrier Islam Arham:机构信息未在 arXiv HTML 中可靠披露
- Arman Luthra:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
冻结嵌入模型新增模态的难点是音频等新输入需在冻结解码器内部获得判别能力,而文本与图像与视频的已存向量必须逐比特不变以保检索索引有效。方法先做模态注入分工:音频由外部声学塔编码经感知重采样连接器写成音频令牌送入基座,热成像则复用基座自带冻结视觉通路送入基座,两路输出都作为各层隐藏状态进入下一步。接着每层瓶颈适配器按降维升维计算增量,只在所属模态门声明的作用域内加回残差流,门关闭时前向钩子直接返回冻结层输出而不执行适配分支。与每输入都执行的低秩适配不同,旧输入执行基座原计算图而保持逐比特一致,且共存包互不可见。在45K AudioCaps受控对比评测协议下,门控适配器rank384的音频到文本R@10为0.665,高于无适配器对照的音频到文本R@10 0.631。该结论的适用边界受限于同一2B基座上音频与热成像双包共存验证,跨基座家族与双门同开输入尚未验证且不在保证内。训练成本为新增约60.6M训练参数约占基座3%,非目标模态推理开销为零而音频编码仍需经过约640M声学塔。
🔗 开源资源
代码相关资源:https://github.com/Eximius-Labs/fusion-embedding — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/EximiusLabs/fusion-embedding-2-2b-preview — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/EximiusLabs/fusion-embedding-2-ember — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/EximiusLabs — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 同形异读被折叠时:用注音绑定把读音留存在监督目标里
英文题目:Ruby-ASR: Evidence-Preserving Supervision for Joint Orthographic and Lexical-Reading Recognition
标签:#语音识别 | #自回归模型 | #CTC | #语音
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hao Shi:机构信息未在 arXiv HTML 中可靠披露
- Yun Liu:机构信息未在 arXiv HTML 中可靠披露
- Xuehao Yang:机构信息未在 arXiv HTML 中可靠披露
- Jun Liu:机构信息未在 arXiv HTML 中可靠披露
- Chuanbo Hua:机构信息未在 arXiv HTML 中可靠披露
- Xuanjun Chen:机构信息未在 arXiv HTML 中可靠披露
- Lianbo Liu:机构信息未在 arXiv HTML 中可靠披露
- Shiao Zhu:机构信息未在 arXiv HTML 中可靠披露
- Zixiong Su:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
日语语音识别以语音为输入并输出汉字与假名混排的正字法文本,难点在于同一写法可对应多种实际读法而传统监督将其坍缩为同一标签。Ruby-ASR将目标改写为词跨度绑定的注音序列,先由声学编码器与投影器生成语音表征,再由自回归解码器逐词元生成汉字跨度与其平假名读法,最后经确定性投影分别恢复正字法视图与读音视图,同时共享编码器的莫拉级CTC分支提供单调读音正则。相比整句双头输出与事后图文转换,该表示在局部保留写法与读法的对应关系并使读音成为语音条件目标。在5个日语基准的加权评估中,Ruby-ASR-ver将读音kana CER降至3.75%,明显优于Qwen3-ASR加共享G2P的5.74%且正字法精度未受损。在5个日语基准的加权评估下,Ruby-ASR-ver的Kana CER为3.75%,低于Qwen3-ASR加共享G2P的Kana CER 5.74%。其适用边界在朗读域最稳固,自发语音与罕见未见词形读音对为失败条件,跨领域外推尚未验证且受限于证据约束标注与小样本诊断。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/hshi-speech/Ruby-ASR-1.7B — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/hshispeech/Ruby-ASR-1.7B — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 不另加音频塔:共享主干如何统一文本图像视频音频检索
英文题目:Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
标签:#音频检索 | #对比学习 | #知识蒸馏 | #多模态模型
评分:8.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Ovis-Embedding Team:Alibaba Token Hub, Alibaba Group
📌 核心摘要
该工作面向任意到任意检索,查询与候选均可为文本、图像、视频、音频及其交错组合,输出为同一空间下可比的余弦相似度排序,难点在于跨模态可比性与模态内细粒度区分难以兼得。方法链为原生骨干转双编码器后接三段训练加弹性推理:以预训练全模态理解模型Qwen-Omni为共享编码器并取最后非填充词元末层状态为嵌入,保留原生对齐;再以大规模全模态语料做低秩对比预训练并辅以焦点加权与专家相似度分布蒸馏建立统一空间;随后以同源采样在高质量子集上全参数微调构造任务一致难负样本;最后以退火蒸馏强化并以冻结编码器加低秩特征分解实现多宽度部署。与外挂音频塔方案的关键差异在于全模态共用同一Transformer融合而非后期对齐,避免声学适配破坏视觉几何。在MMEB-Text基准任务下,Ovis-Embedding-Omni-3B的Overall得分为47.15,高于Qwen3-Embedding-4B的Overall得分46.22。该结论的适用边界受限于多条件检索落后与低维压缩在视觉文档上损失更大的短板,且视频与音频部分评测为本地重算,外推到开放噪声场景尚未验证需谨慎。训练与评估的硬件为配备NVIDIA H100 80GB GPU的集群,原文未给出具体训练成本与推理开销数值。
🔗 开源资源
代码相关资源:https://github.com/ATH-MaaS/Ovis-Omni-Embedding — 链接可访问(HTTP 200)
代码相关资源:https://github.com/ATH-MaaS/Ovis-VL-Embedding — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/spaces/mteb/leaderboard — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 从单句朗读到整场演戏:SceneTTS-Bench 如何量角色稳定、演技与节奏
英文题目:SceneTTS-Bench: A Benchmark for Scene-Level TTS in Drama Dubbing
标签:#文本到语音 | #基准设计 | #语音配音 | #基准测试
评分:8.0/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 1/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yizhong Geng:Beijing University of Posts and Telecommunications , Beijing , China
- Yanliang Li:Beijing DeepLogic Intelligence Technology Co., Ltd. , Beijing , China
- Jinghan Yang:Beijing University of Posts and Telecommunications , Beijing , China
- Tianhan Jiang:University of California , USA
- Yingming Gao:Beijing University of Posts and Telecommunications , Beijing , China
- Ya Li:Beijing University of Posts and Telecommunications , Beijing , China
📌 核心摘要
戏剧配音的输入是多角色多轮剧本与各角色参考音色,输出是逐句配音音频,实际难点是单句自然度无法约束跨轮次音色漂移、高张力台词欠演与长句分段拼接语速跳变。为此SceneTTS-Bench先将剧本解析为含文本说话人情感参考音频与指令的Canonical IR并经分发适配器送入异构合成后端,保证差异来自模型能力。接着三条自动流水线并行诊断:基于角色分布的说话人一致性分数检测音色漂移,基于剧本张力标签与Wav2Vec2.0维度情感预测的表演不足率检测高张力欠演,基于同源分段组两两速率比的语速断裂率检测拼接跳变。每条流水线均保留逐句中间量以支持归因,使聚合分数可回溯到具体轮次与边界。相对已有单句MOS与全局平均语速评估,其关键差异是以分布级一致性、剧本张力监督与边界局部两两比较替代单点相似与全局均值,从而暴露句子级与场景级倒挂的实际意义。在160个场景约10300句语料的基准下,Qwen3-TTS的SCS分数为.96±.01,高于Fish-S2的SCS分数.71±.03。该结论适用边界受限于以中文字符数与英文单词数定义的语速及阈值校准,新语言与风格尚未验证需本地重标定且最终艺术决策仍需人工听测。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://piedpiperg.github.io/scenetts-bench/ — 链接可访问(HTTP 200)
数据相关资源:https://piedpiperg.github.io/scenetts-bench/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 两人对话先分清谁在说,再听懂整场在说什么:第二届 MLC-SLM 的多任务设定
标签:#说话人分离标注 | #基准设计 | #语音识别 | #音频问答 | #多语言
评分:8.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Bingshen Mu:机构信息未在 arXiv HTML 中可靠披露
- Mingchen Shao:机构信息未在 arXiv HTML 中可靠披露
- Zhennan Lin:机构信息未在 arXiv HTML 中可靠披露
- Liumeng Xue:机构信息未在 arXiv HTML 中可靠披露
- Hexin Liu:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
- Eng Siong Chng:机构信息未在 arXiv HTML 中可靠披露
- Longshuai Xiao:机构信息未在 arXiv HTML 中可靠披露
- Qiangze Feng:机构信息未在 arXiv HTML 中可靠披露
- Daliang Wang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该挑战以完整双人多语言对话录音为输入,要求输出带说话人身份与时间边界的转写,并在同一语料上回答声学、语义与联合推理选择题,难点在于无oracle切分下的长时重叠、口音变体与跨轮次上下文依赖。组织方发布约2100小时覆盖14种语言、21种语言与口音变体的训练与开发数据并定义时间受限混合错误率与问答准确率协议,随后提供基于语音大模型的任务1与任务2基线以锚定难度,最后汇总91支队伍的端到端、级联与理解系统并提炼数据质量与长音频推理经验。与首届仅做转写相比,本届将重心从识别准确率转向说话人-时间-文本联合建模与音频依赖监督,强调定位证据与答案可控生成对理解任务的意义。在开发集上任务1基线平均混合错误率为79.15%,而决赛优胜系统在评测集上达到14.93%与93.9%的问答准确率,显示充分适配后提升巨大但基线本身几乎不可用。结论仅适用于安静室内手机采集的双人主题对话,尚无法外推至多人、高重叠、强噪声或自发领域场景。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/alanshaoTT/MLC-SLM-2nd-Task1-Baseline — 链接可访问(HTTP 200)
代码相关资源:https://github.com/DontPushMeee/MLC-SLM-2nd-Task2-Baseline — 链接可访问(HTTP 200)
数据相关资源:https://www.nexdata.ai/competition/mlc-slm — 链接可访问(HTTP 200)
第三方资源:https://github.com/fgnt/meeteval — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 从感知到干活:Qwen3.8-Omni-Flash 如何把长音视频变成可执行的智能体工作流
标签:#音视频理解 | #多模态学习 | #语音对话系统 | #混合专家模型
评分:7.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1.3/1.5
排名:前25% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Qwen Team:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作面向长音视频生产力任务,输入为文本、图像、视频、单声道音频与多通道空间音频,输出为实时文本或语音回复及多步工具调用,难点在于长时序证据稀疏、token开销大与现有智能体框架缺乏流式音视频支持。方法链为四步:先用视觉编码器加通用音频编码器即AuT加空间音频编码器即Spatial AuT与稀疏混合专家主干做统一感知对齐,再经多教师蒸馏把推理、代码与视听专家能力并入统一策略,接着用强化学习校准跨模态一致性与长对话稳定性,最后由插件与实时框架实现按需取证与异步执行。相比以往以感知为主的全模态模型,差异在于把推理与智能体能力从文本向音视频迁移并以主动取证替代一次性密集输入。在OmniVideoBench基准下,Qwen3.8-Omni-Flash智能体取证设置的准确率为67.8,高于静态直接理解设置的准确率63.4。适用边界为短剧翻译、音乐视频生成、会议纪要与教程转技能等生产流程,开放域长电影与强空间推理仍不稳定。原文声称29项评测平均分相对前代提升超25%,每小时音频与音视频API输入成本分别降低超98%与93%,但未披露训练与部署成本。
🔗 开源资源
代码相关资源:https://github.com/QwenLM/Qwen-MM-Plugins — 链接可访问(HTTP 200)
代码相关资源:https://github.com/QwenLM/Qwen-Live-Harness — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 短语音信息稀缺:用可学习向量档案把稀疏帧映射回长语音空间
英文题目:Beyond Short Segments : Expanding Speaker Embeddings with Vector Archives
标签:#说话人验证 | #注意力机制 | #语音 | #预训练
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hyunku Kang:机构信息未在 arXiv HTML 中可靠披露
- Minkyu Cho:机构信息未在 arXiv HTML 中可靠披露
- Chanwoo Kim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
说话人验证需判断两段语音是否属于同一说话人,当输入压缩至一秒左右时韵律与协同发音线索缺失会导致嵌入不稳定,这是语音唤醒与电话认证落地的核心难点。本文提出向量存档映射ECAPA,在预训练WavLM特征与ECAPA-TDNN说话人编码器之间插入可学习的增强模块以补偿稀疏特征。特征先经Transformer层建模帧间时序上下文得到上下文表示,其输出作为查询与可学习向量存档聚合而成的键值进行映射,再经残差回加得到增强序列。增强序列再经注意力统计池化计算加权均值与标准差并广播回加到每帧,使每帧都融合全局话语级上下文后送入编码器生成嵌入。与多段聚合或元学习不同,该方法以训练习得的固定典范参考替代推理时的瞬时上下文,无需增加输入即可恢复缺失的说话人判别信息。在Vox1-O一秒评测设置下,VAM-ECAPA的等误率(EER)为8.342%,低于同训练配方基线的等误率(EER)10.346%。该结论仅适用于短时场景,在3秒条件及更长语音上未超越常规基线,且噪声与跨语言泛化未经验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/slp-lab-research/vam_ecapa — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 只拼模态不够:用静态属性与动态事件补上物理监督
英文题目:OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities
标签:#音视频问答 | #强化学习 | #音视频 | #多模态模型
评分:7.6/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Yizhou Liu:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Jinghang Han:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Kaixiang Qiu:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Qi He:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Minghao Han:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Yue Jiang:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Xujia Chen:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Wei Zou:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Shunli Wang:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Lihua Zhang:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
- Dingkang Yang:Physical Superintelligence Lab, Fysics AI College of Intelligent Robotics and Advanced Manufacturing, Fudan University
📌 核心摘要
OmniFysics-Nano-V2要解决紧凑全模态模型物理感知欠监督问题,输入为图像、视频、音频、语音与文本,输出为文本回答与条件语音波形,难点是语义对齐无法恢复质量摩擦等隐变量与接触事件因果链。该工作先以静态分支做目标过滤、商用多模态大模型画像与原型库区间校准获得属性问答监督,再以动态分支做事件检索、重叠片段嵌入选段与视听时间容限对齐获得交互状态链监督。随后对候选提示各采样4个随机rollout仅保留组内出现至少两种奖励值的提示,再按通用答案正确到细粒度物理感知的两阶段组相对策略优化课程优化策略。与已有全模态系统相比,关键差异是从终点答案奖励转向中间属性与材料感知的可验证奖励。在Daily-Omni基准下,OmniFysics-Nano-V2的得分为85.24,高于Qwen2.5-Omni-7B的得分53.42。结论仅适用于所测问答与选择式物理感知设置,对真实测量精度与真实机器人操作成功率尚未验证。训练在 64 块 NVIDIA H100 上以 bfloat16 进行,奖励多样性过滤估计节省 2687.7 GPU 小时,原文未给出端到端总成本与推理延迟吞吐。
🔗 开源资源
代码相关资源:https://github.com/Fysics-AI/OmniFysics-Nano-V2 — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/Fysics-AI/OmniFysics-Nano-V2 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 边说话边做事:用前后台分离让语音中断不再取消任务
标签:#全双工语音交互 | #评测协议 | #智能座舱 | #语音 | #音频大模型
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Chong Deng:机构信息未在 arXiv HTML 中可靠披露
- Yunjie Ji:机构信息未在 arXiv HTML 中可靠披露
- Yuxiang Kong:机构信息未在 arXiv HTML 中可靠披露
- Xiangang Li:机构信息未在 arXiv HTML 中可靠披露
- Xu Li:机构信息未在 arXiv HTML 中可靠披露
- Binbin Zhang:机构信息未在 arXiv HTML 中可靠披露
- Haina Zhu:机构信息未在 arXiv HTML 中可靠披露
- Jianheng Zhuo:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音交互要求用户可在任务执行中随时打断、追加约束或追问中间产物,而会话节奏与任务执行节奏天然不一致。前景智能体负责流式理解与全双工对话,对即时操作直接调用工具,对需长时推理的请求经spawn_thinking生成自包含目标并向后台委托。编排运行时为该委托创建任务记录并立即返回任务标识以让前景对话继续,随后独立维护排队、运行、完成、失败与取消状态,并协调面向用户的信息与授权请求。运行时在任务完成而用户仍在说话或前端正在应答时保留结果至可播报时机合并送达,环境事件静默更新会话内上下文而跨会话记忆提供个性化,前端再在当前语境中播报结果与制品引用。相比仅靠应用层集成实现异步的语音方案,该运行时把语音打断与任务取消正交控制、把执行完成与结果送达分离,并以统一事件协议与前后端适配器兼容不同前端模型、后端智能体与客户端。在自有座舱基准134例上混合执行任务成功率91.04%,超过直接执行的72.39%与全委托的80.60%;在80个四配置均成功的匹配轮次上混合执行平均执行延迟4.729 s最低。该结论仅在座舱域、Qwen Audio 3.0 Realtime Plus加qwen3.8-max组合下验证,训练、推理与部署成本原文未披露。
🔗 开源资源
- 代码相关资源:https://github.com/QwenAudio/qwen-audio-agent — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 修音准节奏又不换嗓:整流流如何把遮罩补全做成风格保持的美化
英文题目:SRF-SVB: Style-Consistent Singing Voice Beautifying via Rectified Flow
标签:#歌唱生成 | #流匹配 | #Transformer | #音乐
评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Wenhui Li:机构信息未在 arXiv HTML 中可靠披露
- Biao Dong:机构信息未在 arXiv HTML 中可靠披露
- Liwei Hu:机构信息未在 arXiv HTML 中可靠披露
- Jiqing Han:机构信息未在 arXiv HTML 中可靠披露
- Yongjun He:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
歌唱美化Singing Voice Beautifying输入为业余演唱音频,输出为校正音高与节奏并提升音质且保留歌词与原唱音色的演唱波形,难点在于向专业靠拢与保留个性天然冲突。SRF-SVB先用专用编码器分别解耦音高音色与内容特征并拼接为声学条件,再对梅尔谱Mel-spectrogram做连续段掩码并以声学条件加掩码感知上下文重建缺失区,训练整流流Rectified Flow速度场学习噪声到数据的直线轨迹。推理时以前段业余谱作上下文后段静音区作生成区并注入专业音高与对齐后内容特征求解常微分方程Ordinary Differential Equation得到美化谱再经声码器合成波形。与仅校正音高的扩散方法和基于条件变分自编码器Conditional Variational Autoencoder的美化模型相比,关键差异是用可修复的谱上下文显式约束生成区风格而非只靠全局音色向量,具有保留表现力的实际意义。在英文测试集评测下,SRF-SVB的RPA准确率为0.57,高于Diff-Pitcher的RPA准确率0.48。该结论仅适用于有配对专业参考且可做动态时间规整 Dynamic Time Warping 对齐的中英文录制场景,实时直播与强噪声即兴演唱未经验证。原文未披露训练时长与推理延迟的完整算力对比,仅给出10步欧拉求解等零散信息。
🔗 开源资源
- 演示资源:https://mrwho729.github.io/SRF-SVB/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 把水印藏进编码器能保住的结构:NeuMark 对神经编解码器重合成的应对
英文题目:NeuMark: Neural Codec Resynthesis-Robust Audio Watermarking in the Codec Latent Space
标签:#音频水印 | #注意力机制 | #鲁棒性 | #语音
评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Annan Wu:机构信息未在 arXiv HTML 中可靠披露
- Wen-Chin Huang:机构信息未在 arXiv HTML 中可靠披露
- Tomoki Toda:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
面向合成语音溯源的音频水印任务,输入为原始语音与16位消息,输出为听感相似的水印语音,难点在于神经编解码器重合成会丢弃与编解码保留结构不对齐的细微信号证据。NeuMark先用冻结的SpeechTokenizer编码器将波形映射为8路残差向量量化潜表示,再经交叉注意力水印编码器把消息记忆向量逐层注入各路残差流并残差相加。加水印潜序列经冻结解码器重建为水印语音,再经随机失真算子模拟数字信号处理编辑与编解码重合成后送入提取器,同时预测帧级存在概率与消息比特。训练以对抗、特征匹配、梅尔谱、潜余弦与解码检测多目标联合优化,并对比原始参考与重建参考两种变体以分离编解码失真与水印失真。与波形域和单层潜变量基线不同,NeuMark把证据分布到全部编解码对齐层,从而保留重合成下的可提取结构。在LibriSpeech test-clean评测设置下,NeuMark R-O的检测准确率为0.88,高于WavMark的检测准确率0.51。但潜水印受编解码器重建上限约束,原始参考下透明性下降,且单量化器极端压缩与变速仍是失效边界。训练依赖多卡长时优化,推理延迟与部署吞吐原文未量化,完整文本到语音集成与多语噪声外推尚未验证。
🔗 开源资源
代码相关资源:https://github.com/goannan/NeuMark — 链接可访问(HTTP 200)
第三方资源:https://github.com/wavmark/wavmark — 链接可访问(HTTP 200)
第三方资源:https://github.com/facebookresearch/audioseal — 链接可访问(HTTP 200)
第三方资源:https://github.com/TimbreWatermarking/TimbreWatermarking — 链接可访问(HTTP 200)
第三方资源:https://github.com/zjzser/TraceableSpeech — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/spaces/haiyunli/VoiceMark — 链接可访问(HTTP 200)
第三方资源:https://github.com/facebookresearch/audiocraft — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 先学发音再学音色:用合成语音开路、真人语音纠偏的低资源适配
英文题目:From Reliable Text to Real Voices: Trust-Aware Progressive Adaptation for Low-Resource TTS
标签:#文本到语音 | #弱监督学习 | #低资源 | #0 样本 | #语音克隆
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jiayi Lu:机构信息未在 arXiv HTML 中可靠披露
- Yizhong Geng:机构信息未在 arXiv HTML 中可靠披露
- Jinghan Yang:机构信息未在 arXiv HTML 中可靠披露
- Tianhan Jiang:机构信息未在 arXiv HTML 中可靠披露
- Boxun An:机构信息未在 arXiv HTML 中可靠披露
- Yingming Gao:机构信息未在 arXiv HTML 中可靠披露
- Ya Li:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
低资源语音克隆以短参考音频和任意文本为输入,输出目标音色可懂语音,难点在于缅甸语、老挝语缺乏人工标注对,合成语音发音较准但音色单一,真实录音音色丰富但自动语音识别伪标签含噪。先用固定教师合成语音建立文本语音对应并固定参考配对进行合成阶段适应,为模型打下发音基础;接着用真实录音恢复参考说话人控制,并以双识别器转录分歧计算可靠性权重进入加权真实阶段,使噪声监督仅作用于已具发音能力的模型。转录一致加权依据双系统字符分歧下调可疑样本损失,权重分配本身带来增益而非仅改变损失尺度,从而把发音学习与音色恢复解耦。与直接混合或逆序适应相比,该调度避免了噪声主导早期优化与合成阶段削弱说话人响应,独立识别器复评与官方文本对照等控制试验证实一致性分数与标签错误相关。在缅甸语Common400/Clone300评测设置下,立方加权的字符错误率为16.90%,低于均匀加权1.0的字符错误率23.27%。方法仍依赖双识别器与合成筛选流水线,未在更多语系验证,且高分歧长尾样本与跨录音身份聚类未经充分审计。其适用边界受限于缅甸语与老挝语两语种及两种骨干验证,跨语系外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
演示资源:https://insiderx-pro.github.io/S2R-Adaptation-TTS/ — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/InsiderX-Pro/S2R-Adaptation-TTS — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 只听一句不够:用前面二十多秒对话为当前语音补上情绪走向
英文题目:Enriching Speech Emotion Representations with Conversational Context
标签:#语音情感识别 | #SFT | #语音 | #自监督学习 | #基准测试
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Arthur Peuvot:机构信息未在 arXiv HTML 中可靠披露
- Romaric Besançon:机构信息未在 arXiv HTML 中可靠披露
- Gaël de Chalendar:机构信息未在 arXiv HTML 中可靠披露
- Bianca Vieru:机构信息未在 arXiv HTML 中可靠披露
- Ioana Vasilescu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音情感识别需从语音声学信号预测离散情绪类别,难点在于孤立语句丢失对话中情绪演化与说话人间相互影响,制约实时单音频判断。ACERT先将目标语句与固定时长前文拼接送入HuBERT-large编码器与线性映射得到帧级特征,并切分为目标帧与上下文帧。接着对上下文帧做时域均值池化得到单一向量,将其加到每个目标帧并经残差前馈网络与层归一化融合,输出进入下一步。最后对增强后目标帧再池化并经分类头输出情绪类别,完成从上下文增强到判决的链路。与仅用相邻单句或在预测序列上建模转移的方法不同,ACERT直接在音频表征层融合任意时长前文且不依赖说话人标签与未来信息,更适配实时单音频场景。在IEMOCAP五折说话人无关评测下,25 s上下文的非加权准确率(Unweighted Accuracy, UA)达到79.08%,相对同骨干无上下文基线68.38%提升10.70个百分点并超越最强上下文基线CHAN的75.90%。在IEMOCAP五折说话人无关评测下,ACERT的非加权准确率为79.08%,高于CHAN的非加权准确率75.9%。其结论适用边界受限于情绪平稳的双人对话,失败条件是情绪快速切换的多人对话中上下文增益消失,且跨语料泛化能力尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/apeuvot/ACERT — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/facebook/hubert-large-ll60k — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 不换模型换前端:儿童语音的时间包络与可学习归一化如何补上 Whisper
标签:#语音识别 | #时频分析 | #语音 | #SFT
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Edem Ahadzi:机构信息未在 arXiv HTML 中可靠披露
- Ruchi Pandey:机构信息未在 arXiv HTML 中可靠披露
- Tomi H. Kinnunen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
儿童语音识别的输入是声学波形,输出是文字转写,难点在于高基频与共振峰偏移、发音不稳定及响度突变使固定对数梅尔谱丢失连续调制结构。本文方法先以80通道梅尔间隔加窗sinc带通滤波分解波形得到子带信号,再经希尔伯特变换提取瞬时包络并以25Hz低通平滑保留音节调制。包络经帧级均方根池化形成100Hz能量图后送入可学习逐通道能量归一化做自适应增益与压缩。归一化后特征直接送入Whisper编码解码器并与后端联合微调完成识别。与固定对数梅尔前端相比,该机制差异在于显式保留带内能量起伏并让归一化随儿童频谱特性逐通道适配,而非依赖后端注意力补救已丢弃信息。在清洗后MyST测试集下,所提时域包络前端的WER为11.08%,低于相同Whisper-small微调下对数梅尔基线的WER 13.16%。结论仅适用于英语儿童会话、非流式零相位处理及小模型两轮微调条件,跨语种、大模型与因果流式尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/ahadziii/temporal-envelope-whisper-asr — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 听不清细节的音频大模型:用可验证的合成音频一轮轮自己出题
英文题目:EvoAudio: Recursive Self-Improvement for Audio Understanding
标签:#音频理解 | #强化学习 | #课程学习 | #音频大模型
评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yuxiang Wang:机构信息未在 arXiv HTML 中可靠披露
- Shengbo Cai:机构信息未在 arXiv HTML 中可靠披露
- Yingda Shen:机构信息未在 arXiv HTML 中可靠披露
- Ming-Hao Hsu:机构信息未在 arXiv HTML 中可靠披露
- Qinke Ni:机构信息未在 arXiv HTML 中可靠披露
- Liqiang Zhang:机构信息未在 arXiv HTML 中可靠披露
- Teddy Sun:机构信息未在 arXiv HTML 中可靠披露
- Steve Yevs:机构信息未在 arXiv HTML 中可靠披露
- Zhizheng Wu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
大型音频语言模型(Large Audio Language Models, LALMs)理解语义远强于感知语速、音高、响度、说话人结构与事件时序等声学细节,而人工细粒度标注昂贵且蒸馏强模型答案会继承其错误。EvoAudio以当前求解器为中心构建递归闭环:先由提议器读取47种技能画像与混合奖励率以分配配额与升降难度,再调用24种音频工具合成波形并由构造参数确定答案,接着经声学复测与文本可答性过滤后保留可训练样本,随后用组相对策略优化(Group Relative Policy Optimization, GRPO)训练候选模型,并以固定2500题验证集决定是否晋升为下一轮求解器。与固定课程相比,该机制使难度与技能分布始终跟随学习进展,保持奖励方差并避免在已修复弱点上浪费预算。任务输入为音频波形与自然语言问题,输出为对应答案,实际难点在于细微声学线索易在合成混合中失真且文本捷径会掩盖听觉缺失。在MMSU、MMAU-Pro与MMAR三套基准下,EvoAudio(GRPO)的平均准确率为65.4%,高于基线模型的平均准确率59.3%。该结论的适用边界受限于24种工具可构造的韵律与事件结构,对工具覆盖外的语义文化推理尚未验证。增益集中于工具可控的韵律与事件结构,对MMAR语义文化推理外推有限,原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://jensenyx.github.io/EvoAudio.github.io/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 溯源不是抗失真:用密钥与宿主绑定重做语音水印
英文题目:KeyBound: Keyed and Host-Bound Learned Audio Watermarking for Speech Provenance
标签:#音频水印 | #对抗训练 | #语音 | #音频安全 | #对抗鲁棒性
评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Bangshuo Zhu:University of New South Wales , Australia
- Yuxin Cao:National University of Singapore , Singapore
- Weifei Jin:Duke University , USA
- Fusen Guo:University of New South Wales , Australia
- Huadong Mo:University of New South Wales , Australia
- Jingling Xue:University of New South Wales , Australia
- Wei Song:University of New South Wales , Australia
📌 核心摘要
语音来源归属的输入是待验波形,输出是是否存在某方标记及载荷能否归属,难点在于攻击者会窃读、无授权移植或经重合成擦除标记而非仅引入偶然失真。KeyBound先用密钥对16比特载荷做异或掩码随机化,使无密钥观测近似均匀分布,该掩码输出进入下一步嵌入。接着载波经冻结对数梅尔谱表征调制与宿主绑定后嵌入音频,使载波依赖宿主而难以直接搬运。最后检测端由与密钥无关的存在头输出存在分数供公众验证,并由密钥持有者解码恢复归属载荷。与无密钥可移植加性水印相比,该设计把可检测性留给公众而把可读性留给密钥持有者,并以宿主条件载波抑制移植式虚假归属。在LibriSpeech评测套件的EnCodec重合成条件下,KeyBound的检测准确率为1.000,高于AudioSeal的检测准确率0.850。该结论适用边界受限于英文朗读短语音与已见失真族,在Griffin-Lim与未见DAC、BigVGAN下存在性可迁移但精确载荷大幅退化,自适应移除仍是未解决的失败条件。原文未披露训练、推理或部署成本。原文未披露KeyBound代码与权重。
🔗 开源资源
- 第三方资源:https://liuyixin-louis.github.io/xattnmark/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 在一直开着的麦克风下藏攻击:在编码瓶颈处对齐掩蔽的平滑防御
标签:#全双工语音交互 | #数据增强 | #对抗鲁棒性 | #形式化分析
评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kian Shamsaie:机构信息未在 arXiv HTML 中可靠披露
- Iman Modarressi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音到语音对话模型以常开麦克风同时收听与说话,攻击者可在载体语音掩蔽阈值之下注入不可闻加性扰动,并毒化持久对话状态,直接将音频转为口语动作而无可审查文本,防御需兼顾不可闻预算与实时对话质量。先以载体对话语音为输入移植掩蔽阈值威胁模型,负责形式化目标语义劫持、静音拒绝服务与可复用前缀越狱三类目标,输出的感知球扰动约束与攻击目标直接作为后一步噪声成形的预算进入防御设计。再以原始波形与该感知球约束为输入,在波形域注入掩蔽阈值成形噪声训练编码器,并在残差向量量化瓶颈处注入局部码本协方差成形的各向异性高斯噪声后重量化,输出的双重增强码流与干净码流一同进入下一步一致性训练。最后以干净码流与增强码流为输入,用KL一致性项绑定输出分布联合优化对话模型,输出共享权重的PALS-Train部署算子与经蒙特卡罗投票给出椭球半径证书的PALS-Certify认证变体。与高斯增强、输入平滑、PGD对抗训练及Demucs前端等已有方法相比,关键差异在于噪声协方差同时由码本几何与掩蔽阈值决定并作用于潜空间,使防御随机化与攻击者感知约束对齐而非各向同性加噪。在攻击预算Δ=0 dB的评测条件下,PALS的UTMOS为3.82,低于未防御智能体的UTMOS 3.91。该结果的适用边界受限于英语双人对话与数字及模拟混响语音条件,输入端约负26分贝的认证半径远弱于实测攻击区间且尚未验证跨语种与强自适应攻击外推,失败条件包括超出潜空间认证椭球的大预算扰动。训练成本约为1.4倍壁钟时间,PALS-Train推理开销为零而PALS-Certify需千次采样的推理开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 谁来打标签、谁来稳住训练:半监督联邦语音识别的在线教师与服务器锚点
标签:#语音识别 | #联邦学习 | #半监督学习 | #语音
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Wonho Bae:Apple
- Zakaria Aldeneh:Apple
- Martin Pelikan:Apple
- Jan “Honza” Silovsky:Apple
- Tatiana Likhomanenko:Apple
- Sheikh Shams Azam:Apple
📌 核心摘要
服务端持有少量带标注种子数据、客户端仅持有无标注音频是半监督联邦自动语音识别(Automatic Speech Recognition, ASR)的现实输入,输出为可变长字符序列转写,难点在于伪标签错误沿序列与通信轮次复合放大并引发发散。方法链分为三步:首先在种子数据上集中训练种子模型并初始化全局学生与指数滑动平均(Exponential Moving Average, EMA)教师,随后每轮广播模型后由全局教师或在线教师生成伪标签并完成多步本地随机梯度下降(Stochastic Gradient Descent, SGD),最后以概率 \(p\) 交错执行服务端有监督更新以回锚全局模型。与冻结种子或固定全局教师不同,在线教师利用轮内本地适应产生更贴合当前客户端的伪标签,而过渡教师在强种子早期用全局稳定后期切回在线。在域内测试集评估下,所提稳定配方的WER为9.3,低于静态伪标签基线的WER 17.7,且在11个种子到客户端配对中对Rao等取胜9对、域内平均相对改善达20.8%、跨域平均改善达10.0%。结论仅在英语读物、演讲、众包与电话语料仿真内成立,短种子加小批量或强掩蔽仍会发散,且未验证语言模型解码与差分隐私下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 把风格决策写成指令:Interactive TTS 如何拆开理解与发声
英文题目:Interactive TTS: Dynamic Speaking Style Adaptation for Expressive Speech Synthesis
标签:#文本到语音 | #偏好优化 | #多模态学习 | #语音
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Wenjie Tian:机构信息未在 arXiv HTML 中可靠披露
- Kangxiang Xia:机构信息未在 arXiv HTML 中可靠披露
- Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
- Xinfa Zhu:机构信息未在 arXiv HTML 中可靠披露
- HangRui Hu:机构信息未在 arXiv HTML 中可靠披露
- Ziyue Jiang:机构信息未在 arXiv HTML 中可靠披露
- Kexin Huang:机构信息未在 arXiv HTML 中可靠披露
- Ting He:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
- Jin Xu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
多轮多模态交互要求以目标文本、历史语言声学视觉上下文与参考音色为输入,生成情境恰当且音色稳定的语音,端到端上下文感知合成将风格决策淹没在声学映射中,易出现指令失配与多轮音色漂移。该工作提出Interactive TTS,先由上下文到指令模块解析多模态历史与目标文本并输出自然语言风格指令。接着指令条件生成器结合持久参考说话人提示合成离散语音标记,随后用迭代拒绝采样微调强化指令遵循与音色保持。再用上下文感知偏好优化内化情境恰当性,推理时仅传递指令而不传递推理链与多模态上下文。与隐式映射的关键差异是风格决策成为可监督、可评测、可复用的显式接口,具有实际可控意义。在VStyle上总体3.82分居上下文感知语音合成首位,在SpeechParaling-Bench情境适应上对官方锚点胜率80.3%,内部指令集成功率由基座79.5%提升至89.6%且人工音色一致性4.51分。适用边界为话语级风格控制,尚未解决句内细粒度韵律与非言语发声,训练语料多为合成构造,原文未披露推理延迟与部署成本。
🔗 开源资源
演示资源:https://wjtian-wonderful.github.io/InteractiveTTS/ — 链接可访问(HTTP 200)
第三方资源:https://www.alibabacloud.com/help/en/model-studio/qwen3-5-livetranslate-flash-realtime — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 从全脸到嘴部:ROAM-ASD 用联合自注意力应对开放世界的说话人检测
英文题目:ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion
标签:#说话人分离标注 | #注意力机制 | #音视频 | #鲁棒性 | #0 样本
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Pu Wang:机构信息未在 arXiv HTML 中可靠披露
- Yujun Wang:机构信息未在 arXiv HTML 中可靠披露
- Hugo Van hamme:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
主动说话人检测(Active Speaker Detection,ASD)要求对每条可见人脸轨迹逐帧判断该人是否在发出可听语音,输入为场景音频加同一个人的人脸裁剪序列,难点在于野外多说话人、环境噪声、人声干扰、遮挡与表情性嘴动极易造成音画面部误关联。本文方法链为三流编码到共享空间再联合融合预测:冻结 Whisper-large-v3 音频编码器提供语音活动证据,从零训练的轻量人脸编码器提供全局身份与面部运动上下文,复用 Auto-AVSR 视觉语音识别(Visual Speech Recognition,VSR)前端加 Conformer 并以 8 秩低秩适配(Low-Rank Adaptation,LoRA)微调的口部编码器捕捉发音相关唇动,三流投影到 256 维后与逐帧广播的模态无关查询令牌(modality-agnostic query token)拼接做 4 层联合自注意力交互,最后经跳连拼接与时序预测头输出逐帧说话概率,训练中辅以模态丢弃(modality dropout)暴露缺失组合。与 TalkNet 与 TS-Talk 等成对交叉注意力需预定义谁做查询与键值不同,该设计允许任意可用子集直接交互而不依赖特定流存在。在 UniTalk 上相对最强基线 TalkNCE 的 83.2% 平均精度均值(Mean Average Precision,mAP)提升至 87.9%,在 WASD 上相对 Light-ASD 的 93.7% 提升至 98.8%,在 AVA、Talkies、ASW 上分别达 96.5%、98.2%、99.3%。其结论边界在于双视觉流全缺失时音频无法将语音归属到特定轨迹,且长时连续缺失仍显著退化。原文未披露训练硬件、批量大小、总步数、损失函数与推理延迟吞吐成本。
🔗 开源资源
演示资源:https://wangpuup.github.io/ROAM-ASD/ — 链接可访问(HTTP 200)
演示资源:https://wangpuup.github.io/ROAM-ASD-modality/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 只调时长就能学会重读吗:EmphTTS 用强化学习对齐时长预测器
英文题目:EmphTTS: an emphasis-control TTS with reinforcement learning
标签:#文本到语音 | #强化学习 | #语音 | #韵律
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zirui Li:机构信息未在 arXiv HTML 中可靠披露
- Rech Silas:机构信息未在 arXiv HTML 中可靠披露
- Lauri Juvela:机构信息未在 arXiv HTML 中可靠披露
- Tom Backstrom:机构信息未在 arXiv HTML 中可靠披露
- Mikko Kurimo:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
面向重音控制的文本到语音需从带星号标记文本生成对应波形,难点在于重音 lengthening 幅度因词数与位置而异且现有大模型显式标记仍控制不稳,固定全局语速难以兼顾词级时长与可懂度。本文先以流匹配预训练F5-TTS基座并以交叉熵预训练倒计时式时长预测器,再在Expresso重音数据上分别监督微调声学与时长分支以注入星号标记的重音实现,最后冻结声学模型而以组相对策略优化(Group Relative Policy Optimization,GRPO)优化时长采样策略,采样多组候选时长合成后回传奖励更新时长分布。相对已有偏好优化与可懂度奖励工作,差异在于奖励直接包含WhiStress平衡准确率的重音定位项并做组内归一化与截断替代优化,避免韵律坍缩为单调输出,同时联合词错误率与说话人相似度维持可懂度与音色。在 TinyStress-15k 上 EmphTTS 的 StressLM F1 为 0.75,超出最强零样本基线 Qwen3-TTS-VD 的 0.63 且主观偏好显著优于多数基线。结论限于英文、每句少于3个重音词及星号标记输入,未验证无标记语境推断与跨语言迁移。原文未披露训练、推理或部署成本。
🔗 开源资源
演示资源:https://emphtts.github.io/EMPHTTS/ — 链接可访问(HTTP 200)
复现相关资源:https://github.com/SWivid/F5-TTS/blob/main/src/f5_tts/configs/F5TTS_v1_Base.yaml — 链接可访问(HTTP 200)
复现相关资源:https://www.prolific.com/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 删掉画面还要删掉声音:文本与已编辑视频如何共同指定要压制的声源
英文题目:TV-AudioRemover: Joint Text-Visual Guided Sound Removal with Multi-Task Hard-Mixture Curriculum
标签:#音视频声源分离 | #课程学习 | #多任务学习 | #音视频 | #基准测试
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xinyue Guo:MiLM Plus, Xiaomi Inc.
- Jianxuan Yang:MiLM Plus, Xiaomi Inc.
- Daiguo Zhou:MiLM Plus, Xiaomi Inc.
- Jiagao Hu:MiLM Plus, Xiaomi Inc.
- Yuxuan Chen:MiLM Plus, Xiaomi Inc.
- Fei Wang:MiLM Plus, Xiaomi Inc.
- Jian Luan:MiLM Plus, Xiaomi Inc.
📌 核心摘要
输入为经视频擦除得到的编辑后视频、原始混合音频与自然语言指令,输出为仅抑制被删目标声而保留其余成分的音频,难点在于声学成分与视觉实体对齐模糊且提取与删除语义互斥易混淆。方法先以Qwen3-Omni音频优先结构化标注加SAM Audio分割与CLAP、PC分数和SAJ过滤构建单目标视听对齐库并在线合成为混合目标对,为模型提供可控监督。接着多模态扩散变换器将混合隐变量与噪声隐变量拼接去噪,并以任务令牌携带任务极性与模态专用全局调制区分保留与抑制意图。相比仅文本驱动的编辑模型,该视觉同步与任务极性设计提供更强语义接地与时间同步线索,兼顾目标抑制与非目标保留。最后多任务联合学习提取、删除与联合编辑以强化任务边界,再由语义远混合预训练到语义近难混合微调提升细粒度辨别。在AV-Remove-Bench基准下,TV-AudioRemover的TSSR指标为0.635,高于SAM Audio的TSSR指标0.354。该结论适用边界限于6秒左右的双发声体或前景加稳态背景场景,对视觉相似说话人重叠语音仍脆弱。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://yjx-research.github.io/TV-AudioRemover/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 不看配对样本,如何学到从退化到干净的随机输运
英文题目:SE-MSB: End-to-End Unpaired Speech Enhancement using Mamba Schrödinger Bridges
标签:#语音增强 | #扩散模型 | #状态空间模型 | #端到端
评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Andreas Bagge:机构信息未在 arXiv HTML 中可靠披露
- Andreas Nymand:机构信息未在 arXiv HTML 中可靠披露
- Michael Riis Andersen:机构信息未在 arXiv HTML 中可靠披露
- Bjørn Sand Jensen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为混响、加性噪声与削波退化的单通道语音波形,输出为干净语音波形,难点是真实环境中干净与退化样本无法配对且退化算子未知。方法分三步:先在干净分布与退化分布间以独立采样的随机耦合预训练双向漂移网络,学习前后向过程的漂移估计;再用当前模型仿真生成耦合做微调,以逼近熵正则最优传输的薛定谔桥;然后以Mamba扩散骨干在原始波形上执行少步欧拉采样,直接输出增强波形。该链条区别于经高斯中转的桥方法和需已知退化结构的后验采样方法,直接学习两端分布间随机传输,避免了借助第三分布的中转与启发式相位重建。在VCTK去混响任务评测下,SE-MSB(10)的FAD指标为0.15,低于BUDDy(100)的FAD指标0.17。结论适用边界受限于VCTK合成退化与CHiME-6验证,历史录音与Lombard效应尚未验证。训练为单张 RTX 4090 约 1 天 9 小时,2.048 秒音频 10 步推理约 214.19 ms,原文披露了该成本口径。
🔗 开源资源
- 第三方资源:https://github.com/state-spaces/mamba — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 一个模型应对多种测量布局:把空间聚合与频率建模分开做 HRTF 上采样
标签:#声场重建 | #注意力机制 | #空间音频信号 | #Conformer
评分:7.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xingyu Chen:机构信息未在 arXiv HTML 中可靠披露
- Hanwen Bi:机构信息未在 arXiv HTML 中可靠披露
- Sipei Zhao:机构信息未在 arXiv HTML 中可靠披露
- Fei Ma:机构信息未在 arXiv HTML 中可靠披露
- Eva Cheng:机构信息未在 arXiv HTML 中可靠披露
- Ian S. Burnett:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
个性化头相关传输函数Head-Related Transfer Function/HRTF上采样需从数量与位置均可变的稀疏测量恢复稠密双耳对数幅度谱,难点在于空间稀疏性、方向配置漂移与高频谱细节重建相互耦合。所提几何感知注意力Geometry-Aware Attention/GeoAtt先对每频点独立构建上下文方向编码与左右耳及耳间差频谱的联合特征,再以目标方向为查询做多头交叉注意力加权聚合得到查询条件化频谱序列。随后将该序列沿频率轴叠加可学习位置编码,并经堆叠Conformer编码器联合建模局部卷积谱结构与长程频间依赖,最终经共享线性映射输出双耳对数幅度预测。与固定配置模型及变上下文基线相比,关键差异在于将目标与测量方向的相对位移、角度相似与测地距离显式编码为注意力加性偏置,而非隐式位置拼接,从而实现单模型跨配置共享。在SONICOM数据集20个测试听众的评测设置下,GeoAtt的LSD指标为3.07 dB,低于IOA3D的LSD指标3.21 dB。该结论仅在远场幅度建模与同一数据集划分内成立,对半球与水平环等受限覆盖会出现明显退化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 可见不等于送达:只给留存下来的译文记功的流式语音翻译
英文题目:Persistent Delivery Optimization for Streaming Speech-to-Text Translation with Revisions
标签:#语音翻译 | #强化学习 | #流式处理 | #多语言
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zixiang Wan:机构信息未在 arXiv HTML 中可靠披露
- Delin Chen:机构信息未在 arXiv HTML 中可靠披露
- Wei Shi:机构信息未在 arXiv HTML 中可靠披露
- Haihua Xu:机构信息未在 arXiv HTML 中可靠披露
- Youxi Xie:机构信息未在 arXiv HTML 中可靠披露
- Yuexian Zou:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
可修订流式语音到文本翻译(streaming speech-to-text translation,S2TT)需从增量英文语音持续输出目标语言文本,难点是早期证据不足时抢发易产生随后被撤回的临时内容,而基于当前可见草稿的过程奖励会把短暂正确的片段也提前记功。方法链分三步衔接:先冻结 Qwen3-ASR-1.7B 主干并训练目标任务低秩适配与历史模块得到流式监督初值,再用冻结父策略闭环 rollout 缓存模型自生历史以训练历史条件策略,其中历史经门控交叉注意力注入上层解码器,最后以持久投递优化(Persistent Delivery Optimization,PDO)做强化学习微调。与直接奖励当前可见草稿不同,PDO 仅累积在所有后续修订中存活的最长公共前缀的参考覆盖,并单列终稿质量项,完整轨迹回报让后期修订决定早期记功,早存活内容累积更多源时间信用。该机制使系统在首发时刻不变下更早固化终稿内容,并在跨域零样本下仍减少擦除与终结感知延迟。FLEURS 测试集英译 5 方向宏平均上 PDO 相对 History-SFT 基线提升 BLEU 至 31.58 且平均终结感知延迟下降,证明更早稳定而非更晚首发。结论限于 2 秒更新网格的短句朗读翻译与词级稳定度量,对长语音、无限流与人感可读性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 无异常时能选模型吗:从 kNN 分数方差到伪异常探针的几何预测
英文题目:Can We Predict Anomaly Detection Performance from Embedding-Space Geometry?
标签:#异常声音检测 | #形式化分析 | #模型评估 | #工业应用
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kevin Wilkinghoff:Department of Electronic Systems, Aalborg University, Denmark;Pioneer Centre for Artificial Intelligence, Denmark
- Zheng-Hua Tan:Department of Electronic Systems, Aalborg University, Denmark;Pioneer Centre for Artificial Intelligence, Denmark
📌 核心摘要
异常检测仅以正常数据训练却需异常标签做模型选择,且跨表征时正常分数尺度不可比,难以无异常预测AUC优劣。第一步针对对数kNN分数推导以均值分离与内外方差为变量的AUC下界,将可观测正常方差与不可观测分离解耦,使正常方差成为可用信号并暴露缺失的分离信息。第二步以小球局部尺度展开把正常方差分解为密度变化、本征维度异质性、抽样噪声与域间失配,并以局部密度归一化消去密度主项与跨域密度失配,其剩余方差与失配形式进入下一步校准。第三步在嵌入空间直接重组或借用正常嵌入构造伪异常,用伪异常分数代理未知异常分布,分别计算伪AUC与矩形式的界估计量用于候选排序,其关键差异是以伪分离参考替代仅用逆方差跨表征比较。在 DCASE 2022-2025 共 174 个选择任务与 208 个候选系统上,多源混合伪异常的伪 AUC 取得 2.75% 的平均遗憾,优于正常方差基线与固定开发集选择。在DCASE 2022-2025基准的模型选择任务下,Diverse伪异常估计的遗憾指标为2.75,低于Inlier Variance估计的遗憾指标5.19。该结论适用边界受限于kNN与对数最近邻分数及声学异常检测基准,伪异常质量决定成败且最优构造依赖语义元数据,跨模态与跨检测器外推尚未验证。原文未披露训练、推理或部署成本,未提供代码链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 不是越不像越好:把遗忘相似度锚定到陌生人水平的说话人遗忘
英文题目:Forget who you Forgot: Speaker Unlearning to Prevent Re-Identification in Zero-Shot Text-to-Speech
标签:#文本到语音 | #强化学习 | #隐私保护 | #说话人识别 | #0 样本
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.4/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hyoeun Kim:机构信息未在 arXiv HTML 中可靠披露
- Yujun Lee:机构信息未在 arXiv HTML 中可靠披露
- Kyuhong Shim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
零样本文本到语音以3秒参考语音为输入合成同说话人文本语音,要求在屏蔽遗忘说话人可识别性时不损伤可懂度、自然度与保留说话人复现,难点在于相似度降低仍可能保留可检索身份且强干预易破坏语音质量。该方法先由门控网络从说话人嵌入预测转向系数以决定是否干预,其输出进入共享层级转向向量注入步骤,将加权向量叠加到冻结流解码器残差上实现统一身份偏移,转向后的合成语音再进入组相对奖励优化步骤,以人群冒名均值为目标联合约束转写与质量来更新转向向量。与微调全解码器和推理时强转向相比,该机制冻结主干并分离选择与干预,以人群分布为显式目标因而兼顾遗忘彻底性与保留集稳定性。在LibriTTS clean-460评测设置下,GUARD的SIM为0.103,低于CosyVoice2的SIM 0.541,且画廊重识别同步大幅下降而保留集指标基本不变。其适用边界限于封闭画廊与特定验证器和声码器组合,开放集检索与强自适应攻击等外推尚未验证。新增遗忘者的训练成本仅为更新24.8K参数门控约9.9分钟,硬件为单卡V100-16GB,远低于全解码器微调的计算量与存储开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 跑调的人声如何借伴奏找回调:MIDIBack 的联合符号建模
英文题目:MIDIBack: Harmony-Aware Singing Pitch Correction via Joint Vocal-Accompaniment Symbolic Modeling
标签:#音高与旋律提取 | #Transformer | #音乐 | #预训练 | #数据增强
评分:7.1/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Joaquim Cavalcante:机构信息未在 arXiv HTML 中可靠披露
- Yicheng Gu:机构信息未在 arXiv HTML 中可靠披露
- Adriel Trajano:机构信息未在 arXiv HTML 中可靠披露
- Yuri de Malheiros:机构信息未在 arXiv HTML 中可靠披露
- Thais Gaudencio:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动音高校正(Automatic Pitch Correction,以下简称APC)输入为走音人声与伴奏音频,输出为意图音高序列,难点在于无意跑调与有意装饰音在声学基频上高度纠缠而难以仅靠就近量化判定。MIDIBack先用GAME转录人声连续基频中心并用MuScriptor转录伴奏,再经Madmom抽取统一音符级起音与时值等时间属性并序列化为共享八元组序列。合成损坏器叠加短语级全局移调、冻结门控循环单元(Gate Recurrent Unit,以下简称GRU)学习型漂移与均匀噪声以构造训练对,Adversarial-MidiBERT骨干仅在人声位置做分类以还原取整伪标签。与仅看人声或声学频谱的方法不同,该机制把伴奏作为不变调性锚点进行双向和声推理,使人声预测随和声调制动态适配而非仅依赖旋律先验。在全局Outshift损坏条件评测下,MIDIBack的RPA准确率为81.5%,高于去除伴奏条件的RPA准确率35.8%。结论仅适用于转录衍生目标与合成损坏恢复,未验证真实录音重合成质量与听感。原文未披露训练时长与推理部署成本。
🔗 开源资源
数据相关资源:https://sonovox.ai/ — 链接可访问(HTTP 200)
演示资源:https://midiback.joaquimbreno.com/ — 链接可访问(HTTP 200)
第三方资源:https://github.com/openvpi/audio-slicer — 链接可访问(HTTP 200)
第三方资源:https://github.com/openvpi/GAME — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
31. 从能说话到能办事:Qwen-Audio-3.1-Realtime 如何把推理、执行与说话时机分开训练
英文题目:Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction
标签:#语音对话系统 | #强化学习 | #全双工语音交互 | #实时处理
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Lujia Bao:机构信息未在 arXiv HTML 中可靠披露
- Qian Chen:机构信息未在 arXiv HTML 中可靠披露
- Luyao Cheng:机构信息未在 arXiv HTML 中可靠披露
- Chong Deng:机构信息未在 arXiv HTML 中可靠披露
- Yuxiang Kong:机构信息未在 arXiv HTML 中可靠披露
- Xiangang Li:机构信息未在 arXiv HTML 中可靠披露
- Xu Li:机构信息未在 arXiv HTML 中可靠披露
- Jiaqing Liu:机构信息未在 arXiv HTML 中可靠披露
- Chao-Hong Tan:机构信息未在 arXiv HTML 中可靠披露
- Haoyu Wang:机构信息未在 arXiv HTML 中可靠披露
- Wen Wang:机构信息未在 arXiv HTML 中可靠披露
- Xilou Wang:机构信息未在 arXiv HTML 中可靠披露
- Junhao Xu:机构信息未在 arXiv HTML 中可靠披露
- Liang Yi:机构信息未在 arXiv HTML 中可靠披露
- Binbin Zhang:机构信息未在 arXiv HTML 中可靠披露
- Qinglin Zhang:机构信息未在 arXiv HTML 中可靠披露
- Qiquan Zhang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
实时语音交互输入为流式语音与不断演化的用户请求,输出为即时语音回应与可执行工具操作,难点在于长程状态保持、随意打断、背景语音干扰与权限边界约束。方法第一步做思考层基础构建,以核心混合监督微调冷启动音频语言模型,再经多模态多教师在策略蒸馏把文本推理能力迁移并固化原生音频能力,输出具备推理能力的音频基座。第二步做行动层策略学习,将上步音频基座放入自演化可执行环境,以对话级、里程碑级与单轮级三级回放做组相对策略优化,学会工具调用、反馈解读与任务完成,并将可执行策略交给协调层。第三步做说话与协调约束,对协调层输出按数据库状态校验、写入路径合法性、行为断言的固定顺序给予奖励,明确如何说、何时说以及是否说或做。与仅优化延迟或单轮函数调用的已有实时语音系统不同,该方法把状态正确性与行为合规直接绑定为奖励顺序,具有可执行任务的实际意义。在半双工语音到文本改编的τ-Voice上总体任务成功率从78.4%提升至82.0%,在语音到语音Full-Duplex-Bench v1.5上背景语音回应率从73.0%降至13.0%。结论限于合成语音、自动裁判与受控环境口径,长程可执行口语任务、真实录音与大规模人工评测尚未验证。原文未披露训练与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
32. 沉默与重叠都不是错:轮换时机要按说话人意图打分
标签:#轮次切换 | #基准设计 | #语音 | #韵律
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Kian Shamsaie:机构信息未在 arXiv HTML 中可靠披露
- Iman Modarressi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工口语对话模型需在双通道流式音频下连续决定何时接管、退让、附和或保持沉默,难点是相同静默或重叠在不同说话人意图下褒贬相反。作者构建意图感知对话时机基准TACT,为每段长历史拼接说话人记忆画像,并融合多人标注与校准大语言模型法官得到六类意图后验,该后验直接作为条件进入评分。接着按意图拟合人类地板转换偏移参考分布与非负加权核,再用阈值加权连续分级概率评分输出时机、时长与韵律加权打断分并均值成综合得分。与固定窗口二值接管率相比,该机制把早答、迟答与缺席放在同一连续且意图加权的严格真值规则下比较,使合作性重叠可以得高分而应反思时抢答被重罚。在TACT基准下,gpt-realtime-2的综合得分为0.47,低于人类顶线的综合得分0.86。该结论限于英语主导的双人对话与六类离散意图,对多方、跨语言与连续意图的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
33. 纠缠托底差距:用三轴合成网格审计并解耦音频表征的人口公平性
标签:#口语理解 | #评测协议 | #公平性 | #对比学习
评分:7.0/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kian Shamsaie:机构信息未在 arXiv HTML 中可靠披露
- Iman Modarressi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频理解模型以波形为输入,需同时输出文本语义、说话人属性与表达风格判读,但不同口音年龄性别声音的语义保真度不平等,且观测语料中内容与通道混杂使归因困难。作者先构建三轴审计网格TRIAD,将120段文本、24种声音画像与10种表达风格正交交叉并用可控语音合成渲染输出解耦语料,使人口感知属性与内容分离。接着在冻结编码器上定义轴保真度与聚合泄漏和峰值泄漏并证明平均探针差异随泄漏增长,其输出的几何度量直接进入下一步修复目标。最后提出正交残差对比适配器ORCA,用三头对比学习保留三轴信息并以正交惩罚直接最小化泄漏,与对抗删除信息的已有方法不同,其实质是将公平性转为几何解耦问题。在10个开源编码器上聚合泄漏与实测均方探针差异的 Pearson 相关达0.93,ORCA在WavLM上将聚合泄漏降低72%并将口音差距压缩约一半。在TRIAD审计设置下,WavLM Large + ORCA的聚合泄漏指标为0.08,低于WavLM Large的聚合泄漏指标0.29。结论仅适用于线性探针与感知属性层面,单合成器伪影与多语言泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
34. 不为每句话建分布:DriftAudio 用边际漂移做一步音频的分布后训练
英文题目:DriftAudio: Marginal Drifting for Distributional Post-Training of One-Step Text-to-Audio Generators
标签:#音频生成 | #生成模型 | #后训练 | #高效推理
评分:6.9/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xingyu Chen:机构信息未在 arXiv HTML 中可靠披露
- Fei Ma:机构信息未在 arXiv HTML 中可靠披露
- Sipei Zhao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
文本到音频生成以自由文本为输入合成10秒波形,单步生成器将迭代采样压缩为单次评估后分布偏差显著,且每个自由文本条件通常仅对应一两个真实样本而难以估计条件数据分布。DriftAudio先以冻结PANNs编码器将波形映射为音频特征空间,确定边际分布匹配的计算域。接着每步从训练集无放回重采样真实特征作正样本,并以先进先出库维护近期生成特征作负样本,与当前生成样本共同构成场估计的三集合。然后由核加权正负交互估计去分母边际漂移场并转化为分离目标,经距离归一化后回传梯度只更新生成器而保持单步推理流程。相对FdAudio基于一阶与二阶矩的Fréchet匹配,该方法采用基于样本的非参数场而非矩约束,因而保留分布细节且无需为每个条件估计数据分布。在AudioCaps测试集评测下,DriftAudio(从MeanAudio出发)的FAD指标为1.11,低于MeanAudio的FAD指标1.68。该结论适用边界受限于本地回收的AudioCaps子集与单编码器验证,尚未验证多数据集泛化与主观听感及稀有语义保真度。后训练在单块NVIDIA L40硬件上默认参考规模下每优化步中位延迟为23.7秒,增大参考规模时延迟升至49.5秒而推理开销仍与MeanAudio一致为单步。
🔗 开源资源
- 演示资源:https://xingyuaudio.github.io/driftaudio-demo/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
35. 不改唇形只定静音时刻:用二值语音活动信号约束配音合成
英文题目:Not Quite My Tempo: Voice Activity-aware Speech Synthesis for Lip-Synchronous Dubbing
标签:#语音配音 | #流匹配 | #语音 | #跨语言
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Alejandro Pérez-González-de-Martos:机构信息未在 arXiv HTML 中可靠披露
- Florian Lux:机构信息未在 arXiv HTML 中可靠披露
- Angelina Elizarova:机构信息未在 arXiv HTML 中可靠披露
- Milana Shkhanukova:机构信息未在 arXiv HTML 中可靠披露
- Andreas Kellner:机构信息未在 arXiv HTML 中可靠披露
- Mattia Antonino Di Gangi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动唇同步配音要求目标语言语音的有声与静音交替模式在时间轴上精确复刻源语言片段,以保证视听一致,而跨语言文本长度天然不一致使任务兼具翻译适配与韵律规划难度。方法链分三步:先以Silero模型从音频提取帧级有声无声二值掩码,再将音素经ConvNeXt编码并经平均上采样对齐至目标帧长后把VAD嵌入相加注入编码表示。接着含说话人编码与全局风格标记的扩散Transformer流匹配解码器在固定时长画布上做修复式合成,仅约束静音起止而由模型端到端分配有声区内容,训练时对VAD嵌入随机掩码使推理时源语言掩码可全局关闭或局部放宽。与依赖唇动视频编码的路线相比,该路线训练仅需音频文本数据,无需配对视频、人脸跟踪与专用视觉编码器,对动画与多人场景更鲁棒并适配仅约12%需严格同步的工业现实。在291条多语言TEDx英译评测集上,LibriTTS-R模型的帧级Silero对齐准确率从无约束约72.69%提升至有约束约96.21%,静音边界偏差紧缩于0附近。40名英语母语者的主观评测显示位置与韵律MOS下降约0.06至0.13且Mann-Whitney U检验p大于0.05,但内部ASR词错率从8.5%升至13.9%,定性归因为极端时长失配下的删词、重复与重排序,结论仅适用于等时性较好的翻译输入。该方法的适用边界受限于等时性较好的翻译输入,极端失配下存在删词与重复的失败条件;训练成本为在四块NVIDIA A100硬件上以全局批量128训练至80万步。
🔗 开源资源
演示资源:https://anondemos.github.io/NotQuiteMyTempo/ — 链接可访问(HTTP 200)
第三方资源:https://github.com/snakers4/silero-vad — 链接可访问(HTTP 200)
第三方资源:https://github.com/TEN-framework/ten-vad — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
36. 不重编音频也能验声:复用编码器状态删掉无据事件提及
英文题目:REVE: Efficient Hallucination Correction for Large Audio-Language Models via Reused Encoder States
标签:#音频字幕生成 | #测试时自适应 | #音频大模型 | #高效推理 | #音频事件检测
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hongjin Song:机构信息未在 arXiv HTML 中可靠披露
- Jiasheng Kuang:机构信息未在 arXiv HTML 中可靠披露
- Xinyu Yang:机构信息未在 arXiv HTML 中可靠披露
- Qiuyu Fang:机构信息未在 arXiv HTML 中可靠披露
- Ziyu Wu:机构信息未在 arXiv HTML 中可靠披露
- Guowu Tan:机构信息未在 arXiv HTML 中可靠披露
- Xiang Xie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
大型音频语言模型(Large Audio-Language Model, LALM)在开放字幕生成中会提及输入中不存在的声学事件,现有文本自检难以定位具体错误片段。复用编码器状态验证事件(Reused Encoder States for Verifying Events, REVE)复用目标模型已计算的投影前帧状态,先做本体映射把字幕片段对齐到固定事件类,再用双尺度读出打分并经类感知融合得到存在概率,最后按阈值删除无支撑片段而保留其余文本。统计读出汇总帧级分数分布而分段读出保留四段时序均值,两路互补为融合提供全局与局部依据。与需二次编码的外部检测器不同,该方法不重载音频也不运行第二编码器,核验完全发生在已有表示之上。在AudioSet评测下,REVE的Reduction指标为92.9%,高于CED-Tiny的Reduction指标92.7%。该结论的适用边界受限于词级本体匹配与开发集选定的统一阈值,对未映射自由表述不做编辑,且跨架构与开放表述外推尚未验证。增量验证的延迟为完整路径0.57毫秒与GPU前向0.29毫秒,仅增加3.38M参数,无需额外音频编码通道。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
37. 四人餐馆对话要听清谁:CHiME-9 ECHI 在眼镜与助听器上做因果多说话人抽取
英文题目:CHiME-9 ECHI: A Machine Learning Challenge for Enhancing Conversations to Address Hearing Impairment
标签:#目标说话人提取 | #基准设计 | #助听器 | #麦克风阵列 | #主观评测
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 1/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Robert Sutherland:School of Computer Science, University of Sheffield, Sheffield, United Kingdom
- Thomas Kuebert:WS Audiology, Erlangen, Germany
- Marko Lugger:WS Audiology, Erlangen, Germany
- Stefan Petrausch:WS Audiology, Erlangen, Germany
- Eline Borch Petersen:ORCA Labs, WS Audiology, Lynge, Denmark
- Juan Azcarreta Ortiz:Meta Reality Labs, Cambridge, United Kingdom
- Buye Xu:Meta Reality Labs, Redmond, United States of America
- Stefan Goetze:School of Computer Science, University of Sheffield, Sheffield, United Kingdom;South Westphalia University of Applied Sciences, Iserlohn, Germany
- Jon Barker:School of Computer Science, University of Sheffield, Sheffield, United Kingdom
📌 核心摘要
该挑战以四人餐桌对话为输入,要求从Meta Aria眼镜7通道或助听器4通道含噪录音中提取三位对话伙伴语音并抑制佩戴者自身语音,输出面向助听设备的增强语音,难点在于快速轮转与重叠说话、动态干扰声与混响及20 ms严格因果延迟约束。方法链第一步用近嘴麦克风经神经网络降噪与时延补偿构造训练用参考信号,为监督训练提供对齐目标。第二步以因果化目标说话人提取基线结合彩虹段落声纹逐人迭代提取,其输出直接进入第三步的评测筛选。第三步用客观指标筛选加ITU P.835主观质量与转录可懂度听测综合排名,决定最终优胜系统。与仅比较能量的传统客观筛选相比,关键机制差异是用真人听测同时考核可懂度与自然度、背景侵扰度,从而暴露客观指标与感知排序脱节。在评估集听测评测下,AHU-IEI v1-011的主观综合得分为51.35,高于基线的主观综合得分37.15。结论仅适用于模拟自助餐厅英语对话与正常听力众包听众,未验证听损听众增益、移动佩戴与实时功耗下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
38. 给波形编码器补上频谱课:JASPER 的时频联合掩码预训练
英文题目:JASPER: Joint Audio and Speech Pre-trained Encoder Representations
标签:#音频理解 | #自监督学习 | #语音 | #环境声 | #音乐
评分:6.7/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Geeth George:机构信息未在 arXiv HTML 中可靠披露
- Ameenudeen P E:机构信息未在 arXiv HTML 中可靠披露
- Hrishikesh H Pillai:机构信息未在 arXiv HTML 中可靠披露
- Sriram Ganapathy:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作针对语音时域预测与音频时频建模分轨导致的跨域不兼容,输入为截断或补零至8秒的16kHz原始波形,输出为可冻结复用的768维上下文表示序列,难点在于同一波形编码器需同时保留音素级时序精度与环境声谱结构。第一步由卷积前端将波形降采样至50Hz潜序列并按0.16秒切窗得到非重叠窗口,该窗口化潜序列直接作为掩码操作对象。第二步以0.6概率独立选中窗口并以0.2概率延续遮蔽后窗形成长上下文掩码序列,叠加卷积位置编码后送入12层Transformer建模长时依赖得到上下文表示。第三步由双头分别预测帧级时域伪标签与段级8频带谱量化标签并以加权损失联合优化,时域分支保留序列信息而频域分支注入频率局部监督,推理时仅用波形分支抽取表示。与纯时域HuBERT类方法和纯频谱重建方法不同,JASPER在波形编码器内注入频率局部监督,兼顾音素序列精度与时频结构。在 2000 小时同数据同步数对照中 9 任务多数领先,在公开大算力比较中以 2k 小时数据取得 81.74% 平均准确率居首,尤其 VoxCeleb1 达 91.18%。在ESC-50评测任务下,JASPER的准确率为88.05%,高于HuBERT的准确率80.55%。XARES-LLM Track A 平均 0.66、Track B 平均 0.50 亦居首。但结论依赖英文语音与常见音频音乐分类加轻量解码器,低资源语言、强噪声与长时流式外推未经验证,训练与推理成本未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
39. 录音很多不等于见过很多海域:被动声监测中空间异质性如何抬高验证分数
标签:#音频分类 | #评测协议 | #环境声 | #统计分析
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Gabriel Spadon:机构信息未在 arXiv HTML 中可靠披露
- Wayne Renaud:机构信息未在 arXiv HTML 中可靠披露
- Priyanka Aravindan:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该研究处理大西洋加拿大多站点被动声学监测中的船舶存在判断,输入为679秒单通道录音的声学描述子,输出为是否存在AIS关联船舶,难点在于站点先验相差200倍以上且传播与采集配置随部署剧烈变化。方法链先以AIS空间时间连接生成接触标签并计算频谱描述子,再按部署内稳健统计划分回顾性筛选层级并封顶构造基准,随后用跨季节站点归因与水听器归因检验域结构,最后以站点分组保持与随机窗口诊断的配对对比度量验证乐观偏差。相对已有混合站点池化评估,该机制差异在于把站点标识作为分组抽样单元并保留协方差做配对推断。在54507条记录的筛选基准下,未见站点协议的ROC-AUC为0.612,低于随机窗口诊断的ROC-AUC 0.661。结论仅适用于该监测项目与回顾性筛选后的基准分布,对未覆盖海域、水听器更换与无筛选流式部署的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/gabrielspadon/scotian-shelf-labeling — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
40. 边想边说:用异步进度语音盖住推理静音的口语模型
标签:#语音对话系统 | #多模态学习 | #流式处理 | #高效推理 | #语音
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Junyi Ao:Meta Superintelligence Labs;The Chinese University of Hong Kong, Shenzhen
- Kainan Peng:Meta Superintelligence Labs
- Mingbo Ma:Meta Superintelligence Labs
- Shun Zhang:Meta Superintelligence Labs
- Zhenyu Tang:Meta Superintelligence Labs
- Xutai Ma:Meta Superintelligence Labs
- Xiang Li:Meta Superintelligence Labs
- Yinghao Li:Meta Superintelligence Labs
- Yuancheng Wang:Meta Superintelligence Labs;The Chinese University of Hong Kong, Shenzhen
- Zhizheng Wu:The Chinese University of Hong Kong, Shenzhen
- Haizhou Li:The Chinese University of Hong Kong, Shenzhen
- Qing He:Meta Superintelligence Labs
- Xubo Liu:Meta Superintelligence Labs
📌 核心摘要
本文处理语音到语音问答中的长推理延迟问题,输入为用户语音,输出为连续语音回答,难点在于串行先思考后说话会产生十余秒的用户可感知静音。方法上构建异步双流框架:推理思考器基于音频编码生成文本推理轨迹并在里程碑处发射触发符,其隐状态经投影进入轻量出声思考模块生成单句进度话语,最后由统一说话器将两路隐状态分别合成为思考期语音与最终回答语音。运行时动态平衡策略在播放耗尽时补发进度话语而在推理提前完成时取消待合成触发,从而解耦推理推进与语音实现。在Spoken-MQA基准下,Baseline + Think-Aloud CoT的Lsil为0.36s,低于Baseline + CoT的Lsil 12.82s,同时平均准确率保持在87.6%附近。与串行推理相比该机制用推理接地的进度话语替代通用填充词,其打断纠错等交互收益的适用边界尚未验证。该结论仅在英文口语推理与常识问答评测及40词每秒推理速度假设下验证,对短对话是否需要出声思考及打断纠错等交互收益尚未实测。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
41. 把证据运到情绪空间再验算:BiCFlow-MER 的条件输运识别
标签:#语音情感识别 | #流匹配 | #多模态学习 | #0 样本
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yanbing Wang:机构信息未在 arXiv HTML 中可靠披露
- Shenyue Wang:机构信息未在 arXiv HTML 中可靠披露
- Chunyang Yu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频文本多模态情感识别需从语音与转录文本推断说话人情感类别,难点在于情感线索与说话人风格及词法内容纠缠,且双模态情感证据常相互冲突。BiCFlow-MER先以因果生成解耦信息瓶颈分离情感因子,并由情感冲突感知模块生成冲突加权的融合条件。条件整形流将条件相关起点输运为情感空间显式终点,自适应几何分类头做前向原型云似然评分,双向生成决策做后向起点兼容性校验后融合判决。与已有终端融合直接分类不同,该方法把证据构造、输运与几何验证显式分离,使冲突信息可参与条件与温度调节。在四类IEMOCAP五折说话人无关评测下取得78.18%加权准确率,超越次优基线0.40个百分点。在零样本CASE声学语义冲突集上取得59.82%加权F1,超越Fusion Acoustic-Semantic基线4.74个百分点,但提升集中于冲突场景且CASE分支依赖冻结特征,跨语种与强噪声外推尚未验证。原文未披露训练时长、推理时延或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
42. 先压缩时间再做全局融合:MambaVoice 的轻量视听歌声分离
英文题目:MambaVoice: Lightweight Audiovisual Singing Voice Separation Via A Hybrid Mamba-Transformer Model
标签:#音视频声源分离 | #状态空间模型 | #音视频 | #音乐 | #高效推理
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Adithi Shankar:机构信息未在 arXiv HTML 中可靠披露
- Gopika Krishnan:机构信息未在 arXiv HTML 中可靠披露
- Gloria Haro:机构信息未在 arXiv HTML 中可靠披露
- Xavier Serra:机构信息未在 arXiv HTML 中可靠披露
- Martín Rocamora:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
视听歌声分离需以目标表演者视觉为锚,从伴奏与伴唱混合波形中重构目标歌声复数频谱,难点在于持续旋律谐波重叠与音色相似导致的目标误换。方法先以对数频带分割加跨带注意力的音频编码器将256频点压缩为8个频带嵌入,同时以时空图卷积网络从68点二维面部关键点提取歌唱运动特征。视觉嵌入经线性对齐与Sigmoid门控以逐元素乘法调制音频表示,融合特征先经选择性状态空间扫描做线性复杂度时序蒸馏压缩,再经Transformer自注意力做全局频谱融合,最后以1×1卷积估计复数比率掩膜并经逆短时傅里叶变换重构波形。与纯注意力基线不同,该先Mamba后Transformer的排序保留全注意力用于高分辨率谱融合而非近似,以线性扫描前置稳定压缩序列,降低二次复杂度与内存开销。在Acappella未见未闻测试集50%干扰评测条件下,M-T-Hybrid的SDR为14.18 dB,高于VoViT基线的SDR 13.76 dB。该结论受限于16 kHz采样评测、依赖AlphaPose预提取关键点且计时不含视觉前端,主模型以100%干扰课程训练而基线为50%因而口径不一致,跨域与百分百重叠下的外推尚未验证。在硬件与推理开销上,训练成本为单块NVIDIA RTX 4090批量为4,分离网络前向延迟为3.93 ms,约为VoViT的2.94倍加速但不含组块累积与人脸跟踪延迟。
🔗 开源资源
- 代码相关资源:https://github.com/adithishankar19/mamba_voice.git → https://github.com/adithishankar19/mamba_voice — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
43. 文字分高不等于还在听波形:一次 Qwen2-Audio 量化的三路核对
英文题目:Text Scores Can Miss Waveform Use: A Qwen2-Audio Quantization Case Study
标签:#语音情感识别 | #评测协议 | #语音翻译 | #模型量化
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Mengzhe Geng:National Research Council Canada
- Jinxi Jin:The Hong Kong Polytechnic University
- Junhao Xu:The Chinese University of Hong Kong
📌 核心摘要
输入为语音波形与文本指令,输出为翻译文本或情感标签,难点在于相同转录可对应不同韵律与说话人线索,文本分数无法证明模型仍在使用转录之外的声学信息。本文提出三路分离的评估链:先测词汇输出质量以确认基础可用性,再用转录不足的情感任务检验波形依赖行为,最后核查打包实现以确认名义位宽是否转化为实测资源收益。与以往以后训练量化(Post-Training Quantization,PTQ)文本分数兼报内存的做法相比,该机制差异在于冻结参数加权预算与同预算结构对照,使语义保持与工程实现各自需要独立证据。同一6位平均位宽配置在冻结翻译复现中词汇分占优,却在波形依赖端呈现精度相关背离。在冻结翻译复现与说话人隔离情感测试集评测下,6位平均位宽配置的准确率为62.30%,低于全精度基线的准确率66.21%。结论仅适用于所测检查点、表演式情感与给定分配族,外推至自发情感、长音频或多语言韵律尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
44. 拥挤时少数的说话人为何消失:把存在和活动绑在一起再计数
英文题目:Beyond DER: Speaker Counting in Crowded End-to-End Diarization
标签:#说话人分离标注 | #正则化 | #说话人计数 | #模型评估
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Lahiru Samarakoon:机构信息未在 arXiv HTML 中可靠披露
- Hongxu Zhu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
说话人日志需从单通道录音同时估计说话人数并输出每帧每人活动,在5人以上拥挤重叠对话中低活跃说话人极易被漏计,而时长加权的DER会被健谈者主导从而掩盖漏检。该文以端到端吸引子模型EEND-TA为骨干,先用编码器与变换器吸引子产生帧嵌入与存在性打分,再以门控后验耦合存在与活动并作混合正则,最后用说话人加权归约让每位说话人投票权与时长无关。编码器输出进入吸引子生成得到存在概率,门控后验将存在概率与帧活动相乘后送入匹配损失,说话人加权归约在吸引子内平衡活跃与静默帧后再在说话人间平均,从而把监督重心转向低时长说话人。与解耦监督相比,该机制迫使存在性预测考虑帧级活动,并以与时长无关的单票制对齐杰卡德错误率与计数目标,使稀疏低活跃说话人不再被高时长说话人淹没。在拥挤5–8人混合测试集评测下,最终模型的精确计数准确率为41.6%,高于EEND-TA基线的精确计数准确率32.9%。该结论适用边界受限于至多8人的真实语料混合评测,吸收型合并与纯重叠说话人仍是失败条件,更多人数与跨域外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
45. 把无条件分支换成可学习的向量:语音合成中更稳的引导基线
英文题目:Learnable Classifier-Free Guidance Null Embeddings for Enhanced Controllable Speech Synthesis
标签:#文本到语音 | #提示学习 | #语音 | #扩散模型
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Biel Tura Vecino:机构信息未在 arXiv HTML 中可靠披露
- Yoach Lacombe:机构信息未在 arXiv HTML 中可靠披露
- Julian Weber:机构信息未在 arXiv HTML 中可靠披露
- Zbigniew Łatka:机构信息未在 arXiv HTML 中可靠披露
- Haitong Zhang:机构信息未在 arXiv HTML 中可靠披露
- Logan Hart:机构信息未在 arXiv HTML 中可靠披露
- Eren Gölge:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
零样本语音合成需由文本与参考音色生成高保真语音,难点在于同时保证发音稳定与音色韵律忠实。先以参考梅尔谱经声纹编码器得到的说话人潜变量与BPE文本词元为输入,由自回归主干融合历史潜变量输出隐状态,其职责是提供条件化声学上下文,输出逐帧条件隐状态。再以该隐状态为条件输入轻量扩散头,职责是迭代去噪预测因果变分自编码器潜变量并归一化回填主干,从而以上一步隐状态驱动潜序列延续生成直至预测停止。最后在训练中以前两步的生成通路为基础,以0.1概率分别丢弃说话人与文本条件并替换为各自可学习空嵌入进行联合优化,推理时以条件隐状态与空嵌入隐状态为输入解耦计算说话人与文本引导权重,输出加权外推的扩散预测以分别调节偏离程度。相对固定零向量基线,域内可学习基线提供更稳定参考并在大引导尺度下更鲁棒,因而能精细控制属性。在自建65个未见说话人各2句共130个样本的评测设置下,可学习解耦模型的SECS指标为0.841,高于固定零向量基线的SECS指标0.755。该收益伴随稳定性与表现力以及相似度与绝对质量之间的权衡,高引导增强忠实度却可能降低感知自然度。因此其在开放大规模语料与实时系统中的适用边界尚未验证,且原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://airtimemedia.github.io/IS2026-LearnableCFG/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
46. 只改一小段也要逐帧定界:用边界差分与段内一致性做部分伪造定位
英文题目:Boundary and Intra-Segment Learning for Partial Audio Deepfake Localization
标签:#音频深度伪造检测 | #多任务学习 | #语音
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zhe Ye:机构信息未在 arXiv HTML 中可靠披露
- Xiangui Kang:机构信息未在 arXiv HTML 中可靠披露
- Minhua Huang:机构信息未在 arXiv HTML 中可靠披露
- Kai Wu:机构信息未在 arXiv HTML 中可靠披露
- Kong Aik Lee:机构信息未在 arXiv HTML 中可靠披露
- Chng Eng Siong:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
部分伪造定位输入为真伪拼接的整句波形,输出为逐帧真伪标签,难点是伪造段短小且真伪声学差异易被音素与信道变化淹没。先以整句波形为输入,用WavLM-Large加两层Conformer提取帧特征并做帧级二分类,输出帧特征与逐帧预测为后续辅助分支提供共享表示。再以前一步输出的相邻帧特征为输入,对其作差并监督是否发生标签跳变以区分真伪跃迁与一般声学起伏,输出边界预测并以边界损失回传约束帧特征的差分方向。最后以前两步共享的帧特征为输入,按真值标签切出全真或全伪连续段并去首尾帧后求时序均值与标准差拼接为段表示做段分类,同时以余弦紧致损失拉近同段帧特征,输出段预测与紧致帧特征,三路损失联合优化反哺帧级定位。相比边界感知注意力机制、边界帧交叉图注意力网络用边界预测调制帧间交互,以及段感知学习用段内位置与混合,该方法直接约束差分方向与段内分布,因而更紧扣真伪跃迁与区域一致性。在PartialSpoof基准下,BISL的等错误率为2.52%,低于BFC-Net的等错误率2.73%。该结论限于 PS 用 160 ms、HAD 和 LPS 用 20 ms 时间分辨率及已知划分内有效,未验证细粒度与流式实时场景。原文仅说明单卡训练,未披露训练时长、推理延迟与部署成本。
🔗 开源资源
- 第三方资源:https://github.com/microsoft/unilm/tree/master/wavlm — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
47. 舞者姿态能给希腊传统音乐打标签补上音频听不到的那部分吗
英文题目:Pose-Aware Multimodal Automatic Tagging for Greek Traditional Music
标签:#音频分类 | #多模态学习 | #音乐 | #音视频 | #音乐信息检索
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Alexandros Alexiou:机构信息未在 arXiv HTML 中可靠披露
- Charilaos Papaioannou:机构信息未在 arXiv HTML 中可靠披露
- Alexandros Potamianos:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
希腊传统音乐自动标注以音频、视频与舞者位姿为输入,需输出乐器、流派与地域来源共28个非互斥标签,难点在于广播录制视角杂乱且舞蹈片段仅占约半数,运动语义与声学语义对齐困难。所有模态按共享的8秒片段边界对齐,音频以梅尔频谱表征视频帧与骨架流,缺失位姿位置以可学习标记占位以维持时序连续。该工作先用舞蹈场景检测切出舞蹈段,再以多目标跟踪选出主舞者并估计17关节点骨架,经质量过滤形成位姿流;随后音频频谱变换器(Audio Spectrogram Transformer,AST)、SlowFast视频编码器与时空图卷积(Spatial Temporal Graph Convolutional Networks,ST-GCN)骨架编码器分别输出片段表征;最后经门控融合与时序建模完成音轨级多标签预测。与直接平均单模态概率的晚期融合不同,门控融合在冻结的单模态嵌入上学习跨模态加权交互,因而更能利用弱位姿线索补强阈值化预测。与最强音频单模态相比,最优三模态门控系统在Lyra舞蹈子集上将宏平均受试者工作特征曲线下面积(Receiver Operating Characteristic Area Under Curve,ROC-AUC)从0.821提升至0.864,且在音频加视频基础上继续带来提升。结论主要适用于有可见舞蹈的希腊传统音乐广播,对无舞蹈曲目与跨文化迁移尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/alexioualex9/Pose-Aware-Multimodal-Automatic-Tagging — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
48. 把逐帧检索换成一步速度场:在 WavLM 空间学习 kNN 传输
英文题目:One-Step Voice Conversion by Learning kNN Transport in WavLM Space
标签:#语音转换 | #流匹配 | #语音 | #高效推理
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Anton Selitskiy:Stony Brook University;Electrical and Computer Engineering;Stony Brook, NY 11790 USA
- David Millard:University of Rochester;Electrical and Computer Engineering;Rochester, NY 14627 USA
📌 核心摘要
语音转换需将源说话人WavLM嵌入映射为目标说话人嵌入,在保持语言内容的同时改变音色,难点在于目标语料稀疏时显式最近邻匹配退化且多步推理成本高。第一步由配对构造负责,用k=4余弦最近邻在训练集上将源帧映射为伪目标帧,形成源到伪目标的近似最优传输耦合作为监督对。第二步由条件流匹配训练负责,以源嵌入为起点、以伪目标为终点按线性均值加布朗桥方差构造高斯条件路径,并回归速度场,同时叠加单步预测的话者一致性损失来约束目标音色。第三步由条件积分推理负责,以目标话语为交叉注意力键值与FiLM全局调制条件,从源嵌入出发积分一步得到转换嵌入,再经HiFi-GAN声码器合成波形,使上一步学到的速度场直接落地为输出。与Phoneme Hallucinator先上采样再做kNN的两阶段做法不同,本文将匹配本身神经化为单网络回归,省去推理期检索与扩增模块。在LibriSpeech测试集1310组转换上,1步Gaussian Bridge取得23%词错率与3.12的UTMOSv2,优于FreeVC的24%与2.86,也优于Phoneme Hallucinator的25%与2.86。该结论限于英文朗读语音与WavLM Large第6层加HiFi-GAN链路,短目标、跨语言与主观听感外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://anton-selitskiy.github.io/kNN-VC-FM/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
49. 暂停更安静却漂移更大:语音编码器表示漂移与任务损失的错位
英文题目:Quieter Than the Room: Representation Drift and Task Robustness in Speech Encoders
标签:#语音识别 | #评测协议 | #鲁棒性 | #环境声
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Vsevolod Kovalev:Boston University, Boston, MA, USA
- Pranay Manocha:Princeton University, Princeton, NJ, USA
📌 核心摘要
输入为含家庭与远场非语音干扰的语音,输出涉及意图、情感、说话人与转写4类任务决策,难点在于下游分数稳定时底层表征可能已大幅偏移且安静干扰常被忽略。方法链分4步:先冻结8个编码器并对最后一层做时间平均得到句级嵌入,再以余弦距离度量干净与加噪嵌入的漂移,接着用RAVDESS重复录制与情感强度变化构建重复基线与变化上限构成的走廊,最后在全段、仅语音段与仅暂停段3种放置下对比漂移与任务损失。与只报告下游分数的已有鲁棒性评测不同,该工作把干扰位置与局部信噪比显式分离,并揭示上下文编码会把暂停干扰传播到语音帧。在全段加噪评测任务下,任务语料漂移指标的平均斯皮尔曼相关为0.81,高于占空比指标的平均斯皮尔曼相关0.70。该结论的适用边界受限于测试的编码器、声音与语料,在更响时语音段干扰可同时主导漂移与损失,情感任务放置效应亦较弱。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
50. 先转写再翻译为何在训练时作弊:用联合奖励把生成的前缀拉回推理分布
英文题目:Transcribe, Translate, and Optimize: Joint Reward Learning for Speech Translation
标签:#语音翻译 | #强化学习 | #语音识别 | #多语言 | #音频大模型
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yanghe Dong:机构信息未在 arXiv HTML 中可靠披露
- Wanting Huang:机构信息未在 arXiv HTML 中可靠披露
- Weiran Wang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音翻译任务以英语语音为输入,需输出阿拉伯语、中文、德语和日语目标文本,实际难点在于基于转录的链式思考在有监督微调时以参考转录为翻译前缀,而推理时翻译只能跟随自生成转录,模型对转录的强依赖导致误差传播与训练推理失配。本文方法先以Qwen2.5-Omni-3B按同一提示生成包含转录与翻译标签的单响应,使翻译以自生成转录为条件进入后续优化。接着用Whisper归一化词错率度量转录质量、用chrF++度量翻译质量,并经格式门控按权重构成联合奖励。最后以DAPO版组相对策略优化对组内奖励归一化为优势,并按全耦合方式分配到对应词元以更新策略;与仅优化翻译的直接语音翻译强化学习相比,转录误差可通过翻译奖励回传,同时显式语音识别奖励约束转录漂移。在CoVoST 2测试集下,CoT GRPO的平均BLEU为33.42,高于Direct ST GRPO的平均BLEU 31.65。该结论的适用边界受限于单个3B模型、英语到4种语言及2个评测集,更大规模模型与非英语源语言等外推范围尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
51. 用一帧延迟换真流式:TinyCall 在 2.3 kbps 下的因果编码与标量量化安排
英文题目:Narrowband Voice Communication Using Streaming Neural Compression
标签:#语音编码 | #向量量化 | #流式处理 | #端侧运行 | #高效推理
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Dahong Luo:机构信息未在 arXiv HTML 中可靠披露
- Anannya Trehan:机构信息未在 arXiv HTML 中可靠披露
- Aritrik Ghosh:机构信息未在 arXiv HTML 中可靠披露
- Nirupam Roy:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为单通道窄带语音波形,输出为重建波形,难点是在极窄带宽与端侧算力内存约束下同时保住可懂度、音色与韵律。编码器先将波形映射为连续隐向量并经残差量化离散化为可传输码流,解码器再由缓存隐序列预测复数谱并经逆短时傅里叶变换重叠相加合成波形,训练侧以三阶段渐进策略从连续重建过渡到离散对抗优化。与残差向量量化相比,该链路以固定标量取整替代多码本最近邻搜索,从机制上消除了内存受限的查表瓶颈并省去码本存储。在LibriSpeech测试集评测设置下,TinyCall流式模型的PESQ为1.2994,低于离线形式的PESQ 1.3197。该结论限于英语朗读与情感语音重建,未验证强噪声、丢包、跨语言与主观说话人相似度,低客观分数下的实际可用性仍需听感验证。原文披露在工作站单卡上完成长程训练并在树莓派上满足实时因子小于1的流式推理,但未披露端到端功耗与微控制器级实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
52. 真人对话里多说话人提取为何变难:静音太多与注册语音对不上
英文题目:Challenges of Multi-Speaker Extraction for Real Conversational Speech Enhancement
标签:#目标说话人提取 | #时频分析 | #语音 | #助听器
评分:5.8/10 | 创新 1.1/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Robert Sutherland:School of Computer Science, University of Sheffield, Sheffield, United Kingdom
- Stefan Goetze:School of Computer Science, University of Sheffield, Sheffield, United Kingdom;South Westphalia University of Applied Sciences, Iserlohn, Germany
- Jon Barker:School of Computer Science, University of Sheffield, Sheffield, United Kingdom
📌 核心摘要
本文处理助听器场景下的目标说话人提取与多说话人提取问题,输入为助听器双耳壳4通道或Project Aria眼镜7通道采集的多人混响含噪对话,输出为3路去噪后的同伴语音,佩戴者自身通道不提取。难点有二:一是四人对话中单目标可静音占比高达70%,全量谱损失梯度被静音主导,单目标模型甚至坍缩为全静音输出;二是注册语音为朗读彩虹段落首段,与对话中自发语音声学性质不同。方法链分三步衔接:第一步由说话人编码器将彩虹段落注册语音压缩为说话人嵌入,联合训练分支与预训练RawNet3分支的输出均可缓存供推理调用;第二步将多通道混合信号下采样至16kHz并经短时傅里叶变换与卷积编码得到表征,再由特征级线性调制层注入拼接后的多说话人嵌入,实现目标条件化;第三步将条件化特征送入低延迟时频网格网络,经单向时序循环与掩蔽自注意力输出目标频谱并逆变换重建,其间以随机语音活动检测掩码谱损失按80%比例混合掩码与全量损失来控制静音暴露。关键差异是随机语音活动检测掩码谱损失以掩码与全量混合训练替代全量谱损失,在保留静音建模能力的同时避免梯度被静音主导。在ECHI评测集6525个目标语音段上,预训练嵌入MSX模型从0%掩码到80%掩码将频率加权分段信噪比(frequency-weighted segmental SNR,fwSegSNR)从4.35提升至5.12,短时客观可懂度(Short-Time Objective Intelligibility,STOI)从0.54提升至0.60,Wilcoxon检验p<0.01。结论限于英语四人围坐对话与贴身麦克风去噪延迟对齐参考,对密集重叠、移动说话人、其他语言与强混响食堂泛化未验证。单张NVIDIA H100训练约1.5天,4.8小时评测音频增强约45分钟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
53. 长期照护肺炎听诊:X 线监督与三通道前胸协议的稳定判别
英文题目:Physiologically Informed Digital Auscultation for Pneumonia Detection in Long-term Care Residents
标签:#音频分类 | #CNN | #医疗音频 | #多通道 | #可解释性
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Nicholas Rasmussen:Biobehavioral Nursing & Health Informatics, School of Nursing, University of Washington, 1959 NE Pacific St, Seattle, WA, USA
- Oleg Zaslavsky:Biobehavioral Nursing & Health Informatics, School of Nursing, University of Washington, 1959 NE Pacific St, Seattle, WA, USA
- Zih-Ling Wang:School of Nursing, University of Washington, 1959 NE Pacific St, Seattle, WA, USA
- Hongyu Yu:School of Nursing, University of Washington, 1959 NE Pacific St, Seattle, WA, USA
- Joelle Fathi:Biobehavioral Nursing & Health Informatics, School of Nursing, University of Washington, 1959 NE Pacific St, Seattle, WA, USA
- Kaibao Nie:Electrical Engineering, University of Washington Bothell, 17827 113 Ave NE, Bothell, WA, USA
- Amil Khanzada:Virufy (The Covid Detection Foundation), Los Altos, CA, USA
- Tomoko Ito:Institute of Medicine, University of Tsukuba, 1-1-1 Tenno-dai, Tsukuba, Ibaraki, Japan
📌 核心摘要
长期护理机构中80岁以上居民肺炎常呈非典型表现,输入为6个前胸位点数字听诊录音加生命体征与症状等结构化临床变量,输出为患者级是否肺炎,难点是标签噪声大、体位受限与环境干扰强。 该研究将录音重采样至1 kHz并切窗生成对数功率谱,用共享权重ARP-N卷积网络做窗级分类再均值聚合到患者级,临床变量经双层感知机编码后可与声学嵌入融合。 与施加跨通道空间结构的注意力变体不同,该方法以均值概率聚合保留通道独立性,再以内层交叉验证排序加Borda计数完成通道选择并用时域梯度加权类激活映射对齐盲标注事件。 在185例发热呼吸道症状居民的5x5患者级交叉验证评测设置下,X光监督听诊单模态的准确率为0.783,高于临床诊断监督同架构的准确率0.711。 通道消融显示中胸部3号与4号位点稳定居前,注意力对吸气与哮鸣音覆盖率分别达74%与81%,支撑少通道床旁采集的生理合理性。 结论仅适用于有症状发热单中心人群,未经多中心外部验证与后胸及肺超声对照。 原文未披露训练推理算力与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
54. 混合音乐里谁是合成的:用合成概率图加能量掩码定位目标声部
标签:#音频深度伪造检测 | #CNN | #音乐 | #时频分析
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Richa Namballa:机构信息未在 arXiv HTML 中可靠披露
- François Rigaud:机构信息未在 arXiv HTML 中可靠披露
- Romain Hennequin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为真实与合成stem混合的人机共创音乐,输出为指定目标stem是否为合成的曲目级判定,难点在于合成伪影被真实成分掩蔽且需定位到具体乐器而非整曲打分。方法第一步在全真与全合成曲目上训练分频带局部检测器并滑窗拼接得到时频合成概率图即检查谱图,为混合提供逐时频的合成置信。第二步用维纳滤波思想计算目标stem相对混合的能量主导掩膜,得到与检查谱图同维度的责任归属图并与之堆叠对齐。第三步将两通道窗口输入单一stem无关分类器学习能量主导区与合成置信的相关性,窗口预测平均为曲目判定。相比先分离再二分类的朴素基线与仅用频带信噪比的多层感知机,该机制保留伪影时频局部性并以能量掩膜显式对齐责任归属,可复用于训练未见乐器。原文未提供可核对的关键定量结果。结论边界是人声、鼓、吉他在理想与分离条件下较强,贝斯因分离丢弃高频信息被排除在目标之外,钢琴在分离条件下误报上升且稀疏段不确定,目标stem自身为混合的情形未建模。实验仅基于EnCodec单一编解码器代理验证故适用边界受限于分离质量与编解码器泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
55. 开放收集为何仍数不出酷儿声音:六个语音数据集审计与四组实践张力
英文题目:Queer inclusion in speech datasets: An audit and taxonomy of practical tensions
标签:#语音属性识别 | #统计分析 | #公平性 | #隐私保护 | #语音
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Brooklyn Sheppard:机构信息未在 arXiv HTML 中可靠披露
- Anaelia Ovalle:机构信息未在 arXiv HTML 中可靠披露
- Adina Williams:机构信息未在 arXiv HTML 中可靠披露
- Levent Sagun:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是审计英语语音数据集中酷儿声音可见性并解释缺失成因,输出跨数据集对比与张力分类,难点在于语音难以匿名化、身份敏感流动而标注体系长期只有二元性别。第一步按多样性覆盖、公平评估用途与专用设计标准抽样选定技术数据集,并加入酷儿专项数据集作对照,输出名单直接进入编码。第二步沿性别标注选项与分布、机构归属与伦理审查披露、招募方式、数据访问与许可轴结构化编码形成可比矩阵。第三步由编码差异反推采集惯例与社群价值冲突并归纳为规模与包容、效率与参与、开放与自主、静态分类与流动身份之间的张力,后续分析均基于该矩阵展开。与既有偏见研究相比,本文关键机制差异在于不训练或评测任何语音模型,而是把数据集创建流程本身作为研究对象,因而结论指向采集规范改革而非模型调优。原文未提供可核对的关键定量结果。该分类的适用边界受限于英语语料及其基于性别身份的狭义酷儿操作化定义,其向更广义酷儿群体的外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
56. 短到长真的教会了模型吗:把排序、组批与损失归一化解开
标签:#音频生成 | #课程学习 | #语音 | #统计分析
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hongjin Song:机构信息未在 arXiv HTML 中可靠披露
- Runwu Shi:机构信息未在 arXiv HTML 中可靠披露
- Weiqiao Shan:机构信息未在 arXiv HTML 中可靠披露
- Jiale Luo:机构信息未在 arXiv HTML 中可靠披露
- Yujin Wang:机构信息未在 arXiv HTML 中可靠披露
- Yifei Wu:机构信息未在 arXiv HTML 中可靠披露
- Chunxiang Jin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该研究针对语音标记语言模型中短到长训练增益难以归因问题,输入为离散语音标记块序列,输出为下一标记预测,难点在于长度排序同时改变组批构成、标记保留与批均损失权重。方法链分三步:先构造共享首轮分组但顺序不同的分支以分离批量组成与呈现顺序,再以固定成员重排检验纯顺序效应,最后以标记均衡损失干预检验归一化机制,前步分组输出直接作为后步对照输入。相比直接比较排序与随机,该设计将呈现顺序与批量构造及损失归一化解耦,具有诊断意义。在LibriSpeech train-clean-100填充评估设置下,Composition的PPL指标为31.682,低于epoch-wise shuffle的PPL指标31.857。固定组批对照显示首轮短到长呈现顺序效应微弱且不显著,而将批均损失切换为标记均衡损失后首轮分组增益不再显著,表明增益源于批依赖归一化而非顺序本身。该结论仅适用于测试的87M参数Transformer设置,跨分词器及长程课程的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
57. 多数类准确率会骗人:自然脊柱门诊普通话语音的开源情感识别为何在少数情绪上失效
标签:#语音情感识别 | #评测协议 | #语音 | #医疗音频 | #数据标注
评分:5.6/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Tsz Yuet Yeung:机构信息未在 arXiv HTML 中可靠披露
- Zonglin He:机构信息未在 arXiv HTML 中可靠披露
- Dong Chen:机构信息未在 arXiv HTML 中可靠披露
- Huili Peng:机构信息未在 arXiv HTML 中可靠披露
- Huiren Tao:机构信息未在 arXiv HTML 中可靠披露
- Kenneth MC Cheung:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本研究处理自然脊柱门诊中普通话患者与家属自发语音到六类基本情感标签的映射,难点在于情感表达低唤醒且被压平、类别严重偏向中性并叠加诊室噪声、重叠语音与普通话声调和方言码切换干扰。采集流水线先对门诊音频做降噪与响度归一化并切分保留患者或家属有效话轮及其后续医生回应以维持语境,再由多名研究者经校准后盲听标注并经多数投票与低一致仲裁形成参考标签,随后以该参考标准统一评测三种开源模型的四类互补准确率。与演员表演语料上训练的原型情感假设不同,自然临床话语迫使模型面对模糊边界与长尾分布,从而暴露多数类主导的虚高准确率,其实际意义在于必须用均衡与加权指标检验少数情感的临床可用性。在香港大学深圳医院65条话语的临床评测设置下,SenseVoice的未加权准确率为61.5%,高于emotion2vec+的未加权准确率55.4%。该结论仅适用于单中心小样本先导验证,不支持向多中心部署或临床结局预测外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
58. 混合声能写成声源之和吗:冻结音频表示的加性组合诊断
标签:#音频理解 | #评测协议 | #统计分析 | #可解释性
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Chenhao Xue:机构信息未在 arXiv HTML 中可靠披露
- Zhijin Guo:机构信息未在 arXiv HTML 中可靠披露
- Joyraj Chakraborty:机构信息未在 arXiv HTML 中可靠披露
- Martin Reed:机构信息未在 arXiv HTML 中可靠披露
- Nikolaos Thomos:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文考察冻结音频编码器是否把多声源场景表示为各声源贡献之和,输入为真实录音片段与多热声源标签,输出为组合层面的表示预测,难点在于标签存在层级相关、声源存在掩蔽混响与非线性编码干扰。诊断链条分为三环:先抽取冻结表示并按相同标签集合分组平均得到组合表示,再用典型相关分析(Canonical Correlation Analysis,CCA)检验标签与表示的线性对齐,随后在留一组合与重复组合留出上用岭回归拟合声源贡献矩阵并预测未见组合。相对跨模态对齐评测 CompA 的差异在于本文直接检验音频表示空间内部的可加性,并引入置换基线与标签重叠基线分离真正的组合泛化。FSD50K 上 20 次重复留出约 20% 组合时,CLAP 在 CKA 指标上取得 0.60,超过置换基线的 0.21 与标签重叠基线的 0.52,而语音模型则落后于标签重叠基线。该结论仅在已知声源的未见组合均值预测范围内成立,对时序结构、开放声源与实例级分离均未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
59. 只用两个全向麦克风做出可转向高阶差分波束:神经差分波束形成器如何学图案
英文题目:Dual-Microphone Steerable High-Order Neural Differential Beamformer
标签:#语音增强 | #波束成形 | #麦克风阵列 | #语音
评分:5.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Weilong Huang:机构信息未在 arXiv HTML 中可靠披露
- Emanuël A. P. Habets:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理双全向麦克风在自由场中按预设差分波束图做空间滤波的任务,输入为双通道短时傅里叶变换(Short-Time Fourier Transform,STFT)混合信号,输出为指向可转向方向的单通道目标信号,难点是双麦克风经典差分阵列(Differential Microphone Array,DMA)最高一阶且端射外不可转向。方法链分三步:先将双通道实虚谱堆叠送入频率维双向长短期记忆网络(Bidirectional Long Short-Term Memory,BiLSTM)建模瞬时谱空间关系,再经时间维单向网络(Unidirectional LSTM,UniLSTM)建模时序依赖并由转向角独热嵌入初始化状态,最后经线性层输出逐频复数波束成形权重并与阵列信号内积得到估计。与经典差分波束成形器和参数化空间滤波器相比,该方法不推导解析权重而是以波束图加权直达声为监督直接回归最优复权重,因此突破了阶数与白噪声放大的解析约束。在EARS语音合成的双声源测试集上,端射方向一阶心形图下所提神经差分波束成形器(Neural Differential Beamformer,NDBF)信号失真比(Signal-to-Distortion Ratio,SDR)为25.93 dB,超过神经方向滤波(Neural Directional Filtering,NDF)的25.85 dB。该结论仅在半圆自由场仿真和固定3 cm间距下验证,对强混响、阵列失配与多干扰下的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
60. 当时间轴变成可以斜切的体:Passing 如何把单段车窗录像走成无尽旅程
英文题目:Passing: An Endless Journey through Reconstructed Spacetime with AI-Generated Sound
标签:#视频到声音生成 | #生成模型 | #音视频 | #实时处理 | #音视频交互
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.4/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:后 50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Akira Takahashi:Sony Group Corporation, Tokyo, Japan
- Chihiro Nagashima:Sony Group Corporation, Tokyo, Japan
- Zhi Zhong:Sony Group Corporation, Tokyo, Japan
- Shusuke Takahashi:Sony Group Corporation, Tokyo, Japan
- Yuki Mitsufuji:Sony Group Corporation, Tokyo, Japan
📌 核心摘要
Passing的任务是以单段多摩单轨车窗连续录像为输入,生成与重构时空流同步的推测性听觉解释为输出,实际难点在于重采样破坏线性时间与物理声源对应,不存在客观正确配乐且声音须随分支逐刻新生。方法先将4K 480-fps HDR录像堆叠为时空体并沿倾斜旋转截面重采样,预渲染多轨迹片段库进入下一步候选池。再由相机在场状态概率触发A/B默认循环与C/D分支间的跳转,选片结果决定显示的4K HDR 120-fps视频及其224×224 25-fps条件序列。最后将条件序列送入实时SpecMaskFoley,由ControlNet加FT-Aligner承担视听时间对齐并由车内环境声CLAP嵌入提供语义锚定,合成32-kHz立体声。与原版并用CLIP语义与ControlNet对齐不同,该配置删除CLIP而完全交由听觉域锚定,既防止漂向无关纹理又解除实时推理瓶颈。在SpecVQGAN压缩率评测设置下,Passing的压缩率指标为800×压缩,低于SpecMaskFoley的压缩率指标820×压缩。该结论的适用边界受限于单一路线与展览装置,尚未验证其他景观的外推,系统部署硬件为RTX 4080工作站并以显示与条件分离降低推理开销。
🔗 开源资源
- 演示资源:https://ryufurusawa.com/passing — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
61. 谁来定义酷儿语音数据:从众包采集到共同设计的策展转向
英文题目:Towards participatory speech dataset curation: A queer case study and conceptual framework
标签:#语音属性识别 | #数据集构建 | #语音 | #公平性 | #隐私保护
评分:5.3/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.5/1.5 | 清晰度 0.9/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 0.5/1.5
排名:后 50% | 文档类型:理论研究 | arXiv 原文
👥 作者与机构
- Brooklyn Sheppard:机构信息未在 arXiv HTML 中可靠披露
- Anaelia Ovalle:机构信息未在 arXiv HTML 中可靠披露
- Adina Williams:机构信息未在 arXiv HTML 中可靠披露
- Levent Sagun:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理以酷儿群体为代表的边缘化语音数据策展问题,输入是身份敏感且随时间与语境变化的语音,输出是可供识别、分类与合成研究使用的负责任数据集,难点在于出柜风险、历史不信任与众包式标注的结构性擦除。所提方法链包含先界定服务社区与被排除者,再由社区共同制定语音体裁与公开存储维护规则,接着确定协作与致谢等参与方式,最后落实个人在参与程度与撤回权上的自主性,四者以双向迭代相互修正。与既有自上而下众包相比,关键机制差异在于把项目制定权内嵌于社区并强调知识双向共享,因而更适配声音可识别且敏感的语音场景。在Common Voice 16.0语料的评测任务下,包容性评测覆盖的性别得分为3类,高于仅覆盖二元划分的性别得分2类。该结论仅适用于概念指导层面,尚未在任何真实社区建库流程中验证其可行性与风险控制效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
62. 下限增益保住弱语音:用逐帧贝塔约束修补判决引导增强
英文题目:A Hybrid Classical-Learning Framework for Adaptive Decision Directed Speech Enhancement
标签:#语音增强 | #自适应滤波 | #语音
评分:4.1/10 | 创新 0.7/2 | 技术严谨 1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5
排名:后 50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ali Rajabi:机构信息未在 arXiv HTML 中可靠披露
- Xiangwei Zhou:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音增强需从加性噪声观测中恢复干净语音,难点在于非平稳噪声下弱语音易被过度抑制并产生音乐噪声。本文提出自适应Beta约束决策导向(Adaptive Beta-Constrained Decision-Directed,ABCDD)框架:先在短时傅里叶变换(Short-Time Fourier Transform,STFT)域估计噪声功率谱密度并计算后验信噪比,再递归估计先验信噪比并映射为维纳型增益,接着用帧级下限对增益截断,最后由多层感知机(Multilayer Perceptron,MLP)从帧特征预测该下限并经逆变换重构波形。与传统谱减和决策导向方法相比,关键差异是用可学习下限替代固定地板以保留低信噪比成分。在代表性单例上ABCDD在6项指标全面优于经典决策导向。在VoiceBank-DEMAND测试集评测下,MLP-beta ABCDD的平均尺度对齐信噪比指标为13.82 dB,高于噪声基线的平均尺度对齐信噪比指标9.41 dB。该结论仅在该数据集划分与尺度对齐信噪比口径下成立,未验证感知质量、可懂度与强非平稳噪声外推性。感知质量与强非平稳场景外推尚未验证,其适用边界受限于该语料划分与该信噪比口径。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。









































