共分析 75 篇论文
⚡ 今日概览
✅ 筛选入选 75 篇 → 🔬 深度分析完成
🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #语音识别 | 13 篇 | █████████████ |
| #文本到语音 | 5 篇 | █████ |
| #语音增强 | 5 篇 | █████ |
| #音频问答 | 5 篇 | █████ |
| #音频分类 | 4 篇 | ████ |
| #全双工语音交互 | 3 篇 | ███ |
| #声源定位 | 3 篇 | ███ |
| #语音属性识别 | 3 篇 | ███ |
📊 论文评分排行榜(75 篇,按分数降序)
📋 论文列表
🖼️ 有图的论文会在这里展示首张原论文图;原图链接见对应独立页面。
🥇 单麦克风既要分开声音又要估计每个声源的房间响应:DAMSEP 的联合做法
英文题目:DAMSEP: Distance-Aware Monaural Source Separation using Multi-RIR Estimation
标签:#语音分离 | #房间脉冲响应估计 | #多任务学习 | #状态空间模型
评分:8.4/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Wen Wen:机构信息未在 arXiv HTML 中可靠披露
- Qiang Zhou:机构信息未在 arXiv HTML 中可靠披露
- Yu Xi:机构信息未在 arXiv HTML 中可靠披露
- Haoyu Li:机构信息未在 arXiv HTML 中可靠披露
- Bohan Li:机构信息未在 arXiv HTML 中可靠披露
- Kai Yu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
单麦克风混响混合需同时恢复各源干净语音、混响源像及其传播对应的房间脉冲响应(Room Impulse Response,RIR),难点在于重叠语音互相干扰且单通道缺乏空间线索。距离感知单通道声源分离多房间脉冲响应估计(Distance-Aware Monaural Source Separation using Multi-RIR Estimation,DAMSEP)先由分离主干得到两路混响频谱,再经共享去混响分支预测干净频谱,并将两分支表征融合后估计各源复数卷积传递函数(Complex Convolutive Transfer Function,CTF)。训练联合优化干净源波形损失、混响源频谱损失与基于参考干净频谱滤波重建的CTF重建损失,推理时将CTF经扫频激励与逆滤波还原为时域RIR并比较直接混响比(Direct-to-Reverberant Ratio,DRR)得到近远排序。与只能处理单说话人的盲RIR方法不同,该机制让分离监督约束响应估计,响应重建反过来规范分离。在HETMIXR两源评测设置下,DAMSEP的SI-SDRi指标为14.90 dB,高于TF-Locoformer的SI-SDRi指标14.25 dB。该结论限于双源、8 kHz、60拍CTF建模与模拟训练分布,密集混响与同距离源尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/Wenanzhi/DAMSEP — 链接可访问(HTTP 200)
数据相关资源:https://github.com/Wenanzhi/DAMSEP — 链接可访问(HTTP 200)
数据相关资源:https://www.kaggle.com/datasets/limzhiminjessie/query-by-humming-qbh-audio-dataset/data — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 同样 4 比特,不同结局:跨架构 TTS 后训练量化的敏感部件地图
标签:#文本到语音 | #模型量化 | #端侧运行 | #模型比较 | #高效推理
评分:8.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Se Un Park:机构信息未在 arXiv HTML 中可靠披露
- Yutae Kim:机构信息未在 arXiv HTML 中可靠披露
- Junyoung Park:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
文本到语音需把文本映射为自然可懂的波形,端侧部署要求压缩内存与算力,而训练后量化稍有不慎就会损伤韵律、自然度与可懂度且敏感位置随架构而变,难以照抄位宽。本文先以对称最近舍入扫描8比特、6比特与4比特权重及逐张量、逐通道和分组缩放粒度,再对整机与声码器、语言模型和编解码器等部件做消融以定位敏感部件并用前一步的退化排序决定保护对象,接着用分组缩放与逐层GPTQ校准保护该部件,最后叠加8比特动态激活并在真实int8与int4内核上验证系统代价。与仅研究单系统或单方法的工作不同,该文揭示敏感部件完全因模型而异且不能由前馈、扩散或自回归等模型类别预测,因而必须分阶段实测而非照抄位宽,分阶段消融加校准是恢复音质的关键。在200句英语评测上,4比特逐通道权重使Supertonic的UTMOS下降2.8而Kokoro仅下降0.07。该结论受限于英语预测分主导与小样本盲测,真实延迟与能耗还随运行时剧烈变化。Mac mini上Supertonic的4比特路径为fp32延迟的0.60倍而int8反而更慢,故每种配置都需在目标端验证。
🔗 开源资源
- 代码相关资源:https://github.com/uxfacdev/tts-ptq-map — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 能识别风险却不拒绝:音频越狱暴露的识别与拒答脱节及选择性内部干预
英文题目:AEGIS: Audio Endogenous Guarding via Internal Signals Against Large Audio-Language Model Jailbreaks
标签:#音频理解 | #LoRA | #音频安全 | #音频大模型
评分:8.3/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yu-Ling Liao:机构信息未在 arXiv HTML 中可靠披露
- Tzu-Chin Chiu:机构信息未在 arXiv HTML 中可靠披露
- Zong-You Chen:机构信息未在 arXiv HTML 中可靠披露
- Chi-Lei Tsai:机构信息未在 arXiv HTML 中可靠披露
- Shao-Yuan Lo:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
大型音频语言模型需同时处理语义混淆、多语言变体、副语言变化与波形扰动等异构音频输入,期望对有害请求拒答而对良性输入正常应答,难点在于成功越狱究竟源于未能识别风险还是识别后未能触发拒答。所提防御Aegis先在探测选定的中间层读取最终提示词表征并由轻量多层感知机输出连续风险分,随后以该分数加权激活后期解码层的低秩安全适配器残差,最后经阈值判定与闭环强度增长完成高风险输入的拒答触发而低风险输入几乎不受影响。与输入过滤与全局微调不同,该机制将保留的中层风险信号直接转化为后期拒答倾向的选择性放大,而非对所有输入施加统一约束。在6个LALM与3个异构音频越狱基准共18组配对的域内评测设置下,Aegis的不安全率指标为0.4%,低于未防御基线的不安全率指标17.9%。该结论依赖白盒内部表征访问与非自适应攻击评测,对闭源模型与针对门控本身的自适应攻击尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/azzzzliao/aegis-audio-defense — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 不直接去噪而是先分轨:把修复拆成六个可调声轨的实时框架
英文题目:RESTORE: REal-time Steerable Music resTORation and bandwidth Extension via stem disentanglement
标签:#音频修复 | #生成对抗网络 | #音乐 | #实时处理
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Meiying Chen:机构信息未在 arXiv HTML 中可靠披露
- Benjamin R. Thompson:机构信息未在 arXiv HTML 中可靠披露
- Michael C. Heilemann:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
历史音乐修复输入为带限、叠加嘶声与脉冲噪声的44.1 kHz立体声混合,输出需同时去噪并补足缺失高频,难点在于修复标准主观且级联系统误差易累积。RESTORE先把混合Transformer分离骨干扩展为六个输出头,第一步将退化混合单次分解为vocals、music、hiss、transients、residual与高频扩展六路stems,第二步对五路带限stems施加混合一致性约束使其加和重构输入并令残差头默认沉默,第三步仅对高频扩展头启用对抗训练合成缺失高频后送入可调增益重混。用户通过stems增益实现事后可操控重混,生成内容被隔离而非混入干净信号。与已有级联扩散方案的关键差异在于判别式分离与生成式扩展解耦为不同输出头,避免早期分离错误污染生成阶段。在历史录音歌曲类评测设置下,RESTORE全频带恢复的FAD指标为12.13,低于iZotope RX 12的FAD指标13.10。该结论限于78 RPM风格仿真与所选曲库,未验证严重削波、抖晃外推及主观听感偏好。单次前向在单卡上达到约50倍实时,训练成本为单卡56小时。
🔗 开源资源
代码相关资源:https://melissachen15.github.io/restore-audio-demo/ — 链接可访问(HTTP 200)
演示资源:https://melissachen15.github.io/restore-audio-demo/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 先定位区间再局部比拼:PTC-Bias 用音素时间竞争管住大偏置词表
标签:#语音识别 | #检索增强 | #CTC | #关键词检测
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zhiqi Ai:机构信息未在 arXiv HTML 中可靠披露
- Han Cheng:机构信息未在 arXiv HTML 中可靠披露
- Shiyi Mu:机构信息未在 arXiv HTML 中可靠披露
- Yongjin Zhou:机构信息未在 arXiv HTML 中可靠披露
- Shugong Xu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
上下文偏置语音识别需要在给定大规模偏置词表时转写稀有词,难点是长提示带来干扰且初始转写常漏掉近音词。该工作提出 PTC-Bias(Phoneme-Level Temporal Competition Bias),两阶段复用冻结音频编码器后轻量音素 CTC 分支输出的帧级音素后验。预填充阶段 PTC 检索(PTC Retrieval)把偏置词转为带重音的音素 Trie 并做帧同步 CTC 搜索,再经区间重叠竞争计算纳入边缘概率,得到至多 10 个词及其语音区间送入语音大语言模型(SpeechLLM)提示。解码后 PTC 纠错(PTC Correction)在缓存后验的局部窗口内比较检索词与转写差异片段的 CTC 前向概率,以声学裕量加词法与边界检查决定替换。与独立排序或单路径关键词点选不同,该方法把重叠发音显式建模为互斥解释并在检索与纠错两次复用同一证据做竞争。在 LibriSpeech test-clean / test-other 与 2000 个干扰词下,Prompt-SLAM-ASR-7B 的偏置词错率(B-WER)为 3.38% / 7.63%,相对 CTC-Filter 的 4.41% / 10.02% 降低 23.4% / 23.9%,而非偏置词错率(U-WER)为 1.06% / 2.43%,与基线 1.03% / 2.47% 基本持平。该结论限于英语朗读语音与至多 2000 词偏置表,未验证噪声、对话或跨语言外推;原文未披露训练时长、推理端到端成本与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/aizhiqi-work/PTC-Bias — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 别只学老师说什么,更要学它因听到音频才改口的部分
英文题目:Reward-Tilted On-Policy Distillation for Acoustic Grounding in Audio-Language Models
标签:#音频问答 | #知识蒸馏 | #音频大模型 | #后训练
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kaiyang Li:机构信息未在 arXiv HTML 中可靠披露
- Shaobo Han:机构信息未在 arXiv HTML 中可靠披露
- Yue Tian:机构信息未在 arXiv HTML 中可靠披露
- Shihao Ji:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频问答以录音与文本问题为输入并输出答案,难点是模型可仅凭语言先验猜对选项而忽视声学证据。奖励倾斜在策略蒸馏沿学生自生成前缀送入冻结教师,分别计算有音频上下文\(\xi_t^M=(x^M,a,y_{\lt t})\)与无音频参考上下文\(\xi_t^{\varnothing}=(x^{\varnothing},a,y_{\lt t})\)下的下一词分布,以二者对数概率差\(r_t(v)=\log p_{T,t}^M(v)-\log p_{T,t}^{\varnothing}(v)\)为奖励,对原教师分布做指数加权归一化得到\(q_{\alpha,t}(v)\propto p_{T,t}^M(v)\exp(\alpha r_t(v))\),再用逆向KL让学生拟合该目标并辅以金答案交叉熵。与直接拟合教师分布的普通在策略蒸馏相比,该机制在词表层面放大音频带来增益的候选,而非整体锐化分布。训练时仅更新学生并以教师答对为门控保留蒸馏监督,无音频教师分支只在训练时计算而不进入部署解码。在9,000样本MMAU测试集上,由Ke-Omni-R-3B后训练得到的Mizar-3B达72.72%准确率,为所比较3B模型最高,接近7B教师73.86%水平。该结论在两类3B学生与MMAU、MMAR、ADQA-clean三项多选基准上成立,对开放式问答与分布外音频的外推尚未证明。原文未披露训练成本与推理延迟。
🔗 开源资源
- 代码相关资源:https://github.com/KaiyangLi1992/RT-OPD — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 双向连接不等于双向约束:用强方向注意力校准弱方向的 RecCAR
标签:#音视频生成 | #正则化 | #注意力机制 | #扩散模型 | #音视频
评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ohad Rahamim:Bar-Ilan University
- Dvir Samuel:NVIDIA
- Idan Schwartz:Bar-Ilan University
- Gal Chechik:Bar-Ilan University;NVIDIA
📌 核心摘要
联合生成视频Video与伴随模态Motion或Audio要求双路输出在空间与时间上互洽,难点是架构双向连接但信息流单向主导,伴随模态难以约束视频导致解剖错误与音画失步。本文先将双向交叉注意力统一为同一伴随词元下对视频词元的对应分布,再以停止梯度的视频到伴随模态分布为固定参照,最后用KL散度将伴随模态到视频的重归一化分布向其对齐并与生成损失联合微调LoRA参数。与仅做数据微调或依赖外部同步器的方法不同,该机制复用模型内部已学好的对应结构而无需新增标注或推理模块。在VidProM抽取1000条提示构成的测试集评测设置下,EchoMotion+RecCAR的Human Anatomy得分为0.75,高于EchoMotion的Human Anatomy得分0.69。在AVGen-Bench共235条提示的基准评测设置下,JavisDiT++ + RecCAR的AV Desync为0.438±0.08,低于JavisDiT++的AV Desync 0.518±0.01。该结论限于EchoMotion、JavisDiT++与LTX-2三类骨干及短片段联合生成,未验证长视频、多人物遮挡与强噪声条件外推。原文披露视频-运动分支在4块H100上约48 GPU小时,音频分支硬件时长未系统披露。
🔗 开源资源
- 代码相关资源:https://github.com/ohad204/RecCAR — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 压缩后才加税:Whisper 权重压缩如何重分人口组的时间负担
英文题目:Temporal Taxation Compounds Under Post-Training Compression of Whisper Models
标签:#语音识别 | #模型剪枝 | #模型量化 | #知识蒸馏 | #公平性
评分:8.0/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Srishti Ginjala:The Ohio State University, Columbus, OH, USA
- Eric Fosler-Lussier:The Ohio State University, Columbus, OH, USA
- Christopher W. Myers:Air Force Research Laboratory, USA
- Srinivasan Parthasarathy:The Ohio State University, Columbus, OH, USA
📌 核心摘要
自动语音识别需将语音声学输入转写为文字,部署时经后训练权重量化、剪枝与蒸馏后的人口组误差再分配是实际难点。先以Whisper家族原始权重与LibriSpeech校准语音为输入,施加INT8、两种INT4量化、50% Wanda非结构化剪枝及配对Distil-Whisper蒸馏,职责是生成可部署变体,输出为压缩模型集合。再以该压缩模型集合与Fair-Speech等三套语料分组语音为输入,负责聚合分组词错误率并换算为时间税差值与最大最小比,输出的分组误差矩阵直接进入下一步校验。最后以分组误差矩阵为输入,用配对置换检验与信噪比回归负责显著性与混杂校验,输出分布偏移来源结论。与视觉长尾受损直觉不同,剪枝的复合效应随容量单调上升而蒸馏多呈抚平,量化则与配方强相关,三者不可互换,体现了权重压缩而非音频失真的公平性机制差异。在Fair-Speech基准下,Whisper-large-v3经50% Wanda剪枝后的Black/AA-vs-Asian组WER时间税差从FP16基线的WER时间税差30.14秒升至剪枝后的WER时间税差63.73秒每分钟语音,相对增幅达111.4%。结论适用边界受限于Whisper英语朗读语音,尚未验证自发语音、声调语言及GPTQ与AWQ路线的外推。计算量约为150 A100 GPU小时,硬件开销仅覆盖评测所需的A100计算。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 匿名语音还能听清哪个音素:用多模型投票逼近人耳的最小对立体测试
英文题目:ASR ensembling for phoneme intelligibility evaluation of speech anonymizers
标签:#语音可懂度评估 | #模型集成 | #说话人匿名化 | #众包评测
评分:7.9/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Victor Ménestrel:机构信息未在 arXiv HTML 中可靠披露
- Sebastian Möller:机构信息未在 arXiv HTML 中可靠披露
- Slim Ouni:机构信息未在 arXiv HTML 中可靠披露
- Dorothea Kolossa:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音匿名化需在隐藏说话人身份的同时保留内容可懂度,输入为匿名后语音、输出为与人类听辨一致的可懂度分数,难点在于主流词错率受语义上下文与同音专有名词干扰且与真实听感脱节。作者先基于英语诊断性押韵测试构建众包二选一听辨流程,对两千余条刺激收集人类正确率并换算为可懂度作为映射目标。接着让十二个自动语音识别模型参加相同最小对强制选择,其中连接时序分类模型用负损失经Softmax得到二元后验,自回归模型取首个分歧词元概率归一化得到二元后验。再由后验导出硬投票正确率、软投票后验加权差和对数似然比三种估计并做一元线性映射到人类分数,实现由刺激到特征与条件的聚合诊断。相对单模型词错率评估,该方法以多模型投票对冲个体对声学上下文的敏感性,用音素级最小对选择替代有语义偏置的连续转写。在刺激级无载体句测试条件下,十二模型集成的Isoft的指标r2为0.4039,高于Cohere Transcribe的指标r2 0.2392。结论仅适用于高可懂度区间的英语孤立词匿名语音,对强退化或噪声场景尚未验证,LLR 失效被归因于开放 ASR 校准不足。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/VictorMenestrel/DALT-for-Speech-Anonymizers — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 长音频术语总被改错:用全文上下文做侦查再定点重听
英文题目:agentic-ger: terminology recovery in long-form speech using global context
标签:#语音识别 | #检索增强 | #长音频处理 | #多语言 | #语音
评分:7.9/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yanqiao Zhu:机构信息未在 arXiv HTML 中可靠披露
- Wupeng Wang:机构信息未在 arXiv HTML 中可靠披露
- Zhifu Gao:机构信息未在 arXiv HTML 中可靠披露
- Xiangang Li:机构信息未在 arXiv HTML 中可靠披露
- Xie Chen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
长语音转写输入为分钟到小时级音频与带时间戳的初始分段转写,输出为修正后的全文,难点是稀有领域术语易声学混淆且在不同片段中假设不一致。智能体生成式纠错先从初始全文抽取固定的主题、领域与术语摘要,再结合当前全文与工作记忆每轮提出少量可疑跨度并给出怀疑理由,随后截取对应音频段用专用识别模型重转写得到第二假设,最后由大语言模型综合发音兼容性、重转写支持度与跨段一致性做保留或最小编辑裁决,已接受修改更新全文与记忆并指导下一轮。与仅看单段的局部纠错相比,全文约束候选发现与替换选择,避免被单次错误重转写带偏。在GigaSpeechBench中英各约120小时12域评测中,4种LLM与2种初始ASR的32种配置均降低术语错误率,中文Whisper基线结合Max无思维链时偏置字错率(Biased Character Error Rate,B-CER)从35.07%降至22.16%,相对下降36.8%。适用边界是替换错误改善主导而删除错误缺乏文本线索难以发现,英文删除占比更高故增益更小。思维链对27B/31B稠密模型稳定增益,对Flash/Max混合专家模型持平或回退,而推理开销显著上升,Gemma4-31B在中文Whisper转写上校正实时率从0.42升至5.71,硬件为四卡NVIDIA H100经vLLM服务的服务器。
🔗 开源资源
- 代码相关资源:https://github.com/QwenAudio/FunResearch — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 音频问答的不确定性更依赖音频证据:首词概率为何能胜过十次采样
英文题目:Broadening Uncertainty Estimation for Audio Question Answering Across Methods, Formats, and Inputs
标签:#音频问答 | #评测协议 | #音频大模型 | #模型评估
评分:7.8/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Aaron Isidore Grace:机构信息未在 arXiv HTML 中可靠披露
- Weiran Wang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频问答以音频与文本问题为输入并输出答案,难点在于音频语言模型常生成流利却无音频支撑的内容且置信度失真难以事前识别。为此研究先在四个开源模型与五个音频问答基准上并行比较概率、采样、自我验证、证据冲突与音频静音对比五类不确定性信号,其输出的错误检测分数进入下一步跨格式比较。接着将四个多选基准剥离选项转为开放作答并用答案匹配裁判打分,把首词元分布、序列似然与语义聚类采样的不确定性分数映射到同一正确性标签上。最后保留选项而分别移除音频或问题,把缺失输入下的准确率与不确定性变化回传以检验不确定性对证据来源的敏感性。与采样和自我验证相比,首词元信号直接读取决策点分布且无需额外调用,因而更高效稳定并保留了主要不确定性信息。在多选题基准下,首词元最高概率的AUROC为.740,高于十样本离散语义熵的AUROC.708。该结论适用边界受限于所测开源模型与短音频问答基准,长音频推理与需弃答校准的部署场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/aarongrace/uncertainty2026 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 先重建还是先生成:用带噪部分上下文把流匹配梯度连回编码器
标签:#音频生成 | #流匹配 | #端到端学习 | #自监督学习
评分:7.7/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Runwu Shi:机构信息未在 arXiv HTML 中可靠披露
- Kai Li:机构信息未在 arXiv HTML 中可靠披露
- Yujin Wang:机构信息未在 arXiv HTML 中可靠披露
- Dong Yang:机构信息未在 arXiv HTML 中可靠披露
- Jiahui Li:机构信息未在 arXiv HTML 中可靠披露
- Jiang Wang:机构信息未在 arXiv HTML 中可靠披露
- Chang Zeng:机构信息未在 arXiv HTML 中可靠披露
- Benjamin Yen:机构信息未在 arXiv HTML 中可靠披露
- Ashizawa Takeshi:机构信息未在 arXiv HTML 中可靠披露
- Chunxiang Jin:机构信息未在 arXiv HTML 中可靠披露
- Kazuhiro Nakadai:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
文本到音频(Text-to-Audio,TTA)生成需由开放文本描述合成语义准确且声学真实的高质量通用声音,难点在于为重建最优的紧凑隐空间未必适合后续生成建模。Unite-Audio 先以在线编码器编码部分波形并经指数滑动平均(Exponential Moving Average,EMA)编码器提供全量目标,再将二者加噪至同一流时间构造完整流输入以训练文本条件流模型,接着冻结表征专训由噪声出发的全文生成,最后以 Flow-GRPO 强化语义对齐。与冻结分词器的两阶段范式及依赖外部语义教师的方法不同,该框架让生成损失直接塑造从零学习的连续隐空间并保留重建分支以维持可解码性。在 AudioCaps-886 评测上最终模型取得 CLAP 相似度 0.534 与 PaSST KL 散度 1.057,均优于表中对比系统并保持少步采样鲁棒性。该结论目前仅在 16 kHz 最长 20 秒英文描述场景验证,长音频、音乐性与跨域泛化尚未证明。原文未披露训练时长与部署成本,仅报告单卡 H800 上的相对实时因子。
🔗 开源资源
模型相关资源:https://runwushi.github.io/Unite-Audio/ — 链接可访问(HTTP 200)
演示资源:https://runwushi.github.io/Unite-Audio/ — 链接可访问(HTTP 200)
复现相关资源:https://runwushi.github.io/Unite-Audio/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 小参数也要听懂声音:Mizar 用频率合并与三阶段训练补齐音频证据
英文题目:Mizar: A 159M-Parameter Audio-Language Model for Audio Understanding
标签:#音频问答 | #多模态学习 | #音频大模型 | #端侧运行
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Kaiyang Li:机构信息未在 arXiv HTML 中可靠披露
- Shaobo Han:机构信息未在 arXiv HTML 中可靠披露
- Yue Tian:机构信息未在 arXiv HTML 中可靠披露
- Shihao Ji:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频语言模型需以单段录音加文本问题为输入并生成依赖声学证据的答案,难点在于紧凑解码器易忽略音频而退化为语言猜测。本文先以大规模指令混合建立音频与文本对齐,再以强音频依赖子集迫使模型利用声学信息,最后以后训练同时纠正选项位置偏好并补齐弱项。前者提供可推理基座,中者筛选难例改变依赖,后者以平衡重排与师生分区实现保留与补强。相对同规模前作的关键机制差异在于频率合并映射与教师辅助四象限采样,前者保留频带差异后融合,后者针对性排练弱点。跨五个后训练随机种子,在MMAU测试集上平均准确率达到52.92%,在MMAR上为42.42%,在ADQA-clean上为36.02%,相对同协议复评的Mellow分别提升11.45、8.02和5.77个百分点,对应相对增益27.61%、23.31%和19.07%。在单CPU四线程上从打开音频到完整回答的平均时延为1.094秒,峰值进程内存为1.66 GiB。该结论仅适用于英文环境声问答与相近多选题分布,对长音频、重叠声与分布外口音尚未验证。
🔗 开源资源
代码相关资源:https://github.com/KaiyangLi1992/Mizar_159M — 链接可访问(HTTP 200)
模型相关资源:https://github.com/KaiyangLi1992/Mizar_159M — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 把口音减掉而把人留下:口音类比引导如何跳出同一条权衡曲线
英文题目:Accent Analogy Guidance: More Speaker Similarity at Equal Accent in Cross-Lingual Voice Cloning
标签:#语音克隆 | #模型融合 | #跨语言 | #0 样本
评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yoomee Cho:机构信息未在 arXiv HTML 中可靠披露
- Jisun Lee:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
跨语言零样本语音合成以源语言参考音频与目标语言文本为输入生成目标语音,难点在于参考口音随音色一同泄漏而形成译制腔。口音类比引导先为每个代理声音合成源语言与目标语言两个版本,以固定说话人并暴露口音差异。接着取模型自身对两种版本预测之差并在多个代理上平均,得到去音色的口音方向。最后在采样中以权重减去该方向,推向同说话人目标口音的反事实参考。相对复用同一参考残差的重加权分类器无关引导,该减项引入正交于说话人与口音同缩放的外部证据,从而沿新路径权衡身份与口音。在held-out韩语到英语配音测试集下,AAG的SIM指标为0.294,高于曲线基准的SIM指标0.02。其适用边界受限于口音前提是否成立,在X-Voice上前提为零时构成失败条件且增益为负,更换代理集合与西班牙语目标等外推尚未验证,额外前向的推理开销随步数累积。每步每代理增加2次前向计算,OmniVoice单句由2.0 s增至3.3 s,方法本身无需训练。
🔗 开源资源
- 演示资源:https://yoomee-cho.github.io/accent-analogy-guidance/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 一个自回归模型同时吃同步与异步线索:用历史预测补缺失画面
标签:#目标说话人提取 | #自回归模型 | #语音 | #音视频 | #大语言模型
评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Wenxuan Wu:机构信息未在 arXiv HTML 中可靠披露
- Shuhan Zhang:机构信息未在 arXiv HTML 中可靠披露
- Shuai Wang:机构信息未在 arXiv HTML 中可靠披露
- Haizhou Li:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
目标语音提取需从双人或多人混合语音中依据线索恢复目标说话人波形,其输入为混合语音与同步或异步线索、输出为目标语音,难点在于同步视觉易缺失损坏而异步线索无法逐帧跟踪。TSE-Omni先由混合编码器与模态专用线索编码器将语音、唇动、手势与文本映射到统一嵌入空间,缺失模态以零张量补齐并完成说话人识别冷启动。该嵌入进入单个自回归大语言模型主干,逐帧预测目标语义令牌并经残差模块融合同步视觉与历史语音令牌,形成自注册上下文。预测的语义令牌序列再经非自回归声码器重建波形,从而完成从识别跟踪到波形生成的完整链路。与每线索独立训练及损坏匹配训练的已有方法不同,该机制在视觉完好时利用同步帧跟踪、在视觉缺失时依靠自身历史延续提取,避免了视觉恢复模块与损坏仿真训练。在VoxCeleb2核心测试集条件下,TSE-Omni视觉线索的指标NISQA为3.24,高于AV-Sepformer的指标NISQA 2.08。该结论限于2 s干净冷启动、短混合与受控仿真损坏,未验证长时漂移与完全无先验的开放退化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://alexwxwu.github.io/tseomni-main/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 以语料为界的负样本与双世界监督重定开放词汇检测基线
英文题目:COSED: Setting the Bar for Open-Vocabulary Sound Event Detection
标签:#音频事件检测 | #多模态学习 | #0 样本 | #基准测试
评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Florian Schmid:机构信息未在 arXiv HTML 中可靠披露
- Sanjeel Parekh:机构信息未在 arXiv HTML 中可靠披露
- Chi Ian Tang:机构信息未在 arXiv HTML 中可靠披露
- Juan Azcarreta:机构信息未在 arXiv HTML 中可靠披露
- Yijun Qian:机构信息未在 arXiv HTML 中可靠披露
- Arnoldas Jasonas:机构信息未在 arXiv HTML 中可靠披露
- Andrew Frederick Francl:机构信息未在 arXiv HTML 中可靠披露
- Çağdaş Bilen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
开放词汇声音事件检测以任意文本查询为输入,需输出音频中对应事件的起止时间,其难点在于帧级图文对齐监督稀缺且查询空间开放。COSED先用音频编码器与文本编码器分别得到帧级音频嵌入与查询嵌入,再经双层双向门控循环单元做时序精炼,随后以可学习的温度与偏置校准余弦相似度得到帧级检测分数,另设仅用于训练的片段级辅助分支消化无时间标注的字幕数据。与以往混用跨语料负样本或只用单一闭集监督的做法不同,该工作按语料来源屏蔽跨库负样本,并联合闭集类别与开放世界字幕训练,使模型按声学事件而非语料域与文体区分正负样本。在RDS零样本基准任务下,COSED的PSDS1为.224,高于MGA-CLAP的PSDS1 .189。在统一的六任务零样本协议下,该系统在五个任务取得最优并在第六个持平,尤其在既往少报的长时家用、混合场景与自由文本任务上优势集中,表明其跨声学域与查询类型的泛化更均衡。该结论限于所选6个评测集与标签空间零样本定义,对更长录音、重叠密集事件及完全未见声学域的外推尚未验证。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 从声音到临床可用:先把测量定义对齐再谈生物标志物
英文题目:Towards clinical adoption of voice and speech as measures of health: the need for harmonization
标签:#病理语音评估 | #评测协议 | #语音生物标志物 | #开源工具
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Nicholas Cummins:机构信息未在 arXiv HTML 中可靠披露
- Vikram Ramanarayanan:机构信息未在 arXiv HTML 中可靠披露
- Daniel Low:机构信息未在 arXiv HTML 中可靠披露
- Fabio Catania:机构信息未在 arXiv HTML 中可靠披露
- Si-Ioi Ng:机构信息未在 arXiv HTML 中可靠披露
- Caterina Botelho:机构信息未在 arXiv HTML 中可靠披露
- Judith Dineley:机构信息未在 arXiv HTML 中可靠披露
- Abir Elbeji:机构信息未在 arXiv HTML 中可靠披露
- Julie M. Liss:机构信息未在 arXiv HTML 中可靠披露
- Paula Andrea Perez-Toro:机构信息未在 arXiv HTML 中可靠披露
- Visar Berisha:机构信息未在 arXiv HTML 中可靠披露
- Thomas Quatieri:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文输入为临床与远程采集的语音录音,输出为可解释的健康相关声学测度与健康常模参照,难点在于采集设备、诱发任务与提取工具的异质性导致结果不可比。方法链分三步推进:先以项目生命周期框定从研究设计、诱发任务选择、采集记录、预处理、测度提取到建模评估的环节并锁定测度定义为调和重点,其输出进入下一步的测度定义。再定义呼吸、发声、构音、频谱与流畅性五类核心声学测度及其任务适配原则,明确持续元音探查发声控制、朗读捕获流畅性与构音,其规范化定义进入常模计算。最后基于众包语料提取常模并以senselab流水线实现单声道与16kHz重采样后的标准化计算。与依赖高维嵌入或黑箱声学特征的研究相比,该工作坚持先建立任务锚定且生理可解释的基线再谈模型,以抑制通道混杂并支撑可比验证。在最大发声与朗读任务语料下,朗读任务的强度指标标准差为26 dB,高于最大发声任务的强度指标标准差20.0 dB。结论仅适用于美式英语健康成人及持续元音与朗读两类任务,向病理人群、其他语言与自发对话外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/sensein/senselab — 链接可访问(HTTP 200)
第三方资源:https://processchallenge.github.io/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 长朗读缺位:用 20 小时单人有声书补上孟加拉语 TTS 的韵律与归一化
英文题目:BanglaKontho: Closing the Long-Form Gap in Bangla Text-to-Speech
标签:#文本到语音 | #数据集构建 | #主观评测 | #低资源
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Mizbaul Haque Maruf:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
孟加拉语语音合成面临的映射难题是输入为含数字、货币、日期与符号的孟加拉语文本,输出为自然连续语音,现有资源多为短促识别用朗读,缺乏长篇叙述韵律。作者构建离线多阶段流水线,先以16 kHz分析副本做语音活动检测与说话人校验得到切分时刻,再经自动识别初转写与双人全量校对得到可信文本,最后经专用归一化器清洗并从原生音频切出24 kHz发行片段。相对已有短句studio语料,关键差异在于坚持单训练叙述者与有声书长句韵律,并把孟加拉式lakh/koti分组与Danda标点显式规则化以降低符号发音错误。在章节隔离的472句测试集上,相同MB-iSTFT-VITS架构的合成语音经IndicWav2Vec评测取得9.5%词错误率,优于对比基线的16.0%,自然度平均意见分达4.46。该结论仅适用于叙述性朗读风格的单说话人建模,未验证对话韵律、多说话人与跨架构迁移。原文未披露训练时长与推理部署成本。
🔗 开源资源
代码相关资源:https://github.com/mizba-grad/BanglaKontho — 链接可访问(HTTP 200)
数据相关资源:https://github.com/mizba-grad/BanglaKontho — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 剪哪一层?语音大模型的编码器与解码器要用不同尺子量
英文题目:Speech Block Influence: Component-Specific Layer Scoring for Pruning Speech LLMs
标签:#语音识别 | #模型剪枝 | #语音 | #语音大模型 | #高效推理
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Siyu Yao:机构信息未在 arXiv HTML 中可靠披露
- Du Q. Huynh:机构信息未在 arXiv HTML 中可靠披露
- Lian Xu:机构信息未在 arXiv HTML 中可靠披露
- Mark Reynolds:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音大语言模型由语音编码器、适配器和解码器大语言模型三部分组成,输入是音频嵌入拼接文本提示的多模态序列,输出为转写或答案文本。难点在于音频表征长度远超文本且适配器对编码器输出做投影与下采样,直接沿用纯文本块影响力会失真。该工作提出语音块影响力,先用语音文本校准集做无训练打分,再按编码器与解码器分别移除最低冗余层,全程不做恢复微调。编码器分支移除候选层后比较适配器输出相似度,解码器分支仅在文本 token 位置比较相邻层输入输出相似度,另构内容对齐的文本纯校准集验证音频上下文是否必要。相比原始块影响力,新机制将评价点后移至真正进入解码器的表征,并剔除数量占优的音频位置对余弦相似度的主导。在Common Voice评测任务下,SBI-Enc的WER为25%,低于BI的WER 40%。该结论仅适用于三款 Whisper-large-v3 初始化编码器加微调解码器模型与无恢复独立剪枝设置,联合剪枝与高压缩后恢复效果尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/CU-0/sbi-speechllm-pruning — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 不用干净语音也能做识别感知的生成增强:转录监督的 RAM 后训练
标签:#语音增强 | #强化学习 | #后训练 | #语音 | #流匹配
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Julius Richter:机构信息未在 arXiv HTML 中可靠披露
- Christoph Boeddeker:机构信息未在 arXiv HTML 中可靠披露
- Yoshiki Masuyama:机构信息未在 arXiv HTML 中可靠披露
- Kohei Saijo:机构信息未在 arXiv HTML 中可靠披露
- Dominik Klement:机构信息未在 arXiv HTML 中可靠披露
- Gordon Wichern:机构信息未在 arXiv HTML 中可靠披露
- Jonathan Le Roux:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
生成式语音增强在真实噪声下常输出听感合理但语言内容失真结果,且标准流匹配依赖干净目标构造中间态,无法直接在无配对真实录音上训练。第一步由当前速度场模型经32步常微分方程采样为每条含噪语音生成16个增强端点,直接提供待评价的干净假设。第二步将端点经Vocos声码器合成24 kHz波形并重采样归一化后交由Parakeet CTC 0.6B转写,经文本归一计算负词错误率奖励并组内归一化为优势值,把转录弱监督转化为可回归权重。第三步对每个端点独立采样4组高斯起点与时间构造重加噪中间态,回归冻结参考速度与优势加权残差之和构成的修正目标以逼近奖励倾斜分布。与 Flow-GRPO 依赖随机轨迹转移似然不同,全程使用确定性采样与解析重加噪回归,免除配对干净目标、离线偏好对与奖励梯度。在 CHiME-4 真实测试集上语料级词准确率从 76.98% 提升至 82.06%,4 项非侵入式质量指标均未下降,跨 Whisper Large 与 QuartzNet 仍有增益,VOiCES 跨域从 79.21% 提升至 80.56%。默认奖励强度 50 下 P.808 比较平均意见分为 -0.034,95% 置信区间为 [-0.122, 0.054],无显著感知偏好。结论限于英语近场朗读类真实噪声与有转录弱监督场景,原文未披露训练时长与推理部署成本。该结论的适用边界受限于上述有转录英语近场场景,过大奖励强度会引起感知劣化这一失败条件,跨语种无转录外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://merl.com/research/highlights/flowse-ram — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 参数小不等于能跑:LiSenNet 在受限 NPU 上的算子与状态协同改造
英文题目:Beyond Model Size: Redesigning LiSenNet for embedded speech enhancement
标签:#语音增强 | #CNN | #模型量化 | #端侧运行
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.5/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Clément Laroche:机构信息未在 arXiv HTML 中可靠披露
- Rasmus Kongsgaard Olsson:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
单通道语音增强需从含噪短时傅里叶变换中恢复目标语音幅度并实时输出,难点在于受限神经网络加速器只支持静态整数量化卷积图,而小参数模型仍依赖循环、动态归一与异形重排。作者先将频域双向循环改写为深度可分离频率混合器,输出的子带特征进入时域建模,从而消除32步频轴展开导致的切片开销与编译停滞。接着将时域循环替换为因果空洞时间卷积网络并保留卷积门控,其有限感受野历史经先进先出缓冲在帧间传递,为流式推理提供可冲刷状态。然后把多维层归一化折叠为批量归一化、限幅激活约束为ReLU6、上采样改为转置卷积,得到全静态图后再做静态整数量化部署。与循环基线相比,该卷积重设计消除了主机回退并用有限感受野状态替代无限循环状态,具有漂移可冲刷与量化误差不累积的机制优势。在VoiceBank-DEMAND测试集条件下,LiSenNet-NPU的PESQ为3.01,高于LiSenNet的PESQ 2.93。该结论目前仅在单数据集、单芯片STM32N6与固定帧移条件下成立,向多语种、非平稳噪声与更长流式时长的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 逐帧早退省算力吗?修直出口梯子后动态路由不再超越静态前沿
标签:#语音增强 | #正则化 | #模型量化 | #端侧运行 | #高效推理
评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.5/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Clément Laroche:机构信息未在 arXiv HTML 中可靠披露
- Riccardo Miccini:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为单通道含噪语音波形,输出为增强后语音,难点在于助听器等端侧设备只能加速静态整数量化图,且需在实时功耗下兼顾质量与多档位部署。方法链分四步:因果 Conv-FSENet 主干加多级掩膜头构成退出阶梯并输出各深度估计;门控循环单元(Gated Recurrent Unit,GRU)单次路由器基于前端特征在任何时域卷积网络(Temporal Convolutional Network,TCN)栈执行前选择深度并只执行对应前缀;深监督加拐点目标联合训练增强与路由;冻结主干后仅微调掩膜头并施加单调性惩罚以抑制深层退化。与已有早期退出相比,差异在于把单调性作为训练期软约束而非推理后校正,并以修复后静态族作为公平基线。在 VoiceBank-DEMAND 测试集上,修复静态前沿相对同算力专用静态最高提升 0.11 个宽带感知语音质量评估(wideband PESQ,PESQ),并以少 30% 算力匹配最优 PESQ;路由点与修复静态前沿差异仅为 +0.009、-0.001 和 +0.007,路由未抬高质量上限。结论仅适用于语音稠密负载,长暂停与强非平稳难度的外推尚未验证。部署成本上,路由器在 Cortex-M55 上每帧约 26 μs,拆分为多神经网络处理器(Neural-ART NPU,NPU)子图增加约 2.2% 延迟开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 编码器也能剪六层:用留一法选层与无标签恢复守住多语识别
英文题目:Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery
标签:#语音识别 | #模型剪枝 | #知识蒸馏 | #多语言 | #高效推理
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Rasmus Aagaard:Technical University of Denmark;Laerdal Medical
- Nicki Skafte Detlefsen:Technical University of Denmark
📌 核心摘要
自动语音识别(Automatic Speech Recognition,ASR)以语音波形为输入、以文本转写为输出,难点在于编码器深层存在冗余但直接删层易破坏声学表示的多语言泛化。该工作针对 whisper-large-v3-turbo 的 32 层编码器,先逐一做留一层消融,在 FLEURS 四语测试集上计算词错误率(Word Error Rate,WER)变化均值并排序,输出低敏感层集合。接着将排序最低的 6 层整体移除得到 26 层浅编码器,该结构直接替换原 ModuleList 而保持解码器与推理接口不变。然后以完整编码器为教师、剪枝编码器为学生,仅用无标注英语语音做均方误差(Mean Squared Error,MSE)隐状态对齐以恢复表示。与已有解码器压缩及需定制实现的编码器压缩不同,该机制差异在于按任务指标选层加无标签声学对齐,且产物为标准 Transformer 浅堆叠。在FLEURS四语测试集评测下,蒸馏后剪枝编码器的WER为20.1%,低于零样本剪枝编码器的WER 21.9%。结论仅在该模型与所测四语范围内验证,删至第 7 层后急剧恶化且低资源语言外推未验证。蒸馏成本为单卡 Nvidia A100 约半小时的 2000 步训练,编码器参数减少 118M,bfloat16 整模型从 1543MB 降至 1318MB。该结论的适用边界尚未验证低资源语言外推,训练成本受限于单卡硬件短时蒸馏。
🔗 开源资源
代码相关资源:https://github.com/rasgaard/whisper-encoder-layer-prune — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/rasgaard/whisper-large-v3-turbo-encoder-pruned — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 一个音符就是一个声源:用双流网络先抓取再联合分账做乐谱对齐的音符分离
标签:#音乐源分离 | #注意力机制 | #音乐 | #数据集 | #时频分析
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Benjamin Shiue-Hal Chou:机构信息未在 arXiv HTML 中可靠披露
- Purvish Jajal:机构信息未在 arXiv HTML 中可靠披露
- Nicholas John Eliopoulos:机构信息未在 arXiv HTML 中可靠披露
- James C. Davis:机构信息未在 arXiv HTML 中可靠披露
- George K. Thiruvathukal:机构信息未在 arXiv HTML 中可靠披露
- Kristen Yeon-Ji Yun:机构信息未在 arXiv HTML 中可靠披露
- Hao-Wen Dong:机构信息未在 arXiv HTML 中可靠披露
- Yung-Hsiang Lu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
乐谱告知音符分离输入为单声道复调混音与对齐的音高加起止时间,输出为每个乐谱音符的演奏波形,难点在于同乐器音色相近、八度与纯五度共享大量谐波,外加非谐性、颤音、混响与宽带起振相互掩蔽。第一步以谐波打击源分离将混合片段拆为谐波与打击两路,并在乐谱指示存在低一至二个八度重叠时才对谐波流做低频门控,打击流始终保留起振细节,两路输出一并送入抽取网络。第二步由两个时频卷积加时频全连接U型网络分别处理两路分量,在深层编码器、瓶颈与浅层解码器处经双向交叉注意力互写特征,并以音高与起止条件调制逐查询独立输出目标波形。第三步将同期全部原始估计与混合频谱及跨音符上下文送入自适应集合归属,经门控与相对增益预测做归一化重分配,还原满足混音一致的最终音符集合。相对梳状滤波与非负矩阵分解类方法,该设计以学习式谐波加打击分解替代固定模板假设,以跨流注意力替代手工八度处理。在SCNS-Eval评测下,NoteSep的中位SI-SDR为7.39 dB,高于Score-Informed NMF的中位SI-SDR 2.49 dB。该结论限于给定准确乐谱与单声道场景,自动转录误差、强混响现场与未见演奏技法下的外推尚未验证。原文披露了A10上2秒16查询的分离加仲裁开销,训练硬件与总时长未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 仿真准、真实差:单通道说话人距离估计为何要按相关性选模型再做仿射校准
英文题目:Few-Shot Calibration for Sim-to-Real Single-Channel Speaker Distance Estimation
标签:#声源定位 | #领域适应 | #少样本 | #单通道 | #语音
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Michael Neri:机构信息未在 arXiv HTML 中可靠披露
- Archontis Politis:机构信息未在 arXiv HTML 中可靠披露
- Tuomas Virtanen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
单通道说话人距离估计以单麦克风录音回归说话人到麦克风的米制距离,难点是真实标注稀缺而仿真房间脉冲响应与真实混响统计失配致零样本迁移误差大。方法分两段:先在仿真数据上训练冻结卷积循环估计器输出未校准距离,再在目标语料用少量标注拟合常数、偏移、尺度、仿射或收缩仿射映射。理论上无限样本最优仿射系数仅依赖均值、标准差与皮尔逊相关,总体风险为标签方差乘以一减相关平方;有限样本下按拟合参数个数惩罚得到是否值得拟合斜率的阈值条件与偏移保留的离散度判据。与需梯度微调的域自适应不同,该校准冻结主干仅做输出端最小二乘重标定,修正常数偏置与尺度失配而不修复排序能力,故主张按线性相关而非绝对误差选仿真检查点。在QMUL-TIMIT干净条件评测下,全栈噪声训练模型经N=10仿射校准的MAE为2.54 m,低于常数预测基线的MAE 3.08 m。其适用边界受限于估计器与真值需中等以上Pearson相关且欠离散,在VoiceHome2与STARSS23上相关接近零且过离散时校准失败无法超越均值预测,更多房间与噪声外推范围尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/michaelneri/audio-distance-estimation — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 通用语料训不出的健康问答:加纳三语青少年健康语音识别的基准、转舵与落地
标签:#语音识别 | #领域适应 | #多语言 | #低资源
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Stephen E. Moore:机构信息未在 arXiv HTML 中可靠披露
- Akwasi Asare:机构信息未在 arXiv HTML 中可靠披露
- Mich-Seth Owusu:机构信息未在 arXiv HTML 中可靠披露
- Paul Azunre:机构信息未在 arXiv HTML 中可靠披露
- Joel Budu:机构信息未在 arXiv HTML 中可靠披露
- Lawrence A. Adu-Gyamfi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理特威语 Twi、达格巴尼语 Dagbani 与埃维语 Ewe 青少年性与生殖健康咨询语音的自动语音识别 ASR 转写任务,输入为社区采集的健康问询音频,输出为本地语言文本,难点是圣经域语料与健康术语分布严重错位且存在委婉表达。先用通用圣经语料与 50 条健康域语料对 5 个系统做零样本基准评测,输出误差分布并锁定最强零样本候选 Gemma 4。再将健康域人工音频锁定为仅评测集,用约 90k 条圣经语料对紧凑模型做域外监督微调以考验泛化,承接基准选型进入适应阶段。最后把生产管线封装为语音应用 KasaHealth 与语义探针 Senti-Check 分别验证可用性与转写保真度,承接适应后模型进入真实场景检验。与直接微调多模态大模型 Gemma 的路线相比,该文转向轻量 Qwen3-ASR-0.6B 的机制差异在于规避显存不可行并保留语言前缀识别能力。在留出式健康音频评测条件下,埃维语上微调后Qwen3-ASR-0.6B的WER为64.8%,低于微调前基线的WER 109.3%。该结论仅适用于短句朗读式健康问询与 T4 级算力条件,未验证自然对话、方言及噪声鲁棒性。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/GhanaNLP/recorder — 链接可访问(HTTP 200)
代码相关资源:https://github.com/GhanaNLP/senti-check — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/ghananlpcommunity/asante-twi-bible-speech-text — 暂时无法访问
数据相关资源:https://huggingface.co/datasets/ghananlpcommunity/ewe-bible-audio-text-tts — 暂时无法访问
数据相关资源:https://huggingface.co/datasets/ghananlpcommunity/dagbani-bible-audio-text-tts — 暂时无法访问
数据相关资源:https://huggingface.co/datasets/ghananlpcommunity/ghana-nlp-health-UNICEF-asr-dagbani — 暂时无法访问
数据相关资源:https://huggingface.co/datasets/ghananlpcommunity/ghana-nlp-health-UNICEF-asr-ewe — 暂时无法访问
数据相关资源:https://huggingface.co/collections/ghananlpcommunity/ghana-adolescent-conversations-datasets — 暂时无法访问
演示资源:https://kasa-health-frontend.onrender.com — 暂时无法访问
第三方资源:https://ai.google.dev/gemma/docs/get_started#gemma-4-family — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 锚定一侧再学另一侧:AV-GRPO 把音视频联合偏好拆成条件单模子问题
标签:#音视频生成 | #强化学习 | #扩散模型 | #音视频 | #后训练
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zhiyu Xu:机构信息未在 arXiv HTML 中可靠披露
- Weilong Yan:机构信息未在 arXiv HTML 中可靠披露
- Yufei Shi:机构信息未在 arXiv HTML 中可靠披露
- Shiyang Li:机构信息未在 arXiv HTML 中可靠披露
- Yihao Liu:机构信息未在 arXiv HTML 中可靠披露
- Kin-Man Lam:机构信息未在 arXiv HTML 中可靠披露
- Yuewen Cao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
联合音视频生成(Joint Audio-Video Generation)需从文本提示同时输出时间对齐的视频流与音频流,难点在于单模态质量、文本对齐与跨模态同步三类异构奖励互相牵制,且同步难度随对端采样样本变化而不公平。该工作提出AV-GRPO:在音频锚定视频优化与视频锚定音频优化之间交替,先用双塔完整采样一条锚定轨迹并锁定其全部中间交叉状态,再以该锚定为条件独立采样目标模态的8条候选轨迹,将组内奖励解耦为目标模态质量对齐加同步项并只更新目标塔,同时按模态定制噪声强度、KL系数与损失加权。与联合采样同时更新双塔相比,组内同步比较共享同一对端,优势信号只归因于可变模态。在JavisBench上全量微调将音频质量(Audio Quality,简称AQ)从5.097提升至5.798,DeSync从0.757降至0.607,全面超越LTX-2.3与GDPO。该结论限于22B LTX-2.3基座、15步采样与所用VideoAlign、CLIP、Audiobox Aesthetics、CLAP、DeSync奖励组合,换基座或换评测器外推尚未验证。原文披露单节点8卡NVIDIA A800 80GB训练与544×960分辨率97帧24FPS推理配置,但未披露完整训练时长与推理延迟成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 不在合成器流形上的声音怎么倒推参数:联合分布流匹配的训练与推理安排
英文题目:Off-manifold robustness in synthesizer inversion with joint distribution flow matching
标签:#音频理解 | #流匹配 | #鲁棒性 | #多模态学习
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ben Hayes:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
合成器反演需从目标音频估计合成器参数,难点在于正向映射非单射且训练只能用合成器自渲染的在流形配对音频,而部署时用户给出的是无参数标注的离流形真实录音。作者先为音频与参数分配独立噪声时刻并在时间方形上联合建模,使内部拟合联合分布、顶边与右边拟合条件分布、底边拟合边缘分布。接着以配对合成数据约束联合与条件速度场,其学到的联合表示进入下一步作为共享速度场基础。再将无标注真实录音仅送入参数时刻为零的音频边缘分支训练音频边缘,使模型见过离流形信号而不需参数标签。推理时沿顶部条件边固定参考音频积分实现反演,并对参考音频加部分噪声得到平滑后验以抑制不可复现的录音细节,该联合自注意力机制区别于编码器条件基线的瓶颈式条件路径。在Surge XT真实音频评测下,联合模型JDF的MSS指标为7.68,低于编码器条件基线的MSS指标15.50。其结论适用边界受限于两款合成器与重合成距离指标,离流形最优投影多解且人听效果尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
演示资源:https://benhayes.net/synth-jdf/ — 链接可访问(HTTP 200)
第三方资源:https://surge-synthesizer.github.io/ — 链接可访问(HTTP 200)
第三方资源:https://asb2m10.github.io/dexed/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 百万小时立体声语料如何凑齐:YODAS v3 的均衡爬取与保真验证
英文题目:YODAS v3: Over 1 Million Hours of High-Bandwidth, Stereophonic, Multilingual Speech
标签:#语音识别 | #数据集构建 | #多语言 | #数据集
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.3/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- William Chen:机构信息未在 arXiv HTML 中可靠披露
- Shinnosuke Takamichi:机构信息未在 arXiv HTML 中可靠披露
- Sayaka Shiota:机构信息未在 arXiv HTML 中可靠披露
- Satoru Fukayama:机构信息未在 arXiv HTML 中可靠披露
- Samuele Cornell:机构信息未在 arXiv HTML 中可靠披露
- Shinji Watanabe:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作面向开放语音建模缺乏大规模高保真多通道数据的难题,输入为YouTube创意共享许可视频,输出为带语言标签、utterance级时间戳转写、英语翻译与视频描述的48kHz立体声音频语料YODAS v3。方法链分四步:先按语言独立构建维基关键词并用单语unigram子词似然筛选以发起均衡检索,再限定许可并偏置近期上传、去重YODAS v2已有标识,随后以最高质量下载多通道OPUS音频与人工或自动字幕,最后用全量分段短时傅里叶变换峰值法与通道残差法审计有效带宽与有效声道。相对以往共享跨语言关键词与降采样至单声道的做法,关键差异在于语言特定检索与原始格式保留,实际意义是提升中低资源语言覆盖与空间音频可用性,语料达147种语言共1.1M小时且英语占比不足2%。在CommonVoice评测任务下,无过滤阈值模型的德语WER为14.4%,低于0.30过滤阈值模型的德语WER 16.3%。该结果与67.3%数据有效带宽为44.1kHz、92.5%高于32kHz及71%约780K小时为真实多通道的审计结论相互印证,说明高带宽立体声保留并未牺牲转写可用性。其适用边界在于弱监督预训练、高带宽编解码与立体声任务受限,不保证转写精确对齐、语言标签无噪及音乐噪声场景直接可用,仍存在失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/espnet/yodas3 — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 同样的低空航线,为何在不同城市激起完全不同的噪声增量
英文题目:Low-altitude aircraft will reshape noise exposure across global cities
标签:#音频质量评估 | #信号处理 | #环境声 | #空间音频信号
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Tianjing Feng:机构信息未在 arXiv HTML 中可靠披露
- Jian Kang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是以城市户外声暴露为输出,输入为低空飞行器声源、既有道路噪声基线与三维城市形态,难点在于空中声源从顶部入射,与地面交通遮挡逻辑相反且跨城市不可比。方法链分四步:先按人口与国内生产总值筛选并构建十个2 km×2 km中心城区三维模型,再重构无人机与电动垂直起降飞行器倍频带源强与昼夜流量,接着用道路与航空标准分别计算道路基线、低空单独与叠加声场,最后对比昼夜等效声级增量、新暴露面积与立面分布。与既有机场噪声和道路噪声制图相比,关键差异是同时引入空中走廊流量、基线依赖的增量指标与高度相关遮挡,使安静庭院等遮蔽空间的脆弱性显形。在eVTOL Q150场景下,Santiago的新暴露面积指标为3.78%,高于London的新暴露面积指标2.11%。该对比说明相同运行在不同基线与形态下产生显著不均,低基线半封闭空间增量可超过20 dB(A),形成新的暴露分化。垂直维度上暴露随高度与航线声可见性变化,导致同高度不同楼层与立面间的不平等,单高度评估尚未验证这种三维差异。结论适用边界仅限100 m平飞、固定气象与标准化交通的仿真比较,不覆盖起降悬停、指向性与真实运营需求,原文未披露训练、推理或部署成本。
🔗 开源资源
数据相关资源:https://population.un.org/wup/downloads?tab=Cities — 链接可访问(HTTP 200)
第三方资源:https://freesvg.org/world-map-2 — 链接可访问(HTTP 200)
第三方资源:https://www.faa.gov/uas/advanced_operations/nepa_and_drones/FINAL_Appendix_E_Technical_Noise_Report.pdf — 链接可访问(HTTP 200)
第三方资源:https://www.who.int/publications/i/item/9789289053563 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
31. 不定长并行生成:用插入删除改长度的零样本语音合成与编辑
英文题目:EditVoice: Variable-Length Non-Autoregressive Zero-Shot TTS and Speech Editing with Edit Flows
标签:#文本到语音 | #流匹配 | #语音编辑 | #0 样本 | #语音
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hongyao Deng:机构信息未在 arXiv HTML 中可靠披露
- Wenhao Guan:机构信息未在 arXiv HTML 中可靠披露
- Xuetao Lin:机构信息未在 arXiv HTML 中可靠披露
- Peijie Chen:机构信息未在 arXiv HTML 中可靠披露
- Weijie Wu:机构信息未在 arXiv HTML 中可靠披露
- Lin Li:机构信息未在 arXiv HTML 中可靠披露
- Qingyang Hong:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
零样本语音合成需由目标文本和短时音色提示生成自然语音,非自回归并行解码虽快却须预先固定目标长度,难以灵活增删时长与迭代修正。EditVoice在可变长离散空间上建模连续时间马尔可夫链的编辑流,通过插入率、删除率、替换率与词元分布联合更新内容与长度。训练采用随机片段语音补全,将初始跨度与目标跨度经含空白符的辅助对齐配对后做条件流匹配,使前缀与后缀两种提示放置在推理时均可用。推理时零样本合成在目标区初始化固定长度随机词元并仅允许该区编辑,级联编辑经文本差异与强制对齐定位改动区并冻结外部,互补提示采样对同一状态评估两种放置并按操作率择优取样,冲突后以局部提示一致性抑制频繁切换伪影,生成后继续固定终止时间的编辑流采样做训练无关精修,最后经冻结声学解码器输出波形。在Seed-TTS Eval EN评测下,EditVoice的WER为1.48,低于CosyVoice 2的WER 2.58。该结论限于英语短句朗读与 RealEdit 局部编辑,对长文本韵律、多语种及强噪声提示尚未验证。原文未披露训练硬件与时长,仅给出文本到语义词元的相对实时率。
🔗 开源资源
- 演示资源:https://dhy02.github.io/editvoice-demo/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
32. 玻璃盒合成:把共振峰做成可拧的旋钮,而不是学出来的映射
英文题目:ARIS: Low-Resource Glass-Box Neural Source-Filter Synthesis for Phonetic Stimulus Manipulation
标签:#语音编辑 | #信号处理 | #低资源 | #语音学与音系 | #语音
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yiran Ding:机构信息未在 arXiv HTML 中可靠披露
- Wenwei Xu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音学刺激研究需输入单说话人少量录音并输出仅单线索被精确改写的可验证语音,实际难点是在欠一小时数据下同时保证自然度、以赫兹等物理单位可控以及跨语料可复现。ARIS先由RMVPE估计基频与清浊音并由六层Conformer编码器从多分辨率频谱观测映射到声门与声道参数,该参数输出直接进入下一步;接着确定性数字信号处理解码器用LF波表产生声门激励并经显式F1-F3谐振器级联残差极点与门控零点滤波合成波形;最后用户按物理单位全局或局域改写合成器系数后重合成。与WORLD谱包络表示和需学习控制到信号映射的神经声码器不同,ARIS把每个可编辑量绑定为滤波器系数,从机制上隔离线索串扰并减少域外映射失效。在CSMSC语料评测任务下,ARIS的MUSHRA分数为87.5,高于WORLD的MUSHRA分数73.3。该结论适用边界受限于以普通话句和孤立音节为主的验证范围,男性低基频、复杂辅音丛及超范围共振峰上移仍为失败条件,多说话人外推尚未验证。整个模型的训练成本为单块消费级硬件上约2小时完成50k步训练,推理为确定性滤波因而部署负担较低。
🔗 开源资源
- 演示资源:https://n1r.github.io/ARIS_nsf/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
33. 把方言、语码转换和伪造配对放在同一语料里:VietPrism 如何控制词汇与身份混淆
标签:#音频深度伪造检测 | #数据集构建 | #数据集 | #多语言
评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Minh Hoang:机构信息未在 arXiv HTML 中可靠披露
- Thai Le:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
越南语研究长期面临同一资源无法同时支撑语音识别、说话人验证、方言与代码切换建模及伪造检测的问题,自然混合与一致身份缺失使跨任务对齐困难。VietPrism 构建四阶段离线管线:先以人工种子加双语查询发现视频并做单频道三小时限流与疑似AI视频剔除,再经重采样、归一化与降噪后由Gemini 2.5 Pro初转写切分日志并与Montreal Forced Aligner融合、分歧超2秒人工校正,接着以Qwen3-Omni-30B-A3B过滤多说话人与歌唱片段并人工跨视频聚类身份,最后以9至9.5秒验证参考驱动OmniVoice、Higgs Audio v3、VoxCPM2与MiniMax合成同一说话人同一转写文本并做扰动。与既有识别库缺身份、说话人库缺转写、混合库小而窄的设计不同,该机制以同一文本与同一身份约束真伪对子,分离词汇与身份混杂,并保留47.1%时长约472.7小时的自然越英切换。在993.4小时403941条真实语音与相似度过滤前3190小时1290883条伪造语音的零样本评测中,最均衡的DFA-1B在三种合成器上等错误率为10.95%至13.14%,在VoxCPM2上恶化至34.33%,并随说话人相似度升高从16.3%升至33.6%。该结论仅适用于所含四种合成器与采集域内的越南语评测,向其他语言、新型克隆模型与强噪声部署的外推尚未验证。原文未披露训练与推理成本,未提供可核验的数据仓库与许可链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
34. 逐词元绕行:把转写不确定性留在对齐图里而不是压进标签里
标签:#语音识别 | #弱监督学习 | #CTC | #语音 | #多语言
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Saurabh Kumar:机构信息未在 arXiv HTML 中可靠披露
- Diptiman Mohanta:机构信息未在 arXiv HTML 中可靠披露
- Prasanta Kumar Ghosh:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动语音识别(Automatic Speech Recognition,ASR)以声学帧序列为输入并输出字符或子词序列,其难点在于逐字转录并非唯一真值,鼻化标记与拼写变体等局部歧义仍被联接时序分类(Connectionist Temporal Classification,CTC)强制监督。该工作先将全时域分类(Omni-temporal Classification,OTC)的通配符旁路弧细化到每个 Token 并保留词级旁路构成混合图,使单 Token 偏离可被低代价跳过而词内其余位置继续受监督,再以留出集预测熵度量训练进程并几何插值松弛旁路与自环权重以替代按轮次衰减。相对已有词级通配符整词丢弃监督的做法,逐 Token 代价随跳过长度增长并与整词逃逸互补,因而更匹配稀疏局部噪声。与基线相比,混合熵调度模型(OTC-TWH)在 3 个语料共 25 个任务上相对 CTC 平均降低词错率 9.45%。该结论限于无外部语言模型的前缀搜索解码与固定编码器配置,尚未验证多参考评分或学习式权重下的外推效果。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/saurabhk0317/wsasr_icassp27.git → https://github.com/saurabhk0317/wsasr_icassp27 — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
35. 不等长频带不好并行:把选频加窗折进一路打包傅里叶的可逆恒 Q 变换
英文题目:Exact Factorisation and Fast Computation of Invertible Constant-Q Transforms
标签:#音乐理解 | #时频分析 | #高效推理 | #形式化分析
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Facundo Franchino:机构信息未在 arXiv HTML 中可靠披露
- Eloi Moliner:机构信息未在 arXiv HTML 中可靠披露
- Vesa Välimäki:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
可逆恒 Q 变换需将实波形映射为对数频率轴上各频带变长时域系数并能精确重建,难点在于频带系数长度参差、GPU上多核启动与中间频谱搬运开销大,零填充到统一长度又浪费算力与存储。 该方法第一步将相邻实采样打包为一半长度复序列并执行一次打包傅里叶变换,得到保留全部信息的打包频谱。 第二步用预计算路由表从两个打包频点恢复所需傅里叶频点并完成加窗与选位,路由按无序频点对分组为独立块,其输出直接作为同内核中各频带变长逆变换的输入,避免中间频谱落盘。 第三步在合成方向先对各频带做正变换再经对偶路由在打包域累加贡献,最后只用一次打包逆变换解包恢复波形,反向传播则复用同类路由与傅里叶阶段的实伴随,无需保存激活。 与分步选带加窗的非平稳Gabor实现相比,该精确因子分解把恢复、加窗、排序融合为固定映射并保持各频带原生长度,减少核启动与临时搬运。 与相同算子的 PyTorch 基线相比,在 A100 上 CUDA 图回放往返耗时加速达 5.2 倍且重建信噪比(signal-to-noise ratio,SNR)为 129.8 dB。 其结论适用边界受限于N=65536专用切片配置与三层基三十二结构,长于切片需50%交叠切片与Tukey过渡窗拼接,短信号需删低频带或降Q值,其他听觉滤波器组的扇出与性能尚未验证。 原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/cucuwritescode/Flash-CQT — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
36. 从固定窗口到按窗决策:AdaptDuplex 如何把每次听与说都写成显式词元
英文题目:AdaptDuplex: from static to adaptive full-duplex spoken dialogue
标签:#全双工语音交互 | #课程学习 | #流式处理 | #实时处理 | #语音
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Zhiyang Zhou:机构信息未在 arXiv HTML 中可靠披露
- Yingxin Shang:机构信息未在 arXiv HTML 中可靠披露
- Zhou Wang:机构信息未在 arXiv HTML 中可靠披露
- Hongwei Cai:机构信息未在 arXiv HTML 中可靠披露
- Weixu Wang:机构信息未在 arXiv HTML 中可靠披露
- Shuran Zhou:机构信息未在 arXiv HTML 中可靠披露
- Shuofeng Zhao:机构信息未在 arXiv HTML 中可靠披露
- Wenke Fan:机构信息未在 arXiv HTML 中可靠披露
- Qingxiang Guo:机构信息未在 arXiv HTML 中可靠披露
- Dawei Yang:机构信息未在 arXiv HTML 中可靠披露
- Lin Yang:机构信息未在 arXiv HTML 中可靠披露
- Yang Song:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音交互要求模型在持续监听用户音频的同时生成语音,并在打断、附和、背景干扰下做出亚秒级轮次决策。AdaptDuplex以Qwen3-Omni-30B-A3B-Instruct为基座,将Thinker从按轮生成完整回复改为按窗口持续做交互决策,Talker则改为轮内先入先出队列条件下的声学合成。核心设计围绕显式决策令牌展开:紧凑规范序列统一听说控制、动作、文本与下一窗口预测,有界文本超前解决双流速率错位,动态窗口在0.48 s、0.64 s、0.96 s三档中选择时间粒度,分级动作在直接响应之外允许记忆巩固与最多4路外部推理非阻塞共存。训练按双工难度分三阶段课程化Thinker,再做Talker冻结训练、联合微调与GRPO增量优化。在HumDial-FDBench基准下,AdaptDuplex的Final得分为72.9,高于DuplexOmni的Final得分57.3。结论目前仅在中英文合成与脚本化实录上验证,连续窗口、多方对话与视觉输入尚未覆盖,延迟对比未做硬件对齐,训练与部署成本未披露。该结论的适用边界受限于中英文合成与脚本化实录,连续窗口与视觉多方外推尚未验证,训练使用8张NVIDIA H100 GPU,跨硬件的延迟对比仍受限。
🔗 开源资源
- 复现相关资源:https://adaptduplex.github.io/appendix → https://adaptduplex.github.io/appendix/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
37. 深层只看低频带:TF-Refiner 用可配置带宽兼顾多采样率与计算量
标签:#语音增强 | #时频分析 | #语音 | #高效推理
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ui-Hyeop Shin:机构信息未在 arXiv HTML 中可靠披露
- Wooseok Kim:机构信息未在 arXiv HTML 中可靠披露
- Hyung-Min Park:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音增强(Speech Enhancement,SE)需同时服务 16 kHz 电话语音与 48 kHz 全频带音频,输入为含噪短时傅里叶变换(Short-Time Fourier Transform,STFT)谱,输出为增强波形,难点是时频双路径模型代价随频点数增长且多采样率需重复建模。TF-Refiner 先以采样率无关 STFT 与输入编码器得到统一频栅并按可配置截止频率切分为低频分析带与高频互补带,深层 TF-Encoder 只建模低频带得到编码特征。接着 Band Merge 由互补带构造输入相关查询并与编码特征拼接,浅层 TF-Decoder 经高频交叉注意力与全频带自注意力提炼全带表示。最后 Filter Head 预测局部复数滤波器作用于原始含噪 STFT。与固定感知频带或固定子带划分不同,该设计把计算量决定权从采样率转移到物理频率截止点,且无参数依赖总频点数。在VoiceBank+DEMAND测试集评测设置下,通用模型的PESQ为3.46,高于16k专用模型的PESQ 3.35。作者承认两路训练洁净语音均源自 VCTK 而不构成完全不交语料,且未在未见语料库与真实流式时延上验证。在未见语料库与真实流式时延上的泛化能力尚未验证,适用边界受限于当前混合训练条件。默认 5 kHz 截止时 16 kHz 到 48 kHz 计算量由 2.17G 增至 4.35G,约增长 2.0 倍,低于频点数 3 倍增长。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
38. 听到与读到是同一个方向吗:音频语言模型中区别性特征的跨流几何检验
英文题目:Do Audio Language Models Hear and Read Distinctive Features Alike?
标签:#语音属性识别 | #统计分析 | #语音学与音系 | #多语言
评分:7.0/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.3/1.5 | 清晰度 1/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yuanhao Chen:机构信息未在 arXiv HTML 中可靠披露
- Peter Chin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文检验音频语言模型共用解码器在听到音素与读到国际音标文本时是否以相同方向表征同一音系区别特征,难点在于双流天然共享音段身份使任意音素对已有一致性,与零比较会虚增对齐,且跨语言音位库差异阻碍单语言方向泛化。方法链分三步衔接:先按话语组切分语言文献参考语料并用时长换算定位音频帧区间、按字符重叠定位文本词元区间,对冻结解码器同层隐状态按音素类型取均值,输出可比的音素表征进入下一步。接着对仅差一个二值特征的最小对立体做有标记减无标记求差向量并归一化平均,得到音频与文本各自特征方向后计算二者余弦。最后以等量随机配对重复B=2000次构建参考分布并取跨语言中位数选层做Benjamini-Hochberg校正,同时以跨特征最大值为对照,这相对ALAS只测时序绑定与相对零比较的关键差异在于剥离音段身份带来的基线一致性,可避免把通用绑定误读为特征共享。在15种语言11个语系的跨语言评测设置下,Qwen2.5-Omni 7B浊音的余弦相似度为+0.40,高于随机配对参考的余弦相似度+0.34。跨语言一致性更广:三个模型在音频端共享一个浊音方向,两Omni模型91个语言对全部一致,而家族而非尺寸预测哪一流更好表征特征,文本端长音一致更可能来自书面长度符号:而非音系知识。该结论适用边界受限于仅浊音在两Omni模型显著成立且同层比较未搜索跨层编码,旋转复制空间与邻音分布混杂等失败条件尚未验证。原文未披露训练与推理成本,未提供代码链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
39. 缺失下不重建像素而补语义:SemMSA 的隐式精炼与无锚谱对齐
英文题目:SemMSA: Latent Semantic-Aided Robust Multimodal Sentiment Analysis with Incomplete Data
标签:#语音情感识别 | #多模态学习 | #大语言模型 | #鲁棒性 | #音视频
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Wenhao Li:Software School, Shandong University;Shenzhen Loop Area Institute
- Zhibin Wu:Software School, Shandong University
- Chong Xiao:Software School, Shandong University
- Qiangchang Wang:Software School, Shandong University
📌 核心摘要
多模态情感分析(Multimodal Sentiment Analysis,MSA)需从语言、视觉和声学输入预测连续情感分值,实际难点在于帧内随机缺失造成证据碎片化与跨模态不一致。所提 SemMSA 先以轻量适配器将不完整视听序列压缩为前缀并与语言拼接输入冻结大语言模型(Large Language Model,LLM),再迭代追加末位隐状态生成连续潜在语义并池化为语义表示,随后对语义与三模态表示构建径向基核 Gram 矩阵并增强其主特征值以实现无锚点联合对齐,同时以主方向分离损失维持样本间可分性,最后加和融合回归情感分值。相比重构低层特征与依赖主模态锚点的融合范式,该机制直接补偿高层情感语义并建模全局非线性共识,避免了幻觉重构与锚点失效。在 MOSEI 缺失率 0.0 至 0.9 平均评测下达到 Acc-2 79.61 与 F1 80.62,显著优于对比基线;在完整模态下 MOSI 达到 Acc-2 88.70 与 Acc-7 50.97,MOSEI 达到 Acc-2 88.88 与 Acc-7 55.90。该结论限于 MOSI、MOSEI 与 SIMS 的短视频观点场景,未验证对话情感、讽刺检测或长时交互的外推能力。原文报告了任务 GFLOPs 与延迟对比,但未披露训练时长与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
40. 小模型直转国际音标:中间监督与双视图一致性如何压低字符错
标签:#语音识别 | #CTC | #多语言 | #语音 | #数据增强
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Nikhil Navas:机构信息未在 arXiv HTML 中可靠披露
- Sergio Chevtchenko:机构信息未在 arXiv HTML 中可靠披露
- Talisson Damiao:机构信息未在 arXiv HTML 中可靠披露
- Saeed Afshar:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
多语言国际音标转写要求从16 kHz语音直接输出跨语言共享的音素字符序列,难点在于语言不平衡、音素集庞大且小模型易过拟合增强扰动。BranchShine-CR先由80维对数梅尔前端经卷积下采样得到256维帧表示,再送入12层旋转位置编码E-Branchformer编码器建模全局与局部上下文。编码器在第6、10层经共享CTC投影产生中间后验并回注调制后续层表达,最终层输出112符号词汇logits。训练时同一变速波形的两个独立掩码视图分别计算主加辅助CTC损失,并以双向截断梯度对称散度约束最终后验一致。相比已有方法,该组合把中间监督、反馈条件与视图一致统一进从零训练的小模型,而非依赖大规模预训练编码器。在IPApack++共享测试集条件下,BranchShine-CR的IPA-CER为4.47%,低于ZIPA-CTC-NS的IPA-CER 5.76%。结论限于该划分与贪婪解码条件,跨语料泛化与预训练大模型公平对比尚未验证。训练在单卡RTX PRO 5000上耗时4.7天完成350000步,推理为单视图贪婪解码且无语言模型。该训练成本对应单卡RTX PRO 5000硬件上4.7天完成350000步的开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
41. 不重训水印器,只换掉时间坍缩:冻结音频水印的鲁棒性与双负载复用
英文题目:No Time to Collapse: Unlocking Robustness and Multiplexed Capacity in Frozen Audio Watermarkers
标签:#音频水印 | #Conformer | #鲁棒性 | #评测协议
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xuanye Wang:机构信息未在 arXiv HTML 中可靠披露
- Linxi Li:机构信息未在 arXiv HTML 中可靠披露
- Yechen Wang:机构信息未在 arXiv HTML 中可靠披露
- Liwei Jin:机构信息未在 arXiv HTML 中可靠披露
- Qianwei Guo:机构信息未在 arXiv HTML 中可靠披露
- Carsten Maple:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频水印需从受攻击波形中恢复不可感知的多比特负载,难点是攻击后时域证据残缺不均而固定平均或投票会盲目坍缩时间维并丢失定位与可靠性差异。冻结编码器与检测器后先由编码器嵌入单消息或交替双负载并经攻击链退化,再由冻结检测器对受损波形输出时域软结果。系统专用适配器将该软输出池化为窗口级有序序列并附加网格标志,序列进入轻量解码器经两层窗口编码与四层Conformer建模上下文后由注意力池化加权汇聚。相对固定坍缩,该机制按上下文估计窗口可靠性并保留时隙归属,因而无需重训嵌入端即可同时改善鲁棒性与可分离复用容量。在全覆盖单攻击复用评测条件下,Conformer解码器的联合精确恢复准确率为77.1,高于网格感知基线的联合精确恢复准确率67.4。其适用边界受限于已知对齐网格与排除时序扭曲的评测协议,AudioSeal第二负载在冻结检测器已丢失时复用绝对精度仍低是失败条件之一。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
42. 把意图写进时间轴:用关系事件合成可学习的双工轮替监督
英文题目:A Harness for Synthesizing Diverse Naturalistic Full-Duplex Conversations
标签:#全双工语音交互 | #数据集构建 | #语音 | #多语言 | #大语言模型
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Matthew Sun:机构信息未在 arXiv HTML 中可靠披露
- Vinay Kothapally:机构信息未在 arXiv HTML 中可靠披露
- Meng Yu:机构信息未在 arXiv HTML 中可靠披露
- Chao Huang:机构信息未在 arXiv HTML 中可靠披露
- Hao Zhang:机构信息未在 arXiv HTML 中可靠披露
- Yixuan Zhang:机构信息未在 arXiv HTML 中可靠披露
- Steve Yves:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工对话系统以双通道连续音频为输入,需输出系统端抢占、保持、释放与聆听的帧级话轮动作,难点在于轮内停顿与让出话轮的静音相似,抢话、失败打断与反馈音的重叠声学相似但意图相反。该管线先由大语言模型撰写关系事件列表,只定说话人、文本、对话行为与相对锚点而不预测绝对时间戳。接着对事件独立语音合成并强制对齐测得词级边界,得到语内定位点作为后续组装的 cue 点。最后在共享双通道时钟上按依赖顺序解析放置并采样话轮间隔静音,由撰写意图导出帧级标签供训练。相对已有混音与文本合成,其差异在于语内位置实测而语间静音受控采样,且标签源自意图而非语音活动,使相同波形重叠可标为不同动作。在Moshi自由生成评测任务下,微调后模型的Floor precision为0.88,高于微调前基线的Floor precision 0.46。该结论限于英语与普通话的合成音色与受控噪声,外推至真实打断风格与多方噪声仍未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
43. 更广并不更强:冻结编码器多语覆盖与预训练目标的受控分解
标签:#音频深度伪造检测 | #评测协议 | #语音 | #多语言 | #统计分析
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Benjamin Hurt:机构信息未在 arXiv HTML 中可靠披露
- Oscar O’Donnell:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为待判真伪的语音波形,输出为真实与伪造的二分类判决,难点在于训练攻击与部署中未知攻击之间的分布偏移,冻结表征一旦丢失伪造线索即无法在后端挽回。该工作固定冻结自监督编码器(frozen SSL encoder)与轻量后端,以平均最后4层变换器(transformer)表征接60维常量Q倒谱系数(constant-Q cepstral coefficients,CQCC)的跨注意力融合,再经多头因子注意力池化(multi-head factorized attentive pooling,MHFA)或图注意力(anti-spoofing with graph attention,AASIST)后端完成分类,仅训练投影与后端以隔离编码器效应。与以往同时改变容量与语种的做法不同,该研究设置匹配约315M参数的覆盖度轴与匹配Libri-Light-60k数据的目标函数轴,并以配对自助法检验远域差异。在In-the-Wild上128种语言的XLS-R以18.30%等错误率(equal error rate,EER)显著优于1406种语言MMS的22.71%,同数据下掩码预测的HuBERT也大幅优于对比学习的wav2vec2。结论仅适用于ASVspoof 2019 LA训练与固定融合配方的冻结范式,近域排序随后端反转且ASVspoof 5等错误率种子方差极大。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
44. 先找全证据再算时间:TEMA 在多轮多音频对话里做可核对的时间问答
英文题目:TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs
标签:#音频问答 | #强化学习 | #数据集 | #基准测试
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Kaidi Yang:机构信息未在 arXiv HTML 中可靠披露
- Hualei Wang:机构信息未在 arXiv HTML 中可靠披露
- Zhaohui Wang:机构信息未在 arXiv HTML 中可靠披露
- Chenxuan Wang:机构信息未在 arXiv HTML 中可靠披露
- Hong Liu:机构信息未在 arXiv HTML 中可靠披露
- Xiangdong Wang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
多轮多音频时间问答的输入是按序可见录音、模型生成的对话历史与当前问题,输出是事件时刻、时长、计数与跨录音比较的答案,难点在于目标录音范围随追问与增量上传切换,且漏检一个实例就会算错总量。所提框架TEMA每轮依次生成路由、跨度、推理与答案四段,其中路由负责从问题与历史推断需检查的录音集合并标记无事件录音的缺席状态。跨度承接路由确定的录音范围,为每段录音输出全量条件音频描述即全部相关实例的起止区间,再由推理承接该事件表做实例选择与时长累加、排序比较等时间运算后生成答案。与直接生成时间引用或只奖励单区间对齐的前人方法不同,该工作以完备性优先的Span-only奖励直接对照事件表校验范围、数量与边界,使证据可验证。基于Qwen2.5-Omni的模型在TEMA-Bench自然多轮评测中问答准确率达到69.81%,显著高于原始基线与专有大模型对照。其适用边界是依赖强事件标注的合成对话场景,对真实长录音噪声、口语化追问与跨轮证据一致性的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/KadeeYoung/TEMA — 链接不可用(HTTP 404)
模型相关资源:https://github.com/KadeeYoung/TEMA — 链接不可用(HTTP 404)
数据相关资源:https://github.com/KadeeYoung/TEMA — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
45. 基准分好看、个人用不好:韩语唇读在 OLKAVS 上拆开 wording、说话人与仰角
标签:#静默语音接口 | #LoRA | #迁移学习 | #跨语言
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Se Un Park:机构信息未在 arXiv HTML 中可靠披露
- Hakjun Kim:机构信息未在 arXiv HTML 中可靠披露
- Taehoon Roh:机构信息未在 arXiv HTML 中可靠披露
- Junyoung Park:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该任务输入为25 fps唇部灰度视频,输出为韩语文本,难点在于外貌差异大、脚本记忆污染评分、手持仰角多变与自发口语难读。方法链分三步:先用英语预训练视觉前端加Conformer编码器抽取视觉特征,并经联结时序分类与注意力解码器联合解码成音素字母Jamo序列。接着用全量全视角训练建立多视角基线,并按人普查分离措辞记忆与语体效应,其输出的高误差者名单与留出评估集直接进入下一步。然后仅用正面小样本低秩适配对编码器做个人化,得到每用户可分离的低秩文件并迁移到各视角。与冻结前端基线相比,关键机制差异是用全参数英语初始化加全视角训练替代冻结前端,并把增量压缩为编码器侧低秩文件,其适用边界仍受限于棚拍语料。在OLKAVS验证集相机A官方协议下,M9模型的字符错误率Character Error Rate / CER为9.95%,低于已发表V模型的字符错误率Character Error Rate / CER 26.64%。结论仅适用于棚拍有声韩语,默读、无声唇语与真实噪声场景未经验证。训练成本为单卡 140 GPU 小时,适配为 200 步与每用户 44 MB 文件。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
46. 把水印当噪声抹掉:高斯噪声串联语音增强为何能瓦解神经音频水印
英文题目:The Vulnerability of Neural Audio Watermarks under Speech Enhancement
标签:#音频水印 | #评测协议 | #语音增强 | #对抗鲁棒性
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xincong Zhong:机构信息未在 arXiv HTML 中可靠披露
- Shengyao Wang:机构信息未在 arXiv HTML 中可靠披露
- Lingfeng Yao:机构信息未在 arXiv HTML 中可靠披露
- Yihang Bao:机构信息未在 arXiv HTML 中可靠披露
- Jinze Yu:机构信息未在 arXiv HTML 中可靠披露
- Miao Pan:机构信息未在 arXiv HTML 中可靠披露
- Jiang Liu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
神经音频水印需在生成语音中嵌入不可感知签名并在压缩重采样等失真下仍可检测,而语音增强以去噪重构为目标天然将水印视为待去除噪声,黑盒单样本条件下同时实现去水印与保音质尤为困难。本文攻击链先向单条含水印语音注入目标信噪比的高斯噪声以迫使增强器脱离恒等映射进入重生状态,再调用预训练语音增强模型去噪并依据干净语音先验重建谐波与共振峰结构,最后输出去水印语音以同时压低检出率并挽回听感质量。与编解码器重合成仅做波形往返不同,该链条利用生成式先验主动重绘水印寄生的高能量谐波区,因而对集中于谐波区的残差更具破坏性且具有实际威胁意义。在200条LibriSpeech语料构成的评测条件下,10dB高斯噪声级联UniSE的指标TPR@1%FPR为1.2,低于EnCodec重合成基线的指标TPR@1%FPR43.2。其中谱域生成增强已能瓦解多数水印,而特征对齐水印因能量紧贴语音分布仅能被令牌式语言模型增强有效破坏。结论仅适用于英文朗读语音与所测6种水印和6种增强器组合,对强特征对齐水印与音乐等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
47. 从遮罩改混音到生成新声音:SSE 为何要能凭空补音频
英文题目:Spot, Separate, and Enhance: Fully Generative Approach for Audio Mixing
标签:#音频修复 | #流匹配 | #多模态学习 | #音视频 | #数据集
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ilpo Viertola:机构信息未在 arXiv HTML 中可靠披露
- Giulio Cengarle:机构信息未在 arXiv HTML 中可靠披露
- Gouthaman KV:机构信息未在 arXiv HTML 中可靠披露
- Daniel Arteaga:机构信息未在 arXiv HTML 中可靠披露
- Lie Lu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为日常视频的10秒退化非平衡混音、对应画面与1至2句文本描述,输出为重平衡并去噪去混响的重混波形。难点在于目标源被噪声混响淹没时掩码法无可恢复,且重混存在多个感知合理答案,单真值波形重构会惩罚合理解。方法链为:SkipDACVAE把48kHz音频编码为连续隐变量并用零初始化跳连保留细节,PE逐帧编码视频并经插值对齐与门控加法注入音频分支,T5-base编码文本并经交叉注意力引导,条件流匹配扩散Transformer从高斯先验经4步Euler积分生成目标隐变量与残差堆叠,再经SkipDACVAE解码。相对VisAH的谱掩码判别式重混与VisAH-FM的联合训练编解码加rollout全生成训练,该设计冻结编解码以保扩展性,允许生成新内容替代严重退化段,并引入视频加文本双条件。在DegradedMix测试集下,SSE的FD指标为1.26,低于重训VisAH的FD指标2.97。适用边界为基于电影分离茎仿真的增益失衡加背景噪声加混响与Qwen2-Audio自动字幕引导,真实UGC强混响、开放用户指令与长视频拼接尚未验证。训练成本为在两块NVIDIA RTX PRO 6000硬件上以批量26训练约67K步,原文未披露推理延迟与吞吐。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
48. 语音能听懂,事实却判不准:VeriSpeak 揭示的跨模态核查断层
英文题目:To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech
标签:#音频问答 | #检索增强 | #语音 | #基准测试 | #音频大模型
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Debajyoti Mazumder:IISER Bhopal
- Mamta:King’s College London
- Abhirama Subramanyam Penamakuri:MBZUAI
📌 核心摘要
语音事实核查要求以声学声明为输入,以支持或反驳二值 verdict 为输出,难点在于声明在语音中而证据在文本中,模型须同时完成听辨与跨模态比对。该工作构建语音探针基准VeriSpeak,其构造先做知识库富化与原子事实抽取形成可控真声明,再经类别扰动生成伪声明并经单说话人合成与自动转写形成语音输入。验证时链条分三步衔接:先用wav2vec 2.0转写待验语音得到文本查询,再以multi-e5从知识库检索文本证据并与原始语音一并送入大型音频语言模型,大型音频语言模型 Large Audio Language Models / LALMs仍以口语主张为验证对象,最后以思维链提示约束模型显式比对主张与证据并输出二值判定。与纯文本核查相比,该设置迫使模型区分待验证的口语主张与作为背景的检索文本,而非直接复述证据。在 VeriSpeak 上语音输入相对文本骨干出现大幅下降,而检索加推理的思维调优模型达到 86.1% 平均准确率,显著高于无检索语音基线。该结论限于名人传记的时序地理关系事实与合成干净语音,未验证自然口语多说话人口音噪声与开放冲突证据。原文未披露训练推理或部署成本。
🔗 开源资源
数据相关资源:https://huggingface.co/datasets/abhiram4572/VeriSpeak — 暂时无法访问
第三方资源:https://reutersinstitute.politics.ox.ac.uk/digital-news-report/2025 — 链接可访问(HTTP 200)
第三方资源:https://www.wikipedia.org/ — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
49. 直达声主导时误差从哪来:用可学习的视场权重重塑可穿戴阵列的双耳信号匹配
英文题目:Neural Field-of-View for Binaural Signal Matching with Wearable Microphone Arrays
标签:#空间音频渲染 | #端到端学习 | #麦克风阵列 | #空间音频信号 | #主观评测
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Matan Yifrach:School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Beer-Sheva 84105, Israel
- Boaz Rafaely:School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Beer-Sheva 84105, Israel
📌 核心摘要
输入为5通道可穿戴阵列采集的混响语音,输出为左右耳双耳信号,难点是双耳信号匹配在直达混响比升高时弥散场假设失效导致双耳误差增大。所提FoV-BSM-Net先将短时傅里叶变换转为归一化对数幅度谱与通道间相位差张量,再由残差卷积编码加双向门控循环网络回归视场中心向量与方位俯仰张角,接着由可微软掩膜生成对角加权矩阵并代入正则化最小均方滤波器求解双耳滤波器。该链条中表示步骤提供空间线索,回归步骤输出低自由度视场参数,加权滤波步骤将参数转化为双耳输出并以双耳域复合损失端到端训练。与固定视场或显式定位加波束成形不同,该方法不估计波形与离散到达方向,只学习空间加权并保留模型化双耳匹配后端。在高DRR条件测试集下,FoV-BSM-Net的NMSE指标改进为1.7 dB,高于FoV-BSM基线的NMSE指标改进0.8 dB。方位扫描上耳间通道级差与相位差误差同步大幅下降,听感上低直达混响比下接近隐参考而高直达混响比下显著优于固定视场基线。该结论适用边界受限于单点源仿真房间与正面附近声源,多源、头动、近场与真实录音尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
50. 语义越强伪造线索越淡:Voxtral 做欺骗检测为何必须任务适配
英文题目:Spooftral: Can Voxtral Audio-Language Model Detect Speech Spoofing?
标签:#语音伪造检测 | #LoRA | #音频大模型 | #语音
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Avishai Weizman:School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Israel Department of Electrical Engineering, Afeka the Academic College of Engineering, Israel Avignon University, LIA, France
- Yehuda Ben-Shimol:School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Israel Department of Electrical Engineering, Afeka the Academic College of Engineering, Israel Avignon University, LIA, France
- Itshak Lapidot:School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Israel Department of Electrical Engineering, Afeka the Academic College of Engineering, Israel Avignon University, LIA, France
📌 核心摘要
语音伪造检测的输入为待测语音波形,输出为真实或伪造二值判定,难点在于未知合成、转换与编解码条件下细粒度声学伪影极易被语义鲁棒表征抹平。本文以Voxtral音频语言模型为基座,先用固定指令与真实或伪造标签序列的长度归一化对数似然差构造检测分数,再冻结模型做线性探测以定位伪影信息在适配器与解码器阶段的衰减,最后仅对注意力投影做权重分解低秩适配并联合交叉熵与间隔正则完成任务适配。与直接复用语义优化解码器表征的做法不同,该方法保留Whisper音频编码器的声学敏感性,同时让解码器重新学习伪造判别边界,从而兼顾统一问答框架与可复现判决。在ASVspoof5评测集上适配后模型等错误率为4.25%,显著优于冻结线性探测音频适配器9.75%和解码器19.09%的基线。该结论限于ASVspoof系列及所用指令接口,未验证推理式多任务联合与跨语种野外数据的外推。原文未披露训练硬件、时长与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/avishai111/Spooftral — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
51. 从绝对失配到相对失配:特征空间流模型如何校准域偏移做异常声音检测
英文题目:Relative Mismatch: Local-Reference Calibration of Feature-Space Flows for Anomalous Sound Detection
标签:#异常声音检测 | #流匹配 | #检索增强 | #鲁棒性
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Anbai Jiang:机构信息未在 arXiv HTML 中可靠披露
- Xinhu Zheng:机构信息未在 arXiv HTML 中可靠披露
- Lvxin Xu:机构信息未在 arXiv HTML 中可靠披露
- Shuwei Zhang:机构信息未在 arXiv HTML 中可靠披露
- Wenrui Liang:机构信息未在 arXiv HTML 中可靠披露
- Pingyi Fan:机构信息未在 arXiv HTML 中可靠披露
- Wei-Qiang Zhang:机构信息未在 arXiv HTML 中可靠披露
- Cheng Lu:机构信息未在 arXiv HTML 中可靠披露
- Jia Liu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
异常声音检测仅用正常机器声训练,要求对未见故障打高分且在源域与目标域共用阈值,难点是目标工况样本稀少导致模型欠训练与域间分数漂移。该文先用工况分类微调的BEATs前端将音频压缩为128维判别特征并按训练统计标准化,为后端提供紧凑的任务相关表示。该方法接着在特征空间训练整流流速度场以拟合高斯噪声到正常特征的线性插值动力学,并在固定共享高斯库与多时刻上计算预测速度与真值速度的失配,经路径均值与时间加权聚合成绝对分数。该方法再检索查询近邻训练特征并在同一高斯库下计算其均值失配作为局部基准,从查询绝对分数中减去该基准得到相对分数,以剥离局部条件偏移。相比样本空间流失配与非参数k近邻,该设计把容量集中于任务相关流形并显式校准欠训练域的基准失配。在DCASE2020-2025共6套数据集评测设置下,相对失配的官方分数为71.01,高于最强KNN min的官方分数70.79。结论限于 BEATs 判别特征与 DCASE 机器声分布,未验证开放噪声、未知机器或跨前端迁移,原文未披露训练硬件、耗时与推理延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
52. 执行深度不变时,循环放在哪里才算数:流匹配 TTS 的权重重用布局
英文题目:Depth through recurrence: Looped transformers for flow-matching TTS
标签:#文本到语音 | #流匹配 | #Transformer | #语音 | #高效推理
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jiabao Ai:机构信息未在 arXiv HTML 中可靠披露
- Peng Han:机构信息未在 arXiv HTML 中可靠披露
- Yuchen Song:机构信息未在 arXiv HTML 中可靠披露
- Zhengjun Yue:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
流匹配语音合成任务输入为含噪语音、流时间与文本和参考语音上下文,输出为速度场预测,实际难点在于数值积分中需反复评估速度网络,执行深度与采样步数相乘放大计算量与误差,循环复用组织成为质量关键。方法链分三步衔接:先固定每次评估执行18次块调用,构造基线、全共享与部分共享七种版式以分离共享量、复用顺序与共享位置;再令共享段在隐状态不重置下重复访问,保持执行深度而减少独立参数;最后用Euler采样与双分支引导在32步与4步预算下对比可懂度、相似度与预测质量以按预算选型。与整体循环复用相比,相邻复用改变同块两次访问更新的余弦关系并重塑质量权衡。在Seed-TTS评测下,SEQUENCE 9×2的WER为2.03,低于CYCLE 9×2的WER 2.60。位置效应依赖预算,32步前后缀接近而4步后缀明显恶化,仅Middle在两预算与两数据集四组均值中均居前二。该结论适用边界受限于500k更新EMA权重、单尺度模型与英文客观评测,低步数高误码等失败条件尚未验证至听感外推。推理开销方面,峰值显存从877MB降至574MB而采样实时因子相当,硬件实测为H100上fp32批量为1时的32步合成。
🔗 开源资源
- 演示资源:https://jiabaoai67.github.io/loop-f5/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
53. 把同句不同念法分开建模:用固定实现潜变量条件化流匹配速度场
标签:#文本到语音 | #流匹配 | #变分自编码器 | #语音
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Junyi Zhao:机构信息未在 arXiv HTML 中可靠披露
- Yihao Qin:机构信息未在 arXiv HTML 中可靠披露
- Changsheng Ma:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
面向文本到语音(Text-to-Speech,TTS)的同一文本多实现渲染任务,输入为文本与说话人参考,输出为梅尔谱对应的波形,难点在于不同发音实现在相同状态与流时间下诱导不同目标速度而被确定性速度场平均掉。本文先由后验编码器从目标梅尔谱推断 utterance 级随机实现潜变量并以 KL 约束向标准高斯对齐,再将该潜变量经映射与时间嵌入融合后通过自适应层归一化(Adaptive LayerNorm,AdaLN)调制全部扩散变换器(Diffusion Transformer,DiT)模块的速度预测。接着在后验均值上学习线性映射预测效价唤醒支配度(Valence-Arousal-Dominance,VAD)并辅以同文本配对的相对距离保持,使同一潜空间兼具速度条件与语义操控功能。在 LibriSpeech-PC test-clean 构成的 1127 组跨句评测中全量模型取得词错率 2.09% 与 UTMOS 4.19,优于同掩码基线并伴随唤醒度与支配度的分级感知提升。该结论限于英语朗读与情感平行语料的验证,未覆盖多语言、自发语音与强分布外文本。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
54. 近满分不可信时怎么办:表示工程与录音级评估决定水下舰船分类能否部署
标签:#音频分类 | #CNN | #评测协议 | #端侧运行
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Abishek Soti:机构信息未在 arXiv HTML 中可靠披露
- Thura Pyae Sone:机构信息未在 arXiv HTML 中可靠披露
- Naqib Ibnul:机构信息未在 arXiv HTML 中可靠披露
- Htoo Htet Aung:机构信息未在 arXiv HTML 中可靠披露
- Henry Zhong:机构信息未在 arXiv HTML 中可靠披露
- Gregory Cohen:机构信息未在 arXiv HTML 中可靠披露
- Ying Xu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
水下舰船分类需从被动声学输入预测舰船类别,难点在于信道多变与同录音片段泄露会虚高精度并误导部署选型。该工作先将音频切分为固定时长片段并生成多种时频与耳蜗表示,再沿时间维做均值与标准差统计池化以压缩可变长信息,接着用紧凑卷积或经典分类器完成类别判定,最后以录音级划分与梯度类激活映射 Grad-CAM 回看频带依据。与单纯堆大模型的路线不同,该方法把性能来源放在表示选择与严格划分上,强调小模型加对的表示即可保持判别力。表示内部先压缩时域冗余再保留频带结构,使小参数量模型仍能利用类别相关的低频与中频线索。在DeepShip录音级评测协议下,四层紧凑卷积的验证集宏F1为0.6519,高于ResNet18的验证集宏F1 0.6110。结论仅适用于已评测的四类舰船与短片段条件,跨海域与跨设备外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
55. 缺旧标签不存旧音频:用闭式递推做多标签音频类增量学习
英文题目:Exemplar-Free Analytic Learning for Multi-Label Audio Class-Incremental Learning
标签:#音频分类 | #持续学习 | #环境声
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Siyuan Luo:机构信息未在 arXiv HTML 中可靠披露
- Yang Xiao:机构信息未在 arXiv HTML 中可靠披露
- Ting Dang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
多标记音频类别增量学习(Multi-Label Audio Class-Incremental Learning)的输入是含重叠声事件的录音,输出为已见全部类别的存在分数,难点在于每阶段仅标注新类组而旧类是否出现未知。所提解析学习框架先用冻结编码器抽取特征并以岭回归闭式拟合目标矩阵,再递归累积充分统计量以等价联合重训而不存历史样本。ALMA(Analytic Learning for Multi-label Audio)在此基础上用上一阶段分类器输出经裁剪的连续软估计补全旧类目标,并按类别稀有度构造对角加权矩阵参与加权岭回归。与依赖迭代梯度更新而把缺失旧类标注当作负类并产生抑制梯度的方法不同,解析闭式更新使缺失标注对旧类权重无直接覆盖,其实际意义是在无历史样本下保持旧类检测性能稳定。在50类AudioSet-R基准的Setup A评测设置下,ALMA的平均累积mAP指标为43.32%,高于LwF的平均累积mAP指标37.95%。该结论的适用边界为冻结CNN14编码器与阶段内类别互斥划分条件,对编码器持续演化与开放域新类的泛化表现尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
56. 说话与开枪必须同步:PUBG Ally 如何把慢推理装进快对局
英文题目:PUBG Ally: A Conversational Embodied Agent as an AI Teammate
标签:#语音对话系统 | #知识蒸馏 | #游戏音频 | #端侧运行
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Beomsoo Kim:机构信息未在 arXiv HTML 中可靠披露
- Byeongju Kim:机构信息未在 arXiv HTML 中可靠披露
- Dohyun Kim:机构信息未在 arXiv HTML 中可靠披露
- Dongwon Kim:机构信息未在 arXiv HTML 中可靠披露
- Eunchong Kim:机构信息未在 arXiv HTML 中可靠披露
- Hongmin Kim:机构信息未在 arXiv HTML 中可靠披露
- Hyeojung Im:机构信息未在 arXiv HTML 中可靠披露
- Hyeonbin Hwang:机构信息未在 arXiv HTML 中可靠披露
- Hyeonghwan Kim:机构信息未在 arXiv HTML 中可靠披露
- Hyoseok Seol:机构信息未在 arXiv HTML 中可靠披露
- Insub Im:机构信息未在 arXiv HTML 中可靠披露
- Irene Chen:机构信息未在 arXiv HTML 中可靠披露
- Jaeseung Jeon:机构信息未在 arXiv HTML 中可靠披露
- Jimin Hong:机构信息未在 arXiv HTML 中可靠披露
- Kiyoon Yoo:机构信息未在 arXiv HTML 中可靠披露
- Minkyoung Park:机构信息未在 arXiv HTML 中可靠披露
- Seohyeon Jung:机构信息未在 arXiv HTML 中可靠披露
- Seungjun Chung:机构信息未在 arXiv HTML 中可靠披露
- Sue Hyun Park:机构信息未在 arXiv HTML 中可靠披露
- Sungwoo Kim:机构信息未在 arXiv HTML 中可靠披露
- Youngin Cho:机构信息未在 arXiv HTML 中可靠披露
- Yujeong Son:机构信息未在 arXiv HTML 中可靠披露
- Kangwook Lee:机构信息未在 arXiv HTML 中可靠披露
- Hyunseung Kim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是为PUBG Sanhok地图双排提供可语音协作的具身队友,输入为持续演化的游戏状态与玩家按键发话语音,输出为同步的语音回复与游戏内高层动作,难点在于实时性、语音与行为一致性、意图理解与跨轮记忆。事件驱动的System 2语言模型智能体经有界工具按需观测对局信息并解析语音维持上下文,其输出的高层意图与语音决策进入下一步执行。System 1行为树以游戏节拍将该意图转译为移动战斗拾取救援等实时控制并支持抢占恢复,其沉淀的对局轨迹进入下一步训练。基于近39k真人陪玩会话轨迹的教师修正与三阶段蒸馏再将该行为压缩到端侧小语言模型用于部署。与全量状态输入与单速率控制的既有游戏智能体不同,该设计以按需观测保持上下文新鲜并以深思与快控解耦把推理移出实时环路。在能力评测设置下,蒸馏后2B学生的Fact得分为0.932,低于教师的Fact得分0.944。该结论限于Sanhok单人配Ally双排与韩英中三语,其战斗评分仅2.58/5且残留跟随失败与边界击穿,跨地图与跨人群外推尚未验证。原文附录披露了云端教师单局API成本,端侧推理无API成本但未披露训练成本。
🔗 开源资源
- 复现相关资源:https://pubg.com/en/clause — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
57. 以外毛细胞损伤为靶点的仿生助听补偿:从听力图个性化到人耳可懂度验证
英文题目:Subjective Evaluation of DNN AND Auditory-Model-Based Hearing-Loss Compensation
标签:#语音增强 | #主观评测 | #助听器 | #言语感知
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Chuan Wen:机构信息未在 arXiv HTML 中可靠披露
- Brent Nissens:机构信息未在 arXiv HTML 中可靠披露
- Nele De Poortere:机构信息未在 arXiv HTML 中可靠披露
- Morgan Thienpont:机构信息未在 arXiv HTML 中可靠披露
- Matthias Inghels:机构信息未在 arXiv HTML 中可靠披露
- Attila Fráter:机构信息未在 arXiv HTML 中可靠披露
- Guy Torfs:机构信息未在 arXiv HTML 中可靠披露
- Sarah Verhulst:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
感音神经性听力损失患者的核心难点是外毛细胞损伤同时抬高阈值并展宽听觉滤波器,传统助听器只能恢复可听度而难以恢复噪声下频率选择性。本文输入为含餐馆多人babble噪声的矩阵句混合语音,输出为经深度神经网络补偿后直接馈给耳机的增强语音,目标是在个体化耳蜗响应层面逼近正常听力。方法链分为三步:先以纯音测听诊断个体阈值,再经迁移学习将正常听力dCoNNear耳蜗模块个性化为听损耳蜗模块并冻结双通路,最后以多尺度平均绝对误差训练共享dCoNNear结构的助听器模块,使听损通路对增强信号的响应逼近正常参考。与基于处方的NAL-NL2固定增益规则不同,该策略不预设压缩曲线,而是从正常与听损时域耳蜗响应差异中数值优化出与电平相关的补偿,具有恢复调谐的实际意义。在固定Slope35_5听力图和-3 dB信噪比条件评测下,OHC补偿的HASPIv2得分为0.9181,高于未处理条件的HASPIv2得分0.4581。该结论适用边界受限于轻中度斜坡型为主的样本与受控实验室耳机聆听,尚未验证与NAL-NL2的行为优劣及音质维度。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://archive.org/details/odyssey_butler_librivox — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
58. 不压平散射路径:用载波-调制拓扑做语音伪造检测前端
英文题目:WST-Graph: Topology-Preserving Wavelet Scattering Front-End for Speech Deepfake Detection
标签:#音频深度伪造检测 | #图神经网络 | #语音 | #鲁棒性
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kwok-Ho Ng:机构信息未在 arXiv HTML 中可靠披露
- Tingting Song:机构信息未在 arXiv HTML 中可靠披露
- Bingwen Feng:机构信息未在 arXiv HTML 中可靠披露
- Zhihua Xia:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音深度伪造检测以波形为输入输出真伪二分类,难点在于合成伪影局域且跨生成器与信道泛化困难。所提WST-Graph先用固定参数一维散射提取一阶载波包络与二阶调制系数,并做对数压缩与调制级归一化以校准路径幅度。再由顺序网格按父载波键与调制键将平坦路径重排为稀疏通道-载波-时间张量,并以固定结构掩码保留缺失路径拓扑。随后长度感知通道级自适应局部注意力池化将变长帧压缩为固定相对时间格,逐点适配器与深度可分离残差块在同一坐标完成跨阶融合与局部建模,最后由类AASIST谱时图注意力完成全局交互与分类。与直接展平散射路径相比,该链条延迟了跨频跨时混合从而保留显式载波-调制声学坐标,使图后端可利用父子关系建模。在ASVspoof2019 LA评测设置下,WST-Graph-Q82的等错误率为2.92%,低于复现AASIST-L的等错误率3.45%。该结论适用边界受限于仅在ASVspoof 2019 LA上训练,在13个域外集上仅部分领先且多集错误率仍高于30%,更广泛信道与生成器外推尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
59. 重建越好识别越好吗:连续音频编码器中隐宽度与帧率的联合权衡
英文题目:Joint Analysis of Latent Dimensionality and Frame Rate in Continuous Audio Encoders
标签:#音频编码 | #评测协议 | #语音识别 | #音频问答 | #说话人识别
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kyudan Jung:机构信息未在 arXiv HTML 中可靠披露
- Sehyun Lee:机构信息未在 arXiv HTML 中可靠披露
- Son-ha Jo:机构信息未在 arXiv HTML 中可靠披露
- Jaegul Choo:机构信息未在 arXiv HTML 中可靠披露
- Sanghyuk Shoi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
任务以48 kHz波形为输入,输出重建波形与可供识别和问答模型读取的帧序列,实际难点是重建保真度随潜宽度与帧率单调提升,却不能保证下游模型可访问任务相关信息,且宽度与帧率的联合组织效应尚不明确。方法分三步衔接:先在统一DAC-VAE骨干上训练\(d\)为128、256、512、1024与\(f\)为3.125、6.25、12.5、25 Hz的16个编码器,使瓶颈宽度与时间压缩正交可比并输出各格冻结表示;再冻结编码器并为每格单独训练适配器与探针,把表示接入冻结大语言模型完成自动语音识别与口语问答,另用统计池化加线性层做说话人识别,得到跨格可比的下游性能;最后对冻结表示做保留前半主成分的重投影干预,分别送入冻结下游模型与冻结解码器,以分离识别敏感性与重建敏感性。与单轴调参与唯重建选型相比,该设计揭示宽度与帧率的联合组织效应。在 LibriSpeech test-clean 上,12.5 Hz 时 256 维词错率为 3.77%,优于同帧率 1024 维的 4.22%,而 3.125 Hz 时最优转向 1024 维;在 triviaqa_speech 上,12.5 Hz 时 512 维 Cover-EM 为 34.58%,高于 1024 维的 31.38%。该结论限于重建式连续编解码器与所测语音、通用声音、音乐混合训练及英语朗读、问答与说话人评测,未验证离散量化、流式约束与其他语言或噪声场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
60. 把嗯嗯放在对的时刻:用一个可调阈值的轻量头控制全双工模型的倾听反馈
英文题目:Controlling Backchannels in Streamable Full-duplex Models
标签:#全双工语音交互 | #LoRA | #流式处理 | #轮次切换 | #主观评测
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Maike Züfle:机构信息未在 arXiv HTML 中可靠披露
- Peter Polák:机构信息未在 arXiv HTML 中可靠披露
- Sefik Emre Eskimez:机构信息未在 arXiv HTML 中可靠披露
- Jan Niehues:机构信息未在 arXiv HTML 中可靠披露
- Peter Bell:机构信息未在 arXiv HTML 中可靠披露
- Ondřej Klejch:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音交互需在听的同时判断何时插入yeah或uh-huh类回应声,输入为对方连续语流与自身静默状态,输出为回应声起始时刻与词形音频,难点在于时机须与人类语流对齐且频率可控而不打断主发言。本文方法链分三步:先从时序主干隐状态逐帧预测下一帧是否为回应声起始,再以可调阈值将检测与发射解耦以控制频率,最后在触发时强制解码特殊标记并由主干自回归补全词形与音频。相对隐式涌现或强化学习塑形及外部VAP分类器,该机制直接复用主干表征并屏蔽特殊标记的自发发射,从而实现可插拔与可调的显式控制。在TurnBench探针与Full-Duplex-Bench v1生成评测下,该方法提升了频率与时机一致性并保持了暂停处理与轮转能力。在TurnBench抽样的人类听感评测下,PersonaPlex-BC的得分为4.37分,高于随机基线的得分3.77分。该结论目前仅限于英语Fisher训练与TurnBench评测的短窗对话场景,外推至其他语言与强噪声重叠场景尚未验证。原文未披露训练推理的完整优化配置与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/MaikeZuefle/bcmore — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
61. 特化前后来当老师:用任务专属在线蒸馏调和语音模型的转写与问答
英文题目:TS-OPD: Reconciling ASR and QA in Speech Language Models via Task-Specific On-Policy Distillation
标签:#语音识别 | #知识蒸馏 | #音频问答 | #语音 | #语音大模型
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yujie Guo:机构信息未在 arXiv HTML 中可靠披露
- Hongjie Chen:机构信息未在 arXiv HTML 中可靠披露
- Jian Kang:机构信息未在 arXiv HTML 中可靠披露
- Jie Li:机构信息未在 arXiv HTML 中可靠披露
- Yongxiang Li:机构信息未在 arXiv HTML 中可靠披露
- Yong Qin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音语言模型(Speech Language Models,SLMs)在自动语音识别(Automatic Speech Recognition,ASR)专用化后常丢失语音条件问答能力。输入为连续语音加任务提示,输出为逐字转写或带思维链的问答回答,难点是两类监督在同一策略分布上直接冲突。本文提出任务特定在策略蒸馏(Task-Specific On-Policy Distillation,TS-OPD),流程分三步:先冻结语音编码器与大语言模型(Large Language Models,LLMs)只训练适配器得到问答模型,再以其为起点全参数识别微调得到识别专用模型,前者保留指令跟随风格,后者提供更强识别分布;第三步以问答模型为起点初始化学生,按约 1:1 采样识别与问答实例,在学生自采样轨迹上分别只用对应教师做前向散度蒸馏。与共享轨迹下双教师同时监督同一轨迹相比,任务特定路由(Task-Specific Routing)避免了同一状态上的分布竞争。在 LibriSpeech、GigaSpeech、ContextASR-Bench 英语对话子集与 TELEVAL 三套英语问答集上,500 小时蒸馏的学生问答总体准确率 45.07% 为全表最高,基本识别总体词错率 10.03% 明显优于问答适配器与 8k 小时联合训练基线,并缩小了与全参数识别模型 9.16% 的差距,上下文识别中在转写精度与命名实体召回间取得折中。该结论目前仅在英语 Emilia 派生数据上验证,未覆盖多语、长时对话与开放指令泛化,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
62. 任务信息定子空间:在固定参数预算下为低资源语音重分适配容量
英文题目:Adaptive Fisher-Whitened Cross-Covariance for Low-Resource Speech Recognition
标签:#语音识别 | #参数高效微调 | #低资源 | #多语言
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Asmee Mishra:机构信息未在 arXiv HTML 中可靠披露
- Mengjie Qian:机构信息未在 arXiv HTML 中可靠披露
- Brechtje Post:机构信息未在 arXiv HTML 中可靠披露
- Kate Knill:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
低资源自动语音识别需将多语言语音基础模型适配到预训练覆盖不足的语言,输入为连续声学语音而输出为目标语言转写,难点在于仅有约7.5小时至10.5小时标注语音时通用低秩更新难以找到有效子空间。本文先用费雪白化交叉协方差分析(Fisher-Whitened Cross-Covariance Analysis,FCCA)从输入与回传误差统计构造冻结左右基并只训练小核心矩阵,再并行探索跨层共享与跨矩阵重分配两条扩展,前者耦合相邻层对齐更好的一侧基,后者按谱能量在固定预算下选择各矩阵秩。相对通用低秩自适应(Low-Rank Adaptation,LoRA)的机制差异在于基由下游任务统计而非随机初始化或预训练权重谱决定,且可训练量仅随秩平方增长。在FLEURS的Whisper medium评测中,自适应秩变体在Sorani Kurdish上相对标准FCCA将词错率从44.97%降至43.84%,在Qwen3-ASR的Asturian上从19.61%降至18.56%。该结论的适用边界受限于5种FLEURS语言、贪婪解码与无外部语言模型条件,失败条件是跨层共享在Qwen3-ASR上反而升高词错率且与全量微调仍有差距,更多语言与解码外推尚未验证。校准为一次性开销,在RTX 6000上约20秒至90秒,适配本身仅训练Whisper的0.61%参数。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
63. 不用跟读配对:以母语者音素类几何度量二语发音偏离
英文题目:A Native-Reference Phone-Class Geometry for Second-Language Pronunciation Analysis
标签:#语音属性识别 | #自监督学习 | #语音 | #语音学与音系 | #教育
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Tina Raissi:机构信息未在 arXiv HTML 中可靠披露
- Nhan Phan:机构信息未在 arXiv HTML 中可靠披露
- Chenxiao Wang:机构信息未在 arXiv HTML 中可靠披露
- Mikko Kurimo:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为二语学习者自发或朗读语音及其转写与强制对齐边界,输出为相对母语参考的发音偏离距离,难点在于自发语音无固定题面和无平行母语录音,且后验峰值化难以解释对齐与声学模型失配。先对自监督表示按上下文相关音素类求质心形成质心矩阵,其输出减去母语均值后进入下一步,随后对母语质心矩阵做截断奇异值分解构建低维基准并将单句二语质心投影到该基准,最后对匹配音素类计算坐标距离并聚合为句级分数。与基于似然的发音优度和动态时间规整相比,该机制直接比较连续表示几何而非后验分布,且不要求相同文本的平行录音,具有无需标签和题面的实际意义。在S&I Train评测设置下,SVD投影的欧氏距离的Spearman ρ为-0.52,低于全空间的Spearman ρ -0.50。在Speak and Improve 2025自发语料Dev集下偏离距离与综合能力呈负相关(ρ=-0.53,r=-0.53),在UME-ERJ朗读集上与发音分同样呈较弱负相关(ρ=-0.34,r=-0.37),说明距离越小说得分越高。该结论在整体口语与朗读发音之间外推仍受限,短句质心不稳定且难以剥离流利度与覆盖度影响。SVD投影将计算量从2520秒降至8秒,但原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
64. 从音频到可弹指法:手部分离与指法标注为何必须联合建模
英文题目:Statistical Models for Automatic Fingering-Annotated Piano Sheet Music Transcription
标签:#音乐转录 | #统计分析 | #音乐 | #音乐信息检索 | #端到端
评分:6.0/10 | 创新 1.1/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Daniel Penner:Department of Computing Science, University of Alberta, Edmonton, Alberta, Canada
- Abram Hindle:Department of Computing Science, University of Alberta, Edmonton, Alberta, Canada
📌 核心摘要
该工作处理钢琴音频到可演奏乐谱的映射,输入为复调钢琴录音,输出为分左右手双谱表与每音符指法编号,难点在于音频转录误差会传导至手部分配,而手部误分配又会破坏相邻音符指法序列的物理可行性。方法链由4步构成:先用卷积循环网络将音频转录为演奏MIDI,再用统计标注模型为每个音符分配手部与指法,接着用PM2S将演奏MIDI量化为乐谱MIDI并以自有手部预测覆盖其手部输出,最后经MuseScore转换为MusicXML并回贴指法。相对已有单手单声部指法隐马尔可夫模型HMM与双向卡尔曼滤波手部分离,关键差异是分层解耦与联合解码并存,既有拼接两者的Synthesis,也有在束搜索中同时跟踪双手末状态的规则模型与多流三元模型。在PIG数据集130训练与10测试的100次随机划分上,Synthesis手部分离准确率为90.8%,联合手部加指法准确率为56.6%,显著高于重现的合并输出HMM基线。该结论仅适用于古典钢琴独奏与合成音频主导的评测条件,对真实录音、其他风格与多人标注分歧下的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
65. 测试时才学新词:用未标注语音为语言模型补词表与拼写
英文题目:Learning New Words from Unlabeled Test Data in Automatic Speech Recognition
标签:#语音识别 | #测试时自适应 | #无监督学习 | #语音 | #大语言模型
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Mengqi Wang:机构信息未在 arXiv HTML 中可靠披露
- Mark A. Hasegawa-Johnson:机构信息未在 arXiv HTML 中可靠披露
- Haolong Zheng:机构信息未在 arXiv HTML 中可靠披露
- Chang D. Yoo:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为无标注测试语音,输出为包含从未见过的新词的转写文本,难点在于拼写与发音均未知且缺乏语言模型(Language Model,LM)上下文支撑时难以与声学证据联合决策。该方法先用冻结声学模型生成 N 最佳假设并与语言模型偏好做失配打分以定位疑似域,再从对齐后的候选拼写中初始化新词符的均匀拼写分布与嵌入表示,接着仅微调新词符的输入嵌入与输出权重以最小化边际分布的 KL 散度,最后通过占位符注册表在复现时检索复用并联合更新声学与上下文证据。与提供拼写表的上下文偏置方法不同,该工作完全从测试语音估计词义表示与拼写分布,实现了增量词表学习。在 LibriSpeech test-other 频发新词子集上,相对浅融合基线的新词字符错误率降低 14.97%,构音障碍 SAP 开发集新词子集上相对降低 6.67%。该结论仅适用于复现至少两次的新词,对单次出现词与 CTC 高置信误识情形基本无效,且首现候选质量决定后续复用上限。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
66. 麦克风默认关闭:用手腕异常触发一秒声音来分辨细粒度动作
英文题目:AnomaSense: Anomaly-based Sensor Activation for Fine-Grained Human Activity Recognition
标签:#音频分类 | #变分自编码器 | #多模态学习 | #隐私保护
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Xue Wang:University of California, Los Angeles, Los Angeles, CA, USA
- Yang Zhang:University of California, Los Angeles, Los Angeles, CA, USA
📌 核心摘要
该工作处理腕戴细粒度活动识别,输入为连续六通道IMU信号与按需采集的短时音频,输出为20类腕部动作标签,难点是组内动作腕部轨迹几乎相同而材质声音不同,且麦克风常开会泄露语音。方法分三步:仅以无声日常运动训练LSTM-VAE并以重构误差平滑阈值检出异常点,异常点处请求1秒音频并做遮罩且截取前后各0.5秒惯性窗口,DeepConvLSTM与AudioCNN分别提特征后经自注意力融合分类。与监督分类器触发采样的已有方案不同,该触发无需目标活动标签且以运动先于声音的时间先验决定监听时刻,兼具数据最小化与泛化到未见活动的显著潜力。在15人留一交叉验证评测设置下,IMU加无遮罩1秒音频的准确率为96.89%,高于IMU单模态的准确率78.98%。结论仅适用于受控安静环境与偏向音频的活动集,未验证噪声、非脚本运动与长期误触发下的表现。原文未实测功耗与端侧延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
67. 停顿不等于让出话轮:BanglaTurn 如何为孟加拉语补上轮次结束检测基准
英文题目:BanglaTurn: A Benchmark and Whisper-Based Model for End-of-Turn Detection in Bangla Speech
标签:#轮次切换 | #SFT | #数据集 | #基准测试 | #低资源
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Mizbaul Haque Maruf:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
轮次结束检测输入为播客对话语音片段,输出为说话人是否交出话轮的二分类,难点在于区分真正交接与停顿、填充词和听众反馈造成的假边界。方法链由四步构成:播客音频经说话人分离标注切分出说话人轮次并做语音活动检测分块,接着结合分离启发式与大语言模型初标生成候选标签,再由母语者逐条听辨校正并标注填充词,最后将音频送入Whisper编码器经多尺度池化与分类头输出交接概率。与依赖静音阈值和通用多语言模型的方法不同,该路线显式针对孟加拉语会话韵律做迁移并融合局部与全局声学视图。在留出播客的类别均衡测试集上,本文模型准确率达到84.33%,高于Smart-Turn v3的69.28%。结论仅适用于播客域内的宽带孟加拉语对话,向电话窄带、助手短指令和噪声重叠场景外推尚未验证。原文未披露完整训练时长与算力成本,仅报告CPU端到端延迟在165至191 ms之间。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
68. 谁在何时说话:STAM-ASR 用内部说话人时间锚与双记忆改造 AudioLLM
英文题目:STAM-ASR: Speaker-Temporal Anchoring with Memory for Multi-Speaker ASR
标签:#语音识别 | #LoRA | #说话人分离标注 | #音频大模型 | #会议转录
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Victor Tolulope Olufemi:机构信息未在 arXiv HTML 中可靠披露
- Syeda Faiza Ahmed Sara:机构信息未在 arXiv HTML 中可靠披露
- Shammur Absar Chowdhury:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
多说话人语音识别需同时恢复说什么、谁说与何时说,长录音中轮次交替、重叠与说话人重现使分离与归因更难。该方法先复用冻结的Qwen2.5-Omni-7B音频编码器中间层特征,由轻量内部 diarization模块估计多标签说话人活动与说话人向量。接着以说话人向量表征谁、帧级活动表征何时,经残差FiLM线性调制生成目标说话人视角语义表示,保留原序列长度与维度并分别处理重叠说话人。再由共享查询变换器维护说话人记忆与对话记忆,将历史记忆与当前表示拼接后交由大模型解码,并在转写后更新双记忆用于后续轮次。与依赖外部Zipformer前端与外部说话人编码器的TagSpeech路线不同,其差异在于内部特征直接做分离标注、无波形分离的多视角调制与跨轮次固定尺寸双记忆。在语音活动检测切分全量预测条件下,该方法在 AMI 近讲混合会议级联最小排列词错率为 61.8%,在 ICSI、LibriCSS、NOTSOFAR-1 上亦优于同口径 Qwen2.5-Omni-7B 与 TagSpeech-AMI,仅在 AMI 远场单麦克风上落后 TagSpeech-AMI 约 1.6 个百分点。在AMI近讲混合VAD切分评测设置下,STAM-ASR的cpWER为61.8%,低于TagSpeech-AMI的cpWER 69.8%。其适用边界受限于20秒短块切分与特定会议语料,失败条件包括预测说话人活动误差主导、远场与跨域下记忆增益不稳定且尚未验证更长会话外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
69. 不重训模型,只用一帧解剖标定把完整声道轮廓搬到新说话人
英文题目:Anatomy-aware cross-speaker adaptation of complete vocal-tract acoustic-to-articulatory inversion
标签:#语音属性识别 | #领域适应 | #语音 | #发声与构音
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Nhat-Nam Nguyen:机构信息未在 arXiv HTML 中可靠披露
- Pierre-Andre Vuissoz:机构信息未在 arXiv HTML 中可靠披露
- Yves Laprie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作处理跨说话人声学到发音反演,输入为声学倒谱特征,输出为从声门到唇部的10个声道结构轮廓,难点在于解剖形态与发音策略个体差异导致固定模型几何失配。方法链分为三步:先用双全连接加双向长短时记忆网络固定模型在参考人空间预测轮廓,再以单帧/u/标定提取椎体与牙齿为主的解剖标志点估计仿射变换实现全局尺度姿态对齐,最后以薄板样条对仿射后标志点做非刚性插值并逐点映射全部轮廓。仿射输出的变换后标志点直接作为样条插值的源端约束进入下一步,单说话人映射复用于全部录音而无需重训。与纯仿射基线相比,该机制用光滑形变显式分离全局对齐与局部解剖差异,新增下切牙对应点约束下颌区域。在八说话人跨说话人适应评测下,所提Affine12+TPS14配置的指标平均点到最近点距离P2CPmean为3.19 mm,低于主要仿射基线Affine14的指标平均点到最近点距离P2CPmean 3.69 mm。该结论的适用边界受限于法语单参考人、中矢状面轮廓与单帧/u/标定,喉部与唇部残留较大误差且P4出现退化,跨语言与多参考人场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
70. 先降维再建依赖:RALCT 用随机增强与卷积 Transformer 做轻量环境声识别
标签:#音频分类 | #Transformer | #环境声 | #数据增强 | #端侧运行
评分:5.7/10 | 创新 1/2 | 技术严谨 0.6/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.5/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Julia Huang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
环境声音分类需从城市户外录音波形中输出10类标签,难点在于类间易混、时长与信噪比差异大,且端侧部署要求参数量小。所提随机增强分层卷积Transformer(Randomized Audiomentational Layered Convolutional Transformers,RALCT)先对波形按可配置概率施加基于Librosa的加噪、音高偏移与时间伸缩,每轮呈现不同形态;再并行计算对数梅尔频谱(Log-Mel Spectrogram)与梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients,MFCCs)并分别批量归一化后拼接。拼接后的二维表征经三层卷积神经网络(Convolutional Neural Network,CNN)加丢弃(Dropout)与最大池化(Max Pooling)提取局部纹理并压缩时间维度,再经位置编码送入两层Transformer编码器建模长程依赖,最后经展平(Flatten)、密集(Dense)层与Softmax输出类别。该设计的关键差异在于用卷积降维缓解多头注意力 \(O(n^2 \cdot d + n \cdot d^2)\) 的计算压力,同时用双表征互补能量演变与音色包络线索。在UrbanSound8K上80%训练、20%验证的单次随机划分下,最优版本在第119轮达到94.56%验证准确率,与MhaNN-SVM的94.60%基本持平但低0.04个百分点,高于MhaNN的92.20%和AudioCLIP的90.07%。模型约31万参数,转为TensorFlow Lite后约2.8 MB,可在iOS原型Audiority上约1秒内提示汽车喇叭、枪声和警笛。该结论仅在单数据集、单次划分与清洗后8721个文件范围内成立,未验证跨设备与真实街景噪声下的外推能力。
🔗 开源资源
- 代码相关资源:https://github.com/TheClassicTechno/audioclassmodel → https://github.com/TheClassicTechno/audio_ai_classification_research — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
71. 不用算整张谱相关面:用耳蜗内毛细胞包络取循环调制
英文题目:Bio-inspired efficient cyclostationary analysis in machine and underwater acoustic recordings
标签:#音频事件检测 | #时频分析 | #高效推理 | #工业应用
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Thura Pyae Sone:机构信息未在 arXiv HTML 中可靠披露
- Abishek Soti:机构信息未在 arXiv HTML 中可靠披露
- Henry Zhong:机构信息未在 arXiv HTML 中可靠披露
- Gregory Cohen:机构信息未在 arXiv HTML 中可靠披露
- RunChun Mark Wang:机构信息未在 arXiv HTML 中可靠披露
- Ying Xu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文输入为机器与水下声学录音中的弱循环平稳调制,输出为循环频率 Alpha 上的检测谱,难点在于特征宽带分散并被环境噪声与非平稳干扰淹没。方法链分为三步:级联非对称谐振器与快压控 Cascade of Asymmetric Resonators with Fast-Acting Compression 即 CARFAC 前端做对数频率分解与自动增益反馈,内毛细胞 Inner-Hair-Cell 即 IHC 支路经半波整流与泄漏积分提取各通道包络能量并降采样做 FFT 得到通道循环谱,最后按 Alpha 邻域中值归一化与通道间中值聚合抑制强线遮蔽与平方律自噪声。相比快速傅里叶变换累积法 FFT Accumulation Method 即 FAM 构造谱相关曲面再做积分循环调制相干 Integrated Cyclic Modulation Coherence 即 ICMC 的做法,该方法省去块间共轭互乘与大累加器,只用实值能量谱幅度做检测。在合成双边带调幅信号的评测设置下,CARFAC-IHC的循环频率指标为99.935 Hz,低于理论值的循环频率指标100.000 Hz。在16 kHz分段与通道尺寸增大的条件下该流式能量谱路线随分辨率扩展更平缓,可连续运行并仅在候选出现时调用FAM/ICMC确认。该结论外推受限,健康轴承无故障对照与无轴速真值的单船录音只能证明特征重合而非故障检出与泛化。部署成本在单线程桌面 CPU 上实测,原文未给出训练成本因无需训练。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
72. 把重叠回声看成连续方向分布:Herglotz 核如何在一个分析帧内数出多个反射
标签:#声源定位 | #信号处理 | #麦克风阵列 | #空间音频信号
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Pierre Massé:机构信息未在 arXiv HTML 中可靠披露
- Anthony Gallien:机构信息未在 arXiv HTML 中可靠披露
- Wolfgang Kreuzer:机构信息未在 arXiv HTML 中可靠披露
- Markus Noisternig:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理球形麦克风阵列测得的空间房间脉冲响应单分析帧内多反射同时到达问题,输入为经编码滤波补偿后的高阶Ambisonics系数,输出为各回声到达方向、相对强度与反射个数,难点在于早期反射为脉冲状、时域支撑极短且与直达声高度相关,无法依赖长时协方差解耦。方法先用Tikhonov正则反演估计连续Herglotz核构成的定位函数,其输出的复值方向分布进入下一步频带平均。该平均在最大指向性频带内按峰值加权平均幅值得到与频率无关的球面能量图,抑制混叠频段与噪声主导频点的干扰。然后以球面高斯径向基拟合能量图并用类Akaike信息准则迭代选择分量数,拟合误差与模型复杂度共同决定最终反射数。与逐方向独立扫描的导向响应功率不同,该方案同时求解全球分布以抑制相关源拖尾;与多重信号分类相比,其不依赖长时平稳与非相关假设,因而更适于单帧密集早期反射。在ESPRO实测42ms、13反射密集帧评测设置下,Herglotz的检测率指标为70%,高于SRP的检测率指标31%。结论限于早期段单帧定位,尚未验证帧间跟踪、混响尾重建增益与跨厅堂阵列外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
73. 小数据多语言无监督表示:BiMamba2 掩码预测为何说话人聚类强而语种识别弱
标签:#说话人识别 | #自监督学习 | #状态空间模型 | #多语言 | #语音
评分:5.5/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Prakriti Subedi:机构信息未在 arXiv HTML 中可靠披露
- Howard Prioleau:机构信息未在 arXiv HTML 中可靠披露
- Saurav K Aryal:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
无监督野外多语言语音表示要求在无标注、多语言、声学多样条件下,仅从原始音频学习可直接用于语言识别、语音识别与说话人聚类的冻结嵌入,难点在于语言覆盖极不均衡且官方探针分布与训练分布未知。方法链分为四步:先对 MLCommons 无监督语音使用预计算语音活动检测过滤与 80 维对数梅尔分片并做语言感知采样以抑制英语主导,再用 MiniBatchKMeans 从原始声学帧构造离散伪标签,随后以双向 Mamba2 编码器对掩码帧预测伪标签并辅以语言识别与 VICReg 约束学习表示,最后将帧级输出分三段平均与归一化后提交 Dynabench 探针。与单向状态空间模型及 Transformer 掩码预测相比,关键差异是前后向共享状态空间算子求和加对角残差,以线性复杂度获得非因果上下文。官方评估中主检查点在说话人聚类上调整兰德指数达到 0.735,超过全部 4 个基线,而语言识别宏平均 F1 仅为 0.073,字符错误率为 0.870。该结论仅适用于所用数据子集与冻结三段平均嵌入协议,晚期检查点已出现语音内容泛化退化,未验证迭代精炼伪标签或更大规模语料下的外推。原文披露训练使用单张 NVIDIA RTX A6000,未披露完整训练时长与推理吞吐成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
74. 只看低频孤立共振:多分辨率谱图反推板混响物理参数
英文题目:A multi-resolution spectrogram approach for estimating the physical parameters of a plate reverb
标签:#声源定位 | #CNN | #时频分析
评分:5.2/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后 50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Jared Lipkin:机构信息未在 arXiv HTML 中可靠披露
- Meiying Chen:机构信息未在 arXiv HTML 中可靠披露
- Benjamin R. Thompson:机构信息未在 arXiv HTML 中可靠披露
- Andrea Cogliati:机构信息未在 arXiv HTML 中可靠披露
- David A. Anderson:机构信息未在 arXiv HTML 中可靠披露
- Michael C. Heilemann:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理从板式混响脉冲响应反推物理与几何参数的问题,输入为单通道时域脉冲响应,输出为七个原始参数板高 \(L_y\)、厚度 \(h\)、密度 \(\rho\)、张力 \(T_0\)、杨氏模量 \(E\) 与输出位置 \((x_o,y_o)\),评测时换算为六个导出量密度厚度比 \(\mu=\rho h\)、刚度比 \(D/\mu\)、张力比 \(T_0/\mu\)、板高 \(L_y\) 与 \((x_o,y_o)\),难点在于高阶模态节点对称导致的幅度模糊与高频模态重叠造成的不可分辨。所用链条先将脉冲响应降采样至 \(f_s=1470\) Hz并计算多分辨率谱以突出低频孤立共振,再把三通道幅度谱与一通道相位谱堆叠为四通道图像送入改造的残差网络ResNet-18,最后由回归头直接输出七维原始参数。与全频带幅度谱基线相比,带宽限制把容量集中于空间可辨的低阶模态,相位通道为对称位置提供幅度之外的判别依据。在200条5秒随机脉冲响应验证集上,最优模型M1-DsPh平均归一化均方误差为0.0058,相对基线的0.0605下降约90%;摘要另称在5000条验证集上平均误差为0.02920,其中 \(y_o\) 为0.00228、\(L_y\) 为0.00347、\(x_o\) 为0.00574,但正文未展开该5000条划分与换算口径。该结论目前仅在合成数据与已知激励位置、恒定板宽 \(L_x\)、已知阻尼与泊松比等强假设下成立,未验证真实板混响单元、噪声鲁棒性与参数外推能力。训练在单卡RTX 3090上约40轮收敛约1小时,200条推理在M2笔记本上平均约6.47 ms且实时因子约0.0013。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
75. 听错一个数字就下错单:从声学压力到任务成败的 TRACE 核查法
英文题目:Voice Agents under Acoustic Stress: From Signal Degradation to Interaction and Action
标签:#语音交互 | #评测协议 | #鲁棒性 | #语音
评分:5.2/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.3/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:后 50% | 文档类型:综述 | arXiv 原文
👥 作者与机构
- Amir Ivry:机构信息未在 arXiv HTML 中可靠披露
- Kai-Wei Chang:机构信息未在 arXiv HTML 中可靠披露
- Lin Zhang:机构信息未在 arXiv HTML 中可靠披露
- Sharon Gannot:机构信息未在 arXiv HTML 中可靠披露
- Carlos Busso:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音agent需在噪声、混响与竞争说话下依据受损语音与对话历史完成下单等带副作用任务,输出为澄清追问、等待或工具调用,误听号码或跟错说话人会直接触发不可逆错误动作。TRACE先定义目标结果与禁用行为并设定成功标准,该任务规则约束后续录音选择与压力构造方式。接着保留原始录音并标注关键片段,再构造丢包式声学压力副本并核查剩余信息是否支持原目标,该配对输入直接进入下一步对比运行。最后以相同agent与用户回复规则在原始与压力音频上做配对运行,并统计目标达成、违规、恢复与额外轮次以分离中间纠错与最终成功。与仅测转写或回答质量的基准不同,关键机制差异是坚持同一任务在有无压力下配对比较,并把违规后的目标达成与无违规任务成功分离计分,具有防止误动作的实际意义。在十对配对录音的示例任务条件下,移除号码的压力副本的成功率为60%,低于原始录音的成功率90%。结论仅适用于所选任务、声学条件与用户配合假设,压力同时污染澄清回复或涉及时序延迟时的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。



































