共分析 27 篇论文


⚡ 今日概览

✅ 筛选入选 27 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#全双工语音交互3 篇███
#语音可懂度评估2 篇██
#语音合成2 篇██
#说话人分离标注2 篇██
#音乐生成2 篇██
#文本到语音1 篇█
#语音分离1 篇█
#语音唤醒1 篇█

📊 论文评分排行榜(27 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇SteerDuplex: Steerable Duplex Speech Dialogue Models8.5前25%模型报告#全双工语音交互
🥈AlignDPO: Preference-Gated Alignment for Reducing…8.4前25%方法研究#文本到语音
🥉A Device to Control and Manipulate Occlusion Effects…8.1前25%系统技术报告#语音质量评估
4.DriftSE: Speech Enhancement with Generative Drifting8.0前25%方法研究#语音增强
5.PhaseGAN: High-Fidelity Vocoder via Decoupled…7.8前25%方法研究#语音合成
6.VoxTubeS: Distributable Speaker-Anonymized Synthetic…7.7前25%数据集与基准#说话人匿名化
7.Overview and Meta-Analysis of DCASE 2026 Challenge…7.7前25%数据集与基准#音频检索
8.Real-Time Music Source Separation on a Low-Power Audio…7.5前25%系统技术报告#音乐源分离
9.Neural Multichannel Distant Speaker Diarization with…7.4前50%方法研究#说话人分离标注
10.StepAudio 3 Gen Technical Report7.3前50%模型报告#音频生成
11.Kraken: LLM-based Speech-to-Speech Translation via Low…7.2前50%模型报告#语音翻译
12.MP-Bench: Evaluating Voice Agents as a Multiparty…7.2前50%数据集与基准#语音对话系统
13.Unlabeled Echoes: Pseudo-Labels and Genus-Aware…7.1前50%方法研究#音频分类
14.DiffSynth-Music: Audio-Conditioned KV-Cache Adapters…7.1前50%模型报告#音乐生成
15.CMA-OT: Hierarchical Expert Supervision for Dance-to…6.9前50%方法研究#音乐生成
16.TokenMapper: A Step Toward Interoperable Speech Token…6.8前50%方法研究#语音编码
17.What Did the MLLM Hear? Token-Level Spectro-Temporal…6.8前50%方法研究#音频字幕生成
18.Continue, Adapt, or Yield: In-Turn Adaptation to…6.7前50%数据集与基准#全双工语音交互
19.Direct Preference Density Alignment for Conversational…6.6前50%方法研究#音频交互
20.X-Pred MeanFlow for Streaming Token-to-Mel Speech…6.6前50%方法研究#语音合成
21.Not All Speech Is Intent: Adaptive Self-Correcting…6.3前50%系统技术报告#语音唤醒
22.DuplexDrama: A Synthesized Dialogue Dataset with…6.1前50%数据集与基准#全双工语音交互
23.Quantifying Consonant Contributions to Word…5.9前50%方法研究#语音可懂度评估
24.What Counts as a Mistake? Annotating Recitation Events…5.8前50%数据集与基准#音频事件检测
25.Objective Intelligibility Prediction Using Distance…5.8前50%方法研究#语音可懂度评估
26.Location-based Training with Complementary Folded…5.6前50%方法研究#语音分离
27.Audiovisual diarization of overlapping click trains in…5.5前50%应用研究#说话人分离标注

📋 论文列表

🥇 可操控的全双工对话:在会说话的同时听懂指令与保住话轮

英文题目:SteerDuplex: Steerable Duplex Speech Dialogue Models

标签:#全双工语音交互 | #强化学习 | #基准测试 | #语音

评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Utkarsh Tyagi:Equal contribution. Project lead.
  • Ramaneswaran Selvakumar:Equal contribution. Project lead.
  • Advait Gosai:Equal contribution. Project lead.;Scale AI
  • Sonal Kumar:Equal contribution. Project lead.;University of Maryland
  • Nikhil Barhate:Equal contribution. Project lead.;Scale AI
  • Isabell Sagar:Equal contribution. Project lead.;Scale AI
  • Steven Li:Equal contribution. Project lead.;Scale AI
  • Miheer Bavare:Equal contribution. Project lead.;Scale AI
  • Daniel Quigley:Equal contribution. Project lead.;Scale AI
  • Fabiola Tapia Carrillo:Equal contribution. Project lead.;Scale AI
  • Jose M Patron E:Equal contribution. Project lead.;Scale AI
  • Diego Macías Gutiérrez:Equal contribution. Project lead.;Scale AI
  • Paul Song:Equal contribution. Project lead.;Scale AI
  • Ramani Duraiswami:Equal contribution. Project lead.;University of Maryland
  • Dinesh Manocha:Equal contribution. Project lead.;University of Maryland
  • Yunzhong He:Equal contribution. Project lead.;Scale AI

📌 核心摘要

全双工语音对话需在双通道同时监听与发声下完成内容作答、韵律交付与抢话管理,仅看文本转录无法评判语气人设语速与打断时机。方法链分三步:先在Moshi骨干上做掩蔽系统提示的监督微调以建立指令跟随与发声能力,其交互窗口采样进入分组解耦归一化策略优化,第一阶段以连续性约束抑制短答刷分,第二阶段追加延续奖励以穿过噪声与听众反信道。相对已有方法的关键差异是将内容裁判与声学有效性及时序可验证奖励解耦归一化并显式奖励持续说话,避免用短答或沉默换取时序得分,具有维持回答完整性的实际意义。在SteerBench基准下,SteerDuplex的Audio APR指标为65.10%,高于Moshi的Audio APR指标20.55%。强化学习进一步将源清洁中断响应与合成停顿抢话等交互行为优化,但部分聚合任务得分基本持平且存在过早让出话轮的权衡。结论适用边界受限于受控英语单轮操控与所用裁判协议,尚未验证多语言方言长期个性化与真实部署安全。训练成本方面监督阶段使用80张H100硬件完成3600步训练,报告约194.8卡时的两阶段RL区间算力,推理开销与部署吞吐仍需结合流式架构评估。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥈 对齐不必最锐:用偏好门控把 CTC 约束放进 DPO

英文题目:AlignDPO: Preference-Gated Alignment for Reducing Hallucination in Decoder-Only TTS

标签:#文本到语音 | #偏好优化 | #CTC | #后训练 | #语音

评分:8.4/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Xiao Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Oisín Turbitt:机构信息未在 arXiv HTML 中可靠披露
  • Kit Bower-Morris:机构信息未在 arXiv HTML 中可靠披露
  • Jonathan Carlton:机构信息未在 arXiv HTML 中可靠披露
  • Jamie Stacey:机构信息未在 arXiv HTML 中可靠披露
  • Kris Y. Hong:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

解码器自回归文本到语音合成以语音提示与目标文本拼接序列为输入,输出单码本声学词元序列,弱文本语音对齐导致漏读复读与虚构等内容幻觉是主要难点。先以长度归一化联接时序分类负对数似然扫描全部注意力头并选出单调对齐头,其输出的头集合直接作为后续正则目标进入下一步。再以全自动管线多采样生成候选并经词错误率、说话人相似度与外部对齐信号帕累托排序构造偏好对,选出的正负样本对为偏好优化提供训练数据。最后从原始主干单次优化得到目标模型,在直接偏好优化目标上叠加仅作用于正样本的轻量联接时序分类对齐项且不改架构与解码路径。相对已有方法,关键差异是将单一对齐准则门控于偏好内而非均匀施加或在解码时外部约束,使适度锐化得以保持而避免过锐失稳。在Seed-TTS-Eval英语706句评测设置下,DPO+M的WER为0.052,低于DPO的WER 0.070。该结论适用边界为仅在530M自训主干、WavTokenizer单码本与英语语料上验证,过锐初始化无法挽回且在硬集上二值检测饱和仍依赖词错误率判断,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥉 先消掉空气声、再用滤波器重放:可独立控制堵塞增益与插入损失的耳罩装置

英文题目:A Device to Control and Manipulate Occlusion Effects for Own Voice Perception Studies

标签:#语音质量评估 | #信号处理 | #语音 | #实时处理 | #言语感知

评分:8.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Rouben Rehman:Institute for Hearing Technology and Acoustics, RWTH Aachen University, Aachen, Germany
  • Simon Kersten:Institute for Hearing Technology and Acoustics, RWTH Aachen University, Aachen, Germany
  • Aron Schliep:Institute for Hearing Technology and Acoustics, RWTH Aachen University, Aachen, Germany
  • Janina Fels:Institute for Hearing Technology and Acoustics, RWTH Aachen University, Aachen, Germany

📌 核心摘要

自身语音堵塞效应难复现在于插入损失衰减气导与堵塞增益放大骨导至外耳分量相互叠加且个体差异大,任务输入为口前参考声压与目标堵塞曲线、输出为耳罩内换能器实时重放至鼓膜的目标声压,需独立调控两者而非整体复现。方法链第一步以大体积耳罩被动隔离气导并以大空腔逼近开放耳辐射阻抗,其残余泄漏与负载阻抗决定开放耳近似是否成立。第二步在人工头上测量口耳传递与口前麦克风至换能器的电声传递,并经阻抗对比给出固有增益上界,该上界输出直接作为第三步可忽略骨导外耳分量的判据。第三步由目标堵塞效应推导目标传递函数,再经正则化最小二乘求解预计算滤波器并实时馈入口前信号,实现任意插入损失与堵塞增益组合的重放。与深入耳道的耳塞式主动消除或超材料耳塞不同,该方案不封堵耳道而以可穿戴体积匹配负载阻抗,从而将插入损失与堵塞增益解耦为可独立设定的滤波目标。在人工头负载阻抗评测条件下,耳罩在100 Hz处的增益指标为8.7 dB,高于155 Hz以上条件的增益指标0 dB。适用边界是低频残余增益与高频高阶模态方差受限,基频低于110 Hz的深嗓音需筛除,实时链路延迟约6.5 ms且滤波运行于桌面PC硬件。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


4. 只漂移分布不对齐波形:DriftSE 为何要用语义加声学双潜空间做一步增强

英文题目:DriftSE: Speech Enhancement with Generative Drifting

标签:#语音增强 | #生成模型 | #去混响 | #严格因果 | #高效推理

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Liang Xu:Victoria University of Wellington, New Zealand
  • Diego Caviedes-Nozal:机构信息未在 arXiv HTML 中可靠披露
  • W. Bastiaan Kleijn:Victoria University of Wellington, New Zealand
  • Longfei Felix Yan:机构信息未在 arXiv HTML 中可靠披露
  • Rasmus Kongsgaard Olsson:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音增强需从加性噪声与卷积混响退化的频谱中恢复可懂且自然的复谱语音,而回归目标易致过平滑伪影且迭代分数模型需数十步采样。先由映射网络拼接退化STFT观测与缩放高斯噪声,负责单步映射并输出复谱初估计,该初估计直接作为后续潜编码的输入。再将该初估计与干净语音送入冻结的语义与声学编码器,负责解耦抽取帧级潜表示并输出两类潜特征,供漂移场计算使用。接着在各潜空间内以多尺度指数核计算核加权均值漂移场,负责将生成与干净样本的亲和差异转化为牵引目标并输出向量场。最后以多潜空间漂移损失联合优化生成器,负责回传梯度使生成分布向干净流形均衡并输出更新后的增强模型。与依赖时间条件教师分数差的扩散蒸馏不同,该方法直接从干净与生成样本估计高斯核下分数差并支持非配对帧池化对齐,从而将目标从样本记忆转向分布泛化。在EARS-REVERB离线去混响评测设置下,NCSN++双潜DriftSE的WER为8.91%,低于FM-Euler5的WER 11.40%。该结论适用边界受限于配对语义锚点,纯声学潜或完全非配对训练会出现内容幻觉与词错误率骤升,跨语种与极端混响场景尚未验证;其推理开销仅需1次函数评估的单步生成,离线与因果TF-GridNet变体分别以1.69M与1.24M参数实现32 ms算法延迟。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


5. 先补幅度再造相位:PhaseGAN 用两套办法解耦声码器重建

英文题目:PhaseGAN: High-Fidelity Vocoder via Decoupled Amplitude and GAN-Driven Phase Reconstruction

标签:#语音合成 | #生成对抗网络 | #语音 | #高效推理

评分:7.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Wenzheng Zhang:College of Computer Science, Inner Mongolia University, China
  • Xueliang Zhang:College of Computer Science, Inner Mongolia University, China
  • Shulin He:College of Computer Science, Inner Mongolia University, China
  • Fei Zhao:College of Computer Science, Inner Mongolia University, China
  • Xin Liu:College of Computer Science, Inner Mongolia University, China
  • Pengjie Shen:College of Computer Science, Inner Mongolia University, China
  • Zhenlong Guo:College of Computer Science, Inner Mongolia University, China
  • Zixuan Xue:College of Computer Science, Inner Mongolia University, China
  • Hongtao Bao:College of Computer Science, Inner Mongolia University, China
  • Zixuan Li:College of Computer Science, Inner Mongolia University, China

📌 核心摘要

语音声码器需由80维梅尔谱重建波形,其中振幅谱近似插值任务而相位谱无输入线索且呈一对多映射,这是伪影与低效的根源。PhaseGAN采用梅尔到振幅到相位的流水线,先经梅尔滤波器组伪逆插值到线性频轴,再由原位倒谱卷积循环网络回归振幅谱。接着以估计振幅为条件,由同族生成器经伪实虚分支合成包裹相位,最后经逆短时傅里叶变换重叠相加重建波形。全程不使用标签相位,仅用相对论配对对抗损失加多分辨率短时傅里叶变换损失与零中心梯度惩罚约束波形级一致性,从而将相位重建与振幅回归解耦并降低建模负担。在LJSpeech测试集下,PhaseGAN的WB-PESQ为3.926,高于HiFi-GAN的WB-PESQ 3.574。该结论适用边界受限于22.05 kHz英语朗读训练,尚未验证噪声、混响与多语言文本到语音流水线下的稳定性,零样本歌声外推仅有客观指标与小规模主观试听支撑。标准版参数量为1.63M、计算量为6.42G,轻量版参数量为0.54M、计算量为1.05G,训练轮次与硬件延迟细节原文披露有限。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


6. 强匿名反而练不出好模型?VoxTubeS 用七个对齐版本标定隐私与可用的边界

英文题目:VoxTubeS: Distributable Speaker-Anonymized Synthetic Speech Corpora and Their Analysis

标签:#说话人匿名化 | #数据集构建 | #说话人验证 | #隐私保护 | #数据集

评分:7.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Zhe Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Yexin Lu:机构信息未在 arXiv HTML 中可靠披露
  • Junichi Yamagishi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为含环境声的野外英语语音及其说话人划分,输出为可再分发的匿名化合成语料,难点在于语音生物特征难以剥离且聚合多句后残留身份仍可被链接。方法链分三步:先用Whisper large-v3转录并过滤得到1292167句、1511人的英文子集,再分别经正交变换、潜空间混合与负向引导合成三族七变体生成匿名语音并保留环境声,最后在各变体上独立训练说话人验证模型并联合评测隐私与效用。与VoicePrivacy单句评测相比,关键机制差异是引入会话级可链接性与可分离性及说话人空间有效秩分析,并提出带说话人一致性训练的声码器与负分类器无关引导可控合成。下游评测显示OHNN-BigVGAN-SC在VoxCeleb1-O上等错误率为12.40%,接近OHNN-HiFiGAN的12.32%,而其30句会话链接率降至0.025,明显低于前者的0.054。结论仅适用于英语过滤子集与ECAPA攻击者假设,跨编码器、跨语言与真实人工转录下的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


7. 长音频里按文字找片段:对齐要准,时间也要准

英文题目:Overview and Meta-Analysis of DCASE 2026 Challenge Task 6: Audio Moment Retrieval from Long Audio

标签:#音频检索 | #基准设计 | #长音频处理 | #多模态学习 | #Transformer

评分:7.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Hokuto Munakata:机构信息未在 arXiv HTML 中可靠披露
  • Tatsuya Komatsu:机构信息未在 arXiv HTML 中可靠披露
  • Keisuke Imoto:机构信息未在 arXiv HTML 中可靠披露
  • Taichi Nishimura:机构信息未在 arXiv HTML 中可靠披露
  • Huang Xie:机构信息未在 arXiv HTML 中可靠披露
  • Tuomas Virtanen:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频时刻检索(Audio Moment Retrieval,AMR)以数分钟长录音与自由文本查询为输入,输出与查询语义匹配的一个或多个起止时间戳,难点在于开放词汇对齐、长程时序建模与标注稀缺下的精确边界定位。基线链条分两步推进:先由预训练MS-CLAP 2023将滑动窗音频帧与查询文本映射到共享嵌入空间以获得跨模态对齐特征,再由适配自视频矩检索的QD-DETR编码器对音频序列做查询条件化上下文建模,并由解码器以可学习矩查询回归中心宽度与置信度,最后按置信度排序输出首位时刻参与主要评测。与片段级检索和封闭集事件检测相比,该范式直接回归连续区间并用交并比(Intersection over Union,IoU)衡量定位质量,更贴近档案导航需求。在100条录音与177条查询构成的隐藏评测集上,前三名系统主要指标Recall1@0.7同为48.59%,约为基线13.56%的3.5倍,显示强特征与强检测器叠加校准可大幅改善长音频定位。该结论仅适用于1分钟至5分钟英语YouTube类场景且依赖人工时刻标注分布,合成预训练向真实迁移仍需真实验证集筛选。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


8. 装得进低功耗音频芯片的实时音乐分离:预算先行,深滤波补精度

英文题目:Real-Time Music Source Separation on a Low-Power Audio DSP

标签:#音乐源分离 | #CNN | #流式处理 | #端侧运行 | #高效推理

评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.5/1.5

排名:前25% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Jianan Li:机构信息未在 arXiv HTML 中可靠披露
  • Li Liu:机构信息未在 arXiv HTML 中可靠披露
  • Ken Malsky:机构信息未在 arXiv HTML 中可靠披露
  • Gabby Yi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

实时音乐源分离需从44.1 kHz立体声混合输入逐帧输出人声、鼓、贝斯与其他四路波形,难点在于四路相关输出与逐茎波形重建在低功耗音频DSP上同时受片上内存与单帧截止期约束。所提系统先以因果时频卷积加时分布全连接U-Net对384个子带估计复数比掩膜得到第一路波形估计,该掩膜输出进入逆变换前的加权混合节点等待融合。接着门控深度滤波头从同一隐特征预测逐时频点复数有限脉冲响应抽头与门控值,滤波器直接作用于混合频谱得到第二路估计,两路估计按门控加权混合后经逆短时傅里叶变换输出,并由带内顶部估计的高频带增益重建16.5至22.05 kHz。与已有实时系统的关键差异在于以连续上下文训练消除块填充与流式缓存间分布失配,并以过去与未来抽头分配将附加延迟显式设为11.6毫秒整数倍。在MUSDB18-HQ测试集下,部署模型的cSDR指标为4.70 dB,低于RT-STT的cSDR指标5.17 dB。该结论适用边界为同类音频DSP与23毫秒窗工作点,跨语料泛化与整数量化精度尚未验证。部署模型以手排浮点帧循环在器件上实测10.43毫秒满足11.6毫秒延迟约束,训练成本为单张T4上连续段前向训练。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


9. 把高斯方差换成重尾假设,远场多人日志为何更稳

英文题目:Neural Multichannel Distant Speaker Diarization with Heavy-tailed Source Separation Model

标签:#说话人分离标注 | #变分自编码器 | #麦克风阵列 | #语音 | #会议转录

评分:7.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Sicheng Mao:LTCI, Telecom Paris, Institut Polytechnique Paris, France SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University, China LIUM, Le Mans University, France
  • Baihan Li:LTCI, Telecom Paris, Institut Polytechnique Paris, France SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University, China LIUM, Le Mans University, France
  • Mathieu Fontaine:LTCI, Telecom Paris, Institut Polytechnique Paris, France SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University, China LIUM, Le Mans University, France
  • Anthony Larcher:LTCI, Telecom Paris, Institut Polytechnique Paris, France SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University, China LIUM, Le Mans University, France
  • Roland Badeau:LTCI, Telecom Paris, Institut Polytechnique Paris, France SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University, China LIUM, Le Mans University, France

📌 核心摘要

远距离说话人分离标注(Speaker Diarization,SD)以多通道混合录音为输入,输出每时刻说话人活动标签,难点在于混响与噪声、说话人数可变及大动态范围重叠语音。方法沿用神经FCASA的联合分离与标注链路:推理网络从混合频谱估计潜谱特征与活动Logits,再经迭代源导向(Iterative Source Steering,ISS)求解联合对角化投影矩阵与对角系数,接着由深度网络生成各源功率谱密度并组装空间协方差,最后以多通道维纳滤波完成分离并阈值化得到标注。与原高斯方差建模的关键差异在于引入高斯尺度混合(Gaussian Scale Mixture,GSM)冲激变量,边缘化后得到广义高斯与学生t重尾似然,使大能量时频点不被过度惩罚。在AMI评测集Full口径下学生t模型将说话人分离标注错误率(Diarization Error Rate,DER)由18.73%降至16.01%,在CHiME-6上相对改善更显著。该结论限于10秒分块推理与固定源数假设,跨语料与运动声源下泛化明显下降。原文未披露训练、推理或部署成本,也因无干净单源真值而未评估分离指标。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


10. 离散自回归统一音频生成:以首层码本规划与残差声学补全分工控制干扰

英文题目:StepAudio 3 Gen Technical Report

标签:#音频生成 | #自回归模型 | #向量量化 | #统一音频模型

评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Bin Lin:机构信息未在 arXiv HTML 中可靠披露
  • Bo Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Boyang Wang:机构信息未在 arXiv HTML 中可靠披露
  • Boyang Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Boyong Wu:机构信息未在 arXiv HTML 中可靠披露
  • Chao Yan:机构信息未在 arXiv HTML 中可靠披露
  • Chen Geng:机构信息未在 arXiv HTML 中可靠披露
  • Chen Wu:机构信息未在 arXiv HTML 中可靠披露
  • Cheng Yi:机构信息未在 arXiv HTML 中可靠披露
  • Chengli Feng:机构信息未在 arXiv HTML 中可靠披露
  • Chenglin Zhu:机构信息未在 arXiv HTML 中可靠披露
  • DanNi Wan:机构信息未在 arXiv HTML 中可靠披露
  • Daxin Jiang:机构信息未在 arXiv HTML 中可靠披露
  • Dongqing Pang:机构信息未在 arXiv HTML 中可靠披露
  • Fei Tian:机构信息未在 arXiv HTML 中可靠披露
  • Feng Tian:机构信息未在 arXiv HTML 中可靠披露
  • Future Li:机构信息未在 arXiv HTML 中可靠披露
  • Gang Yu:机构信息未在 arXiv HTML 中可靠披露
  • Guanglong Yang:机构信息未在 arXiv HTML 中可靠披露
  • Jia Peng:机构信息未在 arXiv HTML 中可靠披露
  • Jiahao Song:机构信息未在 arXiv HTML 中可靠披露
  • Jiamin Fan:机构信息未在 arXiv HTML 中可靠披露
  • Jiangjie Zhen:机构信息未在 arXiv HTML 中可靠披露
  • Jianzheng Gao:机构信息未在 arXiv HTML 中可靠披露
  • Jun Chen:机构信息未在 arXiv HTML 中可靠披露
  • Li Xie:机构信息未在 arXiv HTML 中可靠披露
  • Lifang Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Lingli Ji:机构信息未在 arXiv HTML 中可靠披露
  • Liying Shi:机构信息未在 arXiv HTML 中可靠披露
  • Lun Cai:机构信息未在 arXiv HTML 中可靠披露
  • Min Xu:机构信息未在 arXiv HTML 中可靠披露
  • Na Wang:机构信息未在 arXiv HTML 中可靠披露
  • Peilin Li:机构信息未在 arXiv HTML 中可靠披露
  • Peng Yang:机构信息未在 arXiv HTML 中可靠披露
  • Pengfei Tan:机构信息未在 arXiv HTML 中可靠披露
  • Qingjian Lin:机构信息未在 arXiv HTML 中可靠披露
  • Ruijie Xiong:机构信息未在 arXiv HTML 中可靠披露
  • Runze Li:机构信息未在 arXiv HTML 中可靠披露
  • Shenghua Hu:机构信息未在 arXiv HTML 中可靠披露
  • Shi Qiu:机构信息未在 arXiv HTML 中可靠披露
  • Siqi Tu:机构信息未在 arXiv HTML 中可靠披露
  • Siyi Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Tianjiao Deng:机构信息未在 arXiv HTML 中可靠披露
  • Wanying Lu:机构信息未在 arXiv HTML 中可靠披露
  • Weiming Niu:机构信息未在 arXiv HTML 中可靠披露
  • Wen Sun:机构信息未在 arXiv HTML 中可靠披露
  • WenWen Qu:机构信息未在 arXiv HTML 中可靠披露
  • Xiangyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Xianwei Zhang:机构信息未在 arXiv HTML 中可靠披露
  • XiaoSu Su:机构信息未在 arXiv HTML 中可靠披露
  • Xing Chen:机构信息未在 arXiv HTML 中可靠披露
  • Xinyu Liu:机构信息未在 arXiv HTML 中可靠披露
  • Xuerui Yang:机构信息未在 arXiv HTML 中可靠披露
  • Yang Li:机构信息未在 arXiv HTML 中可靠披露
  • Yang Yang:机构信息未在 arXiv HTML 中可靠披露
  • Yechang Huang:机构信息未在 arXiv HTML 中可靠披露
  • Yibo Zhu:机构信息未在 arXiv HTML 中可靠披露
  • Yifan Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Yiyang Xu:机构信息未在 arXiv HTML 中可靠披露
  • Yu Fu:机构信息未在 arXiv HTML 中可靠披露
  • Yu Luo:机构信息未在 arXiv HTML 中可靠披露
  • Yu Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Yumang Wang:机构信息未在 arXiv HTML 中可靠披露
  • Yunzhou Ju:机构信息未在 arXiv HTML 中可靠披露
  • Yuxiang Yang:机构信息未在 arXiv HTML 中可靠披露
  • Zekai Liu:机构信息未在 arXiv HTML 中可靠披露
  • Zengwei Yao:机构信息未在 arXiv HTML 中可靠披露
  • Zhenwei Mou:机构信息未在 arXiv HTML 中可靠披露
  • Zheqi Dai:机构信息未在 arXiv HTML 中可靠披露
  • Zhiyue Wu:机构信息未在 arXiv HTML 中可靠披露
  • Zichao Zhou:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该任务以文本指令为输入,统一生成语音、歌声、音乐、音效及多类型混音为输出,实际难点在于多域声学特性差异大,且引入音频建模时易干扰预训练大语言模型的文本知识与推理能力。StepAudio Tokenizer先将24kHz波形与冻结自监督语义特征联合量化为12.5Hz共享16层残差向量量化码流,使每层同时携带语义与声学信息。其输出的首层码本作为粗粒度序列连同文本进入大语言模型主干,沿时间轴自回归预测语义与韵律规划,主干隐状态再连同首层码进入轻量因果变换器沿码本轴补全其余十五层残差码本,最后由全因果解码器直接由完整码流重建波形。相对连续隐空间加扩散或流匹配声码器的统一音频路线,该全离散自回归省去连续声学渲染器并以共享表示跨域建模,降低了多流水线割裂与模态干扰。在AISHELL-1测试集下,带RVQ Adaptor系统的CER为3.00%,低于无RVQ Adaptor系统的CER 5.25%。其结论受限于音乐与复杂混音场景仍缺乏公开客观基准的充分验证,向长时程音乐结构与高密度混音的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


11. 低码率单层量化加双路源语音条件:Kraken 如何让大模型直接说译文

英文题目:Kraken: LLM-based Speech-to-Speech Translation via Low-bitrate VQ and Dual-path Source Conditioning

标签:#语音翻译 | #向量量化 | #生成对抗网络 | #多语言 | #语音

评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Hayato Futami:Sony Group Corporation
  • Hassan Shahmohammadi:Sony Europe Limited
  • Tushar Dhyani:Sony Europe Limited
  • Alkis Koudounas:Sony Group Corporation
  • Raphaël Lafargue:Sony Europe Limited
  • Yosuke Kashiwagi:Sony Group Corporation
  • Quentin Jodelet:Sony Group Corporation
  • Emiru Tsunoo:Sony Group Corporation

📌 核心摘要

语音到语音翻译需将源语言语音直接转为目标语言语音并保留说话人身份与韵律,难点在于高码率语音标记预测开销大且表达性迁移依赖说话人与韵律严格对齐的双语数据。Kraken先以微调过的W2v-BERT 2.0连续编码器抽取源语音特征并经适配器降采样送入Qwen3-8B大语言模型。大语言模型以思维链依次生成源转录、目标译文与单层向量量化低码率离散语音标记,重建自监督语义嵌入以保持可懂度。离散标记再送入以源语音为条件的GAN声码器Autowave-X合成波形,并经迭代精修模块提升音质,源语音条件同时作用于语言模型与声码器以实现双路迁移。相对多层残差量化与自回归编解码语言模型方案,该设计以单层语义向量量化降低序列长度与架构复杂度,以一步推理声码器替代编解码语言模型并放宽对平行表达数据的要求。在CVSS X-En S2ST评测下,Kraken的ASR-BLEU为43.5,高于Qwen3-Omni的ASR-BLEU 40.9。其结论适用边界受限于仅验证X到英语离线翻译,尚未验证英语到外语、非英语互译与流式同传及强噪声与儿童及低资源口音下的稳定性。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


12. 多人对话里该说还是该静:MP-Bench 把轮次感知拆成可核对的行为题

英文题目:MP-Bench: Evaluating Voice Agents as a Multiparty Conversation Participant

标签:#语音对话系统 | #基准设计 | #轮次切换 | #音频问答 | #基准测试

评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Yi-Jen Shih:The University of Texas at Austin
  • Shih-Yun Shan Kuan:National Taiwan University
  • Guan-Ting Lin:National Taiwan University
  • Kai-Wei Chang:Massachusetts Institute of Technology
  • Siddhant Arora:Carnegie Mellon University
  • Shu-wen Yang:National Taiwan University
  • Abdelrahman Mohamed:机构信息未在 arXiv HTML 中可靠披露
  • Shinji Watanabe:Carnegie Mellon University
  • Hung-yi Lee:National Taiwan University
  • David Harwath:The University of Texas at Austin

📌 核心摘要

多方对话评测输入为三人预录争论与轮次游戏的连续音频,输出要求智能体在每一步判断应说还是沉默并生成可播报语音回应,难点在于说话人归属、称呼指代与隐式轮次规则需联合声学线索与对话语境推断,纯文本转写难以还原。构建链先由大语言模型按话题与角色模板生成文本对话并标注称呼与指代,其输出进入ElevenLabs多音色合成得到四人会话音频,再经双条件可解性过滤与人工核验派生理解问答与行为决策任务,最后以流式语音识别检测发声起点并用GPT-5评判语义恰当性。与被动理解基准的关键机制差异在于把轮次切换作为可客观计分的行为维度,使沉默与抢话错误直接计入指标,具有指导全双工打断与延迟权衡的实际意义。消融进一步表明单人规则游戏易解而多说话人时崩塌,且多方提示难以挽回,指向声学归因而非规则遵循缺失。在Turn-Based Game任务评测下,SpkD-ASR配置的轮次准确率为98.44,高于ASR-only配置的轮次准确率49.22。该结论适用边界受限于四人洁净合成语音与单决策点评估,失败条件包括重叠语音、背景噪声与多轮闯入等尚未验证的外推范围。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


13. 标签不够时让模型自己补课:伪标签与同属平滑的蝙蝠叫声识别

英文题目:Unlabeled Echoes: Pseudo-Labels and Genus-Aware Smoothing for Bat Call Recognition

标签:#音频分类 | #半监督学习 | #生物声学监测 | #低资源

评分:7.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Frank Fundel:Ludwig-Maximilians-Universität München, Germany
  • Alexandra Howard:University of the Free State, Department of Zoology and Entomology, Qwaqwa Campus, South Africa

📌 核心摘要

被动声学监测输入为超声时频谱表示,输出为多标签物种概率,难点在于种内变异大而种间声学重叠严重,且专家标注稀缺难以随布设规模扩展。本文先以少量人工标注训练紧凑型生物声学Transformer得到初始检查点,为后续半监督学习提供可靠起点。接着将当前模型在线预测转为硬伪标签,并与人工标注批次交替自训练,使海量无标注录音直接在输出空间扩充监督。与表征预训练和一致性正则相比,该链条不优化代理表示而直接生成任务目标,属级平滑则把不确定质量集中于同属物种,注入生物学结构而无需额外标注。在Skiba语料10%标注评测设置下,伪标签方法的物种宏平均F1为73.45%,高于10%基线的物种宏平均F1 62.47%。属感知平滑与均匀平滑组合进一步提升弱势物种性能,验证了目标构造的互补价值。上述结论适用边界受限于固定紧凑骨干、封闭物种词表与欧洲及南非两个地理池,野外未知类群与自然重叠声仍可能失败,尚未验证开放集与跨设备泛化,需置信度校验与专家复核。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


14. 用一次算好的键值记忆,给冻结的音乐大模型加上可组合的音频控制

英文题目:DiffSynth-Music: Audio-Conditioned KV-Cache Adapters for Controllable Music Generation

标签:#音乐生成 | #Adapter | #流匹配 | #音乐

评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Zhongjie Duan:Alibaba Group Shanghai Jiao Tong University
  • Shengchuan Gao:Alibaba Group Shanghai Jiao Tong University
  • Hong Zhang:Alibaba Group Shanghai Jiao Tong University
  • Yingda Chen:Alibaba Group Shanghai Jiao Tong University

📌 核心摘要

文本与歌词能规定风格与字词,难以规定节拍时刻、声乐旋律走向与演绎细节,而音频信号可直接携带时变与音色线索,如何将其组合注入冻结生成主干又不损害音乐质量是实际难点。先由共享变分自编码器接收目标与各类控制波形,将其映射到同一潜空间,输出统一控制潜变量以供注意力记忆使用。再由三套主干扩散变换器初始化的模板接收上述控制潜变量并编码为层级键值记忆,输出按固定顺序拼接的组合缓存从而实现多控制组合。最后冻结生成分支接收流状态、文本条件与上述组合缓存,通过拼接注意力读取记忆并做条件流匹配去噪,输出解码为音乐波形,其中模板时间固定在干净端使缓存只需计算一次并在采样中复用。与解耦交叉注意力或残差注入不同,该设计复用主干投影结构并以联合注意力记忆组合节拍、人声、伴奏、韵律与参考控制,支持伴奏加韵律的联合人声替换。在50首MUSDB18-HQ英文与50首私有中文歌曲的单控制评测设置下,DiffSynth-Music的Beat-F1为0.8496,高于ACE-Step-1.5-XL-SFT的Beat-F1 0.3031。该结论适用边界仅为单控制自动指标依从性与自动质量分数基本可比,联合控制效果与人听质量尚未验证,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


15. 稀疏舞蹈线索到稠密音乐之间:用分层专家监督补上中间表示

英文题目:CMA-OT: Hierarchical Expert Supervision for Dance-to-Music Generation

标签:#音乐生成 | #课程学习 | #流匹配 | #音视频

评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jinting Wang:机构信息未在 arXiv HTML 中可靠披露
  • Chenxing Li:机构信息未在 arXiv HTML 中可靠披露
  • Dong Yu:机构信息未在 arXiv HTML 中可靠披露
  • Li Liu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

舞蹈到音乐生成的输入是舞蹈视频与二维姿态序列,输出是与舞蹈节奏风格对齐的音乐波形,难点在于舞蹈仅提供稀疏节奏风格线索,而作曲需要稠密的结构配器与表情动态。该框架先由I3D视觉编码器抽取全局风格特征并由节奏编码器从姿态抽取细粒度时序动态,二者共同条件化基于流匹配的扩散变换器以生成音乐潜变量。接着课程引导的多尺度对齐将上一阶段的条件生成表示依次送入顶层风格、中层旋律与底层节奏的Jukebox专家监督,由粗到细渐进蒸馏并以权重衰减缓解梯度冲突。然后尺度感知的融合Gromov-Wasserstein在每个尺度联合优化特征语义对应与成对时序结构保持,以处理变长与错位并自适应平衡两者权重。与仅监督最终音频或做全局余弦硬匹配的方法不同,该机制在表征层提供结构化软对应而非逐点硬对齐,因而兼顾全局连贯与细粒度同步。在AIST++评测设置下,CMA-OT的F1为99.12,高于Base的F1 97.27。该结论适用边界限于5秒短片段与棚拍及短视频两类分布,更长结构与跨风格泛化尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


16. 不经过波形也能翻译语音令牌:TokenMapper 的同速率跨码本映射

英文题目:TokenMapper: A Step Toward Interoperable Speech Token Translation

标签:#语音编码 | #Transformer | #语音 | #高效推理

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Tal Kozakov:Department of Electrical and Computer Engineering, Ben-Gurion University of the Negev
  • Tal Rosenwein:Department of Electrical and Computer Engineering, Ben-Gurion University of the Negev
  • Eliya Nachmani:Department of Electrical and Computer Engineering, Ben-Gurion University of the Negev

📌 核心摘要

语音神经编解码器将波形离散为词表与码本结构互不兼容的 token 序列,跨模型传递通常需解码为波形再重编码,带来延迟与信息损失。TokenMapper以源分词器对同一语句编码得到的离散矩阵与方向标识为输入,直接输出目标词表 token 序列并由目标解码器重建波形,难点在于单码本与八码本残差结构在共享有效帧率下难以对齐。其方法链分三步衔接:先将词元、位置、码本与方向四种嵌入相加并按码本通道堆叠为统一表示,再由共享 Transformer 编码器沿时间轴建模时序依赖得到上下文表示,最后由方向相关路由函数将其映射为目标码本头输入并经单层 Transformer 输出头逐码本预测目标 token。路由显式区分单到单、单到多、多到单与多到多的广播、注意力池化与拼接操作,避免中间波形合成与重分词。与波形桥接先合成再重分词不同,该机制全程保留在离散域并以方向条件共享编码器加目标专用头实现异构码本互操作,因而能绕过源端合成与目标端重分词。在LibriSpeech test-clean评测设置下,GLM到DualCodec翻译的WER为5.85%,高于DualCodec原生重建的WER 3.29%。该结论适用边界受限于三个英语朗读语音词表、共享帧率与配对同语句监督,异速率、可变速率、音乐或强域偏移尚未验证,且向Moshi等多码本目标恢复残差声学细节是主要失败条件。在NVIDIA RTX 6000 GPU上测得端到端离线传输路径延迟相对波形桥接最高降低94.5%,最大单句节省972.3 ms。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


17. 每个词听到了哪里:把音频大模型的描述逐词钉回时频证据

英文题目:What Did the MLLM Hear? Token-Level Spectro-Temporal Grounding for Audio MLLM Explainability

标签:#音频字幕生成 | #时频分析 | #可解释性 | #音频大模型

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Lucia Cascone:机构信息未在 arXiv HTML 中可靠披露
  • Valeria Fraenza:机构信息未在 arXiv HTML 中可靠披露
  • Michele Nappi:机构信息未在 arXiv HTML 中可靠披露
  • Fabio Narducci:机构信息未在 arXiv HTML 中可靠披露
  • Benedetto Simone:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频多模态大模型以波形与提示为输入生成开放词汇字幕,需为每个内容词元指出时频声学支撑,难点在于多声源时间重叠而频谱分离且证据分散在时频平面。STAG先将多模态预填充末层音频位置隐状态经冻结语言模型头投影到目标词元得分,经截断得到时间轮廓。接着对全长波形做梅尔间隔频带遮挡,在教师强制下测量目标词元概率下降得到频谱轮廓。最后将时间与频谱轮廓外积融合,经高斯平滑与跨词元共享归一化形成词元级时频图,并按事件取最大聚合。与仅给出时间维相关的梯度与注意力基线不同,STAG显式恢复频率支撑并保持词元间相对强度可比,使重叠事件可分。在AudioGrounding基准评测下,Qwen2.5-Omni-3B的指标E为41.97,高于Omni-7B的指标E 41.17。该结论适用边界受限于时间边界评测与可匹配生成事件,对不可分时频交互与未标注频率定位尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


18. 边说边改还是停下让路:全双工智能体如何接住重叠话语

英文题目:Continue, Adapt, or Yield: In-Turn Adaptation to Overlapping Speech in Full-Duplex Agents

标签:#全双工语音交互 | #基准设计 | #语音 | #模型评估

评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Yunqi Lu:机构信息未在 arXiv HTML 中可靠披露
  • Tyler Baumgartner:机构信息未在 arXiv HTML 中可靠披露
  • Nikhil Johri:Besimple AI, San Mateo, CA
  • Brandon Tai:机构信息未在 arXiv HTML 中可靠披露
  • Candice Fan:机构信息未在 arXiv HTML 中可靠披露
  • Luc Debaupte:机构信息未在 arXiv HTML 中可靠披露
  • Ruben Aguilar:机构信息未在 arXiv HTML 中可靠披露
  • Bill Wang:机构信息未在 arXiv HTML 中可靠披露
  • Yi Zhong:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

全双工语音交互的输入是持话者A进行中话语与重叠插入者B同期音频的双通道混合,输出要求在不变继续、带回应的适应与让出话轮三者间抉择,难点在于协作性补全与打断在时间上皆表现为重叠且均触发语音活动,仅靠起止检测无法判断是否需吸纳内容。Duplex Cue先以能量语音活动检测加转写从无脚本英语对话中筛出候选并形成2591条线索库,其输出的切点与转写进入模型复核加人类确认环节以判定听者意图为后通道、协作或打断并保留时序证据与备选判断。前步得到的线索意图与切点再进入条件对话延续,由PersonaPlex在B起始前80ms接管A通道生成延续并与录音参照配对,由评分器对双方回应分别判为继续、适应或让出,其输出的回应分布即为主要评价结果。与仅区分继续或停止的既有榜单不同,该设计把听者意图与说话者回应正交解耦,使保留话轮内的内容吸纳可与话轮交接分开计量,从而避免把答后继续误记为抢话或让出。在66组协作配对条件下,录音人的适应率指标为68.2%,高于PersonaPlex的适应率指标34.8%。该结论适用边界限于英语无脚本对话、单检查点单次生成及双侧活跃可评子集,且协作标签见过回应后才判定,盲标重标与跨模型跨语言外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


19. 不用学奖励模型:用人群密度地形图做对话式均衡的在线探索与离线打磨

英文题目:Direct Preference Density Alignment for Conversational Audio Equalization

标签:#音频交互 | #偏好优化 | #强化学习 | #主观评测 | #大语言模型

评分:6.6/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ioannis Stylianou:Department of Electronic Systems;Aalborg University;Aalborg, Denmark
  • Sven Ewan Shepstone:Bang & Olufsen A/S;Struer, Denmark
  • Jon Francombe:Bang & Olufsen A/S;Struer, Denmark
  • Pablo Martinez Nuevo:Bang & Olufsen A/S;Struer, Denmark
  • Zheng-Hua Tan:Department of Electronic Systems;Aalborg University;Aalborg, Denmark

📌 核心摘要

该任务以自然语言描述为输入,输出Beosonic二维均衡器坐标\(x \in [-6,6]^2\),难点在于主观偏好呈多峰分布且输出必须严格符合坐标格式否则控制失效。方法先以反射核密度估计分别估计偏好与全量提议密度并取比值去采样偏置,经全局归一形成稳定奖励面,同义提示簇共享同一流形以缓解稀疏。上一步的奖励面直接作为环境回报进入下一步,接着用组相对策略优化做在线结构对齐,对非法格式赋负奖励并以组内归一优势保持句法流形。然后以对齐后策略采样并注入网格搜索峰值合成偏好对,构造高精度离线数据集,最后以直接偏好优化做精化以逼近局部偏好峰。与纯离线对比学习只约束静态正负例不同,在线分组采样能对训练中新生格式错误即时惩罚,避免在偏好对之外失控漂移。在OOD评测设置下,混合模型的GMRR指标为0.56,高于Base GRPO的GMRR指标0.53。该结论适用边界限于二维有界均衡空间与文本条件语义,尚未验证高维控制与内容自适应外推。其训练成本为单卡硬件上每模型组相对策略优化约6小时与直接偏好优化约1小时,推理采用贪婪解码与32新词元上限。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


20. 把平均速度换成梅尔预测:少步数与有界上下文如何同进一个解码器

英文题目:X-Pred MeanFlow for Streaming Token-to-Mel Speech Decoding

标签:#语音合成 | #流匹配 | #流式处理 | #高效推理

评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Hanke Xie:机构信息未在 arXiv HTML 中可靠披露
  • Xiaming Ren:机构信息未在 arXiv HTML 中可靠披露
  • Qirui Zhan:机构信息未在 arXiv HTML 中可靠披露
  • Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
  • Wenhao Li:机构信息未在 arXiv HTML 中可靠披露
  • Haoyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Ruonan You:机构信息未在 arXiv HTML 中可靠披露
  • Chengyou Wang:机构信息未在 arXiv HTML 中可靠披露
  • Yunxiang Chen:机构信息未在 arXiv HTML 中可靠披露
  • Houdun Liu:机构信息未在 arXiv HTML 中可靠披露
  • Su Feng:机构信息未在 arXiv HTML 中可靠披露
  • Lei Xie:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

离散语义令牌到梅尔谱的映射需在极少函数求值下恢复音色、韵律与精细频谱结构,同时使分块流式解码的每包计算不随 utterance 增长并保持边界连续。以冻结文本到令牌大模型输出为条件,梅尔谱为目标的可训练声学解码是本文任务,其难点在于采样预算与上下文预算的耦合权衡。方法链首先由扩散变换器主干预测广义梅尔场,该输出直接落在声学空间并作为去噪声学量进入下一步;其次将该预测解析换算为平均速度,承载平均流动力学并执行采样更新;随后经层选择块掩码注意力在固定滑窗内做分块推理,多数层聚焦块内精修而少数层交换历史或有界未来上下文;最后由冻结 HiFi-GAN 声码器将梅尔谱合成为波形。相对直接预测平均速度的已有机制,关键差异在于优化仍在速度空间对齐平均流恒等式,而网络输出参数化在梅尔空间从而获得直接重建目标,其实际意义是加速少步收敛并兼顾有界上下文。在100句未见说话人评测设置下,Base规模X-Pred的UTMOS为3.382,高于Direct-uu基线的UTMOS 3.076。该结论适用边界受限于Emilia语料训练与冻结上下游条件,对噪声、长时对话与可懂度敏感场景尚未验证。流式推理开销方面层选择有界上下文在3次求值下实时因子为0.543且首包与启动延迟为141.0/621.0毫秒,训练成本为2.0M更新预算。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


21. 不是每句被听清的话都是叫你:用事后反馈纠正误唤醒

英文题目:Not All Speech Is Intent: Adaptive Self-Correcting Inference Layer for Post-ASR False Wake-Up

标签:#语音唤醒 | #测试时自适应 | #多模态学习 | #端侧运行 | #语音

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Preeti Saraswat:Samsung Research America, Mountain View, CA, USA
  • Divya Neelagiri:Samsung Research America, Mountain View, CA, USA
  • Anil Yadav:Samsung Research America, Mountain View, CA, USA

📌 核心摘要

误唤醒后处理输入为转写后声学语言与设备上下文融合的多模态特征,需输出有意或无意唤醒判定,难点是语音学相似触发常产生语法语义完整文本使单轮分类无法察觉意图错误。先由基分类器以当前特征向量为输入给出初始意图判定,其判定结果与系统响应进入下一轮观察。再由反馈识别模块以上一轮特征与取消重复迟疑沉默等后交互行为为输入,负责判定疑似假阳性或假阴性误分类类型,其类型输出触发模式归纳。最后由模式归纳与校正模块将确认误分类轮次的声学语言与设备上下文抽象为可复用错误模式存入端侧用户记忆,并在未来推理时检索相关模式作为上下文注入大语言模型校正函数与基判定融合后执行接受或抑制。与仅做同轮设备指向分类的方法不同,该机制以后交互行为作噪声监督形成跨轮记忆在线更新,而不改动基座语音识别与理解参数。在问题标注切片阈值0.90评测设置下,带ASCIL层的模型错误率Perror为25.88%,低于基线模型的错误率Perror 34.23%。该结论适用边界受限于会话内跨轮迁移且依赖较丰富交互历史,冷启动用户与未见用户泛化尚未验证,校正路径在基准硬件上中位增加延迟低于60 ms,端侧仅保留抽象特征签名而不传输原始音频。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


22. 把打断与背景声做成可听的监督:DuplexDrama 四阶段合成管线解读

英文题目:DuplexDrama: A Synthesized Dialogue Dataset with Scenarios, Full-Duplex Behaviors, Expressive Speech, and Sound Events

标签:#全双工语音交互 | #数据集构建 | #语音 | #环境声 | #多语言

评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Qingxiang Guo:机构信息未在 arXiv HTML 中可靠披露
  • Wenke Fan:机构信息未在 arXiv HTML 中可靠披露
  • Shuofeng Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Dawei Yang:机构信息未在 arXiv HTML 中可靠披露
  • Zhiyang Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Yingxin Shang:机构信息未在 arXiv HTML 中可靠披露
  • Hongwei Cai:机构信息未在 arXiv HTML 中可靠披露
  • Zhou Wang:机构信息未在 arXiv HTML 中可靠披露
  • Weixu Wang:机构信息未在 arXiv HTML 中可靠披露
  • Lin Yang:机构信息未在 arXiv HTML 中可靠披露
  • Shuran Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Yang Song:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作面向全双工语音对话训练数据稀缺,输入为人物种子与话题种子,输出为带完整人设场景标注与四轨对齐音频的双人长对话,难点在于同时保证人设场景一致、打断附和与未完成在声学上可实现、情感表达可控且声音事件与叙事语义对齐。管线先由DeepSeek-v4.1-pro从人物与话题宏类抽取种子并扩展为双人人物元组与场景规约,再由Gemini-3.1-pro-preview生成带打断附和未完成、情感与声音事件三族正交标签的口语化剧本,前者输出直接作为后者的人设场景约束进入生成。接着用IndexTTS2以说话人提示音频与情感标签联合合成逐句语音,经强制对齐得词级时间戳后组装为双人平行长轨并将行为标签编译为淡出重叠与叠加操作,最后依据触发词起点按可配置信噪比混入环境噪声与声音事件形成配对背景轨。与自然语料有重叠无剧本、合成语料有人设无全双工不同,该方案把行为标签编译为声学操作,把事件标签锚定到词级起点,使剧本语义可直接监督双工建模。在干净与混合音频对比条件下,混合音频的NISQA-MOS为3.18,低于干净语音的NISQA-MOS 3.65。该结论适用边界受限于受控合成分布与中英双语发布子集,尚未验证真实噪声与更稠密打断下的外推性能。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


23. 把一个辅音静音后单词还认得出来吗:用声学掩蔽给辅音贡献排序

英文题目:Quantifying Consonant Contributions to Word Intelligibility via Acoustic Masking

标签:#语音可懂度评估 | #评测协议 | #语音 | #多语言 | #语音学与音系

评分:5.9/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Eunjung Yeo:University of Texas at Austin, USA, Arizona State University, USA, Carnegie Mellon University, USA
  • Kwanghee Choi:University of Texas at Austin, USA, Arizona State University, USA, Carnegie Mellon University, USA
  • Krupaben Kothadia:University of Texas at Austin, USA, Arizona State University, USA, Carnegie Mellon University, USA
  • Visar Berisha:University of Texas at Austin, USA, Arizona State University, USA, Carnegie Mellon University, USA
  • Julie M. Liss:University of Texas at Austin, USA, Arizona State University, USA, Carnegie Mellon University, USA
  • David R. Mortensen:University of Texas at Austin, USA, Arizona State University, USA, Carnegie Mellon University, USA
  • David Harwath:University of Texas at Austin, USA, Arizona State University, USA, Carnegie Mellon University, USA

📌 核心摘要

运动性言语障碍干预时间有限,需将孤立词语音映射为辅音级可懂度贡献排序,难点在于感知实验难以覆盖全辅音库与多语言音系差异。方法链分三步:先强制对齐并裁出孤立词建立基线可识别集,其输出的正确词作为后续掩蔽试验集合;再逐个将目标辅音区间静音掩蔽并用多语言识别器独立重识,其输出的误识判定进入聚合;最后按音位聚合误识比例得到掩蔽诱发误识率并与音位频率和功能负载做偏秩相关验证。与已有功能重要性框架相比,该方法不依赖人工听音而直接测量声学缺失后的词内可恢复性,并以孤立词解码排除句级上下文补偿,因而可在多语言间复用同一流程。在跨语言共享辅音评测下,英英TIMIT与CV-en配对的Spearman相关指标为0.80,高于西班牙语与其他语料最低配对的Spearman相关指标0.63。该结论适用边界仅为典型语音上的语言级先验,尚未验证病理语音与人类听者判断的一致性。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


24. 什么算错?把背诵转写差异分成错误、修正与可接受形式

英文题目:What Counts as a Mistake? Annotating Recitation Events in Quran Memorization Transcripts

标签:#音频事件检测 | #数据标注 | #评测协议 | #基准测试 | #语音

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Mohamad Al Mdfaa:LemoniLab FZCO (lemonilab.com)
  • Nursultan Askarbekuly:Innopolis University (innopolis.ru)
  • Ahmed Helaly:Innopolis University (innopolis.ru)
  • Ubai Sandouk:LemoniLab FZCO (lemonilab.com)
  • Manuel Mazzara:Innopolis University (innopolis.ru)

📌 核心摘要

输入为商用语音识别转写文本与固定经文参照,输出为带半开区间定位的类型化事件,难点在于重复、自我纠正、开端套语与可接受拼写差异在字面编辑距离上都像错误。方法链分三步:标注规范先将差异收敛为十个组合标签并规定原文空格分词与空跨度锚定,其输出进入可执行评分器。评分器按重叠配对同时结算标签与位置并报告标签感知与定位F1,其输出进入基线与智能体试点。基线与试点分别用现成差异与生产组件适配及限时代码生成探测任务难度,并回检标注接口坐标错误。相对已有方法的关键机制差异是将重复、修复与可接受拼写单列为良性或已纠正类别而非错误的轻重程度,使定位误差与命名误差得以分离,实际意义是定位已近解决而命名仍是瓶颈。在Evaluator v2.1评测设置下,Claude Code, Fable 5.1的micro F1为0.892,高于Plain diff的micro F1 0.525。结论适用边界仅限转写文本层面的已切分已评审单元,不覆盖元音与tajweed声学错误,也尚未验证向未见背诵者分布的外推,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


25. 不训练也能估可懂度:Whisper 末端表示加分布距离何时比词错误率更稳

英文题目:Objective Intelligibility Prediction Using Distance Metrics on Speech Foundation Model Representations

标签:#语音可懂度评估 | #统计分析 | #语音 | #语音大模型

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Lyonel Behringer:机构信息未在 arXiv HTML 中可靠披露
  • Andreas Brendel:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

侵入式语音可懂度预测以干净参考语音和编码或增强后测试语音为输入,输出与跨听者平均词正确率对应的信号级估计,难点在于跨语言与跨失真保持稳健,同时保持可微以便直接用作神经网络训练损失。该方法首先冻结语音基础模型,将参考与测试信号分别送入同一模型逐层抽取时序嵌入序列;接着以单条信号内全部帧嵌入为样本集,分别构成参考分布与测试分布,使上一步的帧级向量进入分布级表示;然后在选定层上计算两分布间距离,以弗雷歇音频距离等连续距离值作为可懂度预测,距离越小预测可懂度越高。相对以转写判决输出词错误率或字符错误率的基线,该链路用嵌入分布距离替代离散识别后处理,减少了语言相关解码影响并保留可微性,因而更适合跨数据集比较与损失函数使用。在TMHINTQI测试集下,Whisper Large-v3最后一层编码器嵌入的FAD的PCC为-0.725,低于同模型CER的PCC -0.657。上述结论适用边界受限于有参考信号级相关评估与英语编码及中文增强两个语料,跨噪声类型与主观测试协议的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


26. 圆环排序的断点代价:用互补折叠直线排序重组多通道分离的输出顺序

英文题目:Location-based Training with Complementary Folded Linear Orderings for Multichannel Speech Separation

标签:#语音分离 | #模型集成 | #麦克风阵列 | #语音 | #空间音频信号

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Kaixuan Yang:机构信息未在 arXiv HTML 中可靠披露
  • Stijn Kindt:机构信息未在 arXiv HTML 中可靠披露
  • Nilesh Madhu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

多通道语音分离输入为平面阵列采集的两说话人混响混合,输出为参考通道的两路干声估计,难点在于输出与说话人的置换对应必须稳定,同时充分利用全方位空间线索而不被排序拓扑干扰。方法链分三步:先将圆周方位角按取向角θ折叠到区间[θ,θ+180°]的折叠线性排序消除0°/360°处突变,得到连续单调的排序坐标;再为θ=0°和θ=90°两个正交取向各训练一个卷积循环U型分离器,使各自在有利方位区域保持空间可分性;最后将两路网络的折叠坐标送入拥挤度与边界距离加权分数,只为每条混合选择得分最高的一路输出以规避前后模糊与排序边界。与强制循环拓扑的基于位置训练相比,关键差异是用可控线性折叠加互补选择替代全局循环约束,从而把模型容量还给信号重建而非维持人为循环结构。原文未提供可核对的关键定量结果,仅定性报告互补折叠线性排序集成在两种平面阵列和混响会议室任务中以SI-SDR和ESTOI性能优于圆周排序基线且对±20°方位角扰动鲁棒。该结论适用边界受限于两说话人静态场景,尚未验证三说话人以上折叠混叠与盲方位角估计下的端到端性能。已披露成本显示单网络计算量为参数量1.55M、每帧7.34/7.44M次乘加操作,互补集成为1.55×D参数量而单次推理开销不变。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


27. 重叠喀哒声串归谁:三水听器加视频如何拆解抹香鲸近场混叠

英文题目:Audiovisual diarization of overlapping click trains in sperm whale (Physeter macrocephalus) vocal sparring using a three-hydrophone array

标签:#说话人分离标注 | #信号处理 | #音视频 | #麦克风阵列 | #生物声学

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Lara Berkenbaum:机构信息未在 arXiv HTML 中可靠披露
  • Hervé Glotin:机构信息未在 arXiv HTML 中可靠披露
  • François Sarano:机构信息未在 arXiv HTML 中可靠披露
  • Walter M X Zimmer:机构信息未在 arXiv HTML 中可靠披露
  • Véronique Sarano:机构信息未在 arXiv HTML 中可靠披露
  • Olivier Adam:机构信息未在 arXiv HTML 中可靠披露
  • Pascale Giraudet:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理近海面多抹香鲸重叠喀哒声的说话人分离标注,输入为便携式OPALE三水听器阵列音频与同步双GoPro视频,输出为去交织后的点击列、每列空间模态及其对应的光学个体标识与行为解释,难点在于近场接触、表面多径、身体遮挡与同龄个体脉冲间隔不可分。方法链分为四环:先以Teager-Kaiser能量算子检测并人工清洗获得纯净点击,再在单参考通道上用恒Q变换谱片与短时节律预测重建连续声列,接着在三通道上以到达时差估计波达方向并做核密度聚类,最后将声学角度旋转投影到图像平面并以junk远端解剖点做光学验证。与仅依赖脉冲间隔或深潜多径测距的已有做法不同,该流程把时间精度与谱聚类解耦,并用视觉空间一致性裁决声学不可分情形。在3个记录会话共2655个手工验证点击构成的真值上,9个聚焦场景基线池为1242个点击,其中可分辨的7个场景重建11条声列共计882个点击并归属到Ali与Daren两个已知个体,最难场景的聚类说话人分离标注误差率达到25.79%,而单发声者场景可达0.0%,水平视觉一致率最高达100%。结论仅适用于该双个体vocal sparring概念验证,垂直对齐、离轴遮挡与强时间碰撞下仍需剔除场景或放宽容差。原文未披露训练、推理或部署成本,本方法为非学习型信号处理流水线。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。