共分析 29 篇论文


⚡ 今日概览

✅ 筛选入选 29 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#语音识别4 篇████
#音乐生成3 篇███
#语音增强2 篇██
#语音属性识别2 篇██
#音视频生成2 篇██
#音频分类2 篇██
#声源定位1 篇█
#房间脉冲响应估计1 篇█

📊 论文评分排行榜(29 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇RoleBreak: Benchmarking Long-Horizon Role-Playing…8.7前25%数据集与基准#语音对话系统
🥈LACE: Layer-Wise Compression for Dynamic Frame Rate…8.2前25%方法研究#音频编码
🥉HearInContext: A Benchmark for Implicit Context in…8.2前25%数据集与基准#语音识别
4.Self-Distilled Pronunciation and Accent Control for…8.1前25%方法研究#文本到语音
5.VoiceTrace: A Benchmark and Retrieval Framework for…8.0前25%数据集与基准#音频检索
6.Encoder Awakening via Adapters: Effective Domain…7.8前25%方法研究#语音识别
7.Look Less, Hear Better: Jointly Rewarded GRPO for…7.7前25%方法研究#语音识别
8.G-Mamba: Sparse Graph-Guided Mamba for Audio-Visual…7.6前25%方法研究#语音增强
9.CPR: Combining global composing, local performing and…7.6前25%方法研究#音乐生成
10.ECHO: A Matched-Contrast Benchmark for Context…7.5前25%数据集与基准#轮次切换
11.Counting Closures in Spanish Trills: A Multi-Corpus…7.5前25%应用研究#音频事件检测
12.EMODY Flow: Emotion-Aware Audio-Driven Full-Body…7.4前50%方法研究#音视频生成
13.TTM-Bench: A Framework for Text-to-Music System…7.1前50%数据集与基准#音乐生成
14.Reviving Etter method for autoregressive inpainting…6.9前50%方法研究#音频修复
15.The Unbearable Weight: Scaling Models and Methods for…6.8前50%应用研究#音频分类
16.Correlation-Guided Encoder Selection for Multi-Encoder…6.4前50%方法研究#音频理解
17.DiaWhisper-DPO: Role-Attributed Transcription of…6.3前50%方法研究#语音识别
18.Encypher: Shared Agency and Social Presence in…6.3前50%应用研究#音乐生成
19.Task-oriented neural FOA encoding for SELD from…6.2前50%方法研究#联合声音事件检测定位
20.Divide and Conquer: Mixture-of-Bottleneck Experts in…5.9前50%方法研究#语音情感识别
21.Optimal transport of image sources for interpolation…5.8前50%方法研究#房间脉冲响应估计
22.SpiroPhonia: Non-Invasive Respiratory Health…5.6前50%应用研究#病理语音评估
23.Transformer-Based Token Fusion and Dynamic Graph…5.6前50%方法研究#音视频交互
24.Mask-Based Speech Enhancement for Spatial Audio: A…5.6前50%方法研究#语音增强
25.Speaker-Specific and Language-Dependent Temporal…5.5前50%应用研究#语音属性识别
26.Talking Head Synthesis with Facial Landmark Guidance…5.5前50%方法研究#音视频生成
27.Speaker or Language? Explaining Variance in…5.4后 50%应用研究#语音属性识别
28.CTAN: Cycle-Temporal Attention Network for Embodied…5.3后 50%方法研究#声源定位
29.Timbre Analysis of the Hulusi, a Southwestern Chinese…5.0后 50%应用研究#音频分类

📋 论文列表

🖼️ 有图的论文会在这里展示首张原论文图;点击图片可打开 arXiv 原图。

🥇 演得久就会露馅:RoleBreak 测语音角色扮演的长程一致性与声音情感

原论文 Figure 1:RoleBreak construction pipeline.

英文题目:RoleBreak: Benchmarking Long-Horizon Role-Playing Robustness in Spoken Dialogue

标签:#语音对话系统 | #基准设计 | #基准测试 | #鲁棒性 | #模型评估

评分:8.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Yuqi Wang:机构信息未在 arXiv HTML 中可靠披露
  • Fengyuan Liu:机构信息未在 arXiv HTML 中可靠披露
  • Haochen Luo:机构信息未在 arXiv HTML 中可靠披露
  • Zhiqi Yu:机构信息未在 arXiv HTML 中可靠披露
  • Qi Liu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音角色扮演系统需在长时语音对话中持续维持指定身份、行为约束与恰当声音表达,难点在于上下文累积导致的遗忘、干预诱发的人设漂移与语义和韵律的解耦退化。本文构建 RoleBreak 基准,包含 310 个虚构人物与用户中心角色、6688 个经人工校验的多轮对话轮次和 11743 条细粒度评测标准,其中 1856 轮携带 expressive 情感目标用于考核声音情感。构建链条分四步衔接:角色池整理输出统一表征的角色集合并送入场景设计,场景与探针设计输出含长程依赖与身份安全压力的多轮脚本并送入起草修订,大语言模型起草加人工修订输出用户轮、逐轮评分标准与情感目标并送入语音合成,语音克隆合成输出中性基准语音及情感变体用于评测。与已有短程、以角色保真为主的语音基准相比,该机制差异在于将鲁棒性定义为首次失败轮次并引入多维逐轮裁决,具有长程可定位的实际意义。在 9 组全双工、omni 模态与级联系统评测中,最强级联系统 Qwen3.5-27B 的人设首次失败轮次仅为 10.4 轮、安全首次失败为 11.6 轮,而全部 9 个系统声音情感得分均低于 14.7 分。该结论仅适用于给定合成语音与自动评测链下的相对比较,未验证真实用户噪声、跨语言外推与更长部署会话。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥈 各层残差变化不同速,为何还要共用同一切分:LACE 的逐层压缩

原论文 Fig. 1:Overview of the LACE codec. At each quantization layer, the residual embeddings are independently…

英文题目:LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs

标签:#音频编码 | #向量量化 | #文本到语音 | #高效推理

评分:8.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Thanapat Trachu:机构信息未在 arXiv HTML 中可靠披露
  • Samuele Cornell:机构信息未在 arXiv HTML 中可靠披露
  • William Chen:机构信息未在 arXiv HTML 中可靠披露
  • Shinji Watanabe:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

神经音频编解码面向语音语言建模,输入为连续波形编码后的帧级嵌入,输出为离散语音Token及其时长,实际难点是75 Hz高帧率导致序列过长与建模算力剧增,且残差向量量化浅层刻画主体结构、深层刻画高频细节而随时间变化速率不同。LACE方法链分三步衔接:第一步在每层残差上独立执行压缩,得到层特定分割边界与段平均表示;第二步对段表示量化再按时长重复回帧级残差,使下一层输入同时吸收压缩误差与量化误差,形成逐层残差循环。第三步为兼容TTS,经并集对齐将多层边界取并集后重切分各层码流以统一总时长,并用边界锚点将深层候选边界受限于浅层锚点集合内,从而控制对齐后有效帧率增长。与共享边界的单次压缩相比,关键差异是深层高频残差可拥有更碎切分而不污染浅层结构,从而消除了压缩误差穿透所有层的误差地板。在LibriTTS test-clean上,以微调后DAC为骨干与动态规划压缩在约8.6 kbps下,LACE重建词错率为2.22%,优于同码率单次压缩的4.92%。该结论限于LibriTTS 24 kHz英文朗读语音与22.5 Hz至61.8 Hz区间,深层锚点增大反而损伤TTS稳定性。原文未披露训练时长与部署成本,代码仅声明为ESPnet3配方而未给链接。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥉 同一段语音,不同理解:用固定音频区分语义推断与直接给词

原论文 Figure 1:Illustrative example of implicit contextual disambiguation.

英文题目:HearInContext: A Benchmark for Implicit Context in Speech Recognition

标签:#语音识别 | #基准设计 | #基准测试 | #多语言

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Yifan Gao:机构信息未在 arXiv HTML 中可靠披露
  • Yao Tian:机构信息未在 arXiv HTML 中可靠披露
  • Hongbin Suo:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

上下文语音识别需联合历史对话语义与当前声学证据转写,难点在于同音词声学不可分,且增益可能来自看到目标词而非理解语义。HearInContext先构建同音竞争组与共享锚句,再由助手回复生成隐式支持历史并派生显式与无关对照,最后用同一波形在无上下文、隐式、显式、无关四种条件下复用合成与评测。其与已有域提示基准的机制差异在于固定波形并强制隐式历史排除全部候选词,从而分离语义推理与词汇复制。在HearInContext基准的普通话测试条件下,Qwen3-ASR-1.7B隐式上下文的目标召回率指标为69.92%,高于无上下文条件的目标召回率指标46.20%。对Qwen3-ASR-1.7B的80/10/10全参数监督微调将隐式召回率推高至普通话80.91%与英文85.02%,并迁移到显式条件与真实录音热词任务,而AISHELL-1与LibriSpeech误差变化保持在0.1个百分点以内。结论仅适用于中英同音受控句式与合成语音,尚未验证长程多轮噪声与开放词汇下的外推性。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


4. 不录音也能装上读音开关:用模型自己的声音教它读重音

英文题目:Self-Distilled Pronunciation and Accent Control for Neural Text-to-Speech

标签:#文本到语音 | #知识蒸馏 | #语音 | #韵律 | #主观评测

评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Shuhei Kato:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

端到端文本到语音以原始文本为输入直接生成波形,日语场景下不仅要读对罕见汉字与专有名词的音节,还须实现决定词义的词典性音高重音,模型无词典时只能猜读。作者先用公共前端为基座已能读对的常用词构造含标记的改写输入,再以冻结基座对原始载体句的自合成输出为教师做蒸馏,从而安装同时携带读音与重音的显式通道,学生输入的标记句直接以该自合成波形为目标。推理时注册表按词素边界自动匹配已登记词形并包裹标记,且将后续屈折后缀吸入包裹以避免标记紧贴未转换正字法,实现一次注册全局生效。与依赖录音训练的UtterTune及单字闭式编辑不同,该机制教师完全来自模型自身,无需录音对,控制随词典扩展而泛化到未见词。在50词未见难词听音评测条件下,标记方法的重音实现准确率为0.89,高于plain kana对照的重音实现准确率0.57。同一听音协议下自然度非劣效在调参基座上成立,未调参迁移的另三个基座则出现可听代价。该结论适用边界受限于日语、4名听音人与单一调参配方直接迁移,跨语言与跨范式泛化尚未验证。训练成本仅为单卡消费者硬件上约1小时的低秩适配,不触及合成流水线,部署后按词典路由即可复用。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


5. 谁说了什么:把内容与说话人一起检回来的混合语音检索

原论文 Fig. 2:Overview of VoiceTrace-Emb.

英文题目:VoiceTrace: A Benchmark and Retrieval Framework for Who-Said-What Speech Retrieval

标签:#音频检索 | #多模态学习 | #语音 | #音频大模型 | #基准测试

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Aaron Yee:机构信息未在 arXiv HTML 中可靠披露
  • Fengjie Lu:机构信息未在 arXiv HTML 中可靠披露
  • Jiarui Hai:机构信息未在 arXiv HTML 中可靠披露
  • Chenang Jiang:机构信息未在 arXiv HTML 中可靠披露
  • Helin Wang:机构信息未在 arXiv HTML 中可靠披露
  • Siwei Tu:机构信息未在 arXiv HTML 中可靠披露
  • Weitao You:机构信息未在 arXiv HTML 中可靠披露
  • Lingyun Sun:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

混合语音检索以文本查询指定内容、以参考语音指定说话人,从大规模语音集合中找出由目标说话人说出相关内容的文档,难点在于跨模态语义匹配与声纹匹配须联合判定,且多说话人文档存在干扰说话人。所提框架先由VoiceTrace-Emb将混合查询与候选语音映射到共享空间做高效粗排,再由VoiceTrace-Reranker将查询与每个候选拼接为单一多模态序列做细粒度是否相关判定,前者输出前30名候选进入后者重排。与级联式先分段再分别做语义与声纹打分的方法不同,该框架在统一音频语言模型内实现内容与说话人线索的早期交互与联合表征学习,同时在LibriSQA与SLUE-SQA-5上保持语义检索优势。在VoiceTrace-Bench基准下,VoiceTrace-Reranker的R@1指标为0.8285,高于WhisperX+ECAPA+BGE的R@1指标0.7621。结论适用于朗读与访谈式录音的近场条件,尚未验证噪声、远场、歌声与跨语言外推,也未证明参考语音极短或目标说话人占比极低时的鲁棒性。原文未披露训练时长、优化器与推理部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


6. 先唤醒编码器再整体微调:用轻量适配器补上语音大模型的声学短板

原论文 Fig. 1:Illustration of a standard well-trained Speech-LLM for ASR.

英文题目:Encoder Awakening via Adapters: Effective Domain-Adaptive Fine-tuning of Speech-LLMs

标签:#语音识别 | #Adapter | #领域适应 | #LoRA

评分:7.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Mohan Shi:机构信息未在 arXiv HTML 中可靠披露
  • Zilai Wang:机构信息未在 arXiv HTML 中可靠披露
  • Natarajan Balaji Shankar:机构信息未在 arXiv HTML 中可靠披露
  • Kaiyuan Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Eray Eren:机构信息未在 arXiv HTML 中可靠披露
  • Abeer Alwan:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为儿童自发语音与非洲裔美国人语言访谈等域偏移语音,输出为对应转写文本,难点是目标域数据有限且语音大模型中大语言模型主导优化、交叉熵损失只加在语言模型输出端,导致语音编码器适配不足,而激进微调又会破坏预训练知识。编码器唤醒(Encoder Awakening)阶段在每层编码器插入轻量残差适配器并仅训练适配器以注入目标域声学知识,延续微调(Continual Fine-tuning)阶段以上述适配器为域感知起点联合优化编码器、投影器与语言模型低秩适配。与直接联合微调不同,该方法先隔离优化编码器适配器以避免多模块竞争,再做全局协同,从而底层保留通用声学而高层针对性偏移。在OGI测试集上Canary-Qwen骨干从香草微调的10.95%词错率降至9.05%,并在MyST的8.04%与CORAAL的8.54%上同步取得新最优,均超越使用额外无标注数据的此前最优。该结论目前仅验证于英语儿童与方言两类偏移及2个语音大模型骨干,未覆盖噪声、远场或跨语言外推。原文未披露训练时长、推理延迟与部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


7. 名义延迟不够用:用实测词延迟联合奖励重排流式识别的输出时机

原论文 Figure 1:Accuracy-latency Pareto frontiers.

英文题目:Look Less, Hear Better: Jointly Rewarded GRPO for Streaming ASR

标签:#语音识别 | #强化学习 | #语音 | #流式处理

评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Xiuwen Zheng:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

流式自动语音识别需在增量音频输入下逐词输出转写,难点在于转写准确性与用户感知到的词级提交时机需联合优化,而名义前视无法反映解码器犹豫与消歧等待。方法链分三步:先复现延迟流建模(Delayed Streams Modeling,DSM)的监督微调基线,将文本流按强制对齐词边界加结构延迟放置以学习发射与等待;再提出对齐词发射延迟(Aligned Word Emission Delay,AWED),按假设词终符发射时刻与参考词声学结束时刻之差在匹配词上度量延迟分布;最后用联合奖励的分组相对策略优化(Group Relative Policy Optimization,GRPO)进行后训练,以准确率减去门控组归一化延迟为奖励更新发射策略。与已有方法相比,关键差异是从模仿固定时刻表转向按证据充分性直接优化离散发射动作,并用匹配率门限防止低质量快速发射作弊。在8个英语测试集均值上,80 ms结构延迟下相对Voxtral Realtime基线词错率降低30.8%,480 ms下相对降低5.7%且中位延迟从1.17 s降至1.04 s。结论仅在英语朗读与会议等8个集上验证,未验证其他语言、噪声与长尾重叠语音的外推。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


8. 用稀疏局部图约束跨模态对齐,再让 Mamba 管长时序的轻量音视增强

原论文 Fig. 1:Architecture of the proposed SG-Mamba.

英文题目:G-Mamba: Sparse Graph-Guided Mamba for Audio-Visual Speech Enhancement

标签:#语音增强 | #图神经网络 | #状态空间模型 | #音视频 | #语音

评分:7.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Guo-Ruei Tseng:Dept. of Computer Science and Information Engineering, National Taiwan Normal University, Taiwan Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan
  • Hung-Shin Lee:Dept. of Computer Science and Information Engineering, National Taiwan Normal University, Taiwan Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan
  • Hsin-Min Wang:Dept. of Computer Science and Information Engineering, National Taiwan Normal University, Taiwan Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan
  • Berlin Chen:Dept. of Computer Science and Information Engineering, National Taiwan Normal University, Taiwan Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan

📌 核心摘要

面向含噪与多人干扰的音视频语音增强(Audio-Visual Speech Enhancement,AVSE),输入为带噪语音谱与同步唇部视频,输出为增强波形,难点在于轻量预算下跨模态对齐既要容忍音画微异步又要避免错误全局关联。所提稀疏图引导Mamba(Sparse Graph-Guided Mamba,SG-Mamba)先由音频编码器与冻结视觉前端抽取特征并经位置编码形成图节点,再由分层图结构特征融合模块在局部窗口内完成跨模态聚合,接着将聚合后音频表示送入单向Mamba建模长时依赖,最后经音频跳连与多层全连接网络生成幅度掩膜并结合原始相位重构波形。与无约束拼接或稠密跨注意力不同,该方法以稀疏非对称边与内容自适应注意力显式界定对齐范围。在LRS3噪声混合条件下,SG-Mamba的SI-SDR为13.091 dB,高于RAVEN基线的SI-SDR 12.648 dB,同时保持可比的感知质量与可懂度。作者承认当前拓扑固定且假设视觉输入完好,未验证遮挡与大范围失配下的外推能力。该后端约需5.3 M参数与3.45 G乘加操作,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


9. 连续自回归做钢琴渲染:全局作曲、局部演奏与全序列精修如何分工

原论文 Figure 1:Overview of CPR: (a) training, including the Performer architecture, and (b) autoregressive…

英文题目:CPR: Combining global composing, local performing and full-sequence refining in piano rendering with continuous autoregressive modelling

标签:#音乐生成 | #自回归模型 | #流匹配 | #音乐 | #音乐超分辨

评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Chong Jing:机构信息未在 arXiv HTML 中可靠披露
  • Junan Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Zhizheng Wu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

提示条件钢琴渲染需以参考录音音色复现目标MIDI的音高、起音与力度,难点在于长时音乐语义保持与细粒度音色克隆难以兼得。作曲器Composer以因果Transformer自回归预测连续声学块隐状态,表演器Performer以局部流匹配由该隐状态加历史与音色先验生成梅尔频谱块并回送作曲器,精炼器Refiner再将24 kHz波形超分至48 kHz。相对离散自回归加全序列流匹配,该设计以连续隐状态传递消除量化损失,以短窗双向建模替代长序列注意力从而降低累积误差与计算量。瓶颈表征对齐Bottlenecked Representation Alignment/BREPA以压缩投影对齐自监督MuQ特征约束语义,模态时间旋转位置编码Modality-Time RoPE/MT-RoPE以双轴表示实现MIDI与音频物理时间对齐。在P-MUSE-eval配对提示任务上,系统相对全序列流匹配基线P-MUSE将起音F1提升至78.4%,分布距离降至0.129,呈现更强的MIDI依从与整体自然度。结论目前仅在钢琴族音色与3秒至30秒片段内验证,对其他乐器、长结构与强表现力外推尚未证明。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


10. 同一句话为何有时该让、有时该留:ECHO 用配对上下文检验全双工让轮

原论文 Figure 1:One insertion, three required actions.

英文题目:ECHO: A Matched-Contrast Benchmark for Context-Sensitive Turn-Taking in Full-Duplex Dialogue

标签:#轮次切换 | #基准设计 | #基准测试 | #语音

评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Shuofeng Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Hongwei Cai:机构信息未在 arXiv HTML 中可靠披露
  • Wenke Fan:机构信息未在 arXiv HTML 中可靠披露
  • Qingxiang Guo:机构信息未在 arXiv HTML 中可靠披露
  • Dawei Yang:机构信息未在 arXiv HTML 中可靠披露
  • Zhou Wang:机构信息未在 arXiv HTML 中可靠披露
  • Zhiyang Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Yingxin Shang:机构信息未在 arXiv HTML 中可靠披露
  • Weixu Wang:机构信息未在 arXiv HTML 中可靠披露
  • Lin Yang:机构信息未在 arXiv HTML 中可靠披露
  • Shuran Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Yang Song:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

全双工语音对话要求系统边说边听,输入为重叠用户语音与多轮对话史,输出为让出话轮或继续说的二元动作,难点在于相同插入文本在不同上下文中交互角色完全翻转。作者先从DuplexDrama合成骨架随机采样多轮对话,由DeepSeek-V4-Pro选择可多义解读的重叠位置并生成初始附和或旁白插入。接着在固定插入文本的条件下由Claude-3.5-Sonnet重写被打断助手话语之前的历史以翻转其打断与附和角色,使词面在配对内失效。重写候选经模型一致性筛选与全量人工复核后,用IndexTTS2独立合成并经强制对齐叠加渲染为说话人分离双通道音频,供配对评测使用。与已有基准独立采样事件且非打断反馈词汇封闭不同,该匹配对比设计迫使决策依赖上下文,并以配对联合正确要求惩罚恒定动作偏好。在ECHO基准下,MiniCPM-o 4.5的指标PASRI-B为54.00,高于SoulX-Duplug的指标PASRI-B为4.00。该结论仅适用于中文合成诊断分布,不能外推为自然 prevalence 下的误触发率。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


11. 数闭合而不是数峰:西班牙语颤音两种计数单位为何得出相反性别结论

原论文 Figure 1:The counted unit decides the sociophonetic conclusion.

英文题目:Counting Closures in Spanish Trills: A Multi-Corpus Acoustic Study

标签:#音频事件检测 | #信号处理 | #统计分析 | #语音学与音系 | #社会语音学

评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Mateo Cámara:机构信息未在 arXiv HTML 中可靠披露
  • Maria F. Alcala-Durand:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该研究输入为西班牙语颤音/r/音段音频,输出为闭合数量与闭合间周期,难点在于自然语料常混杂清化与擦化变体且包络峰值会将闭合与其释放重复计数。首先质量过滤器筛选出时长与浊音及周期性达标的规范颤音,其输出进入基于中频能量极小值的闭合检测器以定位经释放验证的闭合,随后独立周期估计器用自相关推算周期做一致性核查,最后聚合到说话人层面做非参数检验与混合效应建模。与包络峰值计数同时报告闭合与释放不同,新机制锚定能量谷并要求释放验证,从而消除了与基频耦合的过计数偏差。在六个西班牙语语料评估条件下,TEDx语料的闭合数指标为2.0,高于DIMEx100语料的闭合数指标1.0。整体上语境效应达中等强度而性别效应不显著,独立周期估计器复现了语境排序。上述参考值仅适用于通过筛选的浊音周期性颤音,不能外推为自然连续语流中的成颤率。该结论的适用边界受限于仅覆盖浊音周期性规范颤音且词首样本稀少而尚未验证非规范变体。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


12. 强音频压住弱情绪时:EMODY Flow 用辅助分类器找回情绪可控性

原论文 Figure 1.:EMODY Flow attaches two lightweight flow-matching generators to the frozen Talker component of…

英文题目:EMODY Flow: Emotion-Aware Audio-Driven Full-Body Motion Generation

标签:#音视频生成 | #流匹配 | #语音 | #0 样本

评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 0.5/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Harsh Kumar Agarwal:INRIA, Univ. Grenoble Alpes , Grenoble , France
  • Xavier Alameda-Pineda:INRIA, Univ. Grenoble Alpes , Grenoble , France
  • Olivier Perrotin:Univ. Grenoble Alpes, CNRS, Grenoble INP, GIPSA-lab , Grenoble , France

📌 核心摘要

该任务以语音音频与 8 类离散情感标签为输入,输出与语音同步的全身动作,难点是高维音频嵌入已能解释大部分重建损失时低维情感标签被生成器忽略。方法链分为三步:首先从冻结的 Qwen-3 Omni 谈话器中抽取 512 维 Mimi 音频编码作为语音表示,其次用两个并行扩散变换器分别生成身体与面部动作序列,最后在训练期用辅助情感分类器迫使生成动作可被识别为目标情感。该编码以每秒12.5帧提供时序条件,情感标签经九类嵌入表与流匹配时间步融合后通过自适应层归一化调制各子层,使语音表示与情感控制共同进入速度场预测。相比在向量量化隐空间做解耦或分块建模的方法,该设计直接在连续 SMPL-X 与 FLAME 参数上做流匹配并复用大模型内部表示,兼顾轻量与可插拔。在 BEAT2 说话人无关测试集上情感无关基线取得 FGD 0.302、Beat Correlation 0.853、Diversity 24.62,相对此前最强的 GestureLSM 提升 26%、5%、62%。该结论边界在于面部情感分离仍弱、10 秒窗口需自回归扩展且身体与面部分支独立采样,原文仅依赖自动指标而缺少人类评价。推理开销方面,原文报告在单块NVIDIA A6000硬件上生成整个BEAT2测试集动作约需6分钟,远快于实时,其适用边界受限于零样本面部评测与离散情感标签的简化假设。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


13. 对齐与开销分开算:TTM-Bench 如何让异构文本音乐系统可比

原论文 Figure 1:Musical-content alignment benchmarking workflow.

英文题目:TTM-Bench: A Framework for Text-to-Music System Performance Benchmarking

标签:#音乐生成 | #基准设计 | #基准测试 | #高效推理

评分:7.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Giorgia Adorni:机构信息未在 arXiv HTML 中可靠披露
  • Michela Papandrea:机构信息未在 arXiv HTML 中可靠披露
  • Battista Rimoldi:机构信息未在 arXiv HTML 中可靠披露
  • Tiziano Leidi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

文本到音乐生成(Text-to-Music,TTM)以自然语言与结构化属性为输入并输出30 s波形,难点在于各系统调制格式、时长与本地或托管访问模式差异导致同一提示无法等价比较。TTM-Bench先从100首商业曲目抽取46维描述子并按系统支持子集裁剪,再由Llama 3.1 8B生成候选提示并以LAION-CLAP筛选保留,最后并行执行音乐内容对齐与计算效率两条工作流分别产出可解释分数与耗时资源记录。与偏好排序或统一训练约束的既有基准相比,该框架保留共享音乐规格而适配表达形式,并将个体级语义、流派与描述子一致性与分布级指标解耦。在100首商业曲目基准下,Stable Audio 2.5的MCAS为0.634,高于Lyria 2的MCAS 0.585,而Stable Audio 2.5延迟为5.6 s、Lyria 3单次成本为0.04 USD,说明对齐优势并不对应效率优势。结论仅适用于所用参考集、系统版本与RTX PRO 6000 Blackwell实测及托管观测条件,MCAS权重尚未经人因验证。效率侧记录了延迟、显存与托管费用,但原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


14. 缺口比模型阶数还短时,Etter 的双向自回归插值还能解吗

英文题目:Reviving Etter method for autoregressive inpainting: Generalization, evaluation, implementation

标签:#音频修复 | #自回归模型 | #音乐 | #开源工具 | #严格因果

评分:6.9/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ondřej Mokrý:机构信息未在 arXiv HTML 中可靠披露
  • Matěj Hrdlička:机构信息未在 arXiv HTML 中可靠披露
  • Pavel Rajmic:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频修复任务输入为含单段连续缺失的波形,输出为填补后的波形,难点在于音乐信号非平稳且长缺失下前后文难以兼顾。本文先用Burg算法或线性预测编码从缺失两侧各估计一组自回归模型系数,再由前向与后向滤波矩阵与已知数据矩阵构造联合最小残差线性系统并求解缺失样本,最后提供纯左侧因果外推与加权交叉淡化两种简化路径。与仅做单向外推或迭代Janssen方法相比,该机制差异在于同时约束双向残差能量并通过边界项耦合求解,因而能利用右侧未来信息并支持缺失短于模型阶数的截断推广。在MUSHRA听测评测设置下,通过后筛选的评估者分数达标人数为14人,低于初始参测的评估者分数达标人数19人。在音乐片段缺失达80ms的评测中,Etter方法总体与多数自回归与稀疏基线相当但弱于逐缺失Janssen,且主观听测排序与PEMO-Q客观差异等级基本一致。结论仅适用于单缺失音乐短间隙插值,未验证多缺失、语音、强非平稳与实时丢包下的外推表现。该结论适用边界受限于单缺失音乐短间隙,强非平稳与多缺失场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


15. 数据不够时别先加模型:无人机声音分类里方法缩放胜过模型缩放

原论文 Figure 1:UAV Audio Classification System

英文题目:The Unbearable Weight: Scaling Models and Methods for UAV Audio Classification

标签:#音频分类 | #参数高效微调 | #数据增强 | #低资源 | #高效推理

评分:6.8/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Andrew P. Berg:Department of Computer Science, College of Charleston, Charleston SC, USA
  • Qian Zhang:Department of Engineering, College of Charleston, Charleston SC, USA
  • Mia Y. Wang:Department of Computer Science, College of Charleston, Charleston SC, USA

📌 核心摘要

无人机音频分类以飞行录音为输入并输出31种平台类别,难点在于仅3100段样本稀缺且新机型持续出现导致大模型全量微调难以负担。作者先将波形转为对数梅尔频谱图并做三倍时域拉伸与谐波失真增强以扩充训练分布,增强后频谱直接送入ImageNet或AudioSet预训练的卷积与Transformer骨干提取特征。接着冻结主干并仅以批归一化调谐适配卷积通道分布或以正交与向量缩放适配注意力权重,使小数据下的可训练参数降至1%量级。最后以五折交叉验证统一比较验证准确率、训练时长与推理内存,使精度效率权衡可直接归因到骨干与微调方法组合。在五折交叉验证设置下,EfficientNet-B7批归一化微调的验证准确率为97.65%±0.30,高于AST正交微调的验证准确率为96.74%±0.24。该结论限于短距单麦克风录音与 5 秒片段划分,未验证新机型持续加入与强噪声远场条件。训练成本随增强约增长至 3 倍,推理内存约为 243.63 MB,原文披露分配置训练时长与内存估算。跨设备远场持续上新的泛化尚未验证且受限于现有采集条件。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


16. 不穷举 220 种融合也能选编码器:用成绩相关性在互补与干扰之间划线

原论文 Fig. 1:Overview of the multi-encoder LALM framework, built on the standardized XARES-LLM architecture.

英文题目:Correlation-Guided Encoder Selection for Multi-Encoder Large Audio-Language Models

标签:#音频理解 | #模型融合 | #音频大模型 | #统计分析

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Pei-Jun Liao:Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of Electrical Engineering, National Taiwan University, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan Grad. Inst. of Biomedical Electronics and Bioinformatics, National Taiwan University, Taiwan Original Content Center, Gamania Digital Entertainment Co., Ltd., Taiwan NTU Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan
  • Hung-Shin Lee:Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of Electrical Engineering, National Taiwan University, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan Grad. Inst. of Biomedical Electronics and Bioinformatics, National Taiwan University, Taiwan Original Content Center, Gamania Digital Entertainment Co., Ltd., Taiwan NTU Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan
  • Wenze Ren:Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of Electrical Engineering, National Taiwan University, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan Grad. Inst. of Biomedical Electronics and Bioinformatics, National Taiwan University, Taiwan Original Content Center, Gamania Digital Entertainment Co., Ltd., Taiwan NTU Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan
  • Kuo-Hsuan Hung:Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of Electrical Engineering, National Taiwan University, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan Grad. Inst. of Biomedical Electronics and Bioinformatics, National Taiwan University, Taiwan Original Content Center, Gamania Digital Entertainment Co., Ltd., Taiwan NTU Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan
  • Hung-yi Lee:Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of Electrical Engineering, National Taiwan University, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan Grad. Inst. of Biomedical Electronics and Bioinformatics, National Taiwan University, Taiwan Original Content Center, Gamania Digital Entertainment Co., Ltd., Taiwan NTU Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan
  • Hsin-Min Wang:Inst. of Information Science, Academia Sinica, Taiwan Grad. Inst. of Electrical Engineering, National Taiwan University, Taiwan Grad. Inst. of AI Interdisciplinary Applied Technology, National Taiwan Normal University, Taiwan Grad. Inst. of Biomedical Electronics and Bioinformatics, National Taiwan University, Taiwan Original Content Center, Gamania Digital Entertainment Co., Ltd., Taiwan NTU Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan

📌 核心摘要

多编码器大音频语言模型需同时处理语音、环境声与音乐的分类、理解与文本生成,而靠直觉或穷举挑选编码器易引入冗余并超出单卡预算,且全组合融合训练呈组合爆炸难以落地。所提相关性引导编码器选择 Correlation-gUided Encoder Selection 即 CUES 先独立评测候选编码器并归一化聚合分数,再计算类别级与任务级皮尔逊相关性以划分能力簇并排序冗余,最后按序指定锚点、互补与可选分歧角色并仅训练选中集合的融合适配器。与穷举融合或按家族直觉搭配不同,该方法以聚合分数相关代替融合训练作为互补信号,并允许按轨道主动空缺第三编码器以规避干扰。在XARES-LLM基准的五折交叉验证下,CUES跨家族三元组的平均测试得分为0.771,高于Whisper-medium的平均测试得分0.739。其适用边界是选择依赖每任务开发集分数且仅在单基准与冻结小骨干上验证,分歧收益呈任务相关而非单调递增。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


17. 把谁说了什么写对:用真实失败做偏好优化的端到端角色转写

原论文 Figure 1:Training pipeline: Stage 1 produces DiaWhisper; Stage 2 refines it into DiaWhisper-DPO.

英文题目:DiaWhisper-DPO: Role-Attributed Transcription of Clinical Interviews via Failure-Mined Preference Optimization

标签:#语音识别 | #偏好优化 | #说话人分离标注 | #LoRA | #医疗音频

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Weiming Li:机构信息未在 arXiv HTML 中可靠披露
  • Ana Catarina Fidalgo Barata:机构信息未在 arXiv HTML 中可靠披露
  • Miguel Constante:机构信息未在 arXiv HTML 中可靠披露
  • João Miguel Sanches:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

临床抑郁访谈需要把每句话同时转写并归属到医生或患者,级联式先做说话人分离标注再启发式指派角色容易误差传递。方法链分三步:先用XTTS重建DAIC-WOZ双人音频并做PDCH-HAMD患者级划分,再以低秩适配(Low-Rank Adaptation,LoRA)微调Whisper-large-v3输出带角色标签与时间戳的序列,同时用加权辅助帧级角色头约束编码器,最后把训练中触发重复的真实失败作为拒绝样本、真值作为偏好样本做DPO精炼。与共享对齐器的级联基线相比,关键差异在于省去独立分离标注模块并用失败本身提供偏好信号,无需人工偏好标注。在DAIC-WOZ测试集评测下,DiaWhisper-DPO的DER为0.119,低于最强级联基线CAM++的DER 0.431。该方法在PDCH-HAMD测试集上报告角色准确率0.757和DER 0.313,覆盖26个测试会话与78个会话种子配对。结论限于重建的双人英语访谈与声音转换后的中文 HAMD 访谈,未验证真实双通道采集、多方重叠与抑郁筛查下游增益。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


18. 从一个人跳到一屋人跳:Encypher 把集体律动写成音乐提示

原论文 Figure 2.:The Encypher system uses a depth camera to capture the joint movements of dancers in a cypher.

英文题目:Encypher: Shared Agency and Social Presence in Collaborative Music Generation for Dance Cyphers

标签:#音乐生成 | #用户研究 | #音乐 | #音视频 | #实时处理

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Zhixing Chen:Massachusetts Institute of Technology, Cambridge, USA
  • Cheng-Zhi Anna Huang:Massachusetts Institute of Technology, Cambridge, USA

📌 核心摘要

Encypher面对的任务是以多人群体身体运动为输入、实时生成持续可共舞的音乐输出,难点在于多人意图冲突、约2秒生成延迟破坏因果耦合、以及破圈式动作对节拍稳定性的苛刻要求。系统先由ZED 2i立体深度相机捕捉Body_34骨架并计算上半身质心幅度等群体几何特征,再经Max/MSP中枢做平滑与量化形成控制信号,最后以加权文本提示与圆形占位参数驱动Lyria RealTime生成连续音频与灯光。与符号MIDI微操的Con Moto相比,该链路放弃音符级控制,换取录音室级音色丰富度与自然语言可协商性,使陌生人无需技巧即可集体塑形音乐。在11名无社交关联新手三轮课堂评测场景下,Enjoyment维度的同意指标为72.7%,高于Engagement维度的同意指标54.5%。结论仅适用于新手陌生人小团体共舞场景,对已有默契的 breaker 社群与固定下拍需求尚未验证,且延迟与节拍漂移仍限制技巧性舞蹈。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


19. 不追求波形像,只追求定位准:面向 SELD 任务的神经 FOA 编码

英文题目:Task-oriented neural FOA encoding for SELD from irregular microphone arrays

标签:#联合声音事件检测定位 | #知识蒸馏 | #麦克风阵列 | #空间音频信号

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jiachen Liu:机构信息未在 arXiv HTML 中可靠披露
  • Yin Cao:机构信息未在 arXiv HTML 中可靠披露
  • Ming Wu:机构信息未在 arXiv HTML 中可靠披露
  • Jun Yang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

联合声音事件检测定位需从不规则麦克风阵列信号同时输出事件类别与到达方向,常规一阶Ambisonics编码依赖球面近似与病态逆矩阵,在稀疏非球阵列下混叠与模型失配导致空间保真不足。先以多通道短时傅里叶系数为输入,由常规编码矩阵提供物理初值并由卷积与Mamba网络预测信号依赖残差矩阵,相加输出四通道FOA兼容表示以补偿幅度相位畸变;再将该表示输入相同特征变换转为四通道对数梅尔谱加三维归一化有源强度向量的七通道特征,其中学生特征来自含噪房间渲染信号而教师特征来自干净理论FOA,分别送入结构相同但参数独立的学生与冻结教师SELD网络。最后以帧级置换不变真值监督与蒸馏联合优化学生与编码器,对事件用带Sigmoid的逻辑二元交叉熵、对方向用教师置信度加权均方误差并按帧选择最优轨道置换,梯度回传使中间表示偏向任务相关空间信息而不约束系数级重建。与重建导向Ambisonics编码不同,该机制以理论FOA为特权任务级监督直接优化下游效用,并保留固定四通道接口以解耦阵列几何与下游网络。在含噪合成Benchmark阵列评测条件下,Neural FOA + KD的ℰ_SELD指标为0.429,低于Conventional FOA的ℰ_SELD指标0.485。信号级分析显示蒸馏表示NMSE恶化却下游最优,证明任务效用与重建保真不一致,其结论适用边界限于1至3个平稳声源、弱混响合成与小规模LOCATA平稳录音,四声源等多源重叠等尚未验证,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


20. 把情感拆成方向与强度:瓶颈专家分治处理多模态情绪

原论文 Fig. 1:Illustration of task-related information extraction for each modality in the ordinal sentiment…

英文题目:Divide and Conquer: Mixture-of-Bottleneck Experts in Informative Ordinal Space for Video-based Multimodal Sentiment Analysis

标签:#语音情感识别 | #混合专家模型 | #多任务学习 | #多模态学习 | #音视频

评分:5.9/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ronghao Lin:机构信息未在 arXiv HTML 中可靠披露
  • Qiaolin He:机构信息未在 arXiv HTML 中可靠披露
  • Zefeng Lu:机构信息未在 arXiv HTML 中可靠披露
  • Yichu Liu:机构信息未在 arXiv HTML 中可靠披露
  • Li Huang:机构信息未在 arXiv HTML 中可靠披露
  • Sijie Mai:机构信息未在 arXiv HTML 中可靠披露
  • Haifeng Hu:机构信息未在 arXiv HTML 中可靠披露
  • Yap-peng Tan:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

视频多模态情感分析需从说话人视频的语言序列X_l、声学序列X_a和视觉序列X_v联合预测连续情感值y,难点在于模态异质性、单模态噪声冗余以及标签序数结构被单任务回归忽略。本文先构建序数情感空间,将y按符号映射为三类极性标签y_polar、取绝对值并以数据集量程H约束为强度标签y_inten,把单回归拆为分类加回归。再由极性与强度瓶颈专家对每模态做任务条件变分信息瓶颈压缩,经高斯重参数采样得到紧凑隐变量B,最后由多模态瓶颈路由融合跨模态选择组合并残差融合为F_M,叠加基于极性错分与强度误差的三类难样本加权损失优化主回归。与整体融合或单瓶颈压缩不同,该分治路由使极性与强度专家各司其职并按需组合跨模态隐变量,从而在保留序数结构的同时抑制无关噪声并提升可解释性。在CMU-MOSI上MoB-DeBERTaV3取得7分类准确率51.1、平均绝对误差0.598、相关系数0.873,超过MMML与ITHP;在CH-SIMS上MoB-MacBERT取得5分类准确率44.2。该结论限于话语级离线评测与完整或缺模态输入,未验证强噪声、跨域与实时流式稳定性,原文未披露训练推理成本与开源产物。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


21. 移动声源下镜像源如何配对:用部分最优传输做房间冲激响应插值

原论文 Figure 1:The cost functions viewed as functions of r=\\lVert\\bmx-\\bmy\\rVert_2, normalized such that their…

英文题目:Optimal transport of image sources for interpolation of room impulse responses with moving sources

标签:#房间脉冲响应估计 | #信号处理 | #统计分析 | #空间音频

评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jesper Brunnström:机构信息未在 arXiv HTML 中可靠披露
  • Filip Elvander:机构信息未在 arXiv HTML 中可靠披露
  • Isabel Haasler:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理移动物理声源沿直线轨迹的房间脉冲响应插值,输入为起点与终点处带噪声且乱序的镜像源点集估计,输出为轨迹上任意中间时刻的镜像源测度以合成任意接收器响应,难点在于整体漂移叠加可见性变化导致的基数不等与对应未知。方法首先用部分最优传输求解两端点集间的部分一对一匹配,将无匹配质量送入虚拟点以显式丢弃不可见源。接着对匹配对按位移插值沿直线移动,对未匹配点按权重淡入淡出构造中间测度,前一步的传输计划直接决定哪些点移动、哪些点渐隐。最后基于均匀球向加高斯噪声的统计模型推导最大似然与源信息地面代价,并由非中心卡方分布按拒绝概率标定虚拟代价以控制误匹配。在带宽为250 Hz且拒绝概率为0.001的统计数据评测设置下,源信息方法的NMSE指标低于线性插值方法的NMSE指标,且最大似然方法的Assignment error指标低于欧氏代价方法的Assignment error指标。与移动接收器方法或直接线性混合房间脉冲响应相比,该机制显式利用镜像源移动距离等于物理源移动距离的等距先验,因而保留几何结构而非模糊叠加。其适用边界受限于线性源轨迹、三阶以内镜像源与低噪声统计假设,在高噪声房间仿真条件下源信息与最大似然优势减弱且欧氏代价反而更优,随机非凸多面体房间外的真实测量尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


22. 日常闲聊里藏着肺部信号:SpiroPhonia 如何用自发语音做 COPD 判别

原论文 Figure 1:SpiroPhonia framework for respiratory health assessment from spontaneous speech.

英文题目:SpiroPhonia: Non-Invasive Respiratory Health Assessment from Spontaneous Speech

标签:#病理语音评估 | #统计分析 | #语音 | #语音生物标志物 | #数据集

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Roksana Khanom:机构信息未在 arXiv HTML 中可靠披露
  • Shafia Supty:机构信息未在 arXiv HTML 中可靠披露
  • Nirupam Roy:机构信息未在 arXiv HTML 中可靠披露
  • Ashok Agrawala:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

慢性阻塞性肺疾病(Chronic Obstructive Pulmonary Disease, COPD)筛查依赖肺量计,难以居家连续监测,本文以现实环境中英语自发对话语音为输入,输出受试者是否患呼吸系统疾病的二分类判断,难点是内容、韵律、通道与说话人变异会淹没微弱呼吸信号。方法链分四步:先做语音活动检测与去噪并切分为10秒至30秒窗以稳定暂停估计,再并行提取声学微扰、梅尔频率倒谱系数(Mel Frequency Cepstral Coefficients, MFCC)谱特征与暂停时序特征,随后经正态性检验加多重校正筛选差异特征并做去冗余,最后以递归特征消除交叉验证(Recursive Feature Elimination with Cross-Validation, RFECV)为各分类器定制子集并在留出集上评估。与依赖实验室持续元音或朗读的方法不同,该工作坚持非诱发自然语音加可解释浅层模型,强调声门不稳定与呼吸言语协调破坏的生理可解释性。在41例留出测试集上梯度提升(Gradient Boosting)达到78.05%准确率与80.00% F1值,随机森林(Random Forest)AUC为87.14%。结论仅适用于英语中老年访谈类语音,未验证跨语言、跨设备与纵向跟踪能力,重度噪声与共病干扰下可能失效。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


23. 看不清就撞一下再改路:TDGP 用令牌融合定方向、用碰撞删边改路径

原论文 Figure 1:Passive visual perception is inherently limited and potentially misleading.

英文题目:Transformer-Based Token Fusion and Dynamic Graph Planning for Audio-Visual Navigation

标签:#音视频交互 | #Transformer | #音视频 | #强化学习

评分:5.6/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Shaohang Wu:机构信息未在 arXiv HTML 中可靠披露
  • Yinfeng Yu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频视觉导航以双耳音频与第一视角视觉为输入,输出连续运动动作以抵达持续发声目标,难点在于狭窄自中心视场、透明障碍与异常光照会产生虚假可通行信号。所提基于Transformer的令牌融合与动态图规划(Transformer-based Token Fusion and Dynamic Graph Planning,TDGP)解耦为高低两层:高层令牌化融合机制(Tokenization Fusion Mechanism in High-Level Transformers,TFM)将视觉特征与双耳声谱特征切分为令牌并经Transformer编码器融合,再由门控循环单元(Gated Recurrent Unit,GRU)建模时序并在3×3局部网格上选择waypoint;底层碰撞惩罚路径规划器(Collision-Penalty Path Planner,CPP)维护动态导航图,经坐标变换与Dijkstra将waypoint转为原子动作,并在碰撞时删边重规划,同时以碰撞惩罚奖励塑造高层避障。与直接映射到动作的AV-Nav相比,关键差异在于高层专注方向决策而底层维护可修正的几何图,把被动视觉失败转化为可学习的几何约束。在Replica听见电话声设置下TDGP以成功率加权路径长度(Success weighted by Path Length,SPL)89.2%超过AV-Nav的74.4%,成功率(Success Rate,SR)98.7%超过91.4%;在Matterport3D(Matterport3D,MP3D)未听见设置下SPL 36.1%超过21.9%,SR 42.2%超过33.5%。该结论限于SoundSpaces 1.0静态仿真与固定听见或未听见划分,未验证动态声源、动态障碍与真实机器人噪声下的外推能力。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


24. 在多通道输出里做掩蔽:增强越强,残留干扰的空间感丢得越多吗

英文题目:Mask-Based Speech Enhancement for Spatial Audio: A Comparison of Ambisonics, Beamforming, and Microphone Channels

标签:#语音增强 | #时频分析 | #空间音频信号 | #麦克风阵列 | #模型比较

评分:5.6/10 | 创新 1.1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Sheli Hendel:机构信息未在 arXiv HTML 中可靠披露
  • Boaz Rafaely:机构信息未在 arXiv HTML 中可靠披露
  • Dorothea Kolossa:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文研究空间音频场景下的语音增强,输入为球形麦克风阵列采集的含混响目标语音、竞争说话人与稳态白噪声混合信号,输出为保留目标定位与场景感知的双耳增强信号,难点在于去噪增益与空间线索保持天然冲突。方法链分为三步:先将高阶球谐声场统一变换到麦克风、波束成形与 Ambisonics 三种表示,再基于已知期望与干扰分量计算对角理想比值掩蔽并逐通道相乘,最后经逆变换回到 Ambisonics 域并用 HRTF 渲染双耳信号后评价。与已有工作相比,本文首次把原始麦克风掩蔽纳入与波束成形掩蔽、Ambisonics 掩蔽的公平对照,揭示了预空间分离程度决定掩蔽上限的机制。在蒙特卡洛仿真场景下,波束成形域掩蔽的SI-SDR为12.93 dB,高于Ambisonics域掩蔽的SI-SDR 9.36 dB。Ambisonics域对残留干扰的ITD误差为43 μs,麦克风域为463 μs,波束成形域为186 μs。结论仅适用于三阶 Ambisonics 加 24 通道均匀采样的仿真房间与理想掩蔽条件,未验证估计掩蔽、一阶系统或真实阵列失配下的外推能力。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


25. 元音管语言、辅音留个人:双语政治演讲的时间组织不对称

英文题目:Speaker-Specific and Language-Dependent Temporal Organization in Bilingual Political Speech

标签:#语音属性识别 | #统计分析 | #多语言 | #语音 | #韵律

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Nina Hosseini-Kivanani:机构信息未在 arXiv HTML 中可靠披露
  • Nafiseh Taghva:机构信息未在 arXiv HTML 中可靠披露
  • Peter Gilles:机构信息未在 arXiv HTML 中可靠披露
  • Oliver Niebuhr:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文输入为10名卢森堡双语政客在可比政治场合自发产出的卢森堡语与法语句子各20句共400句,输出是对时长类节奏时间组织中说话人效应与语言效应的分离与量化,难点在于自然语速、音系结构与修辞风格混杂且样本高度精英化。方法链前两步先从议会录音、发布会与访谈中筛选语调句法完整、无重叠强噪声的自发句并在Praat中校准句子边界,其句子切分结果进入辅音元音标注环节以生成交替的辅音元音区间与停顿层级。后两步再由区间序列派生辅音元音的时长均值、变异与成对变异指数及音节语速,其句子级指标聚合到每位说话人每种语言后做配对t检验与组内相关和语言解释方差分解。与既有单语魅力节奏工作相比,本文把风格对比替换为同一说话人跨语言对比,并同时报告组内相关与语言解释方差,从而区分稳定的辅音指纹与随语言重构的元音计时。在400句配对语料的说话人内比较设置下,卢森堡语的指标Rate Seg为12.3842,高于法语的指标Rate Seg 9.6180。结论仅适用于高曝光政客的正式双语演讲,无法外推到日常双语者、朗读语体或感知层面的魅力判断。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


26. 声音没有空间位置时,如何让三维人脸知道嘴该动哪里

原论文 Figure 1:Overall pipeline of the proposed method.

英文题目:Talking Head Synthesis with Facial Landmark Guidance via 3D Gaussian Splatting

标签:#音视频生成 | #生成模型 | #语音 | #音视频

评分:5.5/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ziheng Yang:机构信息未在 arXiv HTML 中可靠披露
  • Yinfeng Yu:机构信息未在 arXiv HTML 中可靠披露
  • Yongming Li:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音驱动数字人需要把时序语音波形映射为与发音同步的人脸图像序列,难点在于语音特征只携带声学时序模式而缺乏显式面部空间布局,直接驱动三维形变易造成口部错位与局部伪影。本文构建两阶段三维高斯泼溅(3D Gaussian Splatting,3DGS)流水线:先由自监督语音模型WavLM提取音频表示并经轻量编码器压缩,再由预训练音频到地标网络每帧预测68个三维关键点,接着用三平面哈希编码度量空间点与关键点余弦相似度并增强表情敏感点,最后将全局地标向量与局部特征拼接以补偿高斯平移、旋转与尺度偏移,并以深度与法线几何正则抑制稀疏视角塌陷。与仅用语音隐式驱动形变的3DGS基线相比,该设计同时引入局部选择增强与全局结构校正。在自驱动重建评测设置下,本方法的PSNR为38,高于DEGSTalk的PSNR 37。跨驱动条件使用两段合成Obama音频评估同步性能,阈值消融显示0.6的选择性与覆盖度权衡更合理。该结论仅在Lieu、Obama、May共3位说话人上验证,未报告方差、显著性与推理成本,对大姿态、多身份泛化与实时部署的适用性尚未证明。该方法的适用边界尚未验证大姿态与多身份泛化,其训练成本为在Tesla T4硬件上约一小时完成全流程训练。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


27. 说话人压过语言:卢森堡语与法语魅力韵律的方差从哪里来

原论文 Figure 1:Prosodic structure and variance partitioning.

英文题目:Speaker or Language? Explaining Variance in Charismatic Prosody Across Luxembourgish and French

标签:#语音属性识别 | #统计分析 | #语音 | #多语言 | #韵律

评分:5.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后 50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Nina Hosseini-Kivanani:机构信息未在 arXiv HTML 中可靠披露
  • Nafiseh Taghva:机构信息未在 arXiv HTML 中可靠披露
  • Peter Gilles:机构信息未在 arXiv HTML 中可靠披露
  • Oliver Niebuhr:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该研究输入为10名卢森堡双语政客在高度可比公共政治场合产出的卢森堡语与法语自发话语,输出为41个魅力相关声学韵律特征上的说话人与语言方差分解及语言方向判断,难点在于自然语料中语境内容句长性别与个体基线相互纠缠。方法链分三步推进,先经LuxASR转写加WebMAUS强制对齐与Praat人工校准得到400个语句级区间,再由ProsodyPro流水线抽取基频强度时长与嗓音质量频谱特征并做标准化,前步区间直接作为后步特征抽取单元。最后用主成分分析可视化整体位移并以线性混合效应模型估计说话人组内相关与语言固定效应,语言性别与句长作固定效应而说话人作随机截距。与以往单语准备式演讲研究不同,该工作将威望不对称双语社会语言学假设直接操作化为被试内对照而非跨组比较,使语言效应必须在个体签名之上显现。在400句双语政治演讲语料任务下,shimmer特征的Cohen’s d指标为0.90,高于final F0特征的Cohen’s d指标0.68。结论适用边界仅限卢森堡政治公开演讲中的产出声学层面,尚未验证魅力感知判断且无法外推至德语日常对话或非精英群体。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


28. 先互相增强语义再记忆历史:CTAN 用循环一致与时间门控做声音导航

原论文 Figure 1:Given visual depth images and audio spectrograms as input, CTAN first extracts modality-specific…

英文题目:CTAN: Cycle-Temporal Attention Network for Embodied Audio-Visual Navigation

标签:#声源定位 | #注意力机制 | #多模态学习 | #强化学习 | #音视频

评分:5.3/10 | 创新 1/2 | 技术严谨 0.9/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:后 50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Teng Liu:机构信息未在 arXiv HTML 中可靠披露
  • Yinfeng Yu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

具身音频视觉导航要求智能体以第一视角深度图与双耳音频频谱为输入,在未知室内环境中定位静态声源并输出导航动作,难点在于视觉与听觉特征分布异构、几何语义关联难建模,以及声音遮挡衰减导致的声音盲区。该工作提出循环时序注意力网络CTAN,先由双分支卷积编码器分别提取视觉表征与听觉表征。接着音频视觉重构交叉注意力以双向交叉注意力做跨模态翻译,并以循环一致性均方误差约束重构回原模态,得到融合表征。然后时序跨模态记忆以当前融合表征查询长度为10的滑动历史记忆并经自适应门控融合,送入GRU加Actor-Critic学习导航策略。与被动拼接不同,该框架要求跨模态翻译后仍能重构回原模态,以主动语义增强挖掘视听物理耦合先验并保持时序连续感知。在Replica未听过声音评测设置下,CTAN的SPL指标为40.7%,高于SoundSpaces的SPL指标35.8%。该结论适用边界受限于Habitat加SoundSpaces声学仿真的静态声源、无噪声深度条件,动态声源、多声源与真实部署尚未验证,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


29. 葫芦丝高音为何更暗更不混乱:亮度、锐度与分形维度的聚类证据

原论文 Figure 1:Hulusi structure: front (left) and back (right) of the hulusi.

英文题目:Timbre Analysis of the Hulusi, a Southwestern Chinese Free-Reed Instrument, using Machine Learning

标签:#音频分类 | #无监督学习 | #音乐 | #音乐信息检索

评分:5.0/10 | 创新 1/2 | 技术严谨 0.7/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.4/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后 50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Yang Xia:College of Art, Zhejiang Normal University, Jinhua 321004, China;Institute of Systematic Musicology, University of Hamburg, Hamburg 20354, Germany
  • Rolf Bader:Institute of Systematic Musicology, University of Hamburg, Hamburg 20354, Germany

📌 核心摘要

本文输入为9支不同调葫芦丝在消声室稳定吹奏下录制的单音,输出为按音高划分的音色聚类结构,难点在于自由簧与管体非线性耦合使高低音音色变化不单调,单一线性频谱特征难以刻画起振瞬态混沌性。方法链第一步将每支乐器9个指法各录10次共810条3秒录音按音高平均为81个均值音符并切分为重叠窗做傅里叶分析,输出频谱序列进入特征提取。第二步用计算声学存档提取频谱质心、锐度、分形关联维数等7维心理声学特征,输出特征向量进入聚类。第三步训练18×18 Kohonen自组织映射并用统一距离矩阵与成分平面展示聚类边界,输出高音聚集而低音散乱的拓扑映射。与仅用梅尔倒谱系数或线性频谱描述的做法相比,本文引入分形关联维数刻画起振瞬态非谐与涨落,并用拓扑保持映射揭示聚类边界,具有区分高音少泛音与中音小瞬态的实际意义。在9支葫芦丝81个均值音符的音高聚类任务下,F1指法6的音程指标为402.2,高于F1指法5的音程指标192.8。结论仅适用于受试9支乐器与特定演奏压力下的单音样本,低音区散乱无聚类且未验证听感偏好与跨演奏者泛化。该结论的适用边界受限于受试乐器与单音场景,跨曲目演奏与听感偏好的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。