共分析 44 篇论文


⚡ 今日概览

✅ 筛选入选 44 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#全双工语音交互5 篇█████
#音频分类4 篇████
#文本到语音3 篇███
#语音情感识别3 篇███
#音视频生成3 篇███
#音频理解3 篇███
#语音识别2 篇██
#音乐源分离2 篇██

📊 论文评分排行榜(44 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇AuK Technical Report: An Open-Source Foundational…8.8前25%模型报告#语音编辑
🥈TamilEOT: A Dataset and Model for Semantic End-of-Turn…8.7前25%数据集与基准#轮次切换
🥉Tri-PvP: Exposing Modality Bias in Omni-Modal Large…8.3前25%数据集与基准#音视频问答
4.Silent Metronome: Rhythmic Grounding for Live Music…8.0前25%方法研究#音乐生成
5.Direction-Preserving Active Noise Control with a…7.9前25%方法研究#主动降噪
6.What Did I Just Say? Self-Listening for Full-Duplex…7.5前25%方法研究#全双工语音交互
7.X2Streaming-ASR: wait when uncertain, emit when ready…7.5前25%方法研究#语音识别
8.TontaubeV1: Streaming Text-to-Speech with Hierarchical…7.4前50%模型报告#文本到语音
9.ECHO: Dyadic 3D Facial Motion Generation with…7.3前50%方法研究#音视频生成
10.Where Does the Sound Go? Tracing Acoustic Information…7.3前50%方法研究#音频字幕生成
11.Semantic Refinement of Universal Audio Representations…7.3前50%方法研究#音频分类
12.TASTE2: Text-Aligned Speech Modeling and Deployment…7.3前50%系统技术报告#全双工语音交互
13.Noise Adaptive Streaming Audio-Visual Speech Token…7.1前50%方法研究#全双工语音交互
14.Qwen-Audio-3.0-ASR Technical Report7.0前50%系统技术报告#语音识别
15.Clean Accuracy Does Not Guarantee Provenance…7.0前50%方法研究#音频分类
16.Beyond Coherence: Benchmarking Professional Editing…7.0前50%数据集与基准#音视频生成
17.Emotion as a Distribution: Joint Valence-Arousal…6.9前50%方法研究#语音情感识别
18.Rescuing Performance from the Demo: Co-Designing Drum…6.9前50%应用研究#音频交互
19.KABURI-TTS: Phoneme-Keyed Activity-conditioned Bi…6.7前50%方法研究#文本到语音
20.Stabilizing Instruction Supervision for Instruct-TTS…6.7前50%方法研究#文本到语音
21.Omni Interaction Agent Technical Report6.7前50%系统技术报告#全双工语音交互
22.Iterative Audio Separation with Mixture Consistency…6.6前50%方法研究#音乐源分离
23.Open-Set Vessel Re-Identification from Underwater Ship…6.6前50%方法研究#音频指纹
24.AdoDAS: A Privacy-Preserving Multimodal Challenge for…6.3前50%数据集与基准#病理语音评估
25.Disentangled Global-Local Feature Learning with E…6.3前50%方法研究#音频深度伪造检测
26.LipCoder: Voice-Enabled Coding Toolkit6.2前50%系统技术报告#语音交互
27.MVWeaver: A Hierarchical Music Video Generation Agent…6.2前50%方法研究#音视频生成
28.EviSI: An Evaluation Agent for Simultaneous…6.2前50%方法研究#语音翻译
29.TAD: Token-Adaptive Contrastive Decoding with…6.1前50%方法研究#音频问答
30.RAFM-SER++: A Lightweight Multimodal Emotion…6.1前50%方法研究#语音情感识别
31.Geometry-Informed Distributed Acoustic Scene…6.1前50%方法研究#音频理解
32.ConversationalVoice: Full-Duplex Speech Data from Real…5.9前50%系统技术报告#全双工语音交互
33.Comparing Self-Supervised and Domain-Invariant…5.8前50%应用研究#音频分类
34.Spatial Audio Coding Through Relative Room Impulse…5.8前50%方法研究#音频编码
35.From Scores to Evidence: Auditable Decisions Can…5.8前50%方法研究#音频深度伪造检测
36.BinauralVAE: Spatial Audio Reconstruction For World…5.6前50%系统技术报告#音频编码
37.PAPR-Aware Multimodal Token Transmission in MLLM-Based…5.6前50%方法研究#音视频问答
38.SETEAB: Multiscale approach with Squeeze-and…5.5前50%方法研究#语音情感识别
39.Beyond Localisation Accuracy: Sensorimotor Effects of…5.5前50%应用研究#声源定位
40.Lead Vocal Separation from Vocal Ensemble Mixtures…5.4后 50%方法研究#音乐源分离
41.Interpreting Dolphin Vocal Sequences via Multiple…5.0后 50%方法研究#音频理解
42.Reasoning Beyond Transcription: Audio Language Models…4.8后 50%应用研究#音频理解
43.Explainable Temporal Attention-based Defect Detection…4.7后 50%应用研究#音频分类
44.When Speech Meets Lips: Interpretable Audio-Visual…3.8后 50%方法研究#音视频理解

📋 论文列表

🥇 AuK 用一条指令接口统一生成与编辑:语义条件与声学潜变量如何分工

英文题目:AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing

标签:#语音编辑 | #流匹配 | #语音合成 | #统一音频模型

评分:8.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5

排名:前25% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Ziyang Ma:机构信息未在 arXiv HTML 中可靠披露
  • Zhikang Niu:机构信息未在 arXiv HTML 中可靠披露
  • Wenming Tu:机构信息未在 arXiv HTML 中可靠披露
  • Tianrui Wang:机构信息未在 arXiv HTML 中可靠披露
  • Ruiqi Yan:机构信息未在 arXiv HTML 中可靠披露
  • Junxi Liu:机构信息未在 arXiv HTML 中可靠披露
  • Yanru Huo:机构信息未在 arXiv HTML 中可靠披露
  • Nickk Huang:机构信息未在 arXiv HTML 中可靠披露
  • Yang Liu:机构信息未在 arXiv HTML 中可靠披露
  • Qicong Xie:机构信息未在 arXiv HTML 中可靠披露
  • Zeyu Xie:机构信息未在 arXiv HTML 中可靠披露
  • Hui Wang:机构信息未在 arXiv HTML 中可靠披露
  • Haitao Li:机构信息未在 arXiv HTML 中可靠披露
  • Zixuan Jiang:机构信息未在 arXiv HTML 中可靠披露
  • Yalin Li:机构信息未在 arXiv HTML 中可靠披露
  • Jie Fang:机构信息未在 arXiv HTML 中可靠披露
  • Yifan Duan:机构信息未在 arXiv HTML 中可靠披露
  • Zeyue Tian:机构信息未在 arXiv HTML 中可靠披露
  • Guangzheng Li:机构信息未在 arXiv HTML 中可靠披露
  • Haina Zhu:机构信息未在 arXiv HTML 中可靠披露
  • Shuyi Wang:机构信息未在 arXiv HTML 中可靠披露
  • Jinwen Wang:机构信息未在 arXiv HTML 中可靠披露
  • Mingyu Cui:机构信息未在 arXiv HTML 中可靠披露
  • Tian Tan:机构信息未在 arXiv HTML 中可靠披露
  • Auden:机构信息未在 arXiv HTML 中可靠披露
  • Sen Liang:机构信息未在 arXiv HTML 中可靠披露
  • Steve Yves:机构信息未在 arXiv HTML 中可靠披露
  • Shan Yang:机构信息未在 arXiv HTML 中可靠披露
  • Liefeng Bo:机构信息未在 arXiv HTML 中可靠披露
  • Zilong Zheng:机构信息未在 arXiv HTML 中可靠披露
  • Kai Yu:机构信息未在 arXiv HTML 中可靠披露
  • Eng-Siong Chng:机构信息未在 arXiv HTML 中可靠披露
  • Xie Chen:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

AuK将自然语言指令与可选音频上下文映射为目标语音,需兼顾开放生成的创造性、内容编辑的局部性、副语言与声学编辑的内容保持性及增强分离的指令选择性,异构约束与评测标准使统一建模困难。多模态大语言模型聚合层级隐状态形成语义条件,负责理解指令意图与音频上下文的联合语义。联合训练的变分自编码器将输入音频编码为参考潜变量并保留细粒度声学细节,与噪声目标潜变量共同构成声学条件。双流多模态Diffusion Transformer对语义与声学双流做联合注意力交互后经单流Transformer融合,预测整流流速度场并由VAE解码为波形,训练先经生成热身到五任务联合预训练,后训练分别做人类偏好优化与奖励强化学习。与分离式多模型及单流条件拼接方案不同,双流保留各自残差路径再统一融合的设计兼顾语义可控与声学保真,并经一致性初始化加任务路由解耦分布匹配蒸馏为四步免引导模型。在Seed-TTS-Eval基准下,AuK的平均WER错误率相对Qwen3-TTS为3.07%降至2.65%。该结论适用边界限于中英文朗读类生成与所列编辑增强语料,对强自由改写与极端退化外推尚未验证,在相同硬件、输出时长与批量条件下四步免引导Flash相对三十二步引导完整模型实现4.5倍墙钟加速,推理开销显著降低。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥈 停顿不等于结束:泰米尔电话语音的语义轮次终点如何被验证与复现

英文题目:TamilEOT: A Dataset and Model for Semantic End-of-Turn Detection in Tamil Telephone Speech

标签:#轮次切换 | #SFT | #数据集 | #语音 | #单通道

评分:8.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.5/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Santhoshkumar V:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音智能体需在每次停顿判断用户是否说完,输入为用户单通道8秒音频,输出为完整或未完整的二值 verdict,难点在于无文本时仅靠韵律区分句中思考停顿与句末结束。作者先以Silero语音活动检测切出候选边界并用转写文本过滤串音得到18485条边界,其输出直接作为待标样本进入下一步。接着用音频大模型重标完整性标签替代规则标签得到训练集,该标签输出直接作为监督信号进入微调。然后微调Smart Turn v3的Whisper编码器加注意力池化分类头,并经动态int8量化与真实VAD回放做服役校验。该链条把有行为见证的换人边界与无见证的转写分段暂停区分开来,避免把转写员分段习惯误当语义完结,这是相对零样本直接沿用英文阈值的关键差异。在30个未见通话组成的4168条测试集下,微调后base模型相对零样本基线的准确率从70.30%提升至86.13%,ROC-AUC从0.751提升至0.921。结论适用边界受限于窄带泰米尔电话对话,宽带噪声与泰英混用等场景尚未验证,且标签噪声天花板约97.1%构成失败条件。重标全量数据花费5.69美元,单线程笔记本CPU推理延迟低于150毫秒,base动态量化模型仅21MB。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥉 Tri-PvP:用感知与命题的正交冲突把模态偏置从证据形式偏置中剥离

英文题目:Tri-PvP: Exposing Modality Bias in Omni-Modal Large Language Models through Perceptual-Propositional Evidence Conflicts

标签:#音视频问答 | #基准设计 | #多模态学习 | #音频分类 | #模型评估

评分:8.3/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Yen-Ting Piao:NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)
  • Shu-Yun Chen:NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)
  • Chin-Hui Chu:NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)
  • Chun-Wei Chen:NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)
  • Shih-Yun Shan Kuan:NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)
  • Hung-yi Lee:NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)
  • Yun-Nung Chen:NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)

📌 核心摘要

全模态大语言模型需在单次前向中联合处理视觉、音频与文本,当三流证据冲突时模型会系统性偏向某一模态,且既有基准将知觉信号与命题陈述混在同一通道导致偏置归因混淆。Tri-PvP首先以认识论区分为视觉与音频分别构造知觉形态的真实图像与录音和命题形态的模板化陈述并渲染为图文或合成语音,文本恒为命题形态。随后将四种证据组合与同一标签三元组在动物等4个领域各500三元组上配对实例化并以开放式无偏问题呈现,使跨条件比较复用同一资产。最后用GPT-5.4 nano裁判将自由文本回答映射到含BIAS_IMAGE等8类偏置标签并量化偏置分布。与以往三模态冲突基准不控制证据形态不同,该设计实现了模态与证据形态的正交控制,使偏置可干净归因于模态与知觉-命题不对称而非标签不平衡。在OmniBench基准下,对比解码的准确率为37.4%相对基线解码的38.4%降低1.1个百分点且偏置分布重分配而非均匀下降。该结论适用边界受限于日常感知尺度的4个领域,扩展到科学图表等复杂命题尺度及带可靠性提示的指令场景尚未验证,推理开销上对比解码需额外一次前向计算且在单卡上完成全量评测约需24小时。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


4. 耳朵有了,还要给手表:用外部节拍网格锚定实时伴奏

英文题目:Silent Metronome: Rhythmic Grounding for Live Music Accompaniment

标签:#音乐生成 | #自回归模型 | #音乐 | #严格因果 | #流式处理

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Kevin Bretz:机构信息未在 arXiv HTML 中可靠披露
  • Derya Soydaner:机构信息未在 arXiv HTML 中可靠披露
  • Aske Plaat:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

实时伴奏需在严格因果条件下为到达的混合音频流逐帧生成对位声部,输出必须先于对应输入提交且只能依赖自身有噪历史推断速度与拍位,因而极易产生节奏漂移。Silent Metronome先由符号tempo map解析每帧拍内相位与小节内相位并拼接局部速度均值速度拍号嵌入,经两层感知机映射为逐帧调制向量注入各解码器块做自适应层归一化以锁定网格。解码器仍基于流式编解码器自回归生成伴奏词元,调制向量独立于生成历史故不受自回归误差污染。训练期在隐状态上附加音高多标签与恒Q谱预测及前瞻0.2/0.5/0.8秒未来词元的多任务头以塑造和声与规划能力,推理时全部丢弃。与从因果音频推断节奏的已有方法不同,该机制把节奏作为与生成无关的外部时钟共享,从源头消除漂移而无需前视缓冲。在Slakh2100测试集的严格因果评测下,完整模型相对因果基线的Beat-F指标从0.133升至0.432方向为提升。其适用边界在于训练与评测均使用无噪oracle网格,尚未验证真实录音与伙伴偏离网格时的行为。该方案每块预计算调制带来约5%推理开销,单卡A100训练200k步为其训练成本支撑。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


5. 同一组滤波器又要抵消又要透明:方向条件网络如何做保向降噪

英文题目:Direction-Preserving Active Noise Control with a Conditional Control-Filter Estimation Network

标签:#主动降噪 | #CNN | #麦克风阵列 | #空间音频

评分:7.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ziyi Yang:机构信息未在 arXiv HTML 中可靠披露
  • Zhengding Luo:机构信息未在 arXiv HTML 中可靠披露
  • Boxiang Wang:机构信息未在 arXiv HTML 中可靠披露
  • Libin Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Woon-Seng Gan:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

方向保持主动降噪需从6通道混合参考观测与指定期望方向估计多通道控制滤波器,在衰减非期望方向噪声的同时保留期望方向自然直达声,难点在于同一滤波器组须同时最小化残留噪声能量并抑制期望分量诱发的控制响应。该方法先对0.5s混合参考做256点短时傅里叶变换保留复数多通道相位关系并送入三块卷积编码器,同时将期望方向周期编码送入两层方向编码器得到32维嵌入。随后各卷积块经块专属FiLM头把方向嵌入映射为通道调制参数并在归一化后加权偏置注入声学特征,输出经自适应池化展平为2048维声学表示。最后解码器映射为全部通道频点复系数并经解归一化与Hermitian补全逆变换重建为每通道256抽头FIR滤波器,训练经已知16抽头次级路径前向模型以分量分离损失联合惩罚残留噪声与期望响应。相对解析空间选择性主动降噪每观测求解带约束正则化正规方程,单次前向估计无需分离分量与矩阵求逆即可实现方向条件化抵消保持权衡。在3300例主仿真阵列评测设置下,DP-ANC的噪声衰减指标NR相对解析SSANC代表设置从18.28dB提升至22.82dB且输出信噪比指标SNRout从7.94dB提升至12.52dB。其适用边界受限于期望与噪声夹角不小于15°的主评测条件,夹角趋近0°时空间流形相干导致抵消与保持不可兼得,混响移动声源与多声源扩展尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


6. 打断时模型以为说了什么与用户实际听到什么不一致:用已播放语音回灌来锚定进度

英文题目:What Did I Just Say? Self-Listening for Full-Duplex Speech Models

标签:#全双工语音交互 | #多模态学习 | #基准测试 | #数据集构建 | #流式处理

评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.4/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Xuanning Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Junyi Ao:机构信息未在 arXiv HTML 中可靠披露
  • Xiaotong Liu:机构信息未在 arXiv HTML 中可靠披露
  • Tom Ko:机构信息未在 arXiv HTML 中可靠披露
  • Benyou Wang:机构信息未在 arXiv HTML 中可靠披露
  • Haizhou Li:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

全双工语音模型需在持续监听用户语音的同时生成并播放自身语音,输入为连续用户音频流与待合成文本,输出为实时语音与文本控制,难点在于文本生成、语音合成与客户端播放三者异步,模型已生成文本远超实际已播放前缀,导致被打断后无法准确锚定用户实际听到的内容边界。方法链分三步:第一步以40 ms逻辑步将交互离散为用户语音、已播放模型语音与模型文本三通道时间对齐序列并序列化为[H]=[u0,s0,x0,u1,s1,x1,…];第二步将已到达用户端播放的模型波形帧通过语音输入通路回灌至自听通道s_t,无播放时填<silence>,使下一文本预测以可听前缀为因果条件;第三步在模型文本通道用<overlap>/<stop>/<continue>/<wait>等原生控制词在400 ms窗内联合判别打断与backchannel并直接驱动TTS启停,上一阶段的播放边界显式成为下一阶段的控制输入。与仅依赖生成侧文本或隐状态追踪进度的现有全双工模型不同,该机制以客户端已确认的播放前沿显式接地模型状态,避免语义规划超前于播放导致的锚定偏差。在AnchorSpeech-test评测下,三通道自听模型的锚定准确率相对最强商用基线GPT-Realtime-2.1从43.8%升至73.0%提升29.2个百分点且受控对比中相对同骨干同数据的双通道基线从7.8%升至73.0%。该结论适用边界受限于AnchorSpeech以计数、字母表、星期月份等确定性有序序列为主的细粒度锚定任务,对开放域语义锚定与长程多轮任务的外推尚未验证。训练成本为基于Qwen2.5-Omni-7B的两阶段rank-32 LoRA微调约3000小时语音数据在16张NVIDIA H100硬件上约30小时完成,推理开销保持亚秒级停止与响应延迟且增加自听通道后延迟几乎不变。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


7. 流式识别不是等多久,而是每个字该等多久:X2Streaming-ASR 的位置相关提交

英文题目:X2Streaming-ASR: wait when uncertain, emit when ready for streaming ASR

标签:#语音识别 | #强化学习 | #流式处理 | #语音

评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zhiwei Lin:机构信息未在 arXiv HTML 中可靠披露
  • Kaiqi Fu:机构信息未在 arXiv HTML 中可靠披露
  • Rime Wen:机构信息未在 arXiv HTML 中可靠披露
  • Zehan Liu:机构信息未在 arXiv HTML 中可靠披露
  • Shawn Qin:机构信息未在 arXiv HTML 中可靠披露
  • Roy Gan:机构信息未在 arXiv HTML 中可靠披露
  • Hao Wang:机构信息未在 arXiv HTML 中可靠披露
  • Qian Wang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

流式自动语音识别输入为持续到达的音频,输出为逐字符一次性不可修改的部分转写,难点在于每个字符消歧所需的未来上下文不同,统一延迟难以兼顾准确率与提交速度。X2Streaming-ASR将任务拆为提交时机与提交内容,第一阶段训练增量识别能力,仅识别声学已结束的内容,并将其作为后续探测器与初始化权重。第二阶段用第一阶段模型自探测每个字符的最早正确提交轨迹,再以联合监督暖启动识别能力与初始提交策略,但不把探测时间视为真值。第三阶段冻结编码器并用组相对策略优化精炼提交策略,按字符对齐分配误差与等待代价,使等待后做对与提前做对的行为直接获得奖励。与固定分块或全局前视相比,该机制实现位置相关的提交决策,在不确定位置继续等待而在证据充分处立即提交,而非整体平移所有提交点。在5个中文测试集评测设置下,X2Streaming-ASR的延迟指标相对Zipformer与Paraformer在线版从409–585ms降至27–84ms,并在AISHELL-1上以1.96%错误率取得所评流式系统最优。该结论适用边界受限于强制对齐端点定义的延迟口径与中文朗读及会议语料验证,尚未验证其他语种与强噪声远场交互中的泛化。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


8. 先定语义再补声音:TontaubeV1 用分层编解码与有界上下文做流式语音合成

英文题目:TontaubeV1: Streaming Text-to-Speech with Hierarchical Codec Modeling and Bounded Context

标签:#文本到语音 | #自回归模型 | #语音 | #流式处理 | #高效推理

评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Fritz Cremer:机构信息未在 arXiv HTML 中可靠披露
  • Jonathan Cremer:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作处理流式零样本文本到语音合成,输入为已口语化文本与至多约 60 秒参考音频,输出为连续语音,难点在于长文本韵律一致性、有界上下文与首包延迟的兼顾。方法链条分为四步:语义阶段由大模型生成第一码本并固定时长与语调骨架;三个小模型逐级补足声学残差且不改写语义轴;文本与音频以共享逻辑位置与成对边界标记维持跨块对齐;重叠非因果重建经声学编码器转入因果解码器实现流式输出。与单遍交织或共享残差模块的已有分解不同,该设计把韵律容量集中于语义流并让声学阶段无跨块状态,从而支持并发精炼与有界缓存。在 400 段英文有声读物成对评测中,系统韵律偏好得分为 50.1%,与 ElevenLabs Flash v2.5 基本持平,正确性为 48.9%。结论仅限于英文朗读韵律与词级正确性,未验证德语与多语、音色相似度、长篇连贯与流式音质。单卡首音频约 200 ms,单路端到端实时因子约 0.08,8 路并发聚合实时因子约 0.02。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


9. 不对称不确定性分解:用确定性锚点保口型、用随机残差补倾听

英文题目:ECHO: Dyadic 3D Facial Motion Generation with Asymmetric Deterministic Articulation and Stochastic Reaction

标签:#音视频生成 | #流匹配 | #向量量化 | #语音

评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zhuoqiang Cai:机构信息未在 arXiv HTML 中可靠披露
  • Yujie Sun:机构信息未在 arXiv HTML 中可靠披露
  • Chaoyue Niu:机构信息未在 arXiv HTML 中可靠披露
  • Hongyun Yu:机构信息未在 arXiv HTML 中可靠披露
  • Zhiwen Chen:机构信息未在 arXiv HTML 中可靠披露
  • Chengfei Lv:机构信息未在 arXiv HTML 中可靠披露
  • Fan Wu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该任务输入为目标自语音与对方语音双流音频,输出为含50维表情、1维颌与3维颈姿的54维FLAME参数序列,难点在于说话段需强语音约束的稳定构音而倾听段仅弱条件约束呈现点头、微转头等多模态反应,二者时序交替且不确定性分布极不均匀。方法首先以共享HuBERT编码器提取自语音全分辨率特征与对方语音低通上下文,为后续不对称建模提供分层条件。接着确定性锚点网络在该条件下回归语音主导的稳定基线轨迹,其输出作为残差建模的参考。随后残差流匹配分支在标准化残差空间学习条件速度场,仅对锚点未解释的交互变异建模并通过4步RK4积分与早期退火扰动采样生成残差,最后经表情、颌、颈三组可学习缩放注入残差完成融合,训练期在有效倾听窗口上以冻结运动记忆码本作原型正则而推理时旁路。与全序列统一随机或纯回归基线不同,该不对称分解将稳定性与多样性分配到不同子空间与通道,使构音保守而颈部与表情保留更大自由度。在统一基准评测下,ECHO相对最强同输入随机基线ProbTalk3D的FD指标从7.51降至2.80且SID指标从2.34升至4.06。该结论适用边界受限于离线段级生成与FLAME系数指标下的验证,尚未验证实时流式、跨语种与像素级渲染外推,训练成本为单张NVIDIA RTX 4090上约10小时完成主生成器训练且单样本推理开销的实时因子为0.017。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


10. 声音去哪了:末层仍可线性读出却在选项字母上失准的读出瓶颈

英文题目:Where Does the Sound Go? Tracing Acoustic Information Loss in Audio-Conditioned LLMs

标签:#音频字幕生成 | #多模态学习 | #语音情感识别 | #可解释性 | #音频大模型

评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Song-ha Jo:Seoul National University
  • Sehyun Lee:KAIST
  • Soyoon Kim:机构信息未在 arXiv HTML 中可靠披露
  • Jaesik Choi:KAIST
  • Sanghyuk Choi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频条件大语言模型以波形为输入、以文本为输出,实际难点在于韵律、情绪与环境声等非词法线索易被转写偏置覆盖而难以在答案中体现。本文构建编码器-投影器-大语言模型三段流水线,先以Whisper-Tiny/Small与EnCodec、DAC-VAE、WavTokenizer五种冻结前端在统一Qwen3.5-4B上对比转写监督与重构式表征的下游表现。再逐阶段用线性探针与距离几何追踪可恢复性,检验判别性声学结构经投影器与各LM层至末层隐状态的保留程度。最后冻结全栈仅微调输出头W_U的候选字母行以因果检验读出瓶颈,排除表征缺失的解释。与把失效归因于Whisper类前端信息丢失的常见解释不同,该设计将编码器保真与词汇读出对齐解耦,证明瓶颈可位于末层到字母的路由而非内部容量,对齐失效可成为主导瓶颈。在ASR/情绪/声学描述多任务套件下,EnCodec的WER相对对齐基线从20.80降至10.65,方向为下降且探针准确率仍可比MCQA准确率高出最高83个百分点。该结论适用边界受限于受控MCQA设置与小尺度指令模型的验证范围,开放生成与更大规模模型的外推尚未验证,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


11. 冻结表征上分离对比损失与正确配对的语义精炼

英文题目:Semantic Refinement of Universal Audio Representations through Audio-Description Alignment

标签:#音频分类 | #对比学习 | #自监督学习 | #CTC | #统一音频模型

评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Lejun Min:机构信息未在 arXiv HTML 中可靠披露
  • Junyu Dai:机构信息未在 arXiv HTML 中可靠披露
  • Ruichen Zheng:机构信息未在 arXiv HTML 中可靠披露
  • Xinyue Fan:机构信息未在 arXiv HTML 中可靠披露
  • Yang Xiang:机构信息未在 arXiv HTML 中可靠披露
  • Huaichen Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Xingchen Song:机构信息未在 arXiv HTML 中可靠披露
  • Yufei Shi:机构信息未在 arXiv HTML 中可靠披露
  • Han Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Xiangang Li:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

通用音频表示需以原始波形为输入,输出在语音、音乐、环境声上均可被不同容量下游模型读取的序列表示,难点在于掩码声学预训练能保留时频细节却缺乏围绕场景、风格、乐器的语义组织,且额外对比目标的增益易与正确语义对应混淆。本文以12块Conformer将24kHz音频转为25Hz的128维梅尔序列为起点,先延续BEST-RQ掩码预测保留上下文声学,再叠加梅尔/色度重建与面向转录/歌词的CTC构成声学-词汇基座,其输出时序状态直接作为后续语义对齐的输入。随后对音乐与环境声片段引入音频-描述对比对齐,通过掩码时序平均与投影得音频嵌入,以两层Transformer编码冻结多语BERT描述,二者经对称多正样本InfoNCE按域加权对齐,并在片段级之上探索音乐段落与环境声时空动态的时序/事件细粒度变体。与已有音频-语言方法在不同配方下报告增益不同,关键差异在于采用配对内按域与长度分层的打乱描述对照,使正确与打乱共享初始化、音频暴露顺序与对比权重以分离对应效应,并以冻结编码器时序平均线性探针与保留全序列的LoRA适配LLM双读出检验可达性。在冻结编码器且14数据集领域均衡的Task1分类评测设置下,正确配对的T1平均得分相对声学+CTC对照从63.55分升至68.20分、提升4.66分,线性探针下正确配对较打乱对照高4.07分且占总增益87%并在三粒种子三领域一致。该结论适用边界受限于作者内部5:5:1语音/音乐/环境声分布与冻结迁移协议,尚未验证开放域噪声与长时序生成等外推,且打乱对照在序列感知LLM下置信区间跨零显示强模型读出时的失败条件。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


12. 序列不等长就保不住语义:TASTE2 用一词一隐变量走向可打断对话

英文题目:TASTE2: Text-Aligned Speech Modeling and Deployment toward Full-Duplex Voice Interaction

标签:#全双工语音交互 | #多模态学习 | #轮次切换 | #语音合成 | #流式处理

评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Yi-Chang Chen:机构信息未在 arXiv HTML 中可靠披露
  • Chun Wei Chen:机构信息未在 arXiv HTML 中可靠披露
  • Dien-Ruei Wu:机构信息未在 arXiv HTML 中可靠披露
  • Jie Lin:机构信息未在 arXiv HTML 中可靠披露
  • Yu-Kuan Fu:机构信息未在 arXiv HTML 中可靠披露
  • Yang-Hsien Lin:机构信息未在 arXiv HTML 中可靠披露
  • Eddie TC Huang:机构信息未在 arXiv HTML 中可靠披露
  • Simon See:机构信息未在 arXiv HTML 中可靠披露
  • Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露
  • Da-Shan Shiu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

全双工语音交互需以流式输入同步完成语义理解、轮次抢占与让出判断、被打断即停与增量语音合成,还须保留预训练文本能力与副语言线索。TASTE2先用冻结Distil-Whisper编码器加注意力聚合器为每个文本token抽取一个连续音频隐变量,实现文本速率的模态对齐表示。接着基于Qwen2.5-7B的口语语言模型以加权求和融合文本嵌入与对齐隐变量,自回归预测文本token及其滞后一位的音频隐变量对,并经TIES合并注入指令遵循向量后做打断感知对话微调。最后基于Qwen2.5-0.5B的语音解码器将该隐变量对映射为CosyVoice2的S3单元并经流匹配与声码器增量合成,由VAD触发与模型门控共同驱动VoiceBot部署。与交错插入声学token的方案不同,该设计使序列长度严格等于文本长度,避免长度膨胀下的声学负载挤占语义精度。在LLaMA-Questions基准语音问答任务下,TASTE2(Merge)的准确率保持率相对TASTE2(Direct)为92.4%升至98.2%,方向为明显提升。该结论适用边界受限于平滑轮次接管延迟较高、自然对话韵律与多属性显式副语言控制仍弱,且尚未验证长时噪声与多说话人外推范围;部署实测显示双卡NVIDIA RTX A6000上平均首音频延迟经TensorRT优化后为2701毫秒,合成器仍是主要瓶颈。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


13. 噪声越大越要看嘴型:AV-STE 在冻结对话模型前修复语义口令

英文题目:Noise Adaptive Streaming Audio-Visual Speech Token Enhancement for Robust Full-Duplex Spoken Dialogue Models

标签:#全双工语音交互 | #多模态学习 | #音视频 | #流式处理 | #鲁棒性

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Bella Godiva:Integrated Vision and Language Lab, KAIST, South Korea
  • Yeonju Kim:Integrated Vision and Language Lab, KAIST, South Korea
  • Yong Man Ro:Integrated Vision and Language Lab, KAIST, South Korea

📌 核心摘要

全双工语音对话需同时听与说,输入为带噪语音与目标说话人唇部视频,输出为可直接送入冻结对话模型的离散语义语音令牌,难点在于背景噪声与重叠说话人会击穿纯音频Mimi语义令牌并导致应答不连贯。AV-STE先以因果化流式AV-HuBERT音视频编码器从噪声音频与唇动中抽取同步抗噪特征并以4帧前视平衡对齐与延迟,输出映射至Mimi语义词表空间进入融合阶段。接着以视觉特征为查询的软令牌交叉注意力从模糊分词分布中检索语音证据,再以基于熵先验的噪声自适应门控按帧权衡语音与视觉两路,得到增强语义令牌序列。最后仅替换第一路语义码本而保留其余声学码本,并流式送入冻结Moshi生成应答,从而保留原有对话与轮次接管行为。与直接微调对话模型以接入视觉的路线不同,该设计把视觉增强放在令牌前端并保持语言模型冻结,因而无需昂贵多模态训练且保留预训练对话能力。在LRS3同库多人说话人干扰评测设置下,AV-STE+Moshi的GPT得分相对冻结Moshi基线从1.42升至1.91,明显高于基线。该结论适用边界在于依赖可靠唇部视频,干净语音存在表示失配且跨域干净令牌准确率下降,遮挡缺失视频等失败条件尚未验证。训练成本约为单卡A6000上73 GPU小时且模型含335M参数,流式推理引入160ms前视延迟。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


14. 从逐字转写到可直接归档:Qwen-Audio-3.0-ASR 如何把指令、上下文与热词塞进同一遍解码

英文题目:Qwen-Audio-3.0-ASR Technical Report

标签:#语音识别 | #混合专家模型 | #多语言 | #流式处理

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.3/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Chuanmeng Bian:Alibaba Token Foundry
  • Daren Chen:Alibaba Token Foundry
  • Peixin Chen:Alibaba Token Foundry
  • Zhigao Chen:Alibaba Token Foundry
  • Zhiyun Fan:Alibaba Token Foundry
  • Zhifu Gao:Alibaba Token Foundry
  • Bo Gong:Alibaba Token Foundry
  • Qing Gu:Alibaba Token Foundry
  • Jiajun He:Alibaba Token Foundry
  • Yawei Hu:Alibaba Token Foundry
  • Yunjie Ji:Alibaba Token Foundry
  • Jingbei Li:Alibaba Token Foundry
  • Xiangang Li:Alibaba Token Foundry
  • Xu Li:Alibaba Token Foundry
  • Zengxi Li:Alibaba Token Foundry
  • Zheng Li:Alibaba Token Foundry
  • Chengdong Liang:Alibaba Token Foundry
  • Baiji Liu:Alibaba Token Foundry
  • Ying Liu:Alibaba Token Foundry
  • Bin Ma:Alibaba Token Foundry
  • Yiping Peng:Alibaba Token Foundry
  • Yuezhang Peng:Alibaba Token Foundry
  • Zhendong Peng:Alibaba Token Foundry
  • Yu Pu:Alibaba Token Foundry
  • Yang Shi:Alibaba Token Foundry
  • Xin Shu:Alibaba Token Foundry
  • Jian Tang:Alibaba Token Foundry
  • Biao Tian:Alibaba Token Foundry
  • Peiyao Wang:Alibaba Token Foundry
  • Tianzi Wang:Alibaba Token Foundry
  • Wen Wang:Alibaba Token Foundry
  • Wupeng Wang:Alibaba Token Foundry
  • Cheng Wen:Alibaba Token Foundry
  • Yuzhong Wu:Alibaba Token Foundry
  • Zijian Xia:Alibaba Token Foundry
  • Yunchong Xiao:Alibaba Token Foundry
  • Nan Yang:Alibaba Token Foundry
  • Jianwei Yu:Alibaba Token Foundry
  • Jixing Yu:Alibaba Token Foundry
  • Binbin Zhang:Alibaba Token Foundry
  • Lei Zhang:Alibaba Token Foundry
  • Sitong Zhao:Alibaba Token Foundry
  • Guangdong Zhou:Alibaba Token Foundry
  • Yuan Zhou:Alibaba Token Foundry
  • Jianheng Zhuo:Alibaba Token Foundry

📌 核心摘要

自动语音识别需以多语言方言连续语音为输入,输出可直接阅读的文本,实际难点在于方言口音变体、动态长尾实体热词、自发口吃失流利及跨句实体不一致难以仅靠声学证据消解。该系统先用BEST-RQ自监督目标预训练多层Transformer音频编码器,提取鲁棒声学表示并为后续对齐提供初始化。接着冻结音频编码器,联合训练两层Transformer音频适配器与Qwen混合专家大模型解码器,以文本交叉熵损失建立音频文本对齐,编码器顶部CTC解码器输出粗假设以支撑热词定制与长音频对齐。随后经高质量数据冷却、有监督指令微调与基于分组相对策略优化的强化学习,以字错率与关键词热词上下文复合奖励注入语言控制与生产偏好。与级联外挂大模型改写方案不同,目标语言、历史上下文、分级热词与润色指令均与音频表征共同进入同一次自回归解码,避免额外重写并始终以音频为主要证据。在Common Voice 15基准评测下,Qwen-Audio-3.0-ASR的宏平均错误率从次优竞品的5.01%降至4.57%,方向为越低越好。该结论适用边界限于中英优势语种与作者自定工业套件,在FLEURS部分语种与低资源方言上优势减弱,跨域泛化尚未验证。其流式变体在400毫秒算法延迟条件下首包延迟低于200毫秒,强化学习训练在32卡A100硬件上约一日完成,长上下文解码的推理开销随历史长度增加而上升。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


15. 干净高分守不住转码:音频来源归属的编解码压力实测

英文题目:Clean Accuracy Does Not Guarantee Provenance Robustness: A Prospective Codec-Stress Evaluation of Audio Attribution

标签:#音频分类 | #评测协议 | #鲁棒性 | #语音 | #统计分析

评分:7.0/10 | 创新 1.3/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Gang Shi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频来源归属需在转码后音频上判定合成系统或编解码器来源,输入为单阶段编解码器传输后语音、输出为闭集来源标签,其难点是干净基准高分能否迁移到真实传输缺乏可信度量。方法先由保真元数据计算支撑区并经哈希提交冻结,该支撑区输出决定后续可检验的编解码器网格范围。再训练冻结表征与线性或度量头,其干净门限合格输出进入单阶段编解码器网格下的宏平均F1损失度量。度量采用成分级自助同步带推断,前一步的冻结网格保证推断不受结果回看污染。与检测鲁棒性扫描不同,本工作以成分级推断、前瞻注册与匹配门限为核心机制差异,其实际意义是区分操作点效应与编解码器家族效应。在ASVspoof 2019 LA评测任务下,MP3 8 kbit/s条件下WavLM-Base+的Macro-F1指标性能相对干净基准损失53.5点、同步带为43.5到63.6点呈大幅下降。结论适用边界仅限所测闭集任务、双语料、三表征与单阶段网格,不覆盖开集与级联转码等失败条件,相关外推尚未验证。前瞻计算共耗费9.34小时GPU壁钟,峰值显存3.4 GB,57057次变换零失败,所用硬件与计算量已如实披露。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


16. 从看得连贯到剪得准确:CutCraft 如何把多镜头音画的剪辑执行变成可核验的度量

英文题目:Beyond Coherence: Benchmarking Professional Editing-Technique Execution in Multi-Shot Audio-Video Generation

标签:#音视频生成 | #基准设计 | #音视频 | #基准测试

评分:7.0/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Tianyi Zeng:Shanghai Jiao Tong University
  • Junchao Liao:Alibaba Group
  • Yujie Wei:Fudan University
  • Ziying Zhang:Alibaba Group
  • Litao Li:Alibaba Group
  • Tianyi Wang:UT Austin
  • Zhichao Wei:Alibaba Group
  • Shuyao Xu:Alibaba Group
  • Wenwen Qiang:Institute of Software, Chinese Academy of Sciences
  • Siyu Zhu:Fudan University
  • Zhenghao Zhang:Alibaba Group
  • Long Qin:Alibaba Group

📌 核心摘要

CutCraft针对多镜头音视频生成中高连贯性不等于剪辑指令可执行的难点,输入为附加显式剪辑规约的结构化多镜头提示,输出为15秒横屏音视频并要求精确控制镜头数量、时长节奏、转场类型、音画异步与蒙太奇语义,难点在于生成结果常出现镜头合并缺失与时序错位导致后续度量失准。方法链第一步以TransNetV2切分时序单元并由视觉语言模型对齐至真值镜头计划,输出匹配/合并/缺失的对齐结构进入第二步。第二步构建三条证据路径的层次化混合评估:路径一用专家模型直评可度量信号,路径二用专家证据加视觉语言模型仲裁,路径三用视觉语言模型问答对16个维度按量表打分,整体均值作为总体分。第三步以规划-分镜合成-后处理合成的智能体基线显式实现溶解、擦除及J-cut/L-cut等时序,承接对齐与评分所暴露的离散控制短板。与仅评估美学质量或同步性的已有基准相比,关键差异在于将蒙太奇与受控音画异步从代理指标转为可定位的执行度量,使高美学分与剪辑合规性的弱相关得以显式检验。在CutCraft基准的样本位移对照评测下,Seedance 2.0的Overall得分从错位条件的0.247升至对齐条件的0.629且A2事件执行得分从0.003升至0.800方向为对齐后显著提升。该结论适用边界受限于2至6镜头、15秒横屏场景且依赖Qwen3.5-Omni等裁判模型,对更长叙事或强物理交互的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


17. 把情绪当分布输出:在严格说话人无关评估下用 9×9 V-A 网格做可复述的多模态情绪识别

英文题目:Emotion as a Distribution: Joint Valence-Arousal Probability Learning for Speaker-Independent Multimodal Emotion Recognition

标签:#语音情感识别 | #多模态学习 | #状态空间模型 | #评测协议 | #统计分析

评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.4/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Tingyi Lin:机构信息未在 arXiv HTML 中可靠披露
  • Wen-Ren Yang:机构信息未在 arXiv HTML 中可靠披露
  • Kuanwei Chen:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

任务以语音与文本为输入,在IEMOCAP四分类(angry/happy+excited/sad/neutral,约5.5k条)上同时输出类别并输出效价-唤醒度平面上的9×9概率分布,难点在于情感的渐变与混合性以及说话人无关泛化易被随机划分泄露所夸大。方法链先以冻结BERT-base与可切换语音前端分别编码文本与语音并经共享投影对齐维度,再送入时序骨干进行模内时序建模。时序特征经双向跨注意力实现模间对齐与融合后进入双头输出,分类头输出类别,9×9 V-A分布头以二维各向同性高斯软目标经KL散度与交叉熵联合监督并以质心读出连续值。相对以往仅软化类别标签或分别回归效价与唤醒度方差的做法,该工作将输出空间直接设为离散化联合V-A网格上的归一化分布,无需参数化假设即可表达多峰与非邻接质量并提供可校准的不确定性表征。在IEMOCAP说话人无关5折留一会话评测设置下,双头Mamba系统相对同管线Transformer跨注意力基线的非加权准确率从70.0%升至73.0%(三种子均值±0.3%)。分布质心对效价与唤醒度的CCC均为0.66,且分布熵与类别投票歧义仅呈弱正相关、联合分布近乎可分解,表明分布主要提供表征而非置信度信号。适用边界在于高斯软目标为统一先验而非实测标注者分歧、网格截断带来边缘熵偏差,且跨语料零样本与长对话流式场景尚未验证,受限于当前话语长度;推理开销上Mamba在550至2750帧长度下未呈现延迟或峰值显存优势,准确率小幅领先但未达统计显著。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


18. 当打击乐手拿起鼓刷:用持续手势对抗鼓机映射的技术俘获

英文题目:Rescuing Performance from the Demo: Co-Designing Drum Gesture Mappings with a Percussionist

标签:#音频交互 | #RNN | #音乐 | #实时处理 | #用户研究

评分:6.9/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Jordie Shier:机构信息未在 arXiv HTML 中可靠披露
  • Teresa Pelinski:机构信息未在 arXiv HTML 中可靠披露
  • Charalampos Saitis:机构信息未在 arXiv HTML 中可靠披露
  • Andrew Robertson:机构信息未在 arXiv HTML 中可靠披露
  • Andrew McPherson:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文任务是将鼓组演奏的声学输入实时映射为合成器控制,以在保留鼓手既有演奏技巧的同时拓展音色表达,难点在于既有工具依赖起音检测(onset detection)将演奏离散化,无法表征刷奏(brushing)、划奏(drawing)与滚奏(buzz roll)等连续手势,且映射隐含的表征假设易导致技术俘获。方法链分3步:先以基于FluCoMa的起音检测与梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients, MFCC)配合多层感知机(Multilayer Perceptron, MLP)完成离散打击分类并触发音符或音色重映射;再为连续手势训练轻量GRU网络,以32维梅尔频带或3维起音激活包络为输入输出二值手势状态与连续响度调制,经RTNeural以750 Hz帧率实时推理并映射至Ableton Live参数;最后以循环器(Looper)、音序列器(NoteSeq)与预设步进器(PresetStep)等演出装置组织音乐结构,支撑2天录音棚式创作。与仅依赖离散触发的既有增强打击乐系统相比,该机制差异在于将连续手势作为独立可调制类别而非离散事件序列,意义是让擦奏类姿势能驱动连续参数而非误触发。原文未提供可核对的关键定量结果,未报告与基线在识别精度、时延或用户评价上的对比数值。结论适用边界限于与单一职业鼓手在实验室环境下的共创与Max for Live(Max4Live, M4L)生态,未验证跨演奏者、跨风格与舞台长期使用的外推性。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


19. 用可控的音素光栅把重叠说出来:KABURI-TTS 如何做双通道对话合成

英文题目:KABURI-TTS: Phoneme-Keyed Activity-conditioned Bi-channel Utterance Rendering for Interaction

标签:#文本到语音 | #流匹配 | #语音 | #多通道 | #LoRA

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.4/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ryuichiro Higashinaka:机构信息未在 arXiv HTML 中可靠披露
  • Shinnosuke Takamichi:机构信息未在 arXiv HTML 中可靠披露
  • Tetsuji Ogawa:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该任务输入为文本与双说话人参考语音,输出为双通道、单人单通道的立体声对话波形,难点在于重现重叠、打断与简短应答等同时性现象且需使重叠时机可控而非由模型隐式随机决定。方法链第一步由外部模块将文本转化为按25 fps对齐的音素栅格与语音活动栅格,明确每帧每通道的音素与发声状态。第二步基于活动栅格衍生出包含发声、起止与切换等在内的10类帧级交互状态条件,将对话交互显式编码为条件信号。第三步将上述栅格与交互条件连同DACVAE编码的参考声纹一起注入12层整流流DiT,通过双通道批叠加共享权重回归速度场并经DACVAE解码为48 kHz波形,条件偏置在深层持续注入以维持时序一致性。与直接从文本序列化生成混合或立体声的方法不同,该设计将重叠显式参数化为可外部编辑的栅格输入,使同时发声可被精确控制并避免隐式学习导致的交替倾向。在LLM-jp-Zoom1的Test chunk Eval评测设置下,KABURI (GT)的交互自然度得分从Irodori (GT)的2.61升至3.64,方向为显著提升且在五点量表上保持优势。结论的适用边界受限于30秒窗、日语闲聊域与60人语料,对长时对话、其他语言、栅格构建误差及主观评测者偏差的外推尚未验证。训练成本为声学模型在7张Quadro RTX 6000上以有效批量28训练30k步、时长预测器在1张同型号硬件上批量32训练12k步,推理开销为32步ODE数值积分与分类器无关引导scale 2.5带来的延迟。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


20. 指令 supervision 不稳:先把改写漂移管住,再把覆盖面铺开

英文题目:Stabilizing Instruction Supervision for Instruct-TTS via Controllable Diversification and Drift Filtering

标签:#文本到语音 | #数据清洗 | #数据增强 | #语音

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yizhong Geng:机构信息未在 arXiv HTML 中可靠披露
  • Kecan Mao:机构信息未在 arXiv HTML 中可靠披露
  • Qifei Li:机构信息未在 arXiv HTML 中可靠披露
  • Cong Wang:机构信息未在 arXiv HTML 中可靠披露
  • Yingming Gao:机构信息未在 arXiv HTML 中可靠披露
  • Ruimin Wang:机构信息未在 arXiv HTML 中可靠披露
  • Chunfeng Wang:机构信息未在 arXiv HTML 中可靠披露
  • Hao Li:机构信息未在 arXiv HTML 中可靠披露
  • Ya Li:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

指令式语音合成以自由文本指令为输入、以可控风格语音为输出,难点在于大规模指令-语音监督需同时覆盖真实用户多样表达并保持语义忠实,否则漂移会腐蚀训练信号。为此先做属性对齐监督,对短片段做音高语速音量参数化扰动并配模板属性提示,为低层韵律提供可信接地信号。接着做可控多样化,以人物视角与句法模式组合枚举改写并设属性槽不可省略硬约束,将种子属性系统扩展为候选指令。再做漂移过滤,用异家族大模型验证器对候选打分并对边界样本多采投票,仅保留多数判无漂移者形成稳定指令-语音对以微调同一基座。相对无约束改写与朴素微调,该链条差异在于覆盖扩展与忠实性控制解耦又衔接,前者只增多样仍残留漂移,后者以分类法显式剔除执行化、角色代入与实体标签三类腐蚀,实际意义是同时提升泛化与可控性。在InstructTTSEval中文划分基准下,全配方的指令遵循平均准确率相对朴素微调为51.0%升至56.4%,且高于无微调基线的34.5%。其适用边界受限于中文短片段语料与三任务三类漂移,跨语言、长时与开放韵律外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


21. 把打断、等待与做任务放进同一个流:Gander 如何用块展平与小脑-大脑分工实现可打断的全双工 Omni 智能体

英文题目:Omni Interaction Agent Technical Report

标签:#全双工语音交互 | #多模态学习 | #音视频 | #流式处理

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Orantqing:机构信息未在 arXiv HTML 中可靠披露
  • Shengpeng Ji:机构信息未在 arXiv HTML 中可靠披露
  • Junlong Tong:机构信息未在 arXiv HTML 中可靠披露
  • Jialong Zuo:机构信息未在 arXiv HTML 中可靠披露
  • Dongjie Fu:机构信息未在 arXiv HTML 中可靠披露
  • Di Cao:机构信息未在 arXiv HTML 中可靠披露
  • Yangzhuo Li:机构信息未在 arXiv HTML 中可靠披露
  • Shangda Wu:机构信息未在 arXiv HTML 中可靠披露
  • Franz:机构信息未在 arXiv HTML 中可靠披露
  • Evan:机构信息未在 arXiv HTML 中可靠披露
  • Theron Veyra:机构信息未在 arXiv HTML 中可靠披露
  • Changhao Pan:机构信息未在 arXiv HTML 中可靠披露
  • Jingyu Lu:机构信息未在 arXiv HTML 中可靠披露
  • Dongchao Yang:机构信息未在 arXiv HTML 中可靠披露
  • Zhifei Xie:机构信息未在 arXiv HTML 中可靠披露
  • Yang Tan:机构信息未在 arXiv HTML 中可靠披露
  • Xiaoyu Shen:机构信息未在 arXiv HTML 中可靠披露
  • Xiaoda Yang:机构信息未在 arXiv HTML 中可靠披露
  • Wenfu Wang:机构信息未在 arXiv HTML 中可靠披露
  • Teddysun:机构信息未在 arXiv HTML 中可靠披露
  • Steveyves:机构信息未在 arXiv HTML 中可靠披露
  • Zhou Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Bryanytian:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作面向音视频流上的连续人机协作,输入为实时语音、视频与文本混合流,输出为可被打断、可抢话、可主动反馈的语音与工具动作,难点在于同时满足低延迟交互与长时程任务推理并在多方与噪声下区分有效指令。方法链分三段衔接:第一步前端小脑以流式Thinker-Talker架构将1秒窗口内的音视频编码与控制词元展平为统一块流,自回归预测听/说/打断并决定是否本地应答或需委托。第二步其输出的task_start/task_send/task_resolve等工具调用进入中间编排运行时,运行时将其绑定到可信用户轮次并调度后端大脑,避免伪造调用并维持异步任务状态。第三步后端大脑以免训练的Codex/Claude Code代理异步执行检索、代码与文件操作,并经share回传中间结果由小脑整合进持续对话,形成感知-调度-执行的闭环。与依赖外部VAD与端点检测的级联方案不同,该机制把交互状态判断内生为每块首词元的生成决策,使时机与内容共享同一演进表征,可推迟到语义完整而非仅声学静默时再接管。在Full-Duplex-Bench v3基准的100个工具服务场景评测下,Gander的打断率指标从GPT-Realtime的13.5%降至8.0%且保持100%适时接管。结论适用边界受限于前端两分钟滚动上下文与转写驱动的大脑协作,长记忆、多轮视觉接地与复杂噪声下的泛化尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


22. 混合一致性约束下为何需要多输入多输出的迭代精炼

英文题目:Iterative Audio Separation with Mixture Consistency via MIMO Model Extension

标签:#音乐源分离 | #Transformer | #对抗训练 | #生成模型

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yukara Ikemiya:机构信息未在 arXiv HTML 中可靠披露
  • WeiHsiang Liao:机构信息未在 arXiv HTML 中可靠披露
  • Yuki Mitsufuji:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为立体声混合波形 \(\mathbf{x} \in \mathbb{R}^{C \times T}\),输出为满足 \(\mathbf{x}=\sum_{k=1}^{K}\mathbf{s}_k\) 的 \(K\) 个声源波形,难点在于维持混合一致性所要求的相位与音色精确性的同时实现多轮自校正并抑制过分离与误差累积。第一步将单输入单输出或单输入多输出主干扩展为多输入多输出,主干在第 \(i\) 轮接收上一轮全部 \(K\) 个估计 \(\{\hat{\mathbf{s}}_k^{(i-1)}\}\) 并以可学习迭代嵌入为条件输出新估计,初始输入设为 \(\mathbf{x}/K\) 以保持一致性。第二步针对谱掩蔽型主干为每对输入输出预测复数掩蔽 \(\mathbf{m}_{k,j}^{(i)}\) 并加权求和 \(\hat{\mathbf{S}}_k^{(i)}=\sum_j \mathbf{m}_{k,j}^{(i)}\odot \hat{\mathbf{S}}_j^{(i-1)}\) 得到谱域估计,其输出进入下一步时域转换。第三步对所有时域输出施加混合一致性投影 \(\hat{\mathbf{s}}_k^{(i)}\leftarrow\hat{\mathbf{s}}_k^{(i)}+(\mathbf{x}-\sum_j\hat{\mathbf{s}}_j^{(i)})/K\) 以严格满足求和约束并压缩搜索空间。第四步以按轮加权 \(\lambda_i=i\) 的时域与复谱域 L1 重构损失与可选干信号判别器对抗损失联合训练,生成式扩展则引入满足 \(\sum_k \boldsymbol{\epsilon}_k=\mathbf{0}\) 的零和噪声扰动并额外拼接干净混合作为条件以提升鲁棒性。与已有扩散式单源迭代或两阶段残差精炼相比,核心差异在于全源互反馈的联合精炼而非单源独立迭代,使各源在同一前向中相互制衡从而抑制过分离并实现固定点式的单调递进。在MUSDB18-HQ测试集museval评测设置下,MIMO BS-RoFormer的人声SDR性能相对同流程复现的BS-RoFormer基线从11.40 dB提升至11.62 dB。该结论的适用边界受限于仅在44.1 kHz音乐分离的2源与4源任务上验证,尚未验证在语音增强或长时现场录音等场景的外推效果,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


23. 跨航次重识别为何难:去重门控与原始波形选择性核的诚实评估

英文题目:Open-Set Vessel Re-Identification from Underwater Ship-Radiated Noise with a Raw-Waveform Selective-Kernel Acoustic Neural Network (SKANN) and a Cross-Passage Evaluation Protocol

标签:#音频指纹 | #评测协议 | #环境声 | #注意力机制 | #统计分析

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Sunil Tyagi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

任务输入为单通道被动水听器录制的5 s原始波形,输出为对已注册船体画廊的开放集重识别与拒识判定,难点在于同船跨航次信道与环境变化远大于船体间差异且公共数据多为单次捕获导致身份与信道混淆。方法链分四步衔接:先将所有语料重采样至8 kHz并做分段与逐段零均值单位方差归一以剥离电平与硬件着色,其输出波形直接送入四尺度可学习一维滤波器组。随后64通道×四分支的127至8191点滤波器提取16 ms至1 s多时间尺度表征,并由选择性核注意力按输入自适应加权融合为64维谱图。再经五级二维卷积主干早期压缩时间轴、晚期压缩谱轴并以自适应池化得到512维单位球嵌入,最后以加性角度间隔目标训练该嵌入并在推理时与窄带线谱基线的z分数融合打分。与固定梅尔谱加分类头的闭集范式相比,自由核长与每通道注意力使网络自发形成低于500 Hz的恒Q分解与谐波梳状检测器,保留窄带线频绝对位置而非将其增强掉。在40艘船99个转场的IARA跨航次协议评测下,融合方法相对SKANN单一嵌入的指标首位命中率rank-1从0.250升至0.354方向为提升,为唯一名义显著对比而SKANN与窄带方法无显著差异。该结论适用边界受限于同网同类传感器内,跨网未见船与ShipsEar单链路场景下均退化至随机水平为失败条件,且尚未验证航速变化鲁棒性;原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


24. 不发原声原脸如何做青少年抑郁焦虑压力筛查:AdoDAS 的隐私接口与双赛道设计

英文题目:AdoDAS: A Privacy-Preserving Multimodal Challenge for Adolescent Depression, Anxiety, and Stress Assessment

标签:#病理语音评估 | #基准设计 | #隐私保护 | #音视频 | #心理测量

评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Zhaojie Luo:Southeast University, Nanjing, Jiangsu, China;Shenzhen Loop Area Institute, Shenzhen, China
  • Junkun Wang:Southeast University, Nanjing, Jiangsu, China
  • Tianhua Qi:Southeast University, Nanjing, Jiangsu, China
  • Yuxuan Wu:Southeast University, Nanjing, Jiangsu, China
  • Xin Zhao:Southeast University, Nanjing, Jiangsu, China
  • Tetsuya Takiguchi:Kobe University, Kobe, Japan
  • Tomoko Matsui:Shenzhen Loop Area Institute, Shenzhen, China
  • Kun Qian:Beijing Institute of Technology, Beijing, China
  • Fei Wang:Nanjing Medical University, Nanjing, China
  • Shuqiong Wu:The University of Osaka, Osaka, Japan
  • Zhengjun Yue:Shenzhen Loop Area Institute, Shenzhen, China
  • Hiroshi Ishiguro:The University of Osaka, Osaka, Japan
  • Xinyuan Qian:University of Science and Technology Beijing, Beijing, China
  • Haizhou Li:The Chinese University of Hong Kong (Shenzhen), Shenzhen, China;Shenzhen Loop Area Institute, Shenzhen, China

📌 核心摘要

本研究面向青少年抑郁/焦虑/压力的可扩展筛查,输入为校内采集的朗读与3段开放式叙述的音视频派生表征及匿名化ASR文本,输出为基于DASS-21的3个二分类风险标签与21个0至3序数条目分,难点在于未成年人隐私治理、跨会话异质线索融合及高度偏态的序数建模。方法链分四步:先以25Hz对齐的匿名化表征与ASR文本替代原始录音构建隐私接口,再用特征组适配器与带掩码的时序编码器提取可变长多模态证据,随后经会话级融合与被试级聚合形成统一表征,最后分Track A1的3头Sigmoid筛查与Track A2的21头CORAL序数头输出并以固定阈值与二次加权Kappa评测。在1200人隐藏测试集评测下,头部最优提交的平均F1相对音视频融合基线从0.4604升至0.5921且平均QWK从0.2675升至0.2776,方向均为提升。相对已有依赖原始录音或单会话单模态的方法,该基准以表征级隐私接口与跨会话时序融合及心理测量结构约束为关键差异,在降低直接生物特征暴露的同时保留任务相关信息并提升序数一致性。结论的适用边界受限于同校同设备同流程下的未见被试泛化,尚未验证跨学校、跨文化、跨临床人群与真实部署阈值下的外推,且不构成诊断依据,失败条件包括表征仍可能泄露身份与偏态标签下的阈值失配。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


25. 并行解耦全局与局部:E-Branchformer 在音频伪造检测中的可复述设计

英文题目:Disentangled Global-Local Feature Learning with E-Branchformer for Audio Deepfake Detection

标签:#音频深度伪造检测 | #Conformer | #语音 | #自监督学习

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Phuong Tuan Dat:Department of Electrical and Computer Engineering, National University of Singapore
  • Ho Bao Thu:School of Communication and Information Technology, Hanoi University of Science and Technology
  • Nguyen Tran Trung:School of Communication and Information Technology, Hanoi University of Science and Technology
  • Pham Viet Hoang:School of Communication and Information Technology, Hanoi University of Science and Technology
  • Nguyen Thi Thu Trang:School of Communication and Information Technology, Hanoi University of Science and Technology

📌 核心摘要

输入为单通道 16 kHz 语音波形,输出为 bonafide(真实)与 spoof(伪造)二分类判决,难点在于跨合成系统、编解码失真及真实场景信道与录制多样性导致的分布偏移。方法链分四步:以可微调的 XLS-R 300M 提取多层上下文表示并经 Squeeze-and-Excitation Aggregation 自适应聚合层间信息;经 SeLU 激活的线性层投影至 144 维并拼接可学习分类标记(classification token);由 4 层 E-Branchformer 并行建模全局依赖与局部时序模式;经拼接、深度可分离卷积与线性投影的合并操作融合后,对补丁标记(patch tokens)依次施加深度可分离卷积(DWConv)与 Squeeze-and-Excitation(SE,挤压激励)重校准,并以通道注意力逐元素加权分类标记再送线性分类头。与串行 Conformer 相比,平行分支将局部建模卸载至卷积支路,使自注意力支路专注长程韵律与频谱不一致性。原文宣称的双分类标记解耦思想在 3.2 节实现描述中表述为单一分类标记累积全局信息并通过 DWConv-SE 吸收补丁上下文,存在宣称与实现细节的不一致。在 ASVspoof 2021 LA 上等错误率(EER)达到 0.88%,相对最强基线 XLSR-Mamba 的 0.93% 相对降低 5.4%,在 ITW 真实场景上为 6.30% 对 6.71% 相对降低 6.1%,并在 ASVspoof 5 上以 5.44% 领先 Nes2Net-X 的 5.92%。适用边界限于已评测的 ASVspoof 2019/2021/5 与 ITW 的英语为主数据,未验证跨语种、强对抗攻击及多模态伪造的外推能力。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


26. 从注视到聆听:LipCoder 把 AI 编程装进语音闭环

英文题目:LipCoder: Voice-Enabled Coding Toolkit

标签:#语音交互 | #用户研究 | #语音识别 | #文本到语音 | #开源工具

评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.4/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Hayoon Kim:Music and Audio Research Group, Department of Intelligence and Information, Seoul National University, Seoul, Republic of Korea
  • Sungho Lee:Music and Audio Research Group, Department of Intelligence and Information, Seoul National University, Seoul, Republic of Korea
  • Juhwi Kim:Independent Researcher, Seoul, Republic of Korea
  • Bongwon Suh:Human-Centered Computing Lab, Department of Intelligence and Information, Seoul National University, Seoul, Republic of Korea
  • Kyogu Lee:Music and Audio Research Group, Department of Intelligence and Information, AIIS, IPAI, Seoul National University, Seoul, Republic of Korea

📌 核心摘要

视障程序员的输入是安静环境下口语指令、输出是代码修改与可确认的听觉反馈,实际难点是弹窗建议与高亮布局无法靠逐行朗读还原,致使导航、理解、修改与验证全链路断裂且确认代价高。LipCoder以VSCode扩展构建语音流水线,第一步由轻量语音活动检测门控Whisper/Silero转写,先经指令词典匹配常用命令以保证低延迟,失配文本则进入第二步。第二步将转写文本连同语言服务器协议诊断、符号流与项目状态历史送入大语言模型做意图分类与响应生成,其执行结果直接驱动特性执行器做编辑与导航。第三步由音频调度器将语音合成与耳标混音为非重叠反馈,用音色变化、音程堆叠与空间声像替代颜色与布局来表达语法、缩进与光标位置。与仅做语音输入仍依赖视觉确认的方案不同,该工作把口语导航、模型生成与口语摘要加耳标确认收拢到单一听觉优先闭环,减少工具切换与视觉回看。在5名视障程序员完成三类Python任务的被试内对照评测条件下,LipCoder相对基线的系统可用性量表得分从41.2分升至68.8分而高于基线。结论适用边界受限于五人短时受控小任务的探索性评测,噪声口音下识别错误会级联为意图误解的失败条件尚未验证外推,且原文指出语音识别与大模型推理延迟过高会中断编码流。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


27. 从歌曲证据到可执行分镜:MVWeaver 为何用层次规划加歌曲到视觉的桥接来做长篇音乐视频

英文题目:MVWeaver: A Hierarchical Music Video Generation Agent with a Learned Song-to-Visual Bridge

标签:#音视频生成 | #LoRA | #音乐 | #音视频 | #大语言模型

评分:6.2/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Sifei Li:Institute of Automation, Chinese Academy of Sciences, Beijing, China;School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China;KlingAI Research, Beijing, China
  • Minyan Luo:Institute of Automation, Chinese Academy of Sciences, Beijing, China;School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China
  • Xu Li:KlingAI Research, Beijing, China
  • Guodong Qi:KlingAI Research, Beijing, China
  • Xincan Wang:Shanghai Theatre Academy, Shanghai, China
  • Hanwen Wang:Department of Directing, Beijing Film Academy, Beijing, China
  • Chen Zhang:KlingAI Research, Beijing, China
  • Pengfei Wan:KlingAI Research, Beijing, China
  • Oliver Deussen:University of Konstanz, Konstanz, Germany
  • Weiming Dong:Institute of Automation, Chinese Academy of Sciences, Beijing, China;School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

📌 核心摘要

该工作以完整歌曲音频为输入生成数分钟全长音乐视频,需将歌词语义、曲式结构与声学能量时变转化为连贯且避免字面复述的多镜头视觉叙事,难点在于长程概念一致性与音乐对齐的时序锚定。综合歌曲分析先由Gemini 3.1 Pro提炼八维音乐语义档案,并经HT-Demucs分离人声后由FireRedASR2S转录、SongFormer切分段落、Librosa计算平滑对数能量构成段级表示,同时由madmom与Librosa合并节拍与强起音为节奏候选集,为后续规划提供表达内容与时序锚点。Qwen3.6-27B经LoRA微调的歌曲到视觉桥接模型仅以歌曲侧表示为输入,联合预测全局桥接与有序局部桥接决策,其监督来自1861对真实歌曲-MV经教师模型回溯的五阶段关联链而非直接画面标签。分层规划器以Gemini 3.1 Pro将全局桥接经投影生成MV简报,再结合局部桥接展开为视觉发展并定义可复用角色服饰场景资产,进而分解为场景与对齐至节奏候选的可渲染镜头,最后由GPT Image 2渲染资产与首帧并由Kling v3与Kling Avatar分别驱动非演唱与演唱镜头动画。与依赖通用大模型直接构思的AutoMV等方法相比,该设计用真实MV蒸馏的关联链显式约束概念抽象与跨域映射,使视觉前提更贴合歌曲姿态与对抗性而非表层词面联想。在20首测试曲盲评的测试集设置下,MVWeaver的Interpretation Song Alignment得分相对AutoMV从3.06升至4.08,同时Shot-to-Shot Continuity等长程连贯指标亦同步提升。该结论的适用边界受限于以中文流行曲为主的20首小规模测试集与GPT模型盲评体系,对无歌词纯音乐、强叙事长曲及多元美学风格的外推尚未验证,且原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


28. 在允许改写的前提下如何判定语义丢失:EviSI 的证据对齐与分层扣分

英文题目:EviSI: An Evaluation Agent for Simultaneous Interpreting

标签:#语音翻译 | #评测协议 | #大语言模型 | #语音

评分:6.2/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ben Yan:机构信息未在 arXiv HTML 中可靠披露
  • Zongyao Li:机构信息未在 arXiv HTML 中可靠披露
  • Daimeng Wei:机构信息未在 arXiv HTML 中可靠披露
  • Weidong Liu:机构信息未在 arXiv HTML 中可靠披露
  • Huan Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Chong Li:机构信息未在 arXiv HTML 中可靠披露
  • Yaode Wang:机构信息未在 arXiv HTML 中可靠披露
  • Yuzhe Shang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

同声传译的语音到语音翻译需在源语流持续到达时完成理解、翻译与发声,输入为完整源语文本、待评同传输出与辅助参考,输出为可核查的错误清单与确定性扣分,难点在于系统为控制延迟采用重述与概括导致输出偏离书面参考但语义仍可保真,传统参考重叠度量难以区分合理变体与信息损失。EviSI先构建共享源证据,对源文本与参考做联合切分并抽取锚点与事件清单,该清单作为权威依据,待评输出经切分后对齐到清单再进入判定。随后锚点路核查实体、术语、数量与时间的事实同一性,事件路核查命题覆盖与必要限定,逻辑路核查参与者、真值、关系与修饰,流畅度路评估口语表达的自然可懂性,各路分别汇总判定结果。最后经语义调和与表达调和两阶段去重,按多维质量指标罚分思想以锚点、事件、逻辑、流畅度的确定性规则扣分并保留被排除报告以供核查,与COMET等参考依赖度量不同,该机制以源证据为权威并对有效替代表述免罚且避免重复计罚,使容忍合理重述与捕捉事实关系错误得以兼顾。在5个英中语料与4个中英语料共9语料6系统对比的评测设置下,英中聚合系统排序的Kendall τ_b相对COMET20为0.200升至EviSI的1.000且语料内平均τ_b达0.707优于已评基线。该结论的适用边界受限于所测6个商业系统与文本化评估范围,失败条件包括语料内排序失配如Z2语料上EviSI为-0.067而COMET20达0.733且样本级Pearson相关性与基线混叠,尚未验证声学质量、听者理解及多语言人工金标有效性。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


29. 音频幻觉为何总说“有”:用静默对照与首步门控校正肯定偏差的 TAD

英文题目:TAD: Token-Adaptive Contrastive Decoding with Confidence-Guided Gating for Hallucination Mitigation in Large Audio-Language Models

标签:#音频问答 | #对比学习 | #音频大模型 | #鲁棒性

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Heyu Chang:机构信息未在 arXiv HTML 中可靠披露
  • Nianwen Si:机构信息未在 arXiv HTML 中可靠披露
  • Hao Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Wenlin Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Dan Qu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

大音频语言模型需以音频片段与自然语言提问为输入,输出二元存在性判定(是/否),实际难点在于语言先验与训练共现偏置导致模型在目标声音缺席时仍倾向肯定回答,形成音频对象幻觉,且该偏置在静音参考下仍呈正向边际。为此,Token-Adaptive Decoding先以真实音频与等长全零静音波形作双分支前向,按Audio-Aware Decoding形式以对比权重α重加权得到音频感知对比logits,使音频支持的token相对静音先验被放大;该对比logits的输出进入下一步的语义投影。随后方法枚举Yes/No多种表层形式并去重构建肯定与否定token集合S_yes/S_no,通过对数和指数池化对两分支logits在集合上聚合,得到ay、an、by、bn四项标量以稳健估计Yes/No倾向,池化结果直接用于计算边际。接着仅在首步解码计算音频与静音的Yes-No边际差增益δ=(ay-an)-(by-bn),并以阈值τ作置信门控:当δ<τ时对对比logits中所有肯定类token施加惩罚γ,否则保持不变,后续步仅沿用对比logits解码,实现决策关键且类别条件的校正。相较固定对比强度的AAD与层间向量干预的AVS,该机制以音频-静音边际增益自适应决定是否惩罚肯定输出,避免在证据已充分或极弱时过度纠正,具有证据驱动与任务对齐的实际意义。在AudioCaps-Hallucination基准的Random划分评测设置下,TAD的F1相对AAD基线从0.736升至0.853,召回同步提升体现对无支持肯定的有效抑制。该方法的适用边界受限于仅在首步生效,对开放式字幕生成或多步推理中的幻觉外推尚未验证,失败条件包括阈值与惩罚强度失配及强对比导致的过度保守。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


30. 不对称残差融合能否替代双向跨模态 Transformer:RAFM-SER++ 的轻量化权衡

英文题目:RAFM-SER++: A Lightweight Multimodal Emotion Recognition Framework for Real-Time Behavioral Monitoring in Surveillance Systems

标签:#语音情感识别 | #注意力机制 | #多模态学习 | #高效推理

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ngo Truong Dinh:Faculty of Information Technology University of Science, VNU-HCM Ho Chi Minh City, Vietnam ORCID: 0009-0007-0254-0202
  • Tung-Lam Bui:Faculty of Information Technology University of Science, VNU-HCM Ho Chi Minh City, Vietnam ORCID: 0009-0007-0254-0202
  • Chi-Trung Duong:Faculty of Information Technology University of Science, VNU-HCM Ho Chi Minh City, Vietnam ORCID: 0009-0007-0254-0202
  • Vien Nguyen Thi:Faculty of Information Technology University of Science, VNU-HCM Ho Chi Minh City, Vietnam ORCID: 0009-0007-0254-0202
  • Viet-Anh Nguyen:Faculty of Information Technology University of Science, VNU-HCM Ho Chi Minh City, Vietnam ORCID: 0009-0007-0254-0202
  • Phuc-Lu Le:Faculty of Information Technology University of Science, VNU-HCM Ho Chi Minh City, Vietnam ORCID: 0009-0007-0254-0202

📌 核心摘要

语音情感识别需以语音与文本为输入推断愤怒等离散情感类别,难点在于语音情感线索时序稀疏且与文本语义抽象层次、时序对齐不一致,跨模态互补易被冗余融合稀释,同时监控场景要求低延迟与资源受限部署。框架先以HuBERT编码语音、以BERT-base编码文本并经线性投影映射至共享隐空间对齐维度,投影后双模态序列一并送入融合阶段。随后非对称残差注意力融合机制以文本为查询、语音为键值执行单向交叉注意力并以残差形式注入语义表示,经层归一化得到融合序列,进入聚合阶段。聚合阶段由注意力引导池化为每个融合时刻计算自适应权重并加权聚合成话语级128维表示,再经轻量多层感知机分类,训练时以交叉熵与BYOL启发的无负样本余弦对齐损失联合优化以提升表征一致性。相较于MemoCMT等双向跨模态Transformer的重交互设计,该框架将语音建模为对文本语义的情感残差校正,避免冗余双向计算,在保留互补性的同时显著降低参数与延迟,对实时行为监测更具部署意义。在IEMOCAP四分类协议基准评测设置下,RAFM-SER++的平衡准确率BACC相对MemoCMT从77.46%提升至81.10%。该结论适用边界受限于受控录制、人工转写与近场干净语音的验证条件,尚未验证真实监控噪声、混响、说话人重叠、域偏移及自动语音识别错误下的鲁棒性与外推。原文披露硬件为单张NVIDIA RTX 4090,训练成本为100轮、批量32、初始学习率1e-4的配置,推理吞吐在ESD上达79.60 it/s、在IEMOCAP上达74.28 it/s,相对MemoCMT的45.19 it/s与71.70 it/s更快且可训练参数从8.9M降至3.6M。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


31. 墙体遮挡下的分布式声学叙事:用拓扑图与几何提示补全多房间声场景

英文题目:Geometry-Informed Distributed Acoustic Scene Understanding

标签:#音频理解 | #图神经网络 | #麦克风阵列 | #空间音频信号 | #大语言模型

评分:6.1/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yiyuan Yang:机构信息未在 arXiv HTML 中可靠披露
  • Shitong Xu:机构信息未在 arXiv HTML 中可靠披露
  • Niki Trigoni:机构信息未在 arXiv HTML 中可靠披露
  • Andrew Markham:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该研究处理多房间分布式麦克风输入的连续声学场景叙述任务,输入为N个节点的同步log-Mel频谱与房间几何Ω,输出为按时间排序的自然语言叙述,难点在于墙体遮挡导致的非视距缺失与跨房间轨迹的物理一致性约束难以同时满足。方法链分四步:第一步以拓扑图将房间邻接与材质衰减编码为边权w_ij=γ_wall·exp(-λd_ij),为后续融合提供几何先验。第二步用共享的音频频谱变换器提特征并经空间图神经网络与门控循环单元做时空融合得到统一表征,其输出直接作为下一步的图状态输入。第三步由查询式解码器将融合特征离散化为⟨主体,关系,客体⟩三元组序列,该离散符号序列作为下一步的观测日志。第四步将三元组与几何文本化提示输入冻结的Meta Llama-3-8B-Instruct补全缺失转移并生成叙述,利用邻接约束推断必经中间房间。相比忽略拓扑的分布式融合基线与集中式单阵列,显式几何加权与大语言模型零样本空间推理是关键差异,使系统能在部分观测缺失时避免物理不可达跳变而保持叙述连贯。在自定义多房间模拟器评测设置下,完整框架相对集中式单阵列基线的三元组F1从0.51升至0.87且空间一致性分数从35.0%升至88.2%,呈现一致提升方向。结论的适用边界受限于已知平面图与静态门状态的模拟环境,尚未验证真实混响、设备失配与动态拓扑下的泛化能力,存在因三元组误检导致大语言模型产生自信但错误叙述的失败条件。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


32. 从纠缠录音到可控双轨:分离、重建与扩展如何分工保留对话时序

英文题目:ConversationalVoice: Full-Duplex Speech Data from Real Conversations through Source-Faithful Reconstruction and Conversation-Grounded Expansion

标签:#全双工语音交互 | #数据集构建 | #语音分离 | #语音合成 | #轮次切换

评分:5.9/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Richard Yucheng He:AveraLabs
  • Baodong Cao:AveraLabs
  • Chen Xu:AveraLabs
  • Yihang Liu:AveraLabs
  • Tairan Chen:AveraLabs

📌 核心摘要

全双工语音交互需在双轨同步流上建模轮次、重叠、打断与反馈,但真实录音多为嘈杂单声道混合且缺乏稳定说话人槽位,难以直接得到带词级对齐与身份一致的训练数据。管线按分离、重建、扩展三阶段递进:分离通过对话分离与声纹校验恢复双轨、规范转录与自然交互时序并固定说话人槽位,其输出的词与身份锚点直接作为后续约束;重建在词与身份不变约束下以复合参考语音克隆重合成干净语音,并经先对齐后调度的时序重建保留相对轮次与重叠,产出带词级时间戳与播送指令的对齐产物;扩展以重建的上下文、说话人与交互统计为约束生成新对话并显式规划对话、反馈与重叠放置,同样落入等长双轨的统一形态以便混合训练。相对仅输出分离语料的DuplexChat等已有方法,关键差异在于三阶段共享等长双轨、词级时间戳、音频标签与播送指令的统一表征,使重建提供可控的表达监督、扩展提供接地的新事件覆盖而非无约束合成。在共享输出质量评测下,重建的NISQA MOS相对分离的3.563升至4.405而扩展进一步升至4.608,方向为重建与扩展均高于分离且扩展最高。结论的适用边界受限于仅做数据属性自动评测而未验证下游全双工建模增益,且依赖NISQA、DNSMOS与单一Gemini自动打分器,重建时长较源平均拉长26.3%且轮次与重叠保留F1仅0.693与0.664,向真实感知、多语多域与高重叠噪声场景的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


33. 冷启动可用与少样本高精度的分野:域不变韵律与自监督表示的跨域语音钓鱼检测对比

英文题目:Comparing Self-Supervised and Domain-Invariant Features for Cross-Domain Voice Phishing Detection

标签:#音频分类 | #自监督学习 | #领域适应 | #少样本 | #0 样本

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Jeongmin Lee:机构信息未在 arXiv HTML 中可靠披露
  • Seung Yun:机构信息未在 arXiv HTML 中可靠披露
  • Minkyu Lee:机构信息未在 arXiv HTML 中可靠披露
  • Ran Han:机构信息未在 arXiv HTML 中可靠披露
  • Yoonkyu Woo:机构信息未在 arXiv HTML 中可靠披露
  • Jinxia Huang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本研究处理输入为 8 kHz 电话语音、输出为是否属于语音钓鱼(Voice Phishing,VP)的二分类问题,难点在于真实犯罪录音因隐私难以获取且仅有少量样本可用,同时需兼顾端侧轻量部署与跨域泛化。方法链分三步:先以 88 维 eGeMAPS 韵律特征与 768 维 HuBERT / wav2vec2.0 自监督表征分别表征语音,再通过随机森林重要度与 Cohen’s d(\(d < 0.5\))两阶段筛选出 4 维域不变韵律子集,最后用逻辑回归在场景化训练集上学习决策边界并在真实犯罪测试集上评测零样本、1 样本与 5 样本条件。与直接复用大规模预训练表征不同,该域不变筛选机制显式以跨域分布稳定性而非判别力为选择标准,以牺牲天花板换取冷启动鲁棒性与 CPU 可部署性。在固定 812 条测试的跨域评测中,4 维韵律特征零样本达 69.5% F1 超过 HuBERT 的 58.3%,而 5 样本下 HuBERT 反超至 94.2% F1。结论仅在韩语电话带宽、场景化到真实犯罪的单一跨域上验证,未验证跨语言、跨信道与在线流式下的失效模式。原文未披露训练、推理或部署成本的实测数值,仅定性说明韵律特征可 CPU 运行而 SSL 需 GPU。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


34. 在单通道约束下用稀疏相对脉冲响应重建空间:HOA 参数化编码的显式房间建模

英文题目:Spatial Audio Coding Through Relative Room Impulse Response Estimation

标签:#音频编码 | #波束成形 | #空间音频信号 | #向量量化

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Nour Bouayed:机构信息未在 arXiv HTML 中可靠披露
  • Adrien Llave:机构信息未在 arXiv HTML 中可靠披露
  • Jérôme Daniel:机构信息未在 arXiv HTML 中可靠披露
  • Pascal Scalart:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该研究面向三阶高阶Ambisonics空间音频在带宽受限网络下的低码率传输,输入为多通道HOA信号,输出为单路传输通道加少量空间参数重建的沉浸声场,难点在于以约2 kbps级边信息准确刻画房间脉冲响应的早期反射时延、谱染色与晚期弥散混响。方法链分三步:首先以波束成形输出为参考,利用广义时域速度向量GTVV的自转向迭代盲估计相对空间房间脉冲响应ReSRIR,迭代中以零延时ReSRIR估计声源方向并更新波束成形器直至收敛,输出稀疏准因果的时域ReSRIR。接着将ReSRIR分解为含主峰的3个稀疏波包与剩余弥散残差,分别参数化为时延、幅度/球谐编码向量构成的波包张量与按通道时变方差下采样至7个时点的残差包络,经学习的一维卷积滤波器建模残差谱形。最后对差分时延作标量量化、对投影至128维的波包潜向量与残差包络向量作向量量化,共85比特/帧约2 kbps,在解码端以滤波噪声整形重合成残差并与波包叠加,经卷积作用于独立编码的参考通道恢复多通道场景。与IVAS仅保留实值相对传输函数并依赖去相关滤波合成混响导致对称反因果ReSRIR不同,该方案显式保留因果稀疏结构与高阶分量高通谱包络,能更忠实再现早期反射的时延与墙面吸收导致的谱失配。在验证集评测设置下,所提27 kbps方法的QASTANet空间音频质量得分相对32 kbps IVAS基准提升约0.1分并逼近64 kbps IVAS水平,在RSoANU与50-Lebedev未见RIR合成的50条10 s语音测试集上亦取得与32 kbps IVAS相当的得分而码率更低。该结论适用边界受限于单静态声源、截断至40 ms的混响及QASTANet客观指标,尚未验证多源重叠、长混响尾与主观听感的外推,失败条件包括长混响与多源并发,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


35. 分数之外保留证据:可审计决策记录如何改进语音伪造检测的复核

英文题目:From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection

标签:#音频深度伪造检测 | #检索增强 | #语音 | #统计分析 | #可解释性

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Mengzhe Geng:机构信息未在 arXiv HTML 中可靠披露
  • Yujia Lu:机构信息未在 arXiv HTML 中可靠披露
  • Patrick Littell:机构信息未在 arXiv HTML 中可靠披露
  • Manuela Kunz:机构信息未在 arXiv HTML 中可靠披露
  • Xie Chen:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音深度伪造检测的输入为单条语音波形,输出为真伪的单一操作分数,难点在于同分数段样本可能源于被动证据与检索证据冲突或探针缺失等完全不同成因,单一分数无法支撑信任、延迟或复核决策。方法链分四步:第一步为每条语音写入包含被动检测器分数、带密钥探针分数、检索支持与说话人轮廓边距的固定格式决策记录,保留全部溯源线索。第二步以固定平均构造被动-探针、检索增强与轮廓增强三类融合基线,并显式计算被动-探针与融合-检索两维分歧坐标,使冲突可被量化。第三步在交叉家族划分上用带L2正则的逻辑回归对分数块与分歧坐标做迟校准,输入为前一步的记录与分歧特征,输出为可阈值化的单一操作分数而不丢弃原始证据。第四步在固定复核预算下用阈值边距与分歧队列组织选择性复核,将校准后分数与暴露线索共同用于复核排序。在ASVspoof 5 Track 1开发集的4,080条匹配子集评测设置下,固定检索增强规则的等错率EER相对纯检索基线的等错率EER从15.84%降至11.91%,全记录迟校准进一步降至8.43%。与已有单分数检测器相比,该机制差异在于将最终分数保持为可审计的证据束而非早期坍缩的融合分,使边界样本的分歧成因可被追溯与分流,其实际意义在于用同一分数支撑阈值判定与复核队列而无需重训检测器。结论的适用边界在于增益高度集中于A12与A13等少数被动失效家族、探针单独几乎无判别力且最佳被动WavLM在同一子集上仍以6.71%等错率更优,跨家族与外推场景尚未验证;原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


36. 双耳相位不可丢:从 Mel 模糊到复数 VAE 的空间音频重建

英文题目:BinauralVAE: Spatial Audio Reconstruction For World Models

标签:#音频编码 | #变分自编码器 | #空间音频信号 | #开源工具

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Luis Vitor Zerkowski:VISGRAF;IMPA
  • Luiz Velho:VISGRAF;IMPA

📌 核心摘要

本文面向具身导航中视觉遮挡下空间听觉建模,输入为机器人离散动作对应的0.2秒44.1kHz双耳波形,输出为可经逆变换还原的双耳波形及可插值的潜空间状态,其难点在于微秒级ITD完全依赖相位而幅度谱丢弃相位且梅尔频谱46ms帧分辨率无法捕捉时延。方法链分三步衔接:第一步由AudioWorldSim生成动作条件数据并做切片与最大范数归一化,对幅值施0.3幂律压缩后转为梅尔频谱或1024点复数STFT张量;第二步以卷积VAE为编码解码骨干,前者用实值2D卷积预测32维高斯均值与对数方差,后者用五层复卷积并行预测均值、对数方差与伪方差并经Cholesky重参数化采样得到潜向量;第三步将潜向量解码后按分支合成波形,梅尔分支需经Griffin-Lim或BigVGAN-v2估计相位,复数与四通道分支则直接经ISTFT还原,解码输出即作为波形合成的输入。相对将频谱当图像仅建模幅度的已有方法,复数分支以复高斯先验及协方差与伪协方差联合建模显式保持相位的环形拓扑,避免相位塌陷至常数而保留ITD与低频空间感。在留出测试集的评测设置下,复数VAE的重建误差指标相对四通道STFT VAE从5081.71大幅降至625.83,虽仍高于梅尔VAE的19.78但主观上显著改善空间保真度。该结论适用边界受限于模拟混响环境与固定窗长跳长配置,尚未验证真实录制、动态声源及下游导航策略的外推性,且存在VAE固有方差惩罚导致高频细节平滑的失败条件。原文披露梅尔分支约5小时、复数分支约40小时的训练成本及显存占用差异,但未披露推理开销与部署延迟。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


37. 把波形峰值关进语义空间:MAPS 如何在非线性功放下同时做对齐与 PAPR 抑制

英文题目:PAPR-Aware Multimodal Token Transmission in MLLM-Based Multiuser Networks

标签:#音视频问答 | #多模态学习 | #LoRA | #对比学习 | #音视频

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Molka Trabelsi:机构信息未在 arXiv HTML 中可靠披露
  • Rafik Zayani:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文任务是从分布式多用户端采集文本、音频、视觉等多模态原始数据,经令牌化后通过正交频分复用(Orthogonal Frequency Division Multiplexing, OFDM)波形在非线性功率放大器下传输,最终在基站侧由多模态大语言模型(Multimodal Large Language Model, MLLM)融合完成音视频问答(Audio-Visual Question Answering, AVQA)推理,难点在于跨模态语义一致性、任务相关性与波形PAPR之间的联合优化。方法分两阶段:第一阶段冻结各模态编码器与基座模型,仅训练投影层与令牌接收器,以对比损失与锚定重构损失实现跨模态对齐,同时以均衡多模态PAPR损失对OFDM时域信号做波形整形;第二阶段冻结第一阶段组件,仅以低秩适配(Low-Rank Adaptation, LoRA)微调基座模型适配AVQA任务。与仅做任务微调的基线相比,关键机制差异在于将PAPR控制从电路域移至可学习的嵌入空间,并通过固定语义锚点解耦波形优化与对齐。在MUSIC-AVQA测试集、信噪比12 dB、输入回退(Input Back-Off, IBO)3 dB非线性功放下,MAPS相对基线取得约64.5%的准确率提升与64.4%的任务导向能量效率提升,原文在信噪比扫描中另报告同条件下31.7%对18.8%的绝对准确率对应68.3%相对增益。结论仅在AWGN、静态子载波正交分配、离线训练时关闭功放的条件下验证,未覆盖多径衰落、用户异步与分布式边缘协同等外推场景。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


38. 轻量时序建模如何兼顾精度与跨库泛化:SETEAB 的下采样、通道校准与双向加权融合

英文题目:SETEAB: Multiscale approach with Squeeze-and-Excitation Temporal Enhanced Aware Block for Speech Emotion Recognition

标签:#语音情感识别 | #CNN | #语音 | #高效推理

评分:5.5/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Duy Vo:机构信息未在 arXiv HTML 中可靠披露
  • Kiet Anh Hoang:机构信息未在 arXiv HTML 中可靠披露
  • Hao Do:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音情感识别需从语音声学信号预测离散情绪类别,输入为16kHz重采样的80维对数梅尔频谱,输出为情绪标签,难点在于时变情感线索受说话风格、语言与噪声干扰且跨库分布差异大导致泛化不稳。SETEAB先以深度可分离卷积下采样前端按R=4压缩时序冗余并保留情感显著信息,其输出送入挤压激励残差块进行多尺度扩张卷积与通道重校准以强化局部判别特征。随后该特征双向送入8层时序增强感知块堆叠,每块经预层归一化、通道扩张、深度时序卷积与门控残差自适应强调显著时序线索并稳定优化。最后加权双向融合以全局可学习权重a、b平衡前后向贡献并用层级权重聚合多层表征后分类,相对TIM-Net的直接等权相加与标准卷积时序块,TEAB以预归一化与深度门控缓解梯度衰减与特征冗余,BiF以自适应加权缓解时序方向偏置并更贴合情感动态非对称性。在RAVDESS基准评测下,SETEAB(R=4)的非加权准确率UA相对TIM-Net从50.67%提升至59.57%。该结论适用边界受限于EmoBox固定划分的5个短句基准语料与16kHz/80维特征设置,尚未验证长时、强噪声或真实对话场景的外推,推理开销在5秒输入下仅0.06G计算量且可在4GB显存硬件上运行,但训练成本与端侧延迟披露有限。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


39. 个体化 HRTF 为何不只改变定位准确率而是改变定向动作的发起时机

英文题目:Beyond Localisation Accuracy: Sensorimotor Effects of HRTF Individualisation

标签:#声源定位 | #心理声学实验 | #空间音频 | #空间音频信号

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Fulvio Missoni:University of Genoa, DIBRIS, Genoa, 16145, Italy
  • Katarina C. Poole:Dyson School of Design Engineering, Imperial College London, London, United Kingdom
  • Tim Murray-Browne:Dyson School of Design Engineering, Imperial College London, London, United Kingdom
  • Andrea Canessa:University of Genoa, DIBRIS, Genoa, 16145, Italy;these authors contributed equally to this work
  • Lorenzo Picinali:Dyson School of Design Engineering, Imperial College London, London, United Kingdom;these authors contributed equally to this work

📌 核心摘要

该任务要求听者在VR中根据与视觉目标共位的虚拟声源完成听觉引导视觉搜索,输入为双耳渲染的白噪声串与28个球面排布的视听目标,输出为按键反应时与头部运动轨迹,难点在于静态定位精度无法反映连续听觉-运动耦合与多感官整合中的个体化价值。方法链分四步:先按文献流程测量每位被试的个体HRTF并以KEMAR假人为非个体对照;再用3DTune-In Toolkit的RVL方法分别渲染无混响与小房间混响场景;随后通过Meta Quest 3与Sennheiser HD599SE在6自由度追踪下执行336试次搜索;最后以广义线性混合模型分解反应时、运动起始与总角位移。与仅报告定位误差的传统范式不同,该设计将感知优势定位于动作规划与起始阶段而非最终精度,揭示了动态采样与视觉反馈可补偿早期不确定性的机制意义。在无混响场景下,个体HRTF的反应时相对KEMAR基线从0.76降至0.67(对数秒尺度,平均约200 ms缩短),前后向差异最显著。在混响条件下个体化与非个体化的反应时与运动起始差异消失,且优势主要体现在运动起始方向正确率而非总角位移。该结论的适用边界受限于12人短时无适应、无眼动追踪且仅直达声个体化而混响场非个体化的VR双耳系统,混响环境为明确失败条件,尚未验证真实房间、长时学习或完全个体化双耳房间脉冲响应的外推,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


40. 当所有声部都是人声:用主唱音素对齐区分主唱与伴唱的分离路径

英文题目:Lead Vocal Separation from Vocal Ensemble Mixtures Using Phoneme Alignment

标签:#音乐源分离 | #多模态学习 | #Transformer | #音乐

评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5

排名:后 50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yuma Narahata:机构信息未在 arXiv HTML 中可靠披露
  • Tomohiko Nakamura:机构信息未在 arXiv HTML 中可靠披露
  • Yuki Saito:机构信息未在 arXiv HTML 中可靠披露
  • Hiroshi Saruwatari:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

任务输入为六声部无伴奏合唱混合的单通道波形,输出为主唱Vo与剩余声部Other两路信号,难点在于目标与干扰均为人声且时频高度重叠,纯声学线索难以按音乐角色区分主旋律与伴唱。方法链分三步:先由带分割模块将复数频谱按62个频带切分并映射为192维表征,为后续建模提供频带解耦的时频表示;再经6层交替的时序与频带Transformer模块建模长时依赖,其输出作为下一步调制的输入。随后在每层后插入以Vo帧级音素标签序列为条件的特征线性调制FiLM层对表征做缩放与偏置,最后由掩码估计模块生成Vo复数掩码并与输入谱相乘得到分离谱,剩余声部由混合减去估计谱得到。在jaCappella语料10首评估曲的Vo分离任务下,音素条件模型的SI-SDRi指标相对音频基线为9.87 dB升至14.85 dB,且高于仅用演唱/静音活动的对照13.05 dB。相对已有方法的关键机制差异在于引入细粒度音素类别而非仅Vo活动检测,使同音素帧被归为同一类别提供额外区分线索,实际意义在于在伴唱干扰强时仍能按语言内容辅助区分主唱而非仅依赖能量或音高。结论适用边界在于增益依赖准确对齐的音素标签,当越多伴唱声部与Vo同音素时相对优势收窄且尚未验证跨语言与大规模开放歌手集的外推,受限于日语童谣改编的小规模封闭验证,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


41. 把海豚叫声当连续向量做渐进式对齐:高斯核替代离散打分的多序列比对

英文题目:Interpreting Dolphin Vocal Sequences via Multiple Sequence Alignment

标签:#音频理解 | #LoRA | #生物声学 | #Transformer

评分:5.0/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:后 50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Daniel Kohlsdorf:机构信息未在 arXiv HTML 中可靠披露
  • Denise Herzing:机构信息未在 arXiv HTML 中可靠披露
  • Thad Starner:Georgia Institute of Technology, Atlanta, Georgia, USA

📌 核心摘要

输入为野外录制的海豚发声连续录音,输出为跨录音对齐的多序列比对网格及列级声学簇标签,难点在于谱特征为高维连续向量、无离散字母表且时序伸缩与噪声严重导致传统离散替换矩阵失效。方法链分四步衔接:先以约320ms滑动窗口对5–10kHz带通滤波后的语谱图切片,经LoRA微调的Whisper编码器及投影头压缩为128维嵌入序列;再以高斯核连续相似度替代离散得分,通过Needleman-Wunsch式动态规划实现序列到轮廓、轮廓到轮廓的渐进式合并并由引导树决定合并顺序;随后基于距离分位数或目标簇数的早停层次聚类将异质数据拆为多个独立MSA以控制过度拉伸;最后对齐网格以列先验增强的谱聚类构造RBF亲和矩阵并经HMM平滑赋予离散颜色以可视化。与直接在MFCC或Wav2vec特征上做动态时间规整不同,该框架显式引入列级平均相似度与可学习的语义嵌入,使对齐在连续空间仍保持可微的奖励与惩罚机制而非仅依赖欧氏距离最小化。在成年攻击行为数据集评测设置下,微调Whisper Small的间隙率指标gap_percentage为55.72%相对MFCC基线的97.22%大幅降低且干净列比例达78.93%,而MFCC与Wav2vec均被拉伸至97%以上间隙率且总间隙数膨胀超11倍,方向上表明域适应嵌入显著抑制过度插隙。该结论适用边界受限于已切分的孤立发声片段,尚未验证连续多声源重叠、跨物种泛化及比对结果的生物学同源性,且阈值选择依赖人工,失败条件包括高噪声与强个体变异下的列方差升高。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


42. 口吃与成人插话并存时,音频语言模型为何流畅却不忠实

英文题目:Reasoning Beyond Transcription: Audio Language Models on Child Stuttering Speech

标签:#音频理解 | #评测协议 | #语音 | #言语障碍 | #音频大模型

评分:4.8/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:后 50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Chibuzor Okocha:机构信息未在 arXiv HTML 中可靠披露
  • Christan Grant:机构信息未在 arXiv HTML 中可靠披露
  • Zoey Liu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为含儿童口吃与成人提问交织的原始长音频,输出要求仅聚焦儿童语义并保留重复、延长、阻塞、填充停顿等临床相关不流畅,同时完成摘要生成与三类蕴含判断,难点在于儿童声学与韵律发育差异、密集不流畅破坏对齐以及成人语音干扰。方法链分四步:先以Voices of Children Who Stutter语料构建单人朗读与混合访谈两类环境并做不流畅密度标定,再以固定指令驱动7个音频大模型进行零样本端到端推理,随后用Whisper Large-v3与Granite 3.3.2转写后接Llama 3.2 8B等文本大语言模型构成级联基线作对照,最后以3个大语言模型裁判与BERTScore F1及准确率、宏F1分层评估并按难度与不流畅密度分层验证。与级联转写后推理相比,端到端音频语义推理省去显式转写瓶颈但仍受声学干扰制约,指令式语义级说话人聚焦替代信号级分离。关键证据为混合访谈摘要中Kimi-Audio BERTScore F1为0.478领先Audio Flamingo 3的0.433,而级联Whisper+Qwen 2.5在蕴含任务上达0.739准确率与0.737宏F1,显著高于最佳端到端Qwen2.5-Omni的0.681准确率与0.683宏F1。结论仅在轻中度不流畅与短时访谈内部分成立,高密度不流畅、成人干扰强及矛盾类假设下性能骤降,跨口吃类型与跨语料外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


43. 在熔池时序中找缺陷:多模态时序注意力如何把 GMAW 角焊缝的隐蔽缺陷检出率推到 0.99

英文题目:Explainable Temporal Attention-based Defect Detection For Fillet Joints in Real-Time Gas Metal Arc Welding Based on Multi-modal Data

标签:#音频分类 | #注意力机制 | #多模态学习 | #可解释性 | #工业应用

评分:4.7/10 | 创新 1.1/2 | 技术严谨 1.1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5

排名:后 50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Mobina Mobaraki:University of British Columbia- Vancouver campus, 2329 West Mall, Vancouver, V6T 1Z4, British Columbia, Canada
  • Mahyar Asadi:Novarc Technologies Inc., 1225 E Keith Rd, North Vancouver, V7J 1J3 , British Columbia, Canada
  • Klaske Van Heusden:University of British Columbia, Kelowna campus, 3333 University Way, Kelowna, V1V 1V7, British Columbia, Canada
  • Guy A. Dumont:University of British Columbia- Vancouver campus, 2329 West Mall, Vancouver, V6T 1Z4, British Columbia, Canada

📌 核心摘要

本文面向气保护金属极电弧焊角接接头实时内部缺陷检测,输入为熔池图像序列与电弧声学信号、输出为5类缺陷与无缺陷的二分类标签,难点在于电弧不稳定、飞溅遮挡及缺陷亚毫米级且具时序演化特性。方法链分三步:先以二维残差网络ResNet18分别提取图像与梅尔谱特征并探索拼接等融合策略,再将16帧为块的序列送入三维残差网络ResNet 3D以通道维度建模时序依赖,最后对多块融合特征施加多层感知机MLP-Softmax形式的时序注意力加权并以支持向量机SVM分类。与仅用单帧的常规卷积神经网络相比,时序与注意力机制显式建模跨帧与跨模态重要性而非依赖静态空间特征。在自采的29429帧数据集上,时序多模态模型较常规多模态将缺乏熔透等5类缺陷的F1分数分别提升4.21%至12.5%,注意力进一步使缺乏熔透提升至0.99。结论仅在研发环境、刻意造缺陷的6英寸管-法兰角接数据上验证,未覆盖产线噪声、不同材料与接头泛化及在线闭环控制。原文未披露训练、推理或部署成本的完整硬件与时延测量,仅报告注意力模块增加约0.1 GFLOPs。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


44. 从隐式注意力到可编辑的时滞轨迹:音视同步如何为发音评估提供可解释时序依据

英文题目:When Speech Meets Lips: Interpretable Audio-Visual Synchronization for L2 Pronunciation Assessment

标签:#音视频理解 | #注意力机制 | #音视频 | #教育 | #可解释性

评分:3.8/10 | 创新 1/2 | 技术严谨 0.6/1.5 | 实验充分 0.4/1.5 | 清晰度 0.6/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5

排名:后 50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Bowen Yu:Wenzhou-Kean University, Wenzhou, China
  • Mingyu Huang:Wenzhou-Kean University, Wenzhou, China
  • Yishen Liu:Wenzhou-Kean University, Wenzhou, China
  • Yue Zhao:Wenzhou-Kean University, Wenzhou, China

📌 核心摘要

该任务输入为同步采集的16 kHz语音梅尔频谱与25 fps唇部几何轨迹,输出为帧级音视频滞后轨迹Δ(t)及同步稳定性判读,难点在于语速非线性波动、头部运动与录制噪声导致全局偏移与局部失配交织且易与音段错误混淆,难以用固定时延假设建模。方法链前两步为模态编码与融合:先以时序编码器分别对音频与视觉流编码得到上下文嵌入,再经交叉注意力融合显式建模跨模态时序依赖并生成T×T注意力矩阵,前一步的嵌入直接作为注意力对齐的输入。后两步为估计与量化:以每行argmax提取滞后轨迹并计算离散度σt与熵H(t)形成帧级同步原语Pt={Δ(t),σt,H(t)},再经时域平滑聚合与统计量计算得到滞后稳定性指数LSI并联动热图与几何视图进行诊断,滞后原语逐级聚合为稳定性判据。与仅依赖声学的自动发音评估相比,该框架将隐式对齐显式化为可量化、可操作的同步原语而非仅输出分数,意义在于将评分与时序诊断解耦以提供可解释、可定位的发音时序反馈。在900帧序列的对齐评测设置下,本文注意力对齐的对齐耗时指标相对动态时间规整基线从0.82秒降至0.04秒,实现约20倍加速且方向为耗时显著降低。结论的适用边界受限于仅在8个自采多样化语料与30人小规模问卷中验证,尚未验证在SpeechOcean762等公开APA基准上的评分相关性与误发音检出泛化,噪声与跨说话人场景下稳定性下降且跨设备失真未被量化。训练成本为每数据集平均约6分钟的两阶段优化,推理开销在900帧下为0.04秒量级,但原文未披露具体硬件配置与吞吐细节,部署延迟与计算量边界尚不明确。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。