共分析 93 篇论文


⚡ 今日概览

✅ 筛选入选 93 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#语音识别10 篇██████████
#音频分类7 篇███████
#文本到语音4 篇████
#语音增强4 篇████
#音频编码4 篇████
#全双工语音交互3 篇███
#关键词检测3 篇███
#目标说话人提取3 篇███

📊 论文评分排行榜(93 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇YuE2: Unifying Symbolic and Audio Music Generation at…8.9前25%模型报告#歌唱生成
🥈Transformer-based Neural Beamforming for Real-Time…8.8前25%系统技术报告#语音增强
🥉Pruned CTC for Memory-Efficient Large-Vocabulary ASR…8.7前25%方法研究#语音识别
4.Almost Human, Except When It Matters: VoxParity and…8.4前25%数据集与基准#语音代理规划与工具使用
5.Open-Qwen-Music: An Auditable Framework for LLM-Based…8.3前25%系统技术报告#音乐生成
6.Overview and Analysis of the RecSys Challenge 2026…8.2前25%数据集与基准#音乐推荐
7.Acoustic Progress Propagation for Long-Horizon…8.2前25%方法研究#语音识别
8.DuraS2ST: Chain-of-Thought and Reinforcement Learning…8.2前25%方法研究#语音翻译
9.Unsupervised Speech Enhancement via Drifting8.2前25%方法研究#语音增强
10.CoSE-E: A Benchmark for Code-switched Speech…8.2前25%数据集与基准#语音识别
11.Probing Large Audio-Language Models for Compositional…8.1前25%数据集与基准#音频分类
12.HEAR: Real Voices, Real Bias: A Large-Scale Human…8.1前25%数据集与基准#音频问答
13.SAIL: Spatial Audio Intelligence with Large Language…8.0前25%方法研究#声音关系与推理
14.SEmoEdit: Probing and Harnessing the Editability of…8.0前25%方法研究#语音编辑
15.Almieyar: A Culturally Grounded Benchmark for Multi…8.0前25%数据集与基准#语音识别
16.MyoCodec: A Streaming Neural Codec for Electromyography7.9前25%方法研究#音频编码
17.CORA: A Protocol for Diagnosing Boundary Robustness in…7.8前25%数据集与基准#音频检索
18.Joint and Cross-Modal Video-Audio Generation and…7.8前25%综述#音视频生成
19.JazzSAMBA: A Synchronous and Asynchronous Multi-take…7.8前25%数据集与基准#音乐源分离
20.Mask-Induced Displacement in Audio XAI via Logit…7.7前25%方法研究#音频分类
21.Tokens Change, Structure Endures: Spectral…7.7前25%方法研究#音频水印
22.GLAD: Global-Local Adaptive Detector for Robust Speech…7.7前25%方法研究#语音伪造检测
23.Whisper-Flash: Acoustically Conditioned Parallel…7.6前25%方法研究#语音识别
24.DuplexCadence: Exact State and Execution from a Speech…7.6前25%系统技术报告#全双工语音交互
25.MultiTalk: Scaling Full-Duplex Speech Models to Long…7.6前25%数据集与基准#全双工语音交互
26.Normalise or condition? Noise-floor front-ends for on…7.5前25%应用研究#关键词检测
27.CoLMbo-SV: A Grounded Language Model for Explainable…7.5前25%方法研究#说话人验证
28.Jev Matches 7B Language Models for Speech…7.5前25%应用研究#言语神经解码
29.Rethinking Automated Voice Similarity by Shifting from…7.5前25%方法研究#说话人验证
30.Evaluating Machine Unlearning in ASR7.5前25%方法研究#语音识别
31.SPEAR-Gen: Generation-Aware Pre-training for Unified…7.5前25%方法研究#音频理解
32.SyncRA: Learning Temporal Correspondence in Omni-Modal…7.5前25%方法研究#音视频问答
33.Perception-Inspired Bayesian Causal Fusion for…7.5前25%方法研究#联合声音事件检测定位
34.CharDuplex: Building Character-Consistent Full-Duplex…7.4前50%模型报告#全双工语音交互
35.SincDPNet: Interpretable Raw-Waveform Bathroom…7.4前50%数据集与基准#音频分类
36.RemixIT-TSE: Progressive Synthetic-to-Real Adaptation…7.4前50%方法研究#目标说话人提取
37.Trigger Sound Suppression for Misophonia7.4前50%应用研究#音频分离
38.Long-Term Memory-Guided Enhancement for Target…7.4前50%方法研究#音频分类
39.Reconstructing the Vocal Tract with Differentiable…7.4前50%方法研究#语音合成
40.When Capabilities Fail to Compose: Diagnosing the…7.4前50%数据集与基准#音频推理
41.GAMF: Learned and Analytical Array Transfer Function…7.3前50%方法研究#声源定位
42.Harmonizing Spectral Evolution in Conditional Flow…7.3前50%方法研究#文本到语音
43.On Temporal Binding in Large Audio Language Models7.3前50%方法研究#声音关系与推理
44.Distill Locally, Schedule Globally: Flow Maps for Few…7.3前50%方法研究#文本到语音
45.REALM: A Coarse-to-Fine Generative Framework for…7.2前50%方法研究#语音对话系统
46.Language Discrimination Improves Linguistic Learning…7.2前50%方法研究#语言识别
47.Retrieving Individual Stems from Music Mixtures with…7.2前50%方法研究#音乐检索
48.From Script to Drama: An Agentic Framework for…7.1前50%方法研究#文本到语音
49.SpeechCritic: Learning a Diagnostic Speech Judge from…7.1前50%方法研究#语音质量评估
50.APEX-Voice: Can Voice Agents Complete Professional…7.1前50%数据集与基准#语音代理规划与工具使用
51.Enabling Immersive Audio-Visual Experience from Any…7.1前50%系统技术报告#音视频生成
52.What Survives the Codec Shift: Pooled No-Vocals…7.0前50%方法研究#音频深度伪造检测
53.Controlling Speaking Rate in Autoregressive TTS via…7.0前50%方法研究#韵律与风格控制
54.Uncovering Ordinal-Matching Bias in Audio-Visual LLMs7.0前50%方法研究#音视频问答
55.SALMONN-duo: Adaptive Dual-System Coordination for…7.0前50%系统技术报告#语音代理规划与工具使用
56.Audio Tokens as a Budgeted Resource: Marginal-Utility…7.0前50%方法研究#音频编码
57.CARDAMOM: A Micro-Dialectal Arabic Speech Dataset for…7.0前50%数据集与基准#语音识别
58.OpenWhistle: A Large-Scale Longitudinal Dataset and…7.0前50%数据集与基准#音频分类
59.Perceptual Quality Loss or Loss of Perceptual Quality?7.0前50%方法研究#语音增强
60.InstCharVoice: Grounding Natural-Language Instructions…7.0前50%方法研究#文本到语音
61.WenetSpeech-Min: A Large-Scale Minnan Speech Corpus…7.0前50%数据集与基准#语音识别
62.DiffVQE2: An Efficient Low-delay Diffusion Model for…6.9前50%方法研究#回声消除
63.Beyond Textual Chain-of-Thought: JEPA-Conditioned…6.9前50%方法研究#音频推理
64.Latency and accuracy tradeoffs in Spiking Neural…6.9前50%方法研究#关键词检测
65.UDSS-BWE: Uncertainty- and Decision-Science Inspired…6.9前50%方法研究#带宽扩展
66.Adapting offline models to a streaming context for…6.8前50%方法研究#音乐源分离
67.Measurement-Based Bitrate-Energy-Quality Analysis of…6.7前50%系统技术报告#音频编码
68.Multimodal Target Speaker Extraction: Towards Unified…6.7前50%综述#目标说话人提取
69.Unified Target-Speaker ASR with Text and Enrollment…6.6前50%方法研究#目标说话人提取
70.In-Context Adaptation of Encoder-Decoder Models in…6.6前50%方法研究#语音识别
71.Uncovering shortcut learning in audio classifiers by…6.6前50%方法研究#音频分类
72.Explainable and Generalisable LLM-based Cognitive…6.6前50%应用研究#病理语音评估
73.InterBias-SV: Compound Conditions in Speaker…6.6前50%数据集与基准#说话人验证
74.SCISSOR: Score-Conditioned Instrument Source…6.5前50%方法研究#音乐源分离
75.Identity-Assisted Association of Unordered DOA…6.5前50%方法研究#声源追踪
76.Domain-Adaptive Dual-Gating Mixture of Experts for…6.4前50%方法研究#音频深度伪造检测
77.An Efficient Parametric Codec for Low-Bitrate First…6.3前50%方法研究#音频编码
78.Domain-Incremental Learning for Generative Speech…6.3前50%方法研究#语音增强
79.EvolvingAvatar: Interactive 3D Head Generation That…6.3前50%方法研究#音视频交互
80.Beyond Discrimination: Calibrated Geoprior Fusion for…6.3前50%方法研究#音频分类
81.Emergent Tonal Structure in Learned Chord Embeddings…6.3前50%方法研究#音乐分析
82.Distributional Metrics for Evaluating Spoken…6.2前50%方法研究#语音对话系统
83.DGS-MLDG: Domain Gradient Surgery Guided Meta-Learning…6.1前50%方法研究#音频深度伪造检测
84.Does a prosody-trained representation help beyond…6.1前50%方法研究#语音识别
85.Interpreting and Evaluating Dynamic-Rate Speech Codec…6.1前50%方法研究#语音编码
86.From One-Shot Generation to Incremental Music…6.0前50%方法研究#符号音乐生成
87.Model-Guided Design of Low-Context Speech Probes for…5.9前50%应用研究#语音可懂度评估
88.Sub-Model Short-Term Memory Convolutions for Keyword…5.8前50%方法研究#关键词检测
89.From Human Narrative to Harmonic Structure: A Human…5.7前50%应用研究#符号音乐生成
90.Towards Interpretable Framework for Neural Audio…5.5前50%方法研究#语音属性识别
91.Prox-Friendly Log-Magnitude Prior on Complex-Valued…5.5前50%方法研究#去混响
92.Simulation-Based Inference for Plate Reverb System…5.5前50%应用研究#房间脉冲响应估计
93.FlowAct-R2: Beyond Talking Avatar via Streaming…5.3后 50%系统技术报告#音视频交互

📋 论文列表

🖼️ 有图的论文会在这里展示首张原论文图;原图链接见对应独立页面。

🥇 先写可读的谱再唱完整首歌:YuE2 用符号规划统一作曲与音频生成

原论文 Figure 2:YuE2 progressively commits to musical detail while keeping the symbolic score explicit and…

英文题目:YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality

标签:#歌唱生成 | #混合专家模型 | #符号音乐生成 | #音乐 | #自回归模型

评分:8.9/10 | 创新 1.7/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.9/1 | 影响力 1.3/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Ruibin Yuan:机构信息未在 arXiv HTML 中可靠披露
  • Jiahao Pan:机构信息未在 arXiv HTML 中可靠披露
  • Junyan Jiang:机构信息未在 arXiv HTML 中可靠披露
  • Zhiyue Wu:机构信息未在 arXiv HTML 中可靠披露
  • Ziya Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Jiankai Sun:机构信息未在 arXiv HTML 中可靠披露
  • Yizhi Li:机构信息未在 arXiv HTML 中可靠披露
  • Ge Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Yicheng Gu:机构信息未在 arXiv HTML 中可靠披露
  • Zeyue Tian:机构信息未在 arXiv HTML 中可靠披露
  • Junyu Dai:机构信息未在 arXiv HTML 中可靠披露
  • Hanfeng Lin:机构信息未在 arXiv HTML 中可靠披露
  • Kai Li:机构信息未在 arXiv HTML 中可靠披露
  • Shangda Wu:机构信息未在 arXiv HTML 中可靠披露
  • Xuanjie Liu:机构信息未在 arXiv HTML 中可靠披露
  • Jiaming Wang:机构信息未在 arXiv HTML 中可靠披露
  • Zihan Liu:机构信息未在 arXiv HTML 中可靠披露
  • Yue Wang:机构信息未在 arXiv HTML 中可靠披露
  • Yinghao Ma:机构信息未在 arXiv HTML 中可靠披露
  • Hanzhi Yin:机构信息未在 arXiv HTML 中可靠披露
  • Kangrui Chen:机构信息未在 arXiv HTML 中可靠披露
  • Xinyue Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Ziyang Ma:机构信息未在 arXiv HTML 中可靠披露
  • Mengqi Liao:机构信息未在 arXiv HTML 中可靠披露
  • Hejia Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Guowei Huang:机构信息未在 arXiv HTML 中可靠披露
  • Chao Yan:机构信息未在 arXiv HTML 中可靠披露
  • Lei Ke:机构信息未在 arXiv HTML 中可靠披露
  • Jianwei Yu:机构信息未在 arXiv HTML 中可靠披露
  • Bei Liu:机构信息未在 arXiv HTML 中可靠披露
  • Joe Guo:机构信息未在 arXiv HTML 中可靠披露
  • Liumeng Xue:机构信息未在 arXiv HTML 中可靠披露
  • Gus Xia:机构信息未在 arXiv HTML 中可靠披露
  • Wei Xue:机构信息未在 arXiv HTML 中可靠披露
  • Yike Guo:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

完整歌曲生成需兼顾作曲可读性与录音完成度,输入为风格文本与歌词,输出为全曲立体声录音,其难点在于无对齐乐谱录音难以同时学到旋律和声结构与声学细节。YuE2采用单AR-NAR混合专家三级渐进生成,先写可读ABC谱规定调式拍号段落和弦与人声器乐旋律,再将其扩展为25Hz语义令牌,最后经流匹配生成声学隐变量并由变分自编码器解码为波形。为构造对齐训练序列,冻结的SheetSage2提供符号监督,多视角目标合成支撑的MERT2提供语义监督,二者离线转录真实录音得到统一词汇与时间规约。与跳过乐谱的音频模型不同,该系统将旋律和声显式提交为可编辑中间态,同一检查点复用该接口支持受控编辑与零样本翻唱。在GTZAN基准下,SheetSage2-AR的节拍F1指标为86.27,高于SheetSage2-Prober的节拍F1指标82.93。在WildSongBench192提示词上标准双候选取得SongBench全局平均得分6.73,best-of-8达6.96为观测最高。其边界在于最优候选依赖音乐性指标排序、HeartMuLa 存在 SongEval 与 AudioBox 训练复用、翻唱放松和声约束后作品一致性与风格适配需权衡。训练时长与推理成本原文未披露。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥈 慢估计配快修正:在单片机上把六通道波束形成拆成两种时间尺度

原论文 Fig. 1:Block diagram view of the elements in our neural beamforming application.

英文题目:Transformer-based Neural Beamforming for Real-Time Speech Enhancement on Smart Low-Power Hearable Devices

标签:#语音增强 | #波束成形 | #模型量化 | #实时处理 | #端侧运行

评分:8.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.4/1.5

排名:前25% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Luca Bompani:Electrical, Electronic and Information Engineering (DEI), University of Bologna, Italy
  • Marco Fariselli:Electrical, Electronic and Information Engineering (DEI), University of Bologna, Italy
  • Giovanni Oltrecolli:Electrical, Electronic and Information Engineering (DEI), University of Bologna, Italy
  • Francesco Conti:Electrical, Electronic and Information Engineering (DEI), University of Bologna, Italy

📌 核心摘要

六麦克风助听需在毫瓦级微控制器上从混响加性噪声中实时恢复目标语音,难点在于多通道最小方差无失真响应掩膜估计与协方差求逆开销大且延迟敏感。所提管线先由卷积神经网络从参考通道短时傅里叶变换估计语音掩膜并经协方差求逆得到最小方差无失真响应权重,再由轻量因果Transformer从六通道当前帧与上一帧直接预测加性复数校正并叠加归一化后做加权求和,语音活动检测在静音时旁路全管线。慢变声场景由秒级感受野的卷积神经网络捕获而快变细节由约30ms窗的Transformer补偿,二者时间尺度解耦使重型卷积神经网络可跨多帧分片执行而不阻塞输出,这与短窗慢分支复用即退化的已有快慢架构形成关键差异。在VoiceBank测试集下,CNN+Transformer管线的STOI为98.04±0.07%,高于未处理噪声输入的STOI 92.38±0.28%。混合精度部署在GAP9上每帧延迟15ms,完整推理约25.9mJ,平均功耗45.9mW,在30%语音占空比加每秒刷新权重条件下100mAh电池续航约20.3小时,硬件实测支撑全天候推断。该结论限于 8 kHz 仿真混响与漫射噪声,对运动声源、真实佩戴失配与非平稳突发噪声尚未验证。原文未披露训练算力与时长,部署成本以 GAP9 实测功耗与分片调度给出。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥉 只算转录里出现的词:剪掉词表维度的 CTC 如何等价省显存

原论文 Figure 1:Offline LLM-based ASR under causal attention.

英文题目:Pruned CTC for Memory-Efficient Large-Vocabulary ASR Training

标签:#语音识别 | #CTC | #流式处理 | #大语言模型

评分:8.7/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yifan Yang:Shanghai Jiao Tong University
  • Xiaoyu Yang:University of Cambridge
  • Zengrui Jin:Tsinghua University
  • Xian Shi:Alibaba Token Hub, Alibaba Group
  • Yuxuan Wang:Alibaba Token Hub, Alibaba Group
  • Yu Xi:Alibaba Token Hub, Alibaba Group
  • Ziyang Ma:Shanghai Jiao Tong University
  • Qi Chen:Shanghai Jiao Tong University
  • Ruiyang Xu:Shanghai Jiao Tong University
  • Hui Wang:Nankai University
  • Dongchao Yang:Chinese University of Hong Kong
  • Jin Xu:Alibaba Token Hub, Alibaba Group
  • Xie Chen:Shanghai Jiao Tong University;SII

📌 核心摘要

自动语音识别希望直接使用大语言模型原生词表做非自回归解码,但标准联结时序分类需物化帧乘词表激活,显存随词表线性增长而难以训练。Pruned CTC先按批次收集转录中出现的互异目标词与空白符构成小词表,再用分块投影在线累积完整词表归一化子,最后仅在小词表对数概率上做有限波束前向后向计算。反向传播通过重算各词表分块恢复稠密梯度,使对齐项与归一化项分离而不改变目标函数。相比直接删除无关类别,该机制保留了归一化子并证明了损失与一阶梯度等价,具有实质差异。在GigaSpeech评测设置下,Pruned CTC的WER为11.24%,低于标准CTC的WER 11.27%。在单块H100硬件上搭配18万类词表时全步训练显存降低5.1倍,单步时间推理开销增加17%且精度基本持平。结论适用边界限于已验证的离线与有界历史流式CTC解码,依赖转录词覆盖小词表假设与波束足够大的经验条件,超出该范围的长尾分布与极小波束失败条件尚未验证。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


4. 话没变但做法该变:VoxParity 测语音智能体是否真听见了声音

原论文 Figure 1:VoxParity at a glance, and its headline: all 28 systems err toward the words when the audio calls…

英文题目:Almost Human, Except When It Matters: VoxParity and the Decisions a Voice Should Change

标签:#语音代理规划与工具使用 | #基准设计 | #基准测试 | #语音 | #模型评估

评分:8.4/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Bhavik Mangla:Independent Research

📌 核心摘要

语音代理规划与工具使用的输入是整段通话音频、代理角色与政策和打乱顺序的工具菜单,输出是首轮可执行的类型化工具调用,难点是同一转写在不同交付、第二说话人、环境声或说话人状态下要求完全不同的受保护动作。VoxParity固定转写并渲染多版本音频构造最小对比集,用确定性语法匹配器对工具名与类型化参数打分,以词语空测试比较音频相对自身文本孪生的增益并减去仅读词级联的漂移,再以志愿者玩家作同菜单行动参考。在183个场景的评测下,所有28个系统的不安全执行率指标为41%,低于仅读词级联的不安全执行率指标58%。与仅看识别率或直接计分相比,该差分检验只在听觉改变决策超出文本漂移时才记功,从而把听见线索与用线索决策分开,缺口主要在决策桥接而非听觉本身。该结论受限于合成情感、单一主录音者与小规模志愿者,尚不能推广到多说话人与自然情感分布。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


5. 语义先作曲、扩散再渲染:Open-Qwen-Music 如何把接口固定下来做可核查重建

英文题目:Open-Qwen-Music: An Auditable Framework for LLM-Based Music Composition and Diffusion Rendering

标签:#音乐生成 | #自回归模型 | #扩散模型 | #数据集

评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Yangbin Yu:机构信息未在 arXiv HTML 中可靠披露
  • Mingyu Yang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

Open-Qwen-Music处理文本到音乐生成,输入为风格标签与结构化歌词,输出为48 kHz立体声音频,难点在于语义规划的长程连贯性与声学渲染的保真度需要在离散瓶颈处对齐。音乐分词器将24 kHz单声道音频压缩为25 Hz单码本语义令牌并送入音乐大模型,3B规模音乐大模型自回归规划该令牌序列以承载旋律与结构,扩散渲染器再经频谱变分自编码器与频带修正器将令牌还原为波形。与直接端到端生成相比,该分解使表示、规划与渲染接口显式化且可独立替换。与已有只开推理权重的开源项目相比,关键差异在于训练语料、流水线与全部模块权重均公开并用产物清单绑定。在语义分词量化评测任务下,真实录音面板的ΔPER指标为2.879,高于通用音乐保留集的ΔPER指标2.352。作者明确不声称与Qwen-Music质量持平,训练暴露仅约10100小时而原版报告超500万小时,规划器仅在英文30秒内分段窗口训练且无后训练,多语言与长结构泛化尚未验证。渲染器条件流匹配在64张H20硬件上以全局批量256训练29000步,推理采用8步Euler求解器,构成可复现的训练成本与推理开销参照。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


6. 对话式音乐推荐:先多路召回再学着信任哪一路

原论文 Figure 2.:Turn-macro nDCG@20 by target turn index over Blind-B. † The evaluation-data-exposed submission.

英文题目:Overview and Analysis of the RecSys Challenge 2026: Conversational Music Recommendation

标签:#音乐推荐 | #基准设计 | #基准测试 | #音乐

评分:8.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Seungheon Doh:Sony Group Corporation, Japan
  • Sergio Oramas:SiriusXM, United States
  • Bruno Sguerra:Deezer Research, France
  • Abhinav Bohra:Amazon, United States
  • Claudio Pomo:Politecnico di Bari, Italy
  • Francesco Barile:Maastricht University, Netherlands

📌 核心摘要

该挑战研究多轮对话式音乐推荐,输入为用户画像、历史对话与当前请求,输出为20首曲目排序与解释性回复,难点在于意图分散在多轮、候选库达47071首且冷启动缺画像。主流方案形成检索召回、学习排序与 grounded回复生成的三段链条,先由BM25、稠密检索与协同等多路异构检索并集召回候选并保留来源秩与分数证据。接着树模型利用来源存在、秩次与跨源一致性特征重排精选20首,再基于固定榜单生成解释回复以避免虚构证据。相比单检索器基线,其关键差异在于异构并集抬高召回上限,再以来源可信度特征学习信任度,具有可复用的设计意义。在Blind-B评测下,hallucinated系统的nDCG@20得分为0.618,高于次优系统的nDCG@20得分的0.493。其结论适用边界受限于单目标、教师强制合成多轮评测,模糊意图与交互式澄清场景尚未验证,属已知失败条件。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


7. 长草稿走不远:用声学进度递推撑住 ASR 推测解码的后半程

英文题目:Acoustic Progress Propagation for Long-Horizon Speculative Decoding in ASR

标签:#语音识别 | #动态计算与早退 | #高效推理 | #语音

评分:8.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yuanyuan Jia:机构信息未在 arXiv HTML 中可靠披露
  • Qianqian Yang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

自动语音识别需将连续语音声学表示转写为离散文本,轻量草稿模型在多步前滚中难以跟踪每个词元对应的音频位置,导致音频交叉注意力漂移与长程接受长度饱和。第一步由目标解码器第21层注意力峰值初始化时间锚点a1,其复用目标正常解码权重且无需额外前向,输出的锚点位置作为递推起点进入第二步。第二步由进度预测器依据上一进度与当前自注意力后表示递推非负增量并累加得到ak,其未裁剪值用于状态传递与监督,裁剪后位置进入第三步。第三步将裁剪位置转为高斯对数偏置注入音频交叉注意力,检索到的声学上下文经草稿状态影响下一步进度预测形成闭环。与仅做单步对齐监督的AnchorDraft相比,该机制把定位从每步全局重检索改为沿时间前向传播的状态跟踪,并配合变长horizon联合训练学习进度转移。在 5 个英文测试集上以 Qwen3-ASR-0.6B 为目标时宏平均端到端加速比为 1.657x,相对 AnchorDraft 提升 34.3%,接受长度相对提升 46.6%;以 Qwen3-ASR-1.7B 为目标时分别为 1.227x、9.0% 和 16.3%,全程保持与目标自回归解码完全一致的无损词错误率。该结论限于贪婪解码、批量大小为 1 的英文朗读与演讲域,超过 8 的更长草稿验证开销已抵消接受增益,噪声、口音、多语、束搜索与流式场景尚未验证。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


8. 先想好说什么、说多长,再开口:DuraS2ST 把时长对齐变成推理规划

原论文 Figure 1:英文源句预算 3s,级联、黑盒控制与 DuraS2ST 分别输出 1s、5s、3s。官方图注与像素不一致。

英文题目:DuraS2ST: Chain-of-Thought and Reinforcement Learning for Duration-Aligned Speech-to-Speech Translation

标签:#语音翻译 | #强化学习 | #数据集 | #语音配音

评分:8.2/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yayue Deng:机构信息未在 arXiv HTML 中可靠披露
  • Dingdong Wang:机构信息未在 arXiv HTML 中可靠披露
  • Yuxuan Hu:机构信息未在 arXiv HTML 中可靠披露
  • Jinyu Li:机构信息未在 arXiv HTML 中可靠披露
  • Yanqing Liu:机构信息未在 arXiv HTML 中可靠披露
  • Yuanyuan Wang:机构信息未在 arXiv HTML 中可靠披露
  • Weidong Chen:机构信息未在 arXiv HTML 中可靠披露
  • Helen M. Meng:机构信息未在 arXiv HTML 中可靠披露
  • Shujie Liu:机构信息未在 arXiv HTML 中可靠披露
  • Xixin Wu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音到语音翻译(Speech-to-Speech Translation,S2ST)在视频配音等时间敏感场景要求同时保证语义忠实、说话人保持与时长一致,中英等结构差异语对的自然译文音长常偏离源时长。DuraS2ST提出单语音语言模型(Speech Language Model,SLM)先以显式思维链(Chain-of-Thought,CoT)规划目标措辞与音素长度,再自回归生成交错文本声学序列的两阶段管线:先在DuraSet-440K上监督微调(Supervised Fine-Tuning,SFT)建立规划到合成映射,再以组相对策略优化(Group Relative Policy Optimization,GRPO)联合优化翻译质量与时长。与直接时长嵌入或后处理拉伸相比,该机制把时长约束提前到符号层选词而非声学层压缩,从而保留韵律自然度。训练语料经由候选翻译生成、可控合成筛选与音素级推理标注构建,推理轨迹的输出直接作为声学令牌生成的条件上下文。强化阶段以时长裕度奖励与模态感知奖励分配将质量与时长信号归因到对应片段,并以格式门控过滤非法结构以防奖励作弊。在CVSS-T中英双向评测中,Think-RL在ZH-EN上平均BLEU达27.30并将平均相对时长误差降至0.068,在EN-ZH上源目标时长比落在阈值内比例达0.997,显著优于同骨干基线。结论目前仅验证离线中英双向配音,流式同传与更多语种尚未验证,训练推理成本未披露。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


9. 只学干净语音的分布会走丢内容:用锚和键把漂移拴回输入

原论文 Figure 1:The unpaired training recipe. The generator f_\\theta (\\mathbfG) maps the noisy input \\mathbfy to…

英文题目:Unsupervised Speech Enhancement via Drifting

标签:#语音增强 | #生成模型 | #无监督学习 | #去混响

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Diego Caviedes-Nozal:机构信息未在 arXiv HTML 中可靠披露
  • Liang Xu:机构信息未在 arXiv HTML 中可靠披露
  • Rasmus Kongsgaard Olsson:机构信息未在 arXiv HTML 中可靠披露
  • W. Bastiaan Kleijn:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

无配对语音增强只能拿到退化语音集合与独立干净语料,缺失对应关系导致生成器易漂离输入的词内容与音色。本文把标准漂移重写为仅建模干净边缘先验的核密度分数流,指出其缺失观测似然与特征雅可比错位是漂移根源。方法链分三步衔接:库编码器维持向干净流形的牵引,锚编码器以退化输入自身为目标补上似然牵引,键编码器按输入相似度重加权检索行以形成条件先验,生成器单步输出再经自配对对抗校正器去伪影。与纯分布匹配相比,关键差异是训练目标重新依赖输入而不需配对标签。在 VoiceBank-DEMAND 完整 824 句测试集上,键控系统词错误率(Word Error Rate, WER)从未处理输入的 11.7% 降至 10.1%,说话人相似度(ECAPA)从 0.490 恢复至 0.879。在 WSJ0-REVERB 完整 651 句测试集上,词错误率从 32.71% 降至 23.81%,但感知质量与说话人相似度未超输入。该结论边界是去混响增益限于内容、强键控损伤背景质量、校正器在混响上失效。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


10. 字都对了事还没办成:企业混语语音为何要从答案倒查转写

原论文 Figure 1:Overview of CoSE-E Generation Pipeline

英文题目:CoSE-E: A Benchmark for Code-switched Speech Evaluation in Enterprise Settings

标签:#语音识别 | #基准设计 | #基准测试 | #代码转换 | #模型评估

评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Shama Gupta:ServiceNow AI Research
  • Hoang H Nguyen:ServiceNow AI Research
  • Chelsea Huang:ServiceNow AI Research
  • Lindsay Devon Brin:ServiceNow AI Research
  • Fanny Riols:ServiceNow AI Research

📌 核心摘要

企业语音代理输入为母语话语中嵌入英语术语的码语转换语音,输出支撑工单路由与政策问答,难点在于转换常发生在实体与技术术语等高信息处并引发转写失败进而传导为任务失败。方法链分三步:先由大模型生成插入式转换文本并经规范化与合成得到1212条语音再经母语语言学家校验,其输出进入以字面转写为基线的评测,其后用语义级误差与问答式任务误差检验下游答案是否改变。与仅用编辑距离度量的已有方法不同,该框架以答案而非字符串评分,对规范化不变并直接对信息密集标记加权,因而能区分表面改写与实质语义破坏。在ES/EN基准任务下,Qwen3-Omni的AER为.027,低于Scribe-v2的AER .033。欧洲语对上语义最难为法语而表面最难为德语的分裂及中文表面误差高但任务误差不高,共同说明字面指标会误判可用性。该结论适用边界受限于朗读式合成语音、句内插入式转换与英语为嵌入语的设定,电话信道、口吃与交替式转换等场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


11. 从一串碎声音推出人在做什么:大音频语言模型的组合推理缺口

英文题目:Probing Large Audio-Language Models for Compositional Understanding of Sounding Actions

标签:#音频分类 | #基准设计 | #基准测试 | #音频大模型

评分:8.1/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Michel Olvera:机构信息未在 arXiv HTML 中可靠披露
  • Paraskevas Stamatiadis:机构信息未在 arXiv HTML 中可靠披露
  • Changhong Wang:机构信息未在 arXiv HTML 中可靠披露
  • Gaël Richard:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文针对大音频语言模型(Large Audio-Language Model,LALM)能否仅凭声音组合推断高层人类活动,输入为5至10秒现实环境录音,输出为活动标签或自由名词短语,难点在于同一活动声学实现多变且不同家务例行活动声学高度重叠。方法链分三环:先从自我中心视频数据集整合标签并经两轮可听性筛选构建99节点层级分类体系,再用对比语言音频预训练模型嵌入计算类原型并按距离挑选中心与边缘范例及远近干扰项,最后以直接选择、事件接地、开放生成与联合或分步层级分类共5种协议评测约30个模型。与原子事件识别范式相比,该设计把组合抽象作为独立能力进行析因检验,揭示事件接地普遍损伤性能而层级分解稳定增益的结构差异。在最易中心远干扰条件下人类平均准确率达0.864而模型平均仅0.320,差距达0.544,多数模型在最难条件下收敛至接近随机水平。结论仅适用于单标签短片段自我中心家务类活动,不覆盖共发与迁移活动、长时录音、音乐言语与非自我中心场景。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


12. 声音改变答案吗:HEAR 用真人录音检验音频大模型的语音条件偏见

原论文 Figure 1:Demographic distribution of HEAR benchmark

英文题目:HEAR: Real Voices, Real Bias: A Large-Scale Human-Recorded, Demographically Diverse Benchmark for Audio Language Models

标签:#音频问答 | #基准设计 | #基准测试 | #公平性 | #语音

评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Shen Yan:机构信息未在 arXiv HTML 中可靠披露
  • Duc Le:机构信息未在 arXiv HTML 中可靠披露
  • Irina-Elena Veliche:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该基准输入为真实人声朗读的含糊语境问答与开放式生活求助语音,输出为音频大模型的选项归属或长文本建议,难点在于性别与年龄等副语言线索不应影响语义判断但难以与内容和信道隔离。方法链分为三步:首先在美国招募843名成年人用手机居家录制87k条语音,其次将文本偏置问答改写为口语版含糊问答与手写开放问答两类任务并送入语音到文本与实时语音到语音两类模型,最后用内容偏置与语音条件差异等多维指标比较不同人口组输出分布。相比已有合成语音基准,关键差异是用真实声学变异保留口音与韵律及信道特征并同时覆盖实时交互与理解两类架构,因而更贴近部署场景。在Open QA基准下,个性化条件下Qwen-Omni的Disparity指标为54.00%,从默认条件下Qwen-Omni的Disparity指标22.00%升至54.00%。结论目前仅适用于美国英语成人居家手机录音,未验证其他语言与地域及儿童或老年极端群体的外推性。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


13. SAIL:把“是什么” 和“在哪里” 分开编码,再按声源槽位对齐大模型

原论文 Fig. 1:Comparison between the proposed SAIL model and the prior BAT model.

英文题目:SAIL: Spatial Audio Intelligence with Large Language Models via Disentangled Acoustic-Spatial Encoding and Dual-Stream Q-Former

标签:#声音关系与推理 | #多模态学习 | #空间音频信号 | #联合声音事件检测定位 | #音频大模型

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zhengding Luo:机构信息未在 arXiv HTML 中可靠披露
  • Jinyang Wu:机构信息未在 arXiv HTML 中可靠披露
  • Haozhe Ma:机构信息未在 arXiv HTML 中可靠披露
  • Yanghao Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Woon-Seng Gan:机构信息未在 arXiv HTML 中可靠披露
  • Wenwu Wang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为双声道混响语音与自然语言问题,输出为声事件类别、三维方向、距离及声源间相对关系,难点是重叠声源的语义内容与空间属性在融合表征中互相污染且难以保持绑定对应。解耦空间音频变换器先将对数梅尔谱与耳间相位差分为声学流与空间流并行编码,再经共享变换器交互以保留双耳定位线索并抑制声源间串扰。源区分任务查询在预训练中按声源槽聚合事件、方向与距离监督,使每个槽位专注对应声源,随后双流查询变换器按槽分别压缩两路令牌并送入经低秩适配微调的大语言模型进行联合推理。与早期融合基线BAT的关键机制差异是延迟融合与按槽对齐,保留了内容与位置的分离及声源级对应,从而为多源感知与推理提供更可靠的结构化表征。在SpatialSoundQA双声源感知评测任务下,SAIL的方向准确率为46.65%,高于BAT的方向准确率35.12%。结论仅适用于至多2声源合成室内双声道问答,未验证更多声源、真实录音与一阶 Ambisonics 等格式。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


14. 冻结语音流能否直接改情感:SEmoEdit 的速度搬运诊断

原论文 Figure 3:Framework of SEmoEdit for dynamic speech emotion editing.

英文题目:SEmoEdit: Probing and Harnessing the Editability of Pre-trained Speech Flows

标签:#语音编辑 | #流匹配 | #语音 | #基准测试

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Tianxin Xie:The Hong Kong University of Science and Technology (Guangzhou)
  • Pengfei Zhang:The Hong Kong University of Science and Technology (Guangzhou)
  • Kai Jiang:The Hong Kong University of Science and Technology (Guangzhou)
  • Zelin Zhao:The Hong Kong University of Science and Technology (Guangzhou)
  • Li Liu:The Hong Kong University of Science and Technology (Guangzhou)

📌 核心摘要

语音情感编辑输入源语音与目标情感参考,需输出保留文本内容与说话人身份且改变情感的语音,难点在于预训练语音流速度场纠缠情感音色与时序,直接搬运易破坏可懂度与对齐。先以共享噪声构造源条件与目标条件查询冻结流模型速度场并求速度差,输入为源波形与目标参考条件,职责为估计瞬时情感编辑方向,输出为差分速度,该差分速度作为逐点驱动力进入下一步积分。再用音色对齐的语音转换把目标参考统一到源说话人音色,输入为跨说话人目标参考,职责为去除身份泄漏,输出为去身份化的目标条件,该目标条件用于重新构造下一步的速度差查询以抑制声纹携带。最后按起始时间与强度系数对差分速度沿轨迹积分搬运源波形,并以积分中间态检索情感相近干净语料做桥接二次合成,输入为积分中间态,职责为恢复可听性,输出为最终编辑语音。与固定激活偏移相比,该状态依赖的速度搬运随编辑态逐点重算方向,因而更稳定并统一替换、擦除与插值。在SEmoEditBench强度控制任务下,SEmoEdit在F5-TTS骨干上的指标EIC-Emb为0.175,高于最强转向基线的指标EIC-Emb 0.013。其结论适用边界受限,跨数据集跨说话人迁移下降且无显式时长控制骨干时序漂移更大,文本指令泛化尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


15. 生活方言听不懂不是模型小:Almieyar 用全新文化描述语音复测 17 种阿拉伯语方言

英文题目:Almieyar: A Culturally Grounded Benchmark for Multi-Dialect Arabic Speech Recognition

标签:#语音识别 | #基准设计 | #基准测试 | #口音与方言

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Omid Ghahroodi:机构信息未在 arXiv HTML 中可靠披露
  • Anas Madkoor:机构信息未在 arXiv HTML 中可靠披露
  • Dima Faris Al Saudi:机构信息未在 arXiv HTML 中可靠披露
  • Fagr Tahir:机构信息未在 arXiv HTML 中可靠披露
  • Malak Annan:机构信息未在 arXiv HTML 中可靠披露
  • Talha shahid javad allah rakha:机构信息未在 arXiv HTML 中可靠披露
  • Omar Al-Busaidi:机构信息未在 arXiv HTML 中可靠披露
  • Zineb El Kahla:机构信息未在 arXiv HTML 中可靠披露
  • Iheb Zouari:机构信息未在 arXiv HTML 中可靠披露
  • Essa Ahmed Abou Jabal:机构信息未在 arXiv HTML 中可靠披露
  • Ahmed Ezzat:机构信息未在 arXiv HTML 中可靠披露
  • Hind AL-Merekhi:机构信息未在 arXiv HTML 中可靠披露
  • Aisha Hamad M A Al-Naimi:机构信息未在 arXiv HTML 中可靠披露
  • Hadi Wazni:机构信息未在 arXiv HTML 中可靠披露
  • Bushra Alnajjar:机构信息未在 arXiv HTML 中可靠披露
  • Omar Amin:机构信息未在 arXiv HTML 中可靠披露
  • Haya Al-Thani:机构信息未在 arXiv HTML 中可靠披露
  • Houssam Eddine-Othman Lachemat:机构信息未在 arXiv HTML 中可靠披露
  • Marwa Elwakedy:机构信息未在 arXiv HTML 中可靠披露
  • Sundus Abdulmalik Al Nahari:机构信息未在 arXiv HTML 中可靠披露
  • Elahe Zahiri:机构信息未在 arXiv HTML 中可靠披露
  • Osamah Sarraj:机构信息未在 arXiv HTML 中可靠披露
  • Raghad Mousa:机构信息未在 arXiv HTML 中可靠披露
  • Mckeen Assi:机构信息未在 arXiv HTML 中可靠披露
  • Ahd Al Jumah:机构信息未在 arXiv HTML 中可靠披露
  • Heyam Salman:机构信息未在 arXiv HTML 中可靠披露
  • Alhanouf Abdulraqib:机构信息未在 arXiv HTML 中可靠披露
  • Sara Benoumhani:机构信息未在 arXiv HTML 中可靠披露
  • Alia Hamwi:机构信息未在 arXiv HTML 中可靠披露
  • Ayaat Al-Yasseri:机构信息未在 arXiv HTML 中可靠披露
  • Rim Ibrahim Ghazal:机构信息未在 arXiv HTML 中可靠披露
  • Lamia Ben hiba:机构信息未在 arXiv HTML 中可靠披露
  • Mohamed Eltabakh:机构信息未在 arXiv HTML 中可靠披露
  • Fatima Al-Raisi:机构信息未在 arXiv HTML 中可靠披露
  • Yassine El Kheir:机构信息未在 arXiv HTML 中可靠披露
  • Mohammed Abdulrahman:机构信息未在 arXiv HTML 中可靠披露
  • Hamdy Mubarak:机构信息未在 arXiv HTML 中可靠披露
  • Ayah Hashem:机构信息未在 arXiv HTML 中可靠披露
  • Lefkir Meriem:机构信息未在 arXiv HTML 中可靠披露
  • Ehsaneddin Asgari:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文面向自动语音识别在阿拉伯方言上的评测失真问题,输入为方言语音,输出为方言转写文本,难点在于现代标准阿拉伯语与互不相通的口语变体差距大,且既有语料多来自广播而存在训练污染。方法链分四步:社区协调员按10个文化主题挑选图像以锁定评测内容,母语者按5个结构化场景进行约30秒至60秒的图像描述以诱发自发方言语音,Telegram流水线用自动转写辅助说话人自校对,协调员复核裁定正字法与代码转换以形成可发布的参考文本。与已有广播爬取基准的关键机制差异在于内容由社区策展且音频全部新录,从而同时实现文化接地与无污染泛化测试。在Almieyar基准零样本评测下,GPT-4o-transcribe的WER为35.0%,低于Voxtral-Mini-4B的WER 41.1%,表明头部系统间仍存在明显差距且绝对误差依然很高。结论仅适用于图像描述独白的零样本转写,不覆盖对话、朗读、医疗法律等语域及微调后性能。该结论的适用边界受限于图像描述独白任务,对话与微调后性能尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


16. 肌电也要流式组码:MyoCodec 以因果 Transformer 加残差量化做 50 赫兹低码率表示

原论文 Figure 2:An example of EMG signals reconstructed by each model: TinyMyo (top), BioCodec (middle), and…

英文题目:MyoCodec: A Streaming Neural Codec for Electromyography

标签:#音频编码 | #神经编解码与离散单元 | #生理信号 | #流式处理 | #实时处理

评分:7.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jihwan Lee:机构信息未在 arXiv HTML 中可靠披露
  • Kleanthis Avramidis:机构信息未在 arXiv HTML 中可靠披露
  • Junhyeok Lee:机构信息未在 arXiv HTML 中可靠披露
  • Tiantian Feng:机构信息未在 arXiv HTML 中可靠披露
  • Najim Dehak:机构信息未在 arXiv HTML 中可靠披露
  • Shrikanth Narayanan:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

肌电信号需从连续多通道波形中提取紧凑、可流式传输且跨任务复用的表征,难点在于采样率高、通道配置各异而标注稀缺。MyoCodec将2 kHz原始波形按每帧40采样点分帧投影,经8层因果Transformer编码器建模时序依赖,再经6级残差向量量化生成粗到细离散令牌,最后由镜像因果Transformer解码器重建波形,训练分无对抗重建与渐进对抗精化两阶段,共200k步。与非因果离线编码的已有肌电表征不同,MyoCodec坚持全因果流式编解码与逐通道独立处理以兼容任意电极配置,并以50赫兹输出每通道2400比特每秒的多级表征支撑传输与令牌建模。预训练汇集十二个公开语料,先以时域与多尺度谱重建约束码本有效利用,再线性引入对抗与特征匹配损失精化波形细节。在面部肌电到语音解码任务评测下,MyoCodec的WER为21.12,低于TinyMyo的WER 27.77。在面部肌电到语音解码任务上,MyoCodec将词错率降至21.12%,显著优于TinyMyo的27.77%与重训版BioCodec的28.33%,每帧编解码仅需0.482 ms,实现约41倍实时吞吐。该结论限于已见的腕部与面部采集协议,对高密度、新部位或强运动伪影场景尚未验证。原文未披露预训练总耗时与硬件规模,仅给出推理端测量条件与12.72M参数规模。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


17. 改写不远却排位大跌:CORA 用配对秩降诊断目标边界

原论文 Figure 4:Semantic diversity comparison between UIQ, CORA(w/o Prompt), and CORA.

英文题目:CORA: A Protocol for Diagnosing Boundary Robustness in Text-to-Audio Retrieval under Query Reformulations

标签:#音频检索 | #评测协议 | #鲁棒性 | #数据集

评分:7.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Jae Min Woo:机构信息未在 arXiv HTML 中可靠披露
  • Kyongmin Kong:机构信息未在 arXiv HTML 中可靠披露
  • Bogyung Jeong:机构信息未在 arXiv HTML 中可靠披露
  • Minjeong Kim:Sogang University
  • HaeJun Yoo:机构信息未在 arXiv HTML 中可靠披露
  • Du-Seong Chang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

文本到音频检索以自然语言查询对候选池中音频排序,同一意图的命令、疑问、间接、关键词与陈述改写可使同一目标大幅掉榜,而聚合召回难以察觉其实例级失败。所提标题偏移音频检索协议先以源标题为输入,用大模型改写为五种意图保持形式并固定目标音频,输出配对查询以锁定同一检索目标。再以该配对查询为输入,在固定候选池中对源查询与改写查询分别检索并输出两份排序,接着以改写秩减去源秩定义秩降来度量同一目标的保持程度。最后以配对排序与联合嵌入为输入,计算文本位移、目标对齐损失与目标边界余量退化并输出三种诊断信号,再以其与秩降的线性关联诊断失败来源。相对已有鲁棒化训练与宏观评测,该协议不追求平均性能提升,而是诊断目标相对最强非目标竞争者的分数优势如何被改写侵蚀。在四数据集联合协议下,目标边界余量退化的Pearson为0.615,高于文本位移的Pearson 0.084。该结论在意图导向与鲁棒化检索器上依然成立,但其适用边界受限于标题锚定的生成式改写、固定候选池与双塔余弦检索,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


18. 视听不同步就算失败:联合与跨模态视频音频生成编辑的统一问题与设计分类

英文题目:Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

标签:#音视频生成 | #文献综述方法 | #音视频 | #视频到声音生成

评分:7.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:综述 | arXiv 原文

👥 作者与机构

  • Abhinav Sharma:机构信息未在 arXiv HTML 中可靠披露
  • Sai Karthik Navuluru:机构信息未在 arXiv HTML 中可靠披露
  • Wang Wei:机构信息未在 arXiv HTML 中可靠披露
  • Daksh Dangi:机构信息未在 arXiv HTML 中可靠披露
  • Xiangbo Gao:机构信息未在 arXiv HTML 中可靠披露
  • Li Li:机构信息未在 arXiv HTML 中可靠披露
  • Bo Ni:机构信息未在 arXiv HTML 中可靠披露
  • Vardhan Dongre:机构信息未在 arXiv HTML 中可靠披露
  • Junda Wu:机构信息未在 arXiv HTML 中可靠披露
  • Xiyang Hu:机构信息未在 arXiv HTML 中可靠披露
  • Jiuxiang Gu:机构信息未在 arXiv HTML 中可靠披露
  • Seunghyun Yoon:机构信息未在 arXiv HTML 中可靠披露
  • Tong Yu:机构信息未在 arXiv HTML 中可靠披露
  • Chien Van Nguyen:机构信息未在 arXiv HTML 中可靠披露
  • Mohamed Elmoghany:机构信息未在 arXiv HTML 中可靠披露
  • Nedim Lipka:机构信息未在 arXiv HTML 中可靠披露
  • Hoda Eldardiry:机构信息未在 arXiv HTML 中可靠披露
  • Hongjie Chen:机构信息未在 arXiv HTML 中可靠披露
  • Tyler Derr:机构信息未在 arXiv HTML 中可靠披露
  • Thien Huu Nguyen:机构信息未在 arXiv HTML 中可靠披露
  • Zhengzhong Tu:机构信息未在 arXiv HTML 中可靠披露
  • Nesreen K. Ahmed:机构信息未在 arXiv HTML 中可靠披露
  • Franck Dernoncourt:机构信息未在 arXiv HTML 中可靠披露
  • Ryan A. Rossi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理音视频联合建模中的跨模态一致性问题,输入涵盖文本、图像、语音、视频或已有音视频对,输出为同步的视频音频对、单模态补全或双流联合编辑结果,难点在于时间对齐与语义对应需同时成立且编辑还需保持未改区域不变。方法链分三步推进,首先以统一形式化将三类任务定义为联合分布及其条件分布上的采样问题,其次沿生成策略、音频表示、视频表示、对齐施加阶段与预训练复用五轴对约29种联合方法分类,最后按输出类型展开联合编辑、联合生成与跨模态生成的文献综述与数据集指标梳理。与已有综述的关键机制差异在于用对齐分数 S 将架构、目标与采样耦合统一解释,并揭示离散token联合建模等空格。原文未提供可核对的关键定量结果。结论仅适用于已公开文献至2026年中的映射,闭源商业系统与快速演进的预印本细节不在其外推范围内。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


19. 把即兴绑回曲式:JazzSAMBA 用异步叠录与同步合奏补齐爵士标准曲分轨

原论文 Figure 1:JazzSAMBA overview (50 asynchronous / 26 synchronous songs; about 8.1 h preferred-take, about…

英文题目:JazzSAMBA: A Synchronous and Asynchronous Multi-take Band Audio Dataset of Jazz Standards for Live Music Models

标签:#音乐源分离 | #数据集构建 | #数据集 | #音乐生成 | #音乐

评分:7.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Phillip Long:机构信息未在 arXiv HTML 中可靠披露
  • Jacob Nguyen:机构信息未在 arXiv HTML 中可靠披露
  • Jace Hosto:机构信息未在 arXiv HTML 中可靠披露
  • Gage Hosto:机构信息未在 arXiv HTML 中可靠披露
  • Jett Takazawa:机构信息未在 arXiv HTML 中可靠披露
  • Fares Nofal:机构信息未在 arXiv HTML 中可靠披露
  • Sebastian Stade:机构信息未在 arXiv HTML 中可靠披露
  • Nithya Shikarpur:机构信息未在 arXiv HTML 中可靠披露
  • Julian McAuley:机构信息未在 arXiv HTML 中可靠披露
  • Cheng-Zhi Anna Huang:机构信息未在 arXiv HTML 中可靠披露
  • Stephen Brade:机构信息未在 arXiv HTML 中可靠披露
  • Aleksandra Teng Ma:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

爵士标准曲的实时伴奏与分析需要以输入混合音频与书面图表为条件生成或分离目标声部,难点在于即兴与固定和声曲式交织且缺乏干净分轨。作者先以异步叠录与同步合奏两种协议采集鼓、贝斯、钢琴与铜管的分轨与混合,再在统一小节网格上对齐小节线、和弦、段落与独奏者标注并配发MIDI,最后用分离与图表条件伴奏两条基线验证可用性。与流行摇滚多轨及只有和声或独奏转录的爵士语料相比,该机制差异在于同时保留演奏变体与可计分的曲式约束。在异步测试集下,JazzSAMBA微调后HT-Demucs 6s鼓声部的SI-SDR指标为15.09 dB,高于零样本基线的SI-SDR指标13.01 dB。伴奏消融显示图表掩码主要改变节拍对齐而非连贯性,同步合奏因话筒串音使节拍分数更低。结论仅适用于所录编制与标准曲风格,外推至其他编制或自由即兴尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


20. 掩膜填充不是空白:用对数轨迹分解看清音频解释的偏离

原论文 Figure 1:Method overview. Four spectrograms (original and three fills) are passed through classifier…

英文题目:Mask-Induced Displacement in Audio XAI via Logit Trajectory Decomposition

标签:#音频分类 | #统计分析 | #可解释性 | #模型评估

评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Nico García-Peguinho:机构信息未在 arXiv HTML 中可靠披露
  • David Kelly:机构信息未在 arXiv HTML 中可靠披露
  • Fabrizio Smeraldi:机构信息未在 arXiv HTML 中可靠披露
  • Anna Xambó Sedó:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

扰动解释需要对梅尔频谱图做遮挡并将输出变化记在保留特征上,但填充信号本身会污染响应,难点在于缺乏真值时无法区分模型行为与方法伪影。该文先在复数短时傅里叶变换(Complex Short-Time Fourier Transform,STFT)域施加保留掩膜并走完各模型信号链得到logit向量,再以全遮挡到原始输出连线为归因轴做投影分解,最后对正交残差做分保留率协方差与特征谱分析以检验结构稳定性。与以往比较填充忠实度的做法不同,本文放弃排序选优而直接度量几何位移,将标量归因不可见的正交分量显式化。在AudioSet评测条件下,ast+sa零填充Silence类的平均置信度指标为.608,高于panns-sa零填充Silence类的平均置信度指标.327。部分掩膜下正交位移占比高且在中等保留率处最显著,不同采样与加权策略对其暴露程度不一。该结论限于三种填充与三种AudioSet分类器的黑盒logit观测,未打开中间激活验证因果机制,也未证明校正后忠实度提升。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


21. 记号会变,结构留下:面向重编码的语音谱水印

原论文 Figure 6:Detection on Moshi after every pass of each codec.

英文题目:Tokens Change, Structure Endures: Spectral Watermarking for Generated Speech

标签:#音频水印 | #信号处理 | #语音 | #鲁棒性

评分:7.7/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Kanghwi Lee:Institute of Neuroinformatics, University of Zurich and ETH Zurich, Switzerland
  • Kyeongseok Jeong:Institute of Neuroinformatics, University of Zurich and ETH Zurich, Switzerland
  • Jeongmin Liu:Institute of Neuroinformatics, University of Zurich and ETH Zurich, Switzerland

📌 核心摘要

语音语言模型输入提示输出经神经编解码器离散化的token语音,检测端须把波形重编码为token,而解码再编码的往返会替换部分token身份并随多次重合成累积,使依赖精确token身份的水印迅速失效。为此Redwing先在LibriSpeech语料上统计编解码往返替换计数并构建对称替换图,取归一化图拉普拉斯最小特征值对应的平滑基,使易互换token取值相近,该基输出进入下一步优化。再在该基上用无水印生成的采样分布估计信号矩阵A、代价矩阵B与零假设协方差C,并交替求解带幅值约束的嵌入函数g与检测函数h,分别适配低KL代价与低零假设噪声。相对共用随机绿名单的KGW与微调编解码器的WMAR,该设计以实值平滑函数容忍替换并解耦嵌入与检测优化,因而无需训练水印生成器即可保持信号。在Moshi测试集经8次Mimi重合成的评测条件下,Redwing的TPR指标为80.7%,高于KGW的TPR指标8.3%。该结论适用边界受限于低比特率神经重合成与足够长语音,短语音、裁剪与变速等为失败条件,高保真编解码与强信号处理外推尚未验证。完整代码待法律审查后发布,原文未披露训练硬件与推理延迟成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


22. 全局语义盖住局部伪造痕迹时,GLAD 如何逐样本重选层与粒度

原论文 Figure 3:The overall architecture of the proposed GLAD framework from raw speech input to final…

英文题目:GLAD: Global-Local Adaptive Detector for Robust Speech Deepfake Detection

标签:#语音伪造检测 | #混合专家模型 | #多模态学习 | #语音 | #鲁棒性

评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zelin Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Guanjie Huang:机构信息未在 arXiv HTML 中可靠披露
  • Danny Hin Kwok Tsang:机构信息未在 arXiv HTML 中可靠披露
  • Li Liu:The Hong Kong University of Science and Technology (Guangzhou);Guangzhou, China

📌 核心摘要

语音深度伪造检测输入原始波形并输出真伪二分类,难点是在未知合成算法、压缩信道与野外噪声下的分布外泛化。所提全局局部自适应检测器(Global-Local Adaptive Detector,GLAD)先以层次全局局部主干对齐语义与声学自监督表示,再用样本级门控动态重加权层与分支,最后以净化增强消除环境捷径,三阶段输出统一向量经注意统计池化分类。现有自监督检测器偏向全局语义一致而忽视局部伪造痕迹,且静态层聚合无法适应域偏移带来的层重要性变化。与之不同,GLAD以语言声学交叉注意显式桥接粒度差异并以样本级门控替代静态加权,使声学注入强度与层贡献随样本自适应调节,从而保留细粒度取证线索。在仅用ASVspoof 2019 LA训练的设置下,GLAD在ASVspoof 2021 Deepfake评测集上等错误率(Equal Error Rate,EER)为1.31%,显著优于XLS-R加敏感层选择基线的2.30%;在2021 LA、In-The-Wild全集、Fake-or-Real和PartialSpoof上分别为1.88%、5.44%、1.10%和6.53%,均为同期对比中最优。该结论适用于压缩、野外与部分伪造场景,对传统统计声码器攻击A18/A19与极端噪声仍有残留误差。原文披露单样本推理耗时21.08 ms,满足实时但需单卡全微调双大模型,训练成本较高。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


23. 已说出的话就在音频里:用两层并行起草让 Whisper 解码少跑大模型

原论文 Figure 2:Throughput versus batch size on the 64 development clips of Table 1, timed from waveform to text.

英文题目:Whisper-Flash: Acoustically Conditioned Parallel Drafting for Faster Whisper Decoding

标签:#语音识别 | #动态计算与早退 | #语音 | #高效推理

评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Huapeng Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Huayu Wang:机构信息未在 arXiv HTML 中可靠披露
  • Junkai Wu:机构信息未在 arXiv HTML 中可靠披露
  • Kangqi Wang:机构信息未在 arXiv HTML 中可靠披露
  • Xinyu Wang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

Whisper编码器单次并行读取最长30秒音频并输出声学特征,32层解码器却需逐词元自回归生成转录文本,解码端访存与串行等待主导推理耗时。Whisper-Flash首先冻结Whisper large-v3编码器得到声学记忆A并复用已验证目标解码器状态得到历史记忆H,为后续并行猜测提供双路条件。接着2层60.7M可训练草稿器以已发声锚点加8个可学习掩码向量经块内双向自注意力读历史、交叉注意力直读音频,一次并行提出8个候选词元。最后冻结目标解码器以一次因果前向验证全部候选并保留最长一致前缀,在首个分歧处用目标词元纠正、全接受时追加奖励词元,纠正词元成为下一轮锚点并推进缓存。与Medusa等多头并行草稿器共用当前位置单一向量不同,每个掩码位置拥有直达历史与未来音频的独立查询,因而能从已发声内容定位尚未写出的词元。在完整LibriSpeech测试集下,Whisper-Flash的吞吐指标为192.80音频秒每秒,高于贪心解码的吞吐指标60.98音频秒每秒。推理开销方面,单请求贪心对比在单块H100硬件上测得上述吞吐,批量96时编码器占比升至约一半致加速回落,其适用边界受限于英文朗读短语音离线转录场景。局限为英文朗读、已知语言无时间戳、无束搜索与长文分块验证。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


24. 节拍赶不上的原因不在算力:用声明时钟同时收紧状态与执行

原论文 Figure 1:常规运行时与原生时钟契约的状态分配、固定地址缓存和精确形状执行对照。

英文题目:DuplexCadence: Exact State and Execution from a Speech Model’s Declared Timelines

标签:#全双工语音交互 | #形式化分析 | #实时处理 | #流式处理 | #高效推理

评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Haixiao Gao:Jinan University, China
  • Yimin Zheng:Jinan University, China
  • Linyou Xiao:Jinan University, China
  • Zeke Xie:Hong Kong University of Science and Technology (Guangzhou), China

📌 核心摘要

全双工语音交互要求每 1 秒输入在下 1 秒到来前合成出 1 秒语音,会话内阶段严格串行而无法用批处理摊销启动开销。论文将瓶颈定位到语音合成尾段,其数千个微内核的编排空闲与按静态常量超配的持久状态共同导致超时与并发受限。DuplexCadence 先由适配器声明原生时钟与保留策略,再据此分配按需尺寸且地址稳定的保持缓存,并枚举可达形状做精确图形重放。相比填充式分桶记录,该机制不改变归约顺序从而保持比特级一致,同时消除了主机发射间隙与冗余显存。状态规则与计算规则相互使能且按匹配数据块配对验证,逐调用表示不变性在运行期持续校验以保证精确执行。在MiniCPM-o 4.5端到端评测设置下,SRc的SPEAK均值指标为976 ms,低于B0基线的SPEAK均值指标1,141 ms,同步合成段延迟与进程峰值显存亦随精确重放而下降且比特级精确保持不变。结论仅适用于保留有界且推进步长可枚举的流式解码器,逐 token 自回归阶段与提示预热仍回退到急切执行。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


25. 一人对多人、长时双语:MultiTalk 用合成并行流把全双工对话拉长拉多

原论文 Figure 1:Training-data scale comparison.

英文题目:MultiTalk: Scaling Full-Duplex Speech Models to Long, Multi-Party, Bilingual Conversation

标签:#全双工语音交互 | #数据集构建 | #基准测试 | #长音频处理 | #多语言

评分:7.6/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Ke Wang:CUHK MMLab
  • Houxing Ren:CUHK MMLab
  • Zimu Lu:CUHK MMLab
  • Yunqiao Yang:CUHK MMLab
  • Zhuofan Zong:CUHK MMLab
  • Mingjie Zhan:CUHK MMLab
  • Hongsheng Li:CUHK MMLab;CPII under InnoHK

📌 核心摘要

该工作处理单模型服务多名说话人的长时全双工(full-duplex)语音对话,输入为连续多说话人音频流与目标说话人身份,输出为即时语音回应,要求长期跟踪发言归属、话题与回应对象。方法链为离线合成并行流数据、训练双流全双工模型、真人长会议离线回放评测。对话脚本合成先规划场景与人物再生成带重叠与打断标记的轮次,语音渲染与对齐将脚本转为并行声道音频并提供词级时间戳,两阶段训练先做双语双人预训练再做多人微调。基准把真人会议重排为指定角色任务并用法官模型打分。与已有双人短时全双工系统的差异在于把长度、人数、语言与交互动力学同时参数化并保持编解码帧级对齐。在MultiTalkBench上Moshi-MTB最终得分由基座Moshiko-7B的4.66提升至13.15,中文从0.36解锁至16.27,英文从7.82升至10.87,但仍远低于68.74的人类参考。该结论仅适用于英语与汉语会议类场景,不覆盖句内语码转换与更大基座的外推。原文披露预训练约560 GPU小时、微调约33 GPU小时,57.6k小时语料渲染另计64卡30天。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


26. 归一化还是条件化?旋翼噪声地板前端在误报预算下的分化

原论文 Figure 2:Streaming operation (BC-ResNet-8, deployed decision logic): hit rate of commands embedded every 3…

英文题目:Normalise or condition? Noise-floor front-ends for on-board keyword spotting under UAV rotor ego-noise

标签:#关键词检测 | #信号处理 | #基准测试 | #流式处理

评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Yida Lin:机构信息未在 arXiv HTML 中可靠披露
  • Bing Xue:机构信息未在 arXiv HTML 中可靠披露
  • Mengjie Zhang:Victoria University of Wellington;Wellington, New Zealand
  • Sam Schofield:机构信息未在 arXiv HTML 中可靠披露
  • Richard Green:University of Canterbury;Christchurch, New Zealand

📌 核心摘要

单麦克风在小型多旋翼机身上拾取十词飞行指令并输出类别与速度控制,语音比重远低于旋翼自噪声且测试为未见过的另一架无人机噪声,还要在连续音频流中维持极低误触发率。首先流水线每100 ms截取最近1秒98帧40维对数梅尔谱作为判决窗,并对其前2秒200帧按20分位估计每频带噪声地板轮廓与整体电平均值。接着电平锚定条件化前端将判决窗与地板拼为双通道相对特征送入BC-ResNet分类,使首层卷积直接看到带对齐的噪声参考并学习按频带补偿。然后三跳平滑后验经双跳一致确认触发并对同词抑制1秒,停止命令常开而运动命令受开关门控,最终转换为机体坐标系MAVLink速度设定点。与减去地板的归一化丢掉绝对电平证据不同,条件化保留电平信息因而在连续噪声中不抬高误触发率,还可叠加在PCEN之上并保持麦克风增益不变性。在未见无人机噪声测试集条件下,NPC-a在-10 dB的准确率为74.3%,高于对数梅尔基线的准确率69.9%。该结论的适用边界受限于油门稳定时的新鲜地板,变油门后2秒记忆会形成盲区,且真实环境声与旁观者语音仍会高频误触发,失败条件需靠训练负样本与唤醒词缓解。完整流水线在Jetson Orin NX上每100 ms跳步约消耗3.2 ms CPU时间,决策延迟约200 ms由逻辑确认决定。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


27. 报得出数字还不够:CoLMbo-SV 把声纹比对拆成会验证、会引用、待解释的三件事

原论文 Figure 2:VoxReason construction: measurements are extracted from each recording, an LLM writes a…

英文题目:CoLMbo-SV: A Grounded Language Model for Explainable Speaker Verification

标签:#说话人验证 | #多模态学习 | #数据集 | #可解释性

评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Massa Baali:Carnegie Mellon University, USA
  • Sarthak Bisht:Carnegie Mellon University, USA
  • Ziyue Qiu:Carnegie Mellon University, USA
  • Joseph Konan:Carnegie Mellon University, USA
  • Rita Singh:Carnegie Mellon University, USA
  • Bhiksha Raj:Carnegie Mellon University, USA

📌 核心摘要

说话人验证(Speaker Verification, SV)输入为两段语音并输出是否同人,其难点在于嵌入相似度不交代何种声学证据支持判决且信道与韵律混杂难拆分。该系统先用冻结说话人编码器保留完整判别表示,再经映射器(Mapper)生成语言模型前缀并以原始证据旁路输送未压缩比较特征,最后将声学测量以文本块送入语言模型以支撑可核对引用。语言模型在此外缀与测量文本条件下联合生成结构化报告与书面判决,并以两结论负对数似然差作为判决分参与阈值扫描。与把验证压缩进可读特征瓶颈的思路不同,该设计允许判决使用不可名状信息而报告仅承担部分事后说明。测量以文本而非压缩软词元输入以保留精确数值,验证头则提供独立于语言模型的连续决策路径以分离评估。在VoxCeleb1-O共37611个试次上,系统以判决分达到0.99%等错误率(Equal Error Rate, EER),相对同数据微调的最强音频语言基线4.83%大幅降低。该结论限于朗读与访谈语音且未覆盖电话信道与极短语音,原文未披露训练、推理或部署成本。其可解释性承诺的适用边界仍受限于报告模板化倾向,跨信道与强噪声外推尚未验证。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


28. 重排只是做选择:一次定型调用为何能替掉 7B 逐句打分

原论文 Figure 1:Test word error with 95% bootstrap intervals, 978 sentences, identical candidate lists.

英文题目:Jev Matches 7B Language Models for Speech-Neuroprosthesis Rescoring

标签:#言语神经解码 | #模型融合 | #脑信号 | #模型比较 | #高效推理

评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1.3/1.5

排名:前25% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Gabriele Cinà:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

言语神经假体需从皮层脑活动还原企图说话内容并输出文本句子,难点是声学证据噪声大而候选高度相似使重打分决定最终胜者。本文保持三阶段流水线不变,仅替换末端重打分器:循环网络输出音素后验并经词典与神经元n元文法解码产生百选列表。类型化决策模型一次读入全表并返回各标签概率,再与解码器声学分数经列表内标准化加权融合选优。与逐候选计算长度归一化似然的大语言模型相比,单次全表决策消除了生成式选位偏好并强制输出封闭在候选集内。在978句测试集公开协议下,Jev的WER为7.46%,低于OPT-6.7b的WER 7.80%。结论限于单被试T15与缓存列表的离线重打分,未验证多被试泛化与端到端实时闭环。每千句成本为0.069美元且用户侧无需加速器,但依赖公网托管与向第三方传输解码语音结果,中位端到端时延282毫秒,其中服务端约62毫秒、传输约194毫秒。该部署的延迟以传输为主,服务端延迟约62毫秒。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


29. 验证越准不等于听感越准:训练目标与有效维度决定声音相似度

原论文 Figure 1:Overview of our study. Top: measurement of perceptual alignment; bottom: controlled experiments,…

英文题目:Rethinking Automated Voice Similarity by Shifting from EER to Embedding Geometry

标签:#说话人验证 | #评测协议 | #言语感知 | #语音 | #统计分析

评分:7.5/10 | 创新 1.7/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Szu-Chi Chen:机构信息未在 arXiv HTML 中可靠披露
  • Jia-Kai Dong:机构信息未在 arXiv HTML 中可靠披露
  • Yi-Cheng Lin:机构信息未在 arXiv HTML 中可靠披露
  • Sung-Feng Huang:机构信息未在 arXiv HTML 中可靠披露
  • Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音合成与转换常用说话人嵌入余弦相似度自动评价音色相似,选型时默认验证等错误率(Equal Error Rate / EER)越低越符合人耳,但该假设混淆了二分类判别与细粒度排序且未经检验。方法链分三步衔接:先在VoxSim异说话人对上以嵌入余弦与听众均分均值的斯皮尔曼秩相关(Spearman Rank Correlation / SRCC)定义感知对齐度\(\rho_{align}\),输出可比较的对齐分数。再把该分数送入5种模型条件乘7种训练目标的受控矩阵,对比验证性能与对齐度以检验训练目标的分工差异。最后对说话人质心做中心化与特征值分解并以参与率(Participation Ratio / PR)估计等效维度(Effective Dimensionality / \(d_{eff}\)),再用嵌入维度瓶颈干预压缩该几何量以验证因果性。与分类损失依赖可学习类中心加间隔不同,原型类度量损失直接比较同批次嵌入与批量质心,保留更紧凑的说话人流形从而更贴近人类低维感知。在ECAPA-TDNN上,角原型损失与AAM-Softmax同为1.47% EER,但\(\rho_{align}\)从0.111提升至0.406。该几何解释目前仅在VoxCeleb2-dev训练与VoxSim英语评测下成立,未验证跨语言与跨风格迁移。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


30. 遗忘不等于考砸:ASR 遗忘为何要逼近重训模型而非推高误差

英文题目:Evaluating Machine Unlearning in ASR

标签:#语音识别 | #评测协议 | #隐私保护 | #语音

评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Diogo Dinis:机构信息未在 arXiv HTML 中可靠披露
  • Francisco Teixeira:机构信息未在 arXiv HTML 中可靠披露
  • Bhiksha Raj:机构信息未在 arXiv HTML 中可靠披露
  • Alberto Abad:机构信息未在 arXiv HTML 中可靠披露
  • Isabel Trancoso:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理ASR说话人级遗忘任务,输入为语音波形、转写文本与说话人标识,输出为遗忘后模型的词错误率与成员推断抗性,难点在于遗忘模型应分布逼近重训金标准而非推高遗忘集误差。方法链第一步以E-Branchformer为基座构造10组单说话人遗忘与保留划分并重训剔除10个遗忘说话人的金标准模型,为后续对齐提供参照分布。第二步对5种近似遗忘算法做10轮适配并以贝叶斯搜索最小化遗忘集与测试集损失分布间的土方距离,将第一步的划分输出转化为超参数选择目标。第三步用保留集训练、遗忘集评估的简单与知情两类随机森林成员推断攻击加土方距离验证隐私,将第二步对齐后的模型输出送入隐私效用评估。相对只看遗忘集高误差的已有评估,关键机制差异在于坚持窄遗忘定义并引入遗忘感知知情攻击,揭示过度遗忘反而更易被识别的机制,具有纠正标准评估盲区的实际意义。在LibriSpeech单说话人遗忘评测设置下,NegGrad+的MIA AUC为50.18%,低于原始模型的MIA AUC 67.48%。该结论适用边界受限于单模型单语料与10个遗忘主体,序列与同步多主体遗忘均出现退化等失败条件,多说话人场景尚未验证。原文披露实验硬件为单节点Intel Xeon Gold 6348 CPU与3块NVIDIA RTX A6000 GPU,但未量化训练成本与推理开销的延迟与吞吐差异。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


31. 一个表示同时做理解与重建:SPEAR-Gen 用任务对齐目标加粗细两级生成约束

原论文 Figure 1:Overview of SPEAR-Gen. (a) TAFA fuses layer-wise features from SPEAR-XLarge under multi-task…

英文题目:SPEAR-Gen: Generation-Aware Pre-training for Unified Speech Representations

标签:#音频理解 | #自监督学习 | #语音合成 | #流匹配

评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.9/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Xiaoyu Yang:机构信息未在 arXiv HTML 中可靠披露
  • Arthur Hinsvark:机构信息未在 arXiv HTML 中可靠披露
  • Antonios Alexos:机构信息未在 arXiv HTML 中可靠披露
  • Osama Hanna:机构信息未在 arXiv HTML 中可靠披露
  • Philip C. Woodland:机构信息未在 arXiv HTML 中可靠披露
  • Yiting Lu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为原始语音波形或滤波器组特征,输出要求同一单层表示同时支撑理解任务的语言内容判别与生成任务的声学细节恢复。难点在于单层掩码预测目标继承特定层偏置而偏向音素语言信息,重构目标虽保留声学却削弱理解,统一单层易顾此失彼。SPEAR-Gen先以任务对齐特征聚合对冻结SPEAR-XLarge的十三层特征做归一拼接与线性投影,并在语音文本多任务下对齐问答大模型以融合语言与副语言线索。对齐后特征经多码本量化生成离散目标,指导编码器单层输出做掩码符号预测,使多层互补信息集中到最终层。同一输出再经轻量解码器接受对数梅尔谱粗重构与残差流匹配细建模,前者保留主谱时结构,后者补足细粒度声学变化,形成联合损失。在 LibriSpeech 960 小时训练的 Base 规模下,模型在 SUPERB 单层协议上保持语音识别并显著改善情感与说话人任务,同时在 test-clean 重合成上相对理解基线 SPEAR 将感知质量与说话人相似度大幅提升并接近统一基线 WavCube。结论限于英语朗读语音、冻结单层评测与重合成协议,噪声对话跨语言及文本条件生成的泛化尚未验证,原文未披露训练推理与部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


32. 声音与画面对不上时刻:SyncRA 把同时性写进中间层

原论文 Figure 1:A motivating example and the swap diagnostic.

英文题目:SyncRA: Learning Temporal Correspondence in Omni-Modal Models

标签:#音视频问答 | #对比学习 | #音视频 | #多模态模型

评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zelong Xu:University of Wisconsin–Madison
  • Yan Li:University of Wisconsin–Madison
  • Wenhe Hu:University of Alberta
  • Xiyang Hu:Arizona State University

📌 核心摘要

全景视频问答的输入是长视频流与伴随音频及自然语言问题,输出为选项或文本答案,难点在于模型可分别识别声音与画面却不跟踪二者在同一时刻的局部时间对应关系,从而把话语配给错误场景。同步引导表示对齐(Synchrony-Guided Representation Alignment,SyncRA)先利用处理器原生时间元数据把联合上下文中的音频与视觉隐状态按共享区间均值池化,再经共享线性投影与L2归一化映射到64维余弦空间,随后在同一视频内以对称InfoNCE拉近同时刻对并推开异时刻候选,最后与答案交叉熵按权重联合优化并在推理时丢弃投影头。与固定时间码或片段级关联等替代监督相比,该设计直接以输入共现定义正例并保留视频内竞争,从而强制区分时刻而非仅增强单模态时间可读性。在Qwen3-Omni的100视频交换诊断上,AllFour指标从答案微调的34.00%提升至62.50%,且在4个主干与5个公开基准构成的20组比较中平均准确率全部提升。该结论目前仅在60秒至180秒剪辑与多选题交换协议下得到验证,对开放式回答与更长视频的外推尚未检验。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


33. 先问是否同源再融合:贝叶斯因果门控的视听声源定位

原论文 Figure 2:The two causal structures.

英文题目:Perception-Inspired Bayesian Causal Fusion for Audiovisual Source Localization

标签:#联合声音事件检测定位 | #模型融合 | #音视频 | #空间音频信号 | #麦克风阵列

评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Kyung Yun Lee:机构信息未在 arXiv HTML 中可靠披露
  • Sungnyun Kim:机构信息未在 arXiv HTML 中可靠披露
  • Sebastian J. Schlecht:机构信息未在 arXiv HTML 中可靠披露
  • Tae-Hyun Oh:机构信息未在 arXiv HTML 中可靠披露
  • Vesa Välimäki:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

面向有限视场相机配多通道音频的声音事件定位与检测,输入为冻结音频估计的事件类别与方向及视频帧,输出为单位球面上的声源方向,难点在于声源常在视野外或被遮挡,此时视觉观测与声源条件独立,融合只会污染估计。方法链分四步:冻结音频SELD模型输出类别与音频射线,Grounding DINO Tiny以可发声物体标签提示并经手动映射过滤为语义兼容候选,框中心经针孔模型投影为相机射线,基于训练集大圆误差构造von Mises-Fisher似然与均匀零假设计算球面贝叶斯因子,多候选后验经精度加权模型平均回投影到球面得到最终方向。相对无条件融合与固定角阈值硬门控,该机制以连续共同原因后验决定视觉信息价值并在候选间平滑分配权重,避免赢者通吃导致的估计跳变。在MIC全球面合格事件评测下,Causal的DOAE指标为25.40∘,低于Audio的DOAE指标28.15∘。结论仅适用于存在语义兼容检测的合格事件帧,且依赖手动类别映射与角误差先验,检测漏检或映射错误时退化为纯音频。该结论的适用边界受限于合格事件与手动映射及先验标定,跨检测器与大视差外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


34. 被打断后还像同一个人:CharDuplex 用双流时序加角色验证管线训练全双工语音对话

原论文 Figure 1:Overview of the automated character-conditioned data construction pipeline.

英文题目:CharDuplex: Building Character-Consistent Full-Duplex Spoken Dialogue Models

标签:#全双工语音交互 | #强化学习 | #SFT | #数据集 | #语音

评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5

排名:前50% | 文档类型:模型报告 | arXiv 原文

👥 作者与机构

  • Donghang Wu:机构信息未在 arXiv HTML 中可靠披露
  • Yisi Liu:机构信息未在 arXiv HTML 中可靠披露
  • Chen Chen:机构信息未在 arXiv HTML 中可靠披露
  • Hexin Liu:机构信息未在 arXiv HTML 中可靠披露
  • Eng Siong Chng:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文任务是以角色描述与持续到达的用户语音流为输入,同步生成文本与语音回应为输出,难点是在打断、重叠与多轮追问下保持人格、知识与历史一致。方法先将GLM-4-Voice改造为常开同步双流架构并做通用全双工训练,建立听说并行与轮次对齐能力,其输出模型进入角色条件监督微调。接着用生成器与验证器自动构造角色多轮对话并合成双通道音频,做角色条件监督微调以注入角色行为。最后以FDGym让大模型模拟用户仅依据增量可听片段实时追问或打断,并以交互奖励、角色奖励与确定性时序奖励做组相对策略优化,实现真实因果下的多轮优化。相对PersonaPlex等预录音驱动基线的关键差异是后续用户行为依赖模型真实采样在线生成,实际意义是在闭环交互中直接优化角色一致性而不损失全双工能力。在SpeechRole-Eval基准下,CharDuplex的平均得分为0.785,高于PersonaPlex的平均得分0.651。适用边界是训练与评测角色不重叠但均来自 OmniCharacter 与 SpeechRole 训练集同源角色库与合成语音,真实噪声、真实打断与长时对话外推尚未验证。原文披露监督训练硬件为32卡A100、GRPO硬件为8卡A100,但未披露总训练时长与推理延迟实测。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


35. 水声重叠与瞬态混淆才是难点:用可读频带做小模型浴室声识别

原论文 Figure 1:Assistive-living use scenario of SnaanGhar7.

英文题目:SincDPNet: Interpretable Raw-Waveform Bathroom Activity Recognition for Assistive Living

标签:#音频分类 | #信号处理 | #数据集 | #可解释性

评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Debolina Chowdhury:机构信息未在 arXiv HTML 中可靠披露
  • Suman Samui:机构信息未在 arXiv HTML 中可靠披露
  • Sujoy Saha:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

浴室声学事件识别以原始波形为输入,输出7类活动标签,难点在于冲水、淋浴、浴室龙头等水声类中频谱高度重叠且类内方差大,门与助行器具等瞬态类时域包络相似,以及同一房间混响与设备线索易被随机窗切分泄露而虚高精度。方法链分四步:先用树莓派Zero 2 W加WM8960采集5种住宅、宿舍与机构浴室约385分钟音频,按会话与环境隔离切分为21387个定长窗,再用均方根能量、过零率、谱峭度、质心、滚降、平坦度与类均功率谱量化类间重叠与类内离散形成待验证假设,接着以可学习正弦带通组将波形映射为时频表示并送入深度可分离卷积体分类,最后用基于质量子集的多目标贝叶斯优化在验证集上探索精度与尺寸、精度与时延权衡并按加权评分选点。与自由卷积或固定梅尔谱相比,带通约束把首层压缩为每滤波器2个频率参数,使频带可直接以赫兹判读。在环境隔离测试集下,SincDPNet best-F1的准确率为80.2 ± 3.2%,高于SincNet的准确率76.7 ± 1.8%。该结论仅适用于所采5环境与1.51秒窗长条件,对未见房型、设备与多人并发事件的外推尚未验证。训练硬件与优化器细节未披露,推理在树莓派上实测单窗435.6毫秒。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


36. 没有干净目标时如何把目标语音提取搬到真实会议里:先对齐人,再重混练

原论文 Figure 1:Overview of the proposed RemixIT-TSE framework.

英文题目:RemixIT-TSE: Progressive Synthetic-to-Real Adaptation for Target Speech Extraction via Target-Aware Supervision and Remixing

标签:#目标说话人提取 | #领域适应 | #半监督学习 | #语音

评分:7.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yu Wang:机构信息未在 arXiv HTML 中可靠披露
  • Haixin Guan:机构信息未在 arXiv HTML 中可靠披露
  • Shuang Wei:机构信息未在 arXiv HTML 中可靠披露
  • Yanhua Long:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

真实会话中的目标语音提取(Target Speech Extraction,TSE)需要以注册语音为条件从多说话人混叠中恢复目标说话人波形,其难点在于合成训练与混响噪声重叠交织的真实录音存在域差距且缺乏信号级真值。本文提出三阶段渐进适应链:合成数据预训练建立基础抽取能力,目标感知适配(Target-Aware Adaptation,TAA)联合合成监督与真实弱监督注入真实特性,RemixIT-TSE适配(RTA)仅用真实数据以教师伪目标重混训练学生模型。与直接复用分离或增强自监督方法不同,该链条先用区域级说话人一致性与静音约束稳定过渡,再用质量过滤后的目标专属监督避免干扰泄漏被放大。单人区间抽取的注册语音经编码平均形成说话人质心,教师生成的目标与非目标分量经说话人相似度与词错率过滤仅保留高置信度伪目标。过滤后的非目标在批次内重排重混生成自举混合,学生仅以目标SI-SNR损失学习伪目标且教师以指数滑动平均更新。在SLT 2026 REAL-TSE挑战未见场景评测集EVAL-2上,相比源域基线目标词错率相对降低6.53%,说话人相似度、感知质量与活动检测F1亦同步提升。该结论限于有说话人归属时间标注的会议类录音,未验证极噪或说话人快速切换条件,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


37. 只去掉触发音:用流式查询抑制应对误音症的选择性保留

原论文 Figure 1:Time-domain waveforms for gum popping suppression: input mixture, ground truth, and model output.

英文题目:Trigger Sound Suppression for Misophonia

标签:#音频分离 | #时频分析 | #数据集 | #流式处理 | #医疗音频

评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Vaishnavi Vidyasagar:机构信息未在 arXiv HTML 中可靠披露
  • Jasmine Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Mahima Uliyar:机构信息未在 arXiv HTML 中可靠披露
  • Seunghyun Oh:机构信息未在 arXiv HTML 中可靠披露
  • Emily Catherine Gates:机构信息未在 arXiv HTML 中可靠披露
  • Mark Zachary Rosenthal:机构信息未在 arXiv HTML 中可靠披露
  • Shyamnath Gollakota:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

误音症患者对咀嚼等特定触发声高度不耐受,现有耳塞与降噪会连带抹除对话等有用声音,难点在于低延迟下只去除用户指定的触发成分并完整保留残余声场景。本文先经双人校验构建覆盖10类口腔鼻腔触发声的13356条干净片段数据集,再用头相关脉冲响应在线合成双耳混合训练样本,随后由流式双路径网络在查询向量控制下直接估计残余信号,最后在误音症人群中检验主观痛苦是否缓解。与通用目标声音提取相比,关键差异是将任务定义为查询条件下的残余声重建而非目标声提取,并与降噪加回灌架构对齐以容忍10 ms级算法延迟。在咀嚼触发混合的听音评测中模型输出相对原始音频使主观痛苦下降2.37点,单触发查询下残余声改善达19.86 dB SI-SNRi。该结论目前仅在合成双耳混合与咀嚼单类离线听音验证下成立,对更弱触发、多触发并发与真实房间混响的外推尚未验证。原文披露了Orange Pi 5B上的分块处理耗时,训练算力与总时长未披露。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


38. 在四个声源混在一起时,用干净记忆把目标声音推回语言模型眼前

原论文 Figure 1:Overview of LTM-AE. Clean audio hidden states form category long-term memory, while paired…

英文题目:Long-Term Memory-Guided Enhancement for Target Perception in Audio-Language Models

标签:#音频分类 | #检索增强 | #基准测试 | #音频大模型

评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zhenhong Zhou:Nanyang Technological University Beijing University of Posts and Telecommunications
  • Xuanyue Zhao:Nanyang Technological University Beijing University of Posts and Telecommunications
  • Youji Liu:Nanyang Technological University Beijing University of Posts and Telecommunications
  • Yuanhe Zhang:Nanyang Technological University Beijing University of Posts and Telecommunications
  • Xiaoyu Ma:Nanyang Technological University Beijing University of Posts and Telecommunications
  • Lianyu Hu:Nanyang Technological University Beijing University of Posts and Telecommunications
  • Yang Liu:Nanyang Technological University Beijing University of Posts and Telecommunications

📌 核心摘要

输入是目标与 3 个干扰以目标对总干扰比 \(-10\) dB 混合的三秒音频,以及用户指定的目标类别,输出是音频大模型(Audio Large Language Model,ALLM)对该目标的受限分类、自由描述或语音转写,难点是强干扰压制目标表示且非语音目标难用文本引导分离。长期记忆引导音频增强(Long-Term Memory-Guided Audio Enhancement,LTM-AE)为每类缓存干净音频在语言主干入口嵌入空间的均值向量 \(\mu_c\) 与主方向矩阵 \(U_c\),对混合 token \(z_t\) 求其在目标子空间的投影重构 \(\hat{z}_t\),再以插值权重 \(\alpha_c\) 融合原始与重构得到 \(z'_t\) 并送入冻结语言主干解码,语音转写分支另加逐 token 门控调节融合强度。与波形分离或去噪器不同,该方法不重建波形、不训练音频大模型本体,只在嵌入空间做类别条件投影与残差衰减。在 MultiPerception 上以 Qwen2-Audio 为例,受限分类准确率从混合基线 9.60% 提升至 47.20%,无提示检索从 8.25% 恢复至 86.75%。其边界是必须预先知道目标类别、自由描述多类仍为零,且门控转写需额外训练 80 例加 20 例选择。原文未披露训练硬件与推理时延实测。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


39. 只听声音重建声道形状:频域可微仿真如何让逆问题可优化

原论文 Figure 1:Method Overview. We introduce a method to reconstruct a MRI video of a person’s moving vocal…

英文题目:Reconstructing the Vocal Tract with Differentiable Acoustic Simulation

标签:#语音合成 | #信号处理 | #音视频 | #发声与构音 | #多语言

评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Eric Ming Chen:MIT CSAIL
  • Jin Woo Lee:MIT CSAIL
  • Vincent Sitzmann:MIT CSAIL

📌 核心摘要

输入为目标语音波形与估计的声门体积速度脉冲,输出为时变声道截面积函数与MRI视频,难点在于几何到声音映射高度非凸且辅音湍流非线性不可微。方法链由声源估计、频域合成加可微湍流门控、神经几何参数化三步组成:先以Swift-F0提取基频再驱动LF模型合成激励并做均方根能量归一化,其输出作为声道入口体积速度进入下一步;再将声道离散为32段等长圆柱以声顺声感与黏性阻力构成T型电路,用2×2链矩阵连乘得闭式声道传递函数,同时以softmax加权噪声位置与softplus替代硬阈值,将分形Perlin噪声注入各段并经段到唇传递求和;最后将面积参数化为随机傅里叶特征网络与乘性滤波网络神经场或Wav2Vec 2.0编码器与MRI生成器潜变量,以多分辨率对数Mel谱L2损失端到端反传。与时域半隐式有限差分相比,频域闭式解消除时间递归噪声并实现各频率并行,因而梯度更平滑且优化更稳定。在LibriTTS-R上25条语句拟合任务下,频域合成的STOI为0.93±0.02,高于时域基线的STOI 0.77±0.03。该结论适用边界受限于16kHz平面波假设与无鼻腔建模,多解性仍导致几何与真值存在偏差,鼻腔音与高频细节外推尚未验证。训练成本与硬件方面,在RTX 4090上拟合5秒语句约需1分钟,频域合成达71.5倍实时,其推理开销远低于仅1.08倍实时的时域基线。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


40. 都会做却合不起来:大音频语言模型组合能力的系统性掉落

原论文 Figure 1:Illustration of our diagnostic setting.

英文题目:When Capabilities Fail to Compose: Diagnosing the Compositionality Gap in Large Audio-Language Models

标签:#音频推理 | #基准设计 | #数据集 | #音频问答 | #语音识别

评分:7.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Chien-Feng Liu:机构信息未在 arXiv HTML 中可靠披露
  • Chih-Kai Yang:机构信息未在 arXiv HTML 中可靠披露
  • Bo-Han Feng:机构信息未在 arXiv HTML 中可靠披露
  • Yu-Hsuan Li Liang:机构信息未在 arXiv HTML 中可靠披露
  • Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露
  • Cheng-Fu Chou:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文研究大型音频语言模型在双话语输入下先按声学线索定位目标段再执行转写或问答的组合任务,难点在于线索感知与内容执行必须在同一次推理中绑定且互不干扰。诊断链分为三步:原子能力测量在无选择条件下评估双段属性识别与双段下游上限,其输出作为组合退化的参照基线;线索条件片段选择检验属性到序号的绑定能力,其预测揭示定位阶段的独立失效;完整组合执行在给定线索与任务指令下生成目标段答案,从而暴露跨技能集成的额外损失。与已有音频推理评测相比,该设计用相同双段上下文控制输入长度并分离识别与绑定,避免把感知弱直接误读为组合弱。在4个开源模型与40组模型任务线索组合中,组合问答准确率在39组下降且平均下降26.7个百分点,转写词错误率在39组上升且平均上升28.5个百分点。该结论限于合成英语语音、固定两段加1.5秒静音拼接与三类线索三种下游任务,尚未验证自然混叠、多说话人重叠或更长上下文的外推。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


41. 坐标不够时补声学指纹:GAMF 用阵列传输函数做跨阵列波达方向匹配

英文题目:GAMF: Learned and Analytical Array Transfer Function Matching for Array-Generic Direction-of-Arrival Estimation

标签:#声源定位 | #信号处理 | #麦克风阵列 | #Transformer

评分:7.3/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zhiheng Jin:机构信息未在 arXiv HTML 中可靠披露
  • Shichao Hu:机构信息未在 arXiv HTML 中可靠披露
  • Chunyang Xu:机构信息未在 arXiv HTML 中可靠披露
  • Mengyao Zhu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

三维波达方向估计任务以多通道短时频谱为输入、输出声源单位向量,实际难点是跨阵列部署时仅用麦克风坐标无法刻画器件遮挡、声端口与指向性带来的幅度相位畸变。所提通用阵列传递函数匹配框架先将归一化观测频谱经共享谱编码与跨麦克风时序Transformer编码为观测查询,将候选方向阵列传递函数与方向嵌入编码为可复用的候选键,并在同一麦克风上做多头内积匹配。匹配得分经有效通道平均聚合成帧级方向图,再由帧级门控融合学习得分与归一化解析匹配得分后经有效帧时域平均取最大得到三维估计。与仅用坐标调制的几何条件网络不同,该方法以方向相关声学响应作为匹配键并保留通道与模板对应至匹配之后,兼顾模板精确与干扰鲁棒。在8麦克风LOCATA Task 1评测设置下,GAMF-H的准确率为98.80%,高于解析分支的准确率94.14%。该结论适用边界受限于单静态声源与384点固定候选网格,候选传递函数固定参考距离且不含混响,依赖仿真库向真实阵列的外推,尚未验证测量传递函数与新构型。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


42. 低频跑太快、高频跟不上:用小波子带重加权协调流匹配语音合成的频谱演化

原论文 Figure 3:Frequency-selective reweighting process.

英文题目:Harmonizing Spectral Evolution in Conditional Flow Matching for TTS

标签:#文本到语音 | #时频分析 | #流匹配 | #高效推理 | #语音

评分:7.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Isha Pandey Varad Deshpande Abhijat Bharadwaj Ganesh Ramakrishnan:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

条件流匹配文本到语音需从先验噪声经由常微分方程积分生成梅尔谱,难点在于近似子带持续猛涨而细节子带发育滞后,单纯优化时间离散无法同步频谱演化。该文先对中间态做二维离散小波变换并跟踪近似子带LL与细节子带LH、HL、HH的l2能量轨迹以量化失步,再按能量反比构造截断重加权系数对选定子带逐步缩放,最后经小波逆变换重构状态后继续积分。与图像领域固定强度或线性谱校正不同,频率选择性增强随积分阶段自适应改变抑制强度。在1000条LibriTTS-clean上26步增强将弗雷谢音频距离从26步基线的1.04降至0.51,并优于32步基线的1.10;在全量LibriTTS-clean上26步增强为0.51,持平或优于32步基线,同时在H200上将平均运行时从1.339秒降至1.119秒,实时率下降约15.9%。该结论依赖针对F5-TTS与Matcha-TTS分别校准的低维指数与线性调度,多项式调度会导致灾难性退化。其适用边界受限于同架构家族内复用验证,跨全新架构与高噪声语种的可懂度提升尚未验证,构成明确失败条件。在H200硬件上26步增强仅引入小波正逆变换的推理开销,仍将平均延迟从高步数基线有效降低,且无需额外训练成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


43. 粗定位能动,精定位不动:大音频语言模型把时间绑在了事件名上

原论文 Figure 1:Activation swapping across layers for three audio language models.

英文题目:On Temporal Binding in Large Audio Language Models

标签:#声音关系与推理 | #统计分析 | #可解释性 | #音频大模型 | #音频事件检测

评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Paul Primus:机构信息未在 arXiv HTML 中可靠披露
  • Gerhard Widmer:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文输入为包含多事件的音频录音与文本查询,输出为事件先后关系判断与事件起始时间戳,难点在于文本残差流中何处绑定事件特异性时间,以及粗粒度推理与精确定位是否共享机制。方法先用镜像事件顺序的激活交换定位时间信息流入文本事件名表征的中层区间,其输出的中层绑定位置进入下一步解码检验。接着用跨类别交叉验证的单隐层回归检验该表征的可解码性与事件特异性,其输出的粗粒度事件特异表征进入几何刻画。然后经类别中心化构造时间标识并以主成分分析刻画其低维弯曲轨迹,再沿轨迹端点方向对事件名表征加性操控并观测前后关系与onset预测变化,以此区别于仅做探测的已有方法,明确了粗推理依赖该轨迹而精定位另需机制的实际分工。在RealDESED变时长录音评测设置下,AF-Next的相对位置拟合多元R2指标为0.43,高于绝对时间拟合多元R2指标的0.19。三模型均在前两主成分集中八成以上时间方差且端点反向对齐,说明相对时间轨迹是跨模型的共性机制。该结论仅适用于孤立事件与简单声景,对重叠事件、多事件比较与复杂问式尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


44. 本地学斜率、全局排步骤:少步语音流映射如何避开教师轨迹积分

英文题目:Distill Locally, Schedule Globally: Flow Maps for Few-Step Text-to-Speech

标签:#文本到语音 | #知识蒸馏 | #流匹配 | #语音 | #高效推理

评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yentl Collin:机构信息未在 arXiv HTML 中可靠披露
  • Evan Dufraisse:机构信息未在 arXiv HTML 中可靠披露
  • Amr Mohamed:机构信息未在 arXiv HTML 中可靠披露
  • Amine Khelif Khelif:机构信息未在 arXiv HTML 中可靠披露
  • Dani Bouch:机构信息未在 arXiv HTML 中可靠披露
  • Guokan Shang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

零样本语境下文本到语音需将高斯噪声经由常微分方程输运为梅尔频谱图,教师模型依赖数十步数值积分导致推理昂贵,而长区间平均速度目标又受离散化误差与训练成本制约。本文提出局部流映射蒸馏,先学习任意起止时间的直接输运,再用教师推导动态规划从一致性代价图中为不同步数预算搜索采样时刻,最后以冻结四步模型的输出作为对齐感知自蒸馏目标专门打磨低步数生成。三者形成蒸馏提供映射、调度优化多步路径、自精炼弥补单步无调度自由度的递进链条。与依赖积分位移的基线相比,该方法仅需出发点教师速度与前向雅可比向量积即可构造目标,避免区间上的教师 rollout。在 Seed-TTS test-en 上精炼后单步学生取得 1.80% 词错率,接近 32 步教师的 1.76% 水平,但说话人相似度 0.607 对 0.667、UTMOS 3.41 对 3.76 仍有差距。结论目前限于英语客观指标与两套训练语料,跨语言韵律与主观听感外推尚未验证。训练侧单次更新成本与 4 步积分基线相当,单步推理约为教师 32 步的 10 倍加速。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


45. 听众为何慢半拍又爱眨眼:REALM 用延迟融合加表情残差拆开连续性与随机性

原论文 Figure 1:Motivation for responsive listener motion generation.

英文题目:REALM: A Coarse-to-Fine Generative Framework for Embodied Reactive Listening

标签:#语音对话系统 | #生成模型 | #语音 | #音视频 | #主观评测

评分:7.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Peizhen Li:机构信息未在 arXiv HTML 中可靠披露
  • Longbing Cao:机构信息未在 arXiv HTML 中可靠披露
  • Yang Zhang:University of North Texas, USA

📌 核心摘要

反应式倾听生成以说话人音频窗口与听者历史动作为输入,输出表情与头部位姿序列,难点在于回应相对声学线索存在时滞且不必成比例,同时整体轨迹下叠加眨眼等局部多峰变化。所提反应式具身音频驱动倾听模型先以延迟中心注意力融合历史与说话人证据,再由粗解码器回归基准轨迹,最后仅在表情子空间叠加音频条件随机残差,残差潜变量经解码后嵌入完整动作空间。与同步交叉注意力或全空间随机扰动不同,该设计把何时对齐与用多少外部证据解耦,并把随机性约束在非刚性表情。在ViCo域内测试集下,REALM的表情FIDΔfm为3.91,低于ListenFormer的表情FIDΔfm 8.71。该结论限于离线窗口生成与两套肖像系数基准,共享标称延迟与特定机器人映射尚未验证跨个体与跨硬件外推。该框架在单块NVIDIA RTX 5090硬件上训练收敛,总参数量为1.50M且单次前向计算量为0.02G FLOPs,推理开销受限于16帧自回归窗口与精修编码开销。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


46. 能分清语言又不分家:语言判别如何缩小多语言语音模型的额外代价

英文题目:Language Discrimination Improves Linguistic Learning in Multilingual Speech Models

标签:#语言识别 | #自监督学习 | #多语言 | #语音

评分:7.2/10 | 创新 1.7/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Maureen de Seyssel:Apple
  • Jie Chi:Apple
  • Zakaria Aldeneh:Apple

📌 核心摘要

多语言自监督语音模型在总预训练量持平时仍落后于单语模型,难点在于共享表示既要支持跨语言迁移又要避免语言间干扰。 先以500小时英语加500小时法语语音为输入训练第一轮HuBERT,职责是以MFCC聚类目标学习初始声学表征,输出的第6层表征直接进入下一步的目标构造。 再以第一轮表征为输入构造第二轮监督目标,职责是用辅助语言分类器塑造表征或用分语言码本改变聚类目标,输出的新目标作为从头重训练第二轮HuBERT的监督信号。 最后以第二轮第9层表征为输入做共享离散化,职责是生成K=50单元并训练词级口语语言模型,输出的词汇与韵律得分回流检验前序干预效果。 与仅增强最终可分性的方法不同,干预在训练早期塑造目标与表示分工,从而形成可判别但共享的表征状态。 在Common Voice连续音素评测设置下,双语基线的连续音素ABX错误率为11.6%,高于分类器干预的连续音素ABX错误率10.4%。 该结论适用边界受限于英法朗读语音与HuBERT两轮聚类范式,转移与干扰仅为间接证据,跨架构与语种外推尚未验证。 原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


47. 混合里捞出每一轨:用槽嵌入把一首歌拆成多个可检索查询

英文题目:Retrieving Individual Stems from Music Mixtures with Slot Embeddings

标签:#音乐检索 | #对比学习 | #音乐 | #Transformer

评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • David Braun:机构信息未在 arXiv HTML 中可靠披露
  • Junyi Fan:机构信息未在 arXiv HTML 中可靠披露
  • Pranay Manocha:机构信息未在 arXiv HTML 中可靠披露
  • Donald S. Williamson:机构信息未在 arXiv HTML 中可靠披露
  • Adam Finkelstein:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音乐制作中的茎(stem)检索需要以包含多乐器的混合录音为查询,为其中每个目标声部返回库中相似的孤立录音,难点在于多个音色在同一嵌入空间中相互挤占且现有领先方法对比乐器检索(Contrastive Instrument Retrieval,CIR)依赖人工指定乐器族。Stembed(Slot Embeddings)先用音乐自监督Conformer主干MuQ将混合音频编码为帧序列,再用Transformer槽解码器交叉注意力提炼出4个槽表示并映射为256维检索嵌入与存在分数,随后通过最小代价匹配把混合槽与同曲独奏嵌入对齐并继承茎身份,最后用以茎身份为标签的有监督对比损失拉近同身份多视角并推远异身份。与把混合池化为单一向量的CIR相比,多槽结构为每个声部保留独立查询通道,无需乐器族过滤即可并行检索。在MoisesDB的1536个三茎混合、4608次目标检索与2068个茎库评测中,Stembed的全部库R@1为56.8%,明显高于CIR-MuQ的23.6%,且无族别先验的56.8%已超过族别过滤下CIR-MuQ的52.4%。该结论限于已知曲目内片段互检与最多4槽设置,对跨曲感知相似性与更密混合尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


48. 一次合成不够:用可编辑的反复修改做可控多说话人对话语音

原论文 Figure 1:Overview of our method.

英文题目:From Script to Drama: An Agentic Framework for Controllable Multi-Speaker Dialogue TTS

标签:#文本到语音 | #工具增强与约束解码 | #韵律与风格控制 | #语音编辑 | #基准测试

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Kangxiang Xia:机构信息未在 arXiv HTML 中可靠披露
  • Xinfa Zhu:机构信息未在 arXiv HTML 中可靠披露
  • HangRui Hu:机构信息未在 arXiv HTML 中可靠披露
  • Kexin Huang:机构信息未在 arXiv HTML 中可靠披露
  • Wenjie Tian:机构信息未在 arXiv HTML 中可靠披露
  • Ziyue Jiang:机构信息未在 arXiv HTML 中可靠披露
  • Bingshen Mu:机构信息未在 arXiv HTML 中可靠披露
  • Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
  • Ting He:机构信息未在 arXiv HTML 中可靠披露
  • Lei Xie:机构信息未在 arXiv HTML 中可靠披露
  • Jin Xu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

可控多说话人对话语音合成以故事脚本、角色集合与参考语音为输入,输出长时连贯的多轮语音,难点在于单句情感语速响度可控、跨轮音色一致与转场自然难以一次生成兼顾。该工作先由规划模块将非结构化故事解析为含文本、说话人及细粒度表演指令的结构化轮次计划,再由统一语音骨干ControlEdit-TTS逐轮合成初版音频。随后先做单句级评价再做场景级评价,将可编辑失配路由到属性编辑、严重失效路由到重合成、节奏断裂路由到静音调整。相对直接对话模型与纯重合成智能体,其机制差异在于把理解模型反馈转化为可执行操作,并用同一模型完成生成与局部修改以保留可接受片段。在双语对话基准评测下,完整系统的分数为4.819,高于一次生成的分数4.592。适用边界限于情感、语速、响度三种属性与中等长度场景,更长篇幅与更细表演维度的外推尚未验证。原文未披露推理延迟、吞吐与成本,未做显著性检验。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


49. 只用三百组人评校准机器标注:SpeechCritic 的诊断语音评价与分工训练

原论文 Figure 2:Zero-shot probing of three proprietary and five open-source audio-language models on our…

英文题目:SpeechCritic: Learning a Diagnostic Speech Judge from Limited Human Preferences

标签:#语音质量评估 | #偏好优化 | #跨语言 | #语音 | #基准测试

评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Mingyue Huo:机构信息未在 arXiv HTML 中可靠披露
  • Shivam Mehta:机构信息未在 arXiv HTML 中可靠披露
  • Bhavin Jawade:机构信息未在 arXiv HTML 中可靠披露
  • Yinghong Lan:机构信息未在 arXiv HTML 中可靠披露
  • Haoqi Li:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

诊断性语音评价以源语言参考为锚点,比较两个目标候选并输出总体二选一与说话人情感时序发音伪影五维度的A/Tie/B判定及可定位的可听证据,难点在于专家标注昂贵而前沿音频语言模型直接标注存在维度错位与Tie严重低估。SpeechCritic先在约300组人类开发集比较上以分组交叉验证筛选与人类一致的声学度量并丢弃无效伪影指标,再拟合L2正则多项逻辑回归得到维度A/Tie/B概率映射并冻结为校准分布,随后将分布作为非绑定提示连同原始音频与转录交给Gemini-3.1-Pro生成上万条监督,学生在Qwen2.5-Omni-7B上依次经监督微调建任务、在位策略蒸馏迁移教师轮廓与门控强化学习锐化奖励编码行为。与直接让前沿模型替代标注不同,该链条以人类校准的可验证度量约束教师却允许其按音频推翻,从而保留覆盖度的同时纠正系统性Tie偏差。在英语到日语测试集下,SFT的总体准确率为69.54%,高于Qwen2.5-Omni-7B基线的总体准确率13.10%。该结论适用边界受限于自建合成候选池与英语到日语主评测,英语到西班牙语复现与VOX-DUB仅为近似对照,低一致样本与长篇说服性推理伴随错误 verdict为已知失败条件,自然泛化与跨系统部署尚未验证。硬件上原文披露主体实验使用八卡NVIDIA A100 80GB与八卡H200,训练时长与推理开销等完整成本仍未充分量化。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


50. 会说话不等于会干活:APEX-Voice 测全双工语音智能体能否交出有效工作成品

原论文 Figure 4:Full-duplex user simulation and runtime orchestration in APEX-Voice.

英文题目:APEX-Voice: Can Voice Agents Complete Professional Workflows Through Full-Duplex Interaction

标签:#语音代理规划与工具使用 | #基准设计 | #全双工语音交互 | #基准测试

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Puneet Mathur:University of Maryland College Park, USA
  • Dinesh Manocha:University of Maryland College Park, USA

📌 核心摘要

APEX-Voice面向口头委托到可验证工作产物,输入为实时语音对话与演化工单状态,输出为版本化工作产物与工具副作用,难点在于中途纠正、授权撤销与重叠语音必须同步改写记忆与下游动作。方法链分三步:先由分类规约实例化知识、类型化工具、产物模式与授权约束,形成可执行工作流定义;再离线生成并冻结用户语义计划的文本与语音资产,其输出直接送入执行环境作为仿真用户;接着异步编排器按媒体时钟双通道播放与记录,输出终态与事件日志供确定性校验与语义等价裁判联合判定四门成功。与已有全双工评测只看轮次控制或已有职场基准只走文本不同,该工作把持续状态追踪作为主要矛盾并可复现度量。在120个工作流的基准评测下,GPT-realtime-2.1的工作流成功率Pass@1为23.6,高于Grok-Voice-Think-2.0的工作流成功率Pass@1的23.1。结论仅适用于有界英语合成任务与冻结用户策略,外推到真人高变异、长程高风险与多语场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


51. 把无声窄视场视频变成可环视的声景:OmniDream 的对象中心分解与物理声学渲染

原论文 Figure 1:OmniDream transforms a silent perspective video into a 360^\\circ video with synchronized spatial…

英文题目:Enabling Immersive Audio-Visual Experience from Any Video

标签:#音视频生成 | #信号处理 | #音视频 | #空间音频信号

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Zitong Lan:University of Pennsylvania
  • Mutian Tong:University of Pennsylvania
  • Jiatao Gu:University of Pennsylvania
  • Mingmin Zhao:University of Pennsylvania

📌 核心摘要

输入为无声单目透视视频,输出为可自由转头观看的 360 度全景视频与同步一阶 Ambisonics 空间音频,难点是声源须随听者朝向旋转保持锚定且混响须符合场景几何与材质。沉浸式视觉扩展先用 CubeComposer 将窄视场外扩为全景,再用全景深度模型估计相对深度并由视觉语言模型估计度量尺度,反投影三角化为逐帧开放网格,兼作显示、音频语义上下文与声学几何。音频内容生成在全景关键帧上由视觉语言模型提议发声物体并给出声音描述与包围盒,经 SAM2 传播为时空掩膜并做半径 200 像素圆盘膨胀以包含交互,再裁出物体管送入 MMAudio 生成单声道干声,并用盲 RT60 估计器筛除混响大于 0.15 秒样本以免湿声再卷积。物理声学渲染用 SAM2 语义分割划分材质区域并由视觉语言模型查询各频带反射与散射系数后赋予网格,再将掩膜质心提升为三维声源,用 AcoustiX 做射线追踪累积镜面与漫散射增益并按到达方向加权一阶球谐,得到逐秒四通道脉冲响应,对瀑布与人群等扩展源多点采样加全通滤波去相干叠加,最后卷积混合为 FOA。与直接生成混合 FOA 不同,该文保留物体级音轨与脉冲响应后再编码,支持旋转解码与多格式输出。在YT360基准评测下,OmniDream的指标CC为0.58,高于OmniAudio的指标CC 0.54。该结论适用边界受限于外扩质量与深度尺度估计,完全遮挡声源与自由视点移动尚未验证。原文披露硬件为NVIDIA L40上8秒片段推理开销为CubeComposer外扩约1680秒、音频生成约197秒与声学渲染约55秒,当前瓶颈明显。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


52. 语音证据不够用了: pooled 无人声残差为何在未见编解码器下存活

原论文 Figure 1:Speech-centric single-view detection versus the proposed MN-P.

英文题目:What Survives the Codec Shift: Pooled No-Vocals Residuals for Speech Deepfake Detection

标签:#音频深度伪造检测 | #混合专家模型 | #信号处理 | #自监督学习

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jiajun Xu:机构信息未在 arXiv HTML 中可靠披露
  • Menglu Li:机构信息未在 arXiv HTML 中可靠披露
  • Xiao-Ping Zhang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理语音深度伪造检测在生成机制由声码器转向神经编解码器时的泛化失效,输入为单句语音波形,输出为真伪判定,难点在于语音内容表示在高保真编解码合成下区分性衰减。方法链分为三步:先用 HTDemucs 人声分离得到去人声残差并做频带统计池化为话语级向量,再用冻结 XLS-R 自监督表示经混合专家融合得到帧级语音序列,最后经跨视角门控将全局残差上下文广播加权到语音序列后送入后端分类。相对单视角语音检测器的机制差异在于非对称双视角设计,保留语音时序证据的同时引入无需对齐的全局残差统计作为互补上下文。在合并 ASVspoof 2019 LA 与 Codecfake 的 39996 条测试集上,MN-P-AASIST 相对最强重训基线将总体等错误率由 5.986% 降至 2.744%,相对降低 54.2%,未见 DAC 编解码器子集等错误率由 15.692% 降至 6.136%,相对降低 60.9%。该结论限于英语、受控语料与单一未见编解码器条件,未验证多语言、多失真及分离失败时的外推能力。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


53. 语速可读处处有、可写只在中间:钳制投影为何比相加更稳

原论文 Fig. 1:Overview. Left: fitting. The rate axis is learned from WSOLA time-stretched speech, the same…

英文题目:Controlling Speaking Rate in Autoregressive TTS via Activation Steering

标签:#韵律与风格控制 | #测试时自适应 | #语音 | #自回归模型 | #主观评测

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Francesco Verdini:AGIGO ETH Zurich Sapienza University of Rome University of Zurich
  • Antonis Asonitis:AGIGO ETH Zurich Sapienza University of Rome University of Zurich
  • Aref Farhadipour:AGIGO ETH Zurich Sapienza University of Rome University of Zurich
  • Marzieh Razavi:AGIGO ETH Zurich Sapienza University of Rome University of Zurich
  • Pierre-Edouard Honnet:AGIGO ETH Zurich Sapienza University of Rome University of Zurich
  • Vijeta Avijeet:AGIGO ETH Zurich Sapienza University of Rome University of Zurich
  • Juan Pablo Zuluaga Gomez:AGIGO ETH Zurich Sapienza University of Rome University of Zurich

📌 核心摘要

自回归文本到语音(Autoregressive Text-to-Speech,AR-TTS)以文本与参考音色为输入生成波形,训练后缺乏细粒度语速旋钮,文本提示与参考音频只能粗略牵引语速。方法链分三步衔接:先用同文本慢速、中性、快速三元组经冻结解码器前向得到语速对比激活,拟合出语速轴、中性中心与强度单位;再经因果层扫描选定可写的中部解码器块;最后在推理每步将残差流(Residual Stream)在该轴上的投影钳制到目标值。与加性转向(Activation Addition)的开环固定偏移不同,钳制(Clamping)构成闭环反馈,误差大时修正大,到达目标自动归零并可反向纠正过冲。在Seed-TTS-Eval英文测试集的1088条样本上,校准强度将语速推至基线0.68倍至1.33倍区间且说话人相似度仍高于随机异说话人对99.9百分位。该结论限于整句级英文语速、单线性方向与离线评估,未验证句内时变控制、流式部署及其他韵律属性。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


54. 先看脸排座次再听说话:音视频大模型的序数配对捷径

原论文 Figure 1:Position bias on curated two-speaker clips with video-SALMONN2+.

英文题目:Uncovering Ordinal-Matching Bias in Audio-Visual LLMs

标签:#音视频问答 | #SFT | #音视频 | #数据集 | #模型评估

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jihoo Jung:机构信息未在 arXiv HTML 中可靠披露
  • Youngjoon Jang:机构信息未在 arXiv HTML 中可靠披露
  • Hyebin Cho:机构信息未在 arXiv HTML 中可靠披露
  • Suho Yoo:机构信息未在 arXiv HTML 中可靠披露
  • Joon Son Chung:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

多说话人说话人话语归属需以多脸画面为视觉输入、以连续语音为听觉输入,输出每段话语对应的可见说话人,实际难点在于需依赖口唇同步等细粒度音画对应而非空间与时序捷径。作者先构建每人只说单个国家名的合成诊断视频并定义Says-What与Who-Says两种开放问答,其输出的准确率与序数匹配率进入下一步偏差诊断。接着通过交换左上与右上区域视觉位置编码的Swap与循环轮换四区域编码的Rotate干预,观察预测是否跟随篡改后位置排序,以此验证序数匹配的因果性,干预结果直接动机化最后的解耦训练。然后用说话人空间位置与说话顺序独立随机的400段人类说话人合成视频做序数解耦微调,打破位置与顺序的虚假对应以迫使模型学习真实音画线索。相比保持第k个位置对应第k句话的序数耦合微调与依赖位置顺序捷径的基线,OD-FT的关键差异是显式提供位置与顺序解耦的反事实监督,其实质意义在于将合成干预迁移至真实对话理解。在合成诊断语料N=4的Says-What任务下,+OD-FT的准确率为97.0,高于Qwen2.5-Omni的准确率26.9。该结论适用边界受限于结构化清晰语音与固定机位多说话人问答,动态多方扩展与根因分析尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


55. 边听边说又要想清楚:SALMONN-duo 把实时交互与慢速求解分开

原论文 Figure 2:SALMONN-duo comprises two collaborative systems: System 1 interacts with the user in a…

英文题目:SALMONN-duo: Adaptive Dual-System Coordination for Full-Duplex Voice Agents

标签:#语音代理规划与工具使用 | #强化学习 | #全双工语音交互 | #语音 | #流式处理

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Wenyi Yu:Tsinghua University
  • Siyin Wang:Tsinghua University
  • Terumi Chiba:Tsinghua University
  • Xianzhao Chen:ByteDance
  • Xiaohai Tian:ByteDance
  • Jun Zhang:ByteDance
  • Lu Lu:ByteDance
  • Chao Zhang:Tsinghua University

📌 核心摘要

全双工语音交互要求模型在 80 ms 时间块粒度上边听边说,而知识密集问答与环境接地任务需要可变时延的检索推理与工具调用,两者时序冲突是核心难点。SALMONN-duo 采用快思考前端(System 1)常开交互、慢思考后端(System 2)异步求解的分工:前端先输出填充应答并尽早发出委派决策,后端基于快照推断意图并返回参考答案或工具状态,前端再按到达顺序与用户新指令重排播报。相对 MoshiRAG 近乎全量检索与 VoiceChat 几乎不用工具的按题型规则,该工作以知识边界感知监督微调(Supervised Fine-Tuning,SFT)加成本感知分组相对策略优化(Group Relative Policy Optimization,GRPO)显式优化调用效用。在 TriviaQA 上系统达到 80.2% 准确率且调用率仅 25.0%,显著优于 MoshiRAG 以 99.9% 调用实现 75.8% 的代价结构;在定制 τ-Voice 上通过成本与安全奖励将总通过率从 SFT 的 57.0% 提升至 64.0%,追平 GPT-realtime-1.5。结论限于仿真延迟与后端多用真值转录假设下的英语问答与三领域任务对话,真实噪声、中断与跨语言外推尚未验证。原文未披露训练时长与推理部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


56. 把音频 Token 当预算花:边际效用预测与精确序列化预算下的 RVQ 深度分配

原论文 Figure 1:冻结因果编码器、效用控制器、预算分配器与精确前缀可行守卫;下方为逐帧精确预算分配。

英文题目:Audio Tokens as a Budgeted Resource: Marginal-Utility Allocation for Scalable Audio Representations

标签:#音频编码 | #动态计算与早退 | #向量量化 | #严格因果 | #语音

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Mingyu Zhao:Tsinghua Shenzhen International Graduate School, Tsinghua University
  • Jinchao Zhang:Tencent
  • Zhiyong Wu:Tsinghua Shenzhen International Graduate School, Tsinghua University

📌 核心摘要

输入为48 kHz波形经冻结因果编码器得到的潜帧序列,输出为每帧可变残差向量量化深度的可解码比特流,难点在于流式决策不可逆而真实开销包含索引与边信息。先由效用预测器以潜帧序列为输入估计每层不接触目标码率的边际增益并输出增益图,再由在线分配器接收该增益图结合对偶价格与令牌桶计算候选深度并更新价格与桶状态以跨帧传递,最后由精确守卫接收候选深度核对序列化前缀预算并预留下一帧最小深度以输出逐前缀可行的可解码比特流。相对固定深度基线与仅优化平均码率的自适应编码器,该工作把预算执行从话语级收紧为逐前缀硬约束并保持与固定深度序列化预算对齐。离线话语级分配在语音上降低对数短时傅里叶变换(Log-STFT)失真4.39%,20名听众的主观评测(Mean Opinion Score Under Hidden Reference and Anchor,MUSHRA)语音项提升3.52分。在2620个LibriSpeech test-clean话语评测下,UniAdapt dynamic的PESQ为2.042566,低于Official EnCodec的PESQ 2.747038。其适用边界限于同一冻结骨干内的分配改进,音乐与环境声主观增益不显著且外部编解码器仍保持更高绝对重建质量,跨架构与下游任务外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


57. CARDAMOM:在国家标签之下做 21 种微方言语音评测

英文题目:CARDAMOM: A Micro-Dialectal Arabic Speech Dataset for ASR

标签:#语音识别 | #数据集构建 | #数据集 | #口音与方言 | #语言识别

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Bashar Talafha:机构信息未在 arXiv HTML 中可靠披露
  • Samar M. Magdy:机构信息未在 arXiv HTML 中可靠披露
  • Aisha Alansari:机构信息未在 arXiv HTML 中可靠披露
  • Alaa Alkhawaldeh:机构信息未在 arXiv HTML 中可靠披露
  • Abdurrahman Juma:机构信息未在 arXiv HTML 中可靠披露
  • Sharaf Makahleh:机构信息未在 arXiv HTML 中可靠披露
  • Nour Gamal:机构信息未在 arXiv HTML 中可靠披露
  • Omar Attia:机构信息未在 arXiv HTML 中可靠披露
  • Hanaa Kurdi:机构信息未在 arXiv HTML 中可靠披露
  • Najwa Rizk:机构信息未在 arXiv HTML 中可靠披露
  • Maysa Anaya:机构信息未在 arXiv HTML 中可靠披露
  • Hessah Altimyat:机构信息未在 arXiv HTML 中可靠披露
  • Layal Alhazmi:机构信息未在 arXiv HTML 中可靠披露
  • Shumukh Alotaibi:机构信息未在 arXiv HTML 中可靠披露
  • Hajar Alhadaris:机构信息未在 arXiv HTML 中可靠披露
  • Rayan Alomari:机构信息未在 arXiv HTML 中可靠披露
  • Rahaf Almalaq:机构信息未在 arXiv HTML 中可靠披露
  • Malak Alkhorasani:机构信息未在 arXiv HTML 中可靠披露
  • Sara alghamdi:机构信息未在 arXiv HTML 中可靠披露
  • Rahaf Alshamrani:机构信息未在 arXiv HTML 中可靠披露
  • Nsrin Ashraf:机构信息未在 arXiv HTML 中可靠披露
  • Ibrahim Jaradat:机构信息未在 arXiv HTML 中可靠披露
  • Nada Qardahji:机构信息未在 arXiv HTML 中可靠披露
  • Yasmin Zaraket:机构信息未在 arXiv HTML 中可靠披露
  • Elmoukhtar Brahim:机构信息未在 arXiv HTML 中可靠披露
  • Sidi Ebeidy:机构信息未在 arXiv HTML 中可靠披露
  • Oumoulmouminin Mahmoud:机构信息未在 arXiv HTML 中可靠披露
  • Yahjeb Bouha Khatraty:机构信息未在 arXiv HTML 中可靠披露
  • Meya Haroune:机构信息未在 arXiv HTML 中可靠披露
  • Mohammad Ghaddar:机构信息未在 arXiv HTML 中可靠披露
  • Mohamad Eldirany:机构信息未在 arXiv HTML 中可靠披露
  • Rashed Alamoush:机构信息未在 arXiv HTML 中可靠披露
  • Tala Chhaytle:机构信息未在 arXiv HTML 中可靠披露
  • Nuha Albadi:机构信息未在 arXiv HTML 中可靠披露
  • Yahya El Hadj:机构信息未在 arXiv HTML 中可靠披露
  • Hamzah Luqman:机构信息未在 arXiv HTML 中可靠披露
  • Fadi A. Zaraket:机构信息未在 arXiv HTML 中可靠披露
  • Mustafa Jarrar:机构信息未在 arXiv HTML 中可靠披露
  • Muhammad Abdul-Mageed:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作处理阿拉伯语口语微方言自动语音识别与微方言识别任务,输入为YouTube自然对话音频,输出为方言转写与方言标签,难点在于国家内部音系词汇连续变化、正字法不统一及代码转换混杂。构建链条分四步:母语者按地理语言知识拟定21类微方言清单并收集非朗读视频,切分为最长30秒单说话人片段进入标注环节。接着在Label Studio中逐段提供转写、国家与多标签微方言及感知性别与代码转换双版本转写,再按国家分层划分训练与评测并做质量核查。与既有广播级多方言库的关键差异是操作型微方言标签允许一对多归属,使境内变异可直接分层评测而非被国别平均掩盖。在9152条去重测试话语的测试集下,适配后OMNIASR-LLM的WER为35.21%,低于零样本设置的WER 43.47%。结论仅适用于埃及、约旦、黎巴嫩、毛里塔尼亚、巴勒斯坦、沙特已覆盖变体,外推至马格里布、海湾腹地及强噪声场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


58. 在已知个体的五年连续录音里学哨声:OpenWhistle 如何把检测、分割与分类连成可复跑基准

原论文 Figure 4:Evaluation Tasks. The two evaluation tasks: (1) whistle type classification, where isolated…

英文题目:OpenWhistle: A Large-Scale Longitudinal Dataset and Benchmark of Bottlenose Dolphin Vocalizations

标签:#音频分类 | #数据集构建 | #数据集 | #基准测试 | #音频事件检测

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Faadil Mustun:机构信息未在 arXiv HTML 中可靠披露
  • Chiara Semenzin:机构信息未在 arXiv HTML 中可靠披露
  • Roberto Dessi:机构信息未在 arXiv HTML 中可靠披露
  • Pablo Robin Guerrero:机构信息未在 arXiv HTML 中可靠披露
  • Pierre Orhan:机构信息未在 arXiv HTML 中可靠披露
  • Alexis Emanuelli:机构信息未在 arXiv HTML 中可靠披露
  • Emanuele Rossi:机构信息未在 arXiv HTML 中可靠披露
  • Yair Lakretz:机构信息未在 arXiv HTML 中可靠披露
  • Gonzalo de Polavieja:机构信息未在 arXiv HTML 中可靠披露
  • German Sumbre:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为连续被动声学监测录音,输出为口哨声类型标签,难点在于同种内轮廓高度相似、个体差异细微且信噪比多变、重叠频繁。方法链分三步:基于频谱图的VGG16二值检测器筛选含口哨窗并按小于6 s间隔合并为序列,构成大规模无标注语料。海豚适配CREPE每5 ms估计基频并经压缩因子还原高频,再用ARTwarp结合动态时间规整按轮廓聚类,对照人工模板初分后经专家目视校正得到小规模标注集。域内Wav2Vec2.0在无标注语料上预训练后冻结特征做逻辑回归线性探测,会话级划分避免上下文泄露。与通用生物声学模型相比,关键差异是用单物种纵向数据替代跨物种迁移,直接建模种内细粒度结构而非物种间区分。在会话级隔离线性探测任务下,Wav2Vec2.0的分类准确率为81.1±1.8,高于AVES-bio的分类准确率75.1±2.1。该结论的适用边界受限于已知小种群半自然场景,长期漂移与语义功能解释尚未验证。结论仅适用于已知小种群半自然场景,尚不能外推到野生多种群、长期漂移与语义功能解释。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


59. 加上感知损失,听感反而变差:PESQ 优化为何失灵

原论文 Figure 1:Differentiable PESQ loss and GAN metric loss frameworks.

英文题目:Perceptual Quality Loss or Loss of Perceptual Quality?

标签:#语音增强 | #主观评测 | #生成对抗网络 | #模型评估

评分:7.0/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Danilo de Oliveira:机构信息未在 arXiv HTML 中可靠披露
  • Tal Peer:机构信息未在 arXiv HTML 中可靠披露
  • Maurício do V. M. da Costa:机构信息未在 arXiv HTML 中可靠披露
  • Timo Gerkmann:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音增强以含噪语音为输入并输出估计的干净语音,难点在于仪器指标与真实听感经常脱节而优化目标易被误导。该文以SB-SGMSE+与SEMamba为载体构建对比链,先以严格控制变量方式分别训练带可微PESQ项或GAN式PESQ代理判别器版本与去除该项的版本,使辅助损失成为唯一变量。接着在匹配的VoiceBank-DEMAND与失配的EARS-WHAM v2上用PESQ、复合指标、SI-SDR、ESTOI、POLQA及非侵入式MOS等多维仪器指标复测,其输出进入下一步听感裁决。最后开展盲听偏好实验并对复合指标做方差来源分解,以检验仪器增益是否转化为听感增益。与已有极端纯PESQ优化演示不同,该文针对常规训练流程检验实践中常用的辅助权重是否依然有害,因而更具警示意义。在EARS-WHAM失配评测设置下,SB-SGMSE+M5无PESQ版本的SI-SDR为12.67 dB,高于M6 PESQ-high版本的SI-SDR 3.23 dB。其结论适用边界在于仅验证两类PESQ损失与两个数据集,实时系统与多语言泛化等外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


60. 把自然语言指令落到每个字:InstCharVoice 的接地与声学规划

原论文 Figure 1:Motivation and overview of InstCharVoice.

英文题目:InstCharVoice: Grounding Natural-Language Instructions for Character-Level Control in Text-to-Speech

标签:#文本到语音 | #自回归模型 | #韵律与风格控制 | #语音

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Sihang Nie:机构信息未在 arXiv HTML 中可靠披露
  • Xueru Li:机构信息未在 arXiv HTML 中可靠披露
  • Xiaofen Xing:机构信息未在 arXiv HTML 中可靠披露
  • Deyi Tuo:机构信息未在 arXiv HTML 中可靠披露
  • Cheng-Bin Jin:机构信息未在 arXiv HTML 中可靠披露
  • Jingyuan Xing:机构信息未在 arXiv HTML 中可靠披露
  • Jinxin Ji:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

基于指令的语音合成(Instruction-based TTS,ITTS)输入为内容文本、自然语言指令与参考音色,输出为富有表现力的语音,痛点是指令短语、目标字符与声学变化的对应关系隐式不可控。该工作在WordVoice-5A-zh上用Qwen3-Omni-30B-A3B构建接地指令标注,将每条指令回标到字符与时长、边界、能量、基频、音调五维属性对,再用初始化自Qwen2.5-0.5B的自回归模型逐字符先预测接地标记与完整五维属性,再生成对应语音Token,最后经WordVoice-FM重建波形。与直接端到端生成相比,该先定位后规划范式支持检查与用户部分覆写。训练采用语音Token预测、接地预测与五维属性预测三目标联合优化,并以不确定性加权平衡,再启用接地感知加权使损失聚焦于被指令接地的字符属性对。推理时模型逐字符输出接地判断与完整属性规划后才生成对齐语音Token,从而将抽象指令显式转化为可检查的字符级声学计划。在WordVoice-5A-zh测试集评测下,InstCharVoice的指标IMOS为3.602±0.212,高于CosyVoice3的指标IMOS3.402±0.253。结论限于中文朗读类语料与五维可测属性,对抽象情感风格与复杂组合指令未验证,训练推理成本未披露。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


61. 两种笔迹配同一段声音:WenetSpeech-Min 如何把闽南语和普通话转写配成对

原论文 Figure 1:Overview of the WenetSpeech-Min data construction pipeline.

英文题目:WenetSpeech-Min: A Large-Scale Minnan Speech Corpus with Dual Transcriptions for Dialectal Speech Processing

标签:#语音识别 | #数据集构建 | #数据集 | #基准测试 | #文本到语音

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.3/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Haoyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Chunjiang He:机构信息未在 arXiv HTML 中可靠披露
  • Hongtao Li:机构信息未在 arXiv HTML 中可靠披露
  • Zeyu Zhu:机构信息未在 arXiv HTML 中可靠披露
  • Qituan Shangguan:机构信息未在 arXiv HTML 中可靠披露
  • Chengyou Wang:机构信息未在 arXiv HTML 中可靠披露
  • Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
  • Ziyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Bingshen Mu:机构信息未在 arXiv HTML 中可靠披露
  • Yanbo Wang:机构信息未在 arXiv HTML 中可靠披露
  • Shuai Wang:机构信息未在 arXiv HTML 中可靠披露
  • Jinhui Ye:机构信息未在 arXiv HTML 中可靠披露
  • Chengdong Liang:机构信息未在 arXiv HTML 中可靠披露
  • Binbin Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Pengcheng Zhu:机构信息未在 arXiv HTML 中可靠披露
  • Chuang Ding:机构信息未在 arXiv HTML 中可靠披露
  • Qianze Feng:机构信息未在 arXiv HTML 中可靠披露
  • Qingyang Hong:机构信息未在 arXiv HTML 中可靠披露
  • Liumeng Xue:机构信息未在 arXiv HTML 中可靠披露
  • Lei Xie:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

闽南语语音技术需同时处理方言保真转写与可读普通话改写两种输出,二者并非逐词对应,且长期缺乏大规模真实语料与公开评测。为此论文构建约1万小时多源语料WenetSpeech-Min,每条语音均配对方言转写与普通话转写。管线先经语音活动检测切分并用词级虚拟平均意见分、信噪比与音频事件检测过滤,再由三模型投票生成方言文本并经翻译或字幕抽取得到普通话文本。相对仅有普通话标注的MinSpeech与仅30小时的YT-THDC,该工作首次实现大规模双目标配对与公开基准。其评测配套人工核验的配对识别集与分级合成集,统一归一化流程以支撑方言保真与可读改写的并行比较。在WS-Min-Eval-ASR基准下,Qwen3-ASR-WSM-Min的D-CER为17.59%,低于CN-MultiDialect-ASR的D-CER 18.59%。该结论适用边界受限于戏剧主导的媒体语音与作者定义的归一化评分,跨域普通话改写仍存在释义漂移这一失败条件,其跨基准可比性尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


62. 因果约束下做扩散:DiffVQE2 如何把回声噪声联合控制做到低延迟

原论文 Fig. 3:Influence of lookahead on \\mathcalD_val performance in all conditions.

英文题目:DiffVQE2: An Efficient Low-delay Diffusion Model for Acoustic Echo and Noise Control

标签:#回声消除 | #扩散模型 | #语音增强 | #流式处理 | #高效推理

评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Haljan Lugo:机构信息未在 arXiv HTML 中可靠披露
  • Ernst Seidel:机构信息未在 arXiv HTML 中可靠披露
  • Pejman Mowlaee:机构信息未在 arXiv HTML 中可靠披露
  • Ziyue Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Tim Fingscheidt:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

面向免提通话的联合声学回声控制(Acoustic Echo Control,AEC)与噪声抑制需要以麦克风信号和远端参考信号为输入,直接估计近端干净语音,且必须满足低延迟因果约束并处理双讲残留回声与混响失配。该工作先由条件网络(Condition Network,CondNet)从麦克风与参考语谱图估计掩蔽初值与分层语音条件特征,再将初值加噪后连同条件特征送入分数网络(Score Network,ScoreNet)做单步扩散精化,最后经逆短时傅里叶变换得到时域波形。该链条把判别初值作为扩散采样的强先验,用生成分布弥补因果信息不足带来的感知损伤。相对非因果DiffVQE与判别式DeepVQE的关键差异在于全网改用左侧填充因果卷积与单向门控循环单元(Gated Recurrent Unit,GRU),并为小模型引入分组GRU与有限前视。在ICASSP 2023 AEC挑战盲测集上大模型平均主观平均意见分(Mean Opinion Score,MOS)为3.58,超过重训DeepVQE的3.44,且计算量仅为后者的约13%。该结论限于16 kHz英语为主的合成训练与挑战盲测口径,未验证长时回声路径突变、强非线性失真与多语种泛化,客观双讲仪器指标仍落后基线。原文披露训练使用单卡与500 k步等配置,推理为单步采样并报告了参数量与浮点运算量,部署端实测时延与内存未充分披露。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


63. 不用文字推理链,改向波形预测表示学推理:JELAR 的声学条件潜推理

原论文 Figure 1:The training and inference pipeline of proposed JELAR.

英文题目:Beyond Textual Chain-of-Thought: JEPA-Conditioned Latent Reasoning for Large Audio Language Models

标签:#音频推理 | #SFT | #音频问答 | #音频大模型

评分:6.9/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Donghang Wu:机构信息未在 arXiv HTML 中可靠披露
  • Haoyang Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Yizhou Peng:机构信息未在 arXiv HTML 中可靠披露
  • Shreyas Gopal:机构信息未在 arXiv HTML 中可靠披露
  • Yi-Wen Chao:机构信息未在 arXiv HTML 中可靠披露
  • Chen Chen:机构信息未在 arXiv HTML 中可靠披露
  • Hexin Liu:机构信息未在 arXiv HTML 中可靠披露
  • William Tjhi:机构信息未在 arXiv HTML 中可靠披露
  • Eng-Siong Chng:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音频问答需从波形中整合事件、韵律、音色与时序关系并输出答案,难点在于文本思维链多由字幕合成而与声学证据脱节易致幻觉。所提JEPA条件潜推理框架先以冻结波形编码器抽取声学表示,再由答案感知的非因果专家交叉注意力检索相关声学片段形成潜目标,接着训练大音频语言模型自回归预测该潜序列,最后基于潜序列解码文本答案。与显式文本CoT需生成可读中间文本不同,该方法将推理监督放在预测性声学嵌入空间,推理时无需专家与外部编码器。在多步推理基准MMAR上平均准确率相对同数据同主干的Audio-Reasoner基线提升9.10个百分点,在MMAU-mini上提升2.70个百分点,显示了对混合域整合任务的增益。该结论适用边界受限,目前仅在2个选择题基准与单一主干上验证,开放式生成、长音频与分布外泛化能力尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


64. 算得更多却结束更早:用逐层等待控制脉冲网络的延迟与精度

原论文 Figure 1:Cross-timestep pipelining and firing delay in SNNs.

英文题目:Latency and accuracy tradeoffs in Spiking Neural Networks

标签:#关键词检测 | #形式化分析 | #高效推理 | #语音

评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Zhanglu Yan:Department of computer science, National University of Singapore
  • Zixuan Zhu:Department of computer science, National University of Singapore;Shanghai Advanced Research Institute, Chinese Academy of Science;University of Chinese Academy of Sciences, Beijing
  • Kaiwen Tang:Department of computer science, National University of Singapore
  • Yuyang Cai:School of Artificial Intelligence, Shandong University
  • Qianhui Liu:School of Artificial Intelligence, Shandong University
  • Weng-Fai Wong:Department of computer science, National University of Singapore

📌 核心摘要

语音指令识别输入为1秒语音波形或仿生耳蜗事件流,输出为35类指令标签,难点在于脉冲神经网络需多时间步累积发放精度而传统认知认为其必然慢于比特串行量化网络。所提框架Falcon先用延迟可控发放内核控制每层累积多少输入才做发放决策并向下游转发脉冲,形成带可调等待量的脉冲序列并输出延迟候选进入搜索。再用流水线延迟搜索在验证集精度与建模核时延之间贪心评估每层增加等待的收益,选出的固定延迟调度送入训练阶段做适配。最后在固定延迟下做脉冲量化感知训练与阈值和初值微调,将搜索到的低延迟结构恢复至可用精度。与比特串行量化网络需等全部比特累积后才能量化输出不同,该方法允许下游提前消费上游部分时间步,从而用更多局部轮次换更短端到端时延。在GSC评测设置下,Falcon-Medium的建模核时延指标为119.64 μs,低于匹配量化网络的建模核时延指标130.86 μs。结论仅适用于空间模拟存算映射与共享数字引擎的建模时延,不保证吞吐提升与真实芯片一致。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


65. 尾部高频决定听感:用风险敏感判别器约束带宽扩展的幻觉

原论文 Figure 1:The overall architecture of UDSS-BWE.

英文题目:UDSS-BWE: Uncertainty- and Decision-Science Inspired Swin BandWidth Extension

标签:#带宽扩展 | #生成对抗网络 | #语音 | #多语言 | #高效推理

评分:6.9/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Tarikul Islam Tamiti:机构信息未在 arXiv HTML 中可靠披露
  • Sajid Fardin Dipto:机构信息未在 arXiv HTML 中可靠披露
  • David Vergano:Department of Cyber Security Engineering, George Mason University, USA.
  • Luke Baja-Ricketts:机构信息未在 arXiv HTML 中可靠披露
  • Anomadarshi Barua:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

带宽扩展需从带限窄带波形恢复截止频率以上缺失的高频内容,难点在于摩擦音、sibilants、塞音burst与锐利onset等稀疏高频瞬态高度不确定且易被平均型目标平滑掉。为此该工作先用双流Swin-1D格型生成器并行精炼对数幅度流与包裹相位流并经可学习耦合交叉注入信息,再由幅度残差叠加与伪实虚部反正切恢复宽带复谱并经逆短时傅里叶变换合成波形。接着保留多分辨率幅度与相位判别器提供全局结构反馈,其输出的对齐宽带谱为尾部风险监督提供稳定基座。最后叠加条件风险价值判别器做尾部池化放大高频伪影、机会约束高频判别器抑制持续过增强、多准则效用判别器学习谱平坦度质心滚降效用、证据狄利克雷判别器暴露认知不确定性与分布鲁棒判别器做熵正则鲁棒聚合,形成风险敏感的协同判别。相对AP-BWE等双流幅度相位预测基线,该机制差异在于以决策科学与不确定性规则替代通用重参数判别器,用轻量可解释 critics定向校准稀有高频事件而非增加主干容量,实际意义是更少参数下提升感知自然度与跨语种泛化。在VCTK英语干净语音评测条件下,UDSS-BWE的NISQA-MOS为4.35,高于AP-BWE的NISQA-MOS 3.86。该结论适用边界限于朗读式英语与法语及sinc重采样模拟窄带,对强量化编解码与丢包电话信道泛化受限且尚未验证极端噪声全覆盖,而参数由72M降至18.5M带来计算量约2.66倍下降使推理开销降低但训练成本仍需承担多判别器联合优化。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


66. 离线分离模型的延迟不是输入长度:读出位置决定流式下限

英文题目:Adapting offline models to a streaming context for music source separation

标签:#音乐源分离 | #信号处理 | #流式处理 | #实时处理 | #高效推理

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Dylan Sechet:机构信息未在 arXiv HTML 中可靠披露
  • Marc Evrard:机构信息未在 arXiv HTML 中可靠披露
  • Matthieu Kowalski:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音乐源分离(music source separation)需从混合录音恢复人声、鼓、贝斯与其他(vocals/drums/bass/other)波形,离线模型依赖整段未来上下文而难以满足低时延在线推理。第一步以单短时傅里叶变换跳长滑动固定长度上下文窗口并送入未修改的原模型,前一步滑窗输出的整段多源估计直接构成后续读出的候选池。第二步按前视参数选择输出中的单跳读出位置以决定算法时延,上一步候选池的位置索引进入本步并被换算为未来上下文量。第三步对选中跳段做逆变换合成与重叠相加并连续发射,前一步选定的读出点决定本步合成可用的真实上下文与填充方式。与改造为因果卷积与单向循环并重训的专用实时模型不同,该方法保留原非因果权重与变换管线,仅用读出点控制未来上下文量。在 MUSDB18-HQ 上以信号失真比(signal-to-distortion ratio, SDR)为指标,流式 SCNet 与 HT-Demucs 在 23 ms 处达到约 7.0 dB,持平同条件专用实时模型最佳水平;在 93 ms 处达到约 8.5 dB,领先因果化 SCNet 变体约 0.7 dB。结论仅在单通道四轨分离与中型模型上验证,时延低于单变换窗长时合成被迫依赖反射填充而质量陡降,跨大模型与多采样率的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


67. 低码率不等于省电:神经音频解码器在笔记本与手机上的码率能量质量实测

原论文 Fig. 1:Neural and conventional codec paths. R_c, e_dec, and ViSQOL denote transmitted bitrate, decoder-side…

英文题目:Measurement-Based Bitrate-Energy-Quality Analysis of Neural Audio Codec Decoders on Laptop and Phone Platforms

标签:#音频编码 | #评测协议 | #高效推理 | #端侧运行

评分:6.7/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Seunghyeon Shin:机构信息未在 arXiv HTML 中可靠披露
  • Seokjin Lee:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文任务是在一对多回放边界下评估神经音频编码解码器的真实能效,输入为已编码码字索引或压缩比特流,输出为重建波形与单位音频时长解码能耗,难点在于低码率的传输节省与高合成计算量方向相反,且请求的加速器映射未必真实执行。方法链分为三步:先在原始参考 ViSQOL(Virtual Speech Quality Objective Listener)均值空间按公共重叠区间中点选取可比工作点,再经空闲基线相减与音频时长归一化得到 \(e_{dec}\),最后以传输能量系数为参量解析盈亏阈值并用执行有效性筛除失效路径。相对已有码率-质量与延迟报道,差异在于把有效执行证据与参数化传输模型纳入比较,避免把标称加速与低码率直接等同于节能。在全频带音乐手机路径评测下,EnCodec相对AAC-LC的盈亏阈值指标为12.4 mJ/kbit,低于DAC相对AAC-LC的盈亏阈值指标139.2 mJ/kbit。全频带DAC与SNAC在该手机XNNPACK CPU路径上解码1 s音频的延迟为1.32 s与1.63 s,不满足实时可行,其适用边界受限于该单机单路径测量。结论仅适用于所测单台笔记本与单台手机、所列 ONNX Runtime 与 OpenVINO 路径及 ViSQOL 客观锚点,不支持主观等价或全设备排名。原文未披露训练、推理之外的部署成本细节,编码端能量明确排除在外。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


68. 不只靠注册语音找人:五类线索如何各自指定目标说话人

原论文 Fig. 1:Illustration of TSE guided by different auxiliary target cues i.e., audio enrollment, visual…

英文题目:Multimodal Target Speaker Extraction: Towards Unified Speaker Cues Across Modalities

标签:#目标说话人提取 | #文献综述方法 | #音视频 | #空间音频信号 | #脑信号

评分:6.7/10 | 创新 1.6/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:综述 | arXiv 原文

👥 作者与机构

  • Xinyuan Qian:the School of Computer and Communication Engineering, University of Science and Technology Beijing, 100083, China
  • Yanghao Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Ziyang Jiang:the School of Computer and Communication Engineering, University of Science and Technology Beijing, 100083, China
  • Yu Chen:the Chinese University of Hong Kong, Shenzhen, China
  • Xinjia Zhu:机构信息未在 arXiv HTML 中可靠披露
  • Xueyan Chen:the School of Computer and Communication Engineering, University of Science and Technology Beijing, 100083, China
  • Qiquan Zhang:Alibaba Token Foundry, Alibaba Group
  • Zexu Pan:Alibaba Token Foundry, Alibaba Group
  • Jiaying Wang:the Zhejiang Institute of Quality Sciences (Technology Innovation Center of the State Administration for Market Regulation), Hangzhou, 310018, China
  • Xianghu Yue:the School of Computer Software, Tianjin University, Tianjin, 300350, China
  • Jiadong Wang:the University Hospital rechts der Isar, Technical University of Munich, Munich, Germany
  • Björn Schuller:the University Hospital rechts der Isar, Technical University of Munich, Munich, Germany
  • Haizhou Li:the School of Artificial Intelligence, the Chinese University of Hong Kong, Shenzhen, 518172, China

📌 核心摘要

目标说话人提取以多说话人混合语音为输入,以辅助目标线索为条件输出目标波形,难点在于注册语音易混淆、视觉易遮挡、空间定位易误差及文本与神经线索歧义多变。该综述先按音频注册、视觉、空间、文本语义与神经五类线索梳理表征与条件融合方式,将上一步得到的线索嵌入送入提取网络做条件引导。再按判别式估计、变分与扩散生成、流匹配与离散词元预测梳理架构演进,把融合后特征映射为目标波形或词元序列。最后统一讨论数据集构造与评测指标,用仿真混合与真实录音的对照来检验可监督性与评测有效性。与仅罗列模型的综述不同,该文强调线索可靠性、同步与冲突处理,并区分不同范式在保真度与延迟上的取舍。在Libri2Mix Clean统一协议评测下,USEF-Laura-TSE-L(D)的WER为0.076,低于LauraTSE的WER 0.159。其结论仅适用于有孤立目标参考的仿真条件,对真实会议、动态目标切换与缺失模态的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


69. 文本线索与注册语音如何在一个模型里共同指向目标说话人

原论文 Figure 1:Overview of three single-cue TS-ASR interfaces.

英文题目:Unified Target-Speaker ASR with Text and Enrollment Speech Cues

标签:#目标说话人提取 | #注意力机制 | #语音识别 | #语音

评分:6.6/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yuxiang Mei:机构信息未在 arXiv HTML 中可靠披露
  • Yuchen Yan:机构信息未在 arXiv HTML 中可靠披露
  • Dongxing Xu:机构信息未在 arXiv HTML 中可靠披露
  • Jiaen Liang:机构信息未在 arXiv HTML 中可靠披露
  • Yanhua Long:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

目标说话人自动语音识别需从双人混合语音中只转写指定说话人,难点在于短文本线索可能被掩蔽或多说话人共享,而注册语音又存在设备与通道失配。该框架分三步衔接:先将甲骨文短文本与另一句注册语音分别编码为条件序列,保留词级与帧级细节以替代外部说话人向量。接着以混合语音表征作查询在共享Conformer块内部对条件序列做交叉注意力,将词汇定位与声学身份融合为目标增强的编码表示。最后以联结时序分类解码器输出完整转录及线索有效性辅助符号,训练恒定供给双模态并独立采样文本词汇失配与注册非目标说话人的负例,使无效分支接受拒识监督而有效分支主导转写,推理时同一检查点省略不可用分支即支持纯文本、纯注册与双线索推理。拼接式融合在 30000 条双人混合评测上以 5 字文本取得完整转录字符错误率(Character Error Rate,CER)8.80%,优于并行融合的 9.49%,也大幅优于同一检查点的纯文本推理与纯注册推理。结论仅适用于普通话朗读语音的双人无噪混合与甲骨文文本条件,尚未验证非甲骨文关键词、多于两人及强噪声泛化。原文未披露训练时长、推理延迟与部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


70. 不训练也能适应口音与用词:拼接式示范让各类编码器解码器模型都学会跟读

原论文 Fig. 1:Two demonstration approaches for in-context adaptation of encoder-decoder models: (a) Collated…

英文题目:In-Context Adaptation of Encoder-Decoder Models in Speech Recognition

标签:#语音识别 | #测试时自适应 | #语音 | #少样本

评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yen Meng:机构信息未在 arXiv HTML 中可靠披露
  • Sharon Goldwater:机构信息未在 arXiv HTML 中可靠披露
  • Hao Tang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

自动语音识别需将目标语音转写为文本,难点在于面对新说话人、口音与自发语音偏移时在推理时无参数更新实现快速适应。方法链先用基于词频逆文档频率的词法相似度为目标语音检索同说话人的k个示范语音文本对,相似度排序结果决定后续示范的词法与说话人相关性。接着拼贴示范将全部示例音频与目标音频拼接后统一编码,并将全部示例文本作为解码器前缀拼贴,形成长音频部分转写待续写上下文。然后冻结的编码器解码器对该上下文做续写补全式解码,直接生成目标转写,使检索输出经由拼贴格式进入解码条件。与之相比交错示范将语音嵌入与文本交替排列并附加指令提示,其依赖全能模型保留的大语言模型示例学习能力,因而仅适用于特定模型而拼贴适用于交叉注意力与解码器两类架构。在L2-Arctic同说话人4示例检索设置下,Qwen2.5-Omni拼贴示范首遍转写检索的WER为4.5,高于甲骨文转写检索的WER4.1。上下文长度与检索质量构成明确外推边界,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


71. 解释先定位时间,再把局部解释聚成类概念:从笑声判掌声看捷径学习

原论文 Figure 1:Overview of our pipeline.

英文题目:Uncovering shortcut learning in audio classifiers by discovering recurring concepts in temporal explanations

标签:#音频分类 | #模型集成 | #可解释性 | #音频大模型

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Cecilia Bolaños:机构信息未在 arXiv HTML 中可靠披露
  • Luciana Ferrer:机构信息未在 arXiv HTML 中可靠披露
  • Magdalena Fuentes:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理音频分类器中捷径学习诊断问题,输入为黑盒分类器与待审计音频集合,输出为类别级自然语言概念,用于判断模型是否依赖虚假共现。流水线先用扰动加随机森林生成100毫秒粒度的时间定位解释并取高重要性区段,再将滤波音频送入6个大型音频语言模型生成开放集字幕。该字幕集合经指令微调大语言模型按对比性、复现性与语义合并综合为候选概念,最后经至少3/6模型一致的交叉验证保留稳健概念。与依赖内部激活探针或可解释瓶颈层的概念方法不同,该机制完全模型无关,以文本聚合实现从实例解释到类别策略的跃迁,便于人类直接审计。在AudioSet Strong构造的5组目标加语境对照上,洁净训练与虚假相关训练的概念发现分别覆盖5组中的5组与5组中的4组,其中3组明确命中语境词、1组仅得到泛化描述,阴性对照Dog加Clock未误报。在SPU训练模型于SPU测试集与CLN测试集对比的设置下,Applause对应SPU训练模型的召回率指标为0.943,高于同一模型在CLN测试集的召回率指标0.868。该结论仅在5类受控自然共现与冻结MAE-AST加分类头下验证,受限于字幕幻觉、截断伪影与阈值选择,原文未披露训练推理成本与开源产物。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


72. 直接听原声做分类又写依据:双头语音大模型如何兼顾准确与可核查

原论文 Figure 1:Overview of the proposed bilingual speech-based cognitive screening framework.

英文题目:Explainable and Generalisable LLM-based Cognitive Decline Detection with Spontaneous Speech

标签:#病理语音评估 | #多任务学习 | #数据集 | #可解释性 | #多语言

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Ziyun Cui:Tsinghua University, Beijing, China;Shanghai Artificial Intelligence Laboratory, Shanghai, China
  • Wen Wu:Shanghai Artificial Intelligence Laboratory, Shanghai, China
  • Chuan Shi:Peking University Sixth Hospital, Beijing, China;Peking University, Beijing, China
  • Shuguang Yang:Peking University Sixth Hospital, Beijing, China
  • Xueying Gui:OPPO Research Institute, Shenzhen, China
  • Yan Zheng:OPPO Research Institute, Shenzhen, China
  • Qiong Yang:Peking University Third Hospital, Beijing, China
  • Haiyan Zhao:Peking University Third Hospital, Beijing, China
  • Wei-Qiang Zhang:Tsinghua University, Beijing, China
  • Ji Wu:Tsinghua University, Beijing, China
  • Yelei Li:OPPO Research Institute, Shenzhen, China
  • Nan Li:Peking University, Beijing, China;Peking University Third Hospital, Beijing, China
  • Chao Zhang:Tsinghua University, Beijing, China;Shanghai Artificial Intelligence Laboratory, Shanghai, China

📌 核心摘要

本研究处理自发语音到认知状态分类与临床可读解释的映射,输入为原始录音与任务提示,输出为健康对照(HC)、轻度认知障碍(MCI)、痴呆级(AD)三分类及自然语言依据,难点在于声学韵律与语义退化信号微弱且跨语言跨任务差异大。方法链分三步推进:先用Gemini-2.5-Flash对录音加标签做两阶段解释蒸馏得到1393条监督文本,再以Kimi-Audio为骨干冻结主体并用DoRA微调注意力与分类头,最后以分类交叉熵加生成teacher-forcing损失联合优化,使判别表示同时可被语言头复述。与转写后文本分类及自监督特征流水线相比,关键差异是保留停顿语速语调的端到端声语义联合建模并内生解释而非事后归因。在6个数据集任务条件下Kimi-Audio平均准确率0.666,ADReSS上准确率0.893与AUROC 0.921显著优于自监督基线与少样本Gemini。结论限于阈值定义的筛查标签与166例PUTH-AD小样本,未在完全独立外部队列验证,对误分类样本的解释仍会出现过度病理化。原文未披露训练时长,仅说明单张NVIDIA A800推理约7秒每样本与34 GB显存占用,偏向服务端部署。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


73. 复合条件不等于单条件相加:InterBias-SV 的四项对照与可复算边界

原论文 Figure 4:E16 mean absolute gender EER gap by labelled SNR.

英文题目:InterBias-SV: Compound Conditions in Speaker Verification

标签:#说话人验证 | #基准设计 | #基准测试 | #鲁棒性 | #公平性

评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Kamel Kamel:机构信息未在 arXiv HTML 中可靠披露
  • Hridoy Sankar Dutta:机构信息未在 arXiv HTML 中可靠披露
  • Keshav Sood:机构信息未在 arXiv HTML 中可靠披露
  • Sunil Aryal:School of Information Technology, Deakin University;Waurn Ponds, VIC, Australia

📌 核心摘要

文本无关说话人验证以注册与测试语音为输入、以是否同人为输出,在噪声、编解码与说话风格叠加时单条件误差无法预测联合误差,难点在于联合项、边际项与公共参考项常缺失且采样不可比。该基准先定义以等错误率为尺度的四项加性预测与交互对照,明确联合误差、两个边际误差与公共参考的计算关系。接着用冻结编码器加余弦打分的统一流程汇总6个语料上17组实验,共4068条打分记录并覆盖12个编码器标签。最后用脚本重算同语料家族对照并审计采样与溯源条件,区分可数值重算的结果与受控实验可解释的结论。与仅报告联合难度的已有基准不同,它要求四项同时被实测并保留同语料可比性,因而能揭示均值接近零仍可能伴随大幅离散的非可加现象。在RAVDESS情绪语音条件下,neutral→fearful失配条件的EER为0.256,高于neutral/neutral参考条件的EER 0.083。其结论适用边界受限于试次匹配、检查点同一性与部分条件元数据尚未验证,均值接近零不能证明可加性成立,近机会性能与近零分母会破坏比值解释。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


74. 乐谱给身份、音频给证据:SCISSOR 用逐帧查询做联合分配

英文题目:SCISSOR: Score-Conditioned Instrument Source Separation for Orchestral Recordings

标签:#音乐源分离 | #多模态学习 | #音乐 | #0 样本 | #鲁棒性

评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yiheng Lu:机构信息未在 arXiv HTML 中可靠披露
  • Hao-Wen Dong:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

管弦乐分离需从单声道混合中恢复小提琴、中提琴、大提琴与低音提琴四个声部,难点在于声部间共享音高、泛音重叠与音色相近,仅靠音频难以确定归属。SCISSOR先将混合频谱送入共享双轴编码器得到时频音频表征,同时把对齐乐谱光栅化为目标加背景共五个音高活动槽并叠加乐器身份嵌入以形成帧级查询。随后音频与查询经独立投影与归一化进入共享匹配空间计算余弦兼容度,再经槽间Softmax联合分配各频带证据,最后由共享条件精炼器结合音频特征输出复数掩蔽并重建波形。与直接拼接钢琴卷帘的做法不同,该竞争分配使声学证据能够压制错误乐谱提示。与乐谱相关基线的关键机制差异在于空活动时查询退化为纯身份向量,因而乐器仍可参与竞争。在合成加真实训练后,5首未见URMP录音上平均museval SDR达6.80 dB,方向上高于最强外部基线的5.62 dB。乐器身份类乐谱错误仍会使其跌破纯音频对照构成失败条件,单样本PHENICX-Anechoic结论亦缺乏跨录音统计支撑属于尚未验证范围。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


75. 无序方向遇到间歇说话就乱线:用说话人身份把轨迹按人接回去

原论文 Fig. 1:Block diagram of the proposed neural speech source tracker.

英文题目:Identity-Assisted Association of Unordered DOA Estimates for Neural Speech Source Tracking

标签:#声源追踪 | #注意力机制 | #语音 | #麦克风阵列

评分:6.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Bing Yang:机构信息未在 arXiv HTML 中可靠披露
  • Di Liang:机构信息未在 arXiv HTML 中可靠披露
  • Xiaofei Li:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音源追踪需把每帧无序的到达方向估计关联为按说话人一致的活动轨迹,难点在于间歇静音打断空间连续性、近距离与轨迹交叉造成混淆以及混响噪声破坏空间特征。该方法先用定位器输出无序DOA与活动并转为活动耦合相位差表示,同时用diarization编码器抽取时变说话人嵌入,再将两类特征投影平均后复制到多条轨迹并叠加轨迹与时间位置编码。随后交替的时间自注意力沿单条轨迹建模运动演化与身份延续,声源自注意力在同帧多轨迹间实现竞争区分,最终线性层回归有序活动耦合表示并解码为DOA与活动。与纯空间或固定类别节点方法不同,该设计不为说话人分配固定输出节点,而是以嵌入提供长期身份一致性来弥补短期空间连续性失效。在合成数据集评测下,TR的HOTA指标为83.1%,高于C-Conformer的HOTA指标78.3%。该结论适用边界受限于每帧至多2个同时活动源的短时双人场景,尚未验证向更多说话人、更长序列与强混响的泛化能力,复杂间歇与近距离重叠下仍会出现失败条件。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


76. 未见攻击下谁来分流:双路 Sinc 门控加仿射专家的语音伪造检测

原论文 Figure 2:Overview of the proposed DADGMoE framework.

英文题目:Domain-Adaptive Dual-Gating Mixture of Experts for Generalizable Speech Deepfake Detection

标签:#音频深度伪造检测 | #混合专家模型 | #域泛化 | #语音

评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Siqing Qin:机构信息未在 arXiv HTML 中可靠披露
  • Zhe Li:机构信息未在 arXiv HTML 中可靠披露
  • Kong Aik Lee:机构信息未在 arXiv HTML 中可靠披露
  • Man-Wai Mak:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音深度伪造检测(Speech Deepfake Detection,SDD)输入为待判话语波形,输出为真实或伪造二分类标签,难点在于训练与测试的攻击算法、信道和声学环境存在显著域偏移。所提域自适应双门控混合专家(Domain-Adaptive Dual-Gating Mixture of Experts,DADGMoE)在XLSR特征提取器与AASIST后端之间插入混合专家模块:波形分支与自监督学习(Self-Supervised Learning,SSL)特征分支并行提取门控嵌入,再将拼接内容logits与原型相似度logits融合得到路由权重,最后把权重最高的仿射专家作用于中间SSL特征并送入后端分类器。与通用前馈门控相比,该机制用可学习带通滤波显式感知低层物理伪影和高层时序不一致,并以可学习域原型锚定未见伪造模式。在19LA训练并跨数据集测试时,相对XLSR-AASIST基线在ITW上等错误率(Equal Error Rate,EER)从10.46%降至6.35%,在FoR上从7.47%降至4.42%,在21DF上从3.69%降至2.54%。结论仅在19LA训练范式和所测英语为主的伪造基准上成立,对中文ADD场景改善有限,对新型编解码攻击的外推尚未充分验证。成本方面额外参数仅0.17M且单卡Nvidia 4090可训练,原文未披露训练时长、推理时延与吞吐数据。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


77. 低码率下保住空间感:把方向和扩散率合成一个向量再跨频带量化

原论文 Fig. 1:Overview of the proposed parametric FOA codec.

英文题目:An Efficient Parametric Codec for Low-Bitrate First-Order Ambisonics

标签:#音频编码 | #向量量化 | #空间音频信号 | #多通道

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Wei-Ting Lai:机构信息未在 arXiv HTML 中可靠披露
  • Amy Bastine:机构信息未在 arXiv HTML 中可靠披露
  • Lachlan Birnie:机构信息未在 arXiv HTML 中可靠披露
  • Thushara D. Abhayapala:机构信息未在 arXiv HTML 中可靠披露
  • Prasanga N. Samarasinghe:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

低码率一阶Ambisonics(First-Order Ambisonics,FOA)编码需在10 kbps以下同时传输全向声道与每帧多频带的到达方向(Direction of Arrival,DOA)及扩散度,传统方向性音频编码(Directional Audio Coding,DirAC)启发式量化在该区间比特分配低效且多为可变码率。该方法保留标准DirAC分析与合成,仅重设计空间元数据量化器:先按等效矩形带宽(Equivalent Rectangular Bandwidth,ERB)划分36带得到DOA单位向量与扩散度,再将每带参数折成三维指向性向量并跨频带堆叠,最后用5级残差向量量化(Residual Vector Quantization,RVQ)输出恒定0.75 kbps元数据,并结合外部冻结单声道编解码器做DirAC合成。与独立量化DOA和扩散度相比,联合向量使高扩散频带的方向误差被范数自然降权,且码率与频带数解耦。在STARSS23上该方法配EnCodec在6.75 kbps总码率下角度误差为37.98度,低于同总码率传统DirAC的47.42度;在SpatialVCTK上配DAC时短时傅里叶变换(Short-Time Fourier Transform,STFT)损失为0.99,低于传统DirAC的1.91。该结论限于FOA重建与声音事件定位检测探针评估,高混响多种源场景误差依然较高,主观听感亦未验证。原文未披露训练、推理或部署成本之外的系统延迟与算力。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


78. 冻住生成主干、只为每个新域加小适配器:生成式语音增强的域增量学习

英文题目:Domain-Incremental Learning for Generative Speech Enhancement

标签:#语音增强 | #持续学习 | #LoRA | #语音

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Manjunath Mulimani:机构信息未在 arXiv HTML 中可靠披露
  • Annamaria Mesaros:机构信息未在 arXiv HTML 中可靠披露
  • Minje Kim:机构信息未在 arXiv HTML 中可靠披露
  • Jesper Rindom Jensen:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

生成式语音增强的输入为噪声环境下录制的退化语音,输出为自然可懂的干净语音波形,实际难点在于跨数据集说话人、噪声类型与录音条件大幅失配时零样本泛化失效,而朴素微调又覆盖共享知识引发灾难性遗忘。该工作先在Emilia-Large大规模合成噪声语料上从零训练GPT-2 Small生成式基座,以冻结WavLM-Large第6层声学表示为前缀条件,自回归生成Spark-TTS BiCodec的全局token与语义token,再由BiCodec解码器重建波形。增量阶段冻结基座并为每个新域在注意力与前馈层训练域专属低秩适配器,将域共享知识保留在基座而将域特异修正隔离至适配器,推理时按已知域标识直接路由或按最小预测熵选择适配器输出增强语音。相对直接微调线性层与联合微调多域数据的已有方法,该分离式适配避免了覆盖预训练泛化能力与多域数据偏置,因而在仅见当前域数据时仍能兼顾新域适应与旧域保持。在VoiceBank域增量终态评测设置下,DIL-GenSE的SpeechBertScore指标为0.88,高于FT的SpeechBertScore指标为0.73。方法假设推理域属于已见域集合,未验证域顺序、持续增多域的可扩展性与真实录音外推。原文未披露训练推理成本与解码采样超参数。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


79. 边聊边学:用双人上下文预测让 3D 头像在对话中改写自己

原论文 Figure 1:Learning from interaction.

英文题目:EvolvingAvatar: Interactive 3D Head Generation That Adapts as Conversations Unfold

标签:#音视频交互 | #测试时自适应 | #基准测试 | #音视频

评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Junjie Chen:机构信息未在 arXiv HTML 中可靠披露
  • Fei Wang:机构信息未在 arXiv HTML 中可靠披露
  • Kun Li:机构信息未在 arXiv HTML 中可靠披露
  • Yiqi Nie:机构信息未在 arXiv HTML 中可靠披露
  • Xun Yang:机构信息未在 arXiv HTML 中可靠披露
  • Yanbin Hao:机构信息未在 arXiv HTML 中可靠披露
  • Linfeng Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Meng Wang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

交互式三维头部生成需从用户面部视频与双人音频在线生成化身的说话与倾听动作,难点在于对话风格与轮转规律随会话演化且测试时无目标动作标签。本文提出EvolvingAvatar,先用区域结构因果编解码器将表情、颈部与下颌解耦为结构化隐变量,再由自适应生成器融合视觉与双人音频上下文并输出动作隐变量。双人上下文预测在无动作监督下驱动测试时训练,持久快权重跨区间累积会话规律而瞬时下颌分支只响应当前发音,预测的说话活动门控持久适应的注入强度。与固定参数基线相比,该机制把条件建模变为会话内学习。在OOD-Hard基准下,EvolvingAvatar的FDD指标为19.09,低于ARTalk的FDD指标20.91。该结论限于离线录制对话的重演评测,未验证生成动作反过来改变用户行为的活体交互,且配对精度与几何细节仍弱于部分基线。活体双向交互中的长期增益尚未验证且受限于离线重演协议。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


80. 从判别到可信概率:用全局校准与地理先验融合重塑声学监测

原论文 Figure 1:Methodology overview.

英文题目:Beyond Discrimination: Calibrated Geoprior Fusion for Bioacoustic Monitoring

标签:#音频分类 | #不确定性估计与校准 | #生物声学监测 | #模型融合

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Neha Sajja:Google DeepMind;Harvard University
  • Bart van Merriënboer:Google DeepMind
  • Burcu Karagol Ayan:Google DeepMind
  • Tom Denton:Google DeepMind

📌 核心摘要

被动声学监测需将Perch v2与BirdNET v2.4等声学模型输出解读为物种在特定时空窗内出现的概率,但其判别强而校准差导致阈值选择与丰度推断不可靠。论文先在全球标注库WABAD上对有正例物种分别拟合普拉特缩放参数,再取全局均值斜率与截距得到可迁移的均值似然普拉特缩放,无需目标库标签即可输出声学概率。接着以经纬度与年周为输入的地理元模型输出地理概率,并估计物种在数据集上的平均地理先验,为融合提供先验校正。然后将声学概率与地理概率经带先验的贝叶斯算子融合成联合后验,得到可直接用于生态推断的校准概率。与直接相乘的朴素贝叶斯乘法融合不同,新算子显式处理物种先验并做二元归一化,避免双概率相乘向零压缩,从而兼顾地理过滤与校准。在Doohan评测设置下,BirdNET经MLPS预校准加NBSP融合的指标uECE为0.039,低于未校准无融合基线的指标uECE 0.284。该结论适用边界受限于单一地理先验模型与三个有精细定位的标注库,稀有物种与强域偏移下仍弱于本地神谕校准,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


81. 共现能学出五度圈吗:跳字模型和弦嵌入的调性几何与张力探针

原论文 Figure 2:Predicted and human-rated tension curves for three representative progressions, comparing the…

英文题目:Emergent Tonal Structure in Learned Chord Embeddings and Its Relation to Tonal Tension

标签:#音乐分析 | #自监督学习 | #数据增强 | #听觉与音乐认知 | #音乐

评分:6.3/10 | 创新 1.1/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Maral Ebrahimzadeh:机构信息未在 arXiv HTML 中可靠披露
  • Gilberto Bernardes:机构信息未在 arXiv HTML 中可靠披露
  • Sebastian Stober:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为符号化和弦序列,输出为可解释的调性几何与序列级张力曲线,难点在于仅靠共现统计能否同时涌现五度圈、调中心与移调一致性并支撑可迁移的张力分析。方法链第一步负责语料规约与对称化,将贝多芬BPS-FH与Beatles Isophonics语料规约为24个大小三和弦并做12个半音移调增强,输出分布均衡的和弦序列集合。第二步负责分布学习,用上下文窗口为5的Skip-gram学习64维和弦嵌入,将上一步序列的共现结构转化为向量空间中的几何关系。第三步负责几何验证与张力构造,先以调质心距离与上下文距离度量五度圈、移调等变与调区转向,再将验证后的嵌入转化为调相关与局部张力量并做动态平滑得到张力曲线。与手工调性空间相比,关键差异是用数据对称性替代先验几何,移调一致性由训练分布构造性保证,因而增强主要强化全局调相关组织而短程上下文结构本身相对稳健。在 BPS-FH 上增强模型五度圈模板 Spearman 相关达 0.868 / 0.958 且循环排序误差为 0.000 / 0.000,明显优于非增强对照。人类张力部分仅在 12 条短进行上呈中度相关且依赖拟合,外推至含转位、织体与节奏的真实听感时失效。该结论受限于三和弦标签输入与小规模语料诊断性验证,尚未验证向大词汇量与真实演奏纹理的外推。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


82. 不只测单轮像不像:用人类对话分布给语音对话系统打分

原论文 Figure 1:Phone-rate CDS scores for different conversation types.

英文题目:Distributional Metrics for Evaluating Spoken Conversational Systems

标签:#语音对话系统 | #评测协议 | #模型评估 | #语音 | #主观评测

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Shree Harsha Bokkahalli Satish:机构信息未在 arXiv HTML 中可靠披露
  • Erica Cooper:机构信息未在 arXiv HTML 中可靠披露
  • Patrícia Schmidtová:机构信息未在 arXiv HTML 中可靠披露
  • Maike Züfle:机构信息未在 arXiv HTML 中可靠披露
  • Éva Székely:机构信息未在 arXiv HTML 中可靠披露
  • Nicholas Sanders:机构信息未在 arXiv HTML 中可靠披露
  • Ondřej Klejch:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

口语对话系统评价输入为长时间多轮双通道语音交互,输出为系统优劣排序,难点在于对话行为高度多样且孤立语句自然度无法反映节奏与轮换质量。该工作提出可解释的对话分布分数CDS,先以语音活动检测切分轮次并提取语速与节奏及交互特征形成逐会话分布,再以Wasserstein-2距离度量目标分布到人类参考与干扰锚点的相对位置并归一为百分制,最后在家族内与家族间平均得到复合分。与直接测停顿或打断的受控基准不同,该机制比较整体行为分布并置于高成功人类对话与合成干扰构成的双锚尺度上,因而更能反映会话级自然度差异。在VoiceArena Goals语料评测下,Sylber时长分布的Spearman相关系数指标为0.615,高于整体非语义复合CDS的Spearman相关系数指标0.266。该结论仅适用于英语目标导向对话与第三方人性度判断,尚不能外推为因果改进方向或跨语言全双工能力的充分证据。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


83. 元训练与元测试互相抵消时:用非对称投影保住适应的方向

原论文 Figure 2:Overview of the proposed DGS-MLDG framework.

英文题目:DGS-MLDG: Domain Gradient Surgery Guided Meta-Learning for Domain Generalization in Speech Deepfake Detection

标签:#音频深度伪造检测 | #元学习 | #域泛化 | #语音

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Siqing Qin:机构信息未在 arXiv HTML 中可靠披露
  • Kong Aik Lee:机构信息未在 arXiv HTML 中可靠披露
  • Youzhi Tu:机构信息未在 arXiv HTML 中可靠披露
  • Eng Siong Chng:机构信息未在 arXiv HTML 中可靠披露
  • Man-Wai Mak:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音深度伪造检测(Audio Deepfake Detection)的输入为原始波形,输出为真伪二分类标签,难点在于训练攻击类型与未见合成器、编解码器及野外信道之间存在严重域偏移。该工作先按攻击类型划分22个源域并在每轮切分元训练(Meta-Train)与元测试(Meta-Test)以模拟偏移,再以内循环适配得到中间参数并计算双分支梯度,接着用域梯度手术(Domain Gradient Surgery,DGS)做冲突检测与非对称投影,最后以层级变体按层独立执行手术完成外循环更新。与多任务对称手术不同,该方法将元训练梯度定为不可修改的锚点,仅去除元测试梯度中的反向分量,从而维护内循环判别学习。在包含ASVspoof 2021 DF与In-the-wild等7组评测的实验中,DGS-MLDG相对经验风险最小化(Empirical Risk Minimization,ERM)基线取得5.29%的平均相对等错误率下降。该结论限于基于自监督语音骨干与BiMamba后端的短语音切片场景,在强压缩与野外数据上绝对误差依然较高,且未验证对未见语言或实时流式的前推能力。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


84. 可训练融合先涨点,韵律表示再加分吗:冻结 HuBERT 的参数匹配对照

原论文 Figure 1:Two-phase system. Phase 1 trains a 64-D representation using five acoustic-prosodic targets.

英文题目:Does a prosody-trained representation help beyond trainable fusion? A parameter-matched study with frozen HuBERT

标签:#语音识别 | #Adapter | #韵律 | #语音 | #评测协议

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Ki Woong Moon:机构信息未在 arXiv HTML 中可靠披露
  • Daniel Brenner:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

自发语音识别需将高度弱化与协同发音的声学输入转写为文字,韵律 prominence 等线索理论上可缓解歧义,但已有工作难以区分增益来自辅助信息还是新增可训练模块。本文采用两阶段链条:先在 CASPER 上训练 64 维韵律编码器预测对数基频、发声、基频差分、对数能量和频谱倾斜 5 类目标,再冻结该编码器与 HuBERT-base,仅用后者各层隐状态与辅助表示做事后融合识别。关键机制是引入参数量相同的零输入对照 Null,使 Learned 与 Null 仅在辅助输入是否为学习表示上不同,从而隔离信息增量。在 Buckeye、Switchboard 和 AMI IHM 3 个语料上,可训练融合相对无融合基线带来 0.71 至 1.45 个百分点的词错误率下降,而 Learned 相对 Null 的差异分别为 +0.07、-0.09 和 +0.00 个百分点,区间均包含零且校正后不显著。推理期干预显示跨话语替换使 Learned 显著恶化 0.42 至 1.06 个百分点,证明模型依赖输入但无增量收益。结论仅适用于冻结 HuBERT-base、联结时序分类解码与该门控特征线性调制融合架构,未验证微调主干或回灌融合等情形。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


85. 动态帧率编解码的边界在何处切分:音节尺度为何优于音素尺度

原论文 Figure 1:EXP1: Visualization of reference boundaries and rate-matched segmentations for one utterance.

英文题目:Interpreting and Evaluating Dynamic-Rate Speech Codec Boundaries

标签:#语音编码 | #神经编解码与离散单元 | #可解释性 | #语音学与音系

评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Han Wang:机构信息未在 arXiv HTML 中可靠披露
  • Jiaqi Li:机构信息未在 arXiv HTML 中可靠披露
  • Yingda Shen:机构信息未在 arXiv HTML 中可靠披露
  • Yuxiang Wang:机构信息未在 arXiv HTML 中可靠披露
  • Zhizheng Wu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

动态帧率语音编解码器需把连续语音压缩为变长离散单元,输入是连续波形特征,输出是可重建波形的token序列,难点在于边界位置同时决定语义对齐与量化失真。本文以FlexiCodec为公共底座固定编码器与量化器并用多码率混合分配微调共享解码器,只改变边界分配方法以隔离边界效应。EXP1先在TIMIT测试集上以40ms容差计算七种切分相对音素音节等六类参照的边界F1并追踪四种编码器深度的含义迁移,其发现的音节级对齐优势假设直接进入EXP2作为待验关联。EXP2再在6.25Hz等三档码率下比较重建质量与池化失真并构造音素与音节派生的等帧率对照做因果检验。机制差异在于相似度合并与动态规划搜索继承了深层语音识别导向表示的平滑结构,因而偏向音节尺度切分,而非追踪细粒度声学突变。在 TIMIT 测试集 6.25 Hz 下 CodecSlime 以 5.394% 的 q1:8 重建词错率领先,且音节对齐与池化失真的跨方法秩相关绝对值达 0.89。音节派生切分在 4.47 Hz 下相对均匀切分将词错率从 17.61% 降至 13.85%,而音素派生切分在 8.06 Hz 下从 6.47% 升至 7.10%。结论仅适用于语义丰富的编码器特征与 3 Hz 至 10 Hz 中低码率英语场景,未验证 12.5 Hz 以上高码率、多语种与声学特征管线。原文未披露训练超参数与推理部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


86. 从一次生成到多轮改谱:让通用指令模型守住可持久编辑的交互契约

原论文 Figure 2:Operation-aware state transition over a persistent ABC artifact.

英文题目:From One-Shot Generation to Incremental Music Composition: Adapting a General-Purpose Instruction LLM for Persistent Symbolic Editing

标签:#符号音乐生成 | #LoRA | #数据集 | #大语言模型 | #音乐

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • André Ricardo Ducca Fernandes:Department of Informatics (DI), Pontifícia Universidade Católica do Rio de Janeiro (PUC-Rio), Rio de Janeiro, RJ 22451-900, Brazil
  • Jean-Pierre Briot:Department of Informatics (DI), Pontifícia Universidade Católica do Rio de Janeiro (PUC-Rio), Rio de Janeiro, RJ 22451-900, Brazil;Sorbonne Université, CNRS, LIP6, F-75005 Paris, France;CBAE, Universidade Federal do Rio de Janeiro (UFRJ), Rio de Janeiro, RJ 22250-020, Brazil
  • Simone Diniz Junqueira Barbosa1:Department of Informatics (DI), Pontifícia Universidade Católica do Rio de Janeiro (PUC-Rio), Rio de Janeiro, RJ 22451-900, Brazil
  • Hélio Côrtes Vieira Lopes:Department of Informatics (DI), Pontifícia Universidade Católica do Rio de Janeiro (PUC-Rio), Rio de Janeiro, RJ 22451-900, Brazil

📌 核心摘要

该工作研究持续符号作曲任务,输入为持久ABC记谱制品与自然语言操作请求,输出为满足操作语义与保持不变量的修订后ABC,需兼顾语法可用性、局部与全局修改范围及跨轮状态连续。方法首先将作曲形式化为操作感知的状态转移并定义生成与编辑的保持约束,明确各操作可改范围与必留不变量。接着以前步的形式化约束为规范,由Irish Massive ABC Notation曲库训练切分构造含5种操作的496038条多轮对话监督数据,使前后制品对进入下一步训练。然后用该对话数据以低秩适配Low-Rank Adaptation微调Llama 3.1 8B Instruct得到ABC-LLM,并接入NONOTO原型完成编辑渲染试听。与依赖专用编辑架构的已有方法相比,关键机制差异在于用前后制品对教会通用指令模型何处可改与何处必留,实际意义在于使通用模型成为可复用的跨轮编辑算子。在每模型1750次尝试的评测协议下,ABC-LLM的checker admission准入率指标为99.37%,高于未适配基座的checker admission准入率指标29.37%。结论仅限爱尔兰传统单声部主导谱加和弦标记域内成立,未验证跨风格、自由措辞、复调与真实乐手迭代价值。原文未披露训练、推理或部署成本,未提供代码与模型链接。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


87. 听阈正常却听不清噪声:用信息损失选出压缩加调制噪声探针

原论文 Figure 1:ΔAUC (AUC^(NH)-AUC^(k), bits\\cdotlog(Hz)) for the V_IHC\\toAN pathway at 95 dB SPL for unprocessed…

英文题目:Model-Guided Design of Low-Context Speech Probes for Cochlear Synaptopathy

标签:#语音可懂度评估 | #心理声学实验 | #言语感知 | #语音

评分:5.9/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Ahsan J. Cheema:机构信息未在 arXiv HTML 中可靠披露
  • David Meng:机构信息未在 arXiv HTML 中可靠披露
  • Jorge Mejia:机构信息未在 arXiv HTML 中可靠披露
  • Sanna Hou:机构信息未在 arXiv HTML 中可靠披露
  • Sunil Puria:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

耳蜗神经退变输入为纯音阈值正常下的阈上言语编码,输出为是否存在神经性编码损失,难点在于毛细胞功能障碍降低驱动输入而突触丢失减少传输纤维,两者都降低神经输出而难以用心理物理方法分离。方法链分三步:先录制低语境元音-辅音-元音无意义音节并施加时间压缩与噪声退化,再经现象学听神经模型得到内毛细胞电位与听神经图,最后计算两者互信息并以正常听力为基线求信息损失以排序探针。相对既往NU-6有意义词研究,关键机制差异在于用无意义音节削弱词汇语义补偿,并在同一信息论标尺下对比压缩、混响、稳态与调制噪声的互补掩蔽效应。在闭集辅音辨认任务条件下,压缩加调制噪声的自报困难组的准确率为42.3%,低于对照组的准确率47.9%。建模显示40%压缩加调制噪声在最重退变下信息损失最大,单独压缩安静下与单独调制噪声行为上均不显著分离两组。该结论适用边界受限于个体言语接收阈校准与闭集任务,未经生理指标验证因果,安静下存在天花板效应,且仿真与行为信噪比存在错位。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


88. 关键词只偶尔出现时,为何还要每帧都算完整卷积:子模型短时记忆卷积的稀疏执行

原论文 Figure 2:左侧 STMC、右侧图中标为 Multimodal STMC。官方图注将右侧称为 SM-STMC,存在命名差异。

英文题目:Sub-Model Short-Term Memory Convolutions for Keyword Spotting Systems on Device

标签:#关键词检测 | #动态计算与早退 | #端侧运行 | #流式处理 | #高效推理

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Paweł Warlewski:机构信息未在 arXiv HTML 中可靠披露
  • Artur Czeczko:机构信息未在 arXiv HTML 中可靠披露
  • Artur Szumaczuk:机构信息未在 arXiv HTML 中可靠披露
  • Grzegorz Stefański:机构信息未在 arXiv HTML 中可靠披露
  • Szymon Klimaszewski:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

关键词检测需对连续语音流以高时间粒度判断目标词是否出现,在可穿戴等端侧受限设备上同时受算力、内存与实时时延约束。论文先离线训练小型VGG声学嵌入提取梅尔频谱特征,再由多层感知机分类器输出关键词后验,其训练权重直接作为后续流式扩展的基础。推理期将卷积主干按池化边界切分为以池化层或输出层结尾的独立子模型,子模型间经时序记忆缓冲连接复用历史激活,前级子模型的缓冲输出直接作为后级子模型的输入。接着按时间步静态调度只执行到所需深度并每8帧调用一次分类器,从而跳过稀疏分类时无增益的池化分支冗余状态;相对每帧全网前向的原始短期记忆卷积,该机制无需重训练且不引入新参数,并避免运行时控制流以兼容TensorFlow Lite Micro部署,其推理开销以计算量与延迟衡量。在Google Speech Commands标准1秒测试集评估条件下,SM-STMC1的准确率为0.9382,高于VGG1的准确率0.9278。该结论仅在英文孤立词、1024 点窗长与 256 点跳长的梅尔频谱、两套小 VGG 配置下验证,未覆盖噪声、远场、连续语音误触发与跨数据集外推。原文未披露货币与能耗成本,仅报告周期与时延。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


89. 旋律配得上不等于按人的方式配:叙事条件下的人类和声决策如何被保留、改造或压制

英文题目:From Human Narrative to Harmonic Structure: A Human-Centered Investigation of Algorithmic Music Generation through the Chord Wheel Diagram

标签:#符号音乐生成 | #评测协议 | #音乐 | #可解释性

评分:5.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Josef Pavlíček:机构信息未在 arXiv HTML 中可靠披露
  • Petra Pavlíčková:机构信息未在 arXiv HTML 中可靠披露
  • Irena Štrausová:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该研究输入为 6 首叙事流行歌曲的单声部旋律,输出为与之匹配的和声序列,难点在于同一旋律允许多个形式正确解,而人类选择包含持续、重复与离调等身份特征。方法链分 4 步:先将原版和声归一化为罗马数字功能并保留时值以刻画人类决策模式,再对旋律划分节拍感知决策段并枚举候选和弦,接着以旋律兼容、持续、节拍适宜、终止贡献加权打分并经动态规划求最优路径,最后用 BPMN(业务流程模型与标记法)表时间展开与和弦轮盘图(Chord Wheel Diagram,见 www.aakordy.cz)表调性功能位置做对比解读。与仅追求兼容的生成思路差异在于显式保留持续与转移并把视觉解释作为评估一环,其意义是区分听感合理与身份保持。原文未提供可核对的关键定量结果。结论仅适用于小样本案例解读,不支持因果归因或跨风格外推。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


90. 稀疏激活能否拨动年龄性别口音:神经音频编解码的可解释转向探针

原论文 Figure 1:Overview of the SAE steering framework.

英文题目:Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: Exploration toward Age, Gender, and Accent Steering

标签:#语音属性识别 | #神经编解码与离散单元 | #可解释性 | #语音

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Shih-Heng Wang:机构信息未在 arXiv HTML 中可靠披露
  • Tiantian Feng:机构信息未在 arXiv HTML 中可靠披露
  • Aditya Kommineni:机构信息未在 arXiv HTML 中可靠披露
  • Huang-Cheng Chou:机构信息未在 arXiv HTML 中可靠披露
  • Bowen Yi:机构信息未在 arXiv HTML 中可靠披露
  • Xuan Shi:机构信息未在 arXiv HTML 中可靠披露
  • Shrikanth Narayanan:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为原始语音波形,输出为经稀疏激活干预后重构的波形及其年龄、性别与口音预测,难点在于神经音频编解码器表征高度纠缠且缺乏可验证的特质归因手段。该工作先用Top-k稀疏自编码器将量化帧嵌入分解为帧级稀疏激活,再基于源与目标特质组的帧级激活频率差计算归一化比较分并筛选相对关联维度。接着仅在原Top-k活跃交集内以固定强度对源关联维度赋负值、对目标关联维度赋正值,其输出经稀疏自编码器解码器还原嵌入后送入编解码器解码器重构波形。最后用外部年龄性别口音分类器与内容质量指标检验重构语音的偏移方向与退化程度。与仅做任务级探针的前作相比,关键机制差异在于引入波形级转向干预作为因果代理而非只报告相关性,因而可直接验证所选维度是否驱动目标特质变化。在Vox-Profile测试集下,原始女性语音的女性概率指标为95.9%,高于原始男性语音的女性概率指标7.6%。其适用边界受限于性别双向控制较稳而年龄与口音呈非单调、非对称与随强度反转的响应,且转向普遍抬高词错误率并降低感知质量,尚未验证特质与其他信息的分离。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


91. 在对数幅度上加先验为何困难:用辅助变量绕开不可微的 EPILOG 正则

原论文 Figure 1:Visualization of \\psi^(\\alpha,\\epsilon)(z,\\sigma) in Eq.

英文题目:Prox-Friendly Log-Magnitude Prior on Complex-Valued Signal

标签:#去混响 | #正则化 | #语音 | #时频分析

评分:5.5/10 | 创新 1.5/2 | 技术严谨 0.8/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Kazuki Matsumoto:机构信息未在 arXiv HTML 中可靠披露
  • Keidai Arai:机构信息未在 arXiv HTML 中可靠披露
  • Kohei Yatabe:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音去混响需从卷积混响观测中恢复干净语音信号,难点在于复数谱图的对数幅度先验难以直接写入近端分裂优化,且非线性幅度变换使正则项的近端算子难以推导。方法先构造含辅助变量的指数惩罚函数,将二次项分母改为指数形式,从而建立辅助变量与对数幅度之间的解析联系,其输出作为对数域结构的代理进入下一步。接着把倒谱稀疏写成离散余弦变换系数的加权范数并作用于辅助变量,实现对对数幅度的间接正则化,其输出的稀疏倒谱结构进入优化求解环节。最后对增广拉格朗日函数交替最小化,并用含朗伯函数的逐变量近端算子分别更新复数谱图与辅助变量,得到去混响估计。与直接正则化复数值或幅度的已有透视函数方法相比,关键差异是允许辅助变量取全体实数并通过指数耦合传递对数域结构,因而能兼容倒谱稀疏等听觉相关先验并保持可分裂优化。在所报告的评测任务下,原文未提供可核对的关键定量结果。该结论适用边界受限于已知混响算子、八千赫兹重采样与一百二十八帧截断条件,盲估计、长混响与跨库泛化等场景尚未验证,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


92. 从一段板混响脉冲反推六个物理参数:先学全局后验再为每个样本做局部精修

原论文 Figure 1:Summary of the neural architecture.

英文题目:Simulation-Based Inference for Plate Reverb System Identification

标签:#房间脉冲响应估计 | #生成模型 | #时频分析 | #测试时自适应 | #不确定性估计与校准

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Dylan Sechet:机构信息未在 arXiv HTML 中可靠披露
  • Marc Evrard:机构信息未在 arXiv HTML 中可靠披露
  • Matthieu Kowalski:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

任务是从单条5秒44100Hz采样的板式混响脉冲响应反推6个可辨识归一化参数,输入为220500点非归一化位移波形,输出为归一化超立方体中的面密度与刚度张力不变量及板长与读出位置,难点是正向模态合成器不可微且原材料参数仅经由不变量影响观测。方法分三步:概括网络先将脉冲转为三种窗长的对数幅度谱并经卷积与多层感知机压缩为256维嵌入,神经样条流再以该嵌入为条件学习参数后验,离线训练仅用仿真器采样对做最大似然且推理只需一次前向。针对每个测试观测,序贯神经后验估计SNPE-C从当前后验采样提案并仿真生成集中于目标附近的脉冲做三轮精修,再用l2波形重构误差在离线估计与精修估计间二选一以剔除退化个例。与粒子群优化基线相比,关键差异是将仿真器视为仅需采样的黑箱而无需可微前向模型,并直接返回完整后验以评估不确定性而非单一点估计,具有实际校准意义。在自建50条脉冲测试集评估下,选择估计器的全局NMSE指标为0.47×10^{-3},低于粒子群基线的全局NMSE指标50.56×10^{-3}。结论仅在同一仿真器闭环内成立,无真实板、无噪声与外推验证。离线推理不足 1 秒,单样本精修约需 2.5 小时 A100 计算,部署成本极高。该结论适用边界受限于同一仿真器闭环与无噪声条件且尚未验证真实板外推,离线训练成本约26小时A100训练而单样本精修推理开销约2.5小时硬件计算。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


93. 不停播的数字主播:流式多模态参考与主动规划如何分工

原论文 Figure 1:FlowAct-R2 couples proactive interaction with streaming multimodal reference generation.

英文题目:FlowAct-R2: Beyond Talking Avatar via Streaming Multimodal References and Proactive Agent Planning

标签:#音视频交互 | #扩散模型 | #语音代理规划与工具使用 | #流式处理 | #音视频

评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.4/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:后 50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Ziyao Huang:机构信息未在 arXiv HTML 中可靠披露
  • Zhengkun Rong:机构信息未在 arXiv HTML 中可靠披露
  • Shiyang Qin:机构信息未在 arXiv HTML 中可靠披露
  • Shuang Liang:机构信息未在 arXiv HTML 中可靠披露
  • Wentao Hu:机构信息未在 arXiv HTML 中可靠披露
  • Yuxuan Luo:机构信息未在 arXiv HTML 中可靠披露
  • Yuan Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Mingyuan Gao:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

FlowAct-R2面向开放式直播数字人,以滚动动作提示、流式音频与动态更新的图像音频视频参考为输入,输出连续720p人形视频流,难点在于长时保持身份外观的同时响应参考切换与观众打断。流式多模态参考扩散变换器适配预训练Seedance 2.0 Mini参考到视频骨干,以扩散强制支持自回归流式推理,并以视频驱动旋转位置编码对齐参考块与生成时间轴。该变换器再以参考加图像条件锚定身份、以部分加噪历史帧抑制漂移并输出连续视频流,前瞻交互智能体则离线提炼人物设定、长程议程与可复用多模态技能,在线结合观众事件与交互历史决定发起、叠加、推迟、打断或恢复行为,并以闲置、聆听、说话与技能执行时段驱动生成器更新提示与参考。相对已有方法,关键差异在于将参考与条件本身做成可流式切换的流并与智能体调度解耦,使同一接口同时支撑会话问答与唱跳、试穿、场景切换等任务型动作,实际意义在于支持小时级多场景自主直播。在与Vidu-S1对比的人评任务下,FlowAct-R2在视频质量维度的GSB得分为+54.76%,高于在实时交互维度的GSB得分+40.48%。该结论仅在演示精选帧与单组人评下成立,未验证长时身份漂移率与打断恢复成功率。原文未披露训练、推理与部署成本,未设局限小节,且正文对第四类场景在交互式游戏与直播游记之间表述不一致。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。