本汇总收录 authenticated plan 选择集内全部 1354 篇已完成分析、重标和单篇 staging 的论文。
🏷️ 标签说明:本期使用新版受控 taxonomy;热门方向只统计主任务。
⚡ 今日概览
✅ authenticated plan 入选 1354 篇 → 🔬 深度分析、Reader 与页面投影完成
🏷️ 热门方向
| 方向(仅主任务) | 数量 |
|---|---|
| #语音识别 | 213 篇 |
| #语音属性识别 | 106 篇 |
| #文本到语音 | 87 篇 |
| #病理语音评估 | 72 篇 |
| #语音增强 | 59 篇 |
| #音频分类 | 58 篇 |
| #语音情感识别 | 58 篇 |
| #说话人验证 | 43 篇 |
| #音频问答 | 43 篇 |
| #音频深度伪造检测 | 35 篇 |
| #语音合成 | 28 篇 |
| #语音质量评估 | 28 篇 |
| #语音转换 | 25 篇 |
| #说话人分离标注 | 24 篇 |
| #语音编码 | 22 篇 |
| #语音翻译 | 19 篇 |
| #音频事件检测 | 18 篇 |
| #语音对话系统 | 18 篇 |
| #目标说话人提取 | 17 篇 |
| #音频检索 | 17 篇 |
| #语音伪造检测 | 17 篇 |
| #关键词检测 | 16 篇 |
| #语音可懂度评估 | 16 篇 |
| #轮次切换 | 15 篇 |
| #说话人匿名化 | 15 篇 |
| #静默语音接口 | 13 篇 |
| #音频生成 | 13 篇 |
| #语言识别 | 13 篇 |
| #语音分离 | 13 篇 |
| #言语神经解码 | 12 篇 |
| #音频编码 | 12 篇 |
| #音频理解 | 12 篇 |
| #声源定位 | 11 篇 |
| #空间音频渲染 | 10 篇 |
| #口语意图与槽位识别 | 10 篇 |
| #音视频语音识别 | 10 篇 |
| #口语理解 | 9 篇 |
| #强制对齐 | 8 篇 |
| #音频水印 | 8 篇 |
| #语音克隆 | 8 篇 |
| #房间脉冲响应估计 | 7 篇 |
| #歌唱生成 | 7 篇 |
| #说话人识别 | 7 篇 |
| #音频字幕生成 | 7 篇 |
| #语音编辑 | 7 篇 |
| #音视频理解 | 6 篇 |
| #语音超分 | 6 篇 |
| #语音交互 | 6 篇 |
| #主动降噪 | 6 篇 |
| #音视频问答 | 5 篇 |
| #语音活动检测 | 5 篇 |
| #声学场景分类 | 4 篇 |
| #视频到声音生成 | 4 篇 |
| #异常声音检测 | 4 篇 |
| #音乐生成 | 4 篇 |
| #去混响 | 3 篇 |
| #音高与旋律提取 | 3 篇 |
| #音频修复 | 3 篇 |
| #音频质量评估 | 3 篇 |
| #音视频语音分离 | 3 篇 |
| #回声消除 | 2 篇 |
| #全双工语音交互 | 2 篇 |
| #声场重建 | 2 篇 |
| #音乐理解 | 2 篇 |
| #音乐源分离 | 2 篇 |
| #音频分离 | 2 篇 |
| #音频指纹 | 2 篇 |
| #音视频生成 | 2 篇 |
| #音视频语音合成 | 2 篇 |
| #丢包修复 | 1 篇 |
| #音频超分辨 | 1 篇 |
| #音频交互 | 1 篇 |
| #语音唤醒 | 1 篇 |
| #语音配音 | 1 篇 |
📊 论文评分排行榜
| 排名 | Reader 中文题目 | 英文题目 | 八维评分 | 分档 | 文档类型 | 主任务 |
|---|---|---|---|---|---|---|
| 1 | 希伯来语缺的不只是元音:用增强注音加规则转写补齐重音与发音 | Phonikud: Overcoming Phonetic Underspecification for Hebrew Text-To-Speech | 8.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 1.0/1 · 影响力 1.0/1.5 · 开源 1.5/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #文本到语音 |
| 2 | 分布对齐了性能仍崩塌:MV2LRS3 检验视听语音识别的真泛化 | Assessing True Generalisability of Audio-Visual Speech Recognisers | 8.7/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.5/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #音视频语音识别 |
| 3 | 单阶段直达声学码本:OmniVoice 如何把 600 余种语言装进一个扩散语言模型 | OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models | 8.7/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.3/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 模型报告 | #文本到语音 |
| 4 | 看不见生成器时如何判别环境声真假:首届 ESDD 挑战的双赛道基准 | The First Environmental Sound Deepfake Detection Challenge: Benchmarking Robustness, Evaluation, and Insights | 8.6/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #音频深度伪造检测 |
| 5 | 用领域加权把三类专家装进一个编码器:USAD 2.0 的两阶段蒸馏与十亿参数扩展 | USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding | 8.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 模型报告 | #音频理解 |
| 6 | 尾词把延迟排名带偏了:同时语音翻译延迟指标的元评价与修正 | Better Late Than Never: Meta-Evaluation of Latency Metrics for Simultaneous Speech-to-Text Translation | 8.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音翻译 |
| 7 | 在单流服务引擎里塞进多码本与双路引导:延迟交织与配对调度的吞吐保卫战 | An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation | 8.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前25% | 系统技术报告 | #音频生成 |
| 8 | 先记住真话的腔调,再识破假声的破绽:ProSDD 的两阶段韵律建模 | ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks | 8.4/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音频深度伪造检测 |
| 9 | 只转尾部奇异方向:用受限旋转与权重平均做语音持续学习 | Parameter-Efficient Continual Learning for Automatic Speech Recognition | 8.3/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音识别 |
| 10 | 不用时长标签也能对准歌词:分块流匹配如何兼顾长歌连贯与效率 | DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching | 8.3/10 · 创新 1.6/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #歌唱生成 |
| 11 | 不改解码器做多说话人理解:用声纹活动掩码把目标说话人先抽出来 | Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning | 8.3/10 · 创新 1.6/2 · 技术严谨 1.3/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #目标说话人提取 |
| 12 | 从被动端点检测到提前预报:用推测执行掩盖级联对话延迟 | Endpoint Anticipation for Low-Latency Spoken Dialogue | 8.3/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #轮次切换 |
| 13 | 在移动对话中解码注意:MOV-AAD 如何把脑电与身体信号同步起来 | MOV-AAD: A Large-Scale Multimodal Dataset for Auditory Attention Decoding During Moving Conversations | 8.2/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #言语神经解码 |
| 14 | 判别先分、生成再修:MeCo 用一步平均速度把估计搬回干净语音流形 | MeCo: One-Step MeanFlow-based Corrector for Multi-Channel Speech Separation | 8.2/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音分离 |
| 15 | 幼儿语音太难转写:用半百万元音素标注把预训练拉回日常长录音 | BabAR: from phoneme recognition to developmental measures of young children’s speech production | 8.2/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #语音识别 |
| 16 | 用罗马化统一文字、用语音 token 补回发音:UR-BERT 如何把 TTS 文本编码器扩到 495 种语言 | UR-BERT: Scaling Text Encoders for Massively Multilingual TTS Through Universal Romanization and Speech Token Prediction | 8.2/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #文本到语音 |
| 17 | 从更大更杂的数据到更准的边界:MFA 3.0 如何重做语音到文本对齐 | Montreal Forced Aligner and the state of speech-to-text alignment in 2026 | 8.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.3/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.1/1.5 | 前25% | 系统技术报告 | #强制对齐 |
| 18 | 不训练分类器也能认出是谁合成的:残差统计指纹的轻量归因 | Lightweight Detection and Model Attribution of Synthetic Speech via Residual Statistical Fingerprints | 8.2/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音伪造检测 |
| 19 | 噪声下别硬听:用稀疏对齐与视觉离散单元约束大模型的音视识别 | Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement | 8.2/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音视频语音识别 |
| 20 | 从朗读到街头实录:AfriVox-v2 用领域纵深逼出非洲语音识别的真实误差 | AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition | 8.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #语音识别 |
| 21 | 从朗读式评测到电话闲聊:Voice of India 为何重写印度语语音识别的及格线 | Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India | 8.1/10 · 创新 1.6/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #语音识别 |
| 22 | 笑声和哭声翻不过去:MoVE 用混合发声专家保留非言语声 | MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation | 8.1/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音翻译 |
| 23 | 没有配对报告时如何让呼吸音编码器听懂医学语言:REACH 的对齐路线 | Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment | 8.1/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音频分类 |
| 24 | 自然分布会掩盖长尾失败:Earnings25 用 500 小时全量通话加 46 小时均衡切片测金融语音 | Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance | 8.1/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #语音识别 |
| 25 | 非言语发声不是音效:NV-Bench 把交际功能、对齐与逼真度分开测 | NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation | 8.1/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #文本到语音 |
| 26 | 把比特花在变化处:DTM-Codec 用掩码与等路径分段做可变帧率语音编码 | DTM-Codec: Dynamic Token Masking for VFR Speech Coding with Efficient Boundary Selection | 8.1/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音编码 |
| 27 | 不等整句到齐就开口:FlashTTS 如何把自回归与声学解码同时加速 | FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation | 8.1/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.4/1.5 | 前25% | 系统技术报告 | #文本到语音 |
| 28 | 自然多语速普通话基准:GRATS 为何要用真实目标录音检验变速 | GRATS : A Natural Multi-Speed Mandarin Dataset for Speech Time-Scale Modification Benchmarking | 8.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #语音编辑 |
| 29 | 不只听懂说什么:ParA-LLM 用两阶段课程补上副语言与声学理解 | ParA-LLM: A Unified Approach to Paralinguistic and Acoustic Speech Understanding | 8.0/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #音频问答 |
| 30 | 双流看残留、两阶段找不变:DAST 用转换数据练出跨系统攻击 | DAST: A Dual-Stream Voice Anonymization Attacker with Staged Training | 8.0/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #说话人验证 |
| 31 | 先数人再转写:用约束探索把重叠语音的幻觉压回去 | Beyond Mimicry: Constrained Exploration with GRPO for Joint Multi-Talker ASR and Diarization under Unknown Speaker Counts | 8.0/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音识别 |
| 32 | 流行之外唱不准:MMGenre 用可复现流水线诊断歌声合成的流派塌缩 | MMGenre: Benchmarking Singing Voice Synthesis across Multiple Musical Genres | 8.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #歌唱生成 |
| 33 | 把校正后的音素铺回每一帧:TAP-ETS 为何强调帧级时间对齐 | TAP-ETS: Time Aligned Phoneme Guiding for EMG-to-Speech Synthesis | 8.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #静默语音接口 |
| 34 | 在线试错补上离线偏好的缺口:Resonate 用大音频语言模型做奖励训流匹配 | Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models | 8.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音频生成 |
| 35 | 混合域批次下单高斯不够用:用 GMM 刻画偶然风格不确定性做反欺骗域泛化 | Aleatoric Style Uncertainty Augmentation with GMM for Domain Generalization in Anti-spoofing | 8.0/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.9/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音伪造检测 |
| 36 | 只看答对不够:用实例级细则逼音频推理说出每一步依据 | The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents | 8.0/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #音频问答 |
| 37 | 把余弦相似装进贝叶斯聚类:SphereVBx 如何简化 EEND-VC 的第二阶段 | SphereVBx: Spherical Variational Bayes Clustering for Simplified EEND-VC Diarization | 8.0/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #说话人分离标注 |
| 38 | 重叠多反而伤分离:合成对话数据为何对识别与日志任务给出相反配方 | Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization | 8.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #语音识别 |
| 39 | 试次内高分靠捷径:两阶段训练切断脑电试次标识再做目标语音提取 | Breaking Shortcut Learning for Cross-Trial EEG-Guided Target Speech Extraction via Two-Stage Training | 8.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前25% | 方法研究 | #目标说话人提取 |
| 40 | 带着参考学、丢掉参考用:RAT 把参考通道训练成不变性 | RAT: Reference-Augmented Training for ASV Anti-Spoofing | 8.0/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音伪造检测 |
| 41 | 只给文字也能适配语音识别:用多视角去噪留住语音与文本的对齐 | Avoiding Catastrophic Forgetting in Text-Only Adaptation of LLM-based ASR via Multi-View Text Denoising | 7.9/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音识别 |
| 42 | 跨语种情绪为何在中间层最通用:49 层逐层探测揭示的 CRIS 层与类型学轮廓 | TIMBRE: Layer-Wise Cross-Lingual Speech Emotion Recognition Across 49 Layers and 26 Corpora | 7.9/10 · 创新 1.4/2 · 技术严谨 1.3/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前25% | 方法研究 | #语音情感识别 |
| 43 | 单声道加单镜头怎么做多人轮替预测:MuVAP 用角色相对投影锚定说话人 | MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the wild | 7.9/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #轮次切换 |
| 44 | 内容是剩下的东西:用平行话语逼出不变的语音内容标记 | Content is What Remains: Invariant Speech Tokenization from Parallel Utterances | 7.9/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音编码 |
| 45 | 不听原声也能量房间:用混响语音重建反推长房间脉冲响应 | Blind Room Impulse Response Identification via Reverberant Speech Spectrum Reconstruction | 7.9/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #房间脉冲响应估计 |
| 46 | 商用 API 伪造与研究基准脱节时,用多源数据加局部注意力补上泛化缺口 | MultiAPI Spoof: A Multi-API Dataset and Local-Attention Network for Speech Anti-spoofing Detection | 7.9/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #语音伪造检测 |
| 47 | 早期要保树形结构、晚期要做平均:双几何门控如何分时聚合参考 RIR | Dual-Geometry Manifolds for Few-shot RIR Prediction | 7.8/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #房间脉冲响应估计 |
| 48 | 俄语语音缺的不是时长,而是可复述的韵律标注:Balalaika 如何把 5 千小时做成可用训练集 | Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech | 7.8/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #文本到语音 |
| 49 | 低帧率下既要听得清又要懂意思:OmniCodec 用理解模型编码器拆开语义与声音 | OmniCodec: Low Frame Rate Universal Audio Codec with Semantic–Acoustic Disentanglement | 7.8/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 模型报告 | #音频编码 |
| 50 | 不对抗语音下练出抗屈折变化的语音翻译:跨模态鲁棒性迁移如何成立 | Cross-Modal Robustness Transfer (CMRT): Training Robust Speech Translation Models Using Adversarial Text | 7.8/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音翻译 |
| 51 | 头部语言占九成时长时,如何让哈萨克语们被听见:GigaAM 的簇级配比与领域配比 | GigaAM Multilingual: Foundation Model for Underrepresented Languages | 7.8/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 模型报告 | #语音识别 |
| 52 | 小参数做音频问答:Samsone 用裁剪与数据配比换端侧可用性 | Samsone: A Family of Open Small Audio Language Models for On-Device Inference | 7.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 模型报告 | #音频问答 |
| 53 | 高维保真反而难读准:用语义对齐把隐表示拉回可读结构 | Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis | 7.8/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #文本到语音 |
| 54 | 不训练编码器也能切音节:ZeroSyl 用冻结特征范数做语音分词 | ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling | 7.8/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #口语理解 |
| 55 | 语音能验身份,笑声咳嗽就不行:用条件蒸馏保住语音,再用专家分流学会非言语声 | Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach | 7.8/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #说话人验证 |
| 56 | 时间对齐与语义对齐为何必须分开考:AV-SyncBench 的解耦评测 | AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization | 7.8/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #音视频理解 |
| 57 | 标签极少时如何估计构音障碍严重度:伪标签加粗粒度对比学习的跨域路线 | Something from Nothing: Data Augmentation for Robust Severity Level Estimation of Dysarthric Speech | 7.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #病理语音评估 |
| 58 | 没有句子级语料时,用单词级短语音加长语音强制对齐启动濒危语言识别 | Bootstrapping Endangered Language ASR with Short-Form Corpora | 7.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #语音识别 |
| 59 | 通用音素识别的经验配方:自监督表示、多语言数据与自条件 CTC 如何分工 | An Empirical Recipe for Universal Phone Recognition | 7.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前25% | 模型报告 | #语音识别 |
| 60 | 弹性时间:用可预测性决定音频潜在帧的去留 | Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding | 7.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音频编码 |
| 61 | 别只听一句话:给目标话语前后各留 10 秒上下文来判别对儿童说话 | Context-aware child-directed speech detection from long-form recordings | 7.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音属性识别 |
| 62 | 把嵌出在球面换到单纯形:用几何约束关闭模态间隙 | Closing the Modality Gap via Simplex-Constrained Representations | 7.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前25% | 方法研究 | #音频检索 |
| 63 | 只听自然度不够:用成对比较逼出裁判模型在副语言细节上的校准失败 | ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge | 7.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #语音属性识别 |
| 64 | 网络学会算互功率却绕开白化:TDOA 估计的跨架构探测 | What Do Neural Networks Learn for TDOA Estimation? A Cross-Architecture Probing Study | 7.7/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前25% | 方法研究 | #声源定位 |
| 65 | 不重建干净语音:用混合一致性把说话人线索和噪声分开 | Mixture Consistency Learning for Robust Speaker Verification in Noisy Environments | 7.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #说话人验证 |
| 66 | 不听也能答:视频基准的视觉捷径与 25 倍音频压缩的补救 | Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy | 7.7/10 · 创新 1.6/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.5/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #音视频问答 |
| 67 | 自发语音为何难转写:Tarsila-ASR 用 72 小时多域数据逼出模型的域失配 | Tarsila-ASR: A Multi-Domain Test Suite for Benchmarking Brazilian Portuguese Speech Recognition | 7.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.5/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #语音识别 |
| 68 | 把音节切准又切省:findsylls 用可互换的包络与切分器统一音节级分词 | findsylls: A Language‑Agnostic Toolkit for Syllable‑Level Speech Tokenization and Embedding | 7.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 系统技术报告 | #音频事件检测 |
| 69 | 说 same 话却判不同:语音与语言切换如何打散视觉 grounding 的三元组一致性 | Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models | 7.7/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 1.0/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #音视频问答 |
| 70 | 在野外还没解决:UniTalk 用三类难度重测主动说话人检测 | Revisiting Active Speaker Detection: An In-the-Wild Benchmark for Generalization and Robustness | 7.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #说话人分离标注 |
| 71 | 罗马尼亚语逆文本规范化:规则精度与大模型泛化的取舍 | Inverse Text Normalization in Romanian: A Comparative Study of Rule-Based, Neural, and Large Language Model Approaches | 7.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.5/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #语音识别 |
| 72 | 不用并行编码器:用语音活动与谐波线索调制瓶颈的轻量多模态增强 | Real-Time Speech Enhancement on Edge Devices Guided by Harmonic and Voice-Activity Cues Utilizing Skin-Attachable Accelerometer | 7.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #语音增强 |
| 73 | 把逐毫秒的塞音切分交给帧分类:wav2VOT 如何同时估计 VOT、闭塞与弱化 | wav2VOT: automatic estimation of voice onset time, closure duration, and burst realisation with wav2vec2 | 7.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 应用研究 | #语音属性识别 |
| 74 | 谁在何时说了什么:重叠与语义双重视角下的会话语音识别评测 | Who Spoke What When? Evaluating Spoken Language Models for Conversational ASR with Semantic and Overlap-Aware Metrics | 7.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音识别 |
| 75 | 把重叠语音当成交错序列:用洗牌积统一对齐与多人转写 | Modeling Overlapped Speech with Shuffles | 7.7/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前25% | 方法研究 | #语音识别 |
| 76 | 词对了还不够:非言语发声的可控性为何与语音质量脱钩 | NVV-SuperBench: Beyond Words, Beyond Quality—Benchmarking Nonverbal Vocalizations in Speech Generation | 7.7/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #语音合成 |
| 77 | 不用贴脸电极的眼镜,能读懂无声说话的开放词汇吗 | SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces | 7.7/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #静默语音接口 |
| 78 | 搬走家具后混响变了:用编辑前实测与均匀材质代理更新房间脉冲响应 | Echoes after Edits: Room Impulse Response Estimation for Geometry Update | 7.6/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #房间脉冲响应估计 |
| 79 | 换了语言就换了破绽:66 种语言下伪造语音检测为何不再可靠 | When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus | 7.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #语音伪造检测 |
| 80 | 多域语音识别不想反复重训:用模型合并拼出一个模型,代价是跨语言鲁棒性 | Exploring the potential and limitations of Model Merging for Multi-Domain Adaptation in ASR | 7.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音识别 |
| 81 | 先修共振峰再合成:用显式元音矫正平衡可懂度与说话人保持 | Formant-Guided Speech Repair for Enhanced Comprehension of Dysarthric Speech | 7.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #音频修复 |
| 82 | 心音也能被神经编解码器伪造:从 CARDIOFAKE 基准到谱与自监督特征的互补融合 | Towards Detecting Neural Audio Codec Synthesized Heart Sounds | 7.6/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #音频深度伪造检测 |
| 83 | 不先认音素,直接认发音特征:PhonoQ-2.0 为何在跨语料与未见语言上更稳 | Multilingual Phonological Feature Recognition with Self-Supervised Speech Models | 7.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音属性识别 |
| 84 | 一直在线的对话大模型记住了谁在说话:全双工语音对话中的说话人泄露与流式匿名化 | Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models | 7.6/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #说话人匿名化 |
| 85 | 单码本同时建模语义与声学:WavSLM 的蒸馏与分块自回归 | WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation | 7.6/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.5/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音合成 |
| 86 | 特定场景缺标注数据时,如何把网络长音频变成可训练的分类数据:TriA 四步流水线 | TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios | 7.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 数据集与基准 | #音频分类 |
| 87 | 不用进消声室:用仿真 HRTF 反推个人参数再切换到真实域 | HRTF Personalization via Sim-to-Real Neural Field | 7.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前25% | 方法研究 | #空间音频渲染 |
| 88 | 合成语音问答能否把语音语言模型带到二十三种语言 | Turning Speech Language Models into Multilingual Listeners | 7.6/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前25% | 数据集与基准 | #音频问答 |
| 89 | 小数据微调为何越调越偏:纯 GRPO 能否保住域外检测能力 | Does Fine-tuning by Reinforcement Learning Improve Generalization in Binary Speech Deepfake Detection? | 7.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前25% | 方法研究 | #音频深度伪造检测 |
| 90 | 从单段分类到多部位问答:AuscuTSLM 如何把听诊声接到冻结大模型上 | AuscuTSLM: Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings | 7.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音频问答 |
| 91 | 真伪判定的神经元依据能被拆开算账吗:证据子空间投影的量化解读 | Evidence Subspace Projection: Measuring How Much Evidence Explains Deepfake Detection in Self-Supervised Speech Models | 7.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前25% | 方法研究 | #音频深度伪造检测 |
| 92 | 缺配对文本卡住民乐生成:CTMusic 用 741 对标注与两阶段微调补上独奏到合奏 | CTMusic: A Traditional Chinese Instrumental Music Dataset Towards Text-to-Music Generation | 7.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #音乐生成 |
| 93 | 早期帕金森语音检测为何难比较:用固定划分与多维度评估建立可复现基准 | A Benchmark for Early-stage Parkinson’s Disease Detection from Speech | 7.6/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #病理语音评估 |
| 94 | 把同一词的不同发音切成同一串记号:wav2tok 2.0 的分阶段显式对齐 | wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval | 7.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音频检索 |
| 95 | 在儿童佩戴录音里分清谁在说话:用儿童中心数据预训练的 BabyHuBERT | BabyHuBERT: Multilingual Self-Supervised Learning for Segmenting Speakers in Child-Centered Long-Form Recordings | 7.5/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前25% | 模型报告 | #说话人分离标注 |
| 96 | 把一步生成放在压缩隐空间:语义 Token 到波形如何又快又稳 | One-Step Token-to-Waveform Generation with MeanFlow in Latent Space | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音合成 |
| 97 | 不只给真假标签:让人来教模型说出伪造在哪里 | Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #音频深度伪造检测 |
| 98 | 深层说话人线索被稀释时,如何让专家选对人:GLAD 的全局局部动态路由 | GLAD: Global-Local Aware Dynamic Mixture-of-Experts for Multi-Talker ASR | 7.5/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前25% | 方法研究 | #语音识别 |
| 99 | 开放式助听器漏声难除:先用波束粗增强再让轻量网络同时抵消与修复 | ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids | 7.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音增强 |
| 100 | 在不训练的条件下把修改锁在时间片段里:FreeSonic 的时间感知解耦编辑 | FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing | 7.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.9/1 · 影响力 1.2/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音频生成 |
| 101 | 说什么和怎么说都要看:Whisper 声学与大模型语言特征的门控融合 | Listening Between the Lines: Joint Learning of ASR Embeddings and LLM-Augmented Linguistics for Dementia Detection | 7.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #病理语音评估 |
| 102 | 去混响 U-Net 中间层为何按房间聚类:从隐式房间编码到显式条件注入 | Your U-Net Dereverberation Model is Secretly an RIR Encoder | 7.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #去混响 |
| 103 | 留住跨模态共有通道:面向气导骨导融合的 CCAP 结构化剪枝 | Cross-Modal Consistency-Aware Structured Pruning for Efficient Speech Enhancement with Air- and Bone-Conduction Microphones | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音增强 |
| 104 | 在编码器嵌入里同时去噪与识噪:FocalSE 的聚焦掩码与噪声分离 | Noisy Environment Adaptation of Neural Speech Codec via Focal Mask and Noise Feature Separation | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音增强 |
| 105 | 不猜语义、先守住谐波:HFMSE 用显式结构先验约束流匹配生成 | HFMSE: Harmonic-Guided Speech Enhancement with Flow Matching | 7.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音增强 |
| 106 | 不靠闭源模型抄答案:用同一模型自己生成推理过程的 Audio-Cogito | Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models | 7.5/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前25% | 模型报告 | #音频问答 |
| 107 | 先洗掉风格再重上风格:StyleStream 如何做实时零样本音色口音情感转换 | StyleStream: Real-Time Zero-Shot Voice Style Conversion | 7.5/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 系统技术报告 | #语音转换 |
| 108 | 缺模态又有噪声时,如何先学好可迁移的情绪表示再做分类 | MultiEmoVec: Learning Generalised Multimodal Emotion Representation by Momentum Contrast and Multi-task Reconstruction | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音情感识别 |
| 109 | 只给整句标签也要切出情绪起止:非对称原型度量如何压住中性背景 | P-SED : Asymmetric Prototype Metric Learning for Weakly Supervised Speech Emotion Diarization | 7.5/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前25% | 方法研究 | #语音情感识别 |
| 110 | 直接读文本的语音大模型,为什么总读错多音字 | PolyBench: Benchmarking LLM-based TTS Systems for Chinese Polyphone Disambiguation | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #文本到语音 |
| 111 | 从听懂一句话到调对一串接口:Audio2Tool 如何逼出语音工具调用的真短板 | Audio2Tool: Speak, Call, Act - A Dataset for Benchmarking Speech Tool Use | 7.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #口语意图与槽位识别 |
| 112 | 用冻结 CTC 编码器做草稿:语音大模型的自投机解码如何同时加速与纠偏 | Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts | 7.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #语音识别 |
| 113 | 给音频加刻度再做强化:TimePro-RL 如何让大音频语言模型卡准起止时间 | Towards Fine-Grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt | 7.5/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #音频事件检测 |
| 114 | 预训练量大也不灵:库拉尔枢纽揭示语音情感识别的类型学边界 | KuralHub: Exposing Typological Capability Frontiers in Multilingual Speech Emotion Recognition | 7.5/10 · 创新 1.3/2 · 技术严谨 0.9/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前25% | 数据集与基准 | #语音情感识别 |
| 115 | 从混合梅尔谱直达干净梅尔谱:AV-FlowSep 如何用一步流匹配做视听目标说话人分离 | AV-FlowSep: Audio-Visual Target Speaker Separation via Flow Matching | 7.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音视频语音分离 |
| 116 | 先理解再预测:把掩码预测拆成两步能否保留离散目标又提升通用音频迁移 | BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #音频分类 |
| 117 | 强基座不容覆盖:用稀疏贝叶斯适配把合成语码切换知识接进来 | Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音识别 |
| 118 | 绝对打分与两两偏好为何要放在一个语音质量模型里学 | URGENT-MOS: Unified Multi-Metric and Preference Learning for Robust Speech Quality Assessment | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音质量评估 |
| 119 | 角色提示当弱标签:StanceBench 如何把人际立场变成可测的语音评测 | StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #语音属性识别 |
| 120 | 不用聚类标签也能对上声脸:GMOD 以全局图挖潜正样本再做正交解耦 | GMOD: Voice-Face Association Learning via Graph Mining and Orthogonal Disentanglement | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前25% | 方法研究 | #音频检索 |
| 121 | 不用逐层试错:让自监督目标自己选出 Whisper 适配层 | Gumbel-BEARD: Automatic Layer Selection for Self-Supervised Adaptation of Whisper in Low-Resource Domains | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音识别 |
| 122 | 不只判真假:FakeSound2 用定位、可追溯与泛化诊断声音伪造检测 | FakeSound2: A Benchmark for Explainable, Traceable, and Generalizable Deepfake Sound Detection | 7.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #音频深度伪造检测 |
| 123 | 用线性可逆变换把音色压掉:通用语音内容因子化的开集做法 | Universal Speech Content Factorization | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前25% | 方法研究 | #语音转换 |
| 124 | 固定随机量化不够用时:用在线投影与蒸馏修伪标签 | Enhancing BEST-RQ Pseudo-Label Quality Through Online Refinement for Automatic Speech Recognition | 7.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音识别 |
| 125 | 用四元数耦合幅度与相位:QC-GAN 如何在 0.89M 参数下逼近全尺寸 Conformer 增强质量 | QC-GAN: A Parameter-Efficient Quaternion Conformer GAN for High-Fidelity Speech Enhancement | 7.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音增强 |
| 126 | 5 Hz 还能保真吗:U-Codec 用长依赖与深残差量化换取三倍合成速度 | U-Codec: Neural Speech Codec under Extreme Temporal Compression for Fast High-Fidelity Speech Generation | 7.5/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前25% | 方法研究 | #语音编码 |
| 127 | 从成品语音反推后期链:VoxEffects 把六种效果的开关、预设与强度做成可核对监督 | VoxEffects: A Speech-Oriented Audio Effects Dataset and Benchmark | 7.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 数据集与基准 | #音频分类 |
| 128 | 去掉时间步还能增强语音吗:自洽整流流如何只看当前位置推断去噪方向 | Time-Unconditional Generative Speech Enhancement via Autonomous Rectified Flow | 7.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前25% | 方法研究 | #语音增强 |
| 129 | 标签有噪声时让语音编辑站稳:RIVET 用幂等约束压住漂移 | RIVET: Robust Idempotent Voice Attribute Editing | 7.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #语音编辑 |
| 130 | 自然语音也会幻觉:HALAS 用 3611 段财报电话揭示七个主流 ASR 的真实错误 | HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems | 7.4/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 131 | 推理越长反而越不听音频:用结论语义把模型拉回声音 | Enhancing Audio Reasoning via Semantic Summary Prediction | 7.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频问答 |
| 132 | 为南阿塞拜疆语建可用的语音识别:社区录音、转写外来语音与难例评测如何分工 | Preserving the Iranian Turkic Language: Community-Driven ASR Datasets and Benchmarking for South Azerbaijani | 7.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 133 | 一步转换很快,但内容编码器很慢:MeanVoiceFlow2 把两者一起蒸馏重训 | MeanVoiceFlow2: Joint Optimization of Mean Flow and Content Encoder for Fast One-Step Zero-Shot Voice Conversion | 7.4/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 方法研究 | #语音转换 |
| 134 | 把野外农事对话变成可用语料:模型先改、人类分三层把关 | VāṇīSetu: A Human-AI Collaborative Framework for Scalable Conversational Speech Corpus Creation in Low-Resource Settings | 7.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 135 | 内容—结构—流程三视角加门控融合:用图注意力捕捉阿尔茨海默病话语逻辑偏离 | Gated Multi-graph Fusion via Graph Attention Networks for Alzheimer’s Disease Detection | 7.4/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 136 | 声音既是数据又是身份:为什么一次签字管不住合成语音的后用 | Rethinking Consent Acquisition for Voice Synthesis: from Static to Dynamic Consent | 7.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.5/1.5 · 可复现 0.5/0.5 · 工程/实践 0.7/1.5 | 前50% | 理论研究 | #语音克隆 |
| 137 | 在解耦表示上加噪声:用说话人差分隐私把匿名从经验分变成可证明下界 | DP-VOXLET: Provable Speaker Anonymization for Disentangled Speech Representations | 7.4/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 138 | 分数相似不等于听到的东西相同:三个 WavLM 检测器各自盯住了哪段声音 | What Do Deepfake Speech Detectors Actually Hear? | 7.4/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 139 | 把转写风格当作可控开关:用词级时间激活逐字转写 | Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing | 7.4/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 140 | 用稳定的到来方向代替说话人注册:在长会议中直接抽出目标语音 | Position-Aware Target Speaker Extraction for Long-Form Multi-Party Conversations: A Diarization-Free Framework for ASR | 7.4/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 141 | 先保住小声说话,再统一音量:SE-AGCNet 把增强与增益放进一次联合优化 | SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios | 7.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 142 | 标准注意力最准、高效注意力更快:语音情感识别中的精度与扩展性权衡 | How Attention Shapes Emotion: A Comparative Study of Attention Mechanisms for Speech Emotion Recognition | 7.3/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 143 | 台语紧急意图为何难做:用戏剧字幕挖数据,再回到老人真实现场检验 | TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset with Scalable Data Mining In-the-Wild | 7.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #口语意图与槽位识别 |
| 144 | 百万小时立体声如何爬来:YODAS v3 的语言均衡与真带宽验证 | YODAS v3: Over 1 Million Hours of High-Bandwidth, Stereophonic, Multilingual Speech | 7.3/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.3/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 145 | 相位还是纹理:双耳掩蔽释放检验空间音频基础模型的相位编码 | Spectro-Temporal Interference Confounds Phase Encoding in Spatial Audio Foundation Models | 7.3/10 · 创新 1.6/2 · 技术严谨 1.3/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #声源定位 |
| 146 | 只调文本不够:用三段式声学调制补上音频编码器的少样本适配 | Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models | 7.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 147 | 背景音太多时关键词为何被淹没:拆开熵目标再做适应的 ImKWS | ImKWS: Test-Time Adaptation for Keyword Spotting with Class Imbalance | 7.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #关键词检测 |
| 148 | 平均安全不等于人人安全:近五千说话人的重识别风险为何随攻击者与匿名器而变 | A Large-Scale Per-Speaker Analysis of Re-identification Risk in Speech Anonymization | 7.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 149 | 把大模型放进搜索中途:LightBeam 以 10 GB 内存重做 CTC 解码 | Lightbeam: An Accurate and Memory-Efficient CTC Decoder for Speech Neuroprostheses | 7.3/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 方法研究 | #言语神经解码 |
| 150 | 跨被试听觉注意解码为何难泛化:DisenEEG-Net 用正交分解与信息瓶颈拆开任务与被试特征 | DisenEEG-Net: Disentangling EEG features via sufficient information bottleneck and adversarial learning for cross-subject auditory attention detection | 7.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #言语神经解码 |
| 151 | 词中塞音为何变弱:用强度曲线的函数主成分统一度量九种语言的延续弱化 | Cross-linguistic word-medial stop lenition: A Functional PCA approach | 7.3/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 152 | 先抓语义再补声音:GenTSE 用两段生成缓解自回归提取的错位 | GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model | 7.3/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 153 | 同一段语音换一句要求就换答案:INSPIRE 把检索从相似度改为听指令 | INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval | 7.3/10 · 创新 1.6/2 · 技术严谨 1.3/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频检索 |
| 154 | 把多人混叠压成师生二元标签:用未标注课堂音频做域适应的教师-学生 diarization | Role-Aware Semi-Supervised Domain Adaptation for Teacher-Student Speaker Diarization | 7.3/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 155 | 听不清就别硬猜:用想象出参照、用抽取出干净信号再判 | RAISE: Resolving Ambiguity in Audio Understanding with Imagination and Selective Extraction | 7.3/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频问答 |
| 156 | 多意图车舱语音理解为何难测:MAC-SLU 用真实指令与统一评测拉开上下文学习和微调的差距 | MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark | 7.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #口语意图与槽位识别 |
| 157 | 老年语音为何让编解码器伪造检测失效:多模态表示与分布对齐的补位 | Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake | 7.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频深度伪造检测 |
| 158 | 克隆声音时,抑郁和情绪的信号还剩多少:复述式克隆的保留与跨语言增广 | Synthetic Speech, Real Signal: Paralinguistic Preservation and Cross-Lingual Augmentation via Voice Cloning | 7.3/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 159 | 连续扩散语音语言模型仍沿幂律走:损失可预测,语言性可测,长连贯仍缺席 | Scaling Properties of Continuous Diffusion Spoken Language Models | 7.3/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音合成 |
| 160 | 角色对不上、坏片段没人管:AuDirector 用选角加审片闭环做长音频故事 | AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling | 7.3/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #音频生成 |
| 161 | 短句训练的注意力解码器为何在长音频上失序:边界线索、位置编码与长编码训练 | Segmental Attention Decoding With Long Form Acoustic Encodings | 7.3/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 162 | 英语大模型做印度语语音:直接微调为何胜过继续混入英语 | IN-F5: Adapting an English TTS Foundation Model for Multilingual and Zero-Resource Indian Speech Synthesis | 7.3/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 模型报告 | #文本到语音 |
| 163 | 说话人线索混进来源证据时,如何把二者拆开再做验证 | Disentangling Speaker Traits for Deepfake Source Verification via Chebyshev Polynomial and Riemannian Metric Learning | 7.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频指纹 |
| 164 | 只用一句 Hi Pandora 做注册:唤醒词目标语音抽取为何听感上去了识别却掉下来 | Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios | 7.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #目标说话人提取 |
| 165 | 并行解码不丢精度:掩码扩散如何重做语音识别的解码器 | MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding | 7.3/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 166 | 切断声学捷径又拉直轨迹:统一引导如何让流匹配又快又不串音 | Enhancing Flow Matching with A Unified Guidance Framework for Efficient and Robust Speech Synthesis | 7.3/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 方法研究 | #语音转换 |
| 167 | 整句标签太粗、逐帧标签太吵:用子模型投票把语音切成可信与存疑两段再学 | Conflict-Aware Pseudo-Labeling via Acoustic Signals for Multi-Task Speech Emotion Recognition | 7.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 168 | 不追踪伪造,只锚定真实:DASM 用真实流形偏差做音乐深伪检测 | DASM: Detecting AI-Synthetic Music via Authentic Manifold Deviation Modeling | 7.3/10 · 创新 1.6/2 · 技术严谨 1.3/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 169 | 先排好序再蒸馏:让音频大模型直接听懂该留哪对语音翻译数据 | Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data | 7.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音翻译 |
| 170 | 先分大类再认小人:用全局-局部分层分类给大模型补说话人判别力 | Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition | 7.2/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 171 | 不用重训长文本:以软先验与跨句状态把短句语音模型连成连贯长语音 | MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data | 7.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 172 | 在编解码离散码上做吸收式扩散:ADDSE 为何敢用很少步数增强 | Absorbing Discrete Diffusion for Speech Enhancement | 7.2/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 173 | 名单太长塞不进提示词:COALA 先打分过滤再识别多罕见词 | COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation | 7.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 174 | 低信噪比毫米波雷达语音重建:先学会补高频,再学会抗噪声 | mmWave Radar Aware Dual-Conditioned GAN for Speech Reconstruction of Signals With Low SNR | 7.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音超分 |
| 175 | 统一工具链之下,谁在决定音频深伪检测的成败:前端、后端还是训练数据 | DeepFense: A Unified, Modular, and Extensible Framework for Robust Audio Deepfake Detection | 7.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 系统技术报告 | #音频深度伪造检测 |
| 176 | 笑声是谁的?SA-UAED 把说话人、笑咳与背景声一起按帧分开 | SA-UAED: Joint Frame-Level Detection of Audio Events, Speaker Activities, and Speaker-Attributed Paralinguistic Events | 7.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 177 | 超低码率先保说什么:用内容上下文引导重建的 ContextCodec | ContextCodec: Content-Focused Context Guidance for Ultra-Low Bitrate Speech Coding | 7.2/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音编码 |
| 178 | 冻住两端编解码器,只在潜变量之间架桥:BridgeCodec 的低码率跨器互通 | BridgeCodec: Mamba Enhanced Neural Audio Codec with Schrödinger Bridge at Low Bitrate | 7.2/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频编码 |
| 179 | 不等看完就判决:用第一个输出脉冲做分类的早退脉冲网络 | First-to-Spike: An Early-Exit Framework for Rapid and Energy-Efficient Spiking Neural Networks | 7.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #关键词检测 |
| 180 | 小块也稳、低延迟可播:MeanVC 2 用有限未来看与全局音色令牌改造流式转换 | MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion | 7.2/10 · 创新 1.4/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.5/1.5 · 可复现 0.1/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #语音转换 |
| 181 | 只看正中矢状面影像,能否同时保住说什么、像谁说和怎么起伏 | Speaker-Independent Speech Synthesis from Real-time MRI Articulatory Data | 7.2/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.9/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #静默语音接口 |
| 182 | 一起说话时向谁靠拢:多维韵律突显线索的趋同轮廓 | What Happens When We Speak Together? Multidimensional Convergence in Face-to-Face Interaction | 7.2/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 183 | 只给 10 小时新语言语音,能否找回音位表:DiscoPhon 的双轨评测 | DiscoPhon: Benchmarking the Unsupervised Discovery of Phoneme Inventories With Discrete Speech Units | 7.2/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.5/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 184 | 干目标加流匹配:StuPASE 如何在不编造内容的前提下做干净语音 | StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement | 7.2/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 185 | 先给部分分再收紧:随模型成熟度渐进收紧的弱监督 | Progressive Weak Supervision for Speech Emotion Recognition | 7.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 186 | 数据极少时如何让口语评分又分专家又学得快:混合专家与元学习的组合 | Adaptive Multimodal Expert Specialization by Meta-Learning for Spoken English Assessment | 7.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 187 | 训练只听语音、推理只看脸:双空间约束如何稳住看脸合成的音色 | Dual-Space Constrained Face-Based Zero-Shot Text-to-Speech Synthesis | 7.2/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 188 | 多视角训练、单视角可用:用乘法融合把侧脸唇动变成正面提取的增益 | Multi-View Based Audio Visual Target Speaker Extraction | 7.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 189 | 线索可缺可组:WeSep 把目标说话人提取改写为异构线索条件学习 | WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction | 7.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #目标说话人提取 |
| 190 | 不做强制对齐:用音素识别的不确定性做可解释的构音障碍评估 | Phoneme Error and Uncertainty Features for Interpretable Dysarthric Speech Assessment | 7.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 191 | 以自发语音为主:WazobiaSpeech 如何把四种尼日利亚语言的真实变异装进可评测语料 | WazobiaSpeech: A Large-Scale Multilingual Speech Corpus for Robust and Fair ASR in Four Nigerian Languages | 7.1/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 192 | 数据不在多而在对:用三种嵌入从 10 万小时里挑出 5% 训练专才语音识别 | Which Data Matter? Embedding-Based Data Selection for Speech Recognition | 7.1/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 193 | 语言偏斜下只聚合投影器:联邦语音大模型何时逼近集中式识别 | Fed-SpeechLLM: Federated Learning Speech Language Models for Multilingual ASR | 7.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 194 | 一个参数两套解码:用块限制与一致性约束缩小离线-流式差距 | Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization | 7.1/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 195 | 说不要却照做:文本到音频生成的否定失效与百万级否定基准 | Negation in Audio Generation Models | 7.1/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频生成 |
| 196 | 同时纠正太容易的音频和太严格的转写:Vimarsha 如何重测印度二十二种语言识别 | Vimarsha: Faithful ASR Evaluation for Indian Languages with Demographic Diversity, In-the-Wild Audio and Spelling Variations | 7.1/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 197 | 句子可预测时,语音细节为何不再左右词汇竞争 | From Words to Sentences: Contextual Predictability Overrides Phonetic Ambiguity in Lexical Competition | 7.1/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.4/0.5 · 工程/实践 0.5/1.5 | 前50% | 理论研究 | #语音识别 |
| 198 | 因果受限下做增强:RT-SEMamba 用固定状态流式推理再把 8 层蒸馏进 1 层 | RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation | 7.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 199 | 一个提示多种声音:OTAFlow 用分布对齐与条件流建模跨模态风格 | Bridging the Gap: A Hierarchical Framework for Cross-Modal Style Modeling in Expressive TTS | 7.1/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #文本到语音 |
| 200 | 驱动脸动的究竟是音色还是音位:四类语音表示的对照与统一视听合成 | From Tokens to Faces: Investigating Discrete Speech Representations for 3D Facial Animation | 7.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音视频生成 |
| 201 | 先隔离再融合:SeRIn 把单模态精炼与跨模态混合拆成两步 | Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis | 7.1/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 202 | 不加模块也能更稳:用更少的图节点做语音防伪 | SpAArSIST: Sparsified AASIST for Efficient and Reliable Anti-Spoofing | 7.1/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音伪造检测 |
| 203 | 高分不等于听见:文本先验与局部音频线索如何抬高音频语言评测 | All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation | 7.1/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频问答 |
| 204 | 提示学得越好,新类忘得越多:ZEBRA 用零样本锚定拉回泛化 | ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models | 7.1/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #音频分类 |
| 205 | 口音面前编解码与克隆语音还能保真吗:CodecMOS-Accent 的重合成与跨口音主观基准 | CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents | 7.1/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 数据集与基准 | #语音质量评估 |
| 206 | 匿名也要可控:用条件 WGAN 与分类器引导扩散生成性别可控的伪说话人向量 | Controlled Generation of Synthetic Speaker Vectors for Voice Anonymization | 7.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 207 | 从全局相似到逐事件核验:用音频大模型的细粒度反馈教文本音频跟指令 | Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models | 7.1/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频生成 |
| 208 | 4 毫秒做判决:QuadVAD 如何把边界精度、噪声鲁棒和 25 KB 共存 | QuadVAD: Fine-Grained Speech Detection with a Compact Architecture | 7.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.4/1.5 | 前50% | 方法研究 | #语音活动检测 |
| 209 | 语音 token 太多太冗余:用相似度自适应合并保住内容 | AdaTS: Adaptive Token Sampling for Efficient Speech Language Models | 7.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 210 | 一个主干加七个轻量适配器:在不换整机模型的条件下切换语音增强的前视时长 | Latency Controllable Speech Enhancement | 7.1/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 211 | 儿童长时录音建不出可比基准:用统一结构、基准管线与分级治理一起解 | Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities | 7.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 数据集与基准 | #说话人分离标注 |
| 212 | 同时测抑郁和焦虑的德语语音:GADVOX 如何把众包自由言说变成可回归的严重度标签 | GADVOX: The German Anxiety and Depression Voice Examination Dataset | 7.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #病理语音评估 |
| 213 | 从随机攒句子到覆盖全部音素:corpusgen 如何把语料设计变成可计算的选择题 | corpusgen: An Open-Source Toolkit for Phoneme-Coverage-Optimized Speech Corpus Design Across Languages | 7.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.5/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #文本到语音 |
| 214 | 听不清、记不住、串证据:VISA 用看得见的声学线索稳住音频推理 | VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track | 7.1/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 系统技术报告 | #音频问答 |
| 215 | 从散架到锁死:Whisper 幻觉随规模发生的谱相变 | From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales | 7.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 1.5/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 理论研究 | #语音识别 |
| 216 | 把重活交给解码器:ZipCodec 用 4.4M 编码器做单阶段语音分词 | ZipCodec: Simple and Pretrained-Model-Free Speech Tokenizer via Flow-Matching | 7.1/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 217 | 推理越长反而越差:把声音当成文字来想的陷阱 | Step-Audio-R1: Why Audio LLMs Fail at Reasoning — The Trap of Textual Surrogates | 7.1/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 模型报告 | #音频问答 |
| 218 | 文字说很好、声音却在讽刺时:让音频语言模型先解耦再做四步共情推理 | Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models | 7.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 219 | 音频太长反而碍事:用自适应压缩让双模态音乐情绪识别更准 | Less is More: Boosting Bimodal Music Emotion Recognition with Adaptive Audio Sequence Compression | 7.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 220 | 不用干净人声也能学分离:只靠说话人身份做监督 | Speaker Identity as Sole Supervision for Speech Separation | 7.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音分离 |
| 221 | TurnGuide:按轮次先写文本再说语音的全双工对话建模 | TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #全双工语音交互 |
| 222 | 谁的声音算数:自动语音识别里的语言政策与三害审计 | Decolonizing Linguistic Policies in Automatic Speech Recognition: A Framework for Cross-Culturally Competent Speech AI | 7.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.3/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.5/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 理论研究 | #语音识别 |
| 223 | 去掉语言干扰再认人:正交投影与流形约束 PLDA 的跨语言说话人确认 | Orthogonal Feature Projection and Manifold-Constrained Neural PLDA for the TidyVoice2026 Cross-Lingual Speaker Verification Challenge | 7.0/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 系统技术报告 | #说话人验证 |
| 224 | 先学容易方向再反哺困难方向:WhispEar 用伪平行耳语扩大耳语转正常语音 | WhispEar: A Bidirectional Framework for Scaling Whispered Speech Conversion via Pseudo-Parallel Whisper Generation | 7.0/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #语音转换 |
| 225 | 不从头学生成器,只学对齐时长:LipAdapter 用文本到视频对齐改造冻结 TTS | LipAdapter: Text-to-Video Alignment is All You Need for Lip-to-Speech | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #音视频语音合成 |
| 226 | 不只答对,还要想对:用混合相似奖励把推理链拽回声音证据 | Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models | 7.0/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频问答 |
| 227 | 用看不见未来的模型逼出紧边界:因果与反因果一致性收紧说话人日志 | Tight Boundary Prediction in Speaker Diarization Using Causal-Anticausal Consistency | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 228 | 从缺一角到补全篇章:把韵律修复统一为线性逆问题的扩散求解 | Unified Prosody Restoration Using Diffusion Models for Controllable Text-to-Speech Synthesis | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 229 | 只传一路码流、其余靠预测补齐:P2PSynCodec 的极低码率权衡 | An Ultra-Low-Bitrate Neural Speech Codec with Plain-to-Pseudo Synergistic Vector Quantization | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 230 | 给提示词就照做吗:用七级提示检验音频大模型的上下文利用 | IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages | 7.0/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 231 | 先难后易加大学习率:Vividh-ASR 如何把自发语音的适配压进解码器 | Vividh-ASR: A Complexity-Tiered Benchmark and Optimization Dynamics for Robust Indic Speech Recognition | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 232 | 说话人走动时,声音能量还跟得上距离吗:用距离—语音一致性识破伪造 | Physics-Aware Deepfake Detection via Distance–Speech Consistency | 7.0/10 · 创新 1.4/2 · 技术严谨 0.9/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 233 | 把分离留给冻结骨干、把选择交给视觉门控:Plug-and-Steer 的解耦提取 | Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频语音分离 |
| 234 | 长音频能听完却写不对病历:用全合成诊室对话同时做训练与可控评测 | Generating Synthetic Doctor-Patient Conversations for Long-form Audio Summarization | 7.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.5/1.5 · 可复现 0.4/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #口语理解 |
| 235 | 不等停顿的同传:用偏好学习把块间静音换成连续说话 | NaturalFlow: Reducing Disruptive Pauses for Natural Speech Flow in Simultaneous Speech-to-Speech Translation | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音翻译 |
| 236 | 只记最近的声音:WAND 用全局加局部门限把自回归语音合成的显存拉成常数 | WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models | 7.0/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #文本到语音 |
| 237 | 同时骗过说话人与伪造检测:AGENT 如何拆解 SASV 的联合防线 | AGENT: A Black-box Adversarial Attack Exposing the Achilles’ Heel of SASV Systems | 7.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #说话人验证 |
| 238 | 综艺音效为何难生成:用检索打底、专家分工 refinement 补齐时间与情绪 | ARCHES: An Agent-Based Refinement Cycle for Hierarchical Synthesis of Sound Effects for Variety Shows | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #视频到声音生成 |
| 239 | 用说话人匿名化解耦换音色:零前视流式转换如何把延迟压到一帧 | Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音转换 |
| 240 | 先想响什么,再想从哪响:两阶段解耦的一阶 Ambisonics 视频配音 | FoleyImmersive: Decoupling What and Where for Video-to-First-Order Ambisonics | 7.0/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.5/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #视频到声音生成 |
| 241 | 女声/s/更高是嗓子短还是练出来的:12 种语言里把生理和表演分开算 | Disentangling sociophonetic and physiological variation in /s/ acoustics across 12 languages | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 242 | 回声可参考、噪声不可参考时先判别抑制再单步生成补细节 | DiffVQE: Hybrid Diffusion Voice Quality Enhancement Under Acoustic Echo and Noise | 7.0/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #回声消除 |
| 243 | 先造伪源再学回真目标:回文合成支撑的零样本变声 | From A to B to A: Palindromic Zero-Shot Voice Conversion with Non-Parallel Data | 7.0/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音转换 |
| 244 | 解码器这么深,语音任务真用得上吗:从层剪枝量冗余 | Measuring the Redundancy of Decoder Layers in SpeechLLMs | 7.0/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 245 | 把停顿、话题和音素装进同一个提示:LoRA 微调大模型做痴呆检测 | LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features | 7.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 246 | 双通道生成式预训练为何能提前听出轮替:DualTurn 的方法与证据 | DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #轮次切换 |
| 247 | 语音激活动态范围过大时,为何要把校准写成两步优化再用进化策略搜缩放因子 | Evolution Strategy-Based Calibration for Low-Bit Quantization of Speech Models | 7.0/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 248 | 未知水印与未知信道下还能检出吗:VoxWatermark 的大规模扰动评测与 AudioWMD | VoxWatermark: A Large-Scale Benchmark for Audio Watermark Detection under Perturbations | 7.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频水印 |
| 249 | 唱歌也会造假:SingFox 用 20 种语言和六条赛道逼模型现形 | SingFox: A Multi-Lingual Singfake Detection Corpus | 7.0/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.9/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频深度伪造检测 |
| 250 | 留下局部异常:用状态空间模型与双轴混合重学呼吸音分类 | Lung-SRAD: Spectral-Aware Regularized Audio DASS with Dual-Axis Patch-Mix Contrastive Learning for Respiratory Sound Classification | 7.0/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 251 | 基类与新类不在同一域时,如何既记住旧类又认出新域新类 | Cross Domain Few-Shot Class-Incremental Audio Classification Via Adversarial Contrastive Learning | 7.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 252 | 不动权重改发音:FlowEdit 把纠错存进联想记忆 | FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #文本到语音 |
| 253 | 没有干净语音可学时,为何让模型先把混响加重再去掉 | ARTT: Augmented Reverberant-Target Training for Unsupervised Monaural Speech Dereverberation | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #去混响 |
| 254 | 没有通用冠军的语音识别:用同一标尺同时量准度与速度 | Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation | 7.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 255 | 从说清是谁在说到读懂多人对话:MSU-Bench 的两层说话人诊断 | MSU-Bench: Towards Understanding the Conversational Multi-Speaker Scenarios | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 256 | 用自然语言请求加长篇富标题来统一语音合成:Bagpiper-TTS 的规划-标题-生成链路 | Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis | 7.0/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 系统技术报告 | #语音合成 |
| 257 | 留住语调还是藏住身份:用扩散引导连续调节匿名强度 | DiffAnon: Diffusion-based Prosody Control for Voice Anonymization | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 258 | 不微调也能写长叙事:用多尺度可听证据约束大模型的音乐艺术解说 | Music Artistic Captioning: Towards Translating Music into Expressive Language | 7.0/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频字幕生成 |
| 259 | 高资源模型为何在东南亚语言上失灵:SEA-Spoof 的配对构造与跨源评测 | SEA-Spoof: Bridging the Gap in Multilingual Audio Deepfake Detection for South-East Asia | 7.0/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #音频深度伪造检测 |
| 260 | 用发音器官的动作做桥梁:ARTIST 如何把 11 种印度语言压缩进 20 个离散单元做英译 | ARTIST: Universal Articulatory Space Modeling for Multilingual Indic-to-English Speech-to-Speech Translation | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音翻译 |
| 261 | 一个解码器统一三种增强任务:连续条件加离散目标的自回归路线 | UniSE: A Unified Framework for Decoder-Only Autoregressive LM-Based Speech Enhancement | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 262 | 幻觉来自只看文字不听声音:用对齐线索把小型语音语言模型拉回声学 | Probing and Mitigating Hallucinations in Speech-augmented Language Models for Automatic Speech Recognition via Small Language Models | 7.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.4/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 263 | 只看脸说方言:K-DIALECT 如何把说话人身份与方言韵律分开建模 | K-DIALECT : Korean Dialect-Aware Face-Based Speech Synthesis | 7.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频语音合成 |
| 264 | 一步去噪去混响:薛定谔桥轨迹为何要配 Mamba 的状态演化 | Schrödinger Bridge Mamba for One-Step Speech Enhancement | 7.0/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音增强 |
| 265 | 冻住编解码器再补音高:声调丢失为何要走旁路残差 | Pitch-Injected Residual Adapter for Tonal Language in Neural Audio Codec | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频编码 |
| 266 | 冻住原文、只练新层:用深度扩展把文本大模型改成能听的语音模型 | Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling | 7.0/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 267 | 野外影视学表达:用属性思考令牌把开放指令和音色解耦 | Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions | 7.0/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #文本到语音 |
| 268 | 不用注册音频也能做引导增强:用干净先验把 noisy 嵌入拉回正轨 | G-MaP-SE: Guided Speech Enhancement via GMM-Based Prior Matching | 7.0/10 · 创新 1.0/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 269 | 留住多少口音自己定:用离散扩散重写口音相关的语音单元 | Controllable Accent Normalization via Discrete Diffusion | 6.9/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音转换 |
| 270 | 只看两词未来:S5-TTS 如何在有限前视下做逐词流式合成 | Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead | 6.9/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 271 | 去掉参考文本后,流匹配语音合成如何不再把含糊发音带进输出 | Transcript-Free Flow-Matching Text-to-Speech via Speech Feature Conditioning | 6.9/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 272 | 高分辨率歌声打假:全带保全局、子带抓局部如何协同 | Joint Fullband-Subband Modeling for High-Resolution SingFake Detection | 6.9/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 273 | 只传空间信息也能做指向性滤波:神经方向性编码如何压到 0.25 kbps | Neural Directional Coding: Joint Spatial Coding and Filtering with Configurable Directivity Patterns | 6.9/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频编码 |
| 274 | 浊音多给比特、清音少给比特:VoCodec 如何用发声驱动量化压到 1.1 kbps | VoCodec: A Low-bitrate Streamable Neural Speech Codec with Voicing-driven Quantization | 6.9/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 275 | 声音里情绪、内容和病理是缠在一起还是各走各路:用互信息给解耦先称重 | Quantifying Dimensional Independence in Speech: An Information-Theoretic Framework for Disentangled Representation Learning | 6.9/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 276 | 把扩散模型做小做快:FastWave 用去噪重参数与轻卷积做任意到 48 kHz 超分 | FastWave: Optimized Diffusion Model for Audio Super-Resolution | 6.9/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频超分辨 |
| 277 | 连续对齐留给哼唱,离散词袋留给语音:冻结表征如何配匹配策略 | SSL-based Sequence Matching for Unsupervised Audio Retrieval | 6.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频检索 |
| 278 | 在插值随机微分方程里把线性部分算准:十步恢复语音的求解器 | A Fast Solver for Interpolating Stochastic Differential Equation Diffusion Models for Speech Restoration | 6.9/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频修复 |
| 279 | 不做联合优化:用逐层任务向量把同域 ASR 知识并入情感识别 | AdaLTM: Adaptive Layer-wise Task Vector Merging for Categorical Speech Emotion Recognition with ASR Knowledge Integration | 6.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 280 | 双耳不该固定滤波:BiEAR 用耳侧反馈逐帧调节频率选择性 | BiEAR: A Human Auditory-Inspired Adaptive Binaural Front-end for Multi-Speaker Localisation and Distance Estimation | 6.9/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #声源定位 |
| 281 | 语言一变就认错人?在嵌入、后端和打分三处消解语言干扰 | Effectiveness of Language Variability Compensation in Speaker Verification | 6.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 系统技术报告 | #说话人验证 |
| 282 | 既要匿名又要调情绪:DECRA 用因果 VA 轨迹做流式闭环控制 | DECRA: Dynamic Emotion Control for Real-time Speech Anonymization | 6.9/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 283 | 线性效率与全局语义不可兼得?MamTra 用混合替换加蒸馏保住合成质量 | MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis | 6.9/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 284 | 什么算错:意图与逐字两种答案下的口吃语音识别基准 | What Counts as an Error? Dual-Reference Benchmarking for Atypical ASR | 6.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 285 | 儿童语音匿名化为何必须做儿童域适配:内容编码与声码器两端对齐 | Child-Centric Voice Anonymization in Single and Multi-Speaker Speech via Domain-Adapted SSL Models | 6.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #说话人匿名化 |
| 286 | 直接拼历史反而变差:用投影压缩对话与关键词互补做语境 ASR | Context Projector: Complementary Keyword and Dialogue Context Embeddings for LLM-based ASR | 6.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.9/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 287 | 移动声源下方向选择固定滤波为何慢一拍:用卷积循环网络提前选滤波 | Predictive Directional Selective Fixed-Filter Active Noise Control for Moving Sources via a Convolutional Recurrent Neural Network | 6.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #主动降噪 |
| 288 | 不用音素词典做词对齐:把多语表示和可学习的动态规划拼在一起 | Multilingual Word-Level Forced Alignment with Self-Supervised Representations and Learned Dynamic Programming | 6.9/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #强制对齐 |
| 289 | 不改大模型参数,如何让热词只在听到时才生效:AFG-Bias 的检索加门控 | AFG-Bias: Acoustic-Fusion-Gated Biasing for Plug-and-Play Hotword Customization in LLM-Based ASR | 6.9/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 290 | 只给一句话守候意图,模型何时该开口、何时该沉默 | I’ll Keep an Ear Out: Teaching AudioLLMs Proactive Audio Assistance | 6.9/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 291 | 时间池化为何能让维度重排网络把通道做宽而不把算力做贵 | ReDimNet2: Scaling Speaker Verification via Time-Pooled Dimension Reshaping | 6.9/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 292 | 不用多条件训练做流式鲁棒识别:在线分离前端加干净训练后端的解耦路线 | Robust Streaming ASR with Decoupled Separation and Recognition | 6.9/10 · 创新 1.3/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 293 | 同一串压缩口语令牌为何能同时做识别与翻译:MTC-AVSR 的压缩与跨语言对齐 | MTC-AVSR: Compressed-Token-based Audio-Visual Speech Recognition and Translation with Contrastive Language Alignment | 6.8/10 · 创新 1.3/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #音视频语音识别 |
| 294 | 只用卷积和梅尔特征做语音检测:kiloVAD 如何把模型压到 2.1 千参数 | VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment | 6.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音活动检测 |
| 295 | 单数据集高分为何不可信:Spashta Audio-Bench 同时称量印度语言的可懂度与自然度 | Spashta Audio-Bench: Unified ASR and TTS Evaluation Framework across Indian Languages | 6.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 296 | 不靠提示文本纠音:用稠密声学对齐守住发音细节 | Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis | 6.8/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 297 | 自回归模型的熵最小化为何不能只做一半:策略梯度与词元熵的两项补全 | Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 298 | 不靠准时长也能合成:用可学伸缩让非自回归语音自己改长度 | Learning to Rescale: On-the-Fly Sequence Length Adaptation in Non-Autoregressive Speech Synthesis | 6.8/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 299 | 冻住已发货检测器再长出新词分支:参数封顶的模块化关键词扩展 | Scalable Keyword Spotting via Modular Network Expansion | 6.8/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #关键词检测 |
| 300 | 不只判断每帧真假:用相邻帧的方向变化定位部分伪造音频边界 | Temporal Transition-Aware Multi-Head Modeling for Partially Spoofed Audio Detection and Localization | 6.8/10 · 创新 1.6/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音伪造检测 |
| 301 | 用紧码本挤掉音色、再把归一化基频塞回去:SDP-Codec 的低码率与零样本变声 | SDP-Codec: A Speaker-Decoupled Speech Codec with Pitch Injection for Low-Bitrate Coding and Zero-Shot Voice Conversion | 6.8/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 302 | 任务越开放越专,越受限越通用:语音特征在认知评分层级上的分化 | Beyond Binary: Speech Representations Across the Cognitive Score Hierarchy | 6.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 303 | 面试守门不靠干净录音:SEAM 用防捷径设计做实时朗读检测 | SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails | 6.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.9/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 方法研究 | #音频分类 |
| 304 | 长音频问答为何答对内容却对不准时间:用周期时间锚点把时间写进 token 流 | GigaChat Audio: Time-aware Large Audio Language Model | 6.8/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 模型报告 | #音频问答 |
| 305 | 8 倍降采样下掩码与感受野如何对齐:ViP-VL 的越南语预训练路线 | ViP-VL: Vietnamese Self-supervised Speech Pretraining Model with Vector-Quantization Learning | 6.8/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 模型报告 | #语音识别 |
| 306 | 先压掉口音再还原音色:稀疏分词如何让流式口音转换跑起来 | AccentDrift: Real-time Streaming Accent Conversion via Sparse Speech Tokenization | 6.8/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音转换 |
| 307 | 麦克风不够时,能否用生成的虚拟通道补回空间信息 | Spatial-Magnifier: Spatial upsampling for multichannel speech enhancement | 6.8/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 308 | 静音肌电缺语义:用识别文本在推理时纠偏扩散合成 | GETS: Guiding EMG-to-Speech Synthesis via Silent Speech Recognition | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #静默语音接口 |
| 309 | 从固定电话噪声到可学难例:DAR-Boost 把增强参数也交给梯度 | DAR-Boost: A Differentiable and Adaptive Raw Data Augmentation Framework for Robust Anti-Spoofing | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 310 | 类别有增有减时,原型分类器如何不忘旧类又认出新类 | Few-shot Class-variable Incremental Audio Classification via Prototype Adaptation and Pseudo Class-variable Training | 6.8/10 · 创新 1.3/2 · 技术严谨 0.9/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 311 | 把线性预测变成可微优化:用平滑对数面积比跟踪共振峰 | Smooth Formant Tracking with Differentiable Linear Prediction | 6.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 312 | 多人同时说话时,谁说了哪句话:覆盖 22 种印度语言的联合评测 | Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages | 6.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #说话人分离标注 |
| 313 | 多人对话谁该开口:用显式角色约束语音智能体的抢话决策 | Adaptive Turn-Taking for Real-time Multi-Party Voice Agents | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #轮次切换 |
| 314 | 先拟合分布再修波形:DTT-BSR+ 把音乐修复拆成两步走 | DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频修复 |
| 315 | 不共享录音也能拼出多类群分类器:生态约束下的任务向量算术 | Ecologically-Constrained Task Arithmetic for Multi-Taxa Bioacoustic Classifiers Without Shared Data | 6.8/10 · 创新 1.4/2 · 技术严谨 1.3/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 316 | 不确定性找出发音难点,再让微调多练难点:非典型语音的省数据个性化 | Data-Efficient ASR Personalization for Non-Normative Speech Using an Uncertainty-Based Phoneme Difficulty Score for Guided Sampling | 6.8/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 317 | 重建声音还是重建可懂度:双任务加双参照如何评判语音重建 | An Evaluation Framework for Text-to-Speech Voice Reconstruction | 6.8/10 · 创新 1.6/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音克隆 |
| 318 | 越用越分化:用反复自我克隆放大零样本语音合成的鲁棒性差距 | Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation | 6.8/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 319 | 成人与儿童一起识别:用分类器路由和熵感知混合专家分开处理不同口音与年龄 | Entropy-Aware Domain-Routed Mixture-of-Experts Speech-LLM Framework: A Case Study of Multi-Domain Child-Adult ASR | 6.8/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 320 | 英语重音落到中文声调上:先检出再可控合成的重音保持链路 | Evaluating and Preserving Lexical Stress in English-to-Chinese Speech-to-Speech Translation | 6.8/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音翻译 |
| 321 | 粗粒度相似度看不清脚步声:ELSA 把文本拆成声事件再逐个对齐 | ELSA: Acoustic Event-Level Semantic Alignment for Fine-Grained Reference-Free Text-to-Audio Evaluation | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频生成 |
| 322 | 假共振:情绪嵌入余弦相似度为何量不出真情绪 | The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.3/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 323 | 只调流匹配模块:把确定性 ODE 变成可探索的 SDE 再做在线组相对强化学习 | FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech | 6.8/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 324 | 用三种增强输入拆开语音:AugCodec 如何把语义、音色和韵律分开压缩 | AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 325 | 小而稀的叫声为何需要高分辨率与稠密监督:USV-DETR 的技术解读 | USV-DETR: High-Resolution and Densely Supervised Detection of Ultrasonic Vocalizations | 6.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 326 | 不只降调就行:跨男性群体声音满意度与基频基准的众包语料库 | TMASC: Transmasculine Attitude and Speech Corpus | 6.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 327 | 不平均分配量化器:用可学习的层级权重让编解码残差对齐伪造痕迹 | Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection | 6.8/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音伪造检测 |
| 328 | 耳语缺了基频又像噪声:先学会感知不确定再决定信哪一帧 | Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 329 | 用可验证奖励把语码切换听写拉回原语言:CER 与书写系奖励的分工 | Reinforcement Learning for Data-Efficient Code-Switched ASR | 6.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 330 | 先定语义再补声音:DelayGSE 用延迟文本与码本加权压住幻觉 | DelayGSE: A Generative Speech Enhancement Framework with Delayed Text-Aware Conditioning | 6.8/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 331 | 歌曲生成与歌声转换为何难兼得:用课程掩码统一音色与伴奏 | Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation | 6.8/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #歌唱生成 |
| 332 | 把语言身份移出逐词循环:用一次计算的 utterance 级表示替代解码器逐步神经模块 | Token-Independent Language Representations for Low-Latency Configurable Multilingual Speech Recognition | 6.8/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 333 | 五十小时能做富格式医疗转写吗:拉脱维亚语端到端与两阶段路线的对照 | Low-Resource Medical ASR for Rich Transcription in Latvian | 6.8/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 应用研究 | #语音识别 |
| 334 | 总体第一不等于处处第一:印度语 TTS 偏好由表达力和可懂度驱动 | Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages | 6.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #文本到语音 |
| 335 | 词表太大装不下:用三维压缩让开放词表关键词检出跟上偏置识别 | Massive Open-Vocabulary Keyword Spotting | 6.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #关键词检测 |
| 336 | 长对话一测就露馅:口音与切分如何同时拉低英语 ASR | AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR | 6.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 337 | 该说就说、该沉默就沉默:多方对话中助手何时不该插话 | Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue | 6.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.3/1.5 | 前50% | 数据集与基准 | #轮次切换 |
| 338 | 把 Vocos 搬进脉冲域:稀疏放电如何保住频谱细节 | Spiking Vocos: An Energy-Efficient Neural Vocoder | 6.7/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音合成 |
| 339 | 语义保内容、声学保音色:SARA 用双流结构同时要保真与可控 | SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations | 6.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 340 | 合成语音多了反而更不像本人:用域条件把真假语音分开训练 | ZeSTA: Zero-Shot TTS Augmentation with Domain-Conditioned Training for Data-Efficient Personalized Speech Synthesis | 6.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音克隆 |
| 341 | 不做解耦做残差:ProsoCodec 把韵律当成文本与音色解释不了的部分 | ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion | 6.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音转换 |
| 342 | 情感合成的好坏不能只测自然度:一个同时测质量与情感吻合的大规模听感数据集 | A Large-Scale Dataset of Listener Impressions of Emotional TTS | 6.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音质量评估 |
| 343 | 单步可用的可学习薛定谔桥:把训练与推理的起点对齐再做语音增强 | Learnable Schrödinger Bridge and Activations for Efficient Diffusion-based Speech Enhancement | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 344 | 听见录音里的自己为何不适:回放与想象之差及个人敏感的声学加权 | What Makes Us Hate Our Own Voice? Large-scale experiments on Playback–Imagery Gaps and Individual--Speech Feature Effects | 6.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音质量评估 |
| 345 | 既要分开语义与声音,又要摆脱大模型的 HybridCodec | HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec | 6.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音编码 |
| 346 | 广播音频做自监督预训练:滤得越狠,识别越好但听觉越窄 | Data Filtering Trade-offs in Self-Supervised Speech Representation Learning: A Study on Unconstrained Broadcast Audio | 6.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 应用研究 | #语音识别 |
| 347 | 不用直接估计频谱包络:用声道几何约束共振的匿名转换 | Phy-VC: Physics-Informed Voice Conversion for Privacy-Preserving Pathological Speech | 6.7/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 348 | 把每个音素学成一团云:用类别先验加对比聚类实现可插值的音素空间 | PhonemeCVAE: Contrastive Latent Clustering with Class-Conditioned Priors for Controllable Phoneme Interpolation | 6.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音编辑 |
| 349 | 语义越深 prosody 越淡:用显式声学支路补回句子重音 | ProWhistress: An Enhanced Dual-Stream Transcription Architecture for Prosody-Aware Sentence Stress Detection | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 350 | 不重写整份信念状态,只写改了什么:增量式端到端语音对话状态跟踪 | Incremental End-to-End Spoken Dialogue State Tracking with a Multimodal LLM and Reinforcement Learning | 6.7/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #口语意图与槽位识别 |
| 351 | 只在跨度完备时生成:预训练文本模型做流式逆规范化的读标写路线 | Towards Efficient Simultaneous Inverse Text Normalization with Pretrained Text-to-Text Language Model and Read-Tag-Write Policy | 6.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 352 | 只在不确定时才加码:用熵门控与字音双通道抑制热词幻觉 | UGPCB: Uncertainty-Gated Phonetic Contextual Biasing for Improving Hotword Recognition in Large Speech Models | 6.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 353 | 开口前身体先表态:抢话与守话走着不同的运动时钟 | Before the Turn: Investigating Motion Cues Preceding Speech in Dyadic Interaction | 6.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #轮次切换 |
| 354 | 只改那一刻、其余不动:用指令加区间实现多声混合的时间定位编辑 | Edit the Moment, Keep the Rest: Time-Localized Audio Editing via Instruction | 6.7/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频生成 |
| 355 | 把分钟级对话搬进 25 Hz 隐空间:ZipL-Dialog 如何省内存而不丢可懂度 | ZipL-Dialog: Memory-Efficient Long-Form Spoken Dialog Synthesis via Latent Flow Matching | 6.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #文本到语音 |
| 356 | 从场上峰值到声道目标:PyPhonPlan 如何把计划、感知与记忆算成发音 | PyPhonPlan: Simulating phonetic planning with dynamic neural fields and task dynamics | 6.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音合成 |
| 357 | 先给标签、后建质心:延迟承诺如何稳住多说话人在线跟踪 | Delayed-Commitment Online Speaker Tracking for Robust Many-Speaker Diarization | 6.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 358 | 缺一块频谱也要补回来:SEMamba++ 用全局、局部与周期偏置做通用语音修复 | SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns | 6.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 359 | 把对齐留在编码器、把语言建模交给大模型:LLM-as-Joiner 的标签同步解耦 | LLM-as-Joiner: Decoupling Alignment from Language Modeling in Label-synchronous ASR | 6.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 360 | 载波也是控制量:参量阵列声场分区从只调边带到交替调载波 | Carrier-Aware Sound Zone Control for Parametric Array Loudspeakers | 6.7/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #空间音频渲染 |
| 361 | 先分开再贴标签:用两级流式说话人日志降低多说话人识别的归属错误 | Improving Streaming Speaker Diarization for LLM Based Multi-talker Speech Understanding | 6.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 系统技术报告 | #说话人分离标注 |
| 362 | 先把嘴型变成离散语义令牌,再去混合语音里捞人声 | TGTSE: Token-Guided Target Speaker Extraction with Visual Cue | 6.7/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 363 | 不用帧级边界也能做双流合成:CTC 对齐加双词块如何兼顾质量与延迟 | CTC-TTS: LLM-Based Dual-Streaming Text-to-Speech with CTC Alignment | 6.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #文本到语音 |
| 364 | 用可学习的语义锚点把新事件拆成已知语义再做双向检索 | A Semantic-Anchor-based Method for Open-Vocabulary Sound Event Detection | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 365 | 边听边说不断线:用韵律边界标记把流式文本语音合成的上下文锁住 | Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #文本到语音 |
| 366 | 在固定伴奏时长里换歌词:用时长占比重分配守住旋律与总时长 | MeloDISinger: Melody-Aware & Duration-Preserving Singing Voice Editing with Audio Infilling | 6.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编辑 |
| 367 | 不用看脸也能建声纹库:VieSpeaker 以文本元数据推理说话人身份 | VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency | 6.7/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #说话人验证 |
| 368 | 看不见攻击时靠谁分流:用双路选通把波形瑕疵和语义异常分给轻量专家 | Domain-Adaptive Dual-Gating Mixture of Experts for Generalizable Speech Deepfake Detection | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音伪造检测 |
| 369 | 问法一换就信以为真:音频大模型为何跳过查证直接幻听 | Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models | 6.7/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 370 | 跨语言说话人确认为何总被语言带偏:用两路低秩适配把身份和语言分开压 | Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification | 6.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 371 | 同一句话不同语气看到不同脸:把韵律单独送进扩散模型的尝试 | Say That Again: Visualizing Paralinguistic Cues with Prosody-Aware Diffusion | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 372 | 对齐到文本长度还不够:TASTE-S 如何把离线对齐改成可流式编码解码 | TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音编码 |
| 373 | FoleyGenEx:用注入与掩码统一多模态控制、对齐与副词精度 | FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 1.1/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #视频到声音生成 |
| 374 | 从粗节奏到对齐潜变量:GACA-DiT 如何同时解决节奏粗糙与时间错位 | GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音乐生成 |
| 375 | 重音能跨语言跨情绪迁移吗:多语言多情绪感知标注下的泛化边界 | Do Speech Emphasis Models Generalize across Languages and Emotions? | 6.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 376 | 自然不等于合适:五个使用场景重新标定 TTS 评价 | Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation | 6.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #文本到语音 |
| 377 | 块内早已到齐却不敢看:BACON 用分组卷积放宽因果约束 | BACON: Boundary-Aware Convolution for Streaming Conformer Models | 6.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 378 | 小模型做流式日语识别:缓存感知与数据筛选如何互相牵制 | A Compact Fully-Open Cache-Aware Streaming Model for Japanese ASR | 6.7/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 模型报告 | #语音识别 |
| 379 | 在压缩谱里保住瞬态、在宽带上对齐谐波:STSR 的谱-瞬态折中 | STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling | 6.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音超分 |
| 380 | 严格误报下不聚类未知类:只拉紧目标词、用间隔推开难冒充者 | Margin-Aware Contrastive Regularization for Robust Streaming Keyword Spotting under Strict False-Alarm Constraints | 6.7/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #关键词检测 |
| 381 | 重叠帧算了两遍:HALO 把主干内部帧率减半再复原 | HALO: Half-Frame-Rate Adaptive Learnable Operator for Lightweight STFT-Based Speech Enhancement | 6.7/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 382 | 文本测得准不等于开口能用:口语指令如何拉低语音大模型的成绩 | Do What I Say: A Spoken Prompt Dataset for Instruction-Following | 6.7/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #口语理解 |
| 383 | 长语音越转越错:用三种坏音频做减法压住 Whisper 幻觉 | Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding | 6.6/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 384 | 幻觉不在解码器里开始:在编码器表示中检测并转向 Whisper 的非语音幻觉 | Whisper Hallucination Detection and Mitigation via Hidden Representation Steering and Sparse AutoEncoders | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 385 | 交叉熵教发音,感知奖励教好听:给语音增强语言模型补上后训练 | Post-Training Speech Enhancement Language Models with Perceptual Rewards | 6.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 386 | 在压缩语音的隐空间里一次生成对抗扰动:DAC 隐变量攻击如何兼顾成功率与实时性 | Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks | 6.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #音频分类 |
| 387 | 话语相同而帮助不同:语音大模型中的口音与性别交织差距 | The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs | 6.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.5/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 数据集与基准 | #语音对话系统 |
| 388 | 不用百万条身份数据:用一次真实参考锚定音画身份的伪造检测 | Referee: Reference-aware Audiovisual Deepfake Detection | 6.6/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 389 | 语音模型听得懂却想不清:用同分布滚动与 token 级教师打分补齐跨模态能力 | X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs | 6.6/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频理解 |
| 390 | 冻结表示里能线性读出多少空间:SARL 用受控仿真拆解声源与房间编码 | Probing Spatial Structure in Pretrained Audio Representations | 6.6/10 · 创新 1.4/2 · 技术严谨 1.3/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #声源定位 |
| 391 | 小参数如何靠词典读准多音字:G2PO 的轻量与开放词汇设计 | G2PO: A Lightweight Lexicon-enhanced Framework for Open-Vocabulary Mandarin Polyphone Disambiguation | 6.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音合成 |
| 392 | 同一套符号读多种方言:以国际音标统一输入再用专家分流保住口音 | DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Parameter-Efficient Adaptation and Reward-Driven Optimization | 6.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.5/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 393 | 四音节叠词里的弱强节拍:越南语时长重音与音步的证据 | Rhythmic Patterning in Vietnamese: The Case of Quadrisyllabic Reduplicative Words | 6.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 394 | 说了什么话不该决定真假:用教师对抗与瓶颈去掉语言捷径 | Linguistic Bias Mitigation for Spoofing Detection via Gradient Reversal and A Variational Information Bottleneck | 6.6/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音伪造检测 |
| 395 | 不把残差量化层加起来:用三维网格保留从粗到细的分离线索 | Improving Audio Codec-based Speech Separation By Stacking Residual Vector Quantization Layers | 6.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音分离 |
| 396 | 先懂话再压缩:LitCodec 把 ASR 监督放在量化之前做单码本流式编码 | LitCodec: ASR-Guided Streaming Speech Coding with Unified Quantization | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 397 | 高分成员推断多半是数据集走音:先做盲基线再谈大音频模型记住了什么 | Membership Inference Attacks against Large Audio Language Models | 6.6/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频理解 |
| 398 | 在村口和卫生站把话听清:DISPLACE-M 如何为一线健康对话建基准 | Benchmarking Speech Systems for Frontline Health Conversations: The DISPLACE-M Challenge | 6.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #说话人分离标注 |
| 399 | 没有成对导演指令时,如何让 TTS 学会相对改法并保住音色 | Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction | 6.6/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 400 | 跨语言失语还是跨语言混淆:ORBIT 用对抗与双几何压住语言线索 | Synergizing Zero-Shot Cross-Lingual Alzheimer Detection with Language-Invariant Multimodal Bi-Geometric Adversarial Learning | 6.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 401 | 不重合成整句,只换必须换的帧:声学令牌混合同时匿名说话人与命名实体 | Acoustic token admixture for joint speaker and content anonymization | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 402 | 不用离散语音 token:一个模型同时做识别与流匹配合成 | UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models | 6.6/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 模型报告 | #文本到语音 |
| 403 | 改词不改调:无标注旋律引导的歌声重唱如何同时保住歌词与旋律 | YingMusic-Singer: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #歌唱生成 |
| 404 | 既要听对词又要认对人:ZP-KWS 用文本无关声纹给零样本关键词上锁 | Personalized Keyword Spotting for User-Defined Keywords Leveraging Text-Independent Speaker Verification | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #关键词检测 |
| 405 | 算力不动、容量翻倍:TF-MoE 用时间-频率双路稀疏专家做语音分离 | TF-MoE: Time-Frequency Mixture-of-Experts for Efficient Speech Separation | 6.6/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音分离 |
| 406 | 宁可空着也不瞎猜:用占位符与可靠性分数重塑语音识别 | RAS: a Reliability Oriented Metric for Automatic Speech Recognition | 6.6/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 407 | 不靠包络检波器:WaveNorm 在时域直接学出随时间变化的增益 | WaveNorm: A Low-Complexity Time-Domain Neural Adaptive Gain Control for Real-Time Speech Applications | 6.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 408 | 已知很准、未知就自信过头:用门控让 SSL 与手工声学特征各管一段 | Dual-Branch Gated Fusion for Open-Set Audio Deepfake Source Tracing | 6.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 409 | 用不对称填充拨动延迟:在不改感受野和参数量的前提下配置流式增强 | Latency-Configurable Streaming Speech Enhancement via Asymmetric Temporal Padding | 6.6/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 410 | 用相对差距教判别器:RAF 如何让 GAN 声码器又保真又泛化 | RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis | 6.6/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.4/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音合成 |
| 411 | 声音越多越不可靠:多事件音频定位中漏检与误报的同步恶化 | A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs | 6.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 412 | 把好听变成可算分:DeEAR 用三维打分加小样本对齐逼近人类听感 | Decoding the Ear (DeEAR): A Framework for Objectifying Expressiveness from Human Preference Through Efficient Alignment | 6.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 413 | 为检测保留病理:认知状态条件合成与 ASR 文本驱动的 AD 数据增强 | CoSTA: Cognitive-State-Conditioned TTS Data Augmentation Using ASR Transcripts for Alzheimer’s Disease Detection | 6.6/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 414 | 把找路和打分分开:用轻学生找束、重教师定稿的语音束搜索 | Decoupling Search and Evaluation: Efficient Beam Decoding for Language Model-Based Text-to-Speech Synthesis | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 415 | 不用转文字直接听声找物:Speech2See 如何把语音压缩成可定位的语义 | Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection | 6.6/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频理解 |
| 416 | 块内并行、块间串行:DLLM-TTS 如何用离散扩散做语音合成 | DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 417 | 没有坐标也能做地理适配:先从语音预测位置再解码 | Predict-Then-Adapt: Inferring Coordinates from Speech for Continuous Geo-Conditioned Dialectal ASR | 6.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 418 | 英语转写就够了吗:双向翻译预训练如何把语音编码器推向大模型的语义空间 | Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs? | 6.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音翻译 |
| 419 | 总体词错误率饱和之后:用财报电话中的人名公司名检验定制词识别 | Contextual Earnings-22: A Speech Recognition Benchmark with Custom Vocabulary in the Wild | 6.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 420 | 在离散码本上做流匹配:DiFlow-TTS 如何拆开内容、韵律与音质再同时生成 | DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 421 | 盯住语码切换点:用发音相近的错误文本教会模型分清混淆 | Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition | 6.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 422 | 同一句话既定身份又定印象时,合成音为何被参考音拽偏 | LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control | 6.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #文本到语音 |
| 423 | 口音自由变体与句中英语边界:印地-英语混码强制对齐为何必须改词典和改训练数据 | Evaluation of forced alignment of code-mixed speech: the case of Hindi-English | 6.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #强制对齐 |
| 424 | 流式多说话人识别的四条路:不微调也能跑,微调才更准 | Pushing the Boundaries of Streaming Multi-Speaker ASR: A Systematic Study of Architectural Trade-offs | 6.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 系统技术报告 | #语音识别 |
| 425 | 补上幅值与相位线索,再在奇异值域里微调:MoSE 音频伪造检测解读 | Mixture of Spectral Experts for Audio Deepfake Detection | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 426 | 把大模型的语义留在训练端:只用编码器解码重叠语音 | Distilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count Routing | 6.6/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #语音识别 |
| 427 | 四个人同时说话时,耳后脑电如何同时回答何时听与听谁 | NeuroMultiSpEx: Neuro-Guided Target Speaker Extraction for Multi-Speaker Scenarios | 6.6/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 428 | 把百万小时语料装进可复用流程:ESPnet3 如何拆开数据、系统与配方 | ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era | 6.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 系统技术报告 | #语音识别 |
| 429 | 不听我:把已注册的人声删掉来避开远场回传延迟 | Don’t Listen to Me: A Lightweight, Low-Latency Model for Own-Voice Cancellation in Far-Field Speech Enhancement | 6.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 430 | 韵律也能做 ABX:用相同音段、不同韵律的最小对直接量表示空间的距离 | Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations | 6.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 431 | 不用外部声纹编码器做流式变声:从内容编码器中间层直接取说话人表示 | VOSSA: Voiceprint Optimization for Streaming Speech Architectures | 6.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音转换 |
| 432 | 训练时说清为什么错,推理时只给答案:用拒绝式推理拉开相邻意图 | Distilling Structured Reasoning into SpeechLLMs for Spoken Language Understanding | 6.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #口语意图与槽位识别 |
| 433 | 同一句话为何重读不同词:CAST 检验语音合成是否真懂上下文 | Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #文本到语音 |
| 434 | 只改难字:用 CTC 贪心打底、注意力只修低置信字的半自回归推测解码 | Accelerating End-to-End ASR via Semi-Autoregressive Speculative Decoding | 6.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 435 | 从等指令到看时机:ProVoice-Bench 如何考语音智能体的主动介入 | From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench | 6.6/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音交互 |
| 436 | 不只抵消噪声,还要主动补回语音:主动语音增强如何把扬声器变成修复器 | Active Constructive Interference for Speech | 6.6/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #主动降噪 |
| 437 | 低码率先保低频:HARP 用分组残差让 RVQ 按频率分工 | HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs | 6.6/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音频编码 |
| 438 | 语音帧率贴近文本才好推理:冻结大模型下 4.17 Hz 与中间层对齐的取舍 | Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation | 6.6/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频问答 |
| 439 | 从文字直接生成发音器官运动:STArK 用伪标签 EMA 搭起文本到调音的桥 | STArK: Towards Synthesizing Articulatory Kinematics from Text | 6.6/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 440 | 一维嗓音噪声系数为何不能用一个常数走天下:以三维流动为尺校准/a/与/u/ | Noise Scaling Factor for the One-Dimensional Voice Production Model | 6.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音合成 |
| 441 | 先对准方向再补细节:AURA 用两阶段把单声道变成双耳声 | AURA: Audio-Geometry Conditioned U-Net Refinement with Flow Matching for High-Fidelity Monaural-to-Binaural Synthesis | 6.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #空间音频渲染 |
| 442 | 把音色抽出来、把冗余帧并起来:DySTCodec 如何做低码率双流语音离散化 | A Dual-Stream Discrete Neural Codec with Fixed-Length Global Speaker Tokens and Dynamic Frame Rates for Low-Bitrate Speech Tokenization | 6.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 443 | 给 Whisper 加一句可验证的开头:用锚音频同时压制幻觉与装满 30 秒窗口 | Grounding Whisper: An Audio Anchor-Based Approach for Hallucination Mitigation and Throughput-Efficient ASR | 6.5/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 444 | 把费力与清晰拆成两个旋钮:用双轴控制合成伦巴德语音 | Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS | 6.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 445 | 转录错还是问法本身不可答:WASIL 把阿拉伯语语音交互的差评拆开看 | WASIL: In-the-Wild Arabic Spoken Interactions with LLMs | 6.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音交互 |
| 446 | 听错的词捡不回来:用音频关键词门控从纠错记忆里取回该改的那几条 | Audio-KWS-Gated Error Memory Retrieval for Incremental ASR Post-Correction | 6.5/10 · 创新 1.5/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 447 | Harf-Speech:把阿拉伯语音素识别与临床评分拆成可核对的四段流水线 | Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment | 6.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 系统技术报告 | #病理语音评估 |
| 448 | 词错率超过 100% 时不是识别差而是写错了文字:南亚低资源语音识别的失败解剖 | Dissecting ASR Failures in Low-Resource South Asian Languages | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 449 | 口音来时才出手:用混合口音适配器让冻结的 Whisper 按需特化 | Mixture-of-Accent-Adapters for Robust ASR: Injecting Accent Cues into Pretrained Whisper | 6.5/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音识别 |
| 450 | 一个编码器同时记住说了什么和是谁说的:语义与说话人表示的联合后训练 | Learning Multiple Utterance-Level Attribute Representations with a Unified Speech Encoder | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频检索 |
| 451 | 回答对了没有:为什么音频问答需要同时看文字和声音 | AURA Score: A Metric for Holistic Audio Question Answering Evaluation | 6.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 452 | 延迟云端来帮忙:用空间统计稳住低算力多通道语音增强 | Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement | 6.5/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 453 | 开集噪声下说话人确认:用时间平滑阈值选样本、用邻居混合标签纠偏 | Temporal Ensembling Threshold and Neighbor-Aware Label Mixup for Speaker Verification with Open-Set Noisy Labels | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 454 | 不听声音只看嘴:把对齐走成一条单调最优路径 | V-Align: Visual Forced Alignment via Phoneme to Video Optimal Path Traversal | 6.5/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #强制对齐 |
| 455 | 角色比说话人更难认:让 ASR 先定词,再同步判定每个词的医生或患者身份 | ASR-Synchronized Speaker-Role Diarization | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 456 | 仿真越像真实房间,多通道增强在实测上错得越少 | Improving Multichannel Speech Enhancement through Accurate Room-Acoustic Simulations | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音增强 |
| 457 | 不用姿态也能对上拍:PF-D2M 以视频视觉特征做通用舞蹈配乐 | PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation | 6.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音乐生成 |
| 458 | 快慢不同步:用双路径分别建模倾听者反馈的出现时机 | DP-BCT: A Dual-Path model for predicting BackChannel Timing | 6.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #轮次切换 |
| 459 | 编码器任务决定 FAD 能看见什么:四轴拆解下的精度与对齐权衡 | An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance | 6.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频生成 |
| 460 | 整体自然度打高分却听不出声调错:PASQA 只盯日语重音核对错排序 | PASQA: Pitch-Accent-Focused Speech Quality Assessment Model Trained on Synthetic Speech with Accent Errors | 6.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 461 | 录音质量参差、类别极不平衡时,如何让呼吸音分类的边界更清楚:QLung 的质量自适应角度间隔 | Quality Adaptive Angular Margin Learning for Respiratory Sound Classification | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频分类 |
| 462 | 留住旋律、换掉乐器:AdaTT 按目标乐器调节音高与响度控制 | AdaTT: Text-Guided Instrument Timbre Transfer with Target-Adaptive Structural Control | 6.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音乐生成 |
| 463 | 层位置不能乱动:用交错堆叠加速语音基础模型蒸馏 | Fast Speech Foundation Model Distillation Using Interleaved Stacking | 6.5/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 464 | 固定参考测不准偏好:Preference-ASR 把指令遵从变成可算的词错误率 | Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 465 | 噪声下既要补高频又要去噪:VeRe-Flow 用干净速度和干净表示双路纠偏 | VeRe-Flow: Guiding Flow Matching toward Clean Speech via Velocity Contrastive Regularization and Representation Alignment for Noise-Robust Bandwidth Expansion | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音超分 |
| 466 | 把规则还给规则,把歧义留给大模型:日语注音的两条流水线之争 | Benchmarking Large Language Models for Grapheme-to-Phoneme Conversion: A Japanese Case Study | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #文本到语音 |
| 467 | 先校准量尺再推理:用维度奖励把语音质量说清楚 | Calibration-Reasoning Framework for Descriptive Speech Quality Assessment | 6.5/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 468 | 单模态防住了,双模态却被放大:语音语言模型的联合越狱优化 | On Optimizing Multimodal Jailbreaks for Spoken Language Models | 6.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音对话系统 |
| 469 | 只用十秒参考音跨语言克隆:用过滤后的合成语音微调轻量模型 | Lightweight Cross-Lingual Speaker Adaptation for Indic TTS | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音克隆 |
| 470 | 流式匿名总把情绪抹平:用同说话人错峰情感对与声学帧级蒸馏纠偏 | StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation | 6.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 471 | 病因判断写进生成流:构音障碍识别为何先判病因再转写 | Etiology-Aware Speech Language Models for Dysarthric Speech Recognition | 6.5/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 472 | 用可调离散瓶颈切断音色:VerAno 以受限码本平衡匿名与可用性 | VerAno: Speaker Anonymization via Self-Supervised Tokenization and Conditional Flow Matching | 6.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 473 | 把对齐从顶层突变改成逐层铺路:InterAligner 的渐进对齐监督 | Progressive Alignment Objectives for Aligner-Encoder based ASR | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 474 | 跨语音到音乐连续学评分:用 frozen 语义锚稳住旧任务 | CAQA-Net: Continual Audio Quality Assessment Across Speech and Music Domains | 6.5/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频质量评估 |
| 475 | 听音验文:用合成似然把假设拉回语音信号 | Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy | 6.5/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 476 | 把说话人信息挤出去:双粒度正交解耦如何让伪造检测只看合成痕迹 | Dual-Granularity Orthogonal Disentanglement for Generalizable Audio Deepfake Detection | 6.5/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 477 | 多人有声书为何断裂:用解耦上下文与指令蒸馏同时保住连贯与可控 | audiobook-cc: Controllable Long-context Speech Generation for Multicast Audiobook | 6.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 478 | 选项一换就变脸:大音频语言模型的选择题高分有多稳 | Robustness Assessment of Large Audio Language Models in Multiple-choice Evaluation | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 479 | 不加文本解码器:用受约束 CTC 把声学证据锁在骨架上补变音符号 | Constrained CTC decoding for Efficient Diacritic Restoration | 6.5/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 480 | 把水印藏进音节时长里:DuraMark 用可控时长对抗生成式抹除 | DuraMark: Duration-Embedded Watermarking in LLM-based TTS | 6.5/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频水印 |
| 481 | 先听已说出的声音,再定下一个字的语气:动态韵律预测补齐说话人相似度 | Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity | 6.5/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音克隆 |
| 482 | 把多个 noisy 语音特征加起来:跨数据集验证的 ALS 复合指数为何更稳 | Reducing Measurement Noise in Digital Speech Biomarkers: Interpretable Composite Index Scores for Longitudinal ALS Monitoring in Clinical Trials | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 483 | 口音不是噪声:西班牙语和法语十种方言如何让识别器系统性改写 | Dialect Bias in Speech Recognition Across 10 Spanish and French Varieties | 6.5/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 484 | 融合分数分不开好坏时:用 ChatScorer 和间隔过滤让偏好训练学到更清楚的差距 | Improving Stable Speech Synthesis Post-Training with ChatScorer and Margin-Based Preference Construction | 6.5/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #文本到语音 |
| 485 | 字对了人不一定对:临床访谈转写为何要同时查归属、隐私与关键词 | DIALOG DeID: Role and Privacy Aware Transcription for Clinical Interviews Beyond WER | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 系统技术报告 | #语音识别 |
| 486 | 不直接学情绪,而学偏离中性的差:词级残差如何做可放缩的情绪强度 | Word-level Emotional Intensity Control in TTS via Emotion Residual Vectors | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 487 | 统一评分与匹配训练才能选型:SURE 把评估协议与训练转换做成可复现闭环 | A Unified and Reproducible Experimentation Framework for Speech Understanding | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #口语理解 |
| 488 | 用二值静音画布约束配音节奏:语音活动感知的合成如何对齐停顿 | Not Quite My Tempo: Voice Activity-aware Speech Synthesis for Lip-Synchronous Dubbing | 6.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音配音 |
| 489 | 无真标签可学上下文诊断:用无意义伪标签把推理技能与医学语义解耦 | Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio | 6.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 490 | 宽描述做不了逐词提示时:用元数据推理链教语音大模型改稀有词 | Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains | 6.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 491 | 好听不等于说对:用阿萨姆语元音和谐审计多语种合成的音系忠实度 | Towards a Phonology-Informed Evaluation of Multilingual TTS | 6.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 492 | 改内容而不动声学:语义空间编辑加自一致奖励的文本语音编辑 | Edit Content, Preserve Acoustics: Imperceptible Text-Based Speech Editing via Self-Consistency Rewards | 6.5/10 · 创新 1.5/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音编辑 |
| 493 | 强弱不等反而更稳:按能力分工的非对称音频推理协作 | Beyond Symmetric Interaction: Capability-Aware Asymmetric Multi-Agent Collaboration for Audio Deep Reasoning | 6.5/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频问答 |
| 494 | 从混合比位置直接跳到目标:MeanFlow-TSE 为何能把一步生成走直 | MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow | 6.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 495 | 只听声音判断反话:用局部与整体韵律的不一致来识别讽刺 | ProSarc: Prosody-Aware Sarcasm Recognition Framework via Temporal Prosodic Incongruity | 6.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 496 | 只看舌头超声能说话吗:用三维编码加 Transformer 补上协同发音 | Tongue2Speech: Real-Time Speech Synthesis from Tongue Ultrasound Videos via Spatiotemporal Transformers | 6.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #静默语音接口 |
| 497 | 不用专家在场也能收嗓音数据:CalliOpeNLP 如何把指令、录音与合规检查做成一体 | CalliOpeNLP: A Standalone Digital Health Voice Data Collection Research Tool | 6.5/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音识别 |
| 498 | 先抄写再打点:两步式语音大模型如何保住识别率做词级时间戳 | Parameter-Efficient Adaptation of Speech-Aware LLMs for Timestamp Prediction | 6.5/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #强制对齐 |
| 499 | 编解码器换语言不用重训,自监督预训练却必须对齐语言 | Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 500 | 在决策边界上现造难题:ADALA 用强化学习驱动大模型生成难负例 | ADALA: A Wake-up Word Detection Framework Based on Adaptive Semi-supervised learning and Large Language Model | 6.5/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音唤醒 |
| 501 | 不微调也能演好角色:用双层控制向量同步“想法” 与“声音” | DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention | 6.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音对话系统 |
| 502 | 回到耳朵:用听觉加权与相位相关重做音乐高保真压缩 | Back to Ear: Perceptually Driven High Fidelity Music Reconstruction | 6.5/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 模型报告 | #音频编码 |
| 503 | 不只听懂字,还要跟住情绪:Empathy Omni 用情绪轨迹控制共情语音回复 | Empathy Omni: Enabling Empathetic Speech Response Generation Through Large Language Models | 6.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 模型报告 | #语音对话系统 |
| 504 | 指令说情感还不够:用结构化情感向量把强度也管住 | EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis | 6.5/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 505 | 不走多步轨迹:把语音增强写成分布平衡的单步投影 | Speech Enhancement Based on Drifting Models | 6.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 506 | 同时听五个音频为什么变难:MUGEN 用音频当选项考查大音频语言模型 | MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 507 | 靠得太近就分不清:用单通道老师管住双通道学生的空间依赖 | A Dynamic Knowledge Distillation Framework for Mitigating Spatial Ambiguity in Lightweight Dual-Channel Speech Enhancement | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 508 | 用跳读和复读的失败样子教流匹配走稳:RobustSpeechFlow 的对齐鲁棒训练 | RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 509 | 诊室看不到白天的嗓子:用颈表振动一周监测区分两类声带过度功能 | The Interspeech 2026 NeckVibe Challenge: Voice Disorder Detection via Real-World Monitoring of Neck-Surface Vibration | 6.5/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #病理语音评估 |
| 510 | 在线时不能看未来:用渐进蒸馏把视觉前端变轻并保住说话人区分度 | Online Audiovisual Speaker Separation Using Efficient Visual Knowledge Distillation | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频语音分离 |
| 511 | 网格够用但不够准:用注意力选麦克风对、再用高置信网格算连续坐标 | G2C-NET: A Grid-to-Continuous Neural Network for Sound Source Localization in Distributed Microphone Arrays | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 1.0/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #声源定位 |
| 512 | 流式之下还要对准每个音素:MPA-KWS 如何统一文本与音频注册 | MPA-KWS: Multi-Modal Phoneme-Level Alignment for Streaming Open-Vocabulary Keyword Spotting | 6.5/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #关键词检测 |
| 513 | 按文本内容压缩语音:用 CIF 让大模型少看冗余帧 | Content-Aware Dynamic Compression for Efffcient Speech Recognition based on Large Language Model | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 514 | 不再先定死时长:用跳变管结构、用扩散修内容的一次联合生成 | Beyond Two-stage Diffusion TTS: Joint Structure and Content Refinement via Jump Diffusion | 6.4/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 515 | 不用乘法做语音文本对齐:SPARK 把用户自定义关键词检测搬进脉冲域 | SPARK: Efficient Audio-Text Matching for User-Defined Keyword Spotting via Spiking Neural Networks | 6.4/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #关键词检测 |
| 516 | 字错了但意思对了:用意图存活率重评语码切换语音识别 | CSER: Semantic Evaluation of LLM Auto-Repair for Code-Switching ASR | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 517 | 反向做标注:先定发音动作时刻,再合成带地标的英语词库 | An Acoustic Landmark Database of the English Lexicon via Articulatory Synthesis | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音合成 |
| 518 | 一个旋钮管两头:用不对称双项损失在保语音与压噪声之间调平衡 | Balancing Speech Reconstruction and Noise Suppression Using Dual-Asymmetric Loss | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 519 | 不转写、不翻译:用对齐的句向量直接生成法语摘要 | Bridging Languages and Modalities: Lightweight Cross-Lingual Text and Speech Summarization for Low-Resource Scenarios | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音翻译 |
| 520 | 重叠声越多越数不清:PolyBench 检验复调音频中的组合推理 | PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio | 6.4/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 521 | 把水印藏进编解码器不丢的东西里:Latent-Mark 的潜在空间偏移 | Latent-Mark: An Audio Watermark Robust to Neural Codec Compression | 6.4/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频水印 |
| 522 | 把重建当难题:用扩散重建逼出更能泛化的音频深伪检测 | Diffusion Reconstruction towards Generalizable Audio Deepfake Detection | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 523 | 先排可信度再渐进学,还要记住说话人:老年语音半监督识别的伪标签提纯路线 | Confidence Score Guided Incremental and Speaker Adaptive Pseudo-Labeling for Semi-Supervised Elderly Speech Recognition | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 524 | 分开学更准、合在一起更全:用风格文字检索和挑选语音的双编码器 | ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 模型报告 | #音频检索 |
| 525 | 用听者自己的耳朵形状做线索:在保住方位感的同时抽出目标说话人 | HRTF-guided Binaural Target Speaker Extraction with Real-World Validation | 6.4/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 526 | 不在谱上做增强:在语音自监督表示空间里用语音内容带声学细节做流匹配 | PhASE-Flow: Phonetic-Conditioned Acoustic Flow Matching in SSL Representation Domain for Speech Enhancement | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 527 | 野外网页音频上练多语表示:UPS 2026 用三任务逼出通用性短板 | Unsupervised Speech in the Wild Challenge: Learning Robust Multilingual Representations | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.2/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.1/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 528 | 把编辑搬进文本空间:用丰富描述改写实现零样本开放式音频编辑 | Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption | 6.4/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频生成 |
| 529 | 从单人情绪标签转向互动场:重叠共现时的亚秒级声音耦合 | Shifting Relational Paradigms for Affective Computing: Affective Resonance, Vitality Affects, and Vocal Interaction Fields | 6.4/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 理论研究 | #语音情感识别 |
| 530 | 让会思考的语言模型真正用耳朵听:自复述与多编码器融合的音频对齐 | ALARM: Audio–Language Alignment for Reasoning Models | 6.4/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 模型报告 | #音频理解 |
| 531 | 可比性优先的可懂度评估:PathBench 用统一协议约束参考条件与发音内容 | PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 数据集与基准 | #语音可懂度评估 |
| 532 | 小参数做孟加拉语情感识别:用统计选出的韵律特征搭配双流 DNN-KAN | Dual-Stream DNN-KAN Networks with Bangla-Specific Features for Speech Emotion Recognition | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 533 | 同一标签里混进异说话人时,为何平均分数会失准:用双峰混合分离可信与误聚分数 | Leveraging Diarization Labels for Robust Score Calibration in Target Speaker Tagging via Gaussian Mixture Modeling | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人识别 |
| 534 | 情绪有惯性:用说话人局部时间窗构造难负样本的会话情感识别 | EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 535 | 耳戴上省电采样、手机上重建宽带:CAPS 的次奈奎斯特级联重建 | CAPS: A Cascaded Reconstruction Model to Power Saving in Hearables Using Sub-Nyquist Sampling with Bandwidth Extension | 6.4/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音超分 |
| 536 | 把编解码器变小而不变差:用说话人分组同时压缩编码器与解码器 | End-to-End Model Compression for Personalized Neural Speech Codecs | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 537 | 无人机自噪声下先选出可信方位再做空间滤波:在负 25 分贝下保住目标方向 | Ego-Noise-Aware Spatial Filtering for Reliable UAV Audition in Extreme Low-SNR Conditions | 6.4/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 538 | 静态帧淹没了校准:用帧间差异重加权 Hessian 的超低比特语音识别量化 | Not All Frames Are Equal: Difference-Aware Quantization for Ultra-Low-Bit ASR | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 539 | 用单乐器检测器清洗网络爬取音频:七轨分离数据的自动构建 | Automatic Curation of Large-Scale, High-Quality, Multi-Category Music Source Separation Dataset | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #音乐源分离 |
| 540 | 字错很少,临床结论却翻转:配对噪声如何击穿临床语音笔录 | Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 541 | 只改听不见的地方:SMIA 如何同时骗过说话人验证与反欺骗 | Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 542 | 丢掉内容还不够:用多粒度混淆同时保住说话人、压住可懂度 | Privacy-Preserving Speaker Verification with Multi-Granularity Feature Obfuscation | 6.4/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人验证 |
| 543 | 时间听不清不是没听见:大音频语言模型的时间推理为何失灵 | A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models | 6.4/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 544 | 在扫描仪里同时听脑、看肌肉和拍声道:三模态同步采集如何压住电磁伪迹 | An Approach to Simultaneous Acquisition of Real-Time MRI Video, EEG, and Surface EMG for Articulatory, Brain, and Muscle Activity During Speech Production | 6.4/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #静默语音接口 |
| 545 | 状态记忆不够用时,音频编码器如何向 Mamba-2 低头:SAM 的紧凑表征与结构化问答 | SAM: A Mamba-2 State-Space Audio-Language Model | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 模型报告 | #音频问答 |
| 546 | 无人机自噪声下做实时增强:用双带压缩与频率注意力换取低功耗可部署 | DroFiT: A Lightweight Band-Fused Frequency Attention Toward Real-Time UAV Speech Enhancement | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 547 | 先保真再压缩:两阶段潜在分片如何把低帧率语音编码拆成可复现的步骤 | Low-Framerate Speech Tokenization via Two-Stage Latent Patch Modeling | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 548 | 把调制解耦出去:U2A-Net 为何用超声输入重做参量阵建模 | U2A-Net: Physically Motivated Ultrasound‑to‑Audio Neural Modeling for Parametric Array Loudspeakers | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 1.0/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频生成 |
| 549 | 既要修准音节奏,又要留住原唱味道:整流流如何做风格一致的美化 | SRF-SVB: Style-Consistent Singing Voice Beautifying via Rectified Flow | 6.4/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #歌唱生成 |
| 550 | 用音位束做视觉线索:在因果约束下重做在线视听目标说话人提取 | Online Audio-Visual Target Speaker Extraction with Viseme-Guided Lightweight Visual Pretraining | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 551 | 增强越干净识别越差?用识别置信度决定掺多少原声 | Training-Free Intelligibility-Guided Observation Addition for Noisy ASR | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 552 | 谁的声音算正常:五十年神经多样性语音研究为何越做越偏临床 | Making Room for Speech Diversity: A 50 Year Retrospective of Speech Science and Technology through a Neurodivergent Lens | 6.4/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 综述 | #病理语音评估 |
| 553 | 固定阵列模型为何换个麦克风就失灵:用坐标生成卷积核的阵列不变增强 | Towards Array-Invariant Speech Enhancement via Geometry-Aware Dynamic Convolution | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 554 | 缺一个模态就别硬融合:用跨模态一致性决定查人时要不要多模态 | To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection | 6.4/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频检索 |
| 555 | 扩散先验已能去噪,为何还要显式对齐唇动与声音 | Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 556 | 条件加在哪一层:复合退化下输入层注入为何反而不如不用 | SLICE: Speech Enhancement via Layer-wise Injection of Conditioning Embeddings | 6.4/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.4/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 557 | 先分清错因再造错:用语音相似的音节替换来训练更抗识别错误的越英翻译 | PiDA: Phonetically-Informed Data Augmentation for Robust Vietnamese Speech Translation | 6.4/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音翻译 |
| 558 | 空间信息在系统与数据两层如何缓解漏检与混淆的跷跷板 | MCA-DCF-DS: An Adaptive Framework for Unified Diarization and Separation with Spatial Information | 6.4/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音分离 |
| 559 | 不可靠证据太多时,如何让音频问答的每一步都可核查 | Multi-Source Evidence Fusion for Audio Question Answering | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #音频问答 |
| 560 | 先学局部断裂,再判整句真假:混帧后训练重塑语音伪造检测 | Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 561 | 文本想哭、指令要笑时:用文本情感做基线来放大引导的情感语音合成 | Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 562 | 语义密度决定上限:连续特征与离散口令在统一音频理解中的对照 | Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频理解 |
| 563 | 从零到 147 小时:普什图语开放语音库如何先补句子再借广播破圈 | Pashto Common Voice: Building the First Open Speech Corpus for a 60-Million-Speaker Low-Resource Language | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 564 | 不用通用六情绪:毛利语情感语料为何先重定 16 类再录音 | Pā‑Kakare: The First Emotional Speech Database for Te Reo Māori | 6.4/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音情感识别 |
| 565 | 在线又剪枝又微调:OnDA 把个性化关键词识别的架构也拿到端上改 | OnDA: On-device Channel Pruning for Efficient Personalized Keyword Spotting | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #关键词检测 |
| 566 | 不用标签也能学空间:用声学软相似把双耳表示排成物理几何 | Learning Self-Supervised Spatial Representations via Soft Acoustic Contrastive Alignment | 6.4/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 1.0/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #声源定位 |
| 567 | 遮住最明显的病变帧:PAN-Mask 用可学习的病理掩码逼模型学分布特征 | PAN-Mask: Pathology-Aware Neurological Masking with End-to-End Learnable Weights for Neurological Disorder Detection from Speech | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 568 | 低资源多语语音翻译中统一共享为何冲突:用梯度行为自动定分组与共享比 | Automated Gradient-Driven Parameter Sharing for Low-Resource Multilingual Speech-to-Text Translation | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音翻译 |
| 569 | 标签不准又只给包级标签:用校正加双流多示例拆开抑郁语音检测 | Label Correction Enhanced Dual-Stream Multiple Instance Learning for Weakly-Supervised Depression Detection in Speech | 6.4/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 570 | 越快越慢:云端级联字幕中切分粒度如何把延迟推过吞吐边界 | Decoding the Trade-off: A Large-Scale Analysis of Latency and Stability in LLM-based Speech Translation Cascades | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音翻译 |
| 571 | 用同一句话把不同口音拉到一起:话语级监督对比如何正则化 CTC 微调 | Contrastive Regularization for Accent-Robust ASR | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 572 | 停顿越长越难判:用“离下一次说话还有多久” 重做流式端点检测 | Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction | 6.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #语音活动检测 |
| 573 | 没有目标域语音时,只用目标域文本能否教会语音对话状态跟踪跨域 | Joint Speech And Text Training For LLM-based End-To-End Spoken Dialogue State Tracking | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #口语意图与槽位识别 |
| 574 | 不用独热硬目标:用文本内和音频内相似度做软监督的音频文本对比学习 | Leveraging Mutual Intra-Modal Similarity Supervision for Text and Audio | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频检索 |
| 575 | 用三条正交低秩分支把连续情感装进预训练语音模型 | Continuous Time-Varying Emotion Control Zero-Shot Text-To-Speech With Emotion Orthogonal LoRA | 6.4/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 576 | 固定块长走不稳难音区:用轨迹直不直来动态截断再生成 | TC-DBI: A Plug-and-Play Trajectory Confidence-Guided Dynamic Block Inference Strategy for Speech Synthesis with Continuous Block Flow Matching | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #文本到语音 |
| 577 | 景颇人听普通话声调:多数能分界,唯独升调与曲折调连成一片 | Categorical Perception of Mandarin Tones in Jingpo Native Speakers | 6.4/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音频分类 |
| 578 | 只用一两个图特征判别痴呆:加权言语图把语义与时间装进边权重 | WSG: Clinically-Informed Weighted Speech Graphs for Dementia Detection | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 579 | 声音互相遮掩时,如何留住老类又发现新类 | Continual Generalized Category Discovery for Acoustic Signals via Instance-Adaptive Regularization and Dynamic Teacher Guidance | 6.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 580 | 在机器敏感、人耳不敏感的维度上做防御:解耦内容与声纹再加扰 | Imperceptible Voiceprint Protection via Human-Machine Perception Discrepancy Feature Disentanglement | 6.4/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音克隆 |
| 581 | 声音不能只转文字:用独特性留住声学线索的视频推理压缩 | Preserving Acoustic Cues for Video Reasoning: An Efficient Uniqueness-Driven Token Compression Framework | 6.4/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #音视频问答 |
| 582 | 局部要听话、全局不崩坏:CraftTTS 用三阶段对齐做词级韵律控制 | CraftTTS: Fine-Grained Prosody Control for Text-to-Speech | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 583 | 歌声打假为何要看相位:OPERA-Net 用相位一致 CQT 与语义门控隔离伴奏 | OPERA-Net: Octave-aware Phase-sensitive Enhanced Recognition Architecture for Singing Voice Deepfake Detection | 6.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 584 | 无标注测试数据上自己给自己出题:AQA-TTRL 如何让音频问答模型边测边学 | AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning | 6.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频问答 |
| 585 | 从单向门控到双向调制:BiSASV 如何让说话人与伪造检测互相校准 | BiSASV: Bidirectional Feature Modulation with Dual-Granularity Fusion for Spoofing-Robust ASV | 6.4/10 · 创新 1.4/2 · 技术严谨 1.3/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人验证 |
| 586 | 只用五分钟新被试数据:从单人五十小时听觉预训练向感知与产出的语音检测迁移 | MEG-to-MEG Transfer Learning and Cross-Task Speech/Silence Detection with Limited Data | 6.4/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音活动检测 |
| 587 | 短语音不稳、长语音不对词:用混合注册加帧级重打分稳住验证 | Stabilizing Short Duration Speaker Verification through Neural Re-scoring with Hybrid Enrollment | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 588 | 坐席改一个实体,下一通电话就少错一个:闭环伴随如何攒出自己的偏置词典 | A Human-in-the-Loop Multi-Agent Companion for Real-Time Entity Extraction and SLU-Driven ASR Error Correction | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音识别 |
| 589 | 低延迟下保不住音色:用激励信号与互补说话人编码补回韵律和时变信息 | Improving Model Expressivity and Speaker Matching in Low-Latency Voice Conversion | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音转换 |
| 590 | 噪声下谁还听得清:经典与神经语音编码的可懂度对决 | Assessing the Impact of Noise and Speech Enhancement on the Intelligibility of Speech Codecs | 6.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 591 | 把笑声当异常找:无标注多语言笑声切分的能量加表征路线 | MultiLinguahah : A New Unsupervised Multilingual Acoustic Laughter Segmentation Method | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 592 | 同一批人、同一任务、两种媒介:VIP-MINGLE 如何把视频会议与面对面的差异可比化 | VIP-MINGLE: A Corpus for Videoconference and In-Person Multimodal Interaction in Group Language Engagement | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #轮次切换 |
| 593 | 激活精度说了算:Whisper 端侧量化中权重格式与激活位宽的系统对决 | Systematic PTQ Study of Integer and Floating-Point Formats for On-Device Whisper ASR | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 594 | 不逐字追踪也能选好转写:用一次前向的并行采样做最小贝叶斯风险解码 | Non-Autoregressive Minimum Bayes’ Risk Decoding for Fast Speech Recognition | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #语音识别 |
| 595 | 榜单上只有百分之几的错误,为何遇到口吃和构音障碍就翻倍:五种开放语音识别架构的非标准语音泛化检验 | WER Are We (Really): How Well Do Top Open ASR Leaderboard Models Generalize to Nonstandard Speech? | 6.3/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 596 | 把概率推回正态区间:兼顾改对比特与躲开检测的音频水印自适应攻击 | Learning to Evade: Adaptive Attacks on Audio Watermarking | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #音频水印 |
| 597 | 距离与方向混在一起时,贴麦检测如何用互相关把两者分开 | Ada-Mic: Orientation-Adaptive and Robust Close-to-Mic Speech Detection on Smartphone Using Generalized Cross-Correlation Features | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 598 | 后门住在哪里:语音语言模型中组件传播与多任务掩盖 | Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models | 6.3/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音识别 |
| 599 | 在日常家庭噪声里分清哭与闹:真实世界婴儿 distress 的二分类加固与三分类起点 | Advancing Infant Distress Detection: Two- and Three-Way Classification in Real-World Audio Environments | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频分类 |
| 600 | 静态权重跟不上突发噪声时,用噪声即时生成适配参数 | NoiseLoRA-SV: Hierarchical Noise-Conditioned Adaptation with Embedding Distillation for Robust Speaker Verification | 6.3/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人验证 |
| 601 | 瞬时置信不可靠时,用历史稳定性把伪标签抢回来:HistoMatch 解读 | HistoMatch: Unified Transient-Steady Assessment for Noise-Robust Semi-Supervised Speaker Verification | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 602 | 低帧率悬崖不是音素装不下,而是训练时只给了两个 token | Probing Low Frame Rate Degradation in Neural Audio Codecs | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音编码 |
| 603 | 只用 ASR 数据做多语言语音指令跟随:用语言相关的查询库缓解共享投影器的干扰 | Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision | 6.3/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频问答 |
| 604 | 为伪造判别而压缩:在高稀疏下保住跨域泛化的剪枝蒸馏 | Task-Aware Joint Pruning and Distillation for Efficient Audio Deepfake Detection | 6.3/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 605 | 词错率好看却留不住人名和语气词:面向口音对话的实体与填充词召回管线 | Beyond WER: Entity and Disfluency Recall in Accented Conversational ASR | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 606 | 剪掉一半反而更准:Whisper 中一次性幅度剪枝的正则化效应 | Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR | 6.3/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音识别 |
| 607 | 把脸放进全双工对话:在 12.5 Hz 上同时说与动 | Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems | 6.3/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 模型报告 | #全双工语音交互 |
| 608 | 长描述越写越长越被扣分:把情感语音评价拆成原子事实再逐条验音 | EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions | 6.3/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #音频字幕生成 |
| 609 | 看不见舌头也能练反演:用语音网格合成可见发音轨迹补足电磁发音数据 | ArtBoost: Synthetic Articulatory Data Augmentation for Acoustic-to-Articulatory Inversion | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 610 | 噪声下别硬减:用注意力可靠性逐词调节对比解码强度 | Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频语音识别 |
| 611 | 异构语音与文本候选无法直接比大小:用统一重排器把两路检索拼成一张表 | A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers | 6.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频检索 |
| 612 | 从 126 到 4017 种语言:规模质变如何让语音模型听见太平洋深层史 | Scaling Self-Supervised Speech Models Uncovers Deep Linguistic Relationships: Evidence from the Pacific Cluster | 6.3/10 · 创新 1.4/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语言识别 |
| 613 | 从说出有什么到指出何时发生:用确定性边界监督做音频细粒度定位 | AudioGround: Fine-Grained Temporal Grounding in Audio via Deterministic Boundary Supervision | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频检索 |
| 614 | 把典型语音改成带个人口误的构音障碍语音:基于 PPG 的音素编辑增强 | Mispronunciation Modeling via PPG-Based Phone Editing: A Data Augmentation Framework for Dysarthric Speech Recognition | 6.3/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 615 | 词错率看不见的幻觉:把语音识别错误拆成四条可核对的维度 | Hallucination Benchmark for Speech Foundation Models | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 616 | 要评出发音和声调错误,日语识别器为何不能只做听写 | Building Tailored Speech Recognizers for Japanese Speaking Assessment | 6.3/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 617 | 不只是判真假:用可扩展的原型注册追踪是哪一个模型合成的语音 | Who Synthesized This? Joint Deepfake Detection and Generative Source Attribution | 6.3/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音伪造检测 |
| 618 | 不用文字也能判仇恨吗:VINAYAKA 在双曲空间里对齐声音与画面 | VINAYAKA: Multilingual Audio-Visual Hate Speech Detection via Cross-Modal Fusion in Hyperbolic Space | 6.3/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 619 | 发音方式一变,语音大模型的判断也跟着变:VQ-Bench 如何固定文本只动嗓音 | Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models | 6.3/10 · 创新 1.4/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音情感识别 |
| 620 | 把多人混音当作续写来生成:LlaSep 在离散 token 上一次解码出多路语音 | Speaker Separation via Audio Language Modeling | 6.3/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音分离 |
| 621 | 跨语言时说话人向量为何混入语言信息:以对抗与合成扩增做解耦 | Language-Invariant Multilingual Speaker Verification for the TidyVoice 2026 Challenge | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #说话人验证 |
| 622 | 以静音为锚:用分层加权转向把音频幻觉拉回声音证据 | Silence is Golden: Mitigating Hallucinations in Large Audio-Language Models via Layer-Weighted Vector Steering | 6.3/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音频问答 |
| 623 | 三路不对齐时先对齐再融合:LMPAN 用轻量多路径校准保住双讲语音 | LMPAN: A Lightweight Multi-Path Alignment Network for Joint Full-Duplex Acoustic Echo Cancellation and Noise Suppression | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #回声消除 |
| 624 | 野外西班牙语病理语音为何难识别:S-DiverSe 用 3.2 小时揭示微调不如文本后处理稳健 | S-DiverSe: Spanish Diverse Speech | 6.3/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 625 | 没有配对语音时,用对齐过的伪音频提示让大模型做跨域语音识别 | Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 626 | 先转写哪一段:Easper 用会话级排序证明重复比干净更重要 | Easper: An Accessible ASR Pipeline for Language Documentation | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音识别 |
| 627 | 当词错误率把合法连写判错:SCRIBE 用分类误差向量补上印度语丰富转写缺的诊断信号 | SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR | 6.3/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 628 | 噪声下对话系统该说长还是说短:自然语法句为何同时帮到机器和人 | Optimal Linguistic Complexity for Dialogue System Speech in Noise: Convergent Evidence from Automatic and Human Transcription | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 629 | 缺觉能不能从朗读声里听出来:用可解释小特征同时估计剥夺状态与症状 | Acoustic Biomarkers of Sleep Deprivation on French Read Speech: Interpretable and Frugal Modeling of Sleep Deprivation and Its Symptoms | 6.3/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 630 | 同一说话人被语言拆散时,在任务层面把语言先对齐的 L-Proto | L-Proto: Language-Aware Episodic Prototypical Training for Multilingual Speaker Verification | 6.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人验证 |
| 631 | 先用全部伪标签再用人工标注:北萨米语小模型的一次伪标签迭代 | Two-stage semi-supervised learning with pseudo-labels: A case study on Northern Sámi ASR | 6.3/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 632 | 编解码器压坏水印不是擦除而是压皱:先复原频谱再提取 | Countering Neural Audio Codec Distortions in Watermarking with Adaptive Restoration | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频水印 |
| 633 | 用自然背景声做通用扰动:NaVo 如何兼顾防克隆与可听性 | NaVo: Natural Voice Protection against Voice Cloning Attacks via Generative Universal Adversarial Audio | 6.3/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音克隆 |
| 634 | 数据很少、听众很少时怎么做 TTS:SGILE 的高效建声与高效评测 | Two Lessons Learned from the SGILE project: Efficient Building and Evaluation of TTS Voices | 6.3/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 0.5/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #文本到语音 |
| 635 | 真类概率塌向两端时,用排序与距离重建词级置信度 | Rank-Distance Based Confidence Estimation for ASR | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 636 | 把说话人确认改写成问答:音频大模型能学会听出是不是同一个人吗 | Adapting Audio Large Language Models for Speaker Verification | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 637 | 主导语言挤占更新方向时,如何用均衡投影守住多语低资源记忆 | Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 638 | 只用母语语音学发音:离散单元惊异度如何替代标注与对齐 | Light-weight Pronunciation Assessment via Discrete Speech Token Surprisal | 6.3/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 639 | 少即是多:语调与静音决定轮次结束,文本反而增加抢话 | Less can be More: What Aspects of Speech Drive End-of-Turn Detection | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #轮次切换 |
| 640 | 动作做对不等于想对:CoDeTT 把轮次抢答拆成意图诊断 | CoDeTT: A Context-Aware Decision Benchmark for Turn-Taking Evaluation | 6.3/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 数据集与基准 | #轮次切换 |
| 641 | 用显式局部几何探针引导声场:MiNAF 如何从粗网格生成高保真 RIR | Explicit Context-Driven Neural Acoustic Modeling for High-Fidelity RIR Generation | 6.3/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #房间脉冲响应估计 |
| 642 | 帧级蒸馏为何不能只对齐逻辑:用教师无关的时间上下文投影做轻量声音事件检测 | Teacher-Agnostic Temporal Knowledge Distillation for Resource-Efficient Sound Event Detection | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 643 | 用全局带局部学真伪:ADD-DINO 以两阶段自蒸馏缓解标注稀缺 | ADD-DINO: A Two-Stage Self-Distillation Framework for Audio Deepfake Detection | 6.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 644 | 低资源也有高质量:用语言学定制数据加自监督模型做阿姆哈拉语和阿凡奥罗莫语合成 | High-Quality Speech Synthesis for Under-Resourced Ethiopian Languages | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 应用研究 | #文本到语音 |
| 645 | 从一条全局直线到多块局部仿射:SSL-GMMVC 在自监督空间做可解释音色搬移 | SSL-GMMVC: Interpretable Voice Conversion via Locally Linear GMM Transforms in Self-Supervised Representation Space | 6.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音转换 |
| 646 | 不等整句说完就打分:ANCHOR 用先局部后整体的顺序做增量语音质量估计 | ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling | 6.3/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 647 | 只用整条录音的说话人名单,如何学出帧级归属与干净嵌入 | Multi-Speaker Embeddings With Weakly Supervised Speaker Activity Detection For Granular Speaker Diarization | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 648 | 众包听音为何变扁:P.808 与 P.800 对照下的筛选补救 | Screening Matters: A Comparative Study of Conventional and Crowdsourced Listening Tests | 6.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 649 | 先分波束再互斥:用目标与干扰波束的帧级交互做提取 | AV-SNINet: A multi-channel audio-visual speech-noise interaction network for Target Speaker Extraction with cross-beam attention | 6.3/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 650 | 没有加速度计也能估计声门下共振:从语音生成振动再做自动跟踪 | From Continuous Speech to Subglottal Resonances: Automatic Signal Generation, Estimation, and Tracking Framework | 6.3/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 651 | 偏好测试不必测全所有对:用主动选对让 AB 与 BWS 更快分出系统高下 | Exploring Active Sampling Strategies for Pairwise Comparisons in Speech Synthesis Evaluation | 6.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.9/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 652 | 短伪造易被全局平均淹没:MS-GNN 用窗口图与双向多尺度保留局部证据 | MS-GNN: Multi-Scale Graph Neural Network for Detecting Local Audio-Visual Forgery Traces | 6.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 653 | 从一段语音直接长出可编辑 3D 脸:几何与纹理为何要分开对齐 | ES-3DF: Editable Speech-Driven 3D Face Reconstruction via Geometry Texture Disentanglement | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频生成 |
| 654 | 端射越偏不是算法运气差:紧凑线阵时延到角度的病态反演与两处稳健化 | End-Fire Degradation-Robust DOA Estimation for Compact Linear Microphone Arrays | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #声源定位 |
| 655 | 从作曲要素拆开评价:SongBench 如何让歌曲生成测得更细 | SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 数据集与基准 | #歌唱生成 |
| 656 | 稀疏实测补全任意方向双耳脉冲响应:HRIR-Former 的时域网格自由重建 | HRIR-Former: Grid-Free Time-Domain Reconstruction of Head-Related Impulse Responses with a Spatially Encoded Transformer | 6.3/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #声场重建 |
| 657 | 用低频子带先验带路:SCNet 如何让黑盒声码器先看清再重建 | SCNet: Enhancing GAN-based Speech Generation with Subband Condition Network and Magnitude-aware Phase Loss | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音合成 |
| 658 | 旁人插话时只认佩戴者:波束、鼻麦与旁人声检测的三路差分识别 | Multi-Channel Differential ASR for Robust Wearer Speech Recognition on Smart Glasses | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 659 | 解开 1 比特下限:用可变秩二值分解把编码器压进亚比特 | Pushing the Limits of Compression: Sub-1-Bit Conformer via Variable-Rank Binary Decomposition | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 660 | 重构好不等于诊断对:BACH 测八种音频编解码器的生物声健康信息保留 | BACH: Benchmarking Audio Codecs for Bio-Acoustic Health | 6.3/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频编码 |
| 661 | 重叠下听清与分清难以兼得:用双编码交错与自适应掩蔽平衡识别与归属 | Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 662 | 以参考语音为基准、用文字改一项:FineCombo-TTS 的相对属性控制 | FineCombo-TTS: Collaborative and Precise Controllable Speech Synthesis Using Text Descriptions and Reference Speech | 6.3/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 663 | 边界不清与归属不稳:用语言约束修分割、用已知人声锚定聚类的两级会议说话人日志 | Two-Level Uncertainty Suppression for Robust Meeting Diarization | 6.2/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 664 | 不只听出读错了哪个音,还要说出为什么错:PhonLLM 的联合推断 | PhonLLM: Joint Phone Recognition and Phonological Process Inference for Child Speech | 6.2/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 665 | 双耳助听要在 8 毫秒内降噪:RT-Tango 如何把分布式滤波做轻做快 | RT-Tango: Real-Time Distributed Binaural Speech Enhancement for Low-Power Hearing Aid Devices | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 666 | 只练适配器:扩散大模型为何更能扛住语音到文本的潜桥瓶颈 | Refining the Latent Bridge: Superior ASR Performance via Adapter-Only Alignment with Diffusion LLMs | 6.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #语音识别 |
| 667 | 从高频脑电包络到可听语音:高伽马特征与因果扩张解码器的取舍 | Exploiting EEG-based Gamma-Band Time Frequency Feature in WaveNet Decoder Framework for High-Fidelity Speech Reconstruction | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #言语神经解码 |
| 668 | 事件一变场景就错:用合成混叠检验声场景分类的事件鲁棒性 | Towards Event-Robust Acoustic Scene Classification | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #声学场景分类 |
| 669 | 文本很确定、音频很多变:用数据重排让大音频语言模型并行解码 | Audio-NSP: Data-Centric Semi-Autoregressive Generation for Large Audio-Language Models | 6.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.6/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 670 | 当两个高降调靠音高分不开了:平顶山话里发声与时长的补位 | Beyond Pitch: Multidimensional Cue Reweighting of Two High-Falling Tones in Pingdingshan Mandarin | 6.2/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频分类 |
| 671 | 把对比解码的听觉偏置装进权重:CAAD 如何用伪真值同步蒸馏 | CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频理解 |
| 672 | 把查询与键值对调:让跨注意力在流式关键词检测中逐帧可用 | Streaming Open-Vocabulary Keyword Spotting via Role Swapping in Cross-Attention | 6.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #关键词检测 |
| 673 | 自动标注不准时,可解释语音情感识别如何既挑数据又在线改标签 | Explainable and Trustworthy Speech Emotion Recognition Using Confidence Score and Reinforcement Learning Rectified Speech Emotion Descriptors | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 674 | 把哭腔写进文字:用副语言注入加推理约束做热线危机三分类 | Speech-based Psychological Crisis Assessment using LLMs | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 675 | 方向重叠时只靠空间线索不够:SpkGuideDOA 用说话人引导增强定位 | SpkGuideDOA: Speaker-wise Representation Guidance for Multiple Moving Speaker Localization | 6.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #声源定位 |
| 676 | 键盘声能泄密吗:语音预训练表示在跨键盘与 VoIP 失真下的泛化与 KAN 适配 | Impact Analysis of Speech Representation Learning Models for Acoustic Side-Channel Attack | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频分类 |
| 677 | 噪声混响下双路条件 Transformer U-Net 如何分工做音视频情感识别 | Robust Audio-Visual Emotion Recognition via Conditional Transformer U-Nets with Frequency-Injected Visual Stream | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 678 | 把纠缠的语音表示切开:用干预式对比后训练学出内容与说话人子空间 | Learning task-specific subspaces via interventional post-training of speech foundation models | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #说话人验证 |
| 679 | 真伪边界随方言漂移:ArFake 用四种合成器检验阿拉伯语音防伪 | ArFake: A Robust Framework for Multi-Dialect Arabic Speech Spoofing Detection Benchmark | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音伪造检测 |
| 680 | 先做高资源语音识别预训练,再用三五小时做多任务多语言适配 | Towards Enabling Multilingual Multitask SpeechLLMs in Data-Scarce Settings | 6.2/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音识别 |
| 681 | 配错口音不如不配:以置信度门控守住口音自适应问答的信任 | When Machines Speak Like Local Peers: Improving Conversational Experiences with Accent-Adaptive Voice Agents | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音对话系统 |
| 682 | 交叉重建看不出泄漏:用轻量探针量出语音与房间声学的分离度 | Beyond Cross-Reconstruction: Probing-Based Disentanglement Evaluation for Acoustic Teleportation Codecs | 6.2/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频编码 |
| 683 | 同形不同意:一开口就分晓的普通话语音消歧数据集 DEBATE | DEBATE: A Dataset for Disentangling Textual Ambiguity in Mandarin Through Speech | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 684 | 用文字加空间提示直接生成双耳音频:TTBA 为何要交叉排列左右声道 | TTBA: Spatial Prompted Text to Binaural Audio Generation Using Transformer | 6.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #空间音频渲染 |
| 685 | 先对齐延迟再学左右耳差异:Spec2Spatial 的时频空间建模 | Spec2Spatial: A Time-Frequency Spatial Attention Network for Binaural Audio Synthesis | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #空间音频渲染 |
| 686 | 不用标准答案也能学写声音描述:用成对偏好把音频字幕拉向人意 | Aligning Audio Captions with Human Preferences | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频字幕生成 |
| 687 | 语音推理掉链不是听不清,而是没绑住:实体绑定失败与显式枚举修复 | Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention | 6.2/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频问答 |
| 688 | 又快又稳:把一致性约束铺满非自回归精修的每一步 | Align-Consistency: Improving Non-autoregressive and Semi-supervised ASR with Consistency Regularization | 6.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 689 | 编辑改对了吗、没改的地方保住了吗:用差异与共性分开讲清音频编辑评价 | Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs | 6.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频质量评估 |
| 690 | 不用新采集也能读混语唇语:用拼接伪造语码切换再轻量适配 | Cross-Lingual Compositional Learning for Code-Switched Lip Reading | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #静默语音接口 |
| 691 | 听不清电话时在听者端重建语音:Coco-VC 的鲁棒流式转换 | Coco-VC: Degradation-Robust Streaming Voice Conversion System on the Listener Side | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 系统技术报告 | #语音转换 |
| 692 | 日常闲聊里藏着呼吸信号:SpiroPhonia 用自发语音做 COPD 筛查 | SpiroPhonia: Non-Invasive Respiratory Health Assessment from Spontaneous Speech | 6.2/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 693 | 真人读错比合成错更值钱:IQRA 2026 如何把阿拉伯语发音评估推高 0.28 | IQRA 2026: Interspeech Challenge on Automatic Assessment Pronunciation for Modern Standard Arabic (MSA) | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 694 | 先翻译再转写:用四段课程把 Whisper 拉向希腊方言 | Beyond Standard Greek: Adapting Whisper for Greek Dialects through Curriculum Multitask Learning | 6.2/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 695 | 要逐字听见犹豫,又不能忘记通用语音:持续学习引入不流利标记的权衡 | Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR | 6.2/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音识别 |
| 696 | 德拉威语为何更难解码:从词形稀疏到加权注意力与自条件反馈 | Overcoming Decoder Inconsistencies in Whisper for Dravidian and Low-Resource Languages | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 697 | 重度构音障碍语音并非不可建模:21 小时单人数据如何让常规与大模型都学会 | Investigating ASR for Low-Intelligibility Dysarthric Speech | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 698 | 不用真标签做说话人确认:用多层一致挑出可信伪标签,再把不可信样本当无标签蒸馏 | Self-supervised Speaker Verification with High-Confidence Pseudo-Label Selection and DINO-Style Self-Distillation Based on Pre-trained Models | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 699 | 用方向角给重叠语音加一把尺子:空间增强的序列到序列会议日志 | Spatially-Augmented Sequence-to-Sequence Neural Diarization for Meetings | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 700 | 离散音频令牌记得住说话人却不会用:跨特征蒸馏把嵌入空间对齐回来 | Text-Independent Speaker Verification Using Discrete Audio Tokens | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #说话人验证 |
| 701 | 选项顺序会改变答案:大音频语言模型的位置偏置从何而来 | Hearing the Order: Investigating Position Bias in Large Audio-Language Models | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频问答 |
| 702 | 语音准而音乐弱:WQ-Fusion 用门控动态路由调和 Whisper 与 Qwen | WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 703 | 位深越高越难压:Trilobyte 把样本拆成字节做无损压缩 | Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio | 6.2/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音频编码 |
| 704 | 不存旧数据时如何留住旧能力:用蒸馏定方向、用投影让路的持续语音识别 | Retention-Preserving Gradient Projection with Entropy-Guided Token-Level Distillation for Rehearsal-Free Continual ASR | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 705 | 单比特脉冲下做双谱增强:GSU-DBNet 为何只留一个门 | Neuromorphic Speech Enhancement with Dual-Branch Spiking Neural Networks | 6.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 706 | 人类标注超过二十小时后,G2P 规模为何不再带来稳健性 | Scaling Human and G2P Supervision for Robust Phonetic Transcription | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 707 | 不看目标语言也能认情绪:用跨语言拉齐加去说话人学情绪判别表示 | Learning Emotion-discriminative Representations for Zero-Shot Cross-Lingual Speech Emotion Recognition | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 708 | 推理能自圆其说,却不一定在听:大音频语言模型忠实性的双向检验 | Investigating Faithfulness in Large Audio Language Models | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频问答 |
| 709 | 以叠加代替遮挡:MixProLAP 用混合不确定性建模音频文本多对多对齐 | MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音频检索 |
| 710 | 声带不动时舌头为何还能猜出音高:四种假设的逐项证伪 | Automatic pitch prediction from speech articulation: Where does the f0 information come from? | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #静默语音接口 |
| 711 | 交叉注意力只说对一半:语音到文本模型到底在听哪里 | Cross-Attention is Half Explanation in Speech-to-Text Models | 6.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #语音识别 |
| 712 | 不用录音也能对齐语音大模型:用可控错误率模拟声学后验的 TASU2 | TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 713 | 语言变了人不该变:用冻结再解冻的预训练前端做跨语言说话人确认 | Cross-Lingual Speaker Verification with Self-Supervised Pre-Trained Models | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #说话人验证 |
| 714 | 离散省步数、连续补细节:HybridCodec 在 6.25 Hz 下如何保住说话人 | HybridCodec: Modeling Discrete and Continuous Representations For Efficient Speech Language Models | 6.2/10 · 创新 1.4/2 · 技术严谨 1.3/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音编码 |
| 715 | 听还是读:思维链语音翻译到底用了多少声音 | Listening or Reading? Evaluating Speech Awareness in Chain-of-Thought Speech-to-Text Translation | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音翻译 |
| 716 | 脱离应用谈合成语音好坏为何不可靠:四场景交叉验证与虚拟现实替代检验 | Application context in speech synthesis evaluation: A problem and a solution | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音合成 |
| 717 | 给 Transformer 补局部偏置:在 LoRA 瓶颈里做门控卷积的声学适配 | GC-LoRA: Gated Convolutional LoRA for Parameter-Efficient Acoustic Adaptation | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音识别 |
| 718 | 新合成器抹掉了旧痕迹:VoxENES 2026 如何暴露语音伪造检测的泛化缺口 | VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音伪造检测 |
| 719 | 跨语言说话人确认中语言失配:只用顶层冻结特征做潜在交叉注意力适配 | LaS-LCA: Layer-Selected Latent Cross-Attention Adapters and Margin-Mixup for Robust Cross-Lingual Speaker Verification | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 720 | 只要 20 毫秒延迟:EffVOC 如何从无相位频谱直接重建语音波形 | EffVOC: Low-Delay Efficient Speech Waveform Reconstruction from Spectral Representations Without Phase | 6.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #语音合成 |
| 721 | 面对面演出来的对话:20.6 小时俄语工作室语料如何支撑表情丰富的对话合成 | Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #文本到语音 |
| 722 | 只比邻词:用三线索听觉对比复刻大模型韵律判断 | Auditory Contrast Network for Text-Free Prominence Detection | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 723 | 噪声越大越要看脸,但还不够:给音视识别补上说话人与环境线索 | Adaptive AVSR: Integrating Speaker and Environmental Embeddings for Robust Audio-Visual Speech Recognition | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频语音识别 |
| 724 | 整句平均会稀释情绪爆发点:分段嵌入加图注意力如何重做聚合 | Segment-wise Embedding based Graph Attention Network for Effective Speech Emotion Recognition | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 725 | 为质量评价保留声学细节:细粒度编码器与声学任务如何共同约束表征 | A Fine-Grained Acoustically-Aware Pre-training Encoder for Speech Quality Assessment | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 726 | 不开参数也判病:用模拟法庭辩论约束大模型的抑郁检测 | Moot-Court: Training-Free Dialectical Reasoning for Depression Detection | 6.2/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 727 | 语音大模型听得出是谁吗:先测出现成模型的声纹短板,再给大模型外挂说话人向量 | Speaker Verification with Speech-Aware LLMs: Evaluation and Augmentation | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 728 | 真话不止一种音质:用质量感知的多中心为单类学习保留类内差异 | QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection | 6.2/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音伪造检测 |
| 729 | 不改音频加水印:用初始噪声与生成结果的空间相关做溯源 | AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频水印 |
| 730 | 试内切换下脑电不可靠且有延迟,SAGE 用双路候选加软门控做平滑选择 | SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching | 6.2/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 731 | 语义对了还不够:语音翻译如何保住语气、立场与意图 | The Interspeech 2026 Challenge on Transfer of Pragmatic Intent in Speech-to-Speech Translation | 6.2/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音翻译 |
| 732 | 听出言外之意:粤语语音语用基准如何让韵律参与推理 | YUE-PUB-Speech: A Speech-based Pragmatic Understanding Benchmark for Cantonese | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频问答 |
| 733 | 真方言与带口音普通话为何要分开测:GLAD-CSpeech 的方言学基准设计 | GLAD-CSpeech: A Dialectologically Comprehensive Benchmark for Genuine Chinese Dialect Speech | 6.2/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 734 | 只给低阶镜像反射,也能补出完整房间脉冲响应吗 | Room Impulse Response Completion Using Signal-Prediction Diffusion Models Conditioned on Simulated Early Reflections | 6.2/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #房间脉冲响应估计 |
| 735 | 长时噪声下抓瞬时与看全局:表格统计与注意力多实例如何分工检出两类声带过度功能 | Attention-Based Multiple Instance Learning with Tabular Stacking for Ambulatory Detection of PVH and NPVH | 6.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 736 | 用双向保持网络做短窗分割:在 EEND-VC 里兼顾重叠与长录音 | Bidirectional Retention Network-based Segmentation Model for Speaker Diarization | 6.2/10 · 创新 1.1/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 737 | 不用学隐式边界映射:用对准加扫描直接锁住感兴趣区声源 | Sweep-RSE: Streaming Region-of-Interest Speech Extraction in Multi-Talker Scenarios via Explicit Spatial Sweeping | 6.2/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 738 | 因果错位不蒸馏特征值:用历史关系拓扑教流式关键词模型 | Mitigating Causality Mismatch with Causal Temporal Relation Distillation for Streaming Keyword Spotting | 6.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #关键词检测 |
| 739 | 不只听见声音,还要拿出证据:EChO-Agent 把音频问答拆成可核查的四步 | EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning | 6.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #音频问答 |
| 740 | 干净语音即触发器:Ouroboros 如何让增强模型在无注入下自我静默 | Ouroboros: Self-Referential Backdoor Attacks on Speech Enhancement via Clean Audio Triggers | 6.2/10 · 创新 1.5/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音增强 |
| 741 | 口语怎么说就怎么写:非正式波斯语如何同时拉动识别与翻译 | The Impact of Informal Persian Speech on Low-Resource ASR and Speech Translation | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 742 | 听懂与否如何改变人格判断:SPC V2 把语言理解变成可对照的实验条件 | The SSPNet Speaker Personality Corpus Version 2: Investigating the Role of Language Understanding in Automatic Personality Perception | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 743 | 缺真实管制语音时,用合成口音与信道仿真补足识别训练 | Synthetic Audio Generation Framework for Air Traffic Control Speech Recognition | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 744 | 干净与噪声都要保住:DASH 用双视角多层原型蒸馏缓解加噪微调的权衡 | DASH: Dual-View Self-Distillation with Multi-Layer Hidden Representations for Robust Speech Recognition | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 745 | 联邦不搬数据,对抗再分两步挡:语音情感识别的两阶段防御 | A Two-Stage Defence for Robust Federated Speech Emotion Recognition | 6.1/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.4/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 746 | 谁在跟我说话:用说话人感知的多轮对话历史补上缺失的注视 | Who is Talking to Me? Addressing Egocentric TTM with Speaker-aware Conversational Context | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #口语理解 |
| 747 | 台语发声中字落画:用三模态共识把硬字幕视频熬成 860 小时语料 | A Multimodal Semi-Supervised Framework for Automatic Construction of a Cross-Lingual Taigi Speech-Chinese Subtitle Corpus | 6.1/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音视频语音识别 |
| 748 | 体贴的倾听者:只在该应声的停顿处应声 | Considerate Listener Modeling for Korean Streaming Backchannel Prediction | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #轮次切换 |
| 749 | 不用手写谐波字典:用离散化键值瓶颈同时修浊音与清音 | Dictionary-Free Discrete Key-Value Attention for Improving Speech Enhancement | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 750 | 不按口音分专家,按发音方式分:六个语音专家的口音适配 | Mixture of Phonetic Experts Based Low-Rank Adaptation of Conformer Models for Accented English Speech Recognition | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 751 | 双分支不同步、教师更新不稳定:用时间拓扑一致与性能感知更新做声音事件检测 | Consistency-Regularized Dual-Branch Network with Performance-Aware Mean Teacher for Sound Event Detection | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 752 | 稳态要稳、切换要快:用状态引导的平滑解决脑电注意切换的抖动与迟滞矛盾 | SGAD: A State-Guided Adaptive Decision Framework for Robust EEG-Based Auditory Attention Switch Decoding | 6.1/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #言语神经解码 |
| 753 | 多语言痴呆语音检测:冻结编码器加轻量头为何能跨语言迁移 | Foundational speech models evaluation on multilingual dementia prediction | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 754 | 最后一层并非最优:用逐层校准让冻结语音基座的多层融合更稳 | CAL-MOS: Bridging Layers with Adapters for Robust MOS Prediction Across Speech Foundation Models | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 755 | 希腊语歌声转写:规模越大越准,但小模型更需要翻译任务来稳住 | Automatic Lyric Transcription for Greek Songs: Scaling and Task Composition Effects in Whisper Adaptation | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 756 | 一个扩散模型同时看七种机器:条件引导如何替代一机一模型 | UD-ASD: A Unified Diffusion Model for Anomalous Sound Detection | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #异常声音检测 |
| 757 | 小扬声器非线性失真下如何保住声区隔离:用建模网络监督轻量控制网络 | NCPSZ: A Nonlinear Control Network for Miniature Loudspeakers in Personal Sound Zone Applications | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #主动降噪 |
| 758 | 自然对话里藏着早期认知衰退:结构化病历不够时语音补上了什么 | Natural Speech Encodes Early Markers of Cognitive Decline: Evidence from Clinical Conversations | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 759 | 不塌缩频谱轴:在二维谱时网格上直接做全局建模的说话人验证 | Continuous 2D Spectral—Temporal Transformer for Speaker Verification | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 760 | 合成语音混得像不像:用语音级语码混合度约束 TTS 再反哺语码切换识别 | Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 761 | 不直接猜音素:用发音动作预测重建跨语言鲁棒性 | ArtNet: A JEPA-Like Articulatory Predictive Framework for Robust Zero-Shot Phoneme Recognition | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 762 | 固定 320 倍下采样为何装不下多采样率:MSR-HuBERT 按率分流对齐 20 毫秒帧 | MSR-HuBERT: Self-supervised Pre-training for Adaptation to Multiple Sampling Rates | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 763 | 证据不足时别硬编:用噪声先验让音频大模型收敛表达 | Noise-Aware In-Context Learning for Hallucination Mitigation in ALLMs | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频字幕生成 |
| 764 | 一个模型吃下三种采样率:用接口对齐与特征校准共享量化器 | Unified Neural Speech Coding for Multiple Sampling Rates | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音编码 |
| 765 | 模态不可靠时先估计不确定性再融合:EmoEUS 的显式方差监督 | EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 766 | 不用训练也能让语音模型想清楚:以隐状态差值增强链式思考 | Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models | 6.1/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频问答 |
| 767 | 分数超过人类却看不懂嘴型:视觉语音识别的唇读鸿沟 | The Lipreading Gap: Do VSR Models Perceive Visual Speech Like Human Lipreaders? | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #静默语音接口 |
| 768 | 只看文字会把两个人说成一个人:用说话人向量修补假设聚类的多说话人识别 | Speaker-Aware Hypothesis Clustering and Merging for Target-Speaker-free and Target-Speaker Multi-Talker ASR | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 769 | 冻结骨干不动,只把嵌入往干净目标拉:vMF 轮廓似然为何够用 | Revisiting Label-Free Speaker Embedding Enhancement with vMF Profile Likelihood | 6.1/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 770 | 韩语字形写音不准时:只标鼻音韵尾的 SALT-N 为何更稳 | SALT: Selective Allophone-Level Tokenization for Korean Text-to-Speech Synthesis | 6.1/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 771 | 把情感强度学成从中性出发的轨迹:ETC-TTS 如何稳定控制合成情感 | ETC-TTS: Emotion Trajectory Learning for Controllable Emotional Text-to-Speech | 6.1/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 772 | 先验对不准就会漏:双分支如何把语音和噪声各自管住 | Analysing Adversarial Priors for Data-driven Unsupervised Speech Enhancement | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音增强 |
| 773 | 在野外固定说什么、只传特征:内容受控且隐私优先的韵律采集协议 | Collecting Prosody in the Wild: A Content-Controlled, Privacy-First Smartphone Protocol and Empirical Evaluation | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 774 | 不裁脸、不走多阶段:RT-ASDNet 把说话人检测做成单次实时检测 | RT-ASDNet: Unified, Real-Time Active Speaker Detection | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 775 | 不等直线下降:用事件时间证明语音指标比量表更早看到 ALS 恶化 | Speech-based Digital Biomarkers can Accelerate ALS Clinical Trials: Insights from Time-to-Event and Hazard Rate Analysis | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 776 | 神经音频编解码器失真下,谁还能代表人耳:PESQ 与 SCOREQ 的对照 | Evaluating Objective Speech Quality Metrics for Neural Audio Codecs | 6.1/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音质量评估 |
| 777 | 过自信伪标签不可信时:用残差离散度加权与弱掩蔽恢复语义 | Weakly Masked Residual Reliability Learning for Unsupervised Domain Adaptation in Speech Models | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 778 | 小模型也要排好队形:DNSMOS-C 用质量引导的三元组让隐空间按 MOS 排序 | DNSMOS-C: Improving End-to-end Speech Quality Models via Contrastive Learning | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 779 | 跨数据集听损可懂度预测:用少量目标样本做适配为何能超过全量训练 | Improving Cross-Dataset Speech Intelligibility Prediction for Hearing-Impaired Listeners with Few-Shot Adaptation | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音可懂度评估 |
| 780 | 共享与私有分开学、不可靠的不去学:低资源多语 ASR 的解耦与过滤 | Confidence-Gated Mean-Teacher Consistency Regularization for Low-Resource Multilingual ASR with Shared–Private Fusion-LoRA | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 781 | 冻住分类器做生成:用判别主干复用出扩散分数 | Repurposing a Speech Classifier for Guided Diffusion-Based Speech Generation | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音合成 |
| 782 | 多人加智能体时,人与人就近趋同、与智能体和随时间趋同却很弱 | Speech Entrainment in Multi-Party Conversations with a Digital Agent | 6.1/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 数据集与基准 | #语音交互 |
| 783 | 不听懂词也能数口吃:用相似度图搬运重复结构 | Evaluating Zero-Shot Cross-Lingual Stuttering Detection Based on Self-Attention Weights of Temporal Acoustic Vector Sequence | 6.1/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 784 | 语音与文本越狱走的是同一条内部通道:统一安全子空间的发现与转向验证 | A Unified Safety Subspace Exists in Speech Language Models | 6.1/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音对话系统 |
| 785 | 从超声看到颏舌骨肌:用分割加骨架把发音时的肌肉厚度自动量出来 | Automated Measurement of Geniohyoid Muscle Thickness During Speech Using Deep Learning and Ultrasound | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 786 | 比较才看得准:用推理轨迹让音频语言模型学会比情绪 | Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions | 6.1/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 787 | 不用从左到右写句子:掩码与均匀噪声扩散模型如何给语音识别打分与联合解码 | Diffusion Language Models for Speech Recognition | 6.1/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 788 | 听错药名不是随机错:用发音加语义把噪声实体链回词典 | Post-ASR Proper Noun Grounding via Multi-View Phonetic and Semantic Retrieval | 6.1/10 · 创新 1.1/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 789 | 漏进来的声音别改归属直接删:用说话人日志做三重校验的剪枝校正 | Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 790 | 用冻住的语音表征给扩散去噪指路:在瓶颈处做调制的语音增强 | Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 791 | 转写要留、身份要走:面向说话人级遗忘的 ASR 表征驱散 | Towards Privacy-Preserving ASR: Speaker-Level Machine Unlearning | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 792 | 好到不像真的转写:现代语音识别分数为何偏离人耳 | Too Good to Be True: A Study on Modern Automatic Speech Recognition Systems for the Evaluation of Speech Enhancement | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 793 | 训练时硬离散省时间,推理时软分布补信息:只改推理赋值的离散语音 token 用法 | Leveraging Soft Distributions of SSL-Derived Discrete Speech Tokens for Downstream Inference | 6.1/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 794 | 多语言多模态语音大模型情绪识别为何偏向特定性别:ERM-MinMaxGAP 压最坏语言内差距 | ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 795 | 把自适应滤波器的内部状态直接送进注意力:睡眠声音事件检测的置信融合 | Sleep Sound Event Detection Powered by Learnable Multi-Resolution Adaptive Line Enhancer | 6.1/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 796 | 从划区域到指一点:SPOT-TSE 用距离加方位点查询做目标语音提取 | SPOT-TSE: Spatial Point-Guided Target Speech Extraction | 6.1/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #目标说话人提取 |
| 797 | 并行时间—频带混合加可学习回灌:在不调参的情况下压住识别敏感的增强伪影 | Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音增强 |
| 798 | 酷儿声音为何缺席:六个语音数据集审计与四组采集张力 | Queer inclusion in speech datasets: An audit and taxonomy of practical tensions | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 799 | 把现成前馈层复制成专家:用单专家激活扩容多语微调 | Upcycling Pretrained Transformers into Mixture-of-Experts for Multilingual Speech Recognition | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 800 | 只压住意图还不够:绑定子空间如何切断意图到槽位的条件映射 | Selective Capability Unlearning in End-to-End Spoken Language Understanding | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #口语意图与槽位识别 |
| 801 | 希腊语缺干净长语音时,用确定性提示词加单人低秩适配锁住说话人 | Deterministic Prompting for Speaker-Stable Low-Resource Greek TTS | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #文本到语音 |
| 802 | 只在英语上训练的语音反演,为何能猜出法语和俄语的舌唇动作 | Towards Language-Agnostic Speech Inversion | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 803 | 从单标签到多标签:用可控模糊度重做 MSP-Podcast 情感基准与轻量 Mamba 融合 | From Single to Multi-Label SER: Dataset and Mamba-Based Fusion Model | 6.1/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 数据集与基准 | #语音情感识别 |
| 804 | 把无条件向量换成可学习的:语音合成中更稳的分类器无关引导 | Learnable Classifier-Free Guidance Null Embeddings for Enhanced Controllable Speech Synthesis | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 805 | 又轻又准的情感识别:SETEAB 用压缩前端与门控时序平衡精度与跨库泛化 | SETEAB: Multiscale approach with Squeeze-and-Excitation Temporal Enhanced Aware Block for Speech Emotion Recognition | 6.1/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 806 | 能量决定混合比例、帧决定聚合权重:多损失如何管住语音情感识别 | Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 807 | 关键词只偶尔出现,为何卷积要每帧都全算一遍:子模型短时记忆的稀疏调度 | Sub-Model Short-Term Memory Convolutions for Keyword Spotting Systems on Device | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 方法研究 | #关键词检测 |
| 808 | 听见与默念共享音素表征吗:单被试长时 EEG 的一一映射检验 | Shared Phone-Level Neural Representations of Auditory Perception and ‘Inner Voice’ Production: One-to-One Mapping using a Single-Subject EEG Corpus of Heard and Imagined Natural Speech | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #言语神经解码 |
| 809 | 舌头看得见却认不准:用物理一致与上下文完备治超声无声语音的抖动与粘连 | Towards Robust Ultrasound-based Silent Speech Recognition Learning Physics-Aware and Context-Rich Representations | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #静默语音接口 |
| 810 | 邻域一大就变差:用簇出口截断保住局部密度的异常音检测归一化 | Mind the Gap: Detecting Cluster Exits for Robust Local Density-Based Score Normalization in Anomalous Sound Detection | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #异常声音检测 |
| 811 | 把说话人向量拆成能听懂的份量:LISE 的低维非负正交分解 | LISE : Listenable Interpretable Speaker Embeddings | 6.1/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #说话人验证 |
| 812 | 房间变了还是说话变了:让房间嵌入先说自己有多不可信 | Quantifying the Uncertainty of Blindly Estimated Room Embeddings Using a Dispersion-Calibrated Score | 6.1/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #房间脉冲响应估计 |
| 813 | 不删除参数而是合并参数:用聚类做无数据免训练的语音大模型压缩 | Towards Data-free and Training-free Compression for Speech Foundation Models Using Parameter Clustering | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 814 | 边缘先写、云端只改拿不准的词:不确定性引导的语音情感描述协作解码 | Edge–Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频字幕生成 |
| 815 | 看与听对不齐:用时间坐标与跨帧差异做音画一致理解 | Consistent and Coherent Audio-Visual Understanding with Cross-Frame Patch Differential Attention and Cross-Modal Temporal Alignment | 6.1/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频问答 |
| 816 | 数据更大不如种类更多:语音反欺骗中规模与多样性的受控对照 | Exploring the Scale and Diversity of Speech Anti-spoofing Datasets: Experiments and Analysis | 6.1/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音伪造检测 |
| 817 | 不急于下单标签:把模糊情感当分布来推理 | Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction | 6.1/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 818 | 一句输出谁、何时、说了什么:SDR-LLM 用先进先出序列统一说话人、文本与毫秒时间戳 | SDR-LLM: Speech-LLM Based End-to-End Speaker Diarization and Recognition with Sentence-Level Temporal Modeling | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 819 | 声音是悲伤、文字是高兴时,模型该信谁:ACR-Net 把声学和语义强行分开 | ACR-Net: Mitigating Semantic Dominance via Contrastive Acoustic-Semantic Decoupling | 6.1/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 820 | 互补不是相加:用显式残差与隐式适配控制双音频编码器融合 | Dual-Encoder Fusion with Explicit and Implicit Injection for the Interspeech 2026 Audio Encoder Capability Challenge | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 821 | 打乱时间保住音色:用反事实音频逼模型听证据再选答案 | CoRE: Contrastive Evidence-Aware Rescoring for Multiple-Choice Audio Question Answering | 6.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频问答 |
| 822 | 在时频谱上同时看清纹理与归属:TF-MossFormer 的局部-全局注意力分工 | TF-MossFormer: Integrating Convolution Gated Local-Global Attentions for Enhanced Time-Frequency Domain Monaural Speech Separation | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音分离 |
| 823 | 微调变好还是碰巧配对:同一配方换个预训练 checkpoint 就不再是最优 | Rethinking Speech Foundation Model Fine-tuning: Better SFT or Better Match? | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #口语意图与槽位识别 |
| 824 | 描述词对不齐、语音又出错时:用合成查询把工具向量拉回用户说法 | From Noisy Speech to Accurate APIs: LLM-driven Embedding Steering for Resilient Tool Retrieval | 6.1/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频检索 |
| 825 | 为阿联酋方言建语料:Hamsa 如何用 11 小时人工标注把方言识别误差拉下来 | Hamsa: A Manually Annotated Emirati Arabic Corpus for Speech and Language Technologies | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 826 | 吴语越剧演唱合成的第一套基准:小数据如何做对齐、增广与流匹配基线 | Towards Chinese Yue Opera Singing Voice Synthesis: A Benchmark with Dataset, Data Augmentation and Baseline Model | 6.0/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 数据集与基准 | #歌唱生成 |
| 827 | 只给很少录音也能做领域适配:混合批次如何弥合语音文本鸿沟 | Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 828 | 无配对也能降噪:用整句与逐帧双判别器约束生成器 | UFL-GAN: A Multi-Discriminator GAN for Unsupervised Speech Enhancement | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音增强 |
| 829 | 噪声下为什么还听声?用沙普利值拆解音视语音识别的模态偏置 | Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音视频语音识别 |
| 830 | 只在第一步纠偏肯定回答:用静音对照压住音频幻觉 | TAD: Token-Adaptive Contrastive Decoding with Confidence-Guided Gating for Hallucination Mitigation in Large Audio-Language Models | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频问答 |
| 831 | 整机传送链的故障听诊:七通道音频振动如何支撑跨速度检测与分类 | Toward Multimodal Industrial Fault Analysis: A Single-Speed Chain Conveyor Dataset with Audio and Vibration Signals | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #异常声音检测 |
| 832 | 把音素拆成发音属性:普通话误读检测如何同时看清声韵与声调 | Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 833 | 偏好与引导分开学:双模型如何让流匹配语音更听话 | Improving Flow Matching based Text-to-Speech with Dual-Model Preference Optimization and Classifier-Free Guidance | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 834 | 静态卷积不够用时:用通道内局部注意力给 Mamba 换上动态前端 | Attentive Mamba: Channel-wise Local Attention for Speech Recognition | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 835 | 词边缘更稳、词中间更杂:儿童辅音簇熵的位置分化与向成人模型的收敛 | Sorting Clusters into the Shape of the Word: Positional Distribution of Probabilities | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 836 | 边解码边适应:用跨句音频文本提示做老年语音零样本在线说话人适配 | Decoding while Adapting: Zero-Shot Online Speaker Adaptation via Audio-Textual Prompts for Elderly Speech Recognition | 6.0/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 837 | 组织实体为何最难听准:从多词边界到结构约束的声学命名实体识别 | Rethinking Organization Entity Modeling in End-to-End Acoustic Named Entity Recognition | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #口语理解 |
| 838 | 不在时频上加亮度,而在调制域上搬能量:近端聆听增强的另一种分配方式 | Energy Redistribution in the Spectro-Temporal Modulation Domain for Near-End Listening Enhancement | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 839 | 只给分不够:用保覆盖区间与保序建模重做 MOS 预测 | ConformalMOS: Uncertainty-Aware MOS Prediction with Conformal Intervals and Ordinal Modeling | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 840 | 成对验证为何在源头追溯中更差:全局锚定的分辨率优势与嵌入塌缩代价 | The Hidden Cost of Pairwise Verification in Synthetic Speech Source Tracing | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音伪造检测 |
| 841 | 会议里谁在跟谁说、谁接着说:文本推理能走多远,音视频为何还没接上 | Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.9/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.4/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #轮次切换 |
| 842 | 把语言模型加进解码器还是融进参数:用 LoRA 算术做领域适配的 ASR | Merging the Knowledge of LLMs for Automatic Speech Recognition | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 843 | 只有二分类标签时,如何排出生病的轻重顺序:优势加权的排序损失 | Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 844 | 在线缺未来、离线看全文:用在线预测编码补齐双模自监督的注意力落差 | Online Predictive Coding for Dual-Mode Self-Supervised Speech Models | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 845 | 黑盒预测到临床叙事:语音认知筛查如何把词权重翻译成可核对的语言证据 | From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 846 | 唤醒度易迁移、效价值价贵:英语到普通话情感属性的跨语言适配要多少小时 | How Language-Independent Are Emotional Attributes? A Study on Training Data Scaling and Cross-Lingual Generalization | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音情感识别 |
| 847 | 在噪声脑电中找对语音:SCANS 用交叉注意与有监督对比做时间对齐 | SCANS: Supervised Contrastive Temporal Alignment of Neural Responses and Speech Stimuli | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #言语神经解码 |
| 848 | 只会答题的音乐大模型为何算不准情感分数:指令微调打底加数值反馈精修 | Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音乐理解 |
| 849 | 位置编码的输出摆幅为何在忆阻器模数转换中被削顶 | Positional Encoding in the Context of Memristor-Based Analog Computation for Automatic Speech Recognition | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 850 | 用共享说话人空间切断音色泄漏,再用最小池化修补拼接断裂 | Singing Voice Conversion via Shared Speaker Space and Min-Pooling Adversarially Enhanced Flow Matching | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音转换 |
| 851 | 从实例配对到类别锚定:MVCL-DAF++ 以原型对齐与粗细融合应对噪声与长尾 | MVCL-DAF++: Enhancing Multimodal Intent Recognition via Prototype-Aware Contrastive Alignment and Coarse-to-Fine Dynamic Attention Fusion | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #口语意图与槽位识别 |
| 852 | 把头型变成连续声场:GISNO 用神经算子加亥姆霍兹渲染做 HRTF 个性化 | GISNO: Neural Operator-based HRTF Personalization from 3D Meshes via Differentiable Helmholtz Rendering | 6.0/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #空间音频渲染 |
| 853 | 没有参考文本时,幻觉还能被抓住吗:从文本指标到解码器内部的检测对比 | From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 854 | 把残差捷径换成多流混合:双随机约束如何稳住说话人表征 | Beyond Residual Connections: Manifold-Constrained Hyper-Connections for Robust Speaker Representation Learning | 6.0/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 855 | 分段更宽、词表更大时语音还能听懂吗:比特率与生成质量的权衡 | On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音合成 |
| 856 | 朴素音频描述为何拖累问答:用视觉上下文约束听觉描述的级联协作 | VividAC: Visually Informed and Visually Interacted Audio Captioning for Enhancing Audio-Visual Question Answering | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频问答 |
| 857 | 相似就共享、相异就隔离:用带符号正交约束做持续说话人自适应 | SCOLoRA: Similarity Conditioned Signed Orthogonal LoRA for Continual Speaker Adaptation | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音识别 |
| 858 | 不转写直接听:四个分工考官加一个总审如何做雅思口语反馈 | A Multi-Agent Framework to Automate Feedback Generation for IELTS Speaking Test using Multimodal SpeechLMs | 6.0/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 859 | 只用合成元音就能超过真数据:流匹配如何把病理嗓音的非线性抖动学出来 | Synthetic Pathological Speech at Scale: A Flow Matching Approach for Clinical Data Augmentation | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 860 | 不存病人音频也能记住旧医院:Lung-CL 用生成回放与谱感知蒸馏做持续学习 | Lung-CL: Spectrum-aware Distillation and Generative Replay for Continual Learning based buffer-free Respiratory Sound Classification | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 861 | 从录音到怪兽嗓:用预设效果链把声音设计做成可评测的转换任务 | Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion | 6.0/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音转换 |
| 862 | 静音肌电没有配对语音时,同句有声肌电能否做中间表示目标 | Enhancing EMG-to-Speech via Silent-Voiced Representation Alignment | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #静默语音接口 |
| 863 | 从找词困难到语音错语的级联:HASS 如何分层仿真 logopenic 失语 | HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection | 6.0/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 864 | 一个模型管十种说话任务:用混合 DoRA 专家统一自杀风险语音检测 | Towards Paradigm-General Suicide Risk Detection via Speech LLM | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 865 | 只看峰值帧:KFC-KWS 用 CTC 峰值对齐易混关键词的细粒度判别 | KFC-KWS: Keyframe Fusion with CTC for User-Defined Keyword Spotting | 6.0/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #关键词检测 |
| 866 | 不放大模型也能评分:用有序原型把口语水平拉成一条可量化的轨迹 | LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 867 | 耳语缺了声带振动:把对齐和生成拆开再做耳语转正常音 | WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音转换 |
| 868 | 先对齐再微调:用联合预训练约束多语言语音表征的符号空间 | Alignment-Aware Continued Pre-training for Multilingual Speech Representation Learning | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音识别 |
| 869 | 从安全中性到声学可验:以假设与验证打破语音情感的中性偏置 | Breaking Neutral Bias: Zero-Human-Annotation Fine-Grained Emotion Enrichment via Semantic Drift and Discriminative Re-ranking | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频字幕生成 |
| 870 | 小参数如何听清混合声音:按意图过滤再做全局缩放的音频推理 | TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 模型报告 | #音频问答 |
| 871 | 不改模型也能做流式:用滑动窗口加文本发射策略把基础语音模型包成黑盒 | Improving streaming ASR with foundation models using emission policies | 6.0/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 872 | 补回丢失信息时,发音内容为何会被改写:发音合成中的特征与生成建模 | Feature Design and Generative Modelling in Deep Articulatory Synthesis | 6.0/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音合成 |
| 873 | 预训练记得旧音素,为何学不会新音素:语音合成中音素增加的对照检验 | Exploring Pre-training Benefits on Phoneme Addition through Fine-tuning in Speech Synthesis | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #文本到语音 |
| 874 | 固定取一层不够:让 Whisper 编码器与解码器各层自适应加权做句重音检测 | WhiSSDapt: Adaptive Fusion of Whisper Layer Embeddings for Sentence Stress Detection | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 875 | 检测与转写互相约束:DysfluentNet 用冻结编码器同时学会找口吃与写出口吃 | DysfluentNet: Joint Stuttering Event Detection and Dysfluency-Aware Transcription via Hierarchical Self-Supervised Learning | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 876 | 会双语却写不出混说:用偏好对齐逼音频大模型保留原语言 | Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 877 | 先把自己藏进声音里:无训练自嵌套如何抓住局部语音篡改 | A Training-Free Proactive Defense Against Partial Speech Manipulation via Self-Embedding Steganography | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 878 | 语言错配比性别错配更伤反演:芬兰语—俄语 EMA 上的跨域声学到发音反演基线 | Beyond Speaker Independence: Evaluating Cross-Lingual Acoustic-to-Articulatory Inversion Across Finnish and Russian | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 879 | 一次输出五种标签加解释:联合多粒度评分如何兼顾整体与细节 | A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 880 | 源数据不可见时如何合并多个语音分类器:对齐加元加权的靶向合并 | Accurate Source-Free Speech Classification via Meta-Learned Target-Centric Model Merging | 6.0/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 881 | 一个短语断句可以有多种对法:用大模型造多参考来评测断句标注 | LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 882 | 元训练与元测试梯度打架时:用不对称投影保住适应的方向 | DGS-MLDG: Domain Gradient Surgery Guided Meta-Learning for Domain Generalization in Speech Deepfake Detection | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 883 | 说太快听不懂、说太简单不想练:用流利度把词汇和语速同时调准 | AdaptLingo: A Speech-to-Speech English Practice System with Fluency-Adaptive Responses | 6.0/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音对话系统 |
| 884 | 平均分并不中立:低质语音中放大的性别打分差与可学习的性别感知模型 | MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment | 6.0/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 885 | 微调配比动不了的偏差,从头训练却能翻转:预训练表征如何掩盖性别构成效应 | Gender Bias in ASR: A Controlled Study of Gender Composition Across Training Paradigms | 6.0/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音识别 |
| 886 | 听起来很顺却说错了话:离散野外合成让客观 MOS 失灵 | Investigating the Relationship between Objective AI-driven Metrics and Subjective MOS for In-the-Wild Speech | 6.0/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音质量评估 |
| 887 | 近似注意力失焦时:用双向状态空间替换快速注意力的生成式增强 | Improving DF-Conformer using Hydra for high-fidelity generative speech enhancement on discrete codec token | 6.0/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音增强 |
| 888 | 把水印藏进音素稳态区:能跟随克隆迁移的 Mamba 主动防御 | Phoneme-Aware Mamba Watermark: An Active Defense System Against Purified Speech Deepfakes | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.9/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频水印 |
| 889 | 先重采样到 48 kHz 再补高频:LavaSR 用单声码器做任意带宽扩展 | LavaSR: Fast and Flexible Audio Bandwidth Extension via Vocos | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.1/1.5 | 前50% | 方法研究 | #语音超分 |
| 890 | 只增强目标情感不够:用对比分支在去噪中拉开情感距离 | Emo-BPO: Emotion Bidirectional Preference Optimization for Diffusion-based Emotional TTS | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 891 | 只录一句话,能否让构音障碍语音识别学到有用的变体 | Low-Burden Data Augmentation for Dysarthric ASR via Zero-Shot Voice Cloning | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 892 | 在没有转写时如何证明自发语音语料可用:喜马拉雅四语的采集与验证 | Collection and Curation of a Spontaneous Multilingual Speech Corpus for Low-Resource Himalayan Languages | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语言识别 |
| 893 | 训练只见过同一个人说话,测试却要换音色:CFLOW-VC 用可逆流做循环训练 | CFLOW-VC: An unsupervised cycle training strategy based on normalizing flows for Voice Conversion | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.5/1 · 影响力 0.9/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音转换 |
| 894 | 能听出杂音却听不出读错重音:平均意见分预测在声学与韵律上的双重分离 | Investigating Human-Model Discrepancies in Speech Quality Assessment via Acoustic and Prosodic Perturbations | 6.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音质量评估 |
| 895 | 口吃语音研究为何总对不上用的人:从 228 篇文献与 70 位利益相关者看错位 | Aligning Stuttered-Speech Research with End-User Needs: Scoping Review, Survey, and Guidelines | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 综述 | #病理语音评估 |
| 896 | 让 Whisper 边转写边标假词:只改标注不改模型的低成本尝试 | Deepfake Word Detection by Next-token Prediction using Fine-tuned Whisper | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 897 | 重建越好表示越碎:解耦音频编码器的稳定性代价 | Representational Instability in Decoupled Audio Encoders | 6.0/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频编码 |
| 898 | 野外老年语音为何难识别:WildElder 用人工切分与细粒度标注建基准 | WildElder: A Chinese Elderly Speech Dataset from the Wild with Fine-Grained Manual Annotations | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 899 | 校准源放在哪里才能让分布式麦克风阵列标定更准:以克拉美罗下界为目标的声源位置优化 | Optimal Source Placement for TDoA-based Geometry Calibration of Distributed Microphone Arrays | 6.0/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #声源定位 |
| 900 | 不平坦而是脱钩:神经合成语音在整体语调与元音目标上的双向偏离 | Not Flat, But Dissociated: Prosodic and Segmental Divergence in Neural TTS | 6.0/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #文本到语音 |
| 901 | 口音信息藏在哪里:用稀疏自编码器称量神经音频编解码器的可解释性 | Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: A Case Study on Accent Information | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语言识别 |
| 902 | 文本抢了声音的戏:MATA 在中间层把注意力推回音频 | MATA: A Training-Free Approach to Mitigate Cross-Modal Attention Imbalance in Large Audio Language Models | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频问答 |
| 903 | 只管输出不管模型的透明度义务为何管不住声音克隆 | AI Regulation and the Technical Language of Speech Synthesis | 6.0/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 综述 | #语音合成 |
| 904 | 只调文本不够:用音频提示与共享提示补齐少样本音频分类的另一半 | Audio-Language Prompt Learning for Few-Shot Audio Classification | 6.0/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 905 | 先学标准音再适应真实错音:低资源阿拉伯语如何保住细微发音差异 | A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 906 | 先分语种对齐再跨语种迁移:PART 如何避免多语语音表示坍缩 | PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音翻译 |
| 907 | 固定节拍为何在真麦克风前幻觉:学会等待的流式语音翻译 | Learning to Wait: Real Streaming Speech-to-Text Translation with an LLM | 6.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音翻译 |
| 908 | 瓶颈里放状态空间:MambAdapter 用共享投影加 Mamba 做语音音频轻量适配 | MambAdapter: Lightweight Mamba-Based Adapters for Parameter-Efficient Transfer Learning in Speech and Audio | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 909 | 只在音乐上训练的指纹为何能整理电话语音:去重与多样性采样的两条路径 | Leveraging Discriminative Capabilities of Self-Supervised Neural Audio Fingerprinting for Efficient Speech Data Annotation | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #音频指纹 |
| 910 | 在 LLM 内部压缩音频表示:VIB-AVSR 为何只对音频 token 做瓶颈 | VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音视频语音识别 |
| 911 | 把一天的嗓音切开看:时间分段如何让颈表加速计检出声带高功能 | Temporal Partitioning of Vocal Activity for Detecting Vocal Hyperfunction from Neck-Surface Accelerometer Data | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 912 | 短窗看到的不是同一场景:用对抗训练压住瞬时事件、保住场景一致性 | Enhancing Temporal Prediction Consistency for Short-Duration Acoustic Scene Classification via Semantic Adversarial Training | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #声学场景分类 |
| 913 | 轮到谁说话,耳朵怎么提前知道:话轮末尾词拉长的多语料核对 | Word Lengthening as a Function of Utterance Position: A Multi-Corpus Study | 5.9/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #轮次切换 |
| 914 | 把预训练、微调和蒸馏压进一个循环:三层联合语音识别如何排优先级 | From Bilevel to Trilevel: Joint Training for Speech Recognition | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 915 | 发音不定、写法不定:用国际音标把语音语料的口语与书面锚定下来 | IPA-Guided Dual Transcription for Data-Centric Speech Corpus Refinement | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 916 | 跨被试想象语音为何掉到随机水平:用动态多视角图偏置加对抗去被试化补回空间结构 | Subject-Invariant Dynamic Graph Modeling for Cross-Subject EEG Imagined Speech Decoding | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #言语神经解码 |
| 917 | 不预测分数只判断好坏:PrefSQA 用成对偏好绕开 MOS 噪声 | PrefSQA: Pairwise Preference Prediction for Speech Quality Assessment and the Critical Role of High Quality Datasets | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 918 | 在家庭之间泛化:用可分离的说话人条件做婴儿中心多层帧级标注 | Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 919 | 深模型不必全跑完:用早退出口适配联邦语音微调的算力与任务分层 | Adaptive Federated Fine-Tuning of Self-Supervised Speech Representations | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 920 | 从平均发放率到分布:用分层离散隐变量逼近人工耳蜗听神经随机响应 | Towards a Stochastic DNN Approximation of Cochlear Implant Auditory Models | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频编码 |
| 921 | 母语口语问代码时,通用语音识别为什么先错再传错 | CodeVaani: A Multilingual, Voice-Based Code Learning Assistant | 5.9/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音交互 |
| 922 | 中英混读时热词难认:用语言感知加专家分流再做大模型偏置 | LLM-HB: Language-Aware LLM-Guided Hotword Biasing for Code-Switching ASR | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 923 | 自条件细化与逐层选排列的冲突:用高斯加权让各层说同一种说话人编号 | Hierarchical Permutation Consistency Learning for Self-Conditioned End-to-End Speaker Diarization | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 924 | 偏向的音重复多了,话就变歌:元音辅音分布与说唱指令如何推动言转歌错觉 | Effects of distributional bias in vowels and consonants on the Speech-to-Song Illusion | 5.9/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音乐理解 |
| 925 | 短语音缺信息:用可学习的向量档案把稀疏帧映射回长语音特征空间 | Beyond Short Segments : Expanding Speaker Embeddings with Vector Archives | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人验证 |
| 926 | 先学好说话人分类,再学跨语言拉开距离:两阶段渐进式鲁棒说话人表示 | Progressive Learning for Robust Speaker Representation | 5.9/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 927 | 把真伪线索和攻击痕迹拆开:正交约束为何能让语音伪造检测跨库更稳 | Improving Generalization in Speech Deepfake Detection via Orthogonality-Constrained Common-Specific Feature Decorrelation | 5.9/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 928 | 先分清元音清浊再认音素:用由粗到细的目标过渡缓解 CTC 的空白主导 | Transitional Objective Learning with Connectionist Temporal Classification in Phoneme Recognition | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 929 | 记得却用不上:用注意力找关键轮再做解码对比来压住先验 | From Awareness to Adherence: Bridging the Context Gap in Spoken Dialogue Systems via Context-Aware Decoding | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音对话系统 |
| 930 | 谁更嘎吱响:英汉朗读语料中男性更 creaky 的声学证据 | A Corpus-Based Study of Creaky Voice Production in English and Mandarin | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 931 | 先减去语言口音再对齐语义:POTSA 只训练投影层弥合跨语言表示鸿沟 | POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation | 5.9/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音翻译 |
| 932 | 残留说话人信息为何还在:用针孔损失直接压低可链接性 | Reducing Speaker Residual by Considering Pinhole Effect in Voice Anonymization | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 933 | 看得见说话人,才能补回方向声:两阶段定位渲染做野外语音空间化 | Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #空间音频渲染 |
| 934 | 噪声下谁在说话:用对齐的视听互补做语音活动检测 | MAC-VAD: A Modality-Aligned Cross-Attentive Framework for Robust Voice Activity Detection | 5.9/10 · 创新 1.1/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音活动检测 |
| 935 | 声调难、架构偏:南部班图语识别为何没有通用最优模型 | Tone-Conditioned Curriculum Learning for Low-Resource Bantu Speech Recognition | 5.9/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音识别 |
| 936 | 均匀 SDR 不够:用语音噪声竞争与瞬态加权重塑音素重建 | Time–Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement | 5.9/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音增强 |
| 937 | 单通道推理时没有空间线索怎么办:用双通道做特权监督练出伪空间嵌入再调制分离 | Pseudo-Spatially Conditioned TF-Locoformer with MHCA+FiLM Fusion for Single-Channel Speech Separation | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音分离 |
| 938 | 不用孤立语音也能去噪:用干净混合与噪声录音联合训练分离与说话人日志 | Semi-Supervised Joint Separation and Diarization for Multichannel Noisy Speech Mixtures | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音分离 |
| 939 | 把到达方向变成宽波束约束:直接性正则化如何引导 FastMNMF 的伪分离矩阵 | Fast Multichannel Nonnegative Matrix Factorization with Directivity Regularization for DOA-Informed Speech Separation | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音分离 |
| 940 | 无干净语音时如何去混响:用 WPE/WPD 弱监督约束 USDnet++ | USDnet++: Distilling Signal Processing Based Dereverberation for Unsupervised Neural Speech Dereverberation | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #去混响 |
| 941 | 不用打分也能评风格:用两两比较学会判断动漫感语音 | AnimeScore: A Preference-Based Dataset and Framework for Evaluating Anime-Like Speech Style | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 942 | 被遮住的声谱块为何还能用来加速:把掩蔽冗余变成可合并的令牌 | From Masking to Merging: Rethinking SpecAugment for Efficient Audio Spectrogram Transformer | 5.9/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 943 | 两个语音编码器为何比一个更稳:面向识别的编码器融合怎么做 | Speech Encoder Fusion for LLM-based Automatic Speech Recognition | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 944 | 房间不变时听得更省力吗:声码语音下不同沉浸年龄的房间适应 | Adaptation to Room Acoustics in Understanding Vocoded Speech: A Comparison Between Listeners With Varying Immersion Age | 5.9/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 945 | 把八度跳变当作时钟:用基频不稳定性定位嘎裂嗓起点 | Automatic identification of the onset of creaky voice according to F0 instability | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 946 | 可读性难不倒现代语音识别:人类觉得难的文本为何机器转写不怕 | Readability Does Not Predict Speech Recognition Errors: Contrasting Human and Machine Perception. | 5.9/10 · 创新 1.1/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音识别 |
| 947 | 唱得好不好不能只看音准:用块对齐把歌词正确性与音高节奏放在一起评 | Listening Like a Judge: A Music-Aware Framework for Automatic Singing Performance Evaluation | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频质量评估 |
| 948 | 同音不同形都算对吗:临床多文字变体的评测与训练一致性 | When Multiple Script Matters: Evaluating ASR in Clinical Settings | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 949 | 不在混响里硬捞声音:把语义和音色拆开再做增强 | Seed-Enh: Generative Speech Enhancement in Decoupled Semantic and Timbre Spaces | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 950 | 各模态情绪不一致时:用模态专属标签分布补上融合缺的那块信息 | Leveraging Modality-Specific Label Distributions for Enhanced Multimodal Emotion Recognition | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 951 | 先摘要再隔离:单说话人过滤与因果注入如何兼顾情绪线索与隐私边界 | Speaker-Filtered Heterogeneous Graph Network: Toward Privacy-Preserving Multimodal Emotion Recognition | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 952 | 分诊不是诊断:用结构化病历造出带口音和犹豫的急诊对话 | TriageSim: A Conversational Emergency Triage Simulation Framework from Structured Electronic Health Records | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音对话系统 |
| 953 | 检测器声称的公平与泛化,为什么被 39 个数据集的来源重叠卡住 | Ethical and Technical Limits of Deepfake Speech Datasets | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 数据集与基准 | #音频深度伪造检测 |
| 954 | 17 小时田野录音能把转写加速到 2.4 倍吗:马库萨斯语 ASR 的单语、联合与人工校对实验 | Speech Recognition to Accelerate Documentation of Marquesan and Cook Islands Māori | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 955 | 孟加拉语音素在哪里变清晰:Whisper 编码器中深度的可分性与规模效应 | Layer-wise Probing of Whisper’s Encoder Representations for Bengali Phone-like Units | 5.9/10 · 创新 1.1/2 · 技术严谨 1.2/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频分类 |
| 956 | 丢包后相位为何先坏掉:用解耦双流分别修能量与对齐 | DDSN: A Physics-Aware Decoupled Dual-Stream Network for Speech Packet Loss Concealment | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #丢包修复 |
| 957 | 不教音素也能分出音素:肌电静音语音里语音表示何时出现、何时失效 | Emergence of Phonetic Representations in EMG-based Silent Speech Interfaces | 5.9/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #静默语音接口 |
| 958 | 不用算协方差也能做分布式增强:ANDFilter 把 DANSE 的两步迭代改成三段神经滤波 | An All-neural Distributed Filtering Algorithm for Speech Extraction in Wireless Acoustic Sensor Networks | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 959 | 对不准就念错:用注意力对齐分数与教师对齐路径消除大模型语音幻觉 | Eliminating Stability Hallucinations in LLM-based TTS models via Attention Guidance | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 960 | 从有无烦躁到有多烦躁:以强度与时间建模服务对话升级 | HaessigDB: A Database of Irritable Speech with Intensity Grading | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音情感识别 |
| 961 | 发音错误不够采时,让模型在测试句上自己再学一步:SEA-MDD | SEA-MDD: Self-adapting Mispronunciation Detection and Diagnosis Models via Test-Time Training | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 962 | 查询保分辨率、键值做压缩:用分层池化吃掉语音时间冗余 | Leveraging Temporal Redundancy via Layer-wise Key-Value Pooling Attention for Efficient ASR | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 963 | 墙挡住声音时,如何让分散的麦克风拼出一条走得通的叙述 | Geometry-Informed Distributed Acoustic Scene Understanding | 5.9/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频理解 |
| 964 | 重音太轻听不出、太重又失真:三段式训练如何让流匹配语音学会用力恰当 | Refining Emphasis Control in Flow-Matching TTS via Preference Alignment and Reinforcement Learning | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 965 | 喉部太小又动得快:中矢面实时磁共振里怎样用很少标注分割喉部 | Larynx segmentation in mid-sagittal speech production real-time MRI | 5.9/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 966 | 不改模型参数,用多分辨率真伪判断来管住离散语音解码 | MSpoofTTS: Multi-Resolution Spoof-Guided Inference for Discrete Speech Synthesis | 5.9/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 967 | 连续预测加量化约束为何比离散分类更稳:两种编解码增强路径的对照 | Towards Robust Generative Speech Enhancement Using Vector Quantisation-Based Neural Audio Codec | 5.9/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 968 | 粗调音色、细调韵律:CtrlSpeech 如何把音高响度时长对齐到音素 | CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #文本到语音 |
| 969 | 看得见频率依据的伪造语音检测:分频带看破绽,门控融合补盲区 | Interpretable Frequency-Band Attention with Gated SSL Fusion for Audio Deepfake Detection | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 970 | 只给 5 个样例,能连续记住 1000 个词吗:生成式元持续学习的可扩展性检验 | Scaling few-shot spoken word classification with generative meta-continual learning | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 971 | 转录会错、动作测不了:用规则分加语音向量补救德语 SKT 痴呆筛查 | Mitigating Scoring Errors and Compensating for Nonverbal Subtests in Speech-Based Dementia Assessment | 5.8/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 972 | 分散阵列各自分离却对不上序号:用方向约束与分带源模型对齐去中心化向量分析 | Geometrically Constrained Decentralized Independent Vector Analysis for Distributed Microphone Arrays | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音分离 |
| 973 | 认对情绪却回错情绪:CE-CoT 用中性回答做对照来校准共情语音大模型 | CE-CoT: A Contrastive Empathetic Chain-of-Thought Training Strategy for Improving Emotion Consensus in Empathetic Speech LLMs | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音对话系统 |
| 974 | 从算波形差到听懂好坏:LR-AVSE 用大模型描述生成可解释奖励 | LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 975 | 缺一侧性别标签时,如何把另一侧的公平补回来 | Two-Sided Fairness Transfer for Gender-Neutral Speech Emotion Recognition with Partially Observed Attributes | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 976 | 音频不变只改身份描述:语音大模型情绪判断为何随之漂移 | Hidden Priors in Speech LLMs: Speaker Identity Shapes Emotional Perception | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 977 | 拼语料加自动算语速:库克群岛毛利语只有部分岛屿年轻人更快 | Automating Sociophonetic Research in Under-Resourced Languages: A Case Study of Speech Rate in Cook Islands Māori | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 978 | 长口语要同时听清怎么说、说什么和是否答题:M-LAMA 的结构化多模态评分 | M-LAMA: Multimodal Automated Scoring of Long-form Spoken English | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 979 | 穿墙雷达语音为何高频尽失:用级联注意力先守时间再补频谱 | Through-Wall Radar Speech Acquisition via Cascaded Attention Fusion | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 980 | 三小时单人语料做声调语言合成:Efik 语音保存为何选中多语言预训练路线 | Towards Digital Preservation of Efik: TTS for a Low-Resource African Language | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #文本到语音 |
| 981 | 同样的书,为何不同人读出不同的吸引力:有声书叙述声学特征的可核对解读 | Audio-Based Understanding of Audiobook Narration Appeal | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #音频理解 |
| 982 | 时间接近当标签:从自然语音里学心衰变化的方向 | Contrastive Time-Proximity Pre-Training for Speech-Based Heart Failure Monitoring | 5.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 983 | 指令监督不稳:用受控扩写保覆盖、用漂移过滤保忠实 | Stabilizing Instruction Supervision for Instruct-TTS via Controllable Diversification and Drift Filtering | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 984 | 不只看不确定性:用时频结构引导音频主动学习选样 | Beyond Uncertainty and Diversity: Temporal-Spectral Guided Active Learning for Audio | 5.8/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #音频分类 |
| 985 | 不用系统日志也能评对话质量吗:微调让系统无关特征追上系统相关特征 | A System-Agnostic Approach to Modelling Interaction Quality in Spoken Dialogue Systems | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音对话系统 |
| 986 | 压住能量掩蔽之后:调制释放如何抵消信息掩蔽与能量代价 | Mutual Cancellation between Masking Effects Benefits Speech Intelligibility | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 987 | 因果卷积前端能否在 10 毫秒内换来可部署的音素分类增益 | Lightweight Convolutional Front-ends for Real-time Framewise Phoneme Recognition in Cochlear Implants | 5.8/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 应用研究 | #音频分类 |
| 988 | 把停顿钉在文字上:用逐字转写加对齐让大模型判断构音障碍的不恰当停顿 | A Transcript-anchored Pipeline With Large Language Models For Detecting Inappropriate Pauses In Dysarthric Speech | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 989 | 几何算出两个相位候选,一致性迭代替你选:多源 Griffin-Lim 的相位修复 | An Investigation on Combining Geometry and Consistency Constraints into Phase Estimation for Speech Enhancement | 5.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音增强 |
| 990 | 没见过的增强与合成语音也能预测费力度:两个非侵入模型的跨任务泛化检验 | Deep learning-based predictions of perceived listening effort and intelligibility across enhanced, synthetic, natural, and binaural speech | 5.8/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 991 | 辅音保人,元音随语言:双语政治演讲的时间组织如何分工 | Speaker-Specific and Language-Dependent Temporal Organization in Bilingual Political Speech | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 992 | 跨语言借样本做判断:对齐、检索、融合如何补足构音障碍严重度数据 | Cross-lingual Retrieval-Augmented Classification for Dysarthria Severity Assessment | 5.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 993 | 合成语音的差评为何能帮构音障碍打分:MOS 监督的跨域增益与失配边界 | Augmenting Dysarthric Speech Severity Assessment with MOS Supervision | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 994 | 不微调也能抗背景:把目标原型投影到与背景正交的子空间 | POP-SED: Prototype Orthogonal Projection for Robust Few-shot Sound Event Detection | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 995 | 通话中途换人怎么办:用冻结大骨干加轻量投影做每 500 毫秒一次的持续验声 | A light weight Continuous Speaker Verification System for Real time Monitoring | 5.8/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.9/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #说话人验证 |
| 996 | 合成语音也能听出种族:听者偏向、刻板印象与可分类的声学差异 | Perceptual and Acoustic Correlates of Racial Identity in Text-to-Speech Voices | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 997 | 发声过强为何一半好分一半难分:静态分布、动态趋势与声气耦合的分层解法 | A Hierarchical Feature Engineering Framework for Automated Classification of Phonotraumatic and Non-Phonotraumatic Vocal Hyperfunction | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 998 | 把基频滤波当作语音增强:用 Wave-U-Net 直接提基频波形再求瞬时频率 | Instantaneous Pitch Estimation via Wave-U-Net-Based Fundamental Waveform Enhancement | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音高与旋律提取 |
| 999 | 单元数量管听懂,说话人条件管像谁:多语多说话人单元声码器的系统性拆解 | Multilingual Multi-Speaker Unit Vocoders: A Systematic Analysis of Discrete Speech Representations | 5.8/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音合成 |
| 1000 | 朗读与实拍之间:泰卢固语和马拉雅拉姆语恐同恐跨语音仇恨检测为何域一换就掉点 | The First Dravidian Speech Datasets for Transphobic and Homophobic Hate Speech: Creation, Annotation, and Multimodal Benchmarking | 5.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 数据集与基准 | #音频分类 |
| 1001 | 单空间去偏不够用时:用多阶段投影逐轮暴露音乐分类中的残留偏置 | Progressive Learnable Counterfactual Attention for Music Classification | 5.8/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 1002 | 用事件边界锁住注意力:BG-CRNN 如何在噪声中守住声音事件 | BG-CRNN: Boundary-Guided Dynamic Attention for Sound Event Detection in Complex Scenarios | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 1003 | 无干净目标时用带文本的噪声学增强:开关控制的双模式微调 | Text-Annotated Noisy Speech as Supervision: A Dual-Learning Framework for Target-Domain Clean-Free Speech Enhancement | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音增强 |
| 1004 | 辅音靠噪声、元音靠谐波:HWB-plus 为何把带宽扩展拆成两条路 | HWB-plus: A Lightweight Speech Bandwidth Extension Method with Separate Modeling for Consonants and Vowels | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音超分 |
| 1005 | 又快又抗噪的单音高估计:FCPE 用轻量卷积加上下文补全做基频分类 | FCPE: A Fast Context-based Pitch Estimation Model | 5.8/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 模型报告 | #音高与旋律提取 |
| 1006 | 只靠多语言覆盖不够:用连续发音特征补上零样本语音分类的声学现实 | Improving Zero-Shot Phonetic Classification through Language-Agnostic Articulatory Features | 5.8/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频分类 |
| 1007 | 说话人切换次数一变就掉线:把切换标记从自注意力里藏起来 | Multi-Talker ASR Unaffected by Speaker Change Count | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 1008 | 喊上去还是撑住:三种发声努力策略如何被斜率与聚类分开 | Vocal Effort Modulation Strategies: A Cross-Corpus Taxonomy with Noise Robustness and ASR Implications | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1009 | 以澳式英语为基准标差异:PRISM 如何把开放语音变成可复用的发音标注流程 | Pronunciation and Intonation Structured Markup (PRISM): A Dataset for Australian English Pronunciation Feedback | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 1010 | 各客户端说话人互不重叠时,用第二个分类头把全局知识带回本地 | A Federated Learning-Based Speaker Recognition Method with Dual Classification Heads | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人验证 |
| 1011 | 联邦说话人识别里只学关键维度:用费雪信息过滤全局嵌入的冗余 | Learning Global Key Knowledge for Federated Speaker Recognition via Fisher Information | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #说话人验证 |
| 1012 | 语速变快是谁听不懂:用贝叶斯项目反应理论把题目难度和人的能力分开 | Profiling Speech Rate Abilities of Visually Impaired Screen Reader Users by Bayesian Item Response Theory | 5.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 1013 | 不切边界怎么做重音判断:用分层卷积把语音帧压成音节表示 | Boundaryless Speech-to-Syllable Representations with Hierarchical CNN for Linguistically Inspired Automatic Stress Detection | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1014 | 去掉人口学捷径后,轻度认知障碍的语音检测还能准吗 | Fair Cognitive Impairment Detection Through Unlearning | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.2/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1015 | 有限数据下改提示还是改权重:结构化推理以零训练成本超越自训练 | Structured Prompting vs. Self-Training for Audio Reasoning Under Limited Data and Compute: Lessons from Interspeech Audio Reasoning Challenge 2026 | 5.8/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #音频问答 |
| 1016 | 录音不像自己:用可感知的低维滑块逼近自然自语音 | SELFIX: An Interactive System for Natural Self-Voice Approximation | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音转换 |
| 1017 | 词不够用时靠声音补:把音高和能量写进语音表示来解语用歧义 | Prosody-Aware Speech Representations for Emotion Recognition under Pragmatic Ambiguity | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 1018 | 矩形房间学到的声学知识,能搬到 L 形房间吗:冻结编码器只调解码器 | A Novel Transfer Learning Approach for Room Impulse Response Estimation and Speech Dereverberation Across Geometrically Diverse and Data-Scarce Environments | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #房间脉冲响应估计 |
| 1019 | 漂移不是单因素:用模块化诊断数据看鲁棒性如何获得、迁移与遗忘 | MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.9/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 1020 | 硬边界太脆:用时长感知的软目标建模音素过渡不确定性 | Duration-Aware Soft Targets for Text-Independent Supervised Phone Segmentation | 5.8/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 1021 | 先保住是谁,再改嘶哑程度:分阶段条件流把音高性别与气息嘶哑分开建模 | Hierarchical Conditional Continuous Normalizing Flows for Creaky Voice Editing under Speaker Identity Preservation | 5.8/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音编辑 |
| 1022 | 手能代替声道吗:卡西外部共鸣元音的三路证据与高基频代价 | Can Hands Articulate? Kinematic, Acoustic, and Perceptual Analyses of Vowel Production via External Resonators in Kaxi | 5.8/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 1023 | 性感化合成人格:当文本相同,女声仍被听成顺从与性感 | Sexualised Synthetic Personas Encode and Amplify Gendered Power Asymmetries through Voice | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1024 | 不用注册语音做条件:用混合语音自身的说话人吸引子引导潜在流匹配分离 | Latent Flow Matching Based Speech Separation Using Speaker Diarization | 5.8/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音分离 |
| 1025 | 用可懂度去调制声学通道:在冻结 HuBERT 上做构音障碍识别 | IACC-HuBERT: Intelligibility-Aware Channel Conditioning of HuBERT Frontend for Dysarthric Speech Conformer ASR | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.4/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 1026 | 继续预训练把内容推上去、把说话人推下来:离散单元与对比模型的分化 | Content–Speaker Trade-offs in Continued Self-Supervised Pre-Training Across SSL Paradigms for Multilingual Speech | 5.8/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 1027 | 编解码把真话推向假话一边:盯住难正例拉开边界 | Hard Positive-targeted Training for Robust Audio Deepfake Detection under Neural Codec Processing | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 1028 | 所谓语义码本为何更像语音:四种语音编码器的语义与语音 probing | Speech Codec Probing from Semantic and Phonetic Perspectives | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音编码 |
| 1029 | 语义越贴合说得越短吗:自发语音中语义相关度的非线性与频率依赖 | Non-linear Effects of Semantic Relevance on Word Duration in Spontaneous Speech | 5.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1030 | 口音藏在中间层:用均值偏移向量在推理时拨动大音频语言模型 | Activation Steering for Accent Adaptation in Large Audio Language Models | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #语音识别 |
| 1031 | 把一个人的 8 段发音连成一张图:多发音图学习为何在 ALS 分级上超过单段基线 | Multi-Phonation Graph Learning with Self-Supervised Speech Embeddings for ALS Detection and Progression Prediction | 5.8/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1032 | 听不懂也能听出情绪:人类与语音语言模型的跨语言情绪识别是否同构 | Universality of Speech Emotion Recognition in Humans and Speech Language Models | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音情感识别 |
| 1033 | 定长训练遇上变长语音:用时长嵌入去纠正自注意力的位置偏置 | Duration-aware self-attention for speech deepfake detection | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 1034 | 先破坏频域身份结构再保听感:FreqGuard 的主动语音防御 | FreqGuard: Leveraging Frequency-Domain Feature Priors for Universal Proactive Voice Defense | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音克隆 |
| 1035 | 跨库抑郁检测为何只在最后一层解耦不够:逐层压住说话人与语料依赖 | Layer-wise Multi-factor Adaptive Disentanglement for Cross-corpus Speech Depression Detection | 5.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1036 | 车里每人听各的:用人耳掩蔽去管多用户串扰的预编码 | Perceptually Weighted Minimum Mean Square Error Precoding for Acoustic Multi-User MIMO in Vehicular Personal Sound Zones | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #空间音频渲染 |
| 1037 | 拥挤声调空间里,纯音训练为何只救得了部分粤语声调 | Tone-space Distribution Modulates Transfer from Non-linguistic Pitch Training to Cantonese Tone-in-Noise Perception in Native Speakers | 5.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 1038 | 从声道协调谱看对话磨合:自发对话中发音卷入如何随时间分化 | Articulatory Entrainment and Coordination Complexity in Spontaneous Autistic and Non-autistic Dialogue | 5.8/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #语音对话系统 |
| 1039 | 记作相同却读作不同:厦门话变调与本调的次音位分化及三代分歧 | Acoustic Differences Between Citation and Sandhi Tones Across Three Generations in Xiamen Southern Min | 5.8/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1040 | 从词到时间图:把饼干失窃描述变成可计算的叙事轨迹 | Automatic Graphical Representations of Language for Dementia Detection | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1041 | 不足一小时音频如何发现音位:用类型学近亲做迁移的 VQ-VAE | Extreme Few-Shot Phoneme Discovery for Indigenous Australian and Pacific Languages via Typological Transfer Learning | 5.8/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音识别 |
| 1042 | 电视剧语音为何难转准:用视频上下文在解码之后再纠错 | Speech Recognition on TV Series with Video-Guided Post-ASR Correction | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音视频语音识别 |
| 1043 | 韩语字音转换错一个音,为何会拖慢整个语音合成训练:一个形态感知规则引擎的验证 | Uncovering the Impact of G2P Precision on Korean TTS: A Large-Scale Statistical Validation via a Novel Morphological Engine | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #文本到语音 |
| 1044 | 全局平均抹掉颤音:AcoustEmo 用话语对齐的声学窗口找回微韵律 | AcoustEmo: An Utterance-Aware Acoustic Q-Former for Open-Vocabulary Emotion Reasoning | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 1045 | 理解与生成分开测:UG-Bench 如何同时称量大音频语言模型的耳朵和嘴巴 | UG-Bench: A Comprehensive Benchmark for Evaluating Large Audio-Language Models | 5.8/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.9/1.5 · 清晰度 0.6/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频理解 |
| 1046 | 咳嗽里找结核:互补表示为何要先对齐再加权融合 | From Signals to Patterns: Non-Invasive Tuberculosis Detection from Cough Audio using Bandit Weighted Hyperbolic Prototypes | 5.7/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 1047 | 用可编程凸轮搬动声道积木:物理模型如何做出鼻化协同与丛集 timing | Articulatory Dynamics using Physical Vocal-tract Models | 5.7/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音合成 |
| 1048 | 干净语音能否替代扫描仪内语音做声道轮廓反演 | Acoustic-to-Articulatory Inversion of Clean Speech Using an MRI-Trained Model | 5.7/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1049 | 先搭架子后修细节:音频分离大模型注意力动态的因果解剖 | Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models | 5.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分离 |
| 1050 | 矢状面定位病态问题中空间先验与声源先验谁在起作用 | Bayesian Model-Based Assessment of Spatial and Source Priors in Sagittal-Plane Sound Localization | 5.7/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #声源定位 |
| 1051 | 男性声道更参差,所以更好认?从形态参差看说话人识别性别偏差 | Vocal Tract Disparity and Potential Implications for Speaker Recognition | 5.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #说话人识别 |
| 1052 | 语种识别怕微小扰动:用自我蒸馏把对抗样本变成语言关系的训练信号 | Improving Adversarial Robustness in Spoken Language Identification through Self-Defensive Distillation | 5.7/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语言识别 |
| 1053 | 注意力块减半仍可用:逐头通道剪枝如何用二阶分数留住重要维度 | The silence of the weights: a structural pruning strategy for Attention-based audio signal architectures with second-order metrics | 5.7/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音频分类 |
| 1054 | 在配对控制下听出压力:TSST 语音能区分情境并预测皮质醇与消极情绪吗 | Automatic Detection of Stress from Speech in the Trier Social Stress Test | 5.7/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #音频分类 |
| 1055 | 盯住波兰语咝音最小对立:用带括号替代标记的识别加对齐做可核查筛查 | Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1056 | 看得见的脸没有增强爱尔兰语合成语音的情感:声音主导但视觉负责细分 | Exploring the Effect of the Visual Channel in Vocal Expression of Affect in an Irish (Gaelic) Synthetic Voice | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音合成 |
| 1057 | 自动对齐何时算够用:TIMIT 元音上 token 量与声学测量稳定点的实证 | Minimum Token Thresholds and Stabilisation for Reliable Automatic Vowel Alignment: Empirical Study on TIMIT Vowels and MFA | 5.7/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #强制对齐 |
| 1058 | 感冒不重,声纹却漂移:中等症状下的说话人嵌入稳定性检验 | Common Cold Corpus: Health-Aware Robustness Study of Modern Speaker Embeddings Under Physiological Domain Shift | 5.7/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 数据集与基准 | #说话人验证 |
| 1059 | 分支各补短板:按感受野交叉分配注意力的声场景分类 | Branch-wise Complementary Attention for Acoustic Scene Classification | 5.7/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #声学场景分类 |
| 1060 | 犹豫不是噪声:把停顿、重复留在口语纠错输入里 | Exploring Hesitation as a Signal for Spoken Grammatical Error Correction | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #口语理解 |
| 1061 | 病理模型与人耳听判为何在不同语言和性别上对不上:阿尔茨海默语音线索的分组审计 | Disentangling Acoustic Cues in Alzheimer’s Pathology and Perception: The Roles of Language and Gender | 5.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1062 | 把整数帧序号揉软:用局部声学上下文扭曲旋转位置的 CD-RoPE | Convolutional Dynamic Rotary Positional Encoding | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 1063 | 先变多再变稳:用无监督音节发现刻画 5 到 15 岁发音发展的三条曲线 | How does children’s pronunciation develop? Capturing syllabic change with children’s growth using unsupervised syllable discovery | 5.7/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1064 | 声音不够时看脚步:用轨迹上下文补足医院压力检测 | Stress Detection Across Daily Activities: A Context-Aware Multimodal Framework with Trajectory and Ambient Speech | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 1065 | 先在话语内对齐模态,再沿说话人拆分情绪动力:MF-EDM 的两阶段图建模 | MF-EDM: Graph-based Multimodal Fusion and Emotional Dynamics Modeling for Emotion Recognition in Conversation | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 1066 | 不只补数据、要补认知痕迹:用检索约束文本再对齐语音的 AD 增强 | Cognitive-Heuristic Guided Multimodal Data Augmentation for Alzheimer’s Disease Detection Using LLM and TTS | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1067 | 生成式空间音频指标为何对角度不敏感:响应度、平滑度与对称性的灵敏度检验 | Sensitivity Analysis of Generative Spatial Audio Metrics : A Study on Responsiveness, Smoothness, and Symmetry | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音频生成 |
| 1068 | 多增强一起训为何互相拆台:以干净梯度为锚同时治方向与大小 | GradHarmony: A Gradient Alignment and Magnitude Normalization Strategy for Audio Deepfake Detection | 5.7/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.1/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频深度伪造检测 |
| 1069 | 模型算出的声音像不像人听到的像:43 个语音基础模型的说话人相似度对齐检验 | Do speech foundation models perceive speaker similarity as humans do? | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1070 | 呼气相对吸气响了多少:哮喘听诊位置、频带与年龄性别如何共同决定声学与气流受限的相关 | An auscultation location specific study on the relationship between expiratory-to-inspiratory acoustic patterns and spirometric airflow limitation across age and gender in asthmatic patients | 5.7/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音频理解 |
| 1071 | 保住小权重的语音细节:PhonePrune 如何用音素三元组做一次性剪枝 | PhonePrune: One-shot Phoneme-Aware Pruning for Large-scale ASR Models via Phoneme Set Generation and Calibration | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 1072 | 纳卡纳曼加语元音长短是音位对立吗:用时长分布与混合模型验证五组长短配对 | Phonetic evidence for contrastive length in Nakanamanga monophthongs | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1073 | 先粗降噪再对齐干净隐空间:轻量模型如何跨过真实远场分布鸿沟 | Bridging the Distribution Gap in Real-World Far-Field Speech Enhancement via Lightweight Latent Representation Alignment | 5.7/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #语音增强 |
| 1074 | 给说话倾向加先验:贝塔神经 FCASA 如何把远场 diarization 做成完全贝叶斯 | Neural Multichannel Distant Speaker Diarization and Source Separation with Beta Speaker Activity Prior | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #说话人分离标注 |
| 1075 | 不用人打分,能从 TTS 训练过程本身学到质量排序吗:TDScore 解读 | TDScore: Learning Synthetic Speech Quality Predictors from TTS Training Dynamics without Human annotation | 5.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 1076 | 弱读不是删除:wav2vec 2.0 与 Whisper 如何保留辅音丛的底层塞音线索 | Layer-wise Probing of wav2vec 2.0 and Whisper for Consonant Cluster Reduction in African American English | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1077 | 自动笑声标注还不够准:笑声识别误差如何传导到两种合成器的自然度与笑法还原 | Evaluating Automatic Laughter Phone Annotation for Socially-Situated Laughter Synthesis | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音合成 |
| 1078 | 不是比谁分高:用语音特征反解生物声学嵌入到底记住了什么 | Beyond task performance: Decoding bioacoustic embeddings with speech features | 5.7/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频分类 |
| 1079 | 把标注分歧留下来:用熵感知课程学习九类语音情感分布 | Learning from Annotation Uncertainty: Entropy-Aware Curriculum for Speech Emotion Recognition | 5.7/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 1080 | 不混成一路单声道:把视频拆成可编辑事件再做双耳渲染 | Listening to Motion in Space: Vision-Grounded Event-wise Video-to-Audio Generation and Rendering | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.4/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.2/1.5 | 前50% | 系统技术报告 | #视频到声音生成 |
| 1081 | 组平均显著、个人却各走各路:嗓音品质声学关联的说话人依赖 | Acoustic correlates of voice quality settings: variation within and between individual speakers | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1082 | 双语发音动作能从语音自监督表示中线性读出吗:芬兰语与俄语 EMA 的跨语言探测 | How Bilingual Are SSL Speech Models? Cross-Lingual Probing of Articulatory Encoding with Finnish and Russian EMA | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1083 | 议会里谁更常嗯啊:四国近四千小时验证填充停顿的年龄语速与性别反转 | Umm... With Transformers? Insights from Filled Pause Use across Four Slavic Parliaments | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音频事件检测 |
| 1084 | 只量嗓音起始时间不够:澳大利亚英语塞音松气后还藏着一段气声 | An investigation of post-stop breathiness in Australian English | 5.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1085 | 推断错了也不安全:说话人属性组合为何仍能单挑出你 | Voice Privacy from an Attribute-based Perspective | 5.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #说话人匿名化 |
| 1086 | 从全局向量到事件序列:CoSTALA 如何对齐空间音频的多事件时空组合 | CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning | 5.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音频检索 |
| 1087 | 用演戏游戏收集韵律语音:更难的情感识别与藏不住的说话人信息 | From Game-Based Annotation to Representation Probing: Cross-Validated Prosodic Speech and Privacy Implications | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音情感识别 |
| 1088 | 不用切音素也能打分:用老师语音做参照的偏差建模 | ALFreeD: Teacher-Guided Few-Shot Pronunciation Assessment via Segmentation-Free Deviation Modeling | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音质量评估 |
| 1089 | 语气与内容打架时还能轻量判断:互不干扰的三路情感分类 | Lightweight Emotion Recognition with Disjoint Modality Fusion | 5.7/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 0.2/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音情感识别 |
| 1090 | 只给片段标签,也要学会逐帧定位:多实例学习做口吃分类与切分 | Stuttering Classification and Segmentation with Attention-Based Multiple Instance Learning | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 1091 | 侧方听不清:用头戴偶极麦克风阵列把侧向语音捞出来 | Head-Worn Dipole Microphone Array-based Speech Enhancement System for Single-Sided Deafness | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音增强 |
| 1092 | 同音不同形:时间归一化频谱如何暴露音段层面的发音差别 | Time-normalized spectrograms reveal segmental differences in English heterographic homophones | 5.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频分类 |
| 1093 | 说话人嵌入太紧了反而不利生成:用多子中心保留同一人的多样性 | Rethinking Speaker Embeddings for Speech Generation: Sub-Center Modeling for Capturing Intra-Speaker Diversity | 5.7/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音转换 |
| 1094 | 冻住大模型、只练小适配器:用分层专家应对构音障碍严重程度差异 | Clinically-Supervised Hierarchical LoRA-MoE: A Parameter-Efficient Framework for Severity-Aware Dysarthric Speech Assessment | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1095 | 是认出了抑郁,还是认出了说话人:重叠划分如何抬高抑郁检测分数 | Who is Speaking or Who is Depressed? A Controlled Study of Speaker Leakage in Speech-Based Depression Detection | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1096 | 不看源数据时多设备声场景如何对齐:先校准偏置再按一致性加权 | Robust Multi-Source-Free Domain Adaptation via Posterior Adjustment and Label Agreement | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #声学场景分类 |
| 1097 | 日常噪声里嗓音如何被推着走:发声过强亚型的伦巴德效应为何要看音质 | Modeling Lombard Effects in Voice Disorders Using Daily-Life Monitoring of Ambient Noise and Voice Acoustics | 5.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1098 | 把诊室里的发声效率搬到日常生活中:用颈表振动估压力、用麦克风测声压 | Measuring Vocal Efficiency in Daily Life in Patients with Voice Disorders Using Wireless Accelerometer and Microphone Sensors | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1099 | 抑郁线索稀疏而不均匀:用跨模态门控重新分配帧权重 | Learning to Attend to Depression-Related Patterns: An Adaptive Cross-Modal Gating Network for Depression Detection | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1100 | 只用两个声学特征就能考高分:ADReSS 系列测试集的乐观偏差从何而来 | Rethinking Acoustic Variability Of ADReSS and ADReSSo Datasets For Dementia Detection | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1101 | 声门闭合不是硬裁剪:用软接触与软分离重写几何声带振动 | Improved modeling of vocal fold contacting and de-contacting in a geometric vocal fold model | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音合成 |
| 1102 | 把语气听进去再回话:PRISM 用四智能体拆开感知、推理与合成 | PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue | 5.7/10 · 创新 1.3/2 · 技术严谨 0.9/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音对话系统 |
| 1103 | 从能读到能听:日语语音大模型为何要重学说话方式 | Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音对话系统 |
| 1104 | 不用蒸馏也能解耦:CycleCodec 用换说话人再换回来约束内容流 | CycleCodec: Distillation-Free Factorized Neural Speech Codec via Cycle-Consistent Speaker Swapping | 5.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音编码 |
| 1105 | 不用反向传播做语音切分与分类:稀疏装配动力学如何同时管何时与是什么 | Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies | 5.6/10 · 创新 1.5/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频事件检测 |
| 1106 | 一边按场景换写法,一边按场景换判分:对称双专家如何协调音频描述的生成与奖励 | Context-Adaptive Automated Audio Captioning with Symmetric Dual-MoE and Dynamic Reward Routing | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频字幕生成 |
| 1107 | 不出声也能画像:联邦语音模型权重差如何泄露口音与年龄 | Personal Attribute Leakage in Federated Speech Models | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1108 | 双语者向真人与语音助手靠拢吗:元音时长与嗓音起始时间的影子实验证据 | Bilingual Speaker Phonetic Alignment to Voice Assistants | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1109 | 把构音无力从混合嗓音里剥出来:用健康 EMA 学一维运动轴 Za 再算 AWI | Toward an Articulatory Weakness Index for Speech Kinematics in Parkinson’s Disease | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1110 | 语码转换听起来不一样:自发西英双语韵律偏离单语的证据与边界 | The Sound of Code-Switching: Prosodic Profiles of Spontaneous Spanish-English Speech | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语言识别 |
| 1111 | 匿名后还能评分吗:轻量变声对交际特征的保留与识别补偿 | Privacy vs. Performance: Assessing Communication Utility of Anonymized Voice Features | 5.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 应用研究 | #说话人匿名化 |
| 1112 | 组合才显形:指令语音中多维社会线索如何绑定成性别偏置 | The Binding Effect: Analysis of How Multi-Dimensional Cues Form Gender Bias in Instruction TTS | 5.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #文本到语音 |
| 1113 | 对人还是对 AI 说话:粤语对话中时长与声调的细粒度调整 | Modulation of Phonetic Realizations in Cantonese Dialogue with Human and AI Interlocutors | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音交互 |
| 1114 | 先对齐再分离:以文本为锚把讽刺的言外冲突拆出来 | T-ORR: Text-Anchored Orthogonal Residual Rectification for Robust Multimodal Sarcasm Detection | 5.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音视频理解 |
| 1115 | 微型扬声器低频易过冲:用频响增益约束训练固定滤波器 | Active Noise Control With a Gain Constraint for Micro-Loudspeakers | 5.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #主动降噪 |
| 1116 | 双人协作对话中时间压力可听见,脑力负荷却藏在轮替不均里 | Predicting Cognitive Load from Speech and Interaction Dynamics in Dyadic Conversations | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1117 | 用可控的喊声拉开下颌:ArtComp 如何记录瑞典元音的自然扰动与补偿 | The ArtComp dataset: Articulatory and Acoustic Measurements of Swedish in Speech with Naturally Manipulated Jaw Position | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 1118 | 小塞音库如何保持清音短延迟:三种法属波利尼西亚语言的 VOT 与浊音证据 | Oral stop realisation in three French Polynesian languages | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1119 | 听人语音上训练的语音 AI 为何在聋人语音前失效:可用、可验证与优雅降级的立场解读 | Bridging the Speech AI Accessibility Gap for Deaf and Hard of Hearing People | 5.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音识别 |
| 1120 | 词错了意思还在吗:多语言语音识别中语言维度如何联合决定语义保留 | How Linguistic Dimension Interactions Shape Meaning Preservation in Multilingual ASR | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音识别 |
| 1121 | 按语系组织数据能否让自监督语音模型更好地泛化到低资源语言 | Genealogical Priors in Self-Supervised Learning: Improving Speech Technology for Low-Resource Languages | 5.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语言识别 |
| 1122 | 不问老人、只学专家:用在策略奖励学习缓解慢速偏执的长辈语音合成 | Imitation Learning for Elder-Facing Speech Synthesis | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #文本到语音 |
| 1123 | 谁更可信谁多说话:用阈值边距做免训练的逐试次分数门控 | Soft-Gating Score-Level Fusion for Spoofing-Aware Speaker Verification | 5.6/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #说话人验证 |
| 1124 | 低资源纠错是真学会还是背过答案:西弗里斯兰语的污染可控检验 | Can Large Language Models Reliably Correct Errors in Low-Resource ASR? A Contamination-Aware Case Study on West Frisian | 5.6/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音识别 |
| 1125 | 情感一变口音就跑偏:说话人相似度高分为何藏不住口音幻觉 | Accent-Emotion Entanglement in LM-Based Text-to-Speech Systems | 5.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #文本到语音 |
| 1126 | 神经转码盖不住旧痕迹:从 RVQ 离散序列中追溯传统编码器来源 | Tracing the Origins: Legacy Codec Identification in Neural Audio Transcoding | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #音频分类 |
| 1127 | 固定发音任务里仍有语言偏移:用健康人均值平移来救跨语言帕金森构音障碍检测 | Adapting Self-Supervised Speech Representations for Cross-Lingual Dysarthria Detection in Parkinson’s Disease | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1128 | 先计划再确认:流式多模态 Q-Former 如何在线生成机器人动作 | Plan and Double-Check: Streaming Multimodal Q-Former for Online Robot Action Generation | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.4/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #音视频理解 |
| 1129 | 黄獴叫声太难标:先用音节特征分幼体叫声,再用高召回检测帮标注员圈野外录音 | Exploratory analysis of yellow mongoose vocalization: detection from in-the-wild recordings and call classification | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #音频分类 |
| 1130 | 词身份可分不等于学到词:减去音素后还剩多少词信息 | Do speech foundation models really learn words? | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.9/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 前50% | 方法研究 | #音频分类 |
| 1131 | 听不懂时靠什么断句和找重音:德语与匈牙利语听者感知乌尔都语的对比 | The (non-)universality of prominence and Intonation Phrases: German and Hungarian listeners’ perception of an unfamiliar language | 5.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1132 | 拟合快不等于贡献大:多模态情感分析中优化平衡方法的幻觉 | The Illusion of Balanced Multimodal Sentiment Analysis: Beyond the Limits of Optimization-Based Methods | 5.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 1133 | 量表会漂,客观测量更稳:早期帕金森语音与视频生物标志物的安慰剂抗扰性检验 | Speech and Video Biomarkers Exhibit Reduced Within-Subject Variability in Early Parkinson’s Disease and Resistance to Placebo and Hawthorne Effects | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1134 | 从注意力里找证据:用低熵头锁定语音识别依据的 LEAF-X | Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音识别 |
| 1135 | 没见过真骗子时靠什么识破电话诈骗:跨域稳定的韵律特征与自监督表示的冷启动对决 | Comparing Self-Supervised and Domain-Invariant Features for Cross-Domain Voice Phishing Detection | 5.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音频分类 |
| 1136 | 把一句手术口令拆成方向、模式和步数:用顺序回归压住大步长误动作 | Surgical-Robot Command Spotting: Safety-Aware Learning for Compositional Commands | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #关键词检测 |
| 1137 | 强拍放大、弱拍衰减:BeatGain 以度量位置重塑人工耳蜗音乐节奏 | BeatGain - A Rhythmic Pattern Enhancement Algorithm for Music Listening with Cochlear Implants | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #音乐源分离 |
| 1138 | 少而精才能出声:为毛利语做伦理可控的高质量合成语音 | Indigenising Speech Technology: Building a TTS Model for te Reo Māori | 5.6/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 1.1/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 数据集与基准 | #文本到语音 |
| 1139 | 打手势能把重音说得更清楚吗:粤语儿童焦点韵律的手势效应与自闭症组差异 | Effects of Co-speech Gesture on the Acoustic Realization of Focus in Cantonese-speaking Children With and Without Autism Spectrum Disorder | 5.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1140 | 一阶池化丢掉通道协同,流形上的二阶相关如何补回情绪判别力 | Geometric Second-Order Feature Correlation Learning for Self-Supervised Speech Emotion Recognition | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 1141 | 同一组声调在不同元音里为何长得不一样:三高度与四高度湘方言的证据 | Tonal Contrasts in Different Vowel Contexts and Different Tonal Systems | 5.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1142 | 响度推人、语速推模型:正交合成语音拆解讽刺感知的线索权重 | What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1143 | 句子重读与词重读分开建模为何不够:冻结骨干上的双头与词跨度约束 | A Novel Sentence Stress Detection Framework Leveraging Auxiliary Word-Stress Modeling and Loss Optimization | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1144 | 在家也要说白人话:澳大利亚原住民英语使用者与语音技术的错位 | ‘I have to talk proper white ways’: Australian Aboriginal English Speakers’ Experiences with Voice Technologies | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音识别 |
| 1145 | 原始波形学错了什么音:把总错误率拆到音类再看时序与数据的作用 | Phonetic Error Analysis of Raw Waveform Acoustic Models | 5.6/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音识别 |
| 1146 | 隐私与性能难以兼得时,原型对齐如何在联邦抑郁检测中稳住多模态表示 | FedMPA: A Novel Privacy-Performance Optimization Approach for Multimodal Speech-Based Depression Detection | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1147 | 老年普通话声调为何更易混:音高集中、轮廓展平与 T2-T3 双向混淆 | Age-Related Changes in Mandarin Lexical Tone Production: Acoustic Properties and Tonal Distinctiveness | 5.6/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #音频分类 |
| 1148 | 看不见的语言也能借力:用施主 LoRA 初始化受体 LoRA 的跨语言迁移 | Probing LoRA-to-LoRA Cross-Lingual Transfer for Unseen Low-Resource Conditions in Whisper-Based ASR | 5.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音识别 |
| 1149 | 质量分数真在做决策吗:冻结融合下的错位打乱检验 | When Does Quality-Aware Multimodal Fusion Matter? A Leakage-Safe Diagnostic for Decision-Level Dependence | 5.6/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.4/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 1150 | 极少样本下既要学会新语种又不能忘记旧语种:两种混合持续学习如何分工 | Hybrid Continual Learning for Low-Resource Australian Aboriginal Language Identification | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语言识别 |
| 1151 | 离得近才帮得上:用声音和语言特征为 Warlpiri 选跨语言 ASR 迁移源 | Which Languages Transfer Best to Warlpiri? A Similarity-Based Study for Low-Resource ASR | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音识别 |
| 1152 | 只看过去才能像人一样听:因果约束决定语音识别的竞争时间线 | Do Machines Listen Like Humans? A Temporal Benchmark for Phonological Competition in End-to-End ASR | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 数据集与基准 | #语音识别 |
| 1153 | 不追母语腔,只保听得懂:用音素替换误差预测可懂度并排序 | Automatic Assessment of L2 Speech Intelligibility: Segmental Error Ranking | 5.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音可懂度评估 |
| 1154 | 附和声是让话继续还是把话接走:荷兰语中句法完整与边界调前的证据 | Returning the Turn: Do Backchannels Pattern More Like Turn-Holds or Turn-Changes Given Preceding Syntactic Completion and Boundary Tones? | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #轮次切换 |
| 1155 | 基频轮廓相似是即时模仿还是随年龄减弱的迁就:三语纵向语料的动态时间规整检验 | Dynamic Time Warping Reveals Prosodic Alignment in Caregiver–Child Interactions across Languages | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1156 | 模态重要性不是常数:用情绪查询门控刻画对话时间上的动态权重 | Modality Importance is Not Static: Temporal Dynamics via Gating in Multimodal Emotion Recognition | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 1157 | 带渐变语音细节的儿向语切词为何没有想象中难 | Gradient phonetic detail is less detrimental to word segmentation in infant-directed speech | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音识别 |
| 1158 | 日记里说的是什么比怎么说的更能猜中今天的心情 | Daily Affect Inference from Longitudinal Speech-based Journals: A Comparison of Acoustic and Linguistic Models | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 数据集与基准 | #语音情感识别 |
| 1159 | 同语不同域就该拉得轻一点:半正样本对比如何约束语言聚类 | Robust Language Identification Using Semi-positive Contrastive Learning | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语言识别 |
| 1160 | 难对太少见、尾部总失败:用在线难度矩阵把采样从均匀推向难对 | Adaptive Hard-Pair Sampling via Curriculum Learning for Speech Separation | 5.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音分离 |
| 1161 | 机器味反而更清楚:当听者预期改变了对合成韵律边界的感知 | Should Robots Sound more like Machines than like Humans? User Expectations Affect the Perception of Prosody in TTS Voices | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 1162 | 没有框标注时,如何让声音自己长出物体边界:EchoLoc 的热图与框联合定位 | EchoLoc: Audio-Aware Object Grounding via Joint Heatmap and Box-Level Localization | 5.6/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #声源定位 |
| 1163 | 词错误率相近不等于错得一样:零样本儿童语音中表示层的误差分化 | Error Diversity and Performance Variability in Zero-Shot Children’s Speech Recognition | 5.6/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.2/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 1164 | 耳朵为主、眼睛和文字为辅:MER-Live 如何证明情绪是听出来的 | MER-Live: An Interactive Browser Demo of Prosody-Driven Multimodal Emotion Recognition | 5.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.2/1.5 | 前50% | 系统技术报告 | #语音情感识别 |
| 1165 | 高水平巴斯克语口语能分清吗:mHuBERT-147 与 wav2vec 2.0 的 C1 二分类对照 | Discriminating Proficiency Levels in L2 Speech: A Comparative Study of Self-Supervised Models in Basque | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1166 | 只用 250 小时学会 67 种语言的声音:掩码预测为何聚类说话人强、认语言弱 | BiMamba2 Masked Discrete-Unit Prediction for Multilingual Speech Representation for Unsupervised Speech in the Wild Challenge | 5.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #说话人识别 |
| 1167 | 静音中段与清化元音下日本人听辨英语/iː/–/ɪ/:时长与促音偏置为何压过频谱残留 | Perception of English /iː/–/ɪ/ by Japanese Listeners under Silent-Centre and Devoiced Vowel Conditions | 5.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音频分类 |
| 1168 | 听起来都对的波兰语/s/:词位置如何系统改变儿童擦音频谱 | From onset to coda: spectral variation in normative Polish /s/ produced by children | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1169 | 把嗓音维度拆开讲:合成样例为何只让粗糙感的辨别真正提升 | Can deep learning based voice editing enhance voice quality perception skills in speech therapy students? | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音编辑 |
| 1170 | 只用 13 分钟电喉语音:先学会合成电喉声,再学着把它变回自然声 | One-to-Many Electrolaryngeal Voice Conversion with Synthetic Data | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.4/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音转换 |
| 1171 | 不对齐标签而累积特征:用时间平均的群延迟代替显式移位 | Revisiting Delay Compensation via Feature-Level Temporal Accumulation in Continuous Emotion Recognition | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音情感识别 |
| 1172 | 只用几秒提示音做强化适配:VoiceTTA 如何补上少见口音与夸张韵律的模仿缺口 | VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation | 5.6/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #文本到语音 |
| 1173 | 函数链接展开的冗余才是瓶颈:用重加权零吸引在鲁棒非线性有源降噪中做在线特征选择 | A Sparsity-Aware Robust Nonlinear Active Noise Control for Impulsive Noise Environments | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #主动降噪 |
| 1174 | 对话里学声音:连贯对话提高命中也提高误报的反应偏向效应 | Learning speaker identities in dialogue: Conversational familiarisation modulates response bias and confidence in voice recognition | 5.6/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #说话人识别 |
| 1175 | 不换求解器换算子:用声道形状直接算出稳态发声的物理信息神经算子 | Physics-Informed Neural Operator for Speech Production Analysis | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音合成 |
| 1176 | 词频省时间、音节省口舌?单双音节德语整句产出中的加性预期与选择性交互 | How do word frequency and syllable surprisal affect response time and acoustic duration in sentence formulation? | 5.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1177 | 普通话先验拉偏方言词:用跨度级偏好把最强的同音竞争者压下去 | DASR-CPO: Reference-Free Contrastive Preference Optimization for Correcting Mandarin Semantic Drift in Low-Resource Chinese Dialect ASR | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音识别 |
| 1178 | 整体三区格局稳定、焦点后压缩随年龄变强:江淮官话焦点韵律的老化解读 | F0 realization of prosodic focus across adulthood in Jianghuai Mandarin | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1179 | 从左到右并非最优:用掩码扩散揭示语音合成的解码顺序效应 | Decoding Order Matters in Autoregressive Speech Synthesis | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #文本到语音 |
| 1180 | 测量点稀少时,用日常双耳声音补上数据库检索不到的个人线索 | SA-HRTF: A Sound-Assisted Approach to Personalized HRTF Modeling | 5.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #空间音频渲染 |
| 1181 | 平均情感不够用:用交互式遗传算法把 A-V 坐标调到每个人听起来对的位置 | Beyond One-Size-Fits-All: Personalized and Culturally Adaptive Emotional TTS via Interactive Optimization of Individual Emotion Perception Spaces | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #文本到语音 |
| 1182 | 扰动把语音表示的局部邻域撑大了多少:用层级 LID 同时看几何变形与识别退化 | GRIDS: Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 方法研究 | #异常声音检测 |
| 1183 | 一个门控同时管三件事:Whisper 何时该转写、何时该闭嘴 | A Gated Multi-Task Whisper Framework for Speech, Emotion, and Scene Understanding | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音识别 |
| 1184 | 去掉哪条共振峰最伤可懂度:声码器模拟下 F2 主导但频带数会改写排序 | Relative Importance of Formants to the Intelligibility of Vocoded Speech in Cochlear Implant Simulation | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 1185 | 高频词好用却不可信:用 156 个功能词重做与主题无关的说话人用词证据 | Function words: a topic independent approach to word n-gram selection for forensic speaker comparison | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #说话人验证 |
| 1186 | 鼻式电子喉语音更难转清:为何梅尔谱守住鼻腔共振而自监督特征偏向颈式喉 | A Preclinical Study of Electrolaryngeal Voice Conversion for a Novel Nasal Electrolarynx: Feature Choice and Data Augmentation | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.9/1.5 | 前50% | 应用研究 | #语音转换 |
| 1187 | 语音事实存在哪:先用语音因果追踪定位再跨音频与文本编辑 | Localizing and Editing Knowledge in Large Audio-Language Models | 5.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频问答 |
| 1188 | 跨语言朗读时间结构:用六个时长特征合成亨廷顿病语音指数 | A multilingual composite speech index to assess passage reading in Huntington’s disease | 5.5/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1189 | 只听辅音不够:Warlpiri 五处塞音分类为何需要元音中点的变体信息 | Vowel Allophony Improves Maximum-Likelihood Classification of Warlpiri Consonants | 5.5/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音频分类 |
| 1190 | 滑还是不滑:意大利语与罗马尼亚语中双元音与裂音的声学渐变 | To glide or not to glide: Acoustic realization of the diphthong-hiatus contrast in Italian and Romanian | 5.5/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1191 | 系统平均分好看不等于每位说话人都好:编解码失配与检材时长如何共同拖累取证说话人识别 | Codec-induced Mismatch, Speech Duration, and Speaker-dependent Effect in a DNN-based Forensic Speaker Recognition System | 5.5/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 应用研究 | #说话人验证 |
| 1192 | 用可控振荡建模急促韵律:OscillaTTS 如何改写扩散 TTS 解码器的激活函数 | Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS | 5.5/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #文本到语音 |
| 1193 | 单音可接受的变体,为何放进双元音就被拒:毛利语可接受发音区间的三源三角验证 | Mapping Acceptable Pronunciation Range for te reo Māori through Perceptual, Acoustic, and Marker Evaluative Data | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音质量评估 |
| 1194 | 混响把嗓音质量测偏了:盲去混响能否把排序拉回来 | From Echo to Accuracy: Robust Voice Quality Assessment Using Blind Unsupervised Diffusion-based Dereverberation | 5.5/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音质量评估 |
| 1195 | 几何对齐了,映射却没有:咽腔锚定的跨说话人 EMA 归一化为何止步于一维 | Acoustic Pharyngometry as an Auditable Anchor for Cross-Speaker EMA Normalization | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #说话人识别 |
| 1196 | 是换了语言更有魅力,还是换了人:双语政治演讲中说话人与语言的方差之争 | Speaker or Language? Explaining Variance in Charismatic Prosody Across Luxembourgish and French | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1197 | 子带倒谱能定位说话人信息吗:日语/saN/三个音段的取证比对 | Sub-band Cepstral Analysis of Speaker-Specific Information: A Case Study of Japanese Word /saN/ | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #说话人验证 |
| 1198 | 认知衰退混杂下抑郁声音何以辨认:以共时临床评估锁定共振峰 | Disentangling Depression from Cognitive Decline in Elderly Speech Using Concurrent Clinical Assessments | 5.5/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1199 | 口吃者听辨并不差,只是建类与取用方式不同:一次放大的软腭音 VOT 实验 | Voice Onset Time Categorical Perception in Mandarin-Speaking People Who Stutter: A Zoom-In Nonword Study | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #音频分类 |
| 1200 | 噪声转写打歪语义时,用冻结教师把学生拉回干净流形 | ML-KD-DRI-GAN: Teacher-Guided Denoising and Triplet-Adversarial Training for Robust Spoken Language Understanding | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #口语意图与槽位识别 |
| 1201 | 频率带重要性如何左右语音质量网络与人耳:低频依赖与负向敏感的对照 | How Frequency Band Importance Affects Neural Network Predictions and Human Perception for Speech Quality Assessment | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 前50% | 应用研究 | #语音质量评估 |
| 1202 | 轨迹比端点更诚实:八次治疗里声音如何分叉 | Analyzing Longitudinal Vocal Changes During Cognitive Behavioral Therapy for Hikikomori Patients | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1203 | 不用再训练检测器:用跨模型归因约束多模态大模型说出伪造在哪 | XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音伪造检测 |
| 1204 | 把一句话拆成四条流:多尺度残差如何让低码率编解码器分开内容、音色与韵律 | MSR-Codec: A Low-Bitrate Multi-Stream Residual Codec for High-Fidelity Speech Generation with Information Disentanglement | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音编码 |
| 1205 | 不靠人工标注也能定出可信的韵律边界:用长停顿锚点加弱监督推出连续强度 | High-Precision Prosodic Boundary Anchors from Acoustic Cues under Weak Supervision | 5.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1206 | 只用基频做声调识别:主分支推理、辅助分支只在训练时帮忙 | Learning Contextualized Tonal Contours from F0: A Core-Auxiliary Branched Transformer for Mandarin Tone Recognition | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1207 | 平淡语调才见分晓:主观认知下降削弱高层语音追踪而非听觉包络 | More than a feeling: Expressive style influences cortical speech tracking in subjective cognitive decline | 5.5/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #言语神经解码 |
| 1208 | 出声、默动与想象说话是否共享可迁移的神经表征 | Relating the Neural Representations of Vocalized, Mimed, and Imagined Speech | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #言语神经解码 |
| 1209 | 从一对一对齐到多对多包含:ProLAP 用概率分布学音频语义层级 | ProLAP: Probabilistic Language-Audio Pre-Training | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频检索 |
| 1210 | 风格词是全局旋钮还是局部开关:跨注意力如何把指令翻译成声音 | How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #文本到语音 |
| 1211 | 把相似度当证据:鼾声分类中度量学习与可解释推理的分离设计 | Similarity as Evidence: An Explainable Siamese Framework for Snore Sound Classification | 5.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频分类 |
| 1212 | 删掉重要神经元却删不掉音高:WavLM 声学表征的九头蛇冗余与子空间级干预 | Causal Redundancy in Speech Representations: The Hydra Effect and Limits of Sparse Disentanglement in WavLM | 5.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1213 | 后元音拉抬前元音吗:阿萨姆语中部前元音和谐的声学再检验 | An Acoustic Investigation of Mid Front Vowel Harmony in Assamese | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1214 | 拉丁拼写不等于英语发音:为坦库尔语和马林语从零建库并训练字符级 TTS | Scalable Neural TTS for Latin-Script Low-Resource Languages of Manipur | 5.5/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #文本到语音 |
| 1215 | 儿童波兰语咝音发音位置错了,能靠自编码器压出的频谱向量检出吗 | Detection of Incorrect Place of Articulation in Polish Sibilants Using Convolutional Autoencoders | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1216 | 从持续元音到连续儿化音:受限形变如何让三维声道既解剖可信又声学可解释 | Morphoacoustic Modeling of a Dynamic 3D Vocal Tract Using MRI-Constrained Deformations and FEM Acoustics | 5.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音合成 |
| 1217 | 只动年龄和性别能藏住说话人吗:实时匿名中的隐私与音质折中 | Privacy and quality trade-off in real-time speaker anonymization via editing of age and sex attributes | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #说话人匿名化 |
| 1218 | 奥克兰百年元音:/e æ/先升后降而/ɪ/很早就已中央化 | Revisiting the NZE front vowel shift: evidence from New Zealand’s largest and most linguistically diverse city | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1219 | 澳大利亚英语男声中音高不高不重要,变化快慢和话题才重要 | Masculinity and Sexual Orientation as Predictors of f0 Variation in the Speech of Australian English Speaking Men | 5.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1220 | 塞音语境是否改变毛利语元音:高度稳定而前后位置显著漂移 | A preliminary exploration of stop-vowel coarticulation in Māori | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1221 | 把声音映射到语义空间:关键词规整与负样本推开如何让未见属性可预测 | Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 1222 | 没见过的搭嘴音为何反而认得更准:自监督模型在 G|ui 与 West !Xoon 上的微调检验 | Pretrained self-supervised speech models can recognize unseen consonants | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音识别 |
| 1223 | 英语主导下越南语如何被多说一点:两次学前项目实施的输入输出时长对比 | Measuring English and Vietnamese language input and output in an Australian preschool – A longitudinal study | 5.5/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语言识别 |
| 1224 | 参考中心挪一点方向响应就变样:用有限阶能量把中心找回来 | Addressing random spatial translations in measured microphone directional responses by maximizing finite order energy | 5.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #空间音频渲染 |
| 1225 | 从找特征到找证据:用训练样本的影响力解释构音障碍严重度判定 | Towards Dys-XAI: Influence-Based Explanations for Dysarthria Severity Assessment | 5.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 1226 | 普通话卷舌不是卷舌尖:收缩位置后移与前腔扩大才是稳定区别 | Articulatory Analysis of the Mandarin Alveolar–Retroflex Contrast Using Real-Time MRI | 5.5/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1227 | 声调不能丢:用自动声调映射把跨语言强制对齐接到声调语言上 | CrossPhon-Tonal: Streamlining Cross-language Modeling for Forced Alignment in Low-resource Tonal Languages | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.9/1.5 | 前50% | 方法研究 | #强制对齐 |
| 1228 | 听得出家乡:瑞士德语嗓音设定的首次系统编码与低一致性下的地域性别分化 | Applying the Simplified Vocal Profile Analysis to Swiss German Dialects | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1229 | 熟悉是屏障还是助推器:普通话情感韵律识别中人声与克隆熟悉音色的对照 | A barrier or a booster? Familiarity effects on Mandarin emotion prosody recognition using AI-powered voice cloning | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音情感识别 |
| 1230 | 行为不变而神经重组:粤语声调归一化在认知负荷下的主动抑制 | Neural Oscillatory Mechanisms of Speaker Normalization Under Cognitive Load: Evidence from Cantonese Tone Perception | 5.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #语音识别 |
| 1231 | 极高调是假声还是绷紧的真声:开慧话 T4 的音质辨别与音高伴随解释 | Tense Voice, Not Falsetto: An F0-specific Physiological Byproduct of Extreme High-Pitch Tone in Kaihui Xiang | 5.5/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 1232 | 同一编码器不同深度:25 个构音障碍感知维度为何偏好不同 Wav2Vec2 层 | Uncovering Dimension-Specific Layer Preferences in Wav2Vec2 for Fine-Grained Perceptual Assessment of Dysarthric Speech | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 1233 | 在保住音色的同时拧动口音旋钮:CrossAccent-TTS 如何解耦说话人与口音 | CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #文本到语音 |
| 1234 | 同样是副语言任务,为何性别可跨语言迁移而说话人验证不行 | Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #说话人验证 |
| 1235 | 突变越陡越好找:用 Conformer 与冻结 HuBERT 做八类声学界标检测 | Acoustic Landmark Detector based on Conformer and HuBERT | 5.4/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #音频事件检测 |
| 1236 | 只有一句术前语音时,先恢复可懂度再搬运音色为何更稳 | Personalized Electrolaryngeal Voice Conversion with a Single Pre-operative Utterance | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #语音转换 |
| 1237 | 声音在第几层变成答案:对大音频语言模型做因果追踪 | Causal Tracing of Audio-Text Fusion in Large Audio Language Models | 5.4/10 · 创新 1.3/2 · 技术严谨 0.9/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #音频问答 |
| 1238 | 同样听出话没说完,依据却不同:听力损失如何改变轮替结尾的韵律线索权重 | Towards an understanding of prosodic cue weighting for turn-end classification in older adults with varying hearing abilities | 5.4/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #轮次切换 |
| 1239 | 零样本能克隆声音,却克隆不好谁的声音:性别延展嗓音暴露的合成与评测双重偏差 | No-Shot Text-to-Speech: Limitations of Zero-Shot TTS and its Evaluation Methods in Representing Queer and Transgender Voices | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #文本到语音 |
| 1240 | 机器转写对了不等于人听懂了:声学与 Whisper 语义融合再做歌词可懂度回归 | Acoustic and Semantic Feature Fusion Mapping for Lyric Intelligibility Prediction | 5.4/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 后50% | 方法研究 | #语音可懂度评估 |
| 1241 | 语音表示空间里藏着语系树吗:用六种树距离重新量一遍 | Do speech representational spaces encode language family structures? | 5.4/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语言识别 |
| 1242 | 学到的层权重不是随机的:它们在何时跟随预训练的信息分布 | Do Learned Layer Weights Reflect Pretrained Information Structure in Self-Supervised Speech Models? | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语音识别 |
| 1243 | 语音嵌入里藏着多少语言学:声学强、结构弱的梯度式编码 | Probing Linguistic Information in Speech Embeddings: A Diagnostic Analysis across Acoustic and Structural Domains | 5.4/10 · 创新 1.1/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语音属性识别 |
| 1244 | 像说话的文本反而更难听懂:合成语音可听性中的语域效应 | Listenability of Synthetic Speech: On the Effect of Linguistic Registers in Text-to-Speech Input | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #文本到语音 |
| 1245 | 检索要的是全局排序不乱:多尺度嵌入抗信道老化却怕换语言,后端校准来扶正 | On the Robustness of Speaker Embeddings for Cross-Domain Speaker Retrieval | 5.4/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 数据集与基准 | #音频检索 |
| 1246 | 只靠自监督听出声调吗:普通话语境补偿对 wav2vec2.0 的反问 | Perceptual compensation for tonal context in self-supervised speech models | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语音属性识别 |
| 1247 | 从漫画格到有声漫画:检测理解与提示语音合成如何分工又在哪里受限 | Automatic generation of audio comic from manga images | 5.4/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #文本到语音 |
| 1248 | 看图说话为何最能暴露认知分数:任务条件融合与标签约束对齐的取舍 | Task-Conditioned Audio-Text-Image Fusion for Cognitive Score Estimation from Speech-Based Assessments | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 1249 | 只看文本的上下文度量为何给人工译文打低分:场景视听标签如何修正评价 | Audiovisual CXMI: Scene-based Context Tagging for Spoken Language Translation Evaluation | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #语音翻译 |
| 1250 | 资源分离而策略共享:普通话声调与辅音 Ganong 权衡的被试内比较 | Perceptual Trade-offs Across Segmental and Suprasegmental Levels: Comparing Ganong Patterns in Mandarin Consonants and Lexical Tones | 5.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #音频分类 |
| 1251 | 看不见说话人时也不硬指认:用\[None\] 标记统一识别哪张脸何时说了什么 | Unified Audio-Visual Modeling to Recognize Which Face Spoke When and What in Scenarios with On- and Off-Screen Participants | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #音视频语音识别 |
| 1252 | 不用提醒也能记下来的费力时刻:手表如何把听觉吃力与疲劳变成可分类的状态 | Steps toward a wearable-informed model of real-world listening effort and fatigue among adults with hearing loss | 5.4/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 应用研究 | #音频分类 |
| 1253 | 弯了但低频不变:声道弯曲只在非均匀截面和高频才激起横向模式 | Influence of Vocal Tract Curvature on Speech Acoustics: A Three-Dimensional FEM Analysis | 5.4/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音合成 |
| 1254 | 按母语分图:用有向加权混淆统计改写发音检错的语言学先验 | Domain-Aware Mispronunciation Detection and Diagnosis Using Language-Specific Statistical Graphs | 5.4/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语音属性识别 |
| 1255 | 小语种自己建平台:胡拉语社区如何把翻译、审校和数据治理留在村里 | Vavanagi: a Community-run Platform for Documentation of the Hula Language in Papua New Guinea | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #语音翻译 |
| 1256 | 噪声下别让坏模态带偏好模态:用跨模态特征重建学抗噪的音视频情感识别 | Audio-Visual Feature Reconstruction Pretraining for Noise-Robust Emotion Recognition | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #语音情感识别 |
| 1257 | 抬得最高的人最难认:女性自主提调与合成提调的说话人识别效应 | Assessing the effect of volitional and synthetic pitch raising in female speakers on automatic speaker recognition | 5.4/10 · 创新 1.1/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 应用研究 | #说话人验证 |
| 1258 | 只净化参考信号、不碰控制滤波器:因果留声有源降噪的参考增强路线 | A Causal Reference-Enhanced Keep-Speech Active Noise Control Method | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #主动降噪 |
| 1259 | 高频能量为何能暴露儿童卷舌擦音的前移:从 16 kHz 噪声能量到发音位置比值 | Informativity of high-frequency bands on the place of articulation shift in retroflex sibilants produced by children | 5.4/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 1260 | 排卵期与黄体期能从朗读声中分开吗:手工声学特征小幅领先、嵌入特征回到机会水平 | Predicting Menstrual Cycle Phases from Speech: A Paralinguistic Approach | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1261 | 训练中途如何知道口音学对了:用元音空间几何补上损失曲线的口音盲区 | Phonetically Grounded Vowel Space Metrics for Evaluating Synthetic Speech During TTS Model Training | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #文本到语音 |
| 1262 | 跨语言也认得出是谁:说话人嵌入与人耳判断共用声学线索 | Human-like cross-language generalisation in deep neural speaker embeddings and its acoustic foundations | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #说话人验证 |
| 1263 | 一个全局模型不够用:按说话人相似度分别平均构音障碍语音模型 | Towards Personalized Federated Learning for Dysarthric Speech Recognition | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 方法研究 | #语音识别 |
| 1264 | 有物理基础的音高联想,为什么会被性别经验推着走 | Listeners’ gendered experiences and beliefs affect iconic pitch associations | 5.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #音频理解 |
| 1265 | 基频被压缩时促声调还剩什么:火济晋语 T1-T5 的多线索分离 | The role of phonation type in Chinese Jin tones: a study using acoustic metrics | 5.3/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1266 | 自回归解码不是模型附带品:用递推关系重划语音生成的边界 | A Generalized Formalism of Auto-Regressive Decoding for Speech Processing | 5.3/10 · 创新 1.2/2 · 技术严谨 0.7/1.5 · 实验充分 0.3/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 理论研究 | #语音识别 |
| 1267 | 二语者向谁靠拢取决于练什么:人类声音带塞音,真人合成音带节奏与时长对比 | L2 Speakers Accommodate Differently to AI and Human Voices Across Phonetic Features | 5.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音交互 |
| 1268 | 全频带只算一次,子带逐个扫描:0–8 kHz 哪里最认识说话人 | Band-Limited Cepstral Analysis of Speaker Sensitivity in Forensic Voice Comparison | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 后50% | 方法研究 | #说话人验证 |
| 1269 | 芬兰语自然语音的效价要看说了什么,唤醒度主要听怎么说 | Looking for Affect in Spontaneous Finnish Speech through Linguistic Interpretability | 5.3/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音情感识别 |
| 1270 | 归一化把跨语言差异抹掉时,为何反而更像不懂英语的西班牙听者 | How Speaker Normalization Procedures Influence the Computational Modelling of Non-native Vowel Perception: Implications for the L2LP model | 5.3/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #音频分类 |
| 1271 | 不分类也能度量变化:用反事实位移方差刻画鸣禽发声可塑性 | Trajectory Variance: An Unsupervised Measure of Developmental Vocal Plasticity in Birdsong | 5.3/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #音频分类 |
| 1272 | 耳周麦克风多听到了什么:颈部皮肤振动的低频二次声源 | The Effect of Neck Skin Vibration on the Periauricular Acoustic Receiver | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 后50% | 应用研究 | #声场重建 |
| 1273 | 一个齿音对一个前鼻化音:汤戈阿纳卡纳曼加语舌冠塞音是否靠嗓音区分 | Phonetic evidence for contrastive voicing in Nakanamanga coronal plosives | 5.3/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1274 | 人群噪声里听微笑:敏感度下降与判断变保守如何共同起作用 | Hearing Smiles in the Crowd: How Babble Noise Shapes Smiled Speech Perception | 5.3/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1275 | 儿童口吃检测为何要把词和声学帧分成两类节点来建图 | Paediatric-HGNN: A Hybrid Heterogeneous Graph Neural Network for Detecting Disfluency in Children’s Speech via Multiscale Acoustic Fusion | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #病理语音评估 |
| 1276 | 重音不在声调里时:台湾国语者如何用整音节手势协调实现英语重音 | Lexical stress-conditioned spatiotemporal gestural coordination in L2 English | 5.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1277 | 听辨已达标之后频谱仍在移动:5 到 8 岁波兰儿童齿擦音摩擦噪声的年龄斜率 | Age-dependent acoustic changes of the frication noise in dental sibilants produced by typically developing Polish children between 5 and 8 years of age | 5.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1278 | 把 F1 和 F2 看成一条轨迹:悉尼英语六个双元音如何一起动 | Variation and change in dynamicity of Australian English diphthongs in Sydney | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1279 | 看不见后缀时就必须做决定:用可变块恢复孟加拉语码切换的形态完整性 | Dynamic Block-Online Streaming ASR for Low-Resource Agglutinative Code-Switching Speech with Morphology-Aware Evaluation | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.5/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #语音识别 |
| 1280 | 准备好的长独白之后,提问者如何在两种语言里被带偏:议会半自发对话的趋同 | On Entrainment in Semi-Spontaneous Multilingual Parliamentary Speech | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 后50% | 应用研究 | #语音对话系统 |
| 1281 | 不看下游标签也能读懂语音自监督:压缩、几何与跨层生成如何分工 | InsideSSL: Understanding Self-Supervised Speech Representations using a Model-Centric Perspective | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.4/1.5 | 后50% | 方法研究 | #语音属性识别 |
| 1282 | 谁有权决定原住民儿童语音数据怎么用:ELSI 的三角色治理与缺席的社区托管 | From Academic Tool to Community Infrastructure: A Call for Indigenous Partnership in Speech Data Governance | 5.3/10 · 创新 1.3/2 · 技术严谨 0.8/1.5 · 实验充分 0.4/1.5 · 清晰度 0.9/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #音频检索 |
| 1283 | 情绪越高越紧急吗?法国急救电话数据对情绪分诊的再检验 | Revisiting Emotion-Based Triage: Evidence from French Emergency Call Data | 5.3/10 · 创新 1.0/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音情感识别 |
| 1284 | 远距离低资源适应为何逼出表示重写:太平洋语言上的可塑性与稳定性困境 | Continual Adaptation for Pacific Indigenous Speech Recognition | 5.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.5/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音识别 |
| 1285 | 多声源多麦克风下相对传递矩阵能否被直接学出来:三种监督建模的对照解读 | Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones | 5.3/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 方法研究 | #语音增强 |
| 1286 | 只用事件证据拼出长音频的活动结构:文法如何约束顺序与层次 | Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #音频分类 |
| 1287 | 送气擦音不是一个线索说了算:沙溪白语三代人的时间与频谱权重如何重组 | Age-related Differences in Acoustic Realization of Aspirated Fricatives in Shaxi Bai | 5.3/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1288 | 节奏指标分不开的东北印度英语,潜嵌入为何仍把印地语远远推开 | From Rhythm Metrics to Latent Embeddings: Categorising English and Hindi Varieties in Northeast India | 5.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语言识别 |
| 1289 | 重音规则不同时,自监督表示与词内上下文能否跨语言复用 | Multilingual and Cross-lingual Lexical Stress Detection Using SSL Feature Vectors | 5.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.6/1.5 | 后50% | 方法研究 | #语音属性识别 |
| 1290 | 用更强的说话人判别器逼出说话人无关的情感表示:SISER 解读 | SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training | 5.2/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.5/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 后50% | 方法研究 | #语音情感识别 |
| 1291 | 鲁棒性阈值也需要学习:联合估计协方差与白噪声增益的 MVDR | Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming | 5.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语音增强 |
| 1292 | 整条曲线还是局部对齐:延续升调的接触变异如何同时需要全局形状与时间定位 | Reconciling Dynamic Data Analysis with Linguistic Reality: Comparing Legendre Polynomial Modelling and GAMM Applied to Prosodic Contact | 5.2/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语言识别 |
| 1293 | 不只看起点终点:用整条共振峰轨迹重看澳大利亚英语双元音变化 | Modelling diphthong dynamics: A GAMM-based analysis of Australian English diphthongs | 5.2/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1294 | 舌头被挖掉模型也不差:超声到语音映射到底在看哪里 | On the Role of the Tongue Region in Ultrasound-to-Acoustic Mapping | 5.2/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #静默语音接口 |
| 1295 | 既要藏住说话人又要留住痴呆线索:信号与特征两级隐私保护如何分工 | Multi-Level Privacy-Preserving Dementia Detection from Speech via Targeted Adversarial Obfuscation and Representation Learning | 5.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 后50% | 方法研究 | #病理语音评估 |
| 1296 | 语境搭台、韵律补位:中国英语学习者如何听出反语 | The Role of Context and Prosody in the Understanding of English Irony by Chinese L2 Learners | 5.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #口语理解 |
| 1297 | 越讨厌越听不清:用游戏化噪声任务把厌声症拉进听力学测量 | Sound Reactor Mission: Gamified Misophonia Assessment to Bridge the Gap in Audiology and Hearing Care | 5.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.2/0.5 · 工程/实践 1.0/1.5 | 后50% | 应用研究 | #语音可懂度评估 |
| 1298 | 要留住达基尼口音,先别让话筒吓走它:一次电话采集的方法拆解 | Spontaneous Dialect-Aware Speech Corpus for Low-Resource Dakhini, A Southern Indo-Aryan Language: Methods, Challenges, and Insights | 5.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 数据集与基准 | #说话人分离标注 |
| 1299 | 儿童长时录音又多又杂:ELSI 想用统一格式加一键模型调用降低使用门槛 | ELSI: An Interface for Standardizing Child-Centered Datasets, Applying Machine Learning Models, and Extracting Metrics | 5.2/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.3/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #说话人分离标注 |
| 1300 | 人类觉得难的样本先靠后:用意图与感知的对齐关系给语音情绪排课程 | CHUCKLE - When Humans Teach AI to Learn Emotions the Easy Way | 5.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 后50% | 方法研究 | #语音情感识别 |
| 1301 | 缺失中也要认出情绪:用遮罩卷积与多尺度一致性做轻量语音情感识别 | MSMC: Multi-Scale Masked Convolution network for Robust Speech Emotion Recognition | 5.2/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #语音情感识别 |
| 1302 | 从区分干净与噪声脑响应到给增强算法打分:NeuroPAS-Net 的三阶段解码 | fMRI Decoding of Speech Conditions Across Brain Regions of Interest for Neural Evaluation of Speech Enhancement | 5.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #言语神经解码 |
| 1303 | 说“嗯” 却没懂:不一致回应的多模态信号如何被分离出来 | When “yeah” means “not quite”: Multimodal detection of backchannels expressing incomplete understanding | 5.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #音视频理解 |
| 1304 | 把对齐与发音评分装进一个桌面:VoxKit 如何让临床语音研究少写命令行 | VoxKit: Desktop Phone Alignment and Goodness of Pronunciation Analysis | 5.1/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #强制对齐 |
| 1305 | 语音大模型能替人打出口音与易懂度分数吗:相关、进步与线索的三重检验 | Can Speech LLMs Approximate Human Ratings of Accentedness and Comprehensibility? Evidence from Correlational and Feature-Based Analyses | 5.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音质量评估 |
| 1306 | 看得见才改得准:NewAppVoice 用同步可视化与多算法对照修正共振峰测量 | NewAppVoice: Tools for Visualizing and Correcting Acoustic Measures | 5.1/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.3/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #语音属性识别 |
| 1307 | 跨人与跟随个人:德语肌萎缩侧索硬化语音损伤预测在两种评分与五种任务上的分野 | Towards Speech Impairment Prediction in German-Speaking Individuals with Amyotrophic Lateral Sclerosis | 5.1/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 1308 | 当关系先于项目:毛利语语音合作如何把信任写成流程 | Working Together on Technologies: A Case Study of Collaboration in Aotearoa | 5.1/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 0.3/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.0/0.5 · 工程/实践 1.0/1.5 | 后50% | 应用研究 | #文本到语音 |
| 1309 | 普通话卷舌擦音不只一种舌形:五位发音人的超声轮廓与无监督聚类初探 | Tongue-Shape Strategies for Standard Mandarin Retroflex Sibilants: A Preliminary Ultrasound and Unsupervised Clustering Study | 5.1/10 · 创新 1.1/2 · 技术严谨 0.9/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1310 | 舌背抬得更多、喉却放得更低:美英语/k/与/g/的舌喉协同 | The Role of Laryngeal Position in the Articulation of American English Velar Stop Consonants | 5.1/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.4/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1311 | 在过拟合与欠拟合之间架桥:用类原型扩散重塑语音情感表示 | Diffusion Bridge Learning Between Overfitted and Underfitted Representations for speech emotion recognition | 5.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语音情感识别 |
| 1312 | 通用模型先标、专家再改:SpeechBench 把多步语音预标注装进一个本地可部署工具 | SpeechBench: A Unified Speech Annotation and Analysis Tool | 5.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #语音识别 |
| 1313 | 可懂度模型究竟听到了什么:用 eGeMAPS 逐层打开 Wav2Vec 2.0 的声学依据 | What Does a Pathological Speech Assessment Model Know about Acoustic Features? A Case Study on Oral and Oropharyngeal Cancer Patients | 5.1/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 1314 | 缩短放在词中帮忙、放在词尾添乱:普通话听者如何用音节缩短切分语流 | Positioning Effect of Syllable Shortening on Speech Segmentation: Evidence from Mandarin Listeners | 5.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #口语理解 |
| 1315 | 陈述句为何上扬:威尼托方言中宽焦点升调的分布与实现 | Broad Focus Rise(-fall) Declaratives in Venetan: Investigating Typological Outliers in Italo-Romance Intonation | 5.1/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1316 | 深层收缩不是丢失:Wav2Vec 2.0 方言几何的三段轨迹 | Probing the Layer-wise Geometry of Chinese Dialect Representations in Wav2Vec 2.0 | 5.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语言识别 |
| 1317 | 对齐与分工打架时:BELLA 用双层优化把桥接和专家选择分开管 | BELLA: Efficient Bilevel Learning with LoRA for Multilingual ASR | 5.1/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 后50% | 方法研究 | #语音识别 |
| 1318 | 鼻腔通不通,元音会知道:用 A1-P0 与 A1-P1 追踪上气道手术前后的鼻化 | Vowel Nasalization in Upper Airway Diseases: An Analysis Using the CUCO Database | 5.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 1319 | 焦点处能抬高、焦点后压不下去:彝—汉语双语者重音实现的完全分离 | Prosodic Realization of Focus in Yi-Mandarin Bilingual Speakers: On-Focus Expansion without Post-Focus Compression | 5.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1320 | 尾巴丢了调子还在:开慧话入声舒化晚期的线索搬家与性别差 | Gender differences in the phonetic realization of the checked tone in Kaihui Xiang | 5.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1321 | 在手机上同时跑三个十亿级模型:Argmax Pro 如何兼顾实时转写、说话人与自定义词表 | Argmax Pro: Frontier-level Real-time Speech-to-text with Speakers and Custom Vocabulary on Mobile Devices | 5.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.2/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #语音识别 |
| 1322 | 多人嘈杂声里练元音辨别:人类能进步,多语模型里谁更像人类 | English Vowel Perceptual Training under Multitalker Babble: A Comparison of Humans and Large Language Models | 5.0/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1323 | 同性别更难分,同机制未必同记忆:7-12 岁儿童说话人辨别与识别的三问 | Talker Discrimination and Identification in 7-12-year-old Children: Effects of Talker Gender and Phonological Ability | 5.0/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #说话人识别 |
| 1324 | 在时域里学增益:WaveNorm 如何同时做响度归一与降噪 | WaveNorm: Real-Time Neural AGC for Noise-Robust Speech Enhancement on Resource-Constrained Edge Devices | 5.0/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 后50% | 系统技术报告 | #语音增强 |
| 1325 | 看得见又听得见的表示比较:在同一界面里切换编码器、距离与对齐 | Speech Playground: An Interactive Tool for Speech Analysis and Comparison | 5.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.2/0.5 · 工程/实践 0.8/1.5 | 后50% | 系统技术报告 | #音频交互 |
| 1326 | 从第一视角看婴儿:用轻量头戴相机加本地标注破解自然学习环境难题 | The TinyExplorer Ecosystem: Open tools for studying infants’ auditory and visual experiences | 5.0/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #关键词检测 |
| 1327 | 说话人身份不是一块整板:共享声音核心与性别年龄口音各自的外延 | Is Speaker Identity a Unitary Construct? Neural Evidence for Distinct Trait Processing | 5.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1328 | 看眼睛还是看嘴:普通话反语表扬与反语指责的不对称视觉加工 | Eye and Mouth Cues in Audiovisual Perception of Mandarin Irony: Evidence from Eye-Tracking | 5.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #音视频理解 |
| 1329 | 听觉模型做音高距离:把缺失基频的周期感变成可微梯度 | Differentiable Pitch Matching with Auditory Models | 4.9/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.3/1.5 | 后50% | 方法研究 | #音高与旋律提取 |
| 1330 | 先对齐词汇再贴近个人:两阶段个性化让构音障碍语音识别走进手机 | BetterSpeak: An Atypical Speech to Typical Speech Platform for Dysarthric Speakers | 4.9/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.5/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 系统技术报告 | #语音识别 |
| 1331 | 同语掩蔽最难,熟悉阿拉伯语也未必更受伤:词监测任务下的掩蔽语与认知负荷检验 | Effects of listener language experience, masker language, and cognitive load on word monitoring accuracy and response time | 4.8/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #关键词检测 |
| 1332 | 不测听阈、只让人亲身听难:用空间音频把诊室变成咖啡馆的咨询演示系统 | An Immersive VR System for Experiencing Spatial Speech-in-Noise Challenges in Clinical Audiology | 4.8/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.3/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #音频问答 |
| 1333 | 听得更清楚不等于病得更准:语音增强如何扰动神经学生物标志物 | ClinAware: Speech Enhancement Needs Clinical Awareness | 4.8/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 0.3/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.9/1.5 | 后50% | 系统技术报告 | #语音增强 |
| 1334 | 听跟不上、说不准、开口难:AURORA 把影子跟读、重叠模仿和对话练习做进同一套网页课件 | AURORA: A Web-based Authoring System for Bridging Aural-Oral Language Training and Communicative Practice | 4.8/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 0.3/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 系统技术报告 | #语音对话系统 |
| 1335 | 不做声纹分离,只靠指令聚焦口吃儿童:音频大模型的语义推理还差在哪 | Reasoning Beyond Transcription: Audio Language Models on Child Stuttering Speech | 4.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #音频理解 |
| 1336 | 问句更像本人吗:熟悉度与语调如何改变真假语音的等价性 | Intonation Perception in Real and Synthetic Speech across Varying Familiarity Levels: A Pilot Study of Equivalence Assessment | 4.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1337 | 被迫用可懂度换身份:三名非二元辅具使用者的声音主权需求评估 | Lived Experiences of Power and Agency: Achieving Voice Sovereignty in Assistive Speech Technology for Nonbinary Users | 4.7/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音合成 |
| 1338 | 把家庭练习留住、把错误讲清楚:SayCheck 如何连起游戏诱因与属性级诊断 | SayCheck: Gamified Speech Practice and Attribute-Based Speech Analysis for Children | 4.7/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 0.3/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.2/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #语音属性识别 |
| 1339 | 说话结束后的贝塔反弹能否反映发音动作的复杂程度 | Beta Rebound as a Neural Signature for Speech Movement: Preliminary Evidence Using Magnetoencephalography | 4.7/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #言语神经解码 |
| 1340 | 把声音放在前面:用角色化语音让日语风格差异可听可见 | A Speech-First Character Interface for Stylized Japanese Dialogue Practice | 4.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.2/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 系统技术报告 | #语音对话系统 |
| 1341 | 谁的声音可以被收录:以酷儿语音为镜的参与式数据治理框架 | Towards participatory speech dataset curation: A queer case study and conceptual framework | 4.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.2/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1342 | 模仿得像不像,用说话人向量数出来:ECAPA 增强嵌入的模仿评估 | ECAPA-TDNN-based Speaker Embedding Framework for Voice Mimicry Assessment | 4.5/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.4/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #说话人识别 |
| 1343 | 在词级别拧动气息与嘶哑:让语用差别可听可比的交互工具 | VoiceQualityGUI: A Tool for Word-Level Voice Quality Modifications | 4.5/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 0.2/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 系统技术报告 | #语音转换 |
| 1344 | 长短元音靠时长还是靠音色来听:黄云越南语两代人的线索权重差异 | Age-related Differences in the Perception of Vowel Length Contrast in Northern Vietnamese: The Case of Hoang Van (Bac Ninh) Variety | 4.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.4/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.0/1.5 | 后50% | 应用研究 | #音频分类 |
| 1345 | 先写菜谱再做饭:Treble SDK 如何把房间仿真变成可复用的音频场景 | Scalable Audio Scene Generation with the Treble SDK | 4.4/10 · 创新 1.0/2 · 技术严谨 0.9/1.5 · 实验充分 0.2/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 系统技术报告 | #音频生成 |
| 1346 | 不爆破的尾音最难听准哪一个:台湾华语者的韩语塞尾音感知 | The Perception of Korean Stop Coda Consonants by Mandarin Speakers in Taiwan: A Comparative Study of Proficiency Levels | 4.4/10 · 创新 0.8/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.4/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音可懂度评估 |
| 1347 | 躺着说话元音会变吗:新西兰英语中身体姿势对第一、第二共振峰的小而集中的影响 | Effects of body position on vowel formants in New Zealand English | 4.3/10 · 创新 0.7/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1348 | 不用频谱看声调:用耳蜗模型把基频起伏冻成可比对的图像 | Real-Time CARFAC/SAI-derived Pitchogram for Seeing and Correcting Pronunciation in Mandarin Chinese Tones | 4.3/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.2/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 系统技术报告 | #音频分类 |
| 1349 | 尾部清塞音如何关住声音:收缩还是张开,喉头镜来对账 | Achieving voicelessness in coda stop contexts: Insights from combined electroglottography and laryngoscopy | 4.3/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 1350 | 自由对话里怎么给声调打分:Amadea 用合成参考音对照归一化基频轮廓 | Amadea: An AI Companion for Pitch-Aware Spoken Language Practice | 4.2/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.2/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.6/1.5 | 后50% | 系统技术报告 | #语音对话系统 |
| 1351 | 床旁直接算语音:把采集、计算与显示装进一台嵌入式设备 | Demonstration of Embedded Systems for Clinical Speech Analysis | 4.2/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 0.3/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 系统技术报告 | #病理语音评估 |
| 1352 | 不用电脑说话:用可更换凸轮片驱动六滑块声道模型 | Programmable Speech Synthesis without Computers | 4.1/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 0.3/1.5 · 清晰度 0.6/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 系统技术报告 | #语音合成 |
| 1353 | 心音被噪声盖住时:先理解整段心跳,再修补被挖空的表示 | CLEAR: Clinical LLM Embedding and Attention-based Reconstruction | 3.5/10 · 创新 1.0/2 · 技术严谨 0.5/1.5 · 实验充分 0.4/1.5 · 清晰度 0.6/1 · 影响力 0.4/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #音频分离 |
| 1354 | 把签名切碎藏进声音里:DsNA 以后生成指纹的可验证尝试 | DsNA(Digital sigNature for Audios): A Unique Method to Fingerprint Audio Files Generated by Text to Speech | 2.9/10 · 创新 0.6/2 · 技术严谨 0.4/1.5 · 实验充分 0.3/1.5 · 清晰度 0.5/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #音频水印 |
📋 论文列表
1. 希伯来语缺的不只是元音:用增强注音加规则转写补齐重音与发音
英文题目:Phonikud: Overcoming Phonetic Underspecification for Hebrew Text-To-Speech
标签:#基准测试 #数据集 #Adapter #文本到语音
评分:8.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 1.0/1 | 影响力 1.0/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#Adapter
👥 作者与机构
- Yakov Kolani:机构信息未能从会议 PDF 纯文本可靠映射
- Maxim Melichov:机构信息未能从会议 PDF 纯文本可靠映射
- Cobi Calev:机构信息未能从会议 PDF 纯文本可靠映射
- Morris Alper:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
现代希伯来语文本到语音(Text-to-Speech,TTS)输入为无元音符号文本,输出为语音,难点在于正字法欠指定导致重音位置、Shva读法和外来音难以确定。Phonikud先用冻结的DictaBERT注音基座加可训练两层感知机适配头生成增强注音,再经有限状态转换器与词典匹配转为完整国际音标(International Phonetic Alphabet,IPA),最后以该IPA训练轻量TTS并用微调的音频到IPA识别器做自动评测。与直接映射文本到音频或仅用标准注音训练相比,该链条把缺失韵律与音段特征显式化,使小模型获得充分发音输入,从而显著降低重音与元音错误。在ILSpeech基准评测下,Phonikud的WER为17.4%,低于DictaBERT的WER 39.5%。下游90M参数StyleTTS2加Phonikud在SASPEECH 100句上词错误率为35.2%,优于全部开源基线并接近专有系统。结论限于录音室希伯来语、双说话人语料与合成数据训练场景,对口语变体和日期地址等文本归一化尚未验证。训练在单张RTX4090上完成,TTS微调约10小时,开源模型在无GPU的macOS M1上测得实时因子小于1。
🔗 开源资源
- 代码相关资源:https://phonikud.github.io/ — 链接可访问(HTTP 200)
- 模型相关资源:https://phonikud.github.io/ — 链接可访问(HTTP 200)
- 数据相关资源:https://phonikud.github.io/ — 链接可访问(HTTP 200)
- 演示资源:https://phonikud.github.io/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/espeak-ng/espeak-ng — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
2. 分布对齐了性能仍崩塌:MV2LRS3 检验视听语音识别的真泛化
英文题目:Assessing True Generalisability of Audio-Visual Speech Recognisers
标签:#基准设计 #模型评估 #音视频 #音视频语音识别
评分:8.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音视频语音识别 | 主方法:#基准设计
👥 作者与机构
- Zhaofeng Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Stavros Petridis:机构信息未能从会议 PDF 纯文本可靠映射
- Maja Pantic:机构信息未能从会议 PDF 纯文本可靠映射
- Naomi Harte:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频语音识别以含噪语音与唇部视频为输入并输出转写文本,当前在LRS3基准上趋于饱和,难以判断是真实泛化还是对小规模测试集的自适应过拟合。该工作先从海量MultiVSR英文候选池提取时长、年龄、性别、肤色、头部位姿、信噪比与语速七维属性向量,并以LRS3测试集为参考做加权多维最近邻匹配,生成分布对齐的MV2LRS3评测集。接着用该集合对涵盖端到端、自监督与语音大模型集成的五种主流架构做音频、视频与音视频对比及跨词汇评估,再通过留一因子消融与难易样本剖析定位时长依赖、视角与词汇偏差等失效来源。与直接复刻采集流程的WildVSR思路不同,该方法不新建大规模采集而做可控子采样,从而在声学与视觉条件近似不变下检验分布内泛化,具有低成本可复用的实际意义。在MV2LRS3评测集下,AV-HuBERT的WER为23.5%,高于其在LRS3测试集的WER 1.50%。该结论仅适用于干净类TED风格朗读语音的分布内泛化,未验证强噪声与多说话人等更难场景。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/chaufanglin/mv2lrs3 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
3. 单阶段直达声学码本:OmniVoice 如何把 600 余种语言装进一个扩散语言模型
英文题目:OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models
标签:#扩散模型 #多语言 #零样本 #文本到语音 #语音克隆
评分:8.7/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.3/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:模型报告 | 主任务:#文本到语音 | 主方法:#扩散模型
👥 作者与机构
- Han Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Lingxuan Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Zengwei Yao:机构信息未能从会议 PDF 纯文本可靠映射
- Liyong Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Fangjun Kuang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhifeng Han:机构信息未能从会议 PDF 纯文本可靠映射
- Weiji Zhuang:机构信息未能从会议 PDF 纯文本可靠映射
- Long Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Povey:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成(zero-shot TTS)需仅凭数秒参考音频同时复刻音色并准确实现任意文本发音,而大规模多语言扩展更受语种不均衡、异构开源数据噪声转写与传统两阶段级联误差累积制约。OmniVoice先将指令与转写文本编码为条件序列并拼接多码本声学token矩阵,再对目标段执行全码本随机掩码并以双向Transformer(Bidirectional Transformer)并行恢复被掩token,最后经声学token解码器重建波形并支持去噪与属性控制推理。该链条以单阶段文本到声学映射替代文本到语义到声学级联,以全码本稠密掩码损失替代逐层稀疏损失,并以Qwen3-0.6B预训练大语言模型(Large Language Model, LLM)权重初始化提供语言先验以支撑600余语种扩展。在LibriSpeech-PC test-clean上OmniVoice词错率(Word Error Rate, WER)降至1.30,优于同表多款中英文基线并同时取得更高说话人相似度。该结论在102语种评测中仍成立,但极低资源语言的人工主观验证与带噪转写鲁棒性尚未充分外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/k2-fsa/OmniVoice — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/boson-ai/higgs-audio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 看不见生成器时如何判别环境声真假:首届 ESDD 挑战的双赛道基准
标签:#基准设计 #鲁棒性 #环境声 #音频深度伪造检测
评分:8.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音频深度伪造检测 | 主方法:#基准设计
👥 作者与机构
- Han Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Rohan Kumar Das:机构信息未能从会议 PDF 纯文本可靠映射
- Jisheng Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
环境声音深度伪造检测要求对4秒环境声片段输出真伪置信分数,难点在于事件类别高度多样且多声源频繁重叠,语音领域依赖的音高与音素线索在此不可靠。为此挑战以EnvSDD为基础划分可见与不可见文本到音频和音频到音频生成器,再引入视频到音频黑盒赛道并仅提供约1%黑盒训练数据,随后用等错误率统一评测全部提交。参赛方法形成三步链条:首先以EAT与BEATs等大规模自监督模型抽取高层声学表征以抑制生成器特有伪影,其输出的频谱时序特征进入BiCrossMamba等多分支分类后端做精细建模,最后经语义对齐增强与多系统分数融合得到最终置信分。与基线相比,优胜方案的关键差异是用大规模自监督表征加多系统融合替代单模型谱时图注意力,从而捕捉与生成器无关的伪造痕迹。在Track 2测试条件下,HEU系统的EER为2.96%,低于BEATs+AASIST基线的EER 12.48%。结论仅适用于所含9种生成器配置与16 kHz短片段条件,对开放世界新模型与组分级篡改尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/apple-yinhan/ESDD-Review — 链接可访问(HTTP 200)
- 数据相关资源:https://envsdd.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 用领域加权把三类专家装进一个编码器:USAD 2.0 的两阶段蒸馏与十亿参数扩展
英文题目:USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding
标签:#知识蒸馏 #统一音频模型 #音乐 #音频理解
评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:模型报告 | 主任务:#音频理解 | 主方法:#知识蒸馏
👥 作者与机构
- Heng-Jui Chang:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Saurabhchand Bhati:机构信息未能从会议 PDF 纯文本可靠映射
- Mrudula Athi:机构信息未能从会议 PDF 纯文本可靠映射
- Anton Ratnarajah:机构信息未能从会议 PDF 纯文本可靠映射
- Amit Chhetri:机构信息未能从会议 PDF 纯文本可靠映射
- James Glass:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
通用音频编码器需以单一冻结表征同时服务语音环境声与音乐的探测与音频大模型理解,而单领域自监督专家存在跨域失配与语义对齐不足。USAD 2.0第一阶段以领域感知蒸馏从WavLM、ATST-Frame与MuQ三教师学习分层表征并扩展音乐数据覆盖,其输出作为初值进入第二阶段。第二阶段仅蒸馏Whisper Large-v3与AF-Whisper末层做语义对齐得到USAD 2.0+,再经50Hz到25Hz降帧与深度上扩展推至十亿参数以提升容量与效率。与等权蒸馏的关键差异是按输入领域标签软加权教师损失,匹配教师放大至w=ω/(ω+M-1),失配教师保留1/(ω+M-1),ω=10,避免硬切换丢失混合音频线索。在XARES-LLM基准下,SSL预训练初始化的XLarge+的Track A得分为0.772,高于从头训练的Track A得分0.731。该结论限于冻结编码器评测与所选三领域教师覆盖,未验证开放词汇推理、强噪声重叠与微调场景,且有监督多专家拼接基线在 Track A/B 仍以 0.806/0.685 领先。原文披露 Hugging Face 模型集合,未披露训练推理成本与优化器细节。
🔗 开源资源
- 模型相关资源:https://hf.co/collections/MIT-SLS/usad2 → https://huggingface.co/collections/MIT-SLS/usad2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 尾词把延迟排名带偏了:同时语音翻译延迟指标的元评价与修正
标签:#评测协议 #模型评估 #流式处理 #语音翻译
评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#评测协议
👥 作者与机构
- Peter Polák:机构信息未能从会议 PDF 纯文本可靠映射
- Sara Papi:机构信息未能从会议 PDF 纯文本可靠映射
- Luisa Bentivogli:机构信息未能从会议 PDF 纯文本可靠映射
- Ondřej Bojar:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
同时语音翻译(Simultaneous Speech Translation,SimulST)以连续语音流为输入并增量输出目标语言文本,需在翻译质量与用户等待时间之间权衡,而现有延迟指标在人工预切分短式评测中排名矛盾且在无切分长式评测中失效。该工作先以词级源文时间戳加目标到源词对齐构造真值延迟(True Latency,TL)作为元评测金标准,再提出短式指标又一平均滞后(Yet Another Average Lagging,YAAL)并将其扩展为长式指标与软重切分器(SOFTSEGMENTER)流水线,最后用成对排序准确率比较自动指标与真值的一致性。与包含尾词的平均滞后(Average Lagging,AL)等指标不同,YAAL仅统计源音频结束前严格同步生成的词,从而消除离线尾词对延迟的系统性低估或扭曲。在包含4900个短式系统对的IWSLT 2022/2023与MuST-C评测中YAAL达到98%的成对准确率,显著高于全部传统指标,而在长式评测中LongYAAL达到94%并超越基于旧切分器的StreamLAAL约12个百分点。该结论限于IWSLT高资源英德英日英中与捷英增量式系统且依赖对齐质量,在强非单调语序、噪声重叠语音与低资源语言中尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/pe-trik/OmniSTEval — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 在单流服务引擎里塞进多码本与双路引导:延迟交织与配对调度的吞吐保卫战
英文题目:An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation
标签:#开源工具 #自回归模型 #统一音频模型 #高效推理 #音频生成
评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前25% | 文档类型:系统技术报告 | 主任务:#音频生成 | 主方法:#自回归模型
👥 作者与机构
- Haoran Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jinchuan Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Siddhant Arora:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
统一语音理解与生成要求同一自回归模型输入文本与编码语音并输出文本与多码本音频,而现有高吞吐引擎仅支持单流文本自回归,难以原生处理延迟交织多流采样与条件无条件双路引导。先将每步多码本隐状态与流嵌入输入主辅分解,由一路主码本交由调度器管理并在对数计算内采样缓冲其余辅流,输出单流主词元序列并使其进入下一步模态控制。再将主词元序列输入模态状态机与动态词表掩码,依据输出分布推断模态并注入桥接词元与刷尾补齐,输出完整S×T码本矩阵并送入片上合成。最后将完整矩阵与条件无条件配对请求输入同批前向与片上声学解码器,共享主干前向合并引导对数同步采样并直接合成波形,与朴素双请求独立调度相比以共享前向与前缀缓存复用吸收双路开销而非重复分配显存。在单卡H100评测设置下,Bagpiper(vLLM)的解码吞吐指标为5694.5 tok/s,高于Bagpiper(PyTorch)的解码吞吐指标52.7 tok/s。该结论仅适用于延迟模式残差向量量化架构与单卡大并发压测,尚未验证流式低延迟对话与多卡分布情形。推理部署成本为单张H100显卡持续高并发serving,原文未披露训练成本。
🔗 开源资源
- 代码相关资源:https://github.com/whr-a/vllm/tree/opuslm — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 先记住真话的腔调,再识破假声的破绽:ProSDD 的两阶段韵律建模
标签:#多任务学习 #韵律 #语音 #音频深度伪造检测
评分:8.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#多任务学习
👥 作者与机构
- Aurosweta Mahapatra:机构信息未能从会议 PDF 纯文本可靠映射
- Ismail Rasim Ulgen:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Andrews:机构信息未能从会议 PDF 纯文本可靠映射
- Berrak Sisman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造检测(Speech Deepfake Detection,SDD)需判断输入为真实人声还是文本到语音(Text-to-Speech,TTS)与语音转换(Voice Conversion,VC)合成,难点是现代富有表现力合成已高度自然且情感韵律严重外推,致使仅依赖伪造伪影的分类器极易失效。ProSDD先基于基频、浊音活动与能量构造说话人条件韵律目标并以掩码对比预测从纯真实语音中学习自然韵律变异,然后以该阶段权重初始化伪造判别训练并保留韵律预测作为辅助正则,推理仅用主干与轻量分类头输出真伪。与把韵律或情感特征拼入分类器的做法不同,该方法直接用监督掩码目标结构化自监督学习(Self-Supervised Learning,SSL)主干的上下文表示,从而以内化真实韵律为基准感知合成偏差并提升跨域鲁棒性。在ASVspoof 2024测试集上将等错误率(Equal Error Rate,EER)从25.43%降至16.14%,在ASVspoof 2024训练下从39.62%降至7.38%。结论适用于情感与表现力偏移及TTS与VC之间的跨攻击泛化,但对通道退化、多语言与未知高自然度系统的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://prosdd.github.io/ProSDD_website/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 只转尾部奇异方向:用受限旋转与权重平均做语音持续学习
英文题目:Parameter-Efficient Continual Learning for Automatic Speech Recognition
标签:#持续学习 #参数高效微调 #多语言 #语音识别
评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#持续学习
👥 作者与机构
- Steven Vander Eeckt:机构信息未能从会议 PDF 纯文本可靠映射
- Hugo Van hamme:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向冻结语音基础模型逐任务适配新方言并保留初始多语言能力的持续学习任务,输入为新方言语音与对应转写,输出为覆盖全部已学任务的转写结果,难点在于严格参数高效约束下新任务有效适配与旧任务灾难性遗忘之间的冲突。方法首先对每个线性层权重矩阵做奇异值分解,按奇异值能量将前部大能量方向划为头部并冻结,以保留主导表征不受干扰。接着仅在后部低能量尾部子空间内学习近似旋转矩阵,上一步冻结头部后剩余的尾部残差直接作为本步旋转学习的输入,使更新局限于低干扰方向。然后在学习后续任务时重新计算奇异值分解并重划头尾,再将历史尾部旋转解与新任务临时解做凸权重平均,前一步的尾部解直接进入平均以抑制共享尾部内的任务间干扰。在实验1荷兰语系评测设置下,CSSVD的平均WER为18.33%,低于LoRA+FTA的平均WER19.64%。与直接约束低秩增量或仅做增量平均的已有方法不同,该方法以尾部约束限定更新子空间并以近似旋转保持变换结构,消融显示去掉平均会明显增加遗忘而额外学习重缩放几乎无增益。该结论仅在单基座、两任务步、荷兰语系内验证,跨语系、长序列与推理成本外推尚未证明。该结论的适用边界受限于单基座与荷兰语系短序列场景,原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/StevenVdEeckt/pecl-for-asr — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 不用时长标签也能对准歌词:分块流匹配如何兼顾长歌连贯与效率
英文题目:DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching
标签:#流匹配 #偏好优化 #变分自编码器 #音乐 #歌唱生成
评分:8.3/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#歌唱生成 | 主方法:#流匹配
👥 作者与机构
- Yuepeng Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Huakang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Ziqian Ning:机构信息未能从会议 PDF 纯文本可靠映射
- Jixun Yao:机构信息未能从会议 PDF 纯文本可靠映射
- zerui Han:机构信息未能从会议 PDF 纯文本可靠映射
- Di Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Meng Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Luan:机构信息未能从会议 PDF 纯文本可靠映射
- Zhonghua Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
歌曲生成的输入是歌词与文本或音频风格提示,输出是分钟级人声加伴奏立体声混音,其难点在于长时歌词对齐、主伴和谐与曲式连贯难以兼得。DiffRhythm 2首先用5Hz音乐变分自编码器将24kHz波形压缩为短序列隐变量,以降低序列长度并保留重建质量,压缩后的隐变量序列直接进入下一步建模。接着扩散变换器按固定块长交替执行块内并行流匹配与块间自回归扩展,推理时逐块采样并用块级键值缓存传递历史隐状态以保持连贯。然后在连续历史隐层上施加随机块表征对齐损失与MuQ自监督表征对齐以学习曲式,并用跨对偏好优化将音乐性加歌词准确率、风格相似度加音频质量分组配对一次优化多目标。相对已有方法,其关键差异是用半自回归块流匹配替代纯非自回归或全自回归,无需时长标签即实现歌词与演唱对齐,同时避免分轨独立预测导致的主伴不一致与模型合并退化。在块大小对比测试集下,块大小20条件的实时率指标为0.154,低于块大小5条件的实时率指标0.455。该结论适用边界为中英文为主、最长210秒的流行混音歌曲,尚未验证超长曲目、小语种与细粒度音色控制。推理开销方面原文以实时因子刻画不同块大小的计算量,块增大时实时因子明显下降但训练成本等细节披露有限。
🔗 开源资源
- 代码相关资源:https://github.com/xiaomi-research/diffrhythm2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 不改解码器做多说话人理解:用声纹活动掩码把目标说话人先抽出来
英文题目:Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning
标签:#模型融合 #音频大模型 #音频问答 #目标说话人提取
评分:8.3/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#模型融合
👥 作者与机构
- Alexander Polok:机构信息未能从会议 PDF 纯文本可靠映射
- Samuele Cornell:机构信息未能从会议 PDF 纯文本可靠映射
- Sathvik Udupa:机构信息未能从会议 PDF 纯文本可靠映射
- Honza Černocký:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
- Lukáš Burget:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理远场多说话人音频的说话人归属转写与理解,输入为重叠混合语音加说话人活动信息,输出为按目标说话人分离的文本及其问答与摘要,难点在于重叠干扰与长时多轮推理。方法链分三步推进:外部说话人分离标注模型先输出帧级活动概率并折算为静音目标非目标重叠四态掩码;带帧级条件变换的Whisper编码器在各层调制声学表示以抽取目标说话人嵌入;冻结的大语言模型解码器经适配器接收该嵌入并按文本提示生成转写或答案。与序列化输出训练改词表改解码器的做法不同,本方法保持解码器与词表不动,把多说话人归一化前移到编码器。在4个多说话人数据集转写评测下,Dixtral的cpWER为15.4%,低于Gemini 3.0 Flash的cpWER 44.4%。该结论的适用边界限于英语会议类远场数据且依赖外部分离标注质量,重叠严重或标注错误时抽取会退化并构成失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/BUTSpeechFIT/Dixtral — 链接可访问(HTTP 200)
- 数据相关资源:https://hf.co/datasets/popcornell/NSF-QA → https://huggingface.co/datasets/popcornell/NSF-QA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 从被动端点检测到提前预报:用推测执行掩盖级联对话延迟
标签:#多任务学习 #高效推理 #流式处理 #语音 #轮次切换
评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#轮次切换 | 主方法:#多任务学习
👥 作者与机构
- Sathvik Udupa:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
- Petr Schwarz:机构信息未能从会议 PDF 纯文本可靠映射
- Honza Černocký:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
级联式语音对话系统需等待用户轮次结束才触发识别与生成,导致首音频延迟高达1至2秒,远超人类约250 ms的衔接水平。针对该反应式端点检测瓶颈,本文提出端点预期(Endpoint Anticipation,EPA),直接从双流语音预测未来固定视界内是否出现轮次结束。为此模型先用冻结的Mimi神经编解码器抽取用户与系统声学特征,再经流式Transformer编码器融合为统一上下文并输出多视界概率,首个超阈帧即触发下游推测执行。与依赖转写文本的早期预测及通用轮次投影方法不同,该机制完全绕过自动语音识别(Automatic Speech Recognition,ASR),并以固定提前量解耦置信度控制。在SpokenWOZ任务型语料评测下,EPA-M的MRA指标为640 ms,高于VAP基线的MRA指标160 ms。接入Unmute框架后平均延迟降低505 ms,代价是约28.4%的冗余推测计算。该结论更适用于结构化任务对话,在开放式自发对话与中途变卦等语义边界上尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/bloodraven66/EndpointAnticipation — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/kyutai-labs/unmute — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/ErikEkstedt/VAP — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 在移动对话中解码注意:MOV-AAD 如何把脑电与身体信号同步起来
标签:#数据集 #数据集构建 #生理信号 #脑信号 #言语神经解码
评分:8.2/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#言语神经解码 | 主方法:#数据集构建
👥 作者与机构
- Xiaomin He:机构信息未能从会议 PDF 纯文本可靠映射
- Vishal Choudhari:机构信息未能从会议 PDF 纯文本可靠映射
- Tristan J. Spratt:机构信息未能从会议 PDF 纯文本可靠映射
- Aarya Raghavan:机构信息未能从会议 PDF 纯文本可靠映射
- Richard T. Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Nima Mesgarani:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
听觉注意解码(Auditory Attention Decoding,AAD)的输入是多说话人竞争场景下的脑电与生理记录,输出是受试者注意的语音包络或声源轨迹,难点在于声源持续移动、对话轮替与背景噪声叠加时神经追踪信号微弱且易受运动伪迹污染。该工作先用头相关传输函数(Head-Related Transfer Function,HRTF)渲染在正负90度额半平面内连续移动的单对话与双对话刺激并叠加行人声或babble噪声,再同步采集64导脑电、眼动瞳径注视、呼吸气流与胸带努力、皮电、光电容积脉搏、心率血氧皮温加速度等多模态信号并对齐音频,最后用后向时域响应函数重建包络与轨迹并以判别模型完成注意分类。与静态双说话人数据集相比,关键机制差异是用一阶马尔可夫链生成的平滑移动轨迹与有话者切换的自然对话替代固定方位朗读,从而同时考验包络追踪与空间轨迹追踪。在多对话任务中受试流重复词F1显著高于非受试流,双尾Wilcoxon检验p小于0.0001且秩效应量r为0.87,包络重建的受试与非受试相关分离随窗长稳定存在。该结论仅适用于耳机渲染、非个体化声学条件下的正常听力人群,向真实房间混响、助听器佩戴者与老年群体的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://github.com/naplab/MOV-AAD — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 判别先分、生成再修:MeCo 用一步平均速度把估计搬回干净语音流形
英文题目:MeCo: One-Step MeanFlow-based Corrector for Multi-Channel Speech Separation
标签:#流匹配 #高效推理 #麦克风阵列 #语音分离
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#流匹配
👥 作者与机构
- Dohwan Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jung-Woo Choi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为4通道混响噪声混合的复数短时傅里叶变换(Short-Time Fourier Transform,STFT)与冻结判别分离器的单说话人初估计,输出为去噪去混响后的干净语音,难点在于判别模型保真度高但感知不自然而迭代生成模型延迟过高。本文先用冻结判别分离器得到初估计,再以多通道混合与初估计为条件学习条件平均速度场(MeanFlow),将 \(t=1\) 的失真估计一步搬运到 \(t=0\) 的干净流形,接着用数据空间优化(Data-Space Optimization,DSO)联合位移加权的 \(xr\) 损失与端点 SI-SDR 损失分别保障自然度与终端保真度。与依赖分数匹配教师蒸馏且仅用信噪比目标微调的Fast-GeCo不同,该方法直接学习有限区间平均速度并以位移距离加权速度误差,从而在一步条件下同时保留生成先验与终端保真度,具有低延迟实用的意义。在LibriSpeech+DEMAND评测设置下,DeFTAN2加MeCo的NISQA为4.38,高于加Fast-GeCo的NISQA 4.00。在WSJ0+WHAM!评测设置下,DeFTAN2加MeCo的SI-SDR为10.08 dB,高于加Fast-GeCo的SI-SDR 9.81 dB。该结论限于 gpuRIR 仿真房间与 16 kHz 分段语音,未在真实录音与移动声源下验证。推理额外开销为 1 次函数求值(Number of Function Evaluations,NFE)与 0.0068 实时因子(Real-Time Factor,RTF),训练成本原文未披露。
🔗 开源资源
- 代码相关资源:https://github.com/rlaehghks5/MECO — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 幼儿语音太难转写:用半百万元音素标注把预训练拉回日常长录音
英文题目:BabAR: from phoneme recognition to developmental measures of young children’s speech production
标签:#数据集 #SFT #语言习得 #多语言 #语音识别
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#SFT
👥 作者与机构
- Marvin Lavechin:机构信息未能从会议 PDF 纯文本可靠映射
- Elika Bergelson:机构信息未能从会议 PDF 纯文本可靠映射
- Roger Levy:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童语音输入为自然情境长录音中边界粗糙的幼儿发声,输出为跨语言音素序列,难点是声道发育未成熟带来高声学变异,加之成人串音与环境噪声使目标说话人难以分离。方法链分三步:先将 PhonBank 中 31 个语料的异构国际音标转写归一到 57 音素并按儿童切分训练验证测试集,再以儿童日长录音预训练的编码器提取帧级表示,最后用联结时序分类 Connectionist Temporal Classification(CTC)微调并引入 20 秒扩展上下文以抑制干扰并适配嗓音。与成人预训练模型及通用音素识别器相比,该路线以领域内预训练加上下文感知微调实现目标儿童聚焦。TinyVox 测试集上系统音素错误率 Phoneme Error Rate(PER)为 42.1%,相对两个 120% 以上基线下降逾 80 个百分点,并在 SEEDLingS 纵向语料上使自动典型发声比例轨迹落入人工元分析的 95% 置信区间。结论限于组级别粗粒度发育指标与同源语料分布,外推到个体诊断与跨语言平衡评估尚未验证。单配置在单张 NVIDIA V100 32GB 上训练约 5 天,推理延迟吞吐与部署成本未报告。
🔗 开源资源
- 代码相关资源:https://github.com/MarvinLvn/BabAR — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/MarvinLvn/tinyvox — 链接可访问(HTTP 200)
- 演示资源:https://marvinlvn.github.io/projects/babar/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 用罗马化统一文字、用语音 token 补回发音:UR-BERT 如何把 TTS 文本编码器扩到 495 种语言
标签:#知识蒸馏 #多语言 #预训练 #文本到语音
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#知识蒸馏
👥 作者与机构
- Sangmin Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Eek Gyun Ahn:机构信息未能从会议 PDF 纯文本可靠映射
- Woongjib Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Hong-Goo Kang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大规模多语言TTS的任务是以任意书写系统的文本为输入,输出对应语言自然可懂的语音,实际难点在于正字法高度多样而可靠G2P仅覆盖约100种语言,且相同罗马化串在不同语言中对应不同发音带来声学模糊。UR-BERT的方法链分三步:先用Uroman将495种语言正字法统一转写为约30个拉丁字母的字符序列,送入共享字符级编码器。接着以Omnilingual-ASR-W2V-300M为教师提取语音表示,经强制对齐到罗马化字符并以257码本离散化为每字符语音token作为辅助目标。然后在BERT-base上联合优化掩码语言建模与语音token预测,使文本编码直接推断声学信息,再接入VITS微调合成语音。与依赖音素序列的m-PLBERT和XPhoneBERT相比,该机制以紧凑共享词表换取对无G2P语言的可扩展性,并以声学蒸馏补偿罗马化的语音抽象。在包含英语、德语和普通话的高资源评测中,UR-BERT在英语上达到平均意见分(Mean Opinion Score,MOS)4.35,显著高于XPhoneBERT的4.11,且仅用后者约2.5%的文本量(8M对330M句)完成预训练。低资源与零样本巽他语上同样取得每语言MOS最高。该结论目前限于VITS架构与11种有监督微调语言,极低资源语言的韵律稳定性与跨架构泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/sanghyang00/ur-bert — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 从更大更杂的数据到更准的边界:MFA 3.0 如何重做语音到文本对齐
英文题目:Montreal Forced Aligner and the state of speech-to-text alignment in 2026
标签:#评测协议 #语音学与音系 #跨语言 #语音 #强制对齐
评分:8.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.3/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:系统技术报告 | 主任务:#强制对齐 | 主方法:#评测协议
👥 作者与机构
- Michael McAuliffe:机构信息未能从会议 PDF 纯文本可靠映射
- Kaylynn Gunter:机构信息未能从会议 PDF 纯文本可靠映射
- Michael Wagner:机构信息未能从会议 PDF 纯文本可靠映射
- Morgan Sonderegger:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
强制对齐的输入是语音与已知正字转写,输出是词与音素级时间边界,且转写已知而精确边界未知,难点在于自发语音、方言变体和低资源语言下发音多样与录音噪声交织。蒙特利尔强制对齐器 Montreal Forced Aligner 3.0以多阶段流水线衔接大规模预训练、说话人自适应与发音建模,预训练输出进入自适应或跨语言重映射以适配目标人群与方言,再由发音概率加权词典有限状态机完成解码。与无词典的端到端神经语音识别对齐器相比,该机制保留音素中间表示与可训练发音变体,因而边界更贴合语音学需求,并支持人工校对迭代优化。在Buckeye自发英语上词平均边界误差为21.75 ms并领先所有基线,音素级Global模型在多集上平均误差持续低于15 ms,韩语首尔语料专用模型音素平均误差为14.78 ms且大幅优于1.0版本的20.69 ms。结论限于成年英日韩读与自发语音,对儿童、第二语言和极低资源语言的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/MontrealCorpusTools/mfa-interspeech2026 — 链接可访问(HTTP 200)
- 复现相关资源:https://github.com/mmcauliffe/mfa-adaptation — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 不训练分类器也能认出是谁合成的:残差统计指纹的轻量归因
标签:#统计分析 #语音 #音频指纹 #语音伪造检测
评分:8.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#统计分析
👥 作者与机构
- Matías Pizarro:机构信息未能从会议 PDF 纯文本可靠映射
- Mike Laszkiewicz:机构信息未能从会议 PDF 纯文本可靠映射
- Dorothea Kolossa:机构信息未能从会议 PDF 纯文本可靠映射
- Asja Fischer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为任意时长待测语音波形,输出为真伪判定与来源模型归属,难点在于语义内容掩盖微弱生成伪影且新合成模型不断涌现。方法先将对数幅度短时傅里叶变换按时间平均为固定维谱向量以抑制音素起伏并保留谱包络偏置,其输出进入内容保持滤波得到残差嵌入。再按目标模型平均估计残差统计指纹的经验均值与协方差,并用目标残差分布的马氏距离完成单模型阈值判决或多模型最近指纹归属。与闭集分类器不同,该框架新增模型只追加一个均值与协方差而无需重训,因而更易扩展并降低维护负担。在ASVspoof LA基准下,RSF CNN的准确率为0.95,高于X-vector的准确率0.87。该结论适用边界受限于非自适应对手与中轻度失真,强压缩、强回声、混响与低信噪比加噪属于失败条件,声学相似的同族声码器易混淆,重估计可部分恢复,跨语种与未知失真组合尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/matiuste/RSF — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 噪声下别硬听:用稀疏对齐与视觉离散单元约束大模型的音视识别
标签:#多模态学习 #向量量化 #大语言模型 #鲁棒性 #音视频语音识别
评分:8.2/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音视频语音识别 | 主方法:#多模态学习
👥 作者与机构
- Fei Su:机构信息未能从会议 PDF 纯文本可靠映射
- Cancan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Ju:机构信息未能从会议 PDF 纯文本可靠映射
- Hongbin Suo:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频语音识别(Audio-Visual Speech Recognition,AVSR)以含噪语音与唇动视频为输入并输出转写文本,难点在于声学退化时视觉补充不足且大语言模型(Large Language Model,LLM)融合粗糙而提示过长。本文提出AVUR-LLM,分三步推进:稀疏模态对齐(Sparse Modality Alignment,SMA)先将视觉特征重采样到音频帧率并在音频编码器上层做音频条件交叉注意力以校准视觉表征,随后自适应调制融合(Adaptive Modulated Fusion,AMF)用解码器前向声学探针估计逐词元不确定性并门控视觉注入强度,最后视觉单元引导精修(Visual Unit-Guided Refinement,VUR)把中层视觉特征离散压缩为紧凑词元序列供低秩适应(Low-Rank Adaptation,LoRA)后的LLM做N最佳重打分。与独立投影加浅层融合相比,该设计以止梯度保护音频通路并实现噪声感知的方向与幅度双重控制。在LRS3数据集433小时设置下,音视频系统在干净集词错率(Word Error Rate,WER)为0.75%,在0dB巴布尔噪声下为1.7%,相对MMS-LLaMA降低约37%。结论仅在英语TED演讲与人工加噪条件下成立,未验证真实混响重叠与多语言跨域外推,适用边界尚未验证真实场景外推而受限。原文披露编码器选型与LoRA配置但未披露批量大小、训练步数与推理束宽等复现细节。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/yakumo72/AVUR-LLM — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 从朗读到街头实录:AfriVox-v2 用领域纵深逼出非洲语音识别的真实误差
英文题目:AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition
标签:#基准测试 #数据集 #基准设计 #多语言 #语音识别
评分:8.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Busayo Awobade:机构信息未能从会议 PDF 纯文本可靠映射
- Gabrial Ashungafac:机构信息未能从会议 PDF 纯文本可靠映射
- Oluwatoni Otokiti:机构信息未能从会议 PDF 纯文本可靠映射
- Tobi Olatunji:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非洲语音识别长期被朗读语料高估,真实部署需处理非洲语言的自发对话、环境噪声、口音变异及农业与金融等垂直领域术语,输入为野外长音频而输出为逐词转写与实体数值保真。作者先聚合 Africa Next Voices(AFN)与 Waxal 等会话语料并新建 Intron-YT 野外数据集,经语音活动检测(Voice Activity Detection,VAD)切分与母语者转写质检形成评测池,再用多标签流程对转写做领域标注并单独标记数值与命名实体,最后以统一 16kHz 音频与语言提示在 5 类模型上测词错误率(Word Error Rate,WER)与实体数值误差。与通用多模态大模型偏重语义理解不同,该基准强制考核声学精确解码与领域词汇泛化,因而暴露出电信与体育等术语密集场景的系统性失效。在 AfriVox-v2 全语言平均上区域优化的 Sahara-v2 以 20.49% 的 WER 显著优于 Omni-CTC 7B 的 27.85% 与 Gemini 3 Flash 的 26.59%,证明区域数据胜过单纯扩大参数。结论仅适用于所覆盖语言与已验证领域分布,对未覆盖的数百种非洲语言及重叠语音极端噪声外推不足。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/intronhealth/afrivox-v2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 从朗读式评测到电话闲聊:Voice of India 为何重写印度语语音识别的及格线
英文题目:Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India
标签:#基准测试 #基准设计 #模型评估 #多语言 #语音识别
评分:8.1/10 | 创新 1.6/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Kaushal Bhogale:机构信息未能从会议 PDF 纯文本可靠映射
- Manas Dhir:机构信息未能从会议 PDF 纯文本可靠映射
- Amritansh Walecha:机构信息未能从会议 PDF 纯文本可靠映射
- Manmeet Kaur:机构信息未能从会议 PDF 纯文本可靠映射
- Vanshika Chhabra:机构信息未能从会议 PDF 纯文本可靠映射
- Aaditya Pareek:机构信息未能从会议 PDF 纯文本可靠映射
- Hanuman Sidh:机构信息未能从会议 PDF 纯文本可靠映射
- Sagar Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Bhaskar Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Utkarsh Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Tahir Javed:机构信息未能从会议 PDF 纯文本可靠映射
- Shobhit Banga:机构信息未能从会议 PDF 纯文本可靠映射
- Mitesh M Khapra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向印度多语言环境下自发电话对话的自动语音识别(Automatic Speech Recognition,ASR)评测任务,输入为带噪声、方言与语码混合的长语音,输出为语义忠实的文字,难点在于脚本化干净基准无法反映真实分布且单参考词错误率(Word Error Rate,WER)会误罚合法拼写变体。方法链由四步构成:先经双人电话平台采集并用话题提示激发长叙述,再经语音活动检测(Voice Activity Detection,VAD)切分与语言识别和感知质量过滤筛选片段,接着由机器预转写加6轮交叉校对生成高精度基准,最后并行构建容纳词汇与语音变体、连写与命名实体及口吃可选节点的转写格。相比已有公开基准,该设计以闭源防过拟合与正字法感知词错误率(Orthographically-Informed WER,OIWER)允许多合法路径匹配,地理上按人口比例覆盖139个簇并下钻到区县级误差地图。在包含15种语言的Voice of India评测上,最优系统在13种语言取得最低误差但在博杰普尔语等仍超20%可用阈值,公共基准优胜者在真实集上排名明显下滑。结论仅适用于所覆盖语言与电话对话场景,对区县级小样本与2011年人口权重的时效性外推有限。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/JoshTalks/voice-of-india — 链接不可用(HTTP 404)
- 数据相关资源:https://voiceofindia.ai/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 笑声和哭声翻不过去:MoVE 用混合发声专家保留非言语声
标签:#数据集 #混合专家模型 #跨语言 #语音翻译
评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#混合专家模型
👥 作者与机构
- Szu-Chi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- I-Ning Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Yi-Cheng Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Sung-Feng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
表达性语音到语音翻译(Speech-to-Speech Translation, S2ST)需将源语言语音中的笑声与哭泣等非言语发声(Non-verbal Vocalizations, NVs)一并转写翻译并重建为目标语言语音,难点在于真实 NV 数据稀缺且多情感混合易在共享参数中相互干扰。本文先以情感自适应合成构建英中平行表达语料,再冻结音频大模型(Audio Large Language Model, AudioLLM)基座并在其上并行训练 5 个发声专家,最后以无标签语言建模损失训练令牌级软加权路由器(Router)实现混合情感动态融合。合成管线先以笑声检测器与人工核验筛选提示音频,再用解耦声纹与情感韵律的合成引擎生成千小时级平行语料并经双语转写过滤对齐,为专家训练提供可控输入。与共享单适配器易致情感平滑的已有方案不同,五专家各居独立低秩子空间专攻一类情感流形,路由器按上下文逐令牌分配连续权重,从而在保留基座语义能力的同时实现细粒度混合表达。在NonverbalTTS客观评测任务下,MoVE的NV Match准确率为76.00,高于SeamlessExpressive的NV Match准确率14.00。该结论仅在英中双语、5 类情感加合成数据分布内得到验证,对真实噪声 NV 与未见语种的外推尚未证实。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://47zzz.github.io/MoVE/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 没有配对报告时如何让呼吸音编码器听懂医学语言:REACH 的对齐路线
英文题目:Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment
标签:#医疗音频 #对比学习 #零样本 #音频分类
评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#对比学习
👥 作者与机构
- Mustafa Talha İlerisoy:机构信息未能从会议 PDF 纯文本可靠映射
- Hung Manh Pham:机构信息未能从会议 PDF 纯文本可靠映射
- Mathias Funk:机构信息未能从会议 PDF 纯文本可靠映射
- Mykola Pechenizkiy:机构信息未能从会议 PDF 纯文本可靠映射
- Aaqib Saeed:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
呼吸音分类输入为咳嗽、肺部听诊音与呼气等录音,输出为新冠、吸烟、COPD、阻塞性疾病与严重度分级等类别,难点在于自监督音频编码器虽能分辨喘鸣与爆裂音等细粒度模式,但嵌入空间未与临床概念对齐,新病种仍需稀缺专家标注微调。所提框架REACH先以GPT-4等医学大语言模型将声音类型、异常音标签、记录部位、人口学与诊断等离散元数据合成为2至3行肺科报告,形成稠密语义锚点;再以冻结的MedSigLIP文本分支提供稳定语义参照,仅优化音频编码器与双侧投影头;接着以Sigmoid对比损失拉近匹配对并以掩码频谱重构损失约束声学流形不坍缩,同时用FAISS远距离负采样拉开易混病理。与通用音频文本模型的日常字幕接地不同,该方法将对齐与声学预训练解耦,专注学习跨模态桥接而非重学表示。在6个数据集9个任务上,零样本平均AUC达到61.3%,超越CLAP的51.4%与7B生成式模型的54.9%,且线性探测平均71.6%亦居首。该结论在咳嗽细粒度性别区分与5分类COPD严重度分级等文本区分度弱的任务上不成立,跨机构设备与人群的外推尚未验证。原文未披露推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/mtilerisoy/REACH — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 自然分布会掩盖长尾失败:Earnings25 用 500 小时全量通话加 46 小时均衡切片测金融语音
英文题目:Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance
标签:#基准设计 #长音频处理 #语音 #语音识别
评分:8.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Denglin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoran Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Anshul Wadhawan:机构信息未能从会议 PDF 纯文本可靠映射
- Brendan Fahy:机构信息未能从会议 PDF 纯文本可靠映射
- Vinay Ramesh:机构信息未能从会议 PDF 纯文本可靠映射
- David Weisberg:机构信息未能从会议 PDF 纯文本可靠映射
- Dmitriy Derkachevskiy:机构信息未能从会议 PDF 纯文本可靠映射
- Helen Sheehan:机构信息未能从会议 PDF 纯文本可靠映射
- Srivas Prasad:机构信息未能从会议 PDF 纯文本可靠映射
- Michele Franceschini:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该基准输入为英语财报电话会议长音频,输出为转写文本及说话人角色与行业分层评估,难点在于财报术语密集、数字表达多变、准备稿与问答自发语音交织并伴随快速轮转与重叠。构建链条分为四步:先按地域与行业对全量通话做分层抽样以兼顾自然分布与均衡覆盖,再用联结时序分类模型做强制对齐得到词级时间戳,接着按时长约束贪心聚合为评估单元并做内容过滤去操作员套话,最后附加说话人、行业与公司元数据形成可复现划分。与SPGISpeech偏训练语料和Earnings-21/22缺行业均衡及角色标注相比,该工作把长程上下文保留与长尾术语暴露统一在一个可复用协议中。在testset-full基准下,Parakeet-tdt-0.6b-v2的WER为0.10837,低于Whisper-large-v2的WER 0.14039。结论仅适用于英语美国公司主导的财报场景,未验证多语言、强口音与高重叠问答下的外推能力。生物技术等长尾行业的误差显著偏高,其跨语种泛化有效性尚未验证且受限于英语财报场景。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://doi.org/10.5281/zenodo.18762168 → https://zenodo.org/records/18762168 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 非言语发声不是音效:NV-Bench 把交际功能、对齐与逼真度分开测
英文题目:NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
标签:#基准测试 #基准设计 #多语言 #文本到语音
评分:8.1/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#基准设计
👥 作者与机构
- Qinke Ni:机构信息未能从会议 PDF 纯文本可靠映射
- Huan Liao:机构信息未能从会议 PDF 纯文本可靠映射
- Dekun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhizheng Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非言语发声(nonverbal vocalization,NV)合成要求由带标记文本生成兼顾语言内容与副语言事件的语音,难点在于事件长尾分布、在野录音多人混叠以及缺乏配对真人参考导致控不准与音质差无法解耦。本文构建多语言在野基准NV-Bench,先用多语言非言语识别器批量转写再经十名专家校验得到提示与真人音频对,共1651条约7.9小时,按严格均衡单标签与相对均衡多标签划分中英文子集。评测沿指令对齐与声学保真双维度展开,前者用副语言字符错误率刻画事件级可控性,后者用分布距离与说话人相似度刻画真实感差距。与把非言语当附加音效的主流做法相比,该工作以Batliner功能分类统一标签并强制配对参考,使韵律恰当性可被量化检验。在SMIIP-NV测试集下,NVASR的CER为1.29%,低于Qwen2.5-Omni的CER 3.59%。结论仅适用于中英文短句层面的受控提示合成,未验证长对话、自发交互与跨文化语用迁移,原文未披露训练推理成本与时延。
🔗 开源资源
- 数据相关资源:https://charlesnii.github.io/nvbench.github.io → https://charlesnii.github.io/nvbench.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 把比特花在变化处:DTM-Codec 用掩码与等路径分段做可变帧率语音编码
英文题目:DTM-Codec: Dynamic Token Masking for VFR Speech Coding with Efficient Boundary Selection
标签:#主观评测 #Transformer #向量量化 #语音 #语音编码
评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Hoyeol Sohn:机构信息未能从会议 PDF 纯文本可靠映射
- Juhan Nam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
神经语音编码的任务是以极低总码率输入原始波形并输出可懂且保真的重建波形,实际难点在于可变帧率省下的帧必须额外传输保留位置,边信息稍大就会抵消内容节省且难以与固定帧率公平对比。方法先以固定短时傅里叶变换编码得到全分辨率第一阶段特征,再由路径长度能量边界选择器按内容自适应生成二值掩码并决定保留帧位置。接着系统将保留令牌打包为变长短序列送入第二阶段Transformer建模并经单码本向量量化为内容比特,同时将二值掩码作为位置比特与内容比特一并传输。解码端以可学习掩码嵌入回填被掩位置以恢复全长序列,再经逆变换与对抗重建实现位置感知波形合成,其与已有方法的关键差异在于动态选界而非等间隔降采样。在LibriSpeech test-clean上,50 Hz、800 bps总码率下可变帧率相对同架构固定帧率将宽带PESQ从2.46提升至2.66,词错率从3.31%降至2.91%,说话人相似度从0.71升至0.78。增益集中于25 Hz至50 Hz的400至800 bps区间,在80 Hz、1280 bps下词错率由2.54%恶化至2.98%,在ARCH全局语义线性探测中固定帧率多数组合略优。模型约127M参数,仅在LibriSpeech-960上从零训练,未报告训练时长与流式延迟。
🔗 开源资源
- 代码相关资源:https://github.com/hoyso48/DTM-Codec — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/hubertsiuzdak/snac — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 不等整句到齐就开口:FlashTTS 如何把自回归与声学解码同时加速
英文题目:FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation
标签:#知识蒸馏 #高效推理 #流式处理 #文本到语音
评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.4/1.5
排名:前25% | 文档类型:系统技术报告 | 主任务:#文本到语音 | 主方法:#知识蒸馏
👥 作者与机构
- Hanke Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaming Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Dake Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Ruonan You:机构信息未能从会议 PDF 纯文本可靠映射
- Wenhao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jingbin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Guobin Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Huakang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Kejie Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Weiguo Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Xianrong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
实时对话要求文本到语音同时支持流式文本输入与流式语音输出,而传统单码本自回归加多步流匹配管线需整句缓冲且解码缓慢,难以满足低首包延迟与连续交互要求。FlashTTS以两阶段系统应对该问题,第一阶段用滞后多轨道结构并行消费语音、文本与语言轨道以实现单令牌启动,输出进入解码器主干生成首批语音令牌,从源头消除整句等待。第二阶段冻结主干并训练并行多令牌预测分支,以一次前向产出多个未来语音令牌并用主干分布校验保证稳定性。声学侧采用显式数据预测的均值流加块级注意力,将令牌到梅尔谱压缩至2次函数求值后合成波形,从而同时加速自回归与声学瓶颈并支持流式音频生成。在Minimax子集评测下,MTP-3(2-NFE)的WER为18.8,低于CosyVoice2(10-NFE)的WER 26.2。适用边界限于短首包零样本克隆场景,长时韵律稳定性、低资源语言与部署成本尚未验证。原文未披露训练时长与推理工程优化后性能。
🔗 开源资源
- 代码相关资源:https://github.com/ASLP-lab/FlashTTS — 链接可访问(HTTP 200)
- 演示资源:https://aslp-lab.github.io/flashtts_demo → https://aslp-lab.github.io/flashtts_demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 自然多语速普通话基准:GRATS 为何要用真实目标录音检验变速
英文题目:GRATS : A Natural Multi-Speed Mandarin Dataset for Speech Time-Scale Modification Benchmarking
标签:#基准测试 #数据集 #数据集构建 #语音 #语音编辑
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音编辑 | 主方法:#数据集构建
👥 作者与机构
- Ghaida Fathin Aghniya:机构信息未能从会议 PDF 纯文本可靠映射
- Dyah A. M. G. Wisnu:机构信息未能从会议 PDF 纯文本可靠映射
- Stefano Rini:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音时间尺度变换要求改变语速同时保持音高与可懂度,普通话因词汇声调依赖基频与音节时序的精细协同而对拉伸失真高度敏感。人工变速参考无法复现真实变速下的协同变化,因而基于人工参考的波形相似度评测会混淆算法失真与自然变速差异。作者先以卡拉OK式逐字高亮视觉提示采集同一说话人与同一文本在0.5x、0.75x、1.0x、1.25x、1.5x五档目标速率下的独立自然录音,共25人60句7500条8.10小时。再以同说话人同语句自然目标录音为参考构建平行评测对,将1.0x输入生成的变速语音与对应自然目标直接对比,以暴露人工变换与真实变速的差距。接着用固定多语言Whisper medium计算字符错误率(Character Error Rate,CER),用宽带感知语音质量评估(Perceptual Evaluation of Speech Quality,PESQ)、短时客观可懂度(Short-Time Objective Intelligibility,STOI)、深度噪声抑制平均意见分(Deep Noise Suppression Mean Opinion Score,DNSMOS)评价质量,并经蒙特利尔强制对齐器(Montreal Forced Aligner,MFA)与WORLD声码器提取音节时长平均绝对误差(Mean Absolute Error,MAE)与对齐感知F0皮尔逊相关,最后揭示经典与神经方法在自然参考下的多维权衡。在GRATS自然参考与推理式评测下,相位声码器(Phase Vocoder)在0.75x的CER为0.046,低于同期神经基线并在全速率保持可懂度优势,而CLPCNet在DNSMOS与STOI上占优,极端0.5x与1.5x下时长误差呈U形增大且F0相关普遍下降。该结论仅适用于台湾普通话朗读语体与客观指标范围,未经自然度与声调忠实度主观听测验证,也未覆盖自发语音与其他方言。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://grats.tw/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 不只听懂说什么:ParA-LLM 用两阶段课程补上副语言与声学理解
英文题目:ParA-LLM: A Unified Approach to Paralinguistic and Acoustic Speech Understanding
标签:#基准测试 #数据集 #课程学习 #音频问答 #语音属性识别
评分:8.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#课程学习
👥 作者与机构
- Nishit Anand:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaqi Su:机构信息未能从会议 PDF 纯文本可靠映射
- Ke Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yunyun Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Dinesh Manocha:机构信息未能从会议 PDF 纯文本可靠映射
- Ramani Duraiswami:机构信息未能从会议 PDF 纯文本可靠映射
- Rithesh Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Zeyu Jin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
现有音频大模型擅长转写说了什么,却难以回答说话人特质、言语动态与环境声学条件等怎么说的问题。作者先定义声学、说话人内禀、言语动态三大组共22个副语言特征,再用声学仿真引擎将洁净语音与实测房间脉冲响应及背景噪声混合并记录可验证参数,经跨语料映射统一说话人与言语标签,生成超过120万音频问答对,最后按单属性原子问答到多属性联合问答的两阶段课程微调音频大模型,并用6000题多选题基准检验联合推理。仿真负责声学覆盖,标注负责口径统一,课程负责从基础感知过渡到组合推理。与孤立属性分类相比,该机制支持跨声学与说话人维度的自由问答。在ParA-Bench基准下,ParA-LLM的准确率为43.53%,高于Voxtral-24B的准确率38.80%。该结论限于仿真主导声学与英文为主语料下的多选题理解,人类在100题小样本上达78%,模型差距仍大,开放生成与真实远场部署外推能力尚未验证。原文未披露训练与推理成本。
🔗 开源资源
- 模型相关资源:https://nishitanand.github.io/paralinguistic-understanding-llm → https://nishitanand.github.io/paralinguistic-understanding-llm/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 双流看残留、两阶段找不变:DAST 用转换数据练出跨系统攻击
英文题目:DAST: A Dual-Stream Voice Anonymization Attacker with Staged Training
标签:#课程学习 #隐私保护 #语音 #说话人匿名化 #说话人验证
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#课程学习
👥 作者与机构
- Ridwan Arefeen:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoxiao Miao:机构信息未能从会议 PDF 纯文本可靠映射
- Rong Tong:机构信息未能从会议 PDF 纯文本可靠映射
- Timothy Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Aik Beng Ng:机构信息未能从会议 PDF 纯文本可靠映射
- Simon See:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向语音匿名攻击中的说话人验证任务,输入为经匿名系统处理的注册与测试语音对,输出为是否同源的判定分数,难点是匿名变换抹除身份线索并混入各系统不同的声码器伪影。方法采用共享双流骨干的三阶段课程,双流分别用ECAPA-TDNN编码梅尔滤波器组频谱特征与WavLM自监督特征并在中间层融合,以互补视角分离说话人特征与转换伪影。Stage I在VoxCeleb2原始语音上冻结WavLM训练下游融合与分类器,建立说话人判别基础,其输出的判别表示进入下一阶段。Stage II在8种语音转换系统生成的SSTC大规模转换语音上继续训练双流编码器,习得跨失真不变表示,直接提供可跨系统泛化的预训练检查点。Stage III在目标VPAC匿名系统的LibriSpeech匿名语音上小比例微调,校准系统特异判决边界,实现快速适配。在VPAC基准下,DAST全量微调在T10-2系统的等错误率为7.04%,低于VPAC-Top1的等错误率22.46%。该结论适用边界受限于VPAC半知情协议和LibriSpeech英文朗读语料,对情感保留匿名、跨语言与野外信道的泛化尚未验证。训练成本为单张NVIDIA H200 GPU上完成三阶段训练,其中Stage I训练1轮、Stage II训练2轮,推理延迟与吞吐尚未验证。
🔗 开源资源
- 代码相关资源:https://github.com/monkeyDarefeen/DAST — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
31. 先数人再转写:用约束探索把重叠语音的幻觉压回去
标签:#强化学习 #语音识别 #说话人分离标注 #说话人计数
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#强化学习
👥 作者与机构
- Yunrui Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Dingdong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Lingwei Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Xixin Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Helen Meng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理单通道重叠语音的联合转写与标注,输入为连续混合波形提取的声学特征序列,输出为包含说话人数推断、可扩展标记语言结构标签、起止时间戳与逐说话人文本的序列化序列,难点在于说话人数未知、声学掩蔽严重且输出必须同时满足语义、时序与结构约束。方法链分为两阶段,先以思维链增强的监督微调建立先计数后转写的格式与先验,再以组相对策略优化在8路采样 rollout上做约束探索。监督阶段通过随机打乱说话人排列抑制顺序偏置,强化阶段用多维约束感知奖励对完整假设做置换不变优化并以KL散度回锚到参考策略。与直接拼接专用前端或纯监督微调不同,该机制把不可微的计数准确率、置换不变词错率、时间误差与突发幻觉长度直接变成可优化的序列级奖励。在Dynamic-Mix评测下,SFT+CoT+GRPO完整模型的cpWER为9.24%,低于SFT+CoT基线的cpWER 20.17%。结论仅适用于短时高重叠合成混合与2至3人的封闭范围,对真实会议、噪声混响与更多说话人的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/caiyunrui/MT-GRPO — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
32. 流行之外唱不准:MMGenre 用可复现流水线诊断歌声合成的流派塌缩
英文题目:MMGenre: Benchmarking Singing Voice Synthesis across Multiple Musical Genres
标签:#基准测试 #基准设计 #音乐 #歌唱生成
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#歌唱生成 | 主方法:#基准设计
👥 作者与机构
- Wenhao Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxun Tang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiatong Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Qin Jin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
歌唱语音合成以音素、音高与时长的符号乐谱为输入,输出对应歌词的歌声音频,难点在于不同流派在音色、咬字与表达惯例上存在系统性差异而公开数据高度偏向流行音乐。作者构建可扩展流水线,先由Suno V4.5按层级流派提示生成多流派混音,再经Mel-RoFormer分离人声并由STARS转录为音素对齐乐谱,同时保留原始混音作为风格真值。生成对再经时长过滤与音乐表征一致性校验形成评测对,前端生成输出直接进入后端转录与过滤环节。与直接复用流行语料相比,该机制把流派控制前移到可提示的音乐生成端并保留混音真值,从而实现受控的多流派诊断。在MMGenre基准下,TechSinger的SingMOS分数为3.84,高于RNN的SingMOS分数3.25。该结论目前仅在中文短片段与合成乐谱条件下验证,对真实录音长曲与跨语言的外推尚未证明。上述跨语言长曲泛化能力尚未验证且受限于合成短片段分布。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://fengjin1117.github.io/mmgenre-web/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
33. 把校正后的音素铺回每一帧:TAP-ETS 为何强调帧级时间对齐
英文题目:TAP-ETS: Time Aligned Phoneme Guiding for EMG-to-Speech Synthesis
标签:#注意力机制 #生理信号 #语音 #静默语音接口
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#静默语音接口 | 主方法:#注意力机制
👥 作者与机构
- Dongyub Han:机构信息未能从会议 PDF 纯文本可靠映射
- Injune Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Jaejun Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jiwon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Kyogu Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
肌电到语音合成需仅从表面肌电信号恢复可懂语音,其本质难点在于神经肌肉活动与声学之间映射模糊且缺乏显式语言约束。本文提出时间对齐音素引导框架,首先由肌电编码器预测帧级音素后验并构造查询表示,其次由音素编码器将给定音素序列编码为键值记忆,再通过交叉注意力解码器联合构音动态与语言约束生成梅尔频谱,最后在推理时将外部纠错后的合并序列重分布到原始帧网格。与仅把音素作辅助分类损失的已有方法不同,该机制把语言信息作为显式可控生成条件并解耦估计与合成。在Gaddy静默肌电基准98例测试集上,系统以Whisper-medium转写测得词错率由基线的25.12%降至19.77%,同时音素与字符错率同步改善。该结论仅在英语小词汇朗读场景与依赖配对浊音数据的动态时间规整监督下验证,未证明对自发语、跨被试或无配对数据的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/ongdyub/TAP-ETS — 链接可访问(HTTP 200)
- 演示资源:https://github.com/ongdyub/TAP-ETS — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
34. 在线试错补上离线偏好的缺口:Resonate 用大音频语言模型做奖励训流匹配
英文题目:Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
标签:#流匹配 #强化学习 #音频大模型 #音频生成
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频生成 | 主方法:#强化学习
👥 作者与机构
- Xiquan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Junxi Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Wenxi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Haina Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyang Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到音频生成(Text-to-Audio Generation)的输入是自然语言描述,输出是高保真声景波形,难点在于多事件组合与时序逻辑难以对齐且人耳对瑕疵高度敏感。该工作先以条件流匹配(Conditional Flow Matching)预训练潜空间生成器,再将去噪过程重构为马尔可夫决策过程(Markov Decision Process)并用在线组相对策略优化(Group Relative Policy Optimization)采样多轨迹更新策略,最后以大型音频语言模型(Large Audio Language Model)的是非问答概率作为细粒度奖励回传。与离线直接偏好优化(Direct Preference Optimization)及对比语言音频预训练(Contrastive Language-Audio Pretraining)奖励的关键差异在于在线探索与语义推理奖励的结合。预训练使用大规模音频文本语料与流变换器主干,在线阶段以组规模采样多轨迹估计优势并回传归一化肯定概率奖励。在TTA-Bench精度子集基准评测下,Resonate-GRPO的AQAScore指标为0.737,高于Resonate-PT的AQAScore指标0.651。该结论目前仅在该基准与短音频场景验证,对音乐、长时序与多语言提示的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/xiquan-li/Resonate — 链接可访问(HTTP 200)
- 演示资源:https://resonatedemo.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
35. 混合域批次下单高斯不够用:用 GMM 刻画偶然风格不确定性做反欺骗域泛化
英文题目:Aleatoric Style Uncertainty Augmentation with GMM for Domain Generalization in Anti-spoofing
标签:#数据增强 #鲁棒性 #说话人验证 #语音伪造检测
评分:8.0/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#数据增强
👥 作者与机构
- Jin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Man-Wai Mak:机构信息未能从会议 PDF 纯文本可靠映射
- Johan Rohdin:机构信息未能从会议 PDF 纯文本可靠映射
- Oldřich Plchot:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Bo Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Yunfeng Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音反欺骗需从原始波形判断真伪,难点在于训练与测试的伪造算法、编解码和信道域偏移大,攻击类型多样未知,域外泛化差。该方法先计算帧级特征的通道均值与标准差作为风格表示,再用在线高斯混合模型(Gaussian Mixture Model,GMM)刻画标准差向量的多峰分布并估计簇内偶然不确定性(Aleatoric Uncertainty),最后将批量级方差与簇内方差按权重融合后重参数采样生成新风格特征以增强训练。在ASVspoof 5 Track 1开放条件评估集上,单模型等错误率(Equal Error Rate,EER)为3.96%,最小检测代价(minDCF)为0.108,优于同基座的域偏移不确定性建模(Domain Shifts with Uncertainty,DSU)与相关风格不确定性(Correlated Style Uncertainty,CSU)基线。与假设风格服从单高斯的DSU相比,混合建模能保留不同伪造族的分离结构而非粗暴抹平,从而提升域泛化鲁棒性。该结论目前仅在ASVspoof 5反欺骗与欺骗感知说话人验证(Spoofing-Aware Speaker Verification,SASV)上验证,未证明跨语种与全新攻击族的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/happyjin/ASU — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
36. 只看答对不够:用实例级细则逼音频推理说出每一步依据
标签:#基准测试 #评测协议 #音频大模型 #模型评估 #音频问答
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#评测协议
👥 作者与机构
- Ziyang Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Ruiyang Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Yinghao Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Chao-Han Huck Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Bohan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jaeyeon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jin Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Jinyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Carlos Busso:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该挑战以音频信号A与语言查询Q为输入,要求系统同时输出思维链推理过程与最终答案,难点在于答案正确常掩盖虚假推理且传统整体打分不稳定。方法链由三步构成:先以人工标注真值推理链为每题生成5条原子可验证标准,再以GPT-4o逐条二值判定预测链是否满足并附理由,最后仅当答案正确时取平均作为推理质量分,答错直接计0。相比通用整体5分制,该实例级量规将评估分解为可核查命题从而降低评委方差。该协议还以三评委一致性与五次重复评测检验稳定性,并以50对人工偏好对齐验证有效性。在MMAR基准决赛1000题评测下,智能体榜首系统的Rubrics推理质量分数为69.83%,高于单模型榜首系统的Rubrics推理质量分数65.29%。该结论适用边界受限于MMAR分布与指定评委模型组合,跨评委、跨语言与噪声场景的外推性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/ddlBoJack/MMAR — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
37. 把余弦相似装进贝叶斯聚类:SphereVBx 如何简化 EEND-VC 的第二阶段
英文题目:SphereVBx: Spherical Variational Bayes Clustering for Simplified EEND-VC Diarization
标签:#变分自编码器 #端到端 #语音 #说话人分离标注
评分:8.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#变分自编码器
👥 作者与机构
- Petr Pálka:机构信息未能从会议 PDF 纯文本可靠映射
- Jiangyu Han:机构信息未能从会议 PDF 纯文本可靠映射
- Prachi Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Marc Delcroix:机构信息未能从会议 PDF 纯文本可靠映射
- Naohiro Tawara:机构信息未能从会议 PDF 纯文本可靠映射
- Lukáš Burget:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人分离标注的输入是长时连续录音,输出是谁在何时说话的时间边界,实际难点在于短窗局部估计存在重叠与不可靠嵌入,且跨窗全局关联需满足同一窗内不同说话人互斥与说话人数未知。所提球面变分贝叶斯聚类先以环面概率球面判别分析将长度归一化嵌入建模为方向与集中度参数化的球面分布,得到与余弦几何一致的似然输出。接着用变分推断交替更新说话人方向后验与帧级归属责任,前一步的似然直接进入后一步的责任计算并回传修正方向估计。最后以时长可靠性权重降低短嵌入对后验的贡献,并以多流扩展在概率模型内强制窗内互斥约束,从而省去质心估计与重分配启发式。相比标准变分贝叶斯聚类,关键差异是用冯米塞斯费舍尔分布族替代高斯假设,使余弦相似性成为概率模型的特例。在8个端到端神经分离标注加向量聚类基准平均上,参数无关多流版本取得12.48%的分离标注错误率,优于DiariZen基线的12.65%。该结论限于固定局部端到端神经分离标注模型与无宽容 collar 的评测协议,对强重叠与说话人数剧变场景尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/BUTSpeechFIT/DiariZen — 链接可访问(HTTP 200)
- 模型相关资源:https://huggingface.co/BUT-FIT/diarizen-wavlm-large-s80-md-v2 — 暂时无法访问
- 复现相关资源:https://github.com/bsxfan/Toroidal-PSDA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
38. 重叠多反而伤分离:合成对话数据为何对识别与日志任务给出相反配方
英文题目:Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization
标签:#开源工具 #数据增强 #语音识别 #说话人分离标注
评分:8.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#数据增强
👥 作者与机构
- Alexander Polok:机构信息未能从会议 PDF 纯文本可靠映射
- Ivan Medennikov:机构信息未能从会议 PDF 纯文本可靠映射
- Honza Černocký:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
- Lukáš Burget:机构信息未能从会议 PDF 纯文本可靠映射
- Samuele Cornell:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多说话人会话处理需从长时混合录音中同时恢复谁在何时说话与说了什么,真实会议标注稀缺且隐私受限使合成对话成为必需训练源。本文以合成会话仿真为研究对象,先由基于Lhotse的FastMSS高效混合引擎生成可控长会话,其输出进入四状态轮次切换模型以控制保持、切换、打断与附和节奏。随后多域单说话人种子库与房间脉冲响应加噪声增强为混合语音注入声学多样性,其带词级时间戳结果分别驱动基于Whisper的目标说话人识别模型DiCoW与端到端分离标注模型Sortformer。与单任务仿真研究的关键机制差异在于揭示重叠增强与混响对两任务的作用方向相反,因而无法用同一配方兼顾两者,实际意义是必须为识别与分离标注采用任务专属仿真配置。在多数据集会议基准评测下,真实加合成联合训练的DER为16.3%,低于仅真实训练的DER 17.4%。结论仅在 1至4人英语会议与电话及会议轮次统计范围内验证,对高重叠鸡尾酒会与多语言外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/popcornell/FastMSS — 链接可访问(HTTP 200)
- 模型相关资源:https://huggingface.co/BUT-FIT/DiCoW_v3_3 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
39. 试次内高分靠捷径:两阶段训练切断脑电试次标识再做目标语音提取
标签:#对比学习 #脑信号 #语音 #目标说话人提取
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#对比学习
👥 作者与机构
- Wonchul Shin:机构信息未能从会议 PDF 纯文本可靠映射
- Inyong Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Kyogu Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
脑电引导的目标说话人提取(EEG-guided TSE)需从双人混合波形与同步脑电图(EEG)中提取被试注意声源,难点是同一试次(Trial,指目标固定的连续记录块)内注意目标固定,且EEG存在秒到分钟级自相关与慢漂移,端到端模型易用试次身份替代注意解码。本文提出TRUST-TSE两阶段框架:第一阶段用跨模态对比预训练学习EEG与注意语音的细粒度对齐,第二阶段冻结脑电编码器并训练条件化分离器,分离器训练用EEG与双声源相似度差构造置信权重。第一阶段以注意说话人负采样在同试次内构造正负语音候选,学习脑电与语音序列嵌入的段级相似度对齐,输出抑制试次身份的注意力相关脑电表示并冻结传递至下一阶段。第二阶段将冻结脑电嵌入插值对齐后与混合特征拼接输入双路径循环分离器,以相似度差值经映射得到的置信权重加权训练并按符号切换参考源,使提取器保持对条件嵌入敏感。与端到端同时优化混合分离与注意推断不同,该解耦迫使模型依赖脑电语音对应而非试次自相关伪影,因而更具跨试次鲁棒性与实际意义。在KUL跨试次评测设置下,TRUST-TSE的选择准确率为62.27%,高于Pos-only tanh CW的选择准确率42.73%。该结论限于已知被试(Known-subject,同一被试池训练测试)与短窗切分,未验证大规模多会话部署与瞬时注意切换归因,原文未披露训练推理硬件与时延成本。
🔗 开源资源
- 代码相关资源:https://github.com/argaaw/TRUST-TSE — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
40. 带着参考学、丢掉参考用:RAT 把参考通道训练成不变性
英文题目:RAT: Reference-Augmented Training for ASV Anti-Spoofing
标签:#开源工具 #注意力机制 #数据增强 #语音 #语音伪造检测
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#数据增强
👥 作者与机构
- Vojtěch Staněk:机构信息未能从会议 PDF 纯文本可靠映射
- Anton Firc:机构信息未能从会议 PDF 纯文本可靠映射
- Jakub Reš:机构信息未能从会议 PDF 纯文本可靠映射
- Kamil Malinka:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动说话人验证反欺骗(ASV Anti-Spoofing)需从单条测试语音输出真伪分数,难点在于文本转语音与语音转换攻击持续演进,且伴随多声学条件、编解码退化与Malafide、Malacopula对抗攻击。该工作用共享的300M参数XLS-R分别提取测试波形与同说话人真参考波形的24层特征,经参考信息块(Reference-Informed Block,RIB)融合,再对层维与时间维做均值池化并送入3层MLP输出真伪对数几率,取真类对数几率`zbona`为检测分数。RIB内测试自有MLP支路与以测试为查询、参考为键值的4头跨注意力支路并行,再与测试原始嵌入残差相加,使模型早期可借参考校正、后期自然退化为单语句检测器。与显式比对参考的孪生网络或SASV分数融合不同,该方法把参考仅作训练期条件而不要求推理期依赖。在ASVspoof 5评测集Track 1开放条件下,零向量参考推理取得2.57% EER和0.074 minDCF,优于同配方单语句基线的4.87%与0.141,也优于12模型融合冠军T43的2.59%与0.075。结论目前仅在ASVspoof 5与XLS-R前端下成立,XLS-R本身按官方规则不允许正式参赛,跨数据集与强对抗迁移尚未验证,原文未披露训练与推理成本。
🔗 开源资源
- 代码相关资源:https://github.com/Security-FIT/RAT — 链接可访问(HTTP 200)
- 模型相关资源:https://github.com/Security-FIT/RAT — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
41. 只给文字也能适配语音识别:用多视角去噪留住语音与文本的对齐
标签:#领域适应 #LoRA #大语言模型 #语音识别
评分:7.9/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#领域适应
👥 作者与机构
- Sergio Burdisso:机构信息未能从会议 PDF 纯文本可靠映射
- Esaú Villatoro-Tello:机构信息未能从会议 PDF 纯文本可靠映射
- Thibault Bañeras-Roux:机构信息未能从会议 PDF 纯文本可靠映射
- Shashi Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Srikanth Madikeri:机构信息未能从会议 PDF 纯文本可靠映射
- Pradeep Rangappa:机构信息未能从会议 PDF 纯文本可靠映射
- Manjunath K E:机构信息未能从会议 PDF 纯文本可靠映射
- Petr Motlicek:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Stolcke:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
基于大语言模型的语音识别以语音编码器提取声学特征并经投影器映射为类文本嵌入再由大语言模型解码转写,纯文本微调易破坏已学语音文本对齐而引发灾难性遗忘。该方法将目标域自适应重构为文本去噪任务,先在每批中保留源域音频文本对以锚定对齐,再为源域转写构造投影器诱导噪声与合成字符噪声以模拟投影输出。随后其输出与加噪目标域文本共同混批输入,驱动大语言模型在去噪中学习目标词汇句法并保持跨模态桥接。在DefinedAI银行域测试集上词错率(Word Error Rate,WER)为6.53%,相对未自适应基线8.02%改善18.6%。相比直接文本微调或软提示替换语音的做法,多视角批量混合在同一批次内同时保留语音锚点与文本去噪信号,从而兼顾对齐保持与领域适应。该结论的适用边界限于对话式转写文本且目标文本与测试分布接近的场景,声学严重偏移时仍需少量配对音频补充,否则对齐保持可能失效。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/idiap/llm-asr-text-only-adaptation — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
42. 跨语种情绪为何在中间层最通用:49 层逐层探测揭示的 CRIS 层与类型学轮廓
英文题目:TIMBRE: Layer-Wise Cross-Lingual Speech Emotion Recognition Across 49 Layers and 26 Corpora
标签:#评测协议 #跨语言 #语音 #语音情感识别
评分:7.9/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#评测协议
👥 作者与机构
- Anatoly Marchenko:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言语音情感识别需将愤怒、高兴、悲伤与中性4类标签从源语库迁移到语言与录制条件迥异的目标语库,难点在于声学线索与语言韵律深度纠缠。该文先将26个语库统一为4类标签并提取27维声学特征与wav2vec2-xls-r-1b全部49个抽取点的平均池化表示,再用固定逻辑回归在有序语库对上训练并跨语库评测形成层深转移张量,最后按语族与韵律类型分组对比层曲线与消融贡献。与仅用末层或全层平均的已有跨语言评测不同,该文把每一层独立作为冻结特征进行跨语库探测,从而分离出通用情感层与语言专用层。在26×26跨语库矩阵评测下,wav2vec2均值池化表示的F1指标为0.355,高于27维声学特征的F1指标0.252。罗曼斯语族呈现U形相对优势而声调语言优势随深度递增,表明韵律类型塑造了跨语言转移的层级轮廓。结论仅适用于冻结线性探测下的表演类情感迁移,对自然对话与微调场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://doi.org/10.5281/zenodo.20584918 → https://zenodo.org/records/20662633 — 链接可访问(HTTP 200)
- 数据相关资源:https://doi.org/10.5281/zenodo.20584918 → https://zenodo.org/records/20662633 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
43. 单声道加单镜头怎么做多人轮替预测:MuVAP 用角色相对投影锚定说话人
英文题目:MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the wild
标签:#数据集 #多模态学习 #严格因果 #音视频 #轮次切换
评分:7.9/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#轮次切换 | 主方法:#多模态学习
👥 作者与机构
- Haotian Qi:机构信息未能从会议 PDF 纯文本可靠映射
- Gabriel Skantze:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多方轮次切换需从单通道音频与单视角视频连续预测何时发生转换以及由哪位可见参与者接管,难点在于说话人数量可变且重叠与视觉回馈使声学归属模糊。本文方法链分三步推进:语音活动投影主干从波形提取韵律与语言线索并学习未来联合活动,主动说话人检测因果分支将音频与人脸轨迹对齐以提供分离锚点,多方融合模块以全局投影为指挥引导说话人级投影完成何时与何人解耦预测。相对已有双人联合建模,角色相对投影将任意 N 人映射为当前持有者与下一持有者固定对偶,从而避免标签空间指数膨胀。在自采音视频会话语料验证集上,多模态模型在 2 人静默轮次保持与切换预测达到宏平均 F1 值 0.696,显著高于纯音频基线。该结论仅在 2 至 3 人英语无剪辑场景验证,对更大群体与跨语言的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Haotian-Qi/MuVAP — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
44. 内容是剩下的东西:用平行话语逼出不变的语音内容标记
英文题目:Content is What Remains: Invariant Speech Tokenization from Parallel Utterances
标签:#数据增强 #对比学习 #向量量化 #语音 #语音编码
评分:7.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#对比学习
👥 作者与机构
- Laurin Wagner:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为不同说话人、口音、情感、语速与信道条件下的语音波形,输出为保留帧级时间对齐的内容离散序列,难点在于胡伯特模型等自监督特征仍泄漏说话人与韵律干扰并抬高条件熵与破坏可压缩性。方法为两阶段并行不变标识化:第一阶段微调编码器,以序列级软动态时间规整拉齐同转录平行对的帧轨迹,以词级对比损失聚集同词并排斥低重叠词,以音素解码器守住内容。第二阶段在编码器上接线性离散头,由指数滑动平均教师对锚定发音逐帧取最大值并去重生成组共享目标,学生以联结时序分类将组内全部发音对齐到该目标并以均匀与正交损失防止坍缩。与蒸馏或双编码器编解码器不同,该设计把平行组共有因素直接作为监督并端到端协同优化连续表示与离散划分,保留帧级接地而非转写为文本。在LibriLight上相同85M参数解码器语言模型取得测试困惑度1.95,相对HuBERT第9层2.78与WavLM第12层2.67下降约27%到30%,约1400步即达到WavLM最终水平,约减少23倍迭代。结论限于英语及合成平行补充场景,多语言、编解码器端到端重建与强情感保留尚未验证,原文未披露优化器、学习率、批量、步数与硬件成本。
🔗 开源资源
- 代码相关资源:https://github.com/nyrahealth/PINT — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
45. 不听原声也能量房间:用混响语音重建反推长房间脉冲响应
英文题目:Blind Room Impulse Response Identification via Reverberant Speech Spectrum Reconstruction
标签:#多任务学习 #单通道 #语音 #房间脉冲响应估计
评分:7.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#房间脉冲响应估计 | 主方法:#多任务学习
👥 作者与机构
- Pengyu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaofei Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道盲估计需从含噪混响语音中同时恢复未知干净语音与最长达0.96 s的房间脉冲响应,具有病态解耦与长滤波器建模困难。所提Rec-RIR先用去噪模块从观测嵌入中剥离加性噪声得到混响语音嵌入,再用去混响模块进一步剥离混响得到干净语音嵌入。随后由窄带滤波器组对加权融合后的双嵌入做隐式逆滤波并经帧加权池化输出卷积传递函数滤波器,最后经伪侵入式扫频测量将该滤波器转换为时域房间脉冲响应。与迭代极大似然类方法不同,该框架以混响谱重建为直接监督实现端到端非迭代估计,并显式利用干净与混响双分支约束对齐。在SimACE测试集下,Rec-RIR的DRR指标MAE为0.684 dB,低于VINP-oSpatialNet的DRR指标MAE 2.398 dB。该结论适用边界限于单说话人单麦克风英语语音与0.2 s至1.5 s混响时间范围,直达声前2 ms内不规则早期成分仍难以重建,跨语种与强噪声外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Audio-WestlakeU/Rec-RIR — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
46. 商用 API 伪造与研究基准脱节时,用多源数据加局部注意力补上泛化缺口
英文题目:MultiAPI Spoof: A Multi-API Dataset and Local-Attention Network for Speech Anti-spoofing Detection
标签:#基准测试 #数据集 #注意力机制 #语音伪造检测
评分:7.9/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音伪造检测 | 主方法:#注意力机制
👥 作者与机构
- Xueping Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhenshan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yechen Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Linxi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Liwei Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音伪造检测与来源归因的输入输出映射,即从原始波形判定真假并进一步溯源生成接口,难点在于商用私有语音合成接口与开源模型分布差异大且快速演化。方法链由三环构成:首先构建多接口伪造语料MultiAPI Spoof并按接口划分见过与未见过评估域,为跨域泛化提供训练与测试基础;接着用自监督语音编码器XLSR-300M抽取高维声学表示并经注意力池化聚合层级特征;最后将表示送入嵌套多尺度后端,经滑动窗口局部注意力增强块间上下文后再由全连接层输出真伪分数。与仅依赖相邻块层次传递的已有后端Nes2Net-X相比,该设计允许每个块融合邻域块信息,从而强化细粒度伪造痕迹建模。在合并六库训练并加入新语料的设置下,新后端Nes2Net-LA在MultiAPI Spoof全集上达到等错误率0.56%,在野外采集集ITW上达到1.42%,均优于同条件基线。该结论限于英语、4秒切分且无数据增强的受控评测,未验证多语言、长时与压缩信道外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/XuepingZhang/MultiAPI-Spoof — 链接可访问(HTTP 200)
- 数据相关资源:https://xuepingzhang.github.io/MultiAPI-Spoof-Dataset/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
47. 早期要保树形结构、晚期要做平均:双几何门控如何分时聚合参考 RIR
标签:#注意力机制 #少样本 #空间音频信号 #房间脉冲响应估计
评分:7.8/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#房间脉冲响应估计 | 主方法:#注意力机制
👥 作者与机构
- Swapnil Bhosale:机构信息未能从会议 PDF 纯文本可靠映射
- Gordon Wichern:机构信息未能从会议 PDF 纯文本可靠映射
- Yoshiki Masuyama:机构信息未能从会议 PDF 纯文本可靠映射
- Moitreya Chatterjee:机构信息未能从会议 PDF 纯文本可靠映射
- Christoph Boeddeker:机构信息未能从会议 PDF 纯文本可靠映射
- Julius Richter:机构信息未能从会议 PDF 纯文本可靠映射
- Xiatian Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Le Roux:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
少样本房间脉冲响应预测需以同一房间内K个稀疏参考RIR合成未见目标位置的对数幅度谱,难点在于早期稀疏镜面反射呈树状层次结构而后期稠密混响尾呈均匀扩散场,单一零曲率空间难以同时承载两种统计。Janus-RIR先将飞行时间对齐后的参考谱与坐标编码送入ResNet-18得到参考特征,并由目标坐标导出目标查询嵌入与时间基。参考与查询特征随后并行送入庞加莱球双曲分支做层次保持聚合与欧氏分支做平滑加权平均,分别负责早期离散路径选择与后期能量云平均。上一步双路输出再经上下文感知签名门控融合时间基、目标查询与参考池化向量逐帧预测混合系数α(t)做乘积融合投影,最后以Griffin-Lim重建波形。相比强制零曲率平均的xRIR,该设计以双曲距离保留早期瞬态层次,以欧氏加权承载后期扩散平均,从而对齐声学物理的混合时间演变。在AcousticRooms数据集K=8条件下,Janus-RIR(NoVision)的T60指标为7.75%,低于xRIR的T60指标10.53%。该结论适用边界限于该仿真库内插值与幅度谱评价,尚未验证真实房间、跨数据集与相位敏感指标。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/merlresearch/janus-rir — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
48. 俄语语音缺的不是时长,而是可复述的韵律标注:Balalaika 如何把 5 千小时做成可用训练集
英文题目:Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech
标签:#数据集 #数据集构建 #模型集成 #韵律 #文本到语音
评分:7.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#数据集构建
👥 作者与机构
- Kirill Borodin:机构信息未能从会议 PDF 纯文本可靠映射
- Nikita Vasiliev:机构信息未能从会议 PDF 纯文本可靠映射
- Vasiliy Kudryavtsev:机构信息未能从会议 PDF 纯文本可靠映射
- Maxim Maslov:机构信息未能从会议 PDF 纯文本可靠映射
- Mikhail Gorodnichev:机构信息未能从会议 PDF 纯文本可靠映射
- Grach Mkrtchian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对俄语网络音频质量参差、移动重音与语调标注缺失导致文本到语音(Text-to-Speech,TTS)与语音增强(Speech Enhancement)自然度不足的问题,本文提出开源管线Balalaika并构建约5078小时多源俄语语料。原始长音频先经语义语音活动检测(Semantic Voice Activity Detection,Semantic VAD)切分为语义完整的话语块,再经时长、波峰因数(Crest Factor)、NISQA-S感知质量与pyannote说话人日志(Speaker Diarization)过滤保留干净单人片段。每个片段并行生成5路自动语音识别(Automatic Speech Recognition,ASR)假设并经识别器输出投票错误率降低(Recognizer Output Voting Error Reduction,ROVER)融合为共识文本,同时保留联结时序分类加语言模型(Connectionist Temporal Classification + Language Model,CTC+LM)一路的词级时间戳。共识文本再依次经RuPunctBig标点恢复、RuAccent词重音与е/ё归一化、轻量Transformer字音转换(Grapheme-to-Phoneme,G2P)转为保留标点与重音的国际音标(International Phonetic Alphabet,IPA)序列,形成可直接训练的多层标注。与已有俄语语料相比,机制差异在于异构解码互补与显式韵律代理,缓解形态丰富语言的误识与语调缺失。在25小时等预算下,单模型VITS在2000句共享异构测试集上取得平均意见分(Mean Opinion Score,MOS)3.618与语调MOS(IntMOS)2.532,自然度客观分领先但IntMOS次于单说话人RUSLAN的3.182;SEMamba去噪在3000样本测试下多数客观指标居首。结论限于俄语、固定预算非收敛训练与部分同源测试,跨语言迁移与更长训练排序尚未验证。原文未披露训练推理部署成本与硬件。
🔗 开源资源
- 代码相关资源:https://github.com/lab260ru/balalaika — 链接可访问(HTTP 200)
- 数据相关资源:https://hf.co/collections/lab260/balalaika-dataset → https://huggingface.co/collections/lab260/balalaika-dataset — 暂时无法访问
- 数据相关资源:https://hf.co/datasets/lab260/Balalaika2000H → https://huggingface.co/datasets/lab260/Balalaika2000H — 暂时无法访问
- 第三方资源:https://github.com/imdatceleste/m-ailabs-dataset → https://github.com/i-celeste-aurora/m-ailabs-dataset — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/snakers4/open — 链接不可用(HTTP 404)
- 第三方资源:https://github.com/deepvk/nisqa-s — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/mtuciru/LabelSpeech → https://github.com/lab260ru/LabelSpeech — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
49. 低帧率下既要听得清又要懂意思:OmniCodec 用理解模型编码器拆开语义与声音
英文题目:OmniCodec: Low Frame Rate Universal Audio Codec with Semantic–Acoustic Disentanglement
标签:#向量量化 #环境声 #音乐 #语音 #音频编码
评分:7.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:模型报告 | 主任务:#音频编码 | 主方法:#向量量化
👥 作者与机构
- Jingbin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Dake Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Qirui Zhan:机构信息未能从会议 PDF 纯文本可靠映射
- Wenhao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Huakang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Guobin Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Hanke Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Chengyou Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Pengyuan Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Chuan Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Qiang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
通用音频建模要求把语音、音乐与环境声统一压缩为低帧率离散词元,输入为24 kHz波形,输出为语义与声学解耦的多层码本序列,难点在于低码率下保真与语义难以兼得。OmniCodec采用语义与声学双分支结构:语义分支用预训练理解模型编码器Qwen3-Omni-AuT-Encoder提取12.5 Hz语义特征并经向量量化(Vector Quantization,VQ)离散为首层码本,声学分支用SEANet编码波形并减去量化语义后做残差向量量化(Residual Vector Quantization,RVQ)以保留细粒度声学信息,随后经线性适配器(Adapter)重组语义与声学表征送入解码器重建波形,同时以自引导损失(Self-guidance Loss)约束量化与连续两条路径在声学变换器后隐层的一致性。与仅用重建损失或无监督掩蔽模型蒸馏的神经音频编解码器相比,关键差异在于直接复用在2000万小时监督音频上训练的理解编码器作为语义先验,并在语音、音乐、环境声三域实现解耦。在LibriSpeech test-clean上,12.5 Hz 16层2200 bps配置相对同码率Mimi-16L将梅尔距离(Mel Distance)从1.12降至0.81,将梅尔倒谱距离(Mel-Cepstral Distance,MCD)从3.93降至3.05,音乐与环境声美学与失真指标亦占优。该结论限于所用评测集与码率条件,在语音首层困惑度上仍弱于基于WavLM的Mimi,外推至其他语言与高噪声场景尚未验证。原文未披露训练时长与推理延迟成本。
🔗 开源资源
- 代码相关资源:https://github.com/ASLP-lab/OmniCodec — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
50. 不对抗语音下练出抗屈折变化的语音翻译:跨模态鲁棒性迁移如何成立
标签:#对抗训练 #对抗鲁棒性 #多语言 #语音翻译
评分:7.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#对抗训练
👥 作者与机构
- Abderrahmane Issam:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuf Can Semerci:机构信息未能从会议 PDF 纯文本可靠映射
- Jan Scholtes:机构信息未能从会议 PDF 纯文本可靠映射
- Gerasimos Spanakis:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端语音翻译(End-to-End Speech Translation,E2E-ST)将源语言语音直接译为目标语言文本,但非母语屈折形态变异易导致性能骤降,而合成对抗语音成本高昂。该工作先在CoVoST 2转写译文对上预训练翻译编解码器,再以词对齐对比学习与语音文本混合表示联合训练拉近同词跨模态表征并让解码器熟悉混合输入。接着冻结语音编码器,将对抗文本词嵌入替换对应语音片段构成对抗混合序列,仅用对抗文本微调翻译模块并以非对称KL约束其输出贴近干净语音与文本分布。与已有跨模态对齐相比,关键差异在于把对齐后的语义空间直接作为鲁棒性载体,避免了文本到语音合成对抗语音。在4个语向的Speech-MORPHEUS对抗测试中,CMRT-FN较HuBERT-Transformer平均提升3.4个BLEU点,同时相对CMRT-TR干净集仅下降约0.6个点。该结论限于CoVoST 2的英德、英加泰罗尼亚语、英阿、法英及屈折变异攻击,未验证噪声口音自发语音与其他架构的外推性。微调耗时1小时46分,约为对齐训练15小时56分的八分之一,远低于合成5万条对抗语音所需的17小时53分。
🔗 开源资源
- 代码相关资源:https://github.com/issam9/CMRT — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
51. 头部语言占九成时长时,如何让哈萨克语们被听见:GigaAM 的簇级配比与领域配比
英文题目:GigaAM Multilingual: Foundation Model for Underrepresented Languages
标签:#自监督学习 #低资源 #多语言 #预训练 #语音识别
评分:7.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:模型报告 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Andrei Kuzmenko:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandr Maximenko:机构信息未能从会议 PDF 纯文本可靠映射
- Aleksandr Kutsakov:机构信息未能从会议 PDF 纯文本可靠映射
- Georgii Gospodinov:机构信息未能从会议 PDF 纯文本可靠映射
- Dmitrii Bolotov:机构信息未能从会议 PDF 纯文本可靠映射
- Oleg Kutuzov:机构信息未能从会议 PDF 纯文本可靠映射
- Pavel Bogomolov:机构信息未能从会议 PDF 纯文本可靠映射
- Fyodor Minkin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理多语言自动语音识别在中亚长尾语言上的严重退化,输入为多域多语言语音,输出为哈萨克语、吉尔吉斯语、乌兹别克语及俄英语字符序列,难点是预训练与微调均被头部语言主导且尾部转写稀缺。该方法先将2M小时音频切分并做语音活动检测与语言识别后按共现图聚为5个簇,再用HuBERT式掩码单元预测在簇级重加权下预训练Conformer编码器,接着以多源混合数据做联结时序分类微调并在语言内做域感知采样。与朴素均匀上采样不同,簇级加权避免了低资源单语权重估计不稳,而域感知采样抑制了大规模合成语音主导课程。预训练编码器还可直接复用于极低覆盖尾部语言的少样本适配而无需重构流程。在内部自发语音集上吉尔吉斯语词错率为9.8%,显著低于Omnilingual 1B的25.0%与Seamless M4T large的78.3%。结论仅在5个目标语言及Common Voice、FLEURS与自采野外集上验证,对其他语系与真实部署噪声的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/salute-developers/GigaAM — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
52. 小参数做音频问答:Samsone 用裁剪与数据配比换端侧可用性
英文题目:Samsone: A Family of Open Small Audio Language Models for On-Device Inference
标签:#模型剪枝 #音频大模型 #高效推理 #端侧运行 #音频问答
评分:7.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:模型报告 | 主任务:#音频问答 | 主方法:#模型剪枝
👥 作者与机构
- Piotr Masztalski:机构信息未能从会议 PDF 纯文本可靠映射
- Michał K. Grzeszczyk:机构信息未能从会议 PDF 纯文本可靠映射
- Olaf Sikorski:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理音频问答(Audio Question Answering)与音频字幕生成任务,输入为单个或多个可变长音频波形加文本指令,输出为自然语言回答或字幕,难点是在百兆参数预算下同时保持细粒度听觉接地与跨声音、音乐、语音的复杂推理。首先Whisper-Tiny编码器提取帧级特征并池化为50个音频令牌,其输出经双线性加GeLU加残差加层归一化的投影器对齐到文本维度。随后对齐音频嵌入与文本嵌入及分隔符SEP拼接为多模态序列,最后送入SmolLM2解码器自回归生成,实现感知对齐到推理的衔接。与Pengi、Mellow相比,关键差异是词汇裁剪加深度裁剪轻量化与百万级推理问答混合训练,而非更换主干。在 MMAU-Test 平均准确率上 Samsone-134M 达 61.33%,超越 Mellow 的 53.34% 并接近 Audio Flamingo 2 的 61.06%;在更难的 MMAU-Pro 上达 37.57%,相对 Mellow 的 27.50% 提升约 10.07 个百分点,但仍低于 Audio Flamingo 3 的 51.70% 和 Qwen2-Audio-Instruct 的 45.41%。该结论限于短音频理解与选择题式评测,对长时空推理、开放字幕质量与通用语言能力保持尚未充分验证。训练在单张 NVIDIA RTX PRO 6000 Blackwell 96GB 上进行 100 轮次、每轮次 200000 样本,手机端在 Samsung Galaxy S25 Ultra 上生成速度随规模为 39 到 125 token/s。
🔗 开源资源
- 代码相关资源:https://github.com/SamsungLabs/samsone — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/soham97/mellow — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
53. 高维保真反而难读准:用语义对齐把隐表示拉回可读结构
英文题目:Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis
标签:#正则化 #变分自编码器 #零样本 #语音 #文本到语音
评分:7.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#变分自编码器
👥 作者与机构
- Zhikang Niu:机构信息未能从会议 PDF 纯文本可靠映射
- Shujie Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Jeongsoo Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Yushen Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Peining Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Pengcheng Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Yunting Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Bowen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Chunhui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成以文本与参考提示语音为输入,生成兼顾可懂度与音色相似的新语音,实际难点在于梅尔谱冗余导致文本语音难对齐,而高维连续隐变量虽保真却陷入重建保真与可生成性难以兼顾的权衡。Semantic-VAE先以卷积编码器将16 kHz波形下采样为40 Hz、64维紧凑隐变量并施加KL约束。接着对冻结自监督语义特征插值对齐后作帧级余弦方向正则,将结构化语义注入隐空间而不压缩维度,其输出的隐变量直接送入流匹配合成模型。最后基于放大块的解码器与多周期加多频带短时傅里叶判别器协同重建波形,省去梅尔谱加声码器级联。相对已有梅尔谱与普通声学VAE,该方向对齐而非数值逼近的语义约束缓解了重建与生成的权衡并加速收敛。在LibriSpeech-PC test-clean上集成至159M F5-TTS后词错率(WER)降至2.10%,说话人相似度(SIM)提升至0.64,自然度主观平均意见分(MOS)达4.17,超越同资源梅尔谱基线2.23%和0.60以及普通声学变分自编码器(vanilla acoustic VAE)基线2.65%和0.60。该结论在英文朗读语音及SeedTTS中英文集上验证,自发对话与噪声场景外推仍存疑。原文未披露训练硬件与推理延迟吞吐成本。
🔗 开源资源
- 代码相关资源:https://zhikangniu.github.io/semantic-vae/ — 链接可访问(HTTP 200)
- 演示资源:https://zhikangniu.github.io/semantic-vae/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
54. 不训练编码器也能切音节:ZeroSyl 用冻结特征范数做语音分词
英文题目:ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling
标签:#向量量化 #语音学与音系 #语音 #口语理解
评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#口语理解 | 主方法:#向量量化
👥 作者与机构
- Nicol Visser:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Malan:机构信息未能从会议 PDF 纯文本可靠映射
- Danel Slabbert:机构信息未能从会议 PDF 纯文本可靠映射
- Herman Kamper:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
纯语音语言建模需直接从原始音频学习词法、句法与叙事能力,但自监督编码器输出的帧级离散单元序列过长,难以建模长程依赖并加重语言模型的上下文负担。ZeroSyl先对冻结的WavLM Large第13层特征计算帧级L2范数曲线并做3点移动平均与显著度峰检测以切分音节边界,再在边界内对第22层特征做均值池化得到音节嵌入,接着用球面K-means离散化为10000类词表并经层次聚类合并静音类至9116类,最后在该序列上训练OPT-125M因果语言模型。与需微调与蒸馏的Sylber和SyllableLM的关键差异在于完全免训练且以范数自身代替帧间余弦距离作为边界信号,因此管线大幅简化并保留了低码率高效表示。在6k小时Libri-Light训练并以sLM21开发集评测的基准下,ZeroSyl的sWUGGY准确率为68.0%,高于Sylber的sWUGGY准确率66.0%。该结论限于英语朗读语音与125M量级模型,在细粒度词法任务与更大模型外推上尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/nicolvisser/ZeroSyl/ — 链接可访问(HTTP 200)
- 模型相关资源:https://github.com/nicolvisser/ZeroSyl/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/kylebgorman/syllabify — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
55. 语音能验身份,笑声咳嗽就不行:用条件蒸馏保住语音,再用专家分流学会非言语声
标签:#对比学习 #知识蒸馏 #混合专家模型 #说话人验证
评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#混合专家模型
👥 作者与机构
- Tzu-Chieh Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Yi-Cheng Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Huang-Cheng Chou:机构信息未能从会议 PDF 纯文本可靠映射
- Kuan-Yu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Hsin-Yen Sung:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为待验证语音段与非言语发声试次,输出为余弦打分决定的同一说话人判定,难点在于非言语发声缺乏音素结构且10类声学异质性大,单一表征通道难以同时兼容模态语音与笑声、爆破音等非音素信号。方法链第一步由冻结Data2Vec前端提取帧级表征并经可训练适配器逐层传递,其输出进入第二步的层间残差混合专家模块,由门控按声学域分流至语音与非言语专用专家以解耦建模。第三步将专家路由后的特征送入ECAPA-TDNN池化为192维说话人嵌入,训练期以事件内一致与事件间分离约束塑造路由分工,以条件蒸馏仅对语音样本对齐冻结教师、以监督对比损失拉近同说话人跨域嵌入。与直接微调把全域压入单一语音流形不同,该设计训练期按模态选择性正则、推理期无需模态标签由门控自主路由,从而缓解灾难性遗忘并统一身份流形。在NonverbalTTS测试集18043条NVV到语音(NvS)试次上,等错误率(Equal Error Rate, EER)从零样本WavLM基线的38.93%降至22.66%,10764条语音到语音(SvS)EER经蒸馏从13.17%恢复至9.24%。该结论仅在该数据集划分、Montreal Forced Aligner切分与剔除短于0.25秒utterance条件下成立,对合成NVV与跨库未见事件的零样本外推尚未验证。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/wiizzz/nonverbal-sv — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
56. 时间对齐与语义对齐为何必须分开考:AV-SyncBench 的解耦评测
英文题目:AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization
标签:#基准测试 #基准设计 #音视频 #音视频理解
评分:7.8/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音视频理解 | 主方法:#基准设计
👥 作者与机构
- Tianhong Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Mingyang Han:机构信息未能从会议 PDF 纯文本可靠映射
- Boyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxuan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaxin Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Dongxiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoxiang Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Kunpeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Song:机构信息未能从会议 PDF 纯文本可靠映射
- Cheng Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Bo Zheng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频同步需同时判断细粒度时间对应与高层语义一致,输入为野外视频与其原配音频,输出为同步质量判定,难点在于两类线索在特征中纠缠且常用预训练集存在数据泄露与离屏声源干扰。AV-SyncBench先以公开在线平台野外视频为输入,职责是筛选与规范化,经Gemini 3 Flash初筛与至少三人交叉复核,输出为3269条3秒至13秒且主声源可见对齐的干净片段。再以上一步的干净片段与原配音频为输入,职责是变量隔离生成挑战,时间轨施加全局偏移、局部抖动与全局变速而保语义,语义轨用OpenVoice V2与DDSP在固定节奏下替换音色乐器,输出为扰动类型正交的原始对与扰动对。最后以双轨挑战对为输入,职责是统一度量并判定质量,将视频音频统一切分为0.64秒无重叠块,以对角余弦或零偏移概率做原始对 versus扰动对的二分类准确率,输出分轨诊断结果。与耦合评测相比,该流水线以变量隔离实现时间与语义解耦,揭示了偏时间模型与偏语义模型的能力分离。在全局偏移评测任务下,Synchformer的准确率为0.510,高于ImageBind的准确率0.493。该结论适用边界受限于13秒以内单主声源为主的短片段,尚未验证长时与多源混叠外推,评测硬件为两个NVIDIA H20 GPU并各分配4个vCPU。
🔗 开源资源
- 代码相关资源:https://fgt7t6g.github.io/ — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/myshell-ai/OpenVoiceV2 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
57. 标签极少时如何估计构音障碍严重度:伪标签加粗粒度对比学习的跨域路线
英文题目:Something from Nothing: Data Augmentation for Robust Severity Level Estimation of Dysarthric Speech
标签:#对比学习 #弱监督学习 #鲁棒性 #语音 #病理语音评估
评分:7.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#弱监督学习
👥 作者与机构
- Jaesung Bae:机构信息未能从会议 PDF 纯文本可靠映射
- Xiuwen Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Minje Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Chang D. Yoo:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Hasegawa-Johnson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍语音质量评估需从波形直接回归临床感知严重度,但语音无障碍计划中仅10.8小时有专家标注,约占全部243.7小时的4.6%,典型与障碍声学域鸿沟加剧了泛化难度。方法为三阶段流水线:阶段1在有标签子集上训练冻结Whisper-large-v3编码器加回归头的教师模型,为232.9小时无标签语音生成伪标签,目标为自然度与可懂度7分量表均值。阶段2将有标签语音、伪标签语音与921.7小时LibriSpeech典型语音混合做标签感知对比预训练,LibriSpeech统一赋标签1以提供典型锚点,阶段3在有标签子集上微调回归头。与已有细粒度排序监督不同,本文用典型与障碍二分组弱监督加高温平滑弥合声学域鸿沟,使低严重度样本桥接典型与障碍表示。在5个未见跨域测试集评测下,完整框架的说话人级斯皮尔曼等级相关系数(Spearman Rank Correlation Coefficient,SRCC)平均为0.761,高于同骨干基线的说话人级斯皮尔曼等级相关系数(Spearman Rank Correlation Coefficient,SRCC)0.732。该结论限于英语训练向英语脑瘫、中意捷斯斯西语的零样本外推,且跨域标签并非统一严重度定义。原文未披露训练推理成本与硬件。
🔗 开源资源
- 代码相关资源:https://github.com/JaesungBae/DA-DSQA — 链接可访问(HTTP 200)
- 模型相关资源:https://github.com/JaesungBae/DA-DSQA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
58. 没有句子级语料时,用单词级短语音加长语音强制对齐启动濒危语言识别
英文题目:Bootstrapping Endangered Language ASR with Short-Form Corpora
标签:#数据集构建 #低资源 #多语言 #语音识别 #强制对齐
评分:7.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据集构建
👥 作者与机构
- Christopher Bartley:机构信息未能从会议 PDF 纯文本可靠映射
- Anton Ragni:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理濒危语言缺乏语句级监督的难题,输入为单词或短语级短语音与未切分的长录音及连续文本,输出为可训练的语句级语料与可解码识别系统,难点在于短语音声学上下文不足且长语音切分易错、域外词未登录率高。方法链分三步:先在英语上压缩训练粒度验证短语音建模能力,再用短语音训练单音子种子模型做维特比强制对齐获得切分,经三音子模型加偏置语言模型重解码与分割形成新语料,最后合并短语音与新语句训练三音子与神经网络混合系统并辅以外部文本扩展语言模型。与依赖海量预训练加微调的多语言大模型不同,该路线完全基于中央处理器可运行的隐马尔可夫模型工具链重组已有社区资源,避免大算力依赖而具有实际可复用意义。在夏威夷语长语音解码评估条件下,过滤后系统的WER为36.75,低于筛选前系统的WER62.11。该结论适用边界受限于五种语言特定采集域与高域外词未登录率条件,音乐广播与超长录音对齐丢失构成明确失败条件,跨语系与自然对话外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/c-bartley/el-asr → https://github.com/chris-sj-bartley/el-asr — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/HumanSignal/label-studio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
59. 通用音素识别的经验配方:自监督表示、多语言数据与自条件 CTC 如何分工
标签:#CTC #语音学与音系 #多语言 #语音 #语音识别
评分:7.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:模型报告 | 主任务:#语音识别 | 主方法:#CTC
👥 作者与机构
- Shikhar Bharadwaj:机构信息未能从会议 PDF 纯文本可靠映射
- Chin-Jou Li:机构信息未能从会议 PDF 纯文本可靠映射
- Kwanghee Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Eunjung Yeo:机构信息未能从会议 PDF 纯文本可靠映射
- William Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
- David R. Mortensen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
通用音素识别要求从原始波形直接输出国际音标序列,难点在于跨语言音位库存差异大,且训练标签多来自反映规范词典发音的字音转换,声学接地不足。该方法首先以大规模多语言自监督编码器XEUS对波形编码得到深层语境表示,为跨语言共享音系结构提供初始化。接着在IPAPack++约17k小时多语言音素数据上以联结时序分类微调,顶层隐表示经线性投影加Softmax得到含空白符的帧级后验并经CTC边缘化对齐路径训练。然后在选定中间层施加辅助CTC损失,其后验经可学习投影加回本层隐表示,供深层编码器迭代修正,从而把软音素反馈引入后续建模。相比从零训练与普通CTC,该链条的关键差异在于用预训练语音表示补偿规范发音偏置,并用自条件反馈增强跨语言泛化。在PRiSM基准多语言任务下,SelfCTC的PFER指标为17.7,低于Vanilla CTC的PFER指标18.8。增益外推受限于短语音、儿童与女性语音声学偏移及部分语种标注噪声,且时序依赖特征改善最小。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/changelinglab/PhoneticXeus — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
60. 弹性时间:用可预测性决定音频潜在帧的去留
英文题目:Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding
标签:#RNN #高效推理 #离线推理 #音频编码
评分:7.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频编码 | 主方法:#RNN
👥 作者与机构
- Dimitrios Bralios:机构信息未能从会议 PDF 纯文本可靠映射
- Paris Smaragdis:机构信息未能从会议 PDF 纯文本可靠映射
- Minje Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
固定帧率神经音频自编码器对平稳与瞬变区域分配相同时间预算,导致隐序列冗长并推高下游生成建模的计算与显存开销。本文输入为44.1 kHz立体声音频,输出为重建音频与可变长隐序列,难点在于无外部语义监督下判断哪些隐帧可跳过且可恢复。弹性时间(Elastic Time,ET)先冻结基座自编码器并加入重瓶颈(Re-Bottleneck)变换得到新隐序列,再用轻量循环预测器建模隐动态并以多步rollout误差度量可预测性,然后按用户指定保留比例求解分段边界只保留锚帧,最后从锚帧自回归rollout恢复全长隐序列并解码。与依赖音素对齐或语音识别特征的动态分块相比,该机制完全由学习到的隐动态驱动且支持推理时任意码率。在MuChin评测任务下,ET-greedy的SI-SDR为1.6 dB,高于CodecSlime的SI-SDR 0.7 dB,感知质量优势主要体现在分布级指标。该结论限于离线整段可用的重建任务,未验证可变帧率隐序列对自回归或扩散生成的实际加速与质量影响。原文未披露推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/dbralios/elastic-time — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
61. 别只听一句话:给目标话语前后各留 10 秒上下文来判别对儿童说话
英文题目:Context-aware child-directed speech detection from long-form recordings
标签:#自监督学习 #长音频处理 #多语言 #语音 #语音属性识别
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#自监督学习
👥 作者与机构
- Théo Charlot:机构信息未能从会议 PDF 纯文本可靠映射
- Tarek Kunze:机构信息未能从会议 PDF 纯文本可靠映射
- Kaveri K. Sheth:机构信息未能从会议 PDF 纯文本可靠映射
- Alejandrina Cristia:机构信息未能从会议 PDF 纯文本可靠映射
- Marvin Lavechin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童佩戴麦克风采集的日间长音频需要区分儿童指向性言语(child-directed speech,CDS)与成人指向性言语(adult-directed speech,ADS),输入为成人语音片段、输出为KCDS、ADS与OTHER三类,难点在于片段平均仅约1.5秒、声学线索弱且跨语言文化变异大。方法链分三步推进:先汇聚11个语料6种语言182名儿童共22小时10分钟语料并按儿童不重叠划分训练验证测试与Tseltal加Winnipeg留存集,再以冻结卷积层加微调Transformer层的方式比较6个自监督模型,最后将目标话语对称扩展至10秒上下文送入编码器但仅保留目标帧做均值池化与线性分类。相对孤立话语分类的机制差异在于上下文帧通过自注意力丰富目标表示而不直接参与决策,从而引入前后说话人等会话线索。在验证集上10秒上下文将平均F1值从53.2%提升至67.0%,绝对增益达13.8%。结论在自动语音类型分类器(Voice Type Classifier 2.0,VTC 2.0)切分下大幅下滑,且Tseltal户外噪声场景明显弱于英语场景,外推至新文化时需谨慎。原文未披露推理部署成本与优化器细节。
🔗 开源资源
- 代码相关资源:https://github.com/LAAC-LSCP/addressee — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
62. 把嵌出在球面换到单纯形:用几何约束关闭模态间隙
英文题目:Closing the Modality Gap via Simplex-Constrained Representations
标签:#Adapter #对比学习 #多模态学习 #音频检索
评分:7.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#Adapter
👥 作者与机构
- Shubham Gupta:机构信息未能从会议 PDF 纯文本可靠映射
- Siva Reddy:机构信息未能从会议 PDF 纯文本可靠映射
- Perouz Taslakian:机构信息未能从会议 PDF 纯文本可靠映射
- Valentina Zantedeschi:机构信息未能从会议 PDF 纯文本可靠映射
- Cem Subakan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
冻结编码器的跨模态对比模型常保留系统性模态偏移,导致跨模态相似度失准。第一步冻结音频文本的LAION-CLAP和图像文本的FLAVA主干并附加轻量共享适配器以输出逻辑向量,第二步将同一逻辑向量分送欧氏分支做L2归一化与单纯形分支经softmax投影到概率单纯形,第三步分别以余弦相似度与负总体变差距离计分并用双向对称批量内InfoNCE目标只更新适配器参数。与球面余弦对正交变换不变、留下大量等价错位解不同,单纯形以非负与和为1约束强制双模态共用同一概率预算,softmax还附加全局逻辑平移不变性。在Clotho音频文本检索基准下,Lin.+Sfx的检索指标T2A NDCG@10为0.382,高于冻结CLAP基线的检索指标T2A NDCG@10 0.259。该结论限于检索适配、英文字幕配对数据和不足1%可训练参数设置,未验证生成、零样本分类和模态内几何保持。该适用边界受限于检索适配与英文字幕配对场景,向生成与零样本分类的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/ServiceNow/retreever — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
63. 只听自然度不够:用成对比较逼出裁判模型在副语言细节上的校准失败
英文题目:ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge
标签:#基准测试 #基准设计 #音频大模型 #模型评估 #语音属性识别
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#基准设计
👥 作者与机构
- Jisu Jeon:机构信息未能从会议 PDF 纯文本可靠映射
- Seungyeon Jwa:机构信息未能从会议 PDF 纯文本可靠映射
- Joosung Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jinhyeon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Woojin Chung:机构信息未能从会议 PDF 纯文本可靠映射
- Hwiyeol Jo:机构信息未能从会议 PDF 纯文本可靠映射
- Jeonghoon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jonghyun Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Soyoon Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型(Large Audio-Language Model, LALM)作为语音评测者时,输入为音频对与准则指令,输出为`
\[\[A\]]`、`
\[\[B\]]`或`
\[\[TIE\]]`三选一,难点在于细粒度副语言学差异易被整体自然度掩盖且模型不愿弃权。基准构建先从Expresso、Sonos Voice Control Bias Assessment、LibriTTS、EARS的官方测试划分中按标签抽取目标与非目标样本,再按准则构造非Tie对比与双好或双坏Tie对,最后施加同转录与跨转录控制及AB换位以分离声学与词汇依赖。评测流程将同一准则模板施加于Gemini 2.5 Flash、GPT-4o Audio、Kimi-Audio-7B-Instruct、Qwen2.5-Omni-7B与SpeechJudge-7B共5个代表性LALM并与6人人类多数投票对比,输出整体准确率与Tie校准、位置偏差等多维诊断。与仅报告整体偏好的已有语音评测基准相比,该机制差异在于显式要求模糊时弃权与转录解耦,从而暴露校准失效与模态依赖。在ParaPairAudioBench基准下,Gemini 2.5 Flash的准确率为61.5%,低于人类的准确率79.2%。结论仅适用于受控自然语音的成对辨别,不覆盖生成语音分布外泛化与Rate的Tie场景,且未验证去偏方法的有效性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/jsujeon/ParaPairAudioBench — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/jsujeon/ParaPairAudioBench — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
64. 网络学会算互功率却绕开白化:TDOA 估计的跨架构探测
英文题目:What Do Neural Networks Learn for TDOA Estimation? A Cross-Architecture Probing Study
标签:#信号处理 #模型比较 #可解释性 #多通道 #声源定位
评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#声源定位 | 主方法:#信号处理
👥 作者与机构
- Yaozhong Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Runwu Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Takeshi Ashizawa:机构信息未能从会议 PDF 纯文本可靠映射
- Benjamin Yen:机构信息未能从会议 PDF 纯文本可靠映射
- Kazuhiro Nakadai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
到达时延差估计输入为双麦克风短时信号,输出为采样级延迟真值,难点在于加性噪声与混响会破坏各频带可靠性并使固定白化在低信噪比下失效。本文先将双通道短时傅里叶变换系数拼成窄带观测向量并送入三类网络得到延迟估计,再用线性探针解码各层对互功率谱与相位变换相位的编码程度,最后以梯度归因与单频带掩蔽验证频率加权策略并回灌经典加权做瓶颈检验。相对广义互相关相位变换的单位幅度白化,网络普遍保留幅度并放大高能量频带,形成幅度感知的可靠性加权以替代不可逆的信息瓶颈。在合成直接路径0 dB有色噪声条件下,Transformer对互功率谱的探针指标R2为0.94,高于对PHAT相位的探针指标R2 0.12。结论在语音源与LOCATA实录中定性成立,但在强混响下延迟解码能力明显退化且多声源与波形端到端模型尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/york1to/cross-power-is-all-you-need — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
65. 不重建干净语音:用混合一致性把说话人线索和噪声分开
英文题目:Mixture Consistency Learning for Robust Speaker Verification in Noisy Environments
标签:#自监督学习 #鲁棒性 #说话人验证 #语音增强
评分:7.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#自监督学习
👥 作者与机构
- Seung-bin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Chan-yeong Lim:机构信息未能从会议 PDF 纯文本可靠映射
- Jungwoo Heo:机构信息未能从会议 PDF 纯文本可靠映射
- Hyun-seo Shin:机构信息未能从会议 PDF 纯文本可靠映射
- Kyo-Won Koo:机构信息未能从会议 PDF 纯文本可靠映射
- Jisoo Son:机构信息未能从会议 PDF 纯文本可靠映射
- Kyung-Wha Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Ha-Jin Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证在噪声下性能急剧下降,常用语音增强前端被迫拟合仍含信道与残留噪声的伪干净参考,容易把非判别因素复现并传入后端。所提混合一致性学习说话人验证系统先用共享卷积编码器压缩带噪复数频谱,再经结构相同的语音增强解码器与噪声提取解码器分别输出增强谱与噪声谱,并约束两者之和在 L2 意义下逼近原始混合输入,最后仅将语音支路经 Log Mel 变换送入 ReDimNet-B2 后端提取说话人嵌入并以 SphereFace2 损失优化。与单解码器重建干净目标的关键差异在于目标无关的自监督分解加任务驱动路由,使判别信息留在语音支路而无关变化被挤入噪声支路。在 VoxCeleb2 训练、VoxCeleb1 加 MUSAN 在 0 dB 至 20 dB 评测下总平均等错误率为 1.19%,相对自带增强前端的基线 1.36% 相对降低 12.5%,相对复现 ReDimNet-B2 的 1.42% 相对降低 16.2%。该结论限于人工加噪加混响协议与 Nonspeech100、VoxSRC23、VC-Mix 跨域验证,真实远场、强混响与重叠语音外推尚未验证。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/kimho1wq/MCL-SV — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
66. 不听也能答:视频基准的视觉捷径与 25 倍音频压缩的补救
英文题目:Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy
标签:#模型压缩 #评测协议 #状态空间模型 #音视频问答
评分:7.7/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音视频问答 | 主方法:#模型压缩
👥 作者与机构
- Geewook Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Minjoon Seo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
视频问答输入为采样视频帧加连续语音与环境声,输出为自然语言答案,难点在于讲座与会议等长视频必须依赖听觉,而25 Hz音频前端一小时即产生约9万标记,迅速耗尽上下文并形成具体瓶颈。作者先用无音频中央单帧送GPT-4o两次独立判对即剔除的保守探针系统性审计10个基准,量化视觉捷径并发布过滤划分。再在LLaVA-OneVision上外挂Qwen2-Audio的Whisper系编码器,经周期查询压缩器降采样至约1 Hz,最后按时间对齐交错送入Qwen2-7B统一推理。与平均池化、注意力重采样、单向与双向Mamba相比,因果门控Mamba即UniMambaMia在保持因果性的同时退化最平缓,可兼容流式推理并保留时序共现。在Music-AVQA基准下,本文模型的得分为79.5,高于Qwen2.5-Omni的得分45.7。结论仅适用于语音理解与跨模态 grounded任务,视觉中心基准增益消失甚至轻微干扰,这明确了其适用边界。延迟在单张A100 80GB上VideoMME平均耗时本文模型1.60 s,Qwen2.5-Omni为4.12 s,峰值显存分别约34 GiB与约62 GiB。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
67. 自发语音为何难转写:Tarsila-ASR 用 72 小时多域数据逼出模型的域失配
英文题目:Tarsila-ASR: A Multi-Domain Test Suite for Benchmarking Brazilian Portuguese Speech Recognition
标签:#基准测试 #基准设计 #语音 #语音识别
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Sidney Leal:机构信息未能从会议 PDF 纯文本可靠映射
- Ariadne Matos:机构信息未能从会议 PDF 纯文本可靠映射
- Edresson Casanova:机构信息未能从会议 PDF 纯文本可靠映射
- Frederico Gonçalves:机构信息未能从会议 PDF 纯文本可靠映射
- Renato Moraes Silva:机构信息未能从会议 PDF 纯文本可靠映射
- Arnaldo Cândido Jr:机构信息未能从会议 PDF 纯文本可靠映射
- Sandra Aluísio:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对巴西葡萄牙语自发语音转写任务,系统输入为多口音、多场景语音,输出为保留填充、犹豫、截断等口语现象的文本,难点在于朗读域预训练模型在自发条件下严重退化。该工作先汇聚CORAA ASR、NURC-SP、MuPe Life Stories、Common Voice 17.0、Multilingual LibriSpeech、Multilingual TEDx等公开语料的测试划分,统一为16kHz音频并保留文本、时长与音频字段,新增来源与性别字段,形成62094条、共72.46小时的统一评测集。再用该评测集对MuPe-ASR、Whisper-large-v3、Omnilingual 7B做零样本诊断,然后在聚合的1156小时训练集加39小时验证集上对Distil-Whisper、Whisper-medium/large-v3、Omnilingual 300M/1B做监督微调并按验证词错误率选点。与仅在单一口音或朗读数据上训练的已有基线相比,关键差异在于以多地域多文体覆盖逼近真实会话分布,并联合词错误率Word Error Rate/WER、字符错误率Character Error Rate/CER、语义分与实时率Real Time Factor/RTF评测。在Tarsila-ASR上微调后Whisper-large3-ft-75k取得WER为15.40%、CER为9.11%、BERTScore为97.84的最佳字面精度,显著优于未适配对照。结论仅适用于巴西葡萄牙语自发、准备式与朗读混合的离线转写,未验证流式、强噪声与跨语言外推,原文未披露训练推理成本与统计显著性。
🔗 开源资源
- 代码相关资源:https://github.com/nilc-nlp/tarsila-asr — 链接可访问(HTTP 200)
- 模型相关资源:https://github.com/nilc-nlp/tarsila-asr — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/nilc-nlp/tarsila-asr — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
68. 把音节切准又切省:findsylls 用可互换的包络与切分器统一音节级分词
英文题目:findsylls: A Language‑Agnostic Toolkit for Syllable‑Level Speech Tokenization and Embedding
标签:#开源工具 #基准设计 #多语言 #语音 #音频事件检测
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:系统技术报告 | 主任务:#音频事件检测 | 主方法:#基准设计
👥 作者与机构
- Héctor Javier Vázquez Martínez:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音节切分需从连续语音输出音节核、边界与完整区间,直接难点在于核检测较易而边界放置与区间恢复误差会逐级复合放大,且既有实现分散在不同数据集与评测协议下难以复现比较。findsylls先由包络计算以原始波形为输入负责输出平滑能量轮廓及候选核位置,再由特征抽取以原始波形为输入负责独立输出与切分无关的帧级声学或自监督表示,最后由切分算法同时接收前两步输出的轮廓与表示负责生成时间区间并在区间内做均值等池化以输出音节嵌入。伪包络抽象把神经余弦相似度等线索归一化为一维标量时间序列后复用同一Billauer peakdetect逻辑,使表示替换与算法替换可正交消融,从而厘清两者对边界质量与 token率的各自贡献。在 7 个英语、西班牙语与 Kono 语料按音节数加权平均下,Sylber 余弦线索接 peakdetect 取得边界 F1 为 69.9,优于默认 Sylber 流水线的 63.1,同时保持每秒 3.9 个 token 的压缩率。该结论受限于英语与西班牙语音节真值多由发音词典派生,且 50 ms 容差匹配会掩盖不确定边界上的分歧。原文仅报告相对吞吐趋势,经典谱带相减基线达 684x 逆实时因子,神经方法普遍低 1 至 2 个数量级。
🔗 开源资源
- 代码相关资源:https://github.com/hjvm/findsylls — 链接可访问(HTTP 200)
- 代码相关资源:https://pypi.org/project/findsylls/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
69. 说 same 话却判不同:语音与语言切换如何打散视觉 grounding 的三元组一致性
英文题目:Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models
标签:#基准测试 #基准设计 #鲁棒性 #多语言 #音视频问答
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 1.0/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音视频问答 | 主方法:#基准设计
👥 作者与机构
- Basel Mousi:机构信息未能从会议 PDF 纯文本可靠映射
- Fahim Dalvi:机构信息未能从会议 PDF 纯文本可靠映射
- Shammur Absar Chowdhury:机构信息未能从会议 PDF 纯文本可靠映射
- Firoj Alam:机构信息未能从会议 PDF 纯文本可靠映射
- Nadir Durrani:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为文化相关图像叠加英语或阿拉伯语文本或语音陈述,输出为该陈述是否被图像视觉支持的真假判断,难点在于等义输入跨模态与跨语言切换时仍需保持一致的对比判别。方法链分三步:首先从18个中东与北非国家图像库经图像盲过滤构建最小对比三元组,每图对应1个支持陈述Q+与2个貌似合理但不支持的Q-,为下一步提供语义匹配的竞争集;接着将英文陈述直译为阿拉伯语并用零样本合成生成男女声语音及加噪混响版本,保持词义不变进入语音评测;最后以三元组为单位判定全对一致性并用条件指标对比不稳定性CI隔离部分成功中的碎片失败。与已有聚合准确率评估相比,该机制差异在于条件化三元组一致性而非孤立正确率,因而能暴露高F1下的判别崩解。在10150三元组基准下,Qwen2.5-Omni-3B阿拉伯语语音输入的CI指标为0.71,高于文本输入的CI指标0.43。结论适用于中东与北非文化视觉主题及受控合成语音,尚不能外推至真实口语、自发韵律与开放问答。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/baselmousi/cfhr-ci — 链接可访问(HTTP 200)
- 数据相关资源:https://huggingface.co/datasets/QCRI/M2CQA-S — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
70. 在野外还没解决:UniTalk 用三类难度重测主动说话人检测
英文题目:Revisiting Active Speaker Detection: An In-the-Wild Benchmark for Generalization and Robustness
标签:#基准设计 #鲁棒性 #音视频 #说话人分离标注
评分:7.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#说话人分离标注 | 主方法:#基准设计
👥 作者与机构
- Le Thien Phuc Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Zhuoran Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Khoa Quang Nhat Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuwei Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Tu Ho Manh Pham:机构信息未能从会议 PDF 纯文本可靠映射
- Tuan Tai Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Toan Ngo Duc Vo:机构信息未能从会议 PDF 纯文本可靠映射
- Lucas Poon:机构信息未能从会议 PDF 纯文本可靠映射
- Tuan Khai Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Soochahn Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Jae Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
主动说话人检测(Active Speaker Detection, ASD)需对每帧每个可见人脸判定是否正在发声,难点在于多说话人并发、环境噪声、遮挡、相机运动与语言多样性下的视听对齐。作者构建UniTalk基准分三步:先用多语言关键词翻译检索YouTube以搜集覆盖拥挤与噪声场景的候选视频,候选池输出进入内容过滤。过滤结合自动规则与人工审核剔除低分辨率、缺失语音、强背景音乐、严重混响与敏感内容,合格片段进入人脸检测加贪心跟踪以生成稠密人脸轨迹。轨迹作为标注单元进入两轮多人标注与多数共识以确定发声标签,所得全集再按非英语语言、噪声、拥挤与混合困难划分测试子集以定位失效模式。与依赖电影的 AVA 相比,该基准强调真实并发说话与东亚语言覆盖,迫使模型学习可迁移的视听关联而非影视特有捷径。最强 TalkNCE 在 UniTalk 上整体仅得 83.2 mAP,显著低于其在 AVA 上的 95.5 mAP,而 UniTalk 训练模型在 AVA 上可达 88.0 mAP,证明难度来自真实分布而非单纯标注噪声。结论仅适用于所覆盖的网络视频类型与已定义难度轴,未验证极低分辨率、强混响或罕见语种的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/plnguyen2908/UniTalk-ASD-code — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
71. 罗马尼亚语逆文本规范化:规则精度与大模型泛化的取舍
标签:#数据集 #基准设计 #大语言模型 #模型比较 #语音识别
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Oana Sirbu:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandra Diaconu:机构信息未能从会议 PDF 纯文本可靠映射
- Sergiu Nisioi:机构信息未能从会议 PDF 纯文本可靠映射
- Bogdan Alexe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
罗马尼亚语逆文本归一化(Inverse Text Normalization,简称ITN)需把语音识别输出的口语形式转为标准书面形式,难点在数词与名词性数一致、罗马数字纪年、机构命名及日期货币分隔符。作者先制定覆盖8类的语言学指南并经3人标注加两轮校验构建24753对语料,再以全局加复制加归一化词错误率统一评测5类系统。相比英语中心工作,该研究把规则可解释性、神经模型数值不稳定性与大模型上下文推理放在同一罗马尼亚语基准下比较,具有选型意义。在域外400句四领域评测设置下,LLM Prompting的Mean WER为2.57%,低于NeMo/Pynini的Mean WER 4.56%。该结论适用边界受限于新闻训练分布与文学加儿童故事加影视对白加播客构成的域外集,专有大模型训练语料未公开故泛化证据尚未验证需谨慎解读。语法系统CPU约60句每秒且无API成本,少样本提示约0.21句每秒且单句约0.0073美元,精度与成本矛盾突出。从部署看语法系统在CPU硬件上吞吐约60句每秒而少样本提示推理开销约0.21句每秒,延迟与费用差距决定选型。
🔗 开源资源
- 代码相关资源:https://github.com/RoITN — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/RoITN — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/doccano/doccano — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
72. 不用并行编码器:用语音活动与谐波线索调制瓶颈的轻量多模态增强
标签:#多模态学习 #高效推理 #端侧运行 #实时处理 #语音增强
评分:7.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#多模态学习
👥 作者与机构
- Yonghun Song:机构信息未能从会议 PDF 纯文本可靠映射
- Yeongmin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yunsik Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yeeun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonyoung Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
含噪声学麦克风 Acoustic Microphone 在低信噪比下严重退化,而可穿戴边缘设备又装不下并行编码器或注意力融合等多模态重型结构,本文以同步采集的含噪声学信号与皮肤贴附加速度计 Accelerometer 信号为输入,输出增强语音波形。本文提出轻量加速度计辅助 U-Net 第二版 Lightweight ACC-assisted U-Net v2,先从加速度计幅度谱提取帧级语音活动检测 Voice Activity Detection 与基频谐波软掩膜两类线索,再经轻量一维卷积生成特征线性调制 Feature-wise Linear Modulation 的缩放与偏置参数,最后在瓶颈处分别调制频率轴与时间轴门控循环单元并由解码器重建对数幅度谱。与输入拼接或双分支编码相比,该机制不学习完整跨模态重建特征,只传递压缩后的时频结构先验。在咽喉与声学配对语音 Throat and Acoustic Paired Speech 混合深度噪声抑制 Deep Noise Suppression 噪声的测试集下,轻量加速度计辅助 U-Net 第二版 Lightweight ACC-assisted U-Net v2 的感知语音质量评估 Perceptual Evaluation of Speech Quality(PESQ)为 2.78,高于声学单模态 U-Net 骨干的感知语音质量评估 Perceptual Evaluation of Speech Quality(PESQ)1.78,并在 -20 dB 至 0 dB 超越轻量与多模态基线。该结论目前仅在 8 kHz 韩语数据与受控混合协议上验证,真实佩戴偏移与强混响外推尚未证明。原文披露了 STM32H753 微控制器 Microcontroller 端 48.66 ms 推理时延与 40% 剪枝后的存储占用,训练为单卡工作站量级。
🔗 开源资源
- 代码相关资源:https://github.com/yhsong06/LAU-NetV2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
73. 把逐毫秒的塞音切分交给帧分类:wav2VOT 如何同时估计 VOT、闭塞与弱化
标签:#开源工具 #SFT #语音学与音系 #语音 #语音属性识别
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#SFT
👥 作者与机构
- James Tanner:机构信息未能从会议 PDF 纯文本可靠映射
- Morgan Sonderegger:机构信息未能从会议 PDF 纯文本可靠映射
- Jane Stuart-Smith:机构信息未能从会议 PDF 纯文本可靠映射
- Tyler Kendall:机构信息未能从会议 PDF 纯文本可靠映射
- Jeff Mielke:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
塞音标注输入为含目标塞音的短时波形片段,输出要求同时给出闭塞起点、释音突起点、声带振动起点与是否弱化,难点在于毫秒级边界定位、闭塞段与弱化实现声学模糊且跨方言录音条件差异大。该工作先以左右各30ms至60ms随机语境窗提取塞音片段,并将毫秒级人工标注展开为逐帧窗、闭塞、VOT与弱化标签送入下一步。该模型再用卷积特征编码器降采样接Transformer编码器做逐帧分类,并以交叉熵加权折叠序列联结时序分类损失约束学习闭塞不可跟随VOT等合法拓扑。推理时再将帧级后验标签按5ms最小区间合并碎片并转换为起止时间戳输出。与仅估计VOT且假设必有清晰突的AutoVOT类工具相比,机制差异在于统一建模语境窗、闭塞、VOT与弱化四态并显式惩罚非法转移,实际意义是可同时给出闭塞时长与弱化判断。在CSJ-C匹配测试集评测下,止序列分类的准确率为96.8%,高于突实现分类的准确率93.3%。该结论适用边界目前仅限日语自发话训练与五个英语库验证,对负VOT、预送气与三元对立等情形尚未验证。训练成本仅披露使用80GB NVIDIA H100硬件训练10轮,推理开销与部署吞吐未进一步量化。
🔗 开源资源
- 代码相关资源:https://github.com/james-tanner/wav2VOT — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/rpuggaardrode/getVOT — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/ginic/wav2ipa — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
74. 谁在何时说了什么:重叠与语义双重视角下的会话语音识别评测
标签:#评测协议 #模型比较 #语音识别 #说话人分离标注
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Naohiro Tawara:机构信息未能从会议 PDF 纯文本可靠映射
- Samuele Cornell:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Polok:机构信息未能从会议 PDF 纯文本可靠映射
- Marc Delcroix:机构信息未能从会议 PDF 纯文本可靠映射
- Lukáš Burget:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
会话语音识别的输入是远场多说话人长录音,输出是带说话人标签与起止时间戳的转写,难点在于重叠语音、远场噪声与说话人数变化下的词语归属与时间对齐。作者先用时间约束最小置换词错率获得词级对齐与最优说话人置换,再按参考话语是否落入重叠区把误差分解为重叠与单人分量,随后基于该对齐构造话语级语义误差率。与传统等权编辑距离不同,新指标用MiniLM句嵌入余弦相似度加权语义偏离,对填充词与意译更宽容而对否定与实体替换更严厉。在说话人计数评测任务下,VibeVoice的说话人计数准确率为77.5%,高于DiCoW的说话人计数准确率71.9%。其适用边界受限于英语会议与聚餐语料及所选系统与嵌入,失败条件集中于高重叠多说话人场景,跨语言外推尚未验证。该结论限于所测的三个英语会议与聚餐场景、所选系统与 MiniLM 嵌入,未经人类语义判断验证与多语言检验。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://pcspeech-demo.fit.vut.cz/wsw2 → https://pcspeech-demo.fit.vut.cz/wsw2/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
75. 把重叠语音当成交错序列:用洗牌积统一对齐与多人转写
标签:#CTC #语音 #语音识别 #强制对齐
评分:7.7/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#CTC
👥 作者与机构
- Matthew Wiesner:机构信息未能从会议 PDF 纯文本可靠映射
- Samuele Cornell:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Polok:机构信息未能从会议 PDF 纯文本可靠映射
- Lucas Ondel-Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Lukáš Burget:机构信息未能从会议 PDF 纯文本可靠映射
- Sanjeev Khudanpur:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多说话人重叠语音识别的输入是单通道混合音频,输出是带说话人归属的转写与时间对齐,难点是跨说话人词元交织顺序未知且野外数据缺乏帧级词对齐,并发度高时搜索空间急剧膨胀。该方法基于WavLM编码为话语组构建洗牌积监督图以枚举所有保序交织,再用近似起止时间与领κ构造偏序剪枝图,随后将该图与精简无自环CTC拓扑复合求对数半环前向分数以边缘化全部交织与对齐,最后在帧级预测词元与说话人二元组并用一遍贪心或分说话人多遍WFST解码输出结果。与强制固定串行化的utterance级SOT和按说话人独立建模的SD-CTC不同,该框架把排序不确定性保留在损失内并用κ连续调节约束强度,从而避免过早承诺错误顺序。在LibriMix测试集设置下,Base模型shuffle损失的WER为15.1%,低于SD-CTC基线的WER15.4%。适用边界是合成重叠与至多 3 路并发,已知说话人上限收益很小,长 3 说话人对齐曾因显存失败。原文未披露推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/geolocation-from-speech/jsalt2025.git → https://github.com/geolocation-from-speech/jsalt2025 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
76. 词对了还不够:非言语发声的可控性为何与语音质量脱钩
标签:#基准测试 #基准设计 #多语言 #语音 #语音合成
评分:7.7/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音合成 | 主方法:#基准设计
👥 作者与机构
- Liumeng Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Weizhen Bian:机构信息未能从会议 PDF 纯文本可靠映射
- Jiahao Pan:机构信息未能从会议 PDF 纯文本可靠映射
- Wenxuan Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Yilin Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Boyi Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Jingbin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyang Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xinyuan Qian:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Yike Guo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该基准面向含非言语发声的语音生成,输入为带内联标签文本或带发声描述的字幕,输出为词与发声融合的连续语音,难点在于发声类型多、低信噪比口腔音易被掩蔽、长时哭泣类情感轨迹难维持连贯。方法链先按产生机制与交际功能建立45类6大类统一分类体系并调研已有系统与数据集的覆盖偏斜,再从双语富有表现力人声语料挖掘高置信种子以锚定真实分布并校准生成提示。接着用大模型按单类型约束批量生成四字段中英文本与字幕,再经模式校验与人工跨字段核验并对不足50例的类型迭代补采形成每语言2250例评测集,并对生成语音并行施加客观识别、人工听测与大模型多评分者评测。与仅测整体质量或窄标签集合的已有评测不同,该协议将言语可懂度与信号质量同发声类型正确性、放置精度及感知显著性分离,并统一兼容标签式与提示式两种控制接口。在中文标签式系统人工听测评测下,ElevenLabs的Overall Expression得分为3.98±0.12,高于CosyVoice 2的Overall Expression得分3.28±0.16。低信噪比口腔细节与长时情感仍是共性瓶颈,其结论适用边界受限于45类内平衡语料与15系统快照,跨语言自发交互与未覆盖发声类型的外推尚未验证,极端噪声与长时情感连贯存在明确失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://lmxue.github.io/NVV-SuperBench/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/2noise/ChatTTS — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/boson-ai/higgs-audio — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/nari-labs/dia — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
77. 不用贴脸电极的眼镜,能读懂无声说话的开放词汇吗
英文题目:SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces
标签:#数据集 #CTC #数据集构建 #静默语音接口
评分:7.7/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#静默语音接口 | 主方法:#数据集构建
👥 作者与机构
- Ruidong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiacheng Liu:机构信息未能从会议 PDF 纯文本可靠映射
- François Guimbretière:机构信息未能从会议 PDF 纯文本可靠映射
- Cheng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可穿戴静默语音接口(silent speech interface, SSI)需从无声面部运动直接恢复连续文本,输入为超声回波时序,输出为开放词表词序列,难点在于非接触信号微弱且发声与静默构音存在域偏移。数据链先以眼镜式主动声学传感采集双频调频连续波回波并同步记录语音与视频,再经带通滤波与距离维差分得到抑制静态反射的回波剖面,接着用残差编码器加联结时序分类(connectionist temporal classification, CTC)学习回波到子词的无对齐映射,最后以贪婪解码输出文本且全程不依赖外部语言模型。与依赖面肌电或舌超声的侵入式方案不同,该工作证明毫米级面部形变回波已蕴含可解码的音位信息。在配对的静默测试集上联合训练基线达到26.3%的词错误率(word error rate, WER),显著优于纯静默训练与跨模式直接迁移。该结论目前仅适用于单说话人安静环境下的朗读式对话英语。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://doi.org/10.7298/xjjr-9m85 → https://ecommons.cornell.edu/entities/publication/6328648d-caa4-4314-9655-449c59e47918 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
78. 搬走家具后混响变了:用编辑前实测与均匀材质代理更新房间脉冲响应
英文题目:Echoes after Edits: Room Impulse Response Estimation for Geometry Update
标签:#数据集 #注意力机制 #时频分析 #房间脉冲响应估计
评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#房间脉冲响应估计 | 主方法:#注意力机制
👥 作者与机构
- Swapnil Bhosale:机构信息未能从会议 PDF 纯文本可靠映射
- Yoshiki Masuyama:机构信息未能从会议 PDF 纯文本可靠映射
- Moitreya Chatterjee:机构信息未能从会议 PDF 纯文本可靠映射
- Christoph Boeddeker:机构信息未能从会议 PDF 纯文本可靠映射
- Julius Richter:机构信息未能从会议 PDF 纯文本可靠映射
- Gordon Wichern:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Le Roux:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
编辑条件房间脉冲响应估计以编辑前实测响应r0与编辑前后网格G0与G1为输入,在源接收位置不变下预测编辑后响应r1,难点是无逐物体材质标注且不允许在新场景重测。为使几何差在受控吸收下显形,该方法先对G0与G1以M种预设全局均匀材质各仿真代理响应集合PG0与PG1。接着以共享ResNet-18将r0与代理的对数幅度谱编码为声学特征并融合类型嵌入与材质嵌入为结构化隐变量,再经类型池化生成上下文查询q。查询q一方面指导对代理特征的缩放点积全局注意力加权,另一方面调制频带门控时基,进而在谱域合成残差并叠加到r0上得到预测。与需在新场景采多点参考的xRIR插值和需逐场景逆渲染材质的DiffRIR不同,该机制把真实材质保留在r0中而把几何变化交给代理差分显式刻画,避免跨位置插值与昂贵逐面拟合。在14场景留一评测协议下,PG-RIR的T60指标为0.0316 ± 0.0076,低于Identity (r0)的T60指标0.0432 ± 0.0073。该结论适用边界受限于AcoustiX仿真与家具移除训练分布,平移与三步链式编辑仅做小规模零样本检验且逆变换沿用r0相位,多次递推会累积谱平滑而模糊早期瞬态,真实测量场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/merlresearch/geometry-edit-rir — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
79. 换了语言就换了破绽:66 种语言下伪造语音检测为何不再可靠
标签:#数据集 #评测协议 #跨语言 #低资源 #语音伪造检测
评分:7.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音伪造检测 | 主方法:#评测协议
👥 作者与机构
- Kirill Borodin:机构信息未能从会议 PDF 纯文本可靠映射
- Vasiliy Kudryavtsev:机构信息未能从会议 PDF 纯文本可靠映射
- Maxim Maslov:机构信息未能从会议 PDF 纯文本可靠映射
- Mikhail Gorodnichev:机构信息未能从会议 PDF 纯文本可靠映射
- Grach Mkrtchian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作针对欺骗检测器在多语言部署中遭遇语言失配时性能不可预测的难题,输入为多语言合成语音,输出为固定工作点下的伪造拒绝能力诊断。方法链分为4步:先以24个开源文本到语音(Text-to-Speech,TTS)系统在66种语言上按默认配置生成2732.17小时纯伪造语料,再在6个外部真伪基准上混合校准每个检测器的等错误率(Equal Error Rate,EER)阈值,随后将阈值零样本迁移到新语料计算伪造拒绝率(Spoof Rejection Rate,SRR),最后在固定检测器与合成器下对比语言对以分离语言效应。与已有语料相比,关键差异是显式控制(语言,合成器)正交变化并采用无目标域真人语音的诊断协议。在LRLspoof语料评测设置下,w2v2 300在英语上的伪造拒绝率指标为62.27%,高于其在波兰语上的伪造拒绝率指标30.78%。该诊断的适用边界受限于无目标域真人语音的零样本迁移条件,尚未验证跨信道与压缩后处理下的外推范围。该结论仅适用于伪造拒绝端,不刻画误拒真人语音的风险,且依赖外部校准域的选择。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/lab260/LRLspoof — 暂时无法访问
- 数据相关资源:https://modelscope.cn/datasets/lab260/LRLspoof — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/espeak-ng/espeak-ng — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/RHVoice/RHVoice — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/myshell-ai/MeloTTS — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/robinhad/qirimtatar-tts — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/resemble-ai/chatterbox — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/hexgrad/kokoro — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
80. 多域语音识别不想反复重训:用模型合并拼出一个模型,代价是跨语言鲁棒性
英文题目:Exploring the potential and limitations of Model Merging for Multi-Domain Adaptation in ASR
标签:#领域适应 #模型融合 #鲁棒性 #语音识别
评分:7.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型融合
👥 作者与机构
- Carlos Carvalho:机构信息未能从会议 PDF 纯文本可靠映射
- Francisco Teixeira:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Rolland:机构信息未能从会议 PDF 纯文本可靠映射
- Alberto Abad:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为多域欧洲葡萄牙语语音,输出为转写文本,难点在于每个域独立微调会产生大量检查点造成部署碎片化,而联合微调需回访全部历史数据且新增域要重训全量混合。方法链第一步在Whisper Large-v3基座上对10个域分别独立微调,以基座与微调权重之差得到各域任务向量矩阵。第二步将上一步输出的各矩阵分别做截断奇异值分解并只保留主导奇异向量,再跨任务拼接后做正交白化以消除方向干扰,其中BoostedTSV-M在截断前对小奇异值按比例做下界提升以缓解秩坍塌。第三步将上一步输出的解耦方向按缩放系数加权求和后加回基座权重,一次合并得到单一可部署模型,与直接参数平均相比保留了矩阵低秩结构,与任务算术相比增加了显式正交化解耦。与联合微调相比,BoostedTSV-M在欧洲葡萄牙语全集平均词错率上从11.58%降至11.55%并通过MAPSSWE显著性检验,同时英语与多语言退化明显小于联合微调。结论边界是增益集中于目标语言域内与近分布变体,对巴西葡萄牙语及远距离语言仍有退化且存在专用性与鲁棒性权衡。原文未披露训练时长与推理部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Miamoto/mergewhisper — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
81. 先修共振峰再合成:用显式元音矫正平衡可懂度与说话人保持
英文题目:Formant-Guided Speech Repair for Enhanced Comprehension of Dysarthric Speech
标签:#信号处理 #主观评测 #语音 #音频修复 #文本到语音
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频修复 | 主方法:#信号处理
👥 作者与机构
- Xin-Yu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jing-Tong Tzeng:机构信息未能从会议 PDF 纯文本可靠映射
- Carlos Busso:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍语音修复输入为发音扭曲、元音空间塌缩的病理语音,输出为保留原说话人音色与韵律且内容可懂的自然语音,难点在于重度非线性失真下同时保真可懂度、自然度与身份。系统先由构音障碍自适应识别将病理语音转写为语言符号,再由共振峰对齐谱变换(Formant-Aligned Spectral Transformation,FAST)基于强制对齐定位元音并向健康参考 warp 共振峰,最后由说话人自适应合成(Speaker-Adaptive TTS)以校正后音频作韵律与音色条件、以识别文本作内容条件生成波形。与隐式语音转换和扩散重构不同,该链路在合成前显式恢复听皮层依赖的二维共振峰结构,提供可验证的声学中间态。评测采用说话人无关划分与多库跨语言验证,客观指标覆盖错误率与自然度,主观评测由18名母语听者对120条样本打分。在CDSD测试集条件下,提议方法的可懂度得分为4.60分,高于原始语音的可懂度得分2.31分。消融显示仅做谱变换错误率仍高,去掉共振峰校正或说话人自适应均使错误率明显回升,证实两模块互补且须与重建耦合。结论限于普通话与英语句子级朗读及命令语音,未验证自发对话、极重度无残留元音结构与跨病因泛化,原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/xinyu0308/FAST-SR — 链接可访问(HTTP 200)
- 演示资源:https://xinyu0308.github.io/FAST-SR-Demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
82. 心音也能被神经编解码器伪造:从 CARDIOFAKE 基准到谱与自监督特征的互补融合
英文题目:Towards Detecting Neural Audio Codec Synthesized Heart Sounds
标签:#基准测试 #模型融合 #音频安全 #生理信号 #音频深度伪造检测
评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音频深度伪造检测 | 主方法:#模型融合
👥 作者与机构
- Girish:机构信息未能从会议 PDF 纯文本可靠映射
- Orchid Chetia Phukan:机构信息未能从会议 PDF 纯文本可靠映射
- Mohd Mujtaba Akhtar:机构信息未能从会议 PDF 纯文本可靠映射
- Bhavinkumar Vinodbhai Kuwar:机构信息未能从会议 PDF 纯文本可靠映射
- Swarup Ranjan Behera:机构信息未能从会议 PDF 纯文本可靠映射
- Arun Balaji Buduru:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
合成心音检测以心音图波形为输入,输出真伪二分类标签,难点在于神经音频编解码器重建保留心律与身份线索而仅留下细微编解码失真。该工作以CirCor DigiScope真实心音为源,经7种编解码器编码再解码构建平行真伪数据集CARDIOFAKE,共3163条真实与22141条合成心音。方法链为提取谱特征与冻结语音自监督表示经卷积投影为低维向量,接着用格拉姆最优传输跨分支对齐融合,最后经全连接网络分类,前步输出即后步输入。相对直接拼接与原始最优传输,Gram-OT比较特征间相关结构而非原始幅值,对缩放与噪声更稳健并保留节律关系。在CARDIOFAKE可见编解码器评测设置下,GROOT方法的准确率为93.20%,高于AASIST基线的准确率85.15%。闭集身份识别中真实训练合成测试达 86.29%,证明重建伪造具有身份保持性。结论仅适用于编解码重建式伪造与单数据集划分,未验证端到端生成、回放攻击、噪声采集与跨人群外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://helixometry.github.io/SHAC/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
83. 不先认音素,直接认发音特征:PhonoQ-2.0 为何在跨语料与未见语言上更稳
英文题目:Multilingual Phonological Feature Recognition with Self-Supervised Speech Models
标签:#自监督学习 #语音学与音系 #多语言 #零样本 #语音属性识别
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#自监督学习
👥 作者与机构
- Abner Hernandez:机构信息未能从会议 PDF 纯文本可靠映射
- Tomás Arias-Vergara:机构信息未能从会议 PDF 纯文本可靠映射
- Daiqi Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Maier:机构信息未能从会议 PDF 纯文本可靠映射
- Paula Andrea Pérez-Toro:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理多语言帧级音系特征识别,输入为原始波形,输出为发音方式、元音高度与前后、发音部位与清浊构成的22维结构化特征向量,难点在于跨语言音位库存差异大且域偏移下音素优先流水线误差会被映射放大。方法链条为冻结的多语言自监督编码器先输出上下文表示,接着共享投影加两层Conformer建模局部与长程依赖,然后四个专用分类头分别预测不同特征组,最后由发音方式门控仅激活合法的元音与部位分支以保证音系一致性。与先识别音素再查表映射的已有做法相比,该设计显式建模特征组依赖而非假设特征独立。在域内CommonPhone测试上PhonoQ-2.0宏观F1达到91.3%,较同骨干CTC音素基线平均领先8.8个百分点;跨语料库平均88.9%,领先8.6个百分点;在未见语言上从66.9%提升至73.6%,平均提升6.7个百分点。结论适用于英德西捷四种训练语言及朗读与议会演讲域,向法语鼻化、俄语腭化与更远语系的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/abnerLing/PhonoQ-2.0 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
84. 一直在线的对话大模型记住了谁在说话:全双工语音对话中的说话人泄露与流式匿名化
英文题目:Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
标签:#向量量化 #隐私保护 #流式处理 #说话人匿名化 #全双工语音交互
评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#向量量化
👥 作者与机构
- Nikita Kuzmin:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Jiajun Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Yingke Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Tristan Tsoi:机构信息未能从会议 PDF 纯文本可靠映射
- Tianxiang Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Lui:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端全双工语音对话模型以常开大语言模型骨干持续消费用户音频流并直接生成语音回应,其输出需兼顾语义连贯与低延迟打断响应,而跨轮次常驻的用户流隐藏状态可能沉淀可链接的说话人身份,构成合规与隐私难点。为量化该风险,论文第一步从Moshi三十二层与重实现SALM-Duplex二十层中抽取用户流早中晚三层及全层平均池化表示,保留时序结构供探针使用。第二步在LibriSpeech训练数据上为两模型分别训练ECAPA-TDNN说话人验证探针,遵循VoicePrivacy 2024懒惰知情攻击者协议以上一步隐藏状态为输入报告等错误率与可链接性,并做层间与轮次长度分析定位泄露累积规律。第三步将Stream-Voice-Anon以两种方式接入对话链路,波形级Anon-W2W在连续编码器前先净化输入波形而不改动原模型,特征级Anon-W2F则以匿名离散编码器替换连续编码器并微调大语言模型以省去波形合成冗余。相比已有高保真重建离散编码器保留丰富声纹的做法,该前端净化与编码器替换在进入骨干前即剥离说话人特征,使深层语义抽象与匿名化分工衔接并保持流式实时性。在VoicePrivacy 2024评测集上SALM-Duplex离散基线等错误率为11.2%,特征级匿名化提升至41.0%,接近50%随机上限,Moshi离散基线6.4%经波形级提升至36.9%。结论限于朗读语音与ECAPA这类较弱攻击者,未验证自发对话、强攻击者与言语自然度损失,训练超参数与硬件成本原文未披露。
🔗 开源资源
- 代码相关资源:https://github.com/Plachtaa/StreamVoiceAnon — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
85. 单码本同时建模语义与声学:WavSLM 的蒸馏与分块自回归
英文题目:WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
标签:#自回归模型 #知识蒸馏 #向量量化 #流式处理 #语音合成
评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#知识蒸馏
👥 作者与机构
- Luca Della Libera:机构信息未能从会议 PDF 纯文本可靠映射
- Cem Subakan:机构信息未能从会议 PDF 纯文本可靠映射
- Mirco Ravanelli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音语言建模需以连续波形为输入并自回归生成连贯语音延续,同时兼顾词汇内容与说话人身份及韵律等声学细节,而语义与声学纠缠使纯语音单流建模难以兼得可懂度与保真度。WavSLM先以流式FocalCodec-Stream对WavLM第6层特征经因果压缩器和单码本二值球面量化器压缩为50Hz单流离散口令,其输出经因果解压缩器映射回兼容WavLM高层的连续特征。接着将WavLM第7至24层改造为因果解码器并在其上加轻量语言建模头,该解码器以上一步还原特征为输入按块偏移预测目标逐块生成后继口令。与依赖文本预训练或多码本分层声学建模的已有方案不同,该单码本蒸馏链保持文本式单流自回归范式并以块大小解耦建模效率与时间分辨率,兼顾流式低延迟与语义声学联合保留。在LibriSpeech test-clean延续生成任务下,WavSLM-2k的UTMOS为3.72,高于LLaMA-Mimi 1.3B的UTMOS 3.57。该结论限于英文有声书语料和短窗连贯性评测,大词表与长块设置下性能明显下降,开放域对话与多语种尚未验证。模型在单块NVIDIA H100硬件上训练,理论流式延迟为80毫秒,滑动窗注意力将推理开销控制为常数延迟生成。
🔗 开源资源
- 演示资源:https://lucadellalib.github.io/wavslm-web/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
86. 特定场景缺标注数据时,如何把网络长音频变成可训练的分类数据:TriA 四步流水线
标签:#数据集 #数据集构建 #环境声 #音频分类
评分:7.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音频分类 | 主方法:#数据集构建
👥 作者与机构
- Hong Lyu:机构信息未能从会议 PDF 纯文本可靠映射
- Mingru Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Qianhua He:机构信息未能从会议 PDF 纯文本可靠映射
- Yanxiong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jinxin Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengyu Pei:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
家庭场景的音频分类输入为来源杂乱的长录音,输出为片段级事件标签,难点在于人工标注稀缺且类别覆盖不均,音乐背景更易淹没目标事件。所提TriA流水线先由标准化统一格式与响度,再由音频活动检测按能量切分并剔除冗余静音,接着由音频事件检测做局部滑窗初检与全局复核以生成带标注短片段,最后由美学与语义过滤保留高质量样本并写入索引。与仅处理语音或副语言的Emilia等流水线不同,该方法以事件检测为中心并引入事件关键时间与静音关键时间等听测先验来约束切分与过滤。在家庭三任务上,先用先验引导子集再用人工数据序贯微调较仅用人工数据平均相对提升准确率3.97%与宏平均F1值3.35%。该结论目前仅在家庭相关划分上验证,对音乐主导分布与其他声景的泛化尚未证明。流水线小批量验证所用硬件为单卡RTX 3090,约10小时处理284.7小时音频,相对实时因子为0.03。该适用边界意味着结论受限于家庭声景,跨场景部署前仍需复核。
🔗 开源资源
- 代码相关资源:https://github.com/huanxian/TriA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
87. 不用进消声室:用仿真 HRTF 反推个人参数再切换到真实域
标签:#领域适应 #空间音频信号 #空间音频渲染
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#领域适应
👥 作者与机构
- Yoshiki Masuyama:机构信息未能从会议 PDF 纯文本可靠映射
- Gordon Wichern:机构信息未能从会议 PDF 纯文本可靠映射
- Christoph Boeddeker:机构信息未能从会议 PDF 纯文本可靠映射
- Julius Richter:机构信息未能从会议 PDF 纯文本可靠映射
- Takahiro Edo:机构信息未能从会议 PDF 纯文本可靠映射
- Swapnil Bhosale:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Le Roux:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
头相关传输函数 Head-Related Transfer Function / HRTF个性化需从易获取输入预测任意方向双耳对数幅度谱,难点是数值仿真在高频存在系统性伪影而真实测量依赖消声室。所提仿真到真实神经场 Sim-to-Real Neural Field / S2RNF方法链分三步衔接:先以单步隐式梯度起点网络 Implicit Gradient Origin Network / IGON从仿真谱重建误差推断被试共享隐变量,再将域参数由仿真切换为真实以网格无关解码任意方向真实感谱。然后以真实域损失与仿真域损失联合优化网络与域参数,使推理时的仿真到真实切换在训练中显式一致。相对直接修正频谱的精修范式,该机制只用仿真谱估计身份而不逐点改谱,兼顾个性化与空间连续性。在扩展 SONICOM 25人测试集上 S2RNF以均方根误差 Root Mean Square Error / RMSE 4.90 dB优于非个性化平均基线5.05 dB,高频失真下降带来极角误差 Polar RMSE / PolRMSE 改善;在 HUTUBS 留一评估上幅度略优于人体测量基线但感知指标未超越。该结论限于对数幅度建模与高质量头模仿真输入,未验证摄影测量网格、相位与耳间时间差个性化及主观听感。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/merlresearch/s2rnf — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
88. 合成语音问答能否把语音语言模型带到二十三种语言
英文题目:Turning Speech Language Models into Multilingual Listeners
标签:#数据集 #指令微调 #多语言 #音频问答
评分:7.6/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#指令微调
👥 作者与机构
- Tolúlọpẹ́ Ògúnrẹ̀mí:机构信息未能从会议 PDF 纯文本可靠映射
- Dan Jurafsky:机构信息未能从会议 PDF 纯文本可靠映射
- Christopher D. Manning:机构信息未能从会议 PDF 纯文本可靠映射
- Ahnmet Üstün:机构信息未能从会议 PDF 纯文本可靠映射
- Martijn Bartelds:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音语言模型需以语音提问为输入、开放式文本回答为输出,实际难点是多语种口语指令数据稀缺且复杂任务评测长期局限于英语。先以英语Voice Assistant 400K问答文本为输入,用Seamless M4T v2 Large翻译并输出22种语言译文,再以该译文为合成底本,用XTTS、Seamless M4T与MMS按语言分工合成问题端多说话人语音并输出语音问题加文本答案三元组,最后以测试划分每语言200对三元组为输入,经Prolific母语校对并拼接CommonVoice与CoVoST-2输出MULTISPEECH-BENCH供大模型偏好裁判。与已有英语中心合成数据相比,关键差异是以翻译修正率加合成自然度与内容可懂度双维评分显式验证23语种可训练性,使合成质量可追溯到下游增益。在 MULTISPEECH-BENCH 口语问答(Spoken Question Answering / SQA)上,经 MULTISPEECHQA 微调的 Qwen2.5-Omni 以60.6%平均胜率优于未微调版本,方向为微调更优并成为开源最优。该增益在希伯来语、希腊语、波斯语和捷克语等合成质量较低语言上明显减弱为大量平局,且自动语音识别(Automatic Speech Recognition / ASR)平均词错率从49.7%微升至50.4%、语音翻译(Automatic Speech Translation / AST)平均BLEU从22.7降至21.0,基本未提升。该结论的适用边界受限于合成语音质量,低自然度语言失败条件突出且真实口语外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 模型相关资源:https://multispeech.github.io/ — 链接可访问(HTTP 200)
- 数据相关资源:https://huggingface.co/datasets/Mihaiii/qa-assistant — 暂时无法访问
- 第三方资源:https://github.com/quocanh34/Bud500 → https://github.com/apluka34/Bud500 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
89. 小数据微调为何越调越偏:纯 GRPO 能否保住域外检测能力
标签:#强化学习 #SFT #鲁棒性 #音频深度伪造检测
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#强化学习
👥 作者与机构
- Xin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wanying Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Junichi Yamagishi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造检测以波形为输入并输出真或假二值判决,核心难点是向目标域微调后在未见攻击与声学条件下泛化严重急剧退化。本文沿预训练加后训练加微调链条展开,先用大规模真实语音自监督预训练与含声码器伪造数据的后训练得到表征,再在小规模目标域数据上比较监督微调与强化微调,最后用分布漂移工具佐证泛化差异。与仅用真值对数似然的监督微调不同,组相对策略优化对每个输入采样多个人工判决并以组内归一化优势同时利用正负奖励加参考模型约束更新。在Deepfake-Eval-2024微调后的多测试集评测下,纯组相对策略优化的In-the-Wild等错误率为2.19%,低于监督微调的等错误率6.35%。结论限于后训练初始化的自监督语音鉴伪器与4个域外集,对无后训练流水线已被证伪,对流派外攻击与阈值外推性未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/nii-yamagishilab/AntiDeepfake — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
90. 从单段分类到多部位问答:AuscuTSLM 如何把听诊声接到冻结大模型上
英文题目:AuscuTSLM: Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings
标签:#医疗音频 #多模态学习 #生理信号 #音频问答
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#多模态学习
👥 作者与机构
- Fan Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Tsai-Ning Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Nicolas Zumarraga:机构信息未能从会议 PDF 纯文本可靠映射
- Ning Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Markus Kreft:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin O’Sullivan:机构信息未能从会议 PDF 纯文本可靠映射
- Paula Manso Zorrilla:机构信息未能从会议 PDF 纯文本可靠映射
- Elgar Fleisch:机构信息未能从会议 PDF 纯文本可靠映射
- Oliver Aalami:机构信息未能从会议 PDF 纯文本可靠映射
- Paul Schmiedmayer:机构信息未能从会议 PDF 纯文本可靠映射
- Robert Jakob:机构信息未能从会议 PDF 纯文本可靠映射
- Patrick Langer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
患者级听诊问答的输入是同一患者多部位最长30s的心肺录音、部位元数据与自然语言临床问题,输出是二分类判断与开放式诊断描述,难点在于心脏杂音与肺部啰音微弱易被噪声掩盖,且需跨解剖部位整合长时节律上下文。先将异构采样音频重采样至16kHz单声道并截断补齐至30s归一化,职责是统一时长与量纲并输出等长波形,再将等长波形经40ms切块一维卷积投影为时序声学词元并展平多部位序列,职责是离散化长时信号并输出多实例词元序列送入压缩,最后以可学习隐查询对该词元序列做交叉注意力压缩为定长患者表示,并与部位文本词元经门控交叉注意力注入冻结大模型,职责是融合多部位冗余并输出接地文本答案。与单片段分类和通用音频大模型的关键差异在于多实例聚合提供空间冗余以缓解截断损失,轻量领域编码即可比肩大规模预训练编码器,具有减少对大模型依赖的实际意义。在CaReSound基准下,AuscuTSLM的Contains-Match准确率为42.60%,高于微调基线CaReAQA的Contains-Match准确率34.85%。该结论在单记录数据集上依赖完整时长,真实噪声、设备差异与前瞻临床部署尚未验证。该工作的训练与推理在NVIDIA RTX PRO 6000硬件上完成,推理开销约为8h,构成部署前需考虑的计算量受限。
🔗 开源资源
- 代码相关资源:https://github.com/Fan-loewe/AuscuTSLM — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
91. 真伪判定的神经元依据能被拆开算账吗:证据子空间投影的量化解读
标签:#统计分析 #可解释性 #语音 #音频深度伪造检测
评分:7.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#统计分析
👥 作者与机构
- Yixuan Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Cheng-Wei Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yassine El Kheir:机构信息未能从会议 PDF 纯文本可靠映射
- Arnab Das:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Polzehl:机构信息未能从会议 PDF 纯文本可靠映射
- Sebastian Möller:机构信息未能从会议 PDF 纯文本可靠映射
- Ngoc Thang Vu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频深度伪造检测(Audio Deepfake Detection)以语音波形为输入,输出真伪二分类标签,难点在于自监督学习(Self-Supervised Learning, SSL)前端在域外数据上依赖数据集捷径而非真实伪造痕迹。所提证据子空间投影(Evidence Subspace Projection, ESP)先以语音经SSL前端得到的声学token与前馈神经元激活为输入,统计各标签下激活覆盖率并按层拼接,输出共享神经元激活空间中的标签表示,再以该标签表示为输入,在同一数据集与分组内做单对余去均值以去除公共与数据集偏移,输出残差向量,其中真伪残差构成决策轴、同组证据标签残差张成证据子空间,最后以决策轴与证据子空间为输入,将前者投影到后者并以有效秩归一化,输出解释率以前端行为方向的可比能量占比度量证据贡献。与以往整机归因不同,该方法冻结后端而直接比较前端行为方向,实现了跨证据类型的定量可比。在ASV19测试集上冻结模型的静音组解释率超过10%,而在ITW上低于0.5%,微调后XLSR在ASV19上达到0.25%等错误率(Equal Error Rate, EER)却放大了静音依赖。该结论限于XLSR与HuBERT两类前端及6个评测集,对混杂因素的解耦与阈值外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/XIAOYixuan/ESP — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
92. 缺配对文本卡住民乐生成:CTMusic 用 741 对标注与两阶段微调补上独奏到合奏
英文题目:CTMusic: A Traditional Chinese Instrumental Music Dataset Towards Text-to-Music Generation
标签:#数据集 #数据集构建 #音乐 #音乐生成
评分:7.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音乐生成 | 主方法:#数据集构建
👥 作者与机构
- Zixing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yimin Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Haotian Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Han:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到音乐生成以自然语言描述为输入、以波形音频为输出,在传统中国器乐上受困于高质量录音分散稀缺、代表性乐器风格选择难与文化化描述规范难。作者先双源采集数字专辑与Bilibili短视频并经时长过滤、预训练音频网络去人声噪声与人工复核,独奏施加单主奏约束、长曲按乐句手工切分至400秒内并统一至44.1 kHz与负14 LUFS,得到约42小时语料。再由民乐专业毕业生按三段式模板撰写乐器印象、客观进行与情感用途描述,经校准与退修后对合奏子集用DeepSeek-V3改写扩充并人工校验,一致性描述进入下一步配对训练。接着采用独奏到合奏两阶段渐进微调,先学干净音色再学多乐器交互,基座Stable Audio Open全自注意力与交叉注意力用LoRA微调,新加TTT层从头训练。与整体微调基线不同,SA-TTT在24块扩散变换器中每四块末块稀疏插入双向测试时训练层并以小初值门控,以增强装饰音与动态细节调制能力。在独奏子集测试集评测下,SA-TTT的FDopenl3指标为170.44,低于SA-pretrained的FDopenl3指标为315.23。该结论适用边界受限于12种乐器独奏与合奏短片段,声乐戏曲与长时结构外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://frei-2.github.io/CTMusic → https://frei-2.github.io/CTMusic/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
93. 早期帕金森语音检测为何难比较:用固定划分与多维度评估建立可复现基准
英文题目:A Benchmark for Early-stage Parkinson’s Disease Detection from Speech
标签:#语音生物标志物 #基准设计 #语音 #病理语音评估
评分:7.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#病理语音评估 | 主方法:#基准设计
👥 作者与机构
- Terry Yi Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Cristian Tejedor-Garcia:机构信息未能从会议 PDF 纯文本可靠映射
- Khiet Truong:机构信息未能从会议 PDF 纯文本可靠映射
- Janna Maas:机构信息未能从会议 PDF 纯文本可靠映射
- Louis ten Bosch:机构信息未能从会议 PDF 纯文本可靠映射
- Bastiaan R. Bloem:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向从语音检测早期帕金森病(Early Parkinson’s disease,EarlyPD)的二分类问题,输入为持续元音、双音节重复(diadochokinetic,DDK)、句子朗读录音,输出为早期患者与健康对照(healthy controls,HC)的判别分数,难点是早期征兆微弱且既有研究在数据集、语言、任务、评估协议与早期定义上均不可比。基准先以Hoehn和Yahr(Hoehn and Yahr,H&Y)分期小于等于2且确诊后时间(time after diagnosis,TAD)小于等于5年的双阈值筛选受试者,再固定说话人无关五折划分与性别平衡测试集,接着在三种单任务上比较四种训练资源配置与三类代表性模型,最后用受试者工作特征曲线下面积(area under the curve,AUC)选检查点、用验证集F1定阈值并冻结用于测试集,同时报告话语级与说话人聚合级结果。与既往单库单任务报道相比,关键差异是将完全可复现的开放轨道与允许私有数据增强的私有轨道分离,并统一预处理、谱图参数与早停规则,因而更贴近临床部署中的跨库泛化考量。在开放轨道DDK任务全阶段训练下可解释交叉注意力方法RECA-PD达到AUC 0.80、F1 0.73,为各任务块最优;句子朗读次之,持续元音最难。增加说话人多样性多提升AUC但F1因固定阈值跨库校准不良而持平,揭示判别力与校准分离。聚合多条话语通常提升AUC 0.01至0.11并缓解说话人内变异。结论仅适用于西班牙语朗读类任务与小样本早期队列,不能外推至自发语、多语言或大规模筛查。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/terryyizhongru/B-EarlyPD-Speech — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
94. 把同一词的不同发音切成同一串记号:wav2tok 2.0 的分阶段显式对齐
标签:#对比学习 #CTC #向量量化 #语音 #音频检索
评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#CTC
👥 作者与机构
- Adhiraj Banerjee:机构信息未能从会议 PDF 纯文本可靠映射
- Vipul Arora:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
示例查询语音术语检测需将不同说话人、不同时长的同一词例映射为可倒排检索的离散序列,难点是在说话人变化下保持词例级一致与局部时序结构。wav2tok 2.0采用两阶段解耦:第一阶段沿用BEST-STD骨干,以对比学习加向量量化学习说话人不变的帧表示并形成稳定码本。第二阶段以前阶段良好聚类为输入引入成对一致性约束,其中序列级分支将对方去重词元序列在己方帧后验下做禁用空白符的CTC边缘化,帧级分支沿DTW路径为每帧挑选跨视角最相似对齐帧的词元做分类,并以自适应权重平衡两项损失量级。相比BEST-STD仅靠隐式DTW正采样和通用分词器缺乏检索对齐目标,该方法把显式编辑距离保持变为可扩展的一阶监督。在LibriSpeech train-clean-100词内查询检索评测任务下,512码本wav2tok 2.0的MAP为0.86,高于wav2tok的MAP 0.80。该结论目前仅验证于英语朗读语音与二元组倒排加杰卡德(Jaccard)重排管线,对噪声、多语与长时档案的外推尚未验证。原文未披露推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/adhiraj69/wav2tok2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
95. 在儿童佩戴录音里分清谁在说话:用儿童中心数据预训练的 BabyHuBERT
标签:#自监督学习 #长音频处理 #多语言 #语音 #说话人分离标注
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:模型报告 | 主任务:#说话人分离标注 | 主方法:#自监督学习
👥 作者与机构
- Théo Charlot:机构信息未能从会议 PDF 纯文本可靠映射
- Tarek Kunze:机构信息未能从会议 PDF 纯文本可靠映射
- Maxime Poli:机构信息未能从会议 PDF 纯文本可靠映射
- Alejandrina Cristia:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Dupoux:机构信息未能从会议 PDF 纯文本可靠映射
- Marvin Lavechin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为儿童佩戴设备采集的全天自然录音,输出为关键儿童(Key Child, KCHI)、其他儿童(Other Children, OCH)、成年男性(Male Adult, MAL)、成年女性(Female Adult, FEM)四类的多标签时间切分,即语音类型分类(Voice Type Classification, VTC),等同于LENA定义的说话人切分,难点在于约80%非语音、碎片化重叠远场语音与儿童声学变异。方法先用已有PyanNet-VTC检测语音并补足合并为最长30秒的语音块以提供上下文,再以掩蔽预测(Masked Prediction)在大规模多语种儿童中心数据上预训练HuBERT(Hidden-Unit BERT, HuBERT)基座得到BabyHuBERT,接着在BabyTrain-2025上冻结卷积层微调Transformer并接入四个独立二分类头以支持重叠。与干净成人语音预训练的HuBERT及英语儿童预训练的W2V2-LL4300相比,关键差异在于域内多语种儿童数据与去噪特征启动的两轮聚类,更贴近真实采集噪声与儿童发声分布。在20小时ACLEW保留集上BabyHuBERT-VTC平均F1-score为66.9%,较Whisper-VTC提升13.3个百分点,较PyanNet-VTC提升16.0个百分点,与第二标注者的69.8%仅差2.9个百分点;在六语料测试集上为55.0%至76.1%。其适用边界在于单麦克风下他孩语音仍难区分、地址对象分类与音素识别等其他下游未验证。训练在32卡H100上两轮各约30小时,原文未披露推理时延与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/LAAC-LSCP/VTC — 链接可访问(HTTP 200)
- 模型相关资源:https://huggingface.co/MarvinLvn/BabyHuBERT — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
96. 把一步生成放在压缩隐空间:语义 Token 到波形如何又快又稳
英文题目:One-Step Token-to-Waveform Generation with MeanFlow in Latent Space
标签:#流匹配 #变分自编码器 #高效推理 #语音 #语音合成
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#流匹配
👥 作者与机构
- Zheqi Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Guangyan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Jingyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Haolin He:机构信息未能从会议 PDF 纯文本可靠映射
- Chunyat Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Yiwen Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Qiuqiang Kong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理语义令牌到波形Token-to-Waveform合成,输入为25 Hz语义令牌序列与192维说话人嵌入,输出为24 kHz波形,难点是语义令牌高度压缩且丢失声学细节,而交互与端侧场景又要求极低延迟。方法先训练轻量波形变分自编码器Variational Autoencoder,将语音压缩为与令牌同速率的低维潜序列并可确定性解码回波形,把一步生成约束在短序列上。接着训练条件一维扩散Transformer Diffusion Transformer,以均值流MeanFlow目标学习区间平均速度场,推理时从高斯噪声经单次前向得到生成潜序列。最后引入不增加推理代价的精修:冻结生成器只适配解码器,或端到端穿过单步采样联合优化生成器与解码器,用波形域重建加对抗损失缓解生成潜分布与编码潜分布失配。与需多步常微分方程Ordinary Differential Equation积分的流匹配基线不同,该方法以平均速度替代瞬时速度实现单步大步长更新,并将建模移入潜空间以缓解长波形序列的显存与不稳定问题。在LibriSpeech test-clean上,最佳配置140M生成器加24维潜加联合微调相对CosyVoice2 10步基线将端到端实时率Real-Time Factor从0.0775降至0.0046,约17倍加速,词错率Word Error Rate为3.41%,说话人相似度为0.932,UTMOS为3.64,平均意见分Mean Opinion Score为3.85。结论限于LibriTTS训练与相同语义分词器条件,跨语言、噪声与流式场景尚未验证,推理固定为1次生成器加1次解码器前向。
🔗 开源资源
- 代码相关资源:https://github.com/dzq84/meantok — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
97. 不只给真假标签:让人来教模型说出伪造在哪里
英文题目:Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning
标签:#数据集 #SFT #可解释性 #语音 #音频深度伪造检测
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音频深度伪造检测 | 主方法:#SFT
👥 作者与机构
- Artem Dvirniak:机构信息未能从会议 PDF 纯文本可靠映射
- Evgeny Kushnir:机构信息未能从会议 PDF 纯文本可靠映射
- Dmitrii Tarasov:机构信息未能从会议 PDF 纯文本可靠映射
- Artem Iudin:机构信息未能从会议 PDF 纯文本可靠映射
- Oleg Kiriukhin:机构信息未能从会议 PDF 纯文本可靠映射
- Mikhail Pautov:机构信息未能从会议 PDF 纯文本可靠映射
- Dmitrii Korzh:机构信息未能从会议 PDF 纯文本可靠映射
- Oleg Rogov:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音伪造检测的输入为待判语音波形,输出为真伪二分类及可理解依据,难点在于跨合成器与跨域分布偏移大且黑盒分数缺乏人类可感知线索。本文提出人类启发推理框架,先以41414条音频与124410条人工标注构建推理数据集并经Qwen-32B改写为思维链轨迹以提供监督信号,再用硬标签与思维链监督微调让大音频语言模型基于上述轨迹输出思考、伪造线索标签与答案三段结构,最后对该结构化输出以音频接地扰动与组相对策略优化强化声学依据。与仅输出硬标签的大音频模型相比,该链条把分类决策显式绑定到可听伪影描述与分类标签集合,提升了可审计性。在包含20000条语音的Test-1-HL上,SALMONN-7B硬标签模型达到94.5%准确率、88.6%平衡准确率、85.7% F1,推理模型Train-2-R达到93.6%准确率、89.6%平衡准确率、85.0% F1,均超过Wav2Vec2-AASIST基线的92.9%、84.0%、76.7%。该结论的适用边界受限于英俄混合及ASVspoof 5相关分布,对未见高保真商业合成器尚未验证且仍表现脆弱。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/dkorzh10/HIR-SDD — 链接可访问(HTTP 200)
- 数据相关资源:https://hf.co/datasets/marsianin500/HIR-SDD → https://huggingface.co/datasets/marsianin500/HIR-SDD — 暂时无法访问
- 第三方资源:https://github.com/i-celeste-aurora/m-ailabs-dataset — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
98. 深层说话人线索被稀释时,如何让专家选对人:GLAD 的全局局部动态路由
英文题目:GLAD: Global-Local Aware Dynamic Mixture-of-Experts for Multi-Talker ASR
标签:#混合专家模型 #端到端 #语音 #语音识别
评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#混合专家模型
👥 作者与机构
- Yujie Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaming Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhang Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Shiwan Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多说话人语音识别(Multi-Talker ASR,MTASR)需从单通道重叠语音中按时间顺序串行输出多人的转写文本,深层编码器中说话人声学特征被稀释导致传统局部路由难以区分身份是核心难点。该文提出全局局部感知动态混合专家(Global-Local Aware Dynamic Mixture-of-Experts,GLAD),先由卷积前端提取浅层特征并经全局线性编码器生成共享说话人上下文,再在每层由全局路由器和局部路由器分别计算专家分布,最后由帧级动态融合门控加权得到最终路由以驱动低秩专家选择。与显式双分支分离依赖固定结构不同,GLAD以共享全局表征引导每层低秩专家动态分工,并辅以负载均衡损失防止路由坍缩,从而在重叠率变化时自适应平衡身份线索与音素细节。消融显示去掉全局路由器与动态融合均会导致性能明显下降,证明全局说话人上下文对高重叠下身份区分至关重要。在LibriSpeechMix两说话人测试集上GLAD-SOT整体词错率达到6.8%,优于序列化输出训练(Serialized Output Training,SOT)基线的8.1%和跨说话人编码网络(Cross-Speaker Encoding Network,CSE)基线的7.3%。该结论主要在英文朗读模拟重叠和11个会话微调后的电话对话上验证,未证明对噪声、混响、语言切换和流式场景的外推能力。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/NKU-HLT/GLAD — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
99. 开放式助听器漏声难除:先用波束粗增强再让轻量网络同时抵消与修复
英文题目:ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids
标签:#助听器 #波束成形 #高效推理 #主动降噪 #语音增强
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#波束成形
👥 作者与机构
- De Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Xue Du:机构信息未能从会议 PDF 纯文本可靠映射
- Qingying Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Qintuya Si:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
开放耳助听器需从外部麦克风阵列混合声中恢复双耳目标语音并经扬声器播放,但通气孔泄漏会将外部噪声直接送入耳道并与播放信号干涉。所提主动双耳语音增强(active binaural speech enhancement,ABSE)框架先由双耳最小方差无失真响应(binaural minimum variance distortionless response,BMVDR)波束成形器做粗增强并保留空间线索,再将波束输出与参考麦克风信号拼接送入轻量神经网络。轻量网络经编码器提取隐特征、特征增强模块精炼谱时依赖与通道频时注意力、解码器映射回复数谱并经次级路径发声以抵消泄漏。与传统自适应有源控制方案不同,该推理阶段无需耳内误差麦克风。在合成双耳数据集上其感知语音质量(perceptual evaluation of speech quality,PESQ)达到3.626,超过重参数基线与传统联合滤波方法。该结论限于受控仿真方向、信噪比与头相关传输条件,存在方向失配与真实耳道差异时性能会下降。原文未披露训练时长与硬件配置,但报告了适用于耳戴设备的极低参数量与计算量水平。
🔗 开源资源
- 代码相关资源:https://github.com/Bream101/ABSE-NET — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
100. 在不训练的条件下把修改锁在时间片段里:FreeSonic 的时间感知解耦编辑
英文题目:FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing
标签:#注意力机制 #流匹配 #环境声 #音频生成
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频生成 | 主方法:#注意力机制
👥 作者与机构
- Yuxuan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Mingyang Han:机构信息未能从会议 PDF 纯文本可靠映射
- Yusheng Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Andong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Tianhong Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaxin Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Dongxiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoxiang Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Boyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Song:机构信息未能从会议 PDF 纯文本可靠映射
- Cheng Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Bo Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Weibei Dou:机构信息未能从会议 PDF 纯文本可靠映射
- Zehua Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Zhu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到音频编辑要求只改目标事件而保持背景不动,但声音的叠加性使全局条件生成极易污染非编辑区。FreeSonic基于TangoFlux构建免训练两阶段流水线:先用整流流(Rectified Flow,RF)反演将源音频潜变量映射为噪声并缓存源键值,在多模态扩散变换器(Multimodal Diffusion Transformer,MM-DiT)双块中聚合文本到音频注意力得到二值时序掩码,再在单块中做三阶段计划注意力解耦以约束修改范围,最后仅在掩码内注入任务导向噪声以打破源残留。三阶段解耦按早期特征混合、中间时序控制与后期保真推进,早期用调度系数插值源与目标键值并以掩码锁定非编辑区。与全局提示词驱动的扩散编辑不同,该方法以掩码显式分离源与目标键值特征并分阶段融合,兼顾时序一致性与背景保真。在自建AudioCaps与AudioSet Strong混合基准的替换任务上,FreeSonic的弗雷歇音频距离(Fréchet Audio Distance,FAD)为1.83,优于最强免训练基线ZETA的2.27,对比语言音频预训练(Contrastive Language-Audio Pretraining,CLAP)相似度为0.424同步领先。该结论限于10秒剪辑与增加、删除、替换三类任务,未验证长时、多事件重叠或强混响下的鲁棒性,原文未披露训练与部署成本。
🔗 开源资源
- 演示资源:https://free-sonic.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
101. 说什么和怎么说都要看:Whisper 声学与大模型语言特征的门控融合
标签:#语音生物标志物 #多模态学习 #大语言模型 #语音 #病理语音评估
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#多模态学习
👥 作者与机构
- Olivier Jiyoun Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Jonghyeon Park:机构信息未能从会议 PDF 纯文本可靠映射
- Myungwoo Oh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
阿尔茨海默病痴呆筛查需要从Cookie Theft图片描述语音中同时判断说什么与怎么说,输出为阿尔茨海默病患者(AD)与认知正常人(CN)的二分类标签,难点在于声学韵律异常与话语组织受损的互补线索难以联合建模。该方法先用语音基础模型Whisper large-v3编码器提取1280维帧级声学表征并经时序网络与注意力池化压缩为定长向量,再由解码器转写文本并经大语言模型GPT-5.2单次统一标注话题簇与语言质量等多维句子标签,随后在说话人层聚合为可解释特征并经前馈网络映射,最后由门控融合网络按样本自适应加权声学与语言向量并分类。与依赖人工信息单元与单模态建模的已有方法不同,该工作以模型自动构建的8类注意区层级话题分类替代手工编码,并保留统计非显著特征以利用多变量交互。在ADReSSo测试集71人上多模态F1-score达到90.14%,相对官方基线78.87%提升约11.27个百分点并优于单模态对照。在ADReSS测试集48人上F1-score为89.47%,相对官方基线75.00%提升约14.47个百分点。结论目前仅适用于英文Cookie Theft描述任务与ADReSS系列划分,在其他语言与诱发任务及纵向追踪上尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/vivivic/is26dementia — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
102. 去混响 U-Net 中间层为何按房间聚类:从隐式房间编码到显式条件注入
英文题目:Your U-Net Dereverberation Model is Secretly an RIR Encoder
标签:#对比学习 #扩散模型 #可解释性 #语音 #去混响
评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#去混响 | 主方法:#扩散模型
👥 作者与机构
- Sina Khanagha:机构信息未能从会议 PDF 纯文本可靠映射
- Timo Gerkmann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道盲去混响的输入为混响语音 y(t)=x(t)*h(t),输出为干净语音 x(t),实际难点在于房间冲激响应 h(t)非最小相位且未知,直接求逆不稳定,模型必须在无房间先验下盲估计反射延迟与衰减并抑制拖尾。作者先对判别式 NCSN++与扩散式 SGMSE+的注意力块特征做全局平均池化并用 t-SNE 可视化,发现簇在浅层微弱、向瓶颈与注意力块逐渐增强且按 RIR 可分,揭示 U-Net 深层隐式学到房间编码。接着离线以对比学习训练 RIR 编码器,将同一 RIR 污染不同语音拉近、同一语音经不同 RIR 污染推远,得到与内容无关的 256 维归一化嵌入,该嵌入进入下一步作为房间条件。然后将嵌入经层归一化与线性投影生成缩放平移参数,以特征线性调制注入 NCSN++各分辨率残差块并零初始化为恒等映射,再训练条件化去混响模型完成显式强化。相对隐式编码,该显式条件化使深层聚类更紧致可分并稳定早期优化,且须去掉指数滑动平均才能获益,实际意义在于将房间判别性与去混响性能直接关联。在 VCTK-Reverb 测试集下,Conformer 条件化模型的宽带 PESQ 为 2.89,高于 SGMSE+基线的宽带 PESQ 2.62。该结论适用边界受限于合成混响评估,仅用约 10K 真实 RIR 按 0.9/0.05/0.05 划分与 2 个测试说话人,尚未验证真实大房间、加噪联合退化与跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/sp-uhh/rir-encoder — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
103. 留住跨模态共有通道:面向气导骨导融合的 CCAP 结构化剪枝
标签:#多模态学习 #模型剪枝 #高效推理 #端侧运行 #语音增强
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#模型剪枝
👥 作者与机构
- Yeeun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yonghun Song:机构信息未能从会议 PDF 纯文本可靠映射
- Yunsik Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonyoung Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态语音增强(Multimodal Speech Enhancement)需同时利用含噪空气传导麦克风(Air-Conduction Microphone)信号与骨传导麦克风(Bone-Conduction Microphone)信号,难点在于非平稳噪声与双模态带宽尺度失配会扭曲融合表示并抬高可穿戴部署成本。本文提出跨模态一致性感知结构化剪枝(Cross-Modal Consistency-Aware Structured Pruning,CCAP),先将双通道输入分别做模态级零掩蔽,再以卷积通道输出的L1幅值相对多模态参考归一化得到双路敏感度。双路敏感度经等权平均形成通道重要性分数,低分通道被一次性结构化移除后统一微调恢复性能。与幅值剪枝和跨模态激活直接比较类方法的机制差异在于以缺失保持率代替幅值或差异度,从而保留双缺失下仍稳定的融合共享通道。在TAPS数据集80%剪枝率评测条件下,CCAP的Linear CKA分数为0.950,高于MANU的Linear CKA分数0.900。在Arm Cortex-M7上50%剪枝的LAU-Net将延迟降至87 ms,实时因子为0.29。结论限于韩语朗读语音加DNS噪声的双通道早期融合卷积结构,对自发语音与异构融合架构的外推尚未验证。
🔗 开源资源
- 代码相关资源:https://github.com/KYE-Postech/CCAP — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
104. 在编码器嵌入里同时去噪与识噪:FocalSE 的聚焦掩码与噪声分离
英文题目:Noisy Environment Adaptation of Neural Speech Codec via Focal Mask and Noise Feature Separation
标签:#Transformer #环境声 #语音 #音频分类 #语音增强
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#Transformer
👥 作者与机构
- Shaokai Li:机构信息未能从会议 PDF 纯文本可靠映射
- Weiping Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhong Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
神经语音编解码器(Neural Speech Codec,NSC)在真实噪声下重建质量急剧下降,本文输入带噪语音嵌入并输出增强语音波形与噪声类别,难点是低码率量化会放大噪声且低信噪比下干净与噪声成分高度混叠。所提焦点语音增强(Focal Speech Enhancement,FocalSE)先用焦点调制压缩解压缩加Transformer块生成焦点掩码并与带噪嵌入相乘得到增强嵌入,再用SEMamba滤波结果减去增强嵌入分离出噪声嵌入,最后将噪声嵌入送入ResNet1D-18做50类环境声分类以反哺分离。相比只学全局掩码的SECE与可变码率FD方法,该机制同时建模全局上下文与局部短时变化并显式监督噪声分支,形成去噪与分离的协同。在LibriTTS加ESC-50构建的噪声测试集上,6.0 kbps与-5 dB条件下FocalSE达到PESQ 2.116与SI-SDR 5.403 dB,超越次优基线FD-CBR的1.975与4.516 dB。结论仅在16 kHz英语朗读加50类环境声、-5 dB到10 dB与2.5 kbps到6.0 kbps范围内验证,未覆盖混响、丢包与多说话人等外推场景。推理时可裁剪噪声识别分支将参数从222 M降至159 M,但原文未披露延迟与吞吐实测。
🔗 开源资源
- 代码相关资源:https://github.com/shaokai1209/FocalSE — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
105. 不猜语义、先守住谐波:HFMSE 用显式结构先验约束流匹配生成
英文题目:HFMSE: Harmonic-Guided Speech Enhancement with Flow Matching
标签:#流匹配 #信号处理 #语音 #语音增强
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#流匹配
👥 作者与机构
- Jizhen Li:机构信息未能从会议 PDF 纯文本可靠映射
- Weiping Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Xinhong Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从加性噪声与混响中恢复目标干净语音,生成式方法的瓶颈在于条件不可靠:带噪浅层谱的谐波与共振峰结构破碎,而预训练语义模型在低信噪比下本身难以提取准确语义,形成循环依赖。该工作提出HFMSE,先将干净与带噪语音转为梅尔谱并对干净目标做随机掩码。再由谐波编码器经梅尔音高谐波转换矩阵完成基频软定位与谐波掩码估计,接着以掩码门控后的谐波特征与噪声上下文作为持久条件送入扩散Transformer驱动的流匹配模型学习速度场。最后由常微分方程求解器采样梅尔谱并经BigVGAN声码器合成波形。与把基频或谐波仅作后处理或辅助监督的做法不同,该工作用发声物理先验持续约束从噪声到干净语音的整条生成轨迹。在DNS Challenge 2020无混响集上其OVRL为3.485,超过FlowSE的3.451且说话人相似度为0.958高于FlowSE的0.940,有混响与真实录音集优势保持。该结论目前仅在该单基准与感知代理指标上验证,未覆盖强截断、丢包或多说话人等外推场景,原文未披露训练优化细节与推理成本。
🔗 开源资源
- 代码相关资源:https://github.com/xxnhq/HFSE — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
106. 不靠闭源模型抄答案:用同一模型自己生成推理过程的 Audio-Cogito
英文题目:Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
标签:#数据集 #数据集构建 #知识蒸馏 #音频问答
评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:模型报告 | 主任务:#音频问答 | 主方法:#知识蒸馏
👥 作者与机构
- Longhao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hongjie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zehan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Qihan Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Jie Li:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Yongxiang Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频推理以混合音频信号A与文本查询Q为输入,要求模型先输出逐步思维链C再给出最终答案R。其实际难点在于声学线索细微易误读、混合域干扰强且现有标注只有短标签或浅层推理。该工作提出四阶段Cogito-Pipe流水线:先聚合声音、语音、音乐三域及混合音频与元数据,再用约500道种子问题引导问答生成并构造难负例问答对。随后由同一思考模型在隐去答案条件下自由生成思维链,最后经问答一致性检查与法官模型双重过滤得到545k训练样本进入微调。与依赖Gemini等闭源模型的做法不同,本文用目标模型自身生成再微调以保持推理风格一致。基于Qwen3-Omni-Thinking 30B-A3B经LoRA单轮微调得到的Audio-Cogito在MMAR上平均准确率达71.7%,相对基座68.0%提升3.7个百分点,并在Sound-Music等混合域优势明显。该结论目前仅在MMAR单一基准及5次运行取中间3次均值的协议下验证,未在MMAU-Pro等基准验证泛化,原文未披露训练与推理成本、优化器与批量大小等复现细节。
🔗 开源资源
- 代码相关资源:https://github.com/llh666521/Audio-Cogito — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
107. 先洗掉风格再重上风格:StyleStream 如何做实时零样本音色口音情感转换
英文题目:StyleStream: Real-Time Zero-Shot Voice Style Conversion
标签:#流匹配 #实时处理 #流式处理 #零样本 #语音转换
评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:系统技术报告 | 主任务:#语音转换 | 主方法:#流匹配
👥 作者与机构
- Yisi Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Gopala Anumanchipalli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音风格转换以源语音与仅数秒目标参考为输入,输出保留语言内容但联合克隆目标音色口音情感的语音,难点在于内容风格解耦不彻底会导致源风格残留或内容损伤。StyleStream以三步非自回归链实现转换,解风格器Destylizer先从冻结HuBERT-Large-ASR表示经Conformer与有限标量量化瓶颈抽取去风格内容特征。其输出的量化前连续内容特征与目标梅尔频谱上下文及全局风格编码器提取的风格嵌入一并进入风格化器Stylizer,由扩散变换器经频谱修复生成目标风格梅尔频谱,最后由因果Vocos声码器合成波形。与Vevo纯自监督32码离散码本及CosyVoice 2.0的6561大码本语义码不同,该工作以文本监督加极小码本并使用量化前连续特征形成更窄瓶颈,从而减少风格泄露并保留可懂度。在StyleStream-Test基准下,StyleStream离线模型的WER为9.2%,低于Vevo的WER 17.5%。该结论适用边界受限于英语5秒参考与600ms分块,2秒短参考与200ms小分块构成失败条件,跨语种与长时流式外推尚未验证。推理开销与硬件延迟方面,单块NVIDIA RTX A6000上600ms分块平均处理耗时412.7ms,端到端延迟为1012.7ms,声码器训练成本为2块A6000上100k步。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
108. 缺模态又有噪声时,如何先学好可迁移的情绪表示再做分类
标签:#对比学习 #多任务学习 #预训练 #语音情感识别
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#对比学习
👥 作者与机构
- Junchen Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Jesin James:机构信息未能从会议 PDF 纯文本可靠映射
- Karan Nathwani:机构信息未能从会议 PDF 纯文本可靠映射
- Michael Witbrock:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态情感识别以语音、视频、文本为输入并输出情感或观点类别,难点是大规模情感标注稀缺,且真实情感库普遍存在模态缺失、噪声污染与跨采集条件不一致的问题。该方法先将Wav2Vec语音、MA-Net视频与DeBERTa文本特征经两层MLP投影到共享512维空间,再并行执行掩码重建以恢复缺失模态与加噪去噪重建以抵抗混合污染。重建后的原始特征进入6层交叉注意力与单层Transformer编码器构成的9嵌入融合,输出的融合表示再由动量对比编码器与动态负样本队列学习判别性表示,并用自适应损失缩放平衡多目标。与依赖文本锚点或复杂图聚合的前人方法不同,该框架以轻量注意力融合替代构图,以双重建缓解纯对比学习对损坏输入的脆弱性。在CMU-MOSEI评测下,MultiEmoVec的Acc-7准确率为55.31%,高于MGAFR基线的Acc-7准确率52.24%。其适用边界是结论主要受限于YouTube风格观点视频,向实验室双人交互数据的外推仅在IEMOCAP上有限验证且尚未验证跨库超越同库监督。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/MaoriEnglish-Codeswitch/MultiEmoVec — 链接可访问(HTTP 200)
- 模型相关资源:https://github.com/MaoriEnglish-Codeswitch/MultiEmoVec — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
109. 只给整句标签也要切出情绪起止:非对称原型度量如何压住中性背景
英文题目:P-SED : Asymmetric Prototype Metric Learning for Weakly Supervised Speech Emotion Diarization
标签:#对比学习 #弱监督学习 #语音 #语音情感识别
评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#对比学习
👥 作者与机构
- Yumeng Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yukun Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Lixu Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Nurmemet Yolwas:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感日记化(Speech Emotion Diarization,SED)要求仅用话语级弱标签从连续语音中输出帧级情感类别与起止边界,难点在于中性帧主导时长分布而情感事件稀疏局部,且缺乏帧级标注使模型易坍缩为全中性预测。P-SED先用WavLM提取声学特征并经投影头L2归一化到单位超球面,再以可学习情感原型(Emotion Prototype)为语义锚点计算温度缩放余弦相似度得到帧级logits。训练侧以类别感知原型对比损失(Class-aware Prototype Contrastive Loss,CPCL)区分中性包与情感包,并用Top-K显著实例挖掘对高置信帧施加间隔排序约束,辅以话语级分类分支与原型正交正则维持度量空间结构。推理侧对每类概率序列独立做全变分去噪(Total Variation Denoising,TVD),在抑制高频抖动的同时保留分段常数式陡峭边界。与已有方法相比,该工作将全局池化改为中性与情感的不对称建模加局部显著性约束,更符合情感连续成段的先验。在ZED数据集上以情感日记化错误率(Emotion Diarization Error Rate,EDER)为指标,P-SED结合TVD达到47.00%,相对最强弱监督基线FENT的54.37%明显降低。该结论目前仅在小规模会话测试集与四类情感设置下验证,对快速变化情感与开放类别的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/LiuYumeng-Lemon/P-SED — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
110. 直接读文本的语音大模型,为什么总读错多音字
英文题目:PolyBench: Benchmarking LLM-based TTS Systems for Chinese Polyphone Disambiguation
标签:#基准测试 #数据集 #基准设计 #文本到语音
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#基准设计
👥 作者与机构
- Chunhui Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Feifan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Liming Song:机构信息未能从会议 PDF 纯文本可靠映射
- YoonChoon Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Junkwang Oh:机构信息未能从会议 PDF 纯文本可靠映射
- Gunu Jho:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
中文大语言模型语音合成直接从原始文本生成波形,消歧隐含在语言模型内部,传统字形到音素模块的显式准确率与语音识别转写的字错率都无法可靠捕捉声调与拼音错误。作者构建PolyBench的方法链分为四步:基于第7版现代汉语词典在3500个一级通用规范汉字内提取高频多音字词并做规则过滤,接着用DeepSeek-V3.1按词典义项生成带拼音标注与类别标签的语境句,然后经母语者人工核验语义唯一性与标注正确性形成三个测试集,最后用大音频语言模型转写合成语音并抽取目标字拼音自动判分。与已有中文多音字数据集相比,关键差异在于从训练集转向覆盖494字与88词的评测专用设计,并引入长句多音与词级语境等对抗性协议,具有暴露端到端系统隐性错误的实际意义。在主测试集6016句上,最优系统FireRedTTS-2的多音字拼音准确率为82.02%,高于最强字形到音素模型G2PW的79.10%,但方言类仅42.17%左右。该结论仅适用于普通话标准读音与高频字,未验证生僻字、情感变调感叹词与跨句篇章消歧的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://github.com/Chunhui-Lu/PolyBench — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
111. 从听懂一句话到调对一串接口:Audio2Tool 如何逼出语音工具调用的真短板
英文题目:Audio2Tool: Speak, Call, Act - A Dataset for Benchmarking Speech Tool Use
标签:#基准测试 #数据集 #基准设计 #语音 #口语意图与槽位识别
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#口语意图与槽位识别 | 主方法:#基准设计
👥 作者与机构
- Ramit Pahwa:机构信息未能从会议 PDF 纯文本可靠映射
- Apoorva Beedu:机构信息未能从会议 PDF 纯文本可靠映射
- Parivesh Priye:机构信息未能从会议 PDF 纯文本可靠映射
- Rutu Gandhi:机构信息未能从会议 PDF 纯文本可靠映射
- Saloni Takawale:机构信息未能从会议 PDF 纯文本可靠映射
- Aruna Baijal:机构信息未能从会议 PDF 纯文本可靠映射
- Zengli Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音工具调用(Speech Tool Use)要求将原始音频直接映射为可执行应用程序接口(Application Programming Interface,API)调用,难点在于口音与噪声下的声学鲁棒性、参数精确抽取与多步依赖编排。本文构建约 30000 条查询的 Audio2Tool 基准,先以统一工具分类体系组织 152 个已验证函数与 23 个类别,再按 8 级复杂度生成语言查询并经大语言模型(Large Language Model,LLM)评审加人工核验,接着用零样本语音克隆(Zero-shot Voice Cloning)合成多说话人音频并混入车载与室内噪声。与已有语音语义理解(Spoken Language Understanding,SLU)基准相比,该设计以可执行结构正确性替代意图分类,并显式隔离多意图、隐式推理、长上下文干扰、纠错、多轮与多人混叠等失效模式。评测 15 个开源端到端语音大模型(SpeechLM)与 Whisper 加文本 LLM 级联管线显示,Qwen3-Omni 30B 在 Tier-1 直接命令工具准确率达 92.4%,但 Tier-4 隐式推理精确匹配(Exact Match,EM)仅 11.3%,Tier-7 多轮对话槽位 F1(Slot F1)仅 26.8%,且 Tier-7 与 Tier-8 上最强级联反而反超端到端。该结论限于合成语音与智能汽车(Smart Car)、智能家居(Smart Home)、可穿戴设备(Wearables)三领域封闭工具集,未验证真实录音、开放检索与安全关键拒止行为。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://audio2tool.github.io/ — 链接可访问(HTTP 200)
- 数据相关资源:https://audio2tool.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
112. 用冻结 CTC 编码器做草稿:语音大模型的自投机解码如何同时加速与纠偏
英文题目:Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
标签:#CTC #语音大模型 #高效推理 #语音 #语音识别
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#CTC
👥 作者与机构
- George Saon:机构信息未能从会议 PDF 纯文本可靠映射
- Samuel Thomas:机构信息未能从会议 PDF 纯文本可靠映射
- Takashi Fukuda:机构信息未能从会议 PDF 纯文本可靠映射
- Tohru Nagano:机构信息未能从会议 PDF 纯文本可靠映射
- Avihu Dekel:机构信息未能从会议 PDF 纯文本可靠映射
- Luis Lastras:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音感知大语言模型将声学编码器与文本大语言模型级联做转写,逐词元自回归解码成为速度瓶颈,且强语言先验易掩盖声学证据导致幻觉。该方法先以联结时序分类贪婪解码产生草稿并计算帧级熵,若熵低于阈值则直接放行高置信结果。否则将草稿送入大语言模型单次前向验证词元似然,仅接受全部似然高于阈值的假设。若验证失败则从首个低似然位置回退为自回归续写,以声学草稿前缀约束后续生成。相对外挂小草稿模型或多头并行预测,该机制复用冻结CTC编码器本身做非自回归草稿,以熵与似然双重松弛接受准则实现加速与系统组合纠错。在Open ASR基准下,所提双重验证方法的WER为5.58%,低于仅熵接受变体的WER 5.75%。该结论限于CTC训练且冻结编码器的SLM及转写任务,对低接受率语料加速有限,翻译与问答等任务尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
113. 给音频加刻度再做强化:TimePro-RL 如何让大音频语言模型卡准起止时间
标签:#提示学习 #强化学习 #音频大模型 #后训练 #音频事件检测
评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#强化学习
👥 作者与机构
- Yanfeng Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Pengfei Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Qing Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Nan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Lirong Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Ian McLoughlin:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大音频语言模型(Large Audio-Language Model,LALM)能理解音频语义,但难以精确推断查询事件的起始与结束时间:一是音频输入缺显式物理时间坐标,仅靠旋转位置编码(Rotary Position Embedding,RoPE)等难以建立语义与绝对时间的对应;二是监督微调(Supervised Fine-Tuning,SFT)的词元级交叉熵与时间对齐评测指标错位,对合理近似过度惩罚。该文提出 TimePro-RL 框架:先把时间戳词表扩展为可学习嵌入并按编码器帧率交错插入音频特征序列形成显式坐标,再用 SFT 教会模型利用邻域时间嵌入定位,随后在小子集上用分组相对策略优化(Group Relative Policy Optimization,GRPO)以后训练直接优化事件级 F1(Event-based F1,Eb-F1),并以连续辅助奖励的方差门控融合解决小分组下离散奖励区分度丧失。与已有时间标注数据构造和专用时间词元方法不同,差异在于把时间提示放在音频侧输入而非文本侧,并用强化学习(Reinforcement Learning,RL)解决离散指标不可微问题。在音频定位任务下,经TimePro-RL后训练的Qwen2.5-Omni的R@0.9为39.8,从SFT基线的R@0.9 34.1升至39.8。该结论目前仅在 30 秒内短音频、FTAR 与 DESED 受控划分上验证,对长音频、重叠事件与思维链推理的外推尚未验证。原文未披露训练、推理与部署成本,未提供代码与模型。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
114. 预训练量大也不灵:库拉尔枢纽揭示语音情感识别的类型学边界
英文题目:KuralHub: Exposing Typological Capability Frontiers in Multilingual Speech Emotion Recognition
标签:#基准测试 #基准设计 #多语言 #语音 #语音情感识别
评分:7.5/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音情感识别 | 主方法:#基准设计
👥 作者与机构
- Luxshan Thavarasa:机构信息未能从会议 PDF 纯文本可靠映射
- Jubeerathan Thevakumar:机构信息未能从会议 PDF 纯文本可靠映射
- Thanikan Sivatheepan:机构信息未能从会议 PDF 纯文本可靠映射
- Uthayasanker Thayasivam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从声学语音推断愤怒、幸福、悲伤、中性、恐惧等类别,难点在于跨语言韵律与发音差异大而低资源语料稀缺且采集条件不一。该工作依据Ethnologue前70种语言系统检索语料,保留至少包含3个目标情绪且每类不少于50条的33个公开数据集,覆盖29种语言并统一到5类核心情绪。随后冻结自监督学习编码器抽取表征,将其输入两层前馈分类头,仅训练分类头完成单语内划分评估。评测在保留测试集上计算准确率、精确率、召回率与F1-score,并区分宏平均与加权平均以应对类别不均。与以往聚焦高资源语言的评测不同,该工作把语言类型结构作为解释变量,用混合效应模型分离架构与数据集方差,形成可复用的多语言基准流程。在33个数据集基准下,wav2vec2-base的F1-score为0.58,高于wav2vec2-large-960h的F1-score 0.30。结论仅适用于冻结最后一层与单语监督头场景,未验证中间层与零样本跨语言迁移,原文本未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/aaivu/KuralHub — 链接可访问(HTTP 200)
- 代码相关资源:https://aaivu.github.io/KuralHub/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
115. 从混合梅尔谱直达干净梅尔谱:AV-FlowSep 如何用一步流匹配做视听目标说话人分离
英文题目:AV-FlowSep: Audio-Visual Target Speaker Separation via Flow Matching
标签:#流匹配 #Transformer #高效推理 #音视频 #音视频语音分离
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音视频语音分离 | 主方法:#流匹配
👥 作者与机构
- Pattara Tipaksorn:机构信息未能从会议 PDF 纯文本可靠映射
- Wayupuk Sommuang:机构信息未能从会议 PDF 纯文本可靠映射
- Kwanchiva Thangthai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频目标说话人分离需从含竞争说话人与环境噪声的混合波形中借助目标人脸视频恢复干净语音,难点在于声学歧义大且跨域泛化难。先由视觉时序编码器以人脸视频帧为输入抽取目标唇动与外观特征,输出视觉条件Fv,再将该Fv与混合梅尔谱My及插值梅尔谱一同输入基于DiT的向量场估计器,负责回归混合指向干净的直线位移并输出预测向量场,最后将该向量场经欧拉法求解常微分方程得到估计干净梅尔谱,并将其送入Vocos声码器重建为目标波形。与需多轮去噪的扩散式生成方法不同,该方法以最优传输条件流匹配直接回归混合指向干净的位移,理论上支持极少步采样并降低采样开销。在VoxCeleb2-AudioSet语音噪声场景评测下,AV-FlowSep的MCD为4.400,低于AVDiffuSS的MCD 12.761。该结论适用边界受限于双人混合与加性噪声英文口语,尚未验证多说话人、强混响与实时因果约束,基于全脸条件的身份捷径在跨域时仍会引发目标混淆。训练在NVIDIA A100硬件上以1000轮与批量8完成,模型以53.6M计算量与单步推理开销实现分离,但原文未报告推理延迟与吞吐实测。
🔗 开源资源
- 代码相关资源:https://github.com/CAI-NECTEC/AV-FlowSep — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
116. 先理解再预测:把掩码预测拆成两步能否保留离散目标又提升通用音频迁移
英文题目:BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations
标签:#自监督学习 #向量量化 #预训练 #音频分类
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#自监督学习
👥 作者与机构
- Ludovic Tuncay:机构信息未能从会议 PDF 纯文本可靠映射
- Étienne Labbé:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Pellegrini:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
通用音频表征需以冻结编码器同时服务语音、音乐与环境声的线性探测和大模型前端,而掩码预测常把上下文建模与掩码重建耦合在同一编码器中导致域间迁移失衡。该方法先将对数梅尔谱图切分为 \(16\\times 16\) 无重叠块并随机掩码,再用上下文编码器仅对未掩码块建模上下文,接着由轻量预测器结合掩码位置重建被掩码位置的离散目标,训练仅对掩码位置计算交叉熵。离散目标由冻结随机投影量化器生成并保持不变,上下文编码器输出进入预测器后经线性分类得到码本逻辑,职责分离使编码器专注通用上下文。与原 BEST-RQ 将掩码块保留在编码器输入端的做法不同,新流程在编码阶段丢弃掩码块并延迟重引入,从而解耦表征与预测职责。在XARES-LLM基准下,BEST-RQ-2的MoM得分为.41,高于BEST-RQ (ViT)的MoM得分.33。该结论限于 AudioSet 同切分小预算对照与冻结编码器评测,未验证大规模数据、微调及流式部署下的外推性。推理时丢弃预测器使推理开销与单阶段 ViT 基线相同,训练预算约为单张 H100 约 17 小时至 18 小时。
🔗 开源资源
- 代码相关资源:https://github.com/LudovicTuncay/audio-embeddings — 链接可访问(HTTP 200)
- 模型相关资源:https://huggingface.co/ltuncay/BEST-RQ-2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
117. 强基座不容覆盖:用稀疏贝叶斯适配把合成语码切换知识接进来
英文题目:Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR
标签:#LoRA #鲁棒性 #多语言 #语音 #语音识别
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- Enes Yavuz Ugan:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Waibel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
实际部署中输入为德英句内混杂语音,输出为跨语言转写文本,难点在于强多语言模型决策边界已接近最优,任何新分布微调都易覆盖旧知识,且形态融合型切换无法靠表面增广习得。该工作先用 GPT-4o 在温度 0.3 下按等价约束把德语矩阵句中单个词替换为英语嵌入词并施加德语形态屈折,再按 `§§...§§` 分隔符分段调用 XTTS-v2 多说话人合成后拼接,最后再用贝叶斯低秩适配 Bayesian Low-Rank Adaptation 与 BLoRA 在合成数据上适配 Whisper v3 turbo。BLoRA 对低秩矩阵 A 与 B 施加均值 0 方差 0.01 的高斯变分先验与 KL 正则,权重为 0.5,使增量显著稀疏化从而只改动切换相关权重。在 CSFleurs 上 BLoRA 246k 相对基线获得 5.31% 词错率 Word Error Rate 与 WER 相对下降与 21.63% 兴趣点错率 Point-of-Interest Error Rate 与 PIER 相对下降,最激进 5% 字符错率 Character Error Rate 与 CER 过滤下 1k 样本即达 17.85% PIER,对应 32.87% 相对下降,同时 CommonVoice 单语性能基本保持。结论仅在朗读域德英切换验证,对话、远场与口音等域外单语及弱语言对尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/enesyugan/continual-asr — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
118. 绝对打分与两两偏好为何要放在一个语音质量模型里学
英文题目:URGENT-MOS: Unified Multi-Metric and Preference Learning for Robust Speech Quality Assessment
标签:#数据集 #多任务学习 #鲁棒性 #语音 #语音质量评估
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#多任务学习
👥 作者与机构
- Wei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wangyou Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Chenda Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jiahe Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Samuele Cornell:机构信息未能从会议 PDF 纯文本可靠映射
- Marvin Sach:机构信息未能从会议 PDF 纯文本可靠映射
- Kohei Saijo:机构信息未能从会议 PDF 纯文本可靠映射
- Yihui Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhaoheng Ni:机构信息未能从会议 PDF 纯文本可靠映射
- Mengxiao Bi:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Fingscheidt:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
- Yanmin Qian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音质量评估需同时输出绝对质量分与成对偏好判断,但现有数据标注异构且跨域泛化差,难以兼顾多指标与人偏测试。URGENT-MOS 先用多分支预训练编码器提取并对齐波形表征,再由绝对指标预测模块按类别回归多维质量分,同时由自然度条件偏好模块对成对表征做交叉注意力比较得到偏好分,两路共享底层特征并容忍缺失标签联合训练。相比仅做单平均意见分回归或独立偏好建模,该设计以自然度表征约束偏好、以多指标互补正则绝对预测,并直接从绝对类别评分差值派生偏好监督从而复用大规模异构语料。该框架按自然度等类别组织多指标监督并容忍缺失标注,使异构语料能共同训练以提升跨域鲁棒性。在LIVETALK偏好测试任务下,F4C1M5Dref的准确率为0.85,高于UTMOS的准确率0.80。该结论限于语音合成与增强等已测域,细粒度难分样本与跨语种外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/vvwangvv/URGENT-MOS — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
119. 角色提示当弱标签:StanceBench 如何把人际立场变成可测的语音评测
英文题目:StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech
标签:#基准测试 #基准设计 #音频大模型 #语音 #语音属性识别
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#基准设计
👥 作者与机构
- Yuzhe Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Thebaud:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Jesús Villalba-Lopez:机构信息未能从会议 PDF 纯文本可靠映射
- Venkatesh Ravichandran:机构信息未能从会议 PDF 纯文本可靠映射
- Georgi Tinchev:机构信息未能从会议 PDF 纯文本可靠映射
- Najim Dehak:机构信息未能从会议 PDF 纯文本可靠映射
- Laureano Moro-Velázquez:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该基准输入为双人对话语音,输出为目标说话人在9个人际立场维度上的极性选择与置信度,难点在于立场依赖韵律与轮次语境且感知真值难以定义。流程先从Seamless Interaction语料固定种子抽取对话并把角色提示映射到正负极,其输出的角色极性标签进入片段构造步骤。接着构造无上下文单人声片段与有伙伴上下文的转向目标片段,其输出的待评音频进入法官评测步骤。然后由音频大语言模型法官在两种极性顺序下输出结构化JSON并聚合为会话分数以计算鲁棒性与可分性指标。与已有口语对话评测相比,该工作把评价对象从内容正确性转向社会意图,并显式分离输出可靠性与判别能力。在StanceBench基准任务下,Gemini在同情心维度S1的AUROC为0.96,高于其在权力取向维度S7的AUROC 0.86。结论仅适用于角色扮演的英语主导短对话与短片段证据,不支持稳定特质推断与长程互动外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/YuzheWangjhu/StanceBench — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/YuzheWangjhu/StanceBench — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
120. 不用聚类标签也能对上声脸:GMOD 以全局图挖潜正样本再做正交解耦
英文题目:GMOD: Voice-Face Association Learning via Graph Mining and Orthogonal Disentanglement
标签:#对比学习 #课程学习 #无监督学习 #音视频 #音频检索
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#对比学习
👥 作者与机构
- Jianrong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kaibin Bi:机构信息未能从会议 PDF 纯文本可靠映射
- Jinghui Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ju Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Qi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ying Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无监督音脸关联以语音片段与人脸图像为输入,输出跨模态身份相似度,难点在于同一说话人跨视频样本被实例对比误作负例而推远,以及语音与人脸模态私有属性污染共享身份空间。GMOD先用模态内正交解耦将输入映射为共享身份分支与私有噪声分支并以余弦正交与重构约束保持独立,再对解耦后特征做视频级平均池化构造全局跨模态相似图并以邻域由大到小的课程策略挖掘潜在正例,最后用双向多正例对比损失将挖掘集合拉近。与依赖聚类伪标签或粗粒度原型的方法不同,该框架用图流形局部结构替代刚性类别假设,并以正交与重构约束显式隔离模态私有信息,使表示聚焦可共享身份线索。在VoxCeleb1非性别约束验证任务上GMOD以AUC 87.73%超过最强无监督基线SL的87.02%,检索任务亦取得领先。该结论目前仅在VoxCeleb1英文YouTube场景得到验证,多语言与强姿态遮挡下的稳定性尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/BKB00001/GMOD — 链接可访问(HTTP 200)
- 模型相关资源:https://github.com/BKB00001/GMOD — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
121. 不用逐层试错:让自监督目标自己选出 Whisper 适配层
标签:#领域适应 #自监督学习 #低资源 #语音识别
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#领域适应
👥 作者与机构
- Zilai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Natarajan Balaji Shankar:机构信息未能从会议 PDF 纯文本可靠映射
- Mohan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Kaiyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Abeer Alwan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源儿童与方言语音识别输入为目标域语音、输出为文字转写,难点在于声学失配大而标注稀缺,直接微调易过拟合且固定中间层做自监督适配难以跨域通用。该工作先以冻结随机投影加码本在无标注语音上构造掩蔽预测目标,再用可学习对数几率加硬Gumbel-Softmax在每步离散选择编码器预测层并与同层教师表示做蒸馏约束,最后将适配后编码器与原解码器重组做少标注微调,前一步的动态表示选择直接决定后两步的优化信号与保留效果。相比固定层搜索与加权混合,其机制差异在于以直通估计实现单层硬路由,避免多抽象层级混合带来的梯度干扰并以温度退火实现先探索后利用。在MyST数据集上Whisper-medium全量微调取得8.21%词错误率,优于更大参数基线并显著优于直接微调。结论限于Whisper编码器解码器结构与英语儿童及非裔美国人语言变体,未验证噪声、远场、多语或语音大模型等外推场景。自监督适配在Whisper-small上约需1个GPU小时,远低于穷举搜索成本,原文未披露推理与部署开销。
🔗 开源资源
- 代码相关资源:https://github.com/Zilai-WANG/Gumbel_Beard — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
122. 不只判真假:FakeSound2 用定位、可追溯与泛化诊断声音伪造检测
英文题目:FakeSound2: A Benchmark for Explainable, Traceable, and Generalizable Deepfake Sound Detection
标签:#基准设计 #可解释性 #鲁棒性 #音频深度伪造检测 #音频事件检测
评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音频深度伪造检测 | 主方法:#基准设计
👥 作者与机构
- Zeyu Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Yaoyun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xuenan Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Yongkang Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Mengyue Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuexian Zou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
深度伪造声音检测的输入为通用音频片段,理想输出需同时回答是否伪造、何时伪造、如何篡改与源自何处,难点在于生成器快速迭代导致模型过拟合特定伪影,且相似操纵与同构架构在表征空间高度纠缠。本文构建FakeSound2基准,其方法链为事件定位先确定关键语义片段与掩码位置,元数据处理用大语言模型解析删增事件子句生成目标描述,音频操纵阶段按目标描述调用多生成器与规则脚本合成并拼接回放,最后仅对测试集用对比语言音频预训练相似度过滤保留高质量样本。与仅做片段级二分类的已有基准相比,该机制差异在于显式区分生成、编辑、内补、分离、拼接、添加共6种操纵类型与12种来源,并预设域内域外划分,使定位、可解释溯源与泛化可被独立度量。在域内与域外划分的评测下,基线在域外条件的操纵类型准确率为32.4%,低于域内条件的操纵类型准确率93.1%,暴露了能检出异常却说不清成因的溯源失效。该结论基于以 AudioCaps 为底座的通用声音场景,未验证纯语音伪造与音语音联合篡改。原文未披露训练推理成本与延迟吞吐。
🔗 开源资源
- 数据相关资源:https://zeyuxie29.github.io/FakeSound2/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
123. 用线性可逆变换把音色压掉:通用语音内容因子化的开集做法
标签:#信号处理 #零样本 #语音 #语音转换
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#信号处理
👥 作者与机构
- Henry Li Xinyuan:机构信息未能从会议 PDF 纯文本可靠映射
- Zexin Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Lin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Leibny Paola Garcia-Perera:机构信息未能从会议 PDF 纯文本可靠映射
- Berrak Sisman:机构信息未能从会议 PDF 纯文本可靠映射
- Sanjeev Khudanpur:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Andrews:机构信息未能从会议 PDF 纯文本可靠映射
- Matthew Wiesner:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音转换需以源语音为输入输出保留语言内容但替换为目标音色的语音,难点在于WavLM等自监督表征中内容与音色纠缠且目标仅有数秒语音时难以解耦。 先将40个说话人经kNN内容对齐后的WavLM特征堆叠为矩阵并做秩75截断奇异值分解,职责是分离共享内容子空间,输出通用内容基与奇异值结构。 再以该共享结构为输入用最小二乘学习与说话人无关的语音到内容映射W,职责是将任意WavLM帧投影去除音色,输出低维源内容向量,该向量直接作为下一步的输入。 最后以目标说话人约500帧即10秒语音为输入按闭式伪逆估计内容到语音矩阵Sm,职责是重建目标音色特征,将上一步源内容向量右乘目标Sm即输出目标音色语音,完成从共享空间到特定说话人的衔接。 相对kNN-VC与LinearVC需约8分钟目标语音做匹配或映射且无通用开集映射,USCF以可逆线性分解实现开集泛化,实际意义在于大幅降低目标数据需求并可直接作为TTS声学目标。 在LibriSpeech 20源乘5目标语音转换评测设置下,USCF W1的WER为2.70%,低于kNN-VC的WER 3.16%。 结论仅在英语朗读语音下验证,跨语言、噪声与强风格化尚未检验。 原文未披露训练、推理或部署成本
🔗 开源资源
- 代码相关资源:https://github.com/HSTEHSTEHSTE/uscf — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
124. 固定随机量化不够用时:用在线投影与蒸馏修伪标签
英文题目:Enhancing BEST-RQ Pseudo-Label Quality Through Online Refinement for Automatic Speech Recognition
标签:#知识蒸馏 #自监督学习 #向量量化 #预训练 #语音识别
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Jingjing Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Zijian Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Zeineldeen:机构信息未能从会议 PDF 纯文本可靠映射
- Eugen Beck:机构信息未能从会议 PDF 纯文本可靠映射
- Ralf Schlüter:机构信息未能从会议 PDF 纯文本可靠映射
- Hermann Ney:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音自监督学习需要从80维对数梅尔特征中生成离散伪标签以训练掩码预测模型,而BEST-RQ使用固定随机投影与码本导致目标区分性弱且对随机初始化高度敏感。该工作构建三步在线精化链条:先以增量主成分分析(Principal Component Analysis,PCA)替代随机投影以保留输入方差结构,其输出进入迭代码本精化模块按分配质心更新码向量,最后新增蒸馏码本学习中间层时序自相似结构并与主码本联合提供监督。与多随机码本集成和BiRQ相比,该方法以单码本对齐数据分布并引入高层语言线索,避免了多预测头的线性开销。在Librispeech 960小时预训练加100小时微调设置下,测试集test-other词错误率(Word Error Rate,WER)由10.1%降至8.8%,相对降低约12%。结论目前仅在Librispeech系列划分和Conformer编码器下验证,未证明对噪声、跨语言或大规模弱监督场景的外推能力。单码本精化几乎不增加耗时,而双码本蒸馏使单轮预训练由1.31小时增至1.56小时。
🔗 开源资源
- 代码相关资源:https://github.com/dnhkng/PCAonGPU — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
125. 用四元数耦合幅度与相位:QC-GAN 如何在 0.89M 参数下逼近全尺寸 Conformer 增强质量
英文题目:QC-GAN: A Parameter-Efficient Quaternion Conformer GAN for High-Fidelity Speech Enhancement
标签:#Conformer #生成对抗网络 #高效推理 #单通道 #语音增强
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#生成对抗网络
👥 作者与机构
- Shogo Yamauchi:机构信息未能从会议 PDF 纯文本可靠映射
- Hideaki Tamori:机构信息未能从会议 PDF 纯文本可靠映射
- Makoto Sakai:机构信息未能从会议 PDF 纯文本可靠映射
- Yosuke Yamano:机构信息未能从会议 PDF 纯文本可靠映射
- Tohru Nitta:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道语音增强需从含噪短时傅里叶变换(Short-Time Fourier Transform,STFT)中恢复干净波形,难点在于极小参数下同时重建幅度包络与相位连续性,否则易产生音乐噪声并拉低感知质量。所提四元数Conformer生成对抗网络(Quaternion Conformer GAN,QC-GAN)先将对数幅度差分、静态对数幅度与归一化相位余弦正弦拼成四元数输入,再经四元数编码器与两阶段四元数Conformer瓶颈建模局部谱纹与全局时频依赖,随后由幅度掩蔽与复数残差双分支合成增强谱,最后用度量判别器逼近感知分数以优化听感。与实值网络独立处理各通道不同,哈密顿积(Hamilton Product)以结构化权值共享实现旋转式耦合,把幅度相位当作统一实体变换。在VoiceBank+DEMAND上Base模型以0.89M参数取得感知语音质量评估(Perceptual Evaluation of Speech Quality,PESQ)3.48,超过1.83M参数的CMGAN的3.41并接近2.05M参数的MP-SENet的3.50;在DNS-Challenge 3盲测中整体质量亦领先同类基线。结论限于16 kHz非流式单通道增强与所测噪声分布,未验证多通道、流式与跨采样率外推。Tiny模型中央处理器(Central Processing Unit,CPU)实时率约0.89,虽满足实时门限但主要耗时集中于注意力瓶颈,部署裕量有限。
🔗 开源资源
- 代码相关资源:https://github.com/asahi-research/QC-GAN — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
126. 5 Hz 还能保真吗:U-Codec 用长依赖与深残差量化换取三倍合成速度
标签:#Transformer #向量量化 #高效推理 #语音编码 #文本到语音
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Xusheng Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Long Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Wenfu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Zixiang Wan:机构信息未能从会议 PDF 纯文本可靠映射
- Yushen Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shulin Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Meng Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Dong Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuexian Zou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为16 kHz波形,输出为可重建波形的离散语音标记与合成语音,难点在于每帧覆盖约200 ms时音素混叠与频谱细节丢失会同时恶化可懂度与音色。编码器先经五级残差卷积下采样得到5 Hz隐表示并由8层上下文Transformer建模帧间长程依赖,接着经因子化残差向量量化(Factorized Residual Vector Quantization,FRVQ)离散化后送入镜像解码器重建波形。合成阶段将每帧多层标记打包为补丁(patch),全局Transformer建模帧间演进并将隐状态送给局部Transformer逐层预测帧内标记。与高帧率编解码器相比,关键差异是用极低帧率压缩全局自回归步数,再以深层残差量化与层次解码补偿时间分辨率损失。在LibriSpeech test-clean共2620条的重建评测中,5 Hz与32层配置取得词错率(Word Error Rate,WER)3.44、可懂度(Short-Time Objective Intelligibility,STOI)0.93、宽带感知语音质量评估(Wideband Perceptual Evaluation of Speech Quality,PESQ WB)2.59、窄带PESQ NB 3.20、说话人相似度(Speaker Similarity,SPK-SIM)0.87,显著优于同等低帧率基线并接近部分高帧率系统。该结论目前仅在英文朗读语音的重建与零样本合成中验证,噪声、音乐、多语及长时对话外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://anonymous666-speech.github.io/CodecFormer_5Hz/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
127. 从成品语音反推后期链:VoxEffects 把六种效果的开关、预设与强度做成可核对监督
英文题目:VoxEffects: A Speech-Oriented Audio Effects Dataset and Benchmark
标签:#数据集 #基准设计 #鲁棒性 #语音 #音频分类
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准 | 主任务:#音频分类 | 主方法:#基准设计
👥 作者与机构
- Zhe Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yigitcan Özer:机构信息未能从会议 PDF 纯文本可靠映射
- Junichi Yamagishi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音音频特效识别以已制作波形为输入,输出6种后期效果的存在向量、2520类预设类别、生效数量与标量及向量强度,难点在于轻度质量型处理痕迹微弱且易被采集侧与平台侧噪声重采样与编解码退化掩盖。该方法先以洁净语音经降噪压缩均衡去齿音混响限幅固定链路与精选预设库进行离线合成与即时渲染,输出带精确多粒度标签的大规模可控样本进入模型训练。接着采用AudioMAE-Fx在共享表征上以多头方式联合优化存在多标签分类、预设分类、数量分类与强度回归,单次前向同时给出四类预测。最后将预测结果送入覆盖无退化与前后双侧退化的五种设置与跨语料协议,系统评估域内域外存在准确率、预设Top-1/Top-5准确率与强度平均绝对误差。与音乐特效识别不同,其关键机制差异在于面向语音广播质量范式并提供精确多粒度标签与双侧退化控制,因而更贴合真实分发链路的鲁棒性评测。在基准预设库设置下,EQ的预设数指标为7,高于LIM的预设数指标2。结论仅适用于Pedalboard单一实现栈与固定链路,连续参数与真实野外制作尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/nii-yamagishilab/VoxEffects — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
128. 去掉时间步还能增强语音吗:自洽整流流如何只看当前位置推断去噪方向
英文题目:Time-Unconditional Generative Speech Enhancement via Autonomous Rectified Flow
标签:#流匹配 #高效推理 #语音 #语音增强
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#流匹配
👥 作者与机构
- Wen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Wenbin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaofei Zhou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从含噪观测y中恢复干净语音x0,难点在于生成式方法常依赖显式时间步嵌入跟踪噪声尺度,在少步采样时易因轨迹偏离而失稳。本文先构造干净语音与含噪语音加随机扰动之间的直线插值路径x_t=(1-t)x0+t(y+σz),为自治建模提供端点锚定的传输轨迹;接着推导该路径下目标速度场恒等于底层噪声实现而与时间无关,将时变预测转为静态方向估计;然后用去除时间条件的时间无关网络直接从当前状态x_t与y预测静态去噪方向,并以均匀多步欧拉求解器反向积分实现增强。相比BBED与FlowSE等时间条件方法,该设计将非自治时变场改为自治定常场,避免对时间轨迹过拟合而更易少步稳定。在VoiceBank+DEMAND基准NFE=5评测设置下,ARFSE的PESQ为3.11,高于FlowSE的PESQ 3.05。该结论的适用边界受限于非混响训练分布,在DNS Challenge带混响场景下两类方法PESQ均跌至1.09附近,混响下泛化增益尚未验证。在推理开销方面,消融框架下ARFSE单步RTF为0.02,低于FlowSE的RTF 0.05。
🔗 开源资源
- 代码相关资源:https://github.com/zhangwen0821/ARFSE.git → https://github.com/zhangwen0821/ARFSE — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
129. 标签有噪声时让语音编辑站稳:RIVET 用幂等约束压住漂移
标签:#正则化 #鲁棒性 #语音 #语音编辑
评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编辑 | 主方法:#正则化
👥 作者与机构
- Dareen Alharthi:机构信息未能从会议 PDF 纯文本可靠映射
- Bhuvan Koduru:机构信息未能从会议 PDF 纯文本可靠映射
- Rita Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Bhiksha Ramakrishnan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音属性编辑需改变年龄或性别而保留说话人身份与语言内容,大规模语料中标签翻转与模糊会扭曲条件映射并导致反复编辑时身份漂移。RIVET将编辑建模为编码器与解码器构成的整体算子并要求满足幂等性,即重复编辑不再改变已落到目标流形上的结果,从而抑制噪声标签导致的漂移。第一步由ECAPA-TDNN提取说话人嵌入并由VITS语音编码器提取语音潜变量,为后继编辑提供解耦输入。第二步由条件归一化流在目标年龄性别向量下变换说话人嵌入得到编辑潜变量,第三步由VITS生成器以该嵌入为条件合成波形,并将重构语音重新送入双编码器,以面向停止梯度锚的均方误差约束编码一致。与直接约束波形及分离训练编辑模块的已有方法不同,该联合优化以编码一致作为幂等充分条件实现隐式正则,保持了重构质量与表达能力。在 GLOBE 训练的模型上,性别编辑准确率从同架构基线的 77.2% 提升至 85.9%,身份余弦相似度从 0.54 提升至 0.55,自然度 UTMOS 与可懂度 WER 基本持平;跨域到未见 EARS 时性别优势扩大但年龄准确率略降。结论目前仅在年龄、性别两属性及英语数据上验证,编码器固定等假设与正则强度选择尚未充分讨论,原文未披露训练与推理成本。
🔗 开源资源
- 代码相关资源:https://github.com/DareenHarthi/rivet — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
130. 自然语音也会幻觉:HALAS 用 3611 段财报电话揭示七个主流 ASR 的真实错误
英文题目:HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems
标签:#数据集 #数据标注 #语音 #语音识别
评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据标注
👥 作者与机构
- Mateusz Barański:机构信息未能从会议 PDF 纯文本可靠映射
- Jan Jasiński:机构信息未能从会议 PDF 纯文本可靠映射
- Julitta Bartolewska:机构信息未能从会议 PDF 纯文本可靠映射
- Marcin Witkowski:机构信息未能从会议 PDF 纯文本可靠映射
- Konrad Kowalczyk:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别(Automatic Speech Recognition,ASR)输入为真实自发财报录音,输出为转写文本,难点是幻觉(Hallucination)与普通语音错误交织,且在低词错率(Word Error Rate,WER)下依然出现。作者先用 7 模型平均模型间词错率筛选困难片段,再由双人独立标注加第三人仲裁完成幻觉、循环(Looping)与循环幻觉的跨度级标注并校正参考文本,接着用大语言模型(Large Language Model,LLM)五次投票估计严重度,最后按会议隔离划分训练与测试集并评测代理指标与解码器嵌入检测器。与以往在非语音或人工损坏语音上诱发幻觉不同,该链条保留自然语音错误模式并提供可复用检测基准。在 HALAS 上字符错率(Character Error Rate,CER)与语义代理分别达 81% 与 80% ROC-AUC(Receiver Operating Characteristic Area Under the Curve),单层解码器嵌入检测器 F1 为 53.1%,多层拼接提升至 56.1%,表明自然幻觉检测依然困难。该结论仅适用于英语财报领域经分歧富集的高难度短句,不反映真实部署幻觉发生率。原文未披露训练、推理与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/DSP-AGH/HALAS/tree/main — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/HumanSignal/label-studio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
131. 推理越长反而越不听音频:用结论语义把模型拉回声音
英文题目:Enhancing Audio Reasoning via Semantic Summary Prediction
标签:#正则化 #音频大模型 #零样本 #音频问答
评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#正则化
👥 作者与机构
- Francesco Bonzi:机构信息未能从会议 PDF 纯文本可靠映射
- Pooneh Mousavi:机构信息未能从会议 PDF 纯文本可靠映射
- Cem Subakan:机构信息未能从会议 PDF 纯文本可靠映射
- Mirco Ravanelli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型以音频与问题文本为输入并生成分步推理与结论,难点在于长思维链使注意力由声学输入漂向已生成语言词元而产生幻觉,形成显式推理反低于直接作答的推理鸿沟。先在音频提示之后、思维链之前插入寄存器令牌,以问题音频选择题上下文为输入承担前瞻锚点职责,输出一个仅关注上文且对后续不可见的潜状态,该潜状态随序列进入后续解码位置。再以结论段文本为输入经冻结句嵌入器提炼职责得到目标语义嵌入,将其作为下一步对齐监督信号,使上一步寄存器潜状态有明确语义终点可对齐。最后以寄存器末层隐状态与目标嵌入的余弦距离为输入承担语义筛职责,与交叉熵联合优化输出声学聚焦的模型参数,迫使早期自注意力过滤无关背景并锚定全局语义目标。与预测局部偏移的多令牌预测不同,该方法直接对齐终点语义而非中间片段,形成自上而下的语义筛以保证全局一致性。原文未提供可核对的关键定量结果。该结论适用边界受限于特定骨干与两套音频推理基准,尚未验证向高资源模型规模与开放声场景的外推,失败条件包括对齐权重过大时方差增大。推理开销上原文明确训练后丢弃寄存器与投影头且推理无需额外参数,计算量与标准微调解码保持一致。
🔗 开源资源
- 代码相关资源:https://github.com/FrancescoBonzi/SPARE — 链接可访问(HTTP 200)
- 演示资源:https://my-demo-hub.github.io/spare/ — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
132. 为南阿塞拜疆语建可用的语音识别:社区录音、转写外来语音与难例评测如何分工
标签:#基准测试 #数据集 #数据集构建 #低资源 #语音识别
评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据集构建
👥 作者与机构
- Farhan Farsi:机构信息未能从会议 PDF 纯文本可靠映射
- Shayan Bali:机构信息未能从会议 PDF 纯文本可靠映射
- Jalil Nourmohammadi Khiarak:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Hossein Aref:机构信息未能从会议 PDF 纯文本可靠映射
- Taher Akbari Saeed:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
南阿塞拜疆语自动语音识别需把语音转写为阿拉伯文字文本,难点是公开标注几乎为零、正字法不统一、同音异形字多,且现有Whisper未覆盖该语言、仅MMS-1B-All在预训练中包含却无公开基准。方法链第一步负责文本准备,对南阿塞拜疆语图书选文切分并做归一化以压缩词表歧义,其输出的规范句进入第二步作为朗读脚本。第二步负责社区采集,组织14名母语者用自有手机安静朗读配对录音构成25小时以上社区集,其音频文本对进入第四步作为微调训练源。第三步负责跨资源对齐与独立评测,将约25万条北阿塞拜疆语音由专家人工转写为阿拉伯文字南阿塞拜疆正字法构成外部集并与社区集联合训练,同时独立招募新说话人采集3021条约17.49小时更长更自发的AZB ASR GoldSet做困难评测,与直接混用北阿塞拜疆拉丁转写不同,该工作以文字层对齐保留声学内容并用八模型微调检验泛化。在 GoldSet 上社区集微调的 MMS 取得词错误率 63.0%与字错误率 18.0%,优于全部 Whisper 对照;全量社区加外部微调让 Whisper-Base 在 GoldSet 上从 84.0%降至 70.0%,但社区内测从 33.0%升至 49.0%。该结论仅适用于朗读为主、安静录制条件,对话、自发口音与长尾域外推尚未验证。原文未披露训练推理成本与解码超参数细节。
🔗 开源资源
- 代码相关资源:https://github.com/Kartalol/Kartalol-azb-asr — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
133. 一步转换很快,但内容编码器很慢:MeanVoiceFlow2 把两者一起蒸馏重训
标签:#知识蒸馏 #流匹配 #高效推理 #零样本 #语音转换
评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#知识蒸馏
👥 作者与机构
- Takuhiro Kaneko:机构信息未能从会议 PDF 纯文本可靠映射
- Hirokazu Kameoka:机构信息未能从会议 PDF 纯文本可靠映射
- Kou Tanaka:机构信息未能从会议 PDF 纯文本可靠映射
- Yuto Kondo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音转换需在无平行语料下保留源语言内容并替换为目标说话人音色,一步流模型MeanVoiceFlow虽免去多步采样,仍被固定重型内容编码器拖累推理。MeanVoiceFlow2分三步衔接:第一步用可训练轻量内容编码器替换固定重型编码器,与学生平均速度网络联合优化,其中转换蒸馏分支模仿教师在目标说话人条件下的平均速度,重建分支以源说话人条件和真实梅尔谱推导的真实速度为目标拉回真实分布。第二步将上一步学生输出与教师输出混合并加扩散扰动送入判别器做分布对齐以抑制均值模糊,重建分支同样对真实谱与重建谱做混合扩散判别,输出更真实的梅尔谱。第三步用教师在随机打乱说话人嵌入下生成的变说话人样本替换编码器输入做二次前向,隐式约束内容表示对说话人不变,再回流到前两步损失共同训练。在VCTK上8100组跨说话人句子评测中学生自然度主观分3.93超过教师3.76,相似度主观分2.70与教师2.74基本持平,实时率0.00084约为教师0.0072的1/9。LibriTTS上同样在UTMOS与DNSMOS Pro上优于教师。该结论适用边界受限于22.05 kHz 80维梅尔谱加HiFi-GAN V1管线与英语数据,口音转换与实时转换为尚未验证的未来工作。原文未披露训练硬件与时长,未提供代码权重链接,仅提供音频示例页。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
134. 把野外农事对话变成可用语料:模型先改、人类分三层把关
标签:#数据集 #数据标注 #低资源 #语音识别
评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据标注
👥 作者与机构
- Rishabh Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Dhruv Kudale:机构信息未能从会议 PDF 纯文本可靠映射
- Chriss Philip Saji:机构信息未能从会议 PDF 纯文本可靠映射
- Abhinav Painuli:机构信息未能从会议 PDF 纯文本可靠映射
- John Nirmal:机构信息未能从会议 PDF 纯文本可靠映射
- Ganesh Ramakrishnan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为YouTube采集的含环境噪声、多口音、中英混杂的印地语农业对话长音频,输出为可直接训练自动语音识别的词级转写语料KrishiVani。其实际难点在于方言变体、农业专有词、复合词切分与印英数字混写,且纯人工校对高达6-8倍实时成本。方法链为四阶段串行流水线VaniSetu:先以双语农业关键词表检索去重并归一化为16 kHz单声道WAV,再经语音活动检测、说话人分离标注、基线与域适应ASR转写加联接时序分类强制对齐生成可编辑基座。该基座先由配对数据微调的mT5-small做默认首遍纠错,再经标注者、验证者、核查者三级角色在增强版Vagyojaka界面完成编辑复核终审,并以总词数5%与2%阈值联动奖金控质量,其角色分离与激励联动较已有单遍校对更能兼顾吞吐与保真。在 2.5 小时测试集上 mT5 辅助流程相对全人工转写减少 61.1% 标注时间,95% 置信区间为
\[57\.4%,64\.8%\],p 小于 0.001,Cohen’s d 为 2.14,Krippendorff’s alpha 为 0.87,域内词错误率(Word Error Rate,WER)为 22.29%。结论限于印地语农业对话与该标注团队,跨语言跨领域与无激励众包尚未验证。原文未披露训练推理硬件与超参数。
🔗 开源资源
- 代码相关资源:https://github.com/ljn7/Vagyojaka — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/KrishiVaani/KrishiVaani — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
135. 内容—结构—流程三视角加门控融合:用图注意力捕捉阿尔茨海默病话语逻辑偏离
英文题目:Gated Multi-graph Fusion via Graph Attention Networks for Alzheimer’s Disease Detection
标签:#语音生物标志物 #图神经网络 #模型融合 #语音 #病理语音评估
评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#图神经网络
👥 作者与机构
- Jinyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xiao Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuqin Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaobao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Longbiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianwu Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为Cookie Theft图片描述任务的自发语音音频,输出为阿尔茨海默病Alzheimer’s Disease(AD)与健康对照Healthy Control(HC)的二分类标签,难点在于病理语言的非线性结构破坏与症状异质性。系统先用自动语音识别Automatic Speech Recognition(ASR)转写并用预训练BERT编码词节点,再并行构建语义、依存与基于点互信息Pointwise Mutual Information(PMI)的共现图以刻画内容、结构与话语流,随后各视图经图注意力网络Graph Attention Network(GAT)编码与均值池化得到全局向量,最后由门控网络按样本动态加权融合并经多层感知机Multi-Layer Perceptron(MLP)分类。与直接用文本嵌入分类或单依存图方法不同,该机制以健康人常模PMI量化叙事逻辑偏离,并以样本级门控应对句法崩溃与语义空洞等不同表型。在ADReSSo数据集过滤后测试集上该方法准确率达90.00%,高于复现的最强基线Cai et al.的84.29%。结论仅在英语图片描述任务与过滤后小样本上验证,未检验跨语言、自发对话与声学融合的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/opeacc/AD — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
136. 声音既是数据又是身份:为什么一次签字管不住合成语音的后用
英文题目:Rethinking Consent Acquisition for Voice Synthesis: from Static to Dynamic Consent
标签:#文献综述方法 #隐私保护 #理论分析 #语音 #语音克隆
评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.5/1.5 | 可复现 0.5/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音克隆 | 主方法:#文献综述方法
👥 作者与机构
- Matilde Nanni:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音克隆以可懂语音为输入并输出与源说话人高度可识别的合成语音,难点在于声音无法彻底去标识化且用途随时间演化,一次性授权难以覆盖后续身份关联风险。本文属理论研究,主要贡献形态为概念批判与治理方案论证,方法链分为三步:先以身份表征与识别理论刻画声音的社会维度,再以知情同意(Informed Consent)的范围界定检验通用与特定两类静态合同,最后移植生物伦理学的动态同意框架实现持续管控。与语音同意门等一次性技术校验相比,关键机制差异是从数据获取转向持续控制,同意范围可随新用途被细化、更新与撤回。原文未提供可核对的关键定量结果。该方案仅适用于可识别个体声音的受控部署系统,不适用于多说话人混合训练的大规模匿名化模型,也未验证大规模实施的可行性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
137. 在解耦表示上加噪声:用说话人差分隐私把匿名从经验分变成可证明下界
英文题目:DP-VOXLET: Provable Speaker Anonymization for Disentangled Speech Representations
标签:#形式化分析 #变分自编码器 #隐私保护 #语音 #说话人匿名化
评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#形式化分析
👥 作者与机构
- Ivoline Ngong:机构信息未能从会议 PDF 纯文本可靠映射
- Jack D’Iorio:机构信息未能从会议 PDF 纯文本可靠映射
- Hailey Schoppe:机构信息未能从会议 PDF 纯文本可靠映射
- Christopher Liberatore:机构信息未能从会议 PDF 纯文本可靠映射
- Nichole Schimanski:机构信息未能从会议 PDF 纯文本可靠映射
- Taisa Kushner:机构信息未能从会议 PDF 纯文本可靠映射
- Joseph P. Near:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是说话人匿名化(Speaker Anonymization),输入为原始语音波形,输出为保留语义内容与韵律但不可关联原说话人的波形,难点在于经验匿名易被半知情验证模型重新识别且缺乏最坏情况保证。方法链分为三步:首先由解耦编码器将语音拆分为说话人嵌入与语义内容表示,内容分支保持不变进入声码器;其次在低维隐空间对说话人嵌入做裁剪与高斯扰动以满足说话人差分隐私;最后经变分自编码器解码器映射回有效说话人嵌入并由语音转换解码器合成波形。与直接扰动全部特征或从固定池挑选目标说话人的启发式做法不同,该机制只扰动说话人因子并给出权衡函数下界,具有可组合的形式化语义。在2024语音隐私挑战赛Librispeech测试集与半知情攻击者下,OpenVoice基座在强扰动配置取得41.2%的等错误率与3.4%的词错误率,显著高于同类差分隐私工作的不足20%。该结论依赖内容分支无说话人泄漏的完美解耦假设,跨基座与跨语言外推尚未验证。原文未披露训练、推理或部署成本,声明未使用生成式AI辅助写作。
🔗 开源资源
- 代码相关资源:https://github.com/uvm-plaid/dpvc — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
138. 分数相似不等于听到的东西相同:三个 WavLM 检测器各自盯住了哪段声音
标签:#数据标注 #可解释性 #语音 #音频深度伪造检测
评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#数据标注
👥 作者与机构
- Vojtěch Staněk:机构信息未能从会议 PDF 纯文本可靠映射
- Veronika Jirmusová:机构信息未能从会议 PDF 纯文本可靠映射
- Anton Firc:机构信息未能从会议 PDF 纯文本可靠映射
- Kamil Malinka:机构信息未能从会议 PDF 纯文本可靠映射
- Jakub Reš:机构信息未能从会议 PDF 纯文本可靠映射
- Martin Perešíni:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
伪造语音检测器长期只输出真伪分数,无法说明证据位于信号何处与依赖何种声学线索,自监督前端主导后黑盒问题更突出。本文构建音频原生事后解释流水线:先以原始波形输入与伪造Logit为目标,对微调后WavLM帧表征做集成梯度归因,以训练集真品质心为基线并沿层与维度聚合为时间归因图。再由专家对高归因区做结构化语义标注,输出线索类型与局部性评分后进入定向掩膜因果验证。与依赖CAM或注意力可视化的已有方法不同,该机制以公理化积分为替代避免硬掩膜引入伪影,严格分离伪造偏离从而具备因果可验证性。在ASVspoof 5评测集下,SLS的EER错误率为3.98%,低于CA-MHFA的EER错误率5.26%。语义结论为AASIST偏非语音与环境异常、CA-MHFA偏局部音素与发音伪影、SLS偏词边界与频谱完整性,三者互补但共享重压缩失效。上述结论适用边界受限于ASVspoof 5与WavLM Base+联合微调体系,重压缩与YourTTS类攻击下失败条件集中暴露,原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Security-FIT/IG_for_SSL_detectors — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
139. 把转写风格当作可控开关:用词级时间激活逐字转写
标签:#提示学习 #跨语言 #零样本 #语音 #语音识别
评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#提示学习
👥 作者与机构
- Laurin Wagner:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
现代自动语音识别输入为含填充停顿重复截断的连续非流利语音,需同时输出逐字与意图两种文本及可靠词级定时,但异构标注把转写策略当作不受控隐变量,导致解码不稳定、评估混淆与定时无定义。该工作以Whisper-medium为基座,先用覆盖感知的解码器任务标签区分逐字与意图两种发射策略并稳定风格切换,再对筛选出的交叉注意力头施加词边界余弦监督以获得可训练对齐,最后以转写提示的verbatimize模式由意图文本重建规范逐字文本实现语料自举。相对无条件单策略模型与外挂强制对齐器,其差异在于将风格显式参数化并把定时与策略解耦,使输出稳定后再学对齐,从而兼顾内容保真与可控评测。在DisfluencySpeech与自建德语集上,英语训练的冻结嵌入模型德语事件F1从10%升至79%,全量微调达93.8%,非流利语音边界误差降至102 ms,优于Montreal Forced Aligner的142 ms与WhisperX的200 ms。该结论在德语近亲语言与会议口语域内验证充分,远距离语言与自然病理口吃外推尚未验证。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
140. 用稳定的到来方向代替说话人注册:在长会议中直接抽出目标语音
标签:#信号处理 #长音频处理 #麦克风阵列 #语音识别 #目标说话人提取
评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#信号处理
👥 作者与机构
- Yichi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Junzhe Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Wangjin Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Tatsuya Kawahara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
长形式多人对话的输入是麦克风阵列采集的远场混合语音,输出要求同时给出每个目标说话人的干净波形与可用于语音识别的 utterance 切分,难点在于说话人活动高度不均衡、重叠频繁且跨窗身份难以保持一致。本文提出位置感知目标说话人提取(Position-Aware Target Speaker Extraction,PATSE),以目标到达方向角(Direction of Arrival,DOA)为先验,先由多通道特征融合得到统一音频表征,再由空间编码器从耳间相位差与理论相位相似性中提炼目标空间特征,最后经特征调制注入分离主干并重建单目标波形,直接用语音活动检测(Voice Activity Detection,VAD)得到说话人活动而跳过显式分离标注(Diarization)。与连续语音分离(Continuous Speech Separation,CSS)的多输出加跨窗对齐机制不同,PATSE 每个目标独立单流输出从而天然避免串扰与排列歧义。在 LibriReplay-DOA 上 PATSE 预训练加微调后总体词错误率(Word Error Rate,WER)为 14.0%,相对最强 CSS 基线 32.8%大幅下降,在真实 TEIDAN 三人对话上也以 20.50%优于次优基线的 26.82%。该结论依赖说话人基本静止且到达方向角先验准确,对角度估计误差、说话人移动和 15°小夹角高重叠等困难条件的泛化尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/real-recordings/LibriReplay-DOA — 链接可访问(HTTP 200)
- 演示资源:https://exp-demos.github.io/PATSE-audio-demo → https://exp-demos.github.io/PATSE-audio-demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
141. 先保住小声说话,再统一音量:SE-AGCNet 把增强与增益放进一次联合优化
标签:#会议转录 #端到端学习 #语音 #语音增强
评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#端到端学习
👥 作者与机构
- Jinming Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Rao:机构信息未能从会议 PDF 纯文本可靠映射
- Xionghu Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
会议录音的输入是带噪声混响且音量起伏大的单通道波形,目标是输出干净且响度均衡的波形,难点在于先增益会放大噪声而先增强又易抹掉小音量语音。语音增强(Speech Enhancement,SE)先在时频域去噪并保留音量差异,其输出经均方根归一化后进入自动增益控制(Automatic Gain Control,AGC),经频域卷积与双向长短时记忆网络建模做响度均衡,最后用增强相位经逆短时傅里叶变换重建波形。两模块以非对称惩罚联合优化,SE重罚过抑制而AGC重罚静音区虚假能量,从而让SE敢于保留弱语音并把音量交给AGC。与已有级联做法的关键差异是双目标端到端协同而非独立串接,避免了噪声放大与弱语音丢失的恶性循环。在LibriAGC测试集下,SE-AGCNet的WER为6.88%,低于MP-SENet(SE)+pyagc的WER 7.09%。该结论目前仅在英语朗读仿真与两组真实会议远场数据上验证,未覆盖强混响多说话人重叠与在线低延迟条件。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://jinming00.github.io/SE-AGCNet/ — 链接可访问(HTTP 200)
- 演示资源:https://jinming00.github.io/SE-AGCNet/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
142. 标准注意力最准、高效注意力更快:语音情感识别中的精度与扩展性权衡
标签:#注意力机制 #模型比较 #高效推理 #语音 #语音情感识别
评分:7.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#注意力机制
👥 作者与机构
- Marc Casals-Salvador:机构信息未能从会议 PDF 纯文本可靠映射
- Federico Costa:机构信息未能从会议 PDF 纯文本可靠映射
- Rodolfo Zevallos:机构信息未能从会议 PDF 纯文本可靠映射
- Javier Hernando:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从长时语音波形与对应文本推断包括愤怒与中性在内的8类离散情绪,难点在于情绪线索稀疏非均匀且长序列使标准自注意力呈二次计算量。方法固定冻结语音编码器与BERT文本编码器并拼接声学语言序列,仅替换中间序列建模模块,其输出经注意力池化压缩为话语向量再送入分类器。与显式构造全对相似矩阵的标准自注意力不同,高效变体分别用带遗忘的保持记忆、加性递推、槽门控或维度级衰减压缩历史,将复杂度降为线性递推。这种差异的实际意义在于以固定维循环状态换取长音频可扩展性,避免存储全序列相似矩阵。在MSP-Podcast v2.0 Test1评测设置下,SA的Macro F-Score为36.42%,高于FoX的Macro F-Score 34.95%。图2显示高效变体序列模块的延迟与峰值显存随长度近似线性增长,避免了标准注意力的二次增长。结论边界在于评测仅覆盖英语播客自发语音与冻结编码器设置,未验证微调编码器、其他语种或噪声场景下的排序是否保持。效率结论仅针对序列模块而非包含重型编码器的端到端系统。该结论的适用边界受限于英语播客语料与冻结编码器条件,跨语种与噪声场景尚未验证。
🔗 开源资源
- 代码相关资源:https://github.com/marccasals98/AttentionAlternatives — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/fla-org/flash-linear-attention — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
143. 台语紧急意图为何难做:用戏剧字幕挖数据,再回到老人真实现场检验
英文题目:TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset with Scalable Data Mining In-the-Wild
标签:#数据集 #数据集构建 #低资源 #语音 #口语意图与槽位识别
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#口语意图与槽位识别 | 主方法:#数据集构建
👥 作者与机构
- Kai-Wei Chang:机构信息未能从会议 PDF 纯文本可靠映射
- Yi-Cheng Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Huang-Cheng Chou:机构信息未能从会议 PDF 纯文本可靠映射
- Wenze Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Yu-Han Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Yun-Shao Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Chien-Cheng Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan-Fu Liao:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
- James Glass:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以台语语音为输入预测8类家居与急救意图,难点在于台语缺少统一书写、高龄自发语音变异大且可靠自动语音识别缺失。方法链先用网页录制应用在安静房间采集情景诱发语料,再以华语字幕为枢轴做关键词匹配与大语言模型伪标注过滤得到训练段,最后用音视频编码器以英文意图描述检索无文本视频片段作为弱监督补充。与已有朗读或电视剧台语语料相比,该设计以情景与可选生成式视频刺激诱发重复、片段化与紧急发声,更贴近真实求助。仅用野外挖掘数据直接迁移至真实高龄语音时性能严重退化并接近随机,证实了戏剧语音与真实求助之间存在显著域失配。在Taigi-adapt 8分类任务下,WavLM-base-plus的准确率为90.21%,高于HuBERT-base的准确率90.10%。结论仅适用于安静室内高龄台湾腔急救家居场景,对噪声、年轻口音与全球闽南变体尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://kwchang.org/taigispeech → https://kwchang.org/taigispeech/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
144. 百万小时立体声如何爬来:YODAS v3 的语言均衡与真带宽验证
英文题目:YODAS v3: Over 1 Million Hours of High-Bandwidth, Stereophonic, Multilingual Speech
标签:#数据集 #数据集构建 #多通道 #多语言 #语音识别
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.3/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据集构建
👥 作者与机构
- William Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shinnosuke Takamichi:机构信息未能从会议 PDF 纯文本可靠映射
- Sayaka Shiota:机构信息未能从会议 PDF 纯文本可靠映射
- Satoru Fukayama:机构信息未能从会议 PDF 纯文本可靠映射
- Samuele Cornell:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理开放语音语料规模不足与低保真问题,输入为 YouTube 知识共享 (Creative Commons) 视频,输出为 48 kHz 多声道 Opus 音频及带话语级时间戳的原始语言转写与英语翻译,难点在于低资源语言召回不足与标称采样率虚高。首先按语言独立构建维基关键词表并经单轮子词 (unigram) 似然过滤以提升检索相关性,接着限定知识共享许可并偏置新上传视频进行二次检索去重,最后以最高可用质量下载多声道音频与人工或自动字幕形成弱监督。与以往统一多语言关键词表加 16 kHz 或 24 kHz 单声道分发相比,该链路保留原始频带与声道结构并纠正高资源语言偏置,具有可验证的均衡效果。支撑结论的定量结果为在自建 YODAS v3 子集上 48 kHz 描述符分离编解码器 (Descript Audio Codec, DAC) 重建短时客观可懂度 (Short-Time Objective Intelligibility, STOI) 达 0.94,说话人相似度达 0.90,优于同测试集上 LibriTTS 24 kHz 基线的 0.80 和 0.78。该结论仅适用于网络采集的弱标注通用音频,未验证录音棚级对齐质量与极低资源语言转写可靠性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
145. 相位还是纹理:双耳掩蔽释放检验空间音频基础模型的相位编码
英文题目:Spectro-Temporal Interference Confounds Phase Encoding in Spatial Audio Foundation Models
标签:#基准设计 #模型评估 #可解释性 #空间音频信号 #声源定位
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#声源定位 | 主方法:#基准设计
👥 作者与机构
- Yuxuan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyuan Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Peize He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
空间音频基础模型在声源定位等宏观任务上表现优异,但是否真正编码微秒级双耳相位精细结构仍存疑,难点在于定位成功可能来自包络捷径而非跨通道相位计算。本文构建基于双耳掩蔽级差(binaural masking level difference, BMLD)的心理声学探针,先以比特级共享噪声合成同相与反相检测条件并提取冻结嵌入距离比,再引入均衡抵消(equalization cancellation, EC)解析上限与广义互相关相位变换(generalized cross correlation with phase transform, GCC-PHAT)物理对照,最后施加高通滤波与能量均衡及精细结构声码化逐级证伪。与已有方向估计基准只测几何误差不同,该设计将相位敏感性与频谱纹理敏感性显式分离,从而揭示通用双耳模型依赖包络纹理而非真正跨通道计算的混淆机制。在500 Hz与-14 dB评测条件下,专用双耳模型Spatial-AST的BMLD增益指标为+6.8 dB,低于EC基线的BMLD增益指标+15.7 dB。该结论仅适用于冻结表示的低频同相噪声检测范式,向混响语音与多声源推广尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
146. 只调文本不够:用三段式声学调制补上音频编码器的少样本适配
英文题目:Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models
标签:#提示学习 #音频大模型 #少样本 #音频分类
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#提示学习
👥 作者与机构
- Hyebin Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Jaehyuk Jang:机构信息未能从会议 PDF 纯文本可靠映射
- Changick Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Joon Son Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频语言模型在少样本音频分类中输入为音频波形与类别文本模板,输出为余弦相似度最高的类别,难点在于音频域偏移大而音频编码器被冻结导致跨模态对齐受限。该方法在冻结的对比语言音频预训练层次化音频变换器音频编码器与冻结的文本编码器基础上,引入音频侧提示学习:先在对数梅尔频谱后做频带级仿射调制以校准能量分布与录制条件,其输出经分块嵌入后在通道维做令牌级调制以衔接卷积局部特征与注意力全局机制,再在首个滑动窗口变换器块后做结构级调制以稳定早期特征,三路调制与文本侧提示联合优化。与仅调文本的提示学习相比,关键差异在于全类共享的极轻量连续音频提示直接改变声学感知,而非迫使文本适配冻结音频。在11个数据集平均的16样本设置下,结合提示仿射调制学习的扩展配置相对该基线top-1准确率从77.86%提升至79.26%,绝对增益1.40个百分点。该结论限于对比语言音频预训练架构与2至16样本区间,在1样本时曾出现过拟合下滑。原文未披露训练时长与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/hyebin-c/aspl — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
147. 背景音太多时关键词为何被淹没:拆开熵目标再做适应的 ImKWS
英文题目:ImKWS: Test-Time Adaptation for Keyword Spotting with Class Imbalance
标签:#测试时自适应 #鲁棒性 #语音 #关键词检测
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#测试时自适应
👥 作者与机构
- Hanyu Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaheng Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
关键词检测需从连续音频中检出极少数关键词并抑制频繁背景音,噪声引发分布偏移时决策边界易偏向多数类而漏检关键词。ImKWS先经两阶段样本选择过滤高熵与伪标签不一致样本,其筛选输出进入解耦熵最小化与多视角一致性联合优化,再仅更新归一化仿射参数完成单遍测试时自适应。其中解耦熵最小化将标准熵拆为奖励分支与带系数惩罚分支以节制非目标 logit下压,多视角一致性则以对称交叉熵约束原样本与时频掩码增强视图预测一致以平滑梯度。与AdaKWS一味最小化熵不同,其关键差异在于显式抑制多数类过自信而保留少数关键词敏感性。在MS-SNSD环境噪声1:8评测设置下,ImKWS的Macro F1为69.91%,高于去除DEM变体的Macro F1 68.39%。该结论目前仅在 12 类转 4 类的重采样孤立词加噪上验证,未检验连续语音流、开放关键词与说话人变化下的外推能力。适配过程为单遍、批量 128、仅更新批量归一化层,原文未披露训练、推理或部署成本的完整量化数据。
🔗 开源资源
- 代码相关资源:https://github.com/dhyzy123/ImKWS — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
148. 平均安全不等于人人安全:近五千说话人的重识别风险为何随攻击者与匿名器而变
英文题目:A Large-Scale Per-Speaker Analysis of Re-identification Risk in Speech Anonymization
标签:#评测协议 #隐私保护 #说话人匿名化 #说话人验证
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#评测协议
👥 作者与机构
- Orane Dufour:机构信息未能从会议 PDF 纯文本可靠映射
- Paul Magron:机构信息未能从会议 PDF 纯文本可靠映射
- Mickael Rouvier:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Vincent:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音匿名化(speech anonymization)的输入是原始语音,输出是保留语言内容但剥离说话人身份的语音,难点是平均等错误率会掩盖个体层面的高可重识别风险。本文在半知情攻击下构建逐说话人可链接性(linkability)评估链:先用匿名器重写训练与测试语音并训练攻击用说话人验证模型,再按注册人数与会话长度抽样计算余弦相似度下的链接成功率,最后按分位数划分易链接与难链接名单并跨配置比较重叠度。与已有小规模分组偏置分析不同,该机制直接由攻击行为驱动且覆盖多匿名器与多攻击架构,因而能分离说话人、匿名器与攻击者的交互效应。在CommonVoice 11.0英文测试集与2种匿名器、3种攻击器、3种会话长度组合下,持续易链接者仅5人而持续难链接者为166人,任一单因素变化的平均Jaccard相似度均未超过0.47。结论仅适用于所测匿名器与攻击器组合及英文朗读类语音,未验证自发对话、跨语言或未知攻击下的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/OraneD/Speaker-Linkability — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
149. 把大模型放进搜索中途:LightBeam 以 10 GB 内存重做 CTC 解码
英文题目:Lightbeam: An Accurate and Memory-Efficient CTC Decoder for Speech Neuroprostheses
标签:#CTC #大语言模型 #高效推理 #脑信号 #言语神经解码
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#言语神经解码 | 主方法:#CTC
👥 作者与机构
- Ebrahim Feghhi:机构信息未能从会议 PDF 纯文本可靠映射
- Junlin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Nima Hadidi:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Kao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向构音障碍患者的言语神经假体需将大脑皮层运动区神经活动转写为文本,输入为颅内电极记录的阈值放电计数与放电波段功率特征,输出为词序列,难点在于神经数据量小而连时分类(Connectionist Temporal Classification,CTC)音素编码器高度依赖外部语言模型。所提LightBeam先将编码器对数概率经声学缩放展开为束搜索候选,再经向量化词典掩码与阈值剪枝保留合法音素扩展,随后在词边界处用小型N元文法做浅融合维护同音词正交束,最后按固定时间间隔用微调大语言模型(Large Language Model,LLM)做延迟融合替换N元分数并在句尾做标点校正。与仅在终点调用大模型的WFST基线相比,关键差异是将LLM引入首遍解码从而可用小文法替代大文法图。在基线门控循环单元(Gated Recurrent Unit,GRU)编码器下,Brain-to-Text 2025公开集词错率(Word Error Rate,WER)降至5.77%,显著优于原始基线的6.67%。该结论限于两名ALS被试的朗读提示语料与受限句式分布,长对话与新被试外推尚未验证。解码峰值内存由约320 GB降至约10 GB,实时率保持在1以下,适合本地部署。代码与补充材料经Zenodo开源。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
150. 跨被试听觉注意解码为何难泛化:DisenEEG-Net 用正交分解与信息瓶颈拆开任务与被试特征
标签:#助听器 #对抗训练 #Transformer #脑信号 #言语神经解码
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#言语神经解码 | 主方法:#对抗训练
👥 作者与机构
- Tasleem Kausar:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan Liao:机构信息未能从会议 PDF 纯文本可靠映射
- Haoqi Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Siqi Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Haizhou Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨被试听觉注意解码(Auditory Attention Decoding,AAD)需从原始脑电(Electroencephalogram,EEG)波形判断被试注意左侧还是右侧竞争语音,其难点在于个体解剖与认知差异导致的域偏移使被试不变特征难以提取。所提DisenEEG-Net先用并行时空Transformer编码器分别提炼时间与空间上下文并融合成共享隐变量,再经可学习矩阵正交投影切分为任务码与被试码,随后以前者接注意分类与梯度反转域对抗、以后者接受益充分性与信息瓶颈约束,最后将两码拼接送入解码器重构以保持信息完整。与仅做域对抗或图卷积建模的已有方法不同,该框架显式要求两子空间正交互补并用充分瓶颈保留被试信息的同时挤出任务泄漏。在KUL数据集1秒窗口留一被试交叉验证下,任务码达到75.9%的准确率,超出最强基线DARNet约6.0个百分点。该结论仅适用于短窗二选一方向判别与实验室采集条件,未验证长时连续注意追踪、真实混响噪声与听损人群的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/hello1233-maker/DisenEEG-Net — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
151. 词中塞音为何变弱:用强度曲线的函数主成分统一度量九种语言的延续弱化
英文题目:Cross-linguistic word-medial stop lenition: A Functional PCA approach
标签:#统计分析 #语音学与音系 #韵律 #多语言 #语音属性识别
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Seung Suk Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Morgan Sonderegger:机构信息未能从会议 PDF 纯文本可靠映射
- Meghan Clayards:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为九语言大规模对齐语料中的元音间塞音序列/V1CV2/,输出为词中相对词首是否更弱化的判定,难点在于弱化同时体现为时长缩短与强度凹陷变浅且跨语言实现方式不一。先从/V1CV2/切段中提取强度包络并归一化得到可比强度轮廓,再将该轮廓输入跨语言混合函数主成分分析以分离凹陷大小与过渡陡峭度并输出第一主成分权重作为弱化度量,最后将该权重与对数时长共同输入贝叶斯混合效应回归以在控制语速与音段协变量下估计词中相对词首的差异。与以往依赖极值点查找凹陷深度或斜率的方法相比,该机制无需定位极小值因而保留极端弱化甚至近似擦除的token,避免丢弃最值得关注的弱化样本。原文未提供可核对的关键定量结果。浊塞音在多数语言中同时呈现更短时长与更浅强度凹陷的定性趋势支持连续性弱化假设,但结论适用边界受限于词首与词中音节首的读出与自发语料对比,尚未验证更大韵律层级与听者利用该线索的因果链。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://doi.org/10.17605/OSF.IO/CE65H → https://osf.io/ce65h/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
152. 先抓语义再补声音:GenTSE 用两段生成缓解自回归提取的错位
英文题目:GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model
标签:#自回归模型 #偏好优化 #向量量化 #语音 #目标说话人提取
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#自回归模型
👥 作者与机构
- Haoyang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xuyi Zhuang:机构信息未能从会议 PDF 纯文本可靠映射
- Azmat Adnan:机构信息未能从会议 PDF 纯文本可靠映射
- Ye Ni:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Rao:机构信息未能从会议 PDF 纯文本可靠映射
- Shreyas Gopal:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
- Boon Siew Han:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanjin Zheng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
目标说话人提取需依据参考语音从双人混合语音中恢复目标说话人波形,难点在于内容、音色与细粒度声学结构在高熵离散空间中耦合建模困难,且自回归推理易偏离训练分布。GenTSE第一步由语义提取语言模型以WavLM连续嵌入为条件生成目标语义令牌,保留说话人相关连续上下文并输出粗粒度语义序列。第二步声学生成语言模型以该语义序列加DAC连续嵌入为条件生成单码本SimCodec声学令牌,再由SimCodec解码器重建波形,实现由粗到细的生成。第三步用冻结语言模型条件将冻结检查点产生的预测历史作为训练条件以缓解暴露偏置,再用直接偏好优化向高UTMOS样本对齐感知质量。与离散提示和单阶段编解码建模不同,全程保持可生成解码并保留连续上下文,但其验证仍受限于干净混合条件。在 Libri2Mix 干净测试集上相对最强生成基线 Metis 将 UTMOS 从 3.882 提升至 4.296,SECS 达 0.928,dWER 为 0.177,SpeechBERT 为 0.920。结论目前仅限干净双人混合英文朗读场景,未验证噪声、混响、目标缺席与跨库泛化,未披露参数量、延迟与人类主观听测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
153. 同一段语音换一句要求就换答案:INSPIRE 把检索从相似度改为听指令
英文题目:INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval
标签:#基准设计 #模型比较 #语音 #音频检索
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频检索 | 主方法:#基准设计
👥 作者与机构
- Chen-An Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
指令感知语音检索以语音查询与自然语言指令为输入,从语音库中按指令动态定义的语义、说话人、风格与环境标准排序输出相关文档,难点在于同一查询需切换相关性维度并联合理解语言内容与副语言声学线索。该基准构建分三步:先从对话、朗读、表现力与合成语音汇集四类语料并定义延续、说话人、风格与多属性组合等检索意图,再用大模型生成多样化指令并随机配对形成数千组查询指令对,最后以硬负例与排除集控制正例稀疏性并统一用召回率评估四类检索范式。对比固定相似度检索,关键机制差异在于指令条件化评分函数显式决定何种相似优先,而非单一声纹或语义相似。以DailyTalk语义延续为例,指令感知文本嵌入Qwen3-Embedding-8B的R@10达62.00%,明显高于语音自监督WavLM-Large的16.50%,但在VCTK说话人任务上后者以17.50%反超前者的1.88%,暴露语义与声学难以兼顾。结论仅适用于英语朗读与对话及受控合成环境,多属性组合召回仍低于12%,跨语言、真实噪声与长时对话外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
154. 把多人混叠压成师生二元标签:用未标注课堂音频做域适应的教师-学生 diarization
英文题目:Role-Aware Semi-Supervised Domain Adaptation for Teacher-Student Speaker Diarization
标签:#教育 #数据集 #领域适应 #半监督学习 #说话人分离标注
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#半监督学习
👥 作者与机构
- Zhen Liao:机构信息未能从会议 PDF 纯文本可靠映射
- Gaole Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Weiwei Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Mengting Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
真实教室场景的说话人分离标注(Speaker Diarization)需从远场混响音频输出教师(Teacher)与学生(Student)两类角色的时间边界,难点在于教师主导下的短促高频学生轮转、3.44%的角色重叠以及细粒度身份标签缺失造成的多对一映射。该方法先用大规模通用数据预训练DSE-CBM分割模型以获得声学先验,再以均值教师(Mean Teacher)结构用标注与未标注课堂数据联合微调,其中学生模型接受强增强而教师模型提供指数滑动平均伪标签,最后经ECAPA-TDNN提取嵌入并做层次聚类得到长时角色轨迹。与固定通道的排列不变训练不同,角色感知联合损失(Role-Aware Union Loss)将学生标签建模为剩余通道预测的逻辑或,并用最大值近似实现赢者通吃梯度,从而诱发通道专业化。在TSSD测试集上该组合将日记错误率(Diarization Error Rate,DER,collar 0s)从监督微调基线的21.42%降至16.95%,其中混淆误差由6.23%降至2.53%,collar 0.25s下为12.67%。该结论目前仅在普通话教室数据与4通道假设下验证,对多教师、语言迁移与长时漂移尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/lz-hust/TSSD — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/lz-hust/TSSD — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
155. 听不清就别硬猜:用想象出参照、用抽取出干净信号再判
英文题目:RAISE: Resolving Ambiguity in Audio Understanding with Imagination and Selective Extraction
标签:#检索增强 #音频大模型 #音频生成 #音频问答 #音频分离
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#检索增强
👥 作者与机构
- Yueqian Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Qinsi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yudong Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Hancheng Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Hai Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yiran Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为原始音频`x`、文本问题`q`与候选项集`C`,输出为选项预测,难点在于重叠声掩蔽目标与相似音色缺乏可比参照,使单遍解码只能猜测。语义路由仅依据文本判断比较还是分离需求,分流至直接回答、想象或提取路径,前者输出直接进入上下文推理而后两者先实例化证据再推理。听觉想象先由音频大模型做候选校验生成可发声提示,再用Stable Audio Open合成参照集`Z`,将原音频与参照拼接做相对判别。选择性提取先由模型生成目标声物理描述,再调用SAM-Audio得到干净波形`x’`后重新判定。与内置思考链不同,该框架把验证外置为可听证据而非潜表示自我修正,将绝对分类转为相对判别以降低感知负荷。在MMAR基准下,关于准确率等指标原文未提供可核对的关键定量结果。其结论适用边界受限于支持多音频输入的Qwen系模型与两类推理基准,抽象语义任务增益有限且强制套用工具会剥离有用上下文构成失败条件,工具路径显著增加推理开销而直接路径仅引入路由延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
156. 多意图车舱语音理解为何难测:MAC-SLU 用真实指令与统一评测拉开上下文学习和微调的差距
英文题目:MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark
标签:#智能座舱 #数据集 #基准设计 #语音 #口语意图与槽位识别
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#口语意图与槽位识别 | 主方法:#基准设计
👥 作者与机构
- Yuezhang Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Chonghao Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Ziang Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Sheng Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Hua Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Sheng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Qiguang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Kele Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Libo Qin:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语意图与槽位识别需从车载语音输入抽取意图分类与槽位填充结构,难点在于多意图交叠、细粒度槽定义与语音识别误差传导。作者先以20000余条真实车载转写文本为输入,负责脱敏与弱标注以生成训练验证集,输出带噪声弱标注语料。再以上一步输出中筛选的测试文本为输入,负责人工清洗并用CosyVoice-2合成普通话语音以隔离说话人,输出文本与语音对齐的评测输入。最后以上一步对齐的评测输入为输入,负责统一提示格式与评测协议并对比大语言模型与大音频语言模型在零样本、上下文学习、监督微调及流水线与端到端下的表现,输出公平比较结果。与仅用连词拼接构造多意图的已有数据集不同,该基准提供原生复杂多意图与拒识样本,更贴近座舱调用。在MAC-SLU测试集评测下,Qwen3-8B文本输入的总体准确率为60.73%,高于Paraformer+Qwen3-8B流水线的总体准确率47.18%。该结论限于中文座舱单轮短指令与合成语音条件,未验证真实噪声、多口音及多轮对话外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Gatsby-web/MAC_SLU — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
157. 老年语音为何让编解码器伪造检测失效:多模态表示与分布对齐的补位
英文题目:Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake
标签:#数据集 #模型融合 #公平性 #多语言 #音频深度伪造检测
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频深度伪造检测 | 主方法:#模型融合
👥 作者与机构
- Orchid Chetia Phukan:机构信息未能从会议 PDF 纯文本可靠映射
- Girish:机构信息未能从会议 PDF 纯文本可靠映射
- Mohd Mujtaba Akhtar:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
老年语音深度伪造检测需要区分真实老年语音与经神经音频编解码器(Neural Audio Codec,NAC)编解码重建的合成语音,难点在于老年人气息声增强与基频不稳等声学偏移会让在年轻语音上训练的检测器失效并带来诈骗隐患。该工作先用公开老年语料构建覆盖多种编解码器配置的英汉双语老年伪造数据集,再冻结多模态与语音基础模型抽取音频表征并比较下游检测性能,最后提出融合框架对齐双路表征并联合优化分类与对齐目标。与直接拼接或单模型相比,该框架用对称有界散度约束不同预训练分布进入一致空间,从而更稳定地利用互补信息并抑制分布失配带来的融合退化。在老年测试集上最佳融合平均等错误率(Equal Error Rate,EER)达到1.66%,明显优于单模型与已有基线。该结论目前仅限于编解码重建式伪造与英汉老年语料,未验证文本到语音或变声生成的跨攻击泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://helixometry.github.io/ElderlyCodecFake/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
158. 克隆声音时,抑郁和情绪的信号还剩多少:复述式克隆的保留与跨语言增广
标签:#数据增强 #跨语言 #语音情感识别 #病理语音评估 #语音克隆
评分:7.3/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#数据增强
👥 作者与机构
- Roseline Polle:机构信息未能从会议 PDF 纯文本可靠映射
- Owen Parsons:机构信息未能从会议 PDF 纯文本可靠映射
- George Fairs:机构信息未能从会议 PDF 纯文本可靠映射
- Luis Miguel San Martin Fernandez:机构信息未能从会议 PDF 纯文本可靠映射
- Cole Looney:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoliang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandra Livia Georgescu:机构信息未能从会议 PDF 纯文本可靠映射
- Stefano Goria:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床语音输入为短时录音,输出为抑郁与焦虑二分类标签,难点在于标注昂贵且非英语资源稀缺。方法链分四步:先用Whisper转写并截断为可克隆片段,再以复述或固定文本为条件调用8种开源克隆模型生成平行语音,接着用WavLM Large嵌入加逻辑回归构建统一分类器,最后比较真实与克隆训练测试下的曲线下面积与跨语言迁移收益。与以往只测词错率和说话人相似度的做法不同,该文直接度量任务可分性保留,并用固定文本剥离语义以分离副语言信号。在VCTK口音分类任务下,Zonos的AUC指标为0.995,高于Real基线的AUC指标0.957。英语克隆日语训练在真实日语测试上显著超越原始英语直接迁移,表明克隆语音可作为低资源语言的有效增强来源。结论目前仅适用于复述式克隆与英到日这一语对,噪声场景与强迁移基线下的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
159. 连续扩散语音语言模型仍沿幂律走:损失可预测,语言性可测,长连贯仍缺席
英文题目:Scaling Properties of Continuous Diffusion Spoken Language Models
标签:#扩散模型 #预训练 #语音 #语音合成
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#扩散模型
👥 作者与机构
- Jason Ramapuram:机构信息未能从会议 PDF 纯文本可靠映射
- Eeshan Gunesh Dhekane:机构信息未能从会议 PDF 纯文本可靠映射
- Amitis Shidani:机构信息未能从会议 PDF 纯文本可靠映射
- Dan Busbridge:机构信息未能从会议 PDF 纯文本可靠映射
- Bogdan Mazoure:机构信息未能从会议 PDF 纯文本可靠映射
- Zijin Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Russ Webb:机构信息未能从会议 PDF 纯文本可靠映射
- Tatiana Likhomanenko:机构信息未能从会议 PDF 纯文本可靠映射
- Navdeep Jaitly:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无文本口语语言模型需以80Hz连续对数梅尔滤波器组为输入并延续生成语音,帧率相对文本约20倍导致序列极长,且扩散模型缺乏可分解似然难以做语言性排序。管线先将24kHz长对话波形重采样并提取80维对数梅尔滤波器组,切分为上下文与待生成延续,为条件建模提供定长声学输入。接着多模态扩散变换器以两路语音流替代原文文本图像流,用速度参数化与最小信噪比加权去噪损失学习条件速度场,并以零信号作无条件分支避免额外无条件训练以节省计算量。然后将采样滤波器组经声码器合成波形,再经通用音素识别器抽取音素序列并统计真实与生成数据的音素n元经验分布差异,以音素散度完成模型无关评估。相对离散自回归量化的信息瓶颈,该连续扩散路线保留声学细节并将感知质量与语言分布评估解耦,使扩展规律可直接在波形层面验证。在等算力扫描验证集评测下,测试拟合的平均相对误差为0.80%,高于训练拟合的平均相对误差0.49%。外推结论的适用边界受限于当前函数形式与有限算力范围,多数感知指标快速饱和至真实基线正负标准差内,部分按现有形式在任意算力下不可达真实基线。更大上下文与感知器下采样至4096 token及千万小时级训练带来显著计算量,长程连贯仍未解决且尚未验证更大算力下的外推有效性。
🔗 开源资源
- 代码相关资源:https://github.com/apple/ml-diffuslm → https://github.com/apple-aiml-research/ml-diffuslm — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/xinjli/allosaurus — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
160. 角色对不上、坏片段没人管:AuDirector 用选角加审片闭环做长音频故事
英文题目:AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
标签:#模型融合 #环境声 #音乐 #语音 #音频生成
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#音频生成 | 主方法:#模型融合
👥 作者与机构
- Yiming Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Wen Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Baoxiang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xuenan Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为用户提示词`Puser`,输出为融合对白语音、音效与背景音乐的长时沉浸式叙事音频,难点在于多角色音色一致性、情感韵律控制与长程声景协调。管线先由导演智能体解析对话脚本与角色画像并生成7维情感指令,再经选角智能体粗到细检索320样本音色库完成配音。接着声学生产智能体分层合成语音与非语音轨道,评论智能体打分审计并触发定向再生,最后混音智能体合成初版并由交互智能体按自然语言反馈局部改写制作脚本。与WavJourney和PodAgent的开环调度相比,该工作以脚本驱动选角加审计再生闭环替代粗元数据选音与一次性生成。在100个播客与广播剧场景上,全系统内容享受度(CE)6.46、制作质量(PQ)7.59、语音角色匹配(VRM)4.23、情感MOS 4.17,均领先基线并保持制作复杂度与实用性平衡。结论限于短篇扩展故事与受控音色库,未验证更长篇幅、多说话人重叠与高密度混叠定位下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Riddae/AuDirector — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/XiaomiMiMo/MiMo-Audio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
161. 短句训练的注意力解码器为何在长音频上失序:边界线索、位置编码与长编码训练
英文题目:Segmental Attention Decoding With Long Form Acoustic Encodings
标签:#注意力机制 #CTC #长音频处理 #语音识别
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#注意力机制
👥 作者与机构
- Pawel Swietojanski:机构信息未能从会议 PDF 纯文本可靠映射
- Xinwei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Mingbin Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Takaaki Hori:机构信息未能从会议 PDF 纯文本可靠映射
- Dogan Can:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaodan Zhuang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为连续长录音声学特征,输出为逐段文本,难点是基于注意力编码器解码器在短分段训练时偷用边界上下文缺失做位置锚点,在长编码上因全部编码具备完整上下文而丧失排序能力,表现为重复输出与无法结束。方法先在交叉注意力键值上注入按解码段重置的绝对位置编码,为排序提供显式时间基准,其输出的带序长编码进入下一步训练分布矫正。再用声学上下文扩展构造无边界的长编码训练样本并拼接连续分段以覆盖多样的段长与长编码分布,迫使解码器放弃边界捷径并适应长分布。接着用连通时间分类头预测语义边界标签来触发第二遍注意力解码,使推理切分与训练分布对齐,实现直接在长编码子序列上自回归解码。与依赖固定窗重算或仅做重打分的历史做法不同,该机制无需重构边界即可利用长上下文连续性,具有实际部署意义。在TED-LIUM3长语音评测设置下,声学上下文扩展模型的WER为40.3%,低于基线模型的WER 295%。适用边界限于因果Conformer编码与英语长语音评测,段间上下文连续性尚未利用,跨语言与噪声重叠外推未验证。原文未披露训练硬件、完整超参数与时延吞吐实测成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
162. 英语大模型做印度语语音:直接微调为何胜过继续混入英语
标签:#迁移学习 #低资源 #多语言 #零样本 #文本到语音
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#文本到语音 | 主方法:#迁移学习
👥 作者与机构
- Praveen Srinivasa Varadhan:机构信息未能从会议 PDF 纯文本可靠映射
- Srija Anand:机构信息未能从会议 PDF 纯文本可靠映射
- Siddhartha Soma:机构信息未能从会议 PDF 纯文本可靠映射
- Mitesh M Khapra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为印度多语种原生字符文本与短时参考语音,输出为保留音色与风格的 24 kHz 合成语音,难点是在不足英语预训练 2% 数据量下复现英语级自然度与涌现能力。方法链分四步:先扩展 685 个原生字符并从英语嵌入随机采样初始化以免建 grapheme-to-phoneme(字形到音素,G2P),再以近 10 万小时英语 F5-TTS 检查点在 1417 小时 IN11 数据上直接微调,随后以每语言 1、10、100 小时固定 150K 步检验规模效应,最后借文字共享的亲属语言音色跨语合成加母语者校验冷启动零资源语言。与持续混合等量英语数据的常规做法相比,直接微调避免高资源分布牵引。在 1100 条 IN11-Test-Set 上直接微调总体自然度 73.4,显著高于混合策略 66.2 与从零训练 43.2;在 Rasa 官方 8 语种集上以 80.5 进入优秀区间,超 VoiceCraft 7.5 分,WER 19.2 接近人类录音 18.4。结论仅适用于已见文字体系且经人工筛选场景,对无共享文字语言与全自动扩展尚未验证。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
163. 说话人线索混进来源证据时,如何把二者拆开再做验证
标签:#对比学习 #评测协议 #语音 #音频深度伪造检测 #音频指纹
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频指纹 | 主方法:#对比学习
👥 作者与机构
- Xi Xuan:机构信息未能从会议 PDF 纯文本可靠映射
- Wenxin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Williams:机构信息未能从会议 PDF 纯文本可靠映射
- Ville Hautamäki:机构信息未能从会议 PDF 纯文本可靠映射
- Tomi H. Kinnunen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造源验证需判断两段合成语音是否来自同一生成器,难点是合成痕迹与说话人特质在嵌入空间高度纠缠,易导致依赖说话人线索的捷径学习。先以输入语音为输入,由可训练源编码器提取源嵌入并送入分类器构造角间隔logit,职责是建立源判别基础,输出源分类分数。再以上一步的源嵌入与冻结ReDimNet-B6从同一语音提取的说话人嵌入为共同输入,计算纠缠度量并以解耦系数加权形成惩罚项,职责是约束源编码器远离说话人线索,输出回流更新源编码器的梯度信号。最后将上述惩罚项二选一实例化:切比雪夫路径以K阶多项式和替代角间隔并对非目标logit加阈值化内积惩罚以稳定梯度,黎曼路径经指数映射投影到曲率c庞加莱球并用双曲距离构造惩罚分类,两者输出均作为惩罚项进入上一步训练循环,测试时只用更新后源编码器的源嵌入做余弦打分。在MLAAD基准四协议评测设置下,ECAPA-TDNN搭配RiemannSD-AAM在未见源异说话人协议上的EER为9.06% (±0.27),低于AAM-Softmax基线的EER 11.56% (±0.35)。适用边界受限于MLAAD多语言合成语料与伪说话人标签场景,跨库与真实说话人条件尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/xxuan-acoustics/RiemannSD-Net — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
164. 只用一句 Hi Pandora 做注册:唤醒词目标语音抽取为何听感上去了识别却掉下来
标签:#评测协议 #模型比较 #目标说话人提取 #语音唤醒
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#目标说话人提取 | 主方法:#评测协议
👥 作者与机构
- Yiming Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Guangyong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haixin Guan:机构信息未能从会议 PDF 纯文本可靠映射
- Yanhua Long:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
目标说话人提取 Target Speech Extraction / TSE 在本工作中输入为含唤醒词的连续单通道流经关键词检测 Keyword Spotting / KWS 切分后的唤醒片段加后续查询混合,输出为目标查询干净语音,难点是注册仅约1.0秒且本身被电视综艺噪声、节目人声与房间内干扰人声污染。关键词检测先从连续交互流中切分出唤醒片段与后续查询混合,其切分输出的污染唤醒片段直接作为短时注册线索送入后续环节。零样本语音合成 Zero-Shot Text to Speech / ZS-TTS再以该污染唤醒为声学提示重建干净注册文本语音,其合成输出通过干净重合成替代或拼接扩充增强原注册,并条件驱动判别式与生成式提取主干完成目标提取。与依赖预录多秒干净注册的传统范式相比,差异在于把交互固有瞬态信号变为注册源并用合成语音去污而非要求用户配合。在FarNoise-10场景下,CIE-mDPTNet以原始噪声唤醒为注册的词错误率Word Error Rate / WER为4.54%,低于以xTTS干净重合成Clean Re-synthesis / CR为注册的词错误率Word Error Rate / WER 6.41%。该结论仅适用于中文唤醒词 Hi Pandora 与 Hello Cube、单通道近远场电视干扰场景,未验证英文、开放域噪声与多麦克风外推,尚待验证的外推范围与适用边界受限于该实录语料。原文未披露训练硬件、批量大小与部署延迟成本。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Yym-line/EoW-TSE — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/IndexTeam/IndexTTS-2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
165. 并行解码不丢精度:掩码扩散如何重做语音识别的解码器
英文题目:MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
标签:#扩散模型 #高效推理 #多语言 #语音识别
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#扩散模型
👥 作者与机构
- Hao Yen:机构信息未能从会议 PDF 纯文本可靠映射
- Pin-Jui Ku:机构信息未能从会议 PDF 纯文本可靠映射
- Ante Jukić:机构信息未能从会议 PDF 纯文本可靠映射
- Sabato Marco Siniscalchi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别需要将连续语音声学输入映射为离散文本转写,自回归解码语言依赖强但需逐词生成而延迟随长度增长。非自回归并行解码可提速,却常因条件独立假设损失语言建模能力,导致准确率明显落后。该工作构建音频条件掩码扩散链,先由预训练语音编码器提取声学表示并送入非因果Transformer解码器在部分掩码文本上并行预测。接着采用迭代自校正训练让模型暴露自身中间预测错误,以提升多步精炼的鲁棒性。最后用位置偏置熵约束采样自适应决定每轮解掩位置与数量,使高置信且靠前的位置优先恢复。与此前需额外融合模块或辅助路径的扩散及流匹配语音识别方法不同,该框架保留标准编码器-解码器结构并给出噪声加权的扩散似然目标,使多步精炼与训练一致。在 5 个英文测试集上平均词错率达到 6.9%,优于 Canary-1b-flash 的 7.2% 并在 LibriSpeech test-other 上取得 3.6% 的词错率,同时保持 46.81 的逆实时因子。该结论限于朗读、会议、议会与财报英语及德西法三语的有监督评测,未验证长时、噪声、流式与零样本外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
166. 切断声学捷径又拉直轨迹:统一引导如何让流匹配又快又不串音
英文题目:Enhancing Flow Matching with A Unified Guidance Framework for Efficient and Robust Speech Synthesis
标签:#数据增强 #流匹配 #高效推理 #文本到语音 #语音转换
评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#流匹配
👥 作者与机构
- Zuda Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Qianhui Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Junhui Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Hongjiang Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Qiangqiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音生成以语义令牌为内容条件、以声学提示为音色条件重建目标语音,但令牌残留源端音色导致音色泄漏,而基于流匹配的常微分方程求解又带来多步迭代与分类器无关引导的双重延迟。作者提出统一引导框架,先用双阶段异构扰动构造声学失配训练对,迫使模型从语义侧只取内容而向提示侧索取音色,再在同一批次内交替执行内在引导蒸馏与轨迹拉直,使单次前向即隐含引导场并沿直线路径生成。该设计相对已有单阶段扰动与离线蒸馏的关键差异在于模型驱动交叉合成与信号变形级联去快捷方式,以及蒸馏后立即用更新权重在线模拟直线轨迹。在LibriTTS非平行语音转换任务下,统一引导模型的SIM指标为0.850,高于基线模型的SIM指标0.793。统一模型仅需3步生成且流匹配部分实时因子为0.024,显著降低了迭代与引导带来的延迟。该结论目前仅在英语朗读类数据与客观相似度及词错率下验证,噪声、口音、歌唱或主观听感外推尚未验证。原文披露了16卡H100两阶段训练与RTX 4090推理设定,涉及硬件与延迟,具体复现缺口见细节章节。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
167. 整句标签太粗、逐帧标签太吵:用子模型投票把语音切成可信与存疑两段再学
英文题目:Conflict-Aware Pseudo-Labeling via Acoustic Signals for Multi-Task Speech Emotion Recognition
标签:#模型集成 #多任务学习 #弱监督学习 #语音 #语音情感识别
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#弱监督学习
👥 作者与机构
- Haojie Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Shunfei Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Chengze Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhizhong Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Yicheng Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Ning Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别 Speech Emotion Recognition(SER)以整句语音为输入并输出单一情感类别,难点在于同一话语内存在静音、中性过渡与情感突变,仅用话语 utterance 级标签会抹平局部判别线索。本文构建三模块方法链:先将训练集划分为 K 个不重叠子集并按留一交叉验证训练 K 个子模型,去掉池化层后得到帧级候选预测;再按超过 K/2 的多数投票将时间轴切分为共识区 Consensus Region 与冲突区 Conflict Region,共识区赋硬伪标签,冲突区以全局回填 Global Back-filling 策略直接用话语真值监督;最后以共享编码器联合优化话语分支与帧级分支,推理时丢弃辅助分支。与依赖自动语音识别 Automatic Speech Recognition(ASR)转写或复杂结构重设计的同期多任务方法不同,该机制仅用声学信号做细粒度监督并以全局先验显式纠偏。共享编码器采用预训练HuBERT提取帧级特征,帧级辅助损失对共识区用伪标签监督、对冲突区用话语真值回填并加权,再与话语级交叉熵损失联合优化。在IEMOCAP五折留一会话验证设置下,本方法的加权准确率为78.10%,高于Gao等方法的加权准确率77.85%。该结论限于 acted 与对话式英文、德文短句情感分类,尚未验证长时、重叠、强噪声或跨语种外推,且原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/sfxii/CAPL-SER — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
168. 不追踪伪造,只锚定真实:DASM 用真实流形偏差做音乐深伪检测
英文题目:DASM: Detecting AI-Synthetic Music via Authentic Manifold Deviation Modeling
标签:#提示学习 #检索增强 #鲁棒性 #音乐 #音频深度伪造检测
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#检索增强
👥 作者与机构
- Xinya Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Mengyu Qiao:机构信息未能从会议 PDF 纯文本可靠映射
- Wenqiang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhihui Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音乐伪造检测的输入为完整音乐波形,输出为真伪二分类,难点在于生成器快速迭代导致伪造分布非平稳而判别边界迅速过时。本文提出真品流形偏差建模框架 DASM(Detecting AI-Synthetic Music via Authentic Manifold Deviation Modeling),方法链分为两阶段。第一阶段用冻结音乐编码器 MERT-330M 抽取声学语义特征并仅在真品上训练正交记忆库以形成压缩流形先验。第二阶段冻结记忆库,用稀疏交叉注意力以记忆库重构输入并经平均池化得到原始向量与偏差向量。第三将两路信号经独立投影融合后送入交叉熵加角间隔分类头完成判决。与已有判别式方法相比,该机制不拟合伪造伪影而度量偏离真品流形的方向与幅度,因而对未知生成器更具稳定性。在 SONICS 数据集上,DASM 以 0.13% 等错误率显著优于最强基线 WPT-XLSR-AASIST 的 1.04%,准确率达 99.89%,曲线下面积达 99.98%,且平均声学退化精度下降更小。该结论目前仅在全曲合成音乐上得到验证,对跨数据集分布偏移与局部篡改仍存在明显性能边界。训练使用单卡 RTX 4090,原文未披露推理时延、吞吐与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
169. 先排好序再蒸馏:让音频大模型直接听懂该留哪对语音翻译数据
英文题目:Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data
标签:#数据清洗 #音频大模型 #语音 #语音翻译
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#数据清洗
👥 作者与机构
- Qixu Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理挖掘语音到语音翻译数据噪声大、错位多且双侧均为语音无可靠标签时如何筛选可训练语音对的问题,输入为源语音与目标语音组成的挖掘对,输出为保留或丢弃决策。方法先以声学信噪比、感知平均意见分与跨语言语义一致性多视角信号按严格阈值筛选高置信清洁对并施加分级可控退化生成负例,为排序学习提供弱监督。接着以轻量排序模型学习清洁优于噪声的相对顺序,对大规模无标注池打分并取首尾两端生成伪标签,将成对语音包装为指令跟随样本。最后微调音频大模型使其直接从原始双语音预测决策,把声学保真度与跨语言语义一致性统一到端到端听觉判断,避免先转写再用文本大模型打分时丢失失真、合成伪影与错位证据。在CVSS-C加20% SpeechMatrix语料的评测设置下,过滤后训练的语音到单元系统的BLEU为22.72,高于614265对未过滤基线的BLEU 21.32。结论限于合成目标语音、法语到英语为主与离散单元架构,德语到英语仅用简化信号验证,真实自发语音与多元架构泛化尚未验证,原文未披露过滤训练与推理成本。
🔗 开源资源
- 代码相关资源:https://github.com/chin-alt/S2S-Filtering — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
170. 先分大类再认小人:用全局-局部分层分类给大模型补说话人判别力
标签:#会议转录 #多任务学习 #音频大模型 #语音识别 #说话人分离标注
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#多任务学习
👥 作者与机构
- Yuhang Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Haopeng Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Jiale Qian:机构信息未能从会议 PDF 纯文本可靠映射
- Ruiqi Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Hanke Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Hanlin Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Shunshun Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Tao:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Xinsheng Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多说话人会议转写要求从远场混合音频直接输出带时间戳、说话人标签与文本的结构化序列,难点在于重叠、快速轮转与音色相似导致的归属错误。本文提出全局局部说话人分类联合说话人分离标注与识别(Global-Local Speaker Classification for Speaker Diarization and Recognition,GLSC-SDR),先切分单人片段并过滤噪声,再用说话人嵌入与密度聚类生成全局簇标签与簇内局部标签。训练时将该分类任务与序列化输出训练(Serialized Output Training,SOT)的转写任务统一为序列格式并联合优化,使输入表示同时获得跨片段一致性与细粒度区分性。与扁平分类或外挂说话人编码器不同,该设计无需改动大语言模型主干即可引入显式层级监督。在AliMeeting评测任务下,GLSC-SDR的△cp为7.22,低于GSC-SDR的△cp 8.2。该结论目前仅在三套会议语料的域内独立训练评测中验证,未证明对开放说话人、大规模真实对话或流式场景的外推能力。其开放场景适用边界尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
171. 不用重训长文本:以软先验与跨句状态把短句语音模型连成连贯长语音
英文题目:MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data
标签:#基准测试 #注意力机制 #测试时自适应 #长音频处理 #文本到语音
评分:7.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#注意力机制
👥 作者与机构
- Subhankar Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
- Jason Li:机构信息未能从会议 PDF 纯文本可靠映射
- Paarth Neekhara:机构信息未能从会议 PDF 纯文本可靠映射
- Shehzeen Hussain:机构信息未能从会议 PDF 纯文本可靠映射
- Ryan Langman:机构信息未能从会议 PDF 纯文本可靠映射
- Xuesong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Roy Fejgin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
长文本转语音需将段落级输入转为分钟级连续语音,难点在于独立分句合成会造成韵律漂移、音色不一致以及句子边界处基频与能量突变。本文提出MagpieTTS-LF,在训练好的MagpieTTS编码器-解码器上外挂推理时有状态分块循环:先将上一块末尾K个历史文本词元与当前句拼接送入文本编码器做话语级韵律规划并缓存对应编码器隐状态以维持跨块连续表示,再利用上一块记录的注意力位置初始化当前块的软先验,最后在自回归解码时用软注意力先验引导单调对齐并保留远距上下文。与二值掩码截断上下文形成硬截断不同,软先验对远距位置保留非零微小权重并以可控强度叠加到注意力之上,从而实现渐进衰减与长程依赖保持。在20段约3分钟至4分钟英文长文本的评测任务下,MagpieTTS-LF的词错率为0.025,低于Qwen3-TTS的词错率0.045。该结论目前仅在英文朗读体和客观指标上验证,未验证对话、情感强变化体裁及人类主观自然度。原文未披露训练成本与推理延迟吞吐细节。
🔗 开源资源
- 代码相关资源:https://github.com/NVIDIA-NeMo/NeMo → https://github.com/NVIDIA-NeMo/Speech — 链接可访问(HTTP 200)
- 演示资源:https://magpietts-lf.github.io/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/neonbjb/tortoise-tts — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
172. 在编解码离散码上做吸收式扩散:ADDSE 为何敢用很少步数增强
标签:#扩散模型 #Transformer #向量量化 #语音 #语音增强
评分:7.2/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#扩散模型
👥 作者与机构
- Philippe Gonzalez:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为含噪语音波形,输出为增强后波形,难点在于短时傅里叶变换维度高而连续扩散采样慢,且神经音频编解码的残差向量量化码具有帧与深度双层结构。所提吸收离散扩散语音增强框架先用冻结编解码器将干净与含噪语音映射为离散码,再以噪声码为条件对干净码执行多维吸收扩散建模,最后将采样码经码本查表与解码器重建波形。残差量化扩散Transformer沿帧与深度分别建模并复用码本向量,避免了展平序列的高复杂度。相比连续域扩散与掩码生成建模,该方法具有时间无关重参数化与可复用预测,支持并行非自回归采样,并能利用编解码器习得的强语音先验在极低信噪比下保持稳健。在Clarity-FSD50K测试集下,Conv-TasNet的DNSMOS得分为3.47,高于含噪语音的DNSMOS得分为2.90。该结论的适用边界受限于非侵入式感知质量与低信噪比场景,不外推至相位敏感的侵入式指标与全频带场景。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://philgzl.com/addse-demo — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
173. 名单太长塞不进提示词:COALA 先打分过滤再识别多罕见词
标签:#对比学习 #LoRA #检索增强 #语音 #语音识别
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#对比学习
👥 作者与机构
- Jhih-Rong Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Bi-Cheng Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Tien-Hong Lo:机构信息未能从会议 PDF 纯文本可靠映射
- Berlin Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
上下文偏置需将外部实体名单注入语音增强语言模型以纠正罕见词,输入为语音与大规模候选名单、输出为转写文本,难点在于模型上下文窗口有限、干扰实体多且单句常含多个目标而易发生训练崩溃。COALA先以冻结Whisper-large-v2编码器与SmolLM2-135M-Instruct解码器转写并构造含`<unbiased>`标记的候选名单,再用骨干末层隐状态经判别投影器计算长度归一的匹配分并按分数取前10个实体过滤重构提示,最后进行二次解码以完成偏置目标识别与识别。与全局Softmax判别损失不同,多正样本损失做局部解耦以消除正样本互斥,解耦点式损失进一步做点式解耦,将相对排序转为绝对二分类以稳定零点附近的决策边界。在LibriSpeech test-clean评测设置下,+BTI(DPD-Loss)在N=500条件的B-WER为3.25,低于在N=5000条件的B-WER 6.96。该结论的适用边界受限于英文朗读语料与随机采样罕见词名单,单句目标超过top-10截断时存在失败条件,跨域高密度外推尚未验证。两阶段训练成本共17轮并受限于单卡24GB RTX 3090的硬件条件,推理开销主要来自二次解码与打分过滤。
🔗 开源资源
- 代码相关资源:https://github.com/Guo0911/COALA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
174. 低信噪比毫米波雷达语音重建:先学会补高频,再学会抗噪声
英文题目:mmWave Radar Aware Dual-Conditioned GAN for Speech Reconstruction of Signals With Low SNR
标签:#生成对抗网络 #低资源 #预训练 #静默语音接口 #语音超分
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音超分 | 主方法:#生成对抗网络
👥 作者与机构
- JASH KARANI:机构信息未能从会议 PDF 纯文本可靠映射
- Adithya Chittem:机构信息未能从会议 PDF 纯文本可靠映射
- Deepan Roy:机构信息未能从会议 PDF 纯文本可靠映射
- Sandeep Joshi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为穿过玻璃墙采集的毫米波调频连续波雷达振动信号,全局信噪比为负5分贝至负1分贝,有效能量集中在1千赫兹以下,输出为8千赫兹采样的全带宽可懂语音,重建需同时抑制强噪声并幻觉缺失高频。该管线先在合成限带干净语音上无对抗预训练HiFi-GAN生成器以学习低频到高频映射,再用WaveVoiceNet增强分支与噪声梅尔谱经残差融合门生成融合条件,最后以多周期、多尺度与多梅尔判别器联合对抗微调。与仅用波形判别器的基线不同,新增的梅尔谱域二维判别器提供时频局部真实性约束,门控残差融合允许在增强不可靠时回退到原始噪声输入。在RASE 2026双任务雷达数据上,RAD-GAN加权得分为0.333,优于WaveVoiceNet的0.260与HiFi-GAN的0.288。该结论仅适用于室内玻璃穿透直接振膜振动与铝箔二次反射两种受控场景,未验证跨设备、跨说话人与实时推理下的外推能力。预训练约6小时、微调约14小时,均在单卡NVIDIA A6000上完成,原文未披露推理时延与端侧部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/chitadi/RADGAN — 链接可访问(HTTP 200)
- 演示资源:https://rad-gan-demo-site.vercel.app/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
175. 统一工具链之下,谁在决定音频深伪检测的成败:前端、后端还是训练数据
英文题目:DeepFense: A Unified, Modular, and Extensible Framework for Robust Audio Deepfake Detection
标签:#基准设计 #公平性 #鲁棒性 #语音 #音频深度伪造检测
评分:7.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#音频深度伪造检测 | 主方法:#基准设计
👥 作者与机构
- Yassine El Kheir:机构信息未能从会议 PDF 纯文本可靠映射
- Arnab Das:机构信息未能从会议 PDF 纯文本可靠映射
- Yixuan Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Feidi Kallel:机构信息未能从会议 PDF 纯文本可靠映射
- Enes Erdem Erdogan:机构信息未能从会议 PDF 纯文本可靠映射
- Ngoc Thang Vu:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Polzehl:机构信息未能从会议 PDF 纯文本可靠映射
- Sebastian Möller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音伪造检测输入为 16 kHz 波形,输出为真伪二分类分数,难点在于合成方法、信道、语言与音质跨域泛化差且评测协议碎片化。DeepFense 以 YAML 配置编排统一实验,先由数据工厂完成元数据加载、重采样裁剪、增强与组批,再由检测引擎依次经过自监督前端、分类后端与损失计算得到训练信号,最后由统一训练器完成优化、验证、存档与日志追踪。与分散仓库拼装相比,该设计消除了特征归一化、填充分批与优化配置等隐性差异,使前端、后端与训练数据的贡献可比。在 4 个前端、4 个后端、6 个训练集、13 个测试集的大规模比较中,Wav2Vec 2.0 宏平均等错误率(Equal Error Rate, EER)为 25.5%,明显优于次优前端,而 CodecFake 训练的宏平均 EER 为 22.3%,跨域迁移最强,最优单系统为 Wav2Vec2 加 MLP 加 CodecFake 的 17.16%。结论仅适用于所覆盖的组合与固定 4 秒输入加交叉熵加 Adam 流水线,未验证多数据集联合训练、局部篡改定位与溯源等外推场景。原文未披露训练、推理或部署成本。
🔗 开源资源
- 模型相关资源:https://huggingface.co/DeepFense — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
176. 笑声是谁的?SA-UAED 把说话人、笑咳与背景声一起按帧分开
标签:#数据集 #多任务学习 #说话人分离标注 #音频事件检测
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#多任务学习
👥 作者与机构
- Zekun Lan:机构信息未能从会议 PDF 纯文本可靠映射
- Wangyou Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yanmin Qian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文解决多说话人重叠下通用声音事件、说话人语音活动与归属到说话人的副语言事件的联合帧级检测问题,输入为单通道混合音频加目标说话人注册语音,输出为50 Hz分辨率的三类帧级二值活动序列,难点在于副语言短促多变且与常规说话人嵌入失配又缺乏细粒度多标签数据。随机脚本生成器先确定事件起止时间戳、类别与说话人身份,再以LibriSpeech为提示调用ChatterBox-Turbo合成孤立笑声与咳嗽,经PANNs过滤与能量检测修剪后输出干净片段。拼接朗读语音、合成副语言与DESED背景事件按会议式叠加并聚合时间戳得到帧级真值以构建LibriPara,模型沿用T-UAED骨架,以BEATs与WavLM表征经6层Transformer解码器融合事件查询、ECAPA-TDNN嵌入及独立全连接层投影的咳嗽笑声专用查询后点积预测并以二元交叉熵联合优化。相对已有方法的关键差异在于将通用嵌入解耦为独立咳嗽与笑声子空间查询而非共享适配,从而避免表征纠缠并保持身份一致性。在500小时LibriPara训练集上从零训练后,合成测试集咳嗽与笑声段级F1分别从0.282和0.371提升至0.473和0.476,基于真实人声的EARS混合集分别从0.375和0.259提升至0.470和0.409,说话人分离标注错误率基本不变,通用声音事件检测段级F1轻微下降约0.005。在LibriPara测试集下,SA-UAED的SB-F1为0.473,高于T-UAED基线的SB-F1 0.282。结论仅在至多3人、平均语音重叠率15%、仅覆盖笑声与咳嗽、注册用干净非重叠语音的条件下成立,未验证真实远场会议录音与开放集发声。该结论的适用边界受限于合成主导训练,尚未验证真实远场会议的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/originallover/SA-UAED — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/fgnt/sed_scores_eval — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
177. 超低码率先保说什么:用内容上下文引导重建的 ContextCodec
英文题目:ContextCodec: Content-Focused Context Guidance for Ultra-Low Bitrate Speech Coding
标签:#自回归模型 #对比学习 #向量量化 #语音 #语音编码
评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Chengbin Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Wenqi Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Zhijin Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
超低码率语音编码(speech coding)需将连续波形压缩为每秒不足1000比特的离散符号并重建可懂且自然的语音,难点在于声学细节会挤占语言内容的比特预算。ContextCodec先用共享编码器与双分支编码器将声学流与上下文流解耦,再对拼接潜变量做交织分相的自回归潜变量精炼以去除可预测冗余并量化归一化残差。随后帧级音素对比对齐使量化后上下文特征逼近强制对齐音素嵌入,解码端则经上下文引导注意力解码器在输入融合与各级上采样中持续注入上下文门控。相比仅把语义特征作先验或用自监督蒸馏的混合编码器,该设计显式约束语言内容并防止上下文信号在深层解码中衰减。在Common Voice 21.0多语言评测设置下,ContextCodec的WER为28.31%,低于X-Codec的WER 31.06%。跨语言音素覆盖不均与罕见音素欠表示仍限制外推,未验证噪声与丢包等真实信道条件。原文披露单卡训练与骁龙8 Gen 3端侧CPU实时因子为0.4886,具备准实时部署潜力。
🔗 开源资源
- 第三方资源:https://github.com/timmahrt/praatIO — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
178. 冻住两端编解码器,只在潜变量之间架桥:BridgeCodec 的低码率跨器互通
英文题目:BridgeCodec: Mamba Enhanced Neural Audio Codec with Schrödinger Bridge at Low Bitrate
标签:#状态空间模型 #高效推理 #语音 #音频编码 #语音超分
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频编码 | 主方法:#状态空间模型
👥 作者与机构
- Zijian Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Jinghao Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Zhuo Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Fan Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
神经音频编解码器长期依赖成对协同训练的编码器与解码器,当两端采样率与算力不对称时直接通信即告中断,本文以 8 kHz 窄带编码器到 48 kHz 宽带解码器的转译为任务,要求输入为 1 kbps 高度瓶颈化潜特征而输出为可被冻结目标解码器直接渲染的宽带潜特征。方法链分为三步:冻结源编码器与目标解码器以锁定异构端点,薛定谔桥 Schrödinger Bridge(SB)学习两经验分布间的最优随机传输路径,曼巴 Mamba 增强型 U-Net 在多分辨率上交替建模局部结构与长程韵律依赖并经两阶段由潜对齐转向波形保真微调。与需预设高斯噪声先验的标准扩散相比,该机制直接以源潜分布为终端边界从而保留语音结构先验并实现带宽扩展。在DNS挑战集测试集下,BridgeCodec的STOI为0.88,高于源端编解码器的STOI 0.23。该结论目前仅在干净多语朗读语音与自训练 AudioCraft 端点上成立,重噪声、音乐及第三方编解码器间的迁移尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://thuhcsi.github.io/interspeech2026-BridgeCodec/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
179. 不等看完就判决:用第一个输出脉冲做分类的早退脉冲网络
英文题目:First-to-Spike: An Early-Exit Framework for Rapid and Energy-Efficient Spiking Neural Networks
标签:#正则化 #高效推理 #脑信号 #语音 #关键词检测
评分:7.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#正则化
👥 作者与机构
- Zheyuan Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Sirui Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zeyang Song:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiqi Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Siqi Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Haizhou Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为语音指令与脑电情绪等连续时间序列,输出为类别标签,难点在于不同样本信息密度差异大而固定全长推理造成延迟与功耗浪费。本文提出首达脉冲框架,先由脉冲骨干网络逐步提取特征并向决策层注入电流,再由漏积分发放输出神经元积分竞争并以首个脉冲触发停机,随后由胜者通吃侧抑制加速分出胜负,最后由混合时序训练联合优化分类与时序间隔。与依赖每步计算柔性最大值置信度与人工阈值的外挂早退机制不同,该方法以神经元自身发放阈值充当内生决策边界,完全保留事件驱动特性。该内生竞争使平均决策步数随证据充分程度自适应提前,从而同步降低计算量与延迟。在Google Speech Commands V2基准下,F2S方法的准确率为92.89%,高于ED-sKWS基线的准确率90.14%。该结论目前仅在干净语音指令与受试者无关划分的情绪脑电数据上验证,低信噪比与异步传感输入下的外推尚未证实。原文未披露优化器、学习率与训练成本。
🔗 开源资源
- 代码相关资源:https://github.com/PatrickZLin/F2S — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
180. 小块也稳、低延迟可播:MeanVC 2 用有限未来看与全局音色令牌改造流式转换
英文题目:MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion
标签:#流匹配 #高效推理 #流式处理 #零样本 #语音转换
评分:7.2/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#流匹配
👥 作者与机构
- Guobin Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxuan Xia:机构信息未能从会议 PDF 纯文本可靠映射
- Yuepeng Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Dake Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Hanke Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Jingbin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Yanbo Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Pengcheng Zhu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式零样本语音转换需将源语音内容实时转换为未见目标音色,同时保持可懂度与跨块一致性,在短块与低质参考下极易退化。本文提出MeanVC 2,沿识别合成路线构建:流式语音识别模块提取瓶颈特征保留内容,ECAPA-TDNN发言人编码器提取全局音色向量,通用音色令牌编码器将其展开为令牌式键值表示并以瓶颈特征为查询检索细粒度音色,扩散变换器解码器在均值流单步框架下流式生成梅尔谱并经Vocos声码器合成。与MeanVC的块自回归去噪加多参考音色编码器相比,新设计取消干净块教师强制并以层级掩码显式调度过去与有限未来感受野,同时将细粒度音色提取与参考梅尔谱解耦。在Seed-TTS普通话2018对零样本评测中,新系统DNSMOS达3.89、SMOS达3.89、SSIM达0.710,均领先同组基线,端到端首包时延由211.52 ms降至109.88 ms,但CER为7.44%,劣于MeanVC 160 ms的5.11%。该结论目前仅在普通话朗读类数据与单核CPU流水线条件下验证,对噪声混响、跨语言及长时漂移的外推仍缺证据。训练优化器、学习率、批量与步数等成本细节原文未披露。
🔗 开源资源
- 演示资源:https://aslp-lab.github.io/MeanVC2/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
181. 只看正中矢状面影像,能否同时保住说什么、像谁说和怎么起伏
英文题目:Speaker-Independent Speech Synthesis from Real-time MRI Articulatory Data
标签:#CNN #多模态学习 #零样本 #语音 #静默语音接口
评分:7.2/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.9/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#静默语音接口 | 主方法:#多模态学习
👥 作者与机构
- Yuto Otani:机构信息未能从会议 PDF 纯文本可靠映射
- Shun Sawada:机构信息未能从会议 PDF 纯文本可靠映射
- Hidefumi Ohmura:机构信息未能从会议 PDF 纯文本可靠映射
- Kouichi Katsurada:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文从中矢状面rtMRI气道运动序列直接合成含内容韵律音色的人声波形,难点是帧率分辨率有限且不可见声带振动与三维几何。第一步EfficientNetV2-B0逐帧提取声道形状特征并投影至256维,第二步E-Branchformer建模协同发音上下文并经注意力池化形成视频侧说话人表示。第三步共享FiLM生成器注入说话人调制后回归80维对数梅尔谱,第四步BigVGAN-v2合成波形,训练以冻结X-vector音频路径为教师用余弦损失对齐视频路径,推理仅用视频,区别于音素加TTS解耦路线而保留原始时长与相对音高。在USC 75人库筛选后51人中按性别分层划分43/4/4人训练验证测试,4名未见说话人朗读语音差分词错率(differential word error rate,dWER)最优至4.5%,视频路径与使用参考音频的上限路径差距在1.3个百分点以内;在测试集说话人相似性评测下,sub11合成语音对sub11参考的SECS为0.95,高于对sub20参考的SECS 0.91。该结论适用边界受限于二维中矢状面观测,同性别区分与绝对F0估计为失败条件,跨语种外推尚未验证,训练成本仅单卡硬件约4小时。训练在单卡NVIDIA RTX PRO 6000上约4小时收敛。
🔗 开源资源
- 代码相关资源:https://github.com/y-otn/m2s-code — 链接可访问(HTTP 200)
- 演示资源:https://y-otn.github.io/m2s/ — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
182. 一起说话时向谁靠拢:多维韵律突显线索的趋同轮廓
英文题目:What Happens When We Speak Together? Multidimensional Convergence in Face-to-Face Interaction
标签:#统计分析 #韵律 #音视频 #语音属性识别
评分:7.2/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Lena Pagel:机构信息未能从会议 PDF 纯文本可靠映射
- Doris Mücke:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Roessig:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为面对面卡片游戏中15个双元组在单人基线与双人对话下产生的德语问答,输出为说话人是否在韵律凸显线索上相互靠近,难点在于区分人际趋同与凸显自身驱动的语内变异。方法链分三步:首先以词汇与信息结构受控的DiCE任务采集音频与电磁发音仪运动并划分单独与对话模式,为基线对照提供可比语音材料;接着经Whisper与Montreal Forced Aligner对齐及F0半音转换提取时长、F0变动幅度、舌体位移与头部速度,将原始信号转化为四维凸显参数;最后对每个参数×双元组拟合贝叶斯层级线性模型,以单独到对话的说话人间距缩减判定趋同并以伪双元组对照验证特异性。与已有单参数声学趋同研究不同,该工作将趋同定义为多维凸显线索的选择性协同,强调感知显著性与生理约束的权衡。在包含15个双元组的DiCE任务语料评测设置下,时长维度的趋同双元组数量指标为9个,高于舌体位移维度的趋同双元组数量指标2个。结论限于受控实验室德语专有名词与矫正焦点语境,向自发对话与跨语言的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://osf.io/3uebk — 链接可访问(HTTP 200)
- 数据相关资源:https://osf.io/3uebk — 链接可访问(HTTP 200)
- 数据相关资源:https://osf.io/9fmqh — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
183. 只给 10 小时新语言语音,能否找回音位表:DiscoPhon 的双轨评测
英文题目:DiscoPhon: Benchmarking the Unsupervised Discovery of Phoneme Inventories With Discrete Speech Units
标签:#基准设计 #自监督学习 #语音学与音系 #多语言 #语音识别
评分:7.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Maxime Poli:机构信息未能从会议 PDF 纯文本可靠映射
- Manel Khentout:机构信息未能从会议 PDF 纯文本可靠映射
- Angelo Ortiz Tandazo:机构信息未能从会议 PDF 纯文本可靠映射
- Ewan Dunbar:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Chemla:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Dupoux:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为未见语言10小时无标注朗读语音,输出为与预定义音位表对齐的离散单元序列,难点在于未知音位数、长尾同位异音与跨语言泛化。流程先以多语言自监督学习(self-supervised learning,SSL)预训练编码连续表示,再经K均值或预测头离散化为帧级单元,接着在有标注开发集与测试集上学习多对一或一对一映射,最后以音位归一化互信息(phone-normalized mutual information,PNMI)、音位错误率(phone error rate,PER)与切分指标评估识别与边界。与既往零资源评测只测连续表示ABX不同,该基准强制固定词表并显式评估离散化后映射与切分,直接检验单元能否充当音位。在6个测试语言平均上,微调后的SpidR VP-20在多对一256单元下取得61.67%的PER与64.38%的PNMI,明显优于HuBERT基线但插入错误占比仍达69%。结论限于朗读风格与自动对齐的伪音位标注,未验证自发语音、声调、非肺部音与搭嘴音等对比,且预训练已剔除基准语言及近亲语言。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
184. 干目标加流匹配:StuPASE 如何在不编造内容的前提下做干净语音
英文题目:StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement
标签:#流匹配 #主观评测 #语音 #去混响 #语音增强
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#流匹配
👥 作者与机构
- Xiaobin Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Zheng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Mansur Yesilbursa:机构信息未能从会议 PDF 纯文本可靠映射
- Kamil Wojcicki:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
生成式语音增强需从带噪带混响波形恢复录音室级干净语音,难点在于高感知质量与低幻觉难以兼得,混响残留与语义失真常同时出现。StuPASE先以干声目标微调去噪WavLM得到纯净音素级语义表征,再将其经线性投影后与带噪梅尔谱拼接作为条件,由基于DiT的流匹配模块生成干净梅尔谱,最后经Mel声码器合成波形。训练时同时采用语音填充范式,对干净与带噪梅尔谱按比例随机掩蔽,迫使模型利用周围上下文与完整语义序列补全缺失帧,从而充分利用净化后的语义引导。与保留50 ms早期反射目标及GAN声码器的PASE相比,该工作揭示干目标可纠正分布偏置,并用语义引导的填充式生成替代强依赖含噪条件的GAN。在DNS1带混响集上StuPASE取得UTMOS 4.01与dWER 7.89%,同时优于SenSE与Adobe Enhance Speech V2的音质与语言保真。其结论限于16 kHz单通道英文朗读与模拟噪声混响,对音乐、多说话人与极低信噪比外推尚未验证。原文未披露训练时长、推理延迟与部署成本,仅提供演示页面而无代码权重。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
185. 先给部分分再收紧:随模型成熟度渐进收紧的弱监督
英文题目:Progressive Weak Supervision for Speech Emotion Recognition
标签:#弱监督学习 #跨语言 #语音 #语音情感识别
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#弱监督学习
👥 作者与机构
- Bao Thang Ta:机构信息未能从会议 PDF 纯文本可靠映射
- Huynh Thi Thanh Binh:机构信息未能从会议 PDF 纯文本可靠映射
- Van Hai Do:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从语音波形映射到中性、快乐、悲伤、愤怒四类标签,难点在于情感边界连续重叠且早期声学表示对韵律线索辨别力不足,模型分布弥散而排序剧烈波动。所提渐进式弱监督先由 WavLM-Base 编码并经注意力池化得到话语向量,再按当前 top-k 预测构造自适应软目标并在弱命中时优化分布匹配,否则回退硬标签,最后令容忍度 k 经历热身保持与线性衰减再到标准监督三阶段收紧以驱动表示由宽松向精确收敛。与标签平滑均匀松弛全部类别不同,该方法只把残余概率分给模型当前认为 plausibly 的候选并随训练成熟度消除松弛,从而避免对明显错误类别浪费松弛容量。在 IEMOCAP 五折会话无关评测下该方法以非加权准确率达到 78.08%,较同条件交叉熵基线提升 4.66 个百分点,在越南语 ViSEC 上达到 85.70%,提升 11.90 个百分点。该结论限于四分类表演式与声调语料及 WavLM-Base 微调流程,未验证更多类别、自然情感或大模型泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/skyemo47/PWS — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
186. 数据极少时如何让口语评分又分专家又学得快:混合专家与元学习的组合
英文题目:Adaptive Multimodal Expert Specialization by Meta-Learning for Spoken English Assessment
标签:#教育 #元学习 #混合专家模型 #音视频 #语音属性识别
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#元学习
👥 作者与机构
- Cong-Thanh Vu:机构信息未能从会议 PDF 纯文本可靠映射
- Candy Olivia Mawalim:机构信息未能从会议 PDF 纯文本可靠映射
- Hung Le:机构信息未能从会议 PDF 纯文本可靠映射
- Chee Wee Leong:机构信息未能从会议 PDF 纯文本可靠映射
- Guy Sivan:机构信息未能从会议 PDF 纯文本可靠映射
- Shogo Okada:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为青少年升学面试的同步音频、视频与转写文本,输出为口语评价 Spoken English Evaluation(SEE)框架下5维20项分数,难点是样本仅427人且隐私受限难以大规模标注。方法链分4步推进:先将长视频按单话轮步长切分为200秒至250秒重叠片段以构造元任务,再用DisVoice、Qwen3-Embedding-0.6B、OpenFace与轮次统计抽取韵律、语义、面部动作与会话特征,随后经Transformer编码器与注意力池化建模模态间交互,最后由Top-2路由的混合专家模型 Mixture of Experts(MoE)分发给多头打分器并以FOMAML学习可快适应的初始化。与每目标独立LightGBM基线相比,统一主干通过专家分工缓解多评分标准冲突,并以少量梯度适配新口径而非固定模式匹配。在ETS Vericant评测5折交叉验证3次重复设置下,MetaSEE的F1为84.88%,高于基线的F1 81.78%,其均方误差MSE为0.225,低于基线的MSE 0.333。该结论限于短片段分数可代表整段的假设及9岁至16岁非母语面试场景,向成人对话或零样本新题型的外推尚未验证。原文未披露训练、推理或部署成本,代码已在GitHub公开。
🔗 开源资源
- 代码相关资源:https://github.com/cngthnh/meta_see — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
187. 训练只听语音、推理只看脸:双空间约束如何稳住看脸合成的音色
英文题目:Dual-Space Constrained Face-Based Zero-Shot Text-to-Speech Synthesis
标签:#对比学习 #多模态学习 #零样本 #音视频 #文本到语音
评分:7.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#多模态学习
👥 作者与机构
- Jianrong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shengjie Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Ju Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Dengcheng Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Qi Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向单张人脸图像为未见说话人生成语音的零样本任务,输入为人脸图像与文本,输出为保留身份的语音,难点在于无注册音频可锚定音色,且模块化系统训练用语音派生嵌入而推理用人脸派生表征。方法链分三步:先训练语音编码器得到弱语料依赖的说话人嵌入,再训练人脸语音对齐模块得到共享身份空间,最后在多说话人声学模型微调中同时约束合成语音在两空间与真值一致。相对已有模块化方法推理期才引入人脸条件的单向做法,该工作把人脸兼容性提前到声学模型训练目标中。在VoxCeleb2未见说话人集上相对最强模块化基线Face-StyleSpeech将说话人嵌入余弦相似度从0.635提升至0.677,话语间一致性从0.744提升至0.842,词错误率从0.087降至0.072;在LRS2跨语料样本级评测上优势扩大至0.653对0.583。该结论仅在英语朗读与访谈类语料及YourTTS骨干下验证,跨语言、大姿态遮挡与强情感韵律的外推尚未验证。原文仅给出单块NVIDIA RTX 4090,未披露训练时长、推理延迟与部署成本。
🔗 开源资源
- 演示资源:https://zsj23.github.io/dsc-tts → https://zsj23.github.io/dsc-tts/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
188. 多视角训练、单视角可用:用乘法融合把侧脸唇动变成正面提取的增益
英文题目:Multi-View Based Audio Visual Target Speaker Extraction
标签:#多模态学习 #鲁棒性 #音视频 #语音 #目标说话人提取
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#多模态学习
👥 作者与机构
- Peijun Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhan Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频目标说话人提取以混合语音与目标说话人唇部视频为输入,输出目标语音波形,难点是推理时常见非正面视角与头部转动导致视觉线索退化。本文提出多视角张量融合框架,先用短时傅里叶变换编码混合音频并用预训练唇读网络提取各视角唇动嵌入,再经插值对齐与共享长短时记忆网络建模时序,接着对视角对做增1外积与投影平均得到视角不变视觉上下文,最后与音频特征送入TF-GridNet分离并经逆变换重建。与正面矫正或简单相加注意力融合不同,该机制显式建模视角间乘性交互并允许训练用3视角而推理复制单视角补齐,从而在单相机场景下补偿连续姿态变化。在MEAD单视角测试集下,MVTF-GridNet的SI-SDR为15.718 dB,高于GridNet的SI-SDR 15.089 dB。该结论仅在MEAD中性情感与-10 dB至10 dB合成混合范围内验证,未检验真实连续转头、情绪与强混响外推。模型增加约0.326 M参数与约1.074 G FLOPs,原文未披露训练时长与部署延迟。
🔗 开源资源
- 代码相关资源:https://b23ca07a.github.io/MVTF-Gridnet/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
189. 线索可缺可组:WeSep 把目标说话人提取改写为异构线索条件学习
英文题目:WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction
标签:#多模态学习 #麦克风阵列 #音视频 #语音 #目标说话人提取
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#目标说话人提取 | 主方法:#多模态学习
👥 作者与机构
- Ke Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoyang Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shuhan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Haizhou Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
目标说话人提取需以辅助线索为条件从混合语音中恢复目标说话人波形,难点在于线索模态结构差异大且样本级可用性动态变化。WeSep先将任务重写为线索集合上的条件学习问题,每种线索经独立前端编码为特征表示zi以保留模态内特性。接着可配置顶层模型按特征粒度与时间对齐选择注入位置,将zi组合注入与线索解耦的分离主干实现条件融合。最后分离主干估计目标波形,并对批内缺失线索采用零值占位,使异构可用子集可在同一优化框架下统一训练与推理。与ClearerVoice等独立管线式多模态平台相比,WeSep把线索组合视为配置问题而非新架构设计,使模态内多特征并行与跨模态即插即用只需改配置。在Libri2Mix双人干净混合评测设置下,USEF加上下文嵌入组合的指标SI-SDRi为16.56 dB,高于语句级说话人嵌入基线的指标SI-SDRi为13.17 dB。该结论受限于英文干净双人混合、自仿真4通道混响集与VoxCeleb2-mix子集,视觉遮挡、波达方向误差与开放关键词外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/wenet-e2e/WeSep — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
190. 不做强制对齐:用音素识别的不确定性做可解释的构音障碍评估
英文题目:Phoneme Error and Uncertainty Features for Interpretable Dysarthric Speech Assessment
标签:#CTC #可解释性 #语音可懂度评估 #病理语音评估
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#CTC
👥 作者与机构
- Zihan Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Qianli Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Satwinder Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Clarion Mendes:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Hasegawa-Johnson:机构信息未能从会议 PDF 纯文本可靠映射
- Waleed Abdulla:机构信息未能从会议 PDF 纯文本可靠映射
- Seyed Reza Shahamiri:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理构音障碍话语级多维感知评估,输入为病理语音波形,输出为不精确辅音、失真元音、可懂度、自然度等七个维度的二分类筛查与七级严重度排序,难点在于说话人内变异大且传统听感知评估主观耗时。方法链分为三步:首先用冻结的联结时序分类音素识别器做自由解码并保留帧级后验;接着并行计算免参考不确定性与基于参考的音素错误率,前者量化偏离典型发音的程度,后者量化与标准序列的编辑距离;最后拼接为11维可解释族并送入浅层探针完成筛查与分级。与强制对齐优度 Goodness of Pronunciation的关键差异是解码不受标准文本约束,避免将病理实现拉回预期音素而掩盖诊断偏差。在Speech Accessibility Project数据集上完整特征族在四个主要维度平均筛查AUROC达到0.80,接近HuBERT基线的0.81,分级Spearman相关为0.55,落后于HuBERT的0.62。结论仅适用于发音与整体可懂度相关维度,对嗓音质量与韵律维度的外推未经充分验证。其适用边界受限于次要嗓音维度标签偏态与线性探针交互建模不足,细粒度分级外推尚未验证。在成本方面,实验硬件为NVIDIA GeForce RTX 3090 GPU,PED探测运行约81秒,EDL训练约2小时,HuBERT探测约3149秒,训练成本与计算量差异明显。
🔗 开源资源
- 代码相关资源:https://github.com/Kanelmis/PED — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
191. 以自发语音为主:WazobiaSpeech 如何把四种尼日利亚语言的真实变异装进可评测语料
标签:#数据集构建 #公平性 #多语言 #语音识别
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据集构建
👥 作者与机构
- Ife Adebara:机构信息未能从会议 PDF 纯文本可靠映射
- Oluwaseun Nifemi:机构信息未能从会议 PDF 纯文本可靠映射
- Olubayo Adekanmbi:机构信息未能从会议 PDF 纯文本可靠映射
- Rashidat Sikiru:机构信息未能从会议 PDF 纯文本可靠映射
- Ololade Anjuwon:机构信息未能从会议 PDF 纯文本可靠映射
- Ronke Akinmosin:机构信息未能从会议 PDF 纯文本可靠映射
- Faiza Sani:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究针对尼日利亚四种语言自发语音稀缺导致的自动语音识别(Automatic Speech Recognition,ASR)鲁棒性与公平性评估失真问题,输入为多域自然录音与人口统计学元数据,输出为可用于训练与偏差分析的转写语料与基线识别结果。采集先按农业、医疗健康、商业与日常对话等域分类体系设计多模态诱发提示以引出半自发讲述,录音经自动校验与母语者人工核验后进入转写流程,转写遵循统一正字法与特殊标记规范并经集成识别与人工抽检分级质控,最后按说话人无泄漏分层划分为训练与评测子集。与既有朗读语料相比,关键机制差异在于以图像与视频诱发替代文本朗读并保留变体口音与语码混合现象,同时配套细粒度元数据与声调最小对立评估。与未微调基线相比,在WazobiaSpeech域内评测上微调后Whisper Large-v3在豪萨语(Hausa)上词错误率(Word Error Rate,WER)为16.4%,在尼日利亚皮钦语(Naija)上为12.1%,而在约鲁巴语(Yoruba)上为30.02%,显示声调与正字法差异主导误差。该结论仅适用于安静自然环境下手机等常见设备采集的四种目标语言,不支持跨信道或跨语言外推,孤立词声调识别与非标准正字法场景仍显著退化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
192. 数据不在多而在对:用三种嵌入从 10 万小时里挑出 5% 训练专才语音识别
英文题目:Which Data Matter? Embedding-Based Data Selection for Speech Recognition
标签:#领域适应 #鲁棒性 #语音 #语音识别
评分:7.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#领域适应
👥 作者与机构
- Zakaria Aldeneh:机构信息未能从会议 PDF 纯文本可靠映射
- Skyler Seto:机构信息未能从会议 PDF 纯文本可靠映射
- Maureen de Seyssel:机构信息未能从会议 PDF 纯文本可靠映射
- Jie Chi:机构信息未能从会议 PDF 纯文本可靠映射
- Zijin Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Takuya Higuchi:机构信息未能从会议 PDF 纯文本可靠映射
- Jee-weon Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
- David Grangier:机构信息未能从会议 PDF 纯文本可靠映射
- Barry-John Theobald:机构信息未能从会议 PDF 纯文本可靠映射
- Tatiana Likhomanenko:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别在本工作中面对输入为野外伪标签长语音、输出为文本转写、难点为源域异构分布与目标专用域失配且小模型无法吸收102458小时全量变异的矛盾。方法链分4步推进:先用说话人、语音自监督WavLM与句嵌入SBERT三类嵌入将变长语音映射为定长向量,再以到目标验证集的最大余弦相似度度量相关性,接着用最大边际相关以λ平衡相关与已选集冗余做分批贪心选择,最后将选出的5%子集用于训练联结时序分类的Conformer模型。相比单一声学相似度或置信度筛选,晚融合多嵌入同时约束说话声学、音素覆盖与语义词汇相关性并显式去冗余,实际意义是以极小数据量 bridging 域失配。在LibriSpeech clean测试集下,Fusion选择的WER为7.9%,低于随机5%选择的WER 12.5%。结论仅适用于以LibriSpeech、CommonVoice、TED-LIUM为目标且源为Granary英文的专用模型场景,多目标平均与最大聚合均弱于单目标选择。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
193. 语言偏斜下只聚合投影器:联邦语音大模型何时逼近集中式识别
英文题目:Fed-SpeechLLM: Federated Learning Speech Language Models for Multilingual ASR
标签:#联邦学习 #LoRA #多语言 #语音 #语音识别
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#联邦学习
👥 作者与机构
- Mohamed Nabih Ali:机构信息未能从会议 PDF 纯文本可靠映射
- Daniele Falavigna:机构信息未能从会议 PDF 纯文本可靠映射
- Alessio Brutti:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言语音识别需把分布式多语言语音转写为文本,难点是声学条件与语言统计双重非独立同分布导致客户端漂移与跨语言干扰。该工作构建联邦语音大模型框架,先用冻结语音编码器抽取声学表征并经可训练投影器映射到大语言模型输入空间,再用低秩适配微调大语言模型生成转写,最后在服务端只聚合投影器等可训练参数并调度多语言客户端参与。与已有单语联邦语音识别相比,该机制把语言异构显式纳入客户端选择与加权,保留预训练多语言知识并降低通信量。在英语 LibriSpeech 与意大利语 Multilingual LibriSpeech 双语联邦实验中,早期语言偏置策略在英语测试集上取得 9.5% 词错率,显著优于随机选择的基线并接近集中训练的 6.1%。该结论目前仅在朗读语音双语设置下验证,未覆盖自发语音、更多语系与大规模客户端场景。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/mnabihali/Fed-SpeechLLM — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
194. 一个参数两套解码:用块限制与一致性约束缩小离线-流式差距
英文题目:Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization
标签:#正则化 #离线推理 #流式处理 #语音识别
评分:7.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#正则化
👥 作者与机构
- Andrei Andrusenko:机构信息未能从会议 PDF 纯文本可靠映射
- Vladimir Bataev:机构信息未能从会议 PDF 纯文本可靠映射
- Lilit Grigoryan:机构信息未能从会议 PDF 纯文本可靠映射
- Nune Tadevosyan:机构信息未能从会议 PDF 纯文本可靠映射
- Vitaly Lavrukhin:机构信息未能从会议 PDF 纯文本可靠映射
- Boris Ginsburg:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
统一自动语音识别需以同一套参数同时承接全上下文离线转写与低延迟增量转写,而未来上下文缺失导致两种表示冲突在0.5秒以内急剧放大。方法链分三步衔接:先以块受限注意力将多头注意力掩码分解为左上下文、当前块与右上下文并随机采样延迟目标,再以动态块卷积按当前块重排隐状态以对齐块化解码的卷积感受野,最后在双模式前向得到的完整联合网络输出间施加对称散度约束以拉齐预测分布。前者提供延迟可控的结构基础,中者消除训练与块化解码的卷积失配,后者直接惩罚模式间分歧。与仅靠掩码或因果卷积的已有统一方案不同,该约束作用于转导器全格点而非辅助连接时分类损失,避免了帧同步偏置。开放英文评测榜单8个子集上,大右上下文0.6B统一模型离线平均词错率达5.76%,显著优于同规模离线与流式基线并保持离线精度。该结论限于英文朗读与会议等多域评测,未验证噪声重叠与多语外推,且极低延迟下仍需更大右向上下文换取精度。原文未披露训练时长、吞吐与部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
195. 说不要却照做:文本到音频生成的否定失效与百万级否定基准
标签:#基准测试 #基准设计 #人类参与评测 #音频生成 #音频问答
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频生成 | 主方法:#基准设计
👥 作者与机构
- Arjun Arora:机构信息未能从会议 PDF 纯文本可靠映射
- Anshul Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Gubbala Mohith Nukesh:机构信息未能从会议 PDF 纯文本可靠映射
- Bikash Dutta:机构信息未能从会议 PDF 纯文本可靠映射
- Richa Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Mayank Vatsa:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到音频模型在接收包含否定约束的提示时应抑制指定声事件并保留其余场景,但现有系统常生成被明确要求排除的声音,从而出现肯定坍缩并损害忠实生成。该研究以AudioCaps原始描述为源,用大语言模型计数1至3个声事件并按四种否定类型与三种否定范围批量改写,再用三种生成模型合成否定音频并经四种字幕模型重写为文本,最后在音频与文本双模态下并行度量肯定坍缩。与仅依赖全局相似的跨模态对齐不同,该流程用微调编码器与音频问答显式检验逻辑排除是否落地,并揭示架构性否定理解缺陷,具有可复用基准意义。在以原始音频为参考的否定音频相似性评测任务下,AudioGen的Wav2Vec2 FAD分数为0.56,高于AudioLDM2的Wav2Vec2 FAD分数0.19。该结论适用于所测自回归与扩散及流匹配三类架构和所覆盖的一至三个声事件描述,对更长组合场景与交互式生成的推广尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/infly/inf-retriever-v1 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
196. 同时纠正太容易的音频和太严格的转写:Vimarsha 如何重测印度二十二种语言识别
标签:#基准设计 #鲁棒性 #多语言 #语音识别
评分:7.1/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Kaushal Bhogale:机构信息未能从会议 PDF 纯文本可靠映射
- Srija Anand:机构信息未能从会议 PDF 纯文本可靠映射
- Sadakopa Ramakrishnan Thothathiri:机构信息未能从会议 PDF 纯文本可靠映射
- Tahir Javed:机构信息未能从会议 PDF 纯文本可靠映射
- Sshubam Verma:机构信息未能从会议 PDF 纯文本可靠映射
- Mitesh M Khapra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
印度语言语音识别的输入是多方言、多场景带噪语音,输出是文字转写,难点在于真实部署噪声与同一发音多种合法拼写并存且刚性单参考会引入虚假误差。Vimarsha先采集受控野外录音以保证人口与地域覆盖,再从互联网视频挖掘高难度自然语音并按声学标签均衡采样,随后用多模型假设对齐生成候选变体并经母语标注者校验形成变体晶格,最后以正字法知情词错率取晶格最优路径评分。与单参考词错率只认唯一标准答案不同,该机制允许拼写变体、合词切分与代码混合等效形式免罚,从而分离声学能力与正字法宽容度。在受控与野外对比评测下,最优系统的平均WER从COF条件的平均WER10–15%升至IW条件的平均WER27–34%。该结论仅适用于所覆盖的22种预定语言与所采集的86类声学标签分布,对极低资源方言与未见噪声的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/AI4Bharat/Vimarsha — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
197. 句子可预测时,语音细节为何不再左右词汇竞争
标签:#心理声学实验 #统计分析 #言语感知 #语音 #语音识别
评分:7.1/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.4/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音识别 | 主方法:#心理声学实验
👥 作者与机构
- Will Chih-Chao Chang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaxuan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语词识别需在声学展开中解决目标词与最小对竞争词的词汇竞争,关键是亚音位细节与句子预测如何加权。该研究先用范畴判定标定24对词首浊清塞音最小对的嗓音起始时间(Voice Onset Time,VOT)边界并挑选无歧义、部分歧义与最大歧义token,再在孤立词中测跨通道启动的身份优势(identity advantage),随后将相同token剪接到高低可预测句中并在目标词偏移处测视觉词汇判断。与锐化账户不同,预测编码与贝叶斯先验主导预测语境应削弱语音证据权重。在孤立词跨通道启动任务条件下,无歧义token的身份优势指标为β=0.051,高于最大歧义token的身份优势指标β=-0.007。句子中高可预测语境身份优势更大且嗓音起始时间调制消失,支持语境覆盖语音证据而非增强其分辨力。结论仅适用于英语词首塞音、先行预测语境与偏移点启动范式,未验证阈值渐变性与编码保真机制。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
198. 因果受限下做增强:RT-SEMamba 用固定状态流式推理再把 8 层蒸馏进 1 层
英文题目:RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation
标签:#知识蒸馏 #状态空间模型 #严格因果 #实时处理 #语音增强
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#状态空间模型
👥 作者与机构
- Rong Chao:机构信息未能从会议 PDF 纯文本可靠映射
- Sung-Feng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Moreno La Quatra:机构信息未能从会议 PDF 纯文本可靠映射
- Sabato Marco Siniscalchi:机构信息未能从会议 PDF 纯文本可靠映射
- Wen-Huang Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Szu-Wei Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道实时语音增强需在仅用历史与当前帧的严格因果条件下,从噪声复谱中恢复干净幅度与相位,同时满足低算法延迟与低实时率。RT-SEMamba先将复数短时傅里叶变换(Short-Time Fourier Transform,STFT)输入送入因果编码器与因果时频Mamba堆叠进行逐帧建模,再经双解码器输出增强幅度、相位与复谱并由逆变换合成波形。接着冻结的8层教师通过输出级与归一化中间特征级信号,以渐进权重将知识压缩至1层学生,学生编码器、解码器与单模块权重由教师初始化后联合优化。相比依赖增长键值缓存的Transformer,该方案以固定尺寸循环状态实现逐帧递推,避免长序列缓存膨胀与重复计算。在VCTK-DEMAND测试集上,蒸馏后1层学生PESQ从3.06提升至3.18,保持0.11稳态实时率不变,约为8层教师0.29的三分之一,恢复约46.2%的师生PESQ差距。该结论目前仅在该单数据集与16 kHz受控混合条件下成立,未验证混响、移动噪声与跨语料泛化。原文未披露优化器、学习率、批量大小与训练成本。
🔗 开源资源
- 代码相关资源:https://github.com/RoyChao19477/RT-SEMamba — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
199. 一个提示多种声音:OTAFlow 用分布对齐与条件流建模跨模态风格
英文题目:Bridging the Gap: A Hierarchical Framework for Cross-Modal Style Modeling in Expressive TTS
标签:#对比学习 #流匹配 #多任务学习 #语音 #文本到语音
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Jiale Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaxun Li:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanpeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuehai Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自然语言提示的表现力合成输入为风格描述文本,输出为对应情感韵律的语音,难点在于文本与音频的模态表征鸿沟及单提示对应多合理实现的映射不确定性。方法第一步冻结CLAP双编码器并加双侧轻量适配器,以熵正则最优传输做分布级对齐,结合对称InfoNCE对比与情感、音高、能量多任务监督构建统一风格空间。第二步以条件流匹配建模给定文本风格嵌入下音频风格嵌入的条件分布并采样,采样结果作为后续合成的风格条件,保留多样性与随机性。第三步将采样风格嵌入与文本送入基于扩散变换器的流匹配声学模型生成梅尔频谱,再经声码器合成波形。相比纯点对点对比学习,分布级传输对一对多歧义更鲁棒,对比项维持实例级匹配结构,多任务监督增强因子可分性,实际意义是检索对齐与合成风格一致性同步提升。在TextrolSpeech平衡测试集文本到音频检索中达到R@10为0.875、MedR为4,音频到文本R@10为0.912,明显高于同骨干纯对比或纯传输变体;下游合成在无参考与有音色参考两轨的风格主观分(sMOS)与情感相似度(ESIM)上均领先CosyVoice2、IndexTTS2和EmoVoice。该结论仅在约330小时英文语料、400条检索库与Matcha-TTS改造的轻量骨干下验证,未证明跨语言、跨说话人与开放域外推能力,原文未披露训练推理成本与声码器型号。
🔗 开源资源
- 演示资源:https://sunny00952.github.io/OTAFlow/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
200. 驱动脸动的究竟是音色还是音位:四类语音表示的对照与统一视听合成
英文题目:From Tokens to Faces: Investigating Discrete Speech Representations for 3D Facial Animation
标签:#评测协议 #主观评测 #音视频 #语音 #音视频生成
评分:7.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频生成 | 主方法:#评测协议
👥 作者与机构
- Pedro R. Corrêa:机构信息未能从会议 PDF 纯文本可靠映射
- Olivier Perrotin:机构信息未能从会议 PDF 纯文本可靠映射
- Samir Sadok:机构信息未能从会议 PDF 纯文本可靠映射
- Paula D. P. Costa:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Hueber:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音驱动三维面部动画需以语音波形为输入预测时间连贯的ARKit混合形状形变轨迹,难点在于语音表示混杂音位类别、协同发音与韵律,何种信息真正驱动口型尚不清楚。方法链分三步衔接:第一步冻结HuBERT、SpeechTokenizer、WavTokenizer与CosyVoice2四类语音编码器抽取语义、声学与标签表示,第二步将所得帧级词元序列送入GRU逐帧去噪或Transformer跨注意力解码器以L1加速度平滑损失映射为51维混合形状序列,第三步以音位-视素共现探测量化词元可分性并复用TTS词元并行解码语音与面部实现同步。与仅用连续自监督学习 Self-Supervised Learning / SSL特征的主流做法不同,该链以全声学与全标签离散词元对照信息瓶颈,并以共享离散空间打通文本到语音与面部的统一合成,免去先合成音频再驱动动画的两阶段。在 BEAT2 测试集约4小时265条刺激上标签表示结合 Transformer 解码器在双唇闭合得分 Bilabial Closure Score / BCS 上达到47.0%,接近基线57.5%且感知评分无显著差异,但传统唇部误差 Lips Vertex Error / LVE 仍落后。该结论仅在英语独白与离散词元加轻量解码器范围内成立,向多语、强情感与实时系统的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/ProdCor/Token-to-Face — 链接可访问(HTTP 200)
- 代码相关资源:https://github.com/uuembodiedsocialai/FaceDiffuser — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
201. 先隔离再融合:SeRIn 把单模态精炼与跨模态混合拆成两步
英文题目:Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis
标签:#多模态学习 #大语言模型 #音视频 #语音情感识别
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Alexios Filippakopoulos:机构信息未能从会议 PDF 纯文本可靠映射
- Elias Kallioras:机构信息未能从会议 PDF 纯文本可靠映射
- Nikolaos Xiros:机构信息未能从会议 PDF 纯文本可靠映射
- Efthymios Georgiou:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandros Potamianos:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态情感分析(Multimodal Sentiment Analysis,MSA)需从文本、音频、视觉联合预测情感极性与强度,难点是三者几何不同且可互补或矛盾,单次融合常把单模态精炼与跨模态混合纠缠在同一操作。所提 SeRIn(Segregate, Refine, Integrate,分离-精炼-集成)把该解耦做成架构先验:先将可学习融合词元硬划分为音频组、视觉组和音视频组并用模态约束掩码隔离,再经内部门控交叉注意力和内部门控自注意力分别注入各自编码器上下文并组内巩固,最后才在集成头解除隔离做无约束交互。与 DeepMLF(Deep Multimodal Language Model with Fusion,深度融合语言模型)无差别融合池不同,差异是把拓扑写进前向掩码而非靠优化隐式形成。在 CH-SIMS 上二分类准确率(Binary Accuracy,Acc2)相对 DeepMLF 从 82.58% 提升到 84.30%,在 CMU-MOSEI 上从 86.77% 提升到 87.79%,两库所有报告指标均为最优。作者承认拓扑在有显式模态通路架构外效果待验证,且未系统测试弱相关或冲突极性下的门控行为。计算上 SIMS 配置需 290 GFLOPs 和 92M 参数、推理约 2.09 ms每样本,MOSEI 配置为 1702 GFLOPs 和 183M 参数、约 3.00 ms每样本,相对 DeepMLF 的额外开销主要来自每层三组独立交叉注意力。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
202. 不加模块也能更稳:用更少的图节点做语音防伪
英文题目:SpAArSIST: Sparsified AASIST for Efficient and Reliable Anti-Spoofing
标签:#模型剪枝 #高效推理 #鲁棒性 #语音伪造检测
评分:7.1/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#模型剪枝
👥 作者与机构
- Anton Firc:机构信息未能从会议 PDF 纯文本可靠映射
- Vojtěch Staněk:机构信息未能从会议 PDF 纯文本可靠映射
- Zbyněk Lička:机构信息未能从会议 PDF 纯文本可靠映射
- Kamil Malinka:机构信息未能从会议 PDF 纯文本可靠映射
- Martin Perešíni:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音伪造检测需把波形映射为真伪二分类,并在未知合成算法与信道下保持阈值可迁移,难点是谱时关系建模易过拟合训练域。该工作固定 XLS-R 300M 前端,先输出帧级表征并构建时域与频域双视图图节点,再经图注意力交互传播长程依赖,接着用节点打分做 top-k 剪枝聚焦显著区域,最后由堆叠节点汇总为 1024 维话语向量送入分类头。与增加新模块的 AASIST 扩展不同,该方法把可学习打分替换为范数排序代理,把高温注意力汇总显式改为均值,并解耦训练保留率 \(ktr\) 与推理保留率 \(kinf\) 以控制计算。最优配置 AST-03-01-Mag 在 In-the-Wild 上相对基线 EER 从 4.64% 降至 2.82%,minDCF 从 0.133 降至 0.078,同时后端 MAC 从 195.045M 降至 154.706M,参数从 611.8k 降至 586.4k;域内 ASVspoof 5 判别略降但校准明显改善。该结论限于 XLS-R 管线与所用增强训练流程,尚未验证其他前端、语言与攻击分布的可迁移性。原文只披露后端 MAC 与不含前端的后端时延,未披露端到端训练耗时与完整部署内存成本。
🔗 开源资源
- 代码相关资源:https://github.com/Security-FIT/SpAArSIST — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/TakHemlata/SSL_Anti-spoofing — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/clovaai/aasist — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
203. 高分不等于听见:文本先验与局部音频线索如何抬高音频语言评测
标签:#评测协议 #音频大模型 #模型评估 #音频问答
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#评测协议
👥 作者与机构
- Leonardo Haw-Yang Foo:机构信息未能从会议 PDF 纯文本可靠映射
- Chih-Kai Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Chen-An Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ke-Han Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型(Large Audio-Language Models,LALMs)的评测输入为音频片段加文本选择题,输出为选项或开放回答,难点是高分可能来自语言先验而非听觉感知。本文提出双轴诊断,先以文本骨干(Text Backbone,TB)、去音频(None)与全音频(Full)对照分离文本先验,再将音频切分为N等长片段独立作答并计算保持率(Retention Rate,RN)以检验全局依赖,最后按三条件正确性将题目划入5类以支撑后续细粒度分析。与用30秒静音替代无音频的前人做法不同,该框架完全移除音频输入以避免静音干扰,并用片段充分(Fragment-Sufficient,FS)与跨片段(Cross-Segment,XS)类别区分局部线索与整体理解。在MMAU语音任务评测下,Full条件的准确率为67.2%,高于None条件的准确率39.5%,且音频依赖题目中仅3.0%至4.2%需要完整音频。该结论适用于当前以短时问答为主的MMAU系列基准,对长时叙事与交互式听觉推理的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
204. 提示学得越好,新类忘得越多:ZEBRA 用零样本锚定拉回泛化
标签:#提示学习 #正则化 #少样本 #零样本 #音频分类
评分:7.1/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#提示学习
👥 作者与机构
- Asif Hanif:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Yaqub:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频语言模型零样本分类依赖音频编码器与文本编码器对齐,输入为音频波形与类别文本描述,输出为类别相似度排序,难点在于少样本提示调优后基类精度上升但新类泛化塌陷。所提ZEBRA冻结预训练主干并优化可学习上下文提示,再将一次性计算的零样本逻辑与提示学习逻辑按等权相加形成融合逻辑,最后在交叉熵上减去融合分布自熵以惩罚过自信预测。与仅用基类监督优化提示的上下文优化相比,关键差异是用零样本决策空间锚定适配并用熵最大化拉平决策边界,而非引入新参数重塑表示,实际意义在于保留预训练语义对齐的同时获得有监督适配收益。在11个数据集平均的评测设置下,COOP+ZEBRA的新类准确率为59.37%,高于ZERO-SHOT的新类准确率55.18%。结论仅在Pengi编码器与每基类16样本及既定基类-新类划分下成立,跨编码器与开放词汇外推尚未验证。原文披露训练与测试耗时几乎无增加,可视为可忽略开销。表3显示其训练成本与推理开销仅增加数秒,计算量几乎不变。
🔗 开源资源
- 代码相关资源:https://github.com/asif-hanif/zebra — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
205. 口音面前编解码与克隆语音还能保真吗:CodecMOS-Accent 的重合成与跨口音主观基准
标签:#基准测试 #众包评测 #语音编码 #语音质量评估 #语音克隆
评分:7.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音质量评估 | 主方法:#众包评测
👥 作者与机构
- Wen-Chin Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Sanders:机构信息未能从会议 PDF 纯文本可靠映射
- Erica Cooper:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以待测语音与同说话人异语句参考语音为输入,输出自然度、说话人相似度与口音相似度三维平均意见得分,难点在于口音相似缺乏统一主观协议且易与音质和音色混淆。作者先从VCTK筛选32位说话人覆盖10种口音、每人5句共160句真值,再用9个神经编解码器重合成与15个大语言模型克隆开源系统生成4000个样本以覆盖宽质量谱。前一步样本进入众包听音环节,由25名听音人完成19600条三维标注使每样本约获4.9次评分,最后叠加词错误率、说话人余弦相似度、口音余弦相似度与UTMOS预测分做系统级关联与偏差分析。相对已有方法关键差异在于同时评估重合成与语音克隆并分离说话人与口音相似度量,使口音泛化与音色保持能力可被独立检验而非混为音质好坏。在包含9个重合成与15个克隆系统的基准下,NanoCodec的S-NAT得分为4.073,高于Ground Truth的S-NAT得分4.045。结论适用边界是朗读式英语多口音、开集开源系统与众包听音场景,尚未验证自发对话、强噪声、非英语口音及商用闭源系统的外推有效性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/Plachtaa/VALL-E-X — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
206. 匿名也要可控:用条件 WGAN 与分类器引导扩散生成性别可控的伪说话人向量
英文题目:Controlled Generation of Synthetic Speaker Vectors for Voice Anonymization
标签:#扩散模型 #生成对抗网络 #隐私保护 #语音 #说话人匿名化
评分:7.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#扩散模型
👥 作者与机构
- Ekaterina Kolos:机构信息未能从会议 PDF 纯文本可靠映射
- Sarina Meyer:机构信息未能从会议 PDF 纯文本可靠映射
- Ngoc Thang Vu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人匿名化(Speaker Anonymization)需保留语言与韵律但替换说话人身份,难点是伪说话人向量既要适配合成器分布又要可控保留性别等属性且不复制真人。本文基于语音到文本到语音(Speech-to-Text-to-Speech,STTTS)基线B3:先分解内容、韵律与128维全局风格标记(Global Style Tokens,GST)话语级向量,再由向量生成器按性别标签采样伪向量,最后重合成匿名音频。提出两条条件路线:条件二次代价生成对抗网络(conditional WGAN-QC,cWGAN-QC)将标签嵌入注入生成器与评论器并按类别求解二次代价最优传输;分类器引导扩散(Diffusion+Classifier Guidance,CG)在去噪采样中以外挂噪声鲁棒性别分类器梯度修正预测噪声。另提出向量池三维筛选指标:自然度近似Wasserstein-2距离、多样性平均余弦距离、原创性复制相似度,加无抽取模块的哈佛句合成字准确率。在Voice Privacy Challenge 2024套件上,条件扩散女性等错误率(Equal Error Rate,EER)达30.11%,cWGAN-QC性别声学准确率女性99.86%、男性100.00%,隐私与效用与无条件基线相当。结论限于英语朗读LibriSpeech与情感IEMOCAP的性别二分类,未验证年龄、口音、风格等多标签外推。
🔗 开源资源
- 代码相关资源:https://github.com/katja-kolos/synthetic-speaker-vectors — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/huggingface/diffusers — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
207. 从全局相似到逐事件核验:用音频大模型的细粒度反馈教文本音频跟指令
标签:#基准测试 #偏好优化 #音频大模型 #音频生成
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频生成 | 主方法:#偏好优化
👥 作者与机构
- Chun-Yi Kuan:机构信息未能从会议 PDF 纯文本可靠映射
- Siwon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Byeonggeun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Suyoun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Bo-Ru Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Qingming Tang:机构信息未能从会议 PDF 纯文本可靠映射
- Ankur Gandhe:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Chieh-Chi Kao:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到音频生成实际难点是输入为包含多个声音事件与时序约束的指令,输出须同时保证事件齐全与顺序正确,而全局相似度常对漏事件与逆序不敏感。本文提出音频感知大语言模型裁判的偏好优化框架(ALLM-Judged Preference Optimization),链路分三步:先在理解基准与人工抽查上验证裁判的事件存在与时序判断能力,再对每条指令采样多候选音频并由裁判输出存在得分与排序相关得分,最后按双满分为优选、缺事件或乱序为拒选构造偏好对并用直接偏好优化(Direct Preference Optimization,DPO)训练生成模型。与依赖对比相似度排序或静态人工偏好的已有方法相比,该机制把监督从粗粒度匹配改为对事件级与关系级的显式验证。在AudioCaps-test上该方法联合准确率达到71.0%,高于最强基线TangoFlux-CRPO的67.4%,且时序完全匹配率同步提升至89.1%。该结论目前仅在英文描述、2至4事件及叙事化但受控的评测上成立,对重叠严重、背景噪声强与更长事件链的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
208. 4 毫秒做判决:QuadVAD 如何把边界精度、噪声鲁棒和 25 KB 共存
英文题目:QuadVAD: Fine-Grained Speech Detection with a Compact Architecture
标签:#CNN #RNN #高效推理 #语音 #语音活动检测
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.4/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音活动检测 | 主方法:#CNN
👥 作者与机构
- Ramakrishna Chaitanya Rachumallu:机构信息未能从会议 PDF 纯文本可靠映射
- Nivedita Chennupati:机构信息未能从会议 PDF 纯文本可靠映射
- Ankit Gupta:机构信息未能从会议 PDF 纯文本可靠映射
- Balaji Padmanaban:机构信息未能从会议 PDF 纯文本可靠映射
- ParvathiPriyanka Bolla:机构信息未能从会议 PDF 纯文本可靠映射
- Harish Rajamani:机构信息未能从会议 PDF 纯文本可靠映射
- Naveen Ambati:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音活动检测(Voice Activity Detection, VAD)需在连续音频流中输出语音与非语音判决,常开边端场景要求低算法延迟、低功耗与噪声鲁棒同时满足,粗帧网格易造成起始辅音截断。该文构建大规模合成加微调两阶段数据管线,先用蒙特利尔强制对齐器(Montreal Forced Aligner, MFA)对筛选后LibriSpeech生成词级标签并做混响加噪增广,再在TIMIT手工对齐集上微调边界;模型以可学习卷积滤波器组替代固定短时傅里叶变换(Short-Time Fourier Transform, STFT)求幅度特征,经四层层次卷积压缩为紧凑表示,最后由长短期记忆(Long Short-Term Memory, LSTM)单元平滑并输出4ms逐帧概率,训练用二值交叉熵(Binary Cross Entropy, BCE)加平滑损失抑制毛刺。与16ms至40ms的Silero VAD、TenVAD、ResectNet方案不同,其差异在于端到端学习谱灵敏度并显式保持因果细粒度输出。在TIMIT测试集上AUC-ROC为0.97,超过TenVAD的0.952和Silero VAD的0.924;在Earnings21上为0.94,在VoxConverse上与TenVAD持平为0.93。系统约6k参数、25KB、25 MFLOPs、算法延迟4ms,在第13代Intel Core i7笔记本上实时因子为0.0014。跨语言稳健性仅有趋势性表述而无系统数值,AVA-Speech因标签偏移超100ms被判不适合细粒度评测。
🔗 开源资源
- 第三方资源:https://github.com/snakers4/silero-vad — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/TEN-framework/ten-vad — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
209. 语音 token 太多太冗余:用相似度自适应合并保住内容
英文题目:AdaTS: Adaptive Token Sampling for Efficient Speech Language Models
标签:#模型剪枝 #高效推理 #长音频处理 #语音识别 #音频问答
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型剪枝
👥 作者与机构
- Sonal Sannigrahi:机构信息未能从会议 PDF 纯文本可靠映射
- Giuseppe Attanasio:机构信息未能从会议 PDF 纯文本可靠映射
- André F. T. Martins:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音语言模型的任务是以连续语音波形经梅尔滤波器组特征为输入,输出转录、翻译或问答文本,但每20ms一帧的高频语音编码送入大语言模型后,长音频下上下文爆炸且大量语音词元时间冗余,静态池化又会损伤内容密集区。所提自适应词元采样先由 Wav2Vec2Bert 编码得到特征序列,再计算相邻词元余弦相似度并按阈值切分连续子组,最后对子组内词元做逆相似度加权合并后送入投影器与解码器。与均匀卷积下采样和基于联接时间分类的迭代融合不同,该机制在冗余区形成粗粒度表示而在内容区保留细粒度分辨率。在 FLEURS 英译多语语音翻译上其 COMET-22 达 82.0,超过同解码器的卷积池化与窗口级 Q-Former 基线,同时平均压缩约 2 倍,最大约 4.16 倍。该结论主要在 30s 内英文短音频训练、小规模解码器和英译多语设置下验证,长音频泛化与多语口音鲁棒性尚未充分证明。推理侧 10s 音频约需 2.14 TFLOPS,比卷积下采样的 3.23 TFLOPS 低约 34%。
🔗 开源资源
- 代码相关资源:https://github.com/sonalsannigrahi/AdaTS — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
210. 一个主干加七个轻量适配器:在不换整机模型的条件下切换语音增强的前视时长
标签:#Adapter #单通道 #流式处理 #语音增强
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#Adapter
👥 作者与机构
- Hiroshi Sato:机构信息未能从会议 PDF 纯文本可靠映射
- Takafumi Moriya:机构信息未能从会议 PDF 纯文本可靠映射
- Tsubasa Ochiai:机构信息未能从会议 PDF 纯文本可靠映射
- Marc Delcroix:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为单通道加性噪声观测y=x+n,输出为估计干净波形,难点在于助听级数毫秒到电话广播级数百毫秒的延迟预算差异极大,而多数神经增强模型只能在单一预定前视下训练部署,难以按预算利用未来上下文。本文提出延迟可控增强框架,先以因果Conv-TasNet编码器分隔器解码器主干在无未来帧条件下完成主体增强映射,其输出表示进入下一步。接着在分隔器之后插入由空洞一维卷积堆叠构成的延迟控制适配器库,每档适配器以因果与非因果模式组合注入特定右向未来帧,运行时切换适配器即切换延迟而无需重载主干。最后采用批内多延迟联合训练与参数共享策略协同优化主干与适配器,使跨延迟知识共享并使共享型适配器开销与档数无关。相对逐延迟独立训练全模型与固定卷积前视方案,该机制以轻量适配器选择替代多模型存储切换,具有运行时可切换的实际意义。在LibriSpeech与DNS4合成噪声评测设置下,LCA无共享模型的SDR为17.03,高于去除整体联合训练基线的SDR 16.67。该结论适用边界受限于合成加性噪声与客观SDR与DNSMOS验证,尚未验证真实录音强混响竞争说话人与主观听感外推,且七档共享将存储参数由104.1M压缩至24.5M,推理开销维持约1.46G每秒计算量与标准延迟20至650毫秒对应延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
211. 儿童长时录音建不出可比基准:用统一结构、基准管线与分级治理一起解
英文题目:Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities
标签:#数据集 #基准设计 #隐私保护 #语言习得 #说话人分离标注
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#说话人分离标注 | 主方法:#基准设计
👥 作者与机构
- Kaveri K. Sheth:机构信息未能从会议 PDF 纯文本可靠映射
- Lawrence Borst:机构信息未能从会议 PDF 纯文本可靠映射
- Tarek Kunze:机构信息未能从会议 PDF 纯文本可靠映射
- Marvin Lavechin:机构信息未能从会议 PDF 纯文本可靠映射
- Okko Räsänen:机构信息未能从会议 PDF 纯文本可靠映射
- Sho Tsuji:机构信息未能从会议 PDF 纯文本可靠映射
- Loann Peurey:机构信息未能从会议 PDF 纯文本可靠映射
- Alix Bourree:机构信息未能从会议 PDF 纯文本可靠映射
- Alejandrina Cristia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童中心长时录音以佩戴式麦克风采集全天音频,输入为高噪声、重叠、多语言自然交互,输出为说话人分段、指向性、成熟度与转写,直接难点是跨站点格式与知情同意异构、无共享评测以及儿童敏感语音难合规共享。方法链分三环相扣:先用 DataLad 与 ChildProject 对 27 个含人工标注集的语料统一目录与儿童、录音、标注三级元数据,使标注可程序化检索;再将异构标注映射到统一标签并按儿童不相交划分导出四个基准,流水线以嵌套数据集方式可随语料增改重跑;最后以角色分级治理 ELSI按需分配原始音频、带标签片段与衍生指标的访问权限。与仅用公开语料或单语料训练评测的做法不同,该框架把治理嵌入训练评测全流程,使受限多语言数据可合法汇入基准。在声音类型分类留出测试上,用全量汇聚数据微调的模型平均 F1 达到 62.2%,明显高于仅用公开子集微调的 44.4%,但仍低于原始 VTC 2.0 的 65.1% 与人类一致性的 69.8%。结论仅适用于已标准化的合作语料与儿童不相交划分,对指向性、成熟度、转写三个基准及未覆盖语种的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/LAAC-LSCP/benchmarking-dataset-factory — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
212. 同时测抑郁和焦虑的德语语音:GADVOX 如何把众包自由言说变成可回归的严重度标签
英文题目:GADVOX: The German Anxiety and Depression Voice Examination Dataset
标签:#语音生物标志物 #数据集 #数据集构建 #语音 #病理语音评估
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#病理语音评估 | 主方法:#数据集构建
👥 作者与机构
- Robert P. Spang:机构信息未能从会议 PDF 纯文本可靠映射
- Wafaa Wardah:机构信息未能从会议 PDF 纯文本可靠映射
- Hritik Sauw:机构信息未能从会议 PDF 纯文本可靠映射
- Ole Möller-Nilsson:机构信息未能从会议 PDF 纯文本可靠映射
- Etleva Gjoni:机构信息未能从会议 PDF 纯文本可靠映射
- Stefan Brandenburg:机构信息未能从会议 PDF 纯文本可靠映射
- Maria Kreußlein:机构信息未能从会议 PDF 纯文本可靠映射
- Lana Mohr:机构信息未能从会议 PDF 纯文本可靠映射
- Sebastian Möller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对德语缺乏焦虑抑郁语音资源、现有英语访谈语料难以兼顾双症状共病建模的问题,本文以情感中性自发语音为输入、以PHQ-9与GAD-7双量表连续严重度为输出构建筛查指示资源。采集链先经实验室预实验迭代筛选出十条中性结构化提示,再经众包平台随机呈现提示并同步采集语音、自评量表与人口学信息,随后经注意力检查与人机语音筛查过滤会话,最后拼接会话音频并用SQ-AST计算语音质量剖面随元数据发布。相比以临床访谈为主的DAIC-WOZ抑郁语料,关键机制差异在于同一人同时提供声学证据与双目标连续标签,支持多目标回归与共享痛苦因子分析,具有共病解耦研究意义。在GADVOX语料的语音质量关联评测下,GAD-7条件的Pearson相关系数为.015,高于PHQ-9条件的Pearson相关系数为.008。该结论仅适用于众包高教育水平人群的筛查指示建模,不能外推为临床诊断依据,且方言与录音环境未经系统控制。其适用边界受限于众包人群偏移与非临床自评标签,尚未验证临床诊断外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://osf.io/k4z2v/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
213. 从随机攒句子到覆盖全部音素:corpusgen 如何把语料设计变成可计算的选择题
标签:#开源工具 #数据集构建 #语音学与音系 #多语言 #文本到语音
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#文本到语音 | 主方法:#数据集构建
👥 作者与机构
- Muntaser Syed:机构信息未能从会议 PDF 纯文本可靠映射
- Marius Silaghi:机构信息未能从会议 PDF 纯文本可靠映射
- Sharun Akter Khushbu:机构信息未能从会议 PDF 纯文本可靠映射
- Fariha Jaigirdar:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该文面向低资源语言语音语料设计的输入输出难题,输入为任意文本池与目标语言码,输出为音素覆盖率最大且句数最少的待录制子集,难点在于跨语言字音转换不一致与集合覆盖的NP难优化。方法链分三步衔接:基础设施层先用espeak-ng经Phonemizer转写为国际音标,再经映射桥对齐至PHOIBLE典型音库,由覆盖追踪器维护计数并为后续模块提供统一符号输入。评估模块基于该计数输出音素、二音素、三音素覆盖率及分布指标,选择模块在同一计数上运行贪心与精确算法得到候选子集,生成模块再针对剩余缺口定向造句回填。与FestVox等单语贪心管线相比,差异在于语言无关架构加多目标与分布感知优化加可插拔生成后端,意义是降低新语言建库门槛。原文未提供可核对的关键定量结果。结论仅适用于有espeak-ng与PHOIBLE支撑的语言,转写错误大或无文本池时的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/jemsbhai/corpusgen — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
214. 听不清、记不住、串证据:VISA 用看得见的声学线索稳住音频推理
标签:#模型集成 #多模态学习 #音频大模型 #音频问答
评分:7.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#音频问答 | 主方法:#模型集成
👥 作者与机构
- Wenming Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Yanru Huo:机构信息未能从会议 PDF 纯文本可靠映射
- Yixuan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Bohan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyang Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zilong Zheng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向混合音频的音频推理任务输入为音频、问题与候选项,输出为答案与思维链,难点在于噪声重叠下长时整合与细粒度感知不足且推理缺乏可解释性。VISA先做多模态特征抽取,将声学描述、语义字幕、问句驱动事件时间戳与VLM解析的声谱视觉线索并行生成可交叉核验的文本化证据。再把证据与原音频送入两个大型音频语言模型独立做三次随机采样投票,以多数投票得到各自预测并在三票全分歧时用确定性兜底。当两模型预测分歧时按细粒度类别路由选择思维链,对高层语义逻辑用大语言模型评判连贯性,对信号感知类用视觉谱推理策略决定最终答案。该设计与纯端到端推理或重编排智能体的差异在于以大型音频语言模型为工具而非被调度对象,用外部视觉接地替代转录中间件并保留投票一致性校验。在Interspeech 2026音频推理挑战智能体赛道任务下,VISA的准确率为77.40%,高于Team D的准确率76.90%。其结论限于选择题式短音频问答与双模型组合,开放域生成、长音频与跨数据集迁移尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
215. 从散架到锁死:Whisper 幻觉随规模发生的谱相变
英文题目:From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales
标签:#形式化分析 #对抗鲁棒性 #可解释性 #语音 #语音识别
评分:7.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音识别 | 主方法:#形式化分析
👥 作者与机构
- Ivan Viakhirev:机构信息未能从会议 PDF 纯文本可靠映射
- Kirill Borodin:机构信息未能从会议 PDF 纯文本可靠映射
- Grach Mkrtchian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别以声学证据为输入并输出转写文本,在静音、噪声与扰动下大模型仍高置信输出无据内容,传统词错率难以预警这种解耦。作者先将解码器堆叠建模为含外部声学上下文的条件动力系统并推导上下文雅可比矩阵,再把逐层传播子分解为主导秩1方向与残差并引入谱间隙、层间对齐与有效增益刻画信号保持或坍缩,随后用激活奇异谱的有效秩、谱衰减指数与基尔霍夫指数作为可观测代理,最后在对抗LibriSpeech上对比Tiny至Large-v3-Turbo的跨注意力与自注意力演化。与只看词错率或置信度的方法不同,该机制区分色散导致的解体区与对齐增强导致的吸引子区,解释了小模型丢信号与大模型锁先验的不同失效意义。在对抗LibriSpeech评测条件下,Small解码器跨注意力的有效秩变化指标为-13.40%,低于Tiny的有效秩变化指标-11.98%。Large模型则出现自注意力压缩与谱硬化并锁定内部先验。结论仅限于 Whisper 编解码器家族与三类强扰动下的幻觉样本,未验证其他架构、自然分布偏移与在线检测有效性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
216. 把重活交给解码器:ZipCodec 用 4.4M 编码器做单阶段语音分词
英文题目:ZipCodec: Simple and Pretrained-Model-Free Speech Tokenizer via Flow-Matching
标签:#知识蒸馏 #流匹配 #语音 #语音编码
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#流匹配
👥 作者与机构
- Lingxuan Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Han Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Liyong Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Zengwei Yao:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Fangjun Kuang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhifeng Han:机构信息未能从会议 PDF 纯文本可靠映射
- Long Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Povey:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音分词器需把连续波形压缩为离散单元,同时兼顾可重建声学细节与可供语言模型推理的语义结构,难点在于低码率量化会放大不确定性并诱发语义声学冲突。ZipCodec先将24 kHz梅尔频谱经两层步长2卷积下采样4倍送入轻量Zipformer编码器得到连续嵌入,再经有限标量量化离散为每秒23.44帧、约1.97 kbps令牌并回映射为条件向量,接着以Zipformer为主干的流匹配解码器从高斯噪声经由常微分方程求解重建梅尔频谱,最后由Vocos声码器合成波形。与依赖HuBERT或Whisper蒸馏及语义旁路模型的主流路线不同,该方法以强生成式解码器吸收重建压力,并用编码器一致性正则化迫使编码器关注噪声不变结构。在Librispeech PC test-clean重建评测中ZipCodec取得词错率为2.21%,优于编码器大20倍以上的多个基线并接近Vocos上界2.14%。结论受限于梅尔域加Vocos上界、仅中英数据验证及缺乏语义理解类下游评测。训练使用Emilia中英约96.7k小时数据迭代400k步,推理需10步函数求值,蒸馏版可降至3步。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
217. 推理越长反而越差:把声音当成文字来想的陷阱
英文题目:Step-Audio-R1: Why Audio LLMs Fail at Reasoning — The Trap of Textual Surrogates
标签:#知识蒸馏 #强化学习 #音频大模型 #音频问答
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#音频问答 | 主方法:#知识蒸馏
👥 作者与机构
- Yuxin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Daijiao Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Yayue Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Donghang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Liang Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Chengyuan Yao:机构信息未能从会议 PDF 纯文本可靠映射
- Gaolei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Quanhai Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Qiquan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Hexin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
- Xuerui Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Daxin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Gang Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理语音、环境声与音乐波形输入,输出显式思维链与最终答案,难点是既有音频大模型随思维链变长反而退化,因其依赖转写文本替代推理而非声学分析。冷启动先以文本推理、对话与音频数据联合监督微调并结合可验证奖励强化学习建立基础推理能力,其形成的音频思维链能力为后续蒸馏提供起点。模态接地推理蒸馏每轮用上一代模型采样多条候选,经声学接地、逻辑连贯与答案正确三准则筛选后与文本推理数据联合监督微调,将推理锚定到声学特征。多模态可验证奖励强化学习以答案正确加思维格式奖励优化策略并迭代多轮,其维持的长链输出再回流下一轮蒸馏,形成蒸馏与强化交替的闭环。与仅用语言模型评判答案一致性的方法不同,该框架直接筛选声学描述并以格式奖励对抗简答偏好,使长时 deliberation 保留声学分析而非退化为文本捷径。在5个语音理解与推理基准下,Step-Audio-R1的平均得分为83.6%,高于Gemini 2.5 Pro的平均得分81.5%。结论仅在所测 5 个语音推理基准与 Big Bench Audio 实时语音到语音适配上成立,对音乐与环境声细粒度感知、强歧义音频尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
218. 文字说很好、声音却在讽刺时:让音频语言模型先解耦再做四步共情推理
标签:#数据集 #强化学习 #语音情感识别 #语音对话系统
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#强化学习
👥 作者与机构
- Zhixian Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Shuiyuan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wenjie Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Jingbin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音共情对话任务,输入为带细粒度韵律与发音特征的用户语音,输出为细粒度情绪判断与共情回复,难点在于预训练文本语义主导导致讽刺与强颜欢笑等声义冲突样本被误判,且正确识别后仍回落到通用安慰模板。本文方法链为三段:先用一文多情绪合成与 EIPS 标注构建解耦数据并以显式监督微调建立从声学感知到策略规划的完整推理,再以显隐提示等比混合训练将显式思维链内化为直接回复时的隐式激活,最后以双路由软自适应策略优化分别奖励显式链路的逻辑严谨与隐式链路的共情对齐。与仅描述音高语速的声学描述式思维链不同,该框架引入意图挖掘与心理建模等心理学推演并实现推理效率与深度的解耦。在 HumDial-EIBench 冲突子集上,隐式回复共情 LLM 评分为 2.91 分、人工评分为 3.16 分,显著高于 GPT-4o-Audio 的 1.82 分与 1.68 分,冲突情绪准确率从基座的 24.0% 提升至 46.0%。结论仅在中英文短轮单句与合成语音训练条件下验证,对真实自发微韵律与多轮情绪演化的外推尚未证明。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/zxzhao0/CogAudio-LLM — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/zxzhao0/CogAudio-LLM — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/datasets/ASLP-lab/HumDial-EIBench — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
219. 音频太长反而碍事:用自适应压缩让双模态音乐情绪识别更准
英文题目:Less is More: Boosting Bimodal Music Emotion Recognition with Adaptive Audio Sequence Compression
标签:#多模态学习 #向量量化 #音乐 #音频分类
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#向量量化
👥 作者与机构
- Dinghao Zou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音乐情感识别需从音频波形与符号化MIDI(Musical Instrument Digital Interface)推断效价-唤醒度四象限标签,难点在于音频经MERT(Music Understanding Model with Large-Scale Self-Supervised Training)抽取后序列过长且信息稀疏,与紧凑MIDI表征存在密度失衡而稀释融合。全局平均或最大池化对瞬态与平稳区一视同仁易丢弃情感关键变化,而低帧率分词器重训代价高昂难以复用已有预训练表征。该文提出三步流水线:先用冻结的MERT-95M与MIDIBERT(MIDI Bidirectional Encoder Representations from Transformers)分别抽取双模态特征并以60 s与130 s时长上限减少截断;再以PoolingVQ(Pooling with Vector Quantization)对音频做自适应压缩,码本量化局部帧并以滑窗内唯一码数度量变化强度,平稳区平均池化而瞬态区最大池化后降采样至约25 Hz;最后将压缩音频与MIDI经拼接或两阶段交叉注意力融合后分类。融合后终融特征送入全连接分类头输出四类预测概率,并以交叉熵与码本约束联合优化以稳定离散划分与情感判别目标。与全局池化及低帧率重训练分词器相比,该机制无需重训主干且保留情感瞬态,在EMOPIA上交叉注意力融合取得准确率0.8953与宏F1 0.8955,显著超越双模态基线BFAM。该结论仅在钢琴独奏EMOPIA与200首游戏音乐子集上验证,复杂配器与长时结构外推未经检验。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://anonymous.4open.science/r/poolingvq — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
220. 不用干净人声也能学分离:只靠说话人身份做监督
英文题目:Speaker Identity as Sole Supervision for Speech Separation
标签:#对比学习 #弱监督学习 #语音 #语音分离
评分:7.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#对比学习
👥 作者与机构
- Christoph Boeddeker:机构信息未能从会议 PDF 纯文本可靠映射
- Yoshiki Masuyama:机构信息未能从会议 PDF 纯文本可靠映射
- Julius Richter:机构信息未能从会议 PDF 纯文本可靠映射
- Takahiro Edo:机构信息未能从会议 PDF 纯文本可靠映射
- Gordon Wichern:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Le Roux:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为单通道两人含噪混合波形,输出为两个说话人波形,难点是在无干净参考、无空间信息时难以定义重构目标。该方法先由分离器输出掩蔽估计并经排列不变原则对齐说话人顺序,再由嵌入器分别提取估计与辅助话语的说话人表示,最后以对比目标拉近同说话人锚点与正样本并排斥混合内竞争说话人与批内其他辅助。相比混合不变训练和自重混等信号级一致性方法,该机制用判别性身份约束替代波形重构,并将嵌入器训练与分离器更新解耦以避免适应伪影。嵌入器仅在训练阶段提供身份监督并与分离器联合优化,推理阶段分离器独立运行且不再需要辅助话语嵌入。在Libri2Mix max clean评测条件下,联合训练SIS模型的SDR为8.1 dB,低于波形监督上限模型的SDR 14.4 dB。结论仅适用于有稀疏单人段可采辅助话语的两人场景,未验证多人、强混响与真实长对话外推。原文未披露训练、推理与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/merlresearch/sis_sep — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
221. TurnGuide:按轮次先写文本再说语音的全双工对话建模
标签:#多模态学习 #多通道 #语音 #全双工语音交互 #轮次切换
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#全双工语音交互 | 主方法:#多模态学习
👥 作者与机构
- Wenqian Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiao-Hui Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhihan Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Haoli Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Lu Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Irwin King:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端全双工语音语言模型(Full-Duplex Speech Language Models,FD-SLMs)需同时建模用户与助手双通道音频,输入为连续双流语音标记,输出为可随时被打断与重叠的助手语音,难点在于长语音序列稀释语义且文本插入易破坏双通道时间对齐。TurnGuide 先用语音活动检测(Voice Activity Detection,VAD)与停顿合并得到幕间停顿单元(Inter-Pausal Units,IPUs),再用自动语音识别(Automatic Speech Recognition,ASR)获取词级时间戳并容差对齐为回合级图文对。接着在 GLM-4-Voice 主干上做通道级块交织以保留双流交互,同时在助手回合起点交织文本块引导后续语音块生成。相比 Moshi 式按发音时刻逐词插入文本,该回合级聚合保留了完整语义并明确了插入时机与长度。在 Fisher 测试集无条件生成下 TurnGuide 平均 GPT 得分达 8.61,明显高于语音块交织基线(Speech Chunk Interleaving,SCI)的 6.94。结论限于 120 秒电话闲聊延续与离线转写评测,未验证噪声、强重叠与实时流式声码器(vocoder)下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/jianfch/stable-ts — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
222. 谁的声音算数:自动语音识别里的语言政策与三害审计
标签:#评测协议 #公平性 #低资源 #多语言 #语音识别
评分:7.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.3/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Jay L. Cunningham:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Atta Mensah:机构信息未能从会议 PDF 纯文本可靠映射
- Richard Martinez:机构信息未能从会议 PDF 纯文本可靠映射
- João Vieira da Silva Neto:机构信息未能从会议 PDF 纯文本可靠映射
- Efi Dawodu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理自动语音识别与语音介导接口中语音到文本再到服务响应的映射,难点在于低资源语言、原住民变体、非标准方言、声调、搭嘴音、语码转换与敬语在既有基准下被系统性判为不可读。方法分三步,先以语言资本等四种传统综合出七层处境模型定位政策生效层级,其输出进入第二步,被解析为训练数据筛选、词错率类指标与语言模型先验构成的计算性语言政策。第三步以前述政策诊断为输入,用误识别、错位与不信任三害分类把转写错误扩展为语用与关系伤害,并落为参与式审计与共同设计的闭环治理。相对已有偏置研究的关键差异在于把失败从数据稀缺重述为规范秩序主动制造不可理解性,并把不识别与拒绝作为合法设计输出,其实质是将评估从词错率补充为语用充分性与信任度量。在后续跨语言审计规划设置下,规划覆盖上限的语言数指标为5种,高于规划覆盖下限的语言数指标3种。适用边界限于高风险公共服务与文化负载较重的语音交互,对小语种评审团规模与跨社区可靠性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
223. 去掉语言干扰再认人:正交投影与流形约束 PLDA 的跨语言说话人确认
标签:#模型融合 #自监督学习 #跨语言 #说话人验证
评分:7.0/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#说话人验证 | 主方法:#模型融合
👥 作者与机构
- Yuxuan Du:机构信息未能从会议 PDF 纯文本可靠映射
- Xing He:机构信息未能从会议 PDF 纯文本可靠映射
- Jingwen Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Xupeng Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Yankai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Weili Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Boyu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Rong Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Deng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言说话人验证(Speaker Verification,SV)需判断注册与测试语音是否属同一说话人,难点在于训练语言不平衡使模型将语言线索与身份纠缠,导致跨语言目标误拒与同语言非目标误收。所提系统先以冻结的残差网络(Residual Network,ResNet)提取监督说话人向量并以自监督模型(Self-Supervised Learning,SSL)WavLM Base+提供补充表示,经线性对齐与格拉姆施密特正交分解剥离冗余平行分量并保留互补正交分量。然后零初始化门控瓶颈网络将正交分量非线性滤噪后残差注入主向量,形成语言无关增强嵌入。接着单线性变换矩阵将嵌入映射至对角化空间,仅学习特征值向量以解析生成计分矩阵并保持对数似然比形态,再以跨语言难目标与单语言难非目标挖掘做判别微调。与官方基线相比,该融合系统在TidyVoice2026评测集Track 1上等错误率(Equal Error Rate,EER)达1.39%,相对基线9.06%大幅下降。结论限于Common Voice衍生多语言短语音验证,未验证信道剧变、时长极短或未见语系的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
224. 先学容易方向再反哺困难方向:WhispEar 用伪平行耳语扩大耳语转正常语音
标签:#数据集 #数据增强 #流匹配 #语音转换
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#数据增强
👥 作者与机构
- Zihao Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Yingda Shen:机构信息未能从会议 PDF 纯文本可靠映射
- Zifan Guan:机构信息未能从会议 PDF 纯文本可靠映射
- Tongtong Song:机构信息未能从会议 PDF 纯文本可靠映射
- Zhenyi Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhizheng Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
耳语转常态转换以耳语音波形为输入、以常态语音波形为输出,需在缺失基频与周期激励下恢复韵律、音色与可懂度,而平行语料稀缺与时长错位使直接建模困难。WhispEar第一步将SenseVoice-Large蒸馏为轻量语义分词器以输出跨发声模式不变的语义表征,第二步将该表征与方向标识送入共享流匹配变换器以生成对应方向的梅尔谱并结合音色参考合成波形。第三步分别训练常态转耳语与耳语转常态统一分词器承接上述表征实现双向映射,其中较易的常态转耳语先用少量对齐真值训练,再大规模合成伪平行对供给逆方向预训练与微调,这与依赖单语种或对抗训练的已有方案形成关键差异。与最强基线相比,WhispEar-Scaled 在 wEar 中文测试集上将字错率降至 14.93%并将说话人相似度提升至 0.750,显著优于 CosyVoice2 的 29.29%与 0.622。在wTIMIT英文测试集下,WhispEar-Scaled的WER为22.44%,低于CosyVoice2的WER 36.69%。该结论目前仅在安静手机录音与 wTIMIT 和 wEar 划分上得到验证,噪声、远场与未见语言的外推尚未证实。其适用边界受限于安静近场采集与需真值微调的设定,噪声远场与未见语言的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://whispear-demo.github.io/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/zeta-chicken/toWhisper — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
225. 不从头学生成器,只学对齐时长:LipAdapter 用文本到视频对齐改造冻结 TTS
英文题目:LipAdapter: Text-to-Video Alignment is All You Need for Lip-to-Speech
标签:#Adapter #低资源 #多语言 #零样本 #音视频语音合成
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音合成 | 主方法:#Adapter
👥 作者与机构
- Souvik Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
- C. V. Jawahar:机构信息未能从会议 PDF 纯文本可靠映射
- Vinay Namboodiri:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
唇语到语音需从无声视频恢复内容准确、音质自然且与唇动同步的语音,难点在于视素到音素映射多对一且野外数据音质差导致端到端模型泛化弱。该工作先用冻结视觉语音识别转写文本并用冻结唇特征提取器抽取唇嵌入,再由轻量文本到视频对齐网络预测唇部引导的音素时长,接着经由长度调节器扩展音素表征,最后送入冻结多语言文本到语音合成波形。与从零训练语音生成部件的方案不同,该方法只学习跨模态时长映射并复用文本到语音的韵律与音色能力。两阶段训练先学习帧级单调对齐能量再离散化为硬时长,使时长预测稳定可微并直接控制冻结合成器的韵律节奏。在LRS3测试集上该系统以30小时训练取得21.2%的词错率与3.13的DNSMOS,同步与质量接近430小时训练的扩散基线。该结论适用边界限于英语中长句与视觉语音识别转写基本正确条件,短于1秒片段对齐证据不足与零样本小语种转写噪声大时仍明显退化。原文未披露训练硬件、优化器与完整超参数。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
226. 不只答对,还要想对:用混合相似奖励把推理链拽回声音证据
标签:#课程学习 #强化学习 #音频大模型 #音频问答
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#强化学习
👥 作者与机构
- Xiang He:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jinting Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Tianxin Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Zeyu Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Wenfu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Li Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Dong Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频推理任务以原始音频与自然语言问题为输入,要求输出答案与扎根于声学证据的思维链,实际难点在于生成链易脱离音频内容且缺乏细粒度内容监督。Audio-DeepThinker先经音频字幕器将音频转写为文本描述,再由大语言模型生成问答对与参考推理链,为后续强化学习提供问题、答案与参考链三元组。接着策略模型生成推理链与答案并以混合推理相似度奖励约束内容质量,该奖励仅在答案正确时生效,结合大语言模型逻辑评估与嵌入语义对齐,第二阶段去掉嵌入锚点以鼓励多样策略探索。与仅奖励格式正确或鼓励长思考的方法不同,该机制直接比较生成链与参考链的逻辑路径与关键步骤,迫使模型对齐字幕蕴含的声学细节。在 MMAR 测试集上该方法平均准确率达到 74.0%,在 MMAU-Test-Mini 上达到 78.5%,均超越同期音频推理基线并获得 Interspeech 2026 音频推理挑战单模型第一。该结论依赖自动构建的参考链与大语言模型判分器,在强噪声、长时交叉模态与开放域推理中的外推尚未验证。训练使用 8 个节点与全局批量 224 等配置,但原文未披露完整训练时长、推理延迟与部署成本。
🔗 开源资源
- 第三方资源:https://github.com/shuaijiang/Ke-Omni-R — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
227. 用看不见未来的模型逼出紧边界:因果与反因果一致性收紧说话人日志
英文题目:Tight Boundary Prediction in Speaker Diarization Using Causal-Anticausal Consistency
标签:#弱监督学习 #严格因果 #语音 #说话人分离标注
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#弱监督学习
👥 作者与机构
- Shota Horiguchi:机构信息未能从会议 PDF 纯文本可靠映射
- Marc Delcroix:机构信息未能从会议 PDF 纯文本可靠映射
- Naohiro Tawara:机构信息未能从会议 PDF 纯文本可靠映射
- Takanori Ashihara:机构信息未能从会议 PDF 纯文本可靠映射
- Atsushi Ando:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人分离标注的输入是单通道会议录音,输出是每说话人每帧的语音活动,难点在于复用多说话人语音识别语料训练时语义连续性优先的松标注包含停顿与边界填充,模型会内化区间偏松的填充行为。方法先用松标签分别训练因果与反因果局部标注模型,使其因缺失单侧未来或历史上下文而难以复现前填或后填,从而暴露紧边界。接着对双向后验取平均并阈值化,与松标注取交集生成紧伪标签,并对被整体删除的标注段回退为原松段以抑制漏检。然后用紧伪标签以小批量协同训练迭代更新双模型并 tightening 即时回授参数更新,最后用紧伪标签从头训练最终非因果模型。与需多通道强制对齐的做法不同,该机制不依赖说话人分通道录音,而是用方向性结构约束实现弱监督紧化,具有单通道可扩展的实际意义。在AMI-MHM评测设置下,SC紧化非因果模型的DER为20.96%,低于松标签基线模型的DER 35.24%。该结论适用边界限于已知松紧来源的混合训练与中小规模验证,域外紧标注泛化尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
228. 从缺一角到补全篇章:把韵律修复统一为线性逆问题的扩散求解
英文题目:Unified Prosody Restoration Using Diffusion Models for Controllable Text-to-Speech Synthesis
标签:#扩散模型 #韵律 #语音 #文本到语音
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#扩散模型
👥 作者与机构
- Yuki Ito:机构信息未能从会议 PDF 纯文本可靠映射
- Junki Ohmura:机构信息未能从会议 PDF 纯文本可靠映射
- Hayato Futami:机构信息未能从会议 PDF 纯文本可靠映射
- Toshiyuki Sekiya:机构信息未能从会议 PDF 纯文本可靠映射
- Toshiyuki Kumakura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可控语音合成需从易于指定的粗糙或缺失韵律输入恢复帧级基频、清浊音标志与能量,同时保持日语式音调重音规则,否则自然度与可懂度俱损。方法链为:上下文编码器将文本音素与重音符号、说话人与风格标识及音长转为帧级上下文特征,一维 U-Net 分数估计器学习条件韵律先验,推理时由监督分支直接条件生成或由非监督分支经逆问题采样器融合观测约束后输出完整韵律,再送入骨干合成器发声。与直接回归及条件变分自编码器相比,关键差异是以生成先验补全缺失细节并用退化算子显式约束可观测部分。在IH测试集重度组合条件InpRef-S主观评测下,非监督盲修复Diff-U-B的韵律自然度得分为4.74±0.08,低于真值韵律的韵律自然度得分4.86±0.06。结论限于日语情感朗读、给定正确音长与已知平滑或分段平均退化族的情形,跨语言、自发语音与用户真实交互负担尚未验证。训练使用单卡与 64 步扩散采样,论文未报告训练时长与实时率,盲 Gibbs 采样部署代价不明。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
229. 只传一路码流、其余靠预测补齐:P2PSynCodec 的极低码率权衡
英文题目:An Ultra-Low-Bitrate Neural Speech Codec with Plain-to-Pseudo Synergistic Vector Quantization
标签:#知识蒸馏 #向量量化 #语音 #语音编码
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Xiao-Hang Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Ai:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Rui-Chen Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Jian-Qing Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
- Ji Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
超低码率语音编码需将输入语音波形压缩为极少可传输离散符号并在接收端重建可懂语音,难点在于残差向量量化后级贡献递减却占用同等码率导致效率崩塌。所提P2PSynCodec先由编码器将修正离散余弦变换频谱压缩为连续帧级特征,再经单个普通向量量化器量化为可传输基础符号。随后三个伪向量量化器在解码端基于基础符号与已预测辅助符号自回归预测辅助符号,其查表向量与基础符号向量求和后送入解码器重建波形。与残差向量量化逐级传输和有限标量量化粗糙划分不同,该协同设计仅对首级计入码率而伪级零码率,从而保留高码率表达能力并降低传输负担。在LibriTTS测试集下,P2PSynCodec的UTMOS为3.947,高于MDCTCodec的UTMOS 2.670。该结论限于干净英语朗读的离线非因果重建,未验证噪声、混响、跨语言、丢包与流式因果条件下的外推能力。原文未披露优化器、学习率、训练步数与硬件成本,仅提供试听Demo,未开源代码与权重。
🔗 开源资源
- 演示资源:https://pb20000090.github.io/P2PSynCodec/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
230. 给提示词就照做吗:用七级提示检验音频大模型的上下文利用
标签:#基准测试 #基准设计 #多语言 #语音 #语音识别
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Sakshi Joshi:机构信息未能从会议 PDF 纯文本可靠映射
- Dhruv Subhash Rathi:机构信息未能从会议 PDF 纯文本可靠映射
- Sanskar Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Eldho Ittan George:机构信息未能从会议 PDF 纯文本可靠映射
- R J Hari:机构信息未能从会议 PDF 纯文本可靠映射
- Kaushal Bhogale:机构信息未能从会议 PDF 纯文本可靠映射
- Mitesh M Khapra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为覆盖8种印度语言、23个专业域的自然朗读与即兴语音,输出为对应母语文字的逐字转写,难点是声学模糊的稀有术语与命名实体需借助领域上下文消歧,而现有评测在固定提示下无法区分提示利用与参数记忆。本文先按技术工程、专业服务、创意文化三类构建域分类并采集555说话人语音,再经母语者从零转写与资深标注仲裁得到参考文本与双语实体表,最后以L0无上下文到L6对抗错误实体的七级提示度量词错率与命名实体错误率变化。与固定提示评测相比,该机制每次只引入一种上下文信号并保持转写指令不变,使结构化元数据、自然语言描述、英文实体、本土文字实体与对抗实体的贡献可归因。在七级提示基准测试条件下,Gemini 3 Flash在L5的WER为17.46%,低于L1基线条件的WER 18.90%。该结论仅适用于所测转写任务与印度语言域组合,未验证对话检索或长列表偏置外推。原文未披露训练与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
231. 先难后易加大学习率:Vividh-ASR 如何把自发语音的适配压进解码器
标签:#基准测试 #课程学习 #鲁棒性 #多语言 #语音识别
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#课程学习
👥 作者与机构
- Kush Juvekar:机构信息未能从会议 PDF 纯文本可靠映射
- Kavya Manohar:机构信息未能从会议 PDF 纯文本可靠映射
- Aditya Srinivas Menon:机构信息未能从会议 PDF 纯文本可靠映射
- Arghya Bhattacharya:机构信息未能从会议 PDF 纯文本可靠映射
- Kumarmanas Nethil:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为印地语与马拉雅拉姆语多来源语音,输出为转写文本,难点在于多语言 Whisper 与 IndicWhisper 等工作室朗读微调模型在自发口语的语速变化、口吃、韵律起伏与设备噪声及广播快语下急剧退化。方法链分三步推进,先在最高可塑阶段用自发数据 Tier C 以大学习率打破预训练先验并重塑解码器语言映射,再用广播数据 Tier B 以中等学习率精化快速语音的时序建模。最后用工作室 Tier A 与自发 Tier C 按时长 1比1 混合数据在低学习率下巩固精度并抑制自发性能回退,前步表征输出直接作为后步初始化进入下一步。与保守小学习率加由易到难课程的关键机制差异在于将大梯度能量前置并逆序由难到易课程,使解码器承担语言先验重映射而编码器保持声学几何与低有效秩,从而实现参数高效鲁棒性。在 Vividh-ASR 马拉雅拉姆语全局词错误率 Word Error Rate / WER 评测中逆序多阶段微调 Reverse Multi-Stage Fine-Tuning / R-MFT 相对标准顺序降低约 2.9 个绝对百分点,且 244M 模型超越 769M 保守基线与 IndicWhisper。结论限于 Whisper-small/medium 双语验证,未验证自监督与 Conformer 架构及更多语种外推。原文未披露训练步数细节、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
232. 说话人走动时,声音能量还跟得上距离吗:用距离—语音一致性识破伪造
英文题目:Physics-Aware Deepfake Detection via Distance–Speech Consistency
标签:#多模态学习 #信号处理 #音视频 #音频深度伪造检测
评分:7.0/10 | 创新 1.4/2 | 技术严谨 0.9/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#多模态学习
👥 作者与机构
- Kyeongrae Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Kim Sung-Bin:机构信息未能从会议 PDF 纯文本可靠映射
- Oh Hyun-Bin:机构信息未能从会议 PDF 纯文本可靠映射
- Tae-Hyun Oh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为动态说话视频的音轨与画面,输出为真伪分数,难点在于说话人走动、拍摄抖动、遮挡和模糊使唇部线索缺失或不可靠而传统唇同步方法失效。该方法先用RetinaFace定位人脸并用MiDaS单目深度估计取脸区平均得到说话人相对距离,同时用通用声音分离模型提纯目标语音并分窗计算信噪比与早期清晰度C50。再按距离分箱聚合以抑制发声强度与音素波动,计算各箱内方差与熵等统计量并取期望构成五维视频级特征,最后送入单隐层感知机判别物理一致性是否被破坏。与唇语音同步建模相比,该机制不依赖口型可见性而检验视觉几何与声音能量的声传播耦合,可与唇同步检测器分数平均集成而具有互补性。在DF-Dynamic动态子集上该方法ROC-AUC达到0.7449,明显高于2个唇同步基线的0.5096与0.5517。结论仅在存在明显距离变化且麦克风非近讲、噪声相对平稳的场景成立,近讲、强混响突变与深度估计失败时会失效。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://byulharang.github.io/PADD/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
233. 把分离留给冻结骨干、把选择交给视觉门控:Plug-and-Steer 的解耦提取
英文题目:Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
标签:#Adapter #高效推理 #音视频 #语音 #音视频语音分离
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音分离 | 主方法:#Adapter
👥 作者与机构
- Doyeop Kwak:机构信息未能从会议 PDF 纯文本可靠映射
- Suyeon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Joon Son Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频目标说话人提取(Audio-Visual Target Speaker Extraction,AV-TSE)需从双人混合波形与目标唇动视频中输出指定人干净语音,难点在于野外视听数据噪声大导致联合重训会损伤分离保真度并引入排列歧义。该工作冻结音频分离(Audio-Only Speech Separation,AOSS)主干以保留高保真分离能力,再在选定分隔块学习潜转向矩阵(Latent Steering Matrix,LSM)实现特征级通道交换,最后训练轻量视觉转向模块由唇动与音频潜特征逐帧预测门控并驱动LSM将目标锁定到固定通道。与深度融合重学分离不同,该方法只做线性重路由而不改写声学表征,从而解耦分离保真与目标选择并保留预训练声学先验的完整性。该内部路由直接复用主干潜特征而免除重复解码与重编码,因而减少冗余计算并改善实时运行效率。在LRS2-2mix测试集评测设置下,Plug-and-Steer系统的SI-SDRi指标为14.79 dB,低于冻结TF-GridNet主干的SI-SDRi指标14.81 dB。该结论限于 2 说话人英文合成混合与 3 秒短句,未验证多人、强混响与跨语言泛化。原文未披露训练时长与部署成本细节。
🔗 开源资源
- 演示资源:https://plugandsteer.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
234. 长音频能听完却写不对病历:用全合成诊室对话同时做训练与可控评测
英文题目:Generating Synthetic Doctor-Patient Conversations for Long-form Audio Summarization
标签:#医疗音频 #数据集 #数据集构建 #长音频处理 #口语理解
评分:7.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#口语理解 | 主方法:#数据集构建
👥 作者与机构
- Yanis Labrak:机构信息未能从会议 PDF 纯文本可靠映射
- David Grünert:机构信息未能从会议 PDF 纯文本可靠映射
- Severin Baroudi:机构信息未能从会议 PDF 纯文本可靠映射
- Jiyun Chun:机构信息未能从会议 PDF 纯文本可靠映射
- Pawel Cyrta:机构信息未能从会议 PDF 纯文本可靠映射
- Sergio Burdisso:机构信息未能从会议 PDF 纯文本可靠映射
- Ahmed Hassoon:机构信息未能从会议 PDF 纯文本可靠映射
- David Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Adam Rothschild:机构信息未能从会议 PDF 纯文本可靠映射
- Reed Van Deusen:机构信息未能从会议 PDF 纯文本可靠映射
- Petr Motlicek:机构信息未能从会议 PDF 纯文本可靠映射
- Andrew Perrault:机构信息未能从会议 PDF 纯文本可靠映射
- Ricard Marxer:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Schaaf:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
任务以英语双人初级保健首诊长对话音频为输入,输出结构化SOAP病历,实际难点在于非正式口语到正式病历的跨语域映射与长程多说话人声学干扰下的忠实推理。流水线先从外部人口分布与724种主诉采样结构化人物画像,再以多轮角色扮演逐轮生成口语化对话文本,并将对话历史与画像条件传入下一步。接着经人物条件语音克隆、停顿重叠注入、66类临床声音事件叠加与房间声学及Opus压缩仿真得到长对话音频。最后经事实抽取生成带引文与轮次索引的JSON事实表,并以该表为唯一输入做受限改写生成接地的参考病历。相对仅做文本合成的NoteChat与仅57例演员短对话的PriMock57,该设计显式建模跨语域映射与声学干扰,使合成数据可同时用于训练与可控评测。在开发集对话评测任务下,多轮后条件的得分为2.50,从多轮前条件的得分2.01升至2.50。该结论适用边界受限于合成英语首诊场景,尚未验证向真实录音、多方会诊与多语种的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/Play-Your-Part/Synth-DoPaCo — 暂时无法访问
- 复现相关资源:https://huggingface.co/Qwen/Qwen3-ASR-1.7B — 暂时无法访问
- 复现相关资源:https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct — 暂时无法访问
- 复现相关资源:https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Thinking — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
235. 不等停顿的同传:用偏好学习把块间静音换成连续说话
标签:#偏好优化 #主观评测 #流式处理 #语音翻译
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#偏好优化
👥 作者与机构
- Dongwook Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Youngho Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Sangkwon Park:机构信息未能从会议 PDF 纯文本可靠映射
- Heeseung Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Sungroh Yoon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
同时语音到语音翻译(Simultaneous Speech-to-Speech Translation,Simul-S2ST)需在源语流未结束时增量生成目标语音,刚性分块策略导致块间静音频发并损害听感。本文提出NaturalFlow,以Hibiki-2B为基座引入流畅度感知的偏好优化框架,先对同一源语音高温采样多候选译文并用识别质量与静音率打分筛选出连续与断裂样本。接着以银牌准则构造偏好对,将极低静音率导致的加速含糊样本设为负例以约束单目标塌缩,上一步的偏好对直接作为下一步优化的监督信号。最后仅在声学接地的文本流上做长度归一化直接偏好优化以稳定训练,使模型学会选择更长等义释义延长发声时长。该机制与传统质量时延折中优化不同,直接把可复述长度差异转化为发声时长,用更长但等义的释义争取源上下文到达时间。在VoxPopuli基准测试集下,NaturalFlow的沉默率指标SR为0.10,低于Hibiki基线的沉默率指标SR 0.12。结论目前仅限法语到英语朗读式演讲语域,自发对话与多语种外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://naturalflows2st.github.io/naturalflow/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
236. 只记最近的声音:WAND 用全局加局部门限把自回归语音合成的显存拉成常数
标签:#注意力机制 #知识蒸馏 #高效推理 #跨语言 #文本到语音
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#注意力机制
👥 作者与机构
- Hanna Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Tan Dat Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Jaehoon Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Kyuhong Shim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自回归文本到语音(autoregressive text-to-speech,AR-TTS)以系统提示(system prompt,s)、目标文本(target text,x)与参考音频提示(reference audio prompt,apr)为条件逐token生成离散声学序列,全量自注意力(full self-attention)导致显存与计算随长度增长。第一步做注意力解耦与缓存分区,对条件token保持常驻全局注意力(global attention),对生成声学token只保留大小为W的局部滑动窗口注意力(local sliding-window attention),输出固定全局缓存加滚动窗口缓存的结构。第二步承接该截断结构做知识蒸馏适配,以全注意力教师用交叉熵损失(cross-entropy loss,LCE)锚定真值并以偏斜KL散度(skew Kullback-Leibler divergence,LKL)对齐分布,弥补远距截断的内容一致性损失。第三步再承接蒸馏训练做课程稳定,从128收缩至目标窗口并以温度软掩码渐进约束远端注意力,全程复用预训练权重且不改架构。与从头训练的非自回归加速不同,该机制只丢弃少量解码区注意力质量并抑制远端采样伪影传播,其关键差异在于无需结构改造即可实现与总长度无关的常数开销。在Seed-TTS-eval基准test-en任务下,WAND版CosyVoice 2的词错率(word error rate,WER)为1.72%,低于基线全注意力的WER 1.94%。在仅用 LibriTTS train-clean-100 约 53.8 小时英文数据微调 1 个 epoch 后,三模型在 Seed-TTS-eval test-en 上 10 秒生成的 KV 缓存减少 49.9% 至 66.2%,GFLOPs 加速 1.51 倍至 1.89 倍,词错率(word error rate,WER)持平或微降,跨语言 test-zh 字符错率(character error rate,CER)退化在 0.1% 绝对值内。结论限于 10 秒级短句与中英双语,未实测分钟级韵律漂移与超长外推。该结论的适用边界受限于10秒级短句验证,分钟级韵律漂移尚未验证,而训练成本仅为单卡20GB显存单轮微调且推理开销以常数延迟维持。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
237. 同时骗过说话人与伪造检测:AGENT 如何拆解 SASV 的联合防线
英文题目:AGENT: A Black-box Adversarial Attack Exposing the Achilles’ Heel of SASV Systems
标签:#模型融合 #对抗鲁棒性 #说话人验证 #语音伪造检测
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#模型融合
👥 作者与机构
- Yowon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Seongkyu Han:机构信息未能从会议 PDF 纯文本可靠映射
- Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
- Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
欺骗感知说话人验证(Spoofing-Aware Speaker Verification,SASV)以自动说话人验证(Automatic Speaker Verification,ASV)相似度与伪造对策(Countermeasure,CM)得分为联合输入,以接受或拒绝为输出,难点在于两条分支的决策边界不一致且黑盒下不可见。本文方法链由三步构成,先由替代ASV与替代CM分别计算相似度与伪造检测分数,再将ASV分数最大化与CM过阈目标转化为输入梯度并做归一化与冲突检测,最后对冲突分量做选择性投影后融合以迭代更新对抗样本。与仅优化ASV的迁移攻击不同,该方法不再满足于刚过阈值,而是把样本推入接受域深处并显式消除两路梯度反向干扰。在ASVspoof 2019 LA评估集4000条非目标试次上,替代为NeXt-TDNN加AASIST-SSL、受害为ResNet34v2加ResNet-OC、扰动预算0.016条件下,级联结构攻击成功率(Attack Success Rate,ASR)达到99.62%,分数融合结构达到81.58%,显著高于同预算下对比方法。该结论目前仅适用于数字域加性扰动与已测试的模型族组合,对物理播放、编解码与自适应防御尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/2oil/AGENT.git → https://github.com/2oil/AGENT — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
238. 综艺音效为何难生成:用检索打底、专家分工 refinement 补齐时间与情绪
标签:#基准测试 #检索增强 #音视频 #音频检索 #视频到声音生成
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#视频到声音生成 | 主方法:#检索增强
👥 作者与机构
- Wentao Lei:机构信息未能从会议 PDF 纯文本可靠映射
- Li Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
综艺音效生成需从视频画面与语音中定位笑点与情绪转折,并输出风格化非写实声音,其难点在于时间精度、内容多样性与上下文理解难以兼得。ARCHES 先由规划智能体(Planning Agent)检测事件并形成制作方案,再由生成智能体(Generation Agent)结合检索范例合成初版音频,随后检查智能体(Checker Agent)诊断缺陷并经由自适应专家智能切换(Adaptive eXpert Intelligent Switch,AXIS)分发至时间或情绪精修智能体循环迭代,历史成功经验沉淀于创意经验库(Creative Experience Bank,CEB)以加速同类任务。与直接端到端视频到音频(Video-to-Audio,V2A)模型不同,该框架以外部专业素材库锚定多样性,以显式诊断加专科精修替代单次生成。在自建综艺音效基准(Variety Show Sound Effect Benchmark,VSSE-Bench)上,其对数谱距离(Log-Spectral Distance,LSD)为 0.77 dB,Frechet 音频距离(Frechet Audio Distance,FAD)为 7.04,起音差异(Onset Difference,OD)为 0.048 s,主观语义、时间、情绪平均意见分(Mean Opinion Score,MOS)分别达 4.04、4.54 和 4.46,全面领先 4 个视频到音频基线。在VSSE-Bench基准下,ARCHES的LSD为0.77 dB,低于MMAudio的LSD 2.09 dB。多轮精修带来额外延迟,原文明确未来需优化迭代生成延迟。结论仅适用于短事件中心片段,长视频连贯性、跨文化喜剧泛化与迭代时延成本尚未验证。
🔗 开源资源
- 演示资源:https://arches-bench.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
239. 用说话人匿名化解耦换音色:零前视流式转换如何把延迟压到一帧
英文题目:Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization
标签:#生成对抗网络 #严格因果 #流式处理 #说话人匿名化 #语音转换
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#生成对抗网络
👥 作者与机构
- Yudong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zihao Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Junwen Qiu:机构信息未能从会议 PDF 纯文本可靠映射
- Ruihai Jing:机构信息未能从会议 PDF 纯文本可靠映射
- Ruixiang Hang:机构信息未能从会议 PDF 纯文本可靠映射
- Yingda Shen:机构信息未能从会议 PDF 纯文本可靠映射
- Zhizheng Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式零样本语音转换(Voice Conversion,VC)需在逐帧输入下剥离源音色并保留语言与韵律,现有信息瓶颈(Information Bottleneck,IB)会损伤韵律而被迫缓存未来帧求基频,扰动法又难以兼顾泄漏与可用性。本文先用现成说话人匿名化(Speaker Anonymization,SA)模块将源音频映射到伪说话人空间,再送入严格因果流式编码器提取语言内容,同时用独立音色编码器从参考语音抽取全局音色向量,最后由因果生成对抗网络HiFi-GAN解码器逐帧合成波形。与显式基频补偿路线不同,该链条依靠匿名化保留完整韵律来消除对未来上下文的依赖,从而实现单帧进单帧出的零前视架构。训练完成后匿名化模块与多周期和多尺度判别器均被丢弃,推理仅保留因果编码器与生成器以维持严格因果。流式推理依靠因果卷积的状态缓存只存感受野内历史帧,使单帧计算复杂度保持恒定并支撑每20 ms逐块输出。在seed-tts-eval英文子集约1000对上零前视系统取得目标相似度0.521并将算法延迟压至20 ms,显著低于同类流式方案的40 ms至60 ms。该结论目前仅在英语朗读体与短参考条件下验证,跨语言与强噪声外推尚未证明,训练仍依赖外部匿名化预处理带来的额外成本未被量化。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
240. 先想响什么,再想从哪响:两阶段解耦的一阶 Ambisonics 视频配音
英文题目:FoleyImmersive: Decoupling What and Where for Video-to-First-Order Ambisonics
标签:#数据集 #扩散模型 #空间音频信号 #视频到声音生成
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#视频到声音生成 | 主方法:#扩散模型
👥 作者与机构
- Liming Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Lingfeng Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Luo Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuexian Zou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理无声视场视频到一阶Ambisonics生成,输入为普通视场视频与相机朝向,输出为WXYZ四通道空间音频,难点在于视频语义稀疏且内容与几何易纠缠而难以兼顾听感与方位。为补足发声事件 grounding,先用结构化文本增强数据集,详细描述事件物体与所处环境以强化视听对齐与语义 grounding。第一阶段语义优先扩散模型以多速率跨帧注意力与概率时间调制生成单声道W通道并冻结其输出,直接进入第二阶段。第二阶段复数频域空间化器以方向残差门控由W残差预测XYZ通道而不改写W,实现最小干预空间化。与端到端直接生成FOA及级联空间编码器相比,该解耦通过瓶颈门控兼顾语义保真与方向稳定,避免空间化改写已学语义。在YT-AMBISEM评测下,FOLEYIMMERSIVE的KLDdec指标为1.532,低于ViSAGe的KLDdec指标为1.833。该结论限于 5 秒短片段与已有相机朝向条件,对长时、多声源遮挡及未见场景的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://foleyimmersive2026.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
241. 女声/s/更高是嗓子短还是练出来的:12 种语言里把生理和表演分开算
英文题目:Disentangling sociophonetic and physiological variation in /s/ acoustics across 12 languages
标签:#统计分析 #社会语音学 #多语言 #语音 #语音属性识别
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Massimo Lipari:机构信息未能从会议 PDF 纯文本可靠映射
- Morgan Sonderegger:机构信息未能从会议 PDF 纯文本可靠映射
- Meghan Clayards:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为12语言读语长元音F1-F3与元音前/s/频谱,输出为声道长度代理量ΔF与/s/峰值频率的性别效应分解,难点是生理缩放与社会展演混杂且随语言社群变化。方法链分三步:先以GlobalPhone等读语音频为输入,用Montreal Forced Aligner对齐并经PolyglotDB管理,在长元音33%处测量F1-F3,输出逐token共振峰表。再以该共振峰表为输入,按公式聚合为说话人ΔF并做词均值,同时以/s/中点20ms多锥度谱为输入提取1kHz以上最高峰并做词均值,前一步的ΔF与本步的/s/峰值共同组成回归输入表。最后以该回归输入表为输入,用线性混合效应拟合全结果与全中介两个模型并做因果中介分解,输出经ΔF间接效应与性别直接效应。相对直接比性别均值的做法,差异在把声道长度显式作中介,使生理与展演路径可分,能发现总量掩盖下的反向抵消。在12语言混合建模语料下,性别总效应的峰值频率指标为-738 Hz,低于性别直接效应的峰值频率指标-245 Hz。该结论受限于读语体、16 kHz采样、二元性别标签与峰值定义的近似性,外推至自发语与高频共振更高的说话人时需谨慎。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
242. 回声可参考、噪声不可参考时先判别抑制再单步生成补细节
英文题目:DiffVQE: Hybrid Diffusion Voice Quality Enhancement Under Acoustic Echo and Noise
标签:#扩散模型 #语音 #回声消除 #语音增强
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#回声消除 | 主方法:#扩散模型
👥 作者与机构
- Haljan Lugo:机构信息未能从会议 PDF 纯文本可靠映射
- Ernst Seidel:机构信息未能从会议 PDF 纯文本可靠映射
- Pejman Mowlaee:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyue Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Fingscheidt:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理免提通话中麦克风混合信号y(n)与远端参考x(n)到近端干净语音的联合声学回声控制与降噪,需在双讲下同时压制扬声器非线性回声与背景噪声并保留近端音质。先由条件网络输入麦克风谱Y与远端谱X并早期拼接,负责判别式抑制回声与噪声以输出粗净谱与语音条件C,再以前向扩散输入干净谱S按方差爆炸SDE加噪,负责构造扩散训练目标并将前一步条件C作为后续条件输入。最后分数网络以上一步粗估计为起点、以C为条件输入,负责执行单步噪声一致朗之万逆扩散以输出最终增强谱,相对DeepVQE等纯判别式方案以生成式精修恢复被过度抑制的频谱细节并避免多步采样。在合成验证集Dval双讲条件下,DiffVQE的PESQ为2.63,高于DeepVQE的PESQ 2.30。在合成验证集 Dval 双讲条件下 DiffVQE 取得 PESQ 2.63,超过同等重训 DeepVQE 的 2.30,DT Other 4.10 超过 3.83,但 DT Echo 4.65 略低于 DeepVQE 的 4.66,单讲远端 ST Echo 4.60 低于 4.72。结论仅适用于非因果离线增强与合成回声加 ICASSP 2023 混响盲测集,未验证因果流式、真实器件回声和大时延失配下的外推能力。复杂度方面 DiffVQE 约 5.13 M 参数、5.37 G FLOPS、单线程 RTF 0.185,明显低于 DeepVQE 的 5.29 M 参数、42.24 G FLOPS、RTF 0.317。为说明计算量与推理开销,原文以单线程硬件测得上述结果,延迟以RTF表征。
🔗 开源资源
- 演示资源:https://ifnspaml.github.io/DiffVQE-Demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
243. 先造伪源再学回真目标:回文合成支撑的零样本变声
英文题目:From A to B to A: Palindromic Zero-Shot Voice Conversion with Non-Parallel Data
标签:#检索增强 #跨语言 #零样本 #语音转换
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#检索增强
👥 作者与机构
- Moshe Mandel:机构信息未能从会议 PDF 纯文本可靠映射
- Shlomi E. Chazan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本任意到任意语音转换输入为源语音与仅数秒的目标参考语音,输出为保留语言内容但具目标音色的语音,难点在于非平行数据下难以获得监督且短参考下检索邻居稀疏。该方法先用冻结 WavLM(Weighted Layer-wise Masked language model)第 6 层特征对目标段在任意参考说话人特征库中做 K 最近邻(K-Nearest Neighbors,KNN)检索替换以合成伪源特征,再用 6 层 Transformer(变换器)潜在转换器将伪源映射回目标特征并经 HiFi-GAN(High Fidelity Generative Adversarial Network)声码器重建波形,最后在转换特征分布上后训练同构声码器以适配分布偏移。在 LibriSpeech(大规模英语有声书语料)英语评测中 10 秒提示下本方法说话人相似度达 0.713,超过 Vevo 的 0.639、Seed-VC 的 0.578、KNN-VC 的 0.552 和 OOVC 的 0.419,等错误率达 0.180 全面领先,词错误率 0.049 与 Vevo 的 0.033 大体可比。该设计区别于显式解耦与音素后验图路线,以合成到真实监督加冻结 ECAPA-TDNN(Emphasized Channel Attention Propagation and Aggregation Time Delay Neural Network)波形级说话人验证损失直接优化音色一致性。结论限于朗读式 LibriSpeech 系数据与 3 秒至 60 秒提示范围,多语言仅在 Multilingual LibriSpeech 朗读数据上免微调测试,未验证强表现力、噪声与流式场景。原文未披露训练推理成本与延迟。
🔗 开源资源
- 演示资源:https://palindromic-vc.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
244. 解码器这么深,语音任务真用得上吗:从层剪枝量冗余
英文题目:Measuring the Redundancy of Decoder Layers in SpeechLLMs
标签:#模型剪枝 #大语言模型 #语音 #语音识别 #语音翻译
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型剪枝
👥 作者与机构
- Adel Moumen:机构信息未能从会议 PDF 纯文本可靠映射
- Guangzhi Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Philip C Woodland:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音大模型将语音编码器表示经投影器映射到大语言模型解码器,再自回归生成文本,其解码器占比超90%但是否为语音任务必需尚不清楚,而跨模态表征不对齐使直接评估剪枝后兼容性尤为困难。本文以层冗余为切入点,先用角距离度量相邻层隐状态相似性以定位可删连续块,再沿最优剪枝路径剪枝并通过低秩适配与投影器重对齐进行愈合,最后在识别与翻译任务上验证保留性能。相对已有大语言模型剪枝工作,关键差异在于证明冗余继承自文本预训练且不受语音路由改变,并揭示解码器加投影器联合愈合不可或缺,从而可用廉价纯文本前向确定语音可剪位置。在LibriSpeech训练的Llama 3.1 8B系统上,移除43.8%解码器层后测试集词错率仅从2.65%升至3.28%,且推理提速约35%。结论限于SLAM框架下英语朗读语音识别与两对CoVoST2翻译方向,未验证对话、推理与噪声场景的外推能力。原文仅报告推理峰值显存由15.72 GiB降至10.37 GiB,未披露完整训练时长成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
245. 把停顿、话题和音素装进同一个提示:LoRA 微调大模型做痴呆检测
英文题目:LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features
标签:#语音生物标志物 #LoRA #大语言模型 #语音 #病理语音评估
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#LoRA
👥 作者与机构
- Jonghyeon Park:机构信息未能从会议 PDF 纯文本可靠映射
- Olivier Jiyoun Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Myungwoo Oh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
痴呆检测的输入是Cookie Theft看图描述的自发语音,输出为说话人级二分类标签,难点在于认知损伤同时散落在词汇选择、停顿分布、发音变异和叙事连贯等异质维度且单视图信号微弱易混淆。方法链分四步推进:先由Whisper large-v3生成词级转录并经Montreal Forced Aligner得到停顿对齐与语速统计,再用HuPER提取音素序列以保留发音细节,接着以视觉语言模型定义话语簇并做零样本主题标注以显式刻画语篇焦点,最后将四视图拼成JSON提示并以低秩适应(Low-Rank Adaptation, LoRA)微调大语言模型(Large Language Model, LLM)统一推理并经多数投票聚合到说话人级。相比独立编码器加晚融合,该机制差异在于单次前向内做跨视图联合推理而无需模态专用编码器,因而能直接建模词汇、时序与语篇线索间的交互并减少融合结构复杂度。在ADReSSo测试集上最佳模型Qwen3-14B以宏观F1达到90.14%,超越此前最强融合基线Swin-BERT的87.32%。结论目前仅在英文单任务单数据集上成立,未验证跨语言、跨任务与真实临床噪声下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/vivivic/is26dementia — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
246. 双通道生成式预训练为何能提前听出轮替:DualTurn 的方法与证据
英文题目:DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining
标签:#生成模型 #多通道 #预训练 #语音 #轮次切换
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#轮次切换 | 主方法:#生成模型
👥 作者与机构
- Shangeth Rajaa:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向模块化语音助手轮次切换决策,该任务以双说话人连续音频为输入,输出智能体应继续听、开始说、处理重叠与反馈性应答等动作,难点在于需在静音超时前预判边界并区分停顿、话轮结束与简短插入。DualTurn先以冻结的Mimi神经编解码器将双通道24 kHz波形转为12.5帧/秒连续嵌入,经通道特定多层感知机变换拼接后送入Qwen2.5-0.5B主干进行双通道下一帧生成式预训练以学习交互动态。接着丢弃约10.6M参数深度预测器,仅微调轻量分类头以预测每通道六类轮次信号,再经启发式规则或逻辑回归探针映射为五类智能体动作,从而将无标注表示转化为可执行决策。与仅预测二值未来语音活动的语音活动投影Voice Activity Projection(VAP)不同,该方法同时建模双通道语义与韵律并显式区分话轮结束、保持、打断与反馈,意义在于为ASR-LLM-TTS管线补足类端到端模型的预判能力。在Switchboard测试集138会话上其加权F1达0.633,明显高于VAP逻辑回归版本的0.389,且中位响应早约220 ms。在词级轮次预测上平均AUC达0.963,超过3.1B音频文本融合模型的0.880。其结论限于英语双人电话与在线对话,未验证多方、多语言、强噪声与口音泛化,且反馈预测精度仍偏低而不宜单独触发。推理以240 ms步长流式运行,论文称未量化模型在CPU上延迟约78 ms、A100上约27 ms,训练成本仅披露单张A100 40GB与批量32,未披露完整硬件时长。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
247. 语音激活动态范围过大时,为何要把校准写成两步优化再用进化策略搜缩放因子
英文题目:Evolution Strategy-Based Calibration for Low-Bit Quantization of Speech Models
标签:#模型量化 #高效推理 #语音 #语音识别
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型量化
👥 作者与机构
- Lucas RAKOTOARIVONY:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音模型要做全整数推理必须同时量化权重与激活,但音频激活累积分布高度压缩、动态范围极大,最大截断 Maximum、分位 Percentile 与熵 Entropy 等只看分布的校准会把多数值挤进同一量化桶。本文提出演化策略校准 Evolution Strategy-based Calibration,简称ESC,先用均方误差 Mean Squared Error逐层独立初始化卷积、线性与层归一化算子的激活缩放因子,提供稳定起点。再把全部缩放向量拼接为连续向量,以校准集上任务误差为目标用CMA-ES做全局无梯度联合优化,通过采样排序更新分布捕捉跨层依赖。与仅看激活分布的准则不同,该方法直接优化量化后输出误差并绕开舍入不可微问题。该流程在RTX 3090上用TensorRT部署评测INT8模型的推理延迟与显存占用。在LibriSpeech上Conformer的W8A8词错率为16.01%,接近全精度15.94%;在Speech Commands V2上AST的W4A4准确率为96.41%,相对全精度98.13%下降约1.75%,叠加HyQ后达96.76%。该结论限于上述三类算子用ESC、其余算子与权重量化用Max的流程,依赖每任务训练集100样本校准与RTX 3090加TensorRT部署栈,INT4只报精度未测加速,外推到大词汇流式系统与嵌入式平台尚未验证。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
248. 未知水印与未知信道下还能检出吗:VoxWatermark 的大规模扰动评测与 AudioWMD
英文题目:VoxWatermark: A Large-Scale Benchmark for Audio Watermark Detection under Perturbations
标签:#基准测试 #基准设计 #对抗鲁棒性 #语音 #音频水印
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频水印 | 主方法:#基准设计
👥 作者与机构
- Farnaz Sedaghati:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zicheng Weng:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Rao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理音频水印(Audio Watermarking)检测任务,输入为16 kHz单声道5秒语音片段,输出为是否存在水印的二分类判定,难点在于注入方法未知且测试音频经历传输压缩与对抗篡改后分布严重偏移。所提流程先用统一协议在LibriSpeech、Common Voice、VCTK、AISHELL-1多源语料上注入10种传统与神经水印并构造无盒、黑盒与白盒移除与伪造扰动,形成VoxWatermark基准,再训练单查询卷积基检测器对对数梅尔谱打分,接着对同一音频做8次随机变换查询并提取均值与稳定性统计,最后用逻辑回归元分类器融合输出最终判定。相比单次打分的水印检测器(Watermark Detector,WMD)基线,该机制差异在于把判决依据从单点置信改为查询一致性,从而在梯度攻击下更难被单次扰动欺骗。在跨语言测试集Test Set 1上AudioWMD的AUROC为63.8%,高于WMD的57.1%,白盒组达77.2%对48.6%,但无盒平均仅54.3%对51.3%,黑盒HSJA谱图攻击下真阳性率跌至3.9%而WMD保持96.1%。结论仅适用于16 kHz短语音与所列水印和扰动集合,未验证长音频、真实信道录音与未知神经水印的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/wailywang/VoxWatermark — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
249. 唱歌也会造假:SingFox 用 20 种语言和六条赛道逼模型现形
标签:#数据集 #数据集构建 #多语言 #音频深度伪造检测
评分:7.0/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.9/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频深度伪造检测 | 主方法:#数据集构建
👥 作者与机构
- Arth J. Shah:机构信息未能从会议 PDF 纯文本可靠映射
- Devanshi K. Trivedi:机构信息未能从会议 PDF 纯文本可靠映射
- Himanshi U. Borad:机构信息未能从会议 PDF 纯文本可靠映射
- Hemant A. Patil:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向歌唱深度伪造检测,输入为含伴奏的4秒歌唱片段,输出为真伪判定与生成来源判定,难点在于颤音与持续音高调制掩盖了声码器痕迹,且语言与乐器变化会引入严重分布偏移。构建链条先从开放版权网站采集20种语言真唱并做峰值与均方根双重归一化与切分,再用Whisper-large生成歌词转录以驱动合成,随后以3种生成对抗网络声码器、2种扩散模型、2种歌唱转换模型与1种文本到音乐模型批量生成伪造,最后按全球语言、印度语言、乐器类型、超集、替代混音与来源追踪组织为T1至T6共6个评测轨道。与仅覆盖英语或单一生成范式的已有语料相比,该语料同时强调多语言覆盖、文本对称与多范式混合,更贴近真实攻击组合。在SingFox T4超集跨数据集评测下,以FMC训练的LFCC加ResNet基线系统的准确率为77.84%,高于以CtrSVDD训练的对应系统准确率46.06%。该结论仅适用于所收录的8种生成器与4秒无分离伴奏条件,对未见商业系统与长音频的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Arth-Shah/SingFox — 链接可访问(HTTP 200)
- 数据相关资源:https://doi.org/10.5281/zenodo.20691932 → https://zenodo.org/records/20691932 — 链接可访问(HTTP 200)
- 演示资源:https://shorturl.at/Sa1M7 → https://www.shorturl.at/Sa1M7 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
250. 留下局部异常:用状态空间模型与双轴混合重学呼吸音分类
标签:#医疗音频 #对比学习 #正则化 #状态空间模型 #音频分类
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#对比学习
👥 作者与机构
- Hemansh Shridhar:机构信息未能从会议 PDF 纯文本可靠映射
- Miika Toikkanen:机构信息未能从会议 PDF 纯文本可靠映射
- June-Woo Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
呼吸音分类以肺部听诊Mel频谱为输入,输出正常、爆裂音、哮鸣音与混合四类标签,难点在于异常事件稀疏短促且易被正常呼吸主导模式淹没,临床漏诊风险较高。该文方法链分为三步:先用AudioSet蒸馏的音频状态空间模型提取多尺度时频特征以保留中高频空间变化,再对谱响应峰值过强的中层施加高斯卷积平滑以抑制过度局部敏感,最后沿时间轴与频率轴分别做连续块混合并施加不对称停止梯度对比损失以增强不变性。相比依赖全局自注意力与CLS汇聚的音频频谱Transformer,该机制用四向选择性扫描加全局池化替代单token瓶颈,从结构上避免低通滤波与注意力汇聚。在ICBHI基准下,Lung-SRAD的Score为64.48%,高于频率单轴混合的Score 63.18%。结论目前仅在该数据集与8秒标准化呼吸周期上验证,对跨设备、跨人群与长程连续监测的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/RSC-Toolkit/Lung-SRAD — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
251. 基类与新类不在同一域时,如何既记住旧类又认出新域新类
英文题目:Cross Domain Few-Shot Class-Incremental Audio Classification Via Adversarial Contrastive Learning
标签:#对抗训练 #持续学习 #对比学习 #少样本 #音频分类
评分:7.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#对比学习
👥 作者与机构
- Yongjie Si:机构信息未能从会议 PDF 纯文本可靠映射
- Yanxiong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Sen Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Beibei Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨域少样本类增量音频分类(Cross Domain Few-Shot Class-Incremental Audio Classification,CD-FCAC)要求模型以源域充分样本启动基会话,再用目标域每类仅5个样本持续学习新类,并在全部已见类上保持准确率。所提对抗对比训练(Adversarial Contrastive Learning,ACL)先用谱扰动器对对数梅尔谱做随机卷积扰动,再冻结模型沿梯度上升最大化分类损失生成伪目标域样本,接着将源域样本与对抗样本混合输入编码器与分类器联合优化,加权交叉熵保证分类,监督对比损失约束同类紧凑异类分离以预留新类决策空间,增量阶段冻结编码器并用旧类嵌入均值加新类样本更新余弦分类器。与仅用交叉熵或单一策略的已有少样本类增量方法不同,该方法将单源域泛化显式引入持续学习流程,以多样化伪域模拟未见域偏移。在NSynth-100到LS-100的5路5样本设置下平均准确率(Average Accuracy,AA)达到79.09%,高于最强组合基线AMFO+AFA的78.50%。该结论仅在LS-100、NSynth-100与FSC-89构成的6组跨域对上验证,对真实开放噪声、通道失配与大规模连续增量的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/YongjieSi/ACL — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
252. 不动权重改发音:FlowEdit 把纠错存进联想记忆
英文题目:FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS
标签:#持续学习 #流匹配 #检索增强 #文本到语音
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#检索增强
👥 作者与机构
- Harshit Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Ayush Pratap Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Nityanand Mathur:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
冻结流匹配TTS部署后难纠正多语言专有名词误读,词典难覆盖不规则拼写而微调引发灾难性遗忘与音色漂移。FlowEdit先用Whisper-Large-v3强制对齐定位目标词区间并冻结F5-TTS的DiT在文本嵌入空间优化扰动向量逼近参考梅尔谱,再将池化键值对写入Modern Hopfield记忆,推理时经相似度门控软注意力检索注入。与直接改权重不同,该路线将知识置于外部情景记忆而隔离通用语音参数,避免流形干扰。在自建 POLYGLOT-NOUNS 的 312 词 1560 句与 500 条 LibriTTS-R 通用集评测中,目标词音素错误率(Phoneme Error Rate,PER)从零样本基线的 42.5% 降至 3.1%,相对下降 92.7%,而通用 PER 保持 4.1% 与基线持平。残余误差集中于单音节短词与声调语言的基频重建,Mandarin 残余 9.1% 最高;记忆超过 1000 条后检索精度稀释,10k 合成记忆下 PER 退至 6.8% 且延迟升至 112 ms。单次纠错在 A100 上约 15 秒 50 步,M 不超过 500 时检索开销低于 35 ms,适合离线个性化而非实时学习。结论适用边界受限于声调语言与大容量记忆外推,失败条件为M超过1000后的稀释与短词基频重建,超大规模部署与实时学习场景尚未验证,上述延迟与硬件条件决定其推理开销适合离线个性化。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
253. 没有干净语音可学时,为何让模型先把混响加重再去掉
英文题目:ARTT: Augmented Reverberant-Target Training for Unsupervised Monaural Speech Dereverberation
标签:#知识蒸馏 #无监督学习 #单通道 #语音 #去混响
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#去混响 | 主方法:#无监督学习
👥 作者与机构
- Siqi Song:机构信息未能从会议 PDF 纯文本可靠映射
- Fulin Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhong-Qiu Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道无监督去混响需仅从单通道含混响噪声观测估计直达声,既无干净参考也无空间线索,且混响为强相关卷积过程,不满足噪声目标训练的独立假设。第一阶段混响目标训练将观测与在线采样统计相对传递函数卷积后重构原观测,利用卷积交换性迫使网络同时抑制合成与真实晚期混响,输出初始去混响映射。第二阶段基于平均教师的在线自蒸馏以指数滑动平均教师从较干净加噪输入生成伪目标,指导学生处理经物理仿真相对脉冲响应再混响并加噪的困难输入,并以原观测作辅助正则防止坍缩,实现去混响与隐式降噪。与需多通道约束求显式滤波器或迭代扩散联合估计房间脉冲响应的方法不同,该机制完全避开显式滤波器求解,直接学习噪声不变表示。在WSJ0CAM-DEREVERB测试集下,ARTTStageII的SI-SDR为7.3 dB,高于BUDDy的SI-SDR 2.1 dB。该结论适用边界受限于单仿真语料与5至25 dB扩散噪声及高斯扰动假设,对真实房间脉冲响应失配和强非平稳噪声的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://arttdemo.github.io/artt_demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
254. 没有通用冠军的语音识别:用同一标尺同时量准度与速度
标签:#基准设计 #长音频处理 #多语言 #语音识别
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Vaibhav Srivastav:机构信息未能从会议 PDF 纯文本可靠映射
- Steven Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Eric Bezzam:机构信息未能从会议 PDF 纯文本可靠映射
- Eustache Le Bihan:机构信息未能从会议 PDF 纯文本可靠映射
- Nithin Rao Koluguri:机构信息未能从会议 PDF 纯文本可靠映射
- Piotr Żelasko:机构信息未能从会议 PDF 纯文本可靠映射
- Somshubra Majumdar:机构信息未能从会议 PDF 纯文本可靠映射
- Adel Moumen:机构信息未能从会议 PDF 纯文本可靠映射
- Sanchit Gandhi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理多数据集多系统下自动语音识别不可比的评测问题,输入为短语音、长语音与多语言语音,输出为转写质量与效率排名,难点在于输出格式不一、长音频切分策略各异与测试污染难以排查。方法链分为四步:先统一托管11个数据集并按30秒阈值划分短长语音,再对参考与假设文本做去标点去大小写与英文规整以统一词错误率口径,然后在同一硬件下以最大吞吐批量测逆实时因子以比较相对效率,最后以社区拉取请求方式接入新模型并复验后更新榜单。与既有单数据集或单语言评测相比,该机制把准确率与效率解耦为双指标,并用非商业许可数据集与多数据集平均抑制单数据集污染风险。在短英文基准评测下,Zoom Scribe v1的WER为5.80,低于Cohere Labs Transcribe的WER 5.84。该结论的适用边界受限于所选语料与强归一化口径,Conformer结合大语言模型解码器趋势也受训练数据与规模影响。结论仅适用于所选数据集与强归一化口径,不宜直接外推为架构本身的因果优劣,也未验证远场与噪声等条件。原文未披露训练成本,推理成本仅披露评测硬件环境而无完整功耗与费用核算。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
255. 从说清是谁在说到读懂多人对话:MSU-Bench 的两层说话人诊断
英文题目:MSU-Bench: Towards Understanding the Conversational Multi-Speaker Scenarios
标签:#基准设计 #多语言 #语音 #音频问答
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#基准设计
👥 作者与机构
- Zhaokai Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhennan Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Chengyou Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Dehui Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuang Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Chunjiang He:机构信息未能从会议 PDF 纯文本可靠映射
- Pan Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该基准输入为1至5分钟真实中英文多说话人对话音频,输出为四选一单字母答案,要求模型在重叠、打断与快速轮转等复杂条件下完成从谁在何时说什么到角色关系与意图的递进推理。构建链路由Gemini做对话质量筛选输出可用片段,接着由Volcano API与Gemini分别负责声纹分离转写与身份及副语言标注,再由Gemini结合音频、标注与任务提示生成候选问答,最后经8名音频背景人员全量校验只保留答案可判定项。相比单说话人或单任务评测,其机制差异在于两层任务递进与五种说话人指代方式及错误类型标注的干扰项设计,使时间接地定位与错归因可被分离诊断。在 9 个大音频语言模型 Large Audio Language Models / LALMs 的零样本评测中,Gemini-3-Flash 以 0.77 总体准确率领先最强开源 MiMoAudio 的 0.56。该结论仅适用于所选 8 个电话会议与媒体语料及客观选择题设置,未验证开放式生成与长时跨会议跟踪。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
256. 用自然语言请求加长篇富标题来统一语音合成:Bagpiper-TTS 的规划-标题-生成链路
英文题目:Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis
标签:#指令微调 #统一音频模型 #语音 #语音合成
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音合成 | 主方法:#指令微调
👥 作者与机构
- Jinchuan Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Haoran Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Siddhant Arora:机构信息未能从会议 PDF 纯文本可靠映射
- Takashi Maekaku:机构信息未能从会议 PDF 纯文本可靠映射
- Keita Goto:机构信息未能从会议 PDF 纯文本可靠映射
- Jin Sakuma:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Shinohara:机构信息未能从会议 PDF 纯文本可靠映射
- Chao-Han Huck Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
Bagpiper-TTS要处理自由形式自然语言请求的通用语音合成,输入为任意措辞的用户指令,输出为满足转写与副语言属性的目标语音,难点在于请求欠指定、措辞多变且跨越多类合成任务并含模糊声学描述。该系统先做文本规划Text Planning解析意图与事件结构,再合成数百词元的丰富字幕Rich Caption作为声学蓝图,最后由字幕到语音模块直接生成离散音频序列。该链条在单一统一模型内端到端执行,规划输出进入字幕生成,字幕则继承预训练对齐以驱动合成并保持推理连贯。与槽位填充式传统系统相比,其机制差异在于用可扩展文本中转替代固定元数据接口,从而容纳模糊角色描述与非标准声学要求。在Seed-TTS-Eval英文基准经典任务下,Bagpiper-TTS的WER为1.7%,低于CosyVoice 2的WER 2.6%。该结论限于英文为主的受控评测与自造请求,外推到多语言、长时对话与强音乐伴奏场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
257. 留住语调还是藏住身份:用扩散引导连续调节匿名强度
英文题目:DiffAnon: Diffusion-based Prosody Control for Voice Anonymization
标签:#扩散模型 #隐私保护 #韵律 #语音 #说话人匿名化
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#扩散模型
👥 作者与机构
- Ismail Rasim Ulgen:机构信息未能从会议 PDF 纯文本可靠映射
- Zexin Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Andrews:机构信息未能从会议 PDF 纯文本可靠映射
- Philipp Koehn:机构信息未能从会议 PDF 纯文本可靠映射
- Berrak Sisman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人匿名化需输入源语音并输出隐藏说话人身份但保留语言内容与表达力的语音,难点在于韵律同时承载语义情感与身份线索。DiffAnon先用语音分词器SpeechTokenizer提取首层语义嵌入作为内容先验,再用掩蔽韵律模型提取帧级韵律特征与单句说话人向量共同条件化去噪扩散过程,最后经编解码器重建波形,推理时以伪说话人替换源说话人并用引导权重调节源韵律保留度。与固定丢弃或启发式扰动韵律的已有方案不同,该方法将匿名化表述为在语义流形上的声学细化,使无分类器引导可在单个模型内连续插值权衡效用与隐私。在VoicePrivacy 2024 libri-test懒惰攻击场景下,空韵律DiffAnon的EER为42.43%,高于全韵律DiffAnon的EER 33.09%。该结论限于英语朗读语音与挑战所配攻击与识别器,跨语言、自发情感与强自适应攻击尚未验证。训练约40万步占用单张NVIDIA H100,推理需100步DDIM采样,流式与实时部署成本原文未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
258. 不微调也能写长叙事:用多尺度可听证据约束大模型的音乐艺术解说
英文题目:Music Artistic Captioning: Towards Translating Music into Expressive Language
标签:#提示学习 #大语言模型 #长音频处理 #音乐 #音频字幕生成
评分:7.0/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频字幕生成 | 主方法:#提示学习
👥 作者与机构
- Ubaid Ullah:机构信息未能从会议 PDF 纯文本可靠映射
- Hyun-Chul Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Zied Bouraoui:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理分钟级长音频音乐艺术字幕生成,输入为演进波形,输出为多句连贯叙事,需融合速度配器与情感曲式并跨段保持一致,配对数据稀缺与微调过拟合使长程连贯更难。方法分四步:先做全局与功能与局部三尺度切分得到时间分区,再抽取声学语义特征并聚合成证据词典,接着将词典语言化为伪证据并组装含邻段的分层上下文,最后由冻结指令大语言模型生成经格式校验的字幕并经一次性迭代提示优化仅校准文风。与依赖配对微调的字幕器不同,该方法以冻结证据约束生成,模块可换且无需重训,检索增强与结构化提示保障可控叙事与跨数据集泛化。在MQAD测试集基准下,MAC的B1得分为0.3112,高于LP-MusicCaps的B1得分0.1972。在歌剧与全曲场景下其情感一致性与Art得分领先而语义相似度落后,体现表达性与语义对齐的权衡。该结论适用边界受限于切分与特征工具有效及英语程序注释风格偏好成立,人评缺失使艺术性主张尚未验证。推理开销与硬件为两块RTX 3090上分别运行推理与特征提取,生成温度为0.2且最大2048令牌,原文未披露训练成本与延迟吞吐。
🔗 开源资源
- 代码相关资源:https://github.com/uu95/MAC — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
259. 高资源模型为何在东南亚语言上失灵:SEA-Spoof 的配对构造与跨源评测
英文题目:SEA-Spoof: Bridging the Gap in Multilingual Audio Deepfake Detection for South-East Asia
标签:#基准测试 #数据集构建 #多语言 #语音 #音频深度伪造检测
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频深度伪造检测 | 主方法:#数据集构建
👥 作者与机构
- Jinyang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Nana Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Zihan Pan:机构信息未能从会议 PDF 纯文本可靠映射
- Qiquan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Sailor Hardik:机构信息未能从会议 PDF 纯文本可靠映射
- Soumik Mondal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对东南亚多语言场景下音频深度伪造检测输入为16 kHz语音、输出为真伪二分类,但高资源语言训练模型在声调与非声调语言上严重失配的难题,该文构建了覆盖6种语言的大规模配对数据集。构建链条分为三步:先按人口覆盖、语言类型与欺诈现实相关性选定泰米尔语、印地语、泰语、印尼语、马来语和越南语并汇集多源真实语音,再以真实转录驱动10个开源与4个闭源合成系统生成配对伪造,最后按语言与系统分层划分为训练验证测试并配套评测协议。与已有英语中心或长尾测试集相比,其机制差异在于转录级真实伪造配对与开源闭源双源覆盖,使语言效应与系统效应可分离归因。在SEA-Spoof测试集下,MoLEx的错误率为43.822%,高于MoLEx在ASVspoof5测试集下的错误率1.25%。该结论目前仅在所选语种、系统与受控配对条件下成立,对未知方言、新兴扩散式合成及野外信道的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/coqui-ai/TTS — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
260. 用发音器官的动作做桥梁:ARTIST 如何把 11 种印度语言压缩进 20 个离散单元做英译
标签:#向量量化 #发声与构音 #低资源 #多语言 #语音翻译
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#向量量化
👥 作者与机构
- Khushal Yadav:机构信息未能从会议 PDF 纯文本可靠映射
- Vinayak Abrol:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究11种印度语言到英语的直接语音到语音翻译,输入为源语言波形,输出为英语波形,难点在于平行语音稀缺、声学变异大以及长音频自回归幻觉严重。方法链分为两阶段:先用IMS Toucan提取64维二值构音特征并以残差风格向量量化自编码器学习共享离散空间,码本仅20个条目;再由Conformer编码器对80维梅尔滤波器组建模并经中间CTC对齐源端离散单元以剥离噪声;接着由卷积增强差分Transformer自回归预测目标端离散单元;最后经冻结解码器重构构音特征并由Articulator-to-Mel生成器与HiFi-GAN-V1声码器合成波形,全程不经过文本或音素中间表示。相比依赖大规模声学离散单元与参数堆叠的SeamlessM4T类方案,该工作以生理约束的极小码本强制跨语言共享,从机制上将高资源语言变为低资源语言的语音支架。在BhashaAnuvad筛选子集的20秒至50秒长音频测试上,印地语方向取得22.14的BLEU与0.726的COMET,显著高于基线的13.21与0.654;推理 footprint为166M,其中核心语音到构音器83M、声谱生成器50M、声码器31M、冻结向量量化解码器2M。该结论限于印度语系到英语、短训练长测试的特定划分,未验证反向翻译、非印度语系泛化与主观听感。原文披露单卡H100训练53个周期,具备低显存部署潜力。
🔗 开源资源
- 演示资源:https://sites.google.com/view/artist-demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
261. 一个解码器统一三种增强任务:连续条件加离散目标的自回归路线
英文题目:UniSE: A Unified Framework for Decoder-Only Autoregressive LM-Based Speech Enhancement
标签:#自回归模型 #多任务学习 #偏好优化 #语音增强
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#自回归模型
👥 作者与机构
- Haoyin Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Chengwei Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Shaofei Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaotao Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Yinghao Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxiang Kong:机构信息未能从会议 PDF 纯文本可靠映射
- Zheng Xue:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从含噪、混响、削波、限带、丢包及双人混叠的退化语音中恢复目标干净语音,难点在于失真类型多样且语音恢复与目标说话人提取及语音分离的学习范式相互冲突。UniSE先以冻结WavLM Base Plus抽取参考与退化语音连续特征并经线性适配器映射为条件,再由12层解码器自回归生成BiCodec解耦的全局与语义离散令牌,最后经BiCodec解码器重建波形,条件特征作为前缀进入解码器而输出令牌经编码器监督训练。任务令牌切换语音恢复与目标说话人提取及反向提取模式,首轮恢复较响说话人再以其为参考提取并反向提取另一人,从而多轮组合实现双人分离,渐进式直接偏好优化先以DNSMOS平均分再以WavLM特征距离做偏好对齐听感。相对掩码预测与直接映射的多任务框架,该自回归按条件生成目标令牌的机制兼容不同任务模式切换与组合,避免了统一映射冲突并支持感知对齐细化。在DNS 2020含混响测试集下,UniSE+PRL的OVRL得分为3.64,高于Conv-TasNet的OVRL得分2.01。该结论限于16 kHz非流式英文与中文数据及双说话人分离流程,尚未验证严格流式与多于2人场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
262. 幻觉来自只看文字不听声音:用对齐线索把小型语音语言模型拉回声学
标签:#CTC #音频大模型 #可解释性 #语音 #语音识别
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.4/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#CTC
👥 作者与机构
- Bi-Cheng Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Jhih-Rong Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Fu-An Chao:机构信息未能从会议 PDF 纯文本可靠映射
- Berlin Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强语言模型以语音编码器输出的音频标记与指令嵌入为输入生成转写,易产生脱离声学证据的编造词,难点在于强语言先验压制跨模态接地。本文将幻觉操作化为对齐后无参考对应的插入词子集,以幻觉词数与参考词数之比度量幻觉错误率。作者先用零消融因果中介比较多头自注意力与多层感知机的贡献并分析注意力分布,确认幻觉时注意力几乎完全偏向文本标记,再将该定位送入缓解设计。为此提出AudioSLM,在输入层用联结时序分类模块抽取帧级对齐logit并经门控精炼音频标记注入时序线索,在每层注意力与感知机之间插入以音频标记为键值的交叉注意力强化接地。主干采用SmolLM2系列并冻结语音编码器与语言模型主体,仅更新低秩适配、连接器、CTC相关层与新增交叉注意力层。在LibriSpeech-100训练、dev-clean/other与test-clean/other评测下,SmolLM2-135M规模的HER在dev-clean上从52.01%降至8.69%,插入错误从3.69%降至0.74%,test-other词错误率(Word Error Rate,WER)为11.92%。但主干增大至360M和1.7B时HER分别回升至10.64%和12.76%,且验证仅限英文朗读语音。该结论适用边界受限于英文朗读语料,跨语言与自发语音场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/bicheng1225/AudioSLM — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
263. 只看脸说方言:K-DIALECT 如何把说话人身份与方言韵律分开建模
英文题目:K-DIALECT : Korean Dialect-Aware Face-Based Speech Synthesis
标签:#多模态学习 #韵律 #低资源 #音视频语音合成
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音合成 | 主方法:#多模态学习
👥 作者与机构
- Seongyeon Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Juyeob Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Eunil Park:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该文处理韩语六方言文本到语音合成,输入为标准韩语文本加单张人脸图像加方言标识,输出为保留说话人音色且具方言韵律的语音,难点是方言干净参考音频稀缺且标准语模型易抹平方言语调。方法链分四步:基于T5的方言翻译器先将标准语转为目标方言音素序列,双分支人脸编码器用ArcFace提身份、用CLIP提风格并融合成说话人嵌入。方言条件基频预测器输出与音素等长的相对半音偏移轨迹,FiLM融合说话人与音高嵌入后驱动基于GPT的声学模型生成梅尔频谱图或离散音频标记。与依赖参考音频的XTTS-v2不同,该方法以人脸解耦身份风格并显式建模方言音高轮廓,因而在无参考噪声环境下仍可控生成方言语调并保持音色。在lips数据集配对图像语音评测设置下,Ours的MCD为14.66,低于XTTS-v2的MCD 18.93。其结论适用边界受限于朗读体短句与首尔等六类粗粒度方言,方言内部变体与跨地域人脸泛化等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://dxlabskku.github.io/K-Dialect/ — 链接可访问(HTTP 200)
- 演示资源:https://dxlabskku.github.io/K-Dialect/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
264. 一步去噪去混响:薛定谔桥轨迹为何要配 Mamba 的状态演化
英文题目:Schrödinger Bridge Mamba for One-Step Speech Enhancement
标签:#扩散模型 #状态空间模型 #去混响 #语音增强
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#扩散模型
👥 作者与机构
- Jing Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Sirui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Fan Fan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理联合去噪与去混响下的语音增强,输入为含加性噪声与混响的退化短时傅里叶变换 Short-Time Fourier Transform(STFT)谱,输出为干净语音谱,难点在于真实混响加噪声下细节重建与单步低时延推理难以兼得。方法链分3步推进:首先按方差爆炸 Variance Exploding(VE)调度由干净与退化配对样本显式构造薛定谔桥最优传输 Optimal Transport(OT)中间态 \(x\_t\) 作为训练锚点。随后含高斯傅里叶时间嵌入的条件化 oSpatialNet-Mamba 主干以 \(x\_t\) 为输入学习数据预测映射。最后推理时固定 \(t=1\) 由退化端单次前向直接重建干净目标。与盲映射或掩蔽学习仅见起点终点不同,该范式在训练期显式暴露连续传输动力学,并以 Mamba 循环状态演化内化最优控制策略。在DNS Real Recordings测试集下,SBM的OVRL指标为3.198,高于SB-NCSN++(10)的OVRL指标3.024。该结论适用边界受限于16 kHz去噪去混响语音增强任务与DNS合成及真实录音验证范围,尚未验证超分辨率与语义级修复等外推场景。原文未披露训练硬件与时长细节,仅给出 GPU 实测 RTF 与 40 ms 内算法时延设计。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
265. 冻住编解码器再补音高:声调丢失为何要走旁路残差
英文题目:Pitch-Injected Residual Adapter for Tonal Language in Neural Audio Codec
标签:#Adapter #语音学与音系 #低资源 #语音 #音频编码
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频编码 | 主方法:#Adapter
👥 作者与机构
- Jie-Shiang Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Ya-Tse Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
任务输入为16kHz音频经冻结编码器得到的残差向量量化隐变量,输出为保留词义性基频轮廓的重建音频,实际难点在于量化导致F0平滑、八度错与清浊混淆,而常用感知损失对F0不敏感,且闽南语等存在跨3-5音节的长程变调与靠时长和喉塞而非F0区分的入声调。该方法先用WORLD Harvest提取逐帧基频与清浊音标志并量化为4+1比特边信息,为后续提供显式音高监督输入。接着空洞卷积音高注入器将量化音高映射为音高残差,同时置信网络从量化隐变量与清浊标志学出逐帧门控以在入声调与清音段抑制注入。门控残差叠加至冻结隐变量后送入冻结解码器重建,并以CREPE-Tiny嵌入损失回传标准重建损失缺失的音高梯度。与改写权重的全量微调不同,该并行残差路由冻结原编解码器且可完全移除,因而在修复声调的同时避免灾难性遗忘。在闽南语、粤语、越南语3种声调语言与EnCodec、DAC、Mimi、WavTokenizer、BigCodec共15组配置上,编解码器引入的声调错误率(dTER)平均相对降低35.7%,其中EnCodec在越南语上从0.490降至0.120。结论受限于闽南语复杂变调(Tone Sandhi)的声学可恢复上限、对ASR测量链的依赖以及WORLD时延瓶颈,未做正式主观听感与流式验证。单A100上适配器额外时延仅0.92 ms,但WORLD提取5 s音频需1406.66 ms,边信息开销为0.38 kbps(75 Hz)以内,至多0.4 kbps。
🔗 开源资源
- 第三方资源:https://huggingface.co/kyutai/mimi — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
266. 冻住原文、只练新层:用深度扩展把文本大模型改成能听的语音模型
英文题目:Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling
标签:#多模态学习 #参数高效微调 #大语言模型 #语音 #语音识别
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#参数高效微调
👥 作者与机构
- Kazuki Yano:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Suzuki:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为离散化语音token序列与文本指令,输出为转写或按指令生成的文本,难点在于语音持续预训练会灾难性遗忘文本大语言模型已习得的语言与指令能力。方法链分四步:先按OpusLM范式将语音离散化为语义加声学token并追加到原词表尾部,再在冻结文本模型中插入占原层数25%的新层并仅训练新增嵌入与新层,接着对新增层采用函数保持初始化使其初始为恒等映射,最后语音任务用全模型推理而纯文本任务丢弃新增层以精确恢复原模型。相比全量微调与低秩适应,其机制差异在于完全不改动原权重而用新增深度吸收跨模态失配,保留原始计算路径的可逆性。在LibriSpeech test-clean与test-other上,1.7B规模的交错式E-Branchformer变体以0.75B可训练参数取得2.3%与5.3%词错率,持平或优于全量微调的2.3%与5.6%,而文本平均分仅下降6.8%,远小于全量微调的32.6%。结论边界限于英文自动语音识别与SmolLM2系列,未验证多语言多任务与长时推理下的保持能力。原文未披露训练推理部署成本与代码模型数据发布。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
267. 野外影视学表达:用属性思考令牌把开放指令和音色解耦
英文题目:Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions
标签:#自回归模型 #流匹配 #SFT #文本到语音
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#自回归模型
👥 作者与机构
- Junhui Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Qianhui Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Qingxiang Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Dawei Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Ling Miao:机构信息未能从会议 PDF 纯文本可靠映射
- Qiangqiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务以开放式自然语言指令与待合成文本为输入,在给定参考音频音色条件下输出兼顾指令跟随与细粒度情感韵律的语音,难点在于野外极端情感与副语言现象稀缺,且提示音频风格易与指令冲突。本文方法链分四步:多模态管线从影视音视频中切分去噪并对齐单说话人语句,再由多模态大模型分三阶段生成指令标注;无提示音频的自回归语言模型将指令与文本映射为韵律化离散语音词元,中间以紧凑属性思考词元作先验;流匹配声学模块与声码器仅在此后注入参考音色;指令条件说话人微调以说话人标识将通用控制能力迁移到特定人。与需音频提示或限于主流情感的已有指令语音合成相比,该路由将风格归语言模型而音色归声学模块,从机制上缓解风格泄露。在基础评测集上该系统声学参数指定得分为91.1接近Gemini-Flash TTS的92.3,角色扮演得分为88.7超过该基线的80.1,指令跟随主观分为3.81为同期最高;扩展集角色扮演得分为90.1,指令主观分为3.96。结论仅适用于有参考音频的音色注入场景,在噪声与混响等恶劣声学条件下仍退化,且高表现力伴随词错率上升。原文披露单张RTX 4090上整体实时率为0.06,训练成本未充分披露。
🔗 开源资源
- 演示资源:https://zhangjh915.github.io/PolyInstructTTS-demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
268. 不用注册音频也能做引导增强:用干净先验把 noisy 嵌入拉回正轨
英文题目:G-MaP-SE: Guided Speech Enhancement via GMM-Based Prior Matching
标签:#正则化 #单通道 #语音 #语音增强
评分:7.0/10 | 创新 1.0/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#正则化
👥 作者与机构
- Yike Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Ziqian Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zikai Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Xingchen Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhuangqi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Xianjun Xia:机构信息未能从会议 PDF 纯文本可靠映射
- Chuanzeng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道语音增强的输入为含加性噪声的波形,输出为干净语音估计,在噪声类型与说话人分布偏移下仅靠声学线索难以维持音质与说话人一致性。本文提出G-MaP-SE框架,先以冻结的说话人嵌入提取器从干净语音构建高斯混合模型先验,再将噪声utterance的嵌入经余弦相似度与温度加权匹配到先验均值组合得到矫正嵌入,最后经门控融合模块注入时频增强主干的中间特征以指导去噪。相比直接使用噪声嵌入作条件或依赖额外注册音频的个性化增强,该机制把条件特征约束在干净嵌入空间并允许按目标域更换先验而不重训主干。在VoiceBank+DEMAND训练并在DNS Challenge 2020无混响测试集评估的跨域去噪任务下,MP-SENet+G-MaP的WB-PESQ为2.794,高于MP-SENet+Noisy-Cond的WB-PESQ 2.765。该结论限于去噪任务与英语朗读类数据,未验证强混响、多说话人重叠或极低信噪比下的原型误匹配风险。原文未披露训练时长、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Hello3orld/G-MaP-SE — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
269. 留住多少口音自己定:用离散扩散重写口音相关的语音单元
英文题目:Controllable Accent Normalization via Discrete Diffusion
标签:#扩散模型 #向量量化 #语音 #语音转换
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#扩散模型
👥 作者与机构
- Qibing Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhan Du:机构信息未能从会议 PDF 纯文本可靠映射
- Tom Ko:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yannan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haizhou Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口音归一化(Accent Normalization,AN)需将第二语言(L2)口音语音转为母语(L1)发音,同时保留说话人特征与语言内容,难点在于口音强度不可调与节奏失配。所提扩散语言模型口音归一化(Diffusion Language Model for Accent Normalization,DLM-AN)先由自监督分词器与内容编码器抽取音素导向表征,再由公共词元预测器筛选可复用的原生发音词元,并由时长比预测器决定目标长度,最后由掩码离散扩散解码器迭代补全目标词元并经流匹配合成器重建波形。相比连续扩散调起始步长与自回归词元映射,该机制以阈值控制复用比例实现细粒度口音保留,同时支持总时长缩放。在扩展L2-ARCTIC测试集下,DLM-AN-2的WER为10.64%,低于Source的WER 15.86%。随着复用阈值降低,口音保留连续增强而内容可懂度轻微下降,验证了阈值旋钮的可解释控制作用。该结论的适用边界限于英语多口音与合成原生目标的半合成评测,对重口音识别误差传播与极端时长缩放仍脆弱受限。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://p1ping.github.io/dlman-demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
270. 只看两词未来:S5-TTS 如何在有限前视下做逐词流式合成
英文题目:Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead
标签:#自回归模型 #知识蒸馏 #流式处理 #零样本 #文本到语音
评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#自回归模型
👥 作者与机构
- Muyang Du:机构信息未能从会议 PDF 纯文本可靠映射
- Jason Roche:机构信息未能从会议 PDF 纯文本可靠映射
- Junjie Lai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
级联式大语言模型加语音合成系统的瓶颈是文本到语音环节需等待完整句子才能启动,导致端到端响应延迟过高,逐词增量合成又容易丢失韵律与发音准确性。本文提出流式S5-TTS,以音素序列为编码器输入,以有限标量量化(Finite Scalar Quantization,FSQ)声码器码字为解码器输出,编码器按当前词加2个前视词构建上下文,解码器逐词自回归生成并用交叉注意力峰值检测词边界,词间波形经2帧重叠与汉宁窗交叉淡化拼接。辅助卷积注意力先预测解码步到编码步的单调对齐以构造解码器前视掩码,再与主干联合训练并通过交错多源蒸馏接受全上下文教师的软标签监督。与全上下文T5-TTS相比,蒸馏后S5-TTS在LibriTTS未见说话人集上词错率由3.49%降至2.65%,主观平均意见分差距缩小到0.04。该结论仅在英语朗读与对话文本、单教师蒸馏及2词前视设置下验证,未覆盖多语种、噪声参考与长篇章外推。原文未披露训练时长与部署成本。
🔗 开源资源
- 演示资源:https://s5-tts.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
271. 去掉参考文本后,流匹配语音合成如何不再把含糊发音带进输出
英文题目:Transcript-Free Flow-Matching Text-to-Speech via Speech Feature Conditioning
标签:#Adapter #流匹配 #零样本 #语音 #文本到语音
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- SooHwan Eom:机构信息未能从会议 PDF 纯文本可靠映射
- Hee Suk Yoon:机构信息未能从会议 PDF 纯文本可靠映射
- Eunseop Yoon:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Hasegawa-Johnson:机构信息未能从会议 PDF 纯文本可靠映射
- Chang D. Yoo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成需以短参考音频和目标文本生成保留音色且内容正确的新语音,难点在于参考转录依赖外部识别,且病理或口音语音中文本期望与实际声学严重错位。本文提出参考转录无关的RTFree-F5,先以冻结的自监督编码器从参考波形抽取帧级连续表征,再经轻量投影器映射为类文本条件向量,最后与目标文本编码拼接送入流匹配骨干做掩蔽频谱重建。与复用字符填充的原版F5-TTS相比,该机制将参考条件从规范发音期望改为与声学对齐的实际发音描述,从而缓解冲突并省去推理期转录。在构音障碍集SAP发育集上系统词错率由原始语音的24.62%降至10.39%,优于oracle基线的20.71%,自然度由2.16升至2.85;在L2-ARCTIC上由10.75%降至1.44%,优于oracle基线的2.00%。在LibriSpeech-PC上词错率1.77%和自然度4.13保持竞争力。该结论目前仅在英语朗读与两类非典型语音上验证,重度病理、跨语言与对话式场景的外推尚未证明。原文未披露训练之外的推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
272. 高分辨率歌声打假:全带保全局、子带抓局部如何协同
英文题目:Joint Fullband-Subband Modeling for High-Resolution SingFake Detection
标签:#知识蒸馏 #混合专家模型 #音乐 #音频深度伪造检测
评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#混合专家模型
👥 作者与机构
- Chia-Yu Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Xuanjun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Sung-Feng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Haibin Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jyh-Shing Roger Jang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为野外采集的含伴奏歌声经人声分离后的人声片段,输出为真实与合成翻唱的二分类判定,难点在于歌声泛音、气息与高频纹理集中在高频且伪造痕迹在频谱上分布不均,16 kHz系统将其系统性丢弃。方法链分两阶段:阶段一并行训练覆盖0-22.05 kHz的全频带专家与多个等宽无重叠切分的子频带专家,均以ImageNet预训练ResNet18为骨干并替换为32维投影嵌入加轻量分类头,分别输出嵌入与检测对数几率;阶段二在由全频带与选中子频带构成的模型池上实现四种融合,决策层聚合做等权平均,特征层拼接沿特征维拼接后送256与128单元两层感知机,跨专家交互将嵌入组织为序列并用多头自注意力动态重标定,跨专家蒸馏以子频带为教师、全频带为学生并用温度为3.0的KL散度加嵌入均方误差约束,区分单教师与双教师配置。与已有语音移植方法的差异在于保留完整高频带宽并以全局校准局部,而非仅拼接子频带。在重采集WildSVDD上,最优变体FBFSA-D-LM在Test A达等错误率1.58%,FBI-LM在Test B达7.45%,相对自复现UNIBS基线分别相对下降31.6%和30.9%。该结论仅在人声检测、重采集划分下验证,对超高频主导伪造与未见合成器的外推尚未证明。原文未披露训练推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
273. 只传空间信息也能做指向性滤波:神经方向性编码如何压到 0.25 kbps
英文题目:Neural Directional Coding: Joint Spatial Coding and Filtering with Configurable Directivity Patterns
标签:#向量量化 #麦克风阵列 #空间音频信号 #语音 #音频编码
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频编码 | 主方法:#向量量化
👥 作者与机构
- Weilong Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Emanuël A. P. Habets:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
神经方向性编码(Neural Directional Coding,NDC)要解决的任务是发送端仅有紧凑传声器阵列信号,接收端需按推理时任意给定的方向性图合成虚拟方向性传声器(Virtual Directional Microphone,VDM)信号,难点在于高阶频率不变波束通常需要多通道细节而全阵列传输码率过高。该方法先由空间信息编码模块将多通道频谱压缩为可传输边信息,再在接收端将其与单通道参考信号拼接后送入条件化空间滤波器估计复数掩蔽,最后用掩蔽乘以参考信号得到目标方向输出。相对先重建全部通道再做神经方向滤波的级联方案,其机制差异在于完全跳过波形重建并联合优化编码与滤波,使有限比特只保留通道间幅度相位差等可滤波性信息。在4通道16 kHz阵列的EARS测试集上,空间边信息压缩至0.25 kbps的1.4 M参数模型在12阶心形图上取得22.01 dB信号失真比(Signal-to-Distortion Ratio,SDR),超过7.5 kbps的90.8 M参数级联基线的22.02 dB量级并在感知语音质量(Perceptual Evaluation of Speech Quality,PESQ)上领先约0.1分。该结论目前仅在无混响静态点源仿真和固定阵列几何下验证,对高混响、运动源和阵列失配的外推尚未定量证明。原文未披露训练硬件型号与训练时长,推理成本仅能以轻量参数规模间接体现。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
274. 浊音多给比特、清音少给比特:VoCodec 如何用发声驱动量化压到 1.1 kbps
英文题目:VoCodec: A Low-bitrate Streamable Neural Speech Codec with Voicing-driven Quantization
标签:#向量量化 #流式处理 #语音 #语音编码
评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Xiao-Hang Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Ai:机构信息未能从会议 PDF 纯文本可靠映射
- Rui-Chen Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Lirong Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
- Ji Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
神经语音编码以波形为输入、以极低码率离散符号及重建波形为输出,需在压缩下保持可懂度与感知质量,而均匀量化对能量分散的清音帧浪费比特是实际难点。全因果编码器先对MDCT频谱下采样建模并输出编码特征,为后续量化提供紧凑表征。浊音检测器并行对波形做FFT并在基频区间计算能量、经门限判决得到逐帧浊音标志,使帧级码率分配有据可依。浊音驱动量化器据该标志对浊音帧用残差标量向量量化精细编码、对清音帧仅用单个标量量化器,随后对称解码器重建MDCT谱并经逆变换合成波形。与统一复杂量化的已有方法不同,该机制把比特集中于感知权重高的浊音谐波,显著降低清音开销而保持流式低延迟。在LibriTTS语料16kHz、1.1kbps评测设置下,VoCodec的ViSQOL为4.115,高于StreamCodec的ViSQOL 4.048。结论目前仅在英语干净朗读语音验证,噪声、混响、音乐、多语言及可变码率部署约束尚未验证。单模型参数量9.31M、计算量2.62G FLOPs,保持轻量,训练超参数与硬件耗时原文未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
275. 声音里情绪、内容和病理是缠在一起还是各走各路:用互信息给解耦先称重
标签:#统计分析 #发声与构音 #言语障碍 #语音 #语音属性识别
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Bipasha Kashyap:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
- Pubudu N. Pathirana:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为单句语音波形,输出是情感、语言、病理及源滤波器特征集之间成对互信息的定量估计,难点在于高维连续互信息难以精确计算且神经估计方差大、易偏置。方法链分四步:先按声门源、声道滤波器与语义维度划分五个手工特征集,再用MINE下界与CLUB上界并行估计成对依赖并输出至加权环节。接着以KSG非参数估计为锚做自适应加权得到终值,最后对语义维度做源滤波器归因分解以解释声学来源构成。与以往单估计器或只看下游任务的做法不同,该框架用指数滑动平均稳定配分函数、用方差钳制稳定高斯条件模型并强制下界不超过上界,具有实际稳定意义。在跨维度均值表的评测设置下,情感-语言对MINE方法的互信息指标为0.00 nats,低于CLUB方法的互信息指标0.14 nats。该结论的适用边界受限于手工特征与所用英语语料,外推至学习表征与时序韵律尚未验证。结论仅适用于所用手工特征与英语情感、非母语口音、构音障碍及帕金森语料,不代表学习表征或时序韵律同样独立。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/avrpixel-design/P1 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
276. 把扩散模型做小做快:FastWave 用去噪重参数与轻卷积做任意到 48 kHz 超分
英文题目:FastWave: Optimized Diffusion Model for Audio Super-Resolution
标签:#扩散模型 #高效推理 #语音 #音频超分辨
评分:6.9/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频超分辨 | 主方法:#扩散模型
👥 作者与机构
- Nikita Kuznetsov:机构信息未能从会议 PDF 纯文本可靠映射
- Maksim Kaledin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音超分辨率需从8 kHz至24 kHz低采样输入恢复至48 kHz波形,难点在于奈奎斯特频率以上高频完全缺失且须保持幅度与相位一致。FastWave沿NU-Wave 2单模型多输入率框架,先以去噪器重参数化替代噪声预测并引入输入输出预条件,使网络在连续噪声水平下学习条件期望。接着训练噪声服从数据驱动对数正态分布以集中中等噪声区间,其输出的加权L2去噪目标直接决定采样起点与轨迹。然后推理沿概率流常微分方程用一阶Euler与EDM连续噪声表迭代去噪,主干保留短时傅里叶条件与双分支融合块,仅将局部分支换为深度可分离卷积并加入全局响应归一化以降参。与固定对数信噪比调度的NU-Wave 2相比,该去噪加EDM范式减少了训练迭代与函数求值次数并降低单步计算量。在VCTK上采样至48 kHz评测设置下,FastWave 8步的LSD指标为0.83 ± 0.06,高于NU-Wave 2的LSD指标0.78 ± 0.06。单次函数求值约12.87 GFLOPs,8步实时率(Real-Time Factor,RTF)约0.30,4步约0.16。结论仅限VCTK干净英文朗读语音的客观指标,未验证噪声、混响、音乐、跨语种与主观听感。该结论适用边界受限于上述干净语料且尚未验证噪声混响外推,140轮训练成本为单卡NVIDIA V100约30小时量级,推理开销随步数增加。
🔗 开源资源
- 代码相关资源:https://github.com/Nikait/FastWave — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
277. 连续对齐留给哼唱,离散词袋留给语音:冻结表征如何配匹配策略
英文题目:SSL-based Sequence Matching for Unsupervised Audio Retrieval
标签:#自监督学习 #音乐 #语音 #音频检索
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#自监督学习
👥 作者与机构
- Moreno La Quatra:机构信息未能从会议 PDF 纯文本可靠映射
- Alkis Koudounas:机构信息未能从会议 PDF 纯文本可靠映射
- Sabato Marco Siniscalchi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频到音频检索需在无标注下以哼唱查询匹配歌曲库并以示例语音查询匹配含相同双词语句库输出排序列表,难点在于音高偏差、语速伸缩、说话人差异与背景变化叠加且查询与库时长不对齐。第一步冻结语音预训练自监督学习Transformer对输入音频逐约二十毫秒帧抽取连续嵌入序列以保留声学细节,其输出直接作为连续分支的待比序列。第二步以K均值聚类将帧嵌入量化为簇嵌入与离散簇编号序列,簇嵌入保留旋律轮廓而簇编号近似音素类别以供后用。第三步按领域将上步产物分流,连续嵌入用动态时间规整做弹性对齐打分,离散编号视作词袋文档用词频逆文档频率或BM25匹配并统一排序。与需增强配对训练的Wav2Tok和固定动态时间规整(Dynamic Time Warping,DTW)的SUPERB流程不同,它系统对比DTW与词频-逆文档频率(Term Frequency-Inverse Document Frequency,TF-IDF)/BM25的领域适应性。在QbE-LibriSpeech评测任务下,HuBERT-LS加TF-IDF的准确率为0.633,高于DTW的准确率0.300。结论限于4206条哼唱查询对应48首歌与27个双词查询对应107个正例的小规模验证,未覆盖环境声、复调音乐与重叠语音。该结论适用边界受限于上述两套小规模语料,跨域泛化能力尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/MorenoLaQuatra/SSL-AIR — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
278. 在插值随机微分方程里把线性部分算准:十步恢复语音的求解器
标签:#扩散模型 #高效推理 #语音 #音频修复
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频修复 | 主方法:#扩散模型
👥 作者与机构
- Bunlong Lay:机构信息未能从会议 PDF 纯文本可靠映射
- Timo Gerkmann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音修复需从噪声、混响、削波、MP3压缩及窄带等退化观测中恢复干净语音,难点在于条件扩散逆过程需数十次调用大型评分网络且刚度发散导致不稳定。先以干净语音与退化观测间线性插值的均值演化假设为输入,将多类线性随机微分方程统一为插值随机微分方程,职责是证明漂移必为刚度加权残差形式并给出刚度函数与插值函数、扩散系数的互推公式,输出刚度函数与均值方差闭式演化。再以该刚度函数与已训练评分网络估计为输入,基于指数Runge-Kutta思想推导条件概率流常微分方程与含噪逆向随机微分方程的可调噪声族统一快速求解器,输出各离散时间步的二阶采样更新公式,该公式直接决定下一步的积分与噪声注入方式。最后以离散时间网格上的当前状态与中点评分为输入,用基本解精确积分含观测的线性刚性部分,再对评分非线性部分做Taylor展开并以权重积分,最后注入经精确积分的高斯噪声以调节随机性并生成下一状态。与Euler-Maruyama等直接离散全部漂移的方法不同,精确积分线性部分消除了刚度误差并保持二阶精度,因而能以更少调用达到高阶自适应求解器的质量。在去混响任务的测试集下,iSDE-2S的调用量指标为10 NFE,低于EuM、RK2和PC的调用量指标40 NFE。该结论的适用边界受限于复数短时傅里叶变换与NCSN++骨干及所训固定方差爆炸过程,对其他表示与极端退化的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
279. 不做联合优化:用逐层任务向量把同域 ASR 知识并入情感识别
标签:#模型融合 #语音 #语音识别 #语音情感识别
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#模型融合
👥 作者与机构
- Chia-Yu Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Huang-Cheng Chou:机构信息未能从会议 PDF 纯文本可靠映射
- Tzu-Quan Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanchao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ya-Tse Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
类别语音情感识别(Speech Emotion Recognition, SER)需同时读出说什么与如何说,词义不变性与韵律敏感性目标冲突使联合优化易跷跷板退化。本文先在MSP-Podcast上独立微调情感模型与域内识别模型,相减得到任务向量(Task Vector),再冻结WavLM-Large主干与双向量,仅学习每层合并系数与层加权聚合及分类头。合并后24层隐状态经可学习加权求和送入情感预测头(Prediction Head),避免反向传播同时拉扯共享编码器。与全局单系数合并不同,该方法为前端与24层编码器分别学习识别与情感系数,使识别向量稳定为语言锚点而情感向量在中深层主导韵律表达。在MSP-Podcast八分类(愤怒、轻蔑、厌恶、恐惧、快乐、中性、悲伤、惊讶)上,域内双向量自适应层级合并取得非加权平均召回率(Unweighted Average Recall, UAR)38.94%、宏平均F1(Macro-F1, MaF1)35.20%,高于冻结基线约1.89个百分点,远高于多任务学习(Multi-Task Learning, MTL)基线约29.5%。该结论限于保留人工转录的播客域内数据,未验证无转录、低资源或跨语种外推,且正文前后出现38.94%与38.62%两处UAR表述不一致。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://anonymous.4open.science/r/AdaLTM-62A2/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
280. 双耳不该固定滤波:BiEAR 用耳侧反馈逐帧调节频率选择性
标签:#自适应滤波 #鲁棒性 #空间音频信号 #语音 #声源定位
评分:6.9/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声源定位 | 主方法:#自适应滤波
👥 作者与机构
- Hanyu Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Eliathamby Ambikairajah:机构信息未能从会议 PDF 纯文本可靠映射
- Vidhyasaharan Sethu:机构信息未能从会议 PDF 纯文本可靠映射
- Qiquan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Haizhou Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理双耳多说话人定位与距离估计,输入为1秒双耳波形,需在混响、说话人未见与声源重叠下同时输出扇区存在性、方位角与距离类别。方法分三步:先对双耳信号分帧短时傅里叶变换并用K通道Gabor滤波器组聚合为子带表示;神经反馈控制器依据瞬时与平滑子带声压级逐帧输出调制信号,经绝对或相对策略改变各子带Q值从而重塑带宽与增益。该自适应表示进入第三步,从左右耳输出提取耳间强度差、相位差与互相关并送入扇区化多任务后端联合预测检测、方位与距离。与固定双耳前端的关键差异在于推理时逐帧时频自适应且左右耳可非对称调谐,模拟了外毛细胞增益调节的功能思想,因而能强调信息子带并稳定适应混响变化。在Lecture Hall房间评测下,BiEAR+Dual Controller+Rel.经环境迁移后的声音检测准确率为93.22%,高于未迁移的声音检测准确率74.92%。结论边界在于评测仍限于TIMIT合成混合与2个实测房间,移动声源与强噪声未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Hanyu-Meng/BiEAR — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
281. 语言一变就认错人?在嵌入、后端和打分三处消解语言干扰
英文题目:Effectiveness of Language Variability Compensation in Speaker Verification
标签:#对抗训练 #多语言 #语音 #说话人验证
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#说话人验证 | 主方法:#对抗训练
👥 作者与机构
- Ladislav Mošner:机构信息未能从会议 PDF 纯文本可靠映射
- Sara Barahona:机构信息未能从会议 PDF 纯文本可靠映射
- Sandro Cumani:机构信息未能从会议 PDF 纯文本可靠映射
- Johan Rohdin:机构信息未能从会议 PDF 纯文本可靠映射
- Jin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Oldřich Plchot:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理多语言说话人验证(Speaker Verification,SV),输入为不同语言的注册与测试语音,输出为是否属于同一说话人的判定,难点在于语言线索会纠缠说话人嵌入并在跨语言试验中造成系统性偏移。方法链分为四步:先用大规模预训练前端抽取语句级嵌入,再在前端以语言分类分支施加对抗约束以剥离语言信息,接着以解耦说话人与非说话人变异的后端建模剩余变异,最后经校准融合与语言相似度质量调制得到验证分数。相对已有做法的差异在于同时比较嵌入层不变表示、后端显式补偿与分数层补偿,揭示三者效果可相互替代而非简单叠加。关键证据是在 tv26 eval-A上双系统融合以等错误率(Equal Error Rate,EER)2.53%显著优于基线9.06%,方向为语言补偿带来一致增益。结论边界在于开发集仅覆盖训练可见的40种语言,未见38种语言与标签可疑子集上的行为尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
282. 既要匿名又要调情绪:DECRA 用因果 VA 轨迹做流式闭环控制
英文题目:DECRA: Dynamic Emotion Control for Real-time Speech Anonymization
标签:#对抗训练 #说话人匿名化 #语音情感识别 #语音转换
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#对抗训练
👥 作者与机构
- Ghady Nasrallah:机构信息未能从会议 PDF 纯文本可靠映射
- Waris Quamer:机构信息未能从会议 PDF 纯文本可靠映射
- Mu-Ruei Tseng:机构信息未能从会议 PDF 纯文本可靠映射
- Ricardo Gutierrez-Osuna:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
实时说话人匿名化的输入是连续语音流中交织的语言内容、说话人音色与动态情感,输出是保留内容但替换身份并可中和或重定向情感的语音,实际难点在于因果低延迟约束下身份与韵律高度纠缠且情感需逐帧跟踪,而现有流式变声缺少显式韵律控制、离线情感转换又只能做整句级全局调节。DECRA以TVTSyn为流式骨干,先由因果内容编码器提取语言 token并经全局音色记忆检索与球面插值生成时变音色轨迹,为后续解耦提供身份表征。接着带残差的MLP投影将全局说话人嵌入映射到无情感音色子空间,并以梯度反转的效价-唤醒回归器对抗剥离情感泄露,其输出的纯净音色进入波形解码器等待情感回补,这相对全局风格调节实现了音色与情感的并行解耦控制。附着于量化前内容特征的因果语音情感识别头在线预测效价-唤醒轨迹,经插值编码后与时变音色拼接并经条件层归一化融合模块驱动波形解码器,形成匿名化与动态情感控制闭环。在ESD情感中和上唤醒一致性达到0.81、词错误率为14.0%,显著优于Vevo等离线基线;以60 ms分块在GPU上实现约76.1 ms延迟与0.268实时率。该结论限于表演情感与伪标签评测闭环,效价维度与自然对话泛化尚未验证。原文未披露完整训练成本与部署压力测试。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
283. 线性效率与全局语义不可兼得?MamTra 用混合替换加蒸馏保住合成质量
英文题目:MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis
标签:#知识蒸馏 #高效推理 #语音 #文本到语音
评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#知识蒸馏
👥 作者与机构
- Tan Dat Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Sangmin Bae:机构信息未能从会议 PDF 纯文本可靠映射
- Joon Son Chung:机构信息未能从会议 PDF 纯文本可靠映射
- Ji-Hoon Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
LLM文本到语音以文本输入生成语音词元输出,自回归注意力二次复杂度使长序列显存与计算激增。MamTra交错保留部分Transformer负责全局语义、其余替换为Mamba-2负责局部时序,避免纯线性化丢失全局上下文。先搜索杂交位置与比例,在交错、连续与数据驱动七种策略及1:1至1:11比例中优选骨干布局进入映射。再去掉Softmax用结合律得到循环隐状态,把教师查询、键、值投影直接拷贝为Mamba-2的输出投影\(C\_t\)、输入参数\(B\_t\)与输入投影\(x\_t\)完成初始化。最后冻结教师,用真值交叉熵、教师-学生logits偏斜KL与词元嵌入均方误差联合蒸馏学生以恢复生成行为。在Seed-TTS-eval英文集上1:1 BlockBeg相对教师CosyVoice 2词错率(Word Error Rate, WER)从2.03%升至2.28%,绝对上升0.25个百分点,自然度主观分(Naturalness Mean Opinion Score, NMOS)3.66对3.68基本持平,2048上下文每词元节省约1.4e11次浮点运算,A6000上推理显存降低约34%。结论限于LibriTTS约0.5k小时英文朗读微调与3至27词英文朗读加1至62词长度压力集验证,1:11激进替换可懂度明显退化,未验证多语种、噪声提示与播客级超长部署,未报告端到端延迟吞吐与完整训练时长。该适用边界受限于英文朗读场景,激进替换失败条件与超长部署尚未验证,推理开销只报计算量与硬件显存未测延迟吞吐。
🔗 开源资源
- 演示资源:https://mm.kaist.ac.kr/projects/mamtra/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
284. 什么算错:意图与逐字两种答案下的口吃语音识别基准
英文题目:What Counts as an Error? Dual-Reference Benchmarking for Atypical ASR
标签:#评测协议 #言语障碍 #语音 #语音识别
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Hawau Olamide Toyin:机构信息未能从会议 PDF 纯文本可靠映射
- S Umesh:机构信息未能从会议 PDF 纯文本可靠映射
- Hanan Aldarmaki:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以口吃非典型语音音频为输入,要求同时产出意图转写与逐字转写两种合法输出,难点在于同一音频对应两种真值而单参考词错误率会奖励删除口吃属性的系统。方法链分三步衔接:先在FluencyBank Timestamped全量3430样本上对11个开源系统做零微调推理,得到原始预测文本;再经统一文本规范化后并行计算意图词错误率与逐字词错误率及语义指标,形成双参考排名;最后将音频段与CASA临床事件标注对齐,按SR、ISR、MUR、P、B五类事件切分误差构成,并对比词错误率与语义指标分歧以检验意图评测充分性。与既有单参考评测的本质差异是坚持双真值并行排名,从而暴露自回归解码的语言先验归一化偏置与CTC局部声学映射的保留偏置,为按听写与临床评估分选架构提供依据。在FluencyBank Timestamped基准下,NVIDIA Canary-1B-v2的意图词错误率isWER为13.85,低于Whisper Large-v3的意图词错误率isWER16.13。该结论的适用边界受限于英语访谈域与默认推理配置,跨域重度口吃外推尚未验证。结论限于英语访谈域与默认推理配置,未验证微调、多语言与重度外推。原文未披露训练与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Theehawau/usecase_asr — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
285. 儿童语音匿名化为何必须做儿童域适配:内容编码与声码器两端对齐
英文题目:Child-Centric Voice Anonymization in Single and Multi-Speaker Speech via Domain-Adapted SSL Models
标签:#领域适应 #主观评测 #隐私保护 #说话人匿名化 #目标说话人提取
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#说话人匿名化 | 主方法:#领域适应
👥 作者与机构
- Pranav Tushar:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoxiao Miao:机构信息未能从会议 PDF 纯文本可靠映射
- Rong Tong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童语音匿名化(Child-Centric Voice Anonymization)的输入为单人或双人混合儿童语音,输出为隐藏说话人身份但保留语言内容与儿童听感的语音,难点在于儿童高基频与发育变异性导致成人流水线内容表征失配与声码器成人化漂移。方法链分为三步:基于HuBERT的软内容编码(HuBERT-based Soft Content Encoder)提取语言表征并保留基频韵律,源说话人嵌入被儿童参考池嵌入替换以实现身份变换,HiFi-GAN声码器(HiFi-GAN Vocoder)以后两者重建波形,多说话人时先由Conformer目标说话人提取(Target Speaker Extraction,TSE)分离目标再做同样匿名化与混音重建。与成人池直转成人声的已有做法相比,该机制差异在于双组件儿童域适配加年龄一致参考池,从源头保留儿童声学线索而非年龄转换。在MyST测试集上全适配将等错误率(Equal Error Rate,EER)提升至45.09%且词错误率(Word Error Rate,WER)降至16.64%,优于未适配基线并保持有效隐私。结论外推受限于提取器与评测模型仍为成人训练,儿童对儿童高重叠与跨口音泛化尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/pranavtushar/SSL-CVA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
286. 直接拼历史反而变差:用投影压缩对话与关键词互补做语境 ASR
英文题目:Context Projector: Complementary Keyword and Dialogue Context Embeddings for LLM-based ASR
标签:#检索增强 #大语言模型 #语音 #语音识别
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.9/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#检索增强
👥 作者与机构
- Esaú Villatoro-Tello:机构信息未能从会议 PDF 纯文本可靠映射
- Sergio Burdisso:机构信息未能从会议 PDF 纯文本可靠映射
- Shashi Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Hasindri Watawana:机构信息未能从会议 PDF 纯文本可靠映射
- Srikanth Madikeri:机构信息未能从会议 PDF 纯文本可靠映射
- Manjunath K E:机构信息未能从会议 PDF 纯文本可靠映射
- Jeena Prakash:机构信息未能从会议 PDF 纯文本可靠映射
- Thibault Bañeras-Roux:机构信息未能从会议 PDF 纯文本可靠映射
- Kadri Hacioglu:机构信息未能从会议 PDF 纯文本可靠映射
- Petr Motlicek:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Stolcke:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
客服对话语音识别以当前轮音频与多轮对话历史为输入,输出当前轮转写文本,实际难点在于整体词错率与业务实体偏置词错率难以兼顾,且历史原文直接拼入提示词易引入噪声并加剧长上下文负担。该方法先用Gemma3 27B从历史轮次抽取显式单复关键词,形成轻量偏置记忆并拼入提示词以增强实体召回。接着用Dialog2Flow将历史语句映射为对话行为感知的语句嵌入,再经与语音投影器同构的上下文投影器压缩为少量上下文令牌,最后与语音投影和关键词共同送入冻结的WavLM-Large加Llama 3.2 3B Instruct解码。与直接追加原文关键词或历史轮次的做法不同,该互补设计以投影上下文为结构化接地约束关键词偏置,从而在提升实体精度的同时稳定整体转写,避免原文提示的词错率代价与显存溢出风险。在Defined.ai银行域测试集下,混合关键词与投影上下文方法的WER为9.9,低于无上下文基座的WER 10.2。该结论限于WavLM-Large加Llama 3.2 3B Instruct的SLAM-ASR基座与近期约10轮历史窗口,未验证自发对话、噪声重叠、跨语言与长历史外推能力。原文未披露训练时长、推理延迟与部署成本。上述适用边界尚未验证长历史外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/idiap/llm-asr-context-projector — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
287. 移动声源下方向选择固定滤波为何慢一拍:用卷积循环网络提前选滤波
标签:#RNN #麦克风阵列 #主动降噪 #声源追踪
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#主动降噪 | 主方法:#RNN
👥 作者与机构
- Boxiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengding Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Dongyuan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Junwei Ji:机构信息未能从会议 PDF 纯文本可靠映射
- Xiruo Su:机构信息未能从会议 PDF 纯文本可靠映射
- Woon-Seng Gan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
主动噪声控制在处理移动声源时面临声源波达方向快速变化与固定滤波器切换滞后的矛盾,输入为多通道参考信号,输出为误差点处的反噪声抵消信号。所提预测性定向选择固定滤波器先用短时傅里叶变换将连续多帧幅度与相位谱堆叠为时频张量,再由卷积模块提取空间特征并经门控循环单元建模帧间轨迹演化。网络输出下一帧波达方向类别概率并取最大概率索引,从预训练滤波器库中提前选取对应控制滤波器,实时控制器以采样率执行滤波,协处理器以帧率并行完成预测与预选,从而消除切换延迟。相比仅响应当前帧的方向性选择方法与需要误差反馈收敛的自适应方法,该预测机制将轨迹建模与滤波器选择解耦。在R'1测试集条件下,CRNN在20 dB信噪比时的分类准确率为90.3%,高于10 dB信噪比时的分类准确率87.9%。该结论仅适用于单声源远场水平面移动仿真,未验证多声源、近场与真实硬件延迟。模型约含0.05百万参数,单次推理约需480.08百万乘加操作,适合部署于手机类协处理器。
🔗 开源资源
- 代码相关资源:https://github.com/Wang-Boxiang/PD-SFANC — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
288. 不用音素词典做词对齐:把多语表示和可学习的动态规划拼在一起
标签:#模型融合 #自监督学习 #跨语言 #多语言 #强制对齐
评分:6.9/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#强制对齐 | 主方法:#模型融合
👥 作者与机构
- Roy Weber:机构信息未能从会议 PDF 纯文本可靠映射
- Meidan Zehavi:机构信息未能从会议 PDF 纯文本可靠映射
- Rotem Rousso:机构信息未能从会议 PDF 纯文本可靠映射
- Joseph Keshet:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
词级强制对齐(forced alignment)的输入为语音波形与已知词序列,输出为每个词的结束帧序号,难点在于会话语音边界模糊、跨语言无发音词典与grapheme-to-phoneme(G2P)依赖过重。所提多语言词对齐器Multilingual Word Aligner(MWA)先由无监督切分UnSupSeg与大规模多语言语音模型Massively Multilingual Speech(MMS)分别输出帧级声学跃变线索与词级连接主义时序分类(Connectionist Temporal Classification,CTC)置信,再经对齐编码器融合为统一边界概率,最后由可学习动态规划结合片段特征搜索满足最小词长的最优边界序列。对齐编码器以Conformer为骨干在长时上下文上学习融合两种表征,动态规划解码器以边界似然与词内字符发射和等特征打分并经分阶段微调优化。相比隐马尔可夫混合高斯与纯CTC对齐,该方法免音素词典并显式建模边界前后表征跳变与词内概率质量。在 Buckeye 测试集容差 25 ms 下准确率为 73.2%,高于 Montreal Forced Aligner(MFA)的 69.9% 和 MMS 的 52.7%。结论限于词级结束边界且仅在英语训练,未验证 1100 余种语言的大规模外推与音素级精度。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/MLSpeech/Multilingual-Word-Aligner — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
289. 不改大模型参数,如何让热词只在听到时才生效:AFG-Bias 的检索加门控
英文题目:AFG-Bias: Acoustic-Fusion-Gated Biasing for Plug-and-Play Hotword Customization in LLM-Based ASR
标签:#检索增强 #大语言模型 #语音 #语音识别
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#检索增强
👥 作者与机构
- Long Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Lingchao Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanzhong Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Haojun Fei:机构信息未能从会议 PDF 纯文本可靠映射
- Qing Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向大语言模型自动语音识别(LLM-based ASR)热词定制任务,输入为连续语音与用户提供的领域实体列表,输出为准确转写文本,难点在于罕见实体声学证据弱而提示词注入易引发规模崩溃与上下文幻觉。该方法先由跨模态声学检索(Cross-Modal Acoustic Retrieval, CAR)在适配器共享空间中滑动对齐并筛选前5候选,再由热词增强分支融合候选与声学上下文生成偏置特征,同时由声学门控分支根据解码隐状态查询声学序列估计置信度。与直接把长列表拼入提示词不同,该框架将稀疏词汇偏置加到冻结解码logits上,且只有门控与注意力同时确认才注入,从而在表示层抑制无关干扰。在金融测试集上FireRedASR基座字符错误率(Character Error Rate, CER)从6.04%降至2.96%,热词F1达94.7%;OSUM基座相对下降74.1%至2.83%。在Test-AISHELL-1-NE上FireRedASR的F1从83.3%提升至86.5%,CER基本保持。该结论依赖适配器特征质量与中文短实体场景,在长尾发音变体与跨语言外推上尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
290. 只给一句话守候意图,模型何时该开口、何时该沉默
英文题目:I’ll Keep an Ear Out: Teaching AudioLLMs Proactive Audio Assistance
标签:#SFT #音频大模型 #流式处理 #环境声 #音频事件检测
评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#SFT
👥 作者与机构
- Amit Kumar Singh Yadav:机构信息未能从会议 PDF 纯文本可靠映射
- Ritvik Shrivastava:机构信息未能从会议 PDF 纯文本可靠映射
- Xuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Seungwhan Moon:机构信息未能从会议 PDF 纯文本可靠映射
- Shashank Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Pinar Donmez:机构信息未能从会议 PDF 纯文本可靠映射
- Babak Damavandi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
主动式音频辅助(Proactive Audio Assistance)以单条自然语言守望意图(watch-out intent)与连续音频流为输入,在每个时刻因果决策打断通知或保持沉默,难点在于区分首次出现、持续相关、无关输入与已通知重复。方法为打断与沉默建模(Interrupt and Silent Modeling,ISM):先做反应式监督微调建立声音分类能力,再按已知事件边界构造起始打断、持续相关、无关沉默与去重沉默四态样本,在自回归解码中引入 `` `<interrupt>` `` 与 `` `<silent>` `` 两个特殊词元并以平衡交叉熵联合优化。与固定类别持续告警及纯反应式音频大模型相比,关键差异是将意图与交互历史作为解码条件,使抑制重复成为一等建模目标而非后处理规则。在ESC-50五折主动评测中,PALLM相对反应式微调将打断F1从79.8%提升至99.6%,去重召回从10.1%提升至100.0%。该结论外推受限:在未训练的Epic-Sounds厨房音频上打断F1仅67.5%,无关沉默召回10.1%、持续召回41.2%,且流式验证仅用固定位置拼接样本。训练使用6张NVIDIA H100,流式平均延迟3.5秒。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
291. 时间池化为何能让维度重排网络把通道做宽而不把算力做贵
英文题目:ReDimNet2: Scaling Speaker Verification via Time-Pooled Dimension Reshaping
标签:#CNN #高效推理 #语音 #说话人验证
评分:6.9/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#CNN
👥 作者与机构
- Ivan Yakovlev:机构信息未能从会议 PDF 纯文本可靠映射
- Anton Okhotnikov:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证输入为任意时长语音、输出为内容无关的话语级说话人嵌入以供余弦打分,实际难点是保持全时间分辨率时一维通路计算随通道扩张快速增长,而二维卷积又缺乏直接时序上下文。第一步以二维卷积子块在频率维降采样并同步扩展通道提取频域不变特征,第二步在选定中间阶段用同类步幅卷积对时间维减半以缩短序列并释放算力。第三步将二维特征重整为一维表示并用一维时序上下文子块建模,第四步经最近邻上采样对齐不同分辨率残差并以可学习阶段权重加权聚合后送入注意力统计池化得到嵌入。与全程保持时间分辨率并严格维持体积\(V=C \\cdot F \\cdot T\)恒定的原ReDimNet相比,关键差异是允许时间池化阶段体积减半而不补偿通道,再把节省算力用于通道激进扩展,从而在同等计算预算下提升判别力。与原ReDimNet-B6相比,ReDimNet2-B6在VoxCeleb1-O上等错误率(Equal Error Rate, EER)从0.40%降至0.29%,相对下降约28%,同时计算量从20.27 GMACs降至13.05 GMACs,参数量从15.0M降至12.3M。该结论在VoxCeleb2-dev训练、VoxCeleb1-O/E/H与SITW、VOiCES、VoxCeleb1-B域外集上验证,对强噪声、短截断与多语言的外推尚未充分证明。原文披露最大配置约13 GMACs与12.3M参数,原文未披露推理延迟吞吐实测与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
292. 不用多条件训练做流式鲁棒识别:在线分离前端加干净训练后端的解耦路线
英文题目:Robust Streaming ASR with Decoupled Separation and Recognition
标签:#模型融合 #鲁棒性 #流式处理 #语音识别 #语音分离
评分:6.9/10 | 创新 1.3/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型融合
👥 作者与机构
- Yufeng Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Cheng Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Vahid A. Kalkhorani:机构信息未能从会议 PDF 纯文本可靠映射
- DeLiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式语音识别需在零前视低延迟约束下转写含背景噪声、房间混响与重叠说话人的连续语音,输入为单通道混合波形、输出为实时文本转录,实际难点在于未来帧不可见且干扰类型跨语料多变,主流多条件训练需要大规模带噪数据且损伤干净语音性能。本文构建解耦流水线,先由在线语音分离前端从混合波形恢复目标语音,再送入仅用干净语音训练的流式识别后端直接解码,两分支独立训练、可分别替换、无需联合微调。该方案把去干扰与声学语言建模彻底分开,避免把干扰建模压入识别器。后端在快速构想器骨干中以曼巴状态空间模块替代卷积模块以增强长程建模,前端采用因果时频交叉网络实现零帧前视复谱映射分离,增强波形直接进入后端解码,从而与多条件训练共用识别器建模干扰的机制形成差异并保留即插即用灵活性。在LibriSpeech test-other与Auditec噪声混合的6档信噪比平均上,干净训练的快速曼巴构想器加在线时频交叉网络取得词错率36.1%,优于同等数据量的噪声训练基线36.9%;在CHiME-4单通道真实测试集上为24.56%对26.17%,在LibriCSS utterance级平均上为22.93%对25.88%。结论依赖足够强的前端与单通道utterance级评测,弱前端会失效,尚未验证连续长音频、多通道与极低信噪比稳定性。原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
293. 同一串压缩口语令牌为何能同时做识别与翻译:MTC-AVSR 的压缩与跨语言对齐
标签:#模型压缩 #对比学习 #多语言 #音视频语音识别 #语音翻译
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音识别 | 主方法:#模型压缩
👥 作者与机构
- Lusi A:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Duan:机构信息未能从会议 PDF 纯文本可靠映射
- Jiang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Feilong Bao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理音视频语音识别与语音翻译联合任务,输入为唇动视频加含噪语音,输出为英文转写或西班牙语、法语、意大利语、葡萄牙语译文,难点在于高分辨率视听序列拖慢大语言模型且压缩后跨语言语义易丢失。方法链分三步:多模态压缩先融合视听特征并用查询分配将码率压至每秒3.5词元后送入解码空间,语言适配再以门控交叉注意力将压缩词元重编码到多语言词表空间,最后任务条件解码用提示词前缀切换识别与翻译并联合优化生成与对比目标。与以往仅做单任务压缩或直接微调解码器的做法不同,该工作冻结编码器与大语言模型主体,仅训练适配器、词表与低秩适配器实现单流多任务。论文在LRS3上报告词错率0.74%与最强基线持平,在MuAViC英西、英法、英葡上报告28.1、26.3、21.8的翻译得分。结论仅在英语源、4个欧洲目标语及TED式朗读场景验证,自发对话、远场口音与视频缺失条件尚未验证。原文未披露训练硬件与训练时长,仅报告推理侧显存与计算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
294. 只用卷积和梅尔特征做语音检测:kiloVAD 如何把模型压到 2.1 千参数
英文题目:VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment
标签:#模型量化 #严格因果 #端侧运行 #语音活动检测
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音活动检测 | 主方法:#模型量化
👥 作者与机构
- Stephen Bauer:机构信息未能从会议 PDF 纯文本可靠映射
- Sheila Seidel:机构信息未能从会议 PDF 纯文本可靠映射
- Shanza Iftikhar:机构信息未能从会议 PDF 纯文本可靠映射
- Scott Veidenheimer:机构信息未能从会议 PDF 纯文本可靠映射
- Gorkem Ulkar:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音活动检测(Voice Activity Detection,VAD)需从连续音频逐帧判定有无语音,在常开边缘场景下受内存、功耗与检测延迟约束,且噪声与增益变化带来泛化压力。本文提出kiloVAD,以标准Mel频谱为输入,经按窗归一化后送入卷积骨干做因果帧分类,再经结构化剪枝与量化部署形成完整链路。适配层解耦输入分辨率与内部宽度以支持激进剪枝,全局池化兼容不同上下文长度,剪枝后以自蒸馏恢复精度,量化阶段冻结类原型约束特征角度以抑制低比特误差。与依赖可学习滤波器、循环单元或非因果平滑的紧凑模型不同,该设计只用嵌入工具链原生支持的算子。在AVA-Speech数据集严格因果评测下,2.1 k参数剪枝模型达到0.850曲线下面积(Area Under the Curve,AUC),与MarbleNet持平但延迟低3倍;81.1 k参数完整模型达到0.862 AUC。结论仅适用于短上下文因果帧级检测,尚未验证多语言、重叠语音与真实芯片功耗,原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://huggingface.co/spaces/kiloVAD-demo/ — 暂时无法访问
- 第三方资源:https://github.com/snakers4/silero-vad — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
295. 单数据集高分为何不可信:Spashta Audio-Bench 同时称量印度语言的可懂度与自然度
英文题目:Spashta Audio-Bench: Unified ASR and TTS Evaluation Framework across Indian Languages
标签:#基准测试 #基准设计 #多语言 #语音识别 #文本到语音
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Bikash Dutta:机构信息未能从会议 PDF 纯文本可靠映射
- Siddhant Gahankari:机构信息未能从会议 PDF 纯文本可靠映射
- Abhinav Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Siddarth Modugu:机构信息未能从会议 PDF 纯文本可靠映射
- Shalini Kapoor:机构信息未能从会议 PDF 纯文本可靠映射
- Mayank Vatsa:机构信息未能从会议 PDF 纯文本可靠映射
- Richa Singh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
印度语言语音技术面临印欧与达罗毗荼语系混杂、黏着形态丰富与评测割裂的困境,输入为多域语音或文本,输出为转写文本或合成语音,难点在于跨语言与跨声学条件的泛化无法用单数据集单指标衡量。该工作构建模块化可插拔评测框架,数据层聚合7个公开语料共329802条、644.07小时并统一16 kHz单声道重采样与UTF-8小写去标点归一化,模型层通过标准接口注册任意ASR或TTS公开检查点并执行标准化推理,评分层并行计算词错率(Word Error Rate, WER)与字错率(Character Error Rate, CER)等多指标并驱动可视化榜单。与固定榜单相比,机制差异在于将预处理与推理解耦为可复用基础设施,并引入合成语音再识别退化作为可复现的可懂度代理。在IndicTTS上南方优化的AudioX-S以26.74% WER优于IndicConformer的31.58%,而TTS侧Veena以3.52最优弗雷歇音频距离(Frechet Audio Distance, FAD)却对应53.79%最差再识别WER,证实规模与自然度均不能保证跨语言鲁棒性。该结论限于公开检查点零微调评测,未验证微调后排序与真实人听一致性,也未覆盖对话级长音频。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/huggingface/parler-tts — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
296. 不靠提示文本纠音:用稠密声学对齐守住发音细节
标签:#教育 #正则化 #语音 #语音属性识别
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#正则化
👥 作者与机构
- Haopeng Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Longfei Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Xi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Haitong Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Daisuke Saito:机构信息未能从会议 PDF 纯文本可靠映射
- Nobuaki Minematsu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
误发音检测与诊断(Mispronunciation Detection and Diagnosis,MDD)输入为二语朗读语音,输出为实际发出的音素序列及相对标准音的接受/拒绝判定与错误类型,难点在于瞬时协同发音线索易被全局对齐平滑,且易被语言先验覆盖。本文提出免提示框架 CROTTC-IF,先由一致性正则化最优时间传输分类(Consistency-Regularized Optimal Temporal Transport Classification,CROTTC)声学模型输出逐帧稠密后验以保留细粒度偏差,再由编码器-解码器主干在训练期经误发音教师网络隐式内化标准音与错误模式,推理时仅用声学与轻量语言模型插值解码,不输入标准音文本。另设大语言模型(Large Language Model,LLM)分支定量对比多种标准音提示注入方式,以验证显式先验的危害。在 L2-ARCTIC 测试集上该框架检测 F1 达到 71.77%,在 Iqra’Eval2 阿拉伯语古兰经诵读榜单上 F1 为 71.70% 位列第2。该结论主要适用于朗读式英语与诵读式阿拉伯语,对自发语音与跟读场景的外推尚未验证。原文未披露训练时长与推理延迟成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
297. 自回归模型的熵最小化为何不能只做一半:策略梯度与词元熵的两项补全
英文题目:Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models
标签:#自回归模型 #形式化分析 #测试时自适应 #语音识别
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#测试时自适应
👥 作者与机构
- Wei-Ping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Chee-En Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Guan-Ting Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
测试时自适应(Test-Time Adaptation,TTA)需在无监督条件下对单条语音输入 `q` 即时优化模型,再输出转写序列 `y`,自回归依赖使序列空间组合爆炸而难以直接最小化预测熵。论文先证明词元级熵估计器的无偏性,再对序列级与词元级估计器分别求期望梯度,得到可采样的完整梯度表达式并转化为可优化损失。适配时对每条语音采样 `G` 条候选转写,估计序列或词元熵后用策略梯度项加熵路径梯度项更新层归一化参数,多步迭代后贪婪解码输出最终结果。与仅优化词元熵的教师强制启发式相比,该完整目标同时校正轨迹概率与分布锐度,避免遗漏采样分布随参数的变化。在受损Librispeech十种噪声评测条件下,EM-tok-b的WER为19.15%,低于未适配源模型的WER 22.53%。该结论适用边界受限于情景式单样本适配与Whisper语音识别验证,波束搜索变体为有偏估计且在小域偏移与部分语言上增益有限,跨模型架构与流式部署等外推尚未验证。多采样多步迭代带来明显推理开销,原文在单卡RTX 3090硬件上报告每1秒语音适配需数秒量级延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
298. 不靠准时长也能合成:用可学伸缩让非自回归语音自己改长度
英文题目:Learning to Rescale: On-the-Fly Sequence Length Adaptation in Non-Autoregressive Speech Synthesis
标签:#扩散模型 #多语言 #语音 #文本到语音
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#扩散模型
👥 作者与机构
- Jiawei Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Ren Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyu Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Shun Lei:机构信息未能从会议 PDF 纯文本可靠映射
- Yixuan Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非自回归文本到语音合成需将音素文本与音色提示映射为高分辨率语义Token序列再还原波形,难点在于并行解码缺乏显式对齐且对字符级或全局时长预测高度敏感,时长偏差易导致语速异常与韵律断裂。所提弹性长度扩散语言模型ElasticDLM先以掩码扩散将音素与音色提示展开为初始掩码序列,再由弹性语义扩散语言模型联合预测内容与两种功能Token,最后经声学建模阶段与声码器还原波形。训练侧差异化长度缩放方案以
\[EXPAND\]与
\[DELETE\]分别学习块级插入与删除并按扩散时刻分层调度,推理侧分层置信度引导策略在去噪早期优先执行高置信长度操作并重算长度与掩码。与固定长度掩码生成相比,该方法将长度调整内化为块级合并与插入的可学习操作,并以分层置信度在去噪早期完成结构修正。与MaskGCT在Seed-TTS中文集上的对照显示,本方法自然度主观评分自然度平均意见分达到4.20,优于基线3.84且长度误差更小。在seed-test-zh基准下,Ours-Normal的N-MOS为4.20 ± 0.13,高于MaskGCT-Normal的N-MOS 3.84 ± 0.18。该结论目前仅在中英文朗读与单说话人表情数据上验证,极端韵律与长时篇章外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://thuhcsi.github.io/ElasticDLM/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
299. 冻住已发货检测器再长出新词分支:参数封顶的模块化关键词扩展
英文题目:Scalable Keyword Spotting via Modular Network Expansion
标签:#持续学习 #高效推理 #端侧运行 #语音 #关键词检测
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#持续学习
👥 作者与机构
- Viktor Khaymonenko:机构信息未能从会议 PDF 纯文本可靠映射
- Dzmitry Saladukha:机构信息未能从会议 PDF 纯文本可靠映射
- Aliaksei Rak:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Rostov:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为16 kHz单声道1秒级语音,输出为核心词表与新增词表各自加背景类的类别,难点是扩展时原始训练音频不可用且已部署触发器的阈值行为不允许任何回归。方法链分三步:先在核心词表上训练约150k参数的小型流式基座并冻结全部权重与批归一化仿射参数和运行统计,再从冻结编码器多层抽取激活送入轻量扩展分支经时序卷积残差变换与时序池化送入独立新词头产生新词表对数几率,最后采用核心优先决策规则保证已发布阈值行为逐输入不变。与持续学习软约束和参数高效微调改动共享通路不同,该设计通过物理隔离计算路径实现构造性无回归。在Google Speech Commands测试集评测条件下,完全微调的错误率为69.08%,高于基座模型的错误率2.71%。该结论仅在Google Speech Commands v2单轮双词扩展与1%错误接受率标定下成立,多轮扩展、跨语言与强噪声外推尚未验证。扩展分支与新词头新增参数控制在10k预算内,最终模型约160k参数,最坏推理开销的计算量为16.34M乘加操作。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
300. 不只判断每帧真假:用相邻帧的方向变化定位部分伪造音频边界
英文题目:Temporal Transition-Aware Multi-Head Modeling for Partially Spoofed Audio Detection and Localization
标签:#多任务学习 #RNN #语音 #语音伪造检测
评分:6.8/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#多任务学习
👥 作者与机构
- Yunsu Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Juyeob Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Eunil Park:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
部分伪造音频定位(Partially Spoofed Audio Localization,PSAL)输入为整句含短篡改段的语音,输出为逐帧真伪标签以定位篡改区间,难点是拼接边界平滑且音素韵律变异会淹没帧级不一致。该方法用预训练自监督学习(Self-Supervised Learning,SSL)模型 XLS-R 将 16 kHz 波形转为 20 ms帧嵌入并经线性层由1024维投影至256维,再经堆叠2层的三路多尺度门控循环单元(Multi-Scale Gated Recurrent Unit,MS-GRU)融合不同膨胀率局部卷积与双向长时上下文,随后帧真实性头、相邻帧三向过渡头并行输出,最后由精炼头融合帧概率与方向性边界概率重估每帧标签。与仅做帧二分类或无向边界检测相比,三向过渡显式区分进入与离开篡改的不同演化模式,使精炼更具时间一致性。在 PartialSpoof 评测集上帧级等错误率(Equal Error Rate,EER)为 6.45%,较最强基线 CFPRF 的 7.41% 降低 0.96 个百分点,在 PartialEdit-E1/E2 上分别为 4.50% 和 3.85%。结论限于英语朗读式篡改语料与 20 ms 评测,多篡改段尾边界与跨语言泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
301. 用紧码本挤掉音色、再把归一化基频塞回去:SDP-Codec 的低码率与零样本变声
标签:#向量量化 #零样本 #语音编码 #语音转换
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Hounsu Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Juhan Nam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低比特率语音编码需在极低码率下保留内容与韵律并剥离全局音色,难点在于局部token易残留说话人信息,而显式解耦常需多阶段训练或扰动。本文提出说话人解耦(speaker decoupling)的单码本编解码器SDP-Codec,局部支路复用冻结vq-wav2vec的连续预量化特征(pre-quantization features)保留细粒度内容,经内容编码器下采样至50 Hz;帧级对数基频(log-F0)经每段均值方差归一化去除音高范围后由音高编码器(pitch encoder)压缩,与内容特征拼接后经单次联合向量量化(vector quantization)成紧凑token,再分别映射至波形解码器(waveform decoder)与音高解码器(pitch decoder)以重建波形与原始音高范围。全局支路以冻结WavLM特征经感知重采样器(perceiver resampler)提取时不变说话人嵌入,经位置无关交叉注意力(cross attention)与自适应蛇形激活(adaptive snake)恢复音色与音高均值方差。在LibriTTS测试集24 kHz重建中SDP-Codec-24-S以0.45 kbps取得STOI 0.8798,显著高于同码率LSCodec的0.7511,零样本语音转换(zero-shot voice conversion)自然度主观评分达3.89分。作者承认内容保真仍是主要瓶颈,大规模16 kHz变体在词错率上仍落后于BiCodec与MSRCodec,结论外推至噪声、多语及下游语音语言模型仍未经验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
302. 任务越开放越专,越受限越通用:语音特征在认知评分层级上的分化
英文题目:Beyond Binary: Speech Representations Across the Cognitive Score Hierarchy
标签:#语音生物标志物 #自监督学习 #语音 #病理语音评估
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#自监督学习
👥 作者与机构
- Serli Kopar:机构信息未能从会议 PDF 纯文本可靠映射
- Roshan P. Rane:机构信息未能从会议 PDF 纯文本可靠映射
- Christian Mychajliw:机构信息未能从会议 PDF 纯文本可靠映射
- Lydia Federmann:机构信息未能从会议 PDF 纯文本可靠映射
- Gerhard Eschweiler:机构信息未能从会议 PDF 纯文本可靠映射
- Daniela Berg:机构信息未能从会议 PDF 纯文本可靠映射
- Sam Gijsen:机构信息未能从会议 PDF 纯文本可靠映射
- Paula Andrea Pérez-Toro:机构信息未能从会议 PDF 纯文本可靠映射
- Kerstin Ritter:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为德国TREND老年队列神经心理测查中的6种任务录音,包含5个CERAD+诊断任务与1个简易精神状态检查(Mini-Mental State Examination,MMSE)筛查任务,输出为任务级、认知域级和全局级的连续分数与二分类状态,难点在于MCI语音变化细微且标准评分呈任务域全局三层聚合结构。方法链分4步:先剔除非母语者、不完整档案与MCI向健康对照逆转者并施加时长、能量、削波与信噪比门限,再经说话人分离标注提纯被试语音并生成韵律保留流与拼接流,随后并行提取扩展日内瓦极简声学参数集手工特征与冻结自监督表示,最后对每个输入任务与每个层次目标独立训练Ridge回归与支持向量机等模型。与扁平二分类范式不同,该机制把任务开放度与评分聚合显式关联,揭示开放任务稀释与约束任务增益的相反趋势。在TREND语料任务级分数预测评测设置下,以PF任务输入预测PF分数时HuBERT特征的Pearson相关系数在开发集为0.85 ± 0.02,高于保留集的Pearson相关系数0.80。该结论适用边界受限于德语单中心队列,尚未验证跨语言与人口学协变量下的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/neselidondurma/beyond-binary-mci — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/csteinmetz1/pyloudnorm — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
303. 面试守门不靠干净录音:SEAM 用防捷径设计做实时朗读检测
英文题目:SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails
标签:#数据增强 #鲁棒性 #实时处理 #语音 #音频分类
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#数据增强
👥 作者与机构
- Vsevolod Kovalev:机构信息未能从会议 PDF 纯文本可靠映射
- Pranay Manocha:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理英语面试音频中朗读式scripted与自发式spontaneous的二分类,输入为8 s语音窗,输出为脚本化概率,部署时对文件内多窗logits取中值再经Sigmoid得到供人工复核的guardrail信号。其实际难点是标签与语料身份、通道和录制条件深度纠缠,干净棚录易被误作朗读线索。方法链为统一波形预处理消除增益与低频差异,再用来源感知的seam-aware采样保证窗口不跨录音拼接并以非语音填充缺口。训练窗内随机混合非语音噪声库以打破干净即朗读启发式,最后将DistilHuBERT编码均值池化送入轻量MLP并只微调顶层Transformer,相比仅更换骨干的已有方法关键在以采样与增强主动抑制捷径。在私有面试外测集上完整系统3 seeds均值达到外部ROC-AUC 0.9713和外部准确率0.9517,而固定预算下同时关闭噪声库与seam采样后外部AUC从0.8991跌至0.7324,内部测试AUC反而从0.9287升至0.9557,证明内部高分主要来自捷径。结论仅适用于英语朗读对自发的粗粒度风格区分,五种非英语零样本仅部分迁移,重度混响、强口音与并发部署等条件尚未验证。最终模型在NVIDIA A100 80GB上训练3个epoch,L4上INT4量化后显存为41.8 MB且单窗全链路约7.25 ms,原文未披露完整训练时长与功耗。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
304. 长音频问答为何答对内容却对不准时间:用周期时间锚点把时间写进 token 流
标签:#数据集 #多模态学习 #音频大模型 #长音频处理 #音频问答
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#音频问答 | 主方法:#多模态学习
👥 作者与机构
- Aleksandr Kutsakov:机构信息未能从会议 PDF 纯文本可靠映射
- Mariia Sadovina:机构信息未能从会议 PDF 纯文本可靠映射
- Georgii Gospodinov:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandr Maximenko:机构信息未能从会议 PDF 纯文本可靠映射
- Oleg Kutuzov:机构信息未能从会议 PDF 纯文本可靠映射
- Pavel Bogomolov:机构信息未能从会议 PDF 纯文本可靠映射
- Fyodor Minkin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理最长 120 分钟会议、播客、讲座类录音的时间感知理解,输入为长音频加自然语言问题,输出为带显式时间区间的回答、给定区间的片段描述(fragment description)与自主切分的时间锚定摘要,难点是标准音频 token 流无时间坐标,长上下文易输出不可解析或无支撑的时间声明。方法链为:先用 VoxLingua107 语言识别过滤英文并用 WhisperX 获得词级时间戳转录,按静音比过滤并按时长分桶平衡,再用文本大模型 GPT-OSS-120B 在约 10 分钟转录切片上生成问答并用全局验证器在全转录上过滤不一致样本,最后在 10B-A1.8B 混合专家文本基座外挂音频编码器并在音频 token 流中每 60 秒周期性插入时间标记后做音频监督微调。相对短音频定位与转录中心系统的差异在于把时间显式交错进输入输出接口,使模型可在稀疏锚点间插值出秒级精度。主证据是在 20 分钟至 40 分钟时间定位(temporal grounding,TGr)上本模型达到 53.8 mIoU,而 Qwen3-Omni-30B-A3B 同设置仅为 3.6;在 AMI 会议 15 分钟至 50 分钟短语定位上本模型中点 MAE 为 3.5 秒,Qwen 为 290.5 秒。结论边界是长短时长混合训练与锚点缺一不可,单时长训练呈现非对称泛化失效,纯秒制编码与过稀疏锚点显著退化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
305. 8 倍降采样下掩码与感受野如何对齐:ViP-VL 的越南语预训练路线
英文题目:ViP-VL: Vietnamese Self-supervised Speech Pretraining Model with Vector-Quantization Learning
标签:#自监督学习 #向量量化 #预训练 #语音 #语音识别
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Khanh Le:机构信息未能从会议 PDF 纯文本可靠映射
- Kiet Anh Hoang:机构信息未能从会议 PDF 纯文本可靠映射
- Bao Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Duy Vo:机构信息未能从会议 PDF 纯文本可靠映射
- Dung Vo:机构信息未能从会议 PDF 纯文本可靠映射
- Thai Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Linh Pham:机构信息未能从会议 PDF 纯文本可靠映射
- Khoa D Doan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
越南语语音识别输入为连续语音声学特征,输出为词序列,附加任务还需输出情感、方言与说话人属性,难点在于标注稀缺、方言变异大且高压缩编码易丢失短时音素线索。本文方法链为:对数梅尔滤波器组先做声学堆叠以匹配编码器感受野,再在10毫秒原始帧上做跨度掩码并按覆盖比例映射为子采样帧标签,最后用冻结随机投影向量量化器产生离散目标并以ChunkFormer编码器做掩码预测训练。与采样后掩码或简单拼接帧的已有做法相比,差异在于强制掩码流形与下采样流形在时间上同步,从而避免局部声学泄漏并保持码本多样性。在ViSEC情感识别任务评测下,ViP-VL的非加权准确率为74.45,高于Wav2vec2-Large-Vi的非加权准确率73.00。同一17000小时预训练模型在越南语识别基准上平均词错率为13.76%,在方言区域与省级任务上F1分别为93.24%和57.17%,在说话人验证任务上等错率为3.639%。结论适用于朗读与对话类越南语语料,对极低资源方言、强噪声远场与跨语言泛化的外推尚未验证,推理时延与完整算力开销亦未实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
306. 先压掉口音再还原音色:稀疏分词如何让流式口音转换跑起来
英文题目:AccentDrift: Real-time Streaming Accent Conversion via Sparse Speech Tokenization
标签:#向量量化 #实时处理 #流式处理 #语音 #语音转换
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音转换 | 主方法:#向量量化
👥 作者与机构
- Sang-Hoon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Heejin Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Joun Yeop Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Sangjun Park:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口音转换(Accent Conversion,AC)要求保留语言内容与说话人音色,同时将第二语言者语音转换为目标口音,难点在于流式低延迟下实现属性解耦与自然重建。本文提出AccentDrift,先由缓存感知的流式编码器与改进有限标量量化提取稀疏语义token,再经口音适配器注入目标口音嵌入以预测稠密语义token,随后由音色适配器经因果扩散变换器生成梅尔谱并经因果声码器合成波形。该链条以窄信息瓶颈加音素级联接时序分类监督强制剥离韵律与口音信息,与保留韵律的稠密语义方案形成对照。口音适配器前以停止梯度阻断稠密语义预测回传并辅以小尺度梯度反转抑制口音泄漏,使稀疏token仅保留内容后再条件化生成目标口音。在VCTK印度口音376条样本上,以美式口音嵌入与源说话人音色嵌入评测,词错率从并行基线Vevo-Style的13.8降至6.27,说话人相似度从0.57升至0.72,目标口音准确率为60.1,略低于Vevo-Style的65.9;在L2-ARCTIC的20人众包5分制评测中自然度3.97与口音相似度3.96,与基线基本相当。该结论目前仅在英语非母语转美式口音与短句范围内得到验证,跨语言与强口音泛化尚未证明。其适用边界受限于上述英语短句场景尚未验证跨语言外推,流式部署延迟为0.5s。
🔗 开源资源
- 演示资源:https://accentdrift.github.io/demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
307. 麦克风不够时,能否用生成的虚拟通道补回空间信息
英文题目:Spatial-Magnifier: Spatial upsampling for multichannel speech enhancement
标签:#波束成形 #麦克风阵列 #空间音频信号 #语音增强
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#波束成形
👥 作者与机构
- Dongheon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Ashutosh Pandey:机构信息未能从会议 PDF 纯文本可靠映射
- Sanjeel Parekh:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Wong:机构信息未能从会议 PDF 纯文本可靠映射
- Jacob Donley:机构信息未能从会议 PDF 纯文本可靠映射
- Buye Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Azcarreta:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多通道语音增强需以有限真实麦克风观测恢复参考通道目标直达声,边缘设备受物理约束难以布置大孔径阵列导致空间自由度不足。空间放大器先以生成对抗网络从真实麦克风复频谱估计缺失虚拟麦克风波形,输出虚拟波形估计进入下一步增广。空间音频表示学习再将虚拟信息以信号级拼接或特征级隐表示注入下游增强模型,增广信号进入掩蔽估计与波束成形。下游经掩蔽估计结合多通道维纳滤波或最小方差无失真响应波束成形输出目标语音,且虚拟估计与波束成形联合优化以提升空间协方差矩阵秩。与直接用高性能增强模型做虚拟波束成形不同,该链路解耦空间表示学习与频谱增强,强调跨通道建模迫使系统学习可迁移空间先验。在2ch真实加4ch虚拟的FoV-SE评测任务下,Spatial-Magnifier SARL-S的SI-SDR为7.10,高于SpatialNet+MCWF 2ch的SI-SDR 2.19。其结论适用边界受限于训练阵列几何,在任意位置生成虚拟信号仍困难且复杂上采样下仍落后物理多通道阵列,属尚未验证的外推范围。训练成本为32张H100上100轮训练,虚拟模块增量引入额外参数与计算量,推理开销维持与原多通道增强模型相同的计算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
308. 静音肌电缺语义:用识别文本在推理时纠偏扩散合成
英文题目:GETS: Guiding EMG-to-Speech Synthesis via Silent Speech Recognition
标签:#扩散模型 #生理信号 #语音 #静默语音接口
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#静默语音接口 | 主方法:#扩散模型
👥 作者与机构
- Jiwon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jaejun Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Kyogu Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
肌电到语音合成 Electromyography-to-Speech (ETS) 需从无声发音肌电直接生成可懂语音,难点是静默肌电欠定且无配对音频监督,单纯最小化声学重建误差不能保证语义一致。GETS 用共享肌电编码器提取静默特征与发音特征并在特征空间以动态时间规整 Dynamic Time Warping (DTW) 对齐,以对齐后特征条件训练去噪扩散概率模型 Denoising Diffusion Probabilistic Model (DDPM) 生成梅尔谱 Mel-spectrogram,推理期再用预训练静默语音识别 Silent Speech Recognition (SSR) 文本经由冻结自动语音识别 Automatic Speech Recognition (ASR) 模型的条件对数似然梯度做分类器引导修正语义。该设计把韵律交由肌电条件承担、把语义交由识别文本约束,训练无需语言标签,推理才引入文本约束。在 Gaddy and Klein 单人静默测试集上以 Whisper-medium 评估取得 11.89% 词错率 Word Error Rate (WER),相对 25.74% 的 Gaddy and Klein 基线绝对降低 13.85 个百分点;以 DeepSpeech 评估取得 21.32%,同样领先同口径基线 10 个百分点以上。在静默测试集消融任务下,完整引导配置的WER为11.89%,低于无语义引导配置的WER 32.78%。能量打乱分析显示肌电打乱比文本打乱更严重破坏能量轮廓,证明韵律主要来自肌电而非纯文本映射。该结论适用边界受限于单说话人英语朗读语料,多说话人、电极偏移与噪声佩戴场景尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
309. 从固定电话噪声到可学难例:DAR-Boost 把增强参数也交给梯度
英文题目:DAR-Boost: A Differentiable and Adaptive Raw Data Augmentation Framework for Robust Anti-Spoofing
标签:#对抗训练 #数据增强 #鲁棒性 #环境声 #音频深度伪造检测
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#数据增强
👥 作者与机构
- Yingdong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Chengxin Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Nanli Zeng:机构信息未能从会议 PDF 纯文本可靠映射
- Jianguo Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Kun Zeng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频深度伪造检测需从原始波形判别真伪,难点在于未见攻击与声学域偏移导致的泛化失效。静态原始波形增强RawBoost依赖面向电话语音的固定陷波滤波器与开环随机采样,在宽带环境声上会破坏高频纹理,且采样独立于检测器决策边界,浪费训练在过易或非物理样本上。所提可微自适应原始增强框架DAR-Boost(Differentiable Adaptive Raw Boost)将线性与非线性失真(Linear/Non-linear,LnL)、脉冲信号相关噪声(Impulsive Signal-Dependent,ISD)与平稳信号独立噪声(Stationary Signal-Independent,SSI)重写为可微层,由参数生成器(Parameter Generator)预测频点形状参数并经梯度反转层(Gradient Reversal Layer,GRL)最大化任务损失以挖掘边界难例,再由自适应路由器(Adaptive Router)按实例加权融合三路视图与原始波形后送入检测器联合优化。与静态随机采样相比,关键差异在于将离散启发式变为端到端可微的对抗闭环。在环境声基准EnvSDD上,音频到音频(Audio-to-Audio,ATA)等错误率(Equal Error Rate,EER)降至0.90%,优于无增强基线1.42%与静态增强1.53%;文本到音频(Text-to-Audio,TTA)降至4.82%,优于无增强7.19%与静态9.49%。在语音域ASVspoof 2021 LA上为0.88%,与最强静态基线0.89%相当。模块仅含26.27K参数,滤波器数量Nband为5、长度L为101,在NVIDIA RTX 5090上训练,代码已开源。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
310. 类别有增有减时,原型分类器如何不忘旧类又认出新类
标签:#注意力机制 #持续学习 #少样本 #音频分类
评分:6.8/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#持续学习
👥 作者与机构
- Yanxiong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Guoqing Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Qianqian Li:机构信息未能从会议 PDF 纯文本可靠映射
- Sen Huang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该文研究少样本类可变增量音频分类,输入为基类大量音频与增量阶段每类仅5个样本的对数梅尔谱,输出为覆盖全部现存类的标签,且类集合在每轮可能增加或减少,难点在于无旧类样本时既要记住旧类又要快速接纳新类并处理类删除。方法链分为四步:残差网络ResNet-18编码器先在基类预训练并提取512维嵌入,随后类可变原型自适应网络对新旧原型与查询嵌入做注意力校准,伪类可变训练策略在基类上用混合伪类模拟增加与删除交替训练以提升适应性,增量阶段冻结编码器并用高斯均值与协方差重构旧类嵌入或直接丢弃已删类原型。与仅支持类增加的原型分类器和随机分类器相比,该设计显式支持原型删除与动态结构调整,更贴合关键词增删并存的部署场景。在LS-100上全部类平均准确率达到92.62%,高于原型自适应网络(Prototype Adaptation Network,PAN)的91.43%与自适应缓解遗忘过拟合方法(Adaptive Mitigation of Forgetting and Overfitting,AMFO)的91.53%。该结论的适用边界受限于4轮增量、每轮增加5类删除2类及两种不规则变体的验证范围,尚未验证大规模删除、重复增删同一类或长序列漂移下的失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/cgq2971-afk/FCIAC — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
311. 把线性预测变成可微优化:用平滑对数面积比跟踪共振峰
英文题目:Smooth Formant Tracking with Differentiable Linear Prediction
标签:#信号处理 #可解释性 #语音 #语音属性识别
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#信号处理
👥 作者与机构
- Bryn Luisi:机构信息未能从会议 PDF 纯文本可靠映射
- Lauri Juvela:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
共振峰跟踪输入为语音波形,输出为4条随时间变化的共振频率轨迹,难点在于浊音谐波偏置、帧独立假设与高斯残差假设导致轨迹抖动且跨帧不连续。本文先将对数面积比(Log-Area Ratio,LAR)经双曲正切映射为反射系数(Reflection Coefficient,RC)并经前向Levinson递推得到全极点系数,再用逆滤波求时域残差并以L2加L1加帧间平滑项联合优化,最后经伴随矩阵求特征值与带宽筛选得到共振峰,神经版本则由卷积网络预测LAR并由长短期记忆网络(Long Short-Term Memory,LSTM)解码共振峰。与自相关法由Yule-Walker方程耦合求解反射系数不同,该方法把LAR当作自由变量直接做梯度优化,因而可容忍非高斯拉普拉斯激励并强制平滑。在VTR Formants Database测试集下,SMELP的均方根误差指标为166 ± 5 Hz,低于KARMA的均方根误差指标254 ± 14 Hz。训练集消融表明同时使用L1、L2与帧间正则的损失误差最低,证实拉普拉斯假设与平滑约束共同改善轨迹连续性。结论限于16 kHz英文朗读语音的有共振峰音段,未验证噪声、儿童语音或跨语种外推,原文未报告延迟吞吐与部署成本。该结论的适用边界受限于英文朗读语料条件,噪声与跨语种外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/brynluisi/allpole-formants.git → https://github.com/brynluisi/allpole-formants — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
312. 多人同时说话时,谁说了哪句话:覆盖 22 种印度语言的联合评测
英文题目:Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages
标签:#数据集 #基准设计 #多语言 #语音识别 #说话人分离标注
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#说话人分离标注 | 主方法:#基准设计
👥 作者与机构
- Deovrat Mehendale:机构信息未能从会议 PDF 纯文本可靠映射
- Aditya Mehndiratta:机构信息未能从会议 PDF 纯文本可靠映射
- Dhruv Subhash Rathi:机构信息未能从会议 PDF 纯文本可靠映射
- Kaushal Bhogale:机构信息未能从会议 PDF 纯文本可靠映射
- Mitesh M Khapra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理多说话人印度会话的说话人分离标注与语音识别联合评测,输入为单通道混合会议与野外音频,输出为带说话人归属的时间戳转写,难点在于英语混码、方言变体、高重叠与远场混响下的短碎片段转写退化。构建链条分为四环:先按近场多麦约53小时、远场单麦约27小时与YouTube野外约28小时三类条件采集自然辩论式会话并做质量筛选,再以多系统假设为可编辑草稿启动人工转写与说话人归属,随后执行双制式混码规范与重叠段多轮质检,最后统一为RTTM加逐词转写的可复用评测包。与已有评测相比,该工作把分离标注与转写耦合为cpWER与WDER联合考核,而非各自独立打分,因而能暴露切分错误向识别的传导失效。在全量持续时间加权评测中印度专用管线Sarvam以16.0%的DER与38.8%的cpWER领先次优商业API约7.5个百分点与4.9个百分点,证明了本地化建模的实际收益。结论仅适用于印度多语言会话场景,野外子集仅覆盖10种常用语言且未提供说话人标识,数据集定位为评测而非训练用途。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
313. 多人对话谁该开口:用显式角色约束语音智能体的抢话决策
英文题目:Adaptive Turn-Taking for Real-time Multi-Party Voice Agents
标签:#数据集 #LoRA #流式处理 #轮次切换
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#轮次切换 | 主方法:#LoRA
👥 作者与机构
- Soumyajit Mitra:机构信息未能从会议 PDF 纯文本可靠映射
- Prabhat Pandey:机构信息未能从会议 PDF 纯文本可靠映射
- Abhinav Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Shanmukha Sahith:机构信息未能从会议 PDF 纯文本可靠映射
- K V Vijay Girish:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多方语音对话要求智能体在重叠发言与地板竞争(floor competition)下同时判断是否介入与何时介入,而不同角色对主动程度的期望差异使固定阈值策略难以适用。本文输入为连续多说话人音频流与对应转写,输出为逐块是否接管话轮及接管时的文本回应。为此作者先将语音编码器输出经投影拼入大语言模型(large language model,LLM)上下文实现块级流式建模,再由LLM逐块输出接管控制符加回应或空序列表示沉默,最后在推理增强变体中于决策前插入角色相关的思维链(chain-of-thought)。相比仅依赖停顿与句完整性的双人打断模型与无角色多方基线,该机制把社会角色从风格装饰变为门控发言时机的条件变量。在RolePlayConv评测集上思维链变体相对无角色基线将轮次切换F1-score从0.42提升至0.79,同时误触发率从0.14降至0.03。该结论依赖合成话轮边界与教师强制(teacher-forcing)历史,在强重叠与无转写条件下的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/Zyphra/Zonos — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
314. 先拟合分布再修波形:DTT-BSR+ 把音乐修复拆成两步走
英文题目:DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration
标签:#生成对抗网络 #音乐 #音频修复 #音乐源分离
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频修复 | 主方法:#生成对抗网络
👥 作者与机构
- Youran Ni:机构信息未能从会议 PDF 纯文本可靠映射
- Shihong Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Yuzhu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音乐源恢复(Music Source Restoration,MSR)需从成品混音中同时解开声源混合与压缩、混响、编解码等不可逆制作效应,输入为立体声混音而输出为8类干净无处理分轨,难点在于效应函数多对一导致的病态逆问题。本文提出两级级联DTT-BSR+:先用生成式分离器将混合映射为符合干净先验的中间分轨,再用回归网络以该中间结果为唯一输入直接重建目标波形,前者负责语义分布对齐而后者负责局部时域与多分辨率频谱精度。与按物理效应拆分为分离、去混响、去噪三阶段的已有优胜系统相比,该分工把分布拟合与信号重建解耦到不同目标与网络归纳偏置之中。在MSRBench测试集325个片段上新系统平均多分辨率梅尔信噪比达到4.35 dB,显著高于单级母体DTT-BSR的1.38 dB和最强对照X-LANCE-MSR的2.28 dB,并在5类分轨上超越最强对照。该结论不适用于首级已严重失真的打击类细碎声部,且语义一致性指标在部分分轨上随重建精度提升反而恶化。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
315. 不共享录音也能拼出多类群分类器:生态约束下的任务向量算术
英文题目:Ecologically-Constrained Task Arithmetic for Multi-Taxa Bioacoustic Classifiers Without Shared Data
标签:#生物声学监测 #模型融合 #隐私保护 #音频分类
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#模型融合
👥 作者与机构
- Ragib Amin Nihal:机构信息未能从会议 PDF 纯文本可靠映射
- Benjamin Yen:机构信息未能从会议 PDF 纯文本可靠映射
- Runwu Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Takeshi Ashizawa:机构信息未能从会议 PDF 纯文本可靠映射
- Kazuhiro Nakadai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
生物声学监测需在数据无法集中条件下把分散于类群和区域的独立分类器拼成统一多物种系统,输入为异构录音而输出为跨类群物种标签,难点在于无共享数据时避免灾难性遗忘与任务干扰。本文先让各机构从同一BEATs编码器出发独立微调得到各物种组专家模型,其输出的专用编码器权重进入下一步差分。接着在编码器权重上减去预训练权重抽取任务向量,经简单平均合并后加回预训练权重得到统一编码器,该合并编码器直接决定最终特征空间。最后冻结该合并编码器并在其输出特征上训练线性探测层,统一探针输出661类分类结果而分组探针报告组内性能。相对依赖符号冲突裁决的合并方法,该工作利用近正交几何直接平均从而保留全部参数方向,避免了随机多数投票的信息丢弃。在四区域合并评测任务下,均匀合并编码器的准确率为60.8%,低于联合训练基线的准确率67.2%。该结论不适用于焦型到声景的域减法,单调退化表明域风格与物种身份在权重中纠缠。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
316. 不确定性找出发音难点,再让微调多练难点:非典型语音的省数据个性化
标签:#课程学习 #LoRA #低资源 #语音识别
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#课程学习
👥 作者与机构
- Niclas Pokel:机构信息未能从会议 PDF 纯文本可靠映射
- Pehuén Moure:机构信息未能从会议 PDF 纯文本可靠映射
- Roman Böehringer:机构信息未能从会议 PDF 纯文本可靠映射
- Yingqiang Gao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非规范语音个性化要在极少标注语音下提升转写,输入为目标说话人少量语音与文本,输出为转写文本,难点是声学变异大、数据稀缺且易过拟合。方法分三步:先用20次随机前向估计零样本模型的预测不确定性,再把多数投票音素错误率、平均预测熵与真值一致性合成为音素难度分 Phoneme Difficulty Score / PhDScore以区分可学构音困难与不可学噪声,最后按话语级平均分经最小最大归一化映射到1.0至5.0做加权过采样微调。与纯熵加权或微调后不确定性重加权不同,该复合分强调离散错误与稳定性并坚持使用预训练信号。在UA-Speech极低可懂度组变分低秩适配 Variational Low-Rank Adaptation / VI LoRA过采样带来词错率下降13.22个百分点、字符错率下降14.97个百分点,在德语BF-Sprache儿童集上全量微调加预训练PhDScore带来字符错率下降1.61个百分点、词错率下降2.57个百分点。预训练VI LoRA的PhDScore与第二次治疗评估平均精度达0.82,纯熵仅0.54,微调后跌至约0.35。结论受限于单例纵向验证、孤立词经语义重链拼接的语料,以及深度个性化伴随的规范语音遗忘。原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
317. 重建声音还是重建可懂度:双任务加双参照如何评判语音重建
英文题目:An Evaluation Framework for Text-to-Speech Voice Reconstruction
标签:#评测协议 #言语障碍 #零样本 #语音可懂度评估 #语音克隆
评分:6.8/10 | 创新 1.6/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音克隆 | 主方法:#评测协议
👥 作者与机构
- Ariadna Sanchez:机构信息未能从会议 PDF 纯文本可靠映射
- Christoph Minixhofer:机构信息未能从会议 PDF 纯文本可靠映射
- Korin Richmond:机构信息未能从会议 PDF 纯文本可靠映射
- Ondřej Klejch:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Bell:机构信息未能从会议 PDF 纯文本可靠映射
- Simon King:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音重建需以紊乱语音为提示合成高可懂度且保留说话人特质的语音,难点在于身份与病理构音纠缠且缺乏病前参照真值。为此框架先以情景引导区分可懂度与整体重建两种听测任务,再用最优劣标度收集系统偏好排序并以Plackett-Luce模型估计排名。排序输出进入客观对照环节,并行计算转录错误率与说话人余弦相似度等单点指标,再计算双参照分布度量TTSDS Mean以同时逼近通用高可懂度分布与原始紊乱分布。相对已有MOS自然度与相似度评测,该机制差异在于以任务化 framing解耦可懂度与身份判断,并以双参照分布权衡替代单点相似度,具有更贴合重建折衷的实际意义。在17个零样本系统重建主观评测任务下,IndexTTS2的BWS得分为0.963,高于Qwen3-TTS的BWS得分0.791。该结论仅适用于英语病理语音的零样本克隆设定,未验证微调式重建与真实用户长期使用效果。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://minixc.github.io/sap/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/RVC-Boss/GPT-SoVITS — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/metavoiceio/metavoice-src — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/sarulab-speech/UTMOS22 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
318. 越用越分化:用反复自我克隆放大零样本语音合成的鲁棒性差距
英文题目:Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation
标签:#评测协议 #模型评估 #零样本 #文本到语音
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#评测协议
👥 作者与机构
- Shengfan Shen:机构信息未能从会议 PDF 纯文本可靠映射
- Di Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Xingchen Song:机构信息未能从会议 PDF 纯文本可靠映射
- Dinghao Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Liumeng Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Meng Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Luan:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成评测输入为参考音频加参考文本加目标文本,输出为系统质量排序,难点是顶尖系统首轮词错率(Word Error Rate,WER)、说话人相似度(Speaker Similarity,SIM)与预测型平均意见分(Mean Opinion Score,MOS)高度饱和且与人评错位。本文提出迭代区分框架(Iterate to Differentiate,I2D),将模型本轮合成语音作为下一轮参考音频、目标文本作为下一轮参考文本固定目标文本重合成至10轮,再逐轮计算WER/字错率(Character Error Rate,CER)、SIM、DNSMOS、UTMOSv2与情感F1(Emotion F1),最后经均值聚合形成轨迹分数。人评在首轮与末轮语音上按内容准确性、说话人一致性与整体自然度打分,为轨迹聚合提供对齐目标。与单轮直接打分不同,该框架将失配累积转化为鲁棒性探针,使隐性稳定性差异显性化并提升人评相关性。均值、线性加权、指数加权与曲线下面积共同刻画退化轨迹,兼顾早期保真与后期分化趋势。I2D利用弱模型在文本音频失配下更快崩溃的差异化退化恢复区分度,在中文Seed-TTS-Eval人评子集100句上UTMOSv2系统级Spearman秩相关系数(Spearman Rank Correlation Coefficient,SRCC)从0.1182提升至0.4636。该结论限于11个开源模型与Seed-TTS-Eval中文、LibriTTS英文及CV3-Eval情感克隆场景,未验证商用闭源系统与长文本外推,原文未披露训练与推理算力成本。
🔗 开源资源
- 演示资源:https://ssf-1103.github.io/I2D-Bench/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
319. 成人与儿童一起识别:用分类器路由和熵感知混合专家分开处理不同口音与年龄
标签:#混合专家模型 #音频大模型 #语音 #语音识别
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#混合专家模型
👥 作者与机构
- Mohan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Kaiyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zilai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Natarajan Balaji Shankar:机构信息未能从会议 PDF 纯文本可靠映射
- Eray Eren:机构信息未能从会议 PDF 纯文本可靠映射
- Abeer Alwan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向成人与儿童混合的自动语音识别需要将声学波形映射为文字转写,难点在于儿童与成人发音差异大、儿童各年龄段差异细微且数据稀缺,单一模型易顾此失彼。本文以语音大语言模型Speech-LLM为底座,先由基于分类器的域路由C-DR根据编码器表征输出域概率,再按该概率对混合投影器MoP与混合低秩适配器MoL的域专用专家做硬或软选择,最后由熵感知路由EAR按归一化熵在路由结果与共享专家之间插值以缓解边界不确定。与无显式监督的可学习门控混合专家相比,该设计把层次化域结构与不确定性处理显式引入路由过程,可控性与可解释性更强。在OGI-S自发儿童语音与MyST对话语音等公开语料上的评估显示,软路由加EAR的完整模型在OGI-S平均词错率上达到11.08%,显著优于单专家与香草门控混合专家基线并保持了成人干净语音性能。该结论目前仅适用于所测的5个域划分与英语儿童对话和课堂应答场景,对噪声、口音、其他语言及更大年龄跨度的外推尚未验证。训练使用单张NVIDIA A6000显卡完成,原文未披露训练时长与推理时延或部署开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
320. 英语重音落到中文声调上:先检出再可控合成的重音保持链路
英文题目:Evaluating and Preserving Lexical Stress in English-to-Chinese Speech-to-Speech Translation
标签:#数据集 #评测协议 #韵律 #跨语言 #语音翻译
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#评测协议
👥 作者与机构
- Yuchen Song:机构信息未能从会议 PDF 纯文本可靠映射
- Xi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Mingze Li:机构信息未能从会议 PDF 纯文本可靠映射
- Satoshi Nakamura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
英语到汉语语音到语音翻译(Speech-to-Speech Translation,S2ST)需在保留语义的同时把源端词汇重音落实到声调语言对应字符,难点是汉语重音与声调耦合且缺乏标注数据与自动评测手段。方法链分4步推进:先录制双说话人汉语重音语料并做感知与对齐质检,再用XLS-R多层融合加音节池化与双向上下文建模训练汉语重音检测器,接着以源端EmphaClass加目标端检测加SimAlign对齐构成跨语言重音转移分数(Cross-lingual Emphasis Transfer Score,CETS),最后用重音标签微调CosyVoice 3实现可控合成。与直接复用英语帧级检测和通用TTS的方案相比,音节级多层融合更匹配汉语以字为单位的感知单元,显式标签桥接避免韵律在翻译中丢失。在5次随机划分约170条测试样本的评测下,本文系统的CETS-S为58.30%,高于Gemini + Base基线的CETS-S 16.60%,同时ASR-BLEU保持47.35的竞争水平。该结论限于朗读式短句和固定合成音色,未验证自发对话、多说话人及强口音下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
321. 粗粒度相似度看不清脚步声:ELSA 把文本拆成声事件再逐个对齐
标签:#评测协议 #模型评估 #环境声 #音频生成
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频生成 | 主方法:#评测协议
👥 作者与机构
- Shuntaro Suzuki:机构信息未能从会议 PDF 纯文本可靠映射
- Kento Tokura:机构信息未能从会议 PDF 纯文本可靠映射
- Daichi Yashima:机构信息未能从会议 PDF 纯文本可靠映射
- Kanon Amemiya:机构信息未能从会议 PDF 纯文本可靠映射
- Komei Sugiura:机构信息未能从会议 PDF 纯文本可靠映射
- Shinnosuke Takamichi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到音频生成的参考无关评测以文本查询与生成音频为输入,输出与人类主观评分对齐的一致性分数,实际难点在于全局嵌入会平均掉短暂瞬态事件且难以刻画多事件构成性意图。ELSA先用Human-CLAP编码器将整句文本与整段音频映射为全局文本向量与音频向量并计算余弦相似度,以保留整体语义并作为粗粒度基准。接着用文本大语言模型把查询拆分为多个名词加动词短语的独立声学事件,并用语言查询音频源分离模型按事件抽取对应音频片段,在同一嵌入空间编码为事件级文本与音频表示,使上一步的全局语义进入细粒度事件匹配。然后基于事件相似矩阵按行列取最大值修正得到精确率与召回率并计算F1作为细粒度分,再按事件数量自适应加权融合全局分与细粒度分,相对于全局CLAP相似度的关键差异在于显式分解与对齐事件因而更能反映构成性覆盖。在Clotho基准的REL任务下,SAM Audio配置的Spearman ρ得分为39.8%,低于AudioSep配置的Spearman ρ得分43.9%。该结论的适用边界受限于排序相关性与构成性对齐验证,尚未验证事件时序顺序与持续时间建模,且绝对分数系统性偏低需校准后使用。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
322. 假共振:情绪嵌入余弦相似度为何量不出真情绪
标签:#评测协议 #主观评测 #语音 #语音质量评估
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#评测协议
👥 作者与机构
- Yun-Shao Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Yi-Cheng Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Huang-Cheng Chou:机构信息未能从会议 PDF 纯文本可靠映射
- Tzu-Wen Hsu:机构信息未能从会议 PDF 纯文本可靠映射
- Yun-Man Hsu:机构信息未能从会议 PDF 纯文本可靠映射
- Chun Wei Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
情感语音生成评测需要判断合成语音是否复现参考样本的情感韵律,输入为参考与生成语音对,输出为情感相似分数,难点在于说话人音色与文本内容会干扰情感判断。作者先对情感嵌入做均值中心化校准以缓解各向异性,再构建类别三元组判别流程检验离散情感鲁棒性,接着用效价与唤醒度差异检验维度单调性与偏移可分性,最后以合成语音偏好三元组检验与人类感知的一致性。与直接用分类精度论证表征有效性的已有做法不同,该链条把零样本余弦相似本身作为被测对象并用声学干扰子显式分离情感因素。在MSP-Improv语言干扰子条件下emotion2vec的三元组准确率跌至20.14%,维度相关性接近于零,人类对齐最高仅65.00%,表明该指标不可靠。结论仅适用于基于余弦相似的零样本评测范式,不外推到带可训练分类头或显式解耦的监督评测。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
323. 只调流匹配模块:把确定性 ODE 变成可探索的 SDE 再做在线组相对强化学习
标签:#流匹配 #强化学习 #后训练 #零样本 #文本到语音
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#强化学习
👥 作者与机构
- Haoxu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Biao Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Weiqing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xiang Lv:机构信息未能从会议 PDF 纯文本可靠映射
- Han Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangang Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音克隆(Voice Cloning)的输入是提示音频加目标文本,输出是保留说话人音色且内容准确的高自然度语音,难点在于音色相似度、内容可懂度与感知质量三者在流匹配(Flow Matching, FM)模型中互相牵制。FlowTTS-GRPO先把确定性常微分方程(Ordinary Differential Equation, ODE)采样改写为随机微分方程(Stochastic Differential Equation, SDE)路径以获得探索噪声,再用组相对策略优化(Group Relative Policy Optimization, GRPO)在混合采样轨迹上估计组内优势并更新速度场,最后将说话人相似度、语音识别(Automatic Speech Recognition, ASR)转写准确率与DNSMOS感知分经标准差归一化后加权融合为终端奖励。与以往需独立随机生成器或大量偏好对的方法不同,该框架可直接微调开源CosyVoice 3.0与F5-TTS且无需价值网络。在Seed-TTS-Eval中文集上CosyVoice 3.0的ERes2Net相似度由0.830提升至0.859并在WavLM相似度上超越闭源Seed-TTS。该结论限于中英训练后的多语言外推、代理奖励与小规模主观评测,尚未验证长文本与强噪声提示下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/Systran/faster-whisper-large-v3 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
324. 用三种增强输入拆开语音:AugCodec 如何把语义、音色和韵律分开压缩
英文题目:AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation
标签:#数据增强 #向量量化 #语音 #语音编码 #语音转换
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#数据增强
👥 作者与机构
- Dongmei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaohang Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Fanjie Kong:机构信息未能从会议 PDF 纯文本可靠映射
- Abhishek Yanamandra:机构信息未能从会议 PDF 纯文本可靠映射
- Abhinav Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Tompkins:机构信息未能从会议 PDF 纯文本可靠映射
- Woohyun Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Najmeh Sadoughi:机构信息未能从会议 PDF 纯文本可靠映射
- Sunil Hadap:机构信息未能从会议 PDF 纯文本可靠映射
- Xiang Hao:机构信息未能从会议 PDF 纯文本可靠映射
- Zhu Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Caren Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是将16 kHz语音波形压缩为极低帧率离散Token并高保真重建,难点在于低码率低帧率下语义内容、说话人音色与韵律高度纠缠且易丢失可懂度。方法链分四步:先构造三路异源输入,语音转换去除音色、同说话人异语句保留音色、低频频谱保留韵律;再用三条独立编码器分别提取语义、说话人与韵律嵌入并引入增强损失对齐原始与转换语义;接着各自量化并扩展对齐到统一时序;最后经乘法与FiLM条件融合送入解码器重建波形。与FACodec等同源多分支方法相比,关键差异是从数据源头降低互信息而非仅靠损失约束解耦,从而在更低码率下保留内容并支持可控语音转换。在LibriSpeech test-clean 4 s至10 s的1237条短句上,AugCodec-3以12.5 Hz语义帧率、三路Token、400.00 bps取得词错率5.12%与PESQ 1.99,优于同等条件下Mimi的7.19%与1.81。结论仅在英文朗读、非流式重建与语音转换内容保持范围内验证,未验证噪声、混响、多语与长时对话外推。原文未披露训练硬件与时长及推理时延与算力成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
325. 小而稀的叫声为何需要高分辨率与稠密监督:USV-DETR 的技术解读
英文题目:USV-DETR: High-Resolution and Densely Supervised Detection of Ultrasonic Vocalizations
标签:#生物声学监测 #数据集 #Transformer #音频事件检测
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#Transformer
👥 作者与机构
- Yilan Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Kumiko Long:机构信息未能从会议 PDF 纯文本可靠映射
- Arielle Granston:机构信息未能从会议 PDF 纯文本可靠映射
- Adrian Rodriguez-Contreras:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
啮齿类超声发声(Ultrasonic Vocalizations,USVs)检测以声谱图为输入,输出每个鸣声的时频包围盒,难点在于目标窄带短时、尺度小且在谱图上稀疏分布。USV-DETR以实时检测Transformer(Real-Time Detection Transformer,RT-DETR)为基座,先由混合骨干与全局自注意力编码器提取多尺度语义特征,再经P2高分辨率支路保留细粒度时频边界,接着用密集匹配增强的训练框架提供稠密稳定监督,最后由可变形注意力解码器经Top-K查询选择输出框与类别。相比标准RT-DETR仅用P3起始金字塔与稀疏一对一匹配,该工作同时以四倍特征单元提升分辨率并以密集匹配与匹配质量感知损失增加正样本密度,因而更适配稀疏小目标。在SqueakOut测试集上该模型平均精度(Average Precision,AP)达到78.7,相对最强基线RT-DETRv2的73.9提升4.8个点,且小目标精度优势明显。在自采USVpic上AP为78.4,同样领先基线。结论目前仅在小鼠与大鼠幼崽两类实验室录音谱图上验证,未证明跨物种野外噪声与重叠鸣声下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/weiyilan9/USV-DETR — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
326. 不只降调就行:跨男性群体声音满意度与基频基准的众包语料库
标签:#数据集 #数据集构建 #言语感知 #语音 #语音属性识别
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#数据集构建
👥 作者与机构
- Sidney Wong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以众包问卷与自备设备录音为输入,输出跨性别男性群体嗓音满意度、自我感知男性度与声学常模的对应关系,难点在于睾酮替代疗法之外还有束胸、上身手术、非正式降调实践与社会归因交织,且缺乏社区级而非临床诊断级基准。方法链分三步:先在线招募并经伦理保护采集60题问卷与四部件语音样本,其问卷与音频输出进入基于浏览器的语言脑行为语料分析工具托管与对齐,再用Praat集成与稳健基频估计器提取平均与众数基频并按感知分组可视化建立关联。相比聚焦 transfeminine群体的嗓音障碍指数、变性人嗓音问卷与仅20人的Palette of Transmasculine Voices,该工作以非诊断性多模态众包实现感知与声学联合分析,具有社区基准意义。原文未提供可核对的关键定量结果。该分析受限于横断面众包场景,尚未验证纵向追踪与临床诊断外推。结论仅适用于以英语与德语为主的横断面样本,不能外推为睾酮个体纵向因果或临床诊断阈值。原文未披露训练、推理或部署成本,本工作无模型训练。
🔗 开源资源
- 数据相关资源:https://osf.io/tg8bc/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/google/REAPER — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
327. 不平均分配量化器:用可学习的层级权重让编解码残差对齐伪造痕迹
英文题目:Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
标签:#模型融合 #参数高效微调 #向量量化 #语音 #语音伪造检测
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#模型融合
👥 作者与机构
- Jinyang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Zihan Pan:机构信息未能从会议 PDF 纯文本可靠映射
- Qiquan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Sailor Hardik:机构信息未能从会议 PDF 纯文本可靠映射
- Soumik Mondal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为可能含合成或转换痕迹的语音波形,输出为真伪二分类分数,难点在于伪造伪影细弱稀疏且易被信道掩盖,而自监督学习(Self-Supervised Learning,SSL)表征的语义抽象会进一步平滑此类局部线索。本文采用冻结的WavLM-Large前12层经注意力合并(Attentive Merging,AttM)得到上下文特征,同时用EnCodec将波形离散为8层残差码本嵌入,再以可学习的维度级量化器加权聚合成紧凑编解码表征,最后经时序对齐后拼接投影并送入单层长短期记忆网络(Long Short-Term Memory,LSTM)分类。各分支分工明确,语义分支保泛化,编解码分支保细粒度伪影,融合层隔离层级建模收益。与均匀平均和通用多视角拼接相比,该设计显式保留粗到细残差顺序并允许各通道独立偏好不同量化层。在ASVspoof 2019 LA评测集上等错误率(Equal Error Rate,EER)为0.35%,相对注意力合并基线0.65%降低46.2%;在ASVspoof 5 Track 1上为5.68%,相对基线6.60%降低13.9%。该结论限于已测的ASVspoof与CodecFake划分,对未见编解码器族和强失真外推尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
328. 耳语缺了基频又像噪声:先学会感知不确定再决定信哪一帧
英文题目:Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition
标签:#自监督学习 #音频大模型 #鲁棒性 #语音 #语音识别
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Gaopeng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhenyu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zheng Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Yinfeng Xia:机构信息未能从会议 PDF 纯文本可靠映射
- Haitao Yao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
耳语语音输入为无声带振动的类噪声音频,输出为转写文本,难点在于基频(Fundamental Frequency,F0)与谐波结构缺失导致信号高度不确定,常规系统在漏识与幻觉之间剧烈摇摆,微弱线索增强反而更易把环境噪声误作语音。本文先用声学编码器将波形转为声学表征,再由不确定性感知模块经基频轮廓预测与掩蔽频谱重构两项自监督任务估计帧级置信度与全局不确定向量,前者以加性偏置调节解码器对声学前缀的注意力权重,后者经映射生成系统指令引导生成行为并决定何时保持沉默。该设计区别于伪耳语增强与静态投影适配,它把质量感知内化为动态控制而非事后补偿,使解码能按信号可信度选择信任声学证据还是回退,从而兼顾准确率与可靠性。在AISHELL6-Whisper耳语子集上相对此前最优的Seed-ASR取得约17%的字符错误率相对下降,同时在自建噪声集上幻觉率降至4.5%。结论仅在中英文耳语与高信噪通用集上得到验证,对重混响、远场或多说话人耳语的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
329. 用可验证奖励把语码切换听写拉回原语言:CER 与书写系奖励的分工
英文题目:Reinforcement Learning for Data-Efficient Code-Switched ASR
标签:#强化学习 #低资源 #多语言 #零样本 #语音识别
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#强化学习
👥 作者与机构
- Ziwei Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Vickers:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
代码切换识别输入为混合双语语音与语言对格式约束,输出为保留原语言跨度的转写文本,难点是边界语言混淆、整句英译、仅保留英语片段及异体书写系统污染。区别于低秩适配监督微调的词元级交叉熵,该方法以组相对策略优化做可验证奖励学习,对每输入采样多候选并以负字符错误率加书写保真奖励组内标准化求优势,再用裁剪替代目标加相对参考策略的KL正则更新,保真奖励仅当字符全属双语允许脚本并集时给固定系数。训练期做两遍草稿精修,首遍采样更新后取奖励最高草稿,与原音频共同构造第二遍提示再采样更新,测试时仍用单遍贪婪解码。在CS-FLEURS人工朗读测试集上20%数据精修模型宏平均字符错误率为0.134、微平均为0.147,优于100%数据低秩适配监督微调的0.138/0.159;10%数据已达0.138/0.155,基本持平全量监督微调。增益集中在阿拉伯语、日语、俄语等类型距离远的语言对,欧洲近缘对、中文对和韩语对仍由低秩适配占优,阿拉伯语精修在两个评测集上均恶化约0.07。零样本迁移到80小时以上人工录制多轮对话SwitchLingua上20%模型仍以0.229/0.219超越全量监督微调的0.265/0.246,但绝对误差更高。原文定位为可复现试验台而非追求最优性能,承认低字符错误率区间监督微调更强与字符错误率误罚表面形式差异等问题。该结论适用边界受限于朗读与对话评测场景,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
330. 先定语义再补声音:DelayGSE 用延迟文本与码本加权压住幻觉
英文题目:DelayGSE: A Generative Speech Enhancement Framework with Delayed Text-Aware Conditioning
标签:#自回归模型 #向量量化 #音频超分辨 #去混响 #语音增强
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#自回归模型
👥 作者与机构
- Xin Yuan:机构信息未能从会议 PDF 纯文本可靠映射
- Junling Lv:机构信息未能从会议 PDF 纯文本可靠映射
- Zezhou Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Xingjun Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Liangliang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yanqiang Lei:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
生成式语音增强以退化语音为输入并重建清晰波形,在低信噪比与瞬态噪声下易产生流畅但语义错误的幻觉语音。DelayGSE先用短时傅里叶变换(Short-Time Fourier Transform,STFT)编码器提取声学特征并用冻结Whisper v3 large编码器提取语义特征,再由以Qwen 2.5 0.5B初始化的自回归Transformer先预测文本token并延迟5步生成多码本声学token,最后经44.1 kHz Descript Audio Codec(DAC)解码为波形。与并行码本预测及无文本约束的语言模型增强相比,该语义先行与码本延迟机制在保留生成灵活性的同时约束了声学采样空间。多数据集平均文本感知带来15.8%相对词错误率(Word Error Rate,WER)下降,真值文本推理作为上界可达33.1%相对下降,且感知质量未见明显损失。在内部会议实录评测设置下,DGSE-IW的MOS为4.043,高于GAN-based基线的MOS 3.639。该结论适用边界受限于中英文去噪去混响与超分仿真及258条内部会议实录,跨语言泛化与极低信噪比无文本条件下的鲁棒性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://delaygse.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
331. 歌曲生成与歌声转换为何难兼得:用课程掩码统一音色与伴奏
英文题目:Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation
标签:#流匹配 #多任务学习 #零样本 #歌唱生成 #语音转换
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#歌唱生成 | 主方法:#多任务学习
👥 作者与机构
- Ziyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Chunyu Qiang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaopeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxin Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Kang Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Wenjie Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Jingbin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Tianlun Zuo:机构信息未能从会议 PDF 纯文本可靠映射
- Zhao Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Teng Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Yuzhe Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Chen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
歌曲生成缺乏零样本音色克隆,歌声转换则忽视人声与伴奏协同,且前者是文本到音频、后者是音频到音频,输入模态与优化目标冲突导致难以联合训练。UniSinger先用多模态编码器将文本指令、歌词音素、语义内容、说话人嵌入和目标音频隐变量投射到共享隐空间,再以多模态扩散变换器经流匹配学习从高斯噪声到音频隐变量的速度场,接着用在歌声转换信息瓶颈下提纯的跨任务说话人嵌入空间为歌曲生成提供细粒度音色控制,最后以四阶段任务掩码课程逐步开放模态组合以缓解梯度冲突。与单任务或干声转换后级联生成伴奏的机制不同,该框架实现了可克隆歌曲生成与伴奏协同生成歌声转换的端到端统一。在内部500段中英文均衡评测集上,歌曲生成音素错误率为19.61%,优于最强基线DiffRhythm+的20.72%,说话人相似度为68.85%,优于YuE的65.15%;干声转换音素错误率为0.151、相似度为0.712,优于So-VITS-SVC的0.154和0.700,伴奏版本和声度达3.891。在内部均衡评测任务下,UniSinger SVC的说话人相似度得分为0.712,高于So-VITS-SVC的说话人相似度得分0.700。该结论仅在内部短片段上验证,长歌曲结构一致性与野外泛化尚未验证,适用边界受限于短片段内部语料。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://ziyu6.github.io/UniSinger/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/RVC-Boss/GPT-SoVITS — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
332. 把语言身份移出逐词循环:用一次计算的 utterance 级表示替代解码器逐步神经模块
标签:#Adapter #高效推理 #多语言 #语音识别
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#Adapter
👥 作者与机构
- Hongxu Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Lahiru Samarakoon:机构信息未能从会议 PDF 纯文本可靠映射
- Ivan Fung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可配置多语言语音识别要求单个模型通过用户给定的多热语言提示识别任意语言子集,输入为声学特征拼接语言向量,输出为对应语言子词或中文字符转写,难点是语言混淆与解码器语言特定模块随输出长度线性增长的延迟。作者保留编码器中每 utterance 计算一次的神经语言特定模块以维持声学适应性,将解码器中位于掩码自注意力之后、交叉注意力之前、每步依赖当前 token 隐状态的线性投影替换为与 token 无关的可学习静态向量,解码开始前按语言权重一次加权求和并缓存,后续每步只做向量加法。进一步的编码器信息增强方案复用已受连接主义时间分类损失监督的顶层编码器语言分支输出,经时间维全局平均池化与线性加修正线性单元适配器得到 utterance 级动态线索,将静态向量扩展为小型矩阵再投影回模型维度后,以可学习逐维门控做逐元素融合,在解码启动时一次生成固定偏置。该设计将解码器语言模块单步复杂度从相对隐层维度的二次降为线性。在 8 语言多语言 LibriSpeech 测试集全语言激活下,增强方案平均词错误率为 8.70%,与原始可配置多语言模型的 8.70% 持平,静态方案为 8.80%;在自建均衡 4 语言语料上分别为 11.84% 对 11.83% 对 11.92%。在 Intel Xeon 中央处理器上 110-130 token 长组额外开销从 107.88 s 降至静态方案 2.23 s 与增强方案 7.34 s,长语音峰值延迟下降超 90%。结论限于朗读类非均衡语料与未公开的内部 4 语言语料,未验证百语言、强噪声与流式首包延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
333. 五十小时能做富格式医疗转写吗:拉脱维亚语端到端与两阶段路线的对照
英文题目:Low-Resource Medical ASR for Rich Transcription in Latvian
标签:#医疗音频 #SFT #低资源 #语音识别
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#SFT
👥 作者与机构
- Arturs Znotins:机构信息未能从会议 PDF 纯文本可靠映射
- Normunds Gruzitis:机构信息未能从会议 PDF 纯文本可靠映射
- Andris Rozentals:机构信息未能从会议 PDF 纯文本可靠映射
- Maris Golubovskis:机构信息未能从会议 PDF 纯文本可靠映射
- Mikelis Gulbis:机构信息未能从会议 PDF 纯文本可靠映射
- Roberts Dargis:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向拉脱维亚语医疗口述的任务以自发口述音频为输入,直接输出可归档的富格式报告,实际难点在于口音与领域术语密集、数字缩写代码与大小写标点规范严格、口述含标点命令与口误自我纠正。且遗留逐字稿与人工终稿并不逐字对应,通用模型在该领域词错率急剧恶化而在域内仅有约五十小时人工转写可用。方法链分三步:先用大语言模型将遗留逐字稿与人工终稿对齐为逐字到格式化的平行对并经校验与强制对齐得到句级时间戳,该平行对进入下一步作为端到端与文本格式化训练的监督。再对Whisper等基础模型做两阶段微调,先迁移通用拉脱维亚语能力再适配医疗富格式输出;最后用微调模型转写未标注音频并经大语言模型校正过滤得到伪标签音频扩充训练,并以微调文本格式化模型完成逐字转写到格式化报告的两阶段转写。与传统规则式逆文本规范化相比,该路线以数据驱动的端到端学习与大语言模型后编辑替代手工文法维护,并以伪标签复用遗留数据降低人工标注负担。在医疗测试集下,加入伪标签数据的微调Whisper-large-v3模型的WER为10.6%,低于未加伪标签时模型的WER 11.1%。该结论适用边界受限于放射病理与出院小结类口述报告,在对话急诊噪声及跨机构口音上尚未验证,训练硬件为单块A100 80GB图形处理器而推理开销尚未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
334. 总体第一不等于处处第一:印度语 TTS 偏好由表达力和可懂度驱动
标签:#基准测试 #众包评测 #多语言 #文本到语音
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#众包评测
👥 作者与机构
- Srija Anand:机构信息未能从会议 PDF 纯文本可靠映射
- Ashwin Sankar:机构信息未能从会议 PDF 纯文本可靠映射
- Ishvinder Sethi:机构信息未能从会议 PDF 纯文本可靠映射
- Aaditya Pareek:机构信息未能从会议 PDF 纯文本可靠映射
- Kartik Rajput:机构信息未能从会议 PDF 纯文本可靠映射
- Gaurav Yadav:机构信息未能从会议 PDF 纯文本可靠映射
- Nikhil Narasimhan:机构信息未能从会议 PDF 纯文本可靠映射
- Adish Pandya:机构信息未能从会议 PDF 纯文本可靠映射
- Deepon Halder:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammed Safi Ur Rahman Khan:机构信息未能从会议 PDF 纯文本可靠映射
- Praveen Srinivasa Varadhan:机构信息未能从会议 PDF 纯文本可靠映射
- Shobhit Banga:机构信息未能从会议 PDF 纯文本可靠映射
- Mitesh M Khapra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
印度语音优先场景的任务输入是含语码混合、领域词汇与数字符号的多语言朗读文本,输出是相应语音,其实际难点在于语言多样性与表达力、可懂度等多维感知的交织使绝对打分校准敏感且诊断性弱。方法先按领域与压力类型策划跨语言语句并经母语专家质检形成基准,其输出作为统一文本提示进入成对合成环节以控制语言变异。接着招募母语评测者实施两阶段盲听,先锁定整体偏好后独立标注六个感知轴,前阶段锁定结果作为后阶段归因的锚点以减少合理化偏差。最后用布拉德利-特里模型拟合排序并用自助法给出置信区间,与平均意见分及多刺激隐藏参考相比以直接比较替代绝对打分并将选择与归因分离,具有可扩展的可解释性。在代码混合基准条件下,GEMINI 2.5 PRO TTS的Bradley-Terry得分为1135.45,高于ELEVEN LABS V3的Bradley-Terry得分1054.00。粒度轴构成的分类器在留出语言上预测整体偏好准确率达86.1%,可解释分析显示表达力与可懂度贡献最大。结论仅适用于所测7个系统与印度语言朗读场景,外推至对话交互或未覆盖语言尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
335. 词表太大装不下:用三维压缩让开放词表关键词检出跟上偏置识别
标签:#模型压缩 #高效推理 #语音识别 #关键词检测
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#模型压缩
👥 作者与机构
- Leonor Barreiros:机构信息未能从会议 PDF 纯文本可靠映射
- Raul Monteiro:机构信息未能从会议 PDF 纯文本可靠映射
- Afonso Mendes:机构信息未能从会议 PDF 纯文本可靠映射
- Gonçalo M. Correia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
开放词汇关键词检测需判断任意文本关键词是否出现在待测语音中,输出二值命中与候选排序,其瓶颈是声学嵌入高维且随词表增大存储与延迟线性膨胀。所提系统用Whisper-large-v2编码器同时编码待测语句与关键词音频,保留多层隐表示,再经稀疏最大层门控自动筛选判别层,随后用单隐层前馈网络压缩隐维度并用一维卷积网络降低帧率。最后在压缩后余弦相似矩阵上用ResNet-50判别是否命中,命中词作为热词送入Whisper解码器做上下文偏置。与聚合固定多层高维特征的基线相比,该链条以可学习稀疏门控与轻量投影替代全量存储,坚持音频到音频匹配而非退化为文本音频联合嵌入。在Aishell中文未见语言上,最强压缩(LHF-comp)取得71.3%实体召回与14.7%混合错误率(mixed-error-rate, MER),优于重现基线的59.3%与24.9%,单关键词库内存下降达128倍且大规模库处理快约6倍。该结论适用边界受限于验证集最优阈值与短句评测,其失败条件包括在16062词无整理葡萄牙语医学词表上偏置后混合错误率恶化,且长音频语音活动检测切分会传播误差。推理开销上压缩后关键词库存储与处理延迟大幅下降,尚未验证在大规模无整理词表下阈值自适应与长时部署的稳定性。
🔗 开源资源
- 第三方资源:https://github.com/rany2/edge-tts — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/luferrer/ConfidenceIntervals — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
336. 长对话一测就露馅:口音与切分如何同时拉低英语 ASR
英文题目:AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR
标签:#基准测试 #数据集 #基准设计 #长音频处理 #语音识别
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Eugen Beck:机构信息未能从会议 PDF 纯文本可靠映射
- Sarah Beranek:机构信息未能从会议 PDF 纯文本可靠映射
- Uma Moothiringote:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Mann:机构信息未能从会议 PDF 纯文本可靠映射
- Wilfried Michel:机构信息未能从会议 PDF 纯文本可靠映射
- Katie Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Taylor Tragemann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向自动语音识别(Automatic Speech Recognition / ASR)在呼叫中心长时任务型对话中的评估失效问题,输入为双通道长录音的自发代理客户对话,输出为逐词转写,难点在于口语不流利、命名实体密集、口音多样与长时切分误差交织。方法链由四步构成:首先按离散口音类别招募母语者并进行自由角色扮演采集,输出原始双通道音频;其次由专业标注员按逐字规范产生带切分的时间对齐转写;再次经多轮人工质检与引导识别复核回流修正可疑片段;最后统一用多种切分策略驱动开源系统解码并按会话级归一化评分。相比朗读短句基准与按公司国别弱标注口音的财报语料,其机制差异在于受控可比条件下采集自然交互并保留不流利标记,同时提供独立于公开网络的新测试分布。在 Silero 语音活动检测(Voice Activity Detection / VAD)切分下表现最优的系统平均词错率(Word Error Rate / WER)为 8.3%,而新加坡、中国及苏格兰等口音系统性高出约 6 个百分点,平均精度提升并未带来口音公平性。结论仅适用于角色扮演的安静室内呼叫场景,外推至真实投诉、强噪声或未覆盖社群口音尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/snakers4/silero-vad/tree/v5.1.2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
337. 该说就说、该沉默就沉默:多方对话中助手何时不该插话
英文题目:Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue
标签:#基准测试 #SFT #大语言模型 #零样本 #轮次切换
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#轮次切换 | 主方法:#SFT
👥 作者与机构
- Kratika Bhagtani:机构信息未能从会议 PDF 纯文本可靠映射
- Mrinal Anand:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Chen Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Amit Kumar Singh Yadav:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多方对话中的轮次切换(turn-taking)任务输入为截至暂停点的完整文本上下文与指定目标说话人,输出为发言或保持沉默的二元决策,难点在于暂停含义模糊且旁观与被谈及极易混淆。该工作先从三类自然对话语料切分话语边界并为每个非发言者构造决策点,再按显式点名与语境介入划分为两类应发言与两类应沉默样本,接着以零样本提示评测多款大语言模型(large language model,LLM),最后用标签条件蒸馏的单句推理轨迹做有监督微调使模型先解释后决策。与仅预测下位发言者或识别被寻址者的已有工作不同,该方法将参与决策本身作为每暂停点的受控输出,并以显式推理约束语用判断。在 Friends 子集的决策独训练下 Qwen2.5-7b 的平衡准确率达到 66.60%,而推理加决策训练提升至 68.46%。结论仅适用于基于文本上下文的离线暂停点判断,未验证韵律、重叠语音与实时打断等声学线索下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/ishikilabsinc/context — 链接不可用(HTTP 404)
- 模型相关资源:https://huggingface.co/ishiki-labs/models — 暂时无法访问
- 数据相关资源:https://huggingface.co/datasets/ishiki-labs/multi-party-dialogue — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
338. 把 Vocos 搬进脉冲域:稀疏放电如何保住频谱细节
标签:#知识蒸馏 #高效推理 #语音 #语音合成
评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#知识蒸馏
👥 作者与机构
- Yukun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zhaoxi Mu:机构信息未能从会议 PDF 纯文本可靠映射
- Andong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Peilin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xingyu Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理从梅尔频谱图到波形的频域声码任务,输入为 100 维梅尔频谱图,输出为经逆短时傅里叶变换重建的 24 kHz 波形,难点在于二值脉冲的信息瓶颈与脉冲动力学因果性导致的未来上下文缺失。方法链分为三步:首先以堆叠脉冲 ConvNeXt 块将密集逐点卷积转为稀疏累加操作并用幅度捷径回灌信号动态,其次以同构人工网络教师对学生做层间特征与终层幅度相位蒸馏以继承频谱预测能力,最后在每块内嵌入时间移位模块融合相邻帧信息以补偿时序建模短板。与直接脉冲化相比,该设计保留了 Vocos 的无上采样频域架构,同时用事件驱动稀疏性替代主要乘加开销。在 LibriTTS 的 test-clean 划分上,4 步联合模型取得 UTMOS 3.74,对照人工网络基线 3.82 仅下降 0.08,且理论能耗仅为基线的 14.7%。结论限于单语料朗读语音的高保真重建,尚未验证噪声、跨语言、长时与流式条件下的外推能力。能耗为基于 45nm 工艺的理论估算,未给出真实神经形态芯片实测延迟与功耗。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
339. 语义保内容、声学保音色:SARA 用双流结构同时要保真与可控
标签:#变分自编码器 #零样本 #语音 #语音编码 #文本到语音
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#变分自编码器
👥 作者与机构
- Peijie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Wenhao Guan:机构信息未能从会议 PDF 纯文本可靠映射
- Weijie Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Kaidi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Daiyu Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhuanling Zha:机构信息未能从会议 PDF 纯文本可靠映射
- Junbo Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Qingyang Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Lin Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成需要将文本映射为兼顾内容准确与音色保真的连续语音表征,难点在于声学编解码器缺乏语言约束易读错,而自监督语义表征又丢失音色与韵律细节,致使重建保真与生成可控难以兼得。所提语义声学残差自编码器 Semantic-Acoustic Residual Autoencoder(SARA)先用冻结的W2v-BERT 2.0分支输出稳定的语义锚点以保证内容一致性,再用残差卷积声学编码器从波形补足被丢弃的细粒度声学信息,随后将两路时间对齐拼接并经线性投影压缩为紧凑潜变量。最后由基于HiFi-GAN的多感受野融合解码器与对抗判别器从该潜变量重建高保真波形,形成可直接替换梅尔谱供F5-TTS建模的隐空间。与依赖正则损失约束的语义变分自编码器Semantic-VAE相比,关键差异是以冻结语义分支加残差声学分支的双流结构解耦替代损失平衡,从而降低生成轨迹歧义并支持低步数推理。在 LibriSpeech-PC 测试集上基于 F5-TTS Small 的零样本合成词错率 Word Error Rate(WER)降至 1.79%,同时优于更大参数基线的内容准确性。结论目前仅在英文朗读类数据与 F5-TTS 框架内验证,跨语言、噪声及自回归建模的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://pppjchen.github.io/SARA → https://pppjchen.github.io/SARA/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
340. 合成语音多了反而更不像本人:用域条件把真假语音分开训练
标签:#数据增强 #领域适应 #低资源 #语音克隆
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音克隆 | 主方法:#数据增强
👥 作者与机构
- Youngwon Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Jinwoo Oh:机构信息未能从会议 PDF 纯文本可靠映射
- Hwayeon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Hyeonyu Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源个性化语音合成的输入是极少量目标说话人录音与任意待合成文本,输出是保持目标音色且可懂的语音,难点是直接混入大量零样本语音合成数据虽提升可懂度却漂移说话人相似度。为此ZeSTA先用公开零样本模型为目标说话人批量合成同文本语音以扩充语言覆盖,合成语音随真实录音进入多说话人VITS适配阶段。适配阶段引入真实与合成二值域嵌入以条件化声学生成,并对稀缺真实样本做3倍过采样以稳定微调偏置,推理时固定以真实域条件合成。该机制与朴素混合的关键差异是语言信息经文本编码器共享而声学域偏置被显式标记,从而在不改主干结构下保留增强收益。在LibriTTS评测设置下,Fish-Speech源ZeSTA的SECS指标为0.815,高于朴素混合的SECS指标为0.765。结论仅在VITS加英语有声书与助理录音的14个说话人上验证,对其他架构与跨语言泛化尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://zeroone-universe.github.io/zesta/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
341. 不做解耦做残差:ProsoCodec 把韵律当成文本与音色解释不了的部分
英文题目:ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion
标签:#扩散模型 #向量量化 #韵律 #零样本 #语音转换
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#向量量化
👥 作者与机构
- Jeongsoo Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Ji-Hoon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Shujie Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Joon Son Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音转换(Voice Conversion,VC)要求保留源语音的语言内容与韵律(Prosody),只替换目标说话人音色,难点在于整体式神经编解码器将三者纠缠,而提示生成又易整体模仿参考音频。该文提出韵律导向编解码器 ProsoCodec,先用预训练语音识别与说话人验证模型抽取文本与说话人嵌入作为前缀条件,再将低频梅尔谱送入 Transformer 编码器并经二值球面量化形成离散瓶颈,最后由扩散 Transformer 解码器以流匹配目标重建全频梅尔谱。与显式分解内容、音色与基频的方法不同,该设计不设对抗解耦目标,而是靠条件冗余与容量限制迫使瓶颈只编码残差韵律,并用同说话人双话语训练阻止从提示复制话语级风格。在 LibriTTS test-clean、test-other 与 VCTK 合并的 3000 条零样本转换评测中,该方法在内容错误率、目标音色相似度与源韵律保持上同时优于 Seed-VC、Vevo、FACodec、HierSpeech++、UniAudio 与 DDDM-VC 共 6 个开源基线,自然度接近源语音。其结论限于 24 kHz 英文朗读语音与 2秒至8秒短句转换,尚未验证跨语言、强情感、歌唱或噪声自发语音的外推能力。原文未披露训练硬件、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
342. 情感合成的好坏不能只测自然度:一个同时测质量与情感吻合的大规模听感数据集
英文题目:A Large-Scale Dataset of Listener Impressions of Emotional TTS
标签:#数据集 #数据集构建 #语音 #语音质量评估
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音质量评估 | 主方法:#数据集构建
👥 作者与机构
- Erica Cooper:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoxue Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Takuma Okamoto:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Toda:机构信息未能从会议 PDF 纯文本可靠映射
- Nancy Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Hisashi Kawai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
情感合成评估需同时判断语音自然度与情感表达是否贴合目标类别,而现有质量预测模型多在中性合成语音上训练,难以覆盖该双重目标。本文构建含18208个样本、覆盖五种情感与13个合成系统及自然语音的大规模听测库,输出涵盖质量平均意见分、情感匹配分、感知情感类别与效价唤醒支配度评分。数据链分三步:先从情感语音数据集与对话语音收集自然语音并用多种合成系统生成对应情感语音,再将所得音频送入质量、情感类别与匹配度、效价唤醒支配度三个独立听测任务,最后对三任务评分做系统排名与分布一致性分析以形成可建模标签。相对已有中性语音质量库,该数据集关键机制差异是并行提供合成样本与多轴情感标注,使质量与情感保真度可联合建模并支撑零样本预测检验。在Neutral情感任务条件下,UTMOS的SRCC为0.78,高于SSL-MOS的SRCC 0.15。该结论仅适用于英语表演式五情感设置,向自然对话情感与未见情感类别的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
343. 单步可用的可学习薛定谔桥:把训练与推理的起点对齐再做语音增强
英文题目:Learnable Schrödinger Bridge and Activations for Efficient Diffusion-based Speech Enhancement
标签:#扩散模型 #高效推理 #语音 #语音增强
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#扩散模型
👥 作者与机构
- Yihui Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Wouter Tirry:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Fingscheidt:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从加性噪声、混响、削波退化中恢复目标语音的复谱细节,生成式扩散方法质量高但依赖多步逆过程而成本高昂,且训练与推理初值失配易致幻觉。本文提出混合判别生成模型EffDiffSE+,先由条件网络输出预增强语音与多尺度条件,再由辅助网络自适应估计桥初值的均值权重与标准差,最后由桥网络结合Snake激活与交互模块单步生成增强复谱。相对香草薛定谔桥(Schrödinger Bridge,SB)以干净语音训练而以带噪语音启动推理的做法,新机制以高斯分布初始化统一训练与推理初值来源并优选小时间索引失配。在Dval验证集下,EffDiffSE的PESQ为2.21,高于Noisy的PESQ 1.28。论文在URGENT 2024非盲测试集1000条语音上报告PESQ达到2.58,超越次优基线EffDiffSE的2.45,主观平均意见分(Mean Opinion Score,MOS)达到3.95,仅比干净语音低0.01。其结论限于16 kHz英语为主的加噪、加噪加混响、加噪加削波场景,未采用带限失真,未验证多语言与真实录音外推。单步推理复杂度为3.84 GMAC/s,参数量为9.40 M,为所比方法中最低一档。上述适用边界尚未验证多语言与真实录音外推,而单步计算量与训练成本及推理开销已由原文披露的模型规模与硬件配置界定。
🔗 开源资源
- 第三方资源:https://github.com/ludlows/PESQ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
344. 听见录音里的自己为何不适:回放与想象之差及个人敏感的声学加权
标签:#统计分析 #主观评测 #言语感知 #语音 #语音质量评估
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音质量评估 | 主方法:#主观评测
👥 作者与机构
- Koki Fukuda:机构信息未能从会议 PDF 纯文本可靠映射
- Shinnosuke Takamichi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为459名日语母语者朗读中性句后的自我声音评价,输出为回放录音与听觉想象两种条件下的多维印象分,难点在于想象不可观测、顺序与习惯化混杂及个体差异大。方法链分四步:在线采集朗读录音并实施回放与想象的被试内四组设计以分离顺序与漂移;用混合效应模型估计回放—想象差距并检验顺序与特质预测;用重复基线做漂移校正的稳健性检查;对声学特征做发现—验证划分的探索性筛选与特质调节检验。与既往骨导失配解释不同,该工作将厌恶操作化为可检验的回放—想象差距并引入情境与听者加权机制。在在线回放与想象对照任务条件下,有录音接触史组陌生感的回放—想象差距得分为β=0.591,高于怪异感的差距得分β=0.488。结论受限于日本在线自选样本、中性朗读材料与单次想象范式,合成自声音等外推场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/takamichi-lab/selfvoice-playback-imagery-gap — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
345. 既要分开语义与声音,又要摆脱大模型的 HybridCodec
英文题目:HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec
标签:#知识蒸馏 #向量量化 #高效推理 #语音编码
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#知识蒸馏
👥 作者与机构
- Arjun Gangwar:机构信息未能从会议 PDF 纯文本可靠映射
- S Umesh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音离散化需要把波形压缩为语言模型可用的语义令牌和声学令牌,难点是在25Hz低帧率下同时保证首码本语义纯度、全码本重建保真和推理速度。混合编码器(HybridCodec)先用通用卷积编码器把24kHz波形下采样为25Hz共享隐变量,再分两路处理:语义支路用轻量编码器加16384表项向量量化(Vector Quantization,VQ)得到首层语义码,语义解码器将其映射为与冻结w2v-BERT-2.0第16层特征对齐的表示并计算蒸馏损失;声学支路把通用隐变量减去语义解码输出后送入声学编码器和11个1024表项残差向量量化(Residual Vector Quantization,RVQ)层,只建模残差,最后两路解码特征相加送入通用解码器重建波形。与推理依赖大自监督编码器的DualCodec和首层语义偏弱的单流蒸馏DAC相比,该设计保留显式残差解耦,同时训练后丢弃教师。在LibriSpeech test-clean 60k步下首层词错率(Word Error Rate,WER)为15.36%,优于同条件DualCodec的18.93%和DAC蒸馏版的21.54%,实时因子(Real-Time Factor,RTF)为0.014,约为DualCodec的3倍速。结论边界清晰:域内优势在300k时收窄,SeedTTS-en域外基本打平,Common Voice法语零样本首层词错率仍超100%,噪声、音乐、多语言训练均未验证。训练用4卡NVIDIA RTX A6000,推理无需教师但主体仍有159.62M参数。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
346. 广播音频做自监督预训练:滤得越狠,识别越好但听觉越窄
标签:#数据清洗 #预训练 #语音 #语音识别
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#数据清洗
👥 作者与机构
- Yaroslav Getman:机构信息未能从会议 PDF 纯文本可靠映射
- Tamás Grósz:机构信息未能从会议 PDF 纯文本可靠映射
- Tommi Lehtonen:机构信息未能从会议 PDF 纯文本可靠映射
- Mikko Kurimo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为约20400小时无标注芬兰AlfaTV电视广播音频,输出是可用于芬兰语语音识别的自监督表示,难点在于连续采集带来的静音、噪声、音乐、多语言语音混杂且几乎无元数据。处理链为四档递进过滤后统一预训练:原始切分(Raw)将录音直接切为30秒定长块,保留语音与非语音混合上下文;能量语音活动检测(Energy-based Voice Activity Detection,E-VAD)用Auditok按能量阈值粗筛;神经网络语音活动检测(Neural Voice Activity Detection,N-VAD)用pyannote.audio从原始波形定位语音边界;神经检测加音频语言识别(Audio-based Language Identification,A-LID)再用SpeechBrain VoxLingua107 ECAPA-TDNN保留芬兰语。相对已有把能量法或神经法当默认预处理的启发式流程,本文固定wav2vec 2.0掩码对比目标与训练预算,只改变数据分布,从而分离过滤本身的效应并解释其改变同序列内负样本难度的作用。在Common Voice芬兰语微调测试集上最强组合相对无过滤基线带来12.7个百分点的词错误率绝对下降,仅用42.3%数据。该结论限于芬兰语为主的广播域、低资源微调与冻结探针评测,未验证其他语言、其他自监督框架与高资源微调的外推性。代价是神经过滤将实时率从1.6e-08推高至2.3e-03,语言识别再推高至1.0e-02,约4.3倍于单神经检测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
347. 不用直接估计频谱包络:用声道几何约束共振的匿名转换
英文题目:Phy-VC: Physics-Informed Voice Conversion for Privacy-Preserving Pathological Speech
标签:#信号处理 #隐私保护 #发声与构音 #说话人匿名化 #语音转换
评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#信号处理
👥 作者与机构
- Suhita Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
- Yamini Sinha:机构信息未能从会议 PDF 纯文本可靠映射
- Melanie Jouaiti:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Wansiedler:机构信息未能从会议 PDF 纯文本可靠映射
- Kim Hakenberg:机构信息未能从会议 PDF 纯文本可靠映射
- Julian Karcher:机构信息未能从会议 PDF 纯文本可靠映射
- Ingo Siegert:机构信息未能从会议 PDF 纯文本可靠映射
- Sebastian Stober:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床语音匿名化要求输入源说话人波形并输出目标音色波形,同时保留语义、可懂度、韵律与病理标记,其难点在于口吃重复、阻塞、老年震颤等分布外事件易被神经声码器平滑或误判为噪声。Phy-VC先用WavLM第6层提取音素表征与第12层提取韵律情感表征并分别经K最近邻映射到目标说话人特征池,映射输出进入构音预测网络生成8维Maeda控制轨迹。该轨迹经Story参数化生成口腔与鼻耦合面积函数,再经可微分Webster代理估计共振峰频率与带宽并构造洛伦兹滤波器。滤波器与融合模块预测的基频、谐波源滤波、噪声滤波及清浊掩码一起送入减法合成器重建波形,该几何瓶颈强制共振峰协同漂移并将声道长度与音素手势解耦,因而比直接预测谱包络或依赖HiFi-GAN的基线更鲁棒且支持可解释调控。在痴呆语料评测设置下,Phy-VC的CER为15.7±0.7%,低于DDSP-QbE的CER 19.6±0.8%。训练成本为在NVIDIA A100 80GB硬件上约48h完成350轮训练,推理开销为与DDSP-QbE同样快于实时且物理模块额外计算量可忽略。原文仅用标准语音训练,在痴呆、口吃与老年语音上评测分布外泛化,目标始终为健康标准(Standard, SD)音色,其结论限于英语朗读、情感与临床语料场景,对重度构音障碍、跨语言及噪声混杂部署尚未验证。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
348. 把每个音素学成一团云:用类别先验加对比聚类实现可插值的音素空间
标签:#对比学习 #变分自编码器 #语音学与音系 #语音 #语音编辑
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编辑 | 主方法:#变分自编码器
👥 作者与机构
- Nina Goes:机构信息未能从会议 PDF 纯文本可靠映射
- Lars Meyer:机构信息未能从会议 PDF 纯文本可靠映射
- Katrin Neumann:机构信息未能从会议 PDF 纯文本可靠映射
- Paula Andrea Pérez-Toro:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas M. Kist:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理音素级可控语音编辑,输入为对数梅尔频谱图与强制对齐得到的音素边界和类别标签,输出为保留上下文的替换或渐变音素波形,难点在于离散音素表示难以平滑过渡且深层表征不可解释、不可控。方法链为:高斯时长感知池化将变长声学帧压缩为每音素单 token 并由时长预测器约束时序,带类别条件高斯先验的 β 变分自编码器(Variational Autoencoder, VAE)为 71 类英语音素各学习独立分布,原型式监督对比学习(Contrastive Learning, CL)拉近样本到本类质心并推远异类质心,解码端经上采样、Conformer 块、PostNet 精修、对抗与特征匹配缓解过平滑。相对标准正态先验与离散向量量化瓶颈,差异是以可学习先验稳定分布并以外显判别目标塑造几何,使质心间线性插值 \(z^\{\*\}=&\#40;1\-\\alpha&\#41;\\mu\_\{b\}\+\\alpha\\mu\_\{p\}\) 具有语音学意义。在LJSPEECH测试集评测下,完整模型的轮廓系数指标为0.720,高于去除对比学习基线的轮廓系数指标0.203。结论限于英语朗读语音单音素替换,未验证多语言、强协同发音与长时韵律外推。该结论适用边界受限于英语朗读单音素替换场景,跨语言与长时韵律外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/ankilab/PhonemeCVAE.git → https://github.com/ankilab/PhonemeCVAE — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
349. 语义越深 prosody 越淡:用显式声学支路补回句子重音
标签:#数据集 #模型融合 #韵律 #零样本 #语音属性识别
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#模型融合
👥 作者与机构
- Hujian Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Li Tao:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Ying Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jingwei Qu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhaofang Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
句子重读检测需从连续语音直接输出词级或字级重读标签,难点在于Whisper类深层语义表征会平滑掉音高、时长、能量等细粒度韵律线索,且普通话数据稀缺并受声调与轻重格局干扰。该工作提出ProWhistress双流转写架构,第一步由附加解码器块对齐隐式流,以Whisper编码器第12层与解码器第9层为输入生成语义锚定表征并维持转写能力。第二步由三层声学编码器从编码器第9层中间表征提炼显式韵律特征,再经瓶颈交叉注意力投影至256维隐空间注入语言流并映射回原维度。第三步由门控残差融合以负偏置门控将显式流作低幅值残差校正叠加至隐式流,所得融合表征送入两层全连接分类器逐Token预测重读标签,与直接继承Whistress隐式建模不同,该设计避免深层语义主导决策。在TinyStress-15K监督评测上融合表征F1达0.959,显著高于Whistress的0.909;在Expresso零样本上F1为0.820,显著高于Whistress的0.689;在SinoStress-Real上监督与零样本F1分别为0.870与0.869,几乎无衰减。该结论目前仅验证于朗读式中英文短句,未覆盖自发对话、噪声远场与多口音外推。原文仅说明单卡RTX 3090训练,未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
350. 不重写整份信念状态,只写改了什么:增量式端到端语音对话状态跟踪
标签:#强化学习 #多模态模型 #语音 #口语意图与槽位识别
评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语意图与槽位识别 | 主方法:#强化学习
👥 作者与机构
- Tomoya Higuchi:机构信息未能从会议 PDF 纯文本可靠映射
- Michimasa Inaba:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端口语对话状态跟踪(Dialogue State Tracking,DST)需直接从用户语音和历史上下文推断结构化信念状态,难点在于语音噪声会污染状态且多轮累积误差难以消除。本文以多模态大模型Qwen2.5-Omni-7B联合生成本轮转写与符号化编辑操作,再由确定性规则将编辑作用于上一轮状态得到新状态,接着用监督微调建立格式与音频对齐,最后用组相对策略优化(Group Relative Policy Optimization,GRPO)直接优化转写与编辑质量。与每轮重生成完整状态相比,增量编辑输出更短并聚焦变化槽位,减少了误改未变槽位的风险。在SpokenWOZ预测模式评测设置下,Qwen2.5-Omni-7B增量加GRPO方法的联合目标准确率为49.20%,高于同基座全状态基线的联合目标准确率45.36%。结论适用边界受限,目前仅在单个英语口语数据集和单个7B基座上验证,严重依赖前序预测状态质量,长对话后期累积错误时优势会收窄。训练成本原文已披露,监督微调约20小时而强化学习约40小时,均使用8张NVIDIA A6000 48GB。
🔗 开源资源
- 代码相关资源:https://github.com/UEC-InabaLab/IncrementalR — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
351. 只在跨度完备时生成:预训练文本模型做流式逆规范化的读标写路线
标签:#端到端学习 #高效推理 #预训练 #流式处理 #语音识别
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#端到端学习
👥 作者与机构
- Kiet Anh Hoang:机构信息未能从会议 PDF 纯文本可靠映射
- Khanh Le:机构信息未能从会议 PDF 纯文本可靠映射
- Bao Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Linh Pham:机构信息未能从会议 PDF 纯文本可靠映射
- Dung Vo:机构信息未能从会议 PDF 纯文本可靠映射
- Thai Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Mai Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Tri Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Vu Le:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式逆文本归一化需将流式语音识别输出的口语形式实时转为带标点大小写及半符号与语音学变换的书面形式,难点在于缺失未来上下文时难以消歧且大量照抄词不容扰动。第一步由基于预训练EnViT5的块式因果编码器以动态右上下文掩码逐块读入并缓存历史隐状态,其输出直接送入联合B-I-O标注器判定变换边界。第二步读标注写策略消费标注序列,对O词直接透传输出,仅当遇到B或O确认B-I跨度完结时才将该跨度连同左文打包触发解码,连续多跨度合并一次解码以摊薄开销。第三步解码器以受限交叉注意仅关注跨度结束位置之前的前缀并经前缀截断增强学会局部终止,其生成结果经复制粘贴与键值缓存复用历史,与同时机器翻译全局重排不同,该设计利用ITN局部保序避免冗余重生成。在越南语自建 5M 测试集上流式模型书面错误率(Word Error Rate, WER)为 4.18%,相对混合流式基线 8.27% 提升约 1.98 倍并接近非流式基线 3.63%。适用边界限于越南语新闻域、块 3至5加前视 1至2、贪婪解码,罕见外来实体仍易幻觉,长跨度需等完结才输出,275M 参数端侧部署未验证。原文未披露训练时长与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
352. 只在不确定时才加码:用熵门控与字音双通道抑制热词幻觉
标签:#检索增强 #语音大模型 #语音 #语音识别
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#检索增强
👥 作者与机构
- Yong-Jie Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Yun-Fei Shao:机构信息未能从会议 PDF 纯文本可靠映射
- Wei-Qiang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向普通话热词识别的输入为声学特征序列与用户热词表,输出为包含目标实体的转写文本,难点在于子词切分导致文本匹配脆弱而拼音匹配又易引发同音误触与过偏置。该框架先经无参数对数桥接缓存解码器原始对数以估计归一化香农熵,再以熵门控与片段级动量决定是否注入偏置增益,其输出的候选加权对数直接改变束搜索路径。随后双轨字形拼音前缀树并行匹配提供正交证据,N最优重排序阶段以对比同音惩罚奖励双通道一致而惩罚纯拼音命中。与纯文本浅融合相比,该机制差异在于将偏置从全局静态加权转为高不确定区域的条件激活,并强制正字法一致性。在SeACo规定的爱壳1测试集上,完整系统相对基线在字符错误率与热词F1值上均显著改善,且在1000个干扰词下仍保持召回优势。该结论适用边界限于普通话封闭热词表与Dolphin基座,跨语言、多基座及流式场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
353. 开口前身体先表态:抢话与守话走着不同的运动时钟
英文题目:Before the Turn: Investigating Motion Cues Preceding Speech in Dyadic Interaction
标签:#Transformer #语音 #轮次切换
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#轮次切换 | 主方法:#Transformer
👥 作者与机构
- Ying-Hsuan Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Woan-Shiuan Chien:机构信息未能从会议 PDF 纯文本可靠映射
- Huan-Yu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究面对面双人对话中的轮次切换(Turn-taking)预测,输入为说话起始点前连续 3D 骨骼流,输出为保持(Hold)与转移(Shift)二分类,难点在于重叠语音与静默间隙下声学边界模糊且意图早于发声。首先基于角速度与运动多样性构造物理先验并检测阈值上起始(onset)以刻画各部位准备时序,其输出的窗口分布用于指导截断边界选择。接着将固定 3.0s 观察窗按前导时间后移并送入 Transformer 建模长程姿态依赖,从而分离早期粗大动作与晚期同步线索。与把视觉视作同步抽象流的做法不同,该链路以全身异步协商建模意图累积,用上身远期姿态与手头近期线索分治,避免长窗引入先前伴随手势污染并揭示模态特异时序层级。在 InterAct 数据集上,上身(UpperBody)在前导 1.5s 时转移 F1 达到 71.26%,显著高于语音起始点附近的基线条件,支撑了抢夺需长期积累而保持为碰撞瞬间爆发的判断。该结论仅适用于受控双人半结构化场景与离线切分边界,未验证多人、噪声、跨文化及实时流式外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Dawn2745/MCBF — 链接可访问(HTTP 200)
- 代码相关资源:https://github.com/russelsa/mm-vap — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
354. 只改那一刻、其余不动:用指令加区间实现多声混合的时间定位编辑
英文题目:Edit the Moment, Keep the Rest: Time-Localized Audio Editing via Instruction
标签:#扩散模型 #指令微调 #环境声 #音频生成
评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频生成 | 主方法:#扩散模型
👥 作者与机构
- Jinwoo Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Gihun Son:机构信息未能从会议 PDF 纯文本可靠映射
- Won-Gook Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理复调混合音频的时间定位编辑,输入为原始混合波形加自然语言指令与时间区间,输出为仅在指定区间改动的波形,难点在于同类事件多次出现时需选中特定实例并保持其余背景不变。方法链分为三步:首先在线合成三元组以构造共享背景与前景混合的输入目标对并生成含起止时间的指令,其次将参考区间与编辑区间编码为时间嵌入并经交叉注意力与时间步条件双路注入扩散变换器,最后对移动与延长任务拼接源事件掩码以显式标记待保留实例。相比仅做粗粒度增删改或依赖事件类控制信号的已有编辑器,该机制同时约束选哪个实例与改哪里,因而统一支持增加、删除、替换、移动与延长五种操作。为验证细粒度控制,作者在1000个合成混合样本上以0.1 s分段F1评测目标区间事件正确性,EMKR在增加任务目标区达到87.7%,远超SAO-Instruct的26.9%与AudioEditor的44.2%。结论仅适用于合成设定的前景背景叠加场景,对真实稠密重叠、长时混响或未见声类的外推尚未验证。原文未披露训练之外的推理与部署成本。
🔗 开源资源
- 演示资源:https://jinwoo0302.github.io/emkr-demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
355. 把分钟级对话搬进 25 Hz 隐空间:ZipL-Dialog 如何省内存而不丢可懂度
英文题目:ZipL-Dialog: Memory-Efficient Long-Form Spoken Dialog Synthesis via Latent Flow Matching
标签:#流匹配 #高效推理 #长音频处理 #零样本 #文本到语音
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Jihwan Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Nam Soo Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本对话语音合成需由带说话人与轮次标记的文本加提示音频直接生成多说话人多轮长音频,稠密帧级条件流匹配(Conditional Flow Matching,CFM)需一次性处理全长声学序列,激活存储、中间状态与注意力开销随分钟级时长激增。ZipL-Dialog 先用确定性梅尔自编码器将 100 Hz 帧级梅尔谱编码为 4 倍时间压缩的 25 Hz 连续隐序列,再在隐空间做掩码条件流匹配生成目标段隐变量,随后由隐解码器恢复梅尔谱并经神经声码器合成波形,训练联合隐速度回归与梅尔域辅助重建。与直接在帧级梅尔谱建模的 ZipVoice-Dialog 相比,关键差异是生成序列长度与声学帧率脱钩,声学细节保留转由确定性瓶颈、辅助梅尔监督与重调的 ZipFormer 层次下采样承担。在 CoVoMix2 对话测试集上,相对 ZipVoice-Dialog 最大峰值显存降低 11.22 倍,推理加速 2.23 倍,UTMOS 持平或略优。该结论限于英文长对话、单卡批量为 1 的离线单次合成与所用切分评测,客观可懂度与说话人相似度仍有损失,极端时长、流式并发与跨语言外推尚未验证。原文未披露总训练时长与部署成本。
🔗 开源资源
- 演示资源:https://speechdemos.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
356. 从场上峰值到声道目标:PyPhonPlan 如何把计划、感知与记忆算成发音
英文题目:PyPhonPlan: Simulating phonetic planning with dynamic neural fields and task dynamics
标签:#开源工具 #状态空间模型 #语音学与音系 #语音 #语音合成
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音合成 | 主方法:#状态空间模型
👥 作者与机构
- Sam Kirkham:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文针对常规任务动力学把声道变量目标设为不变常量、缺少记忆与感知耦合机制的问题,研究从意图到声道变量的连续语音规划,输入为任务提示与听觉感知分布,输出为声道变量轨迹,难点在于把高维神经肌肉协同约束到低维可控流形并保持时间动态一致。PyPhonPlan先以规划、感知与记忆三层动态神经场(Dynamic Neural Field,DNF)在参数轴上编码分布式激活,经墨西哥帽侧抑制核与S形阈值门控实现竞争稳定与跨层耦合,再由慢时间尺度记忆层积累高于阈值规划历史以偏置后续试次。接着锁存门控规划场在响应提示到达时开放建峰,峰值位置被提取为时变目标。最后临界阻尼谐振子将该目标转化为平滑声道运动,完成神经动力学到发音执行的闭环。与通用场仿真器COSIVINA及固定目标任务动力学相比,该工作把分布性手势输入与发音求解器统一在同一语音专用框架内,兼具时间原理性与神经接地性。原文未提供可核对的关键定量结果。该结论仅来自一维任意参数轴上的高度简化演示,未经真实语音数据与多说话人验证,不支持向自然交互幅度与保持时长的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/samkirkham/PyPhonPlan — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
357. 先给标签、后建质心:延迟承诺如何稳住多说话人在线跟踪
英文题目:Delayed-Commitment Online Speaker Tracking for Robust Many-Speaker Diarization
标签:#无监督学习 #在线推理 #语音 #说话人分离标注
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#无监督学习
👥 作者与机构
- Youngki Kwon:机构信息未能从会议 PDF 纯文本可靠映射
- Hee-Soo Heo:机构信息未能从会议 PDF 纯文本可靠映射
- Minjae Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Han-Gyu Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Bong-Jin Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
在线说话人日志需在音频流到达时即时输出谁在何时说话,其难点在于新说话人判决不可回退,且单次噪声嵌入易污染质心并引发虚假新类注册。所提系统先由语音活动检测切分语音段,再用一点五秒滑动窗口以零点五秒步长提取说话人嵌入,最后由延迟承诺在线说话人追踪逐嵌入标注并实时输出标签。其中追踪模块对远离已注册质心的嵌入先赋予暂定标签并存入缓冲,待累积至多个候选后取中心代表生成高质量质心,同时用随注册数线性增长的自适应阈值抑制虚假注册。与到阈即建新类的常规在线聚类不同,该方法将标签输出与质心注册解耦,使输出延迟保持零点五秒而不等待质心承诺,从而兼顾质心质量与低延迟的实际意义。在VoxConverse评测设置下,本系统的Std(Δ)指标为2.04,低于DIART的Std(Δ)指标4.14。其结论仅适用于多说话人中等重叠野外场景,未验证高重叠会议和单缓冲混入多说话人的失败边界。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/juanmc2005/diart — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
358. 缺一块频谱也要补回来:SEMamba++ 用全局、局部与周期偏置做通用语音修复
标签:#生成对抗网络 #状态空间模型 #时频分析 #语音 #语音增强
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#状态空间模型
👥 作者与机构
- Yongjoon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jung-Woo Choi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
通用语音恢复(General Speech Restoration,GSR)需从含噪声、混响、限带与削波的退化波形中同时去干扰并生成缺失的高频与大幅值语音片段,难点在于时频异质性与多类型退化对局部细节和全局谐波的不同需求。该方法先经短时傅里叶变换(Short-Time Fourier Transform,STFT)与扩张DenseNet编码得到压缩谱特征,再以多分辨率并行时频双路径(Time-Frequency Dual-Path,TFDP)块在三种频率尺度独立建模,最后经幅度与相位双解码器及可学习Softplus映射重建波形。其中频率全局局部周期(Global Local Periodic,GLP)模块以并行门控融合傅里叶分析网络全局周期分支与卷积局部分支并做通道选择。与串行Conformer或Mamba频率建模不同,并行选择与频率轴直接傅里叶展开显式适配缺带与强噪声下的局部全局权重切换。在VCTK-GSR测试集噪声条件下,SEMamba++的UTMOS为2.90,高于SEMamba的UTMOS 2.06。该结论限于16 kHz合成与半实测英语主导评测,未验证采样率无关部署、高采样率音乐与强编解码失真下的稳定性。模型参数量为2.7M且单步推理实时因子为0.021,适合资源受限推理。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
359. 把对齐留在编码器、把语言建模交给大模型:LLM-as-Joiner 的标签同步解耦
英文题目:LLM-as-Joiner: Decoupling Alignment from Language Modeling in Label-synchronous ASR
标签:#LoRA #多模态学习 #大语言模型 #多语言 #语音识别
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#多模态学习
👥 作者与机构
- Jaeyoung Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Masato Mimura:机构信息未能从会议 PDF 纯文本可靠映射
- Ryo Magoshi:机构信息未能从会议 PDF 纯文本可靠映射
- Tatsuya Kawahara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别(Automatic Speech Recognition, ASR)需将长声学帧序列转写为短文本,单调对齐与语言建模耦合在长语音前缀上会推高大语言模型(Large Language Model, LLM)上下文与学习负担,尤其在需处理声学与文本叠加长上下文时优化难度俱增。该工作先用对齐器编码器(Aligner-Encoder)把声学证据压缩为与输出等长的标注同步状态,再在LLM切分层经线性投影与门控残差注入语音并由上层完成预测,同时联合训练轻量识别头复用同一编码器以传递语言知识。相对语音做前缀的解码器方案,其机制差异在于对齐完全留在编码器自注意力中实现并避免格计算与空白符建模,LLM仅在标注位置上做融合与语言建模,从而缩短上下文并冻结复用词表与输出头。在LibriSpeech测试集上LLM头相对同规模解码器基线将词错率降至3.2%与5.6%,同时实时率从0.90降至0.65。该结论限于从零训练的Conformer-L编码器对照,未验证大规模预训练语音编码器或流式与长尾场景的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
360. 载波也是控制量:参量阵列声场分区从只调边带到交替调载波
英文题目:Carrier-Aware Sound Zone Control for Parametric Array Loudspeakers
标签:#波束成形 #多通道 #空间音频信号 #空间音频渲染
评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#波束成形
👥 作者与机构
- Mengtong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Zhuang:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Shaozhe Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xuxiang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Jia-Xin Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
参量阵列扬声器需在共享空间输出明区期望音频并抑制暗区泄漏,输入为各通道载波与边带激励,输出为可听声场明暗分布,其难点在于音频经载波边带非线性自解调产生且跨通道耦合使线性叠加失效。本文提出载波感知声区控制,将载波作为与边带并列的主动控制变量并采用有限步交替重线性化优化声对比度控制权重。第一步在全1载波背景下测量边带条件传递函数并求解声对比度控制得到边带权重,其输出作为固定边带进入载波优化。第二步固定边带测量载波条件传递函数并经共轭映射求解载波权重,第三步在新载波背景下重测边带函数完成边带重对准以适配宽带。与固定载波的边带控制相比,该机制使载波与边带声压空间乘积决定的虚拟源密度对准成为可能,从而同时提升对比度与解调效率。在500 Hz至4000 Hz白噪声宽带场景下,载波感知ACC的总声对比度指标为23.6 dB,高于边带控制的总声对比度指标12.4 dB。该结论目前仅在正面双耳点簇加后方线阵的个人音频布局与消声环境验证,混响室内与多内容多明区外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
361. 先分开再贴标签:用两级流式说话人日志降低多说话人识别的归属错误
英文题目:Improving Streaming Speaker Diarization for LLM Based Multi-talker Speech Understanding
标签:#波束成形 #流式处理 #说话人分离标注 #语音分离
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#说话人分离标注 | 主方法:#波束成形
👥 作者与机构
- Ju Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Ruizhi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ruizhe Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Pan:机构信息未能从会议 PDF 纯文本可靠映射
- Xuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zili Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Florian Metze:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
智能眼镜需从5通道空间音频中区分佩戴者近场自发语音与前方对话者远场语音,并将带说话人标记的音频送入冻结大语言模型完成转写与翻译,难点在于重叠语音、环境噪声与多款设备阵列几何差异。系统先经非线性约束最小方差波束成形将设备相关多通道信号映射为方向表示,再由编解码分离模型输出参考、自发与他发三路流,随后从分离流提取基频与均方根能量特征,经梯度提升决策树判别自发、他发与非语音标记。标记用于选择任务提示词以驱动冻结Gemma-3n 4B生成说话人归属输出,多任务学习、Conformer轻量化和多几何联合训练进一步提升鲁棒性与效率。与单阶段阈值判别相比,两阶段解耦先以神经分离解缠近远场语音,再以轻量分类器基于声学特征判别标记,缓解了均方根比阈值对噪声敏感的失效并提升远场他发鲁棒性。在意大利语到英语多说话人转写任务评测下,1-Stage MT的Other WER为12.99%,从1-Stage ST的Other WER 23.01%降至12.99%。该两阶段结论在高重叠率与三人以上对话中的泛化能力尚未验证,其适用边界受限于双人前方会话假设。该结论未覆盖高重叠率与多说话人扩展情形,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
362. 先把嘴型变成离散语义令牌,再去混合语音里捞人声
英文题目:TGTSE: Token-Guided Target Speaker Extraction with Visual Cue
标签:#多模态学习 #向量量化 #音视频 #目标说话人提取
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#多模态学习
👥 作者与机构
- Tongtao Ling:机构信息未能从会议 PDF 纯文本可靠映射
- Shulin He:机构信息未能从会议 PDF 纯文本可靠映射
- Zhong-Qiu Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频目标说话人提取以单通道混合语音 \(y\) 与同步唇动视频 \(v\) 为输入,估计目标干净语音 \(s\),难点在于视觉与声学模态异构、帧率不对齐,直接以连续唇嵌入为条件只能提供弱相关而非内容级对齐。该工作提出 TGTSE:先用冻结人脸编码器加混合频谱分支预测与 WavLM 聚类伪标签对齐的离散语义令牌 \(\\hat\{z\}\),再将令牌经可训练码本映射为连续嵌入 \(e\),最后以该嵌入为时序对齐条件驱动 TFGridNet 或 MossFormer2 类提取网络重构波形。与连续唇嵌入不同,离散令牌提供模态无关且与发音内容紧耦合的中间表示,将跨模态对齐转化为帧级分类加条件掩码估计问题。在 VoxCeleb2-2Mix 上 TGTSE(MossFormer2)取得 15.2 dB SDR 和 14.8 dB SI-SDR,相对 AV-MossFormer2 基线提升 0.3 dB;在 LRS2-2Mix 上取得 16.2 dB SDR,提升 0.2 dB;跨域在 Grid 上领先超过 2.0 dB。结论限于双人混合、16 kHz 近场合成数据与完整唇部可见条件,未验证强遮挡、多人重叠、噪声混响与实时因果场景。原文未披露训练推理成本与显著性检验。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
363. 不用帧级边界也能做双流合成:CTC 对齐加双词块如何兼顾质量与延迟
英文题目:CTC-TTS: LLM-Based Dual-Streaming Text-to-Speech with CTC Alignment
标签:#自回归模型 #CTC #流式处理 #零样本 #文本到语音
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#CTC
👥 作者与机构
- Hanwen Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Saierdaer Yusuyin:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhijian Ou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
双流文本到语音要求在文本逐词到达时同步输出语音,其难点是文本与语音的细粒度对应未知且前视过长会抬高首包延迟。CTC-TTS先用基于联结主义时间分类(Connectionist Temporal Classification,CTC)的语音识别模型求式1最大后验路径,再把空白符归并到后继音素并按帧率比例映射到神经音频编解码器(Neural Audio Codec,NAC)离散语音令牌。随后系统按词切分出当前词加分隔符加下个词的双词音素组,并拼接当前词语音与块结束符构成训练序列,解码器仅对语音部分计算自回归损失。相比固定比例交织,该结构化分块让模型只需学习局部音素群到语音的映射;相比蒙特利尔强制对齐器(Montreal Forced Aligner,MFA),神经对齐免去了多阶段流水线。在960小时LibriSpeech延续任务上长度拼接变体取得词错率4.82%并优于双词与对齐消融基线,在单说话人流式任务上特征堆叠变体取得词错率1.80%并优于LLMVox的2.40%。结论限于英语单码本编解码器与短提示零样本评测,未验证多语、噪声和长上下文外推。原文未披露训练、推理或部署成本,代码已在正文脚注开源。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
364. 用可学习的语义锚点把新事件拆成已知语义再做双向检索
英文题目:A Semantic-Anchor-based Method for Open-Vocabulary Sound Event Detection
标签:#注意力机制 #数据增强 #零样本 #音频事件检测
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#注意力机制
👥 作者与机构
- Jun Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Pengfei Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Yanfeng Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Qing Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Nan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Lirong Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
开放词汇声音事件检测以长音频为输入,以任意文本或音频描述为查询,输出多类重叠事件的帧级起止与片段级存在概率,难点在于罕见类训练不可见且文本查询与音频特征存在模态失配。该方法先用对比语言音频预训练编码器将文本或音频查询映射为事件查询向量,再将其与可学习语义锚点拼接并经掩蔽自注意力解释为锚点组合,随后由双向交叉注意力实现查询到音频与音频到查询的互检索并经上下文网络时序建模,最后与分类器向量点积得到帧级预测。与仅算查询特征相似度的双流范式不同,语义锚点提供稳定语义参照,双向交互同时增强事件相关音频特征,因而缓解跨模态失配。在AudioSet-Strong开放词汇设置下,DASM音频查询条件的PSDSr指标为32.7,高于文本查询条件的PSDSr指标23.3。跨数据集泛化亦得益于该稳定参照,使模型在未见声学域中仍能解释新事件。该结论限于强标注英文事件与十类家用场景,细粒度重叠、长尾声学变体与实时约束尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
365. 边听边说不断线:用韵律边界标记把流式文本语音合成的上下文锁住
英文题目:Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input
标签:#弱监督学习 #高效推理 #韵律 #流式处理 #文本到语音
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#弱监督学习
👥 作者与机构
- Changsong Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Tianrui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Ye Ni:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhou Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
增量文本输入的流式文本到语音需在文本未到齐时即时发声,输出为连续语音流,难点是缺失未来文本导致韵律不自然与无界历史引发语义漂移和崩溃。先进行弱对齐边界训练,输入为完整文本语音对与WhisperX词级时间戳,职责是在随机词边界后插入markerboundary并按对齐音频位置截断语音目标,输出为学会见标记即停的语言模型。再进行带前视的块内规划,输入为当前块文本、2词未来前视与边界标记拼接序列,职责是利用有限未来上下文规划韵律并生成当前块文本语音词元,其输出的文本与语音直接作为下一步提示素材。最后进行滑动窗口延续与合成,输入为以上一块生成文本语音尾部替换提示后的新块序列,职责是以有界O(k+f)键值缓存延续生成并经流式声码器增量合成,输出为无缝拼接的波形。相对交织基线与朴素滑动窗口基线,该机制以显式边界标记加有限前视替代无界交织或仅依赖历史,在有界上下文中兼顾韵律与稳定。在Seed-TTS-Eval标准集评测下,Boundary-Aware方法的WER为4.03%,低于Sliding-Window基线的WER 6.03%。适用边界为英文朗读型短句与扩写独白,未验证真实对话增量到达、多语言、多基座与自适应边界,原文未披露训练与部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
366. 在固定伴奏时长里换歌词:用时长占比重分配守住旋律与总时长
英文题目:MeloDISinger: Melody-Aware & Duration-Preserving Singing Voice Editing with Audio Infilling
标签:#流匹配 #Transformer #音乐 #语音编辑
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编辑 | 主方法:#流匹配
👥 作者与机构
- Yoonjeong Park:机构信息未能从会议 PDF 纯文本可靠映射
- Jaekwon Im:机构信息未能从会议 PDF 纯文本可靠映射
- Juhan Nam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本驱动歌唱语音编辑(Singing Voice Editing,SVE)的输入是原始音频加原始与编辑后歌词,输出是只重写编辑区而严格保留总时长与非编辑区的歌唱音频,难点是编辑后音素必须贴合原旋律节奏并与伴奏保持同步。所提MeloDISinger先由特征抽取与歌词比对定位音素级编辑掩码,再由旋律感知时长比预测器(Melody-aware Duration Ratio Predictor,MeloDRP)在固定时长预算内按跨注意力融合音素与伪MIDI重分配时长,接着由音高预测器(FPIP)与流匹配声码器以音频补全方式只生成掩码区梅尔频谱并与原频谱拼接。相比隐式时长建模与复用原时长的显式方法,该链条以跨度内Softmax硬约束保总时长,以伪MIDI时序重叠监督学软音素音符对应。在6种编辑设置下,音节失配替换的词错误率由Vevo2的40.89%降至28.74%,时长偏差保持0.00秒量级(残差约0.004秒,源于跳长)。结论目前仅在英文独唱与WhisperX对齐可靠场景验证,多歌手音色泛化与伴奏强偏离仍未验证。原文未披露训练硬件、训练总步数与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
367. 不用看脸也能建声纹库:VieSpeaker 以文本元数据推理说话人身份
英文题目:VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency
标签:#数据集 #数据集构建 #语音 #说话人验证
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#说话人验证 | 主方法:#数据集构建
👥 作者与机构
- Viet Hoang Pham:机构信息未能从会议 PDF 纯文本可靠映射
- Tran Trung Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Bao Thu Ho:机构信息未能从会议 PDF 纯文本可靠映射
- Phuong Tuan Dat:机构信息未能从会议 PDF 纯文本可靠映射
- Trang Thu Thi Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
越南语说话人验证(Speaker Verification,SV)输入为无约束环境下任意时长语音,输出为说话人嵌入与是否同人的判定,难点是跨会话信道差异大而本土大规模标注数据稀缺严重制约泛化。所提管线先用说话人分离标注(Diarization)切分同质语音段并赋予视频内局部标识,再用大语言模型(Large Language Model,LLM)对标题、频道名、简介与采样转录做证据约束的身份推理并仅在显式证据下命名,随后做跨视频姓名规范化与嵌入聚类合并,最后用四分位距清洗离群发音。与依赖人脸检测跟踪的 VoxCeleb 与 VoxVietnam 路线不同,该机制以文本证据链替代视觉共现,从而纳入不可见说话人并省去图像采集成本。在 Vietnam-Celeb-H 上 VieSpeaker 预训练再微调取得等错误率(Equal Error Rate,EER)6.74%,优于 VoxCeleb2 预训练的 6.91%,方向为越低越好。该结论限于访谈、娱乐、播客三类 YouTube 域与 ECAPA-TDNN 单架构验证,未证明对其他语言或强噪声电话场景的外推有效性。原文未披露训练时长与推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
368. 看不见攻击时靠谁分流:用双路选通把波形瑕疵和语义异常分给轻量专家
英文题目:Domain-Adaptive Dual-Gating Mixture of Experts for Generalizable Speech Deepfake Detection
标签:#混合专家模型 #鲁棒性 #语音 #语音伪造检测
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#混合专家模型
👥 作者与机构
- Siqing Qin:机构信息未能从会议 PDF 纯文本可靠映射
- Zhe Li:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Man-Wai Mak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造检测(Speech Deepfake Detection,SDD)输入为待验语音波形,输出为真实或伪造二分类判决,难点在于训练未见的合成算法、声学环境与编解码器会显著偏移特征分布。第一步由波形门控分支负责低层伪影感知,对原始波形施加可学习截止频率的Sinc带通滤波器组,再经一维卷积与全局平均池化得到波形嵌入。第二步由SSL特征分支负责高层不一致建模,对XLSR中间序列施加深度可分离Sinc滤波与残差网络,再经注意力池化得到SSL嵌入。第三步由原型引导路由与仿射专家负责自适应精炼,将两路嵌入拼接投影得内容logits、将SSL嵌入与可学习域原型做余弦相似得原型logits,两者经可学习系数与温度融合后Softmax得路由权重,再以Top-k选择BN专家对SSL序列做缩放平移,精炼特征送AASIST分类。与通用前馈门控MoE不同,该门控显式参数化频带与时序滤波,并用原型锚定隐式伪造模式以实现无域标签路由。在ASVspoof 2019 LA(19LA)训练、ASVspoof 2021 DF(21DF)、In-the-Wild(ITW)、Fake-or-Real(FoR)评测下,相对XLSR-AASIST基线等错误率(Equal Error Rate,EER)从3.69%/10.46%/7.47%降至2.54%/6.35%/4.42%,ADD 2023 R1/R2从27.74%/21.93%降至23.85%/21.61%。该结论未验证强压缩、真实电话信道与最新扩散声码器下的稳定性,原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
369. 问法一换就信以为真:音频大模型为何跳过查证直接幻听
英文题目:Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
标签:#基准测试 #基准设计 #音频大模型 #对抗鲁棒性 #音频问答
评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#基准设计
👥 作者与机构
- Ashish Seth:机构信息未能从会议 PDF 纯文本可靠映射
- Sonal Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Ramaneswaran Selvakuma:机构信息未能从会议 PDF 纯文本可靠映射
- Nishit Anand:机构信息未能从会议 PDF 纯文本可靠映射
- Utkarsh Tyagi:机构信息未能从会议 PDF 纯文本可靠映射
- Prem Seetharaman:机构信息未能从会议 PDF 纯文本可靠映射
- Ramani Duraiswami:机构信息未能从会议 PDF 纯文本可靠映射
- Dinesh Manocha:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型(Large Audio Language Models,简称LALMs)输入为环境与音乐音频加自然语言问题,输出为基于音频证据的回答,难点在于模型常跳过存在性验证而直接沿用语言先验编造细节。该工作先用Gemini 3 Pro做字幕一致性过滤保留8K音频与字幕对,再为每段生成2个对抗性与2个随机反事实声音,接着据此构造显式存在问与预设存在的隐式问,最后将合成口语误导句与原音频拼接形成音频侧攻击。相对只问是否存在的已有幻觉评测,其机制差异在于同时检验查询结构预设与声学虚假线索,并以直接偏好优化(Direct Preference Optimization,简称DPO)做后对齐。在AHA-Eval基准下,Audio Flamingo 3音频侧随机显式攻击的攻击成功率指标为53.40%,从文本侧攻击的攻击成功率指标1.90%升至53.40%。结论仅适用于短片段环境与音乐问答的幻觉拒绝能力,未验证长音频、多轮对话与真实录音误导的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
370. 跨语言说话人确认为何总被语言带偏:用两路低秩适配把身份和语言分开压
英文题目:Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification
标签:#对抗训练 #LoRA #跨语言 #说话人验证
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#LoRA
👥 作者与机构
- Qituan Shangguan:机构信息未能从会议 PDF 纯文本可靠映射
- Junhao Du:机构信息未能从会议 PDF 纯文本可靠映射
- Kunyang Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Feng Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xinsheng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言说话人验证(Speaker Verification)的输入是注册与测试两段可能语言不同的语音,输出是是否同一说话人的判定,难点在于不同语言的音素库存与韵律习惯造成高类内方差,且语言线索易被误作身份依据。方法链分三步:先冻结预训练主干并全局注入说话人与语言两套并行低秩适配分支,分别抽取说话人嵌入与语言嵌入,实现参数空间上的任务因子化解耦;再将两路嵌入送入同一多层感知判别器(Discriminator),语言路直接做语言分类以锚定真实语言决策面,说话人路经梯度反转层(Gradient Reversal Layer)回传对抗梯度以剥离语言成分;最后按三阶段课程先建语言边界再保守引入对抗最后加强解耦,推理时丢弃语言分支与判别器并合并说话人增量。与标准盲对抗的关键差异在于判别器被显式语言表示 grounding,回传梯度指向真实语言线索而非偶然相关特征。在TidyVoice开发集上,w2v-BERT2骨干的最佳单系统将总体等误率(Equal Error Rate)降至0.91%,同人跨语言对异人同语言的最难试次由官方基线的5.19%降至1.62%。最终三模型分数融合系统在tv26 eval-A与tv26 eval-U上取得2.43%与2.84%,相对基线9.06%与11.59%下降超70%并列第3名,但该结果依赖内部大规模多语言预训练与融合校准。结论目前仅在该基准划分下验证,对极低资源语言与强口音偏移的外推尚未证明,原文未披露训练推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
371. 同一句话不同语气看到不同脸:把韵律单独送进扩散模型的尝试
英文题目:Say That Again: Visualizing Paralinguistic Cues with Prosody-Aware Diffusion
标签:#扩散模型 #韵律 #语音 #语音情感识别
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#扩散模型
👥 作者与机构
- Shyamji Tiwari:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为文本相同但韵律不同的语音,输出为反映语调情绪的图像,难点在于把音高、语速等副语言线索从词汇内容、说话人身份与环境声中分离并可控注入生成。方法分为三步:先用 ESResNeXt 提取通用音频嵌入 ha,同时用 2 层多层感知机将基频轮廓、能量包络、音节速率与频谱特征映射为韵律嵌入 hp,拼接投影得到语音嵌入;再以 ProsodyCLIP 做语音-图像-文本对比对齐;最后经解耦交叉注意力把韵律嵌入独立注入冻结的文本分支之外。与整体音频向量直接条件化相比,独立韵律通路保留文本先验并以系数 alpha 调节情绪强度。蒸馏U-Net基于Stable Diffusion 2.1并插入多尺度融合块,仅训练投影层与韵律交叉注意力权重以保留文本先验。在RAVDESS基准下,NovaDiffusion的情绪分类准确率ECA为71.3%,高于SonicDiffusion的情绪分类准确率ECA 48.2%。该结论仅适用于面部表情可判读的情绪相关韵律,对无人物场景情绪与精细韵律连续控制尚未验证。适配器训练约需 4 卡 A100 共约 80 GPU 小时,4 步 OLSS 调度在 Jetson Orin 上约 2.1 秒。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
372. 对齐到文本长度还不够:TASTE-S 如何把离线对齐改成可流式编码解码
标签:#CTC #向量量化 #流式处理 #语音 #语音编码
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#CTC
👥 作者与机构
- Liang-Hsuan Tseng:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向文本语音联合口语语言建模中语音单元远长于文本词元的模态失配,原文提出可流式文本对齐分词器TASTE-S,输入为原始语音波形,输出为与文本等长的文本词元、文本对齐语音嵌入及重建波形。编码器先由语音编码器抽取多层隐状态并经内置连接主义时间分类解码即时得到文本,再由聚合器融合浅层与深层语音特征与文本生成对齐嵌入并经有限标量量化离散化。解码器将文本对齐词元与目标语音单元按固定比例交错输入自回归单元解码器,再经因果流匹配声码器逐块合成波形,两阶段训练先用真实文本暖机并绕过量化再联合适配识别误差。在LibriSpeech test-clean上内置CTC版本词错率4.1%、说话人相似度0.88、时长一致性0.901,与原TASTE相当或更好,编码实时率从0.117降至0.002,解码实时率从0.414降至0.076,长语音首块延迟从12.29秒降至0.311秒。该结论仅适用于英语朗读语音重建与客观指标,尚未验证噪声对话与大语言模型联合建模下的语义收益。原文未披露推理之外部署成本,训练为2张NVIDIA H100约1天。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
373. FoleyGenEx:用注入与掩码统一多模态控制、对齐与副词精度
标签:#数据增强 #扩散模型 #多模态学习 #音视频 #视频到声音生成
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#视频到声音生成 | 主方法:#扩散模型
👥 作者与机构
- Shiyao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xijuan Zeng:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shiwan Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Feng Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Chen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
视频到声音生成需以视频为条件合成时间同步且语义一致的高质量音频,难点在于跨模态时间对齐、多模态条件控制与细粒度语义精度难以兼得。FoleyGenEx以多模态扩散Transformer为骨干,先经DAC-VAE、CLIP与Synchformer分别编码音频潜变量、文本语义与视频语义同步特征。条件潜变量经输入嵌入层注入并与初始噪声求和融合,音频视觉同步流施加一致同步掩码与掩码区均方误差以解耦语义与同步,随后由单模态扩散Transformer经流匹配去噪生成波形潜变量。相对MultiFoley的上采样拼接与MMAudio缺乏参考音频分支,该通道拼接加残差求和与同步掩码设计保留了时序精度并显著扩展了风格迁移与音频编辑控制能力。在VGGSound测试集视频到声音生成任务下,FoleyGenEx的FDVGG指标为0.74,低于MMAudio的FDVGG指标0.97。其适用边界受限于8秒片段与特定数据集划分,副词泛化与长时一致性尚未验证。训练成本为在8张A100硬件上基座训练300000步约三天,含副词增强数据时扩展至330000步。
🔗 开源资源
- 演示资源:https://foleygenex.github.io/FoleyGenEx → https://foleygenex.github.io/FoleyGenEx/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/hkchengrex/MMAudio — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/open-mmlab/FoleyCrafter — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/ariesssxu/vta-ldm — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/hkchengrex/av-benchmark — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/resemble-ai/Resemblyzer — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
374. 从粗节奏到对齐潜变量:GACA-DiT 如何同时解决节奏粗糙与时间错位
标签:#注意力机制 #扩散模型 #流匹配 #多模态学习 #音乐生成
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音乐生成 | 主方法:#扩散模型
👥 作者与机构
- Jinting Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Li Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
舞蹈到音乐生成(Dance-to-Music Generation,D2M)以舞蹈视频与人体姿态序列为输入,生成5秒、44.1kHz波形音乐,要求节拍一致与帧级时间对齐。已有全局运动特征方法节奏隐式粗糙,一阶差分二值节奏对噪声敏感且跨风格鲁棒性差,另有特征编码下采样导致节奏嵌入长度为\(T\)而音乐隐变量长度为\(T\_m\)的时间错位。该文提出GACA-DiT,先由流派自适应节奏提取(Genre-Adaptive Rhythm Extraction,GARE)从姿态帧间位移幅度计算多尺度Gabor小波时域能量与多尺度运动方向相位直方图空域分布,经关节自适应加权与时间注意力融合为逐帧节奏嵌入\(R \\in \\mathbb\{R\}^\{T \\times D\}\),再由上下文感知时间对齐(Context-Aware Temporal Alignment,CATA)将\(R\)均匀切分为\(T\_m\)段并以可学习上下文查询做段内注意力池化得到\(\\tilde\{R\} \\in \\mathbb\{R\}^\{T\_m \\times D\}\),最后将\(\\tilde\{R\}\)与I3D语义视频特征\(V\)共同条件注入8层扩散Transformer以条件流匹配生成音乐隐变量并经DiffRhythm预训练VAE解码为波形。在AIST++评测基准下,GACA-DiT的BCS指标为98.13,高于MotionComposer的BCS指标95.84。该结论仅在AIST++与TikTok舞蹈剪辑上验证,未覆盖长时、多人遮挡与非编舞日常动作,原文未披露训练硬件、训练耗时与推理延迟。其适用边界受限于短时单人编舞剪辑,长时多人遮挡与日常动作场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://anonymous.4open.science/w/GACA-DiT/ — 链接不可用(HTTP 400) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
375. 重音能跨语言跨情绪迁移吗:多语言多情绪感知标注下的泛化边界
英文题目:Do Speech Emphasis Models Generalize across Languages and Emotions?
标签:#数据集 #基准设计 #韵律 #跨语言 #语音属性识别
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#基准设计
👥 作者与机构
- Megan Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Deepali Aneja:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaqi Su:机构信息未能从会议 PDF 纯文本可靠映射
- Yunyun Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haonan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zeyu Jin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音重音检测需从连续语音映射到词级突出度,难点在于韵律实现随语言类型、声调系统与情感唤醒度漂移,单一语言中性朗读训练难以覆盖变异。作者先以内部表现力语音库为底,用大语言模型辅助生成剧本与表演指导并由母语演员演绎,构建覆盖7宏语言、10地域变体与34类情感风格的万条MMEE语料;继而对原始录音做降噪、Qwen3-ASR词级对齐切分与多阶段清洗,其输出进入Prolific母语者三级感知标注并聚合为二值与连续标量目标。随后以EmphaClass微调XLS-R做帧级分类与标量回归、以WhiStress冻结Whisper并增设解码器分类头,在单语、跨语、混合多语与高低唤醒交叉等六种划分下统一评测。与合成处方标签或英语朗读范式不同,该工作以人类分级感知与情感风格覆盖检验表征可迁移性,强调感知韵律结构的跨范式共享。在跨数据集评测设置下,MMEE英语训练的EmphaClass的二值准确率为0.886,高于反向迁移的二值准确率0.798。结论在罗曼与日耳曼语族内较稳而向汉语声调语言大幅衰减,其适用边界受限于专有原始语料与情感均衡之外的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
376. 自然不等于合适:五个使用场景重新标定 TTS 评价
标签:#主观评测 #模型评估 #语音 #文本到语音
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#文本到语音 | 主方法:#主观评测
👥 作者与机构
- Dominika Woszczyk:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Triantafyllopoulos:机构信息未能从会议 PDF 纯文本可靠映射
- Jura Miniota:机构信息未能从会议 PDF 纯文本可靠映射
- Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为同一文本在不同下游用途下的合成语音,输出是对人类相似度与领域恰当性的双维感知评分,难点在于一对多的韵律实现与听者期望随场景漂移。方法链分4步:先按朗读、情感对话、动画角色、自发会话与AI助手5类用途精选30句文本与真值音频,再用5个风格迥异的SOTA系统合成全矩阵刺激,接着通过Prolific上150名母语者的拉丁方听测收集双维度5级评分,最后将评分与韵律声学特征及UTMOSv2、DNSMOS、AudioBox等自动指标做句子级Spearman相关。与已有自然度基准相比,关键差异是将评价锚定为是否适合特定角色而非是否像人,从而揭示助手域人类相似度与恰当性呈负相关。在句子级恰当性相关的评测条件下,助手场景的UTMOS相关为0.33,高于演员场景的UTMOS相关-0.59*。结论仅适用于英语女性音色孤立句评测,未验证多轮对话、男性与老年音色及社会身份偏置的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/domiwk/domain-aware-tts-eval — 链接可访问(HTTP 200)
- 演示资源:https://researcht81.github.io/unconvincing-human → https://researcht81.github.io/unconvincing-human/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
377. 块内早已到齐却不敢看:BACON 用分组卷积放宽因果约束
英文题目:BACON: Boundary-Aware Convolution for Streaming Conformer Models
标签:#CNN #流式处理 #语音 #语音识别 #语音翻译
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#CNN
👥 作者与机构
- Hainan Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Kunal Dhawan:机构信息未能从会议 PDF 纯文本可靠映射
- Dongji Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Jagadeesh Balam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式语音需在不窥视未来组块的前提下增量输出转写或翻译,现有组块注意力(Chunked Attention)已允许块内双向,但深度卷积仍沿用逐帧因果,块内已到达的右侧帧被人为丢弃。首先将深度卷积通道均分为因果组与边界感知双向组,因果组仅在句首补零其余位置自由跨块取全量历史,双向组左向同样跨块而右向截断于当前组块边界。接着两组按各自填充规则并行做深度卷积,前者输出稳定边界处的历史表示,后者输出块内可用的右侧上下文表示。最后将两组输出在同一卷积模块内拼接送入后续结构,核尺寸为\(k\)时聚合有效感受野为\(\[\-&\#40;k\-1&\#41;,&\#40;k\-1&\#41;/2\]\),宽于因果基线的\(\[\-&\#40;k\-1&\#41;,0\]\)且参数量不变,相对全双向变体保留了边界稳定器。在LibriSpeech测试集test-other的流式评测设置下,CHAT架构中BACON的WER为7.68%,低于因果基线的WER 8.47%。该适用边界受限于固定组块与换能器验证范围,且平均发射组块指数显示延迟未增加。结论目前仅在固定组块、9核FastConformer-Large与换能器架构下验证,对变组块长度与流式语音大模型的推广尚未检验,原文未披露训练推理成本与开源实现。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
378. 小模型做流式日语识别:缓存感知与数据筛选如何互相牵制
英文题目:A Compact Fully-Open Cache-Aware Streaming Model for Japanese ASR
标签:#Conformer #数据集构建 #流式处理 #语音识别
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#语音识别 | 主方法:#Conformer
👥 作者与机构
- Yinchang Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
日语流式识别需要在增量输入与有界右视下输出文字,而现有系统或不开放训练链路,或仅支持离线全句解码,且电视域大语料与讲座会话域严重失配。该工作先以parakeet-0.6b-ja教师模型对ReazonSpeech v2电视语料做基于字符错误率(Character Error Rate,CER)分层筛选,再用缓存感知多上下文训练统一多延迟编码,随后在五域混合语料上渐进微调,使单模型兼容离线与流式解码。与已有开放权重系统相比,其机制差异在于用有界右视缓存替代全句注意力,并以换能器与连接时序分类(Connectionist Temporal Classification,CTC)双解码器协同稳定编码表示。在5个日语测试集贪婪解码下,循环神经网络换能器(Recurrent Neural Network Transducer,RNNT)路径平均CER为12.4%,优于1.01B开放基线OWSM-CTC v4的13.5%和0.62B ReazonSpeech NeMo-v2的14.1%,但落后于0.6B parakeet-0.6b-ja的10.0%。结论仅适用于所覆盖的朗读、众包、讲座与会议域,对未覆盖口音与强噪声的外推尚未验证。完整链路在4卡RTX 6000 Ada工作站上约消耗800 GPU小时,流式下仍保持446倍逆实时系数。
🔗 开源资源
- 第三方资源:https://huggingface.co/ouktlab/espnet — 链接不可用(HTTP 401)
- 第三方资源:https://github.com/NVIDIA/NeMo → https://github.com/NVIDIA-NeMo/Speech — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
379. 在压缩谱里保住瞬态、在宽带上对齐谐波:STSR 的谱-瞬态折中
英文题目:STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling
标签:#注意力机制 #生成对抗网络 #零样本 #语音 #语音超分
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音超分 | 主方法:#注意力机制
👥 作者与机构
- Jiajun Yuan:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaochen Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yulin Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Chenhao Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Xueyang Lv:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音超分辨率需从带限低分辨率音频重建至48 kHz宽带语音,难点在于同时维持全局谐波连贯与局部瞬态锐度,而修正离散余弦变换系数重尾分布迫使模型做反双曲正弦压缩,压缩又会平滑弱瞬态能量。STSR先将上采样至48 kHz的低分辨率波形经MDCT与反双曲正弦压缩得到可逆紧凑谱图,再以四阶段分层窗口注意力U-Net学习高频残差,经逆压缩与逆MDCT恢复波形。时域多周期判别器与多尺度判别器约束周期连贯性,高频段多带判别器仅在缺失频带施加对抗压力,稀疏感知损失按基真能量软掩膜分离信号保真与背景抑制。与纯时域建模和局部卷积MDCT生成器相比,跨窗口注意力显式关联低频基频与远端高次谐波,高频聚焦判别避免扰动已知低频基频。在VCTK测试集四种带宽平均评测下,STSR的LSD指标为0.79,低于FLowHigh的LSD指标0.81。该结论限于英语干净朗读语音及受控低通退化,对噪声混响、音乐、其他语言及真实历史录音的外推尚未验证。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
- 演示资源:https://stsr-speech-demo.vercel.app/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
380. 严格误报下不聚类未知类:只拉紧目标词、用间隔推开难冒充者
标签:#对比学习 #鲁棒性 #严格因果 #流式处理 #关键词检测
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#对比学习
👥 作者与机构
- Hanwen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Guosong Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式关键词检测(Streaming Keyword Spotting,SKS)须在连续音频中满足每小时0.5次以下误报的同时保持检出率,难点是因果轻量模型在交叉熵训练下缺乏表示间隔,被迫抬高阈值后对音近冒名者严重漏检。先进行离线难负挖掘,以训练音频窗为输入,用指数滑动平均模型按目标后验排序筛选前五千非目标窗并定期刷新队列,输出边界混淆候选集供后两步使用。再执行目标受限类内拉拢,以候选集中的同关键词嵌入为输入,仅压缩相同目标词类内方差形成紧致目标簇,输出的锚点直接送入排斥步骤,而异质未知类不参与聚类以避免流形畸变。最后施加间隔感知硬负排斥,以目标锚点与难负对为输入,仅在余弦相似超过安全间隔时加权惩罚并与交叉熵联合作为离线辅助目标训练,训练后整体移除,这区别于全局对比聚类与均匀角间隔的无差别约束。在Google Speech Commands V2连续流评测协议下,MACR在0.2 FA/h处的FRR错误率为14.80%,低于标准CE基线的FRR错误率29.85%。结论仅适用于英文10目标词严格误报流式设定,未验证自定义唤醒词、多语种与远场混响外推。该结论适用边界受限于英文闭集流式场景,跨语种与远场外推尚未验证。部署保持因果零前视与同等计算图,训练增加对比分支与挖掘队列开销但推理零附加参数、乘加与延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
381. 重叠帧算了两遍:HALO 把主干内部帧率减半再复原
英文题目:HALO: Half-Frame-Rate Adaptive Learnable Operator for Lightweight STFT-Based Speech Enhancement
标签:#CNN #高效推理 #严格因果 #语音增强
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#CNN
👥 作者与机构
- Jiadong Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Dahan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Leyan Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaobin Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Shiruo Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxiang Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强输入为含噪短时傅里叶变换复谱,输出为增强复谱经逆变换重建的波形,实际难点在于50%及以上重叠导致相邻帧高度相关却仍需逐帧处理,造成时序冗余与计算浪费。半帧率自适应可学习算子先以降采样算子将相邻两帧在各频点拼接,并以局部时频特征条件化的动态卷积混合权重自适应融合为半帧率特征。融合后的缩短序列交由原增强主干估计半速率掩蔽或映射,再由上采样算子从每帧半速率输出恢复原始网格上的两帧全速率谱,形成降采样压缩、主干处理与上采样恢复的方法链。该设计不改动STFT/逆STFT流程且仅依赖当前与前一帧,保持因果性与算法时延不变,与直接丢帧或改跳长窗口做法形成机制差异。在DNS3测试集上,GTCRN接入HALO并加宽通道后PESQ从2.101提升至2.198,SI-SNR从11.39 dB提升至11.90 dB,ESTOI从0.754提升至0.769,方向均为越高越好。该结论适用边界受限于单通道合成DNS3条件与轻量主干验证,在大容量主干、真实远场混响与高重叠优化架构上的增益尚未验证,峰值单步计算未降低亦构成失败条件。原文以每秒乘加运算为推理成本口径但未披露训练时长与硬件开销。
🔗 开源资源
- 第三方资源:https://github.com/dddaniel-z/HALO — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
382. 文本测得准不等于开口能用:口语指令如何拉低语音大模型的成绩
英文题目:Do What I Say: A Spoken Prompt Dataset for Instruction-Following
标签:#数据集 #数据集构建 #多语言 #语音 #口语理解
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#口语理解 | 主方法:#数据集构建
👥 作者与机构
- Maike Züfle:机构信息未能从会议 PDF 纯文本可靠映射
- Sara Papi:机构信息未能从会议 PDF 纯文本可靠映射
- Fabian Retkowski:机构信息未能从会议 PDF 纯文本可靠映射
- Szymon Mazurek:机构信息未能从会议 PDF 纯文本可靠映射
- Marek Kasztelnik:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Waibel:机构信息未能从会议 PDF 纯文本可靠映射
- Luisa Bentivogli:机构信息未能从会议 PDF 纯文本可靠映射
- Jan Niehues:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音大语言模型需在真实口语交互中理解多风格、多语言指令并执行转写、翻译、问答、摘要与合成等任务,难点在于文本提示评估掩盖了口语变体、录音条件与跨语言泛化的失效。作者构建DoWhatISay的链条为先由各任务专家撰写2条英文基础提示并按正式、非正式、详细、简短四种风格各改写2条形成每任务10条,再由母语者翻译本地化为德、英、意、捷、西、法、匈、荷、葡、俄、瑞共11种语言形成990条独特文本提示,最后由19名说话人用手机或笔记本电脑模拟对AI下指令录制并经响度语音活动检测裁剪成总计3小时17分钟的并行语音文本对。该设计与已有工作的关键机制差异在于指令与任务音频来自不同说话人且与下游基准解耦,配接时再组合而非预拼接合成指令,可复用于任意数据集。在FLEURS与MCIF等基准上以Qwen2.5-Omni评估,自动语音识别词错误率文本提示为12.60%,口语提示升至17.08%,机器翻译CometKiwi从81.41降至70.97,证实文本评估系统性高估。该结论在文本输出任务上稳定成立,在语音输出任务上差距消失或反转,且低资源语言与非正式、简短风格下退化更重。该结论适用边界受限于仅在Qwen与Phi两模型上验证,语音输出与跨设备噪声下的外推仍属尚未验证范围。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
383. 长语音越转越错:用三种坏音频做减法压住 Whisper 幻觉
英文题目:Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding
标签:#对比学习 #高效推理 #长音频处理 #语音 #语音识别
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#对比学习
👥 作者与机构
- Hoseong Ahn:机构信息未能从会议 PDF 纯文本可靠映射
- Jeongyun Chae:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonji Park:机构信息未能从会议 PDF 纯文本可靠映射
- Kyuhong Shim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
长语音识别将长录音切分为30秒段并以前一段转写为上下文逐段解码,静音幻觉、重复循环与内容遗漏会在上下文传递中被放大。Whisper-CD冻结Whisper参数,仅在推理时干预:对同一音频段并行计算一路干净对数几率与三路扰动负对数几率,再用带温度的对数求和指数聚合多负信号并按对比公式修正每步词分布,最后贪婪生成。三路负信号分别为10 dB高斯噪声注入、全零静音输入、左移7秒时序偏移,分别对应清晰度下降、先验幻觉与对齐错位。在5个英语长语音基准上,Large-v3-Turbo在CORAAL上词错率从38.75%降至14.43%,下降24.32个百分点;在Earnings22上从33.25%降至16.16%。该方法保留上下文传递与时间戳能力,兼容波束搜索与词级约束。局限是仅在Whisper Large-v3与Large-v3-Turbo上验证,最优对比强度随数据集漂移,对已陷入深度循环的大解码器纠正不彻底,且每步需4路解码器并行,尽管生成变短可部分抵消开销。其适用边界目前受限于英语长语音验证,额外负路径带来的推理开销可被生成变短部分抵消。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
384. 幻觉不在解码器里开始:在编码器表示中检测并转向 Whisper 的非语音幻觉
标签:#自监督学习 #可解释性 #环境声 #语音 #语音识别
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Georgii Aparin:机构信息未能从会议 PDF 纯文本可靠映射
- Vadim Popov:机构信息未能从会议 PDF 纯文本可靠映射
- Tasnima Sadekova:机构信息未能从会议 PDF 纯文本可靠映射
- Assel Yermekova:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
Whisper在静音、噪声与音乐等非语音输入上仍输出流畅但无关的转写,基于平均对数概率与无语音概率阈值的过滤因高置信幻觉而失效。该工作从Whisper音频编码器残差流抽取经时序平均池化的层表示,先用逻辑回归验证幻觉可线性分离且判别力向深层增强。再以FULL非语音训练集估计非幻觉均值减幻觉均值的对比向量与SAE隐维度重要性,推理时对选定层残差流做激活加性平移,或对权重绝对值选出的少量SAE维度做校准加性偏移并经SAE解码器重构回注。与直接平移稠密激活相比,仅干预稀疏子集保留了其余编码表征,因而在抑制幻觉的同时更好地维持英语识别质量。在FULL非语音测试集下,SAE转向的Whisper large-v3的HR指标为27.33%,低于基线Whisper large-v3的HR指标86.88%。结论限于 LibriSpeech、FLEURS 英中文、AISHELL-1 语音侧监控与所列环境声非语音集,音乐与人声重叠过滤口径外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
385. 交叉熵教发音,感知奖励教好听:给语音增强语言模型补上后训练
英文题目:Post-Training Speech Enhancement Language Models with Perceptual Rewards
标签:#自回归模型 #强化学习 #后训练 #语音 #语音增强
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#强化学习
👥 作者与机构
- Frédéric Berdoȥ:机构信息未能从会议 PDF 纯文本可靠映射
- Luca A. Lanzendöerfer:机构信息未能从会议 PDF 纯文本可靠映射
- Antonis Asonitis:机构信息未能从会议 PDF 纯文本可靠映射
- Roger Wattenhofer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从含噪混响受损输入恢复可懂自然的干净语音,自回归语言模型仅以词元级交叉熵训练,与感知的DNSMOS、字错率与UTMOS评价目标错位,难以直接优化不可微感知质量。本文沿用公开UniSE与GenSE监督微调权重作为策略起点,对每个噪声输入采样4条完整增强序列并解码为波形,使序列级奖励可直接打分。随后以DNSMOS加1减字错率加UTMOS等权复合奖励评分并做组内归一化优势,再用序列似然比裁剪的组序列策略优化更新策略且无需评论家网络,补齐预训练微调强化学习链条。相对依赖学习代理或离线偏好对的单指标优化,该多指标在线奖励同时约束感知质量、可懂度与自然度,训练成本表现为单卡硬件上复合奖励训练需22小时,从机制上抑制刷分式奖励黑客行为。人评消融显示复合奖励更受偏好,而单用DNSMOS奖励会劣于基线,印证多奖励鲁棒性。在DNS2020盲测含混响合成条件下,GenSE加后训练的OVRL得分为3.53,高于基线GenSE的OVRL得分3.16。但单张RTX 6000上复合奖励需22小时训练,且结论限于16 kHz英语去噪去混响,未验证流式、带宽扩展与跨语言外推。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
386. 在压缩语音的隐空间里一次生成对抗扰动:DAC 隐变量攻击如何兼顾成功率与实时性
英文题目:Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks
标签:#生成模型 #对抗鲁棒性 #实时处理 #音频分类 #说话人验证
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#生成模型
👥 作者与机构
- Sameek Bhattacharya:机构信息未能从会议 PDF 纯文本可靠映射
- Bharath Krishnamurthy:机构信息未能从会议 PDF 纯文本可靠映射
- Ajita Rattani:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向音频分类与说话人验证的实时对抗威胁,输入为原始波形,输出为误导冻结受害模型的目标类别波形,难点在于投影梯度下降与Carlini-Wagner类迭代波形优化延迟过高,而已有单次生成方法仍在高维波形空间优化且伪影明显。该方法先将原始波形输入冻结DAC编码器映射为压缩连续隐变量以获得低维声学流形,输出的原始隐变量直接送入可训练条件生成器,再将原始隐变量与目标类别嵌入或目标说话人嵌入共同输入生成器单次前向合成限幅隐扰动并叠加得到扰动隐变量,其输出经冻结DAC解码器重建为对抗波形,最后将重建波形输入可微短时傅里叶变换加梅尔滤波器组加对数压缩特征链送入冻结受害模型计算对抗与嵌入间隔损失并反传优化生成器。与直接波形优化不同,其在压缩声学流形中施加小位移即可引发语义级决策翻转,兼顾速度与重建保真。在LibriSpeech说话人验证任务评测设置下,本方法的目标攻击成功率指标为99.80%,高于FGSM的目标攻击成功率指标2.06%。该结论限于白盒、可微特征链与闭集目标条件,未验证黑盒迁移、物理信道回放与人类听感。原文未披露优化器、学习率、损失权重与训练耗时,仅给出推理延迟与加速比。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
387. 话语相同而帮助不同:语音大模型中的口音与性别交织差距
英文题目:The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs
标签:#众包评测 #模型评估 #公平性 #语音 #语音对话系统
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音对话系统 | 主方法:#众包评测
👥 作者与机构
- Shree Harsha Bokkahalli Satish:机构信息未能从会议 PDF 纯文本可靠映射
- Christoph Minixhofer:机构信息未能从会议 PDF 纯文本可靠映射
- Maria Teleki:机构信息未能从会议 PDF 纯文本可靠映射
- James Caverlee:机构信息未能从会议 PDF 纯文本可靠映射
- Ondřej Klejch:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Bell:机构信息未能从会议 PDF 纯文本可靠映射
- Gustav Eje Henter:机构信息未能从会议 PDF 纯文本可靠映射
- Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为相同文本问题但带有不同口音与感知性别的语音,输出为语音大模型(Speech Large Language Model,SpeechLLM)的单轮文本回答,难点在于开放式回答质量差异隐蔽且易与识别错误混淆。方法链分为三步:先用语音克隆合成语言内容恒定而声音身份系统变化的提示语音,再将提示输入三个端到端语音模型生成回答并做转写与自然度核查以排除可懂度混杂,最后用大模型裁判(LLM-as-a-judge)点评与成对比较加最优最差缩放(Best-Worst Scaling,BWS)排序并以人类 BWS 验证趋势。相对多项选择代理偏差测试,该设计直接度量真实交互中的帮助性与假定能力差异,并揭示礼貌外衣下的实质稀释。在口音识别任务下,整体模型的准确率为19.4%,高于随机猜测基线的准确率16.7%。结论仅适用于所测6种英语口音与二元性别呈现及合成语音条件,无法外推至自然对话、自发口音变异或更多身份维度。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
388. 不用百万条身份数据:用一次真实参考锚定音画身份的伪造检测
英文题目:Referee: Reference-aware Audiovisual Deepfake Detection
标签:#多模态学习 #跨语言 #音视频 #音频深度伪造检测 #说话人验证
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#多模态学习
👥 作者与机构
- Hyemin Boo:机构信息未能从会议 PDF 纯文本可靠映射
- Eunsang Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jiyoung Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为待判目标音视频与同一说话人的单段真实参考音视频,输出为真伪二分类及辅助身份一致性判定,难点在于未知伪造下唇同步线索易被遮挡、低分辨率抹除且难以泛化到新操纵。该方法先用基于 Synchformer 预训练的视听编码器将目标与参考切分为 0.64 秒重叠片段并拼接为视听联合序列,再经权重共享的身份瓶颈模块以可学习身份查询交叉注意力压缩出跨模态身份令牌,随后由身份匹配模块以目标查询参考做交叉注意力对齐得到参考感知表示。最后将类别令牌、参考感知令牌与原始目标特征拼接送入视听 Transformer 联合推理同步异常与身份违背,并以伪造分类交叉熵损失与身份匹配二元交叉熵损失相加联合优化。与仅做目标内部同步或视觉单模态身份对比的方法不同,其将伪造视为相对参考的身份外点而非像素异常。在 FakeAVCeleb 训练后零样本测试 KoDF 音频驱动子集上达到 99.41% AUC 和 99.47% AP,显著高于同期视听基线。该结论仅在参考与目标同身份、参考为真实且训练评估参考不重叠条件下成立,参考错配缺失与强压缩传输下的退化尚未验证。原文未披露训练推理成本与阈值校准。
🔗 开源资源
- 第三方资源:https://github.com/black-forest-labs/flux — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/deepfakes/faceswap — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
389. 语音模型听得懂却想不清:用同分布滚动与 token 级教师打分补齐跨模态能力
英文题目:X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs
标签:#知识蒸馏 #多模态学习 #语音大模型 #语音 #音频理解
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频理解 | 主方法:#知识蒸馏
👥 作者与机构
- Di Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Dongjie Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Hai Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Siqi Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Xu Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Jin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端语音大模型直接以语音指令为输入生成文本推理与答复,但连续声学表征与离散文本逻辑空间错位,导致复杂指令遵循与推理能力存在差距,标准监督微调与强化学习难以完全迁移文本端高质量数据。跨模态同策略蒸馏先构建语义不变的语音文本平行提示对,再让学生在双模态下自主多采样 rollout以覆盖自身分布,接着由冻结文本教师给出token级对数概率作为参考分布,最后以策略梯度联合优化模态内与跨模态两项优势。与依赖静态教师轨迹的离线蒸馏不同,该机制在学生探索轨迹上按KL差异动态分配信用,从而缓解暴露偏差并摆脱对真值答案标注的依赖。在BIG Bench Audio、Audio Multi-Challenge与Voice Bench三项基准任务下,X-OPD的平均语音下降指标为3.43%,低于Qwen3-Omni-A3B-Instruct的平均语音下降指标11.29%。该框架同时收窄文本端差距并在MMAR上保留原有通用推理能力,体现双目标的协同而非折中。其结论限于英文合成朗读指令与三项问答推理基准,尚未验证真实噪声、多口音、情感韵律与多轮长程记忆的外推。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
390. 冻结表示里能线性读出多少空间:SARL 用受控仿真拆解声源与房间编码
英文题目:Probing Spatial Structure in Pretrained Audio Representations
标签:#基准测试 #基准设计 #空间音频信号 #声源定位
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#声源定位 | 主方法:#基准设计
👥 作者与机构
- Chuyang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Sivan Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Adrian S. Roman:机构信息未能从会议 PDF 纯文本可靠映射
- Juan P. Bello:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理预训练多通道音频表示中空间结构不清的问题,输入为立体声、双耳和一阶Ambisonics渲染的单声源场景,输出为声源级因子与房间级因子的线性可解性判断,难点在于端到端评测将表示质量与下游结构纠缠而难以分离。方法链分三步:可控场景合成负责独立采样声源与房间因子并跨格式匹配渲染,输出房间与声源互不重叠且分布均衡的训练验证测试场景;冻结编码加线性探测负责将帧级嵌入均值池化后训练轻量分类回归器,输出各因子的解码分数;几何敏感度分析负责以前两步的冻结表示为输入,固定其他属性仅扰动一组因子并计算余弦偏移,输出与探测分数互补的几何响应。与HEAR、SUPERB等多通道任务型基准相比,关键差异是以冻结表示加轻量探针替代任务精度,并用AudibleLight保真定位线索、用PyRoomAcoustics独立控制房间参数,从而实现架构无关的表示质量隔离比较。在SARL基准协议下,方位角任务的指标离散区间数为36,高于俯仰角任务的指标离散区间数12。结论适用边界限于单声源合成场景与线性可解信息,未验证真实录音、多声源及非线性探测下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
391. 小参数如何靠词典读准多音字:G2PO 的轻量与开放词汇设计
英文题目:G2PO: A Lightweight Lexicon-enhanced Framework for Open-Vocabulary Mandarin Polyphone Disambiguation
标签:#检索增强 #高效推理 #零样本 #语音合成
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#检索增强
👥 作者与机构
- Feifan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chunhui Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Liming Song:机构信息未能从会议 PDF 纯文本可靠映射
- Hongjun Kil:机构信息未能从会议 PDF 纯文本可靠映射
- YoonChoon Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Junkwang Oh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向中文语音合成前端的多音字消歧,输入为包含目标多音字的中文句子,输出为该字在当前上下文中的拼音标签,难点在于读音随上下文变化且封闭分类器无法输出训练未见的字音配对。所提g2PO先用RoBERTa-tiny编码器输出字符级隐状态,再由词典融合模块用Trie枚举含目标字的子串并与外部发音词典匹配,经混合池化动态构造上下文相关的词表示。词表示与拼音嵌入拼接后做缩放点积注意力融合,得到增强字符表示与按拼音聚合的词典先验,同时以单隐层多层感知机辅助预测词性标签并拼接其嵌入,最后由音素预测器输出对数几率,经词典先验与合法拼音掩码加权的Softmax约束为合法读音。与依赖稠密词向量和百兆级BERT的方法不同,该机制无需存储词向量且将词典候选直接作为输出先验,从而支持未见读音。在CPP测试集下,g2pO的准确率为99.15%,高于g2pW的准确率99.08%。结论仅在新闻类短句基准与词典覆盖的普通话多音字范围内验证,长尾专名与跨领域口语尚未验证,适用边界受限于词典覆盖与领域分布。训练成本为在单块NVIDIA A100硬件上以批量256训练40000步,推理开销的延迟与吞吐原文未给出实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
392. 同一套符号读多种方言:以国际音标统一输入再用专家分流保住口音
标签:#混合专家模型 #语音学与音系 #低资源 #文本到语音
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#混合专家模型
👥 作者与机构
- Ziqi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Gongyu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yihua Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zihao Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Wei-Qiang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
方言语音合成需由文本生成对应方言发音的语音,难点在于同字异读、标注稀缺且多方言联合训练易相互干扰。该工作先以统一国际音标前端将多方言拼音与汉字映射到共享音素空间,再用F5-TTS骨干联合训练普通话与多方言,随后在文本嵌入后接入方言混合专家以分离方言表征,最后对新方言冻结主干只调适配器并用语音识别反馈做强化优化。相对字符或拼音直输与稠密共享编码,共享音素加稀疏路由在保留跨方言共享声学能力的同时显式保留方言特异性。消融显示去掉混合专家会同时恶化自然度与错误率,而以拼音替代国际音标会导致错误率灾难性恶化,从而证实两组件缺一不可。在成都话子集上,流匹配组相对策略优化(Flow-GRPO)在Qwen3-ASR评测下将WER从29.25%降至23.93%,优于继续训练的29.15%。其适用边界受限于中文多方言及京白云白等有限低资源戏曲变体,南闽话与云白等远离普通话的变体构成明确失败条件,跨语种泛化与大规模商用效果尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/rany2/edge-tts — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
393. 四音节叠词里的弱强节拍:越南语时长重音与音步的证据
英文题目:Rhythmic Patterning in Vietnamese: The Case of Quadrisyllabic Reduplicative Words
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Phuong Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
越南语是否存在词重音及音节之上的韵律层级长期未决,本研究输入为嵌入三类载体句的四音节重叠词朗读语音,输出为音节位置、形态中心语与载体句对时长、强度比和基频的影响判定,难点在于声调、元音与语调边界易掩盖真正的节奏不对称。方法链由三步构成:先构造4个首部居首与4个首部居尾的真实重叠词并控制辅音、元音与声调,再将目标词置于前后音节数为1+1、2+1、1+2的三类载体句中采集8名南方话者朗读,然后提取音节时长、韵部强度比与韵部五点平均基频并以位置、中心语、载体句为固定效应建模推断。相对仅考察双音节词或二至六音节假词的已有工作,本文以真实长词控制音系相似性从而分离形态中心语效应与纯韵律切分效应,其发现的二、四音节拉长支持双音节扬格足的存在。原文未提供可核对的关键定量结果。该结论仅适用于受控朗读下的南方话重叠词,未验证自发语、北方与中部方言及非重叠多音节词的外推性。该适用边界意味着自发语与跨方言推广仍受限且尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
394. 说了什么话不该决定真假:用教师对抗与瓶颈去掉语言捷径
标签:#对抗训练 #知识蒸馏 #正则化 #语音 #语音伪造检测
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#对抗训练
👥 作者与机构
- Anh-Tuan DAO:机构信息未能从会议 PDF 纯文本可靠映射
- Driss Matrouf:机构信息未能从会议 PDF 纯文本可靠映射
- Mickael Rouvier:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Evans:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频深度伪造检测需从原始波形输出真伪二分类,难点在于ASVspoof 5训练集中真伪话语内容错配会显著诱发模型依赖说什么而非如何合成的顽固捷径。方法分两阶段:先在Common Voice英语子集上训练短语语言内容分类教师,使其嵌入显式编码文本信息并冻结;再训练学生,共享XLS-R编码器并分叉为伪造分类头与语言头,语言头经梯度反转层迫使编码器遗忘语言线索,并在语言分支键表示上施加变分信息瓶颈,以KL散度约束被抑制信息容量,只压制主导语言成分并保留鉴伪声学证据。在9个英语域外库的混合池化评测中,IVLing-VIB池化等错误率为8.72%,相对MHFA基线的13.67%下降约36.2%,相对仅对抗的IVLing的9.56%再下降约8.8%。代价是ASVspoof 5域内从顶级系统的约3.30%退化至5.26%。结论仅适用于英语跨库泛化且依赖教师纯度,若教师嵌入混入通道或说话人信息则不变性目标失准。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
395. 不把残差量化层加起来:用三维网格保留从粗到细的分离线索
英文题目:Improving Audio Codec-based Speech Separation By Stacking Residual Vector Quantization Layers
标签:#RNN #向量量化 #高效推理 #语音 #语音分离
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#RNN
👥 作者与机构
- Nhu Minh Phuong Dinh:机构信息未能从会议 PDF 纯文本可靠映射
- Roland Hartanto:机构信息未能从会议 PDF 纯文本可靠映射
- Koichi Shinoda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音分离需从双人混合波形中恢复各说话人信号,波形模型直接处理长序列导致计算贵、内存随音频变长快速增长。神经音频编解码器压缩域分离可降低序列长度,但在启用残差向量量化(Residual Vector Quantization,RVQ)时把各层输出求和,坍缩粗到细声学层级。所提残差网格(RVQ-Grid)先用冻结编码器加量化器得到每层量化向量并按层数、维度、帧数堆叠为三维网格,再经二维卷积投影到隐空间。接着交替用双向长短期记忆网络沿码本轴建模跨层依赖、沿时间轴建模上下文,以保留并利用完整层级信息,区别于把多层坍缩为单一嵌入再分离的已有方法。最后经掩码头产生双说话人掩码并与原网格相乘,在码本轴求和后送冻结解码器重建波形。在WSJ0-2Mix测试集上,EnCodec版本尺度不变信噪失真比提升(Scale-Invariant Signal-to-Distortion Ratio improvement,SI-SDRi)为8.6 dB,相对Codecformer(DAC)的5.0 dB提升3.6 dB,词错误率(Word Error Rate,WER)从30.5%降至8.6%,与同编解码器直通的SepFormer的8.9%相当。该结论仅在8 kHz双人干净混合、冻结DAC和EnCodec条件下验证,未验证噪声、混响、长时真实会议与多语泛化。分离器乘加操作数相对SepFormer降低约6倍,长音频内存增长更平缓。
🔗 开源资源
- 演示资源:https://phuongdnm.github.io/rvqgrid → https://phuongdnm.github.io/rvqgrid/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
396. 先懂话再压缩:LitCodec 把 ASR 监督放在量化之前做单码本流式编码
英文题目:LitCodec: ASR-Guided Streaming Speech Coding with Unified Quantization
标签:#向量量化 #严格因果 #流式处理 #语音 #语音编码
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Son Dang Dinh:机构信息未能从会议 PDF 纯文本可靠映射
- Nguyen Thi Minh Anh:机构信息未能从会议 PDF 纯文本可靠映射
- Nhat Tran Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Huyen Ngo Thi Thu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
实时语音交互要求编码器将输入波形压缩为低码率离散序列并逐帧输出,同时在重建自然度与语言内容可懂度上都不塌陷,而现有波形编码在低码率丢失音素细节,语义编码又依赖非因果或双分支结构。LitCodec先用短时傅里叶变换与因果Conformer编码器将波形映射为帧级隐表示,再以可拆卸文本解码器在量化前施加CTC语义约束使其携带语言结构,随后经有限标量量化压缩为单流离散序列,最后由镜像因果解码器与判别器恢复波形。与双分支蒸馏的本质差异在于监督直接塑造瓶颈前表示而非事后融合语义,避免了多码本同步与非因果依赖,使单次流式解码即可兼顾声学与语义,降低了下游语言模型集成复杂度。在LibriSpeech test-clean评测设置下,LitCodec-V2的WER为3.1%,低于EnCodec的WER 29.0%。该结论目前仅限于英语干净朗读的客观指标,尚未验证噪声、自发、多语与主观听感。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
397. 高分成员推断多半是数据集走音:先做盲基线再谈大音频模型记住了什么
英文题目:Membership Inference Attacks against Large Audio Language Models
标签:#评测协议 #音频大模型 #隐私保护 #音频理解
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频理解 | 主方法:#评测协议
👥 作者与机构
- Jia-Kai Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Yu-Xiang Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向大型音频语言模型的样本级成员泄露审计,输入为音频与对应文本,输出为成员性分数,难点在于声学录制条件与划分标准差异极易伪装成记忆。方法链分三阶段推进:多模态盲基线先用元数据、文本与声学特征训练逻辑回归以量化数据伪影,其筛选结果决定后续审计可用的干净数据集;双阶段生成先令模型自回归解码再以自生成文本重跑前向,从而在无真实训练转写时仍能获得词元概率;成员推理审计将困惑度、熵与Min-k%等约30维指标拼接后做分层交叉验证分类,而模态解耦则以静音、噪声与合成音频替换原始音频以检验绑定来源。与已有文本与视觉成员推理不同,该框架把盲基线相关性诊断作为前置关卡而非事后补充,具有方法论层面的警示意义。在SPGISpeech评测设置下,AF3聚合攻击的AUC指标为51.9,高于MF聚合攻击的AUC指标50.7。结论仅适用于所测Audio-Flamingo 3与Music-Flamingo及8个公开划分,跨闭源模型与多轮次训练的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
398. 在村口和卫生站把话听清:DISPLACE-M 如何为一线健康对话建基准
英文题目:Benchmarking Speech Systems for Frontline Health Conversations: The DISPLACE-M Challenge
标签:#医疗音频 #基准设计 #语音识别 #说话人分离标注
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#说话人分离标注 | 主方法:#基准设计
👥 作者与机构
- Dhanya E:机构信息未能从会议 PDF 纯文本可靠映射
- Ankita Meena:机构信息未能从会议 PDF 纯文本可靠映射
- Manas Nanivadekar:机构信息未能从会议 PDF 纯文本可靠映射
- Noumida A:机构信息未能从会议 PDF 纯文本可靠映射
- Victor Azad:机构信息未能从会议 PDF 纯文本可靠映射
- Ashwini Nagaraj Shenoy:机构信息未能从会议 PDF 纯文本可靠映射
- Pratik Roy Chowdhuri:机构信息未能从会议 PDF 纯文本可靠映射
- Shobhit Banga:机构信息未能从会议 PDF 纯文本可靠映射
- Vanshika Chhabra:机构信息未能从会议 PDF 纯文本可靠映射
- Chitralekha Bhati:机构信息未能从会议 PDF 纯文本可靠映射
- Shareef babu Kalluri:机构信息未能从会议 PDF 纯文本可靠映射
- Srikanth Raj Chetupalli:机构信息未能从会议 PDF 纯文本可靠映射
- Deepu Vijayasenan:机构信息未能从会议 PDF 纯文本可靠映射
- Sriram Ganapathy:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该基准输入为手机远场麦克风采集的非医师卫生工作者(NPHW,含ASHA与Anganwadi Sevikas)与求医者双人印地语对话,输出覆盖说话人边界、带时间戳逐说话人转写、主题词与临床摘要,难点在于自然混响、重叠、自发碎片化描述与印地语对印度英语及Haryanvi、Bhojpuri、Magahi方言的代码混合。处理链先用神经分离标注切分说话人边界,再将时间戳片段送入多语言识别模型得到逐说话人转写,最后由大语言模型基于转写文本抽取主题并生成摘要。相对会议与医院英文语料,该设计把目标从干净结构化问诊转向田野目标导向对话,强调端到端可用性与可复现排行榜。原文采集约55小时,摘要称释放40小时开发集与15小时盲测集,正文明确Track-1/2用25小时开发与10小时盲测、Track-3/4另设约15小时子集含10小时开发与5小时盲测。在Track-2评测任务下,T1的tcpWER为18.63%,低于微调IndicConformer基线的tcpWER 20.23%。摘要与主题仍高度不可靠,最优ROUGE-L仅0.44与0.21量级,闭源大模型亦难生成临床准确总结,外推至印地语之外语言与更长多方对话尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://huggingface.co/jiviai/audioX-north-v1 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
399. 没有成对导演指令时,如何让 TTS 学会相对改法并保住音色
英文题目:Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction
标签:#数据增强 #大语言模型 #语音 #文本到语音
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#数据增强
👥 作者与机构
- Kenichi Fujita:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Ijima:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
方向跟随语音合成(Direction-Following TTS)以文本、参考语音和自然语言表演方向为输入,要求保持说话人身份与语言内容的同时按相对修改重读同一脚本,难点是缺乏配对三元组训练数据。本文先用印象可控零样本语音合成(Zero-Shot TTS)对同一说话人同一参考合成无调制基线与有调制语音构成伪语音对,经说话人一致性与语速过滤并用印象估计器得到 13 维印象差,再以大语言模型(Large Language Model)生成导演式方向文本,形成伪三元组用于训练方向条件风格精炼器。与绝对风格提示的文本到语音(Text-to-Speech)不同,该精炼器冻结骨干合成模型,在语音嵌入空间学习从参考嵌入指向目标偏移的方向条件随机向量场。主观评测中全量组合(Full)在未见说话人上说话人相似度平均意见分(SMOS)为 3.22,方向对齐平均意见分(AlignMOS)为 3.32,而纯录音条件 SMOS 仅为 2.63、AlignMOS 为 3.48,表明伪数据提升鲁棒性而真人数据增强表现力。在未见说话人主观评测条件下,Full的SMOS分数为3.22±0.07,高于Recorded的SMOS分数2.63±0.08。该结论适用边界受限于日语语料、固定骨干模型与有限导演方向集合,在开放方向与跨语言外推上尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://ntt-hilab-gensp.github.io/IS2026pseudo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
400. 跨语言失语还是跨语言混淆:ORBIT 用对抗与双几何压住语言线索
标签:#对抗训练 #多模态学习 #跨语言 #零样本 #病理语音评估
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#多模态学习
👥 作者与机构
- Girish:机构信息未能从会议 PDF 纯文本可靠映射
- Mohd Mujtaba Akhtar:机构信息未能从会议 PDF 纯文本可靠映射
- Farhan Sheth:机构信息未能从会议 PDF 纯文本可靠映射
- Muskaan Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Juliana Gerard:机构信息未能从会议 PDF 纯文本可靠映射
- Paula McClean:机构信息未能从会议 PDF 纯文本可靠映射
- Kongfatt Wong-Lin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本跨语言语音阿尔茨海默病检测的输入是未见语言的自发语音及其转写文本,输出为阿尔茨海默病与健康对照的二分类标签。实际难点在于语言身份与录音任务差异极易淹没细微的认知受损信号,因而必须学习语言不变的损伤线索而非语言相关伪影。所提ORBIT先以注意力池化与双向交叉注意力将多语言语音与文本预训练模型嵌入对齐融合成统一向量,再经梯度反转层在融合层与几何层抑制语言判别信息以得到语言不变融合表示。随后把该融合表示分别投影到球面流形与庞加莱双曲球并以测地距离做原型分类与一致性聚类,最后以乘积专家投票输出临床决策。与单模态及简单拼接相比,该设计以显式语言不变约束加互补几何归纳偏置替代隐式迁移,在留一语言(leave-one-language-out,LOLO)下mHuBERT加Qwen-3-Embeddings达到准确率86.98%与宏F1 85.29%,明显高于同类拼接基线。结论仅在英语、汉语、西班牙语、希腊语四库的二分类图片描述与朗读混合协议内验证,未覆盖严重程度分级、自发对话与真实临床部署中的信道和转写噪声。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://github.com/THUsatlab/AD2021 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
401. 不重合成整句,只换必须换的帧:声学令牌混合同时匿名说话人与命名实体
英文题目:Acoustic token admixture for joint speaker and content anonymization
标签:#模型融合 #向量量化 #隐私保护 #说话人匿名化 #语音编辑
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#模型融合
👥 作者与机构
- Ali Golmakani:机构信息未能从会议 PDF 纯文本可靠映射
- Seyed Ahmad Hosseini:机构信息未能从会议 PDF 纯文本可靠映射
- Omar Manil Bendali:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Vincent:机构信息未能从会议 PDF 纯文本可靠映射
- Brij Mohan Lal Srivastava:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为医疗、法律和企业电话等敏感域语音,需同时抑制生物特征声纹与语言层命名实体和文体指纹,输出为保留域内韵律和可用性的匿名语音。流程先由冻结的 Whisper large-v2 编码器加 8 级残差向量量化得到编码器 token 流,同时将转写经 Transphone 音素转换与联结时序分类强制对齐映射为 64 维发音特征,再由 220M 参数 T5 自回归解码为音素派生 token 流。两流在帧级按混合比 \(\\beta\) 随机选择并经余弦相似度门控 \(\\tau=0\.6\) 过滤错位帧,命名实体识别触发的敏感跨段则强制覆盖为替换实体 token。融合 token 重构向量连同变换基频与 192 维 ECAPA-TDNN 伪说话人嵌入送入 BigVGAN 声码器合成,仅编辑必要帧而保留上下文。与整句重合成相比,该机制在统一合成栈内实现细粒度编辑并降低子系统指纹风险。在 VoicePrivacy 2024 评测中主要工作点 \(\\beta=0\.7\) 达到等错误率 42.54% 与词错误率 3.73%,距挑战最优 0.69 个百分点且可用性损失较小。结论仅在英文朗读语音和 PERSON 与 LOCATION 短实体替换上验证,长篇自发语音、释义级文体匿名与情感保留尚未解决。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
402. 不用离散语音 token:一个模型同时做识别与流匹配合成
英文题目:UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
标签:#自回归模型 #流匹配 #大语言模型 #语音识别 #文本到语音
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Wenhao Guan:机构信息未能从会议 PDF 纯文本可靠映射
- Zhikang Niu:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyue Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Kaidi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Peijie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Qingyang Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Lin Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理同一连续语音主干下的双向任务,输入为语音或文本,输出为对应的文本转写或梅尔频谱图波形,难点在于自回归识别需要因果约束而高质量合成需要双向上下文与细粒度声学建模。方法链分为三步,首先由 Whisper-large-v3-turbo 编码器与适配器将语音映射到大语言模型 SmolLM2-360M 隐空间以做因果转写,其次将合成重构为文本前缀引导的语音填补任务并以最优传输条件流匹配学习速度场,最后用双注意力掩码按任务切换因果与双向模式以共享参数。与离散 token 统一方案的关键差异在于全程保留连续声学细节,避免量化损失并兼顾推理稳定性与生成保真度。在 LibriSpeech-PC 零样本合成上 UniVoice 词错率为 4.06%,相对 OpusLM-7B 的 4.60%下降约 12%,相对纯合成变体 UniVoice-TTS 的 4.66%下降约 13%,在 LibriSpeech test-clean/test-other 识别上为 3.0%/6.3%,接近小规模专用模型但落后于 Whisper-large 系列。结论边界在于仅在英文朗读语音 LibriHeavy 50K 小时上验证,未覆盖噪声、多语、对话与长时韵律外推,且去除了 AdaLN-zero 等说话人适配机制。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
403. 改词不改调:无标注旋律引导的歌声重唱如何同时保住歌词与旋律
标签:#基准测试 #课程学习 #扩散模型 #强化学习 #歌唱生成
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#歌唱生成 | 主方法:#扩散模型
👥 作者与机构
- Chunbo Hao:机构信息未能从会议 PDF 纯文本可靠映射
- Junjie Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Guobin Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Yuepeng Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Huakang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Wenjie Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Gongyu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zihao Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
歌唱语音编辑需在保留原曲旋律与节奏的同时按改写歌词重新合成人声,难点在于歌唱数据稀少且咬字变异大,旋律忠实与歌词忠实常互相冲突,传统方案依赖人工音素级对齐而难以扩展。YingMusic-Singer 以音色参考、旋律参考歌声与改写歌词为输入,先经变分自编码器与旋律提取器得到可比帧率的声学隐变量与旋律表征,再与句子级对齐的国际音标嵌入拼接送入基于流匹配的 Transformer 去噪主干做条件补全,最后用群组相对策略优化对多奖励联合微调以兼顾两类忠实度。相比 Vevo2 的自回归加解耦表征路线,该模型用插值后的连续旋律隐变量加中心核对齐损失实现更紧的旋律约束,并用统一音标与扰动防止语义泄漏。在 LyricEditBench 中文部分替换任务的旋律控制设置下,模型音素错误率为 0.0192,显著低于 Vevo2 的 0.1378,F0 相关系数达 0.9364,验证了双重忠实度的同步提升。该结论限于 2秒至15秒的中短片段与中英文歌曲改写,对长曲结构、极端戏腔及跨语种翻译的鲁棒性尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
404. 既要听对词又要认对人:ZP-KWS 用文本无关声纹给零样本关键词上锁
标签:#模型融合 #零样本 #语音 #关键词检测 #说话人验证
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#模型融合
👥 作者与机构
- Ming-Hsiang Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Kuan-Tang Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Chien-Chun Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-Shin Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Berlin Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向用户自定义关键词检测(User-Defined Keyword Spotting,UD-KWS)需要同时处理未见关键词与未见说话人的双重零样本输入,输出是否为目标说话人说出的目标关键词,难点在于亚秒级语音的说话人嵌入方差大且语义分支易压制说话人线索。所提零样本个性化框架(Zero-shot Personalized KWS,ZP-KWS)先用广义端到端(Generalized End-to-End,GE2E)在关键词片段上微调紧凑说话人编码器以稳定短时嵌入,再用帧级音素监督强化可训练音频流的语音结构,随后文本与音频经自注意力对齐并由判别器输出关键词概率。与共享编码器加权求和的已有做法不同,该工作在推理期将关键词概率与说话人概率相乘实现严格与逻辑,任一分支均可一票否决并支持三种工作模式无重训切换。在LibriPhrase Easy基准TO-KWS任务条件下,ZP-KWS的错误率指标FRR@1% FAR为29.47%,低于PK-MTL的错误率指标FRR@1% FAR 72.79%。结论仅在英语短关键词与单句注册条件下验证,强噪声、远场与多说话人重叠下的外推尚未验证。该工作在单块NVIDIA RTX 5090硬件上训练,整体参数量约1.55M,推理开销仅为每次查询一次余弦相似度计算与标量相乘,注册嵌入可一次性缓存。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
405. 算力不动、容量翻倍:TF-MoE 用时间-频率双路稀疏专家做语音分离
英文题目:TF-MoE: Time-Frequency Mixture-of-Experts for Efficient Speech Separation
标签:#混合专家模型 #高效推理 #语音 #语音分离
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#混合专家模型
👥 作者与机构
- Qinzhe Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Chenda Li:机构信息未能从会议 PDF 纯文本可靠映射
- Wangyou Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Shujie Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Yanmin Qian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道语音分离输入为单路混合语音的复谱、输出为各说话人干净波形,实际难点在于参数不足千万的紧凑模型仍需数十至数百吉乘加运算,且重叠语音的时变状态与宽频异质谱模式难以用同一稠密参数兼顾。TF-MoE先将混合复谱按梅尔刻度切分为八十个子带并投影为深层时频特征,再交替使用时间维与频率维卷积增强Transformer块分别建模帧间依赖与子带结构。随后掩码解码模块以上一步输出的时频表征估计复数掩码并重构目标波形,形成子带切分到双维建模再到掩码重构的递进链条。与稠密前馈相比,关键机制差异是将两类Conformer中的前馈网络替换为稀疏混合专家前馈,对整帧或整个子带均值池化后只路由至单个最优专家并共享给序列内全部标记,以几乎不变的计算量实现专家数倍的参数扩容。在Libri2Mix评测设置下,TF-MoE(E=12)的SDR为17.7 dB,高于TF-MoE(E=6)的SDR 17.2 dB。该结论目前仅在双人干净混合上成立,未验证噪声、混响、三人及以上与多语泛化。该方法的适用边界受限于双人干净混合条件,三人以上与带噪混响场景尚未验证。推理成本为 4.1 GMACs/s 与 0.47 实时因子,训练耗时与硬件原文未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
406. 宁可空着也不瞎猜:用占位符与可靠性分数重塑语音识别
英文题目:RAS: a Reliability Oriented Metric for Automatic Speech Recognition
标签:#评测协议 #强化学习 #主观评测 #鲁棒性 #语音识别
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Wenbin Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhang Qiu:机构信息未能从会议 PDF 纯文本可靠映射
- Bohan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yiwei Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Hankun Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可靠语音识别的输入是噪声与含混语音,输出是完整转写文本,难点是模型在声学证据不足时仍强行解码而产生流畅却误导的幻觉,现有词错率只计对错而无法奖励诚实的不确定表达。本文先以可变长对齐的加权编辑距离定义可靠性感知得分RAS,用占位符对齐零或多个参考词来区分有用词与误导性错误。接着以听辨偏好实验标定弃权代价系数使权衡符合人类可靠性判断,再用真值引导的占位符替换构造监督数据让Whisper学会输出占位符。最后以组相对策略优化直接优化RAS为奖励,使监督得到的弃权能力进入强化学习微调。与强制转写和事后置信度阈值相比,该机制把弃权建模为一对多的低代价对齐,使下游把缺失与幻觉分开处理。在LibriSpeech test-clean评测设置下,Base+PH-Supv+RL的RAS得分为0.8811,高于Base+PH-Supv的RAS得分0.8696。该结论限于英文朗读与中英代码切换、仿真噪声与 Tiny 规模模型,未验证大模型、自发对话与真实远场噪声。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
407. 不靠包络检波器:WaveNorm 在时域直接学出随时间变化的增益
标签:#端到端学习 #高效推理 #严格因果 #实时处理 #语音增强
评分:6.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#端到端学习
👥 作者与机构
- Deepika Ijjada:机构信息未能从会议 PDF 纯文本可靠映射
- Charan Kumar Reddy B:机构信息未能从会议 PDF 纯文本可靠映射
- Ashwini Hanaganti:机构信息未能从会议 PDF 纯文本可靠映射
- Priyanka Devrao Jadhav:机构信息未能从会议 PDF 纯文本可靠映射
- Varsha Uppalanchi:机构信息未能从会议 PDF 纯文本可靠映射
- Balaji Padmanaban:机构信息未能从会议 PDF 纯文本可靠映射
- Nivedita Chennupati:机构信息未能从会议 PDF 纯文本可靠映射
- Karunakar Reddy Pucchakayala:机构信息未能从会议 PDF 纯文本可靠映射
- Harish Rajamani:机构信息未能从会议 PDF 纯文本可靠映射
- Naveen Ambati:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为含时变衰减\(\\alpha&\#40;t&\#41;\)与背景噪声\(n&\#40;t&\#41;\)的单通道麦克风波形\(x&\#40;t&\#41;=\\alpha&\#40;t&\#41;c&\#40;t&\#41;\+n&\#40;t&\#41;\),输出为响度归一化的同采样率波形,难点在于远近场电平剧烈变化、瞬态与非平稳噪声下保持稳定增益而不产生削波、抽吸与噪声放大。先由编码器接收原始波形并用三个扩张分组一维卷积提取多尺度包络特征,输出解耦绝对电平且保留相位的紧凑潜表示,再将该潜表示送入门控循环单元瓶颈结合响度历史做时序积分,输出平滑时序一致的增益控制表示以抑制抽吸,最后将该控制表示送入解码器并用三个对称扩张分组转置卷积还原全分辨率波形,输出隐式嵌入增益校正的归一化波形。与固定attack/release能量检波器及谱域方法相比,该链路直接在时域学习内容相关的电平不变映射且保持因果低延迟。在以Silero VAD为下游的VAD任务测试集下,WaveNorm的FPR错误率为0.272,低于WebRTC的FPR错误率0.304。该适用边界尚未验证多说话人重叠与大混响音乐场景的外推,受限于英语朗读与合成增益条件。原文披露单次推理约需 49M 乘加运算与 55 KB 内存,训练成本未完整披露。
🔗 开源资源
- 代码相关资源:https://github.com/wavenorm123/WaveNorm_AGC — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/CARNIVAL-IITP/Automatic — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
408. 已知很准、未知就自信过头:用门控让 SSL 与手工声学特征各管一段
英文题目:Dual-Branch Gated Fusion for Open-Set Audio Deepfake Source Tracing
标签:#数据增强 #混合专家模型 #语音 #音频深度伪造检测
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#混合专家模型
👥 作者与机构
- Awais Khan:机构信息未能从会议 PDF 纯文本可靠映射
- Kutub Uddin:机构信息未能从会议 PDF 纯文本可靠映射
- Khalid Malik:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
开放集音频来源追溯要求输入为合成语音、输出为24类已知合成系统标签或未知系统拒绝,其难点在于已知类判别力与未知类低置信难以兼得。第一步双路特征抽取并行产生互补输入:冻结XLSR-53编码器经均值池化输出1024维自监督嵌入以捕获音素韵律结构,手工CORES分支输出66维倒谱振荡节奏能量频谱描述子以覆盖信号级伪迹。第二步两路向量经独立投影得到256维专家表示后,其拼接结果进入输入条件门控网络,经两层全连接与Softmax输出两分支权重并加权求和为融合向量。第三步融合向量送入线性分类器得到24类对数几率,再经能量与SME后验打分完成已知归属与未知拒绝,联合训练以标签平滑交叉熵锚定闭集分类、以能量间隔损失拉开已知与未知分数、以门控多样性与熵正则阻止路由坍缩,且前10轮冻结门控以稳定专家表示。与固定拼接相比,门控根据样本分布动态调整分支权重,避免高维自监督表征在数值与梯度上淹没手工分支。在MLAAD(Multilingual Audio Anti-spoofing Dataset)评测集上,系统相对Interspeech 2025参考基线将FPR95从63.0%降至10.4%,相对降幅83.5%,同时保持97.6%已知类准确率与4.9%联合等错率。该结论限于MLAAD的43个未知系统与开发集辅助训练范式,对跨合成生态外推及辅助数据多样性过高时的门控稳定性尚未验证。原文未披露训练推理成本与统计显著性,未发布代码模型。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
409. 用不对称填充拨动延迟:在不改感受野和参数量的前提下配置流式增强
英文题目:Latency-Configurable Streaming Speech Enhancement via Asymmetric Temporal Padding
标签:#CNN #单通道 #流式处理 #语音 #语音增强
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#CNN
👥 作者与机构
- Yunsik Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonyoung Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式语音增强的输入是含噪短时频谱,输出是增强幅度掩码与增强相位,要求在算法时延内兼顾质量与实时响应,难点在于固定架构难以连续权衡过去与未来上下文。该工作先用非对称时间填充将总填充量按比例分配给过去与未来,在不改变感受野与参数量的前提下设定时延档位。接着编码器侧用输入前视缓冲提供真实未来帧,解码器侧用特征缓冲延迟发射以满足未来上下文需求。最后通过选择性状态更新仅缓存当前块帧,阻止前视帧污染后续卷积状态,从而保证全序列与分块推理一致。与全局输入移位或纯因果卷积相比,该机制把未来上下文分散到各层并解决状态损坏问题。在VoiceBank+DEMAND评测设置下,LaCo-SENet全因果档的PESQ指标为3.35±.02,高于aTENNuate基线的PESQ指标3.27。结论仅在单通道 16 kHz 阅读语音加噪场景验证,未覆盖混响、多说话人与真实设备时延。训练推理成本仅报告 ONNX 单线程实时因子,未披露训练硬件与功耗内存。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
410. 用相对差距教判别器:RAF 如何让 GAN 声码器又保真又泛化
英文题目:RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
标签:#生成对抗网络 #自监督学习 #鲁棒性 #跨语言 #语音合成
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.4/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#生成对抗网络
👥 作者与机构
- Yongjoon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jung-Woo Choi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
神经声码器需由梅尔频谱图单步重建波形,现有最小二乘与铰链对抗判定只做绝对真假区分,难以刻画细粒度感知差距与训练分布多模态。RAF先以冻结自监督模型与多分辨率短时傅里叶变换构造三维质量差距Q,再由判别器真假打分差经软正函数构造非负判别器差距d并以均方误差拟合两者。生成器最小化判别器差距期望以间接压缩真实感知差距,形成从质量估计到对抗反馈的闭环。与MetricGAN输入拼接预测归一化PESQ不同,RAF采用显式相对论配对与可分离打分,直接建模真实与生成波形的相对优劣,因而更利于跨语种与跨场景泛化。在LibriTTS-dev上,BigVGAN-base加RAF在1M步时UTMOS达3.651、PESQ达3.767,感知质量超过参数量约8倍的BigVGAN加LSGAN的3.509。在LibriTTS测试集评测设置下,RAF的SMOS分数为4.592,高于LSGAN的SMOS分数4.526。代价是训练段长增至24576点并引入双侧零中心梯度惩罚,BigVGAN-base训练由5.9天增至9.4天,推理仍为单步GAN效率。其适用边界受限于Deeply Korean实录上感知增益收窄的失败条件,尚未验证更强噪声与更长时长的外推,且训练成本因长段与梯度惩罚升高而推理开销仍保持单步。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
411. 声音越多越不可靠:多事件音频定位中漏检与误报的同步恶化
英文题目:A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs
标签:#统计分析 #音频大模型 #模型评估 #环境声 #音频问答
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#统计分析
👥 作者与机构
- Taehan Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jaehan Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Hyukjun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为含1至5个声音事件的真实录音与询问是否含某事件的是非问题,输出为是或否判断,难点在于多事件场景下既要检出存在事件又要抑制对不存在事件的误报。该工作先用指令模型从人工字幕抽取声源与属性二元组并经人工统一本体,再用音频文本对比模型的文本编码器嵌入事件并取语义距离足够远的子集构造不存在事件查询,最后用4种提问模板与3种回答指令组合的12种提示对4个音频大语言模型做贪婪解码评测。与此前依赖名词解析或至多400样本人工标注的幻觉评测相比,关键差异在于以音频对齐相似度过滤负例并按事件数量分层控制场景复杂度,使误报更可解释为幻觉而非本体歧义。在71,174条AudioCapsV2音频构建的大规模评测上,从1事件到5事件,真阳性率下降约29个百分点而假阳性率上升约8个百分点。结论仅适用于字幕显著事件覆盖的日常环境声与所测4款模型及是非式存在判断,未验证时序定位、开放式描述或强重叠混响下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
412. 把好听变成可算分:DeEAR 用三维打分加小样本对齐逼近人类听感
标签:#数据集 #主观评测 #语音 #语音质量评估
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#主观评测
👥 作者与机构
- Zhiyu Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Jingwen Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiale Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Meng Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Sunzhu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengjun Yue:机构信息未能从会议 PDF 纯文本可靠映射
- Benyou Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音到语音系统输入为对话上下文并输出连续语音,难点在于表现力高度主观且缺乏可扩展客观度量,传统声学特征与通用质量分难以反映感知差异。该工作先将表现力解耦为情感强度、韵律丰富度与自发性三个可建模维度,再为各维度训练专用代理打分器,接着用480条人类标注学习非线性融合函数,最后将教师系统蒸馏为统一学生模型以支撑规模化打分。与直接回归整体分或复用去噪质量分不同,该框架显式建模维度间瓶颈制约并用感知不一致惩罚处理过干净合成音。在4组各100条专家标注测试集上,DeEAR整体表现力与人类评分的皮尔逊相关系数达到0.91、斯皮尔曼秩相关系数达到0.85,而DNSMOS与UTMOS均呈负相关。在7系统基准上其排序与人类排序的斯皮尔曼秩相关系数为0.93。在100条盲测A/B中,基于其策展数据微调的模型以78.5%显著优于基线。该结论限于中英双语对话语音与7款语音到语音系统的评测协议,跨语言与跨风格外推尚未验证。原文未披露训练推理硬件与部署成本,生成式AI仅用于语言润色。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
413. 为检测保留病理:认知状态条件合成与 ASR 文本驱动的 AD 数据增强
标签:#数据增强 #语音识别 #病理语音评估 #文本到语音
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#数据增强
👥 作者与机构
- Yin-Long Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanchao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yiming Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yue Li:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaxin Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shaobo Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Liu He:机构信息未能从会议 PDF 纯文本可靠映射
- Yuang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jiahong Yuan:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音阿尔茨海默病检测以语音波形为输入并输出阿尔茨海默病与健康对照的二分类结果,难点在于病理语音稀缺且通用语音合成会抹除停顿与构音异常等诊断线索,难以兼顾自然度与病理保真。CoSTA先在ADReSS训练子集上分别适配出认知状态条件化的CosyVoice2与F5-TTS,使合成语音保留类别相关的韵律与发音特征,再用人工转写与36路自动语音识别转写驱动合成以引入语言扰动并扩充训练集,最后用WavLM检测器学习并在测试时融合原始与合成语音的预测概率。与标准预训练语音合成增强相比,该框架显式建模认知状态并利用识别误差的非随机病理相关性来增加多样性。在ADReSS测试集上音频单模态准确率达到85.83%,相对81.67%的基线提升4.16个百分点并优于传统扰动增强。结论目前仅适用于英文Cookie Theft任务与小样本条件,跨语言与跨场景外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
414. 把找路和打分分开:用轻学生找束、重教师定稿的语音束搜索
标签:#知识蒸馏 #高效推理 #语音 #文本到语音
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#知识蒸馏
👥 作者与机构
- Chenlin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Jie Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Guangyan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Minghui Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiqing Han:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为文本与提示语音,输出为长序列离散声学码元再合成波形,码元自相关强且信息密度低导致一步错即不可逆级联,采样随机抖动而传统集束易陷入静音或噪声循环且延迟过高。所提搜索评估分离集束解码Search-and-eValuatE beam decoding将轻量学生用于局部分块建树,将原始教师用于树形精确评分与最优前缀选择,再以硬重复掩码阻断退化环路。相对传统集束搜索的关键差异在于不再由同一大模型同时承担扩展与评分,而是以排序保持的蒸馏学生降低扩展开销并以短块交替抑制误差累积。在SeedTTS-Eval英文与中文子集上相对采样基线词错率最高下降约一半,同时相对传统集束搜索实现最高约5.1倍的语言模型模块加速且实时因子回到接近基线水平。该结论限于CosyVoice 2基座与中英文朗读型评测,未验证长篇韵律、强情感或噪声提示下的外推稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
415. 不用转文字直接听声找物:Speech2See 如何把语音压缩成可定位的语义
英文题目:Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
标签:#混合专家模型 #多模态学习 #零样本 #语音 #音视频理解
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频理解 | 主方法:#多模态学习
👥 作者与机构
- Wenhuan Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Xinyue Song:机构信息未能从会议 PDF 纯文本可靠映射
- Wenjun Ke:机构信息未能从会议 PDF 纯文本可靠映射
- Zhizhi Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Wenhao Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianguo Wei:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音驱动开放集目标检测以语音波形与图像为输入,直接输出目标框与语音语义对齐结果,难点在于连续语音时间冗余高、信息密度不均,且配对音频图像数据稀缺而难以从零训练。本文提出Speech2See框架,先以HuBERT-Base抽取帧级声学嵌入并经查询引导语义聚合压缩为紧凑语义令牌,再送入类Grounding DINO特征增强器与跨模态解码器完成听觉到定位映射,最后在解码器前馈网络层插入混合LoRA专家做参数高效微调。与经文本中转的两阶段YOSS相比,该设计避免自动语音识别级联误差并保留连续声学线索。在COCO2017验证集闭集评测下,Speech2See的AP指标为56.2,高于YOSS-large的AP指标为39.2。结论仅在10说话人合成语音与COCO、Objects365、Flickr30k、LVIS构造集上验证,真实噪声、多轮指代与长尾罕见类外推尚未证明。该结论适用边界受限于合成语音构造评测,真实噪声下表现尚未验证。训练成本上硬件为8张NVIDIA A800,推理开销上参数量为197.8M且实时因子为0.35。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
416. 块内并行、块间串行:DLLM-TTS 如何用离散扩散做语音合成
英文题目:DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis
标签:#扩散模型 #零样本 #语音 #文本到语音
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#扩散模型
👥 作者与机构
- Wasim Madha:机构信息未能从会议 PDF 纯文本可靠映射
- Nityanand Mathur:机构信息未能从会议 PDF 纯文本可靠映射
- Hamees Sayed:机构信息未能从会议 PDF 纯文本可靠映射
- Apoorv Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Sameer Khurana:机构信息未能从会议 PDF 纯文本可靠映射
- Akshat Mandloi:机构信息未能从会议 PDF 纯文本可靠映射
- Sudarshan Kamath:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成以文本与3秒至5秒参考语音的转录及码本为输入,输出高可懂度、高相似度波形,实际难点是自回归逐Token解码延迟高,而并行模型易丢词错位且依赖显式时长与对齐。DLLM-TTS将X-Codec2单码本序列按块长32切块,先将文本与参考码本拼接为条件,再以阶梯注意力在当前噪声块内双向建模声学连贯、对历史干净块跨块因果继承语义。随后每块以置信度阈值并行解掩码并顺序推进,用句尾符后填EOS处理变长以省去时长模型与音素对齐,相对已有方法的关键差异是以块内并行兼顾块间因果并支持键值缓存流式解码。在Seed-TTS-eval基准下,T=32条件的WER为2.25%,低于T=8条件的WER 14.58%。在 Seed-TTS-eval 英文集上最优配置 T=32、B=32 取得词错率 2.25%、字错率 1.05%、说话人相似度 0.750、主观分 4.25,接近 DiTAR 与 F5-TTS 等基线,实时率 0.15 且首块完成后可流式出声。结论仅在英文短句零样本场景验证,多语种、长文本、强噪声提示外推尚未验证。训练为两阶段课程学习共 20K 小时,耗 8 卡 H100 共 3 天。该0.6B模型在上述硬件上的推理开销以实时率0.15体现低延迟流式吞吐优势。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
417. 没有坐标也能做地理适配:先从语音预测位置再解码
英文题目:Predict-Then-Adapt: Inferring Coordinates from Speech for Continuous Geo-Conditioned Dialectal ASR
标签:#LoRA #可解释性 #鲁棒性 #语音 #语音识别
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- Pouya Mehralian:机构信息未能从会议 PDF 纯文本可靠映射
- Hugo Van hamme:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
方言自动语音识别(Automatic Speech Recognition,ASR)的输入是自发方言语音,输出为文字转写,难点在于音系与词汇随地理连续渐变且标注稀缺,离散方言标签难以刻画过渡带。该文提出预测再适配(Predict-Then-Adapt):先以冻结编码器输出经注意力池化与回归头估计经纬度,再将预测坐标送入坐标门控网络调制低秩更新,最后在启用地理门控的编码器上解码转写。与离散标签条件和普通低秩适配(Low-Rank Adaptation,LoRA)不同,该机制用连续二维坐标调制多个秩一分量的贡献强度,可在区域间平滑插值并保留分量级可分析性。在 GCND 荷兰方言 10 s 测试段上,预测坐标条件系统(Coordinate Regression Head + Gated Low-Rank Interpretable Adaptation,CRH+GLoRIA)平均词错率(Word Error Rate,WER)为 32.62%,相对同秩 LoRA 的 35.67% 降低 3.05 个百分点,与使用真实坐标的上限 32.04% 仅差 0.58 个百分点。定位方面 10 s 可见方言平均误差 25.85 km、30 s 降至 16.27 km,内插区 30 s 为 16.22 km 而外推区为 38.75 km;扰动分析显示 15 km 内影响可忽略、25 km 内平均劣化不足 1 个 WER 点,恰好覆盖定位误差带。结论适用于训练坐标支撑范围内的内插区域,对东部外推方言定位误差明显增大。两遍推理仅增加一次编码器前向与轻量回归头,论文报告额外延迟低于 3%,CRH 新增约 150k 参数,不足骨干 180M 参数的 0.1%。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
418. 英语转写就够了吗:双向翻译预训练如何把语音编码器推向大模型的语义空间
英文题目:Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?
标签:#多任务学习 #大语言模型 #跨语言 #语音识别 #语音翻译
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#多任务学习
👥 作者与机构
- Tomoya Mizumoto:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Fujita:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究语音大模型(Speech LLM)中语音编码器与冻结文本LLM的跨模态对齐难题,输入为多语言语音波形,输出涵盖转写、跨语言翻译、意图与情感理解,难点在于转写预训练表征偏语言相关而LLM需要统一语义空间。方法链分三步:先用序列到序列(Sequence-to-Sequence, Seq2Seq)架构在转写与不同翻译混合目标下预训练编码器,再丢弃解码器只保留编码器抽取连续声学表征,最后经可训练适配器(Adaptor)降采样映射至冻结LLM输入空间。与仅转写或仅非英语到英语翻译相比,关键机制差异是加入英语到多语的对称翻译,迫使编码器剥离音形对应以提取可跨语言迁移的语义。在Llama-3.2-3B-Instruct上双向配置使英语到中文翻译在CoVoST2上达到30.8 BLEU,明显高于单向基线的28.6 BLEU,且未见语言也获得提升。结论边界在于仅验证4种预训练语言与1B/3B规模,未证明大规模多语或更大LLM下依然成立。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
419. 总体词错误率饱和之后:用财报电话中的人名公司名检验定制词识别
英文题目:Contextual Earnings-22: A Speech Recognition Benchmark with Custom Vocabulary in the Wild
标签:#数据集 #基准设计 #语音 #语音识别
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Blaise Munyampirwa:机构信息未能从会议 PDF 纯文本可靠映射
- Arda Ibis:机构信息未能从会议 PDF 纯文本可靠映射
- Zach Nagengast:机构信息未能从会议 PDF 纯文本可靠映射
- Brian Keene:机构信息未能从会议 PDF 纯文本可靠映射
- Dylan Angus:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为财报电话切出的15秒短音频与自定义词表,输出为转写文本以及其中人名与公司和产品名的识别质量,难点是整体词错误率已饱和但稀有上下文词仍决定可用性。方法链分三步:先用大语言模型从Earnings-22转写抽取命名实体并去重规范化形成调用级词表与局部文本窗,再用基于wav2vec的强制对齐映射到长音频并以关键词为中心截取固定15秒音频窗,最后人工校对文本保真度并按本地精简语境与含同调用干扰词的全局语境组织发布。与已有合成偏置词表或依赖外部幻灯片的资源相比,关键差异是语境直接来自对话内且天然包含可信干扰词,更贴近部署时的精度与召回权衡。在人工校对基准下,无瑕样本的样本占比为98.7%,高于接受词级修正样本的样本占比29.5%,该指标对比刻画语料保真度。该结论仅适用于英语财报短片段与提示和增强两类机制,未验证长音频流式与大规模干扰词外推。其尚未验证的外推范围受限于短片段评测与有限干扰词规模。原文未披露训练、推理或部署成本
🔗 开源资源
- 第三方资源:https://github.com/openai/whisper — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
420. 在离散码本上做流匹配:DiFlow-TTS 如何拆开内容、韵律与音质再同时生成
英文题目:DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching
标签:#流匹配 #高效推理 #零样本 #语音 #文本到语音
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Son Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Thanh Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Nghia Huynh:机构信息未能从会议 PDF 纯文本可靠映射
- Son Hy:机构信息未能从会议 PDF 纯文本可靠映射
- Van Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成需用数秒参考音频复现未见说话人的音色与韵律,同时保证内容准确与低延迟。DiFlow-TTS先用冻结的预训练因子化编解码器(Factorized Codec,FACodec)将参考语音解耦为韵律、内容、声学离散单元与说话人嵌入,再由音素内容映射器(Phoneme-Content Mapper,PCM)将音素序列映射为内容单元与内容嵌入,最后由因子化离散流去噪器(Factorized Discrete Flow Denoiser,FDFD)以内容嵌入与参考韵律声学线索为条件并行生成韵律与声学单元,经解码器重建波形。该框架直接在离散空间学习概率速度场,源分布为全掩码序列,目标分布因子化为韵律与声学分布乘积,并以独立韵律头与声学头预测后验。与自回归逐步生成和连续扩散绑定训练采样配置不同,其离散并行去噪支持采样步数灵活调节。与连续流匹配相比,该离散因子化设计减少了声学细节耦合带来的推理开销。在LibriSpeech test-clean跨句合成、3秒提示音、128次函数评估下取得UTMOS 3.98、WER 0.05、F0准确率0.88与F0 RMSE 7.97,韵律与自然度领先同表基线,但SIM-O为0.45,明显低于MaskGCT的0.67与F5-TTS(100K小时)的0.66。该结论限于英语朗读干净提示音,噪声、多语言与长尾音色外推不足,小模型16步可在0.05秒级实时因子下保持可用质量。其适用边界受限于干净英语朗读,噪声与跨语言外推尚未验证,128步设置的延迟仍高于低步配置。
🔗 开源资源
- 第三方资源:https://github.com/facebookresearch/libri-light — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
421. 盯住语码切换点:用发音相近的错误文本教会模型分清混淆
英文题目:Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition
标签:#对比学习 #LoRA #多语言 #语音识别
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#对比学习
👥 作者与机构
- Tung X. Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Hieu Minh Truong:机构信息未能从会议 PDF 纯文本可靠映射
- Giang Son Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Nhu Vo:机构信息未能从会议 PDF 纯文本可靠映射
- Wray Buntine:机构信息未能从会议 PDF 纯文本可靠映射
- Dung D. Le:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
码切换语音识别的输入为含语种交替的语音,输出为混合语转写,难点是嵌入语片段与切换边界邻域的声学混淆集中,且易被整体词错率掩盖。该工作先用固定种子模型解码10-best列表,按嵌入语最大连续片段向两侧扩展r个词元检测兴趣点,再以Gemini 2.5 Pro离线扩充兴趣点替换候选,形成兴趣点局部扰动池。随后经声学似然裕量、音素距离、文本距离三重过滤保留难而可信的近错负例,过滤后的高质量负例集合直接进入对比训练目标。最后用兴趣点加权交叉熵锚定真值并以多负例InfoNCE式对比排序拉开真值与负例得分,推理阶段仍保持标准解码不变。与最小词错率期望优化和单纯兴趣点加权不同,该方法只扰动兴趣点并显式排序声学可信混淆,而非整体加权或增加推理后处理,因而更针对语种切换关键区域。在CS-FLEURS普通话-英语基准评测下,完整模型三重过滤版本的WER为14.06,低于MWER基线的WER 15.75。结论限于 2 个语对、单一骨干和离线一次生成,跨语种与跨模型外推尚未验证,原文未披露训练与推理成本。
🔗 开源资源
- 第三方资源:https://github.com/Kyubyong/g2p — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/undertheseanlp/underthesea — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
422. 同一句话既定身份又定印象时,合成音为何被参考音拽偏
英文题目:LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
标签:#数据集构建 #主观评测 #语音 #文本到语音
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#数据集构建
👥 作者与机构
- Junki Ohmura:机构信息未能从会议 PDF 纯文本可靠映射
- Yuki Ito:机构信息未能从会议 PDF 纯文本可靠映射
- Emiru Tsunoo:机构信息未能从会议 PDF 纯文本可靠映射
- Toshiyuki Sekiya:机构信息未能从会议 PDF 纯文本可靠映射
- Toshiyuki Kumakura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音印象控制需根据文本、参考音频与11维1至7分目标向量合成语音,在保留参考说话人身份的同时精确命中目标印象,难点在于参考音频自带印象会污染目标且长期缺乏公开语料。作者先构建首个公开语料LibriTTS-VI并训练印象估计器,为LibriTTS-R全库提供伪标签,其输出直接作为后续训练的目标向量真值。接着提出解耦训练VIC-dis,用同说话人另一句提供身份表征而仍从原句提取目标向量,以身份与印象来源分离切断同源耦合。再进一步提出参考无关分支VIC-srf,以高斯噪声替代身份表征并仅由目标向量驱动合成,在结构上消除泄露而保留零样本合成能力,这与单参考基线依赖同一参考同时提供身份与印象存在本质差异。在LibriTTS-R test-clean零样本评测下,VIC-srf的RVI-MSE为0.41,低于VIC-base的RVI-MSE 0.61。该结论适用边界受限于英语朗读语料与39个未见说话人零样本场景,强力感等维度响应仍弱且尚未验证跨语言与自发语音外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
423. 口音自由变体与句中英语边界:印地-英语混码强制对齐为何必须改词典和改训练数据
英文题目:Evaluation of forced alignment of code-mixed speech: the case of Hindi-English
标签:#评测协议 #语音学与音系 #多语言 #语音 #强制对齐
评分:6.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#强制对齐 | 主方法:#评测协议
👥 作者与机构
- Ayushi Pandey:机构信息未能从会议 PDF 纯文本可靠映射
- Pamir Gogoi:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Tang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理印地语与英语码混合语音的强制对齐,输入为已知转写的朗读语句,输出为音素级时间边界,难点在于自由变体发音与天城体点缀缺失导致的字音映射歧义。方法链分为三步:先用语音平衡码混合语料库构建印地语英语统一音素集并生成声学转写,再对易混淆音素对实施发音词典重映射以消除正字法歧义,最后将消歧后的词典分别送入码混合整句、单语印地语片段和孤立英语词训练的声学模型以比较边界误差。相对直接使用现成发音词典的做法,重映射通过竞争性代理音素让对齐器在声学上区分浊擦音与清塞擦音变体,避免对齐漂移并保留双变体区分度。在PBCM语料码混合词对齐任务下,码混合整句模型的平均中点绝对误差指标为4.15 ms,低于单语Hindi模型的平均中点绝对误差指标38.18 ms。最大自举映射将浊塞擦音与浊擦音分别代理为清音对应体,实际意义在于弥补缺失点缀正字法的系统性歧义,使边界恢复更可靠。该结论限于朗读新闻文本与 113 名受过英语教育的 Hindi 母语者,未验证自发对话与其他语言对。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Ayushi113/mfa-hindi-code-mixed — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
424. 流式多说话人识别的四条路:不微调也能跑,微调才更准
标签:#Conformer #模型比较 #流式处理 #语音识别 #说话人分离标注
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#Conformer
👥 作者与机构
- Taejin Park:机构信息未能从会议 PDF 纯文本可靠映射
- Ivan Medennikov:机构信息未能从会议 PDF 纯文本可靠映射
- Kunal Dhawan:机构信息未能从会议 PDF 纯文本可靠映射
- Weiqing Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jagadeesh Balam:机构信息未能从会议 PDF 纯文本可靠映射
- Boris Ginsburg:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式多说话人自动语音识别需以在线低延迟转写重叠语音并归属说话人,输入为长会话远场混叠音频,输出为带说话人标签的词序列,难点在于长上下文漂移与训练短测试长的失配。该流水线第一步由流式Sortformer v2.1输出到达序说话人缓存与帧级分离标注,第二步将该缓存经说话人内核嵌入送入共享Nemotron Speech流式编码器或用于掩蔽分支,第三步由RNN-T解码器按单实例序列化或多实例条件方式解码,前者输出合并转写,后者为各说话人分别解码,级联分支则将词时间戳映射到分离标注logits完成归属。机制差异在于词级序列化输出训练以单实例端到端建模重叠并依赖排列不变动态时间规整解决短片段转写与标注错位,而说话人自适应以多实例条件解码保留单说话人精度,前者免多实例开销但需微调,后者精度高但依赖准确分离与算力。在CH109、Mixer6与AMI会议转录(Meeting Transcription)共4个条件上的级联最小排列词错率(Concatenated Minimum-Permutation Word Error Rate,cpWER)显示,SSA在oracle平均16.18%与diar平均23.36%均领先,WL-SOT diar平均33.46%略优于掩蔽输入的34.77%。结论边界是该优势依赖准确流式分离标注与多实例算力,重叠严重与远场单麦克风下增益明显收缩,WL-SOT规模化仍待验证。原文未披露训练时长、推理吞吐与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
425. 补上幅值与相位线索,再在奇异值域里微调:MoSE 音频伪造检测解读
英文题目:Mixture of Spectral Experts for Audio Deepfake Detection
标签:#混合专家模型 #参数高效微调 #时频分析 #语音 #音频深度伪造检测
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#混合专家模型
👥 作者与机构
- Yaxuan Qiu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhe Li:机构信息未能从会议 PDF 纯文本可靠映射
- Mieradilijiang Maimaiti:机构信息未能从会议 PDF 纯文本可靠映射
- Zunwang Ke:机构信息未能从会议 PDF 纯文本可靠映射
- Wushour Silamu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频深度伪造检测需从波形判别真实与合成语音,难点在于神经声码器生成的赝品听感自然而仅残留细微幅度与相位畸变,预训练表征易忽略此类底层物理线索。该框架先由频率音频编码器(Frequency Audio Encoder,FAE)从短时傅里叶变换(Short-Time Fourier Transform,STFT)提取对数幅度与正余弦相位并经卷积压缩为物理线索序列,再以频谱专家混合(Mixture of Spectral Experts,MoSE)在冻结奇异基下对主干前馈矩阵中间矩阵做低秩门控适配,最后经交叉注意力(Cross-Attention)将物理线索与聚合后的主干上下文融合判决。相对直接微调或原始权重空间低秩适配,该设计将适配约束在预训练奇异方向的组合调制上并以输入相关路由分配专家。在ASVspoof 2019 LA评估设置下,Ours(MoSE-WavLM-FAE)的等错误率为0.29%,低于XLSR-53+ASP的等错误率0.31%。结论限于4秒英文朗读式欺骗与信道压缩场景,未验证多语种、长时对话与最新扩散式声码器的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
426. 把大模型的语义留在训练端:只用编码器解码重叠语音
英文题目:Distilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count Routing
标签:#CTC #知识蒸馏 #语音识别 #说话人计数
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#知识蒸馏
👥 作者与机构
- Hao Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Fujita:机构信息未能从会议 PDF 纯文本可靠映射
- Roman Koshkin:机构信息未能从会议 PDF 纯文本可靠映射
- Mengjie Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Lianbo Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yui Sudo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多说话人识别需从单通道重叠语音中按说话起始顺序转写全部说话人文本,重叠严重时混合编码表征纠缠且自回归大语言模型解码缓慢脆弱。该方法先以序列化输出目标对LLaMA教师做多说话人适配并同步向WavLM编码器蒸馏语义先验,使教师更适配多说话人条件。接着固定教师并联合优化序列化连接时分类损失与蒸馏损失,训练后编码器分离器与按起始顺序排列的说话人分支。然后由说话人计数头预测两说话人或三说话人并路由至对应分支,实现纯编码器CTC推理。与已有方法机制差异在于将大语言模型从推理时解码移至训练时正则,避免长序列自回归纠缠而直接强化编码器解耦。在 LibriMix 噪声评估集上,所提编码器模型在三说话人条件词错率为 24.5%,显著优于 SOT-Llama-1B 基线的 39.1%。在LibriMix干净评估集下,所提方法的WER为14.3%,低于SOT-Llama-1B基线的WER 21.6%。结论限于 LibriMix 合成的两说话人与三说话人英文朗读混合,未验证自然会议、更多说话人或跨语言外推,三说话人计数精度仍是瓶颈。该结论的适用边界受限于合成朗读语料,尚未验证自然会议与更多说话人外推;在硬件为单卡NVIDIA H100的推理开销测试中CTC模型的实时因子显著低于LLaMA-1B解码。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
427. 四个人同时说话时,耳后脑电如何同时回答何时听与听谁
英文题目:NeuroMultiSpEx: Neuro-Guided Target Speaker Extraction for Multi-Speaker Scenarios
标签:#助听器 #多模态学习 #脑信号 #语音 #目标说话人提取
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#多模态学习
👥 作者与机构
- Dashanka De Silva:机构信息未能从会议 PDF 纯文本可靠映射
- Saurav Pahuja:机构信息未能从会议 PDF 纯文本可靠映射
- Siqi Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Tanja Schultz:机构信息未能从会议 PDF 纯文本可靠映射
- Haizhou Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
目标说话人提取需从4路0 dB混合语音与20导耳脑电中恢复注意对象波形,难点是竞争者增多导致的置换歧义与耳脑电空间分辨率不足制约。系统先由包络编码器从脑电重建注意包络并输出时间同步表征,再由说话人编码器经图卷积与跨耳注意力解码身份并经适配器对齐到帧级表征。随后门控融合模块按上下文加权何时与何人线索,并以融合参考为查询对混合语音编码做跨模态注意力,最后经掩码解码波形。与仅用单一线索或把包络重建仅作辅助训练的已有神经导向方法不同,该架构将两类线索同时作为提取网络的条件输入并端到端联合优化。在PKU四说话人耳脑电评测设置下,NeuroMultiSpEx的SI-SDRi指标为9.613 dB,高于最强基线NeuroSpEx+的SI-SDRi指标8.904 dB。该结论适用边界受限于受试者内、固定4名刺激说话人与安静混合条件,跨被试与混响泛化尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
428. 把百万小时语料装进可复用流程:ESPnet3 如何拆开数据、系统与配方
英文题目:ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era
标签:#开源工具 #LoRA #预训练 #语音 #语音识别
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- Masao Someki:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Polok:机构信息未能从会议 PDF 纯文本可靠映射
- Carlos Carvalho:机构信息未能从会议 PDF 纯文本可靠映射
- Chyi-Jiunn Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Da-Hee Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiatong Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Jinchuan Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Nelson Enrique Yalta Soplin:机构信息未能从会议 PDF 纯文本可靠映射
- Samuele Cornell:机构信息未能从会议 PDF 纯文本可靠映射
- Siddhant Arora:机构信息未能从会议 PDF 纯文本可靠映射
- Francisco Teixeira:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- William Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Alberto Abad:机构信息未能从会议 PDF 纯文本可靠映射
- Chenda Li:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
- Wangyou Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向基础模型时代语音研究需同时处理百万小时级多源语料、亿级参数模型与多节点训练的难题,输入为异构语音语料与实验配置,输出为可训练、可推理、可评估与可发布的语音模型。数据组织器先以Hydra配置声明式拼装多个PyTorch数据集为统一可迭代对象,其输出的统一迭代接口直接作为分片迭代的输入。数据集分片再按分片数与分布式序号以懒加载方式分配轮次数据,其产生的高效数据流随后送入统一工作流执行。基础系统类最后集中管理数据准备、训练、推理、评估与发布阶段,并由轻量配方通过继承与覆盖扩展实验差异。与ESPnet2紧耦合的脚本配方相比,该设计把通用流程下沉框架而把实验差异保留在配方层。在CHiME-4测试集评测下,ESPnet3增强配置的WER为12.53%,低于ESPnet3基线配置的WER12.84%。该结论适用边界受限于仅在自动语音识别预训练与Whisper微调上验证,尚未验证在语音合成、增强或对话系统中的同等收益。原文披露的硬件为4节点16卡H100且多节点图形处理器利用率超80%,但未给出完整训练成本核算。
🔗 开源资源
- 第三方资源:https://github.com/facebookresearch/hydra → https://github.com/hydra-ecosystem/hydra — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
429. 不听我:把已注册的人声删掉来避开远场回传延迟
标签:#RNN #高效推理 #流式处理 #语音 #目标说话人提取
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#RNN
👥 作者与机构
- Mads Østergaard:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Neergaard Zahid:机构信息未能从会议 PDF 纯文本可靠映射
- Karl Ulbæk:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Bagge:机构信息未能从会议 PDF 纯文本可靠映射
- Kenny Falkær Olsen:机构信息未能从会议 PDF 纯文本可靠映射
- Rasmus Lindrup:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自有语音消除以含注册说话人、干扰说话人与环境噪声的单通道混合为输入,输出剔除注册说话人并保留其余语音的去噪波形,难点在于远场回传延迟易引发可感知的自声失真且需在极低延迟下区分音色相近说话人。该方法先由编码器将混合与注册语音变换到时域隐表示,并由辅助网络从注册语音提炼说话人嵌入,嵌入经后段适配乘法注入主干表示。接着掩蔽网络以Mamba块加MinGRU时序混合估计抑制掩蔽,并作用于混合表示以压制注册语音成分。最后解码器将掩蔽后表示重建为保留语音波形。与基于卷积的时域SpeakerBeam相比,其机制差异在于以Mamba块加MinGRU时序混合替代扩张卷积堆叠,并以双向线性循环编码器替代卷积辅助网络,从而保持因果流式能力并大幅降低计算量。在按基频分层划分说话人的测试条件下,被注册者为低音的异音高混合条件的SDR为12.24 dB,高于被注册者为高音的异音高混合条件的SDR 11.45 dB。该结论目前仅适用于至多1个干扰说话人的非混响合成场景,同音高与3至5人混合时抑制能力明显下降。小模型已可在单CPU线程实现低于实时的流式推理,但大模型实时系数仍高于1,原文未披露训练硬件与训练时长成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
430. 韵律也能做 ABX:用相同音段、不同韵律的最小对直接量表示空间的距离
英文题目:Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations
标签:#数据集 #评测协议 #韵律 #多语言 #语音属性识别
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#评测协议
👥 作者与机构
- Haitong Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Stephen McIntosh:机构信息未能从会议 PDF 纯文本可靠映射
- Kwanghee Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Eunjung Yeo:机构信息未能从会议 PDF 纯文本可靠映射
- Daisuke Saito:机构信息未能从会议 PDF 纯文本可靠映射
- Nobuaki Minematsu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为相同音素序列但韵律模式不同的语音三元组,输出为表征空间是否保留语言学韵律对比的判别误差率,难点在于无需标注即可分离韵律与音素、说话人与时长差异。方法链分三步推进:先构建英语重音、日语声调与汉语声调的韵律最小对偶并裁剪目标词以抑制上下文,再用自监督语音模型逐层抽取帧级表征,最后以动态时间规整对齐并比较距离以判定ABX正确性。与均值池化加分类器探测相比,该机制保留时变韵律轮廓并直接度量几何显著性,同时提供对齐路径用于定位对比。在自然语料上最佳层汉语声调误差率低至5%,而人类为2%,日语上模型19%明显落后于人类9%,英语上模型最差层26%反而略优于人类29%。结论限于词级词汇韵律与朗读体录音,尚未验证语调、焦点与自发对话的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://stephenmac7.github.io/prosodic-abx → https://stephenmac7.github.io/prosodic-abx/ — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/reazon-research/japanese-wav2vec2-base — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/reazon-research/japanese-wav2vec2-large — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/reazon-research/japanese-hubert-base-k2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
431. 不用外部声纹编码器做流式变声:从内容编码器中间层直接取说话人表示
英文题目:VOSSA: Voiceprint Optimization for Streaming Speech Architectures
标签:#端到端学习 #高效推理 #流式处理 #语音转换
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#端到端学习
👥 作者与机构
- Mu-Ruei Tseng:机构信息未能从会议 PDF 纯文本可靠映射
- Waris Quamer:机构信息未能从会议 PDF 纯文本可靠映射
- Ghady Nasrallah:机构信息未能从会议 PDF 纯文本可靠映射
- Ricardo Gutierrez-Osuna:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
实时流式语音转换需将源语言内容映射为目标音色并保持自然度与可懂度,难点是冻结的说话人验证嵌入刻意抑制帧内音素韵律变异,与按帧实现共振峰等声学细节的生成需求失配。VOSSA以流式TVTSyn为骨干并冻结因果内容编码器,抽取其最后卷积层与多头自注意力栈中每隔一层的中间特征逐帧堆叠为序列H,经注意力统计池化加权求均值方差并由两层投影得到全局声纹向量g(x)。全局向量与内容同步时变音色模块结合,以内容为查询、全局记忆为键值生成帧级音色条件,再送入因果解码器重建波形,省去独立说话人编码器并减小模型体积。训练采用同说话人自重建与非平行转换双路径,以同说话人两条嵌入平均为目标,联合梅尔L1重建、对抗、特征匹配、余弦说话人一致性与双向InfoNCE正则,梯度回传池化器、时变模块与解码器。在 LibriTTS 源与 LibriTTS、VoxCeleb、EMIME、ARCTIC、L2-ARCTIC、VCTK 目标构成的转换评测中,VOSSA 归一化目标相似度达 0.86,大幅高于 TVTSyn 的 0.59,同时词错率 0.17 持平、NISQA-MOS 3.48 接近 3.52,主观平均意见分 3.79 略优。该结论限于客观指标加小规模听测与第一共振峰单点诊断,未验证强噪声、跨语言与极端音色外推,训练时长与多硬件部署成本未披露。
🔗 开源资源
- 演示资源:https://morris88826.github.io/VOSSA/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
432. 训练时说清为什么错,推理时只给答案:用拒绝式推理拉开相邻意图
英文题目:Distilling Structured Reasoning into SpeechLLMs for Spoken Language Understanding
标签:#知识蒸馏 #多任务学习 #语音大模型 #口语意图与槽位识别
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语意图与槽位识别 | 主方法:#知识蒸馏
👥 作者与机构
- Toshihiro Tsukagoshi:机构信息未能从会议 PDF 纯文本可靠映射
- Natsuo Yamashita:机构信息未能从会议 PDF 纯文本可靠映射
- Kota Dohi:机构信息未能从会议 PDF 纯文本可靠映射
- Hiroaki Kokubo:机构信息未能从会议 PDF 纯文本可靠映射
- Masaaki Yamamoto:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语理解需将带说话人、韵律和噪声变异的语音映射为意图加槽值结构化语义框,难点在于语义相邻意图仅差范围或粒度而常规微调难以拉开决策边界。本文提出推理引导微调 Reasoning-Guided Fine-Tuning / RG-FT,先用 DeepSeek-R1 基于语音转写、真值标签与全量意图槽位定义库生成候选枚举、拒绝论证和标签预测三段式轨迹,再以语音大模型为学生做双指令多任务学习,推理时仅走直接标签分支。为区别于肯定式解释,拒绝论证要求对每个错误候选引用证据说明矛盾,从而把细粒度对比显式语言化为结构正则。在 SLURP 测试集上 Qwen2.5-Omni-7B 经该方法意图准确率达 88.35%,相对直接微调提升 0.57 个百分点且槽填充 SLU-F1 同步改善至 76.88,六模型在英语 SLURP 与法语 Speech-MASSIVE 上均呈一致增益,最大增益出现在 Music-Flamingo 上为意图准确率 +2.40 个百分点、SLU-F1 +2.80。该结论限于 18 领域 60 类意图的同源划分设置,未验证强噪声、开放意图或跨语料迁移下的稳定性。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
433. 同一句话为何重读不同词:CAST 检验语音合成是否真懂上下文
英文题目:Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark
标签:#基准测试 #基准设计 #韵律 #文本到语音
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#基准设计
👥 作者与机构
- Arnon Turetzky:机构信息未能从会议 PDF 纯文本可靠映射
- Avihu Dekel:机构信息未能从会议 PDF 纯文本可靠映射
- Hagai Aronowitz:机构信息未能从会议 PDF 纯文本可靠映射
- Ron Hoory:机构信息未能从会议 PDF 纯文本可靠映射
- Yossi Adi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语境条件重读生成任务,输入为话语语境与目标句,输出为目标句语音,要求无重读标注时从语篇推断对比焦点并在声学上实现,难点是词形相同而焦点随语境漂移且易受句内偏置干扰。方法先以结构化提示联合生成语境、句子与语义重读目标以保证语义连贯,其输出进入跨模型双评审一致过滤以剔除歧义样本。过滤仅保留标签可判定的对比对并构成基准集合,其合成语音再由重读检测器直接判定命中与跨语境对比,从而分离语义推断与声学实现误差。相对已有显式重读控制与文本理解评测,该工作把推断与实现放在端到端语音中检验并以相同句子消除句内偏置,实际意义在于暴露文本可解而语音难实现的鸿沟。在CAST基准下,Claude-haiku-4.5的Correct指标为76.1,高于Qwen3-0.6B的Correct指标5.3。结论限于词级重读与英语对比焦点,未覆盖语调轮廓与自然语篇,且依赖自动检测近似人耳感知。其适用边界受限于人工校验规模与检测器精度,尚未验证跨语言与自发对话的外推效果。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/boson-ai/higgs-audio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
434. 只改难字:用 CTC 贪心打底、注意力只修低置信字的半自回归推测解码
英文题目:Accelerating End-to-End ASR via Semi-Autoregressive Speculative Decoding
标签:#自回归模型 #高效推理 #流式处理 #语音识别
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自回归模型
👥 作者与机构
- Long Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Lingchao Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanzhong Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Haojun Fei:机构信息未能从会议 PDF 纯文本可靠映射
- Qing Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端语音识别任务输入为长时连续声学特征序列,输出为变长文本词元序列,实际难点在于语音帧长远大于文本长度且存在同音混淆、口音与长尾语义,导致自回归注意力解码准确但须逐词串行等待,CTC贪婪搜索虽快却难以纠正易混词。针对该矛盾,本文提出半自回归推测解码,先用CTC贪婪搜索产生初始假设并以重复帧平均峰值概率估计逐词置信度,再按阈值生成置信掩码区分易难词元。然后仅对低置信位置调用注意力解码器做束搜索并与CTC得分插值融合,高置信词元直接复制保留,最终按束搜索总分选择最优序列。与混合CTC/注意力解码和注意力重打分需计算复杂CTC前缀得分并对全序列重打分不同,该设计完全避开前缀得分瓶颈并保持与分块流式解码兼容,使计算集中于少数难词,具有以接近CTC贪婪搜索延迟获得接近自回归精度的实际意义。在AISHELL-1测试集上,U2++ Conformer结合SASD的字错率(Character Error Rate,CER)为4.73%,与注意力重打分(Attention Rescoring)的4.77%相当,GPU实时率(Real Time Factor,RTF)为0.0188,约为后者0.0535的三分之一。该结论依赖最终长度与CTC假设严格一致且高置信即正确的假设,在高难长尾与强口音下尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
435. 从等指令到看时机:ProVoice-Bench 如何考语音智能体的主动介入
英文题目:From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench
标签:#基准测试 #基准设计 #语音 #语音交互
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音交互 | 主方法:#基准设计
👥 作者与机构
- Ke Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
主动式语音交互(proactive voice interaction)要求智能体在连续对话音频 \(Ca\) 与手机数字上下文 \(Dc\) 中自行判断是否介入,并输出工具调用 \(Tp\) 与文本回应 \(Rp\),难点在于隐式意图推断、长时静默监听与言语和记录矛盾的联合推理。本文构建五阶段合成流水线,先由 Qwen3-Max 按对话主题合成移动应用状态,再合成触发场景与双人对话脚本,经 CosyVoice3 语音合成与声学仿真拼装为自然音频,最后配以语义线索 \(Sc\) 与标准答案 \(Tg,Rg\) 形成五元组样本。与既有被动问答基准相比,该设计将显式指令改为条件触发与知识纠错,迫使模型同时完成何时说话与说什么的决策。在包含 1182 个正负平衡样本的 ProVoice-Bench 上,Step-Audio-R1(T) 33B 总体准确率(Overall Acc)为 0.793,Qwen3-Omni(T) 30B 为 0.787 且总体响应准确率(Overall Racc)以 0.759 反超,思维链显著降低监听类任务误触发但环境声感知仍弱。该结论仅适用于合成英语对话与给定数字上下文,尚无真实远场录音、跨语言与在线打断时延验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/datasets/ThatsGroes/dialog-topics — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
436. 不只抵消噪声,还要主动补回语音:主动语音增强如何把扬声器变成修复器
标签:#状态空间模型 #Transformer #主动降噪 #去削波 #去混响
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#主动降噪 | 主方法:#Transformer
👥 作者与机构
- Ofir Yaish:机构信息未能从会议 PDF 纯文本可靠映射
- Yehuda Mishaly:机构信息未能从会议 PDF 纯文本可靠映射
- Eliya Nachmani:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
主动语音增强 Active Speech Enhancement(ASE)要求从参考麦克风的畸变语音 \(x&\#40;n&\#41;\) 出发,经由抵消扬声器与次级路径,在改造麦克风处合成逼近洁净目标 \(c&\#40;n&\#41;\) 的物理声场 \(e\_h&\#40;n&\#41;=d&\#40;n&\#41;\+a&\#40;n&\#41;\),难点在于同时抑制干扰并补偿混响与削波造成的语音缺损且满足因果时延。所提主动语音增强 Transformer-Mamba(ASE-TM)先以短时傅里叶变换 Short-Time Fourier Transform(STFT)堆叠幅度与相位并经稠密编码器抽取时频特征,再交替使用双向时频 Mamba 路径建模长程依赖并在中段插入降维多头注意力补充全局上下文,随后由幅度与相位双解码器预测抵消信号 \(y&\#40;n&\#41;\) 并经电声非线性 \(f\_\{LS\}\\\{\\cdot\\\}\) 与房间脉冲响应合成为增强波形,最后以时域加频谱加相位加感知对抗损失联合优化抑制与富化。与仅追求残差归零的传统主动噪声控制 Active Noise Control(ANC)相比,该机制允许输出能量高于输入以主动恢复语音谐波结构。在 VoiceBank-DEMAND 去噪测试(\(T\_\{60\}=0\.25\)s,\(\\lambda^2=\\infty\))中 ASE-TM 取得宽带感知语音质量评估 Perceptual Evaluation of Speech Quality(PESQ)2.98,明显高于最强基线注意力循环网络 Attentive Recurrent Network(ARN)的 2.45和传统滤波基线 THF-FxLMS 的 2.37。该结论目前仅在合成主次路径与固定麦克风扬声器布局下验证,强非线性扬声器与未知房间的外推能力尚未证明。原文未披露训练、推理或部署成本的实测细节。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
437. 低码率先保低频:HARP 用分组残差让 RVQ 按频率分工
英文题目:HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs
标签:#向量量化 #音乐 #语音 #音频编码
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频编码 | 主方法:#向量量化
👥 作者与机构
- Qiaoyu Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Lixing He:机构信息未能从会议 PDF 纯文本可靠映射
- Binyue Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Weifeng Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
神经音频编解码以波形为输入、以离散token及重建波形为输出,需支持截断码本实现可变码率,实际难点是标准残差量化各阶段频谱纠缠使截断去除不可预测的频率混合,且谐波相位相干被破坏会导致音色空洞。谐波感知残差划分HARP将9个量化阶段划分为3-2-2-2共4个频率递增组,为低频基音分配更多码本以确立感知基础,其分组累积隐变量作为下一步解码的上下文输入。各组增量经停梯度隔离后接受可学习高斯梅尔权重软带监督以实现频谱分工而不施加矩形截断,相对并行频带分解保留了跨带可见性,相对均匀残差量化明确了频率优先级。组丢失训练使低频组恒在而高频组随机缺失,迫使高频泛音始终在前缀低频上下文中经共享解码器累积重建,从而保证低码率截断仍有结构化频谱层次。在MUSDB18-HQ音乐测试集7.7 kbps评测条件下,HARP的SI-SDR为9.22 dB,高于DAC的SI-SDR 8.97 dB。该结论适用边界受限于44.1 kHz DAC主干与音乐语音通用三类测试分布,跨采样率与强混响等失败条件尚未验证。训练成本因每组额外组级解码前向而增加约2-3倍耗时,推理开销与标准残差量化完全一致而无额外部署负担。
🔗 开源资源
- 代码相关资源:https://github.com/QiaoyuYang/HARP — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
438. 语音帧率贴近文本才好推理:冻结大模型下 4.17 Hz 与中间层对齐的取舍
标签:#向量量化 #大语言模型 #语音识别 #音频问答 #文本到语音
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#向量量化
👥 作者与机构
- Zhen Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Xu Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Yiming Li:机构信息未能从会议 PDF 纯文本可靠映射
- Guangyan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Chimin Chan:机构信息未能从会议 PDF 纯文本可靠映射
- Haohe Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengxi Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Hongzhan Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Zheqi Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Xinshen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Peiwen Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Qiuqiang Kong:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Xue:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理纯语音问句到纯语音回答的口语问答,输入为连续语音问句而输出为语音回答,难点是50 Hz语音序列约为同义文本长度的15倍,冻结文本大模型难以复用原有推理动态。第一步由冻结Whisper-Large-v3编码器抽取50 Hz特征并经步幅卷积下采样至目标帧率,再用分组有限标量量化压缩为离散语音token,输出的紧凑序列进入第二步。第二步冻结Qwen3主干并只训练输入投影器,以中间层InfoNCE将语音与文本的utterance级表征拉近,使语音条件分布逼近文本推理流形,其对齐后表征进入第三步。第三步以非自回归音频头并行预测分组token实现文本到语音与语音到语音生成,相对固定大码本的单向量量化,分组因式分解避免了低帧率下指数级词表爆炸并保持600 bits/s信息率恒定,具有可扩展的实际意义。在SeedTTS test-en评测下,Ours(25 Hz)的WER为3.04,低于CosyVoice2(25 Hz)的WER4.10。固定600 bits/s从50 Hz扫至2.08 Hz时识别呈U形而问答呈倒U形,最优点在4.17 Hz附近,表明过长或过短序列均不匹配文本原生推理节奏。该结论适用边界受限于LibriSpeech朗读英文与InstructS2S-200k问答语料,极低帧率下推理仍会恶化且尚未验证噪声对话与多语种外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
439. 从文字直接生成发音器官运动:STArK 用伪标签 EMA 搭起文本到调音的桥
英文题目:STArK: Towards Synthesizing Articulatory Kinematics from Text
标签:#生成模型 #发声与构音 #语音 #文本到语音
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#生成模型
👥 作者与机构
- Xavier Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Carlos Busso:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为无标注字素文本,输出为归一化模板空间下的12维电磁发音图轨迹加基频与响度,并进一步经冻结声码器可听化为波形,难点在于缺乏大规模文本配对构音数据且需解耦音色与发音内容。方法链第一步由字素转音素与前馈Conformer音素编码器将音素序列编码为上下文相关的音素表示,为对齐提供统一输入。第二步由无监督对齐器以维特比硬对齐抽取真实时长监督时长预测器,训练用对齐时长、推理用预测时长对音素表示做时长扩展实现时间调节。第三步由同构前馈Conformer构音解码器逐帧回归14维构音特征,再送入冻结SPARC声码器结合说话人嵌入合成波形。与以往需真实构音做条件的做法不同,该工作直接学习文本到构音映射,以语句中值对数归一化基频实现训练时无需说话人嵌入的多说话人泛化,推理时按目标说话人中值反归一化做音色克隆。在LibriTTS-R test-clean上基础模型词错率为6.25,高于SPARC重合成的3.31和YourTTS的4.58,自然度MOS为2.8,加入真实韵律后升至3.3。该结论适用边界受限于英语干净朗读语音,韵律建模仍是失败条件,跨语言、噪声、自发语音与真实EMA一致性尚未验证。原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
440. 一维嗓音噪声系数为何不能用一个常数走天下:以三维流动为尺校准/a/与/u/
英文题目:Noise Scaling Factor for the One-Dimensional Voice Production Model
标签:#信号处理 #模型比较 #发声与构音 #语音 #语音合成
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#信号处理
👥 作者与机构
- Tsukasa Yoshinaga:机构信息未能从会议 PDF 纯文本可靠映射
- Takeshi Ikuma:机构信息未能从会议 PDF 纯文本可靠映射
- Brad H. Story:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究针对嗓音产生中气流噪声建模,输入为声门流量与声道截面形状,输出为口端辐射声压,难点在于一维模型无法分辨声门湍流射流与壁面收缩诱发的附加声源。方法链第一步采用三维可压缩Navier-Stokes方程结合体积罚方法与双质量块声带模型同步求解流固耦合振动与声传播,获得含湍流脉动的基准声场与声门流量U3D。第二步将该U3D作为入口体积速度馈入由44段波导构成的一维Tube Talker模型,计算共振、黏性损耗与活塞辐射以复现无空间湍流分辨的声压谱。第三步按Fant公式叠加经雷诺数调制的带通随机噪声流量,并扫参缩放因子α使三维与一维口端压力谱的平均频谱差异最小,从而反推与流态匹配的校准值。与沿用固定经验常数的已有做法不同,该校准将噪声强度与声门闭合状态及声道收缩位置关联,揭示了收缩诱发额外声源时需增大缩放因子的实际意义。在元音/u/自持振荡比较设置下,Ag0=0 mm2条件的基频指标为160 Hz,低于Ag0=1.0 mm2条件的基频指标162 Hz。结论限于 /a/ 与 /u/、常数肺压与双质量块声带,尚未验证其他元音、病理嗓音或连续语流的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://sites.arizona.edu/sapl/research/le-talker/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
441. 先对准方向再补细节:AURA 用两阶段把单声道变成双耳声
标签:#流匹配 #空间音频信号 #语音 #空间音频渲染
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#流匹配
👥 作者与机构
- Wenjie Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Changjun He:机构信息未能从会议 PDF 纯文本可靠映射
- Yinghan Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Shiyun Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Mingjiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务以单声道音频与声源位置姿态序列为输入,直接合成双耳波形,难点在于单声道缺失头间级差与时差线索,且混响与环境微细节呈随机弱信号难以从内容推断。方法链分三步:先用时间动态规整对齐单声道内容与几何运动,再经混合Transformer-CNN下采样块提取全局与局部表征并由空间增强残差上采样块融合多阶段姿态条件生成粗粒度双耳估计,粗估计加噪作为先验起点进入下一步。最后条件流匹配网络以加噪估计与时刻及姿态序列为条件学习最优传输直线路径上的恒定速度场,并用10步定步长Euler求解器积分得到精修双耳波形。相对BinauralGrad类随机扩散逆过程,关键差异是用显式姿态条件的连续时间流匹配替代扩散生成,使训练退化为稳定速度回归并更好补足声传播细节与空间微线索。在KEMAR基准测试集下,AURA的Wave-L2指标为0.123,低于BinauralGrad的Wave-L2指标0.128。结论适用边界受限于2小时KEMAR人头1.5米内近场语音语料,尚未验证对多说话人、音乐、强混响与未见头型的外推能力。在计算量方面,AURA的参数量为11.26M,乘加运算量为759.17M,训练成本为300000步余弦退火训练。
🔗 开源资源
- 演示资源:https://ethuil.github.io/AURA/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
442. 把音色抽出来、把冗余帧并起来:DySTCodec 如何做低码率双流语音离散化
标签:#向量量化 #语音 #语音编码 #语音转换
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Boyang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yechang Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Xuerui Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyue Jiang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低码率语音令牌化输入为16kHz波形,输出为单码本语义令牌与固定全局说话人令牌,实际难点是固定帧率在静音元音段浪费帧且内容音色纠缠加重语言模型负担。全局通路从原始波形提取时不变音色并经查询聚合与FSQ量化成32个令牌,语义通路先做音色扰动再送入冻结Wav2Vec2.0提取内容韵律特征并按余弦相似度合并冗余帧。合并后语义潜变量与全局音色经融合网络拼接,上一步输出经自适应解聚合恢复50Hz基帧率并以轻量精炼平滑边界,最后由卷积声码器重建波形,与BiCodec相比以扰动防泄漏与内容自适应合并替代均匀降采样降低有效码率。在LibriSpeech test-clean上,50 Hz固定帧率版本以0.70 kbps取得词错率6.09%、STOI 0.92、PESQ 2.51、UTMOS 4.13与说话人相似度0.85,40 Hz动态版本以0.57 kbps取得6.12%、0.90、2.48、4.10与0.85,接近固定版本质量但码率明显更低。语音转换从LibriSpeech转到VCTK时50 Hz版本词错率6.82、相似度0.75,明显高于BiCodec的6.91与0.46。在LibriSpeech到VCTK跨数据集语音转换任务下,DySTCodec的SECS从BiCodec的SECS 0.46升至0.75。该结论仅在16 kHz英语朗读与跨数据集转换有限设置下成立,噪声、混响、自发口语及多语言外推尚未验证。原文未披露学习率、训练时长与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
443. 给 Whisper 加一句可验证的开头:用锚音频同时压制幻觉与装满 30 秒窗口
标签:#信号处理 #高效推理 #环境声 #语音 #语音识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#信号处理
👥 作者与机构
- Prateek Agarwal:机构信息未能从会议 PDF 纯文本可靠映射
- Saurabh Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Priyanka Bhatt:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别在真实对话中需转写1秒至5秒短语音,但Whisper的30秒固定窗口在静音与环境噪声上易产生幻觉转写并浪费算力。作者提出音频锚点链:先用语音活动检测粗筛语音段以滤除非语音,再在每段输入前拼接低领域出现率的特定锚音频与2.0秒静音间隔,其拼接输出进入Whisper统一解码。解码后检查锚文本是否存在以判定可信度,批量模式下以锚文本计数校验切分位置,若计数不符则自动回退到单条增强重算以保证鲁棒性。该机制与文本提示或微调抑幻不同,它用声学前置解码提供自回归约束并兼作可验证分隔符,无需改动模型即可同时实现幻觉检测与安全拼接。在包含零售语音与 UrbanSound8K 等共 33233 条样本的评测中,批量回退策略将总体词错率(Word Error Rate,简称 WER)从 32.18% 降至 13.23%,环境音频幻觉错误率(Hallucination Error Rate,简称 HER)从 72.2% 降至 0.14%。其适用边界受限于英语1至5秒短语音与Whisper模型的验证范围,失败条件包括长于10秒语音收益递减与批量校验失败需回退,跨编码器解码器架构与多语种部署尚未验证。推理延迟方面批量回退在并发32时P95延迟为566毫秒,与单条锚点相当并在校验成功时保持高吞吐,该方案无需模型微调故无额外训练成本即可部署于GPU推理框架。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
444. 把费力与清晰拆成两个旋钮:用双轴控制合成伦巴德语音
英文题目:Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS
标签:#流匹配 #主观评测 #语音 #语音可懂度评估 #文本到语音
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Seymanur Akti:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Waibel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入文本与目标发声努力(Vocal Effort,记为 \(\\alpha\))和发音清晰度(Articulation,记为 \(\\beta\))等级,输出在噪声下仍可懂的伦巴德(Lombard)风格语音,难点在于响度、谱倾斜、语速与超发音需协同变化且保持自然度。首先将Expresso风格类映射为发音与努力伪标签并经线性层得到连续嵌入,与说话人嵌入拼接后送入编码器。其次同一联合嵌入分别广播至时长预测与流匹配声学解码器,实现时间与频谱韵律的双路调制。推理时通过标量插值实现话语级连续调节,并对目标词赋高清晰度值实现词级强调。与仅做均方根(RMS)增益加线性拉伸的基线不同,该机制同时改变音素时长、元音分散与高频能量分布。在Harvard Sentences评测条件下,所提方法的词错误率(Word Error Rate,WER)为0.51%,低于基线方法的词错误率(Word Error Rate,WER)2.56%。结论限于英语朗读句与模拟加噪,外推至真实对话修复与听损人群尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://seymanurakti.github.io/synthesizing-lombard-effect/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
445. 转录错还是问法本身不可答:WASIL 把阿拉伯语语音交互的差评拆开看
英文题目:WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
标签:#数据集 #数据标注 #大语言模型 #语音识别 #语音交互
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音交互 | 主方法:#数据标注
👥 作者与机构
- Zien Sheikh Ali:机构信息未能从会议 PDF 纯文本可靠映射
- Hamdy Mubarak:机构信息未能从会议 PDF 纯文本可靠映射
- Soon-Gyo Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Hunzalah Hassan Bhatti:机构信息未能从会议 PDF 纯文本可靠映射
- Firoj Alam:机构信息未能从会议 PDF 纯文本可靠映射
- Shammur Absar Chowdhury:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理阿拉伯语口语经级联ASR转写后送入LLM作答的真实交互,输入为含方言变体与噪声的语音,输出为助手回答及用户点赞或点踩,难点在于转写错误与提示本身模糊或域外相互混淆。方法链先采集约9304轮93人语音并记录点踩细粒度原因,再用Fanar Aura初转写后由同方言标注员全量后编辑2573轮以生成金标准转写与方言标签,接着由三人多数投票标注四类内在可回答性,最后用无参考LLM裁判比较ASR转写、金标准转写与直接音频输入下的回答质量。与已有语音助手基准多用curated任务不同,该设计把自然dislike与转写不确定性直接关联,能区分转写失败与内容失败,具有运行时诊断意义。在DZ方言测试集下,Gemini-ASR输入的APR为80.00%,从音频输入的APR 66.28%升至80.00%。结论仅适用于阿拉伯语系方言与所测级联管线,对其他语言与端到端模型的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/QCRI/WASIL — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
446. 听错的词捡不回来:用音频关键词门控从纠错记忆里取回该改的那几条
英文题目:Audio-KWS-Gated Error Memory Retrieval for Incremental ASR Post-Correction
标签:#检索增强 #大语言模型 #语音识别 #关键词检测
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#检索增强
👥 作者与机构
- Taira Ashikawa:机构信息未能从会议 PDF 纯文本可靠映射
- Daichi Hayakawa:机构信息未能从会议 PDF 纯文本可靠映射
- Takehiko Kagoshima:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
长期增量式ASR后纠错的输入为当前分段音频与含错的ASR假设文本,输出为保留填充词且仅做最小编辑的校正转写,实际难点是长期积累的历史纠错记录迅速超出LLM上下文窗口,而仅按噪声假设文本检索会在触发词本身被误识时漏掉相关历史。该方法先由LLM对比历史假设与人工参考抽取假设片段-参考短语对及读音索引并沉淀为错误记忆与倒排索引,再用开放词表音频关键词检测对当前音频打分并经阈值与Top-N筛选出相关关键词对应的记录子集,最后将该子集的短语对应关系作为编辑提示交由LLM做受约束改写。与全历史提示和纯文本检索相比,关键差异是以声学匹配而非假设文本决定调用哪条记忆,切断了误识词阻断检索的循环依赖,日语以读音建索引进一步缓解汉字字形与发音不一致的检索失配,从而在可控提示长度下复用历史经验。在Earnings-21偏置词子集417条话语上Top-20检索相对近期历史基线将词错误率(Word Error Rate, WER)从29.06降至28.92并实现70.9%微平均提示压缩,在CSJ偏置词子集442条话语上Top-10将字错误率(Character Error Rate, CER)从14.86降至14.62。该结论仅适用于含高频易错专有名词的离线分段纠错回放,未验证关键词漏检严重、记忆快速膨胀或跨领域迁移时的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/openai/whisper-large-v3 — 暂时无法访问
- 第三方资源:https://huggingface.co/openai/whisper-medium — 暂时无法访问
- 第三方资源:https://github.com/revdotcom/fstalign — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
447. Harf-Speech:把阿拉伯语音素识别与临床评分拆成可核对的四段流水线
英文题目:Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
标签:#人类参与评测 #SFT #语音学与音系 #语音 #病理语音评估
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#病理语音评估 | 主方法:#SFT
👥 作者与机构
- Asif Azad:机构信息未能从会议 PDF 纯文本可靠映射
- MD Sadik Hossain Shanto:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Sadat Hossain:机构信息未能从会议 PDF 纯文本可靠映射
- Bdour Alwuqaysi:机构信息未能从会议 PDF 纯文本可靠映射
- Sabri Boughorbel:机构信息未能从会议 PDF 纯文本可靠映射
- Yahya Bokhari:机构信息未能从会议 PDF 纯文本可靠映射
- Abdulrhman Aljouie:机构信息未能从会议 PDF 纯文本可靠映射
- Ayah Othman Sindi:机构信息未能从会议 PDF 纯文本可靠映射
- Ehsan Hoque:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理现代标准阿拉伯语朗读发音评估,输入为参考文本与朗读录音,输出为0到5分临床量表上的话语级发音分数与词级音素反馈,难点在于咽化音、喉音与短元音敏感且缺乏经言语语言病理学家验证的开放工具。基于MSA的发音词典生成规范音素序列并归一化为Harf音素集,作为期望真值进入后续比较。微调后的语音到音素模型将录音直接解码为实际音素序列,默认骨干为OmniASR-CTC-1B-v2,其输出与期望真值一同送入对齐阶段。大语言模型按词切分后用Levenshtein距离完成音素对齐得到替换、删除与插入,并行计算最长公共子序列比率与基于编辑距离的准确率、完整率,再以经验权重融合并映射到0到5分。与专有端到端评估的关键差异在于显式保留参考生成与可审计对齐,每个扣分可追溯到具体音素操作而非黑盒似然。在40例三位专家评分的评测设置下,Harf-Speech的PCC为.791,高于Azure的PCC .635。该结论仅在朗读MSA与轻中度偏差范围内有效,自发对话、方言、儿童言语及重度障碍尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
448. 词错率超过 100% 时不是识别差而是写错了文字:南亚低资源语音识别的失败解剖
英文题目:Dissecting ASR Failures in Low-Resource South Asian Languages
标签:#评测协议 #模型评估 #低资源 #多语言 #语音识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Abdul Hameed Azeemi:机构信息未能从会议 PDF 纯文本可靠映射
- Ihsan Ayyub Qazi:机构信息未能从会议 PDF 纯文本可靠映射
- Maryam Mustafa:机构信息未能从会议 PDF 纯文本可靠映射
- Agha Ali Raza:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理乌尔都语、旁遮普语、普什图语和辛迪语4种南亚语言的语音到文本转写,难点在于波斯阿拉伯文字变体混淆、拼写非标准化、跨文字命名实体与极端资源不均。方法链分3步推进:第一步在通用语音22.0与FLEURS上对5个多语言模型做零样本解码,输出原始转写文本以暴露跨文字输出问题。第二步用jiwer计算词错率并按11类错误分类法分解编辑操作、命名实体与长度效应,其分类结果进入下一步作为可修复性判断依据。第三步对波斯阿拉伯统一码归一化与规则转写后处理做消融,量化其在不重训条件下可恢复的文字层伪误差。与仅报总体词错率的已有评测相比,该框架区分了声学失败与文字层伪误差,具有诊断意义。在Common Voice旁遮普语评测下,经规则转写后处理的Whisper-medium的WER为79.7%,低于转写前Whisper-medium的WER104.7%。结论限于朗读式短语音与零样本推理,未验证微调与自发代码混合场景。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/jitsi/jiwer — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
449. 口音来时才出手:用混合口音适配器让冻结的 Whisper 按需特化
英文题目:Mixture-of-Accent-Adapters for Robust ASR: Injecting Accent Cues into Pretrained Whisper
标签:#Adapter #混合专家模型 #多任务学习 #语音识别
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#混合专家模型
👥 作者与机构
- Mehedi Hasan Bijoy:机构信息未能从会议 PDF 纯文本可靠映射
- Yaroslav Getman:机构信息未能从会议 PDF 纯文本可靠映射
- Tamás Grósz:机构信息未能从会议 PDF 纯文本可靠映射
- Mikko Kurimo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口音鲁棒自动语音识别(Accent-Robust ASR)的输入为带地域或非母语发音偏移的英语语音,输出为转写文本,难点在于单一均匀表示难以覆盖发音变异而全量微调成本高且易破坏预训练稳定性。该工作构建混合口音适配器(Mixture-of-Accent-Adapters,MoAA)链条:先由均值池化加线性投影形成控制瓶颈并预测口音度与口音后验,再用后验对可学习软口音码本(Soft Accent Codebook)加权检索并与非口音词向量门控融合注入编码器,接着由条件表示经路由器(Router)分配瓶颈适配器组实现按需 specialization,最后以同一口音度门控融合冻结主干与适配输出并用确定性幻觉过滤(Deterministic Hallucination Filtering,DHF)清理病态解码。与常开条件或常关不变表示不同,该机制仅在判定为带口音时才调用额外容量并保持推理时无需真实口音标签。在 AESRC 测试集上 MoAA 加 DHF 达到词错误率(Word Error Rate,WER)7.49% 与字错误率(Character Error Rate,CER)3.81%,相对单适配器加 DHF 基线分别降低约 26.9% 与 38.0%。其结论限于训练口音闭集内的英语评测,未验证未见口音与多语扩展,且重度依赖后处理对重复型错误的修正。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
450. 一个编码器同时记住说了什么和是谁说的:语义与说话人表示的联合后训练
英文题目:Learning Multiple Utterance-Level Attribute Representations with a Unified Speech Encoder
标签:#知识蒸馏 #多任务学习 #音频检索 #说话人验证
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#多任务学习
👥 作者与机构
- Maryem Bouziane:机构信息未能从会议 PDF 纯文本可靠映射
- Salima Mdhaffar:机构信息未能从会议 PDF 纯文本可靠映射
- Yannick Estève:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音话语级属性表示学习,输入为多语言原始语音,输出为语义与说话人两种ℓ2归一化话语向量,难点在于单一编码器只对齐文本语义空间会压制说话人等副语言信息。共享语音编码器先联合提取多层帧级隐表示,各属性分支再对所选层做线性投影、可学习层插值加权、层归一化与注意力池化,得到话语向量后与冻结教师对齐。相对单语义蒸馏的SENSE框架,关键差异是新增多分支投影与原来没有的显著层自适应加权,使编码器保持通用而分支负责特化。在VoxPopuli法语到英语语音到语音检索上多任务模型Recall@1为95.94%,接近单语义基线的96.55%并高于SONAR的91.91%;在VoxCeleb1-O上等错误率为0.91%,接近ECAPA-TDNN教师的0.90%。该结论的适用边界受限于语义加说话人两任务与检索加验证场景,情感、语言、口音等更多属性的可扩展性尚未验证。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
451. 回答对了没有:为什么音频问答需要同时看文字和声音
英文题目:AURA Score: A Metric for Holistic Audio Question Answering Evaluation
标签:#基准测试 #评测协议 #人类参与评测 #音频问答
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#评测协议
👥 作者与机构
- Satvik Dixit:机构信息未能从会议 PDF 纯文本可靠映射
- Soham Deshmukh:机构信息未能从会议 PDF 纯文本可靠映射
- Bhiksha Raj:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
开放式音频问答(Audio Question Answering, AQA)要求模型依据音频片段回答自然语言问题并生成自由文本,传统借自机器翻译与音频字幕的 n-gram 与嵌入相似度指标只比较回答与参考的表层重叠,无法处理问题语境、部分正确与长回答推理。作者先构建 AQEval 基准,再用大语言模型(Large Language Model, LLM)语境打分判断问答正确性,接着把问题与回答改写为陈述假设并用对比音频语言模型(Contrastive Language-Audio Pretraining, CLAP)计算音频蕴含,最后以加权归一融合得到 AURA(Audio Response Assessment)分数。与纯文本指标的关键机制差异是同时引入问题条件推理与音频证据接地,而非仅做回答到参考的相似度匹配。在 AQEval 上 AURA 总体相关达 61.80,相对最强传统指标 METEOR 的 27.86 实现约 2.2 倍提升,在 ClothoAQA 总体以 72.62 超过 LLM 基线的 62.59,相对提升 16.02%,在 OpenAQA 总体以 45.44 超过 43.56。该结论限于 Clotho 与 AudioCaps 来源音频及 4 类音频大模型(Audio-Language Model, ALM)回答,未验证音乐、对话与强蕴含模型下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
452. 延迟云端来帮忙:用空间统计稳住低算力多通道语音增强
英文题目:Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement
标签:#波束成形 #麦克风阵列 #端侧运行 #语音增强
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#波束成形
👥 作者与机构
- Xulin Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Azcarreta:机构信息未能从会议 PDF 纯文本可靠映射
- Ashutosh Pandey:机构信息未能从会议 PDF 纯文本可靠映射
- Jesus Alvarez:机构信息未能从会议 PDF 纯文本可靠映射
- Ke Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Jacob Donley:机构信息未能从会议 PDF 纯文本可靠映射
- Ritwik Giri:机构信息未能从会议 PDF 纯文本可靠映射
- Buye Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多通道语音增强输入为8通道含混响噪声短时傅里叶变换谱,输出为目标语音波形,难点是低算力边缘模型在低信噪比下掩蔽估计不准、波束成形随之崩溃。第一步由冻结的因果空间网络处理多通道输入,产生延迟增强复数谱与4层中间表征并经延迟传输至边缘,其输出进入下一步作为参考与引导。第二步边缘轻量门控循环网络将延迟谱与多通道输入拼接做空间卷积降维,经3层分裂门控循环单元估计复数掩蔽得到初始目标,同时接受云端分层特征的特征线性调制引导,其目标估计进入下一步做统计融合。第三步对双边目标估计各自计算互协方差向量后经逐帧自适应权重融合,再做时变递归平滑并求解多通道维纳滤波系数作用于当前帧。与仅做延迟输出条件的前人知识助推相比,关键差异是同时传递层级表征与可融合的二阶空间统计,对延迟更鲁棒,该优势受限于仿真房间与固定阵型验证。在标准条件测试集下,完整框架的SI-SDR为5.74 dB,高于边缘基线TinyGRU+MCWF的SI-SDR 1.97 dB。结论限于仿真房间、固定阵型与 64 ms 至 128 ms 延迟区间,未验证真实设备、移动说话人与丢包抖动。边缘侧仅增 1.5% 参数量与 2.4% 乘加运算,未披露端侧实测时延与功耗。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
453. 开集噪声下说话人确认:用时间平滑阈值选样本、用邻居混合标签纠偏
标签:#弱监督学习 #鲁棒性 #语音 #说话人验证
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#弱监督学习
👥 作者与机构
- Zhihua Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Shumei Tao:机构信息未能从会议 PDF 纯文本可靠映射
- Liang He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证需从试听提取判别性声纹并判定是否同人,大规模采集混入闭集与开放集错误标注,开放集真值不在标签集内使单标签纠错仍误导训练。方法分三步衔接:先在全集预热训练获得基础判别力与初始嵌入,再计算样本嵌入与类原型的余弦相似度并拟合双组分高斯混合模型取交点为单轮阈值。接着对历轮阈值做指数滑动平均得到时间集成阈值以划分干净集与噪声集,干净集只用原始标签训练增强判别力,划分结果直接决定噪声集的后续监督方式。噪声集由均值教师输出选Top-K近邻类别并加权混合为软监督,高置信样本只取单个近邻,从而避免强行指定单一错误身份,相对单轮阈值与单标签纠错以时序平滑抑制波动、以分布混合容纳不确定性。在 VoxCeleb1对称50%噪声下 Vox-O 评测中 TET-LM 等错误率(Equal Error Rate,EER)为4.04%,相对基线 Standard 的13.71%大幅下降并优于最强基线 ES-GMM 的4.66%,平均 EER 相对 Standard 下降54%、最小检测代价(minimum Detection Cost Function,minDCF)下降42%。该结论限于人工对称与非对称同性别翻转噪声及 VoxCeleb 系列,在 Vox-E/Vox-H 部分条件下优势收窄或反转,未在真实网络噪声和跨信道场景验证。原文未披露完整训练时长与推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
454. 不听声音只看嘴:把对齐走成一条单调最优路径
英文题目:V-Align: Visual Forced Alignment via Phoneme to Video Optimal Path Traversal
标签:#多模态学习 #弱监督学习 #强制对齐 #静默语音接口
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#强制对齐 | 主方法:#多模态学习
👥 作者与机构
- Souvik Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
- C. V. Jawahar:机构信息未能从会议 PDF 纯文本可靠映射
- Vinay Namboodiri:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
视觉强制对齐(Visual Forced Alignment,VFA)输入为静音说话人脸视频与已知转写文本,输出为词级或音素级起止时间戳,难点在于无音频时唇动模糊、音素边界不清且缺乏可靠监督。V-Align 先用冻结的视觉 Transformer 池化(Visual Transformer Pooling,VTP)唇动编码器与 XPhoneBERT 音素编码器提取特征,再经可训练堆叠一维卷积模态适配模块映射到共享空间,基于高斯距离核构建帧-音素兼容格点并经逐帧 Softmax 得到柔性遍历后验,最后用维特比风格动态规划解码全局最优单调路径得到离散边界。训练分两阶段:Stage 1 用前向和损失与路径二值化损失学习全局单调结构,无需边界标注;Stage 2 因 MFA 音素库存与分词器不一致,将音素后验按词聚合后用 MFA 词边界做词级监督精修。在 LRS2 上 Stage 2 达到 32.9 ms 平均绝对误差与 91.2% 帧准确率,在 LRS3 上达到 56.9 ms 与 88.5%,相对此前最优的 He 等方法分别降低 17.3 ms 和 13.6 ms。该结论限于英语新闻与演讲类 LRS2 与 LRS3 及以 MFA 为真值的评测,未验证多语、遮挡、侧脸或自发对话外推。原文未披露训练时长、显存占用与推理延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
455. 角色比说话人更难认:让 ASR 先定词,再同步判定每个词的医生或患者身份
标签:#医疗音频 #端到端学习 #语音识别 #说话人分离标注
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#端到端学习
👥 作者与机构
- Arindam Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Fuhs:机构信息未能从会议 PDF 纯文本可靠映射
- Bongjun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Anurag Chowdhury:机构信息未能从会议 PDF 纯文本可靠映射
- Monika Woszczyna:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向医患对话的联合语音识别与说话人角色分类要求输入连续语音并同步输出词序列与每个词的角色标签,难点在于短应答缺少文本区分线索且声学与语义需联合判定。方法链分为三步:先冻结已训练的混合自回归换能器并保留其空白概率以实现词级同步,其次将角色分类编码器输入由语音识别编码器中间层改为第12层高层以引入更多词级语言特征并为角色分类单独配置长上下文循环预测器,最后沿强制对齐的1-best路径用交叉熵训练角色分支并在语音识别出非空时取最大角色。与串行插入角色词的Role-ASR和直接复用说话人分离标注结构的基线相比,关键差异在于承认角色分类更依赖语言而非声学并解耦预测器与编码层级。在内部DoPaCo评测集35.0小时上最终系统基于角色的词分类错误率R-WDER为6.1,相对最强基线Role-ASR的6.5降低6.2%,词错误率WER以15.67优于16.03;在微调后SiMeCo评测集8.5小时上R-WDER为2.1,相对2.2降低4.5%。该结论在两角色近场仿真数据上外推有限,作者自承SiMeCo干净无重叠不能反映真实挑战,且未验证重叠与多人其他角色下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
456. 仿真越像真实房间,多通道增强在实测上错得越少
英文题目:Improving Multichannel Speech Enhancement through Accurate Room-Acoustic Simulations
标签:#数据增强 #麦克风阵列 #语音 #语音增强
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音增强 | 主方法:#数据增强
👥 作者与机构
- Georg Götz:机构信息未能从会议 PDF 纯文本可靠映射
- Alessia Milo:机构信息未能从会议 PDF 纯文本可靠映射
- Steinar Guðjónsson:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Gert Nielsen:机构信息未能从会议 PDF 纯文本可靠映射
- Jesper Pedersen:机构信息未能从会议 PDF 纯文本可靠映射
- Finnur Pind:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多通道语音增强以阵列录音为输入并输出直达声目标语音,需在混响与重叠说话下保持下游识别可用性。本文固定增强器为 SpatialNet-small,对比图像声源法与混合波基仿真增强的训练效果。方法链分为三步:先用不同保真度仿真生成房间脉冲响应,再将其与干净语音卷积并叠加扩散噪声构造多说话人场景,最后训练同一网络并在实测 Eigenmike 数据上用 Kaldi 识别评估。与已有工作相比,关键在于引入交叉频率以下波求解器与刚性球散射建模,补足几何声学缺失的模态与衍射效应。在包含 60 个会话的 LibriCSS-EM6 实测集上,混合仿真模型在 40%重叠条件下相对非知情图像声源模型取得 38.3%的中位词错率相对下降,相对知情图像声源模型取得 23.5%相对下降。结论目前仅限于 6 通道 Eigenmike 子阵与英语朗读场景,未验证其他阵型与移动说话人、强非稳态噪声下的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
457. 不用姿态也能对上拍:PF-D2M 以视频视觉特征做通用舞蹈配乐
英文题目:PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation
标签:#扩散模型 #多模态学习 #主观评测 #音视频 #音乐生成
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音乐生成 | 主方法:#扩散模型
👥 作者与机构
- Jaekwon Im:机构信息未能从会议 PDF 纯文本可靠映射
- Natalia Polouliakh:机构信息未能从会议 PDF 纯文本可靠映射
- Taketo Akama:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
舞蹈到音乐生成需从无声舞蹈视频生成时间对齐的立体声音乐,难点是依赖单人 3D Skinned Multi-Person Linear model(SMPL)或 2D 关键点的已有方法在多人遮挡与 2D 或 3D 非人类舞者下失效,且 AIST++ 仅 60 首曲目导致记忆过拟合与视角单一。该工作提出 Pose-free Diffusion Model for Universal Dance-to-Music Generation(PF-D2M),直接用 Synchformer 视觉编码器特征驱动潜变量扩散变换器(Diffusion Transformer,DiT)生成,并用渐进训练解决数据稀缺:阶段 0 以文本到音频模型 Stable Audio Open 初始化以保留多样音乐先验,阶段 1 在约 500 小时 VGGSound 上学习野外视听同步,阶段 2 在 AIST++ 舞蹈配对加 FMA 与 MoisesDB 纯音乐加 VGGSound 按 2比4比1 混合微调以恢复连贯乐曲结构。输入为 25 fps 舞蹈视频与描述流派乐器情绪的文本提示,输出为 44.1 kHz 立体声音乐。在 AIST++ 未见曲目 mBR0、mMH0、mLO2、mJB5 测试划分上,PF-D2M 第二阶段模型 F1 达到 94.3,超越 LORIS 的 92.5 与 Text-Inv 的 85.5,Beat Hit Score(BHS)达 99.8,同时 20 视频野外主观评测在对齐与质量上全面领先。其适用边界为训练随机裁 7.98 秒片段、评测截 5.12 秒,长时结构、多镜头剪辑与极端视觉条件尚未充分验证。原文未披露训练推理部署成本。
🔗 开源资源
- 第三方资源:https://github.com/open-mmlab/mmpose — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
458. 快慢不同步:用双路径分别建模倾听者反馈的出现时机
英文题目:DP-BCT: A Dual-Path model for predicting BackChannel Timing
标签:#多任务学习 #统计分析 #单通道 #语音 #轮次切换
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#轮次切换 | 主方法:#多任务学习
👥 作者与机构
- Jin Yea Jang:机构信息未能从会议 PDF 纯文本可靠映射
- Saim Shin:机构信息未能从会议 PDF 纯文本可靠映射
- Gahgene Gweon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理听者反馈时机预测,输入为20 s单通道语音,输出为每帧是否出现反馈及其功能类别,难点在于不同功能相对可反馈时机点Backchannel Opportunity Point / BOP的延迟分布差异很大。以BOP为零点定义到标注起始的有符号延迟,Cox比例风险检验显示慢组相对接触感知类的瞬时响应率显著更低,印证快慢分组存在延迟异质性。方法链分为两阶段:先用说话人语音活动监督微调韩语HuBERT编码器以适配轮次结构,再冻结编码器训练BOP头、快慢双路Transformer与帧级预测器,最终输出100帧上的5分类标签,即无反馈Neg与接触感知CP、理解CPU、评估A、情感E四类功能。其中BOP头提供时机锚点,快路聚焦接触感知类锐峰式快速响应,慢路覆盖理解、评估与情感类宽分布延迟响应,最终融合为统一帧级预测目标。相对单路共享建模,结构解耦为快慢类别提供了不同时间依赖的归纳偏置,减少了多任务优化干扰。在115 h韩语双人对话K-MIND上的帧级评测中,相对单路基线Macro-F1从0.4862提升至0.6254,相对提升28.6%。该结论目前仅在韩语声学单模态与固定沉默阈值下成立,未验证跨语言与多模态外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
459. 编码器任务决定 FAD 能看见什么:四轴拆解下的精度与对齐权衡
英文题目:An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
标签:#评测协议 #模型评估 #环境声 #语音 #音频生成
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频生成 | 主方法:#评测协议
👥 作者与机构
- Wonwoo Jeong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到音频生成的自动评估以FAD为标准,但其分数随编码器训练任务保留或丢弃的声学特征而系统性漂移,与人耳判断脱节。为此本文将评估解耦为召回、精确率与对齐含语义和结构两维,先对参考集施加目标扰动得到扰动集以界定各编码器的不变集。接着经由六种编码器映射计算参考集与扰动集高斯分布距离,得到各编码器下的原始FAD曲线。最后用对数自归一化消除跨编码器量纲差异以比较敏感度曲线,聚合时对帧级编码器采用均值池化以隔离训练任务效应。该设计区别于以往只报告单一FAD数值的做法,显式分离了类内容忍、信号劣化敏感与条件一致性三类失败,使任务诱导偏置可直接对比。在LibriSpeech与ESC-50扰动套件评测下,AudioMAE的精确率归一化分数为0.463,高于Whisper的精确率归一化分数0.147。结论仅适用于所测扰动套件与均值池化聚合,不宜外推到音乐和谐性或纠缠的真实生成伪影。该结论的适用边界受限于所测扰动类型与语音和环境声语料,尚未验证音乐和谐性等外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
460. 整体自然度打高分却听不出声调错:PASQA 只盯日语重音核对错排序
标签:#自监督学习 #主观评测 #韵律 #语音 #语音质量评估
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#自监督学习
👥 作者与机构
- Masaya Kawamura:机构信息未能从会议 PDF 纯文本可靠映射
- Yuma Shirahata:机构信息未能从会议 PDF 纯文本可靠映射
- Kentaro Mitsui:机构信息未能从会议 PDF 纯文本可靠映射
- Reo Shimizu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
日语语音合成评估需判断输入波形在东京方言下的音高重音正确性,输出1至5分的口音质量分,难点是传统整体自然度分对局部声调核偏移不敏感。所提音高重音聚焦语音质量评估Pitch-Accent-Focused Speech Quality Assessment(PASQA)先用可控文本到语音Text-to-Speech(TTS)系统篡改重音核位置并按错误mora占比生成伪分与帧级标签,再以wav2vec 2.0提取帧级声学特征并与mora序列经Transformer编码与交叉注意力融合。融合表示分三路输出,分别用Bradley-Terry排序损失学相对顺序、帧级二分类定位错误区间、梯度反转层去说话人偏置。在受控重音错误评测条件下,PASQA的顺序准确率为0.785,高于ACC-SSL-MOS的顺序准确率0.738。与仅用L1回归的整体MOS基线不同,该多任务融合迫使模型关注局部核偏移而非说话人或整体自然度,从而在跨说话人上保持排序稳定。该结论限于日语朗读合成与合成错误分布,真实录音口音变体与跨语言韵律尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
461. 录音质量参差、类别极不平衡时,如何让呼吸音分类的边界更清楚:QLung 的质量自适应角度间隔
英文题目:Quality Adaptive Angular Margin Learning for Respiratory Sound Classification
标签:#医疗音频 #正则化 #鲁棒性 #音频分类
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#正则化
👥 作者与机构
- Yoon Tae Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Heejoon Koo:机构信息未能从会议 PDF 纯文本可靠映射
- Miika Toikkanen:机构信息未能从会议 PDF 纯文本可靠映射
- June-Woo Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
呼吸音分类(Respiratory Sound Classification,RSC)的输入是标准化至8秒的呼吸周期对数梅尔频谱,输出为正常(normal)、爆裂音(crackle)、哮鸣音(wheeze)、混合(both)四类,难点是低质录音占比高且尾类极少,混合类同时包含爆裂音与哮鸣音造成细粒度重叠。所提框架QLung先由音频编码器(Audio Encoder,AST或Audio-CLAP)提取嵌入,再经角分类器(Angular Classifier)将特征与类权重映射到单位超球面,随后由双因子角间隔正则化(Dual-Factor Angular Margin Regularization,DFAM)计算自适应惩罚,最后与交叉熵联合优化以同时收紧类内分布并推开类间边界。其中音频质量分支压制低质样本过拟合,不平衡分支稳定抬升尾类间隔,机制是把样本可信度直接编码为间隔大小而非样本权重或分类目标。在ICBHI官方60-40%无病人重叠划分上,QLung on Audio-CLAP得分为63.39%,接近BTS的63.54%;在SPRSound分布外评估上得分为59.80%,明显领先Audio-CLAP的56.29%与BTS的53.42%。该结论仅在两个呼吸音数据集与两类骨干上验证,SPRSound混合类仅31个样本,对其他设备与人群的外推尚未证明。原文未披露训练硬件、推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/RSC-Toolkit/QLung — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
462. 留住旋律、换掉乐器:AdaTT 按目标乐器调节音高与响度控制
英文题目:AdaTT: Text-Guided Instrument Timbre Transfer with Target-Adaptive Structural Control
标签:#Adapter #扩散模型 #音乐 #音乐生成
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音乐生成 | 主方法:#Adapter
👥 作者与机构
- Dabin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Junwon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Juhan Nam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
乐器音色迁移需将单声部演奏音频的乐器身份转为目标乐器,同时保留旋律节奏等乐谱级内容,难点在于基频与响度曲线中混杂着小提琴式颤音等乐器特异的表情细节,强加给目标乐器会造成音色模糊与不自然。所提目标自适应音色迁移 AdaTT 以冻结的 Stable Audio Open 为主干,先经基频与均方根响度双路控制的 ControlNet 注入源结构,再由文本引导的缩放预测器在输入端独立调节两路强度并在输出端调节整体强度,最后用合成的跨乐器配对数据微调缩放模块。相对单特征 ControlNet 与仅调输出强度的 SmartControl,关键差异是在输入端解耦异构控制并按目标乐器语义逐帧放大或抑制,从而保留乐谱内容又适配目标表达丰富性。在 2400 个文本音频对的迁移评测中 AdaTT 的 CLAP 得分为 0.490,追平主干上限并高于 ControlNet 的 0.463。结论限于 12 秒单声部、按音高聚类的 13 种乐器内迁移,未验证复调与混响等空间线索保留。该结论的适用边界受限于单声部合成数据,复调场景与真实混响条件尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
463. 层位置不能乱动:用交错堆叠加速语音基础模型蒸馏
英文题目:Fast Speech Foundation Model Distillation Using Interleaved Stacking
标签:#知识蒸馏 #语音大模型 #语音 #语音识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#知识蒸馏
👥 作者与机构
- Eungbeom Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Kyogu Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音基础模型蒸馏需把12层教师表征压缩到深而窄的学生模型,输入为连续语音帧,输出为通用表征以支撑识别与理解任务,而深窄结构并行度低导致训练缓慢。该工作采用4阶段堆叠蒸馏链:首阶段训练3层浅学生以低成本学习粗粒度映射,阶段结束时复制特定层并扩展深度,中间阶段在更大深度上继续用教师输出与中间层监督联合优化,末阶段恢复12层目标深度完成对齐。与渐进堆叠把尾部连续块反复搬到顶部不同,交错堆叠把复制层插在其源层之后,从而保持早晚层的相对位置并使中间层损失可稳定使用。在LibriSpeech 960小时蒸馏加SUPERB冻结评测下,交错堆叠在等分调度上取得9.08的音素错误率,相对渐进堆叠的11.50有明显下降。该结论目前仅在HuBERT Base教师、12层窄学生和音素识别、语音识别、槽填充、说话人识别四个任务上验证,未覆盖更大教师、流式或噪声外推。训练成本方面原文以墙钟时间报告约1.16倍至1.24倍加速,推理参数量与全量训练持平。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
464. 固定参考测不准偏好:Preference-ASR 把指令遵从变成可算的词错误率
英文题目:Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs
标签:#基准测试 #数据集 #基准设计 #语音识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Nithin Rao Koluguri:机构信息未能从会议 PDF 纯文本可靠映射
- Sasha Meister:机构信息未能从会议 PDF 纯文本可靠映射
- Nikolay Karpov:机构信息未能从会议 PDF 纯文本可靠映射
- Piotr Żelasko:机构信息未能从会议 PDF 纯文本可靠映射
- Desh Raj:机构信息未能从会议 PDF 纯文本可靠映射
- Jagadeesh Balam:机构信息未能从会议 PDF 纯文本可靠映射
- Boris Ginsburg:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
现有自动语音识别(Automatic Speech Recognition,简称ASR)评测用固定参考文本计算词错误率(Word Error Rate,简称WER),但各测试集对数字口语形与书面形、不流利词和大小写的约定互相冲突,标准归一化又抹掉用户真正关心的格式差异。Preference-ASR把输入定义为音频加自然语言偏好指令,输出为遵从指令的转写文本,难点在于同一音频在不同指令下应有不同正确答案。方法链分三步衔接:先人工校对多源转写得到干净底本,再由大语言模型(Large Language Model,简称LLM)按归一化与实体与不流利词与大小写分类并生成双向指令与偏好参考,最后人工复核形成三元组。与已有丰富转写和语音指令评测相比,关键差异是参考答案以指令为条件且评测用偏好感知归一化选择性跳过冲突步骤,使格式遵从可直接计入误差。在偏好感知WER下,Qwen3-Omni指令设置在归一化类取得9.84%,优于同设置Canary-Qwen的11.32%,方向为越低越好,暴露了标准归一化下两者接近时隐藏的遵从差距。该结论仅适用于英语单句转写与四类格式偏好,未验证多说话人、长音频、多语言及真实部署提示噪声下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
465. 噪声下既要补高频又要去噪:VeRe-Flow 用干净速度和干净表示双路纠偏
标签:#对比学习 #流匹配 #语音增强 #语音超分
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音超分 | 主方法:#流匹配
👥 作者与机构
- Sujin Koo:机构信息未能从会议 PDF 纯文本可靠映射
- Sangyoon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Ji Sub Um:机构信息未能从会议 PDF 纯文本可靠映射
- Hoirin Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
噪声鲁棒带宽扩展要求从含噪窄带输入同时补全缺失高频和抑制噪声,含噪条件下流匹配速度估计易偏离干净流形,重建保真与感知质量难以兼顾。为此VeRe-Flow分四步衔接:第一步以冻结XEUS提取噪声鲁棒自监督特征,并与含噪低分辨梅尔谱拼接构成条件输入。第二步将该条件送入卷积残差前级加Transformer加卷积残差后级的三明治骨干,预测条件速度场并展开去噪与补带轨迹。第三步用表征对齐约束首个Transformer层隐状态逼近干净XEUS表征,第四步用速度对比正则吸引预测速度朝向干净速度方向并排斥配对噪声速度方向,形成表征与速度双层干净监督。在 Valentini-Botinhao 含噪测试集 8 kHz 输入重建 16 kHz 设置下,方法将对数谱距离(Log-Spectral Distance,LSD)从 1.12 降至 1.10,将 DNSMOS OVRL 从 3.07 提升至 3.12,MOS 在生成式基线中最高为 4.14。该结论仅在单一英语含噪语料、固定 8 阶 Chebyshev 低通和 5 dB 至 20 dB 加噪训练下成立,未验证强混响、极低信噪比与跨语言跨采样率外推。原文未披露训练硬件、推理延迟与部署成本。
🔗 开源资源
- 演示资源:https://vere-flow.github.io/VeRe-Flow-Demo/ — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/espnet/xeus — 暂时无法访问
- 第三方资源:https://github.com/hayeong0/Diff-HierVC — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/microsoft/DNS-Challenge — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
466. 把规则还给规则,把歧义留给大模型:日语注音的两条流水线之争
英文题目:Benchmarking Large Language Models for Grapheme-to-Phoneme Conversion: A Japanese Case Study
标签:#数据集 #基准设计 #大语言模型 #语音学与音系 #文本到语音
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#基准设计
👥 作者与机构
- Tomoki Koriyama:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
日语字素到音素转换(Grapheme-to-Phoneme,G2P)需将无空格混排的汉字、假名、数字与拉丁字符映射为假名读音,难点在于词语切分、多音汉字消歧、助词变音、长音化以及数字量词连浊促音等上下文相关规则。该工作构建解析模式(Parse Mode)与直接模式(Direct Mode)两条链路,前者由大语言模型(Large Language Model,LLM)输出词语表层形与片假名读音的JSON形态素解析结果,再经规则后处理完成助词转换与长音归一化,后者由LLM一步直译整句片假名读音,最后统一以假名错误率(Character Error Rate,CER)评测并接入假名输入语音合成(Text-to-Speech,TTS)验证发音收益。与传统词典加规则管线相比,该组合将切分与读音估计交给预训练知识,把确定性发音规则剥离给确定性模块,减少了对词典覆盖的依赖。在3000句人工标注集上,最优LLM解析模式假名CER为0.52%,明显低于最优传统工具OpenJTalk的1.03%,且基于LLM假名的合成发音CER更接近真值假名条件。结论外推受限于新闻朗读类语料与通用词汇分布,对人名地名等专有名词与高度口语化文本尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
467. 先校准量尺再推理:用维度奖励把语音质量说清楚
英文题目:Calibration-Reasoning Framework for Descriptive Speech Quality Assessment
标签:#强化学习 #SFT #音频大模型 #后训练 #语音质量评估
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#强化学习
👥 作者与机构
- Elizaveta Kostenok:机构信息未能从会议 PDF 纯文本可靠映射
- Mathieu Salzmann:机构信息未能从会议 PDF 纯文本可靠映射
- Milos Cernak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可解释语音质量评估要求从30秒语音同时输出多维感知评分、伪影类别与起止时间以及长文本总结,难点是预训练音频大语言模型缺失维度尺度 grounding,且长文本推理易幻觉并干扰平均意见分Mean Opinion Score / MOS推导。本文提出校准-推理两阶段后训练:校准Calibration阶段在维度评分子任务上解冻音频编码器并联合微调大语言模型以注入质量判别特征;推理Reasoning阶段先做单轮长文本监督微调Supervised Fine-Tuning / SFT预热格式,再用组相对策略优化Group Relative Policy Optimization / GRPO按维度独立奖励聚合推理并生成整体评估。与统一偏好奖励相比,维度级奖励把数值精度与语义相似性或大语言模型裁判Large Language Model Judge / LLM-judge反馈精确归因到噪声、失真、连续性等单个维度,避免不同伪影相互混淆。在QualiSpeech测试集上维度级LLM-judge变体取得平均皮尔逊相关系数Pearson Correlation Coefficient / PCC为0.71且MOS的PCC为0.76,超越已有基线,相对此前监督微调最优的MOS结果提升约13%。该结论目前仅在QualiSpeech单一分布内验证,对超低码率编解码等新退化与跨数据集泛化的外推尚未证明。训练成本为2张NVIDIA L40S共96GB显存配合低秩适配Low-Rank Adaptation / LoRA完成校准与推理两阶段训练,推理延迟与部署开销原文未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
468. 单模态防住了,双模态却被放大:语音语言模型的联合越狱优化
英文题目:On Optimizing Multimodal Jailbreaks for Spoken Language Models
标签:#多模态学习 #音频安全 #语音 #语音对话系统
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音对话系统 | 主方法:#多模态学习
👥 作者与机构
- Aravind Krishnan:机构信息未能从会议 PDF 纯文本可靠映射
- Karolina Stańczak:机构信息未能从会议 PDF 纯文本可靠映射
- Dietrich Klakow:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语语言模型(Spoken Language Models, SLMs)以语音与文本为联合输入并生成开放式回复,其安全难点在于离散文本后缀与连续音频扰动会共同推移决策边界,而现有评测只优化其中一侧。该工作先在恶意查询批次上计算肯定答复的平均负对数似然联合损失,再交替执行音频侧归一化梯度更新与文本侧候选后缀搜索,最终输出通用的对抗后缀与加性音频扰动配对,测试时直接拼接到未见恶意查询上诱发越狱。相对固定一侧模态的单模态优化,联合优化让两类扰动在同一前向上下文中相互条件化,从而暴露互补脆弱子空间。在4个模型与4类基音频上的评测显示联合攻击相对单模态基线带来1.5倍到20倍的越狱成功率提升,基于梯度能量动态的顺序近似版本则保持可比成功率并将计算耗时降低至约四分之一到六分之一。就计算量而言,在8个GCG词元加4秒PGD的相同配置下顺序算法在单个NVIDIA H100 80GB硬件上的耗时仅为联合优化的约四分之一到六分之一。该结论限于白盒可微特征提取、AdvBench前40条中抽8条训练加剩余480条测试的划分与贪婪解码加字符串匹配和LLaMA Guard 3自动判定,尚未验证跨模型迁移、人工听感隐蔽性与生产级防御下的外推能力。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
469. 只用十秒参考音跨语言克隆:用过滤后的合成语音微调轻量模型
英文题目:Lightweight Cross-Lingual Speaker Adaptation for Indic TTS
标签:#数据清洗 #SFT #高效推理 #跨语言 #语音克隆
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音克隆 | 主方法:#SFT
👥 作者与机构
- Tarun Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Keshav Agarwal:机构信息未能从会议 PDF 纯文本可靠映射
- Pawan Goyal:机构信息未能从会议 PDF 纯文本可靠映射
- Laxmidhar Behera:机构信息未能从会议 PDF 纯文本可靠映射
- Hema A. Murthy:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究跨语言语音克隆与文本到语音合成任务,目标是在印度语言低资源部署下,用仅10秒参考音频实现稳定、快速、保音色的合成。其输入为四种印度语言文本与说话人原型向量,输出为目标音色波形,实际难点是印度语微调版F5即IN-F5存在丢词、高词错误率和推理缓慢问题。方法为三阶段流水线:先在印地语、马拉地语、泰米尔语、泰卢固语约119小时多说话人语料上预训练带双点说话人调制和余弦一致性损失的非自回归FastSpeech2基座,用通用标签集统一音素空间以解耦语言内容与说话人。再以10秒男性印地语参考驱动IN-F5批量合成覆盖全部78个通用标签集音素的约2400句语料,经音素级错误率、基频、时长和对齐似然四级过滤保留2088句约2.34小时;最后在该合成集上微调基座以注入目标音色。与教师在线推理相比,关键差异是将随机流匹配生成转为离线数据蒸馏加确定性前馈合成,推理时只需文本和说话人原型向量。在印地语50句和三种跨语言各30句评测中,微调系统相对IN-F5实现印地语18.6%相对词错误率下降和跨语言平均21.8%下降,输出完全确定,单句推理约0.25秒,约为教师13.3秒的53倍加速,参数量71.4M约为教师337.1M的4.7分之一。结论仅在单名男性印地语说话人上验证,多说话人、女性音色和22种语言扩展尚未验证。原文披露训练成本为单卡硬件上16小时,单句推理的延迟约0.25秒,模型存储仅286MB,部署计算量显著低于教师模型。
🔗 开源资源
- 演示资源:https://indiclone.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
470. 流式匿名总把情绪抹平:用同说话人错峰情感对与声学帧级蒸馏纠偏
标签:#知识蒸馏 #隐私保护 #流式处理 #语音 #说话人匿名化
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#知识蒸馏
👥 作者与机构
- Nikita Kuzmin:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式说话人匿名化需在仅用历史上下文条件下将源语音转为匿名目标音色,同时保留语言内容与情感韵律,难点在于神经音频编解码器的内容量化丢弃细粒度情感,且音频延续训练使模型偏向优势情感而非源情感。该方法先构造同一说话人的中性提示与情感源配对,迫使模型从源内容而非提示声学恢复情感,再以可学习分隔符显式划分提示与源边界,随后用因果变换器将慢速自回归声学隐状态映射为帧级情感嵌入并向Emotion2Vec+ large蒸馏。与直接微调情感数据相比,重构配对带来数倍于单纯加数据的增益,且声学支路蒸馏避免了与语义分支内容预测的梯度竞争。在VoicePrivacy 2024协议的IEMOCAP评测上,该方法以49.22%的UAR超过中性提示基线的39.72%,相对提升约24%,同时懒知情EER达48.98%。结论仅在表演式情感语料与单一SER评测器下验证,向自发情感与维度情感的外推尚未验证。微调在4卡上不足2小时完成且推理阶段移除蒸馏分支,维持180ms流式延迟与零额外推理开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
471. 病因判断写进生成流:构音障碍识别为何先判病因再转写
英文题目:Etiology-Aware Speech Language Models for Dysarthric Speech Recognition
标签:#自回归模型 #言语障碍 #语音 #语音识别
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自回归模型
👥 作者与机构
- Moreno La Quatra:机构信息未能从会议 PDF 纯文本可靠映射
- Alkis Koudounas:机构信息未能从会议 PDF 纯文本可靠映射
- Valerio Mario Salerno:机构信息未能从会议 PDF 纯文本可靠映射
- Sabato Marco Siniscalchi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍语音识别的输入是来自肌萎缩侧索硬化等五种神经病因的低可懂度语音,输出为逐字转写文本,难点在于病因相关的构音与韵律变异大且数据极不均衡,帕金森占比约半数而中风仅占极少数。所提病因感知语音语言模型先由语音编码器抽取声学表示并池化,再在同一自回归流中先生成病因词完成临床判断,然后以该预测为条件逐词生成转写文本。推理时剥离病因前缀仅对转写部分评分,使临床推理进入解码器因果上下文而非仅改善编码特征。与编码器加辅助分类头或输入端直接给病因提示相比,关键差异是自生成的临床推理直接条件化后续每个文本词元,实际意义是推理时无需临床标签且能激活病理相关声学关注。在Speech Accessibility Project数据集下,病因预测方法的WER为7.77%,低于标准微调方法的WER 8.30%。该结论适用边界受限于英语五病因句子级任务,单词任务与重度低可懂度样本仍误差高企,跨语言与多临床属性的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/MorenoLaQuatra/dysarthric-asr — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
472. 用可调离散瓶颈切断音色:VerAno 以受限码本平衡匿名与可用性
英文题目:VerAno: Speaker Anonymization via Self-Supervised Tokenization and Conditional Flow Matching
标签:#流匹配 #向量量化 #跨语言 #说话人匿名化
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#流匹配
👥 作者与机构
- Ngoc Hung Le:机构信息未能从会议 PDF 纯文本可靠映射
- Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
- Thien An Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Kyujin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人匿名化需输入原始波形并输出隐藏身份但保留内容与情感的语音,难点在于细粒度音色与语言韵律在连续特征中高度纠缠。VerAno先用语音编码器WavLM Large第18层抽取帧级连续特征,再经向量量化变分自编码器(Vector Quantized Variational Autoencoder,VQ-VAE)以受限码本离散化为内容令牌,过滤音色细节后与外部说话人池采样的目标说话人嵌入一起输入条件流匹配(Conditional Flow Matching,CFM)Transformer生成Mel谱,最后由声码器合成波形。与依赖语言相关自动语音识别(Automatic Speech Recognition,ASR)瓶颈或连续自监督特征的方法不同,该框架以码本大小 \(K\) 作为可调信息瓶颈来显式控制隐私与保真度的取舍。在VoicePrivacy Challenge 2024的LibriSpeech与IEMOCAP评测中,CB128配置在等错误率(Equal Error Rate,EER)平均达31.73%,显著高于B1的7.64%并接近B5的34.36%,同时词错误率(Word Error Rate,WER)保持2.53%的次优水平,情感无加权平均召回率(Unweighted Average Recall,UAR)达54.62%。该结论仅在英语训练与VPC半知情攻击及多语言LibriSpeech(Multilingual LibriSpeech,MLS)德葡意西四语有限测试下验证,未覆盖强自适应攻击与实时部署约束。原文未披露训练硬件与时长、推理时延与吞吐等部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
473. 把对齐从顶层突变改成逐层铺路:InterAligner 的渐进对齐监督
英文题目:Progressive Alignment Objectives for Aligner-Encoder based ASR
标签:#CTC #课程学习 #长音频处理 #语音 #语音识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#课程学习
👥 作者与机构
- Jaeyoung Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Masato Mimura:机构信息未能从会议 PDF 纯文本可靠映射
- Takafumi Moriya:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
对齐器编码器要求编码器前U个位置直接对应U个输出词元,输入为声学帧序列而输出为子词序列,长话语中帧数与词数严重失配使单调对齐被迫在顶层数层内仓促形成。作者在第12层接入中间联结时序分类以塑造早期可预测表示,其输出进入第15层中间对齐器学习更长更细粒度的对齐,再由第17层最终对齐器提炼为更短更粗粒度的转写,三个损失联合优化形成由细到粗的渐进课程。中间对齐器与最终对齐器使用独立预测器与联合器以避免不同粒度目标相互干扰。与仅在顶层监督及仅加中间联结时序分类的做法相比,关键机制差异在于把自注意力内部的隐式对齐显式分阶段监督,而非依赖单一正则。在LibriSpeech 960小时训练的17层Conformer下,最终头在test-clean与test-other取得3.1%与5.6%词错误率,相对自复现最终对齐器基线的5.0%与7.8%明显下降且长话语增益最大。该结论在Common Voice英文上同样成立,但尚未验证流式与超长篇章外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
474. 跨语音到音乐连续学评分:用 frozen 语义锚稳住旧任务
英文题目:CAQA-Net: Continual Audio Quality Assessment Across Speech and Music Domains
标签:#持续学习 #音乐 #语音 #音频质量评估
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频质量评估 | 主方法:#持续学习
👥 作者与机构
- Naiyuan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoxun Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuheng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Diqun Yan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理音频质量评估的持续学习问题,输入为含合成失真、会议退化、歌声与器乐生成瑕疵的语音和音乐片段,输出为与主观平均意见分对齐的感知质量分,难点在于语音到音乐声学分布剧变、回归映射需保持细粒度排序以及跨数据集量尺不一致。方法链分四步推进:可训练波形分支提取任务相关分布特征并与冻结频谱分支提供的任务不变语义锚拼接,上一步融合特征进入各任务独立线性回归头得到任务条件预测,排序保真损失基于瑟斯顿模型学习相对优劣以抵抗标签噪声,蒸馏正则约束旧头输出分布以保留历史排序知识。推理时冻结分支特征经K均值原型与柔最小门控自动加权各头实现任务无关预测。与直接微调相比该设计以输出分布约束替代刚性参数约束,更适配连续感知量尺与大幅域偏。在五数据集顺序任务评测下,CAQA-Net(EWC)门控推理的mSRCC指标为0.590,高于MH-FT的mSRCC指标0.589。结论限于固定五任务序列与已知评测划分,频繁振荡的域切换仍会降低稳定性,未验证开放新失真持续流入情形。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
475. 听音验文:用合成似然把假设拉回语音信号
英文题目:Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy
标签:#自回归模型 #模型评估 #语音 #语音识别
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自回归模型
👥 作者与机构
- Zhihan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hankun Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yiwei Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Bohan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无参考假设评估以原始语音与候选文本假设为输入,以一致性评分与优选转写为输出,难点在于无人工参考时解码器置信度易过自信而纯文本重打分丢弃声学证据且无法定位局部错误。READ先用离散自回归TTS在教师强制下计算语音Token给定假设的条件似然并取负对数得到帧级差异序列,再从同一模型解码器自注意力提取语音到文本单调对齐将差异聚合到文本段,最后按总差异重排N-best并按争议与共识区间逐段保留差异最小者以送入ROVER投票。与依赖ASR内部后验或外部语言模型先验的方法不同,READ以分析合成复用现成TTS声学建模显式恢复声学校验且无需针对特定系统训练,因而在噪声下仍能给出时间可定位的细粒度证据。在Switchboard上5-best重排将词错误率(Word Error Rate,WER)从15.02%降至11.93%,相对下降约20.57%。该结论依赖现成CosyVoice2的声学建模与单调对齐假设,对长争议段会退化为整句选择且未验证真实混响与强口音外推。除上述适用边界外,其向真实混响与强口音外推的泛化能力尚未验证,长争议段的失败条件仍受限于对齐假设。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
476. 把说话人信息挤出去:双粒度正交解耦如何让伪造检测只看合成痕迹
英文题目:Dual-Granularity Orthogonal Disentanglement for Generalizable Audio Deepfake Detection
标签:#课程学习 #正则化 #语音 #音频深度伪造检测
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#正则化
👥 作者与机构
- Zhuodong Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Hugen Lv:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Chunhong Yuan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对以对数梅尔谱为输入的音频深度伪造检测,跨说话人与跨场景下合成痕迹易被身份信息淹没,导致隐式身份泄露与泛化失效。框架先经浅层共享编码器保留细粒度声学细节,再分叉为带自注意力的内容分支与带统计池化的身份分支,分别输出伪造痕迹嵌入与说话人嵌入。内容分支接二分类监督,身份分支仅在真实样本上接受角度间隔监督,随后双粒度正交约束以余弦与跨协方差消除方向与维度间线性相关。课程调度将正交权重由零按余弦暖启动渐增至上限,使表征先判别后解耦,避免早期坍缩。与梯度反转等对抗解耦相比,该几何约束无需辅助网络与极小极大优化,且同时覆盖样本级与批量级独立性。在ASVspoof 2021 DF训练并直接测试In-the-Wild的跨域设置下,方法以21.58%等错误率优于同架构梯度反转基线2.60个百分点,并以2.1M参数逼近WavLM-MLP的跨域效果。其结论限于梅尔谱卷积流水线与三组公开评测,未验证编解码失配与自监督前端下的外推。其适用边界受限于上述公开评测,更多失配场景尚未验证;在推理开销上,原文报告完整模型为2.1M参数且每次推理计算量为0.89 GFLOPs。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
477. 多人有声书为何断裂:用解耦上下文与指令蒸馏同时保住连贯与可控
英文题目:audiobook-cc: Controllable Long-context Speech Generation for Multicast Audiobook
标签:#知识蒸馏 #长音频处理 #语音 #文本到语音
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#知识蒸馏
👥 作者与机构
- Min Liu:机构信息未能从会议 PDF 纯文本可靠映射
- JingJing Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Xiang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- JianHao Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Siyu Hao:机构信息未能从会议 PDF 纯文本可靠映射
- Siwei Xia:机构信息未能从会议 PDF 纯文本可靠映射
- Hongbin Zhou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向多角色有声书的输入是整章小说文本与候选音色库,输出是旁白与对白交织的长音频,难点在于跨句语义韵律连贯、角色音色稳定与细粒度情感可控难以兼得。该框架先将长篇切章并做文本解析与角色画像分析,再由可控长上下文语音合成模型逐句生成,最后按选角结果拼接为多播成品。合成模型内部依次完成上下文建模、解耦训练与自蒸馏增强,前一步输出的上下文序列与情感强度指令序列共同约束自回归声学建模。与直接复用语音提示韵律的方案不同,该方法仅用无关内容提取说话人嵌入并以相似度约束选提示,从而有效切断提示情感向目标的泄漏。在章节级评测任务下,Infer-ctx&inst的M-MOS为4.25±0.11,高于cosyvoice2的M-MOS 3.88±0.07。结论目前仅在中文有声书旁白与对白场景验证,跨语言与强噪声提示下的外推尚未证明。原文未披露推理延迟与部署成本。
🔗 开源资源
- 演示资源:https://semisemi-ux.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
478. 选项一换就变脸:大音频语言模型的选择题高分有多稳
英文题目:Robustness Assessment of Large Audio Language Models in Multiple-choice Evaluation
标签:#评测协议 #音频大模型 #模型评估 #鲁棒性 #音频问答
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#评测协议
👥 作者与机构
- Fernando López:机构信息未能从会议 PDF 纯文本可靠映射
- Santosh Kesiraju:机构信息未能从会议 PDF 纯文本可靠映射
- Jordi Luque:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究大型音频语言模型(Large Audio Language Models,LALMs)在多项选择问答(Multiple-Choice Question Answering,MCQA)中的评测失真,输入为音频加文本问题与4个候选项,输出为选项编号加文本,难点是文本先验和措辞变化会掩盖真实听觉理解。方法链分4步推进,先在默认文本下测LALMs并用无音频大语言模型估计语言偏置,再对选项排序做24种全排列测试位置敏感性,接着用两个生成模型分别改写问题与正确答案和干扰项,最后以0.5概率混合各项扰动形成低成本稳健性测试并用严格正确率汇总。相对已有基准只报单点准确率的做法,差异在于引入一致性率与全扰动下全对才算对的正确率并保留音频不变做隔离归因。在MMAU测试迷你集上无音频模型达到48.3%准确率,干扰项改写在部分模型上造成标准差高达13.7%的波动。结论仅适用于保持语义的语言扰动和所测3个基准与4个开源模型,未验证信号级扰动与开放式问答的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
479. 不加文本解码器:用受约束 CTC 把声学证据锁在骨架上补变音符号
英文题目:Constrained CTC decoding for Efficient Diacritic Restoration
标签:#CTC #高效推理 #语音 #语音识别
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#CTC
👥 作者与机构
- Rufael Marew:机构信息未能从会议 PDF 纯文本可靠映射
- Amr Keleg:机构信息未能从会议 PDF 纯文本可靠映射
- Hanan Aldarmaki:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
阿拉伯语语音到文本变音符号恢复(speech-to-text diacritization)输入为语音波形与无符号字符序列,输出为基字符顺序不变的完整带符号序列,难点在于无符号文本同形异音歧义严重,而大规模语音语料多无符号标注。所提方法先用微调的Wav2vec2-XLSR编码器输出含阿拉伯字母、合并组合符号与空白符的帧级CTC后验,再由无符号文本编译线性链字符格栅,在每个字母后插入通配符状态,最后以受限CTC解码只允许字母锁定与符号插入路径。与依赖单最佳带符号假设再做跨注意力融合的多模态基线不同,该设计把语言约束移到解码图,无需额外文本编码器与多模态训练。在ClArTTS与ArVoice联合训练下,所提方法在ClArTTS测试集变音符号错误率为3.80%,在ArVoice测试集为8.69%,均优于文本加语音识别基线的9.05%与9.93%,2000次自助采样差值95%置信区间完全位于零以下。结论仅在古典阿拉伯语单说话人朗读与现代标准语新闻朗读的匹配文本条件下验证,未覆盖方言、自发语音与识别错误传播情形。原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
480. 把水印藏进音节时长里:DuraMark 用可控时长对抗生成式抹除
英文题目:DuraMark: Duration-Embedded Watermarking in LLM-based TTS
标签:#流匹配 #鲁棒性 #语音 #文本到语音 #音频水印
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频水印 | 主方法:#流匹配
👥 作者与机构
- Zhenwei Mou:机构信息未能从会议 PDF 纯文本可靠映射
- Weili Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Liping Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Boyu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大语言模型文本到语音面临语音克隆滥用,输入为音节文本序列与说话人表征,输出为可溯源合成语音,难点是信号级水印易被神经声码器与音频编解码器重建抹除。所提DuraMark先由带时长预测的自回归语言模型逐音节预测时长分布并按目标奇偶比特编辑时长,再基于编辑后时长生成语音Token并经流匹配解码器合成梅尔谱,最后由时长提取器从语音与文本中恢复音节时长并经余弦映射计算相关性完成检测。与AudioSeal等信号级方法在波形或频谱做重构嵌入不同,该方法将信息藏入韵律层面的时长奇偶性,重建仍需保留可懂韵律与自然节奏因而更难被平滑抹除。在AISHELL-3测试集下,DuraMark-Info的TPR指标为0.993,高于AudioSeal的TPR指标0.701。该结论限于普通话单字单音节、需文本辅助对齐的受控评测,未验证跨语言、短语音与文本缺失下的外推能力。原文未披露推理延迟与部署成本。
🔗 开源资源
- 演示资源:https://muzw.github.io/duramark_demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
481. 先听已说出的声音,再定下一个字的语气:动态韵律预测补齐说话人相似度
英文题目:Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity
标签:#自回归模型 #大语言模型 #韵律 #语音克隆
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音克隆 | 主方法:#自回归模型
👥 作者与机构
- Zhenwei Mou:机构信息未能从会议 PDF 纯文本可靠映射
- Liping Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yajun Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Jian-Qing Gao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
个性化语音合成需以参考语音及其转写与目标文本为输入,生成兼具目标音色与说话风格的波形,难点在于目标文本特有的韵律无法从参考语音静态复制。所提方法先将目标与参考文本按汉字即音节切分编码为音节嵌入序列并提取说话人嵌入与参考韵律词元,再在解码时交替执行两步:依据目标文本、参考信息与已生成历史预测当前音节韵律词元,随后以该韵律为条件自回归生成该音节语音词元并送入流匹配声码器。与整体预计算韵律的链式思考提示相比,关键差异是韵律决策能感知已合成的目标语音上下文从而实现动态风格延续。在ESD评测下,所提方法的字符错误率为5.66,低于CosyVoice(50k)的字符错误率6.38。该结论适用边界受限于中文普通话三套语料验证,跨语种、歌唱与强跨情感迁移等场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://muzw.github.io/dynapros/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/FunAudioLLM/CosyVoice → https://github.com/QwenAudio/CosyVoice — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/ddlBoJack/emotion2vec — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/SWivid/F5-TTS — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/open-mmlab/Amphion — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
482. 把多个 noisy 语音特征加起来:跨数据集验证的 ALS 复合指数为何更稳
标签:#语音生物标志物 #心理测量 #语音 #病理语音评估
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#心理测量
👥 作者与机构
- Michael Neumann:机构信息未能从会议 PDF 纯文本可靠映射
- Hardik Kothare:机构信息未能从会议 PDF 纯文本可靠映射
- Diego Cadavid:机构信息未能从会议 PDF 纯文本可靠映射
- Robert H. Scannevin:机构信息未能从会议 PDF 纯文本可靠映射
- Anil Tarachandani:机构信息未能从会议 PDF 纯文本可靠映射
- Ines Hoffmann:机构信息未能从会议 PDF 纯文本可靠映射
- Tara Haley:机构信息未能从会议 PDF 纯文本可靠映射
- Shane Raines:机构信息未能从会议 PDF 纯文本可靠映射
- Vikram Ramanarayanan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为经远程平台采集的朗读段落、句子可懂度、双唇轮替运动和图片描述语音,输出为可解释的肌萎缩侧索硬化进展复合指数,难点在于单特征易受录音条件、疲劳与安慰剂效应干扰,测量噪声淹没纵向微弱变化。第一步在146人2124次观测的自然史数据上按球部损伤与听者费力二分类学习等权、逻辑回归、判别分析与Youden指数优化四种线性权重,输出跨任务特征权重。第二步将该权重经性别分组最小最大归一化与仅用历史访视的纵向插补迁移至临床试验数据,得到可直接评分的试验集指数。第三步用带随机截距斜率的线性混合效应模型估计群体轨迹与个体变化率,并以组内相关系数、测量标准误、最小可检测变化和Bland-Altman一致性完成心理测量学验证。相对单特征报告,关键机制差异在于多任务多维度线性聚合平均抵消随机误差并扩大构念覆盖、减少多重比较负担,同时保留线性可解释性。在VRG50635试验716次观测383对14天重测的评测设置下,Youden指数听者费力复合的组内相关系数ICC指标为0.9562,高于逻辑回归听者费力复合的组内相关系数ICC指标0.9556。该结论适用边界受限于单次独立1b期试验54人40周数据,尚未验证干预疗效检出与跨语言泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
483. 口音不是噪声:西班牙语和法语十种方言如何让识别器系统性改写
英文题目:Dialect Bias in Speech Recognition Across 10 Spanish and French Varieties
标签:#数据集 #基准设计 #统计分析 #公平性 #语音识别
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Rodrigo Nieto:机构信息未能从会议 PDF 纯文本可靠映射
- Maria Angelika-Nikita:机构信息未能从会议 PDF 纯文本可靠映射
- Diane Sarkis:机构信息未能从会议 PDF 纯文本可靠映射
- Diyi Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究西班牙语与法语共10种国家变体的自动语音识别方言偏差,输入为播客访谈中的自然会话语音,输出为保留方言形态句法的转写文本,难点在于口语缩略、区域词汇与话语标记系统性偏离书面标准分布。作者按地区检索Apple Podcasts并过滤音质与说话人片段,再由熟悉目标语言的作者人工转写保留方言特征,得到约1223分钟、129名说话人、性别均衡的20小时评测库,随后在该库上评测7个系统并比较方言与性别分组差异。接着利用Jensen-Shannon散度词偏移定位错误语料与正确语料的词汇分歧,并用任务外pyannote说话人嵌入与Whisper编码器中层表示做方言分类与质心距离分析,最后以编码器冻结与解码器冻结的低秩适应对比定位偏差来源。与仅用朗读式通用语料报告总体分数的已有工作不同,该框架将基准测试与词汇声学归因及适配探针串联,使误差可追溯至具体形态句法与话语标记。在自建20小时播客评测语料下,西班牙语全量LoRA微调的WER为4.26%,低于基线的WER 4.77%。结论仅适用于播客访谈语域与所覆盖变体,对电话信道与高度码转换场景的外推尚未验证,且小样本下说话人级声学距离与WER的因果关系仍不确定。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
484. 融合分数分不开好坏时:用 ChatScorer 和间隔过滤让偏好训练学到更清楚的差距
标签:#偏好优化 #主观评测 #后训练 #文本到语音
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#偏好优化
👥 作者与机构
- Shihao Niu:机构信息未能从会议 PDF 纯文本可靠映射
- Jianguo Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Wenhuan Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Xianghu Yue:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Luo Si:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向编解码语言模型文本到语音后训练中多指标融合奖励区分度弱、机器感坏样本难以抑制的问题,本文以前训练偏好数据提纯而非改优化器为切入点开展方法研究。流程先由基座模型对同一聊天风格长文本采样多候选,再用内容一致性、说话人相似度与会话评分器融合排序,随后经间隔过滤只保留优劣差距清晰的候选组,最后将有序子集送入直接偏好优化或排序变体学习。与直接拿融合标量做在线奖励的方法差异在于,融合分只用于排序与筛选,不直接作为梯度目标,从而避免弱分离监督污染训练。在500条长聊天测试提示、每提示多候选的评测设置下,Rank3DPO的BadRate指标为2.44%,低于SFT基线的BadRate指标12.66%。结论仅适用于CosyVoice2-0.5B单基座与2000条训练提示、500条测试提示的短规模聊天语料下的稳定性提升,跨说话人、跨语言与大规模在线优化尚未验证。训练使用2张NVIDIA A800硬件,原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://hajararabiu869.github.io/demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
485. 字对了人不一定对:临床访谈转写为何要同时查归属、隐私与关键词
英文题目:DIALOG DeID: Role and Privacy Aware Transcription for Clinical Interviews Beyond WER
标签:#医疗音频 #评测协议 #隐私保护 #语音识别 #说话人分离标注
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Guilherme C. Oliveira:机构信息未能从会议 PDF 纯文本可靠映射
- Dominic Dwyer:机构信息未能从会议 PDF 纯文本可靠映射
- Stephanie Fong:机构信息未能从会议 PDF 纯文本可靠映射
- Leandro A. Passos:机构信息未能从会议 PDF 纯文本可靠映射
- Dan Mo:机构信息未能从会议 PDF 纯文本可靠映射
- Benjamin Dixon:机构信息未能从会议 PDF 纯文本可靠映射
- Phillip Wolff:机构信息未能从会议 PDF 纯文本可靠映射
- Scott W. Woods:机构信息未能从会议 PDF 纯文本可靠映射
- Martha Shenton:机构信息未能从会议 PDF 纯文本可靠映射
- Barnaby Nelson:机构信息未能从会议 PDF 纯文本可靠映射
- Zongyuan Ge:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床风险访谈输入为长时双人对话音频,输出为带角色与去标识的转写及症状评分,难点在于短促否定与时间状语易错且说话人归属直接改变评分。DIALOG-DeID先由自动语音识别加说话人分离标注产出带时间戳词序列,再经重叠对齐与大语言模型角色映射区分医生与受访者,最后用去标识模块替换敏感片段并保留轮次结构。该链条以统一片段表示串联可替换后端,使评测能同时审计词面与归因。与仅报词错率的做法不同,其以排列不变的角色归因词错率加限定词保持率揭示互补失效模式。在PSYCHS-Bench基准下,Amazon Transcribe的WER为13.3±1.4,低于Azure STT的WER 19.0±1.7。50个片段审计发现20.0%线索丢失与2.0%硬否定翻转。该结论仅适用于半结构化英语访谈与小样本可行性验证,远场重叠与声学匿名化尚未覆盖。其适用边界受限于小样本英语访谈,远场与重叠场景尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
- 代码相关资源:https://github.com/GuiCamargoX/dialog-deid — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
486. 不直接学情绪,而学偏离中性的差:词级残差如何做可放缩的情绪强度
英文题目:Word-level Emotional Intensity Control in TTS via Emotion Residual Vectors
标签:#Adapter #韵律 #语音 #文本到语音
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#Adapter
👥 作者与机构
- Ji-Hyun Park:机构信息未能从会议 PDF 纯文本可靠映射
- Nam-Seok Song:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
情感文本到语音(Text-to-Speech,TTS)需在词级分配不同情感强度,现有词级标量控制常引发突兀音高跳变和不自然时长,损害感知自然度。该文先用蒙特利尔强制对齐器(Montreal Forced Aligner,MFA)对位与WavLM-Base第7-12层均值池化提取词嵌入,再以情感词减中性词构造情感残差向量(Emotion Residual Vector,ERV)。冻结的中性FastSpeech2主干通过残差注入模块(Residual Injection Module,RIM)学习瓶颈投影与上投影,RoBERTa-Base预测器则从文本加情感提示回归瓶颈目标,推理时以词级权重缩放注入偏移。与直接回归高维残差不同,低维瓶颈使强度缩放更平滑并简化文本到韵律预测。在英文ESD测试集上预测系统自然度平均意见分达3.83,情感分类准确率达0.71,与话语级基线相当并明显优于HED-TTS。该结论仅在平行中性-情感对、英语朗读语音和全局中性条件下验证,非平行采集、自发语音与跨语言外推尚未验证。原文未披露训练、推理或部署成本,仅声明生成式AI只用于语言润色。
🔗 开源资源
- 演示资源:https://jjhh0210.github.io/EmoRes-tts-demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
487. 统一评分与匹配训练才能选型:SURE 把评估协议与训练转换做成可复现闭环
英文题目:A Unified and Reproducible Experimentation Framework for Speech Understanding
标签:#基准测试 #基准设计 #模型比较 #口语理解
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#口语理解 | 主方法:#基准设计
👥 作者与机构
- Jing Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Junhao Du:机构信息未能从会议 PDF 纯文本可靠映射
- Chenghao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Hanqi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoyu Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Guanyu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yixuan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhangjie Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Li Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoran Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wenming Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Yucheng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaqi Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Wenbin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
部署选型面临输入覆盖噪声、混响、多说话人会议、方言与中英码切换等复合条件,输出需同时完成转写、翻译、情感与语义推理,而现有评测因归一化与打分脚本不统一导致不可比,训练增益又难以归因于架构还是数据混合。SURE以统一评测栈为入口,将预测文本映射到规范任务并做语言相关归一化,再调用meeteval与sacrebleu等固定打分器输出JSON报告与相对性能分RPS,该报告反过来驱动选型与榜单刷新。在训练侧,智能体将论文加代码解析为版本化SWIFT配方并经静态加冒烟校验后,在匹配开放子集上从零训练并用同一脚本取最优检查点评估,从而降低实现方差。同协议跨范式对比显示,级联管线在会议转写与干净感知上仍具竞争力,而情感识别全员偏低,受控训练中Qwen2-Audio-7B以1.58%中文CER领先TASU-SFT-2B的4.36%。结论仅适用于所收录开放子集与榜单当前最优定义的RPS,不宜外推至闭源数据规模或未覆盖推理任务。原文未披露训练推理成本与统计显著性。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
488. 用二值静音画布约束配音节奏:语音活动感知的合成如何对齐停顿
英文题目:Not Quite My Tempo: Voice Activity-aware Speech Synthesis for Lip-Synchronous Dubbing
标签:#流匹配 #跨语言 #语音配音 #语音活动检测
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音配音 | 主方法:#流匹配
👥 作者与机构
- Alejandro Pérez-González-de-Martos:机构信息未能从会议 PDF 纯文本可靠映射
- Florian Lux:机构信息未能从会议 PDF 纯文本可靠映射
- Angelina Elizarova:机构信息未能从会议 PDF 纯文本可靠映射
- Milana Shkhanukova:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Kellner:机构信息未能从会议 PDF 纯文本可靠映射
- Mattia Antonino Di Gangi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动唇同步配音要求把源语言片段的发声与静音交替结构精确复刻到目标语言语音中,否则视听错位会直接损害观看体验。本文输入为目标语言音素文本加源语言参考音频的二值语音活动掩码,输出为时长固定且静音边界对齐的英语配音,难点在于跨语言内容长度不同时仍要保持自然停顿与语速。方法链分为三步:先用语音活动检测(Voice Activity Detection, VAD)提取帧级掩码并嵌入后叠加到编码表示,再经平均上采样把文本对齐到固定画布,最后由流匹配扩散变换器在掩码约束下完成声学潜码修复。与依赖唇动编码的已有路线相比,该机制仅约束何时发声而不规定说什么,内容分配留给模型端到端学习,因此无需配对视频训练且对动画与多人场景更鲁棒。在包含291条样本的多语言TEDx评测中,VAD条件将帧级对齐准确率从约73%提升至约96%,而自然度主观分无显著下降。结论仅适用于翻译时长与源结构大致匹配的情形,极端过长或过短文本仍会出现删减与重复。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://alexdemartos.github.io/NQMT_IS26 → https://alexdemartos.github.io/NQMT_IS26/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
489. 无真标签可学上下文诊断:用无意义伪标签把推理技能与医学语义解耦
英文题目:Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio
标签:#医疗音频 #联邦学习 #音频大模型 #少样本 #音频分类
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#联邦学习
👥 作者与机构
- Ran Piao:机构信息未能从会议 PDF 纯文本可靠映射
- Tsai-Ning Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Martijn den Dekker:机构信息未能从会议 PDF 纯文本可靠映射
- Linda Moonen:机构信息未能从会议 PDF 纯文本可靠映射
- Hareld Kemps:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Aaqib Saeed:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床音频诊断输入为分散在各医院的呼吸与心音片段,输出是对训练未见疾病的开放词汇诊断,实际难点是标注稀缺且音频不能出院、机构间标签空间与录音条件异构。FSC先在各客户端用医学音频编码器抽取嵌入并做本地K均值聚类,生成Mountain Breeze等无医学含义伪标签以切断语义捷径。音频再经线性投影层映射为语言模型前缀词元,与支撑集和查询交错的N路K样本情景序列拼接,训练模型按上下文生成标签。三阶段流水线依次做非情景对齐、情景精炼和冻结主干的LoRA适配,全程经Flower以FedProx只同步编码器、投影层与适配器,伪标签本地生成且原音频不出域。与原型网络等纯声学度量及直接提示音频大模型不同,伪标签语义空洞化迫使模型只学声学到上下文标签的抽象映射,疾病语义接地留给预训练医学语言模型。在2路2样本设置下,FSC的准确率为71.6%,高于最强基线的准确率62.1%。该结论适用边界受限于2路2样本条件,3路与增加样本时准确率下降且长多模态上下文会稀释声学注意力,神经系统筛查等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
490. 宽描述做不了逐词提示时:用元数据推理链教语音大模型改稀有词
标签:#数据集 #指令微调 #语音大模型 #语音 #语音识别
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#指令微调
👥 作者与机构
- Jakob Poncelet:机构信息未能从会议 PDF 纯文本可靠映射
- Hugo Van hamme:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音识别的输入是连续语音声学信号加视频标题与描述等宽泛文本上下文,输出是转写文本,难点在于罕见词和命名实体声学混淆且无法靠关键词精确匹配解决。该方法先合并YouTube来源语音片段并清洗元数据得到上下文,再用多版本Whisper生成声学混淆伪标签并筛选与命名实体或罕见词相关的错误,然后用文本大模型生成从错误假设到参考转写的上下文解释链,最后微调语音大模型按初始转写减推理链减最终转写的三段式输出。相比关键词偏置解码和纯文本后编辑,它把宽泛描述转化为可解释的主题约束并要求修正与声学证据兼容。在M³AV测试集3.9k条命名实体子集上,Qwen2-Audio-7B经M切分推理微调后全局词错率从11.9%降至9.3%。该结论限于英语学术演讲类短片段和YouTube元数据质量较好的情形,对无相关上下文或描述噪声极大的视频尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
491. 好听不等于说对:用阿萨姆语元音和谐审计多语种合成的音系忠实度
英文题目:Towards a Phonology-Informed Evaluation of Multilingual TTS
标签:#评测协议 #语音学与音系 #多语言 #文本到语音
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#评测协议
👥 作者与机构
- Sneha Ray Barman:机构信息未能从会议 PDF 纯文本可靠映射
- Neeraj Kumar Sharma:机构信息未能从会议 PDF 纯文本可靠映射
- Shakuntala Mahanta:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言语音合成需要把输入文本转为可懂语音,而难点是自然度高并不意味着语法条件决定的音质交替被正确实现,阿萨姆语中
\[\+ATR\]后缀元音要求词干元音同步和谐即属此类。本文以人类语音为基准学习声学到音系的映射,再跨域投射到 MMS 合成语音并统计方向性失配,接着把元音级预测聚合为词级和谐类型以检验误差是否向上传导。与平均意见分或词错率只给全局标量不同,该框架给出元音身份与和谐类别双维度的方向性诊断。在跨域元音分类任务下,H→TTS条件的准确率为83%,高于H→H条件的准确率81.7%。人类外折评估下误差方向近乎对称,而合成语音的欠生成与过生成比例呈现约7比1的偏态,中部
\[\+ATR\]元音约三分之一被判为
\[\-ATR\]。结论仅适用于具有可测量共振峰相关的 ATR 对立及本研究的朗读载体句场景,未验证自发语、其他和谐类型或多说话人合成的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
492. 改内容而不动声学:语义空间编辑加自一致奖励的文本语音编辑
标签:#流匹配 #强化学习 #主观评测 #语音 #语音编辑
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编辑 | 主方法:#强化学习
👥 作者与机构
- Yong Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Jiangyan Yi:机构信息未能从会议 PDF 纯文本可靠映射
- Jianhua Tao:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Le Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengqi Wen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本语音编辑(Text-based Speech Editing)需根据修改后转写替换局部语音片段,同时保持音色、环境与韵律与上下文无缝衔接,而声学标记中内容与风格纠缠易引发幻觉与边界伪影。该工作先将波形经语义分词器转为离散语义序列并按前缀后缀中间格式组织,由解码器Transformer完成缺失中间段的条件填充,再经流匹配(Flow Matching)解码器与HiFiGAN声码器统一重建波形。随后引入组相对策略优化(Group Relative Policy Optimization,GRPO),以冻结文本到语音(Text-to-Speech,TTS)模型对生成段的条件对数似然为自一致性奖励,并叠加识别词错率与时长门控约束做感知对齐。在Ming-Freeform-Audio-Edit-Benchmark基础集插入、删除、替换三任务上词错率分别为4.50%、6.91%、4.13%,显著低于VoiceCraft的10.70%、16.99%、11.98%与FluentSpeech的12.00%、8.16%、4.66%,主观自然度平均分亦领先约0.3至0.5分。该结论目前仅在英文朗读类数据与0.5秒至2.5秒掩码范围内验证,长篇自发语音与跨语言泛化尚未检验。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
493. 强弱不等反而更稳:按能力分工的非对称音频推理协作
标签:#模型集成 #音频大模型 #大语言模型 #音频问答
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#模型集成
👥 作者与机构
- Yan Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Jinting Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Tianxin Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Xiang He:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Dong Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Li Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频深度推理以音频A、问题Q与候选项O为输入,要求输出答案与连贯推理链,难点在于专家级听觉感知、多步推理与大型音频语言模型Large Audio-Language Models(LALMs)的采样不稳定。第一步为智能体内一致性提炼,各决策智能体对同一问题多次重采样,若答案分歧则由语言模型汇总冲突答案与推理对生成内部关键信息指南,并以该指南为条件做自校正推理以输出稳定的初始答案与推理。第二步为智能体间多轮协作,将上一步的初始答案与推理送入角色自适应非对称交互,强决策智能体仅接收隐式客观声学引导以重听声学冲突点,弱决策智能体与证据智能体则接收来自强者的显式同伴上下文做参照校准,若达成共识即停止否则最多迭代三轮。第三步为最终决策与推理收集,从全部协作历史中过滤与最终答案一致的有效路径,并融合证据智能体验证的声学细节合成整体解释,该按能力分配表决权与反馈形式的设计不同于对称投票或辩论,可避免弱者拖累的桶效应与强者的文本补偿。在MMAR基准上该方法以74.80%平均准确率超越最强基线Qwen3-Omni-30B-A3B-Instruct的71.30%,在MMAU-mini上以79.10%超越该基线的78.80%,方向为提升,并获Interspeech 2026 Audio Deep Reasoning Challenge Agent赛道第3名。结论仅在所测双基准与所选Qwen3-Omni模型组合下成立,跨模型、跨语言与强噪声泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
494. 从混合比位置直接跳到目标:MeanFlow-TSE 为何能把一步生成走直
英文题目:MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
标签:#流匹配 #高效推理 #语音 #目标说话人提取
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#流匹配
👥 作者与机构
- Riki Shimizu:机构信息未能从会议 PDF 纯文本可靠映射
- Xilin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Nima Mesgarani:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
目标说话人提取(Target Speaker Extraction, TSE)需依据注册语音从单通道混合语音中恢复特定目标波形,难点在于重叠干扰强、实时延迟敏感而多步扩散与流模型推理成本过高。该方法先用混合比预测器估计混合谱在背景到目标轨迹上的位置,再以注册条件化的平均速度网络直接预测从混合点到干净目标的平均速度,最后经单步欧拉跳跃重构目标频谱,训练侧则以课程从轨迹流匹配过渡到平均流一致性并辅以自适应加权。与标准整流流匹配多步积分相比,关键差异是学习区间平均速度而非瞬时速度,从而允许大步长单步生成并跳过噪声主导段。在 Libri2Mix Clean 测试集上相对同骨干 AD-FlowTSE 将尺度不变信失真比(Scale-Invariant Signal-to-Distortion Ratio, SI-SDR)从 17.49 dB 提升至 18.80 dB,感知语音质量评估(Perceptual Evaluation of Speech Quality, PESQ)从 2.89 提升至 3.26;在 Noisy 集上从 12.69 dB / 2.15 提升至 12.85 dB / 2.21。该结论目前仅在 Libri2Mix 的干净与噪声两种人工混合设置下验证,未验证混响、多通道、真实录音与跨语料泛化。单步推理在 L40 上实时因子约为 0.018,参数量 359M 与显存 1536MB 与基线基本相当,适合低延迟部署。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
495. 只听声音判断反话:用局部与整体韵律的不一致来识别讽刺
英文题目:ProSarc: Prosody-Aware Sarcasm Recognition Framework via Temporal Prosodic Incongruity
标签:#注意力机制 #韵律 #跨语言 #语音 #音频分类
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#注意力机制
👥 作者与机构
- Prathamjyot Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Ashima Sood:机构信息未能从会议 PDF 纯文本可靠映射
- Sahil Sharma:机构信息未能从会议 PDF 纯文本可靠映射
- Jasmeet Singh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
纯音频讽刺识别需仅从语音判断讽刺意图,难点在于讽刺常体现为细粒度韵律夸张、对比重音与节奏偏离而非词汇本身,且易受说话人风格、对话上下文缺失和视觉缺失影响。ProSarc先以全局情感编码器汇总整句韵律统计建立情感基线,同时以时间韵律编码器用自监督编码器加双层双向长短期记忆网络与多头自注意力刻画帧级动态,前者输出基线表征、后者输出时序表征一并送入下一步。韵律不一致分析器对比两路表征输出标量不一致分数并加权融合,再经分类头判决,同时用蒙特卡洛丢弃估计不确定性并复用注意力权重做弱监督起始定位,与只用句级统计或隐式时序编码的前人音频方法不同,该工作把不一致显式标量化为可检查门控。在MUStARD++五折交叉验证评测下,ProSarc的F1分数为75.28,高于Tiwari等的F1分数66.6。该结论适用边界受限于音频单模态,在自发播客与德语小数据上仍有回落,且24%样本需视觉才能感知,孤立话语建模尚未验证多轮对话外推。单张 Tesla T4 训练 Base 约每轮 1.7 分钟、Large 约每轮 3.5 分钟,推理需 10 次随机前向,成本随编码器规模上升。该训练成本基于单卡Tesla T4硬件,推理开销源于10次随机前向的计算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
496. 只看舌头超声能说话吗:用三维编码加 Transformer 补上协同发音
标签:#CNN #Transformer #实时处理 #语音 #静默语音接口
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#静默语音接口 | 主方法:#Transformer
👥 作者与机构
- Yash Sonkar:机构信息未能从会议 PDF 纯文本可靠映射
- Yasaswi Kilaru:机构信息未能从会议 PDF 纯文本可靠映射
- Sudheera Yelimeli:机构信息未能从会议 PDF 纯文本可靠映射
- Neil Shah:机构信息未能从会议 PDF 纯文本可靠映射
- Vineet Gandhi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
静默语音接口 Silent Speech Interface / SSI 的任务是从舌超声视频输入重建可懂语音输出,难点在于仅有舌体几何观测、缺少唇与声门信息,且长时协同发音与探头位移带来强变异。所提框架先将极坐标扫描线转为笛卡尔楔形视频,再由四层三维时空卷积编码局部运动并池化为 256 维帧级嵌入,随后经正弦位置编码与六层自注意力建模长程依赖,最后由两层多层感知机 Multilayer Perceptron / MLP 映射为 80 维梅尔谱并经 HiFi-GAN 声码器合成波形。与单层注意力或纯卷积加双向长短时记忆网络 Bidirectional Long Short-Term Memory / BiLSTM 基线相比,该机制把短时运动表征与全局时序聚合解耦,从而保留共振峰轨迹与瞬态边界。在英语 TaL 语料单说话人 TaL1 总体评测中,所提方法词错误率达到 15.93%,相对最强自建基线 24.15% 降低超过 8 个百分点;在多说话人 TaL80 混合训练中为 31.64%。结论仅适用于受控采集的英语舌超声到语音重建,跨说话人零样本与跨会话几何鲁棒性尚未解决。全文共 19.17M 参数,其中声码器占 13.92M,主干仅 6.25M,但未披露训练硬件与实测延迟。
🔗 开源资源
- 演示资源:https://tongue2speech.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
497. 不用专家在场也能收嗓音数据:CalliOpeNLP 如何把指令、录音与合规检查做成一体
英文题目:CalliOpeNLP: A Standalone Digital Health Voice Data Collection Research Tool
标签:#医疗音频 #开源工具 #数据集构建 #语音 #语音识别
评分:6.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#数据集构建
👥 作者与机构
- Brian Stasak:机构信息未能从会议 PDF 纯文本可靠映射
- Rebecca Li:机构信息未能从会议 PDF 纯文本可靠映射
- Antonia Chacon:机构信息未能从会议 PDF 纯文本可靠映射
- Rebecca Black:机构信息未能从会议 PDF 纯文本可靠映射
- Cate Madill:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床嗓音数据采集的输入是受试者在多类朗读与表演性发声任务下的录音,输出是可直接建模的标注语料,难点在于人工交互偏差、任务依从性难即时核验与后期切分转录成本高昂。该工具先以离线语音合成与屏幕文本双通道呈现统一指令并分任务独立录音,再调用轻量自动语音识别(Automatic Speech Recognition,ASR)生成转录与置信度,接着仅对朗读类任务做文本相似度合规判定并触发重录提醒,最后自动生成结构化命名音频与受试者语音报告。相比依赖检查者口头指导与事后人工质检的手工流程,其机制差异在于用固定合成指令消除指导变异并将质量控制前移到采集时刻。在同任务内部试用协议下,CalliOpeNLP的耗时指标为18分钟,低于人工连续录音采集的耗时指标28分钟,且人工耗时尚未计入后期切分标注时间。该结论仅适用于安静实验室高质量麦克风条件下的初步试用,未在病理人群与多站点临床环境中验证。该结论的适用边界受限于安静实验室场景,病理嗓音与多站点临床部署尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/DrBrianStasak/CalliOpeNLP/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
498. 先抄写再打点:两步式语音大模型如何保住识别率做词级时间戳
英文题目:Parameter-Efficient Adaptation of Speech-Aware LLMs for Timestamp Prediction
标签:#LoRA #多语言 #零样本 #语音 #强制对齐
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#强制对齐 | 主方法:#LoRA
👥 作者与机构
- Vishal Sunder:机构信息未能从会议 PDF 纯文本可靠映射
- Samuel Thomas:机构信息未能从会议 PDF 纯文本可靠映射
- Xulin Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Brian Kingsbury:机构信息未能从会议 PDF 纯文本可靠映射
- George Saon:机构信息未能从会议 PDF 纯文本可靠映射
- Avihu Dekel:机构信息未能从会议 PDF 纯文本可靠映射
- Luis Lastras:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
词级时间戳预测需在连续语音中同时给出文字与每个词的结束时刻,单遍交错生成常破坏语言连贯性并抬高词错误率,而传统强制对齐又难以融入语音大模型统一解码。所提框架先用基座语音大模型完成常规转写(ASR),再以转写文本与语音为条件复述出带时间戳序列,将联合解码转化为定位问题。三种适配变体分别负责连续微调、模块化双遍与激活式单遍复用,其中激活式适配仅在时间戳调用符后启用增量权重以继承首步缓存。为隔离任务能力,时间戳适配器只在带时间戳数据上训练而冻结基座权重,模块化变体因此保留原始转写翻译能力并支撑零样本跨语言迁移。在9个英语测试集上非模块化变体以平均27.1 ms的累积平均偏移超越最强基线Qwen3 Forced Aligner的41.8 ms,且词错误率与基座持平。该结论依赖强制对齐器生成的伪标签与较长音频拼接增强,真实噪声重叠与未见语言风格下的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
499. 编解码器换语言不用重训,自监督预训练却必须对齐语言
标签:#自监督学习 #跨语言 #多语言 #语音识别 #语音情感识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Daigo Takizawa:机构信息未能从会议 PDF 纯文本可靠映射
- Tomohiko Nakamura:机构信息未能从会议 PDF 纯文本可靠映射
- Samuele Cornell:机构信息未能从会议 PDF 纯文本可靠映射
- William Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Satoru Fukayama:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究跨语言离散语音表征问题,输入为英语、日语和中文的原始波形,输出为下游自动语音识别和语音情感识别所需的特征,难点在于神经音频编解码器离散化与自监督预训练都会引入语言偏差且相互混淆难以分离。方法链分为三步:先在重建波形上评估多种编解码器及不同训练语言条件下重训的编解码器的跨语言稳定性以刻画编解码器偏差。接着固定编解码器只切换自监督预训练语言以量化表征阶段偏差,其重建波形基线归一化后的错误率作为对照进入跨语言比较。最后固定自监督语言与目标语言一致只切换编解码器训练语言以检验编解码器复用性。在跨语言识别与情感语料任务下,评估统一采用跨语言变异系数比较经波形基线归一化后的错误率,覆盖三种语言的多套识别与情感语料。与已有以英语为中心且不区分两阶段的研究不同,本文通过双向固定对照将声学离散化与语言建模分离,揭示偏差主要来自后者,具有复用声学编解码器的实际意义。在DAC重训配置条件下,18码本配置的码率指标为9 kbps,高于官方配置的码率指标6 kbps。结论适用边界为声学编解码器加掩码预测表征的组合,在语义型编解码器、低资源语言和翻译等任务上尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/TencentGameMate/chinese_spe — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
500. 在决策边界上现造难题:ADALA 用强化学习驱动大模型生成难负例
标签:#强化学习 #半监督学习 #大语言模型 #语音唤醒
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音唤醒 | 主方法:#强化学习
👥 作者与机构
- Nianhang Tang:机构信息未能从会议 PDF 纯文本可靠映射
- Chaoyi Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Cai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对始终在线的语音唤醒(Wake-up Word Detection)需在开放集负样本下兼顾高唤起与低误唤,现有静态合成与半监督策略难以覆盖语义级难负例。论文提出自适应框架 ADALA(Adaptive Semi-supervised and Large-model Learning),先由大语言模型(Large Language Model)生成候选文本,再经语音合成(Text-to-Speech)合成音频并送入唤醒词模型与语音识别(Automatic Speech Recognition)验证器联合打分。强化学习(Reinforcement Learning)以该打分作为奖励,用近端策略优化(Proximal Policy Optimization)更新生成器,形成生成-反馈-更新闭环,持续产出决策边界附近的难负样本。训练侧将合成难负例与真实标注及无标注数据在同一批次内联合优化,通过教师-学生一致性正则与梯度反转层(Gradient Reversal Layer)的域对抗损失抑制合成伪影。与已有方法相比,关键差异在于把数据生成本身建模为可优化策略而非固定规则,从而实现语义与语音相似度双维度的自适应挖掘。在1430小时中文自有数据集评测设置下,ADALA的平均唤醒率指标为90.43%,高于Hard-Negative Mining基线的平均唤醒率指标87.75%。该结论限于固定阈值流式评测与受控录音及用户日志难负例集,跨语言仅在2280条Hello Wikka小集验证,未检验开放环境噪声与直接音频生成替代路径。生成器微调约耗8卡Tesla A800 40小时产出10000条样本,唤醒词模型训练约50小时,原文未披露推理时延与端侧部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
501. 不微调也能演好角色:用双层控制向量同步“想法” 与“声音”
英文题目:DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention
标签:#测试时自适应 #大语言模型 #语音 #语音对话系统 #文本到语音
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音对话系统 | 主方法:#测试时自适应
👥 作者与机构
- Wenqiu Tang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen Wan:机构信息未能从会议 PDF 纯文本可靠映射
- Takahiro Komamizu:机构信息未能从会议 PDF 纯文本可靠映射
- Ichiro Ide:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音角色扮演以用户话语与角色档案为输入,需同时输出知识性格一致的文本与匹配音色韵律情感的语音,难点在于端到端微调依赖角色专用数据、泛化差且模态对齐税损伤大模型原有推理能力。内部认知操控在冻结Qwen3-4B残差流中注入人格基向量、上下文激活向量与语言风格向量,动态加权修正隐状态以生成人格对齐文本与显式情感标签。外部表达渲染将情感标签映射为声学控制向量,对冻结StyleTTS 2的风格表征做减法解耦得到情感方向,经扩散风格预测器精修后再做参考与韵律双路插值融合输出最终语音。与更新参数的端到端方案不同,该链以上一步情感标签与强度系数衔接两阶段,全程不更新参数从而保留推理能力并同步心智意图与声音表达。在SpeechRole基准下,DeSRPA的Mean得分为0.8379,高于SpeechRole基线的Mean得分0.7747。该结论适用边界受限于英语影视剧情与开放域角色验证,对高度夸张二次元韵律的一致性与沉浸感仍落后。推理开销方面其首音频延迟为577 ms,高于全端到端模型但显著低于重型级联管线。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
502. 回到耳朵:用听觉加权与相位相关重做音乐高保真压缩
英文题目:Back to Ear: Perceptually Driven High Fidelity Music Reconstruction
标签:#变分自编码器 #音乐 #空间音频信号 #音频编码
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#音频编码 | 主方法:#变分自编码器
👥 作者与机构
- Kangdi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyue Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Junyu Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Jiang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音乐重建要求将44.1 kHz立体声波形压缩为连续隐变量后再波形级还原,难点在于人耳对中高频和谐波瞬态相位极敏感而传统谱距离一视同仁,且立体声空间在压缩中易塌陷。所提耳形变分自编码器(ear-VAE)采用非对称变分自编码器生成对抗网络(VAE-GAN):卷积编码器提取局部特征并经重参数化采样128维连续隐变量,转置卷积加旋转位置编码(RoPE)Transformer解码器重建波形,多尺度短时傅里叶变换(MS-STFT)判别器提供对抗监督。重建分支在算损失前先经K加权(K-weighting)感知滤波以突出敏感频段,幅度监督覆盖中侧左右(MSLR)四路而相位相关损失只监督左右(LR)声道。与对称结构和A加权做法不同,该机制把心理声学与声像约束直接写进优化目标而非依赖判别器隐式学到。在MuChin上该模型梅尔距离0.55、多尺度谱距离1.17、尺度不变信噪比(SI-SDR)9.99 dB,均优于次优基线,主观平均意见分(MOS)达4.70。该结论的适用边界受限于音乐重建任务,向通用音频、低码率语音、极端削波和强混响场景的泛化尚未验证,且对细微空间效应的衰减倾向仍需改进。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
503. 不只听懂字,还要跟住情绪:Empathy Omni 用情绪轨迹控制共情语音回复
英文题目:Empathy Omni: Enabling Empathetic Speech Response Generation Through Large Language Models
标签:#数据集 #多模态学习 #语音 #语音对话系统 #语音合成
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#语音对话系统 | 主方法:#多模态学习
👥 作者与机构
- Haoyu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Guangyan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiale Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jingyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuehai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yiwen Guo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为携带韵律与情绪线索的用户语音,输出为语义恰当且韵律共情的文本与语音回复,难点在于相同文本在不同情绪下语义迥异而情感对话数据稀缺昂贵且标注一致性难保证。首先双分支编码器分别抽取语义内容与情感表征并降采样至10Hz融合送入大语言模型,其次大语言模型同步生成回复文本与词元级情绪轨迹作为显式情感规划并以DTW对齐监督,最后语音解码器以门控融合语言信号并经情感自适应调制生成声学词元与波形。相对从数据隐式学习情绪一致的语音大语言模型,该工作将语义生成与韵律控制解耦并允许单句内情绪过渡,从而降低对大规模高质量情感对话的依赖。在1000条情感查询测试集下,Empathy Omni的Speech Emotion MOS为4.23,高于OpenS2S的Speech Emotion MOS 4.11。结论仅适用于6类基本情绪与中英文可控合成主导分布,对细微混合情绪仍易生成语义对但情感平淡的回复。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
504. 指令说情感还不够:用结构化情感向量把强度也管住
英文题目:EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis
标签:#流匹配 #零样本 #语音 #文本到语音
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Minghui Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Ganjun Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Zikun Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Hongchuan Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Bingao Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Yonglong Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Jiasheng Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Du:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
指令引导的情感语音合成需从自由文本同时恢复语言内容与细粒度情感强度,现有方法或依赖参考音频而存在音色耦合,或仅用粗粒度标签导致强度不可控。本文提出双路径框架EmoInstruct-TTS,先由情感嵌入Emotion2embed融合语义与声学特征并施加分类与序数约束,再由指令条件情感流模型ICE-Flow从指令语义回归样本级嵌入并对齐协方差,随后大语言模型基于指令与文本生成语义令牌,最后条件流匹配声码器结合情感嵌入与说话人嵌入合成波形。与纯文本提示相比,该设计以显式向量承载强度几何,以语言模型保留语言可懂度,兼顾灵活性与声学接地。在21组情感强度零样本任务中,男性双路径MOS达到4.28、ESMOS达到4.25,女性双路径MOS达到4.25、ESMOS达到4.10,均超越CosyVoice2和CosyVoice3;48类任务ECS为0.870。该结论限于中文ESD与CNCED衍生数据及封闭集评估,未验证开放式情感描述的外推能力。原文未披露训练、推理硬件与完整训练成本,仅给出推理增量延迟分析。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
505. 不走多步轨迹:把语音增强写成分布平衡的单步投影
标签:#生成模型 #高效推理 #语音 #语音增强
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#生成模型
👥 作者与机构
- Liang Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Diego Caviedes-Nozal:机构信息未能从会议 PDF 纯文本可靠映射
- W. Bastiaan Kleijn:机构信息未能从会议 PDF 纯文本可靠映射
- Longfei Felix Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Rasmus Kongsgaard Olsson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从带噪复数谱恢复干净语音与波形,难点在于单步判别映射易过平滑丢失细节而扩散类逆过程需数十步积分导致延迟瓶颈。漂移语音增强先由生成器将带噪谱或高斯先验映射为增强谱并经逆短时傅里叶变换得到波形,其输出直接作为语义表征的输入。冻结语义编码器将生成与干净音频投射为多层帧特征并划分为干净正集与生成负集,再以核加权均值偏移构造同时吸引向正集与排斥离负集的漂移场。生成器回归该漂移目标推动前向分布持续演化直至漂移为零的分布均衡,单步推理时直接映射取确定性去噪而条件生成采样新噪声以保留多样性,且该分布对齐原生支持非配对学习。相比扩散与流匹配约束轨迹积分的做法,该机制直接优化分布对齐因而无需迭代采样与刚性帧对帧回归,在单步条件下兼顾保真度与感知自然度。在DNS Challenge 2020盲测任务设置下,DriftSE的WV-MOS为2.65,高于ROSE-CD的WV-MOS 2.37。该结论适用边界受限于英语VoiceBank与DEMAND合成噪声训练及小规模真实录音泛化观察,跨数据集非配对PESQ回落至2.00且跨性别非配对省略参考指标等失败条件尚未验证跨语言与大规模噪声外推,训练硬件为A6000 GPU且单步推理开销为一次函数评估。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
506. 同时听五个音频为什么变难:MUGEN 用音频当选项考查大音频语言模型
英文题目:MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
标签:#基准设计 #音频大模型 #模型评估 #音频问答
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#基准设计
👥 作者与机构
- Chih-Kai Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Yun-Shao Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Yu-Kai Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Ping-Le Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Yen-Ting Piao:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-Wei Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Ting-Lin Hsiao:机构信息未能从会议 PDF 纯文本可靠映射
- Yun-Man Hsu:机构信息未能从会议 PDF 纯文本可靠映射
- Ke-Han Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文针对大型音频语言模型(Large Audio-Language Model, LALM)需同时理解多个音频并完成跨音频比较的实际需求,提出多音频接地与理解基准(Multi-audio Grounding and Understanding Benchmark, MUGEN)。该任务输入为一条文本约束加五个候选音频(10个任务另含1个参考音频,共6个输入),输出为最符合约束的候选编号,难点在于非语义属性区分与随输入数量增长的联合推理退化。方法链分为三步:首先构建覆盖语音、通用音频与音乐的35个任务共1750个实例,其次用六个开源模型加Gemini-3-pro与级联系统评估语义与非语义能力差距,最后引入音频顺序置换自洽推理以聚合多次预测。与已有双音频语义评测相比,该设计强调音频作为选项(audio-as-option)与参考条件比较,具有更强的感知依赖性。在MUGEN全量评测中,Gemini-3-pro高推理档整体准确率为69.60%,而音频置换自洽(Audio-Permutational Self-Consistency, APSC)在低推理档带来6.28个百分点的绝对提升,结合思维链(Chain-of-Thought, CoT)进一步带来6.74个百分点的提升。结论适用于五选一受控比较场景,向开放对话与更长音频的外推尚未验证。原文未披露训练成本,明确承认多次生成带来可观计算开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
507. 靠得太近就分不清:用单通道老师管住双通道学生的空间依赖
标签:#知识蒸馏 #高效推理 #麦克风阵列 #语音增强
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#知识蒸馏
👥 作者与机构
- Yifei Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Zheng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Wentao Hua:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaobin Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
轻量双通道语音增强需从双麦克风混响混合中恢复参考通道目标语音,目标与干扰方位接近时通道间相位差失去区分度,模型仍过度依赖空间线索导致性能塌陷甚至不如单通道。该方法先让双通道混合输入学生分支、单通道混合输入预训练冻结教师分支同步前向,职责是各自输出增强语音并计算相对干净目标的混合损失,再将上一步得到的学生与教师损失差输入动态仲裁模块,职责是评估实例级难度并输出动态蒸馏权重,最后将该权重与学生相对教师输出的蒸馏损失相乘后与任务损失相加,职责是仅更新学生而保持教师冻结,推理时丢弃教师与仲裁模块仅保留学生。与需距离多任务切换或波达方向先验的已有方案不同,该机制无需角度监督且不增加推理参数与辅助输入。在1 m距离分割角度测试集下,D-SKD在0°到15°条件的PESQ为1.793,高于DC-GTCRN的PESQ 1.742。结论目前仅在单干扰仿真与客观指标上成立,未覆盖真实录音、低信噪比外推与多干扰情形。真实录音与多干扰外推尚未验证,构成其适用边界受限。推理开销方面训练后仅保留双通道学生,原文披露其不增加推理参数与辅助输入。
🔗 开源资源
- 演示资源:https://muefy.github.io/D-SKD-Audio-Demo → https://muefy.github.io/D-SKD-Audio-Demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
508. 用跳读和复读的失败样子教流匹配走稳:RobustSpeechFlow 的对齐鲁棒训练
标签:#对比学习 #流匹配 #鲁棒性 #文本到语音
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Jinhyeok Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Hyeongju Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Yechan Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Joon Byun:机构信息未能从会议 PDF 纯文本可靠映射
- Frederik Bous:机构信息未能从会议 PDF 纯文本可靠映射
- Juheon Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成(Zero-shot Text-to-Speech)的输入为文本与说话人提示,输出为连续语音潜变量再经声码器重建,难点在于无显式时长建模时交叉注意力在低容量与少函数求值次数(Number of Function Evaluations,NFE)下易出现跳词与复读。方法链分三步推进:首先沿线性概率路径构建条件流匹配(Conditional Flow Matching)正样本速度场并回归;其次以批内异话语构造随机负速度并作对比正则;最后以同话语等长复读覆盖与前移加静音填充的跳过腐蚀构造困难负样本并强化对比损失。相比随机错配条件,对比信号直接惩罚真实对齐失效所在的潜变量方向,而无需外部对齐器、语音识别模型或偏好数据。在公开 Seed-TTS-eval 上相对同架构基线词错误率(Word Error Rate,WER)由 1.44降至 1.38且说话人相似度(Similarity,SIM)保持 0.60。该策略在多样韵律与低 NFE 下更稳定,但说话人相似度未提升且主观自然度尚未验证。训练使用 8 卡 NVIDIA H100 共 50万步,推理采用 Euler 求解器与分类器无关引导,部署延迟吞吐成本原文未量化披露。
🔗 开源资源
- 演示资源:https://robustspeechflow.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
509. 诊室看不到白天的嗓子:用颈表振动一周监测区分两类声带过度功能
标签:#语音生物标志物 #基准设计 #生理信号 #病理语音评估
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#病理语音评估 | 主方法:#基准设计
👥 作者与机构
- Ahmed Yousef:机构信息未能从会议 PDF 纯文本可靠映射
- Robert Hillman:机构信息未能从会议 PDF 纯文本可靠映射
- Jarrad Van Stan:机构信息未能从会议 PDF 纯文本可靠映射
- Matías Zañartu:机构信息未能从会议 PDF 纯文本可靠映射
- Hamzeh Ghasemzadeh:机构信息未能从会议 PDF 纯文本可靠映射
- Ben Kevelson:机构信息未能从会议 PDF 纯文本可靠映射
- Daryush Mehta:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以颈表振动加速度计信号判别嗓音亢进亚型,输入为连续多日的帧级嗓音特征时间序列,输出为受试者级的二分类标签,难点在于日常发声高度可变且非发声创伤型缺乏可见器质性标记。方法链首先由颈戴单轴加速度计采集振动并经语音检测得到浊音帧,再从每帧提取声压级与倒谱峰突出度等声学特征及基于阻抗逆滤波的声门气流特征,随后参赛系统将多日时间序列聚合成窗或受试者级表示并训练非线性分类器,最后按受试者融合多日概率并以受试者曲线下面积排名。与既往仅用全局均值与标准差的线性基线相比,本次优胜方法的机制差异在于显式建模日内时变与特征间权衡关系,因而更贴近真实嗓音使用节律。在保留测试集上,创伤型任务最佳AUC达到0.93,非创伤型任务最佳AUC达到0.86,均高于对应基线。结论仅适用于以手工特征为输入的成年临床队列,直接外推至男性、其他嗓音疾病或原始波形端到端建模尚未得到验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
510. 在线时不能看未来:用渐进蒸馏把视觉前端变轻并保住说话人区分度
英文题目:Online Audiovisual Speaker Separation Using Efficient Visual Knowledge Distillation
标签:#知识蒸馏 #高效推理 #严格因果 #音视频语音分离
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音分离 | 主方法:#知识蒸馏
👥 作者与机构
- Cheng Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Vahid A. Kalkhorani:机构信息未能从会议 PDF 纯文本可靠映射
- Ashutosh Pandey:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Wong:机构信息未能从会议 PDF 纯文本可靠映射
- Jacob Donley:机构信息未能从会议 PDF 纯文本可靠映射
- Buye Xu:机构信息未能从会议 PDF 纯文本可靠映射
- DeLiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
在线音视频语音分离(audiovisual speaker separation,AVSS)以混合语音谱与多路人脸视频为输入,输出各说话人波形,难点在于严格因果下无法用未来上下文做分组,且预训练视觉前端多为非因果大模型。本文先对 DeepAVSR 做非对称时序填充的因果推理,使视觉嵌入仅依赖过去与当前帧;再将嵌入按说话人通道与混合复谱对齐后送入在线 AV-CrossNet 分离器;最后用视觉知识蒸馏(visual knowledge distillation,VKD)以线性退火权重从冻结教师过渡到轻量学生,全程联合分离目标优化。与依赖语义监督加图像重构辅助目标的轻量前端不同,VKD为任务导向的渐进交接,兼顾稳定优化轨迹与判别性保持。在 LRS2-2mix 上 VKD 系统感知语音质量评估(perceptual evaluation of speech quality,PESQ)达 3.39、尺度不变信失真比提升(scale-invariant signal-to-distortion ratio improvement,SI-SDRi)达 14.7 dB,超越在线基线并缩小与离线差距;在 LRS3-2mix 上为 3.48 和 16.6 dB,在 VoxCeleb2-2mix 上为 3.19 和 11.6 dB。该结论限于双人混合与受控唇部感兴趣区输入,未验证遮挡、多人与端侧实时约束。原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
511. 网格够用但不够准:用注意力选麦克风对、再用高置信网格算连续坐标
标签:#注意力机制 #麦克风阵列 #语音 #声源定位
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 1.0/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声源定位 | 主方法:#注意力机制
👥 作者与机构
- Zhiyuan Yue:机构信息未能从会议 PDF 纯文本可靠映射
- De Hu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
分布式麦克风阵列声源定位需从多节点语音波形与已知节点坐标估计二维连续声源位置,难点是直接回归坐标高度非凸且对噪声混响敏感,而网格分类又陷入粗网格量化误差与细网格计算开销的矛盾。G2C-NET先由可学习关系函数从麦克风对提取局部网格似然,再经自适应成对特征聚合器以独立可学习查询评估每对可靠性并加权融合为全局网格似然分布。该分布进入连续位置估计模块,对最大似然网格及其邻域做似然加权质心得到亚网格连续坐标,全网以分布一致性损失加坐标回归损失联合训练。与均匀求和加硬峰值拾取的图神经网络基线相比,关键差异是以质量感知注意力替代均匀聚合、以可微质心替代不可微拾取,从而兼顾稀疏节点鲁棒性与亚网格精度。在模拟仿真测试集下,G2C-NET的RMSE为25.52 cm,低于LMSL基线的RMSE 27.17 cm。该结论仅适用于单静态声源、已知房间几何的二维场景,未验证多声源、移动声源与阵列失配外推。原文未报告推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
512. 流式之下还要对准每个音素:MPA-KWS 如何统一文本与音频注册
英文题目:MPA-KWS: Multi-Modal Phoneme-Level Alignment for Streaming Open-Vocabulary Keyword Spotting
标签:#数据增强 #对比学习 #CTC #流式处理 #关键词检测
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#对比学习
👥 作者与机构
- Jue Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Guibin Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Jiarui Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiqing Han:机构信息未能从会议 PDF 纯文本可靠映射
- Chenhao Jing:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
开放词汇关键词检测需在仅给定文本或少量音频注册条件下,从连续语音流中判断目标短语是否出现,难点是易混淆词的细粒度区分与流式低延迟约束。该方法先由因果声学编码器提取帧级声学特征并经交叉注意力注入关键词文本先验,再用 W-CTC 强制对齐将连续帧加权聚合为音素级声学嵌入,随后对音频文本对施加非对称代理损失、对音频音频对施加对称 InfoNCE 约束,最后由验证器基于拼接交互特征输出存在概率。相对已有非流式对齐与纯文本注册流式方法,关键差异是训练与推理共用同一 W-CTC 对齐路径并同时支持文本与文本音频两种注册。在LibriPhrase-Hard测试集文本音频注册条件下,MPA的曲线下面积为97.30%,高于InfoNCE-Only的曲线下面积96.30%,且MPA的等错误率为8.21%,低于InfoNCE-Only的等错误率9.04%。结论目前仅在英语朗读短语的干净切分评测上成立,对噪声、口音、长尾关键词与真实流式误唤醒的泛化尚未验证。原文未披露训练硬件、训练轮数与推理实测延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
513. 按文本内容压缩语音:用 CIF 让大模型少看冗余帧
英文题目:Content-Aware Dynamic Compression for Efffcient Speech Recognition based on Large Language Model
标签:#Adapter #大语言模型 #高效推理 #语音 #语音识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#Adapter
👥 作者与机构
- Huifeng Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Bingqian Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shaoxun Xiu:机构信息未能从会议 PDF 纯文本可靠映射
- Xingqun Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Lv:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音大语言模型需把约25 Hz高帧率声学特征送入大语言模型,固定步长拼接或卷积下采样无法适应语速与内容密度变化,高倍率易丢细节、低倍率则冗余。作者冻结StepAudio2-Mini或FireRedLLM-ASR编码器提取特征序列H,经一维卷积加残差得到M,再经线性加Sigmoid预测每帧触发权重,由连续积分触发(Continuous Integrate-and-Fire,CIF)按累积权重触发变长声学嵌入Ea,最后经轻量适配器对齐维度送入Qwen3-1.7B或Qwen2-7B自回归转写。训练以转写词元数N为软目标约束权重和,推理无需文本即可按声学自主决定嵌入数。在LibriSpeech上相对同量级固定基线取得12%至13%词错率相对下降,在AISHELL-1上相对固定基线取得约26%字错率相对下降,在FireRed加Qwen2-7B配置上相对WEST基线取得33.4%相对下降并将平均语音嵌入长度从70压到27,在GigaSpeech二阶段后以39长度取得11.20%词错率。6秒至18秒语音首词元时延下降7.1%至19.5%。结论限于朗读类中英文与GigaSpeech标注数据,未验证自发对话、噪声远场与码切换。推理开销方面原文以延迟刻画效率,报告首词元延迟随平均语音嵌入长度缩短而降低。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
514. 不再先定死时长:用跳变管结构、用扩散修内容的一次联合生成
英文题目:Beyond Two-stage Diffusion TTS: Joint Structure and Content Refinement via Jump Diffusion
标签:#扩散模型 #韵律 #语音 #文本到语音
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#扩散模型
👥 作者与机构
- Jiabao Ai:机构信息未能从会议 PDF 纯文本可靠映射
- Minghui Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Anton Ragni:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到语音(text-to-speech, TTS)需将音素序列映射为梅尔谱,难点在于离散时长结构呈多峰分布而频谱内容连续变化,两阶段模型固定对齐易坍缩为平均韵律,单阶段模型又不稳定。该文提出跳扩散(jump diffusion)框架,在同一逆过程中交替执行离散帧插入与连续去噪:位置预测器(Location Predictor)在压缩状态上选择插入槽位,内容预测器(Content Predictor)生成新帧频谱残差,再经上采样-扩散-下采样(Upsample-Diffuse-Downsample, UDD)在目标长度画布上复用冻结去噪网络并下采样回可变长度迭代进行。该机制把时长建模转为槽位上的分类分布并复用固定维网络的归纳偏置。在 LJSpeech 匹配长度评测中单步变体词错率(word error rate, WER)降至 3.37%,显著低于同长度 Grad-TTS 基线的 4.38%,且主观自然度亦略优;0.75x 慢速外推中 UDD 自适应分配静音而非均匀拉伸。该结论目前仅在单说话人朗读语料下成立,自发与多说话人场景的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
515. 不用乘法做语音文本对齐:SPARK 把用户自定义关键词检测搬进脉冲域
英文题目:SPARK: Efficient Audio-Text Matching for User-Defined Keyword Spotting via Spiking Neural Networks
标签:#注意力机制 #多模态学习 #高效推理 #语音 #关键词检测
评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#注意力机制
👥 作者与机构
- Seung-Yeop Baek:机构信息未能从会议 PDF 纯文本可靠映射
- Sangho Han:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
用户自定义关键词检测以语音波形与用户给定文本为输入,输出两者是否匹配的验证分数,难点在于开放词汇下跨模态对齐与常开部署的功耗约束难以兼顾。该工作的方法链分为三步:脉冲音频编码器先将对数梅尔谱经深度可分离卷积转为稀疏脉冲嵌入,脉冲文本编码器再将音素嵌入经仿真步扩展与时序注意力转为上下文相关的脉冲序列,最后脉冲模式抽取器拼接两路嵌入做跨模态注意力并由双分支判别器输出话语级与音素级匹配概率。与已有人工神经网络方案的关键机制差异在于全链路以发放阈值与累加操作替代浮点乘加,并用列求和的掩码加法实现线性注意力以保持稀疏事件驱动计算。在 LibriPhrase-Easy 上该方法达到 99.07% 的 AUC 与 3.97% 的等错误率,相比 PhonMatchNet 基线以可比精度实现约 21.7 倍的理论能耗下降和约 2.1 倍的参数量下降。结论仅在受控英文朗读合成数据与固定 2 秒音频、35 音素填充设置下成立,未验证噪声、口音、长尾关键词与流式唤醒的外推能力。成本方面单次推理理论能耗为 18.44 微焦,原文未披露训练时长、推理延迟或部署硬件实测开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
516. 字错了但意思对了:用意图存活率重评语码切换语音识别
英文题目:CSER: Semantic Evaluation of LLM Auto-Repair for Code-Switching ASR
标签:#基准测试 #评测协议 #大语言模型 #多语言 #语音识别
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Tien Dat Bui:机构信息未能从会议 PDF 纯文本可靠映射
- Duy Le-Tuan Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Nhat Minh Le:机构信息未能从会议 PDF 纯文本可靠映射
- Van Hai Do:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理越南语为矩阵语言的越英代码切换语音识别,输入为含语内与语际切换的语音,输出为下游可执行的意图,难点是嵌入式英语实体常被转写为矩阵语言语音译而词法错误率虚高。方法链分四步:先由修复模型对假设做代码切换感知归一化,再由生成器针对参考中的实体与意图谓词构造探针问题,接着由抽取模型分别从参考与归一化假设中抽取答案,最后由判别器判定等价并按失败期望计算代码切换语义错误率。框架只罚意图丢失而容忍语音译等价,与词错误率、字符错误率和兴趣点错误率的字符串匹配形成互补。在包含2549条语内人类录音、2315条语际人类录音、97549条多样化合成语音与99994条媒体域合成语音的多条件基准上,自研VN-EN模型在Set 4上取得9.23%的词错误率和10.08%的语义错误率,显著优于商业系统的语义损失。该结论限于越英语音助手指令域且依赖Gemini 2.0 Flash裁判,未建立与人工意图判断一致性的定量相关性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
517. 反向做标注:先定发音动作时刻,再合成带地标的英语词库
英文题目:An Acoustic Landmark Database of the English Lexicon via Articulatory Synthesis
标签:#数据集 #数据集构建 #语音学与音系 #语音合成
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音合成 | 主方法:#数据集构建
👥 作者与机构
- Mateo Cámara:机构信息未能从会议 PDF 纯文本可靠映射
- José Luis Blanco:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Ignacio Godino-Llorente:机构信息未能从会议 PDF 纯文本可靠映射
- Jeung-Yoon Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Stefanie Shattuck-Hufnagel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为CMUDict词典的ARPBET音素序列,输出为男女双说话人配置的合成波形与毫秒级声学界标标注,难点在于自然语音人工标注费力且协同发音会弱化或抹除预期声学事件。先将ARPBET转为IPA典型变体序列以确定上下文相关目标清单,其输出直接作为Pink Trombone发音参数设定的输入。接着为每个音素手工设定发音目标并经相邻目标线性插值合成恒定时长波形,固定时序的波形与关键帧进入规则放置阶段。最后按发音方式规则在闭合或释放指令时刻放置界标,保证标注与底层发音命令确定性对齐。相比从声学反推界标的后验标注,该生成式路径以发音命令为因、声学事件为果,提供无人工标注误差的真值基准,跨语速韵律的外推尚未验证。在Harvard句平衡子集评测条件下,高可懂度部分合成词的STOI为0.8以上,高于全部合成词分布均值的STOI约0.75。该结论仅适用于孤立词与典型发音,不覆盖语速、韵律、语境变体及发音到声学的非瞬时延迟。原文未披露训练、推理或部署成本,因无神经网络训练故无损失与优化器设置。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
518. 一个旋钮管两头:用不对称双项损失在保语音与压噪声之间调平衡
英文题目:Balancing Speech Reconstruction and Noise Suppression Using Dual-Asymmetric Loss
标签:#正则化 #单通道 #语音 #语音增强
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#正则化
👥 作者与机构
- Merlin Carson:机构信息未能从会议 PDF 纯文本可靠映射
- Suyash Dandekar:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从含噪混合中恢复目标语音,难点在于语音与噪声频谱高度重叠,过度抑制损伤语音而保守增强又残留噪声。该工作提出双非对称损失,先基于压缩复数均方误差基座,将增强谱与干净谱的压缩幅度和复数误差分别计算。接着用修正线性单元与指示函数拆分为只罚语音衰减的语音项和只罚残留噪声的噪声项,分别负责衰减检测与残留检测。然后以可调权重λ线性加权两项并经短时傅里叶变换一致性约束训练掩蔽或映射模型,使上一步的加权误差直接进入下一步的模型优化。与以往单边非对称或单步取最大值的可调损失不同,该设计同时优化两项加权和并保留相位感知复数项,避免了逐迭代只优化单目标带来的振荡。在DNS5 Blind Test Set评测下,LiSenNet λ=0.65的SIG得分为3.22,高于LiSenNet λ=0.35的SIG得分3.09。13个λ取值扫描显示λ与语音质量呈强正相关而与背景抑制呈强负相关,极端取值分别导致语音过抑制或噪声泄漏,其结论适用边界受限于测试的信噪比与噪声类型及尚未验证的跨语种外推范围。四种架构覆盖57K参数与56M计算量至2.25M参数与32.73B计算量,MP-SENet长语音评测受限于48GB硬件显存而仅取前30秒,训练成本为200轮指数衰减训练并以验证损失最低检查点测试。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
519. 不转写、不翻译:用对齐的句向量直接生成法语摘要
标签:#数据集 #迁移学习 #跨语言 #低资源 #语音翻译
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#迁移学习
👥 作者与机构
- Chaimae Chellaf:机构信息未能从会议 PDF 纯文本可靠映射
- Salima Mdhaffar:机构信息未能从会议 PDF 纯文本可靠映射
- Yannick Estève:机构信息未能从会议 PDF 纯文本可靠映射
- Stéphane Huet:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言摘要需从源语言长文档或长语音提炼要点并用法语重写,在源语言资源稀缺且语音存在识别误差时级联系统易断裂。本文将文本按句子切分、语音按语音活动检测切分,分别用冻结的跨语言对齐句子嵌入与语音嵌入编码为语义向量序列。该向量序列经线性投影加GeLU激活对齐维度后,送入改造的编码器解码器SBARThez直接生成法语摘要。两阶段先在法语上预训练生成能力再用目标任务微调,只训练投影层与生成部分,使文本训练的模型可直接迁移到语音推理。与先翻译后摘要或先转写翻译后摘要的级联方案不同,该方法完全在句子级语义空间操作,避免误差累积并支持跨语言与跨模态迁移。在ABT-SpeechSUM突尼斯语语音到法语任务测试集下,SBARThez-speech的Rouge-L为20.59,高于W-LST加mT5-large级联基线的Rouge-L 18.95。该结论适用边界受限于法语为目标语言、新闻与故事讲述等有限领域及14种文本语言加3种语音,长语音建模与合成参考摘要的偏差尚未验证。该方法训练成本仅140M可训练参数,推理开销总量约700M参数,远小于级联系统超过2.7B的计算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
520. 重叠声越多越数不清:PolyBench 检验复调音频中的组合推理
英文题目:PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
标签:#基准测试 #基准设计 #音频大模型 #环境声 #音频问答
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#基准设计
👥 作者与机构
- Yuanjian Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Han Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Xubo Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Jinjie Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为真实录制的复音音频片段与文本问题,输出为多选项答案,要求在声源相互掩蔽与证据不稳定下完成计数、分类、检测、并发判断与时长估计。该基准先从 DataSED、DESED 与 MAESTRO-Real 筛选含重叠的真实片段并保留事件类别与时间戳,再由人工与大语言模型协作生成五类多项选择问答并经质量校对,最后用统一提示与语义相似度评分对大型音频语言模型(Large Audio Language Models,LALMs)做评测。其中并发对照额外引入无重叠单音片段以平衡正负样本,避免纯复音下答案恒为肯定带来的评估偏差。与侧重单调时序排序的既有基准相比,该工作把并发关系作为一阶推理对象,迫使模型同时维持多事件证据与关系约束。在PolyBench基准下,Qwen3-Omni-30B-A3B的计数准确率为57.5%,高于Audio Flamingo 3的计数准确率53.4%。结论仅适用于所选三源真实录音与多项选择问答(Multiple-Choice Question Answering,MCQA)协议,未验证开放式问答、精确时间戳的声音事件检测(Sound Event Detection,SED)或合成高密度复音的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/PolyBench/PolyBench — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
521. 把水印藏进编解码器不丢的东西里:Latent-Mark 的潜在空间偏移
英文题目:Latent-Mark: An Audio Watermark Robust to Neural Codec Compression
标签:#评测协议 #向量量化 #鲁棒性 #音频水印
评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频水印 | 主方法:#向量量化
👥 作者与机构
- Yen-Shan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shih-Yu Lai:机构信息未能从会议 PDF 纯文本可靠映射
- Ying-Jung Tsou:机构信息未能从会议 PDF 纯文本可靠映射
- Yi-Cheng Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Bing-Yu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yun-Nung Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Shang-Tse Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为任意时域音频波形,输出为携带零比特存在性标记的加水印波形,难点在于神经编解码器编码器-量化器-解码器链会把离流形波形扰动当噪声丢弃。方法分四步:先在高分辨率工作域维护扰动并重采样到各代理编解码器原生采样率以同步多视角,其多视角波形进入下一步校准。接着用干净音频零分布计算阈值与校准尺度以平衡不同潜空间尺度的梯度,得到归一化铰链损失权重后进入约束优化。然后在无限范数约束下优化波形扰动使多编解码器时序平均潜投影同时越过目标裕量,其扰动波形进入集成检测。最后用归一化裕度的中位数做集成检测并以差值分数衡量经压缩后的方向偏置是否留存。相比在波形或频谱加掩蔽噪声的传统范式,该工作把水印定义为指向码本簇间方向的可保留结构偏置而非待滤除残差,因而能在解码再编码后仍被检出,具有实际意义。在高斯噪声攻击评测设置下,Latent-Mark的存活检测率指标为100.00,高于WavMark的存活检测率指标3.33。该结论适用边界限于零比特检测与所测的编解码器系列,远亲架构与低通滤波下明显回落,跨家族合成管线的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
522. 把重建当难题:用扩散重建逼出更能泛化的音频深伪检测
英文题目:Diffusion Reconstruction towards Generalizable Audio Deepfake Detection
标签:#对比学习 #扩散模型 #鲁棒性 #语音 #音频深度伪造检测
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#扩散模型
👥 作者与机构
- Bo Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Songjun Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoming Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Long Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频深度伪造检测需以原始波形为输入并输出真伪二分类判决,实际难点在于新型语音合成与神经音频编解码持续涌现导致跨域泛化显著下降。本文先用HiFi-GAN、DAC、Encodec与基于潜在扩散的SemantiCodec对ASVspoof 2019 LA训练与开发集的真实与伪造音频做重构,构造听感基本不变但携带生成伪影的难样本以逼近未知攻击。接着冻结XLS-R 300M并提取其多层Transformer特征,经自适应卷积注意力加权聚合为统一表示后送入AASIST分类器进行判别。然后以交叉熵分类损失联合标准对比与增强对比构成的双重对比损失及方差正则损失优化AASIST末隐层嵌入,其中真实样本标为0类而其余三类统一标为非真实类。与仅用单一编解码重构或仅用分类损失的方法相比,该机制差异在于以扩散重构强化难样本覆盖并以对比加正则显式拉开真实与重构真实距离,其实际意义在于提升对扩散合成与编解码攻击的鲁棒泛化。在ASVspoof 2019 LA评估集、ITW、DiffSSD、WaveFake和CodecFake五个测试集上,最优模型RACL Diffusion平均等错误率从基线15.789%降至8.247%,扩散单重构为12.220%,相对基线下降22.604%。结论适用于以重构伪影近似未知攻击的场景,原文未披露训练推理成本与显著性检验。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
523. 先排可信度再渐进学,还要记住说话人:老年语音半监督识别的伪标签提纯路线
标签:#课程学习 #提示学习 #半监督学习 #语音识别
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#半监督学习
👥 作者与机构
- Chengxi Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Xurong Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Shujie Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Jiajun Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Mengzhe Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Youjun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Huimeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoning Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Guinan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xunying Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
老年语音识别需将声学输入转写为文字,难点在于标注稀缺、基础模型解码错误率高、说话人之间构音与语言退化程度差异大。方法链分四步推进:先在少量标注数据上微调Whisper-medium与轻量置信度估计模块Confidence Estimation Module / CEM,对无标注语音生成伪标签并打分;再按说话人内排序把伪标签分成由高到低的多个子集,形成课程学习Curriculum Learning轨迹;随后从高置信子集起迭代微调并用新模型重标下一子集,逐步累积可靠监督;最后在每轮引入可学习说话人提示Speaker Prompt做说话人自适应训练Speaker Adaptive Training / SAT,以解耦说话人特性并提升后续解码质量。相对直接过滤低置信样本或随机划分增量训练,该设计保留全部说话人覆盖并持续修正伪标签而非一次性丢弃,同时用自适应缓解异质性。在DementiaBank Pitt评估集全部说话人上相对半监督基线词错误率Word Error Rate / WER降低1.45个百分点,在JCCOCC MoCA上全部说话人字错误率Character Error Rate / CER降低2.27个百分点,均通过MAPSSWE显著性检验;老年被试子集上降幅分别为2.12和1.88个百分点。结论限于英语痴呆访谈与粤语认知评估两类数据及10%标注说话人默认设置,未验证自发对话、重度病理或其他语种的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
524. 分开学更准、合在一起更全:用风格文字检索和挑选语音的双编码器
英文题目:ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
标签:#对比学习 #语音 #音频检索 #语音属性识别 #文本到语音
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#音频检索 | 主方法:#对比学习
👥 作者与机构
- Anuj Diwan:机构信息未能从会议 PDF 纯文本可靠映射
- Eunsol Choi:机构信息未能从会议 PDF 纯文本可靠映射
- David Harwath:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
现有语音与文本风格对齐仅覆盖少量情绪标签,无法处理音高、音质、口音等丰富的内在特质与情境状态的自由文本描述,检索、属性分类及风格化合成指导缺乏统一表示。本文方法分三步衔接:第一步由语音编码器与文本编码器分别将语音片段与风格描述映射为768维嵌入,第二步对批量嵌入构建语音-文本余弦相似矩阵并用双向InfoNCE对比目标拉近配对样本,输出的共享风格空间直接作为后续训练与推理的基础。第三步针对内在分支用文本编码器本身为28个标签生成释义类别嵌入以产生分类logits,并叠加二元交叉熵多任务损失与按逆标签频率上采样的类别平衡训练,强化模态对齐后进入统一推理,推理时均用余弦相似度完成检索排序、模板分类及TTS候选筛选。与仅覆盖 6 个情境标签的 ParaCLAP 相比,关键差异在于覆盖 28 个内在标签与 23 个情境标签的完整分类体系、更强编码器组合与类别平衡训练。在 ParaSpeechCaps 划分的内在评测集上,专用内在模型取得 R@1 为 18.62 与 UAR 为 46.58,明显优于微调基线与专用分类器基线。该结论局限于 ParaSpeechCaps 的 VoxCeleb 与 Expresso 与 EARS 来源语音及英文风格提示,未在 IEMOCAP 等外部基准与跨语言场景验证。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/huggingface/parler-tts — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
525. 用听者自己的耳朵形状做线索:在保住方位感的同时抽出目标说话人
英文题目:HRTF-guided Binaural Target Speaker Extraction with Real-World Validation
标签:#Conformer #多通道 #空间音频信号 #语音 #目标说话人提取
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#Conformer
👥 作者与机构
- Yoav Ellinson:机构信息未能从会议 PDF 纯文本可靠映射
- Sharon Gannot:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理已知目标方位和俯仰时的双耳目标说话人提取与去混响,输入为左右耳混合短时傅里叶变换复数谱与目标方向直达HRTF,输出为保留双耳间时间差与强度差的双耳直达声,难点在于干扰说话人音色相近时仅靠频谱难以区分且易破坏空间线索。先将左右耳混合复数谱与目标方向HRTF经实虚拼接后分别送入独立卷积编码器映射到共享隐空间,职责是对齐声学与空间线索并输出对齐特征。再将上一步输出的HRTF特征沿时间复制后与混合对齐特征逐元素相乘,职责是以目标空间签名做调制筛选并输出保留目标成分的调制特征。最后将调制特征送入8层窄带Conformer变体NBC2建模窄带时频依赖并经线性解码器恢复左右耳复数谱,输出即为去混响的双耳直达声。相比同骨干DOA嵌入基线,该机制把方向标签换成含耳间滤波细节的个性化声学指纹,使分离更像匹配滤波并约束重建的空间一致性。在包含480次提取的真实录音测试集下,Proposed方法的NISQA分数为3.22,高于DOA-BDE基线的NISQA分数3.14。结论的适用边界限于2说话人全重叠混响英语、已知方位且最近邻HRTF可用的情形,方位量化误差与跨阵列部署等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
526. 不在谱上做增强:在语音自监督表示空间里用语音内容带声学细节做流匹配
标签:#流匹配 #高效推理 #语音 #去混响 #语音增强
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#流匹配
👥 作者与机构
- Jun Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaobin Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Dahan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从带噪带混响语音中恢复高自然度干净语音,难点在于频谱域中音高、音色与语言内容纠缠,相位缺失或分布重尾使生成建模困难。PhASE-Flow(Phonetic-conditioned Acoustic Speech Enhancement with Flow matching)冻结WavLM-Large编码器,从带噪波形抽取第1层Transformer输出作声学表征`za`与最后1层输出作语音学表征`zp`,再用DiT式流匹配模块建模干净声学表征以语音学表征为条件的分布,最后用独立在干净语音上训练的改进Vocos声码器从增强声学表征经逆短时傅里叶变换重建16 kHz波形。与Mel域或短时傅里叶变换域建模相比,该机制把语义对齐与声学细节保留统一在解耦的自监督学习空间内,减少表征错配。在 DNS 2020 无混响合成集上,该方法 UTMOS 达 4.11,超过同架构 Mel 基线 FlowSE 的 3.76 与 AnyEnhance 的 3.96,dWER 为 2.79% 为全场最低。其结论适用边界受限于16 kHz合成英文数据与特定WavLM加声码器组合,混响下dWER恶化至13.19%,跨语言、真实噪声与强混响泛化能力尚未验证。原文未披露参数量、训练时长与推理延迟实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
527. 野外网页音频上练多语表示:UPS 2026 用三任务逼出通用性短板
英文题目:Unsupervised Speech in the Wild Challenge: Learning Robust Multilingual Representations
标签:#基准设计 #少样本 #多语言 #语音识别 #语言识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Rafael Mosquera Gómez:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Felipe Rodríguez:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Galvez:机构信息未能从会议 PDF 纯文本可靠映射
- Sarah Luger:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该挑战以原始波形为输入,要求单一冻结编码器同时输出可支撑语种判定、字符转写和说话人区分的帧级表征,难点在于野外网页音频混杂自发对话、音乐、环境噪声与长尾多语言分布。方法链分为四步:先以无转写网页音频统一预训练以暴露真实声学变异,其次将编码器冻结并经由Dynabench统一接口输出帧嵌入,再分别经时域聚合加线性分类完成语言识别(Language Identification,LID)、经线性映射加联结时序分类完成少样本识别、经按语种独立聚类完成说话人评估,最后以三任务平均排名形成总榜。相对以往在精制语料上预训练并在单任务上评测的范式,关键差异在于训练来源受限与多任务冻结评测的组合,迫使表征自身具备鲁棒性而非依赖下游微调。在80个有效提交的公开榜单上,语言识别最优宏平均F1达到0.9488,少样本自动语音识别(Automatic Speech Recognition,ASR)最优宏平均字符错误率(Character Error Rate,CER)为0.5378,说话人聚类最优调整兰德指数(Adjusted Rand Index,ARI)为0.9469,且无单一系统同时主导三任务。结论仅适用于冻结编码器加轻量探针的设定,无法外推至全参数微调、大语言模型重打分或强去噪前端等场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
528. 把编辑搬进文本空间:用丰富描述改写实现零样本开放式音频编辑
英文题目:Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption
标签:#自监督学习 #统一音频模型 #零样本 #音频生成
评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频生成 | 主方法:#自监督学习
👥 作者与机构
- Xun Gong:机构信息未能从会议 PDF 纯文本可靠映射
- Jinchuan Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Haoran Wang:机构信息未能从会议 PDF 纯文本可靠映射
- William Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
- Yanmin Qian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
开放式音频编辑输入为原始波形与自由文本指令,输出为定向修改后音频,难点在于混合语音、音乐与环境声中判断改什么留什么并维持真实感与身份一致。Bagpiper-Edit方法链分3步:先由统一基座抽取原始音频的丰富描述作为语义代理,再用外部文本大模型将用户请求融合为目标描述,最后以原始音频为声学锚点按目标描述自回归生成。与依赖原子操作加减与成对数据的级联系统不同,该框架把组合编辑收敛到一次文本空间变换加一次锚定生成。训练侧以音频重复约束音色与背景保持不变,以相邻片段分割构造单轮与多轮对话式编辑代理对,从而无需成对编辑数据即可学习锚定生成。在LibriSpeech test-clean转录编辑上,多轮变体取得词错率为14.01%与说话人相似度为0.83,接近专用模型且远好于基座的72.19%与0.58。适用边界在于全句替换易受大模型改写误差传播影响,复杂多说话人与细粒度风格控制仍受基座容量限制。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
529. 从单人情绪标签转向互动场:重叠共现时的亚秒级声音耦合
标签:#统计分析 #韵律 #语音 #语音情感识别
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音情感识别 | 主方法:#统计分析
👥 作者与机构
- Cy Gorman:机构信息未能从会议 PDF 纯文本可靠映射
- Yihang Yao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为 4 人会议中多通道头戴语音,输出不是单人情绪标签而是交互场层面的方向性表达耦合判断,难点在于区分真正的互定向共振与能量同步及群体混杂。首先用 WavLM Base+ 第 1 至 12 层连续隐状态提取跨层离散度表达性代理,其输出与能量等语义代理共享帧轴进入下一步;接着按语音活动将 60 s 窗切分为重叠 Tier A、混合非重叠 Tier B 与分方向 Tier C,其 regime 掩膜决定后续检验的样本;然后在 regime 连续片段上做双变量与 4 说话人条件向量自回归 Granger 检验,其检验统计量再经循环移位零分布校准为超额拒绝率与方向支持分。与个体收敛式 entrainment 不同,该链条以场构型为解释变量并用排他语音对照做反事实检验。在AMI会议语料评测设置下,能量控制条件分析的超额拒绝率指标为+7.4 points,高于双变量模型的超额拒绝率指标+6.6 percentage points。结论仅适用于正式 4 人会议的亚秒级线性预测依赖,跨库与非线性机制尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
530. 让会思考的语言模型真正用耳朵听:自复述与多编码器融合的音频对齐
标签:#Adapter #多模态学习 #音频大模型 #音频理解
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#音频理解 | 主方法:#Adapter
👥 作者与机构
- Petr Grinberg:机构信息未能从会议 PDF 纯文本可靠映射
- Hassan Shahmohammadi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理以音频波形为输入、以自然语言回答为输出的音频问答与推理任务,难点在于推理大模型的内置思维链会复述文本替代输入与元数据来源导致文本腔,且单一Whisper编码器不擅长音乐与环境声。第一步由指令模型基于文本描述与元数据生成多样化候选提示并过滤,仅保留可回答且音频提示对齐的提示以抑制幻觉。第二步由冻结推理模型基于文本表示生成初始回答,再由同一模型将其重述为听觉感知风格的文本并丢弃中间链,重述结果作为音频训练目标切断规则泄露。第三步冻结推理主干与四个音频编码器,仅训练适配器与融合模块,将多层加权特征经交叉注意力或感知器压缩后映射到文本嵌入空间。相对已有自生成方法依赖语音活动检测与识别文本的做法,该链消除了对识别输入的依赖并修复了推理模型的目标分布失配,使冻结主干保留文本能力的同时获得跨编码器互补。在MMSU基准测试条件下,ALARM-E的感知准确率为45.4%,高于7B Qwen2.5-Omni的感知准确率42.5%。该结论适用边界受限于英语为主的短音频推理基准,尚未验证长时对话、强噪声与多轮交互外推。训练成本方面,模型冻结主干仅训练适配器并使用更少音频词元,ALARM-E以50 Hz运行而非175 Hz拼接从而降低计算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
531. 可比性优先的可懂度评估:PathBench 用统一协议约束参考条件与发音内容
英文题目:PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
标签:#基准测试 #基准设计 #多语言 #语音可懂度评估 #病理语音评估
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音可懂度评估 | 主方法:#基准设计
👥 作者与机构
- Bence Mark Halpern:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Tienkamp:机构信息未能从会议 PDF 纯文本可靠映射
- Defne Abur:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Toda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
病理语音可懂度任务(Pathological Speech Intelligibility Task, PSIT)以患者录音为输入,以人工可懂度或相关临床评分为输出,难点在于数据多为私有、标注口径不一、且混杂年龄与录音噪声等混淆因素。该工作构建 PathBench 基准,先将六个公开数据集过滤为词(Word)与句(Sentence)两种刺激类型,再对同一说话人池定义内容匹配(Matched Content, MC)、扩展(Extended, EX)与全量(Full)三种协议,最后并行评测无参考信号类、无参考模型类、有文本参考类与有音频参考类共 12 种方法,统一以说话人级皮尔逊相关系数(Pearson Correlation Coefficient, PCC)汇总性能。所提双重识别构音精度(Dual-ASR Articulatory Precision, DArtP)属于无参考模型类,先用语义模型结合 5-gram 语言模型束搜索解码出语言学校正后的意图文本,再经字素转音素转为音素序列并用独立语音模型做联结时序分类(Connectionist Temporal Classification, CTC)强制对齐打分,从而无需人工转录即可给出可定位到音素与时间的构音置信度。与已有无参考置信度方法相比,其关键差异是用显式语言先验分离意图推断与声学保真度评估,而非直接用识别不确定性代理病理程度。在六数据集 19 个协议平均上 DArtP 达到 0.66,为无参考方法最高,但仍低于有文本参考的构音精度(Articulatory Precision, ArtP)的 0.72 与有音频参考的神经声学距离(Neural Acoustic Distance, NAD)的 0.71。该结论仅适用于英、意、西、荷四种语言的朗读词句任务,未验证自发语音、声调语言与系统加噪下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/karkirowle/pathbench.pathologies — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
532. 小参数做孟加拉语情感识别:用统计选出的韵律特征搭配双流 DNN-KAN
英文题目:Dual-Stream DNN-KAN Networks with Bangla-Specific Features for Speech Emotion Recognition
标签:#注意力机制 #评测协议 #统计分析 #语音 #语音情感识别
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#注意力机制
👥 作者与机构
- Kazi Reyazul Hasan:机构信息未能从会议 PDF 纯文本可靠映射
- Muhammad Abdullah Adnan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理孟加拉语语音情感识别,输入为单句孤立语音,输出为离散情绪标签,难点在于频谱与韵律线索交织且说话人无关泛化困难。方法链首先对候选声学特征做判别性统计筛选,输出多尺度韵律描述子与频谱描述子,分别送入专用分支建模。随后频谱分支经因式化深度神经网络建模纹理,韵律分支经共享基函数网络学习平滑非线性,再经早期与晚期双向交叉注意力交换互补信息。接着情绪自适应门控依预测情绪分布动态加权两流并经瓶颈融合分类输出标签。与直接处理原始波形的大型自监督模型相比,该设计以统计优选的语言适配特征替代大规模预训练,并为异质特征分配专用归纳偏置。在SUBESCO评测设置下,加入韵律KAN分支后模型的准确率为87.37%,高于仅MFCC的基线模型的准确率79.83%。其适用边界受限于表演式数据的优选特征尚未验证会话式场景的外推。该推理开销对应的延迟在中央处理器上为亚秒级,训练成本原文未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
533. 同一标签里混进异说话人时,为何平均分数会失准:用双峰混合分离可信与误聚分数
标签:#统计分析 #鲁棒性 #语音 #说话人分离标注 #说话人识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人识别 | 主方法:#统计分析
👥 作者与机构
- Hee-Soo Heo:机构信息未能从会议 PDF 纯文本可靠映射
- Minjae Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Youngki Kwon:机构信息未能从会议 PDF 纯文本可靠映射
- Han-Gyu Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Bong-Jin Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
目标说话人标记输入为长时多说话人录音,输出是经说话人分离标注获得的单说话人片段及其对应的已注册身份或非目标标签,实际难点在于自然对话片段时长差异极大,短片段嵌入质量差导致验证分数方差高且判别力弱。方法先按常规流程完成语音活动检测与聚类得到分离标签并计算每个片段与注册库的余弦相似度分数。其次收集共享同一标签的全部片段分数构成集合进入下一步拟合。最后对该集合拟合双分量高斯混合模型并用后验最大分量的均值替换原始分数。与直接标签平均和近邻平均相比,该机制显式将正确聚类与误聚类分数分离到不同分量,从而避免异质分数污染聚合结果。在TST-Bench基准下,GMM的DIR指标为93.64%,高于未校准基线的DIR指标88.79%。该结论依赖每标签至少 5 个片段且欠聚类呈现双峰的假设,对极短会话、严重过聚类或信道主导的多峰情形尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
534. 情绪有惯性:用说话人局部时间窗构造难负样本的会话情感识别
英文题目:EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation
标签:#对比学习 #多模态学习 #音视频 #语音情感识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#对比学习
👥 作者与机构
- Zilong Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Chong-xin Gan:机构信息未能从会议 PDF 纯文本可靠映射
- Zezhong Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Ruichen Zuo:机构信息未能从会议 PDF 纯文本可靠映射
- Man-Wai Mak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
对话情感识别以多轮对话中每条话语的文本、音频与视频为输入,输出离散情感标签,难点在于同说话人相邻话语发生情感漂移时仍高度相似,传统上下文建模易误判渐变过渡。该工作先用预训练编码器与双向门控循环单元提取三模态上下文表示,再经Transformer或图网络融合为统一话语向量并送入分类器。同步引入情感惯性引导监督对比学习模块,依据说话人身份与注意力加权时窗划分正样本、易负样本与惯性窗内难负样本,并以相似度动态调节排斥强度。相较于仅按标签异同构造正负对的已有对比方法,该机制显式利用局部时间持续性刻画渐变式情感转移。在IEMOCAP上融合Transformer的变体取得准确率73.95%与加权F1值74.01%,超越表格中最强基线。在MELD上同样取得最高准确率68.19%与加权F1值67.33%,但领先幅度较小。结论目前仅在IEMOCAP与MELD的英文表演与影视对话上验证,向多语言自发对话与长时情感演化的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
535. 耳戴上省电采样、手机上重建宽带:CAPS 的次奈奎斯特级联重建
标签:#多模态学习 #高效推理 #流式处理 #语音增强 #语音超分
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音超分 | 主方法:#多模态学习
👥 作者与机构
- Tarikul Islam:机构信息未能从会议 PDF 纯文本可靠映射
- Sajid F. Dipto:机构信息未能从会议 PDF 纯文本可靠映射
- Luke B. Baja-Ricketts:机构信息未能从会议 PDF 纯文本可靠映射
- David C. Vergano:机构信息未能从会议 PDF 纯文本可靠映射
- Anomadarshi Barua:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向助听式可穿戴设备噪声下语音通信任务,输入为经亚奈奎斯特采样与低比特量化的气导麦克风窄带噪声语音与骨传导麦克风振动信号,输出为移动端恢复的宽带干净语音,难点在于低采样与大量化误差叠加高噪声时相位失真严重。频谱增强网络先在时频域将低分辨率频谱映射为高分辨率表示以简化后续建模,其输出进入上采样网络经多级转置卷积与扩张残差块将频谱转换为波形并提升时间分辨率。幅相增强网络最后融合骨传导波形并在幅度与解缠相位域联合去噪去伪影,与已有单模态带宽扩展或多模态增强相比,该链路将采样率与比特分辨率联合降额与跨模态相位修复放在同一级联中,使助听端可工作于亚奈奎斯特区而由手机承担重建。在桌面端4-16kHz带宽扩展与多模态增强评测任务下,CAPS的PESQ为2.99,高于SEANet的PESQ 2.43。在Google Pixel7上的端到端推理耗时为55.11毫秒,低于国际电信联盟150毫秒单向时延要求,支持流式传输。该结论依赖自采的20人英语朗读与特定压电与加速度传感器组合,跨语言、跨器件与编解码器存在时的泛化尚未验证,手机端约瓦级功耗需由大电池承担。该级联在Pixel7硬件上验证的端到端延迟对应的推理开销仍需由手机端大电池承担。
🔗 开源资源
- 第三方资源:https://github.com/openai/whisper — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
536. 把编解码器变小而不变差:用说话人分组同时压缩编码器与解码器
英文题目:End-to-End Model Compression for Personalized Neural Speech Codecs
标签:#模型压缩 #高效推理 #鲁棒性 #语音 #语音编码
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#模型压缩
👥 作者与机构
- Inseon Jang:机构信息未能从会议 PDF 纯文本可靠映射
- Minje Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Wootaek Lim:机构信息未能从会议 PDF 纯文本可靠映射
- Seungkwon Beack:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
个性化神经语音编解码需以含噪语音为输入、输出干净重建语音,通用大模型为覆盖全说话人方差而参数膨胀,在低比特率下兼顾去噪与保真十分困难。方法先用抗噪说话人编码器提取嵌入并经k均值聚成4组,得到组质心以备分类。推理时按欧氏距离选择最近组索引,再仅运行该组小型个性化DAC编码器生成码流并连同组索引传输。接收端调用同组个性化解码器重建去噪语音,形成收发两端同步适配的端到端压缩链。与仅压缩接收端声码器的个性化线性预测编码网络不同,该方案同时压缩编码器、解码器与量化器并联合承担编码增益与去噪,具有架构无关的实际意义。在LibriSpeech test-clean评测条件下,PDAC-T的码率指标为1 kbps,低于DAC-L的码率指标2 kbps且保持相当感知质量。该结论适用边界受限于英语朗读语音与MUSAN加性噪声的4组划分,频繁切换说话人或跨语言跨信道场景尚未验证;原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/descriptinc/descript-audio-codec — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
537. 无人机自噪声下先选出可信方位再做空间滤波:在负 25 分贝下保住目标方向
英文题目:Ego-Noise-Aware Spatial Filtering for Reliable UAV Audition in Extreme Low-SNR Conditions
标签:#波束成形 #麦克风阵列 #语音 #声源定位 #语音增强
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#波束成形
👥 作者与机构
- Chanhong Jeon:机构信息未能从会议 PDF 纯文本可靠映射
- Jeongmin Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Hyungjoo Seo:机构信息未能从会议 PDF 纯文本可靠映射
- Kyuhong Shim:机构信息未能从会议 PDF 纯文本可靠映射
- Taewook Kang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对无人机自噪声主导下的极低信噪比语音拾取,输入为4元圆形阵列混合信号,输出为单通道增强语音,难点在于强时间相关噪声同时污染方向估计、噪声协方差矩阵 Noise Covariance Matrix / NCM估计和波束形成后残留抑制。方法链分三步推进:先用相位一致性偏离筛选语音主导时频单元并投票得到全局方向,再以该方向同时参数化分频混合掩蔽以估计NCM并驱动最小方差无失真响应 Minimum Variance Distortionless Response / MVDR波束形成,最后用零陷投影估计残留噪声并经方差调制做后滤波。与单增益掩蔽或固定后滤波不同,该框架把方向作为跨阶段共享空间基准,低频用邻近增益保语音而高频用指向性增益抗主瓣展宽。在TIMIT合成测试集条件下,所提方法在-25dB消声场景的方向估计准确率为98.12%,高于混响场景的准确率94.79%。结论限于悬停状态与已知阵型仿真验证,非悬停运动、多机型噪声与真实混响飞行尚未验证。计算成本仅为0.021 GMAC/s,无需预训练模型。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
538. 静态帧淹没了校准:用帧间差异重加权 Hessian 的超低比特语音识别量化
英文题目:Not All Frames Are Equal: Difference-Aware Quantization for Ultra-Low-Bit ASR
标签:#模型量化 #高效推理 #后训练 #语音 #语音识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型量化
👥 作者与机构
- Woori Jeon:机构信息未能从会议 PDF 纯文本可靠映射
- Jungmin So:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别需将连续语音的对数梅尔谱图输入映射为离散文本输出,实际难点在于稳态元音、静默与定长补零带来高度时域相关与冗余,传统后训练量化对所有帧等权估计海森矩阵,导致静态帧主导校准而淹没音素边界处的关键瞬变。差分感知量化先从编码器中间层提取帧级隐层激活并计算相邻帧差分的L2范数,得到表征声学变化速率的时间密度得分。再将该得分按序列均值归一化并加入基底权重生成重要性系数,使静默趋向保底值而瞬变高于均值。然后用该系数加权累积海森矩阵并送入标准GPTQ求解器以量化编码器线性层,其输出的重构误差集中于动态帧,解码器仍保持常规校准。与GPTQ和AWQ均匀利用激活幅值保护显著权重不同,该机制显式抑制零填充与静态帧并放大音素边界瞬变,使量化精度集中于可懂度关键区域。在 Whisper Medium 的 LibriSpeech test-other 划分上,2 比特量化词错率(Word Error Rate,WER)由 GPTQ 基线的 17.53% 降至 12.93%,方向为显著下降。该结论限于 Whisper 系列英文评测,对含突发噪声的场景与流式或基于联结时序分类(Connectionist Temporal Classification,CTC)架构尚未验证,且 Whisper Base 在 2 比特下仍失效。校准开销与标准 GPTQ 基本相同,而 2 比特可将 Medium 权重内存从约 1.5 GB 压缩至 200 MB 以下。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
539. 用单乐器检测器清洗网络爬取音频:七轨分离数据的自动构建
英文题目:Automatic Curation of Large-Scale, High-Quality, Multi-Category Music Source Separation Dataset
标签:#数据集 #数据集构建 #音乐 #音乐源分离
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音乐源分离 | 主方法:#数据集构建
👥 作者与机构
- Yu Ji:机构信息未能从会议 PDF 纯文本可靠映射
- Shuo Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuetonghui Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Mengmei Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Qiang Ji:机构信息未能从会议 PDF 纯文本可靠映射
- zerui Han:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音乐源分离的输入是多乐器混音,输出是钢琴鼓等独立音轨,难点在于网络爬取的独奏查询常混入人声他种乐器与噪声导致标签错位。作者构建三段式流水线:先定义七类固定音轨分类体系,再为每类训练单源检测器筛选纯净片段,最后用多语言独奏关键词爬取视频并经检测器清洗拼接为可用音轨。筛选输出直接作为清洗后数据集进入分离模型训练,使弱标签过滤与混音合成解耦,而非依赖分离模型自身容忍噪声。与直接混用爬取数据相比,该机制差异在于把高阈值二分类显式建模为质量数量权衡点,而非扩大合成规模。在MoisesDB与MedleyDB验证集和测试集构成的评测基准下,联合ACMID清洗数据训练模型的平均信号失真比SDR为6.05 dB,高于仅基线数据训练模型的平均信号失真比SDR 4.89 dB。该结论适用边界受限于流行乐常见乐器与相近录音分布,对民乐与高度重叠合奏的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
540. 字错很少,临床结论却翻转:配对噪声如何击穿临床语音笔录
英文题目:Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes
标签:#医疗音频 #评测协议 #鲁棒性 #语音识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Xiao-Hang Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Hanjie Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Ying-Si Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Ai:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhi-Yang He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
环境临床记录需将医患对话音频转写为结构化病历并输出分诊决策,难点在于自动语音识别前端的微小误听会被大语言模型放大为高风险临床错误,而词错率对此完全失察。该方法先将同一段客观结构化临床考试对话与平稳环境噪声及非平稳语义干扰按信噪比混合,构造配对清洁与加噪音频以控制病例混杂。再用冻结的自动语音识别与大语言模型流水线生成转写与限定模式的结构化JSON,使语义漂移可归因于声学扰动。最后以医师审核的原子事实金标准,从分诊一致性与安全错误两路度量临床不变性与幻觉风险。与只看转写保真度的传统评估不同,该框架建立原因侧触发特征到结果侧安全终点的分类学,直接度量临床不变性而非词面重合。在272段OSCE对话的配对评测条件下,加噪条件的非安全错误率为27.21%,从清洁基线条件的非安全错误率13.60%升至加噪条件的非安全错误率27.21%。结论限于模拟OSCE英语对话与单条WHISPER-LARGE-V3到QWEN3流水线,未验证真实病房混响、远场拾音与多模型泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
541. 只改听不见的地方:SMIA 如何同时骗过说话人验证与反欺骗
标签:#时频分析 #对抗鲁棒性 #语音 #说话人验证 #语音伪造检测
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#时频分析
👥 作者与机构
- Kamel Kamel:机构信息未能从会议 PDF 纯文本可靠映射
- Hridoy Sankar Dutta:机构信息未能从会议 PDF 纯文本可靠映射
- Keshav Sood:机构信息未能从会议 PDF 纯文本可靠映射
- Sunil Aryal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音认证需同时判定说话人身份为真且语音为活体真人发音,而高保真克隆语音叠加隐蔽扰动可同时击穿说话人验证系统与反欺骗对策,构成复合安全威胁。该工作提出频谱掩蔽与插值攻击,先由语音克隆工具基于少量受害者音频合成基线仿冒语音,再经黑盒优化框架迭代向目标系统查询并更新扰动参数,随后由频谱扰动模块仅在低能量时频单元上执行掩蔽或插值并重构波形。相对仅扰动静音背景或依赖梯度的已有攻击,其差异在于以感知不显著区为约束保持声纹特征,并以树结构Parzen估计器在分数与标签反馈下自适应搜索阈值与扰动概率。在ASVspoof 2019与LibriSpeech构成的端到端流水线上,该方法对组合系统的攻击成功率最高达97%,显著高于已有基线。该结论依赖仿真信道与特定开源及商用系统组合,对强鲁棒检测器仍存在扰动强度与声纹保持的折中,且未验证真实电话网与大规模在线自适应防御下的持久性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
542. 丢掉内容还不够:用多粒度混淆同时保住说话人、压住可懂度
英文题目:Privacy-Preserving Speaker Verification with Multi-Granularity Feature Obfuscation
标签:#向量量化 #隐私保护 #语音 #说话人验证
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#向量量化
👥 作者与机构
- Hanseul Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Nam In Park:机构信息未能从会议 PDF 纯文本可靠映射
- Chanjun Chun:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证需在服务端判定身份,同时避免传输语音被自动语音识别还原语言内容或被重构伪造身份,难点在于显式丢弃内容表示后韵律仍携带节奏语调而可被人耳感知。所提框架先在客户端用因子化编解码器FAcodec将波形分解为内容特征\(F\_\{con\}\)、韵律特征\(F\_\{pro\}\)、音色特征\(F\_\{tim\}\)与声学细节特征\(F\_\{aco\}\)并直接丢弃\(F\_\{con\}\),其输出的非内容特征进入下一步混淆。随后对\(F\_\{pro\}\)依次施加全局时间聚合以坍缩时序结构、局部时间聚合以压缩块内动态、局部时间置换以打乱短时关联,并经可学习线性融合得到混淆韵律。最后将混淆韵律与\(F\_\{tim\}\)、\(F\_\{aco\}\)拼接后送入ECAPA-TDNN提取嵌入,并用混淆后特征重构波形以评估可恢复性;与SafeEar仅做全局乱序不同,该分级设计先抹除音节边界再召回语速轮廓并保留块内频谱以维持可判别性。在VoxCeleb1-O上等错误率(Equal Error Rate,EER)为2.35%,相对SafeEar全局乱序基线5.19%下降54.7%,词错误率(Word Error Rate,WER)为98.83%,字符错误率(Character Error Rate,CER)为89.60%。该结论限于VoxCeleb2训练、VoxCeleb1与LibriSpeech test-clean英文评测的认证导向场景,未验证跨语言、强噪声与自适应攻击下的外推能力,原文未披露训练推理成本与端侧开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
543. 时间听不清不是没听见:大音频语言模型的时间推理为何失灵
英文题目:A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models
标签:#注意力机制 #音频大模型 #可解释性 #音频问答
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#注意力机制
👥 作者与机构
- Apoorva Kulkarni:机构信息未能从会议 PDF 纯文本可靠映射
- Kaousheik Jayakumar:机构信息未能从会议 PDF 纯文本可靠映射
- Sreyan Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
- Sarah Wiegreffe:机构信息未能从会议 PDF 纯文本可靠映射
- Dinesh Manocha:机构信息未能从会议 PDF 纯文本可靠映射
- Ramani Duraiswami:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究大型音频语言模型 Large Audio-Language Models,简称 LALMs 的基础时间推理,输入为真实环境录音加四选一问题,输出为最早起始 Earliest Onset、简称 EO,最晚结束 Latest Offset、简称 LO,或最长持续 Longest Duration、简称 LD,要求在重叠与间断事件中定位边界。方法链分为三步:首先基于 TACOS 构建 1657 题受控基准并用静音替换验证音频必要性,其次对比音频、字幕与双模态输入并统计层级注意力分配以刻画行为相关性,最后施加免训练注意力干预检验因果性。与增大音频总注意力的上加权相比,缩放音频词元间分布更能纠正错误,且叠加任务关键词词元可进一步获益。在跨模型三任务平均准确率基准下,瓶颈层注意力缩放的准确率为59.1%,高于干预前基线的准确率55.9%,表明瓶颈在分布精度而非总量不足。全层统一缩放反而损害准确率,而单层定点干预保留正确样本并实现免训练提升,说明干预粒度决定成败。结论仅适用于三类基础边界任务与所测开源架构,复杂组合推理与编码器表征缺陷尚未排除。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
544. 在扫描仪里同时听脑、看肌肉和拍声道:三模态同步采集如何压住电磁伪迹
标签:#信号处理 #发声与构音 #生理信号 #脑信号 #静默语音接口
评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#静默语音接口 | 主方法:#信号处理
👥 作者与机构
- Jihwan Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Parsa Razmara:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Sean Foley:机构信息未能从会议 PDF 纯文本可靠映射
- Aditya Kommineni:机构信息未能从会议 PDF 纯文本可靠映射
- Haley Hsu:机构信息未能从会议 PDF 纯文本可靠映射
- Woojae Jeong:机构信息未能从会议 PDF 纯文本可靠映射
- Prakash Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Xuan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonjeong Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Tiantian Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Takfarinas Medani:机构信息未能从会议 PDF 纯文本可靠映射
- Ye Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Sudarsana Reddy Kadiri:机构信息未能从会议 PDF 纯文本可靠映射
- Krishna Nayak:机构信息未能从会议 PDF 纯文本可靠映射
- Dani Byrd:机构信息未能从会议 PDF 纯文本可靠映射
- Louis Goldstein:机构信息未能从会议 PDF 纯文本可靠映射
- Richard M. Leahy:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音产生的因果链从大脑运动规划经口面肌肉激活到声道运动,单一音频无法揭示其神经生理基础,而同步观测的最大难点是磁共振梯度切换感应伪影、心搏伪影与发音肌电污染相互叠加。所构建三模态同步采集系统先以0.55T螺旋稳态进动序列采集声道实时磁共振视频,并经光纤触发同步5kHz脑电与面部表面肌电,使三路信号在统一时钟下对齐。去伪影链分三步衔接:先用平均模板相减去除周期性梯度伪影,其输出再经心电锁时平均去除心搏伪影,最后以肌电与眼电为参考的典型相关分析投影去除肌电与眼动残留,净化后的脑电与全声道形态直接对齐。相对已有仅同步电磁发音仪与肌电或脑电与电磁发音仪的工作,该范式首次提供全声道动态形态与中枢及外周电生理的对齐真值,可客观监测想象言语中的微构音运动。在单被试18个VCV非词充分发音任务评测下,高伪影记录的伪影成分指标为5,高于低伪影记录的伪影成分指标2,且舌区图像信噪比指标为10.148。该结论目前仅限单被试充分发音任务的初步可行性,跨被试稳定性与静默及想象言语解码性能尚未验证,属明确适用边界受限。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
545. 状态记忆不够用时,音频编码器如何向 Mamba-2 低头:SAM 的紧凑表征与结构化问答
标签:#状态空间模型 #音频大模型 #音频字幕生成 #音频分类 #音频问答
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#音频问答 | 主方法:#状态空间模型
👥 作者与机构
- Taehan Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jaehan Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Hyukjun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理通用音频语言建模,输入为梅尔频谱图与文本指令,输出为开放式描述、分类标签与推理选项,难点在于状态空间模型只能经固定维循环状态在线累积前缀信息而无法像注意力那样回看历史词元。方法链分三步衔接:首先高效音频变换器编码器将频谱转为512个音频词元以保留时频细节,其次两层感知机连接器将其压缩为64个词元并映射到语言空间后直接拼接到文本序列前端输入主干,最后Mamba-2主干对拼接序列做自回归建模并通过联合微调使编码器输出适配其状态容量。与依赖全局交互的Transformer音频大模型不同,该机制迫使表征向低秩高相似方向压缩而非依赖长序列记忆,紧凑富信息词元比超长词元更有效。SAM-2.7B 在 AudioSet 上取得 21.1 平均精度均值(mean Average Precision, mAP),在 AudioCaps 上取得 17.6 语义命题相似度(Semantic Propositional Image Caption Evaluation, SPICE),在 MMAU-Sound 上从 22.83 提升至 56.77,匹配或超越更大参数量 7B 基线。在MMAU-Sound基准下,引入结构化监督后SAM的准确率为56.8,从引入前条件的准确率22.8升至56.8。结论仅在 OpenAQA 四阶段课程训练与短音频描述和推理评测内成立,未验证长音频、噪声域偏移与多轮对话外推。该结论的适用边界尚未验证长音频建模与多轮对话外推,失败条件受限于噪声域偏移场景。训练成本为 2 张 RTX 4090 上 0.5 至 2 天的 bfloat16 混合精度训练,原文未披露推理延迟与吞吐。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
546. 无人机自噪声下做实时增强:用双带压缩与频率注意力换取低功耗可部署
英文题目:DroFiT: A Lightweight Band-Fused Frequency Attention Toward Real-Time UAV Speech Enhancement
标签:#Transformer #高效推理 #单通道 #流式处理 #语音增强
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#Transformer
👥 作者与机构
- Jeongmin Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Chanhong Jeon:机构信息未能从会议 PDF 纯文本可靠映射
- Hyungjoo Seo:机构信息未能从会议 PDF 纯文本可靠映射
- Kyuhong Shim:机构信息未能从会议 PDF 纯文本可靠映射
- Taewook Kang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道无人机自我噪声下语音增强需在极低信噪比下从宽带周期性螺旋桨与电机谐波中恢复目标语音的幅度与相位,谐波基频随转速缓慢漂移,通用降噪难以兼顾质量与端侧资源。该工作先用全频带与子频带双路径编码器以不同压缩比分工提取全局谱上下文与低频细节,前置时间卷积网络承接双路径特征以稳定慢变谐波与平稳结构。随后频率维Transformer对拼接后的全/子带令牌做跨路径联合注意力融合,使全局上下文与细粒度低频细节在共享注意力空间互补,相对单带与循环基线减少跨带干扰。融合特征经解码重建频谱并由后置时间卷积网络在时域精炼动态,再经掩码生成块估计复数掩码与含噪短时傅里叶变换复乘并逆变换重构波形。在VoiceBank-DEMAND混合DJI Flip悬停噪声的模拟测试集下,DroFiT(w/o Post-TCN)的SI-SDR为9.54,高于DCCRN-E的SI-SDR9.51。该结论适用边界受限于单机型悬停噪声、固定pyroomacoustics仿真与约1300条远场扬声器回放真实录音,尚未验证多机型、运动、风噪与大混响外推。模型以168k参数实现帧级流式推理,计算量较DCU-net与SMoLnet-T降低9–26倍,但原文未披露训练成本所需的硬件与时长细节。
🔗 开源资源
- 演示资源:https://ml-sp.github.io/DroFiT/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
547. 先保真再压缩:两阶段潜在分片如何把低帧率语音编码拆成可复现的步骤
英文题目:Low-Framerate Speech Tokenization via Two-Stage Latent Patch Modeling
标签:#流匹配 #变分自编码器 #语音编码 #文本到语音
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#变分自编码器
👥 作者与机构
- Théodor Lemerle:机构信息未能从会议 PDF 纯文本可靠映射
- Diego Torres:机构信息未能从会议 PDF 纯文本可靠映射
- Téo Guichoux:机构信息未能从会议 PDF 纯文本可靠映射
- Nicolas Obin:机构信息未能从会议 PDF 纯文本可靠映射
- Axel Roebel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为原始波形,输出为低帧率连续或离散语音表征,难点在于低码率下同时保住感知质量、语义可懂度与下游可建模性,而联合压缩、对抗训练与语义监督通常互相牵制且训练昂贵。第一步用高帧率变分自编码器建模波形并吸收对抗训练复杂度,得到保留细粒度声学细节的高帧率潜变量序列。第二步将第一阶段潜变量按连续多帧切块分组,再由第二阶段编码器压缩为低帧率表征,使激进压缩发生在潜空间而非波形层面。第三步以流匹配速度场解码由低帧率表征恢复高帧率潜块,并在速度头层面引入语义蒸馏以保留语言内容。与直接在波形上做残差向量量化的方法不同,该机制将大码本与多级量化问题转化为潜块建模,从而避开码本坍缩与复杂分层采样,实际意义在于简化下游建模与解码。原文未提供可核对的关键定量结果。结论的适用边界受限于英语朗读语音的重建与连续分支文本到语音验证,外推至流式因果、多语种与噪声场景尚未验证,训练与推理在单卡消费级硬件上完成,推理开销保持低延迟高效编解码。
🔗 开源资源
- 第三方资源:https://github.com/boson-ai/higgs-audio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
548. 把调制解耦出去:U2A-Net 为何用超声输入重做参量阵建模
英文题目:U2A-Net: Physically Motivated Ultrasound‑to‑Audio Neural Modeling for Parametric Array Loudspeakers
标签:#CNN #空间音频 #语音 #音频生成
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 1.0/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频生成 | 主方法:#CNN
👥 作者与机构
- Mengtong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Jia-Xin Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
参量阵列扬声器需从基带音频经超声调制、换能器辐射与空气非线性传播后预测可听声,难点在于调制、频率响应与自解调级联纠缠,且谐波与互调产物幅度小却决定听感。所提超声到音频网络以192 kHz采样的已调制超声驱动信号为输入,经扩张因果卷积堆提取长时超声特征,再由两级步长卷积实现4倍可学习下采样,最终在48 kHz输出可听声估计。网络以时域波形均方误差与幅度谱均方误差联合训练,使高分辨率超声特征逐步整合映射至低速率可听带,容量集中于二次非线性主导的自解调。与音频到音频黑盒映射及超声到全频带建模不同,该重构不再同时学习调制过程,也避免重建高能量超声载波,因而更契合Westervelt方程描述的超声到可听声物理变换。在1.8 m消声室上边带调幅系统评测设置下,U2A-Net的THD指标为0.52%,低于A2A-Net的THD指标1.86%。同条件下其IMD为1.26%。该结论适用边界受限于单阵列、单距离与500 Hz至7550 Hz步进正弦评估,尚未验证其他阵列尺寸、聆听距离与连续语音音乐激励下的失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
549. 既要修准音节奏,又要留住原唱味道:整流流如何做风格一致的美化
英文题目:SRF-SVB: Style-Consistent Singing Voice Beautifying via Rectified Flow
标签:#流匹配 #主观评测 #音乐 #歌唱生成
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#歌唱生成 | 主方法:#流匹配
👥 作者与机构
- Wenhui Li:机构信息未能从会议 PDF 纯文本可靠映射
- Biao Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Liwei Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Jiqing Han:机构信息未能从会议 PDF 纯文本可靠映射
- Yongjun He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
歌唱美化(Singing Voice Beautifying, SVB)要求把业余演唱的音准节奏校正到专业水准并提升音质,同时保留歌词与演唱者音色和表现风格,难点是音高节奏可独立操控与个性化风格保持难以兼顾。该方法先用RMVPE提取基频轨迹作为音高特征,用预训练Conformer提取音素后验概率(Phonetic Posteriorgram, PPG)作为内容特征,用CAM++提取说话人嵌入并沿时间广播作为音色特征,辅以有效帧掩蔽,四者拼接归一化映射为声学条件;再对梅尔频谱做连续掩蔽并拼接二值掩蔽指示构成掩蔽感知条件;最后由12层扩散Transformer(Diffusion Transformer, DiT)参数化整流流(Rectified Flow)速度场,仅在掩蔽帧上学习噪声到数据的直线轨迹。推理时把业余频谱作为前段上下文,后段置零待生成,后段声学条件使用专业音高、经动态时间规整(Dynamic Time Warping, DTW)对齐到专业时间轴的内容特征与业余音色,从高斯噪声出发用欧拉法求解常微分方程后截取后段经NSF-HiFiGAN合成。在英语PopBuTFy配对测试集评测下,SRF-SVB的原始音高准确率为0.57,高于业余基线的原始音高准确率0.40。该结论限于中英短片段离线美化且推理依赖同内容专业参考提供目标音高,无参考、长曲连贯与实时直播场景尚未验证,生成重建带来轻微发音清晰度损伤。训练硬件为单块NVIDIA GeForce RTX 4090训练成本为500k步,推理开销为欧拉法10步求解常微分方程。
🔗 开源资源
- 演示资源:https://mrwho729.github.io/SRF-SVB/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
550. 用音位束做视觉线索:在因果约束下重做在线视听目标说话人提取
英文题目:Online Audio-Visual Target Speaker Extraction with Viseme-Guided Lightweight Visual Pretraining
标签:#知识蒸馏 #高效推理 #严格因果 #音视频 #目标说话人提取
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#知识蒸馏
👥 作者与机构
- Zixuan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xueliang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Miao:机构信息未能从会议 PDF 纯文本可靠映射
- Zhipeng Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Ying Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Chong Zhu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频目标说话人提取需从双人混合波形与目标人唇动视频中恢复目标语音,重叠严重与同性别干扰时仅靠音频难以定向。在线因果与低算力进一步约束了视觉前端设计。本文先由字形到音位(G2P)与音位到视素映射生成视素标签,再训练非因果音视频教师做视素识别,接着蒸馏出仅视频输入的因果学生作为冻结视觉编码器,最后将视素嵌入经时序卷积网络(TCN)上采样后与短时傅里叶变换(STFT)音频特征拼接送入改进TF-SkiMNet分离器。与联合学习口动线索和视觉语音识别(VSR)预训练表征相比,视素监督词表更小且保留发音动态,兼顾轻量与可解释。在LRS2-Mix域内评测下,所提Viseme加TF-SkiMNet系统的SI-SNR为10.07,高于VSR基线TF-SkiMNet系统的SI-SNR 8.88。该结论依赖LRS2预训练前端与2 s短混合评测,在Vox2-Mix与跨域条件下优势收窄,尚未验证长时与真实噪声外推。训练成本原文未披露,推理成本以MACs计量且视觉前端占主要部分。
🔗 开源资源
- 第三方资源:https://github.com/Kyubyong/g2p — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
551. 增强越干净识别越差?用识别置信度决定掺多少原声
英文题目:Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
标签:#信号处理 #鲁棒性 #语音识别 #语音可懂度评估 #语音增强
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#信号处理
👥 作者与机构
- Haoyang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Changsong Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Rao:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Sakriani Sakti:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
噪声环境下自动语音识别(Automatic Speech Recognition,ASR)输入为带噪语音,输出为文本转写,难点在于语音增强(Speech Enhancement,SE)抑制噪声的同时会引入损伤识别的伪影。所提方法先用冻结SE得到增强语音,再用同一冻结后端ASR分别计算带噪语音与增强语音的话语级置信度并归一化为自适应融合系数,最后按系数在波形域线性插值得到融合语音并送回该ASR解码,全程不更新SE或ASR参数。相比仅看带噪端质量的信噪比与语音质量分数加权,以及需转写标注训练神经预测器的方法,该机制同时考虑双路信号且以可懂度代理为导向,因而无需额外训练。跨域测试中Parakeet在CHiME-4真实集上从增强基线14.72%词错率降至5.55%,显著优于同类实用基线并接近需真实转写的理想上限4.85%。结论仅在英语读句与远场噪声语料上验证,未覆盖混响、重叠与多语等外推场景。原文未披露训练硬件、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
552. 谁的声音算正常:五十年神经多样性语音研究为何越做越偏临床
标签:#系统综述 #言语障碍 #语音 #病理语音评估
评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:综述 | 主任务:#病理语音评估 | 主方法:#系统综述
👥 作者与机构
- Rebecca Lietz:机构信息未能从会议 PDF 纯文本可靠映射
- Jingjin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Peiyao Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Chien:机构信息未能从会议 PDF 纯文本可靠映射
- Norman Makoto Su:机构信息未能从会议 PDF 纯文本可靠映射
- Shaomei Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为1976–2025年Interspeech及其前身与ICASSP中涉及发育性神经多样性言语的论文,输出为对其研究动机与数据实践与评测与语言的批判性评估,难点在于五十年术语漂移与技术叙事背后的价值预设难以量化。方法链分三步:先用词干在ISCA档案与IEEE Xplore初筛口吃与非典型言语候选,其输出进入人工筛选,仅保留实质关于口吃与自闭症与ADHD与双相障碍与唐氏综合征且关于言语的终选集。接着按论文类型与贡献与用例与目标用户与数据源与标注者身份与人类评测与主客观指标与能力主义语言实例结构化编码,其编码表进入内容分析与话语分析,提炼医学化与疏离与他者化主题。与罗列模型与数据集的综述不同,该文把临床视角本身作为审视对象,追问谁受益与谁缺席,因而具有社会技术批判意义。在按时间划分的语料统计设置下,2021–2025年以口吃为主题的论文占比指标为62%,高于2016–2020年占比指标的14%。终选117篇中78%以诊断与检测为动机,56%以服务残障人士的专业人员为目标用户,仅16%直接以残障人士为目标用户。该结论适用边界限于英语语音会议论文话语代表的学术史,尚未验证可外推至工业系统或临床实践的真实伤害程度。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
553. 固定阵列模型为何换个麦克风就失灵:用坐标生成卷积核的阵列不变增强
英文题目:Towards Array-Invariant Speech Enhancement via Geometry-Aware Dynamic Convolution
标签:#CNN #鲁棒性 #麦克风阵列 #语音增强
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#CNN
👥 作者与机构
- Zhenglong Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Wangyou Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Chenda Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yanmin Qian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多通道语音增强输入为任意数目与排列的麦克风时频信号,输出为增强后的目标语音,其难点在于固定阵列模型隐式依赖特定几何,几何一变空间建模即失效而需设备级重训。相对麦克风坐标先经傅里叶位置编码展开为高维向量,再送入拓扑感知坐标变换器做全局拓扑建模并输出变换矩阵。该矩阵接着线性组合共享基核生成阵列相关的动态卷积核,其输出经层归一化与PReLU后变为固定16通道特征图,交由SpatialNet或TF-GridNet等固定主干完成后续增强。与通道独立批处理加平均或注意力合并的首层缺跨通道建模不同,该单阶段坐标到权重适配在首层即注入显式几何并保持排列等变,使输入置换与权重同步置换后卷积点积不变。在RealMAN几何无关设置下,SpatialNet-Geo-DConv的SDR为9.72,高于USES2-comp的SDR 8.62。跨拓扑与跨数据集泛化显示训练至多4通道仍可在5通道与CHiME-4六通道上保持优势,但该结论适用边界受限于8kHz实录与上述通道范围,大阵列与高采样率等外推尚未验证。部署上SpatialNet-Geo-DConv的参数量为1.3M且计算量为6.08G/s,而TF-GridNet-Geo-DConv的计算量为73.12G/s,推理开销随主干显著增加。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
554. 缺一个模态就别硬融合:用跨模态一致性决定查人时要不要多模态
标签:#模型集成 #音视频 #语音 #音频检索
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#模型集成
👥 作者与机构
- Erfan Loweimi:机构信息未能从会议 PDF 纯文本可靠映射
- Mengjie Qian:机构信息未能从会议 PDF 纯文本可靠映射
- Kate Knill:机构信息未能从会议 PDF 纯文本可靠映射
- Guanfeng Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Ho Chan:机构信息未能从会议 PDF 纯文本可靠映射
- Abbas Haider:机构信息未能从会议 PDF 纯文本可靠映射
- Muhammad Awan:机构信息未能从会议 PDF 纯文本可靠映射
- Josef Kittler:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Gales:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
按示例在BBC Rewind广播档案中检索人物时输入为查询人的语音和人脸示例、输出为档案文件排序,难点在于目标可能同时视听出现、仅闻其声或仅见其人而缺席模态嵌入会编码无关身份并污染固定权重融合排序。方法先对说话人嵌入与人脸嵌入分别计算余弦相似度并在文件内取最大值得到单模态分数。接着抽取模内前10名分数与跨模态分数及其均值方差构成48维特征,并送入浅层分类器判别同时视听存在、仅音频存在、仅视觉存在三类存在类型。最后按判别类型将融合权重设为0.5、1、0以切换单双模态排序,其以前一模态检索集在另一模态下的得分一致性作为缺席诊断,这与假设双模态恒有效的固定融合不同。在BBC Rewind语料评测下,加跨模态特征方法的准确率为88.2,高于仅模内特征基线的准确率82.3。结论限于以简介命名实体为相关性代理的显要政治人物检索,且AoP仅26例,跨档案与开放身份泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
555. 扩散先验已能去噪,为何还要显式对齐唇动与声音
英文题目:Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement
标签:#对比学习 #扩散模型 #鲁棒性 #音视频 #语音增强
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#扩散模型
👥 作者与机构
- Colombe Mboungou:机构信息未能从会议 PDF 纯文本可靠映射
- Mostafa Sadeghi:机构信息未能从会议 PDF 纯文本可靠映射
- Jean-Eudes Ayilo:机构信息未能从会议 PDF 纯文本可靠映射
- Romain Serizel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频语音增强需从含噪短时傅里叶变换混合信号中恢复目标语音,低信噪比与非平稳噪声下纯音频先验易失效,而唇动等视觉线索虽具噪声鲁棒性,却在现有交叉注意力融合中缺乏显式对齐约束而被弱化。方法先以前向随机微分方程扰动干净语音并以加权去噪分数匹配损失训练条件分数网络逼近条件分数,再用特威迪公式从扩散状态估计干净语音。接着以可训练音频编码器与冻结视觉编码器抽取归一化嵌入并计算双向InfoNCE损失,最后以时变权重将对齐项与生成损失联合优化而推理保持原后验采样不变。与仅做局部条件重构的AV-DiffUSEEN基线相比,该机制显式约束全局音视频实例判别,促使去噪估计与视觉内容兼容。在TCD语音加DEMAND噪声匹配条件评测下,本模型的SI-SIR指标为29.5,高于AV-DiffUSEEN基线的SI-SIR指标24.30。该结论受限于批量为8的小批量对比、无真实多说话人与强混响验证,且遮挡视觉时性能塌缩更大表明其对视觉依赖更强。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
556. 条件加在哪一层:复合退化下输入层注入为何反而不如不用
英文题目:SLICE: Speech Enhancement via Layer-wise Injection of Conditioning Embeddings
标签:#扩散模型 #多任务学习 #去削波 #去混响 #语音增强
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.4/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#扩散模型
👥 作者与机构
- Seokhoon Moon:机构信息未能从会议 PDF 纯文本可靠映射
- Kyudan Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Jaegul Choo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理同时含加性噪声、混响与非线性失真的退化语音,输入为退化波形与复数谱,输出为干净语音,难点在于多退化耦合时单点条件在深层网络中被稀释,且直接扰动输入谱会干扰频谱处理。先由冻结的WavLM-Base编码器以退化波形为输入抽取帧级特征,经卷积投影与时间平均池化输出共享表示。再将该共享表示送入三个分支头,分别以噪声分类、T60回归与软削波强度回归为职责进行多任务解耦,输出三组分支嵌入。最后将拼接映射后的分支嵌入与时间步嵌入逐元素相加得到条件向量,该条件向量随原有广播路径进入全部残差块实现全深度调制并输出干净语音。与仅在输入谱上相加的NASE式注入相比,该方法不改动输入谱而复用每层已有的时间步调制通道,避免浅层扰动与深层稀释。在多退化测试集条件下,SLICE的ESTOI为0.80,高于输入层注入基线的ESTOI 0.73,且SLICE的SI-SDR为3.7 dB,高于输入层注入基线的SI-SDR 1.4 dB。该结论适用边界受限于受控合成退化,在VOiCES等真实录音上层级注入与无编码器差异微弱,且含混响类别SI-SDR仍为很大的负值属于失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
557. 先分清错因再造错:用语音相似的音节替换来训练更抗识别错误的越英翻译
英文题目:PiDA: Phonetically-Informed Data Augmentation for Robust Vietnamese Speech Translation
标签:#数据增强 #鲁棒性 #语音学与音系 #语音翻译
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#数据增强
👥 作者与机构
- Giang Son Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Tung X. Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Hieu Minh Truong:机构信息未能从会议 PDF 纯文本可靠映射
- Nhu Vo:机构信息未能从会议 PDF 纯文本可靠映射
- Wray Buntine:机构信息未能从会议 PDF 纯文本可靠映射
- Dung D. Le:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
级联式语音翻译以语音为输入,经ASR转写再经神经机器翻译(Neural Machine Translation,NMT)输出译文,核心失配是NMT在干净文本上训练却在含错ASR输出上推理。作者先将PhoWhisper-large与wav2vec2-base越南语ASR输出同参考文本按最小编辑距离对齐抽取替换、插入、删除,再把替换按元音混淆、辅音混淆、声调混淆、外来词(Out-of-vocabulary,OOV)、语音无关、正字法变体六类划分,并用线性混合效应模型(Linear Mixed-Effects Model,LMM)估计各类错误对翻译退化的边际效应。随后提出语音学指导的数据增强(Phonetically-Informed Data Augmentation,PiDA):为约9.4k越南语音节经CharsiuG2P转国际音标(International Phonetic Alphabet,IPA)后取XPhoneBERT均值池化向量建FAISS近邻索引,按训练集词错误率(Word Error Rate,WER)抽样删改位置,替换时在前5近邻内按温度缩放Softmax采样,再与干净平行语料按1比1混合微调VinAI-Translate。与随机频率替换和大语言模型(Large Language Model,LLM)生成噪声的关键差异是替换候选来自显式音素嵌入相似度而非词频抽样或LLM隐式语感。在FLEURS越英测试集上,干净加PiDA在PhoWhisper链路取得28.29 BLEU,较干净微调基线26.25提升2.04且经paired bootstrap显著,同时干净文本BLEU从33.04升至33.72;真实噪声单独微调虽在wav2vec2链路达23.65略高于PiDA混合的23.18,但干净文本降至32.00并显著劣化。该结论仅在单一数据集与两套越语ASR前端上验证,外来词跨语言映射与插入错误尚未处理,原文未披露训练推理成本与解码配置。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
558. 空间信息在系统与数据两层如何缓解漏检与混淆的跷跷板
英文题目:MCA-DCF-DS: An Adaptive Framework for Unified Diarization and Separation with Spatial Information
标签:#波束成形 #测试时自适应 #麦克风阵列 #说话人分离标注 #语音分离
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音分离 | 主方法:#测试时自适应
👥 作者与机构
- Shutong Niu:机构信息未能从会议 PDF 纯文本可靠映射
- Ruo-Yu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Gao-Bin Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Ya Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Tian Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Jia Pan:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Du:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多通道会议转写需同时完成说话人分离标注与语音分离,输入为多麦克风混合录音,输出为分说话人活动边界与增强语音流,难点是高重叠区仅靠频谱线索易失效且漏检与混淆难以兼顾。方法链第一步由谱聚类与记忆感知多说话人嵌入序列到序列架构产生窗级分离标注先验,为后续分离提供时间掩码约束。第二步将该先验与短时傅里叶变换幅度谱及通道间相位差拼接送入Conformer掩蔽估计网络,并经最小方差无失真响应波束成形得到增强语音,同时融合多通道活动概率。第三步用基于空间信息的分离型分离标注长时空间聚类生成低混淆先验,并保留通道间结构仿真多通道自适应数据,以知识蒸馏微调分离标注模型。与仅用频谱的级联基线相比,关键差异是在系统级引入空间特征与波束成形、在数据级保留通道间空间结构做会话自适应,从而分别提升分离质量与降低混淆。在 NOTSOFAR-1 多通道评测集上,以 Whisper-large-v3 为后端的时间受限最小排列词错率(time-constrained minimum-permutation word error rate,tcpWER)从 20.17% 降至 17.86%,优于同后端冠军系统的 18.74%。该结论仅在每会话 4 至 8 人、四设备多麦克风录音及特定后端下验证,处理 12.8 s 窗约需 \(66\.4 \\times 10^\{9\}\) FLOPs,模型约 59.91M 参数,延迟与部署成本未充分分析。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
559. 不可靠证据太多时,如何让音频问答的每一步都可核查
英文题目:Multi-Source Evidence Fusion for Audio Question Answering
标签:#模型集成 #音频大模型 #音乐 #语音 #音频问答
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#音频问答 | 主方法:#模型集成
👥 作者与机构
- Aivo Olev:机构信息未能从会议 PDF 纯文本可靠映射
- Tanel Alumäe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为音频文件、问题与多选项,输出为所选答案与可验证推理链,难点在于语音、音乐与环境声混合下的幻觉、时序细粒度感知与多步推理需同时可核查。系统先由两个大型音频语言模型(Large Audio Language Model,LALM)独立在全音频与三等分片段上报告观察并做语义互证,再由推理智能体分多轮调用分级声学工具补充可复现测量,随后经三阶段矛盾检测生成定向验证假设并做片段级复检。最后将答案选择与七段式推理生成分离,先基于可靠性加权证据选出选项再围绕证据组织论述。与把工具视为等可靠预言机的智能体框架不同,该设计显式区分解析型、概率型、启发型与模型观测的可靠性并做置信度封顶与域外折扣。在MMAR基准共1000样本上系统推理质量得分69.83排名首位且准确率为76.9%,双源相对单源在重放消融中提升显著。该结论适用边界受限于多项选择与推理质量两道门控评测,在音乐理论、时序对比与文化推理上存在明显失败条件,尚未验证向开放问答的外推。原文披露推理开销的端到端延迟平均每样本8至10分钟,不适合实时部署。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
560. 先学局部断裂,再判整句真假:混帧后训练重塑语音伪造检测
标签:#SFT #鲁棒性 #后训练 #语音 #音频深度伪造检测
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#SFT
👥 作者与机构
- Zihan Pan:机构信息未能从会议 PDF 纯文本可靠映射
- Sailor Hardik:机构信息未能从会议 PDF 纯文本可靠映射
- Jinyang Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造检测输入为原始波形,输出为真实或伪造的二分类标签,难点在于伪造线索高度局部且易被内容信息淹没。所提混合帧后训练(Mix-Frames Post-Training,MFPT)先将反类别片段剪贴到基话语并按编码器帧率生成帧标签,再用轻量帧分类器对语音基础模型做低秩适配(Low-Rank Adaptation,LoRA)后训练,最后丢弃帧头并接注意力合并(Attentive Merging,AttM)与话语级分类器做微调。相比直接微调自监督学习(self-supervised learning,SSL)表征,该机制把话语级弱监督拆为位置多样的局部真伪判别,从而偏置表征朝向边界不连续性。后训练采用10%至30%混合比与秩32的低秩适配同时更新注意力与前馈层,帧监督经二元交叉熵优化后进入注意力合并的话语级交叉熵微调。在ASV19LA低资源评测设置下,所提方法的等错误率(Equal Error Rate,EER)为4.34%,低于无后训练基线的等错误率9.32%。在ASVspoof 5评测集上单模型无增强达到等错误率(Equal Error Rate,EER)4.50%,在ASVspoof 2021 LA与DF上跨条件绝对差距仅0.16%。该结论限于ASVspoof系列协议,未验证对最新扩散式合成与真实社交媒体压缩链的泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
561. 文本想哭、指令要笑时:用文本情感做基线来放大引导的情感语音合成
英文题目:Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models
标签:#知识蒸馏 #偏好优化 #语音 #文本到语音
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#偏好优化
👥 作者与机构
- Yizhou Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Yukun Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Chong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yi-Wen Chao:机构信息未能从会议 PDF 纯文本可靠映射
- Chongjia Ni:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
情感文本到语音合成需要在目标文本语义与用户指定的渲染情感冲突时仍保持可懂、自然且情感准确,现有自回归模型易被文本语义牵引而丢失目标情感。作者先用外部大语言模型抽取文本情感并判定不一致等级,再运行渲染情感与文本情感双分支解码并按等级动态融合对数几率,最后将该引导信号经难样本构造的偏好优化蒸馏回模型以实现单遍推理。与传统丢弃条件的无分类器引导相比,该方法以显式情感对比替代空白基线,提供了更具方向性的跨模态修正信号。在包含7类情感的组合语料测试上,难样本增强的蒸馏模型相对中性参考的CosyVoice2基线将情感准确率从50.63%提升至59.55%,同时词错误率从4.61%降至3.76%,动态引导版本情感准确率达64.83%但词错误率为7.86%。结论主要适用于英文7类离散情感与中性参考零样本设定,对开放式细粒度描述、跨语言及强冲突长文本的外推尚未验证。原文未披露训练时长与推理延迟成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
562. 语义密度决定上限:连续特征与离散口令在统一音频理解中的对照
英文题目:Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs
标签:#基准设计 #模型比较 #高效推理 #音频理解
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频理解 | 主方法:#基准设计
👥 作者与机构
- Jing Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Zichao Nie:机构信息未能从会议 PDF 纯文本可靠映射
- Zhisheng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jingran Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究大型音频语言模型中音频表示应采用连续特征还是离散词元,输入为语音、环境声和音乐音频,输出为识别、分类与字幕等理解型文本,难点在于不同量化方式带来的语义损失与跨域泛化难以公平比较。为此作者构建统一音频表示比较框架,先将各类编码器输出统一映射为与语言模型兼容的嵌入序列,再拼接任务提示进行序列到序列生成,随后分别在轻量微调与冻结主干两种部署模式下评测语义质量与扩展规律。与已有窄域或脱离语言模型的编码器评测不同,该框架强调语义约束与多域预训练的决定作用。在LibriSpeech评测任务下,HuBERT的WER为2.31%,低于DAC的WER 171.02%,方向性差距支撑了语义密度优先于信号保真度的结论。该结论在数据受限任务中更易出现逆扩展,且简单投影器可能限制大模型扩展收益。原文未披露训练、推理或部署成本量化数字。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
563. 从零到 147 小时:普什图语开放语音库如何先补句子再借广播破圈
标签:#数据集 #数据集构建 #低资源 #语音识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据集构建
👥 作者与机构
- Hanif Rahman:机构信息未能从会议 PDF 纯文本可靠映射
- Shafeeq ur Rehman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
普什图语自动语音识别(Automatic Speech Recognition,ASR)长期缺乏开放可用的朗读语音数据,输入为众包朗读录音,输出为文字转写,难点在于8个在阿拉伯语和波斯语键盘缺失的辅音在非正式文本中被替换或脱落,且方言与性别覆盖失衡。本文构建基于Mozilla通用语音(Mozilla Common Voice,MCV)的开放语料流水线:界面本地化先解决可参与性,维基百科抽取加长度与字符过滤形成可朗读句池,面向4个最易脱落的摩擦音与塞擦音定向补句以纠正分布偏差,社区审核与广播动员分别负责文本与音频质控和规模扩张。相对直接复用阿拉伯语或波斯语模型,该链条以正字法感知的数据策展替代跨语言迁移,将无用先验转为可训练信号。在MCV20测试集评测设置下,微调后Whisper Base的WER为13.4%,低于零样本Whisper Base的WER 99.0%。该结论仅适用于朗读式MCV读语音,不可外推至对话或自然场景,且方言与性别元数据缺失限制公平性评估。训练在消费级Apple MacBook Pro上完成,原文未披露时长与推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
564. 不用通用六情绪:毛利语情感语料为何先重定 16 类再录音
英文题目:Pā‑Kakare: The First Emotional Speech Database for Te Reo Māori
标签:#数据集 #数据集构建 #低资源 #语音 #语音情感识别
评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音情感识别 | 主方法:#数据集构建
👥 作者与机构
- Himashi Rathnayake:机构信息未能从会议 PDF 纯文本可靠映射
- Jesin James:机构信息未能从会议 PDF 纯文本可靠映射
- Sally Akevai Nicholas:机构信息未能从会议 PDF 纯文本可靠映射
- Gianna Leoni:机构信息未能从会议 PDF 纯文本可靠映射
- C. I. Watson:机构信息未能从会议 PDF 纯文本可靠映射
- Peter J Keegan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别的输入为毛利语Te Reo Māori语音,输出为文化相关的情感类别,难点在于通用六类假设与毛利语情感组织错位且缺乏标注语音。方法链分三步:先沿用前期社区问卷与焦点小组得到的16类标签空间,再按每类组织中性语境句与情感显著句并控制句长与元音覆盖,最后由4名职业演员在录音棚分两日复录并经在线感知验证与声学检验。与沿用通用情感集合的语料相比,差异在于类别定义、脚本设计与录制监护流程均嵌入毛利语文化实践。在八分类感知验证任务下,288句整体识别准确率为36.15%,高于随机猜测的准确率12.5%。混淆集中于相近唤醒度类别,声学上方差分析显示基频、强度与语速均随情感类别显著变化。结论仅适用于棚录表演语料与熟悉毛利语的听者,不能外推至自然对话与跨地域年龄群体。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
565. 在线又剪枝又微调:OnDA 把个性化关键词识别的架构也拿到端上改
英文题目:OnDA: On-device Channel Pruning for Efficient Personalized Keyword Spotting
标签:#模型剪枝 #高效推理 #端侧运行 #关键词检测
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#模型剪枝
👥 作者与机构
- Matteo Risso:机构信息未能从会议 PDF 纯文本可靠映射
- Alessio Burrello:机构信息未能从会议 PDF 纯文本可靠映射
- Daniele Jahier Pagliari:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
个性化关键词检测需把端侧连续音频映射为指定关键词存在性判决,难点是目标关键词在预训练阶段未见、说话人与声学环境偏移叠加,且部署后只能依赖少量用户正例和伪标签在线适配。离线预训练原型网络学习音频嵌入空间,用户校准计算关键词原型并用双阈值距离生成域内伪标签集合。在线阶段先用域内伪标签数据的Hessian感知准则做结构化通道剪枝,剪枝输出的紧凑架构直接作为后续微调与推理的模型骨架。伪标签三元组微调补偿剪枝精度损失并适配权重,适配后模型部署端侧执行常开推理。与纯离线剪枝的关键差异是在微调前用部署域伪标签估计通道重要性,使架构选择与权重适配同分布,从而缩短后续微调并降低推理负担。在HeySnips评测设置下,OnDA在等准确率性能下相对ResNet15基线的压缩率为3.33×,低于相对DS-CNN-L基线的压缩率9.63×。在Jetson Orin Nano硬件部署中OnDA-1以更小架构显著降低微调与推理延迟与能耗,其适用边界受限于所测两套语料与出发架构,强噪声、重叠语音与长期漂移场景尚未验证。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
566. 不用标签也能学空间:用声学软相似把双耳表示排成物理几何
英文题目:Learning Self-Supervised Spatial Representations via Soft Acoustic Contrastive Alignment
标签:#对比学习 #自监督学习 #多通道 #空间音频信号 #声源定位
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 1.0/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声源定位 | 主方法:#对比学习
👥 作者与机构
- Yotam Silverman:机构信息未能从会议 PDF 纯文本可靠映射
- Bracha Laufer-Goldshtein:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为双耳混响语音的双通道短时傅里叶变换(Short-Time Fourier Transform,STFT),输出为到达时间差(Time Difference of Arrival,TDOA)、混响时间(T60)、直达混响比(Direct-to-Reverberant Ratio,DRR)、清晰度指数(C50)和平均吸声系数(ABS)等空间声学参数,难点在于无标注时单通道语义型自监督目标会压制精细通道间线索。该方法先用双流多通道Conformer(Multi-Channel Conformer,MC-Conformer)分别编码空间与频谱分支并经共享解码器做掩码重建,为解耦表征提供可重建的联合潜空间。接着从输入波形解析估计TDOA、互相关峰值与低中高三段相干幅度组成5维声学向量,经全局统计归一化后以高斯核将声学欧氏距离转为软相似权重。然后用该软权重监督空间投影头的温度锐化余弦相似,使潜相似逼近物理相似,从而把方向性与扩散度几何直接写入潜空间并与重建损失联合优化。与跨通道信号重建(Cross-Channel Signal Reconstruction,CCSR)基线相比,该设计解耦度量学习与信号恢复且不依赖增强构造正样本、无需干净语音与房间标签。在未见房间线性评测协议下,CCSR+LSAC的TDOA平均绝对误差指标为1.06样本,低于CCSR基线的TDOA平均绝对误差指标1.88样本。结论限于模拟房间与中高信噪比,真实混响、低信噪比与移动声源尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
567. 遮住最明显的病变帧:PAN-Mask 用可学习的病理掩码逼模型学分布特征
标签:#语音生物标志物 #注意力机制 #正则化 #多语言 #病理语音评估
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#正则化
👥 作者与机构
- Qi Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Junhao Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Boao Jing:机构信息未能从会议 PDF 纯文本可靠映射
- Ziqi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Guodong Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Wei-Qiang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
论文以语音波形为输入预测阿尔茨海默病(Alzheimer’s Disease, AD)、帕金森病(Parkinson’s Disease, PD)与抑郁(Depression)类别,难点在于临床线索稀疏局部且跨疾病语言分布各异。病理特征检测器(Pathology Detector)从波形分帧提取六种可解释声学描述子并做 utterance内归一化,输出帧级特征向量,该向量直接进入注意力聚合步骤。注意力聚合(Attention Aggregation)以轻量双层网络为每帧生成权重并加权求和得到病理显著性分数(Pathology Score),该分数作为可微掩码的掩码位置排序依据。可微软掩码(Differentiable Soft Mask)依据分数优先衰减高显著性波形片段,保留随机成分以维持正则随机性,输出被掩码波形以送入编码分类。被掩码波形经归一化后送入 WavLM 编码器与线性分类头,以交叉熵(Cross-Entropy)联合优化检测器与分类器。与随机掩码(Random Masking)相比,病理感知掩码(Pathology-Aware Masking, PAN-Mask)在 6 个数据集上平均准确率提升 13.82 个百分点,在 ADReSS 上达到 86.36%。该结论限于截断朗读与图片描述任务及所测五种语言,未验证自发对话长时监测与重度噪声下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
568. 低资源多语语音翻译中统一共享为何冲突:用梯度行为自动定分组与共享比
英文题目:Automated Gradient-Driven Parameter Sharing for Low-Resource Multilingual Speech-to-Text Translation
标签:#多任务学习 #低资源 #多语言 #语音翻译
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#多任务学习
👥 作者与机构
- Ruiyan Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Satoshi Nakamura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源多语言语音翻译需将突尼斯语等四语种语音波形统一转写译为英语文本,语种异构与每语种仅约两万句以下数据使均匀共享易引发梯度冲突与负迁移,优化曲面噪声大且收敛困难。该文提出梯度驱动参数共享框架,先以层级梯度相似聚类划分出贝姆巴独立成组与另三语成组。再用自相似与跨相似差值确定百分之五十共享私有比例,分组输出决定比例计算的聚合单元。随后经联合奇异值分解与能量加权残差初始化生成共享与分组私有分支,最后执行分组微调,前步分组与比例直接决定后步路由与容量分配。相较人工设计共享结构或纯梯度投影优化,该机制把训练动力学直接转化为结构决策并保留跨语言迁移通道。在IWSLT 2025低资源评测基准下,GDPS的BLEU为8.39,高于JHU的BLEU 8.20。结论目前仅限SeamlessM4T-Medium模型与4个低资源语对,未验证大规模语种扩展与跨架构泛化。其适用边界受限于上述模型与语料规模,尚未验证大规模语种扩展与跨架构泛化。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
569. 标签不准又只给包级标签:用校正加双流多示例拆开抑郁语音检测
标签:#语音生物标志物 #弱监督学习 #语音 #病理语音评估
评分:6.4/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#弱监督学习
👥 作者与机构
- Yanfei Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanyuan Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Xinzhou Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Jin Qi:机构信息未能从会议 PDF 纯文本可靠映射
- Feiyi Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhao Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音自动抑郁检测需从受访者访谈语音预测其是否抑郁,难点在于训练标签可能因量表阈值与标注噪声而标错,且抑郁线索仅藏于片段级细微段落导致监督不精确。本文提出标签校正增强双流多示例学习LC-DMIL,先以卷积双向长短时记忆样本级主干估计似然比并结合原型密度融合校正得到修正标签,再将语音切分为实例包送入多示例检测模块。在检测模块中最大规则流用实例级多层感知机筛选两类关键实例,聚合器流以关键实例为查询计算相似度加权聚合实例值向量,两流输出融合后判定样本级状态,修正标签作为下一步监督形成迭代。相比仅做标签校正的SLLC或仅做单流多示例学习的方法,该双流融合同时处理不准确监督与不精确监督,并以关键实例引导注意力聚合放大细微线索。在DAIC-WOZ评测设置下,LC-DMIL的UAR为0.651,高于SLLC的UAR 0.614,且其F1-score为0.642,高于SLLC的F1-score 0.613。结论仅在切分后的6s片段与人工交换边缘分数标签设置下成立,随机噪声实验也局限于AVEC 2014的人工翻转协议。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/zhou123122/SLLC — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
570. 越快越慢:云端级联字幕中切分粒度如何把延迟推过吞吐边界
标签:#评测协议 #高效推理 #流式处理 #语音翻译
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音翻译 | 主方法:#评测协议
👥 作者与机构
- Shinyoung Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Taehoon Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
韩语到英语实时字幕需将连续语音转为可读译文,难点在于分段过细会推高云端请求到达率并引发排队累积,同时韩语主宾谓结构又要求足够上下文才能保证英译质量。本文构建可复现字幕管线先由语音活动检测端点切分音频并控制到达率,其输出波形依次进入云端语音识别得到首现文本,再经机器翻译得到稳定译文并区分首现延迟与稳定延迟。该工作以吞吐稳定性为选择准则,提出保留中位实时因子不超过1的最激进可操作阈值,以区别于只评估单次请求延迟的已有方法。在FLEURS韩英全量语料约9.6小时回放评测设置下,stable预设下gpt-4o-transcribe加gpt-4.1-mini级联的BLEU为11.5,高于fast预设下同一级联的BLEU1.9。与单端到端延迟评估不同,该机制差异揭示了激进分段因利用率超限进入积压区而使稳定延迟随时间累积的实际意义。韩英翻译还存在约2至3秒的上下文门限,低于该窗口质量即饱和受损。结论仅适用于非词流式单假设云级联与该语料分布,换语言对、换本地流式模型或高并发生产负载均未验证。其适用边界受限于上述级联与韩英回放语料,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
571. 用同一句话把不同口音拉到一起:话语级监督对比如何正则化 CTC 微调
标签:#对比学习 #鲁棒性 #语音 #语音识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#对比学习
👥 作者与机构
- Van-Phat Thai:机构信息未能从会议 PDF 纯文本可靠映射
- Aradhya Dhruv:机构信息未能从会议 PDF 纯文本可靠映射
- Duc-Thinh Pham:机构信息未能从会议 PDF 纯文本可靠映射
- Sameer Alam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非母语口音语音识别需要把发音变体稳定映射为相同文本,但基于自监督预训练与联结时序分类(Connectionist Temporal Classification,CTC)微调的系统仍对口音偏移敏感。第一步由自监督编码器输出帧级表征并共享给两路,CTC分支计算主识别损失,对比分支对有效帧做掩码平均池化得到定长话语向量,其输出直接作为下一步投影的输入。第二步将话语向量经双层投影与L2归一化送入对比空间,以转写相同定义正对,用温度缩放的对比损失与CTC按步数斜坡加权联合训练,推理时丢弃辅助头以保持解码不变。与依赖口音分类器、口音嵌入或强制对齐的方案不同,该方法无需架构改动与口音标注,推理时丢弃辅助头。在L2-ARCTIC未见口音划分上,wav2vec 2.0 Large基线词错误率(Word Error Rate,WER)从9.98%降至7.41%,相对下降25.8%;未见文本划分从10.47%降至9.14%。几何分析显示115个复读文本的话语内余弦离散度均值从0.0518降至0.0430。结论限于复读式英文非母语语料与CTC加4-gram语言模型解码,未验证自然口音、噪声并发与多语外推。该结论适用边界尚未验证自然口音与噪声并发外推,原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
572. 停顿越长越难判:用“离下一次说话还有多久” 重做流式端点检测
英文题目:Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction
标签:#多任务学习 #流式处理 #语音 #语音活动检测
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音活动检测 | 主方法:#多任务学习
👥 作者与机构
- Tristan Tsoi:机构信息未能从会议 PDF 纯文本可靠映射
- Jiajun Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Yingke Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Huu Quyen Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Tianxiang Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Nikita Kuzmin:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Lui:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端点检测需在流式音频中逐块判断语义单元是否结束,输入为连续音频块、输出为端点触发时刻,犹豫、口吃与话语内停顿的静音模式与真实话轮结束高度相似,仅靠声学静音极易早断或拖尾。Next-Turn首先以Whisper编码器加LoRA微调并做随机截断训练提取帧级表示,使模型在有限前瞻下学习语义完成线索,得到的帧序列输出进入下一步池化。接着对时域做均值池化得到话语级表示,分别送入二分类头输出端点分数与时长头预测到下一次语音起始的剩余时间,时长目标直接由语音时间戳构造并随剩余静音长度分级。然后将预测时长经归一化裁剪转换为时长端点分数,再经指数衰减平滑抑制抖动,联合训练时共享编码器,推理可选用二分类分数、时长分数或加权融合。与依赖ASR转写的级联语义基线相比,该机制以连续时长监督替代模糊二值标注,保留纯音频低开销即插即用特性并避免级联误差与额外延迟。在作者自有中文对话测试集与160 ms流式协议下,最优系统早断率(Early Interruption,EI)为5.0%,320 ms容忍准确率(ACC320)达86.7%,较最强公开基线Easy Turn提升25.9个百分点。结论目前仅在单语单轮中文与小规模人工标注上验证,多轮对话、跨语种与跨域泛化尚未验证,且依赖640 M参数量级编码器与微调流水线。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
573. 没有目标域语音时,只用目标域文本能否教会语音对话状态跟踪跨域
英文题目:Joint Speech And Text Training For LLM-based End-To-End Spoken Dialogue State Tracking
标签:#多模态学习 #大语言模型 #端到端 #语音 #口语意图与槽位识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语意图与槽位识别 | 主方法:#多模态学习
👥 作者与机构
- Katia Vendrame:机构信息未能从会议 PDF 纯文本可靠映射
- Bolaji Yusuf:机构信息未能从会议 PDF 纯文本可靠映射
- Santosh Kesiraju:机构信息未能从会议 PDF 纯文本可靠映射
- Šimon Sedláček:机构信息未能从会议 PDF 纯文本可靠映射
- Oldřich Plchot:机构信息未能从会议 PDF 纯文本可靠映射
- Honza Černocký:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语对话状态追踪(spoken dialogue state tracking,spoken DST)需从当前轮用户语音与多轮转写对话历史中直接输出含全量域槽的结构化可扩展标记语言对象表示法(JavaScript Object Notation,JSON),难点是口语噪声与标注语音稀缺导致的跨域泛化差。本文在端到端语音大语言模型(large language model,LLM)基线
\[7\]上,先冻结 LLM 做多数据集语音识别(automatic speech recognition,ASR)预训练以稳固语音编码器与连接器(connector),再冻结语音编码器与 LLM 基座,联合微调共享连接器、低秩适配(low-rank adaptation,LoRA)与新增文本编码器(text encoder)。语音支路将用户语音经 WavLM 加卷积降采样与 Transformer 映射为 LLM 前缀,文本支路将无配对纯文本用户轮经文本编码器走同一连接器 Transformer,两支路分别与历史拼接后统一预测转写加 JSON 状态。SpokenWOZ(SW)语音联合 MultiWOZ(MW)文本训练时,MW 验证集联合目标准确率(joint goal accuracy,JGA)从 15.1% 升至 19.0%,相对缩小与域内语音训练差距的 28.9%;反向 MW 语音联合 SW 文本时 SW 验证集从 20.5% 升至 30.6%,缩小差距 64.7%。在 Gemma-3-12B-it 上后者测试集达 42.2%,几乎追平域内语音训练的 42.6%。收益主要来自槽键与常见表达,跨城市新实体槽值仍有限,推理时丢弃文本编码器故无额外推理开销。原文未披露延迟吞吐与训练耗时。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
574. 不用独热硬目标:用文本内和音频内相似度做软监督的音频文本对比学习
英文题目:Leveraging Mutual Intra-Modal Similarity Supervision for Text and Audio
标签:#对比学习 #多模态学习 #零样本 #音频分类 #音频检索
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#对比学习
👥 作者与机构
- Julian Miguel von Aspern:机构信息未能从会议 PDF 纯文本可靠映射
- Bruno Defraene:机构信息未能从会议 PDF 纯文本可靠映射
- Anastasios Vafeiadis:机构信息未能从会议 PDF 纯文本可靠映射
- Oleksiy Kutscher:机构信息未能从会议 PDF 纯文本可靠映射
- Ernst Seidel:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Fingscheidt:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
对比语言音频预训练需判断任意音频与文本是否语义对应,输入为批量内配对音频与文本、输出为模间相似度矩阵,难点是批量内非配对样本并非全为负例,独热目标会引入噪声监督。方法链分三步衔接:先冻结文本编码器与音频编码器,分别计算批量内文本间与音频间余弦相似度矩阵以刻画模内连续结构;再经简单加权或基于MC Dropout不确定性的加权混合,将双侧模内矩阵合成为模间相似度软目标;最后用该软目标监督可训练双编码器预测的模间矩阵,并以均方误差回归替代交叉熵,可选叠加带梯度反转的模态分类分支以缩小模态间隔。相对独热基线的关键差异是用双侧模内结构代替单侧硬标签,并把分类适配为回归以兼容软目标,实际意义是保留批量内语义近邻关系而非强制互斥。在Clotho-eval文本查询音频检索任务下,MSE+T变体的mAP@10为34.4%,高于基线的mAP@10 32.3%。该结论适用边界受限于约0.5M训练样本和批量64条件,在NSynth乐器族零样本分类上所有变体均落后于CLAP23,跨数据规模与大批量的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
575. 用三条正交低秩分支把连续情感装进预训练语音模型
英文题目:Continuous Time-Varying Emotion Control Zero-Shot Text-To-Speech With Emotion Orthogonal LoRA
标签:#LoRA #偏好优化 #零样本 #文本到语音
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#LoRA
👥 作者与机构
- Chenchen Wan:机构信息未能从会议 PDF 纯文本可靠映射
- Minchuan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Peng Qi:机构信息未能从会议 PDF 纯文本可靠映射
- Shaojun Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Xiao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本情感文本到语音需以文本、参考语音与目标情感轨迹为输入生成语音,在保留说话人身份与可懂度的同时实现连续且随时间变化的情感控制,难点在于离散标签过粗而参考提示易纠缠音色与韵律。第一步负责条件准备,用预训练 predictor 提取帧级效价唤醒度支配度序列并插值对齐到梅尔帧,其输出作为逐帧标量控制信号进入下一步。第二步负责解耦注入,冻结流匹配主干并在线性变换内插入三路低秩分支,每帧隐状态按对应标量加权叠加增量并施加分支间正交正则,学到的解耦扰动进入对齐阶段。第三步负责两阶段优化,先以条件流匹配损失加正交损失监督微调获得可控初值,再冻结参考模型每条件采样8个候选并以情感轨迹相似度、说话人相似度与1减词错率复合奖励做流式直接组偏好优化。与单路低秩适配或外部条件拼接的差异在于将情感建模为变换空间的正交低秩扰动而非输入拼接,因而更利于句内情感转场且少数据可训。在EMO-change上情感相似度达0.778且唤醒效价轨迹相似度达0.914,显著高于同数据微调基线与大资源EmoCtrl-TTS。该结论限于英语训练加日语到英语跨语言与RAVDESS拼接转场评测,未验证长时多轮切换与强口音泛化。原文未披露训练推理成本与延迟吞吐。
🔗 开源资源
- 演示资源:https://wancc-p.github.io/EoLoRA/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
576. 固定块长走不稳难音区:用轨迹直不直来动态截断再生成
标签:#自回归模型 #流匹配 #高效推理 #文本到语音
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Ren Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyu Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Shun Lei:机构信息未能从会议 PDF 纯文本可靠映射
- Jiawei Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Dongfu Song:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向文本到语音合成中连续块流匹配推理采用固定块长而忽视语音建模难度非均匀分布的问题,输入为文本与参考音频,输出为连续声学隐变量解码的波形,难点在于困难音段速度场估计不稳且误差会跨块累积。方法链分为三步:首先用冻结声学编解码器与扩散变换器按块自回归建模最优传输流并行生成候选块;接着基于常微分方程积分轨迹直线度计算每帧轨迹置信度以估计可靠性;最后按阈值保留最长可靠前缀并截断重生低置信后缀,以更新上下文自适应缩小有效块长。与固定块长基线相比,关键差异在于无需重训即利用推理期几何信号实现块粒度动态调整,而非依赖离散词元概率。在Seed-eval英文集上相对自复现基线词错率由1.921%降至1.798%,自然度平均意见分达3.973,相对推理耗时仅为1.08倍。该结论目前仅在中英文Seed-eval及自复现基线上验证,未覆盖长时韵律失配与强噪声提示等失败条件。训练耗费16张A100约2周,推理采用32步积分,原文未披露完整部署内存与吞吐成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
577. 景颇人听普通话声调:多数能分界,唯独升调与曲折调连成一片
英文题目:Categorical Perception of Mandarin Tones in Jingpo Native Speakers
标签:#心理声学实验 #言语感知 #跨语言 #语音 #音频分类
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- Binghao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xinyuan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yao Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为普通话四声两两配对的合成声调连续统,输出为景颇母语者与普通话母语者的辨认曲线与区分曲线,难点在于景颇语有四个声调音位加上升变体但缺乏降升调,普通话Tone 2高升调与Tone 3降升调轮廓相近,跨语言同化路径难以预判。方法链分三步:先以女性普通话发音人录制的ta四声为源,用PSOLA法逐次修改基频轮廓合成6个调对共12条双向连续统,每条11个刺激;再用辨认任务拟合范畴边界并确定边界位置;最后用AX区分任务测量边界峰,并以知觉同化模型解释同化类型,前步刺激与边界直接进入后步对照检验。与以往只做单向或部分调对的研究相比,该链条把起点音高、终点音高与轮廓形状放在双向与双任务对照中检验,具有双向可比意义。结果显示27名德宏景颇被试除T2-T3外均建立范畴感知,但在T1-T4、T2-T4、T3-T4上峰度更小或边界更宽。在T3-T4区分任务条件下,景颇组的Ppk指标为15.04%,低于普通话组的Ppk指标27.12%。结论仅适用于德宏地区、普通话二级乙等、16-47岁的景颇日常使用者,对其他方言、更高水平者与自然语流变调尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://github.com/wbh-XC/Interspeech2026 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
578. 只用一两个图特征判别痴呆:加权言语图把语义与时间装进边权重
英文题目:WSG: Clinically-Informed Weighted Speech Graphs for Dementia Detection
标签:#语音生物标志物 #开源工具 #统计分析 #语音 #病理语音评估
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Yao Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Fritz Peters:机构信息未能从会议 PDF 纯文本可靠映射
- Madhurananda Pahar:机构信息未能从会议 PDF 纯文本可靠映射
- Dorota A Braun:机构信息未能从会议 PDF 纯文本可靠映射
- Caitlin H Illingworth:机构信息未能从会议 PDF 纯文本可靠映射
- Stefan Goetze:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Blackburn:机构信息未能从会议 PDF 纯文本可靠映射
- Heidi Christensen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为语义流畅性、音素流畅性与 Cookie Theft 图片描述三类诱发语音及转录时间戳,输出为健康对照与痴呆的二分类,难点在于传统语音图谱仅保留词序拓扑而丢失词义、发音、图片空间与产词时延等临床关键线索。方法链分 4 步:先抽取目标词序列,仅保留流畅性正确词与图片内容信息单元以聚焦思维组织;再用 ConceptNet Numberbatch、SoundVectors、内容信息单元坐标与词间间隔计算边权重,把切换代价编码为图距离;接着在 NetworkX 加权有向图上提取直径、平均最短路径、密度与平均总度等拓扑特征;最后经嵌套交叉验证的序列前向选择与朴素贝叶斯完成分类与特征筛选。与既有无权图谱的关键差异是将临床假设转化为权重方向约束,使痴呆对应更小直径与平均最短路径、更大密度与平均总度,从而可解释。在CognoMemory语料PVF任务五折交叉验证设置下,目标词输入的F1为0.75,高于全词输入基线的F1 0.55。结论仅适用于英语老年人群的 3 种诱发任务与小样本离线评估,未验证自发对话、其他语言及纵向追踪的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
579. 声音互相遮掩时,如何留住老类又发现新类
标签:#持续学习 #知识蒸馏 #正则化 #语音 #音频分类
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#持续学习
👥 作者与机构
- Qisheng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Shanhao Han:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Yulu Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Yunsheng Xiong:机构信息未能从会议 PDF 纯文本可靠映射
- Yutao Dou:机构信息未能从会议 PDF 纯文本可靠映射
- Kele Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
持续广义类别发现要求在无法回放历史音频的条件下,以无标注声学流数据为输入,同时输出旧类保持与新类发现结果,其实际难点在于谱时间重叠与多声源纠缠导致新类易被误判为基类并产生严重基类偏置。先以AudioMAE提取谱时间表示并用上一阶段模型计算最大后验置信度,其输出的置信度分布进入下一步划分。再以高斯混合模型拟合该分布并按密度比自适应调节阈值,将批次划分为高低置信子集并分别施加保留与探索正则,得到初步伪标签。随后指数滑动平均动态教师对学生特征做蒸馏与平滑,用时序平滑监督纠正非平稳流中的伪标签漂移并巩固表征。与视觉主导的Happy方法的关键差异在于阈值随重叠度漂移而非固定且教师随学生协同演化而非冻结,其实质意义是增强低信噪比纠缠下的类别可分性,其适用边界外强混响多标签外推尚未验证。在LibriSpeech的50/10增量协议下,w/GMM+EMA的累计平均准确率CAA-Old为82.93%,高于Happy的累计平均准确率CAA-Old 69.82%。该结论限于朗读语音与低信噪比舰船噪声的封闭类别增量设置,未验证开放类别数未知与强混响多标签场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
580. 在机器敏感、人耳不敏感的维度上做防御:解耦内容与声纹再加扰
英文题目:Imperceptible Voiceprint Protection via Human-Machine Perception Discrepancy Feature Disentanglement
标签:#对抗训练 #主观评测 #隐私保护 #语音 #语音克隆
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音克隆 | 主方法:#对抗训练
👥 作者与机构
- Chenlong Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Meng Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Qiang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiongwei Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Kunyuan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan Liao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoyi Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Kui Yao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音克隆仅需数秒参考音频即可伪造目标音色,防御需在不损伤听感的前提下让被盗音频无法被克隆,难点在于人耳不可感知与机器抽取失效难以兼顾且易被预处理削弱。该文先用自编码器把梅尔谱分解为内容编码与说话人嵌入,再冻结编解码器训练扰动生成器并经声码器与掩蔽约束输出保护波形。相对直接在波形或频谱加扰动的方法,该路线把对抗能量限制在机器敏感而人耳不敏感的说话人子空间,并用掩蔽阈值保证不可听性。在VCTK数据集上以AutoVC为白盒、YourTTS、VALL-E和AdaptVC为黑盒的评测中,本文方法防御成功率达到87.2%,平均意见分(Mean Opinion Score,MOS)为4.18,词错率(Word Error Rate,WER)为5.30%,优于同期嵌入层防御RoVo。该结论的适用边界受限于干净16kHz英文朗读、无自适应攻击者与无压缩混响的实验室条件,跨语种、噪声信道与自适应去扰动等场景尚未验证。原文未披露训练、推理或部署成本,仅提供在线试听Demo,未提供代码与权重。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
581. 声音不能只转文字:用独特性留住声学线索的视频推理压缩
标签:#模型压缩 #高效推理 #音视频 #音视频问答
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频问答 | 主方法:#模型压缩
👥 作者与机构
- Haiwei Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Zichao Nie:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
视频推理(Video Reasoning)以视频加用户查询为输入,以忠实回答为输出,难点在于离屏事件与情感语调等线索仅存于音频,而全量音频词元会拖垮多模态大模型上下文。Flash-VAReason先用高效音频时间融合(Audio Time Fusion,ATF)扫描Whisper特征并平均池化短时相似帧,再按原始时长计算保留预算并对超长序列做均匀采样兜底,最后用全局空间动态压缩(Spatial Dynamic Compression,SDC)做全局相似度排序与贪心去重并回填邻域信息。相对丢弃音频或仅用自动语音识别(Automatic Speech Recognition,ASR)转写文本的做法,该方法保留韵律与环境声并与视觉压缩统一在信息独特性框架下,无需架构修改或额外训练即可实现视听联合推理。在CharadesEgo基准下,Flash-VAReason的Overall得分为2.3789,高于UniComp的Overall得分2.2818。结论限于 4.33 s 至 29.92 s 的 CharadesEgo 与 10.17 s 至 29.97 s 的 Ego4D 离线第一人称短视频与 Whisper 加 Omni-MLLM 链路,流式与跨时剧烈非平稳音频尚未验证。压缩流水线本身开销可忽略且无需训练,推理延迟主要来自基座模型。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
582. 局部要听话、全局不崩坏:CraftTTS 用三阶段对齐做词级韵律控制
英文题目:CraftTTS: Fine-Grained Prosody Control for Text-to-Speech
标签:#强化学习 #韵律 #零样本 #文本到语音
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#强化学习
👥 作者与机构
- Wenbing Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Qihang Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Bingsong Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Zihan Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yueran Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Peilei Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Yingming Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Ya Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Gao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理零样本文本到语音,输入为文本与说话人提示,输出为带词级强度与语速标记的语音,难点在于严格局部声学约束易破坏自回归先验并引发伪影、异常停顿与情感泄漏。方法分三阶段:先以DeepSeek-V3标注重读、弱读、快、慢四类标签,经教师Indextts2多轮续写与优选构造偏好对,提供无人工标注的监督信号;再以联合监督微调与直接偏好优化在目标骨干CosyVoice 2上建立标签到声学实现的敏感性;最后以组相对策略优化与多维韵律奖励在采样组内平衡可懂度、强度对比与节奏。与直接声学规划或全局风格迁移不同,其取舍是不硬约束时长参数,而以可懂度锚定、情感解耦与节奏正则间接塑形。在中文InstructTTSEval子集评测下,CraftTTS完整模型的NMOS得分为3.87±0.13,高于基线CosyVoice 2的NMOS得分3.67±0.14。结论适用边界受限于中文短句与四类离散标签,尚未验证跨语言长篇章与连续韵律外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
583. 歌声打假为何要看相位:OPERA-Net 用相位一致 CQT 与语义门控隔离伴奏
标签:#时频分析 #迁移学习 #鲁棒性 #音乐 #音频深度伪造检测
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#时频分析
👥 作者与机构
- Fengwei Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Kun Zeng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
歌唱语音深度伪造检测(Singing Voice Deepfake Detection, SVDD)以含密集背景音乐(Background Music, BGM)的16 kHz歌声波形为输入,输出真伪二分类概率,难点在于伴奏掩蔽伪造痕迹且幅度谱丢弃相位不连续。该工作先由复数常数Q变换(Constant-Q Transform, CQT)提取对数幅度与帧间相位差构成的相位一致CQT(Phase-Consistent CQT, PC-CQT),经ResNet-18得到信号嵌入,同时用冻结底部6层、微调顶部6层的WavLM Base+分支提取语义嵌入并对齐时间分辨率。接着语义嵌入经多层感知机(Multilayer Perceptron, MLP)加Sigmoid生成软门控掩码,对信号嵌入做逐元加权以压制纯器乐段并增强人声段。最后拼接两路嵌入经两层全连接分类器输出结果,训练采用加权交叉熵。在受控CtrSVDD评测集上混合等错误率(Equal Error Rate, EER)为1.54%,优于当年冠军单系统Fosafer Speech的1.65%,在最难的扩散攻击A12上从4.19%降至3.85%。在野外SingFake上总体EER为4.72%,优于领域专用SingGraph的6.05%。结论限于4秒窗的离线二分类,对强编解码退化与未见语种演唱风格的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
584. 无标注测试数据上自己给自己出题:AQA-TTRL 如何让音频问答模型边测边学
英文题目:AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning
标签:#强化学习 #测试时自适应 #音频大模型 #音频问答
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#测试时自适应
👥 作者与机构
- Haoyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaxian Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Dong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Iwasawa:机构信息未能从会议 PDF 纯文本可靠映射
- Yutaka Matsuo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频问答以音频与文本问题为输入并输出选项答案,难点在于部署时噪声、录音条件与说话人差异导致声学失配,而重标注成本高昂。该方法先对每条无标注测试样本多次采样并多数投票生成伪标签与置信度,为后续优化提供可验证目标。接着以伪标签为可验证奖励做组相对策略优化,将投票结果转化为策略更新信号。随后用置信度加权优势并以多次尝试采样缓解全同输出导致的更新停滞,使高可靠样本贡献更大。与直接模仿伪标签的监督微调不同,该路线以奖励优化容忍标签噪声并将多采样投票收益蒸馏回单次推理。在MMAU、MMAR与MMSU基准下,Qwen2.5-Omni 7B经AQA-TTRL适应的平均准确率为68.81,高于未适应直接推理的准确率64.39。该结论限于选择题型音频理解基准的测试集内适应,未验证开放式问答、跨数据集迁移与在线流式场景,且原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
585. 从单向门控到双向调制:BiSASV 如何让说话人与伪造检测互相校准
英文题目:BiSASV: Bidirectional Feature Modulation with Dual-Granularity Fusion for Spoofing-Robust ASV
标签:#模型融合 #语音 #说话人验证 #语音伪造检测
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#模型融合
👥 作者与机构
- Yiqun Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Ji Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Longbiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
防欺骗说话人验证(Spoofing-aware Speaker Verification,SASV)需同时拒绝零尝试冒充者并抵御语音合成与变换攻击,难点在于说话人验证(Automatic Speaker Verification,ASV)需抑制伪影而反欺骗(Countermeasure,CM)需捕捉伪影,二者特征需求冲突且欺骗伪影常与目标说话人声学耦合。该工作先由 ASV 分支汇总注册与测试嵌入的均值、标准差与余弦相似度构成全局统计,经特征线性调制(Feature-wise Linear Modulation,FiLM)注入 CM 分支实现说话人条件化,再将增强后 CM 特征映射为通道门控向量以细粒度重加权 ASV 交互特征,最后并行拼接融合全局相似度的粗粒度通路与通道门控的细粒度通路完成判决。相比仅用 CM 分数标量门控 ASV 嵌入的单向基线,该机制建立了 ASV 到 CM 再到 ASV 的闭环信息流,并以全局通路对冲细粒度过拟合。在 ASVspoof 2019 LA 评测集上,系统相对同前端 ATMM-SAGA 基线将 SASV 等错误率(Equal Error Rate,SASV-EER)从 2.18% 降至 0.73%,最小不可知检测代价(Minimum Agnostic Detection Cost Function,min a-DCF)从 0.0480 降至 0.0153。结论目前仅在该单数据集协议内成立,对跨语种、跨通道与未知生成攻击的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
586. 只用五分钟新被试数据:从单人五十小时听觉预训练向感知与产出的语音检测迁移
英文题目:MEG-to-MEG Transfer Learning and Cross-Task Speech/Silence Detection with Limited Data
标签:#迁移学习 #低资源 #预训练 #脑信号 #语音活动检测
评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音活动检测 | 主方法:#迁移学习
👥 作者与机构
- Xabier de Zuazo:机构信息未能从会议 PDF 纯文本可靠映射
- Vincenzo Verbeni:机构信息未能从会议 PDF 纯文本可靠映射
- Eva Navas:机构信息未能从会议 PDF 纯文本可靠映射
- Ibon Saratxaga:机构信息未能从会议 PDF 纯文本可靠映射
- Mathieu Bourguignon:机构信息未能从会议 PDF 纯文本可靠映射
- Nicola Molinaro:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音脑机接口(Brain-Computer Interface, BCI)需从脑磁图(Magnetoencephalography, MEG)解码语音有无,但新被试通常仅有约5分钟数据,难以从零训练稳健模型。本文先在50小时单被试英语听书数据LibriBrain上预训练MEGConformer,再在18名西班牙语被试的听(Listen)、回放(Playback)和朗读生产(Production)任务上微调,输入为306通道原始MEG窗,输出为语音与静音二分类。预训练表征经验证损失选点、RollAugment循环移位与语音占比软标签微调后迁移到新被试与新任务,区别于以往按被试与任务独立从零训练的做法。任务内听觉准确率提升3.7个百分点,跨任务听觉互迁提升约6个百分点,生产训练模型仍能高于机会水平解码被动听觉,表明捕获了感知与生产共享表征。在Listen任务内评测设置下,迁移模型的准确率为79.0±4.8%,高于从零训练基线的准确率76.2±4.8%。该结论限于语音检测(Voice Activity Detection, VAD)而非音素与语义解码,且预训练为单被试英语、微调为多被试西班牙语。该适用边界外生产到感知迁移更弱且个体差异明显,跨语言泛化与实时脑机接口部署效果尚未验证,原文未披露训练、推理或部署成本。原文未披露训练与推理成本、延迟与部署约束。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
587. 短语音不稳、长语音不对词:用混合注册加帧级重打分稳住验证
英文题目:Stabilizing Short Duration Speaker Verification through Neural Re-scoring with Hybrid Enrollment
标签:#数据集 #注意力机制 #语音 #说话人验证
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#注意力机制
👥 作者与机构
- Zhiqi Ai:机构信息未能从会议 PDF 纯文本可靠映射
- Cheng Han:机构信息未能从会议 PDF 纯文本可靠映射
- Shiyi Mu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yongjin Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Shugong Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
短时说话人验证(Short-Duration Speaker Verification,SDSV)需在用户自定义关键词检出后,对不足3秒的短语级测试语音判定说话人身份,语音信息少且对音素与噪声敏感。所提框架先用冻结说话人主干分别提取文本相关(Text-Dependent,TD)与文本无关(Text-Independent,TI)注册语音及查询语音的 utterance 级与 frame 级特征,再计算两路余弦全局相似度,同时用共享并行交叉注意力做注册与查询帧级双向匹配,最后经轻量多层感知机(Multilayer Perceptron,MLP)融合全局与局部证据输出校验分。与仅用余弦相似度的传统后端相比,关键差异是从 utterance 向量比对转向帧级细粒度重打分,并同时利用TD的词法一致性与TI的身份稳定性。在VoxPhrase的Eval-1 random划分上,CAM++结合10秒TI与短语TD的混合重打分取得1.60%的等错误率(Equal Error Rate,EER),明显优于同条件单一路线的基线。该结论限于VoxCeleb衍生英文数据与DeepMine短语的分布外验证,未覆盖强噪声、远场与跨语言场景。原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
588. 坐席改一个实体,下一通电话就少错一个:闭环伴随如何攒出自己的偏置词典
标签:#测试时自适应 #流式处理 #语音识别 #口语意图与槽位识别
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#测试时自适应
👥 作者与机构
- Shiva Shankar Arumugam:机构信息未能从会议 PDF 纯文本可靠映射
- Ameyaditya Achar J:机构信息未能从会议 PDF 纯文本可靠映射
- Aashraya Sachdeva:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
客服通话的输入为流式语音音频与逐轮到达的客户话轮,输出为写入客户关系管理系统的命名实体与陪伴界面上的抽取建议,实际难点在于人名、单号、药品与SKU等长尾实体易被流式识别误识并向抽取与入库环节传播。方法链分四步衔接:流式自动语音识别先在偏置词表B引导下转写音频得到初始转写,词级纠错规则集R对其替换得到终稿转写并广播至抽取子智能体,抽取结果作为前瞻建议呈现在陪伴界面供坐席在位确认修正,反思子智能体在音频路径外将修正分类为误识、幻觉或漏抽并增补B与R用于下一通电话。与需预先给定实体表的Oracle偏置不同,系统从空表冷启动且跨通话累积领域词典,无需声学重训且反射更新不占用实时转写延迟。在ContextASR-Bench英文基准评测设置下,MACE Adaptive的NE-WER为0.147,低于No Biasing的NE-WER 0.178。该增益在 frozen词表与规则稳态后仍保持稳定,其适用边界尚未验证真实噪声与跨租户大偏置表下的外推表现。该结论限于英文合成语音回放、代理抽取器与 Oracle 编辑器,未验证真实噪声、跨租户与大偏置表下延迟。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
589. 低延迟下保不住音色:用激励信号与互补说话人编码补回韵律和时变信息
英文题目:Improving Model Expressivity and Speaker Matching in Low-Latency Voice Conversion
标签:#注意力机制 #实时处理 #零样本 #语音转换
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#注意力机制
👥 作者与机构
- Anders R. Bargum:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Lajboschitz:机构信息未能从会议 PDF 纯文本可靠映射
- Stefania Serafin:机构信息未能从会议 PDF 纯文本可靠映射
- Cumhur Erkut:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低延迟零样本语音转换(Zero-shot Voice Conversion,VC)需将输入语音改为目标说话人音色,同时保留语言内容与韵律,但在因果与轻量约束下说话人相似度明显落后。所提框架先用内容编码器蒸馏HuBERT离散单元得到语言表征,再由韵律编码器估计基频与响度并合成为正弦加噪声激励信号,直接向解码器各层注入丢失的韵律。同步引入的全局说话人嵌入(Global Speaker Embedding,SGlobal)与互补说话人编码器经因果多头注意力(Multi-Head Attention,MHA)融合,生成任务相关的时变说话人表示。与已有实时基线仅依赖静态全局嵌入或隐式韵律的关键差异在于显式激励补偿与内容韵律条件化的注意力融合。在LibriTTS训练、VCTK未见目标说话人零样本转换评测中,本文方法在说话人嵌入余弦相似度(Speaker Embedding Cosine Similarity,SECS)上达到80.83%,同时保持可比可懂度与基频一致性。结论仅适用于16 kHz英语朗读场景与6个目标说话人的小规模主观评测,跨语言、噪声与歌唱等外推尚未验证。原文未披露训练硬件与训练时长。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
590. 噪声下谁还听得清:经典与神经语音编码的可懂度对决
英文题目:Assessing the Impact of Noise and Speech Enhancement on the Intelligibility of Speech Codecs
标签:#众包评测 #鲁棒性 #语音可懂度评估 #语音编码 #语音增强
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#众包评测
👥 作者与机构
- Lyonel Behringer:机构信息未能从会议 PDF 纯文本可靠映射
- Anna Leschanowsky:机构信息未能从会议 PDF 纯文本可靠映射
- Anjana Rajasekhar:机构信息未能从会议 PDF 纯文本可靠映射
- Emily Kratsch:机构信息未能从会议 PDF 纯文本可靠映射
- Guillaume Fuchs:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究实时通信中语音编码在噪声下的句子可懂度保持问题,输入为干净、加噪与增强后语音,输出为转写可懂度分数与听努力评分,难点在于低码率神经编解码在噪声下可能幻觉且质量分无法反映内容丢失。方法链分四步衔接:先从Clarity语料选句并与DEMAND噪声按多信噪比混合,再用DeepFilterNet2做编码前增强,接着经6种经典与神经编解码处理,最后经众包转写与听努力打分并与客观指标关联。相对已有干净语音质量评估与词级可懂度测试,该链条以自然句开放集模拟真实通信,并用听努力缓解天花板效应。与EVS在5 dB信噪比下对比显示,未增强LPCNet可懂度显著更低,而增强带来显著改善,同时Whisper-B客观可懂度在条件级与主观分Pearson相关达0.973。结论限于英语小规模众测与4类噪声,低信噪比一致性下降且未验证多语言与真实部署链路。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
591. 把笑声当异常找:无标注多语言笑声切分的能量加表征路线
英文题目:MultiLinguahah : A New Unsupervised Multilingual Acoustic Laughter Segmentation Method
标签:#领域适应 #无监督学习 #多语言 #音频事件检测
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#无监督学习
👥 作者与机构
- Sofia Callejas:机构信息未能从会议 PDF 纯文本可靠映射
- Nahuel Gomez:机构信息未能从会议 PDF 纯文本可靠映射
- Catherine Pelachaud:机构信息未能从会议 PDF 纯文本可靠映射
- Brian Ravenet:机构信息未能从会议 PDF 纯文本可靠映射
- Valentin Barriere:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
笑声分割(laughter segmentation)要求从连续音频中输出笑声事件的起止时间,其难点在于多语言环境下背景音乐与环境噪声多变且精确标注成本极高。本文提出无监督多语言方法 MultiLinguahah,先用人声去除保留背景声,再用基于能量的峰值检测切出非语音事件,接着用预训练音频编码器将每个事件映射为高维向量,最后用孤立森林(Isolation Forest)把具有跨语言共性的笑声与离散噪声区分开来。与依赖英语自动语音识别骨干的监督分割相比,该链条不依赖笑声标签并强调非语义声学共性而更具跨域鲁棒性。在 StandUp4AI 非英语单口喜剧评测中,该方法在匈牙利语上以交并比阈值为 0.3 的 F1 达到 0.796,优于 Omine 等方法的 0.706,而在美式英语单口和 YouTube 上仍落后于监督模型。该结论适用于笑声音量高于底噪且人声可被有效去除的场景,对极弱笑声与强音乐干扰尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
592. 同一批人、同一任务、两种媒介:VIP-MINGLE 如何把视频会议与面对面的差异可比化
标签:#数据集 #数据集构建 #音视频 #轮次切换
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#轮次切换 | 主方法:#数据集构建
👥 作者与机构
- Andrew Chang:机构信息未能从会议 PDF 纯文本可靠映射
- Abhinay K Bodi:机构信息未能从会议 PDF 纯文本可靠映射
- Wenxin Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Junrui Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Venu G Kadamba:机构信息未能从会议 PDF 纯文本可靠映射
- Sumanth B H Karanam:机构信息未能从会议 PDF 纯文本可靠映射
- Dhiwahar A Kennady:机构信息未能从会议 PDF 纯文本可靠映射
- David Poeppel:机构信息未能从会议 PDF 纯文本可靠映射
- Dustin Freeman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理小组会话在面对面与视频会议之间的行为分布偏移难以量化的问题,输入为同一小组在两种场景下的多人群聊音视频与会前心理测量基线,输出为逐人时间对齐的多模态特征矩阵与时间分辨人工体验标注。方法上采用组内被试设计让32组105人分别完成面对面与经Zoom采集的视频会议家族问答协作任务,顺序经平衡处理,再经说话人分离标注(speaker diarization)与大词汇量语音识别转写形成带说话人标签的时间戳文本,并行提取韵律时序、句法复杂度与头部姿态视线与面部动作单元(Action Unit)与离散情绪概率,最后将视频切分为10秒片段进行众包愉悦度与流畅度评分与事件标注。相对以往孤立于单场景的AMI、ICSI或孤立于远程的CANDOR、RoomReader,以及依赖非配对网络视频的跨场景比较,其差异在于用人员与任务配对控制混杂,从而分离通信媒介本身效应。视频会议轮次间隙系数β为0.113,话语时长系数β为-0.094,面对面平均依存距离显著性p为.017。在面对面与视频会议配对评分任务下,愉悦度差异的显著性指标p值为.001,低于流畅度差异的显著性指标p值.465。结论仅适用于英语青年学生半结构化问答协作,尚不能外推至正式会议或跨文化场景。原文未披露训练与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
593. 激活精度说了算:Whisper 端侧量化中权重格式与激活位宽的系统对决
英文题目:Systematic PTQ Study of Integer and Floating-Point Formats for On-Device Whisper ASR
标签:#模型量化 #高效推理 #端侧运行 #语音识别
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#模型量化
👥 作者与机构
- Woosuk Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Dohyeon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Taehyung Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Hyukjun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
编码器-解码器Whisper需将30秒梅尔频谱输入映射为文本输出,编码器激活离群更强且移动端内存受限,使低比特后训练量化能否沿用W4A16范式并不明确。作者先用SmoothQuant做跨通道重分布将离群能量从激活搬向权重,再对全部线性层与键值缓存投影注入伪量化噪声以统一比较INT8/4/3与FP8/FP4/NVFP4/MXFP4,然后在LibriSpeech上以确定性束搜索评估词错率与解析模型尺寸。与仅关注权重的LLM量化研究不同,该工作把激活格式与位宽作为一等变量,并对比整数与浮点激活通路的硬件面积含义。在LibriSpeech test-clean评测设置下,base.en经SmoothQuant的INT8的WER为4.64%,低于FP32基线的WER 4.81%。激活位宽是主导因素,保持16比特激活远优于降至8比特,而INT16与FP16激活路径精度等价,使浮点数据通路更具面积效率。该结论适用边界受限于仅在tiny.en与base.en上验证,MXFP4在标准后训练量化下严重退化与INT3崩溃构成失败条件,更大变体与需校正训练的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
594. 不逐字追踪也能选好转写:用一次前向的并行采样做最小贝叶斯风险解码
英文题目:Non-Autoregressive Minimum Bayes’ Risk Decoding for Fast Speech Recognition
标签:#CTC #高效推理 #语音 #语音识别
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#CTC
👥 作者与机构
- Hiroyuki Deguchi:机构信息未能从会议 PDF 纯文本可靠映射
- Takatomo Kano:机构信息未能从会议 PDF 纯文本可靠映射
- Katsuki Chousa:机构信息未能从会议 PDF 纯文本可靠映射
- Marc Delcroix:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别 Automatic Speech Recognition需要将语音声学输入转写为词序列,而非自回归 Non-Autoregressive解码虽可并行生成却因无法以前文为条件而难以消解声学歧义与多路径不确定性,导致高概率路径未必对应高质量转写。该文提出非自回归最小贝叶斯风险 Non-Autoregressive Minimum Bayes Risk解码,记为NAR-MBR,先对连接主义时间分类 Connectionist Temporal Classification对齐路径与条件掩码语言模型 Conditional Masked Language Model掩码位置做无偏采样以构造假设与伪参考集合,再以负词错误率 Word Error Rate为效用函数估计期望效用 Expected Utility并选取最优假设。与最大后验 Maximum A Posteriori贪婪解码的关键差异在于用群体一致性代替单路径概率,并利用非自回归独立性实现单次前向多采样。为维持快速解码优势,该方法在效用计算前去除假设与伪参考的最长公共前后缀并缓存重复样本对得分,以降低二次比较的计算负担。在Web语料上该方法在迭代数 \(N\_\{iter\}=1\)、采样数 \(\|Z\|=64\) 时相对波束搜索 Beam Search获得43.1倍加速且词错误率达到7.4%,显著优于对应基线非自回归解码的8.9%。该结论限于LibriSpeech、Switchboard、AMI及内部Web数据上的Mask-CTC架构,未验证Whisper类大模型与噪声远场外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
595. 榜单上只有百分之几的错误,为何遇到口吃和构音障碍就翻倍:五种开放语音识别架构的非标准语音泛化检验
标签:#评测协议 #鲁棒性 #言语障碍 #语音 #语音识别
评分:6.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Aditya Dhaka:机构信息未能从会议 PDF 纯文本可靠映射
- Aarush Mathur:机构信息未能从会议 PDF 纯文本可靠映射
- Dena Mujtaba:机构信息未能从会议 PDF 纯文本可靠映射
- Hope Gerlach-Houck:机构信息未能从会议 PDF 纯文本可靠映射
- Caryn Herring:机构信息未能从会议 PDF 纯文本可靠映射
- Chelsea Johnson:机构信息未能从会议 PDF 纯文本可靠映射
- J. Scott Yaruss:机构信息未能从会议 PDF 纯文本可靠映射
- Nihar Mahapatra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是将口吃与构音障碍等非标准语音转写为文本,输入声学高度变异且含重复、延长、阻塞与含糊发音,输出需在词汇与语义层面保持可用并支撑无障碍交互。方法链由四步构成:先对 FluencyBank、SEP-28k 与 UIUC Speech Accessibility Project 三个语料做重标注与统一切分并去除时长异常值,再将全部音频重采样至 16 kHz 单声道并做模型相关前端处理,接着用五种模型在仅转写约束下做贪婪解码,最后以词错率、字错率、词汇 F1 与语义相似度做双层评估。与已有单病种或单模型研究不同,本工作以排行榜为锚点实现跨架构可比,并揭示逐字转写与流畅目标之间的度量冲突与架构特异性失效模式。在 UIUC SAP 上 Whisper-Large-v3 全局词错率为 0.18 而 Granite-Speech-3.3-8B 达到 1.39,平均词错率相对标准基准膨胀 2 倍至 5 倍,极端幻觉可达 24 倍。结论仅适用于英语口吃与五类病因构音障碍的离线转写场景,未验证个性化微调与实时部署下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
596. 把概率推回正态区间:兼顾改对比特与躲开检测的音频水印自适应攻击
英文题目:Learning to Evade: Adaptive Attacks on Audio Watermarking
标签:#统计分析 #对抗鲁棒性 #语音 #音频水印
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频水印 | 主方法:#统计分析
👥 作者与机构
- Weikang Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Hanqing Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Duan:机构信息未能从会议 PDF 纯文本可靠映射
- Guangjing Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanda Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Mingzhe Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Qiben Yan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为干净音频或已加水印音频,输出是经微小扰动后误导水印解码器(Watermark Decoder)的音频,难点在于既要改变二进制消息又要让逐比特概率不被基于正态分布的离群检测发现,同时保持听感。方法链分四步:先用少量同源音频估计防御方正态参数得到均值与方差,再以高权重消息损失执行水印攻击(Adaptive Watermark Attack,AWM)生成扰动,然后将允许区间放宽到均值正负2倍标准差并固定轮数优化以提升音质,最后对替换、伪造与擦除三类目标做逐比特自适应加权。与直接优化到0或1的基线不同,该方法只优化落到估计区间外的风险比特并保持非目标位不变。在LibriSpeech等3个数据集上,擦除攻击的检测成功率(Detection Success Rate,DSR)为0%,替换与伪造多低于10%,显著低于AudioMarkBench的接近100%。该结论仅适用于Timbre与AudioSeal各16比特及白盒可查概率的设置,跨模型、跨比特长度与黑盒场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
597. 距离与方向混在一起时,贴麦检测如何用互相关把两者分开
标签:#信号处理 #鲁棒性 #多通道 #语音 #音频分类
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#信号处理
👥 作者与机构
- Stuart Fong:机构信息未能从会议 PDF 纯文本可靠映射
- Sky Qiao:机构信息未能从会议 PDF 纯文本可靠映射
- Xuecong Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Seyed Shahabeddin Nabavi:机构信息未能从会议 PDF 纯文本可靠映射
- Huanzhang Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Jinran Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Siqi Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Amirhossein Hajavi:机构信息未能从会议 PDF 纯文本可靠映射
- Rasoul Mohammadi Nasiri:机构信息未能从会议 PDF 纯文本可靠映射
- Shuangliang Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Longshuai Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanhao Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Irina Kezele:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
近场语音检测需从双通道手机录音判断说话人是贴近话筒还是远离,难点在于信号能量同时受距离和到达方向调制,换个握持角度远近判断就会反转。先以双通道语音谱图或波形为输入,用骨干网络编码得到距离相关向量,再以双通道音频估计的GCC-PHAT向量为输入,用残差卷积编码得到方向相关向量。最后将两路向量拼接后作为融合输入,送入带Sigmoid的稠密层输出贴近与远离二分类概率,使前两步的距离依据与方向峰形多径依据共同进入判决以分离方向干扰。与仅用能量与频谱的已有近场检测相比,关键差异是用互相关峰形与多径结构隐式携带方向信息,从而在不显式估计角度下分离方向干扰,大范围握持外推尚未验证。在办公噪声场景下,Ada-Mic在15cm顶麦非正对条件下的准确率为58%,高于ProxiMic基线的准确率34%。该结论限于2通道手机、短指令朗读与受控角度区间,未验证强混响、多人重叠与跨设备泛化。计算开销方面,对轻量骨干增加约7.6%浮点运算,对大模型骨干可忽略。该额外分支的计算量很小,推理开销主要仍在原骨干上。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
598. 后门住在哪里:语音语言模型中组件传播与多任务掩盖
标签:#LoRA #音频大模型 #音频安全 #语音识别 #语音情感识别
评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- Alexandrine Fortier:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Thebaud:机构信息未能从会议 PDF 纯文本可靠映射
- Jesús Villalba-Lopez:机构信息未能从会议 PDF 纯文本可靠映射
- Najim Dehak:机构信息未能从会议 PDF 纯文本可靠映射
- Patrick Cardinal:机构信息未能从会议 PDF 纯文本可靠映射
- Peter West:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音语言模型(Speech Language Model,SLM)以音频编码器加连接器加语言模型处理语音并同时输出转写与说话人属性,其多组件多任务信息流如何被恶意特征穿透尚不清楚。本文以脏标签音频后门为探针,先用打字机点击触发器污染全管线建立基线攻击,再冻结单个组件隔离其在学习与传播中的作用,最后在编码器与连接器后抽取干净与中毒样本对的嵌入并做聚类检验可分性。与单模态后门研究不同,该链条把组件级因果归因与多任务表征分析串联,揭示了后门存活对组件类型与任务语义的双重依赖。在Libri-360语料ASR任务评测设置下,WavLM全管线基线攻击的攻击有效率(Attack Effectiveness Rate,AER)为99.2%,高于HuBERT全管线基线攻击的攻击有效率(Attack Effectiveness Rate,AER)90.8%。然而中毒编码器在干净重训后仅情绪任务保留63.5%的AER,转写等任务则被完全擦除,且标准双簇激活聚类在全部任务中失效。该结论的适用边界受限于仅验证四种编码器与转写及情感等任务,跨架构与跨语种外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
599. 在日常家庭噪声里分清哭与闹:真实世界婴儿 distress 的二分类加固与三分类起点
标签:#数据集 #迁移学习 #鲁棒性 #音频分类
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频分类 | 主方法:#迁移学习
👥 作者与机构
- Yashaswi Galhotra:机构信息未能从会议 PDF 纯文本可靠映射
- Priyanka Khante:机构信息未能从会议 PDF 纯文本可靠映射
- Anna Madden-Rusnak:机构信息未能从会议 PDF 纯文本可靠映射
- Kaya de Barbaro:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理婴儿佩戴设备采集的日长家庭音频中的痛苦检测问题,输入为连续噪声录音,输出为无痛苦与痛苦的二分类及哭 fuss无痛苦的三分类,难点在于重叠语音与家庭噪声下的弱结构化fuss信号。方法链分为三步:先以5秒重叠切分提供上下文并经欠采样缓解不平衡,再以大规模音频预训练网络YAMNet提取嵌入并经主成分分析PCA去冗余,最后以径向基支持向量机SVM构建非线性边界并经一对一投票扩展至三分类。相对实验室数据训练与手工特征加传统分类器的关键差异在于生态数据加领域对齐表示与间隔分类的结合,显著提升了跨域鲁棒性。在deBarbaroFussCry上留一被试交叉验证LOPO-CV下二分类宏F1达到0.803,相对既有真实基线痛苦F1 0.615提升明显,三分类宏F1为0.624。结论限于英语家庭日长录音与固定切分评测,fuss精度偏低且未验证实时部署与人群外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
600. 静态权重跟不上突发噪声时,用噪声即时生成适配参数
标签:#知识蒸馏 #LoRA #鲁棒性 #说话人验证
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#LoRA
👥 作者与机构
- Dai Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Chen Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Sizhe Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Peng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向含加性噪声语音的说话人验证,输入为受污染语音,输出为用于余弦打分的说话人嵌入,难点在于非平稳噪声与瞬态干扰破坏判别特征而静态参数无法逐例响应。方法分三步:卷积循环重构网络预测噪声谱并经多尺度头输出全局与局部噪声表示;全局表示经超网络动态生成低秩矩阵以重参数化编码器浅层;局部表示经门控网络做帧级调制以抑制深层时变干扰,含噪嵌入再经掩蔽InfoNCE向冻结教师干净嵌入对齐并联合分类与重构损失优化。与静态低秩适配和级联增强不同,该框架推理时逐样本生成适配权重,从粗粒度参数适配过渡到细粒度时变抑制,兼顾抑制与保留。在VoxCeleb1混合MUSAN可见噪声评测条件下,NoiseLoRA-SV的平均等错误率为3.05%,低于ParaNoise-SV的平均等错误率3.40%。其适用边界受限于加性合成噪声与短语音评测,极低信噪比与真实混响等失败条件尚未验证。训练使用NVIDIA A100硬件训练200轮,引入重构与适配模块后参数量增至24.19M,带来额外推理开销与计算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
601. 瞬时置信不可靠时,用历史稳定性把伪标签抢回来:HistoMatch 解读
标签:#数据增强 #半监督学习 #鲁棒性 #语音 #说话人验证
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#半监督学习
👥 作者与机构
- Shenghan Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Xueshuai Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Pengyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yonghong Yan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
半监督说话人验证(Speaker Verification, SV)需以每说话人仅4/10/20条标注语音学习判别性嵌入,并利用VoxCeleb2上约109万条无标注语音提升泛化。其实际难点在于随机N秒裁剪与MUSAN加RIRs噪声混响增强导致瞬时置信度剧烈波动,造成高质量伪标签被系统性漏筛。该文提出HistoMatch,先以弱增强分支经编码器加分类层得到类别分布并用瞬态阈值筛选高置信子集,再为每个无标注样本维护过去K轮弱增强最大似然预测队列并统计出现次数最多的类别计数作为稳态分数以召回低置信但高稳态样本。随后对批量置信均值与批量稳态均值分别做指数滑动平均(Exponential Moving Average, EMA)更新双阈值,并对标注集与筛选后无标注集统一用可加角度裕度(Additive Angular Margin, AAM)损失训练。与固定阈值及现有自适应匹配框架的关键差异在于以离散直方图计数稳态补偿瞬时评估,避免中期训练的单步漏检。在VoxCeleb2训练、VoxCeleb1-O评测且每说话人20标注时,等错误率(Equal Error Rate, EER)为0.91%,相对同条件下最优基线1.09%约提升16.5%,与全监督0.87%仅差0.04个百分点。该结论仅在VoxCeleb1-O/E/H英语名人访谈语音内验证,未覆盖短时、跨信道与强混响外推,原文未披露训练推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
602. 低帧率悬崖不是音素装不下,而是训练时只给了两个 token
英文题目:Probing Low Frame Rate Degradation in Neural Audio Codecs
标签:#评测协议 #高效推理 #语音 #语音编码
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#评测协议
👥 作者与机构
- Alex Gichamba:机构信息未能从会议 PDF 纯文本可靠映射
- Moise Busogi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究低帧率神经音频编解码器重建可懂度骤降的成因,输入为16 kHz语音波形,输出为离散token重建波形,难点在于区分帧率本身的信息瓶颈与训练配置失配导致的假性悬崖。方法链先以描述符音频编解码器Descript Audio Codec, DAC为可控基线,通过调整编码器步幅构造1.6 Hz至100 Hz宽范围帧率变体并固定残差层数与码本规模以隔离帧率效应,接着用强制对齐统计每帧音素负载并计算码本利用率与熵效率以检验两类先验假说,最后对比固定片段时长与固定token数训练协议以验证上下文饥饿解释。与引入动态码率或语义蒸馏的复杂方案不同,本文仅延长低帧率训练片段以匹配token数,揭示悬崖源于解码器训练时缺少跨token边界而非音素碰撞,实践上可直接复用标准卷积编解码器实现极低码率。在LibriSpeech test-clean上6.25 Hz变体的词错率Word Error Rate, WER由固定时长训练的107.40%降至匹配token数后的15.37%,且1.6 Hz在192 bps下仍保持可懂。结论边界在于验证仅限英语朗读语音与重建可懂度指标,未检验自回归合成下游与噪声多语泛化,极低帧率残余退化仍随音素负载平滑上升。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
603. 只用 ASR 数据做多语言语音指令跟随:用语言相关的查询库缓解共享投影器的干扰
标签:#知识蒸馏 #多语言 #语音 #音频问答
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#知识蒸馏
👥 作者与机构
- Shreyas Gopal:机构信息未能从会议 PDF 纯文本可靠映射
- Donghang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Ashutosh Anshul:机构信息未能从会议 PDF 纯文本可靠映射
- Yeo Yue Heng:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhou Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hexin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言语音大语言模型需由语音指令直接生成文本回复,但监督微调依赖大规模任务语音语料,在多语言下稀缺且分布不均。作者冻结Whisper-large-v3编码器与Llama-SEA-LION-v3-8B-IT,仅训练轻量投影器,先由编码器抽取语音表征并经门控网络推断语言权重。该权重用于选择或混合语言查询库中的专属查询序列,再经查询变换器投影为软语音前缀送入冻结大模型,以转录条件下的教师行为为目标做输入输出蒸馏对齐。与共享静态查询的多语言蒸馏基线相比,关键差异在于将单一查询拆为按语路由的语言专属查询,避免优势语言平均化压制低资源语言。在Audio-MLQA封闭问答任务下,Ours (hard-gating)的分数为3.96,高于ML-DiVA的分数3.85。真实自发语音与未见语言上的外推效果尚未验证,适用边界限于已训六语的合成朗读语音。该结论限于朗读式合成语音与6种已训语言,未验证真实自发语音、噪声、口音及未见语言的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
604. 为伪造判别而压缩:在高稀疏下保住跨域泛化的剪枝蒸馏
英文题目:Task-Aware Joint Pruning and Distillation for Efficient Audio Deepfake Detection
标签:#知识蒸馏 #模型剪枝 #高效推理 #鲁棒性 #音频深度伪造检测
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#模型剪枝
👥 作者与机构
- Miao He:机构信息未能从会议 PDF 纯文本可靠映射
- Peng Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Zhongjie Ba:机构信息未能从会议 PDF 纯文本可靠映射
- Qing Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Li Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Kui Ren:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为原始语音波形,输出为真实与伪造的二分类判决,难点在于自监督学习 Self-Supervised Learning(SSL)前端多达3亿参数且伪造痕迹细微,面临编解码与环境失真多样性,高稀疏压缩后域外泛化极易崩塌。方法链分三步:先在域内数据微调教师XLS-R并计算结构单元的移动分数作为任务重要性先验,再以跨域知识蒸馏 Knowledge Distillation(KD)为监督联合优化结构化剪枝掩码,最后将剪枝前端与反欺骗后端分类器联合微调恢复精度。相比仅用域内损失的剪枝蒸馏,该机制用域外无标签数据的多层表示对齐提供泛化监督,并用移动先验约束保留伪造敏感结构。在90%稀疏下压缩模型参数降至31.9M、计算量下降6.3倍,在多个数据集平均仅上升1.30%等错误率 Equal Error Rate(EER),且在ASVspoof5和FoR上甚至优于密集基线。结论限于XLS-R 0.3B骨干与ASVspoof系评测,对更大基座、跨架构迁移与真实端侧时延功耗的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
605. 词错率好看却留不住人名和语气词:面向口音对话的实体与填充词召回管线
英文题目:Beyond WER: Entity and Disfluency Recall in Accented Conversational ASR
标签:#教育 #数据集构建 #LoRA #语音 #语音识别
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- Fiza Husain:机构信息未能从会议 PDF 纯文本可靠映射
- Ankit Pandey:机构信息未能从会议 PDF 纯文本可靠映射
- Yash Singh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向印度、印度尼西亚与拉丁美洲口音的英语学习者对话,系统需同时输出保留填充词的逐字稿与修正实体拼写的教学稿,而通用识别模型常在可接受词错误率下丢实体、删填充词。该工作先用结构化查询语言(Structured Query Language,SQL)词形启发式从生产日志中富集实体话语并以大模型生成银标准参考,再为每区域在Qwen2.5-Omni-3B上训练低秩适配(Low-Rank Adaptation,LoRA)适配器以单次前向输出双稿,最后用大模型判分器对残余错误做六类诊断。相对随机采样与商用基线,该组合在不改声学解码、不引入检索纠错的前提下把监督重心转向高负载实体词。在约6k条三区域测试集评测下,微调模型的实体召回率为80–85%,高于Parakeet的实体召回率53–55%。结论限于英语口音对话与银标准评测,未验证代码切换、多语言外推与全量人工金标下的一致性。原文披露了单卡训练与在线服务延迟量级,总体属于轻量可部署方案。
🔗 开源资源
- 第三方资源:https://github.com/unslothai/unsloth — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
606. 剪掉一半反而更准:Whisper 中一次性幅度剪枝的正则化效应
英文题目:Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR
标签:#模型剪枝 #正则化 #鲁棒性 #语音 #语音识别
评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型剪枝
👥 作者与机构
- Julian Irigoyen:机构信息未能从会议 PDF 纯文本可靠映射
- Arthur Söhler:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Søeborg Kirkedal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别需将多样声学输入转写为文本,过参数化编码器解码器Transformer在口音与混响等域外条件下易泛化不足。本文以公开Whisper-small检查点为对象,先在LibriSpeech验证集上用负对数似然损失计算一阶梯度敏感度与费希尔信息矩阵对角二阶曲率以区分剪枝脆弱与鲁棒组件,再对各组件独立执行一次性非结构化幅度剪枝并以词错率验证增益,最后将固定掩码不重算直接迁移跨语料检验泛化,前步诊断输出决定后步稀疏分配。与全局均匀剪枝不同,该方法按组件敏感度分配稀疏度,只剪鲁棒区而保护解码器前馈网络等脆弱区,使剪枝起隐式正则化作用而非单纯压缩。在LibriSpeech test-other评测设置下,解码器自注意力50%剪枝的WER为9.26%,低于未剪枝基线的WER 11.64%。编码器后段与整体敏感度引导压缩亦保持相近正则化与保精度趋势,并在Common Voice与TED-LIUM语料上保持提升。结论适用边界受限于英语Whisper-small受控设置,Parakeet、wav2vec 2.0、Conformer的完整验证尚未验证,编码器主导的基于连接时序分类的系统亦不适用。部署上非结构化掩码未被稠密核加速,推理开销上实时率不变,而压缩后计算量从4.55降至2.77 GFLOPs且无需微调训练。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
607. 把脸放进全双工对话:在 12.5 Hz 上同时说与动
英文题目:Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems
标签:#向量量化 #流式处理 #音视频 #全双工语音交互
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#全双工语音交互 | 主方法:#向量量化
👥 作者与机构
- Jingjing Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Atsumoto Ohashi:机构信息未能从会议 PDF 纯文本可靠映射
- Ryuichiro Higashinaka:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
全双工语音对话需同时处理用户与系统双路音频并支持重叠与打断,本文进一步要求同步理解面部输入并生成语音与三维面部运动,难点在于面部与音频须同帧率对齐且保持实时流式延迟。先面部编解码器以25fps三维网格位移为输入,将其压缩为离散面部令牌并输出可重建网格的码本,为对话建模提供紧凑目标。再残差量化变换器以双路音频令牌、文本令牌及上一帧面部令牌为输入,自回归维持对话上下文并输出融合隐状态与音频文本嵌入,使面部码本目标进入对话上下文建模。最后面部变换器以上一步融合隐状态与文本音频嵌入为条件输入,在帧内以非因果自注意力并行输出当帧全部面部令牌,将对话上下文转化为音画同步输出。与轮流式音视频对话的关键差异在于坚持双向实时流式处理而非单方发言,并用帧内非因果并行替代逐令牌自回归以降低延迟。在教师强制评测设置下,Moshi-Face的LSE-D指标为8.76,低于Random face的LSE-D指标11.7。该结论仅在 Seamless Interaction 子集受控采集与渲染评测协议下成立,对野外光照遮挡、强重叠打断及主观自然度的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
608. 长描述越写越长越被扣分:把情感语音评价拆成原子事实再逐条验音
英文题目:EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions
标签:#基准测试 #评测协议 #模型评估 #语音 #音频字幕生成
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频字幕生成 | 主方法:#评测协议
👥 作者与机构
- Xin Jing:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Triantafyllopoulos:机构信息未能从会议 PDF 纯文本可靠映射
- Jiadong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shahin Amiriparian:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
情感语音字幕需以原始语音为输入并输出涵盖音色韵律与情绪状态的长文本描述,难点在于传统重叠度量惩罚冗长细节而大模型整体裁判易出现上下文坍缩与幻觉漏检。本文提出情感语音理解评分EmoSURA先由大语言模型将生成字幕与参考字幕分别拆为原子感知单元并形成可验证的独立命题,该输出直接进入后续验证与匹配。接着由音频语言模型逐条对原始音频做是或否的蕴含判断得到幻觉过滤后的精确率,同时用文本模型判定参考单元被生成单元覆盖的召回率并计入可验证的新增细节。最后将精确率与召回率取调和平均并结合描述性子集得分得到总分,从而把幻觉检测锚定在声学证据而非文本相似上。与整体打分机制不同,该分解再验证链条避免了长上下文推理坍缩并显式惩罚未接地幻觉同时奖励忠实覆盖,具有实际评估意义。在SURABench的320对人工平均意见分(Mean Opinion Score,MOS)评测中,EmoSURA的皮尔逊相关系数(Pearson Correlation Coefficient,PCC)为0.4391,显著优于BLEU-4等基线的负相关。该结论的适用边界受限于MSP-Podcast英文3至8秒片段与特定裁判模型组合,其失败条件包括对复杂声乐事件检测率仅60%而尚未验证跨语言与长时外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/KeiKinn/EmoSURA — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
609. 看不见舌头也能练反演:用语音网格合成可见发音轨迹补足电磁发音数据
英文题目:ArtBoost: Synthetic Articulatory Data Augmentation for Acoustic-to-Articulatory Inversion
标签:#数据增强 #发声与构音 #预训练 #语音 #语音属性识别
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#数据增强
👥 作者与机构
- Hyung Kyu Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Byungchan Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Hak Gu Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声学到构音反演任务输入为语音波形信号、输出为电磁构音图记录的构音器运动轨迹,但电磁构音图采集成本高且语料仅数小时规模,一对多映射与说话人、语境差异使跨说话人泛化困难。ArtBoost先用自动语音识别将长时语音网格切分为话语级片段以对齐EMA语料结构,再跟踪上唇、下唇和下门齿对应网格区域并提取张开与前伸方向运动,经重采样构造12通道伪标签。AAI模型先在伪标签的可见通道上掩码预训练学习可见构音先验,再在真实EMA全通道上微调适配真实传感器轨迹。与已有直接EMA监督相比,关键差异在于复用大规模语音网格数据的可见运动作为可扩展弱监督,而非改进声学特征或架构。在留一说话人评测设置下,USC-TIMIT上ArtBoost模型的PCC为0.510±0.04,高于基线模型的PCC 0.351±0.10。该结论限于英语小规模EMA语料和唇颌可见构音器,未验证舌体等不可见构音器与跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
610. 噪声下别硬减:用注意力可靠性逐词调节对比解码强度
标签:#注意力机制 #大语言模型 #鲁棒性 #音视频语音识别
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音识别 | 主方法:#注意力机制
👥 作者与机构
- YoungChae Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Da-Hee Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大语言模型驱动的音视频语音识别以带噪音频与视频为输入并输出转写文本,难点是声学不可靠时模型仍过度依赖音频而忽视视觉互补线索。方法第一步用同一冻结模型构造双条件对比分支,专家为完整音视频条件而业余者为去掉视频嵌入的纯音频条件,分别输出下一token对数概率以执行相减式对比解码。方法第二步提取末层末token对音频区的注意力,先计算相对音频能量与音频熵以度量聚焦强度与分散不确定性,再计算音视频与纯音频预测分布的归一化Jensen-Shannon分歧以度量双分支分歧位置。方法第三步将三路门控相乘得到可靠性权重w_t并形成有效强度λeff_t=w_t·λ后代入对比公式逐token调节干预,相较固定强度静态对比仅在三信号一致指示不可靠时增强纠偏从而兼顾重噪鲁棒与干净语音保真。在 LRS3 测试集 1327 句上,Llama-AVSR 8B 平均相对词错误率降低 9.95%,干净条件从 0.0095 降至 0.0082,-15 dB 从 0.3723 降至 0.3369。结论限于 MUSAN 等比混合噪声与 LRS3/LRS2 英语口语,未验证遮挡、混响或多语泛化。原文披露批量大小为 1 时贪婪解码单句延迟从 1577.9 ms 增至 1714.3 ms,增加 136.4 ms,涨幅为 8.6%,训练成本未披露,本工作无训练。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
611. 异构语音与文本候选无法直接比大小:用统一重排器把两路检索拼成一张表
英文题目:A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers
标签:#数据集构建 #LoRA #检索增强 #音频检索
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#检索增强
👥 作者与机构
- Inho Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Sumyeong Ahn:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理文本查询下同时检索语音库与文本库并生成答案的混合检索增强生成任务,难点在于异构检索器分数尺度不可比与音频文本相关性难以统一度量。方法分两阶段推进:第一阶段用模态专用检索器各取候选并经查询内Z分数归一化融合为标注池,再用基础音频大模型对池内候选打统一相关分以构造跨模态排序监督,纯文本候选回退到文本模型;第二阶段以自回归Yes与No词元对数差为相关分并用低秩适配微调学生重排序器。与共享嵌入空间的联合检索相比,该独立检索加后期融合与跨模态重排机制避免了模态鸿沟导致的一侧坍缩。在Spoken SQuAD混合设置下,ULTRAVOX生成器的EM为0.480,高于Z分数基线的EM 0.357。结论仅适用于短查询与TTS朗读式语音加网页文本的受控混合,面对自发语音、长时会议与真实噪声尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/fixie-ai/ultravox — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
612. 从 126 到 4017 种语言:规模质变如何让语音模型听见太平洋深层史
标签:#统计分析 #多语言 #语音 #语言识别
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语言识别 | 主方法:#统计分析
👥 作者与机构
- Minu Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Hoirin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- David R. Mortensen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为49种语言的自然语音,输出为语言间谱系与区域接触关系的层级结构,难点在于表层地理邻近与深层历史信号相互纠缠且传统比较法难以处理数千年尺度的声学趋同。方法链分四步:先用不同覆盖度的语言识别模型抽取帧级表征并双重平均为语言质心,再经标准化后做Ward层级聚类并以亚语族级谱系标签评估恢复度。接着用文件级自助法检验枝干稳定性,最后对太平洋-大洋洲-澳大利亚分组做维度级显著性检验与声学特征关联。与百级模型仅反映邻近接触不同,4K覆盖通过扩大语言多样性重塑表征几何并形成更集中的编码。在49语言聚类评测下,4K模型的调整兰德指数指标为0.74,高于1K基线的调整兰德指数指标0.47。该结论限于所选语种与录音集合,对未覆盖语系和跨通道泛化的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
613. 从说出有什么到指出何时发生:用确定性边界监督做音频细粒度定位
英文题目:AudioGround: Fine-Grained Temporal Grounding in Audio via Deterministic Boundary Supervision
标签:#指令微调 #音频大模型 #长音频处理 #音频检索
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频检索 | 主方法:#指令微调
👥 作者与机构
- Mingi Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Minchol Kwon:机构信息未能从会议 PDF 纯文本可靠映射
- Junyeong Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
当前大型音频语言模型能描述声音存在却难以输出可验证的起止时间,输入为未剪辑长音频与自然语言查询,输出为支撑答案的时间区间,难点在于长时压缩丢失边界且缺乏精确监督。本文构建AudioGround-IT合成流水线生成确定性边界,再用滑动窗口压缩保留时长可扩展的局部特征,接着以文本时间戳条件与连续绝对时间嵌入恢复全局位置,最后经由SALMONN解码出带时间戳的回答。与仅做粗粒度选择或依赖大模型推断时间戳的已有监督相比,该机制把四类问答统一为区间预测,迫使模型学习何时发生而非背诵文本模式。在Clotho-Moment基准条件下,零样本AudioGround的R1@0.5指标为27.47%,高于加正弦绝对时间嵌入变体的R1@0.5指标26.82%。该结论限于英文标题式查询与分钟级检索,合成拼接的静音间隙和语义过滤可能削弱对重叠混响真实场景的外推。原文未披露训练时长、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
614. 把典型语音改成带个人口误的构音障碍语音:基于 PPG 的音素编辑增强
标签:#数据增强 #言语障碍 #语音 #语音识别
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#数据增强
👥 作者与机构
- Tsai-Hsiu Ko:机构信息未能从会议 PDF 纯文本可靠映射
- You-Cyuan Jhuo:机构信息未能从会议 PDF 纯文本可靠映射
- Chung-Hsien Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍语音识别的输入为声学畸变严重且韵律不规则的病理语音,输出为词序列,难点在于数据极度稀缺、说话人内外部变异大以及特异性音素替代难以用全局声学变换模拟。该方法先由高保真发音后验概率提取器得到典型与障碍语音的音素序列并统计说话人相关的音素映射矩阵,再依据准确率与替代概率阈值对典型语音的PPG做目标音素概率分布交换以注入个性化误发,然后将编辑后PPG送入解耦音色与韵律的PPG到语音合成器并结合音素级时长扰动重建波形。对抗生成式增强仅改变整体频谱包络,而本工作直接改写音素级后验分布并保留帧级对齐,因而能复现元音与辅音类内替代等细粒度构音缺陷。在UASpeech以Block 2为测试集、HuBERT大模型微调并与生成对抗网络(Generative Adversarial Network,GAN)增强基线同量对比的条件下,总体词错误率(Word Error Rate,WER)为19.53%,相对基线21.88%降低2.35个百分点。该结论目前仅限于英语孤立词的说话人相关增强,未验证连续语音、跨语言或未见重度说话人的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
615. 词错率看不见的幻觉:把语音识别错误拆成四条可核对的维度
标签:#医疗音频 #基准设计 #模型评估 #语音 #语音识别
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Alkis Koudounas:机构信息未能从会议 PDF 纯文本可靠映射
- Moreno La Quatra:机构信息未能从会议 PDF 纯文本可靠映射
- Manuel Giollo:机构信息未能从会议 PDF 纯文本可靠映射
- Sabato Marco Siniscalchi:机构信息未能从会议 PDF 纯文本可靠映射
- Elena Baralis:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别的输入为连续语音信号,输出为逐词转写文本,难点在于生成式架构为追求流畅常捏造与音频无关但貌似合理的内容,而WER对所有替换一视同仁。SHALLOW(Speech HALLucination OvervieW)先将参考与假设转写对齐并计算词汇增删替比例以刻画无依据增生,再经Double Metaphone音形编码计算多距离以度量语音相似性,接着用依存图与语法检查量化结构与语法偏离,最后以多尺度窗口嵌入与句嵌入加NLI矛盾惩罚分别评估局部与全局语义漂移。与已有扰动检测或大语言模型(Large Language Model, LLM)分类工作相比,该机制差异在于不依赖易幻觉的LLM判官而用可解释的语言学与声学距离实现四维解耦。在覆盖12类架构的跨域评测中,Parakeet的语音维度得分为15.33,显著优于Whisper Large-v2的20.38,而两者WER差距不能揭示该声学保真差异。该结论适用于英文朗读、口音、儿童与噪声场景,在高WER下各维度与WER解耦因而更具诊断力,但尚未验证声调语言与低资源形态丰富语言。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
616. 要评出发音和声调错误,日语识别器为何不能只做听写
英文题目:Building Tailored Speech Recognizers for Japanese Speaking Assessment
标签:#教育 #CTC #模型融合 #多任务学习 #语音识别
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#多任务学习
👥 作者与机构
- Yotaro Kubo:机构信息未能从会议 PDF 纯文本可靠映射
- Richard Sproat:机构信息未能从会议 PDF 纯文本可靠映射
- Chihiro Taguchi:机构信息未能从会议 PDF 纯文本可靠映射
- Llion Jones:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
日语口语评估需要从语音直接输出带音高重音标记的片假名摩拉序列,难点是带人工重音标注的自发语音仅有Corpus of Spontaneous Japanese(CSJ)核心集23683条约45小时,而正字法数据约大10倍且通用识别器会将口误正则化为规范文本。首先可流式编码器加因果变换器同时预测音素字母(Phonetic Alphabet,PA)、文本字符(Text Tokens,TTs)与基频(fo)轨迹类别,使无重音标注语料也能训练共享表示。其次将PA与TT的联结时序分类(Connectionist Temporal Classification,CTC)后验转成混淆网络并去除空白符得到格子,再经基于UniDic的转换器(Finite-State Transducer,FST)把文本格子映射为第二路PA格子。最后对两路PA格子取并集并求最短路径得到融合解码,兼顾声学忠实度与词典约束。与仅核心集PA训练相比,该链条在CSJ三个核心评估集上将含重音的平均摩拉标签错误率从12.3%降至7.1%,其中7.1%对应融合外部域内TT-only文本格子的最优配置,纯自包含多任务加融合平均为7.9%。该结论限于日语摩拉加重音体系与词典覆盖词汇,对重度非母语口音与词典外错误尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/kyutai/mimi — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
617. 不只是判真假:用可扩展的原型注册追踪是哪一个模型合成的语音
英文题目:Who Synthesized This? Joint Deepfake Detection and Generative Source Attribution
标签:#对比学习 #LoRA #少样本 #语音伪造检测
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#对比学习
👥 作者与机构
- Vishal Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Vinayak Abrol:机构信息未能从会议 PDF 纯文本可靠映射
- Mathew Magimai Doss:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为单句待测语音,输出需同时给出真伪判决与架构族和具体合成器归属,难点在于神经声码器与扩散、流匹配新架构系统性抹除频谱伪影,且封闭集分类器对未见生成器会高置信误判。方法链分三阶段推进:先以 WavLM-Large 为骨干并仅在特征投影与注意力输出投影层插入秩为 8 的低秩适配器,冻结主体以保留掩码预测加去噪预训练表征;再以两阶段课程先分 LLM-Codec、扩散、流匹配、FastSpeech、VITS 等宽族后分族内具体模型,以动态可训练间隔的条件加性角度间隔 Softmax 拉开类间角度、以指数滑动平均维护中心的中心损失收紧类内分布;随后将已知类均值缓存为原型,新模型仅用支持样本均值注册入库;最后测试时用余弦最近原型同时输出族与模型标签,真分数取男性、女性、混合三个质心的最大值。与纯特征分类相比,差异在于把判别空间显式组织为族宏簇包含模型微簇的可扩展超球层级结构。在 ASVspoof 5 Track 1 开放条件上单系统取得 0.49% EER 和 0.09 minDCF,优于最强单系统 T31 的 5.56% EER 和最强集成 T45 的 2.59% EER,但 actDCF 为 0.97 明显差于 T27 的 0.13。该结论依赖 MLAAD v9 时序划分与性别三分真原型,对抗扰动、跨信道压缩与阈值校准尚未验证。原文未披露训练时长与推理延迟吞吐成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
618. 不用文字也能判仇恨吗:VINAYAKA 在双曲空间里对齐声音与画面
英文题目:VINAYAKA: Multilingual Audio-Visual Hate Speech Detection via Cross-Modal Fusion in Hyperbolic Space
标签:#内容审核 #多模态学习 #多语言 #音视频 #音频分类
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#多模态学习
👥 作者与机构
- Bhavinkumar Vinodbhai Kuwar:机构信息未能从会议 PDF 纯文本可靠映射
- Orchid Chetia Phukan:机构信息未能从会议 PDF 纯文本可靠映射
- Rajesh Sharma:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言音视频仇恨言论检测以原始语音波形与采样视频帧为输入,输出仇恨与非仇恨二分类,代码混合、语言切换与自动语音识别误差使文本线索不可靠。VINAYAKA先用冻结WavLM提取副语言韵律表征并用冻结ImageBind提取管状时空行为表征,再经卷积压缩与池化得到紧凑音视频序列。紧凑特征经原点处指数映射送入庞加莱球,以双曲测地距离计算双向交叉注意力权重,实现时间音频与对应视觉场景的结构化对齐。对齐后的双向表征经莫比乌斯加权聚合与莫比乌斯加法融合,再由对数映射返回欧氏空间经全连接分类,前步压缩输出进入对齐计算,对齐输出进入融合分类。与欧氏拼接、欧氏交叉注意力及单纯莫比乌斯加法不同,该设计在负曲率空间同时建模层级依赖与精确对齐,以更低失真刻画副语言与行为线索的层级结构。在HateMM域内评测设置下,VINAYAKA的准确率为.914,高于Möbius加法基线的准确率.883。跨数据集外推存在明显适用边界,HateMM训练模型在MultiHateClip中文上宏平均F1值仅.551,跨文化迁移依然受限。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
619. 发音方式一变,语音大模型的判断也跟着变:VQ-Bench 如何固定文本只动嗓音
英文题目:Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models
标签:#基准测试 #基准设计 #模型评估 #发声与构音 #语音情感识别
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音情感识别 | 主方法:#基准设计
👥 作者与机构
- Harm Lameris:机构信息未能从会议 PDF 纯文本可靠映射
- Shree Harsha Bokkahalli Satish:机构信息未能从会议 PDF 纯文本可靠映射
- Joakim Gustafson:机构信息未能从会议 PDF 纯文本可靠映射
- Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为相同文本与说话人下仅发声类型不同的语音,输出为语音基础模型Speech Foundation Models即SFMs的长文本回应与语音情感识别Speech Emotion Recognition即SER的情绪分布,难点在于剥离词汇与身份后度量细微喉源变化的社会偏见效应。方法链分四步推进:先以Buckeye与VCTK参考音经零样本合成与嗓音转换得到平行语料,再设计治疗与求职等四类开放式场景提示,然后用SFMs生成回应并交由大模型裁判打分,最后用累积链接混合模型与贝叶斯多层模型分离发声与性别效应。与已有多项选择评测相比,该机制差异在于保留生成式行为并检验时间分布线索如句末嘎吱的语用功能,具有生态效度。在语音情感识别任务的Buckeye语料评测设置下,Breathy嗓音的Fearful情绪对数几率变化指标为-1.21,低于Creaky嗓音的Fearful情绪对数几率变化指标-0.94。结论仅适用于美式英语合成平行语料与所测模型族,向自然病理嗓音与非二元性别的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
620. 把多人混音当作续写来生成:LlaSep 在离散 token 上一次解码出多路语音
标签:#数据集 #自回归模型 #语音 #语音分离
评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#自回归模型
👥 作者与机构
- Luca A. Lanzendöerfer:机构信息未能从会议 PDF 纯文本可靠映射
- Constantin Pinkl:机构信息未能从会议 PDF 纯文本可靠映射
- Florian Grötschla:机构信息未能从会议 PDF 纯文本可靠映射
- Roger Wattenhofer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道语音分离以单麦克风混合波形为输入,需同时输出每位说话人的干净波形与说话人活动区间,重叠语音、话轮快速切换与长静音交替使连续掩码易产生跨说话人泄漏与虚假声道。所提LlaSep先用XCodec2将混合与单人源统一离散为每秒50帧、词表65536的整数令牌,同时用冻结Whisper-small编码器提取语义嵌入并经线性投影映射到语言模型隐维度。两类表征以前缀条件拼接后送入LLaSA-1B-Multilingual因果解码器,按起始时间排序自回归生成最多4路说话人令牌流。生成的令牌流再由XCodec2解码器逐流重建为时域波形,完成从混合条件到多路干净语音的端到端生成。与掩码滤波和MixIT源估计不同,该路线逐令牌从零生成而非保留输入波形,天然支持可变说话人数并绕开置换不变训练与固定通道约束,还以生成式解码保证感知清洁度。在LibriCSS基准下,LlaSep的diarization error rate为23.43%,低于PixIT的diarization error rate 32.65%。结论边界在于训练全为合成对话且评测多为8秒切块,对长时、强混响与真实多语言重叠的外推尚未验证,生成内容保真依赖编解码器与令牌准确率。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
621. 跨语言时说话人向量为何混入语言信息:以对抗与合成扩增做解耦
英文题目:Language-Invariant Multilingual Speaker Verification for the TidyVoice 2026 Challenge
标签:#对抗训练 #数据增强 #跨语言 #多语言 #说话人验证
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#说话人验证 | 主方法:#对抗训练
👥 作者与机构
- Ze Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoxiao Miao:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言说话人验证输入为注册与测试语音对,输出为是否同人的判定分数,难点在于跨语言时说话人嵌入纠缠语言特性且单人多语言数据稀缺。本文先以大规模多语言自监督w2v-BERT 2.0为骨干提取多层表征,经层适配器降维适配后拼接并由注意力统计池化聚合得到说话人嵌入,再以梯度反转的语言分类器对抗训练迫使嵌入遗忘语言信息。随后用多语言零样本语音合成Qwen3-TTS为每位说话人扩充多语言语音覆盖,所合成嵌入与真实嵌入共同参与不变性学习,其输出进入ArcFace或SphereFace2监督训练。与仅微调骨干的方案相比,关键机制差异在于显式以对抗梯度抑制语言可预测性而非依赖数据多样性隐式泛化,其实质意义是解耦说话人与语言变异以提升跨语言鲁棒性。在tv26 dev评测设置下,w2v-BERT 2.0 Based模型的EER为2.740%,低于官方基线的EER3.07%。该结论适用边界限于TidyVoice 2026划分的已见语言与38种未见语言场景,在数据充足时合成数据受限未带来增益且未见语言性能明显恶化,跨域外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
622. 以静音为锚:用分层加权转向把音频幻觉拉回声音证据
标签:#测试时自适应 #音频大模型 #可解释性 #音频问答
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#测试时自适应
👥 作者与机构
- Tsung-En Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Kuan-Yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型(Large Audio-Language Model, LALM)在音频问答(Audio Question Answering)中常忽视声学证据而幻觉出不存在的事件,输入为音频加文本问题、输出为是否接地的回答,难点在于语言先验压制稀疏声学线索。方法链分三步:先以等时长静音音频构造负例,与真实音频做末端词元(final-token)残差流相减得到声学方向向量;再用该向量与各层隐状态的余弦相似度加Cohen’s d效应量探测正确组与幻觉组的层级分离,定位高影响深层;最后按探测结果把干预能量从浅层与输出层搬移到中间深层并保持总能量守恒。与纯文本对照向量相比,该声学锚定设计迫使模型关注声音存在性而非语言关联。在Audio Hallucination QA上Gemma召回率从53.4%提升至69.0%,Total F1从55.0%提升至61.9%;在MMAU Test上Qwen准确率从54.8%提升至59.2%。结论仅在二选一与单字母选择题判别任务上验证,未验证开放式字幕、对话与长音频外推。原文未披露训练、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
623. 三路不对齐时先对齐再融合:LMPAN 用轻量多路径校准保住双讲语音
标签:#注意力机制 #端侧运行 #回声消除 #全双工语音交互 #语音增强
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#回声消除 | 主方法:#注意力机制
👥 作者与机构
- Chengwei Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Shaofei Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyin Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaotao Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Zheng Xue:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
全双工语音对话中的联合回声消除与噪声抑制需从麦克风信号中恢复近端语音,难点在于硬件非线性、时变延迟与能量失配会破坏参考信号与麦克风信号的融合。本文提出轻量多路对齐网络,先以子带时延估计加归一化最小均方线性回声消除粗抑线性回声,再用三路软对齐校正参考信号、麦克风信号与线性回声消除输出之间的时延与幅度偏差。随后以增强网络分别提纯麦克风与线性回声消除支路并经注意力掩码自适应融合,最后经后滤波与残留缩放缓解过抑制。相比隐式对齐的端到端基线,该设计用显式软延迟分布与双流融合降低对单一线性回声消除支路的依赖。在AEC Challenge 2023盲测集评测下,LMPAN的MOSavg得分为4.49,高于DeepVQE的MOSavg得分4.40。结论受限于单通道16kHz英语为主的回声加噪场景,尚未验证多麦克风、强混响与多语言外推,动态目标策略会轻微牺牲回声抑制强度。该模型计算量为0.48M参数与126M MACs,原文未披露训练硬件、训练时长与端侧实测延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
624. 野外西班牙语病理语音为何难识别:S-DiverSe 用 3.2 小时揭示微调不如文本后处理稳健
标签:#数据集 #数据集构建 #言语障碍 #语音 #语音识别
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据集构建
👥 作者与机构
- Fernando López:机构信息未能从会议 PDF 纯文本可靠映射
- Fernando Ibañez:机构信息未能从会议 PDF 纯文本可靠映射
- Ana Martínez:机构信息未能从会议 PDF 纯文本可靠映射
- Iván Alonso:机构信息未能从会议 PDF 纯文本可靠映射
- Pablo Gómez:机构信息未能从会议 PDF 纯文本可靠映射
- Santosh Kesiraju:机构信息未能从会议 PDF 纯文本可靠映射
- Jordi Luque:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
病理语音识别需将构音受损、韵律异常且混有噪声音乐的野外西班牙语访谈转写为文字,输入为可变长野外音频、输出为正字法文本与性别疾病可懂度标签,难点是声学域异构与可懂度跨度大。方法链第一步用西班牙语关键词检索YouTube访谈与纪录片候选,经自述诊断加感知筛查保留视频,第二步按说话轮次与语义连贯切分片段并交由母语标注者做保留填充词与<unk>的转写与交叉复核,第三步将转写结果输入基线评测与启发式后处理及微调对比,使文本层纠错与声学适配衔接验证。与医院内控的GITA和NeuroVoz相比,关键差异是保留自发访谈、背景干扰与三病因覆盖,其实测意义是暴露实验室指标向野外泛化的落差。在S-DiverSe上商用Scribe v2总体词错误率(Word Error Rate,WER)20.69%显著优于开源最优omniASR CTC 1B v2的33.56%,启发式文本后处理(Post-processing,PP)将Whisper-large-v3从36.43%降至22.01%、Voxtral-Mini从40.43%降至23.73%。结论仅适用于西班牙语野外神经病理语音评测,不可外推为临床诊断或跨语种适配规律。在S-DiverSe基准下,Scribe v2的WER为20.69%,低于omniASR CTC 1B v2的WER 33.56%。该结论适用边界受限于野外评测场景尚未验证临床诊断外推,硬件上实验在2块A100-SXM4-40GB上贪婪解码运行推理开销未计API费用。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
625. 没有配对语音时,用对齐过的伪音频提示让大模型做跨域语音识别
标签:#领域适应 #大语言模型 #语音 #语音识别
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#领域适应
👥 作者与机构
- Ryo Magoshi:机构信息未能从会议 PDF 纯文本可靠映射
- Takashi Maekaku:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Shinohara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
基于大语言模型的语音识别以音频提示为条件解码文本,当目标域仅有文本时,适配阶段缺失声学上下文,会在推理重新引入音频提示时产生模态失配,难点在于仅用文本合成与真实提示分布一致的训练信号。TE2SL先将目标文本词嵌入上采样至音频提示帧长实现时间对齐,其输出进入由Conformer编码器与线性层组成的精炼模块以映射到音频提示隐空间,该模块在源域配对数据上以帧级均方误差拟合音频编码器与投影器输出。精炼后的伪音频提示再经时域掩蔽正则化后与指令拼接输入大语言模型进行目标域微调,使上一步的分布对齐结果直接作为解码条件。与仅启发式上采样掩蔽相比,该机制显式建模了音频编码器与投影器管线的输出特性,因而兼顾样本相关性与架构感知,具有跨语言可扩展的实际意义。在LibriSpeech到SPGISpeech的跨域适配评测任务下,TE2SL的WER为8.5%,低于Upsample-and-Mask基线的WER 9.1%。该结论仅在朗读到金融电话会议和讲演等有限域移下验证,对强口音噪声及未见编码器的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
626. 先转写哪一段:Easper 用会话级排序证明重复比干净更重要
英文题目:Easper: An Accessible ASR Pipeline for Language Documentation
标签:#开源工具 #SFT #低资源 #语音识别
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#SFT
👥 作者与机构
- Aso Mahmudi:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Ekaterina Vylomova:机构信息未能从会议 PDF 纯文本可靠映射
- Nick Thieberger:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语言文档的输入是野外长录音与ELAN语言学标注工具制作的稀疏转写,输出是可回写ELAN的分说话人全文转写,难点在于语言学家缺工程能力且冷启动时不知先转写哪些会话。Easper先由数据集生成器解析ELAN并校验长标注与重叠后导出十六千赫兹切分与词表统计,该切分与统计进入云端对Whisper-small语音预训练模型做监督微调。微调所得模型下发至离线端完成说话人分离标注与切分识别并回写ELAN分层,形成可迭代的人机闭环。与Elpis语言学工具等本地Kaldi方案不同,该工作坚持云训练与中央处理器离线推理分离及会话不可分的田野约束,免去了本地图形处理器与代码操作。在Bislama与Nafsan三十分钟测试集及Nguna十分钟测试集评测下,ToTy优先策略的字符错误率为20.0%,低于随机基线的字符错误率40.0%。结论适用边界受限于三语小规模Whisper-small全量微调与十分钟至三十分钟测试集,尚未验证大规模档案与其他架构的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
627. 当词错误率把合法连写判错:SCRIBE 用分类误差向量补上印度语丰富转写缺的诊断信号
英文题目:SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR
标签:#基准测试 #评测协议 #多语言 #语音 #语音识别
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Kavya Manohar:机构信息未能从会议 PDF 纯文本可靠映射
- Arghya Bhattacharya:机构信息未能从会议 PDF 纯文本可靠映射
- Kush Juvekar:机构信息未能从会议 PDF 纯文本可靠映射
- Kumarmanas Nethil:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为印度语口语音频与候选转写,输出为带标点、标准数字与领域实体的富转写文本,难点在于黏着语中合法连音合词会触发一对一对齐级联错位并掩盖真实错误类型。类型化切分先将参考与假设标为词素、数字、标点与领域实体并屏蔽领域词,其输出的带类型序列进入弹性对齐,弹性对齐用扩展动态规划在匹配与插入删除之外允许一对二与二对一连音映射并校验语音合理性。分类聚合接收对齐后的类型化编辑操作,按统一分母输出词法、标点、数字与实体错误向量及其加和的SCRIBE-WER,从而把单一标量变为可修复的分类反馈。相对传统整体指标的关键差异在于保留变音符号的归一化与连音容忍对齐,使形态合并不再计为词汇失败,具有定位修复方向的实际意义。在Malayalam Legal基准下,SCRIBE-ASR的WER为44.52,低于IndicWhisper的WER 54.74,表明虚高主要来自形态结构与对齐方式。该结论限于印地语、卡纳达语和马拉雅拉姆语的朗读与通用语料微调场景,长尾自发语音与跨语系外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
628. 噪声下对话系统该说长还是说短:自然语法句为何同时帮到机器和人
标签:#人类参与评测 #言语感知 #语音识别 #语音可懂度评估 #文本到语音
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#人类参与评测
👥 作者与机构
- Lubos Marcinek:机构信息未能从会议 PDF 纯文本可靠映射
- Jonas Beskow:机构信息未能从会议 PDF 纯文本可靠映射
- Joakim Gustafson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为待合成的系统回应文本与环境噪声条件,输出为在噪声下可被机器与人类可靠转写的语音,难点在于简化直觉与语言模型约束效应方向相反,过度简化反而削弱可预测性。方法先用大语言模型生成同命题五级复杂度语料并以可读性指标校验单调性得到受控文本,再经两种文本到语音系统合成并与多环境噪声按多档信噪比混合得到退化语音。最后将退化语音分别送入自动识别与人类听写两条通路计算词错误率,使机器与人类结果可直接比较。与已有噪声自适应工作相比,关键差异是不调节音高语速响度或对话策略,而是直接检验语言形式本身的适应价值,意义在于给出噪声下是否应简化改写的设计原则。在覆盖两种TTS系统、两种ASR模型、12种噪声与7档信噪比的评测设置下,自然语法句L3的WER为26.9%,低于电报式L1的WER 47.5%。结论边界是英语朗读式短对话、加性噪声与中高信噪比部署区,混响、长篇交互与跨语言外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
629. 缺觉能不能从朗读声里听出来:用可解释小特征同时估计剥夺状态与症状
标签:#语音生物标志物 #统计分析 #公平性 #可解释性 #病理语音评估
评分:6.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Vincent P. Martin:机构信息未能从会议 PDF 纯文本可靠映射
- Jean-Luc Rouas:机构信息未能从会议 PDF 纯文本可靠映射
- Pierre Philip:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为法语朗读语音,输出睡眠剥夺状态及客观嗜睡、主观嗜睡、疲劳与警觉绩效损失共6个二分类标签,难点在于个体差异大、主观标签噪声高且易与年龄性别混淆。方法链分为四步:先用无监督鲁棒语音活动检测切分长录音为20秒以上韵律完整片段,再并行提取可解释声学特征,接着以嵌套分层分组交叉验证训练浅层分类器并多数投票到录音级,最后用可解释性与症状网络反推模型学到的是任务特异还是跨症状构念。与基础模型加深度学习范式不同,该工作刻意坚持传统特征加浅层模型以换取可比性、低能耗与偏倚可审计性。在SOMVOICE语料录音级交叉验证任务下,睡眠剥夺分类的UAR指标为0.744,高于MSLT分类的UAR指标0.706。结论仅适用于健康法语成人朗读场景,未验证自发对话、跨语言、临床嗜睡人群与纵向监测的外推能力。全部三套特征分类加SHAP解释共耗电0.450 kWh,约折合8.55 g二氧化碳,未计入设备制造生态成本。
🔗 开源资源
- 代码相关资源:https://github.com/vincentpmartin/Interspeech2026.SOMVOICE.classification — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
630. 同一说话人被语言拆散时,在任务层面把语言先对齐的 L-Proto
英文题目:L-Proto: Language-Aware Episodic Prototypical Training for Multilingual Speaker Verification
标签:#元学习 #跨语言 #多语言 #说话人验证
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#元学习
👥 作者与机构
- Hyung-Seok Oh:机构信息未能从会议 PDF 纯文本可靠映射
- Deok-Hyeon Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Seung-Bin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Seong-Whan Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言说话人验证需判断两段语音是否同属一人,难点是说话人身份与语言相关的音素和韵律纠缠,导致同人在不同语言下形成子簇而跨语言试验退化。L-Proto 先按语言标签维护流式 utterance 缓冲,仅当同语言内就绪说话人数达到阈值才采样 P 人每人 K 条构成单语言情节,再由编码器提取嵌入并计算支持集均值原型与查询的余弦相似度,最后以全局分类损失联合情节交叉熵优化。与随机混合语言情节相比,该机制把语言变异从情节内局部判别中隔离,使原型估计聚焦说话人差异而保留跨迭代多语言覆盖。在 TidyVoice Challenge 开发集上 SimAM-ResNet100 总体等效错误率从 3.48% 降至 1.18%,跨语言目标试验 D/S 条件下从 5.58% 降至 2.01%。该结论仅在约 40 种语言的 TidyVoiceX 微调与开发集划分下验证,依赖语言标签与每语言足够说话人多样性,对极低资源语言和官方评测集外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
631. 先用全部伪标签再用人工标注:北萨米语小模型的一次伪标签迭代
英文题目:Two-stage semi-supervised learning with pseudo-labels: A case study on Northern Sámi ASR
标签:#知识蒸馏 #半监督学习 #低资源 #语音识别
评分:6.3/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#半监督学习
👥 作者与机构
- Priyanshi Pal:机构信息未能从会议 PDF 纯文本可靠映射
- Yaroslav Getman:机构信息未能从会议 PDF 纯文本可靠映射
- Kristiina Ojala:机构信息未能从会议 PDF 纯文本可靠映射
- Tamás Grósz:机构信息未能从会议 PDF 纯文本可靠映射
- Mikko Kurimo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
北萨米语自动语音识别(Automatic Speech Recognition,ASR)需将议会录音与播客等声学输入转写为文本,黏着形态、复合词切分、方言变体与挪威语、瑞典语、英语代码切换使词错误率(Word Error Rate,WER)失真且标注稀缺。作者先用317M参数大教师模型为75小时无标注议会语音生成硬伪标签(Pseudo-Labeling,PL),再让95M参数小学生模型在伪标签上预微调,最后在20小时人工标注(Human-Labeled,HL)数据上校准,形成伪预训练到真值校准的方法链。该链条与混合训练的关键机制差异在于隔离冲突监督,避免伪分布与真值分布在同一批次内相互干扰。相比20小时人工基线,两阶段全量伪标签方案在282utt测试集上将字符错误率(Character Error Rate,CER)从10.09%降至6.73%,方向为显著下降,在1小时YLE播客集上从11.40%降至8.89%。结论限于单轮无语言模型(Language Model,LM)的北萨米语议会及播客域,罕见字符与跨语言借词仍恶化且未验证多轮迭代外推。训练成本方面论文披露单卡NVIDIA V100 32GB上每轮约18小时至20小时,推理与部署成本未披露。
🔗 开源资源
- 模型相关资源:https://hf.co/GetmanY1/wav2vec2-base-sami-22k → https://huggingface.co/GetmanY1/wav2vec2-base-sami-22k — 暂时无法访问
- 模型相关资源:https://hf.co/GetmanY1/wav2vec2-large-sami-22k → https://huggingface.co/GetmanY1/wav2vec2-large-sami-22k — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
632. 编解码器压坏水印不是擦除而是压皱:先复原频谱再提取
英文题目:Countering Neural Audio Codec Distortions in Watermarking with Adaptive Restoration
标签:#CNN #混合专家模型 #音频修复 #音频水印
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频水印 | 主方法:#混合专家模型
👥 作者与机构
- Sungho Park:机构信息未能从会议 PDF 纯文本可靠映射
- Thien An Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
神经音频编解码器压缩后的音频水印提取面临结构化非线性失真,输入为压缩音频输出为水印比特,难点在于残差向量量化抹掉了嵌入依赖的细粒度频谱结构且各编解码器失真异构难以统一泛化。该框架先将压缩音频经短时傅里叶变换转为幅度谱,再由轻量分类器识别编解码器类型并路由到专用修复模型,接着用ConvNeXt增强的九阶段U-Net重建近似压缩前水印谱,最后送入未改动的Timbre解码器做时间池化提取。与重训嵌入器或训练通用去噪器不同,该方法把问题定义为仅在验证阶段生效的谱预修复并用专家分治隔离异构失真,因而无需改动现有水印系统即可扩展新编解码器。在LJSpeech测试划分上EnCodec在6 kbps条件下逐比特准确率从59.00%提升至84.05%,在DAC 8 kbps条件下恢复至99.58%,在FunCodec 16 kbps条件下恢复至98.03%。该结论仅适用于保留残差痕迹的多码本残差向量量化体制,单码本极低码率下信息瓶颈导致修复失效。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
633. 用自然背景声做通用扰动:NaVo 如何兼顾防克隆与可听性
标签:#扩散模型 #LoRA #隐私保护 #语音克隆
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音克隆 | 主方法:#扩散模型
👥 作者与机构
- Seoyoung Park:机构信息未能从会议 PDF 纯文本可靠映射
- Seungmin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Sohee Park:机构信息未能从会议 PDF 纯文本可靠映射
- Dain Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Thien An Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
- Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Daeseon Choi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对仅需数秒语音即可复刻身份的语音克隆(Voice Cloning)威胁,发布前主动防御需破坏说话人编码器提取且不损伤听感。NaVo以文本到音频潜在扩散骨干AudioLDM2为生成器,按性别与雨滴、群杂、办公室、音乐等声学类别划分多个低秩适配模块,单次前向生成通用对抗音频(Universal Adversarial Audio,UAA)后与原始语音按固定信噪比直接混音输出受保护音频。训练联合优化去噪扩散损失与分布目标损失,后者将混合语音嵌入的批量高斯推向预先统计的异性高斯,以Bhattacharyya距离同时对齐均值与方差,从而实现无需逐样本梯度优化的通用保护。与逐样本加波形扰动的优化式防御不同,该机制把扰动变为语义化背景声,兼顾隐蔽性与可迁移性。在未见数据集评测设置下,NaVo的DSR指标为78.0%,高于Enkidu的DSR指标25.2%。该结论限于英语为主的多数据集短句、17 dB固定混音与固定验证阈值,音乐风格在男性ElevenLabs条件下最低跌至32.9%,未验证强声源分离、重录制、跨语言与长时对话稳定性。上述结论的适用边界仍受限于固定混音与阈值协议。原文未披露优化器、学习率、LoRA秩、损失权重与推理延迟。原文未披露训练、推理或部署成本
🔗 开源资源
- 第三方资源:https://github.com/resemble-ai/Resemblyzer — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
634. 数据很少、听众很少时怎么做 TTS:SGILE 的高效建声与高效评测
英文题目:Two Lessons Learned from the SGILE project: Efficient Building and Evaluation of TTS Voices
标签:#教育 #开源工具 #主观评测 #低资源 #文本到语音
评分:6.3/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#文本到语音 | 主方法:#主观评测
👥 作者与机构
- Aidan Pine:机构信息未能从会议 PDF 纯文本可靠映射
- Korin Richmond:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向资源匮乏语言的语音合成任务,输入为仅数小时的语音音频与有限文本,输出为可支持原住民语言教学的高质量语音,难点在于数据稀缺、可用听众极少且建声者多为非语音专业人员。方法链分为三步:先用开源 EveryVoice 语音合成工具包(EveryVoice TTS Toolkit)以适度算力与数据从零建声,再由网页应用组织多语言、多数据量样本的非正式听测,最后用最优最劣量表(Best-Worst Scaling,BWS)采集偏好并可视化个人与群体结果。与常规平均意见分(Mean Opinion Score,MOS)和强制选择 AB 测试相比,BWS 每次呈现 4 个刺激并选出最优与最劣,可由 2 次点击导出 5 组配对偏好,机制差异在于以更少试听换取更多排序信息。在获取5组配对偏好的听测评测设置下,BWS的试听音频指标为4个音频样本,低于AB评测的试听音频指标10个音频样本。原文未披露训练、推理或部署成本。结论仅适用于演示场景的感知体验与工具推广,尚未验证教学效果与小听众统计稳健性。
🔗 开源资源
- 代码相关资源:https://github.com/EveryVoiceTTS/EveryVoice — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
635. 真类概率塌向两端时,用排序与距离重建词级置信度
标签:#评测协议 #鲁棒性 #多语言 #语音 #语音识别
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Nagarathna Ravi:机构信息未能从会议 PDF 纯文本可靠映射
- Madduri Aiswarya Lakshmi:机构信息未能从会议 PDF 纯文本可靠映射
- Ragesh M:机构信息未能从会议 PDF 纯文本可靠映射
- Rajalakshmi Elangovan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别词级置信度估计需为已解码词输出反映部分正确程度的校准分数,但最大类概率因过自信而失效,二值目标把部分正确词一刀切为错误,时序连续目标依赖强制对齐而传播误差,真类概率在大词表下趋近于0而退化为二值。论文提出排序距离目标RanD,先对参考与假设做词级编辑对齐得到正确、替换、插入标记,对正确与替换词对再建立词元级对齐以确定监督位置。接着由每步后验分布计算真值词元的归一化排序分与预测分布到独热分布的归一化欧氏距离分,加权平均为词元分后在词内平均得到词级监督信号。对应四种架构分别冻结语音识别模型并抽取词级聚合嵌入训练轻量置信度估计模型,以编码器与解码器状态聚合为输入并输出词置信度。与真类概率和时序相似度目标不同,排序分随真值排序平滑下降避免坍缩为二值,距离项刻画分布不确定性且无需强制对齐,因而更具判别性与校准性。在KB数据集评测设置下,RanD的AUROC为0.8669,高于TeLeS的AUROC 0.8155。适用边界是仅对已预测词打分而不处理漏检的删除错误,低资源下表示质量不足时效果尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
636. 把说话人确认改写成问答:音频大模型能学会听出是不是同一个人吗
英文题目:Adapting Audio Large Language Models for Speaker Verification
标签:#LoRA #音频大模型 #零样本 #音频问答 #说话人验证
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#LoRA
👥 作者与机构
- Yiming Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Xuenan Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Baoxiang Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证要求输入注册与测试两段语音并输出是否同人判定,难点在于性别年龄相同、设备距离方言失配及短时长下的细粒度区分。作者先将音频大语言模型零样本能力转化为音频问答,对比分离输入、直接拼接、拼接加1秒静音间隔、波形叠加混合四种双语音提示组织方式并筛选最优拼接策略进入微调。接着以混合离散音频Token与连续Whisper特征的Kimi-Audio-7B-Instruct为基座,用基于性别年龄语言设备距离方言时长场景属性的规则难样本采样构造训练对并以低秩适配完成有监督微调。最后将文本相关验证扩展为同时判定说话人与文本内容是否一致的联合问答,利用模型原有语音识别能力实现统一推理。与传统嵌入模型的关键机制差异在于用自回归文本生成替代向量相似度打分,并从输出词元`One`与`Two`的非归一化Logit经Softmax反推验证分数。在3D-Speaker距离维度上微调模型等错误率为20.20%,而在短于2秒的CNCeleb子集上达到19.10%并略优于所对比的传统基线。结论仅适用于所构造的中英文公开评测划分,跨噪声、跨远场与开放集阈值下的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/XiaomiMiMo/MiMo-Audio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
637. 主导语言挤占更新方向时,如何用均衡投影守住多语低资源记忆
英文题目:Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR
标签:#持续学习 #低资源 #多语言 #语音识别
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#持续学习
👥 作者与机构
- Ziang Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Guodong Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Yuchen Ai:机构信息未能从会议 PDF 纯文本可靠映射
- Kaize Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Wei-Qiang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言低资源自动语音识别(Automatic Speech Recognition,ASR)需在Whisper等基础模型上顺序适配新语言,输入为多语种语音,输出为对应转写,难点在于共享表示下新旧语言梯度冲突导致灾难性遗忘且主导语言会扭曲优化方向。所提统一梯度投影(Unified Gradient Projection,UGP)先从各历史语言等量采样构造语言均衡参考梯度,为整体约束提供无偏估计。再检测当前梯度与参考梯度的内积符号,若冲突则将其投影到参考梯度的正交补空间以消除干扰分量,该投影输出直接作为参数更新方向。最后与均衡经验回放(Experience Replay,ER)的混合目标联合优化,以兼顾数据层校正与方向层约束。与随机回放近似约束的平均梯度情景记忆(Averaged Gradient Episodic Memory,A-GEM)相比,关键差异在于按语言等权估计整体约束,避免了回放分布不均衡带来的稳定性偏斜。在东南亚核心集评测设置下,UGP的平均词错误率(Word Error Rate,WER)为9.80%,低于标准ER的平均词错误率(Word Error Rate,WER)11.81%,且UGP的遗忘词错误率(Forgetting WER,FWER)为0.04%,低于标准ER的遗忘词错误率(Forgetting WER,FWER)4.11%。该结论限于FLEURS与CommonVoice构成的9个目标语种和7个历史语种,未验证无关语系大规模连续任务与在线流式场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
638. 只用母语语音学发音:离散单元惊异度如何替代标注与对齐
英文题目:Light-weight Pronunciation Assessment via Discrete Speech Token Surprisal
标签:#自监督学习 #向量量化 #低资源 #语音质量评估
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#自监督学习
👥 作者与机构
- Syeda Faiza Ahmed Sara:机构信息未能从会议 PDF 纯文本可靠映射
- Shammur Absar Chowdhury:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
发音评估(Pronunciation Assessment)需在无学习者标注时,仅凭学习者语音与可选朗读文本输出 utterance 级质量分,难点是音素对齐与误读标签昂贵且跨口音脆弱。该方法先用冻结自监督编码器加 K 均值码本将语音离散化,再用母语三元 Token 语言模型(Token Language Model,TLM)计算惊异度(Surprisal)统计量刻画语音偏离,文本可用时由字符编码器预测规范单元序列并以动态时间规整(Dynamic Time Warping,DTW)对齐得到距离与失配特征,最后经 Ridge 回归融合打分。离散化采用 HuBERT 第 9 层表示与 512 类 K 均值码本,码本与三元模型均只用 LibriSpeech 母语语音训练,惊异度以标准差捕捉局部尖峰。与强制对齐的 goodness of pronunciation(GoP)与掩码恢复零样本方法不同,它完全避开音素集与对齐器,在同一离散空间比较预期与实现。在 SpeechOcean762 测试集上,音频加文本融合达到准确度 PCC 0.661,明显高于纯音频与既往零样本基线。该结论限于英语朗读场景,依赖参考文本与母语先验匹配,自发对话与非英语尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
639. 少即是多:语调与静音决定轮次结束,文本反而增加抢话
英文题目:Less can be More: What Aspects of Speech Drive End-of-Turn Detection
标签:#多模态学习 #流式处理 #语音 #轮次切换
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#轮次切换 | 主方法:#多模态学习
👥 作者与机构
- Rini Sharon:机构信息未能从会议 PDF 纯文本可靠映射
- Manickavela A:机构信息未能从会议 PDF 纯文本可靠映射
- Kadri Hacioglu:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Stolcke:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
话轮结束检测需在流式语音中逐帧判断说话人是否交出话轮,难点在于区分犹豫停顿与真实结束,过早打断与过晚响应都会损害交互体验。本文构建三模态流式检测器,先由冻结声学编码器、手工韵律提取器与运行中转写语义编码器分别输出帧级表征,再经投影与因果时序卷积对齐到统一帧率后拼接融合输出每帧结束概率。该工作用零向量屏蔽失活模态并对每种组合独立重训以保持容量一致,再辅以特征空间可分性分析解释模态贡献。与直接堆叠更多模态不同,该受控消融揭示语义连续融合会在轮中句法完整处引发误触发,而韵律静音与基频变化提供互补精度。在5000条电话对话测试集下,声学加韵律组合的话语级F1指标为0.930,高于声学单模态的F1指标0.927。该结论仅在英语双人电话域内验证,噪声、低资源语言或短指令场景下文本是否仍有害尚未验证。部署方面声学加韵律组合中位延迟为400 ms,文本分支引入30-60 ms推理开销,评测使用NVIDIA A10G硬件。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
640. 动作做对不等于想对:CoDeTT 把轮次抢答拆成意图诊断
英文题目:CoDeTT: A Context-Aware Decision Benchmark for Turn-Taking Evaluation
标签:#数据集 #基准设计 #多语言 #轮次切换
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#轮次切换 | 主方法:#基准设计
👥 作者与机构
- Huan Shen:机构信息未能从会议 PDF 纯文本可靠映射
- Yingao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shangkun Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Zou:机构信息未能从会议 PDF 纯文本可靠映射
- Yunzhang Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
轮次切换评测需要在多轮对话历史与系统状态条件下,在维持说话(Maintain)、停止倾听(Stop & Listen)、接管发言(Takeover)与忽略输入(Dismiss)之间做决策,难点是表面动作相同但交际意图迥异,例如思考停顿与环境噪声都应维持发言。CoDeTT 先以系统状态(SystemSpeaking/SystemIdle)与决策策略构建 14 场景层级分类体系界定诊断空间,再经生成与自动裁判、多音色合成与识别校验、声景混合与真实语料锚定形成 18000 例、中英双语、每例 5 轮历史的评测集,最后采用动作级与意图级两阶段漏斗协议统一比较异构模型,并以语义错配率(Semantic Misalignment Rate, SMR)揭示推理偏差。与只看是否发声的功能性基准相比,该机制区分了动作正确但原因错误的幸运猜对。在中英文评测中,Gemini3-Pro 四动作平均准确率约 81.58%(中文 H=3)与 81.91%(英文 H=3),领先同类全模态基线约 10 个百分点,并在意图层保持约 15%至30% 的低错配率,但其忽略类仍是最弱环。结论仅适用于离线分类式受控合成与半真实混合场景,未验证实时延迟、重叠语音与多人在线交互表现。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/collections/videosdk-live/namo — 链接不可用(HTTP 404)
- 第三方资源:https://huggingface.co/KE-Team/KE-SemanticVAD — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
641. 用显式局部几何探针引导声场:MiNAF 如何从粗网格生成高保真 RIR
英文题目:Explicit Context-Driven Neural Acoustic Modeling for High-Fidelity RIR Generation
标签:#时频分析 #空间音频 #房间脉冲响应估计
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#房间脉冲响应估计 | 主方法:#时频分析
👥 作者与机构
- Chen Si:机构信息未能从会议 PDF 纯文本可靠映射
- Qianyi Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Chaitanya Amballa:机构信息未能从会议 PDF 纯文本可靠映射
- Romit Roy Choudhury:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
房间脉冲响应生成需从发射器位置、接收器位置与朝向预测任意收发对的时域脉冲响应,难点是混响尾部对局部几何与材质敏感且相位存在2π缠绕。MiNAF对每个查询点在单位球上按斐波那契格采样N个均匀方向并做射线与粗糙网格求交,提取首击点距离向量、首击面法线、邻域距离均值与标准差及多阈值占用计数并经非线性投影压缩为上下文矩阵。该上下文矩阵与正弦位置编码后的收发坐标拼接形成融合上下文,再用正弦时间编码逐列调制以区分不同谱列的时间特性。调制后特征输入两个结构相同的多层感知机分别预测对数幅度谱列与瞬时频率谱列,最后经逆短时傅里叶变换合成波形。与依赖全局图像或可学习隐网格的方法不同,该方法把可解释的局部距离分布显式输入模型。在SoundSpaces评测下,MiNAF(GLim)的T60指标为1.59%,低于NeRAF的T60指标2.04%。该结论适用边界受限于场景内拟合与合成RIR评测,尚未验证跨房间泛化与真实测量RIR,且50cm级网格畸变下训练不收敛。推理开销方面,批量256时端到端生成需5.24秒,所用硬件为NVIDIA RTX 4090 laptop GPU。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
642. 帧级蒸馏为何不能只对齐逻辑:用教师无关的时间上下文投影做轻量声音事件检测
英文题目:Teacher-Agnostic Temporal Knowledge Distillation for Resource-Efficient Sound Event Detection
标签:#知识蒸馏 #高效推理 #环境声 #音频事件检测
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#知识蒸馏
👥 作者与机构
- Gihun Son:机构信息未能从会议 PDF 纯文本可靠映射
- Pil Moo Byun:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声音事件检测需从10秒音频输入逐帧输出多类事件活动概率并定位边界,难点在于紧凑模型时序建模能力弱且异构大教师的中间特征难以直接对齐。该文提出教师无关时序知识蒸馏,以冻结教师的帧级逻辑值作为公共蒸馏空间以规避架构差异,再为学生多级编码特征接入时序上下文投影器以建模局部与长程依赖并映射到逻辑值维度,随后用教师置信度感知损失对可靠帧加权蒸馏,最终移除投影器保持推理轻量。与直接沿用图像分类蒸馏或标准逻辑值与特征蒸馏相比,该链条把时序上下文建模前移到投影阶段并抑制模糊教师目标的误导。在家庭环境声音事件检测基准真实验证集上,紧凑学生达到复调声音检测分数为0.574,明显高于从零训练的0.439且优于同教师下两类基线。结论仅在该单一基准与4类教师组合下成立,对其他场景与强后处理依赖型教师的外推尚未验证。原文未披露训练、推理或部署成本实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
643. 用全局带局部学真伪:ADD-DINO 以两阶段自蒸馏缓解标注稀缺
英文题目:ADD-DINO: A Two-Stage Self-Distillation Framework for Audio Deepfake Detection
标签:#知识蒸馏 #自监督学习 #鲁棒性 #低资源 #音频深度伪造检测
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#知识蒸馏
👥 作者与机构
- Zhaorui Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yihao Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Qiao Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Minqiang Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Sian Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Lin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Jianbo Zhan:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Song:机构信息未能从会议 PDF 纯文本可靠映射
- Guoping Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Lirong Dai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频深度伪造检测输入为原始语音波形,输出为真假二分类,难点在于标注稀缺且合成算法快速演进导致跨域泛化差。第一阶段在100万无标签音频上做非对比教师-学生自蒸馏,教师编码全局长片段、学生编码加噪局部分片段并对齐分布学习全局-局部一致表示,教师参数由学生指数滑动平均更新。第二阶段丢弃投影头,将教师编码器接新二分类头,仅用ASVspoof 2019 LA少量标注以加权交叉熵微调实现检测,前阶段表示直接作为后阶段初始化输入。与掩码预测类自监督方法不同,该机制显式建模长短视图对应关系,更适合捕捉局部伪造痕迹并保留全局语义。在跨域6数据集评测下,ADD-DINO的平均错误率(EER)为12.25%,低于XLS-R+AASIST的平均错误率(EER)15.31%。在ASVspoof 2019 LA有限标注评测下,ADD-DINO的等错误率(EER)为0.55%,高于全量监督基线的等错误率(EER)0.23%。结论适用边界受限于英语为主的公开评测与所选8种新合成器,对中文多口音与强压缩信道的稳定性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
644. 低资源也有高质量:用语言学定制数据加自监督模型做阿姆哈拉语和阿凡奥罗莫语合成
英文题目:High-Quality Speech Synthesis for Under-Resourced Ethiopian Languages
标签:#数据集 #SFT #低资源 #多语言 #文本到语音
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#文本到语音 | 主方法:#SFT
👥 作者与机构
- Rahel Mekonen Tamiru:机构信息未能从会议 PDF 纯文本可靠映射
- Solomon Teferra Abate:机构信息未能从会议 PDF 纯文本可靠映射
- Martha Yifiru Tachbelie:机构信息未能从会议 PDF 纯文本可靠映射
- Abel Mulat Alemu:机构信息未能从会议 PDF 纯文本可靠映射
- Samuel Rahimeto Kebede:机构信息未能从会议 PDF 纯文本可靠映射
- Rosa Tsegaye Aga:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源语音合成需把文本转为自然可懂语音,阿姆哈拉语难点在吉兹字母转写、同形异义与辅音重读,奥罗莫语难点在既往语料小、单说话人且缺韵律与非标准词处理。方法链第一步采集多源文本并清洗去重以提供词汇覆盖,第二步在录音室由男女双说话人录制百小时级干净配对音频为建模提供声学基础。第三步对阿姆哈拉语吉兹字母转写为拉丁表示并把数字缩写规范为口语词以兼容分词器,规范文本连同音频微调统一模态编码器解码器生成梅尔谱后由声码器合成16 kHz波形。相对早期拼接与隐马尔可夫模型,该路线以自监督预训练表示替代手工规则和拼接单元,以说话人嵌入实现单模型多音色共享。在阿姆哈拉语增加13小时目标数据的评测条件下,完整系统的总体平均意见得分为4.65,高于未增加目标数据的总体平均意见得分4.12。奥罗莫语总体平均意见得分达4.43,其中发音准确度仅3.98形成明显短板,母语专家每语言评测250条合成语音。结论仅适用于朗读体录音室数据与标准化输入假设,同形异义自动消歧、跨域泛化与长尾非标准词尚未验证,原文未披露训练推理成本与声码器型号。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
645. 从一条全局直线到多块局部仿射:SSL-GMMVC 在自监督空间做可解释音色搬移
标签:#众包评测 #自监督学习 #可解释性 #语音 #语音转换
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#自监督学习
👥 作者与机构
- Tomoya Tanabu:机构信息未能从会议 PDF 纯文本可靠映射
- Hiroshi Nishijima:机构信息未能从会议 PDF 纯文本可靠映射
- Daisuke Saito:机构信息未能从会议 PDF 纯文本可靠映射
- Nobuaki Minematsu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音转换需将源说话人声学特征映射为目标说话人空间并合成波形,输出保持语言内容与自然度,难点在于特征空间按音素呈现异质局部结构而全局映射难以适应。第一步对WavLM-Large第6层源与目标特征做双向余弦最近邻匹配,得到伪平行帧对以提供联合建模的配对输入。第二步对拼接的联合向量用高斯混合模型估计混合权重、均值与协方差,以混合分量划分局部区域并刻画跨说话人联合分布。第三步依据源侧边缘计算各分量后验,将各分量条件期望仿射变换按后验加权求和得到转换特征,再经HiFi-GAN声码器合成波形。相比LinearVC的单一全局仿射,该后验加权多局部线性在K=1时退化为等价仿射,随混合数增大形成全局非线性而保留解析可解释性,全对角交叉对角变体则以对角约束实现位移加缩放。在30个有序说话人对、训练量N为200的客观评测中,4混合全协方差模型等错误率达到27.30%,超过同条件LinearVC非约束基线的25.88%,可懂度与自然度基本持平。作者承认高维下增大混合数时参数估计不稳定,且旋转平面跨分量与跨说话人对的对应关系尚未建立。原文未披露训练推理计算成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
646. 不等整句说完就打分:ANCHOR 用先局部后整体的顺序做增量语音质量估计
标签:#自回归模型 #流式处理 #语音 #语音质量评估
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#自回归模型
👥 作者与机构
- Zhuoyan Tao:机构信息未能从会议 PDF 纯文本可靠映射
- Jiatong Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Hye-jin Shim:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向流式与生成场景的前缀约束估计问题,本文输入为2 s至8 s的语音前缀,输出为当前块质量与完整话语质量的联合预测,难点在于局部突发失真易被全局池化稀释而早期估计失真。方法链分为三步:冻结的声学前端将前缀编码为连续特征,其后离散化查询机制把异构感知指标映射为统一词表中的记分词元,最后共享解码器按块优先顺序先生成块级词元再以其为条件精修话语级词元。相比直接在前缀上复用完整话语模型的基线,该层次将局部估计作为显式中间变量,缓解多任务监督冲突并保留解码器深度。在Overall Dev前缀评测设置下,ANCHOR在4 s前缀的PLCMOS平均绝对误差为0.725,低于2 s前缀的PLCMOS平均绝对误差0.865。结论边界在于有效上下文视界约4 s至6 s,且非因果前端与伪标签依赖限制了向真实主观分与严格流式部署的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
647. 只用整条录音的说话人名单,如何学出帧级归属与干净嵌入
标签:#弱监督学习 #说话人分离标注 #说话人验证 #语音活动检测
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#弱监督学习
👥 作者与机构
- Jenthe Thienpondt:机构信息未能从会议 PDF 纯文本可靠映射
- Kris Demuynck:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人分离标注(Speaker Diarization)需从长录音输出谁在何时说话,传统级联系统依赖外部语音活动检测与粗粒度滑窗嵌入聚类,只能用重叠中点启发式给出粗糙边界。所提方法先在单说话人识别任务上预训练带通道注意力(Channel-Attentive)的ECAPA2编码器以获得帧级特征与语音活动对数,再冻结预池化编码器与语音活动检测模块并引入由2层双向长短期记忆网络构成的说话人活动检测模块,经置换不变的加性角度间隔损失做多说话人微调。推理时先由语音活动对数切分连续语音段,再在2秒滑窗内输出2路嵌入与帧级活动,并用嵌入余弦相似度判断单双说话人后送入谱聚类。该设计与依赖帧级标注的端到端或混合系统不同,仅用话语级说话人标签即学到帧级语音与说话人活动,从而省去外部切分模型。在DIHARD III基准测试集下,ECAPA2+MSFT的混淆错误率为4.0,低于ECAPA2基线的混淆错误率4.7。当前结论限于oracle语音活动检测、非重叠评分、每窗至多2人与4秒合成短窗假设,在会议和餐馆等多说话人强重叠场景出现退化。原文未披露训练硬件、优化器与推理成本。该适用边界尚未验证多说话人强重叠外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
648. 众包听音为何变扁:P.808 与 P.800 对照下的筛选补救
英文题目:Screening Matters: A Comparative Study of Conventional and Crowdsourced Listening Tests
标签:#众包评测 #统计分析 #语音 #语音质量评估
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#众包评测
👥 作者与机构
- Anika Treffehn:机构信息未能从会议 PDF 纯文本可靠映射
- Andrea Eichenseer:机构信息未能从会议 PDF 纯文本可靠映射
- Emily Kratsch:机构信息未能从会议 PDF 纯文本可靠映射
- Nicola Pia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为24条英语干净单声道语音经20种经典与神经编解码退化后的刺激,输出为退化平均意见分Degradation Mean Opinion Score / DMOS的条件均值,难点是众包环境不可控导致量表压缩与方差膨胀。方法链分三段推进:先以实验室P.800退化类别评分Degradation Category Rating / DCR为基准并行采集众包P.808结果形成可比对偶,再对众包端施加测前问卷与可懂度预测试、测中陷阱与金标准题、测后评分跨度与锚点排序三类筛查,最后以与基准的条件均值误差与相关性度量各筛查的单调改善。与已有P.808建议相比,关键机制差异是用预定义阈值的最低参考分与锚点不等式做基于用户的硬筛查,避免了按条件标准化剔除离群值在小方差时误伤真实感知差异。无筛查时两测试条件均值间平均绝对误差Mean Absolute Error / MAE为0.573,参考条件c01低估1.11分而最差锚点c02高估0.88分,而陷阱加参考最低分加跨度加排序的联合筛查后MAE降至0.230且Pearson相关达0.974。结论仅适用于单声道英语语音的DCR场景,未验证其他语言、通用音频与立体声素材。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
649. 先分波束再互斥:用目标与干扰波束的帧级交互做提取
标签:#注意力机制 #波束成形 #麦克风阵列 #音视频 #目标说话人提取
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#注意力机制
👥 作者与机构
- Yanhui Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Runxiang Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Fang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
远场麦克风采集的混合语音受混响、背景噪声与竞争说话人污染,目标说话人提取需在低信噪比下输出可被后端识别的目标语音。方法分两阶段衔接,第一阶段由音视频双路径卷积循环网络估计理想比值掩膜并驱动广义特征值分解波束成形器产生目标波束与干扰波束以提供空间分离先验,第二阶段将双波束与对数功率谱及唇部特征拼接后送入双分支交互网络,用跨波束注意力在瓶颈层做帧级互抑制并联合估计语音与噪声掩膜。与仅做特征拼接的同规模两阶段基线相比,该显式互斥机制能更直接地扣除残留干扰而非依赖隐式融合,可更好保留频谱细节。在自有实录集评测条件下,AV-SNINet的平均WER从第一阶段基线的平均WER28.40%降至20.38%。结论限于近正面用户、圆形阵列与所选噪声类型的远场条件,未验证强混响、侧脸遮挡或多轮对话外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
650. 没有加速度计也能估计声门下共振:从语音生成振动再做自动跟踪
标签:#CNN #信号处理 #发声与构音 #语音 #语音属性识别
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#CNN
👥 作者与机构
- Chigozie Uzochukwu Udeogu:机构信息未能从会议 PDF 纯文本可靠映射
- Carol Espy-Wilson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为连续麦克风语音,输出为颈部加速度计波形与前三个次声门共振(Subglottal Resonances,SGRs)随时间的轨迹,难点在于专用采集成本高、共振易被声道共振峰掩蔽且女性高基频下线性预测不准。方法链分三步:监督式多尺度谱学习模型将语音谱图映射为加速度计谱图并逆变换重建波形,能量持续时间准则从浊音区挑选最长最强稳定元音段做参考估计,自适应跟踪模块用语音活动检测加概率YIN基频门控剔除非浊音帧,用参考偏差触发线性预测阶数与预加重因子重搜实现连续跟踪。与Lulich等逐个共振半自动标注相比,该工作首次实现三共振并发全自动估计与跟踪。在TIMIT语料身高回归评测任务下,本框架Sgr1的RMSE为6.2 cm,低于Arsikere等方法的RMSE 6.6 cm。跟踪阶段以参考共振为锚点逐帧比较偏差并重搜参数从而抑制突变与断裂。该结论适用边界受限于成人美式英语元音主导连续语音,儿童、病理与强噪声场景尚未验证。原文未披露训练、推理或部署成本。结论仅在 50 名成人美式英语说话人元音主导语料上验证,儿童、病理嗓音与强噪声外推未验证,训练推理成本未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
651. 偏好测试不必测全所有对:用主动选对让 AB 与 BWS 更快分出系统高下
英文题目:Exploring Active Sampling Strategies for Pairwise Comparisons in Speech Synthesis Evaluation
标签:#统计分析 #主观评测 #模型比较 #语音质量评估
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#主观评测
👥 作者与机构
- Cassia Valentini-Botinhao:机构信息未能从会议 PDF 纯文本可靠映射
- Andrea Lorena Aldana Blanco:机构信息未能从会议 PDF 纯文本可靠映射
- Dan Wells:机构信息未能从会议 PDF 纯文本可靠映射
- Aidan Pine:机构信息未能从会议 PDF 纯文本可靠映射
- Korin Richmond:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音合成主观评测需在有限听音时长内可靠区分多个系统,输入为多系统语音刺激与听者偏好判断,输出为系统分数与排序,难点在于听者量尺偏差大与全对比较成本高。为此先通过全覆盖预采集构建答案库以支撑离线重采样仿真,接着按随机、合并排序与ASAP采样器请求检索对应问题答案,最后用TrueSkill更新分数并以显著差异数与Kendall排序相关性度量收敛效率。合并排序负责聚焦排序相邻易混淆对并迭代收敛,ASAP负责以前后验KL散度预期信息增益选对并用最小生成树批量组对,其输出直接决定下一批听音问题。与随机和排序方法相比,ASAP以信息增益聚焦不确定性高的系统对并支持批量并行,BWS单题提供五个偏好关系因而在相同时长下信息密度更高。在相同测试时长换算的评测设置下,10名被试BWS结合ASAP的总听音指标为200分钟,低于40名被试AB测试的总听音指标800分钟。该结论适用边界受限于Blizzard Challenge 2013旧系统与美国英语母语众包听者,在当前高自然度神经系统窄区间表现尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
652. 短伪造易被全局平均淹没:MS-GNN 用窗口图与双向多尺度保留局部证据
英文题目:MS-GNN: Multi-Scale Graph Neural Network for Detecting Local Audio-Visual Forgery Traces
标签:#图神经网络 #多任务学习 #音视频 #音频深度伪造检测
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#图神经网络
👥 作者与机构
- Jianrong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Hengyang Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jie Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Ju Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Qi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ying Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为音视频流,输出为视频级真伪判决与窗口级可疑证据,难点在于短时局部篡改极易被全局池化稀释为背景噪声。所提多尺度图神经网络(Multi-Scale Graph Neural Network,MS-GNN)先将流切分为400毫秒非重叠窗口并用TimeSformer与WavLM编码音视频特征,再经3层堆叠图层完成窗口交互与层级精炼,最后经注意力池化得到视频表示。该链条中窗口交互负责时序与跨模态对齐,自底向上聚合负责构造8窗片段语义,自顶向下精炼负责回注上下文以增强局部证据。与全局融合基线相比,关键差异在于显式保留窗口分辨率并用双向层级传递替代一次性池化。在LAV-DF上MS-GNN取得98.12%准确率与99.81%曲线下面积,超越DiMoDif、Referee等5种基线;在FakeAVCeleb上准确率93.20%低于MRDF的94.05%,但曲线下面积96.75%为最高。该结论更适用于含短时局部伪造的视频,在以全局伪造为主的数据上准确率优势消失。端到端延迟主要由特征提取主导,轻量图聚合模块本身仅需0.123G浮点运算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
653. 从一段语音直接长出可编辑 3D 脸:几何与纹理为何要分开对齐
英文题目:ES-3DF: Editable Speech-Driven 3D Face Reconstruction via Geometry Texture Disentanglement
标签:#对比学习 #生成对抗网络 #多模态学习 #语音 #音视频生成
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频生成 | 主方法:#对比学习
👥 作者与机构
- Jianrong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kaibin Bi:机构信息未能从会议 PDF 纯文本可靠映射
- Jinghui Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ju Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Qi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ying Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为约3秒短语音,输出为带纹理的可编辑3D人脸,难点在于语音与人脸几何纹理之间的模态鸿沟非常巨大且身份映射高度病态。先以3DDFAV3特征与StyleGAN2纹理生成器构建解耦的几何纹理空间,明确分离形状系数与高维纹理特征。再用ECAPA-TDNN提取说话人嵌入,并以双分支MLP分别回归3DMM身份系数与纹理特征,经类感知多槽记忆做对比对齐以保持身份判别性。最后将回归的身份系数与纹理特征送入冻结纹理生成器,经可微渲染器融合成像,并以人脸感知损失约束身份一致性。与级联先生成2D再重建3D的已有方法不同,该框架消除了2D误差传播并允许几何纹理独立编辑,具有可解释操控意义。在VoxCeleb1与VGGFace交集的301人测试集下,ES-3DF的Landmark L1指标为1.33,低于CMP的Landmark L1指标1.97。结论仅适用于受控近正面人脸重建,未验证噪声语音、跨语言与大姿态外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
654. 端射越偏不是算法运气差:紧凑线阵时延到角度的病态反演与两处稳健化
英文题目:End-Fire Degradation-Robust DOA Estimation for Compact Linear Microphone Arrays
标签:#数据集 #波束成形 #鲁棒性 #麦克风阵列 #声源定位
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声源定位 | 主方法:#波束成形
👥 作者与机构
- Zheng Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Huayang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhongxin Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Qiqi Tong:机构信息未能从会议 PDF 纯文本可靠映射
- Yaling Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
紧凑均匀线阵输入为多通道语音短时频谱,输出为0°至180°二维方位角,难点是端射附近时延到角度映射斜率发散,微小相位扰动被放大为大幅角度误差。方法在可靠性感知相位变换框架下分两路抑制退化:加权转向响应功率路按基线平方与频率平方逆方差加权增强几何信息,在聚合阶段抑制方差驱动的峰展宽后直接峰值搜索得到角度;互相关加权最小二乘路在物理约束窗内估计时延并经抛物线插值细化后在余弦域线性融合,最后一次性反余弦恢复角度。与传统转向响应功率相位变换的关键差异是把方差抑制放在聚合阶段、把病态隔离在单次反演之后,避免逐对求角再平均的重复放大。在1 m真实混响评测条件下,GCC-WLS的端射区均方根误差指标为3.14°,低于SRP-PHAT的端射区均方根误差指标4.83°。结论仅适用于单源远场方位模型,未验证多源、低信噪比、大混响与近场外推。原文未披露训练、推理或部署成本,方法为免训练信号处理。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
655. 从作曲要素拆开评价:SongBench 如何让歌曲生成测得更细
英文题目:SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment
标签:#基准测试 #数据集 #基准设计 #音乐 #歌唱生成
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#歌唱生成 | 主方法:#基准设计
👥 作者与机构
- Dapeng Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Shun Lei:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Guangzheng Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yunzhe Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Huaicheng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Lishi Zuo:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到歌曲生成以歌词与风格提示为输入,输出含人声与伴奏的完整歌曲,难点在于长时结构连贯性与多维审美无法用可懂度或分布距离刻画。该工作先用Hunyuan大语言模型合成4000段歌词与384条提示并随机配对,驱动Suno多版本与LeVo等系统生成约20000条候选并混入版权歌曲,经SongPrep做结构切分与歌词转写对齐进入标注。该工作接着对29名音乐专业候选者做两阶段校准筛选出10名标注者,每首歌至少3人在随机双盲下按七维1到10分打分,对高方差与直线型作答复审剔除,保留11717样本约683.5小时。最后在自监督音乐表征MuQ之上训练多维分数预测器,在外部模型生成的分布外数据上学习与专家对齐的自动评分。相比SongEval的连贯性、记忆度等重叠感知维度,新框架按演唱、乐器、旋律、结构、编曲、混音、音乐性解耦为原子指标,降低维度干扰并缓解高分扎堆。在分布外测试集下,SongBench的LCC分数为0.835,高于SongEval的LCC分数0.703。该结论仅在中英文流行歌曲与所覆盖系统内验证,对小语种与非主流风格尚未验证,适用边界受限。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
656. 稀疏实测补全任意方向双耳脉冲响应:HRIR-Former 的时域网格自由重建
标签:#多任务学习 #Transformer #空间音频信号 #声场重建
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声场重建 | 主方法:#Transformer
👥 作者与机构
- Shaoheng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Chunyi Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Jihui Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Amy Bastine:机构信息未能从会议 PDF 纯文本可靠映射
- Prasanga N. Samarasinghe:机构信息未能从会议 PDF 纯文本可靠映射
- Thushara D. Abhayapala:机构信息未能从会议 PDF 纯文本可靠映射
- Hongdong Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向每人仅少量实测头相关脉冲响应需补全任意未测方向双耳波形的空间上采样任务,难点在于稀疏不规则采样下的全局空间相关建模与相位定时保真,且固定网格与球谐插值在角度缺口较大时易退化。所提HRIR-Former先将观测行掩蔽投影为信号令牌并叠加正弦方向编码,再经Transformer编码器做跨方向自注意力补全,以实现任意目标方向的网格无关推断。接着由共享解码器映射回全长双耳波形并经掩蔽融合保留实测行,最后以Conv1D沿重排方向轴做局部时域精修以抑制邻域不连续。与频域幅度加最小相位加独立延时估计的已有管线不同,该方法直接在时域联合优化波形、复频谱与耳间线索,避免相位重建割裂。在SONICOM评测协议下,HRIR-Former的ITD-E指标为18.5 μs,低于Nbr基线的ITD-E指标274.2 μs。结论适用边界受限于自由场补偿后数据与客观波形线索指标,尚未验证混响、头动与主观定位外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
657. 用低频子带先验带路:SCNet 如何让黑盒声码器先看清再重建
标签:#生成对抗网络 #时频分析 #语音 #语音合成
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#生成对抗网络
👥 作者与机构
- Nan Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Mingxue Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向由80维对数梅尔频谱图重建24kHz高保真波形的声码器任务,直接预测波形或全带谱系数的黑盒生成对抗网络缺乏频域先验引导且相位包裹误差度量失真,难以保留细粒度谱细节。SCNet先以子带条件网络用ConvNeXtV2块预测低频子带幅度与相位并经逆短时傅里叶变换合成6kHz子带波形,再经短时傅里叶变换得到对齐的频域表示。接着两个耦合块将该频域条件逐元素相加注入主干对应上采样层,为中间特征提供先验约束以稳定特征匹配损失。最后主干联合预测全带幅度与相位并经帧长16帧移4的逆短时傅里叶变换重建波形,同时以目标幅度加权的大幅值感知正弦平方抗包裹相位损失强调高能量时频点。该机制把无约束谱回归变为有先验引导的粗到细修正并使相位权重与感知重要性对齐,区别于无条件直接上采样的黑盒预测。在LibriTTS域内与VCTK域外各500句测试集评测设置下,SCNet的PESQ为4.02,高于BigVGAN的PESQ 3.74。当前验证仍限于24 kHz英语朗读语音与CosyVoice级联,音乐与通用音频及通用声码器能力尚未验证。训练在单卡NVIDIA A100上1M步约需3.6天,V100上合成速度为145.67倍实时。上述训练成本与推理开销分别在单卡NVIDIA A100硬件训练与V100硬件吞吐下计量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
658. 旁人插话时只认佩戴者:波束、鼻麦与旁人声检测的三路差分识别
英文题目:Multi-Channel Differential ASR for Robust Wearer Speech Recognition on Smart Glasses
标签:#波束成形 #鲁棒性 #麦克风阵列 #流式处理 #语音识别
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#波束成形
👥 作者与机构
- Yufeng Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Yiteng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Li Wan:机构信息未能从会议 PDF 纯文本可靠映射
- Suwon Shon:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yifeng Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Zhaojun Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Olivier Siohan:机构信息未能从会议 PDF 纯文本可靠映射
- Yue Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Florian Metze:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
智能眼镜上的穿戴者语音识别(wearer speech recognition,WSR)需从5通道开放场麦克风中只转写穿戴者,输出为流式文本,难点是旁观者侧向说话(side-talk)与目标在频谱和空间上高度混叠。方法链分三步:麦克风选择(microphone selection)固定选取鼻梁通道以保留高信噪比直达声,最小方差无失真响应(minimum variance distortionless response,MVDR)波束成形器(beamformer)聚焦嘴部方向生成增强通道,流式侧向说话检测(side-talk detection,STD)输出逐采样点穿戴者与旁观者对数几率并经卷积降采样为嵌入。三路特征经对数梅尔(log-Mel)提取与拼接后送入循环神经网络换能器(recurrent neural network transducer,RNN-T)编码器、预测网络和联合网络进行转写。与仅用波束成形器的传统前端相比,该设计不建模说话人身份而提供互补与对比性空间线索,具有隐私友好和低延迟意义。在真实录制多通道LibriSpeech侧向说话集上,最优三前端系统相对噪声训练的单波束成形基线最高获得18.0%的相对词错误率下降。在仿真集上最优增益为5.1%。结论限于英语朗读语音模拟与头模回放场景,未验证多旁观者、强混响和自然对话外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
659. 解开 1 比特下限:用可变秩二值分解把编码器压进亚比特
英文题目:Pushing the Limits of Compression: Sub-1-Bit Conformer via Variable-Rank Binary Decomposition
标签:#模型量化 #高效推理 #端侧运行 #语音 #语音识别
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型量化
👥 作者与机构
- Jinsu Yeo:机构信息未能从会议 PDF 纯文本可靠映射
- Banseok Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Youngmin Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为语音声学特征、输出为词序列的Transducer识别面临编码器冗余而预测网络敏感的结构不对称,整数舍入最近邻量化(Round-to-Nearest,RTN)被1比特下限锁死而无法继续压缩。所提LittleASR先以校准集任务损失梯度平方均值计算层敏感度,再以预算偏差与敏感度加权秩惩罚做可微比特搜索并经标量偏移二分搜索严格对齐目标平均比特,最后将优化比特映射为二值低秩分解之秩并做量化感知训练(Quantization-Aware Training,QAT)。与整数网格不同,秩步进以约0.002比特粒度调节有效位宽,使编码器进入亚1比特而解码器保持高秩。优化器将冗余编码器浅层压至低比特而深层语义层与值投影保留较高保真度,从而实现细粒度预算再分配并维持识别精度。在LibriSpeech上混合秩1.0比特dev-other词错率(Word Error Rate,WER)为6.01%,优于张量粒度AbsMean基线的6.30%,并可下探至7.1 MB。该结论仅在约120M参数Conformer-Transducer Large与英文朗读语音验证,未覆盖噪声、口音、流式与多语外推。原文明确承认硬件收益仅为理论运算量,未做实测时延、吞吐与功耗评估。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
660. 重构好不等于诊断对:BACH 测八种音频编解码器的生物声健康信息保留
英文题目:BACH: Benchmarking Audio Codecs for Bio-Acoustic Health
标签:#医疗音频 #基准设计 #音频分类 #音频编码
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频编码 | 主方法:#基准设计
👥 作者与机构
- Zixing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaojun Mo:机构信息未能从会议 PDF 纯文本可靠映射
- Zhongren Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Han:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
生物声学健康以心音、肺音、鼾声等非语音信号为输入,输出疾病或症状类别,难点在于信号短促稀疏且采集质量低,压缩极易抹除细微诊断线索。BACH先将原始音频送入神经音频编码器得到离散表征并重建波形,再分别在原始域、压缩域与重建域上接特征提取与分类器,形成可对比的三条评测通路。其中压缩域直接使用量化器输出的离散表征进行分类,重建域将解码重建音频送入预训练HuBERT提取特征后再分类,原始域作为无损性能上限,三路共享线性映射加Transformer分类器以保证公平。与侧重听感重建的Codec-SUPERB等基准相比,该框架把码本表征的语义保留与重建音频的任务保留能力显式分离,从而揭示重建保真与诊断语义之间的错位。在ICBHI肺音压缩域评测任务下,FACodec的准确率为95.0%,高于DAC的准确率92.7%。结论限于短片段分类与固定低码率,尚未验证连续监测、噪声与跨设备泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
661. 重叠下听清与分清难以兼得:用双编码交错与自适应掩蔽平衡识别与归属
英文题目:Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition
标签:#会议转录 #多任务学习 #大语言模型 #语音识别 #说话人分离标注
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#多任务学习
👥 作者与机构
- Naijun Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Yuke Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Sanli Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Mengtian Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiwei Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Longshuai Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Dandan Tu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多说话人识别需从单通道远场混合语音同时输出文字与说话人归属,重叠打断与附和词使识别与说话人标注相互干扰,联合建模易顾此失彼。双编码器先分工抽取特征,SenseVoice-small抽取语义序列而CampPlus改造体抽取说话人序列,分别保留语义与声学线索并经适配投影对齐维度。融合阶段以固定粒度将两路特征时间交错拼接送入Qwen2.5-0.5B-Instruct,并以文本加转换标记加说话人标识组织标签,使转换检测输出提示后续身份推断。训练阶段采用按话轮词元长度加权的分段感知说话人标识损失强化长话轮归属,并以样本内文本损失均值与2.0取大的自适应阈值屏蔽重叠区高损失词元,从而抑制重复幻觉。与特征维拼接相比,交错对齐避免投影压缩造成表征损失,掩码机制平衡识别与标注训练。与级联基线和端到端大模型相比该结构保留双路完整性并减少幻觉。在AliMeeting Eval评测设置下,时间交错融合的CER为25.56%,低于无ASR掩码变体的CER 28.07%。该结论适用边界受限于中文会议远场单通道且至多50秒切分,开放说话人数、极高重叠与跨语言场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
662. 以参考语音为基准、用文字改一项:FineCombo-TTS 的相对属性控制
标签:#数据集 #流匹配 #语音 #文本到语音
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Shuoyi Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Yixuan Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Peiji Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Yifan Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Yicheng Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Zhisheng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
参考语音擅长零样本克隆但依赖参考质量,文本描述灵活但难以刻画细粒度声学,以往联合方法只是参考定音色加文本粗写全局风格,协作松散。先由语音属性抽取器将提示语音作为输入,编码为拼接音色与残差风格的统一属性嵌入Ea,作为后续变换起点。再以源嵌入Ea与T5编码的描述语义S为条件输入语音方差预测器,用条件流匹配学习源到目标嵌入的细粒度残差映射,输出目标属性嵌入。最后由自回归编解码语言模型以文本与预测目标属性为共同约束,生成Descript Audio Codec声学Token并重建波形,从而衔接参考接地与文本引导。为支持相对控制,作者构造FineEdit三元组〈源语音、控制描述、目标语音〉,每次只变韵律、情感、音色中一类。在FineEdit未见划分的韵律控制评测任务下,FineCombo-TTS的速度控制准确率为98.00,高于VoxInstruct-Joint的速度控制准确率91.35。结论限于英文朗读与情感库,跨语言、噪声参考与强风格冲突外推未验证,训练与推理成本未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
663. 边界不清与归属不稳:用语言约束修分割、用已知人声锚定聚类的两级会议说话人日志
英文题目:Two-Level Uncertainty Suppression for Robust Meeting Diarization
标签:#会议转录 #模型融合 #语音 #说话人分离标注
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#模型融合
👥 作者与机构
- Shuhei Asaka:机构信息未能从会议 PDF 纯文本可靠映射
- Muhammad Shakeel:机构信息未能从会议 PDF 纯文本可靠映射
- Chikara Maeda:机构信息未能从会议 PDF 纯文本可靠映射
- Benjamin Yen:机构信息未能从会议 PDF 纯文本可靠映射
- Takeshi Ashizawa:机构信息未能从会议 PDF 纯文本可靠映射
- Naoaki Sumida:机构信息未能从会议 PDF 纯文本可靠映射
- Kazuhiro Nakadai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
真实会议说话人分离标注(speaker diarization)需从单通道录音输出谁在何时说话,重叠与快速轮转使边界处说话人活动估计不稳,并进一步污染嵌入与全局聚类。本文在 DiariZen 版 EEND-VC(结合神经分割与向量聚类的分离标注框架)流水线上做两级抑制:先将 OWSM-Encoder 的语言上下文经 FiLM(特征线性调制)注入 WavLM 中间层并送入 Conformer 做活动估计。再把已知说话人嵌入复制加权后与待聚类嵌入一起做 AHC(凝聚层次聚类),用加权种子稳定质心。与输出层加权求和或拼接融合不同,中间层调制在保留声学判别力的同时注入语言对齐信息,而数据层面加权复用注册语音约束聚类,避免改动聚类算法本身。与仅用 WavLM-large 相比,单层 FiLM 在 AliMeeting 上将 DER(分离标注错误率)从 14.8% 降至 13.0%;在混合已知与未知说话人条件下,KSGC(已知种子引导聚类)在 AliMeeting 上比标准 AHC 降低约 2.0 个百分点,文称最大增益 2.62 个百分点。结论限于 AMI、AliMeeting 和 AISHELL-4 的 8 s 分块评测,对更长会议、在线推理与未知说话人占主导的场景尚未验证。原文承认双编码器增加计算与显存开销,未披露训练、推理或部署成本量化结果。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
664. 不只听出读错了哪个音,还要说出为什么错:PhonLLM 的联合推断
英文题目:PhonLLM: Joint Phone Recognition and Phonological Process Inference for Child Speech
标签:#多模态学习 #语音学与音系 #多语言 #语音 #语音识别
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#多模态学习
👥 作者与机构
- Ilja Baumann:机构信息未能从会议 PDF 纯文本可靠映射
- Korbinian Riedhammer:机构信息未能从会议 PDF 纯文本可靠映射
- Tobias Bocklet:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童构音筛查需要从语音推断实际发音相对预期发音的偏差类型,传统转写只给文本而无法给出音素级可解释诊断,低龄与病理语音的高变异又放大了对齐与标注难度。PhonLLM先在约9800小时成人多语朗读语音上预训练跨语言音素识别以建立声学音素对齐,再把正字法经发音词典转换得到的预期音素序列与降采样音频表征融合后输入紧凑大语言模型。自回归解码输出典型音素与显式过程标签,其中编码器与大语言模型权重冻结而仅训练低秩适配与音频投影层以保留语言知识并高效适配儿童语音。与级联误发音检测与诊断不同,该方法把音系过程建模为预期发音到实现发音之间的条件变换,直接从声学解码标签,避免中间文本转写的误差传播。在德语、英语和冰岛语6个临床子集评测下,PhonLLM的平均标注F1为75.9,高于机会基线的平均F1 19.2。当前验证仅覆盖前化、背化与删除3类过程且依赖PLAKSS图片命名与单字复述类任务,难以直接外推到去塞擦音、辅音丛简化与塞音化等更广发育过程。该结论适用边界受限于三类过程与单字类任务而尚未验证连续语流外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
665. 双耳助听要在 8 毫秒内降噪:RT-Tango 如何把分布式滤波做轻做快
英文题目:RT-Tango: Real-Time Distributed Binaural Speech Enhancement for Low-Power Hearing Aid Devices
标签:#助听器 #RNN #高效推理 #语音增强
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#RNN
👥 作者与机构
- Zahra Benslimane:机构信息未能从会议 PDF 纯文本可靠映射
- Pierre Chouteau:机构信息未能从会议 PDF 纯文本可靠映射
- Martyna Poreba:机构信息未能从会议 PDF 纯文本可靠映射
- Fabrice Auzanneau:机构信息未能从会议 PDF 纯文本可靠映射
- Michal Szczepanski:机构信息未能从会议 PDF 纯文本可靠映射
- Fabian Chersi:机构信息未能从会议 PDF 纯文本可靠映射
- Romain Serizel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
双耳语音增强需在左右耳各2麦、耳间带宽受限下输出双路干净语音,难点是超低延迟、极低算力和分布式处理三者互斥。本文方法沿用Tango的两阶段分布式链路:单节点网络仅用本耳双通道估计时频掩膜,经语音失真加权多通道维纳滤波(Speech Distortion Weighted Multichannel Wiener Filter,SDW-MWF)生成可传输压缩信号;多节点网络联合本地信号与对侧压缩信号二次估计掩膜,再做SDW-MWF得到双耳输出。与集中式多通道直接重建波形不同,该机制用神经掩膜引导空间滤波,并以非对称分析合成窗解耦频率分辨率与算法延迟。前端用等效矩形带宽(Equivalent Rectangular Bandwidth,ERB)压缩频维并经逆变换恢复线性频分辨率,循环主体用分组循环网络(Grouped Recurrent Network,GRNN),推理侧用固定速率跳过(Fixed-Rate Skipping,FRS)复用掩膜。在BinauRec房间脉冲响应混合语料评测设置下,RT-Tango左耳的SI-SDR为4.4 dB,低于同帧率GTCRN的SI-SDR 6.0 dB,同条件下系统总计算量为33.41 MMACs/s,严格因果在线变体RT-Tango-OS的延迟为8 ms。适用边界限于前方目标、右侧45度和90度噪声、干声-5 dB、0 dB和5 dB混合的受控仿真,移动声源、强混响变化与真实硬件功耗均未验证。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
666. 只练适配器:扩散大模型为何更能扛住语音到文本的潜桥瓶颈
英文题目:Refining the Latent Bridge: Superior ASR Performance via Adapter-Only Alignment with Diffusion LLMs
标签:#Adapter #扩散模型 #高效推理 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#Adapter
👥 作者与机构
- Puneet Singh Bhooi:机构信息未能从会议 PDF 纯文本可靠映射
- Vinayak Abrol:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别(Automatic Speech Recognition, ASR)需要把连续语音声学信号转写为文本,难点在于冻结语音编码器与冻结大语言模型(Large Language Model, LLM)之间的模态鸿沟难以仅靠轻量接口弥合。该工作构建冻结 Whisper-Large-v3 编码器加冻结扩散大语言模型(Diffusion Large Language Model, dLLM)的三段链路,先由编码器抽取声学表征并做帧堆叠压缩,再经深层多层感知机(Multilayer Perceptron, MLP)适配器映射为语言空间声学前缀,最后由 LLaDA-8B 以掩码去噪方式并行精修出转录。与自回归(Autoregressive, AR)逐词解码相比,其关键差异是用全局双向精修替代单向 teacher forcing 链,从而在适配器瓶颈下抑制误差漂移并实现块级并行解码。在 LibriSpeech 960 小时训练与 test-clean 评测下,扩散方案词错率(Word Error Rate, WER)为 2.807%,相对同设置 Llama-3-8B 基线降低约 54%,同时吞吐提升约 45%。该结论目前仅在英文朗读语音与两款 8B 解码器对照下验证,未覆盖噪声对话跨语言长尾口音与流式场景。训练在单张 NVIDIA GPU 上完成,推理采用 128 步掩码去噪与低置信重掩码策略并以实时率倍数衡量效率。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
667. 从高频脑电包络到可听语音:高伽马特征与因果扩张解码器的取舍
标签:#CNN #脑信号 #语音 #言语神经解码
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#言语神经解码 | 主方法:#CNN
👥 作者与机构
- Rantu Buragohain:机构信息未能从会议 PDF 纯文本可靠映射
- Saket Maheshwari:机构信息未能从会议 PDF 纯文本可靠映射
- Karan Nathwani:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理从立体脑电图(stereo EEG,sEEG)重建可听语音的任务,输入为颅内多通道神经信号,输出为对数梅尔谱(logMel),难点在于信噪比低、电极位置因人而异且神经活动与语音存在时序错位。方法链先对原始信号去趋势并提取高伽马带(70-170 Hz)包络特征,再按短窗滑动平均并堆叠邻窗以引入上下文,接着经一维投影送入堆叠因果空洞残差块进行门控时序建模,最后由全局池化与多层全连接映射到声谱帧。相比线性回归和常规卷积与循环结构,该设计以纯卷积并行建模长短程依赖并用残差与跳连聚合多尺度信息,更适配实时解码约束。在10名荷兰语受试者朗读语料上的受试者内评估中,提出模型平均皮尔逊相关系数(Pearson correlation coefficient,PCC)达0.9349,显著高于最强基线NeuroIncept Decoder的0.9050水平。结论仅适用于电极覆盖较好且训练测试同分布的受试者内重建,未验证跨被试迁移与波形级可懂度外推。训练耗时约1812秒而推理延迟为177.30 ms,原文披露了延迟、吞吐与浮点运算量等成本信息。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
668. 事件一变场景就错:用合成混叠检验声场景分类的事件鲁棒性
标签:#基准测试 #数据集 #数据集构建 #鲁棒性 #声学场景分类
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#声学场景分类 | 主方法:#数据集构建
👥 作者与机构
- Yiqiang Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Bohan Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Pengwei Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Shengchen Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xi Shao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声学场景分类输入10秒环境录音并输出公园、公交等13类场景标签,难点在于前景事件剧变而背景类别不变时模型易被前景劫持而误判。为此研究构建事件偏移声学场景基准,以CochlScene为背景、FSD50K为前景,先用预训练BEATs做音频标注排查背景已有事件并清洗事件池。接着用GPT-4做场景与事件语义分组并输出结构化元数据,该元数据约束事件选择器采样前景事件以保证组合真实。最后波形混合器按每片段1到10个事件随机时序叠加,并按每片段-15dB到15dB场景对事件信噪比混合成211小时76081片段数据,训练验证仅含背景与已知事件而未知事件严格隔离至测试集。与只覆盖城市、设备、时间偏移的旧基准相比,该基准把干扰解耦为纯背景、已知事件、未知事件三档评估协议,从而直接度量未知事件导致的系统性崩塌。在ESAS极低信噪比条件下,BC-ResNet的准确率为43.21%,高于TF-SepNet的准确率37.42%。结论适用边界受限于人工叠加的多复音城市室内场景,尚未验证真实长时录音、移动声源与混响变化下的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
669. 文本很确定、音频很多变:用数据重排让大音频语言模型并行解码
英文题目:Audio-NSP: Data-Centric Semi-Autoregressive Generation for Large Audio-Language Models
标签:#SFT #音频大模型 #高效推理 #文本到语音
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.6/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#SFT
👥 作者与机构
- Liang Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Xize Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Dongjie Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Weihao Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Fuming You:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Haifeng Hu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大音频语言模型以文本与离散音频共享自回归骨干为输入,需输出文本回答与长音频序列,其实际难点在于音频序列比文本长数个量级而逐词元解码延迟高,且文本分布尖锐而音频分布平坦熵更高,统一并行易损害保真度。为此本文提出音频下序列预测,先在监督微调回答段随机采样锚点并追加掩码块以重构训练序列,为并行提供可学习目标。接着用定制块注意力掩码隔离块间干扰并只在掩码位置计算交叉熵,使重构序列的监督信号进入模型而不增加参数。推理时以上一步块并行预测进入预测校验接受循环,按文本阈值零点八严格放行与音频阈值零点二宽松放行动态截断接受长度,直至遇到序列结束符。与多词元预测外加轻量头强制定长预测不同,该方法零结构改动且按模态解耦校验标准,避免对音频施加文本级严格阈值而退化为自回归。在LibriSpeech-clean语音识别任务评测下,Audio-NSP方法的WER为2.88%,低于VITA-MTP方法的WER 3.13%。该结论适用边界受限于VITA-Audio-Plus骨干与中英文识别、口语问答及合成语料评测,尚未验证其他音频词元器、长语音对话与真实硬件延迟,且原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
670. 当两个高降调靠音高分不开了:平顶山话里发声与时长的补位
英文题目:Beyond Pitch: Multidimensional Cue Reweighting of Two High-Falling Tones in Pingdingshan Mandarin
标签:#统计分析 #发声与构音 #社会语音学 #语音 #音频分类
评分:6.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#统计分析
👥 作者与机构
- Zhuo Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Bingliang Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiyu Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
平顶山话阳平即Tone 2与去声即Tone 4均实现为高降调,输入为28个(C)V单音节在孤立字与载体句两种条件下的发音,输出为两调类能否维持区分及所用线索权重,难点在于基频轮廓高度重叠。研究同步采集声学与声门图信号并做元音切分与嘎裂声自动检测,输出的f0、开放商、速度商、能量与嘎裂时程进入函数主成分分析与逻辑斯蒂fPCA提取时程得分。得分再由线性混合模型检验调类与年龄交互,并由条件随机森林量化相对权重,森林输出的权重排序揭示历时再分配。与以往只描述嗓音伴随低调不同,该工作把老中青三代作为历时代理变量,直接检验音高趋同下权重再分配,意义在于呈现从音高主导向多维线索竞争的逆向演变。在区分T2与T4的任务下,Creak PC1指标的β估计为10.20,高于F0 PC1指标的β估计为2.31,随机森林平均AUC超过0.97。该结论仅适用于产出端,未经感知实验证实产出与感知是否一致,且多数被试兼通标准普通话。原文未披露训练与部署成本,个体随机森林可视化见外部GitHub链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
671. 把对比解码的听觉偏置装进权重:CAAD 如何用伪真值同步蒸馏
英文题目:CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models
标签:#对比学习 #知识蒸馏 #高效推理 #音频理解
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频理解 | 主方法:#知识蒸馏
👥 作者与机构
- Chun Wei Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Tzu-Quan Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Ke-Han Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Wei-Ping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音语言模型(Speech Language Models,SLMs)以音频与文本指令为输入、以遵循指令的文本为输出,核心困难是大语言模型先验常压制声学证据,而标准知识蒸馏(Knowledge Distillation,KD)会连带复制该语言偏置。该工作提出对比音频感知蒸馏(Contrastive Audio-Aware Distillation,CAAD):阶段1由文本元数据生成伪真值(Pseudo-Ground Truth,Pseudo-GT)作为统一锚定序列,阶段2以该序列同步驱动冻结教师的音频感知正路径与屏蔽音频的文本先验负路径,再将两路径外推得到的音频感知目标蒸馏给仅训练适配器的学生。与直接拟合教师最终分布的标准蒸馏不同,该方法显式减去文本先验并放大音频独有信号,训练期保持全序列并行,推理期保持单路径。在Dynamic-SUPERB全部任务平均准确率上3B学生达到54.44%,相对标准蒸馏的50.40%提升约8%,在MCR-BENCH冲突测试中偏移值(Shift)降至79.03%。结论限于DeSTA2架构与英语为主的表达性语音指令数据,未验证跨架构与强优化学生下的有效性。训练成本为单张RTX A6000约70小时,推理采用贪婪单路径解码,原文未披露吞吐与显存。
🔗 开源资源
- 代码相关资源:https://github.com/ChenWils/Contrastive — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
672. 把查询与键值对调:让跨注意力在流式关键词检测中逐帧可用
英文题目:Streaming Open-Vocabulary Keyword Spotting via Role Swapping in Cross-Attention
标签:#注意力机制 #多模态学习 #流式处理 #关键词检测
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#注意力机制
👥 作者与机构
- Xi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Haichuan Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Liming Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
开放词汇关键词检测需在连续语音流中逐帧判断预注册文本是否出现,难点是注册文本具有全局语义而流式语音仅能提供局部因果上下文,传统以语音为键值、以注册表征为查询的数据流难以增量运行。该工作将流式语音重设为查询、将注册文本重设为键值,先由因果音频编码器与预训练文本编码器分别抽取声学与语义表征,再经跨注意力逐帧计算亲和矩阵并拼接声学上下文,最后由模式判别器输出帧级是否唤醒。第一阶段用注意力输出与文本拼接学习期望的单调对齐模式,第二阶段切换为亲和矩阵与语音拼接以优化决策边界,同时辅以双向对比学习、音素匹配与时域掩蔽难样本生成。与已有流式基线相比,该设计省去 CTC 强制对齐与启发式后处理,将对齐置信与判决学习解耦为网络可优化环节。在 LibriPhrase 困难负样本子集上,该方法取得 EER 28.21% 与 AUC 79.19%,优于所比较的 SYNASPOT-AT 与 CTCAT 基线,但在简单负样本上未全面占优。结论目前仅在英文朗读短语加噪条件下成立,未验证跨语言、远场混响、口音与真实端侧连续误唤醒行为。部署方面论文报告了单线程浮点条件下的实时率测量,显示注意力与判别环节增量开销较小,但原文未披露训练算力与端侧量化后成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
673. 自动标注不准时,可解释语音情感识别如何既挑数据又在线改标签
标签:#强化学习 #可解释性 #后训练 #语音情感识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#强化学习
👥 作者与机构
- Youjun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Xurong Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Mengzhe Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Zengrui Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Jiajun Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Guinan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Shujie Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Huimeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoning Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Chengxi Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Bowen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xunying Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可解释语音情感识别需同时输出离散情绪标签与韵律解释依据,但自动工具按统一阈值标注的语音情感描述符(Speech Emotion Descriptors,SED)可靠性低,且最优阈值随说话人年龄、性别和口音变化。本文提出后训练两步闭环:先用多层感知机置信度估计模型(Confidence Estimation Model,CEM)为每条样本的5维描述符打分并经均值池化筛选可靠子集,再在监督微调(Supervised Fine-Tuning,SFT)中用循环神经网络控制器在线采样保留或修改策略并与语音大模型交替优化。与统一阈值离线标注后全量训练的可解释基线相比,该机制把数据选择与标签修正耦合,使不可靠标签可随情绪监督信号被动态纠正。置信度估计先利用预训练语音大模型在可靠标注上推理构造正负样本对以训练估计器,再对自动标注数据计算话语级综合分数并按百分位截断保留。修正阶段以掩蔽情绪词后的情绪交叉熵变化经组内归一化作为奖励,驱动控制器与语音大模型交替更新。在IEMOCAP和MELD测试集上,90%保留加修正的最优系统相对无选择无修正基线取得2.9个百分点和3.3个百分点绝对准确率提升,相对值分别为3.7%和5.4%,在p等于0.05水平显著。该结论仅在英语会话情感数据的领域内微调设置下成立,未验证跨语言、跨域与噪声鲁棒性,原文未披露训练、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
674. 把哭腔写进文字:用副语言注入加推理约束做热线危机三分类
英文题目:Speech-based Psychological Crisis Assessment using LLMs
标签:#数据增强 #指令微调 #多任务学习 #语音 #病理语音评估
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#指令微调
👥 作者与机构
- Terumi Chiba:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyun Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Yongsheng Tong:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是从中文心理支持热线录音直接预测三级心理危机等级,输入为长达数十分钟的真实求助对话,输出为无危机、低危机与中高危机,难点在于数据稀缺、隐私受限且纯文本转写会丢失哭泣与颤抖等关键情感证据。方法先用自动语音识别将长通话转写为文本,再由语音大模型按危机三元评估表抽取情感与声学表现并以括号形式注入转写文本,形成副语言富化转写。随后微调文本大语言模型,以分类损失完成等级分类,并以生成损失同步生成三元评估表推理链作为辅助正则,前一步的富化文本直接作为本步分类与生成的输入。将长通话切分为连续五分钟短块做数据增强,测试时对同属一通呼叫的所有短块预测多数投票回呼叫级。与直接微调语音端到端模型不同,该框架把副语言信息显式文本化从而复用强文本推理能力,避免在小数据上从零训练适配器。在呼叫级5折交叉验证评测下,本框架的宏F1分数为0.802,高于SpeechLLM基线的宏F1分数0.551。结论仅适用于该私有中文热线分布与三分类口径,未验证跨中心、跨语言与实时部署的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
675. 方向重叠时只靠空间线索不够:SpkGuideDOA 用说话人引导增强定位
英文题目:SpkGuideDOA: Speaker-wise Representation Guidance for Multiple Moving Speaker Localization
标签:#注意力机制 #高效推理 #麦克风阵列 #语音 #声源定位
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声源定位 | 主方法:#注意力机制
👥 作者与机构
- Yongseok Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Davin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多移动说话人定位的输入是麦克风阵列采集的多通道混叠语音,输出是每帧各活跃说话人的到达方向与跨帧身份对应,实际难点在于说话人移动导致空间线索时变且在轨迹交叉与角度重叠时出现严重的空间-频谱交叠使双峰坍缩为单峰。SpkGuideDOA仍以直达路径信道间相位差估计与模板匹配为定位主线,先由引导生成器从多通道幅度提取说话人主导表征,再经残差门控在压缩时频分辨率上调制空间线索估计器的特征,随后分说话人独立估计相位差并模板匹配得到方向。与解耦分离加关联跟踪及声音事件联合检测定位不同,该设计将语音活动检测(Voice Activity Detection,VAD)监督限制在引导分支,并用联合排列不变训练(Joint Permutation Invariant Training,Joint-PIT)强制双解码器说话人索引一致。在仿真集评测下,SpkGuideDOA的MDR指标为4.0%,低于IPDNet的MDR指标11.2%。其适用边界是最多2说话人、受限混响与噪声的近场阵列场景,未验证更多说话人、强混响突变轨迹与开集噪声下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
676. 键盘声能泄密吗:语音预训练表示在跨键盘与 VoIP 失真下的泛化与 KAN 适配
英文题目:Impact Analysis of Speech Representation Learning Models for Acoustic Side-Channel Attack
标签:#数据集 #迁移学习 #鲁棒性 #音频安全 #音频分类
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频分类 | 主方法:#迁移学习
👥 作者与机构
- Nitin Choudhury:机构信息未能从会议 PDF 纯文本可靠映射
- Bikrant Bikram Pratap Maurya:机构信息未能从会议 PDF 纯文本可靠映射
- Arun Balaji Buduru:机构信息未能从会议 PDF 纯文本可靠映射
- Orchid Chetia Phukan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声学侧信道攻击输入为键盘敲击短音频,输出为按键标签,难点是脉冲短促易混且跨键盘硬件与VoIP编解码后谱时漂移严重。方法先系统性构建KEYAC数据集,按笔记本麦克风、手机近场与实时VoIP流三通道采集37把键盘敲击录音。再冻结Wav2Vec2、HuBERT、WavLM等六种语音预训练模型抽取帧级表征并池化为定长向量,仅训练轻量下游头做按键分类。最后在键盘留存与编解码泛化协议下对比全连接、卷积与KAN头,KAN在连接上用可学习一维样条替代固定线性权重以显式拟合复杂非线性交互。在KEYAC编解码泛化评测设置下,WavLM加KAN的准确率为58.36%,高于同骨干卷积基线的准确率45.21%。该结论限于受控采集的 37 把键盘与特定 VoIP 链路,未验证开放词汇密码推理、真实会议噪声与自适应防御下的外推。其适用边界尚未验证跨语言布局与真实会议噪声下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
677. 噪声混响下双路条件 Transformer U-Net 如何分工做音视频情感识别
标签:#多模态学习 #Transformer #鲁棒性 #音视频 #语音情感识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Hanwook Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频情感识别需从语音与人脸视频联合预测情绪类别,背景噪声与混响会破坏音频线索并导致融合失配。该方法输入为噪声混响语音波形与人脸视频剪辑,输出为离散情绪标签。音频流模块先由卷积Transformer前端在64维对数梅尔滤波器组域做时变逆滤波重构以同时抑制噪声与长混响,再与视觉流模块的卷积Transformer U-Net编码器分别抽取紧凑瓶颈表征,其中视觉支路对查询、键与值的空间维做一维快速傅里叶变换并拼接对数幅度谱分支以增强表情动态。两路瓶颈经时间压缩对齐、拼接与提示生成模块引导后送入融合情感解码器分类,同时两路辅助解码器以预测情感嵌入为条件重构中间特征并以平均绝对误差正则化表征。训练分两段:先以平均绝对误差训练前端逼近干净特征并冻结,再以交叉熵加两路重构损失联合优化双U-Net与融合解码器。在CREMA-D上融合模型达到非加权平均召回率89.14%与加权平均召回率89.11%,在RAVDESS音视子集上达到91.69%与90.97%,高于同表HiCMAE约4.2和3.7个百分点。结论仅在4秒短剪辑、MTCNN正面人脸与NOISEX-92加DEMAND加C4DM合成退化下验证,未测试遮挡、模糊、低光照与真实远场偏移。原文未披露参数量、训练硬件与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
678. 把纠缠的语音表示切开:用干预式对比后训练学出内容与说话人子空间
英文题目:Learning task-specific subspaces via interventional post-training of speech foundation models
标签:#对比学习 #后训练 #语音 #关键词检测 #说话人验证
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#对比学习
👥 作者与机构
- Jack Cox:机构信息未能从会议 PDF 纯文本可靠映射
- Jon P Barker:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为连续语音波形,输出为解耦的内容子空间与说话人子空间utterance表征,难点在于基础模型将多变量信息分布式纠缠而下游任务仅需其中部分且要求跨域不变。先冻结骨干抽取末层帧级特征并经无参数均值池化聚合,输入为波形帧序列、职责是无参聚合成单向量、输出为utterance向量,该向量直接送入子空间投影网络。再将utterance向量输入三层多层感知机映射并均分为两个384维分支,职责是分别产出内容与说话人表征,分支输出进入下一步对比约束。最后在方形重排的干预批次上施加多正样本交叉熵与正交正则,输入为分支表征与干预标签、职责是按干预标签构造对比标签分别约束内容不变与说话人不变并惩罚子空间相似、输出为解耦子空间,相对单空间监督对比学习的关键差异是每子空间独立计算对比分布并显式映射干预标签到对比标签,意义在于仅需知道干预变量即可用合成干预获得可迁移不变性。在VoxCeleb1测试集的域外说话人验证任务下,全模型说话人子空间的等错误率为24.7%,低于无子空间网络基线的等错误率38.7%。该结论适用边界受限于干净朗读合成的32说话人训练向野外自发语音迁移,词级内容泛化与真实大规模干预尚未验证,且联合训练存在信息泄露的失败条件。原文未披露训练、推理或部署成本
🔗 开源资源
- 代码相关资源:https://github.com/mjukus/interventional-post-training-speech — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
679. 真伪边界随方言漂移:ArFake 用四种合成器检验阿拉伯语音防伪
英文题目:ArFake: A Robust Framework for Multi-Dialect Arabic Speech Spoofing Detection Benchmark
标签:#基准测试 #数据集 #基准设计 #低资源 #语音伪造检测
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音伪造检测 | 主方法:#基准设计
👥 作者与机构
- Mohamed Elsetohy:机构信息未能从会议 PDF 纯文本可靠映射
- Alhassan Ehab:机构信息未能从会议 PDF 纯文本可靠映射
- Ali Mekky:机构信息未能从会议 PDF 纯文本可靠映射
- Besher Hassan:机构信息未能从会议 PDF 纯文本可靠映射
- Shady Shehata:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为多方言阿拉伯语语音与对应转写,输出为真伪二分类判决与跨生成器和跨方言鲁棒性评估,难点在于方言形态复杂、正字法不统一、数据稀缺且合成质量分布不均。方法链分为四步:先以Casablanca语料驱动FishSpeech、XTTS-v2、ArTST和VITS生成多方言伪造语音,再以分类器可分性、Whisper-large词错误率与12人主观平均意见分做真实度门控筛选高可信伪造样本。接着按受控比例混合真伪样本构造训练验证与测试集,其输出直接作为嵌入分类器与传统基线的训练输入,最后执行域内、留一生成器和留一方言三类协议评测以检验外推能力。与仅覆盖英语的ASVspoof系列和缺阿拉伯方言覆盖的MLAAD相比,该机制差异在于把方言偏移与生成器偏移显式解耦为可复用协议,具有低资源语言安全评测意义。在ARFAKE组合测试集评测下,Whisper-large的等错误率为4.88%,低于Whisper-small的等错误率5.42%。留一方言评测显示摩洛哥方言保持较高准确率而巴勒斯坦方言相对困难,表明方言泛化仍存在不均衡且需持续扩展覆盖。结论仅适用于朗读式短句且未验证野外信道、编解码与部分伪造的外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
680. 先做高资源语音识别预训练,再用三五小时做多任务多语言适配
英文题目:Towards Enabling Multilingual Multitask SpeechLLMs in Data-Scarce Settings
标签:#多任务学习 #低资源 #多语言 #语音识别 #语音翻译
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#多任务学习
👥 作者与机构
- Seraphina Fong:机构信息未能从会议 PDF 纯文本可靠映射
- Marco Matassoni:机构信息未能从会议 PDF 纯文本可靠映射
- Alessio Brutti:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为多语言语音片段,输出需同时覆盖同语种转写、向英语翻译与七类主题判定,难点在于每语言每任务仅有 3-5 小时标注且三任务共享同一段音频、声学内容平行易混淆。首先冻结 Whisper-large-v3-turbo 编码器与 EuroLLM-1.7B-Instruct 大语言模型(Large Language Model,LLM),仅在 CommonVoice 20.0 大规模 ASR 数据上预训练轻量投影器以建立声学到文本嵌入的对齐。其次固定该对齐初始化,在 SIB-Fleurs 小数据上以任务提示联合微调投影器实现多任务适配。最后对比单语与多语预训练及单语与多语微调组合,检验语言亲缘与任务泛化边界。与已有工作分离研究多语或多任务不同,该链条把高资源 ASR 对齐作为低资源多任务的必要前置。在 SIB-Fleurs 意大利语上预训练加微调将词错率(Word Error Rate,WER)降至 5.4%,远优于同设置从零训练的 129.0%,同时语音翻译(Speech Translation,ST)BLEU 从 0.8% 恢复至 48.2%、主题识别(Topic Identification,TID)准确率从 71.8% 恢复至 81.5%。结论仅适用于欧洲语系内三任务平行语料,未见跨任务零样本涌现,远亲语言仍需目标监督。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
681. 配错口音不如不配:以置信度门控守住口音自适应问答的信任
标签:#用户研究 #音视频 #语言识别 #语音对话系统 #文本到语音
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音对话系统 | 主方法:#用户研究
👥 作者与机构
- Shubhangi S. R. Garnaik:机构信息未能从会议 PDF 纯文本可靠映射
- JiHyun Jeong:机构信息未能从会议 PDF 纯文本可靠映射
- Jihoon Ryoo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
机场问询场景需同时处理带口音英语输入识别、 grounded 回答检索与拟人化语音视频输出,难点是口音误判会直接转化为用户可感知的社交错位与信任损失。所提口音自适应对话系统 LocalMATE 先以微调编码器估计用户口音并缓存10分钟会话级标签,再用自动语音识别 Whisper small 转写查询并经文本嵌入检索锁定常见问题解答 FAQ 答案。随后系统依据口音置信度决定调用口音条件语音合成 VEVO 还是在低于阈值 τ=0.34 时回退至中性美音,最后经 SadTalker 渲染唇同步 talking-face 视频。与始终个性化方案不同,该工作把不确定性门控作为一等决策,避免低置信承诺。说话人互斥 L2-ARCTIC 三分类上层加权统计平均池化 WavLM-Base-Plus 测试 Macro-F1为0.835、准确率为83.0%,摘要称85%与表格83.0%存在口径差异;分布外52条韩国口音 Speech Accent Archive 上达92.3%并显著优于注意力统计池化对照63.5%。端到端20名韩国口音英语参与者 within-participant 试验中正确适配显著提升信任与信心而错误适配显著增加摩擦,不确定回退显著缓解错配伤害。结论仅在短时机场问答、韩国口音参与者、固定顺序与固定女性化身条件下成立,未验证长程多轮、强噪声与其他口音外推。原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
682. 交叉重建看不出泄漏:用轻量探针量出语音与房间声学的分离度
标签:#评测协议 #语音 #音频编码 #说话人识别
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频编码 | 主方法:#评测协议
👥 作者与机构
- Philipp Grundhuber:机构信息未能从会议 PDF 纯文本可靠映射
- Emanuël A. P. Habets:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
混响语音声学传送需将卷积混响输入拆分为语音分区与声学分区并支持跨样本声学交换,但解码器可主动忽略错位冗余信息,致使交叉重建质量无法暴露分区间的冗余泄漏。冻结预训练声学传送编码器以固定表征,其输出经时域均值池化压缩为六十四维 utterance 向量,该向量直接送入后续探针以消除时序长度与内容波动影响。随后在语音与声学双分区上独立训练结构相同的轻量多层感知机探针,分别回归宽带与倍频程混响时间、清晰度与直达混响比并分类说话人身份,使探针精度直接反映分区信息含量而非估计器容量。最后以意图分区与非意图分区的性能差度量解耦差距,并用斯泰格相关检验与双比例检验给出统计显著性,从而将信息量原则从维度级适配到分区级。与依赖解码输出质量的已有评估不同,该框架直接度量各分区信息含量下界,可揭示输出指标盲视的不对称泄漏并为显式解耦损失提供依据。在GWAsmall与DNS5合成语音的声学传送评测下,量化N=8模型语音分区的top-1准确率为83.1%,高于声学分区的top-1准确率26.3%。结论仅适用于时不变因子与单一EnCodec血统编码器,对语言内容泄漏与跨架构普适性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
683. 同形不同意:一开口就分晓的普通话语音消歧数据集 DEBATE
英文题目:DEBATE: A Dataset for Disentangling Textual Ambiguity in Mandarin Through Speech
标签:#数据集 #数据集构建 #韵律 #语音 #音频问答
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#数据集构建
👥 作者与机构
- Haotian Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Han:机构信息未能从会议 PDF 纯文本可靠映射
- Yongfeng Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Shihao Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Weihao Gan:机构信息未能从会议 PDF 纯文本可靠映射
- Zixing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向普通话书面歧义需靠声音澄清的问题,本文构建语音消歧(disambiguation through speech,DTS)基准DEBATE,输入为歧义文本加对应朗读语音,输出为与语音意图一致的语义解释,难点在于文本相同而发音、停顿与重音不同导致语义分叉。构建链条先从开源歧义库、社交媒体关键词检索与公务员考试言语理解题三路汇集候选句并划为多音字、结构切分、语义焦点三类,再由大语言模型(large language models,LLMs)扩写并经人工筛查语法、逻辑与伦理后保留200、401、400条文本并逐句精选最优语义解释,随后由10名性别均衡、含8名青年与2名老年的母语志愿者按发音、斜杠停顿边界、尖括号重音标注录制,最后经文件对应检查、每任务随机抽10条人工质检与SenseVoice-small自动语音识别(automatic speech recognition,ASR)转写算字错率入库。全库1001条文本对应10010条音频共9.66小时。在零样本二选一评测中,Qwen2.5-Omni在结构任务准确率68.08%为最高,Gemini 2.0 Flash为68.00%,重音任务最高仅58.83%,均明显低于同协议人类听辨且跨说话人离散更大。该结论仅适用于朗读短句与受控二选一协议,未验证自发对话、噪声远场与开放式问答外推能力。原文未披露训练、推理与部署成本,未提供可核验的数据下载链接与许可证。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
684. 用文字加空间提示直接生成双耳音频:TTBA 为何要交叉排列左右声道
英文题目:TTBA: Spatial Prompted Text to Binaural Audio Generation Using Transformer
标签:#自回归模型 #知识蒸馏 #Transformer #空间音频信号 #空间音频渲染
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#Transformer
👥 作者与机构
- Changjun He:机构信息未能从会议 PDF 纯文本可靠映射
- Lianyu Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Yukun Qian:机构信息未能从会议 PDF 纯文本可靠映射
- Shiyun Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Wenjie Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Mingjiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Weiping Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到双耳音频生成需从自然语言输入产生左耳与右耳双通道波形,难点在于同时保证语义内容正确与耳间强度差和时间差等空间线索可控且稳定。TTBA先用文本编码器将描述转为语义表示,再由空间提示编码器将声源起点方向、终点方向与运动速度映射为空间嵌入并与文本做注意力融合,形成内容感知的条件。随后交叉排列的双通道离散码本将左右耳token交织输入解码器式自回归语言模型,使其在统一空间中联合建模内容与声道依赖,最后由单声道解码器分别重建波形。与先单声道生成再渲染及端到端扩散方案不同,该框架以离散token交织显式保留通道间关系,并用单声道教师蒸馏稳定内容学习。在BEWO-1M单静态评测任务下,TTBA的FDopenl3指标为104.2,低于SpatialSonic的FDopenl3指标136.33。该结论限于合成数据集的5扇区粗粒度方向与短文本提示,尚未验证真实录音、连续角度与长时运动的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://spatialaudiodemo.github.io/TTBA/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
685. 先对齐延迟再学左右耳差异:Spec2Spatial 的时频空间建模
英文题目:Spec2Spatial: A Time-Frequency Spatial Attention Network for Binaural Audio Synthesis
标签:#注意力机制 #时频分析 #空间音频信号 #语音 #空间音频渲染
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#注意力机制
👥 作者与机构
- Changjun He:机构信息未能从会议 PDF 纯文本可靠映射
- Wenjie Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Shiyun Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Lianyu Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Weiping Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Mingjiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
双耳合成需由单声道语音与7维声源位置姿态序列生成左右双通道波形,难点在于同时复现频率相关的耳间强度差与耳间时间差,且几何时延与房间混响耦合难以直接建模。Spec2Spatial先经时域弯折模块按声源到双耳距离与声速做几何时移粗对齐,输出粗对齐双通道波形并经短时傅里叶变换得到拼接频谱进入编码器。编码器由卷积下采样与耳间空间注意力网络交替堆叠,在通道与频率维做门控与能量加权以建模跨耳对应,输出多尺度空间特征进入解码端。解码端由条件融合残差网络以位置姿态经特征线性调制仿射调制频谱并融合通道注意力,逐层上采样输出左右耳复数掩膜,与弯折谱相乘后经逆变换重建波形。相对已有时域扩散与频域位移方法,该链条把几何时延显式前置,再以注意力学习残余耳间差异并以位置调制约束频谱,因而更直接对应强度差与时间差的物理成因。在Binaural Speech数据集评测设置下,Spec2Spatial的MRSTFT指标为1.174,低于NFS的MRSTFT指标1.241。该结论适用边界受限于KEMAR人头1.5米近场录音与已知位置条件,跨房间与跨数据集泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://spatialaudiodemo.github.io/Spec2Spatial/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
686. 不用标准答案也能学写声音描述:用成对偏好把音频字幕拉向人意
标签:#偏好优化 #强化学习 #主观评测 #音频字幕生成
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频字幕生成 | 主方法:#强化学习
👥 作者与机构
- Kartik Hegde:机构信息未能从会议 PDF 纯文本可靠映射
- Rehana Mahfuz:机构信息未能从会议 PDF 纯文本可靠映射
- Yinyi Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Erik Visser:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频字幕生成需以环境声音为输入、以自然语言描述为输出,面临时序结构模糊、同一声场景可多语义粒度描述及传统n-gram指标与人类感知弱相关的难点。本文先用预训练CLAP音频与文本编码器抽取512维嵌入并拼接为1024维联合表示,经隐藏层为512与128的两层网络输出区间为
\[0,1\]的标量奖励,以Bradley-Terry损失在成对人类偏好数据上训练以捕捉细粒度偏好概率。接着冻结该奖励并以自临界序列训练策略梯度对CNN10编码器加Transformer解码器的15M参数基线模型做强化微调,无需真值标注,同时以期望长度为基准的长度惩罚重塑奖励以抑制超长与重复投机。与直接优化对比相似度(CLAPScore)或共识指标(Consensus-based Image Description Evaluation,CIDEr)不同,该链路用偏好概率替代真值监督并保留轻量解码结构。在自有数据集挑战划分上强化后模型人类胜率达59.11%,相对基线40.89%提升显著,同时在AudioCaps挑战划分胜率达53.93%,相对基线46.07%提升明显。该结论主要适用于基线质量较差或不自然的困难样本,在非困难样本上增益微弱甚至为负,且未在更大模型上验证。原文未披露训练、推理或部署成本实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
687. 语音推理掉链不是听不清,而是没绑住:实体绑定失败与显式枚举修复
英文题目:Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention
标签:#评测协议 #语音大模型 #模型评估 #语音 #音频问答
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#评测协议
👥 作者与机构
- Ming-Hao Hsu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaohai Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhizheng Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音大语言模型(Speech Large Language Model, SLLM)可直接处理语音输入,但在复杂推理上持续弱于文本对应物。本文将语音到文本(speech-to-text, S2T)与文本到文本(text-to-text, T2T)的模态差距按任务拆解,发现差距并非均匀认知缺陷:在空间导航、句法排序、事实理解上S2T与T2T基本可比,在需要实体追踪的逻辑任务web of lies上S2T坍缩至 chance 附近,而T2T高达约90%。作者诊断此为实体绑定失败(entity binding failure):编码器的时间池化与下采样保留全局语义但平滑了离散token边界,导致隐式推理中无法维持特定实体与其变化状态的严格对应。为因果验证该诊断,提出实体感知思维链(Entity-Aware Chain-of-Thought, EA-CoT):推理时强制模型先枚举全部人物形成文本锚点,再逐条记录人物与陈述的对应关系,最后依序消解真假链并按格式抽取答案,把脆弱的隐式声学追踪外化为稳定的显式文本引用。在VoiceBench逻辑子集上,Phi-4-Multimodal语音准确率提升24.4个百分点,Qwen2.5-Omni提升13.2个百分点,且是唯一语音增益超过文本增益的类别。名字扰动、通用思维链无效、声学重型基准无增益等对照共同支撑瓶颈在语义绑定维持而非单纯语音识别错误。代价是生成长度从256扩展至1024 token,延迟显著增加,且结论仅适用于文本能力本身较强、瓶颈在语义绑定的任务。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
688. 又快又稳:把一致性约束铺满非自回归精修的每一步
标签:#CTC #正则化 #半监督学习 #语音 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#正则化
👥 作者与机构
- Wanting Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Weiran Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为英语朗读语音声学帧序列,输出为子词级转写文本,难点在于低资源下联结时序分类(Connectionist Temporal Classification,CTC)条件独立假设鲁棒性差,而非自回归(Non-Autoregressive,NAR)精炼又对扰动敏感。方法链分三步:先对同一语句做两次独立随机种子的频谱增强(SpecAugment)得到双视图,再经共享 Conformer 编码器与 CTC 头加 2 步 Transformer 解码器做迭代对齐精炼,最后在有监督真值与在线伪标签上联合优化 CTC 似然与双向对称 KL 一致性损失。相比仅正则化 CTC 的 CR-CTC,差异在于对基座步骤 \(s=0\) 与每次精炼步骤 \(s=1,2\) 同时施加一致性约束,并用终步结果生成伪标签,兼顾并行解码速度与标签依赖建模。在 LibriSpeech 的 LS-100 测试集上,方法将 clean/other 词错率(Word Error Rate,WER)从 12.2%/26.7% 降至 10.0%/22.9%,LS-960 上从 4.3%/9.9% 降至 3.3%/7.4%。LS-100 加 960 小时无标注自训练后进一步降至 4.3%/9.6%,再加 Libri-Light 6000 小时降至 3.8%/9.1%;LS-960 加 6000 小时降至 2.5%/5.7%。结论限于英语朗读、无语言模型融合的贪婪解码,未验证噪声、口音、流式与跨语言外推。原文未披露优化器、学习率、批量大小与训练推理成本,仅声明用生成式 AI 做语言润色。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
689. 编辑改对了吗、没改的地方保住了吗:用差异与共性分开讲清音频编辑评价
标签:#指令微调 #模型评估 #可解释性 #音频质量评估
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频质量评估 | 主方法:#指令微调
👥 作者与机构
- Yuhang Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Xu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Enzhi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频编辑评估需同时输入原始音频、编辑后音频、原始描述与编辑指令,输出总体质量、编辑有效性与未改动保持度,而现有客观指标缺乏参考真值且多模态大模型缺少跨音频联合推理能力。本文先在30000条伪平行对上微调Qwen2-Audio-7B-Instruct使其生成差异描述与共性描述,再验证其准确率与主客观指标的相关性并据此合成Edit score与Faith score,最后用七步思维链提示与40条人工精修样本的轻量指令微调生成结构化自然语言评估。与传统1-5分预测不同,该链条把感知、复述期望、对比判断与综合建议显式分离,使评估过程可审计。在AuditScore测试集上Edit score与人类编辑有效性评分的线性相关系数达到0.7652,超过专用监督基线AuditEval-ssl的0.6196。该结论目前仅在混合重排合成的加删改数据与23个系统的英文评测上验证,对真实录音、韵律音量等声学一致性与长音频的外推尚未证明。原文未披露训练时长、推理成本与解码参数。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
690. 不用新采集也能读混语唇语:用拼接伪造语码切换再轻量适配
英文题目:Cross-Lingual Compositional Learning for Code-Switched Lip Reading
标签:#数据增强 #LoRA #跨语言 #多语言 #静默语音接口
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#静默语音接口 | 主方法:#数据增强
👥 作者与机构
- Jeonghyeon Joo:机构信息未能从会议 PDF 纯文本可靠映射
- Jiyoung Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
码切换唇读以静默人脸视频为输入,输出中英文混排的字符与单词序列,难点在于真实码切换视觉语料稀缺且单句内语言边界模糊易混淆。该工作从现有中英文单语库各抽一段视频并按均匀随机语序做时域拼接,同步拼接对应文本以构造伪码切换样本,再用三维卷积加视觉Transformer前端提取帧级特征,随后以共享低秩适配器微调预训练多语言编码器解码器,最后在真实码切换语料与伪语料上联合优化。与依赖语言标识路由或语言专家隔离建模的码切换语音识别思路不同,该方法利用视素跨语言共享的构音共性,坚持单组共享参数以避免破坏原有多语言表示。在英中码切换基准CSLR上混合错误率降至16.48%,相对最强基线MoE+CTC的37.54%下降超20个百分点,同时在已见中文集与未见英文集上缓解灾难性遗忘。该结论仅在中英双语短句与拼接式伪数据范围内验证,对自然语内频繁切换与长时韵律过渡的外推尚未证明。原文未披露训练时长与推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
691. 听不清电话时在听者端重建语音:Coco-VC 的鲁棒流式转换
英文题目:Coco-VC: Degradation-Robust Streaming Voice Conversion System on the Listener Side
标签:#知识蒸馏 #鲁棒性 #流式处理 #语音转换
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音转换 | 主方法:#知识蒸馏
👥 作者与机构
- Ryo Kato:机构信息未能从会议 PDF 纯文本可靠映射
- Ryutaro Matsunaga:机构信息未能从会议 PDF 纯文本可靠映射
- Toshio Imamura:机构信息未能从会议 PDF 纯文本可靠映射
- Akinori Maeda:机构信息未能从会议 PDF 纯文本可靠映射
- Shuhei Takahara:机构信息未能从会议 PDF 纯文本可靠映射
- Shinnosuke Takamichi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
听者侧流式语音转换需将8 kHz重度退化电话语音实时转为清晰目标音色语音,难点在于编解码伪影、信号失真、混响与加性噪声相互叠加,且说话人音色与退化条件均不可预知。第一步由冻结的ContentVec与Whisper双教师在16 kHz干净语音上提取并融合说话人无关韵律特征与鲁棒语言特征,形成理想目标表示。第二步因果ConvNeXt学生编码器以20 ms帧为单位处理经电话退化流水线动态损坏的8 kHz输入,直接预测上述融合特征,使其输出在进入下一步之前已同时完成语音增强与内容解耦。第三步轻量Vocos解码器将学生特征合成为目标说话人波形,相较沿用单自监督教师的StreamVC编码器,双教师蒸馏与非对称干净教师加退化学生的训练赋予了更强的可懂度保持能力与低延迟可部署性。在模拟噪声电话FLEURS-8k评测设置下,Coco-VC的WER为0.338,低于StreamVC的WER 0.451。在干净VCTK语音条件下其主观质量优势更为明显,而可懂度略有回落,体现了严重噪声下优先保可懂度的权衡。该结论适用边界限于公开仿真与作者自建投诉电话仿真,尚未验证真实通话、多语言与丢包条件下的泛化能力。部署方面该原型在消费级笔记本上实现约80 ms端到端延迟,算法延迟恒定为40 ms,满足实时通话的硬件与延迟要求。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
692. 日常闲聊里藏着呼吸信号:SpiroPhonia 用自发语音做 COPD 筛查
英文题目:SpiroPhonia: Non-Invasive Respiratory Health Assessment from Spontaneous Speech
标签:#语音生物标志物 #数据集 #统计分析 #语音 #病理语音评估
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Roksana Khanom:机构信息未能从会议 PDF 纯文本可靠映射
- Shafia Supty:机构信息未能从会议 PDF 纯文本可靠映射
- Nirupam Roy:机构信息未能从会议 PDF 纯文本可靠映射
- Ashok Agrawala:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务以日常自发对话语音为输入,输出说话人是否存在慢性阻塞性肺疾病及相关慢性呼吸疾病(Chronic Obstructive Pulmonary Disease, COPD),难点在于内容与韵律自由变化、信道噪声及说话人特质会淹没微弱呼吸损伤信号。其方法链分为四步:先对网络访谈语音做语音活动检测(Voice Activity Detection, VAD)清洗与分段,再并行提取声学微扰、频谱包络与呼吸节律三类特征,接着经统计检验与去冗余筛选保留判别性子集,最后按分类器独立做递归特征消除(Recursive Feature Elimination with Cross-Validation, RFECV)并在被试独立划分上评估。与依赖持续元音或朗读的受控范式不同,该工作强调免配合的被动监测与生理可解释的紧凑标志物,具有向手机与智能音箱迁移的实际意义。在201人自发语音数据集的41人独立测试集上,随机森林(Random Forest, RF)达到87.14%的曲线下面积(Area Under Curve, AUC),梯度提升(Gradient Boosting, GB)以80.00%的F1分数和85.71%的敏感性占优,线性支持向量机(Support Vector Machine, SVM)仅用5个特征保持85.00%的高特异性。结论仅适用于英语中老年访谈类语音,患者标签未经肺功能金标准验证,跨语言、跨设备与纵向恶化跟踪均尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
693. 真人读错比合成错更值钱:IQRA 2026 如何把阿拉伯语发音评估推高 0.28
标签:#基准测试 #数据集 #基准设计 #语音 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Yassine El Kheir:机构信息未能从会议 PDF 纯文本可靠映射
- Ahmed Ali:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该挑战研究MSA的误读检测与诊断(Mispronunciation Detection and Diagnosis, MDD),输入为朗读语音与带元音符号的参考文本,输出为实际发音的音素序列并据此判定接受与拒绝,难点在于咽化对立、喉音、长短元音区分及方言干扰导致的系统性偏误。组织方统一68音素库存与Halabi音素化流程,提供真实朗读、合成误读与新增真实误读训练语料,在扩展评测集QuranMB.v2上以F1为主指标排序。参赛主流链条分三步衔接:先由自监督语音编码器抽取帧级声学表示,其输出送入时序建模器学习音素对齐,再经联结时序分类(Connectionist Temporal Classification, CTC)解码为音素序列,最后用语言模型重打分或多检查点融合校准接受与拒绝判定。与首届纯合成监督相比,本届关键差异是用小量真实误读做课程微调与标签清洗,直接弥合合成失真与真实发音偏差,实际意义在于提升对真实错误的诊断精度。在QuranMB.v2上冠军系统F1达到0.7201,较组织方基线0.4414绝对提升0.2787。结论仅适用于古兰诵读主导的MSA朗读场景,未验证自发口语、二语学习者与跨方言泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
694. 先翻译再转写:用四段课程把 Whisper 拉向希腊方言
英文题目:Beyond Standard Greek: Adapting Whisper for Greek Dialects through Curriculum Multitask Learning
标签:#课程学习 #多任务学习 #低资源 #语音识别 #语音翻译
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#课程学习
👥 作者与机构
- Antigoni Klimi:机构信息未能从会议 PDF 纯文本可靠映射
- Dimitrios Damianos:机构信息未能从会议 PDF 纯文本可靠映射
- Stavros Bompolas:机构信息未能从会议 PDF 纯文本可靠映射
- Vivian Stamou:机构信息未能从会议 PDF 纯文本可靠映射
- Stella Markantonatou:机构信息未能从会议 PDF 纯文本可靠映射
- Vassilis Katsouros:机构信息未能从会议 PDF 纯文本可靠映射
- Georgios Paraskevopoulos:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理希腊方言自动语音识别,输入为塞浦路斯、克里特、麦西尼亚方言语音,输出为方言转写文本,难点在于转写稀缺、正字法不统一以及与标准现代希腊语的音系词汇偏离。方法为四阶段课程多任务流水线:阶段0仅用标准希腊语到英语语音翻译建立跨语言声学语义对齐,阶段1以概率混合标准语识别与方言翻译实现领域初切换,阶段2转为方言识别为主并保留方言翻译作正则,阶段3收敛为纯方言识别专项优化。与联合多任务或随机课程不同,该设计同时调度监督类型与数据域,避免早期直接拟合稀疏方言转写,从而缓解分布失配与优化不稳定。在塞浦路斯语测试集下,课程训练方法的词错误率(Word Error Rate, WER)为24.89%,低于直接微调基线的词错误率(Word Error Rate, WER)33.93%。同一large-v3配置在克里特语与麦西尼亚语上亦保持增益,表明翻译正则与施主语言预对齐在低资源下具互补作用。该结论适用边界受限于南部方言区三个相对温和变体,尚未验证北部及土耳其语和意大利罗曼语接触型高偏离变体。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
695. 要逐字听见犹豫,又不能忘记通用语音:持续学习引入不流利标记的权衡
英文题目:Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR
标签:#持续学习 #可解释性 #语音 #语音识别
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#持续学习
👥 作者与机构
- Henri-Leon Kordt:机构信息未能从会议 PDF 纯文本可靠映射
- Theresa Pekarek Rosin:机构信息未能从会议 PDF 纯文本可靠映射
- Jae Hee Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Stefan Wermter:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为含填充词、重复修正、中断和停顿的自发与病理语音,输出为保留不流利标记的逐字转写,难点在于主流识别系统倾向清洗输出并在小数据适配时遗忘通用能力。该工作先在预训练骨干中引入填充词、重复、中断和停顿四类标记并在马来西亚英语语料上微调以建立标记发射机制,其输出的带标记检查点作为后续持续学习的统一起点。接着以选定检查点为起点在Pitt和Delaware语料上按固定顺序适配以模拟域漂移,并对比弹性权重巩固、经验回放、梯度投影与权重平均在记忆稳定性和学习可塑性上的差异。最后用解码器交叉注意力头重要性排序与置零掩膜消融检验标记是否形成专用回路,成功学习标记的方法共享同一小组交叉注意力头且掩膜可选择性抑制标记发射而基本不损伤通用字错率。在Pitt和Delaware顺序适配后的三数据集联合评测下,经验回放的A-F1为0.49±0.01,高于直接微调的A-F1 0.39±0.02。该结论仅在单骨干、单语英语TalkBank序列和固定任务顺序下验证,对其他架构、语言与增量顺序的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
696. 德拉威语为何更难解码:从词形稀疏到加权注意力与自条件反馈
英文题目:Overcoming Decoder Inconsistencies in Whisper for Dravidian and Low-Resource Languages
标签:#注意力机制 #低资源 #多语言 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#注意力机制
👥 作者与机构
- Chowdam Venkata Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Kumud Tripathi:机构信息未能从会议 PDF 纯文本可靠映射
- Pankaj Wasnik:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理多语言自动语音识别中Whisper在达罗毗荼语上词错误率显著高于印欧雅利安语的问题,输入为连续语音声学特征,输出为对应文字转写,难点在于黏着形态导致的长词、低复现与高类型词符比引发的词表稀疏与字符级替换。方法链分为三步:先以语料统计与已知词内替换分解定位形态稀疏与解码不一致,再以加权注意力门控动态融合自注意力与交叉注意力输出以平衡语言上下文与声学线索,最后在倒数第二解码层以自条件将中间预测经线性映射回注并辅以辅助交叉熵损失来增强序列一致性。与以往用于量化去离群点的门控注意力或用于非自回归编码器加速的自条件不同,本工作将两者置于自回归Whisper解码器训练与推理全过程。在Kathbath 8语评测设置下,联合模型的WER为15.53%,低于有形态切分基线的WER 17.18%。结论限于 Whisper-medium 为主的微调与所测印度8语及韩语和斯瓦希里语验证,跨架构外推与无形态切分下的独立增益尚未充分验证。原文披露新增参数不足1%、训练开销增加2%至3%、推理延迟增加不足2%,未披露绝对训练时长与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
697. 重度构音障碍语音并非不可建模:21 小时单人数据如何让常规与大模型都学会
英文题目:Investigating ASR for Low-Intelligibility Dysarthric Speech
标签:#SFT #言语障碍 #语音 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#SFT
👥 作者与机构
- Jinuk Kwon:机构信息未能从会议 PDF 纯文本可靠映射
- Beiming Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Carl Sigmond:机构信息未能从会议 PDF 纯文本可靠映射
- Kristin Teplansky:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
重度构音障碍自动语音识别任务以严重畸变的连续声学语音为输入,需输出对应的文本转写,其实际难点在于运动控制受损导致发音不一致、元辅音扭曲与韵律异常,且在会话语音中退化更剧,加之重症单人长时数据稀缺使可学习性长期存疑。为此方法分三步推进:先以单名可懂度仅20.9%的受试者约21.6小时朗读与自发语料构建说话人相关BLSTM-HMM声学与语言模型以建立可控基线;再将同一训练划分输入大规模预训练Whisper做监督微调以习得个性化重症声学-音素规律;最后将微调后模型直接迁移至TORGO未见说话人评估跨严重度泛化。相比直接使用通用预训练模型,该链条的关键机制差异在于用足量单人数据证明重症畸变是可学习的结构性模式并实现向同严重度他人的选择性迁移,具有支撑辅助沟通的实际意义。在自采测试集上微调后 medium.en 版 Whisper 词错误率(Word Error Rate,WER)降至10.5%,而在 TORGO 重症子集上平均相对微调前改善6.4个百分点且轻中度基本未退化。结论仅适用于与微调源严重度相近且基线未极端恶化的说话人,对基线 WER 超80%的极重度与自然对话场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
698. 不用真标签做说话人确认:用多层一致挑出可信伪标签,再把不可信样本当无标签蒸馏
标签:#知识蒸馏 #自监督学习 #预训练 #语音 #说话人验证
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#自监督学习
👥 作者与机构
- Yishuang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Wanli Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Weihao Gan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自监督说话人验证(Self-supervised Speaker Verification,SS-SV)输入为无标注语音段,输出为说话人嵌入与验证得分,难点在于聚类伪标签含噪且低置信样本难以利用。方法链分三步推进:先在验证试验上按层等错误率筛选最具说话人判别力的预训练模型层并独立聚类,再经匈牙利匹配对齐簇标识并保留跨层一致样本为高置信集,其余划为无标注集,最后对高置信集用标签噪声校正损失做伪监督,同时对无标注集用指数滑动平均教师提供软目标并施加双视图一致性约束。与仅用单层伪标签训练相比,该设计以跨层共识过滤噪声,并以自蒸馏复用低置信数据而非丢弃或强制硬标签。在VoxCeleb2 dev无标注训练并在VoxCeleb1-O评测时,4轮迭代后等错误率达1.09%,相对预训练模型加标签校正基线1.25%降低约12.8%。该结论目前仅在VoxCeleb系列近场英语场景验证,未覆盖跨语言、强噪声与短时等外推条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
699. 用方向角给重叠语音加一把尺子:空间增强的序列到序列会议日志
英文题目:Spatially-Augmented Sequence-to-Sequence Neural Diarization for Meetings
标签:#会议转录 #多模态学习 #麦克风阵列 #说话人分离标注 #声源定位
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#多模态学习
👥 作者与机构
- Li Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
会议说话人分离标注需从远场录音输出谁在何时说话,难点是重叠下声学嵌入不可靠且混响噪声严重。所提空间增强序列到序列神经分离标注(Spatially-Augmented S2SND,SA-S2SND)先用因果卷积循环网络学习直达路径相位差并经迭代检测移除输出方位角谱,再将该谱上采样投影后以残差方式注入Conformer编码器表征,保留原双解码器分别预测语音活动与说话人嵌入。多通道版本在提取器后加入跨通道注意力Transformer聚合各通道帧嵌入。与盲通道融合不同,该方法将显式方向先验作为位置编码注入,使时间重叠但空间分离的说话人更易区分。在AliMeeting测试集上,中型单通道模型结合复合训练数据加方向辅助后离线分离错误率(Diarization Error Rate,DER)为10.40%,优于同设置基线11.33%,相对降低约8.2%。该结论目前仅在8通道圆形阵列坐席会议验证,对移动说话人、每帧超2人重叠及非匹配阵列的外推尚未证明。原文未披露训练时长与推理吞吐成本。
🔗 开源资源
- 第三方资源:https://github.com/fgnt/nara_wpe — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
700. 离散音频令牌记得住说话人却不会用:跨特征蒸馏把嵌入空间对齐回来
英文题目:Text-Independent Speaker Verification Using Discrete Audio Tokens
标签:#知识蒸馏 #向量量化 #语音 #说话人验证
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#知识蒸馏
👥 作者与机构
- Zheng Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Junjie Li:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本无关自动说话人验证(Text-Independent Automatic Speaker Verification)需从任意文本语音中抽取稳定的说话人表示,输入为连续波形或特征,输出为超球面说话人嵌入(Speaker Embedding),难点在于神经音频编解码器(Neural Audio Codec,NAC)离散令牌高度压缩且失去频谱局部相关性。所提跨特征知识蒸馏(Cross-Feature Knowledge Distillation,CFKD)先用80维对数滤波器组(Filterbank,Fbank)训练教师模型以获得结构良好的嵌入空间,再将 EnCodec 残差向量量化(Residual Vector Quantization,RVQ)多层码本嵌入求和并经线性映射为学生输入,最后以余弦相似度损失对齐师生嵌入方向并与分类损失联合优化。与直接用交叉熵训练令牌模型相比,该方法用连续谱几何提供稠密监督而非稀疏硬标签。诊断对比显示重建滤波器组仅轻微退化,证实令牌瓶颈在于信息可及性而非信息丢失,故蒸馏聚焦于嵌入空间几何对齐。在 VoxCeleb1开发集训练并在 Vox1-O 评测时,ECAPA-TDNN1024学生等错误率(Equal Error Rate,EER)从3.38%降至2.25%,接近教师的2.21%。结论仅在 VoxCeleb 英文名人访谈及 EnCodec 令牌上验证,低码率与跨编解码器外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
701. 选项顺序会改变答案:大音频语言模型的位置偏置从何而来
英文题目:Hearing the Order: Investigating Position Bias in Large Audio-Language Models
标签:#评测协议 #音频大模型 #鲁棒性 #音频问答
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#评测协议
👥 作者与机构
- Yu-Xiang Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Chen-An Li:机构信息未能从会议 PDF 纯文本可靠映射
- Sheng-Lun Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Po-Chun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Hsin-Hsi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究大型音频语言模型在四选一多选题中的位置偏置,输入为音频或文本形式的问题加四个候选选项、输出为选项标识,难点在于模型可能依赖答案位置而非语义内容决策从而导致评测失真。方法链第一步将MMAU test-mini、MMAR与MMLU过滤为恰好四选项且时长不超过180秒的子集以保证可比性与可处理性,其输出的文本题库直接进入第二步。第二步用GPT-4o mini TTS将文本问题与选项合成为SPEECH-MMAU、SPEECH-MMAR与SPEECH-MMLU,形成文本与语音配对的六个评测集以分离模态效应。第三步把正确答案系统重排到A、B、C、D各位置并随机打乱干扰项以测量位置敏感性,再对循环置换与全置换的多种顺序分别推理并多数投票以获得稳健评估。与已有文本与视觉位置偏置研究的关键差异在于本文首次在音频模态下分离标识符效应、基座文本模型继承效应与语音引入的模态效应,具有评测框架意义。在MMAU基准下,Phi-4-multimodal全置换多数投票的准确率为69.24,高于原始顺序的准确率65.27。结论的适用边界受限于四选项英文多选题与短于180秒的合成语音样本,开放式问答、更多选项数、真实录音与其他语言的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
702. 语音准而音乐弱:WQ-Fusion 用门控动态路由调和 Whisper 与 Qwen
英文题目:WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation
标签:#注意力机制 #模型融合 #统一音频模型 #音频分类
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#注意力机制
👥 作者与机构
- Mingda Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Xinyue Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Tiantian Xiong:机构信息未能从会议 PDF 纯文本可靠映射
- Hanchen Pei:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jingdong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jacob Benesty:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨域音频编码要求同一表征同时处理语音、环境声与音乐三类异构信号,输入为原始音频,输出为下游分类与理解所需的通用向量,难点在于语音音素结构与音乐谐波、事件瞬态在谱时特性上冲突,单一编码器难以兼顾。该文方法链分四步:先冻结语音弱监督的Whisper-large与语义推理见长的Qwen2-Audio-7B作互补基座,再由自适应特征调制对两路特征做归一化与动态缩放平移以对齐分布,随后叠加旋转位置编码与可学习模块嵌入以区分时序与来源,最后经单层门控Transformer做元素级动态路由。前两步输出的对齐特征进入位置与来源标注阶段,形成沿时序拼接的融合序列,为注意力提供可辨识的时序与基座来源信息。与静态拼接相比,关键差异是将查询投影扩展为查询加门控的联合投影,并以门控掩码逐维度抑制或增强注意力输出,从而实现上下文相关的特征选择,避免固定权重在波动声学场景下误用互补信息。在Interspeech 2026 Audio Encoder Capability Challenge Track A统一生成式评测下,完整WQ-Fusion系统的总体得分为0.836,高于最强单编码器Qwen的总体得分0.796。该结论受限于冻结基座加轻量适配器的赛事协议,尚未验证开放域推理、噪声混响与跨语言外推下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
703. 位深越高越难压:Trilobyte 把样本拆成字节做无损压缩
英文题目:Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio
标签:#自回归模型 #Transformer #音乐 #语音 #音频编码
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频编码 | 主方法:#自回归模型
👥 作者与机构
- Phillip Long:机构信息未能从会议 PDF 纯文本可靠映射
- Zachary Novack:机构信息未能从会议 PDF 纯文本可靠映射
- Chris Donahue:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为全保真脉冲编码调制波形,输出为可精确还原的压缩比特流,难点在于样本级词表随位深指数膨胀,16位需65536类而24位达1677万类,导致嵌入与输出层参数爆炸而不可训练。方法第一步将有符号样本偏移为无符号整数并按高有效位到低有效位拆为字节序列,使词表恒为256,其输出的字节序列直接作为下一步的建模对象。第二步用因果解码器-only变换器建模字节条件概率以捕捉长程与跨通道依赖,其输出的逐位置概率分布进入下一步编码器。第三步将概率送入算术编码器逐符号收窄区间以逼近香农熵极限,训练负对数似然直接对应期望码长。相对FLAC固定几何分布的Rice编码与样本级建模,该机制把词表复杂度从O(2^b)降为O(1),代价是序列长度变为原来的⌈b/8⌉倍,从而首次实现可处理的24位建模。在24位商业音乐评测设置下,Trilobyte的压缩率为1.48x,低于FLAC的压缩率1.63x。该结论适用边界受限于所测音乐、语音、生物声学和音效语料与约90M参数及44.1kHz重采样条件,向更高采样率、多通道混音与噪声主导母带的外推尚未验证。推理开销方面,原文仅说明基于预训练Llama-2-7B的上下文压缩方法慢到难以处理而只在每数据集随机采样的1024个样本块上评测,Trilobyte自身的硬件与吞吐实测缺失。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
704. 不存旧数据时如何留住旧能力:用蒸馏定方向、用投影让路的持续语音识别
标签:#持续学习 #知识蒸馏 #领域适应 #多语言 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#持续学习
👥 作者与机构
- Seunghee Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Junseok Oh:机构信息未能从会议 PDF 纯文本可靠映射
- Ji-Hwan Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向预训练自动语音识别(Automatic Speech Recognition,ASR)模型的序列领域自适应,输入为新领域语音与历史模型参数,输出为兼顾新领域转写与历史领域及多语言能力的统一模型,难点在于无回放、无重要性估计时蒸馏目标含噪且与监督目标冲突。该方法先冻结编码器并仅适配解码器以降低遗忘面,再由冻结教师计算逐词元熵并生成置信加权蒸馏损失以提纯保持梯度,最后检测监督梯度与保持梯度的余弦冲突并仅在冲突时削弱反向分量后相加更新。与固定均匀蒸馏的无遗忘学习相比,该机制把保持信号从标量混合改为方向性约束,并对不可靠教师词元降权。在LibriSpeech到AMI到TED-LIUM到SPGISpeech序列终点,最终平均词错率(Word Error Rate,WER)为8.12%,相对无遗忘学习 decoder-only基线的8.75%降低7.2%,后向迁移(Backward Transfer,BWT)从-4.63改善至-2.82,Common Voice多语言平均退化从1.96%降至0.95%,相对减少51.5%。结论限于英语朗读、会议、讲座和金融四域固定顺序及Whisper Large-v3解码器微调,未验证语种扩展、乱序任务和长期多轮遗忘。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
705. 单比特脉冲下做双谱增强:GSU-DBNet 为何只留一个门
英文题目:Neuromorphic Speech Enhancement with Dual-Branch Spiking Neural Networks
标签:#RNN #高效推理 #语音 #语音增强
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#RNN
👥 作者与机构
- Taiyu Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Wenbin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyi Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhan Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyi Yin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从含噪观测恢复干净语音波形与相位谱,脉冲神经网络受二值发放与事件驱动约束而长期落后于传统人工神经网络。先将含噪语音经短时傅里叶变换得到的实部虚部与幅度三通道谱输入编码器,由三块卷积加卷积注意力模块负责时频压缩与通道增强,输出紧凑时频特征。再将该紧凑时频特征送入由两个堆叠双路径门控脉冲单元构成的分离器,由双向门控脉冲单元在频率路径捕获全局谱相关、单向因果门控脉冲单元在时间路径建模时序依赖并经线性投影与残差融合,输出解耦的时频分离特征。最后将该分离特征送入双分支解码器,由复数DeepFilter分支估计复数掩模实现相位感知重构、幅度掩模分支估计能量包络并经加权平均融合与逆变换,输出增强语音波形,单遗忘门设计将循环层参数减半并保留二值脉冲传输。相对时域均匀施加脉冲单元与延续长短时记忆的已有方法,该跨域联合建模与双分支互补融合在保持稀疏发放的同时弥合了幅度与复数谱的信息割裂,具有参数高效与神经形态兼容意义。在VoiceBank+DEMAND基准测试集下,GSU-DBNet的PESQ为3.04,高于TSTNN的PESQ 2.96。结论目前仅限该英语小规模非严格因果评测,未验证跨语种、强混响与低信噪泛化,未提供神经形态硬件实测。
🔗 开源资源
- 演示资源:https://meng-taiyu.github.io/dpnet-demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
706. 人类标注超过二十小时后,G2P 规模为何不再带来稳健性
英文题目:Scaling Human and G2P Supervision for Robust Phonetic Transcription
标签:#课程学习 #语音学与音系 #语音 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#课程学习
👥 作者与机构
- Alexander Metzger:机构信息未能从会议 PDF 纯文本可靠映射
- Aruna Srivastava:机构信息未能从会议 PDF 纯文本可靠映射
- Ruslan Mukhamedvaleev:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为母语、非母语及卒中后失语症英语语音,输出为国际音标(International Phonetic Alphabet,IPA)音素序列,难点是口音变异大、病理语音不成词且专家标注稀缺昂贵。方法采用四阶段课程:第一步自监督预训练在数万小时无标注多语语音上学习跨语言声学表示,其检查点直接作为第二步的初始化。第二步以多语言ASR微调引入说话人与方言多样性而不引入规范发音偏置,其输出的声学模型再进入G2P扩量阶段。第三步先用G2P由正字法转写生成近似音素标签扩量,再由第四步以40.81小时人工音素标注微调校准,使模型对齐真实误读与非典型实现。与依赖G2P大规模生成规范发音标签的路线不同,该路线避免向标准发音坍缩,保留对误读与非典型实现的敏感性。在TIMIT、EpaDB、PSST、Speech Ocean已知说话人未见测试集与ISLE未见德意口音测试集上,最优课程相对已有最强基线将平均加权音素特征错误率(Weighted Phone Feature Error Rate,WPFER)从8.1%降至3.5%,约2.3倍降低,失语症PSST从25.8%降至5.3%。人工量低于20至30小时时5.3K小时G2P仍有最多约4个百分点增益,超过后无显著增益甚至损害域外泛化。结论仅在英语17种方言与失语症范围内验证,原文未披露训练推理成本与延迟。
🔗 开源资源
- 代码相关资源:https://github.com/KoelLabs/ML.that — 链接不可用(HTTP 404)
- 模型相关资源:https://huggingface.co/KoelLabs — 暂时无法访问
- 数据相关资源:https://github.com/KoelLabs/ML.that — 链接不可用(HTTP 404)
- 复现相关资源:https://github.com/KoelLabs/ML.that — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
707. 不看目标语言也能认情绪:用跨语言拉齐加去说话人学情绪判别表示
标签:#对抗训练 #对比学习 #跨语言 #零样本 #语音情感识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#对比学习
👥 作者与机构
- Jinyi Mi:机构信息未能从会议 PDF 纯文本可靠映射
- Ding Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Toda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本跨语言语音情感识别的输入为源语言与辅助非目标语言的带标注语音,输出为未见目标语言的happy等四类情感标签,难点在于语言韵律文化差异与说话人捷径导致的分布失配。先由与源语言匹配的wav2vec 2.0接收源语言与非目标语言语音并提取帧级表示再均值池化为句向量,再将该句向量送入监督对比分支按语言感知权重拉近跨语言同情感样本并推远异类样本以输出情感对齐的句向量。最后将对齐后的句向量送入梯度反转层驱动的说话人分类器对抗遗忘说话人身份以输出去身份化向量,该向量直接作为线性情感分类器的输入以输出最终情感后验。与仅做整体域对抗或依赖大规模多语言预训练的前人工作不同,该方法显式建模情感条件下的跨语言一致性并解耦说话人变异,具有用少语言数据实现迁移的实际意义。在9组零样本跨语言设置下,Proposed的UAR指标为82.26%,高于Baseline 2的UAR指标73.21%。结论的适用边界仅为happy、angry、sad和neutral的四情感闭集与英汉德法乌尔都语圈内迁移,开放情感与远距离语系外推能力尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
708. 推理能自圆其说,却不一定在听:大音频语言模型忠实性的双向检验
英文题目:Investigating Faithfulness in Large Audio Language Models
标签:#评测协议 #音频大模型 #可解释性 #音频问答
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#评测协议
👥 作者与机构
- Pooneh Mousavi:机构信息未能从会议 PDF 纯文本可靠映射
- Lovenya Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Mirco Ravanelli:机构信息未能从会议 PDF 纯文本可靠映射
- Cem Subakan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型(Large Audio Language Models, LALMs)能对输入音频生成思维链(Chain-of-Thought, CoT)再给出多选答案,难点在于推理听起来合理却可能不反映真实听觉依据与决策过程。第一步以逐步思考提示让模型同时生成推理链与终答并自动分离推理串,得到干净基线作为后续干预的比较起点。第二步保持提示不变而对同一音频施加全时长高斯白噪声叠加与随机掩蔽与语音引导掩蔽及对抗语音注入后重新生成,用基线对比判定推理是否扎根声学证据。第三步冻结原始音频而对基线推理依次施加填充词与提前回答截断与改写与加错后再续写终答,用终答一致性与外部裁判打分判定是否真正跟随推理。相比仅看准确率的评测,该音频忠实与输出忠实双分支解耦能暴露自洽幻觉与语言压倒听觉的多模态断连,在Audio Flamingo 3-Think与Qwen2.5-Omni上覆盖SAKURA四轨与MMAR与MMAU与JASCO验证。核心发现是多模态断连:文本改写下终答几乎完全一致而加错与截断与填充使一致性单调下降,说明内部文本一致性较好;但强噪声与全静音下仍出现高自洽幻觉推理,且对抗错误语音使 SAKURA-Animal 上 Audio Flamingo 3 准确率从约 75% 跌至约 25%,语言线索可压倒声学证据。结论边界是仅多选题与仅 2 个开源模型,未做开放问答与闭源模型与人工听感校验,未披露训练与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
709. 以叠加代替遮挡:MixProLAP 用混合不确定性建模音频文本多对多对齐
英文题目:MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining
标签:#对比学习 #多模态学习 #预训练 #零样本 #音频检索
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#对比学习
👥 作者与机构
- Yu Nakagome:机构信息未能从会议 PDF 纯文本可靠映射
- Jaesong Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Soo-Whan Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频文本对齐输入为10秒音频片段与自由文本描述,输出为跨模态检索排序,难点在于同一场景含重叠声事件且描述方式多样,确定性点嵌入难以表达多对多歧义与包含语义。MixProLAP先用HTS-AT音频编码器与GPT-2文本编码器加均值方差头将双模态映射为对角高斯分布,再以概率成对对比学习Probabilistic Pairwise Contrastive Learning / PPCL与闭式采样距离Closed-form Sampled Distance / CSD做跨模态对齐,随后在同批次内以波形加权叠加与文本连接词拼接构造混合超集并施加模态内包含损失,最后按混合系数分级施加多层包含损失以形成不确定性梯度。与掩码式ProLAP的关键机制差异在于用加性组合而非信息删除来制造层级,混合体在语义上近似包含各源,避免瞬态事件被掩码抹除或环境声掩码无效的问题。在AudioCaps训练并在AudioCaps评测的音频到文本检索中MixProLAP以R@1 26.85超过CLAP基线24.23,显示了对描述歧义的更好建模。该结论目前仅限于AudioCaps与ClothoV2的零样本检索,文本拼接引入的语言不自然性与混合比例外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
710. 声带不动时舌头为何还能猜出音高:四种假设的逐项证伪
英文题目:Automatic pitch prediction from speech articulation: Where does the f0 information come from?
标签:#CNN #发声与构音 #韵律 #静默语音接口
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#静默语音接口 | 主方法:#CNN
👥 作者与机构
- Beliz Ozkan:机构信息未能从会议 PDF 纯文本可靠映射
- Jonas Michael:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Hueber:机构信息未能从会议 PDF 纯文本可靠映射
- Olivier Perrotin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理从发音观测预测基频的矛盾任务,输入为超声舌图与唇图视频,输出为浊音段对数基频,难点在于源滤波器理论预言声门源与声道滤波独立而实证却部分可预测。方法链第一步用四层二维卷积编码器分别将超声舌图或唇图压缩为二百维嵌入并拼接为四百维双模态表示,第二步用一维卷积解码器融合一至十七帧时域上下文回归当前帧基频。第三步经连续小波变换重音分级与朗读或自发划分做假设检验,将词级相关与感知可接受率作为评价依据。与既有静默语音接口直接拟合全局轨迹不同,该工作将机制定位为局部韵律功能耦合而非声门泄漏,强调重音实现时的发音与基频协同具有实际意义。在TaL1语料自发语音测试条件下,L+T模型的全局相关性指标为0.39,低于朗读条件下全局相关性指标的0.70。结论仅适用于朗读训练与重音局部预测,未验证真正静默与跨语言外推,自发会话仍失效。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
711. 交叉注意力只说对一半:语音到文本模型到底在听哪里
英文题目:Cross-Attention is Half Explanation in Speech-to-Text Models
标签:#注意力机制 #可解释性 #语音 #语音识别 #语音翻译
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#注意力机制
👥 作者与机构
- Sara Papi:机构信息未能从会议 PDF 纯文本可靠映射
- Dennis Fucci:机构信息未能从会议 PDF 纯文本可靠映射
- Marco Gaido:机构信息未能从会议 PDF 纯文本可靠映射
- Matteo Negri:机构信息未能从会议 PDF 纯文本可靠映射
- Luisa Bentivogli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音到文本需将连续梅尔谱图映射为离散词序列,输出长度可变且时频线索高度局域,交叉注意力常被挪用为对齐与时间戳依据却未经验证。本文先以能量聚类扰动与KL散度构建输入级与编码器输出级显著图作为银标准,得到每输出词的时间相关性分布。接着沿解码器层与头抽取交叉注意力分数,并在束搜索解码假设下同步获取分布,使上一步显著图成为可对比参照。然后对显著图做二维最大池化等时频聚合与词维归一化,再以皮尔逊相关度量注意力与显著图的一致性,并在编码器输出层面重复对比以分离上下文混合影响。与自然语言处理中围绕注意力可解释性的争论不同,该工作把检验落到语音编码器下采样与2000Hz以下频带集中特性上,指出平均池化会抹除关键局部峰值因而最大池化更保真。在EuroParl-ST测试集下,2D maximum pooling第6层交叉注意力的Pearson为0.582,高于第1层的Pearson 0.115。该结论适用边界受限于仅验证Conformer编码器加Transformer解码器、自训base与FAMA英意双向语音识别与翻译,未覆盖问答摘要等长程任务及语音大语言模型,推理开销在单块NVIDIA A40硬件上base约2.5分钟而大小模型需3至6.5分钟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
712. 不用录音也能对齐语音大模型:用可控错误率模拟声学后验的 TASU2
英文题目:TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs
标签:#CTC #领域适应 #低资源 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#CTC
👥 作者与机构
- Jing Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Chenghao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Lirong Qian:机构信息未能从会议 PDF 纯文本可靠映射
- Junjie Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Xi:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为纯文本转录与目标字错误率(Word Error Rate,WER)区间码,输出为可直接送入语音大模型投影器的帧级联接时序分类(Connectionist Temporal Classification,CTC)后验序列,难点在于无配对音频时如何复现声学解码接口的空白主导与音素混淆结构。方法链为:先对约七分之一 LibriSpeech 做加噪混响增强并用教师识别器生成多错误率后验与贪婪假设,再按字错误率离散为 0-6%、10-40%、50-150% 三档控制码,然后训练 6层编码器加6层解码器、隐藏维度512的轻量 Transformer 模拟器在分布级交叉熵下由文本与控制码自回归生成后验,最后用低错误率档合成的伪后验做两阶段后训练与目标域文本适配。与随机平滑删除插入的 TASU 相比,关键差异是显式字错误率条件与后验分布匹配,使监督难度可调度且更贴近真实解码。在 LibriSpeech 训练并在 SlideSpeech 评测的零音频泛化中,TASU2 分档模型相对 TASU 从 24.07% 降至 17.67%,在 Medical 低资源适配中以 12.12% 超过文本微调 13.62% 与语音合成增强 12.79% 并基本保持源域性能。该结论仅在英语朗读演讲及 8小时医疗文本场景验证,未覆盖强口音噪声与多语跨域外推。原文未披露训练推理部署成本,未提供代码模型数据链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
713. 语言变了人不该变:用冻结再解冻的预训练前端做跨语言说话人确认
英文题目:Cross-Lingual Speaker Verification with Self-Supervised Pre-Trained Models
标签:#模型集成 #自监督学习 #跨语言 #说话人验证
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#说话人验证 | 主方法:#自监督学习
👥 作者与机构
- Jinghan Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Weiqiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言说话人验证输入为注册与测试两段语音,输出为是否同一说话人的二值判定,难点在于说话人生理行为特质与语言相关声学内容相互纠缠,注册与测试语言失配时性能骤降。本文构建自监督预训练模型前端加说话人嵌入后端加分数融合的流水线:以w2v-BERT 2.0提取全部隐藏层表征,经独立适配器投影到统一维度,再经多尺度特征聚合融合成帧级特征。聚合特征经注意力统计池化压缩为话语级表示并投影为256维嵌入,其输出进入三阶段渐进训练,先冻结主干训练下游模块再解冻微调最后大间隔微调。该链条复用143种语言无标注语音学到的通用表征以解耦身份与语言,相对从零训练更能泛化到未见语言,最终与ReDimNet轻量系统分数平均融合完成判定。在TidyVoice2026的tv26 eval-A部分失配与tv26 eval-U完全未见38种语言划分上,融合系统等错误率分别为2.21%与2.99%,单预训练系统在eval-U上为2.84%反超同数据ReDimNet-B6的3.43%。结论仅在该基准验证,未证明向其他语种、信道、时长与噪声的外推能力,未报告训练与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
714. 离散省步数、连续补细节:HybridCodec 在 6.25 Hz 下如何保住说话人
英文题目:HybridCodec: Modeling Discrete and Continuous Representations For Efficient Speech Language Models
标签:#向量量化 #语音 #语音识别 #语音编码 #文本到语音
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Artem Ploujnikov:机构信息未能从会议 PDF 纯文本可靠映射
- Francesco Verdini:机构信息未能从会议 PDF 纯文本可靠映射
- Samir Sadok:机构信息未能从会议 PDF 纯文本可靠映射
- Mirco Ravanelli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
离散语音语言模型需同时处理文本到语音合成与语音到文本识别任务,输入为字符序列或声学提示、输出为对应波形或转写文本,实际难点在于低帧率离散化会丢弃微韵律与音色细节并损害语义保真。本文方法链分三步:首先以WavLM提取基表示并经多尺度全局局部聚合得到紧凑隐变量,为双路建模提供统一输入。然后离散支路以二值球面量化生成低帧率语义索引,连续支路显式编码量化残差以保留声学细节,两路表示共同送入解码器重构连续特征。接着HybridLM以同一GPT式解码器经自适应层归一化区分模式,先自回归生成离散索引确立语义结构,再单步非自回归预测残差并经Vocos合成波形,相对于纯离散基线以极低帧率恢复保真度并减少长序列推理开销。在LibriTTS干净测试集上,12.5 Hz混合合成取得UTMOS 4.10和dWER 14.79,远优于同帧率纯离散基线的1.99和32.97;50 Hz混合识别将WER从28.11降至23.36。与已有纯离散编解码相比关键差异在于离散效率与连续保真的解耦统一,其实际意义是支撑6.25Hz超低帧率下长语音高效合成与识别。结论目前仅在英文朗读语音、贪婪解码和客观指标上验证,未涉及主观听感、噪声远场、多语言与显著性检验,训练推理成本未披露。其适用边界受限于英文朗读语料与客观指标,跨噪声远场多语言外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
715. 听还是读:思维链语音翻译到底用了多少声音
英文题目:Listening or Reading? Evaluating Speech Awareness in Chain-of-Thought Speech-to-Text Translation
标签:#评测协议 #可解释性 #鲁棒性 #韵律 #语音翻译
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#评测协议
👥 作者与机构
- Jacobo Romero-Díaz:机构信息未能从会议 PDF 纯文本可靠映射
- Gerard I. Gállego:机构信息未能从会议 PDF 纯文本可靠映射
- Oriol Pareras:机构信息未能从会议 PDF 纯文本可靠映射
- Federico Costa:机构信息未能从会议 PDF 纯文本可靠映射
- Javier Hernando:机构信息未能从会议 PDF 纯文本可靠映射
- Cristina España-Bonet:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
英语语音到加泰罗尼亚语等6种欧洲语言文本翻译受级联误差传播与韵律信息丢失困扰,需检验思维链是否真正利用语音而非仅读转写。该工作先以mHuBERT离散语音单元接入7B翻译大模型生成转写再生成译文,形成可对比思维链与自级联的统一架构。接着用价值清零归因量化语音、转写与已译词对译文的层级贡献,其输出揭示基线对语音依赖近零。然后向思维链提示注入可控损坏转写测试鲁棒性,并用韵律对照基准检验声学消歧能力。与译文阶段仅见转写的自级联相比,思维链的关键差异是保留语音上下文,而噪声训练迫使其真正听语音故具实际意义。在CONTRAPROST基准测试集下,NOISY-COT的Global得分为17.65,高于NOISY-CASCADE的Global得分15.42。该结论限于英语到6语言、离散单元架构与朗读类评测,未验证自然对话韵律与连续特征模型的泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
716. 脱离应用谈合成语音好坏为何不可靠:四场景交叉验证与虚拟现实替代检验
英文题目:Application context in speech synthesis evaluation: A problem and a solution
标签:#统计分析 #用户研究 #模型评估 #语音 #语音合成
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#用户研究
👥 作者与机构
- Fritz Seebauer:机构信息未能从会议 PDF 纯文本可靠映射
- Markus Rothgänger:机构信息未能从会议 PDF 纯文本可靠映射
- Sven Wachsmuth:机构信息未能从会议 PDF 纯文本可靠映射
- Petra Wagner:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以四个合成系统在学习对话、导航寻物、自由对话和故事朗读中的在体交互语音为输入,以总体质量、听音努力与自然度等多维得分为输出,难点在于检验中性句评测隐含的质量可模块化假设在真实应用中是否成立。方法链分为三步:先在实体模拟公寓及其数字孪生中并行搭建四类应用任务以控制场景变量,再用本地语音识别加Gemma大语言模型加可替换语音合成的对话系统承接交互并触发语音输出,接着按拉丁方轮换系统语音并用百分制视觉量表与用户体验问卷短版采集评分后用贝叶斯多变量分层模型估计任务、系统及其交互效应。与仅改变提问措辞或单场景对照的既有工作不同,该设计在同一研究内交叉多应用与多系统并检验维度特异性,因而能直接观察系统排序随上下文的变化。在语调维度任务对比评测下,T3场景S3系统的语调得分为36.118,高于T2场景S1系统的语调得分11.097。结论仅适用于德语母语者短时在体交互与所用四个系统,开放域部署、长期使用和在线众包场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/astramind-ai/Auralis — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
717. 给 Transformer 补局部偏置:在 LoRA 瓶颈里做门控卷积的声学适配
英文题目:GC-LoRA: Gated Convolutional LoRA for Parameter-Efficient Acoustic Adaptation
标签:#LoRA #鲁棒性 #语音 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- Natarajan Balaji Shankar:机构信息未能从会议 PDF 纯文本可靠映射
- Zilai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kaiyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Mohan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Abeer Alwan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音识别(Automatic Speech Recognition, ASR)中Transformer基础模型在环境退化、窄带电话、方言与儿童语音等声学分布偏移下性能显著下降,而线性低秩适配难以刻画短时谱包络等精细局域上下文。该工作提出门控卷积低秩适配(Gated Convolutional LoRA, GC-LoRA),先将注意力输出投影输入压缩至低秩空间,再经逐点卷积与门控线性单元筛选通道,接着用深度卷积、组归一化与Swish激活捕捉时域邻域,最后经逐点混合并与低秩残差相加后回投至原始维度。与直接作用于查询与键值的标准低秩适配(Low-Rank Adaptation, LoRA)不同,该设计让局域平滑与全局注意力共用同一残差通路并保留冻结主干。在Whisper Medium上四域评测显示其以447k可训练参数在MyST儿童语音测试集取得8.6%词错误率(Word Error Rate, WER),优于829k参数标准LoRA的8.9%。该结论限于编码器输出投影的单任务声学适配,未验证自监督骨干与语音大模型耦合场景。推理profiling显示相对LoRA延迟仅从57.6 ms增至58.9 ms,峰值显存相同。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
718. 新合成器抹掉了旧痕迹:VoxENES 2026 如何暴露语音伪造检测的泛化缺口
标签:#基准测试 #基准设计 #鲁棒性 #多语言 #语音伪造检测
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音伪造检测 | 主方法:#基准设计
👥 作者与机构
- Aastha Sharma:机构信息未能从会议 PDF 纯文本可靠映射
- Guangjing Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音伪造检测(speech spoofing detection)的输入为待判语音波形,输出为真实(bonafide)或伪造判决,难点在于 LLM(large language model)时代合成器与传输后处理显著抹除了旧基准依赖的伪影线索。为此作者构建双语基准 VoxENES 2026,先从 LibriSpeech 抽取 1500 条英语真实语音(40 说话人)与从 VoxPopuli 抽取 1528 条西班牙语真实语音(96 说话人)并统一为 16 kHz 单声道,再用 7 种 TTS 与 3 种语音转换(voice conversion,VC)系统生成 4600 条原始伪造样本,最后对每条原始伪造样本各施加 10 种后处理之一并恢复至 16 kHz,得到 46000 条增强伪造样本,总量 53628 条。8 个已发布预训练检测器在零微调推理协议下最优等错误率(equal error rate,EER)仅为 28.98%,对应准确率 75.94%,其余 5 个模型 EER 为 47.03%至 57.86%,多数接近或劣于随机猜测。Seed-VC 上所有检测器 EER 均高于 41%,为最难子集。该结论仅适用于所选 10 种合成器、10 种后处理与冻结权重协议,未验证重训练或自适应后性能。原文未披露训练、推理或部署成本,生成式 AI 仅用于语言润色。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
719. 跨语言说话人确认中语言失配:只用顶层冻结特征做潜在交叉注意力适配
标签:#Adapter #跨语言 #语音 #说话人验证
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#Adapter
👥 作者与机构
- Xu Shen:机构信息未能从会议 PDF 纯文本可靠映射
- Yihao Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Xinwei Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Yujie Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Yujin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Shoji Makino:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言说话人验证的输入是分属不同语言的注册与测试语音,输出是是否同一说话人的判定,难点在于语言内容与信道变化会淹没说话人特征。所提框架冻结w2v-BERT 2.0编码器,仅选用19-24连续高层以剔除底层声学与音素冗余,其输出进入下一步池化。由跨层共享的可学习隐数组对各层特征做交叉注意力池化,将变长多层表示映射到统一隐空间,池化结果送入时序建模模块。扩张卷积前馈块建模局部谱时相关并聚合成话语级嵌入,再在嵌入级做边缘混合正则化训练加性角度间隔分类器。与全层拼接或平均相比,共享键值瓶颈强制不同层服从同一说话人基座,因而更能抑制语言可变成分,具有实际意义。在TidyVoiceX开发集评测下,LaS-LCA的EER为1.40%,低于SimAM-ResNet34基线的EER 3.07%。该结论适用边界受限于同一40语种训练与开发划分及TidyVoice 2026官方两个评测列表,对38种未见语言的eval-U失败条件退化明显,跨语系外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
720. 只要 20 毫秒延迟:EffVOC 如何从无相位频谱直接重建语音波形
标签:#生成对抗网络 #高效推理 #流式处理 #语音 #语音合成
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#生成对抗网络
👥 作者与机构
- Renzheng Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Welker:机构信息未能从会议 PDF 纯文本可靠映射
- Timo Gerkmann:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Fingscheidt:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无相位波形重建需从幅度谱或 Mel 系数恢复丢失相位并合成波形,因果低延迟约束使相位连续性建模显著变难。EffVOC先以7×1因果卷积映射谱帧并经两层LSTM建模局部动态与长时依赖,输出紧凑声学表征并直接送入后续上采样链。随后4级转置卷积逐级将帧级表征上采样至波形采样率,每级后接残差块细化谐波结构并抑制上采样伪影,全程因果卷积与权重归一化保证流式稳定。相比需要高延迟迭代的Griffin-Lim与整句级BigVGAN、Vocos及扩散流匹配声码器,该设计坚持20 ms窗长加5 ms帧移,以75%重叠高帧率冗余补偿因果信息缺失。在 VCTK 宽带测试集上,幅度输入 F=64 模型 MOS 达到 4.17,接近真值 4.20,超过 32 ms 因果 BAPEN 与 MelFlow;全带 48 kHz 上 F=32 模型 MOS 达到 4.14,同样领先基线。在VCTK全带测试集下,EffVOC幅度模型的MOS为4.14,低于真值的MOS 4.15。其结论适用边界受限于干净英语朗读语音的单数据集验证,噪声、混响、跨语言与长时流式稳定性等外推范围尚未验证。原文仅报告单张 NVIDIA A100 上实时因子约 0.58 至 0.88,未披露训练硬件与时长。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
721. 面对面演出来的对话:20.6 小时俄语工作室语料如何支撑表情丰富的对话合成
英文题目:Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants
标签:#数据集 #数据集构建 #语音 #文本到语音
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#数据集构建
👥 作者与机构
- Ilya Shigabeev:机构信息未能从会议 PDF 纯文本可靠映射
- Ilia Latyshev:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
俄语对话助手需要的文本到语音(Text-to-Speech,TTS)必须输出富有表现力且符合轮次节奏的会话语音,而现有俄语语料多为中性朗读或非受控采集,难以支撑该目标。本文构建名为 Dialogs 的影棚级俄语对话语料,总时长 20.6 小时、11796 条 utterance、3 名说话人(Masha 女 9.9 小时、Sveta 女 4.4 小时、Dima 男 6.2 小时),44.1 kHz 16-bit 立体声。其链条分为三步:先以 GPT-3.5 辅助生成覆盖家庭、旅行、诗歌朗诵、绕口令、汽车与影评书评等场景的提示文本,再让木偶剧院职业演员面对面即兴表演并以 Behringer XM8500 立体声录制,最后经人工切分对齐与 Yandex Tasks 平台众包多标注者投票得到每句风格标签并按说话人与风格分层划分训练、验证、测试集。与朗读式基线相比,该流程的关键差异在于允许偏离脚本的即兴表达与面向对话的表演式录制,从而保留自然语调与接话节奏。在母语者众包语料质量评测下,Dialogs的表现力得分为4.11±0.08,高于Ruslan的表现力得分3.86±0.11。该结论适用边界为表演式影棚俄语三说话人范围,自发重叠对话与噪声场景的外推能力尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
722. 只比邻词:用三线索听觉对比复刻大模型韵律判断
英文题目:Auditory Contrast Network for Text-Free Prominence Detection
标签:#注意力机制 #高效推理 #可解释性 #韵律 #语音属性识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#注意力机制
👥 作者与机构
- Kosuke Shimizu:机构信息未能从会议 PDF 纯文本可靠映射
- Keiichi Zempo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为连续朗读英语语音中目标词及其相邻词的声学实现与可选文本统计,输出为人群感知的词级凸显度评分,难点在于绝对声学值受语速与说话人影响极大,真正决定感知的是与相邻词的相对反差与词汇预期。听觉对比网络(Auditory Contrast Network,ACN)先对每种声学线索独立计算目标词与前后词的非线性对比分,再用可学习的双向注意力加权前后方向得到线索级得分,最后由聚合网络融合各线索对比分、目标词绝对值与文本惊奇度以输出评分。与通用自监督编码器把词扔进大表示不同,该方法把成对对比、线索独立与前向主导写成结构先验,使方向偏置与线索层级可直接读出。训练后模型读出明确的前向主导偏置与严格局部性,聚合权重进一步呈现时长主导而能量与频谱依次递减的层级。除已验证的跨库迁移外,自发对话与多语言场景的泛化尚未验证且仍受限于外部词边界与朗读语料。在Helsinki Prosody训练并向Emphases跨库迁移的评测下,纯声学ACN集成以Pearson r达到0.412,与冻结wav2vec2基线的0.409基本持平,且单线程单字延迟为1.6 ms对194 ms,约120倍优势。该结论仅在朗读英语与外部词边界给定的条件下成立,自发语音、多语言及无切分场景均未验证。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
723. 噪声越大越要看脸,但还不够:给音视识别补上说话人与环境线索
标签:#Adapter #鲁棒性 #音视频 #语音 #音视频语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音识别 | 主方法:#Adapter
👥 作者与机构
- Christopher Simic:机构信息未能从会议 PDF 纯文本可靠映射
- Korbinian Riedhammer:机构信息未能从会议 PDF 纯文本可靠映射
- Tobias Bocklet:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频语音识别(Audio-Visual Speech Recognition,AVSR)以带噪语音与唇部视频为输入并输出转写文本,难点在于低信噪比下音频退化且音画融合权重难以随说话人与环境动态调整。本文以预训练语音识别模型 Whisper 为基座并在其上游增加音画自注意力融合模块,将音频与视觉特征拼接分块后联合编码,再分别从音频提取说话人嵌入与环境噪声嵌入并经多层感知机映射后注入模型,最后用融合后编码与解码器生成文本。与已有音画融合方法相比,关键差异是将噪声嵌入用于融合层内的模态加权而将说话人嵌入用于解码器前的语境增强,并对比前缀拼接、交叉注意力与门控加权三种注入机制。在 LRS3 测试集全混合噪声平均上,最优噪声门控模型词错率降至 4.26%,相对本文无自适应基线与 AV-HuBERT 分别降低约 3.5%与 13.4%。该结论主要适用于英语 TED 演讲类数据与 -5dB 至 10dB 的四类合成噪声,极低信噪比 babble 下仍落后于强视觉依赖模型且双嵌入联合无增益。原文披露基线预训练约 50 小时、每轮微调约 2.5 小时及单批次推理耗时,部署成本未系统讨论。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
724. 整句平均会稀释情绪爆发点:分段嵌入加图注意力如何重做聚合
英文题目:Segment-wise Embedding based Graph Attention Network for Effective Speech Emotion Recognition
标签:#对比学习 #图神经网络 #自监督学习 #语音 #语音情感识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#图神经网络
👥 作者与机构
- Haoyu Song:机构信息未能从会议 PDF 纯文本可靠映射
- Ian McLoughlin:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Song:机构信息未能从会议 PDF 纯文本可靠映射
- Lirong Dai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别以变长语音为输入并输出单标签情感类别,难点在于标注稀缺易过拟合、情感表达稀疏短暂易被静音稀释、整句独热标签与真实混合情感不匹配。方法采用后训练再微调两阶段流水线:输入原始波形,经HuBERT-large提取第19层1024维帧特征,再经一维Swin变换器适配器压缩为全局表征与K个分段语音嵌入,微调时对每条语音多裁剪嵌入建全连接有向图。后训练以块掩码预测与句级对比学习蒸馏优化分段嵌入器,微调以两层图注意力网络加权聚合为句向量,并以交叉熵加有监督对比学习联合优化,分段嵌入输出直接进入图聚合与分类。与直接平均池化帧特征不同,该方法在嵌入域显式建模分段间非欧依赖并拉开类间距离,从而保留短暂情感线索并增强类间可分性。在IEMOCAP留一会话五折交叉验证评测协议下,本方法的加权准确率(WA)为76.22%,高于冻结HuBERT加平均池化基线的加权准确率(WA)72.60%。结论适用边界受限于英文即兴对话与中文MER2023语音单模态验证,跨库泛化、显著性检验与噪声鲁棒性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
725. 为质量评价保留声学细节:细粒度编码器与声学任务如何共同约束表征
英文题目:A Fine-Grained Acoustically-Aware Pre-training Encoder for Speech Quality Assessment
标签:#多任务学习 #自监督学习 #预训练 #语音 #语音质量评估
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#多任务学习
👥 作者与机构
- Subrina Sultana:机构信息未能从会议 PDF 纯文本可靠映射
- Donald S. Williamson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音质量评估需从含噪与混响语音中预测平均意见分(Mean Opinion Score, MOS),难点在于自监督表征常对背景声学不变而丢失影响感知的细粒度谱时线索。本文提出细粒度声学感知预训练编码器(Fine-grained Acoustically-aware Speech Quality Assessment, FASQA),先将波形转为25 ms帧长、64维梅尔滤波器组语谱图并经卷积堆叠得到高层表示,再由局部谱时编码模块聚合邻域动态,接着由帧级谱关系聚合模块按帧加权频谱重要性,最后经多任务预训练嵌入语音与环境信息并冻结编码器训练轻量回归头预测MOS。与仅建模语音内容或长时上下文的基座相比,该方法显式保留噪声类型与房间声学线索并强化局部谱时分辨率。在NISQA TEST FOR划分上FASQA大规模版本均方误差(Mean Squared Error, MSE)为0.281,低于PASE基线的1.057且接近大规模通用音频基座Dasheng Base的0.250。该结论主要适用于英语仿真训练与NISQA类失配有限的评测,对强域外口音与真实大混响的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
726. 不开参数也判病:用模拟法庭辩论约束大模型的抑郁检测
英文题目:Moot-Court: Training-Free Dialectical Reasoning for Depression Detection
标签:#语音生物标志物 #检索增强 #大语言模型 #病理语音评估
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#检索增强
👥 作者与机构
- Yuqing Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Haoxun Li:机构信息未能从会议 PDF 纯文本可靠映射
- Leyuan Qu:机构信息未能从会议 PDF 纯文本可靠映射
- Taihao Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动抑郁检测需以临床访谈文本与语音声学线索为输入,输出是否抑郁的筛查判断,难点在于临床数据稀缺易致过拟合且黑盒推理缺乏可解释的症状归因路径。本文先将交互延迟、语速、基频与能量等声学标志文本化为多模态蓝图,再由控方构建致病图编码内外部症状触发与强化关系、辩方构建情境图编码保护性语境,前者输出为后面对抗举证提供结构化证据。随后多法官以不同采样温度并行裁决并经多数投票形成裁决,反思器对分歧与系统性失败路径做对比反思并沉淀为动态法典正负经验,约束后续推理轨迹。相对直接微调或单路提示的方法,该机制差异在于用冻结大语言模型模拟对抗举证与判例演化,把参数更新替换为可追溯的规则检索与更新,因而兼顾免训练部署与临床可验证性。在DAIC-WOZ测试集下,DeepSeek V3.2完整框架的F1为.8856,高于DepressInstruct基线的F1 .8235。该结论目前仅在单一英文访谈语料与官方划分下验证,未检验跨语言跨场景与双相障碍等复杂共病的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
727. 语音大模型听得出是谁吗:先测出现成模型的声纹短板,再给大模型外挂说话人向量
英文题目:Speaker Verification with Speech-Aware LLMs: Evaluation and Augmentation
标签:#评测协议 #LoRA #大语言模型 #说话人验证
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#LoRA
👥 作者与机构
- Thomas Thebaud:机构信息未能从会议 PDF 纯文本可靠映射
- Yuzhe Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Laureano Moro-Velázquez:机构信息未能从会议 PDF 纯文本可靠映射
- Jesús Villalba-Lopez:机构信息未能从会议 PDF 纯文本可靠映射
- Najim Dehak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动说话人验证(Automatic Speaker Verification,ASV)要求输入注册与测试两段语音并输出是否为同一人的连续分数,难点在于现货语音感知大语言模型(Speech-aware LLM)以语义理解为目标,身份线索是否保留尚不清楚。本文先提出模型无关的双轨打分协议,对闭源模型索取是否同人判断加0到100置信度,对开源模型取是否令牌对数似然比(Log-Likelihood Ratio,LLR)作为分数。接着构建级联增强系统,冻结说话人编码器抽取身份向量,经可学习投影送入解码器语言模型并以低秩适配训练下一词预测。相比以往只做性别情感等粗粒度属性分类,该机制差异在于显式注入判别性声纹表征再让语言模型学习解释。在VoxCeleb1-E评测上增强后的TinyLLaMA-1.1B达到1.03%等错误率(Equal Error Rate,EER),远优于现货模型普遍高于20%的水平。该结论限于名人访谈近场英语场景,未验证噪声远场多语与多说话人时序建模。原文承认增强方案训练与推理成本比专用系统高数个量级。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
728. 真话不止一种音质:用质量感知的多中心为单类学习保留类内差异
英文题目:QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection
标签:#集成学习 #多任务学习 #语音 #语音质量评估 #语音伪造检测
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#集成学习
👥 作者与机构
- Duc-Tuan Truong:机构信息未能从会议 PDF 纯文本可靠映射
- Tianchi Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Ruijie Tao:机构信息未能从会议 PDF 纯文本可靠映射
- Junjie Li:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音伪造检测(Speech Deepfake Detection)输入为待测语音波形,输出为真实或伪造二值判定,难点在于未知攻击不可穷举而真实语音内部存在质量与风格差异,单质心单类学习会把真实分布过度压缩为单峰。所提质量感知多质心单类学习(Quality-aware Multi-centroid One-class Learning,QAMO)先用语音质量评估器Scoreq预测MOS并按阈值离散为高低两档质量标签,再为每档学习可训练质心并以加性间隔Softmax约束质量分类,随后以扩展的多质心OC-Softmax拉近真实样本与其对应质心并推远伪造样本与最近质心,最后在推理时以Softmax加权集成所有质心相似度得到检测分。与单质心单类学习及简单拼接质量分类相比,该机制显式保留真实类内质量结构并避免推理依赖质量标签。在XLSR-Conformer-TCM主干下,QAMO在In-the-Wild上以5.21%等错误率(Equal Error Rate,EER)优于同设置加权交叉熵与单质心基线的7.13%与6.72%,在21DF上以1.63%优于2.39%与1.89%,在FoR上以3.45%优于5.70%与5.65%,但在21LA上以2.53%弱于加权交叉熵的1.37%。该结论主要适用于以ASVspoof2019 LA训练并向21LA、21DF、ITW与FoR泛化的短句验证场景,对更细粒度质量分层与强失真下质量误判尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
729. 不改音频加水印:用初始噪声与生成结果的空间相关做溯源
英文题目:AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS
标签:#流匹配 #鲁棒性 #语音 #音频水印
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频水印 | 主方法:#流匹配
👥 作者与机构
- Timothy Tin-Long Tse:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Aidan Pine:机构信息未能从会议 PDF 纯文本可靠映射
- Mengzhe Geng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理流匹配(flow matching,FM)与扩散(diffusion)语音合成中的来源标识问题,输入为待验证音频与预留初始噪声,输出为是否由指定噪声生成的二值判定,难点在于音频变长、裁剪与变速会破坏对齐且频域攻击易抹除弱相关。方法链分为三环:首先固定特殊噪声并在梅尔谱长度上周期重复以覆盖变长音频,其次用冻结生成模型从该噪声合成语音并保留噪声与梅尔谱的配对关系,最后以余弦相似度计算经验p值或以外挂卷积检测器判别来源,前者输出直接进入阈值判定,后者输出进入二分类训练与增强推理。与后处理水印相比,该机制不修改波形而复用生成动力学自带的噪声到输出映射,因而无生成开销且不损伤音质。在F5-TTS相似度阈值评测设置下,余弦相似度分支的准确率为0.988,高于点积分支的准确率0.986。该结论不适用于回声等混响类退化,也未验证多说话人、大规模多样文本与神经编解码器压缩下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
730. 试内切换下脑电不可靠且有延迟,SAGE 用双路候选加软门控做平滑选择
英文题目:SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching
标签:#多模态学习 #脑信号 #语音 #目标说话人提取
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#多模态学习
👥 作者与机构
- Xuefei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Ximin Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yuting Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Chunlin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向鸡尾酒会场景下依据脑电信号(Electroencephalography,EEG)提取注意说话人的任务,输入为双人混合语音波形与同步多通道EEG,输出为跟随试次内(in-trial)自发注意力切换的目标语音,难点在于EEG噪声非平稳与神经响应内禀滞后导致切换检测延迟和切换点波形不连续。本文方法SAGE先由时域分离器生成两路与注意力无关的候选语音,再由EEG分支估计注意力偏置与切换概率,经自适应温度与局部扩散生成融合权重,最后经可微局部时移对齐EEG与音频并以随机前向方差加权平滑约束抑制低置信激进切换。与假设单试次注意静态不变的既有神经引导提取相比,该链条将切换视为连续动态选择而非硬分类跳转,因而能缓解过渡伪影与标签滞后失配。在自建自发切换数据集上,SAGE以8.67 dB的尺度不变信失真比(Scale-Invariant Signal-to-Distortion Ratio,SI-SDR)和88.24%的短时客观可懂度(Short-Time Objective Intelligibility,STOI)超过最强基线M3ANet的7.13 dB和84.30%,同时平均切换延迟(Average Switch Latency,ASL)从2.37 s降至2.04 s。该结论目前仅在18名普通话母语被试、左右正负90度空间化一男一女双人混合、被试内8:1:1划分条件下验证,未验证跨被试跨语种与强混响噪声外推。原文未披露训练推理成本与流式约束。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
731. 语义对了还不够:语音翻译如何保住语气、立场与意图
英文题目:The Interspeech 2026 Challenge on Transfer of Pragmatic Intent in Speech-to-Speech Translation
标签:#基准设计 #主观评测 #韵律 #语音翻译
评分:6.2/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音翻译 | 主方法:#基准设计
👥 作者与机构
- Nigel G. Ward:机构信息未能从会议 PDF 纯文本可靠映射
- Marcel de Korte:机构信息未能从会议 PDF 纯文本可靠映射
- Javier Vazquez:机构信息未能从会议 PDF 纯文本可靠映射
- Montserrat G. Molina:机构信息未能从会议 PDF 纯文本可靠映射
- Vanessa Bolado:机构信息未能从会议 PDF 纯文本可靠映射
- Carol Figueroa:机构信息未能从会议 PDF 纯文本可靠映射
- Eliya Nachmani:机构信息未能从会议 PDF 纯文本可靠映射
- John E. Ortega:机构信息未能从会议 PDF 纯文本可靠映射
- Satoshi Nakamura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音到语音翻译需在转换词义的同时传递语气与交际意图,输入为源语言会话语音、输出为目标语言语音,难点在于韵律承载的语用功能易在级联中丢失且缺乏直接评测。挑战先让双语者无脚本自然对话并跨语言多次复演选定话语,直至双方认可语气意图一致,形成语用金标准复演参照。接着将原文与候选译文按固定听音顺序提交四名西英双语评委,要求屏蔽语义与音色干扰,仅按语气、感受与意图打1至5分语用相似度。同时用Segura语用相似度自动指标对照人工打分,以检验自动排序与人评的一致性并暴露过敏感等问题。与以往经由韵律声学属性间接推断不同,该设计直接以复演为参照并强制分离语义保真度,使韵律层面的意图保留成为可比目标,具有实际沟通意义。在英语到西班牙语特征映射条件下,MUC的Segura指标为0.8601,高于基线的Segura指标0.8574。该结论仅适用于美式英语与北墨西哥西班牙语短会话话语与小规模评委设置,不能外推至长对话与真实交互场景。其适用边界受限于短话语与小规模评委,尚未验证长对话与真实交互外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
732. 听出言外之意:粤语语音语用基准如何让韵律参与推理
英文题目:YUE-PUB-Speech: A Speech-based Pragmatic Understanding Benchmark for Cantonese
标签:#基准测试 #基准设计 #低资源 #语音 #音频问答
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频问答 | 主方法:#基准设计
👥 作者与机构
- Yajie Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Ziwei Gong:机构信息未能从会议 PDF 纯文本可靠映射
- Chengyan Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiyun Gong:机构信息未能从会议 PDF 纯文本可靠映射
- Yun Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Julia Hirschberg:机构信息未能从会议 PDF 纯文本可靠映射
- Bolei Ma:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语用理解需从对话推断言外之意、预设与指称,输入为粤语对话语音与文本、输出为统一选择题答案,难点在于低资源下韵律与语境推理缺乏配对检验且易被词汇主导掩盖。该链条先以英文PUB为源经任务模板统一为选择题,再用Gemini译为粤语并经两名母语者两轮修订及词典规范,修订后文本直接进入录制环节。接着由两男两女母语者在吸音静音间用独立麦克风录制并质检,得到1680条对话约10.87小时的文本语音对齐语料,录制产物再进入同一选题下的纯文本、纯语音与融合对比。相对纯文本评测与副语言分类,该基准强制同一题目比较不同模态,以分离词汇主导与语音增益,检验韵律何时改善推理。在YUE-PUB-Speech基准五折交叉验证任务下,文本语音拼接方法的平均准确率为77.62%,高于Gemini-2.5-Pro零样本的平均准确率75.42%。该结论的适用边界受限于朗读式安静录音与三类现象,实验硬件为2×NVIDIA A6000各48GB显存。结论仅适用于朗读式、安静录音与三类语用现象,不能外推到自发对话、噪声与更多说话人风格。原文未披露训练时长与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
733. 真方言与带口音普通话为何要分开测:GLAD-CSpeech 的方言学基准设计
英文题目:GLAD-CSpeech: A Dialectologically Comprehensive Benchmark for Genuine Chinese Dialect Speech
标签:#数据集 #基准设计 #语音识别 #语言识别 #文本到语音
评分:6.2/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Ke Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Lihan Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Jiayi Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yunfei Chu:机构信息未能从会议 PDF 纯文本可靠映射
- Shuting Yuan:机构信息未能从会议 PDF 纯文本可靠映射
- Ruiye Lv:机构信息未能从会议 PDF 纯文本可靠映射
- Guangxuan Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Qi Han:机构信息未能从会议 PDF 纯文本可靠映射
- Jin Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Bing Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Hu Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyi Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Qibin Ran:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
汉语方言语音处理输入为带地域变异的连续语音,输出为方言转写、方言语音或方言类别标签,难点在于音系、词汇、语法同时偏离普通话且行政省籍标签掩盖真实边界。该基准先依据中国语言地图集划分8个官话次方言加8个非官话大区共16个方言区并遴选23个代表点,再按13类日常与应用场景分层采集影棚与真实场景语料以区分真方言与带腔普通话。接着执行普通话语义锚加方言转写加分点词表的三层对齐标注,最后用统一协议提供自动语音识别即 Automatic Speech Recognition与文本到语音即 Text To Speech及方言识别即 Dialect Identification基线。与按省份混合标注的资源相比,其机制差异在于以语言学纯度保证类内一致而非地理便利,从而可控比较口音鲁棒性与真实方言分歧。在GLAD-CSpeech零样本ASR评测下,Qwen3-ASR在温州话的字符错误率为86.17%,高于在成都话的字符错误率4.42%。结论仅适用于所采代表点及短句加对话场景,对自发长尾交叠与跨代际外推尚未验证。原文未披露训练、推理或部署成本,未提供代码与数据链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
734. 只给低阶镜像反射,也能补出完整房间脉冲响应吗
标签:#扩散模型 #空间音频 #房间脉冲响应估计
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#房间脉冲响应估计 | 主方法:#扩散模型
👥 作者与机构
- Zeyu Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Brendel:机构信息未能从会议 PDF 纯文本可靠映射
- Albert G. Prinn:机构信息未能从会议 PDF 纯文本可靠映射
- Emanuël A. P. Habets:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
房间脉冲响应补全需以镜像源法仿真的直达声加早期反射为输入,生成包含晚期混响的完整全频带响应,难点在于低反射阶条件器在80ms窗内稀疏不完整,截断拼接易引发时域不连续与波动效应缺失。该方法先将低阶仿真条件信号与加噪响应沿通道拼接送入一维U型网络,由信号预测头直接估计干净响应并以均方误差约束波形,使拼接后的条件信息直接进入去噪估计。随后对预测响应作施罗德反向积分求能量衰减曲线并计算衰减损失,将波形估计输出转入衰减一致性约束,以稳定整体衰减形态。最后在混合仿真数据上以零向量随机替换条件器联合学习条件与无条件分布,并在推理中以分类器无关引导加权融合两次预测以控制条件依从与多样性权衡,该无需截断条件器的机制区别于需要完整80ms窗的基线,因而更适配低阶输入并有利于跨数据集补全。在混合仿真训练并在Treble测试集评测的跨数据集补全设置下,本方法的能量衰减误差EDCMAE为2.15dB,低于Echo2Reverb基线的能量衰减误差EDCMAE3.42dB。该结论限于鞋盒房间合成数据与固定 16 kHz 和 24576 点长度,极低阶条件与真实测量 RIR 尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
735. 长时噪声下抓瞬时与看全局:表格统计与注意力多实例如何分工检出两类声带过度功能
标签:#注意力机制 #模型集成 #弱监督学习 #生理信号 #病理语音评估
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#模型集成
👥 作者与机构
- Kiran Yerpude:机构信息未能从会议 PDF 纯文本可靠映射
- Seung Gyu Jeong:机构信息未能从会议 PDF 纯文本可靠映射
- Seong-Eun Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理基于颈表加速度计(Neck-surface Accelerometer,ACC)多日动态嗓音监测,输入为50 ms帧级声学与逆滤波特征,输出为受试者级音创性嗓音亢进(Phonotraumatic Vocal Hyperfunction,PVH)与非音创性嗓音亢进(Non-phonotraumatic Vocal Hyperfunction,NPVH)二分类概率,难点在于标签仅在受试者级而信息片段稀疏且含缺失和佩戴噪声。方法链分为四步:帧级过滤与缺失编码先筛选浊音非歌唱佩戴段并去离群,表格分支(Tabular Branch)在日级分布统计上用CatBoost建模长期行为,深分支将固定窗编码后经门控注意力池化为受试者表示,最后逻辑回归堆叠(Stacking)融合两分支概率及其一致性特征。与既往手工汇总加浅模型相比,该设计用日级分布刻画持续低效、用注意力定位短时高强度事件,形成病理机制对齐的多尺度建模。在NeckVibe Challenge 2026官方测试中,堆叠系统在PVH上达到AUC 0.891位列第3,在NPVH上达到AUC 0.861位列第1。其结论仅在该挑战赛数据划分与受试者内聚合条件下成立,对跨设备跨人群与NPVH低校准段的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
736. 用双向保持网络做短窗分割:在 EEND-VC 里兼顾重叠与长录音
英文题目:Bidirectional Retention Network-based Segmentation Model for Speaker Diarization
标签:#RNN #高效推理 #语音 #说话人分离标注
评分:6.2/10 | 创新 1.1/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#RNN
👥 作者与机构
- Jian You:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangfeng Li:机构信息未能从会议 PDF 纯文本可靠映射
- Tengfei Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Erwan Zerhouni:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人分离标注需从多人录音输出谁在何时说话,难点在于重叠语音、任意说话人数与长录音的可扩展拼接。该方法先以WavLM Base+多层可学习加权融合并线性降维至256维做前端,将波形转为帧级声学表示后送入后端。该后端用4块双向保持网络建模说话活动,每块含方向相反的保持模块与前馈网络并做残差跳连,再经线性加Softmax做局部幂集分类。随后对局部单人段提嵌入并经贝叶斯隐马尔可夫聚类得到全局身份,再拼接重叠窗预测完成长录音标注。与LSTM、注意力及Mamba后端不同,分块循环在块内并行、块间递推固定尺寸状态,固定分块下相对序列长度呈线性复杂度。在 7 个语料域内宏平均分离错误率 DER 上,冻结无适应的 BiRetNet 为 15.8%,优于 LSTM 的 17.3%、注意力的 17.9%与 Mamba 的 16.2%;微调加域适应后为 15.0%,在 AISHELL-4 的 9.9%与 VoxConverse 的 8.5%上超过同期最优。在7个数据集评测设置下,BiRetNet系统的分离错误率为15.8%,低于LSTM基线的分离错误率17.3%。代价是训练仅用 10 秒段、NOTSOFAR-1 仍高达 21.5%,长窗优势主要体现在内存而非速度。该结论的适用边界受限于仅用10秒段训练且长窗训练尚未验证,NOTSOFAR-1等高混叠场景为失败条件,其推理开销为实时率稳定在1.5左右而内存仅从611MB增至680MB。
🔗 开源资源
- 复现相关资源:https://github.com/BUTSpeechFIT/DiariZen — 链接可访问(HTTP 200)
- 复现相关资源:https://github.com/BUTSpeechFIT/VBx — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
737. 不用学隐式边界映射:用对准加扫描直接锁住感兴趣区声源
标签:#波束成形 #严格因果 #麦克风阵列 #流式处理 #目标说话人提取
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#波束成形
👥 作者与机构
- Hogeon Yu:机构信息未能从会议 PDF 纯文本可靠映射
- SeongHun Noh:机构信息未能从会议 PDF 纯文本可靠映射
- Hyunsik Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Sihyun Joo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
感兴趣区域语音提取以多通道混合STFT复谱为输入,给定连续可变角度窗输出窗内说话人早期反射语音和并在空区输出静默,难点在于离轴目标与窗外强干扰共存且易误触发。Sweep-RSE先经目标中心相位对齐将窗中心搬移至虚拟法线方向,再由边界感知编码器以候选导向矢量旋转并按相位相干加权锁定目标,对齐输出进入下一步细化。随后因果双路径模块做谱时细化并由区域语音检测器门控空区输出,与隐式边界条件相比显式扫描与失配差分建模直接强化窗内相干与窗外相消,物理可解释性更强。在真实感(Realistic)集单目标条件下因果模型达到12.88 dB尺度不变信噪比(Scale-Invariant Signal-to-Distortion Ratio, SI-SDR),较两类隐式条件代理高约2.4 dB,且空区能量衰减达97.92 dB。在Realistic集单目标任务下,Proposed的SI-SDR为12.88,高于DPARNet-Proxy的SI-SDR 10.40。该结论依赖镜像源法仿真房间脉冲响应与固定4通道方形阵列,未验证真实录音、阵列失配与移动声源,窗内多说话人分离仍列为未来工作。其适用边界受限于仿真数据与固定方形阵列,真实录音与移动声源尚未验证。模型以1.66M参数与因果3.05 G/s计算量实现逐帧 \(O&\#40;1&\#41;\) 流式推理,原文未披露训练硬件与耗时。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
738. 因果错位不蒸馏特征值:用历史关系拓扑教流式关键词模型
标签:#知识蒸馏 #严格因果 #端侧运行 #流式处理 #关键词检测
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#知识蒸馏
👥 作者与机构
- Hanwen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Guosong Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向零前视流式关键词检测的任务输入为连续声学特征序列、输出为关键词类别预测,实际难点在于因果学生仅能利用历史语境而非因果教师的逐帧特征已隐含未来上下文,直接回归会造成监督信号与可实现感受野冲突。该方法先经无参数一维自适应平均池化与逐时刻行归一化将师生异构特征映射到统一时间粒度以构造可比关系结构,该输出进入帧间余弦相似关系矩阵构建,再用下三角因果掩码仅对齐历史拓扑并在离线训练中叠加全矩阵拓扑作为特权正则而不改变推理图。与逐点特征回归复制不可达绝对取值不同,该方法只传递相对演化结构从而与因果约束相容,并将全局上下文转化为有因果锚定的辅助监督以提升长时鲁棒性。在Google Speech Commands V2的12分类评测下,Ours-Bi的准确率为96.91%,高于无蒸馏基线Scratch的准确率95.12%。结论目前仅在该数据集与音频频谱Transformer(Audio Spectrogram Transformer,AST)到因果卷积的单一师生组合下验证,跨词汇、跨噪声与跨架构外推尚未证明。部署侧学生保持150K参数、5.2M乘加运算量与0.15 ms单步时延,原文未披露教师训练与完整训练时长成本。该适用边界受限于单一语料与单一师生组合的尚未验证外推,学生在树莓派4B硬件上的单步延迟与计算量则保持零前视推理开销不变。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
739. 不只听见声音,还要拿出证据:EChO-Agent 把音频问答拆成可核查的四步
英文题目:EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning
标签:#检索增强 #音频大模型 #可解释性 #音频问答
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#音频问答 | 主方法:#检索增强
👥 作者与机构
- Siyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Zong:机构信息未能从会议 PDF 纯文本可靠映射
- Junyu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Peiyuan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiahao Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Jingyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Tianrui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaobao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Longbiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianwu Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向复杂音频问答,需同时处理语音、声音与音乐混合信号并给出可核验推理链,难点在于问句相关片段定位与证据一致性评估。为此编排器以问题类型预设工具组合并对失败重试标记不可用,避免幻觉观察污染后续推理。方法组织为四阶段流水线:工具观测先按题型静态调度专用工具产出原始观察,证据整合再由大语言模型提炼为紧凑证据链,证据条件推理随后联合原始音频与证据生成双候选,验证仲裁最后检查格式与一致性并择优输出。与直接拼接工具输出的智能体相比,关键差异在于显式相关性过滤与跨工具综合的证据提炼环节,减轻了推理模型的噪声负担。在 MMAR 基准上相对 Qwen3-Omni-Instruct 基线准确率从 68.7% 提升至 71.0%,rubric 分数从 58.7 提升至 63.0,复合音频增益尤为明显,并列 Agent Track 第 5 名。该结论目前仅在单一 MMAR 评测上验证,对长时细粒度时序定位与工具失效外的泛化尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
740. 干净语音即触发器:Ouroboros 如何让增强模型在无注入下自我静默
英文题目:Ouroboros: Self-Referential Backdoor Attacks on Speech Enhancement via Clean Audio Triggers
标签:#数据集构建 #音频安全 #语音 #语音增强
评分:6.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#数据集构建
👥 作者与机构
- Yunjie Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Yuheng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Diqun Yan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强以含噪语音为输入并回归干净语音,在实时会议与语音助手等前端被动预处理链路中无法容忍推理期被主动注入触发器。Ouroboros先对训练集逐样本精确计算输入输出信噪比并降序筛选高信噪比样本,再将其输入替换为对应干净语音并将目标改写为静音或恶意短语,最后用保留干净子集与投毒子集联合训练以植入后门。推理时正常含噪输入仍走常规增强分支,而自然出现的干净语音因匹配已学分布而被动激活恶意分支。与BadNets类人工正弦触发相比,该CleanTrigger机制完全复用正常输入空间中的干净语音,消除了外加扰动的可检测痕迹。在VB-DEMAND上CMGAN取得99.39%的攻击成功率且PESQ仅下降0.26%,显著优于基线的隐蔽性。该结论限于配对监督训练的预测式与生成式增强模型,未验证跨数据集触发迁移与短时低信噪比误触发边界。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
741. 口语怎么说就怎么写:非正式波斯语如何同时拉动识别与翻译
英文题目:The Impact of Informal Persian Speech on Low-Resource ASR and Speech Translation
标签:#数据集 #SFT #低资源 #语音识别 #语音翻译
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#SFT
👥 作者与机构
- Hadi Alizadeh:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Asgari:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Sadegh Mehrabikia:机构信息未能从会议 PDF 纯文本可靠映射
- Amir Koohnavard:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
波斯语语音识别(Automatic Speech Recognition,ASR)与语音翻译(Speech Translation,ST)的输入是含混响、音乐与背景噪声的影视口语音频,输出为波斯语转写与英语译文,难点在于口语缩读与非标准词汇和正式体转写失配导致声文对齐噪声,如正式体/mi: xO:hæm/对应口语/mi:xOm/。本文构建口语平行语料Toorintan-Persian Informal Dataset(T-PID)并配套波斯语文本规范器(Normalizer),先经两阶段影视片段筛选切分与人工口语一致转写得到音频优先对齐文本,再用机器翻译生成英文并过滤与抽检校正,最后微调Whisper与Wav2Vec2-BERT做识别级联微调后NLLB-200做翻译。与仅用正式朗读语料训练的基线相比,该链条以忠实口语转写缓解声文失配,以音频优先采集适配基于连接时序分类(Connectionist Temporal Classification,CTC)的帧级建模。在T-PID测试集4.59小时2845条划分上,微调后Wav2Vec2-BERT取得29.09%词错率(Word Error Rate,WER)与级联25.30 BLEU,显著优于未微调基线。结论限于影视口语域与级联式翻译,未验证端到端翻译与跨方言外推。原文未披露训练、推理或部署成本,数据集以CC BY-NC 4.0在Hugging Face发布。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
742. 听懂与否如何改变人格判断:SPC V2 把语言理解变成可对照的实验条件
标签:#数据集 #基准设计 #多模态学习 #语音 #语音属性识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#基准设计
👥 作者与机构
- Nisreen Alshubaily:机构信息未能从会议 PDF 纯文本可靠映射
- Emily O’Hara:机构信息未能从会议 PDF 纯文本可靠映射
- Tanaya Guha:机构信息未能从会议 PDF 纯文本可靠映射
- Alessandro Vinciarelli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动人格感知需从10秒法语新闻语音预测听众归因的大五人格印象,难点在于印象同时依赖语言内容与副语言韵律且主观噪声大。该工作第一步负责构建可比语料:沿用640段Radio Suisse Romande广播音频并新增自动转录,音频与文本共同进入表征步骤,同时经Prolific招募懂法语与不懂法语两组评分者以BFI-10打分形成监督标签。第二步负责双通道表征:音频经Whisper编码为嵌入序列并按50%重叠切帧,文本经分词后由Word2vec编码为词嵌入序列,两类序列分别作为单模态建模输入。第三步负责由单模态到多模态建模:两路序列各送入LSTM输出帧级后验与分数并平均为片段预测,再将双路末层隐层拼接经全连接加Softmax完成融合,相对原仅用副语言的基准实现了语言与副语言分离与可控融合。在说话人无关五折嵌套验证中,法语组尽责性多模态准确率达 67.1%,高于同组副语言单模态 64.7% 与语言单模态 64.4%,而英语组宜人性呈现副语言单模态 61.2% 最优、融合降至 58.6%,显示语言理解的增益具特质依赖性。该结论仅适用于短时广播法语与二分标签,开放性在双组均接近随机,回归平均绝对误差多在 5.9 到 8.4 之间,外推到自发对话与跨文化场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
743. 缺真实管制语音时,用合成口音与信道仿真补足识别训练
英文题目:Synthetic Audio Generation Framework for Air Traffic Control Speech Recognition
标签:#数据增强 #低资源 #语音识别 #文本到语音 #语音转换
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#数据增强
👥 作者与机构
- Raphaël Bagat:机构信息未能从会议 PDF 纯文本可靠映射
- Zhe Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Junichi Yamagishi:机构信息未能从会议 PDF 纯文本可靠映射
- Irina Illina:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Vincent:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
空中交通管制(Air Traffic Control,ATC)自动语音识别(Automatic Speech Recognition,ASR)以无线电信道语音为输入并输出管制术语转写,难点在于8 kHz带限噪声、非母语(Second Language,L2)口音密集与可转写数据稀缺。该框架先用语音环境分离与超分净化真实音频,再经文本到语音(Text to Speech,TTS)、最近邻语音转换(Voice Conversion,VC)与口音转换(Accent Conversion,AC)生成多样化语音,最后经重采样、滤波与配对噪声回注还原管制声学条件。净化输出进入生成模块,生成波形进入声学仿真模块,仿真后波形与真实数据混合用于微调Whisper-small。与传统L2到母语(First Language,L1)归一化不同,可控L1到L2转换以目标口音嵌入为条件主动扩展口音多样性。在真实ATCO2测试集上,真实加合成L1到L2数据混合微调词错误率(Word Error Rate,WER)降至21.64%,优于仅真实数据微调的22.69%。该结论限于小规模英语管制语音与Whisper-small微调范式,未验证大模型、多语管制区与可懂度主观质量。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/usnistgov/SCTK.git → https://github.com/usnistgov/SCTK — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
744. 干净与噪声都要保住:DASH 用双视角多层原型蒸馏缓解加噪微调的权衡
标签:#数据增强 #知识蒸馏 #鲁棒性 #语音 #语音识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#知识蒸馏
👥 作者与机构
- Jaeeun Baik:机构信息未能从会议 PDF 纯文本可靠映射
- Ui-Hyeop Shin:机构信息未能从会议 PDF 纯文本可靠映射
- Jiwon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Woocheol Jeong:机构信息未能从会议 PDF 纯文本可靠映射
- Hyung-Min Park:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
任务以含噪语音波形为输入、以转写文本为输出,实际难点是真实噪声引起声学分布偏移,而有监督噪声增强微调易过拟合特定失真并损伤干净集精度。DASH采用两阶段链:先做配对干净视图与加噪视图的无标签编码器自蒸馏以建立噪声不变表示,再以转录损失做全模型有监督微调,前阶段学到的编码器参数直接作为后阶段初始化。教师分支处理干净语音,不计算梯度并施加停止梯度,参数按衰减率0.999对学生做逐步骤指数滑动平均更新;学生分支处理加噪语音并承担反向传播,迫使加噪表示向干净目标对齐。预训练从第6、11、17层抽取隐藏表示,经投影头映射为低维嵌入,与512个k均值原型计算相似度,再经温度3.5的Softmax归一化为分配分布,以帧平均KL散度拉近双视图一致性,随后全模型以0.7倍TDT损失加0.3倍CTC损失微调。该设计把一致性约束放在离散分配空间而非连续向量距离,意图缓解表征坍缩和低层声学捷径。在LibriSpeech test-other上DASH加干净微调达4.10%词错率(Word Error Rate,WER),优于噪声微调基线的4.35%,test-clean保持1.99%未退化。结论限于英语朗读与NOISEX-92人工加噪,未验证真实噪声、混响与自发对话。预训练约0.5小时,微调约12小时,额外开销约4%。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
745. 联邦不搬数据,对抗再分两步挡:语音情感识别的两阶段防御
英文题目:A Two-Stage Defence for Robust Federated Speech Emotion Recognition
标签:#对抗训练 #联邦学习 #对抗鲁棒性 #语音情感识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.4/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#对抗训练
👥 作者与机构
- Yi Chang:机构信息未能从会议 PDF 纯文本可靠映射
- Sofiane Laridi:机构信息未能从会议 PDF 纯文本可靠映射
- Zhao Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Gregory Palmer:机构信息未能从会议 PDF 纯文本可靠映射
- Björn W. Schuller:机构信息未能从会议 PDF 纯文本可靠映射
- Marco Fisichella:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从语音声学输入预测离散情绪标签,在物联网边缘部署中同时面临语音隐私泄露与白盒对抗样本误导诊断或内容审核的难点。本文提出两阶段联邦防御流水线,先由对数梅尔谱特征提取将各客户端语音转为时频输入,再经对抗联邦训练在本地混合干净与对抗样本更新模型并经服务器聚合。最后在推理时对谱图做随机缩放与填充以破坏扰动结构,前一步聚合后的全局模型直接作为后一步随机化推理的输入模型。与依赖攻击类型监控器的集成防御不同,该组合以训练阶段抵抗可迁移单步攻击、以推理随机化打乱过拟合的迭代攻击结构。在DEMoS数据集说话人相关划分上,对抗联邦模型经随机化后在对抗测试集的非加权平均召回率(Unweighted Average Recall / UAR)达90.15%与89.20%等水平,显著高于原始联邦模型的低鲁棒区间。该结论的适用边界受限于单一语料、说话人相关划分、同构客户端与三种白盒攻击,跨语料与异构联邦外推尚未验证,且对DeepFool类强迭代攻击的绝对性能仍明显偏低。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
746. 谁在跟我说话:用说话人感知的多轮对话历史补上缺失的注视
英文题目:Who is Talking to Me? Addressing Egocentric TTM with Speaker-aware Conversational Context
标签:#多模态学习 #Transformer #音视频 #语音 #口语理解
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语理解 | 主方法:#多模态学习
👥 作者与机构
- Fukun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Xionghu Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Minjie Cai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
第一视角下对我说话检测(Talking-to-Me,TTM)需根据目标语音段与对应人脸判断说话人是否在对佩戴者说话,难点在于多说话人频繁出画与视线缺失下的长程语义依赖。所提框架先由说话人感知语音嵌入模块将转写文本特征与说话人身份嵌入及对话轮次嵌入拼接投影为统一表征,再由对话上下文建模模块将当前与历史共10轮表征送入话语级 Transformer 编码器捕捉跨轮依赖。随后注视感知视觉嵌入模块用冻结的注视检测(Looking-at-Me,LAM)骨干提取帧级特征并池化投影,最后经双 token 自注意力融合语义与视觉线索并残差保留文本主导后输出分类。与显式建模身份与长上下文的机制差异使模型在视觉缺失时仍可沿对话流推理意图。在 Ego4D TTM 验证集上以平均精度均值(mean Average Precision,mAP)达到72.40%,超出此前最强的 SICNet约3.42个百分点。作者承认在人脸缺失与语义模糊时仍会失效,跨数据集与测试集外推尚未验证。原文未披露训练、推理或部署成本,代码与模型权重已在 GitHub 开源。
🔗 开源资源
- 第三方资源:https://github.com/EGO4D/social-interactions/tree/ttm — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/EGO4D/social-interactions/tree/lam — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
747. 台语发声中字落画:用三模态共识把硬字幕视频熬成 860 小时语料
标签:#数据集 #多模态学习 #半监督学习 #跨语言 #音视频语音识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音视频语音识别 | 主方法:#半监督学习
👥 作者与机构
- Cheng-Hsiu Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Chih-Chung Kuo:机构信息未能从会议 PDF 纯文本可靠映射
- Yu-Siang Lan:机构信息未能从会议 PDF 纯文本可靠映射
- Chao-Shih Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Yan-Ming Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan-Fu Liao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理跨语言语料构建:输入为台语语音与内嵌繁体中文字幕的视频帧,输出为与语音语义对应的中文字幕文本,难点在于语音与字幕语言不一致且无独立字幕文件可用,单看图像易受模糊与误检影响。视频预处理先用光学字符识别切分字幕片段并给出首候选文本,其输出与对应语音图像一并送入三模态音频视觉语言模型产生第二候选。字符错误率过滤仅保留双候选强一致样本对,其文本连同原图再送入视觉语言模型融合为精炼伪标签,伪标签回训音频视觉语言模型形成迭代闭环。相比单模态识别与双模态模型,该机制用音频语义约束视觉幻觉,用图像证据约束语言模型编造,使三模态互补判断优于任一单模态。在自建Golden Set上融合精炼使字幕识别CER从36.8%降至9.3%,860小时语料使Whisper跨语言转写CER从57.8%降至37.8%,台语到中文翻译BLEU从0.2016升至0.4033。在Golden Set任务下,融合精炼字幕的错误率为15.8%,低于PaddleOCR基线的错误率16.07%。该结论适用边界受限于台湾电视与网络台语节目字幕风格,对重度遮挡、强口音与非繁体字幕场景尚未验证。原文未披露训练推理成本与超参数细节。
🔗 开源资源
- 代码相关资源:https://github.com/Speech-AI-Research-Center/taigi-transcription — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
748. 体贴的倾听者:只在该应声的停顿处应声
英文题目:Considerate Listener Modeling for Korean Streaming Backchannel Prediction
标签:#多模态学习 #多任务学习 #流式处理 #语音 #轮次切换
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#轮次切换 | 主方法:#多模态学习
👥 作者与机构
- Yong-Seok Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Seung Hi Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Sung Yup Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式反向通道预测(backchannel prediction,BC)需在无未来帧条件下逐块判断是否插入短反馈,难点在于反向通道稀疏且聚集于暂停附近,而问句后暂停等语用不当区在声学上同样表现为静音。所提系统共享流式声学编码器,先由暂停检测器(pause detector,PD)输出块级暂停概率并对声学向量做软缩放以偏置决策至暂停邻近区,再用可学习查询对截至当前块的部分自动语音识别(automatic speech recognition,ASR)解码隐状态做交叉注意力压缩,得到文本上下文并与缩放后声学向量拼接送入变换器编码器分类。该设计同时约束何时响应与是否值得响应,而非仅检测静音。在韩语咨询语料评估划分约130637块、其中反向通道阳性3959个的条件下,完整系统相对声学基线将语义误发现率(Semantic False Discovery Rate,Semantic FDR)由5.76%降至3.07%,降幅53.8%,宏平均(Macro-F1)提升2.16个百分点至68.93%。结论目前仅在该咨询场景与人工标注的发起性话轮后暂停定义下成立,对识别错误、跨语言与多说话人泛化尚未验证。训练使用单张NVIDIA A40,原文未披露完整训练耗时与部署开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
749. 不用手写谐波字典:用离散化键值瓶颈同时修浊音与清音
英文题目:Dictionary-Free Discrete Key-Value Attention for Improving Speech Enhancement
标签:#注意力机制 #时频分析 #语音 #去混响 #语音增强
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#注意力机制
👥 作者与机构
- Zihao Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Jinwei Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Rongxiu Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Yingying Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Shilei Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Junlan Feng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道语音增强需从加性噪声与混响观测中恢复干净语音,浊音谐波结构性强易建模,清音辅音随机性强易被过度平滑。该文保留时频网格网络(TFGridNet)卷积加自注意力骨干,在部分注意力层对键(Key)与值(Value)并行施加输入投影适配器、有限标量量化(Finite Scalar Quantization,FSQ)与输出投影适配器,查询(Query)保持连续,再送入标准点积注意力计算权重与加权重构。量化后键决定相似度分布偏向稳定的语音原型,量化后值提供原型对应的上下文滤波,从而在匹配阶段抑制噪声引起的权重抖动。与依赖手工谐波字典的谐波注意力(Harmonic Attention,HAtt)联合时,前者管周期性浊音,后者管随机清音。在未见LibriSpeech集上,TFGridNet+HAtt+DFDA相对TFGridNet+HAtt将感知语音质量评估(PESQ)从2.68提升至2.74,将尺度不变信噪比(SISNR)从14.66 dB提升至15.32 dB,将清音段信噪比(UV SSNR)从7.37 dB提升至8.26 dB。结论限于16 kHz去噪与去混响、自有25k小时训练分布及判别式骨干,未验证突发噪声、跨采样率与生成式骨干外推。在上述适用边界内原文还披露了推理开销,1秒音频输入下DFDA仅增加0.48 GMACs计算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
750. 不按口音分专家,按发音方式分:六个语音专家的口音适配
标签:#LoRA #混合专家模型 #零样本 #语音 #语音识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#混合专家模型
👥 作者与机构
- Santosh Dahal:机构信息未能从会议 PDF 纯文本可靠映射
- Anmol Guragain:机构信息未能从会议 PDF 纯文本可靠映射
- Tianchi Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Luis Fernando D’Haro:机构信息未能从会议 PDF 纯文本可靠映射
- Kiran Chandra Dahal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为带6种母语背景口音的英语语音,输出为英文转写文本,难点在于非母语发音对元音共振峰与辅音频谱的系统性偏移让原生模型词错率升至约30.82%。方法链分三步推进:首先用在LibriSpeech上训练并冻结的音素识别模型为每帧生成发音类别伪标签,其次由可学习门控从编码器中间表示输出声学路由分布并与监督信号按可学习混合系数加权融合,最后在Conformer注意力投影上按Top-2激活对应低秩专家并叠加到冻结权重输出。与按口音分配专家的混合专家方案不同,该方法以固定的6类发音方式共享专家集合,测试时无需口音标签即可按音素内容自适应。在L2-ARCTIC多口音评测中最佳配置MoPE-QKV 6-16层取得10.43%词错率,相对单LoRA基线11.33%与全微调12.80%均有优势;留一口音零样本平均词错率9.98%,相对单LoRA平均11.38%下降约12.3%,相对未适配基线17.93%下降约44.3%。该结论仅在约16小时12分钟训练规模与Small约13M量级Conformer CTC模型上验证,未覆盖大模型、自发对话与强噪声外推。适配集中在第6层至第16层查询、键与值投影,每层6个秩为8的低秩专家但推理每帧仅激活2个,总参数约13.6M、活跃参数约13.2M,单卡NVIDIA RTX 5090可完成训练。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
751. 双分支不同步、教师更新不稳定:用时间拓扑一致与性能感知更新做声音事件检测
标签:#正则化 #半监督学习 #预训练 #音频事件检测
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#半监督学习
👥 作者与机构
- Lipeng Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Qing Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wu Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Peng Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Zhijun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Kuiliang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jinjie Fu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声音事件检测需从10 s音频中同时给出事件类别与起止边界,标注稀缺且预训练模型浅深层语义尺度不一致易导致双分支各自为政。该方法以预训练音频教师学生变换器帧级模型为前端,将12层均匀切分为前6层与后6层,经层归一化加可学习加权分别得到浅层特征与深层特征,再各送入一个4层Conformer分支建模不同层次时序依赖并拼接经线性层输出。在分支间引入时间拓扑一致性损失对齐帧间自相似结构,使双分支演化轨迹同步而保留特征互补,其输出进入性能感知平均教师的监督优化。训练侧用性能感知平均教师按标注参考损失是否创新低切换快慢EMA系数以跟随学生实时状态,最后对两阶段模型做跨阶段融合平均前后预测。与双分支独立训练加固定衰减教师相比,该设计只约束关系拓扑而非特征值本身,并让教师更新幅度自适应训练波动,从而提升定位与分类稳定性。在DCASE 2024 Challenge Task 4评测设置下,所提跨阶段融合系统的Score为1.309,高于CP-JKU (Iter.2)的Score 1.298。该结论限于家庭环境与MAESTRO Real混合分布,未验证跨域、强噪声与小样本稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
752. 稳态要稳、切换要快:用状态引导的平滑解决脑电注意切换的抖动与迟滞矛盾
标签:#助听器 #自适应滤波 #脑信号 #语音 #言语神经解码
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#言语神经解码 | 主方法:#自适应滤波
👥 作者与机构
- Yuting Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Xuefei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Ximin Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chunlin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
听觉注意切换解码(Auditory Attention Switch Decoding,AASD)要求从脑电图(Electroencephalography,EEG)与两路竞争语音中逐窗判断当前注意说话人,难点是EEG非平稳导致窗级预测抖动,且切换过渡期证据模糊。所提状态引导自适应决策(State-Guided Adaptive Decision,SGAD)在冻结的EEG-语音匹配编码器之上增加决策级时序模块:先计算EEG嵌入与两路语音嵌入的皮尔逊相关度并形成决策裕量,再由因果状态检测器(Causal State Detector,CSD)聚合历史EEG嵌入估计切换概率,最后经自适应门控机制(Adaptive Gating Mechanism,AGM)将该概率映射为时变平滑系数以递归更新决策裕量。稳态施加强平滑,疑似切换时降低惯性,从而解耦稳定性与响应速度。在MS-AASD数据集上搭配FCTNet编码器与留一试验(LOTO)划分时SGAD达到准确率85.6%与切换F1值72.5%,切换延迟1.12 s;六协议平均准确率79.8%、平均切换F1值67.3%、平均延迟1.18 s。该结论限于13名21岁至28岁正常听力青年、自发按键切换范式与双说话人0 dB混合条件,最严的留一被试与说话人对(LOSSO)降至76.7%与62.3%,尚未验证听损人群、混响噪声与实时闭环助听场景。原文未披露推理吞吐与端侧部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
753. 多语言痴呆语音检测:冻结编码器加轻量头为何能跨语言迁移
英文题目:Foundational speech models evaluation on multilingual dementia prediction
标签:#语音生物标志物 #迁移学习 #多语言 #零样本 #病理语音评估
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#迁移学习
👥 作者与机构
- Bartłomiej Eljasiak:机构信息未能从会议 PDF 纯文本可靠映射
- Wojciech Szecówka:机构信息未能从会议 PDF 纯文本可靠映射
- Piotr Masztalski:机构信息未能从会议 PDF 纯文本可靠映射
- Agnieszka Pruszek:机构信息未能从会议 PDF 纯文本可靠映射
- Teresa Brzozka:机构信息未能从会议 PDF 纯文本可靠映射
- Zofia Marciniak:机构信息未能从会议 PDF 纯文本可靠映射
- Justyna Krzywdziak:机构信息未能从会议 PDF 纯文本可靠映射
- Michał K. Grzeszczyk:机构信息未能从会议 PDF 纯文本可靠映射
- Łukasz Łazarski:机构信息未能从会议 PDF 纯文本可靠映射
- Mateusz Matuszewski:机构信息未能从会议 PDF 纯文本可靠映射
- Daria Hemmerling:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究基于语音声学证据的痴呆检测(dementia detection),输入为图片描述、故事复述与堂吉诃德朗读等语音,输出为痴呆与健康对照(healthy control)的二分类标签,难点是多语言口音与任务差异大、小样本临床数据易过拟合。方法链为受 SUPERB 启发的标准流水线:先用带时间戳转录或 pyannote.audio 说话人分离标注(diarization)剔除访谈者语音并切分为含至少 6 秒被试语音的片段,再用冻结的基础语音编码器(foundational speech encoder)提取多层 Transformer 表征并以可学习权重融合,最后经轻量下游分类器输出片段概率并平均得到被试级得分,以验证集阈值判定类别。与已有单语种微调工作相比,该工作把多语言联合训练与未见语言零样本(zero-shot)迁移作为核心变量,检验病理标志的跨语言通用性。在合并英语语料上平均达到 0.854 的 F1 值,在更具挑战的多语言合并语料上达到 0.761 的 F1 值和 0.831 的 ROC AUC,未见语言英语零样本达到 0.786 的 ROC AUC。结论仅适用于以图片描述为主的 5 种语言语料,未验证自发对话、重度口音与不同录音设备的泛化,TAUKADIAL 官方划分不一致时结论更需谨慎。原文仅披露使用 8 卡 A100 与 4 卡 RTX PRO 6000 训练,未披露训练时长、推理时延与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
754. 最后一层并非最优:用逐层校准让冻结语音基座的多层融合更稳
英文题目:CAL-MOS: Bridging Layers with Adapters for Robust MOS Prediction Across Speech Foundation Models
标签:#Adapter #鲁棒性 #语音 #语音质量评估
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#Adapter
👥 作者与机构
- Alef Iury Ferreira:机构信息未能从会议 PDF 纯文本可靠映射
- Pedro Botelho:机构信息未能从会议 PDF 纯文本可靠映射
- Fernanda Silva:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Casanova:机构信息未能从会议 PDF 纯文本可靠映射
- Rafael Faustino:机构信息未能从会议 PDF 纯文本可靠映射
- Frederico Oliveira:机构信息未能从会议 PDF 纯文本可靠映射
- Arlindo Galvão Filho:机构信息未能从会议 PDF 纯文本可靠映射
- Anderson da Silva Soares:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非侵入式平均意见分预测输入为待评语音波形,输出为1至5分的人类感知质量分,难点是不同语音基础模型各层分别编码声学、音素与语义信息且最优深度随骨干和语料漂移。作者先冻结语音基础模型抽取全部编码层表示,再对每层独立施加适配器校准至任务空间,随后跨层拼接并做掩码均值池化得到话语向量,最后经多层感知机回归并截断到MOS区间。与直接对原始层做可学习标量加权的朴素融合相比,该链条的关键差异是在融合前消除层间尺度与语义错位,而非假设各层已可比,这提升了冻结骨干下多层融合的稳健性并缩小与全量微调的差距。在四数据集平均评测条件下,XLSR-300M最佳层选择的平均话语级MSE为0.417,低于末层基线的平均话语级MSE 0.469。该结论仅在 BVCC、BRSpeechMOS、SingMOS 与 TMHINT-QI 的域内划分下成立,未验证跨数据集、跨合成系统与跨语言外推,朴素融合在部分骨干上仍接近最优。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
755. 希腊语歌声转写:规模越大越准,但小模型更需要翻译任务来稳住
标签:#多任务学习 #低资源 #音乐 #语音识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#多任务学习
👥 作者与机构
- Maria Frangiadaki:机构信息未能从会议 PDF 纯文本可靠映射
- Dimitrios Damianos:机构信息未能从会议 PDF 纯文本可靠映射
- Kosmas Kritsis:机构信息未能从会议 PDF 纯文本可靠映射
- Vassilis Katsouros:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
希腊语歌唱的自动歌词转录需将多声部歌曲中的人声映射为希腊语文本,难点在于持续元音与花唱造成的时域拉伸、节奏不规则以及伴奏干扰,且词形变化丰富。作者先以混合变换器音源分离提取人声,再经联结时序分类强制对齐得到片段级平行语料,然后以Whisper为基座分别开展转录单任务微调、转录翻译多任务交替训练与口语到歌唱两阶段适应。与直接零样本推理相比,该链条将口语预训练表示逐步约束到歌唱声学与希腊语词法,并以固定比例交替呈现任务纯批次设计,避免了转录与翻译目标在同一批次内冲突。与零样本基线相比,最优的两阶段Whisper Large-v3在保留测试集上将归一化词错误率(Word Error Rate,WER)由53.6%降至27.2%。结论仅适用于分离后人声主导的希腊流行歌曲片段,对强伴奏残留、方言与即兴唱腔的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
756. 一个扩散模型同时看七种机器:条件引导如何替代一机一模型
英文题目:UD-ASD: A Unified Diffusion Model for Anomalous Sound Detection
标签:#工业应用 #扩散模型 #统一音频模型 #异常声音检测
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#异常声音检测 | 主方法:#扩散模型
👥 作者与机构
- Pengxiang Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Qiu:机构信息未能从会议 PDF 纯文本可靠映射
- Yanzhi Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
异常声音检测以10 s机器运转音频的对数梅尔谱为输入,以正常与异常二值判定为输出,难点在于仅用正常样本建模分布并在7类机器与域偏移下保持稳定泛化。方法链分三步:条件投影器将离散机器编号映射为条件嵌入并与谱图通道拼接,为后继生成提供机器上下文;条件扩散模型仅在正常数据上学习去噪重建,将任意输入按正常声修复;对帧级重建误差做时间池化得到256维向量,再用2分量高斯混合模型以负对数似然打分,建模误差分布而非简单范数。与逐机训练的自编码器和扩散基线相比,该链条以跨机共享主干加轻量条件引导替代多模型部署,以分布级误差建模替代L1或L2阈值,从而兼顾泛化与特异重建。在DCASE2022 Task 2开发集评测下,统一模型UD-ASD-U的AUC调和均为77.16%与pAUC调和均为62.80%,均高于官方自编码器基线的AUC与pAUC,分别领先约24.15个百分点AUC和10.00个百分点pAUC。其结论适用边界受限于已知准确机器标签条件,失败条件包括标签缺失或错误,且对未见机型的零样本检测尚未验证。原文披露单片段推理约 0.32 s 与 24.4M 参数量,训练耗时与显存占用未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
757. 小扬声器非线性失真下如何保住声区隔离:用建模网络监督轻量控制网络
英文题目:NCPSZ: A Nonlinear Control Network for Miniature Loudspeakers in Personal Sound Zone Applications
标签:#CNN #严格因果 #语音 #主动降噪
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#主动降噪 | 主方法:#CNN
👥 作者与机构
- Chen Gong:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Chen Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Hongqing Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Liming Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Lu Gan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向智能手机防泄漏的个人声区(Personal Sound Zone,PSZ)需要在亮区(Bright Zone,BZ)保真再现语音的同时压低暗区(Dark Zone,DZ)能量,而微型扬声器在大音量下产生的谐波与互调失真使线性滤波器无法生成有效的反相抵消信号。方法链分三步:首先在时频域用高容量建模网络离线拟合扬声器到传声器的非线性映射;随后冻结该代理模型并以前馈方式接入控制优化,使控制网络生成的驱动信号经由代理产生可微分的亮区与暗区声场误差;最后采用锚点扬声器(Anchor Speaker)分工,由主耳机扬声器维持亮区目标,轻量因果网络只优化辅助扬声器以抵消暗区非线性泄漏。与线性方法相比,该框架不再假设可叠加传递函数,而是直接对失真谐波建模并进行相位敏感的多通道控制。在半消声室采集的智能手机任务上,以200-2000 Hz声学对比度(Acoustic Contrast,AC)为指标,提出方法相对线性可变跨度权衡(Variable Span Trade-off,VAST)基线平均提升3.78 dB,相对参数量匹配的因果卷积基线平均提升1.80 dB,且亮区声压级接近参考。结论目前仅适用于受试设备、固定佩戴姿态与高音量非线性工况,未验证跨设备、混响房间与移动外推能力。原文未披露训练时长、推理时延与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
758. 自然对话里藏着早期认知衰退:结构化病历不够时语音补上了什么
英文题目:Natural Speech Encodes Early Markers of Cognitive Decline: Evidence from Clinical Conversations
标签:#语音生物标志物 #多模态学习 #语音 #病理语音评估
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#多模态学习
👥 作者与机构
- Yasaman Haghbin:机构信息未能从会议 PDF 纯文本可靠映射
- Sina Rashidi:机构信息未能从会议 PDF 纯文本可靠映射
- Ali Zolnour:机构信息未能从会议 PDF 纯文本可靠映射
- Margaret McDonald:机构信息未能从会议 PDF 纯文本可靠映射
- Maryam Zolnoori:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为家庭护理场景下结构化电子健康档案(Electronic Health Record,EHR)、自由文本护理记录与自然对话语音,输出为是否存在认知衰退的二分类判断,难点在于早期症状细微且结构化记录稀疏缺失。方法链分为三步:先对护理记录与语音做清洗、自动转录与说话人角色映射并仅保留患者语音,再分别用声学分析工具与预训练语言模型抽取韵律声学特征和语义句法嵌入,最后经线性适配投影为统一模态标记并由可学习融合标记通过交叉注意力与自注意力压缩融合后分类。与已有实验室诱发语音研究的关键机制差异在于直接利用真实护理对话的长时交互内容与表达方式双通道,并量化每种语音来源相对病历基线的增量价值。在 175 例按性别、结局与填补状态分层划分的测试集上,最优组合相对病历基线将曲线下面积(Area Under Curve,AUC)从 0.74 提升至 0.92,同时认知类 F1 达到 83.08。该结论目前仅适用于单中心英语家庭护理人群与回顾性划分,尚未验证跨机构、跨语言与纵向预测能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
759. 不塌缩频谱轴:在二维谱时网格上直接做全局建模的说话人验证
英文题目:Continuous 2D Spectral—Temporal Transformer for Speaker Verification
标签:#注意力机制 #高效推理 #语音 #说话人验证
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#注意力机制
👥 作者与机构
- Seongwook Ham:机构信息未能从会议 PDF 纯文本可靠映射
- Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证(Speaker Verification,SV)需以对数梅尔滤波器组等时频输入提取可区分说话人的嵌入表示并用于是否同人判定,难点在于同时保留频谱细节与长时依赖而不被过早压缩丢失频率结构。该工作提出连续二维谱时变换器(Continuous 2D Spectral-Temporal Transformer,C2D-ST),先由五阶段谱时注意力主干以邻域注意力建局部依赖并以轴向注意力沿频率与时间建全局依赖,再将多阶段输出折叠为时间序列做可学习加权聚合与最终时序建模,最后经注意力统计池化输出嵌入。与 ReDimNet 类混合结构的关键差异是全局建模直接发生在谱时网格而非塌缩后的一维时间表示上,从而保留频率维结构并提升参数效率与判别能力。在 VoxCeleb1-O/E/H 评测中,最终配置(大间隔微调与质量度量函数)平均等错误率(Equal Error Rate,EER)达到 0.507%,平均最小检测代价(minimum Detection Cost Function,minDCF)为 0.051,参数量 6.9M,优于 15.0M 的 ReDimNet-B6(0.633%/0.059)与 27.1M 的 ECAPA2(0.617%/0.062)。该结论目前仅在 VoxCeleb2 开发集训练与 VoxCeleb1 测试的范围内验证,未检验噪声、短语音与跨语言外推。原文未披露训练硬件、批量大小与推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
760. 合成语音混得像不像:用语音级语码混合度约束 TTS 再反哺语码切换识别
英文题目:Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech
标签:#数据增强 #偏好优化 #多语言 #语音识别 #文本到语音
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#偏好优化
👥 作者与机构
- Yeo Yue Heng:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhou Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Shreyas Gopal:机构信息未能从会议 PDF 纯文本可靠映射
- Hexin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Leibny Paola Garcia-Perera:机构信息未能从会议 PDF 纯文本可靠映射
- Sailor Hardik:机构信息未能从会议 PDF 纯文本可靠映射
- Jeremy H. M. Wong:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
代码切换(Code-Switching,CS)自动语音识别(Automatic Speech Recognition,ASR)需转写中英混杂的自发对话,难点在于语言交替频繁、跨语言音系干扰强且高质量标注语料稀缺。本文提出代码混合引导的偏好学习框架:先在新加坡马来西亚普通话英语对话语料 SEAME 上微调多语言合成模型 CosyVoice 2得到基线,再对同一文本随机采样多个候选,用混合错误率(Mixed Error Rate,MER)、感知质量 UTMOS 与声学混合度差值排序,最后用直接偏好优化(Direct Preference Optimization,DPO)放大最优与最差样本的似然间隔。与只优化可懂度或自然度的已有合成偏好方法不同,该框架引入基于帧级语言伪标签的声学混合度,显式约束合成语音的语言比例与边界结构。在SEAME语料DevMAN和DevSGE评测设置下,100小时真实加100小时合成微调的Whisper Large v3的混合错误率为8.9%与14.2%,分别低于100小时纯真实基线的混合错误率12.1%与17.8%。该结论仅在 SEAME 单一语料验证,未证明对其他语言对或朗读式切换的适用性。原文未披露训练推理部署成本与开源产物。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
761. 不直接猜音素:用发音动作预测重建跨语言鲁棒性
英文题目:ArtNet: A JEPA-Like Articulatory Predictive Framework for Robust Zero-Shot Phoneme Recognition
标签:#变分自编码器 #鲁棒性 #跨语言 #零样本 #语音识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#变分自编码器
👥 作者与机构
- Zeqian Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Fuliang Weng:机构信息未能从会议 PDF 纯文本可靠映射
- Shu Shang:机构信息未能从会议 PDF 纯文本可靠映射
- Yaqian Zhou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本跨语言音素识别以语音声学输入、以国际音标序列为输出,难点在于直接声符映射在未见语言上出现大量界内音素混淆而非单纯未登录音素缺失。本文先用英文微调多语言HuBERT构建联结时序分类识别器并生成帧级伪标签,再经Panphon查表将伪标签转为24维发音属性向量形成结构化监督目标。接着冻结识别器并训练变分信息瓶颈加发音预测器,将编码器隐状态压缩为随机潜变量后回归发音向量以滤除语言相关波动。推理时按联结时序分类分段池化取均值向量预测发音向量,再用向量空间库存对齐在目标语言音素库中做余弦最近邻解码。与基线相比,该组合在7个未见语言平均音素错误率相对降低20.56%,音素特征错误率相对降低7.01%。结论目前仅在英文到德荷法西意葡波的欧洲语言迁移上验证,对声调语言与低质量野外语音的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
762. 固定 320 倍下采样为何装不下多采样率:MSR-HuBERT 按率分流对齐 20 毫秒帧
英文题目:MSR-HuBERT: Self-supervised Pre-training for Adaptation to Multiple Sampling Rates
标签:#CNN #自监督学习 #预训练 #语音 #语音识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Zikang Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Meng Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Tianrui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xuanchen Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaobao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Longbiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianwu Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自监督语音模型长期绑定16 kHz输入,其固定320倍下采样卷积在24 kHz和48 kHz上产生帧移错位,直接混入多速率波形会导致时间分辨率不一致与高频语义失衡,无法直接处理混合采样率波形。MSR-HuBERT按输入采样率将波形路由至专用下采样卷积分支,通过为每种速率定制步长与核宽把16 kHz、22.05 kHz、24 kHz、48 kHz统一压缩到20 ms帧移的帧级特征,再经分支独立层归一化消除聚合不一致并映射到共享特征空间。随后共享Transformer编码器对掩蔽后特征建模长时上下文,并用单一共享码本做掩蔽单元预测,从而在统一时间网格上联合学习多速率数据并约束不同速率表征落入公共不变空间。与重采样到单速率的HuBERT相比,该机制无需重采样即可避免高频信息丢弃,又完整保留了原有掩蔽预测目标与编码器结构以兼容已有改进。在SUPERB协议16 kHz LibriSpeech测试集评测下,MSR-HuBERT的WER为5.89%,低于Re. 16kHz HuBERT Base的WER 6.03%。结论目前仅在4种速率、冻结编码器的SUPERB范式及英语朗读语音上验证,未覆盖噪声、对话或跨语言外推。每增加1种采样率约增加3%参数量,4速率混合训练时长仅增加约2.6%。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
763. 证据不足时别硬编:用噪声先验让音频大模型收敛表达
英文题目:Noise-Aware In-Context Learning for Hallucination Mitigation in ALLMs
标签:#基准测试 #检索增强 #音频大模型 #模型评估 #音频字幕生成
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频字幕生成 | 主方法:#检索增强
👥 作者与机构
- Qixuan Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Khalid Zaman:机构信息未能从会议 PDF 纯文本可靠映射
- Masashi Unoki:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
听觉大语言模型以音频为输入生成自然语言描述,在重叠事件与背景噪声等真实场景下常因声学证据不足而依赖语言先验作过度确定的补全,从而产生听觉幻觉。NAICL离线合成多谱分布宽带噪声并配以结构化保守描述构建先验库,以无稳定语义的噪声刻画声学下界应有的表达模板。在线推理时用BEATs编码器对输入音频与噪声库编码并按余弦相似度检索Top-3最相关噪声-描述对,其输出直接作为上下文进入下一步。被测大模型在输入音频与检索噪声上下文联合条件下解码生成字幕,在证据不足时退回声学层保守表达而非断言具体事件。与用真实音频作示范不同,该方法以弱语义噪声为对比先验,避免强化事件级确定性表达,故为免微调的推理时校准。在Clotho-1K基准下,NAICL的幻觉率指标为16.98%,低于Qwen2.5-Omni-7B基线的幻觉率指标26.53%。该结论适用边界受限于英文众包字幕的短时环境声,尚未验证语音音乐与长音频上的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
764. 一个模型吃下三种采样率:用接口对齐与特征校准共享量化器
英文题目:Unified Neural Speech Coding for Multiple Sampling Rates
标签:#Adapter #向量量化 #流式处理 #语音 #语音编码
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Jiankai Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Junteng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Lizhong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Liang Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhan Ma:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为16 kHz、24 kHz与48 kHz语音波形,输出为同采样率重建波形与离散编码,难点在于相同卷积感受野对应不同物理时长,且带宽差异导致频谱统计与中间特征分布偏移,难以共享量化器。先由输入端采样率适配器将各采样率波形映射到统一内部时间网格,输出时间对齐后的内部波形以消除物理时长错位;再将该对齐波形送入共享编码器与残差向量量化提取并离散化隐表示,输出跨采样率共用的码本索引并送入解码侧重建内部波形;最后经块内采样率调制器按采样率做通道级仿射校准后,由输出适配器将重建的内部波形恢复为目标采样率。与外部重采样或多分支、变步长方案不同,该设计把采样率感知压缩到接口转换与特征校准两个轻量环节,主干与码本完全共享。在LibriTTS 24 kHz评测设置下,统一模型的ViSQOL为4.224,高于专用模型Ours@24kHz的ViSQOL 4.168。结论仅在英语朗读、固定三档采样率和固定1.5 kbps下验证,未覆盖任意采样率、噪声混响与可变码率。单模型参数量19.65M,三档计算量为2.14/2.58/2.34 G MACs,原文未披露推理时延实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
765. 模态不可靠时先估计不确定性再融合:EmoEUS 的显式方差监督
英文题目:EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation
标签:#多模态学习 #Transformer #音视频 #语音 #语音情感识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Zilong Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Junjie Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhe Li:机构信息未能从会议 PDF 纯文本可靠映射
- Man-Wai Mak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
对话情感识别需为每轮话语综合文本、音频、视频证据并利用对话上下文预测离散情绪,难点是各模态质量随话语剧烈波动且易混淆情绪边界模糊。EmoEUS 先以冻结编码器加双向门控循环单元提取上下文特征,再经上下文分布估计器 Context-level Distribution Estimator 将三模态特征映射为高斯均值 \(\\mu\_\{\\delta\}\) 与方差 \(\\sigma\_\{\\delta\}\),按相对方差计算模态置信度并加权均值,随后经多头注意力与 Transformer 编码器融合上下文并分类,同时以显式监督损失 Explicitly Supervised Loss 将预测方差对齐到话语分布与情绪模态相关聚类中心的 2-Wasserstein 距离。与仅用分类损失隐式学习不确定性的方法不同,该设计为方差提供逐话语回归目标,使融合权重随可靠性动态调整。在IEMOCAP留一会话验证集评测下,EmoEUS的加权F1为74.36%,从FEMI的加权F1 73.53%升至74.36%。在MELD官方划分测试集评测下,EmoEUS的加权F1为67.53%,从AdaIGN的加权F1 66.79%升至67.53%,并降低了Happy-Excited等易混对的误分率。结论限于完整三模态英文会话,缺失模态、高噪声与跨域外推尚未验证,原文未披露训练推理成本。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
766. 不用训练也能让语音模型想清楚:以隐状态差值增强链式思考
标签:#测试时自适应 #音频大模型 #少样本 #语音 #音频问答
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#测试时自适应
👥 作者与机构
- Lok-Lam Ieong:机构信息未能从会议 PDF 纯文本可靠映射
- Chia-Chien Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chih-Kai Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Yu-Han Huang:机构信息未能从会议 PDF 纯文本可靠映射
- An-Yu Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为朗读式语音问题加任务指令,输出为逐步推理与最终答案,难点在于大型音频语言模型(Large Audio-Language Model, LALM)经多模态训练后指令跟随弱化,直接思维链(Chain-of-Thought, CoT)提示不能稳定诱发结构化推理,且语音推理弱于文本推理。方法构造带短CoT提示与不带提示的成对输入,抽取最后k层最终提示词位置隐状态之差作为推理方向,再按实例级或外部数据平均得到转向向量,推理时在选定深层全位置以系数缩放注入并做L2范数保持。与直接CoT或多次采样投票相比,该机制在表示层强化CoT相关激活,无需更新参数或多次完整生成。在4个LALM与4个语音推理基准的微平均准确率上,11组12组模型与方法组合超越CoT,Audio Flamingo 3上文本导出向量相对CoT提升4.4个百分点,Voxtral-mini-3B上朴素转向提升4.3个百分点。该结论限于英语数学与科学类朗读语音问答,未验证噪声、自发语音、多轮对话或长音频外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
767. 分数超过人类却看不懂嘴型:视觉语音识别的唇读鸿沟
英文题目:The Lipreading Gap: Do VSR Models Perceive Visual Speech Like Human Lipreaders?
标签:#人类参与评测 #模型比较 #言语感知 #静默语音接口
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#静默语音接口 | 主方法:#人类参与评测
👥 作者与机构
- Rishabh Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Naomi Harte:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
视觉语音识别(Visual Speech Recognition,VSR)输入为静音唇部视频,输出为词转写文本,难点在于大量音素(Phoneme)在视觉上不可区分,孤立词时句子上下文缺失使歧义更大。本研究首先复用Auto-AVSR、AV-HuBERT与VSP-LLM三类预训练VSR系统对2189个MaFI英语孤立词做零微调推理,得到词转写基线输出。接着将该转写经音素化器(Phonemizer)转为音素与视素(Viseme)序列并计算多级分数,同时构建仅见前K个音素的纯文本n元模型以剥离视觉贡献。然后以前两步的分数与基线为输入,在词频与MaFI视觉清晰度下做误差相关分析,并对比视素混淆拓扑与高低清晰度分组性能,从而揭示模型依赖训练语言模式而非自下而上视觉感知的机制差异。最佳模型Auto-AVSR-Large在MaFI上词错误率(Word Error Rate,WER)为0.65,优于人类0.83,字符错误率(Character Error Rate,CER)为0.30对0.65,音素分(Phoneme Score,PS)为0.87对0.71,视素分(Viseme Score,VS)为0.82对0.53,但其词级人类对齐分数仅0.37,人类分裂半上限达0.74。纯文本2元模型仅见3个首音素即在MaFI达41%词准确率,在域内LRS3达76.7%。结论仅适用于英语孤立词离线识别,未验证连续句子、多说话人与非英语外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
768. 只看文字会把两个人说成一个人:用说话人向量修补假设聚类的多说话人识别
标签:#模型集成 #语音 #语音识别 #目标说话人提取
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型集成
👥 作者与机构
- Yosuke Kashiwagi:机构信息未能从会议 PDF 纯文本可靠映射
- Osamu Take:机构信息未能从会议 PDF 纯文本可靠映射
- Hayato Futami:机构信息未能从会议 PDF 纯文本可靠映射
- Emiru Tsunoo:机构信息未能从会议 PDF 纯文本可靠映射
- Siddhant Arora:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多说话人语音识别(Multi-Talker Automatic Speech Recognition,MT-ASR)需从单通道混合语音中恢复无序的多说话人转写集合,难点在于排列不定、重叠干扰以及相同文本会让纯文本相似度失效。本文沿用说话人令牌条件解码生成多假设,再为每个假设的对齐音频段抽取连续说话人嵌入,接着以归一化编辑距离与嵌入距离的加权和做凝聚层次聚类(Agglomerative Hierarchical Clustering,AHC),最后在簇内用识别器输出投票纠错(Recognizer Output Voting Error Reduction,ROVER)合并。与仅文本聚类的 HCM 相比,关键差异是在联合转写-说话人空间定义距离,并在目标说话人场景用注册嵌入直接匹配簇质心而非离散令牌量化提示。在 VCTK 伪相同内容两说话人干净条件下,词错率(Word Error Rate,WER)由 68.3% 降至 36.6%,相对下降约 46.4%;在 LibriMix 目标说话人干净两说话人条件下,WER 由 18.7% 降至 14.4%,相对改善约 23.0%。该结论在标准 LibriMix 上仅为持平或微降,在三说话人强噪声与极端重叠下仍失效,且未验证真实会议数据。原文未披露训练与推理计算成本,未提供代码与模型。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
769. 冻结骨干不动,只把嵌入往干净目标拉:vMF 轮廓似然为何够用
英文题目:Revisiting Label-Free Speaker Embedding Enhancement with vMF Profile Likelihood
标签:#统计分析 #鲁棒性 #语音 #说话人验证
评分:6.1/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#统计分析
👥 作者与机构
- Seunghwan Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jinyong Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Sooyoung Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Youngjin Ko:机构信息未能从会议 PDF 纯文本可靠映射
- Myungjoo Kang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证(Speaker Verification)需将变长语音映射为归一化嵌入并用余弦打分比对,噪声、混响、电话信道等声学失配会扭曲嵌入方向。作者冻结说话人嵌入提取器,先由干净语音与增强退化语音生成配对嵌入,再用轻量映射将退化嵌入推向干净目标,随后以冯·米塞斯-费舍尔分布(von Mises-Fisher,vMF)建模干净目标并解析消去逐样本集中参数,最终得到对数残差目标并用其梯度自适应压制大残差对。与固定集中的均方误差及扩散生成式增强相比,该机制差异在于用样本内估计的不确定性调节监督强度而非学习显式生成轨迹。在ResNet-34主干上,中国名人数据集(CN-Celeb)评测的等错误率(Equal Error Rate,EER)由14.54%降至13.78%,远场语音数据集(VOiCES)由5.62%降至5.30%,同时VoxCeleb1标准集基本不损失。该结论限于加性噪声与混响交叠及电话退化的已见组合,对极端未见退化与跨语种泛化的外推尚未验证。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
770. 韩语字形写音不准时:只标鼻音韵尾的 SALT-N 为何更稳
英文题目:SALT: Selective Allophone-Level Tokenization for Korean Text-to-Speech Synthesis
标签:#流匹配 #语音学与音系 #低资源 #语音 #文本到语音
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Kwangsung Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Cellik Adams:机构信息未能从会议 PDF 纯文本可靠映射
- EunKyoung Jo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
韩语文本到语音的输入是韩文正字法文本,输出是对应语音,难点在于形态音系正字法造成的形音不一致与音位到同位异音的一对多映射在低资源下难以隐式习得。本文先用文本规整与字位到音位转换把输入变为音位序列,再由选择性同位异音层级分词按声母与韵尾规则附加发音标签,最后将该序列送入预训练流匹配模型微调以生成梅尔频谱并经声码器合成波形。与直接使用字素或音位以及全量同位异音标记相比,该方法的机制差异是只显式切分最高频且声学区分度最大的鼻音韵尾,从而以最小词表扩张换取分布均衡。在12.75小时韩语单说话人数据集上主推配置相对字素基线将字符错误率从4.74%降至3.30%,且获得最高主观自然度。结论仅在单说话人朗读体小数据与特定微调流程下成立,向多说话人、大规模语料及其他语言的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
771. 把情感强度学成从中性出发的轨迹:ETC-TTS 如何稳定控制合成情感
英文题目:ETC-TTS: Emotion Trajectory Learning for Controllable Emotional Text-to-Speech
标签:#流匹配 #向量量化 #语音 #文本到语音
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#流匹配
👥 作者与机构
- Gaeun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jaeuk Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可控情感语音合成需要从文本生成语音并连续调节情感强度,难点在于推理时缩放或插值常导致强度非单调与音质退化。所提情感轨迹学习框架先用残差向量量化提取分层风格向量并以可学习情感原型锚定类别中心,再以条件整流流匹配学习从中性原型加噪出发指向目标情感的速度场,推理时按轨迹参数积分得到参考无关的中间风格并送入声学骨干合成。与仅在推理时操纵嵌入的相对属性与缩放因子方法不同,该机制在训练中显式监督中间状态,因而单调性更稳定。在 ESD 英语集上情感准确率达到 92.93%,明显高于同骨干基线并保持自然度竞争力;在 AIHub 韩语集上多档强度成对比较误差率显著下降。该结论限于韩语 7 类与英语 ESD 5 类表演性情感及有限说话人设定,未验证零样本说话人与真实自发情感。原文未披露推理积分求解器与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
772. 先验对不准就会漏:双分支如何把语音和噪声各自管住
英文题目:Analysing Adversarial Priors for Data-driven Unsupervised Speech Enhancement
标签:#生成对抗网络 #无监督学习 #语音 #语音增强
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#生成对抗网络
👥 作者与机构
- Dominik Klement:机构信息未能从会议 PDF 纯文本可靠映射
- Matthew Maciejewski:机构信息未能从会议 PDF 纯文本可靠映射
- Sanjeev Khudanpur:机构信息未能从会议 PDF 纯文本可靠映射
- Honza Černocký:机构信息未能从会议 PDF 纯文本可靠映射
- Lukáš Burget:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无监督语音增强需从带噪输入恢复干净语音,在无配对监督时须同时满足输入重构一致性与输出符合干净语音分布,单分支模型常因一致性损失主导而把噪声漏进增强结果。本文提出双分支无监督生成对抗网络框架,先由共享编码器将带噪语音映射为潜表示,再经两个并行分支分别提纯语音潜变量与噪声潜变量并由共享解码器合成波形,最后以最优线性混合重构输入并用三组判别器分别约束语音、噪声与带噪分布。相比仅用干净语音先验的单分支方法,显式噪声分支提供了残留噪声的专用去处,使一致性压力不再迫使语音分支吸收噪声。在 VCTK+Demand 基准上双分支模型取得 PESQ 2.58,优于同构单分支基线的 2.34 与 unSE 的 2.45,COVL 亦为参评方法中最高。该结论目前仅在朗读类英语与有限噪声类型上验证,对强失配干净语音先验与复杂非平稳噪声的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/BUTSpeechFIT/USE — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
773. 在野外固定说什么、只传特征:内容受控且隐私优先的韵律采集协议
标签:#数据集构建 #隐私保护 #韵律 #语音属性识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#数据集构建
👥 作者与机构
- Timo K. Koch:机构信息未能从会议 PDF 纯文本可靠映射
- Florian Bemmann:机构信息未能从会议 PDF 纯文本可靠映射
- Ramona Schoedel:机构信息未能从会议 PDF 纯文本可靠映射
- Markus Buehner:机构信息未能从会议 PDF 纯文本可靠映射
- Clemens Stachl:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
野外韵律采集需同时解决语义与韵律混杂及原始音频隐私风险,输入为智能手机生态瞬时评估提示与麦克风信号,输出为服务器端可直接分析的韵律特征向量。方法链第一步为内容控制采集,每次评估触发正性、中性、负性三种效价朗读并从德语验证句集中随机抽句,其录音直接进入第二步。第二步为端侧参数化与删除,音频以无压缩线性脉冲编码暂存本地,经安卓原生openSMILE库提取eGeMAPS88维与ComParE6373维特征后立即删除波形与中间表格,仅加密批量传输特征向量。第三步为合规过滤与诊断验证,基于发声概率、浊音切分与谐波噪声比剔除非人声片段,再以混合效应模型与受试者分块交叉验证检验条件差异与预测效度,结果回用于校准自然语音分析。相比直接上传原始音频或无约束日记语音的方法,该协议以标准化朗读控制语义混杂、以端侧提取与即删保障隐私,可规模化重复测量韵律基线。在受试者分块十折交叉验证任务下,随机森林对唤醒度的预测性能Spearman相关为0.12,高于对效价的预测性能Spearman相关为0.02。结论仅适用于德语朗读场景与工程特征,无法外推至自发情感表达或自监督嵌入。该适用边界受限于朗读范式尚未验证自发场景的外推。该文未披露训练、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
774. 不裁脸、不走多阶段:RT-ASDNet 把说话人检测做成单次实时检测
标签:#端到端学习 #实时处理 #音视频 #语音 #说话人分离标注
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#端到端学习
👥 作者与机构
- Okan Köpüklü:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
主动说话人检测(Active Speaker Detection,ASD)的输入是连续视频片段与同步原始音频波形,输出是关键帧中全部人脸框与说话或非说话标签,难点在于唇动与语音细粒度同步、多人遮挡小脸以及逐人裁剪导致的延迟随人数线性增长。本文方法链分三步:音频流用Sinc卷积加深度可分离卷积从原始波形提取紧凑嵌入并广播到空间网格,视觉流用三维卷积骨干加特征金字塔与可变形融合提取四分之一分辨率时空特征,融合检测头用热力图分类定位加宽高与偏移回归一次性输出框与状态。与既有先检测再逐脸分类的多阶段管线相比,该机制取消外部人脸检测器与逐人前向,使单帧计算量恒定并支持端到端优化。在AVA-ActiveSpeaker验证集上288分辨率32帧配置取得平均精度均值(mean Average Precision,mAP)77.3%,显著低于离线最强基线95.6%的分类上界。该结论仅适用于以预测框计算的联合检测分类口径,不可直接外推到基于真值框的分类评测或拥挤小脸场景。原文未披露训练硬件与训练时长。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
775. 不等直线下降:用事件时间证明语音指标比量表更早看到 ALS 恶化
标签:#语音生物标志物 #统计分析 #语音 #病理语音评估
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Hardik Kothare:机构信息未能从会议 PDF 纯文本可靠映射
- Michael Neumann:机构信息未能从会议 PDF 纯文本可靠映射
- Vikram Ramanarayanan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
肌萎缩侧索硬化进展异质且非线性,传统量表粗糙迟钝难以早期捕捉延髓衰退,本文输入远程对话平台采集的纵向朗读与描述音视频,输出各指标首次达到最小临床重要差异的时间与风险估计,难点在于右删失与频繁脱落下保持敏感性。第一步用Praat与面部网格等工具自动提取声学、发音运动学与语言学特征,并以最保守最小临床重要差异定义事件标签。第二步将事件标签输入生存分析,用Kaplan-Meier估计生存曲线并以对数秩检验比较各指标敏感性差异。第三步将生存曲线输出的风险估计以指数近似换算为风险率,并代入对数秩样本量公式推算不同风险比下的样本量与试验时长,相比线性混合效应模型,该非参数事件视角更能容纳非线性轨迹与删失。在30例每臂与风险比0.5的试验时长评测设置下,RP最大唇宽的试验时长指标为4个月,低于ALSFRS-R延髓子分的试验时长指标137个月。结论限于单中心远程英语队列与恒定风险假设,删失与人群异质性可能偏倚估计,未经外部试验验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
776. 神经音频编解码器失真下,谁还能代表人耳:PESQ 与 SCOREQ 的对照
英文题目:Evaluating Objective Speech Quality Metrics for Neural Audio Codecs
标签:#统计分析 #主观评测 #音频编码 #语音质量评估
评分:6.1/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音质量评估 | 主方法:#主观评测
👥 作者与机构
- Luca A. Lanzendöerfer:机构信息未能从会议 PDF 纯文本可靠映射
- Florian Grötschla:机构信息未能从会议 PDF 纯文本可靠映射
- Roger Wattenhofer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是评估神经音频编解码器重建语音的感知质量,输入为48 kHz立体声参考语音与语音加背景声混合音频,输出为客观指标与人耳判断一致性的排序与选型建议,难点在于生成式压缩失真与立体声通道独立编码引入的空间损伤超出了电话语音与广播音频指标的设计域。方法链分为四步:先将开放音频质量数据集的11个纯语音与11个混合片段重采样至48 kHz并做响度归一化,再经6种低码率通用系统独立编码左右通道重建,然后组织多刺激隐藏参考与锚点听测获得基本音频质量主观均分,最后计算失真、感知、可懂度与免参考平均意见分预测四大类20余种指标与主观均分的Pearson线性相关与Kendall排序相关。机制差异在于同时覆盖侵入式与非侵入式指标,并区分纯语音与混合内容两种失真分布,对照手工心理声学模型与数据驱动神经嵌入两条路线。在纯语音评测条件下,SCOREQ的Pearson为0.937,高于PESQ的Pearson0.886。混合内容下感知语音质量评估仍保持高相关而免参考指标全面退化,凸显背景声与空间损伤的域依赖。结论仅适用于10 kbps以下通用编解码器的48 kHz双通道独立编码场景,外推至专用语音编解码器、单声道电话、音乐与空间渲染未经验证。原文未披露训练、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
777. 过自信伪标签不可信时:用残差离散度加权与弱掩蔽恢复语义
英文题目:Weakly Masked Residual Reliability Learning for Unsupervised Domain Adaptation in Speech Models
标签:#领域适应 #正则化 #语音 #语音识别 #语音翻译
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#领域适应
👥 作者与机构
- Yuan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yonghe Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhenjie Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Feilong Bao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaodong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Bo Pang:机构信息未能从会议 PDF 纯文本可靠映射
- Yandong Guo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无监督领域适应要求仅用预训练语音模型和无标注目标域语音完成适配,输入为噪声、口语交互与口音语音,输出为词序列或翻译文本。难点在于域偏移下模型过自信导致的伪标签噪声,以及降权不可靠词元后决策边界附近监督不足。弱掩码残差可靠性学习 Weakly Masked Residual Reliability Learning先对每个词元联合建模最大置信度和残差离散度得到词元权重以抑制不可靠词元。接着对高可靠词元施加弱置信掩码部分降权以迫使模型从不可靠上下文恢复语义。随后用多扰动一致性正则在utterance级过滤低质量样本并用保留样本微调两轮。相比仅用置信度、间隔或熵加权的伪标签方法,该机制显式利用非极大类概率形态区分可靠与过自信预测,并以部分掩码替代直接丢弃保留边界信号。在 CHiME-4真实测试集、SLURP测试集和CORAAL测试集上相对 Whisper-medium 基线分别取得13.8%、25.0%和15.7%的词错率 Word Error Rate 相对下降,在 CoVoST2 爱沙尼亚语、印尼语和威尔士语翻译上 BLEU 分别达到10.5、41.8和13.6。该结论仅在3个英语识别域、3个翻译语言和 Whisper 系列上验证,未覆盖流式、低资源强口音与多次运行统计显著性,原文未披露训练推理成本与延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
778. 小模型也要排好队形:DNSMOS-C 用质量引导的三元组让隐空间按 MOS 排序
英文题目:DNSMOS-C: Improving End-to-end Speech Quality Models via Contrastive Learning
标签:#CNN #对比学习 #端到端学习 #鲁棒性 #语音质量评估
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#对比学习
👥 作者与机构
- Xinyu Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Fredrik Cumlin:机构信息未能从会议 PDF 纯文本可靠映射
- Victor Ungureanu:机构信息未能从会议 PDF 纯文本可靠映射
- Chandan K. A. Reddy:机构信息未能从会议 PDF 纯文本可靠映射
- Christian Schüldt:机构信息未能从会议 PDF 纯文本可靠映射
- Saikat Chatterjee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非侵入式语音质量评估以单段退化语音为输入,直接预测平均意见分而无需干净参考,实际难点在于轻量卷积模型易过拟合训练域失真,在未见语言与录制条件下泛化下降。该方法先将16kHz语音的对数幅度谱送入四层卷积加全局最大池化编码器压缩为64维嵌入,其输出进入回归头进行质量映射。回归头同时预测高斯后验均值与方差并以均值作为质量分,训练时以高斯负对数似然约束分布拟合,同时在嵌入上施加MOS引导的三元组对比约束使质量相近者靠近、差异者远离。相对SCOREQ依赖大规模自监督编码器与先对比预训练再拟合回归的两阶段流程,本文差异在于单阶段联合优化对比损失与似然损失且推理结构与DNSMOS Pro完全同构,因而无额外部署负担并更利于稳定学习质量序结构。在NISQA TRAIN SIM训练并在NISQA TEST FOR评测时,线性相关系数(linear correlation coefficient,LCC)从0.763提升至0.787;在BVCC域内斯皮尔曼秩相关系数(Spearman rank correlation coefficient,SRCC)从0.788提升至0.801。该结论限于合成失真与英语、中文、德语有限跨域验证,未覆盖生成式语音与大规模真实通话外推。该适用边界之外的大规模真实通话与生成式语音场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
779. 跨数据集听损可懂度预测:用少量目标样本做适配为何能超过全量训练
标签:#助听器 #领域适应 #少样本 #语音 #语音可懂度评估
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音可懂度评估 | 主方法:#领域适应
👥 作者与机构
- Guojian Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Xuefei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Ryandhimas E. Zezario:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
听障语音可懂度预测(Speech Intelligibility Prediction, SIP)需从双耳助听处理语音预测听者主观可懂度分数,跨数据集时因听者、声学环境和助听器(Hearing Aid, HA)设置偏移而严重退化,且目标域标注获取昂贵。为此论文提出跨域少样本自适应网络(Cross-domain Few-shot Adaptation SIPNet, CFA-SIPNet),先在源域做语音基础模型(Speech Foundation Model, SFM)融合加Transformer的监督预训练以学习可迁移表示,再冻结主干并在目标域用少量样本更新适配器(Adapter)与评分头,同时以嵌入对比学习拉开不同可懂度样本的距离。相比已有逐点回归与数据拼接增强方法,该机制显式建模可懂度排序与差异结构,因而在有限监督下更具判别性。在Arehart目标测试集的跨库评测中,该方法相对最强基线ZipEnhancer + MP-SENet的2-Clips增强取得约8.5%的均方根误差(Root Mean Square Error, RMSE)下降与约4.2%的皮尔逊相关系数(Pearson Correlation Coefficient, PCC)提升,并以少于20%目标训练样本超越域内全量训练。其结论目前仅在CPC3到Arehart的单向迁移上成立,未验证反向迁移、多语言与强噪声混响等更复杂外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
780. 共享与私有分开学、不可靠的不去学:低资源多语 ASR 的解耦与过滤
标签:#LoRA #低资源 #多语言 #语音识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- Jie Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Liang He:机构信息未能从会议 PDF 纯文本可靠映射
- Longwei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Qingyuan Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Xuejian Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源多语言自动语音识别需将多语言语音转写为对应文本,难点在于标注稀缺导致监督不足,而联合训练中高资源语言挤占低秩适配容量引发负迁移。所提框架冻结Whisper-small骨干并分结构与训练两路推进:共享私有融合低秩适配将每层增量分解为跨语言共享分支与语言私有分支,再以逐语言可学习系数融合两路输出以隔离干扰并保留迁移;均值教师对可训练适配参数做指数滑动平均,为双增强视图提供更平滑的一致性目标;基于教师最大词表概率的置信门控仅保留高置信词元的KL一致性损失,并经两阶段训练与阈值调度避免早期噪声。与全共享适配相比,机制差异在于结构解耦处理空间干扰而时序集成加可靠性过滤处理监督噪声。在Kathbath基准测试集下,whisper-small+SPF-LoRA+MT-CR的WER为19.85%,低于whisper-small+LoRA的WER 30.73%。该结论仅在 Kathbath 所选五种印度雅利安语及冻结 Whisper-small 设置下验证,未验证跨语系与大规模数据外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
781. 冻住分类器做生成:用判别主干复用出扩散分数
英文题目:Repurposing a Speech Classifier for Guided Diffusion-Based Speech Generation
标签:#Adapter #扩散模型 #高效推理 #语音合成
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#扩散模型
👥 作者与机构
- Rostislav Makarov:机构信息未能从会议 PDF 纯文本可靠映射
- Timo Gerkmann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理以类别标签为条件的对数梅尔谱语音生成问题,痛点是标准分类器引导(Classifier Guidance)需同时训练和评估分数模型与噪声条件分类器,参数与采样开销大。方法链为:先在加噪对数梅尔输入上用交叉熵训练 U-Net 改造的噪声条件分类器并冻结,再从其多尺度前向抽头与对联合能量模型(Joint Energy-based Model)边际对数密度求偏导得到的梯度抽头构造融合信号,最后仅训练轻量解码式分数子网(Score Subnet)在去噪分数匹配(Denoising Score Matching)目标下预测无条件分数,条件采样时再叠加同一冻结分类器的分类对数概率梯度。与需双模型联合采样的标准管线不同,该机制把判别主干复用为固定多尺度特征提取器,回避了能量模型归一化常数的不稳定联合训练。在 SC09 无条件生成中子网以 4.4M 可训练参数取得 FID 0.17,持平 16.6M 全量 U-Net;在引导强度 3.0 的条件生成中双方均达 FID 0.03 左右,子网单步计算从 22.74 GMACs 降至 16.44 GMACs。该结论的适用边界受限于SC09十类英文数字语料与单一16kHz HiFi-GAN重建链路,尚未验证对大词表、文本条件或直接波形生成的可迁移性。其推理开销因复用冻结主干而使单步计算量下降,但训练成本仍需先训练噪声条件分类器再训练子网,且采样需100步VP-SDE求解。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
782. 多人加智能体时,人与人就近趋同、与智能体和随时间趋同却很弱
英文题目:Speech Entrainment in Multi-Party Conversations with a Digital Agent
标签:#统计分析 #韵律 #语音情感识别 #语音交互
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音交互 | 主方法:#统计分析
👥 作者与机构
- Nicholas Mehlman:机构信息未能从会议 PDF 纯文本可靠映射
- Kaitlin Zareno:机构信息未能从会议 PDF 纯文本可靠映射
- Kleanthis Avramidis:机构信息未能从会议 PDF 纯文本可靠映射
- Anfeng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究多人人类与数字智能体同场对话中的言语顺应,输入为分轮次多说话人语音与智能体语音,输出为人与人及人与智能体在声学与语义特征上的趋同判定,难点在于多方轮次交错与儿童语音变异使趋同易被话题与角色分工混淆。方法链分三步推进:先以Wizard of Oz采集成人与家庭会话并做人工说话人切分与轮次划分,再提取振幅与PESTO基频及VoxProfile情感与Whisper等嵌入,然后以混合效应回归比较同轮与跨轮及前5轮与后5轮距离以检验局部与全局顺应。与既有双人人类顺应研究相比,关键差异在于同时引入非人类参与者与多方结构并区分局部即时对齐与会话级收敛,有助于揭示社会语境对顺应的调节作用。在全局顺应评测任务下,成人P2P的Emotion distcos指标为0.05076,低于家庭P2P的Emotion distcos指标0.0861。局部比较显示成人P2P在振幅、基频与唤醒度上显著趋同而人与智能体顺应缺失,全局上家庭P2P基本不显著而儿童到智能体在语义上收敛。结论仅适用于结构化问答式外星访客范式与英语年轻成人及 8 岁到 14 岁儿童家庭,难以推广到开放域多方协作或长期交互。该适用边界受限于结构化访谈场景,尚未验证开放域协作中的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
783. 不听懂词也能数口吃:用相似度图搬运重复结构
标签:#注意力机制 #跨语言 #零样本 #病理语音评估
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#注意力机制
👥 作者与机构
- Genzo Miyahara:机构信息未能从会议 PDF 纯文本可靠映射
- Tsuneo Kato:机构信息未能从会议 PDF 纯文本可靠映射
- Akihiro Tamura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口吃事件检测需从连续语音中同时判定无障碍语音与阻塞、感叹词、延长、音重复、词重复共6个非互斥标签,难点在于部分类别声学变异大且低资源语言缺乏标注。第一步冻结语音编码器,仅将其作为特征提取器输出保留时序的声学向量序列而不更新参数,为后续跨时刻比较提供多层表征基础。第二步对同层任意两时刻向量计算归一化内积得到时序声学向量序列自注意力权重矩阵,将绝对取值转化为时刻间相对相似结构,其行列均对应原始时间轴。第三步将24层矩阵堆叠为多通道二维图像送入改造的VGG-19,由交替卷积与池化从局部到全局捕捉重复与延长结构并完成多标签分类,训练时仅更新分类器。与直接池化编码器绝对表征的方法不同,该方法比较跨时刻相对相似结构,对语言相关音色细节依赖更低。零样本跨语言评测中,中文AS-70加英文SEP-28k联合训练、在德语KSoF测试的Whisper编码器版本在词重复上达到F1值0.40,超过同期最优检索增强模型StutterFuse的0.20,并在感叹词上达到0.69超过其0.62,但在阻塞、延长、音重复上落后约0.10至0.23。结论仅在3秒短片段分类和英德中3个语料、5种语言组合上验证,摘要中77-98%单语水平的说法依赖跨表相对值,长时定位、阻塞弱声学建模及更多语系外推尚未证明。原文未披露训练推理成本与阈值策略。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
784. 语音与文本越狱走的是同一条内部通道:统一安全子空间的发现与转向验证
英文题目:A Unified Safety Subspace Exists in Speech Language Models
标签:#形式化分析 #对抗鲁棒性 #可解释性 #语音 #语音对话系统
评分:6.1/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音对话系统 | 主方法:#形式化分析
👥 作者与机构
- Nurdaulet Mukhituly:机构信息未能从会议 PDF 纯文本可靠映射
- Muhammad Cendekia Airlangga:机构信息未能从会议 PDF 纯文本可靠映射
- Rifo Ahmad Genadi:机构信息未能从会议 PDF 纯文本可靠映射
- Nhi Hoai Doan:机构信息未能从会议 PDF 纯文本可靠映射
- Amirbek Djanibekov:机构信息未能从会议 PDF 纯文本可靠映射
- Samuel Munachiso Nwadike:机构信息未能从会议 PDF 纯文本可靠映射
- Zangir Iklassov:机构信息未能从会议 PDF 纯文本可靠映射
- Kentaro Inui:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音语言模型需同时处理语音与文本输入并在有害请求下保持拒绝,难点在于音频越狱可通过副语言线索与波形扰动绕过文本对齐。先以有害、越狱与良性查询的语音与文本输入送入模型,抽取Qwen2-Audio第15层与GLM-4-Voice第17层末词元残差流激活,并在有害与越狱激活并集上拟合模态专属二维主成分投影,输出可分离拒绝与顺从的低维平面。再以该投影平面为输入,计算越狱均值减有害均值的差向量以估计顺从偏移,并将其反投影回残差流全维空间,输出可注入的音频与文本转向向量。最后以前述转向向量为输入,以带符号缩放系数加减注入推理时残差流,正向注入使有害输入转向顺从,反向相减使越狱输入恢复拒绝且无需重训。与孤立处理单模态或单攻击的防御不同,该工作把安全建模为共享低维几何中的同一线性边界并用跨模态平行性解释迁移。在Qwen2-Audio越狱评测设置下,减去音频转向向量的AdvWave的攻击成功率为0.52%,低于原始输入的攻击成功率97.93%。跨架构与自适应攻击下的泛化尚未验证,其适用边界受限于两模型与五种攻击的条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
785. 从超声看到颏舌骨肌:用分割加骨架把发音时的肌肉厚度自动量出来
标签:#CNN #发声与构音 #语音 #语音属性识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#CNN
👥 作者与机构
- Alisher Myrgyyassov:机构信息未能从会议 PDF 纯文本可靠映射
- Bruce Xiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Shuming Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen Song:机构信息未能从会议 PDF 纯文本可靠映射
- Min Ney Wong:机构信息未能从会议 PDF 纯文本可靠映射
- Yongping Zheng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为颏下中矢状面B超视频帧,输出为颏舌骨肌(geniohyoid,GH)厚度随时间变化曲线,难点在于深部肌肉边界模糊、探头摆位敏感与人工描记主观耗时。所提骨架形态肌肉分析框架(Skeleton-based Morphometric Muscle Analysis,SMMA)先以卷积网络分割肌肉区域,再经形态学后处理与细化提取中轴并计算中段骨架到边界的垂直距离,最后与同步音频的元音事件对齐形成动态测量。与既往舌轮廓追踪及吞咽领域人工横截面测量相比,该链路首次实现深部舌肌厚度在发音过程中的全自动逐帧量化。为解耦评估分割与测厚,试验在11名粤语发音人的按被试划分上对比5种分割网络与3名标注者一致性,并在随机与优选图像上对比超声医师人工厚度。在厚度测量任务下,临床优选图像上SMMA的平均绝对误差指标为0.53 mm,低于随机抽样图像上SMMA的平均绝对误差指标0.88 mm。该结论目前仅适用于受控摆位下的孤立元音与健康成人,连续语流、病理人群与跨语言外推尚未验证。原文未披露训练成本,仅报告推理吞吐。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
786. 比较才看得准:用推理轨迹让音频语言模型学会比情绪
英文题目:Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions
标签:#偏好优化 #音频大模型 #跨语言 #语音 #语音情感识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#偏好优化
👥 作者与机构
- Abinay Reddy Naini:机构信息未能从会议 PDF 纯文本可靠映射
- Jaeyeon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Chao-Han Huck Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
- Carlos Busso:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理双语音序数情感比较:输入两段语音xA、xB与维度提示p,输出哪段唤醒度、效价或支配度更高,难点在于需跨音频联合韵律声学、语义与副语言线索并给出可信依据。方法先用音频字幕模型生成语义描述,并行抽取GeMAPS低层描述子并离散为低中高等定性文本,形成互补证据输入下一步。再由大推理模型综合双边证据合成少于五句的比较轨迹,以真值y+校验再生并以错误答案y-为条件生成似真错误轨迹。最后将支持双音频输入的Qwen2.5-Omni-3B经低秩适配微调为先生成推理再输出决策,对比监督微调与直接偏好优化及其带推理变体,关键差异是以显式正确与错误推理对做偏好优化而非仅学标签。在MSP-Podcast测试集跨情感任务下,+DPO-CoT的Arousal偏好准确率为0.881,高于+DPO的偏好准确率0.880。该结论限于三维情感偏好与阈值过滤后的清晰样本,对环境、发声、韵律与人际等多维比较尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
787. 不用从左到右写句子:掩码与均匀噪声扩散模型如何给语音识别打分与联合解码
标签:#CTC #扩散模型 #语音 #语音识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#扩散模型
👥 作者与机构
- Davyd Naveriani:机构信息未能从会议 PDF 纯文本可靠映射
- Albert Zeyer:机构信息未能从会议 PDF 纯文本可靠映射
- Ralf Schlüter:机构信息未能从会议 PDF 纯文本可靠映射
- Hermann Ney:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音识别需将连续声学帧映射为离散词序列,外部语言知识与声学证据的紧耦合长期受自回归从左到右串行瓶颈限制。本文保持独立语言模型设定,先用联结时序分类编码器产生声学假设,再用扩散语言模型对N最优假设重打分,最后将均匀状态扩散模型嵌入逐词元联合解码以同步修正假设。重打分通过多组掩码前向估计证据下界并做掩码数归一化,联合解码则把每轮扩散输出的词表分布与对应帧的CTC分布加权融合后独立采样进入下一轮。与掩码扩散仅在掩码位打分不同,均匀状态扩散在所有位置输出全词表分布,因而可直接参与逐词元构建并持续提供语言约束。在LibriSpeech dev-other评测设置下,24层掩码扩散重打分的WER为4.47%,低于CTC基线的WER 5.08%。单步联合解码的推理开销极低,识别实时率约0.003,接近纯CTC的实时率0.002,其适用边界仍受限于英文朗读场景尚未验证噪声与跨域条件。该结论仅在LibriSpeech英文朗读语音、dev-other单划分与340M参数内验证,未覆盖流式、噪声、跨域与大词表长尾表现。原文声明发布全部代码与配方但未给出仓库链接与许可证。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
788. 听错药名不是随机错:用发音加语义把噪声实体链回词典
英文题目:Post-ASR Proper Noun Grounding via Multi-View Phonetic and Semantic Retrieval
标签:#医疗音频 #检索增强 #语音 #语音识别
评分:6.1/10 | 创新 1.1/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#检索增强
👥 作者与机构
- Pranshu Nema:机构信息未能从会议 PDF 纯文本可靠映射
- Kush Shrivastava:机构信息未能从会议 PDF 纯文本可靠映射
- Bhavik Vachhani:机构信息未能从会议 PDF 纯文本可靠映射
- Rustom Lawyer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对端到端语音识别转写中药物专有名词发音合理但拼写错误的问题,本文将任务定义为后识别专有名词接地,给定含噪转写中的噪声提及,输出预定义词典中的规范实体排序列表而不改写原文,其难点在于罕见长尾实体的系统性音似替换与上下文稀疏。方法链由三步组成:先用端到端识别得到文本假设,再用零样本命名实体识别抽取疑似药物提及并将提及连同上下文送入检索,最后对每个提及并行计算细粒度音素相似、粗粒度编码相似和上下文语义相似,经候选集内归一化后加权融合排序。与已有解码内偏置或单视角纠错不同,该设计强调发音结构先验与语义互补且完全识别无关,仅用转写文本而无需声学特征与解码器状态。在 United-MedSyn(United-We-Care 合成医疗英文语音)测试集闭词表条件下,最强融合(Soundex+G2P+text-embedding-3-large)在 69542 个对齐实体上 Whisper-large-v3 达到 Recall@1 为 74.67%、Recall@10 为 87.36%,较精确匹配基线 38.27% 提升 36.40 个百分点;在 Qwen3-ASR-1.7B 上达到 59.82% 和 71.86%,较基线 36.27% 提升 23.55 个百分点。该结论适用边界受限于词典由训练集构建且覆盖测试实体、仅保留真值与识别抽取实体数一致且成功检出实体的子集,同音近形词与同适应症语义邻居仍是失败条件而难区分。原文未披露训练、推理延迟与部署成本。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
789. 漏进来的声音别改归属直接删:用说话人日志做三重校验的剪枝校正
英文题目:Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction
标签:#多模态学习 #语音识别 #说话人分离标注 #语音分离
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#多模态学习
👥 作者与机构
- Hermann Yepdjio Nkouanga:机构信息未能从会议 PDF 纯文本可靠映射
- Minwei Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Maggie Wigness:机构信息未能从会议 PDF 纯文本可靠映射
- Suresh Singh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
级联多说话人语音识别先分离再识别,输入为双说话人重叠混合语音,输出为按说话人归属的文本,其瓶颈在于分离残留的说话人泄漏会被识别器忠实转写并污染归属。所提流水线先用分离模型得到双路波形并调用通用识别模型生成带词级时间戳的初排转写,再用独立说话人分离标注模型在每路分离音频上检测干扰说话人窗口。接着对落入窗口的候选词执行声学包含加词汇交叉验证加时间重叠的三重共识检查,仅当三者同时成立才从转写中删除该词。与主流词汇重标注范式相比,该机制差异在于承认强泄漏下归属不可辨而选择直接剪除伪影,并以声学证据为门控抑制文本共现词的误伤。在转写相似度大于0.4的高泄漏子集上,MossFormer2主干在AMI Individual Headset Mix上从65.58%降至46.39%,相对下降约29.26%,Sepformer主干在AMI Single Distant Microphone上从71.53%降至57.54%。该结论限于双说话人英文读写与会议场景,未验证三人以上、强噪声远场外推与跨语言,原文未披露训练硬件与推理延迟成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
790. 用冻住的语音表征给扩散去噪指路:在瓶颈处做调制的语音增强
英文题目:Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework
标签:#扩散模型 #自监督学习 #语音 #语音增强
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#扩散模型
👥 作者与机构
- Shuubham Ojha:机构信息未能从会议 PDF 纯文本可靠映射
- Carol Espy-Wilson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从加性噪声中恢复干净语音,扩散模型自然度较好但缺乏语言学约束且跨条件泛化偏弱。本文先用冻结的 wav2vec 2.0 Base 从带噪波形提取 768 维音素表征,再经三层多层感知机投影为尺度与偏置系数,最后在 U-Net 瓶颈处以特征线性调制完成通道级仿射调制。与拼接输入或多层条件网络不同,该方法只在抽象层注入语义并用指数平滑压缩时序,避免浅层谱细节被高层调制干扰。该平滑系数由线性高斯状态空间下卡尔曼增益稳态推导为指数滑动平均,实验统一取最优值以平衡侵入式与非侵入式感知指标。在 VoiceBank-DEMAND 测试集上 128 通道模型 PESQ 达到 2.8742,相对同配置 StoRM 基线的 2.4862 提升约 0.39。在VoiceBank-DEMAND测试集下,OURS-128的STOI为0.8673,高于StoRM-128的STOI 0.8571。结论目前仅在 VoiceBank-DEMAND 与 LibriMix 的受限噪声与 16 kHz 条件下验证,未证明对混响、带宽缺失与真实远场的外推能力。推理成本主要来自 30 步扩散采样,32 通道变体实时因子为 0.55 而 128 通道变体明显慢于实时。单次前向的计算量在128通道配置下为312 GFLOPs,经30步迭代采样后累计达9360 GFLOPs。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
791. 转写要留、身份要走:面向说话人级遗忘的 ASR 表征驱散
英文题目:Towards Privacy-Preserving ASR: Speaker-Level Machine Unlearning
标签:#对比学习 #隐私保护 #语音 #语音识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#对比学习
👥 作者与机构
- Seaone Ok:机构信息未能从会议 PDF 纯文本可靠映射
- Seungu Han:机构信息未能从会议 PDF 纯文本可靠映射
- Eungbeom Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Kyogu Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别 Automatic Speech Recognition / ASR 以语音波形为输入并输出文字转写,难点在于自监督编码器为提升识别仍会记忆说话人声纹,从而可被成员推断攻击 Membership Inference Attack / MIA 重识别。本文先在微调后的 HuBERT-base 编码器上做层级探针定位记忆起点,再冻结编码器训练第 6 层辅助说话人头以获得可控嵌入空间并用 K-Means 估计遗忘簇质心,最后解冻编码器并以语音感知身份色散 Speech-Aware Identity Dispersion / SAID 将遗忘嵌入推离质心,同时仅在保留集上保留联结时序分类 Connectionist Temporal Classification / CTC 损失维持语言映射。相对梯度上升与随机标签等参数级遗忘机制,SAID直接在嵌入空间打散遗忘说话人簇质心结构,因而能在抹除身份可分性的同时保留语言映射的完整性。在VCTK遗忘未见语句评测设置下,SAID的MIA准确率为52.6%,低于原始模型的MIA准确率60.1%。该遗忘过程仅更新已定位层的表征分布并在保留集上维持转写约束,使保留集与未见测试集的识别可用性得以延续。该结论仅在高清朗读英语、小规模单语料微调和线性探针攻击下验证,未检验噪声、口音偏移、大规模遗忘或更强攻击下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
792. 好到不像真的转写:现代语音识别分数为何偏离人耳
标签:#人类参与评测 #模型评估 #语音识别 #语音增强
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#人类参与评测
👥 作者与机构
- Danilo Oliveira:机构信息未能从会议 PDF 纯文本可靠映射
- Tal Peer:机构信息未能从会议 PDF 纯文本可靠映射
- Timo Gerkmann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入是含噪语音与5种增强后语音,输出是以转写准确率为代理的增强质量与可懂度判断,难点在于现代自动语音识别的噪声鲁棒性与语言先验会掩盖声学失真。方法链分四步:先用预测型、生成型与混合型共5种SE模型制造不同伪影,再用7种ASR贪婪解码转写,接着经统一文本归一化按式1计算WER、按式2计算词准确率WAcc,最后与20人听写及感知客观听觉质量评估、扩展短期客观可懂度等做系统级与utterance级相关分析。与无语言模型的联结主义时间分类模型相比,大规模含噪训练加内嵌语言模型的关键机制差异是能纠错和幻觉补全,实际意义是绝对分数虚高且与声学聚焦指标排序分叉。在听测子集评测条件下,人类干净语音的词准确率WAcc为95.1%,高于SGMSE+增强语音的词准确率WAcc 69.0%。结论仅适用于英语朗读、输入信噪比-2.5至10 dB听测子集与-2.5至17.5 dB全集及所测5种增强器,未验证重度混响、真实远场与多语外推。该结论的适用边界受限于上述语料与信噪比范围,尚未验证重度混响与多语外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
793. 训练时硬离散省时间,推理时软分布补信息:只改推理赋值的离散语音 token 用法
英文题目:Leveraging Soft Distributions of SSL-Derived Discrete Speech Tokens for Downstream Inference
标签:#向量量化 #语音 #语音识别 #语音转换
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#向量量化
👥 作者与机构
- Kentaro Onda:机构信息未能从会议 PDF 纯文本可靠映射
- Satoru Fukayama:机构信息未能从会议 PDF 纯文本可靠映射
- Daisuke Saito:机构信息未能从会议 PDF 纯文本可靠映射
- Nobuaki Minematsu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为预训练自监督学习(self-supervised learning,SSL)编码器抽取的帧级连续特征,输出为下游语音识别与语音合成可消费的稠密表示,难点是硬聚类离散化丢弃帧级分配不确定性并在域外放大误差。方法链为:训练阶段沿用最近质心硬分配并联合学习词嵌入与下游模型,保持可压缩与高效训练;推理阶段计算到全部质心的欧氏距离并经温度控制的软最大(softmax)转为后验分布;以下游嵌入期望作为输入送入冻结的下游模型。相比需微调编码器的软单元(HuBERT-Soft)与多码本加权融合,该机制无需重训SSL主干且保留单码本压缩率。WavLM在ERJ非母语语音识别(automatic speech recognition,ASR)中词错率(word error rate,WER)为38.8%,优于连续特征基线的38.9%;HuBERT在相同设置下为49.4%对50.5%,同样反超连续基线。结论边界是增益依赖推理温度选择且同域大码本提升有限,尚未验证去重与子词建模后的口语建模场景。原文未披露训练与推理算力开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
794. 多语言多模态语音大模型情绪识别为何偏向特定性别:ERM-MinMaxGAP 压最坏语言内差距
标签:#基准测试 #正则化 #公平性 #多语言 #语音情感识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#正则化
👥 作者与机构
- Zi Haur Pang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoxue Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Tatsuya Kawahara:机构信息未能从会议 PDF 纯文本可靠映射
- Nancy Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理多语言多模态语音情感识别,输入为英语、日语和德语对话语音及可选真实转写文本,输出为7类情感标签,难点在于韵律与人口统计属性纠缠且语言与模态都会改变偏差形态。所提经验风险最小化最大差距(ERM-MinMaxGAP)先以监督微调学习整体情感映射,再在小批量内估计各语言男女条件平均损失并取出最大语言差距施加平方惩罚,最后依据开发集差距与容忍阈值的差来自适应升降公平权重。与平均差距或固定权重做法不同,该机制显式惩罚最坏语言并在任务未学好时自动降低干预,避免单一语言大差距被平均抹平。在MELD-ST多语言测试中,多模态设置下该方法加权F1达到57.68%,准确率达到58.65%,平均性别差距为3.53%;单模态下加权F1为51.38%,准确率为54.32%,平均差距为4.34%。相对最强基线,多模态提升5.03个百分点加权F1和3.62个百分点准确率,单模态提升5.49个百分点加权F1和9.75个百分点准确率。结论仅适用于MELD-ST派生的英日德三语表演性对话及二元性别划分,未验证自然对话、更多语言、其他人口统计维度与零样本大模型的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
795. 把自适应滤波器的内部状态直接送进注意力:睡眠声音事件检测的置信融合
英文题目:Sleep Sound Event Detection Powered by Learnable Multi-Resolution Adaptive Line Enhancer
标签:#医疗音频 #自适应滤波 #注意力机制 #单通道 #音频事件检测
评分:6.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#自适应滤波
👥 作者与机构
- Chanwoo Park:机构信息未能从会议 PDF 纯文本可靠映射
- Chanwoo Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理睡眠声音事件检测(Sound Event Detection, SED),输入为床头单麦克风整夜环境音频,输出为鼾声(snoring)、低通气(hypopnea)与阻塞性呼吸暂停(obstructive apnea)三类的逐帧独立概率,难点在于医院谐波设备噪声与伪周期鼾声交织且呼吸暂停边界模糊。所提ALE-置信度融合声音事件检测(ALE-Confidence Fusion Sound Event Detection, ACF-SED)先以多分辨率自适应线增强器组并行分离周期与非周期成分并生成置信图,再由双流卷积编码器分别处理增强流与噪声流,随后经可学习置信池化压缩为时间置信迹,最后由置信引导交叉路径块完成事件建模与噪声上下文门控融合。与仅把增强谱送入网络的传统做法不同,该框架把滤波器内态作为注意力偏置与特征调制增益,提供了无需额外标注的信号处理先验。在音频多导睡眠呼吸暂停分析(Audio-Polysomnography Sleep Apnea Analysis, APSAA)评测集上,ACF-SED以事件F1值0.7105超过最强基线音频谱Transformer(Audio Spectrogram Transformer, AST)的0.6710,同时在片段F1与PSDS上保持领先,并可由预测事件计数直接估计呼吸暂停低通气指数(Apnea-Hypopnea Index, AHI)。当前验证局限于单中心32例西班牙睡眠实验室数据且测试仅4例,跨设备跨人群泛化尚未验证,AHI估计呈系统性低估。原文披露了训练优化配置但未披露推理阈值与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
796. 从划区域到指一点:SPOT-TSE 用距离加方位点查询做目标语音提取
英文题目:SPOT-TSE: Spatial Point-Guided Target Speech Extraction
标签:#状态空间模型 #麦克风阵列 #流式处理 #目标说话人提取
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#目标说话人提取 | 主方法:#状态空间模型
👥 作者与机构
- Taewon Ryu:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
智能眼镜等多通道场景要求从混合语音中按空间位置抽取目标说话人语音,难点在于固定区域边界敏感以及仅靠距离或方位角在空间重叠时会产生歧义。SPOT-TSE以连续空间点查询为条件,先将归一化距离与方位角经傅里叶特征映射与线性投影编码为查询嵌入,再经由特征线性调制注入分离主干以强调查询点声源,随后用邻近加权软目标平滑训练监督并以难负空间采样迫使模型联合利用双维线索。与区域选择方法相比,该机制把二值内外判定改为以查询点为中心的连续加权,从而缓解边界突变并在同方位不同距离等重叠情形下保持区分性。在最难的随机房间加随机阵列位姿数据集D3上,系统将信号失真比从混合信号的-4.64 dB提升至11.05 dB,词错误率从1.05降至0.22。在固定房间固定位姿D1上达到14.95 dB和0.12词错误率。结论目前仅适用于0.5 m至3.5 m、方位角-95度至95度的仿真眼镜阵列,未在真实设备录音验证,密集混响与运动声源下的外推能力不明。计算方面以双向Mamba替代循环结构后每秒乘加运算从40.19 G降至10.54 G,参数量从0.52 M增至1.46 M,原文未披露训练时长与硬件型号。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
797. 并行时间—频带混合加可学习回灌:在不调参的情况下压住识别敏感的增强伪影
英文题目:Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends
标签:#注意力机制 #CNN #语音 #语音识别 #语音增强
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#注意力机制
👥 作者与机构
- Xingyu Shen:机构信息未能从会议 PDF 纯文本可靠映射
- Runze Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wei-Ping Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Benoit Champagne:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为单通道含噪混响波形,输出为可直接送入冻结识别器的增强波形,难点在于增强伪影会损伤识别精度且前端必须保持轻量可部署。方法链分为四步:先将复数短时傅里叶变换(Complex STFT)按非均匀V4划分切分为23个子带并做带内嵌入,再用12层并行时间频带混合器同时建模带内时序与帧级跨带依赖,接着经掩码加残差重构得到增强谱与波形,最后由可学习观测相加预测单标量权重并融合观测与增强信号。相对循环式频带拆分结构的关键差异在于块内无循环展开,时序用门控空洞深度卷积而跨带用逐帧自注意力并行执行。训练采用多分辨率短时傅里叶变换幅度损失与尺度不变信噪比损失的固定加权和,并分两阶段先训练增强网络再冻结训练观测相加回归器。在CHiME-4真实单通道评测集et05 real上搭配冻结Whisper Large时词错率(Word Error Rate)为6.24%,低于同表两类循环基线并保持前端仅0.96M参数与0.58 GMAC/s。推理开销方面该前端计算量仅为0.58 GMAC/s,流式因果与低延迟硬件部署条件尚未验证。结论目前仅在英语DNS与CHiME-4及冻结Whisper解码下验证,未验证流式因果、可学习权重跨语种跨识别器迁移与强混响之外的失真类型。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
798. 酷儿声音为何缺席:六个语音数据集审计与四组采集张力
英文题目:Queer inclusion in speech datasets: An audit and taxonomy of practical tensions
标签:#统计分析 #公平性 #隐私保护 #语音 #语音属性识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Brooklyn Sheppard:机构信息未能从会议 PDF 纯文本可靠映射
- Anaelia Ovalle:机构信息未能从会议 PDF 纯文本可靠映射
- Adina Williams:机构信息未能从会议 PDF 纯文本可靠映射
- Levent Sagun:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为6个英语语音技术数据集与2个酷儿导向言语科学数据集的论文档、性别标注与收集说明,输出为酷儿包容度审计结论与四类实践张力分类,难点在于语音难匿名化且身份标注涉及污名、安全与再识别风险。方法链分为三步:先按标注选项、标签分布、机构属性、伦理审查披露、招募方式与数据访问许可设定6维审计轴,再统计各库二元外性别占比并核查招募与许可差异,最后以主流库对照MAGES与PTMV归纳张力。相较以往偏见研究多用二元性别、口音或种族切分,本文以酷儿社区为案例揭示规模化开放收集在实践中系统性遗漏小众群体的机制。原文未提供可核对的关键定量结果。结论仅适用于英语与性别维度代理的可见性,不支持向性取向推断或跨语言外推,也未验证包容方案对下游误差的因果改善。本工作适用边界受限于英语语料与审计时点的数据版本,尚未验证包容方案向其他语言与下游任务的外推效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
799. 把现成前馈层复制成专家:用单专家激活扩容多语微调
英文题目:Upcycling Pretrained Transformers into Mixture-of-Experts for Multilingual Speech Recognition
标签:#混合专家模型 #多语言 #语音 #语音识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#混合专家模型
👥 作者与机构
- Kentaro Shinayama:机构信息未能从会议 PDF 纯文本可靠映射
- Kohei Matsuura:机构信息未能从会议 PDF 纯文本可靠映射
- Jaeyoung Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Masato Mimura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言自动语音识别需以单一模型将多语言语音转写为字形序列,难点在于远距离语言间的负迁移与容量共享瓶颈,低秩专家仍受表征容量受限而难以兼顾异构分布。本文将 Whisper 解码器微调重构为容量扩张流水线:首先复制预训练前馈网络 Feed-Forward Network(FFN)参数构造多个专家,接着以硬路由或软路由决定每 token 激活的单一专家,然后冻结编码器并仅微调解码器以保留声学共享表示,最后在 CommonVoice 十语数据上联合优化。其中硬路由按语言索引强制分专家以隔离语言相关容量,软路由则基于解码器隐状态与语言嵌入选择专家以保留参数效率。与低秩混合专家模型 Mixture-of-Experts(MoE)插入小模块不同,该方法直接复用全容量 FFN 并保持激活参数不变,从而在不增加推理计算下线性扩大总容量。在 CommonVoice 十语上硬路由西欧五语平均字错率 Word Error Rate(WER)降至 12.3%,优于多语言微调基线的 13.6%。该结论限于解码器端上循环与 Whisper 族模型,软路由专家分化不足且未验证开放语种零样本扩展。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
800. 只压住意图还不够:绑定子空间如何切断意图到槽位的条件映射
英文题目:Selective Capability Unlearning in End-to-End Spoken Language Understanding
标签:#正则化 #端到端 #语音 #口语意图与槽位识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语意图与槽位识别 | 主方法:#正则化
👥 作者与机构
- Akanksha Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Vinod Kumar Kurmi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端口语理解将语音直接映射为意图加槽位值的结构化语义帧,解码顺序固定为先意图后槽位,联合分布分解为\(p\_\{\\theta\}&\#40;i,s\|x&\#41;=p\_\{\\theta\}&\#40;i\|x&\#41;p\_\{\\theta\}&\#40;s\|i,x&\#41;\)。作者将可删除功能定义为条件能力\(C\_\{\\theta\}&\#40;i&\#41;&\#40;x&\#41;=p\_\{\\theta\}&\#40;s\|i,x&\#41;\),实际难点是压低边缘意图概率\(p\_\{\\theta\}&\#40;i\|x&\#41;\)无法消除该条件映射。强制供给真实意图前缀时模型仍可重建槽位,此结构性失效称为能力持续,分类式遗忘方法未显式处理该条件生成结构。绑定子空间遗忘分两阶段:先在槽位位置抽取解码器隐状态,对比遗忘集与保留集协方差得到方差过剩的低维绑定方向。再在微调中惩罚条件似然梯度在该子空间上的投影以降低一阶敏感度,并与遗忘反转、保留损失和保留KL正则联合优化。与仅抑制边缘概率的梯度上升与偏好优化不同,BSU直接衰减表征空间的意图条件方向,因而强制前缀下仍能阻断重建且不增加推理开销。SLURP上NeMo-Conformer-Transformer设置下,BSU将强制前缀波束恢复率(Beam Retrieval Rate,BRR@10)从92.64%降至22.10%,语义相似度从90.14%降至24.80%,接近重训练的18.59%与23.53%,保留集意图准确率维持87.90%。结论限于单意图删除、英文SLURP与法文SpeechMASSIVE子集、教师强制对齐的槽位边界,原文未披露优化器、学习率、子空间维度与训练成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
801. 希腊语缺干净长语音时,用确定性提示词加单人低秩适配锁住说话人
英文题目:Deterministic Prompting for Speaker-Stable Low-Resource Greek TTS
标签:#LoRA #主观评测 #低资源 #文本到语音
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#文本到语音 | 主方法:#LoRA
👥 作者与机构
- Georgios Syllas:机构信息未能从会议 PDF 纯文本可靠映射
- Efthymios Georgiou:机构信息未能从会议 PDF 纯文本可靠映射
- Kosmas Kritsis:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandros Potamianos:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
现代希腊语文本到语音面临干净单说话人数据稀缺、多说话人社区数据噪声大且每人时长碎片化的问题,输入为希腊语文本与风格描述,输出为稳定说话人身份的自然语音。方法链分为三段:先用WhisperX对齐与置信度加信噪比过滤把有声书和Common Voice转化为1.5秒至10秒的可用片段,再对880M参数Parler-TTS解码器做全量微调以迁移相近语音的先验,最后冻结主干并用单说话人低秩适配锁定音色。与大语言模型随机生成风格描述相比,确定性提示通过分箱离散化和固定模板消除了条件方差,使适配阶段获得一致风格信号。在Common Voice测试集评测设置下,Det.+LoRA的WER为10.7%,低于LLM+LoRA的WER 21.1%。29人听测中音色一致性达4.24分而真人为4.30分。结论限于现代希腊语朗读风格和1名男性适配说话人,未验证多说话人、多风格及其他语言的外推能力。该适用边界尚未验证跨说话人与跨风格外推,训练成本为全量微调约20小时A100硬件与低秩适配约2小时T4硬件。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
802. 只在英语上训练的语音反演,为何能猜出法语和俄语的舌唇动作
标签:#多任务学习 #发声与构音 #跨语言 #语音 #语音属性识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#多任务学习
👥 作者与机构
- Saba Tabatabaee:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Tiede:机构信息未能从会议 PDF 纯文本可靠映射
- Suzanne Boyce:机构信息未能从会议 PDF 纯文本可靠映射
- Liran Oren:机构信息未能从会议 PDF 纯文本可靠映射
- Carol Espy-Wilson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音反演需从声学波形同时恢复口腔收缩与声源激励,其难点在于声发映射多对一且跨说话人与跨语言变异大。本文以英语音频为输入,以6维口腔声道变量与3维声源特征为输出,先用WavLM-Large抽取多层语音表征并加权融合,再经Conformer建模局部与长时依赖,接着经全连接与上采样对齐至100 Hz,最后由双分支多任务头分别回归发音与声源目标。与仅英语建模的既有反演系统相比,该链条把自监督表征、协同发音建模与声源辅助监督结合,使英语学习到的协同模式可迁移到未见语言。在XRMB测试集下,本文模型的平均PPMC得分为0.86,高于已有模型
\[8\]的平均PPMC得分0.85。该英语训练系统在未见法语与俄语上仍保持较强预测力,显示协同发音规律具有跨语言可迁移性。该结论仅适用于朗读式近场录音与少量法俄说话人,俄语噪声与鼻音度伪标签可能高估泛化,且未验证自发语音与更多语系。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
803. 从单标签到多标签:用可控模糊度重做 MSP-Podcast 情感基准与轻量 Mamba 融合
英文题目:From Single to Multi-Label SER: Dataset and Mamba-Based Fusion Model
标签:#基准测试 #模型融合 #状态空间模型 #语音 #语音情感识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音情感识别 | 主方法:#状态空间模型
👥 作者与机构
- Vu Long Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Long Duc Do:机构信息未能从会议 PDF 纯文本可靠映射
- Vinh Quang Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Ngoc Minh Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Quang Minh Le Pham:机构信息未能从会议 PDF 纯文本可靠映射
- Hieu Trung Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Trang Thu Thi Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为野外播客自然语音片段,输出为Angry等8类情感上的多热向量,难点在于感知歧义大、标注分歧系统性强且标签组合呈长尾稀疏。流水线先按说话人无关划分保留域内8类情感并做最少3个标注与域外比例过滤,再用相对与多数投票阈值确定性规则生成至多3标签监督,其输出进入组合长尾控制环节。该环节先在训练集上拟合剪枝少于1000样本的罕见组合得到18类主流空间,再仅在训练集内做频率感知右移增广,随后双分支Mamba分别编码40维梅尔频率倒谱系数与100维对数梅尔谱,经掩码均值池化与可学习门控融合后输出8路sigmoid预测。与多数投票单标签和重型Transformer或自监督语音基座做法不同,该方案显式保留次要情感并以线性时间状态空间建模长音频。在MSP-Podcast Test1固定阈值评测下,Fusion-Gate的微平均F1指标为0.510,高于Fuse-KR(MFCC+LogMel+VQF)的微平均F1指标0.475。该结论的适用边界限于18类主流组合与0.45固定阈值评测,尾部Fear、Disgust等失败条件明显且跨语料泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
804. 把无条件向量换成可学习的:语音合成中更稳的分类器无关引导
英文题目:Learnable Classifier-Free Guidance Null Embeddings for Enhanced Controllable Speech Synthesis
标签:#扩散模型 #主观评测 #语音 #文本到语音
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#扩散模型
👥 作者与机构
- Biel Tura-Vecino:机构信息未能从会议 PDF 纯文本可靠映射
- Yoach Lacombe:机构信息未能从会议 PDF 纯文本可靠映射
- Julian Weber:机构信息未能从会议 PDF 纯文本可靠映射
- Zbigniew Latka:机构信息未能从会议 PDF 纯文本可靠映射
- Haitong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Logan Hart:机构信息未能从会议 PDF 纯文本可靠映射
- Eren Golge:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向零样本可控语音合成,输入为待合成文本与参考说话人语音,输出为48 kHz目标音色语音,难点在于无分类器引导(Classifier-Free Guidance,CFG)常用的固定零向量偏离训练分布且无法区分说话人与文本两种正交通道。方法链分三步:自回归(Autoregressive,AR)主干先融合历史声学潜向量、说话人隐变量与文本词元生成隐状态,再由轻量扩散头迭代去噪预测变分自编码器(Variational Autoencoder,VAE)潜向量并回填继续生成,推理时以可学习零嵌入构造的无条件与分通道无条件预测为参照做引导外推。与固定零向量相比,机制差异在于每个条件拥有独立可优化的无条件基线并在训练中经条件丢弃获得梯度共享,从而提供域内稳定的引导起点。在65个未见表现力说话人每人合成2句共130条样本的评测设置下,可学习零嵌入的SECS为0.817,高于固定零嵌入的SECS 0.755,且其CER为0.9%,低于固定零嵌入的CER 1.2%。结论边界是增益集中于相似性、稳定性与表现力,对大引导权重的鲁棒性更强,但绝对感知质量未同步提升且最优解耦权重依赖手工挑选。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
805. 又轻又准的情感识别:SETEAB 用压缩前端与门控时序平衡精度与跨库泛化
标签:#CNN #高效推理 #鲁棒性 #语音 #语音情感识别
评分:6.1/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#CNN
👥 作者与机构
- Duy Vo:机构信息未能从会议 PDF 纯文本可靠映射
- Kiet Anh Hoang:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Do:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从语音声学输入预测离散情绪类别,难点在于说话风格、语种与噪声差异大且情绪线索稀疏易变,跨库域偏移更使泛化异常困难。本文提出基于挤压激励时序增强感知模块的轻量多尺度框架 Squeeze-and-Excitation Temporal Enhanced Aware Block,简称 SETEAB,以兼顾精度与效率。方法链为深度卷积下采样先压缩短时冗余并保留显著情感线索,挤压激励残差模块 SE-Res2Block 再强化局部多尺度与通道判别性,时序增强感知模块 TEAB 堆叠负责双向长程情绪动态建模,最后由加权双向融合与多层聚合输出话语级表示。与 TIM-Net 直接相加双向特征不同,该框架引入预归一化与门控残差及全局方向权重与层级权重,实现自适应 past-future配比与多层级协同表达。在 EmoBox 协议下 5 个库内基准平均指标上,SETEAB R=2 平均非加权准确率 UA 为 47.69%,超过 TIM-Net 的 42.22% 与 MS-SENet 的 42.97%,同时跨库平均加权准确率 WA 达到 37.53%,高于 MS-SENet 的 34.31%。该结论限于 acted 与会话语音的 EmoBox 划分,尚未验证强噪声与自发情绪外推。成本方面模型仅约 0.4-0.5M 参数与 0.06-0.12G FLOPs,显著轻于 wav2vec 2.0 base 的约 95M 参数与 33.53G FLOPs。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
806. 能量决定混合比例、帧决定聚合权重:多损失如何管住语音情感识别
标签:#注意力机制 #数据增强 #对比学习 #语音 #语音情感识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#数据增强
👥 作者与机构
- Cong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhong Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhua Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Qifei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yingming Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Ruimin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Chunfeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Ya Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别以原始语音波形为输入,输出离散情感类别,难点在于情感表达细微主观且标注数据稀缺易致过拟合。该框架先由能量自适应混合按信噪比叠加语音片段并以瞬时能量与时域覆盖比计算软标签权重生成能量多样样本,再经WavLM编码器提取帧级特征序列并由帧级注意力加权聚合成话语级向量,最后以KL散度、焦点、中心与监督对比多损失联合优化分类与表征。与仅按长度加权的标签自适应混合不同,该方法用能量动态决定混合主导性,使标签更贴合听感并丰富特征空间,配合注意力聚合与多损失缓解类别不平衡与特征混叠。在IEMOCAP会话无关评测下,本方法的加权准确率为78.47%,高于Tang等基线的加权准确率71.64%。在MSP-IMPROV等四个语料的说话人或会话无关条件下亦保持领先,消融证实各组件有效。其结论适用边界受限于四个公开语料的说话人或会话无关划分,跨语言与多模态等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
807. 关键词只偶尔出现,为何卷积要每帧都全算一遍:子模型短时记忆的稀疏调度
英文题目:Sub-Model Short-Term Memory Convolutions for Keyword Spotting Systems on Device
标签:#CNN #高效推理 #端侧运行 #流式处理 #关键词检测
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#CNN
👥 作者与机构
- Paweł Warlewski:机构信息未能从会议 PDF 纯文本可靠映射
- Artur Czeczko:机构信息未能从会议 PDF 纯文本可靠映射
- Artur Szumaczuk:机构信息未能从会议 PDF 纯文本可靠映射
- Grzegorz Stefański:机构信息未能从会议 PDF 纯文本可靠映射
- Szymon Klimaszewski:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向连续音频流的关键词检测需在任意时刻从输入语音中检出短关键词,滑动窗口卷积为保时间粒度而高频重算全网,计算冗余严重。该方法先将VGG风格骨干按池化边界切分为以池化层结尾的子模型序列,使各块对应不同时间分辨率。再按静态调度每步仅执行所需最深子模型,前级输出经短期记忆缓冲传递给后级,跳过与当前决策无关的中间池化状态。最后分类器仅在低时间分辨率处低频调用并复用嵌入,部署时拆为独立子模型以兼容TensorFlow Lite而无需重训练。与每帧全块执行的原始短期记忆卷积相比,该机制改变执行路径而非网络权重,以可控延迟增加换取计算量与缓冲的大幅下降。在标准1 s GSC评测设置下,SM-STMC1的准确率(加权召回率)为0.9382,高于VGG1的准确率0.9278。该结论仅在11类GSC及两个VGG骨干上验证,未覆盖噪声、远场、连续误接受率与多关键词场景。该外推的适用边界受限于已验证的安静近场单关键词条件,噪声远场等尚未验证。原文未披露训练优化器、学习率与轮数,仅报告端侧MCPS、缓冲字节数与延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
808. 听见与默念共享音素表征吗:单被试长时 EEG 的一一映射检验
标签:#数据集 #统计分析 #言语感知 #脑信号 #言语神经解码
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#言语神经解码 | 主方法:#统计分析
👥 作者与机构
- Scott Wellington:机构信息未能从会议 PDF 纯文本可靠映射
- Oliver Watts:机构信息未能从会议 PDF 纯文本可靠映射
- Damien Coyle:机构信息未能从会议 PDF 纯文本可靠映射
- Benjamin Metcalfe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理头皮脑电图中听觉感知与内隐想象发音是否共享音素级表征的问题,输入为单被试听小说句子与想象复述同一句子时的64通道连续脑电加词级时间戳,输出为39个CMU音素的听觉事件相关电位与想象电位在距离空间的一一对应关系与聚类结构,难点在于头皮信号信噪比极低且想象语音无可观测声学对齐、信号微弱易混淆。方法先用听后想象配时复述范式采集严格对齐的配对语料并做重参考与滤波及基于眼电的独立成分去伪迹,其输出的连续信号按音素边界切分为过长窗口,再经18个子带零相位滤波加平均与平滑得到各通道事件相关电位。随后以堪培拉距离度量同源通道波形形态差异并跨通道平均、跨子带求和得到音素对距离矩阵,其输出进入凸二次优化学习子带加权,使每行对角距离最小以强化一一映射。与宽带欧氏幅度直接比较不同,该机制按幅值归一化强调相对形态差异,并用行约束显式保证想象音素距其同名听觉音素最近,因而更适合跨模态微弱波形比对。在CHINS单被试听觉-想象配对任务下,加权子带融合的分离比指标为3.37倍,高于等权基线的分离比指标1倍。加权距离的层次聚类在树根下两层形成元音、齿龈塞音鼻音近音、双唇软腭音、擦音四组,显示音系结构在跨模态距离中保持。该结论的适用边界受限于单被试英语连续语句听后想象任务,跨被试泛化与在线解码尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
809. 舌头看得见却认不准:用物理一致与上下文完备治超声无声语音的抖动与粘连
标签:#数据增强 #CNN #RNN #鲁棒性 #静默语音接口
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#静默语音接口 | 主方法:#数据增强
👥 作者与机构
- Hongyu Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Su:机构信息未能从会议 PDF 纯文本可靠映射
- Yudong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Siwen Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Qisheng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Kele Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
静默语音识别(Silent Speech Recognition,SSR)需从超声舌成像(Ultrasound Tongue Imaging,UTI)序列直接解码文本,难点在于探头位移与斑点噪声导致的采集变异以及协同发音带来的长程上下文依赖。本文提出物理感知与上下文丰富的表示学习框架,先以离线时间聚类将约121.5 fps的高帧率原始序列压缩为定长紧凑序列并保留关键构音事件,再经空间平移加高斯噪声加时间掩码的物理启发增强以模拟成像扰动并迫使模型利用上下文。增强后序列进入3D卷积网络提取局部时空动力学,再由双向门控循环单元汇聚全局语境并经联结时序分类解码为字符。与把帧视为独立视觉单元的二维建模相比,该链条同时强调一致性(Consistency)与完整性(Completeness),具有更强的时空归纳偏置。在UXTD儿童语料Type-A词级数据的重叠说话人划分上,词错率从0.2512降至0.1595,相对下降36.5%;在未见说话人划分上,词错率从0.1203降至0.0597,相对下降50.4%,字错率从0.0734降至0.0227,相对下降69.1%。结论目前仅限于UXTD的词级短句与儿童发音分布,尚未验证大词表连续语句或成人与临床人群的外推。原文未披露训练轮数、推理时延或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
810. 邻域一大就变差:用簇出口截断保住局部密度的异常音检测归一化
标签:#工业应用 #信号处理 #鲁棒性 #异常声音检测
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#异常声音检测 | 主方法:#信号处理
👥 作者与机构
- Kevin Wilkinghoff:机构信息未能从会议 PDF 纯文本可靠映射
- Gordon Wichern:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Le Roux:机构信息未能从会议 PDF 纯文本可靠映射
- Zheng-Hua Tan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
半监督异常声音检测的输入为机器运行音频嵌入,输出为异常分数,难点在于源域与目标域密度不均导致单一阈值和固定邻域归一化失效。方法链先以最近参考距离得到原始异常分数,再对每个参考样本计算有序邻居距离与距离比序列以刻画局部密度形态,接着用簇退出检测根据比值骤降自适应截断邻域,最后以截断邻域均值做对数域归一化并可选方差最小化缩放。与固定小邻域相比,关键差异是从预设邻域大小转向逐样本保局域性判断,避免跨簇样本污染密度估计。在5个嵌入模型与5个DCASE数据集基准协议下,LDN+CED的平均性能为66.09%,高于LDN基线的平均性能65.90%。结论仅适用于存在异质子簇与域偏移的嵌入空间,在单域均匀的DCASE2020上无增益且大跳变阈值未经跨场景校准。该结论的适用边界受限于异质密度假设,稀疏弱结构区的保守回退尚未验证更大邻域外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
811. 把说话人向量拆成能听懂的份量:LISE 的低维非负正交分解
标签:#心理声学实验 #无监督学习 #可解释性 #语音 #说话人验证
评分:6.1/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#无监督学习
👥 作者与机构
- Xiaoliang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Chong-xin Gan:机构信息未能从会议 PDF 纯文本可靠映射
- Ke Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Bell:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Williams:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动说话人验证(Automatic Speaker Verification, ASV)将语音映射为高维说话人嵌入(Speaker Embedding),但难以说明其中编码了何种可感知的音色特征。LISE(Listenable Interpretable Speaker Embeddings)冻结预训练编码器,先将 utterance 级嵌入按说话人平均为说话人级向量,再以非负权重将其重构为少量正交成分,随后按成分权重排序构造高低权重说话人组并以熟悉化加二选一听辨任务检验成分可感知性。该方法以低维连续非负表示保留渐变音色差异,并以正交约束减少成分冗余,区别于高维稀疏二值分解和允许相消的线性降维。在 VoxCeleb1-O 上基于 ECAPA-TDNN 重构嵌入的等错误率(Equal Error Rate, EER)为 2.10%,接近原始嵌入的 1.80%,基于 x-vector 为 3.08%,接近原始的 2.30%;25 名听众对 35 个成分的总体判别准确率为 83.9%,显著高于 PCA 的 59.1% 和 Iben 等人方法的 49.0%。在VoxCeleb1-O评测设置下,LISE基于ECAPA-TDNN的等错误率为2.10%,高于原始嵌入的等错误率1.80%。结论仅在保留验证性能且听众可分辨层面成立,原文承认少数成分捕获语言差异,TTS 可听原型未做系统评估,且未披露训练时长、显存占用与部署成本。该结论适用边界受限于VoxCeleb1-O验证集条件,跨语种外推尚未验证,其训练成本对应单个NVIDIA 2080Ti GPU硬件上200轮优化的计算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
812. 房间变了还是说话变了:让房间嵌入先说自己有多不可信
英文题目:Quantifying the Uncertainty of Blindly Estimated Room Embeddings Using a Dispersion-Calibrated Score
标签:#对比学习 #变分自编码器 #语音 #房间脉冲响应估计
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#房间脉冲响应估计 | 主方法:#对比学习
👥 作者与机构
- Yang Xiang:机构信息未能从会议 PDF 纯文本可靠映射
- Philipp Götz:机构信息未能从会议 PDF 纯文本可靠映射
- Emanuël A. P. Habets:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Walther:机构信息未能从会议 PDF 纯文本可靠映射
- Wenwu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Philip J.B. Jackson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
仅从混响语音盲估计的房间嵌入易受语音内容与录制退化扰动,即使说话人、房间与收发几何不变,表示漂移也会连累下游可靠性判断,难点在于用单条受损语音给出任务无关的可靠度。流水线第一步在房间脉冲响应对数梅尔谱上训练变分自编码器,得到结构化潜空间并冻结其后验统计与解码器。第二步用多视角语音编码器对齐该冻结后验,并叠加共享同一房间脉冲响应的多正样本对比,输出抑制内容变化的语音房间嵌入。第三步冻结语音编码器,以受损嵌入相对干净锚点的离散度为监督目标,用间隔排序损失训练轻量不确定性头,推理仅需单条受损语音即可输出分数。相对前作MRL,关键改动是以每房间脉冲响应配多条语音的多视角批次替代单视角,并把基于重构分位距的不确定性改为表示层离散度排序目标,使分数直接单调反映表示偏移。在粉红噪声与频时遮挡的受控污染评测下,所提不确定性分数与离散度的Spearman相关为0.90,高于MRL-MV的Spearman相关0.85。但结论限于合成污染与按 RIR 身份划分,未验证干扰说话人、设备失配等野外退化与严格按房间不交叠泛化。原文未披露训练、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
813. 不删除参数而是合并参数:用聚类做无数据免训练的语音大模型压缩
标签:#模型压缩 #语音大模型 #高效推理 #语音 #语音识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型压缩
👥 作者与机构
- Haoning Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhaoqing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Huimeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Youjun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chengxi Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Mengzhe Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Xunying Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音基础模型压缩的输入是 HuBERT-large 与 Whisper-large-v3 中 Transformer 线性层权重,输出是注意力头数与前馈中间维更小的稠密紧凑权重,难点在于无原始数据、无再训练时按重要性孤立剪枝易误删协同有用参数且忽略相似冗余。该方法先将多头自注意力模块(Multi-Head Self-Attention,MHSA)、交叉注意力模块与前馈网络模块(Feed-Forward Network,FFN)内关联矩阵拼接展平为结构单元,再用 k-means 聚类将 N 个单元合并为 K 个质心并回填重构权重,随后按模块组内拼接矩阵参数方差将各层分为高、中、低三档并倾斜重分配保留数。与基于 L2 范数(L2-norm)的幅度剪枝相比,其机制差异是用相似融合保留集体信息而非孤立丢弃低分单元。LibriSpeech 评测中 HuBERT-large 在 50% 均匀稀疏免训练下聚类相对幅度剪枝在 test-clean、test-other 降低 27.73%、18.61% 绝对词错率(Word Error Rate,WER),微调 3 轮后仍低 0.19%、0.79%;Whisper-large-v3 在 10% 混合稀疏免训练下相对幅度剪枝降低 2.86%、5.02% 且与未压缩基线无显著差异。该结论边界是 HuBERT 在 60% 与 Whisper 在 30% 稀疏后均灾难性退化,且仅在 LibriSpeech 英文朗读语音验证。原文未披露训练时长与推理延迟实测,仅给 GFLOPs 理论分析。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
814. 边缘先写、云端只改拿不准的词:不确定性引导的语音情感描述协作解码
标签:#模型融合 #高效推理 #隐私保护 #音频字幕生成
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频字幕生成 | 主方法:#模型融合
👥 作者与机构
- Xiangyuan Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Jiajun Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Hong Jia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感描述要求从语音波形生成富含副语言细节的自然语言标题,难点是细微共现情绪线索集中在少数高不确定词且对表征不稳定敏感。边缘侧小音频语言模型先在本地编码语音波形并自回归起草候选标题,同时按词表分布计算每词预测熵以度量语义不可靠性。若长度为L的草稿块内最大熵超过阈值,则仅将该高不确定块标识、已确认前缀与紧凑声学表征上传云端,否则保留在本地继续生成。云端大音频语言模型对上传块单次前向验证并接受或纠正困难词,回传已验证序列后边缘对齐解码状态并从最后确认位置继续生成,块长依上轮是否被纠正而自适应伸缩以平衡可靠与开销。与固定切层卸载对所有词采用同一路径不同,该机制以熵为代理实现词级按需调用,使多数解码保留本地而仅少量困难词触发云端校验,兼顾质量效率与隐私。在MER2024英文子集332条上动态策略BLEU-1达44.65,较边缘基线36.71相对提升21.6%,BLEU-4相对提升约49.3%,中文BLEU-4相对提升达62.7%,总耗时从40.21秒降至28.67秒,输出吞吐从1.53 tokens/s升至13.05 tokens/s。该结论依赖特定熵阈值与秩阈值、A100级云端验证与受控仿真,跨域泛化与真实网络抖动尚未检验,压缩表征仍可能残留说话人与内容信息。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
815. 看与听对不齐:用时间坐标与跨帧差异做音画一致理解
标签:#注意力机制 #多模态模型 #音视频 #音视频问答
评分:6.1/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频问答 | 主方法:#注意力机制
👥 作者与机构
- Lecheng Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Chenyang Lyu:机构信息未能从会议 PDF 纯文本可靠映射
- Haoqin Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Wenxi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Mohamed Fazli Imam:机构信息未能从会议 PDF 纯文本可靠映射
- Jiahui Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Qing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Shaochen Jiang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理音视频场景对话问答与跨模态一致性理解,输入为多帧视频加整段音频与多轮文本问题,输出为自然语言回答,难点在于音频事件与视觉变化在细粒度时间轴上错位且现有大模型多用分离编码器加无约束交互导致语义干扰。方法链分3步推进:先由视觉语言骨干与Whisper系音频编码器抽取特征并以占位符拼入语言模型,再用帧级旋转位置编码与升降序频率注入建立可比的跨模态时间坐标,随后由跨帧块差分注意力捕捉与声音相关的视觉动态,最后用时间对齐掩码与自适应门控做双向交叉融合。与分离编码加全局交叉注意力相比,关键差异是将跨模态注意力硬约束为时长比映射下的时间邻域加线性插值软权重,并以门控残差保留模态特性。在AVSD验证集上以8帧配置取得准确率50.30%,超越用全量帧的Qwen2.5-Omni的46.95%,音频驱动幻觉检测F1达到80.2%。结论边界在于LongVALE上CIDEr仅0.20远低于InternVL-3的8.24,视频驱动幻觉F1为68.34%低于PandaGPT的69.1%,Video-MME总体也落后于Qwen2.5-Omni,作者归因为训练对话格式与长描述格式失配。原文未披露推理延迟吞吐与开源产物。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
816. 数据更大不如种类更多:语音反欺骗中规模与多样性的受控对照
英文题目:Exploring the Scale and Diversity of Speech Anti-spoofing Datasets: Experiments and Analysis
标签:#数据集构建 #鲁棒性 #语音 #语音伪造检测
评分:6.1/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音伪造检测 | 主方法:#数据集构建
👥 作者与机构
- Zhuolin Yi:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Yanzhen Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Yihuan Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Chai:机构信息未能从会议 PDF 纯文本可靠映射
- Daixian Li:机构信息未能从会议 PDF 纯文本可靠映射
- Guanxiang Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Jiajun Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音伪造检测(speech spoofing detection)需从波形中区分真实语音与合成或转换语音,难点在于未知生成方法持续涌现导致的跨域泛化失效。本文以受控实验解耦训练规模与生成方法多样性,先在固定攻击种类下按1%、5%、10%、20%、50%、100%比例随机抽样以观察规模效应,再跨库按每个生成方法抽取1000条伪造样本并统一真实来源构建高多样性小规模组合集以检验多样性效应。两阶段均采用固定XLS-R 300M前端结合AASIST(Audio Anti-spoofing using Integrated Spectro-temporal graph attention networks)后端与RawBoost(raw data boosting)增强进行训练与跨数据集评测。与规模优先假设不同,该设计揭示多样性通过覆盖更广伪造痕迹分布来抑制对特定领域的过拟合,而单纯增量仅重复已知分布。在VoiceWukong全集上组合训练集以19.46%的等错误率(Equal Error Rate, EER)显著优于规模达1982小时的Spoofceleb训练集的23.58%。结论仅适用于所测英语与中英双语场景及固定容量的自监督模型,尚未验证更大容量模型或未见语种与编解码攻击下的外推性。原文未披露训练、推理或部署成本,动机部分引用的AntiDeepfake联合训练需8卡NVIDIA H100且74000小时规模仅比次优提升约1个百分点。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
817. 不急于下单标签:把模糊情感当分布来推理
英文题目:Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
标签:#正则化 #音频大模型 #后训练 #语音 #语音情感识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#正则化
👥 作者与机构
- Xiaofeng Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaheng Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Jean Honorio:机构信息未能从会议 PDF 纯文本可靠映射
- Abhirup Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
- Hong Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音模糊情感识别输入为语音与转录文本二元组,输出为多人标注投票归一化得到的情绪概率分布与解释性推理链,难点在于多情绪解释可同时成立而单标签建模会坍缩为过自信判断。该工作先用GPT-4o按文本语义分析、韵律声学分析与综合消解三步合成歧义感知思维链数据,再在解码末端对情绪类别词的词元logit做softmax读出预测分布,接着用分布散度约束预测分布贴近人类感知分布。这一约束以即插即用方式分别嵌入监督微调联合损失、直接偏好优化在线偏好损失与组相对策略优化奖励函数,使决策层不确定性建模与推理过程优化分离。与确定性音频问答式推理只追求单正确答案不同,该机制显式保留概率质量并要求推理同时支撑多数与少数情绪证据。在IEMOCAP评测任务下,GRPOz的JS指标为0.20,低于Audio-Reasoner的JS指标0.36。该结论适用边界受限于IEMOCAP与CREMA-D封闭情绪集,尚未验证自然对话、自发情感与跨语言迁移下的失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
818. 一句输出谁、何时、说了什么:SDR-LLM 用先进先出序列统一说话人、文本与毫秒时间戳
标签:#端到端学习 #多任务学习 #音频大模型 #语音识别 #说话人分离标注
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#端到端学习
👥 作者与机构
- Renjie Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Yixuan Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Shun Lei:机构信息未能从会议 PDF 纯文本可靠映射
- Xiang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Runchuan Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Yikai Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Guoyang Zeng:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人分离标注与识别(Speaker Diarization and Recognition,SDR)要求从多人对话音频同时输出谁在何时说了什么,级联系统存在分割误差向识别传导,重叠下轮转建模困难,多数端到端方案只输出语序文本而缺毫秒级时间戳。本文提出SDR-LLM统一语音大模型框架,输入16 kHz单通道对话切片与自然语言提示,输出含说话人标识、量化起止时间与文本的结构化标记序列,一次自回归解码同时完成分离标注与识别。语音前端并行使用FireRedASR-LLM-L内置Conformer编码器提供声学语义表示与WavLM-Large编码器经多层融合补充说话人判别线索,对齐至80 ms后拼接输入Qwen2-7B-Instruct。输出采用先进先出(First-In-First-Out,FIFO)序列化,重叠语句按绝对起始时间排序并保证先开始者整句完整输出。训练采用两阶段策略:第一阶段用单语句语料合成时间感知、说话人判别、对话模拟三任务预训练,第二阶段用真实会议微调。在AliMeeting测试集上连接字错率(concatenated minimum-permutation Character Error Rate,cpCER)为29.51%,优于级联最强基线Sortformer加FireRedASR的34.67%与Pyannote加FireRedASR的47.13%;在AISHELL-4上分离标注错误率(Diarization Error Rate,DER)为11.83%,与Pyannote前端的11.82%基本持平但转写优势明显。结论限于2至4人、20至30秒切片的中英文会议播客场景,4人与低重叠下时间精度优势收窄,未验证长时与任意人数外推。原文未披露推理时延与部署成本,承诺未来开源但本稿无可获取产物。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
819. 声音是悲伤、文字是高兴时,模型该信谁:ACR-Net 把声学和语义强行分开
英文题目:ACR-Net: Mitigating Semantic Dominance via Contrastive Acoustic-Semantic Decoupling
标签:#基准测试 #注意力机制 #对比学习 #对抗鲁棒性 #语音情感识别
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#对比学习
👥 作者与机构
- Mengke Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yanda Shao:机构信息未能从会议 PDF 纯文本可靠映射
- Tianhe Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Feng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别的输入为带转写的情感语音,输出为以声音为准的情感标签,难点在于声学韵律与文本语义矛盾时模型抛弃声音而盲从文本,即语义主导。所提声学冲突解决网络先用结构隔离双流编码器分别保留声学细节与纯语义锚点,再以声学为查询的跨模态注意力主动扫描矛盾词元并做残差融合,最后用对比解耦损失按样本是否冲突施加余弦拉近或间隔排斥以形成正交子空间。与仅做融合权重标定的方法不同,该机制在融合前即阻止语义先验覆盖声学特征,因而能定位而非掩盖冲突。该解耦使声学与语义表征进入正交子空间并保持高潜在解耦度,从而在对抗与常规语音中维持声学保真。在ASPIRE基准下,ACR-Net的ACC为76.5%,高于MCR的ACC 48.5%。该结论适用边界受限于合成对抗语音与四类冲突及中英德有限语种,对自然讽刺与强噪声远场尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
820. 互补不是相加:用显式残差与隐式适配控制双音频编码器融合
标签:#LoRA #模型融合 #音频大模型 #音频分类 #音频理解
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#模型融合
👥 作者与机构
- Yucong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Ju:机构信息未能从会议 PDF 纯文本可靠映射
- Hongbin Suo:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
Interspeech 2026音频编码器能力挑战要求以统一大音频语言模型前端同时处理分类与理解任务,单一编码器难以兼顾语音语义与宽域声学线索。作者固定Whisper-Base与Dasheng-Base双编码器,均对齐到25 fps并投影至512维共享融合空间,再以逐帧双路Softmax门控加权混合并保留双流残差。融合输出再叠加可学习缩放的短时傅里叶变换对数幅度谱残差形成统一输出,直接送入XARES-LLM评测管线。在此骨干上对比隐式注入与显式注入,前者先用低秩适配适配Dasheng再冻结融合,后者显式剥离Whisper可线性预测的Dasheng成分并对残差施加能量与去相关约束。与拼接基线和稀疏混合专家融合相比,该设计用稠密门控与残差保留降低了路由不稳定风险。在官方all配方评测设置下,隐式注入的Track A Overall分数为0.712,高于基线的Track A Overall分数0.701。该结论适用边界受限于该双编码器组合及官方管线,更换编码器规模或数据配比后的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://github.com/xiaomi-research/xares-llm — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
821. 打乱时间保住音色:用反事实音频逼模型听证据再选答案
英文题目:CoRE: Contrastive Evidence-Aware Rescoring for Multiple-Choice Audio Question Answering
标签:#评测协议 #测试时自适应 #音频大模型 #音频问答
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#测试时自适应
👥 作者与机构
- Peihong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhixin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxuan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yiqiang Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhou Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Shengchen Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多项选择音频问答要求联合音频片段、自然语言问题与候选选项选出最符合声学证据的选项,难点是大型音频语言模型易依赖文本先验而忽视真实声音。该文提出对比证据感知重打分(Contrastive Evidence-Aware Rescoring,CoRE),先将原始波形按40ms分块置换并以0.5概率块内时域反转构造反事实音频,再在统一选项打分协议下对比原始与反事实的长度归一化选项对数似然得到证据增益,最后由基于2为底Jensen-Shannon散度的冲突信号与仅保留正向熵减的置信信号经几何平均构成自适应门控,融合两组打分输出预测。与静音作负条件或词元解码层对比不同,CoRE在选项层保留短时声学统计并破坏长程语义连续性,减少分布外伪影并与选择题决策对齐。在DCASE 2025 Task 5与AIR-Bench SoundQA上,以Kimi-Audio-7B-Instruct为基座时CoRE在生物声学问答子集相对默认推理将准确率从43.3%提升至51.9%,在Qwen2-Audio-7B-Instruct上从30.0%提升至40.7%。该结论目前仅适用于英文选择题与短生物声环境声场景,对生成式问答与高层推理主导问题外推尚未验证。方法为无训练测试时干预,每样本需一次额外反事实前向。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
822. 在时频谱上同时看清纹理与归属:TF-MossFormer 的局部-全局注意力分工
标签:#注意力机制 #时频分析 #单通道 #语音 #语音分离
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#注意力机制
👥 作者与机构
- Shengkui Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Zexu Pan:机构信息未能从会议 PDF 纯文本可靠映射
- Haoxu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Biao Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangang Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道语音分离需从单路混合波形恢复各说话人波形,难点在于同时保留谐波与音素级短程连续性和说话人身份长程一致性。本文提出时频域Transformer TF-MossFormer,先经短时傅里叶变换得到实部虚部谱并用二维卷积编码为隐表示,再交替沿频率轴与时间轴精化表示,最后解码直接预测各声源复谱并经逆变换重建波形。每个建模模块依次经卷积SwiGLU前馈、均方根组归一化后的局部全局多头自注意力与第二个卷积SwiGLU并带残差,前者输出进入后者逐步提炼。局部采用内容感知的滑动窗口注意力聚合邻域以保留谱连续性,全局采用全序列注意力负责长程分组,二者间以一维卷积加Swish门控逐元加权,最优编排为先局部后全局的级联V1,区别于静态卷积与纯全局注意力的刚性建模。在WSJ0-2Mix测试集下,TF-MossFormer(M)的SI-SDRi指标为24.0 dB,高于TF-Locoformer(M)的SI-SDRi指标23.6 dB。该结论适用边界受限于WSJ0-2Mix双说话人全重叠8kHz英语条件,尚未验证噪声、混响、多于两说话人及跨语种场景的泛化与失败条件。在计算量上小中大模型分别需99.5、283.4与425.0 G MACS/s,参数量为6.0、16.9与25.4M,部署需权衡分离质量与推理开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
823. 微调变好还是碰巧配对:同一配方换个预训练 checkpoint 就不再是最优
英文题目:Rethinking Speech Foundation Model Fine-tuning: Better SFT or Better Match?
标签:#SFT #统计分析 #模型比较 #语音 #口语意图与槽位识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语意图与槽位识别 | 主方法:#SFT
👥 作者与机构
- Wangjin Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhou Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yichi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Tatsuya Kawahara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究自监督语音表征在下游分类中的适配归因,输入为预训练语音编码器与SUPERB分类语音,输出为类别标签,难点在于单检查点小幅增益易被误读为方法上限提升而忽略配方与预训练实例耦合。方法链分三步:先固定9个wav2vec 2.0、HuBERT与WavLM检查点并保持SUPERB流程不变,其输出的统一评测分数进入下一步交叉比较。再构造特征模式与冻结模式交叉的8种有监督微调配置做全矩阵训练,其输出的配对预测进入McNemar检验划分行内最优组并检验跨检查点与多种子稳定性。与把更高分数解读为更高性能上限不同,本文提出激发匹配解释,认为差异来自可靠激活已有能力的难易而非上限提升,其实质是配方对特定预训练实例的激活成功率差异。在SID任务下,hubert-base-ls960的F1-Z2配置准确率为0.8353,高于F1-Z1配置的准确率0.7335。该解释的适用边界受限于三任务与8种配置组合,向生成任务的外推尚未验证。结论仅适用于意图分类(Intent Classification,IC)、语音情感识别(Speech Emotion Recognition,ER)与SID三个分类任务及8种冻结加特征组合,不支持向生成或大模型指令调优外推。全矩阵实验的训练成本总计约10000个GPU小时,硬件为单个NVIDIA H20。原文仅说明总计约10000个GPU小时的单个NVIDIA H20运行成本,未披露完整复现开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
824. 描述词对不齐、语音又出错时:用合成查询把工具向量拉回用户说法
英文题目:From Noisy Speech to Accurate APIs: LLM-driven Embedding Steering for Resilient Tool Retrieval
标签:#数据增强 #大语言模型 #鲁棒性 #语音 #音频检索
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#数据增强
👥 作者与机构
- Catalin Zorilă:机构信息未能从会议 PDF 纯文本可靠映射
- Qingxiuxiong Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Rama Doddipatla:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音查询到工具检索任务,输入为含混响和加性噪声的语音,输出为相关 API 排序,难点在于 API 描述非标准化、冗长缺失且与嵌入模型训练分布失配,同时自动语音识别(Automatic Speech Recognition,ASR)转写错误进一步放大查询侧噪声。方法链分为三步:先用 ASR 将语音转写为文本并用文本编码器得到查询向量,再离线用 QWEN3-8B 为每个工具生成用户风格的使用场景与查询并编码平均为转向向量,最后以加权插值融合原始 API 向量与转向向量用于余弦检索。与直接使用原始描述相比,该机制显著把工具表示从文档风格搬移到用户查询分布,且无需重训即插即用。在3个数据集平均的噪声查询qn评测下,EMBS增强后bge-large-en-v1.5的NDCG指标N@1为20.5,高于无转向基线的NDCG指标N@1的19.3。该结论限于合成英文语音与 Whisper 转写链路,真实口语、多语言和大规模 API 库外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/WhisperSpeech/WhisperSpeech — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
825. 为阿联酋方言建语料:Hamsa 如何用 11 小时人工标注把方言识别误差拉下来
英文题目:Hamsa: A Manually Annotated Emirati Arabic Corpus for Speech and Language Technologies
标签:#数据集 #数据标注 #SFT #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据标注
👥 作者与机构
- Mohammed Alyafeai:机构信息未能从会议 PDF 纯文本可靠映射
- Hamza Alobeidli:机构信息未能从会议 PDF 纯文本可靠映射
- Omar Alkaabi:机构信息未能从会议 PDF 纯文本可靠映射
- Shaikha Alsuwaidi:机构信息未能从会议 PDF 纯文本可靠映射
- Leen AlQadi:机构信息未能从会议 PDF 纯文本可靠映射
- Ahmed Alzubaidi:机构信息未能从会议 PDF 纯文本可靠映射
- Maitha Alhammadi:机构信息未能从会议 PDF 纯文本可靠映射
- Basma El Amel Boussaha:机构信息未能从会议 PDF 纯文本可靠映射
- Hakim Hacid:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
阿联酋阿拉伯语自动语音识别面临输入为自然会话语音、输出为方言忠实转写文本的任务,难点在于与现代标准阿拉伯语的音系交替、特有否定词与阴性形态,以及背景噪声和七个酋长国之间的地区变体。作者构建Hamsa语料的链条分为三步:先从公开阿联酋在线内容抓取并过滤出清晰单语会话片段,保留4174个平均约1分3秒的原始样本并切分为短句,再由5名母语者按方言正字法指南逐句转写,随后由1名标注者对约5小时约45%数据做二次人工校对以统一拼写。相比侧重英阿语码转换播客的Mixat,该工作坚持单语会话覆盖与反MSA归一化,提供更干净的方言训练信号。在Hamsa测试集上微调的Whisper-large-v2将词错误率从42.25%降至24.46%,字符错误率从71.91%降至8.27%,并在外部Mixat测试集上同步改善,显示方言适配而非语料过拟合。该结论目前仅适用于短句主导的非重叠语音,对边界乡村变体、码转换和说话人独立泛化的外推尚未验证。原文未披露训练时长、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
826. 吴语越剧演唱合成的第一套基准:小数据如何做对齐、增广与流匹配基线
标签:#数据集 #数据增强 #基准设计 #流匹配 #歌唱生成
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#歌唱生成 | 主方法:#基准设计
👥 作者与机构
- Peng Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Chenyang Lyu:机构信息未能从会议 PDF 纯文本可靠映射
- Yue Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Wujin Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Longyue Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Weihua Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaodong Shi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
越剧歌唱语音合成以歌词音素序列、音素级时长与音高序列及歌手标识为输入,输出干声波形,难点在于吴方言无现成对齐工具、标准电子谱稀缺且实唱与谱面偏离。作者先在专业录音棚邀请专攻Xiaosheng行当的职业演员戴耳机听伴奏对照纸质谱演唱,录制48 kHz单声道干声并按完整唱句切分为句子级片段,再经越剧发音应用Yueyinyitong词典查音加人工校多音字、Praat手标音素边界、Parselmouth自动提取音高并人工校验,形成对齐的音素、时长与音符三元组,得到565条共1.35小时的YOAT数据集。随后用念白与跨剧种数据做发音与音高增强,最后以Transformer编码加真值时长扩展与最优传输条件流匹配解码生成梅尔谱并经预训练HiFi-GAN声码器成波。与FFT-Singer、DiffSinger和戏曲专用FT-GAN的关键差异在于用OT-CFM建模分布间速度场,以更少推理步获得稳定音高。YOAT测试集22条上10步模型取得F0 RMSE为0.2133与MOS-N为3.92,优于3个对比基线。该结论仅适用于单歌手棚录干声与给定准确时长音高的设定,未验证多歌手、伴奏混音与自动预测时长下的外推。原文未披露训练时长、推理部署成本与显著性检验。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
827. 只给很少录音也能做领域适配:混合批次如何弥合语音文本鸿沟
英文题目:Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR
标签:#领域适应 #大语言模型 #低资源 #语音 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#领域适应
👥 作者与机构
- Thibault Bañeras-Roux:机构信息未能从会议 PDF 纯文本可靠映射
- Sergio Burdisso:机构信息未能从会议 PDF 纯文本可靠映射
- Esaú Villatoro-Tello:机构信息未能从会议 PDF 纯文本可靠映射
- Dairazalia Sánchez-Cortés:机构信息未能从会议 PDF 纯文本可靠映射
- Shiran Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Severin Baroudi:机构信息未能从会议 PDF 纯文本可靠映射
- Shashi Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Hasindri Watawana:机构信息未能从会议 PDF 纯文本可靠映射
- Manjunath K E:机构信息未能从会议 PDF 纯文本可靠映射
- Kadri Hacioglu:机构信息未能从会议 PDF 纯文本可靠映射
- Petr Motlicek:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Stolcke:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为目标域语音,输出为对应转写文本,难点在于目标域文本丰富但配对语音稀缺,而仅用纯文本微调大语言模型(Large Language Model, LLM)会使其脱离语音投影器输出的噪声表示。方法链分三步:先在源域配对数据上训练语音投影器以建立语音文本对齐,再冻结声学侧并以低秩适配(Low-Rank Adaptation, LoRA)微调LLM,最后以混合组批同时喂入源域辅助数据、目标域损坏文本和少量目标域配对语音以保持对齐。与纯文本适配相比,该机制差异在于用真实目标语音锚定表示分布而非仅学习领域语言先验。在DefinedAI银行域测试集评测设置下,配对语音文本适配的词错率WER为4.55%,低于纯文本适配的词错率WER6.38%。结论仅在英语银行、农业和乐器三类域内验证,未覆盖强口音、噪声或跨语言外推。该结论的适用边界受限于源域预训练对齐质量,强噪声与重口音下的失败条件尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
828. 无配对也能降噪:用整句与逐帧双判别器约束生成器
英文题目:UFL-GAN: A Multi-Discriminator GAN for Unsupervised Speech Enhancement
标签:#生成对抗网络 #无监督学习 #语音 #语音增强
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#生成对抗网络
👥 作者与机构
- Satvik Bejugam:机构信息未能从会议 PDF 纯文本可靠映射
- Venkatesh Parvathala:机构信息未能从会议 PDF 纯文本可靠映射
- Sri Rama Murty Kodukula:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无监督语音增强的输入是加性噪声语音,输出是估计的干净语音,难点在于无平行干净参考时难以同时抑制噪声并保留细粒度语音结构。该工作的方法链分为三步:首先基于神经时变滤波(Neural Time-Varying Filtering,NTVF)生成器估计幅度掩膜并结合噪声相位重构波形,其中自回归预测编码(Autoregressive Predictive Coding,APC)特征经线性映射后拼入上下文滤波分支以补充长时语音线索;然后话语级判别器对整句频谱打分以约束全局分布,帧级判别器对每帧打分以提供局部时序反馈;最后双方以最小二乘生成对抗网络(Least-Squares GAN,LSGAN)目标交替优化,使增强语音分布逼近非平行干净语音分布。与单判别器或度量学习型非监督框架相比,关键差异在于不依赖特定客观指标并显式分离全局与局部对抗监督,从而缓解单点打分收敛慢与逐块过抑制问题。在VoiceBank+DEMAND测试集上该方法PESQ-WB达到2.64,略低于QMixCAT的2.66但CSIG达到3.99明显占优,验证了感知质量的均衡提升。结论目前仅在该合成数据集与已知信噪比范围内成立,向混响、削波、真实录音与跨语种的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
829. 噪声下为什么还听声?用沙普利值拆解音视语音识别的模态偏置
标签:#多模态学习 #统计分析 #鲁棒性 #音视频语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音识别 | 主方法:#统计分析
👥 作者与机构
- Umberto Cappellazzo:机构信息未能从会议 PDF 纯文本可靠映射
- Stavros Petridis:机构信息未能从会议 PDF 纯文本可靠映射
- Maja Pantic:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频语音识别以带噪语音与唇部视频为输入并自回归生成转写文本,难点是音频易学导致干净时视觉几乎被忽略、噪声下又利用不足。本文提出解码相对模态贡献框架 Dr. SHAP-AV,先为每个生成词元定义期望对数概率特征函数并以置零近似缺失特征,再经置换采样估计输入特征到输出词元的细粒度Shapley矩阵,随后派生全局平衡、生成过程轨迹与输入输出时间对齐三类指标。与仅做分类器或固定条件归因的MM-SHAP不同,该工作同时适配大语言模型拼接输入与编码器解码器交叉注意力结构,并引入信噪比扫描与时序分析以揭示动态加权机制。在LRS2基准评测条件下,Llama-AVSR在-10dB噪声条件的音频贡献指标为46.0%,低于干净条件的音频贡献指标65.4%,说明存在持续音频偏置。该结论限于英语句子级 LRS2 与 LRS3 推理时分析,未验证训练干预或实时部署效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
830. 只在第一步纠偏肯定回答:用静音对照压住音频幻觉
标签:#对比学习 #音频大模型 #鲁棒性 #音频问答
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#对比学习
👥 作者与机构
- Heyu Chang:机构信息未能从会议 PDF 纯文本可靠映射
- Nianwen Si:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Wenlin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Dan Qu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型(Large Audio-Language Model,LALM)在二元音频问答中常因语言先验虚报不存在声音,首步是否决策成为幻觉关键点。为此论文提出免训练的令牌自适应对比解码(Token-Adaptive Contrastive Decoding,TAD),先并行计算真实音频与等长全零静音参考下的词表对数几率(logits),再按音频感知对比加权得到去先验表示。接着方法将多种表层形式的肯定与否定子词集合化,并用对数求和指数(log-sum-exp)池化聚合成是否证据,计算音频相对静音的边际增益。仅当首步增益低于阈值时对肯定集合施加固定惩罚,否则保持原对比输出并进入常规解码。与固定强度的音频感知解码(Audio-Aware Decoding,AAD)相比,该决策关键且类别条件的门控避免了证据充分时的过度纠正。在Qwen2-Audio-7B-Instruct的AudioCaps-Hallucination上,TAD相对AAD在随机、流行、对抗三个划分分别将F1从0.736提升至0.853、从0.499提升至0.558、从0.425提升至0.494;在Gemma-3n-E4B-it上对应提升0.025至0.064;在Clotho-AQA是否子集上Qwen2从0.810提升至0.816,Gemma上与AAD基本相当。该结论目前仅限于是否问答与首步干预,对开放式描述及多步推理尚未验证。原文未披露训练、推理延迟或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Changhy26/TAD — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
831. 整机传送链的故障听诊:七通道音频振动如何支撑跨速度检测与分类
标签:#工业应用 #数据集构建 #异常声音检测 #音频分类
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#异常声音检测 | 主方法:#数据集构建
👥 作者与机构
- Zhang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yucong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoxiao Miao:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理单速链式输送机(Single-Speed Chain Conveyor,SSCC)系统级故障分析,输入为同步多通道音频与振动波形,输出为正常与否判定或正常加四类故障的五分类标签,难点在于稳态周期成分掩盖微弱故障线索,且速度、负载与工厂结构噪声带来分布偏移。方法链分四步:按速度、负载、故障类型与噪声条件组织采集并切分为5秒样本;用冻结预训练音频编码器经SIREN工具包逐通道提取嵌入;以通道内标准化与经验累积分布函数(Empirical Cumulative Distribution Function,ECDF)分位数映射统一异常尺度;经晚期融合平均或加权投票得到样本级决策。相对聚焦电机轴承且多为单模态的CWRU、IIEE、IICA,以及仅单音频通道的MaFaulDa和HUSTmotor,关键差异是整机多传感布局加真实噪声回放与双任务跨速度划分,使通道分析与多模态互补可被统一检验。在目标速度为100的无监督故障检测任务下,FISHER音频视图的AUROC为0.954,高于FISHER融合视图的AUROC 0.882。结论仅适用于该输送机平台与所定义的lean、dry、loose、screwdrop四类故障及回放噪声,跨设备跨产线与开放集异常的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
832. 把音素拆成发音属性:普通话误读检测如何同时看清声韵与声调
英文题目:Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis
标签:#教育 #自监督学习 #语音学与音系 #语音 #语音属性识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#自监督学习
👥 作者与机构
- Jinghao Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Mostafa Shahin:机构信息未能从会议 PDF 纯文本可靠映射
- Beena Ahmed:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向二语普通话学习的误读检测与诊断(Mispronunciation Detection and Diagnosis, MDD)需同时判断音段与声调错误,输入为L2朗读语音与正则文本,输出为音素级接受或拒绝及可解释的属性级反馈,难点在于声调与音段紧耦合且拼音(Pinyin)掩盖同形异音。方法链分三步:先用音素化器(Phonemizer)将文本经Dragonmapper转为国际音标(International Phonetic Alphabet, IPA)序列并做最长匹配与现代汉语归一,接着经音素到属性映射得到二值语音属性向量并以Wav2Vec2 XLSR-53为骨干做多标签CTC微调,最后由属性到音素转写器重建音素并经Levenshtein对齐生成两级反馈。与纯音素基线相比,该机制不直接分类音素而共享发音部位与调形等底层特征,使混淆对可追溯到个别区别性特征。在Common Voice 13中文(CV13-CN)训练并在LATIC评测时,IPA-D × Tone-CAT相对同训练Wav2Vec2基线将误接受率(False Acceptance Rate, FAR)从9.97%降至8.15%,诊断错误率(Diagnostic Error Rate, DER)从34.03%降至27.86%;IPA-D × Tone-PT进一步将DER降至26.05%但FAR回升至8.79%。摘要宣称相对音素基线FAR降10.1%、DER降23.6%,与表5绝对数值的相对换算存在口径差异。结论限于朗读式普通话音节与小规模非母语口音,对自发语音与未见母语背景的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
833. 偏好与引导分开学:双模型如何让流匹配语音更听话
标签:#流匹配 #偏好优化 #零样本 #文本到语音
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#偏好优化
👥 作者与机构
- Minchuan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chenchen Wan:机构信息未能从会议 PDF 纯文本可靠映射
- Junjie Li:机构信息未能从会议 PDF 纯文本可靠映射
- Peng Qi:机构信息未能从会议 PDF 纯文本可靠映射
- Shaojun Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Xiao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本文本到语音的输入为目标文本与短参考音频,输出为保留音色并准确发音的语音,难点在于同一条件下采样质量波动大且训练目标与人类感知的不一致。本文先用预训练流匹配模型对同一提示多次采样并以词错误率与说话人相似度做帕累托排序构造偏好对,再以两个同初始化模型分别拟合偏好分布与非偏好分布并用联合目标协同优化,随后在采样端以三项引导组合偏好速度场与代理提示下的非偏好速度场,同时引入投影缩放与首步置零来稳定无分类器引导。与单模型直接偏好优化相比,解耦建模避免了正负信号在同一参数上的冲突,并把偏好信号显式带入推理引导。在Seed-TTS test-zh上偏好双模型将词错误率从基线4.24降至3.06且相似度同步提升,挑战文本训练的版本进一步降至2.87,证实了小规模代理偏好数据的有效性。该结论目前仅在中英双语朗读类评测与上述代理指标下成立,未验证真实人类偏好、情感韵律与低资源语言的外推能力。原文未披露训练、推理或部署成本,未来工作承认需用蒸馏与低秩适配降低双模型开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
834. 静态卷积不够用时:用通道内局部注意力给 Mamba 换上动态前端
英文题目:Attentive Mamba: Channel-wise Local Attention for Speech Recognition
标签:#注意力机制 #状态空间模型 #语音 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#状态空间模型
👥 作者与机构
- Jen-Tzung Chien:机构信息未能从会议 PDF 纯文本可靠映射
- Fan-Che Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Ching-Hsien Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为16 kHz音频提取的80维对数梅尔滤波器组特征,输出为字符或词序列文本,难点在于长时相关建模需要全局记忆而细粒度声学细节又依赖内容自适应的局部聚合。该方法先以因果深度卷积分别生成查询、键和值的通道上下文,使每帧表示携带宽度为w的局部历史,再在因果局部窗口内做跨通道点积注意力得到自适应上下文矩阵U,随后将U作为选择性状态空间模型的选择性输入并动态生成状态转移矩阵A、输入矩阵B与输出矩阵C。相比Mamba2的静态卷积加线性投影,该设计以实例相关的注意力权重替代固定核聚合,同时保留状态空间模型的线性长程建模。在LibriSpeech的联结时序分类加基于注意力的编码器解码器加4元语言模型50-best重打分设置下,注意力Mamba在test-clean上词错率为2.73%,低于同设置Conformer重打分基线的3.03%。该结论目前仅在英文朗读与TED演讲数据及双向非流式编码器下验证,未证明严格因果流式或跨语言外推有效。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
835. 词边缘更稳、词中间更杂:儿童辅音簇熵的位置分化与向成人模型的收敛
英文题目:Sorting Clusters into the Shape of the Word: Positional Distribution of Probabilities
标签:#统计分析 #语言习得 #语音学与音系 #语音 #语音属性识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Anastasia Chuprina:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为CHILDES儿童实际发音及其成人目标形式的音标转写,输出为词首、词中元音间和词尾三位置辅音丛分布熵,难点在于儿童系统高度可变且各语言音系约束与形态音系干扰不同。方法链分四步:先清洗变音符号并按词首、元音间、词尾抽取辅音丛,再以每儿童每位置50个丛的等长分箱控制样本量偏倚以进入估计,然后用Schurmann-Grassberger估计器计算熵并以Chao-Shen估计器核对稳健性,最后将熵差输入线性混合效应模型检验位置、语言与收敛效应。相对已有按正确率计位置效应的方法,关键差异是以分布多样性度量约束松弛程度,从而区分运动探索与音系学习两层机制并解释词边稳定现象。在四音节以内词的语料设置下,成人理想系统的占比指标为>97%,高于儿童实际产出的占比指标>95%。结论仅适用于4音节以内词的双辅音丛且依赖转写质量,形态音系与声学实现尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://osf.io/v6uc7/overview — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
836. 边解码边适应:用跨句音频文本提示做老年语音零样本在线说话人适配
标签:#多模态学习 #提示学习 #零样本 #语音 #语音识别
评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#提示学习
👥 作者与机构
- Chengxi Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Xurong Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Shujie Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Mengzhe Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Tianzi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Youjun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Huimeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoning Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Jiajun Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Xunying Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
老年语音识别需将含构音不清与选词组句障碍的语音转写为文本,难点在于说话人异质性大、数据稀疏且切分为短句后长程上下文丢失。本文基于 Whisper-medium 构建边解码边适应的在线链条:先对训练说话人做说话人自适应训练得到离线提示目标,再用冻结 Whisper 卷积与分词器抽取当前句及至多 3 轮历史语音与文本嵌入,经双重跨模态融合与基于查询压缩器的模块生成紧凑在线说话人提示并拼接到编码器输入参与解码。与仅用声学向量或批量伪标签微调的批量测试时自适应不同,该方法在解码同时利用跨句音频与文本互补信息并冻结主干加低秩适配。在 DementiaBank Pitt 评测集与 JCCOCC MoCA 评测集上相对说话人无关基线分别获得 0.61%词错误率与 1.22%字错误率的绝对下降且通过显著性检验,推理实时率相对批量提示自适应加速达 9.83 倍。该结论限于英语痴呆访谈与粤语认知评估两类受试者无关划分,未验证噪声、重度障碍或长时对话漂移下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
837. 组织实体为何最难听准:从多词边界到结构约束的声学命名实体识别
英文题目:Rethinking Organization Entity Modeling in End-to-End Acoustic Named Entity Recognition
标签:#数据增强 #正则化 #语音识别 #口语理解
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语理解 | 主方法:#正则化
👥 作者与机构
- Spandan Dey:机构信息未能从会议 PDF 纯文本可靠映射
- Nidhi Mantri:机构信息未能从会议 PDF 纯文本可靠映射
- Sambit Behera:机构信息未能从会议 PDF 纯文本可靠映射
- Hirak Mondal:机构信息未能从会议 PDF 纯文本可靠映射
- Sanjay Kurmi:机构信息未能从会议 PDF 纯文本可靠映射
- Sreyasree Mandal:机构信息未能从会议 PDF 纯文本可靠映射
- Atharv Joshi:机构信息未能从会议 PDF 纯文本可靠映射
- Premjeet Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Gopal Agrawal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端声学命名实体识别需直接从语音输出交错词序列与实体标记,组织(Organization)类因多词跨度、缩写与全称混用、大量未登录词及缺失大小写与标点线索而最难检。本文先以Whisper-small为基座复现联合转写加标注基线并诊断验证集失效模式,再用大语言模型定向改写组织句式并经语音合成回灌声学训练集,随后引入组织专用结束符与结构约束实体学习(Structure-Constrained Entity Learning,SCEL)联合优化跨度一致性。最终系统在同一英语测试集上将组织F1值从30.35%提升至51.40%,词错误率(Word Error Rate,WER)从13.15%降至9.53%,总体实体F1值达76.88%。与级联先转写后标注管线不同,该框架在解码中直接监督实体起止配对并校准标签置信度,以显式跨度约束代替后处理纠错,从而稳定多词组织边界。在Yadav等人英语基准测试集下,最终框架的组织F1指标为51.40%,高于交叉熵基线的组织F1指标30.35%。该结论的适用边界受限于干净朗读英语语料,含噪远场、口音与多语言等条件的泛化尚未验证。该增益仅在LibriSpeech与Common Voice衍生的Yadav等人英语库及同管线合成的多跨度样本上验证,未覆盖噪声、口音、多语言或真实长尾分布,原文未披露训练与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
838. 不在时频上加亮度,而在调制域上搬能量:近端聆听增强的另一种分配方式
英文题目:Energy Redistribution in the Spectro-Temporal Modulation Domain for Near-End Listening Enhancement
标签:#统计分析 #主观评测 #时频分析 #语音可懂度评估 #语音增强
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#时频分析
👥 作者与机构
- Amin Edraki:机构信息未能从会议 PDF 纯文本可靠映射
- Amirhossein Hajavi:机构信息未能从会议 PDF 纯文本可靠映射
- Irina Kezele:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanhao Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
近端听音增强以干净语音为输入,在总能量不变约束下输出回放前预处理波形,以提升噪声环境中的可懂度,难点在于常规时频增益难以直接操控承载共振峰过渡等结构的谱时间调制模式。该方法先对对数幅度短时傅里叶变换分段并经二维傅里叶变换得到调制功率谱,输出谱时间调制能量分布。接着以可分离谱调制分量与时间调制分量外积构成全局掩蔽并加权调制功率谱,将固定能量预算重分配至利于可懂度的调制区。随后经逆变换重构语谱并结合高斯带通滤波与能量归一化合成波形,使上一步的调制域加权落为满足能量约束的时域输出。与谱整形与动态范围压缩等时频带增益基线相比,该机制直接抑制极低调制并增强发音相关调制区,以全局共享掩蔽实现结构化控制而非逐时频点增益。在餐馆噪声-5 dB条件下的主观评测下,STM滤波的句正确得分为0.92,高于未处理噪声语音的句正确得分0.46。该结论适用边界受限于固定掩蔽、有限噪声类型与信噪比及小规模初步主观验证,跨语种与更宽声学场景泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
839. 只给分不够:用保覆盖区间与保序建模重做 MOS 预测
英文题目:ConformalMOS: Uncertainty-Aware MOS Prediction with Conformal Intervals and Ordinal Modeling
标签:#统计分析 #鲁棒性 #语音 #语音质量评估
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#统计分析
👥 作者与机构
- Kehinde Elelu:机构信息未能从会议 PDF 纯文本可靠映射
- Joshua E. Siegel:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammadali Saffary:机构信息未能从会议 PDF 纯文本可靠映射
- Tashfain Ahmed:机构信息未能从会议 PDF 纯文本可靠映射
- Simeon Babatunde:机构信息未能从会议 PDF 纯文本可靠映射
- Ebuka Okpala:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音质量评估需从波形预测多人平均意见分(Mean Opinion Score,MOS),难点在于评分主观噪声大且点估计无法表达不确定性。本文方法链分4步:冻结上游编码器抽取帧级嵌入并做时域均值池化得到定长向量,序数预测头输出K个分数仓概率并以期望求得标量MOS,训练以高斯平滑软目标约束邻仓连续性,标定阶段用保留标定集残差分位数生成固定半宽并裁剪至1至5。与仅输出点估计的UTMOS和FUSE-MOS相比,机制差异在于后处理共形校准提供有限样本覆盖保证而非启发式方差。标定沿用语音挑战划分并在开发池内留出497个样本估计残差分位数以确定区间半宽,评测同时报告覆盖率与平均区间宽度以兼顾有效性与锐度。在BVCC基准测试集下,M2D2的MSE为0.080,低于FUSE-MOS的MSE 0.086。其结论适用边界受限于域内BVCC验证,跨系统泛化与域外鲁棒性尚未验证,波形骨干差异仍会导致校准误差变化。原文未披露推理与部署成本,训练单次约2小时。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
840. 成对验证为何在源头追溯中更差:全局锚定的分辨率优势与嵌入塌缩代价
英文题目:The Hidden Cost of Pairwise Verification in Synthetic Speech Source Tracing
标签:#对比学习 #模型比较 #语音 #语音伪造检测
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#对比学习
👥 作者与机构
- Anton Firc:机构信息未能从会议 PDF 纯文本可靠映射
- Zbyněk Lička:机构信息未能从会议 PDF 纯文本可靠映射
- Vojtěch Staněk:机构信息未能从会议 PDF 纯文本可靠映射
- Kamil Malinka:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
合成语音来源追溯需在开放集下判断测试语音来自哪一生成器,输入为待测语音与声称生成器注册语音,输出为同一来源验证分,难点在于不同生成器痕迹细微且易被说话人与信道因素掩盖。先以冻结的自监督骨干抽取表征并经池化后端压缩为话语嵌入,其输出进入下一步训练头学习。再分别经全局锚定的闭集分类线性层或成对验证的孪生融合头优化嵌入,前者优化交叉熵并输出余弦相似度,后者优化成对相似概率。最后在相同数据与轮次预算下以声称式协议打分,评估域内与域外验证错误率。机制差异在于全局分类迫使样本向全局类别中心对齐,而成对目标直接优化局部相对距离,更易将方差压入少数方向并放大分数尾部重叠。在MLAAD域内评测设置下,全局锚定Global(CE)的等错误率EER为8.61 ± 0.29%,低于成对验证Intermediate(scratch)的等错误率EER 14.92 ± 2.43%。结论边界是该排序仅在所测骨干、池化头与挖掘策略下成立,域外 STOPA 上所有方法均严重退化且区分度微弱。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
841. 会议里谁在跟谁说、谁接着说:文本推理能走多远,音视频为何还没接上
标签:#会议转录 #人类参与评测 #大语言模型 #多模态模型 #轮次切换
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.4/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#轮次切换 | 主方法:#人类参与评测
👥 作者与机构
- Ryo Fukuda:机构信息未能从会议 PDF 纯文本可靠映射
- Takatomo Kano:机构信息未能从会议 PDF 纯文本可靠映射
- Siddhant Arora:机构信息未能从会议 PDF 纯文本可靠映射
- Marc Delcroix:机构信息未能从会议 PDF 纯文本可靠映射
- Naohiro Tawara:机构信息未能从会议 PDF 纯文本可靠映射
- Atsunori Ogawa:机构信息未能从会议 PDF 纯文本可靠映射
- Yuya Chiba:机构信息未能从会议 PDF 纯文本可靠映射
- Atsushi Ando:机构信息未能从会议 PDF 纯文本可靠映射
- William Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理四人英语会议中的在线轮次切换(turn-taking)预测,输入为当前说话人标识与转录文本及可选音视频片段和历史上下文,输出为被称呼者(addressee)标签与下一说话人候选集合,并由后者派生是否换轮,难点在于多人指代模糊、重叠语音与频繁换轮带来的不确定性。评测链条先从AMI语料筛选11个会话并重构话语级标签,其中IS1000a仅用于调试、其余10个会话共4051条话语用于评测,再以统一在线约束并行运行监督模型、文本LLM与多模态LLM,最后用同任务人机对照与消融分离上下文、思考模式与注视线索的贡献。相比仅用前一句话特征的传统分类器,LLM凭借数十轮对话历史与逐步推理建模话题走向与角色习惯,因而在下一说话人预测上占优。与已有单任务文本评测不同,该工作把三类任务、三种建模范式与人类表现纳入同一协议,并显式检验原始音视频是否带来增益。在包含347条话语的人评子集评测设置下,Gemini 2.5 Pro完整上下文条件的下一说话人预测F1指标为57.7,高于去除上下文条件的下一说话人预测F1指标25.7。结论仅适用于AMI式角色化四人会议与提供理想说话人与转录的设定,跨语言、三人对话与真实说话人日志场景尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
842. 把语言模型加进解码器还是融进参数:用 LoRA 算术做领域适配的 ASR
英文题目:Merging the Knowledge of LLMs for Automatic Speech Recognition
标签:#领域适应 #模型融合 #大语言模型 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型融合
👥 作者与机构
- Hayato Futami:机构信息未能从会议 PDF 纯文本可靠映射
- Tatsuya Kawahara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理基于大语言模型(Large Language Model,LLM)的自动语音识别(Automatic Speech Recognition,ASR)向目标文本域适配问题,输入为源域配对语音文本与目标域纯文本,输出为目标域转写文本,难点在于无目标域配对数据且大模型解码时融合开销过高。方法链分为三步:先在同一基座上分别训练源域语音识别适配器与源域和目标域语言模型适配器;再将目标域语言模型向量加到语音识别参数上实现域扩展,或进一步减去源域语言模型向量实现域迁移;最后引入稀疏合并(TIES-Merging)做截断选符号与掩码合并以抑制任务干扰。相比浅融合(Shallow Fusion,SF)与密度比(Density Ratio,DR)在每步解码调用外部模型,该机制把知识压缩进单组权重,推理保持单模型前向。在CSJ-SPS到CSJ-APS适配中目标评估集eval1字符错误率从13.9%降至13.3%,而英语LibriSpeech到SPGISpeech词错误率从11.2%降至10.6%。该结论适用边界受限于同基座同秩适配器与学术演讲和金融电话两类偏移验证,失败条件为增大语言模型系数会导致跨模态崩溃且增益不及显式融合。原文仅在NVIDIA RTX A6000上报告实时率不变,未披露训练硬件时间与完整部署成本统计。
🔗 开源资源
- 第三方资源:https://github.com/arcee-ai/mergekit — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
843. 只有二分类标签时,如何排出生病的轻重顺序:优势加权的排序损失
标签:#语音生物标志物 #多模态学习 #音视频 #病理语音评估
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#多模态学习
👥 作者与机构
- Manning Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Tingyi Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Leheng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Haifeng Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuncheng Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Sijie Mai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
野外音视频自动抑郁检测需从长度为 `T` 的音频与视觉序列预测二元标签,难点是抑郁与正常线索高度重叠且二元标注掩盖了严重度连续谱。该方法先用双流一维卷积投影加序列时延网络编码单模态时序,再经模态内Transformer提炼与三路互注意力融合得到统一表示并输出抑郁分数 `s` 与概率 `p`。与逐样本二元交叉熵相比,核心差异是引入二元优势加权排序损失,用正负样本对分数差显式建模序关系并动态放大违反间隔的困难对,同时收缩类内方差并正则批次分布。在LMVD测试集上准确率76.50、精度75.00、召回79.12、F1 77.01,超越次优基线CAF-Mamba约2.14个百分点;在D-vlog上准确率71.23、精度70.67、召回86.18、F1 77.66,F1领先CAF-Mamba约0.62个百分点但准确率低于后者。该结论仅在两个野外视频数据集的站内划分上验证,未验证向DAIC-WoZ等临床访谈域的迁移,也未检验学到排序与真实量表的一致性。原文未披露特征提取细节、训练推理成本与代码。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
844. 在线缺未来、离线看全文:用在线预测编码补齐双模自监督的注意力落差
英文题目:Online Predictive Coding for Dual-Mode Self-Supervised Speech Models
标签:#自监督学习 #预训练 #流式处理 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Keita Goto:机构信息未能从会议 PDF 纯文本可靠映射
- Takashi Maekaku:机构信息未能从会议 PDF 纯文本可靠映射
- Jin Sakuma:机构信息未能从会议 PDF 纯文本可靠映射
- Jinchuan Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Shinohara:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
双模式自监督语音模型需用同一编码器同时支持流式在线识别与全上下文离线识别,输入为卷积特征序列,输出为上下文表示,难点在于在线自注意力缺失未来帧导致与离线分支的注意力分布失配和联合优化困难。该工作先将语音分块并为每块追加可学习在线寄存器以提供缺失未来的代理容量,再用在线预测编码将拼接后的寄存器表示经多组线性投影去预测随后多个离线分支表示并以余弦距离联合优化,最后为在线与离线分支保留独立的层归一化仿射参数以隔离统计量偏移。与直接使用寄存器或共享归一化的已有做法相比,关键差异在于寄存器被显式多步未来预测目标正则化而非仅靠容量补偿。在 160 ms 块长且无前视的 LibriSpeech 评测中,在线词错误率由 3.65% 降至 3.40%,同时离线由 2.73% 降至 2.64%,在线离线差距缩小。结论主要适用于 LibriSpeech 预训练同分布的英语朗读语音识别微调场景,在 WSJ 跨域离线条件下曾出现退化,外推至说话人、情感等多任务流式应用尚未验证。原文未披露训练时长、推理吞吐与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
845. 黑盒预测到临床叙事:语音认知筛查如何把词权重翻译成可核对的语言证据
标签:#语音生物标志物 #多模态学习 #可解释性 #语音 #病理语音评估
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#多模态学习
👥 作者与机构
- Yasaman Haghbin:机构信息未能从会议 PDF 纯文本可靠映射
- Sina Rashidi:机构信息未能从会议 PDF 纯文本可靠映射
- Ali Zolnour:机构信息未能从会议 PDF 纯文本可靠映射
- Fatemeh Taherinezhad:机构信息未能从会议 PDF 纯文本可靠映射
- Ali Fartoot:机构信息未能从会议 PDF 纯文本可靠映射
- Hossein Azadmaleki:机构信息未能从会议 PDF 纯文本可靠映射
- James M. Noble:机构信息未能从会议 PDF 纯文本可靠映射
- Maryam Dadkhah:机构信息未能从会议 PDF 纯文本可靠映射
- Maryam Zolnoori:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音筛查认知障碍任务,输入为最长30秒的多语言自发语音、对应转录与年龄分组,输出为健康对照、轻度认知障碍与阿尔茨海默病三分类及面向医生的结构化语言学解释,难点在于黑盒Transformer预测与临床认知语言机制之间缺乏可理解映射。筛查阶段采用语音护理自适应门控融合模型融合语言、声学与年龄表示并动态加权输出三分类概率,其预测与原始转录共同进入解释阶段。解释阶段并行计算面向Transformer的沙普利加性解释词级归因与四类理论语言学特征,将子词级归因聚合为词级证据。随后四阶段大语言模型流水线依次完成词级解读、特征级解读、跨源聚合与结构化报告生成,用六个认知语言维度约束提示并做渐进式精炼,这与仅输出数值重要性的既有可解释方法不同。在70例英语分层子集医生盲评条件下,报告与认知画像一致的得分为98%,高于系统临床可用性的得分为82/100。在NIA PREPARE基准测试集上筛查模型F1为72.11%、AUC为86.83%。该结论仅在英语子集小样本医生评估与单次测试集上验证,未覆盖声学可解释性与多语言泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
846. 唤醒度易迁移、效价值价贵:英语到普通话情感属性的跨语言适配要多少小时
标签:#迁移学习 #跨语言 #低资源 #语音 #语音情感识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#迁移学习
👥 作者与机构
- Dániel Halmai:机构信息未能从会议 PDF 纯文本可靠映射
- Gábor Gosztolya:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究从语音信号预测唤醒度、效价度与优势度三维连续情感属性的跨语言泛化与低资源适应问题,输入为播客自然语音,输出为三维连续分值,难点是效价度和优势度高度依赖语言文化与标注习惯,而既有跨语言工作多为小数据二分类,无法回答何种目标数据量下适应优于单语训练。方法链第一步在约一百零四小时英语MSP-Podcast v1.11上训练WavLM Large三输出回归模型,以均方误差优化并按开发集均方误差选点,形成跨语言源先验。第二步在台湾华语BIIC-Podcast上抽取约一、二、五、十、二十小时子集,分别从零开始直接训练与加载源先验继续微调,使源模型权重直接进入目标小数据适应。第三步在统一开发集与测试集上按属性分别计算Pearson相关系数与一致性相关系数,并用五随机种子均值与Mann-Whitney U检验判定适应相对直接训练与百小时单语基线的差异。测试集上 10 小时适应的唤醒度 Pearson 为 0.624,超过 100 小时单语模型的 0.606且差异显著,而效价度需 20 小时适应才与 100 小时单语模型持平,约为 0.362对0.365。结论边界是仅验证英语到台湾华语单方向、单一主干与播客自然语域,优势度绝对性能偏低且未涉及类别情感。原文未披露训练、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
847. 在噪声脑电中找对语音:SCANS 用交叉注意与有监督对比做时间对齐
英文题目:SCANS: Supervised Contrastive Temporal Alignment of Neural Responses and Speech Stimuli
标签:#注意力机制 #对比学习 #脑信号 #语音 #言语神经解码
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#言语神经解码 | 主方法:#对比学习
👥 作者与机构
- K M Naimul Hassan:机构信息未能从会议 PDF 纯文本可靠映射
- Donald S. Williamson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
匹配失配任务以64通道EEG片段为输入,需从同一语音信号的N个非重叠候选包络中选出时间同步的一项,难点在于EEG噪声大、维度高且被试差异显著。所提SCANS先用扩张卷积前端将EEG与语音包络投影到128维共享空间并扩大感受野提取局部特征,输出序列进入下一步精炼。接着对称跨模态注意力以对方模态为键值做相互精炼并加入位置嵌入保持时序,再经全局平均池化与L2归一化得到可比嵌入。最后将EEG与音频嵌入拼接后经多层感知机分类头输出匹配logit,并以交叉熵加监督对比对齐损失联合优化全局同步。与仅在末层比较的晚融合编码器不同,该链路在特征提取全程交换信息,以身份矩阵为监督稳定共享隐空间并提升跨被试泛化。在SParrKULee数据集2023赛制评测设置下,SCANS的Total Score为86.1,高于Thornton等人的Total Score 82.13。该结论适用边界限于荷兰语听故事范式与3 s及5 s窗和2选1及5选1设置,跨语言与在线助听部署尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
848. 只会答题的音乐大模型为何算不准情感分数:指令微调打底加数值反馈精修
英文题目:Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment
标签:#指令微调 #强化学习 #音乐 #音乐理解
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音乐理解 | 主方法:#强化学习
👥 作者与机构
- Takuya Hasumi:机构信息未能从会议 PDF 纯文本可靠映射
- Welly Naptali:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音乐情绪回归要求从波形预测唤醒度(arousal,能量强度)与效价(valence,愉悦度)在1至9区间的连续分值,难点在于标注主观噪声大、效价声学线索弱、自回归文本解码器只有下一个词元预测目标而无数值误差目标,开源模型零样本直接预测常失效。该文先用伪问答式指令微调(Instruction Tuning,IT)建立音频到分数文本的映射,冻结音乐编码器并以低秩适配微调解码器学习粗粒度分数格式,再用反馈驱动对齐(Feedback-Driven Alignment,FDA)以组相对策略优化(Group Relative Policy Optimization,GRPO)直接优化分数精度,奖励为负平方误差、解析失败给-200大惩罚。与纯似然训练相比,关键差异是从模仿文本转向按组内归一化优势做裁剪策略更新,从而更有效利用编码器特征并显著提升效价等难维度的实际意义。在混合通用音乐问答训练下,FDA后DEAM唤醒度与效价决定系数(\(R^2\))为0.48与0.35,较同设置纯指令微调明显改善且MusicQA三指标基本保持。结论仅在DEAM与MERGE及MusicFM加Vicuna 7B组合下验证,未证明跨风格、跨标注体系与零样本外推能力。训练使用单卡NVIDIA A100,原文未披露完整耗时、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
849. 位置编码的输出摆幅为何在忆阻器模数转换中被削顶
标签:#模型量化 #鲁棒性 #语音 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#模型量化
👥 作者与机构
- Benedikt Hilmes:机构信息未能从会议 PDF 纯文本可靠映射
- Nick Rossenbach:机构信息未能从会议 PDF 纯文本可靠映射
- Ralf Schlüter:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为对数梅尔特征的连续语音,输出为联结时序分类(Connectionist Temporal Classification,CTC)解码的音素或子词序列,难点是忆阻器交叉阵列在编程噪声与模数转换量化下会放大大模型的误差。方法链分4步:先训练带相对位置编码(Relative Positional Encoding,PE)的12层Conformer基线,再经对称量化观察器映射到SynaptogenML仿真器件,接着诊断位置编码分支线性层的削波分布,最后分别调整该分支转换器量程或删除其线性变换后重训重测。与此前忽略位置编码的忆阻器语音研究不同,本文证明失效集中在编码分支而非全网,并提出局部扩量程的针对性修复。在LibriSpeech dev-other评测下,仅扩大位置编码分支量程方法的WER为6.6 ± 0.06,低于默认4比特量程映射基线的WER 7.6 ± 0.08。该结论的适用边界受限于仿真器件与固定噪声假设,更多芯片变异下的外推尚未验证。结论仅在仿真 128×128 阵列、8 比特激活与固定仿真噪声下成立,未验证真实芯片与流式长语音外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
850. 用共享说话人空间切断音色泄漏,再用最小池化修补拼接断裂
标签:#对抗训练 #流匹配 #零样本 #音乐 #语音转换
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#流匹配
👥 作者与机构
- Yuye Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Ayiduosi Tuohan:机构信息未能从会议 PDF 纯文本可靠映射
- Tianqi Ning:机构信息未能从会议 PDF 纯文本可靠映射
- CuiCui Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Huang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
歌唱声音转换需把源歌声的音色迁移到目标歌手,同时保留音素、音高轮廓与旋律。其实际难点在于解耦不足会泄漏源音色,而过度解耦又会损伤演唱细节与连贯性。MinFlow-SVC先用预训练WavLM-large最后一层特征经帧级K近邻映射到单共享说话人空间,训练内容编码器输出去音色内容特征。再以内容特征加目标音色嵌入与基频为条件,用最优传输条件流匹配生成梅尔谱,最后由HiFi-GAN声码器合成波形。与逐帧平均对抗和整体谱约束不同,该方法在内容侧用StyleGAN结构判别器加最小池化只约束最差片段,在声学侧用基频动态谐波掩膜聚焦有效能量带再施加最坏情况约束以修复高频模糊与金属噪声。在M4Singer训练、OpenSinger随机6人各10句零样本评测中,10步欧拉常微分方程求解器采样的MinFlow-SVC-10自然度平均意见分达到3.83,超过So-Vits-SVC的3.68与NeuCoSVC的3.59,主观相似度2.65亦为最高,客观音色余弦相似度0.663略低于So-Vits-SVC的0.671。该结论仅在普通话歌唱、单共享说话人池、15人主客观评测下成立,跨语言跨风格、混响噪声与长时稳定性尚未验证,训练耗时与显存占用未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
851. 从实例配对到类别锚定:MVCL-DAF++ 以原型对齐与粗细融合应对噪声与长尾
标签:#注意力机制 #对比学习 #音视频 #口语意图与槽位识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语意图与槽位识别 | 主方法:#对比学习
👥 作者与机构
- Haofeng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yifei Han:机构信息未能从会议 PDF 纯文本可靠映射
- Long Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yangfan He:机构信息未能从会议 PDF 纯文本可靠映射
- Yaxin Xue:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态意图识别以文本、声学与视觉三路输入预测用户意图类别,难点在于跨模态语义错位、噪声干扰与长尾稀有类泛化不足。针对弱语义接地与细粒度线索易被淹没的问题,该工作强调以类别级原型约束实例表征,并以全局摘要引导 token 级跨模态交互,区别于仅做实例级对比或单层注意力加权的已有融合。系统先用模态专用编码器提取文本、视觉与声学特征并经CTC对齐,再由粗到细动态注意力融合先抽取模态全局摘要后与细粒度特征分层交互得到融合表示。该融合表示与各模态表征一同进入原型感知对比对齐与多视角对比阶段,以批内同类均值原型为锚点施加原型级对比约束,再与交叉熵分类损失联合优化并解码输出意图标签。消融与可视化表明粗融合与原型对齐互补且同类样本围绕原型聚拢,解释了稀有类鲁棒性来源。在 MIntRec 上准确率 76.18%、加权 F1 分数 75.66%,相对 MVCL-DAF 分别提升 1.46 和 1.05 个百分点;在 MIntRec2.0 上准确率 60.40%、加权 F1 分数 59.23%、召回率 53.96%,相对基线提升 2.60、4.18 和 11.93 个百分点,表明困难与稀有意图检出增强。结论限于 MIntRec 系列离线对话剪辑,未验证缺模态、开放意图检测与跨语种迁移,原文未披露延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
852. 把头型变成连续声场:GISNO 用神经算子加亥姆霍兹渲染做 HRTF 个性化
标签:#信号处理 #零样本 #空间音频信号 #空间音频渲染
评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#信号处理
👥 作者与机构
- Chen Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Hongqing Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Lu Gan:机构信息未能从会议 PDF 纯文本可靠映射
- Liming Shi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
个性化头相关传输函数需从三维头耳网格几何预测任意方向与频率的双耳声学滤波,难点在于跨被试网格非规则且测量方向稀疏离散。几何感知球面神经算子先以基于图的编码器将非规则网格特征聚合到规则球面隐网格,再用球面傅里叶算子在球面上建模全局散射映射得到连续边界复声压,其输出的边界场作为下一步积分器的输入。最后可微亥姆霍兹积分渲染器将边界声压解析传播到任意场点耳道处并归一化为头相关传输函数。与离散回归直接输出固定方向频谱不同,该链路将学习对象转为与离散化无关的边界函数并由物理方程保证场点一致,因而支持空间超分与径向外推。在HUTUBS数据集评测下,Proposed方法的LSD指标为2.92 dB,低于DNN-VAE基线的LSD指标4.29 dB。该结论限于小样本刚性头假设与受控仿真验证,未在更大实测库与多样人种耳形上验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
853. 没有参考文本时,幻觉还能被抓住吗:从文本指标到解码器内部的检测对比
英文题目:From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection
标签:#RNN #模型评估 #语音 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#RNN
👥 作者与机构
- Jan Jasiński:机构信息未能从会议 PDF 纯文本可靠映射
- Mateusz Barański:机构信息未能从会议 PDF 纯文本可靠映射
- Julitta Bartolewska:机构信息未能从会议 PDF 纯文本可靠映射
- Marcin Witkowski:机构信息未能从会议 PDF 纯文本可靠映射
- Konrad Kowalczyk:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为真实语音及其自动语音识别 Automatic Speech Recognition 转写假设,输出为话语级是否含幻觉 Hallucination 的二分类判断。实际难点在于流畅编造与普通音似错误在文本表面高度相似且部署时无参考转写可用,纯文本线索在参考缺失时判别力急剧下降。方法链分为文本特征、语言模型与内部状态三路:先从假设与参考中抽取误差与语义特征并送入树集成分类器,输出幻觉概率作为第一路信号。再以领域病理知识与少样本改写提示驱动大语言模型 Large Language Model 做二分类,输出第二路判断以补充语义失实视角。最后对 Whisper large v3 解码器中间层完整解码序列做池化探测与双向长短时记忆网络 Bidirectional Long Short-Term Memory 分类,输出第三路参考无关概率,三路中文本与内部概率经逻辑回归元分类器做晚融合,相对已有方法的关键差异在于用中间层系统性漂移取代单点不确定性并实现跨范式互补,具有参考无关部署意义。在 HALAS 上 Whisper large v3 子集的测试中,晚融合取得 F1 为 68.3% 与 ROC AUC 为 90.0%,优于单范式检测器。该结论仅适用于短至中长英文财报类朗读语音与 Whisper 系编码器解码器架构,对单字功能词插入与长尾非典型幻觉仍大量漏检。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/DSP-AGH/asr_hallucination_ — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
854. 把残差捷径换成多流混合:双随机约束如何稳住说话人表征
标签:#模型融合 #鲁棒性 #语音 #说话人验证
评分:6.0/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#模型融合
👥 作者与机构
- Zezhong Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoyu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhe Li:机构信息未能从会议 PDF 纯文本可靠映射
- Chong-xin Gan:机构信息未能从会议 PDF 纯文本可靠映射
- Zilong Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Man-Wai Mak:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证需从可变长语音中提取判别性嵌入,输入为80维滤波器组特征,输出为说话人向量并用余弦打分判定是否同源,深层残差网络常因通道级恒等相加缺乏跨通道交互而出现特征冗余与信号衰减。该方法分三步衔接:第一步将隐状态切分为N个并行流并拼接聚合,第二步把聚合表示送入变换块提取时序与通道特征,第三步对变换输出按流切分后交由混合矩阵加权更新,各流输出直接进入下一层继续演化。与无约束超连接相比,关键差异在于先由可学习参数经指数化构造非负矩阵,再经3次Sinkhorn-Knopp行列归一化投影到双随机流形得到混合矩阵,从而保持能量守恒与均值稳定并赋予高带宽跨流刷新能力。在 VoxCeleb1-O 上大尺寸 ECAPA-TDNN 变体等错误率从 0.87% 降至 0.77%,相对下降 11.5%,VoxSRC21 验证集上 ResNet-34 变体从 3.83% 降至 3.35%,相对下降 12.5%。该结论目前仅在 VoxCeleb2 开发集训练与 VoxCeleb1 系评测下成立,未验证噪声、远场、跨语言或大规模干扰集的外推能力。引入混合矩阵与迭代仅增加可忽略计算量,大小ECAPA变体的推理开销分别维持约1.0与3.8 GFLOPs量级且参数量不变,其适用边界仍受限于VoxCeleb系语料尚未验证噪声远场跨语言外推。
🔗 开源资源
- 第三方资源:https://github.com/modelscope/3D-Speaker — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
855. 分段更宽、词表更大时语音还能听懂吗:比特率与生成质量的权衡
标签:#自监督学习 #向量量化 #模型评估 #语音 #语音合成
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#向量量化
👥 作者与机构
- Shunsuke Kando:机构信息未能从会议 PDF 纯文本可靠映射
- Wataru Nakata:机构信息未能从会议 PDF 纯文本可靠映射
- Shinnosuke Takamichi:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Miyao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
生成式口语建模的任务是以语音波形为输入,先经离散化得到单元序列再续写并合成出可懂且连贯的新语音为输出,实际难点在于长单元序列带来建模冗余与语义保真和声学自然度的权衡难以兼顾。方法链第一步由语音到单元负责分段均值池化与聚类量化,将胡伯特第九层特征按宽度切分并聚类去重后输出低码率单元序列并送入下一步,第二步由单元语言模型负责自回归续写以上一步单元为上下文生成延续单元,第三步由单元到语音负责将续写单元合成为波形完成闭环。与固定二十毫秒帧级量化不同,关键机制是联合放宽分段宽度与扩大聚类词表以缩短序列同时保留区分度,其实质是以更大词表换更低码率从而兼顾效率与内容。重合成中四十或八十毫秒可接近基线,延续中八十至一百二十毫秒大聚类配置在困惑度与多样性上相当或更优,且可懂度与声学保真分别偏向不同合成器。在语音延续的人工MMOS评测任务下,LLM裁判条件的SRCC得分为0.323,高于PPL条件的SRCC得分-0.105。该结论的适用边界受限于上述语料与特征设置,尚未验证自发对话与多语言的外推与失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
856. 朴素音频描述为何拖累问答:用视觉上下文约束听觉描述的级联协作
标签:#模型融合 #零样本 #音视频 #音频字幕生成 #音视频问答
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频问答 | 主方法:#模型融合
👥 作者与机构
- Mingi Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jaehoon Go:机构信息未能从会议 PDF 纯文本可靠映射
- Jinkwon Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Sangyeon Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Sunjae Yoon:机构信息未能从会议 PDF 纯文本可靠映射
- Junyeong Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频问答 Audio-Visual Question Answering / AVQA 要求模型同时输入视频帧与伴随音频并回答计数、定位与比较类问题,难点在于听觉描述常与视觉实体错位且缺乏问题相关细节,直接拼接反而干扰大语言模型 Large Language Model / LLM 推理。VividAC 先由视觉智能体 Visual Agent 依据问题名词短语生成问题相关视频描述,再经基于问题相似度的名词过滤提炼查询聚焦关键词,最后由听觉智能体 Audial Agent 以视频描述加关键词为条件生成视觉接地的音频字幕,三段文本依次输入 LLM 完成作答。与直接生成独立音频字幕或反向音频引导视觉的做法不同,该视觉到音频的单向级联把跨模态对齐显式放在字幕生成阶段而非联合训练中。在 MUSIC-AVQA 测试集上搭配 Qwen2.5 推理时整体准确率达到 59.91%,超出最强端到端基线 Video-SALMONN 约 7.0 个百分点。结论目前仅在器乐演奏场景得到验证,对开放域噪声、语音主导内容及视觉字幕出错时的鲁棒性尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
857. 相似就共享、相异就隔离:用带符号正交约束做持续说话人自适应
英文题目:SCOLoRA: Similarity Conditioned Signed Orthogonal LoRA for Continual Speaker Adaptation
标签:#持续学习 #LoRA #语音 #语音识别
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- Ye-Eun Ko:机构信息未能从会议 PDF 纯文本可靠映射
- Jae-Hong Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Dong-Hyun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jin-Seong Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
持续说话人自适应(Continual Speaker Adaptation)要求单个端到端语音识别模型沿说话人流 \(Spk\_1,\\dots,Spk\_T\) 依次个性化,每步仅可见当前说话人自适应集 \(D\_t=\\\{&\#40;x\_t^n,y\_t^n&\#41;\\\}\),不能回放历史数据,输出为合并后的单一推理模型,难点是新说话人学习导致历史说话人灾难性遗忘,而统一隔离又会阻断相似说话人间的迁移。相似度条件有符号正交低秩适应(Similarity Conditioned Signed Orthogonal LoRA,SCOLoRA)先用 ECAPA-TDNN 提取当前嵌入 \(e\_t\) 与历史嵌入 \(e\_i\) 并计算余弦相似度 \(S\_\{i,t\}\),再经 S 形先验与轻量路由生成有符号系数 \(\\lambda&\#40;S\_\{i,t\}&\#41;\),最后以单位 Frobenius 球面投影下的重叠正则约束新低秩分支训练并合并入 Whisper small 主干。相似度远高于阈值时系数为负鼓励基对齐,远低于阈值时为正强制正交分离。单位球面投影消除尺度歧义使重叠有界,历史基固定仅优化当前分支与控制器以稳定训练。在 TEDLIUM3 的8说话人流上测试集平均词错率(Word Error Rate,WER)为4.11%,优于 O-LoRA 的4.33%和 GainLoRA 的4.25%,开发集遗忘分数为0.05,低于 O-LoRA 的0.19;在 CHiME3 的4说话人噪声流上从28.09%降至22.59%。该结论的适用边界受限于短流英语演讲与受控噪声场景,尚未验证长流、强口音、语言切换与嵌入失效下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
858. 不转写直接听:四个分工考官加一个总审如何做雅思口语反馈
标签:#教育 #多模态学习 #少样本 #语音 #语音属性识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#多模态学习
👥 作者与机构
- Hui Xin Koh:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Chenghua Lin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
雅思口语测试输入为原始考生长音频,输出为总分与四项准则分数及可执行反馈,难点在于流利度与发音依赖韵律时序而转写会抹除停顿、重音与发音偏误线索。第一步按考试三部分切分并分段独立评估,再由流利连贯、发音、词汇与语法四个准则智能体直接听音频并结合少样本专家示例分别给出分数与反馈,其输出一并进入下一步。第二步由元评审器回听原音频做交叉一致性校验与冲突裁决,第三步按官方舍入规则平均合成总分并整合为统一报告。相对级联式自动语音识别(Automatic Speech Recognition)加大语言模型(Large Language Model)流水线,该设计避免了识别纠错对口音与不流利的不可逆清洗。与回归基线相比,所提多智能体少样本系统在自建270场模考语料上平均皮尔逊相关(Pearson r)达到0.480,反馈与专家反馈的语义相似度达到0.824。结论限于中等分数段的英语模考场景,未验证跨考官、跨主题与高风险实考的外推稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
859. 只用合成元音就能超过真数据:流匹配如何把病理嗓音的非线性抖动学出来
英文题目:Synthetic Pathological Speech at Scale: A Flow Matching Approach for Clinical Data Augmentation
标签:#数据增强 #流匹配 #跨语言 #病理语音评估
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#流匹配
👥 作者与机构
- Alkis Koudounas:机构信息未能从会议 PDF 纯文本可靠映射
- Moreno La Quatra:机构信息未能从会议 PDF 纯文本可靠映射
- Quentin Jodelet:机构信息未能从会议 PDF 纯文本可靠映射
- Hayato Futami:机构信息未能从会议 PDF 纯文本可靠映射
- Valerio Mario Salerno:机构信息未能从会议 PDF 纯文本可靠映射
- Sabato Marco Siniscalchi:机构信息未能从会议 PDF 纯文本可靠映射
- Emiru Tsunoo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
病理语音评估以持续元音为输入,输出健康与病理二分类及细粒度病种判断,难点在于数据稀缺不平衡且传统线性扰动无法复现声门非线性不稳定性。本文先在德语SVD、葡萄牙语AVFAD、意大利语VOICED与英语PVQD合并的7211例多语言元音库上微调流匹配文本到语音模型F5-TTS,以临床状态token控制健康与病理声学特征,再以参考引导方式规模化合成平衡训练集,最后用自监督编码器加均值池化与多层感知机分类器在合成与真实数据上训练并在无说话人重叠的held-out真实数据上评测。相比加噪变调等传统增强与自回归合成,该方法以常微分方程全局轨迹避免逐token漂移,更适合基频稳定敏感的持续元音。在held-out真实数据评测下,Synth-only 100k的准确率为0.836,高于Real-only的准确率0.804。该结论限于持续元音与二值状态控制,未验证连接语音与严重度连续建模,外域细粒度分类增益随规模扩大已趋饱和,远域帕金森零样本在100k出现回落。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
860. 不存病人音频也能记住旧医院:Lung-CL 用生成回放与谱感知蒸馏做持续学习
标签:#医疗音频 #持续学习 #知识蒸馏 #音频分类
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#持续学习
👥 作者与机构
- Qinben Lai:机构信息未能从会议 PDF 纯文本可靠映射
- Lukui Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaxin Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Wenjuan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
呼吸音分类需以Mel频谱图为输入,输出正常、爆裂音、哮鸣音、混合共4类,难点是跨医院设备与人群的协变量偏移,以及隐私法规禁止缓存历史患者数据。所提Lung-CL以音频频谱Transformer为主干,将其解耦为冻结特征提取器G与可训练语义学习器H,先以G稳定潜分布,再为每类拟合类别条件高斯混合合成伪特征并注入H做隐回放。同时教师-学生间多层谱感知蒸馏以能量门控聚焦高能量病理区,以余弦损失保持语义方向,以KL散度保持类间关系,与分类损失联合优化。该机制显式分离域不变病理与设备噪声而非盲对齐特征,从而在抑制低能量背景噪声的同时保留历史语义与响应关系。在S1序列评测设置下,Lung-CL的准确率为61.81%,高于朴素微调的准确率58.70%,且Lung-CL的BWT为-4.0%,高于朴素微调的BWT -14.11%。结论的适用边界受限于3个公开库的域增量场景,类增量、开放集噪声与真实床旁部署漂移尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
861. 从录音到怪兽嗓:用预设效果链把声音设计做成可评测的转换任务
标签:#基准测试 #数据集 #数据集构建 #语音转换
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音转换 | 主方法:#数据集构建
👥 作者与机构
- Seolhee Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Minsu Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Yangsun Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Woosun Min:机构信息未能从会议 PDF 纯文本可靠映射
- Choonghyeon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Namhyun Cho:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
人到非人语音转换(human-to-non-human voice conversion,H2NH-VC)要求以原始人声或拟声为源内容,以专业声音设计(sound design)后的怪兽与机械音色为目标风格,难点在于非语言发声分布广泛且效果链非线性强而公开资源缺失。该工作先从语音库与开放拟声音频中筛选清洗原始素材,再由声音设计师经 Dehumaniser 2与宿主后处理构建多风格预设算子并批量渲染设计变体,最后划分训练与测试的源音色和预设风格可见与不可见组合以支撑泛化评测。与已有自然人声转换基准的关键机制差异在于评测目标从说话人相似度转向设计音色复现,并提供源到参考的配对参考与预设结构说明以支持可控比较。在所报告的代表性基线中,可见源与可见风格下音色余弦相似度达到0.667且平均意见分(mean opinion score,MOS)为3.81,而双不可见条件下分别降至0.610与3.49,表明未知风格与未知源同时出现时感知质量明显下降。该结论仅适用于所含效果器族与短时发声,对长时表演、交互式参数控制与跨工具迁移尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
862. 静音肌电没有配对语音时,同句有声肌电能否做中间表示目标
英文题目:Enhancing EMG-to-Speech via Silent-Voiced Representation Alignment
标签:#统计分析 #迁移学习 #生理信号 #语音 #静默语音接口
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#静默语音接口 | 主方法:#迁移学习
👥 作者与机构
- Jiwon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Injune Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Jaejun Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Eungbeom Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Dongyub Han:机构信息未能从会议 PDF 纯文本可靠映射
- Kyogu Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
肌电到语音(EMG-to-Speech,ETS)以面部肌电重建可懂语音,难点是静默肌电(silent EMG)无配对声学真值且样本远少于发声肌电,导致内容映射不稳定。所提静默-发声对齐(Silent-Voiced Alignment,SVA)让同一肌电编码器同时编码静默输入`Es`与同话语发声配对`Ev`,先在输出层用声学欧氏距离与音素分布欧氏距离构造代价矩阵并以动态时间规整(Dynamic Time Warping,DTW)求解发声到静默的帧映射,再沿该路径计算输出对齐损失,并复用同一路径对各Transformer隐层施加余弦距离约束,最后以基于输出对齐误差的Sigmoid型样本权重调节辅助损失强度。与以往只迁移语音衍生声学目标的做法不同,该机制把发声肌电表征作为可达的中间教师,提供独立于语音目标的正则化。在Gaddy and Klein数据集98条静默测试上,以Whisper medium评测,Mel目标词错误率从26.75%降至25.14%,相对降低约6.0%,\(p=0\.002\);软语音单元(Soft Speech Unit,SU)目标从27.78%降至26.55%,\(p=0\.009\)。Mel下Fréchet Speech Distance从6.48降至6.28且显著,SU下从8.99变为9.15且不显著。结论目前仅在单一英语数据集与两类基线编码器上验证,未证明跨被试、跨语言或病理场景外推能力,原文未披露训练与推理成本。
🔗 开源资源
- 代码相关资源:https://github.com/jiwonlee-0218/SVA- — 链接不可用(HTTP 404)
- 第三方资源:https://github.com/dgaddy/silent — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
863. 从找词困难到语音错语的级联:HASS 如何分层仿真 logopenic 失语
英文题目:HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection
标签:#数据增强 #言语障碍 #病理语音评估 #语音合成
评分:6.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#数据增强
👥 作者与机构
- Harrison Li:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Cheol Jun Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Jiachen Lian:机构信息未能从会议 PDF 纯文本可靠映射
- Rabab Rangwala:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxu Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Emma Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Lynn Kurteff:机构信息未能从会议 PDF 纯文本可靠映射
- Zoe Ezzes:机构信息未能从会议 PDF 纯文本可靠映射
- Willa Keegan-Rodewald:机构信息未能从会议 PDF 纯文本可靠映射
- Jet Vonk:机构信息未能从会议 PDF 纯文本可靠映射
- Siddarth Ramkrishnan:机构信息未能从会议 PDF 纯文本可靠映射
- Giada Antonicelli:机构信息未能从会议 PDF 纯文本可靠映射
- Zachary Miller:机构信息未能从会议 PDF 纯文本可靠映射
- Marilu Gorno Tempini:机构信息未能从会议 PDF 纯文本可靠映射
- Gopala Anumanchipalli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
原发性进行性失语 Primary Progressive Aphasia / PPA 自动筛查受临床语音稀缺制约,输入为自然叙事语音、输出为对数缺失型 Logopenic Variant / lvPPA 判别,难点在于检索障碍与音系错误多层耦合且随严重度变化。分层失语语音模拟 Hierarchical Aphasic Speech Simulation / HASS 先由大语言模型 Large Language Model / LLM 生成自发文本并注入词汇检索损伤,再将词级紊乱文本转写为词对齐国际音标并注入音系编码损伤,最后经 VITS 合成保留标记的紊乱语音并以同管线无损伤对照隔离合成伪影。与既往孤立插入重复或停顿的做法不同,HASS 以词汇偏置与句法依从约束多层共现并做轻度、中度、重度三档严重度分级以控制紊乱标记率随病情加重递增,从而模拟疾病结构而非孤立事件并提升跨站泛化能力。在Baycrest与Delaware训练并跨站至Hopkins与Capilouto评测场景下,HASS的AUC为0.892 ± 0.076,高于基线的AUC 0.850 ± 0.122。该结论仅在英语 lvPPA 二分类与所用诱发范式内验证,未覆盖其他变体与真实严重度纵向演化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
864. 一个模型管十种说话任务:用混合 DoRA 专家统一自杀风险语音检测
英文题目:Towards Paradigm-General Suicide Risk Detection via Speech LLM
标签:#混合专家模型 #语音大模型 #零样本 #语音 #病理语音评估
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#混合专家模型
👥 作者与机构
- Jialun Li:机构信息未能从会议 PDF 纯文本可靠映射
- Weitao Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyun Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Yinan Duan:机构信息未能从会议 PDF 纯文本可靠映射
- Diyang Qu:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Runsen Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chang Lei:机构信息未能从会议 PDF 纯文本可靠映射
- Wen Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
青少年自杀风险检测以语音为输入、以二分类风险标签为输出,难点在于不同语音诱发范式激发的声学与语义线索互补但分布差异大,单范式建模割裂且难以泛化到新评估任务。该工作以语音大模型为主干,先将语音与任务描述文本联合编码得到深层语义表示,再由路由器根据主干隐状态动态计算专家权重,然后加权组合多个权重分解低秩适配专家完成参数高效适配,最后经分类器输出风险预测与置信度。与简单混合数据的联合微调相比,该机制用解耦路由与负载均衡显式建模范式特异与跨范式共享信息,避免单适配器容量不足与范式干扰。在十范式1223名中国青少年数据上的评测显示,混合 DoRA 专家平均准确率达到0.656,相对单范式独立建模的0.628提升4.5%。结论仅在中文青少年 MINI-KID 即时风险标注与受控采集条件下成立,对未来行为预测、跨语言跨年龄及真实临床噪声场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
865. 只看峰值帧:KFC-KWS 用 CTC 峰值对齐易混关键词的细粒度判别
英文题目:KFC-KWS: Keyframe Fusion with CTC for User-Defined Keyword Spotting
标签:#CTC #多模态学习 #语音 #关键词检测
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#CTC
👥 作者与机构
- Jin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Wenbin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Ji Hu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
用户自定义关键词检测(User-defined KWS)需在仅给定注册音频与文本时判断查询音频是否含目标词,难点在于仅差一两个音素的易混词会被全局匹配平均化而误触发。本文提出 KFC-KWS(Keyframe Fusion with CTC),先将查询音频、注册音频、音素与文本统一投影到共享空间并做完整 utterance 级自注意力融合,再用 CTC 峰值挑选非空去重音素帧并取局部窗均值形成关键帧,随后以关键帧与注册特征的余弦相似度矩阵为查询去注意力完整表征,最后将双分支输出融合判决。与均匀匹配或外部音素记忆库方案不同,该方法把 CTC 后验直接复用为帧重要性指示器,兼顾局部判别与全局上下文,并以模态丢弃做正则。在 LibriPhrase 难例集上该方法达到 97.65% AUC 与 7.75% EER,平衡 AUC 为 98.73%,显著优于同类多模态基线。结论目前仅在英语朗读短语的干净切分条件下成立,未验证噪声、口音、流式与跨语言外推。原文未披露推理时延与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
866. 不放大模型也能评分:用有序原型把口语水平拉成一条可量化的轨迹
英文题目:LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment
标签:#教育 #正则化 #语音 #语音属性识别
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#正则化
👥 作者与机构
- Hong-Yun Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Fu-An Chao:机构信息未能从会议 PDF 纯文本可靠映射
- Bi-Cheng Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Berlin Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语评估(Spoken Language Assessment,SLA)需从多部分自发语音预测人类评分,难点在于发音流利度等浅层声学线索与语义深度需联合建模,且欧洲语言共同参考框架(Common European Framework of Reference,CEFR)等级具有渐进序数结构。第一步冻结Whisper Large-v3编码器抽取32层表征,由语义锚定层路由(Semantic-Anchored Layer Routing,SALR)偏置初始化并加权融合多深度特征,输出的帧级融合特征进入下一步。第二步经注意力池化(Attention Pooling)按时间显著性加权得到定长向量,再经特征适配器映射为隐嵌入并由期望解码输出连续分数。第三步以潜序数原型对齐(Latent Ordinal Prototype Alignment,LOPA)约束该隐嵌入,通过原型吸引实现类内紧致并以序数约束使原型间距与分差成比例,形成有序流形。与直接微调多模态大模型或仅用末层回归不同,该方法不更新主干且显式约束原型间距与分差成比例,兼顾效率与序数可解释性。在Speak & Improve 2025评估集上,该Whisper方案整体均方根误差(Root Mean Square Error,RMSE)为0.361,皮尔逊相关系数(Pearson Correlation Coefficient,PCC)为0.828,持平Phi-4多目标多模态基线并明显优于末层基线。结论目前仅在该英语二语语料四部分口语任务上验证,跨语言、跨测试体系与分布外泛化尚未检验。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
867. 耳语缺了声带振动:把对齐和生成拆开再做耳语转正常音
标签:#流匹配 #变分自编码器 #低资源 #语音转换
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#流匹配
👥 作者与机构
- Dong Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Ju:机构信息未能从会议 PDF 纯文本可靠映射
- Yao Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
耳语转正常语音转换(Whisper-to-Normal,W2N)需从缺失声带振动的耳语恢复可懂且自然的有声波形,难点是频谱失配大、韵律时序不一致且平行语料稀缺。该方法先以在耳语正常语料上微调的Whisper-large V3内容编码器抽取语义表征,再经双编码器连续变分自编码器(Variational Autoencoder,VAE)加软动态时间规整(Soft Dynamic Time Warping,Soft-DTW)做耳语到正常域对齐,接着由前馈Transformer粗梅尔生成器恢复全局结构并经最优传输条件流匹配(Optimal-Transport Conditional Flow Matching,OT-CFM)对残差精修细节,最后以在生成梅尔上微调的HiFi-GAN合成波形;正常输入经门控路由绕过对齐以兼容常规语音转换(Voice Conversion,VC)。与单阶段联合映射相比,差异在于将跨域对齐与正常域生成解耦且生成模块仅在正常语音上训练。在普通话AISHELL6-Whisper耳语测试集上,相对耳语输入字符错误率(Character Error Rate,CER)由22.937%降至16.932%,感知质量DNSMOSovrl由1.102升至3.072。该结论限于有目标语言训练数据的重训设置,未验证跨语言零样本、真实病理语音与强噪声稳定性。原文未披露训练推理部署成本。
🔗 开源资源
- 演示资源:https://demo-whispervc.github.io/demo-whispervc/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/rkmt/wesper-demo — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/tan90xx/distillw2n — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
868. 先对齐再微调:用联合预训练约束多语言语音表征的符号空间
英文题目:Alignment-Aware Continued Pre-training for Multilingual Speech Representation Learning
标签:#多任务学习 #向量量化 #跨语言 #多语言 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#多任务学习
👥 作者与机构
- Xun Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Xuyang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Fan Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Gaofeng Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Pengyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言语音识别任务以多语种连续语音波形为输入,以离散文字符号序列为输出,实际难点在于异构文字导致可共享符号稀少且长尾语言分布使声学符号对齐被完全推迟到微调阶段而跨语言泛化不足。该工作在多语言语音表示模型MMS基础上插入对齐感知持续预训练,先以掩码对比与多样性约束保持声学不变性并经随机替换将联结时序分类梯度同时注入上下文与量化路径,再以统一罗马化约束中间表示并以语言感知双码本分解离散空间,最后做联结时序分类微调得到识别结果。与仅做声学延续的常规做法不同,统一罗马化将多文字投影到共享拉丁符号空间以约束中间表示,语言感知双码本把离散空间分解为全局与语言特定分支以缓解高资源语言对码字的挤占,从而用文本符号约束重塑表示以促进跨脚本共享。在FLEURS测试集下,联合预训练方法的WER为36.6%,低于直接微调的WER 47.2%。在FLEURS测试集上联合预训练将词错率由直接微调的47.2%降至36.6%,双码本进一步降至35.5%;在MLS-10小时测试集上联合方法为21.1%,相对基线21.2%几乎无提升。该结论依赖特定语种覆盖与辅助语料验证,国际音标路径因转换覆盖缺失与误差未能在FLEURS上充分验证。该结论适用边界受限于特定语种覆盖与语料条件,跨高资源与未见语种的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
869. 从安全中性到声学可验:以假设与验证打破语音情感的中性偏置
标签:#数据增强 #对比学习 #音频大模型 #语音 #音频字幕生成
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频字幕生成 | 主方法:#数据增强
👥 作者与机构
- Qihang Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Wenbing Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Bingsong Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Zihan Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yueran Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Peilei Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Ya Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Yingming Gao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音情感描述任务,输入为原始音频波形,输出为细粒度自然语言情感字幕,难点在于粗粒度中性标注导致大型音频语言模型输出坍缩为安全中性描述,且纯文本扩增切断声学绑定引入幻觉。方法先用Gemini 2.5 Pro与Qwen3-Omni协同标注并按BGE-M3相似度切分,以高一致样本加软硬负例微调Qwen2.5-Omni判别式裁判模型,负责声学保真校验,其输出作为后续过滤器进入下一步。接着以DeepSeek-V3对低一致样本做多维语义漂移,负责突破中性边界提出多样情感假设,其多候选假设全部送入裁判模型。最后由裁判模型逐候选验声并按漂移大于精炼大于原始的优先级重排过滤,负责保留可验证的丰富描述并丢弃冲突样本。与单向文本扩增和视觉转写主导标注相比,该假设验证机制把生成与验证解耦,避免词汇与视觉模态压制声学证据。在12,000样本下游有监督微调对比评测下,本文方法的Gemini 2.5 Pro Win Rate为66.15%,高于未精炼基线的Gemini 2.5 Pro Win Rate 29.23%。该结论目前仅在 29530 片自采语料与模型内评测上验证,未检验跨语种跨场景泛化与语音合成等下游增益。原文未披露训练推理成本与数据丢弃率细节。该结论的适用边界受限于上述语料与模型内评测,跨场景外推尚未验证;原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
870. 小参数如何听清混合声音:按意图过滤再做全局缩放的音频推理
英文题目:TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints
标签:#注意力机制 #音频大模型 #高效推理 #零样本 #音频问答
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#音频问答 | 主方法:#注意力机制
👥 作者与机构
- Vinh-Thuan Ly:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向资源受限音频推理,模型需从语音、环境声与音乐交叠的长时信号中回答多跳问题,难点在于紧凑语言模型易被无关声事件淹没且难以维持长叙事链。本文提出意图感知特征精炼框架:三流前端先并行抽取细粒度语音、事件级与全局语义表示并对齐为固定长度序列。E-Branchformer编码器再联合建模局部瞬态与长程依赖,用户意图向量随后经交叉注意力残差增强任务相关片段,对比语言音频预训练Contrastive Language-Audio Pretraining即CLAP锚点最后经门控仿射调制注入全局先验。该链条把被动投影改为主动按问过滤,使小语言模型Small Language Model即SLM只处理已提纯表征并按思维链Chain-of-Thought即CoT格式输出。在MMAR零样本评测中该1.5B系统取得46.4%平均准确率,显著高于多个7B至13B传统基线,但在超密集混合与空间解析任务上出现回退,且长推理叙事能力仍弱于30B以上系统。训练使用单卡A100,推理约需5GB显存,原文未披露具体训练时长与端侧实测延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
871. 不改模型也能做流式:用滑动窗口加文本发射策略把基础语音模型包成黑盒
英文题目:Improving streaming ASR with foundation models using emission policies
标签:#评测协议 #语音大模型 #流式处理 #语音识别
评分:6.0/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#评测协议
👥 作者与机构
- Gerard Mas Mollà:机构信息未能从会议 PDF 纯文本可靠映射
- Albert Sanchis:机构信息未能从会议 PDF 纯文本可靠映射
- Alfons Juan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
离线语音基础模型(Speech Foundation Model,SFM)在流式自动语音识别(Automatic Speech Recognition,ASR)中因上下文受限而退化,如何在不读取模型内部张量、不训练的前提下实现低延迟高精度转写是本文任务。方法链分三步衔接:滑动音频缓冲(Sliding Audio Buffer)先按固定切块长度 `\(L\_c\)` 累积音频,达到最大窗口 `\(L\_\{max\}\)` 后维持固定长度滑动窗口并送入黑盒模型得到词级转写与时间戳;基于时间戳的去重模块(Repetition Control)以已提交词的最后时间戳 `\(T\_\{last\}\)` 为界过滤重叠历史词,保证时间单调推进;发射策略(Emission Policy)模块再对候选缓冲决定延迟发射以抑制闪烁(Flickering)并输出稳定文本。与依赖注意力或对齐头的模型感知策略不同,本文仅用文本与时间戳做判决,因而可跨架构复用且无需训练。在 Earnings22 上 Parakeet-v3 流式基线词错率(Word Error Rate,WER)为 25.35%,LocalAgreement(LA)策略将其降至 11.45%且延迟约 2.25 秒,接近同模型 11.19%的离线水平;TedLium-v3 从 17.16%降至 3.00%,VoxPopuli 从 10.24%降至 6.40%。该结论目前仅在三套英文朗读与会议类数据上验证,未覆盖噪声、重叠语音、多语及长尾口音的外推情形。原文未披露训练成本,推理仅说明在 NVIDIA RTX 4090加 Intel Core 10920X 节点上评测。
🔗 开源资源
- 代码相关资源:https://github.com/germol00/streaming — 链接不可用(HTTP 404)
- 模型相关资源:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3 — 暂时无法访问
- 模型相关资源:https://huggingface.co/nvidia/canary-1b-v2 — 暂时无法访问
- 第三方资源:https://github.com/NVIDIA/NeMo → https://github.com/NVIDIA-NeMo/Speech — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
872. 补回丢失信息时,发音内容为何会被改写:发音合成中的特征与生成建模
英文题目:Feature Design and Generative Modelling in Deep Articulatory Synthesis
标签:#流匹配 #模型评估 #发声与构音 #语音合成
评分:6.0/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#流匹配
👥 作者与机构
- Charles McGhee:机构信息未能从会议 PDF 纯文本可靠映射
- Mark J.F. Gales:机构信息未能从会议 PDF 纯文本可靠映射
- Kate Knill:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音合成需从发音反演得到的低维发音轨迹重建语音,难点在于跨说话人一致性反演表示已剥离基频、能量、音色与韵律,直接合成频谱模糊且机械感重。先以14维发音表示ArtVVN为输入,该步负责以舌体唇下颌关节点及发声鼻音主成分保持跨说话人音位一致,输出剥离语调与音色的纯发音轨迹。再将该轨迹与对数归一化到0至1的基频短时能量及预训练说话人验证模型嵌入拼接,该步负责显式补回韵律与音色,输出增强声学条件。最后将增强声学条件送入Conformer回归器或扩散Transformer条件流匹配模型生成梅尔谱,并将梅尔谱送入冻结BigVGAN Base声码器输出波形,其中流匹配以欧拉求解器函数求值次数调节保真与多样性。与直接确定性回归相比,生成式建模从数据中学习韵律分布而非依赖可能受噪污染的源特征。在VCTK噪声子集评测设置下,仅用发音的Base级联模型的PER为15.0,低于使用SPARC未归一化源特征的同架构模型的PER 29.1。该结论限于英语LibriTTS-R训练与小模型区间,未验证大规模数据下生成模型能否同时兼顾可懂度、音质与说话人还原。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://artsynth.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
873. 预训练记得旧音素,为何学不会新音素:语音合成中音素增加的对照检验
英文题目:Exploring Pre-training Benefits on Phoneme Addition through Fine-tuning in Speech Synthesis
标签:#迁移学习 #跨语言 #低资源 #预训练 #文本到语音
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#迁移学习
👥 作者与机构
- Masato Murata:机构信息未能从会议 PDF 纯文本可靠映射
- Koichi Miyazaki:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Koriyama:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Toda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源文本到语音需将预训练模型扩展到目标语未见音素,输入为目标语音素序列,输出为对应波形,难点在于新增嵌入随机初始化且小数据下声学映射易混淆语言与说话人因素。本文先用大语言模型生成受控英文文本并经espeak-ng转写为国际音标过滤,得到排除目标音素的有限集与包含全音素的完整集,分别用于预训练与微调。再用同一基于VCTK训练的Conformer-FastSpeech2管线合成配对语音以隔离声学条件,并对比朴素微调与从零训练在多档数据量下的目标音素错误率与自然度。与已有跨语言迁移只报整体自然度提升不同,本文将音素增加单独度量,揭示声学先验与新音素学习解耦,微调自然度占优但新音素学习需同等或更多数据。在英语到日语跨语言场景评测下,100、300和500话语条件下微调的目标音素错误率高于从零训练的目标音素错误率,而微调的自然度得分高于从零训练的自然度得分。适用边界为单说话人微调与朴素嵌入扩展,未验证大规模多语预训练、音素映射初始化及主观听感外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
874. 固定取一层不够:让 Whisper 编码器与解码器各层自适应加权做句重音检测
英文题目:WhiSSDapt: Adaptive Fusion of Whisper Layer Embeddings for Sentence Stress Detection
标签:#模型融合 #可解释性 #韵律 #语音 #语音属性识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#模型融合
👥 作者与机构
- Someshwaran Murugaiyan:机构信息未能从会议 PDF 纯文本可靠映射
- Jhansi Mallela:机构信息未能从会议 PDF 纯文本可靠映射
- Chiranjeevi Yarra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
句子重读检测任务输入为连续语音与参考文本转录,输出为每个词是否突显的二值标签,实际难点在于突显是句内相对判断且依赖局部韵律与整句语义语境,非母语发音变异与标注稀缺进一步加大跨说话人泛化难度。WhiSSDapt冻结Whisper-small英文版骨干,对编码器与解码器全部层学习温度Softmax加权求和得到两路聚合表征。再以加权解码器表征为查询、加权编码器表征为键值送入新增Whisper解码器块做交叉注意力融合。随后经两层前馈网络做词元级二分类并映射为词级标签,训练仅更新层权重、新增解码器块与分类头并用加权交叉熵缓解类别不均衡。在 ISLE 德语非母语朗读上词级 F1-score 为 0.853,相对固定第 9 层基线 WhiStress 的 0.804 提升约 6.09%;在合成 EmphAsses 上为 0.9811,相对 0.939 提升约 4.48%。与固定取第9层做上下文的WhiStress不同,该方法同时自动化学习编码器与解码器跨层组合,权重分析发现解码器第9层与编码器第12层为跨数据集锚点,固定组合E(1,12)-D9接近全自适应性能。结论限于非母语朗读与受控合成英语,未验证自发对话、噪声、无参考文本与多语言韵律,原文未报告延迟与计算成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
875. 检测与转写互相约束:DysfluentNet 用冻结编码器同时学会找口吃与写出口吃
标签:#CTC #课程学习 #多任务学习 #语音识别 #病理语音评估
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#多任务学习
👥 作者与机构
- Mohankumar Muthu:机构信息未能从会议 PDF 纯文本可靠映射
- Sasikala E:机构信息未能从会议 PDF 纯文本可靠映射
- Girirajan S:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口吃自动分析需同时输出话语级事件类型与含口吃标记的转写文本,输入为原始波形,难点在于阻塞与音重复声学微弱、类别极不均衡且流利参考会惩罚忠实转写。方法分四步衔接:第一步冻结WavLM-Large并以可学习权重融合24层表征,输出统一帧级特征以兼顾高层语义与中层音素信息。第二步将该融合特征送入注意力统计池化多标签检测头,以焦点损失输出六类口吃事件对数几率作为全局先验。第三步把检测对数几率经交叉注意力门控注入双向长短期记忆解码器输入,并在扩充五个口吃标记的词表上以对齐一致性约束的口吃感知连接时序分类目标约束标记发射位置。第四步按三标注者Fleiss Kappa将训练集分五档由易到难逐档扩大训练集,待覆盖全量后再持续训练至早停。在SEP-28k测试集上宏观F1达到72.4%,在FluencyBank上口吃包容词错误率降至18.3%,均超越所列最强基线。结论限于英语朗读与播客短片段,未验证多语言、重度口吃与实时交互场景。原文未披露训练时长、推理时延与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
876. 会双语却写不出混说:用偏好对齐逼音频大模型保留原语言
英文题目:Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs
标签:#偏好优化 #音频大模型 #多语言 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#偏好优化
👥 作者与机构
- Trung Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Cheng Yi Lewis Won:机构信息未能从会议 PDF 纯文本可靠映射
- Minh Duc Pham:机构信息未能从会议 PDF 纯文本可靠映射
- Yingxu He:机构信息未能从会议 PDF 纯文本可靠映射
- Shuo Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Ai Ti Aw:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为英汉混杂语音并要求输出逐字转写,难点在于多语言音频大模型虽能单语识别,却常将混杂内容整体翻译、丢弃一侧语言或产生重复幻觉。方法链分三步:先以真实语码切换转写为偏好正样本,再用文本大模型对同一转写做全局与局部翻译以合成模仿失败的负样本,最后以直接偏好优化拉大正负样本似然差来约束转写行为。训练基于约十万偏好对并在中英文多种转写指令提示下随机采样,以避免过拟合单一模板并稳定混合语言生成。与以往扩充语码切换监督数据或改进编码解码结构不同,该方法不增加新声学知识,而是唤醒模型已有的多语言能力并强化保留语言构成的指令遵循。分布内评测中Phi-4-multimodal-instruct在EMILIA-test上混合错误率由70.98%降至7.38%,分布外评测中Qwen2-Audio-7B-Instruct在SEAME dev man上相对降低20.0%。结论目前仅限于英汉语码切换转写,未验证其他语言对、其他音频理解任务及长期记忆保持。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
877. 先把自己藏进声音里:无训练自嵌套如何抓住局部语音篡改
标签:#信号处理 #音频安全 #语音 #音频深度伪造检测 #音频水印
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#信号处理
👥 作者与机构
- Yigitcan Özer:机构信息未能从会议 PDF 纯文本可靠映射
- Zhe Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Wanying Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Junichi Yamagishi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
部分伪造音频的输入为除一至两个词段被替换外其余真实的语音,输出为整句真伪判决与可播放的原始内容恢复。其难点在于篡改占比越小被动检测越接近随机猜且难以定位恢复,因而需在发布前预嵌自描述信息以实现主动核验与恢复。该方法先用神经语音编解码器SNAC将载体语音压缩为自描述比特流,再以时间重复最低有效位嵌入把该比特流多份写入载体得到含水印音频。接收端经多数投票解码恢复比特流并合成参考波形,最后用动态时间规整比较接收波形与自重构的归一化梅尔对数谱差异并阈值判决。在AV-Deepfake1M验证集单字替换测试条件下,本文方法的等错误率指标为9.95%,低于LAV-DF的等错误率指标50.17%。该结论仅适用于发布前可预嵌入的协作式防护场景,对极短篡改与压缩转码等后处理尚未验证。方法本身免训练,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
878. 语言错配比性别错配更伤反演:芬兰语—俄语 EMA 上的跨域声学到发音反演基线
标签:#基准设计 #发声与构音 #跨语言 #语音 #语音属性识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#基准设计
👥 作者与机构
- Ruchi Pandey:机构信息未能从会议 PDF 纯文本可靠映射
- Tomi H. Kinnunen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声学到发音反演需从语音声学信号估计舌唇时变运动轨迹,一对多映射与跨说话人解剖差异使其在域偏移下极易退化。本文在芬兰语与俄语双语电磁发音仪语料FROST-EMA上建立标准化AAI基准,方法链分为三步:先对1250 Hz发音轨迹做插补滤波降采样与归一化并派生目标表示,再以声学前端提取帧级特征并切分为100帧窗口,最后由反演后端回归发音轨迹并以Pearson相关评价。与既往混杂录音协议的跨语言研究不同,该设计在同一语料内独立控制跨性别与跨语言偏移,并系统比较声学前端、发音目标表示与反演后端。在留一说话人跨域评测设置下,语言失配条件的Pearson相关下降Δr为≈0.10–0.20,高于性别失配条件的Pearson相关下降Δr≈0.05–0.10。舌体收缩位置等语言特异性维度退化集中于音位活跃段,而唇部维度相对稳健,使束变量表示在精度相当时提供诊断优势。该结论仅适用于母语朗读条件下的芬兰语与俄语及小规模说话人池,尚未验证第二语言与口音化语音。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
879. 一次输出五种标签加解释:联合多粒度评分如何兼顾整体与细节
英文题目:A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales
标签:#偏好优化 #音频大模型 #可解释性 #语音 #语音属性识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#偏好优化
👥 作者与机构
- Aditya Kamlesh Parikh:机构信息未能从会议 PDF 纯文本可靠映射
- Cristian Tejedor-Garcia:机构信息未能从会议 PDF 纯文本可靠映射
- Catia Cucchiarini:机构信息未能从会议 PDF 纯文本可靠映射
- Helmer Strik:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理二语朗读发音评估,输入为语音波形加正字法转写与目标音素序列,输出为句级准确度与流利度与韵律三方面等级加词级与音素级准确度序列标签及一段自由文本依据,难点在于标签严重偏向高分且细粒度错误稀少而主观依据难验证。方法链分三步推进:先以 rubric 提示词将五维标签与依据统一为固定格式单遍生成,使细粒度目标为句级判断提供接地;再以监督微调学习格式与基本映射;最后以有界直接偏好优化 Bounded Direct Preference Optimization 在正负标签对上强化 rubric 一致性并限制对近 miss 拒绝项的过度压低。与级联ASR再评分基线相比,该方法以冻结Qwen2-Audio-7B-Instruct骨干加LoRA适配单遍联合建模多粒度标签并附带依据,其细粒度错误定位能力尚未验证,训练在单块RTX A6000硬件上完成因而推理开销受限于大模型解码。在SpeechOcean762测试集下,多粒度模型BDPO-M的PCC为0.73,高于单粒度模型的PCC为0.72。依据分析显示句级情感自洽但词与音素提及稀疏且与人工标签弱对齐,表明细粒度可信度尚未成立。原文未披露训练时长、推理采样与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
880. 源数据不可见时如何合并多个语音分类器:对齐加元加权的靶向合并
英文题目:Accurate Source-Free Speech Classification via Meta-Learned Target-Centric Model Merging
标签:#领域适应 #元学习 #模型融合 #跨语言 #语音情感识别
评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#模型融合
👥 作者与机构
- Ka Hyun Park:机构信息未能从会议 PDF 纯文本可靠映射
- Junghun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- U Kang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
源无关语音分类要求在无法访问源域数据时,仅利用多个已训练源分类器和极少量带标签目标样本构建目标分类器,难点是跨语言域偏移大而目标监督极少,直接拟合易过拟合。所提MOCHEE冻结wav2vec2-XLS-R-300m编码器,只合并轻量两层MLP头,先为每个源头每层学习经Sinkhorn归一化的软置换矩阵,把隐藏单元映射到共享排序以消除置换对称。接着把对齐后参数按可学习合并权重加权平均得到目标头,权重学习不直接最小化目标训练损失,而是把目标小集合切分为训练与验证两半,在训练划分上对对齐参数做一步虚拟更新。然后在验证划分上回传元梯度优化合并权重,使权重反映泛化贡献,该设计解耦对齐与加权,并保持不更新源模型原始参数的合并效率优势。与直接平均或在目标训练损失上选权已有合并方法的关键差异是元目标直接优化验证泛化,因而在低资源目标下选择更稳健。在CAFÉ目标域测试集评测下,MOCHEE的准确率为50.85 ± 1.74,高于Re-basin + Uni.的准确率43.44 ± 0.90。结论目前仅在 CAMEO 跨语料情绪数据和冻结编码器加 MLP 头架构下验证,未证明对编码器微调、开放标签或非情绪任务的适用性。原文未披露训练与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
881. 一个短语断句可以有多种对法:用大模型造多参考来评测断句标注
英文题目:LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations
标签:#评测协议 #大语言模型 #韵律 #少样本 #文本到语音
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#评测协议
👥 作者与机构
- Younghan Park:机构信息未能从会议 PDF 纯文本可靠映射
- Hoyeon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Hawon Jeong:机构信息未能从会议 PDF 纯文本可靠映射
- Jong-Hwan Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
短语断句预测(phrase break prediction)需为词序列输出无边界与多级韵律边界序列,难点是同一语句存在多种自然合法切分而单参考评测会误拒有效变体。本文提出基于大语言模型的多参考评测(LLM-based Multi-Reference Evaluation / LMRE),先从专家标注池中反复采样少样本示例并批量查询模型以生成候选标注,再经频次过滤建成可复用的多参考查找表。评测时将待测标注与该语句下全部参考比较取最大相似度并经阈值判定接受与否,从而把一对多容忍显式编码进自动流程。与单参考精确匹配和直接用模型当裁判相比,该机制用确定性检索替代黑盒打分,兼顾可复现性与多样性覆盖。在韩语多策略测试集上多参考 F1 与人类五分制评分的皮尔逊相关达到 0.621,明显高于单参考的 0.505,且在可接受组大幅缩小接受率差距。该结论目前仅在韩语和有限文本类型上验证,对长句之外的语种迁移和参考噪声控制尚未充分检验。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
882. 元训练与元测试梯度打架时:用不对称投影保住适应的方向
标签:#元学习 #鲁棒性 #语音 #音频深度伪造检测
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#元学习
👥 作者与机构
- Siqing Qin:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Youzhi Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
- Man-Wai Mak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造检测输入为待判语音波形,输出为真伪二分类分数,核心难点是训练攻击与未见攻击、编解码传输与野外采集之间存在严重域偏移。该工作第一步将22类源攻击域随机划分为元训练域与元测试域,在元训练损失上内循环一步适配并在适配参数上计算元测试损失,形成模拟域偏移的双层目标。第二步监控元训练梯度与元测试梯度的内积判定冲突,非冲突时直接相加,冲突时将元测试梯度向元训练梯度法平面做非对称投影,仅保留正交或正向分量以保证更新无冲突。层级变体对每个可训练层独立计算余弦相似度,只对瞬时冲突层执行同式手术。与 PCGrad、GradVac、CAGrad 等对称手术不同,该设计固定元训练梯度为锚点以保留域适应信号,仅清洗泛化梯度的破坏分量。在 ASVspoof 2021 DF、ASVspoof 5、CFAD 未见集、ADD 2023 R1/R2、In-the-wild、CodecFake 共 7 个评测集上,DGS-MLDG 与 LW-DGS-MLDG 相对经验风险最小化(Empirical Risk Minimization,ERM)基线取得 5.29% 与 4.04% 的跨集平均等错误率相对下降。在In-the-wild评测设置下,DGS-MLDG的等错误率为5.23%,低于ERM基线的等错误率6.71%。该结论限于三源库联合训练与 XLSR-Mamba 后端,在单源域、非自监督后端或强对抗攻击下的外推尚未验证。原文未披露训练推理成本与开源产物。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
883. 说太快听不懂、说太简单不想练:用流利度把词汇和语速同时调准
英文题目:AdaptLingo: A Speech-to-Speech English Practice System with Fluency-Adaptive Responses
标签:#教育 #检索增强 #用户研究 #语音 #语音对话系统
评分:6.0/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音对话系统 | 主方法:#检索增强
👥 作者与机构
- Zackary Rackauckas:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
AdaptLingo 面向第二语言英语口语练习,输入为学习者麦克风语音,输出为文本与语音双通道回复,难点在于初学者易被复杂词汇与快语速淹没而高水平者又厌倦简化对话。系统先将录音转标准波形并做静音裁剪与归一化,再以 Praat 音节核检测脚本提取发音速率与言语速率两维时间声学特征,经随机森林预测初、中、高三档流利度,该标签随即决定 EIKEN 词表子集选择与检索增强生成约束,并联动 gpt-4o-mini-tts 的合成语速。相较静态难度对话系统,其差异在于用声学预测显式驱动词汇检索加 logits 偏置与语速档位,而非仅靠提示词软约束。在标注流利度数据集上分类达到 95% 测试宏 F1,而在噪声用户研究语音上准确率仅为 47%,日语母语 10 人中有 15 个问卷条目偏好自适应系统,而普通话与西班牙语组多数条目偏好基线。该结论仅适用于短轮次日常话题与小样本组内比较,跨口音泛化与长期学习增益尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/zackrack/AdaptLingo — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
884. 平均分并不中立:低质语音中放大的性别打分差与可学习的性别感知模型
英文题目:MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment
标签:#多任务学习 #统计分析 #公平性 #语音 #语音质量评估
评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#多任务学习
👥 作者与机构
- Wenze Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Yi-Cheng Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Wen-Chin Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Erica Cooper:机构信息未能从会议 PDF 纯文本可靠映射
- Ryandhimas Zezario:机构信息未能从会议 PDF 纯文本可靠映射
- Hsin-Min Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理合成语音与转换语音的语音质量评估,输入为待评波形,输出为人类感知质量分,难点是听众性别带来的系统性差异被简单平均掩盖。该掩盖使聚合标签偏向一方感知标准且幅度随整体质量变化,难以用固定校准消除。方法链分三步:第一步在BVCC训练集上按听众性别乘说话人性别统计评分均值与标准差以刻画分布,第二步承接该分布做Welch t检验验证差异显著性并按整体MOS四档(1-2、2-3、3-4、4-5)量化男女均值差随质量收窄的规律。第三步将上述分组规律转为监督信号,构建共享自监督学习(Self-Supervised Learning,SSL)编码器加均值分支与性别分支的联合模型,同时拟合整体真值、男性组真值与女性组真值。相比直接拼接性别标签或为男女各训独立模型,该设计用取值为0与1的抽象二元组嵌入作为条件信号,共享编码器保留全量数据表示,两分支分离偏好。在 BVCC 测试集3个随机种子(1337、2337、3337)平均下,性别感知模型的均值分支在话语级将线性相关系数(Linear Correlation Coefficient,LCC)从 0.853 提升至 0.862,均方误差(Mean Squared Error,MSE)从 0.290 降至 0.239;基线同一预测对照男性真值话语级 MSE 为 0.372,对照女性真值为 0.430,系统级为 0.141 对 0.194,相对差距 37.6%。结论目前仅在 BVCC 英语合成语音、二元性别划分与 SSL-MOS 框架下成立,未验证跨数据集、跨语言与缓解后公平收益,原文未披露训练推理成本与开源产物。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
885. 微调配比动不了的偏差,从头训练却能翻转:预训练表征如何掩盖性别构成效应
英文题目:Gender Bias in ASR: A Controlled Study of Gender Composition Across Training Paradigms
标签:#SFT #模型比较 #公平性 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#SFT
👥 作者与机构
- Seshan S:机构信息未能从会议 PDF 纯文本可靠映射
- Murali Kadambi:机构信息未能从会议 PDF 纯文本可靠映射
- Amartya Veer:机构信息未能从会议 PDF 纯文本可靠映射
- Prasanta Kumar Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理语音识别中的性别差异,输入为不同性别构成的训练语音,输出为分性别的词错误率与人口学差异分数,难点是预训练带来的未知性别分布会混杂微调阶段的构成效应。方法链分三步:先按女性占比0%至100%以10%步长构造11种训练划分并固定测试集,再对3个预训练模型做监督微调同时对混合模型做从零训练,最后按性别分组计算词错误率与人口学差异分数以对比构成敏感性。与已有微调研究的关键机制差异是引入完全受控的从零训练参照,从而分离预训练表征稳定性和微调数据构成的影响。在Indic TIMIT评测设置下,从零Kaldi系统在全男性训练时的人口学差异分数为+43.1,高于全女性训练时的人口学差异分数-37.2,而3个预训练系统波动基本在正负12以内且无单调趋势。结论边界限于英语朗读与众包语音、二元性别标注和71.36小时量级训练,不支持向非二元性别、多语言或大规模持续预训练外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
886. 听起来很顺却说错了话:离散野外合成让客观 MOS 失灵
标签:#统计分析 #主观评测 #语音 #语音质量评估
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音质量评估 | 主方法:#主观评测
👥 作者与机构
- Jasmer Sanjotra:机构信息未能从会议 PDF 纯文本可靠映射
- Nagendra Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Shekhar Nayak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为相同文本与说话人提示下的4类语音输出,输出为人类自然度平均意见得分(Mean Opinion Score,MOS)与客观MOS预测值的系统级排序与文件级相关性,难点在于野外(In-The-Wild,ITW)离散token合成会产生频谱光滑但语义损坏的错误。方法链分4步推进:先以连续干净系统StyleTTS 2作锚点、以离散ITW系统MQTTS作目标并配加性巴布尔噪声控制与真实录音上界构造可比语料,再经耳机筛查的绝对类别评分(Absolute Category Rating,ACR)流程收集768个人类评分并用线性混合效应模型估计系统效应,随后用VERSA工具包以无参考方式计算UTMOSv2与DNSMOS等5个指标,最后做分系统Pearson与Spearman相关及Steiger依赖相关检验以判定崩塌。与已有验证只覆盖干净连续合成不同,该设计的关键差异是把加性失真与生成性语义失真解耦,从而暴露指标只感知频谱表面质量的机制盲区。在分系统文件级相关评测条件下,连续干净系统UTMOSv2的Pearson为0.51,高于离散ITW系统UTMOSv2的Pearson -0.01。结论仅适用于具有token重复与韵律反转类伪影的MQTTS扩展架构,未验证VALL-E等其他离散架构与多语言大规模场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
887. 近似注意力失焦时:用双向状态空间替换快速注意力的生成式增强
标签:#Conformer #生成模型 #状态空间模型 #向量量化 #语音增强
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#状态空间模型
👥 作者与机构
- Shogo Seki:机构信息未能从会议 PDF 纯文本可靠映射
- Shaoxiang Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Li Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
高保真生成式语音增强需从带噪混响输入恢复缺失细节,离散神经编解码器码元建模进一步放大长序列全局依赖与局部声学细节的矛盾。本文基于Genhancer管线:先由Descript Audio Codec编码器得到带噪码元并反量化为嵌入,经潜在去噪器得到去噪条件特征并可与WavLM自监督特征融合,再由码元生成器并行自回归预测干净码元,最后由解码器重建波形。原骨干DF-Conformer用正交随机特征快速注意力FAVOR+近似Softmax并用空洞卷积扩大局部感受野,本文提出DC-Hydra变体,保留空洞卷积,将全局分支替换为双向选择性状态空间模型Hydra,以准可分矩阵混合器实现无近似的线性复杂度建模。在DAPS数据集评测设置下,Hydra的NISQA指标为4.81,高于FAVOR+的NISQA指标4.76。该结论仅在 LibriTTS-R 训练加 DAPS 评测、8 秒切块推理的固定流程下验证,对多语言、强非平稳噪声、流式因果与主观听感的外推尚未证明。跨语种与流式因果场景的外推适用边界尚未验证。原文未报告延迟吞吐与显著性检验。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
888. 把水印藏进音素稳态区:能跟随克隆迁移的 Mamba 主动防御
英文题目:Phoneme-Aware Mamba Watermark: An Active Defense System Against Purified Speech Deepfakes
标签:#对抗训练 #状态空间模型 #对抗鲁棒性 #语音 #音频水印
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频水印 | 主方法:#状态空间模型
👥 作者与机构
- Yanda Shao:机构信息未能从会议 PDF 纯文本可靠映射
- Mengke Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhixin Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Tianyi Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音主动防御中的可溯源水印任务,输入为 16 kHz 原始波形与 16 位说话人身份码,输出为不可感知的水印语音,要求水印在语音克隆与扩散纯化后仍可被解码溯源,难点在于表层对抗扰动易被 PhonePuRe 类两阶段波形扩散去噪加谱细化擦除。方法链分为三步:冻结 XLS-R 300M 提取语境表征 \(H\) 并经 Mamba 系编码器生成频谱扰动,再由 Montreal Forced Aligner(蒙特利尔强制对齐器,MFA)边界与预计算音素平均谱字典构造的稳定性掩膜 \(M&\#40;f,t&\#41;\) 约束扰动集中于 100-1000 Hz 共振峰稳态区,最后经可微纯化对抗微调与 8 层 CNN 解码器实现 1 秒分块多数投票溯源。与 AntiFake 与 VoiceGuard 类只破坏合成的不可溯源扰动不同,该机制把载体从易擦除噪声转为克隆为保可懂度必须保留的音素声学结构。在 LibriSpeech train-clean-100 训练、PhonePuRe 纯化评测下,多头 Mamba 对抗微调后原始准确率 91.56%、纯化准确率 84.55%、保持率 92.34%;在 11 名 VCTK 说话人共 165 条 YourTTS 与 sv2TTS 克隆语音上溯源真阳性率约 99.9%-100.0%,未检出伪造长度约 1.0 秒,SNR 超 34 dB、PESQ 高于 3.5。结论仅在英语干净朗读、单一纯化器与旧克隆管线下验证,对扩散声码器新变体、噪声混响与跨语言迁移尚未验证。原文未披露训练与推理硬件成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
889. 先重采样到 48 kHz 再补高频:LavaSR 用单声码器做任意带宽扩展
英文题目:LavaSR: Fast and Flexible Audio Bandwidth Extension via Vocos
标签:#生成对抗网络 #时频分析 #高效推理 #语音 #语音超分
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音超分 | 主方法:#生成对抗网络
👥 作者与机构
- Yatharth Sharma:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
带宽扩展的输入是降采样至8 kHz至48 kHz区间的限带语音,输出是恢复至48 kHz的宽带波形,难点是高频缺失需幻觉生成而已有低频必须严格保真。方法链分三步:先用sinc插值将任意输入重采样至48 kHz固定网格,把变采样率问题转为固定网格频谱补全;再由8层ConvNeXt骨干从80维梅尔谱同步预测复数短时傅里叶变换系数并经逆变换合成波形;最后用平滑交叉掩膜将原始低频锚与生成高频融合以消除接缝。与固定比率双分支的AP-BWE和迭代采样的AudioSR相比,该机制以单网络统一任意比率并省去多尺度流水线。在VCTK验证集8 kHz到48 kHz设置下,对数谱距离为0.85,优于AudioSR的1.61和NVSR的1.22,与AP-BWE的0.87相当,感知质量ViSQOL为3.51与AP-BWE持平,时域SI-SDR为18.02 dB略低于AP-BWE的18.77 dB。A100上批量32时实时率为0.0001约12549倍实时,8核CPU上为0.0053约190.5倍实时。结论仅限于干净英文朗读语音,未验证噪声、音乐、编解码失真及主观听感外推。原文未披露训练硬件、总步数与损失权重,未给出代码权重链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
890. 只增强目标情感不够:用对比分支在去噪中拉开情感距离
英文题目:Emo-BPO: Emotion Bidirectional Preference Optimization for Diffusion-based Emotional TTS
标签:#扩散模型 #偏好优化 #语音 #文本到语音
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#偏好优化
👥 作者与机构
- Jiacheng Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Hongfei Du:机构信息未能从会议 PDF 纯文本可靠映射
- Xinyuan Song:机构信息未能从会议 PDF 纯文本可靠映射
- Y. Alicia Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Yanfu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Ye Gao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
情感文本到语音需由文本生成可懂且情绪可控的语音,难点在于重音、语调与节奏在连续情绪空间中交织且多情绪轨迹易混淆。情感双向偏好优化先对同文本不同情绪语音构造顺序相反的偏好对子,分别监督目标情绪与竞争情绪。接着以两个独立扩散去噪分支分别学习情绪对齐与情绪对比得分场,前者拉向目标情绪,后者建模远离方向。推理时两分支按对比引导公式融合,并随去噪进程由弱到强施加晚期调度以保护早期声学结构。与仅增强目标条件的Emo-DPO等方法不同,该方法把参考条件由无条件替换为竞争情绪,显式放大情绪间间隔。在ESD英语子集与EmoVoiceDB混合评测下,Emo-BPO的指标Emo SIM为99.23,高于EmoVoice的指标Emo SIM 98.59。该结论限于英语5类离散情绪与Grad-TTS加HiFi-GAN链路,未验证零样本说话人、开放情绪描述与真实对话场景。原文未披露训练、推理或部署成本,仅提供在线试听页面。
🔗 开源资源
- 演示资源:https://jiachengqaq.github.io/emo-bpo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
891. 只录一句话,能否让构音障碍语音识别学到有用的变体
英文题目:Low-Burden Data Augmentation for Dysarthric ASR via Zero-Shot Voice Cloning
标签:#数据增强 #零样本 #语音识别 #语音克隆
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#数据增强
👥 作者与机构
- Satwinder Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Qianli Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zihan Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Clarion Mendes:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Hasegawa-Johnson:机构信息未能从会议 PDF 纯文本可靠映射
- Waleed Abdulla:机构信息未能从会议 PDF 纯文本可靠映射
- Seyed Reza Shahamiri:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍语音识别任务以病理说话人的连续语音为输入、输出对应文本转写,实际难点在于构音、节奏与发声系统性畸变叠加病因与严重度差异,导致说话人间与说话人内变异大而可训练数据极稀缺。方法链分三步:先为每名TORGO说话人选取平均约7.2秒的单句富含音素参考音频以锁定障碍音色;再以过滤后的LibriSpeech 100h域外文本为内容提示调用Higgs Audio V2批量合成18小时TORGO-Synth并隔离测试词表防泄漏;最后用克隆、真实及混合数据分别微调Whisper-medium并在留出真实语音上对比词错率与跨库迁移。与需多句注册或说话人微调的传统合成扩增不同,该机制免微调复用典型语音训练的克隆模型,检验其能否保留可迁移的障碍声学线索,从而以极低采集负担提供词汇多样且病理保真的训练信号。在TORGO上克隆微调将词错率从31.62%降至26.00%,接近真实微调的24.44%,并在SAP-1102上从14.50%降至12.84%。该结论主要适用于重度与中重度障碍及以脑性瘫痪为主的分布,对轻度与中度高可懂度语音可能失效或退化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/boson-ai/higgs-audio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
892. 在没有转写时如何证明自发语音语料可用:喜马拉雅四语的采集与验证
标签:#数据集 #数据集构建 #低资源 #多语言 #语言识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语言识别 | 主方法:#数据集构建
👥 作者与机构
- Abhijit Sinha:机构信息未能从会议 PDF 纯文本可靠映射
- Subham Kutum:机构信息未能从会议 PDF 纯文本可靠映射
- Udara Laxman Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Paban Sapkota:机构信息未能从会议 PDF 纯文本可靠映射
- Hemant Kumar Kathania:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源喜马拉雅语言的计算建模难点在于缺乏统一采集的自发语音,输入为自然室内环境下的自由独白,输出为可支撑跨语言比较与建模的结构化语料。方法链分为四步:先通过社区招募筛选320名母语者并签署知情同意,输出匿名化说话人集合,每语种80人,再以无脚本独白方式完成每人5次录制,平均每次约5.5分钟,每人约27-28分钟,总计146小时,随后按语言分层组织目录与元数据以支持说话人无关划分,最后用声学分布分析与语言识别验证语言可分性。相比以往小规模或条件不一致的采集,该工作以跨语系与声调类型覆盖结合统一元数据框架为机制差异,使区域内比较成为可能。在说话人无关80/20划分下,40维梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients,MFCC)与韵律能量融合的卷积神经网络(Convolutional Neural Network,CNN)在四语言识别上达到92.95%准确率,显著高于单用音高轮廓的56.86%。结论仅适用于转写缺失下的声学可分性验证,未验证自动语音识别或跨方言泛化等外推场景。原文未披露训练、推理或部署成本,未提供数据与代码获取方式。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
893. 训练只见过同一个人说话,测试却要换音色:CFLOW-VC 用可逆流做循环训练
英文题目:CFLOW-VC: An unsupervised cycle training strategy based on normalizing flows for Voice Conversion
标签:#数据增强 #无监督学习 #鲁棒性 #语音 #语音转换
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.5/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#无监督学习
👥 作者与机构
- FeiBao Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非平行语音转换(Voice Conversion,VC)需保留源内容同时替换目标音色,训练时内容与音色同源而推理时跨说话人组合,导致解耦失配与泛化下降。该文以端到端 VITS 框架的 FreeVC 为骨干,提出 CFLOW-VC:先验侧由 WavLM 自监督特征与梅尔风格编码器(Mel-Style Encoder)特征经先验编码器得到高斯先验并用梯度反转层(Gradient Reversal Layer,GRL)做说话人分类去音色,后验侧由线性频谱与说话人编码器特征经后验编码器得到高斯后验,二者由可逆归一化流(Flow)双向映射,解码器 HiFiGAN 仅由循环后验重建波形。为模拟推理期未见组合,引入额外目标样本构成先验到后验再到先验的循环训练策略(Cycle Training Strategy,CTS),并以星形判别器(Star Discriminator)对抗损失、双向 KL 损失、循环 KL 损失与 HiFiGAN 重建损失联合约束。在 VCTK 训练、LibriTTS test-clean 中 6 源转 VCTK 10 目标的干净条件下,CFLOW-VC 以 73.50% SIM 与 3.948 UTMOS 超过 FreeVC 的 65.51% 与 3.712,WER 为 4.96% 略高于 FreeVC 的 4.61%;噪声下 WER 12.09% 相对 FreeVC 的 25.04% 近乎减半。该结论限于 VCTK 训练的英语任意到任意短句转换及客观三指标与 30 人 MOS,未验证长音频、跨语言、歌唱与强混响稳定性。原文披露 4 卡 NVIDIA 4090 预训练 500k 步加冻结后验编码器与解码器后循环微调 200k 步,批量 64,未披露参数量与推理时延。
🔗 开源资源
- 演示资源:https://bigdan12.github.io/CFLOW_VC_demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
894. 能听出杂音却听不出读错重音:平均意见分预测在声学与韵律上的双重分离
标签:#主观评测 #模型评估 #韵律 #语音 #语音质量评估
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音质量评估 | 主方法:#主观评测
👥 作者与机构
- Masato Takagi:机构信息未能从会议 PDF 纯文本可靠映射
- Masaya Kawamura:机构信息未能从会议 PDF 纯文本可靠映射
- Reo Shimizu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuma Shirahata:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入是自然与合成日语语音,输出是人类平均意见分(Mean Opinion Score,MOS)与6种模型预测分的敏感性对比,难点在于标量MOS把声学保真度、韵律正确性与说话人特性压缩为一维而掩盖分歧。方法链分三步推进:先在JVS语料上构造削波、粉红噪声与MP3压缩的声学退化组以检验H1,再用可控声调的NANSY-TTS系统翻转重音短语生成韵律错误组以检验H2,最后用自然多说话人与基频(Fundamental Frequency,F0)及语速人工缩放组检验H3。关键机制差异在于受控扰动实现了解耦归因,而非依赖野外文本到语音(Text-to-Speech,TTS)样本的相关性分析。主观评测由15名日语母语者对全部656个样本按自然度打分并取平均,客观评测经VERSA统一调用6个模型完成,两路结果按条件对齐后比较均值变化与排序相关性。在韵律错误评测条件下,High重音错误条件的人类MOS得分为2.16,低于None基线条件的人类MOS得分4.00,而所有模型预测分变化不足0.10,揭示了声学之外的盲区。结论仅适用于日语重音感知与所测6模型,不宜外推至英语重音语言或未测模型。其适用边界受限于日语重音体系与所测模型范围,跨语言韵律与真实野外退化场景尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
895. 口吃语音研究为何总对不上用的人:从 228 篇文献与 70 位利益相关者看错位
英文题目:Aligning Stuttered-Speech Research with End-User Needs: Scoping Review, Survey, and Guidelines
标签:#系统综述 #用户研究 #语音识别 #病理语音评估
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:综述 | 主任务:#病理语音评估 | 主方法:#系统综述
👥 作者与机构
- Hawau Olamide Toyin:机构信息未能从会议 PDF 纯文本可靠映射
- Mutiah Apampa:机构信息未能从会议 PDF 纯文本可靠映射
- Toluwani Aremu:机构信息未能从会议 PDF 纯文本可靠映射
- Humaid Alblooshi:机构信息未能从会议 PDF 纯文本可靠映射
- Ana Rita Valente:机构信息未能从会议 PDF 纯文本可靠映射
- Gonçalo Leal:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengjun Yue:机构信息未能从会议 PDF 纯文本可靠映射
- Zeerak Talat:机构信息未能从会议 PDF 纯文本可靠映射
- Hanan Aldarmaki:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理口吃语音技术与终端需求脱节问题,输入为真实口吃音频与临床决策场景,输出需同时兼顾日常沟通支持与临床记录评估两种冲突目标,难点在于口吃事件多维多模态且随说话人、情境、对话伙伴剧烈变化。方法链分三步:先做范围综述构建228篇文献库并按自研分类体系标注研究方向与语言覆盖与利益相关者参与及开放情况,其输出的分布缺口直接决定问卷设计;再与言语语言病理学家共创双问卷分别采集40名口吃者与30名言语语言病理学家的偏好与挑战,其输出的偏好排序进入下一步对照;最后对比文献重心与问卷偏好提炼错位并形成多维指南。与既有单点用户感知调查不同,该工作把意图型识别与逐字型识别以及片段级分类与时序检测显式拆为独立评估对象,使基准选择直接对应不同用户价值,文献侧口吃辨识主导而用户侧更需定位事件时机的错位因此得以显现。在文献语料基准任务下,单语研究的计数指标为183篇,高于多语研究的计数指标25篇。结论的适用边界受限于以英语为中心的已发表文献与特定临床网络招募样本,低资源语言临床部署与纵向疗效验证等外推范围尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
896. 让 Whisper 边转写边标假词:只改标注不改模型的低成本尝试
英文题目:Deepfake Word Detection by Next-token Prediction using Fine-tuned Whisper
标签:#SFT #语音 #语音识别 #音频深度伪造检测
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#SFT
👥 作者与机构
- Hoan My Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wanying Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Xuechen Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Junichi Yamagishi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为个别词被替换为合成语音的部分伪造话语,要求同时输出完整转写文本与每个词的真假判定,难点在于篡改片段短且与真实上下文衔接自然,传统整句二分类无法定位。该方法先用WhisperX获得词级对齐并构造含标记的训练文本对,再对选中词做声码器复制合成并用交叠相加回贴以保证边界平滑,随后在被选词前后插入复用词元构成扩展序列,最后对Whisper Large v3整体微调以联合预测文本与标记,解码时解析标记对判定合成词。相比增加分类头与多任务损失的定位方案,该方法无需改动架构与训练算法,将检测转化为语言建模问题,可直接复用现有识别系统。在E.TTS测试集下,Ft.TTS微调Whisper的WER为2.20%,低于预训练Whisper的WER 8.13%。其适用边界受限于训练与测试在领域和合成方式上匹配,跨合成器与跨域时检测与转写均显著退化,声码器数据未能弥合真实生成模型的差异。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/RVC-Boss/GPT-SoVITS — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/jitsi/jiwer — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
897. 重建越好表示越碎:解耦音频编码器的稳定性代价
英文题目:Representational Instability in Decoupled Audio Encoders
标签:#评测协议 #鲁棒性 #多语言 #音频编码
评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频编码 | 主方法:#评测协议
👥 作者与机构
- Ehsan Variani:机构信息未能从会议 PDF 纯文本可靠映射
- Tom Bagby:机构信息未能从会议 PDF 纯文本可靠映射
- Georg Heigold:机构信息未能从会议 PDF 纯文本可靠映射
- Ke Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Cyril Allauzen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
解耦音频编码器将波形映射为下游大模型直接消费的连续隐变量或离散词元,难点在于传统率失真只约束可重建性而不约束语义等价输入在隐空间的几何一致性。该工作先建立稳定性率失真概念框架,把语义与干扰信息分解并定义稳定性惩罚以刻画一致性与重建之间的权衡。接着提出连续编辑距离,对归一化帧序列做插入删除替换的动态规划对齐以吸收平凡时移并给出有界可比的漂移量。然后用频谱增强加逆变换掩码在二十六种方言上构造语义保持扰动,把连续漂移与量化放大的责任分离并送入前两步的度量做剖析。与率失真感知追求听感真实而被迫跟踪高频纹理不同,该框架强调机器消费的几何不变性从而揭示感知优化损害稳定性的机制意义。在图1中5个频谱增强变体对照干净参考的评测设置下,SoundStream离散码的UED指标为235.0,高于Encodec离散码的UED指标120.0。该结论适用边界受限于局部时频掩码且内容可懂的语义保持扰动,尚未验证全局加性噪声与低信噪比外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
898. 野外老年语音为何难识别:WildElder 用人工切分与细粒度标注建基准
英文题目:WildElder: A Chinese Elderly Speech Dataset from the Wild with Fine-Grained Manual Annotations
标签:#数据集 #数据集构建 #语音 #语音识别 #语音属性识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#数据集构建
👥 作者与机构
- Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaming Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Jiabei He:机构信息未能从会议 PDF 纯文本可靠映射
- Haoqin Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
老年中文语音识别需将野外采集的老年发音输入转写为汉字文本,难点在于语速缓慢、颤音、音量降低与口音重及录制条件杂乱交织,实验室录制难以覆盖话题多样性与自发语音风格。作者构建WildElder基准的方法链首先通过通用关键词检索与定向频道收集互补获取在线老年视频,解决老年资源稀缺且分散的问题。随后将视频切分为话语级片段并由人工完成正字法转写与年龄性别口音强度标注,转写规范统一数字字母格式并剔除过短片段,标注输出直接进入准确性完整性一致性可用性四维质检保留合格样本。与依赖自动转写的大规模野外语料相比,该工作的机制差异在于坚持全人工标注与专家复核以保证老年语音标签可靠,从而兼顾野外真实性与精选数据集可靠性并支撑识别与说话人画像研究。在 WildElder 测试集上 Mandarin 中心预训练的 Conformer-WenetSpeech 微调后字符错误率(Character Error Rate, CER)为 13.54%,优于零样本直接推理的 16.43%。结论适用于普通话为主的老年日常话题场景,对重口音与超高龄及方言主导语音的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
899. 校准源放在哪里才能让分布式麦克风阵列标定更准:以克拉美罗下界为目标的声源位置优化
英文题目:Optimal Source Placement for TDoA-based Geometry Calibration of Distributed Microphone Arrays
标签:#形式化分析 #麦克风阵列 #语音 #声源定位
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声源定位 | 主方法:#形式化分析
👥 作者与机构
- Xu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Qintuya Si:机构信息未能从会议 PDF 纯文本可靠映射
- Qingying Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- De Hu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
分布式麦克风阵列几何校准需从到达时间差观测中同时恢复麦克风位置与采集时间偏移,随机校准源布置常导致估计方差偏大。本文先基于含采集时间偏移的到达时间差模型推导费雪信息矩阵与CRLB,再以最小化CRLB迹为目标在房间盒约束内直接优化全部N个机器人声源位置,随后用多阶段策略将2N维联合优化拆为先联合优化K个位置再逐个贪心追加。该设计相对已有随机源校准的关键差异在于把源位置从被动采样变为面向估计下界的主动设计变量,因而更贴合到达时间差几何敏感性。在M=N=10、混响时间0.3s、信噪比15dB的声学仿真条件下,一阶段方法的指标MSEr为0.0489 m2,低于随机布置的指标MSEr 0.240 m2。该结论依赖已知房间范围与粗略麦克风初值,且仅在高斯噪声与中等混响噪声下验证,重强反射、大 TDoA 野值或三维大空间的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
900. 不平坦而是脱钩:神经合成语音在整体语调与元音目标上的双向偏离
英文题目:Not Flat, But Dissociated: Prosodic and Segmental Divergence in Neural TTS
标签:#统计分析 #语音学与音系 #韵律 #文本到语音
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#统计分析
👥 作者与机构
- Rong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kun Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Harald Baayen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为相同文本的人类录音与合成语音,输出是对韵律与音段两层组织偏离的定位,难点在于全局评分掩盖了不同时间尺度与发音维度的异质失效。本文在13100条配对LJ-TTS话语上先提取基频动态、微扰动、轮廓形状与时域强度共21维话语级特征,做组间非参数检验与套索逻辑回归分类,以分离全局离散压缩与局部扰动信号。接着将人类录音的强制对齐边界迁移至合成语音,在元音内部相对位置采样第一与第二共振峰,计算角元音三角面积与十元音凸包面积。最后按唇音、齿龈音与软腭音分组拟合起始与中点间的线性位点方程,以检验辅音环境对元音起始的影响。与只看基频均方误差或只看元音面积的已有评测不同,本文强调全局压缩与局部反转并存的层级失调以及韵律与音段近乎独立。在LJ-TTS语料评测设置下,MixerTTS的三角面积指标为14,898,低于人类基线的三角面积指标49,955。该结论限于单说话人美式英语朗读与两阶段合成,表现力更强的自发或对话语音及新端到端架构尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
901. 口音信息藏在哪里:用稀疏自编码器称量神经音频编解码器的可解释性
标签:#无监督学习 #可解释性 #语音 #语言识别
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语言识别 | 主方法:#无监督学习
👥 作者与机构
- Shih-Heng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Tiantian Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Aditya Kommineni:机构信息未能从会议 PDF 纯文本可靠映射
- Thanathai Lertpetchpun:机构信息未能从会议 PDF 纯文本可靠映射
- Bowen Yi:机构信息未能从会议 PDF 纯文本可靠映射
- Xuan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
神经音频编解码器将语音压缩为离散码字再重建,其内部如何保留口音等超语言信息仍不透明,制约敏感场景可信部署。本文输入为整句语音波形,输出为美音对英音、美音对非美非英音两组二分类口音标签,难点在于口音线索分布于整句且经量化后高度纠缠。先将整句波形输入编解码器,把重建连续特征按时间平均为句向量,再将该句向量输入TopK稀疏自编码器升维稀疏化并重建得到稀疏激活,最后将稀疏激活分解为位置与幅度特征后输入逻辑回归输出口音标签并计算相对保留率。相比已有编解码器评测只报任务绝对性能,本文以各编解码器自身为基线的相对下降度量可分解性,并揭示声学型与语音型编码器的不同承载机制。在Vox-Profile美英口音任务评测下,SpeechTokenizer的Macro-F1为92.44%,高于Mimi的Macro-F1 88.79%。该结论仅适用于任务级可分性口音二分类与所测稀疏区间,未验证单维语义、特征操控与其他超语言属性外推。该框架在单维语义操控等场景尚未验证,适用边界受限。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
902. 文本抢了声音的戏:MATA 在中间层把注意力推回音频
标签:#注意力机制 #多模态学习 #音频大模型 #音频问答
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#注意力机制
👥 作者与机构
- Junyu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Zong:机构信息未能从会议 PDF 纯文本可靠映射
- Tianrui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengding Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Meng Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaobao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Longbiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianwu Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型任务以音频信号与文本指令为输入,需输出答案及连贯推理链,实际难点是融合时系统性偏向文本的注意力失衡导致声学线索利用不足、推理易出现幻觉与逻辑断裂。本文提出免训练方法 MATA(More Attention To Audio),先诊断各解码层对音频词元的平均注意力分布,再在多模态融合关键的中间层对序列末词元的原始注意力分数做音频区间加权,最后经归一化 Softmax 重新分配权重以强化音频上下文。与视觉领域的重对齐训练或文本抑制策略不同,MATA 不新增参数且只干预推理前向的局部注意力计算。在 MMAU Test-mini(v05.15.25,1000样本)上增强后的 Qwen2.5-Omni-7B 平均准确率达到73.6%,在 MMAR(1000样本全集)上达到61.2%,在 Interspeech 2026 音频推理挑战中将 Qwen3-Omni-Thinking 的准确率提升至71.0%且推理质量 rubric 分达到62.6%,获单模型赛道第2名。该结论目前仅在 Qwen 系列解码器架构与 MMAU 与 MMAR 类问答推理上验证,对其他编码器与长音频交互场景的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
903. 只管输出不管模型的透明度义务为何管不住声音克隆
英文题目:AI Regulation and the Technical Language of Speech Synthesis
标签:#文献综述方法 #隐私保护 #音频安全 #语音 #语音合成
评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:综述 | 主任务:#语音合成 | 主方法:#文献综述方法
👥 作者与机构
- Jennifer Williams:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是弥合语音合成技术语言与全球人工智能监管条文之间的错位,输入是分散的透明度义务条文与快速演化的合成技术,输出是对监管盲区的概念澄清,难点在于语音身份可以在不产生音频输出的中间表示层被建模、存储与转移。作者首先重构从1962年Bell Labs数字合成、分析合成到2016年WaveNet以来合成与说话人验证及语音识别趋同的历史,说明合成长期属于电信与信号处理而非符号人工智能。接着以嵌入类型表揭示外部训练的身份模型如何进入下游合成,最后用4类工作流说明同一身份表示可在管线与端到端架构间复用并指向政策缺口。与图像领域生成与篡改二分法不同,该文强调语音克隆的关键不在最终波形而在可移植身份模型的创建与流转,这一机制差异使仅标注输出的法规难以追溯责任。原文未提供可核对的关键定量结果。其结论仅适用于概念与立法语言层面,不覆盖检测器性能、水印鲁棒性或具体合规成本等实证外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
904. 只调文本不够:用音频提示与共享提示补齐少样本音频分类的另一半
英文题目:Audio-Language Prompt Learning for Few-Shot Audio Classification
标签:#提示学习 #音频大模型 #少样本 #音频分类
评分:6.0/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#提示学习
👥 作者与机构
- Qisheng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoyi Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Wuyang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yutao Dou:机构信息未能从会议 PDF 纯文本可靠映射
- Kele Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
少样本音频分类需在每类仅16个样本下将音频波形映射到正确语义类别,难点是声学相似类语义描述接近而细粒度声学差异难以建模,且文本主导适配易造成跨模态优化失衡。本文提出多模态音频语言提示学习(Multi-modal Audio-Language Prompt Learning,MALP),冻结PENGI音频编码器与文本编码器,只优化音频专用、文本专用与共享三组提示。模态专用提示先以残差方式分别增强音频与文本表示以保留预训练结构,共享提示再以拼接方式注入双分支形成公共语义子空间以促进对齐,融合表示逐类经余弦相似度与Softmax做分类并以交叉熵训练。与仅优化文本提示的CoOp、CoCoOp和PALM相比,关键差异是显式恢复音频分支可塑性并解耦专用化与对齐,从而提升细粒度类别的可分性与跨模态一致性。在11个基准平均准确率上MALP达到78.35%,相对PALM提升1.77个百分点,尤其在Beijing-Opera与CREMA-D等细粒度任务增益更明显。该结论限于PENGI骨干与16-shot为主的评测,尚未验证超低样本、跨域与跨骨干外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
905. 先学标准音再适应真实错音:低资源阿拉伯语如何保住细微发音差异
标签:#CNN #领域适应 #模型集成 #低资源 #语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#领域适应
👥 作者与机构
- Jing Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Shuqing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yongyi Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Pan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Jingdong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jacob Benesty:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向低资源现代标准阿拉伯语(Modern Standard Arabic,MSA)发音错误检测与诊断(Mispronunciation Detection and Diagnosis,MDD),系统输入为学习者朗读语音,输出为音素(phoneme)序列并保留非典型发音以定位错误,难点在于咽音与强调辅音对比细微、噩化辅音时长敏感,且真实标注学习者数据稀缺。方法链为预训练编码器提取跨语言声学表征,因果空洞时序卷积网络(Temporal Convolutional Network,TCN)建模局部构音细节,联接时序分类(Connectionist Temporal Classification,CTC)解决无对齐变长映射,再以两阶段训练与多检查点集成完成域适应与稳定解码。与优先全局语义连贯的注意力架构不同,该设计以卷积局部归纳偏置与严格因果约束避免未来上下文将细微错误过度平滑纠正。第一阶段在约79小时母语语音与约80小时合成误读语音上学习通用声学音素映射,第二阶段在约2小时真实学习者语音上适配分布,推理时以混淆网络融合6个检查点假设并经3-gram语言模型重打分输出。在QuranMB.v2盲测测试集下,本系统的F1-score为0.7201,高于官方基线的F1-score 0.4414。结论仅在古兰经朗读场景验证,向自发口语与方言干扰的泛化尚未证明,原文未披露训练时长与推理延迟吞吐成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
906. 先分语种对齐再跨语种迁移:PART 如何避免多语语音表示坍缩
英文题目:PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs
标签:#课程学习 #多语言 #语音 #语音识别 #语音翻译
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#课程学习
👥 作者与机构
- Pei Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Andong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Xi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Baosong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Derek F. Wong:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Huang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言语音到文本需把多语言语音映射为转写或翻译文本,常规冻结大语言模型(Large Language Model,LLM)并混训多语言自动语音识别(Automatic Speech Recognition,ASR)与语音到文本翻译(Speech-to-Text Translation,S2TT)易使各语言音频表征坍缩到共享空间,丢失语言特异性。该工作提出渐进对齐表征训练(Progressive Alignment Representation Training,PART),将语言内对齐与跨语言对齐解耦为三步渐进链条。第一阶段冻结语音编码器与大语言模型,仅在单语多语言自动语音识别数据上训练轻量适配器,完成向大语言模型嵌入空间的粗粒度语言内对齐并提供稳定初始化。第二阶段以上一步已对齐的适配器为起点,渐进解冻语音编码器并与其联合优化,以扩充表征容量实现精细语言内对齐并保留语言特异性。第三阶段以前两阶段的语言内对齐表征为基础,联合自动语音识别与语音到文本翻译数据优化编码器与适配器,并用低秩适应(Low-Rank Adaptation,LoRA)激活大语言模型以利用跨语言迁移能力。与常规冻结大语言模型混训多任务的做法不同,该先保特异性再做迁移的设计缓解了表征坍缩并增强跨语言鲁棒性。全部三阶段共享自回归负对数似然目标。在Fleurs上PART-2B相对同数据同规模两阶段基线平均词错率从6.4%降至4.7%,相对下降约26.6%,在Common Voice 15上从9.2%降至7.4%,在CoVoST2英译上平均BLEU高1.4点。该结论限于10种训练覆盖语言的维基朗读与众包域,未验证未见语言、噪声对话泛化,训练与推理成本未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
907. 固定节拍为何在真麦克风前幻觉:学会等待的流式语音翻译
英文题目:Learning to Wait: Real Streaming Speech-to-Text Translation with an LLM
标签:#Transformer #大语言模型 #流式处理 #语音 #语音翻译
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#Transformer
👥 作者与机构
- Shucong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Titouan Parcollet:机构信息未能从会议 PDF 纯文本可靠映射
- Rogier van Dalen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式语音到文本翻译需在音频到达过程中逐块读入声学流并增量输出目标译文,实际难点是语速快慢不定且麦克风提前打开引入的前置静音会使固定节拍强行输出而幻觉或掉队。本文在Bestow架构上引入可学习等待策略,先由两层卷积加二十二层Conformer编码器将滤波组特征逐级下采样至每秒12.5帧的语音嵌入并做自监督预训练与翻译微调。接着等待策略以已听语音嵌入与已生成词为输入逐步预测等待或发射,若判等待则读入新的音频块继续累积,若判发射则进入下一步。最后条件网络以交叉注意力将语音嵌入注入文本嵌入,再送入冻结大语言模型生成下一个目标词,实现听译交错进行。相对固定等待策略等待1.28秒后每640毫秒输出一词,该机制能在静音时等待、在语义完整时发射,具有真实场景鲁棒意义。在前置5秒噪声的SilFleurs评测场景下,学习等待策略的COMET分数为0.745,高于固定等待策略的COMET分数0.593。该结论适用边界受限于短句Fleurs及其SilFleurs变体验证,尚未验证长演讲、语中停顿与真实麦克风噪声下的外推表现。训练成本为在四块A100硬件上以Adam优化器训练180000步,延迟方面学习策略平均逻辑延迟为1.72秒。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
908. 瓶颈里放状态空间:MambAdapter 用共享投影加 Mamba 做语音音频轻量适配
标签:#Adapter #状态空间模型 #语音识别 #音频分类
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#Adapter
👥 作者与机构
- Salman Hussain Ali:机构信息未能从会议 PDF 纯文本可靠映射
- Umberto Cappellazzo:机构信息未能从会议 PDF 纯文本可靠映射
- Mirco Ravanelli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音与音频基础模型的参数高效迁移问题,输入为对数梅尔频谱图分块序列或 Whisper 编码器隐状态,输出为音频类别标签或多语言转写文本,难点在于语音长上下文建模与全量微调成本高昂。方法链分为三步:首先以跨层共享的一对下投影与上投影将高维特征压缩至低秩瓶颈空间,其次在瓶颈内以轻量 Mamba 模块建模时序动态并经上投影回映射,最后以每层可学习标量加权并行叠加至冻结主干。相对每层独立投影的瓶颈适配器与依赖深度可分离卷积的 Conformer 适配器,该设计以共享投影省参数并以层特异状态空间补偿表达力。在Whisper五语言识别评测任务下,MambAdapter的WER为49.9,低于Bottleneck的WER50.7。该结论限于 Pfeiffer 与 Houlsby 并行插入、编码器端适配与分类加中等规模识别任务,未验证解码器适配与长语音外推。原文未披露优化器、学习率与训练轮数等训练成本细节。该设计适用边界受限于编码器端并行适配与中等规模语料,解码器适配与长语音外推尚未验证,推理开销上短时流式场景延迟相对较高而随序列长度与批量增大被摊薄。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
909. 只在音乐上训练的指纹为何能整理电话语音:去重与多样性采样的两条路径
标签:#数据清洗 #自监督学习 #语音 #音频指纹
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频指纹 | 主方法:#自监督学习
👥 作者与机构
- Kemal Altwlkany:机构信息未能从会议 PDF 纯文本可靠映射
- Elmedin Selmanovic:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向电话语音自采自标场景,输入为大规模未标注语音库,输出为去重后多样且定额的优先标注子集,难点在于重复留言浪费受限标注工时而随机抽样又偏向高频重复样本。方法先复用冻结的预训练Conformer指纹模型提取音频指纹嵌入并做相似检索以剔除近重复,其输出的剩余嵌入直接进入下一步。接着在剩余嵌入空间执行最远点采样使定额子集均匀散开,最后将多样子集交付受限标注者标注,从而减少冗余并提升声学覆盖。与侧重内容转写的语音嵌入不同,该指纹机制以区分同一音频为目标,因此在说话人声学特性上更具判别性,具有去重与多样采样双重实际意义。在VCTK语料说话人分类任务下,PTC的F1-score为96.36 ± 0.56,高于WavLM的F1-score 82.28 ± 1.16。结论依赖音乐训练的PTC泛化到电话语音的假设,未验证其他指纹模型与跨语言外推。该结论的适用边界受限于电话语音场景,跨语言与其他指纹模型的泛化能力尚未验证。原文未披露训练、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
910. 在 LLM 内部压缩音频表示:VIB-AVSR 为何只对音频 token 做瓶颈
标签:#正则化 #大语言模型 #鲁棒性 #音视频 #音视频语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音识别 | 主方法:#正则化
👥 作者与机构
- Piyush Arora:机构信息未能从会议 PDF 纯文本可靠映射
- Navlika Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Umberto Cappellazzo:机构信息未能从会议 PDF 纯文本可靠映射
- Stavros Petridis:机构信息未能从会议 PDF 纯文本可靠映射
- Maja Pantic:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频语音识别以带噪语音与唇动视频为输入并自回归生成文本转写,难点在于大语言模型骨干仅经文本预训练且只用低秩适配微调,对音频域偏移缺乏显式约束。沿用Llama-AVSR流水线,冻结Whisper-medium编码音频、可适配AV-HuBERT编码视频,经线性投影与3倍下采样映射到Llama-3.2-1B词嵌入空间后拼接文本提示解码。在此基础上于第4层与第8层后插入变分信息瓶颈模块,仅对音频隐状态做对角高斯采样压缩并以可学习先验做KL正则。瓶颈输出以插值系数0.5与原表示混合后送入后续层,以平衡压缩与语音判别信息保留。与仅依赖数据增强或编码器端改进不同,该机制直接约束语言模型内部表示,迫使模型保留转写相关信息并丢弃噪声方差。在LRS2上叠加MUSAN babble与speech噪声评估,噪声训练下babble平均词错率从18.85%降至17.39%,-10 dB处从34.87%降至32.52%;干净训练下babble平均从23.07%降至21.09%,-10 dB处从47.03%降至40.97%,干净语音基本持平。结论限于受控加性噪声与英语广播数据,未验证混响、遮挡、跨数据集与大模型扩展性,原文未披露优化器、学习率、批量、步数、硬件与解码配置。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
911. 把一天的嗓音切开看:时间分段如何让颈表加速计检出声带高功能
标签:#语音生物标志物 #模型集成 #生理信号 #病理语音评估
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#模型集成
👥 作者与机构
- Łukasz Łazarski:机构信息未能从会议 PDF 纯文本可靠映射
- Bartłomiej Eljasiak:机构信息未能从会议 PDF 纯文本可靠映射
- Szymon Szmajdziński:机构信息未能从会议 PDF 纯文本可靠映射
- Teresa Makuch:机构信息未能从会议 PDF 纯文本可靠映射
- Iwan Ryżenkow:机构信息未能从会议 PDF 纯文本可靠映射
- Anna Plęs:机构信息未能从会议 PDF 纯文本可靠映射
- Władysław Średniawa:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为长时程颈表加速度计(neck-surface accelerometer,NSA)经处理得到的50 ms帧级声学与气流特征,输出为受试者级咽创伤型发声过度功能(phonotraumatic vocal hyperfunction,PVH)与非咽创伤型发声过度功能(non-phonotraumatic vocal hyperfunction,NPVH)判别,难点在于日常发声行为高度异质且两类病理机制不同。方法链分三步:先按昼夜节律与发声类型将连续记录切分为多个时间窗,再在每个窗内对浊音帧计算分布统计量压缩为定长表征,最后用梯度提升树与逻辑回归分别建模并平均概率得到集成预测。核心机制差异是既往全天聚合抹平晨昏差异,而显式时段切分保留局部高强度用声片段的判别信息。在NeckVibe Challenge盲测集上,PVH集成受试者级ROC AUC为0.925,显著高于基线0.82并获第1名;NPVH为0.820,高于基线0.78并获第4名。结论仅适用于该挑战的采集设备与人群划分,对跨设备、跨语言及临床重度不平衡队列的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
912. 短窗看到的不是同一场景:用对抗训练压住瞬时事件、保住场景一致性
标签:#对抗训练 #鲁棒性 #环境声 #声学场景分类
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声学场景分类 | 主方法:#对抗训练
👥 作者与机构
- Yiqiang Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhou Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Peihong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxuan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Shengchen Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xi Shao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
短时声学场景分类以1秒短窗音频的对数梅尔谱为输入,输出长时环境类别,实际难点在于前景事件时变导致上下文缺失、短窗预测相对长窗全局预测漂移且性能随差异增大而崩塌。该方法先用标准场景模型计算长窗全局预测与多个短窗局部预测间的平均KL散度得到LGPD,并按LGPD分层划分稳定与不稳定子集以量化时间预测不一致。接着冻结的BEATs事件标注器为短片段生成527维伪事件概率标签,送入与场景分类器同构的事件判别器形成辅助分支。最后特征提取器同时连接最小化场景交叉熵的场景分类器和经梯度反转层连接的事件判别器,前者保持场景判别性,后者以反转梯度迫使特征遗忘瞬态事件信息从而学到时长不变表示,推理时丢弃事件分支。与把事件作联合学习正信号的多任务机制不同,该框架把局部事件视为需对抗抑制的干扰源,实际意义在于提升高差异片段的一致性与鲁棒性。在TAU Urban Acoustic Scenes 2020 Mobile Development数据集1秒测试集下,SAT的准确率为63.5%,高于基线的准确率59.6%。在TAU Urban Acoustic Scenes 2020 Mobile Development数据集1秒评测中该方法总体准确率达63.5%,较基线提升3.9个百分点且高差异分位改善最明显。其适用边界限于单数据集短窗场景与依赖预训练标注器质量,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
913. 轮到谁说话,耳朵怎么提前知道:话轮末尾词拉长的多语料核对
英文题目:Word Lengthening as a Function of Utterance Position: A Multi-Corpus Study
标签:#统计分析 #韵律 #语音 #轮次切换
评分:5.9/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#轮次切换 | 主方法:#统计分析
👥 作者与机构
- Mateo Cámara:机构信息未能从会议 PDF 纯文本可靠映射
- José Luis Blanco:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Ignacio Godino-Llorente:机构信息未能从会议 PDF 纯文本可靠映射
- Jeung-Yoon Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Stefanie Shattuck-Hufnagel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为连续对话与朗读语料中库方提供的词切分与说话人轮次边界,输出为轮次末词与句中词的时长差异判定,难点在于词汇选择、语速风格与韵律边界强度都会混淆位置效应。作者先将说话人切换前或长静音标记的轮次完成前最后一个词标为轮次末、其余标为句中,并把同说话人延续的中途句末归为句中以分离句法完成与话轮完成,得到全集比较用的位置标签。接着在剔除回馈词后做整体与分库比较以上一步标签量化位置主效应,再用同说话人同词形严格与宽松配对控制词汇效应,最后用断裂指数分组与音节切分定位效应来源以解释边界机制。在剔除回馈词的基准条件下,轮次末词的平均词时长指标为0.44 s,高于句中词的平均词时长指标0.24 s。与仅对比句法完成的方法不同,该方法以话轮完成为划分并用配对与韵律分层剥离词汇与语速混淆,使约二百毫秒级差异可作为轮次预测与合成的定量约束。同词配对效应减弱但仍成立,朗读与自发、英语与西班牙语均可观察,向音节计时、莫拉计时与声调语言的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
914. 把预训练、微调和蒸馏压进一个循环:三层联合语音识别如何排优先级
英文题目:From Bilevel to Trilevel: Joint Training for Speech Recognition
标签:#对比学习 #知识蒸馏 #多任务学习 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#多任务学习
👥 作者与机构
- Jen-Tzung Chien:机构信息未能从会议 PDF 纯文本可靠映射
- Yu-Chun Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaodong Cui:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音识别(Automatic Speech Recognition, ASR)需将语音特征序列转写为文本,在标注语音稀缺而无标注音频充足时,两阶段预训练加微调易遗忘预训练语义并与教师指导冲突。该文提出三层级有监督无监督蒸馏联合训练(Trilevel Supervised Unsupervised Distilled Learning, TL-SUD),以上层有监督连接时序分类损失对齐标签,中层无监督对比损失学习通用表示,下层特征蒸馏损失注入教师先验,共享FastConformer骨干并在单循环内联合更新。与加权求和及双层联合训练(Bilevel Joint Unsupervised and Supervised Training, BL-JUST)不同,该方法以下层最优解集约束上层可行域,并用序列惩罚梯度将中下层折叠为单层代理后再与上层构成第二轮双层问题。在LibriSpeech的train-other-500无标注加train-clean-100有标注设置下,115M模型在test-other上词错率为15.9%,相对两阶段基线的19.5%明显下降。在LibriSpeech test-other评测设置下,TL-SUD的词错率为15.9%,低于加权求和基线的词错率19.1%。该结论适用边界受限于LibriSpeech英文朗读语音与贪婪解码无外部语言模型条件,噪声会议或跨域迁移等场景尚未验证,偏离该分布时可能出现失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
915. 发音不定、写法不定:用国际音标把语音语料的口语与书面锚定下来
英文题目:IPA-Guided Dual Transcription for Data-Centric Speech Corpus Refinement
标签:#数据清洗 #SFT #语音 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#数据清洗
👥 作者与机构
- Jeong-Ju Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Young-Ik Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jin NamGoong:机构信息未能从会议 PDF 纯文本可靠映射
- Jaeyeon Jang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
高质量语音语料需要口语实现与书面规范的一致对齐,但两者是多对多映射,同一书面形式可有多种口语实现,同一发音也可对应多种写法,日期数字等仅凭文本上下文本质欠定。本文提出数据为中心的两阶段流水线,先由音素中间条件 Phoneme Intermediate Conditional / PIC 语音转文本模型从音频单次前向同步输出国际音标 International Phonetic Alphabet / IPA 与正字法文本,再由微调大语言模型 Large Language Model / LLM 以两者为联合条件生成固定格式的书面口语二元组,前者提供发音锚点,后者负责上下文推理与格式统一。与纯文本归一化相比,该机制把实际发音作为额外约束,在书面歧义处实现可验证消歧,并支撑噪声或领域语料的迭代提纯。在 Google TN 抽取的 1000 条合成语音诊断评测上,所提方法句子准确率 88.7%,数字错误率 4.7%,优于 Duplex 基线的 81.9%与 10.2%。在 100 小时 YouTube 韩语牙科语料清洗版 KDSC V2 上微调后,牙科集误差从基线 16.9%降至 5.1%,数字集从噪声版微调的崩溃中恢复。该结论适用边界受限于英语合成语音诊断评测与韩语牙科单一领域,尚未验证对自然口语多说话人与多领域泛化的有效性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
916. 跨被试想象语音为何掉到随机水平:用动态多视角图偏置加对抗去被试化补回空间结构
英文题目:Subject-Invariant Dynamic Graph Modeling for Cross-Subject EEG Imagined Speech Decoding
标签:#对抗训练 #图神经网络 #Transformer #脑信号 #言语神经解码
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#言语神经解码 | 主方法:#图神经网络
👥 作者与机构
- Saravanakumar Duraisamy:机构信息未能从会议 PDF 纯文本可靠映射
- Luis A. Leiva:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨被试想象语音脑电解码以64导2秒头皮脑电为输入,输出5类想象词标签,难点在于信噪比低、空间分布弥散且被试间频谱与连接模式差异大。方法链分四步推进:预训练EEG Transformer先提取长时序表征并按电极汇聚为通道令牌以保留空间身份;滑动短窗计算空间亲和与多频段相位锁定等动态多视角连接先验并做收缩平滑;图偏置注意力将先验以可学习混合权重注入注意力logits得到窗级嵌入;注意力池化融合成trial级向量后由词分类与梯度反转被试对抗分支联合优化。与把通道视为可交换输入的普通微调范式不同,该设计显式编码神经生理拓扑与时变交互并抑制被试捷径。在数据集1严格留一被试外协议评测下,完整模型的准确率为31.20%,高于微调EEGPT基线的准确率23.60%。结论仅限于5词封闭集与64导实验室采集,更大词表、少通道与跨设备外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
917. 不预测分数只判断好坏:PrefSQA 用成对偏好绕开 MOS 噪声
标签:#数据集 #偏好优化 #语音 #语音质量评估
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#偏好优化
👥 作者与机构
- Junyi Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Donald S. Williamson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音质量评估成对偏好预测以两段语音波形为输入,输出二值偏好判断,难点在于平均意见分标签噪声大且内容是否匹配会干扰相对质量比较。本文提出偏好语音质量评估PrefSQA,先由wav2vec 2.0与WavLM双编码器抽取语义与声学特征并经双向长短时记忆网络汇总为分值与不确定度,再以不确定度调节的Bradley-Terry对数几率得到偏好概率,同时由损伤注意力残差修正局部失真。与已有偏好方法依赖评分监督或固定温度不同,该方法用预测方差动态软化难样本比较,并以批内非匹配参考特征头约束全局排序。在CHiLi NM仿真集测试条件下,PrefSQA的准确率为90.37%,高于UPPSQA的准确率81.05%。该提升在平均意见分衍生集上几乎不可见,说明高噪声标签会遮蔽架构优势。误差集中于小间隔样本,其失败条件是近不可区分对仍易误判,尚未验证显式并列选项与大规模真实人偏好外推范围,适用边界受限于仿真与小规模人评语料。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
918. 在家庭之间泛化:用可分离的说话人条件做婴儿中心多层帧级标注
标签:#LoRA #鲁棒性 #低资源 #语音 #说话人分离标注
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#LoRA
👥 作者与机构
- Xulin Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Jialu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Nur Hossain Khan:机构信息未能从会议 PDF 纯文本可靠映射
- Kexin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Bashima Islam:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Hasegawa-Johnson:机构信息未能从会议 PDF 纯文本可靠映射
- Nancy L. McElwain:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
婴幼儿中心家庭录音需从单通道长音频中为儿童(CHN)、女性照顾者(FAN)、男性照顾者(MAN)与兄弟姐妹(CXN)四个层级同时输出帧级互斥发声标签,难点在于低信噪比、重叠发声与跨家庭域偏移。方法链分三步衔接:经低秩自适应(Low-Rank Adaptation, LoRA)微调的Whisper-large-v2编码器先提取声学表征并由窗口多层感知机(Multi-Layer Perceptron, MLP)降采样聚合局部上下文,共享声学序列再与因子化家庭感知说话人令牌拼接,轻量目标说话人提取器为每个层级提炼倾向性特征后由层级专用分类器输出帧标签并辅以时序平滑损失。与冻结编码器或单层建模相比,因子化设计显式分离层级不变信息与家庭特有变异并保留多层级重叠能力。在家庭不重叠测试集上平均Macro-F1达到74.88%,平均Cohen’s κ达到68.14%,超越同口径多层级基线。该结论限于LittleBeats穿戴采集的4至15月龄英语家庭场景,未验证跨设备跨语言外推与重度重叠下的边界稳定性。原文披露单块NVIDIA A100 GPU上训练约需3小时,未披露长时推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
919. 深模型不必全跑完:用早退出口适配联邦语音微调的算力与任务分层
英文题目:Adaptive Federated Fine-Tuning of Self-Supervised Speech Representations
标签:#联邦学习 #自监督学习 #隐私保护 #语音 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#联邦学习
👥 作者与机构
- Xin Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Chunrui Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Hong Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Xianrui Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Gao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向联邦学习下自监督语音表示的异构微调,输入为保留在本地的原始波形,输出为转写文本、分类标签或验证分数,难点在于设备算力差异导致的掉队效应与不同下游任务所需表示深度不一致。第一步由客户端进行资源与任务感知的深度选择,依据内存与算力及任务复杂度确定最大可训练深度并选定退出层。第二步沿弹性多出口主干仅前向至该深度并经任务头计算损失、回传更新该深度以内参数,深层保持冻结,输出的各层局部更新直接作为服务器聚合的输入。第三步由服务器做深度加权的逐层部分聚合,仅汇总训练过该层的客户端更新并按样本量与训练深度加权,形成浅层全员稳健优化、深层由高资源客户端精化的金字塔结构。与统一全模型平均相比,该设计将模型深度与设备能力解耦,兼顾效率与任务适配性。在LibriSpeech自动语音识别(Automatic Speech Recognition,ASR)test-clean上,异构按层聚合词错误率(Word Error Rate,WER)为8.79%,优于同配置标准联邦平均(Federated Averaging,FedAvg)的9.21%,与同质最优深度的8.81%持平。在内存上,关键词检测(Keyword Spotting,KWS)从12层降至3层显存从562.36 MB降至319.02 MB,降幅43.27%。该结论仅在Wav2Vec 2.0 Base与5类英语任务上验证,未检验大模型、跨语言或大规模客户端漂移下的外推能力。跨语言与大规模漂移的适用边界尚未验证,现有深浅分组已显示客户端硬件差异直接决定计算量与显存占用。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
920. 从平均发放率到分布:用分层离散隐变量逼近人工耳蜗听神经随机响应
英文题目:Towards a Stochastic DNN Approximation of Cochlear Implant Auditory Models
标签:#助听器 #变分自编码器 #向量量化 #高效推理 #音频编码
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频编码 | 主方法:#变分自编码器
👥 作者与机构
- Theresa Hartmann:机构信息未能从会议 PDF 纯文本可靠映射
- Ian C. Bruce:机构信息未能从会议 PDF 纯文本可靠映射
- Benjamin Lentz:机构信息未能从会议 PDF 纯文本可靠映射
- Rainer Martin:机构信息未能从会议 PDF 纯文本可靠映射
- Anil Nagathil:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
人工耳蜗电刺激建模需由Greenwood频率分辨率频谱图预测40个特征频率上平均发放率神经图,难点在于发放具有试次间随机性而现有深度近似只学习均值响应。分层向量量化变分自编码器先将输入频谱图编码为粗细两级离散潜码,分别保留全局结构与精细时频细节,粗码经顶层解码后与底层编码拼接再量化以融合多尺度信息。底层解码器逐时频bin输出Gamma分布的形状参数与尺度参数,得到发放强度的连续分布预测。独立Gamma采样将分布参数转化为随机平均发放率神经图,使负对数似然与指数化均方误差联合优化分布与点值。与确定性重建相比,该机制学习发放分布而非单点均值,因而能复现均值结构与试次间方差特性。在音乐测试集下,原始模型自比的NSIM指标为0.90±0.02,高于DNN自比的NSIM指标0.70±0.02。该结论适用边界受限于低中频与自发放射,高频活动与跨通道跨时间的精细相关因逐bin独立采样而建模不足,尚未验证生理与行为层面的等效性。推理开销方面,原文报告原始模型生成神经图的平均计算时间为68.96±0.26s,因而该快速近似更适于实时建模与策略测试。
🔗 开源资源
- 第三方资源:https://github.com/jabeim/GMT — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
921. 母语口语问代码时,通用语音识别为什么先错再传错
英文题目:CodeVaani: A Multilingual, Voice-Based Code Learning Assistant
标签:#教育 #偏好优化 #多语言 #语音 #语音交互
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音交互 | 主方法:#偏好优化
👥 作者与机构
- Jayant Havare:机构信息未能从会议 PDF 纯文本可靠映射
- Srikanth Tamilselvam:机构信息未能从会议 PDF 纯文本可靠映射
- Ashish Mittal:机构信息未能从会议 PDF 纯文本可靠映射
- Shalaka Thorat:机构信息未能从会议 PDF 纯文本可靠映射
- Soham Jadia:机构信息未能从会议 PDF 纯文本可靠映射
- Varsha Apte:机构信息未能从会议 PDF 纯文本可靠映射
- Ganesh Ramakrishnan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
CodeVaani面向印度初学者用母语语音提问代码概念的场景,输入为母语词夹杂英语技术词的代码混杂语音,输出为同语言文本回答与音频播放,难点在于口语化变量名、符号算子与编程关键词易被语音识别误转写并污染下游代码模型。系统先按语言路由调用Whisper处理英语、Indic-Conformer处理印度语言做初始转写,保留混合语义并输出文本给下一步。接着经直接偏好优化微调的指令调优Gemma-27B做代码感知转写修正,将误识同音技术词与符号表达恢复为代码形式。修正文本再送入Codestral-22B生成同语言解释、问答与排错回答,经Django、PostgreSQL、Redis与Celery异步轮询交付修正查询与回答文本及音频。与Saaras V3及通用多模态模型相比,该级联把声学识别与代码语义修复解耦,使后者专门纠正同音技术词失真,提升多语言代码密集语音的鲁棒性。在5种语言各100条共500条真人朗读查询的评测任务下,CodeVaani的WER为8.1%,低于Qwen3-Omni-Flash的WER 11.61%。28人实验室可用性评价中89%以上给出Fair及以上等级,26名回答采纳意愿者中25人表示可能或肯定在课程中使用。结论限于短句单轮查询与受控录音,未验证课堂噪声、多轮对话与长期学习收益,原文未披露训练与推理成本及延迟吞吐。
🔗 开源资源
- 演示资源:https://tinyurl.com/icse2026-artifacts → https://drive.google.com/drive/folders/1V7gfxGeG1GmUNyZeC9iGNDQ_XOIUb-cs?usp=sharing — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
922. 中英混读时热词难认:用语言感知加专家分流再做大模型偏置
英文题目:LLM-HB: Language-Aware LLM-Guided Hotword Biasing for Code-Switching ASR
标签:#混合专家模型 #大语言模型 #多语言 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#混合专家模型
👥 作者与机构
- Yuxuan He:机构信息未能从会议 PDF 纯文本可靠映射
- Genshun Wan:机构信息未能从会议 PDF 纯文本可靠映射
- Pengcheng Li:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Jian-Qing Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Yanmin Qian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
中英码切换语音识别需在单句内转写中英文交替语音,难点在于语言边界处声学混淆与英文实体及中文命名实体等热词稀少难识别。该工作以 Whisper-medium 编码器提取声学特征后经混合专家适配器做语言特化映射,再与热词嵌入拼接输入经 LoRA 微调的 Qwen3-4B 解码,同时以辅助语言头约束大语言模型隐状态保留语言判别性。热词以提示方式注入并辅以偏置损失强化目标位置的生成概率,从而在解码端实现自适应上下文偏置。与仅做单语建模或解码后融合的已有码切换方法不同,该机制将语言分离与大语言模型条件偏置联合优化,使双语热词信号反向影响专家分配。在 ASRU2019 码切换测试集 15 个干扰词设置下,完整模型混合错误率达到 5.85%,相对自家基线 7.34% 降低 20.30%,其中偏置混合错误率从 22.11% 降至 8.99%。该结论目前仅在该单数据集及固定热词构造下验证,对近音词、大规模热词库及跨数据集泛化的表现尚未证明。原文未披露推理延迟与部署成本,训练规模差异下作者声明不宜与先前工作直接比较。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
923. 自条件细化与逐层选排列的冲突:用高斯加权让各层说同一种说话人编号
英文题目:Hierarchical Permutation Consistency Learning for Self-Conditioned End-to-End Speaker Diarization
标签:#正则化 #Transformer #语音 #说话人分离标注
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#正则化
👥 作者与机构
- Bongsu Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Wooil Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人分离标注需从单通道录音输出每帧每位说话人的活动标签,重叠语音与说话人索引排列歧义是主要难点。本文在非自回归端到端分离标注上研究自条件精炼,输入为对数梅尔滤波器组特征,中间层预测经吸引子重构后回注深层以逐层优化帧级多标签活动概率。逐层排列不变训练在每层各自选择最优排列,导致相邻层索引冲突并污染自条件信号,作者将其定义为层级排列不一致。为此连续影响方案分三步衔接:先以高斯核按层间距离计算影响权重,再聚合邻层代价矩阵得到目标层聚合代价,最后经匈牙利算法求解各层排列并将一致化预测回注下一编码块。与强制共享全局排列的组级硬约束不同,该软正则保留层特异灵活性,使排列变化跨层协同而非异步抖动,从而解锁自条件渐进精炼。在CALLHOME 2话者改编/测试划分的评测设置下,连续影响方案的分离标注错误率为7.52%,低于逐层基线的分离标注错误率8.30%。该结论适用边界受限于CALLHOME改编与测试划分及模拟会话预训练条件,向更多话者、宽带数据或流式系统的外推能力尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
924. 偏向的音重复多了,话就变歌:元音辅音分布与说唱指令如何推动言转歌错觉
英文题目:Effects of distributional bias in vowels and consonants on the Speech-to-Song Illusion
标签:#心理声学实验 #语音学与音系 #言语感知 #语音 #音乐理解
评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音乐理解 | 主方法:#心理声学实验
👥 作者与机构
- Haruki Kagotani:机构信息未能从会议 PDF 纯文本可靠映射
- Hiroko Terasawa:机构信息未能从会议 PDF 纯文本可靠映射
- Makiko Sadakata:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理日语短语重复聆听后由话语向音乐的知觉转化,输入为9摩拉自然朗读语音,输出为重复前后的类歌度与类说唱度评分,难点在于韵律与语义之外的音段分布是否独立驱动音乐化。方法链分三步推进:先以9摩拉真词约束为输入,负责按元音偏置与辅音偏置2×2设计构造40条短语并用香农熵校验偏置强度,输出四条件刺激文本集;再以该文本集为输入,负责由不知假设的播音员录音并做修剪与归一化转码,输出可在线随机呈现的音频文件,使文本集进入录制环节;最后以该音频文件为输入,负责分为两套并在歌曲指令与说唱指令下采集单次与10次重复评分并计算变化量,输出感知变化量,使录制音频进入众包重复聆听评测。与既往聚焦音高稳定与节奏规则的研究不同,本文直接操纵音素分布并引入说唱框架以容纳音高起伏语音的节奏性音乐化。在歌曲与说唱指令合并的重复聆听条件下,有元音偏置刺激的感知变化得分为1.00,高于无元音偏置刺激的感知变化得分0.80。该结论限于日语母语众包聆听与人工高偏置短语,对自然语义连贯语音及跨语言的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
925. 短语音缺信息:用可学习的向量档案把稀疏帧映射回长语音特征空间
英文题目:Beyond Short Segments : Expanding Speaker Embeddings with Vector Archives
标签:#注意力机制 #自监督学习 #语音 #说话人验证
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#注意力机制
👥 作者与机构
- Hyunku Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Minkyu Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Chanwoo Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证需从测试语音提取说话人嵌入并用余弦距离判定是否同人,短至1秒的输入因协同发音与韵律信息缺失而性能急剧恶化。所提系统先用预训练WavLM按SUPERB范式对所有层表示做可学习加权求和得到帧序列,再将该帧序列送入基于Transformer的向量档案映射与统计池化模块增强上下文并补全稀疏特征,最后将增强序列送入ECAPA-TDNN编码为192维嵌入用于余弦评分。该模块先以自注意力建模上下文得到序列,再以其为查询去匹配可学习的典型特征库以召回缺失的话语人判别信息,并将全局统计向量广播回每一帧以注入话语级上下文。与多段聚合或元学习不同,该方法在推理时无需额外语音,直接以训练习得的固定档案作为键与值来补全信息。在VoxCeleb1基准Vox1-O的1秒条件下,VAM-ECAPA的等错误率为8.334%,低于常规训练基线的等错误率18.437%。适用边界是1秒至2秒的短时验证,对3秒及以上稳定特征可能引入扰动,噪声与跨语言泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
926. 先学好说话人分类,再学跨语言拉开距离:两阶段渐进式鲁棒说话人表示
标签:#数据增强 #对比学习 #鲁棒性 #跨语言 #说话人验证
评分:5.9/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#对比学习
👥 作者与机构
- Nikhil Keetha:机构信息未能从会议 PDF 纯文本可靠映射
- Hima Jyothi R:机构信息未能从会议 PDF 纯文本可靠映射
- Nivedita Chennupati:机构信息未能从会议 PDF 纯文本可靠映射
- Balaji Padmanaban:机构信息未能从会议 PDF 纯文本可靠映射
- Harish Rajamani:机构信息未能从会议 PDF 纯文本可靠映射
- Naveen Ambati:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证需将变长语音映射为定长身份向量,在噪声混响与跨语言训练测试不一致时保持同人聚合异人分离,难点是共享语言音系会主导向量导致异人误识与同人跨语言误拒。第一阶段在TidyVoice多语言数据上以加性角度间隔损失微调重塑维度网络ReDimNet-B6主干,配合音乐语音噪声、房间脉冲响应与变速扰动学习噪声鲁棒分类空间并输出192维向量。第二阶段冻结主干,在其固定表征上训练轻量残差卷积投影网络,以均衡采样跨语言三元组损失直接优化归一化向量余弦距离几何并输出256维向量。与单一分类损失或梯度反转对抗去语言不同,该分工将声学鲁棒留给增强加分类学习,将语言不变留给冻结表征上度量学习,规避联合对抗优化不稳定,其适用边界在于依赖域内多语言数据与均衡三元组构造。在 TidyVoice 开发集全量目标对全量非目标上等错误率(Equal Error Rate, EER)为1.58%,相对挑战基线 SimAM-ResNet34 的3.07%下降约1.49个百分点,最小检测代价(minDCF, Ptarget=0.01)从0.8200降至0.6481。结论边界是盲测未见语言上误差仍远高于开发集,多语言高度重叠说话人簇间距仍小,投影网络仅256.13 K参数、27.36 M MAC/s,原文未披露训练硬件、时长与端侧时延。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
927. 把真伪线索和攻击痕迹拆开:正交约束为何能让语音伪造检测跨库更稳
标签:#多任务学习 #正则化 #鲁棒性 #语音 #音频深度伪造检测
评分:5.9/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#正则化
👥 作者与机构
- Donghee Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Wooil Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造检测输入原始波形、输出真实/伪造二分类,难点在于经验风险最小化(Empirical Risk Minimization,ERM)下模型易记住训练集静音时长、信道与编解码等捷径,在未知攻击和真实传播条件下性能骤降。第一步沿SSL-AASIST骨干由wav2vec 2.0 XLS-R前端与RawNet2卷积编码波形,再经自注意力聚合构建谱图表示\(G\_s\)与时序图表示\(G\_t\),为后继解耦提供时频输入。第二步将\(G\_s\)与\(G\_t\)经共享线性投影加SeLU(Scaled Exponential Linear Unit)分出通用与特定两分支,前者送AASIST后端做主检测,后者送多层感知机(Multilayer Perceptron,MLP)做真实/TTS/VC辅助分类,实现是否伪造与何种攻击的分工。第三步对两分支节点表示施加余弦相似度平方均值的正交损失,并与主辅损失联合训练,使通用分支保留域不变真实性证据而特定分支吸收攻击相关成分。与只加辅助任务仍纠缠的做法不同,该约束显式最小化通用真实性线索与攻击相关成分的重叠,迫使主分类器依赖域不变证据。在 ASVspoof 2019 LA训练加 RawBoost增强下,该方法在 ASVspoof 2021 DF上将等错误率(Equal Error Rate,EER)从6.64%降至3.67%,在 ASVspoof 5上从16.25%降至14.39%,在 In-the-Wild上从11.22%降至8.84%,而在域内19LA与近域21LA上基本持平。结论限于训练于19LA的跨语料评测,未验证跨语言与强对抗外推,原文未披露训练推理成本与开源产物。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
928. 先分清元音清浊再认音素:用由粗到细的目标过渡缓解 CTC 的空白主导
英文题目:Transitional Objective Learning with Connectionist Temporal Classification in Phoneme Recognition
标签:#CTC #课程学习 #语音 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#课程学习
👥 作者与机构
- Izabela Krysińska:机构信息未能从会议 PDF 纯文本可靠映射
- Mikołaj Morzy:机构信息未能从会议 PDF 纯文本可靠映射
- Agnieszka Pludra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音素识别需将连续语音映射为音素序列,而联接时间分类 Connectionist Temporal Classification(CTC)因空白符主导易陷入抑制期,导致早期梯度微弱、对齐不稳且收敛缓慢。所提过渡目标学习 Transitional Objective Learning(TOL)先以元音、浊辅音与清辅音三分类等粗粒度声学目标提供易对齐监督,再经S形权重调度将损失重心平滑移向细粒度音素目标,最终由音素损失主导完成精细区分。与同时优化多粒度的层级多任务不同,该方法以时变加权显式实现由易到难的课程切换,无需改动编码器结构,可直接用于预训练模型微调。粗粒度目标更易形成稳定对齐,其输出可为细粒度音素建模提供平滑过渡的初始化引导。与标准微调相比,在TIMIT上音素错误率 Phoneme Error Rate(PER)由0.049降至0.044,相对降低10.2%,在LnNor波兰语划分上由0.084降至0.076,在Vibravox法语噪声划分上由0.063降至0.054,且收敛更快更稳定。结论目前仅在英语、法语和波兰语的wav2vec 2.0微调场景验证,调度形式与层级划分的跨模型泛化尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
929. 记得却用不上:用注意力找关键轮再做解码对比来压住先验
标签:#注意力机制 #测试时自适应 #语音 #语音对话系统
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音对话系统 | 主方法:#测试时自适应
👥 作者与机构
- Che Hyun Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Heeseung Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Sungroh Yoon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多轮口语对话需以历史语音与文本为输入生成严格忠于用户约束和自身既往回答的文本,难点是模型内部似能感知关键轮却被强参数先验在解码时压制而产生幻觉。该工作先用当前查询对历史的注意力经层选择与聚合定位关键轮,再以去掉关键轮的无条件分布刻画参数先验,最后用惩罚权重对比放大关键上下文的分布偏移以完成推理时矫正。与粗粒度丢弃全历史的文本上下文感知解码即Context-Aware Decoding / CAD不同,该方法以注意力感知的细粒度关键轮掩码实现跨模态精准对比。在Audio MultiChallenge基准下,本方法的平均通过率指标为33.10%,高于无CAD基线的平均通过率指标26.01%。该结论仅在3至8轮的语音到文本问答与替代评测器下验证,未证明对语音到语音生成与开放域长对话的外推性。该适用边界尚未验证对语音到语音生成与开放域长对话的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
930. 谁更嘎吱响:英汉朗读语料中男性更 creaky 的声学证据
英文题目:A Corpus-Based Study of Creaky Voice Production in English and Mandarin
标签:#统计分析 #社会语音学 #多语言 #语音 #语音属性识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Meixian Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yao Yao:机构信息未能从会议 PDF 纯文本可靠映射
- Charles Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为普通话与美国英语朗读句录音,输出为元音段嘎裂嗓音程度的性别与语言效应,难点在于嘎裂声学表征易受录音设备差异、音高跟踪失败与元音固有音色混淆。流程先以Montreal Forced Aligner做词与音素对齐并人工校对切出元音,再用Praat以1毫秒步长跟踪基频并剔除过短过长与中部70%不可跟踪token。接着用VoiceSauce在中部区间提取基频、一二次谐波差校正值、0-3,500赫兹谐噪比与倒谱峰凸显度,最后以线性混合效应模型检验语言与性别主效应及交互。相比以往单语言感知评价或说话人级嘎裂率计数,该设计用句长句法与音段分布受控的平行朗读材料与统一声学管线分离生理性基频差异与喉部紧缩线索,其结果受限于朗读体与可跟踪元音条件,尚未验证自发语境下的模式。在平行朗读语料评测下,普通话女性减男性的HNR35指标为7.26,高于英语女性减男性的HNR35指标3.61。结论仅适用于相对清晰的朗读体成年说话人,无法外推至自发会话、社会意义协商或已被剔除的重度嘎裂段。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
931. 先减去语言口音再对齐语义:POTSA 只训练投影层弥合跨语言表示鸿沟
英文题目:POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
标签:#迁移学习 #跨语言 #零样本 #语音翻译
评分:5.9/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#迁移学习
👥 作者与机构
- Xuanchen Li:机构信息未能从会议 PDF 纯文本可靠映射
- Chenrui Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Tianrui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Meng Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Zikang Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhou Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Jin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuheng Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Nyima Tashi:机构信息未能从会议 PDF 纯文本可靠映射
- Longbiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianwu Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理多语言语音到文本翻译(Speech-to-Text Translation,S2TT),输入为多源语言语音,输出为中文文本,难点在于语音编码器表征按语种聚类导致低资源语言难以复用高资源翻译映射。方法链分三步,首先由偏差补偿(Bias Compensation,BC)模块估计并减去语种均值偏置以粗对齐编码器输出,其结果送入冻结编码器后的查询变换器(Query Transformer,Q-Former)。接着在Q-Former内部利用语义相同的跨语言平行语音对施加分词级别最优传输(Optimal Transport,OT)约束,以Sinkhorn距离学习软对齐并与翻译交叉熵联合优化。最后由在线奖励引导层调度策略基于置信上界(Upper Confidence Bound,UCB)选择最受益的浅层施加OT,避免深层与解码目标冲突。与以往仅做语音到文本跨模态对齐的方法不同,该框架直接对齐源语言语音之间语义一致性,保留声学细节并促进跨语言共学。在FLEURS数据集上相对同结构基线5语种平均提升1.29 BLEU,零样本语言平均提升2.93 BLEU,显示低资源泛化收益。结论仅在英日西韩俄到中文及6个零样本方向验证,未验证其他目标语言与大规模噪声场景外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
932. 残留说话人信息为何还在:用针孔损失直接压低可链接性
英文题目:Reducing Speaker Residual by Considering Pinhole Effect in Voice Anonymization
标签:#正则化 #隐私保护 #语音 #说话人匿名化
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#正则化
👥 作者与机构
- Zeyan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Weili Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Liping Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Boyu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音匿名化需将输入语音转为隐藏源说话人身份但保留内容与韵律的匿名语音,难点是说话人属性会残留在内容与韵律表征中并维持可链接性。本文在已训练好的解耦式匿名框架上新增微调阶段:推理时每条语音拆为内容特征、韵律特征与说话人特征,再把说话人特征替换为伪说话人特征并由声码器合成匿名波形;微调时对同一批次多说话人多条语音使用共享伪说话人特征,使输出差异主要来自残留,并用冻结的说话人编码器从匿名波形提取嵌入计算针孔损失。该损失定义为匿名嵌入的组间散度与组内散度之比,最小化它可直接压低同源簇紧致度,同时联合原始生成目标维持可懂度。在LibriSpeech上x-vector基线配IDMap-Diff的平均等错误率从18.326%升至31.632%,ASR瓶颈加全局风格token(ASRBN-GST)配IDMap-Diff从48.202%升至50.754%,而词错误率波动多在0.1%以内。该结论限于utterance级伪说话人分配与VPC2024的自动说话人验证、语音识别与情感识别协议,未验证跨信道、强自适应攻击或主观自然度。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
933. 看得见说话人,才能补回方向声:两阶段定位渲染做野外语音空间化
英文题目:Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes
标签:#数据集 #多模态学习 #空间音频信号 #语音 #空间音频渲染
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#多模态学习
👥 作者与机构
- Qingyu Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Peng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Wenwu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Philip J.B. Jackson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究由360°视频与全指向通道恢复一阶Ambisonics(First-Order Ambisonics / FOA)定向分量的语音空间化任务,难点在于野外混响、噪声与多人交叠下的视觉接地与相位一致重建。定位器(Localizer)复用音视频分割(Audio-Visual Segmentation / AVS)骨干在等距柱状投影(equirectangular projection / ERP)上生成逐帧空间热图并归一化为概率先验,置信门控以峰值集中度与熵评估先验可靠性。渲染器(Renderer)以复数域U-Net将先验经适配器调制解码特征,并以复数掩码作用于全指向频谱生成定向通道,同时保留全指向通道以维持跨通道相干。相对无监督分离与单峰值解析编码,该设计以稠密可解释先验加门控调制平衡视觉与音频证据,在先验模糊时自动降低视觉权重以稳定重建。在YT-SPEECH测试集上完整模型ℓ2为1.15×10的负3次方、角度误差为0.64、PESQ为3.42,优于最强解析基线并同时取得更低空间误差。该结论适用边界受限于8.9小时策展语料与可视可定位说话人场景,其在重叠声源与复杂声学下稳定性下降的失败条件已显现,向更大规模与强混响外推则尚未验证。原文未披露训练推理部署成本与批量大小等完整复现细节。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
934. 噪声下谁在说话:用对齐的视听互补做语音活动检测
英文题目:MAC-VAD: A Modality-Aligned Cross-Attentive Framework for Robust Voice Activity Detection
标签:#注意力机制 #知识蒸馏 #鲁棒性 #音视频 #语音活动检测
评分:5.9/10 | 创新 1.1/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音活动检测 | 主方法:#注意力机制
👥 作者与机构
- Bruhanth Mallik:机构信息未能从会议 PDF 纯文本可靠映射
- Chintan Tundia:机构信息未能从会议 PDF 纯文本可靠映射
- Kumud Tripathi:机构信息未能从会议 PDF 纯文本可靠映射
- Shreyas Nagoor:机构信息未能从会议 PDF 纯文本可靠映射
- Pankaj Wasnik:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作以音视频流为输入输出语音或非语音二分类,难点在于真实噪声、混响、重叠语音及光照遮挡与姿态变化下单音频检测易失效且跨模态时序对齐困难。音频侧由可学习小波编码器WavelNet从原始波形提取时频表征并经Bi-LSTM建模时序,视觉侧由EfficientViT从112×112人脸裁剪提取帧级表征并经视觉时序网络建模唇动演化,两路输出共同送入融合模块。动态音视频跨注意力先将双流特征经全连接降维加GELU映射至瓶颈空间,再做对称双向交叉注意力交换上下文,随后以温度系数控制的Softmax门控对原始与交叉特征做Hadamard加权融合,经上采样与残差回填拼接为联合嵌入。融合特征经冻结Wav2Vec 2.0教师适配器的均方误差蒸馏与双向注意力一致性同步损失约束,再经全连接加Softmax分类,相较拼接相加与单向交叉注意力以门控显式抑制弱模态污染。在MMVAD验证集下,WavelNet+Eff-ViT+Distil的F1为86.39%,高于WavelNet+Eff-ViT的F1 80.73%。结论适用边界受限于AVA-Speech电影剪辑衍生的正脸裁剪场景,对严重遮挡、离轴人脸与多说话人重叠混响的外推尚未验证。该模型参数量为21.4M,单帧GPU延迟为21.9ms,吞吐为45.7FPS,推理开销已在原文披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
935. 声调难、架构偏:南部班图语识别为何没有通用最优模型
英文题目:Tone-Conditioned Curriculum Learning for Low-Resource Bantu Speech Recognition
标签:#Adapter #课程学习 #低资源 #多语言 #语音识别
评分:5.9/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#课程学习
👥 作者与机构
- Kesego Mokgosi:机构信息未能从会议 PDF 纯文本可靠映射
- Vukosi Marivate:机构信息未能从会议 PDF 纯文本可靠映射
- Sitwala Mundia:机构信息未能从会议 PDF 纯文本可靠映射
- Unarine Netshifhefhe:机构信息未能从会议 PDF 纯文本可靠映射
- Tsholofelo Mogale:机构信息未能从会议 PDF 纯文本可靠映射
- Thapelo Sindane:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
南部班图语语音识别(speech recognition)以16kHz朗读语音为输入、以无声调正字法文本为输出,难点在于声调铺展(tone spreading)跨越词边界并与形态耦合,而书写省略声调迫使模型隐式恢复长程依存。该工作先用冻结Whisper基线估计每条语音的归一化词错率,结合基频统计的归一化声调复杂度按 \(s&\#40;u&\#41;=\\alpha \\cdot WER\_\{norm\}&\#40;u&\#41;\+\\beta \\cdot Tonal\_\{norm\}&\#40;u&\#41;\) 融合,其中 \(\\alpha=0\.7\)、\(\\beta=0\.3\),并划分难度五分位;再经三阶段由易到难逐步扩大训练子集,同时在编码器末端以utterance级五维声调向量经双层门控多层感知机驱动4路并行瓶颈适配器,动态调节表征。相对仅按词错率或时长排序的通用课程,该机制把语言学复杂度显式注入样本调度与参数适配。在Swivuriso训练并在Swivuriso与NCHLT联合评测时,W2V-BERT声调条件配置联合平均词错率降至28.41%,优于同架构多语言基线30.89%与Whisper多语言基线29.44%。结论仅适用于isiZulu、isiXhosa、Sesotho、Setswana、Tshivenda、Xitsonga六种南部班图语朗读语音,对会话与码切换语音及跨语系迁移尚未验证,且Nguni语族偏好W2V-BERT、Sotho-Tswana语族偏好Whisper,无单一模型通吃。原文未披露训练时长与推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
936. 均匀 SDR 不够:用语音噪声竞争与瞬态加权重塑音素重建
英文题目:Time–Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement
标签:#助听器 #时频分析 #麦克风阵列 #语音增强
评分:5.9/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#时频分析
👥 作者与机构
- Nasser-Eddine Monir:机构信息未能从会议 PDF 纯文本可靠映射
- Paul Magron:机构信息未能从会议 PDF 纯文本可靠映射
- Romain Serizel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多通道语音增强(Multichannel Speech Enhancement,MCSE)需从混响多麦克风混合信号中恢复目标语音,难点是均匀信号失真比(Signal-to-Distortion Ratio,SDR)损失会平均所有时频单元,淹没爆破音与摩擦音等局部高信息线索。该工作构建三步加权链:先计算梅尔域局部信干比并经 Sigmoid 得到竞争门控,再乘以语音幅度门控以抑制低能量区,最后引入谱通量(Spectral Flux,SF)增强帧间能量突变并与可学习谱权重对照。相对仅用对数信干比加权的已有方案,新机制同时建模竞争强度、语音存在与瞬态动态,避免在高信干比纯语音区浪费优化容量。在白噪声测试集上,所提谱通量增强损失将词错率(Word Error Rate,WER)在中高输入信干比段系统性压低,辅音音素准确率(Phoneme Accuracy,PA)从34.0%提升至36.1%。结论仅在助听器双耳配置与白噪声及语音形噪声两类掩蔽下验证,极低信干比与强混响外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
937. 单通道推理时没有空间线索怎么办:用双通道做特权监督练出伪空间嵌入再调制分离
标签:#对比学习 #多通道 #单通道 #语音 #语音分离
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#对比学习
👥 作者与机构
- Daichi Nitsu:机构信息未能从会议 PDF 纯文本可靠映射
- Koichi Shinoda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道语音分离输入为单路混叠波形,需输出多路干净语音,在噪声与混响下缺乏声源方向等空间线索,因而声源归属歧义严重且时频掩蔽易混淆。该方法先以双通道混合作为特权信息对比预训练单通道空间编码器,使其嵌入对房间几何与声源位置敏感而对说话内容不敏感,为推理时单通道输入提供伪空间先验。接着将该编码器与TF-Locoformer分离主干联合微调,并在每个分离块前注入伪空间条件,使上一步学到的嵌入逐层调控时频建模过程。融合模块以多头交叉注意力生成自适应嵌入,再以特征线性调制做逐通道仿射调制,与直接拼接或门控卷积融合不同,可实现全局条件对时频特征的层级细粒度控制。在WHAMR评测设置下,所提中型方法的指标SI-SNRi为18.9 dB,高于复现TF-Locoformer中型基线的指标SI-SNRi 18.6 dB。该结论适用边界受限于WHAMR及其无噪变体NF-WHAMR的仿真双声道派生数据,对真实阵列失配与强混响泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
938. 不用孤立语音也能去噪:用干净混合与噪声录音联合训练分离与说话人日志
英文题目:Semi-Supervised Joint Separation and Diarization for Multichannel Noisy Speech Mixtures
标签:#半监督学习 #多通道 #说话人分离标注 #语音分离
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#半监督学习
👥 作者与机构
- Yuto Nozaki:机构信息未能从会议 PDF 纯文本可靠映射
- Kohei Saijo:机构信息未能从会议 PDF 纯文本可靠映射
- Yoshiaki Bando:机构信息未能从会议 PDF 纯文本可靠映射
- Masaki Onishi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为4通道含噪会议混合语音,输出为各说话人分离波形与说话人活动序列,难点在于扩散与非平稳噪声污染空间协方差建模并导致分离残留。方法第一步由推断网络从含噪混合估计解相关矩阵、空间基向量、功率谱潜变量后验与说话人活动,实现局部高斯与联合可对角化参数化。第二步将上一步输出的解相关矩阵与空间参数代入多通道维纳滤波,解析求出干净混合的后验均值与协方差以得到分离信号。第三步以含噪重构证据下界保留语音间无监督分离能力,同时以配对干净混合的阈值信噪比、似然与多通道板仓斋藤距离三项目标监督噪声抑制。相对Neural FCASA仅依赖含噪混合重构,关键机制差异在于引入干净混合监督解耦语音分离与噪声去除,实际意义是无需孤立语音即可提升噪声鲁棒性。在合成会议测试集10秒分段评测下,全组合模型相对Neural FCASA将信干比(Signal-to-Distortion Ratio,SDR)从12.3 dB提升至13.9 dB,感知语音质量评估(Perceptual Evaluation of Speech Quality,PESQ)从1.83提升至2.18,短时客观可懂度(Short-Time Objective Intelligibility,STOI)从0.80提升至0.85。该结论仅在LibriSpeech合成会议叠加DEMAND噪声并经加权预测误差(Weighted Prediction Error,WPE)去混响的条件下成立,未验证真实会议、移动声源与强混响外推。原文未披露训练与推理算力成本,仅提供音频示例页,未开源代码权重。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
939. 把到达方向变成宽波束约束:直接性正则化如何引导 FastMNMF 的伪分离矩阵
标签:#正则化 #麦克风阵列 #语音 #语音分离
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#正则化
👥 作者与机构
- Ryosuke Ono:机构信息未能从会议 PDF 纯文本可靠映射
- Aditya Arie Nugraha:机构信息未能从会议 PDF 纯文本可靠映射
- Yoshiaki Bando:机构信息未能从会议 PDF 纯文本可靠映射
- Kazuyoshi Yoshii:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理超定条件下到达方向已知的多通道语音分离,输入为5通道弧形阵列采集的混响含噪混合频谱,输出为各说话人的空域像估计,难点是全秩空间协方差模型自由度过高易陷局部最优且无法利用已知方向。先用联合对角化约束的快速多通道非负矩阵分解建模虚拟成分功率,得到虚拟成分观测功率与方差模型输出并送入分离矩阵优化。再为每个虚拟滤波器分配目标通过方向与置零方向,并以冯米塞斯概率密度在连续角度域加权构成方向性正则项。最后用乘性更新优化声源模型而用向量坐标下降闭式更新分离矩阵,与单点几何约束相比,连续域软加权容忍方向误差与混响扩散并在集中度趋于无穷时退化为经典约束。在
\[arc,0\.3,20dB\]仿真条件任务下,DR-FastMNMF von Mises的SDR为9.2(2.5),高于FastMNMF的SDR 4.9(3.4)。结论的适用边界受限于说话人数较少且方向先验准确的仿真超定场景,在三至四说话人拥挤时优势消失且尚未验证估计方向误差。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
940. 无干净语音时如何去混响:用 WPE/WPD 弱监督约束 USDnet++
标签:#无监督学习 #弱监督学习 #麦克风阵列 #去混响
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#去混响 | 主方法:#无监督学习
👥 作者与机构
- Ruizhe Pang:机构信息未能从会议 PDF 纯文本可靠映射
- Shulin He:机构信息未能从会议 PDF 纯文本可靠映射
- Jingqi Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Zhong-Qiu Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无监督语音去混响需从无标注多通道混响混合中恢复参考麦克风直达声,直接路径信号与滤波器存在盲解卷积歧义。本文提出无监督去混响网络增强版 USDnet++,先用预训练无监督网络估计直达声以计算加权预测误差(Weighted Prediction Error,WPE)与卷积波束成形(Convolutional Beamformer,WPD)所需的功率谱、相对传递函数与掩蔽,再把信号处理去混响(Signal Processing Based Dereverberation,SPD)结果视为虚拟麦克风新增一路混合约束(Mixture-Constraint,MC)损失,迫使经前向卷积预测(Forward Convolutive Prediction,FCP)线性滤波后的网络估计同时重构原始多通道混合与SPD结果。相比直接把传统算法输出当回归目标,新损失只要求滤波后可解释教师观测,保留超越教师失真上限的自由度。多阶段精炼将网络估计与WPD交替迭代,首轮增强模型为次轮提供更准参数;双模型系统进一步把多通道WPD结果与原始混合拼接作为第二模型输入特征。在WSJ0CAM-DEREVERB上,单通道输入、8通道损失约束下使用USDnet-WPD监督的模型取得PESQ 2.86、eSTOI 0.822、SI-SDR 3.9 dB,明显高于USDnet基线2.64/0.794/3.1 dB与WPE基线2.02/0.690/2.0 dB,且超过其教师USDnet-WPD的2.59/0.809/2.8 dB。该结论仅限仿真房间脉冲响应加REVERB扩散空调噪声、单说话人条件,未验证真实录音与强噪声外推,训练与推理成本未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
941. 不用打分也能评风格:用两两比较学会判断动漫感语音
英文题目:AnimeScore: A Preference-Based Dataset and Framework for Evaluating Anime-Like Speech Style
标签:#数据集 #众包评测 #评测协议 #语音 #语音属性识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#评测协议
👥 作者与机构
- Joonyong Park:机构信息未能从会议 PDF 纯文本可靠映射
- Jerry Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为日语语音波形,输出为动漫风格相似度的标量分数,难点在于该属性高度多维且缺乏共享绝对标尺,因而平均意见分式绝对打分不可靠且难以复现迭代开发。方法链分为三步:先从动漫与通用语料筛选三千条话语并以文本相似与说话人相似控制语言与身份混淆来构造跨语料A/B比较对,再通过众包收集一万五千个二选一偏好与自由描述以建立经验胜率与声学解释基线,最后在冻结自监督学习编码器上训练双向长短时记忆排序器并经均值池化输出分数。声学分析表明高胜率语音具有较低共振峰中值、较高浊音占比与连续快速但停顿极少的发音策略,而非单纯依靠高音调。与直接回归平均意见分的机制差异在于用成对逻辑损失学习相对序,从而将评价转化为可微奖励信号并可直接用于生成模型的偏好优化。在held-out A/B比较测试集下,SSL排序模型的ROC曲线下面积(Area Under Curve,AUC)为90.8%,高于手工特征逻辑回归的ROC曲线下面积(Area Under Curve,AUC)69.3%。结论仅在日语、所用三语料分布及当前标注人群内有效,跨语言跨人群与生成语音优化闭环尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
942. 被遮住的声谱块为何还能用来加速:把掩蔽冗余变成可合并的令牌
英文题目:From Masking to Merging: Rethinking SpecAugment for Efficient Audio Spectrogram Transformer
标签:#数据增强 #Transformer #高效推理 #音频分类
评分:5.9/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#数据增强
👥 作者与机构
- Minhee Park:机构信息未能从会议 PDF 纯文本可靠映射
- Hyowon Ahn:机构信息未能从会议 PDF 纯文本可靠映射
- Chanwoo Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频分类以二维语谱图为输入并输出事件或关键词标签,长序列自注意力带来二次计算开销,而频谱增强产生的低信息掩码区仍全量参与编码是实际浪费所在。该方法先将时频掩码对齐至块网格并扫描记录全零块位置形成二值矩阵,其输出的二值矩阵进入嵌入后阶段筛选合并候选。接着在加入位置嵌入后且进入编码器前随机组成不相交掩码块对,并经维度级最大值融合压缩序列后送入编码器完成分类。与依赖表征相似度计算的通用词元合并及随机丢弃不同,其以增强冗余为结构先验实现免额外模块的缩减。在Balanced AudioSet基准下,合并100对的平均精度mAP从合并0对的mAP34.07升至34.08,而训练吞吐从43.3升至49.3样本每秒,相对提升13.9%。该结论受限于掩码块数量决定的最大合并比例,向其他主干与推理加速的外推尚未验证。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
943. 两个语音编码器为何比一个更稳:面向识别的编码器融合怎么做
英文题目:Speech Encoder Fusion for LLM-based Automatic Speech Recognition
标签:#模型融合 #多语言 #语音 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型融合
👥 作者与机构
- Jakob Poncelet:机构信息未能从会议 PDF 纯文本可靠映射
- Hugo Van hamme:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为短时语音波形,输出为对应文字转写,难点在于单一语音编码器难以兼顾多语言泛化与特定语言声学细节。为此作者构建语音大语言模型流水线,先由两个并行预训练编码器分别抽取互补声学特征并下采样对齐至16.7 Hz相同帧率,形成时间同步的双流特征。融合层将双流特征合成为单流表示,再经2层多层感知机投影器映射至大语言模型嵌入空间并以量化低秩适配微调完成识别。相对静态特征拼接,该方法引入帧级Sigmoid门控与跨编码器多头注意力及序列级Transformer融合,使权重随语言与声学条件动态分配。在荷兰语Spoken Dutch Corpus测试集clean上时间变换器词错率降至6.8%,优于Whisper单编码器的8.3%和NeLF单编码器的7.5%。结论限于短语音单语与荷英双语及荷兰语多人会话转写,未验证长音频、流式与跨域泛化,作者自认绝对性能仍难超专用自动语音识别模型且受限于rank 4加4-bit量化资源约束。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
944. 房间不变时听得更省力吗:声码语音下不同沉浸年龄的房间适应
标签:#心理声学实验 #言语感知 #语音 #语音可懂度评估
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#心理声学实验
👥 作者与机构
- Epri Pratiwi:机构信息未能从会议 PDF 纯文本可靠映射
- C. T. Justine Hui:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Hioka:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为同一房间块呈现的三词英语矩阵句,输出为逐词识别正确率与瞳孔扩张努力指标,难点在于八通道声码器降解与混响同时削弱包络线索且沉浸年龄差异可能混杂适应效应。方法链分三步:先用400–7000Hz八频带噪声声码器模拟人工耳蜗处理并与未处理语音对照,其输出直接进入下一步混响加载;再将球形阵列实测脉冲响应解码至31通道扬声器阵列重放以保留头相关传输函数,生成 seminar与chapel等多混响刺激;最后在固定房间块呈现下连续追踪识别率与瞳孔峰值扩张随句序的变化。与既有房间适应研究相比,关键差异是同时操控信号降解与沉浸年龄并引入瞳孔努力指标,从而区分能听清与费力听清的分离过程。在房间声学条件设置下,Chapel的混响时间指标为1.8 s,高于Seminar room的混响时间指标0.7 s。结论仅适用于正常听力青年在模拟人工耳蜗与新西兰英语材料下的短期块适应,未验证真实人工耳蜗用户、老年及强噪声外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
945. 把八度跳变当作时钟:用基频不稳定性定位嘎裂嗓起点
英文题目:Automatic identification of the onset of creaky voice according to F0 instability
标签:#软件工具 #信号处理 #发声与构音 #语音 #音频事件检测
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#信号处理
👥 作者与机构
- Rasmus Puggaard-Rode:机构信息未能从会议 PDF 纯文本可靠映射
- Joshua Penney:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为含模态到嘎吱过渡的音节波形与元音区间,输出为嘎吱起点时刻以测算嘎吱时长与元音占比,难点在于过渡短促且存在性检测无法定位边界。该链条先用REAPER估计声门闭合时刻与F0轨迹并以Praat均方根振幅峰后限定搜索窗,限定后的窗内信号进入差分检测。接着计算F0一阶差分并取峰值导数80%处首帧为候选,该候选帧号送入时刻对齐步骤。最后将候选映射到最邻近声门闭合时刻作为起点并自动输出TextGrid与诊断图供核查。与惩罚八度跳变的Praat式跟踪不同,该方法以不惩罚跳变的自相关加动态规划保留真实周期倍增,并以导数峰值前沿捕捉起始而非滞后峰值。原文未提供可核对的关键定量结果。该结论适用边界受限于词尾/t/喉化前模态到嘎吱单向起点,词首与裂隙语境偏移方向及其他嘎吱亚型尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/google/REAPER — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
946. 可读性难不倒现代语音识别:人类觉得难的文本为何机器转写不怕
英文题目:Readability Does Not Predict Speech Recognition Errors: Contrasting Human and Machine Perception.
标签:#统计分析 #模型比较 #语音识别 #语音可懂度评估
评分:5.9/10 | 创新 1.1/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#统计分析
👥 作者与机构
- Baptiste Ramonda:机构信息未能从会议 PDF 纯文本可靠映射
- Laurianne Sitbon:机构信息未能从会议 PDF 纯文本可靠映射
- Julien Pinquier:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为不同可读性文本对应的语音,输出为自动语音识别转写文本,难点在于人类朗读困难文本时会自然改变发音从而混淆文本难度与声学难度的因果。方法链由三环构成,文本语料先经语音合成Text to Speech / TTS生成稳定韵律的基准音频以冻结说话人因素,合成音频再经食堂babble噪声与房间混响退化以模拟挑战声学环境,退化音频最后送入多架构识别器并以词错误率Word Error Rate / WER与内部不确定性度量评估转写退化。与依赖困惑度解释旧架构错误的观点不同,本文机制差异在于证明现代端到端架构已将声学转写与语言理解解耦,对可听性优化具有模块解耦的实际意义。在CLEAR合成语音评测条件下,Whisper Tiny的WER与GRI的Pearson相关系数为≤0.03,低于Wav2Vec2的Pearson相关系数0.24。结论仅适用于英语朗读体与所测架构和退化类型,未验证对话、自发语音与多语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
947. 唱得好不好不能只看音准:用块对齐把歌词正确性与音高节奏放在一起评
英文题目:Listening Like a Judge: A Music-Aware Framework for Automatic Singing Performance Evaluation
标签:#数据集 #LoRA #多模态学习 #音频质量评估
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频质量评估 | 主方法:#多模态学习
👥 作者与机构
- Neelam Saini:机构信息未能从会议 PDF 纯文本可靠映射
- Sourav Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动歌唱质量评估输入为含伴奏的演唱波形与参考歌词,输出为可解释的整体分数与分段反馈,难点在于装饰音、弹性速度与可接受即兴难以与真实失误区分。该框架先经音源分离得到人声与伴奏,再用模态引导微调后的识别模型生成带时间的原型切分并滑窗扩展为候选块,随后以语义、词形与音素三路相似度完成参考引导的块对齐与内容打分。并行支路从伴奏估计全局调性,从人声提取音高轮廓与发声起始点,计算调内偏离与节拍对齐误差得到音乐分,最终按时长加权融合两路分数并交由大语言模型生成自然语言反馈。与仅用声学或仅用文本的已有方案不同,它以块为单位容忍移调与装饰变化,同时保留局部强弱对比,具有双模态互补的实际意义。在SWARALYRICS评测设置下,MG-LoRA增强转写的排序相关指标ρ为0.626,高于Whisper基线的排序相关指标ρ0.518。结论目前仅在印度单人独唱与有限公开歌唱集上验证,多人合唱与极端噪声下的外推尚未证明。训练使用2块32GB显存加速微调与推理,原文未披露完整时长与部署延迟成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
948. 同音不同形都算对吗:临床多文字变体的评测与训练一致性
英文题目:When Multiple Script Matters: Evaluating ASR in Clinical Settings
标签:#医疗音频 #基准测试 #基准设计 #多语言 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Jean Seo:机构信息未能从会议 PDF 纯文本可靠映射
- Minkyu Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Jeonguk Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jisoo Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Wooseok Han:机构信息未能从会议 PDF 纯文本可靠映射
- Eunho Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非英语临床自动语音识别(Automatic Speech Recognition, ASR)的输入为韩英混杂的医患对话音频,输出为转写文本,难点在于同一英语医学术语存在英文原形与韩文音译两种合法书写,声学实现相同但单参考词错误率(Word Error Rate, WER)会误判为错误。本文构建临床基准MultiClin的方法链为先从ACIBench、Primock57、MTS-Dialog收集英文医患对话并用生成模型标注三类可变实体,再将其余文本译为韩文并保留实体的英文原形加韩文音译双形式,接着由护理背景人员校对并用参数化语音合成加混响与暖通噪声仿真生成对话音频,最后用动态多参考解析算法在预测窗口内为每个实体选择局部字符错误率(Character Error Rate, CER)更小的合法形式。该机制与传统单参考及通用代码切换评测的关键差异在于承认正字法多对一映射并做实体级局部对齐,因而更贴近临床可接受答案集合。零样本评估显示Gemini 2.5 Pro在全多书写感知设置下CER为4.86%、WER为15.78%,相对严格单参考的24.23%和28.28%大幅下降,Whisper Large v3 Turbo在100%音译统一微调后最优CER为6.16%。结论仅适用于韩国语境下合成语音与医学术语(MEDICAL)、数值(NUMBER)、单位(UNIT)三类受控实体的评估,未验证真实录音、其他语种及病历生成等下游任务的外推效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
949. 不在混响里硬捞声音:把语义和音色拆开再做增强
英文题目:Seed-Enh: Generative Speech Enhancement in Decoupled Semantic and Timbre Spaces
标签:#流匹配 #语音 #语音增强 #语音转换
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#流匹配
👥 作者与机构
- Zengqiang Shang:机构信息未能从会议 PDF 纯文本可靠映射
- Biao Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Pengyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强输入为加性噪声污染语音,输出为干净语音,难点在于声学空间语音与噪声高度纠缠,直接建模易出现高频抑制和谐波空洞与音色失真。该文提出Seed-Enh,将增强解耦到语义空间与音色空间,用冻结Whisper-Large-v2编码器从后半段含噪语音提取抗噪语义表示,用CAM++全局嵌入加上下文学习从前半段提取音色信息。扩散变换器以流匹配融合双路条件生成梅尔谱,再经BigVGAN声码器合成波形,前步语义与音色输出直接作为后步生成的条件输入。与以含噪语音为源分布的传统增强流相比,该链条改用标准高斯先验加双空间条件重构,避免残留噪声污染生成起点并更好保留谐波与高频细节。在DNS盲测集评测设置下,Seed-Enh的OVRL指标为3.095,高于Schrödinger Bridge的OVRL指标3.076。该结论仅在所述英语盲测与仿真集及DNSMOS系列感知指标下成立,未验证强混响、削波或真实录音泛化。上述优势的适用边界受限于所报告语料与指标,强混响与真实录音等外推范围尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://github.com/Plachtaa/seed-vc — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
950. 各模态情绪不一致时:用模态专属标签分布补上融合缺的那块信息
英文题目:Leveraging Modality-Specific Label Distributions for Enhanced Multimodal Emotion Recognition
标签:#对比学习 #多模态学习 #音视频 #语音 #语音情感识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Xiaohan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Xingfeng Li:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Toda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态情感识别以语音、文本和人脸视频为输入,输出统一的7类情感标签,难点是各模态情感倾向经常分歧而传统方法只用统一硬标签监督。该工作提出模态标签分布框架MoLD,先由模态私有编码器抽取表示并预测各模态标签分布,再经跨模态融合为每个模态聚合互补信息,最后将融合表示与分布向量拼接后联合预测统一标签,并以对比式相似性损失约束跨模态一致。与早期拼接和注意力融合的关键差异是把模态私有监督从离散标签放宽为标签分布学习,并让预测分布直接参与最终表示,从而保留模糊性和互补性。在EmotionTalk中文交互数据集官方7分类划分上,MoLD在全模态下达到58.96%非加权平均召回率和59.67%宏平均F1,相对最强注意力基线提升2.91个百分点UAR和2.42个百分点F1。该结论目前仅在单一数据集下验证,对缺失模态、跨语言和跨语料的外推尚未证明。原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
951. 先摘要再隔离:单说话人过滤与因果注入如何兼顾情绪线索与隐私边界
标签:#图神经网络 #隐私保护 #严格因果 #语音情感识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#图神经网络
👥 作者与机构
- Heying Song:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Han:机构信息未能从会议 PDF 纯文本可靠映射
- Yandi Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Zixing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Ziping Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态对话情感识别(Multimodal Dialogue Emotion Recognition,MDER)输入为对话中每轮话语的文本、音频和视觉特征,输出为情感标签,难点在于全局图传播易混入非目标说话人表示并引入未来上下文泄露。该工作提出说话人过滤异构图网络(Speaker-Filtered Heterogeneous Graph Network,SF-HGN),先用上下文感知图注入(Context-Aware Graph Injection,CAGI)在因果窗口内检索跨说话人线索并写入目标表示,再在单说话人异构图(Single-Speaker Heterogeneous Graph,SS-HG)上做关系感知的图传播,最后拼接三模态节点表示经多层感知机(Multilayer Perceptron,MLP)分类。与全局图方法不同,该链条把跨说话人语义接触限制为一次向量注入,后续消息传递隔离在说话人诱导子图内。在IEMOCAP上取得加权准确率(Weighted Accuracy,WA)68.76%与加权F1(Weighted F1,WF1)68.73%的总体最优,在MELD上取得WA 66.40%与WF1 65.65%的总体最优,方向为提升。该结论局限于两个英语表演型数据集,且IEMOCAP愤怒类塌陷、MELD多数类偏置明显,向多方强噪声或实时部署的外推尚未验证。原文未披露训练时长、硬件与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
952. 分诊不是诊断:用结构化病历造出带口音和犹豫的急诊对话
标签:#医疗音频 #数据集构建 #语音对话系统 #语音克隆
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音对话系统 | 主方法:#数据集构建
👥 作者与机构
- Dipankar Srirag:机构信息未能从会议 PDF 纯文本可靠映射
- Quoc Dung Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Aditya Joshi:机构信息未能从会议 PDF 纯文本可靠映射
- Padmanesan Narasimhan:机构信息未能从会议 PDF 纯文本可靠映射
- Salil Kanhere:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
急诊分诊需从简短口语交互中完成风险评估与急症等级划分,但真实护患录音受隐私管制而缺失,现有资源多为结构化结局或事后记录。TriageSim以结构化电子健康记录为潜在临床状态,先构建患者与护士画像,再由对话主控、护士智能体与患者智能体进行多轮交互并记录生命体征查询与红旗征,最后经韵律短语切分、口音条件语音克隆与急诊背景混音生成对齐文本与音频。与既往纯文本诊断对话生成相比,该框架将澳大拉西亚分诊量表与急诊严重度指数作为显式决策策略注入护士智能体,并分离护士与患者的信息权限。在失流畅控制评测任务下,重复的Spearman相关指标为0.52,高于填充停顿的Spearman相关指标0.33。该结论目前仅适用于合成英语口音与短急诊交互,尚不能外推至真实噪声、真实患者行为与高风险决策。原文披露对话生成约 1000 美元 API 调用成本,未披露训练或部署延迟吞吐。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
953. 检测器声称的公平与泛化,为什么被 39 个数据集的来源重叠卡住
英文题目:Ethical and Technical Limits of Deepfake Speech Datasets
标签:#文献综述方法 #公平性 #语音 #音频深度伪造检测
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频深度伪造检测 | 主方法:#文献综述方法
👥 作者与机构
- Vojtěch Staněk:机构信息未能从会议 PDF 纯文本可靠映射
- Eva Trnovská:机构信息未能从会议 PDF 纯文本可靠映射
- Kamil Malinka:机构信息未能从会议 PDF 纯文本可靠映射
- Anton Firc:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
深度伪造语音检测的输入为混合真实与合成语音的待测音频,输出为真伪判定,难点在于鲁棒性与公平性声明缺乏可审计的数据基础。该审计先按纳入排除标准策展39个同行评议数据集并统一编码可及性、合成工具、语言、规模、说话人与许可,再回溯底层真实语音来源并构建来源重叠映射。最后统计人口统计元数据缺失与许可限制以诊断评估有效性,与以往只罗列规模年份的综述不同,该审计把来源谱系作为泛化声明的证伪条件,揭示共享语料导致数据泄漏的机制。在39个数据集审计设置下,单语数据集的占比指标为64%(25/39),高于多语数据集的占比指标21%(8/39)。同时仅19个数据集同时报告男女说话人数,双语占15%,受限获取与缺失许可等问题的适用边界受限于公开文档审计层面。上述结论仅适用于公开文档可查的审计层面,未验证重叠对具体检测器错误率的因果影响。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
954. 17 小时田野录音能把转写加速到 2.4 倍吗:马库萨斯语 ASR 的单语、联合与人工校对实验
英文题目:Speech Recognition to Accelerate Documentation of Marquesan and Cook Islands Māori
标签:#迁移学习 #跨语言 #低资源 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#迁移学习
👥 作者与机构
- Marie Teikitohe:机构信息未能从会议 PDF 纯文本可靠映射
- Rolando Coto-Solano:机构信息未能从会议 PDF 纯文本可靠映射
- Sally Akevai Nicholas:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理野外采集的马克萨斯语自然对话转写,输入为含风噪、背景人声、二至四人重叠与法语语码切换的长录音,输出为带时间切分的正字法文本,难点是仅17小时标注、38位46至86岁说话人、覆盖Nuku-Hiva等6种方言。方法链分4步:先用ELAN人工切分为平均3.7秒短句并剔除可识别法语词元得到短句级训练对,再以Wav2Vec2 Large XLSR-53等6种基础模型做单语监督微调,训练至验证集词错率拐点前停止,推理期对Wav2Vec2、MMS、Whisper与Omnilingual外挂KenLM语言模型纠正长元音、声门塞音与词边界,最后用Silero语音活动检测切分长音频、分段识别再按时间索引拼回ELAN可编辑层。与直接用大规模多语模型相比,该流程靠小语种适配加语言模型先验稳定正字法。最佳单语Wav2Vec2加语言模型在5次随机80/10/10划分下中位字符错率16.0%与词错率31.4%,库克群岛毛利语单语为1.8%与7.2%,较此前无语言模型约6%与18%明显下降。人工由自动语音识别出发校对比纯手工快0.7倍至2.4倍,第三说话人先校对后手写仍快约35%。结论仅适用于慢速清晰叙事,快速交互、环境噪声与法语混杂时仍需大量重听。全部实验消耗约246小时Nvidia A100计算时间。
🔗 开源资源
- 第三方资源:https://github.com/snakers4/silero-vad — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
955. 孟加拉语音素在哪里变清晰:Whisper 编码器中深度的可分性与规模效应
英文题目:Layer-wise Probing of Whisper’s Encoder Representations for Bengali Phone-like Units
标签:#评测协议 #可解释性 #语音学与音系 #语音 #音频分类
评分:5.9/10 | 创新 1.1/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#评测协议
👥 作者与机构
- Munim Thahmid:机构信息未能从会议 PDF 纯文本可靠映射
- Sadia Sharmin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究冻结的Whisper编码器在孟加拉语上何处形成音位类单元的线性可分表示,输入为连续语音与转写,输出为逐层音类判别性能曲线,难点在于低资源语言缺乏可靠音素对齐且短片段易受说话人与词汇泄漏干扰。方法链分为四步:先用多语言语音模型对罗马化转写做强制对齐并按规则合并相邻字形得到区间标签,再按最大时间重叠将区间映射到50 Hz编码帧并取中心段平均为层表示,接着逐层训练线性探针在说话人无关划分上评估,最后用最小对ABX判别与二元对立探针做无分类器交叉验证。相对自监督编码器的中期峰后速降,监督语音识别训练被认为能把音系细节保留到更深编码层,这构成机制差异与复用冻结特征的实际意义。在共享2000话语子集说话人无关评测设置下,Whisper-medium在15/24层的Macro-F1为0.858 ± 0.003,高于Whisper-small在8/12层的Macro-F1 0.837±0.017。结论仅适用于粗粒度罗马化代理标签与自然语境判别,精细音系与上下文受控泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
956. 丢包后相位为何先坏掉:用解耦双流分别修能量与对齐
英文题目:DDSN: A Physics-Aware Decoupled Dual-Stream Network for Speech Packet Loss Concealment
标签:#时频分析 #严格因果 #语音 #丢包修复
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#丢包修复 | 主方法:#时频分析
👥 作者与机构
- Hao Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Yonghui Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Jianbing Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Niu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiqiang He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
丢包隐藏(packet loss concealment / PLC)需在因果约束下,仅用被二值掩码置零的历史频谱重建当前帧并合成连续波形,长突发丢失切断短时依赖、迫使模型依赖全局上下文以避免不连续伪影是主要难点。本文提出包裹相位感知的解耦双流网络(Wrapped-Phase-Aware Decoupled Dual-Stream Network / DDSN),链条分四步:幅度流取对数幅度谱、相位流取三角表示独立编码并保持时间分辨率,共享时间卷积网络(temporal convolutional network / TCN)瓶颈融合全局上下文以对齐两流,缩放非对称残差引导(scaled asymmetric residual guidance / SARG)以幅度先验单向增强相位细节,流形约束解码与多分辨率重建完成相干合成。与直接拼接实虚谱或 PHASEN 式乘性门控不同,SARG 以 1 为基底做加性调制,仅用幅度掩码增强细节,避免低能量区相位被截断,从而保持复平面拓扑连续与波形相干,并以余弦正弦回归与正交投影绕开相位卷绕不连续。在 INTERSPEECH 2022 PLC 盲测集上 DDSN 以 PESQ 3.25、PLCMOS 4.08 超过 cplx-bin2bin 的 3.16、3.95。在 VCTK 合成集 50% 丢包率下 PLCMOS 为 3.76,远高于对照的 2.42。该结论仅在 16 kHz 英语朗读语音、Gilbert-Elliot 合成突发与该盲测集范围内验证,未覆盖音乐、强混响或多语言自发对话。原文未披露训练硬件、推理延迟与实时因子实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
957. 不教音素也能分出音素:肌电静音语音里语音表示何时出现、何时失效
英文题目:Emergence of Phonetic Representations in EMG-based Silent Speech Interfaces
标签:#Conformer #语音学与音系 #生理信号 #静默语音接口
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#静默语音接口 | 主方法:#Conformer
👥 作者与机构
- Guillaume Toussaint:机构信息未能从会议 PDF 纯文本可靠映射
- Deborah Pereg:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Scheck:机构信息未能从会议 PDF 纯文本可靠映射
- Tanja Schultz:机构信息未能从会议 PDF 纯文本可靠映射
- Jürgen Schmidhuber:机构信息未能从会议 PDF 纯文本可靠映射
- Michael Wand:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究表面肌电静默语音接口的表征语义,输入为8通道面部肌电,输出为梅尔频谱、音素序列或字符文本,难点在于标注稀缺且肌电与语音映射隐式纠缠。方法链分三步:第一步由3个残差卷积块加12层Conformer共享编码器将肌电时序编码为隐表征,其输出同时送入各任务头与后续探测;第二步以帧级均方误差回归梅尔谱、以交叉熵分类MFA音素、以CTC解码字符构成多任务监督,另设emg2vec掩码对比预训练分支先预训练再微调;第三步冻结编码器,用线性分类器探音素、线性回归器探梅尔谱并以预训练Wav2Vec2计算合成词错误率,辅以UMAP可视化以检验语义分离。与已有肌电预训练工作相比,关键差异是将线性探测首次系统用于回归型合成目标,并在统一主干下对比有监督与对比预训练的语义。在Gaddy and Klein单说话人数据集上,多任务EMG到语音加音素监督模型线性探测音素准确率含静音达84.29%、去静音达52.84%,显著高于预训练模型的37.56%与4.45%,而纯音素模型合成探测WER达100%。结论仅适用于单说话人小数据英语有声与无声对齐场景,未验证多说话人、跨电极与大规模预训练外推性。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
958. 不用算协方差也能做分布式增强:ANDFilter 把 DANSE 的两步迭代改成三段神经滤波
标签:#端到端学习 #麦克风阵列 #语音 #语音增强
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#端到端学习
👥 作者与机构
- Jiawei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoqing Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Feiran Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianfei Tong:机构信息未能从会议 PDF 纯文本可靠映射
- Guohua Sun:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无线声传感器网络(Wireless Acoustic Sensor Network,WASN)语音提取需在每节点仅传一路压缩信号的约束下,从多节点含混响带噪观测中恢复参考麦克风目标语音,难点是低信噪比与非平稳下协方差估计与矩阵求逆不稳定。本文提出全神经分布式滤波器(All-neural Distributed Filter,ANDFilter),先由单节点滤波模块对本地多通道谱做空谱编码并合成局部滤波器得到压缩信号,再由节点选择模块以本地表示为查询对远端压缩信号做余弦注意力加权聚合,最后由多节点滤波模块融合本地观测与聚合信号直接合成全局复数滤波器。与分布式自适应节点信号估计相比,该链路用前向函数逼近替代迭代统计优化与显式求逆,因而免于协方差误差累积并支持端到端监督。在LibriSpeech与Freesound仿真的4节点测试集上,ANDFilter平均达到语音质量评估(Perceptual Evaluation of Speech Quality,PESQ)2.86与扩展短时客观可懂度(Extended Short-Time Objective Intelligibility,ESTOI)0.83,明显高于分布式自适应节点信号估计的1.44与0.61。该结论仅适用于全连接仿真房间、单目标单噪声与固定阵列几何,尚未验证节点缺失、时钟失配与真实混响泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
959. 对不准就念错:用注意力对齐分数与教师对齐路径消除大模型语音幻觉
英文题目:Eliminating Stability Hallucinations in LLM-based TTS models via Attention Guidance
标签:#注意力机制 #知识蒸馏 #正则化 #文本到语音
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#注意力机制
👥 作者与机构
- Shiming Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhihao Du:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Xiang:机构信息未能从会议 PDF 纯文本可靠映射
- Tianyu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Han Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Qian Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hanjie Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
基于大语言模型(Large Language Model, LLM)的文本到语音(Text to Speech, TTS)以文本与说话人提示为输入,自回归预测离散语音Token,缺乏显式对齐导致在长文本与困难文本上出现重复、无限延长与漏读等稳定性幻觉。本文以 CosyVoice2为对象分析解码器自注意力,发现中层存在类似交叉注意力的前向对齐带,据此提出最优对齐分数(Optimal Alignment Score, OAS):用维特比(Viterbi)动态规划在语音到文本注意力子矩阵中找到全局概率和最大的单调路径,再以路径概率占对齐区域总概率之比度量连续单调对齐质量。作者将第8层与第9层各一半注意力头指定为对齐头并加掩码限制其只关注文本到语音区域,以路径负对数似然作为正则(\(L\_\{OAS\}\))联合训练;再用预训练教师模型中OAS最高头的最优路径换算文本Token持续时长,构造稀疏重复文本与进度条(progress bar)伪标签,以思维链(Chain of Thought, CoT)方式指导学生模型在预测语音Token时同步预测文本位置。与硬单调注意力及依赖强制对齐标签的方法不同,该链条无需外部对齐器且保留语音连续性。在Seed-TTS-Eval困难集上词错误率(Word Error Rate, WER)从13.568%降至9.984%,在CV3-Eval困难中文集上从10.239%降至6.660%,通用集相似度、UTMOS与主观平均意见分(Mean Opinion Score, MOS)未下降。结论仅在中文普通与困难朗读场景验证,未覆盖多语言、长篇章、流式与强重复口语,训练与推理成本未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
960. 从有无烦躁到有多烦躁:以强度与时间建模服务对话升级
英文题目:HaessigDB: A Database of Irritable Speech with Intensity Grading
标签:#数据集 #数据集构建 #LoRA #语音 #语音情感识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音情感识别 | 主方法:#数据集构建
👥 作者与机构
- Niklas Weller:机构信息未能从会议 PDF 纯文本可靠映射
- Marc Grau:机构信息未能从会议 PDF 纯文本可靠映射
- Ivo Blohm:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为银行客服场景下按句切分的连续客户语音片段,输出为烦恼、挫折与攻击性三维度的1至10级序数强度,难点在于词汇礼貌但韵律已变质的早期微弱信号难以用二分类捕捉且随对话演化。方法链条由合成剧本生成与演员录音构成可控时序刺激源,接着由众包多标注者提供三维强度评分并过滤低质标注,最后经基于序数 Krippendorff α 的迭代剔除形成各维度高一致子集以支撑可靠监督学习。相对 Emo-DB 与 IEMOCAP 等通用类别语料,关键机制差异在于同时建模强度分级与对话内轨迹,使升级风险可被连续跟踪而非事后分类。在攻击性高一致子集的留出测试集条件下,XLSR-wav2vec的MAE为1.333,低于HuBERT的MAE 1.502。结论仅适用于表演化英语银行客服录音与内部划分,跨说话人、跨领域与真实噪声下的外推尚未验证。训练使用单卡16GB NVIDIA T4,批量大小4、学习率1e-4、微调5轮,推理与部署成本未量化。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
961. 发音错误不够采时,让模型在测试句上自己再学一步:SEA-MDD
英文题目:SEA-MDD: Self-adapting Mispronunciation Detection and Diagnosis Models via Test-Time Training
标签:#教育 #自监督学习 #测试时自适应 #语音 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#测试时自适应
👥 作者与机构
- Minglin Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Helen Meng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
发音错误检测与诊断(Mispronunciation Detection and Diagnosis,MDD)需将第二语言(Second Language,L2)朗读语音转写为音素序列,再与标准发音对齐以给出接受或拒绝判决,其难点在于学习者水平与错误类型分布高度发散而大规模标注不可行。本文提出自适应MDD方法(Self-adapting MDD,SEA-MDD),先由卷积特征编码器将原始波形转为隐表示,再经融合测试时训练(Test-Time Training,TTT)模块的Transformer建模上下文,最后经线性层输出音素后验并以联接时间分类(Connectionist Temporal Classification,CTC)损失优化,外环学习通用参数而内环在每条测试语音上以重建损失即时更新记忆权重。与依赖目标说话人额外数据的元学习适配相比,该机制无需跨句收集数据即可在单句内消除表征意外性。在CU-CHLOE测试集评测下,SEA-MDD-MLP全块配置的PER为8.03%,低于wav2vec2-CTC基线的PER 8.53%,且其F1为81.54%,高于该基线的F1 80.40%。该结论目前仅在粤语与普通话口音英语朗读数据上验证,对其他母语背景与自发语音的外推尚未证明。单句适配额外延迟在首块配置下仅为 3 ms 至 5 ms,全块配置最高为 52 ms,训练使用 2 块 NVIDIA H100 完成 20000 步更新。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
962. 查询保分辨率、键值做压缩:用分层池化吃掉语音时间冗余
英文题目:Leveraging Temporal Redundancy via Layer-wise Key-Value Pooling Attention for Efficient ASR
标签:#注意力机制 #高效推理 #流式处理 #语音 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#注意力机制
👥 作者与机构
- Yi Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Guibin Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Chenhao Jing:机构信息未能从会议 PDF 纯文本可靠映射
- Jiqing Han:机构信息未能从会议 PDF 纯文本可靠映射
- Jiarui Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别需处理长时声学帧序列并保留音素边界精度与长程语义,标准自注意力二次复杂度与相邻帧冗余迫使模型堆深。该文提出键值池化注意力,先对键和值做时域平均池化压缩而保持查询全分辨率,再将池化索引映射回声学窗中心以校准相对位置编码,接着用窗右边界重构因果掩码并用全窗有效规则重构填充掩码,最后按编码器不同阶段预设差异化步长完成编码识别。与直接下采样输入或稀疏线性注意力不同,该机制解耦查询与上下文分辨率,既扩大感受野又保留边界定位。在AISHELL-1上大模型测试集字符错误率由6.58%降至6.35%,LibriSpeech测试集other词错误率由8.32%降至8.09%,同时单核CPU实时率相对下降约10%。该结论限于剪枝Transducer框架下的Zipformer变体与中英文朗读语音验证,干净小模型出现回退,严格流式部署尚未验证。原文未披露训练超参数细节与训练推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
963. 墙挡住声音时,如何让分散的麦克风拼出一条走得通的叙述
英文题目:Geometry-Informed Distributed Acoustic Scene Understanding
标签:#图神经网络 #Transformer #大语言模型 #麦克风阵列 #音频理解
评分:5.9/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频理解 | 主方法:#图神经网络
👥 作者与机构
- Yiyuan Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Shitong Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Niki Trigoni:机构信息未能从会议 PDF 纯文本可靠映射
- Andrew Markham:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多房间声学场景理解以分布式同步音频与环境几何为输入,输出物理一致的自然语言场景叙事,难点是墙门遮挡造成的非视距缺失与跨房间声音泄漏混淆。该框架先以共享音频谱Transformer编码各节点对数梅尔谱并拼接三维坐标位置编码,得到节点级声学表征。随后拓扑感知图卷积以墙体衰减边权做空间消息传递,并经门控循环单元建模时序,输出统一时空嵌入。该嵌入经基于查询的注意力解码器转为离散语义三元组序列,再将三元组与几何邻接日志线性化为提示交由冻结大语言模型补全缺失迁移并生成叙事。与集中式单阵列相比,该机制显式用墙体衰减边权抑制不可靠泄漏路径,并用邻接约束修正非物理房间跳变。在自研多房间仿真器基准下,完整框架的三元组F1为0.87,高于集中式单阵列基线的三元组F1 0.51。空间一致性得分(Spatial Consistency Score, SCS)为88.2%。结论仅适用于受控仿真房间与有限事件并发,真实混响、开合门动态变化与多人重叠尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
964. 重音太轻听不出、太重又失真:三段式训练如何让流匹配语音学会用力恰当
英文题目:Refining Emphasis Control in Flow-Matching TTS via Preference Alignment and Reinforcement Learning
标签:#流匹配 #偏好优化 #强化学习 #韵律 #文本到语音
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#偏好优化
👥 作者与机构
- Jiangnan Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Jiawei Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Pengfei Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Xuerui Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向中文文本到语音中的重音控制,输入为带重音标记的文本,输出为在指定词上实现可感知凸显且保持自然度的语音,难点在于人工标注稀缺且韵律感知高度非线性。该工作以流匹配骨干F5-TTS为底座,先经监督微调学习标记到韵律的初始映射,再用直接偏好优化在自动构造的偏好对上强化凸显区分度,最后以保持系数的在线强化学习Flow-CPS探索更强且自然的流轨迹。与依赖规则调参或大语言模型标签的已有方案不同,该链条用同一客观韵律度量小波韵律工具串联偏好构造与奖励反馈,并为非自回归模型设计了群组相对优势更新。在200条中文评测集上,最终系统重音凸显度达到1.45,明显高于原生F5-TTS的0.86,且词错误率维持在1.63%附近。该结论目前仅在中文、低资源标注与短句重音场景验证,对英文、长篇章及多重音泛化尚未证明。训练需多阶段迭代与8卡大显存集群支持,推理时延与部署开销原文未量化。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
965. 喉部太小又动得快:中矢面实时磁共振里怎样用很少标注分割喉部
英文题目:Larynx segmentation in mid-sagittal speech production real-time MRI
标签:#半监督学习 #发声与构音 #语音学与音系 #语音属性识别
评分:5.9/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#半监督学习
👥 作者与机构
- Yubin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xuan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Prakash Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Louis Goldstein:机构信息未能从会议 PDF 纯文本可靠映射
- Krishna Nayak:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为0.55T中矢状面实时磁共振成像序列,输出为甲状软骨等六类喉部结构语义掩膜及声带长度与喉高等动力学曲线,难点在于低场强分辨率低、喉部结构细小模糊且随发音快速形变。方法先由语音学家标注关键点边界并栅格化为二值掩膜,再用COCO预训练的Mask2Former微调得到全监督基线,随后以该基线初始化均值教师框架,用弱增强生成高置信度伪标签并以强增强训练学生模型。学生优化标注损失与伪标签损失的加权组合,教师权重以指数滑动平均更新,使未标注帧输出进入下一轮伪标签循环。相对既往聚焦声门上声道的高场强分割工作,该流水线系统评估标注比例收益与半监督增益,并将掩膜转化为可解释的语音学变量。在测试集评估条件下,100%标注条件的半监督模型的Dice相似系数得分高于25%标注条件的监督基线的Dice相似系数得分,原文未提供可核对的关键定量结果。该结论适用边界受限于普通话与约鲁巴语训练分布及四名普通话发音人192个音节样本验证,对甲状软骨等模糊结构可靠性低且半监督增益有限。原文未披露训练推理成本与延迟吞吐。
🔗 开源资源
- 第三方资源:https://github.com/facebookresearch/detectron2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
966. 不改模型参数,用多分辨率真伪判断来管住离散语音解码
英文题目:MSpoofTTS: Multi-Resolution Spoof-Guided Inference for Discrete Speech Synthesis
标签:#测试时自适应 #零样本 #语音 #语音伪造检测 #文本到语音
评分:5.9/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#测试时自适应
👥 作者与机构
- Junchuan Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Minh Duc Vu:机构信息未能从会议 PDF 纯文本可靠映射
- Ye Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成(Zero-Shot TTS)以文本与参考语音为输入,自回归生成离散神经编解码器(Codec)令牌序列,微小令牌偏差会在解码中累积漂移并产生可闻伪影。所提MSpoofTTS冻结NeuTTS2基座,不做重训或偏好优化,先在LibriTTS约100小时干净英语朗读数据上训练多分辨率令牌级鉴伪器组,区分真实金令牌(Golden Tokens)与合成令牌在不同时域跨度下的分布差异,再以熵感知采样(Entropy-Aware Sampling,EAS)生成候选延续,送入由短窗到长窗的分层剪枝与重排,最终只保留鉴伪排名最优的延续拼回主序列。在LibriSpeech上分层熵感知采样(HierEAS,即MSpoofTTS)NISQA达到4.602,高于原始核采样Original的4.462和EAS的4.571,MOSNet为4.4158,WER降至0.0532,说话人相似度(SIM)维持0.901,基本不损可懂度与音色。在LibriTTS与高难度TwistList舌绕口令集上感知增益趋势一致,但TwistList上HierEAS的WER为0.1531,弱于EAS的0.1433。结论目前仅在英语朗读与单一Codec加单一合成器闭环内验证,未证明跨编解码器、跨语言与强韵律迁移的外推性。原文未量化推理延迟、实时率与训练推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
967. 连续预测加量化约束为何比离散分类更稳:两种编解码增强路径的对照
英文题目:Towards Robust Generative Speech Enhancement Using Vector Quantisation-Based Neural Audio Codec
标签:#生成模型 #向量量化 #鲁棒性 #语音增强
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#向量量化
👥 作者与机构
- Haixin Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Nilesh Madhu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究基于向量量化神经音频编解码器的生成式语音增强,输入为带噪含混响波形,输出为感知干净语音,难点是干净预训练编解码器先验与失真输入隐表示之间的失配。方法复用干净语音预训练的Descript Audio Codec作编解码主干并固定码本,以干净连续隐表示与码本索引作隐层监督目标。连续分支用Transformer回归预测干净连续向量,再经残差向量量化投影到干净先验流形后解码重建波形。离散分支先经残差向量量化离散化再做多层码本分类,经查表求和重建隐表示后解码。关键差异是连续偏差为欧氏邻域偏离可被量化拉回先验附近,而离散错类导致隐空间跳变且交叉熵不约束数值距离,主成分分析可视化支持该解释。在DNS3公开测试集含混响条件下,全微调cNAC-SE的DNS-MOS总体质量OVL为2.91,高于微调dNAC-SE的DNS-MOS总体质量OVL 2.79。结论依赖DNS-MOS非侵入式评价与英语数据,未做主观听测与跨语言验证。该结论的适用边界受限于英语客观评价场景,主观听感与跨语言外推尚未验证。原文未披露训练时长、硬件与端到端延迟实测。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
968. 粗调音色、细调韵律:CtrlSpeech 如何把音高响度时长对齐到音素
英文题目:CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis
标签:#自回归模型 #扩散模型 #韵律 #零样本 #文本到语音
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#自回归模型
👥 作者与机构
- Zhisheng Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaohang Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Zhu Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Caren Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Rohith Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Manoj Aggarwal:机构信息未能从会议 PDF 纯文本可靠映射
- Gerard Medioni:机构信息未能从会议 PDF 纯文本可靠映射
- David Harwath:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可控表达性语音合成需以音素序列文本生成波形语音,并在保持目标音色下对特定音素或词的音高响度节奏做帧级局部控制,难点在于身份与韵律高度纠缠且缺乏时间对齐的控制接口。CtrlSpeech先将音素嵌入与离散化音高响度时长信号按音素对齐叠加构成细粒度条件,同时从提示语音提取全局说话人嵌入作为音色条件。两类条件与连续声学隐变量补丁一同送入因果自回归Transformer生成总结历史上下文的隐表示,该表示作为下一步生成的条件输入。局部扩散解码器以该隐表示为条件逐补丁重建VAE连续隐变量,再经BigVGAN声码器合成波形,支持先粗生成再细调的迭代流程。与仅提供句子级全局风格提示的方法不同,该设计将粗粒度身份与细粒度韵律显式分离并保持帧级对齐,因而可直接操控局部韵律事件而不破坏音色。在LibriSpeech-PC test-clean零样本合成设置下,CtrlSpeech(0.6B)的WER为2.46%,低于复现DiTAR基线的WER 2.55%。该结论适用边界受限于英语朗读语料的零样本合成任务,尚未验证情感跨语种自发语音与非言语声的外推,且失败条件包括基频提取与强制对齐误差较大的情形。训练成本为在8张NVIDIA A100 80GB硬件上训练5个epoch,推理开销为采用32步采样与1.5引导尺度的分类器自由引导解码。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
969. 看得见频率依据的伪造语音检测:分频带看破绽,门控融合补盲区
英文题目:Interpretable Frequency-Band Attention with Gated SSL Fusion for Audio Deepfake Detection
标签:#注意力机制 #自监督学习 #可解释性 #语音 #音频深度伪造检测
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#注意力机制
👥 作者与机构
- Abeer Alhammad:机构信息未能从会议 PDF 纯文本可靠映射
- Abdullah Aldahlawi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为变长语音波形,输出为整句真实或伪造判决,难点在于伪造痕迹在频域稀疏且随合成算法漂移,整体建模难以定位与泛化。该工作提出频带多示例学习BandMIL,先将重叠窗口切分为8个重叠频带图像并用共享编码器加手工特征提取带级表示,再经频带注意力Band Attention聚合为窗口级频域向量。同步用自监督学习Self-supervised Learning编码器WavLM-Large提取全局时序表示,经门控融合Gated Fusion按输入自适应加权后送分类器,最后以多示例学习Multiple Instance Learning聚合窗口分数为 utterance决策。与整体式自监督学习和后融合子带方法不同,该机制显式学习每输入的频带重要性与分支可信度,兼顾可审计性与互补建模。在ASVspoof 2019 LA评测集上完整系统取得1.28%等错误率Equal Error Rate和0.0331最小串联检测代价函数minimum tandem Detection Cost Function,优于同训练流程下自监督学习单分支的1.73%。结论仅在该旧基准的13种未知攻击上验证,对A18等转换攻击仍明显吃力且未验证跨数据集与野外泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
970. 只给 5 个样例,能连续记住 1000 个词吗:生成式元持续学习的可扩展性检验
英文题目:Scaling few-shot spoken word classification with generative meta-continual learning
标签:#持续学习 #元学习 #少样本 #语音 #音频分类
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#元学习
👥 作者与机构
- Louise Beyers:机构信息未能从会议 PDF 纯文本可靠映射
- Batsirayi Mupamhi Ziki:机构信息未能从会议 PDF 纯文本可靠映射
- Ruan van der Merwe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为1秒英文孤立词音频,输出为1000个候选词中的闭集类别,难点在于每类仅5个标注样本且类别持续增加。编码器将梅尔倒谱系数映射为嵌入向量,为后验建模提供表征基础。每类以正态伽马先验建模均值与精度并以闭式后验更新类统计量,新类观测不影响已学类参数。在查询集上计算交叉熵以元训练编码器与先验,元测试时冻结元参数并以学生t分布直接预测新词。与微调HuBERT基线反复重训全量参数不同,GeMCL以类独立统计量隔离更新从而免疫灾难性遗忘。在连续增加至1000类的持续学习场景下,GeMCL的波动指标为0.48,低于CH基线的波动指标7.13。该结论仅在英语孤立词、同分布元训练、25路元训练泛化到1000路的条件下成立,未验证开放集检测、噪声与跨语言外推。表2披露的训练成本以单卡小时累计元训练、调参与适配耗时。单卡累计成本上元训练加调参与适配共约42.9小时,显著低于基线数百小时的重训开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
971. 转录会错、动作测不了:用规则分加语音向量补救德语 SKT 痴呆筛查
标签:#语音生物标志物 #模型融合 #语音 #病理语音评估
评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#模型融合
👥 作者与机构
- Franziska Braun:机构信息未能从会议 PDF 纯文本可靠映射
- Christopher Witzl:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Erzigkeit:机构信息未能从会议 PDF 纯文本可靠映射
- Hartmut Lehfeld:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Hillemacher:机构信息未能从会议 PDF 纯文本可靠映射
- Tobias Bocklet:机构信息未能从会议 PDF 纯文本可靠映射
- Korbinian Riedhammer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理德语SKT的纯语音自动化评分,输入为临床面对面录音与Whisper转写,输出为各言语子测验粗分与总分对应的认知分级,难点是方言口罩病理语音导致的高转写误差与排序归还等运动子测验完全无语音证据。方法链先用规则评分从词时间戳与目标词典算出时长与漏报分,为后续校正保留可解释锚点。接着将该分数与同句Whisper编码器或解码器嵌入送入注意力加多层感知机的深度校正模型,以潜表征修正转写偏差并输出校正后粗分。最后把已校正的多子测验表征级联送入深度补偿模型以逼近含缺失运动分测的总分,并做序列优选以最少步骤达到决策阈值。相比直接转写计分或纯嵌入回归,其差异在于保留临床评分逻辑再用声学语言学潜表征做误差补偿,而非抛弃规则。在分层五折验证集的SKT总分补偿任务下,RB+ENC深度补偿模型的RMSE为1.93±0.15,低于规则评分RB的RMSE 2.58。该结论限于单中心德语 SKT 与老年队列,未验证跨语言跨量表与真实居家噪声下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
972. 分散阵列各自分离却对不上序号:用方向约束与分带源模型对齐去中心化向量分析
标签:#信号处理 #麦克风阵列 #语音 #语音分离
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#信号处理
👥 作者与机构
- Changda Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yichen Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Bing Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Shoji Makino:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
分布式麦克风阵列的输入是多个空间分散小阵列采集的混响混合语音,输出是各阵列本地的分离语音,难点是各阵列独立存在频域置换模糊且跨阵列输出序号不一致,导致共享源活跃度会混叠不同说话人能量。该方法先沿用辅助函数独立向量分析框架在各阵列本地估计解混矩阵并只交换功率统计量,其输出的功率谱进入按子频带重写的源模型以削弱跨阵列强依赖。随后基于DOA最大后验几何先验约束解混滤波器在干扰方向形成零陷,强制各阵列同一输出序号对准同一说话人,其约束后的代价再由向量坐标下降交替更新辅助变量与解混向量并经投影回传恢复尺度。与原Dec-IVA相比关键差异是用方向性零陷避免全局平均掩盖置换错误,并用分阵列加权惩罚跨阵列不一致,从而在噪声下保持对齐鲁棒性。在8阵列无噪声与含噪对比测试条件下,Loc-IVA的SDRi指标为2.44 dB,低于无噪声条件的SDRi指标4.10 dB。结论仅在 2 说话人、确定性 2 麦克风阵列、同步采集和已知 DOA 的仿真混响房间成立,未验证说话人移动、阵列异步与 DOA 估计误差下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
973. 认对情绪却回错情绪:CE-CoT 用中性回答做对照来校准共情语音大模型
标签:#对比学习 #语音大模型 #后训练 #语音 #语音对话系统
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音对话系统 | 主方法:#对比学习
👥 作者与机构
- Jing-Han Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Ya-Tse Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Bo-Hao Su:机构信息未能从会议 PDF 纯文本可靠映射
- Xin-Yu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Krishna Somandepalli:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
共情语音交互要求输入语音的说话人情绪与智能体回复情绪方向一致,难点在于语音大模型常能正确做语音情绪识别却生成情绪错位的回复。作者提出对比式共情思维链(Contrastive Empathetic Chain-of-Thought,CE-CoT),将单条回复拆为情绪标签(Emotion,e)、忽略情绪的中性回复(Neutral Response,rneu)与融合第一人称情绪反应和探索性追问的修正回复(Revised Response,rrev)三段,先由文本大模型Qwen-7B-Chat基于转录文本与真实情绪标签生成教师目标,再让语音大模型在语音输入加相同提示下复现该推理结构,从而保持训练与推理行为一致。相比直接模仿回复的常规行为对齐,该结构用同一输入下的中性与修正构成隐式对比,迫使模型学习修正方向。在MSP-Podcast评测任务下,BLSP-Emo经CE-CoT对齐相对常规对齐版本的情感共识得分提升为19.1%,高于相对预训练版本的情感共识得分提升18.8%。该提升源于语音模型以KL散度拟合教师三段式推理而非仅拟合表层文本,使情绪识别、中性生成与共情修正形成可控链条。该结论适用边界受限于单轮四类情绪与Gemini Flash 2.0自动裁判,尚未验证多轮对话与更细腻共情策略。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
974. 从算波形差到听懂好坏:LR-AVSE 用大模型描述生成可解释奖励
英文题目:LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
标签:#强化学习 #音频大模型 #可解释性 #音视频 #语音增强
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#强化学习
👥 作者与机构
- Chih-Ning Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jen-Cheng Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Hsin-Min Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shao-Yi Chien:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
- Fan-Gang Zeng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频语音增强以含噪语音与唇部视频为输入并输出干净波形,难点在于均方误差与尺度不变信噪比与人耳感知错位。LR-AVSE先以编码器-分离器-解码器基座输出时域掩码并注入高斯扰动构造随机策略,其输出进入冻结语音语言模型SALMONN。SALMONN生成清晰度与噪声的自然语言评价并经情感分析模型转成1-5分相对奖励,再以近端策略优化联合尺度不变信噪比微调策略。与直接回归平均意见分的标量奖励不同,该链条保留文本作为可读证据并以相对增益稳定训练,从而实现可解释的感知对齐。在AVSEC-4测试集上该方法感知语音质量评估(Perceptual Evaluation of Speech Quality,PESQ)达到1.25,超过预训练基线的1.20与RL-DNSMOS基线的1.24,同时主观偏好率分别达96.7%与67.6%。在AVSEC-4测试集下,LR-AVSE的PESQ为1.25,高于预训练基线的PESQ为1.20。该结论适用边界受限于双耳英语场景与真实房间脉冲响应,跨语言跨噪声与更强LLM下的可迁移性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
975. 缺一侧性别标签时,如何把另一侧的公平补回来
标签:#对抗训练 #迁移学习 #公平性 #语音 #语音情感识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#迁移学习
👥 作者与机构
- Woan-Shiuan Chien:机构信息未能从会议 PDF 纯文本可靠映射
- Tomohiko Nakamura:机构信息未能从会议 PDF 纯文本可靠映射
- Huan-Yu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Satoru Fukayama:机构信息未能从会议 PDF 纯文本可靠映射
- Hitoshi Suda:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Ogata:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别输入为语音与文本查询,输出为Neutral、Happiness、Anger、Sadness四类情绪,难点是说话人侧与标注人侧性别偏置并存,而目标域常缺失一侧性别标签导致传统双侧去偏无法训练。第一阶段在属性完备源域以对比语言音频预训练为基座微调情绪分类器,并联两层全连接性别分类器做对抗去偏,分别得到说话人侧与标注人侧单侧公平模型。第二阶段计算源域两侧公平模型参数差作为属性到公平任务向量,按缩放系数加到目标域已知单侧模型上以推断缺失侧模型,前一阶段输出的单侧参数直接构成后一阶段向量计算与加算的输入。与需双侧标签的对抗去偏不同,该机制把公平校正视为可在参数空间平移的方向而非重新训练约束,因而无需目标缺失侧标签即可实现跨数据集公平迁移。在跨数据集嵌入对齐评测设置下,BIIC-Podcast的平均余弦相似度指标为0.33,高于IEMOCAP的平均余弦相似度指标0.31。其适用边界限于性别二分类、三套播客及表演数据集和四情绪分类,尚未验证其他属性、语言与真实部署分布。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
976. 音频不变只改身份描述:语音大模型情绪判断为何随之漂移
英文题目:Hidden Priors in Speech LLMs: Speaker Identity Shapes Emotional Perception
标签:#LoRA #公平性 #语音 #语音情感识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#LoRA
👥 作者与机构
- Hsing-Hang Chou:机构信息未能从会议 PDF 纯文本可靠映射
- Bo-Hao Su:机构信息未能从会议 PDF 纯文本可靠映射
- Krishna Somandepalli:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从韵律与音色等副语言线索映射到Neutral、Angry、Happy与Sad四类标签,难点在于语音大模型同时受音频信号、提示词措辞与预训练分布调制,文本注入的说话人身份描述可能形成先验并覆盖声学证据。作者先固定同一 utterance音频不变,仅插入口音、国家与语言3类共12种身份语句构成36种提示变体,得到可控的身份条件预测分布。接着以前述分布中最佳与最差身份条件间的F1gap度量敏感性,并以逐utterance置换检验判断其是否显著超出零假设,该检验输出的显著敏感用例进入下一步声学聚焦分析。然后在音频区间上计算梯度显著性归一化累积分布及其平均绝对偏移,以检验预测翻转是否伴随声学关注重分配,最后冻结音频编码器并以轻量LoRA适配语言模型做混合提示脱敏微调。该工作与以往多任务或对抗去说话人表征不同,直接将说话人身份作为可控文本变量,从而分离声学证据与语境先验对情感判断的作用。在MSP-Podcast评测设置下,Qwen2-Audio语言条件的F1gap指标为0.1239,高于混合提示LoRA微调的F1gap 0.0025。结论仅适用于单句提示词注入的 12 种口音、国家与语言描述,未验证组合身份或真实说话人属性的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
977. 拼语料加自动算语速:库克群岛毛利语只有部分岛屿年轻人更快
标签:#统计分析 #社会语音学 #低资源 #语音 #语音识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#统计分析
👥 作者与机构
- Rolando Coto-Solano:机构信息未能从会议 PDF 纯文本可靠映射
- Sally Akevai Nicholas:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为库克群岛毛利语Cook Islands Māori(CIM)的田野录音与社交媒体音视频,输出为按岛屿与年龄分组的语速差异解释,难点在于低资源转写不可靠、社会元数据缺失以及说话人跨岛流动性强。先输入原始音视频用Silero语音活动检测切分发声片段并输出时间边界,再将该边界内音频送入Wav2Vec2语音识别生成转写并按莫拉计数输出莫拉每秒语速,最后将语速与人工核验的岛屿归属及五十岁人工二分年龄一起送入带年龄与岛屿交互项的线性回归以输出效应检验。与只做小规模人工标注的社会语音学不同,该流程用半自动管道扩充语料并以保序验证保留相对比较可比性。在三岛田野与社交媒体语料下,Nga Pu Toru年轻组的语速指标为7.7 moras/second,高于年长组的语速指标6.8 moras/second。Rarotonga两代人无显著差异,Aitutaki整体更快但代际差异亦不显著。结论仅适用于所覆盖三岛及当前代际语言活力格局,不能外推至北部岛屿或其它韵律特征。该外推尚未验证,适用边界受限于所覆盖三岛与现有说话人样本。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/snakers4/silero-vad — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
978. 长口语要同时听清怎么说、说什么和是否答题:M-LAMA 的结构化多模态评分
英文题目:M-LAMA: Multimodal Automated Scoring of Long-form Spoken English
标签:#教育 #多模态学习 #长音频处理 #语音 #语音质量评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#多模态学习
👥 作者与机构
- Minh Dao-Xuan-Quang:机构信息未能从会议 PDF 纯文本可靠映射
- Son Dinh-Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Thi-Mai-Anh Bui:机构信息未能从会议 PDF 纯文本可靠映射
- Phi-Le Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向认证类口语考试的自动语音评估需对3至5分钟自发长语音在发音、流利度、词汇、语法和话语管理5个维度同时打0至10分,难点在于长程话语连贯性建模、声学实现与语言内容的交互以及分数高度集中于中段的偏置优化。所提M-LAMA先用冻结Whisper编码器加瓶颈适配器提取分块声学特征并按考试三段做注意力池化以保留话语结构,其输出与ASR转写一同进入下一步。接着用冻结Qwen2文本编码器对转写与题目做问题感知编码得到任务条件语义表征,再以双向跨模态注意力与门控融合统一四路表征并映射为21档分数分布求期望。最后经对比对齐、粗粒度分档到细粒度回归的三阶段渐进优化缓解中段偏置并稳定全谱学习。与已有音频大模型直接拼接或提示词打分不同,该设计把题目条件、话语分段与分布感知训练内建为结构先验,具有更强的多标准对齐意义。在完整测试集上多阶段模型在流利度上相对Qwen2.5 Omni将平均绝对误差(Mean Absolute Error,MAE)由0.84降至0.59并把容差1分准确率(Acc@1)由66.53%提升至91.39%。该结论适用边界受限于单一机构私有认证数据与考生级划分,跨考试类型与跨母语迁移能力尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
979. 穿墙雷达语音为何高频尽失:用级联注意力先守时间再补频谱
英文题目:Through-Wall Radar Speech Acquisition via Cascaded Attention Fusion
标签:#注意力机制 #单通道 #语音 #语音增强 #语音超分
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#注意力机制
👥 作者与机构
- Ruotong Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Zhi-Wei Tan:机构信息未能从会议 PDF 纯文本可靠映射
- V.G. Reju:机构信息未能从会议 PDF 纯文本可靠映射
- Andy W. H. Khong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
穿墙雷达语音采集以单通道复数谱 \(M&\#40;f,\\tau&\#41;\) 为输入,目标是估计干净语音谱 \(S&\#40;f,\\tau&\#41;\),难点是杂波噪声强、1 kHz以上高频严重衰减且高频信噪比远低于0 dB,模型沿用含噪相位而专注于对数幅度谱恢复以保障可懂度。所提级联注意力融合Transformer(Cascaded Attention Fusion Transformer,CAF-Former)先将可靠低频幅度作为初始输入,再经10层渐进式Transformer逐层向高频扩展频带并逐层精炼谱细节。然后每层内时间多查询注意力(Temporal Multi-Query Attention,TMQA)以共享键值产生互补时间注意力图,接着频率注意力融合(Frequency Attention Fusion,FAF)沿频率轴建模跨频依赖并重标定谱结构,最后经前馈与残差输出全带幅度。与传统多头自注意力(Multi-Head Self-Attention,MHSA)线性拼接多头不同,该设计用共享谱基缓解头碎裂,并让低频线索显式指导高频谐波恢复,从而抑制伪影并保持共振峰连续性。在实录穿墙测试集上,CAF-Former在STOI指标上达到0.617,超过最强基线TF-Locoformer的0.612。该结论目前仅在5.31 GHz、15 cm混凝土墙和激振器声源下验证,未验证真人声、其他墙体与实时部署。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
980. 三小时单人语料做声调语言合成:Efik 语音保存为何选中多语言预训练路线
英文题目:Towards Digital Preservation of Efik: TTS for a Low-Resource African Language
标签:#数据集 #SFT #主观评测 #低资源 #文本到语音
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#SFT
👥 作者与机构
- Offiong Bassey Edet:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Oyo-Ita:机构信息未能从会议 PDF 纯文本可靠映射
- Archibong Okon Archibong:机构信息未能从会议 PDF 纯文本可靠映射
- David Effanga Bassey:机构信息未能从会议 PDF 纯文本可靠映射
- Mbuotidem Sunday Awak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
Efik 文本到语音(Text-to-Speech, TTS)的输入为带声调正字法的 Efik 文本,输出为可懂且保留词汇声调的语音,难点是在约 3.08 小时单说话人数据下联合建模音段与声调轮廓。方法链分为三步:先以无线麦克风在安静室内采集小说、民间故事与教材朗读并做人工转写与声调校对,再将音频统一转码至 16kHz 单声道 wav 并切分后送入四个预训练 TTS 做适配微调,最后由母语者从整体质量、自然度与口音保持三维打分。与从零训练的端到端方案不同,该工作依赖多语言预训练(Multilingual Pretraining)的跨语言迁移来弥补极低资源,尤其借用 Yoruba 检查点扩展 Efik 特殊字符。在测试子集母语者评测中,多语言语音合成(Multilingual Speech Synthesis, MMS-TTS)以平均意见分(Mean Opinion Score, MOS)3.80 分领先次优 Orpheus-TTS 的 3.08 分,并可稳定生成近 3 分钟长语音而其他模型在 20 秒到 30 秒后即幻觉。该结论仅适用于短句单说话人朗读体,声调误读与罕见鼻化音仍未解决,多说话人与自发语体未经验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/canopyai/Orpheus-TTS — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/openai/whisper — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
981. 同样的书,为何不同人读出不同的吸引力:有声书叙述声学特征的可核对解读
英文题目:Audio-Based Understanding of Audiobook Narration Appeal
标签:#统计分析 #韵律 #语音 #音频理解
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频理解 | 主方法:#统计分析
👥 作者与机构
- Shahar Elisha:机构信息未能从会议 PDF 纯文本可靠映射
- Mariano Beguerisse-Díaz:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanouil Benetos:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为单叙述者英语有声书录音、体裁标签与文本来源链接,输出为叙述吸引力的关联解释与预测,难点在于内容热度、体裁期待与录制质量相互混杂且真实完播行为不可得。方法链先将每本录音按章节切分为30秒片段并采样拼接,再用eGeMAPS、YAMNet与Whisper转录三通道抽取频率、能量、频谱、节奏与音频事件表征并聚合为129维书级向量,接着用广义线性模型做全局回归、按体裁独立拟合观察特异性、用线性混合效应模型以书组随机截距吸收标题效应,最后用四分位分类与组内排序检验预测力。相对以往小规模感知实验或合成语音偏好调查,差异在于以8854本大规模真实消费与同文本多版本对照控制内容混淆。LibriVox全局回归伪R2为0.09,Spotify回访率子集提升至0.16,组内排序Kendall’s τ在回访率下达到0.28且显著优于随机。结论仅适用于英语志愿朗读与粗粒度人气代理,难以直接外推至专业演播与个性化偏好。原文未披露训练推理成本与延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
982. 时间接近当标签:从自然语音里学心衰变化的方向
英文题目:Contrastive Time-Proximity Pre-Training for Speech-Based Heart Failure Monitoring
标签:#语音生物标志物 #对比学习 #跨语言 #语音 #病理语音评估
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#对比学习
👥 作者与机构
- Tobias Fiedler:机构信息未能从会议 PDF 纯文本可靠映射
- Mariam Fouad:机构信息未能从会议 PDF 纯文本可靠映射
- Marcus Hott:机构信息未能从会议 PDF 纯文本可靠映射
- Leonhard Riehle:机构信息未能从会议 PDF 纯文本可靠映射
- Felix Hohendanner:机构信息未能从会议 PDF 纯文本可靠映射
- Bruce Johnson:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Cummins:机构信息未能从会议 PDF 纯文本可靠映射
- Bert Arnrich:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
心衰急性失代偿检测需从自然朗读语音中排出入院水肿态与出院缓解态的相对顺序,难点在于内容可变与录音条件及语言差异淹没细微病理信号。排序需跨患者消除绝对水平差异并聚焦个体内纵向趋势变化。方法链分三步衔接:梅尔频谱切分为短段并由共享双向长短期记忆网络编码帧级表示,注意力先在段内聚合帧再在段间聚合为整段向量,时间邻近对比目标拉近同患者短期录音并推远长期录音以注入纵向敏感性。相比沿用说话人验证不变性或手工声学特征,该机制显式利用心衰渐进性假设而非内容无关身份区分。与经典声学特征相比,对比时间邻近表示在 Mayo 跨中心跨语言测试上以 XGBoost 排序器取得 0.61 准确率而基线跌至 0.34,显示更稳的迁移趋势。结论仅适用于入院出院极端状态排序,未验证连续失代偿程度跟踪与大规模远程监测外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
983. 指令监督不稳:用受控扩写保覆盖、用漂移过滤保忠实
标签:#数据增强 #数据清洗 #指令微调 #语音 #文本到语音
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#数据清洗
👥 作者与机构
- Yizhong Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Kecan Mao:机构信息未能从会议 PDF 纯文本可靠映射
- Qifei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Cong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yingming Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Ruimin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Chunfeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ya Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
指令式语音合成任务输入为用户自由文本指令,输出为口音、情感、语速、音量等多维风格可控语音,实际难点是大规模指令语音监督难采集,而大语言模型(Large Language Model,LLM)改写结构化标签所得指令存在同质化与语义漂移腐蚀监督。流程第一步做属性对齐的数据准备,对每段语音做变调变速变音量参数化扰动并配模板提示,形成可信低层韵律锚点。第二步以上一步的扰动后语音与结构化标签为种子,用人物视角(Persona)、句法模式(Syntactic Pattern)与属性槽位(Attribute Slots)硬约束有界枚举生成多样化指令候选,系统扩展覆盖。第三步用异源验证器对候选评分并对边界样本投票,仅保留高保真指令语音对进入第四步监督微调(Supervised Fine-Tuning,SFT),以先扩覆盖后滤漂移区别于无约束改写。在中文InstructTTSEval上完整方案平均指令遵循准确率56.4%,超过同骨干无微调34.5%与朴素微调51.0%,外部基线VoxInstruct为47.5%;无约束改写漂移率40.4%降至约束改写15.4%,过滤后审计约5%。结论目前仅在中文单语料与CosyVoice 2.0-0.5B单基座验证,未检验跨语言与真实用户分布外推。原文未披露训练硬件、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
984. 不只看不确定性:用时频结构引导音频主动学习选样
英文题目:Beyond Uncertainty and Diversity: Temporal-Spectral Guided Active Learning for Audio
标签:#时频分析 #低资源 #环境声 #音频分类
评分:5.8/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#时频分析
👥 作者与机构
- Hui Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Tianjiao Wan:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Su:机构信息未能从会议 PDF 纯文本可靠映射
- Qisheng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Hengzhu Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Kele Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频分类需从海量无标注波形中挑选少量值得标注的样本,难点在于瞬态事件与谐波连续性等时频结构难以显式定义而通用不确定性准则将其视为静态向量。时频主动学习(Temporal-Spectral Active Learning,TSAL)先在已标注集上微调自监督音频频谱Transformer(Self-Supervised Audio Spectrogram Transformer,SSAST)并建模软损失分布以筛选高损失锚点,该输出刻画难学模式。接着为锚点与无标注样本分别提取特征嵌入与伪标签梯度并计算特征梯度相似度,该得分实现按结构对齐排序。然后取最高分批次查询标注并回流到标注集进入下一轮微调循环。与基于置信度与几何覆盖的方法不同,TSAL以优化轨迹相似替代预测统计量,从而显式偏好共享难学时频模式的样本。在ESC-50基准下,TSAL的准确率为82.65%,高于随机采样基线的准确率79.90%。该结论限于闭集分类与中等预算循环微调,未验证开放集检测与跨域迁移下的失效行为。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
985. 不用系统日志也能评对话质量吗:微调让系统无关特征追上系统相关特征
英文题目:A System-Agnostic Approach to Modelling Interaction Quality in Spoken Dialogue Systems
标签:#多模态学习 #RNN #模型评估 #语音 #语音对话系统
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音对话系统 | 主方法:#多模态学习
👥 作者与机构
- Paul Gering:机构信息未能从会议 PDF 纯文本可靠映射
- Roger K. Moore:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
交互质量预测输入为系统提示与用户回应的多轮交换序列,输出为1至5级满意度标签,难点在于标签偏斜严重、噪声大且传统系统依赖日志无法跨系统复用,跨语种与全自动转写场景尚未验证。该方法先用语音活动检测与Whisper转写加人工校对构建时序对齐的双说话人文本,再用自监督声学编码器与文本编码器分别提取交换级声学与语义表示并融合时长与轮次等时序特征,最后用带自注意力的单向长短期记忆网络建模对话上下文输出交互质量。与直接使用人工设计的系统日志代理特征不同,系统无关路线依赖可微编码器端到端微调来自适应噪声与任务语义。在LEGO语料对话级划分的测试集下,微调后SA模型的Macro-F1为0.454,低于SD模型的Macro-F1 0.462。该结论仅在电话公交查询、英语、人工校对转写条件下成立,未验证全自动转写与跨系统迁移。跨系统迁移的泛化上限尚未验证。微调使SA可训练参数增至135.73M、单交换推理延迟增至17.98 ms,但仍低于20 ms实时阈值。
🔗 开源资源
- 第三方资源:https://github.com/snakers4/silero-vad — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
986. 压住能量掩蔽之后:调制释放如何抵消信息掩蔽与能量代价
英文题目:Mutual Cancellation between Masking Effects Benefits Speech Intelligibility
标签:#心理声学实验 #言语感知 #多语言 #语音 #语音可懂度评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#心理声学实验
👥 作者与机构
- Yixin Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Tang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
英语目标句在英语或普通话竞争语音下的可懂度同时受能量掩蔽、信息掩蔽与调制掩蔽牵制,难点是三者随信噪比与调制相似度耦合而难以分离。先以Harvard英语目标句与英汉竞争语音及平稳噪声为输入,构造目标-竞争对并衍生保留不同程度频谱与时域调制的6种掩蔽器,输出多条件掩蔽器集合供能量等化使用。再以多条件掩蔽器集合与目标句配对为输入,用高能量glimpse比例逐对自适应调节信噪比以等化能量掩蔽至0.3、0.4与0.5三档,输出等能量刺激并直接送入听音测试。最后接收等能量刺激为输入,在25名母语听者上测词识别率并分析glimpse分布,输出可归因于非能量因素的跨语言与调制退化差异。与直接调全局信噪比不同,该链条在谱时域最小化能量差异,使调制掩蔽释放与总glimpse减少的相互抵消效应得以显现,具有归因上的实际意义。在25名母语听者参与的听音测试条件下,0.4 HEGP条件的WRR准确率为33.8%,高于0.3 HEGP条件的WRR准确率17.4%。该结论仅在单男性美音目标、250 ms前后掩蔽、实验室耳机听音下验证,未检验多说话人、混响、听损人群与自动识别系统的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
987. 因果卷积前端能否在 10 毫秒内换来可部署的音素分类增益
标签:#CNN #严格因果 #实时处理 #音频分类
评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#CNN
👥 作者与机构
- Yuchu Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Leslie M. Collins:机构信息未能从会议 PDF 纯文本可靠映射
- Boyla O. Mainsah:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
人工耳蜗(Cochlear Implant, CI)需在噪声混响下满足严格因果与不大于 10 ms 延迟的实时处理,基于音素的时频掩蔽增强依赖帧级音素分类器,而分类器性能是该链路的主要瓶颈。输入的对数压缩短时频谱特征先经轻量因果卷积前端做局部时频编码,再送入单向长短时记忆网络(Long Short-Term Memory, LSTM)、门控循环单元(Gated Recurrent Unit, GRU)或状态空间模型(State Space Model, SSM)后端建模时序依赖并输出每帧音素类别,前端与后端联合训练。该设计坚持不使用未来上下文,以可控感受野扩张换取端侧可部署性,区别于离线场景常用的双向与注意力结构。在LibriSpeech叠加真实房间脉冲响应与噪声的模拟划分评测设置下,加入8层二维时频卷积的GRU的帧准确率为38.94%,高于GRU基线的帧准确率31.51%。2层频率维一维卷积帧准确率为36.98%且延迟为2.45 ms,一维时间卷积多配置延迟保持在约2.0 ms至2.8 ms,满足亚10 ms实时约束。该结论仅适用于帧分类准确率与 STM32F746G 片上资源指标,未验证增强后可懂度、真实耳蜗采集数据与多说话人外推能力。原文未披露训练时长与成本,未提供代码、权重与数据集链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
988. 把停顿钉在文字上:用逐字转写加对齐让大模型判断构音障碍的不恰当停顿
标签:#SFT #韵律 #语音 #强制对齐 #病理语音评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#SFT
👥 作者与机构
- Minsu Han:机构信息未能从会议 PDF 纯文本可靠映射
- Insung Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Taeyoung Jeong:机构信息未能从会议 PDF 纯文本可靠映射
- Myoung-Wan Koo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍阅读语音的不恰当停顿检测需同时给出停顿位置、时长与语言学合理性,而替代、重复、填充与拖长使转写和对齐极易错位。本文以秋季段落朗读录音为输入,输出带时长标记的转写与每处停顿的恰当与否判定及简短依据。方法链分四步衔接:微调逐字Whisper保留填充与自我修复并输出原文,转入蒙特利尔强制对齐器获得词级时间戳后用帧级语音活动检测重写重叠停顿边界,再由大语言模型把未知词映射回可对齐形式并注入时长标记,最后由大语言模型结合句法位置与时长判定三类不恰当停顿。相对WhisperX类转写加独立对齐方案,该设计把韵律证据文本化,使大语言模型能联合语言上下文做判断并生成可解释理由。在743条韩语语料的说话人无关划分上,Whisper加蒙特利尔强制对齐器加语音活动检测的对齐F1达到72.8%,轻中度组二分类宏F1为0.68,显著高于CTC对照。结论限于健康与轻中度组,重度组因转写不可靠未纳入定量,跨段落与跨语言外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
989. 几何算出两个相位候选,一致性迭代替你选:多源 Griffin-Lim 的相位修复
标签:#信号处理 #语音 #语音增强
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#信号处理
👥 作者与机构
- Chun-Wei Ho:机构信息未能从会议 PDF 纯文本可靠映射
- Pin-Jui Ku:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Yen:机构信息未能从会议 PDF 纯文本可靠映射
- Sabato Marco Siniscalchi:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
- Chin-Hui Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
加性噪声下的语音增强需从含噪复数短时傅里叶变换谱恢复干净语音相位,而几何法虽能算出相位差绝对值却留下符号二义性。所提多源 Griffin-Lim 算法先用 TF-GridNet 估计语音与噪声幅度或噪声相位,再在语音与噪声分支间交替执行一致性投影与加性混合约束以隐式选择符号,并经短时傅里叶变换与逆变换循环精化相位估计。与直接回归相位和有监督符号预测器的关键差异是无需学习随机性强的符号目标。与直接相位估计相比,噪声相位分支在 VoiceBank-DEMAND 上将 SI-SNR 从 19.13 dB 提升至 19.61 dB,背景抑制略优但整体增益有限。在VoiceBank-DEMAND评测设置下,NP-MSGLA的PESQ为3.46,高于直接相位估计的PESQ 3.44。该结论仅在单通道加性噪声与 5 次迭代初始化为含噪相位的条件下验证,未证明收敛与低信噪比外推性。该方法的适用边界尚未验证混响与多说话人外推,其迭代精化效果受限于估计幅度的精度。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
990. 没见过的增强与合成语音也能预测费力度:两个非侵入模型的跨任务泛化检验
标签:#助听器 #知识蒸馏 #言语感知 #语音可懂度评估
评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#知识蒸馏
👥 作者与机构
- Dirk Eike Hoffner:机构信息未能从会议 PDF 纯文本可靠映射
- Hartmut Schoon:机构信息未能从会议 PDF 纯文本可靠映射
- Rainer Huber:机构信息未能从会议 PDF 纯文本可靠映射
- Jan Rennies:机构信息未能从会议 PDF 纯文本可靠映射
- Bernd T. Meyer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为含噪、增强、合成与双耳空间语音,输出为言语可懂度与感知听力努力的客观预测,难点在于无干净参考时兼顾空间释放掩蔽、增强失真与合成语音的感知差异。方法链第一步由前馈神经网络估计帧级三音素后验并以其不确定性表征识别退化,舍弃隐马尔可夫转录级后进入聚合。第二步由预训练WavLM-Large提取波形表征并结合听力图经双向长短时记忆网络与多头注意力,以教师学生范式回归听觉感知指标。第三步在独立听力努力集上学习线性映射到听力量表,并经心理测量函数拟合估计言语识别阈,再以较优耳策略选取双耳通道中数值较高的一侧输出。相对短时客观可懂度与听觉感知指标等侵入式方法的机制差异在于两者均无需干净参考,仅从后验分散或蒸馏感知指标推断感知,故可用于真实单端场景。在增强语音听力努力任务下,HASA-Net+的相关系数指标为0.98,高于PHOBI的相关系数指标0.94。结论限于正常听力德语与英语句测试、特定噪声与房间条件,对听损人群与重度混响的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
991. 辅音保人,元音随语言:双语政治演讲的时间组织如何分工
英文题目:Speaker-Specific and Language-Dependent Temporal Organization in Bilingual Political Speech
标签:#统计分析 #韵律 #多语言 #语音 #语音属性识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Nina Hosseini-Kivanani:机构信息未能从会议 PDF 纯文本可靠映射
- Nafiseh Taghva:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Gilles:机构信息未能从会议 PDF 纯文本可靠映射
- Oliver Niebuhr:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为卢森堡语与法语政治场合自发话语,输出为基于时长节律度量的语言组织差异判断,难点在于高风险修辞风格、说话人个性与语言音系约束相互纠缠。处理链条分为三环:先按语调句切分并清洗重叠噪声得到400句配对语料,再经WebMAUS粗对齐加人工校对得到辅音元音交替层并派生均值变异与成对变异指数,最后经组内配对检验与方差分解分离说话人与语言贡献。与既往单语魅力节律工作相比,该链条把分析对象从风格对比转向同一说话人跨语言重组,因而能识别元音主导的语言效应。在10名政客每人20句政治话语配对语料条件下,卢森堡语的音段速率指标为12.3842,高于法语的音段速率指标9.6180。同一条件下法语元音时长分布呈现偏长且离散的元音主导模式,与整体加速形成互补的跨语言重组特征。结论仅适用于精英政客正式政治话语中的卢森堡语法语对,无法推广到日常双语或低熟练度二语习得。原文未披露训练、推理或部署成本,本研究无模型训练。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
992. 跨语言借样本做判断:对齐、检索、融合如何补足构音障碍严重度数据
英文题目:Cross-lingual Retrieval-Augmented Classification for Dysarthria Severity Assessment
标签:#对比学习 #检索增强 #跨语言 #病理语音评估
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#检索增强
👥 作者与机构
- Taeyoung Jeong:机构信息未能从会议 PDF 纯文本可靠映射
- Insung Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Du-Seong Chang:机构信息未能从会议 PDF 纯文本可靠映射
- Myoung-Wan Koo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍严重程度自动评估输入为最大发声时间与轮替运动速率共6项任务录音,输出为健康对照与轻中度与重度三分类标签,难点在于标注病理语音稀缺且语言与病因差异易淹没严重程度线索。跨语言检索增强分类先以冻结Whisper-small编码加可训练投影头做有监督对比学习塑造严重程度空间,再用源语言训练集构建键值向量库,最后以查询向量检索top-k参考并经交叉注意力融合后送入MLP分类与6任务软投票。相比直接混合多语言数据训练,该机制用对齐后检索替代数据池化,避免语言特异声学噪声污染决策边界,从而将跨语言信息转化为可比参考而非训练噪声以增强决策稳健性。在说话人独立协议的意大利语测试集下,CRAC的平衡准确率为0.867,高于单语基线1的平衡准确率0.667。当前结论仅验证韩意双语与脑卒中对ALS组合,重度样本稀少与检索规模敏感性限制外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
993. 合成语音的差评为何能帮构音障碍打分:MOS 监督的跨域增益与失配边界
英文题目:Augmenting Dysarthric Speech Severity Assessment with MOS Supervision
标签:#自监督学习 #迁移学习 #病理语音评估 #语音质量评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#迁移学习
👥 作者与机构
- Kaimeng Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Minzhu Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Zengrui Jin:机构信息未能从会议 PDF 纯文本可靠映射
- Siyin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍言语评估需从单句波形直接回归可懂度与自然度严重度,难点在于临床标注稀缺且开放词汇泛化困难,居家采集的朗读与自发语音进一步加剧声学变异性。本文以自监督学习编码器提取话语表征,先在QualiSpeech合成质量数据上学习总体质量与自然度感知以获得感知先验,再将编码器表征迁移至Speech Accessibility Project数据预测临床严重度评分。迁移过程对比联合训练与微调两条路径,前者按一比一混合数据并经线性映射对齐量表后联合优化,后者先做质量预训练再在目标域微调,从而避免跨域梯度干扰并重新加权目标特征。与既往生成伪数据缺乏感知标签的做法不同,该工作利用真实人类平均意见分作为跨域监督,直接复用合成失败与病理偏离共享的感知共性,因此能减少对稀缺临床标注的依赖并具有实际意义。在SAP自然度预测评测任务下,wav2vec 2.0 Large*的均方误差指标相对降低为24.2%,高于wav2vec 2.0 Base的均方误差指标相对降低19.4%。结论仅适用于英语居家采集的朗读与自发语音,且可懂度严重偏向1级轻度,自然度分布相对均衡,外推至重度、其他疾病与语种尚未验证。原文未披露训练硬件、批量大小、训练轮数与推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
994. 不微调也能抗背景:把目标原型投影到与背景正交的子空间
英文题目:POP-SED: Prototype Orthogonal Projection for Robust Few-shot Sound Event Detection
标签:#生物声学监测 #测试时自适应 #鲁棒性 #少样本 #音频事件检测
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#测试时自适应
👥 作者与机构
- Takehiko Kagoshima:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
少样本声音事件检测输入是仅标注前5个事件的长录音,输出是后续查询音频中目标事件的起止时间,难点在于支持集正样本与查询帧均被背景声污染而原型易偏置。该方法先以冻结声学编码器抽取帧特征并用支持集正样本均值构造原型,为后续去背景提供基准表示。接着对支持集负样本特征与全部查询特征拟合球面混合分布以刻画背景方向,其均值向量进入候选背景集合。然后枚举背景均值向量的全部子集,按支持集可分性与阈值扰动鲁棒性筛选最优子集,最后将原型投影到该子集的正交子空间并用余弦相似加平滑阈值完成检测。与依赖领域微调与支持集微调的参赛系统不同,该机制无需更新编码器即可在测试时利用查询背景。在DCASE2024 Task 5验证集下,POP-SED(BEATs)的F-score为62.35%,低于Liu et al.的F-score 70.60%。其结论仅在该生物声学验证集的单向5样本划分下成立,对更大混合数、更强域偏移与阈值漂移尚未验证。原文未披露训练、推理或部署成本,生成式AI仅用于英文翻译与语言润色。
🔗 开源资源
- 第三方资源:https://github.com/microsoft/unilm/tree/master/beats — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
995. 通话中途换人怎么办:用冻结大骨干加轻量投影做每 500 毫秒一次的持续验声
英文题目:A light weight Continuous Speaker Verification System for Real time Monitoring
标签:#数据增强 #对比学习 #实时处理 #流式处理 #说话人验证
评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.9/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#说话人验证 | 主方法:#对比学习
👥 作者与机构
- Nikhil Keetha:机构信息未能从会议 PDF 纯文本可靠映射
- Hima Jyothi R:机构信息未能从会议 PDF 纯文本可靠映射
- Nivedita Chennupati:机构信息未能从会议 PDF 纯文本可靠映射
- Balaji Padmanaban:机构信息未能从会议 PDF 纯文本可靠映射
- Harish Rajamani:机构信息未能从会议 PDF 纯文本可靠映射
- Naveen Ambati:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
电话客服与银行通话需在全程持续确认当前说话人仍为注册声纹对应客户,输入为流式电话语音与注册声纹、输出为持续一致性判定与失配告警,难点在于信道退化、多语言混用与语码切换下的嵌入漂移及一次认证后换人难发现。第一步由冻结的ReDimNet-B1主干对对数梅尔滤波器组特征做时域与谱时处理,输出192维紧凑嵌入,为后续提炼提供鲁棒初表示。第二步由轻量卷积投影网络在冻结嵌入上用含同语言与跨语言样本的三元组采样训练,输出256维语言不变最终表示,显式改善跨语言一致性。第三步将语音活动检测后片段表示与注册声纹做余弦相似度打分,在1秒窗0.5秒跳的流式管线中每500毫秒更新判定,失配持续3秒即向坐席端告警。与一次性认证相比,差异在于将单次比对转为滑动窗口上的持续比对,并以噪声混响变速增强维持嵌入稳定,具有实时拦截敏感信息泄露的实际意义。在TidyVoice语料评测任务下,第二阶段精炼表示的维度指标为256维,高于第一阶段编码器表示的维度指标192维,系统在该任务下的错误率为2.08%。该系统在该硬件上处理1秒音频仅需约50毫秒延迟,对应计算量为318M乘加操作。在 Intel Core i7-8650U 中央处理器(Central Processing Unit,CPU)上实时因子(Real-Time Factor,RTF)为 0.05,模型总量为 2.5M 参数与 318M 乘加操作,满足实时监控的部署成本要求。结论目前仅限该单一 curated 数据集离线评测,未验证开放电话网噪声、注册时长变化与长期漂移下的外推能力。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
996. 合成语音也能听出种族:听者偏向、刻板印象与可分类的声学差异
英文题目:Perceptual and Acoustic Correlates of Racial Identity in Text-to-Speech Voices
标签:#主观评测 #公平性 #社会语音学 #语音属性识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#主观评测
👥 作者与机构
- Noah Khaloo:机构信息未能从会议 PDF 纯文本可靠映射
- Nicole Holliday:机构信息未能从会议 PDF 纯文本可靠映射
- Sarah Creel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为全合成英语语音,输出为听者感知的说话人种族标签与人格特质评分,难点在于听者明知是合成语音时是否仍能感知种族线索,以及刻板印象是否迁移到合成音色。方法链分为四步:从EasyPeasy AI平台按美音与非裔美音分区及配图分层抽取32个音色并合成控制文本,再经144名美国Prolific听众完成人格块与种族块两阶段听辨,接着对每音色被判为黑人的比例标准化后做三聚类重标定为白人感知类与黑人感知类与模糊类,最后基于嗓音心理声学模型提取基频与共振峰与谐波源与非谐波源特征训练极端梯度提升分类器以定位声学相关物。与既往人类语音研究相比,关键差异在于显式告知被试为合成语音并检验人类相似度对社会评价的调节作用。男性黑人感知音色在专业度与能力与愉悦度与可信度上均显著低于白人感知音色,而女性音色未见显著种族效应。在说话人层面五折交叉验证任务下,精简至前15特征的模型的准确率为66%,高于全61特征模型的准确率65%。结论边界在于存在强烈白人偏置且5/9模糊类来自平台黑人女性音色,外推至其他方言或平台模型尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
997. 发声过强为何一半好分一半难分:静态分布、动态趋势与声气耦合的分层解法
标签:#语音生物标志物 #统计分析 #言语障碍 #病理语音评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- June-Woo Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Kangwook Jang:机构信息未能从会议 PDF 纯文本可靠映射
- Minu Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Hyunju Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为颈表加速度衍生的14维帧级声学与作用空气动力学序列,仅保留浊音帧,输出为受试者级发声创伤性发声过度功能对照常人与非发声创伤性发声过度功能对照常人二分类标签,难点是日常长时监测的高变异性与非创伤组无结构病变导致的分布重叠。方法第一步按受试者聚合静态分布与动态趋势描述子,静态层计算分布矩与分位数,动态层在一阶与二阶差分上计算趋势与波动量,形成197维表示。第二步以上一步表示为输入构造比值归一量与6项源滤波器及稳定努力耦合交互项,输出203维分层特征集以显式建模声学空气动力学关联。第三步将该特征集送入训练折内中位数插补与基于极端梯度提升的递归特征消除交叉验证筛选,再以固定超参数训练逻辑回归等五种分类器并做解释,区别于已有仅用简单时间平均而忽视动态与耦合关系的做法。在按受试者分组分层10折交叉验证集任务下,耦合特征逻辑回归的AUC为0.891 ± 0.04,高于静态特征的AUC 0.851 ± 0.05。结论受限于给定特征级数据与日汇总粒度的两组对照任务,不能外推至原始波形、连续预警或跨设备人群。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
998. 把基频滤波当作语音增强:用 Wave-U-Net 直接提基频波形再求瞬时频率
英文题目:Instantaneous Pitch Estimation via Wave-U-Net-Based Fundamental Waveform Enhancement
标签:#CNN #鲁棒性 #语音 #音高与旋律提取 #语音增强
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音高与旋律提取 | 主方法:#CNN
👥 作者与机构
- Junya Koguchi:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Koriyama:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对语音与歌唱中快速变化的基频,瞬时基频估计需从含谐波与噪声的波形中输出连续频率轨迹,难点在于传统通道选择在强谐波与低信噪比下易失稳。本文将基频波形滤波重构为语音增强问题,先用Wave-U-Net直接从原始波形回归基频正弦分量并约束残差满足混合一致性。接着对估计波形构造解析信号并求相位导数得到瞬时频率,以此作为连续基频输出。与IRAPT等多通道周期性打分再选通道的机制不同,该方法省去显式通道选择,依靠大感受野回归与瞬时频率损失约束相位演化连续性。在包含语音歌唱乐器的干净测试条件下,提出方法的粗糙基频准确率为88.47%,高于Halcyon的粗糙基频准确率86.80%。在0 dB加性噪声测试条件下,提出方法的粗糙基频准确率为86.40%,高于NINJAL的粗糙基频准确率62.35%。但高频调制下随机响应仍高于 NINJAL,且混叠与残留谐波假设尚未完全解决,原文未披露训练、推理或部署成本。该结论的适用边界受限于以单正弦基频假设与解析信号瞬时频率为前提的外推范围。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
999. 单元数量管听懂,说话人条件管像谁:多语多说话人单元声码器的系统性拆解
英文题目:Multilingual Multi-Speaker Unit Vocoders: A Systematic Analysis of Discrete Speech Representations
标签:#生成对抗网络 #向量量化 #多语言 #语音合成
评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#生成对抗网络
👥 作者与机构
- Naman Kothari:机构信息未能从会议 PDF 纯文本可靠映射
- Arjun Gangwar:机构信息未能从会议 PDF 纯文本可靠映射
- Adarsh Arigala:机构信息未能从会议 PDF 纯文本可靠映射
- S Umesh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究多语言多说话人场景下离散单元到波形的重建任务,输入为自监督表示聚类得到的离散语音单元,输出为保留目标说话人与语言属性的语音波形,难点在于单元混杂音素、说话人与语言信息而导致音色串扰与跨语言干扰。方法链分为四步:先用Data2Vec-AQC第21层表示在22种语言1200小时平衡数据上训练500至10000五档多语言k均值模型提取语义单元,再将单元映射为128维可学习嵌入并与192维ECAPA-TDNN说话人嵌入和128维语言嵌入拼接为生成器输入,然后由BigVGAN生成器与多周期判别器加CQT时频判别器对抗合成波形,最后用基于梅尔谱的两层卷积语种分类器施加语言一致性约束。相对已有单语HiFi-GAN复合成与固定说话人查找表方案,关键差异在于采用连续ECAPA-TDNN说话人空间与可扩展大聚类词表以支持未见说话人泛化。在IndicVoices-R四语言每语言16未见说话人测试集上,无说话人调控时孟加拉语词错率随聚类增大从60.42%降至25.13%,而加入说话人调控后说话人相似度由约0.16跃升至0.77。结论仅在印度雅利安与达罗毗荼语系内验证,对其它语系、大词表外推及韵律可控性尚未验证。主观质量指标UTMOSv2因无趋势被省略,原文未披露推理延迟与部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/UnitBigVGAN — 链接不可用(HTTP 404)
- 第三方资源:https://github.com/AI4Bharat/IndicConformerASR — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/AI4Bharat/IndicMFA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1000. 朗读与实拍之间:泰卢固语和马拉雅拉姆语恐同恐跨语音仇恨检测为何域一换就掉点
标签:#多模态学习 #低资源 #多语言 #音频分类
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频分类 | 主方法:#多模态学习
👥 作者与机构
- K N Lakshmi:机构信息未能从会议 PDF 纯文本可靠映射
- K Hemavardhan Reddy:机构信息未能从会议 PDF 纯文本可靠映射
- A Venkata Satya:机构信息未能从会议 PDF 纯文本可靠映射
- Kota Venkata Vamshidhar Reddy:机构信息未能从会议 PDF 纯文本可靠映射
- Jyothish Lal G:机构信息未能从会议 PDF 纯文本可靠映射
- Premjith B:机构信息未能从会议 PDF 纯文本可靠映射
- Jesin James:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是从泰卢固语和马拉雅拉姆语语音中识别恐同、恐跨与无仇恨三类输出,难点在于低资源、代码混合、讽刺韵律及诱发朗读与社媒自发语音的域差异。方法链先将音频统一为16 kHz单声道并做语音活动检测切分,再分别用Wav2Vec 2.0提取声学嵌入和Whisper转写加IndicBERT提取语义嵌入,随后经线性投影对齐至共享空间并由注意力加权融合,最后送入双分支多尺度分类器输出类别。相对已有纯文本仇恨检测,该机制显式引入音高与语调等副语言线索并在域内实现互补。在马拉雅拉姆语域内评测条件下,多模态融合的F1为0.9566,高于文本单模态的F1 0.8300。跨域时声学失配导致性能骤降,暴露声学泛化脆弱性。该结论的适用边界受限于小规模双语言三分类封闭评测,跨方言噪声与重叠语音场景尚未验证。结论仅适用于小规模双语言三分类封闭评测,无法外推至方言、噪声、多说话人重叠及开放社媒分布。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1001. 单空间去偏不够用时:用多阶段投影逐轮暴露音乐分类中的残留偏置
英文题目:Progressive Learnable Counterfactual Attention for Music Classification
标签:#注意力机制 #音乐信息检索 #音乐 #音频分类
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#注意力机制
👥 作者与机构
- Yi-Xing Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Wen-Li Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Jia-Ching Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jen-Chun Lin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音乐分类输入为时频分布的长音频片段,输出为歌手、流派或情绪标签,难点在于弱监督注意力仅靠分类损失学习,易被伴奏音色与录制偏差等虚假关联误导。本文提出渐进式可学习反事实注意力(Progressive Learnable Counterfactual Attention,P-LCA),在每个精炼阶段并行学习主事实注意力与可学习反事实注意力并对比事实预测\(y^\{&\#40;k&\#41;\}\)与反事实预测\(\\tilde\{y\}^\{&\#40;k&\#41;\}\)形成注意力效应监督,再将主分支注意力加权表示经共享投影变换潜分布并注入固定正弦阶段嵌入后送入下一阶段,最后聚合\(K\)个阶段损失联合优化,推理时丢弃全部反事实分支。与随机干预的反事实注意力学习(Counterfactual Attention Learning,CAL)和单空间可学习反事实注意力(Learnable Counterfactual Attention,LCA)相比,关键差异是以表征变换主动改变偏差与任务线索的相对可分性。在Artist20歌手识别任务下,genreMERT(w/ P-LCA)的帧级平均F1为0.70,高于genreMERT(w/ LCA)的帧级平均F1 0.66。在Artist20歌手识别任务下,genreMERT(w/ P-LCA)的歌曲级平均F1为0.88,高于genreMERT(w/ LCA)的歌曲级平均F1 0.84。该结论在3个音乐数据集与genreMERT、Short-chunk ResNet两种骨干上验证,阶段数\(K=3\)最优,\(K\)增至4、5后增益停滞或回落。该结论适用边界受限于上述音乐语料与骨干组合,跨语种跨风格泛化尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1002. 用事件边界锁住注意力:BG-CRNN 如何在噪声中守住声音事件
英文题目:BG-CRNN: Boundary-Guided Dynamic Attention for Sound Event Detection in Complex Scenarios
标签:#注意力机制 #半监督学习 #鲁棒性 #环境声 #音频事件检测
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#注意力机制
👥 作者与机构
- Zongmu Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Zhongxin Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Jisheng Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Zhenru Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Jingdong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jacob Benesty:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声音事件检测需从连续音频同时输出事件类别与起止时间,在非平稳噪声下相邻噪声易污染目标特征并引起边界漂移与碎片化检出。BG-CRNN先以卷积网络与自监督ATST-Frame并行提取特征,经自适应池化对齐拼接为语义丰富的融合特征输入后续时序建模。动态边界变换器接着预测逐帧边界并构造段内动态掩码,将自注意力严格限制在同一事件段内,阻断跨段噪声传播以输出边界特征。边界引导注意力再利用该边界嵌入生成门控权重,以残差方式重标定并增强活跃事件区后交由循环网络做帧级预测,并以平均教师、混合上采样与插值一致性训练做半监督学习。在WildDESED测试集下,BG-CRNN的指标PSDS1为0.380,高于ATST-CRNN基线的指标PSDS1为0.367,表明段内约束有效抑制了跨段噪声干扰。该结论适用边界限于家庭场景10类事件与合成噪声评估,尚未验证开放词汇、强混响或移动声源。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1003. 无干净目标时用带文本的噪声学增强:开关控制的双模式微调
标签:#领域适应 #低资源 #语音识别 #语音增强
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#领域适应
👥 作者与机构
- Xin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Shulin He:机构信息未能从会议 PDF 纯文本可靠映射
- Xueliang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强(Speech Enhancement, SE)模型多在合成干净与噪声配对上训练,输入为退化语音、输出为干净波形与复谱,难点在于真实房间、设备与噪声分布下缺乏配对干净目标导致跨域失配。本文提出的 SwitchSE 先将门控卷积循环网络(Gated Convolutional Recurrent Network, GCRN)在合成集上预训练,再以开关嵌入交替消费合成配对与目标域噪声文本配对,前者用时频 \(L1\) 约束重建,后者用冻结识别模型提供的联结时序分类(Connectionist Temporal Classification, CTC)损失引导可识别性,推理时切换嵌入偏置输出取向。与单目标微调相比,该机制以每批次单损失激活避免感知质量与识别友好性直接冲突,并实现增强模式与识别模式的可控切换。在 CHiME-3 真实集上增强模式将 P.808 MOS 从 2.77 提升至 3.23,识别模式将词错率(Word Error Rate, WER)从 63.66% 降至 20.27%,同时 VCTK 合成集性能基本保持。结论仅在单真实场景与同源识别器贪婪解码下成立,跨识别器、跨语种与多骨干外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1004. 辅音靠噪声、元音靠谐波:HWB-plus 为何把带宽扩展拆成两条路
标签:#信号处理 #高效推理 #语音 #语音超分
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音超分 | 主方法:#信号处理
👥 作者与机构
- Xin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Xueliang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
带宽扩展需从截止于2至3 kHz的窄带语音恢复缺失高频,难点在于元音谐波与辅音类噪声能量结构迥异而轻量模型容量有限。本文方法先对波形半波整流并与窄带幅度相加后取对数得到混合谱,再由双分支加权高斯混合模型分别预测掩膜并经帧级融合权重合成为预测谱,最后经带引导掩膜与翻转相位合成波形。其中元音分支以混合谱为基底并用Mel尺度初始化高斯均值与带宽以聚焦听觉敏感区,辅音分支则以白噪声谱为基底并在高频均匀初始化以匹配平坦噪声特性。相对单分支HWB-Net的统一建模,该双分支解耦使元音分支在辅音帧被动输出近零而融合权重在元音帧抑制噪声分支,从而避免谐波算子失配与互调伪影。在VCTK语料22050 Hz评测设置下,HWB-plus的DNSMOS P.808指标为3.55,高于HWB-Net的DNSMOS P.808指标3.31。该结论目前仅在干净英文朗读语音与单一说话人无关划分上验证,对噪声、混响、跨语言及真实传输退化是否成立尚未证明。原文未披露训练硬件、推理时延与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1005. 又快又抗噪的单音高估计:FCPE 用轻量卷积加上下文补全做基频分类
标签:#CNN #高效推理 #鲁棒性 #音高与旋律提取
评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告 | 主任务:#音高与旋律提取 | 主方法:#CNN
👥 作者与机构
- Yuxin Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Ruoyi Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Lu-Chuan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Tianyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hangyu Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单声部基音估计需由含噪人声波形输出逐帧基频轨迹,难点在于噪声鲁棒性与计算效率难以兼得,强噪声下时频线索易被淹没。本文提出快速上下文基音估计模型FCPE,其方法链分三步衔接:先将16kHz波形转为对数梅尔谱并经浅层一维卷积嵌入为高维序列,为时序建模提供紧凑输入;再将该序列送入堆叠轻量卷积块,以深度可分离卷积扩大时域感受野并结合频谱掩码迫使模型利用前后帧上下文推断;最后由线性层输出360类音分概率并以峰值邻域加权平均解码为基频。与RMVPE重型U-Net不同,该通道解耦设计在不大幅增加参数下保留长时依赖,掩码训练是其噪声下保持连续跟踪的关键。在 MIR-1K 干净集上 FCPE 达到 96.79% 粗音高准确率(Raw Pitch Accuracy,RPA),与 RMVPE 的 97.77% 和 CREPE 的 97.90% 基本可比,实时因子(Real-Time Factor,RTF)低至 0.0062。在MIR-1K干净评测条件下,FCPE的准确率为96.79%,低于RMVPE的准确率97.77%。该结论的适用边界受限于训练泄漏与强噪声失败条件,在TONAS真实噪声0dB下FCPE为76.83%,落后RMVPE的86.56%约9.73个百分点,在-20dB下多类噪声均大幅退化。训练真值来自可微分数字信号处理(Differentiable Digital Signal Processing,DDSP)重合成的 M4Singer 与 VCTK,推理速度仅在单张 RTX 4090 GPU 上测量。就部署而言,该单卡测得的推理开销与硬件吞吐外推尚未验证,极低信噪比与跨设备延迟仍受限。
🔗 开源资源
- 第三方资源:https://github.com/maxrmorrison/torchcrepe — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/yxlllc/RMVPE — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/SonyCSLParis/pesto — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1006. 只靠多语言覆盖不够:用连续发音特征补上零样本语音分类的声学现实
英文题目:Improving Zero-Shot Phonetic Classification through Language-Agnostic Articulatory Features
标签:#多任务学习 #语音学与音系 #多语言 #零样本 #音频分类
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#多任务学习
👥 作者与机构
- Ryo Magoshi:机构信息未能从会议 PDF 纯文本可靠映射
- Jaeyoung Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Shinsuke Sakai:机构信息未能从会议 PDF 纯文本可靠映射
- Tatsuya Kawahara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音到国际音标(International Phonetic Alphabet,IPA)转写需从声学直接还原跨语言音素,而字形到音素(Grapheme-to-Phoneme,G2P)标签只反映音位抽象且跨语言符号不一致,导致现有语音基础模型在未见语言上难以区分细微对立。本文先以排除中日训练的双模型做零样本汉语送气与日语拨音分类,暴露离散词元方法的系统性偏置,再引入基于连续发音特征(Articulatory Feature,AF)向量的最近模板分类流程。流程先用强制对齐定位目标音段并选取峰值帧,再提取发音特征分类模块(Articulatory Feature Classification Module,AFCM)输出的向量并与 PanPhon 模板比较,按单帧或音段平均两种时域聚合输出类别。与离散后验相比,该机制用共享发音维度传递监督,尤其改善低频音的声学可分性。在汉语送气单帧评测中发音特征方法达到 95.4% 平衡准确率,在日语音段鼻音四分类中达到 72.6%,均明显高于对应离散基线。结论限于两组发音对照与特定数据集划分,对塞擦音、声调及自发变体等更广零样本外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1007. 说话人切换次数一变就掉线:把切换标记从自注意力里藏起来
标签:#注意力机制 #自回归模型 #单通道 #语音 #语音识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#注意力机制
👥 作者与机构
- Naoki Makishima:机构信息未能从会议 PDF 纯文本可靠映射
- Suzuka Yamada:机构信息未能从会议 PDF 纯文本可靠映射
- Taiga Yamane:机构信息未能从会议 PDF 纯文本可靠映射
- Mana Ihori:机构信息未能从会议 PDF 纯文本可靠映射
- Tanaka Tomohiro:机构信息未能从会议 PDF 纯文本可靠映射
- Satoshi Suzuki:机构信息未能从会议 PDF 纯文本可靠映射
- Shota Orihashi:机构信息未能从会议 PDF 纯文本可靠映射
- Ryo Masumura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究单通道多说话人自动语音识别(multi-talker automatic speech recognition,Multi-Talker ASR)中按时间顺序拼接转写并插入说话人切换(speaker change,SC)标记时的长度外推难题,输入为连续语音声学特征,输出为含切换标记的字符序列,难点是训练仅见最多 2 次切换时推理遇到更多切换会跳过整段话语。方法链分三步:先用 Transformer 编码器将声学特征映射为隐表示,再用带新型掩码的 Transformer 解码器自回归预测目标序列,该掩码在训练与推理时恒屏蔽切换类标记并在训练时随机屏蔽文本标记以切断计数线索,最后将解码隐状态经 Softmax 输出下一字符分布并分别适配纯转写与联合说话人分离标注(speaker diarization,Diarization)两种标签体系。与依赖完整历史上下文的常规前视掩码不同,该设计强制模型不依靠已出现切换标记数量做决策,因而在未见切换次数下仍能维持边界预测。论文在自发日语语料(Corpus of Spontaneous Japanese,CSJ)拼接的非重叠 3 次切换测试集上,字符错误率(character error rate,CER)从基线的 13.5% 降至 5.9%,说话人切换计数准确率(speaker change count accuracy,SCCA)从 59.5% 升至 96.3%。结论仅在最多 5 次切换的拼接与模拟重叠语音上验证,未覆盖真实会议噪声与未知说话人规模下的外推行为。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1008. 喊上去还是撑住:三种发声努力策略如何被斜率与聚类分开
标签:#无监督学习 #鲁棒性 #发声与构音 #语音识别 #语音属性识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#无监督学习
👥 作者与机构
- Lubos Marcinek:机构信息未能从会议 PDF 纯文本可靠映射
- Jonas Beskow:机构信息未能从会议 PDF 纯文本可靠映射
- Joakim Gustafson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
发声努力 vocal effort调节的输入是同一文本在柔声到极大声连续等级下的发音,输出是说话人采用何种多维声学策略,难点在于基频与能量人际基线差异大且性别与语料混杂易被误读。该文先对每位说话人拟合声学特征随努力等级变化的斜率,再经标准化后做K均值 K-means聚类形成策略类型,接着用留一说话人交叉验证评估类别可分性并转入噪声混合与法语语料做外部验证。相比以往只报告群体均值或单一性别差异的做法,该文把策略显式离散化为可前置于语音合成的轻量分类器。最关键的定量证据来自AVID语料50人的留一验证,逐折重算簇中心的多项逻辑回归达到96%至98%准确率与约0.97宏平均F1值,显著高于仅用柔声到大声端点差分的84%对照。结论仅适用于受控朗读与中等以上信噪比条件,低信噪比与类人声干扰下类别迅速退化且跨语料仅保守型对应稳定。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1009. 以澳式英语为基准标差异:PRISM 如何把开放语音变成可复用的发音标注流程
标签:#数据标注 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#数据标注
👥 作者与机构
- Olga Maxwell:机构信息未能从会议 PDF 纯文本可靠映射
- Uy Thinh Quang:机构信息未能从会议 PDF 纯文本可靠映射
- Debbie Loakes:机构信息未能从会议 PDF 纯文本可靠映射
- Adele Gregory:机构信息未能从会议 PDF 纯文本可靠映射
- Robert Turnbull:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是为澳大利亚高校国际学生提供可解释的澳大利亚英语(Australian English,AusEng)发音反馈,输入为朗读录音与正字法文本,输出为词级节段与短语级韵律差异标签,难点在于世界英语变体差异大、韵律反馈长期缺失、现有工具常误罚AusEng常见特征。方法链第一步从CommonVoice英文分区版本21.0按地域筛选中国香港、南亚与印度尼西亚三组朗读语料以保证学习者代表性,其输出的音频与人口统计元数据直接进入第二步。第二步用Montreal Forced Aligner版本3.3.9生成词级边界并人工校对切分,其输出的TextGrid连同音频进入第三步。第三步由语音学家在自研网页平台上按13大类53小类编码体系标注元音辅音与音高核调型停顿显著度衔接节奏等并经复核视图质控,与仅覆盖单音素的主流工具不同,该设计把韵律与节段统一为可解释反馈,具有教学可操作意义。全集859个标注中节段错误占比指标约为49.9%,除拼写占比指标约4.1%外其余韵律错误占比指标约为46.1%,支撑韵律不可或缺的初步判断。在CommonVoice三口音语料统计设置下,香港组停顿插入占比指标为15.4%,高于印度尼西亚组停顿插入占比指标的6.6%。该结论仅适用于朗读短句与极不均衡子集,且未做评分者间一致性检验与统计检验,L1与L2身份亦因元数据不足无法区分。原文未披露训练推理成本,未训练评估模型。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1010. 各客户端说话人互不重叠时,用第二个分类头把全局知识带回本地
英文题目:A Federated Learning-Based Speaker Recognition Method with Dual Classification Heads
标签:#联邦学习 #隐私保护 #语音 #说话人验证
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#联邦学习
👥 作者与机构
- Ying Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Zhihua Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Liang He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人识别以语音波形或声学特征为输入,输出说话人嵌入供试听对判决,实际难点在于各机构说话人互不重叠且受隐私约束无法集中语音,本地分类头仅见局部标签导致嵌入缺乏全局可分性。FedDCH先下发全局嵌入提取器与全局分类头,客户端以全局头与本地头联合监督同一前向嵌入并加权优化,使本地反向传播即引入跨客户端类别知识。随后客户端按说话人字符串标识将本地头参数回写到全局头对应位置再上传,服务端对提取器按数据量加权平均、对全局头按说话人归属加权聚合后重新下发迭代至收敛,与滞后平均的FedAvg形成提前监督差异。在VoxCeleb与CN-Celeb四客户端联合训练的评测设置下,FedDCH在VoxCeleb1上的EER为1.12%,低于FedAvg的EER 1.18%。在VoxCeleb2按说话人切分为4个客户端的设置下,平均等错误率(Equal Error Rate,EER)相对本地训练改善46.5%,相对联邦平均(Federated Averaging,FedAvg)改善7.6%;在VoxCeleb与CN-Celeb四数据集各作一客户端的跨域设置下,相对本地训练平均改善68.8%,相对FedAvg改善5.4%。结论限于说话人互斥且全局标签可通过标识精确对齐的横向联邦,对开放集难例与大规模类别扩展尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1011. 联邦说话人识别里只学关键维度:用费雪信息过滤全局嵌入的冗余
英文题目:Learning Global Key Knowledge for Federated Speaker Recognition via Fisher Information
标签:#联邦学习 #隐私保护 #语音 #说话人验证
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#联邦学习
👥 作者与机构
- Ying Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Zhihua Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Liang He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
联邦说话人识别任务输入为各机构私有的语音波形或声学特征,输出为用于验证的说话人判别嵌入与身份判定,实际难点在于说话人分布与地域信道异构导致本地更新保留冗余漂移特征并持续污染全局模型。该方法先以全局与本地嵌入提取器对同批语音分别编码得到全局嵌入与本地嵌入,再将全局嵌入送入新初始化临时分类器以交叉熵损失求对嵌入梯度并取逐元素平方,经批量平均得到费舍尔信息对角近似并按比例筛选高信息维度索引。接着仅对筛选后子向量做L2归一化并以余弦距离约束本地关键维度向全局对齐,最后将该对齐损失与AM-Softmax分类损失直接相加经多轮本地训练与联邦聚合更新全局模型,相比MOON类整体嵌入模仿只传递高Fisher维度从而过滤异构冗余而非全盘模仿。在VoxCeleb2四客户端划分并以Vox-O评测时本地模型等错误率(Equal Error Rate,EER)为2.06%、1.91%、2.18%、1.98%,优于同设置FedAvg与FedFSS基线;在VoxCeleb1联合CN-Celeb1两客户端异构下Vox侧为3.01%而CN侧为12.58%,CN侧略逊于FedFSS的12.35%。结论限于按说话人ID均匀划分与双客户端跨语种封闭评测,未验证狄利克雷非独立同分布、信道突变或开放集注册场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1012. 语速变快是谁听不懂:用贝叶斯项目反应理论把题目难度和人的能力分开
标签:#心理测量 #主观评测 #言语感知 #语音 #语音可懂度评估
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#心理测量
👥 作者与机构
- Takahiro Miura:机构信息未能从会议 PDF 纯文本可靠映射
- Masatsugu Sakajiri:机构信息未能从会议 PDF 纯文本可靠映射
- Masaki Matsuo:机构信息未能从会议 PDF 纯文本可靠映射
- Keiichi Yasu:机构信息未能从会议 PDF 纯文本可靠映射
- Junji Onishi:机构信息未能从会议 PDF 纯文本可靠映射
- Ken-ichiro Yabu:机构信息未能从会议 PDF 纯文本可靠映射
- Tohru Ifukube:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理日语视觉障碍屏幕阅读器用户的合成语音语速理解评估,输入为150 WPM至500 WPM合成的音素平衡句,输出为可懂度与听辨能力的人物能力估计与项目难度分离。方法链分三步推进:先用ITA语料库语句在多语速下采集复述准确率与主观评分,再以贝叶斯累积probit模型与贝叶斯Beta回归分别建模有序评分与有界百分比,最后从随机效应抽取能力参数并用回归检验视力状态与使用经验的作用。与传统准确率混淆项目难度和个体能力的做法不同,该框架将二者置于同一潜在量表并用后验区间显式表达小样本不确定性。在ITA语料朗读句评测设置下,150 WPM条件的准确率为99.4%,高于500 WPM条件的准确率74.0%。该结果受限于小样本后验不确定性,表明语速提升系统性压低理解表现,而个体能力方差仍是主导差异来源。结论仅适用于有经验的日语用户与朗读体短句,尚不能外推至新手、自然阅读材料或音节语言。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1013. 不切边界怎么做重音判断:用分层卷积把语音帧压成音节表示
标签:#教育 #CNN #韵律 #语音 #语音属性识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#CNN
👥 作者与机构
- Namrata Mokshagundam:机构信息未能从会议 PDF 纯文本可靠映射
- Sai Harshitha Aluru:机构信息未能从会议 PDF 纯文本可靠映射
- Chiranjeevi Yarra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为第二语言(Second Language, L2)英语孤立单词发音波形,输出为每个音节的重读与非重读二分类标签,难点在于重读依赖音高、时长、能量等韵律对比,且传统方法依赖昂贵易错的音节或音素边界。该工作先用预训练 wav2vec 2.0 提取 768 维帧级表征并经单层双向长短期记忆网络(Bidirectional Long Short-Term Memory, BiLSTM)编码上下文,再经 6 级一维卷积与最大池化将最长 210 帧逐级压缩至 5 个音节级向量,最后由 5 层循环解码器输出音节重读概率并在推理后取最大者满足每词一重读。与依赖强制对齐或音素边界的方法不同,该链路训练时不使用边界监督,并用 Post-net2.0 损失显式惩罚多重读预测。在 ISLE 语料德语与意大利语学习者说话人无关划分上,联合(Combined)训练的自回归(Autoregressive, AR)模型在对应测试集达到 94.86% 与 96.24% 的音节准确率,相对部分边界无关基线领先约 18.67 个百分点与 16.12 个百分点,相对边界依赖基线仅领先 0.77 至 1.98 个百分点。该结论仅在孤立多音节词与已知音节数条件下成立,未验证连续语音与未知音节数下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1014. 去掉人口学捷径后,轻度认知障碍的语音检测还能准吗
标签:#对抗训练 #多模态学习 #公平性 #病理语音评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#对抗训练
👥 作者与机构
- William Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Jiali Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Hadi Amiri:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
轻度认知障碍(Mild Cognitive Impairment, MCI)筛查以自发语音、转录文本及配图描述为输入,输出认知状态标签,难点在于人口学线索与标签的虚假相关及多模态信号分布不均。所提公平检测框架(fair MCI detection, FMD)先由单模态编码器分别表征语音与文本等输入,再以文本为锚的交叉注意力(cross-attention)融合实现细粒度对齐,接着共享表征同时送入疾病分类器与人口学分类器,最后经梯度反转(gradient reversal, GR)反向抑制人口学可预测性。与晚期拼接及专家乘积基线相比,该机制显式将互补认知线索对齐与人口学捷径去除解耦,而非依赖重加权或末层重训。在TAUKADIAL上语言去偏变体平均F1达到92.6,超越最强基线CogniVoice的84.1,且最差组F1与平均间隔同步改善。在TAUKADIAL基准下,FMD Lang的平均F1为92.6,高于CogniVoice的平均F1 84.1。在PREPARE上整体增益收窄,跨库零样本迁移绝对性能仍处低位,其适用边界受限于组内公平与小幅域泛化,跨域大规模外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/google-bert/bert-base-multilingual-cased — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1015. 有限数据下改提示还是改权重:结构化推理以零训练成本超越自训练
标签:#提示学习 #音频大模型 #模型比较 #低资源 #音频问答
评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#音频问答 | 主方法:#提示学习
👥 作者与机构
- Sujit Noronha:机构信息未能从会议 PDF 纯文本可靠映射
- Steven Au:机构信息未能从会议 PDF 纯文本可靠映射
- Kaushlendra Tripathi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态音频推理(Multi-Modal Audio Reasoning,MMAR)要求模型同时听辨声学细节并完成计数、音乐理论、情感意图与文化常识等四选一推理,难点在于高质量音频思维链稀缺且30B级模型微调成本高昂。本文以Qwen3-Omni 30B为基座对比三条路线:结构化提示工程先做基线错误分析再固化听觉接地与决策流程,自动化提示优化用DSPy MIPROv2在划分数据上搜索提示,强化自训练(Reinforced Self-Training,ReST)则生成候选推理并只用学习区正确样本做qLoRA微调。与文本微调直接改权重不同,胜出的结构化推理通过HEARD描述、ANALYSIS综合与ANSWER承诺三段式约束模型忠于原始音频证据并禁止自我覆写。在MMAR 1000题测试集上结构化推理取得72.6%准确率,较67.1%基线提升5.5个百分点,而ReST与MIPROv2分别降至64.7%与63.3%。该结论仅在单一基准与单一基座模型上验证,小样本子类与跨基准迁移尚未检验。结构化提示训练成本为零,ReST则需16采样候选生成与3轮迭代微调的显著GPU开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1016. 录音不像自己:用可感知的低维滑块逼近自然自语音
英文题目:SELFIX: An Interactive System for Natural Self-Voice Approximation
标签:#心理声学实验 #言语感知 #语音 #语音转换
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音转换 | 主方法:#心理声学实验
👥 作者与机构
- Pavo Orepic:机构信息未能从会议 PDF 纯文本可靠映射
- Steven Moran:机构信息未能从会议 PDF 纯文本可靠映射
- Volker Dellwo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自我嗓音近似的输入是麦克风录制的空气传导语音,输出是说话人主观听感自然的变换版本,难点在于骨传导滤波组合空间巨大且多频段均衡器搜索缺乏感知约束而不易收敛。浏览器前端经快速应用程序接口将单声道语音送至后端,先由基频估计与同步叠加相加 PSOLA 重合成完成音高与声道长度缩放,其输出进入线性预测编码分解得到的声源与滤波器表示。再经六百赫兹低频搁架与保留中频的梯形参数滤波及峰值软削波输出波形,所有参数被约束在生理合理范围并支持实时试听与日志记录。与直接调节均衡器增益不同,该链路把搜索限制在音高加声道长度加谱倾斜的低维感知相关空间,因而更易映射内部自我嗓音表征。在单滑块感知匹配任务条件下,男性参与者的置信度分数为77.79±17.79,高于女性参与者的置信度分数74.22±19.89。结论仅适用于 Hi, how are you 短句朗读与联想笔记本内置麦克风加扬声器链路,未验证跨文本跨设备与大样本外推。该结论的跨文本与跨设备泛化能力尚未验证且受限于二十五人概念验证范围。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://osf.io/6nxzw/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1017. 词不够用时靠声音补:把音高和能量写进语音表示来解语用歧义
英文题目:Prosody-Aware Speech Representations for Emotion Recognition under Pragmatic Ambiguity
标签:#基准测试 #模型融合 #韵律 #语音情感识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#模型融合
👥 作者与机构
- Yeonwoo Park:机构信息未能从会议 PDF 纯文本可靠映射
- Chioh Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理韩语口语情感识别中的语用歧义问题,输入为单声道 16 kHz 短语音波形,输出为 59 类多标签情感,难点是同一文本如 Geurae 可因语调表达赞同或讽刺而词法线索失效。方法链分三步:冻结的 Whisper-large-v3-turbo 编码器将对数梅尔频谱转为帧级语义表征,负责提供转写导向的共享表示;并行提取的基频即 F0 与能量经插值对齐到同一时间分辨率,负责补回被语义抽象压制的韵律变化;拼接投影后送入两层 Transformer 编码器加三层线性层的分类头,负责联合建模语义与韵律并以 Sigmoid 输出多标签。与输出级晚期融合不同,该设计在共享隐空间直接注入显式韵律,使歧义消解依赖声学实现而非文本推理。在 AI-Hub 韩语朗读训练集与 1000 条语用歧义未见测试集上,韵律增强版本较同骨干无韵律版本在子集准确率即 Subset accuracy 上提升 13.93 个百分点,在语用歧义消解即 PAR 上提升 11.6 个百分点,并持平 GPT-4o mini 文本推理。结论仅在韩语朗读与会话剪辑范围内验证,跨语言、自发噪声及视觉缺失外的泛化尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1018. 矩形房间学到的声学知识,能搬到 L 形房间吗:冻结编码器只调解码器
标签:#正则化 #迁移学习 #少样本 #去混响 #房间脉冲响应估计
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#房间脉冲响应估计 | 主方法:#迁移学习
👥 作者与机构
- Shahab Pasha:机构信息未能从会议 PDF 纯文本可靠映射
- Jiahong Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Hualin Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Christian Ritz:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该文处理由房间几何、声源与麦克风位置预测房间脉冲响应(Room Impulse Response,RIR),难点是从凸矩形房间泛化到非凸L形与不规则房间且目标标注极少。方法链分三步推进:几何感知编码器(Geometry-aware Encoder)先将拼接参数映射为形状不变表征并展开为时变嵌入,物理约束解码器(Physics-informed Decoder)再经两层长短期记忆网络(Long Short-Term Memory,LSTM)逐采样合成波形,源域预训练后冻结编码器仅微调解码器以保留空间推理并适配混响特性。与对抗生成方法不同,该框架用稀疏性与指数衰减正则器显式编码早期无到达与能量衰减先验,避免对抗训练不稳定。在40个未见L形与不规则房间的2000条仿真RIR上,微调模型相对源域基线将均方误差(Mean Square Error,MSE)降低56%,对数谱距离(Log-Spectral Distance,LSD)降低37%,去混响语音质量(Perceptual Evaluation of Speech Quality,PESQ)达到3.24。结论限于16 kHz仿真图像源数据与固定房间划分,未验证真实测量、移动声源与大混响外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1019. 漂移不是单因素:用模块化诊断数据看鲁棒性如何获得、迁移与遗忘
英文题目:MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition
标签:#基准测试 #数据集 #持续学习 #鲁棒性 #语音识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#持续学习
👥 作者与机构
- Theresa Pekarek Rosin:机构信息未能从会议 PDF 纯文本可靠映射
- Matthias Kerzel:机构信息未能从会议 PDF 纯文本可靠映射
- Stefan Wermter:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理自动语音识别在口音、损伤、年龄、噪声与领域词汇共现漂移下的鲁棒性退化问题,输入为多条件语音波形,输出为转写文本,难点在于单因子评测无法复现现实累积漂移与遗忘机制。其方法链第一步以田口L27正交阵列加两个折叠维度构造108种运行配置,系统覆盖语言内容、说话人特征与声学环境共10个因子,输出的配置表直接作为后续数据填充的规格约束。第二步承接该规格约束,优先以开源真实语料填充可行组合,对缺失组合以XTTS-v2零样本合成补齐,再经重采样与噪声注入在内的增强管线统一声学条件,形成多小时语料。第三步承接该语料,按声学漂移、说话人漂移、语言漂移与复合漂移切分在线持续学习课程,使回放与正则方法在流式单遍训练中暴露遗忘与迁移。与已有噪声或口音单点数据集相比,关键差异是将鲁棒性视为随任务序列演化的可迁移能力并显式分离漂移类型。在whisper-small.en上经验回放10%缓存时平均词错率为17.31%,优于联合训练基线的27.24%。结论仅在英语小模型与8100条规模内成立,合成失真与顺序敏感性限制了向大模型与真实长尾的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1020. 硬边界太脆:用时长感知的软目标建模音素过渡不确定性
英文题目:Duration-Aware Soft Targets for Text-Independent Supervised Phone Segmentation
标签:#RNN #语音学与音系 #语音 #音频事件检测
评分:5.8/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#RNN
👥 作者与机构
- Raghavan Ramesh:机构信息未能从会议 PDF 纯文本可靠映射
- Meka Nani:机构信息未能从会议 PDF 纯文本可靠映射
- Sri Rama Murty Kodukula:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本无关有监督音素切分需从连续声学序列逐帧预测边界概率,但自然过渡渐变而人工标注多为单帧硬标签,带来监督失配与伪峰过分割。本文以枢轴边界自适应计算左右音段时长并按扩展比截取邻域,再用两个非归一化零均值半高斯脉冲生成时长感知软目标并以加权二元交叉熵训练两层双向门控循环单元模型,最后经基于显著性的峰值检测得到边界输出。与硬目标和结构化损失等已有机制不同,该方法不改架构而只重塑监督分布,用指数衰减刻画过渡不确定性,从而抑制虚假峰值并降低过分割。在TIMIT测试集下,软目标模型的R-value指标为91.53,高于硬目标基线的R-value指标89.50。该结论限于 20 ms 容差与梅尔频率倒谱系数(MFCC)加轻量循环网络的设定,对强制对齐噪声较大的语种与长时自发语音的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1021. 先保住是谁,再改嘶哑程度:分阶段条件流把音高性别与气息嘶哑分开建模
标签:#对抗训练 #流匹配 #主观评测 #语音 #语音编辑
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编辑 | 主方法:#流匹配
👥 作者与机构
- Frederik Rautenberg:机构信息未能从会议 PDF 纯文本可靠映射
- Fritz Seebauer:机构信息未能从会议 PDF 纯文本可靠映射
- Petra Wagner:机构信息未能从会议 PDF 纯文本可靠映射
- Reinhold Haeb-Umbach:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
任务输入为语音波形x及其说话人表征s与属性向量a,输出为仅改变嘶哑程度而保持平均基频、性别与说话人身份的重合成语音,难点是人群层面嘶哑与音高强相关会被单阶段生成模型学成耦合而调嘶哑时拖动音高与性别感知。方法先将说话人向量s经第一段条件连续流f1在平均基频与性别条件下映射到中间隐变量,并经梯度反转层做基频回归对抗与性别分类对抗以剥离高层信息。接着第二段条件连续流f2仅以气息声粗糙声与嘶哑为条件将中间隐变量映射到标准正态附近的基分布。推理时先正向积分到基分布,再将嘶哑目标改为af加偏置后逆序积分得到新说话人表征并经YourTTS后端合成。相对单阶段共享条件的基线,关键差异是按高层与低层分网分时注入条件并强制中间层不变,从而阻断低层操作向上游泄漏并保留身份。在LibriTTS-R语料听辨任务下,hierarch模型的说话人相似度分数为3.0±1.2,高于base模型的说话人相似度分数1.6±0.8。该结论适用边界受限于英语朗读语音单一后端与嘶哑单维度验证,尚未验证其他嗓音品质与跨语种外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1022. 手能代替声道吗:卡西外部共鸣元音的三路证据与高基频代价
标签:#人类参与评测 #发声与构音 #言语感知 #语音 #语音可懂度评估
评分:5.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#人类参与评测
👥 作者与机构
- Jinyang Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Bingliang Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Jiangping Kong:机构信息未能从会议 PDF 纯文本可靠映射
- Xiyu Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
卡西表演以芦苇哨片为声源、以双手在口外构成可变共鸣腔,输入为197个普通话单音节词朗读,输出为5个单元音a、o、e、i、u的类别归属,难点在于基频高达约300 Hz至700 Hz时谐波稀疏导致共振峰估计与感知均不稳定。研究先用MediaPipe追踪右手21个关节点的三维姿态并经主成分分析降维得到手势元音图,再用VoiceSauce与宽带语图人工校准提取基频与第一至第三共振峰并训练随机森林分类器量化可分性,最后用24名母语听者的强制选择听辨测量可懂度与反应时从而闭环验证发音到感知。与高音歌唱中随基频连续上移共振峰的做法不同,卡西在特定基频区间内将共振峰锁定在邻近谐波上并在区间交界处跳变回落,使共振峰稳定在较窄范围内以兼顾响度与区分度。在普通话语音与卡西对比测试集下,普通话语音测试集的准确率为96.4%,高于卡西测试集的准确率84.1%。该结论仅适用于单名熟练表演者的孤立水平调元音,未验证辅音、双元音、声调连续语流与多表演者泛化,o与e的混淆仍严重。该适用边界受限于孤立元音与单表演者条件,连续语流与多表演者泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1023. 性感化合成人格:当文本相同,女声仍被听成顺从与性感
英文题目:Sexualised Synthetic Personas Encode and Amplify Gendered Power Asymmetries through Voice
标签:#主观评测 #公平性 #言语感知 #语音 #语音属性识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#主观评测
👥 作者与机构
- Alice Ross:机构信息未能从会议 PDF 纯文本可靠映射
- Ariadna Sanchez:机构信息未能从会议 PDF 纯文本可靠映射
- Elin Kanhov:机构信息未能从会议 PDF 纯文本可靠映射
- Catherine Lai:机构信息未能从会议 PDF 纯文本可靠映射
- Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为ElevenLabs语音库中以调情与诱惑标签出售的男声与女声合成语音,输出为听众对其性别化权力感知的系统性差异,难点在于剥离文本露骨程度与声音风格本身带来的刻板印象。首先按性别与性化标签选取热门声音并分别合成性化文案与彩虹通道中性文本,形成风格与内容正交的刺激集并进入听辨环节。接着通过在线听辨让被试每轮从36个形容词中三选并辅以自由评论,将评价映射到积极消极与支配顺从及性化维度。然后结合广义线性混合效应回归与平均基频及语速测量检验差异来源,区分声学特征与文本效应的贡献。与只谈默认女声的语音助手性别研究不同,本文证明可售卖的性化人设本身即编码了不对称的亲密脚本。在语音声学评测条件下,性化男声的平均基频指标为70.08 Hz,低于中性男声的平均基频指标110.88 Hz。结论仅适用于英语商业性化人设与美国和加拿大常住听众,未验证其他语言文化与长期交互中的顺应效应。该结论的适用边界受限于英语语料与美加听众,跨语言长期交互效应尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://ariadnasc.github.io/synth-personas → https://ariadnasc.github.io/synth-personas/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1024. 不用注册语音做条件:用混合语音自身的说话人吸引子引导潜在流匹配分离
英文题目:Latent Flow Matching Based Speech Separation Using Speaker Diarization
标签:#流匹配 #单通道 #语音 #语音分离
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#流匹配
👥 作者与机构
- Boris Rubenchik:机构信息未能从会议 PDF 纯文本可靠映射
- Sharon Gannot:机构信息未能从会议 PDF 纯文本可靠映射
- Ethan Fetaya:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道语音分离需从单麦克风混合波形中恢复各说话人干净语音,重叠与说话人混淆是主要难点。本文提出结合端到端说话人分离标注与隐空间流匹配的分离流水线,仅训练隐空间U-Net而复用冻结变分自编码器、BigVGAN声码器与长时流式EEND-EDA模块。流程先由EEND-EDA从混合梅尔谱提取说话人吸引子与帧级活动概率并平均池化为条件向量,再将混合隐表示与中间噪声隐状态拼接输入流匹配U-Net估计速度场,迭代采样后经解码与声码器重建波形,推理辅以无分类器引导与对抗说话人引导抑制干扰说话人。相对依赖注册音频的提取范式,混合派生吸引子直接刻画混合内可分性且无需注册,并以置换不变训练解决盲分离排列歧义。在LibriMix双说话人干净集上,所提方法整体感知质量评分为3.20,DNSMOS为3.76,词错误率为13.26%,混淆率指标为0.08%,大幅低于注册变体与SoloSpeech。方法仅验证双说话人英语朗读混合与10.24秒固定时长训练,未检验未知说话人数、噪声混响与长时流式外推。原文未披露优化器、训练轮数、采样步数与训练推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1025. 用可懂度去调制声学通道:在冻结 HuBERT 上做构音障碍识别
标签:#参数高效微调 #言语障碍 #语音 #语音识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#参数高效微调
👥 作者与机构
- Paban Sapkota:机构信息未能从会议 PDF 纯文本可靠映射
- Hemant Kumar Kathania:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍语音识别需将高度变异的病理语音转写为文本,输入为说话人可懂度差异极大且标注稀少的TORGO话语,输出为词序列,难点在于通用自监督表示多在典型语音上预训练而难以覆盖重度失真。该文先从话语级HuBERT均值特征训练可懂度分类器,并取倒数第二层128维嵌入作为严重程度表征,为后续调制提供话语级条件输入。接着将该嵌入经通道条件器以FiLM缩放偏置与门控方式注入冻结的HuBERT-large-ll60k前端,在间隔10层共3处自适应调制声学表示。最后把调制特征送入12层Conformer编码器加6层Transformer解码器,以CTC权重0.7的联合CTC/注意力目标训练并用束搜索解码,与全量或部分微调不同,该方法冻结主干只训练条件器与分类层,把外部严重程度信息转化为参数高效的通道控制。在TORGO留一说话人交叉验证评测设置下,Gated-FiLM的WER为21.0%,低于冻结HuBERT的WER 28.9%。该结论的适用边界受限于英语TORGO小样本封闭词汇与固定解码配置,跨库跨语言泛化与显著性检验尚未验证,重度失真下FiLM-only与门控变体互有胜负构成失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1026. 继续预训练把内容推上去、把说话人推下来:离散单元与对比模型的分化
标签:#自监督学习 #多语言 #语音识别 #说话人分离标注 #语言识别
评分:5.8/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#自监督学习
👥 作者与机构
- Danner Schlotterbeck:机构信息未能从会议 PDF 纯文本可靠映射
- Alessandro Huaman:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Gomez:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理多语言自发语音上的持续预训练(Continued Pre-Training,CPT)领域适配问题,输入为无标注目标域音频,输出为可迁移的语音表示,需同时服务语音识别(Automatic Speech Recognition,ASR)、语言识别(Language Identification,LID)与说话人分离标注(Speaker Diarization)三类任务。方法链为数据筛选、伪标签重算、分范式恢复预训练三步:先按语音活动检测(Voice Activity Detection,VAD)密度与语言稀缺度从 MLCommons Unsupervised People Speech百万小时语料中构造100小时与500小时子集,再对离散单元模型重算目标域k均值伪标签并接入新的投影头,最后在共享掩码预测或对比目标下恢复预训练5个轮次。与既有集中于对比模型、可直接恢复训练的CPT不同,该工作把重算嵌入聚类标签引入HuBERT与WavLM,使离散单元模型也能在目标分布上继续学习。在UPS挑战集上HuBERT-base三种子均值语言识别Macro-F1由0.56升至0.67,字符错误率(Character Error Rate,CER)由0.72降至0.65,而说话人分离标注调整兰德指数(Adjusted Rand Index,ARI)由0.76降至0.32,WavLM-large与WavLM-base+亦出现类似说话人崩塌,对比模型OmniASR则ARI由0.37微升至0.42。结论边界在于内容增益随种子与数据规模波动大,仅说话人退化在多个离散单元模型中稳定复现,且原始能力保持与大规模验证尚未完成。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1027. 编解码把真话推向假话一边:盯住难正例拉开边界
英文题目:Hard Positive-targeted Training for Robust Audio Deepfake Detection under Neural Codec Processing
标签:#数据增强 #对比学习 #鲁棒性 #语音 #音频深度伪造检测
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#对比学习
👥 作者与机构
- Jiwon Seo:机构信息未能从会议 PDF 纯文本可靠映射
- Inho Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Seongkyu Han:机构信息未能从会议 PDF 纯文本可靠映射
- Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
- Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理音频深度伪造检测(Audio Deepfake Detection,ADD)在神经编解码器(Neural Codec,NC)重建后鲁棒性骤降问题,输入为原始或NC重建波形,输出为真实(bonafide)与伪造(spoof)二分类,难点是NC伪影使真语音嵌入向伪造区域偏移并模糊边界。方法链分4步:先以干净真语音为锚构建包含2个NC真正样本与3个伪造负样本的小批量,持续暴露边界混淆对;再挖掘离锚最远的难正样本(hard positive)聚焦易错真语音;随后用引导损失(guidance loss)推远难正样本与负样本并用三元组损失(triplet loss)约束锚与负样本距离;最后与交叉熵联合优化以稳定分类。相比仅做NC数据增强,该机制显式塑造难例周围的嵌入几何而非期望模型自行学到分离。在包含BigCodec与SpeechTokenizer等条件评估中,SSL-Conformer总体等错误率(Equal Error Rate,EER)从24.36%降至10.93%,未见NC条件下从30.19%降至11.83%。结论限于4种低比特率语音编解码器与短句评测集,未验证高压缩音乐、实时流式及对抗自适应伪造的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1028. 所谓语义码本为何更像语音:四种语音编码器的语义与语音 probing
英文题目:Speech Codec Probing from Semantic and Phonetic Perspectives
标签:#评测协议 #可解释性 #语音学与音系 #语音 #语音编码
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#评测协议
👥 作者与机构
- Xuan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Chang Zeng:机构信息未能从会议 PDF 纯文本可靠映射
- Tiantian Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Shih-Heng Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianbo Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音分词器需把连续波形映射为离散 token 并同时服务理解与生成,但所谓语义首层到底编码词汇语义还是语音相似仍不清楚。输入为连续语音波形与离散文本词元,输出为可同时支撑重建与语言建模的离散编码,难点在于声学相似与词汇语义在特征距离中纠缠且跨模态空间并不共享。本文以 EnCodec、DAC、MIMI 与 MIMO 为对象,先用同义词与近音词对的特征距离对比语义与语音密度,再把码本特征与实时磁共振声道距离做投影加权典型相关以验证构音 grounding,最后用中心化核对齐度量语音与文本表征的结构对齐。与把自监督语音特征直接蒸馏为语义层的已有做法不同,该链条以前层累加解码特征进入后层距离计算,并用声道距离相关与跨模态结构对齐交叉验证,从而区分真正的构音编码与单纯的声学相似。在LibriSpeech词级语音文本对齐评测下,MIMI的CKA得分为0.329,高于MIMO的CKA得分0.122。其适用边界受限于英语词级短片段与四款编码器的探测条件。该结论目前仅适用于英语词级短片段与所测四款编码器,未验证长语境、跨语言与下游任务增益。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1029. 语义越贴合说得越短吗:自发语音中语义相关度的非线性与频率依赖
英文题目:Non-linear Effects of Semantic Relevance on Word Duration in Spontaneous Speech
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Kun Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Rong Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为Buckeye自发英语对话中目标词及其前文语境,输出为该词发音时长的统计解释,难点在于语义易化与词汇竞争抑制可能同时作用并呈非线性,传统词频与N元概率难以刻画概念一致性。方法先用在Common Crawl上预训练的三百维fastText静态词向量计算目标词与前三个词的余弦相似,并按0.9、0.6、0.3近因加权求和得到语义相关度,其输出刻画局部语义适配程度。接着拼接词长、基于SUBTLEX-US的对数词频、短语语速和音段删减等控制变量,形成与说话人标识共同进入下一步的预测矩阵。最后送入广义加性混合模型估计非线性平滑项与说话人随机效应,由此分离各因素贡献并揭示U形曲线。与线性可预测性建模的关键机制差异在于显式量化局部语义适配并允许非线性,从而区分中度支持的易化与高度语境中心词的竞争抑制,具有生产侧时序建模意义。原文未提供可核对的关键定量结果。该结论适用边界受限于美式英语访谈式自发语音与特定向量窗口设置,跨语言与韵律交互等外推范围尚未验证。原文未披露训练、推理或部署成本,并声明未使用生成式AI工具。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1030. 口音藏在中间层:用均值偏移向量在推理时拨动大音频语言模型
英文题目:Activation Steering for Accent Adaptation in Large Audio Language Models
标签:#测试时自适应 #音频大模型 #可解释性 #语音 #语音识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#测试时自适应
👥 作者与机构
- Jinuo Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Sung Kyun Chung:机构信息未能从会议 PDF 纯文本可靠映射
- Qiuchi Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Eun-Jung Holden:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为带地域或非母语口音的英语语音,输出为转写文本,难点在于音素实现与韵律偏移导致共享基座模型出现系统性识别落差与公平性问题。该方法先用文本匹配的跨口音与同口音内话语对提取各编码器层的均值偏移方向,再将该方向单层注入并经由多模态投影仪测量余弦对齐增益,从而得到去说话人混杂的层敏感性画像。画像指导的推理时口音转向将抽取集估计的单位化方向以前向钩子加到选中层隐藏状态,使评测语音向标准英语表示漂移而无需更新权重。与直接调参相比,该机制把适应约束在口音敏感子空间,避免在无关层扰动语义表示。在平衡抽样评测中,加拿大口音词错率相对基线下降33.80个百分点,北爱尔兰口音下降29.63个百分点,阿拉伯口音下降8.06个百分点。结论仅适用于所测的8种英语口音与Qwen2-Audio-7B编码器中间层窗口,未验证跨语言、强噪声或流式部署的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1031. 把一个人的 8 段发音连成一张图:多发音图学习为何在 ALS 分级上超过单段基线
标签:#语音生物标志物 #图神经网络 #自监督学习 #病理语音评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#图神经网络
👥 作者与机构
- Behrad TaghiBeyglou:机构信息未能从会议 PDF 纯文本可靠映射
- Fatemeh Bagheri:机构信息未能从会议 PDF 纯文本可靠映射
- Ervin Sejdic:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
肌萎缩侧索硬化症构音障碍线索分散在5个持续元音和3类轮替运动音节的多个时段中,单录音独立分类难以稳定刻画被试级状态,更难从早期录音预测远期功能衰退。该工作提出被试级图分类流水线:先将每段8 kHz录音重采样至16 kHz、峰值归一化并统一为20秒后切分为10个2秒块,再用冻结自监督Transformer编码器取末层隐状态均值池化为768维嵌入。接着将同一被试最多80个块堆叠为节点特征,按余弦相似度构建无向加权k近邻图并以相似度为边权,最后用图神经网络消息传递加全局均值池化和两层多层感知机输出被试标签。与逐录音独立建模相比,该机制允许跨元音、跨音节与跨时段块间直接传播互补证据,从而聚合稀疏且分布式的源、滤波器与稳定性线索。在SAND官方验证集设置下,最优HuBERT加图同构网络配置任务1的宏F1为0.73,高于SAND验证基线的宏F1的0.61,且任务2的宏F1为0.69,高于SAND验证基线的宏F1的0.58。该结论仅在验证集成立,未经挑战服务器测试集验证,且拼贴重复与固定无监督构图可能引入伪相似。实验在单张NVIDIA RTX 5080上基于Python 3.11.9、PyTorch 2.10.0和Hugging Face Transformers 5.1.0实现,未披露训练时长与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1032. 听不懂也能听出情绪:人类与语音语言模型的跨语言情绪识别是否同构
英文题目:Universality of Speech Emotion Recognition in Humans and Speech Language Models
标签:#人类参与评测 #模型比较 #跨语言 #语音情感识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#人类参与评测
👥 作者与机构
- Yuka Tatsumi:机构信息未能从会议 PDF 纯文本可靠映射
- Nathan Roll:机构信息未能从会议 PDF 纯文本可靠映射
- Robert D. Hawkins:机构信息未能从会议 PDF 纯文本可靠映射
- Meghan Sumner:机构信息未能从会议 PDF 纯文本可靠映射
- Dan Jurafsky:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文检验不懂目标语言仍能识别语音情绪的普遍性,输入为加拿大法语、日语、希腊语、泰语实验室表演短句,输出为happy、sad等六类强制单选,难点在于语言未见、跨库情绪类别不对齐与韵律线索存在文化差异。先以四语言实验室表演语料为输入筛选均衡刺激并限定单次播放限时作答,职责是构建跨语言可比测试集,输出与人类试验完全相同的非英语刺激池与101名英语单语听者的人类基线。再以前一步输出的刺激池的六类标签为约束,以英语ESD、CREMA-D、RAVDESS语音经冻结24层Whisper-medium.en与HuBERT-large-ll60k编码加时域均值池化的话语向量为输入训练带L2正则的多项逻辑回归探针,职责是以英语验证集最优层锁定主分析层,输出层选择与英语探针权重。最后以前两步输出的同题非英语刺激池与探针权重为输入做零适配测试并与人类基线做分层bootstrap对比,职责是隔离层选择与跨语言测试,输出可比的普遍性差异与响应偏差。与已有跨语言识别工作不同,本研究以同刺激同任务对比冻结单语编码器与单语听者,实际意义在于分离声学表征普遍性与峰值精度背后的响应偏差。在非英语四语言测试集评测设置下,人类听者的准确率为43.8%,高于众数基线的准确率21.4%。结论仅限于表演性、实验室录制、短句、冻结单语编码器加线性探针条件,不外推至自然对话、多语预训练或微调系统。原文未报告训练推理成本与代码模型数据发布。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1033. 定长训练遇上变长语音:用时长嵌入去纠正自注意力的位置偏置
英文题目:Duration-aware self-attention for speech deepfake detection
标签:#注意力机制 #鲁棒性 #语音 #音频深度伪造检测
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#注意力机制
👥 作者与机构
- Youzhi Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Liping Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造检测需将变长语音判为真或假,而固定长度填充与截断会引入边界伪影并丢失关键赝品线索,导致时长失配时性能退化。该方法先由wav2vec 2.0 XLS-R提取帧级表征,再由音频时长与片段偏移经傅里叶特征映射构造计时嵌入,然后将该嵌入注入Conformer与ConFusionformer的自注意力偏置以校正注意力系数,最后经池化与二分类器输出真伪判决。与直接拼接或自适应层归一化不同,该设计把全局时长上下文作为注意力偏置约束来调节位置交互,其中相对位置编码依赖型变体约束最强。三种实现按约束强度递进:帧独立变体只学习每头偏置,帧依赖变体建模计时嵌入与全序列的逐帧交互,相对位置编码依赖变体则将计时嵌入拼接到相对距离编码并限制在最大相对距离内以避免过度校正。这种偏置校正使每帧在全局时长上下文引导下兼顾局部伪造痕迹与长程不一致性,从而缓解训练与评测时长失配时的波动。在ASVspoof21-DF上ConFusionformer加该变体平均等错误率EER为1.71%,优于基线的1.84%,并在In-the-Wild上保持改善。该结论限于ASVspoof19训练与四个英语评测集,CodecFake上绝对误差仍超25%且未验证长音频与跨语种外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1034. 先破坏频域身份结构再保听感:FreqGuard 的主动语音防御
英文题目:FreqGuard: Leveraging Frequency-Domain Feature Priors for Universal Proactive Voice Defense
标签:#时频分析 #音频安全 #语音 #语音克隆
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音克隆 | 主方法:#时频分析
👥 作者与机构
- Yankai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhipeng Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxuan Du:机构信息未能从会议 PDF 纯文本可靠映射
- Rong Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Deng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
主动语音防御输入为原始说话人波形,输出为加入不可感知扰动的保护波形,难点是同一扰动须同时让黑盒语音合成产出的克隆语音通不过说话人验证,又不损伤保护语音本身的听感与身份。FreqGuard 先在 LibriSpeech 上系统实测压缩、量化、频带掩蔽、加噪、混响与重采样对身份相似度与音质的影响,筛选出中低频掩蔽与中等码率编码等低失真高破坏操作,按40%平衡、40%强扰动、20%参考构建24000条引导数据集;再用先验驱动防御网络重构幅度谱与相位谱以提供高质量扰动基座,用梯度引导扰动模块在幅度谱上沿最小化说话人嵌入余弦相似方向注入无穷范数约束扰动,最后经短时逆傅里叶变换合成保护音频。与随机噪声初始化直接最大化嵌入偏移不同,该框架强调频域结构性破坏身份与合成共享子空间。在VCTK经CosyVoice合成并用Cam++计分时保护语音感知评估语音质量为2.467且攻击成功率为25.05%,显著低于同表PoP的96.85%与Enkidu的62.05%;在StyleTTS2下攻击成功率为1.70%,接近端到端基线的1.90%。该结论目前仅在21个说话人共4200条评估语音、4种合成器、6种验证模型下验证,高压缩强净化与实时流式部署外推尚未证明。训练使用4张NVIDIA RTX 4090共100轮,推理时延与吞吐论文未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1035. 跨库抑郁检测为何只在最后一层解耦不够:逐层压住说话人与语料依赖
英文题目:Layer-wise Multi-factor Adaptive Disentanglement for Cross-corpus Speech Depression Detection
标签:#领域适应 #跨语言 #语音 #病理语音评估
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#领域适应
👥 作者与机构
- Minggang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shohei Kato:机构信息未能从会议 PDF 纯文本可靠映射
- Wen Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Fenghui Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Yan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语料语音抑郁检测输入为连续语音切分的滤波器组特征,输出为受试者级健康对照与抑郁二分类,难点在于说话人身份与录音语言任务协议等多源干扰在编码器层级中编码并逐层累积传递,仅在输出层约束难以消除捷径特征。该工作提出层间多因子自适应解耦框架 Layer-wise Multi-factor Adaptive Disentanglement(LMAD),在无监督域适应下对多个关键层估计希尔伯特施密特独立性准则 Hilbert-Schmidt Independence Criterion(HSIC)依赖,按依赖比例与梯度方向一致性生成自适应权重,再以加权正则抑制说话人与语料依赖并保留抑郁依赖。与仅在末层对齐或仅解耦说话人的已有方法不同,该机制在多个中间层同时干预并逐层逐因子调节强度,从而阻断干扰的逐层放大。在DAIC-WoZ训练Androids测试的跨语料设置下,ECAPA-TDNN骨干宏平均F1从0.39提升至0.62,健康与抑郁两类同时改善且语料内性能保持竞争。该结论目前仅在英语临床访谈与意大利语自发语音的双向迁移上验证,关键层集合先验固定且未验证多站点泛化。原文未披露训练推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1036. 车里每人听各的:用人耳掩蔽去管多用户串扰的预编码
标签:#智能座舱 #自适应滤波 #空间音频 #语音 #空间音频渲染
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#自适应滤波
👥 作者与机构
- Huihui Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Dengke Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Pengcheng Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Weiyu You:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaojuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Genke Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
车载个人声区需在7扬声器与4座位强混响耦合下同时向多位乘客送出独立语音,串扰与频率选择性衰落使传统能量型控制难以兼顾可懂度。所提框架先对目标语音做短时傅里叶变换并提取音调与噪声掩蔽体,经扩展函数与绝对听阈合成全局掩蔽阈值,再经逆映射生成感知权重矩阵。该权重送入频域声学多用户MIMO模型,与接收均衡矩阵和预编码矩阵构成感知加权均方误差目标,并在总功率与声对比度约束下交替优化以压制敏感时频区失真。与压力匹配等基线相比,该机制把均匀能量抑制改为听觉敏感度引导的联合多区误差最小化,在掩蔽强区放宽约束以保留目标保真度并提升多用户干扰协调能力。在实测轿车座舱与LibriSpeech语料评测设置下,MU MIMO Perceptual的STOI为0.859,高于PM的STOI 0.855。结论的适用边界限于静态停放车辆的三次重复测量与客观指标,尚未验证行驶噪声、头部移动与主观偏好下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1037. 拥挤声调空间里,纯音训练为何只救得了部分粤语声调
标签:#心理声学实验 #言语感知 #语音 #语音可懂度评估
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#心理声学实验
👥 作者与机构
- Yi Weng:机构信息未能从会议 PDF 纯文本可靠映射
- Junjie Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yanyuan Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Gang Peng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理粤语母语者在多人babble噪声下声调识别脆弱的问题,输入为受掩蔽的单音节词,输出为六声调类别判断,难点在于基频被信息性掩蔽且拥挤声调空间易混淆。方法链分三步:先用前后测词识别与奇异性音高敏感性测试建立基线,输出可辨阈与各声调识别准确率。接着将基线揭示的音高分辨短板送入8次居家自适应ABX纯音水平与轮廓辨别训练,以缩小可辨阈并锐化低层音高表征。最后把训练后的表征送入同说话人与新说话人词识别检验,分别度量近迁移增益与跨说话人远迁移保持。相比以往在安静条件下检验非言语训练的做法,本研究把增益窗口压到0dB与-5dB噪声并引入说话人泛化,以区分天花板效应与表征锐化效应。在安静条件的孤立音节识别任务下,T3的准确率约为70%,高于T6的准确率42%。结论边界是声学分离度高的声调可借助领域通用锐化获益,拥挤区声调仍需依赖说话人归一化与语境的针对性训练。低起始压缩区声调的跨说话人泛化适用边界受限,仍需针对性训练验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1038. 从声道协调谱看对话磨合:自发对话中发音卷入如何随时间分化
标签:#信号处理 #发声与构音 #语音 #语音对话系统
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音对话系统 | 主方法:#信号处理
👥 作者与机构
- Thanushi Withanage:机构信息未能从会议 PDF 纯文本可靠映射
- Carol Espy-Wilson:机构信息未能从会议 PDF 纯文本可靠映射
- Elizabeth Redcay:机构信息未能从会议 PDF 纯文本可靠映射
- Desi Jones:机构信息未能从会议 PDF 纯文本可靠映射
- Noah Sasson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为无任务自发双人对话语音,输出为发音协调复杂度变化与双人趋同得分,难点在于自然语速下协同发音与元音弱化严重,音素边界不可靠且无法使用侵入式电磁记录。方法链分为三步:先用语音反演得到六维发音器官轨迹,再对通道间互相关矩阵求特征谱以表征协调结构,最后用几何衰减加权和压缩为标量并比较双人前后半程间距变化得到趋同度。与既有短时声学预测或任务态发音测量相比,该框架强调与说话人无关的全局运动协调演化而非局部声学模仿,因而更具可解释性。在CANDOR数据集1381对非自闭对话中,前后半程加权协调值均值由0.3552降至0.3352,配对检验显著且趋同为正的对话多伴随更高自评会话成功率。结论仅适用于初次见面成人英语式闲聊,未验证儿童、任务型对话与多轮细粒度动态,也未排除熟悉度与话题的混杂。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1039. 记作相同却读作不同:厦门话变调与本调的次音位分化及三代分歧
标签:#统计分析 #语音学与音系 #社会语音学 #语音 #语音属性识别
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Huangyang Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Xiuwei Zeng:机构信息未能从会议 PDF 纯文本可靠映射
- Weijun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Peggy Pik Ki Mok:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为厦门闽南语单音节与双音节图片命名录音,输出为本调与变调基频轮廓是否等同及代际差异判断,难点在于传统变调圈将多对形式记为同一调值,掩盖了次音位高度与斜率差异与年龄分化。首先由两名母语者听辨筛选正确本调与变调发音,其输出的正确token进入下一步声学测量。接着用ProsodyPro提取十点归一化对数基频并做说话人内z-score归一化与去克里克声处理,其输出的规整化轮廓进入统计建模。最后以广义加性混合模型拟合整体轮廓并用线性混合效应模型检验高度与斜率交互,以输出可检验的年龄分组差异。与仅凭听觉印象的记音传统相比,该链条以连续高度比与斜率交互量化隐性分化,使中和与分化程度可直接比较,具有揭示渐变音变的实际意义。原文未提供可核对的关键定量结果。结论限于厦门市区49人的朗读 real-word 材料,未验证自发语、跨声调语境与儿童习得轨迹。该发现的适用边界受限于朗读语体与市区样本,尚未验证自发语与跨方言的外推表现。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1040. 从词到时间图:把饼干失窃描述变成可计算的叙事轨迹
英文题目:Automatic Graphical Representations of Language for Dementia Detection
标签:#语音生物标志物 #SFT #语音 #病理语音评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#SFT
👥 作者与机构
- Lingfeng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Si-Ioi Ng:机构信息未能从会议 PDF 纯文本可靠映射
- Pranav S. Ambadi:机构信息未能从会议 PDF 纯文本可靠映射
- Fan Lei:机构信息未能从会议 PDF 纯文本可靠映射
- Kimberly D. Mueller:机构信息未能从会议 PDF 纯文本可靠映射
- Julie Liss:机构信息未能从会议 PDF 纯文本可靠映射
- Visar Berisha:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为Cookie Theft看图说话录音,输出为认知状态判别线索与叙事组织解释,难点在于自发临床语音存在识别错误、措辞多样和空言语导致的语义稀疏。方法链分四步:WhisperX转写并给出词级时间戳后送入微调BERT做23类句子级多标签内容信息单元识别,LRP回传相关性并结合Sentence Transformer相似度定位词或片段起始时间,最后按时间序连边构建边权为间隔的有向时序图并提取组织与动力学特征。与既有词典匹配和空间图相比,该机制显式量化转移快慢与局部不稳定性而非仅覆盖位置,为临床筛查提供可视化时序解释。在W-ADRC语料评测设置下,人工转写条件的F1分数为0.879 ± 0.086,高于ASR转录条件的F1分数0.865 ± 0.098。临床组叙事覆盖更窄且进展更慢,独特节点减少与步长延长共同指向检索与组织受限,该外推在现有横断面比较之外尚未验证。结论限于英语 Cookie Theft 单任务和横断面两组比较,未验证跨任务、跨语言与纵向追踪能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1041. 不足一小时音频如何发现音位:用类型学近亲做迁移的 VQ-VAE
标签:#迁移学习 #语音学与音系 #跨语言 #少样本 #语音识别
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#迁移学习
👥 作者与机构
- Prasanth Yadla:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理不足1小时无标注遗产录音的音素级声学单元发现,输入为含噪声与磁带退化的16 kHz原始波形,输出为逼近真实音素库的离散编码序列与类音素单元,难点在于极少数据易过拟合且通用表征偏向印欧语系。方法先基于音素库交并比与语系权重挑选爪哇语与他加禄语等锚点,并在源语言上预训练向量量化变分自编码器形成可迁移码本,该码本直接作为目标初始化进入下一步。随后保留源码本并以低学习率与增强策略适配目标语言,再对编码做共现与时长后处理合并为类音素单元。与通用XLS-R加聚类相比,差异在于用亲缘语言声学模板与音节先验做初始化与隐式正则,而非依赖大规模通用表征。在Te Reo Māori不足一小时语料评测条件下,本文方法的NMI指标为0.56,高于XLS-R的NMI指标0.47。该结论仅在自一致性指标下成立,未用真实音素转写验证,且依赖存在高资源亲缘语言与近似音素表先验,孤立语与声调语言外推未经证实。原文披露单卡约12小时源语言预训练与每语2至4小时适配成本,20M参数量级支持田野侧轻量部署。该适用边界外推受限,原文披露的训练成本对应单卡硬件源语言约12小时与每语2至4小时适配。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1042. 电视剧语音为何难转准:用视频上下文在解码之后再纠错
英文题目:Speech Recognition on TV Series with Video-Guided Post-ASR Correction
标签:#多模态学习 #大语言模型 #音视频 #音视频语音识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频语音识别 | 主方法:#多模态学习
👥 作者与机构
- Haoyuan Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Yue Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Liqiang Jing:机构信息未能从会议 PDF 纯文本可靠映射
- John Hansen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
电视剧场景输入为长时音频与对应视频片段,输出为对话转写文本,难点在于多说话人、重叠语音、领域专有名词与长程上下文依赖使纯音频模型频繁出现同音与语境错误。该工作先用在自建训练集上微调的语音后端生成初版转写,再以冻结视频大模型回答剧集识别与细粒度描述两类问题抽取场景与人物上下文,最后将问答文本与初版转写连同纠错指令送入冻结大语言模型只改明显错误。与依赖唇动特征的音视频识别不同,该链路绕开高分辨率对齐人脸要求而依赖可解释的高层语义提示,具有即插即用特性。在自建Violin-TV测试集1013条剪辑上,以WavLM-large为后端时词错误率从29.83%降至23.64%,相对下降20.75%,显著优于无视觉纯文本纠错的29.45%。该结论目前仅在英语电视剧剪辑与4种已微调后端上验证,对音乐、非英语及强噪声直播的外推未经检验。原文未披露训练超参数、推理成本与延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1043. 韩语字音转换错一个音,为何会拖慢整个语音合成训练:一个形态感知规则引擎的验证
标签:#统计分析 #语音学与音系 #语音 #文本到语音
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#统计分析
👥 作者与机构
- Heejo You:机构信息未能从会议 PDF 纯文本可靠映射
- Sungwoo Moon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
韩语语音合成以字形文本为输入、音素序列为输出供声学模型学习对齐,难点在于音变深度依赖形态边界且一次变化会触发级联连锁反应,宽松耦合的开源g2pk难以兼顾精度与速度并向训练引入标签噪声。新引擎先用Kiwi形态分析构建句子到语节再到音节与语素的分层指针结构,使每个音节可直接查询形态边界,输出结构化表征进入规则引擎。规则引擎再按优先级顺序扫描音系规则,命中后回跳至语节首音节递归重估,将上一步改写作为下一步触发条件以模拟同化链式反应。同时规则专用孤立词典按词源隔离处理汉字词与固有词例外,并与规则重估结果合并为最终音素序列。与仅浅层引用形态结果的g2pk不同,该设计把形态信息内化为可寻址结构并显式建模规则级联,可解释且可定点修复。在925句KSS语料专家校验评测设置下,新引擎的准确率为85.7%,高于g2pk的准确率27.2%。该结论适用边界受限于标准朗读体与正确形态切分,同形异义等尚未验证。结论仅在标准韩语朗读体与Kiwi切分正确范围内成立,同形异义与新词空格错误仍会导致级联误用。原文未披露训练推理部署成本与代码模型数据发布。
🔗 开源资源
- 第三方资源:https://github.com/bab2min/Kiwi — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/Kyubyong/g2pk — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1044. 全局平均抹掉颤音:AcoustEmo 用话语对齐的声学窗口找回微韵律
英文题目:AcoustEmo: An Utterance-Aware Acoustic Q-Former for Open-Vocabulary Emotion Reasoning
标签:#注意力机制 #多模态模型 #音视频 #语音情感识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#注意力机制
👥 作者与机构
- Liyun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xuanmeng Sha:机构信息未能从会议 PDF 纯文本可靠映射
- Shuqiong Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Fengkai Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可解释开放词汇情感推理以视频帧、音频波形与带时间戳转写为输入,输出开放词汇情感词序列及解释,难点在于焦虑性颤音与语调突变等毫秒级线索易被全局平均抹除。首先声学编码器输出帧级特征并按话语起止时间戳映射为离散区间,得到与语言边界对齐的局部片段,该片段作为下一步局部建模的输入。其次每段由可学习查询经交叉注意力压缩为固定查询令牌,蒸馏微韵律等情感显著细节,同时并行保留全局背景令牌以维持宏观语境,融合后的多尺度声学令牌进入下一步。最后视觉令牌、融合声学令牌与显式携带时间戳的指令一起送入微调大语言模型生成情感解释。相比依赖全局音频池化的已有方法,该机制显式追踪声学线索随语言内容的时间演化,实际意义在于保留短时异常而不被长时平稳段稀释。在EMER-Fine测试集下,AcoustEmo的Avg得分为67.55,高于AffectGPT的Avg得分61.75。其失败条件在于依赖准确的话语时间戳与相对干净的说话人边界,在讽刺语义冲突与低信噪比重叠噪声下仍易失效,适用边界受限于清晰分句对话。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1045. 理解与生成分开测:UG-Bench 如何同时称量大音频语言模型的耳朵和嘴巴
英文题目:UG-Bench: A Comprehensive Benchmark for Evaluating Large Audio-Language Models
标签:#基准测试 #基准设计 #音频大模型 #音频理解
评分:5.8/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.9/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频理解 | 主方法:#基准设计
👥 作者与机构
- Jiaming Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Haoqin Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jinghua Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhang Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Shiyao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Enzhi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shiwan Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大音频语言模型(Large Audio-Language Models,LALMs)评测需同时覆盖语音、环境声与音乐的理解,以及转写、翻译、情感、字幕与语音合成,难点在于任务异构、提示模板不一与理解生成割裂。UG-Bench提出四阶段解耦评测流水线:输入标准化模块统一提示,模型接口模块调度11个LALMs与5个专用合成模型,输出统一模块规范自由格式生成,任务评测模块按语音感知、音频感知、语音生成与口语理解4类能力组织19个任务独立打分并加权排序。与仅测理解的Dynamic-SUPERB、偏重生成式理解的AIR-Bench和聚焦对话的SD-Eval相比,其差异在于模型实现与任务评测解耦并同时覆盖理解与生成。标准化提示输入模型接口产生中间结果,中间结果经输出统一为一致格式后进入任务评测,各任务按词错率、准确率、BLEU与平均意见分独立计分再按四类能力加权综合。任务评测按语音感知权重0.4、音频感知0.3、语音生成0.2与口语理解0.1先算子排名再算总分,便于新增模型与任务而不改上游组件。在语音感知任务评测下,Qwen2-Audio的WER为8.10,低于Salmonn的WER 31.67。该结论仅适用于所选开源模型官方checkpoint零样本不微调设置,中文星标数据不计入排名,槽填充因过难被舍弃,原文未披露训练与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1046. 咳嗽里找结核:互补表示为何要先对齐再加权融合
标签:#语音生物标志物 #模型融合 #向量量化 #音频分类
评分:5.7/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#模型融合
👥 作者与机构
- Mohd Mujtaba Akhtar:机构信息未能从会议 PDF 纯文本可靠映射
- Girish:机构信息未能从会议 PDF 纯文本可靠映射
- Sanjam Wadhwa:机构信息未能从会议 PDF 纯文本可靠映射
- Muskaan Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Ning Ma:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
咳嗽结核筛查的输入为诱发采集的咳嗽音频,输出为结核阳性或阴性判定,难点是跨设备与跨环境变异大且咳嗽缺乏语言内容。所提COBALT即码本对齐赌博机加权双曲原型融合,先用轻量一维卷积适配器将两路序列压缩为K个令牌,再经原点处指数映射送入庞加莱球并以共享原型码本做双曲向量量化对齐,接着用多臂赌博机视角学习原型可靠性权重并重加权证据,最后拼接两路证据及其逐元素乘积送入多层感知机分类。与直接拼接和莫比乌斯加法相比,关键差异是共享码本统一异构空间而可靠性权重抑制不稳定原型。在CODA TB DREAM Challenge基准受试者不相交五折交叉验证下,梅尔频率倒谱系数与PaSST融合达到准确率88.93%、F1值87.26%与曲线下面积89.07%,超越单表示与拼接基线并自称新最优。该结论仅在该诱发咳嗽基准内验证,未验证被动咳嗽、合并感染与筛查阈值下的外推能力。原文未披露推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1047. 用可编程凸轮搬动声道积木:物理模型如何做出鼻化协同与丛集 timing
英文题目:Articulatory Dynamics using Physical Vocal-tract Models
标签:#信号处理 #发声与构音 #语音 #语音合成
评分:5.7/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音合成 | 主方法:#信号处理
👥 作者与机构
- Takayuki Arai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为目标词的手势时序,输出为物理声道模型发出的连续语音,难点在于用机械结构复现协同发音与辅音丛时序重叠带来的声学渐变。首先将唇孔径、舌体收缩度与软腭耦合等声道变量写成手势谱,明确各手势的起始保持与释放时序,其输出直接作为凸轮形状的设计图纸。接着把谱线转译为直线凸轮的斜坡与矩形板组合以驱动六个可动模块与鼻咽耦合阀,使重叠时序转化为凸轮间距进入下一步发声。然后经扫频激励测传递函数并用自动语音识别检验可懂度,其测得的极零点变化与识别转折回证手势重叠是否生效。与计算机构音合成相比,该机制差异在于时序重叠直接体现为凸轮间距,鼻化与元音插入可被肉眼观察到,具有教学直观意义。原文未提供可核对的关键定量结果。结论限于
\[bɑb\]、
\[bɑm\]与
\[ɑbɹɑ\]等固定语料,未验证连续语流、外推至其他元辅音或跨说话人泛化。该物理模型的连续语流与跨说话人外推能力尚未验证,受限于固定语料与手工调参的适用边界。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1048. 干净语音能否替代扫描仪内语音做声道轮廓反演
英文题目:Acoustic-to-Articulatory Inversion of Clean Speech Using an MRI-Trained Model
标签:#RNN #发声与构音 #语音 #语音属性识别
评分:5.7/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#RNN
👥 作者与机构
- Sofiane Azzouz:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声学到发音反演需以语音波形为输入,重建从声门到唇部的8条发音器官轮廓,实际难点在于实时磁共振成像伴随音频含强扫描噪声且存在高频能量缺失、伦巴德效应与仰卧发音偏移,致使洁净录音与成像帧难以直接对应。本文先以句子级格式塔匹配加词级相对位置加音素内时间归一化,将洁净语音对齐到磁共振成像(magnetic resonance imaging, MRI)帧,得到与每帧对应的洁净目标时刻与帧索引,再用自监督学习(self-supervised learning, SSL)表示HuBERT-Base提取50 Hz嵌入,送入全连接加双向长短期记忆网络(bidirectional long short-term memory, Bi-LSTM)回归8×100轮廓坐标。与直接用动态时间规整(dynamic time warping, DTW)做声学对齐不同,该链条以音素边界约束对应帧,保留了音段结构。洁净训练洁净测试在MRI轮廓上达到均方根误差(root mean square error, RMSE)1.56 mm,中位数1.33 mm,接近去噪训练去噪测试的1.51 mm,明显优于跨条件测试的1.64 mm。在去噪与洁净跨条件评测设置下,洁净训练洁净测试条件的均方根误差为1.56 mm,低于跨条件测试的均方根误差1.64 mm。结论仅限单说话人法语、仰卧与伦巴德效应未校正的情形,外推至多说话人与真实噪声仍未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1049. 先搭架子后修细节:音频分离大模型注意力动态的因果解剖
标签:#注意力机制 #高效推理 #可解释性 #音频分离
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分离 | 主方法:#注意力机制
👥 作者与机构
- Yuxuan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyuan Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Peize He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入文本提示与混合音频、输出目标声轨分离结果,难点在于注意力观测与流匹配常微分方程非线性耦合纠缠,视觉空间对齐经验难以直接迁移为时序路由解释。先进行正交探测,输入加性注入与交叉注意力分别消融后的分离输出,以声学与语义正交指标度量分工,输出加性主导语义身份的不对称分工假设。再进行因果冻结,输入该分工假设指导下的自注意力轨迹,按熵变划分稳定层与快速层并冻结注意力矩阵,输出宏观包络早期收敛而细节持续精修的收敛时刻定位。最后进行门控劫持与层选择性缓存,输入上述收敛结论对应的层级划分,强制时段门控检验潜在几何能力并仅对已收敛层复用注意力计算,输出保真分离与推理开销节省。相对把交叉注意力视为语义接地的已有做法,该机制提出加性路径主导语义身份而交叉注意力精修声学纹理的不对称分工,为收敛引导缓存提供依据。在因果冻结评测设置下,稳定层冻结的SI-SNR指标为0.05 dB,低于快速层冻结的SI-SNR指标0.66 dB。该结论的适用边界受限于SAM Audio小模型与3B变体及三档复杂度语料,尚未验证向其他条件方案与求解器的外推,快速层过早冻结即构成失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1050. 矢状面定位病态问题中空间先验与声源先验谁在起作用
英文题目:Bayesian Model-Based Assessment of Spatial and Source Priors in Sagittal-Plane Sound Localization
标签:#心理声学实验 #统计分析 #模型比较 #空间音频 #声源定位
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声源定位 | 主方法:#统计分析
👥 作者与机构
- Yunda Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Nengheng Zheng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
矢状面定位需从单耳谱中同时解耦未知声源谱与方向相关头相关传输函数,输入为宽带噪声与声码器处理点击串,输出为极角估计,难点在于谱模糊与低谱分辨率下前后混淆加剧。方法链分三步:伽马通滤波器组提取0.7 kHz至18 kHz谱梯度特征并加入内部噪声得到感觉输入,整流互相关与映射生成感觉似然,再与空间先验相乘取最大后验并加入运动噪声输出方向,其中生态声源先验以白化矩阵作用于模板与输入。与固定均匀或前后对称先验不同,该工作允许前后混合权重与位置离散自由变化并联合评估声源谱统计,意义在于检验不对称与重尾期望是否更符合人耳行为。在七种谱分辨率条件下,无声源先验的AL变体的保护超越概率指标为0.281,低于全风险指标的0.68。结论仅适用于中位面静态宽带合成刺激与个体拟合条件,低通道下绝对误差被系统性高估且无法外推至人工耳蜗用户。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1051. 男性声道更参差,所以更好认?从形态参差看说话人识别性别偏差
英文题目:Vocal Tract Disparity and Potential Implications for Speaker Recognition
标签:#统计分析 #公平性 #发声与构音 #语音 #说话人识别
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#说话人识别 | 主方法:#统计分析
👥 作者与机构
- Tiena Danner:机构信息未能从会议 PDF 纯文本可靠映射
- Valeriia Vyshnevetska:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Friedrichs:机构信息未能从会议 PDF 纯文本可靠映射
- Steven Moran:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以正中矢状面静息容积与实时发音磁共振图像为输入,量化男女组内声道形态离散度差异并为女性说话人识别精度偏低寻找生物学解释,难点在于解剖形状、构音运动与可分性之间链路缺失。方法链第一步在静息与元音两套协议下标注二维解剖地标并将动态轨迹跨帧跨重复平均为单说话人单元音代表形状,为形状分析提供可比输入。第二步以广义普鲁克分析去除位置朝向尺度进入形状空间并以主成分分析揭示性别轴与元音轴,其输出的残差坐标进入离散度检验。第三步以个体到组均值均方普鲁克距离度量形态离散度并以质心尺寸与元音类别为协变量做999次置换检验,同时以逐地标方差热图定位咽壁舌尖等差异来源。与归因于训练数据性别不平衡或基频谐波稀疏采样的解释不同,本文提出男性更大解剖构音变异带来更具区分性频谱包络的内在机制,具有校正数据偏置之外的人因意义。在静息态形态测量任务设置下,男性组的质心尺寸指标为1503.04,高于女性组的质心尺寸指标1386.16。该结论仅在混合构音层面通过显著性检验,静息与分元音仅呈方向趋势且除/e/外均为男高,尚未验证连续语流、跨语言及自动说话人验证性能是否同步分化。原文未披露训练推理部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1052. 语种识别怕微小扰动:用自我蒸馏把对抗样本变成语言关系的训练信号
标签:#知识蒸馏 #对抗鲁棒性 #语音 #语言识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语言识别 | 主方法:#知识蒸馏
👥 作者与机构
- Spandan Dey:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语语言识别以短语音声学特征为输入,输出语种判决并为多语言后端选路,实际难点是微小人耳难辨扰动即可翻转判决并引发后端连锁失效,而短时长与语种间声学重叠进一步放大决策边界脆弱性。论文首先做白盒敏感性分析:在 VoxLingua-10 验证集上 ECAPA-TDNN 基线无攻击等错误率(Equal Error Rate, EER)为 3.794%,FGSM 在扰动步长 0.03 时恶化至 14.425%,PGD 在 0.03、10 步时恶化至 13.757%,论证 LID 的脆弱性。随后提出自防御对抗重训练分三步推进:先用对抗样本挖掘按轮次渐进混入PGD样本以控制扰动域暴露并形成增强训练集,再用上一轮同语种正确预测的平均分布构建语言级软标签矩阵做在线标签平滑,最后引入动态权重爬升、预测熵倒数加权与仅用真实样本更新矩阵,将可靠软目标送入硬软加权损失以抑制边界低置信污染。与传统对抗重训练(Adversarial Re-Training, ART)直接做样本级对齐和防御蒸馏(Defensive Distillation, DD)依赖外部教师不同,该方法做语言级、熵加权、真实样本限定的自蒸馏。在 VoxLingua-10 评测集 ECAPA-TDNN 上 SDART 在干净、FGSM、PGD 下 EER 分别为 2.801%、3.666%、3.544%,相对基线 4.098%、15.112%、9.345% 大幅恢复且优于 TRADES 与 DD。结论目前仅限白盒 FGSM 与 5 步 PGD、10 个主流语种、两类架构与两套语料,未验证自适应攻击、物理信道与开放集外推,原文未披露训练推理成本与代码权重。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1053. 注意力块减半仍可用:逐头通道剪枝如何用二阶分数留住重要维度
标签:#模型剪枝 #高效推理 #语音识别 #音频分类 #语音翻译
评分:5.7/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#模型剪枝
👥 作者与机构
- Andrea Diecidue:机构信息未能从会议 PDF 纯文本可靠映射
- Carlo Alberto Barbano:机构信息未能从会议 PDF 纯文本可靠映射
- Piero Fraternali:机构信息未能从会议 PDF 纯文本可靠映射
- Mathieu Fontaine:机构信息未能从会议 PDF 纯文本可靠映射
- Enzo Tartaglione:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频Transformer以声谱与波形为输入并输出分类标签或转写翻译文本,但其注意力块参数冗余严重,在有限硬件上部署时存储与计算负担突出。方法先按点积与投影合法性将注意力约束解耦为查询键值组与值输出组,明确可独立剪枝的通道集合;再以幅度或Fisher信息为通道打分并以贪心预算分配在给定稀疏度下选出剪枝集合;最后按全局阈值跨层统一排序或局部阈值逐层定量执行,并经迭代十轮、每轮剪枝后轻量微调恢复性能。相对整头剪枝只能整头删除,该逐头通道细粒度模式保留了重要头内的关键通道,因而在高稀疏下更灵活且无需专用硬件即可改变拓扑加速前向。在SpeechCommands分类任务评测设置下,逐头Fisher剪枝模型的准确率为97.71%,高于整头Fisher基线的准确率97.51%。在AudioSet上同等60%注意力稀疏度下前者平均精度为30.86%,与后者31.10%基本持平,显著优于全局幅度排序的25.90%。该结论适用边界受限于仅对注意力块剪枝的验证,跨头非均匀通道数与头通道双维度联合剪枝等外推尚未验证。原文以AudioSet单样本平均推理耗时随稀疏度变化报告了推理开销趋势,但原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1054. 在配对控制下听出压力:TSST 语音能区分情境并预测皮质醇与消极情绪吗
英文题目:Automatic Detection of Stress from Speech in the Trier Social Stress Test
标签:#语音生物标志物 #集成学习 #生理信号 #语音 #音频分类
评分:5.7/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#集成学习
👥 作者与机构
- Hanna Drimalla:机构信息未能从会议 PDF 纯文本可靠映射
- Wieland R. Cremer:机构信息未能从会议 PDF 纯文本可靠映射
- Christine Kraus:机构信息未能从会议 PDF 纯文本可靠映射
- Oliver T. Wolf:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为实验室诱发求职演讲语音,输出为应激与对照条件标签及皮质醇、淀粉酶和情感变化值,难点在于个体差异大且应激声学线索细微易与任务交互混淆。处理链分为 4 步:先将 9 分钟录音裁剪并用 Sortformer 做说话人分离标注 Diarization 以保留被试语音,再用 librosa、Praat 与 openSMILE 提取梅尔频率倒谱系数 Mel-Frequency Cepstral Coefficients / MFCC、基频与扩展日内瓦极简声学参数集 extended Geneva Minimalistic Acoustic Parameter Set / eGeMAPS 并拼接为被试级向量,接着在折内标准化后训练逻辑回归与树集成分类回归模型,最后用沙普利加性解释 Shapley Additive Explanations / SHAP 解释特征贡献。与既往无对照或组内设计相比,组间随机对照加生理与情感多维验证使声学差异更可解释为应激效应。在 50 名被试的 10 折嵌套交叉验证中,极端梯度提升 Extreme Gradient Boosting / XGB 以准确率 0.82 与曲线下面积 Area Under Curve / AUC 0.82 显著超过多数类基线,支持语音可区分急性社会评价应激。结论仅适用于德语大学生实验室演讲场景,未验证真实世界噪声、跨语言与长期应激的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/nokiagiant/egemaps — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1055. 盯住波兰语咝音最小对立:用带括号替代标记的识别加对齐做可核查筛查
英文题目:Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant
标签:#CTC #可解释性 #语音 #病理语音评估
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#CTC
👥 作者与机构
- Milosz Dudek:机构信息未能从会议 PDF 纯文本可靠映射
- Daria Hemmerling:机构信息未能从会议 PDF 纯文本可靠映射
- Kamil Kwarciak:机构信息未能从会议 PDF 纯文本可靠映射
- Maciej Stroinski:机构信息未能从会议 PDF 纯文本可靠映射
- Maria Pensko:机构信息未能从会议 PDF 纯文本可靠映射
- Mateusz Kowalewski:机构信息未能从会议 PDF 纯文本可靠映射
- Leonid Pavlovskyi:机构信息未能从会议 PDF 纯文本可靠映射
- Sebastian Jurczak:机构信息未能从会议 PDF 纯文本可靠映射
- Anna-Mariia Vitkovska:机构信息未能从会议 PDF 纯文本可靠映射
- Zuzanna Miodonska:机构信息未能从会议 PDF 纯文本可靠映射
- Natalia Mocko:机构信息未能从会议 PDF 纯文本可靠映射
- Michal Krecichwost:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对波兰语儿童咝音替代筛查,输入为图片命名与跟读的短词和无意义音节录音,输出为目标咝音位置的疑似错读标记与可解释类型,难点在于儿童声学变异大且通用识别器的语言模型先验会抹平最小对立错误。基于自监督语音编码器的连接主义时间分类识别器先输出含括号替代证据的产生序列,该序列进入对齐模块与提示正则序列做最小编辑对齐并抽取目标加实现加类型加位置加置信度的诊断向量。模板约束助手再据此生成照护者报告或在低置信时要求重录,从而形成识别到对齐再到反馈的方法链。与通用转写优先的语音识别不同,该设计去除了外部语言模型并将可解释性操作定义为可审计对齐与固定模板加抑制规则。在留存测试集下,完整模型的精确序列匹配指标为88.7%,高于去除后编码器基线的精确序列匹配指标84.5%。保守筛查代理在目标音节上取得精确率72.9%与召回率61.4%,假警率仅2.7%。当前结论仅适用于相同提示库存下的说话人泛化,开放词汇与失真及省略等错误尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1056. 看得见的脸没有增强爱尔兰语合成语音的情感:声音主导但视觉负责细分
标签:#心理声学实验 #言语感知 #音视频 #语音合成
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音合成 | 主方法:#心理声学实验
👥 作者与机构
- Anna Maria Giovannini:机构信息未能从会议 PDF 纯文本可靠映射
- Zihan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Ailbhe Ní Chasaide:机构信息未能从会议 PDF 纯文本可靠映射
- Christer Gobl:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为一句爱尔兰语中性合成语句与目标情感标签,输出为听者在Happy-Sad等三组对立维度上的七级量表判断,难点是高激活与低激活内部状态在单靠嗓音时映射不唯一、happy等情感长期难以合成可辨。方法链第一步基于同一说话人自然情感发音的逆滤波与LF模型参数化得到声源偏移,经语音源发生器重合成愤怒等五种嗓音刺激,其输出直接作为后续视听配对的听觉端。第二步依据面部动作编码系统在写实男性模型上构建多强度表情动画并经无声多选验证挑选含蓄版本,其输出作为视觉端以避免掩蔽嗓音。第三步将嗓音与表情按嗓音独呈、同余组合、冲突组合配对并实现唇形同步开展三项感知测试,关键差异是刻意压低视觉强度并以效价对立的冲突组合检验通道主导。在Happy-Sad测试任务下,冲突happy配sad视觉刺激的二元识别准确率为58%,低于嗓音独呈与同余happy刺激的准确率94%。结论边界限于爱尔兰语成人听者、单一男性 Kerry 口音嗓音与单一男性头像,relaxed 被 bored 刺激更强 cue 到,跨文化与跨说话人泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1057. 自动对齐何时算够用:TIMIT 元音上 token 量与声学测量稳定点的实证
标签:#统计分析 #社会语音学 #语音 #强制对齐
评分:5.7/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#强制对齐 | 主方法:#统计分析
👥 作者与机构
- Simon Gonzalez:机构信息未能从会议 PDF 纯文本可靠映射
- Jason Littlefield:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Hoang:机构信息未能从会议 PDF 纯文本可靠映射
- Chloe Dean:机构信息未能从会议 PDF 纯文本可靠映射
- Hayden Ooi:机构信息未能从会议 PDF 纯文本可靠映射
- Myung Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Bradley Donnelly:机构信息未能从会议 PDF 纯文本可靠映射
- Latchman Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Biggs:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Cawley:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理已知文本与语音时间轴对齐即强制对齐后的可靠性问题,输入为TIMIT手动边界与蒙特利尔强制对齐器自动边界下的元音切分,输出为时长与第一共振峰、第二共振峰测量是否一致,难点在于边界小误差会以非均匀方式污染频谱测量并随元音与特征而变化。方法链分三步推进,首先按token量从200起递增抽样并用Praat提取中点声学量,其次在每个增量上拟合以对齐来源为固定效应、说话人与词为随机截距的混合效应模型并取绝对差异轨迹,最后用Kendall单调检验判改善并用连续容差规则定位不再显著变化的稳定点。与以往只报起点终点或中点边界位移的做法不同,该文把充分性定义为声学模式随数据量收敛,从而直接回答何时加数据已无意义。在TIMIT元音语料下,F2的稳定所需token数指标为≈2,335 tokens,高于Duration的稳定所需token数指标≈730 tokens。结论目前仅适用于高质量受控朗读英语,向自发语音、噪声与低资源语言的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1058. 感冒不重,声纹却漂移:中等症状下的说话人嵌入稳定性检验
标签:#数据集 #数据集构建 #鲁棒性 #语音 #说话人验证
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#说话人验证 | 主方法:#数据集构建
👥 作者与机构
- Anabell Hacker:机构信息未能从会议 PDF 纯文本可靠映射
- Ingo Siegert:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为同一说话人在健康与急性上呼吸道感染状态下的配对朗读语音,输出为健康感知的稳健性判断与身份保持度量,难点在于中度症状效应十分微弱且混杂于日常设备与环境变异之中。方法链分为三步:远程采集配对语料并以Wisconsin Upper Respiratory Symptom Survey问卷标定症状严重度,接着系统详细用Geneva Minimalistic Acoustic Parameter Set声学参数集刻画音高与周期性变化,最后将文本受控的健康与患病录音送入4种说话人嵌入模型做余弦相似度验证与位移分析。与聚焦重症实验室录音的既有研究不同,该工作将生理性发声机制变化与通道失配有效分离,揭示了神经嵌入对分布式高维扰动的敏感性。在文本受控验证条件下,Titanet的等错误率为1.51%,低于ECAPA-TDNN的等错误率3.10%。结论仅适用于德语朗读、中度症状与短时配对场景,尚未验证自发对话、重症演变及跨设备泛化能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1059. 分支各补短板:按感受野交叉分配注意力的声场景分类
英文题目:Branch-wise Complementary Attention for Acoustic Scene Classification
标签:#注意力机制 #CNN #高效推理 #声学场景分类
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声学场景分类 | 主方法:#注意力机制
👥 作者与机构
- Seung-Gyu Han:机构信息未能从会议 PDF 纯文本可靠映射
- Jinwoo Jung:机构信息未能从会议 PDF 纯文本可靠映射
- Pil Moo Byun:机构信息未能从会议 PDF 纯文本可靠映射
- Won-Gook Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声学场景分类需从单通道录音判别10类城市场景,难点在于十秒与一秒等不同时长片段中时间与频谱线索尺度多变且移动端预算严格。所提分支互补注意力先将四分支卷积输出融合为全局特征并沿通道、时间、频率三轴平均池化得到描述子,再经一维卷积与Sigmoid生成通道、时间、频率权重并经外积组合成联合时频权重。随后四种权重经Softmax归一化后按感受野短板交叉分配至对应分支并加权求和,实现互补增强而非简单相加。相对通道注意力与通道时频注意力的同质化重标定,该交叉补偿机制显式利用了分支间感受野差异以扩大有效感受野。在TAU Urban Acoustic Scenes 2020评测设置下,BCA的准确率为72.03%,高于Rep-Mobile基线的准确率68.86%。该结论目前仅在两个TAU划分与Rep-Mobile骨干上验证,未证明对其他骨干、长时录音或强设备偏移的外推能力。原文披露了参数量与MACs量级而未披露训练、推理或部署成本的wall-clock测量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1060. 犹豫不是噪声:把停顿、重复留在口语纠错输入里
英文题目:Exploring Hesitation as a Signal for Spoken Grammatical Error Correction
标签:#教育 #提示学习 #语音 #口语理解
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语理解 | 主方法:#提示学习
👥 作者与机构
- Seunghoon Han:机构信息未能从会议 PDF 纯文本可靠映射
- Minyoung Kyoung:机构信息未能从会议 PDF 纯文本可靠映射
- Hyungbae Jeon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语语法纠错与反馈需以二语学习者语音为输入并输出语法修正,难点在于口语迟疑与识别误差会干扰以书面语料训练的纠错模型。作者提出迟疑感知链:先将人工迟疑标注转换为含特殊标记的标记转写以显式保留静默暂停、填充停顿与重复的位置与类型,再为每个输入词元叠加迟疑类型嵌入以传递跨度级上下文,最后以文本到文本转换器编码器解码器从标记序列生成修正文本。与直接删除迟疑的常规做法不同,该机制把迟疑当作误差高发区的局部先验而非噪声,使模型在纠错时关注迟疑上下文。在Speak & Improve Corpus 2025评测集下,所提方法的F0.5指标为0.4790,高于人工流利转写基线的F0.5指标0.4606。迟疑邻域增益更为集中,表明迟疑标记有助于定位易错区域并提升召回而非仅靠删除冗余词。该结论适用边界受限于人工转写且迟疑标注准确的受控条件,尚未验证含识别误差与自动迟疑检测的端到端外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1061. 病理模型与人耳听判为何在不同语言和性别上对不上:阿尔茨海默语音线索的分组审计
标签:#人类参与评测 #可解释性 #言语感知 #多语言 #病理语音评估
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#人类参与评测
👥 作者与机构
- Liu He:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanchao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yin-Long Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Yiming Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaxin Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhe Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiahong Yuan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为图片描述任务下的自发语音,输出分为临床阿尔茨海默病(Alzheimer’s Disease,AD)标签与16名母语为普通话的听众给出的感知评分,难点在于病理声学标志与人类听辨策略均随语言和性别漂移。方法链分四步推进:先采集普通话与希腊语各30条并做听辨实验得到感知加权分,再提取时域流畅性与韵律与发声与构音共21个全局特征,接着分别训练病理分类与感知回归的随机森林,最后用SHAP排序对比与广义线性混合效应模型(Generalized Linear Mixed-Effects Model,GLMER)验证。与既往只检验解释忠实度的工作不同,该文把病理模型与感知模型的可解释性对齐度本身作为审计指标,揭示全局对齐会掩盖亚组崩解。在图片描述语料的病理分类任务下,普通话子集的AUC为0.83,高于希腊语子集的AUC 0.60。结论仅适用于图片描述、小样本与naive听众条件,不可外推至临床医生、自然对话或其他语言。该结论的适用边界受限于小样本与特定语料条件,尚未验证向临床专家与自然对话场景的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1062. 把整数帧序号揉软:用局部声学上下文扭曲旋转位置的 CD-RoPE
标签:#CNN #鲁棒性 #语音 #语音识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#CNN
👥 作者与机构
- Euijin Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Mengchun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别的Branchformer编码器需把960小时LibriSpeech连续语音映射为文字,而刚性等距整数位置索引难以匹配语速伸缩与信息密度不均。卷积动态旋转位置编码先以核尺寸为9的深度可分离一维卷积在全维隐表示上抽取局部声学上下文,经双曲正切限幅与ReZero可学习系数生成有界时间偏移,其输出直接作为位置修正量进入下一步。接着将该偏移与整数索引相加形成连续时间坐标,再以原始逆频率为外乘子旋转查询与键,从而把输入相关的相对偏置注入注意力分支并与并行卷积门控多层感知机分支互补。该设计只扭曲时间域而保留高低频谐波比例,不同于直接调制频率或相位的做法,因而在语速扰动下能自适应重定位时间网格。在LibriSpeech test-other上相对RelPos基线词错率由5.07%降至4.95%,且总参数量减少2.2M。其结论适用边界受限于单一朗读英语语料与单一种子验证,尚未验证向Conformer等内置卷积架构、大规模自监督编码器及高变异会话语音的外推,且极端减速与加速下所有模型词错率均超50%构成失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1063. 先变多再变稳:用无监督音节发现刻画 5 到 15 岁发音发展的三条曲线
标签:#无监督学习 #语言习得 #语音学与音系 #语音 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#无监督学习
👥 作者与机构
- Koharu Horii:机构信息未能从会议 PDF 纯文本可靠映射
- Naohiro Tawara:机构信息未能从会议 PDF 纯文本可靠映射
- Atsunori Ogawa:机构信息未能从会议 PDF 纯文本可靠映射
- Shoko Araki:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童语音分析的输入为朗读语音波形,输出为发音随年龄的发育规律,难点是儿童存在大量不符合成人音素划分的中间发音而传统识别器会强制映射到标准类别。先以朗读语音波形的自监督表征为输入,用无监督音节发现Sylber从相似性突变估计音节边界并做段内平均,输出段嵌入,为跨年龄聚类提供声学单元。再以全年龄段池化的段嵌入为输入,先用k均值粗聚为16384类再用凝聚式聚类合并,输出1024个音节声学簇,使细粒度声学差异收敛为可计数的发音库存。最后以上述边界与簇为输入,分别用成人训练模型度量贴近成人程度并用儿童适配模型刻画儿童特有变异,输出时序组织、发音库存与稳定性的三维发育分析。与自上而下强制对齐相比,该机制不依赖音素监督而直接从声学规律发现单元,因而能保留被词典视为噪声的省略与模糊音节。在包含 957 名 5 岁至 15 岁儿童的 OGI Kids 朗读语料上,儿童适配模型相对成人训练模型的边界 Jaccard 指数从 0.39 提升至 0.43,同时复现了音节簇数先扩张后收缩的发育曲线。该结论依赖横断面朗读语料与基于提示文本的目标音节标签,对自发对话与障碍语音的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/cainesap/syllabify — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/Berkeley-Speech-Group/sylber — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1064. 声音不够时看脚步:用轨迹上下文补足医院压力检测
标签:#语音生物标志物 #多模态学习 #语音 #音频分类
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#多模态学习
👥 作者与机构
- Wei-Heng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Woan-Shiuan Chien:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理医院工作者日级别压力二分类,输入为全天前景语音片段与室内定位轨迹,输出为压力与否,难点在于声学线索随科室情境漂移且单日语音稀疏可变易受个体差异干扰。方法为轨迹语音嵌入(Trajectory Speech Embedding,TSE):先将24维openSMILE低层描述子按日聚合为360维统计向量并经Transformer声学编码器得到表征;再将分钟级位置序列压缩为会话序列并经预训练轨迹Transformer编码为移动表征;最后将双嵌入拼接后送入多层感知机(Multilayer Perceptron,MLP)分类器并辅以双分支辅助损失联合训练。轨迹编码器先在额外纯轨迹日上以预测下一位置为目标预训练以捕获空间转移关系,再随主框架端到端微调使声学与移动表示互补。与纯声学建模的关键差异在于引入空间行为上下文显式校正发声判断,而非仅优化声学表示。在TILES-2018数据集受试者独立划分下,Coordinate TSE相对Bi-LSTM声学基线F1提升9.32个百分点且Matthews相关系数(Matthews Correlation Coefficient,MCC)提升0.038。该结论仅限于单医院室内WiFi与Beacon定位环境,未验证跨医院与无定位条件的泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1065. 先在话语内对齐模态,再沿说话人拆分情绪动力:MF-EDM 的两阶段图建模
标签:#图神经网络 #多模态学习 #音视频 #语音情感识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#图神经网络
👥 作者与机构
- Sooyeon Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Eunseong Kwon:机构信息未能从会议 PDF 纯文本可靠映射
- Gahgene Gweon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
对话情感识别(Emotion Recognition in Conversation,ERC)以对话中每条话语的文本、声学、视觉证据为输入,逐条预测离散情感标签,难点在于模态语义鸿沟与跨说话人时序演化交织。该文提出两阶段框架多模态融合与情感动态建模(Multimodal Fusion and Emotional Dynamics Modeling,MF-EDM),先由话语内图完成跨模态聚合,再由双路径图完成对话级时序建模,最后拼接分类。第一阶段将早融合向量作为多模态锚节点与三类单模态节点同图传递并定向汇聚,第二阶段将锚节点特征分别送入同说话人惯性分支与跨说话人传染分支,以分离持续与交互信号。与既有图融合相比,差异在于锚节点在传播内部参与对齐而非传播后拼接,且情感动态按心理学机制解耦为有向持续与无向多频交互。在IEMOCAP全量测试上该方法以加权F1 74.24%超过同设置复现的最强基线GraphSmile约2.88个百分点,在MELD、K-MIND、M3ED上亦一致领先。结论边界在于依赖说话人标签构图、未来窗口隐含离线假设、传染与惯性分布不同时增益不稳定,未验证说话人缺失或噪声场景。原文未披露训练时长、参数量与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1066. 不只补数据、要补认知痕迹:用检索约束文本再对齐语音的 AD 增强
标签:#语音生物标志物 #数据增强 #检索增强 #语音 #病理语音评估
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#数据增强
👥 作者与机构
- Yu Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Cheng Gong:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Wen:机构信息未能从会议 PDF 纯文本可靠映射
- Ruihao Jing:机构信息未能从会议 PDF 纯文本可靠映射
- Tianrui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shansong Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Boyu Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuheng Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Xuanchen Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xiao Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Chunyu Qiang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiao-Lei Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Longbiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianwu Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
阿尔茨海默病Alzheimer’s Disease,AD的语音检测输入为自发描述语音与转写文本,输出为认知正常与患病二分类,难点在于公开语料稀少且隐私受限,通用增强难以复现停顿增多与词汇贫乏等病理模式,且易破坏文本与音频的临床对应关系。该框架先从真实语料估计流利度与词汇和声学等多维认知属性向量,再以双源检索增强Retrieval-Augmented Generation,RAG约束大语言模型Large Language Model,LLM生成含填充词与暂停标记的AD风格脚本,其中专家知识库提供临床边界而真实病例转写提供行为模板,最后由属性引导的语音合成Text-to-Speech,TTS将标记渲染为对应声学停顿与语速变化。与单模态扰动或无约束生成相比,关键差异是语言与声学共用同一认知蓝图从而保持模态一致,使停顿标记能被同步渲染为可控声学静音,从而提升训练样本的临床可信度。在ADReSSo测试集上CogniAlign模型经1比1增强后准确率由0.789升至0.831,F1由0.783升至0.833。结论仅在英语图片描述任务与同分布划分内成立,未验证跨语言与跨采集设备及重度失衡场景。原文未披露训练、推理或部署成本,仅提供合成样例展示页。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1067. 生成式空间音频指标为何对角度不敏感:响应度、平滑度与对称性的灵敏度检验
标签:#评测协议 #鲁棒性 #空间音频信号 #音频生成
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频生成 | 主方法:#评测协议
👥 作者与机构
- Purnima Kamath:机构信息未能从会议 PDF 纯文本可靠映射
- Adrian S. Roman:机构信息未能从会议 PDF 纯文本可靠映射
- Koichi Saito:机构信息未能从会议 PDF 纯文本可靠映射
- Yuki Mitsufuji:机构信息未能从会议 PDF 纯文本可靠映射
- Juan P. Bello:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
生成式一阶Ambisonics需要评价输出是否跟随方位角与仰角等控制参数变化,但现有分布度量与样本度量对该跟随能力的响应规律尚不清楚。本文提出沿连续空间轨迹的元评测框架:先在受控FOA场景中沿圆形轨迹合成空间参数序列并计算各待评度量到参考位置的距离曲线,再从曲线形状量化响应度、平滑度与对称性,最后在三级场景复杂度与加噪条件下比较度量优劣。与仅比较单点频谱或相位误差的已有方法不同,该框架要求距离随偏离参考位置单调增大且邻域变化平滑、正反轨迹对称,从而直接检验空间控制的粒度与稳定性。在SoundSpaces房间脉冲响应与FSD50K事件合成的68400个10秒FOA样本、每条轨迹19步的实验中,定位导向的弗雷歇音频距离变体F-PSELD与最小方差无失真响应波束成形声学图占据响应度与平滑度权衡的更优区域,而强度向量在同类镜像多源下因能量抵消而坍塌。在加噪鲁棒性评测条件下,低信噪比条件的信噪比指标为0 dB,低于高信噪比条件的信噪比指标15 dB。结论仅适用于人工合成房间脉冲响应场景与所测的少数度量,未验证真实生成模型输出与主观听感的一致性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1068. 多增强一起训为何互相拆台:以干净梯度为锚同时治方向与大小
英文题目:GradHarmony: A Gradient Alignment and Magnitude Normalization Strategy for Audio Deepfake Detection
标签:#数据增强 #正则化 #语音 #音频深度伪造检测
评分:5.7/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频深度伪造检测 | 主方法:#正则化
👥 作者与机构
- Inho Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
- Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频深度伪造检测输入原始波形或谱时特征、输出真假二分类标签,实际难点在于多增强并行时干净梯度与多个增强梯度既方向冲突又幅度失衡,简单求和会拖慢优化并偏向特定扰动。GradHarmony先以干净梯度为固定锚做干净参考梯度对齐,对内积为负的增强梯度减去其在干净方向上的冲突分量以保证对齐后内积非负,输出方向一致的增强梯度进入下一步。接着基于批次中位数与指数移动平均估计典型幅度并做暖启动,对曾冲突与未冲突梯度施加差异化裁剪阈值,仅缩放增强梯度而不改变方向与干净锚。最后将干净梯度与裁剪后增强梯度相加得到更新,相对仅做双路对齐的PCGrad与GradVac,其以原始分布为主方向并解耦方向与幅度两类失配,因而在多增强下保持稳定收敛与泛化。在ASVspoof 2019 Logical Access训练、ASVspoof 2021 DeepFake(含隐藏子集,DF21)为域内、In-the-Wild(ITW)、DSD-Corpus(DSD)与Fake-or-Real(FoR)为域外的设置下,SSL-AASIST在ITW的等错误率(Equal Error Rate,EER)由直接增强的11.60%降至7.04%,在DF21由5.36%修复至3.74%。该结论限于RawBoost、房间脉冲响应(Room Impulse Response,RIR)与MUSAN三种常规增强与5个模型的组合验证,未覆盖自适应攻击或大规模增强池。原文未披露推理与部署成本,仅以训练轮数示意收敛加速。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1069. 模型算出的声音像不像人听到的像:43 个语音基础模型的说话人相似度对齐检验
英文题目:Do speech foundation models perceive speaker similarity as humans do?
标签:#统计分析 #模型比较 #言语感知 #语音 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Minoru Kishi:机构信息未能从会议 PDF 纯文本可靠映射
- Hayato Yagi:机构信息未能从会议 PDF 纯文本可靠映射
- Shinnosuke Takamichi:机构信息未能从会议 PDF 纯文本可靠映射
- Yuki Saito:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为不同说话人的多条语音,输出为说话人对之间的连续相似度,难点在于人类感知的相似性是高层认知判断,无法被声学距离或验证准确率直接刻画。方法链分为四步:先在JVS与VCTK上收集同性别内听感评分并归一化为人类相似度图,再对43个基础模型按层抽取平均池化嵌入并以余弦相似度构建模型图,接着用相关与图结构距离度量两图对齐程度,最后以编码器与解码器等模型配置为自变量做多元回归解释差异。与已有层探测只关注辨别性能不同,该工作把几何关系本身作为感知一致性的检验对象,因而能揭示监督目标与架构对感知对齐的影响。在JVS与VCTK多数据集回归评测设置下,解码器架构条件的LCC指标为-0.77,低于多语言条件的LCC指标0.00。然而结论局限于日语与英语同性别内评分及平均池化嵌入,跨性别与跨风格外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1070. 呼气相对吸气响了多少:哮喘听诊位置、频带与年龄性别如何共同决定声学与气流受限的相关
标签:#医疗音频 #统计分析 #时频分析 #音频理解
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频理解 | 主方法:#统计分析
👥 作者与机构
- Dheeraj Harish Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Sanjana MC:机构信息未能从会议 PDF 纯文本可靠映射
- Perumal Keerthi Priya:机构信息未能从会议 PDF 纯文本可靠映射
- K V Nikhath Khanam:机构信息未能从会议 PDF 纯文本可靠映射
- Uma Maheshwari Krishnaswamy:机构信息未能从会议 PDF 纯文本可靠映射
- Prasanta Kumar Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
哮喘听诊评估输入为后背4个部位自然呼吸声与用力肺活量指标第一秒用力呼气容积与用力肺活量比值,输出为部位与频带特异的阻塞关联模式,难点在于呼吸声非平稳、年龄性别解剖差异与部位串扰交织。方法分四步:专家在Audacity中切分吸气与呼气段并按部位组织5个呼吸周期,接着对每段做短时傅里叶变换求平方幅度谱功率。然后按0-800 Hz、100-200 Hz、200-400 Hz、400-800 Hz聚合为呼气吸气功率比并取受试者中位数,最后按年龄与性别分层做Spearman秩相关。与既往不分人口学特征的全肺平均E/I研究不同,该工作强调下背部与上背部随增龄的空间再分布假说,突出了100-400 Hz气流敏感频带的部位特异意义。在年龄分层评测设置下,50–60岁组指标FEV1/FVC为86.33 ± 7.40,高于40–50岁组指标FEV1/FVC 79.37 ± 12.13。该关联的适用边界受限于后背静息呼吸与小样本高龄组,尚未验证用力呼吸与前胸部位的外推。结论仅适用于静息自然呼吸的后背听诊探索性关联,不支持跨年龄直接比较与诊断替代,50-60岁组仅18例使高龄结论脆弱。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1071. 保住小权重的语音细节:PhonePrune 如何用音素三元组做一次性剪枝
标签:#模型剪枝 #语音学与音系 #多语言 #语音 #语音识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#模型剪枝
👥 作者与机构
- Minsik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jihie Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大规模自动语音识别需将连续语音转写为文字,低能量擦音与瞬态爆破音依赖的细粒度线索在一次性剪枝中易被低幅值假设误删,尤其韩语阻塞音三重对立与日语时长对立更脆弱。PhonePrune先按互补分布与最小对立体生成含声学负例与异位负例的音素三元组校准集,再对目标音素位置做时间掩码梯度评分以分离特异性与可分性,最后以音素分数调制权重幅值并经阈值生成二值掩码实现一次性剪枝。与幅值剪枝直接丢弃小权重的机制不同,该方法以对比敏感性显式抬升音素票据的保留优先级,兼顾预训练结构知识与局部音素相关性。校准仅用128组三元组即能捕获脆弱参数,平衡系数取中值时兼顾全局幅值与音素可分性并取得最低误差。在Common Voice 15评测设置下,PhonePrune的WER为15.50%,低于Distil-Whisper的WER 17.90%。该结论限于Whisper-large在50%稀疏度与所选英韩日评测的零样本转写,英语三组均弱于蒸馏基线,跨架构与更高稀疏度的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1072. 纳卡纳曼加语元音长短是音位对立吗:用时长分布与混合模型验证五组长短配对
英文题目:Phonetic evidence for contrastive length in Nakanamanga monophthongs
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Shubo Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究检验纳卡纳曼加语五个单元音是否均存在音位性长短对立,输入为野外诱发的载体句目标词录音,输出为长短元音的时长判定,难点在于既往转写混乱、动词形态导致实际音节数漂移及多语接触干扰。方法链分三步:先以图片呈现加比斯拉马语口头提示在固定载体句中采集五次重复朗读,输出标注音频;再经Praat手动切分元音起止并建EMU语音数据库,输出时长测量;最后以线性混合效应模型分离长度、音质与词长效应并做估计边际均值事后比较。相对仅凭最小对立对的音系推断,该机制以受控声学测量加说话人与词项随机截距提供可证伪证据,适用边界尚未验证至自然语流与其他方言。在2622个目标元音语料的评测设置下,长元音的平均时长指标为177 ms,高于短元音的平均时长指标85 ms。结论限于朗读体词干首音节,未验证频谱线索、感知边界与方言及语体稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1073. 先粗降噪再对齐干净隐空间:轻量模型如何跨过真实远场分布鸿沟
标签:#数据集 #领域适应 #高效推理 #语音增强
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#领域适应
👥 作者与机构
- Biao Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyuan Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Zengqiang Shang:机构信息未能从会议 PDF 纯文本可靠映射
- Mou Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Pengyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
真实远场语音增强输入为含噪声与混响的远场单通道信号,输出为干净近场波形,难点在于真实中高频衰减与传播特性与仿真房间脉冲响应差异大,轻量单阶段网络难以直接学习跨分布映射。该方法先用冻结的预训练去噪模型对远场短时傅里叶变换特征做粗去噪去混响,再由轻量分布映射网络将粗增强信号投射到干净近场自编码器学到的紧凑隐空间,最后由ConvNeXt解码器从对齐隐变量重建波形。与直接谱映射相比,该链条把困难回归转化为结构化隐空间对齐,降低了单模型容量需求。在自采真实远场测试集评测下,本文方法的P.835 OVRL指标为2.94,高于同真实数据训练的因果TF-GridNet的P.835 OVRL指标为2.49。该结论适用边界受限于普通话AISHELL-3朗读内容、4 m、6 m、8 m三距离与DNSMOS客观评价,尚未验证跨语言、强干扰与主观可懂度外推。推理开销对应的计算量约为0.8 GMAC/s,参数量约为10.38 M,满足低功耗实时部署预算。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1074. 给说话倾向加先验:贝塔神经 FCASA 如何把远场 diarization 做成完全贝叶斯
标签:#变分自编码器 #麦克风阵列 #语音 #说话人分离标注 #语音分离
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人分离标注 | 主方法:#变分自编码器
👥 作者与机构
- Sicheng Mao:机构信息未能从会议 PDF 纯文本可靠映射
- Mathieu Fontaine:机构信息未能从会议 PDF 纯文本可靠映射
- Anthony Larcher:机构信息未能从会议 PDF 纯文本可靠映射
- Roland Badeau:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
远距离说话人分离标注输入为麦克风阵列采集的混响含噪多通道会议语音,输出为每时刻每说话人的起止标注,难点在于说话人数可变、重叠频繁与空间混响耦合。该方法沿用神经 FCASA(Fast Full-rank Spatial Covariance Analysis)的联合分离与标注框架,先以共享神经编码器从混合频谱推断潜谱特征与说话活动倾向,再以 Beta 先验约束倾向变量并经 Bernoulli 生成二值活动掩码,最后将掩码与联合对角化空间协方差结合,经多通道 Wiener 滤波得到分离信号与标注结果。相对原神经 FCASA 分离分支贝叶斯、标注分支二值交叉熵监督的关键差异,是用与 Bernoulli 共轭的 Beta 建模说话意愿的连续分布,并以期望似然加 Beta 间 KL 散度的闭式证据下界替代交叉熵。在 AMI 评测集上 Full 协议下相对复现基线 diarization error rate 降低 3.18 至 3.52 个百分点,jaccard error rate 降低 5.08 至 5.67 个百分点,重叠段改善最明显。结论仅在 AMI 会议场景与 10 秒切块评测协议内成立,对说话人数泛化、强重叠外场景与分离质量尚未验证。原文未披露训练推理耗时与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1075. 不用人打分,能从 TTS 训练过程本身学到质量排序吗:TDScore 解读
标签:#弱监督学习 #跨语言 #语音 #语音质量评估
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#弱监督学习
👥 作者与机构
- Natacha Miniconi:机构信息未能从会议 PDF 纯文本可靠映射
- Meysam Shamsi:机构信息未能从会议 PDF 纯文本可靠映射
- Anthony Larcher:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音质量评估需要无人工平均意见得分条件下预测合成语音感知排序,跨语言与跨合成范式泛化与标注成本是实际难点。该方法先从零训练多种文本到语音系统并周期保存检查点,用同一文本集合成各检查点音频以形成质量渐变序列,其输出直接作为伪标签构造的输入。接着为每条音频附训练迭代与训练损失作伪标签,并用客观质量曲线确定的最大迭代截断饱和检查点,过滤后的数据集再进入预测器训练。最后基于自监督语音表示以成对排序目标训练TDScore从音频估计迭代或损失,预测分用于与人工平均意见得分算斯皮尔曼等级相关。与依赖人工标注或通用伪造检测代理的方法不同,该机制将优化进程本身视为质量排序信号,因而可捕捉系统开发相关的质量差异。在英语BVCC外域评测下,TDScore–F5–Ite的系统级SRCC为0.73,低于TDScore–MOS的系统级SRCC 0.88。该结论适用边界受限于F5等渐进改善型训练动态,对非单调改善架构与细粒度跨时期泛化尚未验证,SOMOS上衰减即为失败条件例证。原文未披露训练推理部署成本与优化器超参数。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1076. 弱读不是删除:wav2vec 2.0 与 Whisper 如何保留辅音丛的底层塞音线索
标签:#评测协议 #公平性 #可解释性 #语音学与音系 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#评测协议
👥 作者与机构
- Hamid Mojarad:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Tang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为含词尾双辅音丛的非裔美国人英语自然语音,输出是对简化与典型发音的区分及对底层塞音身份的恢复,难点在于简化是受音节与语境制约的渐变弱化而非干净删除。先用Montreal Forced Aligner在CORAAL语料上做典型与简化双发音词典对齐以获得6760个词例,再将整句送入冻结的wav2vec2-base与Whisper-small编码器抽取12层768维帧表示,接着按对齐边界对完整丛与首辅音做均值池化得到词例向量,最后用单隐层多层感知机做留说话人交叉验证探测。与人工扰动下的音素复原研究不同,本文利用自然删除缺口检验是否保留底层信息,具有生态效度。在/mp/丛简化检测任务下,wav2vec 2.0末层的准确率为72.6%,低于第1层的准确率80.2%。两模型在简化鼻音上保留典型类别线索,说明简化被编码为结构化渐变而非完全删除。该结论限于单语素双辅音丛与 7 类高频丛,未验证三辅音丛与双语素过去时及跨方言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1077. 自动笑声标注还不够准:笑声识别误差如何传导到两种合成器的自然度与笑法还原
英文题目:Evaluating Automatic Laughter Phone Annotation for Socially-Situated Laughter Synthesis
标签:#数据集构建 #主观评测 #语音学与音系 #语音合成
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#主观评测
👥 作者与机构
- Hiroki Mori:机构信息未能从会议 PDF 纯文本可靠映射
- Hiroto Ueda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理社交情境笑声合成,输入为目标笑声的音素序列,输出为对应笑声音频,难点在于笑声呼气段与吸气段高度变异且人工标注极耗人力。方法链分为三环:先在游戏对话语料上人工标注11个说话人的笑声呼叫单元并训练基于XLSR-53 large的帧级笑声音素识别器,其输出的边界与类别序列进入下一环;再用人工与自动两套标签分别训练参数合成笑声器并用同类标签构造Fish-Speech的提示;最后以自然度与笑法相似度听测比较标签质量与架构差异。关键机制差异在于参数合成器显式依赖音素时长与声学映射,而音频大模型仅把音素序列当作弱提示并依靠预训练先验补全细节。在4个未见说话人上的听测显示Fish-Speech自然度平均分达到3.62,明显高于参数合成器人工标签条件的2.71,而笑法相似度则反转为2.58对3.94。结论仅适用于日语游戏闲聊笑声与小样本零样本提示设置,未验证笑声音素语言模型闭环、跨语种与强情感笑声的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1078. 不是比谁分高:用语音特征反解生物声学嵌入到底记住了什么
英文题目:Beyond task performance: Decoding bioacoustic embeddings with speech features
标签:#生物声学监测 #统计分析 #可解释性 #音频分类
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#统计分析
👥 作者与机构
- Ines Nolasco:机构信息未能从会议 PDF 纯文本可靠映射
- Jules Cauzinille:机构信息未能从会议 PDF 纯文本可靠映射
- Marius Miron:机构信息未能从会议 PDF 纯文本可靠映射
- Gagan Narula:机构信息未能从会议 PDF 纯文本可靠映射
- Milad Alizadeh:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Fernandez:机构信息未能从会议 PDF 纯文本可靠映射
- Matthieu Geist:机构信息未能从会议 PDF 纯文本可靠映射
- Ellen Gilsenan-McMahon:机构信息未能从会议 PDF 纯文本可靠映射
- Olivier Pietquin:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Chemla:机构信息未能从会议 PDF 纯文本可靠映射
- Sara Keen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
生物声学复用冻结预训练嵌入时,输入为野外多类群录音、输出为物种或个体标签,模型究竟保留何种可解释声学依据并不透明,选型受限于榜单分数而缺乏内容诊断。该工作先用OpenSMILE抽取88维eGeMAPS可解释特征作为声学真值,再用AVEX抽取6个冻结编码器的整段时间平均嵌入作为待探针表征,使真值与嵌入在样本级对齐,接着以线性岭回归与浅层多层感知机做嵌入到特征回归探针并以5折R2度量可恢复性,最后计算各特征对标签的归一化互信息并与可恢复性交叉对照以定位任务相关缺口。与已有基准只比分类准确率不同,该链条把评价从性能排序转为特征覆盖诊断,可直接指导按任务显著特征选型或互补拼接。在六数据集混合评估任务下,响度类特征的R2指标为0.76,高于基频类特征的R2指标0.33。结论仅适用于最后一层冻结嵌入与线性可解码视角,未验证可恢复特征是否真被下游分类器使用,也未做层间动态分析。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1079. 把标注分歧留下来:用熵感知课程学习九类语音情感分布
英文题目:Learning from Annotation Uncertainty: Entropy-Aware Curriculum for Speech Emotion Recognition
标签:#课程学习 #多任务学习 #语音 #语音情感识别
评分:5.7/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#课程学习
👥 作者与机构
- Zahra Omidi:机构信息未能从会议 PDF 纯文本可靠映射
- John Hansen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别输入为播客语音,输出为9类离散情感与效价激活支配三维连续评分,难点是多人标注存在系统性分歧而硬共识标签会抹除混合感知。该工作先由官方多人投票构造硬共识独热、主投票归一化分布、主次投票加权合并分布三类监督目标并计算归一化标注熵,再以WavLM-Base编码加时序卷积与两层门控循环单元提炼话语嵌入,随后用分类与效价激活支配回归双分支联合训练并仅在分类分支施加熵过滤或加权课程以先学低熵清晰样本再逐步引入高熵样本。与硬标签训练相比,分布监督保留跨类别不确定性而非将其挤入剩余类,从而在保持宏观指标的同时显著改善与人类投票分布的一致性。在MSP-Podcast 2.0 Test1测试集评测下,M90-Filter的Macro-F1为34.8±.5,高于Hard-CE的Macro-F1 28.7±2.1。高熵话语仍难以用硬指标评价,结论仅适用于有多标注且保留 Other 类的 9 分类体系。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1080. 不混成一路单声道:把视频拆成可编辑事件再做双耳渲染
英文题目:Listening to Motion in Space: Vision-Grounded Event-wise Video-to-Audio Generation and Rendering
标签:#多模态学习 #实时处理 #空间音频信号 #空间音频渲染 #视频到声音生成
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.4/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#视频到声音生成 | 主方法:#多模态学习
👥 作者与机构
- Hyeonwoo Park:机构信息未能从会议 PDF 纯文本可靠映射
- Dayeon Ku:机构信息未能从会议 PDF 纯文本可靠映射
- Hong Kook Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向无声视频的视频到音频生成需以无声画面为输入、以可编辑双耳音频为输出,其难点在于多声源混合叠加、事件时间同步与空间听感难以兼顾,传统单轨单声道更无法支持分轨编辑。VisionSFX先由视觉语言模型Gemma 4-VL解析视频,将其分解为带起止时间与声音描述的事件表和环境提示,并把分段视频与提示向后传递。接着事件音由预训练视频音频模型在5秒填充裁剪内独立生成并加窗截取,环境音则由视频无关文本音频模型单独生成,从而避免事件混合进入环境轨。随后光流质心经自运动校正得到方位、单目深度得到距离,再经头相关传输函数渲染为双耳分轨并混音输出,任一重提示、重定位或时间注入仅影响对应磁盘分轨。与依赖配对双耳语料的端到端双耳生成相比,该后验渲染与独立分轨机制免训练且格式可重渲染,具有编辑隔离性。在展位演示任务下,10秒片段生成的延迟指标为约1分钟,低于通用视频上传后初始化的延迟指标1至2分钟。当前结论仅适用于演示级短片与受控展示环境,对复杂遮挡、快速运镜与密集重叠事件的外推尚未验证。原文未披露训练成本,推理与交互依赖两台NVIDIA DGX Spark图形处理器并在1至2分钟内完成短片初始化。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1081. 组平均显著、个人却各走各路:嗓音品质声学关联的说话人依赖
英文题目:Acoustic correlates of voice quality settings: variation within and between individual speakers
标签:#统计分析 #发声与构音 #语音 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Alice Paver:机构信息未能从会议 PDF 纯文本可靠映射
- Kirsty McDougall:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为4名英音男性语音学人员以默认嗓音和5种非默认嗓音朗读连续语音,输出为倾斜度、噪声与长时共振峰指标能否稳定指示喉部与声道设置,难点在于习惯基线高度个体化且喉部与声道调节相互耦合。首先用Montreal Forced Aligner做音素级强制对齐并仅保留元音段,为声学测量提供干净分析单元;接着将其输出送入VoiceSauce与Praat提取CPP、谱倾斜、HNR与LTF F1至F4并按说话人与设置求均值与标准化,得到可比的长时参数;最后拟合嗓音设置、声学指标与说话人三重交互的线性混合效应回归并用估计边际均值做默认对非默认成对比较。相对以往跨说话人求平均的做法,该文把说话人作为交互因子而非噪声平均掉,从而分离组趋势与个体实现路径。在默认对照非默认嗓音的成对比较设置下,组层面设置与指标交互的指标F值为24.7,高于个体层面三重交互的指标F值3.34。结论仅适用于英音男性模仿嗓音的元音长时测量,电话信道、噪声、女性嗓音与自然习惯变异均未验证。上述结论的适用边界受限于小样本模仿数据,跨信道与自然变异外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1082. 双语发音动作能从语音自监督表示中线性读出吗:芬兰语与俄语 EMA 的跨语言探测
标签:#自监督学习 #可解释性 #发声与构音 #跨语言 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#自监督学习
👥 作者与机构
- Ailín Pollio San Pedro:机构信息未能从会议 PDF 纯文本可靠映射
- Tomi H. Kinnunen:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandre Nikolaev:机构信息未能从会议 PDF 纯文本可靠映射
- Ruchi Pandey:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为芬兰语俄语双语者原始音频,输出为5个发音器官共10通道电磁构音图横向与垂直轨迹,难点在于线圈摆位偏差大、腭化与元音和谐等类型差异显著且自发语音变异大。方法链条分三步:先对每条话语内各通道做z-score归一化并经Butterworth低通滤波降采样至50 Hz以对齐自监督学习帧率,其输出的连续波形进入编码器。接着用冻结自监督学习编码器逐层抽取1024维表示,该逐帧表示直接作为回归特征进入探针训练。再为每通道训练独立线性探针做逐帧仿射预测,最后以通道与说话人平均的Pearson相关即构音分数评估,并设留一说话人交叉验证检验泛化。与既往英语可控朗读探测相比,该工作引入同一说话人内第一语言、模仿口音与第二语言三条件对照及连环画自发叙事任务,机制意义在于检验构音编码的语言无关性。在18说话人合并层平均评估设置下,MMS-300m的Pearson为0.689,高于XLSR-53的Pearson 0.620。结论边界是中层最优、舌部优于唇部、上唇垂直方向持续最难且自发任务下降约0.1,尚未验证非线性或序列探针能否消除差距。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1083. 议会里谁更常嗯啊:四国近四千小时验证填充停顿的年龄语速与性别反转
英文题目:Umm... With Transformers? Insights from Filled Pause Use across Four Slavic Parliaments
标签:#统计分析 #社会语音学 #多语言 #语音 #音频事件检测
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频事件检测 | 主方法:#统计分析
👥 作者与机构
- Ivan Porupski:机构信息未能从会议 PDF 纯文本可靠映射
- Branimir Dropuljić:机构信息未能从会议 PDF 纯文本可靠映射
- Nikola Ljubešić:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为四种斯拉夫语言议会发言音频、官方转写与说话人元数据,输出为填充停顿发生率及其与说话人特质的关联,难点在于超大规模自发语音的可靠标注与特质效应和状态波动的混杂。方法链第一步用基于wav2vec2-bert的变换器检测器输出每条话语的填充停顿计数,其计数与音频时长一起进入第二步。第二步用XLM-R-ParlaSent预测话语级情感并计算音节语速等多维协变量,形成的话语级特征表进入第三步的统计建模。第三步用经Mundlak校正的广义估计方程负二项模型分离说话人均值与话语偏离,相对既往小样本单语研究的关键机制差异在于以总体平均效应与稳健标准误处理嵌套相关并显式区分特质与状态,其适用边界受限于正式议会域。在四国议会语料的基准条件下,波兰议会的填充停顿率指标为3.47 FPs/min,高于塞尔维亚议会的填充停顿率指标1.38 FPs/min。结论仅适用于正式议会域与克罗地亚语、塞尔维亚语、捷克语、波兰语四种议会语料,难以直接外推至日常对话或其他语系。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1084. 只量嗓音起始时间不够:澳大利亚英语塞音松气后还藏着一段气声
英文题目:An investigation of post-stop breathiness in Australian English
标签:#统计分析 #社会语音学 #语音 #语音属性识别
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Thomas Powell-Davies:机构信息未能从会议 PDF 纯文本可靠映射
- Rosey Billington:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为澳大利亚英语塔斯马尼亚词表朗读中词首清塞音/p, t, k/的释放段,输出为是否含塞后气嗓期及其时长划分,难点是传统嗓音起始时间把清擦噪声到模态元音视作整体,无法区分其中叠加周期性与摩擦的气嗓过渡。方法链分三步:先用Montreal Forced Aligner对目标词做词与音素级对齐以定位塞音释放,再在Praat中人工划分总嗓音起始时间和清送气加气嗓加模态元音的起止边界并以至少两个声门周期为气嗓门限,最后将标注导入EMU-SDMS与R的lme4做二项与线性混合效应建模以分离性别、年龄、发音部位与音节数效应。与既有嗓音起始时间研究的关键机制差异是把释放视为清送气加叠加送气式气嗓的两段结构,借用东孟加拉语研究中的After Closure Time与Superimposed Aspiration概念而非延长单一嗓音起始时间数值。在塔斯马尼亚词表朗读语料下,女性说话人含气嗓释放的比例指标为535/977(55%),高于男性说话人的比例指标120/575(21%)。结论仅适用于朗读体受控元音语境,未验证自发语、其他元音、浊塞音与跨地域变体的外推性。上述外推的适用边界尚未验证且受限于受控朗读与单一元音/æ/条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1085. 推断错了也不安全:说话人属性组合为何仍能单挑出你
标签:#评测协议 #隐私保护 #语音 #说话人匿名化 #语音属性识别
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#说话人匿名化 | 主方法:#评测协议
👥 作者与机构
- Mehtab Ur Rahman:机构信息未能从会议 PDF 纯文本可靠映射
- Martha Larson:机构信息未能从会议 PDF 纯文本可靠映射
- Cristian Tejedor-Garcia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是从原始或匿名化语音推断性别、年龄、口音、职业四元组说话人属性档案以评估隐私泄露,难点是单属性推断误差与匿名失真并不必然降低档案可单出性与可链接性。方法先用预训练ECAPA TDNN提取192维嵌入并经四个独立多层感知机分别推断四属性,输出单utterance后验。接着对同一说话人多utterance后验平均得到说话人级档案,再按k匿名计算唯一率与匿名集大小分布。最后以单utterance目标档案对多utterance参考档案做精确匹配再识别攻击,用不可调阈值的错误率度量风险。与语音隐私挑战信号到信号等错误率范式不同,本文采用类别精确匹配且无阈值可调,直接对应法规意义上的单出与等价类划分风险。在VoxCeleb2测试子集72人条件下,推断档案的唯一率指标为31.9%,低于真值档案的唯一率指标38.9%。该结论适用边界受限于小规模名人域与四属性组合,尚未验证大规模人口、细粒度属性与部分匹配及自适应匿名感知攻击者。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1086. 从全局向量到事件序列:CoSTALA 如何对齐空间音频的多事件时空组合
标签:#对比学习 #长音频处理 #空间音频信号 #音频检索
评分:5.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#对比学习
👥 作者与机构
- Peiwei Ren:机构信息未能从会议 PDF 纯文本可靠映射
- Jinbo Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Fang Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Shan Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Yin Cao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向双事件一阶 Ambisonics(First-Order Ambisonics,FOA)长序列输入,模型需同时输出事件语义、离散方向与先后顺序的联合表征,难点在于全局向量压缩导致上下文漂移与局部语义坍缩。方法链分四步推进:先用 Qwen3-8B 改写结合空间房间脉冲响应(Spatial Room Impulse Response,SRIR)合成带方向与时序连接词的正负样本对;再以语义与空间双分支编码器加可学习融合得到硬切片、软切片与全局三路音频表征;随后由带旋转位置编码(Rotary Position Embedding,RoPE)的时序编码器从软切片提取顺序依赖并残差融合为时空表示;最后用全局对比、3路时空对比、局部对齐与特征一致性四重损失分层约束。相比仅做全局对齐的对比语言音频预训练(Contrastive Language-Audio Pretraining,CLAP)类方法,关键差异在于显式区分时序反转与空间交换两类难负例并以独立硬编码锚定局部纯度。在自建9000样本评测集的双向检索中,全量模型文本到音频召回率 Recall@1 达8.10%,显著高于 SALM 的4.77%。该结论仅适用于零重叠双事件合成场景,未验证重叠声源、更多事件数与真实房间混响的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1087. 用演戏游戏收集韵律语音:更难的情感识别与藏不住的说话人信息
标签:#数据集构建 #隐私保护 #韵律 #多语言 #语音情感识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音情感识别 | 主方法:#数据集构建
👥 作者与机构
- Sia Vosh Sepanta:机构信息未能从会议 PDF 纯文本可靠映射
- Roberto Zamparelli:机构信息未能从会议 PDF 纯文本可靠映射
- Alessio Brutti:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理非职业说话人在语境提示下产出的韵律情感语音识别与属性残留问题,输入为多语言短句录音与人口统计元数据,输出为7类情感标签与情感及年龄可恢复性判断,难点在于自然度与标注一致性难以兼得。方法链第一步由Actor’s Challenge游戏负责采集,试镜者按语境录制而选角导演判别语境并按1-5分打分,前者录音进入后者形成自验证。第二步由冻结表征加轻量分类器负责基线验证,对AC与RAVDESS等语料采用同一嵌入分类管线比较可分性,其验证结论进入第三步隐私分析。第三步由语音到大语言模型管线分阶段探针负责隐私分析,依次探测Whisper编码器输出E、投影层Z与语言模型层H的残留信息。与专业演员棚录相比,该设计以语境化非典型表达换取生态效度,代价是识别难度上升。在四分类语料基准下,RAVDESS的准确率为0.92,高于AC英语子集的准确率0.73。结论仅适用于小规模英意法德众包样本,俄语与波斯语扩展及职业演员对照尚未完成。其适用边界受限于众包录音条件与小规模语言覆盖,逆向跨语料迁移存在明确失败条件。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1088. 不用切音素也能打分:用老师语音做参照的偏差建模
英文题目:ALFreeD: Teacher-Guided Few-Shot Pronunciation Assessment via Segmentation-Free Deviation Modeling
标签:#教育 #自监督学习 #少样本 #语音 #语音质量评估
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音质量评估 | 主方法:#自监督学习
👥 作者与机构
- Meenakshi Sirigiraju:机构信息未能从会议 PDF 纯文本可靠映射
- Nevin K Mathew:机构信息未能从会议 PDF 纯文本可靠映射
- Reni K Cherian:机构信息未能从会议 PDF 纯文本可靠映射
- Chiranjeevi Yarra:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动发音评估需由学习者语音预测utterance级发音质量分,难点是非母语偏离导致强制对齐边界不可靠且人工评分成本高昂,偏离常被约束到预期音素序列而失真。所提ALFreeD输入为同学文本的教师utterance与学习者utterance,输出为0到10分的utterance级总分,全程不使用典型发音词典与强制对齐边界,直接在表征空间度量偏离。流程为:用预训练HuBERT-base提取双路帧级表征,经动态时间规整建立时序对应,沿对齐路径计算余弦距离得到帧级偏差序列,再以教师间偏差训练的通用背景模型加i-vector框架提炼utterance级偏差向量以抑制非发音变异,最后仅训练两层感知机回归分数。在SpeechOcean762测试集评测下,ALFreeD用2500条标注训练的Pearson相关系数为0.74,高于HiPAMA的Pearson相关系数0.73。该结论目前仅限于中文母语者英语朗读单数据集、合成美音教师语音和单指标,未验证自发语音、跨母语和跨教师泛化。原文未披露训练推理成本与显著性检验。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1089. 语气与内容打架时还能轻量判断:互不干扰的三路情感分类
英文题目:Lightweight Emotion Recognition with Disjoint Modality Fusion
标签:#开源工具 #多模态学习 #高效推理 #语音 #语音情感识别
评分:5.7/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Serkan Sulun:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从语音声学与文本语义推断愤怒等类别,难点在于现实中语调与内容可能冲突且任一模态可能缺失。先用冻结的Distil-Whisper-large-v3音频编码器单次前向同时得到音频特征与转写文本,再经线性层与层归一化投影至32维公共空间并拼接哨兵向量标识模态有无。随后由独立自注意力分支与单向音频到文本交叉注意力分支并行提炼时序信息,最后经音频头、文本头与融合头输出三路预测以兼顾冲突与一致情形。与依赖独立自动语音识别转写加通用双编码器的常规多模态方案相比,关键差异在于复用同一模型完成识别与特征供给并以不相交分支隔离模态干扰。在Intel Core i7-5600U纯CPU条件下,Light-DMF的实时率为0.81,低于实时基线的实时率1。该结论仅验证了延迟与轻量性,未在 IEMOCAP 等数据集上验证分类性能,故无法外推至讽刺或跨域场景的准确率优势。训练在单张 NVIDIA A100 80GB 上完成但时长与优化配置未披露,推理侧依赖冻结大模型与 Colab 演示,端侧部署仍需承担骨干网络开销。推理开销受限于冻结骨干网络,在CPU硬件上仍需承担大模型前向延迟,适用边界尚未验证分类准确率外推。
🔗 开源资源
- 代码相关资源:https://sulun.org/lightdmf → https://www.sulun.org/lightdmf/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1090. 只给片段标签,也要学会逐帧定位:多实例学习做口吃分类与切分
英文题目:Stuttering Classification and Segmentation with Attention-Based Multiple Instance Learning
标签:#注意力机制 #弱监督学习 #言语障碍 #语音 #音频事件检测
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#弱监督学习
👥 作者与机构
- Petar Sušac:机构信息未能从会议 PDF 纯文本可靠映射
- Sebastian P. Bayerl:机构信息未能从会议 PDF 纯文本可靠映射
- Hrvoje Džapo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为 3 秒口吃语音片段,输出为片段级多标签分类与 20 ms 级帧级口吃分割,难点是主流数据集只有片段级弱标签而临床严重度评估需要事件持续时长。该方法用语音基础编码器抽取多层帧表示并经 HConv 接口融合,再经双向长短期记忆网络做时序平滑与投影,随后分叉为实例分支与嵌入分支。实例分支对每帧输出多标签概率并用最大池化得到片段预测,嵌入分支用多实例学习注意力加权帧嵌入得到包表示再分类,帧级推理时若片段判正则对归一化前注意力分数加 Sigmoid 阈值化。与已有最大池化多实例方法相比,关键差异是将注意力池化嵌入机制首次引入多标签口吃分类,使片段判别与关键帧定位解耦并保留可解释权重,同时通过微调编码器摆脱对合成口吃帧级预训练的依赖。在 CASA 共识测试集整段录音评测下,Whisper 注意力池化模型帧级平均 F1 达到 0.70,高出同期分割基线约 0.23 至 0.25;在 SEP-28k-E 上仅在 Block、Sound repetition、Word repetition 和 Interjection 上达最优,Prolongation 与流畅标签仍落后基线。该结论仅适用于英语播客与 FluencyBank 访谈类语音,对长时阻塞、多说话人及跨语言泛化尚未验证。原文未披露训练推理成本与代码权重。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1091. 侧方听不清:用头戴偶极麦克风阵列把侧向语音捞出来
英文题目:Head-Worn Dipole Microphone Array-based Speech Enhancement System for Single-Sided Deafness
标签:#助听器 #波束成形 #麦克风阵列 #语音增强
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音增强 | 主方法:#波束成形
👥 作者与机构
- Ken Takaki:机构信息未能从会议 PDF 纯文本可靠映射
- Kouei Yamaoka:机构信息未能从会议 PDF 纯文本可靠映射
- Yoshihiro Kawahara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单侧聋患者的核心困难是聋侧直接侧向来话听不清,而传统助听器多增强前方声源,输入为眼镜端多通道混合语音与多方向竞争噪声,输出为侧向目标语音的增强信号。本文构建眼镜式偶极子与全向混合阵列,先由4全向加4偶极子同步采集并经光纤转接进入计算机,再在假头上实测全方位传递函数以刻画头部遮挡,最后以最小方差无失真响应波束成形器进行侧向指向增强。与共位全向阵列相比,该组合利用偶极子天然侧向8字形指向弥补了小孔径阵列对侧向敏感度不足的问题,具有物理指向与阵列增益叠加的意义。在TIMIT语料四方向言语形噪声评测条件下,2偶极子加1全向波束成形的SDR为3.06 dB,高于3全向波束成形的SDR 2.28 dB。该结论仅限消声室传递函数加仿真混合的离线评估,未验证真实混响、多说话人与佩戴误差下的外推能力。因此其适用边界尚未验证真实混响与佩戴偏移下的失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1092. 同音不同形:时间归一化频谱如何暴露音段层面的发音差别
英文题目:Time-normalized spectrograms reveal segmental differences in English heterographic homophones
标签:#统计分析 #时频分析 #语音学与音系 #语音 #音频分类
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#时频分析
👥 作者与机构
- Yu-Hsiang Tseng:机构信息未能从会议 PDF 纯文本可靠映射
- Harald Baayen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
异形同音词研究输入为自然新闻播报中的单词音频片段与包含目标词的左侧文本窗口,输出为词身份在音段实现上的差异判定与形义关联解释,难点在于自然语流时长各异会掩盖细微发音差别,且语义效应易与语速、搭配和句法范畴混淆。该工作先按固定50帧反解可变跳长计算梅尔频谱图,展平为1050维后经主成分分析压缩至50维得到等长形式向量,为后续跨词例比较提供统一表征。再对每对同音词独立训练多分类线性判别分析,以相邻三帧拼接预测强制对齐音素标签,线性得分即音素对数几率,刻画各归一化时刻实现的典型程度。最后用广义加性模型在控制时长、音频来源与前后词的条件下分音段检验词身份效应,并以全词频谱对数几率与语境嵌入对数几率关联发音可分性与语义可分性。该机制依托判别式词库模型,主张形义映射直接塑造实现细节,不设共享抽象音系节点,因而能揭示语义可分度对发音典型性的连续调制作用。在Redhen 2016语料的10折交叉验证设置下,时域归一化形式向量的同音对分类准确率为79.30%,高于随机置换基线的准确率2.82%。该结论适用边界受限于高频美国电视新闻英语,尚未验证自发对话、其他口音与其他语言的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1093. 说话人嵌入太紧了反而不利生成:用多子中心保留同一人的多样性
标签:#模型融合 #主观评测 #语音 #说话人验证 #语音转换
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#模型融合
👥 作者与机构
- Ismail Rasim Ulgen:机构信息未能从会议 PDF 纯文本可靠映射
- John Hansen:机构信息未能从会议 PDF 纯文本可靠映射
- Carlos Busso:机构信息未能从会议 PDF 纯文本可靠映射
- Berrak Sisman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音转换需从参考话语抽取目标身份并保留语言内容与韵律,难点是识别导向的说话人嵌入过度压缩同说话人方差导致合成平淡。先以VoxCeleb2训练话语为输入,用多子中心角间隔Softmax训练强调通道注意力传播聚合时延神经网络,每类以多个子中心经温度缩放Softmax加权聚合计算相似度,职责是保留结构化类内分布,输出为子中心嵌入器。再以参考话语为输入,用冻结的子中心嵌入器抽取192维向量以承载音色与韵律风格,职责是提供目标身份条件,并将该向量与离散HuBERT语言单元和归一化基频离散单元拼接,输出为拼接条件特征。最后以拼接条件特征为输入,将其送入改造HiFi-GAN声码器重合成波形,与单原型附加角间隔Softmax坍缩到单点不同,多子中心允许不同话语对齐不同子中心从而兼顾可分性与表达力。在VCTK未见说话人零样本转换评测任务下,子中心ECAPA-TDNN(C=20)的词错率WER为13.93%,低于基线ECAPA-TDNN的词错率WER14.84%。强情感与自发语料上的泛化增益尚未验证。该结论目前仅在英语朗读式VCTK与该重合成架构下验证,未检验文本到语音(Text to Speech,TTS)或强情感风格外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1094. 冻住大模型、只练小适配器:用分层专家应对构音障碍严重程度差异
标签:#LoRA #混合专家模型 #低资源 #语音 #病理语音评估
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#混合专家模型
👥 作者与机构
- Jiaqi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Guanghua Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Hongjie Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Shuwen Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Sicong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
病理语音评估以波形语音为输入,输出健康对照与四级严重度分级,难点在于UA-Speech样本稀少且不同严重度间发音、韵律与可懂度畸变差异极大,统一适配易欠拟合细粒度病理变异。方法链分三步:可训练卷积前端先适配病理低层声学并送入冻结的WavLM Transformer编码器,底部共享低秩适配提取跨严重度通用声学表征并经时间注意力池化聚合成话语级向量,顶部临床监督路由器据此选择单个严重度专家适配器完成精细建模。与统一低秩适配相比,关键差异是将通用声学与严重度特异畸变解耦到不同深度并做输入条件激活,推理时仅激活单个专家,因而在不增加激活参数下增强对异质畸变的建模能力。在UA-Speech说话人独立OSPS协议的二分类检测任务下,LoRA-MoE的F1 Score为94.54%,高于全量微调的F1 Score 86.86%。结论仅在英语孤立词、单语料五折OSPS划分下验证,未验证连续语音、跨语料与跨病因外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1095. 是认出了抑郁,还是认出了说话人:重叠划分如何抬高抑郁检测分数
标签:#领域适应 #评测协议 #语音 #病理语音评估 #说话人识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#评测协议
👥 作者与机构
- Hsiang-Chen Yeh:机构信息未能从会议 PDF 纯文本可靠映射
- Luqi Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Aurosweta Mahapatra:机构信息未能从会议 PDF 纯文本可靠映射
- Shreeram Suresh Chandra:机构信息未能从会议 PDF 纯文本可靠映射
- Emily Mower Provost:机构信息未能从会议 PDF 纯文本可靠映射
- Berrak Sisman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理从访谈语音预测抑郁标签的病理语音评估任务,输入为去除访谈者后被试纯语音拼接片段,输出为健康与抑郁二分类,难点在于声纹等身份线索与抑郁声学标志在预训练表征中高度纠缠易形成捷径。方法链分为三步:先按151人对照组与38人目标组划分并构造各5117段等规模训练集A与B以固定测试集控制重叠,再用Wav2Vec 2.0自监督表征提取话语级嵌入并经线性分类器预测抑郁,最后引入以说话人为域的域对抗神经网络Domain-Adversarial Neural Network / DANN通过梯度反转抑制身份信息。与已有工作相比,该文不追求新架构,而是用固定训练量与共享测试集的受控重叠范式直接量化身份泄漏的评估偏差并检验去身份表征的实际意义。在DAIC-WOZ受控对比设置下,训练集B重叠条件下微调Wav2Vec线性探测模型的抑郁分类准确率为97.65%,高于训练集A独立条件下同一模型的抑郁分类准确率58.74%。结论仅适用于片段级分类与单库内评估,未验证跨库、跨语言或真实纵向复诊的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1096. 不看源数据时多设备声场景如何对齐:先校准偏置再按一致性加权
英文题目:Robust Multi-Source-Free Domain Adaptation via Posterior Adjustment and Label Agreement
标签:#领域适应 #模型集成 #隐私保护 #鲁棒性 #声学场景分类
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声学场景分类 | 主方法:#领域适应
👥 作者与机构
- Hoyoung Yoon:机构信息未能从会议 PDF 纯文本可靠映射
- U Kang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多源免源领域适应(Multi-Source-Free Domain Adaptation,MSFDA)需在无法访问源数据时,将多个冻结源模型适配到无标注目标设备,其难点是麦克风响应差异导致各模型类别偏置不一致且目标先验未知。所提 FASOLA(Fusing All Sources via Posterior Adjustment and Label Agreement)先估计全局目标类别先验并对每个源模型的对数几率做减源偏置加目标先验的后验校准,再以各模型与剩余模型聚合预测的一致率计算可靠性权重,最后对校准后概率做加权聚合得到目标预测。与依赖置信度或熵的信息最大化与锚点伪标签方法不同,该机制不信任尖锐度而信任跨源一致性,并先统一各源的边缘分布再加权。在 DCASE 2020 Task 1A 的留一设备协议下,FASOLA 在 6 个模拟目标设备上的平均准确率达到 54.43%,高于最强基线 DECISION 的 51.88%。其结论目前仅适用于类别集合封闭且可批量估计目标统计量的离线适配,作者自述未来需扩展到消除全局统计量依赖的完全在线流式设置。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1097. 日常噪声里嗓音如何被推着走:发声过强亚型的伦巴德效应为何要看音质
标签:#统计分析 #发声与构音 #环境声 #语音 #病理语音评估
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Ahmed Yousef:机构信息未能从会议 PDF 纯文本可靠映射
- Trishul Chowdhury:机构信息未能从会议 PDF 纯文本可靠映射
- Gregory Ciccarelli:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas F. Quatieri:机构信息未能从会议 PDF 纯文本可靠映射
- Robert Hillman:机构信息未能从会议 PDF 纯文本可靠映射
- Daryush Mehta:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为日常生活颈表加速度计语音与肩戴麦克风环境噪声,输出为不同嗓音亚型随噪声变化的发声调整规律,难点在于实验室结论难以推广到动态真实交流且患者可能存在适应不良。方法分三步:双设备同步采集多日信号并按朗读段对齐时间,接着在3分钟窗口内提取声压级与基频等嗓音统计量与等效噪声级均值波动特征,然后按组训练线性与多项式及梯度提升回归并用偏依赖斜率刻画趋势,前步窗口化特征直接进入后步分组建模。与既往仅看声压级与基频的线性分箱做法不同,本文引入嗓音质量维度与噪声波动维度并采用非线性回归揭示亚型特异斜率,具有补充声带负荷评估的临床意义。在按说话人分组预测的留出测试设置下,CPP的测试集r²指标为0.32,高于SPL的测试集r²指标0.18。其中PVH组声压级斜率更陡而CPP斜率大于非创伤组,提示亚型特异的噪声驱动负荷,其跨设备校准误差相关的适用边界受限仍需讨论。该结论仅适用于以女性为主的门诊样本与粗粒度噪声表征,跨个体泛化与因果干预效果尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1098. 把诊室里的发声效率搬到日常生活中:用颈表振动估压力、用麦克风测声压
标签:#信号处理 #生理信号 #语音 #病理语音评估
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#信号处理
👥 作者与机构
- Ahmed Yousef:机构信息未能从会议 PDF 纯文本可靠映射
- Emma Willis:机构信息未能从会议 PDF 纯文本可靠映射
- Vahni Tagirisa:机构信息未能从会议 PDF 纯文本可靠映射
- Robert Hillman:机构信息未能从会议 PDF 纯文本可靠映射
- Daryush Mehta:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为日常生活连续嗓音信号,输出为生态声门效率,难点在于实验室简化任务与受控声学环境无法反映真实交流发声行为,且声门下压无法在日常无创直接测量。方法分三步:先在实验室用/p/元音序列同步采集麦克风声压级、口内压与颈表加速度,建立个体加速度均方根到声门下压的线性校准,其校准系数直接用于日常映射。再用无线颈带在日常监测中同步计算声压级与加速度幅值并经嗓音活动检测保留浊音言语帧,最后将加速度幅值映射为声门下压并换算至dB后求比值得到连续生态声门效率。与既往仅在实验室快照测量声门效率不同,该机制把效率估计延伸为带发声时间占比的纵向行为量。在日常监测场景下,患者组的EVE标准差指标为0.44,低于对照组的EVE标准差指标1.02。结论仅适用于成年女性声带小结小样本,男性、其他嗓音疾病与治疗前后变化均未验证,且传感器移位与头位衣物噪声可能影响日常估计。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1099. 抑郁线索稀疏而不均匀:用跨模态门控重新分配帧权重
标签:#语音生物标志物 #注意力机制 #多模态学习 #语音 #病理语音评估
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#注意力机制
👥 作者与机构
- Hangbin Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Yudong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Rongfeng Su:机构信息未能从会议 PDF 纯文本可靠映射
- Nan Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Lan Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理基于语音的抑郁检测,输入为受试者音频及其自动语音识别(Automatic Speech Recognition,ASR)转写文本,输出为严重程度等级,难点在于抑郁相关模式在时间上稀疏分布而均匀池化会淹没关键片段。方法链分为三步:首先冻结的HuBERT第12层抽取帧级声学表示、指令感知的Qwen-Embedding-0.6B抽取词元级文本表示,其次自适应跨模态门控(Adaptive Cross-Modal Gating,ACMG)用对侧模态掩码平均池化得到的全局上下文为本侧每帧生成门控权重并逐元相乘精炼,最后模态专属Transformer编码器建模时序后拼接送入多层感知机(Multilayer Perceptron,MLP)分类。与平均池化与单模态门控相比,该机制以跨模态全局语义指导局部帧选择,实现低能量停顿与负面情感表达的互相印证。在PDCD2025官方五折交叉验证上跨模态门控平均准确率达81.25%,较同结构无门控基线提升1.47个百分点;在DAIC-WOZ官方开发集上F1达69.39%。该结论仅在中文电话咨询三分类与英文临床访谈二分类上验证,对噪声环境与重度外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1100. 只用两个声学特征就能考高分:ADReSS 系列测试集的乐观偏差从何而来
英文题目:Rethinking Acoustic Variability Of ADReSS and ADReSSo Datasets For Dementia Detection
标签:#语音生物标志物 #评测协议 #鲁棒性 #语音 #病理语音评估
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#评测协议
👥 作者与机构
- Muhammad Abdullah Zafar:机构信息未能从会议 PDF 纯文本可靠映射
- Mostafa Shahin:机构信息未能从会议 PDF 纯文本可靠映射
- Beena Ahmed:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究面向基于自发语音的痴呆检测,输入为 Cookie Theft 看图描述录音,输出为健康对照与阿尔茨海默痴呆的二分类,难点在于小样本下通道与病理线索高度纠缠而固定划分易放大利好偏差。方法链由三环构成:先用 openSMILE 提取扩展日内瓦极简参数集与计算副语言学挑战集低级声学描述符并做单特征筛选,其输出进入两特征逻辑回归探针以测试最小特征集的分离能力,再分别施加固定测试集评估、训练标签随机置换与 Monte Carlo 重采样以检验稳定性。与以往追求更高精度的建模工作不同,该文把极简可解释分类器当作诊断工具,用负对照与分布扰动揭示高分是否依赖偶然对齐。在 ADReSS 测试集上两特征达到 macro-F1 0.875,接近文献最优的 0.895,而重采样均值回落至 0.622,表明单划分成绩不可外推。该结论仅适用于所考察的低级声学特征与线性探针组合,未验证大模型或语言学特征是否同样脆弱。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1101. 声门闭合不是硬裁剪:用软接触与软分离重写几何声带振动
英文题目:Improved modeling of vocal fold contacting and de-contacting in a geometric vocal fold model
标签:#信号处理 #主观评测 #发声与构音 #语音合成
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#信号处理
👥 作者与机构
- Tianyi Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zihao Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Birkholz:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该文解决构音语音合成中声源自然度不足问题,输入为基频轮廓、跨声门压与发声前静息位形参数,输出为下、上声门时变面积\(A\_1&\#40;t&\#41;\)和\(A\_2&\#40;t&\#41;\)以驱动声道分支管声传播与气流分离仿真,难点在于部分接触期的碰撞减速与黏附渐开无法用中矢面硬削波余弦表达。方法链第一步由静态位移设定楔形预开口,其输出的剩余缝宽决定接触阈值与归一化接触量,第二步由动态驻波位移提供准周期振动并经相位延迟与截断积分求面积。第三步在接触起始相位\(\\gamma\_1\)与解接触结束相位\(\\gamma\_2\)附近用与余弦相切的自然指数函数\(f\_1&\#40;\\alpha&\#41;\)、\(f\_2&\#40;\\alpha&\#41;\)取代瞬时削波,实现软接触与软解接触,第四步以形状参数\(s\)非对称延长接触段来控制声门面积波形左右偏斜。与旧模型直接削波加对称偏斜 warp 的机制差异在于,新机制保留了大开口时趋近纯余弦的连续过渡,因而更符合生物力学渐进开闭并改善模态到清音过渡的实际意义。在27名听音人、9句德语拷贝合成句、81种发声前参数组合上的配对评测中,新模型(NEW)A/B偏好率为58.1%,平均意见分(mean opinion score,MOS)为3.02,优于旧模型(OLD)的41.9%和2.68。该结论仅适用于VocalTractLab 2.4男声JD2与模态发声网格,未验证女声、病理嗓音、自发语音与外部声码器外推性。原文未披露训练与推理成本,本质为无训练的解析物理模块。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1102. 把语气听进去再回话:PRISM 用四智能体拆开感知、推理与合成
英文题目:PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue
标签:#模型融合 #检索增强 #韵律 #语音情感识别 #语音对话系统
评分:5.7/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音对话系统 | 主方法:#模型融合
👥 作者与机构
- Wen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaocui Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhuoyue Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Shi Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Daling Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yifei Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
共情口语对话以用户语音为输入,需同时输出语义得体且韵律对齐的语音回复,难点在于级联转写会丢弃情感韵律线索而端到端模型缺乏可解释情感控制与灵活知识更新。PRISM以四智能体流水线组织推理:感知器先用Whisper转写并用emotion2vec与VAD提取情绪标签、置信度及停顿等副语言状态,形成结构化韵律表示。管理者接着将数值韵律映射为可读自然语言描述以供大模型推理,并负责对话流控与后验校验,其输出连同上下文需求进入响应者。响应者按需调用COMET-BART等常识工具生成带目标情感强度的文本,再交由发声器经两阶段规则映射与自适应精调计算合成韵律参数并由StyleTTS2合成表达性语音。相比已有级联与端到端方案,关键差异在于用可读韵律描述替代隐式声学特征并把知识调用内化为统一生成决策,从而支持免重训更换知识源与可控语音生成。在AvaMERG音频子集上PRISM超过Qwen2.5-Omni-7B等8个基线,ROUGE-L达到0.1872且人类评测在共情与韵律恰当性占优。该结论仅在单数据集英文共情对话及短轮次设置下验证,未检验跨语言、强噪声与长程情绪演化下的外推能力。原文未披露训练、推理或部署成本与延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1103. 从能读到能听:日语语音大模型为何要重学说话方式
英文题目:Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
标签:#基准测试 #偏好优化 #SFT #语音 #语音对话系统
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音对话系统 | 主方法:#偏好优化
👥 作者与机构
- Mengjie Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Lianbo Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Fujita:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Roman Koshkin:机构信息未能从会议 PDF 纯文本可靠映射
- Yui Sudo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为日语语音指令,输出为可直接送入语音合成的文本,要求保留事实与意图的同时做到简洁口语化与可发声化,难点在于日语敬体谓语、终助词与复句结构使书面长文本合成后冗长机械且不合社交礼貌。方法先冻结语音编码器与大语言模型仅训练投影层以对齐语音文本表示,其输出的语音理解表示进入下一步偏好数据构造。接着用强模型改写与多轮采样构造口语优选与书面劣选对并合成波形验听,再以直接偏好优化联合监督微调拉大两者相对似然并用口语系统提示协同约束。与仅做提示或仅做文本指令微调不同,该机制显式对比口语与书面风格并以散度约束保持指令跟随,因而在保持知识的同时改变注意力与归一化带来的文体分布。在SpokenElyza基准下,KQ-LN调参模型的LLM-as-Judge得分为3.44,高于TopLayers调参模型的LLM-as-Judge得分3.38。结论仅在日语短指令问答与级联式语音对话(Speech Dialogue)场景得到验证,未检验长对话、多说话人与真实用户听感外推。该结论的适用边界受限于日语短指令场景,跨语言与真实听感外推尚未验证。原文披露预训练使用32张H100与偏好训练使用8张H100,但未披露具体训练时长与推理时延成本。从硬件看偏好训练的训练成本为使用8张H100,预训练硬件为32张H100。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1104. 不用蒸馏也能解耦:CycleCodec 用换说话人再换回来约束内容流
英文题目:CycleCodec: Distillation-Free Factorized Neural Speech Codec via Cycle-Consistent Speaker Swapping
标签:#自监督学习 #向量量化 #语音编码 #语音转换
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#自监督学习
👥 作者与机构
- Rui-Chen Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Sanders:机构信息未能从会议 PDF 纯文本可靠映射
- Jinzuomu Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Ai:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
- Korin Richmond:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
因子分解语音编码需把语音拆为帧级时变内容流与话语级说话人表示,难点是在无外部教师监督时两流互相泄漏且交换说话人后内容容易漂移。其方法链分三步:先以单码本小码本压缩时变流容量并迫使说话人信息流向全局嵌入,输出容量受限的内容量化序列。再用基于查询的聚合器从长时非均匀上下文提炼更具判别性和稳定性的全局向量,为解码提供稳定的说话人条件。最后经交换合成、重分析与换回重构验证内容在说话人注入下保持稳定,以编解码器自身的分析合成闭环替代跨模型蒸馏,这构成与依赖ASR或SSL教师方法的关键机制差异。在LibriTTS测试集零样本语音转换评测下,CycleCodec的WER为11.668,低于TiCodec的WER15.156。该结论目前仅在英语训练与英汉越评测下验证,对真正无标准评测工具的低资源语言及强韵律解耦尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1105. 不用反向传播做语音切分与分类:稀疏装配动力学如何同时管何时与是什么
英文题目:Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
标签:#RNN #语音 #音频分类 #音频事件检测
评分:5.6/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#RNN
👥 作者与机构
- Trevor Adelson:机构信息未能从会议 PDF 纯文本可靠映射
- Vidhyasaharan Sethu:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
连续语音需要同时回答何时切分与切成何类,而集合演算长期停留在离散符号序列,缺乏连续语音接口与多时间尺度组织。该文提出三步装配语音链:先将梅尔谱帧经概率采样转为二进制脉冲以保留细粒度时变,其输出同时送入两条装配通路。接着冻结权重的双层 refractory层级以k-cap稀疏竞争产生装配重构信号,用帧间变化量峰值指示电话与词边界,实现无监督切分。然后每类独立循环区仅见本类连续段并以Hebbian可塑性学习谱时轨迹,测试时同一输入并行送入所有类区并以共振得分最高者作为类别,两路共享竞争机制但可塑性与读出分离。其与深度学习的本质差异是以局部Hebbian可塑性与赢者通吃替代反向传播,以动力学轨迹本身作为表示而非静态映射。在TIMIT边界检测任务下,层级Level 2的F1为0.61,高于L1-direct基线的F1 0.42,同期39类电话分类准确率为47.5%。该结论仅在小规模受控语料、真值切分或容忍窗评测下成立,未验证噪声、长时对话与开放词表外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1106. 一边按场景换写法,一边按场景换判分:对称双专家如何协调音频描述的生成与奖励
英文题目:Context-Adaptive Automated Audio Captioning with Symmetric Dual-MoE and Dynamic Reward Routing
标签:#LoRA #混合专家模型 #强化学习 #音频字幕生成
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频字幕生成 | 主方法:#混合专家模型
👥 作者与机构
- Seyun Ahn:机构信息未能从会议 PDF 纯文本可靠映射
- Joon-Hyuk Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动音频字幕生成(Automated Audio Captioning, AAC)需将时变声事件映射为连贯自然语言,难点是细粒度音频文本对齐与跨场景描述策略差异。该框架先用预训练卷积音频编码器抽取声学特征,再送入带混合专家模型(Mixture-of-Experts, MoE)的生成器解码器(Bidirectional and Auto-Regressive Transformers, BART)解码,由已融合音频文本的解码器隐状态做跨注意力路由,稀疏激活低秩适配(Low-Rank Adaptation, LoRA)专家。同步地多维奖励模型分解语义相关性、语法正确性、词汇多样性与音频文本融合变换器(Audio-Text Fusion Transformer, ATFT)对齐分,并由全局音频表示驱动的奖励路由加权聚合。组相对策略优化(Group Relative Policy Optimization, GRPO)在同音频候选组内做标准化优势归一化,实现无价值网络的上下文相对更新。与静态奖励强化学习相比,关键差异是策略与奖励两侧同时引入上下文路由。在Clotho v2.1上该方法CIDEr达0.4137,超越监督与CIDEr优化基线,在主观对齐与自然度上占优;在AudioCaps上语义指标占优但CIDEr略低于直接优化CIDEr的基线。结论限于10秒至30秒英文众包字幕,未验证长音频、噪声与跨语言外推,人工评测仅20条音频且评价者构成前后矛盾。原文未披露优化器、学习率、采样组大小与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1107. 不出声也能画像:联邦语音模型权重差如何泄露口音与年龄
标签:#联邦学习 #隐私保护 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#联邦学习
👥 作者与机构
- Hamdan Al-Ali:机构信息未能从会议 PDF 纯文本可靠映射
- Ali Reza Ghavamipour:机构信息未能从会议 PDF 纯文本可靠映射
- Tommaso Caselli:机构信息未能从会议 PDF 纯文本可靠映射
- Fatih Turkmen:机构信息未能从会议 PDF 纯文本可靠映射
- Zeerak Talat:机构信息未能从会议 PDF 纯文本可靠映射
- Hanan Aldarmaki:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究联邦学习下自动语音识别模型的个人属性泄漏,输入为全局模型与目标说话人单样本微调后模型的权重差分,输出为性别与年龄与口音及情感与构音障碍的属性推断,难点在于攻击者无法接触目标语音而只能利用细微权重更新信号。该方法链分三步衔接:第一步在公开语音上为每个标注样本复刻单语句微调以构造带标签的影子模型权重库,第二步对每个参数张量抽取均值与标准差与最值并拼接为定长向量,其输出的压缩向量直接作为第三步输入。第三步按类别计算质心并用归一化欧氏距离对目标向量做最近质心分类,从而将权重空间位移转化为属性标签。与以往需目标语音前向探测或成员推断的方法不同,该机制完全不使用音频探测而只比较权重功能位移,因而在更弱更现实的威胁模型下仍能验证画像风险。在语音口音档案库口音二分类中Wav2Vec2达到100%准确率,而性别任务在三种模型上仅为46%至64%,表明覆盖缺失属性更易泄漏。结论边界在于小样本受控朗读与单语句微调条件,连续年龄与开放口音及自然情感的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1108. 双语者向真人与语音助手靠拢吗:元音时长与嗓音起始时间的影子实验证据
英文题目:Bilingual Speaker Phonetic Alignment to Voice Assistants
标签:#人类参与评测 #多语言 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#人类参与评测
👥 作者与机构
- Alyssa Allen:机构信息未能从会议 PDF 纯文本可靠映射
- Kathryn Campbell-Kibler:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为墨西哥西班牙语主导的西英双语者基线朗读与人类/语音助手刺激语音,输出为是否发生语音趋同的判断,难点在于自动语音识别偏向标准美音而在线录音噪声大且英西语音起始时间基线差异明显。方法链分三步:先以西班牙语与英语双语块采集基线朗读再分人类与机器条件采集跟读样本,其跟读样本进入蒙特利尔强制对齐器与AutoVOT自动切分元音时长与嗓音起始时间并经人工校对,其校对后声学参数再进入线性组合与距离差检验判断跟读是否被刺激预测且更接近刺激。与仅做单语或单特征的人机趋同工作不同,该文在被试内同时比较双语与人机维度并引入性别、方言区与可懂度评价作调节,具有检验类人趋同社会敏感性的实际意义。在词汇跟读任务条件下,嗓音起始时间刺激主效应的指标t值为2.05,高于刺激、条件与语言三阶交互的指标t值-1.34。结论限于50名墨西哥成年女性声刺激、在线录音与单词跟读情境,外推到对话、男性合成声或实验室音质尚未验证。原文未披露训练、推理或部署成本,声明未使用生成式AI参与构思与写作。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1109. 把构音无力从混合嗓音里剥出来:用健康 EMA 学一维运动轴 Za 再算 AWI
英文题目:Toward an Articulatory Weakness Index for Speech Kinematics in Parkinson’s Disease
标签:#语音生物标志物 #统计分析 #发声与构音 #语音 #病理语音评估
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Shrishail Baligar:机构信息未能从会议 PDF 纯文本可靠映射
- Ahmed Yousef:机构信息未能从会议 PDF 纯文本可靠映射
- Daryush Mehta:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为连续语音声学波形,输出为标量构音弱化指数,难点在于声学指标混叠呼吸、喉与构音贡献而无法直接度量声道运动受限。方法链分为四环:先用固定音频到电磁发音图反演模型由音频预测6线圈轨迹,再在250 ms滑窗内提取位移幅度与速度及颌舌协调共29维运动学特征,接着经健康USC-TIMIT数据学习的标准化加主成分分析得到一维构音状态时间序列\(Za&\#40;t&\#41;\),最后经线性校准并在语音段取均值等泛函形成指数。相对通用嗓音质量主成分的机制差异在于主成分基完全由真实运动学位移与速度方差定义且方向被固定为运动越小越慢则值越高。与年龄性别匹配对照相比,帕金森组帧级\(Za\)均值约2.5而对照约-1.5且9对全部同向升高,在21例帕金森队列中\(AWI\)与UPDRS Part III的Spearman相关为0.53。该指数仅在英语朗读语料和单一反演架构下验证,对自发语音与其他构音障碍及跨库通道差异的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1110. 语码转换听起来不一样:自发西英双语韵律偏离单语的证据与边界
英文题目:The Sound of Code-Switching: Prosodic Profiles of Spontaneous Spanish-English Speech
标签:#统计分析 #韵律 #多语言 #语音 #语言识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语言识别 | 主方法:#统计分析
👥 作者与机构
- Debasmita Bhattacharya:机构信息未能从会议 PDF 纯文本可靠映射
- Michela Marchini:机构信息未能从会议 PDF 纯文本可靠映射
- Julia Hirschberg:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为迈阿密自发西英对话的话语级音频、词级语言标识与说话人人口学元数据,输出为语码转换话语相对英语单语与西班牙语单语在音高、能量与时长上的差异画像及其受熟练度与多语属性调节的解释,难点在于自然对话中说话人、话题、话语长度与语言含量高度混杂。首先提取语言无关韵律特征并做分布检验定位差异层级,其次用无监督聚类检验差异的可分性,最后把预训练语言识别模型当探针检验韵律与熟练度的关联。与既往聚焦朗读、少数说话人、单音素或特定句法位置的感知或产出研究不同,该工作采用宏观话语级通用特征加模型诊断路径,直接刻画自然语码转换整体听感,定性上呈现更高、更轻、更断续且方差更大的模式。在Bangor Miami语料的二元韵律语言识别任务下,微调加分类头模型的准确率为0.92,高于预训练基线的准确率0.64。进一步发现熟练度主要塑造单语而非语码转换韵律,语码转换更接近说话人高熟练语言的单语韵律,而转换方向影响不显著、插入与交替策略及语码丰富度调节差异幅度。该结论的适用边界限于该西英自发对话语料,尚未验证向其他语言对、方言转换及对齐与交互场景的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1111. 匿名后还能评分吗:轻量变声对交际特征的保留与识别补偿
英文题目:Privacy vs. Performance: Assessing Communication Utility of Anonymized Voice Features
标签:#信号处理 #隐私保护 #韵律 #说话人匿名化 #语音识别
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#说话人匿名化 | 主方法:#信号处理
👥 作者与机构
- Amanda Chan:机构信息未能从会议 PDF 纯文本可靠映射
- Chee Wee Leong:机构信息未能从会议 PDF 纯文本可靠映射
- Candy Olivia Mawalim:机构信息未能从会议 PDF 纯文本可靠映射
- Shogo Okada:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为美国在线求职访谈式自发独白语音,输出为转写文本、低层韵律流利度特征与自信等高层沟通构念分数,难点是匿名变换同时扰动声学线索与自动语音识别时间戳。方法链为四级串行管线:先用相位声码器时间尺度变换在前端改写音高与时域包络并永久丢弃原音频,再经内部Kaldi模型或微软Azure发音评估模型得到词与音素级时间戳,最后由声学统计与BERT多任务模型抽取特征并预测构念。与侧重均衡错误率与词错误率的既有匿名化研究不同,本文直接度量填充词与停顿等评价特征的跨条件一致性。在1.5小时AMI会议语音保留集评测下,微调后Azure模型匿名语音的WER为7.89%,高于原始语音的WER 7.72%。在1000条真实面试语音语料任务下,定制模型使重复词、犹豫标记、填充词比率与说话速率的原始与匿名皮尔逊相关系数达到0.97以上。结论限于PV-TSM、英语自发面试与所选Azure管线,未验证其他匿名算法、跨语言与强噪声外推。原文未披露训练与部署成本,仅提及单条2分钟语音匿名延迟约0.4秒。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1112. 组合才显形:指令语音中多维社会线索如何绑定成性别偏置
英文题目:The Binding Effect: Analysis of How Multi-Dimensional Cues Form Gender Bias in Instruction TTS
标签:#评测协议 #公平性 #语音 #文本到语音
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#评测协议
👥 作者与机构
- Kuan-Yu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yi-Cheng Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Po-Chung Hsieh:机构信息未能从会议 PDF 纯文本可靠映射
- Huang-Cheng Chou:机构信息未能从会议 PDF 纯文本可靠映射
- Chih-Fan Hsu:机构信息未能从会议 PDF 纯文本可靠映射
- Jeng-Lin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jian-Jiun Ding:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
指令文本到语音以自由文本风格指令与中性内容文本为输入合成波形,难点是社会地位、职业与人格多线索交织时声学性别会偏离单线索先验而单变量审计无法捕捉。该工作先以孤立描述词为输入做单变量敏感性扫描,职责是多次采样估计女性化概率以建立先验基线,输出为极化描述词集合与基线分布。再以上一步筛选的极化词为输入构造双维与三维组合指令,职责是经文本实现函数将抽象语义元组映射为自然语言提示以隔离特定冲突轴,输出为组合提示及其合成波形。最后以前一步组合提示的对数几率输出为输入计算偏离可加基线的交互项,职责是判定绑定效应与主导覆盖并经置换检验区分显著性与强度,输出为组合审计结论。与单变量基线相比,该机制差异在于把组合偏差显式分解为独立效应与非线性交互,从而区分线性叠加与否决式覆盖,具有组合审计意义。在PromptTTS++单变量与组合评测设置下,组合指令的女性化概率指标P(x)为0.17,低于单线索nurse基线的女性化概率指标P(x)为0.99。该结论适用边界受限于外显二元性别分类,跨语言指令与非二元感知的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1113. 对人还是对 AI 说话:粤语对话中时长与声调的细粒度调整
英文题目:Modulation of Phonetic Realizations in Cantonese Dialogue with Human and AI Interlocutors
标签:#统计分析 #语音学与音系 #社会语音学 #语音 #语音交互
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音交互 | 主方法:#统计分析
👥 作者与机构
- Xinyi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Grace Wenling Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Yusheng Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Manson Chun Man Wong:机构信息未能从会议 PDF 纯文本可靠映射
- Miko Hoi Tung Ng:机构信息未能从会议 PDF 纯文本可靠映射
- Tan Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Peggy Pik Ki Mok:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为17名香港粤语母语者在脚本化人机对话中面对人类与AI对话者的产出语音,输出为时长、声调基音频率轨迹与元音共振峰三角面积的身份与情感效应判定,难点在于剥离音色语速混淆并在声调语言中捕捉细粒度调节。方法链由四步构成:先以向导式巫师范式采集20组中性转负面六轮对话,再用蒙特利尔强制对齐器初切加母语者人工校对切分话语与目标词,然后经ProsodyPro提取话语语速、目标词时长与归一化基音频率及中点共振峰,最后以线性混合效应模型与广义加性混合模型检验身份与情感效应。与既有英语德语研究直接调用现成助手音色不同,本工作以同一女声约3000句录音训练时长感知DurIAN合成AI音并复用原视频姿态,从而将身份效应归因于交互认知而非声学跟随。在中性对话语料条件下,AI条件的声调1的基音频率时间指标从2.55的时间指标升至7.73的时间指标,显著区别于人类条件的时间指标,且目标词时长指标效应为-10.891毫秒。结论仅适用于脚本化短对话中的粤语六声与三个边角元音,快速中性负面切换与小元音词例数限制了情感外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1114. 先对齐再分离:以文本为锚把讽刺的言外冲突拆出来
英文题目:T-ORR: Text-Anchored Orthogonal Residual Rectification for Robust Multimodal Sarcasm Detection
标签:#对比学习 #多模态学习 #音视频 #语音 #音视频理解
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频理解 | 主方法:#多模态学习
👥 作者与机构
- Qi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Junyi Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jiabin Han:机构信息未能从会议 PDF 纯文本可靠映射
- Hongjiao Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态讽刺检测的输入为对齐的文本、音频与视频话语,输出为讽刺与否的二分类,难点在于稀疏短暂的非言语反讽线索易被联合空间融合抹平,且语速拉长、微停顿与表情超前存在非线性错位。该文提出以文本为锚的正交残差矫正框架,先以动态局部约束对齐为每个词预测高斯时间中心以聚合音频与视频,再经结构保持几何分解将映射特征投影到文本子空间得到共振与正交失谐残差,最后由对比失谐路由构建字面状态与失谐状态并以其距离向量分类。与共享空间混合的已有方法不同,该机制显式保留冲突而不做平均,从而避免字面语义主导判决。在说话人无关协议的MUStARD基准下,T-ORR的F1为76.8%,高于Simple-Concat基线的F1 70.8%,在MUStARD++上F1为72.4%。其适用边界受限于存在可观测跨模态失配的话语,失败条件是依赖外部世界知识或声韵表情完全真诚中立的讽刺仍会因失谐残差接近零而被判为字面,跨语种与长对话外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1115. 微型扬声器低频易过冲:用频响增益约束训练固定滤波器
英文题目:Active Noise Control With a Gain Constraint for Micro-Loudspeakers
标签:#正则化 #单通道 #主动降噪
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#主动降噪 | 主方法:#正则化
👥 作者与机构
- Zhenhua Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Yin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Liming Shi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道前馈主动降噪以参考信号为输入、抵消声为输出,难点是在智能手机等便携设备中微型扬声器低频重放效率低而维纳最优解却在低频给出过高增益,易引发机械过冲与非线性失真。该工作先以均方误差最小化为目标由维纳-霍夫方程求无约束最优固定滤波器,再对低频段施加频响无穷范数增益约束得到ANC-LF-FRC,最后在目标降噪带非约束频段增加向无约束维纳解靠近的L2正则项得到ANC-FRC,并用CVX求解凸问题。与级联高通滤波相比,该机制不引入额外群延迟而保留电子延迟预算,与纯低频约束相比则用全带成形抑制截断振荡。在消声室48 kHz实测评测条件下,ANC-FRC在500-1000 Hz频段的NR level指标为13.9615,高于High-pass method的NR level指标6.0539。该结论仅在单仿真头、0.75 m正前方声源、白噪声与实录列车噪声及400 Hz分界设置下验证,未验证大声压下振膜位移和谐波失真是否真正受控。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1116. 双人协作对话中时间压力可听见,脑力负荷却藏在轮替不均里
英文题目:Predicting Cognitive Load from Speech and Interaction Dynamics in Dyadic Conversations
标签:#评测协议 #RNN #统计分析 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#RNN
👥 作者与机构
- Tahiya Chowdhury:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该文输入为双人协作对话中每人分通道语音,输出为NASA任务负荷指数六维感知负荷的连续分数,难点在于自然对话中负荷标注粗糙且与任务类型和说话风格强耦合。方法先将任务级音频切分为连续窗口并用语音活动检测屏蔽静音,再分别提取静态声学、时序差分和基于说话时序的交互特征形成双人配对序列。随后由共享门控循环单元编码加均值池化拼接双人表征,最后经全连接层以双头回归同时预测双方分数并平均得到对偶均值。与既往离散分类和随机切分不同,该工作坚持连续回归与跨对偶泛化,直接检验交互结构能否带来可迁移信号。在留一对偶交叉验证设置下,时间需求对偶均值的CCC指标为0.42,高于时间需求个体水平的CCC指标0.32。该结论仅适用于任务结构固定的远程协作对话,未验证跨任务、跨语言与细粒度时序追踪能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1117. 用可控的喊声拉开下颌:ArtComp 如何记录瑞典元音的自然扰动与补偿
标签:#数据集 #数据集构建 #发声与构音 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#数据集构建
👥 作者与机构
- Elísabet Eir Cortes:机构信息未能从会议 PDF 纯文本可靠映射
- Lisa Gustavsson:机构信息未能从会议 PDF 纯文本可靠映射
- Ellen Marklund:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为中央标准瑞典语18个元音在`i"b b`双唇塞音语境中从极弱到喊叫的朗读发音过程,输出为时间对齐的电磁发音仪关节点轨迹、声门图波形、唇部双视角视频与高质量音频的声学分析结果,难点在于可控地制造超出日常会话范围的下颌开度扰动并观测其余发音器官的自适应代偿。方法链分为三步:先用阻尼输出加视觉辅助装置诱发连续可变的发声努力以自然撑大下颌开度,其输出进入多模态同步采集环节完成关节点、声学与生理信号配准,最后经咬合板坐标归一化与三法融合的共振峰估计进入声学标注。相比咬合块、机械负载与Lombard噪声等已有扰动手段,该范式同时覆盖过弱与过强两端且避免口内异物与听觉不适,具有更高的自然度与动态范围。在以环境噪声诱发Lombard语音为对照的发声努力对比任务下,DOVA条件的相对强度范围指标高于环境噪声对照的相对强度范围指标,研究以10 dB步进设置四或五个衰减等级以覆盖从极弱到喊叫的连续区间。该结论目前仅适用于受控朗读元音的下颌开度代偿分析,尚不能外推至辅音、连续会话或病理人群。其适用边界受限于7名发音人的3000个元音语料中仅1100个被完整分析的受控朗读条件,尚未验证连续会话与病理人群的外推。原文未披露训练、推理或部署成本,本工作无模型训练。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1118. 小塞音库如何保持清音短延迟:三种法属波利尼西亚语言的 VOT 与浊音证据
英文题目:Oral stop realisation in three French Polynesian languages
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Janet Fletcher:机构信息未能从会议 PDF 纯文本可靠映射
- Adele Gregory:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为塔希提语、马克萨斯语南北变体和鲁鲁图语的朗读清塞音,输出为嗓音起始时间、词中闭塞时长与浊音占比的跨语言规律,难点在于发音人稀少且既有描写多为印象式而互相矛盾。方法链分三步推进:先以朗读录音与词表为输入,用适配法属波利尼西亚音位的WebMaus强制对齐并经Praat逐token核对波形语图,输出词、音段与嗓音起始时间边界,再以上步边界为输入,经emuR转为emu-sdms数据库并标注主重音、词位与后接元音,输出可检索的层级标注库,最后以该标注库的闭塞与嗓音起始时间区间为输入,用线性混合效应模型检验音位、后接元音、词位与重音效应,输出效应估计与事后比较。与既有印象式描写相比,关键机制差异在于将元音协同发音与韵律位置分离建模,证明后接元音而非语言或重音主导变异,具有澄清描写矛盾的实际意义。在塔希提语句框朗读语料下,/t/的平均VOT指标为22.57 ms,高于/p/的平均VOT指标16.98 ms。其适用边界受限于实验室窄焦点朗读的双音节或三音节词,尚未验证自发话语中的词汇重音、词首lengthening与弱化变体。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1119. 听人语音上训练的语音 AI 为何在聋人语音前失效:可用、可验证与优雅降级的立场解读
英文题目:Bridging the Speech AI Accessibility Gap for Deaf and Hard of Hearing People
标签:#用户研究 #公平性 #语音识别 #文本到语音 #语音转换
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#用户研究
👥 作者与机构
- Abraham Glasser:机构信息未能从会议 PDF 纯文本可靠映射
- Christian Vogler:机构信息未能从会议 PDF 纯文本可靠映射
- Raja Kushalnagar:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为带聋人口音的英语发声与手语口译转述语音,输出为可用字幕文本、可发声的个性化语音与实时重发声,难点在于听人数据训练的语音人工智能对非典型韵律发声系统性失效且聋人无法靠听觉校验。作者提出先以亲历与文献归纳语音到文本、文本到语音、语音到语音三类场景分工,再以可用性、可验证性、优雅降级为功能约束筛选方案,继而以公平、问责、透明、伦理审查身份冒用与数据剥削风险,最后落到非听觉校验与保留个人音色的定制约束。与已有无障碍研究相比,关键差异是将可验证性从听觉确认转为视觉与转写回检,并要求低置信时拒识而非幻觉补全。原文未提供可核对的关键定量结果。结论限于英语聋人口音与混合会议等定性场景,未验证跨语言重口音与实时重发声外推。原文未披露训练推理部署成本,明确声明未使用生成式人工智能。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1120. 词错了意思还在吗:多语言语音识别中语言维度如何联合决定语义保留
英文题目:How Linguistic Dimension Interactions Shape Meaning Preservation in Multilingual ASR
标签:#统计分析 #模型评估 #多语言 #语音识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#统计分析
👥 作者与机构
- Simon Gonzalez:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Hoang:机构信息未能从会议 PDF 纯文本可靠映射
- Bradley Donnelly:机构信息未能从会议 PDF 纯文本可靠映射
- Jason Littlefield:机构信息未能从会议 PDF 纯文本可靠映射
- Myung Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Chloe Dean:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Biggs:机构信息未能从会议 PDF 纯文本可靠映射
- Hayden Ooi:机构信息未能从会议 PDF 纯文本可靠映射
- Latchman Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Cawley:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言自动语音识别的替换错误会同时损伤发音、形态、句法和词义,传统词错率把所有错误等同处理,无法解释为何字面错误多但句意仍可保留。本文以FLEURS参考句与Whisper和Seamless输出句为输入,以句级语义相似度为输出,难点在于分离各语言维度的独立贡献与联合效应。方法链分三步推进,首先对齐参考与假设并仅保留替换对以排除增删干扰,其次用语音转写、词性与依存标注、词向量与句向量分别计算四个维度的相似度,最后以语言和系统为随机截距的Beta混合效应回归检验主效应、两两交互以及按系统的三阶调节。与依赖世界语言结构图谱语言级代理特征的已有工作相比,本文机制差异在于全部特征都从本次识别输出中逐词测量。在FLEURS语料基准下,MOR:SYN交互的指标为0.24,高于PHN:SYN交互的指标-0.22。结论仅适用于所选替换错误、所用解析与嵌入工具链及两个被测系统,无法外推到增删错误或未覆盖语系。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1121. 按语系组织数据能否让自监督语音模型更好地泛化到低资源语言
标签:#自监督学习 #低资源 #多语言 #语音 #语言识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语言识别 | 主方法:#自监督学习
👥 作者与机构
- Elizabeth Granda:机构信息未能从会议 PDF 纯文本可靠映射
- Edson A. Luna:机构信息未能从会议 PDF 纯文本可靠映射
- Andres F. Gonzalez:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源语音技术需要在无标注条件下将在高资源语言学到的声学表示迁移到未见语言,难点在于随机多语言混合缺乏可迁移的语音结构且原始语料高度不均衡。本文以无监督野外人物语音为来源,先利用挑战赛提供的语音活动检测(Voice Activity Detection,VAD)与基于 Whisper Large v3 的语种识别结果剔除低语音占比与无语言标签文件,再按语系组织结构化训练集,随后对 WavLM-Large 做延续预训练并作为嵌入提取器提交挑战赛评测。与随机混合的关键差异在于用谱系先验约束训练分布,使对比学习更可能遇到系内共享音系规律的困难负样本,而非偶然的通道或噪声差异。在UPS挑战赛下游任务评测下,语系感知配置的得分为0.50,高于随机混合配置的得分0.04。两者预训练验证损失分别收敛至3.86和3.93,说明数据组织而非优化充分度主导迁移效果。作者同时承认两者均低于原始 WavLM-Large 基线,讨论部分另有一处相反表述。该结论仅适用于约60小时延续预训练与特定未见语划分,尚未验证更大规模、更多模型与地理接触因素下的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/datasets/MLCommons/peoples — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1122. 不问老人、只学专家:用在策略奖励学习缓解慢速偏执的长辈语音合成
标签:#强化学习 #主观评测 #低资源 #语音 #文本到语音
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#强化学习
👥 作者与机构
- Dongrui Han:机构信息未能从会议 PDF 纯文本可靠映射
- Weidong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jiawen Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Mingyu Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Helen Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Xixin Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向老年人的语音合成需将文本转为慢速、高可懂且偏好对齐的粤语语音,难点在于老年人易疲劳而难以大规模采集偏好,且奖励函数欠约束易引发奖励黑客。该方法先以医护人员录制的老年面向与新闻播报配对样本训练专家奖励与发音奖励并以加权调和平均融合成复合奖励,再用组相对策略优化微调CosyVoice 2-Yue策略,随后以两阶段在策略奖励学习迭代加入策略rollout并重训奖励模型以动态收紧约束。与固定奖励的组相对策略优化相比,关键差异在于奖励模型随策略分布演化而更新而非冻结,从而抑制一味拉长停顿的投机解。在内部测试集与8名老年人平均意见分评测下,GRPO w/ OPRL Stage 2的MOS为3.78±0.16,高于GRPO w/o OPRL的MOS 2.70±0.23。结论仅在粤语、单基座模型与小规模老年听测范围内成立,未验证跨语言、跨基座与长期真实部署偏好的外推性。上述适用边界受限于单语言小样本条件,跨场景长期效果尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://dongru1.github.io/demo/im-efss/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1123. 谁更可信谁多说话:用阈值边距做免训练的逐试次分数门控
英文题目:Soft-Gating Score-Level Fusion for Spoofing-Aware Speaker Verification
标签:#模型集成 #语音 #说话人验证 #语音伪造检测
评分:5.6/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#模型集成
👥 作者与机构
- Seongkyu Han:机构信息未能从会议 PDF 纯文本可靠映射
- Yowon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
- Thien An Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
防欺骗说话人验证(Spoofing-Aware Speaker Verification,SASV)需在一次判决中同时拒绝零努力冒充试次和合成伪造试次,难点是自动说话人验证(Automatic Speaker Verification,ASV)与反欺骗对策(Countermeasure,CM)目标冲突且分数尺度漂移。所提方法先将ASV余弦相似度经线性映射归一到
\[0,1\],将CM真伪Logits经Softmax转为真实语音后验概率,再在开发集上估计各自等错误率(Equal Error Rate,EER)阈值并计算分数与阈值之差作为置信度边距,最后按CM门控(CM Gating)、ASV门控(ASV Gating)与双门控(Double Gating)三种解析式逐试次加权求和得到融合分。与固定求和与固定加权融合相比,该机制让置信高的子系统主导判决,无需额外训练即可即插即用。在ASVspoof 2019 LA评测下,CM门控融合的a-DCF为0.0178,低于简单求和基线1的a-DCF 0.1738。在四组ASV-CM组合与两个基准语料上的对比显示双门控在多数配置下最优,且无需训练的动态加权可超越需训练的深度神经网络后端嵌入融合基线。其失败条件是CM的EER阈值接近0或1时边距失真会导致ASV区分力或CM拒伪能力被压制,故适用边界受限于阈值居中且需按阈值位置选择门控类型,极端阈值下的稳定融合尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1124. 低资源纠错是真学会还是背过答案:西弗里斯兰语的污染可控检验
标签:#生成模型 #大语言模型 #少样本 #低资源 #语音识别
评分:5.6/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#生成模型
👥 作者与机构
- Yun Hao:机构信息未能从会议 PDF 纯文本可靠映射
- Reihaneh Amooie:机构信息未能从会议 PDF 纯文本可靠映射
- Wietse de Vries:机构信息未能从会议 PDF 纯文本可靠映射
- Rik van Noord:机构信息未能从会议 PDF 纯文本可靠映射
- Martijn Wieling:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为西弗里斯语语音,输出为文字转写,难点是可用转写语音仅约5.5小时训练量且大语言模型(Large Language Model,LLM)对该仅约40万人使用的语言覆盖不足,基线识别错误率高。方法链分三步:先用Common Voice弗里斯语微调后的跨语言语音表示模型(Cross-lingual Speech Representation,XLS-R)经束宽50的束搜索产生5最佳假设,再将假设连同零样本或少样本提示送入LLM,最后由LLM直接生成而非选择转写。与重排序或三元语言模型(Trigram Language Model)重打分不同,生成式纠错(Generative Error Correction,GER)可跳出解码空间并利用LLM语言知识修正列表外词形,还以选择式基线对比验证生成自由度的实际意义。在Common Voice弗里斯语测试集上,GPT-5.1生成式3样本将词错误率(Word Error Rate,WER)从13.5%降至8.9%,超越5最佳预言上限9.6%。在非公开离线集上从21.1%降至13.9%,同样超越预言上限18.0%,表明增益并非单纯污染记忆。结论限于弗里斯语、单一XLS-R 1B基座与少量模型,未验证其他语言与噪声域外推性。原文未披露推理成本、延迟与部署约束。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1125. 情感一变口音就跑偏:说话人相似度高分为何藏不住口音幻觉
英文题目:Accent-Emotion Entanglement in LM-Based Text-to-Speech Systems
标签:#主观评测 #模型评估 #零样本 #语音 #文本到语音
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#主观评测
👥 作者与机构
- Matthew Hayden:机构信息未能从会议 PDF 纯文本可靠映射
- Jinzuomu Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Korin Richmond:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成(zero-shot text-to-speech, ZS-TTS)需仅凭短参考音频复刻说话人音色与口音,而常用说话人相似度指标(speaker similarity metric, SSM)常掩盖口音替换等关键错误。本文以 CosyVoice 2 与 MaskGCT 为案例,研究情绪指令与情绪参考音频诱发口音漂移的口音情绪纠缠(accent-emotion entanglement)现象。方法链分三步:先以 MEAD 数据集演员语音为参考批量合成多情绪多文本样本,再用口音识别系统 GenAID 提取嵌入并计算分布熵与质心距离以筛选异常目标句,最后以内容与情绪匹配的真值对做口音相似度平均意见分(similarity mean opinion score, SMOS)听测验证。与仅报告 WavLM 与 ERes2Net 说话人相似度的已有评估不同,该流程将主观口音判断与嵌入空间可视化结合,直接暴露口音维度失效。在MEAD语料021文本Happy情绪评测条件下,CosyVoice 2的口音SMOS分数为1.17±0.49,低于MaskGCT的口音SMOS分数3.79±1.2,波动揭示了情绪对口音的系统性干扰。结论仅适用于美式口音单参考说话人主测与3种情绪,未验证跨语言与大规模多说话人外推。原文未披露训练、推理或部署成本,训练数据不可见故无法确定纠缠根因。
🔗 开源资源
- 演示资源:https://accemoentangle.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1126. 神经转码盖不住旧痕迹:从 RVQ 离散序列中追溯传统编码器来源
英文题目:Tracing the Origins: Legacy Codec Identification in Neural Audio Transcoding
标签:#Transformer #向量量化 #语音 #音频分类
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#Transformer
👥 作者与机构
- Wonje Heo:机构信息未能从会议 PDF 纯文本可靠映射
- Shinee Youn:机构信息未能从会议 PDF 纯文本可靠映射
- Yooshin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Chuck Chae:机构信息未能从会议 PDF 纯文本可靠映射
- Donghoon Shin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
传统音频取证依赖线性解码波形中的频谱截断与量化噪声,而残差向量量化(Residual Vector Quantization,RVQ)的非线性离散转码会将新伪影叠加在旧痕迹之上,导致来源判定失效。本文输入为经传统编码器压缩后再经神经音频编码器(Neural Audio Codec,NAC)转码的RVQ离散索引序列,输出为原始传统编码器类别及码率类别。方法链分为三步:层因果变换先用二维卷积提取时间与码本平面的局部相关,再以因果掩码建模低层对高层的依赖;动态聚合估计全局与时变层权重并沿层轴加权求和为时间特征;时序上下文变换对聚合序列建模长程瞬态处理差异并池化分类。与直接在波形或比特流上统计建模的传统方法不同,该框架直接在嵌入后码本空间解耦叠加伪影。在VCTK构建的转码集上固定码率编码器识别准确率超过97%,18类联合识别准确率达到89.34%。结论在高码率趋于透明的MP3与Opus上仍混淆明显,且尚未验证跨神经编码器与跨语种外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1127. 固定发音任务里仍有语言偏移:用健康人均值平移来救跨语言帕金森构音障碍检测
标签:#语音生物标志物 #领域适应 #跨语言 #语音 #病理语音评估
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#领域适应
👥 作者与机构
- Abner Hernandez:机构信息未能从会议 PDF 纯文本可靠映射
- Eunjung Yeo:机构信息未能从会议 PDF 纯文本可靠映射
- Kwanghee Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Chin-Jou Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengjun Yue:机构信息未能从会议 PDF 纯文本可靠映射
- Rohan Kumar Das:机构信息未能从会议 PDF 纯文本可靠映射
- Jan Rusz:机构信息未能从会议 PDF 纯文本可靠映射
- Mathew Magimai Doss:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Rafael Orozco-Arroyave:机构信息未能从会议 PDF 纯文本可靠映射
- Tomás Arias-Vergara:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Maier:机构信息未能从会议 PDF 纯文本可靠映射
- Elmar Nöth:机构信息未能从会议 PDF 纯文本可靠映射
- David R. Mortensen:机构信息未能从会议 PDF 纯文本可靠映射
- David Harwath:机构信息未能从会议 PDF 纯文本可靠映射
- Paula Andrea Pérez-Toro:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
帕金森病构音障碍检测需从口部轮替运动(Oral Diadochokinesis,DDK)录音区分帕金森病(Parkinson’s Disease,PD)与健康对照(Healthy Control,HC),难点是自监督语音模型(Self-Supervised Speech Model,S3M)表征同时编码语言节律与音系实现,造成跨语言评估时病理被语言差异淹没。该文先将冻结S3M帧级输出经分块平均逐级聚合为说话人向量,再在每折内仅用HC估计源语言与目标语言质心并做减源加目标平移,最后将对齐后向量送入逻辑回归(Logistic Regression,LR)分类器并以嵌套交叉验证选定高灵敏度阈值。与需重训骨干或依赖目标域病理标签的相关对齐和对抗适应不同,该语言平移(Language Shift,LS)为无参数表征运算且不更新语音模型。在以西班牙语为目标的跨语言评测中,HuBERT灵敏度由0.29提升至0.83,F1达到0.74,扭转了高特异低灵敏偏置。语言探针精度平移后由96%降至近随机水平,佐证语言身份被削弱。该结论限于受控/pa-ta-ka/任务与三语小规模临床数据,分布距离更大的德语增益收窄,向自然语料外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1128. 先计划再确认:流式多模态 Q-Former 如何在线生成机器人动作
英文题目:Plan and Double-Check: Streaming Multimodal Q-Former for Online Robot Action Generation
标签:#多模态学习 #流式处理 #音视频 #音视频理解
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音视频理解 | 主方法:#多模态学习
👥 作者与机构
- Chiori Hori:机构信息未能从会议 PDF 纯文本可靠映射
- Ryosuke Korekata:机构信息未能从会议 PDF 纯文本可靠映射
- Motonari Kambara:机构信息未能从会议 PDF 纯文本可靠映射
- Yoshiki Masuyama:机构信息未能从会议 PDF 纯文本可靠映射
- Siddarth Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Radu Corcodel:机构信息未能从会议 PDF 纯文本可靠映射
- Diego Romeres:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Le Roux:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理未切分烹饪演示视频的在线理解问题,输入为连续到达的视频与音频流,输出为单臂机器人可执行的微步动作序列与面向人确认的自然语言描述,难点在于无显式切分时仍需低延迟决定何时说话。本文方法先按 1 秒切块抽取多模态特征并交织,再由流式查询变换器 Querying Transformer(Q-Former)融合左上下文生成查询嵌入,最后由冻结大语言模型 Large Language Model(LLM)逐块自回归生成或输出结束符以等待下一块。与离线 AVBLIP 相比,关键差异是用块因果交叉与自注意力掩码实现并行训练,并用采样或损失阈值选择提前生成时刻而无需重训 LLM 解码器。在 YouCook2 验证集上,损失选择流式模型动作序列 BLEU-2 为 0.328,相对离线基线下降不足 10%,平均提前约 2.92 秒触发。该结论仅适用于烹饪演示域与文本相似度指标,未验证真实机器人执行成功率与对话纠错效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1129. 黄獴叫声太难标:先用音节特征分幼体叫声,再用高召回检测帮标注员圈野外录音
标签:#信号处理 #生物声学 #音频分类 #音频事件检测
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#信号处理
👥 作者与机构
- Sevada Hovsepyan:机构信息未能从会议 PDF 纯文本可靠映射
- Imen Ben Mahmoud:机构信息未能从会议 PDF 纯文本可靠映射
- Vanessa Rüegg:机构信息未能从会议 PDF 纯文本可靠映射
- Marta Manser:机构信息未能从会议 PDF 纯文本可靠映射
- Mathew Magimai Doss:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
黄獴(Yellow Mongoose,YM)野外录音混杂噪声与异种叫声,输入为连续长音频与孤立叫声片段,输出要求检出疑似发声段并划分 9 类幼崽叫声类型,难点在于类别极不平衡与未定义类归属不明。方法链分三步推进:先将叫声降采样并做短时傅里叶变换(Short-Time Fourier Transform,STFT)压缩为 16 帧乘 24 通道的谱时模板,再用随机森林(Random Forest,RF)完成分类并以置换重要性回溯判别频时区,最后用鲁棒语音活动检测(robust Voice Activity Detection,rVAD)与 WhisperSeg 在野外录音上做检出加时域合并后处理。与直接端到端卷积神经网络(Convolutional Neural Network,CNN)相比,关键差异在于显式音节尺度谱时参数化先验,而非从波形学习全部表示。在940条幼崽叫声语料的5折分层交叉验证评测下,手工特征加随机森林的准确率为0.684 ± 0.016,高于卷积网络的准确率0.61 ± 0.029。该结论仅适用于小样本高不平衡的黄獴幼崽数据与 29 段野外录音的辅助标注场景,未验证跨群体跨物种与成体主导场景的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1130. 词身份可分不等于学到词:减去音素后还剩多少词信息
标签:#统计分析 #可解释性 #语音学与音系 #语音 #音频分类
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#统计分析
👥 作者与机构
- Robin Huo:机构信息未能从会议 PDF 纯文本可靠映射
- Ewan Dunbar:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自监督语音模型(self-supervised speech model, S3M)词探针的高准确率可被音素形式解释:词身份(signified)与语音形式(signifier)在声学上纠缠,仅凭词分类无法证明模型编码了形式之外的词信息。任务输入为连续语音帧表征,输出为词身份标签,实际难点在于词身份与局部音素序列高度共变,词探针高准确率可能仅反映音素编码而非词层面信息。作者以 LibriSpeech dev-clean 为评测语料,对 HuBERT base 与 wav2vec 2.0 base 的卷积尾层和 12 个 Transformer 层的帧表征先做零均值单位方差标准化,再用岭回归以独热音素、左右双音素和三音素标签预测每帧向量并相减得到残差,最后在残差上用帧级线性 softmax 探针预测词身份,并以音素探针校验是否真正线性去除了音素。相对池化后全局余弦相似度比较近音词与同义词的做法,该方法可定位子空间并避免无关维度淹没效应;拟合时排除恰好等于或包含完整词的 n 元组样本以防误删词均值。去除三音素后3至6音素长度词在HuBERT第9层附近与wav2vec 2.0第7至8层附近仍保持明显词可解码性,表明中层编码了独立于局部音素的词信息。在LibriSpeech dev-clean语料的无监督词发现任务下,去音素残差的NED指标为.463,低于原始表征的NED指标.508。结论限于英语朗读语音的帧级线性可解码性,未证明句法语义编码,未验证无对齐标签时的实用外推,原文未披露训练与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1131. 听不懂时靠什么断句和找重音:德语与匈牙利语听者感知乌尔都语的对比
标签:#人类参与评测 #韵律 #言语感知 #跨语言 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#人类参与评测
👥 作者与机构
- Farhat Jabeen:机构信息未能从会议 PDF 纯文本可靠映射
- Ákos Buza:机构信息未能从会议 PDF 纯文本可靠映射
- Ella Reimann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为陌生语言乌尔都语朗读及其去标点拉丁转写,输出为德语与匈牙利语听者感知的突显词与语调短语边界,难点在于剥离词汇句法后声学线索仍被母语韵律系统过滤。先以四段约十八秒乌尔都语录音与去标点文本为输入,由两组听者反复听音熟悉后履行快速韵律转写职责标注边界与突显,输出为逐词感知标记。再以该感知标记为输入,履行一致性检验与建模职责计算组内组间Fleiss Kappa并以广义线性回归检验听者母语与发音人交互,输出为一致性系数与交互显著性,其决定的发音人差异对象直接进入声学分析。最后以被感知为突显词的语音片段为输入,在语音分析软件中手工切分词界并提取时间归一化基频,履行加性混合模型拟合职责,输出为轮廓差异与多重交互解释以回溯感知差异来源。与主张边界线索通用的既有结论不同,本文引入德匈类型学对照并同步检验突显与边界,揭示语言特异性过滤的实际意义在于纠正以高一致为通用性的分析谬误。原文未提供可核对的关键定量结果。结论适用边界仅限无乌尔都语经验的德匈听者对短篇朗读体的感知,尚未验证产出、其他语体或法语韩语等短语重音语言的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1132. 拟合快不等于贡献大:多模态情感分析中优化平衡方法的幻觉
标签:#多模态学习 #模型比较 #音视频 #语音情感识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Ioanna Kaffeza:机构信息未能从会议 PDF 纯文本可靠映射
- Efthymios Georgiou:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandros Potamianos:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态情感分析输入为文本、音频与视觉三路固定特征,输出为语句级情感类别,难点在于文本快速拟合主导联合训练并压制其余模态。本文先在固定长短期记忆网络(Long Short-Term Memory,LSTM)后期融合下统一复评即时梯度调制(On-the-fly Gradient Modulation,OGM)及其泛化增强变体(Generalization Enhancement,GE)与 ACC 变体、自适应梯度调制(Adaptive Gradient Modulation,AGM)、原型模态重平衡(Prototypical Modal Rebalance,PMR)与交替重构增强(ReconBoost),再用独立开发集校准比率估计检验稳定性,接着以合成互补任务与冻结编码器权重搜索诊断拟合与贡献错位,最后提出基于 held-out 判别式模态价值评估的研究议程。与已有工作在训练期用损失与梯度调制恢复平衡不同,本文主张编码器优化与融合权重优化必须分离,前者用训练数据,后者用 held-out 判别性能。在CMU-MOSI的Audio-Video设置下,Late Concatenation的准确率为54.93%,高于ReconBoost的准确率47.29%。该结论适用于文本主导且互补性与样本级变异显著的情感分析场景,在强交叉模态架构或非情感任务中尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1133. 量表会漂,客观测量更稳:早期帕金森语音与视频生物标志物的安慰剂抗扰性检验
标签:#语音生物标志物 #统计分析 #音视频 #病理语音评估
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Hardik Kothare:机构信息未能从会议 PDF 纯文本可靠映射
- Oliver Roesler:机构信息未能从会议 PDF 纯文本可靠映射
- Lakshmi Arbatti:机构信息未能从会议 PDF 纯文本可靠映射
- Michael Neumann:机构信息未能从会议 PDF 纯文本可靠映射
- Karl Kieburtz:机构信息未能从会议 PDF 纯文本可靠映射
- Andrew McGarry:机构信息未能从会议 PDF 纯文本可靠映射
- Craig Thompson:机构信息未能从会议 PDF 纯文本可靠映射
- Vikram Ramanarayanan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为早期未治疗帕金森病患者的远程视听交互数据与临床运动检查量表,输出是同一构念下客观指标能否替代主观评分并抵抗安慰剂效应与霍桑效应,难点在于早期症状轻微且量表易受期望与观察行为干扰。虚拟向导先采集朗读与敲击等多任务音视频并经云端分割提取声学与运动特征,其输出的特征矩阵进入基线关联筛选。基线关联筛选再用斯皮尔曼相关保留与量表单题同构的客观指标,筛选后的配对指标进入线性混合效应追踪与变异系数比较以检验组均变化与个体内稳定性。与既往离线判别研究不同,该工作把真实药物无效试验作为噪声放大器,直接对比量表改善与客观指标不变以揭示期望效应的实际意义。在ASCEND试验纵向随访评测设置下,客观宽幅敲击次数的变异系数指标为0.260,低于MDS-UPDRS左手敲击题的变异系数指标0.682。该适用边界受限于早期轻症队列与12周无效药物背景,尚未验证中晚期或有效干预下的敏感性。结论仅适用于早期轻症且 12 周无疾病进展的场景,无法外推至中晚期或有效药物干预下的敏感性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1134. 从注意力里找证据:用低熵头锁定语音识别依据的 LEAF-X
英文题目:Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models
标签:#注意力机制 #可解释性 #语音 #语音识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#注意力机制
👥 作者与机构
- Ravi Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Utkarsh Grover:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaomin Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Agoritsa Polyzou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
Transformer自动语音识别需为每个解码词元输出在声学特征帧序列上的归一化重要性分布,但扰动类解释不稳定且与内部计算脱节,原始注意力又常被高熵发散头污染而难以词级接地。LEAF-X先对解码器音频到文本交叉注意力计算头香农熵并经温度变换转为置信权重,在层内加权平均得到去噪层注意力,抑制对词元对数似然无影响的注意力。其输出进入带残差思想的多层rollout算子以聚合跨层证据得到词元到帧归因,再可选以词元对数似然梯度调制注意力并以逐层消融负对数似然增量估计层重要性做因果重加权。与直接平均或单层注意力及扰动解释不同,该链条同时利用低熵置信选择、跨层传播与轻量因果校验,使稀疏解释更贴近模型实际打分变化并可审计。在LibriSpeech评测设置下,LEAF-X的D-AOPC指标为0.45,低于SaCo的D-AOPC指标为0.51。在Whisper-large-v3与Canary-Qwen-2.5B及TED-LIUM语料条件下其删除与不保真度最低而稀疏性与稳定性居前,仅时间定位与最强基线持平或略低,消融显示各组件互补。其适用边界受限于特定主干、数据集与语言覆盖,对注意力与熵校准敏感,且尚未验证噪声域偏移与人类可解释性上的表现;因果重加权带来与音频到文本注意力层数相当的额外前向计算量,必要时可关闭以降低推理开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1135. 没见过真骗子时靠什么识破电话诈骗:跨域稳定的韵律特征与自监督表示的冷启动对决
英文题目:Comparing Self-Supervised and Domain-Invariant Features for Cross-Domain Voice Phishing Detection
标签:#领域适应 #自监督学习 #少样本 #零样本 #音频分类
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#领域适应
👥 作者与机构
- Jeongmin Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Seung Yun:机构信息未能从会议 PDF 纯文本可靠映射
- Minkyu Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Ran Han:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonkyu Woo:机构信息未能从会议 PDF 纯文本可靠映射
- Jinxia Huang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音钓鱼检测的输入是8 kHz电话语音,输出为诈骗与正常咨询的二分类,难点在于真实犯罪录音因隐私难以获取且仅有极少量样本可用。方法链分3步:先在源域情景剧本与目标域真实诈骗之间做离线特征筛选,用随机森林粗选再以科恩d值(Cohen’s d)留下跨域稳定特征;再将筛选后的韵律特征或冻结的自监督学习(self-supervised learning,SSL)表示送入逻辑回归学习判决边界;最后在固定真实域测试集上比较零样本与少样本迁移效果。与直接复用全部声学特征或冻结SSL表示相比,该流程把域稳定性筛选与分类器训练解耦,换取了冷启动可用性。在情景训练、真实犯罪测试下,域不变4特征零样本达到69.5% F1,而HuBERT在5样本条件下达到94.2% F1。该结论仅在韩语电话场景与给定数据源下验证,未验证跨语言与跨诈骗话术外推。原文未披露训练、推理或部署成本实测值,仅做定性计算量讨论。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1136. 把一句手术口令拆成方向、模式和步数:用顺序回归压住大步长误动作
英文题目:Surgical-Robot Command Spotting: Safety-Aware Learning for Compositional Commands
标签:#医疗音频 #注意力机制 #多任务学习 #跨语言 #关键词检测
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#关键词检测 | 主方法:#多任务学习
👥 作者与机构
- Jaewon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Sang-Beom Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Bum-Hwi Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Kwang-Yong Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
手术室语音控制需在口罩遮挡与手术室噪声下把短语音映射为51类韩语组合命令,误将5步听成1步会造成大幅超调或欠调。模型先用轻量共享深度可分离卷积编码器把40维对数梅尔谱压缩为24帧128维特征,再以方向、模式、幅度三路独立时域注意力池化分别汇聚证据,随后方向与模式用Softmax分类而1至5步用一致性排序逻辑(Consistent Rank Logits,CORAL)序数回归输出。相比把组合命令视为独立类的扁平分类,该分解显式编码步数序数关系并以掩码仅在步进样本上监督幅度。留一说话人评估下完整模型在干净与噪声乘以口罩与无口罩组合条件下达到95.36%联合命令成功率,步进子集平均绝对误差(Mean Absolute Error,MAE)为0.0338步且灾难性误差率为0.60%。结论限于5说话人预切分2秒话语与回放重录噪声,尚未验证流式检测与拒识。模型约181K参数与每2秒窗5.99M乘加操作,原文未披露训练硬件、推理延迟实测或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1137. 强拍放大、弱拍衰减:BeatGain 以度量位置重塑人工耳蜗音乐节奏
英文题目:BeatGain - A Rhythmic Pattern Enhancement Algorithm for Music Listening with Cochlear Implants
标签:#助听器 #信号处理 #主观评测 #音乐 #音乐源分离
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音乐源分离 | 主方法:#信号处理
👥 作者与机构
- Benjamin Lentz:机构信息未能从会议 PDF 纯文本可靠映射
- Theresa Hartmann:机构信息未能从会议 PDF 纯文本可靠映射
- Anil Nagathil:机构信息未能从会议 PDF 纯文本可靠映射
- Ian Bruce:机构信息未能从会议 PDF 纯文本可靠映射
- Rainer Martin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
人工耳蜗聆听音乐时频谱分辨率受限而时间包络相对保留,输入为包含人声与多乐器的立体声混音,输出为降复杂度且节拍更清晰的重混信号,难点在于切分音等弱拍事件会抬高感知复杂度并干扰主脉冲。BeatGain先用Spleeter将混音分离为人声、贝斯、鼓和其他四路干声,其输出进入Driedger谐波打击声分离以提纯各干声的打击成分。预训练BeatThis!估计四分音符节拍与小节位置并经线性插值得到十六分音符网格,再按四分音符与八分音符位置放大两倍、非网格十六分音符衰减至零构造时变增益信号。该增益仅作用于贝斯、鼓和其他干声的打击成分并与保留人声的干声重混参数叠加,最终重混输出增强信号。与仅整体放大打击乐的重混基线不同,该方法引入度量位置相关的时变调制而非全局频谱加权,因而能选择性稀疏节奏纹理。在10首流行摇滚片段的双选听测评测下,V+2P相对未处理信号的节奏清晰度偏好分数为90.0%,高于BeatGain相对未处理信号的节奏清晰度偏好分数87.6%。结论目前仅适用于4/4拍且四干声均活跃的短片段,未验证其他拍号、真实人工耳蜗用户与长期偏好外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1138. 少而精才能出声:为毛利语做伦理可控的高质量合成语音
英文题目:Indigenising Speech Technology: Building a TTS Model for te Reo Māori
标签:#基准测试 #数据集构建 #低资源 #多语言 #文本到语音
评分:5.6/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#数据集构建
👥 作者与机构
- Gianna Leoni:机构信息未能从会议 PDF 纯文本可靠映射
- Peter-Lucas Jones:机构信息未能从会议 PDF 纯文本可靠映射
- Tūreiti Keith:机构信息未能从会议 PDF 纯文本可靠映射
- Suzanne Duncan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理毛利语与新西兰英语文本到语音合成,输入为毛利语及双语码切换文本,输出为毛利语优先的自然语音,难点在于毛利语音系独特且单说话人高质量语料稀缺,通用引擎复用他语发音对毛利语近乎不可懂。方法分四步推进:部落语言专家筛选著述并清洗正字法与分句后转入录制;母语级播音人才在部落电台录音棚多轮录制并补转写历史访谈;专家逐句审听按通过、重录、修复与改写处置后送入训练;以语音相近的西班牙语基座加毛利语与英语精标语料微调,并用固定试听基准迭代补录缺失发音。与通用多语引擎直接复用他语发音不同,该工作以西班牙语为基座再精调并坚持部落专家全程质检,其意义在于以较少数据保证发音与文化适切。为此构建覆盖全音位的90句毛利语基准与100句双语码切换基准,按发音、韵律与清晰自然度做新旧版本对比试听。在自建训练语料统计设置下,男性嗓音的毛利语数据量指标为近11小时,高于女性嗓音的毛利语数据量指标逾3小时。该结论的适用边界仅为该部落通用口音下的男女基座嗓音,情感表达、地域口音泛化与外部听众评价尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1139. 打手势能把重音说得更清楚吗:粤语儿童焦点韵律的手势效应与自闭症组差异
标签:#统计分析 #韵律 #言语障碍 #语音 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Zhuoran Li:机构信息未能从会议 PDF 纯文本可靠映射
- Si Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yitian Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Bingxin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Ho-Yi Ku:机构信息未能从会议 PDF 纯文本可靠映射
- Jiayue Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Chun-Sing Wong:机构信息未能从会议 PDF 纯文本可靠映射
- Angel Chan:机构信息未能从会议 PDF 纯文本可靠映射
- Zhuoming Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyan Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Li Sheng:机构信息未能从会议 PDF 纯文本可靠映射
- Po-yi Tempo Tang:机构信息未能从会议 PDF 纯文本可靠映射
- Ratree Wayland:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为粤语儿童在Toy Talk问答中产生的目标形容词及其后接名词,输出为在位与焦点后音节的平均基频、基频范围与时长上的焦点实现,难点在于声调语言中焦点与手势对声学的调制微弱且易被个体与调形差异淹没。方法链分4步:玩具对比问答诱发形容词上的对比焦点与无对比焦点并正交操控有无手势;人工在Praat中切分目标音节并提取3类声学参数;以被试组别、手势条件与焦点位置为固定效应拟合线性混合效应模型;显著交互后做Tukey校正的事后比较。与既有时间同步研究不同,本文直接检验手势存在与否对手势伴随音节声学的塑造作用,并区分手势类型。在象形手势任务条件下,ASD组在位音节的时长指标d为0.35,高于TD组在位音节的时长指标d 0.23。象形手势使两组在位目标音节显著延长,典型发展组同时压缩焦点后音节以强化对比,自闭症组在指示手势下出现在位与焦点后同时缩短,其呼吸驱动因果链尚未验证。结论仅适用于11岁左右粤语儿童的实验室诱发语料,未验证自然对话、自发手势与其他语言的泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1140. 一阶池化丢掉通道协同,流形上的二阶相关如何补回情绪判别力
英文题目:Geometric Second-Order Feature Correlation Learning for Self-Supervised Speech Emotion Recognition
标签:#自监督学习 #统计分析 #语音 #语音情感识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#统计分析
👥 作者与机构
- Shuanglin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ruxiao Qian:机构信息未能从会议 PDF 纯文本可靠映射
- Siyang Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从连续语音帧序列预测离散情绪类别,难点在于韵律与频谱线索以通道间协同变化呈现,而全局平均等一阶聚合隐含独立性假设并丢弃协同结构。本文提出二阶相关(Second-Order Correlation,SOC)层,先将冻结SSL帧特征去均值并经可学习矩阵投影到低维子空间,再计算迹归一化协方差以构造对称正定(Symmetric Positive Definite,SPD)描述子,最后经对数欧氏映射(Log-Euclidean Mapping,LEM)投影到切空间并半向量化后送入多层感知机(Multi-Layer Perceptron,MLP)分类。与直接欧氏平均协方差或先展平再做几何后处理的做法不同,该链条把相关建模保留在流形上并仅在切空间做线性学习,从而兼顾数值稳定与几何相容。在HuBERT骨干与ESD数据集的说话人无关5折评测下,SOC取得加权准确率(Weighted Accuracy,WA)73.50%,高于全局平均池化(Global Average Pooling,GAP)的71.38%和聚焦注意力(Focus Attention,FA)的72.48%。该结论目前仅在ESD与RAVDESS两个表演性小库及冻结base骨干上验证,未检验噪声、跨语种与跨库泛化,也未验证长语音奇异协方差下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1141. 同一组声调在不同元音里为何长得不一样:三高度与四高度湘方言的证据
英文题目:Tonal Contrasts in Different Vowel Contexts and Different Tonal Systems
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Mingxing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Pauline Bolin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yufeng Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为湘方言寿雁与梅花最小对立单音节词的载体句朗读,输出为基频轨迹、均值、时长、强度与嗓音质量的多维声学刻画,难点在于元音固有音高与擦音摩擦噪声会污染调位判断,且三高度与四高度调层系统可能调用不同线索。录制与切分先获得可比元音段并提取基频与VoiceSauce声学参数,线性混合效应模型与增长曲线分析再检验调类与元音语境的主效应及交互,XGBoost结合SHAP最终量化各类线索对调类区分的相对贡献。前一步的声学参数与统计检验结果直接进入下一步的特征重要性排序,使时长与嗓音线索可与基频线索同台比较。与只看基频均值的传统描写相比,该链条把时长、强度与谐噪比等嗓音维度纳入同一可解释排序,能揭示高调更短更响更周期化的跨线索协同,高元音语境下调位分化与声门紧张度差异更大。原文未提供可核对的关键定量结果。结论仅适用于成年男性朗读体单音节,女性、自然语流与感知权重尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1142. 响度推人、语速推模型:正交合成语音拆解讽刺感知的线索权重
英文题目:What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study
标签:#心理声学实验 #韵律 #言语感知 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Zhu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Shekhar Nayak:机构信息未能从会议 PDF 纯文本可靠映射
- Matt Coler:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理无语境条件下仅凭声音判断讽刺度的任务,输入为语义中性的英语短句合成语音,输出为讽刺度与自然度评分,难点在于自然语音中语速、音高变化与响度高度共变,事后声学对比无法分离各自因果贡献。方法链分为三步:先用提示控制型神经语音合成生成语速、音高变化与响度正交组合的候选刺激,并以效应量筛选保留目标维度强操控且低串扰的样本。上述筛选后刺激进入人类感知实验,由母语者按固定量表给出讽刺与自然度判断,形成可建模的人类评分。最后将完全相同刺激送入可处理音频的基础模型多种子重复评分,直接对比人类与模型的线索权重。与依赖自然讽刺与字面产出对比的既有研究不同,该框架用生成式合成实现三维韵律独立操控,使感知差异可归因于韵律操控而非说话人与文本差异。在人机相同刺激对比条件设置下,人类响度线索的系数指标为0.285,高于模型响度线索的系数指标0.035。结论的适用边界仅限语境极简的合成语音感知偏差,不代表完整语篇讽刺理解,也不保证跨语言与母语人群的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1143. 句子重读与词重读分开建模为何不够:冻结骨干上的双头与词跨度约束
标签:#多任务学习 #韵律 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#多任务学习
👥 作者与机构
- Tien-Hong Lo:机构信息未能从会议 PDF 纯文本可靠映射
- Fong-Chun Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Ting-An Hung:机构信息未能从会议 PDF 纯文本可靠映射
- Yu-Hsuan Hsieh:机构信息未能从会议 PDF 纯文本可靠映射
- Yao-Ting Sung:机构信息未能从会议 PDF 纯文本可靠映射
- Berlin Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理朗读式发音评估中的句子重音检测,输入为语音对数梅尔频谱与已知参考文本,输出为词级是否重读,难点在于韵律线索与语义显著性交织,且Whisper子词切分会把一个词的重音分散到多个Token。第一步冻结Whisper主干抽取声学与解码表征,为双任务头提供共享输入。第二步句子重音分支以解码状态为查询、编码状态为键值做交叉注意力,输出Token级二分类概率,其概率分布直接进入下一步的词跨度约束。第三步并行音素级词重音分支提供细粒度监督,同时词跨度重音正则项在真值受压词跨度内强制单个主导Token逼近一并压制其余位置,从而缓解子词歧义。与仅做SSD的WhiStress相比,差异在于引入辅助音素监督并增加词内峰值约束,其实质是将粗粒度词显著性判断与细粒度词内分布锐化解耦。在 TinyStress-15K 测试集上完整模型 STRAW 取得 F1 为 0.934,相对 WhiStress 的 0.909 提升 2.5 个百分点,且精确率 0.945 与召回率 0.924 同时改善。该结论目前仅在合成朗读语音与给定文本条件下成立,对自发语音、真实 L2 口音及无文本情形尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1144. 在家也要说白人话:澳大利亚原住民英语使用者与语音技术的错位
标签:#用户研究 #公平性 #语音识别 #语音交互
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#用户研究
👥 作者与机构
- Celeste Rodríguez Louro:机构信息未能从会议 PDF 纯文本可靠映射
- Glenys Dale Collard:机构信息未能从会议 PDF 纯文本可靠映射
- Hope Narrier:机构信息未能从会议 PDF 纯文本可靠映射
- Katrina Cox:机构信息未能从会议 PDF 纯文本可靠映射
- Lily Hayward:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Colbung:机构信息未能从会议 PDF 纯文本可靠映射
- Ben Hutchinson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为澳大利亚原住民英语使用者在车载助手、手机听写、导航与短信等日常场景的商用语音交互口述,输出为失败体验与应对策略的主题解释,难点在于该变体与主流澳式英语表面相近却在发音词汇语法语用上系统偏离且以口语为主无统一正字法并常被污名为错误英语。方法链分三步衔接:先由原住民咨询委员会指导伦理与议题设计以确定访谈方向,其输出交由5名Nyungar原住民研究助理以yarning故事漫谈主导半结构化访谈在珀斯私人住宅等安全场景采集口述。再将录音转写脱敏后做主题分析提炼模式,并把初步发现交回全体团队与社区回访核验以形成最终解释。与面向非裔美国人英语的偏差测量强调模型打分不同,本文以社区主导质性证据揭示将失败种族化归因与私域压力扩展的机制,其意义在于把技术失败理解为结构性不平等而非孤立误差。在珀斯社区访谈场景下,女性组的人数指标为23,高于男性组的人数指标15。结论仅适用于以西澳大利亚为主的 39 人样本与当前商用语音技术,不支持对识别误差率或跨地区变体的外推。该结论的适用边界受限于西澳都市样本与现有商用系统,跨地区变体与未来系统的表现尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1145. 原始波形学错了什么音:把总错误率拆到音类再看时序与数据的作用
英文题目:Phonetic Error Analysis of Raw Waveform Acoustic Models
标签:#CNN #模型评估 #语音学与音系 #语音 #语音识别
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#CNN
👥 作者与机构
- Erfan Loweimi:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengjun Yue:机构信息未能从会议 PDF 纯文本可靠映射
- Andrea Carmantini:机构信息未能从会议 PDF 纯文本可靠映射
- Zoran Cvetkovic:机构信息未能从会议 PDF 纯文本可靠映射
- Steve Renals:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Bell:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理原始波形输入到音素序列输出的TIMIT音素识别,难点在于整体音素错误率(phone error rate, PER)掩盖了不同宽音素类(broad phonetic class, BPC)的误差来源与系统性混淆,难以判断误差来自前端分辨还是时序上下文建模不足。方法链由三步衔接构成:可学习卷积前端先从原始波形提取谱特征并经最大池化降采样输出帧级表征,其输出送入双向长短期记忆网络(bidirectional long short-term memory, BLSTM)建模双向时序上下文,再由全连接层接三音素和单音素双输出头完成分类与正则约束训练。相比固定梅尔滤波器组(Filterbank, FBank)前端,该路线保留相位信息并联合学习参数化滤波器与识别后端,代价是小数据下归纳偏置更弱而更依赖数据量与预训练迁移补充多样语境。在 TIMIT 测试集上 Sinc2Net 加 BLSTM 达到 15.3% 的 PER,为同期原始波形最佳,而经 WSJ 预训练迁移后 CNN 加 BLSTM 进一步降至 12.3% 并反超滤波器组基线。结论仅在英语小词表朗读音素识别及三套特定 BPC 划分下成立,未验证端到端、自监督或大词表连续语音的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1146. 隐私与性能难以兼得时,原型对齐如何在联邦抑郁检测中稳住多模态表示
标签:#语音生物标志物 #联邦学习 #多模态学习 #隐私保护 #病理语音评估
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#联邦学习
👥 作者与机构
- Dushanthi Madhushika Manamalage:机构信息未能从会议 PDF 纯文本可靠映射
- Frederick Sundram:机构信息未能从会议 PDF 纯文本可靠映射
- Partha S. Roop:机构信息未能从会议 PDF 纯文本可靠映射
- Seyed Reza Shahamiri:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音抑郁检测以临床访谈音频与转录文本为输入,输出基于PHQ-8的抑郁与非抑郁二分类标签,难点在于说话人可识别性使集中收集不可行,而联邦学习下音频与文本异构空间加非独立同分布又加剧客户端漂移与成员推断泄露。FedMPA扩展集中式ALiDeR模型,先在各客户端按文本、音频与融合分别计算类均值原型并上传,服务端以指数滑动平均维护全局原型库以平滑噪声更新。本地训练用加权交叉熵保持类别平衡,用模态拉近损失向正确类全局原型对齐,再用排斥损失远离错误类原型,聚合时按原型余弦相似度加权并叠加服务端动量,推理时低置信样本回退到原型分类。在E-DAIC测试集56人上FedMPA取得准确率0.88、F1 0.89、非加权平均召回率UAR 0.89与隐私-性能得分PPS 0.92,超过最强联邦基线FedGPD的0.84、0.85、0.87与0.89。该结论仅在单数据集、单划分、4客户端与黑盒置信度攻击评估下成立,未验证跨人群、跨采集设备与白盒攻击下的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1147. 老年普通话声调为何更易混:音高集中、轮廓展平与 T2-T3 双向混淆
标签:#统计分析 #语音学与音系 #语音 #音频分类
评分:5.6/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#统计分析
👥 作者与机构
- Zhongxuan Mao:机构信息未能从会议 PDF 纯文本可靠映射
- Yan Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Chenyu Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
普通话词汇声调以基频 F0 高度与斜率为核心编码,输入为孤立汉字朗读语音,输出为四声声学实现与系统可分性,老化带来的喉部与呼吸运动退化使动态调形控制尤为困难。研究先用 Praat 提取 F0 轮廓并转换为说话人归一化 T 值,再派生平均高度与斜率、轮廓内标准差与极差、起始与结束值及音节时长,随后以线性混合效应模型检验组别与声调及性别交互,再在高度与斜率构成的声调空间中计算 Bhattacharyya 距离并用径向基核支持向量机验证可分性。与非声调语言整体抬高或降低基频的描述不同,该工作揭示分声调与分性别的中心化加轮廓扁平化机制,具有声调语言特异性。在年轻组与年长组对照下,十折交叉验证调类分类准确率从 94.35% 降至 84.50%,其中第三声跌至 71.27% 且双向第二声与第三声混淆合计达 36.47%。结论仅适用于南京籍标准普通话孤立字朗读与正常至轻度听力损失人群,未验证连续语流、方言差异及纵向老化因果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1148. 看不见的语言也能借力:用施主 LoRA 初始化受体 LoRA 的跨语言迁移
英文题目:Probing LoRA-to-LoRA Cross-Lingual Transfer for Unseen Low-Resource Conditions in Whisper-Based ASR
标签:#LoRA #跨语言 #低资源 #语音识别
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- Hirak Mondal:机构信息未能从会议 PDF 纯文本可靠映射
- Spandan Dey:机构信息未能从会议 PDF 纯文本可靠映射
- Gopal Agrawal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源自动语音识别需将声学语音转写为文字,本研究目标语在Whisper预训练中近乎缺席且标注仅40小时到100小时,零样本词错误率高达178.40%到249.86%。该方法先输入受体语与候选供体语料并按语系亲缘性限定为同属印度雅利安语系,其职责是保证音系兼容并输出受限候选集,再将该候选集的Whisper分词器词表经验分布输入詹森香农散度计算,其职责是挑选散度最小者以实现梯度子空间对齐并输出最优供体。随后将最优供体的大规模语音转写数据输入低秩适应适配器训练以学习可迁移先验并输出供体适配器参数,最后将该参数完整拷贝为受体适配器初始值并在受体少量数据上继续微调以吸收剩余分布偏移并输出可解码的受体适配器。与依赖高资源预训练锚点和语言标识后验相似度的已有LoRA到LoRA扩展相比,该机制不要求供体已被充分预训练,而是用分布对齐降低解码器需吸收的分布偏移。在Hindi供体600小时到Bhojpuri Rural Woman受体40小时设置下,供体初始化转移的WER为25.14,低于受体单独LoRA的WER 30.37。其结论适用边界受限于Hindi-Bhojpuri、Marathi-Konkani、Bengali-Assamese三组同语系配对,跨语系与声学差异主导情形尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1149. 质量分数真在做决策吗:冻结融合下的错位打乱检验
标签:#评测协议 #多模态学习 #生理信号 #语音 #语音情感识别
评分:5.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#评测协议
👥 作者与机构
- Jaden Moon:机构信息未能从会议 PDF 纯文本可靠映射
- Arvind Pillai:机构信息未能从会议 PDF 纯文本可靠映射
- Andrew Campbell:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音、视频与生理多模态二分类压力与情感识别,输入为对齐的多路证据与缺失标记,输出为状态标签,难点在于质量估计与融合性能相关时难以判定其是否真正改变了决策层选择。方法分三步:先构建分离证据、可用性与质量信号的对齐实例表,再在可观测训练行上训练并冻结单模态专家以输出固定后验,接着训练固定后验加权的晚期融合与混合专家路由并仅在测试时打乱质量对齐来比较匹配与打乱差异。与仅报告整体性能的质量感知架构不同,该诊断固定证据与融合参数,只破坏质量与实例对应关系,因而能识别对质量证据对齐的决策依赖。在StressID全观测测试集下,音频单模态专家逻辑回归的平衡准确率为0.592 ± 0.08,高于直方图梯度提升的平衡准确率0.569 ± 0.05。该诊断的适用边界在于全观测评估隔离了质量效应而未检验质量与缺失交互及早期表征干预。结论仅适用于决策层后验加权与所用信号衍生质量,不外推至早期注意力或表征层干预及质量与缺失交互。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1150. 极少样本下既要学会新语种又不能忘记旧语种:两种混合持续学习如何分工
英文题目:Hybrid Continual Learning for Low-Resource Australian Aboriginal Language Identification
标签:#持续学习 #低资源 #多语言 #语言识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语言识别 | 主方法:#持续学习
👥 作者与机构
- Pravina Mylvaganam:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Eliathamby Ambikairajah:机构信息未能从会议 PDF 纯文本可靠映射
- Vidhyasaharan Sethu:机构信息未能从会议 PDF 纯文本可靠映射
- Jingyao Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语音到语言标签的语言识别任务,难点是澳大利亚原住民语言极度稀缺且说话人极少,直接微调会引发对高资源语言的灾难性遗忘。方法链分三步:先以VoxLingua107预训练的ECAPA-TDNN提取声学表征并替换末层分类器纳入新语言,再用重要性约束或教师软目标保留旧知识,最后以新语言负对数似然驱动目标语言判别。回放增强弹性权重巩固用Fisher重要性加小回放缓冲稳定旧参数,约束引导知识蒸馏则冻结教师并用温度为2.0的软分布对齐高资源输出。与单一持续学习相比,关键差异是将参数级正则与样本或输出级保留显式耦合,在回放极少时仍兼顾可塑性与稳定性。在Warlpiri单语适配中约束引导知识蒸馏取得93.38%综合F1,高于知识蒸馏基线的93.02%并远高于微调的65.38%。在Warlpiri单语适配任务下,CG-KD的Overall F1-score为93.38%,高于KD的Overall F1-score 93.02%。结论适用边界受限于仅3个原住民语言与33类高资源评测子集,跨信道与大规模语种序列场景尚未验证,极低资源下联合训练仍可能失败。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/PraviMyl/AAL — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1151. 离得近才帮得上:用声音和语言特征为 Warlpiri 选跨语言 ASR 迁移源
英文题目:Which Languages Transfer Best to Warlpiri? A Similarity-Based Study for Low-Resource ASR
标签:#迁移学习 #跨语言 #低资源 #语音识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#迁移学习
👥 作者与机构
- Pravina Mylvaganam:机构信息未能从会议 PDF 纯文本可靠映射
- Eliathamby Ambikairajah:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Vidhyasaharan Sethu:机构信息未能从会议 PDF 纯文本可靠映射
- Tünde Szalay:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为仅约1小时的Warlpiri语音并输出文字转写,难点在于极小语料无法训练可靠声学与语言模型,且该语言与常见高资源语言在音系和韵律上差异显著。方法链分三步推进,先用多语言语言识别(Language Identification,LID)模型从107种语言中预筛候选集,再用预训练语音模型提取话语嵌入并以余弦平均计算声学相似度与层级演化,同时从类型学数据库抽取句法与音位等特征向量计算语言学相似度,最后按相似度排序逐一做源语言适应的Whisper模型微调并在目标语上二次微调。与按语系或地理启发选源语言的做法不同,该框架以可测量的声学与音位重叠替代先验假设,因而更能捕捉跨语系的发音接近性。在 DoReCo 划分的 Warlpiri 测试集上,以 Assamese 为源语言的微调取得 32.6% 的词错误率(Word Error Rate,WER)和 12.3% 的字符错误率(Character Error Rate,CER),明显优于 41.0% 的多语言基线。该结论的适用边界受限于单一濒危语言与Whisper small单链路验证,尚未验证向其他语系或自监督架构的外推,且日语等低相似语言存在迁移效果差的失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1152. 只看过去才能像人一样听:因果约束决定语音识别的竞争时间线
英文题目:Do Machines Listen Like Humans? A Temporal Benchmark for Phonological Competition in End-to-End ASR
标签:#基准设计 #模型比较 #言语感知 #严格因果 #语音识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音识别 | 主方法:#基准设计
👥 作者与机构
- Linkai Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Christian Brodbeck:机构信息未能从会议 PDF 纯文本可靠映射
- Sahil Luthra:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Brown:机构信息未能从会议 PDF 纯文本可靠映射
- Jay Rueckl:机构信息未能从会议 PDF 纯文本可靠映射
- Monty Escabi:机构信息未能从会议 PDF 纯文本可靠映射
- David Gow:机构信息未能从会议 PDF 纯文本可靠映射
- James S. Magnuson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
人类言语感知是增量消歧过程,输入为连续声学信号,输出为随时间起伏的词激活,难点在于离线转写指标无法刻画 onset 竞争者与韵脚竞争者的时序分离特征与微观动态抑制过程。该基准先将音频转成频谱并在词首插入200 ms静音以对齐声学到眼动的滞后,再用编码器逐帧输出300维语义向量并求其与目标及竞争词向量的余弦相似度轨迹。相似轨迹经Luce选择规则转化为注视比例分布,并与人类视觉世界范式曲线逐点比较RMSE与MAE误差。与能用未来上下文的非因果架构不同,因果架构只能累积过去与当前证据,因而被迫复现人类先cohort后rhyme的竞争时序规律。在1533词多说话人测试条件下,因果模型的RMSE为0.07,低于非因果模型的RMSE 0.22。该结论限于孤立词、小词表与正确识别样本,未验证连续语音、词频与邻域密度控制及神经数据外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1153. 不追母语腔,只保听得懂:用音素替换误差预测可懂度并排序
英文题目:Automatic Assessment of L2 Speech Intelligibility: Segmental Error Ranking
标签:#教育 #集成学习 #语音 #语音可懂度评估
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音可懂度评估 | 主方法:#集成学习
👥 作者与机构
- Agnieszka Pludra:机构信息未能从会议 PDF 纯文本可靠映射
- Izabela Krysińska:机构信息未能从会议 PDF 纯文本可靠映射
- Matuesz Jekiel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理二语英语朗读语音的可懂度自动评估,输入为5秒至15秒朗读录音与参考文本,输出为可懂度分数,难点在于音段错误众多但仅部分影响交际,且主观评价一致性偏低。方法链分三步:先从内部考试备考录音、VoxPopuli与speechocean762筛选录音并经众包听者打分建立真值,再用Azure AI Speech服务做音素识别并与词典典式转写对齐抽取误读与替换特征,随后训练回归模型预测分数并按基尼重要度排出音素影响力。与传统母语贴近度打分不同,该机制直接学习错误到可懂度的映射,使反馈聚焦高功能负载音素而非全部偏差,从而减轻学习负担并提升反馈可操作性。在多特征回归模型评测下,AdaBoost DTR的MSE为0.48,低于RFR的MSE 0.49。该结论受限于朗读任务与所用语料范围。结论仅适用于朗读式英语成人二语语音,未验证自发对话、低水平学习者与超音段主导场景的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1154. 附和声是让话继续还是把话接走:荷兰语中句法完整与边界调前的证据
标签:#统计分析 #韵律 #语音 #轮次切换
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#轮次切换 | 主方法:#统计分析
👥 作者与机构
- Ariëlle Reitsema:机构信息未能从会议 PDF 纯文本可靠映射
- Matthijs Westera:机构信息未能从会议 PDF 纯文本可靠映射
- Yiya Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Johanneke Caspers:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为荷兰语地图任务对话中停顿间单元的句法完整性与句末边界调,输出是对随后出现保持、转换还是反向通道的类型解释,难点在于反向通道可选且与让渡线索高度重叠。方法链分三步:先以100 ms静音与说话人切换切分停顿间单元并标注三类转移,再用荷兰语语调转写系统标注高、低、平边界调并依据上下文判断句法完整,最后以反向通道为参照拟合多项混合回归并用Jensen-Shannon散度比较预测分布相似性。与把反向通道并入保持的既有做法不同,本文将其独立建模并检验边界调与完整性的交互效应。模型以说话人与对话为随机截距控制个体与会话变异,并在加权效应编码下估计边界调与完整性及其交互的主效应。在荷兰语地图任务语料下,保持-反向通道的JSD散度指标为0.187,高于转换-反向通道的JSD散度指标0.070,自举检验p小于0.001,表明反向通道更接近转换。分布上保持多接平调而反向通道与转换多接高调,绝对百分比差异也显示反向通道偏离保持而贴近转换。结论限于任务导向荷兰语协作对话,未验证自发闲聊与其他语言及韵律重音等更早线索,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1155. 基频轮廓相似是即时模仿还是随年龄减弱的迁就:三语纵向语料的动态时间规整检验
英文题目:Dynamic Time Warping Reveals Prosodic Alignment in Caregiver–Child Interactions across Languages
标签:#统计分析 #语言习得 #韵律 #多语言 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Olivier Rüst:机构信息未能从会议 PDF 纯文本可靠映射
- Sabine Stoll:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为纵向自然互动中儿童话轮及其后2秒窗口内非重叠的女性主要照料者跟随话轮,输出为二者基频轮廓相似度随话轮间隔与儿童年龄的变化规律,难点在于话轮时长不等、儿童基频高而变异大、自然录音存在多人干扰与地址对象不明。本文方法链为观测流水线:按说话人日志与起止时间戳抽取儿童-照料者话轮对并计算间隔,用Praat自相关法提取基频并经去倍频、外推和平滑后做均值中心化以保留轮廓形状,再用动态时间规整求路径长度归一化距离,最后以分语言贝叶斯多层对数正态回归检验间隔与年龄效应。与既有描述儿童导向言语静态特征的研究不同,本文把启动与顺应拆成对立预测:启动预测短时趋同但无年龄调制,顺应预测短时趋同叠加随年龄相似度下降,使机制差异可被纵向数据区分。在ACQDIV三语语料基准任务条件下,俄语时间间隔效应的证据比ER指标为284.71,高于英语时间间隔效应的证据比ER指标0.33。该结论仅适用于一对一女性照料者互动与基频轮廓层面,未验证词汇句法、语速与发音清晰度等多维对齐,也未覆盖多人家庭与实验室诱发语境。原文未披露训练、推理或部署成本,仅声明部分文稿经GPT-4润色。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1156. 模态重要性不是常数:用情绪查询门控刻画对话时间上的动态权重
英文题目:Modality Importance is Not Static: Temporal Dynamics via Gating in Multimodal Emotion Recognition
标签:#注意力机制 #多模态学习 #RNN #可解释性 #语音情感识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Jiyeon Ryu:机构信息未能从会议 PDF 纯文本可靠映射
- SeongHun Noh:机构信息未能从会议 PDF 纯文本可靠映射
- Jin-Hyuk Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Woojin Kang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态情感识别需从文本、语音和视频中逐话轮推断6类情绪,难点在于各模态贡献随对话上下文漂移,而静态融合默认其平稳不变。该工作先独立训练单模态编码器并导出话语级表征,再在固定特征上比较静态融合、无门控时序融合与门控时序融合,核心为情绪查询门控:每个情绪类维护可学习查询向量,按上一时刻隐状态估计类别后验并对类条件模态分布加权边缘化,再将时变权重乘到当前时刻多模态特征后送入门控循环单元做长度为8的上下文融合与分类。与隐式交互的Transformer融合不同,该方法将模态重要性显式参数化为位于2维单纯形上的时变分布,参数量更小且更易做归因检验。扰动分析显示遮挡少数关键时刻即可显著改变预测。在IEMOCAP六类留一会话交叉验证评测下,情绪查询门控时序融合的Macro-F1为0.5731±0.0263,高于静态MLP融合的Macro-F1 0.4821±0.0407。结论仅在剧本化双人对话与干净转录条件下成立,向自然对话、噪声语音或缺失模态的外推尚未验证。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1157. 带渐变语音细节的儿向语切词为何没有想象中难
英文题目:Gradient phonetic detail is less detrimental to word segmentation in infant-directed speech
标签:#无监督学习 #语言习得 #语音学与音系 #语音 #语音识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#无监督学习
👥 作者与机构
- Gabriel Scharff:机构信息未能从会议 PDF 纯文本可靠映射
- Megha Sundara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为连续婴儿指向言语的音段序列,输出为词边界划分,难点在于真实发音存在弱化、删除与同化而词典式音素输入掩盖了该难度。本文对比音素转写与语音转写两种输入,先将 PhonProv 语料的 PRAAT 标注由 X-SAMPA 转为国际音标并清洗重音与长度标记,再用四种无监督切分算法分别处理完整语料与十分之一子集,最后以位置敏感的词符 F 值度量音素到语音的性能落差。与仅依赖底部统计的转移概率和DiBS不同,PUDDLE与适配文法结合自下而上统计与自上而下词库信息,因而对多变体造成的词库碎片化更具韧性,这为在变异输入下选择切分机制提供了依据。在完整语料评测设置下,语音转写条件下适配文法的词符F分数为0.52,低于音素转写条件下同一词符F分数的0.58。缩小至十分之一语料条件时数据稀疏放大了变异代价,PUDDLE的落差扩大而适配文法仍保持相对稳定,说明充足重复暴露是缓冲变异的关键。该结论的适用边界受限于仅编码辅音变异且缺失元音变异的英语家庭互动数据,尚未验证跨语言与连续声学输入的外推。结论仅适用于编码辅音变异而缺失元音变异的英语家庭语料,不能外推至连续声学输入或跨语言场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1158. 日记里说的是什么比怎么说的更能猜中今天的心情
标签:#数据集构建 #模型比较 #零样本 #语音 #语音情感识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音情感识别 | 主方法:#数据集构建
👥 作者与机构
- Michelle D Schlicher:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Triantafyllopoulos:机构信息未能从会议 PDF 纯文本可靠映射
- Nadine N Schmitt:机构信息未能从会议 PDF 纯文本可靠映射
- Johanna Löchner:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以德语每日自由回顾语音及其转写为输入,输出多维心境问卷效价与唤醒分数及知觉压力量表分数,难点在于反思性叙述混合全天体验且个体内波动小、问卷难以分离效价与强度。方法链分三步:先用能量切分与Whisper Large-v3转写得到短语级音频与重叠文本窗,输出进入下一步建模;再用声学支路提取eGeMAPS与wav2vec2情绪预测并训练随机森林、用语言支路微调GBERT-large并零样本调用Mistral-7B-Instruct,分别输出三目标分数;最后在群体层面汇合评估并在个体层面用混合效应模型检验声学关联。相对已有方法的关键差异在于直接对比自由日记中副语言与语义流的信息量,表明效价偏语义而唤醒在该反思场景下声学贡献极弱,具有指导采集范式选择的实际意义。在说话人无关5折交叉验证评估设置下,Mistral-7B-Instruct在效价维度上的CCC指标为.466,高于GBERT-large在效价维度上的CCC指标.227。结论仅适用于群体间特质差异,对个体内日常波动的外推尚未验证,高唤醒与高压力个体的误差模式也显示脆弱性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1159. 同语不同域就该拉得轻一点:半正样本对比如何约束语言聚类
英文题目:Robust Language Identification Using Semi-positive Contrastive Learning
标签:#对比学习 #鲁棒性 #多语言 #语音 #语言识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语言识别 | 主方法:#对比学习
👥 作者与机构
- Shubham Sharma:机构信息未能从会议 PDF 纯文本可靠映射
- Padmanabhan Rajan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语语言识别需从语音波形判别12种印度语言并输出语言标签,难点在于训练域的广播与朗读语音与测试域的YouTube与多场景口语在信道与采集方式上存在偏移,易使模型过拟合声学细节而泛化失效。该工作先用音频编码器与文本编码器将语音与音素字幕映射到512维共享空间得到可比的音频与文本嵌入,再以目标矩阵区分强正对与半正对并施加不同拉拢强度形成半正对比约束,接着将半正对比损失与交叉熵分类损失联合端到端优化音频分支与分类器。与二值对比学习相比,该机制允许同语言跨域样本靠近但不坍缩到同一中心,动态字幕进一步用多锚点保留音素结构,从而保留语种内差异并增强域不变性。在DatasetM yt测试集下,SpCL whisp静态模型的准确率为89.36%,高于标准对比学习α为0的准确率87.65%。该结论限于12种印度语言与广播和朗读到YouTube与多场景口语的偏移,在更大语种与噪声条件下的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1160. 难对太少见、尾部总失败:用在线难度矩阵把采样从均匀推向难对
英文题目:Adaptive Hard-Pair Sampling via Curriculum Learning for Speech Separation
标签:#课程学习 #鲁棒性 #语音 #语音分离
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音分离 | 主方法:#课程学习
👥 作者与机构
- Pengjie Shen:机构信息未能从会议 PDF 纯文本可靠映射
- Xueliang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhong-Qiu Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道语音分离输入为单路双人混合波形,输出为各说话人干净语音,音色相近对占比小却残留干扰大,均匀采样易过拟合简单对而在相似音色上失效。方法先以每批次混合的负SI-SDR为输入,用指数滑动平均在线更新说话人-说话人难度矩阵\(D\)与计数矩阵\(C\),输出实时难度估计供采样查询。再以该难度矩阵为输入均匀采样锚点说话人,对已观测伙伴按温度Softmax依难度采样干扰说话人并对未观测对回退均匀分布,输出偏向难对的双人混合波形进入训练,最后以这些混合波形为输入经暖机均匀、中段温度线性退火聚焦难对、末段回退均匀的三段课程训练分离网络,输出适应难对的分离参数而不改损失以避免固定重加权与离线划分的分布偏移。在 Libri2Mix 测试集 6000 条混合上,TF-GridNet 在初始温度 \(\\tau\_0=20\) 时平均 SI-SDR 改善量(SI-SDR improvement,SI-SDRi)从 21.9 dB 提升到 22.7 dB,底部 30% 平均 SDRi 从 18.3 dB 提升到 18.8 dB。结论仅在 2 说话人英语朗读混合与 3 种骨干上验证,未检验噪声混响、跨数据集与多人混合外推。采样额外开销为每批次 1 次查表加 Softmax 与分类采样,原文称可忽略,未披露训练与推理耗时。该增益适用边界受限于英语朗读语料,噪声混响多人场景尚未验证,而课程采样只增加查表与采样计算量,训练成本与推理开销原文称可忽略。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1161. 机器味反而更清楚:当听者预期改变了对合成韵律边界的感知
标签:#主观评测 #韵律 #言语感知 #语音 #语音可懂度评估
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#主观评测
👥 作者与机构
- Ha Eun Shim:机构信息未能从会议 PDF 纯文本可靠映射
- Paige Tuttösí:机构信息未能从会议 PDF 纯文本可靠映射
- Olivia Yung:机构信息未能从会议 PDF 纯文本可靠映射
- Ivan Fong:机构信息未能从会议 PDF 纯文本可靠映射
- Sara Ng:机构信息未能从会议 PDF 纯文本可靠映射
- Angelica Lim:机构信息未能从会议 PDF 纯文本可靠映射
- Yue Wang:机构信息未能从会议 PDF 纯文本可靠映射
- H. Henny Yeung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理文本到语音在句法歧义句中的韵律可懂度问题,输入为词序列相同但逗号边界不同的正字法文本,输出为听者对目标图像的匹配判断,难点在于开源TTS的逗号对比微弱且易被漏检。方法链第一环用女性母语者朗读的对比性目标韵律形式微调Matcha-TTS以强化逗号对比,得到拟人情感基线并作为后续操控的统一源头。第二环经由韵律操控与音质操控分别派生降低音高变化的单调变体与改变音色的机器味变体,第三环将单嗓音暴露的机器人训练式图片匹配与MOS-X2问卷串联以分离客观理解与主观评价。相比以往把自然度与可懂度分开评分的设计,该工作把指数特征视作期望启动子而非装饰性音色,从而检验嗓音身份预期对边界感知的影响。在机器人训练式图片匹配任务条件下,Incongruent对比Congruent嗓音的回归系数指标为0.44,高于Human-like对比Machine-like嗓音的回归系数指标−0.51。结论仅适用于英语直接称呼与列举两类边界歧义及实验室单次聆听,跨语言与多轮交互外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1162. 没有框标注时,如何让声音自己长出物体边界:EchoLoc 的热图与框联合定位
英文题目:EchoLoc: Audio-Aware Object Grounding via Joint Heatmap and Box-Level Localization
标签:#对比学习 #Transformer #音视频 #声源定位
评分:5.6/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#声源定位 | 主方法:#对比学习
👥 作者与机构
- Junghwa Shin:机构信息未能从会议 PDF 纯文本可靠映射
- Yeonwoo Kim:机构信息未能从会议 PDF 纯文本可靠映射
- HyungJune Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声源定位的输入为同场景图像帧与音频片段,输出为发声对象的空间位置,难点在于缺乏与声音对齐的边界框标注,且音频视觉相似度热图模糊而难以直接转为精确框。第一步由模态编码负责表征,视觉流以MDETR权重初始化的ResNet-101输出空间特征图,音频流以冻结的PANNs CNN14输出全局向量,二者作为后续双分支的共享输入。第二步由热图分支负责弱监督定位,其像素级内积相似度分别经log-sum-exp聚合的空间对比损失和全局池化语义对齐的全局对比损失训练,输出的相似度图再取覆盖top概率质量的紧致区域生成伪框并送入下一步。第三步由框分支负责对象级接地,将视觉特征与全局音频特征经Transformer编码器早期融合后,由解码器可学习对象查询直接回归边界框,伪框经匈牙利匹配监督查询而不作硬目标拟合,总损失为空间对比损失、全局对比损失与框损失之和,从而把候选生成与选择纳入联合优化,区别于仅做全局对齐或依赖固定阈值后处理。在Flickr-SoundNet-Test上取得84.34 cIoU、88.22 cIoU adap、54.29 AUC、79.99 AUC adap,其中自适应指标相对最强基线MarginNCE分别相对提升2.58%与17.08%;在VGG-SS上为36.36 cIoU、44.31 cIoU adap、38.28 AUC、41.19 AUC adap,未超过FNAC和MarginNCE。该结论限于单声源主导、同源训练测试场景,跨域、多声源与热图失效时的鲁棒性尚未验证。单卡NVIDIA GeForce RTX 3090训练40轮约15小时,推理延迟与阈值校准代价未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1163. 词错误率相近不等于错得一样:零样本儿童语音中表示层的误差分化
英文题目:Error Diversity and Performance Variability in Zero-Shot Children’s Speech Recognition
标签:#自监督学习 #模型评估 #零样本 #语音 #语音识别
评分:5.6/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.2/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Abhijit Sinha:机构信息未能从会议 PDF 纯文本可靠映射
- Hemant Kumar Kathania:机构信息未能从会议 PDF 纯文本可靠映射
- Paban Sapkota:机构信息未能从会议 PDF 纯文本可靠映射
- Mikko Kurimo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为成人语音训练的声学模型在儿童语音上的转写,输出为词序列,难点在于音高、构音发育差异导致的声学失配与儿童标注稀缺。本文构建零样本成人到儿童迁移链条,先用冻结自监督学习(Self-Supervised Learning,SSL)表示逐层抽取声学特征,再送入混合深度神经网络隐马尔可夫模型(DNN-HMM)解码得到1-best假设,最后分别做误差类型分解、大语言模型(Large Language Model,LLM)文本纠错与跨层预言机(Oracle)选择以检验互补性。与只选全局最优词错误率(Word Error Rate,WER)层的做法不同,本文把可恢复性与逐句最优性纳入表示质量判据,从而揭示全局指标所掩盖的结构差异。在CMU Kids零样本评测条件下,跨层预言机选择的WER为16.42%,低于最优单层基线的WER 21.52%。结论仅适用于英式与美式朗读儿童语料及冻结表示加二元语言模型解码条件,未验证自发对话、病理语音与其他语言的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1164. 耳朵为主、眼睛和文字为辅:MER-Live 如何证明情绪是听出来的
英文题目:MER-Live: An Interactive Browser Demo of Prosody-Driven Multimodal Emotion Recognition
标签:#多模态学习 #韵律 #实时处理 #语音情感识别
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Haoyu Song:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoxiao Miao:机构信息未能从会议 PDF 纯文本可靠映射
- Pai Chet Ng:机构信息未能从会议 PDF 纯文本可靠映射
- Timothy Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Aik Beng Ng:机构信息未能从会议 PDF 纯文本可靠映射
- Ian McLoughlin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
MER-Live面向无预知边界的实时多模态情感识别,输入为麦克风语音流、摄像头人脸流与浏览器语音识别转写文本,输出为快乐、悲伤、愤怒、中性四类的连续估计与主导表情符号,难点在于以滑动窗替代已知边界并实时融合多速率异量纲预测。方法链第一步由6.77M参数掩码自编码器语音情感模型承担声学编码,仅取最近3秒音频的128×300对数梅尔谱提取非词汇韵律并输出软概率。第二步由视觉分支与文本分支各自输出软概率向量,其中文本分支接收原生语音识别转写仅作平局裁决者,两路输出与声学软概率一并送入融合步骤。第三步以中性类概率构造置信度权重对三路投票做加权晚融合并重归一化,融合结果再经显示端指数滑动平均与迟滞平滑输出稳定标签,与关键词触发式演示的关键差异在于音频模型不接触文本、音素或词边界,可用相同词不同语调验证声学主导性。在单块H200批量5的推理评测下,TensorRT 10.5 FP16的延迟性能指标为0.24 ms,低于PyTorch FP32的延迟性能指标3.36 ms。实时模式受固定3秒感受野限制而精度上限接近60%,完整性能需切换至5秒录制平均模式,且文本分支依赖Chrome或Edge浏览器接口,当前构建使用明文WebSocket。源代码与运行时包仅承诺未来发布于GitHub,原文未披露训练成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1165. 高水平巴斯克语口语能分清吗:mHuBERT-147 与 wav2vec 2.0 的 C1 二分类对照
标签:#教育 #自监督学习 #模型比较 #低资源 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#自监督学习
👥 作者与机构
- Christoforos Souganidis:机构信息未能从会议 PDF 纯文本可靠映射
- Aitor Bellanco:机构信息未能从会议 PDF 纯文本可靠映射
- Andoni Sudupe:机构信息未能从会议 PDF 纯文本可靠映射
- Inma Hernáez:机构信息未能从会议 PDF 纯文本可靠映射
- Ibon Saratxaga:机构信息未能从会议 PDF 纯文本可靠映射
- Eva Navas:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理高风险认证场景下自动口语评估Automated Speaking Assessment(ASA)中的整体水平判别,输入为切分为20秒片段的无转写学习者独白,输出为通过与否的二值标签,难点在于C1及以上相邻水平的差异细微且涉及话语与韵律而非可懂度。方法链分为三步:先将16 kHz原始波形送入冻结卷积编码器的自监督学习Self-Supervised Learning(SSL)主干提取帧级上下文表示以保留预训练声学知识,再经均值池化压缩为片段级向量并接入线性分类头微调,最后将多片段预测经跨种子集成聚合为独白级判定。与对比学习的wav2vec 2.0不同,掩码聚类预测的多语言HuBERT Multilingual HuBERT(mHuBERT-147)更强调音系与重音类结构,作者推测其对母语相近的高水平巴斯克语学习者更敏感。在专有C1-HABE测试集上mHuBERT-147的种子多数投票准确率达到0.795,显著优于wav2vec 2.0 xlsr。该结论仅适用于巴斯克语C1相邻水平与ICNALE英语B1与B2+对照设置,无法外推到多等级划分或跨母语泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1166. 只用 250 小时学会 67 种语言的声音:掩码预测为何聚类说话人强、认语言弱
标签:#自监督学习 #状态空间模型 #多语言 #语音 #说话人识别
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#说话人识别 | 主方法:#自监督学习
👥 作者与机构
- Prakriti Subedi:机构信息未能从会议 PDF 纯文本可靠映射
- Howard Prioleau:机构信息未能从会议 PDF 纯文本可靠映射
- Saurav Aryal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无监督野外语音挑战(Unsupervised Speech in the Wild, UPS)要求在无标注多语言语音上学习冻结表征,并支撑语言识别、语音识别与说话人聚类三类探测。第一步负责离线目标构造,将长语音按10秒切块并离线提取80维对数梅尔特征,再用小批量K均值对原始梅尔帧聚类生成200类离散伪标签,为掩码预测提供监督信号。第二步负责表征学习,将带掩码的特征送入12层双向Mamba2(Bidirectional Mamba2, BiMamba2)编码器,以前向与反向状态空间路径加线性跳连构建双向上下文,并联合掩码伪标签预测、方差不变协方差正则(VICReg)与语言识别损失联合训练。第三步负责探测适配,将编码器输出经起、中、末三段平均与L2归一化形成话语嵌入,供官方Dynabench探测调用。与掩码自编码Transformer路线相比,该方案以状态空间对偶(Structured State Space Duality, SSD)实现双向上下文,保持线性复杂度。在官方评测中,主检查点step 19.5k说话人聚类调整兰德指数(Adjusted Rand Index, ARI)为0.735,超过全部四个基线,而语言识别宏F1为0.073、字符错误率(Character Error Rate, CER)为0.870,明显落后于Whisper与HuBERT-large。该结论仅适用于约250小时67语言小规模训练与冻结嵌入探测设置,无法外推至大语种覆盖或微调场景。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/datasets/MLCommons/unsupervised — 链接不可用(HTTP 401) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1167. 静音中段与清化元音下日本人听辨英语/iː/–/ɪ/:时长与促音偏置为何压过频谱残留
标签:#心理声学实验 #言语感知 #跨语言 #音频分类
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- Shinichi Tokuma:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为通用美音男性在载体句中读出的teat/tit与peace/piss的/CVC/录音,输出为日本大学生在静默中心与去浊化元音条件下的二选一辨认,难点是母语时长策略、促音联想与清辅音环境极易掩盖频谱线索。方法链分三步:先录制筛选最优token,再分别构造挖除元音核的SC连续体与用送气尾部扩展替代元音中部的DEV连续体,最后经由Praat MFC范式收集辨认并用重复测量逻辑回归建模,前步编辑后token重新嵌入载体句进入下一步听辨。与既往SC研究的关键差异是改用前后均为清辅音的高元音框架以触发日语清化语境,并增设送气编辑对照以检验残留高频频谱是否有助辨认,其意义在于区分时长效应与清化联想的实际贡献。在重复测量逻辑回归评测设置下,DEV条件的元音类型效应的指标Wald χ2为57.136,高于SC条件的元音类型效应的指标Wald χ2 37.402。结果显示时长缩短诱发选/ɪ/的偏好与40ms附近触发的促音式clipping效应叠加,而去浊化残留与送气存在并未提升辨认准确率,低水平者尚未验证对频谱线索的有效利用。结论仅适用于CEFR B1左右、无海外经历的日本大学生对teat/tit与peace/piss特定清辅音框架的感知,未验证高水平者、其他元音与自然语流的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1168. 听起来都对的波兰语/s/:词位置如何系统改变儿童擦音频谱
英文题目:From onset to coda: spectral variation in normative Polish /s/ produced by children
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Joanna Walczak:机构信息未能从会议 PDF 纯文本可靠映射
- Oliwia Skórzewska:机构信息未能从会议 PDF 纯文本可靠映射
- Zuzanna Miodońska:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为5至8岁波兰语儿童听觉判定正常的/s/擦音段,输出为词首、词中与词尾三类位置的频谱差异判断,难点在于儿童发音变异大且听觉正常仍可能藏有次音位差异。先人工界定擦音起止并切分为短帧,输入为儿童词例原始录音,职责是定位摩擦区间并输出帧级频谱,再以帧级频谱为输入计算质心、偏度、峰度等静态谱矩与帧间谱通量,职责是刻画静态谱形与时变过程并输出每词例特征均值,最后以上述特征均值为输入送入以词位置为固定效应、说话人与母词为随机效应的线性混合效应模型,职责是控制个体与词汇变异并输出边际均值用于位置两两比较与效应量估计。相对仅做听觉评估或整体平均谱矩的做法,关键机制差异在于同时建模静态谱形与帧间谱通量并控制协同发音随机斜率,从而区分边界强化与词内协同发音的不同来源。在8词试点语料评测设置下,词中/s/的谱偏度指标为0.93,高于词首/s/的谱偏度指标0.08。该结论的适用边界受限于八词非均衡词表,年龄轨迹与运动学解释尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1169. 把嗓音维度拆开讲:合成样例为何只让粗糙感的辨别真正提升
标签:#教育 #心理声学实验 #言语感知 #语音 #语音编辑
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音编辑 | 主方法:#心理声学实验
👥 作者与机构
- Jana Wiechmann:机构信息未能从会议 PDF 纯文本可靠映射
- Frederik Rautenberg:机构信息未能从会议 PDF 纯文本可靠映射
- Reinhold Haeb-Umbach:机构信息未能从会议 PDF 纯文本可靠映射
- Petra Wagner:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
听觉感知嗓音质量评估要求听者在约30秒连续语流中并行判断嘶哑粗糙感、气息声、嘎吱声等重叠维度,新手内部标准不稳定且自然锚定音永远多维混杂。研究构建三段式训练链:先用16段德语半自发模拟电话语音做二值前测,再由专家进行约10分钟生理与听辨讲解并播放示例,最后用相同16段语音做后测,两组唯一设计差别是讲解示例来自自然锚定音还是合成操控音。合成支路复用前期文本到语音骨干加条件连续归一化流操控模块,以全局说话人表征为变换对象、以7维嗓音质量强度为条件输入,改变条件值即可生成同说话人多强度样本,使单一维度被隔离放大后进入讲解。与传统自然锚定相比,关键机制差异是同说话人可比与强度连续可调,从而降低多维干扰并展示细微变体。在相同16段语音后测任务下,合成组的感知灵敏度d’指标为1.03,高于对照组的感知灵敏度d’指标0.55。结论目前只适用于非病理德语日常语音的单次短时讲解与20名女性临床语言学学生的范围,未验证长期保持、病理嗓音与跨语言外推。跨病理嗓音与长期保持的外推尚未验证,其适用边界受限于单次短时讲解设计。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1170. 只用 13 分钟电喉语音:先学会合成电喉声,再学着把它变回自然声
英文题目:One-to-Many Electrolaryngeal Voice Conversion with Synthetic Data
标签:#数据增强 #低资源 #语音 #语音转换
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#数据增强
👥 作者与机构
- Bowen Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Haruto Ueno:机构信息未能从会议 PDF 纯文本可靠映射
- Carlos Toshinori Ishi:机构信息未能从会议 PDF 纯文本可靠映射
- Chaoran Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
电子喉语音转换需将单调机械的电子喉语音转为保留语言内容与语速的多说话人自然语音,难点在于时间对齐平行数据极度稀缺且频谱失配严重。该工作先在日语JVS语料上从零预训练任意到多说话人QuickVC模型以获得自然语音转换潜空间。再用100句真实电子喉语音以相同语音为输入与目标微调得到自然到电子喉模型,并将JVS中大规模自然语音批量合成为时间对齐的伪电子喉平行对。最后以合成电子喉语音送入Whisper编码器、对应自然语音送入说话人编码器,仅更新内容编码器与流模块并冻结说话人编码器来监督微调同一预训练模型实现一对多转换,其与仅扁平化基频方法的差异在于学习真实频谱包络与辅音特性以缩小合成与真实分布差距。在100句真实电子喉测试与5个目标音色上的客观评测显示,所提10k模型在梅尔倒谱失真(Mel-Cepstrum Distortion, MCD)上以6.607优于扁平基频基线的6.885,基频相关性从0.548提升至0.585,语音相似度保持在0.923。在100句电子喉语音转换5个目标音色的客观评测下,ours-10k的MCD为6.607,低于flat-F0的MCD 6.885。该结论目前仅在单名日语男性长期使用者与中性朗读语料上验证,未覆盖多病因多设备与自发情感韵律的外推。其适用边界受限于单说话人中性朗读语料,跨病因跨设备与情感韵律场景尚未验证,训练成本为单卡NVIDIA RTX 3090硬件上全流程约4天,10秒音频的推理开销约0.05秒延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1171. 不对齐标签而累积特征:用时间平均的群延迟代替显式移位
标签:#信号处理 #模型比较 #鲁棒性 #语音 #语音情感识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#信号处理
👥 作者与机构
- Jian Xiang:机构信息未能从会议 PDF 纯文本可靠映射
- Jingyao Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
- Vidhyasaharan Sethu:机构信息未能从会议 PDF 纯文本可靠映射
- Eliathamby Ambikairajah:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
连续情感识别需从语音逐帧回归唤醒度与效度,人工持续标注存在感知、决策与动作延迟,导致预测与金标错位。作者提出累积延迟补偿,先用冻结的wav2vec 2.0 base提取语音表示并降采样至标注分辨率,再对每维特征施加因果滑动平均以群延迟引入延迟并同时平滑特征,最后送入受约束神经微分方程建模连续情感动态。滑动平均输出作为累积后特征向量进入微分方程求解器按固定步长积分,初始状态由累积后特征映射得到,形成从特征提取经时间累积到动态回归的方法链。与需截断与复制边界的平移延迟补偿不同,累积延迟补偿不修改输入标签对齐,延迟由积分窗长决定,具有更宽的近优区间。在RECOLA语料语音任务评测设置下,唤醒度上ADC的CCC指标为0.820±0.012,高于SDC的CCC指标0.811±0.021。统一有效延迟的公平对比显示效度优势显著而唤醒度差异不显著,部分维度消融表明高低频增益无显著差异。该结论适用边界受限于单语料单模态、五个固定种子及1秒到7秒窗搜索,效度最优窗长于唤醒度,跨语料与跨模态外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1172. 只用几秒提示音做强化适配:VoiceTTA 如何补上少见口音与夸张韵律的模仿缺口
英文题目:VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation
标签:#前缀微调 #强化学习 #测试时自适应 #零样本 #文本到语音
评分:5.6/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#测试时自适应
👥 作者与机构
- Tianxin Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Dong Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Li Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成的输入为文本与数秒参考语音,输出为保留目标音色与韵律的合成语音,难点在于口音、儿童、含混、小品与方言等非典型提示与训练域显著偏移导致风格模仿失效。VoiceTTA先以不同温度采样多个候选合成以暴露韵律多样性,其输出直接进入奖励计算。接着用基频与能量变异系数差异、说话人相似度与可懂度词错率计算风格与可懂度奖励,为候选排序定标。最后以组相对偏好优化只更新前置可学习前缀并用于正式合成,实现不改主干的快速对齐。相对已有微调与直接推理的关键机制差异在于测试时换任务在线适配且每次适配后重置前缀,避免跨样本累积并以16KB前缀实现个性化。在5类非典型语音评测场景平均下,VoiceTTA的WER为3.12,低于F5-TTS的WER 3.19。该结论适用边界受限于短提示单样本适配与流匹配主干F5-TTS,跨主干与长时稳定性尚未验证;推理开销上原文仅披露硬件为NVIDIA RTX 6000 Ada GPU且每样本需50步GRPO与4候选采样。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1173. 函数链接展开的冗余才是瓶颈:用重加权零吸引在鲁棒非线性有源降噪中做在线特征选择
英文题目:A Sparsity-Aware Robust Nonlinear Active Noise Control for Impulsive Noise Environments
标签:#自适应滤波 #正则化 #鲁棒性 #主动降噪
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#主动降噪 | 主方法:#自适应滤波
👥 作者与机构
- Hengwei Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Hongqing Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Liming Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Lu Gan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道非线性主动噪声控制需由参考信号生成控制信号以抵消经主路径到达误差传声器的脉冲非线性噪声,难点在于扬声器饱和非线性与Alpha稳定脉冲野值同时破坏线性控制器与最小均方类更新的稳定性。该方法先以三角函数链将参考向量映射为高维特征并经估计次级路径滤波得到滤波特征以建模记忆非线性,滤波特征直接驱动后续鲁棒更新。接着以最小平均p幂准则抑制脉冲梯度爆炸并叠加输出功率约束防止饱和发散,得到基线MOV-FsLMP的稳定更新量。最后叠加对数和重加权零吸引正则,对小系数强收缩而对大系数弱偏置以在线剪除冗余基,与同等对待全部展开系数的基线不同,该机制把自适应能量集中到少数物理主导分量从而降低失调并抬高稳定步长上界。在临界大步长脉冲噪声评测设置下,所提方法的MSE为-6.5 dB至-3 dB,低于基线MOV-FsLMP的MSE -2 dB至0.5 dB。该结论适用边界受限于合成主次路径与单一脉冲强度α=1.6的验证,尚未验证真实声学路径、时变次级路径估计误差与高阶Volterra非线性的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1174. 对话里学声音:连贯对话提高命中也提高误报的反应偏向效应
标签:#心理声学实验 #统计分析 #言语感知 #语音 #说话人识别
评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#说话人识别 | 主方法:#心理声学实验
👥 作者与机构
- Tianze Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Volker Dellwo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
日常说话人识别需在对话中附带编码可变身份线索,而实验室多用孤立语句加刻意记忆,输入的语言可变性与输出的记忆负荷均与真实条件脱节,难点在于分离自然语境与注意指向的作用。研究先用真人参考音筛选目标与干扰说话人并以VibeVoice合成四人连贯对话及其打乱版本以控制语言内容,再将200名被试随机分入对话与打乱乘身份内容与无指向的三类焦点组接受约3分钟熟悉化,随后其内容回忆成绩用于质控并进入旧新语音再认与9点置信度评定以分离辨别力与反应偏向。与打乱材料相比,连贯对话并未提升辨别力而是使决策标准自由化,熟悉化刺激与真值交互显著。在旧新语音再认任务下,旧说话人试次中对话组相对打乱组的准确率指标优势比为1.53,高于新说话人试次中对话组相对打乱组的准确率指标优势比0.76。正确旧试次置信度被系统性放大而注意焦点主效应缺失,表明会话中身份编码相对自动化而无需明确指向身份。相对已有最小化变异与负荷的刻意记忆范式,该设计保留自然对话结构与附带学习,更能估计日常上限之外的真实加工过程,具有生态效度意义。该结论适用边界受限于短时熟悉后的即时再认,尚未验证跨天保持与高相似说话人泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1175. 不换求解器换算子:用声道形状直接算出稳态发声的物理信息神经算子
英文题目:Physics-Informed Neural Operator for Speech Production Analysis
标签:#自监督学习 #高效推理 #发声与构音 #语音 #语音合成
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#自监督学习
👥 作者与机构
- Kazuya Yokota:机构信息未能从会议 PDF 纯文本可靠映射
- Xinmeng Luan:机构信息未能从会议 PDF 纯文本可靠映射
- Debasish Ray Mohapatra:机构信息未能从会议 PDF 纯文本可靠映射
- Gary Scavone:机构信息未能从会议 PDF 纯文本可靠映射
- Sidney Fels:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理以声道截面形状函数为输入、同步输出声带振动位移、声门体积流与唇端声压的耦合正向仿真任务,难点在于有限元或龙格库塔加有限差分等传统求解器需逐步迭代,且经典物理信息神经网络换条件需重训。首先分支网络编码16点归一化声道截面积并直接输出该形状下的稳态基频,为时间导数缩放提供形状相关的频率条件。接着躯干网络编码归一化时空坐标并经傅里叶特征映射提供满足时间周期性的基函数,与分支特征内积得到位移与声压声速的初步表示。然后硬约束将体积速度在声门处钳制为声门流并保证流量为正,残差仅由双质量振动方程与一维声波方程及唇端辐射条件构成的物理损失训练,无需监督波形。相对逐步迭代的四阶龙格库塔加有限差分求解器与换形状重训的物理信息神经网络,该算子一次训练后可对多形状并行推理,实际意义在于将多形状稳态分析转为快速正向推理。在Arai五个元音稳态仿真任务下,PINO在/a/条件的振动频率指标为193.1 Hz,低于四阶龙格库塔加有限差分求解器的振动频率指标193.3 Hz。结论仅适用于已训练形状的稳态单周期重放,非稳态、辅音、三维声道与未见形状均未验证。训练约80小时而单元音平均推理约0.0389秒,硬件型号已披露但损失权重与学习率等配置缺失。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1176. 词频省时间、音节省口舌?单双音节德语整句产出中的加性预期与选择性交互
标签:#人类参与评测 #统计分析 #语音学与音系 #语音 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#人类参与评测
👥 作者与机构
- Ivan Yuen:机构信息未能从会议 PDF 纯文本可靠映射
- Bernd Möbius:机构信息未能从会议 PDF 纯文本可靠映射
- Bistra Andreeva:机构信息未能从会议 PDF 纯文本可靠映射
- Mitko Sabev:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理德语句子产出中词与音节两个嵌入层级的频率效应如何分离的问题,输入为图片预览与听觉问句诱发的完整句子产出,输出为句子起始反应时(response time,RT)与重读音节元音时长,难点在于真词中词频与音节频率天然共变且计划潜伏期与发音实现可能反映不同过程。方法链分为三步:先按词频高低与音节惊奇度(syllable surprisal)构造单音节与双音节德语真词刺激并匹配元音身份与句中句末位置,再经图片命名熟悉化后执行听觉问句诱发的句子生成任务采集录音,最后在 Praat 中标注词与元音边界并用线性混合效应模型检验加性或交互效应。与聚焦单层级或伪词操纵的已有工作不同,该设计在真词中同时变化两层变量并同步比较 RT 与声学时长。在单音节词条件下,高频词的音节惊奇度指标为17,高于低频词的音节惊奇度指标16。结论仅适用于受控图片诱发德语短句与少量高可描绘词汇,无法外推至自发连续语篇或大范围音节分布。该结论的适用边界受限于受控短句任务与小词表,尚未验证在自发语篇中的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1177. 普通话先验拉偏方言词:用跨度级偏好把最强的同音竞争者压下去
标签:#LoRA #偏好优化 #低资源 #语音 #语音识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#偏好优化
👥 作者与机构
- Tao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- haiyang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源方言语音识别需将四川话语音转写为简体中文字符,难点在于预训练模型被普通话先验主导,常把方言词替换为同音高频普通话词,形成普通话语义漂移(Mandarin Semantic Drift)。该工作先用基线解码训练集并对齐假设与参考以挖掘高频同音混淆,再经全序列动态匹配在字符层面定位方言词并映射回子词位置,接着在教师强制前向上传入整句并计算金标准跨度与最强混淆跨度的对数概率差,最后以交叉熵与跨度级无参考对比偏好优化混合目标进行两阶段适配。与已有似然微调的关键机制差异在于显式压低特定普通话竞争者而非仅抬高正确答案,从而直接翻转局部排序。在MagicData四川话语料4.53小时划分上,相对纯LoRA微调字符错误率从24.85%降至22.58%,方言实体F1值从72.82升至74.15。结论仅在单一方言小数据与非说话人无关划分下成立,未验证跨方言与跨说话人泛化。训练需在消费级GPU上做两阶段微调,推理不增加模块与重打分开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1178. 整体三区格局稳定、焦点后压缩随年龄变强:江淮官话焦点韵律的老化解读
英文题目:F0 realization of prosodic focus across adulthood in Jianghuai Mandarin
标签:#统计分析 #韵律 #社会语音学 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Xinxian Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaohu Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
江淮官话焦点韵律研究的输入是中性焦点与主语初始、状语中部、宾语尾部窄焦点问答句,输出是三关键成分的平均F0与F0展幅及其窄减中性差异,难点在于声学老化与方言声调变异可能掩盖焦点三区格局。先以5套十音节SAVO句框为输入,用4类问句诱发焦点并形成录制脚本输出,再以该脚本为输入,用头戴麦在隔音室录制三年龄组1200条语音形成声学语料输出,最后以该语料为输入,经ProsodyPro每音节取9点并转半音计算均值与展幅后送入线性混合效应模型检验格局与调节输出。在FF相对中性焦点语料任务下,宾语的平均F0显著性指标为p<.001,低于主语的平均F0显著性指标p>.05。相比仅验证青年人有无焦点后压缩的研究,本工作把三区格局保持与聚焦增强、后压缩微调幅度分离检验,揭示了稳定表征与敏感调节的分化。该结论的适用边界仅为受控朗读语料,自发对话与性别交互等外推范围尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1179. 从左到右并非最优:用掩码扩散揭示语音合成的解码顺序效应
英文题目:Decoding Order Matters in Autoregressive Speech Synthesis
标签:#自回归模型 #主观评测 #语音 #文本到语音
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#自回归模型
👥 作者与机构
- Minghui Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Anton Ragni:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到语音(Text-to-Speech,TTS)需由文本生成长度为 \(T\) 的声学序列,难点在于停顿和重音依赖全局文本、协同发音耦合双向局部上下文,固定从左到右可能误设条件依赖。第一步用确定性无参标量量化把Mel谱映射为离散索引,输出透明声学单元以隔离学习型编解码器偏置。第二步以掩码扩散模型按随机掩码比例 \(t\) 与置换 \(\\sigma\) 并行训练全位置条件分布,使同一解码器兼容任意顺序。第三步在推理时按指定置换逐帧单步解码,比较固定左右序与置信度自适应选位。与每种顺序训练一个因果自回归模型的传统做法相比,同一解码器支持推理时任意置换,从而把顺序选择从架构约束变为可优化变量。在LJSpeech上自适应top1的平均意见分(Mean Opinion Score,MOS)为3.91,超过从左到右(left-to-right,l2r)的3.78,次于声码参考的3.99;从右到左(right-to-left,r2l)为3.87,客观上在词错率(Word Error Rate,WER)、Mel倒谱失真(Mel-Cepstral Distortion,MCD)和UTMOSv2上优于l2r。在LJSpeech评测设置下,top1的MOS为3.91,高于l2r的MOS 3.78。该结论仅在单女声朗读语料、量化Mel加现成HiFi-GAN声码器路径下成立,未验证多说话人、噪声或长篇韵律外推,原文未披露训练优化器、网络规模与推理延迟成本。上述结论适用边界受限于单人朗读语料与量化Mel路径,尚未验证多说话人外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://minghuizhao39.github.io/sample-page-order/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1180. 测量点稀少时,用日常双耳声音补上数据库检索不到的个人线索
英文题目:SA-HRTF: A Sound-Assisted Approach to Personalized HRTF Modeling
标签:#检索增强 #少样本 #空间音频信号 #空间音频渲染
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#检索增强
👥 作者与机构
- Qingying Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Siyuan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- De Hu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
头相关传输函数个性化需从极少方向测量恢复全空间双耳幅度谱,高频受耳廓头与躯干散射影响呈强非线性,现有小库检索难以找到声学近邻,低频易预测而高频误差随频率快速增大。上分支用条件残差检索增强神经场以耳间时间差检索相似被试并生成初始估计,通过残差与调制融合多参考幅度与方向信息。下分支用声音引导模块从目标方向双耳声音频谱提取补充估计,经卷积编码与注意力校准捕获个体头耳声学线索。顶层融合模块学习频点权重向量做谱域加权并精炼输出,相对仅用位置信息的神经滤波与纯检索增强基线,引入日常双耳声音作为辅助信息,在稀疏测量下实现互补融合。在SONICOM测试集白噪声条件的设置下,测量方向数为5时SA-HRTF的LSD指标为2.53,低于测量方向数为3时SA-HRTF的LSD指标3.02。语音等窄带信号高频信息不足时需回退高频至检索分支输出,其适用边界受限于宽带辅助声音与准确定位假设,方位俯仰偏差下仅小幅退化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1181. 平均情感不够用:用交互式遗传算法把 A-V 坐标调到每个人听起来对的位置
标签:#偏好优化 #主观评测 #言语感知 #语音 #文本到语音
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#偏好优化
👥 作者与机构
- Wangzixi Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Bagus Tris Atmaja:机构信息未能从会议 PDF 纯文本可靠映射
- Sakriani Sakti:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理文本到语音(Text-to-Speech, TTS)中情绪表达与听者感知错位的问题,输入为文本与目标情绪类别,输出为携带个性化情感韵律的语音,难点在于情绪感知具主观性与文化依赖性而平均标注隐含通用映射假设。方法链分两部分推进:先以Grad-TTS为骨干并引入情绪控制器(Emotion Controller)将二维唤醒度-效价(Arousal-Valence, A-V)坐标映射为高维情绪特征再联合音高与能量预测器调节韵律,接着冻结声学模型并以交互式遗传算法(Interactive Genetic Algorithm, IGA)在A-V空间内生成候选语音群体,最后由听者多轮挑选偏好样本并经加权交叉与退火变异迭代重塑个人情绪空间。与依赖大规模偏好数据重训模型的强化学习人类反馈(Reinforcement Learning with Human Feedback, RLHF)范式不同,该设计将适配限制在低维控制空间并免除奖励模型与梯度更新。对照以美国数据平均A-V为基线的盲测显示个性化语音偏好率达到76%,情绪控制器亦将平均意见分(Mean Opinion Score, MOS)从3.37提升至3.75。结论目前仅在美式英语女声与中日印尼共30名听者及7类情绪上验证,跨语言与实时交互外推尚未证明。原文未披露推理延迟与部署成本。
🔗 开源资源
- 演示资源:https://37integer.github.io/Beyond-One-Size-Fits-All/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1182. 扰动把语音表示的局部邻域撑大了多少:用层级 LID 同时看几何变形与识别退化
标签:#统计分析 #对抗鲁棒性 #语音 #异常声音检测 #语音识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#异常声音检测 | 主方法:#统计分析
👥 作者与机构
- Sandra Arcos-Holzinger:机构信息未能从会议 PDF 纯文本可靠映射
- Sarah M. Erfani:机构信息未能从会议 PDF 纯文本可靠映射
- James Bailey:机构信息未能从会议 PDF 纯文本可靠映射
- Sanjeev Khudanpur:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自监督语音模型在良性噪声与对抗扰动下层表征局部几何如何变形及其能否预示识别退化,是需从输入映射到监测输出的难题。GRIDS先将干净与扰动语音独立送入相同模型得到逐层帧嵌入,再用k近邻距离估计逐层局部本征维度并经谐波均值聚合为层轨迹,接着以扰动与干净维度差关联词错率变化并用12维向量训练轻量分类器区分异常。前一步的帧嵌入直接作为后一步维度估计的输入,聚合后的层轨迹再进入关联与分类,实现几何度量到监测决策的传递。与依赖表征相似度或全局秩的方法不同,该方法刻画单样本邻域扩张率,能定位早期层持续膨胀而非整体偏移,为无转录本监测提供可解释依据。在LibriSpeech test-clean全配对918条评测设置下,WavLM在10 dB时PGD-MSE的ΔWER为0.83,高于PGD-CTC的ΔWER 0.46。结论仅适用于12层WavLM与wav2vec 2.0 BASE、无目标投影梯度下降攻击和全时重叠噪声,高信噪比与任务迁移下的可分性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1183. 一个门控同时管三件事:Whisper 何时该转写、何时该闭嘴
英文题目:A Gated Multi-Task Whisper Framework for Speech, Emotion, and Scene Understanding
标签:#多任务学习 #语音识别 #语音情感识别 #声学场景分类 #语音活动检测
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#多任务学习
👥 作者与机构
- Manjiri Bhat:机构信息未能从会议 PDF 纯文本可靠映射
- Ravindra B. Keskar:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为16 kHz复杂音频,输出需同时给出转写文本、8类语音情感识别(Speech Emotion Recognition, SER)标签和5类声学场景分类(Acoustic Scene Classification, ASC)标签,难点在于噪声下三任务相互干扰与Whisper在非语音段的严重幻觉导致资源浪费与响应迟滞。方法链分三步:共享Whisper-small.en编码器先将80维对数梅尔谱映射为1500×768隐表示并均值池化为分类嵌入;随后四头联合优化自动语音识别(Automatic Speech Recognition, ASR)解码器与语音活动检测(Voice Activity Detection, VAD)启发门控、SER、ASC分类器。推理时三分类门控先判清洁语音、非语音或含噪语音,再条件激活对应任务头以跳过无效解码从而抑制幻觉。与后处理VAD过滤不同,该门控作为可学习辅助任务参与训练并直接控制推理路由,具有上下文感知的实际意义。在ESAS-32K的70/10/20划分上门控模型ASR词错误率(Word Error Rate, WER)为23.315%,单任务Whisper-small为30.774%,幻觉率由98.58%降至0.015%;加无重复n-gram约束后WER进一步降至0.411%量级。该结论限于固定10 s合成英文及5类场景,未验证变长、多语和真实部署噪声。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1184. 去掉哪条共振峰最伤可懂度:声码器模拟下 F2 主导但频带数会改写排序
标签:#心理声学实验 #言语感知 #语音 #语音可懂度评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#心理声学实验
👥 作者与机构
- Ying Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Yuting Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Xuefei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究普通话句子在人工耳蜗模拟下仅靠前三个共振峰轨迹维持可懂度的能力,输入为普通话 Hearing in Noise Test男声句子,输出为逐词复述正确率,难点在于包络提取与频带粗化后难以分离各共振峰的语言学贡献。处理链分三步衔接:先用线性预测编码按16毫秒Hanning窗、50%重叠逐帧提取共振峰频率与幅度轨迹并合成为正弦波语音,再将该稀疏信号送入预加重、分带包络提取与噪声调制的噪声声码器,最后在宽带与3种声码器配置下组织10名母语听者完成16条件句子识别。与既有宽带正弦波研究相比,机制差异在于把缺失一个共振峰的对照嵌入可配置的植入处理,借此观察频谱与时间约束如何重塑感知权重。在宽带非声码器条件下,缺失F2条件的句子识别分数为31.4%,低于全保留F1F2F3条件的句子识别分数97.2%。高分辨率声码器保持该排序,降低包络截止频率使F1与F2差距缩小至不显著,减少频带数则发生翻转使F1权重超过F2。结论边界限于安静环境、普通话单男声与模拟听者,噪声掩蔽、非声调语言泛化及频率与强度线索分离尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1185. 高频词好用却不可信:用 156 个功能词重做与主题无关的说话人用词证据
标签:#统计分析 #模型评估 #语音 #说话人验证
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#统计分析
👥 作者与机构
- Michael Carne:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
法庭说话人比较需基于已知与 questioned语音转写判断是否同源,词选择特征易被谈话话题污染,导致似然比虚高。本文先用全部词一元组按频率筛选构建基线,再以人工定义的156词封闭功能词表做显式前置过滤以剔除话题词,接着比较频率、互信息、方差分析F值、卡方与方差阈值五种过滤式特征选择,最后经两层多项-狄利克雷模型与逻辑回归校准输出校准似然比。与隐式频率截断必然混入高频话题词不同,该方法以语言学先验约束特征空间,再用监督排序保留具说话人区分力的子集,尚未验证跨风格与跨人群时该先验是否仍然有效。在104名澳大利亚男性休闲电话对话共208篇转写的评测设置下,方差分析F值筛选的指标Cllr为0.78,低于全量功能词对照的指标Cllr为0.83。该结论仅限同种休闲电话风格内男性英语,未验证警局问询与电话指示等风格失配及性别年龄外推。原文未披露训练、推理或部署成本,未提供代码模型数据链接。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1186. 鼻式电子喉语音更难转清:为何梅尔谱守住鼻腔共振而自监督特征偏向颈式喉
标签:#医疗音频 #数据增强 #语音 #语音可懂度评估 #语音转换
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音转换 | 主方法:#数据增强
👥 作者与机构
- Qi-Yan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Ming-Chi Yen:机构信息未能从会议 PDF 纯文本可靠映射
- Fo-Rui Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hsin-Te Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Ching-Hung Lai:机构信息未能从会议 PDF 纯文本可靠映射
- Shu-Wei Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Ping-Cheng Yeh:机构信息未能从会议 PDF 纯文本可靠映射
- Jyh-Shing Roger Jang:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
- Hsin-Min Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
鼻腔电子喉语音转换任务输入为置于鼻腔入口激励、经鼻咽耦合的鼻腔电子喉语音,输出为可懂自然语音,实际难点在于其固定基频激励与机械噪声叠加中高频共振、低频衰减及元音共振峰抬升,使面向传统颈部电子喉优化的系统难以直接迁移。方法链先在45k句COSPRO自然语料上做文本到语音解码器预训练与语音编码器适配以学习语言与声学先验,再用F5-TTS由TWnews生成合成自然语音并经局部线性嵌入转换检索第6层WavLM-Large邻居重建梅尔频谱图得到合成鼻腔电子喉配对以扩充数据,随后用合成配对做语音转换预训练并用240句真实配对微调,最终由HiFi-GAN重建波形。其中合成数据生成解耦语义检索空间与频谱重建空间,用WavLM特征检索而用对应梅尔频谱图重建以保留鼻腔共振。与直接复用WavLM特征不同,该工作坚持梅尔频谱图建模以显式保留中高频共振线索,避免了在大规模自然语音上预训练的自监督特征对鼻腔特异谱 cues 的欠表征。在TMHINT 40句NEL到NL评测上,梅尔频谱图ETN-VC将字符错误率(Character Error Rate,CER)由72.0%降至63.0%、音节错误率(Syllable Error Rate,SER)由58.8%降至53.8%,并在30人A/B可懂度听辨中优于WavLM版本与无增强基线。结论仅限单健康发音人临床前仿真条件,未验证真实喉切除患者与病房噪声泛化,原文未披露训练与推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1187. 语音事实存在哪:先用语音因果追踪定位再跨音频与文本编辑
英文题目:Localizing and Editing Knowledge in Large Audio-Language Models
标签:#参数高效微调 #音频大模型 #可解释性 #语音 #音频问答
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#参数高效微调
👥 作者与机构
- Sung Kyun Chung:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaheng Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Qiuchi Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Jinuo Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Hong Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型(Large Audio-Language Models, LALMs)以连续语音提问并生成事实答案,但静态训练导致过时与幻觉事实难以局部修正。作者先用语音感知因果追踪(speech-aware causal tracing)对齐主体词时间戳并加噪破坏,再逐层恢复以定位音频编码器与语言主干中的事实存储层。该定位输出直接决定后续编辑目标层与词锚点,编辑阶段对比单层秩一更新、多层零空间约束更新与跨模态序贯编辑。与直接替换离散词符的文本定位不同,该方法针对连续声学帧施加帧级破坏并均值池化取词表示,从而兼顾时序分布与跨模态对齐。在500条语音化CounterFact子集上,音频单层编辑总体得分71.36,优于文本单层编辑64.10和音频微调61.50,跨模态单层编辑进一步达到77.60,功效95.20与泛化78.70最高,但特异性回落至64.72。单层一致优于多层,音频多层与跨模态多层特异性仅49.72与43.02。结论目前仅在Qwen2-Audio-7B-Instruct与Gemini 2.5 Flash合成英文事实问答上验证,未证明对多说话人、噪声、真实口音或大规模连续编辑的外推能力。原文未披露训练时长、推理与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1188. 跨语言朗读时间结构:用六个时长特征合成亨廷顿病语音指数
英文题目:A multilingual composite speech index to assess passage reading in Huntington’s disease
标签:#语音生物标志物 #信号处理 #多语言 #语音 #病理语音评估
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#信号处理
👥 作者与机构
- Valentina G. Constantin:机构信息未能从会议 PDF 纯文本可靠映射
- Vitoria S. Fahed:机构信息未能从会议 PDF 纯文本可靠映射
- Emer P. Doheny:机构信息未能从会议 PDF 纯文本可靠映射
- Ruth Filan:机构信息未能从会议 PDF 纯文本可靠映射
- Carla Collazo:机构信息未能从会议 PDF 纯文本可靠映射
- Joanna Krzysztofik:机构信息未能从会议 PDF 纯文本可靠映射
- Elliot Mann:机构信息未能从会议 PDF 纯文本可靠映射
- Philippa Morgan-Jones:机构信息未能从会议 PDF 纯文本可靠映射
- Laura Mills:机构信息未能从会议 PDF 纯文本可靠映射
- Cheney Drew:机构信息未能从会议 PDF 纯文本可靠映射
- Anne E. Rosser:机构信息未能从会议 PDF 纯文本可靠映射
- Rebecca Cousins:机构信息未能从会议 PDF 纯文本可靠映射
- Grzegorz Witkowski:机构信息未能从会议 PDF 纯文本可靠映射
- Esther Cubo:机构信息未能从会议 PDF 纯文本可靠映射
- Monica Busse:机构信息未能从会议 PDF 纯文本可靠映射
- Madeleine M. Lowery:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
亨廷顿病段落朗读需同时捕捉运动迟缓与高认知负荷下的停顿紊乱,而三国文本长度与韵律差异使原始时长特征无法直接合并。该研究以手机录制的朗读波形为输入,输出可跨语言比较的综合时间语音指数及其与统一亨廷顿病评定量表关联。处理链分三步衔接:先经带通滤波与Teager-Kaiser能量算子包络提取语音能量,再以Otsu滑动窗口自适应阈值检测浊音能量bursts并计算10种时间特征,最后仅保留三国均显著的6个特征做语言内对照标准化并反转方向后平均。与既往单语声学分析或排除朗读特征的多语融合不同,该方法不训练预测器而以对照分布对齐消除语言主效应。在三国三语段落朗读任务下,综合时间语音指数与符号数字模式测验的Pearson相关为r=-0.77,低于其与 Stroop词语阅读测试的Pearson相关r=-0.70。该指数在纵向进展、早驱分层或不同录音设备上的外推性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1189. 只听辅音不够:Warlpiri 五处塞音分类为何需要元音中点的变体信息
英文题目:Vowel Allophony Improves Maximum-Likelihood Classification of Warlpiri Consonants
标签:#统计分析 #语音学与音系 #言语感知 #语音 #音频分类
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#统计分析
👥 作者与机构
- Coralie Cram:机构信息未能从会议 PDF 纯文本可靠映射
- John McGahay:机构信息未能从会议 PDF 纯文本可靠映射
- Megha Sundara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
Warlpiri语有/p/、/t/、/ɻ/、/c/、/k/五个塞音调音部位,输入为元音间VCV序列中切分的CV与VC段声学线索,输出为辅音调音部位与相邻元音类别,难点是爆破谱形高度重叠且传统第二共振峰过渡不足以稳定区分拥挤的调音连续体。方法链第一步用Praat提取爆破谱矩与时长等辅音内在线索并估计边界共振峰,为后续建模提供基线特征表示。第二步在相邻元音上构造百分之二十五区间共振峰过渡与元音中点共振峰两类外在线索,其输出直接拼接到内在线索之后形成扩展特征向量。第三步以多元高斯建模的最大似然分类器进行分层交叉验证与置换检验,输出最优分类决策以量化各类线索组合的贡献。在CV序列辅音分类任务下,SM模型的宏平均F分数为0.702,高于S模型的宏平均F分数0.654。相对仅用内在线索与仅加过渡的已有方法,关键机制差异是引入元音中点体现的元音变体信息,其实际意义是在不损害元音分类的同时显著提升辅音部位可分性。该结论适用边界受限于半自发Warlpiri成年女性语音与离线最优分类器,跨库存泛化与人类听辨行为尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1190. 滑还是不滑:意大利语与罗马尼亚语中双元音与裂音的声学渐变
标签:#统计分析 #语音学与音系 #多语言 #语音 #语音属性识别
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Johanna Cronenberg:机构信息未能从会议 PDF 纯文本可靠映射
- Lori Lamel:机构信息未能从会议 PDF 纯文本可靠映射
- Ioana Chitoran:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为意大利语和罗马尼亚语广播新闻与访谈中经强制对齐切分的/ia/序列,输出其语速归一化对数时长与时归一化共振峰动态,难点在于双元音与裂口在连续语流中呈渐变重叠并受重音与词内位置调制。方法链分四步:先基于LIMSI识别器与对齐器筛选目标词并标注第二元音重读与词首词中属性,输出带条件标签的token集进入声学估计。接着用wrassp提取F1与F2并经Bark变换与去均值归一化及B样条时归一化与平滑,输出可比轨迹进入统计建模。然后以线性混合效应回归分析对数归一化时长并以函数型主成分分析分解共振峰轨迹,再用条件均值重构平均F1与F2轨迹。与实验室小样本工作相比,关键差异在于大语料自然变体下分离时长与谱动态并检验语言与重音与位置交互,具有跨语言推广意义。在意大利语广播语料条件下,词中位置重读与非重读间对数归一化时长指标差值为0.56个单位,高于词首位置重读与非重读间对数归一化时长指标差值0.37个单位。该结论适用边界在于仅覆盖/ia/组合且尚未验证感知区分与语素边界等因素,外推至其他元音与语体受限。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1191. 系统平均分好看不等于每位说话人都好:编解码失配与检材时长如何共同拖累取证说话人识别
标签:#评测协议 #公平性 #鲁棒性 #语音 #说话人验证
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#说话人验证 | 主方法:#评测协议
👥 作者与机构
- Guangmou Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Bruce Xiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Vincent Hughes:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
法医语音比较(Forensic Voice Comparison,FVC)需比较未知 questioned sample(QS)与已知 known sample(KS)并输出似然比(Likelihood Ratio,LR),难点在于信道编解码失真与QS时长不足叠加且个体差异显著。方法链分四步:先以香港粤语高清录音为基准并仅对QS施加三种代表性有损编解码退化;再经对数梅尔滤波器组(Log-Mel Filterbank,Fbank)提取与残差网络(ResNet34-MHA)抽取说话人嵌入(Speaker Embedding);接着经线性判别分析(Linear Discriminant Analysis,LDA)降维与概率线性判别分析(Probabilistic Linear Discriminant Analysis,PLDA)计分;最后经双高斯校准(Bi-Gaussianized Calibration)映射为可解释LR。与既往孤立考察单一编解码或时长的工作不同,本研究并行比较多代编解码并引入按说话人似然比代价(By-speaker Cllr,Cspkllr)追踪个体稳定性。在香港粤语跨会话测试条件下,最差失配5s QS系统的Cllr指标为0.3以下,低于信息性似然比门限条件的Cllr指标1。结论仅适用于青年男性粤语、实验室近讲与单次编解码退化,真实多跳级联与多样人群尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1192. 用可控振荡建模急促韵律:OscillaTTS 如何改写扩散 TTS 解码器的激活函数
英文题目:Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS
标签:#扩散模型 #韵律 #语音 #文本到语音
评分:5.5/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#扩散模型
👥 作者与机构
- Sandipan Dhar:机构信息未能从会议 PDF 纯文本可靠映射
- Nirmesh J. Shah:机构信息未能从会议 PDF 纯文本可靠映射
- Ashishkumar P. Gudmalwar:机构信息未能从会议 PDF 纯文本可靠映射
- Pankaj Wasnik:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是由音素文本生成 Mel 频谱进而合成波形,难点是表现力语音中音高能量突变与浊清边界处的锐利韵律转折难以用固定周期非线性刻画。方法链分三步:先由声学文本编码器与 PLBert 韵律文本编码器经可迁移单调对齐器(Transferable Monotonic Aligner,TMA)得到语言对齐表征,再由声学与韵律风格编码器及 JDC 音高提取器提供风格与基频能量条件,最后将所提 Oscilla 激活嵌入基于 iSTFT-Net 的解码器重构 Mel 频谱并经两阶段联合训练优化。与 Snake 的固定幅度振荡不同,Oscilla 定义为 \(x \+ \\tanh&\#40;\\alpha \\sin^2&\#40;x&\#41;&\#41;\),以可学习参数 \(\\alpha\) 调制周期项并保留线性旁路,因而在大振荡处饱和抑制、小振荡处放行渐变。在 LJSpeech 上主观 MUSHRA 由 StyleTTS2 的 81.48 提升至 86.67,Mel 倒谱失真(Mel Cepstral Distortion,MCD)由 6.64 降至 6.59,基频均方根误差(F0-RMSE)由 0.41 降至 0.35。结论仅在单说话人英语与 ESD 英文子集的愤怒、高兴、悲伤 3 种情绪上验证,未验证多说话人、跨语言或歌唱等更强外推场景。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1193. 单音可接受的变体,为何放进双元音就被拒:毛利语可接受发音区间的三源三角验证
标签:#教育 #主观评测 #语音学与音系 #言语感知 #语音质量评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音质量评估 | 主方法:#主观评测
👥 作者与机构
- Zoe E Evans:机构信息未能从会议 PDF 纯文本可靠映射
- C. I. Watson:机构信息未能从会议 PDF 纯文本可靠映射
- Peter J Keegan:机构信息未能从会议 PDF 纯文本可靠映射
- Jesin James:机构信息未能从会议 PDF 纯文本可靠映射
- Piata Allen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文界定te reo Māori学习者发音的可接受范围,输入为大学毛利语课程学生pepeha朗读录音与固定文本,输出为单元音/0/、/5/与双元音/50/、/5i/、/5e/在流利者判断下的可接受边界与教学含义,难点在于变异跨说话人与代际且典范目标存争议。方法链分三步:先由慕尼黑自动切分系统做正字词、音位词与音素三层强制对齐并由语音学家校正边界与感知标签,其对齐与标签结果进入流利者评价;再由约10名流利者按音节做接受或拒绝二值评价,其接受率进入声学验证;最后在自研FRED平台提取F0与11点F1/F2轨迹并做统计检验以验证感知判断。与把双元音视为单元音序列的传统教学观不同,本文把双元音视为具有整体目标与独立容忍边界的单位音位,实际意义在于发音评估须按双元音环境分别设定容忍度。在pepeha朗读语料评测设置下,后化
\[u\]变体的F2指标为1073 Hz,低于典范
\[0\]的F2 1746 Hz。该结论的适用边界仍受限于朗读体短文本条件。结论目前仅适用于朗读体短文本中的2个单元音与3个双元音,不能外推至自发语、韵律层面或其余辅元音。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1194. 混响把嗓音质量测偏了:盲去混响能否把排序拉回来
标签:#扩散模型 #无监督学习 #语音 #去混响 #语音质量评估
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音质量评估 | 主方法:#扩散模型
👥 作者与机构
- Sven Franz:机构信息未能从会议 PDF 纯文本可靠映射
- Tanja Grewe:机构信息未能从会议 PDF 纯文本可靠映射
- Bernd T. Meyer:机构信息未能从会议 PDF 纯文本可靠映射
- Jörg Bitzer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床嗓音评估依赖平滑倒谱峰突出度(Smoothed Cepstral Peak Prominence,CPPS),但混响会系统性压低该指标并打乱嗓音优劣排序,限制其跨房间可比性。本文构建原始录音到伪无回声参考再到受控加混响再到二次去混响的方法链:先用盲无监督扩散模型去除原始房间影响以获得伪无回声参考,其输出经三十五个实测治疗室脉冲响应卷积以模拟可控退化,最后再次去混响并在各阶段对浊音段提取CPPS进行配对非参数检验。与需估计房间脉冲响应或配对干净数据的加权预测误差(Weighted Prediction Error,WPE)和监督神经方法不同,该链路无需测量脉冲响应或干净参考,可直接用于常规临床录音。在SVDB与ReST双库对照评测条件下,连续语音指标容限δ1在SVDB为0.465 dB,高于ReST的指标容限δ1 0.292 dB。在连续语音任务条件下二次去混响显著收缩卷积引入的CPPS离散度并恢复排名一致性,多数房间均观察到改善,而持续元音在水平恢复与排序恢复上均未达标。该结论主要适用于连续语音,对持续元音基本不成立,且仅在德语双库与所用治疗室混响范围内验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1195. 几何对齐了,映射却没有:咽腔锚定的跨说话人 EMA 归一化为何止步于一维
英文题目:Acoustic Pharyngometry as an Auditable Anchor for Cross-Speaker EMA Normalization
标签:#信号处理 #发声与构音 #语音 #说话人识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人识别 | 主方法:#信号处理
👥 作者与机构
- Daniel Friedrichs:机构信息未能从会议 PDF 纯文本可靠映射
- Valeriia Vyshnevetska:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨说话人电磁发音仪(Electromagnetic Articulography,EMA)比较的输入是头动校正后的腭参考中矢状面舌体轨迹,输出是可比几何坐标与共振峰预测,难点在于声道形态与发音策略纠缠且EMA坐标与解剖对应间接。本文方法链分三步:先由腭描迹包络估计腭长代理并做均匀缩放至规范长度,再从声学咽测量(Acoustic Pharyngometry,AP)面积函数提取口腔扩张峰相对口咽交界(Oral-Pharyngeal Junction,OPJ)的无量纲比例,最后以该比例为内部节点做分段单调前后向(Anterior-Posterior,A-P)重映射。与全局相似变换或薄板样条(Thin-Plate Spline,TPS)非刚性配准不同,该文只允许单个可质检锚点驱动的一维warp,刻意牺牲自由度换取可解释性。在14名德语被试DDK语料评测任务下,缩放加warp的多传感器舌轨迹离散指标为26.13 mm,低于仅缩放的离散指标26.36 mm,且两者均低于基线的离散指标31.28 mm,而留一说话人岭回归预测F1与F2并未改善且F1损失大于F2。该结论仅适用于受控DDK与持续元音的线性映射,未验证连续语音、二维warp或咽部形态更复杂人群的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1196. 是换了语言更有魅力,还是换了人:双语政治演讲中说话人与语言的方差之争
英文题目:Speaker or Language? Explaining Variance in Charismatic Prosody Across Luxembourgish and French
标签:#统计分析 #韵律 #多语言 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Nina Hosseini-Kivanani:机构信息未能从会议 PDF 纯文本可靠映射
- Nafiseh Taghva:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Gilles:机构信息未能从会议 PDF 纯文本可靠映射
- Oliver Niebuhr:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为10名卢森堡双语政客在公共演讲等场景中每人卢森堡语与法语各20句共400句自发话语,输出为说话人与语言对魅力韵律方差的相对解释量及差异方向,难点在于自然语境下内容与语用功能难以跨语言对齐。方法链分三步:先筛选高度可比的自发语句并经LuxASR转写与WebMAUS对齐及人工校对,再用ProsodyPro提取基频、强度与音质等41个声学韵律特征,最后经主成分分析可视化并以线性混合效应模型分离说话人随机截距与语言固定效应。与既有单语魅力研究相比,关键机制差异在于将语言声望与身份功能作为系统性嗓音设置检验,而非仅比较整体韵律强度,因而能区分个人特质与语言选择效应。在400句双语政治演讲语料的检验条件下,第一主成分的方差解释率指标为31.4%,高于第二主成分的方差解释率指标16.8%。该结论仅适用于政治公共演讲且未经感知实验验证,无法外推至日常对话或其他人群。跨人群与日常对话场景的适用边界尚未验证且受限于单一政治语料与声学分析。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1197. 子带倒谱能定位说话人信息吗:日语/saN/三个音段的取证比对
英文题目:Sub-band Cepstral Analysis of Speaker-Specific Information: A Case Study of Japanese Word /saN/
标签:#信号处理 #语音学与音系 #语音 #说话人验证
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#说话人验证 | 主方法:#信号处理
👥 作者与机构
- Shunichi Ishihara:机构信息未能从会议 PDF 纯文本可靠映射
- Frantz Clermont:机构信息未能从会议 PDF 纯文本可靠映射
- Can Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
法庭语音比对需要判断两段语音是否来自同一说话人,并以似然比(Likelihood Ratio,LR)量化证据强度,其输入为跨时段采集的已知与未知语音对、输出为经校准的似然比,实际难点在于说话人信息在频谱上分布不均且随音段变化而难以精确定位。本研究以日语词/saN/中擦音/s/、元音/a/和鼻音/N/为对象,先提取全频带线性频率倒谱系数(Linear-Frequency Cepstral Coefficients,LFCC),再经线性变换得到各窄子带限带倒谱系数(Band-Limited Cepstral Coefficients,BLCC),随后分音段估计多变量核密度似然比并经逻辑回归校准。相对传统滤波器组子带方法,该机制无需重分析原始信号即可灵活生成任意频率区间表示,便于细粒度取证解释。在306名成年男性跨时段录音上,全频带条件下/a/的Cllr为0.38766,优于/N/的0.43473和/s/的0.68110,4个优选子带融合后性能接近全频带。结论限于男性、引用式单一词汇与宽带条件,未验证电话信道、女性与连续语音外推能力。原文未披露训练、推理或部署成本,仅说明生成式AI仅用于文字润色。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1198. 认知衰退混杂下抑郁声音何以辨认:以共时临床评估锁定共振峰
标签:#语音生物标志物 #数据集 #统计分析 #语音 #病理语音评估
评分:5.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Woori Jeon:机构信息未能从会议 PDF 纯文本可靠映射
- Seunghee Ha:机构信息未能从会议 PDF 纯文本可靠映射
- Sang-Kyu Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Ji Hye Yoon:机构信息未能从会议 PDF 纯文本可靠映射
- Tae-Jin Yoon:机构信息未能从会议 PDF 纯文本可靠映射
- Seung Jin Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Woojae Han:机构信息未能从会议 PDF 纯文本可靠映射
- Jungmin So:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为韩国轻度认知障碍老年人三年纵向朗读语音及并发抑郁与认知量表分数,输出为抑郁二分类标签与抑郁特异声学证据,难点在于抑郁与认知衰退均压缩基频范围与发音动态而易使分类器学到认知模式。方法链分三步:第一步将88维扩展声学集按功能划为7组并提取每组第一主成分以代表整体模式,压缩组内冗余供后续统计检验。第二步将各组主成分分别送入纵向混合模型与控制简易精神状态检查量表等的偏相关进行双重检验,筛选出控制认知后仍与抑郁显著关联的共振峰组。第三步仅用该显著组内原始特征训练径向基支持向量机完成分类,使统计筛选结果直接决定分类器输入空间。与直接分类或年轻人群基线不同,该流程把并发临床评估作为特征选择的因果过滤器而非事后协变量。留一被试交叉验证下共振峰第一与第二共振峰组合以12个特征达到非加权平均召回率0.760,超越88维基线与最优自监督模型。结论限于韩国老年人朗读任务与小样本单中心队列,女性特异性差且未验证自发语音与跨语言泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1199. 口吃者听辨并不差,只是建类与取用方式不同:一次放大的软腭音 VOT 实验
标签:#心理声学实验 #言语障碍 #言语感知 #语音 #音频分类
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- Yusuke Kiyama:机构信息未能从会议 PDF 纯文本可靠映射
- Xiyu Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究考察普通话口吃者能否将连续嗓音起始时间映射为送气与不送气音位范畴,输入为合成软腭塞音非词连续体,输出为辨认标签、区分判断与反应时,难点在于无词汇线索时边界附近细微差异易被掩盖。方法链分三步:先以20名不参试母语者做预实验经probit分析定位约3.69步边界并换算到31级量尺z=9.07,其输出决定刺激截取范围;再截取其周围z5至z14共10个token构成放大镜式刺激集以提高边界灵敏度;最后对22名口吃者与18名流畅对照施测字母决策基线、辨认与区分任务并以边界对齐混合效应模型分析范畴内外反应时与敏感性d’。与既有真词粗步长研究不同,该设计在无外部噪声下同时隔离词汇影响并加密边界采样,因而更易暴露细微映射差异。在辨认任务条件下,PWS组的边界位置指标为8.64,高于PWNS组的边界位置指标7.43。辨认反应时仅对照组呈现跨范畴慢于范畴内的典型不对称而口吃组不显著,严重度越高区分范畴内反应越快而逆效能分数未下降。结论仅适用于北方官话区成人软腭非词安静听音条件,未验证齿龈与双唇、噪声、语调元音及神经机制外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1200. 噪声转写打歪语义时,用冻结教师把学生拉回干净流形
标签:#对比学习 #知识蒸馏 #生成对抗网络 #鲁棒性 #口语意图与槽位识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#口语意图与槽位识别 | 主方法:#知识蒸馏
👥 作者与机构
- Ankit Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Munir Georges:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
噪声口语理解的输入是含替换插入删除错误的自动语音识别转写文本,输出为意图标签,难点在于训练用干净文本与测试用噪声文本存在分布失配且语义嵌入的类可分性下降。本文先在干净转写上训练由编码器解码器生成器与分类判别器组成的教师模型以定义干净语义流形,冻结后为学生学习提供表示与决策参照。接着学生生成器对噪声嵌入做输出层与瓶颈层的多层次潜在对齐去噪,并以合成生成器产生的难负样本提供对抗监督,使去噪输出逼近教师干净嵌入。然后双判别器协同蒸馏对齐中间瓶颈特征与类别逻辑分布,再叠加三元组几何约束增强类内紧致与类间分离,联合优化语言编码器。与仅做对抗特征匹配的GAN-BERT相比,该机制同时传递表示层去噪方向与决策层类别关系,而非只做表层一致性。在SLURP噪声意图分类任务下,ML-KD-DRI-GAN的准确率为86.99%,高于GAN-BERT的准确率82.50%。结论目前仅限于英语短指令、两种自动语音识别假设与意图分类任务,未验证槽位填充、跨语言与真实部署噪声。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1201. 频率带重要性如何左右语音质量网络与人耳:低频依赖与负向敏感的对照
标签:#主观评测 #模型比较 #可解释性 #语音 #语音质量评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音质量评估 | 主方法:#主观评测
👥 作者与机构
- Ada Lamba:机构信息未能从会议 PDF 纯文本可靠映射
- Donald S. Williamson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音质量评估以预测平均意见分逼近人类感知为目标,输入为含噪与增强语音的频谱特征,输出为 utterance 级质量分,难点在于深度模型在未见数据上常与人类判断失配且根因不明。本文先用沙普利加性解释计算各50Hz频带的局部贡献并聚合为全局平均趋势,再用部分依赖图刻画平均幅度与预测的全局响应关系以上一步趋势进入对比,然后用单频带幅度缩放扰动验证预测变化方向是否一致。听音实验将原始与扰动语音配对呈现,收集质量打分、偏好选择与噪声量等四因素归因,从而对照人与模型的敏感频带。与已有单模型单方法解释相比,该链条同时覆盖局部归因、全局平均与扰动验证,并引入200人人类对照,具有实际对照意义。在IUCOSINE测试集扰动评测下,SCOREQ的Pearson相关系数为.998,高于DNSMOS的Pearson相关系数.951。结论仅适用于卷积与 wav2vec 2.0 类质量模型在窄带幅度扰动下的行为,未验证混响、编解码与真实增强失真等外推场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1202. 轨迹比端点更诚实:八次治疗里声音如何分叉
英文题目:Analyzing Longitudinal Vocal Changes During Cognitive Behavioral Therapy for Hikikomori Patients
标签:#语音生物标志物 #模型融合 #RNN #语音 #病理语音评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#RNN
👥 作者与机构
- Samara S. Leal:机构信息未能从会议 PDF 纯文本可靠映射
- Stavros Ntalampiras:机构信息未能从会议 PDF 纯文本可靠映射
- Antonio Trabacca:机构信息未能从会议 PDF 纯文本可靠映射
- Marcella Bellani:机构信息未能从会议 PDF 纯文本可靠映射
- Roberto Sassi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为蛰居症患者8次网络认知行为治疗会话语音,输出为改善或恶化二分类,难点在于个体基线差异大且临床量表仅有治疗前后两点、青少年与青年成人量表不可比。方法链先做信号清洗与说话人分离得到患者纯语音并切分为5秒薄片,再将薄片级声学特征聚合为会话级序列并相对首会话做基线归零以隔离个体内变化。接着基于斜率与早期被试间变异筛选稳定梅尔频率倒谱系数,最后用多层感知机建模筛选系数加基频描述符、用门控循环单元建模Wav2vec 2.0嵌入并融合为患者级概率。与仅比较治疗前后差值或静态抑郁检测不同,该工作利用整段轨迹形状建模疗效演化,因而更能捕捉中期分化与互补表示信息。在青少年亚组留一被试验证协议下,融合表示AR4的F1pos指标为0.62,高于仅wav2vec2表示AR3的F1pos指标为0.30。该结论仅适用于小样本单中心远程治疗场景,无法外推到中间症状连续监测或跨站点泛化。其适用边界受限于小样本单中心数据,尚未验证跨站点与连续监测外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1203. 不用再训练检测器:用跨模型归因约束多模态大模型说出伪造在哪
标签:#数据集 #多模态学习 #可解释性 #语音伪造检测
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音伪造检测 | 主方法:#多模态学习
👥 作者与机构
- Yupei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Qiyang Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoliang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Berrak Sisman:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音伪造检测(Speech Deepfake Detection,SDD)输入为连续语音波形,输出不仅是真伪二分类,还需给出异常时频位置与自然语言理据,难点在于伪造痕迹细微、缺乏接地解释数据且音频大语言模型(Large Language Model,LLM)易幻觉。第一步复用wav2vec 2.0、HuBERT、WavLM三个冻结预训练检测器,对频谱图计算积分梯度(Integrated Gradients,IG)、局部可解释模型不可知解释(Local Interpretable Model-agnostic Explanations,LIME)与显著图(Saliency),得到像素级归因图。第二步将归因图送入视觉语言模型Qwen2.5-VL-7B提炼为时间范围与频率范围区间,同时用openSMILE eGeMAPSv02特征训练的4层多层感知机(Multilayer Perceptron,MLP)经SHAP选出前3重要声学特征,二者打包为可核查证据。第三步由Qwen3-Omni-30B综合原始音频与该证据包,生成包含音频异常、自由文本解释、XAI聚合的三段式结构化解释。与纯音频提示基线相比,差异在于把跨模型归因作为可核查支撑信号并要求模型批判性使用而非复述。在PartialSpoof开发子集上,单模型全XAI配置内部准确率(Inside Accuracy,IA)为0.492,较纯音频基线0.049提升44.3个百分点,单模型LIME的IA达0.811。结论仅适用于被4个模型同时正确分类的伪造片段,真实语音仅做定性试探,跨数据集泛化、延迟成本未验证。跨攻击类型与跨数据集的外推适用边界尚未验证。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1204. 把一句话拆成四条流:多尺度残差如何让低码率编解码器分开内容、音色与韵律
标签:#向量量化 #语音编码 #文本到语音 #语音转换
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#向量量化
👥 作者与机构
- Jingyu Li:机构信息未能从会议 PDF 纯文本可靠映射
- Guangyan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen Ye:机构信息未能从会议 PDF 纯文本可靠映射
- Yiwen Guo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作解决低码率下高保真重建与可控语音生成难以兼得的问题,输入为16 kHz语音提取的80维梅尔频谱图(Mel-spectrogram,窗长25 ms、帧移10 ms),输出为可重建波形的离散多流令牌与最终波形,难点在于高压缩率会丢失音色与细节,而显式解耦又依赖不稳定的对抗训练。编码链以冻结的HuBERT语义特征与冻结的CAM++说话人嵌入(Speaker embedding)经交叉注意力融合为12.5 Hz基底,再对编码器残差在12.5 Hz做单码本韵律量化并以基频F0与频谱能量显式监督,随后在25 Hz量化细粒度残差补全纹理,最终由级联解码器重建100 Hz级梅尔谱并经预训练Fre-GAN声码器(Vocoder)合成波形。相比依赖对抗剔除泄漏的因子化编解码器,该设计以残差减法隐式分工实现稳定解耦。在Librispeech测试集重建评测下,MSR-Codec-612的STOI为0.90,高于WavTokenizer的STOI 0.89。在Seed-TTS英文测试集零样本合成评测下,MSR-Codec-524的词错率WER为3.07,低于FireRedTTS的词错率WER 3.82。噪声混响与跨语言外推的适用边界尚未验证。该结论限于英文朗读类数据与客观指标,未覆盖噪声混响、跨语言与主观听感外推,训练优化器、学习率与硬件成本原文未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1205. 不靠人工标注也能定出可信的韵律边界:用长停顿锚点加弱监督推出连续强度
英文题目:High-Precision Prosodic Boundary Anchors from Acoustic Cues under Weak Supervision
标签:#弱监督学习 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#弱监督学习
👥 作者与机构
- Hanyu Liao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoluan Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务以词间交界声学证据为输入,输出连续韵律边界强度,难点在于无人工标注时可靠负例难以定义且边界线索多义。首先从停顿入手筛选长停顿候选构成保守池,其输出交由音高重置与能量变化做分位数精炼,形成宽严两档锚点。随后以宽松锚点为正例、其余可靠基频交界为未标记集训练非负正未标记模型,将稀疏锚点传播为全集强度分。与直接拟合ToBI标签或启发式阈值判定不同,该链条只信任高精度声学正例而不伪造负例,并以可解释分层控制精度与覆盖权衡。精炼阶段先以浊音帧比例构造可发声门控以剔除不可靠基频交界,再在保守池内按数据分位数确定音高与能量阈值,使阈值随语料自适应。在日语朗读语料盲听审计任务下,高置信锚点集的断裂率指标为0.467,高于低分组的断裂率指标0.033。该结论限于日语朗读与自动词对齐条件,未验证自发语音、跨语言与专家标注一致性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1206. 只用基频做声调识别:主分支推理、辅助分支只在训练时帮忙
标签:#Transformer #高效推理 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#Transformer
👥 作者与机构
- Yi-Fen Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiang-Li Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Po-Yu Chiu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
普通话声调识别输入为连续语音按10 ms提取、经说话人归一化的基频 Fundamental Frequency / F0序列与强制对齐得到的音节边界,输出为每音节五类声调标签,难点在于连读变调、轻声弱化与清音段缺测导致典型轮廓形变。第一步做轮廓嵌入,将对数归一化F0线性投影后与音节 Syllable / Syl、词 Word / Wrd、语块 Chunk / Chk三级交替嵌入 Alternating Embedding相加,输出叠加位置编码的轮廓输入进入编码器。第二步做双路上下文编码,核心轮廓编码器 Contour Network / C-Net经音高层与音节层Transformer学习上下文相关轮廓表示,节奏编码器 Rhythm Network / R-Net对多区间时长统计建模节奏上下文,两路输出分别进入训练分支。第三步做梯度引导训练与精简推理,训练期核心多层表示经层特异注意力池化 Layer-specific Attention Pooling / LSAP聚合后作为辅助分支交叉注意力的键值,以三分支交叉熵等权和反传约束核心参数,推理期丢弃辅助分支,仅保留核心分支与两层多层感知机 Multilayer Perceptron / MLP分类器输出标签。与推理时仍保留融合结构的单分支TNet-Full不同,该设计把自注意力表示学习与交叉注意力梯度引导解耦。在FCU-VOICE-360同一80%、10%、10%划分下,音节词二级输入的v2-m3取得97.2%音节准确率,超过同粒度TNet-Full基线的97.0%,但轻声T5的F1值由0.971降为0.966。该结论仅在受控母语朗读上成立,对自发对话、二语口音、噪声与基频跟踪失效的外推尚未验证。原文未披露优化器、学习率、批量大小与训练推理硬件成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1207. 平淡语调才见分晓:主观认知下降削弱高层语音追踪而非听觉包络
标签:#统计分析 #韵律 #言语感知 #脑信号 #言语神经解码
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#言语神经解码 | 主方法:#统计分析
👥 作者与机构
- Matthew King-Hang Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Yun Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Cloris Pui-Hang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Manson Cheuk-Man Fong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
主观认知下降(subjective cognitive decline,SCD)指客观测验正常但自诉认知变差的老年状态,输入为自然连续粤语语音与同步脑电(electroencephalography,EEG),输出为不同表征层级的皮层追踪强度(cortical tracking strength,CTS)及其随SCD严重度与表达风格的变化,难点在于分离感觉与语言加工并排除听力与情绪混淆。方法链分三步:先构建四种表达风格的聆听材料并采集主观效价与脑电,再提取声学包络与亚音节切分及音位配列概率三类特征,最后用多变量时间响应函数(multivariate temporal response function,mTRF)做跨刺激预测并以线性混合模型检验调节效应。与既往只看包络或单层语言特征的工作相比,该文同时建模切分与统计预测并操纵韵律丰富度,使语言补偿失效的情境特异性得以显现。在四种表达风格语料条件下,对话风格的效价得分为3.61,高于乱序风格的效价得分2.00。结论仅适用于安静聆听下的粤语亚音节追踪,未验证词句层面、噪声场景与纵向转化预测。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1208. 出声、默动与想象说话是否共享可迁移的神经表征
英文题目:Relating the Neural Representations of Vocalized, Mimed, and Imagined Speech
标签:#信号处理 #模型比较 #脑信号 #语音 #言语神经解码
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#言语神经解码 | 主方法:#信号处理
👥 作者与机构
- Maryam Maghsoudi:机构信息未能从会议 PDF 纯文本可靠映射
- Rupesh Chillale:机构信息未能从会议 PDF 纯文本可靠映射
- Shihab A Shamma:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究从立体定向脑电图(stereotactic EEG,sEEG)解码发声(vocalized)、默剧式空动(mimed)与想象(imagined)三种言语模式声谱图的任务,难点在于后两种模式无声学输出且缺乏外部时间对齐线索。方法链条分为三环:先以带时滞的岭回归线性解码器从神经响应重建听觉皮层模型频谱,再将各条件训练的解码器交叉施加到其余条件以检验表征共享,最后用包络相关与排序辨别力评估重建保真度与刺激特异性。与已有分条件独立解码不同,本文把跨条件泛化本身作为表征相似性的探针,并以线性与卷积循环非线性模型对照可解释性差异。在公开汉语 VocalMind 数据集上,发声训练线性解码器在发声测试上的语句排序辨别力高出随机基线 0.32,非线性模型对应值达 0.59,所有跨条件包络相关均显著高于零模型。结论限于单被试侵入式记录与离线重建评估,未验证在线脑机接口(brain-computer interface,BCI)或跨被试跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1209. 从一对一对齐到多对多包含:ProLAP 用概率分布学音频语义层级
标签:#数据集 #对比学习 #多模态学习 #预训练 #音频检索
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频检索 | 主方法:#对比学习
👥 作者与机构
- Toranosuke Manabe:机构信息未能从会议 PDF 纯文本可靠映射
- Yuchi Ishikawa:机构信息未能从会议 PDF 纯文本可靠映射
- Hokuto Munakata:机构信息未能从会议 PDF 纯文本可靠映射
- Yoshimitsu Aoki:机构信息未能从会议 PDF 纯文本可靠映射
- Tatsuya Komatsu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语言描述音频检索的输入为音频片段与自然语言查询,输出为跨模态相似度排序,难点在于一对多与多对一映射交织且声音源相互叠加,确定性单点嵌入难以表达抽象层级。概率语言音频预训练 ProLAP 先将音频与文本分别编码为对角高斯分布的均值与方差,再用概率成对对比损失 PPCL 拉近匹配对并推远非匹配对,随后用跨模态与模内包含损失约束一般概念包含具体概念。与确定性 CLAP 直接比较余弦距离不同,该方法用分布重叠度与非对称包含分数显式建模不确定性与层级,分层掩码进一步构造由粗到细的包含链条。在 AudioCaps 上音频到文本检索 R@1 达 42.13%,相对 SigLIP 基线提升约 1.25 个百分点且在跨数据集上保持稳定,音频遍历精度达 26.83% 显著高于基线。该结论仅在 AudioCaps 与 ClothoV2 微调与合成层级字幕上验证,对真实多源重叠与开放域查询的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1210. 风格词是全局旋钮还是局部开关:跨注意力如何把指令翻译成声音
英文题目:How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech
标签:#注意力机制 #统计分析 #可解释性 #语音 #文本到语音
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#注意力机制
👥 作者与机构
- Nityanand Mathur:机构信息未能从会议 PDF 纯文本可靠映射
- Hamees Sayed:机构信息未能从会议 PDF 纯文本可靠映射
- Wasim Madha:机构信息未能从会议 PDF 纯文本可靠映射
- Apoorv Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Sameer Khurana:机构信息未能从会议 PDF 纯文本可靠映射
- Akshat Mandloi:机构信息未能从会议 PDF 纯文本可靠映射
- Sudarshan Kamath:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
风格描述语音合成以自由文本刻画音色与韵律为输入、以波形为输出,难点在于难以判断风格词是全局调制整句还是局部对齐到某些音段。本文先用前向钩子截获流匹配扩散变换器每一层每一步的跨注意力,再按注意力头平均并跨层跨步聚合为每个描述词的时间热图,最后将热图与基频和能量轮廓关联并按层步分解重要性。与图像归因直接复用空间图不同,该链条把二维空间归因改造为一维时间归因,并区分风格词与内容词和功能词的分工。在3520个生成样本的评测设置下,风格词的时间方差指标为2.1×10−5,低于功能词的时间方差指标19.2×10−5。代表词响亮loud的注意力与能量呈正向高相关,支持全局调制兼具语义接地。结论仅适用于所测模型与模板化英文风格提示,向自然提示与其他架构的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1211. 把相似度当证据:鼾声分类中度量学习与可解释推理的分离设计
英文题目:Similarity as Evidence: An Explainable Siamese Framework for Snore Sound Classification
标签:#医疗音频 #对比学习 #可解释性 #音频分类
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#对比学习
👥 作者与机构
- Boyang Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Mengkai Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Haojie Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Kun Qian:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
鼾声分类需将4秒波形映射为Velum(V)、Oropharyngeal(O)、Tongue base(T)与Epiglottis(E)共4类激励位置标签,即VOTE分类体系,难点在于类别极不均衡、设备与噪声多变且临床要求给出可理解依据。所提框架先将对数梅尔谱经倒谱均值方差归一化后送入轻量卷积编码器得到ℓ2归一化嵌入。该嵌入再以半难三元组损失联合类别平衡交叉熵优化类内紧致与类间间隔。随后在测试时用类别质心最近邻完成非参数判决并对查询检索最相似支撑样本,支撑解释不改变判决,仅将查询与支撑样本的深层特征激活投影回时频面以比对共享结构。与已有原型投票不同,该设计把相似度形成过程显式锚定到具体参考音频与可比激活证据。在慕尼黑-帕绍鼾声语料库测试集下,所提质心推理的宏召回指标为0.638,高于微调wav2vec 2.0基线的宏召回指标0.401。该结论限于单中心小样本与加性白噪声评测,在0 dB重噪声与跨设备分布偏移下未获验证。该适用边界之外的跨设备大规模外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1212. 删掉重要神经元却删不掉音高:WavLM 声学表征的九头蛇冗余与子空间级干预
标签:#统计分析 #可解释性 #语音 #语音属性识别
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Patalee Narasinghe:机构信息未能从会议 PDF 纯文本可靠映射
- Kasindu Bandara:机构信息未能从会议 PDF 纯文本可靠映射
- Vilash Nawagamuwa:机构信息未能从会议 PDF 纯文本可靠映射
- Janak Senevirathne:机构信息未能从会议 PDF 纯文本可靠映射
- Uthayasanker Thayasivam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究自监督语音表示中低层声学属性的编码方式,输入为 WavLM-Base+ 各变换器层的逐帧残差流激活,输出是对 GeMAPS 声学属性的线性可解码性与因果归属判断,难点在于连续语音信号高度冗余且神经元严重多语义。方法链分为四步:先用岭回归线性探测定位声学信息所在的层级并以打乱标签为对照,再用 SHAP 重要性排序揭示原始神经元的多语义重叠,接着训练 JumpReLU 稀疏自编码器将残差流升维为稀疏隐变量并做基于套索探针与 SHAP 排序的迭代置零消融,最后改用迭代零空间投影在全线性子空间层面擦除目标属性并检验跨探针影响。相比神经元级消融,子空间擦除直接移除整个线性可预测方向,因而能绕过分布式备份并检验属性间是否共享子空间。在RAVDESS与CREMA-D和TIMIT联合语料的评测设置下,音高探针中SAE隐变量的相对R2保持率指标为98.85%,高于WavLM第1层的相对R2保持率指标98.31%。结论仅适用于早期层线性可解码的低层韵律与频谱属性,未验证深层语义与说话人属性以及非线性编码情形。实验使用单张 NVIDIA RTX 4070,原文未披露训练时长与完整计算开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1213. 后元音拉抬前元音吗:阿萨姆语中部前元音和谐的声学再检验
英文题目:An Acoustic Investigation of Mid Front Vowel Harmony in Assamese
标签:#统计分析 #语音学与音系 #社会语音学 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Saurabh Nath:机构信息未能从会议 PDF 纯文本可靠映射
- Rosey Billington:机构信息未能从会议 PDF 纯文本可靠映射
- Danielle Barth:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
阿萨姆语被描写为存在由后音节闭元音触发的逆行性抬高,即前音节中元音/E/在/i/前抬高,输入为CVCV词中目标元音的声学实现,输出为是否发生跨方言稳定的和谐判定,难点是中前元音音位对立本身存疑且既往单一方言构音结果分歧大。方法链分4步推进:从当代阿萨姆语语料库筛选18名50-65岁发音人并覆盖3个方言区,接着采集词表朗读与30分钟以上对话两类语体。然后经强制对齐加人工校对切分目标元音并用Fast Track提取共振峰,最后以Nearey1归一化后送入线性混合效应模型检验和谐语境与方言和语体的交互。与仅依赖内省和单一方言构音描述相比,该设计把和谐效应操作化为可检验的F1与F2条件差异并控制时长与性别。在Bihaguri词表语料设置下,/CECi/词的F1指标为428 Hz,低于/CECa/词的F1指标553 Hz,支持高度维度存在和谐但幅度随方言与语体组合变化。该结论的适用边界限于上述三方言区老年发音人的词表与对话语料。结论限于 /E/ 在 /i/ 前与 /a/ 前的局部比较,未验证 /u/ 触发、鼻音阻断、范畴性中和或知觉相关性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1214. 拉丁拼写不等于英语发音:为坦库尔语和马林语从零建库并训练字符级 TTS
英文题目:Scalable Neural TTS for Latin-Script Low-Resource Languages of Manipur
标签:#数据集 #数据集构建 #低资源 #语音 #文本到语音
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#数据集构建
👥 作者与机构
- Hoomexsun Pangsatabam:机构信息未能从会议 PDF 纯文本可靠映射
- Khumanthem Chanchanbi:机构信息未能从会议 PDF 纯文本可靠映射
- Kansham Tungran Maring:机构信息未能从会议 PDF 纯文本可靠映射
- Yambem Jina Chanu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文针对拉丁书写藏缅语坦库尔语(Tangkhul)与马林语(Maring)缺乏文本到语音(Text-to-Speech,TTS)语料的问题,输入为带变音符号的拉丁扩展字符文本,输出为自然语音波形,难点在于音系复杂且声调丰富、方言未标准化、正字法不统一且无现成音频。方法链分为四步:先以学生教材标准方言为基准、辅以故事书、诗集和圣经译本构建文本并由母语者校对剔除不当内容,再在低噪声录音室采集两名女性母语者单说话人朗读,接着用基于能量的语音活动检测(Voice Activity Detection,VAD)切分并做响度归一化与人工对齐质检,最后用字符级声学模型生成梅尔谱并由声码器合成波形。与英语预训练模型直接复用相比,该链条保留了声调与特殊元音的正字法区分,因而更适配目标音系。在每种语言250句评估集上非自回归模型配神经声码器取得梅尔倒谱失真度(Mel-Cepstral Distortion,MCD)约8.3与盲测平均意见分(Mean Opinion Score,MOS)3.06-3.51,明显优于Griffin-Lim基线。结论仅适用于录音室单说话人朗读场景,方言差异与变音符号拆分错误仍会导致可懂度下降。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1215. 儿童波兰语咝音发音位置错了,能靠自编码器压出的频谱向量检出吗
英文题目:Detection of Incorrect Place of Articulation in Polish Sibilants Using Convolutional Autoencoders
标签:#CNN #多任务学习 #言语障碍 #语音 #病理语音评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#CNN
👥 作者与机构
- Wojciech Pieniążek:机构信息未能从会议 PDF 纯文本可靠映射
- Oliwia Skórzewska:机构信息未能从会议 PDF 纯文本可靠映射
- Maria Filipek:机构信息未能从会议 PDF 纯文本可靠映射
- Zuzanna Miodońska:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童波兰语清卷舌擦音 /ʂ/ 与塞擦音 /tʂ/ 的调音位置误读检测,输入为人工切分的音段语谱图,输出为卷舌正常与齿间异常的二分类,难点在于儿童发音变异大且病理样本稀少。方法链分为三步:先将语谱图缩放到统一尺寸并送入卷积编码器压缩为低维嵌入,再由解码器重构输入以保留谱结构,最后将瓶颈向量标准化后交由支持向量机完成分类。与纯无监督重构相比,多任务变体在瓶颈上并联交叉熵分类头,迫使嵌入同时编码可重构性与诊断相关性。在儿童语料的说话人无关十折交叉验证下,最优多任务模型对擦音 /ʂ/ 灵敏度为 81.63%且准确率为 72.68%,对塞擦音 /tʂ/ 灵敏度为 84.31%且准确率为 70.31%,高于作者既往梅尔频率倒谱系数加支持向量机在塞擦音上约 71.58% 的灵敏度。该结论仅适用于受控图片命名任务中的两个卷舌嘶音,未验证连续语音与多中心泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1216. 从持续元音到连续儿化音:受限形变如何让三维声道既解剖可信又声学可解释
标签:#信号处理 #发声与构音 #语音 #语音合成
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#信号处理
👥 作者与机构
- Tharinda Piyadasa:机构信息未能从会议 PDF 纯文本可靠映射
- Michael Proctor:机构信息未能从会议 PDF 纯文本可靠映射
- Tünde Szalay:机构信息未能从会议 PDF 纯文本可靠映射
- Joan Glaunès:机构信息未能从会议 PDF 纯文本可靠映射
- Amelia Gully:机构信息未能从会议 PDF 纯文本可靠映射
- Kirrie Ballard:机构信息未能从会议 PDF 纯文本可靠映射
- Emily Kiff:机构信息未能从会议 PDF 纯文本可靠映射
- Naeim Sanaei:机构信息未能从会议 PDF 纯文本可靠映射
- Sheryl Foster:机构信息未能从会议 PDF 纯文本可靠映射
- David Waddington:机构信息未能从会议 PDF 纯文本可靠映射
- Craig Jin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为同一名澳大利亚英语成年女性说话人的持续发音容积MRI、中矢状面实时MRI视频序列与扫描外坐姿录音,输出为沿协同发音轨迹采样的三维声道网格及其频域共振峰轨迹,难点在于二维动态观测无法直接约束三维分支侧腔,且三维声学对唇部辐射条件、牙齿缺失和微小几何误差高度敏感。方法链分三步:先以ITK-SNAP分割持续
\[ɑ:\]和
\[ɹ:\]三维口腔气道并配准到统一坐标系,再将
\[ɑ\]→
\[ɹ\]和
\[ɹ\]→
\[ɑ\]建模为两段受限大变形微分同胚度量映射,用全部过渡帧中矢状面气道轮廓共Nrt=42和Nrt=23作为序列约束引导测地形变路径并按帧索引采样中间网格,最后将水密网格嵌入类头部封闭体再置于半径0.4 m球形外场,用COMSOL压力声学频域求解亥姆霍兹方程,以声门均匀法向质点速度激励、唇前15 cm接收点计算声压级传递函数峰值。与仅约束端点的传统配准和一维面积函数管模型相比,该链条保留三维侧腔与自由场辐射,使中间几何在解剖与声学上同时可检查。在持续音端点评测设置下,FEM的指标F1为800 Hz,高于扫描外持续音参考的指标F1的690 Hz。去每共振峰全局偏置后F1残差离散为78 Hz、F2为74 Hz、F3为163 Hz,相对量D(F3-F2)轨迹相关为r=0.72,受限于地标数n=5仅作定性支持。结论仅适用于单人单次intervocalic rhotic概念验证,持续音相对连续语音存在超发音效应。原文未披露训练推理部署成本,FEM仅做5个网格以降低计算负担。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1217. 只动年龄和性别能藏住说话人吗:实时匿名中的隐私与音质折中
标签:#统计分析 #隐私保护 #流式处理 #说话人匿名化
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#说话人匿名化 | 主方法:#统计分析
👥 作者与机构
- Waris Quamer:机构信息未能从会议 PDF 纯文本可靠映射
- Ricardo Gutierrez-Osuna:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究流式语音匿名中年龄与性别编辑的隐私质量权衡,输入为原始语音,输出为保留语言内容但抑制说话人身份的可懂语音,难点在于属性改变量与自然度损失的非线性耦合。内容分支由内容编码器预测HuBERT-Kmeans离散单元以保留语言内容,其离散内容表示与韵律特征一同送入解码器等待融合。说话人分支由说话人编码器拼接X-vector与ECAPA-TDNN得到嵌入,再沿Pearson相关加权的PCA复合方向按强度参数偏移嵌入以完成年龄与性别编辑。流式HiFiGAN解码器经AdaIN与FiLM注入编辑后说话人嵌入与韵律后重建波形,随后用线性回归分离各属性对余弦相似度与DNS-MOS的贡献。与黑盒语音转换不同,该方案以可解释双属性轴实现实时细粒度控制,可定位隐私下降陡于质量下降的最优匿名区。在感知听辨评测下,极端偏移条件的质量分数为2.0,低于中度偏移条件的质量分数2.6。结论仅适用于英语朗读语音与 PCA 可分属性区间,极端偏移或跨语言口音外推尚未验证。成本方面论文仅提及 2 块 NVIDIA RTX 3090 训练与延迟 350 ms 以下的流式设计,未披露完整训练时长与推理算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1218. 奥克兰百年元音:/e æ/先升后降而/ɪ/很早就已中央化
标签:#统计分析 #社会语音学 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Brooke Ross:机构信息未能从会议 PDF 纯文本可靠映射
- C. I. Watson:机构信息未能从会议 PDF 纯文本可靠映射
- Elaine Ballard:机构信息未能从会议 PDF 纯文本可靠映射
- Miriam Meyerhoff:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理奥克兰百年新西兰英语前元音演变问题,输入为现代访谈语音与历史口述史语音,输出为短前元音/e, æ, ɪ/的共振峰位置及其历时轨迹,难点在于历史录音质量不一且早期新西兰英语个体变异极大。方法链分为四环:先对现代Auckland Voices语料与历史Auckland Born语料做正字转写与强制对齐,再用forest提取重读元音目标点第一与第二共振峰并经性别线性变换归一化,随后以年龄组与性别为固定效应、说话人为随机效应构建线性混合模型Linear Mixed Model / LMM得到群组与说话人质心,最后针对/ɪ/按是否邻接边音做二次切分验证。与既有短前元音移位链式解释的关键机制差异在于本文提出/ɪ/央化可能先起于边音环境再泛化,而非被动接受/e/与/æ/高化的推链压力。在以Older AV为参照组的线性混合模型评测设置下,Younger AV组的TRAP元音F1指标为+0.84 bark,高于Historical组的F1指标+0.63 bark。该结论适用边界限于奥克兰且历史样本极小,跨地区推广与录音介质效应尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1219. 澳大利亚英语男声中音高不高不重要,变化快慢和话题才重要
标签:#统计分析 #社会语音学 #语音 #语音属性识别
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Timothy Shea:机构信息未能从会议 PDF 纯文本可靠映射
- Hannah White:机构信息未能从会议 PDF 纯文本可靠映射
- Joshua Penney:机构信息未能从会议 PDF 纯文本可靠映射
- Anita Szakay:机构信息未能从会议 PDF 纯文本可靠映射
- Felicity Cox:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为77名澳大利亚英语男性的图片描述连续语音,输出为局部f0、f0差分动态性与f0极差三类指标,难点在于性取向、男性角色态度与话题在人内与人际层面交织且年龄分组带来异质性。方法分四步依次推进,先过滤元音与响音辅音并剔除犹豫标记以净化可测区间,再用MacReaper提取声门闭合时刻并以10毫秒步长估计局部f0。接着按200毫秒静音切分话语并计算相邻f0差分与话语内极差,最后将三类指标送入线性混合效应回归检验性取向、男性角色态度得分、年龄组与话题的交互,上一步的话语级指标直接构成下一步建模的因变量。与仅比较平均f0的已有方法不同,本文同时建模动态性与话题切换并引入男性角色态度量表,使社会意义索引过程可在人内条件下被量化检验。在图片描述任务语料条件下,年龄组与性取向交互的f0差分指标为3.219,高于话题与性取向交互的f0差分指标0.979。局部f0仅年龄组达到显著,30岁以上组预测f0低于30岁及以下组,同时30岁以上组男性角色态度得分越高f0差分越小而年轻组无此趋势。该结论适用边界限于在澳大利亚完成中小学教育的成年男性图片描述语体,尚未验证自发对话与跨方言外推,受限于女性群体与自然对话场景。原文未披露训练、推理或部署成本
🔗 开源资源
- 第三方资源:https://github.com/google/REAPER — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1220. 塞音语境是否改变毛利语元音:高度稳定而前后位置显著漂移
英文题目:A preliminary exploration of stop-vowel coarticulation in Māori
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Isabella Shields:机构信息未能从会议 PDF 纯文本可靠映射
- Hiraia Haami-Wells:机构信息未能从会议 PDF 纯文本可靠映射
- C. T. Justine Hui:机构信息未能从会议 PDF 纯文本可靠映射
- Peter J Keegan:机构信息未能从会议 PDF 纯文本可靠映射
- C. I. Watson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为毛利语口塞音语境中重读短元音的朗读发音,输出为第一、第二共振峰动态轨迹是否随辅音语境显著变化的判断。难点在于毛利语仅5个短单元音但允许较大变异,且既有MAONZE论述否认后续辅音的预期效应,静态均值难以捕捉形状偏移。方法链分三步:以CVCV目标词嵌入固定载体句Ko
\[target\]te kupu控制重音与双侧辅音,用WebMAUS自动切分加人工校界与wrassp逐帧共振峰估计加人工校对获得Bark域归一化轨迹,再以广义加性混合模型分离元音与辅音的参量截距与时间平滑效应。与既往印象式与静态描述相比,关键差异是用连续时间非线性平滑显式检验轨迹高度与形状差异并纳入说话人随机平滑。在7名毛利裔女性说话人共524个有效重读元音的语料下,F2模型的调整R2指标为0.82,高于F1模型的调整R2指标的0.67。结论仅适用于女性谨慎朗读语体,未验证男性、老年、自然语流、鼻音与其他序列的外推有效性。其余人群与自然语流的适用边界尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1221. 把声音映射到语义空间:关键词规整与负样本推开如何让未见属性可预测
英文题目:Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings
标签:#对比学习 #大语言模型 #零样本 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#对比学习
👥 作者与机构
- Byoungjun So:机构信息未能从会议 PDF 纯文本可靠映射
- Jaejun Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Kyogu Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人属性预测需从语音输入映射到可解释的声音描述输出,难点在于固定标签无法覆盖未见措辞且声学与文本语义存在跨模态鸿沟。第一步由ECAPA-TDNN声学编码器将语音编码为连续预测向量,以冻结的GPT-OSS-20B嵌入作为44个属性的连续目标并用强度加权余弦相似度对齐。第二步在属性文本后附加speech等关键词以收缩嵌入流形,将松散标签锚定为紧致域流形,其输出的紧致目标空间直接作为后续对齐与判别学习的基准。第三步在该紧致空间上施加Top-k负样本损失,在拥挤语义区拉开正负边距并以平滑梯度惩罚最混淆负例,使声学预测远离近义干扰项。与封闭集多标签分类相比,该机制差异在于把离散索引替换为连续语义空间从而支持同义词检索。在LibriTTS-P测试集上微平均F1指标下所提方法在阈值0.2时以0.7625超过基准Vo-Ve的0.6645,在阈值0.8时以0.7380超过基准的0.7286,同时在Gemini 3.1 Pro生成的未见同义词上保持相近水平。结论目前仅在单一英语朗读语料与人工同义词上验证,未覆盖真实新属性与跨风格外推。该结论的适用边界受限于单一语料与人工同义词,尚未验证真实开放词汇外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/jaejunL/vove — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1222. 没见过的搭嘴音为何反而认得更准:自监督模型在 G|ui 与 West !Xoon 上的微调检验
英文题目:Pretrained self-supervised speech models can recognize unseen consonants
标签:#数据集 #自监督学习 #跨语言 #低资源 #语音识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#自监督学习
👥 作者与机构
- Chihiro Taguchi:机构信息未能从会议 PDF 纯文本可靠映射
- Éric Le Ferrand:机构信息未能从会议 PDF 纯文本可靠映射
- Hirosi Nakagawa:机构信息未能从会议 PDF 纯文本可靠映射
- Hitomi Ono:机构信息未能从会议 PDF 纯文本可靠映射
- Kanji Kato:机构信息未能从会议 PDF 纯文本可靠映射
- Emily Prud’hommeaux:机构信息未能从会议 PDF 纯文本可靠映射
- David Chiang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为 G|ui 语和 West !Xoon 语的野外叙事与诱发语音,输出为包含 40 余种搭嘴音的音素转写,难点是搭嘴音在主流预训练中几乎缺席且伴随声调与元音复杂变化。方法链分三步:先构建两套低资源语料并统一去声调与正字法,再加载 Wav2Vec2 系与 HuBERT 系的多语或单语预训练编码器并叠加联结时序分类解码层,最后以全参数微调适配目标语言并用贪婪与束搜索加 n 元语言模型解码评分。与依赖目标音素在预训练中充分出现的直觉不同,自监督掩码预测学到的声学表征可迁移到未见的爆裂类搭嘴音。在贪婪解码评测设置下,搭嘴音辅音的错误率低于非搭嘴音辅音的错误率,Wilcoxon 符号秩检验给出 W 为 0 与 p 为 0.016。该结论的适用边界受限于全参数微调与字符级评估条件,冻结编码器时性能会大幅下降且尚未验证零样本外推。结论仅适用于全参数微调加字符级评估的搭嘴音辅音识别,不保证冻结编码器、零样本或元音与声调同样成立。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1223. 英语主导下越南语如何被多说一点:两次学前项目实施的输入输出时长对比
标签:#统计分析 #语言习得 #多语言 #语音 #语言识别
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语言识别 | 主方法:#统计分析
👥 作者与机构
- Ha Chi Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Minh Anh Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Mai Linh Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Weicong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Paola Escudero:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究测量澳大利亚墨尔本学前机构中越南语 heritage 语与英语的输入输出,输入为Zoom课堂录音,输出为引导者与儿童按英越划分的言语时长及相对使用率,难点在于多人重叠、儿童语音稀疏、英越频繁切换且自动工具失效。方法分四步:每年按相同规则抽取8个片段并由越英双语第一作者在Praat中标注四类区间起止,再用MATLAB脚本汇总时长并计算描述统计。然后在RStudio中用brms包做以秒级时长为因变量的贝叶斯回归,最后检验5个方向性假设并报告估计值、95%可信区间与证据比。与既往问卷加LENA日记录或单轮视频编码相比,本研究坚持跨年可比取样加纵向建模,更适合评估课程迭代对师幼互动的影响。在相同取样条件的8段课堂语料评测下,IMP-2的言语占比指标为25.3%,高于IMP-1的言语占比指标10.9%。结论仅适用于该园所、单名越南语引导者、结构化主题课程初期的师幼互动,未验证遗产语儿童与附加语(Additional Language,无家庭背景的课堂新语言)儿童的分群轨迹,也未检验长期保持效果。跨园所推广与不同引导者条件下的效果尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1224. 参考中心挪一点方向响应就变样:用有限阶能量把中心找回来
标签:#信号处理 #麦克风阵列 #空间音频信号 #空间音频渲染
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#空间音频渲染 | 主方法:#信号处理
👥 作者与机构
- Xue Wen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为离散球面网格上测得的与距离无关的方向性传递函数,输出为消除未知空间平移后的校准响应与可复用的有限阶质心,难点在于参考中心选择与安装偏差将能量泄漏到高阶球谐,破坏有限阶截断可舍弃的假设。方法先对平移响应做球谐展开并定义有限阶能量比为最大化目标,明确能量集中程度的优化方向。再以阶加权正则抑制高阶平坦与局部极值,并用分频调度先窄带搜索再全频带约束精化求解有限阶质心,其输出作为抵消随机平移的二次平移量进入下一步。最后将观测值平移到质心后执行插值、平滑或方向感知编码,并按需平移回去以保持世界坐标一致。与固定几何中心或物理传声器位置相比,关键差异是质心完全由声学数据驱动且在世界坐标下平移不变,因而能对冲任意测量平移并保障有限阶能量。在方向感知编码评测任务下,10°方向误差条件的方向误差指标为10°,低于20°方向误差条件的方向误差指标20°。该结论依赖平面波模型的远场假设,对近场、强散射与高频剧烈波动的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1225. 从找特征到找证据:用训练样本的影响力解释构音障碍严重度判定
英文题目:Towards Dys-XAI: Influence-Based Explanations for Dysarthria Severity Assessment
标签:#统计分析 #可解释性 #言语障碍 #病理语音评估
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Xiaoliang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Qiyang Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yupei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Erfan Loweimi:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Williams:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengjun Yue:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍严重程度评估需将语音映射为典型 typical、轻度 mild、中度 moderate、重度 severe共4级有序标签,难点在于相邻级别差异连续且听觉感知评定本身存在评定者间变异。该工作先用梯度轨迹追踪TracIn计算每条训练语音对每条测试语音的影响分,再按测试真值标签聚合为类级向量并进一步按训练标签平均为4×4影响矩阵,最后按标签距离统计序数敏感性以刻画模型全局行为。与输出时频显著图或OpenSMILE描述子排序不同,该机制直接返回可听的支持与对抗参考样本,使有序比较显式化。在TORGO说话人无关划分的受控删除评测下,删除类内高影响20%样本后中度类别的准确率为0.3%,低于未删除基线的准确率36.8%,即从36.8%降至0.3%。删除低影响样本后中度与轻度性能回升超十个百分点且矩阵呈对角主导与邻级互助结构,支撑了解释的因果相关性与序数敏感性。结论目前仅在单数据集与弱线性分类器下成立,跨语种、跨采集条件与更强声学编码器的外推尚未验证。原文未披露训练、推理或部署成本,仅提供试听演示页而无代码权重开源。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1226. 普通话卷舌不是卷舌尖:收缩位置后移与前腔扩大才是稳定区别
英文题目:Articulatory Analysis of the Mandarin Alveolar–Retroflex Contrast Using Real-Time MRI
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Qi Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Tatsuya Kitamura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
普通话齿龈卷舌对比的舌尖姿态争议大,本文输入为中矢面实时磁共振视频,输出为归一化收缩位置、收缩长度、前腔伪面积与后腔伪面积的类别判别,难点在于低空间时间分辨率下微小开口易受元音语境与声道长度干扰。方法链第一步沿气道中线每2毫米布设正交网格并依强度不连续提取气组织边界形成开口函数,为后续测量提供轮廓基础。第二步以0.5毫米阈值界定收缩区间并计算口部归一化位置与前后腔宽度和,将开口函数转化为四维指标。第三步以线性混合效应模型控制元音语境与声道长度后检验类别主效应与类别乘辅音对交互,由四维指标得到统计判别。相对既往腭位图与超声定性观察,该工作以腔体几何量替代舌尖姿态描述,更直接衔接共振声学解释。原文未提供可核对的关键定量结果。结论仅适用于北方标准音成年人的单次稳态帧,受小样本、仰卧录音与低时间分辨率限制,尚未验证时间动态与声学中介。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1227. 声调不能丢:用自动声调映射把跨语言强制对齐接到声调语言上
标签:#迁移学习 #语音学与音系 #跨语言 #低资源 #强制对齐
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#强制对齐 | 主方法:#迁移学习
👥 作者与机构
- Hongchen Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Yixin Gu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言强制对齐以低资源目标音频与正字法转写加发音词典为输入,输出音素级时间边界,声调语言中基频轮廓显著影响音节时长与边界划分却长期被忽略。CrossPhon-Tonal将国际音标拆分为音段串与赵元任声调字母后缀,先用构音特征距离完成音段映射,再把声调作为附加层在目标音段已证实的变体中选择。生成的组合映射将源发音词典转换为目标声学模型兼容的中间词典,进而直接驱动目标音频的强制对齐。相对以往删除声调或依赖专家手工映射的做法,该机制禁止生成未见的音段声调组合,避免将声调当作次音位噪声并消除专家瓶颈。在以语言相关模型对齐为基准和0.025秒容差的评测条件下,Thai模型对齐普通话音频时CrossPhon-Tonal自动映射的一致率指标为0.772,高于专家映射的一致率指标0.726。该结论仅在以语言相关模型对齐为基准和0.025秒容差下成立,未经大规模人工标注验证。克罗地亚等小数据与跨语系组合效果下降,其泛化适用边界仍尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1228. 听得出家乡:瑞士德语嗓音设定的首次系统编码与低一致性下的地域性别分化
英文题目:Applying the Simplified Vocal Profile Analysis to Swiss German Dialects
标签:#数据标注 #统计分析 #社会语音学 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#数据标注
👥 作者与机构
- Alessia Wüst:机构信息未能从会议 PDF 纯文本可靠映射
- Adrian Leemann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为127名18-40岁瑞士德语年轻人的约1分钟自发对话录音,输出为10个嗓音轮廓设置的分类标注与性别及地理分布结论,难点在于听辨判断主观性强且连续声学信号难以离散化。方法链分四步推进:先从Dialäktatlas语料127个调查点每点抽1人并统一远程录音流程,再由4名评级者经校准后独立执行简化嗓音轮廓分析二分类编码并计算Fleiss Kappa。随后经共识会议确定终值并做卡方检验与k近邻平滑制图,使个体判断进入信度评估再进入群体统计与空间可视化。与既往印象式方言描写及完整版嗓音轮廓分析相比,该机制差异在于用中性基线加存在性判断降低认知负荷,并首次建立可检验的性别与地理假设。在127人Dialäktatlas语料评测下,velopharyngeal条件的Fleiss Kappa指标为0.386,高于voice type条件的Fleiss Kappa指标为0.302。该研究中部咽部扩张制图受限于单点单人代表性与低信度,尚未验证其跨样本稳定性。该结论边界在于单点单人抽样加音频缺失视觉线索,且咽部扩张低信度与中部女性过采样使中部地图可能为伪影。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1229. 熟悉是屏障还是助推器:普通话情感韵律识别中人声与克隆熟悉音色的对照
标签:#心理声学实验 #言语感知 #生理信号 #语音 #语音情感识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#心理声学实验
👥 作者与机构
- Feng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Gaoyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Shanshan Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Yixiang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Hanrui Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Xurong Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理普通话孤立听觉情绪韵律感知任务,输入为人类自然语音与AI克隆语音,输出为听者对高兴、愤怒、恐惧、悲伤4类情绪的判断准确率、反应时与心率变异性,难点在于合成音色保真但存在韵律微扰,同时身份熟悉度提供自上而下补偿或失调线索。方法链分为三环:先录制陌生播音员情绪语音与熟悉人中性语音,再经情感保持语音转换生成熟悉与陌生AI情绪刺激,最后开展被试内听辨并同步采集行为与生理信号,前一步输出的刺激集直接构成下一步感知比较条件。与以往匿名说话人研究相比,关键机制差异在于引入社会认知变量,检验熟悉度是补偿合成缺陷还是触发恐怖谷式审视。在陌生人语音比较条件下,高兴条件的准确率差异系数为7.74,高于恐惧条件的准确率差异系数1.51。结论边界限于无视觉与语境的孤立声学判断、单一女性陌生声源与单一熟悉音色,尚未验证多说话人、强噪声或临床人群外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/Plachtaa/seed-vc — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1230. 行为不变而神经重组:粤语声调归一化在认知负荷下的主动抑制
标签:#时频分析 #言语感知 #脑信号 #语音 #语音识别
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#时频分析
👥 作者与机构
- Kaile Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Gang Peng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理粤语水平调T55/T33/T22在说话人基频漂移下的外在归一化,输入为载体短语语境加目标音节/ji/,输出为三选一字辨认,难点是绝对音高不可靠且视觉分心占用中枢资源。方法链先构造4说话人乘3种移调语境的听觉刺激以诱发对比性语境效应,再叠加4×4与8×8几何图形视觉搜索构成无负载、低负载与高负载三区组双任务,最后对目标锁时脑电做事件相关谱扰动与置换检验以分离Alpha与Delta调制。相比把归一化视为自动过程的观点,该工作提出负载下靠顶枕部Alpha同步抑制视觉流、前额Delta去同步转向外部听觉的补偿机制。在粤语声调归一化双任务条件下,语境F0主效应的卡方指标为19.77,高于认知负载主效应的卡方指标0.32。无负载出现0-415ms的Alpha去同步,负载转为159-800ms的持续Alpha同步并伴随303-565ms前额Delta去同步,行为上语境效应保持而负载主效应不显著。结论仅适用于健康年轻粤语母语者的小样本实验室双任务,未验证噪声、老年、第二语言或连续语流的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1231. 极高调是假声还是绷紧的真声:开慧话 T4 的音质辨别与音高伴随解释
标签:#统计分析 #发声与构音 #语音学与音系 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Yi Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Aini Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入的是开慧湘语6个声调在载体句中的录音,输出是对极高调T4发声类型的判定及其生理归因,难点在于紧嗓与假声在听感上相近且都伴随极高基频。方法链分三步:先以Praat双层标注切分有效调域并用VoiceSauce在9个等距时间点提取基频与声源参数,再经对数变换与分说话人z分数归一化消除音段与个体差异,最后以广义加性混合模型分离调类水平差异与动态轨迹差异。与既往单人听感描述不同,该文用全调系对照与F0收敛点检验区分生理伴随与音位特征。在16名发音人104词载体句语料条件下,以T4为参照的广义加性混合模型显示T3的H1-H2指标为0.55,高于T6的H1-H2指标0.18,证实T4具有全调系最低的频谱倾斜并支持紧模态而非假声判断。结论仅适用于句中平稳载体句下的老年湘语发音,连续语流与青年人群的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1232. 同一编码器不同深度:25 个构音障碍感知维度为何偏好不同 Wav2Vec2 层
标签:#LoRA #可解释性 #言语障碍 #语音 #病理语音评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#LoRA
👥 作者与机构
- Zihan Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Qianli Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Satwinder Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Clarion Mendes:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Hasegawa-Johnson:机构信息未能从会议 PDF 纯文本可靠映射
- Waleed Abdulla:机构信息未能从会议 PDF 纯文本可靠映射
- Seyed Reza Shahamiri:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理病理语音细粒度感知评估,输入为构音障碍者连续语音,输出为DAB体系下25个维度1至7级严重度评分,难点在于病理声学与常态预训练失配及维度间声学属性异质且标签偏向正常至轻度。方法先在无标注病理语音上以低秩适配做无监督域适应校准Wav2Vec2编码器,输出适配后编码器进入下一步。接着冻结编码器做分层线性探测以揭示各维度最优深度,并以可学习标量混合对全部层软加权融合,经精炼颈与次序一致回归头联合预测25维。相对默认取最后一层的做法,关键差异在于将深度选择从全局超参数变为随维度变化的连续权重,使发声与构音维度各取所需层。在Speech Accessibility Project自建说话人无关划分的评测设置下,可理解度维度的全局混合平均绝对误差指标为.43,低于按维度混合的平均绝对误差指标.44。结论仅在美式英语五种病因的句子级评估内验证,对重度稀疏维度、韵律时序维度与跨语种外推尚未验证。原文披露了3卡RTX 3090与两阶段耗时,量级为适应约58小时、单次探测约2小时、融合训练约3小时。就部署而言,该工作的硬件为3卡RTX 3090,训练成本已如上披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1233. 在保住音色的同时拧动口音旋钮:CrossAccent-TTS 如何解耦说话人与口音
标签:#对抗训练 #自回归模型 #大语言模型 #跨语言 #文本到语音
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#自回归模型
👥 作者与机构
- Ram Annamdevula:机构信息未能从会议 PDF 纯文本可靠映射
- Ankit Tatawat:机构信息未能从会议 PDF 纯文本可靠映射
- Ashishkumar P. Gudmalwar:机构信息未能从会议 PDF 纯文本可靠映射
- Nirmesh J. Shah:机构信息未能从会议 PDF 纯文本可靠映射
- Pankaj Wasnik:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言TTS需在保留说话人音色同时渲染目标口音并连续控制强度,印度多语言下口音与音色耦合且标注稀缺构成实际难点。先将16kHz原始波形输入Neucodec编码器离散化为声学令牌,职责是保留感知质量的紧凑序列基础,输出离散令牌序列。再将令牌嵌入送入Perceiver Resampler经交叉与自注意力压缩为固定长度说话人与风格表示,并经GRL辅助分类器剥离口音语言信息后叠加可学习语言嵌入,输出可加性渲染的组合条件,前一步令牌序列即为本步压缩与解耦的输入。最后将该组合条件与IPA文本一同输入Qwen 2.5 0.5B自回归解码器预测声学令牌并经Neucodec解码器重建波形,前一步组合条件作为本步的显式控制输入,推理时凸组合两种语言嵌入以连续调节强度。与直接条件方案不同,该分离式对抗去口音与显式加性渲染使口音控制独立于音色保持,具有可插值控制的实际意义。在印度口音转换评测设置下,提出方法的UTMOS为3.181,高于IndicF5的UTMOS 2.817。该结论适用边界限于上述封闭语料条件,开放外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/resemble-ai/Resemblyzer — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1234. 同样是副语言任务,为何性别可跨语言迁移而说话人验证不行
英文题目:Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
标签:#迁移学习 #跨语言 #多语言 #语音 #说话人验证
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#迁移学习
👥 作者与机构
- Pol Buitrago:机构信息未能从会议 PDF 纯文本可靠映射
- Oriol Pareras:机构信息未能从会议 PDF 纯文本可靠映射
- Federico Costa:机构信息未能从会议 PDF 纯文本可靠映射
- Javier Hernando:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理副语言语音任务中的跨语言泛化度量问题,输入为多语言语音,输出为性别标签或说话人是否相同的判定,难点在于语言内容与韵律音色线索相互纠缠,难以判断性能变化来自语言还是数据组成。方法链分为三步:先为每个任务确定处于动态增长区间的训练量区间,再分别测得同语言增量带来的自增益与跨语言增量带来的交叉增益,最后以后者除以前者得到行归一化转移矩阵并派生聚合诊断量。与已有单源适应或干扰矩阵相比,关键差异是以目标语言自身增益为分母做下游性能归一化,使不同语言与不同任务具有可比性。在Mozilla Common Voice 22.0的44语言全矩阵任务下,性别识别的相对Frobenius偏离指标为0.162,低于说话人验证的相对Frobenius偏离指标2.970。结论仅适用于受控均衡小数据微调下的mHuBERT-147编码器,对大规模多语言联合训练或端到端验证架构的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1235. 突变越陡越好找:用 Conformer 与冻结 HuBERT 做八类声学界标检测
英文题目:Acoustic Landmark Detector based on Conformer and HuBERT
标签:#Conformer #语音学与音系 #语音 #音频事件检测
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音频事件检测 | 主方法:#Conformer
👥 作者与机构
- Mateo Cámara:机构信息未能从会议 PDF 纯文本可靠映射
- José Luis Blanco:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Ignacio Godino-Llorente:机构信息未能从会议 PDF 纯文本可靠映射
- Jeung-Yoon Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Stefanie Shattuck-Hufnagel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为16 kHz孤立音节与单词语音,输出为8类声学界标(acoustic landmark)的发生时刻与类别,难点在于事件稀疏且标注时刻存在类型相关的不确定性,语料仅1839条且类别极不均衡使元音等渐变事件更难精确定位。系统先将语音转为80维对数梅尔谱或冻结HuBERT等表征并对齐到10 ms帧,再送入256维12层Conformer编码器经线性头逐帧分类,训练时以每类高斯软标签替代单帧硬标签并用加权交叉熵优化,最后经softmax与峰值检测输出界标时刻与置信度。相比硬标签与规则基线,按元音20 ms到塞音与鼻音10 ms设置扩散宽度的机制差异使模型容忍标注抖动并保留定位锐度,自监督表征还缓解可控音节与真实单词间的域差异并支撑整句非因果建模。在自有语料90/10划分上冻结HuBERT达到F1@20 ms为0.77,软标签相对硬标签提升7.0个百分点。结论仅适用于受控短语音与8类Stevens界标体系,元音与鼻音释放仍弱且TIMIT零样本迁移不佳。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1236. 只有一句术前语音时,先恢复可懂度再搬运音色为何更稳
英文题目:Personalized Electrolaryngeal Voice Conversion with a Single Pre-operative Utterance
标签:#模型融合 #SFT #少样本 #语音 #语音转换
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音转换 | 主方法:#模型融合
👥 作者与机构
- Devin Chang:机构信息未能从会议 PDF 纯文本可靠映射
- Hsin-Te Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Ming-Chi Yen:机构信息未能从会议 PDF 纯文本可靠映射
- Shu-Wei Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
- Hsin-Min Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
电子喉语音转换 Electrolaryngeal Voice Conversion / ELVC需将电子喉 Electrolaryngeal / EL机械语音转为可懂且保留患者术前音色的自然语音 Natural / NL,难点在于真实术前录音极少且电子喉与自然语音存在严重域失配,直接套用预训练转换模型会导致内容崩溃。本文限定仅用1句模拟术前自然语音做音色参考,方法链第一步由基于局部线性嵌入 Locally Linear Embedding / LLE的转换模块负责可懂度恢复,以Chinese-HuBERT特征做近邻检索、以WavLM第六层特征估计权重并重构内容特征,形成可懂的中间声学表示。第二步将该中间表示跳过波形合成以特征级级联直接送入预训练零样本转换 Zero-shot Voice Conversion / ZS-VC骨干Seed-VC,由其负责音色迁移并将表示投影回自然语音流形,单句术前语音仅作为目标音色参考注入。第三步以伪目标监督精调实现跨阶段兼容,用动态时间规整 Dynamic Time Warping / DTW对齐不等长源与伪目标序列并更新除声码器外的可训练模块,使第二阶段适应经恢复的电子喉分布。与直接套用零样本模型及伪目标训练相比,级联把可懂度恢复与音色迁移解耦,避免了域失配下的内容崩溃。在4组台湾国语听力噪声测试 Taiwan Mandarin Hearing in Noise Test / TMHINT句对上平均,精调后特征级联将音节错误率 Syllable Error Rate / SER降至59.65%,说话人相似度提升至0.84,客观上持平或略优于使用240句配对数据的监督基线。该结论仅在模拟术前数据的受控中文场景成立,未验证真实喉切除患者、跨语言与多噪声鲁棒性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1237. 声音在第几层变成答案:对大音频语言模型做因果追踪
英文题目:Causal Tracing of Audio-Text Fusion in Large Audio Language Models
标签:#评测协议 #音频大模型 #可解释性 #语音 #音频问答
评分:5.4/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音频问答 | 主方法:#评测协议
👥 作者与机构
- Wei-Chih Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chien-yu Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型需以连续音频序列与文本提示为输入,输出短时属性答案,实际难点在于无法定位声学证据在模型深度与序列位置上何时何处汇入文本推理。该方法先做干净运行缓存原始音频下的文本隐状态,再做破坏运行以全段静音替换音频并保持长度与词元数不变以切断声学信息。接着做补丁运行将干净隐状态按层或按位置写回破坏运行,并用恢复率度量因果贡献,从而同时得到深度与位置两维因果图。与仅做投影观察的AudioLens类Logit Lens方法不同,该干预主动隔离声学信息并区分深度与位置,实际意义在于可定位融合层与检索瓶颈以指导架构设计。在SAKURA基准条件下,充分因果补丁位置的恢复率指标为1.0,高于无因果贡献位置的恢复率指标0.0。结论限于结构化短问答与静音基线条件,未验证开放式推理、长音频与噪声条件,未披露训练与推理成本。其适用边界受限于结构化短问答与静音基线,开放式推理与长音频场景尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1238. 同样听出话没说完,依据却不同:听力损失如何改变轮替结尾的韵律线索权重
标签:#心理声学实验 #韵律 #言语感知 #语音 #轮次切换
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#轮次切换 | 主方法:#心理声学实验
👥 作者与机构
- Lorenza Zaira Curetti:机构信息未能从会议 PDF 纯文本可靠映射
- Hae-Sung Jeon:机构信息未能从会议 PDF 纯文本可靠映射
- Lauren V. Hadley:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理老年听众仅凭韵律判断话轮是否结束的任务,输入为语义相同的陈述疑问句录音,输出为完成或延续二分类,难点在于剥离词汇句法后边界线索微弱且听力损失可能改变线索可靠性。方法链分为三步:先用在线数字三联音测试划分听力正常与听力损失组,再呈现40组完成与延续配对刺激并要求判断说话人是否讲完,最后提取目标词时长与强度及末尾音高上升时长与音程并用基于秩的回归关联逐项正确率。机制差异在于典型听力组依赖边界强度即时长与强度的交互,而听力损失组依赖音高运动即上升时长与音程,提示损失不是整体敏感性下降而是加权重塑。在包含112名55至75岁被试的话轮完成延续分类任务下,典型听力组的准确率为61%,高于听力损失组的准确率54%。结论仅适用于无上下文的单说话人英语陈述疑问句朗读语音,未验证自发对话、多说话人或助听补偿下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1239. 零样本能克隆声音,却克隆不好谁的声音:性别延展嗓音暴露的合成与评测双重偏差
标签:#主观评测 #模型评估 #公平性 #零样本 #文本到语音
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#文本到语音 | 主方法:#主观评测
👥 作者与机构
- Juliana Francis:机构信息未能从会议 PDF 纯文本可靠映射
- Robin Netzorg:机构信息未能从会议 PDF 纯文本可靠映射
- Joakim Gustafson:机构信息未能从会议 PDF 纯文本可靠映射
- Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理零样本语音克隆任务,输入为约10秒参考语音与待合成文本,输出为保留目标音色的语音,难点在于性别expansive音色在训练与评测数据中稀缺且感知相似度难被自动指标刻画。方法链分四步推进:从MAGES与GLOBE构建GE与N-GE参考集并做拼接归一化,用6个零样本TTS模型合成Harvard语句,组织类MUSHRA人听相似度评测,并行计算说话人相似度、自动平均意见分与词错误率并做组间检验。与已有合成偏置研究相比,该工作把模型偏置与评测指标偏置放在同一框架下对照,揭示自动评测自身的盲区。在MAGES与GLOBE对照评测设置下,LinaSpeech在GE语音上的词错误率(WER)为.141,高于其在N-GE语音上的词错误率(WER).072。结论仅适用于美式英语朗读类短句与所测 6 模型,无法外推至自发对话、跨语言或性别肯定嗓音训练场景。该结论的跨语言与自发对话外推尚未验证,受限于美式英语朗读场景。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/Zyphra/Zonos — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1240. 机器转写对了不等于人听懂了:声学与 Whisper 语义融合再做歌词可懂度回归
英文题目:Acoustic and Semantic Feature Fusion Mapping for Lyric Intelligibility Prediction
标签:#多模态学习 #主观评测 #音乐 #语音可懂度评估
评分:5.4/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音可懂度评估 | 主方法:#多模态学习
👥 作者与机构
- Yuxiang Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Guodong Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Da Shen:机构信息未能从会议 PDF 纯文本可靠映射
- Wenlin Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Weili Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Boyu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Wei-Qiang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
歌词可懂度(Lyric Intelligibility)任务输入为多风格音乐片段,输出为反映人类主观理解难易的连续分数,难点在于演唱发音变异与伴奏掩蔽使机器转写与人耳感知严重脱节。所提流水线先从波形提取能量与频谱等手工声学特征以刻画信号清晰度,再用 Whisper 编码器(Whisper Encoder)抽取蕴含音素与语义的高维时序嵌入以补充深层内容线索,接着对两类特征做时序统计与归一化并构造交互特征,最后由回归映射模块学习到主观分数的连续预测。相比仅用转写正确率的基线,该机制同时建模浅层听觉线索与深层语音语义,弥补了硬词匹配无法反映韵律与语义连贯的缺陷。在 Cadenza 2026 CLIP 数据集 5 折交叉验证下,最优 Whisper 加 CatBoost 配置取得均方根误差 RMSE 27.367 与皮尔逊相关系数 Corr 0.654,相对基线误差下降且相关性提升。该结论的适用边界受限于单一英文歌词标注集,尚未验证对多语言与强混响现场的泛化能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1241. 语音表示空间里藏着语系树吗:用六种树距离重新量一遍
英文题目:Do speech representational spaces encode language family structures?
标签:#评测协议 #可解释性 #多语言 #语音 #语言识别
评分:5.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语言识别 | 主方法:#评测协议
👥 作者与机构
- Emily Gaughan:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Bell:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入是230个语种变体共26个语系的朗读语音,输出是与Glottolog标准分类的系统发生树距离,难点在于亲缘是层级演化结构而非扁平语族标签,单层分类精度无法刻画内部分支一致性。该链条先对每种语言采样至多100条测试语音并抽取冻结编码器中间层帧级隐状态做时间均值池化与语言内平均,得到语言级向量并计算余弦距离矩阵,再用WPGMC凝聚聚类诱导预测树并与Glottolog树对齐,最后以PARTITION、QUARTET、PATH、NYE等6种距离做多视角比较。与仅判顶层语族的探测器相比,树比较能同时检验四叶拓扑、二分划分与叶间路径等多层结构差异,避免监督探测受数据不平衡与训练干预影响,因而更贴近共享创新的语言演变逻辑。在Common Voice 23.0测试集230个语种评测下,Whisper-LID的PARTITION距离指标为354,高于LDND的PARTITION距离指标314。结论仅适用于朗读脚本语音与Glottolog分类参照,对自发语音、音系形态演变及争议语系的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1242. 学到的层权重不是随机的:它们在何时跟随预训练的信息分布
英文题目:Do Learned Layer Weights Reflect Pretrained Information Structure in Self-Supervised Speech Models?
标签:#统计分析 #可解释性 #预训练 #语音 #语音识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#统计分析
👥 作者与机构
- Yaroslav Getman:机构信息未能从会议 PDF 纯文本可靠映射
- Tamás Grósz:机构信息未能从会议 PDF 纯文本可靠映射
- Mikko Kurimo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
冻结自监督语音模型做英语自动语音识别时,通常在冻结各层输出上学习加权求和,难点在于权重是否反映预训练的信息结构而非下游偶然拟合。为此先在LibriSpeech语料上按强制对齐切分音素段与词段表示,每层独立做小批量K均值聚类,再以调整互信息度量聚类与真实标签的一致性,得到层级信息曲线。另一支在ML-SUPERB冻结主干加卷积下采样与两层Transformer头的联结时序分类训练中学习经Softmax归一化的层权重,聚合前对每层做层归一化以消除尺度干扰,输出进入层序号维度的Spearman秩相关计算并做5000次置换检验。在ML-SUPERB单语英语ASR评测任务下,对比家族10分钟监督词级AMI的Spearman相关指标为0.91,高于1小时监督的Spearman相关指标0.70。与既有以单层下游性能为参照判定权重不可靠的做法不同,该链条直接以冻结表示自身的层级信息含量为参照,揭示了有限监督下权重系统性跟随预训练结构的机制意义。结论仅限冻结主干的单语ASR与音素词级AMI参照,尚未验证说话人、情感或非ASR任务,适用边界受限。原文未披露训练、推理或部署成本,明确声明正文经ChatGPT类工具润色。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1243. 语音嵌入里藏着多少语言学:声学强、结构弱的梯度式编码
标签:#统计分析 #可解释性 #语音 #语音属性识别
评分:5.4/10 | 创新 1.1/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Simon Gonzalez:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Hoang:机构信息未能从会议 PDF 纯文本可靠映射
- Hayden Ooi:机构信息未能从会议 PDF 纯文本可靠映射
- Chloe Dean:机构信息未能从会议 PDF 纯文本可靠映射
- Bradley Donnelly:机构信息未能从会议 PDF 纯文本可靠映射
- Myung Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Latchman Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Jason Littlefield:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Cawley:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Biggs:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为多语言朗读语音波形及其转写文本,输出为冻结语音嵌入对15类声学语音学与结构特征的线性可解释度,难点在于自监督表示以分布式方式混合多层级信息且无显式语言单元对应。方法先用librosa与parselmouth提取抖动shimmer与频谱形状等声学量并用包络峰值估计语速,再用Stanza自动标注计算词性熵词元复杂度从句复杂度与校正型例比,其输出特征矩阵与下一步嵌入矩阵对齐为回归目标。接着将冻结W2V-BERT 2.0输出的1024维帧序列按10秒分块并经时间维中值池化得到句向量,上一阶段的语言学特征作为监督信号进入稀疏映射学习。最后以Lasso回归学习嵌入到各特征的稀疏线性映射并在独立测试集报告R2,以非零系数刻画子空间梯度分布。与直接分析基频或共振峰的传统做法相比,该诊断不预设信号模型而探测不变结构在嵌入子空间的梯度分布,对多语言比较更具可扩展性。在FLEURS子集36种语言测试集条件下,Shimmer的指标R2为0.59,高于Clause的指标R2 0.02,CTTR的指标R2为0.43亦高于Lemma的指标R2 -.005,表明声学频谱线索强可解码而形态句法几乎无线性可及性。该结论适用边界限于朗读风格线性探测与中值池化句表示,尚未验证自发对话非线性解码或其他架构的外推。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1244. 像说话的文本反而更难听懂:合成语音可听性中的语域效应
英文题目:Listenability of Synthetic Speech: On the Effect of Linguistic Registers in Text-to-Speech Input
标签:#统计分析 #主观评测 #言语感知 #语音 #文本到语音
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#文本到语音 | 主方法:#主观评测
👥 作者与机构
- Maja Jønck Hjuler:机构信息未能从会议 PDF 纯文本可靠映射
- Tuyet Katie Nhi Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Laurianne Sitbon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究考察文本到语音合成输入的语言语域如何影响可听性,输入为谈话电台转写、简明维基、标准维基与大语言模型生成文本,输出为听者加工合成语音时的主观努力与理解记忆,难点在于文本可读性指标无法预测听觉加工代价。方法先按相同百科话题采集四类语域文本以控制主题差异,其输出文本直接作为语音合成的输入材料。接着经同一合成引擎生成澳大利亚口音语音并做最小停顿修复,输出的16段刺激以随机顺序进入被试内听音环节。然后收集5项任务负荷指数、3项投入精神努力量与3道线索回忆题,并以可读性与多维分析标注器解释语域来源。与只评自然度或可懂度的传统评估不同,该工作把Biber语域维度与听努力直接关联,揭示口语相似性不等于易听性,可指导语音交付文本选型。在47名被试16段刺激的评测设置下,电台转写的AIME得分为62.9,高于GPT生成文本的AIME得分25.2。结论适用边界受限于短百科话题、单引擎与在线无控听音条件,长篇、对话交互或多说话人场景尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1245. 检索要的是全局排序不乱:多尺度嵌入抗信道老化却怕换语言,后端校准来扶正
英文题目:On the Robustness of Speaker Embeddings for Cross-Domain Speaker Retrieval
标签:#评测协议 #鲁棒性 #语音 #音频检索
评分:5.4/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:数据集与基准 | 主任务:#音频检索 | 主方法:#评测协议
👥 作者与机构
- Chuanqi Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Xilu Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人检索的输入是跨域查询语音,输出是含大量异集干扰者的全局画廊排序,难点在于域漂移会压缩类间角间隔并颠覆排序拓扑而非仅移动二分类阈值。该工作先冻结六种预训练嵌入并以余弦相似构建全局相似矩阵,再按信道、声学环境、语言与年龄四类失配划分查询与画廊并混入干扰者,随后用精确率与平均精度评估排序稳定性,最后以自适应对称归一化做免训练后端校准。与仅优化局部验证间隔的已有评测不同,该链条显式检验了嵌入空间在大规模索引下的排序保持能力,校准通过动态选择高分背景队列来重整分数分布。在电话到网络通道失配场景评测下,ERes2Net校准后的P@10准确率为43.76%,高于校准前的P@10准确率40.70%。该结论限于VoxCeleb2预训练模型与100目标说话人抽样协议,未验证开放阈值检出与更大库容下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1246. 只靠自监督听出声调吗:普通话语境补偿对 wav2vec2.0 的反问
英文题目:Perceptual compensation for tonal context in self-supervised speech models
标签:#自监督学习 #语音学与音系 #言语感知 #语音属性识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#自监督学习
👥 作者与机构
- James Kirby:机构信息未能从会议 PDF 纯文本可靠映射
- Ioana Krehan:机构信息未能从会议 PDF 纯文本可靠映射
- Michele Gubian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究以普通话声调三与声调四两选判断伪复刻人类感知补偿实验,输入为前接声调语境加目标音节的连续统刺激,输出为声调类别判断,难点在于基频同时受声调目标、顺向协同发音、语调与音段扰动多因素决定。处理链条分三环:先从AISHELL-3测试集40位说话人抽取双音节并用Parselmouth重合成14步声调四到声调三连续统,生成约13700条连续统约192000条刺激。再将刺激送入预训练与微调两版wav2vec2.0抽取各层嵌入,最后分别计算嵌入相似度与训练线性探针,以无语境基线为锚观察语境是否推移范畴边界。与既有辅音同化补偿研究不同,本工作聚焦超音段声调语境并以边界相对基线移动方向检验补偿,突出自监督表征对语调语境的敏感性差异。在AISHELL-3语料验证集探针分类任务条件下,高层Transformer的准确率为99%,从卷积层的准确率82%升至高层Transformer的准确率99%。结论仅适用于该架构与普通话声调三四对比,尚不能外推至其他声调对、语言或架构。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1247. 从漫画格到有声漫画:检测理解与提示语音合成如何分工又在哪里受限
标签:#众包评测 #多模态模型 #语音 #文本到语音
评分:5.4/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#文本到语音 | 主方法:#众包评测
👥 作者与机构
- Sota Koshino:机构信息未能从会议 PDF 纯文本可靠映射
- Shotaro Ueji:机构信息未能从会议 PDF 纯文本可靠映射
- Shinnosuke Takamichi:机构信息未能从会议 PDF 纯文本可靠映射
- Tomohiko Nakamura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为日语漫画页面图像,输出为按阅读顺序播放的多角色表演语音,难点在于版面解析、阅读排序、说话人归属与夸张表演风格的连贯合成。系统分三段串行:先检测版块(panel)、文本区、人物脸并做文本识别,再做角色识别、阅读排序、说话人关联与情感预测,生成可扩展标记语言(Extensible Markup Language,XML)脚本;最后用提示语音合成逐句生成并拼接。情感控制由视觉语言模型(Vision-Language Model,VLM)综合当前句文本、上下文、角色脸图与所在版块图预测8类情感,拼成固定模板风格提示送入微调后的ParlerTTS。该设计的实质是以符号化脚本与自然语言提示解耦图像理解与语音生成,允许人工修正脚本形成半自动模式。在Manga109子集与40页众包评测下,自动流水线与人工校正加合成整体印象平均意见分(Mean Opinion Score,MOS)均为约2.5分,真人表演约为4.0分,表明前端自动化已接近人工脚本水平,瓶颈在合成表现力与音质。结论仅适用于短页日漫,未验证长篇一致性、跨风格与跨语言外推,原文未披露训练推理成本与延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1248. 看图说话为何最能暴露认知分数:任务条件融合与标签约束对齐的取舍
标签:#语音生物标志物 #混合专家模型 #多模态学习 #语音 #病理语音评估
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#多模态学习
👥 作者与机构
- Justyna Krzywdziak:机构信息未能从会议 PDF 纯文本可靠映射
- Władysław Średniawa:机构信息未能从会议 PDF 纯文本可靠映射
- Agnieszka Pruszek:机构信息未能从会议 PDF 纯文本可靠映射
- Wojciech Szecówka:机构信息未能从会议 PDF 纯文本可靠映射
- Michał K. Grzeszczyk:机构信息未能从会议 PDF 纯文本可靠映射
- Teresa Brzozka:机构信息未能从会议 PDF 纯文本可靠映射
- Bartłomiej Eljasiak:机构信息未能从会议 PDF 纯文本可靠映射
- Zofia Marciniak:机构信息未能从会议 PDF 纯文本可靠映射
- Łukasz Łazarski:机构信息未能从会议 PDF 纯文本可靠映射
- Mateusz Matuszewski:机构信息未能从会议 PDF 纯文本可靠映射
- Daria Hemmerling:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理基于语音的认知评估中从录音预测蒙特利尔认知评估 (Montreal Cognitive Assessment, MoCA) 与简易精神状态检查 (Mini-Mental State Examination, MMSE) 分数的回归问题,难点在于临床分数采集频率低于录音频率导致样本级监督粗糙,且轻度认知障碍 (Mild Cognitive Impairment, MCI) 与健康对照的言语差异细微而五种诱发任务异质。方法链分三步推进:先用音频、文本与视觉预训练编码器抽取模态表示并经独立投影头映射到共享融合空间,再以任务嵌入 (task embedding) 条件化的交叉注意力实现词元级交互并在图片描述 (Picture Description, PD) 任务中加入视觉分支,最后用轻量多输出回归头联合掩码加权均方误差主损失与标签条件图文对齐损失优化并以混合专家 (Mixture-of-Experts, MoE) 做任务特化。与仅把图片作特征源的做法不同,该设计把转录与图像一致性显式建模为健康对照鼓励高相似、MCI 在超过裕度时惩罚高相似的几何约束。在自采波兰语临床数据集患者级五折评估的聚合任务条件下,E6的RMSE为2.49,低于E0的RMSE 3.74,且E6的MMSE RMSE为2.14,低于E0的MMSE RMSE 2.97。结论目前仅限于该采集协议与五类任务内,跨语言、跨中心与独立队列验证尚未完成。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1249. 只看文本的上下文度量为何给人工译文打低分:场景视听标签如何修正评价
英文题目:Audiovisual CXMI: Scene-based Context Tagging for Spoken Language Translation Evaluation
标签:#评测协议 #统计分析 #主观评测 #音视频 #语音翻译
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音翻译 | 主方法:#评测协议
👥 作者与机构
- Dayeon Ku:机构信息未能从会议 PDF 纯文本可靠映射
- Hwayoung Park:机构信息未能从会议 PDF 纯文本可靠映射
- Hong Kook Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语翻译质量依赖说话人关系、物理场景、语气氛围等视听语境,输入为韩语电影对白视频与待评英译文,输出为衡量语境利用程度的分数,难点在于句子级指标无法区分译文是否用好了场景信息。所提视听条件交叉互信息先做视觉切分与说话人集合精炼得到连贯场景,再用多模态大模型与专用分类器抽取6类结构化标签,最后将标签同时喂给上下文感知与上下文无关翻译模型并比较目标句对数概率差。与纯文本条件交叉互信息只看前后文不同,该机制把视听线索显式条件化,从而在场景约束下隔离文本上下文的增益并凸显语境使用效果。在韩英电影翻译相关性评测任务下,AV-CXMI的Pearson相关为0.400,高于文本CXMI的Pearson相关-0.295。结论目前仅在韩英电影对白验证,其他语对、体裁和长时话语的外推能力尚未验证,适用边界受限于该场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1250. 资源分离而策略共享:普通话声调与辅音 Ganong 权衡的被试内比较
标签:#心理声学实验 #统计分析 #言语感知 #语音 #音频分类
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- Jiaxin LI:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Weng:机构信息未能从会议 PDF 纯文本可靠映射
- Yicheng Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Gang Peng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为普通话声调1声与2声的连续统及不送气/t/与送气/th/的嗓音起始时间VOT连续统,输出是二选一音位归类,要求解释含糊语音如何在声学与词汇知识间消解歧义。方法链分4步推进:录制自然端点并用Tandem-STRAIGHT与Praat脚本合成16步连续统,再经预实验锁定边界并选取8步用于正式测试,接着以混合呈现完成320试次的二选一分类,最后用混合效应模型估计群体效应并用个体斜率与Cohen’s d量化权衡。与以往只做辅音VOT的研究不同,本文在同一被试内平行比较了频谱线索声调与时间线索辅音,检验了加工能力与整合策略是否分离。在端点识别任务下,声调对比的准确率为98.0%,高于辅音对比的准确率97.6%。57名被试中声调与辅音的斜率和词汇效应的跨水平相关均不显著,而每种对比内部斜率越浅则词汇依赖越大,声调与辅音均呈现显著负相关。结论仅适用于高熟悉度单音节词对的安静实验室分类任务,未验证噪声、语境、第二语言或发展性人群中的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1251. 看不见说话人时也不硬指认:用\[None\] 标记统一识别哪张脸何时说了什么
标签:#自回归模型 #Transformer #音视频 #音视频语音识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音视频语音识别 | 主方法:#自回归模型
👥 作者与机构
- Naoki Makishima:机构信息未能从会议 PDF 纯文本可靠映射
- Suzuka Yamada:机构信息未能从会议 PDF 纯文本可靠映射
- Taiga Yamane:机构信息未能从会议 PDF 纯文本可靠映射
- Mana Ihori:机构信息未能从会议 PDF 纯文本可靠映射
- Tanaka Tomohiro:机构信息未能从会议 PDF 纯文本可靠映射
- Satoshi Suzuki:机构信息未能从会议 PDF 纯文本可靠映射
- Shota Orihashi:机构信息未能从会议 PDF 纯文本可靠映射
- Ryo Masumura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究含在屏与画外参与者的音视频说话人归属语音识别(audio-visual speaker-attributed speech recognition,AVSASR),输入为单通道重叠语音与多路人脸视频,输出为按说话起始先后排序的多人转写、起止时间戳与视频归属,要求部分说话人不在画面时避免错误强制关联。方法为端到端单模型序列化输出:语音编码器与视频编码器分别抽取声学与唇动表征,经可学习段嵌入区分来源后拼接,再由Transformer编码器建模跨模态依赖,最后由Transformer解码器自回归生成时间戳加文本加视频令牌序列,其中画外话语统一生成专用`
\[None\]`令牌。该标记可复用多次,而每个可见编号至多出现一次,训练时对所有音画组合等概率采样。含画外说话人的 LRS3 仿真测试中,3 话语时所提方法视觉词错率(visual word error rate,VWER)为 42.6%,优于分离式多说话人音视频语音识别加唇动检测基线的 44.9%,2 话语时为 30.4%对 34.8%;视觉时间错误率(visual time error rate,VTER)同样更优。全可见条件下与专用模型基本持平,3 话语词错率(word error rate,WER)为 33.4%对 33.5%。在含画外说话人的三话语仿真测试条件下,所提方法的VWER为42.6%,低于分离式多说话人音视频语音识别加唇动检测基线的VWER 44.9%。该结论的适用边界受限于LRS3仿真混合、固定三路视频与最多三话语的评测场景,画外多说话人时依赖音画同步的归属仍困难构成失败条件,真实远场会议与更多人数场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1252. 不用提醒也能记下来的费力时刻:手表如何把听觉吃力与疲劳变成可分类的状态
标签:#助听器 #用户研究 #生理信号 #音频分类
评分:5.4/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#用户研究
👥 作者与机构
- David Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Marisa Poulos:机构信息未能从会议 PDF 纯文本可靠映射
- Erin O’Neill:机构信息未能从会议 PDF 纯文本可靠映射
- Qi Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Ivan Iotzov:机构信息未能从会议 PDF 纯文本可靠映射
- Jorge Mejia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为听损成人在日常生活中经Apple Watch采集的心率、心率变异性、腕部声学描述子与睡眠数据,输出为瞬时聆听努力是否偏高与当天疲劳是否偏高,难点在于消费级信号粗糙、场景不可控且主观标签稀疏漂移。先由手表端超简生态瞬时评估以困难聆听时刻为输入,负责自发记录努力标签并同步提取声学特征,输出瞬时标签-声学对齐记录。再由日级聚合与二值化重构以上述对齐记录联同被动生理监测及手机端晨间睡眠与晚间疲劳调查为输入,负责聚合成睡眠、生理与声暴露日特征并重构为高努力与高疲劳二分类标签,输出可建模的日级样本。最后由分类与留一被试验证以上述日级样本为输入,负责用随机欠采样提升训练努力模型、用随机森林训练疲劳模型并检验个体泛化,输出泛化性能估计以判断野外可用性。与仅依赖实验室生理或声学的方法不同,该工作将内在生理负荷与客观声环境在真实聆听时刻对齐建模,直接面向用户状态感知声处理,但仍受限于腕部粗粒度传感。在每日疲劳评估任务下,非助听器使用者的疲劳得分为4.41,低于助听器使用者的得分5.55。该结论仅适用于轻中度对称感音神经性听损的小样本、缺失约32%日记录的场景,未验证跨设备、重度听损与长期纵向外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1253. 弯了但低频不变:声道弯曲只在非均匀截面和高频才激起横向模式
英文题目:Influence of Vocal Tract Curvature on Speech Acoustics: A Three-Dimensional FEM Analysis
标签:#信号处理 #发声与构音 #语音 #语音合成
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音合成 | 主方法:#信号处理
👥 作者与机构
- Debasish Ray Mohapatra:机构信息未能从会议 PDF 纯文本可靠映射
- Sidney Fels:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以三维弯曲声管几何为输入,以声道传递函数与共振模态结构为输出,难点在于弯曲、截面变化与开口辐射耦合,难以分离弯曲本身的声学贡献。方法先构建均匀与非均匀截面两类弯曲声管,并固定中心线长度为17cm以控制变量,使几何差异仅来自弯曲强度。接着采用贴体四面体网格的三维有限元时域波传播求解器计算管内压力演化,记录口端压力并求解传递函数。最后对比弯曲与直管传递函数,并结合正中矢状面压力分布判定平面波假设是否失效,从而定位反共振来源。与将声道简化为直管的一维与二维模型相比,该机制用显式弯曲波导保留曲率传播,能激发横向高阶模态并产生反共振,具有更真实的物理意义。在最高至14 kHz传递函数对比的设置下,非均匀弯曲管高频共振偏移条件的频率指标为10 kHz,高于低频平面波主导条件的频率指标8 kHz。结论边界是仅验证单个元音
\[A\]的圆形截面理想管,真实不规则截面、侧腔与唇辐射尚未纳入。其适用边界受限于理想圆截面与单个元音条件,复杂构形外推尚未验证。原文未披露训练、推理或部署成本,本研究为物理仿真而无学习训练。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1254. 按母语分图:用有向加权混淆统计改写发音检错的语言学先验
英文题目:Domain-Aware Mispronunciation Detection and Diagnosis Using Language-Specific Statistical Graphs
标签:#教育 #图神经网络 #多语言 #语音 #语音属性识别
评分:5.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#图神经网络
👥 作者与机构
- Hanh Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Tuong Tu Huu:机构信息未能从会议 PDF 纯文本可靠映射
- Huan Vu:机构信息未能从会议 PDF 纯文本可靠映射
- Thien Van Luong:机构信息未能从会议 PDF 纯文本可靠映射
- Tien Cuong Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Trang Thu Thi Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
发音错误检测与诊断(Mispronunciation Detection and Diagnosis,MDD)需以学习者语音与标准音素序列为输入,输出音素级错误位置与错误类型,其难点在于不同母语(First Language,L1)背景呈现系统性但方向不对称的替代模式。该文先从训练集对齐中统计目标音素被误读为各变体的条件概率,构建按母语分组的有向加权混淆图,再以共享参数的图卷积网络(Graph Convolutional Network,GCN)在该图上传播得到母语相关的音素嵌入表,接着以声学编码输出为查询、以查表所得语言学嵌入为键值做交叉注意力融合,最后拼接声学与上下文特征做基于联结时序分类(Connectionist Temporal Classification,CTC)的音素预测。与同类无向等权类别图不同,该设计显式编码混淆方向与频率并按批次母语标签动态切换图结构。在 L2-ARCTIC 基准上,所提 MDD-LSSG(Language-Specific Statistical Graph)在检测子任务取得 F1 值为 59.52%,高于最强基线 CAT-GCN-MDD 的 58.24%,诊断错误率(Diagnosis Error Rate,DER)为 20.88%,与最强基线的 20.84% 基本持平。该结论目前仅在 6 位测试说话人覆盖的 6 种母语划分下成立,未验证对未见母语、儿童语音或自发语音的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1255. 小语种自己建平台:胡拉语社区如何把翻译、审校和数据治理留在村里
英文题目:Vavanagi: a Community-run Platform for Documentation of the Hula Language in Papua New Guinea
标签:#数据集构建 #低资源 #多语言 #语音 #语音翻译
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音翻译 | 主方法:#数据集构建
👥 作者与机构
- Bri Olewale:机构信息未能从会议 PDF 纯文本可靠映射
- Raphael Merx:机构信息未能从会议 PDF 纯文本可靠映射
- Ekaterina Vylomova:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
Vavanagi面向胡拉语Hula与英语间平行文本与语音采集,输入为英语源句,输出为经审核的胡拉语文本译文与配套录音,难点在于书写不熟的老年流利者与数字熟练但流利度下降的青年之间能力错位。方法链第一步由管理员导入英语数据并启动采集任务,其输出的待译句列表直接进入译者工作池。第二步由译者提交胡拉语文本与语音翻译,其提交物随即进入长者主导的评审队列接受修订与反馈。第三步由评审者标错评论并退回修订,通过的译文再由管理员导出归档,云端数据库与角色权限支撑全流程追踪。相对外部主导的咨询式文档模式,其机制差异在于发起设计实施与数据治理均内嵌于胡拉社区结构并配套社区融资激励,因而更利于代际衔接与数据主权实践。在系统可用性评测设置下,“希望频繁使用系统”维度的得分为3.4/5,高于“系统复杂”维度的得分1.5/5。该结论目前仅适用于单一语言社区的受控众包场景,尚未验证跨语言可迁移性与下游建模效果。原文未披露训练、推理或部署成本,技术支出总量低于20美元。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1256. 噪声下别让坏模态带偏好模态:用跨模态特征重建学抗噪的音视频情感识别
英文题目:Audio-Visual Feature Reconstruction Pretraining for Noise-Robust Emotion Recognition
标签:#多模态学习 #鲁棒性 #预训练 #音视频 #语音情感识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Ivan Halim Parmonangan:机构信息未能从会议 PDF 纯文本可靠映射
- Tharindu Fernando:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Denman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为同步语音与人脸视频,输出为8类离散情绪标签,难点是背景噪声、混响、削波丢包与冻结撕裂等退化会让受损模态主导融合并压制干净模态。该方法先用冻结的语音编码器EAT-base与视频编码器Timesformer-Base抽取潜特征,再经各自3层Mamba2状态空间模型编码器做时序建模并映射到统一维度。接着以2层双向交叉注意力让音频以注意力池化后视频为条件、视频以音频为条件做信息交换,其输出进入独立反投影加3层Mamba2解码器从带噪双模态重构干净特征。两阶段自监督预训练先只训单模态编码器做模态内去噪80轮,再冻结编码器训融合与解码器200轮并用梯度归一化GradNorm平衡双模态均方误差损失,下游则冻结预训练表征另训注意力池化加GeLU加余弦分类器,音频与视频分支独立评测。与已有对齐式音视频预训练的关键差异是显式保留输入细节的跨模态条件去噪重构,而非只学跨模态语义对应,这使噪声鲁棒性来自干净模态对受损模态的直接修复。在RAVDESS基准下,无预训练含噪音频的准确率为39%,低于无预训练含噪视频的准确率79%。结论仅适用于短句摆拍英语情绪数据与特征级合成退化,向自发情绪、长时对话与真实信道失配的外推尚未验证。原文未披露训练时长、推理时延与部署成本,仅给出参数量与计算量对比。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1257. 抬得最高的人最难认:女性自主提调与合成提调的说话人识别效应
标签:#统计分析 #鲁棒性 #发声与构音 #语音 #说话人验证
评分:5.4/10 | 创新 1.1/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#说话人验证 | 主方法:#统计分析
👥 作者与机构
- Chloe Patman:机构信息未能从会议 PDF 纯文本可靠映射
- Linda Gerlach:机构信息未能从会议 PDF 纯文本可靠映射
- Anil Alexander:机构信息未能从会议 PDF 纯文本可靠映射
- Finnian Kelly:机构信息未能从会议 PDF 纯文本可靠映射
- Kirsty McDougall:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理法庭场景下女性说话人故意抬高音高后的说话人验证问题,输入为默认与抬高音高的朗读语音对,输出为是否同一说话人的相似度与系统错误率,难点在于抬高策略因人而异且女性基线基频已较高。方法链分为三步:先用频谱x向量系统VOCALISE生成跨条件相似度分数与动物园图,其输出的易混说话人直接进入下一步的个案剖析。再用Praat长时基频分析与听辨分析刻画每位说话人的抬高幅度、动态范围与音质策略,最后在更大样本上用合成基频提升做隔离对照以检验纯音高因素。与既有男性研究相比,本文机制差异在于同时考察音高极端程度、音高动态范围受限以及喉部紧张等协同策略,而非仅看基频均值偏移。在PASR女性语料下,默认对抬高比较的等错误率为14.4%,高于默认对默认比较的等错误率0.0%,且误差主要由个别说话人驱动。该结论在自发语音中的泛化能力尚未验证,且合成对照受限于未能复现真实伪装策略。结论仅适用于受控朗读与训练有素的发音人,无法直接外推至自发情感尖叫或普通伪装者。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1258. 只净化参考信号、不碰控制滤波器:因果留声有源降噪的参考增强路线
英文题目:A Causal Reference-Enhanced Keep-Speech Active Noise Control Method
标签:#自适应滤波 #严格因果 #语音 #主动降噪
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#主动降噪 | 主方法:#自适应滤波
👥 作者与机构
- Li Rao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaobin Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yiming He:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Haishan Zou:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
保持语音主动降噪输入是混有环境噪声与通话语音的参考信号\(xv&\#40;n&\#41;=x&\#40;n&\#41;\+vr&\#40;n&\#41;\)和耳内误差信号\(e&\#40;n&\#41;=d&\#40;n&\#41;\+ve&\#40;n&\#41;\+y&\#40;n&\#41;\),输出是保留语音并抑制噪声的耳内信号,难点是参考端语音泄漏会使抗噪声携带语音成分并抵消目标语音,且耳机不允许帧级未来视。第一步由误差重构负责去除控制声贡献,用误差信号减去估计次级通路卷积控制信号得到含噪语音估计\(\\hat\{dv\}&\#40;n&\#41;=e&\#40;n&\#41;\-\\hat\{s\}u&\#40;n&\#41;\),为增强提供耳端上下文。第二步由因果WaveNet负责参考增强,以原始参考\(xv\)与估计\(\\hat\{dv\}\)为条件输出保留噪声并抑制语音的增强参考\(\\hat\{x\}=g\_\{\\phi\}&\#40;xv,\\hat\{dv\}&\#41;\),第三步由传统FIR滤波器负责抵消,将增强参考滤波为\(u&\#40;n&\#41;=w\\hat\{x\}&\#40;n&\#41;\)并经次级通路\(s\)辐射,RLS自适应更新\(w\)。与直接替换控制滤波器的DeepANC不同,该链路保留传统滤波器且步长为1加因果填充故无附加算法延迟,误差域损失\(Lenh\)将优化对准联合降噪保语音目标。在带限噪声测试集下,RSE-based KSANC(Lenh)的STOI为88.67%,高于未处理的STOI 86.89%。结论限于 8 kHz 采样右耳单通道实测耳机脉冲响应、讲者集中正面附近、混响时间约 0.25 s,未做双耳、多讲者、强混响与盲听主观评价。原文承认 WaveNet 参数量大,需优化压缩才能部署于资源受限耳机。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1259. 高频能量为何能暴露儿童卷舌擦音的前移:从 16 kHz 噪声能量到发音位置比值
标签:#统计分析 #语音学与音系 #言语障碍 #语音 #病理语音评估
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Oliwia Skórzewska:机构信息未能从会议 PDF 纯文本可靠映射
- Maria Filipek:机构信息未能从会议 PDF 纯文本可靠映射
- Wojciech Pieniążek:机构信息未能从会议 PDF 纯文本可靠映射
- Zuzanna Miodońska:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童卷舌擦音与塞擦音的病理替代会改变摩擦噪声的频谱分布,输入为切分出的擦音段波形,输出为对构音位置偏移的声学判别,难点在于儿童声道短、个体发育差异大且病理样本稀少不平衡。本研究先对波形归一化并分帧取中段以抑制协同构音,再提取噪声能量与摩擦共振峰积分能量及其比值,最后以构音位置为固定效应、说话人与词为随机效应的线性混合效应模型逐特征检验。与传统只看7 kHz以下低频的分析不同,该方法将诊断线索扩展到高频并用比值刻画能量再分配,对浊音与发音方式更稳健。在波兰学龄前儿童卷舌音语料任务下,聚合特征FNER12_23的指标边际R2为20%,高于单子带NE1的指标边际R2 15%。该比值特征在浊擦音与塞擦音上均保持判别力,其适用边界受限于共振峰划分与波兰语三列齿音体系。结论限于波兰语卷舌音的四类构音位置,未纳入牙齿解剖因素与纵向发育验证,外推到其他语言需重估共振峰划分。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1260. 排卵期与黄体期能从朗读声中分开吗:手工声学特征小幅领先、嵌入特征回到机会水平
英文题目:Predicting Menstrual Cycle Phases from Speech: A Paralinguistic Approach
标签:#语音生物标志物 #统计分析 #语音 #语音属性识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Anika A. Spiesberger:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Triantafyllopoulos:机构信息未能从会议 PDF 纯文本可靠映射
- Melanie Weirich:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为德语朗读语音,输出为排卵期 ovulation 与黄体期 luteal 的二分类标签,难点在于激素引起的发声变化微弱且呈多变量分布,单一声学指标难以稳定区分。方法链分为四步:按逆向周期日定时采集双阶段语音并同步检测唾液激素,再经人工句子切分得到句级样本,接着并行提取可解释声学集与情感微调嵌入,最后用嵌套留一组交叉验证训练多个浅层分类器并以多数投票得到被试级预测。相对既往单变量 t 检验思路,关键机制差异在于用高维建模捕捉特征交互,并检验个体激素水平与年龄对可预测性的调节作用。在包含 76 名自然周期女性的德语朗读数据集上,随机森林 Random Forest 结合日内瓦极简声学参数集 eGeMAPS 取得 62.5 % 准确率,显著高于嵌入表示的随机水平。结论仅适用于受控朗读与双阶段区分,未验证自发对话、多阶段连续追踪与跨语言泛化,且响度等效应可能受录音条件混杂。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1261. 训练中途如何知道口音学对了:用元音空间几何补上损失曲线的口音盲区
英文题目:Phonetically Grounded Vowel Space Metrics for Evaluating Synthetic Speech During TTS Model Training
标签:#评测协议 #模型评估 #语音学与音系 #语音 #文本到语音
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#文本到语音 | 主方法:#评测协议
👥 作者与机构
- Pasindu Udawatta:机构信息未能从会议 PDF 纯文本可靠映射
- Jesin James:机构信息未能从会议 PDF 纯文本可靠映射
- Sally Akevai Nicholas:机构信息未能从会议 PDF 纯文本可靠映射
- B. T. Balamurali:机构信息未能从会议 PDF 纯文本可靠映射
- C. I. Watson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为文本到语音(Text-to-Speech,TTS)微调过程中不同检查点的合成语音,输出为与目标口音相似程度对应的客观分数,难点在于训练损失曲线缺乏语言学可解释性且无法反映口音感知变化。方法链分为三步:先用WebMAUS切分与Parselmouth提取共振峰(Formant)在音段中点求平均得到元音空间坐标,再分别计算合成与真实角元音多边形的面积交叠与普鲁克分析(Procrustes Analysis)对齐残差,最后将两指标时序曲线与听感口音相似度评分做关联验证。与仅做定性可视化的既有工作相比,该机制将形状相似显式量化为可追踪的面积共享与尺度位置旋转不变的几何偏差,具有训练过程可监测的实际意义。在新西兰英语8个检查点上元音空间交叠(Vowel Space Overlap)与平均口音相似度的Pearson相关为0.72,普鲁克归一化差异(Procrustes Normalised Disparity)相关为-0.79,均达到显著水平。结论目前仅适用于以元音差异为主的英语口音Tacotron 2微调场景,未验证辅音主导语言、协同发音变化及现代非自回归架构的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1262. 跨语言也认得出是谁:说话人嵌入与人耳判断共用声学线索
标签:#人类参与评测 #统计分析 #言语感知 #跨语言 #说话人验证
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#说话人验证 | 主方法:#统计分析
👥 作者与机构
- Tianze Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiyang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoming Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Volker Dellwo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
以粤语与英语双语语音对为输入,输出说话人相似度并检验其跨语言泛化,难点在于语言切换会改变音高、共振峰与谐噪能量结构从而干扰身份线索整合。方法链分四步:先复用已有感知评分获取人类相似结构,再用VoiceSauce提取29维声学变量并构造声学差异矩阵,接着用Wespeaker抽取18个模型说话人嵌入并计算余弦相似,最后以线性混合模型与表征相似性分析对齐机器、人类与声学三方结构。与仅做单语验证的已有工作不同,本文将语言切换作为显式操纵并对比粤语微调前后,以检验泛化是否依赖共享声学线索的语言敏感加权。在粤语-英语双语语音相似性评测条件下,同说话人对的余弦相似度得分为0.78,高于异说话人对的余弦相似度得分0.60。声学对齐进一步显示粤语侧依赖F2、F4与高频谐波能量,英语侧依赖基频、共振峰离散度与倒谱峰突出度,而混合语言对呈均衡模式,印证了语言敏感加权机制。结论仅适用于短时女性高熟练双语者节日用语,未验证长语音、多说话人、男性及大规模粤语训练的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1263. 一个全局模型不够用:按说话人相似度分别平均构音障碍语音模型
英文题目:Towards Personalized Federated Learning for Dysarthric Speech Recognition
标签:#联邦学习 #隐私保护 #言语障碍 #语音 #语音识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#联邦学习
👥 作者与机构
- Tao Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Mengzhe Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Jiajun Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Shujie Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Xunying Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为构音障碍者的孤立词(UASpeech)与连续语音(TORGO)声学波形,输出为文字转写,难点在于数据稀缺、与正常语音严重失配、说话人间障碍程度与可懂度差异大,且医疗语音隐私敏感不宜集中。方法链分为三步:先将 HuBERT-large 拆为底层的说话人无关(Speaker-Independent,SI)部分与顶层的说话人相关(Speaker-Dependent,SD)部分;再对 SI 部分做按样本量加权的联邦平均以学习共享声学表示;最后对 SD 部分做数量权重与说话人相似度权重的凸组合个性化聚合,相似度来自参数差余弦或 SI 输出嵌入余弦。与强制全层共享的正则化联邦平均(Federated Averaging,FedAvg)相比,关键差异是 SD 层不再全局一致而是向相似邻居倾斜。在 UASpeech 上相对正则化 FedAvg 获得 0.99% 绝对词错率(Word Error Rate,WER)下降(31.45%到30.46%,3.15%相对),在 TORGO 上获得 0.56% 绝对下降(11.83%到11.27%,4.73%相对),均通过匹配对句子片段词错率(Matched Pairs Sentence-Segment Word Error,MAPSSWE)显著性检验(\(\\alpha=0\.05\))。结论仅在 16 与 8 个说话人的英语构音障碍语料及 HuBERT-large-ls960-ft 联结时序分类(Connectionist Temporal Classification,CTC)微调设置下验证,未验证跨语言、老年语音与大规模客户端场景。原文未披露学习率、优化器、批量大小、解码策略与训练推理成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1264. 有物理基础的音高联想,为什么会被性别经验推着走
英文题目:Listeners’ gendered experiences and beliefs affect iconic pitch associations
标签:#心理声学实验 #韵律 #社会语音学 #言语感知 #音频理解
评分:5.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#音频理解 | 主方法:#心理声学实验
👥 作者与机构
- Sasha Calhoun:机构信息未能从会议 PDF 纯文本可靠映射
- Paul Warren:机构信息未能从会议 PDF 纯文本可靠映射
- Sara Gilbert:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为英语母语成人听者对嗓音音高与身体尺寸的内隐联想,输出为该联想强度能否被短时经验改变以及是否受听者性别与嗓音性别调节,难点在于物理相似性与性别意识形态纠缠难分。方法链分三步:先用人工智能生成的虚构大与小生物图片搭配语音合成的弱与不确定语句和高低重合成版本构建聚合启动与分离启动以激活尺寸与情感链接,再用目标加颜色尺寸相近干扰项的记忆辨认任务保证编码有效,最后用动物图片尺寸分类与无意义词音高分类的内隐联想测验比较相容组块与不相容组块反应时差异。相对既往仅报告群体相关的频率编码观察,本研究引入因果启动并交叉听者性别与嗓音性别,具有机制检验意义。原文未提供可核对的关键定量结果。结论仅适用于英母语成人对频率编码式音高与尺寸联想的短时可塑性,未验证自然语调、长期信念与跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1265. 基频被压缩时促声调还剩什么:火济晋语 T1-T5 的多线索分离
英文题目:The role of phonation type in Chinese Jin tones: a study using acoustic metrics
标签:#统计分析 #发声与构音 #语音学与音系 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Xiaojing Du:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
研究输入为霍吉晋语孤立单音节声学样本,输出为T1与历史入声T5的可分性判断,难点是两者f0空间高度压缩且T5韵尾常伴不规则激励与弱周期性,导致晚段f0估计欠定。首先在统一低f0搜索条件下并置Praat自相关、YIN与REAPER做九点时间归一化f0追踪,以跨算法分歧诊断偏移段周期模糊;接着提取TBU时长与低频谐噪比HNR05及共振峰校正谐波差H∗1-H∗2等发声度量并做标准化,前步追踪结果与本步度量共同构成特征输入;最后用度量多维尺度分析比较f0单线索与多线索音系空间,实现从诊断到建模的衔接。相对单f0描写,该工作把追踪器间分歧视为周期模糊的诊断信号而非测量误差,并将声学空间离散度与发声维度引入入声身份建模,具有补充脆弱f0的实际意义。在17位发音人孤立单音节语料下,全线索集的离散指数指标为约8.12,高于f0单线索的离散指数指标约2.02。结论仅限于产出端声学可分性,未验证听者是否利用发声线索做范畴感知,也未证明偏移段f0真值。该结论适用边界受限于产出端声学分析,听者范畴感知整合机制尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1266. 自回归解码不是模型附带品:用递推关系重划语音生成的边界
英文题目:A Generalized Formalism of Auto-Regressive Decoding for Speech Processing
标签:#自回归模型 #形式化分析 #理论分析 #语音识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 0.7/1.5 | 实验充分 0.3/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:理论研究 | 主任务:#语音识别 | 主方法:#自回归模型
👥 作者与机构
- Julia Gachot:机构信息未能从会议 PDF 纯文本可靠映射
- Philipp Allgeuer:机构信息未能从会议 PDF 纯文本可靠映射
- Marie S. Bauer:机构信息未能从会议 PDF 纯文本可靠映射
- Stefan Wermter:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音序列预测的输入是声学特征或文本提示,输出是离散词元序列,难点在于推理时需在指数级组合空间中高效逼近目标函数局部极大并同时兼顾推理速度与输出多样性。本文提出以递推关系为中心的广义自回归(Auto-Regressive, AR)形式主义,将每次迭代拆为估计条件概率分布、基于目标函数聚合解释的决策、先验更新与终止检验四步,前一步输出的候选序列集与先验状态直接进入下一步估计,并给出模型与解码的纳入准则与分步报告规范。该框架与传统最大后验束搜索视角的关键差异在于不再按确定性与随机性二分,而是按温度采样与束搜索等方法的贡献所在步骤定位差异,使跨语音任务的方法比较与模块化消融成为可能。原文未提供可核对的关键定量结果。该结论目前仅适用于可建模为概率约束下随机整数问题(Stochastic Integer Problem under Probabilistic Constraints, SIPC)的离散组合优化任务,对连续输出与不估计条件概率的模型的适用边界尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1267. 二语者向谁靠拢取决于练什么:人类声音带塞音,真人合成音带节奏与时长对比
英文题目:L2 Speakers Accommodate Differently to AI and Human Voices Across Phonetic Features
标签:#人类参与评测 #语言习得 #语音学与音系 #语音 #语音交互
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音交互 | 主方法:#人类参与评测
👥 作者与机构
- Nan Gan:机构信息未能从会议 PDF 纯文本可靠映射
- Elisa Pellegrino:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理L2英语学习者听模型句复述时语音向模型靠拢的趋同问题,输入为真人与合成模型句音频,输出为学习者复述音频相对模型的声学距离变化,难点在于趋同高度依赖特征且易与基线起点差异和语速混淆。方法链分三步:先以基线朗读加双会话交叉跟读采集配对语音并做强制对齐与声学提取,再对嗓音起始时间(Voice Onset Time, VOT)、紧张-松弛元音时长比与频谱距离及节奏构造趋同量,最后用线性混合效应模型检验模型语音类型效应并控制基线距离。与既有母语者研究多用旧式拼接与参数合成语音和单一时长特征不同,本研究引入现代神经合成语音并同时覆盖辅音时长、元音对比与节奏且隐藏语音身份。跟读真人语音的归一化VOT趋同更强,而跟读合成语音的元音时长比与强度节奏趋同更强。在双会话跟读任务设置下,会话1时长节奏趋同指标的估计为0.278,高于会话2时长节奏趋同指标的估计0.027。结论仅适用于中国女性中高级英语学习者跟读女性美音句子的短时模仿,未验证交互对话与长期习得迁移。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1268. 全频带只算一次,子带逐个扫描:0–8 kHz 哪里最认识说话人
英文题目:Band-Limited Cepstral Analysis of Speaker Sensitivity in Forensic Voice Comparison
标签:#信号处理 #可解释性 #语音 #说话人验证
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#说话人验证 | 主方法:#信号处理
👥 作者与机构
- Shunichi Ishihara:机构信息未能从会议 PDF 纯文本可靠映射
- Satoru Tsuge:机构信息未能从会议 PDF 纯文本可靠映射
- Frantz Clermont:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
法庭语音比对需输入约30秒跑步语音并输出似然比,难点在于说话人信息在频谱上分布不均且缺乏可解释定位。方法先对语音分帧做短时谱分析并提取14维全带线性频率倒谱系数,拼接至约6000帧构成全带特征矩阵。接着经线性变换将全带倒谱映射为任意0.6kHz或1.2kHz子带的带限倒谱系数,保持各子带等权重而无需重分析原始信号。最后将各子带特征送入高斯混合模型通用背景模型建模并经逻辑回归校准为似然比,按子带扫描与似然比融合评估信息量。与需重分析原始信号的子带滤波方法不同,该变换直接复用全带倒谱矩阵并可自由选择子带位置与宽度,具有灵活定位意义。在0–8kHz子带扫描评测下,最终0.6kHz子带的C_llr指标为0.82571,高于最终1.2kHz子带的C_llr指标0.67020。结论仅适用于男性英语长时跑步语音与0至8 kHz范围,未验证女性、跨语言、短时及电话信道情形。原文未披露训练、推理或部署成本,仅声明生成式AI只用于文字润色,BLCC工具可向通讯作者索取。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1269. 芬兰语自然语音的效价要看说了什么,唤醒度主要听怎么说
英文题目:Looking for Affect in Spontaneous Finnish Speech through Linguistic Interpretability
标签:#多模态学习 #可解释性 #言语感知 #语音 #语音情感识别
评分:5.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#多模态学习
👥 作者与机构
- Kalle Lahtinen:机构信息未能从会议 PDF 纯文本可靠映射
- Liisa Mustanoja:机构信息未能从会议 PDF 纯文本可靠映射
- Okko Räsänen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究自发芬兰语中人类感知的效价与唤醒度建模,输入为1至20秒语音片段及其口语转写,输出为
\[\-1\.0,1\.0\]区间连续评分,难点在于自发情感模糊、标注主观且芬兰语口语变异大,既有研究割裂为声学或文本两条线。第一步做数据准备与转写对照,将口语芬兰语转写保留为CF并经GPT 4.1规范化为标准芬兰语SF,再经Trankit做词形与句法预处理,其输出直接作为文本特征入口。第二步做冻结式离线特征提取,文本侧得ModernBERT嵌入、FinnSentiment三维后验、36维词典向量与语言学归一化向量,音频侧得ExHuBERT嵌入与88维eGeMAPS功能集,并可拼接另一维度人工感知分。第三步做浅层回归评估,将拼接特征送入MLP分别回归效价与唤醒度,以L=1-CCC为损失,按说话人分组评估127种组合。与已有方法相比,该工作未提出新编码器,差异在于冻结预训练表示并显式对照隐式嵌入与可解释词典句法特征,同时对照CF与SF以分离声学与语言贡献。在FinnAffect测试集评测设置下,音频组合的CCC指标为0.686±0.019,高于文本组合的CCC指标为0.196±0.036。结论仅适用于芬兰语自发对话与主题独白场景,且依赖人工转写与人工跨维度分数,跨语言与全自动流水线外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://huggingface.co/fergusq/finbert-finnsentiment — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1270. 归一化把跨语言差异抹掉时,为何反而更像不懂英语的西班牙听者
标签:#统计分析 #言语感知 #跨语言 #语音 #音频分类
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#统计分析
👥 作者与机构
- Jooyoung Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Kakeru Yazawa:机构信息未能从会议 PDF 纯文本可靠映射
- James Whang:机构信息未能从会议 PDF 纯文本可靠映射
- Paola Escudero:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为墨西哥西班牙语与美国英语元音在中点处提取的第1与第2共振峰,输出为英语元音被映射到5个西班牙语范畴的分布,难点在于说话人声道差异与跨语言音系差异纠缠,且零基础听者缺乏目标语归一化参照。方法链分3步:先对西英数据施加同一种说话人归一化,英语侧参数全部来自西班牙语样本估计,其输出直接作为下一步模型的输入特征。再用归一化后F1与F2训练多层感知器完成西班牙语5分类,其输出的冻结分类器进入最后一步。最后将英语token送入冻结模型生成5×9感知矩阵并与人类数据对比;与保留组间差异的Nearey对数均值法相比,Lobanov按说话人做Z得分标准化,理论上更易坍缩跨语言差异却反而最贴合零基础听者。在美式英语9元音映射任务下,Lobanov的平均绝对误差为13.93,低于Raw Hz的平均绝对误差21.07。该结论仅适用于无英语经验的初始感知阶段,未验证加入F3与时长后或进阶学习者是否反转。因此其适用边界受限于初始阶段,进阶学习者与多线索条件的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1271. 不分类也能度量变化:用反事实位移方差刻画鸣禽发声可塑性
英文题目:Trajectory Variance: An Unsupervised Measure of Developmental Vocal Plasticity in Birdsong
标签:#无监督学习 #变分自编码器 #生物声学 #音频分类
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#无监督学习
👥 作者与机构
- Kanghwi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为40至101日龄斑胸草雀无类型标签的单次发声频谱,输出为每个发声的发展可塑性标量得分,难点在于同一发声无法跨年龄纵向追踪且缺乏类别监督。变分自编码器先将频谱压缩为128维隐向量,为年龄条件建模提供紧凑表征,其输出隐向量连同记录年龄直接进入下一步。位移模型以源隐向量与源和目标年龄为条件预测隐偏移,训练监督来自小批量内平方欧氏代价加匈牙利算法的最优传输配对,同一源在7个均匀目标年龄的反事实隐向量按维度求跨年龄方差再求和即得轨迹方差。与高斯最优传输、每年龄k近邻和每年龄最优分配三类非参数基线相比,学习模型做样本特异的非线性预测,而基线只做群体仿射漂移或检索,因而刻画个体发声将如何变化而非仅检索相似他者。在每只鸟3K子集的鸣唱与叫声分离评测下,位移模型的指标Cohen’s d为+.57,高于高斯最优传输的指标Cohen’s d +.06。轨迹方差还与频谱平坦度呈负相关r为-.48至-.75,与时长r为0.70至0.80,故分离指标均在时长残差化后计算以排除长度混杂。该结论的适用边界受限于无纵向真值、时长混杂未完全解耦、启发式标注约83%一致以及仅单一群体三只鸟,跨物种与人类语音外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1272. 耳周麦克风多听到了什么:颈部皮肤振动的低频二次声源
英文题目:The Effect of Neck Skin Vibration on the Periauricular Acoustic Receiver
标签:#信号处理 #发声与构音 #麦克风阵列 #语音 #声场重建
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#声场重建 | 主方法:#信号处理
👥 作者与机构
- Ruoyan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhao Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Fan Fan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自发声耳周采集的输入是口腔辐射与颈部皮肤振动叠加的混合声场,输出是各测点相对口前参考的相对传递函数,难点在于活体中两类源始终耦合而难以分离定量。作者先用GRAS KEMAR假头口部模拟器播放20 Hz至20 kHz扫频信号建立无振动的纯口腔辐射基线,其输出作为验证仿真的对照参考。再对2名真人持续发声做多通道同步录音并以协方差特征分解估计相对传递函数,得到的实测传递进入与仿真的对比环节。接着用自研GPU加速边界元法对三维扫描头模施加口部均匀声压激励仿真纯口腔场,并以假头实测吻合验证模型后将真人实测系统性偏离归因于颈振。相对已有仅把口腔视为唯一声源的自声仿真,该研究的关键机制差异是引入颈部皮肤振动经空气二次辐射到达耳周接收器的附加路径解释,并发现越靠近颈部的耳下测点偏离越大。在人体持续发声语音评测设置下,高频能量可忽略条件的频率指标为4000 Hz,高于低频信噪比有效条件的频率指标200 Hz。结论仅适用于200 Hz至1000 Hz低频段的近耳贴肤接收场景,无法外推至高频、鼻音辐射、不同发声强度与广泛人群。其适用边界受限于仅2名受试者与未校准传感器,尚未验证更广泛人群与发声强度的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1273. 一个齿音对一个前鼻化音:汤戈阿纳卡纳曼加语舌冠塞音是否靠嗓音区分
英文题目:Phonetic evidence for contrastive voicing in Nakanamanga coronal plosives
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:5.3/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Shubo Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
纳卡纳曼加语Tongoa变体是否存在清齿塞音/t̪/与浊前鼻化龈后塞音/ⁿd/的对立长期悬置,本文输入为词中第二音节声母位置的目标冠音录音,输出为清浊与前鼻化属性的声学判决,难点在于鼻闭塞与口闭塞边界模糊及na-前缀与动词交替限制词首最小对立获取并受元音长短与音节数干扰。方法链先基于词典预研构建12个双音节CV.CV词表并用图片加比斯拉马语提示在固定载体句中诱发五次重复以获得可控语料,其输出进入Praat多层人工切分与测量步骤提取嗓音起始时间与闭塞时长并对/ⁿd/以强度下降中点划分鼻闭塞与口闭塞。切分测量结果再进入线性混合效应模型步骤,以音位音节数元音长短为固定效应说话人与词汇为随机截距分离音位效应。与既往纯听辨描写不同,该链条把前鼻化比例与预浊量直接对应到音位主张,使历史重构假设可被声学量证伪。在词中第二音节声母位置443个词中token测试条件指标下,/t̪/的VOT指标为29 ms,高于/ⁿd/的VOT指标-98 ms。结论目前仅适用于词中位置 Tongoa 变体,Nguna 变体与调音部位不对称机制尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://catalog.paradisec.org.au/repository/SLI01 — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1274. 人群噪声里听微笑:敏感度下降与判断变保守如何共同起作用
英文题目:Hearing Smiles in the Crowd: How Babble Noise Shapes Smiled Speech Perception
标签:#心理声学实验 #统计分析 #言语感知 #语音 #语音属性识别
评分:5.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Rong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Esther Janse:机构信息未能从会议 PDF 纯文本可靠映射
- Dirk Heylen:机构信息未能从会议 PDF 纯文本可靠映射
- Khiet Truong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究无视觉时多人babble噪声下微笑言语的听觉感知,输入为愉悦式微笑、机械咧嘴与中性朗读语句,输出为两项二选一行为判断,难点在于声学掩蔽导致感觉证据退化与不确定下决策策略漂移相互交织。方法链分三步:先从AMuS语料选取全覆盖的Speaker B法语男声与Speaker C英语女声并做去首尾静音与70 dB归一,输出干净刺激进入下一步。再将刺激与NOISEX-92约100人餐室babble按Quiet、-3 dB、-6 dB混合,输出带掩蔽的三条件试次进入行为实验。最后组织英法流利听众完成微笑检测与微笑类型分类强制选择任务,并用广义线性混合模型与信号检测论联合分析敏感性与反应偏向。与既往仅关注干净条件下微笑可听性的研究相比,该工作同时建模敏感性下降与偏向保守化,揭示正确率变化可由决策标准漂移解释,具有现实噪声下情感感知的实际意义。在任务2微笑类型分类设置下,Quiet条件的敏感性指标d’为1.28,高于-6 dB条件的敏感性指标d’为0.55。该结论的适用边界受限于朗读式非自发微笑与餐室babble掩蔽,尚未验证自发对话与多说话人泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://doi.org/10.5281/zenodo.20729215 → https://zenodo.org/records/20729215 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1275. 儿童口吃检测为何要把词和声学帧分成两类节点来建图
标签:#图神经网络 #言语障碍 #语音 #病理语音评估
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#图神经网络
👥 作者与机构
- Rashini Liyanarachchi:机构信息未能从会议 PDF 纯文本可靠映射
- Rachael Mackay:机构信息未能从会议 PDF 纯文本可靠映射
- Alison Short:机构信息未能从会议 PDF 纯文本可靠映射
- Aditya Joshi:机构信息未能从会议 PDF 纯文本可靠映射
- Erik Meijering:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童口吃自动检测需以连续语音为输入并输出流利、核心口吃与典型发育性不流利三类标签,难点在于儿童基频高、发声生理不稳定且病理性阻断与正常搜索行为声学重叠严重。本文方法链分四步推进:混合特征抽取为词与帧节点提供表征,异构图构建编码层级与上下文关系,跨模态注意力与关系图卷积实现词向帧的异常定位,双向门控循环单元融合时序节律后分类。相对同构图与纯声学时序模型,该设计以词汇意图节点为语义锚点,使发育性修订依赖邻域上下文而病理性事件依赖局部能量尖峰。在UCLASS与FluencyBank-CWS混合语料说话人独立5折验证协议下,Paediatric-HGNN的Typical Disfluency F1为0.38,高于SEP-28k预训练加微调基线的Typical Disfluency F1 0.08。该模型加权准确率为82.4%,流利F1为0.904,核心口吃F1均值0.280。该结论限于英语自发会话与朗读混合的小样本儿科场景,未验证跨语言与跨站点外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1276. 重音不在声调里时:台湾国语者如何用整音节手势协调实现英语重音
英文题目:Lexical stress-conditioned spatiotemporal gestural coordination in L2 English
标签:#统计分析 #语言习得 #语音学与音系 #韵律 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Paul McGuire:机构信息未能从会议 PDF 纯文本可靠映射
- Michael Proctor:机构信息未能从会议 PDF 纯文本可靠映射
- Feng-fan Hsieh:机构信息未能从会议 PDF 纯文本可靠映射
- Yueh-chin Chang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理台湾华语(Taiwanese Mandarin,TWM)者产出英语名词-动词重音对立时声学线索不可靠的难题,输入为电磁发音仪(Electromagnetic Articulography,EMA)记录的唇舌颌运动轨迹,输出为重读与非重读音节是否在关节协同空间中可分及其解释模式。方法链先以手势标注界定音节并提取6个收缩地标,再对地标做时间配准以分离相位与速率差异,随后将多通道位移与对数时间弯曲函数联合做多变量函数主成分分析(Functional Principal Component Analysis,FPCA),最后在主成分得分空间检验条件分离并用听感口音度做描述性语境化。相对只看元音中点位移或时长的已有做法,关键差异在于整音节时空联合建模使时长扩张与下颌下降等协同变化可被同图解释。在口音度评测任务下,07F的口音度得分为6.5,高于08F的口音度得分3.5。结论仅适用于复杂音节的探索性个案,不能外推到更多音节结构、更大群体或声学重音策略。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1277. 听辨已达标之后频谱仍在移动:5 到 8 岁波兰儿童齿擦音摩擦噪声的年龄斜率
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Zuzanna Miodońska:机构信息未能从会议 PDF 纯文本可靠映射
- Oliwia Skórzewska:机构信息未能从会议 PDF 纯文本可靠映射
- Natalia Mocko:机构信息未能从会议 PDF 纯文本可靠映射
- Magdalena Krycha:机构信息未能从会议 PDF 纯文本可靠映射
- Michal Krecichwost:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为61至96月龄波兰儿童图片命名与跟读录音中的齿擦音/s, z/,输出为年龄与性别对声学特征的影响判断,难点在于构音发育的连续微变易被说话人差异、词位重读前后音语境与词频不平衡淹没。方法链分为三步:先由言语语言病理学家筛选88名/s, z/为齿位成人样、清浊正确且无鼻化腭化等病理的儿童并切分20 ms帧提取短时频谱;再并行计算12个全谱特征与29个摩擦噪声特征;最后对每个特征拟合线性混合效应模型,以月龄与出生指定性别及其交互为固定效应、说话人与词为随机效应检验发育趋势。相比既有儿童研究多报告谱矩均值,该工作引入摩擦共振峰间距与2至7 kHz内每500 Hz窄带能量作为构音手势的直接标记。在包含8601个/s/帧的波兰儿童语料任务下,/s/的NE9年龄效应的p值指标为0.004,低于性别效应的p值指标0.493。结论仅适用于目标齿位发音的波兰语齿擦音,未验证自发与跟读差异、性别效应及向卷舌音的推广。该适用边界尚未验证向自发语料与卷舌音的外推,且受限于每月龄仅一至三名儿童的高变异性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1278. 把 F1 和 F2 看成一条轨迹:悉尼英语六个双元音如何一起动
英文题目:Variation and change in dynamicity of Australian English diphthongs in Sydney
标签:#统计分析 #社会语音学 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Benjamin Purser:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为悉尼自发访谈中六个双元音的声学轨迹,输出是对其动态形状的社会与语言制约解释,难点在于非手校连续语料噪声大且F1与F2在时间上相互依赖。方法链分三步推进:先在10%至90%区间提取九个等距归一化共振峰观测并做说话人归一化,再对每个元音分别实施多变量函数主成分分析(Multivariate Functional Principal Component Analysis,MFPCA),将双通道曲线压缩为少数主成分得分,最后以混合效应模型检验年龄组、性别、阶层与语境等预测因子。相比以往对F1与F2分开做离散余弦变换(Discrete Cosine Transform,DCT)或广义加性混合模型(Generalized Additive Mixed Models,GAMMs)的做法,该机制能自动保留跨共振峰的时间依赖并统一处理稳定与可变双元音。在悉尼言谈语料57269个样例的检验设置下,FACE PC1年龄组效应的指标标准化系数为-0.93,低于性别效应的指标标准化系数-0.51。在鼻音前与词尾等语境中动态偏移尤为明显,但结论目前仅适用于悉尼英语的特定代际与阶层划分。该结论的适用边界受限于悉尼特定代际与阶层划分,尚未验证向其他地区英语外推的稳定性。原文未披露训练、推理或部署成本,未声称超越已有方法的精度纪录。
🔗 开源资源
- 复现相关资源:https://doi.org/10.5281/zenodo.18794862 → https://zenodo.org/records/18794862 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1279. 看不见后缀时就必须做决定:用可变块恢复孟加拉语码切换的形态完整性
标签:#数据增强 #评测协议 #低资源 #流式处理 #语音识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.5/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#数据增强
👥 作者与机构
- Kazi Rafat:机构信息未能从会议 PDF 纯文本可靠映射
- Afifa Imran:机构信息未能从会议 PDF 纯文本可靠映射
- Md. Ismail Hossain:机构信息未能从会议 PDF 纯文本可靠映射
- Md. Romzan Ali:机构信息未能从会议 PDF 纯文本可靠映射
- Fuad Rahman:机构信息未能从会议 PDF 纯文本可靠映射
- Sifat Momen:机构信息未能从会议 PDF 纯文本可靠映射
- Shafin Rahman:机构信息未能从会议 PDF 纯文本可靠映射
- Nabeel Mohammed:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究孟加拉语-英语句内码切换的流式语音识别,输入为连续语音,输出为英语词根加孟加拉语后缀的混写转写。难点有三:前置元音符号渲染顺序与因果逐帧发射冲突,英语词根后接孟加拉语黏着后缀形成跨语形态依赖,以及句内码切换监督稀缺。方法链为文本合成加非自回归声学建模加推理侧组块:先用脚本锚定外来词注入将命中750词典的孟加拉语词形改写为英语词根加原后缀,构造约20%码切换句子;再用Paraformer编码器加连续集成触发机制学习表示;推理时以大于200 ms停顿触发语音活动检测语义块,最长3秒块内恢复离线全局双向注意力,实现结合后缀重估词根的后视修正。与2.4秒因果流式相比,动态块以数据依赖延迟换形态完整性。在Common Voice合成码切换集上,动态块取得词错率38.73%与字符错率15.62%,码切换词错率三元组为0.53/0.29/0.35,词根与形态分量优于同级因果大窗但字符错率略高。月经健康合成域微调后词根错误降至22%量级。适用边界为依赖可靠语音活动检测与常见外来词覆盖,快速连读退化为3秒固定块,罕见医学实体仍脆弱。原文未报告训练推理成本与实测延迟分布。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1280. 准备好的长独白之后,提问者如何在两种语言里被带偏:议会半自发对话的趋同
英文题目:On Entrainment in Semi-Spontaneous Multilingual Parliamentary Speech
标签:#统计分析 #韵律 #多语言 #语音对话系统
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音对话系统 | 主方法:#统计分析
👥 作者与机构
- Jennifer Jane Ries:机构信息未能从会议 PDF 纯文本可靠映射
- Debasmita Bhattacharya:机构信息未能从会议 PDF 纯文本可靠映射
- Julia Hirschberg:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究半自发多语言议会对话中的言语顺应,输入为10-20分钟备稿独白与后续1-2分钟自发提问,输出为声学韵律与语义两个维度上的顺应度量,难点在于发言长度悬殊、语言组合多变且单轮交互缺乏多轮基线。方法链分为四步:先用88维eGeMAPSv02与1152维RemBERT多语嵌入表征双方发言,再以提问者异地同语独白作基线归一化以剥离说话人本底,然后用余弦相似度计算全局与首中尾分段顺应并以每种语言组合5000对随机配对构建零假设检验,最后以线性混合效应模型与特征消融解析维度间耦合与关键驱动。与固定自发度单语研究相比,关键机制差异在于揭示跨语言条件下初始语义顺应预测末段声学顺应的耦合及首因末因并存的时间模式。时间分段显示声学韵律在82.5%交换中呈现首尾强于中段的首因末因模式,语义在67.5%交换中呈现类似模式且首因更强。在加拿大Hansard语料40组均衡交换评测条件下,声学韵律维度的显著交换比例指标为57.5%,高于语义维度的显著交换比例指标17.5%。跨语言交换中初始语义顺应与末段声学顺应的正向耦合显著强于单语交换,表明多阶段规划仅在跨语言约束下显现。该结论的适用边界受限于单轮英法问答任务,多轮对话与其他语言场景尚未验证。该结论仅适用于英法议会单轮问答且未验证多轮与其他语言的外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1281. 不看下游标签也能读懂语音自监督:压缩、几何与跨层生成如何分工
英文题目:InsideSSL: Understanding Self-Supervised Speech Representations using a Model-Centric Perspective
标签:#评测协议 #模型比较 #可解释性 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#评测协议
👥 作者与机构
- Samir Sadok:机构信息未能从会议 PDF 纯文本可靠映射
- Xavier Alameda-Pineda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自监督语音表示的可解释性任务输入为冻结编码器输出的逐层连续词元矩阵,输出为压缩、组织与抽象方式随层深的演化刻画,难点在于不同预训练目标导致的信息路径差异无法被单一下游指标区分。为此InsideSSL先用基于Gram矩阵特征谱的冯诺依曼熵度量压缩以跟踪有效维度演化,再用相邻词元转移向量平均夹角定义的曲率度量流形展开以刻画几何光滑化,接着用加噪、变调与时域掩蔽双视图间的InfoNCE损失度量扰动不变性以上一步拓扑为条件定位鲁棒层。然后为每层训练流匹配解码器并跨层重构对数Mel频谱得到生成兼容性矩阵以刻画功能迁移,最后用线性探测关联音素、基频与说话人任务使内禀度量进入下游验证。与只依赖外部标签的相关性分析不同,该框架主张内禀拓扑先行、任务映射随后,从而揭示稳定语音核心、身份波动与深层语义剪枝的实际意义。在线性探测任务下,音高回归与曲率的Pearson为0.82,高于音高回归与熵的Pearson 0.77。结论仅适用于所测双向 Transformer 系模型与朗读英语,对大规模多语、流式与生成式语音模型的适用性未验证。原文未披露训练、推理或部署成本
🔗 开源资源
- 代码相关资源:https://insidessl.github.io/ — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1282. 谁有权决定原住民儿童语音数据怎么用:ELSI 的三角色治理与缺席的社区托管
标签:#数据集构建 #隐私保护 #语音 #音频检索
评分:5.3/10 | 创新 1.3/2 | 技术严谨 0.8/1.5 | 实验充分 0.4/1.5 | 清晰度 0.9/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#音频检索 | 主方法:#数据集构建
👥 作者与机构
- Kaveri K. Sheth:机构信息未能从会议 PDF 纯文本可靠映射
- Sebastien Christian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为儿童中心长录音敏感语音,输出为分级共享与可复现分析,难点在于开放科学、儿童隐私、法国法律与来源国法规及多方伦理逻辑冲突下原住民治理缺位。方法链第一步由保管者集中持有原始音频并负责合规与权限审批,其授权输出进入第二步。第二步工具创建者在获批原始音频访问下训练语音类型分类器等模型并版本化注入平台骨干,其派生标注与聚合指标进入第三步。第三步分析者仅用派生输出做研究而不接触原始音频,从而隔离敏感访问并支撑跨库可复现基准。相比家庭银行与Databrary仅做研究者访问控制,本文以社区权威为中心设计原则并规划社区保管者层以实现按语料库的否决与收益回流,具有实际治理意义。在ELSI原住民语料设置下,公开语料的语料数量指标为1个,低于非公开语料的语料数量指标9个。结论边界在于社区主体认定、否决与撤回执行、派生删除范围均未验证,仅为待协同设计(Co-design)提案。原文未披露训练、推理或部署成本,生成式AI仅用于语言润色。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1283. 情绪越高越紧急吗?法国急救电话数据对情绪分诊的再检验
英文题目:Revisiting Emotion-Based Triage: Evidence from French Emergency Call Data
标签:#医疗音频 #统计分析 #语音 #语音情感识别
评分:5.3/10 | 创新 1.0/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#统计分析
👥 作者与机构
- Elio Stasica:机构信息未能从会议 PDF 纯文本可靠映射
- Clément Joly:机构信息未能从会议 PDF 纯文本可靠映射
- Amandine Lecomte:机构信息未能从会议 PDF 纯文本可靠映射
- Vincent P. Martin:机构信息未能从会议 PDF 纯文本可靠映射
- Romain Serizel:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanuel Vincent:机构信息未能从会议 PDF 纯文本可靠映射
- Tahar Chouihed:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为法国SAMU54紧急呼叫中心初始分诊录音,输出为调度员标注的P3到P0有序优先级,难点在于无体检高时间压力下情绪表达与医学紧急度是否一致。处理链先用说话人分离标注加人工校对抽取主叫者语音并拼接,再并行调用类别型语音情感识别与维度型语音情感识别得到离散标签与效价唤醒中位数,最后将情绪特征与年龄性别与呼叫者角色一起送入有序逻辑回归比较解释力。与以往直接由强烈负情绪映射高优先级的假设不同,该文以元数据为基线并检验交互项,凸显说话人依赖性。在250通法国急救呼叫语料任务下,其他第三方呼叫者的回归指标系数为2.50,高于家庭成员呼叫者回归指标系数的1.33。类别情绪相对中性均不显著而年龄与呼叫者角色持续显著,维度模型中唤醒与效价及说话人角色存在显著交互。结论仅适用于单中心小样本法语分诊场景,无法外推到院前处置结果或多中心部署。跨中心跨语种泛化效果尚未验证,失败条件集中于患者本人低唤醒呼叫的误判风险。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1284. 远距离低资源适应为何逼出表示重写:太平洋语言上的可塑性与稳定性困境
英文题目:Continual Adaptation for Pacific Indigenous Speech Recognition
标签:#持续学习 #LoRA #跨语言 #低资源 #语音识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.5/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#持续学习
👥 作者与机构
- Yang Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Aso Mahmudi:机构信息未能从会议 PDF 纯文本可靠映射
- Nick Thieberger:机构信息未能从会议 PDF 纯文本可靠映射
- Eliathamby Ambikairajah:机构信息未能从会议 PDF 纯文本可靠映射
- Eun-Jung Holden:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为 16 kHz 单声道野外语音与字符级转写,输出为比斯拉马语、纳夫桑语、雷雷帕语的文字转写,难点在于总量仅 32.13 小时且南岛语系音系与 Whisper 预训练分布严重偏离。该工作以 Whisper-Small 为唯一基座,先在 0.5 小时至 10.0 小时数据量下对比全量微调与编码器加解码器低秩适配,再用固定均衡评测子集抽取适配前后 12 层编码器与 12 层解码器隐状态并计算余弦距离刻画层级漂移,最后按纳夫桑语后接雷雷帕语的顺序做持续学习并在新语言、旧语言与英语上评测遗忘。相比只报词错率的黑盒评测,该链条把外部增益与内部重构显式关联,用以区分平滑复用与推倒重写。在比斯拉马语10.0小时测试集下,全量微调的WER为19.64,低于LoRA的WER 22.62。在雷雷帕语2.0小时测试集下,LoRA的WER为75.66,低于全量微调的WER 84.10。结论仅适用于 Whisper-Small 在这三种语言上的监督微调,向更大模型、自监督基座、无关语系与无监督条件的外推尚未验证。原文未披露训练与推理成本,未提供代码、权重与数据集链接。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1285. 多声源多麦克风下相对传递矩阵能否被直接学出来:三种监督建模的对照解读
标签:#CNN #多通道 #语音 #语音增强
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#CNN
👥 作者与机构
- Oshan A. B. Yalegama:机构信息未能从会议 PDF 纯文本可靠映射
- Wageesha N. Manamperi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究多声源多麦克风下的相对传递矩阵(Relative Transfer Matrix,ReTM)估计,目标是由B组麦克风观测线性表示A组观测,即在短时傅里叶变换(Short-Time Fourier Transform,STFT)域满足 \(M\_A&\#40;f,t&\#41;=R\_\{AB\}&\#40;f&\#41;M\_B&\#40;f,t&\#41;\),其中 \(R\_\{AB\}&\#40;f&\#41;=H\_A&\#40;f&\#41;H\_B&\#40;f&\#41;^\{\\dagger\}\),难点是多源同时激活时W不交叠正交假设失效,且混响使频域乘性近似对窗长敏感。方法对比三条监督路径:STFT卷积网络(STFT Convolutional Network,SCoNet)在STFT域做按频率的深度卷积回归A组谱;卷积滤波求和网络(Convolutional Filter and Summation Network,FuSNet)在时域用 \(Q\_A \\times Q\_B\) 个可学习一维卷积核参数化相对冲激响应并求和重构波形;长短时记忆自动编码器网络(LSTM-based Autoencoder Network,LAeNet)按频点用权重共享双向长短时记忆网络(Bidirectional Long Short-Term Memory,BiLSTM)加时间平均提取特征,再经前馈网络估计矩阵系数并经确定性乘法重构谱。三者均以时域负信干比与频域相对谱误差加权损失联合训练,避免对长时平稳协方差的依赖。在6 m × 7 m × 3 m、混响时间500 ms仿真房中,频域模型在三源语音去噪上优于协方差基线,LAeNet在场景B达8.67 dB、0.92可懂度,基线为6.06 dB、0.87;但FuSNet去噪仅2.21 dB、0.80,与其在矩阵重构指标上的领先相矛盾。该结论限于静止声源、固定分组和40 dB加性白噪声仿真,未验证真实房间、移动声源与源数泛化。原文未披露训练成本,仅给出推理延迟与参数量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1286. 只用事件证据拼出长音频的活动结构:文法如何约束顺序与层次
英文题目:Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition
标签:#形式化分析 #长音频处理 #音频分类 #音频事件检测
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#形式化分析
👥 作者与机构
- Peng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Qingyu Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Philip J.B. Jackson:机构信息未能从会议 PDF 纯文本可靠映射
- Wenwu Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
长音频活动识别要求从分钟级录音中同时恢复声音事件序列、子活动切分与顶层活动标签,难点在于事件检测缺失错位且跨步骤长程依赖难以从声学直接学到。本文先用事件中心声学前端将录音转成按起始时间排序的事件段与类别后验,再从训练脚本归纳分层活动文法并以概率上下文无关文法刻画活动到子活动再到事件的组成与顺序,最后用Earley风格最大后验解码融合声学似然与文法先验得到活动-子活动-事件解析树并导出时间跨度与根标签。与MultiAct分层独立解码相比,关键差异是将跨层组成与顺序作为显式语法约束在推理时强制满足,而非仅靠多头多任务学习隐式关联。在MultiAct音频评测集上该方法将子活动切分的Edit分数提升至35.3%,显著高于全监督子活动网络基线,同时训练无需任何子活动或活动标注。该结论仅在3类活动的小规模程序化音频上验证,边界粗糙或事件大面积漏检时高交并比定位与分类仍会失效。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1287. 送气擦音不是一个线索说了算:沙溪白语三代人的时间与频谱权重如何重组
英文题目:Age-related Differences in Acoustic Realization of Aspirated Fricatives in Shaxi Bai
标签:#统计分析 #语音学与音系 #社会语音学 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Xiaofang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Infat Lo:机构信息未能从会议 PDF 纯文本可靠映射
- Yao Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
沙溪白语送气擦音的输入是受控词表朗读录音,输出是送气对立在三维声学上的相对效应与代际差异,难点在于时间、频谱、发声三类线索相互耦合且随擦音部位与年龄变化。方法链先在Praat中分层标注擦音区间、送气区间、后接元音与整音节并提取起始时长比(initial duration ratio)、频谱质心差(spectral centroid difference)与经共振峰校正的一二次谐波差(H1-H2),再经由人内标准化消除量纲与基线差异,最后以送气条件为核心固定效应的线性混合效应模型(linear mixed-effects model)估计边际均值与成对对比。与以往单参数或描述性声谱分析不同,该研究在同一建模框架内量化三维相对效应并检验其协变重组。在沙溪白语16词朗读语料条件下,中年组齿龈擦音/s/的频谱质心差指标为2.38,高于青年组齿龈擦音/s/的频谱质心差指标0.45。结论仅适用于沙溪点16词朗读语体共30人960个token,青年组高度离散且感知与构音证据缺失使音变方向推断尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1288. 节奏指标分不开的东北印度英语,潜嵌入为何仍把印地语远远推开
标签:#统计分析 #韵律 #语音 #语言识别
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语言识别 | 主方法:#统计分析
👥 作者与机构
- John Aheibam:机构信息未能从会议 PDF 纯文本可靠映射
- Joyshree Chakraborty:机构信息未能从会议 PDF 纯文本可靠映射
- Priyankoo Sarmah:机构信息未能从会议 PDF 纯文本可靠映射
- Rohit Sinha:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为印度东北地区5种英语变体与2种印地语变体的朗读语音,输出为变体类别判定,难点在于不同母语背景的英语在时间组织上高度重叠且易受语速与文本构成影响。方法链分四步:70人分7组朗读北风与太阳英文版或印地语译文并经Praat手工切分呼吸组与元辅音区间计算8个节奏度量,线性混合效应模型以语言为固定效应检验组间差异,其输出进入层次聚类与线性支持向量机验证可分性。最后用语言识别模型嵌入经主成分分析降维至42维与判别投影做跨表征对照,并计算嵌入主成分与节奏度量的Pearson相关。与仅用阈值划分节奏类的旧范式不同,该链条把显著性检验、无监督聚类、有监督分类与自监督表征相关分析串联,使时间节奏与整体声学线索可互相印证。在节奏特征支持向量机分类任务下,HIN的准确率为78.2%,高于AHI的准确率77.1%。结论仅适用于受控朗读体与当前 7 组说话人,无法推广到自发语音、其他母语背景或语速差异更大的场景。该结论的适用边界受限于受控朗读语料,跨自发语音与更大语速差异的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1289. 重音规则不同时,自监督表示与词内上下文能否跨语言复用
英文题目:Multilingual and Cross-lingual Lexical Stress Detection Using SSL Feature Vectors
标签:#自监督学习 #韵律 #跨语言 #多语言 #语音属性识别
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#自监督学习
👥 作者与机构
- Abdulrahman Alhabshi:机构信息未能从会议 PDF 纯文本可靠映射
- Beena Ahmed:机构信息未能从会议 PDF 纯文本可靠映射
- Mostafa Shahin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究多语与跨语词汇重音检测,输入为连续朗读语音与对应文本,输出为每个音节有重音或无重音的二分类标签,难点在于阿拉伯语由音节重量与末三音节窗口决定、英语由词库与形态交互决定且伴随元音弱化,两者声学实现差异大。方法链为强制对齐获得音节边界并由规则生成标签,再用冻结SSL编码器抽取帧级向量并在音节内平均得到1024维音节嵌入,接着由音节级预网络做孤立分类。最后由词级后网络建模词内前后音节依赖并输出序列后验,其输入为预网络的音节嵌入序列并经时延层融合上下文后计入掩码损失。与此前手工韵律特征加单阶段分类器不同,该设计把上下文建模同时放在冻结表示的Transformer上下文与词内时延结构中,以分离表示可移植性与序列依赖的作用。在Common Voice英语子集测试集评测下,多语训练的HuBERT后网络的准确率为97.08%,低于单语基准的准确率97.49%。结论仅适用于朗读式标准语与自动规则标签条件,未验证自发语音、方言与非母语偏误的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1290. 用更强的说话人判别器逼出说话人无关的情感表示:SISER 解读
英文题目:SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training
标签:#对抗训练 #自监督学习 #语音 #语音情感识别
评分:5.2/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.5/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#对抗训练
👥 作者与机构
- Eunseo Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Hyunku Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Chanwoo Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人不变量语音情感识别需从原始波形预测情绪类别,难点在于情感标注稀缺且说话人特性与情感线索在声学层面深度纠缠,导致在固定说话人上学到的相关性无法泛化到未见说话人。 SISER第一步以微调的wav2vec 2.0 base为特征编码器,将原始波形编码为帧级上下文表示并汇成定长话语向量,同时送入情感与说话人两个分支。 第二步情感分支用三层全连接加PReLU将该向量映射为四类情绪分布,并以情绪交叉熵保留情感可分性。 第三步说话人分支用输入适配至768维的ECAPA-TDNN加线性层从同一向量预测每折训练说话人身份,以强判别器暴露浅层分类器漏检的残留说话人线索。 第四步采用编码器与判别器交替冻结优化,以熵最大化显式迫使说话人后验趋向均匀分布并按权重λ与情感损失联合,使编码器输出难以归因于任一说话人,这与梯度反转仅要求分错而不约束失败方式形成关键差异。 在 IEMOCAP 合并兴奋与幸福后的 5531 条 4 分类、留一会话 10 折交叉验证下,表 1 报告测试集非加权准确率为 60.63%,相对无增强 CNN+GRU 基线 51.15% 提升 9.48 个百分点,且接近带速度扰动增强基线的 59.91%。 该结论仅在 10 说话人英文表演语料下验证,未检验跨语料、跨语言与噪声外推,且正文与表格间均值存在矛盾。 代码已在脚注公开,训练在单卡 NVIDIA A100 上完成,训练时长与推理成本未披露。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1291. 鲁棒性阈值也需要学习:联合估计协方差与白噪声增益的 MVDR
英文题目:Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming
标签:#波束成形 #鲁棒性 #麦克风阵列 #语音 #语音增强
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音增强 | 主方法:#波束成形
👥 作者与机构
- Yongyi Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Hanchen Pei:机构信息未能从会议 PDF 纯文本可靠映射
- Jianbo Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Jingdong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jacob Benesty:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为8通道混响含噪语音的短时傅里叶变换(Short-Time Fourier Transform,STFT)系数,输出为保持目标方向无失真并抑制干扰与噪声的增强语音,难点在于麦克风自噪声与阵列失配会使MVDR的WNG骤降并放大白噪声。方法链分三步:多线索融合特征提取器从频率、窄带时序、子带与全带四个视角构建共享表示;双分支头分别预测逐频WNG约束阈值与复数时频噪声掩膜,掩膜经时域平均得到噪声协方差估计;二次特征值问题(Quadratic Eigenvalue Problem,QEP)可微鲁棒MVDR层将协方差与WNG阈值映射为满足无失真约束的权向量并输出滤波语音。相比固定WNG或对角加载的外部启发式折中,该机制把鲁棒性控制内化为随声场景变化的潜变量并用重建误差端到端隐式监督。在可见阵列条件的评测设置下,所提自适应方法的SNR增益为11.940 dB,高于调至最优固定阈值的传统MVDR的SNR增益10.543 dB。该结论仅在合成房间、端射目标与高斯间距扰动下验证,未测试真实器件老化、方向误差与运动声源。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1292. 整条曲线还是局部对齐:延续升调的接触变异如何同时需要全局形状与时间定位
标签:#统计分析 #模型比较 #韵律 #社会语音学 #语言识别
评分:5.2/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语言识别 | 主方法:#统计分析
👥 作者与机构
- Angelo Dian:机构信息未能从会议 PDF 纯文本可靠映射
- Mary Baltazani:机构信息未能从会议 PDF 纯文本可靠映射
- Spyros Armostis:机构信息未能从会议 PDF 纯文本可靠映射
- Elinor Payne:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为塞浦路斯希腊语与雅典希腊语延续升调感兴趣区内基频轨迹,输出为接触变异的音系解释,难点在于表面连续曲线可对应多组调性目标与对齐方式。先以原始轮廓为输入做听觉预分类步骤,其职责是区分塞浦路斯低核与高核变体,输出的分组标签直接作为后续两分支建模的共同因子进入回归与平滑。再以分组后按半音转换并时长归一化的轨迹为输入做勒让德压缩步骤,其职责是用四阶正交基提取表征整体几何的均值斜率曲率系数,输出的系数进入线性混合效应检验以判定组间整体类型差异。最后以同一归一化轨迹与前步类型假设为输入做广义加性混合建模步骤,其职责是用样条与说话人随机平滑拟合曲线并输出成对差异曲线,定位显著分歧区间以衔接并细化前步的全局结论。前者长于整体类型判定而对局域不敏感,后者以样条与随机平滑显式定位时间对齐与缩放差异,适用于共享结构核心下的细粒度系统内比较。在归一化RoI时长语料的GAMM差异评估任务下,CYG-nh相对ATG显著分歧区间的上端指标为49.5%,低于CYG-nh相对CYG-nl首段分歧区间的上端指标55.5%。该结论适用边界受限于青年半自发延续升调且依赖预分类,尚未验证无标注未知变体或自发语流的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1293. 不只看起点终点:用整条共振峰轨迹重看澳大利亚英语双元音变化
英文题目:Modelling diphthong dynamics: A GAMM-based analysis of Australian English diphthongs
标签:#统计分析 #社会语音学 #语音 #语音属性识别
评分:5.2/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Ksenia Gnevsheva:机构信息未能从会议 PDF 纯文本可靠映射
- Canaan Lan:机构信息未能从会议 PDF 纯文本可靠映射
- Gerard Docherty:机构信息未能从会议 PDF 纯文本可靠映射
- Catherine Travis:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为悉尼城市与Braidwood乡村自发语音中FACE、FLEECE、GOAT、MOUTH、PRICE五个双元音在20%至80%区间的归一化F1与F2轨迹,输出为性别与地域对动态形状影响的显著性判断,难点在于双元音呈非线性时变且传统首尾双点采样会丢失中段分化与曲率信息。方法链分三步:先用Fast Track提取共振峰并限制阻碍音间重读语境与剔除离群点得到可比观测,再对每个元音的F1与F2分别拟合广义加性混合模型以分离群组时间平滑与说话人与词项随机效应,然后以模型比较检验性别、地域及其交互并对显著交互做简化可视化解读。与已有离散点方法相比,关键机制差异在于以全轨迹时间平滑加自回归误差直接检验形状差异而非平行位移假设,因而能发现中段与曲率处的社会分化,具有更完整的实际解释力。在Sydney Speaks与Braidwood语料下,FLEECE F2的Gender效应的卡方指标为29.68,高于Location效应的卡方指标16.46。该全轨迹结论的适用边界受限于取样与语境,尚未验证其他年龄与族群的外推。结论仅适用于中老年Anglo-Celtic背景的阻碍音间重读元音,未验证年轻人、多族群与其他语音环境的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1294. 舌头被挖掉模型也不差:超声到语音映射到底在看哪里
英文题目:On the Role of the Tongue Region in Ultrasound-to-Acoustic Mapping
标签:#注意力机制 #CNN #可解释性 #静默语音接口
评分:5.2/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#静默语音接口 | 主方法:#注意力机制
👥 作者与机构
- Ibrahim Ibrahimov:机构信息未能从会议 PDF 纯文本可靠映射
- Gábor Gosztolya:机构信息未能从会议 PDF 纯文本可靠映射
- Csaba Zainkó:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
超声舌成像到声学映射需将单帧超声转为80维梅尔谱再经声码器合成语音,难点是帧内混杂周围组织回波、声影与成像伪影,且舌体动态细节难以从单帧静态像素中解耦。作者先以自适应阈值与时序稳定策略提取舌区掩膜并构造去舌输入,再用标准2D-CNN对比原始与去舌映射误差。接着训练双编码器以掩膜流经1x1卷积门控调制图像流并做多尺度池化回归预测,最后经HiFi-GAN合成并以MCD、PESQ与MOSnet综合评价。与已有架构微调不同,该工作把空间先验显式做成跨注意力门控加残差连接,使舌区聚焦可被Grad-CAM直接检验而非仅靠精度推测。在UltraSuite-TaL80语料测试集条件下,说话人01fi基线的MSE为0.3521 ± 0.0436,低于所提双编码器的MSE 0.4341 ± 0.0697。结论仅适用于逐帧映射与当前训练条件,未验证时序建模与跨说话人外推,缺舌仍可重建不代表舌动力学不重要。原文披露硬件与优化配置,未披露训练时长与推理延迟吞吐成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1295. 既要藏住说话人又要留住痴呆线索:信号与特征两级隐私保护如何分工
标签:#对抗训练 #隐私保护 #说话人匿名化 #病理语音评估
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#对抗训练
👥 作者与机构
- Henriette Flore Kenne:机构信息未能从会议 PDF 纯文本可靠映射
- Raphael Anaadumba:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Arif Ul Alam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床痴呆筛查语音同时携带诊断所需的韵律生物标志物与可识别身份的声纹和语义内容,输入为原始波形,输出要求在阻断自动语音识别转写与说话人识别重链接的同时保留痴呆判别能力。本文方法链先以目标转写引导的投影梯度下降(Projected Gradient Descent,PGD)生成对抗波形,并经累积信号攻击(Cumulative Signal Attack,CSA)整形将能量集中于关键词对齐时段,再用Parselmouth提取韵律向量与ECAPA-TDNN提取说话人嵌入拼接输入共享编码器,最后经梯度反转层(Gradient Reversal Layer,GRL)抑制说话人分支并以互信息(Mutual Information,MI)选噪破坏低诊疗价值维度。与单阶段高斯扰动或乱序匿名化相比,该机制在信号层破坏语义解码而保留低频韵律,在特征层实现维度级隐私效用控制。在DementiaBank Pitt语料评测下,ADV+PRIV配置的痴呆F1为0.79,低于原始未匿名基线的痴呆F1 0.83。该结论仅在英文图片描述任务与白盒评估下成立,未验证跨语言、自发对话与可懂度严重下降时的临床可用性。跨设备与跨语言外推效果尚未验证且受限。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1296. 语境搭台、韵律补位:中国英语学习者如何听出反语
英文题目:The Role of Context and Prosody in the Understanding of English Irony by Chinese L2 Learners
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Yinan Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Shanpeng Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理英语二语反语理解任务,输入为语境音频加目标句音频,输出为反语与真诚二选一判断及反应时,难点在于字面褒义与批评意图冲突且线索权重不明。为此先构造固定句式目标句并嵌入强不一致、模糊与无不一致三类语境以控制期待违背程度。接着由真人录制反讽、中性与真诚三种韵律并经效度筛选保留刺激,其输出直接作为感知实验的材料。最后用PsychoPy先呈现语境再呈现目标句并采集判断比例与反应时,输入混合模型检验语境、韵律与水平主效应及交互。相对已有单线索二语研究的关键差异是同时操控语境与韵律并检验水平调节,实际意义在于区分主导线索与补偿线索以指导教学。在模糊语境条件下,反讽韵律的反语判断率指标为75.47%,高于真诚韵律的反语判断率指标10.97%。该结论适用边界受限于字面表扬型反语与程式化录制语境,字面批评型反语、自然对话与自发韵律等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1297. 越讨厌越听不清:用游戏化噪声任务把厌声症拉进听力学测量
标签:#心理声学实验 #言语感知 #语音 #语音可懂度评估
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.2/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#心理声学实验
👥 作者与机构
- Jorge Mejia:机构信息未能从会议 PDF 纯文本可靠映射
- Jan-Willem Wasmann:机构信息未能从会议 PDF 纯文本可靠映射
- Jane Gregory:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
厌声症患者对咀嚼吮吸等日常声音产生强烈情绪生理反应并损害日常言语理解,但听力学缺乏标准化可扩展客观行为学路径,现有评估依赖自评问卷而标准言语噪声测试又需校准设备与专用房间。声音反应堆任务构建浏览器端约6分钟单会话流水线,先做引导与音频检查,再以1-up/1-down自适应阶梯用VCV音节在调制噪声下估计个体言语接收阈并将其输出作为后续难度锚点。接着对7类日常声音按烦恼度量表评分并选出最烦声音作为优质燃料,将个性化掩蔽声输入下一步三条件对比。随后在个体阈值下组块比较优质燃料、合成燃料与标准燃料下的辅音识别,最后完成分掩蔽声可接受噪声级测量。与通用掩蔽声不同,个性化显著性声音被假设引入情绪与注意负荷,具有生态效度与可扩展意义。在三掩蔽声对比设置下,Premium Fuel的准确率为59.2%,低于Standard Fuel的准确率86.3%。该结论仅适用于轻度敏感成人可行性样本,未验证诊断效度与听力损失人群外推。原文未披露训练、推理或部署成本,未提供代码与数据。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1298. 要留住达基尼口音,先别让话筒吓走它:一次电话采集的方法拆解
标签:#数据集 #数据集构建 #低资源 #语音 #说话人分离标注
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:数据集与基准 | 主任务:#说话人分离标注 | 主方法:#数据集构建
👥 作者与机构
- Anindita Mondal:机构信息未能从会议 PDF 纯文本可靠映射
- Priyanka Kommagouni:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以熟人电话对话音频为输入,产出可支撑方言敏感识别与对话建模的达基尼语自发语料,难点在于非prestige方言在正式与被观察情境下向标准印地语或乌尔都语漂移。方法链第一步以结构调查形成音系与形态诊断清单,该清单直接指导经社区中介的分层招募以锁定稳定使用方言者。第二步将招募输出的熟人配对送入电话信道隐蔽录制,利用日常亲密信道与不知情交互诱发非监控语体并产出原始对话音频。第三步对原始音频做说话人分离切分与拼接形成单说话人文件,再经标准语识别预转写与规则检测生成方言标签密度,密度分流决定人工复核强度以产出终版语料。相对已有历史与文学研究的差异在于把失配视为方言信号而非转写噪声,从而把标注人力集中于高密度片段。在60人前期调查的语料设置下,女性强偏移条件的性能指标依据样本量为60,低于全量验证条件下性能指标可核对值对应的0,原文未提供可核对的关键定量结果。结论仅能作为语料建设指南而非已验证的性能提升,其外推受限于单一城市网络、性别不均衡与电话窄带音质,且隐蔽记录加事后同意模式在不同伦理审查下未必可行。原文未披露训练、推理或部署成本,声明使用生成式AI仅做语言润色与图表格式整理。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1299. 儿童长时录音又多又杂:ELSI 想用统一格式加一键模型调用降低使用门槛
标签:#开源工具 #数据集构建 #语言习得 #说话人分离标注
评分:5.2/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.3/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#说话人分离标注 | 主方法:#数据集构建
👥 作者与机构
- Kaveri K. Sheth:机构信息未能从会议 PDF 纯文本可靠映射
- Loann Peurey:机构信息未能从会议 PDF 纯文本可靠映射
- Sho Tsuji:机构信息未能从会议 PDF 纯文本可靠映射
- Alejandrina Cristia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童中心长时录音以儿童佩戴轻便麦克风采集的全天自然互动为输入,要求输出可跨语料比较的儿童发声计数、成人发声计数、对话轮次及音素音节词数,难点在于目录命名与元数据异构、开源模型需命令行操作门槛高且闭源工具不可复现导致指标不可比。ELSI先调用ChildProject接口完成目录结构与元数据校验和转换以统一为通用格式,其输出的规范语料直接进入集成的开源模型层。模型层用语音类型分类器输出按说话人类型的带时间戳标签并用ALICE估计成人音素数,再由指标层从时间戳导出各类计数并输出可下载表格。相对既有命令行工具的关键差异是浏览器免安装加远端计算封装,把工程复杂性转移到机构服务器,从而让无编程背景者也能复用已验证模型。原文未提供可核对的关键定量结果。结论仅适用于已试点合作语料的演示场景,向新语言、新采集设备与大规模并发的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://elsi-lscp.ddns.net/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1300. 人类觉得难的样本先靠后:用意图与感知的对齐关系给语音情绪排课程
英文题目:CHUCKLE - When Humans Teach AI to Learn Emotions the Easy Way
标签:#课程学习 #语音 #语音情感识别
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#课程学习
👥 作者与机构
- Ankush Pratap Singh:机构信息未能从会议 PDF 纯文本可靠映射
- Houwei Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别输入为语音声学信号、输出为6类情感标签,难点在于说话人差异、文化语境差异与感知主观性导致标签噪声大、类别可分性低。先以每段8至12个人工感知标注分布为输入,计算熵或意图感知一致得分并输出样本难度排序,再以难度得分与意图—感知是否一致为输入,按清晰匹配、明确错位等规则划分输出由易到难的4个样本bins,最后以前一阶段训练子集为输入逐阶段扩大训练子集,用冻结HuBERT表征训练双向长短期记忆网络与Transformer并输出情感预测。与已有基于熵或意图一致比例的打分课程不同,该工作显式区分一致强度与意图对齐,使强一致但错位样本先于模糊错位样本学习以提供稳定学习信号。在CREMA-D主体依赖评测设置下,Intended-Perceived Agreement 1的平均宏准确率为0.6827,高于非课程基线的平均宏准确率0.6685。该结论适用边界受限于单一表演语料与冻结特征加浅层序列模型,尚未验证对自然情感、自发语料或端到端微调的泛化能力。在训练成本方面课程通过前期小子集训练减少累积梯度更新计算量,最高精度排序减少约17%更新量,最省更新排序减少近40%更新量并保持可比精度。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1301. 缺失中也要认出情绪:用遮罩卷积与多尺度一致性做轻量语音情感识别
英文题目:MSMC: Multi-Scale Masked Convolution network for Robust Speech Emotion Recognition
标签:#CNN #知识蒸馏 #高效推理 #语音 #语音情感识别
评分:5.2/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#知识蒸馏
👥 作者与机构
- Haoyu Song:机构信息未能从会议 PDF 纯文本可靠映射
- Ian McLoughlin:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoxiao Miao:机构信息未能从会议 PDF 纯文本可靠映射
- Aik Beng Ng:机构信息未能从会议 PDF 纯文本可靠映射
- Simon See:机构信息未能从会议 PDF 纯文本可靠映射
- Timothy Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别(Speech Emotion Recognition,SER)以对数梅尔频谱图为输入、愤怒/高兴/中性/悲伤四分类为输出,难点在于同时需要短时微韵律细节与覆盖整句的长程全局情感轨迹,而轻量卷积网络长程能力弱、普通掩码训练又会被零填充污染。第一步由掩码卷积编码器负责干净局部建模,它按可见掩码有效面积对卷积做重归一化,只聚合可见时频特征以消除零填充泄漏,并输出干净局部特征图。第二步由条件位置编码与轻量Transformer负责长程建模,条件位置编码先为该特征图恢复时频拓扑,再将仅40%可见Token送入Transformer并物理丢弃掩码Token以截断注意力长度,得到全局语义向量。第三步由指数滑动平均教师与解耦优化负责跨尺度蒸馏,见完整视图的教师提供多层局部目标与池化后全局目标,学生以掩码区归一化均方误差加余弦距离补全缺失语义,教师以动量跟踪学生,推理仅保留学生与分类头。相对普通卷积直接处理零掩码区或保留零向量做全长注意力的做法,有效掩码重加权避免边界稀释、物理丢弃削减二次开销。在IEMOCAP即兴子集2280条、10折留一说话人交叉验证下,MSMC full报告加权准确率(Weighted Accuracy,WA)76.0%、非加权准确率(Unweighted Accuracy,UA)68.8%,参数量6.77M、3秒音频约0.9G乘加操作,WA超过同表WavLM-base约8.8个百分点但UA仍低约1.4个百分点。该结论仅在单一英文即兴4类设置下验证,未覆盖噪声、跨语种、跨库与显著性检验,原文数字存在76.0%与76.1%、6.77M与5.8M前后不一致。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1302. 从区分干净与噪声脑响应到给增强算法打分:NeuroPAS-Net 的三阶段解码
标签:#迁移学习 #脑信号 #语音可懂度评估 #言语神经解码
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#言语神经解码 | 主方法:#迁移学习
👥 作者与机构
- Ching-Chih Sung:机构信息未能从会议 PDF 纯文本可靠映射
- Francis Pingfan Chien:机构信息未能从会议 PDF 纯文本可靠映射
- Li-wei Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Berrak Sisman:机构信息未能从会议 PDF 纯文本可靠映射
- Borching Su:机构信息未能从会议 PDF 纯文本可靠映射
- Yu-Te Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为聆听清晰与含噪语句时采集的功能性磁共振成像fMRI多体素响应,输出为语音声学条件类别及增强语音向清晰模式靠近程度的连续评分,难点在于体素维度极高且被试间功能组织差异显著。所提神经感知评价网络NeuroPAS-Net先以掩码重构自监督学习通用体素表示,再以带回放的增量学习在多被试有标签数据上持续训练分类器,最后将编码器与分类器迁移至新被试做监督微调。与单次训练的支持向量机SVM和卷积神经网络CNN相比,该链条以预训练表征缓解个体差异,以回放机制抑制灾难性遗忘,以个性化微调适配目标被试。在R PreCG增强条件评测下,DNN-SE的NeuroPAS分数为0.60,高于Classic-SE的NeuroPAS分数0.41。该解码器在右侧中央前回分离性最强并在全部12个言语相关区一致超越两种基线,且NeuroPAS与主观可懂度呈中等单调关联。结论目前仅适用于健康年轻普通话母语者的实验室语句理解任务,未在听力损失与老龄人群及真实复杂噪声中验证。听力损失与老龄人群的外推范围尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1303. 说“嗯” 却没懂:不一致回应的多模态信号如何被分离出来
标签:#集成学习 #音视频 #语音 #音视频理解
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音视频理解 | 主方法:#集成学习
👥 作者与机构
- Olcay Türk:机构信息未能从会议 PDF 纯文本可靠映射
- Stefan Lazarov:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Angela Grimminger:机构信息未能从会议 PDF 纯文本可靠映射
- Hendrik Buschmeier:机构信息未能从会议 PDF 纯文本可靠映射
- Petra Wagner:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为德语解释对话中表层示意理解的正向回馈片段及伴随语境,输出为一致与不一致的二分类,难点是表层形式高度相似而底层理解状态不透明。方法分三步:先以被解释者视频回放自评为理解真值并经话题窗口传播给回馈标注,再分别提取openSMILE的88维声学特征、以MediaPipe为基础的134维头动泛函和话题时长等话语特征并经稳健标准化与低方差过滤送入XGBoost分类器,最后用SHAP值解析特征贡献与置信子集不对称性。与既往只做回馈功能分类不同,该工作把认知失配本身作为可观测多模态弱信号问题,并强调话语复杂度与表达投入的交互。在预留验证集216个样本的评测下,不一致类的F1-score指标为0.75,高于一致类的F1-score指标的0.70。结论仅适用于德语桌游解释、短回馈词为主且依赖回放自评的场景,对负向回馈、跨语言和实时检测尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1304. 把对齐与发音评分装进一个桌面:VoxKit 如何让临床语音研究少写命令行
英文题目:VoxKit: Desktop Phone Alignment and Goodness of Pronunciation Analysis
标签:#医疗音频 #软件工具 #自监督学习 #语音 #强制对齐
评分:5.1/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#强制对齐 | 主方法:#自监督学习
👥 作者与机构
- Nina R Benway:机构信息未能从会议 PDF 纯文本可靠映射
- Beckett Frey:机构信息未能从会议 PDF 纯文本可靠映射
- Tristan Mahr:机构信息未能从会议 PDF 纯文本可靠映射
- Michael McAuliffe:机构信息未能从会议 PDF 纯文本可靠映射
- Prad Kadambi:机构信息未能从会议 PDF 纯文本可靠映射
- Visar Berisha:机构信息未能从会议 PDF 纯文本可靠映射
- Katherine Hustad:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向缺乏命令行能力的临床与儿童语音研究者,输入为按说话人子目录组织的音频与同名正字法转写及可选人工TextGrid,输出为词与音素级TextGrid边界及音素级发音质量分数,难点在于临床儿童语音适配困难且分散工具链难以比对复现。先由数据集注册规范目录并写入名称描述与日期元记录,其输出的已注册语料与可比对记录进入训练适配。再由训练适配利用已有或人工TextGrid对蒙特利尔强制对齐器声学模型做自适应或对Wav2Vec2对齐模型做训练,其输出的适配模型进入对齐与打分。最后由对齐与打分在后台线程选用适配模型与词典或分词器生成TextGrid并用LibriSpeech预训练Wav2Vec2分类器以十毫秒分辨率计算目标音素对数后验作为声学质量分,其逐帧与聚合CSV进入查看比对。相对分散的命令行对齐器加Praat加独立打分脚本,该系统以三面板界面加后台任务加堆叠器与引擎及分析器抽象把注册训练对齐比对与打分串起,使新引擎自动传播到全流程并支持管线重排。在LibriSpeech语料预训练设置下,打分器以10毫秒分辨率在42个音素库存上计算对数后验分数,但除该设置描述外原文未提供可核对的关键定量结果,未报告目标条件的分数高于比较条件的分数的具体数值。其向儿童与病理语音群体分析的外推效果尚未验证且对齐质量依赖人工标注质量而受限。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://voxkit-web.vercel.app/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1305. 语音大模型能替人打出口音与易懂度分数吗:相关、进步与线索的三重检验
标签:#统计分析 #语音大模型 #少样本 #语音 #语音质量评估
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音质量评估 | 主方法:#统计分析
👥 作者与机构
- Wenwei Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Catia Cucchiarini:机构信息未能从会议 PDF 纯文本可靠映射
- Roeland van Hout:机构信息未能从会议 PDF 纯文本可靠映射
- Helmer Strik:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为印度尼西亚高中生朗读的英语语音,输出为 1 至 9 分的口音度与易懂度打分,难点在于人类感知同时依赖音段错误与超音段韵律且专家标注成本高。方法链分三步推进:先用语音大语言模型在零样本与少样本提示下直接对语音打分,其输出进入线性混合效应建模以检验前后测进步;再并行用 Praat 与 eGeMAPS 及 Whisper 抽取声学与词距特征,其输出与人类均分及模型分数分别进入 Lasso 筛选与排序对比。与传统预定义维度发音评估不同,该路线不做特征工程而让模型从原始语音隐式整合线索,再以后验特征关联反推其依据。在 31 名测试学习者共 1736 条话语上,最优少样本设置下易懂度 Spearman 相关系数达 0.497 且均方误差降至 1.37,显著低于零样本基线。结论仅适用于朗读式印尼口音英语及所测 Qwen3-Omni-30B-Instruct 模型与提示,在自发对话与其他母语背景中尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1306. 看得见才改得准:NewAppVoice 用同步可视化与多算法对照修正共振峰测量
英文题目:NewAppVoice: Tools for Visualizing and Correcting Acoustic Measures
标签:#开源工具 #信号处理 #语音学与音系 #语音 #语音属性识别
评分:5.1/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.3/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音属性识别 | 主方法:#信号处理
👥 作者与机构
- Amélie Elmerich:机构信息未能从会议 PDF 纯文本可靠映射
- Yao Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Louise McKeever:机构信息未能从会议 PDF 纯文本可靠映射
- Katia Chirkova:机构信息未能从会议 PDF 纯文本可靠映射
- Lise Crevier-Buchman:机构信息未能从会议 PDF 纯文本可靠映射
- Claire Pillot-Loiseau:机构信息未能从会议 PDF 纯文本可靠映射
- Angelique Amelot:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作输入为.wav语音与配套.TextGrid标注,输出为经人工核验的声学参数表,难点是羌语与Tibetic变体存在元音uvularization、发声与声调对立且无参考共振峰值,默认自动提取易产生系统性跟踪错误。方法链分为3步:先按tier与interval切分并设定测量点数与分析窗,再并行运行多路基频fundamental frequency / fo与共振峰formant / F1-F4估计并同步叠加显示波形、宽带语谱图、线性预测编码linear predictive coding / LPC包络与原始频谱,最后在可编辑结果表中直接修正错值并自动重算谐波幅度、谐波噪声比harmonics-to-noise ratio / HNR等派生量。与Praat、VoiceSauce、VoiceLab、WaveSurfer、WinPitch、XKL等工具相比,关键差异是3路fo与2路formant跨算法同屏对齐加逐点可视核验,使算法分歧即时暴露而非事后看离群值。原文未提供可核对的关键定量结果。结论仅适用于有人工逐段核验的小规模描写语音学流程,不适用于大规模全自动语料处理与非周期性极短浊音段的可靠外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1307. 跨人与跟随个人:德语肌萎缩侧索硬化语音损伤预测在两种评分与五种任务上的分野
标签:#语音生物标志物 #迁移学习 #言语障碍 #语音 #病理语音评估
评分:5.1/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#迁移学习
👥 作者与机构
- Monica Gonzalez-Machorro:机构信息未能从会议 PDF 纯文本可靠映射
- Ricarda von Heynitz:机构信息未能从会议 PDF 纯文本可靠映射
- Justin Hanslmeier:机构信息未能从会议 PDF 纯文本可靠映射
- Finja Grimm:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandra-Iulia Deac:机构信息未能从会议 PDF 纯文本可靠映射
- Anne Gründel:机构信息未能从会议 PDF 纯文本可靠映射
- Isabell Cordts:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向德语肌萎缩侧索硬化症人群的语音损伤预测,输入为朗读、看图描述、持续元音和双音节重复等录音,输出为功能量表语音项与构音障碍者生活质量问卷分数,难点在于疾病异质性强、样本少且量表粒度粗糙。方法链分为三步:先经语音活动检测切分与谱门限降噪得到干净语音,再分别提取手工声学集与预训练语音编码器嵌入并按训练集归一化,最后按任务独立训练回归器并经均值融合得到会话级预测。相比既往区分患者与健康对照的研究,该工作同时建模横断面泛化与个体内随访,并首次将主观生活质量量表作为声学回归目标。在QOL-Dys个体内随访任务测试集下,/da/-/da/音节重复条件的CCC指标为0.86,高于朗读通道条件的CCC指标0.75。结论仅适用于单中心德语小队列与所列五种任务,未验证跨中心、跨语言与其他运动神经元疾病的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/luferrer/ConfidenceIntervals — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1308. 当关系先于项目:毛利语语音合作如何把信任写成流程
英文题目:Working Together on Technologies: A Case Study of Collaboration in Aotearoa
标签:#主观评测 #多语言 #语音 #文本到语音
评分:5.1/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.3/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.0/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#文本到语音 | 主方法:#主观评测
👥 作者与机构
- Ben Hutchinson:机构信息未能从会议 PDF 纯文本可靠映射
- Gabriella Conlon:机构信息未能从会议 PDF 纯文本可靠映射
- Greg Duncum:机构信息未能从会议 PDF 纯文本可靠映射
- Carrie Jones:机构信息未能从会议 PDF 纯文本可靠映射
- Tāne Karamaina:机构信息未能从会议 PDF 纯文本可靠映射
- Hautahi Kingi:机构信息未能从会议 PDF 纯文本可靠映射
- Jamie Towler:机构信息未能从会议 PDF 纯文本可靠映射
- Caroline Rainsford:机构信息未能从会议 PDF 纯文本可靠映射
- Ngahiwi Apanui-Barr:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本案例输入为新西兰驾驶导航场景下的英语与毛利语混排文本,输出为带新西兰英语口音且能正确读出毛利语地名的文本到语音语音,难点在于长音符号缺失与变体拼写、英毛混写与文化归属冲突交织。方法链分三步:先以谅解备忘录重建信任并锁定键盘长音符号与新西兰语音两个目标,其输出的共识目标进入参与框架,该框架以关怀与共识规范平衡双方关系与期望。接着以知识产权协议固化对发音词典与评测数据的集体监护权,其确权的词典与数据进入最后的语言工程与评测,完成后者重写录音脚本、扩充鲁棒发音词典并采用混合评测。与以数据为中心的低资源语音合成不同,该工作把语言视为珍宝并将集体监护写入流程,从机制上约束匿名化与标准化惯习。原文未提供可核对的关键定量结果。结论仅适用于有明确原住民治理主体的 revitalisation 场景,未验证向其他语言与大规模部署的外推。该结论的适用边界受限于上述合作场景,其向其他语言与大规模部署的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1309. 普通话卷舌擦音不只一种舌形:五位发音人的超声轮廓与无监督聚类初探
标签:#无监督学习 #语音学与音系 #语音 #语音属性识别
评分:5.1/10 | 创新 1.1/2 | 技术严谨 0.9/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#无监督学习
👥 作者与机构
- Zixi Jing:机构信息未能从会议 PDF 纯文本可靠映射
- C. T. Justine Hui:机构信息未能从会议 PDF 纯文本可靠映射
- Karen Huang:机构信息未能从会议 PDF 纯文本可靠映射
- C. I. Watson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
标准普通话卷舌擦音研究的输入是载体句中齿龈与卷舌最小对立音节的超声舌面影像,输出是可复现的舌形策略标签与说话人策略偏好分组,难点在于卷舌实现非典型且存在跨地域与个体内变异。该工作先在辅音段内挑选最大收缩单帧并做质心对齐以抑制探头偏移,得到统一坐标系下每token的42点舌轮廓。再构造全局范围与曲率及分段斜率等多维形状描述子并做标准化Ward.D2层次聚类,输出6个细簇并经离群值剔除形成代表性平均轮廓。最后将6个细簇合并为圆顶、驼峰与凹陷3个超策略,并在中心对数比变换后做说话人组合聚类以比较个体分布。与Luo的驼峰与成束二分法相比,该机制差异在于完全由数据驱动发现凹陷类并用圆顶替代成束,从而容纳更宽背景发音人的舌体形态。在5名女性普通话发音人读句语料下,说话人二分组的平均轮廓系数指标为0.626,高于6个细簇的平均轮廓系数指标0.134。结论仅适用于小规模女性普通话读句语料的舌体可见段形态,尚未验证与声学合并格局或地域分布的对应关系。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1310. 舌背抬得更多、喉却放得更低:美英语/k/与/g/的舌喉协同
英文题目:The Role of Laryngeal Position in the Articulation of American English Velar Stop Consonants
标签:#统计分析 #发声与构音 #语音学与音系 #语音 #语音属性识别
评分:5.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Daejin Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为美国英语词首清浊软腭塞音/k/与/ɡ/在/i u ɑ/元音前的同步超声矢状面视频与音频,输出为舌背与舌骨运动学差异及其与后接元音基频峰值的关联判定,难点在于软腭接触遮挡真实接触量且喉位无法直接观测。首先用DeepLabCut在Articulate Assistant Advanced中逐帧追踪舌面样条T0-T10与舌骨与下颌阴影并做基于舌背-舌骨向量的旋转与等比归一化,其输出的舌骨到T4欧氏距离进入声学与发音地标标注,得到闭塞时长与嗓音起始时间与元音时长与基频峰值及起始点与目标点与偏移点与峰值速度后再进入混合模型检验。与既往只比舌轮廓高度的工作不同,该链条把舌骨作为舌外肌起点来度量舌扩张,并同步检验舌拉假说与气动嗓音约束两种对立机制。原文未提供可核对的关键定量结果。该结论仅适用于无预浊音的美国英语朗读变体与载体句中 /ə/ 后的词首塞音,未验证自发语速与跨语言外推。其适用边界受限于朗读载体句语料,尚未验证自发语速与跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1311. 在过拟合与欠拟合之间架桥:用类原型扩散重塑语音情感表示
标签:#扩散模型 #鲁棒性 #跨语言 #语音 #语音情感识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音情感识别 | 主方法:#扩散模型
👥 作者与机构
- Shi-wook Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从语音波形映射到离散情绪标签,难点在于情绪线索微弱且与说话人、信道和语言内容纠缠,小规模语料极易诱发过拟合。该方法先从同一骨干不同训练阶段抽取配对表征并以类内均值构建类别原型,再用共享条件去噪器学习域内样本与原型双向随机映射。接着以配对对齐与循环一致约束稳定几何变换,最后用共享分类器与对数几率对Kullback-Leibler(KL)正则保持判别结构。与直接跨域翻译或强制域不变不同,该设计以原型为中介做类中心化重塑,旨在保留决策边界同时平滑过特化方向。在英语训练、日语测试的跨语言设置下,异质桥接后模型的准确率WAR为51.74%,高于桥接前基线的准确率WAR 45.32%。结论仅在英语与日语的4类情绪语料间验证,未证明对噪声、说话人或大规模自然分布的有效性。跨噪声与大规模自然分布的外推尚未验证,适用边界受限于上述双语实验。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1312. 通用模型先标、专家再改:SpeechBench 把多步语音预标注装进一个本地可部署工具
英文题目:SpeechBench: A Unified Speech Annotation and Analysis Tool
标签:#软件工具 #数据标注 #隐私保护 #语音 #语音识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#数据标注
👥 作者与机构
- Zheng Nan:机构信息未能从会议 PDF 纯文本可靠映射
- Tharmakulasingam Sirojan:机构信息未能从会议 PDF 纯文本可靠映射
- Mostafa Shahin:机构信息未能从会议 PDF 纯文本可靠映射
- Tünde Szalay:机构信息未能从会议 PDF 纯文本可靠映射
- Vidhyasaharan Sethu:机构信息未能从会议 PDF 纯文本可靠映射
- Beena Ahmed:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向领域专用语音数据标注难题,输入为原始长音频,期望输出为时间对齐的多层级标注,难点在于语音活动检测(Voice Activity Detection,VAD)、说话人分离标注(Speaker Diarization)、语音识别(Automatic Speech Recognition,ASR)与强制对齐(Forced Alignment)等步骤相互依赖,且儿童语音等敏感数据难以传至公网。方法链由三段构成:用户与项目管理负责鉴权与数据集组织并调度音频文件进入标注流程,其输出的待标注音频进入可视化预标注流水线定义阶段,通过拖拽组合后端模型模块生成分层预标注,最后在标注分析工作台完成人工修正与声学验证。相对 Praat 偏单文件专家分析和 Label Studio 偏任务分发而缺乏模型链编排的现状,该工具以流水线级编排加标注层直接映射为机制差异,降低了非技术用户的使用门槛。原文未提供可核对的关键定量结果。结论目前仅适用于演示环境下的会话语音展示流程,向儿童语音、病理语音及大规模多项目协作的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/HumanSignal/label-studio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1313. 可懂度模型究竟听到了什么:用 eGeMAPS 逐层打开 Wav2Vec 2.0 的声学依据
标签:#统计分析 #可解释性 #语音 #语音可懂度评估 #病理语音评估
评分:5.1/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Tuan Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Corinne Fredouille:机构信息未能从会议 PDF 纯文本可靠映射
- Alain Ghio:机构信息未能从会议 PDF 纯文本可靠映射
- Muriel Lalain:机构信息未能从会议 PDF 纯文本可靠映射
- Virginie Woisard:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
病理语音评估需由朗读语音预测专家可懂度得分,难点在于口腔与口咽癌术后构音和韵律损伤异质性强而数据稀缺,临床又要求决策可解释。本文先以经语音识别中间微调的自监督语音编码器逐层抽取帧级表征,再以扩展日内瓦极简声学参数集低层描述子为可解释参照对齐时间粒度,最后用投影加权典型相关分析分别计算单特征逐层相关与末层分组均值相关。与直接报告黑盒分数的已有评估相比,该链条把深层表征翻译回韵律、频谱与音质三组临床概念并给出排序。在C2SI语料可懂度任务评测下,末层频谱组的PWCCA相关指标为0.77,高于音质组的PWCCA相关指标0.65,而首个梅尔倒谱系数在各层均最稳定。该结论仅适用于无喉部受累的口腔与口咽癌可懂度任务,未在其他病种、语言及其他自监督架构上验证,高相关特征可作可解释替代仍是假设。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1314. 缩短放在词中帮忙、放在词尾添乱:普通话听者如何用音节缩短切分语流
英文题目:Positioning Effect of Syllable Shortening on Speech Segmentation: Evidence from Mandarin Listeners
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Shu-Chen Ou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理连续语音无停顿时如何切分词汇的言语分割问题,输入为三音节无意义音节连续流,输出为对词与跨界局部词的辨别,难点在于过渡概率与韵律线索常常冲突。方法链分为三步:先由台湾普通话男性发音人孤立录制音节并归一化时长与基频以消除干扰,再在学习流中按词首缩短、词中缩短与词末缩短三种位置压缩目标音节至一半时长,最后在中性测试音下用二选一迫选检验切分。与以往强调末元音拉长或词首辅音增强标示边界不同,本文检验词中缩短作为内部结构线索的反向机制,具有汉语经验基础。在二选一迫选测试条件下,MS条件的准确率为65.28%,高于TP-only基线条件的准确率55.56%。同组比较还显示词末缩短损害切分而词首缩短无显著作用,说明缩短位置决定其被解释为内部还是边界信号。该结论仅适用于普通话母语者对受控人工语言的短时学习,尚未验证与其他弱化线索叠加或跨语言推广。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1315. 陈述句为何上扬:威尼托方言中宽焦点升调的分布与实现
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Elinor Payne:机构信息未能从会议 PDF 纯文本可靠映射
- Angelo Dian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为半自发会话中完整语调短语的宽焦点陈述句,输出为核调轮廓类别与音系解释,难点在于区分无标记升调与延续升调,并处理词尾重音导致的核音高重音与边界调拥挤。前两步先由母语者依据上下文筛选宽焦点完整语调短语并排除感叹与信息结构不明样本,其输出进入按核词重音位置划分的 oxytonic、paroxytonic、proparoxytonic分组与听辨加f0目检三分类。后两步将升调与升降调合并为RISE(-FALL)并定义从核前音节起点至话语末尾的感兴趣区,再对f0做按说话人半音归一化与广义加性混合模型比较以检验整体音高与曲线形状差异。相对意大利语式H+L L%降调预期,该研究提出Venetan存在以核音节低谷L加后核H为核心的竞争性升调变体,其后核峰位置随有无后核音节材料而实现为升调或升降调。在半自发会话语料条件下,本研究宽焦点陈述句升调变体占比指标为47%,低于文献中朗读语料年轻人占比指标50%。结论的适用边界限于Gambellara老年单方言人群,升调与升降调的截断关系及核重音是L还是L+H仍尚未验证,需结合疑问句与窄焦点系统检验。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1316. 深层收缩不是丢失:Wav2Vec 2.0 方言几何的三段轨迹
英文题目:Probing the Layer-wise Geometry of Chinese Dialect Representations in Wav2Vec 2.0
标签:#统计分析 #可解释性 #语音学与音系 #语音 #语言识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语言识别 | 主方法:#统计分析
👥 作者与机构
- Zhen Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Jiahong Yuan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为5种汉语方言自然语音与微软Azure合成的标准普通话锚点语音,输出是对Wav2Vec 2.0 XLSR-53各层方言几何结构的三阶段划分与选层建议,难点在于剥离语速与文本差异后量化音系变异的层级演化。方法链分三步:先经短时能量语音活动检测与16 kHz重采样清洗音频并冻结模型抽取24层隐状态,其输出的帧级特征序列直接进入下一步距离计算。接着用动态时间规整度量各方言序列到锚点的声学流形距离并按序列长度和归一化,其输出的距离矩阵与话语均值池化质心进入拓扑分析。随后对质心求欧氏距离求和、多维缩放投影与凝聚层次聚类以揭示拓扑重组。与以往把预训练模型当黑盒取顶层的做法不同,该工作把深层收缩解释为抑制细粒度变体并凸显宏观谱系的隐式特征过滤器。在MagicHub五方言语料任务下,第24层MDS投影的距离指标为约0.4,低于第1层MDS投影的距离指标约8。结论仅适用于5方言小样本与冻结XLSR-53的无监督几何观察,未验证说话人、信道、文本不平衡下的外推性与分类增益。该三阶段结论的适用边界受限于小样本无监督几何观察,尚未验证跨说话人与信道的外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1317. 对齐与分工打架时:BELLA 用双层优化把桥接和专家选择分开管
英文题目:BELLA: Efficient Bilevel Learning with LoRA for Multilingual ASR
标签:#LoRA #混合专家模型 #大语言模型 #多语言 #语音识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#LoRA
👥 作者与机构
- A F M Saif:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaodong Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Brian Kingsbury:机构信息未能从会议 PDF 纯文本可靠映射
- Tianyi Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多语言自动语音识别(Multilingual ASR)需将多语言语音波形转写为对应文本,难点在于高资源语言主导共享解码器并干扰低资源语言的声学与语言建模。该框架先用预训练语音编码器抽取声学特征并经可训练桥接网络映射为大语言模型(Large Language Model, LLM)可读的前缀嵌入,再由轻量路由器依据桥接输出与语言标识选择混合专家低秩适配器(Mixture-of-Experts LoRA, MoE-LoRA)参与解码,最后以双层优化交替更新对齐与预测两组参数并通过门控梯度保持耦合。与桥接加单共享适配器或固定语言适配器相比,其关键差异在于把对齐归为下层、把路由与专家特化归为上层,使路由依赖对齐质量而专家反馈又修正桥接。在CoVoST 2五语言评测中搭配Whisper-Large时BELLA在葡萄牙语上以9.7%词错率(Word Error Rate, WER)优于桥接基线10.2%,但在多数语言上仍弱于固定语言适配器基线。该结论仅在英语、西班牙语、俄语、葡萄牙语、瑞典语五种语言与短语音转写范围内验证,未检验大规模语言扩展、域偏移与零样本外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1318. 鼻腔通不通,元音会知道:用 A1-P0 与 A1-P1 追踪上气道手术前后的鼻化
英文题目:Vowel Nasalization in Upper Airway Diseases: An Analysis Using the CUCO Database
标签:#统计分析 #语音学与音系 #语音 #病理语音评估
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Yilan Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Qi Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为上气道手术患者与健康对照的连续朗读语音,输出为元音鼻化程度与病种及手术时间点的关联判断,难点在于传统基频与微扰指标对鼻腔通气变化不敏感。方法链分3步:先基于CUCO数据库的TDU子集选取4组共107名西班牙语被试在术前、术后2周和3个月的固定朗读;再用Montreal Forced Aligner(蒙特利尔强制对齐器,MFA)定位与鼻辅音同音节的/e/、/u/、/o/并以Styler脚本提取鼻化指标\(A1\-P0\)与\(A1\-P1\);最后做组间单因素方差分析与组内配对t检验以检验病种与时间效应。与泛用声学特征相比,该机制直接比较第一共振峰幅度与鼻耦合附加峰能量,理论上更贴近鼻腔通畅度与鼻口耦合变化。在CUCO数据库TDU子集术前横断比较条件下,鼻中隔成形组/u/元音的\(A1\-P0\)指标为-8.81 dB,低于内镜鼻窦手术组的\(A1\-P0\)指标-5.31 dB。结论仅适用于卡斯蒂利亚西班牙语有限鼻化语境,未验证跨语言与自发语外推,且长期手术效应基本为阴性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/stylerw/styler_praat_ — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1319. 焦点处能抬高、焦点后压不下去:彝—汉语双语者重音实现的完全分离
标签:#统计分析 #韵律 #跨语言 #语音 #语音属性识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Ziyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Chenyu Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以三词同调普通话句朗读为输入、以焦点词与焦点后词的韵律声学实现为输出,难点在于检验焦点内扩张与焦点后压缩能否在缺少后者的母语背景下分离习得。研究先用特殊疑问句诱发首焦、中焦、尾焦并用一般疑问句诱发中性基线以界定焦点位置。再提取词级基频半音、强度与时长并做焦点减中性得到增量以控制个体基线,然后用线性混合效应模型检验组别乘焦点条件乘词位置交互及彝语组内语言经验预测。相对已有韩语、日语、闽南语部分迁移研究,本文以实验证实完全缺失焦点后压缩的凉山彝语群体检验极端抑制假设,意义在于验证两模块是否功能独立。在三词同调句焦点语料条件下,北京组后焦点位置的ΔF0指标为-2.34半音,低于彝语组同一位置ΔF0指标的0.19半音。结论适用边界为高度控制的同调三词句朗读,自发语篇与感知可懂度外推尚未验证且时长存在语速受限混淆。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1320. 尾巴丢了调子还在:开慧话入声舒化晚期的线索搬家与性别差
英文题目:Gender differences in the phonetic realization of the checked tone in Kaihui Xiang
标签:#统计分析 #语音学与音系 #社会语音学 #语音 #语音属性识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Yi Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Aini Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为开慧湘语单音节载体句朗读录音,输出是对入声调是否去入声化的声学判定,难点在于塞尾消失后须从基频、时长与嗓音质量中分离范畴对立与实现变异。方法链分三步:先经语图目检判断塞尾存留并用VoiceSauce提取多点声学参数,再按说话人做对数与z分数归一化以消除个体量级差异,随后用混合模型分离调类与性别的主效应及非线性交互。相对既有描写只记调值与塞尾有无,该文把多维线索的空间再分布作为判据,提出调类已音位化而发声线索左移的晚期模型。样本覆盖十六名中老年发音人的两千七百余有效 token。在单载体句朗读语料下,入声调类型效应的时长指标为-0.45,低于性别主效应的时长指标-0.00。结论仅适用于中老年发音人单载体句朗读的晚期过渡态,未验证多韵律位置稳定性与代际方向。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1321. 在手机上同时跑三个十亿级模型:Argmax Pro 如何兼顾实时转写、说话人与自定义词表
标签:#模型融合 #端侧运行 #流式处理 #语音识别 #说话人分离标注
评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#模型融合
👥 作者与机构
- Dylan Angus:机构信息未能从会议 PDF 纯文本可靠映射
- Chen Cen:机构信息未能从会议 PDF 纯文本可靠映射
- Berkin Durmus:机构信息未能从会议 PDF 纯文本可靠映射
- Arda Ibis:机构信息未能从会议 PDF 纯文本可靠映射
- Brian Keene:机构信息未能从会议 PDF 纯文本可靠映射
- Andrey Leonov:机构信息未能从会议 PDF 纯文本可靠映射
- Blaise Munyampirwa:机构信息未能从会议 PDF 纯文本可靠映射
- Zach Nagengast:机构信息未能从会议 PDF 纯文本可靠映射
- Arda Okan:机构信息未能从会议 PDF 纯文本可靠映射
- Atila Orhon:机构信息未能从会议 PDF 纯文本可靠映射
- Eduardo Pacheco:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该系统处理移动端实时麦克风流式音频,输出带说话人标签的文字流并支持用户定制词表,难点在于离线大模型直接分块流式化会损失精度,定制长尾词与多人嘈杂场景在端侧难以兼顾低延迟与功耗。流式推理模块先以中间结果可修正机制逼近离线精度,上下文偏置模块再用独立连接主义时间分类声学模型做关键词增强,说话人分离标注模块最后用合成数据微调版本附加说话人身份,三者并行运行于移动端神经加速单元。与云端方案相比,其机制差异在于全部推理保留在本地并以神经加速单元保障全天电池与热稳定。在定制词表任务设置下,Argmax Pro的词表规模指标为3000词,高于云端平台的词表规模指标不到500词。结论仅适用于作者声称的iOS与安卓消费级移动设备场景,在强噪声、重叠语音与长时高温运行下的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/ggml-org/whisper.cpp — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1322. 多人嘈杂声里练元音辨别:人类能进步,多语模型里谁更像人类
标签:#心理声学实验 #模型比较 #言语感知 #语音属性识别
评分:5.0/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Wenwei Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Alif Silpachai:机构信息未能从会议 PDF 纯文本可靠映射
- Catia Cucchiarini:机构信息未能从会议 PDF 纯文本可靠映射
- Helmer Strik:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为安静与语音形噪声下美国英语单音节词音频,输出为/E/-/æ/与/eI/-/aI/两组元音对的二选一词选择,难点在于荷兰母语者对非母语元音对比在噪声下高度混淆,且最优多说话者babble人数难以用人因实验穷举。方法链分三步:先用荷兰听者完成前测-训练-后测的高变异语音训练,训练期叠加2人与6人babble且仅训练期给正误反馈,其输出的准确率变化作为人类基线进入下一步对比;再将相同刺激送入Wav2Vec2.0、Whisper-large-v3与Qwen2.5-Omni-7B,以强制对齐置信度、编辑距离选词或角色提示二选一模拟相同行为;最后新增安静与语音形噪声微调做匹配与失配对照,以检验跨噪声迁移。与仅在英语上预训练的Wav2Vec2.0相比,多语言大规模预训练被作者用来解释更鲁棒的声学语音表征,使微调主要强化通用声学生音知识而非特定噪声适配。在SSN测试集下,Qwen2.5-Omni-7B的准确率为75.00%,高于Wav2Vec2.0的准确率62.50%。结论仅适用于2种元音对、2人与6人babble及100试次短时在线训练,尚未验证更多说话人数、长训练与不同熟练度外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1323. 同性别更难分,同机制未必同记忆:7-12 岁儿童说话人辨别与识别的三问
标签:#心理声学实验 #语音 #说话人识别 #说话人验证
评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#说话人识别 | 主方法:#心理声学实验
👥 作者与机构
- Rebecca Holt:机构信息未能从会议 PDF 纯文本可靠映射
- Parisa McGirr:机构信息未能从会议 PDF 纯文本可靠映射
- Chi Yhun Lo:机构信息未能从会议 PDF 纯文本可靠映射
- Anita Szakay:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理7-12岁典型发育儿童如何从连续语句中提取说话人身份线索,输入为不同说话人朗读的句子音频,输出为同异判断与身份映射,难点在于同性别说话人声学重叠大且识别比辨别更依赖稳定表征与记忆。方法链分四步:先录制16名澳大利亚英语成年说话人语句并做强度归一化与可混淆度筛选以控制刺激难度,其次用AX范式测说话人辨别并计算敏感度,其再用改良ABX范式测说话人识别,最后用CTOPP-2的删除与非词复述量化语音意识与语音工作记忆并做混合效应建模。辨别输出的试次准确率与识别试次直接采用相同说话人配对以支撑相关分析,语音得分再作为预测因子进入回归模型。与既往训练加延迟测试的识别范式相比,该ABX将学习压缩到试次内,先呈现两位说话人自我介绍再识别目标句,降低了儿童记忆负荷与任务时长。原文未提供可核对的关键定量结果。结论仅适用于典型发育英语儿童在线家庭环境下的短时识别,未验证实验室声学控制、纵向发展与临床人群外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1324. 在时域里学增益:WaveNorm 如何同时做响度归一与降噪
标签:#CNN #端侧运行 #实时处理 #语音 #语音增强
评分:5.0/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音增强 | 主方法:#CNN
👥 作者与机构
- Deepika Ijjada:机构信息未能从会议 PDF 纯文本可靠映射
- Charan Kumar Reddy B:机构信息未能从会议 PDF 纯文本可靠映射
- Ashwini Hanaganti:机构信息未能从会议 PDF 纯文本可靠映射
- Priyanka Devrao Jadhav:机构信息未能从会议 PDF 纯文本可靠映射
- Varsha Uppalanchi:机构信息未能从会议 PDF 纯文本可靠映射
- Nivedita Chennupati:机构信息未能从会议 PDF 纯文本可靠映射
- Karunakar Reddy Pucchakayala:机构信息未能从会议 PDF 纯文本可靠映射
- Balaji Padmanaban:机构信息未能从会议 PDF 纯文本可靠映射
- Harish Rajamani:机构信息未能从会议 PDF 纯文本可靠映射
- Naveen Ambati:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为说话人距离、房间声学与设备特性导致大幅波动的原始语音波形,输出为响度归一且抑制背景噪声的波形,难点是在因果低延迟下区分语音与噪声能量,避免延迟适应、抽吸、削波与噪声放大。先将20 ms帧长、10 ms帧移的48 kHz波形输入编码器,经因果分组卷积捕捉短时幅度与包络变化,输出紧凑隐表示刻画快瞬态与慢包络。再将该隐表示输入32维门控循环单元瓶颈维持跨帧上下文以平滑增益轨迹,经32单元全连接层精炼后输出条件良好的特征表示。最后将精炼特征输入镜像转置卷积解码器渐进恢复时间分辨率并隐式施加增益校正,直接重建校正波形,并以时域均方误差加多分辨率谱损失联合训练。与依赖包络跟踪与固定启动释放时间的规则方法不同,该方案不显式估计增益因子,而是端到端学习内容相关的电平不变映射,实现稳定响应调整。在VoiceBank加DEMAND噪声衰减与TIMIT干净语音放大混合场景任务评测条件下,WaveNorm衰减输出的响度指标为-26 LUFS,高于放大输出的响度指标-28 LUFS。该结论在受控语料与有限响度区间内受限,跨设备真实远场外推尚未验证,其计算量为49 M乘加运算与55 KB内存,感受野约0.56 ms延迟面向边缘部署。
🔗 开源资源
- 第三方资源:https://github.com/CARNIVAL-IITP/Automatic — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1325. 看得见又听得见的表示比较:在同一界面里切换编码器、距离与对齐
英文题目:Speech Playground: An Interactive Tool for Speech Analysis and Comparison
标签:#开源工具 #信号处理 #模型比较 #语音 #音频交互
评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.2/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#音频交互 | 主方法:#信号处理
👥 作者与机构
- Stephen McIntosh:机构信息未能从会议 PDF 纯文本可靠映射
- Daisuke Saito:机构信息未能从会议 PDF 纯文本可靠映射
- Nobuaki Minematsu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对Praat等传统工具难以接入深度学习时代的自监督表示与构音特征,且双话语对比依赖临时编码加可视化脚本的痛点,本文提出交互式语音可视化与比较工具语音游乐场。先由前端采集层以上传波形、转写与TextGrid为输入,负责曲目管理与本地持久化,输出已选音轨并送入后端编码。再由后端语音处理库以已选音轨波形为输入,负责统一映射为连续帧级、离散单元或变长分段表示并可进一步离散化或分组,输出可比表示并作为比较与展示的共同基础。最后由交互展示与比较层以该可比表示为输入,负责单话语叠加波形与区间层缩放试听与双话语计算相似矩阵并执行全局或半全局对齐生成插入、删除与替换差异,输出可视听差异解释并联动播放对应区间。与现有工具的关键差异在于同一话语对上可即时切换编码器、离散化设置、距离度量与对齐模式,并联动试听对应区间。原文未提供可核对的关键定量结果。原文未提供任何基准数据集、基线、指标或用户研究数值,结论仅能视为功能存在性说明,尚未验证在大规模语料、实时课堂反馈或表示评估中的可靠性、效率与有效性。原文未披露训练、推理与部署成本。
🔗 开源资源
- 第三方资源:https://github.com/stephenmac7/mfa-service — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1326. 从第一视角看婴儿:用轻量头戴相机加本地标注破解自然学习环境难题
英文题目:The TinyExplorer Ecosystem: Open tools for studying infants’ auditory and visual experiences
标签:#开源工具 #评测协议 #语言习得 #关键词检测
评分:5.0/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#关键词检测 | 主方法:#评测协议
👥 作者与机构
- Cátia M Oliveira:机构信息未能从会议 PDF 纯文本可靠映射
- Teodor Y. Nikolov:机构信息未能从会议 PDF 纯文本可靠映射
- Tamas Foldes:机构信息未能从会议 PDF 纯文本可靠映射
- Charlotte Bocchetta:机构信息未能从会议 PDF 纯文本可靠映射
- Hana D’Souza:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为婴幼儿日常第一视角头戴视频与伴随音频,输出为面孔可用性、手部活动与命名事件等时间对齐的结构化标注,难点在于场景动态嘈杂、被试年幼敏感且人工标注极耗时。方法链由三步衔接:首先TinyExplorer Gear采集高垂直视野的第一视角视频与伴随音频,为后续分析提供原始音视频数据。然后基准筛选环节分别优选面孔检测、手部检测与关键词发现模型,其输出的优选模型与语音管线直接固化为下一步的标注组件。最后TinyExplorer Detection App在研究者本地机器离线集成这些模型,将原始音视频转为可复用的面孔、手部与命名事件标注流。与仅做长时音频记录或云端处理方案相比,该生态以开放硬件加本地推理实现软硬件协同与隐私合规。原文未提供可核对的关键定量结果。结论适用边界受限于英语成人命名词与小规模玩耍场景,尚未验证跨语言、长时家庭记录与手物交互泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://osf.io/95wvn/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1327. 说话人身份不是一块整板:共享声音核心与性别年龄口音各自的外延
英文题目:Is Speaker Identity a Unitary Construct? Neural Evidence for Distinct Trait Processing
标签:#人类参与评测 #言语感知 #脑信号 #语音 #语音属性识别
评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#人类参与评测
👥 作者与机构
- Yike Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Kaile Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为合成伪英语词与纯音,任务为组块式显式二选一判断说话人性别、年龄与口音,输出为准确率、反应时与全脑血氧信号,难点在于剥离词汇语义后分离多维身份线索的共享与特异表征。方法链第一步合成伪词控制语言干扰并采用组块设计采集两轮功能像,其输出进入第二步经DeepPrep标准化预处理与逐被试表面单变量广义线性模型拟合,得到各特质减纯音基线对比图。第三步对对比图做群组置换检验并经合取定义共享语音核心,再在核心内比较激活强度,其输出直接支撑扩展区分离判断。相对将说话人身份视为单一整体的颞叶语音区模型,该工作提出核心加扩展模型,主张双侧颞上回、颞上沟和Heschl回负责通用声音编码,左侧感觉运动区支持年龄、双侧额叶支持口音。行为上口音准确率86.76%显著低于性别97.70%与年龄95.40%,反应时口音1087.33 ms显著长于性别853.58 ms与年龄917.79 ms;三条件均激活双侧颞上皮层,合取得到双侧共享核心,核心内口音显著强于性别与年龄,年龄与性别无差异。在性别、年龄与口音显式判断任务下,口音条件的准确率为86.76%,低于性别条件的准确率97.70%。结论仅适用于34名普通话母语右利手年轻成人对合成英语伪词的主动判断任务,未验证自然连续语音、母语口音、被动聆听与跨语言外推。原文未披露训练、推理或部署成本,未声称语音识别SOTA。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1328. 看眼睛还是看嘴:普通话反语表扬与反语指责的不对称视觉加工
英文题目:Eye and Mouth Cues in Audiovisual Perception of Mandarin Irony: Evidence from Eye-Tracking
标签:#心理声学实验 #言语感知 #音视频 #语音 #音视频理解
评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#音视频理解 | 主方法:#心理声学实验
👥 作者与机构
- Shifeng Xia:机构信息未能从会议 PDF 纯文本可靠映射
- Shanpeng Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为普通话字面褒贬与真实意图相反的反语语音和说话人面部视频,输出为听者判断说话人意图是赞扬还是批评,难点在于反语赞扬在纯听觉下极难识别且眼口线索权重未知。研究沿用Li等人话语补全任务构造的60个正负偏向场景和120句目标句,由单名23岁女性发音人分4种态度录制,再剪辑为纯视觉、视听安静与视听噪声三种条件呈现,最后用Eyelink 1000 Plus记录眼动并以线性混合效应模型分析眼口兴趣区注视占比与瞳孔大小。与以往只看行为正确率或整体面部效应的工作不同,该设计把注视分配视为线索利用指标、把瞳孔大小视为认知负荷指标,从而区分注意偏好与加工代价。在反语责备识别任务条件下,视听安静设置的准确率为82.67%,低于纯视觉设置的准确率94.70%。反语赞扬在视听安静下口部注视超过眼部且眼注视伴随更大瞳孔扩张,表明两类反语依赖不同视觉通路。结论仅适用于单发音人、实验室摆拍表情与8人babble在-10 dB信噪比条件,未验证多发音人、自发反语及强语境下的稳定性。本文不涉及模型训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1329. 听觉模型做音高距离:把缺失基频的周期感变成可微梯度
标签:#信号处理 #听觉与音乐认知 #音频生成 #音高与旋律提取
评分:4.9/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音高与旋律提取 | 主方法:#信号处理
👥 作者与机构
- David Marttila:机构信息未能从会议 PDF 纯文本可靠映射
- Joshua D. Reiss:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
DDSP合成以波形为输入、以匹配目标感知音高的纯音频率为输出,难点是频谱损失随频率振荡致梯度无信息量且缺失基频时谱峰与感知脱节。第一步JAX可微CARFAC将单通道波形映射为多通道神经活动模式,其分帧输出送入听觉稳定。第二步重叠帧经触发式时间积分求稳定听觉图像,沿行求和得耳蜗图表音色、沿列求和得音高图表周期。第三步将音高图变至频域并按耳蜗图能量指数衰减归一化,对幅度谱算一阶沃瑟斯坦距离加能量加权以梯度下降更新频率。与直接搬运谱能量的谱最优传输不同,该方法在周期表征中度量距离故对缺失基频更鲁棒。在16 kHz、8192采样点的纯音匹配任务中,触发式时间积分2048帧长(Triggered Temporal Integration,TTI-2048)在250 Hz缺失基频目标上粗粒度梯度准确率达95.8%,细粒度达76.8%,最低损失偏差为6音分,显著高于SOT-2048的54.3%、65.3%和2994音分。但在265 Hz真实女性元音a上TTI-2048粗粒度虽达93.7%,最低损失偏差仍达702音分,自相关(Autocorrelation Function,ACF)变体偏差较小但梯度方向性不足。其适用边界受限于真实元音仍偏差大且尚未验证大规模端到端训练外推,听觉反传的计算量约为常规谱损失的30倍推理开销。
🔗 开源资源
- 复现相关资源:https://github.com/google/carfac — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1330. 先对齐词汇再贴近个人:两阶段个性化让构音障碍语音识别走进手机
英文题目:BetterSpeak: An Atypical Speech to Typical Speech Platform for Dysarthric Speakers
标签:#迁移学习 #言语障碍 #低资源 #语音识别
评分:4.9/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#迁移学习
👥 作者与机构
- Seyed Reza Shahamiri:机构信息未能从会议 PDF 纯文本可靠映射
- Zihan Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Qianli Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Satwinder Singh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍语音识别的输入为高度变异的病理语音,输出为可读文本并进一步合成为典型语音,难点在于说话人之间与说话人内部变异大且病理数据极度稀缺,儿科场景还叠加发育动态变化。BetterSpeak先以大规模典型语音预训练的Conformer(卷积增强Transformer)获得语音与语言先验,再用障碍语料中健康对照者数据做词汇适配以对齐词表与发音分布,接着用入驻时采集的少量目标说话人样本微调靠近声学端的编码器实现个体适配。适配后个性化模型接入移动应用完成转写、大语言模型增强与文本到语音发声,并通过持续采集与隐私模式实现迭代更新。与通用模型在重度障碍语音上失效相比,该管线在UASpeech上平均词错率(Word Error Rate,WER)为21.5%,在TORGO上为12.7%,论文称大幅优于既有序列到序列方法。该结论目前仅限于两个公开成人障碍语料的离线转写,未验证儿童语音、纵向变化与真实噪声下的稳定性。原文未披露训练、推理或部署成本,伦理批准后的唐氏综合征与脑瘫儿童开放试验仅为未来计划。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1331. 同语掩蔽最难,熟悉阿拉伯语也未必更受伤:词监测任务下的掩蔽语与认知负荷检验
标签:#心理声学实验 #言语感知 #多语言 #语音 #关键词检测
评分:4.8/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#关键词检测 | 主方法:#心理声学实验
👥 作者与机构
- Jessica Chin:机构信息未能从会议 PDF 纯文本可靠映射
- Laurence Bruggeman:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Antoniou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理英语目标词在双人掩蔽言语中的词监测,输入为含噪16词序列加双人巴布声与视觉数字预载,输出为探测灵敏度与命中反应时,难点在于能量掩蔽与信息掩蔽交织,且语言相似性与听者熟悉度难以分离。方法链分三步衔接:先呈现1个或3个二位数操纵认知负荷并经回忆校验负荷生效,其形成的记忆保持状态带入下一步的竞争听音。接着呈现印制目标词并播放目标词序列叠加英语、瑞典语、阿拉伯语、西班牙语四种掩蔽语构成负信噪比试次,其空格键反应与数字回忆输出进入下一步统计估计。最后采用贝叶斯多层模型估计掩蔽语与负荷效应,分离被试与词条随机变异以得到条件比较。与既往句子识别研究相比,该机制差异在于用低语境高频双音节词降低句法语义支架,从而更直接检验声韵相似与掩蔽语知识的作用。单语者在西班牙语掩蔽下的词灵敏度高于英语掩蔽,证据比为20.39,后验概率为0.95,反应时在英语掩蔽下最慢,双语者总体更慢但准确率相当。结论边界是仅在-5 dB信噪比词监测范式与所选四种语言内成立,未验证句子级、更多掩蔽人数或实验室级听音条件的推广性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1332. 不测听阈、只让人亲身听难:用空间音频把诊室变成咖啡馆的咨询演示系统
英文题目:An Immersive VR System for Experiencing Spatial Speech-in-Noise Challenges in Clinical Audiology
标签:#医疗音频 #用户研究 #音频问答 #空间音频渲染
评分:4.8/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.3/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#音频问答 | 主方法:#用户研究
👥 作者与机构
- Nicky Chong-White:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Ho:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本系统面向临床咨询中纯音阈值与言语分数难以传达真实聆听困难的问题,输入为临床医生选定的虚拟环境与难度预设,输出为患者在头动锚定的空间声场中对目标对话的聆听体验与可讨论的漏听实例。方法链先由RealityKit空间音频框架将目标语音、竞争说话人与环境声固定于360°视觉场景的不同方位并随头动保持世界坐标锁定,输出空间一致的视听场景进入聆听环节。再播放20-30秒目标对话并从其他方位分层叠加掩蔽以复现注意分配压力,接着经Apple Speech语音作答或注视与捏合手势采集回答并转入医生引导的复盘咨询。与侧重测验可行性、康复或助听器微调的既有虚拟现实听觉工作不同,该文明确将自身定位为便携式非诊断性演示工具,强调在普通诊室无需声处理室、扬声器阵列或实验室条件下开展共情式沟通。与已有方法相比的关键机制差异在于用增减竞争源数量并移动其方位与距离、利用距离衰减间接改变有效信噪比,替代固定信噪比录音,使抽象掩蔽变为可感知的方位与距离变化。原文未提供可核对的关键定量结果。结论仅适用于设备佩戴前的体验式宣教,未在听损人群验证难度区分度与咨询效果,外推至评估或康复训练尚无依据,该适用边界尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1333. 听得更清楚不等于病得更准:语音增强如何扰动神经学生物标志物
标签:#语音生物标志物 #评测协议 #语音 #语音增强
评分:4.8/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.3/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音增强 | 主方法:#评测协议
👥 作者与机构
- Pramod H. Kachare:机构信息未能从会议 PDF 纯文本可靠映射
- Chetana Amancharla:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为含噪语音,输出为增强音频试听、增强前后频谱图对照、7维神经相关语音生物标志物变化与轻量风险分数,难点在于感知质量优化目标与临床特征保持目标不一致,增强器在压噪同时可能改写韵律谱细结构。方法链第一步由噪声模拟构造可控退化并输出同一含噪起点,第二步由保守谱门限、激进平滑与预训练DEMUCS三路增强并行输出各自估计语音以隔离增强哲学差异。第三步由基于Librosa的生物标志物提取计算暂停比等7维特征并归一化至区间后输入下一步,第四步由固定启发权重聚合为轻量风险分数形成漂移探针并回传可视化对照。与已有增强工作相比,关键差异是将可懂度提升与生物标志物稳定性解耦为并列评估维度,意义在于暴露telehealth预处理可能引入的解释风险。在同一含噪样本受控条件设置下,暂停比的权重指标为0.22,高于音高均值的权重指标0.08。原文未提供可核对的关键定量结果。该演示观察的适用边界受限于交互演示样本与受控条件,跨疾病泛化尚未验证。结论仅适用于演示级敏感性观察,不能外推为诊断有效性或跨疾病泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1334. 听跟不上、说不准、开口难:AURORA 把影子跟读、重叠模仿和对话练习做进同一套网页课件
标签:#教育 #用户研究 #语音 #语音对话系统
评分:4.8/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.3/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音对话系统 | 主方法:#用户研究
👥 作者与机构
- Nobuaki Minematsu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向EMI过渡中听说协同不足难题,输入为教师登记的音视频教材与学习者录音,输出为可视化反馈与对话评估报告,难点在于教师难以自建随时随地的训练闭环。第一步听力训练负责暂存与组块感知,采集跟读等录音并以DTW比较学习者跟读与参考跟读计算听力失流畅度,可视化个人与全体平均曲线定位掉队位置。第二步口语训练承接听力定位的弱点片段负责可理解度模仿,用重叠跟读即时可视化时长、音节突显度与基频轮廓间隙,并以ASR词级得分加全体平均得分区分人与机器责任。第三步交际实践承接口语打磨后的产出能力负责任务迁移,用ChatGPT高级语音模式完成猜词等五项对话,话后切换评估提示词仅基于ASR转写打分,并将录音转为音素后验图检测易混音素对。相对已有CALL工具的差异在于将听力诊断、韵律模仿与生成式任务对话纳入同一编排平台,并以高变异语音转换扩展声学多样性。原文未提供可核对的关键定量结果。用该系统开发的STEAC部署于832名学习者每日约30分钟共8周的课程,暑期前后测LD与PD显著降低但跨水平外推尚未验证。该结论仅适用于日本大学生备考学术交流场景,未验证跨母语、跨水平与长期保持效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1335. 不做声纹分离,只靠指令聚焦口吃儿童:音频大模型的语义推理还差在哪
英文题目:Reasoning Beyond Transcription: Audio Language Models on Child Stuttering Speech
标签:#评测协议 #音频大模型 #言语障碍 #语音 #音频理解
评分:4.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#音频理解 | 主方法:#评测协议
👥 作者与机构
- Chibuzor Okocha:机构信息未能从会议 PDF 纯文本可靠映射
- Christan Grant:机构信息未能从会议 PDF 纯文本可靠映射
- Zoey Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为含口吃儿童与成人交织的5分钟至10分钟原始长录音,输出要求只聚焦儿童语义并保留临床相关的口吃现象,同时完成儿童专属语义摘要与儿童语音蕴含判断,难点在于高频非流利与成人语音干扰下的指令级分离。方法链分三步推进:先以Voices-CWS语料构建单人朗读与多人访谈对照环境并由临床专家校验蕴含假设,再以Whisper与Granite加文本大模型级联建立转录媒介上界以分离声学与语义误差,接着以零样本固定提示调用多种音频语言模型直接从声学推理并用文本大模型裁判加BERTScore与分层准确率评估。相比传统先分离再转写的流水线,该工作强调绕过转录瓶颈的端到端音频语义推理,并以口吃保留与成人泄漏控制作为显式指令约束。在多人访谈蕴含任务下,Whisper加Qwen 2.5级联的准确率为0.739,高于Qwen2.5-Omni的准确率0.681。音频原生模型普遍偏向蕴含预测而矛盾类检测薄弱,提示偏差在不同难度下持续存在而非单纯推理复杂度所致。结论仅适用于英语口吃儿童访谈与朗读场景,高口吃密度与多人干扰下性能下降,且尚未验证跨语言与临床部署泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1336. 问句更像本人吗:熟悉度与语调如何改变真假语音的等价性
标签:#心理声学实验 #韵律 #言语感知 #说话人验证 #语音属性识别
评分:4.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Hanrui Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Gaoyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yixiang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yujie Xing:机构信息未能从会议 PDF 纯文本可靠映射
- Feng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Xurong Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为普通话中性短句的自然陈述与疑问语音及经转换合成的目标音色语音,输出为听者在说话人相似性感知与语调识别中的准确率、反应时与相似度评分,难点在于疑问句末基频上扬等韵律细节在合成中易被压缩且加工受说话人熟悉度调节。方法链分三步:先在隔音室录制2名熟悉者与2名陌生女性说话人的11句六词中性句,每句陈述与疑问各录两遍择优并另录高表现力语音作转换源;再用基频条件化歌声转换模型保留源语义与基频轮廓并替换为目标音色,经说话人编码器余弦相似度与语音学专家筛选语调最佳版本;随后在PsychoPy中实施2×2×2被试内双任务实验并用混合模型与Firth回归分析。相比既有可懂度、自然度与音色相似度评估,该设计把韵律保真度与长期熟悉表征的交互作为等价性判据,对语言训练语料构建具有实际意义。在说话人相似性感知任务条件下,纯自然语音对的准确率为0.917,高于自然加合成混合对的准确率0.851。结论仅适用于受控实验室条件下的成年普通话母语听者、中性短句与女性嗓音,未验证儿童、障碍人群、情感韵律与长篇语料。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1337. 被迫用可懂度换身份:三名非二元辅具使用者的声音主权需求评估
标签:#用户研究 #社会语音学 #语音 #语音合成
评分:4.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音合成 | 主方法:#用户研究
👥 作者与机构
- Maxwell Hope:机构信息未能从会议 PDF 纯文本可靠映射
- Juliana Francis:机构信息未能从会议 PDF 纯文本可靠映射
- Joakim Gustafson:机构信息未能从会议 PDF 纯文本可靠映射
- Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究面向依赖语音生成设备SGD的性别 expansiveness用户,输入为其日常沟通叙述与身份表达困境,输出为可指导下一代辅助语音设计的主题洞察,难点在于群体高度异质且长期被排除在研究之外。方法链分为三环:先通过两轮间隔一周的匿名问卷收集日常生活与身份表达叙述,再以归纳式主题分析提炼整合与表达与权力三主题,最后将用户诉求映射到当代语音合成能力并提出关系主权式设计方向。与既有工作只问声音是否像某一性别不同,本研究把可懂度与本真性冲突以及对话节奏权等社会技术约束纳入主权框架,具有更完整的权力视角。原文未提供可核对的关键定量结果。结论仅适用于所调查的英语语境小众经验,不支持向其他语言文化或大样本效应的外推,且未验证所提技术映射的实际效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1338. 把家庭练习留住、把错误讲清楚:SayCheck 如何连起游戏诱因与属性级诊断
英文题目:SayCheck: Gamified Speech Practice and Attribute-Based Speech Analysis for Children
标签:#游戏音频 #CTC #语音学与音系 #语音 #语音属性识别
评分:4.7/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.3/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音属性识别 | 主方法:#CTC
👥 作者与机构
- Mostafa Shahin:机构信息未能从会议 PDF 纯文本可靠映射
- Kirrie Ballard:机构信息未能从会议 PDF 纯文本可靠映射
- Beena Ahmed:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
儿童居家言语练习的输入是目标词录音,输出应为音素正误与错误性质解释,难点在于低龄儿童配合度低且儿童语音偏差大而传统二值评分无法指导干预。SayCheck的方法链由四步衔接构成:治疗师先按音素及其词内位置与词长配置目标词与星星规则;儿童在Say Bananas闯关收集星星时触发练习窗口完成听范例与录音提交;PhoneAid再以wav2vec2表征经可分连接时序分类映射为多维二值音系属性序列并与标准发音对齐;对齐结果进入汇总视图生成音素准确率与辅音元音正确率等报告供治疗师筛选查看。与传统误发音检测仅输出替换插入删除不同,该系统同时输出浊音性鼻音性调音部位与元音高低前后等可发音解释特征,使治疗师可定位构音维度。原文未提供可核对的关键定量结果。该结论仅适用于演示级工作流展示,尚未验证对发音进步、参与度或不同障碍类型的外推效果。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://say66.com/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1339. 说话结束后的贝塔反弹能否反映发音动作的复杂程度
标签:#波束成形 #时频分析 #脑信号 #语音 #言语神经解码
评分:4.7/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#言语神经解码 | 主方法:#波束成形
👥 作者与机构
- Keerthana Stanley:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Paul Ferrari:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为脑磁图记录的自然语句朗读信号,输出为双侧口腔运动皮层运动后贝塔反弹的强度与时程及其受构音复杂性调制情况,难点在于言语包含快速重叠的颌唇舌运动且下颌伪迹大、基线易受残留调制污染。方法链第一步采用延迟朗读范式依次分离视觉感知、无声准备与公开朗读,输出高信噪比的分段试验与感知前基线,第二步以手动标记的下颌运动偏移为零点对试验定界并截取负六秒至正两秒区间,输出对齐后的传感器数据进入下一步。第三步用合成孔径磁源成像波束形成器抑制颌动等非神经噪声并归一化到标准模板脑,输出定位的双侧口腔运动皮层源时间序列,第四步对其做Morlet小波平均时频响应并在运动后特定感兴趣区内评估贝塔功率回升。相对以肢体按压力量与变化率调制反弹的已有范式,关键差异在于以真实辅助沟通短语的音节与语音复杂性替代简单肢体动作,并以左侧语言优势半球偏侧化为观察目标。在五短语朗读任务评测设置下,短语Do you understand me的WCM得分为7,高于短语I need help的WCM得分5。结论仅适用于健康右利手中老年英语朗读的组平均定性观察,未经统计显著性与个体泛化验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1340. 把声音放在前面:用角色化语音让日语风格差异可听可见
英文题目:A Speech-First Character Interface for Stylized Japanese Dialogue Practice
标签:#教育 #SFT #语音 #语音对话系统 #文本到语音
评分:4.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.2/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音对话系统 | 主方法:#SFT
👥 作者与机构
- Zackary Rackauckas:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作针对日语学习中书面形、发音、社会语域与句末词难以通过纯文本体会的问题,输入为任意语言的键入文本或录制语音,输出为角色限定的日语文本及其表现力语音与词汇辅助。方法链首先由角色提示约束的大语言模型将对话请求转为指定人物风格的日语回复,其文本直接进入基于 Style-BERT-VITS2 JP Extra 微调的角色语音合成模块生成对应音色与韵律,最后由移动端聊天视图完成播放回放与点词查阅振假名、罗马音与英语释义。与中性导师型语言学习机器人相比,关键机制差异在于以多角色并行对比为核心交互,同一提示可分发给不同角色以同时暴露词汇、语域与嗓音差异。原文未提供可核对的关键定量结果,明确将本稿限定为演示论文,用户研究方法与学习结果归于另一篇同伴论文,此处不重复。结论仅适用于展会环境下的风格化口语接触与兴趣激发,不适用于正式语体教学或替代课堂与母语者反馈。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1341. 谁的声音可以被收录:以酷儿语音为镜的参与式数据治理框架
英文题目:Towards participatory speech dataset curation: A queer case study and conceptual framework
标签:#数据集构建 #公平性 #语音 #语音属性识别
评分:4.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#数据集构建
👥 作者与机构
- Brooklyn Sheppard:机构信息未能从会议 PDF 纯文本可靠映射
- Anaelia Ovalle:机构信息未能从会议 PDF 纯文本可靠映射
- Adina Williams:机构信息未能从会议 PDF 纯文本可靠映射
- Levent Sagun:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以酷儿群体为案例的参与式语音数据治理,输入是身份敏感且随时间情境变化的语音与标注,输出是可被研究复用的数据集与治理规范,难点在于出柜风险、说话人可识别性与众包式单向采集难以建立信任。所提方法链包含先界定服务社群与被排除者,再由社群共同制定采集话语类型与公开维护规则,接着明确协作与致谢等参与方式,最后落实个体在授权与撤回上的自主权,各阶段输出回流修正社群边界与项目目标。与传统自上而下众包相比,该机制差异在于双向知识共享与迭代式共同设计,将决策权前移至数据集创建之前而非仅事后标注。在概念框架任务设置下,本文框架的阶段指标为4,高于起始社区阶段的阶段指标1。该机制的实际意义在于把出柜风险评估与性别标注自主权嵌入采集全程,从而减少误性别与二次伤害并提升边缘化声音的代表性。该结论适用于边缘化语音社群的概念指导,尚未在真实采集流程中验证其可行性与治理成本。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1342. 模仿得像不像,用说话人向量数出来:ECAPA 增强嵌入的模仿评估
英文题目:ECAPA-TDNN-based Speaker Embedding Framework for Voice Mimicry Assessment
标签:#注意力机制 #主观评测 #语音 #说话人识别
评分:4.5/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#说话人识别 | 主方法:#注意力机制
👥 作者与机构
- Bhasi K.C.:机构信息未能从会议 PDF 纯文本可靠映射
- Rajeev Rajan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理文本无关条件下语音模仿质量评估,输入为目标名人原声与5名模仿者录音,输出为每位名人下最像目标的模仿者排序,难点在于差异细微且分散在韵律与频谱维度。方法链为:用Librosa按30毫秒帧长与10毫秒帧移提取韵律与频谱帧特征,分别送入强调通道注意力传播聚合时延神经网络(Emphasized Channel Attention Propagation and Aggregation Time Delay Neural Network,ECAPA-TDNN)生成定长嵌入(记为E向量),再经一维卷积编码加注意力加权与稀疏自编码器压缩得到增强嵌入,最后由深度神经网络分类器输出20个名人后验并做韵律谱双流得分融合排序。相对直接用X向量或D向量打分,差异在于用通道注意力、多尺度聚合与注意力统计池化增强细粒度表征,并以稀疏约束提纯后在概率层融合以规避显式对齐。在MIMICz数据集评测设置下,所提增强E向量融合方法的Top-1 hit rate准确率为75.00%,高于Bhasi et al.暹罗网络基线的Top-1 hit rate准确率72.00%。该结论适用边界受限于马拉雅拉姆语男性电影演员受控studio场景,跨语言、跨性别、噪声与实时条件尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1343. 在词级别拧动气息与嘶哑:让语用差别可听可比的交互工具
英文题目:VoiceQualityGUI: A Tool for Word-Level Voice Quality Modifications
标签:#软件工具 #SFT #语音 #语音编辑 #语音转换
评分:4.5/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音转换 | 主方法:#SFT
👥 作者与机构
- Harm Lameris:机构信息未能从会议 PDF 纯文本可靠映射
- Alan Villamil:机构信息未能从会议 PDF 纯文本可靠映射
- Nigel G. Ward:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工具输入为源话语音频、不少于30秒的目标说话人参考音频和词级时间对齐转录,输出为保留语言内容但局部嗓音品质被改写的语音及时间对齐的强度记录,难点在于嗓音品质与韵律、音色高度耦合且语用含义只在与词和韵律的特定时序配置中显现。方法链为:先用全局音高与音质均为零值的零轮次转换得到通用韵律基线,再由用户调节全局音高与音高变化以逼近原音频,最后在词级调节嘶哑、气息与鼻音化三组感知组合并反复试听迭代。与整体式语音转换相比,关键差异是将四种声门源声学参数经独立仿射编码器注入转换路径,并封装为三维感知滑杆与词边界绑定,使非专家可构造最小对立刺激。原文未提供可核对的关键定量结果。结论仅适用于英语高表现力朗读类语料的早期假设筛选,未验证跨语言、自发对话、感知一致性与鼻音化独立可控性。原文未披露训练硬件、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1344. 长短元音靠时长还是靠音色来听:黄云越南语两代人的线索权重差异
标签:#心理声学实验 #社会语音学 #言语感知 #语音 #音频分类
评分:4.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.0/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- Van Dat Ta:机构信息未能从会议 PDF 纯文本可靠映射
- Baoya Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理北部越南语中/a/与/a:/元音时长对比的感知问题,输入为时长与共振峰正交操控的合成听觉刺激,输出为长短元音二选一判断与反应时,难点在于时长线索与音质线索高度共变且难以分离权重。方法链分三步推进:先以自然产出的/ta:t 45/与/tat 45/为基音构建时长5步与第一共振峰3步及第二共振峰3步正交组合的刺激矩阵,再通过双图二选一辨别任务收集跨年龄组判断与反应时,最后用混合效应逻辑回归与线性回归分离各线索权重与一致性效应。与以往仅报告产出差异或未量化线索权重的研究不同,本研究在同一乡村社区内比较青年与老年听者,并用一致与冲突整合预测加工代价,直接检验感知作为音变起点的机制。在时长与音质正交操控的二选一辨别任务条件下,时长线索的权重指标log-odds系数为1.22,高于F1线索的权重指标log-odds系数0.97。结论仅适用于Hoang Van点的该元音在闭音节中的感知,跨说话人、跨元音、跨方言及产出端映射均尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1345. 先写菜谱再做饭:Treble SDK 如何把房间仿真变成可复用的音频场景
标签:#数据集构建 #空间音频信号 #语音 #音频生成
评分:4.4/10 | 创新 1.0/2 | 技术严谨 0.9/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#音频生成 | 主方法:#数据集构建
👥 作者与机构
- Georg Götz:机构信息未能从会议 PDF 纯文本可靠映射
- Konstantinos Gkanos:机构信息未能从会议 PDF 纯文本可靠映射
- Steinar Guðjónsson:机构信息未能从会议 PDF 纯文本可靠映射
- Daniel Gert Nielsen:机构信息未能从会议 PDF 纯文本可靠映射
- Jesper Pedersen:机构信息未能从会议 PDF 纯文本可靠映射
- Finnur Pind:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理从洁净语音、房间脉冲响应与规则元数据合成可训练可评测的多说话人带噪混响场景的问题,输入为脉冲响应集合、洁净音频集合与规则元数据,输出为混合音频、分离目标、转录与可序列化元数据,难点在于几何、材料、位置、朝向、重叠与设备特性的组合爆炸与手工脚本成本。方法链分为三步:先由会话规则与洁净音频生成带时间戳的音轨块与源组,再由场景规则与设备或听者规则将音轨映射到具体声源到脉冲响应路径与听者配置并封装为轻量配方,最后仅在需要时执行卷积与混叠以产生混合与目标。与直接分发波形或孤立脉冲响应文件相比,差异在于定义与渲染分离带来的延迟计算、可序列化与可批量随机化。原文未提供可核对的关键定量结果。适用边界限于所接入仿真引擎与脉冲响应集合的物理保真度,未验证合成数据对下游识别或分离的增益与向真实测量的外推能力。原文未披露训练、推理或部署成本,本工作无模型训练。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1346. 不爆破的尾音最难听准哪一个:台湾华语者的韩语塞尾音感知
标签:#心理声学实验 #统计分析 #语言习得 #言语感知 #语音可懂度评估
评分:4.4/10 | 创新 0.8/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#心理声学实验
👥 作者与机构
- Shu-Wei Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Jung-yueh Tu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究考察台湾华语学习者对韩语不除阻塞音韵尾/p,t,k/的感知辨认,输入为首尔话者产出的含前元音/i,u,a/的单音节刺激,输出为含/l/填充项的四选一韵尾标签,难点在于目标韵尾强制不除阻且母语仅有鼻音韵尾而缺乏口部塞音韵尾映射。方法链先由8名话者录制并经2名母语听者听写筛选出1男1女话者作为正式音源,其输出进入OpenSesame v3.3.9单次呈现并收集课程分组学习者的按键反应,其输出再进入R中按被试计算正确率并以Friedman检验加Holm校正配对比较与卡方独立性检验分析元音与水平效应。与母语者基于稳定范畴补偿协同发音的机制不同,学习者更依赖元音到闭塞过渡等细粒度声学相似性,因而呈现元音依赖的非对称混淆。在单音节四选一听辨任务条件下,目标/k/的卡方指标为30.63,高于目标/t/的卡方指标19.07,且跨元音合并统计下三塞音两两差异显著并形成/p/高于/t/高于/k/的层级。元音显著改变混淆方向,例如非前元音后/t/多误听为/k/而/i/后/k/多误听为/t/,表明训练需按元音语境组织最小对立。结论仅适用于初级至中级台湾大学生群体与少量话者单音节听辨任务,未验证高级水平、纵向发展、多话者泛化与生产迁移。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1347. 躺着说话元音会变吗:新西兰英语中身体姿势对第一、第二共振峰的小而集中的影响
英文题目:Effects of body position on vowel formants in New Zealand English
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:4.3/10 | 创新 0.7/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Qing Guan:机构信息未能从会议 PDF 纯文本可靠映射
- C. I. Watson:机构信息未能从会议 PDF 纯文本可靠映射
- C. T. Justine Hui:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为同一说话人在仰卧、坐、站三种静态身体姿势下朗读的孤立词/hVd/录音,输出为第一共振峰F1与第二共振峰F2的Bark值差异,难点在于重力方向改变引起的声道形状微调与说话人代偿交织且效应微弱易被个体差异淹没。方法链分四步:先在隔声室内固定话筒距离采集三姿势语音,再经WebMAUS对齐加人工校正并在稳定段手动定点提取共振峰,接着用ASSP追踪加EMU-R人工复核保证轨迹可靠,最后将数值转Bark后拟合含说话人随机截距的线性混合效应模型并做Tukey校正的边际均值对比。与以往假设整体元音空间平移的研究不同,该文显式建模位置与元音、年龄、性别的交互,提出效应集中于特定元音与人群的非均匀位移解释,实际意义在于合并仰卧与直立录音时需按元音与人群分别校正。在年龄×性别分组条件下,年轻女性组F2仰卧对坐对比的指标p值为<0.001,低于同组坐对站对比的指标p值0.001。结论适用边界受限于新西兰英语孤立词朗读与小样本描述,连续语流、其他方言及大样本下的稳定性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1348. 不用频谱看声调:用耳蜗模型把基频起伏冻成可比对的图像
标签:#教育 #时频分析 #语言习得 #实时处理 #音频分类
评分:4.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#音频分类 | 主方法:#时频分析
👥 作者与机构
- Yuka Maruyama:机构信息未能从会议 PDF 纯文本可靠映射
- Jason Orlosky:机构信息未能从会议 PDF 纯文本可靠映射
- Chris Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Flora Salim:机构信息未能从会议 PDF 纯文本可靠映射
- Thad Starner:机构信息未能从会议 PDF 纯文本可靠映射
- Benjamin Tag:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
普通话二语学习者需将连续语音中快速变化的基频轨迹映射到四声范畴并稳定产出对应调型,系统以学习者麦克风语音与合成参考语音为输入,输出可并排比对的音高图反馈,但美尔语谱图时间精细结构变化迅速,新手难以实时解读。方法链第一步由级联非对称谐振与快作用压缩模拟耳蜗频率分析,对输入语音分帧处理得到多通道耳蜗响应。第二步将多通道输出送入稳定听觉图像阶段按周期触发对齐,把快速变化的时间精细结构解调为随滞后缓慢变化的稳定周期表示。第三步由稳定周期表示提炼出音高随时间变化的音高图,并送入辨音与产出双原型分别承担听参考选声调与跟读对照调型。相对已有美尔语谱图经短时傅里叶变换与滤波压缩得到时频表示,上述链路以听觉周期稳定机制保留周期结构,使调型轮廓更缓慢直观,支撑无校准实时自学。原文未提供可核对的关键定量结果。该结论适用边界受限于汉语水平考试1级和2级22词演示词表与现场演示条件,尚未验证更大词表与自然课堂的外推效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1349. 尾部清塞音如何关住声音:收缩还是张开,喉头镜来对账
标签:#统计分析 #发声与构音 #语音 #语音属性识别
评分:4.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Joshua Penney:机构信息未能从会议 PDF 纯文本可靠映射
- Jae Hyun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Dijana Dragicevich:机构信息未能从会议 PDF 纯文本可靠映射
- Prue Gourley:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理澳大利亚英语尾部清塞音如何实现清化问题,输入为高前长元音/i:/后接/p,t,k/的朗读发音过程,输出为元音后半段声门开放程度与喉部收缩状态判断,难点在于电声门图只能经阻抗间接推断接触,看不见会厌喉部收缩与声门扩张的协同。方法链分为三步:先用同步音频与电声门图采集并对元音后半段求开放商轨迹,再用柔性鼻咽喉镜直接成像声门与会厌上结构,最后以平滑轨迹加逐帧目检对齐两种证据以区分声门扩张与喉部收缩。与既往仅凭电声门图推断不同,该工作以直接影像补足声门上形态信息,因而能区分真正的声门扩张和伴随会厌收缩的声门收缩。原文未提供可核对的关键定量结果。结论为鼻音前位置舌冠音前收缩、软腭音前扩张、双唇音无一致模式,短语末三部位均倾向收缩,但均为描述性趋势而无形式化统计检验。结论目前仅适用于高前元音实验室朗读语境,不能外推至自然语流与其他元音及后接环境。该结论的适用边界受限于三名男性母语者与实验室朗读条件,尚未验证自然语流与其他元音环境的泛化能力。原文未披露训练、推理或部署成本,未提供代码、模型与数据集。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1350. 自由对话里怎么给声调打分:Amadea 用合成参考音对照归一化基频轮廓
英文题目:Amadea: An AI Companion for Pitch-Aware Spoken Language Practice
标签:#教育 #信号处理 #韵律 #语音 #语音对话系统
评分:4.2/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音对话系统 | 主方法:#信号处理
👥 作者与机构
- Mrigendra Agrawal:机构信息未能从会议 PDF 纯文本可靠映射
- Ryan Tsui:机构信息未能从会议 PDF 纯文本可靠映射
- Kyaw Maung Maung Tet Toe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为学习者在课程复述或开放伴侣对话中的语音,输出为对应意图的母语级参考音频、归一化基频轮廓差异可视化与音高模式分,难点在于日语声调与汉语声调对音高敏感而自由对话缺乏预设目标文本。方法链由4步构成:浏览器采集语音后经自动语音识别转写意图,该文本进入语音合成生成参考音频,随后双路提取并归一化基频与强度包络,最后经动态时间规整对齐并计算距离得分。相对固定提示复读系统,关键差异是用识别结果动态构造参考目标,使反馈可扩展到学习者自选表达并嵌入持续对话而不打断交流。在F0估计设置下,pYIN上限的频率指标为400 Hz,高于pYIN下限的频率指标80 Hz。原文未提供可核对的关键定量结果。适用边界限于单参考轨迹对比,未处理多可接受语调、ASR错误传导与噪声下F0失效,且尚未验证与专家评价的相关性及长期习得效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1351. 床旁直接算语音:把采集、计算与显示装进一台嵌入式设备
英文题目:Demonstration of Embedded Systems for Clinical Speech Analysis
标签:#语音生物标志物 #信号处理 #端侧运行 #语音 #病理语音评估
评分:4.2/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.3/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#病理语音评估 | 主方法:#信号处理
👥 作者与机构
- Jeremiah B Joyce:机构信息未能从会议 PDF 纯文本可靠映射
- Erik Clemens:机构信息未能从会议 PDF 纯文本可靠映射
- Sanjeev Mishra:机构信息未能从会议 PDF 纯文本可靠映射
- Josh Boesche:机构信息未能从会议 PDF 纯文本可靠映射
- David Johnson:机构信息未能从会议 PDF 纯文本可靠映射
- Marie Reyes:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床床旁语音分析的输入是医患对话录音,输出是说话人划分与韵律指标可视化,难点在于深学习模型依赖专用算力而被迫离线传输,既引入延迟又带来隐私与信息技术运维负担。预处理流水线负责将长对话切分为说话人、角色与语句级片段,其输出的片段进入转写对齐模块生成词级时间戳与文本。韵律量化与仪表盘模块负责基于对齐文本计算语速与轮替指标并支持同步回放,其人工修正后的标注可回流重算指标进入床旁决策。与已有云端集中处理机制相比,关键差异在于将传感与计算与显示封装于单一端侧设备,从而省去上传环节并支持离线床旁决策。原文未提供可核对的关键定量结果,仅以定性语言声称快于音频时间的本地处理与近实时提取。结论仅适用于演示环境下的功能展示,尚未验证噪声病房中的鲁棒性与诊断有效性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1352. 不用电脑说话:用可更换凸轮片驱动六滑块声道模型
标签:#信号处理 #发声与构音 #语音 #语音合成
评分:4.1/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.3/1.5 | 清晰度 0.6/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音合成 | 主方法:#信号处理
👥 作者与机构
- Takayuki Arai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是在不用计算机与电机的条件下驱动滑动块式机械声道模型产生连续短语,输入为6通道发音块位移随归一化时间的目标轨迹,输出为模型辐射的语音波形,难点在于同时协调从唇端到声门端6个滑块的高度以实现元音与辅音的动态过渡。方法链为离线设计轨迹、凸轮轮廓物理编码、机械传动调制共振腔形:先给定凸轮位移曲线,再用可插拔板件在直线基板或旋转基轴上拼出对应轮廓,最后由基板直线滑动或基轴旋转顶升VTM-UT30-D6/D9模型底部的6个发音滑块。相对每句短语加工一整套固定凸轮的旧做法,可编程基板加标准板件允许拆装重构轮廓,同一硬件可切换短语。实验只合成英语短语I love you,对比直线凸轮与旋转凸轮,宽带频谱图显示共振峰走向大致相似,原文未报告任何可核对的定量指标、听测分数、声源与气流条件和重复性统计。原文未提供可核对的关键定量结果。结论仅对缓慢演示性短语成立,未验证长句、辅音丛、鼻腔支路、语速鲁棒性与跨短语泛化,原文未披露成本与延迟。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1353. 心音被噪声盖住时:先理解整段心跳,再修补被挖空的表示
英文题目:CLEAR: Clinical LLM Embedding and Attention-based Reconstruction
标签:#医疗音频 #生成对抗网络 #图神经网络 #生理信号 #音频分离
评分:3.5/10 | 创新 1.0/2 | 技术严谨 0.5/1.5 | 实验充分 0.4/1.5 | 清晰度 0.6/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音频分离 | 主方法:#图神经网络
👥 作者与机构
- Eashita Wazed:机构信息未能从会议 PDF 纯文本可靠映射
- Hieyong Jeong:机构信息未能从会议 PDF 纯文本可靠映射
- Choonsung Shin:机构信息未能从会议 PDF 纯文本可靠映射
- Shima Okada:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床听诊需在10 dB医院环境噪声下从含噪波形恢复含第一心音、第二心音与杂音的干净波形,难点是噪声非平稳且与心音频带重叠并掩盖微弱病理纹理。CLEAR以冻结预训练Whisper编码器提取全局声学嵌入并构图,掩码图注意力网络预测0到1有界掩码相乘去噪得到残缺嵌入。隐空间生成对抗网络再愈合流形并经轻量解码器合成16000 Hz宽带波形,以全序列自注意力利用长程周期先验、图拓扑解耦噪声、低维对抗避开高维传输与相位失配。在BUET多病种心音数据集10 dB合成噪声评测设置下,增强输出的PESQ为4.6433,高于含噪输入的PESQ 1.0304。在 BUET 多病种心音数据集 10 dB 合成噪声下,最优单样本峰值感知语音质量评估(Perceptual Evaluation of Speech Quality,PESQ)4.6433 与尺度不变信失真比(Scale-Invariant Signal-to-Distortion Ratio,SI-SDR)64.3566 dB,相对含噪输入 1.0304 与 -29.3715 dB 巨幅提升;测试集均值则为 PESQ 2.9958、对数谱距离 1.7898、背景抑制 2.6713 与总体质量 3.3865。结论仅适用于该单数据集单信噪比合成评估,未验证真实听诊器采集、多信噪比、跨设备与下游疾病分类增益,未披露训练推理成本与开源产物。其适用边界尚未验证跨设备真实采集与多信噪比外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
1354. 把签名切碎藏进声音里:DsNA 以后生成指纹的可验证尝试
标签:#信号处理 #音频安全 #语音 #音频水印
评分:2.9/10 | 创新 0.6/2 | 技术严谨 0.4/1.5 | 实验充分 0.3/1.5 | 清晰度 0.5/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音频水印 | 主方法:#信号处理
👥 作者与机构
- Vishal Gourav:机构信息未能从会议 PDF 纯文本可靠映射
- Phanindra Mankale:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向合成语音溯源,输入为用户文本提示经文本到语音生成的波形与关联元数据,输出为携带可验证签名的自包含音频,难点在于不改动底层合成架构而实现内生溯源。方法为三步后生成流水线:首先TTS服务由文本生成原始波形并配对元数据,其输出同时送入并行的两支处理。接着指纹生成器对音频与元数据做密码学哈希与签名得到紧凑签名并切为三个碎片,音频分块器将音频切为两个等长块,两者输出共同进入交织器。最后交织器将碎片与音频块交叉拼接为指纹音频,验证侧用逆向DsNA流水线拆分重构并比对签名以鉴真。与依赖外部库检索的传统音频指纹相比,差异在于将签名存于文件结构内部而非外部匹配,具有无需外部查找的实际意义。在250个TTS生成样本的评测设置下,指纹音频的平均意见分(Mean Opinion Score,MOS)为4.48,低于原始音频的平均意见分(Mean Opinion Score,MOS)4.51。作者承认仅为初始概念验证,尚未验证压缩与噪声等真实变换下的鲁棒性、抗对抗篡改能力与感知质量,需在更多数据集与条件下扩展评估。原文未披露训练、推理与部署成本,未提供代码与数据。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。